આ મહિનાના Hugging Face પેપર રેન્કિંગ્સ એક વિકસતા ક્ષેત્રને દર્શાવે છે. મુખ્ય કામ માત્ર પેરામીટરની સંખ્યા વધારવા વિશે નથી, પરંતુ મોડલ્સને જોવું, યાદ રાખવું અને જે શરૂ કર્યું છે તેને પૂર્ણ કરવા સક્ષમ બનાવવા વિશે છે. નીચેના દસ પેપર્સ રીઅલ-ટાઇમ વિડિયો, રોબોટ કોગ્નિશન, પ્રમાણિક બેન્ચમાર્કિંગ અને જનરેટર્સને શિક્ષકો તરીકે ગણવાની શાંત ક્રાંતિ વિશે વાત કરે છે.

તમે ખરેખર ઉપયોગ કરી શકો તેવો રીઅલ-ટાઇમ વિડિયો

મોટાભાગના વિડિયો મોડલ્સ હજુ પણ મોંઘા પ્રયોગશાળાના પ્રયોગો જેવા જ વર્તે છે. તેઓ ભારે હાર્ડવેર પર મિનિટો સુધી ચાલતા રહે છે અને એવા ક્લિપ્સ આપે છે જેને તમે ચાલુમાં નિયંત્રિત કરી શકતા નથી. Vidu S1 આ સમીકરણ બદલી નાખે છે. તે રીઅલ-ટાઇમ ઇન્ટરેક્શન પર ધ્યાન કેન્દ્રિત કરે છે, જે વપરાશકર્તાઓને વૉઇસ કમાન્ડ દ્વારા ડિજિટલ પાત્રોને નિર્દેશિત કરવાની મંજૂરી આપે છે, જ્યારે મોડલ TurboDiffusion નામની ટેકનિક દ્વારા સ્ટાન્ડર્ડ કન્ઝ્યુમર GPUs પર ચાલે છે.

આ હાર્ડવેર શિફ્ટ મહત્વપૂર્ણ છે. જ્યારે મોડલને હવે ટોપ-ટિયર એક્સિલરેટર્સના મોટા સેટની જરૂર પડતી નથી, ત્યારે તે માત્ર એક ડેમો રહેવાને બદલે ઇન્ફ્રાસ્ટ્રક્ચર બની જાય છે. રીઅલ-ટાઇમમાં ચેટ પર પ્રતિક્રિયા આપતા લાઈવ-સ્ટ્રીમિંગ અવતારો, અથવા ગ્રાહક સેવાના પાત્રો જે જરૂરિયાત મુજબ આઈ-કોન્ટેક્ટ કરે છે અને અવાજ બદલે છે તે વિશે વિચારો. Vidu S1 એવા વિડિયો AI તરફ નિર્દેશ કરે છે જે માત્ર એક રિસર્ચ પ્રીપ્રિન્ટ નથી, પરંતુ એક પ્રોડક્ટ તરીકે ઉપલબ્ધ છે.

નિર્દેશો સમજતા રોબોટ્સ

ફિઝિકલ AI માટે નેવિગેશન હજુ પણ એક મૂળભૂત અવરોધ છે. ABot-N1 સામાન્ય ભાષાના નિર્દેશો દ્વારા સંચાલિત રોબોટ નેવિગેશન માટે ફાઉન્ડેશન મોડલ પ્રસ્તાવિત કરીને આ સમસ્યાનો ઉકેલ લાવે છે. નાજુક, અગાઉથી મેપ કરેલા રૂટને બદલે, સિસ્ટમ તે જે જુએ છે અને સાંભળે છે તેમાં પેટર્ન ઓળખીને વિવિધ વાતાવરણમાં હલનચલન કરવાનું શીખે છે.

તેનો તાત્કાલિક ફાયદો લોજિસ્ટિક્સમાં જોવા મળે છે. “બાઇક રેક પછીના સાઇડ એન્ટ્રન્સ પર પેકેજ મૂકો” જેવા મૌખિક સૂચન આપેલ ડિલિવરી રોબોટ તે સૂચનાનું વિશ્લેષણ કરી શકે છે અને જ્યારે રેક ખસે ત્યારે અનુકૂલન સાધી શકે છે. હોમ આસિસ્ટન્ટ્સ પણ સમાન લવચીકતા મેળવે છે, જે અગાઉથી અપલોડ કરેલા ચોક્કસ ફ્લોર પ્લાન વગર એપાર્ટમેન્ટમાં ફરી શકે છે.

ગઈકાલ યાદ રાખતા રોબોટ્સ

ABot-AgentOS નેવિગેશનના કામ સાથે જોડાઈને એક અલગ સમસ્યાનો ઉકેલ લાવે છે: રોબોટ્સ સામાન્ય રીતે દરેક કમાન્ડ પછી રીસેટ થઈ જાય છે. આ સિસ્ટમ મશીનને વપરાશકર્તાઓ, વસ્તુઓ અને દૈનિક આદતો માટે લાંબા ગાળાની યાદશક્તિ ધરાવતા એક પર્સિસ્ટન્ટ એજન્ટ તરીકે ગણે છે.

વન-ટાઇમ પ્રોસેસર અને કન્ટીન્યુઅસ એજન્ટ વચ્ચેનો તફાવત એક સાધન અને સહકર્મચારી વચ્ચેના તફાવત જેવો છે. વેરહાઉસ ઓટોમેશનમાં, યાદશક્તિ ધરાવતો રોબોટ નોંધશે કે મંગળવારના શિપમેન્ટમાં હંમેશા નાજુક વસ્તુઓ હોય છે અને તે મુજબ તેની પકડ (grip) એડજસ્ટ કરશે. ઘરની સંભાળ માટે, તે યાદ રાખશે કે કોઈ ચોક્કસ રહેવાસી બપોરે ૩ વાગ્યે બ્લાઇન્ડ્સ અડધા ખુલ્લા રાખવાનું પસંદ કરે છે. આ સાતત્ય મોટા પાયે પર્સનલાઇઝેશન શક્ય બનાવે છે.

વિડિયો બેન્ચમાર્ક પરથી પડદો ઉઠાવવો

Video-Oasis એક અણધારી નિદાન આપે છે: ઘણા લોકપ્રિય વિડિયો અન્ડરસ્ટેન્ડિંગ બેન્ચમાર્ક ખામીયુક્ત છે. મોડલ્સ વારંવાર માત્ર ટેક્સ્ટ જ્ઞાનનો ઉપયોગ કરીને પ્રશ્નોના જવાબ આપે છે, વાસ્તવિક ફ્રેમ્સ જોવાની જરૂર જ નથી સમજતા. આ પેપર દર્શાવે છે કે વર્તમાન બેન્ચમાર્ક પ્રશ્નોમાંથી અડધા પ્રશ્નો કોઈપણ વિઝ્યુઅલ ઇનપુટ વગર ઉકેલી શકાય છે.

તેનો અર્થ એ છે કે સંશોધકો સાચા અવલોકનને બદલે ચતુર અનુમાનને પ્રોત્સાહન આપી રહ્યા છે. સમુદાયને એવા ઇવેલ્યુએશન પ્રોટોકોલ્સની જરૂર છે જે મોડલ્સને દરેક જવાબ પિક્સેલ-લેવલના પુરાવા પર આધારિત કરવા માટે મજબૂર કરે. અન્યથા, જ્યારે લાઇટિંગ બદલાય ત્યારે આત્મવિશ્વાસ સાથે ભ્રમ (hallucinate) પેદા કરતા સિસ્ટમ્સ બનાવવાનું જોખમ રહે છે.

લાંબા કામ પૂર્ણ કરતા કોડિંગ એજન્ટ્સ

કોડિંગ આસિસ્ટન્ટ્સ સ્નિપેટ્સ સારી રીતે લખે છે, પરંતુ સો સ્ટેપના DevOps વર્કફ્લો હજુ પણ પડકારરૂપ છે. Long-Horizon-Terminal-Bench એ ટેસ્ટ કરે છે કે એજન્ટ્સ લાંબા કાર્યો સાથે કેવી રીતે કામ કરે છે, વચ્ચે આવતી ભૂલોમાંથી કેવી રીતે બહાર આવે છે અને માનવીય મદદ વગર કેવી રીતે ફરીથી આયોજન (replan) કરે છે.

આ એવા કોઈપણ વ્યક્તિ માટે મહત્વપૂર્ણ છે જે સ્વાયત્ત સિસ્ટમ એડમિનિસ્ટ્રેશનનું સપનું જુએ છે. એવો એજન્ટ જે સર્વરને પેચ કરી શકે, ડિપેન્ડન્સીઝમાં ડાયગ્નોસ્ટિક્સ ચલાવી શકે અને જો કોઈ સ્ટેપ નિષ્ફળ જાય તો રોલબેક કરી શકે તેવા એજન્ટ કરતા ઘણો વધુ મૂલ્યવાન છે જે પરફેક્ટ Python લખે છે પરંતુ પહેલી મિસિંગ API કી પર અટકી જાય છે. આ બેન્ચમાર્ક સંશોધકોને તે પ્રકારની સહનશક્તિ માટે સ્કોરબોર્ડ આપે છે.

સસ્તું રિઇનફોર્સમેન્ટ લર્નિંગ

Direct OPD રિઇનફોર્સમેન્ટ લર્નિંગમાં ખર્ચની સમસ્યાનો ઉકેલ લાવે છે. મોટા મોડલ્સ માટે RL ઘણો ખર્ચાળ છે અને GPU ના કલાકોનો વપરાશ કરે છે. સૂચવેલ શોર્ટકટ સરળ છે: પહેલા RL સાથે એક નાનું મોડલ તાલીમ આપો, પછી તે શીખેલી પોલિસીને મોટા મોડલમાં ટ્રાન્સફર કરો.

નાના એક્સપ્લોરર્સ સસ્તામાં ભૂલો કરે છે. એકવાર વ્યૂહરચના પ્રમાણિત થઈ જાય પછી, મોટું મોડલ પૂરેપરો ખર્ચ કર્યા વિના તે પાઠો શીખી લે છે. લાર્જ લેંગ્વેજ મોડલ્સને એલાઇન કરવા અથવા એજન્ટ્સને ફાઇન-ટ્યુન કરવા માટે પ્રયાસ કરતી લિન ટીમો માટે,