ફિઝિકલ AI ની ક્ષિતિજ એક મોટા અવરોધનો સામનો કરી રહી છે: આપણી પાસે ઉચ્ચ-ચોકસાઈ ધરાવતા, વાસ્તવિક દુનિયાના તાલીમ ડેટાનો અભાવ છે. Large Language Models ઇન્ટરનેટના ટેક્સ્ટ સ્ક્રેપ કરીને વિકસ્યા છે; રોબોટિક્સ માટે તેનાથી ઘણો ખર્ચાળ અભિગમ જરૂરી છે.

રોબોટિક્સમાં ડેટાની અછતની સમસ્યા

હ્યુમનોઇડ અને વેરહાઉસ રોબોટ્સ માનવ કુશળતાની સાથે મેળ ખાવા માટે, તેમને એવા ડેટા સ્કેલની જરૂર છે જે હાલમાં ઉપલબ્ધ નથી. Encord ના રોબોટ લર્નિંગ હેડ અને OpenAI ના રોબોટ લેબના અનુભવી વિનીથ વેલમુરુગન કહે છે કે, મોટી સફળતા મેળવવા માટે YouTube ના સમગ્ર વિડિયો કોર્પસ કરતા લગભગ પાંચ ગણા મોટા ડેટા સેટની જરૂર છે.

ટેક્સ્ટ પુષ્કળ પ્રમાણમાં છે અને તેને સ્ક્રેપ કરવું મફત છે. ફિઝિકલ ડેટાનું ઉત્પાદન કરવું પડે છે. માત્ર વિડિયો દ્વારા તાલીમ આપવાથી ઘણીવાર જટિલ મેનિપ્યુલેશન માટે જરૂરી ચોકસાઈ મળતી નથી. તેથી ઉદ્યોગ મોડેલ આર્કિટેક્ચરને સુધારવાને બદલે ઉચ્ચ-ગુણવત્તાવાળા, એનોટેટેડ (annotated) ફિઝિકલ ડેટાના ઉત્પાદનની વધુ મુશ્કેલ સમસ્યા ઉકેલવા તરફ વળ્યો છે.

વિડિયોથી આગળ: મગજના તરંગો અને સ્નાયુઓના સંકેતોનો ઉપયોગ

Encord જેવા સ્ટાર્ટઅપ્સ રોબોટ્સને ઊંડો સંદર્ભ આપવા માટે નવી ડેટા મોડાલિટીઝનું પરીક્ષણ કરી રહ્યા છે. જર્મન ન્યુરોસાયન્સ સ્ટાર્ટઅપ Zander Labs સાથેના એક પાયલોટ પ્રોજેક્ટમાં, Encord ઓપરેટરોને બ્રેઈન-વેવ હેડસેટ્સથી સજ્જ કરે છે. ન્યુરલ પ્રવૃત્તિને માપીને, સંશોધકો ઈરાદો (intent), ભૂલ અને આશ્ચર્યનો અંદાજ લગાવવાની આશા રાખે છે.

Zander ના ન્યુરોસાયન્ટિસ્ટ લુકાસ ગેહર્કે કહે છે કે મગજની પ્રવૃત્તિને ટ્રેક કરવાથી મોડેલ બિલ્ડર્સને ચોક્કસ ખબર પડે છે કે ક્યારે રોબોટે કોઈ અઘરા કાર્ય માટે તેના સૌથી શક્તિશાળી કોમ્પ્યુટેશનલ મોડેલ્સનો ઉપયોગ કરવો જોઈએ.

Encord આ બાબતોનું પણ સંશોધન કરે છે:

  • Electromyography (EMG): હાથના આગળના ભાગમાં (forearm) બાંધેલા સેન્સર્સ સ્નાયુઓમાં ઇલેક્ટ્રિકલ સિગ્નલો પકડે છે, જે હાથના હલનચલનનો 3-D નકશો બનાવે છે જે હેડ-માઉન્ટેડ કેમેરા ઘણીવાર ચૂકી જાય છે.
  • Leader-Follower Rigs: જોડીમાં રહેલા રોબોટિક આર્મ્સ જ્યાં એક માનવ ઓપરેટરની નકલ કરે છે, જે પ્રવાહી રેડવું અથવા પોકર ચિપ્સ ગોઠવવા જેવા ચોક્કસ કાર્યોને કેપ્ચર કરે છે.
  • Dense Annotation: "જમણો હાથ બોલ્ટ ટાઈટ કરે છે" જેવા લેબલ્સ. વેલમુરુગનનું અનુમાન છે કે વિશિષ્ટ કાર્યોની તાલીમ માટે આ ડેન્સ એનોટેશન કાચા (raw) એગો વિડિયો કરતા 100 ગણું વધુ મૂલ્યવાન છે.

ફિઝિકલ AI ની આર્થિક વાસ્તવિકતા

ડિજિટલ-ફર્સ્ટ AI થી ફિઝિકલ AI તરફ જવું મશીન લર્નિંગના અર્થશાસ્ત્રને બદલી નાખે છે. LLM લેબ્સ વેબ પરથી ડેટા મેળવીને લગભગ શૂન્ય માર્જિનલ ખર્ચ પર મોડેલ્સ બનાવતા હતા. રોબોટ તાલીમ ડેટાનું ઉત્પાદન કરવા માટે હાર્ડવેર, માનવ ઓપરેટરો અને મહેનતભર્યા એનોટેશનની જરૂર પડે છે. Encord ઉચ્ચ-ગુણવત્તાવાળા ડેટાને તેના મૂલ્ય કરતા 20 ગણો વધુ ખર્ચ-અસરકારક બનાવવાનું લક્ષ્ય રાખે છે, છતાં તે મોટા રોબોટ ફ્લીટ્સ માટે મલ્ટી-મિલિયન ડોલરના પ્રોજેક્ટ્સમાં પરિવર્તિત થાય છે.

જે કંપનીઓ સૌપ્રથમ વિશાળ, સમૃદ્ધ એનોટેટેડ ડેટાસેટ્સ બનાવશે તે ઓટોનોમસ મેનિપ્યુલેશનમાં પ્રભુત્વ જમાવશે—ઇથરનેટ કેબલ પ્લગ કરવાથી લઈને વસ્તુઓ ઉપાડવા અને પેક કરવા સુધી. જેઓ માત્ર વિડિયો પાઇપલાઇન્સ પર નિર્ભર રહેશે તેઓ પાછળ રહી જવાનું જોખમ ઉઠાવશે કારણ કે સ્પર્ધકો માનવ શરીર અને મગજમાંથી વધુ સમૃદ્ધ સંકેતો મેળવી રહ્યા છે.

મુખ્ય મુદ્દાઓ

  • ડેટા મેન્યુફેક્ચરિંગ વિરુદ્ધ કલેક્શન: LLMs જે ઇન્ટરનેટના હાલના ડેટા સ્ક્રેપ કરે છે તેનાથી વિપરીત, ફિઝિકલ AI ને ઉચ્ચ-ચોકસાઈ ધરાવતા ડેટાસેટ્સના ખર્ચાળ, મેન્યુઅલ ઉત્પાદનની જરૂર છે.
  • ન્યુરોલોજીકલ મોડાલિટીઝ: મગજના તરંગો અને EMG ઉમેરવાથી રોબોટ્સ વિડિયો કરતા વધુ અસરકારક રીતે માનવ ઈરાદો, ભૂલ અને 3-D હાથના હલનચલનને સમજી શકે છે.
  • સ્કેલ પડકાર: રોબોટિક્સ મોડેલ્સને સમગ્ર YouTube આર્કાઇવ કરતા ઘણો મોટો ડેટાસેટ જોઈએ છે; ડેટા જનરેશન હવે પ્રાથમિક બિઝનેસ ફ્રન્ટિયર છે.

Encord એ જર્મન ન્યુરોસાયન્સ સ્ટાર્ટઅપ Zander Labs સાથે એક પાયલોટ પ્રોજેક્ટ શરૂ કર્યો છે જે ફિઝિકલ AI માટે ઉચ્ચ-ચોકસાઈ ધરાવતો તાલીમ ડેટા મેળવવા માટે ઓપરેટરોને બ્રેઈન-વેવ હેડસેટ્સ અને ફોરઆર્મ EMG સેન્સર્સથી સજ્જ કરે છે. આ ભાગીદારીનો હેતુ YouTube વિડિયોના કુલ વોલ્યુમ કરતા પાંચ ગણો મોટો ડેટાસેટ બનાવવાનો છે—એક એવો સ્કેલ જે સંશોધકો કહે છે કે રોબોટ્સને માનવ-સ્તરની કુશળતા સુધી પહોંચવા માટે જરૂરી છે અને તે રોબોટિક્સ કેવી રીતે શીખે છે તેને નવો આકાર આપી શકે છે.

રોબોટિક્સ ડેટા શા માટે અવરોધ છે

Large language models ઓપન વેબ સ્ક્રેપ કરીને વિકસ્યા હતા; કાચો માલ પુષ્કળ અને સસ્તો હતો. તેનાથી વિપરીત, ફિઝિકલ AI ને એવા ડેટાની જરૂર છે જેનું ઉત્પાદન કરવું પડે છે. દરેક પકડ (grasp), વળાંક (twist) અથવા રેડવું (pour) રેકોર્ડ કરવું જોઈએ, એનોટેટ કરવું જોઈએ અને તેને પેદા કરનારા બળો અને ઈરાદાઓ સાથે જોડવું જોઈએ. સામાન્ય વિડિયો ઘણીવાર જટિલ મેનિપ્યુલેશન માટે જરૂરી સૂક્ષ્મ સંકેતો ચૂકી જાય છે, જે આજકાલના મોડેલ્સ અને ફેક્ટરીઓ, વેરહાઉસ અને ઘરોની જરૂરિયાતો વચ્ચે અંતર ઊભું કરે છે.

Encord ના રોબોટ લર્નિંગ હેડ અને પૂર્વ OpenAI રોબોટ-લેબ અનુભવી વિનીથ વેલમુરુગન કહે છે કે જ્યાં સુધી YouTube ના વિડિયો કોર્પસ કરતા લગભગ પાંચ ગણો મોટો ડેટાસેટ અસ્તિત્વમાં નહીં આવે ત્યાં સુધી આ ક્ષેત્ર આગળ વધશે નહીં. સમસ્યા હવે મોડેલ આર્કિટેક્ચરની નથી; સમસ્યા એ છે કે ડેટાનું ઉત્પાદન (manufacture) કેવી રીતે કરવું.

મગજની તરંગો અને સ્નાયુઓના સંકેતો ઉમેરવા

Encord-Zander પાયલોટ વિઝ્યુઅલ રેકોર્ડમાં શારીરિક સંકેતો ઉમેરીને તે ખામીને પૂરી કરવાનો પ્રયાસ કરે છે. ઓપરેટરો હેડસેટ પહેરે છે જે ઇલેક્ટ્રોએન્સેફલોગ્રાફી (EEG) – મગજની વિદ્યુત પ્રવૃત્તિ – વાંચે છે, જ્યારે હાથના આગળના ભાગ (forearm) પરના EMG સેન્સર્સ સ્નાયુઓના આવેગો (impulses) કેપ્ચર કરે છે. તેનો હેતુ ઈરાદો, આશ્ચર્ય અથવા ભૂલ જેવી માનસિક સ્થિતિઓનો અંદાજ લગાવવાનો અને કાચા સ્નાયુ સંચાલનને હાથની ગતિના ત્રિ-પરિમાણીય (3D) નકશામાં રૂપાંતરિત કરવાનો છે, જે માત્ર વીડિયો દ્વારા શક્ય નથી.

Zander ના ન્યુરોસાયન્ટિસ્ટ લુકાસ ગેહર્કે સમજાવે છે કે માનવી ક્યારે મુશ્કેલ પેટા-કાર્યની અપેક્ષા રાખે છે તે જાણવાથી રોબોટ યોગ્ય સમયે તેના સૌથી શક્તિશાળી કમ્પ્યુટેશનલ મોડલ્સનો ઉપયોગ કરી શકે છે.

ન્યુરો-ડેટા ઉપરાંત, Encord કેટલાક પૂરક તકનીકોનું પરીક્ષણ કરે છે:

  • Electromyography (EMG): હાથના આગળના ભાગ પરના સેન્સર્સ સ્નાયુ સક્રિયતાનું લાઈવ રીડ-આઉટ આપે છે, જે આંગળીઓના માર્ગોનું સચોટ પુનઃનિર્માણ કરવામાં મદદ કરે છે જે હેડ-માઉન્ટેડ કેમેરાઓ ઘણીવાર ચૂકી જાય છે.
  • Leader-follower rigs: રોબોટિક હાથની એક જોડી સાથે મળીને કામ કરે છે, જેમાં એક હાથ માનવ ઓપરેટરની હિલચાલનું અનુકરણ કરે છે. આ નાજુક કાર્યો—પ્રવાહી રેડવું, ચિપ્સ ગોઠવવી—કેપ્ચર કરે છે જ્યાં મિલીમીટર સ્તરની ભૂલો પણ મહત્વની હોય છે.
  • Dense annotation: માત્ર ઉચ્ચ-સ્તરની ક્રિયાઓનું લેબલિંગ કરવાને બદલે, Velmurugan ની ટીમ "જમણો હાથ બોલ્ટ ટાઈટ કરે છે" જેવા ઝીણવટભર્યા વર્ણનો ઉમેરે છે. તેમનું અનુમાન છે કે ચોક્કસ મેનિપ્યુલેશન કૌશલ્ય તાલીમ આપવા માટે આ વિગત કાચા એગો-સેન્ટ્રિક (ego-centric) વીડિયો કરતા લગભગ 100 × વધુ મૂલ્યવાન છે.

ડેટા મેન્યુફેક્ચરિંગનું અર્થશાસ્ત્ર

Physical AI મશીન લર્નિંગના નાણાકીય ગણિતને બદલે છે. LLM લેબ્સ લગભગ શૂન્ય માર્જિનલ ખર્ચ પર મોડલ્સ બનાવતા હતા કારણ કે ઇન્ટરનેટ અનંત ટેક્સ્ટ પૂરો પાડે છે. જોકે, રોબોટ તાલીમ ડેટાનું ઉત્પાદન કરવા માટે હાર્ડવેર, માનવ ઓપરેટરો અને મહેનતભર્યા એનોટેશનની જરૂર પડે છે. Encord નું આંતરિક લક્ષ્ય ઉચ્ચ-ગુણવત્તાવાળા ડેટાને ગ્રાહકોને મળતા મૂલ્ય કરતા 20 × વધુ ખર્ચ-અસરકારક બનાવવાનું છે, પરંતુ તે આક્રમક કાર્યક્ષમતા પણ મોટા પાયે રોબોટ ફ્લીટ માટે મલ્ટી-મિલિયન-ડોલરના પ્રોજેક્ટ્સમાં પરિણમે છે.

જોખમો સ્પષ્ટ છે: જે કંપનીઓ સૌપ્રથમ વિશાળ, સમૃદ્ધ એનોટેટેડ ડેટાસેટ્સ જનરેટ કરી શકશે તે ઓટોનોમસ મેનિપ્યુલેશનના ઉભરતા બજાર પર પ્રભુત્વ જમાવશે—પછી ભલે તેનો અર્થ ડેટા-સેન્ટરના ફ્લોર પર ઇથરનેટ કેબલ જોડવા હોય અથવા ડિસ્ટ્રિબ્યુશન સેન્ટરમાં વસ્તુઓ પસંદ કરવી અને પેક કરવી હોય. જેઓ માત્ર વીડિયો પાઇપલાઇન્સ પર નિર્ભર રહેવાનું ચાલુ રાખશે તેઓ પાછળ રહી જવાનું જોખમ ઉઠાવશે કારણ કે સ્પર્ધકો માનવ શરીર અને મગજમાંથી વધુ સમૃદ્ધ સંકેતો મેળવી રહ્યા છે.

વિરોધ પક્ષના મુદ્દાઓ અને ખુલ્લા પ્રશ્નો

દરેક વ્યક્તિ એ વાતથી સહમત નથી કે ન્યુરો-સિગ્નલ્સ એ ખૂટતો ભાગ છે. ટીકાકારો દલીલ કરે છે કે વધારાની હાર્ડવેર જટિલતા ફાયદાઓ કરતાં વધુ હોઈ શકે છે, ખાસ કરીને જ્યારે વીડિયો અને ફોર્સ-ટોર્ક સેન્સર્સ પહેલેથી જ ઘણા ઔદ્યોગિક કાર્યો માટે સારો દેખાવ આપે છે. સ્કેલેબિલિટી (Scalability) એもう એક ચિંતા છે: હજારો ઓપરેટરોને EEG હેડસેટ્સ અને EMG રગ્સથી સજ્જ કરવા નાના ઉત્પાદકો માટે મોંઘા સાબિત થઈ શકે છે.

ડેટા-જનરેશન પાઇપલાઇન હજુ પણ શ્રમ-સઘન છે. લીડર-ફોલોઅર રગ્સ હોવા છતાં, ખરેખર જનરલ રોબોટ માટે જરૂરી કાર્યોની વ્યાપકતાને કેપ્ચર કરવા માટે અનેક લેબ્સ અને ફેક્ટરીઓમાં સતત, સંકલિત પ્રયાસોની જરૂર પડશે. બજારને એ નક્કી કરવું પડશે કે વધારાના પ્રદર્શનના લાભો શરૂઆતની રોકાણને યોગ્ય ઠેરવે છે કે નહીં.

આગળ શું જોવું

  • ડેટા વોલ્યુમ માઈલસ્ટોન્સ: YouTube કરતા પાંચ ગણા મોટા ડેટાસેટનો Encord નો દાવો એક નક્કર બેન્ચમાર્ક હશે. જ્યારે તે જાહેર કરવામાં આવશે, ત્યારે અન્ય ખેલાડીઓ પાસે તેને મેચ કરવા અથવા તેનાથી આગળ વધવા માટે સ્પષ્ટ લક્ષ્ય હશે.
  • હાર્ડવેર અપનાવવાનો દર: EEG અને EMG ઉપકરણો ડેટા-કલેક્શન રગ્સમાં કેટલી ઝડપથી પ્રમાણભૂત બને છે તે દર્શાવશે કે આ અભિગમ પ્રાયોગિક પાયલોટથી આગળ વધશે કે નહીં.
  • ખર્ચના માપદંડો: જો Encord સાબિત કરી શકે કે તે વચન આપેલ 20 ગણો ખર્ચનો ફાયદો આપી શકે છે, તો તે મોડલ ડિઝાઇનને બદલે "ડેટા મેન્યુફેક્ચરિંગ" પર ધ્યાન કેન્દ્રિત કરતા નવા પ્રવેશદ્વારોની લહેર લાવી શકે છે.
  • પ્રદર્શનમાં તફાવત