Qwen-Drive-1.0 પર્સેપ્શન, પ્લાનિંગ અને ભાષાને એક જ મોડેલમાં જોડે છે, જે સ્વાયત્ત-વાહન (autonomous-vehicle) એન્જિનિયરોને બોલાવેલી અથવા લખાણ દ્વારા આપવામાં આવેલી સૂચનાઓનું પાલન કરવાની ક્ષમતા ગુમાવ્યા વિના એક વધુ સ્પષ્ટ સ્ટેકનું વચન આપે છે. આ એકીકૃત આર્કિટેક્ચર ડેવલપમેન્ટની જટિલતા ઘટાડી શકે છે અને સાથે સાથે કારને “તમે શા માટે વળ્યા?” જેવા પ્રશ્નોના જવાબ આપવા અથવા “આગળનો એક્ઝિટ લો” જેવી સૂચનાઓનું પાલન કરવા સક્ષમ રાખી શકે છે.
એકીકૃત ફાઉન્ડેશન શા માટે મહત્વનું છે
આજનું મોટાભાગનું સેલ્ફ-ડ્રાઇવિંગ સોફ્ટવેર અલગ-અલગ મોડ્યુલ્સનું મિશ્રણ છે: એક વિઝન સિસ્ટમ જે કેમેરા અને લિડાર (lidar) ડેટાનું વિશ્લેષણ કરે છે, એક પ્લાનર જે ટ્રેજેક્ટરી નક્કી કરે છે, અને એક લેંગ્વેજ ઇન્ટરફેસ જે યુઝરના કમાન્ડ અથવા સમજૂતીને હેન્ડલ કરે છે. દરેક ભાગ અલગથી તાલીમ પામે છે, તેથી જ્યારે વિઝન અથવા પ્લાનિંગ ભાગોનું વર્ચસ્વ હોય ત્યારે લેંગ્વેજ ઘટક ઘણીવાર વિચલિત થઈ જાય છે. પરિણામે એવું વાહન મળે છે જે નેવિગેટ કરી શકે છે પરંતુ કુદરતી ભાષાને વિશ્વસનીય રીતે સમજવામાં અથવા ઉત્પન્ન કરવામાં નિષ્ફળ જાય છે.
Qwen-Drive-1.0 એકસાથે ત્રણ કાર્યો પર એક સિંગલ બેકબોન તાલીમ આપીને આ વિખરાયેલી સમસ્યાનો સામનો કરે છે—3-D પર્સેપ્શન, વિઝ્યુઅલ ક્વેશ્ચન આન્સરિંગ (VQA), અને મોશન પ્લાનિંગ. ડ્રાઇવિંગ ડેટાસેટ્સને જનરલ વિઝન-લેંગ્વેજ કોર્પોરા સાથે મિક્સ કરીને, મોડેલ જોતા અને કાર્ય કરતા શીખતી વખતે તેનું ભાષાકીય જ્ઞાન જાળવી રાખે છે. આ “મલ્ટિમોડલ ફાઉન્ડેશન” લાર્જ લેંગ્વેજ મોડલ્સના ટ્રેન્ડ્સને પ્રતિબિંબિત કરે છે જે ઘણા ડાઉનસ્ટ્રીમ એપ્લિકેશન્સ માટે આધાર તરીકે કામ કરે છે, પરંતુ તે સુરક્ષિત નેવિગેશન માટે જરૂરી સ્પેસિયલ રીઝનિંગ (spatial reasoning) પણ ઉમેરે છે.
મોડેલનું મૂલ્યાંકન કેવી રીતે કરવામાં આવ્યું
સંશોધકોએ મોડેલને ઓપન-લૂપ અને ક્લોઝડ-લૂપ બંને ટેસ્ટ દ્વારા ચલાવ્યું. ઓપન-લૂપ સિનારીયોમાં સિસ્ટમે રેકોર્ડ કરેલા સેન્સર સ્ટ્રીમ્સ પર પ્રક્રિયા કરી અને પર્યાવરણને અસર કર્યા વિના આગાહીઓ (predictions) જનરેટ કરી; ક્લોઝડ-લૂપ ટ્રાયલ્સમાં તેણે ખરેખર એક સિમ્યુલેટેડ વાહનને નિયંત્રિત કર્યું. આ સેટિંગ્સમાં, Qwen-Drive-1.0 નું મોશન-પ્લાનિંગ પ્રદર્શન એવા સ્પેશિયાલિસ્ટ મોડલ્સ જેવું જ હતું જે ફક્ત ડ્રાઇવિંગ પર ધ્યાન કેન્દ્રિત કરે છે. સાથે સાથે, તેના VQA ઘટકે દ્રશ્ય વિશેના પ્રશ્નોના જવાબ આપ્યા, જે દર્શાવે છે કે સંયુક્ત તાલીમ દરમિયાન ભાષાની ક્ષમતા જળવાઈ રહી છે.
બાકી રહેલા અવરોધો
વર્તમાન કાર્ય સંપૂર્ણ સેન્સર સ્યુટ સુધી પહોંચતું નથી. હાઇ-રિઝોલ્યુશન લિડાર ઇનપુટ્સ અને લોંગ-રેન્જ પ્રિડિક્શન—બંને હાઇવે ડ્રાઇવિંગ માટે નિર્ણાયક છે—તાલીમ સેટમાં ગેરહાજર છે. પર્સેપ્શન પણ ડેટાસેટ્સના મર્યાદિત સંગ્રહ પર આધારિત છે, જે વિવિધ હવામાન, લાઇટિંગ અને ટ્રાફિક પરિસ્થિતિઓમાં જનરલાઇઝેશન વિશે પ્રશ્નો ઉભા કરે છે. જ્યાં સુધી મોડેલ વાસ્તવિક દુનિયાના હાઇ-બેન્ડવિડ્થ સેન્સર સ્ટ્રીમ્સ પર પોતાને સાબિત ન કરે ત્યાં સુધી, એન્જિનિયરો સાબિત થયેલા પાઇપલાઇન્સને બદલવામાં ખચકાશે.
જો આ અભિગમ સ્કેલ થાય તો શું બદલાઈ શકે છે
જો એક સિંગલ ફાઉન્ડેશન સમગ્ર પર્સેપ્શન-પ્લાનિંગ-લેંગ્વેજ સ્ટેકને હેન્ડલ કરી શકે, તો ઓટોમોટિવ ટીમો અલગ-અલગ મોડ્યુલ્સના જટિલ સંચાલનને છોડી શકે છે. તેનાથી ઇન્ટિગ્રેશન પ્રયાસો ઘટશે, ઇન્ટર-મોડ્યુલ કોમ્યુનિકેશનથી થતો લેટન્સી (latency) ઘટશે અને અપડેટ્સ સરળ બનશે: પ્લાનરને ફરીથી તાલીમ આપ્યા વિના નવી ભાષા ક્ષમતા ઉમેરી શકાશે. ઓટોનોમસ ડ્રાઇવિંગ માટેના બેન્ચમાર્ક સ્યુટ્સને પણ વિકસિત કરવાની જરૂર પડશે, જેમાં પરંપરાગત સુરક્ષા અને કાર્યક્ષમતા સ્કોર્સની સાથે ભાષા-કેન્દ્રિત મેટ્રિક્સ ઉમેરવા પડશે.
વિરોધ પક્ષ: સ્પેશિયલાઇઝેશનનું હજુ પણ સ્થાન છે
સ્પેશિયાલિસ્ટ મોડલ્સ એટલા માટે શ્રેષ્ઠ છે કારણ કે તેમને વિશાળ, ડોમેન-સ્પેસિફિક ડેટા પર ફાઇન-ટ્યુન કરી શકાય છે. એક યુનિફાઇડ મોડેલ લિડાર-ઓન્લી પર્સેપ્શન નેટવર્ક અથવા અબજો માઇલ ડ્રાઇવિંગ લોગ્સ પર તાલીમ પામેલા પ્લાનરના સંપૂર્ણ શિખર પ્રદર્શન સાથે મેળ ખાવા માટે સંઘર્ષ કરી શકે છે. સુરક્ષા-મહત્વપૂર્ણ કાર્યો માટે, નિયમનકારો અને ઉત્પાદકો સમર્પિત, વ્યાપક રીતે પ્રમાણિત ઘટકોની માંગ કરવાનું ચાલુ રાખી શકે છે.
આગળ શું જોવું
ભવિષ્યના રિલીઝ એ દર્શાવશે કે શું Qwen-Drive-1.0 હાઇ-રિઝોલ્યુશન લિડારને ગ્રહણ કરી શકે છે અને લોંગ-હોરાઇઝન ફોરકાસ્ટિંગ કરી શકે છે. વાસ્તવિક દુનિયાના રોડ ટેસ્ટ, ખાસ કરીને વિવિધ શહેરી વાતાવરણમાં, એકીકૃત અભિગમ માટે લિટમસ ટેસ્ટ હશે. જો તે ટ્રાયલ્સ સફળ થાય, તો ઉદ્યોગ મલ્ટિમોડલ ફાઉન્ડેશન્સ તરફ વળી શકે છે જે સ્વાયત્ત વાહનોમાં ભાષાને એક મુખ્ય ઘટક તરીકે ગણે છે.
