Qwen-Drive-1.0 perception, planning, language എന്നിവയെ ഒരു സിംഗിൾ മോഡലിലേക്ക് സംയോജിപ്പിക്കുന്നു. ഇത് സ്വയം നിയന്ത്രിത വാഹന എഞ്ചിനീയർമാർക്ക്, സംസാരത്തിലൂടെയോ എഴുത്തിലൂടെയോ നൽകുന്ന നിർദ്ദേശങ്ങൾ പാലിക്കാനുള്ള കഴിവ് നഷ്ടപ്പെടുത്താതെ തന്നെ കൂടുതൽ ലളിതമായ ഒരു സ്ടാക്ക് വാഗ്ദാനം ചെയ്യുന്നു. ഈ ഏകീകൃത ആർക്കിടെക്ചർ വികസന സങ്കീർണ്ണത കുറയ്ക്കാൻ സഹായിക്കും, ഒപ്പം "എന്തുകൊണ്ടാണ് നിങ്ങൾ തിരിഞ്ഞത്?" എന്ന ചോദ്യത്തിന് ഉത്തരം നൽകാനോ "അടുത്ത എക്സിറ്റിൽ ഇറങ്ങുക" എന്ന നിർദ്ദേശം പാലിക്കാനോ കാറുകളെ പ്രാപ്തമാക്കും.
ഒരു ഏകീകൃത ഫൗണ്ടേഷൻ (foundation) പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്?
ഇന്നത്തെ മിക്ക സ്വയം നിയന്ത്രിത വാഹന സോഫ്റ്റ്വെയറുകളും വ്യത്യസ്ത മോഡ്യൂളുകളുടെ ഒരു കൂട്ടമാണ്: ക്യാമറ, ലിഡാർ (lidar) ഡാറ്റ വിശകലനം ചെയ്യുന്ന ഒരു വിഷൻ സിസ്റ്റം, സഞ്ചാരപാത തീരുമാനിക്കുന്ന ഒരു പ്ലാനർ, ഉപയോക്താവിന്റെ നിർദ്ദേശങ്ങളോ വിശദീകരണങ്ങളോ കൈകാര്യം ചെയ്യുന്ന ഒരു ലാംഗ്വേജ് ഇന്റർഫേസ് എന്നിവ ഇതിൽ ഉൾപ്പെടുന്നു. ഓരോ ഭാഗവും ഒറ്റപ്പെട്ട രീതിയിലാണ് പരിശീലിപ്പിക്കപ്പെടുന്നത്, അതിനാൽ വിഷൻ അല്ലെങ്കിൽ പ്ലാനിംഗ് ഭാഗങ്ങൾക്കാണ് മുൻഗണന ലഭിക്കുന്നതെങ്കിൽ ലാംഗ്വേജ് ഘടകത്തിൽ വ്യതിയാനങ്ങൾ സംഭവിക്കാറുണ്ട്. ഇതിന്റെ ഫലമായി, വാഹനത്തിന് സഞ്ചരിക്കാൻ കഴിയുമെങ്കിലും സ്വാഭാവിക ഭാഷ കൃത്യമായി മനസ്സിലാക്കാനോ ആശയവിനിമയം നടത്താനോ സാധിക്കാതെ വരുന്നു.
Qwen-Drive-1.0 ഈ വിഭജനത്തെ നേരിടുന്നത് മൂന്ന് ജോലികൾ ഒരേസമയം ചെയ്യുന്ന ഒരു സിംഗിൾ ബാക്ക്ബോൺ പരിശീലിപ്പിച്ചുകൊണ്ടാണ്—3-D perception, വിഷ്വൽ ക്വസ്റ്റ്യൻ ആൻ്റിംഗ് (VQA), മോഷൻ പ്ലാനിംഗ്. ഡ്രൈവിംഗ് ഡാറ്റാസെറ്റുകൾ പൊതുവായ വിഷൻ-ലാംഗ്വേജ് കോർപ്പസുകളുമായി (corpora) കൂട്ടിച്ചേർക്കുന്നതിലൂടെ, കാണാനും പ്രവർത്തിക്കാനും പഠിക്കുന്നതിനോടൊപ്പം തന്നെ ഈ മോഡൽ അതിന്റെ ഭാഷാപരമായ അറിവ് നിലനിർത്തുന്നു. ഈ "മൾട്ടിമോഡൽ ഫൗണ്ടേഷൻ" പല ആപ്ലിക്കേഷനുകൾക്കും അടിസ്ഥാനമായി വർത്തിക്കുന്ന ലാർജ് ലാംഗ്വേജ് മോഡലുകളിലെ പ്രവണതകളെപ്പോലെയാണ്, എന്നാൽ സുരക്ഷിതമായ നാവിഗേഷന് ആവശ്യമായ സ്പേഷ്യൽ റീസണിംഗും (spatial reasoning) ഇത് നൽകുന്നു.
മോഡൽ എങ്ങനെ വിലയിരുത്തി
ഗവേഷകർ ഈ മോഡലിനെ ഓപ്പൺ-ലൂപ്പ് (open-loop), ക്ലോസ്ഡ്-ലൂപ്പ് (closed-loop) ടെസ്റ്റുകളിലൂടെ പരീക്ഷിച്ചു. ഓപ്പൺ-ലൂപ്പ് സാഹചര്യങ്ങളിൽ, സിസ്റ്റം റെക്കോർഡ് ചെയ്ത സെൻസർ സ്ട്രീമുകൾ പ്രോസസ്സ് ചെയ്യുകയും പരിസ്ഥിതിയെ സ്വാധീനിക്കാതെ പ്രവചനങ്ങൾ നടത്തുകയും ചെയ്തു; ക്ലോസ്ഡ്-ലൂപ്പ് പരീക്ഷണങ്ങളിൽ, ഇത് യഥാർത്ഥത്തിൽ ഒരു സിമുലേറ്റഡ് വാഹനം നിയന്ത്രിച്ചു. ഈ സാഹചര്യങ്ങളിലുടനീളം, Qwen-Drive-1.0-ന്റെ മോഷൻ-പ്ലാനിംഗ് പ്രകടനം ഡ്രൈവിംഗിൽ മാത്രം ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്ന സ്പെഷ്യലിസ്റ്റ് മോഡലുകൾക്ക് തുല്യമായിരുന്നു. അതേസമയം, ഇതിന്റെ VQA ഘടകത്തിന് ചുറ്റുമുള്ള സാഹചര്യങ്ങളെക്കുറിച്ചുള്ള ചോദ്യങ്ങൾക്ക് ഉത്തരം നൽകാൻ കഴിഞ്ഞു, ഇത് സംയുക്ത പരിശീലനത്തിലൂടെ ഭാഷാപരമായ കഴിവ് നിലനിർത്തുന്നുണ്ടെന്ന് തെളിയിക്കുന്നു.
ബാക്കിയുള്ള തടസ്സങ്ങൾ
നിലവിലെ പ്രവർത്തനം ഒരു സമ്പൂർണ്ണ സെൻസർ സ്യൂട്ടിന്റെ പരിധിയിൽ എത്തിയിട്ടില്ല. ഹൈവേ ഡ്രൈവിംഗിന് നിർണ്ണായകമായ ഹൈ-റെസല്യൂഷൻ ലിഡാർ ഇൻപുട്ടുകളും ദീർഘദൂര പ്രവചനങ്ങളും (long-range prediction) ഇതിന്റെ ട്രെയിനിംഗ് സെറ്റിൽ ഇല്ല. കൂടാതെ, പെർസെപ്ഷൻ പരിമിതമായ ഡാറ്റാസെറ്റുകളെ ആശ്രയിച്ചാണ് പ്രവർത്തിക്കുന്നത്, ഇത് വ്യത്യസ്ത കാലാവസ്ഥകൾ, വെളിച്ചം, ട്രാഫിക് സാഹചര്യങ്ങൾ എന്നിവയിലുള്ള പ്രകടനം സംബന്ധിച്ച ചോദ്യങ്ങൾ ഉയർത്തുന്നു. യഥാർത്ഥ ലോകത്തെ ഉയർന്ന ബാൻഡ്വിഡ്ത്ത് സെൻസർ സ്ട്രീമുകളിൽ ഈ മോഡൽ വിജയിക്കുന്നത് വരെ, നിലവിലുള്ള വിശ്വസനീയമായ സംവിധാനങ്ങൾക്ക് പകരക്കാരനാകാൻ എഞ്ചിനീയർമാർ മടിക്കக்கூടാം.
ഈ സമീപനം വ്യാപിപ്പിക്കപ്പെട്ടാൽ എന്ത് മാറ്റം വരാം?
ഒരു സിംഗിൾ ഫൗണ്ടേഷന് മുഴുവൻ perception-planning-language സ്ടാക്ക് കൈകാര്യം ചെയ്യാൻ കഴിയുമെങ്കിൽ, ഓട്ടോമോട്ടീവ് ടീമുകൾക്ക് വ്യത്യസ്ത മോഡ്യൂളുകളുടെ സങ്കീർണ്ണമായ ഏകോപനം ഒഴിവാക്കാം. ഇത് ഇന്റഗ്രേഷൻ പരിശ്രമം കുറയ്ക്കാനും, മോഡ്യൂളുകൾ തമ്മിലുള്ള ആശയവിനിമയത്തിലെ ലേറ്റൻസി (latency) കുറയ്ക്കാനും, അപ്ഡേറ്റുകൾ ലളിതമാക്കാനും സഹായിക്കും: പ്ലാനർ വീണ്ടും പരിശീലിപ്പിക്കാതെ തന്നെ പുതിയ ഭാഷാപരമായ കഴിവുകൾ ഇതിൽ ചേർക്കാൻ സാധിക്കും. സ്വയം നിയന്ത്രിത ഡ്രൈവിംഗിനായുള്ള ബെഞ്ച്മാർക്ക് സ്യൂട്ടുകളും പരിണമിക്കേണ്ടതുണ്ട്, പരമ്പരാഗത സുരക്ഷാ-കാര്യക്ഷമത സ്കോറുകൾക്കൊപ്പം ഭാഷാ കേന്ദ്രീകൃതമായ അളവുകോലുകളും അവയിൽ ഉൾപ്പെടുത്തേണ്ടി വരും.
വിപരീത വാദം: പ്രത്യേകവൽക്കരണത്തിന് ഇപ്പോഴും സ്ഥാനമുണ്ട്
ഡൊമെയ്ൻ-സ്പെസിഫിക് ആയ വൻതോതിലുള്ള ഡാറ്റ ഉപയോഗിച്ച് ഫൈൻ-ട്യൂൺ ചെയ്യാൻ കഴിയുന്നതുകൊണ്ട് സ്പെഷ്യലിസ്റ്റ് മോഡലുകൾ മികച്ച പ്രകടനം കാഴ്ചവെക്കുന്നു. ഒരു ഏകീകൃത മോഡലിന് ലിഡാർ മാത്രം ഉപയോഗിക്കുന്ന പെർസെപ്ഷൻ നെറ്റ്വർക്കിന്റെയോ അല്ലെങ്കിൽ കോടിക്കണക്കിന് മൈലുകൾ ഡ്രൈവിംഗ് ലോഗുകൾ ഉപയോഗിച്ച് പരിശീലിപ്പിച്ച പ്ലാനറുടെയോ പരമാവധി പ്രകടനം എത്തിക്കാൻ കഴിഞ്ഞെന്നു വരില്ല. സുരക്ഷാപരമായ കാര്യങ്ങളിൽ, നിയന്ത്രണ ഏജൻസികളും നിർമ്മാതാക്കളും പ്രത്യേകമായി പരിശോധിക്കപ്പെട്ടതും അംഗീകരിക്കപ്പെട്ടതുമായ ഘടകങ്ങൾക്കായി തുടർന്നും ആവശ്യപ്പെട്ടേക്കാം.
ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ
ഭാവിയിലെ റിലീസുകൾ Qwen-Drive-1.0-ന് ഹൈ-റെസല്യൂഷൻ ലിഡാർ ഉൾക്കൊള്ളാൻ കഴിയുമോ എന്നും ദീർഘകാല പ്രവചനങ്ങൾ നടത്താൻ കഴിയുമോ എന്നും വെളിപ്പെടുത്തേണ്ടതുണ്ട്. യഥാർത്ഥ റോഡ് പരീക്ഷണങ്ങൾ, പ്രത്യേകിച്ച് വൈവിധ്യമാർന്ന നഗര ചുറ്റുപാടുകളിൽ, ഈ ഏകീകൃത സമീപനത്തിന്റെ ലിറ്റ്മസ് ടെസ്റ്റ് ആയിരിക്കും. ഈ പരീക്ഷണങ്ങൾ വിജയിക്കുകയാണെങ്കിൽ, സ്വയം നിയന്ത്രിത വാഹനങ്ങളിൽ ഭാഷയെ ഒരു പ്രധാന ഘടകമായി പരിഗണിക്കുന്ന മൾട്ടിമോഡൽ ഫൗണ്ടേഷനുകളിലേക്ക് വ്യവസായം മാറാൻ സാധ്യതയുണ്ട്.
