BYD च्या नवीन HyWorldVLA मॉडेलने NAVSIM v1 बेंचमार्कवर 90.59 PDMS गुण मिळवले आहेत, हा एक असा विक्रम आहे जो चिनी EV क्षेत्रातील या दिग्गज कंपनीला स्वायत्त-ड्रायव्हिंग (autonomous-driving) फाउंडेशन मॉडेल्सच्या नकाशावर आणतो. PDMS हे एखादी प्रणाली सुरक्षित आणि कार्यक्षम मार्ग किती चांगल्या प्रकारे नियोजित करते हे मोजते; उच्च स्कोअरचा अर्थ अधिक सुलभ आणि अधिक विश्वसनीय स्वयंचलित ड्रायव्हिंग वर्तन असा होतो.

हे मेट्रिक का महत्त्वाचे आहे

NAVSIM v1 हे व्यापकपणे वापरले जाणारे सिम्युलेशन सूट आहे जे गुंतागुंतीच्या ट्रॅफिकमध्ये अंदाज लावण्याची आणि कृती करण्याची मॉडेलची क्षमता तपासते. 90.59 PDMS मिळवणे हे यापूर्वीच्या सर्व आकड्यांना मागे टाकणारे आहे, ज्यावरून असे सूचित होते की HyWorldVLA रस्तेवरील घटनांचा असा अचूक अंदाज लावू शकते जो प्रस्थापित कंपन्यांच्या सुरुवातीच्या टप्प्यातील प्रणालींना टक्कर देतो.

हे शक्य करणारी आर्किटेक्चर (Architecture)

HyWorldVLA दोन पारंपारिकपणे वेगळ्या असलेल्या दृष्टिकोनांचे मिश्रण करते:

  • Pixel-level prediction – मॉडेल सभोवतालचा तपशीलवार व्हिज्युअल नकाशा ठेवते, ज्यामध्ये लेन मार्किंग आणि पादचाऱ्यांच्या हालचालींसारखे सूक्ष्म संकेत जतन केले जातात.
  • Latent-level reasoning – हे दृश्याला उच्च-स्तरीय प्रतिनिधित्वात (higher-order representation) संकुचित करते ज्याचा वापर भविष्यातील अंदाजांसाठी केला जाऊ शकतो, ज्यामुळे दीर्घकालीन नियोजन शक्य होते.

केवळ पिक्सेल मॉडेल्स तपशीलांमध्ये उत्कृष्ट असतात परंतु त्यांना प्रचंड कम्प्युटिंग शक्तीची आवश्यकता असते, ज्यामुळे ते उत्पादन कारसाठी (production cars) अव्यवहार्य ठरतात. केवळ लेटंट मॉडेल्स वेगाने चालतात परंतु ते व्हिज्युअल बारकावे सोडून देतात जे सुरक्षिततेसाठी अत्यंत महत्त्वाचे असू शकतात. BYD च्या हायब्रिड डिझाइनचा दावा आहे की ते दोन्ही जगातील सर्वोत्तम गोष्टी मिळवून देते, ज्यामुळे प्रचंड हार्डवेअर खर्च न करता अधिक समृद्ध अंदाज मिळतात.

ही प्रणाली Vision-Language-Action (VLA) पॅराडाइमचे अनुसरण करते. प्रथम ती भविष्यातील फ्रेम्सची "कल्पना" करते (vision), त्यानंतर त्या फ्रेम्सचे मजकूर किंवा प्रतीकात्मक वर्णनात रूपांतर करते (language), आणि शेवटी त्या वर्णनाचा थेट वाहन नियंत्रणांशी (action) संबंध जोडते. प्रत्यक्ष व्यवहारात, मॉडेल ट्रॅफिक कसे बदलेल याचा अंदाज वर्तवते आणि त्या अंदाजाचा वापर स्टेअरिंग, वेग वाढवणे किंवा ब्रेक लावणे यासाठी करते.

कोणाला फायदा होऊ शकतो

BYD ही जगातील सर्वात मोठी इलेक्ट्रिक-वाहने उत्पादक कंपनी आहे. आपल्या वाहनांच्या ताफ्यात (fleet) HyWorldVLA समाविष्ट केल्यामुळे कंपनीला वास्तविक जगातील ड्रायव्हिंग डेटाचा अभूतपूर्व साठा उपलब्ध होईल. हे चक्र—ताफ्यातील डेटावर प्रशिक्षण देणे आणि अपडेटेड मॉडेल्स तैनात करणे—BYD च्या स्वयंचलित ड्रायव्हिंग क्षमतेला गती देऊ शकते आणि Tesla, Waymo आणि Huawei यांसारख्या कंपन्यांशी असलेली दरी कमी करू शकते, ज्यांच्याकडे आधीच मोठे स्वायत्त ताफे कार्यरत आहेत.

काय अनिश्चित आहे

सार्वजनिक अहवालात मॉडेलचा आकार आणि वापरलेल्या प्रशिक्षण डेटाचे प्रमाण दिले गेलेले नाही, ज्यामुळे स्केलेबिलिटी आणि खर्चाबद्दल प्रश्न निर्माण होतात. जरी हायब्रिड दृष्टिकोन केवळ पिक्सेल मॉडेलपेक्षा कमी इन्फरन्स खर्च (inference expense) देण्याचे आश्वासन देत असला, तरी शुद्ध लेटंट डिझाइनच्या तुलनेत ते अधिक जटिलता वाढवते. ऑटोमोटिव्ह इंजिनिअर्सना हे तपासावे लागेल की कामगिरीतील वाढ अतिरिक्त सिलिकॉन किंवा सॉफ्टवेअर ओव्हरहेडची भरपाई करते का.

पुढे काय पाहावे

  • Production rollout – BYD ने ग्राहक किंवा व्यावसायिक वाहनांमध्ये HyWorldVLA समाकलित करण्यासाठी अद्याप कोणतीही कालमर्यादा जाहीर केलेली नाही. मर्यादित बाजारपेठेत प्रायोगिक कार्यक्रम (pilot program) हे एक तार्किक पहिले पाऊल असेल.
  • Benchmark updates – NAVSIM v1 ची जागा बहुधा नवीन सूट घेतील, ज्यामध्ये स्वायत्ततेच्या (autonomy) विविध पैलूंवर (उदा. प्रतिकूल हवामान, रात्रीचे ड्रायव्हिंग) भर दिला जाईल. HyWorldVLA या चाचण्यांमध्ये कशी कामगिरी करते, यावरून त्याची टिकाऊपणा दिसून येईल.
  • Competitive response – जर BYD चे स्कोअर रस्त्यावरील विश्वासार्हतेत बदलले, तर स्पर्धक मागे पडू नये म्हणून त्यांच्या स्वतःच्या हायब्रिड मॉडेल संशोधनाचा वेग वाढवू शकतात.

निष्कर्ष: BYD चा विक्रमी स्कोअर हे दर्शवतो की हायब्रिड पिक्सेल-लेटंट व्हिजन-लँग्वेज-ॲक्शन मॉडेल अशी नियोजन गुणवत्ता देऊ शकते जी एकेकाळी केवळ विशेष AI लॅब्ससाठी राखीव होती. सिम्युलेशनमधून प्रत्यक्ष रस्त्यावर येताना हा फायदा टिकून राहतो की नाही, यावरून BYD खरोखर स्वायत्त ड्रायव्हिंगचे स्वरूप बदलू शकेल की नाही हे ठरवले जाईल.