OpenAI च्या GPT-5.5 Codex ला अडथळा आला आहे. GitHub आणि Hacker News वरील डेव्हलपर्सनी गेल्या काही आठवड्यांत एका विचित्र वर्तणुकीकडे लक्ष वेधले आहे. हे मॉडेल जटिल कोडिंग आणि तर्क (reasoning) करण्यासाठी बनवले असून, ते 'reasoning-token clustering' नावाच्या समस्येमुळे अडखळत आहे. याचा परिणाम म्हणजे विखुरलेले आउटपुट, तर्कात टप्पे वगळणे आणि व्याकरण बरोबर असूनही चुकीची उत्तरे मिळणे. सॉफ्टवेअर इंजिनिअरिंगसाठी एक गंभीर सहाय्यक म्हणून ओळखले जाणारे साधन असल्याने, ही त्रुटी केवळ किरकोळ अडथळा नसून मोठी समस्या आहे.

वापरकर्ते प्रत्यक्षात काय पाहत आहेत

हे अहवाल केवळ अस्पष्ट तक्रारींच्या स्वरूपात आले नाहीत. वापरकर्त्यांनी विशिष्ट त्रुटींचे वर्णन केले आहे. एखादा डेव्हलपर मॉडेलला एखादे फंक्शन रिफॅक्टर (refactor) करण्यास, अनेक फाइल्समधील बग शोधण्यास किंवा विशिष्ट डिझाइन पॅटर्न लागू करण्यास सांगू शकतो, आणि मॉडेल सुरुवातीला उत्तम काम करते पण नंतर भरकटते. हे केवळ चुकीची उत्तरे देत नव्हते. बहु-टप्प्यांच्या विचार प्रक्रियेदरम्यान ते मध्यंतरी आपला धागा हरवून बसल्यासारखे वाटत होते. ज्या फंक्शनला पाच तार्किक टप्पे लागणे अपेक्षित आहे, ते तिसऱ्या टप्प्यावरच कोलमडू शकते किंवा असे कोड तयार करू शकते जे संरचनेत योग्य वाटतात पण महत्त्वाच्या edge cases कडे दुर्लक्ष करतात. या समस्येचे एक वैशिष्ट्य होते: मॉडेल भाषेमध्ये अपयशी ठरत नव्हते; तर ते स्वतःच्या तर्काचे व्यवस्थापन (bookkeeping) करण्यात अपयशी ठरत होते.

reasoning-token clustering ची कार्यपद्धती

हे का महत्त्वाचे आहे हे समजून घेण्यासाठी, लार्ज लँग्वेज मॉडेल्स प्रत्यक्षात कसे वाचतात हे समजून घेणे आवश्यक आहे. ते माणसांप्रमाणे वाक्ये वाचत नाहीत. ते मजकुराचे tokens मध्ये विभाजन करतात—जे अक्षरांचे, शब्दांश किंवा कधीकधी पूर्ण शब्दांचे तुकडे असतात. हे tokens मशीनसाठी कच्चा माल आहेत, ज्यांचा वापर करून ते उत्तरे तयार करतात.

Reasoning-token clustering म्हणजे मॉडेल जेव्हा एखाद्या गृहितकाकडून (premise) निष्कर्षाकडे (conclusion) जाते, तेव्हा ते संबंधित tokens चा समूह कसा करते. एका सुव्यवस्थित प्रक्रियेत, मॉडेल एका तार्किक धाग्याशी संबंधित tokens एकत्र करते, तो विचार पूर्ण करते आणि नंतर पुढच्या समूहाकडे (cluster) व्यवस्थित वळते. जेव्हा हे क्लस्टरिंग बिघडते, तेव्हा वेगवेगळ्या तार्किक धाग्यांमधील tokens एकमेकांत गुंतले जातात. एक तार्किक व्हेरिएबल दुसऱ्यामध्ये मिसळते. सिंटॅक्स (syntax) तसाच राहतो, पण विचारांची रचना विस्कळीत होते.

हे एखाद्या अशा शेफसारखे आहे जो भाज्या चिरणे विसरला आहे. स्वयंपाकघर पूर्णपणे सज्ज आहे, रेसिपी समोर उघडी आहे आणि शेफला वर्षांचे प्रशिक्षण आहे. पण जर प्राथमिक तयारीच विस्कळीत झाली—उदा. कामाची जागा नीट नसल्यामुळे कांदे केकच्या पिठात मिसळले गेले—तर शेफ कितीही कुशल असला तरी अंतिम निकाल खराबच लागेल. GPT-5.5 Codex साठी, tokens हे घटक (ingredients) आहेत आणि reasoning clusters हे तयारीचे स्टेशन्स आहेत. जेव्हा ही स्टेशन्स विस्कळीत होतात, तेव्हा तयार होणारा पदार्थ बिघडतो.

एक ठोस उदाहरण उपयुक्त ठरेल. समजा तुम्ही मॉडेलला युजर ऑथेंटिकेशन (user authentication) हाताळणारा Python script डीबग (debug) करण्यास सांगितले. या कामासाठी एकाच वेळी तीन वेगळे धागे व्यवस्थित ठेवणे आवश्यक आहे: पासवर्ड हॅशिंग (password hashing), सेशन मॅनेजमेंट (session management) आणि डेटाबेस क्वेरीज (database queries). जर reasoning clusters एकमेकांत मिसळले, तर मॉडेल सेशन लॉजिक हॅशिंग रूटीनला लागू करू शकते किंवा डेटाबेस व्हेरिएबलला युजर इनपुट समजण्याची चूक करू शकते. तयार झालेला कोड वरवर पाहता बरोबर वाटू शकतो, पण प्रत्यक्ष वापराच्या वेळी तो अपयशी ठरू शकतो किंवा सुरक्षेची त्रुटी निर्माण करू शकतो. ही त्रुटी कोडच्या व्याकरणात नसून, तो तयार करणाऱ्या विचारांच्या तर्कात आहे.

ही आर्किटेक्चर का संघर्ष करत आहे

मॉडेल्सची सध्याची पिढी मानवाप्रमाणे वागण्यासाठी प्रेरित केली जात आहे. या महत्त्वाकांक्षेमुळे गुंतागुंत वाढते. हे सिस्टम केवळ त्याच्या ट्रेनिंग डेटातील सांख्यिकीय पॅटर्नच्या आधारे पुढचा token ओळखत नाही. तर ते नैसर्गिक, संदर्भासहित आणि संवादात्मक वाटणारी तर्क करण्याची शैली (reasoning style) सिम्युलेट करण्याचा प्रयत्न करत आहे.

या दुहेरी जबाबदारीमुळे घर्षण निर्माण होते. केवळ भाषा हाताळणे—स्वर (tone), शैली, बारकावे, संवादाचा प्रवाह—हे कठोर आणि संरचित तर्कापेक्षा (reasoning) वेगळे संगणकीय कार्य आहे. दोन्ही गोष्टी एकाच वेळी करणे आर्किटेक्चरवर ताण आणते. सध्याची रचना तर्क आणि भाषा या दोन्ही गोष्टी एकाच वेळी हाताळण्यासाठी संघर्ष करत आहे. स्वच्छ आणि क्रमिक तार्किक साखळीऐवजी, मॉडेल कधीकधी असे तर्क देते जे मानवासारखे वाटत असले तरी संगणकीय दृष्ट्या विस्कळीत असतात.

एका वकिलाची कल्पना करा जो एक कडक करार मसुदा करण्याचा प्रयत्न करत आहे आणि त्याच वेळी शब्दांच्या माध्यमातून कविताही रचत आहे. दोन्ही भाषांशी संबंधित कामे आहेत, परंतु त्यांना वेगवेगळ्या शिस्तीची आवश्यकता असते. जेव्हा मॉडेल अतिशय प्रवाही आणि मानवी अभिव्यक्तीकडे जास्त झुकते, तेव्हा त्याची कठोर तर्कसंगत रचना टिकवून ठेवण्याची क्षमता कमकुवत होते. नैसर्गिक वाटण्याचा प्रयत्न केल्यामुळे संज्ञानात्मक ओझे (cognitive overhead) वाढते आणि अधिक जटिलता म्हणजे नेहमीच चांगले परिणाम असावेत असे नाही. मॉडेलला एकाच वेळी विचार करणे आणि मोहक वाटणे असे दोन्ही कामे सांगितले जात आहेत, आणि 'अटेंशन मेकॅनिझम'चे हार्डवेअर या दुहेरी मागणीशी पूर्णपणे जुळवून घेऊ शकलेले नाही.

प्रयोगशाळेबाहेर हे का महत्त्वाचे आहे

या घटनेचे दोन वेगळी कारणे आहेत.

पहिले म्हणजे, AI परिपूर्ण नाही याची ही एक स्पष्ट आठवण आहे. सर्वोत्तम मॉडेल्स देखील त्यांच्या मर्यादा ओलांडताना चुका करतात. लार्ज लँग्वेज मॉडेल्सभोवती चालणारे मार्केटिंग चक्र अनेकदा त्यांना 'ओरॅकल'सारखी (सर्वज्ञ) प्रणाली म्हणून विकते, परंतु ते प्रत्यक्षात संभाव्यता इंजिन (probabilistic engines) आहेत. ते पुढचे टोकन कोणते असेल याचा अंदाज लावतात आणि कधीकधी ते अंदाज सुसंगत वाटणाऱ्या निरर्थक गोष्टींमध्ये रूपांतरित होतात. GPT-5.5 Codex सारख्या फ्लॅगशिप कोडिंग मॉडेलला स्वतःच्याच तर्कात अडखळताना पाहणे ही एक वास्तववादी जाणीव करून देणारी गोष्ट आहे. हे 'पॅटर्न मॅचिंग' आणि 'खुरी समज' यामधील सीमा दर्शवते, आणि ती सीमा अजूनही अत्यंत वास्तविक आहे.

दुसरे म्हणजे, व्यवसाय या मॉडेल्सवर अवलंबून आहेत. खराब कामगिरीचा उत्पादन विकास आणि ग्राहक सेवांवर थेट आणि मोजता येण्याजोग्या प्रकारे परिणाम होतो. Codex वापरून बॅकएंड इन्फ्रास्ट्रक्चर तयार करणारी एखादी स्टार्टअप कंपनी सुरक्षा त्रुटी निर्माण करू शकते, कारण मॉडेलने दोन ऑथेंटिकेशन लेयर्समध्ये गोंधळ केला असेल. अशाच आर्किटेक्चरवर आधारित ग्राहक-सेवा बॉट रिफंड किंवा पॉलिसी अपवाद देण्याचे आश्वासन देऊ शकतो जे तो प्रत्यक्षात पूर्ण करू शकत नाही, ज्यामुळे कायदेशीर धोका आणि नाराज ग्राहक निर्माण होऊ शकतात.

जेव्हा तुम्ही सॉफ्टवेअरच्या पलीकडे पाहता, तेव्हा धोके अधिक वाढतात. अशा घटना आरोग्यसेवा किंवा कार चालवण्यामध्ये AI वापरण्याबाबत गंभीर प्रश्न निर्माण करतात. जर एखादे मॉडेल SQL क्वेरी लिहिताना टोकन क्लस्टर्समध्ये गोंधळ करू शकत असेल, तर जेव्हा ते वैद्यकीय स्कॅनचे विश्लेषण करते किंवा स्वायत्त वाहनासाठी रिअल-टाइम सेन्सर डेटा वाचते, तेव्हा काय होईल? त्यामागील यंत्रणा—अब्जावधी पॅरामीटर्समधील सांख्यिकीय पॅटर्न मॅचिंग—मूलभूतपणे सारखीच आहे. उच्च-परिणामाच्या क्षेत्रांमध्ये या प्रणालींवर विश्वास ठेवण्यासाठी तर्कसंगत विश्वासार्हतेच्या अशा पातळीची आवश्यकता असते, जी टोकन-क्लस्टरिंगमधील त्रुटी थेट कमकुवत करतात.

एक अडखळण, कोसळणे नाही

याला अपयश म्हणणे ही चूक ठरेल. या समस्या नवीन तंत्रज्ञान निर्मितीचा एक भाग आहेत. AI क्षमतेतील प्रत्येक महत्त्वपूर्ण प्रगतीनंतर काही काळ अस्थिर वर्तनाचा काळ आला आहे. सुरुवातीच्या GPT मॉडेल्सनी अत्यंत आत्मविश्वासाने चुकीची तथ्ये सांगितली होती. इमेज जनरेटर्सनी एकेकाळी मानवी हात चुकीच्या पद्धतीने दाखवले होते. कोड मॉडेल्सनी संदिग्ध सूचना मिळाल्यास वारंवार 'इनफिनिट लूप्स' आउटपुट दिले आहेत. प्रत्येक त्रुटीने एक सीमा स्पष्ट केली आणि संशोधकांनी त्या सीमांचा वापर अधिक चांगले मार्गदर्शक आराखडे तयार करण्यासाठी केला.

संशोधक या त्रुटींचा वापर प्रणाली सुधारण्यासाठी आणि अधिक सक्षम करण्यासाठी करतात. GitHub थ्रेड्स आणि Hacker News कमेंट सेक्शनमधून मिळणारा फीडबॅक हा केवळ गोंधळ नाही. तो वास्तविक जगातील कच्चा डायग्नोस्टिक डेटा आहे. जेव्हा शेकडो डेव्हलपर्स हजारो वेगवेगळ्या कामांमध्ये मॉडेलची चाचणी घेतात, तेव्हा ते अशा त्रुटी समोर आणतात ज्या अंतर्गत गुणवत्ता-आश्वासन (quality-assurance) टीम पूर्णपणे शोधू शकली नसती. ही क्राउडसोर्स्ड छाननी फीडबॅक लूप अधिक घट्ट करते आणि अधिक जलद व लक्ष्यित सुधारणा करण्यास भाग पाडते.

या घटनेमुळे बहुधा मॉडेलची अधिक चांगली आवृत्ती तयार होईल. एकदा त्रुटी नोंदवली आणि समजून घेतली की, OpenAI ऐतिहासिकदृष्ट्या वेगाने सुधारणा करत आले आहे. ही सुधारणा अटेंशन मेकॅनिझममध्ये बदल करणे असो, रिझनिंग लेयर्स आणि लँग्वेज लेयर्सचे वजन कसे असावे याचे प्रमाणीकरण करणे असो, किंवा वापरकर्त्यापर्यंत पोहोचण्यापूर्वी गुंतागुंतीचे टोकन क्लस्टर्स पकडण्यासाठी नवीन पडताळणी प्रक्रिया आणणे असो, त्याचा परिणाम अधिक टिकाऊ प्रणालीच्या स्वरूपात होतो.

मुख्य निष्कर्ष

काम करणाऱ्या डेव्हलपर्ससाठी हा धडा व्यावहारिक आहे. AI-जनरेटेड कोड आणि तर्काला अंतिम उत्पादन न मानता केवळ एक 'पहिला मसुदा' समजा. तुमच्या चाचण्या (tests) करा. तर्काची स्वतः हाताने पडताळणी करा. आउटपुट वरवर जरी पॉलिश वाटत असले तरी, मॉडेलने त्याचे अंतर्गत टोकन क्लस्टर्स विस्कळीत केले असावेत, असे गृहीत धरा. सुंदर सिंटॅक्समध्ये एखादा गोंधळलेला विचार लपलेला असू शकतो.

संपूर्ण उद्योगासाठी, ही घटना हे अधोरेखित करते की कृत्रिम बुद्धिमत्तेतील प्रगती ही सरळ रेषेत नसते. ती रिलीज, बिघाड, निदान आणि दुरुस्ती या चक्राचा भाग आहे. GPT-5.5 Codex अडखळले, पण त्या अडखळण्यामुळेच पुढची आवृत्ती अधिक सरळ चालण्यास शिकते.

पर्यायी लर्निंग कम्युनिटी: [