Kimi K3 तीन कठीण प्रॉम्प्ट्सवर—एक संभाव्यता (probability) समस्या, एक पुली-इनर्शिया (pulley-inertia) परिस्थिती आणि एक गुंतागुंतीची Python बॅकपॅक स्क्रिप्ट—अपयशी ठरली, तर GPT-5.6-SOL ने यशस्वीरीत्या पूर्ण केले. हा फरक दर्शवतो की जेव्हा तुम्हाला गणित, भौतिकशास्त्र आणि कोडमधील बहु-स्तरीय तर्क (multi-step reasoning) न थांबता पूर्ण करणारा मॉडेल हवा असतो, तेव्हा टोकन बजेटिंग आणि लॅटन्सी (latency) का महत्त्वाचे ठरतात.
हा बेंचमार्क का महत्त्वाचा आहे
डेव्हलपर्स आणि संशोधक अनेकदा केवळ हेडलाईन स्कोअरच्या आधारावर LLM निवडतात, वास्तविक जगातील दबावाखाली ते कसे वागते यावर नाही. या तुलनात्मक चाचणीत, प्रत्येक मॉडेलने अशा समस्या सोडवण्याचा प्रयत्न केला ज्यामध्ये तर्काची एक लांब साखळी आवश्यक होती. GPT-5.6-SOL ने तिन्ही क्षेत्रांमध्ये पूर्ण आणि अचूक उत्तरे दिली; तर Kimi K3 ने काहीही उपयुक्त उत्तर देण्यापूर्वीच आपले टोकन बजेट संपवले किंवा टाइमआउट झाले.
चाचणीची मांडणी
- Math – एक संभाव्यता प्रश्न ज्यामध्ये पॅटर्न-ओव्हरलॅप संभाव्यता आणि अपेक्षित मूल्य (expectation) व विचलन (variance - second moments) यांची गणना करणे आवश्यक होते.
- Physics – पुलीचा इनर्शिया (inertia) आणि स्प्रिंग-टेंशनयुक्त केबल सैल झाल्यावर होणारा ऊर्जेचा ऱ्हास यांचे मॉडेलिंग करणे.
- Programming – गुंतागुंतीच्या अवलंबित्व (dependencies) आणि टाई-ब्रेक नियमांसह बॅकपॅक-पॅकिंग समस्येसाठी Python सोल्यूशन लिहिणे आणि त्यानंतर सहा स्वतंत्र टेस्ट केसेसद्वारे आउटपुट तपासणे.
आकडेवारी काय सांगते
GPT-5.6-SOL
- Math – अपेक्षित मूल्य आणि विचलन स्पष्टपणे मांडून पूर्ण आणि अचूक सोल्यूशन दिले.
- Physics – इनर्शिया मॉडेल अचूकपणे तयार केले आणि ऊर्जेचा ऱ्हास विचारात घेऊन विश्लेषणात्मक उत्तराशी जुळणारे उत्तर दिले.
- Programming – असे कोड तयार केले जे कंपाईल झाले, चालले आणि सहाही बाह्य तपासण्यांमध्ये यशस्वी झाले. मात्र, एक अंतर्गत टेस्ट असर्शन (assertion) चुकीचे होते, जे आपल्याला आठवण करून देते की मॉडेलद्वारे तयार केलेले टेस्ट्स अचूकच असतील असे नाही.
Kimi K3
- Math – टोकन मर्यादा गाठली (प्रथम ६,५०० टोकन्सवर आणि नंतर १०,००० टोकन्सवर) आणि कोणतेही उत्तर न दाखवता थांबले.
- Physics – कोणतेही दृश्य आउटपुट येण्यापूर्वीच टोकन्स संपले.
- Programming – २४५ सेकंदांनंतर टाइमआउट झाले आणि मूल्यमापनासाठी काहीही उपलब्ध झाले नाही.
तार्किक कार्यक्षमता विरुद्ध कच्ची शक्ती
प्रोडक्शन पाईपलाईन्स तयार करणाऱ्यांसाठी याचा अर्थ स्पष्ट आहे: जो मॉडेल आउटपुट न देता टोकन्स खर्च करते, तो पुढील प्रक्रिया (downstream processes) थांबवू शकतो, खर्च वाढवू शकतो आणि वापरकर्त्यांना निराश करू शकतो.
विश्वासार्हता आणि "परफेक्ट" कोडचा छुपा खर्च
जिंकणाऱ्या मॉडेलकडूनही चूक झाली: GPT-5.6-SOL च्या स्वतः तयार केलेल्या टेस्ट केसमध्ये एक चुकीचे असर्शन होते. हे दर्शवते की मॉडेलद्वारे तयार केलेले व्हॅलिडेशन मानवी पुनरावलोकनासाठी (human review) पर्याय असू शकत नाही. जेव्हा मॉडेल कोड लिहिते, तेव्हा तुम्हाला तरीही स्वतंत्र तपासणी करणे आवश्यक असते.
पुढे काय पाहावे
- Finish reason tracking – प्रतिसाद टोकन मर्यादा, टाइमआउट किंवा नैसर्गिक थांबण्यामुळे संपला आहे का, याची नोंद ठेवा.
- Reasoning token count – प्रत्येक मॉडेल अंतर्गत विचार प्रक्रियेवर (internal deliberation) आणि अंतिम आउटपुटवर किती टोकन्स खर्च करते, याची तुलना करा.
- Latency monitoring – प्रत्येक टप्प्यासाठी लागणारा वेळ मोजा; जो मॉडेल प्रत्येक क्वेरीसाठी मिनिटे घेते, तो इंटरअॅक्टिव्ह ॲप्ससाठी अयोग्य ठरू शकतो.
डेव्हलपर्सनी या मेट्रिक्सना केवळ अंतिम उत्तर न मानता महत्त्वाचे संकेत (first-class signals) म्हणून हाताळले पाहिजे.
निष्कर्ष
पूर्णतेच्या बाबतीत GPT-5.6-SOL हे Kimi K3 पेक्षा सरस आहे. ही चाचणी आपल्याला हे देखील आठवण करून देते की, जे मॉडेल "बरोबर उत्तर देते" ते देखील दोषपूर्ण अंतर्गत तपासणी करू शकते, त्यामुळे मानवी देखरेख (human oversight) आवश्यकच आहे. 'फिनिश रिझन्स', टोकन वापर आणि लॅटन्सीचा मागोवा घेतल्यास, कोणत्याही 'सायलेंट टाइमआउट'मध्ये न अडकता तुम्हाला कामासाठी योग्य साधन निवडण्यास मदत होईल.
