एका सिंगल RTX 5090 वर स्थानिकरित्या (locally) चालवलेल्या पाच LLM एजंट्सच्या बेंचमार्कवरून असे दिसून येते की, ३५-बिलियन-पॅरामीटर असलेल्या mixture-of-experts (MoE) मॉडेलने वास्तविक कोडिंग टास्कमध्ये आपल्या इतर प्रतिस्पर्ध्यांना मागे टाकले. कोणत्याही क्लाउड API शिवाय, अस्तित्वात असलेल्या ॲडमिन पॅनेलमध्ये Tag Manager जोडण्याच्या या चाचणीत Qwen 3.6 35B-A3B स्पष्ट विजेता ठरले.

ही चाचणी का महत्त्वाची आहे

वैयक्तिक हार्डवेअरवर लार्ज लँग्वेज मॉडेल्स (LLMs) चालवल्यामुळे डेव्हलपर्सना API शुल्क आणि डेटा-प्रायव्हसीच्या चिंतांपासून सुटका मिळते. तरीही, “local agents” हा शब्द अजूनही केवळ एक “buzzword” आहे: ते खरोखरच फाईल्स एडिट करू शकतात का, कमांड-लाइन टूल्स वापरू शकतात का आणि मानवी हस्तक्षेपाशिवाय प्रोडक्शन-रेडी कोड तयार करू शकतात का? क्लाउड सेवांचा वापर न करता केलेली ही प्रत्यक्ष तुलना, तंत्रज्ञान सध्या नेमके कुठे आहे याची डेव्हलपर्सना ठोस कल्पना देते.

हार्डवेअर आणि टास्क

पाचही मॉडेल्स एकाच वर्कस्टेशनवर चालवण्यात आली: एक RTX 5090 GPU, जे एक सामान्य हाय-एंड कन्झ्युमर कार्ड आहे, आणि कोणतीही बाह्य सेवा वापरली गेली नाही. टास्क हेतुपुरस्सर सोपा पण वास्तववादी होता – आधीच तयार असलेल्या ॲडमिन सेक्शनमध्ये Tag Manager घटक जोडणे. यशस्वी होण्यासाठी मॉडेलला योग्य सोर्स फाईल्स शोधणे, त्यामध्ये बदल करणे आणि नवीन फीचरमुळे अस्तित्वात असलेल्या कार्यक्षमतेवर कोणताही परिणाम होणार नाही याची खात्री करणे आवश्यक होते.

मॉडेलची कामगिरी

  • Qwen 3.6 35B-A3B (MoE) – हे काम स्वायत्तपणे (autonomously) पूर्ण केले, विचारले नसलेले पण उपयुक्त सुधारणा देखील जोडले आणि रन झाल्यानंतर कोणत्याही पॅचेसची (patches) गरज पडली नाही.
  • Qwen 3.6 27B (dense) – टास्क पूर्ण केला, परंतु यासाठी साधारण दुप्पट इंटरॅक्शन स्टेप्स लागल्या आणि अधूनमधून सूचनांचा चुकीचा अर्थ लावला.
  • GLM-4.7-Flash (dense) – कार्यरत अंमलबजावणी (implementation) केली, परंतु चुकीचे फाईल-मॅचिंग पॅटर्न वापरले आणि सुरक्षा तपासणी (security checks) वगळली, ज्यामुळे कोड असुरक्षित राहिला.
  • Qwythos-9B – कोणतेही वास्तविक टूल्स वापरू शकले नाही; हे अपयश मॉडेलमुळे किंवा स्थानिक सेटअपमुळे असू शकते, परंतु चाचणीमध्ये याचे नेमके कारण शोधता आले नाही.
  • Nemotron-3-Nano (hybrid) – एका लूपमध्ये अडकून पडले, आधीच शोधलेल्या फोल्डरचा शोध घेण्यासाठी ४० फेऱ्या (turns) घालवली आणि त्यापुढे प्रगती करू शकले नाही.

निकालातून काय समजते

आर्किटेक्चर हा एक विश्वसनीय अंदाज वर्तवणारा घटक नाही

MoE मॉडेल, जे त्याचे पॅरामीटर्स अनेक 'एक्स्पर्ट सब-नेटवर्क्स'मध्ये विभागते, ते स्पष्टपणे विजयी ठरले, तर dense आणि hybrid प्रकारांमध्ये यश आणि पूर्ण अपयश असे मिश्रित निकाल मिळाले. यावरून असे सुचते की केवळ आर्किटेक्चरल निवडीमुळे टूल-वापरण्यातील क्षमता (tool-use competence) सुनिश्चित होत नाही.

टूलचा वापर करणे हा अजूनही एक मोठा अडथळा आहे

पाचही एजंट्सपैकी कोणीही चाचणीसाठी दिलेल्या समर्पित स्क्रीनशॉट टूलचा वापर केला नाही. सर्वांनी फाईलची नावे ओळखून किंवा अप्रत्यक्ष मार्ग शोधून काम करण्याचा प्रयत्न केला. "कोड तयार करू शकतो" आणि "बाह्य युटिलिटीजचे नियोजन (orchestrate) करू शकतो" यामधील अंतर अजूनही मोठे आहे.

स्थानिकरित्या चालवणे म्हणजे केवळ मॉडेल नाही, तर संपूर्ण स्टॅक डीबग करणे होय

चाचणी सुरू होण्यापूर्वीच दोन मॉडेल्सच्या प्रॉम्प्ट टेम्पलेट्समध्ये तात्काळ सुधारणा (on-the-fly patches) करणे आवश्यक होते. मॉडेल-विशिष्ट बग्स सुधारण्यात खर्च झालेला वेळ हा प्रत्यक्ष Tag Manager कोड लिहिण्यापेक्षा जास्त होता, यावरून सध्याची स्थानिक deployments किती नाजूक आहेत हे दिसून येते.

एक सावधगिरीची सूचना

हा बेंचमार्क एका विशिष्ट हार्डवेअर कॉन्फिगरेशन, एका कोडिंग परिस्थिती आणि मॉडेल्सच्या एका लहान संचावर आधारित आहे. Qwen 3.6 35B-A3B या मॉडेलने यापूर्वीच्या एका राउंडमध्ये अपयश दाखवले होते; त्याचे ते अपयश केवळ एक योगायोग होता. त्यामुळे हे निकाल केवळ निदर्शक (indicative) आहेत, अंतिम (definitive) नाहीत.

पुढे काय पाहावे

भविष्यातील राउंड्समध्ये टास्क सेट विस्तारणे, अधिक वैविध्यपूर्ण टूलचेन समाविष्ट करणे आणि विविध प्रकारच्या हार्डवेअरवर चाचणी घेणे आवश्यक असेल. MoE मॉडेल्स सातत्याने dense आणि hybrid डिझाइन्सपेक्षा सरस कामगिरी करतात का, आणि डेव्हलपर्स मॅन्युअल बग-पॅचिंगची गरज काढून टाकणारे विश्वसनीय 'रॅपर्स' (wrappers) तयार करू शकतात का, याकडे लक्ष देणे गरजेचे आहे.

थोडक्यात सांगायचे तर: ३५B MoE मॉडेल आधीच एका सक्षम स्थानिक कोडिंग असिस्टंटप्रमाणे काम करू शकते, परंतु व्यापक इकोसिस्टम—टूल इंटिग्रेशन, प्रॉम्प्ट इंजिनिअरिंग आणि स्टेबल रनटाइम्स—अजूनही मागे आहे. जोपर्यंत हे सर्व घटक एकमेकांशी जुळत नाहीत, तोपर्यंत डेव्हलपर्सनी “plug-and-play” स्थानिक एजंट्सबद्दलच्या अपेक्षा मर्यादित ठेवाव्यात.