एका संशोधन पथकाने कोडिंग विनंती स्वस्त लँग्वेज मॉडेल हाताळू शकेल की नाही हे ठरवण्यासाठी एक राउटर तयार केला, ज्याचा उद्देश इन्फरन्स खर्च (inference costs) कमी करणे हा होता, परंतु हा राउटर "नेव्हर-एस्केलेट" (never-escalate) बेसलाईनला मागे लावू शकला नाही. हा अपयश दर्शवतो की अचूकतेवर आधारित मेट्रिक्स (accuracy-centric metrics) मॉडेल कॅस्केड्सना (cascades) कसे दिशाभूल करतात आणि कठीणता खऱ्या अर्थाने मोजणारे संकेत (signals) कोणते आहेत.

राउटर का महत्त्वाचा होता

मॉडेल कॅस्केड्स प्रत्येक विनंती अशा सर्वात लहान मॉडेलकडे पाठवतात जे ती अचूकपणे उत्तर देऊ शकेल. जर राउटरने साध्या प्रॉम्प्टसाठी स्वस्त मॉडेल निवडले, तर सिस्टम मोठ्या मॉडेलसाठी लागणारी महागडी कम्प्युटिंग प्रक्रिया टाळते. या पथकाने ५३९ वास्तविक कोडिंग टास्कवर—४२८ सोपे आणि १११ कठीण—राउटरला प्रशिक्षित केले, जेणेकरून स्वस्त मॉडेल कधी पुरेसे ठरेल हे त्याला समजेल अशी अपेक्षा होती.

अपयशी ठरलेले आकडे

  • होल्ड-आउट AUC (area under the ROC curve): ०.५९४
  • ५-फोल्ड क्रॉस-व्हॅलिडेशन रेंज: ०.५५ – ०.५७
  • सर्वोत्तम थ्रेशोल्ड: "नेव्हर-एस्केलेट" धोरणाशी जुळते

होल्ड-आउट AUC ०.५९४ होता आणि क्रॉस-व्हॅलिडेशनची रेंज ०.५५ ते ०.५७ दरम्यान होती, याचा अर्थ असा की क्लासिफायर सोप्या आणि कठीण प्रकरणांमध्ये फारसा फरक करू शकत नाही. जेव्हा ऑप्टिमल थ्रेशोल्ड असे धोरण अवलंबते ज्यात महागड्या मॉडेलचा वापर कधीच केला जात नाही, तेव्हा राउटरचे कोणतेही मूल्य राहत नाही. तो निर्णय घेण्याऐवजी एका स्थिर प्रेडिक्टरप्रमाणे (constant predictor) वागतो.

प्रयोगांमध्ये काय तपासले गेले

संशोधकांनी तीन फीचर सेट्सची तुलना केली:

फीचर सेट AUC
११ साधे सरफेस फीचर्स (उदा. टोकन काउंट, कीवर्डची उपस्थिती) ०.६१०
१०२४-डायमेंशनल प्रॉम्प्ट एम्बेडिंग (सिमँटिक वेक्टर) ०.५५२
दोन्ही एकत्रित ०.६०९

आश्चर्याची गोष्ट म्हणजे, हलक्या वजनाच्या सरफेस फीचर्सनी हाय-डायमेंशनल सिमँटिक एम्बेडिंगपेक्षा चांगली कामगिरी केली. एम्बेडिंगने प्रॉम्प्टचा विषय पकडला पण त्याची मूळ कठीणता नाही. स्वस्त मॉडेलचा ड्राफ्ट राउटरला दिल्याने AUC ०.६४० पर्यंत वाढला, ज्यावरून असे सूचित होते की जनरेशन दरम्यान मिळणारे संकेत केवळ प्रॉम्प्टमध्ये असलेल्या संकेतांपेक्षा अधिक माहितीपूर्ण असतात.

दोन मूलभूत चुका

१. अचूकता हे चुकीचे मोजमाप आहे

राउटरने केवळ अचूकतेचा अंदाज न लावता, एका साध्या धोरणाच्या तुलनेत 'कॉस्ट-अॅक्युरसी ट्रेड-ऑफ' (cost-accuracy trade-off) सुधारणे आवश्यक आहे. जर तो "नेव्हर-एस्केलेट" पेक्षा चांगली कामगिरी करू शकत नसेल, तर कच्च्या अचूकतेचा (raw accuracy) विचार केला तरी तो कोणताही आर्थिक फायदा देत नाही. AUC सारखी पारंपारिक मेट्रिक्स कॅस्केडमधील आर्थिक पैलूंकडे दुर्लक्ष करतात.

२. "ऑलवेज-एस्केलेट" ही मर्यादा नाही

या प्रयोगात महागडे मॉडेल अचूक आहे असे गृहीत धरले होते आणि "नेहमी मोठ्या मॉडेलचा वापर करा" याला वरची मर्यादा मानले होते. प्रत्यक्षात, मोठ्या मॉडेलने कधीकधी अशी उत्तरे बिघडवली जी स्वस्त मॉडेलने अचूक दिली होती. जेव्हा स्वस्त मॉडेलसोबत कधी थांबायचे हे माहित असलेले एक परिपूर्ण राउटर असेल, तेव्हा ते निवडलेल्या कॉस्ट मेट्रिकमध्ये "ऑलवेज-एस्केलेट" बेसलाईनला सुमारे ४.२ पॉइंट्सनी मागे टाकू शकते. ही तफावत दर्शवते की महागड्या मॉडेलची कामगिरीची मर्यादा गृहीत धरल्यापेक्षा कमी आहे.

अधिक चांगले राउटिंग सिग्नल्स डिझाइन करणे

निष्कर्ष तीन व्यावहारिक दिशा सुचवतात:

  • जनरेशन-टाइम संकेत समाविष्ट करा. स्वस्त मॉडेलचे मध्यवर्ती आउटपुट (त्याचा ड्राफ्ट) राउटरला दिल्याने अशी कठीणता समजते जी केवळ प्रॉम्प्टमध्ये दिसत नाही.
  • टास्क-विशिष्ट सरफेस फीचर्सना प्राधान्य द्या. लांबी, विशिष्ट ऑपरेटर्सची उपस्थिती किंवा कोड-स्टाईल मार्कर्स यांसारखी साधी मेट्रिक्स सामान्य सिमँटिक एम्बेडिंगपेक्षा अधिक अचूक अंदाज देऊ शकतात.
  • कॉस्ट-अवेअर मेट्रिक्ससह यश मोजा. केवळ अचूकता किंवा AUC ऐवजी, लक्ष्यित गुणवत्ता पातळी राखत असताना किती महागड्या कॉल्स टाळले गेले याचे मूल्यांकन करा.

निष्कर्ष: जो राउटर केवळ अचूकतेसाठी ऑप्टिमाइझ करतो तो खर्चात बचत करण्याची खात्री देऊ शकत नाही; प्रभावी राउटिंगसाठी जनरेशन-टाइम पुरावे आणि कॉस्ट-अवेअर मूल्यांकनाची आवश्यकता असते.