एक शोध टीम ने यह तय करने के लिए एक राउटर बनाया कि क्या एक सस्ता लैंग्वेज मॉडल कोडिंग अनुरोध को संभाल सकता है, जिसका उद्देश्य इन्फरेंस लागत (inference costs) को कम करना था, लेकिन राउटर "नेवर-एस्केलेट" (never-escalate) बेसलाइन को नहीं हरा सका। यह विफलता दर्शाती है कि क्यों सटीकता-केंद्रित मेट्रिक्स कैस्केड्स को गुमराह करते हैं और उन संकेतों की ओर इशारा करती है जो वास्तव में कठिनाई को पकड़ते हैं।

राउटर क्यों महत्वपूर्ण था

मॉडल कैस्केड्स प्रत्येक अनुरोध को उस सबसे छोटे मॉडल के पास भेजते हैं जो उसका सही उत्तर दे सके। यदि राउटर एक सरल प्रॉम्प्ट को सस्ते मॉडल पर भेजता है, तो सिस्टम बड़े मॉडल के लिए आवश्यक महंगे कंप्यूट (compute) को छोड़ देता है। टीम ने 539 वास्तविक कोडिंग कार्यों—428 आसान और 111 कठिन—पर एक राउटर को प्रशिक्षित किया, यह उम्मीद करते हुए कि यह सीख जाएगा कि कब सस्ता मॉडल पर्याप्त होगा।

वे आंकड़े जो कम रहे

  • होल्ड-आउट AUC (ROC कर्व के नीचे का क्षेत्र): 0.594
  • 5-फोल्ड क्रॉस-वैलिडेशन रेंज: 0.55 – 0.57
  • सर्वश्रेष्ठ थ्रेशोल्ड: "नेवर-एस्केलेट" नीति से मेल खाता है

होल्ड-आउट AUC 0.594 था और क्रॉस-वैलिडेशन 0.55 से 0.57 के बीच था, जिसका अर्थ है कि क्लासिफायर मुश्किल से आसान और कठिन मामलों के बीच अंतर कर पाता है। जब इष्टतम थ्रेशोल्ड (optimal threshold) एक ऐसी नीति को दोहराता है जो कभी भी महंगे मॉडल का उपयोग नहीं करती है, तो राउटर कोई मूल्य नहीं जोड़ता है। यह निर्णय लेने वाले के बजाय एक निरंतर प्रेडिक्टर (constant predictor) की तरह व्यवहार करता है।

प्रयोगों ने क्या परीक्षण किया

शोधकर्ताओं ने तीन फीचर सेटों की तुलना की:

फीचर सेट AUC
11 सरल सरफेस फीचर्स (जैसे, टोकन काउंट, कीवर्ड की उपस्थिति) 0.610
1024-आयामी प्रॉम्प्ट एम्बेडिंग (सिमेंटिक वेक्टर) 0.552
दोनों का संयोजन 0.609

आश्चर्यजनक रूप से, हल्के सरफेस फीचर्स ने उच्च-आयामी सिमेंटिक एम्बेडिंग से बेहतर प्रदर्शन किया। एम्बेडिंग ने प्रॉम्प्ट के विषय को तो पकड़ा लेकिन उसकी आंतरिक कठिनाई को नहीं। सस्ते मॉडल के ड्राफ्ट को राउटर में डालने से AUC बढ़कर 0.640 हो गया, जो बताता है कि जनरेशन के दौरान दिखने वाले संकेत केवल प्रॉम्प्ट में मौजूद संकेतों की तुलना में अधिक जानकारीपूर्ण होते हैं।

दो मौलिक कमियां

1. सटीकता गलत पैमाना है

एक राउटर को केवल सटीकता का अनुमान नहीं लगाना चाहिए, बल्कि एक सरल नीति (naïve policy) की तुलना में लागत-सटीकता ट्रेड-ऑफ (cost-accuracy trade-off) में सुधार करना चाहिए। यदि यह "नेवर-एस्केलेट" से बेहतर प्रदर्शन नहीं कर सकता है, तो कच्ची सटीकता (raw accuracy) चाहे जो भी हो, यह कोई लागत लाभ नहीं देता है। AUC जैसे पारंपरिक मेट्रिक्स कैस्केड के आर्थिक आयाम की अनदेखी करते हैं।

2. "ऑलवेज एस्केलेट" (Always escalate) सीमा नहीं है

प्रयोग में यह मान लिया गया था कि महंगा मॉडल अचूक है, और "हमेशा बड़े मॉडल का उपयोग करें" को ऊपरी सीमा माना गया। वास्तव में, बड़ा मॉडल कभी-कभी उन उत्तरों को बिगाड़ देता था जिन्हें सस्ता मॉडल सही ढंग से दे देता था। एक आदर्श राउटर जो जानता है कि कब सस्ते मॉडल के साथ बने रहना है, वह चुने गए लागत मेट्रिक में "ऑलवेज एस्केलेट" बेसलाइन को लगभग 4.2 अंक से हरा सकता है। यह अंतर दर्शाता है कि महंगे मॉडल की प्रदर्शन सीमा अनुमान से कम है।

बेहतर रूटिंग संकेत डिजाइन करना

निष्कर्ष तीन व्यावहारिक दिशाओं का सुझाव देते हैं:

  • जनरेशन-टाइम संकेतों को शामिल करें। सस्ते मॉडल के मध्यवर्ती आउटपुट (इसके ड्राफ्ट) को राउटर में डालने से उस कठिनाई का पता चलता है जिसे केवल प्रॉम्प्ट छिपा देता है।
  • कार्य-विशिष्ट सरफेस फीचर्स को प्राथमिकता दें। सरल मेट्रिक्स—जैसे लंबाई, कुछ ऑपरेटरों की उपस्थिति, या कोड-स्टाइल मार्कर—सामान्य सिमेंटिक एम्बेडिंग की तुलना में अधिक सटीक हो सकते हैं।
  • लागत-जागरूक मेट्रिक्स के साथ सफलता को मापें। शुद्ध सटीकता या AUC के बजाय, इस बात का मूल्यांकन करें कि लक्षित गुणवत्ता स्तरों को बनाए रखते हुए कितने महंगे कॉल्स (calls) से बचा जा सका है।

निष्कर्ष (Takeaway): एक राउटर जो केवल सटीकता के लिए अनुकूलित (optimize) करता है, वह लागत बचत की गारंटी नहीं दे सकता; प्रभावी रूटिंग के लिए जनरेशन-टाइम साक्ष्य और लागत-जागरूक मूल्यांकन की आवश्यकता होती है।