एका स्वतंत्र संशोधकाने त्याच्या LLM-चालित संशोधन एजंटने (LLM-driven research agent) वापरलेले प्रत्येक टोकन एका महिन्यासाठी नोंदवले आणि बिलामध्ये ३१% बचत केली. खर्च $९४५ वरून $६५१ वर आला, तर यशाचा दर ९१% वरून ९३% पर्यंत वाढला; खर्च-संवेदनशील AI वर्कफ्लो चालवणाऱ्या कोणालाही हे निकाल नक्कीच महत्त्वाचे वाटतील.
टोकन-स्तरीय डेटा का महत्त्वाचा होता
बहुतेक LLM वापरकर्ते फक्त अंतिम बीजक (invoice) पाहतात – एक एकत्रित रक्कम जी प्रत्येक उप-कार्याचा (sub-task) खर्च लपवून ठेवते. संशोधकाच्या एजंटने तीन मुख्य कृती केल्या: SEC फायलिंग्ज शोधणे, अहवाल तयार करणे (drafting reports) आणि संशोधन संश्लेषण (research syntheses) एकत्र करणे. तपशीलवार डेटाशिवाय, जूनमध्ये त्याने भरलेले $३१२ योग्य खर्च झाले होते की नाही, हे त्याला सांगता आले नाही.
लपलेला खर्च (hidden leakage) शोधण्यासाठी, त्याने एक PostgreSQL लॉगिंग लेयर जोडला ज्याने मॉडेलचे नाव, टोकन संख्या, टास्कचा प्रकार आणि प्रति-कॉल खर्च (per-call cost) नोंदवला. ३० दिवसांनंतर, त्या डेटाने एक स्पष्ट चित्र मांडले:
- SEC फायलिंग शोध – एकूण खर्चाचा ४१%
- अहवाल तयार करणे – २८%
- संशोधन संश्लेषण – १७%
- गुणवत्ता तपासणी – ९%
- इतर – ५%
आकडेवारीवरून असे दिसून आले की सर्वात महागडी पायरी स्वतः मॉडेल नव्हती, तर एजंटने शोध निकालांना (raw search results) प्रॉम्प्टमध्ये (prompts) कशा प्रकारे फीड केले होते, हे होते.
बचत घडवून आणणारे तीन बदल
१. प्रॉम्प्ट देण्यापूर्वी सारांश तयार करा (Summarize before you prompt)
सुरुवातीला, एजंट प्रत्येक प्रॉम्प्टमध्ये २० कच्चे शोध निकाल भरत असे, ज्यामुळे इनपुटमधील टोकन्सची संख्या मोठ्या प्रमाणात वाढत असे. त्याने प्रथम एक स्वस्त सारांशकर्ता (summarizer) समाविष्ट केला, ज्यामुळे इनपुटमध्ये मोठी कपात झाली. प्रति-शोध टास्कचा खर्च $०.८४ वरून $०.१९ वर आला – म्हणजेच ७७% कपात झाली.
२. साध्या तपासण्यांसाठी स्वस्त मॉडेलचा वापर करा
गुणवत्ता तपासणी (Quality checks) एका उच्च-स्तरीय मॉडेलवर चालवली जात होती, ज्याचा खर्च प्रति तपासणी $०.०९ होता. त्याने बहुतेक पास/फेल तपासणीसाठी कमी किमतीचे मॉडेल वापरले, ज्यामुळे प्रति-तपासणी किंमत $०.०१ पर्यंत कमी झाली. स्वस्त मॉडेलने ८९% वेळा अचूक उत्तरे दिली; कोणतीही त्रुटी आढळल्यास ती मूळ मॉडेलकडे पाठवली जाई (escalated), ज्यामुळे अचूकता कायम ठेवत खर्च ८७% ने कमी झाला.
३. आत्मविश्वास जास्त असल्यास तपासणी वगळा
जेव्हा टास्कचा ऐतिहासिक यशाचा दर (historical success rate) जास्त होता आणि आउटपुटची लांबी अपेक्षित मर्यादेत होती, तेव्हा गुणवत्ता-तपासणीचा टप्पा वगळण्यासाठी त्याने एक नियम जोडला. यामुळे अंदाजे ६०% तपासण्या रद्द झाल्या ज्या अन्यथा केल्या असत्या.
फळ (The payoff)
हे तीन बदल लागू केल्यानंतर, मासिक हिशोब असा दिसला:
- एकूण खर्च: $९४५ → $६५१ (३१% कपात)
- प्रति टास्क SEC शोध खर्च: $०.८४ → $०.१९ (७७% कपात)
- प्रति टास्क गुणवत्ता-तपासणी खर्च: $०.०९ → $०.०१ (८७% कपात)
- एकूण यशाचा दर: ९१% → ९३%
यशाचा उच्च दर असे सूचित करतो की लहान प्रॉम्प्ट्समुळे गोंधळ (noise) कमी झाला आणि मॉडेलला मुख्य प्रश्नावर लक्ष केंद्रित करण्यास मदत झाली.
मर्यादा आणि प्रतिवाद (Caveats and counter-points)
हा दृष्टिकोन दोन गृहितकांवर अवलंबून आहे. पहिले म्हणजे, स्वस्त सारांशकर्त्याने पुढील तर्कणासाठी (downstream reasoning) पुरेशी माहिती राखून ठेवणे आवश्यक आहे; जर त्याने महत्त्वपूर्ण तपशील वगळले, तर आउटपुटची गुणवत्ता खालावू शकते. दुसरे म्हणजे, गुणवत्ता तपासणीसाठी वापरलेले कमी-किमतीचे मॉडेल परिपूर्ण नाही; त्याच्या ८९% अचूकतेचा अर्थ असा आहे की त्रुटींचा एक छोटा भाग अजूनही अंतिम उत्पादनापर्यंत पोहोचतो, जरी एस्केलेशन पाथ (escalation path) त्यातील बहुतेक त्रुटी पकडतो. कडक अनुपालन (compliance) गरजा असलेल्या वापरकर्त्यांना अधिक कडक मर्यादा किंवा अतिरिक्त पडताळणी पायऱ्यांची आवश्यकता भासू शकते.
LLM व्यावसायिकांसाठी याचा अर्थ काय?
- तपशीलवार डॅशबोर्ड फायदेशीर ठरतात. उच्च-स्तरीय खर्च अहवाल टोकनचा अपव्यय लपवतात. प्रत्येक टास्कनुसार वापर नोंदवल्यामुळे अशा अकार्यक्षमता समोर येतात ज्या अन्यथा लपलेल्या राहिल्या असत्या.
- नेहमीच प्रगत (Frontier) मॉडेल्सची गरज नसते. एकूण गुणवत्ता धोक्यात न आणता स्वस्त मॉडेल डेटा कॉम्प्रेस करू शकते किंवा साधे बायनरी निर्णय घेऊ शकते.
LLM एजंटचा लपलेला खर्च म्हणजे अनेकदा त्याचे मोजले न गेलेले काम असते. टोकन प्रवाह (token flow) मोजून आणि लक्ष्यित ऑप्टिमायझेशन (targeted optimizations) लागू करून, संशोधकाने $९४५ च्या मासिक बिलाचे रूपांतर $६५१ च्या कार्यक्षम ऑपरेशनमध्ये केले आणि कामगिरीही वाढवली. AI वर्कलोडचे बजेट तयार करणाऱ्या कोणासाठीही धडा स्पष्ट आहे: प्रत्येक टोकन मोजा, आणि मग डेटाच्या आधारे कुठे कपात करायची ते ठरवा.
