એક સ્વતંત્ર સંશોધકે એક મહિના સુધી તેના LLM-સંચાલિત રિસર્ચ એજન્ટ દ્વારા વપરાયેલા દરેક ટોકનનો ડેટા નોંધ્યો અને તેના બિલમાં 31% નો ઘટાડો કર્યો. ખર્ચ $945 થી ઘટીને $651 થયો, જ્યારે સફળતાનો દર 91% થી વધીને 93% થયો, જે ખર્ચ-સંવેદનશીલ AI વર્કફ્લો ચલાવનાર કોઈપણ વ્યક્તિ માટે નોંધપાત્ર પરિણામ છે.
ટોકન-સ્તરનો ડેટા શા માટે મહત્વનો હતો
મોટાભાગના LLM વપરાશકર્તાઓ ફક્ત અંતિમ ઇન્વોઇસ જુએ છે – એક એવી એકીકૃત રકમ જે દરેક પેટા-કાર્યના ખર્ચને છુપાવે છે. સંશોધકના એજન્ટે ત્રણ મુખ્ય કાર્યો કર્યા હતા: SEC ફાઇલિંગ્સ શોધવા, રિપોર્ટ્સ ડ્રાફ્ટ કરવા અને રિસર્ચ સંશ્લેષણને એકસાથે જોડવા. વિગતવાર ડેટા વિના, તે જાણી શકતા નહોતા કે જૂનમાં તેમણે ચૂકવેલા $312 યોગ્ય રીતે વપરાયા હતા કે નહીં.
છુપાયેલું નુકસાન (leakage) શોધવા માટે, તેમણે એક PostgreSQL લોગિંગ લેયર ઉમેર્યું જે મોડેલનું નામ, ટોકન ગણતરી, કાર્યનો પ્રકાર અને પ્રતિ-કોલ ખર્ચને કેપ્ચર કરતું હતું. 30 દિવસ પછી, ડેટાએ એક સ્પષ્ટ ચિત્ર રજૂ કર્યું:
- SEC ફાઇલિંગ સર્ચ – કુલ ખર્ચના 41%
- રિપોર્ટ ડ્રાફ્ટિંગ – 28%
- રિસર્ચ સંશ્લેષણ – 17%
- ક્વોલિટી ચેક્સ – 9%
- અન્ય – 5%
આ આંકડાઓએ દર્શાવ્યું કે સૌથી મોંઘો તબક્કો મોડેલ પોતે નહોતો, પરંતુ એજન્ટ કેવી રીતે કાચા સર્ચ પરિણામોને પ્રોમ્પ્ટ્સમાં ફીડ કરતો હતો તે હતો.
બચત લાવનારા ત્રણ સુધારા
1. પ્રોમ્પ્ટ આપતા પહેલા સારાંશ તૈયાર કરો
શરૂઆતમાં, એજન્ટ દરેક પ્રોમ્પ્ટમાં 20 કાચા સર્ચ પરિણામો ભરી દેતો હતો, જેનાથી ઇનપુટમાં મોટી સંખ્યામાં ટોકન્સ ઉમેરાતા હતા. તેમણે પહેલા એક સસ્તું સમરાઇઝર (summarizer) ઉમેર્યું, જેનાથી ઇનપુટમાં મોટો ઘટાડો થયો. સર્ચ કાર્ય દીઠ ખર્ચ $0.84 થી ઘટીને $0.19 થયો – જે 77% નો ઘટાડો છે.
2. સાદા ચેક્સને સસ્તા મોડેલ પર મોકલો
ક્વોલિટી ચેક્સ એક હાઇ-એન્ડ મોડેલ પર ચાલતા હતા જેનો ખર્ચ પ્રતિ ચેક $0.09 હતો. તેમણે મોટાભાગના પાસ/ફેલ ચેક્સ માટે ઓછા ભાવવાળા મોડેલનો ઉપયોગ કર્યો, જેનાથી પ્રતિ ચેક કિંમત ઘટીને $0.01 થઈ ગઈ. સસ્તું મોડેલ 89% વખત સાચો જવાબ આપતું હતું; કોઈપણ નિષ્ફળતાના કિસ્સામાં તેને મૂળ મોડેલ પર મોકલવામાં આવતું (escalate), જેનાથી ચોકસાઈ જળવાઈ રહી અને ખર્ચમાં 87% નો ઘટાડો થયો.
3. જ્યારે વિશ્વાસ (confidence) વધારે હોય ત્યારે ચેક્સ સ્કીપ કરો
તેમણે એક નિયમ ઉમેર્યો કે જ્યારે પણ કાર્યનો ઐતિહાસિક સફળતા દર ઊંચો હોય અને આઉટપુટની લંબાઈ અપેક્ષિત મર્યાદામાં હોય, ત્યારે ક્વોલિટી-ચેક સ્ટેપને બાયપાસ કરો. આનાથી લગભગ 60% ચેક્સ દૂર થઈ ગયા જે અન્યથા ચલાવવા પડત.
પરિણામ
આ ત્રણ ફેરફારો અમલમાં આવ્યા પછી, માસિક હિસાબ કંઈક આવો દેખાતો હતો:
- કુલ ખર્ચ: $945 → $651 (31% ઘટાડો)
- પ્રતિ કાર્ય SEC સર્ચ ખર્ચ: $0.84 → $0.19 (77% ઘટાડો)
- પ્રતિ કાર્ય ક્વોલિટી-ચેક ખર્ચ: $0.09 → $0.01 (87% ઘટાડો)
- કુલ સફળતાનો દર: 91% → 93%
વધારે સફળતાનો દર સૂચવે છે કે ટૂંકા પ્રોમ્પ્ટ્સથી ઘોંઘાટ (noise) ઘટ્યો અને મોડેલને મુખ્ય પ્રશ્ન પર ધ્યાન કેન્દ્રિત કરવામાં મદદ મળી.
સાવચેતીઓ અને વિરોધાભાસી મુદ્દાઓ
આ અભિગમ બે ધારણાઓ પર આધારિત છે. પ્રથમ, સસ્તા સમરાઇઝરે આગળના તર્ક (downstream reasoning) માટે પૂરતી માહિતી જાળવી રાખવી જોઈએ; જો તે મહત્વપૂર્ણ વિગતો કાઢી નાખે, તો આઉટપુટની ગુણવત્તા બગડી શકે છે. બીજું, ક્વોલિટી ચેક્સ માટે વપરાતું ઓછા ખર્ચનું મોડેલ સંપૂર્ણ નથી; તેની 89% ચોકસાઈનો અર્થ એ છે કે ભૂલોનો એક નાનો હિસ્સો હજુ પણ અંતિમ ઉત્પાદન સુધી પહોંચે છે, જોકે એસ્કેલેશન પાથ મોટાભાગની ભૂલોને પકડી લે છે. કડક પાલન (compliance) જરૂરિયાતો ધરાવતા વપરાશકર્તાઓને વધુ કડક મર્યાદાઓ અથવા વધારાના વેરિફિકેશન સ્ટેપ્સની જરૂર પડી શકે છે.
LLM પ્રેક્ટિશનર્સ માટે આનો અર્થ શું છે
- વિગતવાર ડેશબોર્ડ્સ જીતે છે. ઉચ્ચ-સ્તરના ખર્ચના રિપોર્ટ્સ ટોકનનો બગાડ છુપાવે છે. દરેક કાર્ય દીઠ વપરાશની નોંધ રાખવાથી એવી બિનકાર્યક્ષમતાઓ બહાર આવે છે જે અન્યથા છુપાયેલી રહેત.
- ફ્રન્ટિયર મોડેલ્સ હંમેશા જરૂરી નથી હોતા. એક સસ્તું મોડેલ એકંદર ગુણવત્તા સાથે સમાધાન કર્યા વિના ડેટાને સંકુચિત કરી શકે છે અથવા સાદા બાઈનરી નિર્ણયો લઈ શકે છે.
LLM એજન્ટનો છુપાયેલ ખર્ચ ઘણીવાર તેના દ્વારા કરવામાં આવતું અણમાપેલું કામ હોય છે. ટોકન ફ્લોનું માપન કરીને અને લક્ષિત ઓપ્ટિમાઇઝેશન લાગુ કરીને, સંશોધકે $945 ના માસિક બિલને $651 ના વધુ કાર્યક્ષમ ઓપરેશનમાં બદલી નાખ્યું અને સાથે સાથે કામગીરીમાં પણ સુધારો કર્યો. AI વર્કલોડનું બજેટ બનાવનાર કોઈપણ વ્યક્તિ માટે બોધપાઠ સ્પષ્ટ છે: દરેક ટોકનનું માપન કરો, પછી ડેટાને નક્કી કરવા દો કે ક્યાં કાપ મૂકવો.
