એક સ્વતંત્ર સંશોધકે એક મહિના સુધી તેના LLM-સંચાલિત રિસર્ચ એજન્ટ દ્વારા વપરાયેલા દરેક ટોકનનો ડેટા નોંધ્યો અને તેના બિલમાં 31% નો ઘટાડો કર્યો. ખર્ચ $945 થી ઘટીને $651 થયો, જ્યારે સફળતાનો દર 91% થી વધીને 93% થયો, જે ખર્ચ-સંવેદનશીલ AI વર્કફ્લો ચલાવનાર કોઈપણ વ્યક્તિ માટે નોંધપાત્ર પરિણામ છે.

ટોકન-સ્તરનો ડેટા શા માટે મહત્વનો હતો

મોટાભાગના LLM વપરાશકર્તાઓ ફક્ત અંતિમ ઇન્વોઇસ જુએ છે – એક એવી એકીકૃત રકમ જે દરેક પેટા-કાર્યના ખર્ચને છુપાવે છે. સંશોધકના એજન્ટે ત્રણ મુખ્ય કાર્યો કર્યા હતા: SEC ફાઇલિંગ્સ શોધવા, રિપોર્ટ્સ ડ્રાફ્ટ કરવા અને રિસર્ચ સંશ્લેષણને એકસાથે જોડવા. વિગતવાર ડેટા વિના, તે જાણી શકતા નહોતા કે જૂનમાં તેમણે ચૂકવેલા $312 યોગ્ય રીતે વપરાયા હતા કે નહીં.

છુપાયેલું નુકસાન (leakage) શોધવા માટે, તેમણે એક PostgreSQL લોગિંગ લેયર ઉમેર્યું જે મોડેલનું નામ, ટોકન ગણતરી, કાર્યનો પ્રકાર અને પ્રતિ-કોલ ખર્ચને કેપ્ચર કરતું હતું. 30 દિવસ પછી, ડેટાએ એક સ્પષ્ટ ચિત્ર રજૂ કર્યું:

  • SEC ફાઇલિંગ સર્ચ – કુલ ખર્ચના 41%
  • રિપોર્ટ ડ્રાફ્ટિંગ – 28%
  • રિસર્ચ સંશ્લેષણ – 17%
  • ક્વોલિટી ચેક્સ – 9%
  • અન્ય – 5%

આ આંકડાઓએ દર્શાવ્યું કે સૌથી મોંઘો તબક્કો મોડેલ પોતે નહોતો, પરંતુ એજન્ટ કેવી રીતે કાચા સર્ચ પરિણામોને પ્રોમ્પ્ટ્સમાં ફીડ કરતો હતો તે હતો.

બચત લાવનારા ત્રણ સુધારા

1. પ્રોમ્પ્ટ આપતા પહેલા સારાંશ તૈયાર કરો

શરૂઆતમાં, એજન્ટ દરેક પ્રોમ્પ્ટમાં 20 કાચા સર્ચ પરિણામો ભરી દેતો હતો, જેનાથી ઇનપુટમાં મોટી સંખ્યામાં ટોકન્સ ઉમેરાતા હતા. તેમણે પહેલા એક સસ્તું સમરાઇઝર (summarizer) ઉમેર્યું, જેનાથી ઇનપુટમાં મોટો ઘટાડો થયો. સર્ચ કાર્ય દીઠ ખર્ચ $0.84 થી ઘટીને $0.19 થયો – જે 77% નો ઘટાડો છે.

2. સાદા ચેક્સને સસ્તા મોડેલ પર મોકલો

ક્વોલિટી ચેક્સ એક હાઇ-એન્ડ મોડેલ પર ચાલતા હતા જેનો ખર્ચ પ્રતિ ચેક $0.09 હતો. તેમણે મોટાભાગના પાસ/ફેલ ચેક્સ માટે ઓછા ભાવવાળા મોડેલનો ઉપયોગ કર્યો, જેનાથી પ્રતિ ચેક કિંમત ઘટીને $0.01 થઈ ગઈ. સસ્તું મોડેલ 89% વખત સાચો જવાબ આપતું હતું; કોઈપણ નિષ્ફળતાના કિસ્સામાં તેને મૂળ મોડેલ પર મોકલવામાં આવતું (escalate), જેનાથી ચોકસાઈ જળવાઈ રહી અને ખર્ચમાં 87% નો ઘટાડો થયો.

3. જ્યારે વિશ્વાસ (confidence) વધારે હોય ત્યારે ચેક્સ સ્કીપ કરો

તેમણે એક નિયમ ઉમેર્યો કે જ્યારે પણ કાર્યનો ઐતિહાસિક સફળતા દર ઊંચો હોય અને આઉટપુટની લંબાઈ અપેક્ષિત મર્યાદામાં હોય, ત્યારે ક્વોલિટી-ચેક સ્ટેપને બાયપાસ કરો. આનાથી લગભગ 60% ચેક્સ દૂર થઈ ગયા જે અન્યથા ચલાવવા પડત.

પરિણામ

આ ત્રણ ફેરફારો અમલમાં આવ્યા પછી, માસિક હિસાબ કંઈક આવો દેખાતો હતો:

  • કુલ ખર્ચ: $945 → $651 (31% ઘટાડો)
  • પ્રતિ કાર્ય SEC સર્ચ ખર્ચ: $0.84 → $0.19 (77% ઘટાડો)
  • પ્રતિ કાર્ય ક્વોલિટી-ચેક ખર્ચ: $0.09 → $0.01 (87% ઘટાડો)
  • કુલ સફળતાનો દર: 91% → 93%

વધારે સફળતાનો દર સૂચવે છે કે ટૂંકા પ્રોમ્પ્ટ્સથી ઘોંઘાટ (noise) ઘટ્યો અને મોડેલને મુખ્ય પ્રશ્ન પર ધ્યાન કેન્દ્રિત કરવામાં મદદ મળી.

સાવચેતીઓ અને વિરોધાભાસી મુદ્દાઓ

આ અભિગમ બે ધારણાઓ પર આધારિત છે. પ્રથમ, સસ્તા સમરાઇઝરે આગળના તર્ક (downstream reasoning) માટે પૂરતી માહિતી જાળવી રાખવી જોઈએ; જો તે મહત્વપૂર્ણ વિગતો કાઢી નાખે, તો આઉટપુટની ગુણવત્તા બગડી શકે છે. બીજું, ક્વોલિટી ચેક્સ માટે વપરાતું ઓછા ખર્ચનું મોડેલ સંપૂર્ણ નથી; તેની 89% ચોકસાઈનો અર્થ એ છે કે ભૂલોનો એક નાનો હિસ્સો હજુ પણ અંતિમ ઉત્પાદન સુધી પહોંચે છે, જોકે એસ્કેલેશન પાથ મોટાભાગની ભૂલોને પકડી લે છે. કડક પાલન (compliance) જરૂરિયાતો ધરાવતા વપરાશકર્તાઓને વધુ કડક મર્યાદાઓ અથવા વધારાના વેરિફિકેશન સ્ટેપ્સની જરૂર પડી શકે છે.

LLM પ્રેક્ટિશનર્સ માટે આનો અર્થ શું છે

  • વિગતવાર ડેશબોર્ડ્સ જીતે છે. ઉચ્ચ-સ્તરના ખર્ચના રિપોર્ટ્સ ટોકનનો બગાડ છુપાવે છે. દરેક કાર્ય દીઠ વપરાશની નોંધ રાખવાથી એવી બિનકાર્યક્ષમતાઓ બહાર આવે છે જે અન્યથા છુપાયેલી રહેત.
  • ફ્રન્ટિયર મોડેલ્સ હંમેશા જરૂરી નથી હોતા. એક સસ્તું મોડેલ એકંદર ગુણવત્તા સાથે સમાધાન કર્યા વિના ડેટાને સંકુચિત કરી શકે છે અથવા સાદા બાઈનરી નિર્ણયો લઈ શકે છે.

LLM એજન્ટનો છુપાયેલ ખર્ચ ઘણીવાર તેના દ્વારા કરવામાં આવતું અણમાપેલું કામ હોય છે. ટોકન ફ્લોનું માપન કરીને અને લક્ષિત ઓપ્ટિમાઇઝેશન લાગુ કરીને, સંશોધકે $945 ના માસિક બિલને $651 ના વધુ કાર્યક્ષમ ઓપરેશનમાં બદલી નાખ્યું અને સાથે સાથે કામગીરીમાં પણ સુધારો કર્યો. AI વર્કલોડનું બજેટ બનાવનાર કોઈપણ વ્યક્તિ માટે બોધપાઠ સ્પષ્ટ છે: દરેક ટોકનનું માપન કરો, પછી ડેટાને નક્કી કરવા દો કે ક્યાં કાપ મૂકવો.