આ મહિને અમારું AI-સર્વિસ બિલ વધીને $31,000 થઈ ગયું—અમે જે બજેટ રાખ્યું હતું તેના કરતા ત્રણ ગણું વધારે—કારણ કે કોડની માત્ર એક જ લાઇન દ્વારા આપણો અંદાજે 80% ટ્રાફિક સૌથી મોંઘા મોડેલ, GPT-4o પર મોકલી દેવામાં આવ્યો હતો.
બિલ કેમ આટલું વધી ગયું
અમે આ સિસ્ટમ વિશ્વસનીયતા માટે બનાવી હતી: ઝડપી પ્રતિસાદ, શૂન્ય ડાઉનટાઇમ અને સરળ સ્કેલિંગ. તે પસંદગીએ ટોકન વપરાશમાં એક ક્લાસિક “મેમરી લીક” જેવી સ્થિતિ ઊભી કરી—મોટાભાગની વાતચીતો માટે જે મોડેલ જરૂરિયાત કરતા ઘણું વધારે (overkill) હતું, તેના પર સતત ટોકન્સ ખર્ચાઈ રહ્યા હતા.
એન્જિનિયરિંગમાં ફેરફાર: ખર્ચને આર્કિટેક્ચરલ ચિંતા તરીકે જોવો
AI ખર્ચને માત્ર નાણાકીય સમસ્યા તરીકે જોવાથી સાચું કારણ છુપાઈ જાય છે: તે કોડ જે નક્કી કરે છે કે દરેક રિક્વેસ્ટ માટે કયું મોડેલ ચલાવવું. મોડેલ પસંદગીને રાઉટિંગ લેયર (routing layer) માં ખસેડવાથી છુપાયેલો ખર્ચ એક નિયંત્રિત કરી શકાય તેવા વેરિએબલમાં બદલાઈ ગયો.
1. કાર્ય મુજબ મોડેલ પસંદ કરો
નિયમ સરળ છે: ગુણવત્તાની જરૂરિયાત પૂરી કરે તેવું સૌથી નાનું મોડેલ વાપરો. અમે ચાર સામાન્ય રિક્વેસ્ટ પ્રકારોને સસ્તા વિકલ્પો સાથે જોડ્યા:
- Simple chat → DeepSeek V4 Flash (97.5% બચત)
- Classification → Qwen3-8B (98.3% બચત)
- Code generation → DeepSeek Coder (97.5% બચત)
- Summarization → Qwen3-32B (97.2% બચત)
આ ટકાવારી પસંદ કરેલા મોડેલ અને GPT-4o વચ્ચેના ટોકન-કિંમતનો સીધો તફાવત દર્શાવે છે. આમાં થતો નુકસાન એ છે કે જે કાર્યો માટે ઉચ્ચ સ્તરના તર્ક (reasoning) ની જરૂર નથી, તેની ક્ષમતામાં થોડો ઘટાડો થઈ શકે છે.
2. CDN ની જેમ ટાયર્ડ રાઉટિંગ (Tiered routing)
અમે બે-સ્તરીય (two-tier) રાઉટર બનાવ્યું જે પહેલા દરેક રિક્વેસ્ટને સસ્તા મોડેલ પર મોકલે છે. જો પ્રતિસાદ ક્વોલિટી ચેકમાં નિષ્ફળ જાય—જેમ કે કોન્ફિડન્સ થ્રેશોલ્ડથી નીચે હોય અથવા જરૂરી એન્ટિટીઝ ખૂટતી હોય—તો અમે તેને આપમેળે ઉચ્ચ-સ્તરના મોડેલ પર રી-રાઉટ કરીએ છીએ. આ 'ફોલબેક' (fallback) પદ્ધતિ યુઝર એક્સપિરિયન્સ જાળવી રાખે છે અને પ્રીમિયમ મોડેલનો ખર્ચ ત્યારે જ કરે છે જ્યારે ખરેખર જરૂર હોય.
3. વારંવાર આવતા પ્રોમ્પ્ટ્સને કેશ (Cache) કરો
ઘણી વાતચીતોમાં એક જ સિસ્ટમ પ્રોમ્પ્ટ અથવા FAQ ટેક્સ્ટનો ફરીથી ઉપયોગ થાય છે. આ આઉટપુટ્સને કેશ કરીને, અમે સમાન પ્રતિસાદો ફરીથી ગણતરી કરવાનું ટાળીએ છીએ. અમારા પરીક્ષણોમાં ઇન-મેમરી કેશ (in-memory cache) દ્વારા વારંવાર આવતા પ્રોમ્પ્ટના ખર્ચમાં અંદાજે 30% નો ઘટાડો થયો.
4. મોકલતા પહેલા પ્રોમ્પ્ટ્સને કોમ્પ્રેસ કરો
લાંબા સિસ્ટમ પ્રોમ્પ્ટ્સ યુઝરના કન્ટેન્ટ જેટલી જ ઝડપે ટોકન્સનો વપરાશ કરે છે. અમે એક પ્રી-પ્રોસેસર ઉમેર્યું જે પ્રોમ્પ્ટ પર સસ્તા સમરાઇઝર (summarizer) ચલાવે છે, જેથી મોંઘા મોડેલ પર મોકલતા પહેલા તેને જરૂરી સંદર્ભ (context) સુધી ટૂંકાવી શકાય. આ એક પગલાને કારણે જ ટોકન ખર્ચમાં દર વર્ષે હજારો ડોલર બચ્યા.
વાસ્તવિક દુનિયા પર અસર
એક ચેટબોટનો અગાઉનો ખર્ચ $420/મહિને હતો. તેની 85% ક્વેરીઝને સસ્તા મોડેલ પર મોકલીને અને કેશિંગનો ઉપયોગ કર્યા પછી, બિલ ઘટીને $28 થઈ ગયું. લેટન્સી (Latency) માં સુધારો થયો કારણ કે હળવું મોડેલ ઝડપથી પ્રતિસાદ આપતું હતું, અને ફોલબેક પાથનો ઉપયોગ ભાગ્યે જ થયો.
મુખ્ય વાત (Takeaway)
AI ખર્ચને આર્કિટેક્ચરના મુખ્ય નિર્ણય તરીકે ગણો. રિક્વેસ્ટને યોગ્ય મોડેલ પર મોકલો, ગુણવત્તા આધારિત ફોલબેક ઉમેરો, વારંવાર આવતા પ્રોમ્પ્ટ્સને કેશ કરો અને ઇનપુટ્સને કોમ્પ્રેસ કરો—આમ તમે વિશ્વસનીયતા જાળવી રાખીને ખર્ચમાં મોટો ઘટાડો કરી શકો છો.
