ഈ മാസം ഞങ്ങളുടെ AI-സർവീസ് ബിൽ $31,000 ആയി ഉയർന്നു—ഞങ്ങൾ ബജറ്റ് ചെയ്തതിനേക്കാൾ മൂന്നിരട്ടിയിലധികം—കാരണം ഒരു വരി കോഡ് കാരണം ഞങ്ങളുടെ ട്രാഫിക്കിന്റെ ഏകദേശം 80 % ഏറ്റവും വിലകൂടിയ മോഡലായ GPT-4o-ലേക്ക് അയക്കപ്പെട്ടു.

ബിൽ ഇത്രയധികം വർദ്ധിക്കാൻ കാരണം

വേഗതയേറിയ പ്രതികരണങ്ങൾ, തടസ്സമില്ലാത്ത പ്രവർത്തനം (zero downtime), സുഗമമായ സ്കെയിലിംഗ് എന്നിവ ഉറപ്പാക്കാൻ വേണ്ടിയാണ് ഞങ്ങൾ ഈ സിസ്റ്റം നിർമ്മിച്ചത്. എന്നാൽ ആ തീരുമാനം ടോക്കൺ ഉപയോഗത്തിൽ ഒരു ക്ലാസിക് “memory leak” പോലെ പ്രവർത്തിച്ചു—മിക്ക ആവശ്യങ്ങൾക്കും അമിതമായി തോന്നുന്ന ഒരു മോഡലിൽ തന്നെ ടോക്കണുകൾ ചിലവഴിച്ചുകൊണ്ടിരുന്നു.

എഞ്ചിനീയറിംഗ് മാറ്റം: ചിലവിനെ ഒരു ആർക്കിടെക്ചറൽ പ്രശ്നമായി കാണുക

AI ചിലവിനെ വെറുമൊരു സാമ്പത്തിക പ്രശ്നമായി കാണുന്നത് യഥാർത്ഥ പരിഹാരം മറച്ചുവെക്കുന്നതിന് തുല്യമാണ്: ഓരോ റിക്വസ്റ്റും ഏത് മോഡൽ ഉപയോഗിക്കണമെന്ന് തീരുമാനിക്കുന്ന കോഡാണ് യഥാർത്ഥത്തിൽ ഇതിനെ നിയന്ത്രിക്കുന്നത്. മോഡൽ തിരഞ്ഞെടുക്കുന്ന പ്രക്രിയ റൂട്ടിംഗ് ലെയറിലേക്ക് (routing layer) മാറ്റിയതോടെ, ഒളിഞ്ഞിരിക്കുന്ന ഒരു ചിലവ് നിയന്ത്രിക്കാവുന്ന ഒരു ഘടകമായി മാറി.

1. ജോലിക്കനുസരിച്ച് മോഡലിനെ തിരഞ്ഞെടുക്കുക

ഇതിന്റെ നിയമം ലളിതമാണ്: ഗുണനിലവാര ആവശ്യകതകൾ നിറവേറ്റുന്ന ഏറ്റവും ചെറിയ മോഡൽ ഉപയോഗിക്കുക. ഞങ്ങൾ നാല് സാധാരണ റിക്വസ്റ്റ് തരങ്ങളെ കുറഞ്ഞ ചിലവുള്ള മറ്റ് മോഡലുകളുമായി ബന്ധിപ്പിച്ചു:

  • Simple chat → DeepSeek V4 Flash (97.5 % ലാഭിക്കാം)
  • Classification → Qwen3-8B (98.3 % ലാഭിക്കാം)
  • Code generation → DeepSeek Coder (97.5 % ലാഭിക്കാം)
  • Summarization → Qwen3-32B (97.2 % ലാഭിക്കാം)

തിരഞ്ഞെടുത്ത മോഡലുകളും GPT-4o-യും തമ്മിലുള്ള ടോക്കൺ വിലയിലെ വ്യത്യാസമാണ് ഈ ശതമാനങ്ങൾ സൂചിപ്പിക്കുന്നത്. ഉയർന്ന തലത്തിലുള്ള ചിന്താശേഷി (reasoning) ആവശ്യമില്ലാത്ത ജോലികളിൽ മോഡലിന്റെ കപ്പാസിറ്റിയിൽ ചെറിയൊരു കുറവ് വരാം എന്നതാണ് ഇതിന്റെ ഏക പോരായ്മ.

2. ഒരു CDN പോലെ ടയർഡ് റൂട്ടിംഗ് (Tiered routing)

ഞങ്ങൾ രണ്ട് ഘട്ടങ്ങളുള്ള (two-tier) ഒരു റൂട്ടർ നിർമ്മിച്ചു; ഇത് ആദ്യം എല്ലാ റിക്വസ്റ്റുകളെയും കുറഞ്ഞ ചിലവുള്ള മോഡലിലേക്ക് അയക്കുന്നു. ലഭിച്ച മറുപടി ഒരു ക്വാളിറ്റി ചെക്കിംഗിൽ പരാജയപ്പെട്ടാൽ—കൃത്യത കുറവാണെങ്കിലോ ആവശ്യമായ വിവരങ്ങൾ ഇല്ലെങ്കിലോ—അത് സ്വയമേവ ഉയർന്ന നിലവാരമുള്ള ഒരു മോഡലിലേക്ക് റീ-റൂട്ട് ചെയ്യുന്നു. ഈ ഫാള்பാക്ക് (fallback) രീതി ഉപയോഗിക്കുന്നതിലൂടെ ഉപയോക്താവിന്റെ അനുഭവം തകരാതെ തന്നെ, ആവശ്യമുള്ളപ്പോൾ മാത്രം പ്രീമിയം മോഡലുകൾ ഉപയോഗിച്ച് ചിലവ് കുറയ്ക്കാൻ സാധിക്കുന്നു.

3. ആവർത്തിച്ചുള്ള പ്രോംപ്റ്റുകൾ കാഷെ (Cache) ചെയ്യുക

പലപ്പോഴും ഒരേ സിസ്റ്റം പ്രോംപ്റ്റുകളോ FAQ ടെക്സ്റ്റുകളോ ആണ് ഉപയോഗിക്കാറുള്ളത്. ഇത്തരം മറുപടികൾ കാഷെ ചെയ്തു സൂക്ഷിക്കുന്നതിലൂടെ ഒരേ കാര്യങ്ങൾ വീണ്ടും പ്രോസസ്സ് ചെയ്യുന്നത് ഒഴിവാക്കാം. ഞങ്ങളുടെ പരീക്ഷണങ്ങളിൽ, ഇൻ-മെമ്മറി കാഷെ ഉപയോഗിച്ചപ്പോൾ ആവർത്തിച്ചുള്ള പ്രോംപ്റ്റുകൾ മൂലമുള്ള ചിലവ് ഏകദേശം 30 % കുറഞ്ഞു.

4. അയക്കുന്നതിന് മുമ്പ് പ്രോംപ്റ്റുകൾ കംപ്രസ്സ് ചെയ്യുക

നീളമേറിയ സിസ്റ്റം പ്രോംപ്റ്റുകൾ ഉപയോക്താവിന്റെ ഉള്ളടക്കം പോലെ തന്നെ ധാരാളം ടോക്കണുകൾ ഉപയോഗിക്കുന്നു. ഇതിനായി ഞങ്ങൾ ഒരു പ്രീ-പ്രോസസ്സർ ചേർത്തു; ഇത് പ്രോംപ്റ്റിനെ ഒരു ചെറിയ സമ്മറൈസറിലൂടെ കടത്തിവിട്ട്, അത് പ്രധാനപ്പെട്ട കാര്യങ്ങൾ മാത്രം ഉൾക്കൊള്ളുന്ന രീതിയിൽ ചുരുക്കി വലിയ മോഡലുകളിലേക്ക് അയക്കുന്നു. ഈ ഒരു നടപടിയിലൂടെ മാത്രം ടോക്കൺ ചിലവിൽ വർഷം തോറും ആയിരക്കണക്കിന് ഡോളറുകൾ ലാഭിക്കാൻ സാധിച്ചു.

യഥാർത്ഥ ലോകത്തെ സ്വാധീനം

മുമ്പ് ഒരു ചാറ്റ്ബോട്ടിന് മാസം $420 ചിലവ് വന്നിരുന്നു. എന്നാൽ അതിന്റെ ചോദ്യങ്ങളിൽ 85 % കുറഞ്ഞ ചിലവുള്ള മോഡലുകളിലേക്ക് റൂട്ട് ചെയ്തതിലൂടെയും കാഷിംഗ് ഉപയോഗിച്ചതിലൂടെയും ബിൽ $28 ആയി കുറഞ്ഞു. ലളിതമായ മോഡലുകൾ വേഗത്തിൽ പ്രതികരിക്കുന്നതിനാൽ ലേറ്റൻസി (latency) കുറയുകയും, ഫാള்பാക്ക് രീതി ഉപയോഗിക്കേണ്ടി വരുന്നത് വളരെ കുറയുകയും ചെയ്തു.

പാഠം

AI ചിലവിനെ ഒരു പ്രധാനപ്പെട്ട ആർക്കിടെക്ചറൽ തീരുമാനമായി കാണുക. ആവശ്യാനുസരണം മോഡലുകളെ റൂട്ട് ചെയ്യുക, ഗുണനിലവാരത്തിന് അനുസരിച്ചുള്ള ഫാള்பാക്ക് സംവിധാനം ഏർപ്പെടുത്തുക, ആവർത്തിച്ചുള്ള പ്രോംപ്റ്റുകൾ കാഷെ ചെയ്യുക, ഇൻപുട്ടുകൾ കംപ്രസ്സ് ചെയ്യുക—ഇതിലൂടെ വിശ്വാസ്യത നിലനിർത്തിക്കൊണ്ടുതന്നെ വലിയ തോതിൽ ചിലവ് കുറയ്ക്കാൻ നിങ്ങൾക്ക് സാധിക്കും.