ഒരു ഗവേഷകൻ തന്റെ LLM അധിഷ്ഠിത റിസർച്ച് ഏജന്റ് ഉപയോഗിച്ച ഓരോ ടോക്കണും ഒരു മാസത്തേക്ക് രേഖപ്പെടുത്തുകയും ബില്ലിൽ 31% കുറവ് വരുത്തുകയും ചെയ്തു. ചിലവ് $945-ൽ നിന്ന് $651 ആയി കുറഞ്ഞു, അതേസമയം വിജയശതമാനം (success rate) 91%-ൽ നിന്ന് 93%-ലേക്ക് ഉയർന്നു. ചെലവ് കുറഞ്ഞ AI വർക്ക്ഫ്ലോകൾ നടത്തുന്നവർക്ക് ശ്രദ്ധേയമായ ഒരു ഫലമാണിത്.

ടോക്കൺ തലത്തിലുള്ള ഡാറ്റയുടെ പ്രാധാന്യം എന്തുകൊണ്ട്?

മിക്ക LLM ഉപയോക്താക്കളും കാണുന്നത് അവസാന ഇൻവോയ്സ് മാത്രമാണ് - ഓരോ ഉപ-ദൗത്യത്തിന്റെയും (sub-task) ചിലവ് മറച്ചുവെക്കുന്ന ഒരു മൊത്തം തുക മാത്രം. ഗവേഷകന്റെ ഏജന്റ് പ്രധാനമായും മൂന്ന് കാര്യങ്ങളാണ് ചെയ്തിരുന്നത്: SEC ഫയലിംഗുകൾ തിരയുക, റിപ്പോർട്ടുകൾ തയ്യാറാക്കുക, റിസർച്ച് സിന്തസിസ് (research syntheses) തയ്യാറാക്കുക എന്നിവയായിരുന്നു അവ. സൂക്ഷ്മമായ ഡാറ്റ ഇല്ലാതെ, ജൂണിൽ താൻ നൽകിയ $312 ശരിയായ രീതിയിൽ ഉപയോഗിച്ചോ എന്ന് അദ്ദേഹത്തിന് മനസ്സിലാക്കാൻ കഴിഞ്ഞില്ല.

മറഞ്ഞിരിക്കുന്ന അധിക ചിലവുകൾ കണ്ടെത്താനായി, അദ്ദേഹം മോഡൽ പേര്, ടോക്കൺ എണ്ണം, ടാസ്ക് തരം, ഓരോ കോളിന്റെയും ചിലവ് എന്നിവ രേഖപ്പെടുത്തുന്ന ഒരു PostgreSQL ലോഗിംഗ് ലെയർ ചേർത്തു. 30 ദിവസത്തിന് ശേഷം ലഭിച്ച ഡാറ്റ വ്യക്തമായ ഒരു ചിത്രം നൽകി:

  • SEC ഫയലിംഗ് സെർച്ച് – ആകെ ചിലവിന്റെ 41%
  • റിപ്പോർട്ട് ഡ്രാഫ്റ്റിംഗ് – 28%
  • റിസർച്ച് സിന്തസിസ് – 17%
  • ക്വാളിറ്റി ചെക്കുകൾ – 9%
  • മറ്റുള്ളവ – 5%

ഏറ്റവും കൂടുതൽ ചിലവ് വരുന്ന ഘട്ടം മോഡൽ തന്നെയായിരുന്നില്ല, മറിച്ച് സെർച്ച് റിസൾട്ടുകൾ പ്രോംപ്റ്റുകളിലേക്ക് ഏജന്റ് നൽകുന്ന രീതിയായിരുന്നു എന്ന് ഈ കണക്കുകൾ കാണിച്ചുതന്നു.

ലാഭമുണ്ടാക്കിയ മൂന്ന് മാറ്റങ്ങൾ

1. പ്രോംപ്റ്റ് ചെയ്യുന്നതിന് മുമ്പ് സംഗ്രഹിക്കുക (Summarize)

തുടക്കത്തിൽ, ഏജന്റ് ഓരോ പ്രോംപ്റ്റിലും 20 സെർച്ച് റിസൾട്ടുകൾ നേരിട്ട് ഉൾപ്പെടുത്തുന്നുണ്ടായിരുന്നു, ഇത് ടോക്കണുകളുടെ എണ്ണം വൻതോതിൽ വർദ്ധിപ്പിച്ചു. ഇതിന് പരിഹാരമായി അദ്ദേഹം ആദ്യം ഒരു കുറഞ്ഞ ചിലവുള്ള സംഗ്രഹിക്കുന്ന സംവിധാനം (summarizer) ഏർപ്പെടുത്തി, ഇത് ഇൻപുട്ട് കുറയ്ക്കാൻ സഹായിച്ചു. സെർച്ച് ടാസ്കിനായുള്ള ചിലവ് $0.84-ൽ നിന്ന് $0.19 ആയി കുറഞ്ഞു – അതായത് 77% കുറവ്.

2. ലളിതമായ പരിശോധനകൾ കുറഞ്ഞ ചിലവുള്ള മോഡലിലേക്ക് മാറ്റുക

ക്വാളിറ്റി ചെക്കുകൾക്കായി ഓരോ പരിശോധനയ്ക്കും $0.09 ചിലവുള്ള ഒരു ഹൈ-എൻഡ് മോഡലായിരുന്നു ഉപയോഗിച്ചിരുന്നത്. അദ്ദേഹം മിക്ക പാസ്/ഫെയിൽ (pass/fail) പരിശോധനകൾക്കുമായി കുറഞ്ഞ വിലയുള്ള ഒരു മോഡൽ ഉപയോഗിച്ചു, ഇത് പരിശോധനയ്ക്കുള്ള ചിലവ് $0.01 ആയി കുറച്ചു. കുറഞ്ഞ ചിലവുള്ള മോഡൽ 89% തവണ കൃത്യമായ മറുപടി നൽകി; എന്തെങ്കിലും പിശക് സംഭവിക്കുകയാണെങ്കിൽ അത് പഴയ മോഡലിലേക്ക് മാറ്റുന്ന രീതി (escalation) സ്വീകരിച്ചതിലൂടെ കൃത്യത നിലനിർത്തിക്കൊണ്ടുതന്നെ ചിലവ് 87% കുറയ്ക്കാൻ സാധിച്ചു.

3. ആത്മവിശ്വാസം (confidence) കൂടുതലായപ്പോൾ പരിശോധനകൾ ഒഴിവാക്കുക

ഒരു ടാസ്കിന്റെ മുൻകാല വിജയശതമാനം കൂടുതലാണെങ്കിൽ, ഔട്ട്പുട്ടിന്റെ ദൈർഘ്യം പ്രതീക്ഷിച്ച പരിധിയിലാണെങ്കിൽ, ക്വാളിറ്റി ചെക്ക് ഘട്ടം ഒഴിവാക്കാനുള്ള ഒരു നിയമം അദ്ദേഹം ചേർത്തു. ഇത് അനാവശ്യമായി നടന്നിരുന്ന പരിശോധനകളിൽ ഏകദേശം 60% ഒഴിവാക്കാൻ സഹായിച്ചു.

ഫലം

ഈ മൂന്ന് മാറ്റങ്ങൾ വരുത്തിയതോടെ മാസത്തെ കണക്കുകൾ ഇങ്ങനെയായി:

  • ആകെ ചിലവ്: $945 → $651 (31% കുറവ്)
  • ടാസ്ക് દી പറയുന്ന SEC സെർച്ച് ചിലവ്: $0.84 → $0.19 (77% കുറവ്)
  • ടാസ്ക് દી പറയുന്ന ക്വാളിറ്റി ചെക്ക് ചിലവ്: $0.09 → $0.01 (87% കുറവ്)
  • ആകെ വിജയശതമാനം: 91% → 93%

വിജയശതമാനം ഉയർന്നത് ചെറിയ പ്രോംപ്റ്റുകൾ ഉപയോഗിച്ചത് മൂലം അനാവശ്യ വിവരങ്ങൾ (noise) കുറഞ്ഞതിനാലും മോഡലിന് പ്രധാന ചോദ്യത്തിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കാൻ സഹായിച്ചതിനാലും ആണെന്ന് കരുതപ്പെടുന്നു.

ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങളും മറ്റ് വശങ്ങളും

ഈ രീതി രണ്ട് അനുമാനങ്ങളെ അടിസ്ഥാനമാക്കിയുള്ളതാണ്. ഒന്നാമതായി, കുറഞ്ഞ ചിലവുള്ള സംഗ്രഹിക്കുന്ന സംവിധാനം (summarizer) ആവശ്യമായ വിവരങ്ങൾ നിലനിർത്തുന്നുണ്ടെന്ന് ഉറപ്പാക്കണം; പ്രധാനപ്പെട്ട വിവരങ്ങൾ നഷ്ടപ്പെട്ടാൽ ഔട്ട്പുട്ടിന്റെ ഗുണനിലവാരം കുറയാം. രണ്ടാമതായി, ക്വാളിറ്റി ചെക്കുകൾക്കായി ഉപയോഗിക്കുന്ന കുറഞ്ഞ ചിലവുള്ള മോഡൽ പൂർണ്ണമല്ല; അതിന്റെ 89% കൃത്യത എന്നത് ചെറിയ തോതിലുള്ള പിശകുകൾ ഫലത്തിൽ വരാൻ സാധ്യതയുണ്ടെന്ന് സൂചിപ്പിക്കുന്നു (എങ്കിലും എസ്‌കലേഷൻ പാത്ത് അവയിൽ ഭൂരിഭാഗവും കണ്ടെത്തുന്നുണ്ട്). കർശനമായ നിയമങ്ങൾ പാലിക്കേണ്ട ഉപയോക്താക്കൾക്ക് കൂടുതൽ കൃത്യതയുള്ള പരിശോധനകൾ ആവശ്യമായി വന്നേക്കാം.

LLM പ്രായോഗികമായി ഉപയോഗിക്കുന്നവർക്ക് ഇതിൽ നിന്നുള്ള പാഠങ്ങൾ

  • സൂക്ഷ്മമായ ഡാഷ്‌ബോർഡുകൾ വിജയിക്കും. ഉയർന്ന തലത്തിലുള്ള ചിലവ് റിപ്പോർട്ടുകൾ ടോക്കൺ പാഴാകുന്നത് മറച്ചുവെക്കുന്നു. ഓരോ ടാസ്കിനും ഉപയോഗം രേഖപ്പെടുത്തുന്നത് otherwise മറഞ്ഞിരിക്കുന്ന കാര്യക്ഷമതയില്ലായ്മകൾ കണ്ടെത്താൻ സഹായിക്കും.
  • എല്ലാത്തിനും ഫ്രോണ്ടിയർ മോഡലുകൾ (Frontier models) ആവശ്യമില്ല. മൊത്തത്തിലുള്ള ഗുണനിലവാരം കുറയാതെ തന്നെ ഡാറ്റ ചുരുക്കാനോ ലളിതമായ തീരുമാനങ്ങൾ എടുക്കാനോ കുറഞ്ഞ ചിലവുള്ള മോഡലുകൾക്ക് സാധിക്കും.

ഒരു LLM ഏജന്റിന്റെ മറഞ്ഞിരിക്കുന്ന ചിലവ് പലപ്പോഴും അത് ചെയ്യുന്ന അളന്നുതീർത്ത പാടില്ലാത്ത ജോലികളാണ്. ടോക്കൺ ഉപയോഗം കൃത്യമായി നിരീക്ഷിച്ചും ലക്ഷ്യമിട്ടുള്ള മാറ്റങ്ങൾ വരുത്തിയും, ഗവേഷകൻ തന്റെ $945 മാസ ബില്ലിനെ $651 എന്ന കുറഞ്ഞ ചിലവിലേക്ക് മാറ്റി, അതോടൊപ്പം പ്രവർത്തനക്ഷമതയും വർദ്ധിപ്പിച്ചു. AI വർക്ക്ഫ്ലോകൾക്കായി ബജറ്റ് തയ്യാറാക്കുന്നവർക്ക് ഇതിൽ നിന്നുള്ള പാഠം വ്യക്തമാണ്: ഓരോ ടോക്കണും അളക്കുക, എന്നിട്ട് ഡാറ്റ നൽകുന്ന സൂചനകൾക്കനുസരിച്ച് ചിലവ് കുറയ്ക്കുക.