இந்த மாதம் எங்களது AI-சேவை கட்டணம் $31,000 ஆக உயர்ந்துவிட்டது—நாங்கள் ஒதுக்கிய பட்ஜெட்டை விட மூன்று மடங்கு அதிகம்—ஏனெனில் ஒரு சிறிய குறியீடு (line of code), எங்களது 80% டிராஃபிக்கையும் மிகவும் விலையுயர்ந்த மாடலான GPT-4o-விற்கு அனுப்பியது.

கட்டணம் ஏன் இவ்வளவு அதிகமாக உயர்ந்தது

நாங்கள் இந்த அமைப்பை நம்பகத்தன்மைக்காக உருவாக்கினோம்: வேகமான பதில்கள், இடைவெளியற்ற இயக்கம் (zero downtime), மற்றும் தடையற்ற விரிவாக்கம் (smooth scaling). அந்தத் தேர்வு டோக்கன் பயன்பாட்டில் ஒரு வழக்கமான “memory leak” போன்ற சூழலை உருவாக்கியது—பெரும்பாலான உரையாடல்களுக்குத் தேவையில்லாத ஒரு மாடலுக்கே டோக்கன்கள் தொடர்ந்து செலவிடப்பட்டன.

பொறியியல் மாற்றம்: செலவை ஒரு கட்டமைப்பு சார்ந்த விஷயமாகக் கருதுதல்

AI செலவை ஒரு நிதிச் சிக்கலாக மட்டும் பார்ப்பது, உண்மையான தீர்வை மறைத்துவிடுகிறது: அதாவது, ஒவ்வொரு கோரிக்கையையும் (request) எந்த மாடல் கையாள வேண்டும் என்பதைத் தீர்மானிக்கும் குறியீடுதான் அந்தத் தீர்வு. மாடல் தேர்வை ரூட்டிங் லேயருக்கு (routing layer) கொண்டு வந்ததன் மூலம், மறைமுகமாகச் சென்ற செலவை ஒரு கட்டுப்படுத்தக்கூடிய காரணியாக மாற்ற முடிந்தது.

1. பணிகளுக்கு ஏற்ற மாடலைத் தேர்ந்தெடுங்கள்

விதி எளிமையானது: தரத் தேவையைப் பூர்த்தி செய்யும் மிகச்சிறிய மாடலைப் பயன்படுத்துங்கள். நாங்கள் நான்கு பொதுவான கோரிக்கை வகைகளை மலிவான மாற்று மாடல்களுடன் இணைத்தோம்:

  • எளிய அரட்டை (Simple chat) → DeepSeek V4 Flash (97.5% சேமிப்பு)
  • வகைப்படுத்துதல் (Classification) → Qwen3-8B (98.3% சேமிப்பு)
  • குறியீடு உருவாக்கம் (Code generation) → DeepSeek Coder (97.5% சேமிப்பு)
  • சுருக்கம் செய்தல் (Summarization) → Qwen3-32B (97.2% சேமிப்பு)

இந்த சதவீதங்கள், தேர்ந்தெடுக்கப்பட்ட மாடலுக்கும் GPT-4o-க்கும் இடையிலான நேரடி டோக்கன் விலை வித்தியாசத்தைக் காட்டுகின்றன. இதன் விளைவாக, உயர்தரத் தர்க்க அறிவு (top-tier reasoning) தேவையில்லாத பணிகளில் மாடலின் செயல்திறனில் ஒரு சிறிய குறைவு ஏற்படலாம்.

2. CDN போன்ற அடுக்குமுறை ரூட்டிங் (Tiered routing)

நாங்கள் இரண்டு அடுக்குகள் கொண்ட ஒரு ரூட்டரை உருவாக்கினோம், இது முதலில் ஒவ்வொரு கோரிக்கையையும் மலிவான மாடலுக்கு அனுப்புகிறது. பதிலானது ஒரு விரைவான தரப் பரிசோதனையில் தோல்வியடைந்தால்—அதாவது நம்பகத்தன்மை (confidence) ஒரு குறிப்பிட்ட அளவை விடக் குறைவாக இருந்தாலோ அல்லது தேவையான தகவல்கள் விடுபட்டிருந்தாலோ—நாங்கள் அதைத் தானாகவே உயர்நிலை மாடலுக்கு மாற்றுகிறோம் (re-route). இந்தத் தற்காலிகத் தீர்வு (fallback), விலையுயர்ந்த மாடலைத் தேவைப்படும்போது மட்டும் பயன்படுத்துவதன் மூலம் பயனர் அனுபவத்தைப் பாதுகாக்கிறது.

3. மீண்டும் வரும் ப்ராம்ப்ட்களைச் சேமித்து வைப்பதே (Cache) சிறந்தது

பல உரையாடல்களில் ஒரே மாதிரியான சிஸ்டம் ப்ராம்ப்ட் (system prompt) அல்லது FAQ உரைகள் மீண்டும் பயன்படுத்தப்படுகின்றன. அந்தப் பதில்களைச் சேமித்து வைப்பதன் (caching) மூலம், ஒரே மாதிரியான பதில்களை மீண்டும் கணக்கிடுவதைத் தவிர்க்கலாம். எங்களது சோதனையில், இன்-மெமரி கேச் (in-memory cache) மூலம் மீண்டும் வரும் ப்ராம்ப்ட்களுக்கான செலவு சுமார் 30% குறைந்தது.

4. அனுப்பும் முன் ப்ராம்ப்ட்களைச் சுருக்குங்கள்

நீண்ட சிஸ்டம் ப்ராம்ப்ட்கள், பயனர் உள்ளடக்கத்தைப் போலவே அதிக டோக்கன்களைப் பயன்படுத்துகின்றன. நாங்கள் ஒரு ப்ரீ-புரோசஸரை (pre-processor) சேர்த்துள்ளோம், இது ப்ராம்ப்ட்டில் உள்ள தேவையற்றவற்றை நீக்கி, முக்கியமான தகவல்களை மட்டும் சுருக்கி (summarize), விலையுயர்ந்த மாடலுக்கு அனுப்புகிறது. இந்த ஒரு படிநிலை மட்டுமே டோக்கன் செலவில் ஆண்டுக்கு ஆயிரக்கணக்கான டாலர்களைச் சேமித்தது.

நிஜ உலகத் தாக்கம்

முன்பு ஒரு சாட்பாட் (chatbot) பயன்பாட்டிற்கு மாதம் $420 செலவானது. அதன் கோரிக்கைகளில் 85% ஐ மலிவான மாடலுக்கு மாற்றி, கேச்சிங் முறையைப் பயன்படுத்திய பிறகு, கட்டணம் $28 ஆகக் குறைந்தது. இலகுவான மாடல் வேகமாகப் பதிலளித்ததால் தாமதம் (latency) குறைந்தது, மேலும் தற்காலிகத் தீர்வு (fallback) முறை மிக அரிதாகவே பயன்படுத்தப்பட்டது.

முக்கியக் கருத்து

AI செலவை ஒரு முக்கியமான கட்டமைப்பு முடிவாகக் கருதுங்கள். கோரிக்கைகளைத் தகுந்த மாடலுக்கு வழிநடத்துங்கள், தரத்தின் அடிப்படையில் தற்காலிகத் தீர்வைச் (fallback) சேருங்கள், மீண்டும் வரும் ப்ராம்ப்ட்களைச் சேமித்து வையுங்கள் மற்றும் உள்ளீடுகளைச் சுருக்குங்கள்—இவற்றின் மூலம் நம்பகத்தன்மையைக் குறைக்காமல் செலவுகளைப் பெருமளவு குறைக்க முடியும்.