ஒரு புதிய செலவு பகுப்பாய்வு (cost analysis) படி, ஒரு நிறுவனம் மாதத்திற்கு சுமார் 5 மில்லியன் முதல் 10 மில்லியன் உள்ளீட்டு டோக்கன்களை (input tokens) செயலாக்கினால் மட்டுமே, ஒரு பெரிய மொழி மாதிரியை (large language model) சுயமாகத் தங்குவது (self-hosting) வணிக ரீதியான API-களை விடச் சிறந்ததாக இருக்கும். AI சேவைகளுக்கான பட்ஜெட்டைத் திட்டமிடுபவர்களுக்கு, "இலவச" திறந்த எடைகள் (open weights) என்ற கவர்ச்சி உண்மையான சேமிப்பாக மாறுமா என்பதை அந்த சமநிலை புள்ளி (break-even point) தீர்மானிக்கிறது.
API மாதிரி (The API Model)
API வழங்குநர்கள் ஒவ்வொரு டோக்கனுக்கும் கட்டணம் வசூலிக்கிறார்கள் மற்றும் அனைத்து வன்பொருள் (hardware), மின்சாரம் மற்றும் குளிர்விப்பு (cooling) வசதிகளையும் கவனித்துக் கொள்கிறார்கள். தற்போதைய பொதுவான விலைகள்:
- Claude Sonnet 5 – ஒரு மில்லியன் உள்ளீட்டு டோக்கன்களுக்கு $2
- GPT-5.6 – ஒரு மில்லியன் உள்ளீட்டு டோக்கன்களுக்கு சுமார் $1
- Meta Muse Spark – உள்ளே வரும் (inbound) ஒரு மில்லியன் டோக்கன்களுக்கு $1.25, வெளியே செல்லும் (outbound) ஒரு மில்லியன் டோக்கன்களுக்கு $4.25
இந்த மாதிரி 'பயன்படுத்தும் அளவிற்கு மட்டும் பணம் செலுத்தும்' (pay-as-you-go) முறையிலானது. பயன்பாடு பூஜ்ஜியமாகும்போது, கட்டணமும் பூஜ்ஜியமாகிவிடும். மேலும், GPU செயலிழப்பு, ஃபார்ம்வேர் (firmware) புதுப்பிப்புகள் மற்றும் கொள்ளளவு திட்டமிடல் (capacity planning) போன்ற தலைவலிய்களிலிருந்தும் பயனர்கள் தப்பிக்கலாம்.
சுயமாகத் தங்குதல் மாதிரி (The Self-Hosting Model)
உங்கள் சொந்த வன்பொருளில் ஒரு திறந்த எடை மாதிரியை (open-weight model) இயக்குவது என்பது, பயன்பாடு எதுவாக இருந்தாலும் கணக்கீட்டுச் செலவை (compute cost) நீங்களே ஏற்க வேண்டும் என்று அர்த்தம். LLM அனுமானத்திற்கு (inference) பொதுவாகத் தேர்ந்தெடுக்கப்படும் ஒரு NVIDIA H100-ன் விலை:
- பொதுவான GPU கிளவுட் சேவைகளில் ஒரு மணி நேரத்திற்கு $2 – $3
- முக்கிய கிளவுட் தளங்களில் (AWS, Azure) ஒரு மணி நேரத்திற்கு $7 – $12
இது ஒரு H100-ஐத் தொடர்ந்து இயக்குவதற்கு மாதத்திற்கு தோராயமாக $1,800 – $2,000 ஆகும். வன்பொருள் விலை என்பது கட்டணத்தின் கண்ணுக்குத் தெரியும் ஒரு பகுதி மட்டுமே.
எண்கள் சந்திக்கும் இடம் (Where the Numbers Meet)
மாதந்திர உள்ளீட்டு டோக்கன் அளவு 5 மில்லியன் முதல் 10 மில்லியன் வரம்பை எட்டும்போது, சுயமாகத் தங்குவது பிரீமியம் API-களை விட மலிவானதாக மாறும் என்று இந்த பகுப்பாய்வு கூறுகிறது. அந்த வரம்பிற்கு கீழே, டோக்கன் அடிப்படையிலான API விலைகளே லாபகரமானவை. மாதத்திற்கு 100 மில்லியன் டோக்கன்கள் அல்லது அதற்கு மேல் இருக்கும்போது, வன்பொருள் சார்ந்த செலவு API செலவை விடக் குறைகிறது, இது காகித அளவில் சுயமாகத் தங்குவதை ஈர்க்கக்கூடியதாகக் காட்டுகிறது.
மறைமுகமான செயல்பாட்டுச் செலவுகள் (Hidden Operational Expenses)
ஒரு மாதிரியைத் தயாரிப்பில் (production) இயக்குவதற்கான உண்மையான செலவில் GPU வாடகை என்பது சுமார் 30% மட்டுமே. மீதமுள்ளவை இதிலிருந்து வருகின்றன:
- நெட்வொர்க்கிங் மற்றும் சேமிப்பு (Networking and storage) – அதிகத் திறன் கொண்ட இணைப்புகள் மற்றும் வேகமான டிஸ்க்குகள் தாமதத்தைக் (latency) குறைக்கின்றன.
- மீள்தன்மை மற்றும் கண்காணிப்பு (Redundancy and monitoring) – பல இன்ஸ்டன்ஸ்கள் (instances), ஆரோக்கியச் சோதனைகள் (health checks) மற்றும் எச்சரிக்கை வழித்தடங்கள் (alert pipelines) மென்பொருள் மற்றும் வன்பொருள் செலவுகளை அதிகரிக்கின்றன.
- பொறியியல் திறமை (Engineering talent) – ஒரு மாதிரியைத் தொடர்ந்து நம்பகமான முறையில் ஆன்லைனில் வைத்திருக்க பொதுவாக 1.5 – 2 முழுநேரப் பொறியாளர்கள் தேவைப்படுவார்கள். சந்தை விலையின்படி, இது ஆண்டுச் செலவில் $270,000 – $550,000 ஐச் சேர்க்கிறது.
இந்தத் தேவைகள் அனைத்தையும் சேர்க்கும்போது, வன்பொருளிலிருந்து மட்டுமே கிடைக்கும் என்று தோன்றும் சேமிப்பு விரைவாக மறைந்துவிடும்.
சுயமாகத் தங்குதலை யார் பரிசீலிக்க வேண்டும் (Who Should Consider Self-Hosting)
குறிப்பிட்ட சூழ்நிலைகளின் கீழ் மட்டுமே சுயமாகத் தங்குவது அர்த்தமுள்ளதாக இருக்கும்:
- தொடர்ச்சியான அதிகப்படியான அளவு (Consistently massive volume) – நிறுவனம் வழக்கமாக 5 மில்லியன் டோக்கன் வரம்பைத் தாண்ட வேண்டும், இல்லையெனில் டோக்கன் அடிப்படையிலான API விலை குறைவாகவே இருக்கும்.
- ஒழுங்குமுறை அல்லது தரவுத் தனியுரிமை கட்டுப்பாடுகள் (Regulatory or data-privacy constraints) – சில துறைகள் உரிமம் பெற்ற அல்லது தனிப்பட்ட தரவை மூன்றாம் தரப்பு முனையங்களுக்கு (third-party endpoints) அனுப்புவதைத் தடை செய்கின்றன.
- சிறப்புத் தனிப்பயனாக்கம் அல்லது தாமத உத்தரவாதங்கள் (Specialized customization or latency guarantees) – ஒரு மாதிரியை உள் தரவுகளில் நுணுக்கமாக மாற்றியமைக்க (fine-tuned) வேண்டியிருந்தாலோ அல்லது ஒரு வினாடிக்கும் குறைவான நேரத்தில் பதிலளிக்க வேண்டியிருந்தாலோ, சொந்தமாகத் தொழில்நுட்பக் கட்டமைப்பைக் (stack) கொண்டிருப்பது நியாயமானதாக இருக்கலாம்.
இந்த அழுத்தங்கள் எதுவும் இல்லையென்றால், மறைமுகமான பணியாளர்கள் மற்றும் உள்கட்டமைப்புச் செலவுகள் பெரும்பாலும் வன்பொருள் சேமிப்பை விட அதிகமாக இருக்கும்.
ஒரு கலப்புத் திட்டம் (A Hybrid Playbook)
சுயமாகத் தங்குவது சாத்தியமான அளவிலான வளர்ச்சியை எட்டும் பெரும்பாலான குழுக்கள் இன்னும் ஒரு கலப்பு அணுகுமுறையையே பின்பற்றுகின்றன:
- API-களுடன் தொடங்குங்கள் – அவை மலிவானவை, விரைவாக ஒருங்கிணைக்கக்கூடியவை மற்றும் சோதனைகள் அல்லது குறைந்த அளவிலான வேலைகளுக்குச் சிறந்தவை.
- அதிக அளவிலான தரவுகளை மாற்றவும் – டோக்கன் எண்ணிக்கை தொடர்ந்து சமநிலை புள்ளியைத் தாண்டும்போது, அந்தத் தரவு வழித்தடங்களை (pipelines) உள் நிறுவனக் கிளஸ்டருக்கு (in-house cluster) மாற்றவும்.
- பாதுகாப்பு வலையைத் தக்கவைத்துக் கொள்ளுங்கள் – உள்ளூர் வளங்களை (on-prem resources) அளவுக்கு அதிகமாகத் தயார் செய்வதைத் தவிர்க்க, அவ்வப்போது வரும் அல்லது திடீரென அதிகரிக்கும் கோரிக்கைகளை API மூலம் தொடரவும்.
டோக்கன் கணக்கீடுகளைத் தொடர்ந்து செய்யுங்கள், பின்னர் வெறும் வன்பொருள் விலைகளில் விடுபட்ட செயல்பாட்டுச் செலவுகளையும் கணக்கில் கொள்ளுங்கள். முழுமையான பிம்பத்தின் அடிப்படையில் எடுக்கப்படும் முடிவுகள் தவறான நம்பிக்கைகளால் பாதிக்கப்பட வாய்ப்பு மிகக் குறைவு.
முக்கியக் கருத்து (Takeaway)
உங்கள் AI தயாரிப்பு மாதத்திற்கு சில மில்லியன் டோக்கன்களுக்கும் குறைவாகச் செயலாக்கினால், எளிமையான மற்றும் மலிவான வழி இன்னும் API-யைப் பயன்படுத்துவதே ஆகும். தொடர்ச்சியான, அதிக அளவிலான தேவை, கடுமையான இணக்க விதிகள் (compliance) அல்லது தனிப்பயனாக்கப்பட்ட தாமதத் தேவைகள் ஏற்படும் போது மட்டுமே சுயமாகத் தங்குவது நிதி ரீதியாகச் சாத்தியமாகும்—அப்படியிருந்தாலும், கிளவுட் சேவைகளை விடச் சிறந்தது என்று நீங்கள் முடிவெடுப்பதற்கு முன், பணியாளர்கள் மற்றும் உள்கட்டமைப்பின் மறைமுகச் செலவுகளையும் கணக்கில் கொள்ள வேண்டும்.
