Whisper மற்றும் API: ஒரு “இலவச” மாடல் எப்போது அதிக செலவுமிக்கதாக மாறுகிறது?

உங்கள் குழு AssemblyAI பில்லைப் பார்க்கிறது. யாரோ ஒருவர் கேட்கிறார்கள்: "பணத்தைச் சேமிக்க ஏன் Whisper-ஐ நாங்களே ஹோஸ்ட் செய்யக்கூடாது?"

இது எளிதாகத் தோன்றுகிறது. ஒரு checkpoint-ஐப் பதிவிறக்கவும். ஒரு கட்டளையை (command) இயக்கவும். ஒரு மதியத்திற்குள் முடிந்துவிடும்.

ஆனால் உண்மையான கேள்வி என்னவென்றால்: அடுத்த இரண்டு ஆண்டுகளுக்கு அந்த endpoint-ஐ இயக்குவதற்கான செலவு என்ன?

API பில் ஏன் மலிவாகத் தெரிகிறது

நிர்வகிக்கப்படும் (Managed) டிரான்ஸ்கிரிப்ஷன் சேவைகள், செயலாக்கப்படும் ஆடியோவின் ஒவ்வொரு வினாடிக்கும் கட்டணம் வசூலிக்கின்றன. உதாரணமாக, AssemblyAI அதன் asynchronous pipeline வழியாகச் செல்லும் ஒவ்வொரு மணிநேர உள்ளடக்கத்திற்கும் தோராயமாக $0.15 – $0.21 வசூலிக்கிறது. இந்த எண்கள் பல வேலைகளை மறைத்து வைத்துள்ளன: சேவை வழங்குநர் inference hardware-ஐப் பராமரிக்கிறார், இரைச்சல் மிகுந்த ஆடியோவைச் சுத்தம் செய்கிறார், பேசுபவர்களைப் பிரிக்கிறார், தகவல்களை (entities) வடிவமைக்கிறார் (கிரெடிட் கார்டு எண்கள், மின்னஞ்சல்கள், சரிபார்ப்பு குறியீடுகள்), முடிவுகளை நிகழ்நேரத்தில் (real time) வழங்குகிறார் மற்றும் சேவையை 24 × 7 கண்காணிக்கிறார். நீங்கள் பெறும் விலைப்பட்டியல் (invoice) இவை அனைத்தின் கூட்டுத்தொகையாகும், இது ஒரு எளிய வினாடிக்கு ஒரு விகிதமாகத் தொகுக்கப்பட்டுள்ளது.

GPU விலை உண்மையில் எதைக் குறிக்கிறது

Whisper Large-v3 ஒரு ஒற்றை A100 அல்லது H100 GPU-வில் இயங்க முடியும். கிளவுட் வழங்குநர்கள் அந்த கார்டுகளைத் தேவைப்படும்போது (on demand) ஒரு மணி நேரத்திற்கு $2 – $4 எனப் பட்டியலிடுகிறார்கள். இதில் உள்ள சிக்கல் என்னவென்றால், சிப் பயன்பாட்டில்லாமல் (idle) இருக்கும்போதும் நீங்கள் முழு மணிநேரக் கட்டணத்தையும் செலுத்த வேண்டும். உங்கள் பணிச்சுமை (workload) GPU-வின் கொள்ளளவில் 15% மட்டுமே பயன்படுத்தினால் கூட, நீங்கள் முழுமையான $2 – $4 கட்டணத்தைச் செலுத்த வேண்டியிருக்கும்.

நீங்கள் ஏற்க வேண்டிய பொறியியல் கடன் (Engineering debt)

சுய-ஹோஸ்டிங் (Self-hosting) என்பது ஒரு மாடல் checkpoint-ஐத் தொடங்குவதோடு நின்றுவிடுவதில்லை. மறைந்துள்ள வேலைகள் விரைவாகத் தெரியப்படுபவை வன்பொருள் (hardware) செலவை விட அதிகமாகிவிடும்.

  • Speaker diarization – ஓப்பன் சோர்ஸ் Whisper குரல்களைப் பிரித்தறியாது. நம்பகமான diarization pipeline-ஐ உருவாக்குவதற்குத் தனி மாடல், தரவு மற்றும் தொடர்ச்சியான சரிசெய்தல் (tuning) தேவைப்படும்.
  • Streaming support – Whisper முழு கோப்புகளையும் asynchronous முறையில் செயலாக்குகிறது. நிகழ்நேரத் தலைப்புகள் (captions) அல்லது குரல் முகவர் (voice-agent) பதில்களுக்கு, back-pressure கையாளுதல் மற்றும் தாமதத்தைக் கண்காணித்தல் (latency monitoring) போன்ற வசதிகளுடன் கூடிய ஒரு தனிப்பயனாக்கப்பட்ட streaming layer தேவைப்படும்.
  • Entity formatting – மூல டிரான்ஸ்கிரிப்ட்களில் (Raw transcripts) முக்கியமான தகவல்களை மறைக்க அல்லது மறுவடிவமைக்கத் தேவையான தர்க்கம் (logic) இருக்காது. கிரெடிட் கார்டு எண்கள், மின்னஞ்சல் முகவரிகள் அல்லது OTP குறியீடுகளுக்கான விதிகளைச் சேர்ப்பது ஒரு சவாலான பொறியியல் முயற்சியாகும், மேலும் ஒரு சிறிய எழுத்துப் பிழை கூட டிரான்ஸ்கிரிப்டைப் பயன்படுத்த முடியாதபடி செய்துவிடும்.
  • Reliability engineering – ஒரு GPU-வில் இயங்கும் டெமோ (demo) எளிதானது; ஆனால் ஒரு தயாரிப்புச் சேவை (production service) ஒரே நேரத்தில் பல பணிகளைச் செய்தல் (concurrency), மீண்டும் முயற்சித்தல் (retries), இடைநிறுத்தம் இல்லாத மேம்படுத்தல்கள் (zero-downtime upgrades) மற்றும் எச்சரிக்கை (alerting) ஆகியவற்றைச் சமாளிக்க வேண்டும்.

சுய-ஹோஸ்டிங் எப்போது உண்மையில் லாபகரமானது

சில குறிப்பிட்ட சூழ்நிலைகளில் மட்டுமே கணக்கீடு மாறுகிறது:

  • அதிகப்படியான, தொடர்ச்சியான பேட்ச் செயலாக்கம் (Heavy, continuous batch processing) – மாதக்கணக்கில் ஒரு GPU-வை கிட்டத்தட்ட 100% பயன்பாட்டில் வைத்திருக்க போதுமான ஆடியோ உங்களிடம் இருந்தால், ஒரு மணிநேர வன்பொருள் கட்டணத்தை மிகப்பெரிய அளவிலான டிரான்ஸ்கிரிப்ஷன்களுக்குப் பிரித்துச் செலவிட முடியும் (amortized), இதனால் ஆடியோவின் ஒரு யூனிட் செலவு API விகிதத்தை விடக் குறைவாக இருக்கும்.
  • கடுமையான தரவு-தனியுரிமை விதிகள் (Strict data-privacy mandates) – ஆடியோ உங்கள் இடத்திலிருந்து வெளியேறுவதைத் தடுக்கும் விதிமுறைகள், செலவைப் பொருட்படுத்தாமல் செயலாக்கத்தை உள்ளூரிலேயே (in-house) வைத்திருக்க உங்களைத் தூண்டுகின்றன.
  • முன்மாதிரி உருவாக்கத்திற்கான (Prototyping) முழு மாடல் கட்டுப்பாடு – Whisper-ன் கட்டமைப்பு, prompts ஆகியவற்றை மாற்றியமைக்க அல்லது சொந்தத் தரவுகளில் நுணுக்கமாகச் சரிசெய்ய (fine-tune) வேண்டிய ஆரம்பக்கட்ட சோதனைகளுக்கு, checkpoint-ஐ நேரடியாக வைத்திருப்பது பயனளிக்கும்.

இந்தச் சூழல்களுக்கு வெளியே, “இலவச” மாடல் மிகவும் செலவுமிக்கதாக மாறுகிறது, ஏனெனில் மறைந்துள்ள பொறியியல் கடன் மற்றும் பயன்படுத்தப்படாத GPU நேரம் ஆகியவை API-ன் குறைந்த வினாடி கட்டணத்தை விட மிக விரைவாகப் பெருகிவிடும்.

சுருக்கம்: Whisper-ன் உரிமக் கட்டணம் (license fee) இல்லாதது கவர்ச்சிகரமானது, ஆனால் அதன் மொத்த உரிமையாளர் செலவில் (total cost of ownership) GPU விலை, பயன்படுத்தப்படாத நேரம் மற்றும் பெரும்பாலான குழுக்கள் ஏற்கனவே டிரான்ஸ்கிரிப்ஷன் API-களுக்குப் பணிகளை ஒப்படைக்கும் பல்வேறு பொறியியல் பணிகளும் அடங்கும். நீங்கள் வன்பொருளை முழுமையாகப் பயன்படுத்த முடியும் என்றாலோ, தரவை உள்ளூரிலேயே வைத்திருக்க வேண்டும் என்றாலோ அல்லது மாடலின் மீது ஆழமான கட்டுப்பாட்டைப் பெற வேண்டியிருந்தாலோ மட்டுமே சுய-ஹோஸ்டிங் மலிவான வழியாகும். இல்லையெனில், “இலவச” மாடல் உங்கள் டிரான்ஸ்கிரிப்ஷன் பட்ஜெட்டில் மிகவும் விலையுயர்ந்த பகுதியாக இருக்கக்கூடும்.