Whisper বনাম API: যখন একটি “ফ্রি” মডেল সবচেয়ে ব্যয়বহুল খাতে পরিণত হয়
আপনার টিম AssemblyAI-এর বিল দেখে। কেউ একজন জিজ্ঞেস করে: "টাকা বাঁচাতে আমরা কেন নিজেরাই Whisper হোস্ট করছি না?"
শুনতে সহজ মনে হয়। একটি checkpoint ডাউনলোড করুন। একটি কমান্ড চালান। এক বিকেলেই কাজ শেষ।
কিন্তু আসল প্রশ্ন হলো: আগামী দুই বছর সেই endpoint চালানোর খরচ কত হবে?
কেন API বিল সস্তা মনে হয়
Managed transcription সার্ভিসগুলো প্রসেস করা অডিওর প্রতি সেকেন্ডের ভিত্তিতে চার্জ করে। উদাহরণস্বরূপ, AssemblyAI তার asynchronous pipeline-এর মাধ্যমে প্রবাহিত প্রতি এক ঘণ্টার কন্টেন্টের জন্য প্রায় $0.15 – $0.21 বিল করে। এই সংখ্যাগুলোর আড়ালে অনেক কাজ লুকিয়ে আছে: প্রোভাইডার inference hardware রক্ষণাবেক্ষণ করে, নয়েজযুক্ত অডিও পরিষ্কার করে, স্পিকারদের আলাদা করে, এনটিটি ফরম্যাট করে (ক্রেডিট কার্ড নম্বর, ইমেল, ভেরিফিকেশন কোড), রিয়েল-টাইমে ফলাফল স্ট্রিম করে এবং ২৪ × ৭ সার্ভিস মনিটর করে। আপনি যে ইনভয়েস পান তা হলো এই সবকিছুর সমষ্টি, যা একটি সহজ প্রতি-সেকেন্ড রেটে গুছিয়ে দেওয়া হয়েছে।
GPU-এর দামের প্রকৃত অর্থ কী
Whisper Large-v3 একটি মাত্র A100 বা H100 GPU-তে চলতে পারে। ক্লাউড প্রোভাইডাররা অন-ডিমান্ড হিসেবে এই কার্ডগুলোর দাম প্রতি ঘণ্টায় $2 – $4 হিসেবে তালিকাভুক্ত করে। আসল সমস্যা হলো, চিপটি যখন অব্যবহৃত (idle) থাকে তখনও আপনাকে পুরো ঘণ্টার দাম দিতে হয়। যদি আপনার কাজের চাপ GPU-এর ক্ষমতার মাত্র ১৫% ব্যবহার করে, তবুও আপনাকে পুরো $2 – $4 চার্জ দিতে হবে।
আপনি যে ইঞ্জিনিয়ারিং ডেট (Engineering debt) উত্তরাধিকারসূত্রে পাচ্ছেন
সেলফ-হোস্টিং শুধুমাত্র একটি মডেল checkpoint লঞ্চ করার মধ্যেই সীমাবদ্ধ নয়। এর পেছনের লুকানো কাজগুলো দ্রুত মূল হার্ডওয়্যার খরচের চেয়ে বেশি হয়ে দাঁড়ায়।
- Speaker diarization – ওপেন-সোর্স Whisper কণ্ঠস্বর আলাদা করতে পারে না। একটি নির্ভরযোগ্য diarization pipeline তৈরি করতে আলাদা মডেল, ডেটা এবং ক্রমাগত টিউনিং প্রয়োজন।
- Streaming support – Whisper পুরো ফাইলগুলো asynchronously প্রসেস করে। রিয়েল-টাইম ক্যাপশন বা ভয়েস-এজেন্ট রেসপন্সের জন্য একটি কাস্টম streaming layer প্রয়োজন, যার সাথে back-pressure handling এবং latency monitoring সুবিধাও থাকতে হবে।
- Entity formatting – র (Raw) ট্রান্সক্রিপ্টে সংবেদনশীল তথ্য মাস্ক বা রিফরম্যাট করার লজিক থাকে না। ক্রেডিট কার্ড নম্বর, ইমেল অ্যাড্রেস বা OTP কোডের জন্য নিয়ম যোগ করা একটি জটিল ইঞ্জিনিয়ারিং কাজ, এবং একটি ছোট ভুলও ট্রান্সক্রিপ্টটিকে ব্যবহারের অনুপযোগী করে তুলতে পারে।
- Reliability engineering – একটি মাত্র GPU-তে ডেমো চালানো সহজ; কিন্তু একটি প্রোডাকশন সার্ভিসের ক্ষেত্রে concurrency, retries, zero-downtime upgrades এবং alerting সামলাতে হয়।
কখন সেলফ-হোস্টিং আসলে লাভজনক হয়
মাত্র কয়েকটি নির্দিষ্ট পরিস্থিতিতে হিসাবটি উল্টে যায়:
- ভারী এবং নিরবিচ্ছিন্ন ব্যাচ প্রসেসিং – যদি আপনার কাছে মাসের পর মাস GPU-কে প্রায় ১০০% ইউটিলাইজেশনে রাখার মতো যথেষ্ট অডিও থাকে, তবে প্রতি ঘণ্টার হার্ডওয়্যার চার্জটি বিশাল পরিমাণ ট্রান্সক্রিপশনের মাধ্যমে অ্যামর্টাইজ (amortized) করা সম্ভব, যা প্রতি অডিওর খরচকে API রেটের চেয়ে কম করে দেয়।
- কঠোর ডেটা-প্রাইভেসি নিয়মাবলী – যেসব রেগুলেশন অডিওকে আপনার প্রাঙ্গণ (premises) থেকে বাইরে যেতে বাধা দেয়, সেগুলো আপনাকে খরচ যাই হোক না কেন, ইন-হাউস প্রসেসিং করতে বাধ্য করে।
- প্রোটোটাইপিংয়ের জন্য পূর্ণ মডেল নিয়ন্ত্রণ – প্রারম্ভিক পর্যায়ের পরীক্ষাগুলো যেখানে Whisper-এর আর্কিটেকচার, প্রম্পট পরিবর্তন বা নিজস্ব ডেটার ওপর fine-tune করার প্রয়োজন হয়, তারা সরাসরি checkpoint মালিকানার সুবিধা পায়।
এই ক্ষেত্রগুলোর বাইরে, “ফ্রি” মডেলটি সবচেয়ে ব্যয়বহুল খাতে পরিণত হয় কারণ লুকানো ইঞ্জিনিয়ারিং ডেট এবং অব্যবহৃত GPU-এর সময় দ্রুত API-এর সামান্য প্রতি-সেকেন্ড ফি-কে ছাড়িয়ে যায়।
সারকথা: Whisper-এর জিরো-লাইসেন্স ফি লোভনীয়, কিন্তু মালিকানার মোট খরচ (total cost of ownership)-এর মধ্যে GPU-এর দাম, অব্যবহৃত সময় এবং একগুচ্ছ ইঞ্জিনিয়ারিং কাজ অন্তর্ভুক্ত থাকে যা বেশিরভাগ টিম ইতিমধ্যে ট্রান্সক্রিপশন API-এর মাধ্যমে আউটসোর্স করে থাকে। শুধুমাত্র যখন আপনি হার্ডওয়্যারটি পুরোপুরি ব্যবহার করতে পারেন, ডেটা অন-প্রেম (on-prem) রাখতে বাধ্য হন, অথবা মডেলের গভীর নিয়ন্ত্রণ প্রয়োজন হয়, তখনই সেলফ-হোস্টিং সাশ্রয়ী পথ হয়ে ওঠে। অন্যথায়, “ফ্রি” মডেলটি সম্ভবত আপনার ট্রান্সক্রিপশন বাজেটের সবচেয়ে ব্যয়বহুল অংশ।
