ওপেন-সোর্স মডেল API-গুলো খুব কমই স্থির থাকে। Novita এবং StreamLake উভয়ই Large Language Model ব্যবহারের জন্য তাদের চার্জ বা ফি পরিবর্তন করেছে, এবং আপনি যদি এই প্ল্যাটফর্মগুলোর মাধ্যমে প্রোডাকশন ট্রাফিক চালান, তবে আপনার এখনই নতুন হিসাবগুলো দেখে নেওয়া উচিত। টোকেন ইকোনমিক্স নির্ধারণ করে যে একটি AI ফিচার লাভজনক হবে নাকি এটি অর্থ অপচয়ের একটি উৎস হয়ে দাঁড়াবে। যখন প্রতি মিলিয়ন টোকেনের রেট পরিবর্তিত হয়, তখন আপনার মাসিক ক্লাউড খরচও তার সাথে পরিবর্তিত হয়।
কেন LLM-এর দাম ক্রমাগত পরিবর্তিত হয়
বার্ষিক চুক্তির প্রথাগত সফটওয়্যার লাইসেন্সের মতো নয়, বেশিরভাগ LLM ইনফারেন্স (inference) ইউটিলিটির মতো বিল করা হয়। আপনি যা ব্যবহার করেন তার জন্য অর্থ প্রদান করেন, যা সাধারণত টোকেন হিসেবে পরিমাপ করা হয়। একজন প্রোভাইডারের রেট কার্ড একটি পরিবর্তনশীল নথি। যখন অন্তর্নিহিত GPU ক্লাস্টারগুলো সস্তা হয়, যখন নতুন মডেল ওয়েট (model weights) পুরনোগুলোর জায়গা নেয়, অথবা যখন কোনো প্ল্যাটফর্ম মুনাফার ভিত্তিতে প্রতিযোগিতা করার সিদ্ধান্ত নেয়, তখন এটি পরিবর্তিত হয়।
প্রোটোটাইপ করার সময় এই অস্থিরতা উপেক্ষা করা সহজ। প্রতিদিন কয়েক হাজার টোকেন খরচ করা একটি সাইড প্রজেক্টের ক্ষেত্রে বিশ শতাংশ দামের পরিবর্তন খুব একটা চোখে পড়বে না। কিন্তু প্রোডাকশন ওয়ার্কলোড (production workloads) সম্পূর্ণ আলাদা। একটি কাস্টমার-ফেসিং চ্যাটবট, একটি ডকুমেন্ট পার্সার, বা একটি কোড-জেনারেশন পাইপলাইন প্রতি মাসে সহজেই কয়েকশ মিলিয়ন টোকেন ব্যবহার করতে পারে। সেই স্কেলে, প্রতি-টোকেন প্রাইসিংয়ের সামান্য পরিবর্তনও আপনার ইনফ্রাস্ট্রাকচার বাজেটকে বদলে দিতে পারে।
Novita এবং StreamLake উভয়ই এই উচ্চ-পরিবর্তনশীল প্রাইসিং পরিবেশে কাজ করে। তারা কেবল একটি মডেল পুনরায় বিক্রি করছে না; তারা একই ছাতার নিচে বিভিন্ন ওপেন-ওয়েট (open-weight) এবং প্রোপাইটরি (proprietary) এন্ডপয়েন্ট হোস্ট করে। যখন তারা তাদের ট্যারিফ আপডেট করে, তখন তার প্রভাব আপনি তাদের API-এর মাধ্যমে ইন্টিগ্রেট করা প্রতিটি মডেলের ওপর পড়ে।
Novita এবং StreamLake কী করে
উভয় প্ল্যাটফর্মই ইনফারেন্স প্রোভাইডার বা API গেটওয়ে হিসেবে কাজ করে। আপনার নিজস্ব GPU-তে Llama, Mistral, Qwen বা অন্যান্য মডেল সেলফ-হোস্ট করার পরিবর্তে, আপনি তাদের এন্ডপয়েন্টে রিকোয়েস্ট পাঠান। আপনি স্ট্যান্ডার্ড অথেন্টিকেশন, লোড ব্যালেন্সিং এবং কখনও কখনও বেশ কয়েকটি মডেল ফ্যামিলির মধ্যে ইউনিফাইড ফরম্যাটিং পান। এর বিনিময়ে আপনাকে র (raw) কম্পিউট খরচের পরিবর্তে প্ল্যাটফর্মের নির্ধারিত (marked-up) রেট প্রদান করতে হয়।
তাদের প্রাইসিং পেজে ইনপুট টোকেন (প্রম্পট) এবং আউটপুট টোকেন (কমপ্লিশন)-এর জন্য আলাদা রেট তালিকাভুক্ত করা থাকে। কিছু মডেল বড় কনটেক্সট উইন্ডো বা বিশেষায়িত ভ্যারিয়েন্টের জন্য অতিরিক্ত প্রিমিয়াম চার্জও গ্রহণ করে। যেহেতু তারা অনেক মডেলকে একত্রিত করে, তাই Novita বা StreamLake-এর একটি মাত্র প্রাইসিং আপডেট একসাথে একাধিক এন্ডপয়েন্টকে প্রভাবিত করতে পারে। আপনি লগ-ইন করে দেখতে পারেন যে গত কোয়ার্টারে আপনি যে সস্তা সামারাইজেশন মডেলটি বেছে নিয়েছিলেন, সেটি এখন একই প্ল্যাটফর্মের একটি বড় বিকল্পের চেয়েও বেশি ব্যয়বহুল হয়ে গেছে।
সাম্প্রতিক পরিবর্তনগুলো আপনার বিলের ওপর কীভাবে প্রভাব ফেলবে
Novita এবং StreamLake-এর সাম্প্রতিক আপডেটগুলো বেশ কিছু মডেলের রেট কার্ড পরিবর্তন করেছে। আপনি যদি আপনার বর্তমান ইন্টিগ্রেশনগুলো অডিট না করেন, তবে আপনি মূলত অন্ধভাবে নতুন শর্তাবলীতে সম্মতি দিচ্ছেন। দামের পরিবর্তনগুলো সরাসরি এবং পরিমাপযোগ্য উপায়ে Large Language Model ব্যবহারের খরচকে প্রভাবিত করে:
- প্রতি-টোকেন রেট: ইনপুট এবং আউটপুট খরচের মধ্যে পার্থক্য দেখা দিতে পারে। আউটপুট টোকেন সাধারণত বেশি ব্যয়বহুল হয় কারণ টেক্সট পড়ার চেয়ে টেক্সট তৈরি করতে বেশি কম্পিউট প্রয়োজন হয়। যদি প্রোভাইডার আউটপুট প্রাইসিং আনুপাতিকভাবে বেশি বাড়িয়ে দেয়, তবে যে কোনো ভার্বোস (verbose) অ্যাপ্লিকেশন বা বিস্তারিত উত্তর প্রদানকারী অ্যাপ্লিকেশনের খরচ বহুগুণ বেড়ে যাবে।
- মডেল-নির্দিষ্ট সমন্বয়: প্রতিটি এন্ডপয়েন্ট একইভাবে পরিবর্তিত হয় না। একটি জনপ্রিয় মডেল সস্তা হতে পারে, আবার একটি নির্দিষ্ট বা নিশ (niche) ভ্যারিয়েন্ট আরও ব্যয়বহুল হতে পারে। চার্ট চেক না করলে, আপনি আপনার বাজেটের জন্য ভুল এন্ডপয়েন্টের মাধ্যমে ট্রাফিক চালাতে পারেন।
- টিয়ারড (Tiered) বা ভলিউম ডিসকাউন্ট: কিছু প্রোভাইডার সেই থ্রেশহোল্ড বা সীমা পরিবর্তন করে যেখানে বাল্ক ডিসকাউন্ট কার্যকর হয়। আপনি যদি সম্প্রতি উচ্চতর ভলিউম ব্যান্ডের আওতায় এসে থাকেন, তবে নতুন প্রাইসিং আপনাকে সাহায্য করতে পারে, অথবা এটি সেই ডিসকাউন্টটি সরিয়ে নিতে পারে যা আপনি আশা করেছিলেন।
যেহেতু আপনি যা ব্যবহার করেন তার জন্য অর্থ প্রদান করেন, তাই খরচ নিয়ন্ত্রণ করার একমাত্র উপায় হলো আপনার ওয়ার্কলোডকে বর্তমান প্রাইস স্ট্রাকচারের সাথে সামঞ্জস্যপূর্ণ করা। পুরনো রেট কার্ড এখন কেবল ঐতিহাসিক তথ্য মাত্র।
ডেভেলপারদের জন্য একটি ব্যবহারিক অডিট
আপনি যদি সম্প্রতি আপনার ইনফারেন্স খরচ পর্যালোচনা না করে থাকেন, তবে এখনই সঠিক সময়। ক্ষতি মূল্যায়ন করার এবং খরচ কমানোর একটি সহজ উপায় নিচে দেওয়া হলো:
১. আপনার ব্যবহারের লগ (usage logs) সংগ্রহ করুন। গত ত্রিশ দিন দেখুন। ইনপুট টোকেন থেকে আউটপুট টোকেন আলাদা করুন এবং মডেল অনুযায়ী সেগুলোকে ভাগ করুন। Novita এবং StreamLake-এর বেশিরভাগ ড্যাশবোর্ড এটি দেখায়, অথবা আপনি আপনার নিজস্ব রিকোয়েস্ট লগ থেকেও এটি বিশ্লেষণ করতে পারেন।
২. নতুন প্রাইসিংয়ের সাথে তুলনা করুন। আপনার টোকেন সংখ্যা নিন এবং সেটিকে আপডেট করা রেট দিয়ে গুণ করুন। সেই ফিগারটির সাথে গত মাসে পুরনো প্রাইসিং অনুযায়ী আপনি যা প্রদান করেছিলেন তার তুলনা করুন। এই পার্থক্যটিই হলো আপনার নতুন মাসিক খরচের হার।
3. মডেল পরিবর্তন মূল্যায়ন করুন। আপনি যে মডেলটি ব্যবহার করছেন সেটি যদি উল্লেখযোগ্যভাবে বেশি ব্যয়বহুল হয়ে যায়, তবে একই প্ল্যাটফর্মের কোনো সস্তা বিকল্প আপনার মানের মানদণ্ড পূরণ করে কি না তা পরীক্ষা করে দেখুন। একটি ছোট প্যারামিটার মডেল বা একটি quantized ভার্সন নিয়ে A/B টেস্ট করুন। অনেক সময় রুটিন কাজের জন্য নির্ভুলতার হ্রাস নগণ্য হয়।
4. আপনার প্রম্পটগুলো সংকুচিত করুন। যখন system prompt-এ অনেক few-shot উদাহরণ বা দীর্ঘ ডকুমেন্ট থাকে, তখন ইনপুট খরচ বেড়ে যায়। ইনজেকশন করার আগে কনটেক্সট সারসংক্ষেপ করার চেষ্টা করুন, max_token লিমিট কমিয়ে দিন, অথবা ওয়ার্কিং উইন্ডো ছোট করতে retrieval ব্যবহার করুন। ইনপুট থেকে আপনি যত টোকেন কমাতে পারবেন, নতুন রেটে তত টাকা সাশ্রয় হবে।
5. বাজেট অ্যালার্ট সেট করুন। বেশিরভাগ প্ল্যাটফর্ম আপনাকে খরচের সীমা (spending caps) বা দৈনিক ব্যবহার একটি নির্দিষ্ট সীমা অতিক্রম করলে webhook অ্যালার্ট কনফিগার করার সুযোগ দেয়। যদি এগুলো চালু না থাকে, তবে বিলিং সাইকেলের মাঝপথে দামের পরিবর্তন আপনাকে অবাক করে দিতে পারে।
রেট কার্ডের সূক্ষ্ম বিষয়গুলো পড়ুন
যখন আপনি আপডেট করা প্রাইসিং পর্যালোচনা করবেন, তখন শুধুমাত্র প্রতি-মিলিয়ন-টোকেন ফিচারের ওপর নির্ভর করবেন না। প্রোভাইডাররা প্রায়ই ডকুমেন্টেশনে সূক্ষ্ম বিষয়গুলো লুকিয়ে রাখে।
context caching উপলব্ধ কি না তা পরীক্ষা করুন। কিছু প্ল্যাটফর্ম একটি দীর্ঘ ডকুমেন্ট ক্যাশ করার জন্য একটি নির্দিষ্ট ফি চার্জ করে, এবং তারপরে পরবর্তী কলগুলোতে প্রতি-অনুরোধের খরচ কমিয়ে দেয়। যদি আপনার অ্যাপ্লিকেশন প্রতিবার একই ব্যাকগ্রাউন্ড কনটেক্সট পুনরায় পড়ে, তবে ক্যাশিং দামের বৃদ্ধি প্রশমিত করতে পারে।
এমন রেট লিমিটিংয়ের দিকে খেয়াল রাখুন যা পরোক্ষভাবে খরচ বাড়ায়। যদি নতুন প্রাইসিং আপনাকে উচ্চতর থ্রুপুট টিয়ারের দিকে ঠেলে দেয়, তবে আপনাকে হয়তো ক্যাপাসিটি রিজার্ভ করতে হতে পারে বা ন্যূনতম প্রতিশ্রুতি (minimum commitments) দিতে হতে পারে। এছাড়াও নিশ্চিত করুন যে API টোকেন জেনারেট করা অনুযায়ী বিল করে নাকি টোকেন রিকোয়েস্ট করা অনুযায়ী। একটি রিকোয়েস্ট যদি ম্যাক্স লেন্থ লিমিটে পৌঁছায়, তবে রেসপন্স কেটে গেলেও আপনাকে তার জন্য খরচ দিতে হবে।
আপনি যদি Novita বা StreamLake-এর মাধ্যমে fine-tuned বা প্রাইভেট এন্ডপয়েন্ট ব্যবহার করেন, তবে যাচাই করে নিন যে তাদের ইনফারেন্স ফি-এর পাশাপাশি হোস্টিং ফি পরিবর্তিত হয়েছে কি না। আপনি যদি মাঝে মাঝে বা বিরতি দিয়ে কাজ (intermittent workloads) চালান, তবে স্টোরেজ এবং কোল্ড-স্টার্ট খরচ টোকেন প্রাইসিংকে ছাড়িয়ে যেতে পারে।
একটি স্থিতিস্থাপক AI বাজেট তৈরি করা
কোনো একক প্রোভাইডারের হাতে আপনার পুরো ইনফারেন্স বাজেট যেন বন্দি না থাকে। লক্ষ্য হলো এমন সিস্টেম তৈরি করা যেখানে প্রাইসিং আপডেট হওয়া একটি রুটিন রক্ষণাবেক্ষণ প্রক্রিয়া, কোনো জরুরি অবস্থা নয়। আপনার ল্যাটেন্সি এবং নির্ভুলতার প্রয়োজনীয়তা অনুযায়ী বিকল্প মডেলগুলোর একটি তালিকা সবসময় প্রস্তুত রাখুন। আপনার কোডবেসে হালকা অ্যাবস্ট্রাকশন লেয়ার বজায় রাখুন যাতে আপনি বিজনেস লজিক পুনরায় না লিখেই এন্ডপয়েন্ট পরিবর্তন করতে পারেন।
খরচই একমাত্র চলক (variable) নয়। ল্যাটেন্সি, প্রাপ্যতা এবং কনটেক্সট-উইন্ডো সাইজও গুরুত্বপূর্ণ। কিন্তু দাম হলো সেই চলক যা কোনো সতর্কতা ছাড়াই পরিবর্তিত হয়। Novita এবং StreamLake-কে নির্দিষ্ট ইউটিলিটির পরিবর্তে ডাইনামিক মার্কেটপ্লেস হিসেবে বিবেচনা করে আপনি পরিস্থিতির চেয়ে এক ধাপ এগিয়ে থাকতে পারেন।
আসল শিক্ষা
আপনি যা পরিমাপ করতে পারেন না, তা অপ্টিমাইজ করতে পারবেন না। Novita এবং StreamLake-এর নতুন রেট কার্ড সামনে এসেছে। বিস্তারিত এখানে দেখুন, আপডেট করা খরচের বিপরীতে আপনার হিসাব পুনরায় যাচাই করুন এবং সিদ্ধান্ত নিন যে আপনার বর্তমান স্ট্যাকটি এখনও আর্থিকভাবে লাভজনক কি না। অডিটিং করার জন্য ব্যয় করা কয়েক ঘণ্টা ভবিষ্যতে ফিন্যান্স টিমের সাথে বড় কোনো জটিলতা এড়াতে সাহায্য করবে।
আপনি যদি অন্যান্য বিল্ডারদের সাথে অভিজ্ঞতা বিনিময় করতে চান যারা বিভিন্ন প্রোভাইডারের ইনফারেন্স খরচ ট্র্যাক করছেন, তবে কৌশলগুলো তুলনা করার জন্য GyaanSetu learning community একটি ভালো জায়গা। প্রাইসিং পরিবর্তন তখনই কষ্টদায়ক হয় যখন তা আপনাকে অপ্রস্তুত অবস্থায় ধরে ফেলে।
