Alibaba-র Qwen2.5-Max এবং DeepSeek-এর V3-Flash এই সপ্তাহে বাজারে এসেছে, যেখানে প্রতিটিই সস্তা AI inference-এর জন্য ভিন্ন পথ বেছে নিয়েছে। Alibaba তাদের ২.৪ ট্রিলিয়ন-প্যারামিটার বিশিষ্ট mixture-of-experts (MoE) ডিজাইনের মাধ্যমে প্রতিটি কুয়েরিতে মাত্র প্রায় ৯৫ বিলিয়ন প্যারামিটার সক্রিয় করে; অন্যদিকে DeepSeek প্রতি টোকেনের দাম কমাতে তাদের আর্কিটেকচারটি সংকুচিত করেছে। AI-এর এই লড়াই এখন আর শুধু মডেলের আকারের ওপর নয়, বরং প্রতি টোকেনে কত ডলার খরচ হচ্ছে তার ওপর ভিত্তি করে পরিমাপ করা হচ্ছে।

"বেশি প্যারামিটার" থেকে "কম খরচ"-এর দিকে

বছরের পর বছর ধরে large-language-model (LLM) উন্নয়নের প্রধান মাপকাঠি ছিল প্যারামিটার সংখ্যা। OpenAI, Google এবং অন্যান্যরা ট্রিলিয়ন-প্যারামিটার সীমা অতিক্রম করার বিষয়ে গর্ব করত, এই ধারণা নিয়ে যে বড় মানেই বেশি বুদ্ধিমান। Alibaba এবং DeepSeek দেখাচ্ছে যে এখন হিসাব বদলে গেছে।

Alibaba-র Qwen2.5-Max এখনও স্কেলের ওপর নির্ভর করে, তবে এটি একটি খরচ বাঁচানোর কৌশল যোগ করেছে। একটি dense মডেলে প্রতিটি inference-এর সময় প্রতিটি প্যারামিটার কাজ করে, যা ২.৪ ট্রিলিয়ন-প্যারামিটার নেটওয়ার্ককে একটি শক্তি-ক্ষয়ী দানবে পরিণত করে। MoE নেটওয়ার্কটিকে অনেকগুলো "expert"-এ বিভক্ত করে এবং প্রতিটি রিকোয়েস্টকে একটি নির্দিষ্ট উপসেটে পাঠিয়ে দেয়। Qwen2.5-Max-এর রাউটার যেকোনো প্রম্পটের জন্য প্রায় ৯৫ বিলিয়ন প্যারামিটার বেছে নেয়, যা ল্যাটেন্সি এবং শক্তি নিয়ন্ত্রণে রেখে একটি ট্রিলিয়ন-প্যারামিটার সিস্টেমের মতো রিজনিং ক্ষমতা প্রদান করে।

DeepSeek ট্রিলিয়ন-প্যারামিটার অর্জনের উচ্চাকাঙ্ক্ষা পুরোপুরি এড়িয়ে গেছে। এর V3-Flash মডেলটি সস্তায়, দ্রুত এবং বড় পরিসরে চালানোর জন্য তৈরি করা হয়েছে। কোম্পানিটি মডেলটিকে "ultra-low inference pricing"-এর মাধ্যমে বাজারজাত করছে, যাদের লক্ষ্য হলো সেই ডেভেলপাররা যারা প্রতিদিন লক্ষ লক্ষ টোকেন প্রসেস করেন কিন্তু অতিরিক্ত খরচ করতে চান না। সঠিক দাম প্রকাশ করা হয়নি, তবে বার্তাটি স্পষ্ট: যদি কোনো স্টার্টআপ পশ্চিমা দেশগুলোর প্রতি-টোকেন রেট বহন করতে না পারে, তবে V3-Flash একটি কার্যকর বিকল্প হয়ে উঠবে।

কেন Inference Cost একটি প্রতিযোগিতামূলক সুবিধা হয়ে উঠছে

মডেলগুলো যখন ল্যাব থেকে বেরিয়ে প্রোডাকশনে আসে, তখন inference cost অত্যন্ত গুরুত্বপূর্ণ হয়ে ওঠে। যেসব এন্টারপ্রাইজ চ্যাটবট, ডকুমেন্ট-অ্যানালাইসিস পাইপলাইন বা রিকমেন্ডেশন ইঞ্জিনে LLM ব্যবহার করে, তারা দ্রুত বুঝতে পারে যে টোকেন-ভিত্তিক মূল্য নির্ধারণ তাদের পরিচালন ব্যয়ের (operating expenses) একটি বড় অংশ হয়ে দাঁড়িয়েছে। যে মডেলের প্রতি টোকেন খরচ অর্ধেক, সেটি অন্যান্য উদ্যোগের জন্য বাজেট দ্বিগুণ করতে পারে—যেমন আরও বেশি ডেটা, উচ্চ ট্রাফিক বা অতিরিক্ত ফিচার।

এই দুটি চীনা প্রতিষ্ঠান ভিন্ন ভিন্ন মার্কেট সেগমেন্টকে লক্ষ্য করছে। Alibaba-র MoE জটিল এবং রিজনিং-নির্ভর কাজের জন্য উচ্চ পারফরম্যান্সের প্রতিশ্রুতি দেয়, পাশাপাশি প্রতি রিকোয়েস্টের কম্পিউট বাজেটও নিয়ন্ত্রণে রাখে। অন্যদিকে, DeepSeek-এর হালকা মডেলটি উচ্চ-ভলিউম এবং ল্যাটেন্সি-সংবেদনশীল কাজের জন্য উপযোগী, যেখানে কাঁচা শক্তি বা raw horsepower-এর চেয়ে অনুমেয় খরচ বেশি গুরুত্বপূর্ণ।

উভয় কৌশলই পশ্চিমা প্রদানকারীদের অবস্থান দুর্বল করতে পারে, যারা বড় মডেলগুলোকে প্রিমিয়াম মূল্যে বিক্রি করে। যদি ডেভেলপাররা সস্তা টোকেন মূল্যে সমতুল্য ফলাফল পেতে পারেন, তবে দামী API ব্যবহার করার আগ্রহ কমে যাবে।

বৈশ্বিক AI ইকোসিস্টেমের জন্য প্রভাব

  • স্টার্টআপ এবং SME: কম inference cost AI-চালিত পণ্যের ক্ষেত্রে বাধা কমিয়ে দেয়। যেসব টিমের একসময় API বিলের জন্য অতিরিক্ত মূলধনের প্রয়োজন হতো, তারা এখন সীমিত বাজেটেও প্রোটোটাইপ তৈরি এবং লঞ্চ করতে পারে।
  • এন্টারপ্রাইজ: অভ্যন্তরীণ AI পরিষেবা চালনা করা বড় কর্পোরেশনগুলো তাদের পরিচালন ব্যয় কমাতে পারে, যা ডেটা সংগ্রহ, মডেল ফাইন-টিউনিং বা অতিরিক্ত কম্পিউট করার জন্য তহবিল খালি করে।
  • পশ্চিমা প্রদানকারী: তাদের রেভিনিউ মডেল প্রতি-টোকেন চার্জের ওপর নির্ভরশীল। খরচ-কেন্দ্রিক বিকল্পগুলোর দিকে এই পরিবর্তন তাদের দাম কমাতে অথবা এমন সক্ষমতার মাধ্যমে নিজেদের আলাদা করতে বাধ্য করবে যা সস্তা মডেলগুলো এখনও অর্জন করতে পারেনি।
  • নিয়ন্ত্রক এবং নীতি-নির্ধারক: আরও সাশ্রয়ী AI বিভিন্ন সেক্টরে এর ব্যবহার ত্বরান্বিত করতে পারে, যা তদারকি, ডেটা গোপনীয়তা এবং অটোমেশনের গতি নিয়ে প্রশ্ন তুলতে পারে।

সীমাবদ্ধতা এবং পাল্টা যুক্তি

Qwen2.5-Max-এর মতো MoE মডেলগুলো কোনো জাদুকরী সমাধান নয়। রাউটিং লজিক ইঞ্জিনিয়ারিংয়ের জটিলতা বাড়িয়ে দেয় এবং sparse activation বিভিন্ন ধরণের কুয়েরির ক্ষেত্রে অসম পারফরম্যান্স তৈরি করতে পারে। যদি রাউটার ভুল করে, তবে একটি রিকোয়েস্ট অনুপযুক্ত (sub-optimal) এক্সপার্টদের কাজে লাগাতে পারে, যা আউটপুটের মান কমিয়ে দেয়। তাছাড়া, হার্ডওয়্যার এখনও dense compute-এর দিকে বেশি ঝুঁকে আছে; MoE inference-এর জন্য বিশেষায়িত এক্সিলারেটর এখনও ব্যাপকভাবে প্রচলিত নয়, যা বাস্তব ক্ষেত্রে দক্ষতার উন্নতিকে সীমিত করতে পারে।

DeepSeek-এর খরচ-কেন্দ্রিক দর্শনও কিছু ঝুঁকি বহন করে। আক্রমণাত্মক মূল্য নির্ধারণের অর্থ প্রায়ই মডেলের আকার এবং ট্রেনিং ডেটার ওপর কঠোর সীমাবদ্ধতা, যা পারফরম্যান্সকে সীমিত করতে পারে। যেসব অ্যাপ্লিকেশনের সূক্ষ্ম রিজনিং প্রয়োজন, সেখানে সস্তা মডেলটি হয়তো পিছিয়ে পড়তে পারে, যা ব্যবহারকারীদের আবার বড় এবং দামী বিকল্পগুলোর দিকে ঠেলে দেবে।

পরিশেষে, "প্রতি ডলারে বুদ্ধিমত্তা" প্রতিযোগিতার কেবল একটি দিক মাত্র। ল্যাটেন্সি, নির্ভরযোগ্যতা, ইকোসিস্টেম সাপোর্ট এবং আঞ্চলিক রেগুলেশন মেনে চলা এখনও নির্ণায়ক ভূমিকা পালন করবে। যে কোম্পানিগুলো এই সমস্ত ক্ষেত্রে একটি ভারসাম্যপূর্ণ প্যাকেজ প্রদান করবে তারাই সম্ভবত আধিপত্য বিস্তার করবে, শুধু যারা দামের লড়াইয়ে জিতবে তারা নয়।

পরবর্তীতে যা লক্ষ্য রাখা প্রয়োজন

  • বেঞ্চমার্ক প্রকাশ: Qwen2.5-Max-এর MoE রাউটিং দক্ষতা এবং V3-Flash-এর টোকেন খরচের স্বতন্ত্র মূল্যায়ন প্রকাশ করবে যে এই হাইপ বাস্তবে পরিমাপযোগ্য সাশ্রয়ে রূপান্তরিত হয় কি না।
  • হার্ডওয়্যার উন্নয়ন: স্পার্স অ্যাক্টিভেশনের (sparse activation) জন্য অপ্টিমাইজ করা অ্যাক্সিলারেটরগুলোর ব্যবহার MoE-এর সুবিধাগুলোকে আরও বাড়িয়ে তুলতে পারে, অন্যদিকে সাধারণ উদ্দেশ্যে ব্যবহৃত GPU-গুলো ডেন্স মডেলগুলোকে (dense models) প্রতিযোগিতামূলক রাখতে পারে।
  • মূল্য নির্ধারণ সংক্রান্ত প্রতিক্রিয়া: পশ্চিমা প্রদানকারী সংস্থাগুলো তাদের টায়ার বা স্তরগুলো সমন্বয় করতে পারে অথবা ব্যাচ ইনফারেন্স ডিসকাউন্ট বা অন-প্রিমিস লাইসেন্সিংয়ের মতো খরচ সাশ্রয়ী ফিচার যোগ করতে পারে।
  • নিয়ন্ত্রক পদক্ষেপ: সস্তা AI যত ছড়িয়ে পড়বে, সরকারগুলো স্বচ্ছতা এবং নিরাপত্তার জন্য এমন মানদণ্ড প্রবর্তন করতে পারে যা এই মডেলগুলোর বৃহৎ পরিসরে ব্যবহারের ক্ষেত্রে প্রভাব ফেলতে পারে।

সারসংক্ষেপ

আলিবাবার MoE-চালিত Qwen2.5-Max এবং DeepSeek-এর স্বল্পমূল্যের V3-Flash দেখায় যে, AI প্রতিযোগিতা এখন প্যারামিটার সংখ্যার পাশাপাশি বাজেটের ওপরও অনেকাংশে নির্ভরশীল। যে কোম্পানিগুলো প্রতি-টোকেন খরচ কম রেখে উন্নত ভাষাগত সক্ষমতা প্রদান করবে, তারা AI-কে আরও বিস্তৃত ব্যবহারকারীদের কাছে পৌঁছে দেবে, যা দীর্ঘকাল ধরে সবচেয়ে বড় এবং সবচেয়ে ব্যয়বহুল মডেলগুলোর অনুকূলে থাকা প্রতিযোগিতামূলক গতিশীলতাকে নতুন রূপ দেবে।