Nvidia ১১ আগস্ট Nemotron 3.5 Lightning প্রকাশ করেছে। ৩০-বিলিয়ন প্যারামিটারের এই mixture-of-experts মডেলটি মাত্র ৩ বিলিয়ন সক্রিয় প্যারামিটার নিয়ে চলে, এবং এর সহযোগী NeMo Switchyard রাউটিং লাইব্রেরিটি ইতিমধ্যে ইনফারেন্স খরচ এবং ক্যাশ দক্ষতার (cache efficiency) বিষয়ে বিতর্কের জন্ম দিয়েছে। Switchyard যেভাবে মডেলগুলোর মধ্যে রিকোয়েস্ট আদান-প্রদান করে, তা প্রম্পট ক্যাশ নষ্ট করে দিতে পারে এবং একটি মাত্র ইনফারেন্স সেশনের বিল দ্বিগুণ করে দিতে পারে।
ওপেন-ওয়েট এজেন্টদের জন্য তৈরি একটি মডেল
Nemotron 3.5 Lightning সেই সব AI এজেন্টদের লক্ষ্য করে তৈরি করা হয়েছে যারা টুল ব্যবহার করে, ফলাফল যাচাই করে এবং একটি রিজনিং ট্রেস (reasoning trace) বজায় রাখে। তিনটি প্রযুক্তিগত বৈশিষ্ট্য একে আলাদা করে তুলেছে:
- Hybrid architecture – এটি একটি Mamba-2 state-space কোরকে প্রচলিত Transformer-এর সাথে যুক্ত করে, যা প্রমাণ করে যে নন-Transformer ডিজাইনগুলোও এই স্কেলে প্রতিযোগিতা করতে পারে।
- 4-bit floating-point quantization – লো-প্রিসিশনে (low-precision) থাকার কারণে ৩০ B মডেলটি একটি M5 Max MacBook Pro-তে প্রতি সেকেন্ডে প্রায় ১০০টি টোকেন তৈরি করতে পারে, যা একটি ফুল-প্রিসিশন মডেলের পক্ষে অর্জন করা কঠিন।
- Full openness – Nvidia এর ওয়েট ফাইল এবং সম্পূর্ণ ট্রেনিং রেসিপি প্রকাশ করেছে, যা উচ্চ-ক্ষমতাসম্পন্ন ইনফারেন্সের জন্য তৈরি কোনো মডেলের ক্ষেত্রে বিরল।
প্রাথমিক ব্যবহারকারীরা বলছেন যে মডেলটি "অতিরিক্ত চিন্তা" (over-think) করতে পারে, যা অনেক সময় ভুলসহ দীর্ঘ রিজনিং চেইন তৈরি করে। ডেভেলপাররা একটি শক্তিশালী এবং উন্মুক্ত এজেন্ট এক্সিকিউটর পাচ্ছেন, তবে অপ্রয়োজনীয় কথা এড়াতে তাদের সতর্কতার সাথে প্রম্পট দিতে হবে।
রাউটিং লেয়ার কেন গুরুত্বপূর্ণ
NeMo Switchyard হলো Nvidia-র একটি লাইব্রেরি যা সম্ভাব্য মডেলগুলোর মধ্য থেকে একটি রিকোয়েস্টকে ডায়নামিকভাবে "সেরা" মডেলের কাছে পাঠাতে (routing) সাহায্য করে। তাত্ত্বিকভাবে, একটি রাউটার প্রতিটি কুয়েরির জন্য একটি বিশেষজ্ঞ মডেল নির্বাচন করে উত্তরের মান বাড়াতে পারে। বাস্তবে, রাউটিং সিদ্ধান্তটি প্রম্পট-ক্যাশিং মেকানিজমের সাথে সাংঘর্ষিক হয়, যার ওপর অনেক ইনফারেন্স পাইপলাইন নির্ভর করে।
- Prompt caches প্রাথমিক প্রম্পটের টোকেন এমবেডিংগুলো (token embeddings) সংরক্ষণ করে যাতে পরবর্তী জেনারেশনগুলো "prefill" ধাপটি পুনরায় গণনা না করেই সেগুলো ব্যবহার করতে পারে।
- Routing swaps প্রথম কয়েকটি টোকেনের পর একটি রিকোয়েস্টকে Model A থেকে Model B-তে স্থানান্তর করে, যা সিস্টেমকে ক্যাশ করা প্রম্পটটি ফেলে দিতে এবং নতুন মডেলের জন্য এটি শুরু থেকে পুনরায় গণনা করতে বাধ্য করে।
যেহেতু AI-এর বেশিরভাগ খরচ নতুন টোকেন তৈরির চেয়ে ক্যাশ করা প্রম্পট পড়ার পেছনে ব্যয় হয়, তাই একটি মাত্র রাউটিং হপ (routing hop) কার্যকরভাবে একটি রিকোয়েস্টের খরচ দ্বিগুণ করে দিতে পারে।
খরচের টানাপোড়েন
সামনে কী আসছে
এই বিতর্কটি এমন সময়ে এসেছে যখন Nvidia-র ওপেন-ওয়েট কৌশল সরাসরি প্রতিযোগিতার মুখে পড়েছে। ১৫ আগস্ট Qwen 3.8-27B লঞ্চ হবে এবং প্রাথমিক বেঞ্চমার্কগুলো ইঙ্গিত দিচ্ছে যে এটি লোকাল ডেভেলপমেন্ট সিনারিওতে Nemotron 3.5 Lightning-এর সাথে পাল্লা দিতে সক্ষম।
Nvidia-র কৌশল—ওপেন ওয়েট, ওপেন ট্রেনিং রেসিপি এবং একটি ওপেন রাউটিং লেয়ার—এমনভাবে ডিজাইন করা হয়েছে যাতে যারা লোকালি এই মডেলগুলো চালান তাদের জন্য তাদের GPU-ই ডিফল্ট হার্ডওয়্যার হয়ে ওঠে। সফটওয়্যার স্ট্যাকটি উন্মুক্ত করার মাধ্যমে Nvidia আশা করছে যে ডেভেলপাররা তাদের ইকোসিস্টেমে আটকে পড়বেন, এমনকি যদি রাউটিং লজিকটি লুকানো অতিরিক্ত খরচও যোগ করে।
সারসংক্ষেপ
আপনি যদি আপনার নিজস্ব মেশিনে Nemotron 3.5 Lightning চালানোর পরিকল্পনা করেন, তবে কেবল "এটি কত দ্রুত জেনারেট করতে পারে?" তা নয়, বরং "Switchyard কতবার আমাকে আমার প্রম্পট ক্যাশ ফেলে দিতে বাধ্য করবে?" তাও জিজ্ঞাসা করুন। সেই উত্তরটিই নির্ধারণ করবে যে মডেলটির ওপেন-ওয়েট প্রতিশ্রুতি বাস্তব জীবনে সাশ্রয়ী হবে নাকি একটি ব্যয়বহুল পরীক্ষা। Qwen-এর মতো বিকল্পগুলো আসার সাথে সাথে, রাউটিং ফ্লেক্সিবিলিটি এবং ক্যাশ-চালিত খরচ দক্ষতার মধ্যে ভারসাম্যই ঠিক করবে কোন টুলকিট—এবং শেষ পর্যন্ত কোন হার্ডওয়্যার প্ল্যাটফর্ম—জয়ী হবে।
