Nemotron 3 Nano 30B A3B, এর পূর্বসূরি, ইতিমধ্যেই বড় ফাউন্ডেশন মডেলগুলোর একটি কম্প্যাক্ট বিকল্প হিসেবে পরিচিত ছিল। একটি হাইব্রিড Mamba-Transformer আর্কিটেকচারে পরিবর্তন এনে এবং যেকোনো মুহূর্তে মাত্র ৩.৬ বিলিয়ন প্যারামিটার সক্রিয় করার মাধ্যমে, Lightning দক্ষতার নতুন মাত্রা স্পর্শ করছে এবং একই সাথে অনেক বড় মডেলের সমতুল্য reasoning power প্রদান করছে।

কেন এখন গতি গুরুত্বপূর্ণ

AI এজেন্টগুলো এখন batch-style inference থেকে নিরবচ্ছিন্ন ইন্টারঅ্যাকশনের দিকে ধাবিত হচ্ছে। একটি চ্যাটবট যদি কয়েক সেকেন্ডের জন্য থেমে যায় তবে তা ধীরগতির মনে হয়; আবার একজন ডেভেলপারের টাইপিংয়ের সাথে code-completion tool-এর ধীরগতি কাজের প্রবাহ ব্যাহত করে। এই পরিস্থিতিতে, token-per-second throughput সরাসরি রেসপন্সিভনেস বা প্রতিক্রিয়ার গতির সাথে সম্পর্কিত। ৬৭০ টোকেন-প্রতি-সেকেন্ডের এই হারটি Google-এর Gemini 3.5 Flash-Lite-এর জন্য রিপোর্ট করা ৩৮৬ টোকেন-প্রতি-সেকেন্ডের প্রায় দ্বিগুণ, এবং এটি একটি স্ট্যান্ডার্ড Intelligence Index টাস্ক সম্পন্ন করার সময় কমিয়ে মাত্র আধা মিনিটে নিয়ে আসে। এর বিপরীতে, একই টাস্কের জন্য Qwen 3.6 35B A3B-এর ৩.৫ মিনিট এবং Gemma 4 31B-এর ৫.৮ মিনিট সময় প্রয়োজন হয়।

যে কোনো সার্ভিসের জন্য এই ব্যবধানটি অত্যন্ত গুরুত্বপূর্ণ যা অনেকগুলো সমসাময়িক রিকোয়েস্ট হ্যান্ডেল করতে হয়। একই হার্ডওয়্যারে একটি সার্ভার যদি দ্বিগুণ টোকেন প্রসেস করতে পারে, তবে তা হয় খরচ কমাতে পারে অথবা সক্ষমতা দ্বিগুণ করতে পারে, যা ক্লাউড প্রোভাইডার এবং এন্টারপ্রাইজগুলোর জন্য একটি স্পষ্ট সুবিধা।

মডেলটি কীভাবে এই ফলাফল অর্জন করে

Nemotron 3.5 Lightning-এর হাইব্রিড আর্কিটেকচার Transformers-এর long-range pattern-recognition ক্ষমতা এবং Mamba ব্লকের state-space দক্ষতার সমন্বয় ঘটায়। মডেলিং ক্ষমতা বজায় রাখতে এর মোট প্যারামিটার সংখ্যা ৩১.৬ বিলিয়ন রাখা হয়েছে, তবে যেকোনো নির্দিষ্ট টোকেনের জন্য মাত্র ৩.৬ বিলিয়ন প্যারামিটার সক্রিয় থাকে। এই sparse activation প্রতি টোকেনে compute কমিয়ে দেয়, যার ফলে গুণমান উল্লেখযোগ্যভাবে না কমিয়েই throughput বৃদ্ধি পায়।

Artificial Analysis Lightning-এর জন্য ২৪ স্কোর করেছে একটি Intelligence Index স্কোর, যা পূর্ববর্তী Nano মডেলের ১৫ স্কোরের তুলনায় নয় পয়েন্ট বেশি। এটি OpenAI-এর gpt-oss-120b-এর সমপর্যায়ে রয়েছে, যদিও Lightning মাত্র এক-চতুর্থাংশ প্যারামিটার ব্যবহার করে। এটি এখনও শীর্ষ মডেলগুলোর—Meta-র Muse Glimmer (৩৫) এবং Qwen 3.6 35B A3B (৩২)-এর চেয়ে কিছুটা পিছিয়ে থাকলেও, এর intelligence-to-parameter ratio অন্যতম সেরা।

এজেন্টিক বেঞ্চমার্কগুলোও একই চিত্র তুলে ধরে

Agentic workloads—যেমন পরিকল্পনা করা, টুল ব্যবহার করা এবং multi-step reasoning—এ Lightning দারুণ পারফর্ম করে। GDPval-AA v2 বেঞ্চমার্কে মডেলটি ৮২৪ Elo রেটিং অর্জন করেছে, যা ১২০-বিলিয়ন-প্যারামিটার বিশিষ্ট gpt-oss-120b (৮০০) এবং Nvidia-র নিজস্ব বড় মডেল Nemotron 3 Super (৬৯৮)-কে ছাড়িয়ে গেছে। Terminal-Bench v2.1 টেস্টে Lightning-এর সাফল্যের হার ৭% থেকে বেড়ে ২৪.৩% হয়েছে, যা gpt-oss-120b-এর রেকর্ড করা ২৬.২%-এর খুব কাছাকাছি।

Nvidia জানিয়েছে যে, ডোমেইন-স্পেসিফিক টাস্কগুলোতে মডেলটিকে টিউন করার জন্য CodeRabbit এবং Harvey-এর মতো পার্টনারদের সাথে post-training কোলাবরেশন মডেলটির সাফল্যের পেছনে কাজ করেছে। এই রিফাইনমেন্টগুলো মডেলটিকে দ্রুত রাখার পাশাপাশি বিশেষায়িত ওয়ার্কলোডে প্রতিযোগিতামূলক রাখতে সাহায্য করে।

প্রাপ্যতা এবং ব্যবহারিক বিষয়সমূহ

মডেলটি পারমিসিভ OpenMDW-1.1 লাইসেন্সের অধীনে পাওয়া যাচ্ছে, যার weights BF16 এবং NVFP4 ফরম্যাটে রয়েছে। NVFP4 ভেরিয়েন্টটি গুণমান খুব সামান্য কমিয়ে মডেলটিকে আরও কম্প্যাক্টভাবে উপস্থাপন করে, যা edge deployments বা সাশ্রয়ী ক্লাউড ইনস্ট্যান্সের জন্য একটি কার্যকর বিকল্প। এছাড়া, দশ লক্ষ (one-million) টোকেনের context window মডেলটিকে কোনো অংশ বাদ না দিয়ে অত্যন্ত দীর্ঘ প্রম্পট হ্যান্ডেল করতে সাহায্য করে, যা document-level analysis বা বিশাল codebase-এর জন্য অত্যন্ত মূল্যবান।

DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius এবং Crusoe-এর মতো প্রোভাইডারদের মাধ্যমে serverless inference ইতিমধ্যেই চালু রয়েছে। ডেভেলপাররা নিজস্ব ইনফ্রাস্ট্রাকচার তৈরি না করেই পরীক্ষা-নিরীক্ষা শুরু করতে পারেন, যদিও প্রকৃত সাশ্রয়ী কার্যকারিতা প্রতিটি প্ল্যাটফর্মের মূল্যের ওপর নির্ভর করবে।

Takeaway: Nemotron 3.5 Lightning প্রমাণ করে যে একটি মডেল ১২০-বিলিয়ন-প্যারামিটার সিস্টেমের সমতুল্য reasoning level বজায় রেখে শীর্ষস্থানীয় প্রতিযোগীদের তুলনায় প্রায় দ্বিগুণ token throughput দিতে পারে, যা একে latency-sensitive AI এজেন্টগুলোর জন্য একটি শক্তিশালী প্রার্থী হিসেবে গড়ে তুলেছে।