DeepMind এই সপ্তাহে DiffusionGemma উন্মোচন করেছে, যা একটি ওপেন-ওয়েট ল্যাঙ্গুয়েজ মডেল। এটি একটি একক H100 GPU-তে প্রতি সেকেন্ডে প্রায় ১,৫০০ টোকেন জেনারেট করতে পারে, যেখানে স্ট্যান্ডার্ড Gemma 4 মডেল প্রতি সেকেন্ডে সর্বোচ্চ ৩০৩ টোকেনের কাছাকাছি পৌঁছায়। এই গতির বৃদ্ধি অত্যন্ত গুরুত্বপূর্ণ কারণ এটি রিয়েল-টাইম অ্যাপ্লিকেশনে এআই-চালিত এজেন্টদের গতি কমিয়ে দেওয়া ল্যাটেন্সি বা বিলম্বের বাধা (latency bottleneck) কমিয়ে দিতে পারে।
কীভাবে DiffusionGemma টোকেন-বাই-টোকেন পদ্ধতি ভেঙে ফেলে
অধিকাংশ আধুনিক ল্যাঙ্গুয়েজ মডেল অটোরিগ্রেসিভ (autoregressively) পদ্ধতিতে টেক্সট জেনারেট করে: তারা একটি টোকেন প্রেডিক্ট করে, সেটি মডেলকে পুনরায় ইনপুট হিসেবে দেয়, তারপর পরবর্তী টোকেনটি প্রেডিক্ট করে। এই "বাম-থেকে-ডান" লুপটি কম্পিউট এবং মেমরির মধ্যে একটি ঘনিষ্ঠ সম্পর্ক তৈরি করে, কারণ প্রতিটি টোকেনের জন্য মডেলের ওয়েট (weights) অ্যাক্সেস করতে হয়। DiffusionGemma এই লুপের পরিবর্তে একটি ডিসক্রিট ডিফিউশন প্রসেস (discrete diffusion process) ব্যবহার করে, যা ২৫৬-টোকেনের একটি চাঙ্ককে (chunk) নয়েজি ডেটার একটি একক ব্লক হিসেবে বিবেচনা করে। এরপর মডেলটি পুরো ব্লকটিকে সমান্তরালভাবে (in parallel) ডিনয়েজ করে, যা কাজের চাপ বারবার ওয়েট লুকআপ থেকে সরিয়ে প্রতি ধাপে আরও বেশি কম্পিউট করার দিকে নিয়ে যায়। Nvidia-র H100-এর মতো হার্ডওয়্যার, যা সমান্তরাল গণিতে অত্যন্ত দক্ষ, সেখানে এই পদ্ধতিটি দারুণ কার্যকর।
এআই এজেন্টদের জন্য গতি কেন গুরুত্বপূর্ণ
স্বায়ত্তশাসিত এজেন্টরা (Autonomous agents) সাধারণত অনুসন্ধান, সারসংক্ষেপ এবং টেস্টিং-এর একটি চক্র অনুসরণ করে। প্রতিটি ধাপে একাধিক মডেল কল করার প্রয়োজন হতে পারে, তাই প্রতি-টোকেন ল্যাটেন্সি খুব দ্রুত বৃদ্ধি পায়। যখন একটি মডেল ধীর হয়ে যায়, তখন পুরো এজেন্ট পাইপলাইনটি আটকে যায়, যা খরচ বাড়িয়ে দেয় এবং ব্যবহারকারীর অভিজ্ঞতা কমিয়ে দেয়।
পারফরম্যান্সের ভারসাম্য বা ট্রেড-অফ
DiffusionGemma-র এই গতির বিনিময়ে মূল সক্ষমতার ক্ষেত্রে একটি পরিমাপযোগ্য মূল্য দিতে হয়। AIME বেঞ্চমার্কে—যা রিজনিং (reasoning), তথ্যগত নির্ভুলতা (factuality) এবং ভাষা বোঝার ক্ষমতা পরিমাপ করে—DiffusionGemma পেয়েছে ৬৯.১ স্কোর, যেখানে Gemma 4 পেয়েছে ৮৮.৩। ডিফিউশন পদ্ধতিটি খুব ছোট আউটপুটের ক্ষেত্রে দুর্বলতা এবং মাঝে মাঝে টোকেন "স্টাটারিং" (stuttering) বা তোতলামি করার প্রবণতা দেখায়, যেখানে জেনারেট করা টেক্সট বারবার আসে বা দ্বিধাগ্রস্ত হয়। যখন প্রায় ৩২ জনের বেশি ব্যবহারকারী একই সাথে মডেলটিকে কুয়েরি করে, তখন এর সমান্তরাল সুবিধার কার্যকারিতা কমে যায় এবং সামগ্রিক থ্রুপুটে (throughput) স্ট্যান্ডার্ড অটোরিগ্রেসিভ পদ্ধতিটি এর সমান হয়ে যায়।
কোন পদ্ধতিটি কোথায় উপযুক্ত
উপাত্তগুলো একটি হাইব্রিড ডিপ্লয়মেন্ট কৌশল বা মিশ্র ব্যবহারের কৌশল নির্দেশ করে:
- ডিফিউশন মডেল: কম কনকারেন্সি এবং ল্যাটেন্সি-সংবেদনশীল কাজের জন্য যা গভীর রিজনিংয়ের প্রয়োজন হয় না—যেমন ছোট প্রম্পট তৈরি করা, টেমপ্লেট পূরণ করা বা খসড়া টেক্সট তৈরি করা।
- অটোরিগ্রেসিভ মডেল: উচ্চ কনকারেন্সি কাজের চাপ, জটিল রিজনিং বা দীর্ঘ টেক্সট জেনারেশনের জন্য যেখানে গতির চেয়ে নির্ভুলতা বেশি গুরুত্বপূর্ণ।
এই পরিবর্তনের ফলে এআই ইনফ্রাস্ট্রাকচারের ওপর কী প্রভাব পড়বে
যদি মডেলের আকার বাড়ানোর পরিবর্তে জেনারেশন অ্যালগরিদম নিয়ে নতুন করে ভাবলে গতির এই সুবিধা পাওয়া যায়, তবে দক্ষতার বড় অর্জনগুলো আসতে পারে "প্লাম্বিং" বা অবকাঠামোগত উন্নতির মাধ্যমে। এই ট্রেড-অফটির মানে হলো, ডেভেলপারদের নির্দিষ্ট কিছু ক্ষেত্রে গুণমানের সামান্য হ্রাস মেনে নিতে হবে।
পাল্টা যুক্তি: ডিফিউশন কি মূলধারার ব্যবহারের জন্য প্রস্তুত?
ডিফিউশন ইমপ্লিমেন্টেশন ছোট প্রম্পটের ক্ষেত্রে সমস্যা করে এবং অসংলগ্ন (jittery) আউটপুট তৈরি করতে পারে।
পরবর্তীতে কী লক্ষ্য রাখা উচিত
- স্কেলিং স্টাডিজ: বড় ডিফিউশন মডেলগুলো কি গতি বজায় রেখে সক্ষমতার ব্যবধান কমিয়ে আনতে পারবে?
- হার্ডওয়্যার অপ্টিমাইজেশন: জিপিইউ (GPU) বিবর্তিত হওয়ার সাথে সাথে, কম্পিউট-ভারী ডিফিউশন ধাপ এবং ওয়েট-ভারী অটোরিগ্রেশনের মধ্যে ভারসাম্য আবারও পরিবর্তিত হতে পারে।
- রাউটিং অ্যালগরিদম: টাস্ক-অ্যাওয়ার মডেল রাউটারের প্রাথমিক প্রোটোটাইপগুলো দেখাবে যে ডায়নামিক সিলেকশনের মাধ্যমে সিস্টেমের সামগ্রিক ল্যাটেন্সি কতটা কমানো সম্ভব।
মূল কথা
DiffusionGemma প্রমাণ করে যে, মৌলিক জেনারেশন লুপ নিয়ে নতুন করে ভাবলে অতিরিক্ত চিপ ছাড়াই ল্যাটেন্সি কমিয়ে আনা সম্ভব। এই প্রযুক্তি অটোরিগ্রেসিভ মডেলগুলোর সম্পূর্ণ বিকল্প নয়, তবে এটি একটি হাইব্রিড এআই স্ট্যাকের জন্য একটি আকর্ষণীয় টুল, যেখানে প্রতিটি কাজের ভিত্তিতে গতি এবং নির্ভুলতার ভারসাম্য বজায় রাখা যায়। এআই ইনফ্রাস্ট্রাকচারের পরবর্তী ঢেউ সম্ভবত কেবল মডেলের আকার দিয়ে নয়, বরং এটি কতটা বুদ্ধিমত্তার সাথে সঠিক ইঞ্জিনের মাধ্যমে কাজ পরিচালনা করতে পারে তার ভিত্তিতে বিচার করা হবে।
