Xiaomi-এর নতুন MiMo-V2-Flash মডেল, যা একটি ৩০৯ বিলিয়ন-প্যারামিটার বিশিষ্ট mixture-of-experts (MoE) সিস্টেম, বর্তমানে SWE-Bench-এর ওপেন-সোর্স লিডারবোর্ডে ৭৩.৪% নির্ভুলতা (accuracy) নিয়ে শীর্ষে রয়েছে; অথচ এটি সমমানের মডেলগুলোর তুলনায় ৫০ ভাগের ১ ভাগেরও কম কম্পিউটেশন ব্যবহার করে। এই ফলাফলটি দেখায় যে, লার্জ-ল্যাঙ্গুয়েজ-মডেল গবেষণায় যা এখন সাধারণ বিষয় হয়ে দাঁড়িয়েছে সেই বিশাল বিদ্যুৎ বিল ছাড়াই উচ্চমানের পারফরম্যান্স অর্জন করা সম্ভব।

কেন Xiaomi MoE-এর দিকে ঝুঁকেছে

একটি MoE আর্কিটেকচার একটি শেয়ার্ড ব্যাকবোন-এর সাথে অনেকগুলো "expert" সাব-নেটওয়ার্ক যুক্ত করার মাধ্যমে খরচ কমিয়ে আনে। মডেলটি সম্পূর্ণ ৩০৯ বিলিয়ন প্যারামিটার সংরক্ষণ করে কিন্তু প্রতিটি টোকেনের জন্য মাত্র ১৫ বিলিয়ন প্যারামিটার সক্রিয় করে। এই নির্বাচনী সক্রিয়করণ (selective activation) ইনফারেন্স মেমরি এবং কম্পিউটেশন বহুগুণ কমিয়ে দেয়, যার ফলে মডেলটি FP16 মোডে ৬১৮ GB VRAM সহ প্রায় দশটি H100 GPU-তে চালানো সম্ভব হয়।

ইঞ্জিনিয়ারিং কৌশল যা এটিকে ব্যবহারোপযোগী করে তুলেছে

  • Hybrid attention pattern – বেশিরভাগ লেয়ার sliding-window attention ব্যবহার করে, যা প্রতিটি টোকেনের চারপাশে একটি সরু ব্যান্ডের মধ্যে attention matrix-কে সীমাবদ্ধ রাখে। প্রতি ষষ্ঠ লেয়ার global attention-এ পরিবর্তিত হয়, যা মেমরি অতিরিক্ত খরচ না করেই দীর্ঘপাল্লার ডিপেন্ডেন্সি (long-range dependencies) ক্যাপচার করে। এই প্যাটার্নটি মেমরি ব্যবহার ছয় গুণ কমিয়ে দেয়।
  • Fast decoding module – একটি বিল্ট-ইন প্রেডিক্টর একটি মাত্র ফরোয়ার্ড পাসে বেশ কয়েকটি টোকেন প্রদান করে, যা স্ট্যান্ডার্ড autoregressive decoding-এর তুলনায় ২.৬ গুণ পর্যন্ত বেশি জেনারেশন স্পিড প্রদান করে।
  • 256 K context window – এই আর্কিটেকচারটি এক চতুর্থাংশ মিলিয়ন (২৫০,০০০) টোকেন ইনপুট গ্রহণ করতে পারে, যা কোডবেস, রিসার্চ পেপার বা যেকোনো দীর্ঘ ডকুমেন্টের জন্য উপযোগী।

এই উপাদানগুলো মডেলটিকে এমন হার্ডওয়্যারে ব্যবহারযোগ্য রাখে যা অন্যথায় একটি ৩০৯ বিলিয়ন স্কেলের সিস্টেমের জন্য নাগালের বাইরে হতো।

Multi-Teacher On-Policy Distillation (MOPD)

MOPD অনেকগুলো বিশেষায়িত টিচার ব্যবহার করে স্টুডেন্ট মডেল—MiMo-V2-Flash-কে প্রশিক্ষণ দেয়: যেমন গণিতের জন্য একজন, প্রোগ্রামিংয়ের জন্য অন্যজন, এবং এভাবেই চলতে থাকে। স্টুডেন্ট মডেলটি যখন নিজস্ব রেসপন্স তৈরি করে, তখন এটি একই সাথে সব টিচার থেকে ফিডব্যাক গ্রহণ করে। যেহেতু স্টুডেন্ট মডেলটি সেই ডিস্ট্রিবিউশন থেকে শেখে যা এটি বাস্তবে তৈরি করবে, তাই এই ডিস্টিলেশন স্থিতিশীল থাকে এবং নলেজ ট্রান্সফার বাস্তব জগতের কাজের ওপর ফোকাসড থাকে।

MOPD প্রথাগত পদ্ধতির তুলনায় ৫০ ভাগের ১ ভাগেরও কম কম্পিউটেশন খরচ করে।

বেঞ্চমার্ক পারফরম্যান্স

বেঞ্চমার্ক স্কোর
SWE-Bench (coding) 73.4 %
GPQA-Diamond (general QA) 83.7 %
MMLU-Pro (multitask language understanding) 84.9 %
Arena-Hard (adversarial chat) 86.2 %

বিদ্যমান সীমাবদ্ধতা বা ট্রেড-অফসমূহ

MoE-এর মাধ্যমে সাশ্রয় হলেও, MiMo-V2-Flash চালানো কোনো ল্যাপটপে করার মতো সহজ কাজ নয়। এটি ডিপ্লয় করার জন্য এখনও প্রায় দশটি H100 GPU প্রয়োজন, এবং ৬১৮ GB VRAM-এর প্রয়োজনীয়তা মডেলটিকে হাই-স্পিড ইন্টারকানেক্ট সমৃদ্ধ ডেটা-সেন্টার এনভায়রনমেন্টের মধ্যে সীমাবদ্ধ রাখে।

পরবর্তী লক্ষ্য বা যা নজর রাখা প্রয়োজন

মূল কথা: MiMo-V2-Flash প্রমাণ করে যে, চতুর ট্রেনিং পাইপলাইন এবং মডুলার আর্কিটেকচার ব্যবহার করে সেই বিশাল কম্পিউটেশন খরচ ছাড়াই শীর্ষমানের পারফরম্যান্স পাওয়া সম্ভব, যা বছরের পর বছর ধরে লার্জ-ল্যাঙ্গুয়েজ-মডেল ডেভেলপমেন্টের প্রধান চ্যালেঞ্জ হয়ে দাঁড়িয়েছিল। পরবর্তী চ্যালেঞ্জ হলো এই পারফরম্যান্সকে এমনভাবে সাশ্রয়ী করা যাতে এটি কেবল বড় ফান্ডিং পাওয়া ল্যাবগুলোর বাইরে সাধারণ মানুষের নাগালের মধ্যেও আসে।