একটি ১৫০-বিলিয়ন-প্যারামিটার বিশিষ্ট Mixture-of-Experts মডেল একটি সাধারণ ডেভেলপার ল্যাপটপে টেক্সট জেনারেট করতে পারে। এই পরীক্ষাটি দেখায় যে পারফরম্যান্সের আসল সীমাবদ্ধতা SSD-এর গতি নয়, বরং RAM। এটি গুরুত্বপূর্ণ কারণ এটি প্রমাণ করে যে ক্লাউড কম্পিউটিংয়ে খরচ না করেই ফ্রন্টিয়ার-স্কেল মডেলগুলো স্থানীয়ভাবে (locally) পরীক্ষা করা সম্ভব।

পরীক্ষা

আমরা একটি REAP-pruned ১৫০-B-প্যারামিটার MoE মডেল—DeepSeek V4 Flash—ওপেন-সোর্স Colibrì inference engine-এর মাধ্যমে চালিয়েছি। হার্ডওয়্যার হিসেবে ব্যবহার করা হয়েছে একটি AMD Ryzen AI 9 365 ল্যাপটপ, যাতে ছিল ৬১ GB RAM এবং ১ TB NVMe SSD। আমরা তিন মিনিটের একটি জেনারেশন রান টাইম করেছি এবং প্রতিটি ডিস্ক অ্যাক্সেস লগ করেছি।

সংখ্যাগুলো কী প্রকাশ করে

  • ডিস্ক অ্যাক্টিভিটি ছিল নগণ্য। তিন মিনিটের জেনারেশনের সময় SSD ১১ সেকেন্ডেরও কম সময় রিড (read) অপারেশন করেছে। এমনকি ড্রাইভটি যদি তাৎক্ষণিকভাবে ডেটা পড়তে পারত, তবুও মোট থ্রুপুট (throughput) মাত্র প্রায় ৬ শতাংশ বৃদ্ধি পেত।
  • RAM-এর আকার সরাসরি গতিকে প্রভাবিত করেছে। RAM ক্যাশ অর্ধেক করে দিলে থ্রুপুট প্রায় ১৫ শতাংশ কমে গেছে। CPU ডিস্কের জন্য অপেক্ষা করার মতোই প্রায় সমান সময় ব্যয় করেছে ক্যাশ মিস (cache misses) হ্যান্ডেল করতে—যেমন ডেটা ডি-কোয়ান্টাইজ (de-quantising), কপি করা এবং ম্যানেজ করা।

এই পরিসংখ্যানগুলো সেই প্রচলিত ধারণাটি বদলে দেয় যে, ল্যাপটপে লার্জ-মডেল ইনফারেন্সের (inference) ক্ষেত্রে স্টোরেজ ব্যান্ডউইথ হলো প্রধান বাধা বা চোক পয়েন্ট (choke point)।

কেন RAM, SSD-কে ছাড়িয়ে যায়

যখন একটি মডেল প্যারামিটার আগে থেকেই RAM-এ থাকে না, তখন সিস্টেমকে অবশ্যই:

  1. SSD থেকে ডেটা সংগ্রহ করতে হয়।
  2. এটি ডিকোড করতে হয় এবং গণনার জন্য CPU রেজিস্টারে নিয়ে যেতে হয়।

উভয় ধাপই সাইকেল (cycles) খরচ করে। প্রথম ধাপটি SSD-এর ব্যান্ডউইথ দ্বারা সীমাবদ্ধ; দ্বিতীয় ধাপটি প্রায় একই পরিমাণ বিলম্ব যোগ করে কারণ ডেটা যত দ্রুতই আসুক না কেন, CPU-কে অবশ্যই ডেটা ডি-কোয়ান্টাইজ করতে হয়। তাই একটি দ্রুততর SSD খুব সামান্যই সুবিধা দেয়, যেখানে বেশি RAM মডেলের আরও বেশি অংশকে RAM-এ ধরে রাখতে সাহায্য করে এবং ব্যয়বহুল রাউন্ড-ট্রিপ (round-trip) দূর করে।

ডেভেলপারদের জন্য প্রভাব

  • স্টোরেজে নয়, মেমরিতে বিনিয়োগ করুন।
  • স্থানীয়ভাবে পরীক্ষা করা সম্ভবপর হয়ে ওঠে। ডেভেলপাররা ক্লাউড ক্রেডিটের জন্য টাকা খরচ না করেই বিদ্যমান মেশিনে ওপেন-ওয়েট MoE মডেল চালাতে পারেন এবং স্টাইল, টুল-কলিং আচরণ এবং আউটপুট কোয়ালিটি পরীক্ষা করতে পারেন।
  • ব্যাচ ইভালুয়েশন (Batch evaluation) বাস্তবসম্মত। রিয়েল-টাইম চ্যাট এখনও ধীরগতির মনে হতে পারে, তবে কিউড জব (queued jobs)—যেমন গবেষণার জন্য ডজন ডজন প্রম্পট জেনারেট করা—একটি ল্যাপটপে স্বাচ্ছন্দ্যে চালানো সম্ভব।

সম্ভাব্য পাল্টা যুক্তি

কেউ কেউ যুক্তি দিতে পারেন যে, যেসব ওয়ার্কলোডে বারবার নতুন এক্সপার্ট ওয়েটস (expert weights) লোড করতে হয়, সেখানে SSD ল্যাটেন্সি (latency) এখনও গুরুত্বপূর্ণ।

পরবর্তীতে যা লক্ষ্য রাখা উচিত

  • মেমরি-দক্ষ (Memory-efficient) মডেল ভেরিয়েন্ট।
  • অন-চিপ ক্যাশ (on-chip caches) সমৃদ্ধ হার্ডওয়্যার।
  • সফটওয়্যার-লেভেল ক্যাশিং কৌশল।

মূল কথাটি পরিষ্কার: যে সকল ডেভেলপার ল্যাপটপে বিশাল MoE মডেল নিয়ে পরীক্ষা করতে চান, তাদের বেশি RAM কেনা উচিত। SSD আপগ্রেড করলে মাত্র কয়েক শতাংশ সুবিধা পাওয়া যায়, যেখানে অতিরিক্ত মেমরি ইনফারেন্স টাইমকে দুই অঙ্কের শতাংশে (double-digit percentages) কমিয়ে আনতে পারে। এটি AI প্রোটোটাইপিংয়ের খরচ সংক্রান্ত হিসাব বদলে দেয় এবং সেই মডেলগুলো স্থানীয়ভাবে, বিনামূল্যে পরীক্ষা করার পথ খুলে দেয় যেগুলোকে আগে ডেডিকেটেড ক্লাউড ক্লাস্টার প্রয়োজন বলে মনে করা হতো।