SkewAdam Mixture-of-Experts ট্রেনিং মেমরি ৬০%-এর বেশি কমিয়ে দেয় এবং নির্ভুলতায় (accuracy) উল্লেখযোগ্য উন্নতি ঘটায়, যা ডেভেলপারদের একটি ৬.৭৮ বিলিয়ন-প্যারামিটার MoE মডেল একটি মাত্র ৪০ GB GPU-তে চালানোর সুযোগ করে দেয়।

কেন MoE ট্রেনিং মেমরি সংকটে পড়ে

Mixture-of-Experts আর্কিটেকচার একটি ডেন্স ব্যাকবোন (dense backbone) বজায় রেখে প্রতিটি ইনপুটকে "expert" সাব-নেটওয়ার্কের একটি ছোট উপসেটের মাধ্যমে চালনা করে। এর সুবিধা হলো এমন একটি মডেল তৈরি করা যা কম্পিউটেশনাল খরচ উল্লেখযোগ্যভাবে না বাড়িয়েই বিলিয়ন বিলিয়ন প্যারামিটারে স্কেল করতে পারে। বাস্তবে, অপ্টিমাইজার—বিশেষ করে AdamW ভ্যারিয়েন্ট যা বেশিরভাগ টিম ব্যবহার করে—GPU RAM-এর সিংহভাগ দখল করে নেয়। একটি ৬.৭৮ B-প্যারামিটার মডেলের জন্য, শুধুমাত্র অপ্টিমাইজারটির momentum এবং variance tensor-এর জন্য প্রায় ৫০ GB প্রয়োজন হয়। এর সাথে activations এবং মডেল weights যোগ করলে পিক মেমরি (peak memory) ৮১.৪ GB ছাড়িয়ে যায়, যা ডেভেলপারদের মাল্টি-GPU সেটআপ বা ধীরগতির ট্রেনিং শিডিউল ব্যবহার করতে বাধ্য করে।

SkewAdam যা ভিন্নভাবে করে

SkewAdam কোনো নতুন লার্নিং রুল আবিষ্কার করেনি। এটি Adam-এর moments গুলোকে নতুনভাবে সাজায়:

  • ডেন্স ব্যাকবোনটি full-precision momentum বজায় রাখে, যা ডেন্স লেয়ারগুলোর প্রয়োজনীয় মসৃণ আপডেট নিশ্চিত করে।
  • এক্সপার্ট ব্যাংকটি variance-এর একটি factored approximation সংরক্ষণ করে, যা প্রতিটি এক্সপার্টের জন্য সংরক্ষিত ডেটার পরিমাণ কমিয়ে দেয়।
  • রাউটার, যা নির্ধারণ করে কোন এক্সপার্টগুলোকে সক্রিয় করতে হবে, সেটি একটি সঠিক second-moment estimate বজায় রাখে।

এই তিনটি উপাদানকে আলাদা "tiers" হিসেবে বিবেচনা করার মাধ্যমে, অপ্টিমাইজারটি যেখানে কম প্রয়োজন সেখানে অতিরিক্ত প্রিসিশন (redundant precision) বাদ দেয় এবং যেখানে সবচেয়ে বেশি প্রয়োজন সেখানে তা বজায় রাখে।

পরিমাপযোগ্য প্রভাব

SkewAdam ব্যবহার করে একই ৬.৭৮ B-প্যারামিটার MoE মডেল চালালে পাওয়া যায়:

  • পিক GPU মেমরি: ৩১.৩ GB (৮১.৪ GB থেকে কমে এসেছে)
  • অপ্টিমাইজার-স্টেট ফুটপ্রিন্ট: ১.২৯ GB (৫০ GB থেকে কমে এসেছে)

এই হ্রাসকৃত স্টেট একটি মাত্র ৪০ GB অ্যাক্সিলারেটরের ভেতরে অনায়াসেই এঁটে যায়।

শুধু সাশ্রয় নয়, নির্ভুলতাও বৃদ্ধি পায়

মেমরি কমানোর ফলে প্রায়শই মডেলের গুণমান ক্ষতিগ্রস্ত হয়, কিন্তু SkewAdam perplexity—যা একটি স্ট্যান্ডার্ড ল্যাঙ্গুয়েজ-মডেল মেট্রিক—১২৬.৮ (AdamW) থেকে বাড়িয়ে ১০৮.৪ করে। এটি একই টাস্কে Muon (১২০.২) এবং Lion (৩৯৩.৭)-কেও ছাড়িয়ে যায়। লেখকদের মতে, এই উন্নতির কারণ হলো তিনটি tier জুড়ে momentum বজায় রাখা; Adafactor-এর মতো পদ্ধতিগুলো যা momentum পুরোপুরি বাদ দিয়ে দেয়, সেগুলো পিছিয়ে পড়ে।

অমীমাংসিত প্রশ্নসমূহ

SkewAdam-এর ফলাফল একটি ৬.৭৮ B-প্যারামিটার মডেলের ওপর প্রদর্শিত হয়েছে। এটি এখনও অস্পষ্ট যে, আরও বড় মডেলের ক্ষেত্রে বা ল্যাঙ্গুয়েজ মডেলিংয়ের বাইরের কাজের ক্ষেত্রে একই মেমরি-স্টেট রেশিও বজায় থাকবে কি না।

যা লক্ষ্য রাখতে হবে

  • আরও বড় MoE কনফিগারেশনের (দশ বিলিয়ন বা তার বেশি প্যারামিটার) ওপর বেঞ্চমার্ক।
  • ওপেন-সোর্স ফ্রেমওয়ার্কগুলোর মাধ্যমে এর গ্রহণ এবং জনপ্রিয় ট্রেনিং স্ক্রিপ্টে এর অন্তর্ভুক্তি।
  • লুকানো ট্রেড-অফ (trade-offs) সম্পর্কে কমিউনিটির মতামত, যেমন বিভিন্ন লার্নিং-রেট শিডিউলের অধীনে convergence speed বা stability।

উৎস: ডেভেলপার পোস্ট যা অপ্টিমাইজারটির ডিজাইন এবং পরীক্ষামূলক ফলাফল বিস্তারিতভাবে বর্ণনা করেছে।