Direct Preference Optimization (DPO) ডেভেলপারদের একটি আলাদা রিওয়ার্ড মডেল (reward model) প্রশিক্ষণ দেওয়া বা রিইনফোর্সমেন্ট-লার্নিং (RL) লুপ চালানোর প্রয়োজন ছাড়াই লার্জ ল্যাঙ্গুয়েজ মডেলগুলোকে ফাইন-টিউন করতে দেয়, যা কম্পিউটেশনাল খরচ এবং প্রথাগত RL-from-human-feedback পাইপলাইনের অস্থিরতা উভয়ই ব্যাপকভাবে হ্রাস করে।
কেন RL-from-Human-Feedback বেশ জটিল মনে হয়
স্ট্যান্ডার্ড RL-from-human-feedback (RLHF) প্রক্রিয়ায় তিনটি ধাপ রয়েছে। প্রথমত, একটি কিউরেটেড ডেটাসেটের ওপর একটি বেস মডেলকে ফাইন-টিউন করা হয়। এরপর, একটি রিওয়ার্ড মডেল আউটপুট জোড়ার মধ্যে মানুষের পছন্দ বা প্রেফারেন্স প্রেডিক্ট করতে শেখে। সবশেষে, প্র্যাকটিশনাররা Proximal Policy Optimization (PPO) – একটি ক্লাসিক RL অ্যালগরিদম – ব্যবহার করেন যাতে পলিসিটি মূল মডেলের কাছাকাছি থেকেও উচ্চতর প্রেডিক্টেড রিওয়ার্ডের দিকে অগ্রসর হতে পারে।
এই তিনটি মডেলের সেটআপকে একই সাথে মেমরিতে রাখতে হয় এবং এটি একটি ব্যয়বহুল RL লুপ তৈরি করে যা প্রতিটি আপডেটে নতুন টেক্সট স্যাম্পল করে। টিমগুলো প্রায়ই দেখে যে পলিসিটি রিওয়ার্ডকে "গেম" (game) করতে শেখে, অর্থাৎ এমন আউটপুট তৈরি করে যা প্রক্সি স্কোরে ভালো হলেও কাঙ্ক্ষিত গুণমান বজায় রাখতে ব্যর্থ হয়। এর ফলে পাইপলাইনটি ব্যয়বহুল, ভঙ্গুর এবং স্কেল করা কঠিন হয়ে পড়ে।
DPO-এর বীজগণিতীয় শর্টকাট (algebraic shortcut)
DPO রিওয়ার্ড মডেলটিকে সম্পূর্ণভাবে বাদ দেয়। মূল পর্যবেক্ষণটি হলো যে, RLHF-এর লক্ষ্য—একটি রেফারেন্স মডেল থেকে বিচ্যুতিকে পেনাল্টি দিয়ে প্রত্যাশিত রিওয়ার্ড সর্বোচ্চ করা—এর একটি ক্লোজড-ফর্ম এক্সপ্রেশন (closed-form expression) রয়েছে। গণিতটি পুনর্গঠন করার মাধ্যমে, যেকোনো টোকেনের রিওয়ার্ড হয়ে ওঠে পলিসি দ্বারা নির্ধারিত log-probability এবং রেফারেন্স মডেল দ্বারা নির্ধারিত log-probability-এর মধ্যকার পার্থক্য।
বাস্তবে এর মানে হলো "রিওয়ার্ড" পলিসির ভেতরেই অবস্থান করে। প্রশিক্ষণটি প্রেফারেন্স জোড়ার ওপর একটি একক ক্লাসিফিকেশন লস-এ (classification loss) রূপান্তরিত হয়: একটি নির্বাচিত রেসপন্স এবং একটি প্রত্যাখ্যাত রেসপন্স দেওয়া হলে, মডেলটিকে নির্বাচিত টেক্সটটিতে উচ্চতর প্রোবাবিলিটি দেওয়ার জন্য উৎসাহিত করা হয়। কোনো স্যাম্পলিং নেই, কোনো PPO আপডেট নেই, এবং স্টোর করার জন্য কোনো অতিরিক্ত মডেল নেই।
নতুন লস (loss) দেখতে কেমন
এই লসটি বর্তমান পলিসির অধীনে পছন্দের উত্তরের log-probability-এর সাথে রেফারেন্স মডেলের log-probability-এর তুলনা করে, যা একটি টেম্পারেচার-সদৃশ হাইপারপ্যারামিটার β দ্বারা স্কেল করা হয়। একটি উচ্চ β পলিসিকে রেফারেন্সের কাছাকাছি থাকতে বাধ্য করে, যা সাবলীলতা (fluency) এবং নিরাপত্তা বজায় রাখে। একটি নিম্ন β পলিসিকে আরও দূরে সরে যাওয়ার সুযোগ দেয়, যা নির্বাচিত উত্তরের প্রতি এর পছন্দকে আরও তীক্ষ্ণ করে তোলে।
ডেভেলপারদের জন্য গুরুত্বপূর্ণ সুবিধাগুলো
- কোনো রিওয়ার্ড মডেল নেই – আলাদা প্রেডিক্টরের জন্য অতিরিক্ত মানুষের ফিডব্যাক সংগ্রহের প্রয়োজনীয়তা দূর করে।
- প্রশিক্ষণের সময় কোনো স্যাম্পলিং নেই – গ্রেডিয়েন্ট গণনার জন্য মডেলকে কখনোই নতুন টেক্সট তৈরি করতে হয় না, যা GPU ব্যবহারের সময় নাটকীয়ভাবে কমিয়ে দেয়।
- স্থিতিশীলতা (Stability) – একটি স্ট্যান্ডার্ড binary-cross-entropy loss উচ্চ-ভ্যারিয়েন্স সম্পন্ন RL গ্রেডিয়েন্টকে প্রতিস্থাপন করে, যা প্রায়শই ডাইভারজেন্সের কারণ হয়।
- দক্ষতা (Efficiency) – প্রতিটি প্রেফারেন্স জোড়ার ওপর একটি মাত্র গ্রেডিয়েন্ট স্টেপই যথেষ্ট; PPO-এর তুলনায় অনেক কম epochs-এ প্রশিক্ষণ সম্পন্ন হয়।
প্রাথমিক পরীক্ষাগুলো দেখায় যে, কম্পিউটেশনাল বাজেটের সামান্য অংশ ব্যবহার করেই DPO বেঞ্চমার্ক প্রেফারেন্স ডেটাসেটে PPO-এর পারফরম্যান্সের সমান বা তার চেয়ে বেশি ফলাফল দিচ্ছে। এই খরচ কমানোর সুবিধাই ব্যাখ্যা করে কেন অনেক ওপেন-সোর্স প্রজেক্ট ইতিমধ্যে DPO বা এর কাছাকাছি কোনো সংস্করণকে তাদের ডিফল্ট অ্যালাইনমেন্ট পদ্ধতি হিসেবে গ্রহণ করেছে।
ট্রেড-অফ (Trade-offs)
DPO একটি নির্দিষ্ট প্রেফারেন্স জোড়ার সেটের ওপর কাজ করে। প্রশিক্ষণের সময় এটি কখনোই নতুন কোনো কমপ্লিশন (completion) স্যাম্পল করে না, তাই মূল ডেটাতে অনুপস্থিত কোনো উত্তর স্পেস (answer spaces) এটি অন্বেষণ করতে পারে না। বিপরীতে, একটি অনলাইন PPO রান মডেলটিকে ক্রমাগত পরীক্ষা করার মাধ্যমে নতুন এবং উচ্চতর রিওয়ার্ডযুক্ত আচরণ খুঁজে পেতে পারে।
যদি β খুব কম সেট করা হয় বা প্রশিক্ষণ অনেক বেশি স্টেপ পর্যন্ত চলে, তবে পলিসিটি রেফারেন্স মডেল থেকে এতটাই দূরে সরে যেতে পারে যে সাবলীলতা হারিয়ে যেতে পারে বা অনাকাঙ্ক্ষিত আর্টিফ্যাক্ট (artefacts) তৈরি হতে পারে।
সারসংক্ষেপ
Direct Preference Optimization তিনটি মডেল এবং RL-নির্ভর RLHF স্ট্যাকের পরিবর্তে একটি একক, স্থিতিশীল লস ব্যবহার করে যা সরাসরি মানুষের প্রেফারেন্স জোড়া থেকে শেখে। এর ফলে ল্যাঙ্গুয়েজ মডেলগুলোকে অ্যালাইন করার জন্য একটি সাশ্রয়ী এবং আরও অনুমানযোগ্য পথ তৈরি হয়—যদি আপনার প্রশিক্ষণ ডেটা প্রয়োজনীয় আচরণগুলো ধারণ করে এবং আপনি ড্রিফট প্যারামিটারটি নিয়ন্ত্রণে রাখেন।
