গবেষকরা Ring-Zero নামে একটি নতুন রিইনফোর্সমেন্ট-লার্নিং ফ্রেমওয়ার্ক ঘোষণা করেছেন যা একটি ট্রিলিয়ন-প্যারামিটার বিশিষ্ট ল্যাঙ্গুয়েজ মডেলকে টোকেন-বাজেটের মধ্যে থেকে রিজনিং (reasoning) করতে শেখায়, এবং মডেলটি ২০২৬ সালের AIME গণিত পরীক্ষায় ৮৪.২% নম্বর পেয়েছে। এই ফলাফলটি দেখায় যে, এই স্কেলে মডেলটি ধাপে ধাপে সমস্যা সমাধানের সেই অভ্যাসগুলো অর্জন করতে পারে যা প্রকৌশলীরা ঐতিহ্যগতভাবে প্রম্পটে (prompts) হার্ড-কোড করে থাকেন।

কেন এটি গুরুত্বপূর্ণ

AIME-স্তরের পারফরম্যান্স দীর্ঘকাল ধরে "মানুষের স্তরের" পরিমাণগত রিজনিংয়ের একটি মানদণ্ড হিসেবে বিবেচিত হয়ে আসছে। কোনো মানুষের লেখা উদাহরণ ছাড়াই ৮৪.২% রেঞ্জে পৌঁছানো নির্দেশ করে যে, মডেলটির রিজনিং ক্ষমতা কোনো হাতে তৈরি কাঠামো (scaffolds) থেকে নয়, বরং প্রশিক্ষণের গতিশীলতা (training dynamics) থেকেই উদ্ভূত হয়েছে। যারা AI এজেন্ট তৈরি করছে তাদের জন্য এর তাৎপর্য স্পষ্ট: জটিল প্রম্পট রেসিপি লেখা এবং রক্ষণাবেক্ষণ করার পরিবর্তে একটি ট্রেনিং লুপ ব্যবহার করা যেতে পারে, যা মডেলটিকে শেখাবে কখন গভীরভাবে চিন্তা করতে হবে এবং কখন একটি সহজ শর্টকাট যথেষ্ট হবে।

প্রম্পট ইঞ্জিনিয়ারিং থেকে ট্রেনিং ডায়নামিকস

বছরের পর বছর ধরে, ডেভেলপাররা লার্জ ল্যাঙ্গুয়েজ মডেলগুলোকে বহু-ধাপের রিজনিং করতে বাধ্য করার জন্য "সমস্যাটিকে বিভিন্ন অংশে ভাগ করুন" বা "আপনার উত্তর যাচাই করুন"-এর মতো প্রম্পট টেমপ্লেটের ওপর নির্ভর করেছেন। এই টেমপ্লেটগুলো বাহ্যিক কাঠামো (scaffolding) হিসেবে কাজ করে; মডেলটি নির্দেশাবলী অনুসরণ করে কিন্তু প্রক্রিয়াটিকে নিজের ভেতরে গেঁথে নিতে পারে না। Ring-Zero এই ধারণাটি বদলে দেয়। মডেলটি একটি কাজের বিবরণের সাথে একটি যাচাইযোগ্য উত্তর (verifiable answer) পায়—যা একটি গ্রাউন্ড-ট্রুথ (ground-truth) যা স্বয়ংক্রিয়ভাবে পরীক্ষা করা যায়। এরপর এটি ধারাবাহিকভাবে বিভিন্ন প্রচেষ্টার মাধ্যমে উত্তর খোঁজার চেষ্টা করে এবং শুধুমাত্র তখনই রিওয়ার্ড (reward) পায় যখন তার প্রচেষ্টা যাচাইযোগ্য উত্তরের সাথে মিলে যায়, এবং রিইনফোর্সমেন্ট লার্নিংয়ের মাধ্যমে তার পলিসি আপডেট করে।

যেহেতু রিওয়ার্ডটি এমন একটি উদ্দেশ্যের সাথে যুক্ত যা ফাঁকি দেওয়া কঠিন (উত্তরটি কেবল গ্রহণযোগ্য হলেই চলবে না, বরং সঠিক হতে হবে), তাই মডেলটি নিজেই রিজনিং প্যাটার্ন বা যুক্তি প্রদানের ধরন আবিষ্কার করে। গবেষণাপত্রটিতে যুক্তি দেওয়া হয়েছে যে, একবার একটি নির্ভরযোগ্য রিওয়ার্ড সিগন্যাল স্থাপন করা হয়ে গেলে, মডেলটিকে ট্রিলিয়ন প্যারামিটারে স্কেল করলে স্বয়ংক্রিয়ভাবে সেই ধরণের প্রম্পট-ইঞ্জিনিয়ারিং কৌশলগুলো প্রকাশ পায় যা প্রকৌশলীরা ছোট মডেলগুলোর জন্য ম্যানুয়ালি যুক্ত করে থাকেন।

চার-ধাপের ট্রেনিং পাইপলাইন

Ring-Zero-এর প্রশিক্ষণ চারটি স্বতন্ত্র ধাপের মাধ্যমে সম্পন্ন হয়:

  1. প্রথম-ধাপের RL – মডেলটি সম্ভাব্য রিজনিং ট্রেসগুলো অন্বেষণ করে এবং শেখে কোন টোকেন সিকোয়েন্সগুলো সঠিক উত্তরের দিকে নিয়ে যায়।
  2. সেলফ-ডিস্টিলেশন (Self-distillation) – উচ্চ-মানের ট্রেসগুলো মডেলের ভেতরে ফিরে আসে, যা উদ্ভূত রিজনিং প্যাটার্নগুলোকে স্থিতিশীল করে।
  3. দ্বিতীয়-ধাপের RL – একটি সূক্ষ্ম লুপ পূর্বের উন্নতিগুলো বজায় রেখে পলিসিকে আরও উন্নত করে।
  4. টিয়ারড ট্রেনিং (Tiered training) – মডেলটি বুদ্ধিমত্তার সাথে টোকেন বাজেট বরাদ্দ করতে শেখে, সমস্যার জটিলতার ওপর ভিত্তি করে ছোট (≈২ হাজার টোকেন) এবং দীর্ঘ (≈২০ হাজার টোকেন) রিজনিং পথের মধ্যে একটি বেছে নেয়।

টিয়ারড ট্রেনিং হলো উৎপাদনের জন্য সবচেয়ে প্রাসঙ্গিক অংশ। বাস্তব প্রয়োগের ক্ষেত্রে, প্রতিটি অতিরিক্ত টোকেন কম্পিউট খরচ বাড়ায়। মডেলটিকে শেখানোর মাধ্যমে যে কখন একটি সমস্যা ছোট উত্তরের জন্য যথেষ্ট সহজ এবং কখন এটি একটি গভীর, বহু-ধাপের বিশ্লেষণের দাবি রাখে, Ring-Zero সরাসরি রিজনিংয়ের গুণমানকে অর্থনৈতিক দক্ষতার সাথে যুক্ত করে।

শেখার দুটি পর্যায়: আবিষ্কার এবং শাণিতকরণ

লেখকরা শেখার এই প্রক্রিয়াটিকে দুটি পর্যায়ে বর্ণনা করেছেন:

  • আবিষ্কার (Discovery) – প্রাথমিক রিইনফোর্সমেন্ট-লার্নিং ধাপগুলো কিছুটা অগোছালো বা নয়েজি (noisy) হয়; মডেলটি বিভিন্ন ধরণের কৌশল চেষ্টা করে, যার অনেকগুলোই ব্যর্থ হয়। নতুন রিজনিং পথ উন্মোচনের জন্য এই বৈচিত্র্য বা ভ্যারিয়েন্স অত্যন্ত প্রয়োজনীয়।
  • শাণিতকরণ (Sharpening) – একবার একটি সম্ভাবনাময় প্যাটার্ন দেখা দিলে, পরবর্তী RL ধাপগুলো পলিসিকে আরও সুসংহত করে, ভ্যারিয়েন্স কমায় এবং আচরণকে দৃঢ় করে।

এই অগ্রগতি মানুষের উন্নতির সাথে সাদৃশ্যপূর্ণ: প্রথমে প্রাথমিক চিন্তাভাবনা (brainstorming) এবং তারপরে নিবিড় অনুশীলন। মূল অন্তর্দৃষ্টি হলো যে, শুরুর দিকের এই "অগোছালো" পর্যায়টিকে চেপে না রেখে বরং গ্রহণ করা উচিত, কারণ এটি পরবর্তী পরিমার্জনের জন্য কাঁচামাল সরবরাহ করে।

কী কী সমস্যা হতে পারে?

গবেষণাপত্রটির আশাবাদ কয়েকটি অনুমানের ওপর নির্ভর করে যা পুঙ্খানুপুঙ্খভাবে পরীক্ষা করা প্রয়োজন:

  • রিওয়ার্ড ডিজাইন – এই ফ্রেমওয়ার্কের জন্য এমন একটি রিওয়ার্ড প্রয়োজন যা যাচাইযোগ্য এবং শর্টকাট বা ফাঁকি দেওয়া প্রতিরোধ করতে সক্ষম। অনেক বাস্তব জগতের কাজের জন্য, এমন রিওয়ার্ড সংজ্ঞায়িত করা সহজ নয় এবং এর জন্য ব্যয়বহুল অ্যানোটেশন পাইপলাইনের প্রয়োজন হতে পারে।
  • পরিবেশগত বাধা (Environmental bottlenecks) – লেখকরা উল্লেখ করেছেন যে, মডেলের পারফরম্যান্স তার আকারের কারণে নয়, বরং আশেপাশের মূল্যায়ন অবকাঠামোর (টেস্ট স্যুট, লগ, স্পষ্ট মেট্রিক্স) কারণে সীমাবদ্ধ। সেই অবকাঠামো তৈরি এবং রক্ষণাবেক্ষণ করা একটি বিশাল ইঞ্জিনিয়ারিং প্রচেষ্টা হতে পারে।
  • প্রশিক্ষণের কম্পিউট খরচ – একাধিক RL ধাপের মাধ্যমে একটি ট্রিলিয়ন-প্যারামিটার মডেল প্রশিক্ষণ দেওয়া অত্যন্ত ব্যয়বহুল। যদিও টিয়ারড ট্রেনিং ইনফারেন্স খরচ কমায়, তবুও প্রাথমিক প্রশিক্ষণের বাজেট অনেক বেশি থাকে, যা এই পদ্ধতিটিকে সম্ভবত কেবল উচ্চ-তহবিল সম্পন্ন ল্যাবগুলোর মধ্যেই সীমাবদ্ধ করে রাখতে পারে।

এরপর কী লক্ষ্য করবেন

AI বিশেষজ্ঞদের জন্য ব্যবহারিক শিক্ষা

  • প্রম্পটকে একমাত্র হাতিয়ার হিসেবে গণ্য করবেন না – প্রশ্ন করুন যে, আপনি প্রম্পটে যে আচরণটি কোড করছেন, সেটি কি রিওয়ার্ড-চালিত (reward-driven) ট্রেনিং লুপের মাধ্যমে শেখানো সম্ভব কি না।
  • টোকেন ব্যবহারকে একটি প্রধান লক্ষ্য হিসেবে নির্ধারণ করুন – শুরুতেই বাজেট-সচেতন সিগন্যাল যোগ করুন; মডেলটি তখন কম্পিউট খরচের বিপরীতে নির্ভুলতার ভারসাম্য বজায় রাখতে শিখবে।
  • ফিডব্যাক লুপ সম্পন্ন করুন – এমন একটি সিস্টেম চালু করুন যা স্বয়ংক্রিয়ভাবে টাস্ক সরবরাহ করে, যাচাইযোগ্য উত্তরের বিপরীতে ফলাফল পরিমাপ করে এবং সেই ফলাফলগুলো পুনরায় ট্রেনিংয়ে ব্যবহার করে। এই লুপের মাধ্যমেই মডেলটি তার নিজস্ব কাজের ধারা (workflow) খুঁজে পায়।

যখন রিওয়ার্ড স্পষ্ট থাকে এবং পরিবেশ নির্ভরযোগ্যভাবে সাফল্য পরিমাপ করতে পারে, তখন মডেলের স্কেল বাড়ানো কেবল তার সক্ষমতা বৃদ্ধি করে না—বরং এটি মডেলটিকে শিখিয়ে দেয় কীভাবে চিন্তা করতে হবে। হাতে লেখা কাঠামো (scaffolding) থেকে স্ব-নির্দেশিত যুক্তিনির্ভরতার (self-directed reasoning) এই পরিবর্তন AI এজেন্ট তৈরির পদ্ধতি এবং এর মূল্য নির্ধারণের কৌশলকে বদলে দিতে পারে।