Barret Zoph, OpenAI-এর একজন প্রাক্তন নির্বাহী, Gemini লার্জ-ল্যাঙ্গুয়েজ মডেলের পরিবারকে ত্বরান্বিত করতে গবেষণার ভাইস-প্রেসিডেন্ট হিসেবে Google-এ যোগ দিয়েছেন। Google আশা করছে যে reinforcement learning এবং post-training কৌশলগুলোতে Zoph-এর দক্ষতা Gemini-এর alignment, reasoning এবং safety উন্নত করবে—যে ক্ষেত্রগুলোতে OpenAI-এর GPT সিরিজ বর্তমানে নেতৃত্ব দিচ্ছে।

AI এলিটদের এক দ্রুত পরিবর্তনশীল সফর

Zoph-এর জীবনবৃত্তান্ত এই খাতের সাম্প্রতিক অস্থিরতার একটি মানচিত্রের মতো। OpenAI-তে দুই বছর কাটানোর পর, তিনি ২০২৪ সালের অক্টোবরে প্রাক্তন OpenAI CTO Mira Murati-এর সাথে Thinking Machines নামক একটি স্টার্টআপ সহ-প্রতিষ্ঠা করতে চলে যান। কয়েক মাস পর উদ্যোগটি বন্ধ হয়ে যায়; ২০২৫ সালের জানুয়ারির মধ্যে Zoph এবং সহ-প্রতিষ্ঠাতা Luke Metz AI এন্টারপ্রাইজ সেলস পরিচালনার জন্য পুনরায় OpenAI-তে যোগ দেন। সেই ভূমিকায় পাঁচ মাস কাটানোর পর, ২০২৫ সালের জুনে Zoph আবার চলে যান, যা তাকে Google-এ যাওয়ার পথ প্রশস্ত করে।

প্রতিটি পদক্ষেপ একটি বৃহত্তর প্যাটার্নকে প্রতিফলিত করে: শীর্ষস্থানীয় গবেষকরা প্রতিষ্ঠিত ল্যাব, নবীন স্টার্টআপ এবং প্রযুক্তি জায়ান্টদের বিশাল পুঁজির মধ্যে যাতায়াত করেন। Zoph-এর সর্বশেষ পদক্ষেপ তাকে এমন একটি কোম্পানিতে নিয়ে এসেছে যারা AI-তে বিলিয়ন বিলিয়ন ডলার ঢেলেছে কিন্তু OpenAI-এর আলোচিত মডেল রিলিজগুলোর সাথে পাল্লা দিতে হিমশিম খাচ্ছে।

কেন reinforcement learning এবং “post-training” হলো নতুন যুদ্ধক্ষেত্র

লার্জ-ল্যাঙ্গুয়েজ মডেলগুলো বিশাল টেক্সট কর্পোরা (text corpora) এর ওপর pre-training করার মাধ্যমে প্রাথমিক সক্ষমতা অর্জন করে। পরবর্তী ধাপটি—যাকে প্রায়শই post-training বলা হয়—বাস্তব জগতের ব্যবহারের জন্য সেই মডেলগুলোকে fine-tune করে। সবচেয়ে দৃশ্যমান post-training পদ্ধতি হলো Reinforcement Learning from Human Feedback (RLHF), যেখানে মানব মূল্যায়নকারীরা মডেলের আউটপুট বিচার করেন এবং একটি reinforcement-learning অ্যালগরিদম সেই বিচার অনুযায়ী মডেলটিকে সামঞ্জস্য করে।

Google-এর Gemini লাইনটি শক্তিশালী প্রাথমিক পারফরম্যান্স দেখায়, তবুও সমালোচকরা উল্লেখ করেন যে এর safety এবং instruction-following OpenAI-এর সর্বশেষ GPT-এর তুলনায় পিছিয়ে আছে। একজন গবেষককে নিয়োগ করার মাধ্যমে যার প্রকাশিত কাজ বারবার RL এবং RLHF-এর সীমানা প্রসারিত করেছে, Google সেই ব্যবধান ঘুচিয়ে দেওয়ার সংকেত দিচ্ছে। Zoph এমন পাইপলাইন তৈরিতে সাহায্য করবেন যা আরও দক্ষতার সাথে মানুষের ফিডব্যাক সংগ্রহ করবে, সূক্ষ্ম উদ্দেশ্য বুঝতে পারে এমন reward model তৈরি করবে এবং স্থিতিশীলতা বজায় রেখে reasoning উন্নত করতে পারে এমন নতুন RL অ্যালগরিদম নিয়ে পরীক্ষা চালাবে।

Google এবং OpenAI-এর জন্য ঝুঁকির মাত্রা

Google-এর জন্য, এই পদক্ষেপটি ক্লাউড পরিষেবা, সার্চ এবং কনজিউমার প্রোডাক্ট জুড়ে Gemini-কে একটি বাণিজ্যিক ভিত্তি হিসেবে প্রতিষ্ঠিত করার বহুবর্ষের প্রচেষ্টার একটি সুনির্দিষ্ট পদক্ষেপ। উন্নত-aligned মডেলগুলি দায়বদ্ধতার ঝুঁকি কমায় এবং গ্রাহকের আস্থা বাড়ায়—যা অত্যন্ত গুরুত্বপূর্ণ কারণ এন্টারপ্রাইজগুলো এমন AI দাবি করছে যা নিরাপদে বৃহৎ পরিসরে প্রয়োগ করা যায়।

এদিকে, OpenAI Zoph-এর বাইরেও অন্যান্য মেধাবীদের চলে যাওয়ার (talent exodus) সংকটের মোকাবিলা করছে। গত আট মাসে কোম্পানিটি তাদের চিফ অপারেটিং অফিসার এবং সিনিয়র ডেটা-সেন্টার লিডারদের বিদায় দেখেছে, সেই সাথে নির্বাহীদের একটি পরিবর্তনশীল ধারাও লক্ষ্য করা গেছে। এই প্রস্থানের ঘটনাটি এমন সময়ে ঘটছে যখন OpenAI একটি সম্ভাব্য IPO-এর প্রস্তুতি নিচ্ছে, যা বিনিয়োগকারীরা সাধারণত নেতৃত্বের স্থিতিশীলতার জন্য নিবিড়ভাবে পর্যবেক্ষণ করেন। কর্মী পরিবর্তন নতুন দৃষ্টিভঙ্গি আনতে পারে, তবে এটি দীর্ঘমেয়াদী গবেষণা কর্মসূচির ধারাবাহিকতা ব্যাহত করার ঝুঁকিও তৈরি করে।

পাল্টা যুক্তি: একজন নিয়োগ রাতারাতি Gemini-কে বদলে দেবে না

Google-এর কাছে ইতিমধ্যে RL, safety এবং model alignment-এ গবেষকদের একটি বিশাল দল রয়েছে। কিছু পর্যবেক্ষক সতর্ক করেছেন যে একজন ভাইস-প্রেসিডেন্ট, এমনকি Zoph-এর মতো পরিচিত ব্যক্তিত্ব হলেও, একা Gemini-এর মতো বিশাল একটি প্রোডাক্ট লাইনকে আমূল পরিবর্তন করতে পারবেন না। এর প্রকৃত প্রভাব নির্ভর করবে Zoph কত দ্রুত তার ধারণাগুলোকে বিদ্যমান টিমের সাথে একীভূত করতে পারেন, সম্পদ নিশ্চিত করতে পারেন এবং বৃহত্তর প্রোডাক্ট রোডম্যাপকে প্রভাবিত করতে পারেন তার ওপর।

মেধা বা ট্যালেন্টের এই স্থানান্তর কৌশলগত সুবিধার পাশাপাশি ব্যক্তিগত পছন্দ এবং ক্যারিয়ার গড়ার পথের বিষয়ও হতে পারে। এন্টারপ্রাইজ সেলসে Zoph-এর সংক্ষিপ্ত stint নির্দেশ করে যে তিনি এমন ভূমিকা পছন্দ করেন যা গবেষণা এবং বাজারের প্রভাবের সংমিশ্রণ ঘটায়—এমন একটি সমন্বয় যা একটি গবেষণা-কেন্দ্রিক ল্যাবের চেয়ে Google আরও ভালোভাবে প্রদান করতে পারে।

পরবর্তীতে যা লক্ষ্য রাখতে হবে

  • Gemini releases – আসন্ন মডেল আপডেটগুলো প্রকাশ করবে যে RL-কেন্দ্রিক পরিমার্জনগুলো safety score এবং reasoning benchmark উন্নত করতে পারে কি না।
  • Research publications – Google-এর গবেষণা বিভাগ থেকে প্রকাশিত পেপারগুলোতে Zoph-এর নাম বা সহ-লেখক হিসেবে থাকা নির্দেশ করবে অভ্যন্তরীণ পরীক্ষার দিকনির্দেশনা।
  • OpenAI leadership churn – উচ্চপদস্থ কর্মকর্তাদের আরও বিদায় বা নতুন নিয়োগ যেকোনো পাবলিক অফারিংয়ের আগে কোম্পানির গবেষণা এজেন্ডাকে নতুন রূপ দিতে পারে।
  • Market response – ক্লাউড-সার্ভিস গ্রাহক এবং এন্টারপ্রাইজ ক্রেতারা Google-এর AI স্ট্যাক ব্যবহারের প্রতিশ্রুতি দেওয়ার আগে Gemini-এর alignment-এ সুনির্দিষ্ট উন্নতি লক্ষ্য করবেন।

Takeaway

Barrett Zoph-এর OpenAI থেকে Google-এ আসা বিষয়টি নির্দেশ করে যে, AI-এর এই অস্ত্র প্রতিযোগিতা এখন কম্পিউটেশনাল ক্ষমতার (compute front) পাশাপাশি প্রতিভার (talent front) লড়াইয়েও সমভাবে লিপ্ত। Gemini-র গবেষণার নেতৃত্বে একজন reinforcement-learning বিশেষজ্ঞকে নিযুক্ত করার মাধ্যমে Google বাজি ধরছে যে, post-training-এর ওপর আরও জোরালো মনোযোগ দিলে OpenAI-এর GPT মডেলগুলোর সাথে পারফরম্যান্স এবং নিরাপত্তার ব্যবধান কমিয়ে আনা সম্ভব হবে—এমন একটি ফলাফল যা এই শিল্পের প্রতিযোগিতামূলক গতিপ্রকৃতিকে নতুন রূপ দিতে পারে।