OpenAI चे माजी कार्यकारी Barret Zoph यांनी Gemini या large-language models च्या कुटुंबाला गती देण्यासाठी Google मध्ये research चे vice-president म्हणून रुजू झाले आहे. Google ला आशा आहे की reinforcement learning आणि post-training तंत्रांमधील Zoph यांचा अनुभव Gemini चे alignment, reasoning आणि safety सुधारण्यास मदत करेल—या क्षेत्रांमध्ये सध्या OpenAI च्या GPT सिरीजचे वर्चस्व आहे.

AI क्षेत्रातील दिग्गजांचा वेगाने बदलणारा प्रवास

Zoph यांचा बायोडाटा (résumé) या क्षेत्रातील अलीकडील अस्थिरतेचा नकाशा असल्यासारखा वाटतो. OpenAI मध्ये दोन वर्षे काम केल्यानंतर, ऑक्टोबर २०२४ मध्ये त्यांनी माजी OpenAI CTO Mira Murati सोबत Thinking Machines नावाचे स्टार्टअप सुरू करण्यासाठी कंपनी सोडली. काही महिन्यांनंतरच ते स्टार्टअप बंद झाले; जानेवारी २०२५ पर्यंत Zoph आणि सहकारी co-founder Luke Metz यांनी AI enterprise sales चे नेतृत्व करण्यासाठी पुन्हा OpenAI मध्ये प्रवेश केला. त्या भूमिकेत पाच महिने काम केल्यानंतर, जून २०२५ मध्ये Zoph यांनी पुन्हा कंपनी सोडली, ज्यामुळे त्यांना Google मध्ये जाण्याचा मार्ग मोकळा झाला.

प्रत्येक टप्पा एका व्यापक पॅटर्नचे दर्शन घडवतो: आघाडीचे संशोधक प्रस्थापित लॅब्स, नवोदित स्टार्टअप्स आणि टेक दिग्गजांच्या मोठ्या भांडवलामध्ये फिरत असतात. Zoph यांची ही नवीनतम झेप अशा कंपनीत झाली आहे ज्याने AI मध्ये अब्जावधी डॉलर्स खर्च केले आहेत, परंतु OpenAI च्या गाजलेल्या मॉडेल रिलीजशी स्पर्धा करण्यात त्यांना संघर्ष करावा लागला आहे.

Reinforcement learning आणि “post-training” हे नवीन युद्धक्षेत्र का आहेत?

Large-language models हे प्रचंड मजकूर डेटावर (text corpora) pre-training दरम्यान मूळ क्षमता प्राप्त करतात. पुढील टप्पा—ज्याला अनेकदा post-training म्हटले जाते—या मॉडेल्सना वास्तविक जगातील वापरासाठी fine-tune करतो. सर्वात दृश्यमान post-training पद्धत म्हणजे Reinforcement Learning from Human Feedback (RLHF), जिथे मानवी मूल्यमापनकर्ते मॉडेलच्या आउटपुटचा न्याय करतात आणि एक reinforcement-learning अल्गोरिदम त्या निर्णयांनुसार मॉडेलमध्ये सुधारणा करतो.

Google च्या Gemini मालिकेची मूळ कामगिरी भक्कम आहे, तरीही टीकाकारांच्या मते तिची safety आणि instruction-following क्षमता OpenAI च्या नवीनतम GPT च्या तुलनेत मागे आहे. RL आणि RLHF च्या सीमा विस्तारणारे संशोधन केलेले संशोधक नियुक्त करून, Google ने ही दरी कमी करण्याचा संकेत दिला आहे. Zoph मानवी फीडबॅक अधिक कार्यक्षमतेने गोळा करण्यासाठी pipelines तयार करण्यास, सूक्ष्म हेतू समजून घेणारे reward models विकसित करण्यास आणि स्थिरता न गमावता reasoning सुधारणारे नवीन RL algorithms प्रयोग करण्यास मदत करतील.

Google आणि OpenAI साठीचे महत्त्व

Google साठी, ही हालचाल Gemini ला cloud services, search आणि ग्राहक उत्पादनांमध्ये व्यावसायिक आधारस्तंभ बनवण्याच्या बहुवर्षीय प्रयत्नांमधील एक ठोस पाऊल आहे. अधिक चांगल्या प्रकारे align केलेली मॉडेल्स कायदेशीर जोखमीचा धोका कमी करतात आणि ग्राहकांचा विश्वास वाढवतात—जे कंपन्यांसाठी मोठ्या प्रमाणावर सुरक्षितपणे तैनात करता येण्याजोग्या AI ची मागणी करत असताना अत्यंत महत्त्वाचे घटक आहेत.

दरम्यान, OpenAI ला टॅलेंट एक्झोडसचा (talent exodus) सामना करावा लागत आहे, जो केवळ Zoph पुरता मर्यादित नाही. गेल्या आठ महिन्यांत कंपनीने आपले मुख्य परिचालन अधिकारी (COO) आणि वरिष्ठ डेटा-सेंटर लीडर्सना सोडून देताना पाहिले आहे, सोबतच अनेक कार्यकारी अधिकारीही कंपनी सोडून गेले आहेत. हे सर्व OpenAI संभाव्य IPO साठी तयारी करत असताना घडत आहे, ही अशी प्रक्रिया आहे ज्यामध्ये गुंतवणूकदार सहसा नेतृत्वाच्या स्थिरतेची बारकाईने तपासणी करतात. कर्मचारी बदलामुळे नवीन दृष्टिकोन मिळू शकतात, परंतु यामुळे दीर्घकालीन संशोधन कार्यक्रमांमधील सातत्य खंडित होण्याचा धोकाही असतो.

प्रतिवाद: एका नियुक्तीमुळे रातोरात Gemini बदलणार नाही

Google कडे आधीच RL, safety आणि model alignment मध्ये संशोधकांची मोठी फौज आहे. काही निरीक्षकांचा असा इशारा आहे की, Zoph सारख्या प्रतिभावान व्यक्तीची नियुक्ती झाली तरी, एक single vice-president एकट्याने Gemini सारख्या मोठ्या उत्पादन श्रेणीचे पूर्णपणे पुनरुज्जीवन करू शकत नाही. याचा खरा प्रभाव Zoph त्यांच्या कल्पना सध्याच्या टीममध्ये किती वेगाने समाविष्ट करतात, संसाधने मिळवतात आणि व्यापक उत्पादन रोडमॅपवर प्रभाव पाडतात यावर अवलंबून असेल.

Talent moves हे केवळ धोरणात्मक फायद्यासाठी नसून वैयक्तिक सुसंगतता आणि करिअरच्या दिशेवरही अवलंबून असू शकतात. Zoph यांचा enterprise sales मधील अल्प काळ संशोधनासोबतच बाजारपेठेतील प्रभावाचे मिश्रण असलेल्या भूमिकांची आवड दर्शवतो—अशी संधी केवळ संशोधन लॅबपेक्षा Google अधिक चांगल्या प्रकारे देऊ शकते.

पुढे काय पाहावे?

  • Gemini releases – आगामी मॉडेल अपडेट्समधून RL-केंद्रित सुधारणांमुळे safety scores आणि reasoning benchmarks मध्ये सुधारणा होते का, हे स्पष्ट होईल.
  • Research publications – Google च्या संशोधन विभागातील Zoph यांच्या नावाचे किंवा सह-लेखनाचे शोधनिबंध अंतर्गत प्रयोगांची दिशा दर्शवतील.
  • OpenAI leadership churn – पुढील मोठ्या पदावरील एक्झिट्स किंवा नवीन नियुक्त्या कोणत्याही सार्वजनिक ऑफरपूर्वी (public offering) कंपनीचा संशोधन अजेंडा बदलू शकतात.
  • Market response – क्लाउड-सर्व्हिस ग्राहक आणि एंटरप्राइझ खरेदीदार Google च्या AI स्टॅकवर विश्वास ठेवण्यापूर्वी Gemini च्या alignment मधील ठोस सुधारणांकडे लक्ष देतील.

Takeaway

बॅरेट झोफचे OpenAI कडून Google कडे झालेले स्थलांतर हे अधोरेखित करते की, AI शस्त्रास्त्र स्पर्धा आता केवळ compute आघाडीवरच नाही, तर talent आघाडीवरही तितक्याच तीव्रतेने लढली जात आहे. Gemini च्या संशोधनाचे नेतृत्व करण्यासाठी reinforcement-learning तज्ज्ञाची नियुक्ती करून, Google असा विश्वास व्यक्त करत आहे की post-training वर अधिक लक्ष केंद्रित केल्यामुळे OpenAI च्या GPT मॉडेल्ससोबतची कामगिरी आणि सुरक्षिततेतील तफावत कमी होईल—असा परिणाम जो या उद्योगाची स्पर्धात्मक गतिशीलता बदलून टाकू शकतो.