முன்னாள் OpenAI நிர்வாகியான Barret Zoph, Gemini வகை பெரிய மொழி மாதிரிகளின் (large-language models) வளர்ச்சியைத் துரிதப்படுத்த, கூகுளில் (Google) ஆராய்ச்சித் துறைத் துணைத் தலைவராக இணைந்துள்ளார். reinforcement learning மற்றும் post-training நுட்பங்களில் Zoph கொண்டுள்ள நிபுணத்துவம், Gemini-இன் alignment, reasoning மற்றும் safety ஆகியவற்றை மேம்படுத்த உதவும் என்று கூகுள் நம்புகிறது—இந்தத் துறைகளில் தற்போது OpenAI-இன் GPT தொடர் முன்னணியில் உள்ளது.

AI உலகின் முன்னணித் தலைவர்களின் வேகமான பயணம்

Zoph-இன் வாழ்க்கை வரலாறு இந்தத் துறையின் சமீபத்திய மாற்றங்களை ஒரு வரைபடம் போலக் காட்டுகிறது. OpenAI-இல் இரண்டு ஆண்டுகள் பணியாற்றிய பிறகு, அவர் அக்டோபர் 2024-இல் முன்னாள் OpenAI CTO Mira Murati உடன் இணைந்து Thinking Machines என்ற ஸ்டார்ட்அப் நிறுவனத்தைத் தொடங்கினார். சில மாதங்களிலேயே அந்த நிறுவனம் மூடப்பட்டது; ஜனவரி 2025-க்குள் Zoph மற்றும் சக இணை நிறுவனர் Luke Metz ஆகியோர் மீண்டும் OpenAI-இல் இணைந்து AI enterprise sales பணிகளை முன்னெடுத்தனர். அந்தப் பொறுப்பில் ஐந்து மாதங்கள் இருந்த பிறகு, ஜூன் 2025-இல் Zoph மீண்டும் வெளியேறினார், இது அவர் கூகுளுக்குச் செல்வதற்கான பாதையை அமைத்துக் கொடுத்தது.

ஒவ்வொரு மாற்றமும் ஒரு பரந்த முறையைப் பிரதிபலிக்கிறது: முன்னணி ஆராய்ச்சியாளர்கள் நிறுவப்பட்ட ஆய்வகங்கள், வளர்ந்து வரும் ஸ்டார்ட்அப்கள் மற்றும் தொழில்நுட்ப ஜாம்பவான்களின் பெரும் முதலீடுகள் ஆகியவற்றிற்கு இடையே மாறி மாறிச் செல்கிறார்கள். Zoph-இன் சமீபத்திய நகர்வு, AI துறையில் பில்லியன் கணக்கான டாலர்களை முதலீடு செய்தும், OpenAI-இன் கவனத்தை ஈர்க்கும் மாடல் வெளியீடுகளுக்கு நிகராகச் செயல்படப் போராடிக்கொண்டிருக்கும் ஒரு நிறுவனத்திற்கு அவரை அழைத்துச் சென்றுள்ளது.

ஏன் reinforcement learning மற்றும் “post-training” ஆகியவை புதிய போர்க்களமாக உள்ளன

பெரிய மொழி மாதிரிகள் (Large-language models) பிரம்மாண்டமான உரைத் தொகுப்புகளில் (text corpora) pre-training மூலம் அடிப்படைத் திறன்களைப் பெறுகின்றன. அடுத்த கட்டமான post-training, அந்த மாதிரிகளை நிஜ உலகப் பயன்பாட்டிற்காகச் செம்மைப்படுத்துகிறது (fine-tunes). மிகவும் பிரபலமான post-training முறை Reinforcement Learning from Human Feedback (RLHF) ஆகும்; இதில் மனித மதிப்பீட்டாளர்கள் மாதிரியின் வெளியீடுகளைத் தீர்மானிக்கிறார்கள், மேலும் ஒரு reinforcement-learning அல்காரிதம் அந்தத் தீர்மானங்களுக்கு ஏற்ப மாதிரியைச் சரிசெய்கிறது.

கூகுளின் Gemini வரிசை சிறந்த அடிப்படைத் திறனைக் காட்டினாலும், அதன் safety மற்றும் instruction-following ஆகியவை OpenAI-இன் சமீபத்திய GPT-க்கு பின்னால் இருப்பதாக விமர்சகர்கள் குறிப்பிடுகின்றனர். RL மற்றும் RLHF ஆகியவற்றின் எல்லைகளைத் தொடர்ந்து விரிவுபடுத்தி வரும் ஒரு ஆராய்ச்சியாளரை நியமிப்பதன் மூலம், அந்த இடைவெளியைக் குறைக்க கூகுள் intent காட்டுகிறது. மனித கருத்துக்களை (human feedback) அதிகத் திறனுடன் சேகரிக்கும் வழிமுறைகளை உருவாக்கவும், நுணுக்கமான நோக்கங்களைப் புரிந்துகொள்ளும் reward models-களை வடிவமைக்கவும், நிலைத்தன்மையைக் குறைக்காமல் reasoning திறனை மேம்படுத்தும் புதிய RL அல்காரிதம்களைச் சோதிக்கவும் Zoph உதவுவார்.

கூகுள் மற்றும் OpenAI ஆகியவற்றுக்கான சவால்கள்

கூகுளுக்கு, இந்த நகர்வு Gemini-ஐ cloud சேவைகள், தேடல் (search) மற்றும் நுகர்வோர் தயாரிப்புகள் ஆகியவற்றில் ஒரு வணிகத் தூணாக மாற்றுவதற்கான பல ஆண்டு கால முயற்சியின் ஒரு முக்கியப் படியாகும். சிறந்த முறையில் சீரமைக்கப்பட்ட (better-aligned) மாதிரிகள் பொறுப்புக்கூறல் அபாயத்தைக் (liability risk) குறைப்பதோடு, வாடிக்கையாளர் நம்பிக்கையையும் அதிகரிக்கின்றன—நிறுவனங்கள் பெரிய அளவில் பாதுகாப்பாகப் பயன்படுத்தக்கூடிய AI-ஐக் கோரும் சூழலில் இது மிக முக்கியமான காரணியாகும்.

அதே நேரத்தில், OpenAI தகுதியான நபர்களின் வெளியேற்றத்தால் (talent exodus) போராடி வருகிறது. கடந்த எட்டு மாதங்களில், நிறுவனத்தின் தலைமை செயல்பாட்டு அதிகாரி (COO) மற்றும் மூத்த தரவு மையத் தலைவர்கள் (senior data-center leaders) உட்பட பல நிர்வாகிகள் மாறி மாறி வெளியேறியுள்ளனர். OpenAI ஒரு சாத்தியமான IPO-விற்காகத் தயாராகி வரும் வேளையில் இந்த வெளியேற்றங்கள் நிகழ்கின்றன; முதலீட்டாளர்கள் பொதுவாக இத்தகைய சூழலில் தலைமைத்துவ நிலைத்தன்மையை உன்னிப்பாகக் கவனிப்பார்கள். பணியாளர் மாற்றங்கள் புதிய பார்வைகளை வழங்கக்கூடும், ஆனால் அவை நீண்டகால ஆராய்ச்சித் திட்டங்களின் தொடர்ச்சியைக் குலைக்கும் அபாயத்தையும் கொண்டுள்ளன.

மாற்றுக்கருத்து: ஒரு புதிய நியமனம் ஒரே இரவில் Gemini-ஐ மாற்றிவிடாது

கூகுள் ஏற்கனவே RL, safety மற்றும் model alignment ஆகியவற்றில் சிறந்த ஆராய்ச்சியாளர்களைக் கொண்டுள்ளது. Zoph போன்ற அனுபவம் வாய்ந்த ஒரு துணைத் தலைவரால் மட்டுமே Gemini போன்ற ஒரு பெரிய தயாரிப்பு வரிசையை முழுமையாக மாற்றியமைக்க முடியாது என்று சில ஆய்வாளர்கள் எச்சரிக்கின்றனர். Zoph தனது கருத்துக்களை ஏற்கனவே உள்ள குழுக்களுடன் எவ்வளவு விரைவாக ஒருங்கிணைக்கிறார், வளங்களைப் பெறுகிறார் மற்றும் ஒட்டுமொத்த தயாரிப்புத் திட்டத்தில் (product roadmap) எவ்வளவு செல்வாக்கு செலுத்துகிறார் என்பதிலேயே அதன் உண்மையான தாக்கம் அமையும்.

திறமையாளர்களின் இடமாற்றம் என்பது மூலோபாய நன்மையைப் போலவே தனிப்பட்ட பொருத்தம் மற்றும் தொழில் வாழ்க்கையின் போரைப் பொறுத்தும் அமையும். Zoph-இன் enterprise sales அனுபவம், ஆராய்ச்சி மற்றும் சந்தை தாக்கம் ஆகிய இரண்டையும் இணைக்கும் பொறுப்புகளுக்கான அவரது ஆர்வத்தைக் காட்டுகிறது—ஆராய்ச்சி சார்ந்த ஆய்வகங்களை விட கூகுள் இத்தகைய வாய்ப்பை வழங்கச் சிறந்த நிலையில் உள்ளது.

அடுத்து கவனிக்க வேண்டியவை

  • Gemini வெளியீடுகள் – வரவிருக்கும் மாடல் மேம்படுத்தல்கள், RL-சார்ந்த செம்மைப்படுத்தல்கள் பாதுகாப்பு மதிப்பெண்கள் மற்றும் reasoning benchmarks ஆகியவற்றில் முன்னேற்றத்தை ஏற்படுத்துமா என்பதைக் காட்டும்.
  • ஆராய்ச்சி வெளியீடுகள் – கூகுளின் ஆராய்ச்சிப் பிரிவிலிருந்து வெளிவரும் Zoph-இன் பெயர் அல்லது இணை ஆசிரியர் பெயரைக் கொண்ட ஆய்வுக் கட்டுரைகள், உள்நாட்டு சோதனைகளின் திசையைக் காட்டும்.
  • OpenAI தலைமை மாற்றங்கள் – மேலும் பல முக்கியப் பதவிகளில் இருந்து வெளியேற்றங்கள் அல்லது புதிய நியமனங்கள், பொதுப் பங்களிப்புக்கு (public offering) முன்னதாக நிறுவனத்தின் ஆராய்ச்சித் திட்டத்தை மாற்றியமைக்கக்கூடும்.
  • சந்தை எதிர்வினை – cloud-சேவை வாடிக்கையாளர்கள் மற்றும் நிறுவன வாங்குபவர்கள், கூகுளின் AI stack-ஐத் தேர்ந்தெடுப்பதற்கு முன் Gemini-இன் alignment-இல் உறுதியான முன்னேற்றங்களை எதிர்பார்த்துப் பார்ப்பார்கள்.

முக்கியக் கருத்து

Barrett Zoph OpenAI-யிலிருந்து Google-க்கு மாறியது, AI ஆயுதப் போட்டி இப்போது கணினித் திறன் (compute) முன்னணியில் எவ்வளவு முக்கியமோ, அதே அளவு திறமையான மனிதவள (talent) முன்னணியிலும் போரிடுகிறது என்பதை அடிக்கோடிட்டுக் காட்டுகிறது. Gemini ஆராய்ச்சியின் தலைமையின் கீழ் ஒரு reinforcement-learning நிபுணரை அமர்த்துவதன் மூலம், post-training மீதான தீவிர கவனம் OpenAI-யின் GPT மாடல்களுக்கும் இடையிலான செயல்திறன் மற்றும் பாதுகாப்பு இடைவெளியைக் குறைக்கும் என்று Google நம்புகிறது—இது இந்தத் துறையின் போட்டித் தன்மையை (competitive dynamics) மாற்றியமைக்கக்கூடிய ஒரு முடிவாகும்.