Barret Zoph, były dyrektor OpenAI, dołączył do Google jako wiceprezes ds. badań, aby przyspieszyć rozwój rodziny dużych modeli językowych Gemini. Google liczy na to, że wiedza Zopha w zakresie uczenia ze wzmocnieniem (reinforcement learning) i technik post-trainingowych pozwoli usprawnić dopasowanie (alignment), rozumowanie i bezpieczeństwo Gemini – obszary, w których seria GPT od OpenAI obecnie dominuje.
Błyskawiczna podróż przez elitę AI
Życiorys Zopha czyta się jak mapę niedawnych turbulencji w sektorze. Po dwóch latach w OpenAI odszedł w październiku 2024 roku, aby współzałożyć startup Thinking Machines wraz z byłą dyrektor technologiczną (CTO) OpenAI, Mirą Murati. Przedsięwzięcie upadło po kilku miesiącach; do stycznia 2025 roku Zoph i współzałożyciel Luke Metz ponownie dołączyli do OpenAI, aby kierować sprzedażą AI dla przedsiębiorstw. Po pięciu miesiącach na tym stanowisku Zoph odszedł ponownie w czerwcu 2025 roku, torując sobie drogę do Google.
Każdy przystanek odzwierciedla szerszy schemat: czołowi badacze przemieszczają się między uznanymi laboratoriami, nowo powstającymi startupami a ogromnymi funduszami gigantów technologicznych. Najnowszy skok Zopha ląduje w firmie, która zainwestowała miliardy w AI, ale miała trudności z dorównaniem głośnym premierom modeli OpenAI.
Dlaczego uczenie ze wzmocnieniem i „post-training” to nowe pole bitwy
Duże modele językowe nabywają surowe zdolności podczas wstępnego trenowania (pre-training) na ogromnych korpusach tekstowych. Kolejna faza – często nazywana post-trainingiem – dostraja te modele do użytku w świecie rzeczywistym. Najbardziej widoczną metodą post-treningu jest uczenie ze wzmocnieniem na podstawie informacji zwrotnej od ludzi (RLHF), gdzie ludzcy ewaluatorzy oceniają wyniki modelu, a algorytm uczenia ze wzmocnieniem dostosowuje model tak, aby spełniał te oceny.
Linia Gemini od Google wykazuje solidne surowe wyniki, jednak krytycy zauważają, że jej bezpieczeństwo i zdolność do podążania za instrukcjami odstają od najnowszego GPT od OpenAI. Mianując badacza, którego publikacje wielokrotnie przesuwają granice RL i RLHF, Google sygnalizuje zamiar zniwelowania tej luki. Zoph pomoże budować potoki (pipelines) efektywniej zbierające ludzką informację zwrotną, projektować modele nagrody (reward models) wychwytujące niuanse intencji oraz eksperymentować z nowatorskimi algorytmami RL, które poprawią rozumowanie bez poświęcania stabilności.
Stawka dla Google i dla OpenAI
Dla Google ten ruch jest konkretnym krokiem w wieloletnich staraniach o uczynienie Gemini komercyjnym filarem usług chmurowych, wyszukiwarki i produktów konsumenckich. Lepiej dopasowane modele zmniejszają ryzyko odpowiedzialności i zwiększają zaufanie klientów – co jest kluczowe, gdy przedsiębiorstwa wymagają AI, którą można bezpiecznie wdrażać na dużą skalę.
OpenAI tymczasem zmaga się z odpływem talentów, który wykracza poza Zopha. W ciągu ostatnich ośmiu miesięcy firma pożegnała swojego dyrektora operacyjnego (COO) oraz starszych liderów centrów danych, a także doświadczyła dużej rotacji na stanowiskach kierowniczych. Odejścia te następują w czasie, gdy OpenAI przygotowuje się do potencjalnego debiutu giełdowego (IPO) – procesu, który inwestorzy zazwyczaj poddają wnikliwej analizie pod kątem stabilności przywództwa. Rotacja może wnieść świeże spojrzenie, ale niesie też ryzyko zakłócenia ciągłości długoterminowych programów badawczych.
Kontrargument: jedno zatrudnienie nie zmieni Gemini z dnia na dzień
Google dysponuje już szeroką kadrą badaczy w dziedzinie RL, bezpieczeństwa i dopasowania modeli. Niektórzy obserwatorzy ostrzegają, że jeden wiceprezes, nawet o takim doświadczeniu jak Zoph, nie jest w stanie samodzielnie przebudować tak dużej linii produktów jak Gemini. Realny wpływ będzie zależał od tego, jak szybko Zoph zintegruje swoje pomysły z istniejącymi zespołami, zabezpieczy zasoby i wpłynie na szerszą mapę drogową produktu.
Ruchy kadrowe mogą wynikać w równym stopniu z dopasowania osobistego i ścieżki kariery, co ze strategicznej przewagi. Krótki epizod Zopha w sprzedaży dla przedsiębiorstw sugeruje apetyt na role łączące badania z wpływem rynkowym – kombinację, którą Google może być w stanie zaoferować lepiej niż laboratorium skupione wyłącznie na badaniach.
Na co warto zwrócić uwagę
- Premiery Gemini – nadchodzące aktualizacje modeli ujawnią, czy ulepszenia skoncentrowane na RL poprawią wyniki w zakresie bezpieczeństwa i benchmarkach rozumowania.
- Publikacje badawcze – prace działu badawczego Google noszące nazwisko Zopha lub zawierające jego współautorstwo wskażą kierunek wewnętrznych eksperymentów.
- Rotacja w kierownictwie OpenAI – kolejne głośne odejścia lub nowe zatrudnienia mogą zmienić agendę badawczą firmy przed ewentualną ofertą publiczną.
- Reakcja rynku – klienci usług chmurowych i nabywcy korporacyjni będą wypatrywać konkretnych usprawnień w dopasowaniu Gemini, zanim zdecydują się na wdrożenie stosu AI od Google.
Wnioski
Przejście Barretta Zopha z OpenAI do Google podkreśla, że wyścig zbrojeń w dziedzinie AI toczy się obecnie równie mocno na froncie talentów, co na froncie mocy obliczeniowej. Obsadzając specjalistę od uczenia ze wzmocnieniem na czele prac badawczych nad Gemini, Google liczy na to, że większy nacisk na proces post-treningowy zmniejszy lukę w zakresie wydajności i bezpieczeństwa względem modeli GPT firmy OpenAI – co może zmienić dynamikę konkurencji w branży.
