Баррет Зоф, колишній керівник OpenAI, приєднався до Google на посаді віцепрезидента з досліджень, щоб прискорити розвиток сімейства великих мовних моделей Gemini. Google сподівається, що досвід Зофа в галузі навчання з підкріпленням (reinforcement learning) та методів постобучення (post-training) допоможе покращити узгодженість (alignment), здатність до міркування та безпеку Gemini — сфери, в яких серія GPT від OpenAI наразі лідирує.

Стрімкий тур елітою ШІ

Резюме Зофа схоже на карту нещодавніх потрясінь у цьому секторі. Після двох років в OpenAI він пішов у жовтні 2024 року, щоб стати співзасновником стартапу Thinking Machines разом із колишньою технічною директоркою OpenAI Мірою Мураті. Підприємство згорнулося через кілька місяців; до січня 2025 року Зоф та його колега-співзасновник Люк Мец знову приєдналися до OpenAI, щоб очолити продажі ШІ для підприємств. Після п'яти місяців на цій посаді Зоф знову пішов у червні 2025 року, що відкрило шлях до його переходу в Google.

Кожен етап відображає ширшу закономірність: провідні дослідники переміщуються між усталеними лабораторіями, молодими стартапами та величезними бюджетами технологічних гігантів. Останній стрибок Зофа привів його в компанію, яка вклала мільярди в ШІ, але все ще намагається зрівнятися з гучними релізами моделей від OpenAI.

Чому навчання з підкріпленням та «постобучення» — це нове поле битви

Великі мовні моделі здобувають базові можливості під час попереднього навчання (pre-training) на величезних масивах текстів. Наступний етап — часто званий постобученням (post-training) — налаштовує ці моделі для реального використання. Найбільш помітним методом постобучення є навчання з підкріпленням на основі відгуків людей (Reinforcement Learning from Human Feedback, RLHF), де люди-оцінювачі судять результати роботи моделі, а алгоритм навчання з підкріпленням коригує модель відповідно до цих оцінок.

Лінійка Gemini від Google демонструє стабільні базові показники, проте критики зазначають, що її безпека та здатність виконувати інструкції відстають від останньої моделі GPT від OpenAI. Призначаючи дослідника, чиї публікації неодноразово розширювали межі RL та RLHF, Google сигналізує про намір подолати цей розрив. Зоф допомагатиме створювати конвеєри для ефективнішого збору людських відгуків, розробляти моделі винагороди, що вловлюють тонкі нюанси намірів, та експериментувати з новими алгоритмами RL, які покращують здатність до міркування без втрати стабільності.

Ставки для Google та OpenAI

Для Google цей крок є конкретним етапом у багаторічній спробі зробити Gemini комерційним наріжним каменем у хмарних сервісах, пошуку та споживчих продуктах. Краще узгоджені моделі знижують ризики відповідальності та підвищують довіру клієнтів — це критичні фактори, оскільки підприємства вимагають ШІ, який можна безпечно впроваджувати в масштабах компанії.

OpenAI тим часом бореться з відтоком талантів, який виходить за межі лише випадку з Зофом. За останні вісім місяців компанія втратила свого операційного директора та керівників центрів обробки даних, а також пережила постійну зміну топменеджменту. Ці звільнення відбуваються саме тоді, коли OpenAI готується до потенційного IPO — процесу, за яким інвестори зазвичай ретельно стежать з точки зору стабільності керівництва. Кадровий обмін може принести нові ідеї, але він також несе ризик порушення безперервності довгострокових дослідницьких програм.

Контраргумент: один найм не перепише Gemini за одну ніч

Google вже має потужний склад дослідників у сферах RL, безпеки та узгодження моделей. Деякі спостерігачі застерігають, що один віцепрезидент, навіть із таким досвідом, як у Зофа, не зможе самотужки оновити таку величезну лінійку продуктів, як Gemini. Справжній вплив залежатиме від того, наскільки швидко Зоф інтегрує свої ідеї в існуючі команди, забезпечить ресурси та вплине на загальну дорожню карту продукту.

Переходи талантів можуть залежати від особистої відповідності та кар'єрної траєкторії так само сильно, як і від стратегічної переваги. Короткий період роботи Зофа у сфері корпоративних продажів свідчить про прагнення до ролей, що поєднують дослідження з ринковим впливом — поєднання, яке Google може запропонувати краще, ніж суто дослідницька лабораторія.

На що варто звернути увагу далі

  • Релізи Gemini – майбутні оновлення моделей покажуть, чи покращать вдосконалення, зосереджені на RL, показники безпеки та бенчмарки міркування.
  • Наукові публікації – статті дослідницького підрозділу Google, де автором або співавтором буде Зоф, вкажуть на напрям внутрішніх експериментів.
  • Зміна керівництва OpenAI – подальші гучні звільнення або нові призначення можуть змінити дослідницьку програму компанії перед будь-яким публічним розміщенням акцій.
  • Реакція ринку – клієнти хмарних сервісів та корпоративні покупці чекатимуть на конкретні покращення в узгодженості Gemini, перш ніж переходити на ШІ-стек Google.

Висновок

Перехід Барретта Зофа з OpenAI до Google підкреслює, що гонка озброєнь у сфері ШІ тепер ведеться на фронті талантів так само запекло, як і на фронті обчислювальних потужностей. Призначивши спеціаліста з навчання з підкріпленням очолити дослідження Gemini, Google робить ставку на те, що посилена увага до етапу донавчання (post-training) дозволить скоротити розрив у продуктивності та безпеці з моделями GPT від OpenAI — результат, який може змінити конкурентну динаміку галузі.