Barret Zoph, ancien cadre d'OpenAI, a rejoint Google en tant que vice-président de la recherche pour accélérer la famille de modèles de langage de grande taille Gemini. Google espère que l'expertise de Zoph en apprentissage par renforcement et en techniques de post-entraînement permettra de renforcer l'alignement, le raisonnement et la sécurité de Gemini — des domaines où la série GPT d'OpenAI domine actuellement.
Un tour d'horizon effréné de l'élite de l'IA
Le CV de Zoph ressemble à une carte des récentes turbulences du secteur. Après deux ans chez OpenAI, il est parti en octobre 2024 pour cofonder la startup Thinking Machines avec l'ancienne directrice technique (CTO) d'OpenAI, Mira Murati. L'entreprise a fermé après quelques mois ; en janvier 2025, Zoph et son cofondateur Luke Metz ont rejoint à nouveau OpenAI pour diriger les ventes de solutions IA aux entreprises. Après cinq mois à ce poste, Zoph est reparti en juin 2025, ouvrant la voie à son arrivée chez Google.
Chaque étape reflète une tendance plus large : les chercheurs de premier plan oscillent entre laboratoires établis, startups naissantes et les moyens colossaux des géants de la technologie. Le dernier saut de Zoph le mène dans une entreprise qui a investi des milliards dans l'IA, mais qui a peiné à égaler les lancements de modèles médiatisés d'OpenAI.
Pourquoi l'apprentissage par renforcement et le « post-entraînement » sont le nouveau champ de bataille
Les modèles de langage de grande taille acquièrent des capacités brutes lors de la phase de pré-entraînement sur de massifs corpus de textes. La phase suivante — souvent appelée post-entraînement — affine ces modèles pour un usage en conditions réelles. La méthode de post-entraînement la plus visible est l'apprentissage par renforcement à partir de la rétroaction humaine (RLHF), où des évaluateurs humains jugent les résultats du modèle et un algorithme d'apprentissage par renforcement ajuste le modèle pour satisfaire ces jugements.
La gamme Gemini de Google affiche des performances brutes solides, pourtant les critiques notent que sa sécurité et sa capacité à suivre des instructions accusent un retard par rapport au dernier GPT d'OpenAI. En nommant un chercheur dont les travaux publiés repoussent régulièrement les limites du RL et du RLHF, Google signale son intention de combler cet écart. Zoph aidera à construire des pipelines qui collectent la rétroaction humaine plus efficacement, à concevoir des modèles de récompense qui capturent des intentions nuancées et à expérimenter de nouveaux algorithmes de RL qui améliorent le raisonnement sans sacrifier la stabilité.
Les enjeux pour Google et pour OpenAI
Pour Google, ce mouvement est une étape concrète dans un effort pluriannuel visant à faire de Gemini un pilier commercial à travers les services cloud, la recherche et les produits grand public. Des modèles mieux alignés réduisent les risques de responsabilité et renforcent la confiance des clients — des facteurs critiques alors que les entreprises exigent une IA pouvant être déployée à grande échelle en toute sécurité.
OpenAI, quant à elle, est aux prises avec un exode de talents qui dépasse le cas de Zoph. Au cours des huit derniers mois, l'entreprise a vu son directeur des opérations (COO) et ses cadres supérieurs des centres de données partir, parallèlement à une rotation constante de dirigeants. Ces départs surviennent alors qu'OpenAI se prépare à une éventuelle introduction en bourse (IPO), un processus que les investisseurs scrutent généralement pour garantir la stabilité de la direction. Le renouvellement peut apporter des perspectives fraîches, mais il risque également de perturber la continuité des programmes de recherche à long terme.
Contrepoint : une seule embauche ne réécrira pas Gemini du jour au lendemain
Google dispose déjà d'un vivier important de chercheurs en RL, en sécurité et en alignement de modèles. Certains observateurs avertissent qu'un seul vice-président, même doté du pedigree de Zoph, ne peut à lui seul refondre une ligne de produits aussi vaste que Gemini. L'impact réel dépendra de la rapidité avec laquelle Zoph intégrera ses idées aux équipes existantes, obtiendra des ressources et influencera la feuille de route globale du produit.
Les mouvements de talents peuvent autant dépendre de l'adéquation personnelle et de la trajectoire de carrière que de l'avantage stratégique. Le bref passage de Zoph dans la vente aux entreprises suggère un appétit pour des rôles mêlant recherche et impact sur le marché — une combinaison que Google pourrait être mieux positionné pour offrir qu'un laboratoire exclusivement dédié à la recherche.
À surveiller ensuite
- Sorties de Gemini – les prochaines mises à jour des modèles révéleront si les affinements axés sur le RL améliorent les scores de sécurité et les références de raisonnement.
- Publications de recherche – les articles de la division de recherche de Google portant le nom de Zoph ou une co-signature indiqueront la direction des expérimentations internes.
- Rotation de la direction d'OpenAI – de nouveaux départs de haut niveau ou de nouvelles embauches pourraient remodeler l'agenda de recherche de l'entreprise avant toute offre publique.
- Réaction du marché – les clients des services cloud et les acheteurs d'entreprises surveilleront les améliorations concrètes de l'alignement de Gemini avant de s'engager dans la pile technologique IA de Google.
À retenir
Le passage de Barrett Zoph d'OpenAI à Google souligne à quel point la course aux armements en IA se joue désormais autant sur le front des talents que sur celui de la puissance de calcul. En plaçant un spécialiste de l'apprentissage par renforcement à la tête de la recherche de Gemini, Google parie qu'une attention accrue portée au post-entraînement permettra de réduire l'écart de performance et de sécurité avec les modèles GPT d'OpenAI — un résultat qui pourrait redéfinir la dynamique concurrentielle du secteur.
