전 OpenAI 임원인 Barret Zoph가 Gemini 대규모 언어 모델 제품군의 발전을 가속화하기 위해 Google의 연구 부문 부사장(vice-president of research)으로 합류했습니다. Google은 Zoph의 강화 학습(reinforcement learning) 및 사후 학습(post-training) 기술에 대한 전문성이 현재 OpenAI의 GPT 시리즈가 앞서고 있는 분야인 Gemini의 정렬(alignment), 추론(reasoning) 및 안전성(safety)을 강화해 주기를 기대하고 있습니다.

AI 엘리트들의 급변하는 행보

Zoph의 이력서는 최근 업계의 격동을 보여주는 지도와 같습니다. OpenAI에서 2년간 근무한 후, 그는 2024년 10월 전 OpenAI CTO인 Mira Murati와 함께 스타트업 Thinking Machines를 공동 창업하기 위해 퇴사했습니다. 이 벤처는 몇 달 만에 해체되었으며, 2025년 1월 Zoph와 공동 창업자인 Luke Metz는 AI 기업용 영업을 진두지휘하기 위해 OpenAI에 재합류했습니다. 해당 직무에서 5개월을 보낸 후, Zoph는 2025년 6월 다시 퇴사하며 Google로의 이직을 위한 길을 열었습니다.

각 행보는 더 넓은 패턴을 반영합니다. 즉, 선도적인 연구자들이 기존 연구소, 신생 스타트업, 그리고 막대한 자본을 가진 거대 기술 기업 사이를 오가고 있다는 점입니다. Zoph의 최근 행보는 AI에 수십억 달러를 쏟아부었지만, OpenAI의 화제성 높은 모델 출시에는 미치지 못해 고군분투해 온 기업으로 향했습니다.

강화 학습과 “사후 학습”이 새로운 격전지가 된 이유

대규모 언어 모델은 방대한 텍스트 코퍼스에 대한 사전 학습(pre-training)을 통해 기초 역량을 습득합니다. 다음 단계인 사후 학습(post-training)은 이러한 모델을 실제 환경에서 사용할 수 있도록 미세 조정(fine-tuning)합니다. 가장 눈에 띄는 사후 학습 방법은 인간 피드백 기반 강화 학습(RLHF)으로, 인간 평가자가 모델의 출력을 판단하면 강화 학습 알고리즘이 그 판단을 충족하도록 모델을 조정하는 방식입니다.

Google의 Gemini 라인업은 탄탄한 기초 성능을 보여주지만, 비평가들은 안전성과 지시 이행(instruction-following) 능력이 OpenAI의 최신 GPT에 비해 뒤처진다고 지적합니다. RL 및 RLHF의 경계를 반복적으로 확장해 온 연구자를 영입함으로써, Google은 그 격차를 줄이겠다는 의지를 드러내고 있습니다. Zoph는 인간의 피드백을 더 효율적으로 수집하는 파이프라인을 구축하고, 미묘한 의도를 포착하는 보상 모델(reward models)을 설계하며, 안정성을 해치지 않으면서 추론 능력을 향상시키는 새로운 RL 알고리즘을 실험하는 데 기여할 것입니다.

Google과 OpenAI가 걸린 이해관계

Google에게 이번 영입은 Gemini를 클라우드 서비스, 검색 및 소비자 제품 전반의 상업적 초석으로 만들기 위한 다년간의 노력 중 구체적인 단계입니다. 더 잘 정렬된 모델은 법적 책임 리스크를 낮추고 고객 신뢰를 높입니다. 이는 기업들이 대규모로 안전하게 배포할 수 있는 AI를 요구함에 따라 매우 중요한 요소가 되었습니다.

한편, OpenAI는 Zoph를 넘어선 인재 유출 문제로 고심하고 있습니다. 지난 8개월 동안 이 회사는 최고 운영 책임자(COO)와 고위 데이터 센터 리더들이 떠났으며, 경영진의 교체도 빈번하게 일어났습니다. 이러한 이탈은 OpenAI가 잠재적인 IPO를 준비하는 과정에서 발생하고 있으며, 투자자들은 일반적으로 이 과정에서 리더십의 안정성을 면밀히 검토합니다. 인력 교체는 새로운 관점을 불어넣을 수도 있지만, 장기적인 연구 프로그램의 연속성을 저해할 위험도 있습니다.

반론: 단 한 명의 영입으로 Gemini가 하룻밤 사이에 바뀌지는 않는다

Google은 이미 RL, 안전성 및 모델 정렬 분야에서 두터운 연구진을 보유하고 있습니다. 일부 관찰자들은 Zoph와 같은 화려한 경력을 가진 부사장이라 할지라도, Gemini처럼 거대한 제품 라인을 혼자서 완전히 개편할 수는 없다고 경고합니다. 실제 영향력은 Zoph가 자신의 아이디어를 기존 팀에 얼마나 빨리 통합하고, 자원을 확보하며, 광범위한 제품 로드맵에 얼마나 영향을 미치느냐에 달려 있을 것입니다.

인재 이동은 전략적 이점만큼이나 개인의 적성과 커리어 경로에 의해서도 결정됩니다. Zoph가 기업용 영업 분야에서 짧게 근무했던 점은 연구와 시장 영향력을 결합한 역할을 선호함을 시사합니다. 이는 연구 전용 연구소보다는 Google이 더 잘 제공할 수 있는 조합일 수 있습니다.

향후 주목해야 할 점

  • Gemini 출시 – 향후 모델 업데이트를 통해 RL 중심의 개선 작업이 안전성 점수와 추론 벤치마크를 향상시키는지 확인할 수 있을 것입니다.
  • 연구 논문 발표 – Zoph의 이름이 들어가거나 공동 저자로 참여한 Google 연구 부문의 논문들은 내부 실험의 방향을 보여줄 것입니다.
  • OpenAI 리더십 변동 – 추가적인 고위급 인사의 퇴사나 신규 영입은 상장(IPO)을 앞두고 회사의 연구 과제를 재편할 수 있습니다.
  • 시장 반응 – 클라우드 서비스 고객과 기업 구매자들은 Google의 AI 스택을 도입하기 전에 Gemini의 정렬 능력이 구체적으로 개선되는지 지켜볼 것입니다.

시사점

Barrett Zoph가 OpenAI에서 Google로 자리를 옮긴 것은 AI 군비 경쟁이 이제 컴퓨팅 자원 못지않게 인재 확보 측면에서도 치열하게 전개되고 있음을 여실히 보여준다. Gemini 연구의 수장에 강화 학습 전문가를 배치함으로써, Google은 사후 학습(post-training)에 더욱 집중하여 OpenAI의 GPT 모델과의 성능 및 안전성 격차를 좁히겠다는 승부수를 던졌으며, 이는 업계의 경쟁 구도를 재편할 수 있는 결과로 이어질 수 있다.