Barret Zoph, một cựu giám đốc điều hành tại OpenAI, đã gia nhập Google với tư cách là phó chủ tịch nghiên cứu nhằm đẩy nhanh sự phát triển của dòng mô hình ngôn ngữ lớn Gemini. Google hy vọng chuyên môn của Zoph về học tăng cường (reinforcement learning) và các kỹ thuật hậu huấn luyện (post-training) sẽ thắt chặt khả năng căn chỉnh (alignment), lập luận và tính an toàn của Gemini—những lĩnh vực mà dòng GPT của OpenAI hiện đang dẫn đầu.
Một hành trình chóng mặt của giới tinh hoa AI
Bản lý lịch của Zoph giống như một bản đồ về những biến động gần đây của ngành này. Sau hai năm tại OpenAI, ông đã rời đi vào tháng 10 năm 2024 để đồng sáng lập startup Thinking Machines cùng với cựu CTO của OpenAI, Mira Murati. Dự án này đã đóng cửa chỉ sau vài tháng; đến tháng 1 năm 2025, Zoph và người đồng sáng lập Luke Metz đã tái gia nhập OpenAI để dẫn dắt mảng bán hàng AI cho doanh nghiệp. Sau năm tháng ở vị trí đó, Zoph lại rời đi vào tháng 6 năm 2025, dọn đường cho việc chuyển sang Google.
Mỗi điểm dừng chân đều phản ánh một mô hình rộng lớn hơn: các nhà nghiên cứu hàng đầu luân chuyển giữa các phòng thí nghiệm lâu đời, các startup non trẻ và nguồn lực tài chính dồi dào của các gã khổng lồ công nghệ. Bước nhảy gần nhất của Zoph đưa ông đến một công ty đã đổ hàng tỷ đô la vào AI nhưng vẫn đang chật vật để bắt kịp những đợt ra mắt mô hình gây tiếng vang lớn của OpenAI.
Tại sao học tăng cường và “hậu huấn luyện” là chiến trường mới
Các mô hình ngôn ngữ lớn đạt được các khả năng thô trong quá trình tiền huấn luyện (pre-training) trên các kho dữ liệu văn bản khổng lồ. Giai đoạn tiếp theo—thường được gọi là hậu huấn luyện (post-training)—sẽ tinh chỉnh các mô hình đó để sử dụng trong thế giới thực. Phương pháp hậu huấn luyện rõ rệt nhất là Học tăng cường từ phản hồi của con người (RLHF), trong đó các chuyên gia đánh giá sẽ nhận xét kết quả đầu ra của mô hình và một thuật toán học tăng cường sẽ điều chỉnh mô hình để đáp ứng các nhận xét đó.
Dòng Gemini của Google cho thấy hiệu suất thô ổn định, tuy nhiên các nhà phê bình lưu ý rằng tính an toàn và khả năng tuân thủ chỉ dẫn của nó vẫn tụt hậu so với dòng GPT mới nhất của OpenAI. Bằng cách bổ nhiệm một nhà nghiên cứu có các công trình đã công bố liên tục phá vỡ các giới hạn của RL và RLHF, Google đang phát đi tín hiệu về ý định thu hẹp khoảng cách đó. Zoph sẽ giúp xây dựng các quy trình thu thập phản hồi của con người hiệu quả hơn, thiết kế các mô hình phần thưởng (reward models) nắm bắt được các ý định tinh tế, và thử nghiệm các thuật toán RL mới giúp cải thiện khả năng lập luận mà không làm mất đi tính ổn định.
Những thách thức đối với Google và OpenAI
Đối với Google, bước đi này là một bước đi cụ thể trong nỗ lực kéo dài nhiều năm nhằm biến Gemini thành trụ cột thương mại trong các dịch vụ đám mây, tìm kiếm và các sản phẩm tiêu dùng. Các mô hình được căn chỉnh tốt hơn sẽ làm giảm rủi ro pháp lý và tăng cường niềm tin của khách hàng—những yếu tố quan trọng khi các doanh nghiệp yêu cầu AI có thể được triển khai an toàn ở quy mô lớn.
Trong khi đó, OpenAI đang phải vật lộn với tình trạng chảy máu chất xám vượt ra ngoài phạm vi của Zoph. Trong tám tháng qua, công ty đã chứng kiến giám đốc điều hành (COO) và các lãnh đạo trung tâm dữ liệu cấp cao rời đi, cùng với sự thay đổi liên tục của đội ngũ quản lý cấp cao. Những sự ra đi này diễn ra trong bối cảnh OpenAI đang chuẩn bị cho một đợt IPO tiềm năng, một quá trình mà các nhà đầu tư thường xem xét kỹ lưỡng về sự ổn định của đội ngũ lãnh đạo. Sự thay đổi nhân sự có thể mang lại những góc nhìn mới, nhưng nó cũng có nguy cơ làm gián đoạn tính liên tục của các chương trình nghiên cứu dài hạn.
Quan điểm ngược lại: một nhân sự mới sẽ không thể thay đổi Gemini chỉ sau một đêm
Google đã sở hữu một đội ngũ nghiên cứu hùng hậu về RL, tính an toàn và căn chỉnh mô hình. Một số quan sát viên cảnh báo rằng một phó chủ tịch duy nhất, ngay cả khi có bề dày thành tích như Zoph, cũng không thể một mình đại tu một dòng sản phẩm lớn như Gemini. Tác động thực sự sẽ phụ thuộc vào việc Zoph tích hợp các ý tưởng của mình vào các nhóm hiện có nhanh đến mức nào, cách ông đảm bảo nguồn lực và gây ảnh hưởng đến lộ trình sản phẩm rộng lớn hơn.
Sự chuyển dịch nhân tài có thể liên quan đến sự phù hợp cá nhân và quỹ đạo nghề nghiệp cũng nhiều như lợi thế chiến lược. Thời gian ngắn làm việc trong mảng bán hàng doanh nghiệp của Zoph cho thấy sự khao khát đối với các vai trò kết hợp giữa nghiên cứu và tác động thị trường—một sự kết hợp mà Google có thể có vị thế tốt hơn để cung cấp so với một phòng thí nghiệm thuần nghiên cứu.
Những điều cần theo dõi tiếp theo
- Các bản phát hành Gemini – các bản cập nhật mô hình sắp tới sẽ tiết lộ liệu những cải tiến tập trung vào RL có giúp cải thiện điểm số an toàn và các tiêu chuẩn đánh giá (benchmarks) về lập luận hay không.
- Các công bố nghiên cứu – các bài báo từ bộ phận nghiên cứu của Google mang tên Zoph hoặc có sự đồng tác giả sẽ cho thấy hướng đi của các thử nghiệm nội bộ.
- Sự biến động lãnh đạo tại OpenAI – thêm các sự ra đi của những nhân vật tầm cỡ hoặc các đợt tuyển dụng mới có thể định hình lại chương trình nghiên cứu của công ty trước bất kỳ đợt chào bán công khai nào.
- Phản ứng của thị trường – các khách hàng dịch vụ đám mây và người mua doanh nghiệp sẽ chờ đợi những cải tiến cụ thể trong khả năng căn chỉnh của Gemini trước khi cam kết sử dụng hệ sinh thái AI (AI stack) của Google.
Bài học rút ra
Sự chuyển dịch của Barrett Zoph từ OpenAI sang Google nhấn mạnh rằng cuộc chạy đua vũ trang AI hiện nay đang diễn ra trên mặt trận nhân tài cũng quyết liệt như trên mặt trận năng lực tính toán. Bằng cách đưa một chuyên gia về học tăng cường (reinforcement learning) vào vị trí dẫn dắt mảng nghiên cứu của Gemini, Google đặt cược rằng việc tập trung mạnh mẽ hơn vào giai đoạn hậu huấn luyện (post-training) sẽ thu hẹp khoảng cách về hiệu suất và độ an toàn so với các mô hình GPT của OpenAI—một kết quả có thể tái định hình cục diện cạnh tranh của toàn ngành.
