Barret Zoph อดีตผู้บริหาร OpenAI ได้เข้าร่วมงานกับ Google ในตำแหน่งรองประธานฝ่ายวิจัย (vice-president of research) เพื่อเร่งการพัฒนาตระกูลโมเดลภาษาขนาดใหญ่ Gemini โดย Google หวังว่าความเชี่ยวชาญของ Zoph ในด้าน reinforcement learning และเทคนิค post-training จะช่วยเพิ่มความแม่นยำในการปรับจูนโมเดล (alignment) การใช้เหตุผล (reasoning) และความปลอดภัย (safety) ซึ่งเป็นด้านที่ซีรีส์ GPT ของ OpenAI ยังคงเป็นผู้นำอยู่ในปัจจุบัน

เส้นทางอันรวดเร็วของเหล่าชนชั้นนำในวงการ AI

ประวัติการทำงานของ Zoph เปรียบเสมือนแผนที่ที่แสดงถึงความผันผวนของภาคส่วนนี้ในช่วงที่ผ่านมา หลังจากทำงานที่ OpenAI ได้สองปี เขาได้ลาออกในเดือนตุลาคม 2024 เพื่อร่วมก่อตั้งสตาร์ทอัพ Thinking Machines กับอดีต CTO ของ OpenAI อย่าง Mira Murati แต่กิจการดังกล่าวต้องปิดตัวลงหลังจากผ่านไปเพียงไม่กี่เดือน ต่อมาในเดือนมกราคม 2025 Zoph และ Luke Metz ผู้ร่วมก่อตั้งอีกคน ได้กลับเข้าสู่ OpenAI อีกครั้งเพื่อนำทีมขาย AI สำหรับองค์กร หลังจากดำรงตำแหน่งนั้นได้ห้าเดือน Zoph ก็ลาออกอีกครั้งในเดือนมิถุนายน 2025 เพื่อเปิดทางให้กับการย้ายไปร่วมงานกับ Google

ทุกจุดหมายสะท้อนถึงรูปแบบที่กว้างกว่านั้น นั่นคือเหล่านักวิจัยชั้นนำมักจะย้ายไปมาระหว่างห้องปฏิบัติการที่มั่นคง สตาร์ทอัพที่เพิ่งก่อตั้ง และบริษัทเทคโนโลยียักษ์ใหญ่ที่มีเงินทุนมหาศาล การก้าวกระโดดครั้งล่าสุดของ Zoph นำเขาไปสู่บริษัทที่ทุ่มเงินหลายพันล้านดอลลาร์ให้กับ AI แต่ยังคงต้องดิ้นรนเพื่อให้สามารถเปิดตัวโมเดลที่สร้างความฮือฮาได้เทียบเท่ากับ OpenAI

ทำไม reinforcement learning และ “post-training” จึงกลายเป็นสมรภูมิใหม่

โมเดลภาษาขนาดใหญ่จะได้รับความสามารถพื้นฐานในช่วงการฝึกฝนเบื้องต้น (pre-training) จากคลังข้อมูลข้อความมหาศาล ขั้นตอนถัดมาซึ่งมักเรียกว่า post-training คือการปรับจูนโมเดลเหล่านั้นเพื่อให้ใช้งานได้จริงในโลกปัจจุบัน วิธีการ post-training ที่เห็นได้ชัดที่สุดคือ Reinforcement Learning from Human Feedback (RLHF) ซึ่งผู้ประเมินที่เป็นมนุษย์จะตัดสินผลลัพธ์ของโมเดล และอัลกอริทึมการเรียนรู้แบบเสริมกำลังจะปรับแต่งโมเดลเพื่อให้สอดคล้องกับคำตัดสินเหล่านั้น

ผลงานพื้นฐานของตระกูล Gemini จาก Google นั้นแสดงให้เห็นถึงประสิทธิภาพที่แข็งแกร่ง แต่เหล่านักวิจารณ์ตั้งข้อสังเกตว่าด้านความปลอดภัยและการปฏิบัติตามคำสั่ง (instruction-following) ยังตามหลัง GPT รุ่นล่าสุดของ OpenAI การแต่งตั้งนักวิจัยที่มีผลงานตีพิมพ์ซึ่งผลักดันขอบเขตของ RL และ RLHF มาอย่างต่อเนื่อง เป็นการส่งสัญญาณจาก Google ว่ามีความตั้งใจที่จะปิดช่องว่างดังกล่าว Zoph จะช่วยสร้างกระบวนการ (pipelines) ที่เก็บรวบรวมคำติชมจากมนุษย์ได้อย่างมีประสิทธิภาพมากขึ้น ออกแบบ reward models ที่สามารถจับใจความเจตนาที่ละเอียดอ่อน และทดลองกับอัลกอริทึม RL รูปแบบใหม่ที่ช่วยเพิ่มความสามารถในการใช้เหตุผลโดยไม่สูญเสียความเสถียร

เดิมพันของ Google และ OpenAI

สำหรับ Google การเคลื่อนไหวครั้งนี้เป็นขั้นตอนที่เป็นรูปธรรมในความพยายามหลายปีที่จะทำให้ Gemini กลายเป็นรากฐานสำคัญเชิงพาณิชย์ ทั้งในบริการ cloud, การค้นหา และผลิตภัณฑ์สำหรับผู้บริโภค โมเดลที่มีการปรับจูน (alignment) ที่ดีขึ้นจะช่วยลดความเสี่ยงด้านความรับผิดชอบและเพิ่มความเชื่อมั่นของลูกค้า ซึ่งเป็นปัจจัยสำคัญในขณะที่องค์กรต่างๆ ต้องการ AI ที่สามารถนำไปใช้งานในระดับกว้างได้อย่างปลอดภัย

ในขณะเดียวกัน OpenAI กำลังเผชิญกับการไหลออกของบุคลากรที่มีความสามารถ ซึ่งไม่ได้มีเพียงแค่ Zoph เท่านั้น ในช่วงแปดเดือนที่ผ่านมา บริษัทได้เห็นประธานเจ้าหน้าที่ฝ่ายปฏิบัติการ (COO) และผู้นำด้านศูนย์ข้อมูลอาวุโสลาออกไป พร้อมกับการหมุนเวียนของผู้บริหาร การลาออกเหล่านี้เกิดขึ้นในขณะที่ OpenAI กำลังเตรียมตัวสำหรับการเข้าจดทะเบียนในตลาดหลักทรัพย์ (IPO) ซึ่งเป็นกระบวนการที่นักลงทุนมักจะตรวจสอบความมั่นคงของผู้นำ การเปลี่ยนตัวบุคลากรอาจนำมุมมองใหม่ๆ เข้ามา แต่ก็มีความเสี่ยงที่จะขัดขวางความต่อเนื่องของโครงการวิจัยระยะยาว

มุมมองต่าง: การจ้างงานเพียงคนเดียวไม่สามารถเปลี่ยนโฉม Gemini ได้เพียงชั่วข้ามคืน

Google มีทีมนักวิจัยจำนวนมากในด้าน RL, ความปลอดภัย และการปรับจูนโมเดล (model alignment) อยู่แล้ว ผู้สังเกตการณ์บางคนเตือนว่ารองประธานเพียงคนเดียว แม้จะเป็นคนที่มีประวัติการทำงานดีเยี่ยมอย่าง Zoph ก็ไม่สามารถยกเครื่องสายผลิตภัณฑ์ที่ใหญ่เท่า Gemini ได้เพียงลำพัง ผลกระทบที่แท้จริงจะขึ้นอยู่กับว่า Zoph จะสามารถผสานแนวคิดของเขาเข้ากับทีมที่มีอยู่เดิมได้อย่างรวดเร็วเพียงใด สามารถจัดสรรทรัพยากรได้หรือไม่ และสามารถส่งอิทธิพลต่อแผนงานผลิตภัณฑ์ (product roadmap) ในภาพรวมได้มากน้อยแค่ไหน

การเคลื่อนย้ายบุคลากรอาจขึ้นอยู่กับความเหมาะสมส่วนบุคคลและเส้นทางอาชีพพอๆ กับความได้เปรียบทางกลยุทธ์ ช่วงเวลาสั้นๆ ของ Zoph ในด้านการขายสำหรับองค์กรบ่งบอกถึงความต้องการในบทบาทที่ผสมผสานงานวิจัยเข้ากับผลกระทบต่อตลาด ซึ่งเป็นสิ่งที่ Google อาจอยู่ในตำแหน่งที่พร้อมจะมอบให้ได้ดีกว่าห้องปฏิบัติการวิจัยเพียงอย่างเดียว

สิ่งที่ต้องจับตามองต่อไป

  • การเปิดตัว Gemini – การอัปเดตโมเดลที่กำลังจะมาถึงจะเผยให้เห็นว่าการปรับปรุงที่เน้น RL จะช่วยเพิ่มคะแนนความปลอดภัยและเกณฑ์มาตรฐานการใช้เหตุผล (reasoning benchmarks) ได้หรือไม่
  • สิ่งตีพิมพ์ด้านการวิจัย – งานวิจัยจากแผนกวิจัยของ Google ที่มีชื่อของ Zoph หรือมีชื่อเขาเป็นผู้เขียนร่วม จะบ่งบอกถึงทิศทางการทดลองภายใน
  • การเปลี่ยนแปลงผู้นำของ OpenAI – การลาออกของผู้บริหารระดับสูงเพิ่มเติมหรือการจ้างงานใหม่ อาจส่งผลต่อทิศทางการวิจัยของบริษัทก่อนการเสนอขายหุ้นต่อสาธารณะ
  • การตอบรับของตลาด – ลูกค้าบริการ cloud และผู้ซื้อระดับองค์กรจะเฝ้าดูการปรับปรุงที่เป็นรูปธรรมในการปรับจูน (alignment) ของ Gemini ก่อนที่จะตัดสินใจเลือกใช้ AI stack ของ Google

บทสรุป

การย้ายจาก OpenAI ไปยัง Google ของ Barrett Zoph ตอกย้ำให้เห็นว่าการแข่งขันทางอาวุธด้าน AI ในปัจจุบันนั้นเป็นการต่อสู้กันในด้านบุคลากรพอๆ กับด้านกำลังการประมวลผล (compute) ด้วยการส่งผู้เชี่ยวชาญด้านการเรียนรู้แบบเสริมกำลัง (reinforcement learning) เข้ามานำทัพงานวิจัยของ Gemini Google จึงเดิมพันว่าการมุ่งเน้นไปที่ขั้นตอน post-training ให้เข้มข้นยิ่งขึ้น จะช่วยลดช่องว่างด้านประสิทธิภาพและความปลอดภัยเมื่อเทียบกับโมเดล GPT ของ OpenAI ซึ่งเป็นผลลัพธ์ที่อาจเปลี่ยนโฉมหน้าพลวัตการแข่งขันของอุตสาหกรรมนี้