Barret Zoph, בכיר לשעבר ב-OpenAI, הצטרף ל-Google כסגן נשיא למחקר כדי להאיץ את משפחת מודלי השפה הגדולים Gemini. Google מקווה שהמומחיות של Zoph ב-reinforcement learning ובטכניקות post-training תעזור לחזק את ה-alignment, יכולות ההסקה (reasoning) והבטיחות של Gemini – תחומים שבהם סדרת ה-GPT של OpenAI מובילה כיום.

סיור סוער בנבחרת העלית של עולם ה-AI

קורות החיים של Zoph נראים כמו מפה של התהפוכות האחרונות במגזר. לאחר שנתיים ב-OpenAI, הוא עזב באוקטובר 2024 כדי להקים יחד עם Mira Murati, ה-CTO לשעבר של OpenAI, את הסטארט-אפ Thinking Machines. המיזם נסגר לאחר מספר חודשים; בינואר 2025, Zoph ושותפו המייסד Luke Metz הצטרפו מחדש ל-OpenAI כדי להוביל את מכירות ה-AI לארגונים (enterprise sales). לאחר חמישה חודשים בתפקיד זה, Zoph עזב שוב ביוני 2025, מה שסלל את הדרך למעברו ל-Google.

כל תחנה משקפת דפוס רחב יותר: חוקרים מובילים נעים בין מעבדות מבוססות, סטארט-אפים צעירים והכיסים העמוקים של ענקיות הטכנולוגיה. הקפיצה האחרונה של Zoph מביאה אותו לחברה שהשקיעה מיליארדים ב-AI, אך התקשתה להשתוות להשקות המודלים של OpenAI שגונבות את כל הכותרות.

מדוע reinforcement learning ו-"post-training" הם שדה הקרב החדש

מודלי שפה גדולים רוכשים יכולות גולמיות במהלך שלב ה-pre-training על מאגרי טקסט עצומים. השלב הבא – המכונה לעיתים קרובות post-training – מבצע כוונון עדין (fine-tuning) למודלים הללו לשימוש בעולם האמיתי. שיטת ה-post-training הנראית ביותר היא Reinforcement Learning from Human Feedback (RLHF), שבה מעריכים אנושיים שופטים את פלטי המודל ואלגוריתם של reinforcement learning מתאים את המודל כדי לספק את השיפוטים הללו.

קו המוצרים Gemini של Google מציג ביצועים גולמיים מוצקים, אך מבקרים מציינים כי הבטיחות והיכולת לבצע הוראות (instruction-following) שלו מפגרות מאחורי ה-GPT האחרון של OpenAI. על ידי מינוי חוקר שעבודתו המפורסמת דוחפת שוב ושוב את הגבולות של RL ו-RLHF, Google מאותתת על כוונה לצמצם את הפער הזה. Zoph יעזור בבניית תהליכי עבודה (pipelines) שיאספו משוב אנושי בצורה יעילה יותר, יתכננו מודלי תגמול (reward models) שיפיקו כוונה מורכבת, ויבצעו ניסויים באלגוריתמי RL חדשניים שישפרו את יכולת ההסקה מבלי להקריב יציבות.

הסיכונים עבור Google ועבור OpenAI

עבור Google, המהלך הוא צעד קונקרטי במאמץ רב-שנתי להפוך את Gemini לאבן יסוד מסחרית בשירותי הענן, בחיפוש ובמוצרי צריכה. מודלים בעלי alignment טוב יותר מפחיתים את הסיכון לאחריות משפטית ומגבירים את אמון הלקוחות – גורמים קריטיים ככל שארגונים דורשים AI שניתן לפרוס בבטחה בקנה מידה רחב.

במקביל, OpenAI מתמודדת עם נטישת כישרונות שחורגת מעבר ל-Zoph. במהלך שמונה החודשים האחרונים החברה ראתה את סמנכ"ל התפעול שלה ואת מנהלי מרכזי הנתונים הבכירים עוזבים, לצד דלת מסתובבת של מנהלים בכירים. העזיבות מגיעות בזמן ש-OpenAI נערכת לאפשרות של IPO, תהליך שמשקיעים בוחנים בדרך כלל לעומק בכל הנוגע ליציבות ההנהגה. תחלופה יכולה להכניס פרספקטיבות חדשות, אך היא גם מסתכנת בשיבוש הרצף בתוכניות מחקר ארוכות טווח.

נקודת מבט נגדית: גיוס אחד לא ישכתב את Gemini בן לילה

ל-Google כבר יש סגל עמוק של חוקרים ב-RL, בטיחות ו-model alignment. חלק מהצופים מזהירים שסגן נשיא יחיד, גם אם הוא בעל רקע כמו של Zoph, אינו יכול לשנות מן היסוד קו מוצרים גדול כמו Gemini לבדו. ההשפעה האמיתית תלויה בשאלה כמה מהר Zoph ישלב את רעיונותיו בצוותים הקיימים, יבטיח משאבים וישפיע על מפת הדרכים הרחבה של המוצר.

מעברי כישרונות יכולים להיות קשורים להתאמה אישית ומסלול קריירה לא פחות מאשר ליתרון אסטרטגי. תקופת השירות הקצרה של Zoph במכירות לארגונים מרמזת על רעב לתפקידים המשלבים מחקר עם השפעה בשוק – שילוב ש-Google עשויה להיות בעמדה טובה יותר להציע מאשר מעבדה המוקדשת למחקר בלבד.

מה כדאי לעקוב אחריו בהמשך

  • גרסאות Gemini – עדכוני מודלים קרובים יחשפו האם שיפורים המתמקדים ב-RL ישפרו את מדדי הבטיחות ואת מדדי ההסקה (reasoning benchmarks).
  • פרסומים מחקריים – מאמרים מחטיבת המחקר של Google הנושאים את שמו של Zoph או שותפות בכתיבתם יצביעו על הכיוון של הניסויים הפנימיים.
  • תחלופת הנהגה ב-OpenAI – עזיבות נוספות של דמויות בולטות או גיוסים חדשים עשויים לעצב מחדש את סדר היום המחקרי של החברה לקראת הצעה לציבור.
  • תגובת השוק – לקוחות שירותי ענן ורוכשים ארגוניים יעקבו אחר שיפורים קונקרטיים ב-alignment של Gemini לפני שהם מתחייבים למערך ה-AI של Google.

שורה תחתונה

המעבר של Barrett Zoph מ-OpenAI ל-Google מדגיש כיצד מרוץ החימוש בבינה מלאכותית מתנהל כעת בחזית הכישרונות באותה מידה שבה הוא מתנהל בחזית כוח המחשוב. באמצעות הצבת מומחה ללמידת חיזוק (reinforcement learning) בראש המחקר של Gemini, Google מהמרת שמיקוד חד יותר ב-post-training יצמצם את פער הביצועים והבטיחות מול מודלי ה-GPT של OpenAI — תוצאה שעשויה לעצב מחדש את הדינמיקה התחרותית של התעשייה.