بارت زوف، مدیر سابق OpenAI، به عنوان نایب‌رئیس بخش تحقیقات به گوگل پیوست تا به توسعه خانواده مدل‌های زبانی بزرگ Gemini سرعت ببخشد. گوگل امیدوار است تخصص زوف در یادگیری تقویتی و تکنیک‌های پس‌آموزش (post-training)، هم‌ترازی، استدلال و ایمنی Gemini را تقویت کند؛ حوزه‌هایی که در حال حاضر سری GPT شرکت OpenAI در آن‌ها پیشتاز است.

گشتی سریع در میان نخبگان هوش مصنوعی

رزومه زوف مانند نقشه‌ای از تلاطم‌های اخیر این حوزه است. پس از دو سال فعالیت در OpenAI، او در اکتبر ۲۰۲۴ شرکت نوپای Thinking Machines را با همکاری میرا موراتی، مدیر ارشد فناوری سابق OpenAI، بنیان‌گذاری کرد. این سرمایه‌گذاری پس از چند ماه منحل شد؛ تا ژانویه ۲۰۲۵، زوف و هم‌بنیان‌گذار دیگر، لوک متز، دوباره به OpenAI پیوستند تا رهبری فروش سازمانی هوش مصنوعی را بر عهده بگیرند. پس از پنج ماه فعالیت در این نقش، زوف در ژوئن ۲۰۲۵ دوباره شرکت را ترک کرد و مسیر را برای انتقال خود به گوگل هموار نمود.

هر توقف او بازتاب‌دهنده یک الگوی گسترده‌تر است: محققان برجسته میان آزمایشگاه‌های تثبیت‌شده، استارتاپ‌های نوپا و بودجه‌های کلان غول‌های فناوری در حرکت هستند. جهش اخیر زوف او را به شرکتی رسانده است که میلیاردها دلار در هوش مصنوعی سرمایه‌گذاری کرده، اما برای رسیدن به سطح انتشار مدل‌های پرسر و صدای OpenAI با چالش روبرو بوده است.

چرا یادگیری تقویتی و «پس‌آموزش» میدان نبرد جدید هستند

مدل‌های زبانی بزرگ قابلیت‌های خام خود را طی مرحله پیش‌آموزش (pre-training) روی مجموعه‌داده‌های متنی عظیم به دست می‌آورند. مرحله بعدی که اغلب «پس‌آموزش» (post-training) نامیده می‌شود، آن مدل‌ها را برای استفاده در دنیای واقعی تنظیم دقیق (fine-tune) می‌کند. مشهودترین روش پس‌آموزش، یادگیری تقویتی از بازخورد انسانی (RLHF) است که در آن ارزیابان انسانی خروجی‌های مدل را قضاوت می‌کنند و یک الگوریتم یادگیری تقویتی، مدل را برای برآورده کردن آن قضاوت‌ها تنظیم می‌کند.

خانواده Gemini گوگل عملکرد خام قدرتمندی نشان می‌دهد، اما منتقدان خاطرنشان می‌کنند که ایمنی و توانایی پیروی از دستورالعمل‌های آن نسبت به آخرین مدل GPT شرکت OpenAI عقب‌تر است. گوگل با انتصاب محققی که آثار منتشرشده‌اش بارها مرزهای RL و RLHF را جابه‌جا کرده است، نشانه‌ای از قصد خود برای پر کردن این شکاف است. زوف به ساخت خط‌لوله‌هایی (pipelines) کمک خواهد کرد که بازخورد انسانی را با کارایی بیشتری جمع‌آوری کنند، مدل‌های پاداشی طراحی کنند که نیات ظریف را درک کنند و با الگوریتم‌های نوین RL آزمایش کنند که بدون از دست دادن پایداری، استدلال را بهبود می‌بخشند.

مخاطرات برای گوگل و OpenAI

برای گوگل، این اقدام گامی ملموس در تلاش چندساله برای تبدیل Gemini به یک رکن تجاری در خدمات ابری، جستجو و محصولات مصرف‌کننده است. مدل‌های با هم‌ترازی بهتر، ریسک مسئولیت‌پذیری را کاهش داده و اعتماد مشتری را افزایش می‌دهند؛ عواملی حیاتی در زمانی که سازمان‌ها خواهان هوش مصنوعی‌ای هستند که بتواند در مقیاس بزرگ و با ایمنی کامل مستقر شود.

در همین حال، OpenAI با خروج گسترده استعدادها دست‌وپنجه نرم می‌کند که فراتر از زوف است. در هشت ماه گذشته، این شرکت شاهد خروج مدیر عملیات (COO) و رهبران ارشد مرکز داده‌های خود، در کنار جابه‌جایی مداوم مدیران اجرایی بوده است. این خروج‌ها در حالی رخ می‌دهد که OpenAI خود را برای یک عرضه عمومی اولیه (IPO) احتمالی آماده می‌کند؛ فرآیندی که سرمایه‌گذاران معمولاً آن را از نظر ثبات مدیریت به دقت بررسی می‌کنند. جابه‌جایی نیروها می‌تواند دیدگاه‌های تازه‌ای وارد کند، اما خطر مختل شدن تداوم برنامه‌های تحقیقاتی بلندمدت را نیز به همراه دارد.

دیدگاه مقابل: یک استخدام، Gemini را یک‌شبه بازنویسی نمی‌کند

گوگل در حال حاضر تیم عمیقی از محققان در زمینه‌های RL، ایمنی و هم‌ترازی مدل در اختیار دارد. برخی ناظران هشدار می‌دهند که یک نایب‌رئیس، حتی با سوابق درخشانی چون زوف، به تنهایی نمی‌تواند یک خط تولید به بزرگی Gemini را متحول کند. تأثیر واقعی به این بستگی دارد که زوف با چه سرعتی ایده‌های خود را با تیم‌های موجود ادغام کند، منابع را تأمین نماید و بر نقشه راه گسترده‌تر محصول تأثیر بگذارد.

جابه‌جایی استعدادها می‌تواند به همان اندازه که بحث استراتژی است، به تناسب شخصی و مسیر شغلی نیز باشد. دوره کوتاه زوف در بخش فروش سازمانی نشان‌دهنده تمایل او به نقش‌هایی است که تحقیق را با تأثیرگذاری در بازار ترکیب می‌کنند؛ ترکیبی که گوگل ممکن است در مقایسه با یک آزمایشگاه صرفاً تحقیقاتی، موقعیت بهتری برای ارائه آن داشته باشد.

آنچه باید در آینده زیر نظر داشت

  • انتشارات Gemini – به‌روزرسانی‌های آتی مدل‌ها مشخص خواهد کرد که آیا اصلاحات متمرکز بر RL، امتیازات ایمنی و معیارهای استدلال را بهبود می‌بخشند یا خیر.
  • انتشارات تحقیقاتی – مقالات بخش تحقیقات گوگل که نام زوف یا همکاری او را در آن‌ها ببینیم، نشان‌دهنده جهت‌گیری آزمایش‌های داخلی خواهد بود.
  • تغییرات مدیریتی در OpenAI – خروج‌های سطح بالا یا استخدام‌های جدید بیشتر می‌تواند دستور کار تحقیقاتی شرکت را پیش از عرضه عمومی تغییر دهد.
  • واکنش بازار – مشتریان خدمات ابری و خریداران سازمانی، پیش از تعهد به زیرساخت هوش مصنوعی گوگل، منتظر بهبودهای ملموس در هم‌ترازی Gemini خواهند بود.

نکته کلیدی

Barrett Zoph’s shift from OpenAI to Google underscores how the AI arms race now fights on the talent front as much as the compute front. By planting a reinforcement-learning specialist at the helm of Gemini’s research, Google bets that a sharper focus on post-training will narrow the performance and safety gap with OpenAI’s GPT models—an outcome that could reshape the competitive dynamics of the industry.