OpenAI کے سابق ایگزیکٹو، بارٹ زوف (Barret Zoph) نے Gemini فیملی کے large-language models کی رفتار تیز کرنے کے لیے ریسرچ کے وائس پریزیڈنٹ کے طور پر Google میں شمولیت اختیار کر لی ہے۔ Google کو امید ہے کہ reinforcement learning اور post-training تکنیکوں میں زوف کی مہارت Gemini کی alignment، reasoning اور safety کو بہتر بنائے گی—وہ شعبے جہاں OpenAI کی GPT سیریز فی الحال سبقت لے رہی ہے۔
AI کے اشرافیہ کا ایک تیز رفتار دورہ
زوف کا ریزیومے (résumé) اس شعبے میں حالیہ اتار چڑھاؤ کے نقشے کی طرح ہے۔ OpenAI میں دو سال گزارنے کے بعد، انہوں نے اکتوبر 2024 میں سابق OpenAI CTO میرا موراتی (Mira Murati) کے ساتھ اسٹارٹ اپ Thinking Machines کی مشترکہ بنیاد رکھنے کے لیے کمپنی چھوڑ دی۔ یہ منصوبہ چند ماہ بعد ہی ختم ہو گیا؛ جنوری 2025 تک زوف اور ساتھی کو-فاؤنڈر لک میٹز (Luke Metz) نے AI انٹرپرائز سیلز کی قیادت کرنے کے لیے دوبارہ OpenAI میں شمولیت اختیار کی۔ اس کردار میں پانچ ماہ گزارنے کے بعد، زوف جون 2025 میں دوبارہ چلے گئے، جس سے ان کے Google منتقل ہونے کا راستہ صاف ہو گیا۔
ہر قدم ایک وسیع تر نمونے کی عکاسی کرتا ہے: صف اول کے محققین قائم شدہ لیبز، نو آموز اسٹارٹ اپس اور ٹیک دیو مالکان کے بڑے سرمایوں کے درمیان گھومتے رہتے ہیں۔ زوف کی تازہ ترین چھلانگ انہیں ایک ایسی کمپنی میں لے آئی ہے جس نے AI میں اربوں ڈالر لگائے ہیں لیکن OpenAI کے مشہور ماڈلز کے مقابلے میں آنے میں جدوجہد کی ہے۔
کیوں reinforcement learning اور “post-training” نیا میدانِ جنگ ہیں
Large-language models بڑے ٹیکسٹ ڈیٹا (corpora) پر pre-training کے دوران بنیادی صلاحیتیں حاصل کرتے ہیں۔ اگلا مرحلہ—جسے اکثر post-training کہا جاتا ہے—ان ماڈلز کو حقیقی دنیا کے استعمال کے لیے مزید بہتر (fine-tune) بناتا ہے۔ سب سے نمایاں post-training طریقہ Reinforcement Learning from Human Feedback (RLHF) ہے، جہاں انسانی جائزہ لینے والے ماڈل کے نتائج کا فیصلہ کرتے ہیں اور ایک reinforcement-learning الگورتھم ان فیصلوں کے مطابق ماڈل کو ایڈجسٹ کرتا ہے۔
Google کی Gemini لائن بہترین بنیادی کارکردگی دکھاتی ہے، تاہم ناقدین کا کہنا ہے کہ اس کی safety اور ہدایات پر عمل کرنے کی صلاحیت OpenAI کے تازہ ترین GPT سے پیچھے ہے۔ ایک ایسے محقق کو مقرر کر کے جس کے شائع شدہ کام نے بار بار RL اور RLHF کی حدود کو وسعت دی ہے، Google اس فرق کو ختم کرنے کے ارادے کا اشارہ دے رہا ہے۔ زوف ایسے پائپ لائنز بنانے میں مدد کریں گے جو انسانی فیڈ بیک کو زیادہ مؤثر طریقے سے حاصل کریں، ایسے ریوارڈ ماڈلز تیار کریں جو باریک بینی سے ارادوں کو سمجھ سکیں، اور نئے RL الگورتھم کے ساتھ تجربات کریں جو استحکام کو متاثر کیے بغیر reasoning کو بہتر بنائیں۔
Google اور OpenAI کے لیے داؤ پر کیا لگا ہے
Google کے لیے، یہ اقدام Gemini کو کلاؤڈ سروسز، سرچ اور صارفین کی مصنوعات میں ایک تجارتی ستون بنانے کی کئی سالہ کوشش میں ایک ٹھوس قدم ہے۔ بہتر alignment والے ماڈلز قانونی ذمہ داری کے خطرے کو کم کرتے ہیں اور صارفین کے اعتماد کو بڑھاتے ہیں—یہ وہ اہم عوامل ہیں کیونکہ ادارے ایسے AI کا مطالبہ کر رہے ہیں جسے بڑے پیمانے پر محفوظ طریقے سے استعمال کیا جا سکے۔
دریں اثنا، OpenAI ٹیلنٹ کے اخراج (talent exodus) سے نبرد آزما ہے جو زوف سے کہیں آگے تک پھیلا ہوا ہے۔ گزشتہ آٹھ ماہ کے دوران کمپنی نے اپنے چیف آپریٹنگ آفیسر اور سینئر ڈیٹا سینٹر لیڈرز کو چھوڑتے ہوئے دیکھا ہے، ساتھ ہی ایگزیکٹوز کی آمد و رفت بھی جاری رہی ہے۔ یہ روانگی اس وقت ہو رہی ہے جب OpenAI ممکنہ IPO کے لیے تیاری کر رہا ہے، ایک ایسا عمل جس کا سرمایہ کار عام طور پر قیادت کے استحکام کے لیے باریک بینی سے جائزہ لیتے ہیں۔ ملازمین کی تبدیلی نئے تناظر تو لا سکتی ہے، لیکن یہ طویل مدتی تحقیقی پروگراموں کے تسلسل کو متاثر کرنے کا خطرہ بھی رکھتی ہے۔
دوسرا رخ: ایک بھرتی راتوں رات Gemini کو نہیں بدل سکے گی
Google کے پاس پہلے سے ہی RL، safety اور ماڈل alignment میں محققین کی ایک بڑی ٹیم موجود ہے۔ کچھ مبصرین خبردار کرتے ہیں کہ ایک وائس پریزیڈنٹ، چاہے وہ زوف جیسے تجربہ کار ہی کیوں نہ ہوں، اکیلے Gemini جیسے بڑے پروڈکٹ لائن کو مکمل طور پر تبدیل نہیں کر سکتا۔ اصل اثر اس بات پر منحصر ہوگا کہ زوف کتنی تیزی سے اپنے خیالات کو موجودہ ٹیموں میں شامل کرتے ہیں، وسائل حاصل کرتے ہیں، اور وسیع تر پروڈکٹ روڈ میپ پر اثر انداز ہوتے ہیں۔
ٹیلنٹ کی نقل و حرکت ذاتی مطابقت اور کیریئر کے رخ کے بارے میں بھی ہو سکتی ہے، نہ کہ صرف اسٹریٹجک فائدے کے بارے میں۔ انٹرپرائز سیلز میں زوف کا مختصر دور ان کرداروں کی خواہش کو ظاہر کرتا ہے جو تحقیق کو مارکیٹ کے اثر کے ساتھ ملاتے ہیں—ایک ایسا امتزاج جو Google شاید محض تحقیق کرنے والی لیب کے مقابلے میں بہتر طور پر پیش کرنے کی پوزیشن میں ہے۔
آگے کیا نظر آئے گا
- Gemini releases – آنے والی ماڈل اپ ڈیٹس سے یہ ظاہر ہوگا کہ آیا RL پر مرکوز بہتری سے safety اسکورز اور reasoning benchmarks میں اضافہ ہوتا ہے۔
- Research publications – Google کے ریسرچ ڈویژن کے وہ پیپرز جن پر زوف کا نام یا مشترکہ مصنفیت ہوگی، وہ اندرونی تجربات کی سمت کی نشاندہی کریں گے۔
- OpenAI leadership churn – مزید اعلیٰ سطح کی روانگیوں یا نئی بھرتیوں سے کسی بھی عوامی پیشکش (public offering) سے پہلے کمپنی کے تحقیقی ایجنڈے کو نئی شکل مل سکتی ہے۔
- Market response – کلاؤڈ سروس کے صارفین اور انٹرپرائز خریدار Google کے AI اسٹیک پر بھروسہ کرنے سے پہلے Gemini کی alignment میں ٹھوس بہتری کا انتظار کریں گے۔
خلاصہ
Barrett Zoph کا OpenAI سے Google میں منتقل ہونا اس بات کو اجاگر کرتا ہے کہ AI کی ہتھیاروں کی دوڑ اب کمپیوٹ کے محاذ کے ساتھ ساتھ ٹیلنٹ کے محاذ پر بھی لڑی جا رہی ہے۔ Gemini کی تحقیق کی سربراہی میں reinforcement-learning کے ماہر کو تعینات کر کے، Google کا یہ جوا ہے کہ post-training پر زیادہ توجہ دینے سے OpenAI کے GPT ماڈلز کے ساتھ کارکردگی اور حفاظت کے فرق کو کم کیا جا سکے گا—ایک ایسا نتیجہ جو صنعت کی مسابقتی حرکیات کو نئی شکل دے سکتا ہے۔
