کلاڈ (Claude) کی خود مختار پروٹین بائنڈر مہم نے 27 فیصد ہٹ ریٹ (hit rate) ریکارڈ کیا، جو انسانی تجربہ گاہوں کے عام 10-15 فیصد کے مقابلے میں بہتر ہے اور اسی ہدف پر ہونے والی متوازی انسانی کوششوں سے بھی آگے ہے۔ یہ نتیجہ ظاہر کرتا ہے کہ ایک وسیع اور مہارت سے تیار کردہ پرامپٹ (prompt) ایک لینگویج ماڈل کو ورچوئل بائیوٹیک ورک فلو میں بدل سکتا ہے، لیکن یہ یہ بھی اجاگر کرتا ہے کہ جب ماڈل کے کنفیڈنس میٹرکس (confidence metrics) غلط ہو جائیں تو یہ طریقہ کار کتنا نازک ہو جاتا ہے۔

اعداد و شمار میں تجربہ

اینتھروپک (Anthropic) نے اپنے کلاڈ ماڈل کو پروٹین ڈیزائن کا مکمل پروٹوکول اور ایک مقررہ GPU بجٹ دیا، اور پھر اسے 16 پروٹین اہداف پر اینڈ ٹو اینڈ مہم چلانے دی۔ لیبارٹری کی ناکامی کے بعد ایک ہدف کو ختم کر دیا گیا، جس کے بعد 15 قابل عمل مہمات باقی رہیں۔ ان میں سے کلاڈ نے 1,320 ممکنہ سیکوئنسز تیار کیے؛ لیبارٹری ٹیسٹنگ نے 354 کو حقیقی بائنڈرز کے طور پر تصدیق کی، جس سے 26.8 فیصد کامیابی کی شرح حاصل ہوئی۔

موازنہ کے لیے، انسانی قیادت میں چلنے والے زیادہ تر بائنڈر پروجیکٹس 10 فیصد سے 15 فیصد کے درمیان ہٹ ریٹ رپورٹ کرتے ہیں۔ RBX1 ہدف پر براہ راست مقابلے میں، انسانی شرکاء نے 3.7 فیصد ہٹ ریٹ حاصل کیا جبکہ کلاڈ کے ڈیزائنز نے 31.1 فیصد حاصل کیا۔ ماڈل نے خود درجہ بندی کرنے کی صلاحیت بھی دکھائی: کلاڈ نے جس واحد ڈیزائن کو اپنا بہترین قرار دیا تھا وہ 49 فیصد بار کامیاب رہا، اور ٹاپ دس ڈیزائنز 39 فیصد بار کامیاب رہے۔

جہاں سسٹم ناکام رہا

یہ اعداد و شمار دو واضح خامیاں چھپاتے ہیں۔ کلاڈ MBP ہدف پر مکمل طور پر ناکام رہا اور TNFα ہدف پر بھی ناقص کارکردگی کا مظاہرہ کیا، اس کے باوجود ان رنز کے لیے اس کے اندرونی کنفیڈنس اسکورز (confidence scores) زیادہ رہے۔ دوسرے لفظوں میں، ماڈل کو یقین تھا کہ وہ کامیاب ہو رہا ہے جبکہ ویٹ لیب (wet-lab) کے نتائج کچھ اور ہی کہانی سنا رہے تھے۔ یہ غلط پیمائش والے سگنلز ایک خطرہ ظاہر کرتے ہیں: ایک خود مختار پائپ لائن جو اپنے ہی میٹرکس پر بھروسہ کرتی ہے، وہ بے سود تجربات پر وسائل ضائع کر سکتی ہے۔

پرامپٹ انجینئرنگ بطور نیا لیب نوٹ بک

اس مطالعے کا سب سے حیران کن پہلو بیالوجی نہیں بلکہ وہ پرامپٹ ہے جس نے اسے چلایا۔ ایک سینئر سائنسدان عام طور پر یہ فیصلہ کرنے میں ہفتوں صرف کرتا ہے کہ کن پروٹین ریجنز کا جائزہ لینا ہے، کن کمپیوٹیشنل ٹولز کا استعمال کرنا ہے، اور کمپیوٹ ٹائم کو کیسے مختص کرنا ہے۔ اینتھروپک نے اس مہارت کو 16,000 الفاظ کے ایک پرامپٹ میں سمیٹ دیا—جو تقریباً ایک مختصر ناول کے برابر ہے۔ متن کا تقریباً دو تہائی حصہ آپریشنل معاملات سے متعلق تھا: وقت، بجٹ کی نگرانی، اور ان سب ایجنٹس (sub-agents) کی ترتیب جو بیرونی سافٹ ویئر کو کال کرتے تھے۔

کلاڈ نے RFdiffusion (ایک ڈیفیوژن پر مبنی اسٹرکچر جنریٹر) اور ProteinMPNN (ایک سیکوئنس ڈیزائن نیٹ ورک) جیسے اوپن سورس ڈیزائن انجنوں کو استعمال کیا۔ لینگویج ماڈل نے ایک شیڈولر کے طور پر کام کیا، جو ان ٹولز کے درمیان درمیانی نتائج فراہم کرتا، پیرامیٹرز کو ایڈجسٹ کرتا، اور یہ فیصلہ کرتا کہ ڈیزائن سائیکل کب روکنا ہے۔ درحقیقت، پرامپٹ ایک ورچوئل لیبارٹری مینیجر بن گیا، جس نے انسانی سائنسدانوں کو ورک فلو کے چھوٹے موٹے معاملات سے آزاد کر دیا۔

بائنڈرز اصل میں کیا ہیں

تمام 354 تصدیق شدہ ہٹس ایسے مالیکیولز ہیں جو جسمانی طور پر اپنے ہدف پروٹینز کے ساتھ جڑ جاتے ہیں۔ پیپر بائنڈنگ اسیز (binding assays) کی رپورٹ کرتا ہے لیکن فنکشنل ڈیٹا فراہم نہیں کرتا—یعنی اس بات کا کوئی ثبوت نہیں کہ کوئی بائنڈر سرگرمی کو تبدیل کرتا ہے، کسی کنفارمیشن کو مستحکم کرتا ہے، یا علاج کی صلاحیت رکھتا ہے۔ اسی طرح، اسٹرکچرل ویلیڈیشن (مثلاً X-ray crystallography یا cryo-EM) موجود نہیں ہے، اس لیے بائنڈنگ کا درست طریقہ کار محض ایک قیاس آرائی ہے۔ لہذا، یہ مہم تیزی سے بائنڈر کی دریافت کے لیے ایک 'پروف آف کانسیپٹ' (proof-of-concept) ہے، نہ کہ ایسی پائپ لائن جو ادویات کے امیدوار فراہم کرے۔

بائیوٹیک اور AI ریسرچ کے لیے اہمیت

اگر پرامپٹ پر مبنی ماڈل قابل اعتماد طریقے سے انسانی ہٹ ریٹس کو دوبارہ پیدا کر سکتا ہے یا ان سے تجاوز کر سکتا ہے، تو بائیوٹیک کمپنیاں ابتدائی مرحلے کی دریافت کی لاگت اور وقت میں بڑی بچت کر سکتی ہیں۔ تاہم، MBP اور TNFα پر غلط پیمائش والے کنفیڈنس اسکورز یہ ظاہر کرتے ہیں کہ مکمل طور پر خود مختار سسٹم ابھی پیداواری سطح کے لیے تیار نہیں ہے۔ کمپنیوں کو کنفیڈنس میٹرکس کی تشریح کرنے اور فنکشنل اہمیت کی تصدیق کرنے کے لیے اب بھی انسانی نگرانی کی ضرورت ہوگی۔

AI کے نقطہ نظر سے، یہ کام "ٹول" اور "ایجنٹ" کے درمیان فرق کو دھندلا دیتا ہے۔ کلاڈ کوئی نیا پروٹین ڈیزائن الگورتھم نہیں ہے؛ یہ ایک جنرل پرپز لینگویج ماڈل ہے جو کافی تفصیلی ہدایات ملنے پر موجود مخصوص ٹولز کو منظم کر سکتا ہے۔ یہ تجربہ ایک ایسے مستقبل کی طرف اشارہ کرتا ہے جہاں AI کسی ایک جزو کی جگہ لینے کے بجائے، اوپن سورس سائنسی سافٹ ویئر کے ماڈیولر ایکو سسٹم کو آپس میں جوڑنے والے پل کا کام کرے گا۔

جوابی نکتہ: پرامپٹ کی پیچیدگی کی پوشیدہ قیمت

اگرچہ یہ مطالعہ 16,000 الفاظ کے پرامپٹ کو علم کے حصول کی کامیابی کے طور پر پیش کرتا ہے، لیکن اس پرامپٹ کا حجم ہی عملی خدشات پیدا کرتا ہے۔ اس طرح کی دستاویز تیار کرنے کے لیے گہری مہارت، بنیادی ٹولز سے واقفیت، اور ممکنہ پیچیدگیوں کا اندازہ لگانے کی صلاحیت درکار ہوتی ہے۔ دوسرے لفظوں میں، مہارت ختم نہیں ہوئی ہے—بلکہ یہ لیب سائنسدانوں سے منتقل ہو کر پرامپٹ انجینئرز تک پہنچ گئی ہے۔

مزید برآں، ایک مقررہ GPU بجٹ پر انحصار تلاش کی گہرائی (exploration depth) پر ایک سخت پابندی عائد کرتا ہے۔ انسانی ٹیمیں عبوری نتائج کی بنیاد پر وسائل کو متحرک طور پر دوبارہ مختص کر سکتی ہیں، جبکہ Claude کی مہم ایک پہلے سے طے شدہ بجٹ کے مطابق رہی، جس سے ممکنہ طور پر نمونہ لیے گئے sequence space کی وسعت محدود ہو سکتی ہے۔

آگے کیا دیکھنا ہے

Anthropic کا مقالہ کئی سوالات کو حل طلب چھوڑ دیتا ہے۔ مستقبل کے کام میں confidence calibration کے مسئلے کو حل کرنے کی ضرورت ہوگی تاکہ ماڈل کی خود تشخیصی تجرباتی نتائج کے مطابق ہو۔ فنکشنل اسیز (functional assays)—جیسے کہ enzymatic inhibition یا cellular activity—کو خود مختار لوپ میں شامل کرنے سے یہ ٹیکنالوجی محض binder کی شناخت کے بجائے drug discovery کے زیادہ قریب ہو جائے گی۔ آخر میں، مختلف اہداف اور بدلتے ہوئے بجٹ کے حالات میں اس طریقہ کار کی benchmarking سے یہ معلوم ہو سکے گا کہ دیکھا گیا hit rate قابلِ اعادہ ہے یا محض ایک outlier ہے۔

حاصلِ کلام واضح ہے: تفصیلی prompt orchestration ایک language model کو ورچوئل biotech lab میں تبدیل کر سکتا ہے، جو ایسے binder hit rates فراہم کرتا ہے جو انسانی اوسط سے کہیں زیادہ ہیں۔ تاہم، یہ طریقہ کار اب بھی ماہرانہ prompt authorship پر منحصر ہے اور confidence کی غلطیوں کا شکار رہتا ہے جو مہنگے تجربات کو ناکام بنا سکتی ہیں۔ جیسے جیسے کمیونٹی ان pipelines کو بہتر بنائے گی، AI کی خود مختاری اور انسانی نگرانی کے درمیان توازن یہ طے کرے گا کہ آیا ایسے نظام معمول کے آلات بن جائیں گے یا محض تجرباتی تجسس تک محدود رہیں گے۔