GSK نے برطانوی بائیوٹیک فرم Relation Therapeutics کے ساتھ 110 ملین ڈالر تک کی مالیت کا تحقیقی تعاون (research collaboration) کیا ہے۔ یہ شراکت داری بڑے پیمانے پر، ہائی ریزولوشن ڈیٹا سیٹس تیار کرے گی جو اس بات کا سراغ لگائیں گے کہ انسانی خلیات جینیاتی تبدیلیوں اور ادویات کے علاج پر کیسے ردعمل دیتے ہیں۔ یہ اس ڈیٹا کی رکاوٹ (bottleneck) کو ختم کرتا ہے جس نے AI پر مبنی دوا کی دریافت (drug discovery) کے عمل کو سست کر دیا ہے اور مالیکیول سے دوا تک کے سفر کو کئی سال کم کر سکتا ہے۔
وہ ڈیٹا کا مسئلہ جس نے AI کو پیچھے رکھا ہوا ہے
گزشتہ دہائی کے بیشتر حصے میں، فارما میں AI کا فیصلہ ماڈل کے سائز سے کیا گیا ہے، نہ کہ ان پٹ کی اہمیت سے۔ انٹرنیٹ ٹیکسٹ پر تربیت یافتہ لارج لینگویج ماڈلز (LLMs) پیٹرن میچنگ میں بہترین ہیں، لیکن جب یہ پیش گوئی کرنے کے لیے کہ آیا کوئی مرکب (compound) زندہ خلیے میں کیا اثرات مرتب کرے گا، کہا جاتا ہے تو وہ لڑکھڑا جاتے ہیں۔ "ویٹ لیب" (wet lab) ڈیٹا وہ گمشدہ کڑی ہے—یعنی حقیقی تجربات سے حاصل کردہ پیمائشیں جو کسی جین کے آن یا آف ہونے، یا دوا کے استعمال کے بعد حیاتیاتی اثرات کے تسلسل کو قید کرتی ہیں۔
Relation Therapeutics اس خلا کو پُر کرے گی۔ معاہدے کے تحت، یہ بڑے پیمانے پر ایسا ڈیٹا تیار کرے گی جو نہایت باریک بینی سے اس بات کی پیمائش کرے گا کہ انسانی خلیات دو متغیرات (variables) پر کیسے ردعمل دیتے ہیں: جینیاتی تبدیلیاں اور ادویات کے مداخلت (drug interventions)۔ AI سسٹمز کو خلیاتی طرز عمل کا یہ تفصیلی منظر فراہم کر کے، اس شراکت داری کا مقصد ماڈلز کو محض خام (crude) بائنڈنگ پیش گوئیوں سے نکال کر پورے حیاتیاتی راستوں (pathways) کی سیمولیشن تک لے جانا ہے۔
بلیک باکس پیش گوئیوں سے خلیاتی درستگی تک
روایتی AI پائپ لائنز اکثر ایک واحد نمبر فراہم کرتی ہیں: اس بات کا امکان کہ کوئی مالیکیول کسی ٹارگٹ پروٹین کے ساتھ جڑے گا (bind کرے گا)۔ پھر محققین یہ جاننے کے لیے مہینوں یا سال گزار دیتے ہیں کہ آیا وہ بائنڈنگ کسی علاج کے اثر میں تبدیل ہوتی ہے یا نہیں۔ نیا طریقہ کار اس واحد اندازے کی جگہ ڈاؤن اسٹریم نتائج کا ایک کثیر جہتی نقشہ (multi-dimensional map) لاتا ہے۔ جب ایک AI ماڈل یہ جان لیتا ہے کہ جین X کو ختم کرنا راستہ Y کو متحرک کرتا ہے، اور کوئی ممکنہ دوا اسی راستے کو کمزور کرتی ہے، تو وہ بہت پہلے ہی اس کی تاثیر کا اندازہ لگا سکتا ہے۔
اس کا فائدہ مہنگے تجربات (trial-and-error experiments) میں کمی ہے۔ اگر کوئی ماڈل قابل اعتماد طریقے سے یہ پیش گوئی کر سکے کہ کوئی مرکب مطلوبہ خلیاتی ردعمل پیدا کرے گا، تو کم مرکبات کو تیار کرنے، اسکرین کرنے اور مسترد کرنے کی ضرورت ہوگی۔ اس سے تحقیق و ترقی (R&D) کے اخراجات کم ہوتے ہیں اور وقت کی بچت ہوتی ہے—یہ وہ فوائد ہیں جو براہ راست دوا کے مارکیٹ میں انحصاری کے دورانیے اور فارما کمپنیوں کے منافع پر اثر انداز ہوتے ہیں۔
"صحیح ڈیٹا" ایک حفاظتی حصار (moat) بن جاتا ہے
یہ شراکت داری "بگ ڈیٹا" سے "صحیح ڈیٹا" کی طرف منتقلی کو اجاگر کرتی ہے۔ عام مقصد کے لیے بنائے گئے ماڈلز محض ڈیٹا کی مقدار پر ترقی کرتے ہیں، لیکن دوا کی دریافت کے لیے ایسا ڈیٹا چاہیے جو انتہائی مخصوص ہو اور حاصل کرنا مشکل ہو۔ قابل اعتماد خلیاتی ردعمل کے پروفائلز تیار کرنے کے لیے جدید آلات، ماہر عملہ اور سخت کوالٹی کنٹرول کی ضرورت ہوتی ہے—ایسی سرمایہ کاری جو صرف بڑے فنڈز رکھنے والے کھلاڑی ہی برداشت کر سکتے ہیں۔
وہ کمپنیاں جو جینیاتی کوڈ کو پیمائش کے قابل خلیاتی نتائج سے جوڑنے والی پائپ لائن کی مالک ہوں گی، ان کے پاس سب سے قیمتی دانشورانہ ملکیت (intellectual property) ہوگی۔ ایسے ڈیٹا سیٹس کی انفرادیت ایک ایسا دفاعی حصار پیدا کرتی ہے جسے کسی نئے نیورل نیٹ ورک آرکیٹیکچر کے مقابلے میں دوبارہ بنانا زیادہ مشکل ہے۔ بائیوٹیک کے بانیوں کے لیے پیغام واضح ہے: اگلی الگورتھمک پیش رفت کے پیچھے بھاگنے کے بجائے ڈیٹا انجن بنانا زیادہ تزویراتی (strategic) ہو سکتا ہے۔
جوابی دلیل: صرف ڈیٹا ہی سب کچھ حل نہیں کرے گا
ناقدین کا کہنا ہے کہ مکمل ڈیٹا بھی AI ماڈلز کو گمراہ کر سکتا ہے۔ خلیات مختلف ٹشو اقسام، بیماریوں کی حالتوں اور مریضوں کی آبادیاتی خصوصیات کے لحاظ سے مختلف ہوتے ہیں؛ ایک سیاق و سباق میں حاصل کردہ ڈیٹا سیٹ دوسرے پر لاگو نہیں ہو سکتا۔ بڑے پیمانے پر اعلیٰ معیار کے ڈیٹا سیٹس تیار کرنے اور ان کی دیکھ بھال کرنے کی لاگت ماڈلز کی تربیت کے اخراجات سے بھی زیادہ ہو سکتی ہے، جو چھوٹی کمپنیوں کے لیے پیمائش (scalability) کے سوالات کھڑے کرتی ہے۔
ریگولیٹرز بھی اہمیت رکھتے ہیں۔ وہ پیشگی AI جو انسانی حیاتیات کی سیمولیشن کا دعویٰ کرتی ہے، اسے آخر کار طبی نتائج (clinical outcomes) کے ذریعے ثابت کرنا ہوگا، جس سے جانچ پڑتال کا ایک نیا درجہ شامل ہو جاتا ہے۔ اگر صنعت حقیقی دنیا کے مناسب تجربات کے بغیر صرف کمپیوٹر ماڈلز (in-silico) کی پیش گوئیوں پر بہت زیادہ انحصار کرتی ہے، تو اسے اس وقت مشکلات کا سامنا کرنا پڑ سکتا ہے جب امید افزا امیدوار تجربات میں ناکام ہو جائیں۔
آگے کیا دیکھنا ہے
اگلے چند ماہ یہ ظاہر کریں گے کہ آیا GSK-Relation کی کوششیں وعدہ کیے گئے پیمانے پر قابل استعمال ڈیٹا فراہم کر پاتی ہیں یا نہیں۔ اہم اشارے درج ذیل ہیں:
- بینچ مارک ڈیٹا سیٹس کی اشاعت جن تک دوسرے محققین رسائی حاصل کر سکیں (خواہ محدود شرائط کے تحت ہی کیوں نہ ہو)
- ابتدائی مرحلے کے AI ماڈلز جو ٹیسٹ سیٹ پر روایتی اسکریننگ طریقوں سے واضح طور پر بہتر کارکردگی دکھائیں
- دیگر بڑی فارما کمپنیوں کی جانب سے مزید سرمایہ کاری، جو اس بات کا اشارہ ہو کہ ڈیٹا کا یہ طریقہ کار قابلِ نقل ہے
اگر اس تعاون سے ہٹ ریٹ (hit-rate) یا سائیکل کے وقت میں ٹھوس بہتری آتی ہے، تو یہ اسی طرح کے معاہدوں کی ایک لہر پیدا کر سکتا ہے، جو اس بات کو نئے سرے سے ترتیب دے گا کہ صنعت تحقیق و ترقی (R&D) کے اخراجات کہاں خرچ کرتی ہے۔ اس کے برعکس، اگر ڈیٹا بہت زیادہ شور (noisy) والا یا مربوط کرنے کے لیے بہت مہنگا ثابت ہوا، تو کمپنیاں دوبارہ ان ہائبرڈ طریقوں کی طرف لوٹ سکتی ہیں جو AI کو روایتی ہائی تھرو پٹ اسکریننگ کے ساتھ ملاتے ہیں۔
اہم نکات
GSK کا اعلیٰ معیار کے سیلولر ڈیٹا پر 110 ملین ڈالر کا داؤ ایک فیصلہ کن موڑ کی نشاندہی کرتا ہے: AI کے ذریعے ادویات کی دریافت میں، سب سے فیصلہ کن فائدہ ان حیاتیاتی سگنلز کے معیار اور انفرادیت میں ہوگا جو ماڈلز کو تربیت دیتے ہیں، نہ کہ خود الگورتھم کے محض حجم میں۔
