GSK یک همکاری تحقیقاتی با شرکت بیوتکنولوژی بریتانیایی Relation Therapeutics به ارزش حداکثر ۱۱۰ میلیون دلار امضا کرده است. این مشارکت مجموعهدادههای عظیم و با وضوح بالایی ایجاد خواهد کرد که واکنش سلولهای انسانی به تغییرات ژنتیکی و درمانهای دارویی را ردیابی میکنند. این همکاری به گلوگاه دادهای که کشف داروهای مبتنی بر هوش مصنوعی را کند کرده است، حمله میکند و میتواند سالها از مسیر تبدیل مولکول به دارو بکاهد.
مشکل دادهای که مانع پیشرفت هوش مصنوعی شده است
در بیشتر طول دهه گذشته، هوش مصنوعی در صنعت داروسازی بر اساس اندازه مدل، و نه مرتبط بودن ورودیها، مورد قضاوت قرار گرفته است. مدلهای زبانی بزرگ که بر روی متنهای اینترنتی آموزش دیدهاند، در تطبیق الگوها عالی عمل میکنند، اما وقتی از آنها خواسته میشود پیشبینی کنند که یک ترکیب چگونه در یک سلول زنده اثر میگذارد، دچار مشکل میشوند. قطعه گمشده، دادههای «آزمایشگاهی» (wet lab) بوده است؛ یعنی اندازهگیریهای حاصل از آزمایشهای واقعی که سلسلهمراتب اثرات بیولوژیکی را پس از روشن یا خاموش شدن یک ژن، یا اعمال یک دارو، ثبت میکنند.
Relation Therapeutics این شکاف را پر خواهد کرد. طبق این توافق، این شرکت دادههای مقیاسبزرگی تولید خواهد کرد که با دقت واکنش سلولهای انسانی به دو متغیر را اندازهگیری میکند: تغییرات ژنتیکی و مداخلات دارویی. این مشارکت با تغذیه سیستمهای هوش مصنوعی از این دیدگاه دقیق و جزئی از رفتار سلولی، قصد دارد مدلها را از پیشبینیهای خامِ اتصال (binding) به سمت شبیهسازی کل مسیرهای بیولوژیکی سوق دهد.
از پیشبینیهای جعبه سیاه به دقت سلولی
خط لولههای (pipelines) سنتی هوش مصنوعی اغلب تنها یک عدد را خروجی میدهند: احتمال اینکه یک مولکول به یک پروتئین هدف متصل شود. سپس محققان ماهها یا سالها را صرف آزمایش این موضوع میکنند که آیا آن اتصال به یک اثر درمانی منجر میشود یا خیر. رویکرد جدید، تخمین تکنقطهای را با یک نقشه چندبعدی از پیامدهای پاییندست جایگزین میکند. وقتی یک مدل هوش مصنوعی بداند که حذف ژن X باعث فعال شدن مسیر Y میشود و یک داروی کاندید همان مسیر را تضعیف میکند، میتواند اثربخشی را بسیار زودتر استنباط کند.
نتیجه این کار، کاهش آزمایشهای پرهزینه آزمون و خطا است. اگر مدلی بتواند به طور قابل اعتماد پیشبینی کند که یک ترکیب باعث ایجاد یک پاسخ سلولی مطلوب میشود، نیاز به سنتز، غربالگری و دور ریختن ترکیبات کمتری خواهد بود. این امر هزینههای تحقیق و توسعه (R&D) را کاهش داده و زمانبندیها را کوتاهتر میکند؛ مزایایی که مستقیماً بر بازه انحصاری بازار یک دارو و سود خالص شرکتهای داروسازی تأثیر میگذارد.
«دادههای درست» تبدیل به خندق دفاعی میشود
این مشارکت نشاندهنده تغییری از «دادههای بزرگ» به «دادههای درست» است. مدلهای همهمنظوره با حجم عظیم دادهها شکوفا میشوند، اما کشف دارو نیازمند دادههایی است که بسیار خاص و بهدست آوردن آنها دشوار باشد. تولید پروفایلهای قابل اعتماد از پاسخهای سلولی، نیازمند تجهیزات پیشرفته، پرسنل ماهر و کنترلهای کیفیت سختگیرانه است؛ سرمایهگذاریهایی که فقط بازیگران با بودجههای بالا از پس آن برمیآیند.
شرکتهایی که مالک خط لولهای هستند که کد ژنتیکی را به پیامدهای سلولی قابل اندازهگیری متصل میکند، ارزشمندترین مالکیت معنوی را در اختیار خواهند داشت. انحصاری بودن چنین مجموعهدادههایی، یک سد دفاعی ایجاد میکند که بازسازی آن دشوارتر از یک معماری جدید شبکه عصبی است. برای بنیانگذاران بیوتکنولوژی، پیام روشن است: ساختن یک موتور داده ممکن است استراتژیکتر از دنبال کردن موفقیتهای الگوریتمی بعدی باشد.
دیدگاه مقابل: دادهها به تنهایی همه چیز را حل نمیکنند
منتقدان خاطرنشان میکنند که حتی دادههای بینقص نیز میتوانند مدلهای هوش مصنوعی را گمراه کنند. سلولها در انواع بافتها، وضعیتهای بیماری و ویژگیهای جمعیتشناختی بیماران متفاوت هستند؛ مجموعهدادهای که در یک زمینه ثبت شده است، ممکن است قابل تعمیم نباشد. هزینه تولید و مدیریت مجموعهدادههای عظیم و باکیفیت میتواند بسیار بیشتر از هزینه آموزش مدلها باشد، که این امر سوالاتی را در مورد مقیاسپذیری برای شرکتهای کوچکتر ایجاد میکند.
نهادهای نظارتی نیز اهمیت دارند. هوش مصنوعی پیشبینیکنندهای که ادعا میکند بیولوژی انسان را شبیهسازی میکند، در نهایت باید در برابر نتایج بالینی اعتبارسنجی شود که این امر لایهای از نظارت را اضافه میکند. اگر صنعت بیش از حد به پیشبینیهای درونکامپیوتری (in-silico) بدون آزمایشهای کافی در دنیای واقعی تکیه کند، ممکن است در صورت شکست کاندیداهای امیدوارکننده در کارآزماییها، با عقبگرد مواجه شود.
آنچه در آینده باید زیر نظر داشت
چند ماه آینده مشخص خواهد کرد که آیا تلاش GSK-Relation میتواند دادههای قابل استفاده را در مقیاس وعده داده شده ارائه دهد یا خیر. شاخصهای کلیدی عبارتند از:
- انتشار مجموعهدادههای معیار (benchmark) که سایر محققان بتوانند به آنها دسترسی داشته باشند (حتی با شرایط محدود)
- مدلهای هوش مصنوعی در مراحل اولیه که به وضوح از روشهای غربالگری سنتی در یک مجموعه داده آزمایشی (held-out test set) بهتر عمل میکنند
- سرمایهگذاریهای بعدی از سوی سایر غولهای داروسازی، که نشاندهنده اعتماد به قابلیت تکرار رویکرد دادهمحور است
اگر این همکاری منجر به بهبودهای ملموس در نرخ موفقیت (hit-rate) یا زمان چرخه شود، میتواند موجی از معاملات مشابه را به راه بیندازد و نحوه تخصیص بودجههای تحقیق و توسعه در این صنعت را تغییر دهد. برعکس، اگر دادهها بسیار نویزدار یا برای ادغام بیش از حد پرهزینه باشند، شرکتها ممکن است به رویکردهای ترکیبی که هوش مصنوعی را با غربالگری پربازده (high-throughput) متداول ترکیب میکند، بازگردند.
نکته کلیدی
سرمایهگذاری ۱۱۰ میلیون دلاری GSK بر روی دادههای سلولی با دقت بالا، نشاندهنده یک چرخش تعیینکننده است: در حوزه کشف دارو با هوش مصنوعی، تعیینکنندهترین مزیت بهطور فزایندهای کیفیت و انحصاری بودن سیگنالهای بیولوژیکی خواهد بود که مدلها را آموزش میدهند، و نه صرفاً ابعاد خودِ الگوریتمها.
