GSK یک همکاری تحقیقاتی با شرکت بیوتکنولوژی بریتانیایی Relation Therapeutics به ارزش حداکثر ۱۱۰ میلیون دلار امضا کرده است. این مشارکت مجموعه‌داده‌های عظیم و با وضوح بالایی ایجاد خواهد کرد که واکنش سلول‌های انسانی به تغییرات ژنتیکی و درمان‌های دارویی را ردیابی می‌کنند. این همکاری به گلوگاه داده‌ای که کشف داروهای مبتنی بر هوش مصنوعی را کند کرده است، حمله می‌کند و می‌تواند سال‌ها از مسیر تبدیل مولکول به دارو بکاهد.

مشکل داده‌ای که مانع پیشرفت هوش مصنوعی شده است

در بیشتر طول دهه گذشته، هوش مصنوعی در صنعت داروسازی بر اساس اندازه مدل، و نه مرتبط بودن ورودی‌ها، مورد قضاوت قرار گرفته است. مدل‌های زبانی بزرگ که بر روی متن‌های اینترنتی آموزش دیده‌اند، در تطبیق الگوها عالی عمل می‌کنند، اما وقتی از آن‌ها خواسته می‌شود پیش‌بینی کنند که یک ترکیب چگونه در یک سلول زنده اثر می‌گذارد، دچار مشکل می‌شوند. قطعه گمشده، داده‌های «آزمایشگاهی» (wet lab) بوده است؛ یعنی اندازه‌گیری‌های حاصل از آزمایش‌های واقعی که سلسله‌مراتب اثرات بیولوژیکی را پس از روشن یا خاموش شدن یک ژن، یا اعمال یک دارو، ثبت می‌کنند.

Relation Therapeutics این شکاف را پر خواهد کرد. طبق این توافق، این شرکت داده‌های مقیاس‌بزرگی تولید خواهد کرد که با دقت واکنش سلول‌های انسانی به دو متغیر را اندازه‌گیری می‌کند: تغییرات ژنتیکی و مداخلات دارویی. این مشارکت با تغذیه سیستم‌های هوش مصنوعی از این دیدگاه دقیق و جزئی از رفتار سلولی، قصد دارد مدل‌ها را از پیش‌بینی‌های خامِ اتصال (binding) به سمت شبیه‌سازی کل مسیرهای بیولوژیکی سوق دهد.

از پیش‌بینی‌های جعبه سیاه به دقت سلولی

خط لوله‌های (pipelines) سنتی هوش مصنوعی اغلب تنها یک عدد را خروجی می‌دهند: احتمال اینکه یک مولکول به یک پروتئین هدف متصل شود. سپس محققان ماه‌ها یا سال‌ها را صرف آزمایش این موضوع می‌کنند که آیا آن اتصال به یک اثر درمانی منجر می‌شود یا خیر. رویکرد جدید، تخمین تک‌نقطه‌ای را با یک نقشه چندبعدی از پیامدهای پایین‌دست جایگزین می‌کند. وقتی یک مدل هوش مصنوعی بداند که حذف ژن X باعث فعال شدن مسیر Y می‌شود و یک داروی کاندید همان مسیر را تضعیف می‌کند، می‌تواند اثربخشی را بسیار زودتر استنباط کند.

نتیجه این کار، کاهش آزمایش‌های پرهزینه آزمون و خطا است. اگر مدلی بتواند به طور قابل اعتماد پیش‌بینی کند که یک ترکیب باعث ایجاد یک پاسخ سلولی مطلوب می‌شود، نیاز به سنتز، غربالگری و دور ریختن ترکیبات کمتری خواهد بود. این امر هزینه‌های تحقیق و توسعه (R&D) را کاهش داده و زمان‌بندی‌ها را کوتاه‌تر می‌کند؛ مزایایی که مستقیماً بر بازه انحصاری بازار یک دارو و سود خالص شرکت‌های داروسازی تأثیر می‌گذارد.

«داده‌های درست» تبدیل به خندق دفاعی می‌شود

این مشارکت نشان‌دهنده تغییری از «داده‌های بزرگ» به «داده‌های درست» است. مدل‌های همه‌منظوره با حجم عظیم داده‌ها شکوفا می‌شوند، اما کشف دارو نیازمند داده‌هایی است که بسیار خاص و به‌دست آوردن آن‌ها دشوار باشد. تولید پروفایل‌های قابل اعتماد از پاسخ‌های سلولی، نیازمند تجهیزات پیشرفته، پرسنل ماهر و کنترل‌های کیفیت سخت‌گیرانه است؛ سرمایه‌گذاری‌هایی که فقط بازیگران با بودجه‌های بالا از پس آن برمی‌آیند.

شرکت‌هایی که مالک خط لوله‌ای هستند که کد ژنتیکی را به پیامدهای سلولی قابل اندازه‌گیری متصل می‌کند، ارزشمندترین مالکیت معنوی را در اختیار خواهند داشت. انحصاری بودن چنین مجموعه‌داده‌هایی، یک سد دفاعی ایجاد می‌کند که بازسازی آن دشوارتر از یک معماری جدید شبکه عصبی است. برای بنیان‌گذاران بیوتکنولوژی، پیام روشن است: ساختن یک موتور داده ممکن است استراتژیک‌تر از دنبال کردن موفقیت‌های الگوریتمی بعدی باشد.

دیدگاه مقابل: داده‌ها به تنهایی همه چیز را حل نمی‌کنند

منتقدان خاطرنشان می‌کنند که حتی داده‌های بی‌نقص نیز می‌توانند مدل‌های هوش مصنوعی را گمراه کنند. سلول‌ها در انواع بافت‌ها، وضعیت‌های بیماری و ویژگی‌های جمعیت‌شناختی بیماران متفاوت هستند؛ مجموعه‌داده‌ای که در یک زمینه ثبت شده است، ممکن است قابل تعمیم نباشد. هزینه تولید و مدیریت مجموعه‌داده‌های عظیم و باکیفیت می‌تواند بسیار بیشتر از هزینه آموزش مدل‌ها باشد، که این امر سوالاتی را در مورد مقیاس‌پذیری برای شرکت‌های کوچک‌تر ایجاد می‌کند.

نهادهای نظارتی نیز اهمیت دارند. هوش مصنوعی پیش‌بینی‌کننده‌ای که ادعا می‌کند بیولوژی انسان را شبیه‌سازی می‌کند، در نهایت باید در برابر نتایج بالینی اعتبارسنجی شود که این امر لایه‌ای از نظارت را اضافه می‌کند. اگر صنعت بیش از حد به پیش‌بینی‌های درون‌کامپیوتری (in-silico) بدون آزمایش‌های کافی در دنیای واقعی تکیه کند، ممکن است در صورت شکست کاندیداهای امیدوارکننده در کارآزمایی‌ها، با عقب‌گرد مواجه شود.

آنچه در آینده باید زیر نظر داشت

چند ماه آینده مشخص خواهد کرد که آیا تلاش GSK-Relation می‌تواند داده‌های قابل استفاده را در مقیاس وعده داده شده ارائه دهد یا خیر. شاخص‌های کلیدی عبارتند از:

  • انتشار مجموعه‌داده‌های معیار (benchmark) که سایر محققان بتوانند به آن‌ها دسترسی داشته باشند (حتی با شرایط محدود)
  • مدل‌های هوش مصنوعی در مراحل اولیه که به وضوح از روش‌های غربالگری سنتی در یک مجموعه داده آزمایشی (held-out test set) بهتر عمل می‌کنند
  • سرمایه‌گذاری‌های بعدی از سوی سایر غول‌های داروسازی، که نشان‌دهنده اعتماد به قابلیت تکرار رویکرد داده‌محور است

اگر این همکاری منجر به بهبودهای ملموس در نرخ موفقیت (hit-rate) یا زمان چرخه شود، می‌تواند موجی از معاملات مشابه را به راه بیندازد و نحوه تخصیص بودجه‌های تحقیق و توسعه در این صنعت را تغییر دهد. برعکس، اگر داده‌ها بسیار نویزدار یا برای ادغام بیش از حد پرهزینه باشند، شرکت‌ها ممکن است به رویکردهای ترکیبی که هوش مصنوعی را با غربالگری پربازده (high-throughput) متداول ترکیب می‌کند، بازگردند.

نکته کلیدی

سرمایه‌گذاری ۱۱۰ میلیون دلاری GSK بر روی داده‌های سلولی با دقت بالا، نشان‌دهنده یک چرخش تعیین‌کننده است: در حوزه کشف دارو با هوش مصنوعی، تعیین‌کننده‌ترین مزیت به‌طور فزاینده‌ای کیفیت و انحصاری بودن سیگنال‌های بیولوژیکی خواهد بود که مدل‌ها را آموزش می‌دهند، و نه صرفاً ابعاد خودِ الگوریتم‌ها.