GSK חתמה על שיתוף פעולה מחקרי עם חברת הביוטק הבריטית Relation Therapeutics בשווי של עד 110 מיליון דולר. השותפות תיצור מאגרי נתונים עצומים ברזולוציה גבוהה העוקבים אחר האופן שבו תאים אנושיים מגיבים לשינויים גנטיים ולטיפולים תרופתיים. היא תתמודד עם צוואר הבקבוק של הנתונים שעיכב את גילוי התרופות מבוסס ה-AI ועשויה לקצר שנים בדרך מהמולקולה לתרופה.

בעיית הנתונים שעיכבה את ה-AI

במשך רוב העשור האחרון, הבינה המלאכותית (AI) בתחום הפארמה נמדדה לפי גודל המודל, ולא לפי רלוונטיות הקלט. מודלי שפה גדולים שאומנו על טקסטים מהאינטרנט מצטיינים בזיהוי תבניות, אך הם נתקלים בקשיים כשמבקשים מהם לחזות כיצד תרכובת משפיעה על תא חי. החלק החסר הוא נתוני "wet lab" – מדידות מניסויים אמיתיים שתופסים את שרשרת ההשפעות הביולוגיות לאחר הפעלת או כיבוי של גן, או יישום של תרופה.

Relation Therapeutics תמלא את הפער הזה. במסגרת ההסכם, היא תייצר נתונים בקנה מידה גדול המודדים בקפידה כיצד תאים אנושיים מגיבים לשני משתנים: שינויים גנטיים והתערבויות תרופתיות. על ידי הזנת מערכות AI בתצוגה גרנולרית זו של התנהגות תאית, השותפות שואפת להעביר את המודלים מחיזוי קישור (binding) גולמי לסימולציות של מסלולים ביולוגיים שלמים.

מחיזויים של "קופסה שחורה" לדיוק תאי

תהליכי AI מסורתיים מוציאים לעיתים קרובות מספר בודד: ההסתברות שמולקולה תקשורת עם חלבון מטרה. לאחר מכן, חוקרים מבלים חודשים או שנים בבדיקה האם הקישור הזה מתרגם לאפקט טיפולי. הגישה החדשה מחליפה את האומדנות בנקודה בודדת במפה רב-ממדית של תוצאות המשך. כאשר מודל AI יודע שביטול (knockout) של גן X מפעיל מסלול Y, ושתרופה מועמדת מעדנת את אותו מסלול, הוא יכול להסיק על יעילות בשלב מוקדם הרבה יותר.

התמורה היא הפחתה בניסויי "ניסוי וטעייה" יקרים. אם מודל יכול לחזות באופן אמין שתרכובת תעורר תגובה תאית רצויה, יהיה צורך לסנתז, לסרוק ולהשליך פחות תרכובות. זה מפחית את הוצאות המחקר והפיתוח (R&D) ומקצר לוחות זמנים – יתרונות המשפיעים ישירות על חלון הבלעדיות של התרופה בשוק ועל השורה התחתונה של חברות הפארמה.

ה"נתונים הנכונים" הופכים לחפיר (moat)

השותפות מדגישה מעבר מ-"big data" ל-"right data". מודלים לשימוש כללי משגשגים על נפח עצום, אך גילוי תרופות דורש נתונים ספציפיים מאוד וקשים להשגה. יצירת פרופילי תגובה תאית אמינים דורשת מכשור מתוחכם, כוח אדם מיומן ובקרת איכות קפדנית – השקעות שרק שחקנים מבוססי הון יכולים להרשות לעצמם.

חברות שבבעלותן את הצינור (pipeline) המחבר בין הקוד הגנטי לתוצאות תאית מדידות, יחזיקו בקניין הרוחני בעל הערך הרב ביותר. הבלעדיות של מאגרי נתונים כאלה יוצרת מחסום הגנה שקשה יותר לשכפל מאשר ארכיטקטורת רשת עצבית חדשה. עבור מייסדי ביוטק, המסר ברור: בניית מנוע נתונים עשויה להיות אסטרטגית יותר מרדיפה אחרי הפריצת האלגוריתמית הבאה.

נקודת מבט נגדית: נתונים לבדם לא יפתרו הכל

מבקרים מציינים שגם נתונים מושלמים יכולים להטעות מודלי AI. תאים שונים בין סוגי רקמות, מצבי מחלה ודמוגרפיה של מטופלים; מאגר נתונים שנאסף בהקשר אחד עשוי שלא להיות תקף להכללה. עלות יצירה וניהול של מאגרי נתונים עצומים ואיכותיים יכולה לעלות יותר מעלות אימון המודלים, מה שמעלה שאלות לגבי יכולת ההתרחבות (scalability) של חברות קטנות יותר.

גם הרגולטורים חשובים. בינה מלאכותית חיזויית הטוענת לסמלץ ביולוגיה אנושית חייבת בסופו של דבר לעבור תיקוף מול תוצאות קליניות, מה שמוסיף שכבה של פיקוח. אם התעשייה תישען בכבדות מדי על תחזיות in-silico ללא בדיקות מציאותיות מספקות, היא עלולה להתמודד עם עיכובים כאשר מועמדים מבטיחים נכשלים בניסויים.

מה כדאי לעקוב אחריו בהמשך

החודשים הקרובים יחשפו האם המאמץ של GSK-Relation יכול לספק נתונים שמישים בקנה המידה המובטח. אינדיקטורים מרכזיים כוללים:

  • פרסום מאגרי נתונים למדידה (benchmark) שחוקרים אחרים יכולים לגשת אליהם (אפילו בתנאים מוגבלים)
  • מודלי AI בשלבים מוקדמים שמציגים ביצועים טובים באופן מובהק משיטות סריקה מסורתיות על סט בדיקה נפרד
  • השקעות המשך מחברות פארמה גדולות אחרות, המאותתות על אמון בכך שגישת הנתונים ניתנת לשחזור

אם שיתוף הפעולה יניב שיפורים מוחשיים בשיעור ההצלחה (hit-rate) או בזמן המחזור, הוא עשוי לעורר גל של עסקאות דומות, ולעצב מחדש את האופן שבו התעשייה מקצה תקציבי R&D. לעומת זאת, אם הנתונים יתבררו כרועשים מדי או יקרים מדי לשילוב, חברות עשויות לחזור לגישות היברידיות המשלבות AI עם סריקה קונבנציונלית בדרגת תפוקה גבוהה (high-throughput screening).

שורה תחתונה

ההימור של GSK על נתונים תאיים ברמת דיוק גבוהה (high-fidelity) בסך 110 מיליון דולר מסמן שינוי כיוון מכריע: בתחום גילוי התרופות באמצעות בינה מלאכותית, היתרון המכריע ביותר יהיה יותר ויותר איכותם ובלעדיותם של האותות הביולוגיים המאמנים את המודלים, ולא הגודל הגולמי של האלגוריתמים עצמם.