GSK, İngiliz biyoteknoloji firması Relation Therapeutics ile 110 milyon dolara varan bir araştırma iş birliği imzaladı. Bu ortaklık, insan hücrelerinin genetik değişikliklere ve ilaç tedavilerine nasıl tepki verdiğini takip eden devasa, yüksek çözünürlüklü veri setleri oluşturacak. Bu adım, yapay zeka destekli ilaç keşfini yavaşlatan veri darboğazını hedef alıyor ve bir molekülün ilaca dönüşme sürecini yıllarca kısaltabilir.
Yapay zekayı geride tutan veri problemi
Geçtiğimiz on yılın büyük bir bölümünde, ilaç sektöründeki yapay zeka, girdi uygunluğuna göre değil, model boyutuna göre değerlendirildi. İnternet metinleri üzerinde eğitilen büyük dil modelleri örüntü eşleştirmede mükemmeldir, ancak bir bileşiğin canlı bir hücrede nasıl dalgalanacağını tahmin etmeleri istendiğinde tökezlerler. Eksik parça ise "ıslak laboratuvar" (wet lab) verileriydi; yani bir genin açılıp kapanması veya bir ilacın uygulanması sonrasında meydana gelen biyolojik etkiler zincirini yakalayan gerçek deney ölçümleri.
Relation Therapeutics bu boşluğu dolduracak. Anlaşma kapsamında, insan hücrelerinin iki değişkene nasıl tepki verdiğini titizlikle ölçen büyük ölçekli veriler üretecek: genetik değişiklikler ve ilaç müdahaleleri. Yapay zeka sistemlerini hücresel davranışın bu ayrıntılı görünümüyle besleyerek, ortaklık modelleri kaba bağlanma tahminlerinden tüm yolakların simülasyonlarına taşımayı hedefliyor.
Kara kutu tahminlerinden hücresel hassasiyete
Geleneksel yapay zeka iş akışları genellikle tek bir sayı üretir: bir molekülün hedef proteine bağlanma olasılığı. Araştırmacılar daha sonra bu bağlanmanın terapötik bir etkiye dönüşüp dönüşmediğini test etmek için aylar hatta yıllar harcar. Yeni yaklaşım, tek noktalı tahmini, sonraki sonuçların çok boyutlu bir haritasıyla değiştiriyor. Bir yapay zeka modeli, X geninin devre dışı bırakılmasının Y yolunu tetiklediğini ve aday bir ilacın aynı yolu hafiflettiğini bildiğinde, etkinliği çok daha erken çıkarabilir.
Bunun getirisi, maliyetli deneme-yanılma deneylerinin azalmasıdır. Eğer bir model, bir bileşiğin arzu edilen bir hücresel tepkiyi tetikleyeceğini güvenilir bir şekilde öngörebilirse, daha az bileşiğin sentezlenmesi, taranması ve elenmesi gerekir. Bu durum Ar-Ge harcamalarını düşürür ve zaman çizelgelerini kısaltır; bu avantajlar doğrudan bir ilacın pazar münhasırlığı penceresini ve ilaç firmalarının kâr marjını etkiler.
"Doğru veri" bir hendek (moat) haline geliyor
Ortaklık, "büyük veri"den "doğru veri"ye doğru bir kaymaya dikkat çekiyor. Genel amaçlı modeller devasa hacimlerden beslenir, ancak ilaç keşfi son derece spesifik ve elde edilmesi zor veriler gerektirir. Güvenilir hücresel tepki profilleri oluşturmak; gelişmiş enstrümantasyon, yetkin personel ve sıkı kalite kontrolleri gerektirir; bunlar yalnızca iyi finanse edilen oyuncuların karşılayabileceği yatırımlardır.
Genetik kod ile ölçülebilir hücresel sonuçları birbirine bağlayan iş akışına sahip olan şirketler, en değerli fikri mülkiyeti kontrol edecektir. Bu tür veri setlerinin münhasırlığı, yeni bir sinir ağı mimarisini kopyalamaktan daha zor olan savunmacı bir bariyer oluşturur. Biyoteknoloji kurucuları için mesaj nettir: Bir veri motoru inşa etmek, bir sonraki algoritmik atılımın peşinden koşmaktan daha stratejik olabilir.
Karşı görüş: Veri tek başına her şeyi çözmeyecek
Eleştirmenler, mükemmel verinin bile yapay zeka modellerini yanıltabileceğini belirtiyor. Hücreler doku tiplerine, hastalık durumlarına ve hasta demografisine göre farklılık gösterir; tek bir bağlamda yakalanan bir veri seti genelleştirilemeyebilir. Devasa, yüksek kaliteli veri setleri oluşturmanın ve düzenlemenin maliyeti, modelleri eğitme maliyetini gölgede bırakabilir ve bu da daha küçük firmalar için ölçeklenebilirlik sorularını beraberinde getirir.
Düzenleyiciler de önemlidir. İnsan biyolojisini simüle ettiğini iddia eden öngörücü yapay zekanın, en nihayetinde klinik sonuçlara karşı doğrulanması gerekir, bu da bir denetim katmanı ekler. Eğer endüstri, yeterli gerçek dünya testi yapmadan in-silico tahminlere çok fazla yaslanırsa, vaat eden adayların klinik deneylerde başarısız olması durumunda gerilemelerle karşılaşabilir.
Sırada ne var?
Önümüzdeki birkaç ay, GSK-Relation çabasının vaat edilen ölçekte kullanılabilir veri sunup sunamayacağını ortaya koyacaktır. Temel göstergeler şunlardır:
- Diğer araştırmacıların erişebileceği (kısıtlı şartlar altında bile olsa) kıyaslama (benchmark) veri setlerinin yayınlanması
- Ayrılmış bir test setinde geleneksel tarama yöntemlerinden belirgin şekilde daha iyi performans gösteren erken aşama yapay zeka modelleri
- Veri yaklaşımının tekrarlanabilir olduğuna dair güven sinyali veren diğer büyük ilaç şirketlerinden gelen takip yatırımları
Eğer iş birliği, isabet oranında veya döngü süresinde somut iyileşmeler sağlarsa, endüstrinin Ar-Ge bütçelerini nasıl tahsis ettiğini yeniden şekillendiren benzer anlaşma dalgalarını tetikleyebilir. Aksine, veriler entegre edilemeyecek kadar gürültülü veya maliyetli çıkarsa, firmalar yapay zekayı geleneksel yüksek verimli tarama (high-throughput screening) ile harmanlayan hibrit yaklaşımlara geri dönebilir.
Özet
GSK'nın yüksek doğruluklu hücresel verilere yaptığı 110 milyon dolarlık yatırım, belirleyici bir dönüşümün sinyalini veriyor: yapay zeka destekli ilaç keşfinde en belirleyici avantaj, algoritmaların kendi boyutlarından ziyade, modelleri eğiten biyolojik sinyallerin kalitesi ve özel oluşu olacaktır.
