GSK ha siglato una collaborazione di ricerca con la società biotech britannica Relation Therapeutics per un valore fino a 110 milioni di dollari. La partnership creerà dataset massivi ad alta risoluzione che monitorano come le cellule umane reagiscono alle alterazioni genetiche e ai trattamenti farmacologici. Questo approccio affronta il collo di bottiglia dei dati che ha rallentato la scoperta di farmaci guidata dall'IA e potrebbe accorciare di anni il percorso dalla molecola al medicinale.

Il problema dei dati che ha frenato l'IA

Per gran parte dell'ultimo decennio, l'IA nel settore farmaceutico è stata giudicata in base alla dimensione del modello, non alla rilevanza dell'input. I grandi modelli linguistici addestrati su testi internet eccellono nel riconoscimento di pattern, ma vacillano quando viene chiesto loro di prevedere come un composto si propaghi attraverso una cellula vivente. L'elemento mancante sono stati i dati del "wet lab" (laboratorio umido): misurazioni provenienti da esperimenti reali che catturano la cascata di effetti biologici dopo che un gene viene attivato o disattivato, o dopo l'applicazione di un farmaco.

Relation Therapeutics colmerà questa lacuna. In base all'accordo, genererà dati su larga scala che misurano meticolosamente come le cellule umane rispondono a due variabili: cambiamenti genetici e interventi farmacologici. Fornendo ai sistemi di IA questa visione granulare del comportamento cellulare, la partnership mira a far evolvere i modelli da approssimative previsioni di legame a simulazioni di interi percorsi biologici.

Dalle previsioni "black-box" alla precisione cellulare

Le pipeline tradizionali di IA spesso forniscono un singolo numero: la probabilità che una molecola si leghi a una proteina bersaglio. I ricercatori trascorrono poi mesi o anni a testare se tale legame si traduca in un effetto terapeutico. Il nuovo approccio sostituisce la stima a punto singolo con una mappa multidimensionale degli esiti a valle. Quando un modello di IA sa che il knockout del gene X attiva il percorso Y, e che un farmaco candidato attenua proprio quel percorso, può inferire l'efficacia molto prima.

Il vantaggio è una riduzione dei costosi esperimenti di tipo "trial-and-error" (tentativi ed errori). Se un modello può prevedere in modo affidabile che un composto innescherà una risposta cellulare desiderabile, sarà necessario sintetizzare, testare e scartare meno composti. Ciò riduce la spesa in R&S e accorcia i tempi: vantaggi che influenzano direttamente la finestra di esclusività di mercato di un farmaco e i profitti delle aziende farmaceutiche.

I "dati giusti" diventano il fossato difensivo

La partnership evidenzia uno spostamento dai "big data" ai "dati giusti". I modelli generalisti prosperano grazie al puro volume, ma la scoperta di farmaci richiede dati altamente specifici e difficili da ottenere. Generare profili di risposta cellulare affidabili richiede strumentazione sofisticata, personale qualificato e rigorosi controlli di qualità: investimenti che solo gli attori ben finanziati possono permettersi.

Le aziende che possiedono la pipeline che collega il codice genetico a risultati cellulari misurabili deterranno la proprietà intellettuale più preziosa. L'esclusività di tali dataset crea una barriera difensiva più difficile da replicare rispetto a una nuova architettura di rete neurale. Per i fondatori di biotech, il messaggio è chiaro: costruire un motore di dati potrebbe essere più strategico che inseguire la prossima svolta algoritmica.

Controargomentazione: i dati da soli non risolveranno tutto

I critici osservano che anche i dati perfetti possono trarre in inganno i modelli di IA. Le cellule differiscono in base ai tipi di tessuto, agli stati patologici e alla demografia dei pazienti; un dataset raccolto in un contesto potrebbe non essere generalizzabile. Il costo della generazione e della cura di dataset massivi e di alta qualità può superare di gran lunga la spesa per l'addestramento dei modelli, sollevando questioni di scalabilità per le aziende più piccole.

Anche i regolatori contano. L'IA predittiva che sostiene di simulare la biologia umana deve essere infine convalidata rispetto agli esiti clinici, aggiungendo un ulteriore livello di scrutinio. Se l'industria si affida troppo alle previsioni in silico senza adeguati test nel mondo reale, potrebbe affrontare battute d'arresto quando candidati promettenti falliranno nei trial clinici.

Cosa osservare in futuro

I prossimi mesi riveleranno se l'impegno di GSK-Relation potrà fornire dati utilizzabili alla scala promessa. Gli indicatori chiave includono:

  • Pubblicazione di dataset di benchmark a cui altri ricercatori possono accedere (anche con termini ristretti)
  • Modelli di IA in fase iniziale che superano dimostrabilmente i metodi di screening tradizionali su un set di test separato (held-out test set)
  • Investimenti successivi da parte di altri colossi farmaceutici, a segnale della fiducia nella replicabilità dell'approccio basato sui dati

Se la collaborazione porterà miglioramenti tangibili nel tasso di successo (hit-rate) o nei tempi di ciclo, potrebbe innescare un'ondata di accordi simili, rimodellando il modo in cui l'industria alloca i fondi per la R&S. Al contrario, se i dati si rivelassero troppo rumorosi o costosi da integrare, le aziende potrebbero tornare ad approcci ibridi che combinano l'IA con lo screening convenzionale ad alto rendimento (high-throughput screening).

In sintesi

La scommessa da 110 milioni di dollari di GSK sui dati cellulari ad alta fedeltà segnala una svolta decisiva: nella scoperta di farmaci tramite IA, il vantaggio più determinante sarà sempre più la qualità e l'esclusività dei segnali biologici che addestrano i modelli, e non la mera dimensione degli algoritmi stessi.