GSK a signé une collaboration de recherche avec la société de biotechnologie britannique Relation Therapeutics, d'une valeur pouvant atteindre 110 millions de dollars. Ce partenariat créera des ensembles de données massifs et à haute résolution qui suivent la manière dont les cellules humaines réagissent aux altérations génétiques et aux traitements médicamenteux. Il s'attaque au goulot d'étranglement des données qui a ralenti la découverte de médicaments assistée par l'IA et pourrait faire gagner des années sur le chemin allant de la molécule au médicament.
Le problème de données qui a freiné l'IA
Pendant la majeure partie de la dernière décennie, l'IA dans le secteur pharmaceutique a été jugée sur la taille des modèles, et non sur la pertinence des données d'entrée. Les grands modèles de langage entraînés sur des textes provenant d'Internet excellent dans la reconnaissance de formes, mais ils trébuchent lorsqu'on leur demande de prédire comment un composé se propage dans une cellule vivante. La pièce manquante a été les données de « wet lab » (laboratoire humide) — des mesures issues d'expériences réelles qui capturent la cascade d'effets biologiques après l'activation ou la désactivation d'un gène, ou l'application d'un médicament.
Relation Therapeutics comblera cette lacune. Dans le cadre de cet accord, elle générera des données à grande échelle mesurant méticuleusement la réponse des cellules humaines à deux variables : les changements génétiques et les interventions médicamenteuses. En alimentant les systèmes d'IA avec cette vue granulaire du comportement cellulaire, le partenariat vise à faire passer les modèles de simples prédictions de liaison à des simulations de voies entières.
Des prédictions « boîte noire » à la précision cellulaire
Les pipelines d'IA traditionnels produisent souvent un chiffre unique : la probabilité qu'une molécule se lie à une protéine cible. Les chercheurs passent ensuite des mois ou des années à tester si cette liaison se traduit par un effet thérapeutique. La nouvelle approche remplace l'estimation ponctuelle par une carte multidimensionnelle des résultats en aval. Lorsqu'un modèle d'IA sait que l'inactivation du gène X déclenche la voie Y, et qu'un médicament candidat atténue cette même voie, il peut en déduire l'efficacité beaucoup plus tôt.
Le bénéfice réside dans une réduction des expériences coûteuses par essais et erreurs. Si un modèle peut prévoir de manière fiable qu'un composé déclenchera une réponse cellulaire souhaitable, il y a moins de composés à synthétiser, à cribler et à rejeter. Cela réduit les dépenses de R&D et raccourcit les délais — des avantages qui affectent directement la fenêtre d'exclusivité commerciale d'un médicament et les résultats financiers des entreprises pharmaceutiques.
La « bonne donnée » devient un rempart
Le partenariat souligne un passage du « big data » aux « bonnes données ». Les modèles à usage général prospèrent grâce au volume pur, mais la découverte de médicaments exige des données hautement spécifiques et difficiles à obtenir. La génération de profils de réponse cellulaire fiables nécessite une instrumentation sophistiquée, un personnel qualifié et des contrôles de qualité rigoureux — des investissements que seuls les acteurs bien financés peuvent s'offrir.
Les entreprises qui possèdent le pipeline reliant le code génétique aux résultats cellulaires mesurables détiendront la propriété intellectuelle la plus précieuse. L'exclusivité de tels ensembles de données crée une barrière défensive plus difficile à reproduire qu'une nouvelle architecture de réseau neuronal. Pour les fondateurs de biotech, le message est clair : construire un moteur de données peut être plus stratégique que de courir après la prochaine percée algorithmique.
Contrepoint : les données ne résoudront pas tout
Les critiques soulignent que même des données parfaites peuvent induire les modèles d'IA en erreur. Les cellules diffèrent selon les types de tissus, les états pathologiques et les données démographiques des patients ; un ensemble de données capturé dans un contexte donné peut ne pas être généralisable. Le coût de la génération et de la curation d'ensembles de données massifs et de haute qualité peut éclipser les dépenses liées à l'entraînement des modèles, soulevant des questions de scalabilité pour les plus petites entreprises.
Les régulateurs comptent également. L'IA prédictive qui prétend simuler la biologie humaine doit finir par être validée par rapport aux résultats cliniques, ce qui ajoute une couche de surveillance. Si l'industrie s'appuie trop lourdement sur les prédictions in silico sans tests adéquats en conditions réelles, elle pourrait subir des revers lorsque des candidats prometteurs échoueront lors des essais.
À surveiller prochainement
Les prochains mois révéleront si l'effort conjoint de GSK et Relation peut fournir des données exploitables à l'échelle promise. Les indicateurs clés incluent :
- La publication d'ensembles de données de référence auxquels d'autres chercheurs peuvent accéder (même sous des conditions restreintes)
- Des modèles d'IA de stade précoce qui surpassent de manière démontrable les méthodes de criblage traditionnelles sur un ensemble de test distinct
- Des investissements de suivi de la part d'autres géants de la pharma, signalant la confiance dans la reproductibilité de cette approche basée sur les données
Si la collaboration produit des améliorations tangibles du taux de succès ou du temps de cycle, elle pourrait déclencher une vague d'accords similaires, remodelant la manière dont l'industrie alloue ses budgets de R&D. À l'inverse, si les données s'avèrent trop bruitées ou trop coûteuses à intégrer, les entreprises pourraient revenir à des approches hybrides mêlant l'IA au criblage à haut débit conventionnel.
À retenir
Le pari de 110 millions de dollars de GSK sur les données cellulaires de haute fidélité signale un pivot décisif : dans la découverte de médicaments par l'IA, l'avantage le plus déterminant sera de plus en plus la qualité et l'exclusivité des signaux biologiques qui entraînent les modèles, et non la simple taille des algorithmes eux-mêmes.
