GSK ha firmado una colaboración de investigación con la firma biotecnológica británica Relation Therapeutics por un valor de hasta 110 millones de dólares. La asociación creará conjuntos de datos masivos y de alta resolución que rastrearán cómo reaccionan las células humanas a las alteraciones genéticas y a los tratamientos farmacológicos. Esto ataca el cuello de botella de datos que ha frenado el descubrimiento de fármacos impulsado por la IA y podría reducir en años el camino desde la molécula hasta el medicamento.
El problema de los datos que ha frenado a la IA
Durante la mayor parte de la última década, la IA en el sector farmacéutico se ha juzgado por el tamaño del modelo y no por la relevancia de los datos de entrada. Los modelos de lenguaje de gran tamaño entrenados con texto de internet sobresalen en la detección de patrones, pero fallan cuando se les pide que predigan cómo un compuesto repercute en una célula viva. La pieza que faltaba han sido los datos de "laboratorio húmedo" (wet lab): mediciones de experimentos reales que capturan la cascada de efectos biológicos después de que un gen se activa o se desactiva, o de que se aplica un fármaco.
Relation Therapeutics llenará ese vacío. Bajo el acuerdo, generará datos a gran escala que miden meticulosamente cómo responden las células humanas a dos variables: cambios genéticos e intervenciones farmacológicas. Al alimentar a los sistemas de IA con esta visión granular del comportamiento celular, la asociación pretende pasar de predicciones de unión rudimentarias a simulaciones de vías completas.
De las predicciones de caja negra a la precisión celular
Los flujos de trabajo tradicionales de IA suelen arrojar un único número: la probabilidad de que una molécula se una a una proteína objetivo. Los investigadores pasan entonces meses o años probando si esa unión se traduce en un efecto terapéutico. El nuevo enfoque sustituye la estimación de un solo punto por un mapa multidimensional de los resultados posteriores. Cuando un modelo de IA sabe que la inactivación del gen X desencadena la vía Y, y que un fármaco candidato atenúa esa misma vía, puede inferir la eficacia mucho antes.
La recompensa es una reducción de los costosos experimentos de ensayo y error. Si un modelo puede pronosticar con fiabilidad que un compuesto desencadenará una respuesta celular deseable, será necesario sintetizar, cribar y descartar menos compuestos. Esto reduce el gasto en I+D y acorta los plazos, ventajas que afectan directamente a la ventana de exclusividad de mercado de un fármaco y a los beneficios de las empresas farmacéuticas.
Los "datos adecuados" se convierten en el foso defensivo
La asociación destaca un cambio de los "big data" a los "datos adecuados". Los modelos de propósito general prosperan gracias al volumen puro, pero el descubrimiento de fármacos exige datos altamente específicos y difíciles de obtener. Generar perfiles de respuesta celular fiables requiere instrumentación sofisticada, personal cualificado y controles de calidad estrictos: inversiones que solo los actores bien financiados pueden permitirse.
Las empresas que posean el proceso que vincula el código genético con resultados celulares medibles dominarán la propiedad intelectual más valiosa. La exclusividad de tales conjuntos de datos crea una barrera defensiva más difícil de replicar que una nueva arquitectura de red neuronal. Para los fundadores de biotecnológicas, el mensaje es claro: construir un motor de datos puede ser más estratégico que perseguir el próximo avance algorítmico.
Contrapunto: los datos por sí solos no lo resolverán todo
Los críticos señalan que incluso los datos perfectos pueden confundir a los modelos de IA. Las células difieren según el tipo de tejido, el estado de la enfermedad y la demografía de los pacientes; un conjunto de datos capturado en un contexto puede no ser generalizable. El coste de generar y curar conjuntos de datos masivos y de alta calidad puede eclipsar el gasto de entrenar los modelos, lo que plantea dudas sobre la escalabilidad para las empresas más pequeñas.
Los reguladores también son importantes. La IA predictiva que afirma simular la biología humana debe, eventualmente, ser validada frente a los resultados clínicos, lo que añade una capa de escrutinio. Si la industria se apoya demasiado en las predicciones in silico sin pruebas adecuadas en el mundo real, podría enfrentarse a contratiempos cuando los candidatos prometedores fallen en los ensayos.
Qué observar a continuación
Los próximos meses revelarán si el esfuerzo de GSK-Relation puede ofrecer datos utilizables a la escala prometida. Los indicadores clave incluyen:
- Publicación de conjuntos de datos de referencia (benchmarks) a los que otros investigadores puedan acceder (incluso bajo términos restringidos)
- Modelos de IA en etapas tempranas que superen de forma demostrable a los métodos de cribado tradicionales en un conjunto de pruebas independiente
- Inversiones posteriores de otros gigantes farmacéuticos, lo que indicaría confianza en que el enfoque de datos es replicable
Si la colaboración produce mejoras tangibles en la tasa de éxito (hit-rate) o en el tiempo de ciclo, podría desencadenar una ola de acuerdos similares, remodelando la forma en que la industria asigna los dólares de I+D. Por el contrario, si los datos resultan demasiado ruidosos o costosos de integrar, las empresas podrían volver a enfoques híbridos que combinan la IA con el cribado convencional de alto rendimiento.
Conclusión
La apuesta de 110 millones de dólares de GSK en datos celulares de alta fidelidad señala un giro decisivo: en el descubrimiento de fármacos mediante IA, la ventaja más determinante será, cada vez más, la calidad y la exclusividad de las señales biológicas que entrenan los modelos, y no el mero tamaño de los propios algoritmos.
