GSK заключила соглашение о научно-исследовательском сотрудничестве с британской биотехнологической фирмой Relation Therapeutics на сумму до 110 миллионов долларов. Партнерство позволит создавать масштабные наборы данных высокого разрешения, которые отслеживают реакцию человеческих клеток на генетические изменения и воздействие лекарственных препаратов. Это поможет устранить проблему «узкого места» в данных, которая замедляла разработку лекарств с помощью ИИ, и может сократить путь от молекулы до лекарства на годы.

Проблема данных, сдерживающая развитие ИИ

На протяжении большей части последнего десятилетия эффективность ИИ в фармацевтике оценивалась по размеру моделей, а не по релевантности входных данных. Большие языковые модели, обученные на текстах из интернета, отлично справляются с поиском закономерностей, но пасуют, когда их просят предсказать, как соединение повлияет на живую клетку. Недостающим звеном были данные «мокрых лабораторий» (wet lab) — результаты реальных экспериментов, фиксирующие каскад биологических эффектов после включения или выключения гена или применения препарата.

Relation Therapeutics восполнит этот пробел. Согласно соглашению, компания будет генерировать крупномасштабные данные, которые тщательно измеряют реакцию человеческих клеток на две переменные: генетические изменения и лекарственное вмешательство. Обеспечивая системы ИИ таким детализированным представлением клеточного поведения, партнерство стремится перейти от грубых прогнозов связывания к симуляции целых биологических путей.

От прогнозов «черного ящика» к клеточной точности

Традиционные конвейеры ИИ часто выдают одно число: вероятность того, что молекула свяжется с целевым белком. Затем исследователи тратят месяцы или годы, проверяя, приведет ли это связывание к терапевтическому эффекту. Новый подход заменяет точечную оценку многомерной картой последующих результатов. Когда модель ИИ знает, что нокаут гена X запускает путь Y, а кандидатный препарат подавляет этот же путь, она может сделать вывод об эффективности гораздо раньше.

Результатом станет сокращение дорогостоящих экспериментов методом проб и ошибок. Если модель может надежно предсказать, что соединение вызовет желаемый клеточный ответ, потребуется синтезировать, тестировать и отбраковывать меньше соединений. Это снижает расходы на НИОКР и сокращает сроки — преимущества, которые напрямую влияют на период эксклюзивности препарата на рынке и чистую прибыль фармацевтических компаний.

«Правильные данные» становятся защитным рвом

Это партнерство подчеркивает переход от «больших данных» (big data) к «правильным данным» (right data). Универсальные модели процветают за счет огромных объемов, но разработка лекарств требует высокоспецифичных и труднодоступных данных. Создание надежных профилей клеточного ответа требует сложного оборудования, квалифицированного персонала и строгого контроля качества — инвестиций, которые могут позволить себе только хорошо финансируемые игроки.

Компании, владеющие цепочкой, связывающей генетический код с измеримыми клеточными результатами, будут обладать самой ценной интеллектуальной собственностью. Эксклюзивность таких наборов данных создает защитный барьер, который труднее воспроизвести, чем новую архитектуру нейронной сети. Для основателей биотехнологических компаний посыл ясен: создание «двигателя данных» может быть более стратегически важным, чем погоня за очередным алгоритмическим прорывом.

Контраргумент: одни лишь данные не решат всех проблем

Критики отмечают, что даже идеальные данные могут ввести модели ИИ в заблуждение. Клетки различаются в зависимости от типа ткани, состояния заболевания и демографии пациентов; набор данных, полученный в одном контексте, может не быть применим к другим. Стоимость создания и курирования массивных высококачественных наборов данных может затмить расходы на обучение моделей, что ставит вопросы масштабируемости для небольших фирм.

Регуляторы также играют важную роль. Прогностический ИИ, претендующий на симуляцию биологии человека, в конечном итоге должен быть подтвержден клиническими результатами, что добавляет уровень контроля. Если отрасль будет слишком сильно полагаться на прогнозы in silico без адекватного тестирования в реальном мире, она может столкнуться с неудачами, когда многообещающие кандидаты провалятся в клинических испытаниях.

На что обратить внимание

Ближайшие несколько месяцев покажут, сможет ли проект GSK и Relation обеспечить полезные данные в обещанном масштабе. Ключевые индикаторы включают:

  • Публикацию эталонных наборов данных, к которым смогут получить доступ другие исследователи (пусть и на ограниченных условиях);
  • Модели ИИ на ранних стадиях, которые наглядно превосходят традиционные методы скрининга на контрольной выборке;
  • Последующие инвестиции со стороны других фармацевтических гигантов, что станет сигналом уверенности в воспроизводимости подхода, основанного на данных.

Если сотрудничество принесет ощутимые улучшения в доле попаданий (hit-rate) или сокращении циклов разработки, это может спровоцировать волну аналогичных сделок, меняя принципы распределения средств на НИОКР в отрасли. И наоборот, если данные окажутся слишком зашумленными или дорогими для интеграции, компании могут вернуться к гибридным подходам, сочетающим ИИ с традиционным высокопроизводительным скринингом.

Ключевой вывод

Ставка GSK в 110 миллионов долларов на высокоточные клеточные данные знаменует собой решительный разворот: в области разработки лекарств с помощью ИИ решающим преимуществом всё чаще будет становиться качество и эксклюзивность биологических сигналов, на которых обучаются модели, а не просто масштаб самих алгоритмов.