GSK는 영국 바이오테크 기업 Relation Therapeutics와 최대 1억 1,000만 달러 규모의 연구 협력을 체결했습니다. 이번 파트너십은 유전자 변형 및 약물 처리에 대해 인간 세포가 어떻게 반응하는지를 추적하는 방대하고 고해resolution 데이터셋을 구축할 것입니다. 이는 AI 기반 신약 개발을 늦춰온 데이터 병목 현상을 해결하며, 분자 단계에서 의약품 단계로 나아가는 경로를 수년 단축할 수 있습니다.

AI 발전을 가로막은 데이터 문제

지난 10년 동안 제약 분야의 AI는 입력값의 관련성이 아닌 모델의 크기로 평가받아 왔습니다. 인터넷 텍스트로 학습된 대규모 언어 모델(LLM)은 패턴 매칭에는 뛰어나지만, 화합물이 살아있는 세포 내에서 어떻게 파급 효과를 일으키는지 예측하는 데는 한계를 보입니다. 부족했던 부분은 바로 "웨트 랩(wet lab)" 데이터, 즉 유전자가 켜지거나 꺼지거나 약물이 투여된 후 발생하는 생물학적 연쇄 반응을 포착하는 실제 실험 측정값이었습니다.

Relation Therapeutics가 이 격차를 메울 것입니다. 이번 계약에 따라, 이 기업은 유전자 변화와 약물 개입이라는 두 가지 변수에 대해 인간 세포가 어떻게 반응하는지를 정밀하게 측정하는 대규모 데이터를 생성할 예정입니다. AI 시스템에 이러한 세밀한 세포 행동 관찰 데이터를 제공함으로써, 이번 파트너십은 모델을 단순한 결합 예측 단계에서 전체 경로(pathway) 시뮬레이션 단계로 격상시키는 것을 목표로 합니다.

블랙박스 예측에서 세포 단위의 정밀함으로

기존의 AI 파이프라인은 종종 분자가 표적 단백질에 결합할 확률이라는 단일 수치만을 출력합니다. 연구자들은 그 결합이 실제 치료 효과로 이어지는지 확인하기 위해 수개월 또는 수년 동안 테스트를 거쳐야 합니다. 새로운 접근 방식은 단일 지점 추정치를 하류 결과(downstream outcomes)에 대한 다차원 지도로 대체합니다. AI 모델이 유전자 X를 제거(knockout)하면 경로 Y가 활성화되고, 후보 약물이 동일한 경로를 억제한다는 것을 알게 되면 훨씬 더 이른 시점에 효능을 추론할 수 있습니다.

이를 통해 비용이 많이 드는 시행착오 실험을 줄일 수 있습니다. 모델이 화합물이 바람직한 세포 반응을 유도할 것이라고 신뢰성 있게 예측할 수 있다면, 합성, 스크리닝 및 폐기해야 할 화합물의 수를 줄일 수 있습니다. 이는 R&D 지출을 낮추고 개발 기간을 단축하며, 결과적으로 약물의 시장 독점 기간과 제약사의 수익에 직접적인 영향을 미치는 이점을 제공합니다.

"적절한 데이터"가 곧 해자(Moat)가 된다

이번 파트너십은 "빅데이터"에서 "적절한 데이터(right data)"로의 전환을 강조합니다. 범용 모델은 방대한 양을 바탕으로 번창하지만, 신약 개발에는 매우 구체적이고 확보하기 어려운 데이터가 필요합니다. 신뢰할 수 있는 세포 반응 프로필을 생성하려면 정교한 장비, 숙련된 인력, 엄격한 품질 관리가 필요하며, 이는 자금력이 풍부한 기업만이 감당할 수 있는 투자입니다.

유전 코드와 측정 가능한 세포 결과 사이를 연결하는 파이프라인을 소유한 기업이 가장 가치 있는 지적 재산(IP)을 확보하게 될 것입니다. 이러한 데이터셋의 독점성은 새로운 신경망 구조를 만드는 것보다 복제하기 어려운 방어벽을 형성합니다. 바이오테크 창업자들에게 메시지는 명확합니다. 차세대 알고리즘의 돌파구를 쫓는 것보다 데이터 엔진을 구축하는 것이 더 전략적일 수 있습니다.

반론: 데이터만으로는 모든 것을 해결할 수 없다

비판론자들은 완벽한 데이터조차 AI 모델을 오도할 수 있다고 지적합니다. 세포는 조직 유형, 질병 상태, 환자 인구 통계에 따라 다르기 때문에, 특정 맥락에서 수집된 데이터셋이 일반화되지 않을 수 있습니다. 대규모 고품질 데이터셋을 생성하고 큐레이션하는 비용은 모델 학습 비용을 압도할 수 있으며, 이는 소규모 기업들에게 확장성 문제를 제기합니다.

규제 기관의 역할도 중요합니다. 인간의 생물학을 시뮬레이션한다고 주장하는 예측 AI는 결국 임상 결과에 의해 검증되어야 하므로 엄격한 조사를 받게 됩니다. 만약 업계가 적절한 실세계 테스트 없이 인실리코(in-silico) 예측에 너무 과도하게 의존한다면, 유망한 후보 물질이 임상 시험에서 실패할 때 큰 차질을 겪을 수 있습니다.

향후 주목해야 할 점

향후 몇 달간 GSK와 Relation의 협력이 약속된 규모의 유용한 데이터를 제공할 수 있을지가 드러날 것입니다. 주요 지표는 다음과 같습니다:

  • 다른 연구자들이 접근 가능한(제한적 조건 하에서도) 벤치마크 데이터셋의 공개
  • 별도의 테스트 세트에서 기존 스크리닝 방식보다 성능이 입증된 초기 단계 AI 모델
  • 데이터 접근 방식의 재현 가능성에 대한 신뢰를 보여주는 다른 대형 제약사들의 후속 투자

만약 이번 협력이 히트율(hit-rate)이나 사이클 타임에서 가시적인 개선을 가져온다면, 이는 유사한 거래의 물결을 일으켜 업계의 R&D 자금 배분 방식을 재편할 수 있습니다. 반대로 데이터가 너무 노이즈가 심하거나 통합 비용이 너무 높다면, 기업들은 AI와 기존의 고처리량 스크리닝(high-throughput screening)을 결합한 하이브리드 방식으로 회귀할 수도 있습니다.

핵심 요약

고충실도 세포 데이터에 대한 GSK의 1억 1,000만 달러 투자는 결정적인 전환을 시사합니다. AI 신약 개발 분야에서 가장 결정적인 우위는 알고리즘 자체의 규모가 아니라, 모델을 학습시키는 생물학적 신호의 품질과 독점성이 될 것입니다.