GSK 已与英国生物技术公司 Relation Therapeutics 签署了一项价值高达 1.1 亿美元的研究合作协议。此次合作将创建大规模、高分辨率的数据集,用于追踪人类细胞对基因改变和药物治疗的反应。它旨在解决一直阻碍 AI 驱动药物研发的数据瓶颈,并有望将从分子到药物的研发路径缩短数年。
阻碍 AI 发展的难题:数据问题
在过去的十年中,制药领域的 AI 评估标准大多在于模型规模,而非输入数据的相关性。在互联网文本上训练的大语言模型擅长模式匹配,但在预测化合物如何在活细胞中产生连锁反应时却显得力不从心。缺失的关键环节是“湿实验”(wet lab)数据——即通过真实实验获取的测量数据,这些数据能够捕捉基因开启或关闭、或施加药物后产生的生物效应级联反应。
Relation Therapeutics 将填补这一空白。根据协议,该公司将生成大规模数据,细致地测量人类细胞对两个变量的反应:基因变化和药物干预。通过向 AI 系统提供这种细胞行为的细粒度视图,该合作伙伴关系旨在将模型从粗糙的结合预测提升到对整个信号通路的模拟。
从黑盒预测转向细胞级精准度
传统的 AI 流水线通常只输出一个数字:分子与靶点蛋白结合的可能性。研究人员随后需要花费数月或数年时间来测试这种结合是否能转化为治疗效果。新方法用下游结果的多维图谱取代了单一的点估计。当 AI 模型能够预知敲除基因 X 会触发通路 Y,且候选药物能抑制该通路时,它就能更早地推断出疗效。
其回报在于减少了昂贵的试错实验。如果模型能够可靠地预测化合物会触发理想的细胞反应,那么需要合成、筛选并丢弃的化合物就会减少。这降低了研发支出并缩短了时间线——这些优势直接影响药物的市场独占期和制药公司的利润。
“正确的数据”成为护城河
此次合作凸显了从“大数据”向“正确数据”的转变。通用模型依赖于海量数据,但药物研发需要高度特定且难以获取的数据。生成可靠的细胞反应图谱需要先进的仪器、专业的技能人员和严格的质量控制——这些投资只有资金雄厚的参与者才能负担得起。
拥有连接基因密码与可测量细胞结果之流水线的公司,将掌握最有价值的知识产权。此类数据集的排他性创造了一种防御壁垒,其复制难度远高于新型神经网络架构。对于生物技术领域的创始人来说,信号很明确:构建数据引擎可能比追求下一个算法突破更具战略意义。
反方观点:仅靠数据无法解决所有问题
批评人士指出,即使是完美的数据也可能误导 AI 模型。细胞在不同组织类型、疾病状态和患者人口统计特征方面存在差异;在一种环境下获取的数据集可能无法推广到其他环境。生成和整理大规模、高质量数据集的成本可能超过训练模型的费用,这为规模较小的公司带来了扩展性方面的疑问。
监管机构也至关重要。声称能够模拟人类生物学的预测性 AI 最终必须经过临床结果的验证,这增加了审查层级。如果行业过度依赖计算机模拟(in-silico)预测而缺乏充分的现实世界测试,那么当极具前景的候选药物在临床试验中失败时,可能会面临挫折。
后续关注重点
未来几个月将揭示 GSK 与 Relation 的合作能否按承诺的规模提供可用的数据。关键指标包括:
- 发布其他研究人员可以访问(即使是在受限条件下)的基准数据集
- 在留出测试集(held-out test set)上表现明显优于传统筛选方法的早期 AI 模型
- 来自其他制药巨头的后续投资,这标志着市场对该数据方法可复制性的信心
如果此次合作能在命中率或周期时间方面带来实质性的改进,可能会引发一波类似的交易浪潮,重塑行业分配研发资金的方式。相反,如果数据被证明噪声太大或整合成本过高,企业可能会回归到将 AI 与传统高通量筛选相结合的混合方法。
核心观点
GSK 对高保真细胞数据的 1.1 亿美元押注标志着一次决定性的转型:在 AI 药物研发领域,最决定性的优势将日益取决于用于训练模型的生物信号的质量和排他性,而非算法本身的规模。
