研究人员表明,线性可扩展的长上下文 Transformer 可以在蛋白质序列上训练掩码语言模型,而不会出现令标准 Transformer 瘫痪的内存爆炸问题。通过将内存成本从平方级转变为线性级,该方法让科学家能够处理比以往更长的蛋白质序列,这一进步有望加速药物研发和生物技术研究。

为什么标准 Transformer 会遇到瓶颈

蛋白质数据库中的序列往往长达数千个氨基酸。传统的 Transformer 模型会计算每对位置之间的注意力,这一过程随序列长度的平方而增长。随着序列变长,内存使用量会急剧飙升,迫使从业者不得不截断蛋白质或将其拆分为片段。上下文的丢失阻碍了模型学习跨越长链部分的结构基序(structural motifs)的能力。

线性规模的突破

这种新方法用一种内存随序列长度线性增长的设计取代了全自注意力机制。在实践中,该模型可以一次性处理整个蛋白质,从而保留对折叠和功能至关重要的长程相互作用。由于该算法所需的内存资源大大减少,在大规模蛋白质语料库上进行训练变得更便宜、更快速,从而为更丰富的掩码语言模型(MLM)目标打开了大门,即对整个链上的氨基酸进行掩码并进行预测。

这对生物学意味着什么

更长、更连续的蛋白质表示提高了模型对三维结构、活性位点和进化模式的理解能力。研究人员现在可以在大规模、未经整理的序列集合上进行预训练,并针对特定任务(如突变效应预测或抗体设计)进行微调。计算负载的降低也降低了小型实验室在普通硬件上运行最先进(state-of-the-art)模型的门槛。

注意事项与悬而未决的问题

线性规模的注意力机制通常依赖于近似方法——如滑动窗口、低秩分解或稀疏模式——这可能会忽略远距离残基之间微妙的相互作用。早期实验表明,在内存节省和预测准确性之间存在一定的权衡,尤其是在需要精确长程耦合的任务上。新架构还增加了实现复杂度,在稳健的库出现之前,这可能会减缓其普及速度。

后续关注点

业界将密切关注基准测试结果,通过标准数据集比较线性规模 Transformer 的蛋白质 MLM 性能与传统模型的差异。该技术与现有生物信息学流水线的集成以及开源版本的发布,将决定其传播速度。如果准确性差距缩小,该方法可能会成为大规模蛋白质语言建模的默认选择,从而重塑计算生物学解决蛋白质折叠问题的方式。

核心观点: 通过将内存需求从平方级大幅削减至线性级,长上下文 Transformer 使全长蛋白质序列在掩码语言建模中变得可行,在控制计算成本的同时,有望提供更丰富的生物学见解。