研究人员引入了 ReBA 路由,这是一种几何引导的 Token 路由方案,旨在保持多模态混合专家 (MoE) 模型中视觉 Token 和文本 Token 的平衡。早期实验表明,当图像分辨率大幅提高时,该方法能够稳定训练,而传统的路由方案在这种场景下通常会表现不佳。
为什么视觉语言模型需要新的路由方案
视觉语言模型摄取两种截然不同的数据流:数量可能达数百个的图像补丁 (image patches) 和少量的单词 Token。标准的 MoE 路由将每个 Token 都视为同类数据,导致图像补丁涌向少数几个专家,而文本 Token 则处于闲置状态。现有工作试图通过辅助损失 (auxiliary loss) 来平衡负载,但这种方法仅能使分配给每个专家的 Token 总数相等。由于庞大的图像负载可能会抵消极小的文本负载,这种损失函数会掩盖真实的失衡情况,直到性能下降。
ReBA 如何改变路由规则
ReBA 在路由过程中引入了模态边界 (modality boundary)。它不再使用混合了补丁和单词的单一池,而是构建了遵循图像 Token 几何布局的独立路径。每个图像实例都会获得相同的总体权重,从而防止单个专家成为瓶颈。在图像补丁空间排列的引导下,即使输入分辨率发生变化,系统也能保持稳定。
作者报告的主要优势包括:
- 强制视觉 Token 与语言 Token 之间的清晰划分。
- 保证 Batch 中每张图像的贡献相等。
- 防止专家被单一模态淹没。
- 在图像补丁数量增加时保持平衡。
在多个基准测试设置中,无论 Batch 中增加了多少补丁,ReBA 都能保持专家池的均匀利用,表现优于传统的辅助损失方法。
局限性与开放性问题
该研究未提供关于速度或内存消耗的具体数据,因此我们尚不清楚额外的路由逻辑是否会带来隐藏成本。作者还假设来自单张图像的所有补丁都作为一个整体运行;这一假设在混合了不同分辨率图像或包含部分掩码区域 (masked regions) 的 Batch 中可能会失效。
后续关注点
- 性能与效率的权衡:未来的工作需要量化 ReBA 带来的任何额外开销。
- 混合 Batch 行为:在结合了高分辨率和低分辨率图像的 Batch 上进行测试,将揭示模态边界是否依然有效。
- 在大规模流水线中的应用:如果路由稳定性能够转化为更好的下游任务表现(例如图像描述或视觉问答),开发者可能会使用 ReBA 取代标准的辅助损失。
如果你正在构建视觉语言 MoE 流水线,随着图像分辨率的提高,将默认路由更换为 ReBA 可能会为你提供更均匀的专家使用模式。更换后请密切关注 Token 分布指标;分布越平坦,说明模态边界发挥了作用。
