从文本机器人到视频医生

大语言模型 (LLMs) 一直擅长从文本中提取医学事实,但要赋予它们良好的医患沟通能力却被证明并非易事。传统的 AI 助手在静态聊天窗口中回答问题;它们无法读取患者的面部表情,也无法随着对话的展开而调整语气。AMIE (Video) 试图通过将交互转移到实时视频链接上来弥补这一差距,在这种模式下,AI 必须跟上节奏、提出后续问题并对视觉线索做出反应。

从文本转向视频不仅仅是 UI 的微调。它迫使模型处理不间断的视听数据流,模仿真实问诊的节奏,并在不暂停的情况下处理多个对话线程。在实践中,这种能力可以让 AI 担任一线分诊代理,处理常规问题,从而让医生腾出精力处理复杂病例。

测试是如何进行的

Google 构建了一个测试框架,招募了 15 名经过培训的演员来扮演具有复杂症状的患者。演员们在涵盖五个器官系统的临床场景中进行即兴表演:

  • 心肺系统症状
  • 腹部问题
  • 头-眼-耳-鼻-喉 (HEENT) 问题
  • 神经系统和精神疾病
  • 肌肉骨骼疾病

随后,独立的临床评估人员从诊断准确性、提问策略和共情沟通能力三个方面对 AI 进行评分。评分结果显示,AMIE (Video) 的表现与处理相同病例的全科医生 (primary-care physicians) 相当。

为什么这一结果意义重大

如果 AI 能够可靠地与患者演员交流并得出与人类临床医生相同的结论,那么在医疗劳动力短缺的情况下,医疗系统可以部署这种低成本、可扩展的切入点。具备视频功能的 AI 可以进行非紧急情况的分诊、安排随访或提供初步建议——而无需承担实体诊室的运营成本。对于偏远或医疗资源匮乏地区的患者来说,虚拟的“一线”临床医生可以显著缩短等待时间。

警示的一面

该研究仍处于模拟阶段。无论演员多么专业,都无法复制真实患者的不可预测性,因为真实患者在问诊时会带来个人病史、合并症和情绪波动。此外,评估依赖于人类评分者对 AI 表现的解读;任何评分系统中都可能存在主观偏见。

监管审批仍是另一大障碍。目前的医疗器械框架要求在批准诊断或分诊功能之前,必须提供真实世界应用中的证据。如果没有这些数据,任何部署都只能停留在研究环境或受到严格监督的试点阶段。责任归属问题也随之而来:如果 AI 误读了视觉线索并推荐了错误的治疗方案,谁该承担责任——是开发者、托管平台,还是监督医生?

下一步计划

Google 已发出信号,下一阶段将涉及真实患者的试验,并配备真实的健康记录和多样化的统计学背景。这些研究不仅需要证明在临床推理方面具有同等水平,还需要证明其安全性、数据隐私以及在不同人群中的公平表现。

总结

AMIE (Video) 表明,由大语言模型驱动的 AI 可以在模拟视频问诊中独当一面,在广泛的疾病谱中获得与全科医生相同的临床评分。这一突破为 AI 驱动的一线护理开启了大门,但技术能否从实验室走向临床,将取决于真实患者试验、监管审批以及明确的责任框架。