联邦政府很少匆忙采用未经测试的技术。特别是公共卫生部门,在工具接触患者记录或疫情数据之前,往往需要花费数年时间进行验证。因此,当美国卫生机构宣布将对 OpenAI 和 Anthropic 构建的生成式 AI 系统进行实地测试时,信号非常明确:大语言模型已从消费级实验转向了严肃的机构级候选方案。
PULSE 究竟在做什么
这项新计划被称为公共卫生用例与学习扩展引擎 (Public Health Use Case and Learning Scaling Engine),简称 PULSE。它是一个测试框架,而非产品发布。PULSE 并不是简单地将聊天机器人投入卫生部门的电子邮件系统中并寄希望于好结果,而是像公共卫生部门对待新疫苗一样对待生成式 AI。它创造了受控条件,让州、地方、部落和领地机构可以在严格观察副作用的同时试用这些工具。
该计划汇集了四个不同的合作伙伴。健康人工智能联盟 (CHAI) 提供针对医疗保健的治理和安全标准。OpenAI 和 Anthropic 提供前沿语言模型。Accenture 则提供将这些系统连接到现有政府基础设施所需的集成专业知识,而这些基础设施通常运行在数十年前的数据库和严格的采购规则之上。
PULSE 并不是在询问 AI 是否能写邮件或总结会议记录,而是在询问这些模型是否能可靠地协助三项核心任务:流行病学监测、资源配置和公共卫生沟通。这些听起来可能很抽象,但它们共同描述了运行卫生部门的日常负担。监测意味着筛选实验室报告、住院记录和学校缺勤数据,以便在疫情爆发前发现苗头。资源配置意味着在严重的流感季节,实时决定将有限的疫苗剂量或抗病毒药物发送到哪里。公共卫生沟通意味着将复杂的联邦指南转化为数十个不同社区都能理解的通俗语言,而且通常是在食源性疾病调查争分夺秒的关键时刻。如果 AI 能够在不增加额外工作量或引入错误的情况下协助完成其中任何一项任务,那么效率的提升将是巨大的。
为什么十个管辖区改变了一切
该计划将在选自各州、地方、部落民族和美国领地的十个管辖区开展试验。这种刻意的分布正是其核心意义所在。一个位于人口密集地区、拥有数百名流行病学家并运行光纤网络的州卫生部门,所面临的限制与一个依靠极简人员配置和间歇性网络连接来追踪登革热的领地机构完全不同。
部落的参与具有特殊的意义。部落卫生机构历来面临资金不足和严重的数据主权问题。通过纳入部落管辖区,PULSE 承认任何声称具有国家实用性的 AI 工具都必须能够处理特殊人群、尊重独特的治理结构,并在具有独特环境和社会健康负担的背景下运行。如果一个模型无法在这些条件下表现出色,它就不配获得联邦认可。
领地机构增加了另一项必要的压力测试。美国领地的公共卫生官员管理的疾病模式和供应链与本土有着显著差异。如果一个 AI 助手假设互联网连接是完美的,或者依赖于大型城市医院常见的 ICD-10 编码习惯,那么当飓风摧毁基础设施时,它将彻底失效。十个管辖区的设计迫使该计划收集硬性证据,以证明这些模型是能够适应不完美的环境,还是会分崩离析。
从聊天机器人到任务关键型基础设施
在过去的两年里,围绕大语言模型的公众讨论一直集中在编程捷径、营销文案和图像生成上。PULSE 则刻意将焦点转向任务关键型基础设施。当卫生部门使用 AI 模型来解析传染病报告时,一个错误不再是某种古怪的“幻觉”,而是一个潜在的公共安全失败。
这一现实使得此次试点成为解决三个持续性技术问题的先例:准确性、幻觉缓解以及数据隐私。在这种语境下,“幻觉”可能意味着模型捏造药物相互作用、虚构不存在的疫情暴发集群,或误报报告法规。PULSE 的结构旨在衡量这些错误发生的频率,以及技术护栏是否能在错误传达给决策者之前将其拦截。
隐私问题同样重要。公共卫生机构处理受 HIPAA 及其他州级法规保护的健康信息。任何接触此类数据的 AI 系统都必须明确展示其存储的内容、训练数据的流向,以及谁可以在后续访问输出结果。CHAI 的参与表明,这些测试不仅将考验 OpenAI 和 Anthropic 模型的原始智能,还将测试它们在严格的机构治理框架内运行并留下清晰审计追踪的能力。
开发者与监管者的蓝图
对于构建医疗 AI 的开发者和初创企业创始人来说,PULSE 提供了一些市场迫切需要的东西:一个可见的、由政府支持的标准。初创公司在向公共卫生系统销售产品时往往面临困难,因为采购官员缺乏评估 AI 安全性的通用清单。如果 PULSE 能为衡量行政卫生环境中的偏见、准确性和隐私提供透明的标准,这些标准可能会迅速成为全国供应商的默认基准。
该计划还暗示了大语言模型可能需要如何演进以服务于政府。消费级聊天机器人针对流畅、有帮助的回答进行了优化。而政府卫生工作则需要引用来源、校准后的不确定性以及机构记忆。一个为流行病学护士提供建议的模型,必须能够说出“证据尚不明确”,而不是捏造一个自信的答案。观察 OpenAI 和 Anthropic 如何针对这种环境调整其提示策略和检索系统,将揭示底层技术是否真的能够满足行政机构的预期。
如果试点成功,其技术和治理方面的见解可能会影响到美国国界之外。全球各地的公共卫生部门都面临着类似的数据负担和人员短缺问题。一个在流行病学和健康传播领域部署 LLM 的经过验证的框架,可能会成为一个国际参考点,就像 FHIR 标准之于电子健康档案一样。
核心启示
PULSE 并不承诺人工智能将解决公共卫生问题。它承认了处理健康信息的旧方式过于缓慢且过于耗费人力,并且任何替代方案在进行全国推广之前,都必须在现实且多样的条件下得到验证。通过将 CHAI 的安全框架与 OpenAI 和 Anthropic 的前沿模型相结合,并迫使这些工具在十个截然不同的司法管辖区证明自己,该计划以应有的怀疑态度对待生成式 AI,同时也为其提供了所需的测试场。对于卫生官员、开发者及其服务的社区而言,这种平衡正是负责任的采用所应有的样子。
