OpenAI 在 ChatGPT 中推出 Health 功能:免费与付费建议之间的鸿沟
OpenAI 正式通过面向 18 岁及以上美国用户的“Health in ChatGPT”功能进入医疗咨询领域。虽然该功能提供了与个人健康数据前所未有的集成,但它也引入了一个备受争议的双层体系,即医疗见解的质量直接取决于您的订阅状态。
质量差距:GPT-5.5 Instant 对比 GPT-5.6 Sol
OpenAI 新推出的健康服务的核心在于模型能力之间的显著差异。免费用户使用的是 GPT-5.5 Instant,该模型针对速度进行了优化,但临床准确性较低。相比之下,付费订阅用户可以访问 GPT-5.6 Sol,这是专门为高水平推理和健康基准测试设计的新旗舰模型。
这种性能差距可以通过 HealthBench Professional 测试进行量化。在该基准测试中,GPT-5.6 Sol 在所有类别中的表现都优于医生编写的答案以及较旧的 GPT-4o 和 GPT-5.5 Instant 模型。最值得注意的是,该模型在以下方面表现出巨大的优势:
- 完整性 (Completeness): Sol 为 88.0%,Instant 为 53.2%。
- 健康决策帮助程度 (Health Decision Helpfulness): Sol 为 83.0%,Instant 为 50.8%。
虽然 OpenAI 可能会出于经济原因为这种分层访问辩护,但这创造了一种现实:最准确、最全面的医疗分析被锁在付费墙之后。
深度集成与数据隐私
除了简单的文本查询,“Health in ChatGPT”还允许用户同步 Apple Health、医疗记录和各种健康应用。这使得 AI 能够分析化验结果、监测睡眠模式,并帮助用户为即将到来的医生预约做准备。
为了应对这些信息的敏感性,OpenAI 承诺执行严格的隐私政策:连接的健康数据不会用于模型训练或定向广告。这是建立信任的关键举措,尤其是自一月份以来,与健康相关的查询量已从 2.3 亿激增至每周超过 3 亿次。
AI 在临床环境中的局限性
尽管基准测试得分令人印象深刻,但科技行业仍保持谨慎。AI 在医疗领域应用的一个主要障碍是“过度自信”问题。在 RadLE 2.0 放射学基准测试中,测试的 16 个 AI 模型中没有一个能达到人类放射科医生的水平,这主要是因为聊天机器人往往以极高的信心提供错误的发现,而不是承认不确定性。
此外,AI 缺乏捕捉非语言暗示的能力,也无法利用人类医生在面对面检查时所提供的多年临床直觉。OpenAI 通过在功能开发过程中邀请 260 多名医生来缓解这一问题,但他们仍保持着明确的免责声明:ChatGPT 不能替代专业的医疗建议。
监管障碍与全球可用性
虽然美国用户可以使用该功能,但该功能在欧洲经济区、瑞士和英国仍无法使用。这主要是由于 GDPR 严格的数据隐私指令,以及根据 EU AI Act,此类工具可能被归类为“高风险”。随着 AI 越来越接近临床一线,技术能力与监管合规之间的紧张关系只会进一步加剧。
核心要点
- 分层智能: 付费用户通过 GPT-5.6 Sol 获得卓越的医疗推理能力,其在 HealthBench Professional 上的表现显著优于免费的 GPT-5.5 Instant 模型。
- 数据同步: 该功能允许与 Apple Health 和医疗记录进行深度集成,尽管 OpenAI 承诺这些数据不会用于训练。
- 临床局限性: 尽管基准测试得分很高,但 AI 仍面临“幻觉式自信”的问题,并且缺乏人类医生那种细致入微的体格检查能力。
