Google 的 SensorFM:面向通用健康智能的基础模型
Google Research 发布了 SensorFM,这是一款开创性的基础模型,旨在将碎片化的可穿戴传感器数据转化为统一的健康智能层。通过利用海量数据集,该模型超越了单一用途的追踪,能够对人体生理和行为提供全面的理解。
超越孤立的可穿戴指标
目前的可穿戴技术通常依赖于“孤立”的方法:一种算法检测睡眠阶段,另一种评估心血管风险,第三种则监测压力。这种碎片化的架构效率低下,难以提供用户健康的整体视图。
SensorFM 旨在用共享的 AI 基础来取代这些互不相连的模型。它旨在处理连续的、通常带有“间隙”或不完整的传感器数据,以回答广泛的健康问题。这种转变使得创建具有用户生理状态深度上下文感知能力的个性化 AI 健康助手成为可能。
海量规模与多模态数据集成
SensorFM 预训练的规模在可穿戴领域是前所未有的。Google 研究人员利用了来自 100 多个国家、500 万名 Fitbit 和 Pixel Watch 用户采集的超过一万亿分钟的多模态传感器数据。该数据集代表了此类模型训练有史以来规模最大、多样性最丰富的可穿戴数据集合。
该模型处理源自五种核心传感器类型的 34 个不同特征:
- 光学心率监测 (PPG): 追踪心率和心率变异性。
- 加速度: 监测身体活动和运动。
- 皮肤电导率: 测量生理反应。
- 皮肤温度: 追踪热量变化。
- 气压高度: 感知海拔变化。
为了处理可穿戴数据固有的“噪声”问题,SensorFM 使用了一种称为“自适应与继承掩码”(Adaptive and Inherited Masking, AIM)的技术。这使得模型能够区分真正缺失的数据点与训练期间人工掩码的数据点,从而使其能够重建并理解不完整的数据流。
在 35 项健康任务中表现卓越
在针对 35 项不同预测任务(涵盖心理健康、心血管健康、代谢标志物和睡眠)的严格测试中,SensorFM 展示了卓越的多功能性。在针对近 14,000 名参与者的独立数据集进行测试时,基于 SensorFM 表征构建的简单特定任务模型在 35 个类别中的 34 个类别中都优于传统的监督基准模型。
此外,该模型被证明具有极高的“标签效率”。由于它在预训练期间已经学习了人体生理的基本模式,因此在适应新的特定任务时,所需的标注样本显著减少。这种能力对于监测焦虑或抑郁等复杂且具有高度个体差异的特征尤为重要。
赋能下一代 AI 健康智能体
SensorFM 最重要的意义或许在于它与 Gemini 等大语言模型 (LLMs) 的集成。在实验设置中,SensorFM 为 AI 健康智能体提供生理上下文,随后由智能体生成健康摘要供临床医生审阅。
结果令人瞩目:通过 SensorFM 预测增强后的摘要在五个关键维度(上下文、个性化、可解释性、相关性和安全性)上的得分显著高于基准摘要。值得注意的是,使用 SensorFM 预测的 AI 表现与使用实际临床健康数据的表现统计学上相当,这表明基础模型很快就能为个性化数字健康指导提供高保真度的上下文。
核心要点
- 统一智能: SensorFM 用一个能够处理 35 种不同健康和行为任务的单一基础模型,取代了碎片化、单一用途的健康算法。
- 无与伦比的规模: 该模型在来自 500 万用户的万亿分钟多模态数据上进行了预训练,使其成为同类中规模最大的数据集。
- 增强的 AI 上下文: 通过将生理洞察输入 LLMs,SensorFM 能够实现高度个性化且具有临床相关性的健康摘要和数字助手。
