万亿分钟数据预训练:SensorFM如何重塑可穿戴健康数据底层逻辑
可穿戴数据困境与通用模型的破局
在可穿戴设备爆发式增长的今天,我们正陷入一种数据丰富但信息匮乏的悖论。智能手表、健康监测手环以及各类植入式传感器每时每刻都在产生海量的原始数据:心率变异性、皮肤电活动、加速度计信号、皮肤温度以及血氧饱和度等。然而,这些多模态数据面临着三大核心挑战:一是数据缺失问题,由于设备佩戴不当、电池耗尽或信号干扰,真实世界中的数据往往是不完整的;二是标注稀缺,医疗级标签获取成本高昂,导致监督学习模型难以大规模落地;三是异构性,不同厂商、不同型号的设备产生的信号特征差异巨大,使得单一模型难以通用。
传统的解决思路通常是将传感器信号转化为特定的统计特征,然后针对每个健康终点(如糖尿病风险、睡眠分期)单独训练一个专用模型。这种“烟囱式”的开发模式不仅效率低下,且无法捕捉不同生理状态之间的潜在关联。Google Research近期推出的SensorFM,试图通过引入基础模型(Foundation Model)范式来重塑这一领域。它不再关注单一任务的局部优化,而是致力于从海量无标签数据中学习通用的生理表征,从而为多种健康预测任务提供一个统一的底层语义空间。
海量无标签数据的规模效应
SensorFM的基石在于其前所未有的数据规模。该模型基于500万参与者的数据,涵盖了超过1万亿分钟的多模态传感器记录。这一规模不仅超越了此前所有的可穿戴健康数据集,更关键在于其“无标签”的特性。传统深度学习依赖高质量的专家标注,而SensorFM采用自监督重建预训练策略,直接从原始信号中提取内在结构。
模型主要处理五种传感器模态:光电容积脉搏波(PPG)、加速度计、皮电活动(EDA)、皮肤温度以及高度计。在预训练阶段,系统并未试图预测具体的疾病标签,而是通过掩码自编码器框架,要求模型重建被掩码的传感器数据片段。这种机制迫使模型理解生理信号的时间序列依赖关系和跨模态相关性。例如,心率的变化往往伴随着皮肤电活动的细微波动,而活动量(加速度计)则直接影响心率和体温。通过最小化掩码区域的重建均方误差,模型隐式地学习了这些复杂的生理耦合机制。
数据与模型的联合扩展实验进一步验证了这一策略的有效性。研究团队从10万到1亿参数、从200万到20亿传感器小时的规模进行了系统性测试,发现预训练损失与下游性能呈近线性提升,且未出现饱和迹象。这意味着,只要数据量和模型参数量同步扩展,SensorFM的通用表征能力将持续增强。最大规模的SensorFM-B模型在35个下游任务中的33个上取得了最优性能,证明了规模效应在健康数据领域的重要性。
缺失感知:将噪声转化为信号
在真实世界中,数据缺失是不可避免的常态,而非例外。传统的数据处理方法通常采用均值插补或丢弃缺失记录,这不仅引入了偏差,更浪费了宝贵的上下文信息。SensorFM通过一项名为Adaptive and Inherited Masking(AIM)的创新机制,彻底重构了模型对缺失数据的处理方式。
AIM机制的核心思想是将真实设备产生的数据缺失与预训练过程中人为引入的人工掩码视为等价。模型在训练过程中,直接从不完整的记录中学习,无需预先进行数据清洗或插补。这使得SensorFM天生具备“缺失感知”能力。它不再将缺失视为需要消除的噪声,而是将其作为一种特殊的数据模式进行建模。
这种设计在实际应用中展现出惊人的鲁棒性。实验数据显示,即使在60分钟的传感器数据完全缺失的情况下,SensorFM在日步数预测任务上的精度仍能保持在99.7%。这是因为模型已经学会了如何利用剩余时段的多模态数据(如温度、心率的长期趋势)以及人口统计先验信息,来推断缺失时段的状态。这种对缺失数据的原生兼容性,极大地降低了下游任务部署前的数据预处理门槛,使模型能够直接应用于真实世界的嘈杂数据流中。
标签高效适应与自动化预测头
尽管预训练赋予了SensorFM强大的通用表征能力,但最终仍需将其映射到具体的健康预测任务上。传统的全监督学习需要大量标注数据,而医疗领域往往面临严重的标注稀缺问题。SensorFM通过线性探测评估证明了其高效适应能力:冻结预训练编码器,仅在其上训练轻量级线性头,即可在34/35个任务上超越人工特征工程的全监督基线。
更为突破性的进展在于“Agentic预测头”的设计。研究团队构建了一个基于多LLM Agent协作竞争的自动化系统。在这个系统中,多个LLM Agent扮演不同角色,迭代生成、测试并优化下游预测头的代码。它们在一个类似“课堂”的环境中相互竞争,探索超过3万个候选方案。这种自动化方法不仅摆脱了手动设计特征工程的人为局限,还通过LLM的逻辑推理能力,挖掘出人类专家可能忽略的非线性交互模式。
测试结果表明,在16/20个分类任务和12/15个回归任务中,由Agent自动生成的预测头性能超越了简单的线性探测。值得注意的是,Agent能力的强弱与搜索到的方案优劣呈正相关。这表明,随着基础大模型能力的提升,自动化特征工程的潜力将进一步释放。这种“预训练通用表征+自动化下游适配”的范式,为医疗AI的可扩展性提供了新路径。
从预测到代理:个人健康智能体的落地
SensorFM的终极目标不仅是提供预测结果,更是作为个人健康代理(Personal Health Agent)的Grounding工具。当前的LLM在健康咨询中常面临幻觉问题,缺乏对个体实时生理状态的具体感知。SensorFM通过将下游预测器作为工具嵌入LLM代理,显著提升了回答的上下文感知能力、个性化水平和安全性。
临床验证环节邀请了1860名临床医生对整合了SensorFM的个人健康代理进行评分。结果显示,在回答的相关性、安全性以及基于具体生理数据的准确性方面,集成SensorFM的代理显著优于仅依赖通用知识的LLM。例如,当用户询问“我最近睡眠质量下降是否会影响我的心血管风险”时,代理能够调用SensorFM提取的个性化睡眠特征和心血管风险指标,提供基于具体数据的定制化建议,而非通用的健康贴士。
这种整合解决了LLM在垂直领域的两个关键短板:一是对个体微小变化的敏感度不足,二是缺乏对生理信号因果关系的深层理解。SensorFM提供的通用生理表征,为LLM提供了一个坚实的事实锚点,使其能够在尊重生理规律的基础上进行推理和交互。
多域覆盖与临床意义
SensorFM覆盖的心血管、代谢、睡眠、心理健康、生活方式及人口统计六大类35个任务,体现了其广泛的临床适用性。在心血管健康方面,模型利用PPG和心率变异性特征,能够持续评估心律异常和血压趋势,实现早期预警。在代谢风险筛查中,通过组合睡眠、活动量和皮肤温度信号,模型能推断糖尿病和肥胖等风险指标。
在睡眠障碍分析中,多模态传感器融合使得精准识别睡眠阶段和呼吸中断模式成为可能,辅助睡眠呼吸暂停筛查。而在心理健康追踪领域,模型从心率变异性、皮电活动和活动模式中捕捉抑郁、焦虑等心理状态的微弱信号,支持长期的情绪监测。这些应用场景的共同点在于,它们都依赖于对多源异构数据的融合理解,而这正是SensorFM的核心优势所在。
此外,随着模型规模的增大,研究发现模型对人口统计特征的依赖逐渐降低。这表明,大模型已经隐式地学到了与生理状态直接相关的特质,而不是简单地依赖年龄、性别等静态标签进行推断。这种从相关性到因果性的逼近,是医疗AI走向临床可信的关键一步。
局限性与未来展望
尽管SensorFM在技术上取得了显著突破,但其应用仍处于技术预览阶段。目前,该模型主要作为学术研究参考,尚未开放直接部署接口。其庞大的参数量和数据处理需求,也对计算资源提出了极高要求。此外,虽然模型在预训练数据分布内表现优异,但在面对极其罕见的人群或新型传感器硬件时,其泛化能力仍需进一步验证。
隐私保护也是不容忽视的问题。虽然预训练使用无标签数据,但原始数据中仍包含敏感的生理信息。如何在享受数据规模红利的同时,确保用户隐私不被泄露,需要结合联邦学习、差分隐私等技术进一步探索。
未来,随着SensorFM架构的开放和生态系统的完善,我们有望看到更多基于通用生理表征的创新应用。从个性化的运动指导,到慢性病的远程管理,再到精神健康的数字化干预,SensorFM为代表的可穿戴健康基础模型,正在重新定义人机交互的健康维度。它不仅仅是一个预测工具,更是连接人类生理信号与数字智能的桥梁,为构建真正以个体为中心的健康服务体系奠定了技术基石。