可穿戴模型也有扩展定律:与 LLM 扩展定律的异同
Google 首次为可穿戴传感器数据建立扩展定律,形式与 LLM 类似但在数据规模、饱和点、经济性上存在关键差异。
LLM 的强大在很大程度上来自一个简洁的经验规律:验证损失会随模型规模、数据规模与训练算力可预测地下降。这套「扩展定律」的形式不仅是 AI 经济学的底盘,也决定了前沿实验室必须投入九位数美元来训练下一代模型。那么同样一套规律是否适用于非语言的基础模型?例如基于可穿戴传感器信号训练的生理数据模型?最新研究给出的答案是肯定的,但形式并不完全相同。
Google 的可穿戴模型扩展定律
Google 的论文《Scaling Wearable Foundation Models》(LSM)是学界首次为来自可穿戴设备的生理传感器数据建立扩展定律。研究人员测试了 2M、7M、110M、328M 四档参数量的模型,将训练数据从几千小时一路扩展到 4000 万小时,跨多个数量级验证了损失随算力下降的幂律关系。
其形式与 LLM 的扩展定律相似:L = aCᵇ + c,其中 C 是算力、b 是幂律指数、c 是不可消除的损失下限。模型规模与数据量在每个生成式任务(随机插值、时间插值、传感器缺失值补全、预测)上都带来了可衡量的性能提升。下游微调后,插值与预测任务相对基线提升 16–23%,活动识别任务提升 29%。
与 LLM 扩展定律的异同
LLM 的扩展定律最早由 Kaplan 等人于 2020 年提出,并在 2022 年的 Chinchilla 论文中被精细化:固定算力下,参数与 token 应同比例扩展,大约 20 token / 参数。Chinchilla 用 70B 参数、1.4T token 训练,击败了数据不足的更大模型。
两者最重要的差异在于饱和点:LSM 的收益在约 1000 万小时数据、约 1 亿参数处就开始趋于平坦,而 LLM 在万亿 token 规模上仍未见明显饱和。换言之,L 公式中的不可消除项 c 形式上两者都有,但实践中非语言模型更早触顶。
附带一提,作者团队用 4 人小组在与 Google、Apple 同等量级的数据上训练了 JEPA 风格的可穿戴模型 JETS。相比之下,新成立一家 LLM 基础模型公司需要数十亿美元,而非语言领域可能仍为小型团队留有空间。
未解之问:数据墙、市场结构与潜在空间
这一差异带来几个值得思考的问题:
- 数据墙:LLM 正逼近「数据墙」——高质量公共文本库存接近耗尽,合成数据只是权宜之计;生理数据则相反,每块手表每年被动产生约 8760 小时信号,约束反而来自标注、算力与数据清洗。如果能通过架构创新把 c 压到 0,扩展定律的天花板还可能很高。
- 市场结构:T. Rowe Price 指出「AI 资本开支的经济学最终建立在扩展定律之上」。如果非语言模型的扩展定律形态不同,竞争格局是否也会不同,是否会出现资本更轻、玩家更分散的市场?
- 同一潜在空间?CLIP 等工作已将视觉对齐到 LLM 的潜在空间,未来所有模型是否会收敛到同一潜在空间,还是生理等模态会保留语言难以表达的细微区分?这些开放问题值得长期关注。
(本文为原博客的要点整理与编译,扩展定律的具体公式与常数已并入正文表格叙述。)
