桃子桃子快讯
返回首页
研究论文

灵初智能 Psi-R2.5:以强配对数据与上下文学习,重做机器人学习数据

灵初智能发布 Psi-R2.5,逆向用 Psi-W0 世界模型从机器人真实操作生成人手示范,构建强配对数据,并探索视频作…

2026.09.24 · 周四3 分钟阅读

灵初智能近日对其机器人基础模型 Psi-R2.5 进行了阶段性技术披露,重点不在参数规模,而在数据环节的改进:把十万小时级的人类操作数据与机器人执行轨迹做更严格的配对,从而让人手示范真正「可被机器人用得上」。这一动作指向具身智能落地的老问题——预训练看过再多视频,到了客户现场,机器人依然要从头学。

从弱配对到强配对:先有机器人动作,再造对照人手

过去常见做法是让人类先示范,再用策略优化把人手轨迹「翻译」成机械臂可执行的动作。这一流程涉及世界模型、轨迹推演和强化学习协同,链路较重,且由于人手和机械手在关节结构、接触摩擦上的差异,逐帧对齐始终困难。

灵初此次提出的是一条逆向思路:从真实的机器人操作图像与动作出发,用世界模型 Psi-W0 反向生成对应的人手操作视频,得到「场景基本一致、动作时序逐帧对应、机器人侧可成功回放」的强配对数据,再用于训练一个端到端转换器。转换器不是策略模型,而是「带动作输出的视频编辑模型」,输入人手操作、输出匹配的机器人图像与动作。灵初设置的两种验证口径——直接在真机上回放,以及将转换数据用于后训练——把评价标准从「视频像不像」切换到「数据能不能撑住实际任务」。

值得注意的是,灵初也在数据层面减少同一任务的重复堆叠、增加任务多样性,并通过自动标注管线把任务拆解到原子动作后再标注审核,意在让数据价值不再仅以小时计量。

视频作为提示:上下文学习的另一种打开方式

高质量的人机配对数据并不只服务于训练。在 Psi-R2.5 中,灵初进一步探索了上下文学习(In-Context Learning,ICL):一段人类示范既可以进入训练集,也可以作为当下任务的提示交给已训练好的模型,不必每次都为新任务跑一遍训练流。

这与 Psi-R2.5 的双层架构相衔接:上层模型负责把一段长程指令拆成子任务,下层模型结合子任务与当前观测输出具体操作轨迹。灵初强调,「不用重新训练」不等于模型此前没有训练,也不等于随手拍一段视频就能让机器人完成所有工作,目前展示的是特定任务中的 ICL 能力,更多细节尚待公布。

后训练仍不可省:手机盒装配的成功率样本

预训练目标被灵初明确界定为「让后训练需要的数据更少」。在手机盒装配这一多步骤、高精细度任务上,结合人工参与与强化学习的后训练框架经过几轮迭代后,任务成功率达到约 99%,耗时 1-2 个工作日。到了客户现场仍会收集失败数据用于下一轮改进,该方案已用于实际客户环境中处理复杂情况。

整体来看,Psi-R2.5 的更新更像是工程与方法层面的补课:把示范、提示、后训练三类数据消费方式统一在同一套强配对数据基座上,减少机器人适应新场景所需的额外投入。至于这些方法在更大规模、更多任务上的泛化表现,仍有待更系统地公开验证。

信源