桃子桃子快讯
返回首页
研究论文

诺因发布GLOW技术报告:机器人一次演示即可跨场景复用任务

诺因发布GLOW技术报告,提出统一多模态自回归架构,让机器人通过人类一次演示实现跨物体、跨环境、跨任务的技能复用。

2026.09.24 · 周四3 分钟阅读

诺因(Knowin)于9月24日发布面向通用具身智能的生成式学习架构 GLOW 技术报告,提出了一套将通用认知能力转化为物理行动的完整路径,核心是让机器人实现「一次演示即可学会」的跨场景任务复用能力。报告同时披露了 GLOW 在三项国际主流具身评测中的成绩。

技术架构概览

GLOW 架构由四个核心模块组成。KnowinGLOW 是统一的多模态自回归模型,将视觉理解、语义解析、空间推理、任务规划与动作生成整合在同一模型内,而非「视觉模块+动作模块」的拼接方案;理解与动作共享同一套表征体系。KnowinDream 是合成具身经验引擎,以完整交互经历为训练单元,通过 Home×Event×Future 的条件组织方式,在不同光照、材质、纹理、相机视角与机器人配置下生成多样化训练数据。KnowinWorld 负责基于当前状态推演不同候选动作的物理后果,评估碰撞风险、接触稳定性、路径可达性等约束,训练阶段可替代真机完成大量试错推演,运行阶段在动作执行前预判风险、排除无效路径。KnowinAgent(Harness)作为任务运行系统,持续管理执行节点、接收实时反馈,出现偏差时可就地修正,接近精细操作区域时自动切换为小幅微调模式。

「一教就会」的演示能力

报告通过四类家务场景展示了 GLOW 的演示学习能力:

  • 开盒收纳:机器人根据实时画面定位盒盖、物品与盒内区域,按人类操作逻辑完成开盖、放物、合盖整套动作;更换不同盒子和物品后仍能顺畅完成。
  • 浇水:人类教学使用黑色细嘴壶,执行时换成绿色浇水壶,机器人将抓握方式、对准角度、倾斜幅度等核心逻辑映射到新器具上。
  • 擦桌:人类沿心形轨迹擦拭,机器人复现同样的心形擦拭动作,能捕捉到「怎样擦」的个性化操作特征。
  • 调酒:面对多杯多步骤场景,机器人从人类操作中识别操作对象、倾倒关系与先后顺序,依次完成取杯、倾倒、回正、放回的连贯流程。

评测结果

报告披露了 GLOW 在三项评测中的成绩:

  • RoboDojo 仿真任务:在18项仿真任务中,GLOW 平均成功率为62.2%,平均得分71.1分,较 GPT-6(Robocurve)基线分别高出40个百分点和41.3分。
  • LIBERO-Pro 基准:在 Object、Goal、Spatial 六个扰动分项中,GLOW 独立运行的平均成功率为86.7%,较 GPT-6 Astra 的58.2%提升28.5个百分点,六项中五项领先,位列单策略模型第一,领先第二名 ASPIRE 15个百分点。
  • Embodied Arena 具身问答榜:KnowinBrain-1.5 以65.的综合得分位列20个参评模型第一,覆盖第一视角理解、时空定位、目标驱动规划、物理推理等多个维度。

路线与展望

报告认为,自回归架构正在成为模型架构的收敛方向,具身智能的竞争核心将转向数据与学习方式。诺因表示将持续推进 GLOW 的物理学习与泛化能力,以规模化物理经验训练模型,以统一架构协同认知与行动,以闭环执行适应环境变化,让机器人在变化的环境中自主执行长程任务。

信源