桃子桃子快讯
返回首页
行业动态

讯飞成立爻方智能,押注机器人大脑本体认知

科大讯飞注资 3 亿元成立爻方智能,由科学家潘嘉带队,发布 iFLYTEK-Embodied-Omni 技术报告,主张机…

2026.07.23 · 周四4 分钟阅读

科大讯飞在 WAIC 2026 开幕前悄悄注册了一家新公司——安徽爻方智能科技有限公司,注册资本 3 亿元,由科大讯飞杰出科学家、具身智能前沿科学带头人潘嘉带队,专攻机器人大脑。同期,爻方联合中国科学技术大学、聆动通用机器人发布技术报告 iFLYTEK-Embodied-Omni,提出一个核心判断:当下主流的机器人大脑,造法就不对。

行业共识:瓶颈在大脑

具身智能展区里机器人动作慢,并非单纯技术不够,而是大脑还没跨过实用门槛。换一个环境或物体,动作就开始变形,所以大量展示只能停留在精心布置的 Demo 层面。交互方式从离身符号跃迁到具身交互,机器人需要理解物理规律并推演后果,而承担这一跃迁的只能是大脑。身体的关节、电机、灵巧手供应链日趋成熟,但「让身体知道该做什么、会发生什么」的大脑尚未真正造好。

围绕大脑怎么造,行业分歧集中在两条主线:架构选择与数据来源。

架构之争:VLA 不是终局

VLA 直接将视觉与语言映射为动作,见效快、门槛低,但短板也日益明显:它更像一个「即时反应系统」,只管现在怎么做,不管做完之后世界会怎样。雨天路滑、踩刹车仍会打滑——只对当下反应、不对后果推演,正是 VLA 的根本局限。

世界模型接棒火起来,逻辑是「先预测未来画面,再从画面推出动作」,让机器人学会「先想后动」。英伟达把这条路的招牌「Physical AI」喊成年度关键词,行业开始从 VLA 集体迁向 WAM。

但在爻方看来,世界模型仍有两个坑:

  • 误差累积:预测与动作串行执行,预测一旦出错,误差会直接传导进动作,任务越长滚得越大,即「可执行性鸿沟」。
  • 缺乏本体认知:模型能预判球的落点,但不知道自己的身体能不能扣杀到那个位置。画面算得再准,不知道这具身体做不做得到,动作照样落空。

爻方正是要给世界模型补上「本体认知」这味药引子。

iFLYTEK-Embodied-Omni 的解法

爻方把架构做成双核:在 VLM(理解规划)之外,引入 VGM(视频生成模型)负责预测未来视觉状态,让机器人在动手前先在脑子里预演后果。AGM(动作生成)作为低层小脑,把规划翻译成可执行动作。三者通过共享的多模态自注意力机制实时交互,把「大脑想完、再交给小脑做」的串行架构改成实时协同。

「本体认知」落地方式是把逆运动学做成训练任务:不直接告诉模型手该怎么动,只给它要到达的终点,逼它自己补全中间每一步。预测未来是学会看世界,逆运动学是学会看自己。

数据配比也反着来,并不把预算全砸在真机数据上:

  • 带动作标注的机器人轨迹:26.88%
  • 无动作的人类操作视频:18.95%
  • 通用 VQA 数据:5.06%
  • 空间推理、感知与任务规划:49.11%

将近一半的训练数据是 2D/3D 轨迹、定位、空间指向、任务规划等「具身大脑数据」,不需要真机就能结构化地喂出模型的「空间感」与「规划力」。

训练分四步走:VLM、VGM、AGM 先各自开小灶,最后联合微调对齐。成绩单如下:

  • LIBERO-Plus 零样本基准(七种环境扰动):平均成功率 89.6%,超过当时最强的 VLA 与 WAM 方法。
  • RoboTwin 2.0 双臂协同基准:标准与随机环境分别 93.68% 和 93.16%,几乎不受干扰。
  • 长时序任务(连做七步):随机环境成绩反而更高,环境越乱双核大脑越显本事。

真机层面,爻方出底座,讯飞控股子公司安徽聆动通用负责工业具身大脑-小脑-本体全链路,真机已能落地干活。

讯飞这盘棋

爻方是新公司,但底子不是新的。讯飞过去十几年做的事,恰好是把一项技术逼过实用门槛:车载语音在方言和噪音里不出错、家电听错一次指令用户可能再也不打开。潘嘉直言,正是被客户一年年提更高的要求打磨,才攒下让技术真正落地的工程化能力。从语音到多模态再到具身大脑,换的是模态,不变的是那套把 AI 逼到能用的功夫。

AI 这几年最大的变化,是交互从屏幕里挪到屏幕外——对讯飞而言,这个转向的时机恰到好处。整盘棋的分工也由此清晰:讯飞出 AI 底座与产业资源,爻方专攻机器人大脑,聆动通用兼具本体与硬件,负责工业具身全链路。方向已经摆出,剩下的就是时间问题。

信源