桃子桃子快讯
返回首页
研究论文

Transformer Transformer:用扩散 Transformer 协同设计机器人

斯坦福团队提出统一模型,给定运动演示即可生成完整机器人本体,在抛布任务中跟踪误差降低 73%。

2026.07.29 · 周三5 分钟阅读

斯坦福大学研究团队近期公布了一项名为「Transformer Transformer」的研究工作。核心成员包括 Huy Ha、Karen Liu 和 Shuran Song。该模型的设计思路是:只要给一段操作演示,模型就能自动生成一个完整的机器人——包括每一个连杆、关节、电机和惯量参数——针对该动作进行形态优化。

研究背景:机器人形态与任务能力

机器人能完成哪些任务,很大程度上由其本体形态决定。研究者指出,过去的工作大多致力于让机器人更「聪明」——更大的数据集、更好的算法、更强的策略网络——但如果机器人形态本身不合理,再好的策略也可能受限于硬件。

论文将问题具体化为:给定目标末端运动和奖励函数,生成一个完整的机器人本体形态——包括几何、运动学、惯量、电机,以及相应的控制器。作者将这一任务命名为「运动条件下的机器人协同设计」(motion-conditioned robot co-design)。

核心方法:三步一模型

整个框架被重构为三个步骤:演示、生成、验证。用户提供目标末端运动(可以来自人类演示,例如通过 UMI 捕获),模型生成优化后的本体形态,再由同一个模型直接控制该机器人跟踪动作。同一网络承担三种角色:生成器、评估器与跨形态控制器。

论文包含三个核心贡献:

  • 统一的机器人表征 RoboTokens;
  • 统一的架构 Transformer Transformer;
  • 统一的训练目标 Dynamics Self-Guidance。

RoboTokens:统一的机器人表征

研究者将每一种机器人都表示为类型化的 token 序列:

  • 蓝色 token 编码本体(连杆、关节、电机);
  • 橙色 token 编码动力学(状态与动作)。

同一个 tokenizer 可处理四足、人形、灵巧手等不同形态,无需针对每种机器人单独设计适配器,单一模型即可跨形态学习。RoboTokens 的关键设计目标包括:

  • 完整:覆盖刚体关节机器人的所有信息,包含 5 种 embodiment token 类型以及状态和动作 token。
  • 灵活:token 之间通过 ID 引用,6 自由度机械臂与 35 自由度双足机器人使用同一种格式。
  • 一致:对冗余的空间偏移做规范化处理,并在同一坐标系中存储惯量与变换数据,降低模型需要学习的方差。
  • 可扩展:新增 token 类型无需更改架构,例如加入末端位姿 token 时只需让其指向对应连杆与时间步。
  • 可优化:连续值 RoboTokens 可直接用于扩散,相较 MJCF 等自回归文本格式,既具备全局可控性,又可微,便于推理阶段做基于梯度的奖励优化。

团队对 MuJoCo Menagerie 中的 11 个机器人进行了 token 化,质量跨度从 0.65 kg 灵巧手到 67.5 kg 四足,关节数从 6 到 35,每个机器人被表示为 28–101 个 token。论文指出,RoboTokens 比 MJCF 文本格式紧凑 27–110 倍,足以让 transformer 端到端地进行扩散,而非自回归地「写」XML。

Transformer Transformer:统一的架构

模型采用扩散 Transformer(DiT)配合 DDIM 噪声调度,在 RoboTokens 上进行训练。噪声会被添加到所有非条件 token 上,通过改变被遮蔽的 token,模型可以在不同任务与形态之间灵活切换。同一架构可覆盖多种本体空间(轮式双臂、四足、人形)和使用场景(本体生成、跨形态控制)。

实验结果

团队在 ALOHA 2 双臂平台上制造了一个为「抛布」任务设计的机器人。相较原始平台,该设计的跟踪误差降低 73%,最大关节速度降低 30%。在三个设计空间中的实验表明,模型可对未见过的奖励与轨迹进行零样本优化,在性能与运行时间上均优于基于进化的基线方法。

Dynamics Self-Guidance:关键的训练与推理机制

与针对单一奖励函数过拟合的做法不同,Transformer Transformer 本身是一个动力学模型,其与奖励无关的预测在推理时会被转换为奖励特定的价值预测,进而通过 Dynamics Self-Guidance 引导本体扩散过程,使同一模型既具备跨形态泛化能力,又能针对具体奖励函数完成优化。

信源