桃子桃子快讯
返回首页
模型发布

高德发布ABot-Recon:无需长程记忆,12帧重建万帧3D场景

高德推出万帧级流式3D重建模型ABot-Recon,仅用12帧局部上下文即可实时稳定重建上万帧3D场景,多项基准达SOT…

2026.08.28 · 周五3 分钟阅读

阿里巴巴集团旗下高德于8月28日正式发布首个无长程依赖的万帧级流式3D重建模型 ABot-Recon。该模型仅依赖连续12帧局部画面,即可实时稳定地重建上万帧的3D场景,实现「边拍边建」,并在 KITTI、Oxford Spires、VBR 等权威评测中取得最低误差的 SOTA 成绩。目前,推理与评测代码及权重已在 GitHub 开源,并上线魔搭社区体验专区。

背景:长序列重建的瓶颈

随着自动驾驶、具身智能等技术走向开放环境,物理AI需要在移动过程中持续理解空间——「我在哪、周围有什么、下一步怎么走」。在定位信号弱、变化快的商场、园区、仓库等私域场景,系统难以依赖一次性建图或事后重建。

主流方案是流式3D重建,但该技术长期受困于两类问题:

  • 误差累积:长距离下轨迹漂移明显;
  • 显存膨胀:随序列变长,资源消耗急剧上升。

传统做法是在重建中设置记忆锚点,依赖长程记忆不断保存、检索和融合历史信息,但序列越长,模型的速度越慢、精度越差、显存越高。

技术路径:局部预测 + 残差优化

ABot-Recon 选择了一条全新的技术路线,核心思路是「局部位姿预测 + 残差优化」,以应对长序列对精度、速度和显存的挑战。

  • 摒弃长程记忆锚点:模型仅以最近12帧连续画面作为局部上下文窗口,每次只预测当前相机坐标系下的局部点云与相邻两帧之间的相对位姿;
  • 计算复杂度恒定:因预测目标始终是局部、与序列长度无关,内存与单帧计算量不再随视频变长而膨胀;
  • 误差约束机制:在预测和训练端分别设计纠偏与误差约束机制,实时校准轨迹误差,逐步拼接出完整全局轨迹与三维场景。

基准表现:精度、速度、显存全面领先

在多个公开长序列基准测试中,ABot-Recon 全面超越现有方法:

  • 精度:在 Oxford Spires 长序列基准测试中,平均轨迹误差较行业代表方法 LingBot-Map 降低 40.6%;相对旋转误差 RPE-R 低至 0.12°,较前代 SOTA 降低约 40%,为同类流式方法最优;
  • 速度:在 KITTI-02 测试中实现 24.45 FPS 的实时重建,推理速度达行业代表方法的 1.24 倍,在平均轨迹误差低于20米的全部方法中吞吐最高、显存最低;
  • 显存:峰值显存占用仅约 6.71GB,约为同类模型的三分之一,一张消费级显卡 GTX 1080Ti 即可运行,大幅降低了流式3D重建的使用门槛。

应用与开源

ABot-Recon 仅需单目 RGB 视频输入,无需额外深度传感器或已知相机参数,即可实现万帧级实时三维重建,可应用于测绘行业的私域建图与底图更新,以及具身智能、自动驾驶和3D内容生产等场景。

项目主页:https://amap-cvlab.github.io/ABot-Recon-html 技术报告:https://github.com/amap-cvlab/ABot-Recon/blob/main/ABot-Recon-Tech-Report.pdf 魔搭体验:https://modelscope.cn/studios/amap_cvlab/ABot-Recon/

这一结果印证了一个反直觉的结论:让模型走得更远,未必要记得更多。仅看12帧的模型,反而走出了更准、更快、更省的一条路。

信源