今年4月,一段用单目RGB相机实时重建三维空间的视频,率先在海外开发者社区传开了。
被马斯克、李飞飞、Jim Fan关注的泛AI创作者 Min Choi 则评价其“这AI真够狂野的”。
头部内容创作者 AI DRIVR 在 X 上评价其仅依赖单目 RGB 相机、无需激光雷达即可实时运行且完全开源,并感叹“we’re living in the future”。
最近,蚂蚁灵波的这项工作又迎来了来自学术界的认可。
LingBot-Map的论文《Geometric Context Transformer for Streaming 3D Reconstruction》入选ECCV 2026 Oral 和 Award Candidates。
“解决流式3D感知的基础问题,吸收经典SLAM的思想,同时保留前馈基础模型端到端学习和泛化的优势”。
可以说在精度、效率和长程稳定性上都拿到了结果。
3D基础模型从一次性重建场景,
走向持续维护“空间记忆”。
想象一台机器人在仓库里巡检。
它从货架一端出发,绕过障碍,进入另一片区域,十几分钟后沿原路返回。
出发时见过的门和转角,早已离开当前视野;重新经过那里时,新的观测仍然需要和此前的空间对上。
这要求模型一边处理新画面,一边保留走过的路。
行程越长,需要维持的空间关系就越多。
这些关系,对端侧的智能体来说,是很大负担。
对人类来说,我们不会记录每一帧的所有内容,而是选择性地只保存最本质的线索,以达到长时间内连贯地穿越大规模环境的目的。
这就是LingBot-Map的思路,选择性高效完成流式3D 重建。
这种方式赋予了其可以在超大场景(如大型物流中心)中进行长时间、不间断的自主导航与巡检。
而且,也能让机器人厂商大幅降低对昂贵 3D 传感器的依赖。
机器人很难长时间穿越大规模环境,这是长期存在的问题。
虽然这几年,VGGT、Depth Anything 3等前馈3D模型推动了一次性三维重建。在离线设置下,模型可以同时看到一组多视角图像,利用完整上下文预测相机位姿和场景几何。
但这会产生一个问题,陌生新环境下,运行会很重,所以更适合静态下的重建。
追求速度的流式输入根本没有这个条件。
第100帧到来时,第101帧还不存在。
模型只能利用已经看到的内容判断当前状态;等序列延伸到几千帧,最初的门、转角和楼梯虽然不在眼前,仍可能是维持整条轨迹一致性的重要参照。
但流式的重建逻辑,也有个问题:“历史压缩得太狠,模型容易丢掉关键线索,误差沿着轨迹积累”。
保留接近完整的历史,几何信息更丰富,显存和计算量也会随之上涨。
后者容易迷路,前者像背着越来越重的相册赶路。
之前,大家做定位建图,往往依赖激光雷达。
这也是LingBot-Map的一个优势。
只需要单目,就能在10,000+ 帧的长序列里,处理 518×378 分辨率的视频可以稳在 20 FPS 左右。
这意味着,普通相机就能成为重建三维空间的起点。
机器⼈⼚商也可以⼤幅降低对昂贵 3D 传感器的依赖。
成本和便利性都会有质的变化。
而这个优势能形成,究其原因,在于LingBot-Map设计了一套独特的记忆系统。
LingBot-Map的核心是Geometric Context Attention(GCA),设计了像人类一样的选择性记忆,不试图记住所有细节,也不轻易遗忘过去。
这样可以节省宝贵的内存。
如果细看,GCA把空间记忆分成三个层次。
Anchor Context,记住出发点。
模型先用最开始的几帧画面固定一套坐标和尺度。就像出发时先插下一面旗子,后面所有位置都以它为参照,不会越走越偏。
Local Pose-reference Window,记住眼前发生了什么。
模型保留最近几帧完整画面,通过门框、桌角、墙面等在画面中的相对移动,判断自己刚刚走了多远、转了多少。这种运动视差,就是单目摄像头从连续视频里获得的深度线索。
Trajectory Memory,记住走过的路线。
更早的画面不必全部保存,只压缩成一串轨迹记忆。当局部判断出现误差时,可以利用压缩后的历史几何线索,抑制误差在长序列中的持续积累。
三者合起来,让单目不再只是拍照片,而是在持续观察、移动和对照中恢复三维空间。
因此,模型不需要像激光雷达那样逐帧测距,也能从视频里的运动视差和长期空间记忆中推断几何关系。
当然,这种记忆不是无限的。轨迹记忆虽然比完整图像特征轻得多,但视频越长,历史仍会继续增长。因此,超长视频还需要结合关键帧和分窗口处理。
它减轻的是保存全部过去的负担,并不是让历史信息凭空消失。
这套记忆机制如何被检验?
一个很直接的方式是:序列不断变长之后,误差会不会持续累积?
论文中也看到,在Oxford Spires测试中,当序列从320帧增加到3840帧,LingBot-Map的ATE只从5.37升至5.60,增幅为0.23;其他流式方法的增幅则在0.70到14.31之间。
那记忆本身会因为特征减少保存而出现较大衰弱吗?
这也是LingBot-Map值得关注的点。
相比保留全部历史图像特征,GCA将显存占用从36.06GB降至13.28GB,速度从11.87 FPS提升到20.29 FPS,ATE也从6.60降至5.98。
也就是说,历史信息并非保存得越多越好。在于过滤重复信息的同时,留下维持长期空间一致性所需的几何线索才是关键。
相比于学术上的认可,开发者的关注来得更早。
仅几个月时间,官方GitHub仓库获得了16,800+ Stars、1,894 Forks,也开始有人为它适配不同硬件、简化安装过程。
一项重建模型,逐渐进入了开发者自己的设备和工作流。
单目输入、长序列处理和开源代码,为开发者降低了上手和改造的门槛。
开源的代码,更能让开发者能够针对不同设备调整运行配置、封装安装流程、添加交互界面。
一个开源项目拿到上万Stars或者论文拿到Oral,可能源于方法足够新、技术路径具备学术创新价值,或是Demo足够抓眼球。
有人愿意替它解决安装、硬件和交互问题,说明开始流传了。
LingBot-Map开源后,许多开发者加入创作开发。
有的制作了可以在Apple Silicon Mac上运行的原生桌面前端,还配了一套3D点云查看器;有的试图把原本复杂的配置过程压缩成一键安装,并提供低显存启动方案。
甚至还有开发者专门针对RTX 4060 8GB显存环境做适配。
这让一项原本看起来更像实验室成果的模型,能在更常见的消费级硬件上跑起来。
这些适配逐项处理着论文之外的使用障碍,也让 LingBot-Map 更容易进入开发者自己的设备与空间感知工作流。
而在 LingBot-Map之前,机器人还需要从二维图像中提取稳定的结构线索,并恢复可度量的三维几何。
蚂蚁灵波此前推出的 LingBot-Vision 和 LingBot-Depth,对应的正是前面的两个环节。
所以,空间感知,不是一个单点问题。
上下游的分工很明确。
技术逻辑上,空间感知⾄少包含三个连续层次:从⼆维画⾯中提取细致的空间结构、将视觉信息转化为具备真实尺度的⼏何测量、再把连续观测组织成⻓期⼀致的三维地图。
这样一个任务:机器人要从桌上拿起一只透明玻璃杯,穿过房间和走廊,把它送到另一个房间。
对人来说,这只是简单的抓取—移动—放置任务。对机器人来说,却需要时刻面临三个连续问题。
首先,它得看清楚眼前的世界。
玻璃杯的轮廓并不总是清晰可见,杯沿、杯壁和桌面的边界可能相互重叠;周围还有其他物体,机器人需要判断哪些部分属于杯子,哪些只是背景。
如果连物体的结构都没有看清楚,后面的抓取就无从谈起。
这正是LingBot-Vision在解决的。
但看清楚还不够。
机器人还需要知道,玻璃杯究竟离自己有多远,夹爪应该伸到什么位置,桌面和杯口分别处在怎样的空间高度。
尤其面对玻璃、镜面、金属等材质时,普通相机往往难以直接获得可靠的深度信息。
于是,问题从看清结构进一步变成了量准距离。
LingBot-Depth 则通过 RGB 图像与深度信息之间的对应关系,补足传感器缺失、噪声或不完整的几何信息,把视觉线索转化为更接近真实尺度的空间测量。
机器人因此不仅能识别杯子,还能判断它在哪里、离自己多远,以及怎样接近它更安全。
然而,任务并没有在机器人成功抓起玻璃杯的那一刻结束。
它还要穿过房间、找到走廊、进入目标房间,并把杯子送到正确的位置。机器人不能只依赖当前这一帧画面,而要把一路上看到的环境组织起来:刚才经过的门在哪里,目标房间位于哪个方向,自己是否已经走过了某个位置。
这就从看清楚和量准确,进一步进入了记得住。
LingBot-Map 所做的,正是把视觉和深度信息持续组织成一份可更新的三维空间记忆,让机器人能够在移动过程中定位自己、重建环境,并利用长期轨迹支持导航和任务规划。
所以你看,机器人真正需要的不是某一个孤立的感知模块,而是一条逐步展开的技术链。
LingBot-Map走出了一条很有意思的路径。
先在海外KOL中引发关注。随后,开源代码进入开发者社区,GitHub获得超过1.69万Stars。
如今,论文又入选ECCV 2026 Oral。
先被看见,再被用起来,最后走上顶会。
但这些之外,更值得关注的是背后还有一条正在形成的空间感知链路,以及空间感知必须为行动负责的研发逻辑。
只有当视觉信息被转换为可度量、可持续更新、可被规划和控制模块调⽤的世界表征,机器人才真正具备在物理世界中行动的基础。