社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  Git

从GitHub爆火到ECCV Oral,全球开发者把LingBot-Map玩出新高度

机器之心 • 1 周前 • 58 次点击  
图片
编辑|陈陈


机器人正在学习一种曾经只属于人类的能力:记住自己走过的世界。


第一次进入陌生房间时,人不会把看到的一切逐帧存储下来。我们会记住关键结构:门在哪里,桌子在哪里,刚才经过的位置,以及自己现在处于什么位置。


正是这种选择性记忆,支撑了人类在复杂环境中的持续行动。对于机器人来说,这也是走向真实世界必须解决的问题。


今年 4 月,蚂蚁灵波开源的流式 3D 重建基础模型 LingBot-Map,正是在「机器人如何记住空间」这一核心问题上,探索出了一条新的技术路线。无需复杂硬件,仅靠一颗普通 RGB 摄像头,就能让机器人在视频采集过程中,实时完成相机位姿估计与场景三维结构重建,从而填补了实时空间感知领域的关键技术空白。


在穿越多房间的长序列中,面对环境剧变与大幅视角变换,LingBot-Map 依然能表现出极强的鲁棒性


截至目前,LingBot-Map 官方 GitHub 项目已获得 16.9K Stars、1.9K Forks,并多次登上 GitHub Trending,成为 3D 视觉领域备受关注的开源项目之一。



  • 项目地址:https://github.com/Robbyant/lingbot-map

  • 论文地址:https://arxiv.org/pdf/2604.14141

  • 论文主页:https://technology.robbyant.com/lingbot-map

  • Hugging Face 链接:https://huggingface.co/robbyant/lingbot-map

  • ModelScope 链接:https://www.modelscope.cn/models/Robbyant/lingbot-map


令人惊喜的是,现在这项研究迎来新的认可。


其论文《Geometric Context Transformer for Streaming 3D Reconstruction》入选 ECCV 2026 Oral,将于会议期间进行口头报告。在昨天 ECCV 的开幕式上,机器之心前方编辑还在 Award Candidates 的名单中看到了这项工作。


从 GitHub 社区的高度关注,到顶级视觉会议的认可,LingBot-Map 完成了从开发者生态到学术界的双重验证。


更重要的是,它背后反映出一个变化:机器人空间感知的竞争,正在从看见世界,走向记住世界。


顶会认可之前,LingBot-Map 已完成开源社区验证


在入选 ECCV Oral 之前,LingBot-Map 已经在开源社区收获了一大波关注,开发者围绕这个项目进行了各种二次开发。


有人快速完成复现验证,有人把它搬到不同硬件环境中尝试运行,也有开发者开始探索新的空间数据采集方式。


每个人的玩法都很有趣,这种来自社区的主动探索,往往比单纯的 Stars 数量更能说明它的生命力。


让更多人能够快速体验:从部署到可视化


对于许多研究项目,论文公开并不意味着普通开发者能够真正使用。环境配置、依赖安装、结果展示等环节,往往成为从论文 Demo 到实际体验之间的距离。


LingBot-Map 开源后不久,就有开发者制作了可在 Apple Silicon Mac 上本地运行的原生桌面前端和 3D 点云查看器,让用户能够更加直观地查看模型生成的空间重建结果。


来源:https://github.com/donalleniii/lingbot-desktop-mac


与此同时,也有开发者基于 Pinokio 制作了一键启动方案,将环境配置、依赖安装以及 Demo 运行流程进一步封装,让没有复杂配置经验的用户也能够快速体验 LingBot-Map。


来源:https://github.com/cocktailpeanut/lingbot-map.pinokio


这些尝试补齐了从研究成果到开发体验之间的重要环节,让更多用户能够真正接触和使用这一流式 3D 重建模型。


更多设备运行:消费级硬件适配


除了优化使用流程,开发者也开始尝试扩展 LingBot-Map 的硬件适用范围。


开发者 ureeey 针对 RTX 4060 8GB 显存设备进行了适配尝试,通过优化运行策略降低显存压力,让 LingBot-Map 能够运行在更轻量的 GPU 环境中。


来源:https://github.com/ureeey/lingbot-map-rtx4060-8g/blob/main/README.md?utm_source=chatgpt.com


这类尝试背后的意义在于:当模型不再局限于高配置工作站,而能够进入更多普通开发环境时,技术才有机会被更多人测试、改造和应用。


从摄像头到智能眼镜:探索新的采集入口


在 X 平台上,有开发者关注到,过去部分高精度三维扫描任务通常依赖专业 LiDAR 设备,或者需要复杂的离线优化流程,而传统方法在长时间连续输入下也容易面临稳定性挑战。


相比之下,LingBot-Map 通过普通视频流实现实时流式重建,仅需单 GPU 即可运行,达到约 20 FPS,并能够处理超过 10,000 帧的长序列输入。


来源:https://x.com/XAMTO_AI/status/2080900857235726635


在这些开发者看来,LingBot-Map 展示了一种更加轻量的空间感知路径:降低对专用硬件和复杂流程的依赖,让实时三维重建能力有机会进入机器人、AR/VR、自动驾驶等更多场景。


基于这一点,真有人进一步将 LingBot-Map 接入消费级设备。


他将 Ray-Ban Meta Gen-2 智能眼镜(无需 LiDAR)改造成 3D 扫描设备,通过手机 App 采集数据,并调用部署在 RunPod 上的 LingBot-Map 后端,在约 30 秒内完成所在空间的三维建图。即使使用较少的视频帧,室内场景仍能获得较好的重建效果。


来源:https://x.com/0x6rss/status/2079597540568137866


除了智能眼镜,这位用户在普通戴尔台式机上运行 LingBot-Map,仅对着办公桌进行一次视频采集,约 61.5 秒后便获得了一个可交互浏览的三维点云模型。


来源:https://x.com/shavonnewong_/status/2080130333094101360


而这些,只是 LingBot-Map 开源之后社区探索的一部分。对于一个 3D 视觉研究项目而言,这种持续的二次开发并不常见,这表明 LingBot-Map 已经开始进入真实的使用场景。


开源之后,团队也在持续更新评测脚本、推理优化、示例案例以及问题修复,进一步提升项目的可用性和稳定性。与此同时,官方还展示了超长视频重建结果:在约 25,000 帧、持续 13 分钟的室内行走视频中,LingBot-Map 仍能保持连续重建,生成完整的三维空间表示。


当然,社区热度只是其中一面。对于一项研究成果而言,真正决定其长期影响力的,仍然是它是否解决了领域中的关键问题。


ECCV Oral 背后,LingBot-Map 如何重新设计机器人空间记忆?


那么,LingBot-Map 究竟解决了什么问题?为什么一个流式 3D 重建模型,能够吸引开发者持续扩展,又能够获得 ECCV Oral 的认可?


答案需要回到机器人空间感知中最核心的挑战:如何让机器人在不断增长的视频输入中,既保持对空间的长期记忆,又避免计算和存储成本随着时间无限增加。


对于机器人而言,3D 重建需要边走边理解环境。机器人看到当前画面,需要同时回答现在看到的位置在哪里?过去走过的区域和当前画面之间是什么关系?


这意味着模型需要持续估计摄像头轨迹,并生成对应的深度信息,最终形成不断扩展的三维地图。


流式重建相比离线重建,要面对一个核心矛盾:保留更多历史信息,可以提升空间一致性;但历史越来越长,也会让计算和存储成本快速增长。


现有方法大致采用三种路线。


一种方法类似记住全部历史。例如基于 causal attention 的方案,会缓存之前所有帧的信息。这样模型拥有完整上下文,但随着序列增长,显存和计算量也不断增加。


另一种方法选择压缩历史状态,例如循环网络式结构。但压缩过度可能导致模型遗忘关键几何信息,长时间运行后出现轨迹漂移。


还有一些方法结合传统 SLAM,通过关键帧选择和优化算法维持稳定性。但这类方法依赖人工设计的规则,并且需要额外优化过程,难以兼顾实时性。


因此,真正困难的问题是机器人面对不断增长的视频流,哪些空间信息必须保留,哪些信息可以舍弃?


LingBot-Map 将这个问题称为 streaming reconstruction 中的 context management(上下文管理)。它希望让模型像人类空间记忆一样,只保留最重要的几何线索,而不是记录所有观察。


GCA:把空间记忆拆成三层,让模型知道该记什么


为了解决这个问题,LingBot-Map 提出了 Geometric Context Attention(GCA,几何上下文注意力)。


它的核心思想来自传统 SLAM:一个稳定的空间系统,通常需要三类信息:一个固定参考点,用来确定坐标;附近区域的信息,用来判断当前位置;长距离历史,用来避免累计漂移。因此,GCA 将流式状态拆成三个部分。


LingBot-Map 流程。该框架处理相对于初始化集 [T, T) 的当前视图。DINO 骨干网络提取图像特征,然后通过交替的帧注意力层和 GCA 层进行细化。在 GCA 模块中,输入视图聚合来自锚点上下文、局部姿态参考窗口 [T, T] 和轨迹记忆上下文的信息。最后,特定任务的头部预测相机姿态和深度图,从而实现对长序列的鲁棒、内存高效的流式 3D 重建。


第一层:Anchor Context,建立空间坐标。负责记住「我从哪里出发」。它为整个三维坐标系提供稳定基准,空间重建最怕坐标漂移,有了锚点,模型在处理第一万帧时,仍然清楚第一帧发生在什么位置。


第二层:Local Pose-Reference Window,保持局部精确定位。用来负责捕捉当前位置附近的局部几何细节。这相当于对「我身边有什么」保持清醒的即时感知,保证了逐帧重建的精度。


第三层:Trajectory Memory,压缩长期历史避免漂移。这是整个架构中较为关键的设计。它把庞大的历史信息压缩成极其紧凑的逐帧 Token,以较低的存储代价保留对过去路径的「印象」。正是这一机制,让 LingBot-Map 的内存消耗几乎不随视频长度增长,处理 100 帧和处理 10000 帧,总的计算量和内存占用维持在几近相同的水平。


这种设计带来的效率提升相当可观。在 1 万帧序列中,传统 causal attention 需要约 500 万 token;GCA 只需要约 7 万 token,足足压缩了近 80 倍,且每处理一帧新画面,计算量和内存消耗几乎不随总帧数增长。


注意力掩码比较。每个方框代表一帧的 Token,由一小段上下文 Token 和一段较大的图像 Token 组成。(a) 全注意力(Full attention)会关注所有帧。(b) 因果注意力(Causal attention)支持流式处理,但计算开销随序列长度线性增长。(c) 滑动窗口注意力(Sliding-window attention)虽然限制了计算成本,但会丢失长程上下文。(d) GCA 将流式上下文划分为锚框 (n=2)、局部窗口 (k=2) 和轨迹记忆,在保持计算成本随序列长度增加而近乎恒定的同时,保留了丰富的长程上下文信息。


在基准测试上,它表现如何?


实验也验证了 LingBot-Map 有效性。


团队首先在 Oxford Spires 数据集上进行测试,并以两种设置分别测试模型的短程定位能力和长程稳定性。


在稀疏设置中,团队选取 320 帧图像(每隔 12 帧采样)测试,LingBot-Map 在几乎所有指标上都取得了最佳结果。


尽管 LingBot-Map 采用的是流式在线推理方式,但其性能仍大幅超过最强的离线基线方法。具体来看,LingBot-Map 的 AUC@15 达到 61.64,明显高于最佳离线方法 DA3 的 49.84,并超过 VGGT 的两倍以上(VGGT 为 23.84)。在轨迹级别的精度指标上,LingBot-Map 将 ATE 从 DA3 的 12.87 米、VGGT 的 24.78 米降低到了 6.42 米。


相比依赖跨帧重投影误差优化的传统优化方法,LingBot-Map 同样取得了更优表现。它超过了表现最好的优化方法 VIPE,在位姿精度(AUC@15:61.64 vs. 45.35)和轨迹一致性(ATE:6.42 vs. 10.52)两个指标上均取得优势。


而在在线流式方法之间的比较中,优势更加明显。其他流式方法普遍存在严重的记忆遗忘问题:随着序列不断增长,模型会逐渐丢失过去观察到的几何信息,最终导致累计漂移。LingBot-Map 分别达到 61.64 和 6.42,在位姿精度上提升约 10 倍,在轨迹误差上降低约 2.8 倍。



在密集设置(完整 3840 帧)下,团队进一步对模型的长序列流式重建能力进行了压力测试。随着轨迹长度从 320 帧增加到 3840 帧,大多数前馈式方法都会因为累计漂移问题出现明显性能下降。


相比之下,LingBot-Map 始终保持较低的误差水平,ATE 仅从 6.42 增加到 7.11。在序列长度扩大 12 倍的情况下,误差只增加了 0.69。


这说明 GCA 的三层上下文结构 —— 包括 anchor context、trajectory memory 和 local window—— 能够在无需显式优化或回环检测(loop closure)的情况下,有效保持长距离几何一致性。


值得注意的是,LingBot-Map 在保持最高轨迹精度的同时,还达到了具有竞争力的推理速度,运行速度达到 20.29 FPS,在所有流式方法中实现了最佳的轨迹估计效果。



在生成高质量三维地图方面,团队在 ETH3D、7-Scenes、NRGBD 三个数据集测试点云重建。LingBot-Map 均取得最高 F1 分数。



在 ETH3D 数据集上,LingBot-Map 的 F1 达到 98.98,相比第二名 Wint3R 的 77.28 提升了 21.70 个百分点。说明 LingBot-Map 生成的重建结果不仅更加精准,也覆盖了更加完整的场景结构。


在 7-Scenes 数据集上,LingBot-Map 的 F1 达到 80.39,并在 Accuracy(0.02)和 Completeness(0.07)两个指标上均取得最佳表现。


在 NRGBD 数据集上,LingBot-Map 的优势更加明显,其 F1 达到 64.26。NRGBD 包含大量复杂室内环境以及精细几何结构,在这类场景中,其他方法由于累计位姿漂移,容易导致重建结果出现表面模糊或结构重复的问题。而 LingBot-Map 具备更强抗漂移能力的轨迹估计,可以直接提升这类场景下的重建质量。


下图是定性对比结果。在较简单的场景中(图中上方几组),TTT3R 和 Wint3R 已经出现建筑边缘错位的问题。随着场景复杂度增加(中间几组),竞争方法开始出现重复结构和模糊表面,这是由于累计位姿漂移导致同一几何结构被投影到了不同位置。


在最具挑战性的多建筑室外场景中(底部几组),差距更加明显:TTT3R 和 Wint3R 几乎完全失去空间一致性,生成的点云出现坍缩和碎片化,甚至无法区分独立建筑。相比之下,LingBot-Map 始终保持清晰的几何结构、锐利的建筑边缘以及连续的墙面表面,说明 GCA 提供的长期几何一致性能力能够直接转化为高质量的 3D 重建效果。


点云重建的定性比较。


从一个模型,到一套机器人空间感知体系


其实回看蚂蚁灵波的技术布局,LingBot-Map 并非孤立存在。


对于机器人而言,真正的空间理解并非单一能力。它首先需要看懂眼前的环境,随后需要准确判断距离,最后,还需要把连续观察到的信息整合起来,形成对整个环境的长期记忆。


围绕这三个环节,蚂蚁灵波已经布局了 LingBot-Vision、LingBot-Depth 和 LingBot-Map,分别对应视觉结构理解、高精度空间感知以及持续空间记忆。


其中,LingBot-Vision 提出的思路,是让模型重新关注图像中的边界。它认为,物体轮廓和形状变化区域包含大量几何信息,是机器人理解空间的重要线索。基于此,团队提出掩码边界建模(Masked Boundary Modeling),让模型无需人工标注或额外边缘检测器,就能自主学习亚像素级边界表示,并利用这些边界信息增强视觉表征。


LingBot-Depth 的关键洞见是将传感器缺失视为可学习的信息,而非单纯的噪声。通过掩码深度建模(Masked Depth Modeling, MDM),模型能够结合 RGB 图像中的视觉上下文,推断缺失区域的深度信息。这样,机器人不仅能看到物体,还能更准确判断物体在三维空间中的位置关系,尤其在处理透明、反光、密集物体时表现突出。


LingBot-Map 则进一步解决记住的问题,通过流式 3D 重建能力,将连续视频中的视觉信息组织成稳定的三维空间表示,让机器人能够在不断移动过程中更新环境认知,并保持对已经探索区域的记忆。


三者结合起来,形成一条从感知到理解再到行动的空间智能链路。


当机器人能够持续感知、理解并记忆周围环境,它才有可能完成更复杂的导航、巡检、操作和任务执行。LingBot-Map 所推动的,正是机器人从看到世界走向理解并利用世界的关键一步。



© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com


Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/200931