点击下方卡片,关注【Xbotics具身智能实验室】公众号
更多具身干货,欢迎加入【Xbotics知识星球】(戳我)
👉具身智能学习资料汇总:https://github.com/Xbotics-Embodied-AI-club/Xbotics-Embodied-Guide
👉具身智能求职/实习信息汇总:https://github.com/Xbotics-Embodied-AI-club/Xbotics-Embodied-AI-Job
你想要的这里都有~~
这阵子看了一圈具身智能的 GitHub,有个感受挺明显——大家已经不满足于列 VLA 论文清单了。过去这类 Awesome 项目主要是找论文、找代码、找 benchmark,但最近冒出来的几个新仓库,悄悄把一条更清晰的技术主线带出来了:
VLA 在往世界动作模型、动作预测、失败恢复和后训练方向走。
说白了,机器人光看懂图、听懂话,然后直接蹦出一个动作,在真实世界里根本不够用。你一动作,环境就变了,环境变了下一步动作就得跟着调整。模型要是不清楚“我这步做完之后会发生什么”,碰到长程任务、接触类任务、工业场景就很吃力。
所以这期我不搞大而全的堆砌,只挑了三个个人觉得最值得长期跟的仓库。它们刚好对上一个层次:一个抓 WAM 新主线,一个看全景,一个扫每日新论文。
第一个:https://github.com/OpenMOSS/Awesome-WAM
如果只能留一个,我肯定选它。
这个仓库不是随便收一堆论文,而是专门围绕“世界动作模型”(WAM)做的系统梳理,并且是 WAM 综述论文的配套仓库。5月13号才初始发布。
它最让我喜欢的地方,是把一个本来有点乱的领域重新分了类。
以前说起机器人世界模型,什么预测未来视频、用视频生成辅助规划、把未来状态隐式塞进策略网络、动作和未来观测一起建模……单看论文都挺新,但搁一块儿就容易晕。
Awesome-WAM 给了一条很管用的分法:
把 WAM 分成 Cascaded WAM(先想象未来,再出动作)和 Joint WAM(把预测未来和生成动作塞进同一个模型联合搞)。还按表示形式拆成像素空间、隐空间、自回归生成、扩散式生成等等。
这对写内容太友好了。
因为 WAM 不是某一个模型的名字,而是一种判断标准:模型到底有没有把“未来状态预测”嵌进策略里?动作是不是和预测的未来绑在一起的?如果只是拿个视频模型当外挂,或者训练时加个辅助损失,未必算真正的 WAM。这个边界一清楚,看论文就不容易被“世界模型”这词带偏。
我后面会拿它当 WAM 方向的主资料源,适合挖选题,比如“为什么 VLA 之后大家开始谈 WAM?”“机器人需要预测未来图像,还是只需要预测对动作有用的隐状态?”之类的问题。

第二个:https://github.com/DravenALG/awesome-vla-wam
如果说 Awesome-WAM 是专题综述延伸,那 awesome-vla-wam 就是一张大地图。它的定位就是系统整理 VLA 和 WAM 的研究,帮人看清机器人基础模型最近的发展脉络。
这个仓库覆盖面很全。从通用 VLA 开始,拆出带 3D/4D 建模的、带强化学习的、高效 VLA、潜动作 VLA,还有人形、灵巧手、触觉这些细分。到了 WAM 部分,又继续拆成通用世界模型、基于视频生成的、基于 VLM 的、从零训的。
特别有意思的是,它直接点明了 VLA 和 WAM 的交集:基于预训练 VLM 构建、同时能预测未来状态的模型,可以既算 VLA 也算 WAM。这就把未来可能会出现的混合模型格局讲清楚了——以后不一定非此即彼,更可能是同一个模型里,上层有视觉语言理解,中层有世界状态预测,下层出动作。

这个仓库适合做路线导航。想写 VLA+RL,就从强化学习那个分区切入;想写灵巧手,就看 Dexterous/Tactile;想写 WAM,就顺着三条路线往下找。每个月扫一遍,很容易看出哪些小方向突然热了。
第三个:https://github.com/Ed1sonChen/DailyArxiv
严格说,它不是一个具身智能专用仓库,而是一个自动抓 arXiv 新论文的工具库,按关键词天天更新。
比如它的 Vision Language Action 分区里,已经能看到 5月15号的 VLA-AD,讨论怎么用离线语义指导做 VLA 策略蒸馏,把大模型老师压缩成轻量学生策略,强调实时控制里的模型大小和推理成本。
我把它放进来,纯粹是因为它适合当“新论文雷达”。现在具身智能论文更新速度太快,靠人工每天刷 arXiv 坚持不了几天。
DailyArxiv 的价值是把“可能值得看”的论文先捞出来。当然,真正要写东西时还得再做二次筛选:看有没有代码、有没有真机实验、是不是只在模拟器上刷分、有没有提出新问题。
它更像一个上游入口。我现在的习惯是,每周扫一遍 Vision Language Action、World Model 这些关键词,把有意思的标题挑出来,再跟 Awesome-WAM、awesome-vla-wam 这类人工整理仓库交叉验证。两边都出现的,基本值得认真看。

为什么只推这三个?
它们刚好组成一套资料闭环:Awesome-WAM 回答“新主线是什么”,awesome-vla-wam 回答“各个方向全景长什么样”,DailyArxiv 回答“每天又冒出哪些新东西”。
单个用都有短板:只看 DailyArxiv 容易陷进标题党,看什么都想写;只看 Awesome-WAM 会太聚焦 WAM,忽略后训练、轻量化部署、触觉人形这些工程侧问题;只看 awesome-vla-wam 又全景有了,但动态敏感度不够。
搭配起来用最舒服:用 DailyArxiv 发现新工作,用 awesome-vla-wam 定位它在全景里的坐标,用 Awesome-WAM 判断它是不是摸到了下一阶段的主线。
收个尾
如果说过去两年具身智能最热的是 VLA,那最近这批 GitHub 仓库其实在提示一件事:
下个阶段,大家会越来越关心世界模型、动作之后的状态预测,还有部署期的持续学习。
这不是换概念,而是真实场景绕不开的坎。抓杯子杯子可能滑,插孔接触力会变,叠衣服布料形态一直变,工业上下料姿态偏离示教分布——模型只懂“看图出动作”,在这种动态反馈里很难撑住。
所以 WAM 的意义,是把机器人策略从“当前状态到动作”,往“当前状态—未来状态—动作后果”的闭环里推进了一步。
这三个仓库,值得放进收藏夹。不用天天看,但隔一两周扫一次,你就能感觉到:这个领域的热点,到底是在变多,还是在变深。
-END-
Ask Me Anything|提问箱
❝对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。
怎么问:在评论区留言,或私信公众号
我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。
提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。
一起把问题变成知识,推动社区进步 🚀