社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  chatgpt

研究实锤:世界模型根本不懂物理定律,属于它的“ChatGPT时刻”还很远

图灵人工智能 • 2 周前 • 91 次点击  

单击上方图灵人工智能”,选择“星标”公众号

您想知道的人工智能干货,第一时间送达

图片
转自学术头条,仅用于学术分享,如有侵权留言删除
近年来,基于视频生成模型的世界模型(World Models)已成为人工智能领域备受关注的方向之一。Sora、Genie、Cosmos、V-JEPA 这些视频生成模型,都指向了一个共同的假设:如果它们看过足够多的视频,或许就会逐步形成“物理直觉”,进而理解物理世界。


然而,问题在于,现有基准很难验证这一假设是否成立。


视频生成模型究竟是遵循了物理定律,还只是生成了看起来正确的结果?它能否像牛顿一样用物理定律思考,而不只是像亚里士多德那样依赖“直觉”?


针对这些问题,南洋理工大学 S-Lab 团队及其合作者提出了首个以物理定律为核心的视频模型评估基准 Apple-π结果表明,当前的视频生成模型距离可靠的通用世界模拟器仍有很大差距,即使是 SOTA 模型的得分也只有 0.473


Image

论文链接:https://arxiv.org/abs/2607.16401


研究团队表示,即使现有模型能根据标注好的第一帧画面生成看起来合理的运动,也不代表它们真的看懂了物体关系、学会了物理规律,或能始终按一致的运动规律生成结果。


这项工作旨在帮助未来的视频生成模型真正学会依照物理定律理解和模拟世界,但属于世界模型的“ChatGPT时刻”依然很远,而要做到这一点,研究人员还需要为视频世界模型赋予更强的场景理解能力、更丰富的物理推理数据,以及专门面向推理的后训练。


Apple-π,锚定在物理定律中的基准

Apple-π 是首个以物理定律为核心的视频模型评估基准它要求模型感知相关物理量、表述支配定律,推导出符合定律的后续运动,并定位推理失败发生在哪一步。


图片

图|Apple-π 概览。


具体设计如下:


1.视频数据集:Orchard 包含 400 个经典力学视频,先确定物理定律和初始条件,再生成或筛选对应视频。任务分为单一定律和多定律组合两类,覆盖重力、碰撞、惯性及多段运动衔接,考察模型能否持续更新位置和速度。


Image

图|Orchard 概览。


2.基准协议:Apple-π 将 Orchard 案例拆为感知、表述和推导三类任务,五个子轨道,用于分项评估模型的物理推理能力。感知-文本用于复刻画面中的数字和标注,感知-图形用于定位并保留实验物体;表述-文本从候选物理公式中选择支配方程并代入变量,表述-图形预测目标时刻的物体位置并标注速度;推导则基于首帧初始条件生成完整运动视频。


图片

图|Apple-π 基准协议。


3.评估套件:Apple-π 采用混合评分机制。多模态大模型评分用于评估回答合理性、格式合规性和画面清晰度;在具备物体掩码和轨迹真值的赛道中,物理真值指标用于量化物体定位、轨迹和速度误差,判断运动过程是否符合物理规律。各赛道得分统一归一化到 [0,1]。


无论哪类模型,物理推导表现都有限

研究团队在完整 Apple-π 基准上评估了 11 个代表性模型。整体结果显示,视频预训练、推理监督和统一理解均能改善模型的感知和表述能力;不过无论哪类模型,物理推导表现都十分有限。


具体来看,专有模型结果整体强于基础开源视频模型大规模、高质量视频训练可以蒸馏有用的物理先验;经过视频推理微调的 VBVR-Wan2.2,也在视频模型中表现更有竞争力;GPT Image 2 和 Nano Banana 2 结果显著领先说明显式理解和可控视觉生成有助于标注读取、物体 grounding 和最终帧生成。


即使是 SOTA 模型的得分也只有 0.473,物理运动推理仍然是目前的主要瓶颈。


Image

图|主要结果。


此外,为了进一步定位模型在不同推理环节中的问题,Apple-π 将评测流程拆分为感知、定律建模和动态推演三个阶段,考察模型在感知、对齐、推理和生成上的能力。


结果显示,模型的错误并不只出现在最终生成阶段,还体现在中段的物理推理环节:即使部分模型能完成标注读取和物体定位,其在物理规则选择、状态更新以及后续运动预测上仍明显不足。它们更多依赖表层视觉模式匹配,尚未形成稳定的物理状态建模能力。


局限性

尽管 Apple-π 能更细致地评估视频模型的物理推理能力,但仍存在一些不足。


例如Apple-π 覆盖的范围仍然有限。它主要聚焦经典刚体力学,包括重力驱动运动、动量守恒碰撞、牛顿第一定律,以及这些规律的简单组合,但并未评估流体、热力学、电磁学、断裂、颗粒介质、生物运动或量子现象。


同时Apple-π 覆盖的物体和场景也不全面。数据中的动态物体只包括球体、立方体、圆柱体和圆锥体。由于使用单一固定相机,因此它并不直接考察多视角一致性或新视角生成能力。


研究团队指出,Apple-π 的输入设置依然依赖第一帧标注来固定场景与物理量的对应关系。因此,基准主要考察模型在已有视觉场景下的物理推理能力,不测试模型能否仅凭文本构造完整物理场景。


此外,当前的评估方式也存在不足。MLLM 裁判无法完全判断物理过程是否正确,因此 Apple-π 还需要结合掩码、像素和速度等指标,这些指标也会受到分割质量、画面差异和标注噪声的影响。


最后,Apple-π 在时间归一化上也有局限。评估默认将完整解码后的输出视为提示词要求的物理时长,但视频生成服务可能返回不随请求时长变化的固定长度视频容器,评估结果会因此受到影响2。


作者:夏千斯

图片

文章精选:

1.图灵奖得主姚期智最新演讲: AI有边界,恰恰是好事

2.图灵奖得主本吉奥警告全网:AI已经学会“演给安全测试看”,下一代我们可能真的抓不住了!
3.图灵奖得主萨顿 WAIC 2026 最新演讲:现在的 AI 还不算真智能,我们正迈入经验时代
4.菲尔兹奖得主陶哲轩最新访谈:未来数学属于人类与 AI 的混合体
5.图灵奖得主、AI教父辛顿:AI已具备意识,且将进化成远超人类的智能生命体
6.图灵奖得主、“AI教父”辛顿认错:我当年想得太简单!卡死医疗AI落地的,其实是背后的法律
7.图灵奖得主Bengio预言o1无法抵达AGI!Nature权威解读AI智能惊人进化,终极边界就在眼前
8.图灵奖得主、强化学习之父Rich Sutton:大语言模型是一个错误的起点
9.图灵奖得主杨立昆:大语言模型缺乏对物理世界的理解和推理能力,无法实现人类水平智能
10.压缩即是全部 —— 菲尔兹奖得主 Michael Freedman 给数学和 AI 的一封信

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/199333