首个物理定律评估基准 Apple-π 登场,揭示视频生成模型距通用世界模拟器差距大 【导语近年来基于视频生成模型的世界模型成为人工智能热门方向但现有基准难验证模型是否形成“物理直觉”。南洋理工大学团队提出以物理定律为核心的评估基准 Apple-π揭示当前模型距可靠通用世界模拟器差距大。】Apple-π锚定物理定律的评估基准基于视频生成模型的世界模型备受关注不过现有基准难以验证模型是否形成“物理直觉”。为此南洋理工大学 S-Lab 团队及其合作者提出首个以物理定律为核心的视频模型评估基准 Apple-π。它要求模型感知物理量、表述支配定律推导出后续运动并定位推理失败步骤。其具体设计包括视频数据集 Orchard 包含 400 个经典力学视频任务分单一定律和多定律组合两类基准协议将案例拆为感知、表述和推导三类任务及五个子轨道评估套件采用混合评分机制各赛道得分归一化到 [0,1]。模型物理推导表现有限研究团队在完整 Apple-π 基准上评估 11 个代表性模型结果显示视频预训练、推理监督和统一理解能改善模型的感知和表述能力但无论哪类模型物理推导表现都十分有限。专有模型结果整体强于基础开源视频模型经过视频推理微调的 VBVR-Wan2.2 在视频模型中更具竞争力GPT Image 2 和 Nano Banana 2 结果领先说明显式理解和可控视觉生成有帮助。即便 SOTA 模型得分也仅 0.473物理运动推理是主要瓶颈。模型推理环节问题多Apple-π 还将评测流程拆分为三个阶段考察模型多方面能力。结果表明模型错误不仅出现在最终生成阶段中段物理推理环节也存在问题。部分模型虽能完成标注读取和物体定位但在物理规则选择、状态更新和后续运动预测上明显不足更多依赖表层视觉模式匹配未形成稳定物理状态建模能力。Apple-π 仍有局限性尽管 Apple-π 能更细致评估视频模型物理推理能力但存在诸多不足。它覆盖范围有限主要聚焦经典刚体力学未涉及流体、热力学等现象覆盖的物体和场景不全面不考察多视角一致性或新视角生成能力。其输入设置依赖第一帧标注主要考察已有视觉场景下的物理推理能力当前评估方式存在不足MLLM 裁判无法完全判断物理过程结合的指标也受多种因素影响时间归一化也有局限评估结果可能受视频生成服务返回情况影响。编辑观点Apple-π 的提出为视频生成模型评估提供了新视角揭示了现有模型的不足。虽有局限但为后续研究指明方向推动模型向真正理解物理世界迈进。