这项由中国科学院自动化研究所(CASIA)联合香港中文大学(CUHK)、上海人工智能实验室(SLAI)、高德地图(AMAP)及清华大学(THU)共同完成的研究,于2026年8月以预印本形式公开发布,论文编号为arXiv:2608.02603。感兴趣的读者可通过该编号在arXiv平台查阅完整原文。
**研究背景:为什么给AI视频生成打分这么难**
考虑这样一个场景:你在玩一款电子游戏,操控一个角色走向一段楼梯。一个真正理解世界的游戏引擎会让角色的脚步随台阶高低起伏;一个"只懂皮毛"的引擎,则可能让角色像幽灵一样直接飘过楼梯,双脚悬空。这两种游戏,你一眼就能分出好坏。然而,现在的AI视频生成模型评测体系,长期停留在"画面好不好看"和"角色有没有按指令动"的层面,根本没有追问那个更关键的问题:**这个AI生成的"世界",真的会对周遭环境做出合理反应吗?**
这正是这支研究团队想要解决的问题。他们开发了一套名为**WorldExam**的评测基准,把视频世界模型的能力层层拆解,从表面画质一直追问到深层的"世界反应性"——也就是说,当AI生成的角色靠近障碍物时,障碍物会动吗?当它撞上别人时,对方会让路吗?当不稳定的物体失去支撑时,它会掉下来吗?
**一、什么是"世界模型",为什么它和普通视频生成不一样**
普通的AI视频生成,就像一台高级打印机:你描述一个场景,它给你生成一段符合描述的视频,追求的是"看起来像真的"。而"世界模型"追求的是更高一层的目标:它需要像一个微型物理世界一样运转,能够根据当前状态推断出"接下来应该发生什么",而不仅仅是"画出指令要求的内容"。
打个比方,一台普通视频生成AI像是一位经验丰富的摄影师,你说要拍什么,他就拍什么,画面精美,构图讲究。而世界模型则更像一位导演兼物理学家——他不仅要拍出你要求的场景,还要确保场景中每一个物体的行为符合物理规律,每一个路人的反应符合社会常识,每一块地形都会对角色的运动产生真实影响。
目前,这类模型主要分三种。**摄像机驱动型**模型接受摄像机的运动轨迹作为指令,本质上是在控制"观察世界的视角如何移动"。**动作驱动型**模型接受类似电子游戏键盘的操作指令(W前进、S后退、A左移、D右移等),直接控制场景中的角色动作。**语言驱动型**模型则接受自然语言描述,你用文字说"角色向前走然后右转",它就生成对应视频。三种类型的模型各有所长,但也各有短板,WorldExam的一个重要贡献就是用统一的框架把这三种类型放在同一张考卷上进行比较。
**二、WorldExam是一张怎样的考卷:四个难度层级**
WorldExam的设计逻辑,就像学校里的分层次考试:从最基础的"写字工整吗",逐步升级到"能解应用题吗",再到"能解开放式大题吗"。整套基准共包含1474道测试题,横跨八项专项任务,形成四个由浅入深的诊断层级。
**第一层是视觉质量(Visual Quality)**,考察的是最基础的"画面好不好看"。这里涉及六项通用指标:画面前后颜色是否一致(照度一致性)、画面是否有闪烁抖动(时序稳定性)、主体形象是否保持连贯(主体一致性)、整体美感如何(美学质量)、动作是否流畅(运动平滑度),以及基本的成像质量。这一层是所有模型的"入门考",做得不好的模型直接暴露了生成能力的基线缺陷。
**第二层是控制遵从性(Control Adherence)**,考察的是"模型能不能按指令动"。这里分为两项任务。"摄像机控制"测试摄像机运动是否真的按照指令描述的方向和时间比例执行;"主体控制"则测试场景中的指定角色能否按照给定的方向序列运动。这一层相当于考察"执行力"——指挥官下达命令,士兵是否准确执行。
**第三层是空间一致性(Spatial Consistency)**,考察的是"模型有没有空间记忆"。通过"场景重访"任务实现:让摄像机先往某个方向运动,然后原路返回,看最终画面是否和一开始的初始帧保持一致。这就像你在一个房间里先向左走,再向右走回原位——如果你是真正"理解"这个空间的,你看到的应该和出发时一样。而如果模型只是在"编造"视频,往往在返回时会生成截然不同的场景,就像一个路痴从原路返回却发现街道全变了。
**第四层是世界反应性(World Reactivity)**,这是整张考卷最难的部分,也是WorldExam最核心的创新所在。这一层要测试的是:模型在没有被明确告知"应该发生什么"的情况下,能否根据初始场景自动推断出合理的连锁反应。
**三、"世界反应性"这道大题究竟怎么考**
世界反应性这一层共设五项任务,每项任务的设计都遵循同一个原则:指令只告诉模型"做什么动作",但绝口不提"环境应该如何响应"。
**地形交互(Terrain Interaction)**:场景中有楼梯、斜坡、沟渠或桥梁等地形,指令只说"向前走",但从未提到"你要上台阶了,脚要抬高"。评测的是模型能否自动推断出角色在不平坦地形上的正确高度变化和身体姿态调整。一个好的世界模型,角色脚踩台阶时应该一步一步抬脚;一个"只看表面"的模型,角色可能会浮空漂过去,像没有重力一样。
**物体交互(Object Interaction)**:场景中放置了一个可以被撞动的物体,指令只说"向前走",但从未说"撞上那个物体会发生什么"。评测的是接触发生后,物体的反应是否符合其物理属性——松散的物体应该被推动,柔软的物体应该变形,坚硬固定的物体应该阻挡主体。最糟糕的情况,是主体像幽灵一样穿过物体,或者物体完全无动于衷。
**社会交互(Social Interaction)**:场景中有其他行人或智能体,当主体移动到他们附近时,这些"路人"应该如何反应?指令只控制主体的运动,从不说明"周围的人要怎么应对"。评测的是这些背景角色能否做出合理的回避、礼让或停步等社交反应。如果路人对一辆径直开来的车毫无反应,继续若无其事地走进车轮,那说明这个世界根本不"活"。
**物理反应(Physical Reaction)**:这项任务测试的是一个纯粹由物理规律驱动的过程,例如一个重心超出支撑面的篮子开始缓慢倾倒、最终落地,或者一个被推动的物体在惯性作用下继续滑行。某些情况下指令甚至是"停止"(?),意思是主体完全静止,让物理过程自行演化。评测的是引力、摩擦力、动量、弹性等物理规律是否真实地体现在画面中。
**目标完成(Goal Completion)**:这是唯一只面向语言驱动型模型的任务,也是整套考卷概念层次最高的一项。给定一个高层次目标,例如"用螺丝刀松开蓝色玩具车的电池仓螺丝",场景中摆放了蓝色玩具车、红色玩具车、螺丝刀还有一枚硬币作为干扰物。模型需要自己判断:应该拿起螺丝刀而不是硬币,应该操作蓝色玩具车而不是红色的,应该对准电池仓的螺丝位置……整个执行过程的每一步都由模型自行推断,而不是由指令逐帧指定。这考察的是一种类似"理解意图、自主规划、正确执行"的综合能力。
**四、1474道题是怎么设计出来的**
WorldExam的题目设计分两条路线。针对摄像机控制和场景重访这类"静态场景任务",研究团队直接从已有的真实场景数据集中挑选合适的第一人称视角图像,然后搭配精心编排的摄像机运动指令组合。
针对主体控制和五项世界反应性任务这类"动态交互任务",则启动了一个更精密的流水线。首先,研究团队为每项任务建立了一个"情景模式库",例如地形交互任务中包含了楼梯(占29%)、地下通道(16%)、平台(15.5%)、台阶块(15%)、斜坡(10%)等多种地形类型;物体交互任务中包含了门/闸门(24%)、标识牌/锥桶(13%)、容器(12%)、墙体(12%)等各类物体。
从模式库中抽取一个具体情景后,一个由大语言模型驱动的"结构化案例生成器"会将其扩展为完整的场景描述草稿,包括:详细的场景文字描述、用于生成初始帧图像的提示词、主体控制指令,以及一份用于最终评测的"核查清单"草稿。
接下来,用图像生成模型批量生成N张候选初始帧,再由人工筛选。筛选标准非常具体:关键物体必须清晰可见、空间布局必须支持预设行为的发生、图像内容必须与场景描述一致、并且场景中必须留有足够的运动空间。已经提前展示了最终结果(例如物体已经倒地)、关键实体被遮挡、或者物理上根本无法完成预设动作的图像,都会被淘汰。
最终选定的初始帧图像会送入"图像条件案例精炼器",对场景描述、语言提示词和核查清单进行细化,确保所有描述都与实际图像中的实体和空间关系精确对应。这套流程确保了每一道题目都是"可解的",同时又不会在题目本身中泄露答案。
**五、评分是怎么做的:从3D重建到AI阅卷**
WorldExam的评分体系同样分层设计,不同任务用不同的评分方式,但整体逻辑就像一个多学科联合阅卷小组。
针对摄像机控制、场景重访、主体控制和地形交互这四项任务,研究团队采用了一种颇具创意的方法:把生成的视频"立体化"。具体来说,他们用一个名为VGGT-Ω的几何重建模型,从每帧画面中估算出摄像机的位置、姿态和场景深度信息,相当于把二维视频"还原"成一个三维空间,然后在三维空间里对轨迹进行精确的数学分析。
摄像机控制的评分,是把从视频中还原出来的摄像机运动轨迹,与指令要求的理想轨迹进行比对,分别计算平移误差和旋转误差。为了公平处理不同类型模型的差异,研究团队还设计了一套"图像空间位移对齐"机制——因为相同的数值指令在不同模型中可能触发完全不同幅度的画面变化,就像同样踩下油门,不同马力的车会产生完全不同的加速度,直接比较数值误差并不公平。解决方法是,先给每个摄像机驱动型模型做一次"标定测试",测量它在默认输入下能产生多大的画面位移,然后据此缩放输入指令,让所有模型生成的画面位移量处于同一基准线上,再进行比较。
场景重访的评分更有意思:在摄像机执行完往返运动之后,从返回段中选取与初始摄像机姿态最接近的那一帧,与初始帧进行图像质量比较,用PSNR(峰值信噪比)、LPIPS(感知相似度)和SSIM(结构相似性)三个指标衡量画面的保真度,再结合"是否真的回到了初始视角"这个二元判断,综合给出最终分数。
主体控制的评分,则是用SAM2这个图像追踪工具,从初始帧的主体掩码出发,全程追踪主体的运动轨迹,再用VGGT-Ω将这条追踪轨迹从二维像素坐标还原到三维世界空间,最后评估三维轨迹是否符合指令要求的运动方向。
地形交互的评分有一个巧妙设计:除了生成视频用的初始帧之外,研究团队还额外提供了一张"无主体的地形图"——就是把角色从场景里"抹掉",让3D重建算法能够看清完整的地形几何形状。这样就能精确地把主体的三维运动轨迹"投影"到地形表面上,逐点比较主体高度和地形高度的变化是否吻合。
至于物体交互、社会交互、物理反应和目标完成这四项任务,涉及的是语义理解和因果判断,无法用轨迹误差来量化,因此改用GPT-5.5作为"AI阅卷老师",对照案例专属核查清单逐条评判。每张核查清单通常包含6到8个可观察的具体条目,例如"篮子是否从洗衣机上倒下而非滑回原位"、"物体的运动是否从支撑点附近开始倾斜"等。AI老师从视频中均匀采样10帧,逐条给出满足或不满足的判断,任何模糊、不可见或画面外的情况都算不满足,最终得分是满足条目数占总条目数的比例。
为了验证AI阅卷的可靠性,研究团队专门做了人工评测对照实验:在800个评测样例上,由三名人类标注员独立打分,以多数票决定参考答案,再与AI老师的分数进行相关性分析。结果显示,在所有800个样例上,AI老师与人类评分的斯皮尔曼相关系数达到0.8614,皮尔逊相关系数达到0.8583,属于强相关,说明这套AI阅卷机制是可靠的。
**六、20个模型上考场:结果如何**
研究团队共评测了20个代表性视频世界模型,其中6个摄像机驱动型、7个动作驱动型、7个语言驱动型,包括NeoVerse、InSpatio-World、WorldPlay、LingBot-World、Veo 3.1、Hailuo 2.3、Vidu Q3等业界知名模型。
在摄像机控制这道题上,摄像机驱动型模型的优势非常明显。其中,NeoVerse以97.33的高分领跑,InSpatio-World以85.94紧随其后,这两个模型的共同特点是都采用了"3D重建后重新投影"的生成策略——先从初始图像重建出三维结构,再把新的摄像机视角渲染出来,因此摄像机轨迹的控制精度极高。反观采用"将摄像机姿态编码成向量输入"策略的ReCamMaster和FantasyWorld,分数分别跌至38.64和18.46,尽管这两个模型的画质评分依然很高。这说明画质好并不等于控制精确,两者可以完全脱节。在动作驱动型模型中,WorldPlay以92.74的成绩脱颖而出,是该类型最强的选手。语言驱动型模型整体表现最弱,最好的Hailuo 2.3只有63.29,说明用自然语言来精确描述复杂的摄像机运动序列,本身就存在相当大的信息损失。
场景重访这道题上,NeoVerse和InSpatio-World都实现了100%的返回成功率,综合得分分别为89.25和85.90。WorldPlay在动作驱动型中表现最佳,返回成功率79%,综合分72.51。语言驱动型中最好的Hailuo 2.3,返回成功率只有50.5%,综合分48.70——意味着有近一半的时间,模型让摄像机"迷路了",无法回到出发点。
进入动态交互赛道后,画风发生了明显转变。在主体控制这道题上,动作驱动型模型的优势出现了:LingBot-World以55.47拿到最高分,WorldPlay得49.75,而语言驱动型模型最好的Veo 3.1只有37.28。然而,即便是动作驱动型模型的最高分,离满分也还相差很远,常见的失误是模型把主体控制指令错误地理解成了摄像机运动,或者场景直接静止不动。
地形交互这道题,动作驱动型模型暴露出了一个关键问题:从主体控制到地形交互,分数出现了"悬崖式下跌"。WorldPlay的主体控制分是49.75,但地形交互只有27.49,LingBot-World从55.47跌到24.33。换句话说,即便这些模型能让角色向前走,它们也大多数时候不知道"走在台阶上应该怎么走"。而语言驱动型模型在这道题上反超了动作驱动型:Vidu Q3得64.39,Hailuo 2.3得61.57,Seedance 1.5得53.83,全面超过动作驱动型的最高分27.49。
物体交互上,Veo 3.1以75.96领跑,Vidu Q3以71.59紧随,而动作驱动型最好也只有33.75。语言驱动型模型在这道题上展现出了明显的理解力——它们似乎更"懂得"接触会产生什么后果。
社会交互这道题的差距最为悬殊。Veo 3.1拿到了85.10的高分,Vidu Q3拿到了81.91,而动作驱动型最好的LingBot-World只有60.37。大量失败案例是:路人完全无视走过来的主体,或者主体直接"穿过"路人,就像双方都是幽灵。
物理反应这道题,Hailuo 2.3以63.84拿到最高分,Veo 3.1和Vidu Q3分别以61.76和61.23紧随,动作驱动型最好的LingBot-World只有33.43。物理过程的自主演化,对动作驱动型模型来说几乎是盲区。
目标完成这道语言模型专属题,HappyHorse 1.0和Veo 3.1以85.33和85.30并列第一,表现出色。而Kling 2.5尽管在视觉质量上是语言驱动型模型中得分最高的,目标完成分却只有48.25,清晰印证了"画面好看≠理解任务意图"这一结论。
研究团队还额外验证了评测系统对底层技术细节的鲁棒性:用另一个深度估计模型(DA3)替换原本的几何重建工具,重新跑了所有几何相关指标。结果显示,所有模型在静态场景赛道的整体分数平均绝对变化只有3.09%,在动态交互赛道只有0.57%,模型排名基本保持不变。这说明评测结论不依赖某一个特定的底层工具,具有相当的稳定性。
**七、这套考试揭示了什么**
通过这张覆盖四个层级、八项任务、三类接口的统一考卷,一个清晰的格局浮现出来。
摄像机驱动型模型是摄像机控制和场景空间记忆方面的绝对强者,但它们的接口根本不支持角色动作控制,在世界反应性测试上连上场的资格都没有。动作驱动型模型能较精确地控制角色运动,但它们往往只是让角色"动起来",而无法让世界其他部分对这个动作做出响应——地形不配合、物体不反应、路人不让路、物理过程不展开。语言驱动型模型在理解和生成复杂的交互结果上表现最好,能更好地处理"场景条件反应",但在执行复杂的精确运动控制时远不如前两类模型准确。
更重要的是,视觉质量高并不能预测世界反应性好。七个语言驱动型模型的视觉质量通用分数集中在79.64到81.04的极窄区间内,但它们的任务综合分却从39.85到65.02大幅散开,相差将近30分。这意味着,用画质来评价世界模型,就像用一份菜的摆盘精美程度来评价厨师的烹饪水平——有时候确实相关,但根本不是核心能力的体现。
归根结底,这项研究的核心发现是:当前没有任何一个模型能同时在所有任务上表现优秀,三种接口类型各自擅长不同的事,世界反应性这一核心能力在所有类型的模型中都有相当大的提升空间。让AI生成的"世界"真正活起来、真正会对外界刺激做出合理反应,仍然是这个领域面临的重大未解难题。WorldExam的意义在于,它第一次用一套严格统一的框架,把这个差距清晰地量化和呈现了出来,为后续研究者指明了需要努力的方向。
Q&A
Q1:WorldExam评测基准和其他视频生成评测工具有什么区别?
A:WorldExam最核心的区别在于它专门测试"世界反应性"——也就是AI生成的场景中,环境有没有对角色的行为做出合理回应。现有的大多数评测工具主要看画面质量或指令是否被执行,但不追问"角色走到台阶上,脚步有没有随台阶起伏""撞上物体后物体有没有被推动"这类更深层的问题。WorldExam设计了四个难度层级、八项专项任务,并且统一覆盖了摄像机驱动、动作驱动和语言驱动三类模型,是目前覆盖面最广、诊断层次最深的同类评测框架之一。
Q2:为什么语言驱动型模型在世界反应性任务上比动作驱动型模型表现更好?
A:从WorldExam的实验结果来看,语言驱动型模型在地形交互、物体交互、社会交互等任务上全面超过了动作驱动型模型。研究团队的分析认为,语言驱动型模型在训练过程中接触了大量带有因果关系和物理常识描述的文本数据,因此对"接触会导致什么结果""不稳定物体会如何运动"有更多隐性的知识积累。而动作驱动型模型的训练目标更偏向于精确执行离散动作,对场景中其他元素的联动响应关注较少,导致角色虽然能按指令移动,但周围的世界却"无动于衷"。
Q3:WorldExam评测中用AI自动打分准确吗,和人类判断一致吗?
A:研究团队对此进行了专项验证。在物体交互、社会交互、物理反应和目标完成这四项需要语义判断的任务中,他们抽取了800个评测样例,由三名人类标注员独立打分,以多数票作为参考答案,再与GPT-5.5的AI打分进行比较。结果显示,两者的斯皮尔曼相关系数为0.8614,皮尔逊相关系数为0.8583,属于强相关水平。具体到各项任务,目标完成任务的一致性最高(0.8960),社会交互任务相对最低(0.7019),但整体来看AI评分与人类判断的吻合度足以支撑可信的模型比较结论。