Command Palette
Search for a command to run...
VGI-Bench:探析视频生成模型中的视觉智能
VGI-Bench:探析视频生成模型中的视觉智能
摘要
近期研究表明,视频生成模型可以通过生成的帧展现出某种形式的零样本视觉推理能力。然而,可靠的评估仍然具有挑战性:基准测试应采用与当前视频模型视觉先验一致的输入,要求有效的演化过程而不仅仅是合理的最终状态,并校准任务难度以保持挑战性但部分可行。为此,我们引入了 VGI-BENCH,包含 27 个任务和 810 个实例,通过任务领域和技能标签的两级分类法组织,用于对视频生成模型的视觉推理能力进行细粒度评估。我们的评估表明,当前的生成系统可以解决一部分基于视觉的推理任务,但仍远未达到可靠水平,即使是最强的模型 Seedance 2.0,在我们的评估标准下也仅达到 51.0% 的准确率。我们的分析进一步探讨了输出失败模式、输入条件敏感性、合成微调的迁移性能边界,以及内部去噪视角所揭示的有限自我修正能力,即后续步骤主要优化早期假设而非纠正推理错误。我们希望 VGI-BENCH 能够有助于推动下一代视频生成模型的发展。
一句话总结
伊利诺伊大学厄巴纳-香槟分校、清华大学、滑铁卢大学、麻省理工学院等机构的研究者提出了 VGI-Bench,这是一个包含 27 个任务和 810 个实例的基准,采用两级分类体系组织,用于探测视频生成模型中的零样本视觉推理能力。评估结果显示,即使是最强的模型 Seedance 2.0,也仅达到 51.0% 的准确率,揭示了模型有限的自我修正能力:后续去噪步骤只是细化早期假设,而非修正推理错误。
核心贡献
- 提出 VGI-BENCH,一个包含 27 个任务和 810 个实例的基准,采用任务领域和技能标签的两级分类体系组织,在真实输入、过程敏感的任务设计和校准难度下评估视频生成模型的视觉推理能力。
- 对当前图像和视频生成模型进行了广泛评估,展示了新兴的推理能力但远未达到可靠水平,最强模型(Seedance 2.0)在该基准标准下仅达到 51.0%。
- 提供了对视频模型推理的多方面诊断分析,涵盖失败模式(如物理崩溃、规则违反、物体/状态不一致)、输入条件敏感性、合成微调的有限迁移以及去噪动态,揭示了有限的自我修正能力:后续步骤细化早期假设而非修正推理错误。
引言
视频生成模型越来越被视为不仅是视觉世界模拟器,也是潜在的视觉推理器,能够通过生成的帧序列来表达推理任务的解决方案。然而,现有的用于评估此类零样本推理的基准存在显著不足:它们通常依赖与这些模型的自然图像先验不匹配的抽象或线条输入,包含无需模拟场景演化即可解决的任务,并且未能控制任务难度,导致评估可能反映的是领域不匹配或不可行性,而非真正的推理局限。为解决这些问题,作者提出了 VGI-BENCH,一个通过逼真输入、需要有效中间轨迹的过程敏感任务以及接近当前能力边界的校准难度水平来评估视频生成模型视觉智能的基准。作者系统评估了一系列当代视频和图像生成模型,发现即使是最强的模型 Seedance 2.0,在其标准下也仅达到 51.0,常见失败模式包括物理崩溃、规则违反以及物体或状态不一致。他们的诊断分析进一步揭示,性能对输入条件和视觉风格敏感,合成微调仅部分迁移到真实任务,且当前模型在去噪过程中表现出有限的自我修正能力,为塑造和限制视频生成模型推理的因素提供了详细视角。
数据集
作者构建了 VGI-BENCH,一个用于评估生成模型视觉智能的基准。该数据集围绕两级分类体系组织:四个互斥领域和七个非排他性技能标签。四个领域为视觉组织、物理操作、结构化谜题和时空动态。技能标签受视觉认知理论启发,包括空间、时间、规划、属性锚定、物理、拓扑和可供性。这种设计允许对模型能力进行粗粒度和细粒度的诊断。
任务收集与组成
- 每个任务遵循统一的输入/输出格式:模型接收文本提示和作为第一帧的输入图像,然后生成完成指定视觉过程的视频。
- 任务设计为过程敏感的,意味着成功取决于中间状态演化和符合规则的轨迹,而不仅仅是最终状态的正确性。
- 每个任务在三个难度级别上实例化,每个级别约十个实例。每个实例由输入图像、文本提示和任务特定的评估标准组成。
- 输入图像来自网络图像、现有数据集,或使用图像生成模型(如 GPT-Image-2 和 Nano Banana Pro)生成。生成的输入经过人在环路审查流程以去除意外伪影。所有图像统一为 16:9 宽高比。
- 文本提示指定任务目标、相关物体、属性、允许的操作、禁止的捷径和任务特定规则。它还包括与任务无关的背景、布局、相机运动和视频速度控制,以保持生成的视频聚焦于程序性推理。
- 每个任务配有一个参考解决方案,可以是图像(如突出显示迷宫中有效路径)或期望最终状态的文本描述(如解开绳结)。这些参考指导任务提出和标准构建。
质量控制和过滤
- 预生成阶段校准任务难度。对于每个提议的任务,作者采样两个最简单级别的实例,并在多个最先进的视频生成模型(包括 Sora2、Veo3.1 和 Kling3.0)上进行测试。只有当至少一个模型解决该任务且至少一个模型失败时,任务才被接受;否则,修改任务设计和输入材料。这过滤掉了对当前模型而言可平凡解决或完全不可行的任务。
- 每个任务实例经过人工审查,确保其忠实于预期目标,适合典型的视频时长限制(5 到 10 秒),并由清晰的提示描述。不合格的实例被修改或丢弃。
评估标准与数据使用
- 评估使用两个互补指标:完整性(Comp.)和评分细则得分(Rub.)。完整性使用分级标准(完成、部分或失败)衡量朝向任务目标的全局进展,由 VLM 在 2fps 下对均匀采样的帧进行评判。评分细则得分通过细粒度检查清单衡量局部过程有效性,使用从粗到细的自适应帧采样策略(从 4fps 开始,然后在 8fps 下重新采样标记的区间),滑动聚焦窗口为 10 帧。
- 每个细则项目使用逆衰减惩罚 1/(x+1) 评分,其中 x 是违规次数。评分细则得分是所有项目级得分的平均值。
- 最终得分将 Comp. 与 Rub. 相乘,对任一类型的失败进行惩罚。这确保全局目标完成和局部规则遵守对于高分都是联合必要的。
数据增强
- 为了将基准扩展到图像生成模型,作者将某些任务改造为单图像输出格式,同时保留任务目标。例如,MAZE 被改编为绘制从起点到终点的有效路径,RECOVER 2D NET 被改编为渲染完整的 3D 结构。该分支使得在相关任务目标下可以比较静态推理和程序性推理。
方法
为确保基准中的每个任务对当前视频生成模型既有意义又可处理,作者引入了多阶段质量控制流程。该流程在最终任务实例纳入基准之前运行,旨在过滤掉那些要么平凡容易要么完全不可行的任务。
第一阶段是预生成校准步骤。对于每个提议的任务,作者在最简单难度级别上采样两个实例,并在多个最先进的视频生成模型(包括 Sora2、Veo3.1 和 Kling3.0)上进行测试。只有当至少一个模型成功解决采样实例而至少另一个模型失败时,任务才被接受。该接受标准确保任务既不会被所有模型平凡解决,也不会完全超出任何模型的当前能力。如果任务不满足此条件,作者修改任务设计及其输入材料。重要的是,此阶段作为合理性过滤器:它验证任务可以合理地表达为视频过程,而不是证明任何模型能完全解决它。第二阶段涉及人工审查。每个任务实例由人工标注者检查以确认三个属性:实例忠实于预期任务目标,实例适合典型的视频时长限制(5 到 10 秒),以及实例由清晰无歧义的提示描述。任何未通过这些检查的实例被修改或丢弃。
一旦任务实例通过质量控制,作者定义了一个双指标评估协议,以考虑任务的过程敏感性。因为如果轨迹违反任务规则,看似正确的最终状态是不够的,而局部合理的视频可能因朝向目标进展甚微而仍然失败,评估同时评估全局完成度和局部过程有效性。
第一个指标,完整性,捕获朝向任务目标的全局进展。由于不同任务具有不同的目标状态,作者定义了任务特定的分级标准,将生成的视频映射到三个级别之一:完成、部分或失败。基于 VLM 的评判器接收以每秒 2 帧(fps)均匀采样的帧集以及分级标准,并返回相应的级别。
第二个指标,评分细则得分,衡量整个视频中的局部过程有效性。对于每个任务,作者设计了覆盖显式规则和其他约束的细粒度检查清单。由于某些关键违规可能仅短暂出现,评估使用从粗到细的自适应帧采样策略。VLM 评判器首先以 4 fps 的粗采样率检查视频,对照检查清单并标记需要更仔细检查的区间。这些标记的区间随后以 8 fps 的更细采样率重新采样并重新评估,使评判器能够捕获瞬态违规而无需密集采样整个视频。为保持每次判断的聚焦性,作者采用 10 帧的滑动聚焦窗口并带边缘帧重叠,使得每次只检查一个小局部片段。每个细则项目使用逆衰减惩罚 1/(x+1) 评分,其中 x 是该项目的违规次数。这种衰减反映了直觉:一旦违规重复发生,额外发生的边际效应递减。评分细则得分是所有项目级得分的平均值。作者指出,其他单调衰减函数(如指数衰减)同样适用并保持相同的定性趋势。
视频的最终得分将两个指标相乘:最终得分是完整性和评分细则得分的乘积。这种乘法设计对任一类型的失败进行惩罚。例如,几乎静态的视频保留了大部分局部约束,产生高评分细则得分,但朝向任务目标进展甚微,导致低完整性得分。相反,视频可能看似达到目标状态,产生高完整性得分,同时违反规则,导致低评分细则得分。聚合将两个方面视为联合必要条件,防止任一方面单独主导评估。
为将基准扩展为图像生成模型推理的测试平台,作者将部分视频任务改造为单图像输出格式,同时保留原始任务目标。这种改编不与过程敏感的任务设计矛盾:原始视频任务评估视频模型能否通过时间状态演化表达过程,而图像版本询问图像模型能否推断并渲染目标状态或视觉解决方案。例如,MAZE 任务被改编为绘制从起点到终点的有效路径,RECOVER 2D NET 任务被改编为渲染完整的 3D 结构。该分支使得在相关任务目标下可以直接比较静态推理和程序性推理。
实验
评估使用两个互补指标:完整性用于全局目标进展,评分细则得分用于局部过程有效性,两者相乘要求同时满足。商业视频模型优于开源模型但仍远未解决,结构化谜题以及拓扑和时间技能是最薄弱的领域。基于 VLM 的评估器与人类判断高度一致,消融实验确认自适应帧采样和滑动聚焦窗口都是必要的。在合成数据上的微调迁移不均匀,改善了训练分布中表现良好的技能,而物理交互和强时间依赖基本不变,去噪动态分析揭示自我修正很少见,修订大多在不同错误状态之间移动而非朝向正确状态。
基准比较显示,大多数现有视频基准缺乏逼真输入、过程敏感任务或难度控制中的至少一项,而所提出的基准独特地结合了高推理需求、真实外观、过程敏感性和难度校准。该设计旨在减少视觉领域不匹配,并确保任务需要显式展开推理而非可从静态输入回答。只有所提出的基准结合了高推理需求与逼真输入、过程敏感任务和难度控制。若干现有基准使用抽象或合成输入,可能导致领域不匹配并削弱评估有效性。大多数基准不要求过程敏感推理,意味着无需模拟场景演化即可回答。许多基准缺乏难度控制,导致任务过难而无法提供诊断信息。
商业视频生成模型始终优于开源模型,Seedance-2.0 取得最高总分,但所有模型仍然显著困难,尤其是在结构化谜题以及需要拓扑和时间推理的任务上。商业与开源之间的性能差距在简单和困难级别均明显可见,即使最好的模型也远未达到完美成功率。Seedance-2.0 以 51.0 的总分领先,但所有模型远未解决任务。商业模型在所有类别中均优于开源模型,视觉组织领域的差距最大。结构化谜题是最具挑战性的领域,暴露了多步规则和状态跟踪中的失败。拓扑和时间是最弱的技能维度,表明在连通性保持和多步状态跟踪方面存在问题。要求完美完整性和评分细则得分的严格成功率显著较低,突显了该基准的难度。
基于 VLM 的评估器的可靠性以人类标注为基准进行衡量,完整方法达到最高一致性。移除自适应帧采样或滑动聚焦窗口的消融降低了性能,将基础模型替换为更便宜的替代品也会降低可靠性。使用 Gemini-3-Flash 的完整评估器达到最高 AUC 和成对准确率,优于所有消融。移除自适应帧采样或滑动聚焦窗口会降低 AUC 和成对准确率,确认两个组件都是必要的。将基础模型替换为更便宜的替代品(GPT-5-mini、Claude-Haiku-4.5、Qwen3.6-Plus)导致一致性大幅下降,最弱模型表现接近随机水平。
在改编的静态目标状态子集上,商业图像模型优于开源模型,Nano-Banana-Pro 在平均成功率上领先。大多数模型的性能从简单任务到困难任务下降,表明存在明显的难度梯度。该设置仅测试目标状态推断和渲染,而非视频基准中评估的时间过程有效性。Nano-Banana-Pro 在商业模型中取得最高平均成功率,而开源模型显著落后。大多数模型在困难任务上的成功率低于简单任务,确认了有意义的难度梯度。商业与开源之间的性能差距与视频分支一致,但所有模型在改编子集上仍远未完美。
在合成数据上微调视频生成模型提高了所有结构重叠组的推理性能,与训练分布最一致的任务收益最大。然而,迁移受结构覆盖限制,任务级改进不均匀,一些非重叠任务仍然受益,而某些能力难以改进或出现退化。对于所有三个基础模型,性能提升随与训练分布的结构重叠减少而下降。VBVR-Wan2.2 模型在重叠任务上显示出最大的绝对改进,而非重叠收益较小但仍为正。VBVR-Wan2.1 模型在非重叠任务上实际出现退化,表明该设置中存在负迁移。任务级结果各不相同:例如,UN-TIE_KNOT 在成功率上变化不大但评分细则得分大幅提升,表明行为更受控而非新的推理能力。改进集中在合成数据中表现良好的技能上,如规划和空间推理,而物理交互和强时间依赖仍难以改进。
所提出的基准独特地结合了逼真输入、过程敏感任务、难度控制和高推理需求,弥补了现有视频基准中常依赖抽象输入或缺乏过程敏感性的不足。评估显示商业视频生成模型始终优于开源模型,但所有模型仍然显著困难,尤其是在结构化谜题以及拓扑或时间推理方面,严格成功率显著较低。基于 VLM 的评估器在使用自适应帧采样、滑动聚焦窗口和强基础模型时达到最高可靠性,消融这些组件会降低与人类标注的一致性。在改编的静态图像子集上,商业模型再次领先但仍远未完美,在合成数据上微调视频模型产生不均匀的收益,改善了重叠任务的推理,同时存在非重叠任务负迁移的风险。