HyperAIHyperAI

Command Palette

Search for a command to run...

VBVR-Pro:一个可扩展且可验证的原生视觉推理套件

摘要

原生视觉推理将视觉生成本身视为推理的媒介:视觉状态(即图像和视频)不仅是待理解或待渲染的输入输出,更是超越语言的问题求解的一等基质。然而,由于缺乏可扩展的训练任务、可靠的反馈以及跨生成基质的受控比较,该领域的进展仍受到瓶颈制约。在本工作中,我们引入了 VBVR-Pro,一个闭环测试平台,使通过生成实现的原生视觉推理变得可训练、可验证、可优化且实验可控。1) 任务扩展。VBVR-Pro 将视觉推理转化为一个包含 300 个程序化生成任务的受控任务空间。在 VBVR-Pro 上训练的模型在七个外部视觉推理基准(如 RISE-Video、MME-CoF-Pro 和 BabyVision)上展现出超越所提套件的强迁移能力。进一步分析验证了这些增益反映了视觉推理能力而非指令模式拟合。2) 可验证奖励。VBVR-Pro 为任务基元评估提供了可验证的奖励评分器。通过对主流多模态大语言模型(MLLM)作为评判者的系统研究,我们识别出当前 VLM 作为评判者范式中反复出现的失败模式。相比之下,所提出的评分器基于确定性的任务特定规则,实现了与人类判断的细粒度对齐。重要的是,它们可作为大规模多任务强化学习的可靠奖励信号,并在视觉推理任务上展现出更强的强化学习后性能。3) 机制研究。VBVR-Pro 支持对超过 30 种图像、视频和交错生成器的受控模态研究。我们的分析表明,视频生成在需要持续时空状态跟踪的任务中仍最为强大,而交错生成通过外部化中间视觉状态提供了一种计算高效的替代方案。关键的是,消融和探测实验表明,视觉原生轨迹的存在是视觉推理中比显式语言思维链更关键的基质。我们发布所有数据、模型、评分器和代码,以促进未来研究。

一句话总结

VBVR-Pro 来自南洋理工大学、加州大学伯克利分校、加州大学圣地亚哥分校等机构,是一个闭环测试平台,包含 300 个程序化生成的任务、可验证的基于规则的奖励评分器(在多任务强化学习中优于 VLM 作为评判者的方法),以及覆盖 30 多个生成器的受控研究,证明视频生成在时空跟踪方面表现优异,且视觉原生轨迹优于显式语言思维链,适用于视觉推理。

核心贡献

  • 提出 VBVR-Pro,一个包含 300 个程序化生成视觉推理任务的闭环测试平台,并证明在其上训练的模型可迁移至七个外部基准(如 RISE-Video、MME-CoF-Pro、BabyVision),消融实验证据确认性能提升源于视觉推理而非指令模式拟合。
  • 提供可验证的、任务特定的奖励评分器,避免 VLM 评判者反复出现的失败模式,实现细粒度的人类对齐,并将这些评分器作为 50 个任务上多任务强化学习的可靠奖励信号,在视觉推理任务上取得更强的强化学习后性能。
  • 在超过 30 个图像、视频和交错生成器上开展受控模态研究,发现视频生成在持久时空状态跟踪方面最强,交错生成提供了一种计算高效的替代方案,消融和探针实验表明视觉原生轨迹比显式语言思维链是更关键的推理基质。

引言

大语言模型使语言成为研究机器推理的主导媒介,但物理世界中的许多智能形式本质上是非语言的,涉及空间变换、时间连续性、物体持久性和动态交互。以往工作难以系统性地研究原生视觉推理:现有基准大多仅用于评估而缺乏训练数据,大规模合成数据源侧重于简化的符号设置,基于 VLM 的评判者在需要精确计数、细粒度空间关系或时间一致性的任务上不可靠。作者提出 VBVR-Pro,一个闭环基础设施,使通过生成进行的视觉推理变得可训练、可验证、可优化和实验可控。它提供了包含 300 个任务和对齐模态(视频、关键帧图像和交错文本-图像数据)的程序化生成任务套件,可验证的奖励评分器在逐实例人类一致性上优于 VLM 评判者并支持强化学习,以及覆盖 30 多个生成器的受控比较。结果表明,视频生成在持久时空跟踪方面表现优异,交错生成提供了计算高效的替代方案,而纯图像生成在程序性推理上往往缺乏表达能力,诊断结果确认迁移收益源于学习的视觉推理操作而非指令模式拟合。

数据集

作者构建了 VBVR-Pro-Dataset,一个大规模合成数据集,旨在通过扩展任务覆盖范围而非仅增加实例数量来提高视觉推理的迁移性。

  • 数据集构成与来源

    • 该数据集由 50 多位研究人员和工程师协作构建。
    • 包含 300 个任务,其中 150 个是从现有 VBVR 基准重新实现和修订的,150 个是新增设计的以扩大覆盖范围。
    • 任务按照认知分类法组织,涵盖五种能力:感知、空间、变换、抽象和知识。单个任务可带有多个能力标签。
    • 每个任务由参数化程序(即生成器)生成,该程序对网格大小、物体数量、布局、外观和难度等配置进行采样,然后实例化一个问题实例并附带程序化推导的解决方案。
  • 每个子集的关键细节

    • 完整数据集涵盖 300 个任务。
    • 从 300 个任务中,50 个被保留用于域外评估。
    • 从其余 250 个任务中,作者对每个任务采样 5,000 个实例,共产生 125 万个训练实例。
    • VBVR-Pro-Bench 共包含 100 个任务:50 个域外任务加上从有训练数据的 250 个任务中选出的 50 个域内任务。
    • 专门的强化学习训练集覆盖这 50 个域内任务,并用于实验中。
  • 论文如何使用数据

    • 训练集用于监督微调和强化学习实验。
    • 在强化学习实验中,作者使用覆盖 50 个域内任务的 5 万实例子集,从相同的基础模型检查点开始。
    • 数据集在统一任务分布下支持视频、图像和交错模态。
  • 裁剪策略、元数据构建及其他处理细节

    • 每个已求解实例包含一个元数据文件,记录随机种子、问题规格、完整解决方案和关键元素属性。该元数据为可验证的奖励评分器提供结构化真值,并用于去重和划分构建。
    • 每个实例被渲染为对齐的视频和图像模态。图像模态采用三种输出模式:Last-Frame 用于可通过单一最终状态解决的任务,Key-Frame 用于需要选定状态并针对基于路径的任务绘制解决方案轨迹的任务,Multi-Frame 用于评估过程完整性或时间连续性的任务。
    • 视频和图像是同一底层问题的不同渲染形式,具有等效的解决方案,从而支持模态间的受控比较。
    • 所有 300 个生成器均通过检查渲染样本和验证求解器实现进行审查。每个任务的分辨率、帧率和帧数均被检查。
    • 对于交错设置,作者使用 Gemini-3.1-Pro-Preview 生成中间求解步骤的文本描述,并对每个任务的所有实例统一应用专用提示词。
    • 与 150 个重制任务相比,150 个新任务表现出更高的视觉复杂度,每帧不同连通颜色区域的中位数为 80,而重制任务为 12;推理深度也更深,47% 的任务需要多步推理,而重制任务仅为 7%。

方法

作者在统一框架下利用 300 个任务特定生成器构建 VBVR-Pro,从结构化参数空间中采样配置以实例化问题实例。每个实例附带包含随机种子、问题规格和完整解决方案的元数据,提供程序化推导的监督信号。该框架的一个关键特性是将实例渲染为对齐的视觉模态。如下方图所示,图像模态采用三种不同的输出模式:Last-Frame 仅显示最终状态,适用于可通过单张图像解决的任务;Key-Frame 呈现捕捉关键转换的选定状态,通常为基于路径的任务绘制完整解决方案轨迹;Multi-Frame 均匀采样中间状态以评估过程完整性或时间连续性。

为了可靠地评估视觉推理,作者识别出 VLM 评判者范式的关键局限。如下方图所示,VLM 评判者经常表现出三种代表性失败模式:对细粒度视觉细节的感知不精确、忽略决定性错误,以及对任务本身的根本性误解。

除了不准确之外,VLM 评判者计算成本高昂且缺乏可复现性,在重复评估中产生不一致的分数。下方图表明,所提出的确定性评分器在每次评估成本显著更低的情况下,与人类偏好的一致性高于专有和开源 VLM 评判者。

为了克服这些局限,作者设计了一套可验证的奖励评分器,作用于任务相关的语义实体而非原始像素。每个评分器使用经典计算机视觉方法(如 HSV 颜色分割和轮廓检测)定位感兴趣的对象并提取颜色、形状、位置和数量等属性。下方图展示了这一端到端评估过程。对于具有软性标准的任务,最终分数由任务特定检查的加权和计算。对于具有硬约束的任务,检查以乘法方式组合,使单个违规大幅降低最终分数,从而提供可解释的错误分解。

针对大规模多任务强化学习,作者开发了一个专为原生视觉推理定制的端到端强化学习基线。组相对优化中的标准随机扰动往往无法引发有意义的语义探索,因为它们通常改变低层外观而保持底层决策不变。下方图比较了系数保持采样(CPS)与常规 Flow-SDE 采样。增加 SDE 随机性会引入严重的视觉损坏和背景伪影。相比之下,CPS 在基本保持清晰形状和背景的同时,实现了多样化的语义决策和更广泛的奖励范围。

作者采用 CPS 进行强化学习探索,将反向去噪过程表述为:

xtΔt=(1(tΔt))x^0+(tΔt)cos(ηπ2)x^1+(tΔt)sin(ηπ2)ϵx_{t - \Delta t} = (1 - (t - \Delta t)) \widehat{x}_{0} + (t - \Delta t) \cos \left(\frac{\eta \pi}{2}\right) \widehat{x}_{1} + (t - \Delta t) \sin \left(\frac{\eta \pi}{2}\right) \epsilonxtΔt=(1(tΔt))x0+(tΔt)cos(2ηπ)x1+(tΔt)sin(2ηπ)ϵ

其中 x^0\widehat{x}_{0}x0x^1\widehat{x}_{1}x1 分别表示预测的干净样本和预测的噪声,ϵN(0,I)\epsilon \sim \mathcal{N}(0, I)ϵN(0,I)η\etaη 控制随机性。关键在于,系数满足 cos2(ηπ/2)+sin2(ηπ/2)=1\cos^2(\eta \pi / 2) + \sin^2(\eta \pi / 2) = 1cos2(ηπ/2)+sin2(ηπ/2)=1,确保增大 η\etaη 会用新采样的高斯噪声替换部分预测噪声,而不增加总噪声系数。训练流程在 5 万实例的强化学习子集上评估三种变体:监督微调(SFT)作为非强化学习基线、使用 VLM 评判者的强化学习(RLVLM),以及使用所提出的确定性评分器的可验证奖励强化学习(RLVR),从而隔离可验证奖励信号对策略优化的影响。

实验

实验验证了一种面向生成模型原生视觉推理的新基准和训练范式。基于规则的验证性奖励评分器在所有评估器中实现了与人类偏好最高的一致性,同时成本最低。在 VBVR-Pro 数据集上训练提升了所有九个开源模型在图像、交错和视频生成上的表现,其中视频模型在状态转换方面表现优异,交错模型提供了更好的精度-效率权衡。消融和反事实诊断表明,视觉轨迹监督的贡献大于文本语义,且模型学习的是可复用的视觉关系而非记忆模板。可验证奖励强化学习(RLVR)优于 SFT 和 RLVLM,同时提升了域内和域外泛化能力,案例研究表明 RLVR 实现了后期步骤的自我纠正和更连贯的多步空间规划。

VBVR-Pro 是一个大规模视觉推理基准,在任务数量和数据规模上超过现有资源,并独特地在统一分布下覆盖视频、图像和交错模态。它包含专门用于强化学习的训练和评估划分,并采用完全可验证的任务特定评分器,与现有基准常用的基于 VLM 的评估形成对比。数据集还扩展了视觉复杂性和推理深度,新开发的任务相比重制任务具有更复杂的场景和多步推理。VBVR-Pro 在比较的基准中提供了最大的训练集,并独特地支持视频、图像和交错生成任务。它包含一个用于强化学习的专门划分,包含 50 个域内任务,以及一个包含 100 个任务的独立评估集。新开发的任务具有更高的视觉复杂度,例如每帧不同颜色区域的中位数为 80,而重制任务为 12。现有基准通常依赖 VLM 评判者,这些评判者被证明不准确、昂贵且不可复现,而 VBVR-Pro 使用确定性的可验证评分器。

对相同视频的重复评估表明,VLM 评判者会对大部分样本改变分数,而确定性可验证评分器每次产生完全相同的结果。这种不一致性在分数被用作逐样本奖励时尤其成问题,因为它可能引入噪声优化信号。可验证评分器完全可复现,跨运行零分数变化。VLM 评判者对超过一半的样本改变了分数,有些在超过 90% 的情况下改变分数。VLM 评判者的分数变化可能很大,在 0-1 尺度上最高可达 0.221。

该表列出了开源生成式基础模型的配置,区分了图像生成和交错文本-图像生成模型。它报告了总参数和激活参数,其中混合 token(MoT)模型显示稀疏激活,而稠密模型使用所有参数。引用的实验章节讨论了可验证奖励强化学习(RLVR)提升视觉推理,包括持续的性能提升和推理轨迹的定性变化。MoT 模型如 BAGEL-7B-MoT 和 ThinkMorph-7B 有 140 亿总参数但仅激活 70 亿,而 SenseNova-U1-8B-MoT 激活 160 亿中的 80 亿。稠密模型如 FLUX.2-dev 和 Qwen-Image-Edit 使用全部参数,分别为 320 亿和 200 亿。RLVR 在整体、域内和域外指标上均呈现明显上升趋势,而 RLVLM 产生的增益较小且不稳定。RLVR 实现了去噪轨迹中后期步骤的自我纠正,而强化学习前的模型早期就固定了答案且不进行修正。RLVR 改善了生成视频帧的时间一致性,保持连贯的多步空间规划,如有效的迷宫路径。

顶级专有图像生成模型在 VBVR-Pro-Bench 上优于大多数开源模型,Seedream-5.0-Pro 取得了最高整体分数。在 VBVR-Pro-Dataset 上进行任务特定训练一致提升了所有九个模型在图像、交错文本-图像和视频生成上的表现,域内设置的增益大于域外。尽管有这些改进,即使最强的训练模型仍低于人类水平。Seedream-5.0-Pro 和 Seedance 2.0 等专有模型领先基准,而大多数学术开源模型明显落后。任务特定训练平均整体增益为 0.290,域内增益(+0.401)是域外增益(+0.179)的两倍以上。最强训练模型仍低于人类水平,表明还有很大的改进空间。

对交错模态的消融研究表明,移除中间视觉状态(使用单张图像而非多张)会导致明显的性能下降,而将有意义的推理文本替换为占位符的影响则小得多。这表明对于视觉推理任务,显式视觉状态转换的贡献大于中间文本推理。将视觉轨迹压缩为单张图像使两个模型的整体分数分别下降 0.024 和 0.111。在保持多图像轨迹的同时将推理文本替换为占位符,性能变化极小(整体分数仅下降 0.001 和 0.009)。研究结果表明,对于空间和变换任务,跟踪视觉状态转换比文本语义更为关键。

VBVR-Pro 被提出为一个大规模视觉推理基准,独特地覆盖视频、图像和交错模态,并使用完全可验证的确定性评分器替代不可靠的 VLM 评判者,后者被证明会对超过一半的样本改变分数。实验表明,可验证奖励强化学习(RLVR)在域内和域外任务上均产生持续增益,实现了后期步骤的自我纠正和更好的生成时间一致性。在 VBVR-Pro 上进行任务特定训练一致提升了所有九个测试模型,域内增益更大,但即使最强模型仍低于人类表现。对交错模态的消融揭示,显式视觉状态转换远比中间文本推理重要,因为移除多图像轨迹会导致明显下降,而将推理文本替换为占位符的影响极小。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供