语言模型思考靠 token 链,那视觉模型能不能靠"画图链"思考?这篇论文的立场很激进:图像和视频不只是给模型"看"的输入或给人"欣赏"的输出,而是解题的草稿纸——中间视觉状态就是推理过程本身。这条路叫 native visual reasoning。
它卡在三个瓶颈:没有可扩展的训练任务、没有可靠的反馈信号、没有跨模态的受控比较。VBVR-Pro 的全部工作就是补齐这三块:可训练(300 任务)→ 可验证(规则 scorer)→ 可优化(RLVR)→ 可归因(模态对照)。
任务按五种认知能力组织:感知、空间、变换、抽象、知识。每个任务是一个参数化程序——随机网格、物体数量、布局、外观,配一个确定性求解器自动算出标准答案,零人工标注。300 个生成器里 150 个来自前作 VBVR,150 个为新设计(中位颜色连通域 80 个 vs 旧任务 12 个,复杂度高一个量级)。
规模:347 万图像、130 万视频、125 万训练实例,50 个任务整个留作域外评测。最关键的设计决策是:同一题目渲染成对齐的视频版与图像版——不是两个数据集,是同一问题的两种模态化身,这才让后面的模态对照实验成立。
论文对 VLM-as-a-judge 的批评相当系统。三种典型失败:数值不精确(颜色混合错了,三个裁判最低也给 0.80,规则 scorer 给 0.40)、忽略决定性细节(该保持的圆环大小变了还打高分)、误解任务规则(正确答案被压到 0.24)。更麻烦的是不可复现:温度设 0,同一批视频重复打分,VLM 有 55-93% 的样本分数会变——当评测指标已够糟,当 RL 奖励就是灾难。
方案是为 100 个评测任务各写一个规则 scorer:用 HSV 分割、轮廓检测、OCR、轨迹跟踪等经典 CV 方法提取语义属性,在属性层打分而非像素层。软指标加权求和,硬约束(如迷宫不许穿墙)乘法门控。结果全维度碾压:与人类偏好一致率超 0.60(GPT-5.5 仅 0.54,Gemini-3.1-Pro 0.52),成本最低,完全确定性,OOD 模型排序与人类相关性 Spearman ρ=1.00。
这是全文最有味道的部分。用同一套任务训练 30 多个生成器后——
视频 vs 交错图文 vs 单图。直觉上视频应全面胜出,但训练后最强的交错图文模型(SenseNova-U1)在域内与最强视频模型(Wan2.2)打平——学过任务结构后,稀疏的关键视觉状态就够用,计算还便宜得多。视频的真正优势在变换类任务和域外泛化:需要持续跟踪状态转移时,稠密时序表征不可替代。单图生成全面垫底——一张终点图装不下多步过程。
消融才是铁证。把中间多帧图像压成单帧,掉分明显;把中间推理文本换成无意义占位符,几乎不掉分。中间视觉状态是主角,中间文本是配角——与语言模型里"CoT 文本承载推理"恰好镜像。
反事实干预更直接:删输入图像,0.638 → 0.064;删中间图像 → 0.099;中间图像加噪 → 0.190。中间视觉状态被模型因果性地使用,不是装饰。
RL 采样的算法选择很巧妙:标准 Flow-SDE 加大随机性会把画面打得稀烂,他们改用系数保持采样(CPS),既保画面质量又产生足够的语义探索多样性。
同一数据、同一算法、只换奖励源:SFT 0.503 → RLVLM(VLM 打分当奖励)0.508,几乎白给;RLVR(规则 scorer 当奖励)0.548,域外也从 0.328 涨到 0.377——RLVR 在没见过任何域外任务的条件下提升了泛化。奖励信号质量直接决定 RL 上限。
更有意思的是行为变化:RLVR 后的模型在去噪早期答错,会在后续步骤自我修正收敛到正确答案(pre-RL 模型第一步就定死不改);迷宫轨迹连贯性也显著变好。同等计算预算下,RL 把推理视界拉长了。
VBVR-Pro 训练的 Wan2.2 在七个外部基准(RISE-Video、V-ReasonBench、MME-CoF-Pro 等)上最高提升 20 个百分点。最近邻分析显示测试题与训练集在 CLIP / DINOv2 / 文本特征空间里都不相似——涨的是可复用的视觉推理操作,不是指令模板拟合。
对做视频理解/检索的人,三个可搬走的结论:
① 评测设计:生成式输出别用 VLM 当裁判,属性级规则 scorer 更准、更便宜、可复现,还能直接当 RL 奖励。
② 模态选型:需要状态跟踪选视频,性价比选交错图文,单图生成别指望过程推理。
③ 范式信号:如果推理可以发生在视觉状态空间里,那"视频语义检索"的终局可能不是"文本描述视频",而是直接在视觉轨迹上推理——模型的中间产物本身就是可检索、可验证的语义单元。