UniVR:在视觉空间中进行统一视觉推理的思考

UniVR框架概述

本文提出UniVR框架,旨在解决现有AI模型依赖文本空间推理导致的物理一致性差及扩展受限问题。UniVR基于Emu3.5,采用两阶段训练:冷启动SFT建立视觉先验,随后通过VR-GRPO强化学习范式,结合全局奖励与Step-Focal奖励,直接在视觉空间中进行复杂推理和长程规划。实验显示,UniVR在VR-X基准上较基座提升20.9%,长程规划任务提升25.2%,并在34B参数规模下超越Gemini 3 Pro。需注意,该方法对计算资源要求较高,且奖励机制依赖通用VLM,在细粒度物理知识方面仍有局限。

读回:利用预训练MLLM的零样本奖励模型提升文本生成图像性能

方法:SpectraReward

本文提出SpectraReward,一种无需训练、利用预训练多模态大语言模型(MLLM)的图像条件提示词对数似然作为奖励信号的方法。通过冻结的预训练MLLM对生成图像进行条件化,并执行单次教师强制前向传播计算提示词token级别的似然分布(语义谱),取其平均对数似然作为标量奖励。Self-SpectraReward是其在统一多模态模型(UMM)中的特例,使用模型自身的理解分支作为奖励模型,实现闭环自我改进。实验表明,该方法在GenEval、TIIF-Bench等基准上显著优于基线,且奖励MLLM的规模扩大并不总是带来单调的性能提升,30B左右的模型可能已足够。