UniVR:在视觉空间中进行统一视觉推理的思考
本文提出UniVR框架,旨在解决现有AI模型依赖文本空间推理导致的物理一致性差及扩展受限问题。UniVR基于Emu3.5,采用两阶段训练:冷启动SFT建立视觉先验,随后通过VR-GRPO强化学习范式,结合全局奖励与Step-Focal奖励,直接在视觉空间中进行复杂推理和长程规划。实验显示,UniVR在VR-X基准上较基座提升20.9%,长程规划任务提升25.2%,并在34B参数规模下超越Gemini 3 Pro。需注意,该方法对计算资源要求较高,且奖励机制依赖通用VLM,在细粒度物理知识方面仍有局限。