IQA-T1:用工具调用生成视觉证据,破解大模型图像质量评估的语义偏差难题

训练流程:SFT与强化学习

本文介绍IQA-T1框架,针对现有基于多模态大语言模型的图像质量评估方法中存在的语义偏差和低层感知退化捕捉不足问题,提出基于工具的视觉证据推理范式。通过构建Q-Tool数据集并进行监督微调与强化学习,模型能自适应调用噪声残差等分析工具生成显式证据。实验显示,该方法在KonIQ、SPAQ等七个基准上平均PLCC/SRCC达0.795/0.784,优于现有对比方法。需注意工具库覆盖范围及推理延迟限制。

打破信息瓶颈:基于相机-显示器耦合的端到端颜色直通

架构改进:抑制伪影

传统色彩管理(如ICC工作流)将相机和显示器分离校准,导致信息瓶颈和误差累积。本文提出Color Pass-Through框架,将两者视为耦合系统,通过重捕获协议训练神经投影器,并引入相机零空间校正解决观察者差异。实验显示,在Huawei和Xiaomi手机上,该方法在PSNR和∆E指标上均优于默认ISP和自动白平衡基线,用户研究也证实了其感知优势。

MobileSAM2:用超图蒸馏实现移动端视频分割

方法概述

本文提出HyperKD框架,通过构建时序和粒度超图显式提取并蒸馏SAM2中的高阶知识,从而训练出在移动端资源受限设备上高效运行的轻量级MobileSAM2模型。在MOSE, DAVIS 2017, LVOS, SA-V-val, SA-V-test五个基准上进行视频分割评测,与FitNets, CIRKD, FAKD等SOTA知识蒸馏方法及轻量级非蒸馏模型对比。在Embodied AI任务(LIBERO-PRO)和TrackAnything (TAM)上验证泛化性。模型架构搜索空间为手动设计,缺乏自动化神经架构搜索的优化保证。仅使用约10%的SA-V数据进行蒸馏训练,虽高效但可能限制对长尾分布

SPIN-4DGS:解决4D高斯泼溅快速运动模糊与物体消失的隐式网络方案

论文代表图:figure-02-p002-01

本文介绍SPIN-4DGS,一种针对大帧间位移快速运动的4D Gaussian Splatting改进方案。现有4DGS方法在处理快速运动时,高斯属性易坍塌导致物体模糊或消失。SPIN-4DGS通过时空位置切片避免跨帧干扰,并利用隐式网络预测高斯属性,减少内存开销。实验显示,在CMU Panoptic Sports数据集上,Basketball场景PSNR达30.05 dB,优于D3DGS 1.83 dB。该方法兼容D3DGS和Realtime-4DGS基线,但需注意初始位置质量对最终效果的影响,且细化迭代会增加训练时间。

Hallo4D:基于多模态大模型共识的3D/4D生成时空一致性优化

背景:SDS方法的局限与4D挑战

本文介绍Hallo4D框架,旨在解决3D/4D生成中的Janus问题和时间抖动。通过引入LMMs进行幻觉检测与校正,结合共识驱动的重一致性优化和运动显著性采样,显著提升一致性。实验显示CLIP Score提升,但需注意LMM推理开销及单前景假设。

RINO:让RGB成为视觉的统一语言

论文代表图:figure-01-p002-01

传统视觉模型需为不同任务设计特定架构。RINO提出统一RGB接口,将深度估计、分割、姿态等任务转化为RGB-to-RGB编辑。通过冻结的通用图像编辑器(如Qwen-Image-Edit)和文本提示,实现零样本迁移。实验涵盖深度、法线、分割、检测、姿态及条件生成等20+任务。需注意:深度评估采用仿射不变协议,生成任务分辨率与基线不同,检测任务使用Oracle-class设置。

FlowWAM:光流统一世界动作模型与机器人控制

方法:双流扩散Transformer架构

本文介绍FlowWAM,一种将光流作为统一动作表示的世界动作模型。通过双流扩散Transformer,模型在策略模式下联合生成RGB与光流,并通过动作专家解码执行;在世界模型模式下,以目标光流为条件生成未来帧。实验显示,FlowWAM在RoboTwin 2.0仿真基准Clean设置下成功率达92.94%,在WorldArena基准上EWMScore达63.71,并在真实Franka与ARX机器人上优于基线。需注意光流提取的计算开销及HSV编码的归一化敏感性。

视频扩散模型中的串行性差距:为何增加去噪步数无法解决长链物理推理

方法:硬球动力学测试床

本文揭示了视频扩散模型在处理长链因果推理(如多球碰撞)时存在的“串行性差距”。理论证明双向去噪无法提供可扩展的串行计算,增加去噪步数无效。实验显示,自回归生成和增加模型深度能有效缓解此问题。结果基于合成数据,自然视频应用需谨慎。

UniVR:在视觉空间中进行统一视觉推理的思考

UniVR框架概述

本文提出UniVR框架,旨在解决现有AI模型依赖文本空间推理导致的物理一致性差及扩展受限问题。UniVR基于Emu3.5,采用两阶段训练:冷启动SFT建立视觉先验,随后通过VR-GRPO强化学习范式,结合全局奖励与Step-Focal奖励,直接在视觉空间中进行复杂推理和长程规划。实验显示,UniVR在VR-X基准上较基座提升20.9%,长程规划任务提升25.2%,并在34B参数规模下超越Gemini 3 Pro。需注意,该方法对计算资源要求较高,且奖励机制依赖通用VLM,在细粒度物理知识方面仍有局限。

读回:利用预训练MLLM的零样本奖励模型提升文本生成图像性能

方法:SpectraReward

本文提出SpectraReward,一种无需训练、利用预训练多模态大语言模型(MLLM)的图像条件提示词对数似然作为奖励信号的方法。通过冻结的预训练MLLM对生成图像进行条件化,并执行单次教师强制前向传播计算提示词token级别的似然分布(语义谱),取其平均对数似然作为标量奖励。Self-SpectraReward是其在统一多模态模型(UMM)中的特例,使用模型自身的理解分支作为奖励模型,实现闭环自我改进。实验表明,该方法在GenEval、TIIF-Bench等基准上显著优于基线,且奖励MLLM的规模扩大并不总是带来单调的性能提升,30B左右的模型可能已足够。