问两次,看两次:提示回音解决视觉语言模型中的“问题优先”悖论
本文揭示了视觉语言模型(VLM)中“问题优先”(Question-First)提示导致性能下降的悖论。通过Logit Lens和因果注意力阻断实验,我们发现问题优先虽能引导感知,但因距离过远导致下游读取失败。为此,提出无需训练的提示回音策略(Question Echoing和Image Echoing),在Qwen3-VL等模型上显著恢复并超越基线性能。
本文揭示了视觉语言模型(VLM)中“问题优先”(Question-First)提示导致性能下降的悖论。通过Logit Lens和因果注意力阻断实验,我们发现问题优先虽能引导感知,但因距离过远导致下游读取失败。为此,提出无需训练的提示回音策略(Question Echoing和Image Echoing),在Qwen3-VL等模型上显著恢复并超越基线性能。
本文介绍DiTango,一种针对分布式DiT推理的低成本并行生成方法。针对现有Context Parallelism在多节点扩展时的通信瓶颈,DiTango利用注意力贡献的空间局部性,提出基于Attention State的可组合复用机制。通过Anchor-guided Selection Planner预测复用误差,结合State-centric Parallel Runtime优化通信与计算重叠。实验显示,在32 GPU上,Wan-14B模型获得1.9倍端到端加速,同时保持高质量生成。
本文提出MLRS,基于InternVL3.5-8B和SAM3,通过GRTO强化学习框架联合优化,无需修改VLM架构即可在遥感多任务中达到SOTA。实验显示,在GEOBench-VLM检测Precision@0.5从0.24提升至0.56,GeoSeg-Bench2分割IoU从0.41提升至0.70。研究证明数据多样性比数据量更能驱动OOD泛化,但需注意微调SAM3可能牺牲零样本泛化能力,且多时相/多视角任务因数据源单一提升有限。
自心(Ego)视角下的3D手部姿态预测常因视野受限和动态剧烈导致线索不足。本文提出Exo2EgoPose框架,引入外心(Exo)视频作为全局上下文指导。核心包括双重心外心重建模块(DERM)和全局到局部调制模块(GLMM)。实验显示,在AssemblyHands、Ego-Exo4D和EgoMe-pose基准上,MPJPE显著优于AR-VRM等基线,并在CALVIN机器人基准上验证了人类到机器人的迁移能力。需注意模型依赖配对的外心视频监督信号。
本文介绍HETA++,一种改进的全局运动恢复结构(SfM)方法。针对现有平移平均方法在共线相机运动下易退化、显式方法鲁棒性不足的问题,HETA++提出混合显式平移平均框架。该方法首先构建视图-轨迹图,利用全局旋转精炼相对平移,并通过特征视差角和极平面分布过滤异常值。初始化阶段结合凸距离目标函数与非双线性角度目标函数,优化收敛性与鲁棒性。最后通过联合优化模块进行选择性角度精炼与束调整。实验表明,在1DSfM数据集上,HETA++在AUC@3°等指标上优于HETA和GLOMAP,且运行时间分别快2倍和3倍。在KITTI序列数据上,轨迹估计精度显著提升。
本文提出E3DGS,解决3D高斯泼溅中几何与光度变换规则异构的问题。通过将球谐函数系数映射至gl(3)矩阵载体,实现统一的SE(3)等变性。实验显示,在ModelNet10/40分类中,SE(3)鲁棒性准确率分别达94.79%和93.17%,远超基线;在RLBench机器人操作中成功率提升至50.4%。预训练参数量减少约59%。需注意,该方法在ℓ≥3高阶球谐函数及接触密集任务中仍有局限,且计算成本略高。
本文提出PE-Field 4D,解决视频扩散Transformer在视角变换中几何结构丢失的问题。核心方法是将参考内容的投影位置编码注入交叉注意力机制,实现几何感知生成。在DAVIS数据集上,该方法在Dyn-MEt3R和MEt3R指标上优于ReCamMaster、GEN3C等基线。需注意,方法依赖ViPE估计深度,几何重建误差可能影响最终效果。
本文提出MoD-VLLM框架,旨在解决长视频理解中Token预算有限与多事件细节捕捉之间的矛盾。现有方法如Token剪枝或关键帧选择易导致细节丢失或错误传播。MoD-VLLM通过正负视频片段定位模块识别相关片段,并利用模块化动态粒度反射模块,对正片段进行细粒度编码以捕捉细节,对负片段进行粗粒度编码以保留全局上下文。结合DPO优化与反事实验证,该框架实现了迭代式自我修正。实验显示,在VideoMME和MEventBench等基准上,MoD-VLLM显著优于LLaVA-Video和Qwen2.5-VL等基线模型。
本文提出TANGO方法,针对自回归视频扩散模型在生成长视频时出现的“终端点”崩溃问题。该方法利用扩散模型作为评判者,通过预测下一步并检查噪声残差是否符合各向同性高斯分布来识别终端点,并在测试时通过约束优化更新参数以偏离终端点。实验显示,在VBench基准上总分提升3.1%,15秒视频平均FVD降低28.3%。需注意,该方法依赖预训练模型流形中存在有效解,且会增加推理时间。
本研究深入分析Qwen2.5-VL-3B-Instruct在组合式视觉问答中的失败机制。通过因果均值消融、注意力消除和MLP消除,发现接地与属性提取失败源于前馈网络,而推理失败源于晚期注意力。跨架构分析显示LLaVA-1.5-7B因编码器压缩空间细节而表现不同。