IB-Flow:基于信息瓶颈引导的CFG蒸馏用于少步文本到图像生成
本文提出IB-Flow,解决少步CFG蒸馏中静态引导强度与随机时间步采样的盲目性问题。通过信息瓶颈原理,动态优化注入目标时间步和引导强度,在2步NFE下实现SOTA性能。实验显示在Qwen-Image-20B上GenEval达0.86,DPG-Bench达88.67,优于ArcFlow。需注意超参数κ敏感性及极端少步生成的伦理风险。
本文提出IB-Flow,解决少步CFG蒸馏中静态引导强度与随机时间步采样的盲目性问题。通过信息瓶颈原理,动态优化注入目标时间步和引导强度,在2步NFE下实现SOTA性能。实验显示在Qwen-Image-20B上GenEval达0.86,DPG-Bench达88.67,优于ArcFlow。需注意超参数κ敏感性及极端少步生成的伦理风险。
传统全局SfM依赖尺度模糊的对极几何,导致全局定位对噪声基线估计和弱视图图约束敏感。DGSfM通过将单目深度估计集成到全局SfM中,利用深度感知相对位姿求解、视图图过滤和深度引导初始化来解决尺度歧义和初始化敏感性问题。实验显示,在ETH3D和LaMAR数据集上,该方法显著提升了相机位姿估计精度。需注意,方法性能受单目深度模型质量影响,且严格过滤可能略降点云完整性。
具身智能依赖VLM进行实时视觉推理,但边缘设备电池有限,单次查询能耗高达50-500焦耳。现有工作多聚焦减少视觉令牌,假设视觉处理是主要能耗。本研究在RTX 3070和Jetson Orin NX上对5个VLM进行系统能耗画像,发现平均功率恒定,解码阶段能耗占比86-97%。实验表明,视觉令牌剪枝最多节省10%能耗,而控制输出长度可节省97%。建议优化时优先控制输出长度,并注意动态视觉令牌模型在高分辨率下的预填充能耗陷阱。
本文提出CD-LAM框架,针对潜在动作模型(LAM)中动作无关视觉因素泄露导致的动作跟随性差问题,引入基于因果的去偏目标进行微调。实验显示,该方法在2B和14B模型上显著降低FDCE(前景位移切弗距离误差),并在AgiBot真实机器人数据集上实现12倍以上的适应效率提升。需注意,高PSNR不保证良好的动作跟随性,FDCE是更可靠的评估指标。
本文介绍Hydra++框架,通过集成CRISP或SAM3D形状估计器及RMCC模块,解决现有场景图缺乏实例几何细节的问题。实验显示在uHumans2数据集上F1达0.776,并在户外混合LiDAR-相机配置下有效恢复细粒度网格。需注意RMCC依赖掩码质量,且SAM3D延迟较高。
视觉语言模型(VLM)在物体计数任务中常出现幻觉。本研究通过探针分析发现,VLM内部编码了正确的计数信息,但输出方向存在错位。论文提出基于误差检测器的自校正方法,在不更新参数的情况下将计数准确率提高了最高15.6%。视频涵盖探针分析、SVCCA子空间对齐、因果干预实验及自校正框架效果,并讨论模型差异与局限性。
本文介绍OpenLongTail框架,通过恢复自车轨迹并结合Plücker射线、时间深度扭曲和跨视图记忆库,将单目长尾视频转化为多视图资产。实验显示,在AlpaSim中,合成数据使Alpamayo R1策略得分提升至0.748,碰撞率0%。需注意生成成本较高及分布对齐限制。
本文提出视觉预训练(VP),直接对原始科学文档图像进行自回归视觉潜在预测。实验显示,在相同语料源下,VP在GPQA等科学推理基准上显著优于文本预训练(TP),且跨模态对齐指标(如Centroid Separation)大幅改善。VP通过稀疏前景视觉表示保留页面结构,无需文本提取或配对监督。优势在视觉结构密度高的样本上最显著,纯文本主导样本上优势不明显。
本文介绍PanoWorld框架,针对全景世界生成中长程记忆物理一致性差的问题,提出基于旋转等变性的运动解耦、DPRC射线条件建模及GMA几何记忆增强模块。在World360基准上,该方法在FID、PSNR等指标上优于Imagine360、Matrix-3D等基线,并支持单卡H20实时生成。需注意仿真与真实数据分布差异及轨迹输入质量依赖。
本文审计了27篇结肠镜息肉分割论文,发现普遍存在HD95、Recall等关键指标缺失及数据划分不兼容问题。通过重新评估5个代表性模型,证明单一Dice指标掩盖了严重的边界误差和漏检风险,且不同划分协议导致的性能波动超过许多SOTA改进幅度。文章提出了Polyp Segmentation Reporting Checklist (PSRC)以规范报告,并警示二次综述中的转录错误。