MixFrag:脆弱性引导的混合精度量化,让ViT部署不再一刀切

论文代表图:figure-01-p003-01

视觉Transformer性能强大但部署成本高,训练后量化是解决之道。然而,不同组件对量化的敏感度差异巨大,统一精度分配往往顾此失彼。MixFrag框架提出了一种直接测量组件量化脆弱性的方法——用KL散度衡量单个组件量化后模型输出的偏离程度,然后将比特分配建模为多选择背包问题,用动态规划求得全局最优解。在COCO目标检测任务上,MixFrag以显著优势超越先前最佳混合精度方法。但需注意,该方法在极端低比特分类任务上仍落后于优化密集型方案,且脆弱性度量未考虑组件间的交互影响。

MPIE-Bench:多人编辑的接触几何,VLM评委为何“看走眼”?

方法贡献与验证

现有文本到图像编辑模型在生成多人紧密接触场景时,常出现肢体融合、身体穿透等解剖学错误,但当前基准测试依赖的VLM评估在此类几何错误上趋于饱和,无法有效衡量。MPIE-Bench从视频中挖掘了2500个参考图-指令-目标图三元组,覆盖14种交互类别和4个接触密度。其核心贡献是MPIE-Eval评估协议:使用冻结的Multi-HMR模型从生成图像中重建多人网格,并基于网格计算Anatomy(解剖完整性)和Interaction(交互几何)两个新指标。实验发现,闭源模型的VLM-Interaction评分高达0.98-0.99,而网格Interaction评分仅为0.45-0.72,揭示了VLM评估

UniCross:从手-物关系视角统一四种灵巧技能,实现无缝长程操作

统一视角:手-物关系运动

灵巧操作包含抓取、重定位、手中旋转和平移四种基本技能,但现有方法为每种技能设计特定约束和目标,导致技能间缺乏兼容性,难以组合成长程操作。UniCross 提出手-物关系视角,将所有技能统一建模为“在保持物体稳定的同时实现期望的关系运动”,从而共享状态、动作和奖励结构。论文先用 PPO 独立训练十个单技能策略,再通过 DAgger 蒸馏为单一统一策略。实验表明,统一策略在四种技能上均达到高成功率,并能泛化到未见物体和不同手部形态,同时支持技能链式组合完成长程操作。需要注意的是,训练和评估对象限于简单几何体,对复杂日常物体的泛化性尚未充分验证。

FeatFix:缓存扩散模型里,验证过的精确特征为何要丢弃?

一个具体的浪费场景

扩散模型推理慢,训练免缓存加速器通过复用或预测中间特征来减少计算,但会引入近似误差。部分方法引入验证步骤计算精确特征来监控漂移,却算完就扔,从未想过用这些已经付过计算代价的精确特征来当场校正草稿状态。FeatFix 提出“验证即复用”原则,在固定的层-时间步验证点,将已计算的完整块输出直接替换草稿输出,消除局部残差,其余点保持原草稿策略。通过匹配计算量的 Verify 控制组,论文在 FLUX.1-dev 上证明,相同延迟下 FeatFix 的 ImageReward 从 0.911 跃升至 1.318,且校正带来的误差降低会持续传播到下游层和后续去噪步骤。方法在 HunyuanVideo-1

ObjectStream:用隐式对象做记忆锚点,流式视频理解不再丢失细节

研究空白与核心贡献

流式视频理解面临一个核心矛盾:模型必须在未知未来查询的情况下持续保留有用证据,但内存和延迟约束又迫使它不断压缩历史信息。现有方法按 token 重要性或时间冗余来压缩,却忽略了一个关键事实——视频理解本质上是对持久对象及其演化的追踪。ObjectStream 提出了一种全新的思路:直接从冻结的 Video-LLM 特征空间中自动发现隐式对象,将它们作为记忆锚点,跨帧关联成持久轨迹,再配合对象突变检测和近期视觉窗口,构建紧凑而完整的流式记忆。在 OVO-Bench 和 StreamingBench 两个在线流式基准上,ObjectStream 让 Qwen2.5-VL-7B 的实时视觉感知得分大

ROAD:不堆数据不堆算力,靠对齐3D基础模型先验实现高保真生成

论文代表图:figure-02-p003-01

高保真3D生成通常依赖大规模模型与海量数据,计算成本极高。ROAD框架另辟蹊径:它冻结一个现成的3D基础模型,通过互惠目标对齐策略将其判别语义先验注入扩散Transformer,在仅用3万训练资产、8块A100训练3.5天的条件下,生成质量超越TRELLIS等更大规模模型,逼近商业模型Step1X-3D。核心创新在于识别并解决了生成模型与判别模型之间的语义-结构异构性问题——全局语义凝聚(HSC)和结构最优对齐(SOA)两个组件协同工作,让生成器真正“理解”3D形状的语义结构。该方法可迁移至CraftsMan和TRELLIS等不同框架,但生成质量受限于所选基础模型的语义能力。

EgoGenesis:用3D锚定记忆与动作几何编码,让自我中心视频生成不再漂移

研究空白与核心贡献

训练世界-动作模型需要大量自我中心视频-动作对,但真实数据采集昂贵,而现有视频生成器存在场景漂移和动作失准问题。EGOGENESIS提出两个几何感知条件机制:OAPM维护第一帧的3D场景锚点并在线刷新近期状态,解决场景不一致;A3D-RoPE将末端执行器的度量3D坐标编码为旋转位置嵌入,实现精确的动作控制。在8个真实机器人任务上,用EGOGENESIS生成的合成轨迹增强训练后,双臂分布外成功率从53%提升至70%。需注意,生成质量依赖预训练先验,且A3D-RoPE要求准确的相机标定和深度估计。

VAD:多模态在线蒸馏中,如何让模型只学视觉真正支持的修正?

正视觉优势的盲区

多模态在线策略蒸馏中,特权视图教师提供的逐token修正混合了视觉信号、语言先验和教师特异性效应,导致学生无法分辨哪些修正真正由视觉证据支持。VAD通过反事实视觉干预——对比证据存在和证据移除两种视图——估计视觉证据方向的代理向量,将教师修正投影到该方向上得到视觉归因分量,并据此重建以学生为中心、分离支持与反驳分支的目标分布。实验在6个细粒度视觉基准上验证了方法的有效性,语义分析证实视觉归因分量显著富集视觉属性、物体和决策相关token。留出泛化测试表明VAD是唯一在两个模型尺度上均实现正增益的后训练方法。需要注意的是,当前归因方法仅实现语义富集而非可辨识分离,归因分量可能仍包含非视觉教师效应

VLM裁判为何总说“任务完成”?OSReward揭示宽松偏差并开源纠正模型

研究空白与OSReward的定位

计算机使用智能体(CUA)的评估、数据筛选和强化学习都依赖VLM裁判来判断轨迹是否成功。但裁判本身可靠吗?OSReward构建了首个跨平台、严格人工标注的基准,对27个VLM裁判进行系统评测,发现它们普遍存在“宽松偏差”——将失败轨迹误判为成功。其中“接受未完成任务”错误占所有错误的48%以上。论文进一步开源了OS-Shepherd奖励模型,通过SFT+RL两阶段训练针对性纠正偏差,在困难集上以极低成本达到商业模型水平。但需注意,OSReward-Hard上失败样本占70%,原始准确率需结合平衡准确率解读;OS-Shepherd在困难集上约60%的准确率仍距理想训练信号有差距。

MeshFM:不靠3D标注,2D特征如何让模型看懂三维世界?

研究空白与核心洞察

三维形状理解长期依赖昂贵的3D标注或缓慢的逐形状优化。MeshFM另辟蹊径,仅从DINOv2等2D基础模型蒸馏知识,通过SAM纠正特征混叠,训练出一个前馈网络直接预测通用3D特征。实验表明,该方法在零样本分割、对应、分类任务上媲美甚至超越专用SOTA模型,且对任意旋转鲁棒。但其继承2D模型的左右对称混淆问题值得注意。