XYZFlow:用多维捷径流破解少步生成的表达力瓶颈
XYZFlow 提出通过多维条件化(时间历史条件化与空间 Next Shortcut Prediction)增强概率流表达力,在 ImageNet 256×256 上以 3-4 步实现 7.2-8.5× 教师加速并取得竞争性 FID。
XYZFlow 提出通过多维条件化(时间历史条件化与空间 Next Shortcut Prediction)增强概率流表达力,在 ImageNet 256×256 上以 3-4 步实现 7.2-8.5× 教师加速并取得竞争性 FID。
提出Contextual Preference Gain (CPG)指标揭示现有DPO类方法的上下文盲区,并设计C2-DPO通过显式最大化CPG来缓解MLLM物体幻觉。
TGRHuman通过解耦几何与纹理生成,利用显式多视角2D观测生成与优化,实现高效、高质量、视角一致的文本驱动3D人体生成。
通过受控实验研究对象中心世界模型中槽位表示质量与分布偏移下规划鲁棒性的关系,发现规划成功率与无监督槽位质量指标正相关但增益饱和,且冻结预训练视觉特征是鲁棒性的重要来源。
构建首个面向古典诗词配图的多维人工标注基准 TangPoetryBench(1280 张图像、10 个维度),并训练开放、基于评分标准的 PoemAutoEvaluator(PAE),在排序能力上达到专有评判模型 Claude 的水平。
提出 TTH,一种无需训练、单次生成、不改模型权重或隐状态的解码策略,通过 CLIP 验证候选物体 token 并以熵自适应融合来抑制 LVLM 物体幻觉。
Diagram-MMU 是首个同时评估 MLLM 在科学图表解析、编辑与问答三项任务上基础能力与智能体能力的 TikZ 基准,覆盖 6 类图表、3.7k 张图与 18.3k 个样本。
本文提出首个针对VLM的any-to-any后门攻击范式,通过一次性启发式投毒使模型将触发器视为指令,并在推理时利用特征空间触发器隐写术为任意未见过的目标caption动态合成隐蔽触发器。