GraphVerse:当多模态模型看图推理时,瓶颈到底在哪里?
GraphVerse 的核心洞察是:真正的视觉图推理,必须让模型无法绕过图像本身。为此,论文提出了四种以图为中心的图像编辑策略。比如,把图切成碎片打乱,模型必须先在大脑里拼回原图才能推理;或者把两张图叠在一起,要求模型在视觉上分离它们再进行比较。这些操作让视觉推理从可选项变成了必选项。
GraphVerse 的核心洞察是:真正的视觉图推理,必须让模型无法绕过图像本身。为此,论文提出了四种以图为中心的图像编辑策略。比如,把图切成碎片打乱,模型必须先在大脑里拼回原图才能推理;或者把两张图叠在一起,要求模型在视觉上分离它们再进行比较。这些操作让视觉推理从可选项变成了必选项。
现有的三维重建基准,要么是ETH3D这样的通用场景,要么是室内盆栽的作物数据集,没有一个把田间尺度的多角度重建和农艺实测指标挂起钩来。更关键的是,最近火热的零样本前馈模型——比如DUSt3R和VGGT——号称能从几张图直接预测三维结构,但它们飞到玉米地上空还能不能行,从来没人认真检验过。UAV3DCrop为此设计了两条赛道:赛道A让NeRF和3DGS方法在已知位姿下逐场景优化,赛道B让前馈模型在完全零样本的条件下直接预测位姿和几何。
首次提出直接优化编码器注意力目标的不可感知ℓ∞扰动攻击,使DETR-R50的mAP从42.1降至0.97,DINO-Swin-L从56.8降至1.44。
问题的根源在于,现有方法把“去噪步数”当作一个固定常数,而不是一个应该根据提示复杂度动态调整的变量。简单的提示,比如“一只猫”,可能二十步就够了;复杂的提示,比如“一只戴着墨镜的橘猫坐在红色沙发上”,才需要更多步数。PAST的核心洞察就是:让模型学会“适可而止”,根据提示的复杂度和去噪的实时进度,自适应地决定何时终止当前回合。
提出Atelier框架,通过将模糊的艺术意图转化为显式的控制状态并迭代优化,系统性地减少图像生成中因艺术家名字触发的非请求性经典视觉捷径(如梵高的星空漩涡),从而提升风格保真度和内容保持度。
提出SGPO框架,通过感知扩散生成过程中的语义变化和信噪比,自适应地将RL优化划分为混沌逃离、带探索的偏好优化和稳定收敛三个阶段,以缓解奖励黑客问题并提升生成质量与多样性。
这正是当前医学基础模型评估体系的一个盲区。我们习惯用下游任务的分数来衡量模型好坏——分割Dice高就认为模型可靠。但下游性能是一个“终端过滤器”,它可能掩盖表示空间内部的剧烈变化。一个模型可以在伪影图像上输出看似合理的分割结果,但其底层特征已经发生了根本性偏移。当这个模型被迁移到新任务时,这种隐性脆弱性就可能突然暴露。目前,没有任何系统性研究告诉我们:不同的预训练策略、架构选择和领域专用化程度,究竟如何影响表示空间对MRI伪影的耐受能力。
问题的根源在于,传统基准是“死”的——一旦发布就固定不变,而模型却在不断进化、不断吞噬更多训练数据。现有的一些“活”基准尝试,要么依赖人工验证,成本高、速度慢;要么使用开放式问题加LLM评判,主观性强、难以规模化。LiveXiv的核心洞察是:ArXiv上每天涌现的最新科学论文,就是取之不尽、用之不竭的“考题矿藏”。关键在于,如何全自动地将这些论文中的图表转化为可靠的、真正需要视觉理解的选择题,同时还要让持续评估的成本可控。