快速导读:Motto提出Spatially-Grounded Thought Tokenization和Context-Adaptive Chain-of-Tokens,通过动态切换感知与推理模式,在多项基准上实现SOTA性能。
多模态大模型(MLLM)在视觉定位任务中面临感知与推理难以兼顾的挑战。现有方法要么依赖直接坐标预测导致误差传播,要么采用检测-检索策略受限于提案质量,缺乏统一框架处理任意复杂度的查询。
Motto(Mixture-of-Thought-Tokens)提出通过Spatially-Grounded Thought Tokenization和Context-Adaptive Chain-of-Tokens统一感知与推理。该方法在PR-Bench等新基准上展示SOTA性能,为复杂视觉理解提供新范式。
英文题目:Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding
论文出处:arXiv 每日论文精选 · arXiv:2607.24407
原始论文:PDF / 论文页面
对应视频标题:Motto:用思维令牌统一感知与推理|推荐指数:★★★★★
这篇论文解决什么问题?
当前基于MLLM的定位方法主要分为三类:直接坐标预测、检测-检索和特殊令牌解码。直接预测方法在密集物体场景中误差累积严重;检测-检索方法依赖高质量提案,泛化能力有限;特殊令牌解码方法缺乏空间参考和显式推理步骤。
这些局限导致模型在处理简单查询时效率低下,而在复杂查询中推理能力不足。例如,在需要跨图像推理或长描述理解的任务中,现有模型往往无法有效整合视觉线索与语义信息。
Motto旨在解决这一核心矛盾,通过引入思维令牌机制,使模型能够根据查询复杂度动态调整处理策略,实现感知与推理的无缝切换。
核心创新
- Spatially-Grounded Thought Tokenization:显式对齐令牌与空间位置,提供可解释的空间锚点。
- Context-Adaptive Chain-of-Tokens:通过Switch Adapter动态选择感知或推理模式,结合Textual Reflection和Focus Adapter增强复杂查询处理能力。
- PR-Bench:新构建的指代表达式理解基准,专门评估感知与推理能力的差距。
方法概览
Motto框架包含Spatially-Grounded Thought Tokenization(将令牌与空间网格对齐)和Context-Adaptive Chain-of-Tokens(基于Scan-Focus-Action范式动态生成P-Tokens或R-Tokens)。
- Spatially-Grounded Thought Tokenization:将思维令牌与空间网格显式对齐,每个令牌对应特定空间区域,提供可解释的空间锚点。
- Context-Adaptive Chain-of-Tokens:基于Scan-Focus-Action范式,模型首先生成Perceptual Thought Tokens(P-Tokens)捕捉细粒度视觉线索。
- Switch Adapter:评估上下文复杂度,动态决定采用感知模式还是推理模式。简单查询直接解码P-Tokens,复杂查询触发推理模式。
- Reasoning Thought Tokens(R-Tokens):在推理模式下,通过Textual Reflection和Focus Adapter增强视觉证据,生成R-Tokens进行深度推理。
- 联合解码:P-Tokens和R-Tokens共同输入解码器,实现感知与推理信息的融合,输出最终定位结果。
逐图理解论文
现有局限

现有方法难以兼顾精细感知与复杂推理。直接预测误差传播,检测-检索依赖提案,特殊令牌缺乏空间参考。
核心区分

详细展示Motto工作流程。观察P-Tokens如何捕捉视觉线索,Switch Adapter如何评估上下文,以及R-Tokens如何在推理模式下生成。
最强结论

展示Motto在通用指代表达理解基准上的性能对比。注意Motto在多个基准上的SOTA表现,特别是RefCOCO系列。
意义与局限

对比感知与推理模式的热力图。注意P-Tokens作为空间锚点的分布,以及R-Tokens在推理模式下的聚焦效果。
实验如何设计?
- 评估基准:在COCO、RefCOCO系列、Ref-L4、gRefCOCO、HumanRef、ReasonSeg、MIG-Bench及PR-Bench上进行广泛评估。
- 消融实验:验证P-Tokens、R-Tokens、Switch Adapter、Textual Reflection和Focus Adapter各组件的有效性。
- 参数分析:研究不同网格大小、令牌长度限制及训练策略对性能的影响,确保方法鲁棒性。
关键结果与论文证据
- Motto在RefCOCO上达到94.0% Acc@0.5,优于其他模型(第9页)。
- 在MIG-Bench上平均得分74.5%,比第二名高出10.7%(第9页)。
- 在PR-Bench上mAcc达到71.2%,显著优于通用MLLM(第9页)。
- 在COCO Text prompt下mAP为56.4%,F1为62.1%(第9页)。
- 消融实验显示,Switch Adapter和R-Tokens对复杂查询性能提升显著。
- 网格大小选择对性能敏感,过细或过粗均导致性能下降。
阅读时需要注意
- 模型依赖Qwen3-VL-2B backbone,更大规模backbone的潜力未完全探索。
- 推理模式增加计算开销,整体效率低于纯感知模式。
- PR-Bench由MLLM辅助生成并经人工修正,可能存在标注偏差。
关联工作
- Rex-Omni:使用相对坐标处理多样化提示,作为对比基线。
- Migician:通过思维链增强推理,作为对比基线。
- ChatRex:采用检测-检索策略,作为对比基线。
- LLaVA-Grounding:使用特殊令牌解码,作为对比基线。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
思维令牌混合:为自由形式多模态接地统一感知与推理 高天一1,2,†,方涵2,†,丁天一2,4,李浩2,5,魏欣2,孙洪波2,董晓冬2,袁野2, 徐景林3,梁孔明4,孙浩2,∗,辛景民1,∗
1 人机混合增强智能全国重点实验室,人工智能与机器人研究所,西安交通大学 2 中国电信人工智能技术(北京)有限公司 星辰AGI实验室 3 北京科技大学 4 北京邮电大学 5 上海交通大学
多模态大语言模型在接地任务中取得了巨大进展,然而现有方法仍难以统一精确的定位与复杂的推理。一方面,基于文本的方法依赖于坐标或索引预测,严重限制了模型对密集视觉对象的感知能力。同时,基于潜在令牌的方法使用缺乏固有空间参考的特殊令牌,并采用缺乏思考步骤的解码机制,削弱了高层推理能力。因此,开发一个在感知和推理方面都表现出色的统一框架仍然具有挑战性。为解决这一问题,我们提出了思维令牌混合(Mixture-of-Thought-Tokens, Motto),这是一种新的自由形式多模态接地方法,旨在弥合感知-推理差距,使多模态大语言模型能够赋能多样、任意的接地查询。具体而言,我们引入了空间接地思维令牌化(Spatially-Grounded Thought Tokenization),将特殊令牌与空间位置显式对齐,以实现清晰的空间对应关系和视觉可解释性。我们进一步设计了上下文自适应令牌链(Context-Adaptive Chain-of-Tokens),通过动态切换模式,在不同复杂度的接地任务中实现稳健的接地。此外,我们构建了PR-Bench,这是一个包含27个新指代表达理解基准,用于评估感知-推理差距。广泛的实验表明,Motto在多样化的自由形式接地任务中均取得了最先进的性能。
链接:项目主页 | GitHub 日期:2026年7月28日 [cs.CV]
1 引言
细粒度视觉感知与推理旨在将语义查询与图像区域关联,是计算机视觉中的一项挑战性任务 Yan et al. (2025); Wu et al. (2024b); Yu et al. (2025)。以往的工作主要关注通过类别提示进行开放词汇检测 Zareian et al. (2021); Liu et al. (2024),采用具有分离特征和跨模态交互的双编码器。然而,由于语言理解能力不足,此类范式在处理复杂的指代表达时表现出局限性。更关键的是,它们对刚性成对跨模态融合的依赖严重限制了其对任意查询组合的泛化能力。
多模态大语言模型(MLLMs)的最新进展通过统一编码和预训练知识推动了自由形式多模态接地的进步 Singh et al. (2025); Yang et al. (2025)。例如,UFO Tang et al. 统一了检测与分割以实现细粒度感知。Rex-Omni Jiang et al. (2025a) 通过相对坐标处理多样化的提示。Migician Li et al. (2025) 通过思维链机制增强了推理能力。尽管如此,现有方法仍面临一个关键局限:它们本质上被设计为在低层视觉感知或高层语义推理中表现出色,却未能将这两种能力统一在一个框架内。如图1所示,这种性能差距源于感知与推理之间不同的任务优先级。以感知为导向的任务(例如,文本/视觉引导的检测 Lin et al. (2014); Tang et al. (2024))优先考虑捕捉广泛的视觉线索,以实现多个目标的精确定位。相比之下,以推理为中心的任务(例如,指代表达
† 同等贡献 * 通讯作者
1
第 2 页
思维令牌混合:自由形式多模态接地中感知与推理的统一
定位所有热气球。感知导向任务 推理中心任务 定位寿司。定位那只灰色长毛猫。在情境中,如图像2,我需要做什么?还是图像1?或是图像3? 热气球位于 <P_3> ReasonSeg <P_5> <P_6>。证据已足够。我 现在将以感知模式进行解码。COCO-I 寻找供人们并排工作的椅子。文本引导检测 短接地短语 多图像接地 定位与图像匹配的参考对象。在她旁边定位那个挥手举起手势的女孩。定位出现在所有四张图像中的动物。PR-Bench 椅子位于 <P_4> <P_6> <P_8>。 证据不足,切换至COCO 推理模式。我需要识别并排工作的椅子。目标椅子 位于 <R_17> <R_19> <R_24>。MIG-Bench 通用视觉长描述 多图像接地 引导检测 接地 COCO-G 板上匹配的插槽在哪里?gRefCOCO 在其他3张图像中,定位女孩指向的字母对应的对象。我应该看什么才能知道 Image-2 中的人何时过马路是安全的?定位像红圈标记那样的物品。 板上有许多插槽位于 <P_4> <P_5>。 证据不足,切换至 推理模式。我需要检查女孩指向的字母。板上字母U对应的插槽位于 <R_14>。交互式引导检测 视觉接地推理 多图像接地
图1 思维令牌混合(Motto)通过整合空间接地思维令牌化和上下文自适应令牌链,解决广泛的接地任务,从而统一感知和推理能力。
理解 Mao et al. (2016); Xiao et al. (2024),推理接地 Lai et al. (2024),以及多图像接地 Li et al. (2025)) 需要语义理解来解决视觉歧义,以识别特定目标。因此,开发一个能同时处理自由形式查询组合中的感知和推理的统一框架仍然是一个挑战。
当前基于MLLM的方法通常可分为三类策略:(i) 直接坐标预测 Liu et al. (2025b); Zhan et al. (2024),(ii) 检测与检索 Ma et al. (2024); Jiang et al. (2024b),以及 (iii) 特殊令牌解码 Wang et al. (2023); Zhang et al. (2024)。直接坐标预测往往容易受到误差传播的影响,特别是在密集物体场景中。检测与检索方法使用边界框作为MLLM检索候选区域的提议,这对区分多个局部细节提出了新的挑战。相比之下,特殊令牌解码通过将MLLM与外部解码器对齐提供了灵活性。然而,这种策略主要集中于分割 Zhu et al. (2026); Wang et al. (2026a),其在对象检测方面的潜力尚未得到充分探索。此外,此类方法迫使MLLM生成缺乏明确语义参考的特殊令牌(例如 <Det>),破坏了其固有的顺序推理能力。中间思考步骤的缺失也导致特殊令牌输出同质化,阻碍了对不同复杂度查询的适应。
为了解决这些局限性,我们提出了思维令牌混合(Motto),这是一个用于自由形式视觉接地的新框架(图2),使MLLM能够处理任意查询。具体而言,我们提出了空间接地思维令牌化,以统一输入表述和区域接地。图像被划分为 N × N 的区域网格,其中每个思维令牌对应一个具有空间焦点的特定位置。MLLM在推理链中生成这些思维令牌,有效地将视觉线索和语义线索压缩为可解释的潜在表示。然后,解码器从这些空间对齐的思维令牌中重建目标区域,确保每一步都有明确的证据支持。
为了有效弥合视觉感知与语义推理之间的差距,我们提出了上下文自适应令牌链,它通过扫描-聚焦-行动范式构建思维令牌的混合。这使得模型能够根据上下文语义动态适应其接地模式并整合多样化的证据,从而实现精确的视觉接地。在感知扫描阶段,生成感知思维令牌(P-Tokens)以捕捉丰富的视觉线索,用于细粒度对象感知。随后,切换适配器评估聚合的上下文查询,以确定是直接执行感知接地还是激活推理密集型接地。如果模型表现出高置信度,则直接解码P-Tokens以实现感知接地。否则,流程进入上下文重新聚焦阶段,其中结合文本反思线索以补充缺失的语义信息。此后,聚焦适配器聚合候选视觉区域并注入针对性的视觉证据,以将模型重新定向到相关的空间区域。最后,在决定性行动阶段,模型利用语义和视觉上下文生成推理思维令牌(R-Tokens),这些令牌与P-Tokens结合,以实现稳健的推理驱动接地决策。
2
第 3 页
思维令牌混合:为自由形式多模态接地统一感知与推理
问题 #1:定位所有站立的人。 问题 #2:哪位女士的面具颜色与其他人不同?
MLLM 区域_1 区域_n… 感知模式 推理模式 有6个人站立 在 <P_3><P_4> 处有几位女性。证据是 MLLM 在 <P_3> <P_4> <P_5> 处。…… 不足,切换到推理模式。我需要比较 证据充足,解码感知模式下的解码令牌。他们的面具颜色以识别不同的那个。目标 穿着蓝色面具的女性位于 <R_7><R_12>。 [452, 39,…741, 618], [797, 259, 961, 604] 区域_3,…区域_6 区域_7 特殊令牌 P令牌 P_ R_12R_7 上下文文本反思查询 3 4 5 3 4 视觉证据 答案 #1 答案 #2 答案 #1 答案 #2 答案 #1 答案 #2 答案 #1 答案 #2 R令牌 (a) 直接坐标预测 (b) 检测与检索 (c) 特殊令牌解码 (d) 思维令牌混合 (Motto)
图2 现有方法难以平衡精确定位和语义推理,阻碍了最佳性能。 相比之下,Motto 在交错链中生成空间对齐的思维令牌,该链选择适当的模式,从而实现统一的感知和推理。
为了衡量细粒度空间定位与复杂语义推理之间的性能差距,我们构建了 PR-Bench,这是一个全面的指代表达理解 (REC) 基准,将指代表达式解耦为这两个核心维度。总之,我们的主要贡献如下:
• 我们提出了思维令牌混合 (Motto),这是一个统一的框架,整合视觉感知和语义推理,以接地任意复杂度的查询。
• 我们设计了空间接地思维令牌化,以确保明确的空间可解释性,并开发了上下文自适应令牌链,该链在交错思维链中动态切换不同的接地模式,以生成思维令牌和证据。
• 我们提出了 PR-Bench,这是一个旨在定位感知-推理差距的 REC 基准。在 10 多个基准上的广泛实验表明,Motto 实现了最先进的性能,为基于 MLLM 的自由形式多模态接地建立了强大的基线。
2 相关工作
2.1 自由形式多模态接地
自由形式多模态接地是基于多样化查询在目标图像中定位物体的任务,涵盖各种模态和设置的组合。开放词汇检测 (OVD) Zareian 等人 (2021) 支持针对开放类别的文本驱动检测,通常在 COCO Lin 等人 (2014) 和 LVIS Gupta 等人 (2019) 上进行评估。指代表达理解 (REC) Nagaraja 等人 (2016); Xiao 等人 (2025); Kang 等人 (2025b) 侧重于在给定指代表达句的情况下接地特定区域,通常在 RefCOCO 系列上进行评估,包括 RefCOCO Yu 等人 (2016)、RefCOCO+ Yu 等人 (2016) 和 RefCOCOg Mao 等人 (2016)。为了解决涉及多目标或无目标情况的通用场景,引入了更具挑战性的基准,例如 gRefCOCO He 等人 (2023) 和 HumanRef Jiang 等人 (2025b)。最近的基准显著增加了查询复杂度。例如,Ref-L4 Chen 等人 (2025) 引入了需要视觉推理的长描述性表达式和隐式查询,而 MC-Bench Xu 等人 (2025) 和 MIG-Bench Li 等人 (2025) 将接地扩展到多图像上下文。总体而言,这些进展将接地从简单的短语到区域匹配转向具有深度语义推理的自由形式多模态任务 Chen 等人 (2023b); Zheng 等人 (2024); Hu 等人 (2025a,b),这激励了我们整合感知和推理能力的统一框架。
2.2 接地任务中的 MLLM。
现有的基于 MLLM 的接地方法通常遵循三种策略。第一种是直接坐标预测。Shikra Chen 等人 (2023a) 将坐标预测为自然语言文本,而 KOSMOS-2 Peng 等人 (2023) 通过包含位置令牌的 Markdown 风格链接来表示接地区域。然而,这种方法存在误差传播问题:即使微小的令牌级错误也会破坏整个边界框 Liu 等人 (2025a)。第二种是检测与检索。Groma Ma 等人 (2024) 和 ChatRex Jiang 等人 (2024b) 等方法将接地表述为区域令牌检索。ROD-MLLM Yin 等人 (2025) 引入了
3
第 4 页
思维令牌混合:自由形式多模态定位中感知与推理的统一
文本令牌 视觉令牌 P令牌 R令牌 上下文 查询 视觉证据 切换适配器 问题:谁盘子里的披萨最少? MLLM 注意力 注意力 Q Qv Qt f̃v f̃t 上下文自适应令牌链 Q K V K V Q 感知扫描 上下文重聚焦 果断行动 注意力 注意力 f̃t f̃v 桌子周围坐着几个人在吃披萨,他们可以位于 我需要进一步检查 底部左侧的男子是目标,因为他的 每个盘子以及哪个盘子上的披萨最少, Q 注意力 证据不足,切换到推理模式。 盘子属于每个人,因此最终目标 Qc Qrc 空间接地 思维令牌化 切换 聚焦适配器 适配器 证据充足,解码 聚焦 P令牌 解码器 在感知模式下解码令牌。 适配器
<P_0> 答案:ℳprior 解码器 [2, 458, 331, 919] fv . <P_6> 卷积 卷积 在感知模式下解码 在推理模式下解码 R令牌 ZP 0.82 ZP; ZR 0.94 fg fw
<R_10> 0.68 0.29 K V K V 解码器 解码器 <R_15> 0.27 0.17 Q 注意力 Q 注意力 fv <R_20> fv Qagg Qorc 0.13 0.05
图3 思维令牌混合概览。我们提出空间接地思维令牌化,将思维令牌与特定的空间位置对齐。然后提出上下文自适应令牌链,使多模态大语言模型能够遵循“扫描-聚焦-行动”范式自适应地切换定位模式。模型首先预测感知思维令牌(P令牌)以捕捉细粒度的视觉线索。随后,切换适配器评估上下文以确定适当的定位模式。对于简单查询,P令牌由解码器直接解码。然而,对于需要更深层次推理的复杂查询,文本反思和细化的视觉证据被用作重聚焦上下文,以指导推理思维令牌(R令牌)的生成,然后这些令牌与P令牌一起由解码器联合解码。
用于生成提议的低级定位器,而VGent Kang等人(2025a)将这些提议与MLLM的隐藏状态结合,用于基于解码器的选择。尽管这种策略避免了直接生成坐标,但它严重依赖于提议质量,并且在区分多个候选区域中的细粒度细节方面存在困难。第三种是特殊令牌解码。LLaVA-Grounding Zhang等人(2024)通过特殊令牌将MLLM与定位模型连接,而VisionLLM Wang等人(2023)和VisionLLM v2 Wu等人(2024a)进一步采用了任务特定令牌和路由令牌。然而,通过特殊令牌进行的隐式对齐往往限制了推理能力。
3 方法论
我们提出了一种用于自由形式多模态定位的统一框架,该框架集成MLLM以生成思维令牌的混合体,在潜在空间中压缩视觉和语义线索,而解码器将这些表示映射到坐标。
3.1 空间接地思维令牌化
我们将自由形式多模态定位定义为响应任意组合的文本或视觉查询以定位目标区域的任务,涵盖从单张到多张候选图像。
我们通过利用MLLM的多模态编码能力,将所有输入信息统一为单个序列 X = {I, qv, qt}。这里,I 表示一个或多个目标图像,而视觉查询 qv 由参考图像或直接渲染在其上的空间线索(例如,框、点)组成。文本查询 qt 涵盖各种形式,从类别名称到涉及隐含关系的问题。由于 qv 和 qt 都是可选的,因此模型能够处理任意输入组合。给定这种统一输入
4
第 5 页
思维令牌混合:自由形式多模态接地中统一感知与推理
条件,模型自回归地生成输出序列 $Y = (y_1, \dots, y_L)$ 如下:
$$ P(Y | X; \theta) = \prod_{i=1}^{L} P(y_i | y_{<i}, I, q_v, q_t; \theta), \quad (1) $$
其中 $\theta$ 表示可学习参数。
为了统一输出表示,MLLM 首先感知细粒度的图像细节,并通过预测连续的特殊令牌执行语义推理,从而直接在潜在空间中实现感知和推理。其次,解码器从这些潜在表示中预测精确的边界框。为了增强这些令牌的可解释性,我们提出了空间接地思维令牌化(Spatially-Grounded Thought Tokenization),并引入了空间对齐的思维令牌。具体而言,每个令牌作为一个离散的空间锚点,指示感兴趣区域,明确对应于图像中的唯一位置。我们将目标图像 $I$ 划分为 $N \times N$ 网格,从而定义一个由 $N^2$ 个空间锚点组成的细粒度词汇表,线性索引从 0 到 $N^2 – 1$:
$$ \mathcal{T}_{\text{thought}} = \{t_k \mid 0 \le k < N^2\}, \quad (2) $$
其中 $t_k$ 表示对应于第 $k$ 个空间锚点的思维令牌,该锚点映射到网格中的特定位置。将思维令牌与网格位置对齐,使模型能够将多样的感知和语义线索压缩到潜在空间中,同时确保空间可解释性。通过利用这些潜在表示,模型比离散文本令牌保留了更全面的信息,实现了以图像为中心的鲁棒感知和推理。对于每个查询的真实边界框 $B_q = \{b_1, \dots, b_M\}$,我们通过选择与目标区域最相关的空间锚点来构建思维令牌的动态序列 $S_{\text{thought}}$。具体而言,对于 $N \times N$ 网格中的每个网格单元 $k$(其中 $0 \le k < N^2$),我们计算聚合的重叠分数 $\alpha_k$。该分数定义为 $\alpha_k = \sum_{b \in B_q} \text{IoU}(C_k, b)$,表示所有目标框在该单元上的总覆盖范围,其中 $C_k$ 表示第 $k$ 个网格单元。然后我们按 $\alpha_k$ 对单元进行排序,并选择排名靠前的单元作为思维令牌,丢弃任何重叠为零的单元。所选令牌的数量在 $[K_{\min}, K_{\max}]$ 范围内动态确定。形式上,序列定义为:
$$ S_{\text{thought}} = \{t_k \in \mathcal{T}_{\text{thought}} \mid \text{rank}(\alpha_k) \le K, \alpha_k > 0\}, \quad (3) $$
其中 $K = \min(K_{\max}, \max(K_{\min}, |\{k \mid \alpha_k > 0\}|))$。这种选择机制确保 MLLM 主要关注相关的空间锚点,从而提高了效率和可解释性。
3.2 上下文自适应令牌链(Context-Adaptive Chain-of-Tokens)
感知扫描。给定输入查询,如果提供了多张图像,MLLM 首先从候选集中识别目标图像。然后,它在 $N_p \times N_p$ 网格上生成一系列感知思维令牌,长度在 $[K_{p\min}, K_{p\max}]$ 内自适应变化,以捕捉潜在表示中的细粒度感知细节。生成的序列记为 $S_p$,随后由切换适配器(Switch Adapter)处理,该适配器总结与查询相关的信息以生成用于模式选择的上下文指示器。具体而言,我们使用可学习查询 $Q_v \in \mathbb{R}^{L_v \times d}$ 和 $Q_t \in \mathbb{R}^{L_t \times d}$ 压缩图像特征 $f_v \in \mathbb{R}^{N_v \times d}$ 和文本嵌入 $f_t \in \mathbb{R}^{N_t \times d}$,其中 $L_v$ 和 $L_t$ 表示查询数量,$d$ 是共享维度。随后进行跨模态融合:
$$ \tilde{f}_v = \text{Attn}(Q_v, f_v, f_v), \quad \tilde{f}_t = \text{Attn}(Q_t, f_t, f_t), \quad (4) $$ $$ f'_t = \text{Attn}(\tilde{f}_t, \tilde{f}_v, \tilde{f}_v), \quad f'_v = \text{Attn}(\tilde{f}_v, \tilde{f}_t, \tilde{f}_t). $$
随后,融合后的视觉和文本特征($f'_v$ 和 $f'_t$)被组合以更新全局可学习上下文查询 $Q_c \in \mathbb{R}^{L \times d}$:
$$ Q^r_c = \text{Attn}(Q_c, [f'_t; f'_v], [f'_t; f'_v]), \quad (5) $$
其中 $[\cdot; \cdot]$ 表示按特征拼接。这个精炼的上下文查询 $Q^r_c$ 被附加在 $S_p$ 之后。基于切换上下文 $X_{sw}$,MLLM 随后生成长度为 $L_{sw}$ 的决策序列 $Y$:
$$ P(Y | X_{sw}; \theta) = \prod_{i=1}^{L_{sw}} P(y_i | y_{<i}, X, T_{id}, S_p, Q^r_c; \theta). \quad (6) $$
5
第 6 页
思维令牌混合:为自由形式多模态接地统一感知与推理
其中 $T_{id}$ 表示指示目标图像的文本。多模态大语言模型(MLLM)判断视觉线索是否充足。当视觉线索充足时,MLLM 生成触发序列(例如,“以感知模式解码令牌”)以终止推理并执行解码。否则,流程进入推理模式。
上下文重新聚焦。在推理模式下,MLLM 首先通过结合文本反思和针对性视觉证据来执行上下文重新聚焦。首先,MLLM 生成显式的文本反思链,以识别 P-Tokens 捕获的潜在表示中的局限性,避免将视觉线索直接投影到离散文本空间。这一策略减轻了将连续表示转换为离散符号时固有的细微感知细节丢失问题。相反,这些反思明确表征了接地挑战,例如宽泛的目标分布、小物体尺度或语义歧义,从而在保持潜在空间连续性的同时确保推理的一致性。随后,采用聚焦适配器(Focus Adapter)来总结由 P-Tokens 识别的候选视觉区域。我们首先基于 P-Tokens 指示的网格位置构建视觉补丁图 $M_{prior}$。具体而言,如果来自视觉特征 $f_v$ 的每个补丁与任何选定的网格区域重叠,则将其值设为 1,否则为 0。该二值图有效地突出了与目标分布相关的补丁。然后处理视觉特征 $f_v$ 以捕获全局和针对目标的上下文。
$$f_g = \text{Conv}_g(f_v), \quad f_w = \text{Conv}_w(f_v \odot M_{prior}), \quad (7)$$
其中 $f_g$ 和 $f_w$ 分别表示全局和针对目标的特征,$\odot$ 表示逐元素乘积。为了整合由生成的 P-Tokens 提供的感知上下文,我们利用来自 MLLM 的上下文查询 $Q_{rc}$ 的输出表示 $Q_{rc}^o$ 作为初始化查询,并执行分层交叉注意力:
$$Q_{agg} = \text{Attn}(\text{Attn}(Q_{rc}^o, f_g, f_g), f_w, f_w), \quad (8)$$
这通过首先结合全局特征,然后用针对目标的特征对其进行细化,将查询转换为紧凑的放大视觉令牌。这些生成的查询 $Q_{agg}$ 作为重新聚焦的视觉证据,并附加在文本反思之后,以共同指导推理思维令牌的生成。
决定性行动。基于前一阶段聚合的文本反思和视觉证据,MLLM 进入决定性行动阶段,以生成推理思维令牌(R-Tokens)的动态序列。概率公式化为:
$$P(Y | X^r) = \prod_{i=1}^{L_r} P(y_i | y_{<i}, X_{sw}, T_{ref}, Q_{agg}; \theta), \quad (9)$$
其中 $T_{ref}$ 和 $Q_{agg}$ 分别代表文本反思和视觉证据。生成的序列记为 $S_r$,其作用于大小为 $N_r \times N_r$ 的网格,其长度 $L_r$ 在 $[K_r^{\min}, K_r^{\max}]$ 内自适应变化。我们设置 $N_r > N_p$ 以实现更细的网格划分,确保每个令牌对应更小的网格,从而实现更精确的定位。随后,引入类似 DETR 的 Zhu et al. (2020) 解码器,将这些空间对齐的思维令牌转换为显式区域。该解码器包含三个 Transformer 解码器层和两个用于边界框回归和置信度评分的预测头,它通过投影潜在表示来初始化对象查询,具体取决于接地模式:
$$Q_{object} = \begin{cases} \text{MLP}(Z_P), & \text{if mode} = \text{perceptual}, \\ \text{MLP}([Z_P; Z_R]), & \text{if mode} = \text{reasoning}, \end{cases} \quad (10)$$
其中 $Z_P$ 和 $Z_R$ 分别表示 P-Tokens 和 R-Tokens 的潜在表示,$[\cdot; \cdot]$ 表示沿令牌维度的拼接,$\text{MLP}(\cdot)$ 将表示投影到解码器的查询空间。最后,建模的对象查询 $Q_{object}$ 通过 Transformer 层与目标图像特征交互,以产生最终的边界框和置信度分数。
3.3 训练策略
数据构建策略。为了促进基于查询难度的自适应模式选择,我们提出了一种双模态数据构建框架,该框架在两个数据池上运行:(i) 开放词汇检测数据:
6
第 7 页
思维令牌混合:为自由形式多模态接地统一感知与推理
我们实施一种基于规则的硬样本挖掘策略。尾部类别的实例被直接识别为硬样本。对于头部类别,我们分析目标密度和边界框的纵横比。表现出高目标密度或极小边界框面积的查询被归类为硬样本,而其他查询则被视为易样本。(ii) 引用接地数据:我们采用 Qwen3-VL-235B-A22B Bai et al. (2025a) 通过每个查询重复生成 8 次来评估查询难度。在超过 50% 的尝试中成功解决的查询被归类为易样本。对于剩余的候选项,我们采用相同的 MLLM 进行二次细化:那些尽管存在轻微定位偏差但仍能正确识别目标的被重新归类为易样本,而那些表现出核心推理失败或缺失关键证据的则保持为硬样本。基于此分类,我们构建真实标签序列。对于易样本,我们利用 P-Tokens 直接编码目标区域。对于硬样本,我们利用 MLLM 显式反思错误原因并将其总结为反思推理链。这些硬样本随后通过结合 P-Tokens 与 R-Tokens 形成。详细的分布统计信息见补充材料。
训练阶段。我们的训练策略包含两个阶段,以平衡感知和推理能力。首先,我们在易开放词汇检测样本上预训练模型,专注于学习感知扫描并生成 P-Tokens,以增强对多样化物体类别的泛化能力。其次,我们在完整数据集上微调模型,以覆盖完整的扫描-聚焦-行动范式。这使得模型能够区分接地模式,并利用 P-Tokens 和 R-Tokens 进行基于推理的决策,同时保留细粒度检测能力。
训练目标。我们使用两个主要目标优化模型:语言建模损失 Ltxt 和接地损失 Ldet。对于自回归输出,语言损失采用标准的监督微调,使用逐令牌交叉熵: Ltxt = – (1/T) Σ_t log p(ˆyt | X, y<t), (11) 其中 ˆyt 表示步骤 t 的真实标签令牌。接地损失 Ldet 包含边界框回归和分类组件,其中预测框通过匈牙利算法 Kuhn (1955) 与真实标签框进行匹配。遵循先前的工作 Carion et al. (2020); Meng et al. (2021); Liu et al. (2022),我们利用 L1 损失 LL1 和 GIoU 损失 Lgiou Rezatofighi et al. (2019) 进行边界框回归。对于分类,我们采用 Grounding DINO Liu et al. (2024) 中的焦点损失策略,并进行关键修改,即保留所有正预测,同时仅对得分最高的前 K 个硬负样本应用焦点损失监督,公式如下:
Lcls = FL(ˆsi,j, 1) + (1/Nsel) Σ_i [ Σ_{j∈Pi} FL(ˆsi,j, 0) + Σ_{j∈Nihard} FL(ˆsi,j, 0) ], (12)
其中 i 和 j 分别表示样本索引和预测索引,FL(·) 表示焦点损失,ˆsi,j 表示第 i 个样本中第 j 个预测的分类得分。Pi 和 Nihard 分别表示第 i 个样本的匹配正预测集合和得分最高的前 K 个硬负样本集合,Nsel = Σ_i (|Pi| + |Nihard|) 表示所有训练样本中选定预测的总数。最后,整体训练目标结合这些组件如下:
L = λtxtLtxt + λL1LL1 + λgiouLgiou + λclsLcls, (13)
其中 λtxt, λL1, λgiou 和 λcls 分别是语言建模和接地各项损失的平衡权重。
3.4 PR-Bench 统计
我们构建了 PR-Bench,这是一个全面的 REC 基准,评估两项核心能力:视觉线索感知和组合推理。视觉线索感知包含三个子类别:(1) 属性,捕捉内在视觉特性;(2) 位置,定义物体间的空间关系;以及 (3) 交互,描述类别内的相对关系。组合推理解决更复杂的任务:(4) 关系,涉及多物体组合引用;(5) 常识,需要
7
第 8 页
思维令牌混合:免费统一自由形式多模态接地的感知与推理
无需显式命名的上下文识别;以及(6)拒绝,处理针对不存在对象的查询。我们使用 FineHARD Xie 等人 (2025) 中的图像构建 PR-Bench。提出了一种基于多模态大语言模型(MLLM)的标注流水线来生成初始的查询-边界框对,随后由十名人工标注员进行细化。PR-Bench 包含 6,000 个均匀分布的对,涵盖六个子类别,利用超过 1,000 种对象类型的高分辨率图像。它保持了 9% 的平均目标面积比,特别强调边缘可见的目标。
4 实验
4.1 实验设置
数据集与任务。我们构建了训练数据池,包括作为开放词汇检测数据的 Object365 Shao 等人 (2019),以及多样化的指代接地数据,包括 MGrounding-630k Li 等人 (2025)、RefCOCO/+/g Yu 等人 (2016); Mao 等人 (2016)、VisualGenome Krishna 等人 (2017)、gRefCOCO He 等人 (2023)、HumanRef Jiang 等人 (2025b)、ReasonSeg Lai 等人 (2024)、OmniRef Zheng 等人 (2025a) 和 Rexverse2M Jiang 等人 (2024b)。我们在三个核心任务上评估 Motto。对于开放词汇检测,我们遵循 T-Rex2 Jiang 等人 (2024a) 在 COCO Lin 等人 (2014) 上报告结果,涵盖三种提示设置:文本(类别名称)、视觉-G(参考图像)和视觉-I(交互框)。对于指代性图像定位(REC),我们在 RefCOCO Yu 等人 (2016)、RefCOCO+ Yu 等人 (2016)、RefCOCOg Mao 等人 (2016)、Ref-L4 Chen 等人 (2025)、gRefCOCO He 等人 (2023)、HumanRef Jiang 等人 (2025b) 和 ReasonSeg Lai 等人 (2024) 上评估性能,输入从短短语和长描述到推理问题,目标从单个对象到多个对象。注意,ReasonSeg Lai 等人 (2024) 是通过从原始掩码中提取边界框来使用的。随后,我们采用 MIG-Bench Li 等人 (2025) 进行多图像接地。我们进一步在提出的 PR-Bench 上评估模型的全面感知和推理能力。
评估指标。对于 REC,遵循标准协议 Kazemzadeh 等人 (2014); Yu 等人 (2016); Mao 等人 (2016),我们在 RefCOCO Yu 等人 (2016)、RefCOCO+ Yu 等人 (2016)、RefCOCOg Mao 等人 (2016) 和 Ref-L4 Chen 等人 (2025) 上使用 Acc@0.5 评估单对象接地。对于多对象接地,我们在 gRefCOCO He 等人 (2023) 和 ReasonSeg Lai 等人 (2024) 上报告 Pr@(F1 = 1, IoU ≥0.5) (Pr) 和无目标准确率 (N-Acc),以及在 HumanRef Jiang 等人 (2025b) 上报告密度 F1 (DF1) 和拒绝分数 (Rej)。在多图像接地中,我们在 MIG-Bench Li 等人 (2025) 上使用 Acc@0.5。对于 COCO Lin 等人 (2014) 上的对象检测,我们报告 mAP 和 F1,其中 F1 表示 F1@mIoU。对于 PR-Bench,我们采用平均准确率 (mAcc) 和 N-Acc。mAcc 计算为五个非拒绝子类别的平均准确率,分数在 IoU 阈值从 0.5 到 0.9(步长 0.05)上平均。此外,我们报告两个专用指标:mAccAP I,在视觉线索感知中的三个子类别上平均,以及 mAccRC,在排除拒绝后的组合推理的两个子类别上平均。
实现细节。Motto 基于 Qwen3-VL-2B Bai 等人 (2025a) 构建。在第一阶段,我们以 512 的批量大小训练所有参数 2 个 epoch。学习率设置为解码器 1 × 10−4,MLLM 为 1 × 10−5。在第二阶段,我们以 128 的批量大小训练 2 个 epoch,采用解码器 2 × 10−5 和 MLLM 1 × 10−5 的学习率。P 令牌和 R 令牌的网格大小设置为 3 × 3 和 5 × 5,向文本词汇表中引入了总共 34 个额外令牌,P 令牌和 R 令牌的最大令牌长度分别为 4 和 6。对于损失函数,权重系数配置为 λtxt = 1.0,λL1 = 2.0,λgiou = 5.0,以及 λcls = 4.0。我们在 Lcls 中将 K 设置为 20 以进行 top-K 难负样本选择。所有实验均在 32 块 NVIDIA A800-80G GPU 上进行。
4.2 主要结果
文本和视觉提示下的对象检测。我们在 COCO 基准上评估 Motto 的零样本能力。通过预测空间对齐的思维令牌,Motto 显式地定位感兴趣区域,同时将丰富的感知和语义信息压缩到紧凑的潜在空间中。在标准文本提示设置下,尽管仅使用了一半的训练数据,Motto 的性能与现有的 MLLM 方法(例如 Rex-Omni)具有竞争力。对于视觉提示,我们考虑两种场景:基于图像的查询(Visual-G)和特定区域的查询(Visual-I)。Motto 在这两方面都表现出色,分别以 mAP 优势 5.2% 和 0.4% 超越第二好的模型。值得注意的是,虽然通用 MLLM 已经具备能力
8
第 9 页
思维令牌混合:免费统一自由形式多模态接地的感知与推理
表 1 通用指代表达式理解基准上的比较。最佳结果以粗体显示,次佳结果以下划线标示。“–”表示不可用或未报告的结果。
gRefCOCO HumanRef PR-Bench 模型 参数量 RefCOCO RefCOCO+ RefCOCOg Ref-L4 ReasonSeg Pr N-Acc DF1 Rej mAcc N-Acc
通用多模态大语言模型 Qwen3-VL Bai 等人 (2025a) 2B 87.4 78.1 84.9 85.4 46.5 25.1 58.9 – 49.8 52.8 – Youtu-VL Wei 等人 (2026) 4B 93.2 89.8 92.6 83.3 25.7 – 55.3 – 51.3 53.2 – InternVL3.5 Wang 等人 (2025b) 8B 91.9 87.6 89.5 80.9 31.2 – 40.0 33.1 38.3 41.5 – Qwen3-VL Bai 等人 (2025a) 8B 90.6 84.8 88.2 88.5 55.4 55.0 64.9 47.9 56.4 59.4 16.2 GLM-4.1V-Thinking Hong 等人 (2025) 9B 88.9 82.9 86.3 84.8 49.3 29.0 58.6 34.5 57.6 57.9 – Qwen3.5 Qwen Team (2026) 9B 87.2 88.8 88.2 89.0 56.3 – 72.0 10.8 56.6 63.7 11.9 Qwen3.5 Qwen Team (2026) 27B 92.5 89.6 90.6 90.2 56.7 – 71.5 13.4 65.7 65.3 – InternVL3.5 Wang 等人 (2025b) 38B 90.4 87.4 89.8 85.5 36.0 – 51.1 – 51.7 48.5 12.7
接地专用多模态大语言模型 VLM-R1 Shen 等人 (2025) 3B 89.2 83.5 86.2 80.9 45.7 30.6 46.4 27.1 26.5 54.4 – VLM-FO1 Liu 等人 (2025a) 3B 90.8 86.3 88.6 84.4 58.7 52.5 82.6 46.4 46.7 53.9 11.4 Rex-Omni Jiang 等人 (2025a)[CVPR’26] 3B 86.3 78.6 86.7 78.0 38.0 33.6 74.9 – 40.6 53.7 – Chatrex Jiang 等人 (2024b) 7B 90.7 87.0 89.9 80.0 29.9 – 55.6 – 23.0 49.5 – ROD-MLLM Yin 等人 (2025)[CVPR’25] 7B 89.8 84.1 86.7 – 53.5 57.8 – – – – – Migician Li 等人 (2025)[ACL’25] 7B 90.8 85.7 87.9 73.2 29.4 14.4 45.9 26.0 47.3 52.3 – DeepEyes Zheng 等人 (2025b)[ICLR’26] 7B 89.8 83.6 86.7 85.2 50.3 38.4 50.3 22.8 68.6 45.7 – VGent Kang 等人 (2025a)[CVPR’26] 7B 92.3 87.9 90.3 – – – – – – – – Motto 2B 94.0 90.8 93.1 92.5 69.6 58.0 83.0 53.4 71.2 71.7 46.9
表 2 不同提示设置(文本、视觉-G 和视觉-I)下在 COCO 上的比较。表 3 在 MIG-Bench Li 等人 (2025) 上的比较。SG(瞬时接地)平均静态、鲁棒和 “–”表示不可用结果,∗表示非零样本重 常见设置的结果。V(视觉参考)聚合对象跟踪 试结果。最佳和次佳结果以粗体和下划线突出 (OT)、多视图 (MV)、区域和指代表达式任务。T(文本) 显示。 对应于组接地 (GG)。V+T 平均推理 文本 视觉-G 视觉-I 和对应 (Co-Re) 任务。最佳和次佳结果 模型 mAP F1 mAP F1 mAP F1 以粗体和下划线突出显示。 T-Rex-2 52.2 – 46.5 – 58.5 – 模型 参数量 SG V T V+T AVE Youtu-VL 4B 33.3 37.3 37.9 21.1 32.9 VLM-FO1-3B 44.4∗ – 14.1∗ 24.9∗ 11.0∗ 20.3∗ Migician 7B 65.4 70.5 66.5 46.8 63.8 Rex-Omni-3B – 52.9 17.4 29.9 – 61.3 Qwen3-VL 8B 34.6 25.6 53.9 29.2 31.8 Youtu-VL-4B 47.1 – 18.4 26.8 21.0 27.4 Qwen3.5 9B 40.1 29.9 44.9 16.2 31.7 Qwen3.5-9B 37.7 48.7 20.8 36.9 32.6 45.1 GLM-4.1V-Thinking 9B 50.1 39.5 63.5 47.5 46.7 Qwen3.5-27B 38.8 50.6 22.2 37.4 33.3 45.6 Qwen3.5 27B 48.7 37.8 66.1 31.9 42.7 Motto 56.4 62.1 51.7 57.4 58.9 65.7 Motto 2B 71.0 81.2 85.4 61.0 74.5
为了处理视觉提示,Motto 显著增强了这一能力,从而实现精确接地。这些改进展示了强大的泛化能力,以及 Motto 从大规模数据集中受益的潜力。
通用指代表达式理解。表 1 将 Motto 与各种基准上的最先进模型进行了比较,避免了仅依赖 RefCOCO/+/g 的偏差。Motto 在 RefCOCO/+/g(短短语)和 Ref-L4(长描述)上均优于现有方法,有效处理从短短语到复杂句子的查询。在 gRefCOCO 和 HumanRef 等多目标基准上,Motto 能够准确定位多个目标,并在不存在对象时自信地拒绝查询,从而缓解了仅针对单个正对象训练的常见幻觉问题。值得注意的是,基于检索的方法如 ChatRex Jiang 等人 (2024b) 由于推理能力有限,在 ReasonSeg 上表现不佳,因为该任务需要对目标进行深入语义理解。相比之下,Motto 通过在上下文自适应令牌链中聚合语义和视觉上下文,实现了具有竞争力的性能。最后,虽然模型在 RefCOCO 等标准数据集上趋于饱和,但其在 PR-Bench 上的性能显著下降,突显了将高级感知与推理相结合的必要性。PR-Bench 中六个子类别的更详细比较见补充材料。
多图像接地。如表 3 所示,尽管参数量显著少于其他模型,Motto 在 MIG-Bench 的所有任务上均取得了最先进性能,比第二好的模型平均提高了 10.7%。自由形式多图像接地仍然是一个重大挑战:传统检测模型不支持此类任务,而现有的多模态大语言模型尽管具备自由形式接地能力,但在扩展到多图像场景时却表现不佳。即使是 Qwen3.5 等先进模型也表现不佳,特别是
第 10 页
思维令牌混合:免费统一自由形式多模态定位的感知与推理
表4 COCO、PR-Bench和MIG-Bench上增量组件的消融研究 表5 空间接地思维令牌化中不同网格大小的消融研究。
设置 COCO PR-Bench MIG-Bench AVG 网格大小 PR-Bench mAcc AP I mAcc RC N-Acc COCO MIG-Bench AVG P令牌 R令牌 mAcc AP I mAcc RC N-Acc 基线 <Det>(短长度) 44.6 67.3 54.5 45.3 58.7 54.1 2 × 2 – 45.1 68.4 55.2 46.5 61.2 55.3 <Det>(长长度) 43.2 66.8 54.2 44.7 58.5 53.5 3 × 3 – 46.2 69.1 55.9 46.7 62.6 56.1 ours 4 × 4 – 44.8 67.9 54.4 45.4 60.8 54.7 P令牌 46.2 69.1 55.9 46.7 62.6 56.1 3 × 3 3 × 3 46.0 70.1 58.6 46.4 64.7 57.2 + R令牌 45.9 70.3 59.4 45.8 65.3 57.3 3 × 3 4 × 4 46.2 72.5 61.0 46.1 66.1 58.4 + 切换适配器 46.4 71.6 60.9 46.5 66.2 58.3 + 文本反思 46.7 72.4 61.7 46.4 66.6 58.8 3 × 3 5 × 5 46.6 73.2 63.2 46.3 67.5 59.4 + 聚焦适配器 46.6 73.2 63.2 46.3 67.5 59.4 3 × 3 6 × 6 45.2 71.8 60.3 46.2 65.6 57.8
表6 不同定位模式的消融研究。 COCO Ref-L4 PR-Bench 数据分布 90 40 93 20
84 30 79 15 PR-Bench 训练 COCO Ref-L4 AVG 65 20 71 10 63 策略 准确率(%) 60 准确率(%) mAcc AP I mAcc RC N-Acc 48 10 比例(%) 49 5 比例(%) 感知 43 0 39 0 46.2 88.2 69.1 55.9 46.7 61.2 1 2 3 4 5 6 3 4 5 6 7 8 仅 P令牌长度 R令牌长度 推理 43.6 90.4 67.7 60.4 45.8 61.6 仅 图4 不同令牌长度限制下的性能 自适应 46.6 90.7 73.2 63.2 46.3 64.0 的 (a) P令牌和 (b) R令牌,以及 定位 训练数据中实际令牌长度的分布。
在视觉参考 (V) 和推理与对应 (V+T) 中。相比之下,Motto 通过统一输入格式和输出表示,实现了鲁棒的多图像定位。这种设计使模型能够利用 P令牌 和 R令牌 之间的协作,在候选集中准确识别目标图像并定位特定区域。
4.3 消融研究
我们在 300 万样本子集上进行了详细的消融研究,采用了与全数据集训练相同的超参数。
思维令牌混合的效果。如表 4 所示,前两行是使用缺乏显式空间锚点的朴素特殊令牌(例如 <Det>)的基线。相比之下,我们的 P令牌 和 P+R令牌 设置采用具有相同序列长度的空间对齐思维令牌。采用空间对齐的思维令牌显著提升了性能,特别是在长令牌设置中。如果没有显式的空间对齐,增加特殊令牌的数量通常会产生同质化的输出,导致性能大幅下降。相反,我们的 P令牌 和 R令牌 利用在推理链内预测的由粗到细的网格划分。该机制将视觉线索和语义线索顺序压缩为可解释的潜在表示,从而实现更高的准确性。此外,切换适配器带来了平均 1.0% 的提升。这表明自适应选择不仅增强了模式间的协作,还确保了专门的关注:P令牌 捕捉全面的上下文,而 R令牌 处理复杂的推理。最后,结合文本反思和视觉证据增强了推理能力,同时保留了细粒度的感知,验证了我们的思维令牌混合的有效性。
空间接地思维令牌化中的网格大小。我们探讨了思维令牌不同网格大小的影响,评估了仅 P令牌 设置(感知模式)和结合 P令牌 与 R令牌 的完整方法。如表 5 所示,3 × 3 网格在 P令牌 上产生了最佳结果,特别是在 COCO 上。这表明过于粗糙的划分缺乏足够的细节,而过于精细的网格会碎片化视觉证据并限制多模态大语言模型 (MLLM) 的感受野,阻碍全局上下文感知。相反,将 R令牌 网格大小从 3 × 3 增加到 5 × 5 一致地提升了推理指标,混合配置 3 × 3 (P) / 5 × 5 (R) 达到了峰值性能。这表明虽然较粗的网格足以进行广泛的视觉扫描,但在推理阶段更细的划分能够基于聚合的上下文精确定位细微细节。
自适应定位模式。表 6 比较了三种设置:仅感知、仅推理和自适应
10
第 11 页
思维令牌混合:免费统一感知与自由形式多模态定位
问题:在图像中定位南瓜。问题:挂在墙上的图片中,哪些地方兔子可以居住?
朴素 <Det> 令牌 南瓜位于 <Det> <Det> <Det> <Det>。朴素 <Det> 令牌 兔子可能居住的地方位于 <Det> <Det> <Det> <Det>。
第1个 <Det> 第2个 <Det> 第3个 <Det> 第4个 <Det> 第1个 <Det> 第2个 <Det> 第3个 <Det> 第4个 <Det>
Motto 证据南瓜是足够的,解码 <P_2> 令牌 <P_5> 在 <P_6> 感知 <P_7> 模式。Motto 兔子可以住在图片中的帐篷里,或者在墙上的木房子 <P_5> <P_6>。证据不足 … <P_2> <P_5> <P_6> <P_7> <P_5> <P_6> <R_9> <R_16>
图 5 感知模式与推理模式之间热力图的比较。还包括使用朴素特殊令牌 <Det> 的基线可视化。
定位(Motto)。结果表明,自适应定位模式在所有指标上均取得了优越的性能。虽然 Reason-Only 凭借其完整的推理链在基于推理的任务(如 Ref-L4 和 PR-Bench mAccRC 指标)上表现出色,但 Perceptual-Only 在 COCO 等视觉基准以及 PR-Bench mAccAP I 和 N-Acc 指标上表现更佳。这些观察结果突显了无需额外推理的直接定位的必要性。将复杂的推理应用于简单查询不可避免地会偏离以图像为中心的感知,从而导致定位幻觉。因此,Motto 根据聚合上下文动态选择最佳模式,有效地平衡了精确感知与复杂推理。
令牌长度限制与分布分析。图 4 说明了 P-Tokens (KPmax) 和 R-Tokens (KRmax) 的最大令牌限制变化的影响。得益于显式的空间对齐,Motto 在不同的令牌限制下保持稳定的性能,在 KPmax = 4 和 KRmax = 6 时达到峰值。值得注意的是,训练数据中实际令牌长度的分布也与这些峰值相吻合。因此,虽然少数多对象场景需要更长的序列,但设置更高的限制以覆盖这些罕见情况会增加训练不稳定性并降低性能。因此,我们采用 KPmax = 4 和 KRmax = 6 作为最佳配置。
4.4 可视化
图 5 可视化了不同令牌设计的热力图。为了公平比较,我们使用相同数量的令牌来评估感知和推理能力。如前两行所示,Motto 在感知模式下运行,其中每个 P-token 充当不同区域的空間锚点。相比之下,<Det> 令牌的热图表现出同质分布。由于缺乏固有的空间参考,<Det> 令牌在解码过程中往往无法捕捉潜在对象。在后两行中,我们展示了需要推理的场景,其中 <Det> 令牌从一开始就错误识别目标,导致最终结果错误。相比之下,Motto 在推理模式下运行:P-tokens 首先进行全面的感知,随后 R-tokens 通过推理链专注于目标,从而实现鲁棒的定位。
5 结论
我们提出了 Motto,这是一个统一的定位框架,弥合了细粒度感知与复杂推理之间的差距。通过集成空间接地思维令牌化(Spatially-Grounded Thought Tokenization),Motto 实现了具有显式视觉可解释性的精确定位。此外,我们的上下文自适应令牌链(Context-Adaptive Chain-of-Tokens)使模型能够针对不同查询动态平衡感知和推理模式。包括所提出的 PR-Bench 在内的广泛评估表明,Motto 取得了最先进的性能,为自由形式多模态定位建立了强大的基线。
11
第 12 页
思维令牌混合:免费统一自由形式多模态接地的感知与推理
参考文献
Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, 等人。Qwen3-vl 技术报告。arXiv 预印本 arXiv:2511.21631, 2025a.
Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, 等人。Qwen2.5-vl 技术报告。arXiv 预印本 arXiv:2502.13923, 2025b.
Nicolas Carion, Francisco Massa, Gabriel Synnaeve, Nicolas Usunier, Alexander Kirillov, 和 Sergey Zagoruyko. 基于 Transformer 的端到端目标检测。在欧洲计算机视觉会议,页码 213–229。Springer, 2020.
Jierun Chen, Fangyun Wei, Jinjing Zhao, Sizhe Song, Bohuai Wu, Zhuoxuan Peng, S-H Gary Chan, 和 Hongyang Zhang. 在大模态模型时代重新审视指代表达理解评估。在计算机视觉与模式识别会议论文集,页码 513–524, 2025.
Keqin Chen, Zhao Zhang, Weili Zeng, Richong Zhang, Feng Zhu, 和 Rui Zhao。Shikra:释放多模态大语言模型的 指代对话魔力。arXiv 预印本 arXiv:2306.15195, 2023a.
Zhihong Chen, Ruifei Zhang, Yibing Song, Xiang Wan, 和 Guanbin Li. 利用场景知识推进视觉接地:基准与方法。在 IEEE/CVF 计算机视觉与模式识别会议论文集,页码 15039–15049, 2023b.
Agrim Gupta, Piotr Dollar, 和 Ross Girshick。Lvis:用于大词汇实例分割的数据集。在 IEEE/CVF 计算机视觉与模式识别会议论文集,页码 5356–5364, 2019.
Shuting He, Henghui Ding, Chang Liu, 和 Xudong Jiang。Grec:广义指代表达理解。 arXiv 预印本 arXiv:2308.16182, 2023.
Wenyi Hong, Wenmeng Yu, Xiaotao Gu, Guo Wang, Guobing Gan, Haomiao Tang, Jiale Cheng, Ji Qi, Junhui Ji, Lihang Pan, 等人。Glm-4.5 v 和 glm-4.1 v-thinking:通过可扩展强化学习实现多功能多模态推理。arXiv 预印本 arXiv:2507.01006, 2025.
Rui Hu, Lianghui Zhu, Yuxuan Zhang, Tianheng Cheng, Lei Liu, Heng Liu, Longjin Ran, Xiaoxin Chen, Wenyu Liu, 和 Xinggang Wang。Groundingsuite:测量复杂多粒度像素接地。在 IEEE/CVF 国际计算机视觉会议论文集,页码 23105–23114, 2025a.
Yizhi Hu, Zezhao Tian, Xingqun Qi, Chen Su, Bingkun Yang, Junhui Yin, Muyi Sun, Man Zhang, 和 Zhenan Sun. Remerec:关系感知和多实体指代表达理解。在第 33 届 ACM 国际多媒体会议论文集,页码 4010–4019, 2025b.
Qing Jiang, Feng Li, Zhaoyang Zeng, Tianhe Ren, Shilong Liu, 和 Lei Zhang。T-rex2:通过文本-视觉提示协同实现通用目标检测。在欧洲计算机视觉会议,页码 38–57。Springer, 2024a.
Qing Jiang, Gen Luo, Yuqin Yang, Yuda Xiong, Yihao Chen, Zhaoyang Zeng, Tianhe Ren, 和 Lei Zhang。Chatrex:驯化多模态大语言模型以进行联合感知和理解。arXiv 预印本 arXiv:2411.18363, 2024b.
Qing Jiang, Junan Huo, Xingyu Chen, Yuda Xiong, Zhaoyang Zeng, Yihao Chen, Tianhe Ren, Junzhi Yu, 和 Lei Zhang。通过下一点预测检测任何物体。arXiv 预印本 arXiv:2510.12798, 2025a.
Qing Jiang, Lin Wu, Zhaoyang Zeng, Tianhe Ren, Yuda Xiong, Yihao Chen, Liu Qin, 和 Lei Zhang。指代任何人。在 IEEE/CVF 国际计算机视觉会议论文集,页码 21667–21678, 2025b.
Weitai Kang, Jason Kuen, Mengwei Ren, Zijun Wei, Yan Yan, 和 Kangning Liu。Vgent:通过模块化设计实现视觉接地,以解耦推理和预测。arXiv 预印本 arXiv:2512.11099, 2025a.
Weitai Kang, Luowei Zhou, Junyi Wu, Changchang Sun, 和 Yan Yan。基于注意力驱动约束平衡的视觉接地。在第 33 届 ACM 国际多媒体会议论文集,页码 1637–1645, 2025b.
Sahar Kazemzadeh, Vicente Ordonez, Mark Matten, 和 Tamara Berg。Referitgame:在自然场景照片中指代物体。在 2014 年自然语言处理实证方法会议论文集 (EMNLP),页码 787–798, 2014.
12
第 13 页
思维令牌混合:统一自由形式多模态接地的感知与推理
Ranjay Krishna, Yuke Zhu, Oliver Groth, Justin Johnson, Kenji Hata, Joshua Kravitz, Stephanie Chen, Yannis Kalantidis, Li-Jia Li, David A Shamma, 等. Visual genome: 使用众包密集图像注释连接语言与视觉. 国际计算机视觉期刊, 123(1):32–73, 2017.
Harold W Kuhn. 匈牙利分配问题求解方法. 海军研究物流季刊, 2(1-2):83–97, 1955.
Xin Lai, Zhuotao Tian, Yukang Chen, Yanwei Li, Yuhui Yuan, Shu Liu, 和 Jiaya Jia. Lisa: 通过大型语言模型进行推理分割. 在 IEEE/CVF 计算机视觉与模式识别会议论文集, 第 9579–9589 页, 2024.
You Li, Heyu Huang, Chi Chen, Kaiyu Huang, Chao Huang, Zonghao Guo, Zhiyuan Liu, Jinan Xu, Yuhua Li, Ruixuan Li, 等. Migician: 揭示多模态大型语言模型中自由形式多图像接地的魔力. arXiv 预印本 arXiv:2501.05767, 2025.
Tsung-Yi Lin, Michael Maire, Serge Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, 和 C Lawrence Zitnick. Microsoft coco: 上下文中的常见对象. 在欧洲计算机视觉会议, 第 740–755 页. Springer, 2014.
Peng Liu, Haozhan Shen, Chunxin Fang, Zhicheng Sun, Jiajia Liao, 和 Tiancheng Zhao. Vlm-fo1: 弥合 VLM 中高层推理与细粒度感知之间的差距. arXiv 预印本 arXiv:2509.25916, 2025a.
Shilong Liu, Feng Li, Hao Zhang, Xiao Yang, Xianbiao Qi, Hang Su, Jun Zhu, 和 Lei Zhang. Dab-detr: 动态锚框是 DETR 更好的查询. arXiv 预印本 arXiv:2201.12329, 2022.
Shilong Liu, Zhaoyang Zeng, Tianhe Ren, Feng Li, Hao Zhang, Jie Yang, Qing Jiang, Chunyuan Li, Jianwei Yang, Hang Su, 等. Grounding dino: 结合 DINO 与接地预训练以实现开放集目标检测. 在欧洲 计算机视觉会议, 第 38–55 页. Springer, 2024.
Ziyu Liu, Zeyi Sun, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Haodong Duan, Dahua Lin, 和 Jiaqi Wang. Visual-rft: 视觉强化微调. 在 IEEE/CVF 国际计算机视觉会议论文集, 第 2034–2044 页, 2025b.
Chuofan Ma, Yi Jiang, Jiannan Wu, Zehuan Yuan, 和 Xiaojuan Qi. Groma: 用于接地多模态大型语言模型的局部视觉令牌化. 在欧洲计算机视觉会议, 第 417–435 页. Springer, 2024.
Junhua Mao, Jonathan Huang, Alexander Toshev, Oana Camburu, Alan L Yuille, 和 Kevin Murphy. 无歧义对象描述的生成与理解. 在 IEEE 计算机视觉与模式识别会议论文集, 第 11–20 页, 2016.
Depu Meng, Xiaokang Chen, Zejia Fan, Gang Zeng, Houqiang Li, Yuhui Yuan, Lei Sun, 和 Jingdong Wang. Conditional DETR 用于快速训练收敛. 在 IEEE/CVF 国际计算机视觉会议论文集, 第 3651–3660 页, 2021.
Varun K Nagaraja, Vlad I Morariu, 和 Larry S Davis. 建模对象间的上下文以理解指代表达. 在欧洲计算机视觉会议, 第 792–807 页. Springer, 2016.
Zhiliang Peng, Wenhui Wang, Li Dong, Yaru Hao, Shaohan Huang, Shuming Ma, 和 Furu Wei. Kosmos-2: 将多模态大型语言模型接地到世界. arXiv 预印本 arXiv:2306.14824, 2023.
Qwen Team. Qwen3.5: 迈向原生多模态智能体, 2026年2月. URL https://qwen.ai/blog?id=qwen3.5.
Hamid Rezatofighi, Nathan Tsoi, JunYoung Gwak, Amir Sadeghian, Ian Reid, 和 Silvio Savarese. 广义交并比: 边界框回归的度量与损失. 在 IEEE/CVF 计算机视觉与模式识别会议论文集, 第 658–666 页, 2019.
Shuai Shao, Zeming Li, Tianyuan Zhang, Chao Peng, Gang Yu, Xiangyu Zhang, Jing Li, 和 Jian Sun. Objects365: 大规模高质量目标检测数据集. 在 IEEE/CVF 国际计算机视觉会议论文集, 第 8430–8439 页, 2019.
Haozhan Shen, Peng Liu, Jingcheng Li, Chunxin Fang, Yibo Ma, Jiajia Liao, Qiaoli Shen, Zilun Zhang, Kangjia Zhao, Qianqian Zhang, 等. Vlm-r1: 一种稳定且可泛化的 R1 风格大型视觉语言模型. arXiv 预印本 arXiv:2504.07615, 2025.
Aaditya Singh, Adam Fry, Adam Perelman, Adam Tart, Adi Ganesh, Ahmed El-Kishky, Aidan McLaughlin, Aiden Low, AJ Ostrow, Akhila Ananthram, 等. Openai gpt-5 系统卡. arXiv 预印本 arXiv:2601.03267, 2025.
13
第 14 页
思维令牌混合:免费统一感知与自由形式多模态接地
唐浩,谢晨伟,王海阳,包晓毅,翁廷宇,李攀登,郑云,王立伟。Ufo: 一种通过开放式语言接口实现细粒度视觉感知的统一方法。在第三十九届 神经信息处理系统年会论文集。
唐诗雨,罗兆凡,王一凡,王立军,陆虎川,苏卫波,刘立波。Lovd:大词汇量 开放词汇目标检测。在第32届ACM多媒体国际会议论文集,页码 9321–9329,2024。
王浩,乔立猛,季泽群,黄志坚,冯成建,郑庆芳,马林,兰祥元,梁晓丹。X-sam:从分割万物到任意分割。arXiv预印本 arXiv:2508.04655,2025a。
王浩,乔立猛,季泽群,黄志坚,冯成建,郑庆芳,马林,兰祥元,梁晓丹。X-sam:从分割万物到任意分割。在AAAI人工智能会议论文集,第40卷,页码26187–26196,2026a。
王世豪,刘世龙,官元国,魏新宇,刘扬州,李志强,满云泽,陈果,陶安德,刘桂林,Jan Kautz,张磊,余志丁。Locateanything:通过并行框解码实现快速高质量视觉语言接地。arXiv:2605.27365,2026b。
王卫云,高章伟,顾立新,蒲恒军,崔龙,魏兴光,刘朝阳,景玲玲,叶圣龙,邵杰,等。Internvl3.5:在通用性、推理和效率方面推进开源多模态模型。arXiv预印本 arXiv:2508.18265,2025b。
王文海,陈哲,陈小康,吴建南,朱西洲,曾刚,罗平,陆通,周杰,乔宇,等。Visionllm:大型语言模型也是面向视觉任务的开放式解码器。神经信息处理系统进展,36:61501–61513,2023。
魏志祥,李毅,阚哲瀚,蒋兴华,龙祖伟,刘世峰,沈洪泽,刘伟,谭晓宇,林浩佳,等。Youtu-vl:通过统一的视觉语言监督释放视觉潜力。arXiv预印本 arXiv:2601.19798,2026。
吴建南,钟慕言,邢森,赖泽强,刘朝阳,陈哲,王文海,朱西洲,卢伟力,陆通,等。Visionllm v2:一种端到端的通用多模态大型语言模型,用于数百个视觉语言任务。神经信息处理系统进展,37:69925–69975,2024a。
吴俊达,张哲浩,夏宇,李新通,夏朝阳,Aaron Chang,于彤,Kim Sungchul,Rossi Ryan A,张瑞义,等。多模态大型语言模型中的视觉提示:综述。arXiv预印本 arXiv:2409.15310,2024b。
肖林辉,杨晓山,彭芳,王耀伟,徐长生。Hivg:用于视觉接地的分层多模态细粒度调制。在第32届ACM多媒体国际会议论文集,页码5460–5469,2024。
肖林辉,杨晓山,兰祥元,王耀伟,徐长生。迈向视觉接地:综述。IEEE模式分析与机器智能汇刊,2025。
谢春宇,王斌,孔凡景,李金城,梁大卫,张庚申,冷大卫,尹玉辉。Fg-clip:细粒度视觉与文本对齐。arXiv预印本 arXiv:2505.05071,2025。
徐云秋,朱林超,杨毅。Mc-bench:多模态大型语言模型时代多上下文视觉接地的基准。在IEEE/CVF国际计算机视觉会议论文集,页码17675–17687,2025。
阎子昂,李智林,何一男,王辰廷,李昆昌,李欣浩,曾祥宇,王子磊,王亚丽,乔宇,等。任务偏好优化:通过视觉任务对齐改进多模态大型语言模型。在计算机视觉与模式识别会议论文集,页码29880–29892,2025。
杨安,李安峰,杨宝松,张北辰,惠斌源,郑博,余博文,高畅,黄成根,吕晨旭,等。Qwen3技术报告。arXiv预印本 arXiv:2505.09388,2025。
尹恒,任玉强,严科,丁守宏,郝永涛。Rod-mllm:在多模态大型语言模型中实现更可靠的目标检测。在计算机视觉与模式识别会议论文集,页码14358–14368,2025。
于立成,Patrick Poirson,杨珊,Alexander C Berg,Tamara L Berg。建模指代表达中的上下文。在欧洲计算机视觉会议论文集,页码69–85。Springer,2016。
于振达,陈锦,沈家宇,周兰香,方涵,臧祥浩,班超,陈景峰,何忠江,孙浩,李泽瑞,康艳梅。Vico:一种多任务视频增强且认知保持的模态
14
第 15 页
思维令牌混合:自由形式多模态接地中感知与推理的统一
对齐训练框架。在 ICASSP 2025 – 2025 IEEE 国际声学、语音和信号处理会议 (ICASSP),第 1–5 页,2025。doi: 10.1109/ICASSP49660.2025.10888636。
Alireza Zareian, Kevin Dela Rosa, Derek Hao Hu, 和 Shih-Fu Chang。使用标题进行开放词汇目标检测。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 14393–14402 页,2021。
Yufei Zhan, Yousong Zhu, Zhiyang Chen, Fan Yang, Ming Tang, 和 Jinqiao Wang。Griffon:利用大语言模型在任何粒度下拼写出所有目标位置。在欧洲计算机视觉会议,第 405–422 页。Springer,2024。
Hao Zhang, Hongyang Li, Feng Li, Tianhe Ren, Xueyan Zou, Shilong Liu, Shijia Huang, Jianfeng Gao, Leizhang, Chunyuan Li, 等人。Llava-grounding:基于大型多模态模型的接地视觉聊天。在欧洲计算机视觉会议,第 19–35 页。Springer,2024。
Minghang Zheng, Jiahua Zhang, Qingchao Chen, Yuxin Peng, 和 Yang Liu。Resvg:增强视觉接地中多实例的关系和语义理解。在第 32 届 ACM 国际多媒体会议论文集,第 1187–1196 页,2024。
Qiancheng Zheng, Yunhang Shen, Gen Luo, Baiyang Song, Xing Sun, Xiaoshuai Sun, Yiyi Zhou, 和 Rongrong Ji。Omni-referring 图像分割。arXiv 预印本 arXiv:2512.06862,2025a。
Ziwei Zheng, Michael Yang, Jack Hong, Chenxiao Zhao, Guohai Xu, Le Yang, Chao Shen, 和 Xing Yu。Deepeyes:通过强化学习激励“与图像思考”。arXiv 预印本 arXiv:2505.14362,2025b。
Lianghui Zhu, Bin Ouyang, Yuxuan Zhang, Tianheng Cheng, Rui Hu, Haocheng Shen, Longjin Ran, Xiaoxin Chen, Li Yu, Wenyu Liu, 等人。Lens:学习使用统一强化推理分割任何事物。在 AAAI 人工智能会议论文集,第 40 卷,第 13952–13960 页,2026。
Xizhou Zhu, Weijie Su, Lewei Lu, Bin Li, Xiaogang Wang, 和 Jifeng Dai。Deformable detr:用于端到端目标检测的可变形 Transformer。arXiv 预印本 arXiv:2010.04159,2020。
15
第 16 页
思维令牌混合:自由形式多模态接地中的感知与推理统一
A 深入分析
A.1 细粒度自适应接地模式
我们在图 6 中报告了 Motto 在不同基准及其子类别中的模式选择倾向。结果表明,模式选择与任务复杂度密切相关。在 COCO 和 RefCOCO/+/g 等检测或短短语接地基准中,模型主要使用感知模式进行直接接地;而在专注于长标题接地的 Ref-L4 中,推理模式的使用频率更高。这一趋势在 PR-Bench 中尤为明显,其中感知模式在视觉线索感知任务中占主导地位,而推理模式在组合推理任务中领先,突显了向更复杂、语义对齐任务的转变。此外,推理模式在 MIG-Bench 的跨图像推理中也被频繁使用。
感知模式 推理模式 100% 4.3% 3.5% 5.8% 6.4%
23.8% 80% 37.5% 41.6%
54.5% 64.7% (%) 60% 87.6% 93.8% 95.7% 96.5% 94.2% 93.6% 比例 40% 77.2% 62.5% 58.4%
45.5% 20% 35.3%
12.4% 6.2% 0% COCO RefCOCO RefCOCO+ RefCOCOg Ref-L4 gRefCOCO HumanRef ReasonSeg PR-Bench(API) PR-Bench(RC) MIG-Bench 基准
图 6 不同基准中感知模式和推理模式的比例。
A.2 效率分析
如表 7 所示,我们通过随机采样每个任务的 200 个实例,评估了 Motto 在单对象、多对象和多图像任务中的推理效率,以分析端到端平均挂钟时间(Avg. Wall Time)、输出序列长度(Avg. Seq Length)和接地准确率(Acc)。单对象设置基于 RefCOCO 和 Ref-L4 构建,多对象设置基于 COCO 和 HumanRef 构建,多图像设置基于 MIG-Bench 构建。多对象设置中,每个查询平均包含 5.1 个目标对象。基于直接坐标预测的方法(例如 Qwen3-VL-2B、Rex-Omni-3B)的延迟主要受序列长度限制;此外,由于误差传播,它们在多对象任务中遭受显著的性能下降。以 VLM-FO1 为例的检测与检索方法,由于通过外部模型生成区域提议的初步阶段,产生了巨大的计算开销。相比之下,Motto 通过在感知模式和推理模式之间动态切换,展示了卓越的自适应能力。
B 训练数据详情
B.1 训练数据组成
表 8 总结了我们在两阶段训练管道中使用的训练数据。阶段 1 使用 Object365 进行预训练,阶段 2 使用涵盖多种接地任务的混合微调集。对于阶段 2,我们进一步将数据组织为感知和推理子集。对于阶段 2,我们进一步将数据组织为感知和推理数据,如图 7 所示。
1
第 17 页
思维令牌混合:免费统一自由形式多模态接地的感知与推理
表 7 Motto 与代表性模型的效率分析。我们报告了三个任务上的平均挂钟时间(Time)、序列长度(Len.)和准确率(Acc.)。
单对象 多对象 多图像 模型 时间(s) 长度 准确率 时间(s) 长度 准确率 时间(s) 长度 准确率
感知模式样本 Qwen3-VL-2B Bai et al. (2025a) 1.5 44.6 83.0 2.4 74.5 42.6 1.3 35.7 25.0 Rex-Omni Jiang et al. (2025a) 0.6 16.0 84.5 1.8 46.7 49.8 1.2 28.8 14.0 VLM-FO1 Liu et al. (2025a) 1.1 13.9 86.5 1.4 18.2 47.6 1.6 20.9 11.5 Motto 0.9 23.2 92.9 1.2 28.6 62.1 1.0 26.3 76.2
推理模式样本 Qwen3-VL-2B Bai et al. (2025a) 2.1 68.6 68.0 2.9 106.7 24.3 2.3 80.1 17.5 Rex-Omni Jiang et al. (2025a) 1.9 47.5 43.5 2.5 69.9 31.2 2.0 45.9 9.5 VLM-FO1 Liu et al. (2025a) 1.6 19.4 33.0 2.0 23.9 38.3 1.8 21.2 12.0 Motto 1.8 40.5 72.4 2.0 45.9 60.2 1.9 44.2 62.1
表 8 Motto 的训练数据组成。REC 表示指代表达式理解。
任务 数据集 # 样本 感知
阶段 1:预训练 目标检测 Object365 700万 阶段 2:微调 阶段 2 目标检测 Object365 70万 微调 REC VisualGenome 300万 REC RefCOCO 12万 REC RefCOCO+ 12万 推理 REC RefCOCOg 8万 REC Rexverse2M 100万 通用 REC gRefCOCO 19万 通用 REC HumanRef 4.5万 Object365 VisualGenome RefCOCO RefCOCO+ 通用 REC ReasonSeg 1千 RefCOCOg REXverse2M gRefCOCO HumanRef ReasonSeg OmniRef MGrounding-630K Omni 指代 OmniRef 11万 图 7 多图像接地 阶段 2 微调中的感知和推理数据分布。 MGrounding-630K 63万
B.2 数据构建提示
图 8 展示了我们指代接地数据构建流水线中使用的提示模板。这三个提示分别用于直接接地探测、证据诊断和错误反思。它们提供了用于构建感知数据和推理数据的中间注释。
C 其他主要结果
C.1 其他骨干网络上的主要结果
表 9 报告了 Motto 在其他骨干网络(包括 Qwen2.5-VL-3B 和 Qwen3-VL-4B)上的主要结果。结果表明,Motto 在不同骨干网络和不同模型规模下均一致地提高了接地性能,表明所提出的框架不依赖于特定的骨干网络。
2
第 18 页
思维令牌混合:免费统一自由形式多模态接地的感知与推理
直接接地提示 证据诊断提示 反思提示 您是一位专家级多模态接地标注员。 您是一位专家级多模态接地标注员。 您是一位专家级多模态接地 您的任务是在给定图像或图像集中直接定位查询所指的 以下样本已进行了直接接地尝试。该样本已被识别为困难样本, 标注员。 目标。 因为初始的直接接地尝试已不足。 不要提供逐步推理。 初始预测区域已在图像中标记。 图像已包含由该初始尝试产生的标记区域。 不要解释您的决定。 您的任务是诊断该初始尝试是否已经能够正确识别目标但定位不精确,或者因缺少关键证据而失败。 仅以所需格式输出最终接地结果。 您的任务是解释初始尝试为何不足,通过明确指出缺失的证据或错误来源。 指令: 指令: 指令: 1. 阅读查询并仔细检查图像。 1. 仔细阅读查询。 1. 仔细阅读查询。 2. 如果提供了多张图像,首先确定哪张图像包含目标。 2. 结合标记的预测区域检查图像。 2. 结合标记的初始预测检查图像。 3. 直接识别目标区域。 3. 判断标记的区域(s)是否对应于查询所指的正确目标。 3. 识别初始尝试中缺失、被忽略或误解释的关键证据。 4. 仅输出目标边界框坐标,可能有多个框。 4. 如果已识别正确目标,但标记区域稍不准确、不完整、过大、过小或未紧密定位,则输出 SUFFICIENT。 4. 关注导致初始预测无法正确解决查询的关键线索。 5. 如果查询未指代任何有效目标,输出 NONE。 5. 如果标记区域(s)不对应正确目标,或初始尝试遗漏了关键证据,则输出 INSUFFICIENT。 5. 反思必须简洁且以证据为中心。 6. 不要输出任何反思、诊断或中间推理。 6. 仅输出诊断标签和一个原因句子。
图 8 指代接地数据构建中使用的提示模板。
表 9 不同模型在多个接地基准上的性能比较。
RefCOCO Ref-L4 gRefCOCO HumanRef Reason PR-Bench MIG-Bench COCO (mAP) 模型 Avg. Acc Pr N-Acc DF1 Rej Seg mAcc N-Acc AVE Text Vis-G Vis-I
通用多模态大语言模型 Qwen3-VL-2B Bai et al. (2025a) 83.5 85.4 46.5 25.1 58.9 – 49.8 52.8 – 21.4 34.9 11.6 25.3 Youtu-VL-4B Wei et al. (2026) 91.9 83.3 25.7 – 55.3 – 51.3 53.2 – 32.9 47.1 18.4 21.0 InternVL3.5-8B Wang et al. (2025b) 89.7 80.9 31.2 – 40.0 33.1 38.3 41.5 – – – – – Qwen3-VL-8B Bai et al. (2025a) 87.9 88.5 55.4 55.0 64.9 47.9 56.4 59.4 16.2 31.8 36.8 20.8 29.5 GLM-4.1V-Thinking-9B Hong et al. (2025) 86.0 84.8 49.3 29.0 58.6 34.5 57.6 57.9 – 46.7 27.2 14.5 10.4 Qwen3.5-9B Qwen Team (2026) 88.1 89.0 56.3 – 72.0 10.8 56.6 63.7 11.9 31.7 37.7 20.8 32.6 Qwen3.5-27B Qwen Team (2026) 90.9 90.2 56.7 – 71.5 13.4 65.7 65.3 – 42.7 38.8 22.2 33.3 InternVL3.5-38B Wang et al. (2025b) 89.2 85.5 36.0 – 51.1 – 51.7 48.5 12.7 – – – –
接地专用多模态大语言模型 T-Rex-2 Jiang et al. (2024a) – – – – – – – – – – 52.2 46.5 58.5 VLM-R1 Shen et al. (2025) 86.3 80.9 45.7 30.6 46.4 27.1 26.5 54.4 – – – – – VLM-FO1 Liu et al. (2025a) 88.6 84.4 58.7 52.5 82.6 46.4 46.7 53.9 11.4 – 44.4 14.1 11.0 Rex-Omni-3B Liu et al. (2025a) 83.9 78.0 38.0 33.6 74.9 – 40.6 53.7 – 11.9 – 17.4 – Chatrex Jiang et al. (2024b) 89.2 80.0 29.9 – 55.6 – 23.0 49.5 – – – – – ROD-MLLM Yin et al. (2025) 86.9 – 53.5 57.8 – – – – – – – – – Migician Li et al. (2025) 88.1 73.2 29.4 14.4 45.9 26.0 47.3 52.3 – 63.8 10.0 7.1 9.3 DeepEyes Zheng et al. (2025b) 86.7 85.2 50.3 38.4 50.3 22.8 68.6 45.7 – – – – – VGent Kang et al. (2025a) 90.2 – – – – – – – – – – – – MottoQwen3-VL-2B 92.6 92.5 69.6 58.0 83.0 53.4 71.2 71.7 46.9 74.5 56.4 51.7 58.9 MottoQwen3-VL-4B 94.8 94.3 73.3 58.3 84.1 54.3 74.8 74.1 47.5 76.6 57.7 53.1 60.4 MottoQwen2.5-VL-3B 92.1 89.4 67.4 57.6 82.7 53.5 70.7 68.1 47.4 72.8 55.0 50.7 57.5
C.2 MIG-Bench 上的详细结果
表 10 展示了多图像接地基准上的细粒度结果。Motto 在 MIG-Bench 的所有任务中均取得了最先进(SOTA)的性能。
C.3 PR-Bench 上的详细结果
表 11 展示了 PR-Bench 上的详细结果。Motto 在所有评估维度上均取得了最先进(SOTA)的性能,优于专家模型和通用模型。
D 额外的消融研究
我们在 300 万样本子集上进行了额外的消融研究,采用了与全数据集训练相同的超参数。
3
第 19 页
思维令牌混合:免费统一自由形式多模态接地的感知与推理
表 10 不同模型在 MIG-Bench Li et al. (2025) 上的性能比较。OT、MV、GG 和 Co-Re 分别表示目标跟踪、多视图接地、组接地和对应关系。
自发接地 指称接地 模型 AVE 差异 相似性 视觉参考 文本 视觉+文本 静态 鲁棒 常见 OT MV 区域 参考 GG 推理 Co-Re
InternVL3.5-8B Wang et al. (2025b) 2.5 3.2 13.6 10.2 6.3 2.0 12.1 17.6 5.0 0.9 7.3 Qwen3-VL-2B Bai et al. (2025a) 7.4 4.5 30.3 12.5 6.3 3.7 25.3 20.8 10.9 4.3 12.6 Qwen3-VL-8B Bai et al. (2025a) 40.7 24.5 38.8 30.0 22.9 26.1 23.2 53.9 32.7 25.6 31.8 Youtu-VL-4B Wei et al. (2026) 21.8 31.9 46.1 49.6 38.5 0.3 60.6 37.9 27.7 14.5 32.9 Qwen3.5-9B Qwen Team (2026) 53.6 11.7 54.9 29.5 30.2 29.5 30.3 44.9 24.8 7.7 31.7 GLM-4.1V-Thinking-9B Hong et al. (2025) 44.5 50.0 55.9 28.1 47.7 6.5 75.8 63.5 63.4 31.6 46.7 Qwen3.5-27B Qwen Team (2026) 56.3 21.3 68.5 28.0 37.9 33.9 51.5 66.1 35.6 28.2 42.7 Migician Li et al. (2025) 65.2 46.8 84.2 70.7 60.1 74.3 76.8 66.5 59.4 34.2 63.8 MottoQwen3-VL-2B 69.5 56.4 87.0 79.6 66.3 87.9 90.9 85.4 67.3 54.7 74.5 MottoQwen3-VL-4B 69.7 60.6 90.7 82.4 68.4 88.1 91.9 88.2 70.3 55.6 76.6 MottoQwen2.5-VL-3B 68.2 52.1 86.5 77.1 63.9 87.0 88.9 83.8 66.3 53.8 72.8
表 11 PR-Bench 六个评估方面的细粒度评估。
总体 视觉线索 感知 组合推理 模型 大小 mAcc mAcc AP I mAcc RC 属性 位置 交互 关系 常识 拒绝 通用 MLLMs Qwen3-VL Bai et al. (2025a) 2B 52.8 55.7 48.2 59.5 58.0 50.0 46.7 49.6 – Youtu-VL Wei et al. (2026) 4B 53.2 56.7 47.9 61.5 57.2 51.4 49.2 46.6 – InternVL3.5 Wang et al. (2025b) 8B 41.5 44.1 37.6 45.7 41.2 45.3 37.8 37.3 – Qwen3-VL Bai et al. (2025a) 8B 59.4 62.0 55.6 64.8 62.6 58.7 55.8 55.4 16.2 GLM-4.1V-Thinking Hong et al. (2025) 9B 57.9 61.2 52.9 63.6 61.5 58.6 52.4 53.4 – Qwen3.5 Qwen Team (2026) 9B 63.7 66.3 59.7 68.9 66.9 63.1 59.4 60.0 11.9 Qwen3.5 Qwen Team (2026) 27B 65.3 67.6 61.9 68.4 67.3 67.0 62.7 61.0 – InternVL3.5 Wang et al. (2025b) 38B 48.5 51.7 43.7 52.0 50.8 52.3 43.9 43.4 12.7
接地专用 MLLMs VLM-R1 Shen et al. (2025) 3B 54.4 57.0 50.5 59.0 58.0 54.1 47.8 53.2 – VLM-FO1 Liu et al. (2025a) 3B 53.9 57.3 48.8 57.9 56.8 57.2 49.6 47.9 11.4 Rex-Omni Jiang et al. (2025a) 3B 53.7 58.8 46.0 59.5 58.0 58.9 46.8 45.1 – DeepEyes Zheng et al. (2025b) 7B 45.7 47.3 43.1 49.7 46.3 46.0 42.6 43.6 – ChatRex Jiang et al. (2024b) 7B 49.5 53.0 44.3 54.7 51.1 53.2 45.1 43.4 – Migician Li et al. (2025) 7B 52.3 56.6 45.8 57.3 59.7 52.8 45.4 46.1 – LocateAnything Wang et al. (2026b) 3B 57.4 61.7 50.8 63.1 61.4 60.8 50.0 51.6 – MottoQwen3-VL-2B 2B 71.7 74.4 67.6 75.8 74.5 72.9 66.3 68.9 46.9 MottoQwen3-VL-4B 4B 74.1 76.2 71.0 78.4 76.2 74.0 69.8 72.1 47.5 MottoQwen2.5-VL-3B 3B 68.1 69.9 65.4 72.6 69.4 67.8 64.2 66.5 47.4
D.1 训练策略的消融实验
表 12 将我们的两阶段训练策略与单阶段基线进行了比较。两阶段方法实现了 1.1% 的平均提升,在以推理为中心的任务(如 Ref-L4 和 PR-Bench mAccRC)中取得了显著增益。通过在阶段 1 中对齐感知扫描,并在阶段 2 中引入完整的扫描-聚焦-行动范式,我们建立了跨任务更连贯的训练流程,并最大化了模型处理复杂查询的能力。
D.2 Lcls 的消融实验
表 13 评估了 Lcls 中的 top-K 难负样本选择。没有选择时,性能受到过多负样本干扰的限制。K = 20 的设置产生了最佳结果,特别是在 COCO 和 gRefCOCO 等多目标基准上实现了峰值性能。虽然过小的 K 无法提供足够的对比信号,但过大的 K 会导致性能下降,因为简单负样本主导了训练过程。在 PR-Bench 子类别中观察到的一致增益进一步证实,平衡的选择对于稳定有效的分类优化至关重要。
4
第 20 页
思维令牌混合:为自由形式多模态接地统一感知与推理
表 12 训练策略的消融研究。表 13 PR-Bench Lcls 中 top-K 难负样本选择的消融研究,其中“无选择”对应于没有 top-K 难负样本选择的标准 PR-Bench Lcls。
策略 COCO Ref-L4 AVG mAcc AP I mAcc RC N-Acc gRefCOCO PR-Bench 设置 COCO AVG 单阶段训练 46.1 89.0 72.2 60.6 46.4 62.9 Pr mAcc AP I mAcc RC N-Acc
两阶段训练 无选择 45.1 61.9 72.4 61.7 46.6 57.5 K = 10 44.8 63.3 72.2 62.8 46.2 57.8 阶段 1 45.7 – – – – – K = 20 46.6 64.2 73.2 63.2 46.3 58.7 阶段 2 46.6 90.7 73.2 63.2 46.3 64.0 K = 30 45.8 63.7 73.0 62.4 46.4 58.2
D.3 切换适配器的消融研究
表 14 评估了 Switch Adapter 的不同设置。仅依赖文本嵌入或图像特征会导致次优结果,因为它无法捕捉互补的跨模态线索。我们的完整 Switch Adapter 通过聚合跨模态上下文实现了最佳平均性能。
D.4 聚焦适配器的消融研究
表 15 评估了 Focus Adapter 的不同设置。从集成 P+R-Tokens、Switch Adapter 和文本反思的基线配置开始,我们研究了不同的视觉证据聚合配置如何影响接地性能。结果表明,单独依赖全局特征或目标聚焦特征带来的提升有限,因为它们要么缺乏空间分辨率,要么无法捕捉更广泛的场景上下文。完整的 Focus Adapter 通过分层聚合全局和目标聚焦证据,特别是在以推理为中心的任务(如 PR-Bench RC 和 MIG-Bench)中,实现了最佳性能。
表 14 Switch Adapter 配置的消融研究。完整的 Switch Adapter 聚合来自文本嵌入和视觉特征的跨模态上下文。Switch Adapter 同时聚合全局和目标聚焦的视觉证据。
表 15 Focus Adapter 配置的消融研究。基线表示具有 P+R-Tokens、Switch Adapter 和文本反思的配置。完整的 Focus Adapter 同时聚合全局和目标聚焦的视觉证据。
PR-Bench 设置 COCO MIG-Bench AVG mAcc AP I mAcc RC N-Acc PR-Bench 设置 COCO MIG-Bench AVG 基线 mAcc AP I mAcc RC N-Acc 仅 P-Tokens 46.2 69.1 55.9 46.7 62.6 56.1 基线 P + R-Tokens 45.9 70.3 59.4 45.8 65.3 57.3 P + R + Switch + Refl. 46.7 72.4 61.7 46.4 66.6 58.8 Switch Adapter 设置 Focus Adapter 设置 仅文本嵌入 46.0 70.8 59.8 46.1 65.6 57.6 仅全局特征 46.5 72.8 62.1 46.3 66.8 58.9 仅视觉特征 46.1 71.0 59.6 46.2 65.7 57.7 仅目标聚焦特征 46.4 72.7 62.5 46.2 67.1 58.9 完整 Switch Adapter 46.4 71.6 60.9 46.5 66.2 58.3 完整 Focus Adapter 46.6 73.2 63.2 46.3 67.5 59.4
E PR-Bench 的更多细节
E.1 PR-Bench 中每个子类别的定义
PR-Bench 的六个子类别的定义如下,相应的视觉示例如图 9 所示。这六个子类别互斥,共同评估两个不同的维度:视觉线索感知(属性、位置和交互)和组合推理(关系、常识和拒绝)。
属性。属性子类别关注对象的内在且可直接观察到的视觉属性,包括颜色、纹理、材料、形状和状态等特征。目标识别依赖于从同类别干扰项中区分细粒度的视觉线索。
位置。位置子类别捕捉图像中不同对象之间的空间关系。它要求基于目标相对于场景中异构锚对象的相对位置来定位目标。
交互。交互子类别关注同类别对象之间的空间排列和相对顺序。它通常依赖于同质组内的序数或相对定位。
5
第 21 页
思维令牌混合:自由形式多模态接地中的感知与推理统一
视觉线索感知 组合推理
属性 常识
穿着黑色连衣裙的人 贴有海报的白板 能提供关于拾取垃圾所用工具信息 带有黄色花朵的物体 相机视野外的场景
位置 关系
黑色柜子旁边的相框 与打印机在同一层架上的花篮 椅子完全垂直于墙壁放置 带有图片的陶瓷容器 窗帘的颜色
交互 拒绝
从左数第八个人 高牛奶盒右侧的第二盒牛奶 开启的黑色塑料电脑显示器 穿着蓝色衬衫和蓝色裤子的人 窗户旁边的黑色木柜
图 9 PR-Bench 六个子类别的示例。左侧的三个任务(属性、位置和交互)主要评估视觉线索感知,而右侧的三个任务(常识、关系和拒绝)则需要更强的组合推理能力。
关系。关系子类别通过与不同锚定对象的比较关系来识别目标,利用共享或对比的视觉属性。此类别要求对多个实体进行接地,然后进行比较判断。
常识。常识子类别通过上下文或功能描述而非显式视觉属性来识别目标。因此,指代表达式通过其在场景中的用途、目的或上下文来描述目标。
拒绝。拒绝子类别侧重于处理指代表达式中的否定和不存在引用。在这些情况下,指代表达式包含一个或多个与图像中任何对象都不匹配的条件。
E.2 PR-Bench 标注流程
PR-Bench 使用来自 FineHARD Xie et al. (2025) 的图像开发,这是一个具有广泛分辨率边界框标注的大规模数据集。为了确保一致的质量和可管理的计算需求,我们根据分辨率变异性过滤图像,仅保留介于 1024×1024 和 2048×2048 像素之间的图像,以及 Grounding DINO 检测到的边界框分布。此选择过程优先考虑具有多种不同对象和丰富视觉内容的图像。为了在六个子类别中生成高质量的查询-边界框对,我们提出了如图 10 所示的细粒度标注流程。
图像解析与区域生成。对于每张图像 I,我们提示 Qwen2.5-VL-72B Bai et al. (2025b) 生成编码视觉元素的结构化属性字典,包括对象类别 c、固有属性 a、与其他对象的交互关系 r 以及简短描述短语 d。然后,我们使用 Grounding DINO Liu et al. (2024) 将描述短语 d 接地以获得边界框 b。为了确保视觉复杂性,我们保留包含至少两个不同对象类别和五个总对象的图像。因此,每张图像 I 的属性结构化如下:
EI = {(aj, bj, cj, dj, rj)}Nj=1, 其中 |cj| > 2, N ≥5, (14)
6
第 22 页
思维令牌混合:为自由形式多模态接地统一感知与推理
图像解析与区域生成 指代表达生成 PR-Bench 目标字典 对象1: 对象2: 对象2 [任务]: 属性 [边界框]: [2,850,130,998] [类别]: 块 [类别]: 块 [指代表达]: 红色立方体形状的块 [属性]: 木质,三角形 [属性]: 红色,立方体形状 [关系]: [关系]: 在木箱左侧 在蓝色块前方 [描述]: 红色立方 [描述]: 体形状的块 在木箱左侧 一致性 唯一性 一个木质三角形块 [边界框]: [2,850,130,998] 检查 检查
⚫ “块”类别中有多少样本? 1 蓝色盒子 属性字典 ⚫ 木质外观是否 2 红色物体 对象1: 接地多模态大语言模型作为 [类别]: 块 唯一? 3 立方体形状的盒子 [属性]: 木质,三角形 4 木质块 [关系]: ⚫ 红色外观是否唯一? 在蓝色块前方 木质? 5 红色立方体形状的块 [描述]: 三角形? … ⚫ … 6 木质立方体 一个木质三角形块 对象1 7 带有红色标记的块 对象2: [类别]: 块 红色? 属性 关系 8 立方体形状的块 [属性]: 红色,立方体形状 立方体形状? [关系]: 在木箱左侧 对象1: 对象2 … 位置 常识 [描述]: 红色立方体形状的块 [边界框]: [2,850,130,998] 在木箱左侧 区域修正 交互 拒绝 对象2: [边界框]: [840,823,983,1087] 指代表达修正
图 10 构建 PR-Bench 的细粒度指代标注流程。
其中 j 表示特定对象的索引。
区域修正。对于每个对象 j,我们将 EI 的每个元素转换为验证检查清单。然后提示 Qwen2.5-VL-72B 评估目标区域内的视觉内容是否与检查清单中的相应属性一致。仅保留在所有属性上完全一致的对象,因为它们提供可靠的空间坐标和多样化的属性描述。
指代表达生成。一旦属性得到验证,我们设计了一个任务选择机制,以自动将每个保留的对象分配给特定的任务类型,由选择函数 Fselect 形式化如下:
Tj = Fselect(tj, EI). (15)
其中 tj 是要分配的目标对象。Fselect 是一个基于人类定义规则的选择函数,旨在通过定义特定的视觉条件来识别每个任务的挑战性实例。例如,我们将属于同一类别但表现出不同固有属性的对象分配给属性任务,提供更细粒度的视觉线索作为先验。这些规则有意引入视觉复杂性,从而策划一组高质量、与任务相关的种子对象。然后,我们提示 Qwen2.5-VL-72B 重新表述属性,以生成分配给特定任务 Tj 的对象候选表达式。
指代表达修正。每个指代表达都通过两阶段验证过程进行验证。首先,采用一致性检查来验证边界框内的视觉内容是否与表达式在语义上对齐,从而过滤掉幻觉描述。其次,唯一性检查确保表达式明确指向图像中单个、不同的区域。
E.3 任务选择规则
表 16 展示了为识别每个子类别中的挑战性实例而设计的详细基于人类定义规则的选择函数。
E.4 PR-Bench 统计
PR-Bench 包含六个子类别的 6,000 对数据,如表 17 所示。为了确保卓越的数据质量,我们在自动化流程之后实施了严格的人工验证过程。十位专家标注员进行多轮审查,手动纠正定位不准确之处并完善语言歧义,仅保留最精确和最具有挑战性的样本。
7
第 23 页
思维令牌混合:自由形式多模态接地中的感知与推理统一
表 16 PR-Bench 六个子类别的详细选择规则。
任务类别 目标对象选择规则
属性 需要区分多个同类别实例,依据是其独特的内在属性而非简单的命名。
位置 通过与异构锚定对象的空间关系,在多个同类别实例中定位目标对象。
交互 基于有序位置或相对排列,在三个或更多同类别实例组中识别目标。
关系 通过与锚定对象共享或对比属性进行比较推理来识别目标。
常识 通过功能性、目的性或上下文描述来识别目标,而非显式的视觉属性。
拒绝 图像中无匹配对象,要求模型拒绝无效引用而不产生幻觉。
表 17 PR-Bench 的分布统计。
类型 图像 短语 图像尺寸 框尺寸 短语长度
属性 701 1,000 1602×1301 10.76% 9.3
位置 735 1,000 1588×1294 8.34% 11.0
交互 642 1,000 1608×1292 9.43% 10.3
关系 695 1,000 1619×1282 6.15% 14.4
常识 715 1,000 1627×1280 6.14% 15.5
拒绝 764 1,000 1629×1301 N/A 13.8
总计 3102 6,000 1612×1292 8.16% 12.4
E.5 标注提示
我们提供了 PR-Bench 构建过程中两个主要标注阶段所使用的提示。图 11 展示了结构化图像解析的提示,指导模型将场景分解为以对象为中心的属性。图 12 说明了针对特定任务的指代表达生成提示,强制执行跨六个子类别定义的任务感知构建。
您是视觉智能和组合场景分析专家,作为复杂的 AI 引擎运行。您的主要任务是仔细分析提供的图像,并将其分解为基本视觉元素。对于每个不同的对象,您将生成一个编码其核心特征的属性字典。您的输出必须是单个有效的 JSON 对象。请严格按照以下步骤执行:
1. 全面对象识别:您的第一步是对整个图像进行彻底扫描,以识别每个不同的、有形的对象。为每个对象分配一个清晰简洁的类别标签(例如,“person”、“laptop”、“coffee mug”、“dog”)。不要遗漏任何对象,即使它们很小或在背景中。严格关注具体物品,忽略“阴影”、“光线”或“空虚”等抽象概念。
2. 处理多个实例:如果您识别出多个相同类别的对象(例如,两把椅子,三本书),您必须将每个对象视为输出列表中的单独且唯一的条目。每个实例都需要其自己的属性字典。
3. 详细固有属性提取:对于每个识别出的对象,您必须创建一个嵌套的属性对象。用所有可观察到的视觉属性填充此对象。尽可能描述详细。需要考虑的关键属性包括但不限于:颜色:(例如,“blue”、“pale yellow”、“multi-colored”)。材质:(例如,“polished wood”、“brushed metal”、“transparent glass”、“ceramic”)。状态:(例如,“open”、“closed”、“full”、“empty”、“on”、“off”、“ripe”)。纹理:(例如,“smooth”、“rough”、“fluffy”、“glossy”)。其他相关细节,如形状、图案或特定标记。
4. 交互关系映射:在描述对象的固有属性后,识别其与其他已识别对象的空间连接。如果存在此类关系,请添加 interactive_relationships 字段。该字段必须是字符串列表。每个字符串必须从当前对象的角度描述关系。示例:["to the left of the monitor"],["behind the window on the left"]。
5. 简短描述短语生成:对于每个对象,您必须提供一个描述短语。这应该是一个简洁的自然语言摘要,捕捉对象在图像特定上下文中的本质。示例:对于杯子,“a white ceramic mug filled with dark coffee”。对于人,“a woman with brown hair smiling at the camera”。
6. 严格 JSON 输出格式:您的最终且唯一的输出必须是单个有效的 JSON 对象。对象的根必须有一个键:“scene_properties”。“scene_properties”的值必须是列表(JSON 数组),包含您检测到的每个视觉元素的属性字典。列表中的每个字典必须包含: "class":对象的类别。 "attributes":用于视觉属性的键值对嵌套 JSON 对象。 "interactive_relationships":此字段是可选的,仅在观察到清晰、有意义的关系时才应包含。 "description_phrase":简洁的描述短语。
图 11 PR-Bench 中用于结构化图像解析的提示,指导模型将场景分解为以对象为中心的属性。
F 额外评估细节
对于 COCO 评估,我们遵循 T-Rex2 Jiang et al. (2024a) 协议用于所有三种设置。对于基于 MLLM 的方法,遵循 Youtu-VL Wang et al. (2025a),我们使用预测框面积作为 mAP 计算的置信度分数。我们还报告 F1@mIoU 作为补充指标。
G 可视化
8
第 24 页
思维令牌混合:自由形式多模态接地中感知与推理的统一
你是语言区分艺术的大师。你的目的是基于场景中的目标对象,构思一个简洁、自然的语言短语。为了成功, 你必须采用以下分析思维。
属性位置交互 解构目标:首先彻底开始于空间线索:首先检查分析组的 spatial 布局:首先,调查所有对象 理解目标对象的所有给定属性,并选择一个空间关系以了解其完整排列。找到 目标对象。它的核心身份是什么?它的定义特征是什么?从它的属性中。这种关系将成为你的整个短语的基础。最终发现空间签名:分析目标的放置 调查其他对象:接下来,检查非目标对象的属性。你的目标是构建一个完整的心理地图,以了解整个组内的共享特征。识别唯一签名:这是最关键的一步。将目标与所有其他对象进行比较,以锁定使目标独特的特定属性或属性组合。问自己:“关于目标,我能说什么,而不能对其他任何对象说?”
关系常识拒绝 寻找参考点:首先,调查场景中的其他对象。寻找一个可以作为有用“锚点”的对象,一个有助于描述目标的比较点。发现关系链接:分析目标和你选择的锚点的属性,以找到它们之间的有意义链接。这种链接将是两种类型之一:相似链接:目标的属性与锚点的属性相同(例如,颜色相同)。对比链接:目标的属性与锚点的属性不同(例如,材质不同)。确保链接无歧义:一旦你脑海中有了比较短语,你必须验证它是无懈可击的。这种比较是否只挑出目标,且仅目标?如果任何其他对象也可能符合此描述,则链接不够好,你必须找到一个新的。
将目标视觉隔离:在你开始之前考虑对象的功能,首先理解开始于真实基础:你的过程始于一个真实的目标对象。这个对象是你将修改的模板。执行最小、合理的变异:对基础对象进行单个、微妙的更改,以创建一个不存在的新的“虚拟”对象。好的策略包括:改变属性:将颜色从“红色”改为“绿色”。交换其身份:将“杯子”改为密切相关的“马克杯”。移动其位置:将“在左边”改为“在右边”,但仅当新位置合理时。关键是要保持其他所有细节相同,以维持可信度。验证不存在性:查看你的新描述,并将其与场景中的每个真实对象进行检查。
图 12 PR-Bench 中指代表达生成任务特定的提示。
G.1 PR-Bench 的可视化
我们在图 13 中提供了 PR-Bench 的可视化,涵盖所有六个子类别,并展示了代表性模型的预测,以说明 PR-Bench 的复杂性。
G.2 深入案例研究
我们提供了一个深入的案例研究,以进一步检查 Motto 在不同接地场景下的行为。如图 14 所示,提出的上下文自适应令牌链使模型能够根据上下文语义和可用证据的充分性动态调整其接地模式。当证据充分时,Motto 直接解码 P-Tokens 进行接地;否则,它切换到推理模式,并结合文本反思和视觉证据来支持 R-Token 生成。这些示例展示了扫描-聚焦-行动范式如何跨不同实例实现自适应接地。
G.3 Motto 的扩展可视化结果
图 15 展示了广泛接地任务中的额外可视化结果,提供了对 Motto 能力更全面、更直观的看法。
9
第 25 页
思维令牌混合:免费统一自由形式多模态定位的感知与推理
属性问题:定位方形抽象画。位置问题:定位楼梯上方阳台上的花箱。
真实标签 Qwen3.5-9B Youtu-VL-4B 真实标签 Qwen3.5-9B Youtu-VL-4B
VLM-FO1-3B Rex-Omni-3B Motto-2B VLM-FO1-3B Rex-Omni-3B Motto-2B
交互问题:定位从左数第一个条纹靠垫。关系问题:定位颜色与右上角所有便利贴不同的记号笔。
真实标签 Qwen3.5-9B Youtu-VL-4B 真实标签 Qwen3.5-9B Youtu-VL-4B
VLM-FO1-3B Rex-Omni-3B Motto-2B VLM-FO1-3B Rex-Omni-3B Motto-2B
常识问题:定位通过指向和点击与数字界面交互的设备。拒绝问题:定位带有纯金图案的白色礼品袋。
真实标签 Qwen3.5-9B Youtu-VL-4B 真实标签 Qwen3.5-9B Youtu-VL-4B
VLM-FO1-3B Rex-Omni-3B Motto-2B VLM-FO1-3B Rex-Omni-3B Motto-2B
图 13 PR-Bench 上案例的可视化。每一行展示一个具有挑战性的示例以及代表性模型的相应预测结果。
10
第 26 页
思维令牌混合:免费统一自由形式多模态接地的感知与推理
问题:定位奶牛。Qwen3.5-9B Rex-Omni-3B Motto-2B
[{"bbox_2d": [26, 255, 704, 885], "object_1<|obj_label": "cow"},{"bbox_2d": [172, 395, 762, 920], "label": "cow"}] 在 <P_2> <P_3> <P_4> 处有 3 头牛。证据充足,以感知模式解码。Ground Truth [26, 255, 704, 885], [172, 395, 762, 920], [31, 169, 759, 918]
问题:定位手提包。Qwen3.5-9B Rex-Omni-3B Motto-2B
我在 <P_6> 处找到 2 个手提包。证据不足,切换到推理模式。我需要再次检查图像的右侧。有 3 个手提包在 <R_13><R_20><R_21>。
[{"bbox_2d": [284, 690, 333, 874], "label": "handbag"}] Ground Truth [294, 690, 798, 999], [345, 886, 7, 118]
问题:定位一副细塑料框眼镜,由一位坐着、穿着浅蓝色上衣的女性佩戴。Qwen3.5-9B Rex-Omni-3B Motto-2B
一副细塑料框眼镜由一位坐着、穿着浅蓝色上衣的女性佩戴。目标一副细塑料框眼镜由一位坐着、穿着浅蓝色上衣的女性佩戴,位于 <P_1>。证据充足,以感知模式解码。
[{"bbox_2d": [300, 39, 536, 626], "label": "A pair of thin, plastic-rimmed glasses are worn by a woman, who is seated and dressed in a light blue top."}] Ground Truth [302, 39, 536, 667]
问题:定位穿着白色衣服但不穿棕色鞋子的人。Qwen3.5-9B Rex-Omni-3B Motto-2B
有 3 个穿着白色衣服但不穿棕色鞋子的人,位于 <P_4><P_7>。证据不足,切换到推理模式。我需要检查他们鞋子的颜色。目标人物位于 <R_7><R_12><R_17><R_22>。
[{"bbox_2d": [568, 200, 700, 847], "label": "the person wearing white clothes but not brown shoe"}] Ground Truth [331, 238, 448, 872], [438, 215, 573, 928], [563, 199, 702, 845]
图 14 Motto 在不同接地场景下的深入案例研究。Motto 通过扫描-聚焦-行动范式动态适应其接地模式,执行基于 P-Tokens 的直接感知接地,或通过重新聚焦的语义和视觉证据进行推理驱动的接地。
11
第 27 页
思维令牌混合:统一感知与自由形式多模态接地
目标检测 文本 视觉-视觉- 定位所有人员。定位所有背包。参考 图像
交互 框 交互 框 定位斑马。参考 图像
指代表达理解 定位图中描绘的 定位舞台上穿着 Locate a black, sturdy-looking box with a glossy on the upper rear section of 定位空椅子。白色衬衫且不穿夹克的。饰面,位于鼓的踏板的旁边。红色双层巴士的上后部。
在城市的大多数地方,都有指定区域 定位戴太阳镜且行人可以安全过马路。定位绿色椅子和白色沙发。 但不在该男子右侧站立的人。通常用于识别这些区域的物体是什么?
多图像接地 给定一张源图像,随后 请找到边界框 这些图像共享一个共同对象。识别并 由其几个区域描述的区域。在源图像的第1张图中定位此对象。
图15 Motto 在各种接地任务中的扩展可视化结果,包括文本下的目标检测、 参考图像(Visual-G)和交互式视觉(Visual-I)提示、指代表达理解,输入 从短短语和长标题到推理问题,目标从单个到多个对象,以及 跨多个候选图像的多图像接地。
12