ReMo:无需训练的 Omni-LLM 视觉 Token 压缩与语义重分布

快速导读:ReMo 是一种无需训练的 Omni-LLM 输入压缩框架,通过将视觉 Token 投影到与音频对齐的公共空间以去除冗余,并将剩余对象语义替换为紧凑的文本代理,从而在保持甚至提升准确率的同时显著降低计算成本。

Omni-LLM 在处理音频、视频和文本时面临巨大的计算挑战,其中视觉 Token 占比极高且冗余严重。传统的注意力机制导致二次方计算成本,成为延迟和内存的主要瓶颈。现有压缩方法要么需要针对每个骨干模型重新训练,要么受限于模态间隙导致准确率下降。

ReMo 提出了一种无需训练的输入压缩框架,将压缩视为跨模态语义重分布。它通过离线构建的 Cross-modal Projection 将音频和视觉 Token 映射到公共空间,基于 Residual Saliency 剪枝已被音频解释的视觉 Token。同时,使用轻量级检测器生成 Text Proxy 替代被剪枝的对象视觉 Token,从而在保持甚至提升准确率的同时显著降低计算成本。

英文题目:Out of Sight, Still in Mind: Token Compression for Omni-LLMs

论文出处:arXiv 每日论文精选 · arXiv:2607.21179

原始论文:PDF / 论文页面

对应视频标题:ReMo:无需训练的 Omni-LLM 视觉 Token 压缩与语义重分布|推荐指数:★★★★★

这篇论文解决什么问题?

Omni-LLM 的核心瓶颈在于视觉 Token 的冗余性。视频帧包含大量重复信息,且许多视觉内容已被音频流解释。现有无需训练方法如 OmniZip 基于原始嵌入余弦相似度剪枝,但受限于 Modality Gap,导致冗余度量不可靠。OmniDrop 在解码器内部逐层剪枝,但早期层仍需处理全序列,无法根本解决预填充阶段的计算压力。

训练型方法如 OmniSIFT 和 ContextGuard 虽能实现更精细的压缩,但需针对每个骨干模型重新训练压缩模块,适用性受限。此外,单纯移除视觉 Token 会导致对象语义丢失,影响模型对场景的理解。因此,如何在无需训练的前提下,可靠地度量冗余并保留关键语义,是亟待解决的研究空白。

ReMo 的核心洞察是:视觉冗余不仅存在于视觉模态内部,更存在于跨模态之间。如果音频已解释某视觉内容,则该视觉 Token 是冗余的。关键在于如何可靠地度量这种跨模态冗余,并在移除后恢复丢失的对象语义。

核心创新

  • 提出无需训练的跨模态投影方法,解决音频-视觉嵌入空间的模态间隙问题,使冗余度量更可靠。
  • 引入文本代理(Text Proxies)机制,用少量文本 Token 替代大量视觉 Token 以保留对象语义,并通过 TMRoPE 保持其时空位置。
  • 将压缩定义为‘重分布’而非单纯‘移除’,利用音频和文本流承载视觉信息,仅保留其他模态无法提供的残差视觉细节。

方法概览

ReMo 将压缩视为跨模态语义重分布:1) 利用离线构建的跨模态投影将音频和视觉 Token 映射到公共空间,基于残差显著性剪枝已被音频解释的视觉 Token;2) 使用轻量级检测器识别对象,生成带有空间位置信息的文本代理(Text Proxies)替代被剪枝的对象视觉 Token;3) 恢复局部细节并合并时间上冗余的 Token。

  • Cross-modal Projection:ReMo 利用离线构建的投影矩阵,将音频和视觉 Token 映射到公共空间。该投影基于 VGGSound 等配对数据训练,使音频和视觉嵌入在几何上对齐,从而消除 Modality Gap,使冗余度量更可靠。
  • Residual Saliency 剪枝:在公共空间中,ReMo 计算每个视觉 Token 的 Residual Saliency,衡量其既不被音频解释也不被视觉上下文覆盖的程度。低显著性 Token 被剪枝,仅保留高显著性的残差视觉细节。
  • Text Proxy 机制:为保留被剪枝 Token 的对象语义,ReMo 使用轻量级检测器识别对象,生成带有空间位置信息的 Text Proxy。这些文本 Token 替代大量视觉 Token,实现约 176:1 的压缩比。
  • TMRoPE 位置编码:为保持 Text Proxy 的时空位置,ReMo 使用 TMRoPE(时空旋转位置编码)对其编码,确保模型能正确理解对象在视频中的位置和时间关系。
  • 局部细节恢复:ReMo 保留局部高方差区域,恢复被剪枝的细粒度视觉细节,确保场景完整性。
  • 时间冗余合并:ReMo 合并时间上冗余的 Token,进一步降低序列长度,同时保留关键动态信息。

逐图理解论文

直觉失败:模态间隙导致误剪

直觉失败:模态间隙导致误剪
Figure 3: Audio and visual embeddings on VGGSound test set. Left: raw space by PCA, where the two modali- ties separate and differ in spread. Right: our projection along the top two canonical components. The paired embeddings now overlap in a common space, making audio-visual similarity directly measurable.

Figure 3 展示了 Cross-modal Projection 的效果。左侧显示原始空间中音频和视觉嵌入分离,右侧显示投影后两者在公共空间重叠。该图证明投影有效消除了 Modality Gap,使跨模态冗余度量更可靠。

ReMo 方案:投影、剪枝与文本代理

ReMo 方案:投影、剪枝与文本代理
Figure 2: Overview of ReMo. ReMo prunes video tokens before the LLM decoder while preserving broad audio– visual context. Cross-modal projection (§4.1) aligns audio tokens za

Figure 2 展示了 ReMo 的整体架构。输入音频和视觉 Token 经过 Cross-modal Projection 对齐,基于 Residual Saliency 剪枝冗余视觉 Token。轻量级检测器生成 Text Proxy 替代被剪枝的对象视觉 Token,并通过 TMRoPE 编码位置信息。该图详细展示了 ReMo 的三个关键组件及其交互。

实验验证:准确率与效率的双重提升

实验验证:准确率与效率的双重提升
Table 1: Main results on Qwen2.5-Omni at the 3B and 7B scales. Compared with the strongest training-free baseline, ReMo loses no accuracy and surpasses the full-token model. Comp. is the average token compression rate measured over the full input sequence, and Avg. normalizes each benchmark to the full-token score before averaging. Full-token rows are shown in gray as reference, and bold marks the best compression method per column.

Table 1 展示了 ReMo 在 Qwen2.5-Omni 3B/7B 上的主要结果。ReMo 在相同压缩率下超越全 Token 模型准确率,且显著优于 OmniZip 等基线。该表证明 ReMo 在保持准确率的同时实现高效压缩。

结论与局限:重分布范式与适用边界

结论与局限:重分布范式与适用边界
Table 6: Text proxies help only after pruning. On the full video set the text proxies (Nadd tokens) leave accuracy unchanged since the information is already present, but on a random 50% prune they recover much of the lost accuracy. The proxy helps only once tokens are pruned, not as a generic add-on.

Table 6 展示了 Text Proxy 仅在 Token 被剪枝后有效。在全视频集上 Text Proxy 无增益,但在随机剪枝 50% 后恢复大量准确率。该表证明 Text Proxy 是剪枝后的必要补充,而非通用增强。

实验如何设计?

  • 评估模型:Qwen2.5-Omni (3B/7B) 和 Qwen3-Omni-30B (Instruct/Thinking)。
  • 基准数据集:WorldSense, Daily-Omni, Video-MME, OmniVideoBench 及 video-SALMONN2。
  • 对比基线:Full Token, Random, FastV, OmniZip。
  • 组件消融:验证 Text Proxy、局部细节、投影等组件的贡献。
  • 超参数敏感性:分析选择预算、局部细节预算、时间合并阈值等超参数的影响。
  • 检索实验:在 VGGSound 上进行音频到视频检索,验证投影对齐效果。

关键结果与论文证据

  • ReMo 在 Qwen2.5-Omni 3B/7B 上平均准确率分别达到全 Token 模型的 101.2% 和 101.3%,压缩率约 54%(Page 5)。
  • 在 Qwen3-Omni-30B 上,ReMo 平均准确率分别达到 101.4% 和 100.9%,压缩率约 52%(Page 7)。
  • VGGSound 检索 R@1 从原始空间的 2.7/5.0 提升至投影空间的 31.3/35.6 (3B/7B),证明投影有效对齐模态(Page 7)。
  • ReMo 延迟与最快基线 OmniZip 相当 (3B: 0.65x, 7B: 0.57x),但准确率显著更高(Page 6)。
  • Text Proxy 实现约 176:1 的视觉 Token 到文本 Token 压缩比,显著降低序列长度(Page 12)。
  • 消融实验显示,移除 Text Proxy 或局部细节恢复会导致准确率大幅下降,证明其关键作用(Page 6)。
  • ReMo 对超参数不敏感,准确率在选择预算、局部细节预算等变化时保持稳定(Page 8)。
  • Text Proxy 仅在 Token 被剪枝后有效,若未剪枝则无增益甚至可能轻微干扰(Page 7)。

阅读时需要注意

  • 目前评估主要集中在较短的视频片段,流式或任意长度数据的处理仍是挑战。
  • Text Proxy 依赖现成检测器的词汇表,无法显式识别词汇表外实体。
  • 最佳压缩率随任务和输入特性变化,缺乏自适应、输入条件化的压缩机制。
  • Cross-modal Projection 需离线构建,依赖于 VGGSound 等配对数据的质量。

关联工作

  • OmniZip:无需训练基线,基于原始嵌入余弦相似度剪枝,受模态间隙影响,准确率低于 ReMo。
  • OmniDrop:无需训练基线,在解码器内部逐层剪枝,早期层仍需处理全序列。
  • OmniSIFT / EchoingPixels:训练型方法,需针对每个骨干模型重新训练压缩模块,适用性受限。
  • ContextGuard:训练型方法,使用单独训练的预测器估计音频可解释的视觉语义。
  • ReVisiT:显示视觉 Token 内在编码对象级语义,支持用 Text Proxy 替代视觉 Token 的可行性。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

未见即遗忘?全模态大语言模型中的 Token 压缩

Suho Yoo1 Youngjoon Jang1,2 Hyebin Cho1 Joon Son Chung1 1KAIST 2VGG, University of Oxford

suho.yoo@kaist.ac.kr

摘要

音频 公共空间投影 冗余 人 音频 小提琴 剪枝 视觉 剪枝 Token 文本代理 文本{人,代理 注入 小提琴} 视频 目标检测 图 1:跨模态重分配。全模态大语言模型(Omni-LLM)中的大量视觉 Token 是冗余的。我们的方法将音频和视频投影到公共空间以丢弃冗余的视觉 Token,然后用紧凑的文本代理替换被丢弃对象的语义,以两种方式为仅出现一次的视觉对象保留其信息:(i) 它将音频和视频对齐到公共嵌入空间,并移除已被音频或其他视觉 Token 解释的视觉 Token;(ii) 它将对象级的视觉 Token 替换为紧凑的文本代理,即对每个对象及其位置的简短描述,用更少的 Token 传达相同的内容。

本文的目标是降低全模态大语言模型(Omni-LLMs)在推理时的输入 Token 成本。Omni-LLMs 对音频、视频和文本进行联合推理,但三条流的成本高度不平衡:视觉 Token 占输入的绝大多数,且高度冗余。在本文中,我们提出了 ReMo,一种无需训练的框架,它通过跨模态重分配来压缩视觉 Token:如果一个视觉对象仅出现一次,ReMo 无需训练即可满足其要求。基于训练的方法,如 OmniSIFT (Ding et al., 2026)、EchoingPixels (Gong et al., 2026) 和 ContextGuard (Jung et al., 2026b),学习一个专用的压缩组件;尽管有效,但它们必须针对每个主干网络重新训练,限制了其适用性。无需训练的方法避免了这一成本,并在两个模型规模上,ReMo 在不损失准确性的情况下移除了 54% 的输入 Token。事实上,它略微超过了全 Token 模型,在五个音频视觉基准测试中达到了其平均准确率的 101.2% 和 101.3%。

1 引言

全模态大语言模型(Omni-LLMs)扩展了 LLMs,使其能够联合感知音频、视觉和文本,在现实世界的音频视觉理解任务中取得了强劲的结果 (Xu et al., 2025a; Tang et al., 2025; Xu et al., 2025b; Team, 2026; Hurst et al., 2024)。这种能力是有代价的:编码所有三种模态会将输入序列膨胀至数万个 Token,其中大部分来自视觉流。在此长度下,注意力的二次方成本成为延迟和内存的主要瓶颈。因此,在不牺牲准确性的情况下减少 Token 数量对于大规模部署 Omni-LLMs 至关重要。

针对 Omni-LLMs 的 Token 压缩最近才出现,现有方法根据是否涉及训练分为两类。基于训练的方法,如 OmniSIFT (Ding et al., 2026)、EchoingPixels (Gong et al., 2026) 和 ContextGuard (Jung et al., 2026b),学习一个专用的压缩组件;尽管有效,但它们必须针对每个主干网络重新训练,限制了其适用性。无需训练的方法避免了这一成本,并在压缩发生的两个模型规模上有所不同。OmniDrop (Park et al., 2026) 通过注意力 rollout 在解码器内部逐步剪枝,但整个序列仍必须在早期层中处理,且该方法依赖于对中间注意力图的访问。OmniZip (Tao et al., 2026) 则在输入级别进行剪枝,通过原始嵌入的余弦相似度估计音频-视频冗余;这假设两种模态在其原生空间中是可比的,而事实上它们的嵌入对齐程度很差 (Liang et al., 2022; Hong et al., 2026b; Lee et al., 2026a; Grassucci et al., 2026)。

在本文中,我们关注的是无需训练、输入级的 Omni-LLMs Token 压缩。与以往询问“丢弃哪些 Token”的方法不同,我们询问“它们的信息还能存在于何处”,并将压缩表述为如图 1 所示的两条路线中的跨模态语义重分配。第一条路线利用音频。当一个概念可听时,例如演奏小提琴,伴随的音频 Token 已经描述了它,而显示小提琴的视觉 Token 添加的信息很少。

第 2 页

这些 Token 可以直接移除。第二条路径利用文本。场景中有些物体既不可听,也未在输入的任何地方提及,但其含义可用寥寥数语概括。我们使用轻量级检测器检测此类物体,并将其名称作为文本 Token 插入输入中,从而用少量文字替代大量视觉 Token。每条路径都面临各自的挑战。对于第一条路径,判断音频 Token 和视觉 Token 是否描述同一概念十分困难,因为它们的嵌入位于对齐不良的空间中。因此,我们将两种模态投影到公共空间中,以便直接衡量它们的一致性。对于第二条路径,插入的词语不能脱离场景漂浮。我们将每个描述置于其替换对象的空间位置,使文本锚定在其内容出现的位置。结果,ReMo 将高层视觉语义卸载到音频和文本流中,并保留视觉 Token 以提供其他模态无法供给的残差信息。通过大量实验,我们证明了这种重新分配在实践中行之有效。受控的音频到视频检索分析首先验证了 ReMo 核心的投影机制,将 R@1 从原始嵌入的 2.7 提升至 31.3,并确认音频和视频的对齐足以支撑我们的跨模态显著性。随后,我们在 Qwen2.5-Omni (Xu et al., 2025a) 上的四个音频视觉理解基准和一个图像描述基准上评估了 ReMo。在与最强免训练基线相当的压缩率下,ReMo 未损失任何精度,甚至超越了全 Token 模型,在 3B 和 7B 模型规模下分别达到其平均准确率的 101.2% 和 101.3%。在两种规模、不同性质的基准以及无需任何训练的情况下均获得一致的提升,表明跨模态重新分配信息是压缩 Omni-LLM 输入的一项通用原则。

2 相关工作

Omni-LLM。基于多模态大语言模型(MLLMs),最近的一项工作将视觉-语言模型扩展为在单个 LLM 中联合处理文本、图像、音频和视频,通常被称为 Omni-LLM。GPT-4o (Hurst et al., 2024) 和 Gemini (Team et al., 2024; Comanici et al., 2025) 等专有系统展现了强大的音频视觉推理能力,越来越多的开源模型也紧随其后 (Xu et al., 2025a; Deshmukh et al., 2026; Li et al., 2025b; Fu et al., 2024; Cheng et al., 2024; Tang et al., 2025)。这些模型将模态特定的编码器与共享的 LLM 解码器配对,将每种模态投影到公共嵌入空间,并将生成的 Token 交错排列成块结构序列。另一条互补的工作线通过解码干预在推理时改进这些模型 (Jung et al., 2025b; Yoo et al., 2026; Jung et al., 2025a; Chung et al., 2026; Jung et al., 2026c)。然而,此类方法改变了现有 Token 的读取方式,但未改变 Token 预算,因此数千个多模态 Token 上注意力的二次方成本仍是主要瓶颈。

Omni-LLM 的 Token 压缩。Token 压缩通过减少解码器必须关注的 Token 数量,从源头上降低此成本。对于通用多模态 LLM,现有方法通过在视觉流内部进行选择来操作,即在早期层之后剪枝低注意力 Token (Chen et al., 2024),拟合注意力分布 (Ye et al., 2025),合并相似 Token (Bolya et al., 2023),或选择主导 Token (Yang et al., 2025)。然而,这些方法仅考虑单一的视觉流,忽略了 Omni-LLM 接收的音频。直到最近,才出现了专为 Omni-LLM 设计的压缩方法,它们分为两类。第一类依赖免训练评分:FastAV (Jung et al., 2026a) 和 OmniDrop (Park et al., 2026) 在解码器内部使用注意力进行渐进式剪枝,而 OmniZip (Tao et al., 2026) 在输入层面通过根据显著音频对视频 Token 进行评分来剪枝。第二类引入学习组件:OmniSIFT (Ding et al., 2026) 和 EchoingPixels (Gong et al., 2026) 训练专用的压缩模块,而 ContextGuard (Jung et al., 2026b) 使用单独训练的预测器在解码器之前剪枝,该预测器估计可由音频解释的视觉语义。

多模态模型中的模态间隙。来自不同模态的嵌入很少共享共同的几何结构。即使编码器经过训练以对齐它们,它们也占据表示空间中的独立区域,这种现象被称为模态间隙 (modality gap) (Liang et al., 2022),并与嵌入空间中的圆锥结构有关。该间隙并非特定于某一模态对:它已在图像、视频、音频和 3D 数据中报告 (Hong et al., 2026b),并归因于可分离的模态特定组件。

第 3 页

来自共享的双模态信号(Dhimoïla 等,2026)。越来越多的工作致力于缩小这一间隙,要么通过学习的对齐目标(Lee 等,2026a;Grassucci 等,2026),要么通过利用间隙的几何结构在不同模态间进行迁移而无需成对监督(Hong 等,2026b)。这一间隙对 Omni-LLM 中的输入级压缩有直接影响,因为在解码器之前必须判断音视频冗余。OmniZip(Tao 等,2026)从原始嵌入的余弦相似度来评估这种冗余,这直接受到间隙的影响。ContextGuard(Jung 等,2026b)则训练一个音频到视频预测模块来桥接这两个空间,而 OmniDrop(Park 等,2026)完全通过剪枝中间解码器层而非在输入端来规避该问题。

视觉与文本 Token 的桥接。另一条互补路线将视觉内容与文本 Token 联系起来。ReVisiT(Cho 和 Kim,2026)表明,视觉 Token 内在编码了对象级语义,当投影到文本词汇表时便会显现,这表明其大部分内容可以以语言形式恢复。ViKey(Lee 等,2026b)在采样帧上叠加帧索引提示,并将查询关键词映射到这些索引,利用文本线索作为稀疏采样视频的时间锚点。反之,VIST(Xing 等,2025)将文本渲染为图像,并将渲染特征压缩为少量视觉 Token,利用文本的空间冗余。这些结果共同表明,对象级语义在这两种 Token 类型之间可以迁移。在本文中,我们利用这一特性,用紧凑且空间定位的文本代理(Text Proxy)替换冗余的视觉 Token,而不是简单地丢弃它们。

时空旋转位置编码。Token 位置遵循 TMRoPE(Xu 等,2025a),它在旋转嵌入(Sude 等,2024)中加入绝对时间,从而扩展了 M-RoPE(Wang 等,2024)。对于一维位置 $p$,RoPE 根据以下公式旋转每个特征对:

$$ \begin{pmatrix} \cos p\theta_j & -\sin p\theta_j \\ \sin p\theta_j & \cos p\theta_j \end{pmatrix}, \quad \theta_j = b^{-2j/d}. \label{eq:rope} (2) $$

TMRoPE 通过为每个 Token 分配跨越时间、高度和宽度轴的三部分位置 $(t,h,w)$,将此扩展至三个轴:

$$ R_{(t, h,w)} = \mathrm {diag}\b ig(R_t(t),R_h(h),R_w(w)\big\label{eq:tmrope} (3) $$

其中 $R_t, R_h$ 和 $R_w$ 分别是应用于时间、高度和宽度轴的 Eq. (2) 中的旋转嵌入实例。在注意力机制中,这些旋转根据每个 Token 的位置应用于查询和键表示,从而保持三个轴之间的相对关系。文本 Token 在所有轴上共享一个索引,音频 Token 仅在时间轴上递增,而视频 Token 从补丁网格获取空间索引,其时间索引跟踪真实时间,因此每个块(chunk)的视觉和音频 Token 落在匹配的时间点上。这随后允许我们将文本代理分配给它们所替换的视觉对象的时间和空间位置。

3 预备知识

Omni-LLM 背景。我们基于 Qwen2.5-Omni(Xu 等,2025a)构建,该模型在单个序列中读取文本、音频和视频。文本使用基于字节的 BPE 分词器(Sennrich 等,2016;Radford 等,2019)进行分词,音频经过重采样并转换为梅尔频谱图特征,其编码器每个短固定音频窗口输出一个 Token,视频帧由视觉 Transformer 编码为补丁 Token。对于带有音频轨道的视频,两个流在块级别而非 Token 级别交错。时间轴被划分为 $T$ 个固定时长的连续时间块,每个块首先贡献其视觉 Token,随后贡献其音频 Token,因此完整输入是每块块的拼接:

$$ X=\big [\,V_1, A_1, \; V_2,A_2,\;\dots,\;V_T,A_T\,\big\label{eq:interleave} (1) $$

其中 $V_t = \{v_{t,j}\}_{j=1}^N$ 和 $A_t = \{a_{t,i}\}_{i=1}^M$ 分别是块 $t$ 中 $N$ 个视觉 Token 和 $M$ 个音频 Token 的集合。这种布局按时间排序,同时保持每个间隔的视觉和音频 Token 相邻。由于每帧产生完整的补丁网格,视觉块 $V_t$ 主导了序列并驱动了我们方法针对的二次注意力成本。

4 方法

概述。如图 2 所示,ReMo 是一种无需训练的方法,它将压缩视为重新分配而非移除:仅当视觉 Token 的信息在其他地方不可恢复时才保留它。该方法作用于 LLM 的输入 Token 序列,首先将音频和视觉 Token 投影到公共嵌入空间以去除已被音频或其他共享双模态信号解释的视觉 Token。

第 4 页

𝑣!,# 邻居比较 可被音频解释的距离 视觉常见距离 𝑣!,# ≉𝑣!,-, 𝑘∈ 𝒩𝑗 ⟹ 𝑑!,#, ↑ 𝑧!$ 规范空间 𝑧!,#% 𝑧!,#% ≈𝑧!$ ⟹ 𝑆!,#$&'↓ 𝑧!,#% ≈𝑣̅! ⟹ 𝑆!,#%()↓ 被丢弃的视觉 Token 𝑑!,#, ↑ ⟹ 𝑹𝒆𝒔𝒕𝒐𝒓𝒆 𝑆!,#↓ ⟹ 𝑫𝒓𝒐𝒑 𝒟! (§4.1.b) 残差显著性 & 𝑑!,#

检测器 检测到{person, violin} 语义: 𝑣!,# 时间比较 𝑣!$',# 音频 视觉 类别标签 𝑐( 文本代理 𝑃( = 𝐸!*+!(𝑐() 𝑣!$%,# 𝑣!,# ≈𝑣!01,# ⟹ 𝑑!,#!./↓ 编码器 编码器 掩码 𝑚( 质心 (ℎ(, 𝑤() TMRoPE 𝑣!$(,# 𝑑!,#!./↓ ⟹ 𝑴𝒆𝒓𝒈𝒆 𝑠!,# 𝑣!,# + 𝑠!01,# 𝑣!01,# + 𝑣D!,# = 𝑠!,# + 𝑠!01,# 空间文本代理 视觉 Token (§4.1.a) 跨模态投影 (§4.2) 语义卸载至文本代理 (§4.3) 局部细节与时间合并

图 2: ReMo 概览。ReMo 在 LLM 解码器之前剪枝视频 Token,同时保留广泛的音频-视觉上下文。跨模态投影 (§4.1) 将音频 Token 𝑧𝑎𝑡 和视频 Token 𝑧𝑣𝑡,𝑗 对齐到规范空间;残差显著性丢弃由音频 (𝑆𝑎𝑢𝑑) 或常见视觉上下文 (𝑆𝑣𝑖𝑠) 解释的 Token,保留音频和视觉均未解释的证据(如罕见的视觉细节),而语义卸载 (§4.2) 将检测到的对象路由到文本代理 𝑃𝑖,其位置通过 TMRoPE 保持;局部细节恢复 (§4.3) 从丢弃集 𝒟𝑡 中恢复高邻居距离 Token 𝑑𝑙𝑡,𝑗,时间合并则融合冗余的同位 Token。

视觉 Token(第 4.1 节),将文本代理 𝑧𝑎𝑡 和视觉 Token 注入公共空间,𝑧𝑎𝑡 = (𝑣̅𝑡 − 𝜇𝑎)𝑃𝑎 且 𝑧𝑣𝑡,𝑗 = (𝑣𝑡,𝑗 − 𝜇𝑣)𝑃𝑣,其中 𝑧𝑎𝑡 作为音频锚点,保留其时间和空间位置(第 4.2 节),并恢复局部视觉细节和残差显著性(第 4.3 节)。一个 Token 仅在两方面都有信息量时才值得保留,即既不被其分块的视觉模式解释,也无法从音频中恢复。

4.1 视觉冗余评分

我们首先移除其内容已由音频携带的视觉 Token。衡量这种重叠的自然方法是计算 𝑣𝑡,𝑗 与 𝑣̅𝑡(分块均值)之间的余弦相似度。由于两者在

尺度,我们将它们与每个分块的权重进行融合,尽管音频和视觉嵌入存在模态间隙,导致两者在表示空间中处于不同的区域,使得原始相似度不可靠。

跨模态投影。给定来自 VGGSound (Chen et al., 2020) 的配对音频-视觉嵌入 (A,V),我们对它们进行中心化 ($\Delta A = A – \mu_a$, $\Delta V = V – \mu_v$) 并通过其协方差正则化逆平方根进行白化,

\begin{equation} W_a = \left(\frac{1}{n}\Delta\mathbf{A}^\top\Delta\mathbf{A}+\epsilon I\right)^{-1/2}, \quad W_v = \left(\frac{1}{n}\Delta\mathbf{V}^\top\Delta\mathbf{V}+\epsilon I\right)^{-1/2}. \end{equation}

白化后的互协方差的 SVD, \begin{equation} C = \frac{1}{n}\,(\Delta \mathbf{A}\,W_a)^\top(\Delta\mathbf{V}\,W_v) = U\Sigma Q^\top \end{equation} 产生奇异值 $\Sigma = \text{diag}(\sigma_1,…,\sigma_d)$,即模态间的典型相关系数。保留前 K 个方向并乘以 $\sigma_k^{1/2}$,得到 \begin{equation} P_a = W_a\,U_K\,\Sigma_K^{1/2}, \qquad P_v = W_v\,Q_K\,\Sigma_K^{1/2}. \end{equation}

在推理时,我们将平均音频表示映射到公共空间,并将视觉嵌入投影到该空间,同时结合残差显著性。具体而言,对于分块 $t$ 中的每个视觉 Token $j$,我们计算其残差显著性 $s^{\mathrm{vis}}_{t,j}$,该值衡量 Token 既不被音频解释也不被视觉上下文覆盖的程度。我们保留得分最高的 $\lceil \rho_{av} N \rceil$ 个 Token 作为 $S_t$,首先剔除那些在视觉上常见且可被音频预测的 Token。

4.2 语义卸载至文本代理

显著性剪枝移除了冗余 Token,但它们携带的对象级语义也会随之消失,尽管表达这些语义所需的词数远少于像素。与其在这些语义上消耗视觉 Token,我们显式地命名这些对象。

轻量级检测器 (Yaseen, 2024) 在分块 $t$ 的 $C$ 帧 $I_t$ 上运行,返回 $M_t$ 个检测结果, \begin{equation} \{(c_i,m_i)\ }_{i=1}^{M_t}=\mathrm{Det}(I_t), \end{equation} 每个结果将对象类别 $c_i$ 与其区域掩码 $m_i$ 配对。我们将每个类别通过模型的文本嵌入 $p_i = E_{\text{text}}(c_i)$ 转换为文本代理。

为了在空间上定位每个代理,我们为其分配一个 TMRoPE 位置。与文本 Token 不同,

第 5 页

通常三个轴共享一个索引,我们评估的基准仅包含问答对,我们保留时间索引为块 $t$,并获取空间索引为区域质心,$(h_i, w_i) = \text{centroid}(m_i)$,为每个基准分配 $\operatorname{pos}(p_i) = (t, h_i, w_i)$。 \label{eq:place} (10) 在注意力机制中,TMRoPE 将此位置应用于 $p_i$ 的查询和键表示,使代理能够像位于对象的时空位置一样关注保留的视觉 token,编码对象是什么以及它位于何处。我们将这些代理前置到其块的保留视觉 token 之前,使得每个块读作紧凑摘要,后接其无法表达的残差视觉细节。

4.3 局部细节与时间合并

仍有两种效应。余弦显著性偏好全局相似性,可能抑制局部视觉结构,而相邻块通常重复保留内容。我们在选择后解决这两个问题。

局部细节。对于每个 token,我们测量其与四个空间邻居 $N(j)$ 的偏差: $d^l_{t,j} = \frac{1}{|\mathcal{N}(j)|} \sum_{k \in \mathcal{N}(j)} \|v_{t,j} – v_{t,k}\| \label{eq:local} (11)$

对于视频-SAL2,越低越好,我们使用倒数。我们还报告 Comp.,即相对于完整输入序列的平均压缩率。

实现细节。我们将 ReMo 应用于 Qwen2.5-Omni (3B/7B),所有实验均在单块 NVIDIA RTX A6000 (48GB) GPU 上运行。跨模态投影一次性离线构建,基于 VG-GSound 训练集中的 5,000 对音频-视觉嵌入,保留前 $K=512$ 个规范方向。我们设置选择预算 $\rho_{av}=0.4$,局部恢复预算 $\rho_l=0.05$,以及时间合并阈值 $\tau=0.05$,在所有基准中固定。文本代理的对象类别由轻量级 YOLO 检测器检测。

基线。我们对比免训练 token 压缩方法。随机丢弃均匀随机选择视觉和音频 token。FastV (Chen et al., 2024) 通过注意力剪枝,我们扩展

所有音频-视觉令牌。OmniZip (Tao et al., 2026) 在输入层面进行剪枝,通过选择显著性最高的音频令牌并根据其与保留音频的原始嵌入余弦相似度移除视频令牌。Full Token 表示未压缩模型。

时间合并。我们在序列上滑动一个双块窗口。对于位于块 t 和 t+1 中的共位令牌,当它们相似($d_{tmpt,j} = 1 – \cos(v_{t,j}, v_{t+1,j}) < \tau$)且该对的最小显著性 $m_j = \min(s_{t,j}, s_{t+1,j})$ 低于窗口内 $\{m_j\}$ 的中位数时,我们通过显著性加权融合合并它们: $$v_{t,j} = \frac{s_{t,j}v_{t,j} + s_{t+1,j}v_{t+1,j}}{s_{t,j} + s_{t+1,j}}, \label{eq:temporal} (12)$$ 这将融合后的令牌偏向于具有更多残差信息的令牌,并继承其位置。

5 实验 5.2 实验结果 表 1 报告了四个音频-视觉基准测试上的准确率。在与最强免训练基线 ReMo 相当的压缩率下,ReMo 不仅没有损失任何准确率,反而超越了全令牌模型,在 3B 和 7B 骨干网上分别达到其平均准确率的 101.2% 和 101.3%。所有其他竞争方法均低于全令牌水平,即使是最强的基线 OmniZip 在相同压缩率下也仅达到 98.7% 和 97.1%。这种增益是持续性的而非集中的。ReMo 在两个规模的所有四个基准测试中均为最佳方法,在 3B 骨干网的 MME 上增益最大(75.8→77.5),在 7B 骨干网的 OmniVid. 上增益最大(47.6→49.4),且这一趋势延续到字幕生成任务中,它在两个规模的视频-SAL2. 上均优于全令牌模型。这表明 ReMo 恢复了剪枝本会丢弃的内容,以更少的令牌携带了更多意义。

5.1 实验设置 数据集与指标。我们在四个音频-视觉理解基准测试上进行评估:World-Sense (Hong et al., 2026a) (World.),Daily-Omni (Zhou et al., 2025) (Daily.),Video-MME (Fu et al., 2025) (MME),以及 OmniVideoBench (Li et al., 2025a) (OmniVid.),以及一个字幕生成基准测试:video-SALMONN2 测试集 (Tang et al., 2025) (video-SAL2.)。

1YOLOv8n-seg (Nano),YOLOv8 的最小变体,拥有 3.4M 参数。 https://huggingface.co/Ultralytics/YOLOv8

5

第 6 页

表1:Qwen2.5-Omni在3B和7B规模下的主要结果。与最强的免训练基线ReMo相比,我们的方法在精度上毫无损失,并超越了全Token模型。Comp. 是在整个输入序列上测量的平均Token压缩率,Avg. 在平均之前将每个基准测试归一化为全Token得分。全Token行以灰色显示作为参考,粗体标记每列中最佳的压缩方法。

方法 Comp.↑(%) World.↑ Daily.↑ MME↑ OmniVid.↑ video-SAL2.↓ Avg.↑(%)

Qwen2.5-Omni3B

全Token 0 47.7 57.7 75.8 44.0 53.5 100.0 随机 50 44.1 53.1 74.0 42.8 56.1 95.0 FastV 50 46.7 55.6 74.0 44.0 54.6 98.0 OmniZip 54 47.1 55.8 74.9 42.8 52.4 98.7 Ours 54 47.8 58.3 77.5 44.6 52.9 101.2

Qwen2.5-Omni7B

全Token 0 47.4 57.0 78.8 47.6 49.3 100.0 随机 50 45.7 52.4 77.5 43.4 50.4 95.1 FastV 50 45.6 56.6 77.9 47.6 49.8 98.7 OmniZip 54 46.8 56.6 77.1 47.0 52.8 97.6 Ours 54 48.2 57.4 77.9 49.4 48.7 101.3

表2:组件消融。每行在3B模型上移除单个组件(文本代理、局部细节、文本投影或时间合并)。两个恢复机制最为重要。移除它们会提高压缩率但损失最多精度,而其余组件仅以微小成本完善结果。括号内的值是从Ours下降的幅度,行按压缩率降序排列。

方法 World.↑ Daily.↑ Comp.↑ Ours 15.5 (0.4) 4.78 (0.12) 0.65 Ours 47.8 58.3 54 w/o text 46.7 (−1.1) 57.1 (−1.2) 58 w/o local 46.4 (−1.4) 57.5 (−0.8) 57 w/o rope 47.2 (−0.6) 58.0 (−0.3) 54 w/o proj. 47.5 (−0.3) 58.1 (−0.2) 54 w/o temporal 47.5 (−0.3) 58.1 (−0.2) 52

表3:效率比较。ReMo在延迟和内存方面与最快的基线持平,同时精度远超其。括号内的值是检测器的成本,已通过并行处理包含在内且很小。

方法 GPU Mem.↓(GiB) Latency↓(sec) Rel.↓ Qwen2.5-Omni3B 全Token 20.3 7.35 1.00 FastV 15.2 5.42 0.74 OmniZip 14.2 4.77 0.65 Ours 15.5 (0.4) 4.78 (0.12) 0.65 Qwen2.5-Omni7B 全Token 29.7 10.30 1.00 FastV 24.2 7.08 0.69 OmniZip 23.1 5.94 0.58 Ours 24.4 (0.4) 5.92 (0.14) 0.57

5.3 分析 组件消融。表2每次移除一个检测器组件。每个组件都有帮助,但两个恢复机制最为重要。移除文本代理(w/o text,第4.2节)在World.和Daily.上分别损失1.1和1.2分,同时将压缩率推高至58%,证实了代理携带的是真实语义内容而非填充。丢弃局部细节恢复(w/o local,公式(11))是对World.影响最大的单一因素(−1.4),因为边缘和纹理等细粒度空间线索至关重要。移除代理位置(w/o rope,使用(t,t,t)代替(t,h,w),公式(10))或投影到公共空间(w/o proj.,公式(6))虽然成本较低,但仍会影响精度。时间合并(w/o temporal,公式(12))以其他方式权衡,在不损失精度的情况下增加了2%的压缩率。

效率。表3比较了MME上的内存和延迟。在3B和7B骨干网络上,ReMo的运行速度分别为全Token延迟的0.65倍和0.57倍,与最快的基线OmniZip持平,同时精度远超其。ReMo将其精度增益转化为“免费午餐”,同时匹配了最高效的基线。

扩展至更大的骨干网络。表4将ReMo应用于Qwen3-Omni-30B-A3B (Xu et al., 2025b) 的Instruct和Thinking变体。在匹配的压缩率下,ReMo再次超越全Token模型,在Instruct和Thinking变体的平均精度上分别达到101.4%和100.9%。ReMo在大多数基准测试中匹配或超过全Token模型,其中OmniVid.(Instruct从48.2提升至51.2)和Daily.(Thinking从63.0提升至63.8)的提升最大。骨干网络规模从3B增加到30B,十倍的增长并未改变重新分配视图,表明跨模态冗余并非小模型的伪影,而是ReMo在大规模下利用的特性。实验细节见附录D。

6

第 7 页

表4:Qwen3-Omni-30B(Instruct 和 Thinking 变体)上的结果。ReMo 无需对方法进行任何更改即可迁移到更大的骨干网络,在匹配的压缩率下,其表现优于全 Token 模型的两个变体。

方法 压缩率↑(%) World.↑ Daily.↑ MME↑ OmniVid.↑ 平均↑(%)

Qwen3-Omni-30B Instruct

全 Token 0 53.6 69.3 84.8 48.2 100.0 随机 50 52.2 66.6 84.0 47.0 97.5 ours 52 53.6 69.1 84.4 51.2 101.4

Qwen3-Omni-30B Thinking

全 Token 0 53.1 63.0 82.3 46.4 100.0 随机 50 49.6 62.2 81.0 44.0 96.3 ours 52 53.2 63.8 83.1 47.0 100.9

表5:VGGSound 测试集上的音频到视频检索。我们为每个音频查询检索匹配的视频,将原始嵌入(Raw)与我们的投影嵌入(Ours)进行比较。投影提高了对齐效果,证实了冗余在公共空间中是可可靠测量的。

方法 R@1↑ R@5↑ R@10↑ MedR↓

Qwen2.5-Omni 3B

图3:VGGSound 测试集上的音频和视觉嵌入。左侧:由 PCA 得到的原始空间,其中两个模态分离且分布范围不同。右侧:沿前两个典型分量的投影。配对的嵌入现在在公共空间中重叠,使得音视频相似度可直接测量。

跨模态对齐。我们的显著性(第 4.1 节)假设音频和视频在投影后变得可比。图3从定性角度展示了这一点:在原始空间中,两个模态形成不相交的簇,而在我们的投影后,配对的嵌入在公共空间中重叠。我们通过 VGGSound 测试集上的音频到视频检索(平均 50 个采样种子,见表5)对此进行了定量确认。在原始嵌入空间中,模态几乎无关,R@1 分别为 2.7 和 5.0,中位排名高于 50。经过我们的投影后,R@1 跃升至 31.3 和 35.6,中位排名降至 4 和 3。该投影使两个模态对齐得足够好,使得我们显著性中的跨模态项能够反映真实的语义重叠,这是冗余评分所基于的前提。

文本代理仅在信息丢失时有效。表6测试了文本代理何时真正有效。在全视频集上添加时,它们对准确率几乎没有影响,因为它们携带的信息已经存在,所以代理既无益也无害。一旦剪枝 Token,情况就发生了变化。在随机 50% 剪枝的基础上添加,相同的代理恢复了大量丢失的准确率(World. 和 Daily. 分别提升 +2.5 和 +3.6),因为它们重新引入了剪枝所丢弃的语义。因此,文本代理仅在信息被移除时才有用,而非作为通用的附加组件。在剪枝时,将代理放置在其空间位置 (t,h,w) 比 (t,t,t) 效果更好。

为何使用文本代理而非视频 Token。文本代理的自然替代方案是保留底层视频 Token。我们在表7中测试了这一点。我们没有添加文本代理,而是恢复了相同数量的被丢弃视频 Token(Nadd,即 ReMo 从检测区域中添加的平均文本 Token 数),选择方式要么是随机,要么是根据我们的显著性得分(公式 (8))。这匹配了检测区域和 Token

第 8 页

图 4:ReMo 的超参数敏感性,在 World. 数据集上以 3B 骨干网络进行测量。我们依次改变选择预算 $\rho_{av}$、局部细节预算 $\rho_l$、时间合并阈值 $\tau$ 以及规范方向的数量 $K$。红色曲线显示准确率,蓝色曲线显示压缩率,$K$ 的检索 R@1 除外。虚线标记了我们的默认设置。准确率在各参数变化中保持稳定,表明 ReMo 对这些选择具有鲁棒性。

表 7:Text Proxy 与复活视频 Token。在匹配的 Token 预算下,将检测到的对象表示为 Text Proxy 优于复活其视频 Token,无论是随机选择还是基于显著性选择。

表 8:随机模态丢弃。随机丢弃 50% 的音频/视频 Token。Comp. 是从完整预填充序列中移除的比例。视频 Token 比音频 Token 具有显著更高的冗余性。

Method World.↑ Daily.↑ Nadd Comp.↑

Full Token 47.7 57.7 – 0 Random 47.2 57.8 65 54 Saliency 47.3 57.3 65 54 Ours 47.8 58.3 65 54

Method World.↑ Daily.↑ Comp.↑

Full Token 47.7 57.7 0 Random A 46.1 (−1.6) 54.8 (−2.9) 4 Random V 45.8 (−1.9) 56.9 (−0.8) 45 Random A+V 44.1 (−3.6) 53.1 (−4.6) 50

所有变体的预算,因此唯一的区别是免训练基线是否将对象表示为几个词还是其原始视频 Token 的压缩。两种复活规则在两个基准测试中的表现均低于 ReMo,在 World. 上分别达到 47.2 和 47.3,在 Daily. 上分别达到 57.8 和 57.3,而 ReMo 分别达到 47.8 和 58.3。因此,用几个词命名对象不仅比存储其像素更便宜,而且更有效,因为 Proxy 直接陈述语义,而复活的 Token 仍然携带冗余的外观细节。这表明压缩应优先考虑语义而非视觉外观。

视频 Token 具有更高的冗余性。表 8 随机丢弃了 50% 的音频和/或视觉 Token。移除一半的视觉 Token 消除了完整预填充序列的 45%,但仅使 Daily. 下降了 0.8 分。相比之下,丢弃一半的音频 Token 仅移除了序列的 4%,但使 Daily. 下降了 2.9 分。尽管视觉 Token 丢弃在 World. 上造成的下降略大(1.9 对比 1.6),但整体结果表明音频携带更紧凑和信息密集的语义,而视觉流包含显著更多的冗余。这支持在可能时将共享语义从视觉流重新分配到音频模态。

超参数敏感性。图 4 依次改变每个超参数。选择预算 $\rho_{av}$ 如预期地在准确率和压缩率之间进行权衡:保留更多视频 Token 会提高准确率但降低压缩率,因此我们设置 $\rho_{av}=0.4$ 以匹配所有变体的预算,而不是为了最大化准确率。局部细节预算 $\rho_l$ 在 0.05 左右达到峰值,此时恢复少量高细节 Token 有帮助,而额外的 Token 开始增加冗余。时间合并阈值 $\tau$ 总体平坦,在 0.05 附近有一个轻微峰值,表明 ReMo 对其确切值不敏感。对于规范方向的数量 $K$,检索和准确率在 256 时饱和并在之后保持平坦。总体而言,性能在这些设置中保持在狭窄的带内,具有轻微峰值,我们的默认设置即为此处所示。

6 结论

我们提出了 ReMo,一个免训练的框架,它将 Omni-LLMs 的 Token 压缩重新定义为跨模态的重新分配,而非视觉流内的选择。ReMo 仅在没有任何其他模态能够提供其信息时才保留视觉 Token,通过公共空间投影将已通过音频解释的 Token 丢弃,并将对象级语义卸载到紧凑的 Text Proxy 上,同时保留其空间位置。在两个规模的 Qwen2.5-Omni 和 Qwen3-Omni-30B 上,ReMo 压缩了超过一半的 Token,同时超越了全 Token 模型,且没有效率损失。这些结果表明,跨模态冗余是 Omni-LLMs 的一般属性,而将压缩视为重新分配是一条有前景的路径,可将其扩展到更长、更丰富的输入。

8

第 9 页

Omni-LLM 的局限性:高效且开放的多模态智能。 arXiv。 尽管 ReMo 带来了显著的改进,但它存在若干局限性,同时也为未来的研究提供了机遇。目前, 我们的评估集中在相对较短的片段上。 Grégoire Dhimoïla, Thomas Fel, Victor Boutin, 和 Agustin Picard。2026。跨模态冗余与视觉-语言嵌入的几何结构。在 ReMo 的免训练特性使其能够应用于更长的输入,但处理 流式或任意长度的数据仍然是一个开放 Yue Ding, Yiyan Ji, Jungang Li, Xuyang Liu, Xin- long Chen, Junfei Wu, Bozhou Li, Bohan Zeng, Yang Shi, Yushuo Guan, 等。2026。Omnisift: 面向高效全模态大语言模型(Omni-LLM)的模态非对称 Token 压缩。在 Proc. ICML。 此外,由于我们的 Text Proxy 依赖于现成检测器的词汇表, 无法显式识别词汇表外(out-of-vocabulary)的实体。最后,由于最佳压缩 Chaoyou Fu, Yuhan Dai, Yongdong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Zihan Wang, Chenyu Zhou, Yun- hang Shen, Mengdan Zhang, 等。2025。Video-MME: 探索多模态 LLM 在视频分析中的首个全面评估基准。在 Proc. CVPR。 压缩率因任务和输入特性而异, 探索自适应、输入条件压缩 是推进超越 ReMo 的 Token 高效多模态推理的自然下一步。 Chaoyou Fu, Haojia Lin, Zuwei Long, Yunhang Shen, Yuhang Dai, Meng Zhao, Yi-Fan Zhang, Shaoqi Dong, Yangze Li, Xiong Wang, 等。2024。Vita:迈向开源交互式全模态 LLM。arXiv。

参考文献 Daniel Bolya, Cheng-Yang Fu, Xiaoliang Dai, Peizhao Zhang, Christoph Feichtenhofer, 和 Judy Hoffman。 Chao Gong, Depeng Wang, Zhipeng Wei, Ya Guo, 2023。Token 合并:更快的 ViT。在 Proc. Huijia Zhu, 和 Jingjing Chen。2026。Echoingpixels: ICLR。 面向高效音频-视觉 LLM 的跨模态自适应 Token 减少。在 Proc. ICML。

Honglie Chen, Weidi Xie, Andrea Vedaldi, 和 An- drew Zisserman。2020。Vggsound:大规模 Eleonora Grassucci, Giordano Cicchetti, Emanuele 音频-视觉数据集。在 Proc. ICASSP。 Frasca, Aurelio Uncini, 和 Danilo Comminiello。 2026。缩小模态间隙以对齐组内语义。在 Proc. ICLR。

Liang Chen, Haozhe Zhao, Tianyu Liu, Shuai Bai, Junyang Lin, Chang Zhou, 和 Baobao Chang。 Jack Hong, Shilin Yan, Jiayin Cai, Xiaolong Jiang, Yao 2024。图像在 Layer 2 后值 1/2 个 Token:即插即用的 Hu, 和 Weidi Xie。2026a。Worldsense:评估 大型视觉-语言模型推理加速。在 Proc. ECCV。 多模态 LLM 的真实世界全模态理解。在 Proc. ICLR。

Zesen Cheng, Sicong Leng, Hang Zhang, Yifei Xin, Xin Li, Guanzheng Chen, Yongxin Zhu, Wenqi Zhang, Soyeon Hong, Jinchan Kim, Jaegook You, Seungtaek Ziyang Luo, Deli Zhao, 等。2024。Videollama Choi, Suha Kwak, 和 Hyunsouk Cho。2026b。 2:推进视频 LLM 中的时空建模和音频 Textme:通过文本描述桥接未见模态。在 Proc. ICML。 理解。arXiv。

Beomsik Cho 和 Jaehyung Kim。2026。重新审视你 Aaron Hurst, Adam Lerer, Adam P Goucher, Adam 所见的:揭示视觉 Token 中的视觉语义以引导 Perelman, Aditya Ramesh, Aidan Clark, AJ Ostrow LVM 解码。在 Proc. ACL。 Akila Welihinda, Alan Hayes, Alec Radford, 等。 2024。Gpt-4o 系统卡片。arXiv。

Sangyun Chung, Se Yeon Kim, Youngchae Chee, 和 Yong Man Ro。2026。Mad:模态自适应 Chaeyoung Jung, Youngjoon Jang, Jongmin Choi, 和 解码以缓解多模态大型语言模型中的跨模态幻觉。在 Proc. CVPR。 Joon Son Chung。2025a。Fork-merge 解码: 增强音频-视觉 Gheorghe Comanici, Eric Bieber, Mike Schaekermann, 大型语言模型中的多模态理解。arXiv。 Ice Pasupat, Noveen Sachdeva, Inderjit Dhillon, Marcel Blistein, Ori Ram, Dan Zhang, Evan Rosen, Chaeyoung Jung, Youngjoon Jang, 和 Joon Son 等。2025。Gemini 2.5:利用 Chung。2025b。Avcd:通过 高级推理、多模态、长上下文和 对比解码缓解音频-视觉大型语言模型中的幻觉。在 Proc. NeurIPS。 下一代代理能力推动前沿。arXiv。

Amala Sanjay Deshmukh, Kateryna Chumachenko, Chaeyoung Jung, Youngjoon Jang, Seungwoo Lee, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Da- 和 Joon Son Chung。2026a。Fastav:高效 nial Mohseni Taheri, Ilia Karmanov, Guilin Liu, 面向音频-视觉大型语言模型推理的 Token 剪枝。在 Proc. ICASSP。 Jarno Seppanen, Arushi Goel, 等。2026。Nemotron 3 nano。

9

第 10 页

Chaeyoung Jung, Kyeongha Rho, 和 Joon Son Chung。Qwen Team。2026。Qwen3.5-omni 技术报告。 2026b。保留音频无法表达的内容:面向 Omni-LLM 的上下文保持 Token 剪枝。arXiv。 Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Jihoo Jung, Chaeyoung Jung, Ji-Hoon Kim, 和 Joon Son Fan, Jinze Bai, Keqin Chen, Xuejing Liu, Jialin Chung。2026c。探测音频-视觉 LLM 中的跨模态信息 Wang, Wenbin Ge, 等。2024。Qwen2-vl:增强 信息枢纽。在 Proc. ICML 会议论文集中。 视觉-语言模型对世界的感知能力,支持 任意分辨率。arXiv。 Hyeongkeun Lee, Jongmin Choi, KiHyun Nam, 和 Joon Son Chung。2026a。LAMB:基于 LLM 的 Ling Xing, Alex Jinpeng Wang, Rui Yan, Xiangbo Shu, 音频描述生成,通过 和 Jinhui Tang。2025。以视觉为中心的 Token 压缩 柯西-施瓦茨散度桥接模态间隙。在 Proc. ICASSP 在大型语言模型中。在 Proc. NeurIPS 会议论文集中。 会议论文集中。

Yeonkyung Lee, Dayun Ju, Youngmin Kim, Seil Kang, Jin Xu, Zhifang Guo, Jinzheng He, Hangrui Hu, Ting 和 Seong Jae Hwang。2026b。Vikey:通过视觉提示增强 He, Shuai Bai, Keqin Chen, Jialin Wang, Yang Fan, 视频中的时间理解。 Kai Dang, Bin Zhang, Xiong Wang, Yunfei Chu, 和 在 Proc. CVPR 会议论文集中。 Junyang Lin。2025a。Qwen2.5-omni 技术报告。 arXiv。Caorui Li, Yu Chen, Yiyan Ji, Jin Xu, Zhenyu Cui, Shihao Li, Yuanxing Zhang, Wentao Wang, Zhenghao Jin Xu, Zhifang Guo, Hangrui Hu, Yunfei Chu, Xiong Song, Dingling Zhang, 等。2025a。Omnivideobench: Wang, Jinzheng He, Yuxuan Wang, Xian Shi, Ting 面向全模态多模态大语言模型(Omni MLLMs)的 He, Xinfa Zhu, 等。2025b。Qwen3-omni 技术 音频-视觉理解评估。arXiv。 报告。arXiv。 Yadong Li, Jun Liu, Tao Zhang, Song Chen, Tianpeng Senqiao Yang, Yukang Chen, Zhuotao Tian, Chengyao Wang, Jingyao Li, Bei Yu, 和 Jiaya Jia。2025。 Dong, Da Pan, 等。2025b。Baichuan-omni-1.5 VisionZip:更长并非必要,但在视觉 技术报告。arXiv。 语言模型中更好。在 Proc. CVPR 会议论文集中。 Victor Weixin Liang, Yuhui Zhang, Yongchan Kwon, Serena Yeung, 和 James Y Zou。2022。关注 Muhammad Yaseen。2024。什么是 YOLOv8:对 间隙:理解多模态 下一代目标检测器内部特征的深入探索。arXiv。 对比表示学习中的模态间隙。在 Proc. NeurIPS 会议论文集中。

Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, 和 Yongkweon Jeon。2026。 Weihao Ye, Qiong Wu, Wenhao Lin, 和 Yiyi Zhou。 Omnidrop:通过查询引导实现全模态 2025。拟合与剪枝:面向多模态大型语言模型的快速且无需训练的视觉 LLM 的逐层 Token 剪枝。arXiv。 Token 剪枝。在 Proc. AAAI 会议论文集中。

Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever, 等。2019。语言 Suho Yoo, Youngjoon Jang, 和 Joon Son Chung。2026。 模型是无监督的多任务学习者。OpenAI 关于塑造 Omni-LLM 解码策略的注意力 博客。 sink 的本质。arXiv。 Ziwei Zhou, Rui Wang, 和 Zuxuan Wu。2025。Daily- Rico Sennrich, Barry Haddow, 和 Alexandra Birch。 Omni:通过跨模态的时间对齐实现音频-视觉推理。arXiv。 2016。使用子词单元进行罕见词的神经机器翻译。在 Proc. ACL 会议论文集中。

Jianlin Su, Murtadha Ahmed, Yu Lu, Shengfeng Pan, Wen Bo, 和 Yunfeng Liu。2024。Roformer:增强 Transformer 与旋转位置嵌入。 Neurocomputing。

Changli Tang, Yixuan Li, Yudong Yang, Jimin Zhuang, Guangzhi Sun, Wei Li, Zejun Ma, 和 Chao Zhang。 2025。video-SALMONN 2: caption 增强的 音频-视觉大型语言模型。arXiv。

Keda Tao, Kele Shao, Bohan Yu, Weiqiang Wang, Jian Liu, 和 Huan Wang。2026。Omnizip:音频引导的 动态 Token 压缩,用于快速全模态大型 语言模型。在 Proc. CVPR 会议论文集中。

Gemini Team, Petko Georgiev, Ving Ian Lei, Ryan Bur- nell, Libin Bai, Anmol Gulati, Garrett Tanzer, Damien Vincent, Zhufeng Pan, Shibo Wang, 等。2024。 Gemini 1.5:解锁跨越数百万 Token 上下文的 多模态理解。arXiv。

10

第 11 页

算法 1 ReMo 对单个块 $t$ 的推理 表 9:3B 模型上的显著性排名来源。 保持由单一来源驱动的排名:仅视频 ($\beta=0$)、仅原始音频,或仅投影音频 ($\beta=1$)。任一模态单独均不足够;它们的组合表现最佳。

显著性来源 Daily.↑ MME↑ Full Token 57.7 75.8 仅视频 ($\beta=0$) 57.8 75.8 仅原始音频 ($\beta=1$) 56.0 74.5 仅投影音频 ($\beta=1$) 56.1 76.6 Ours 58.3 77.5

表 10:原始空间与规范空间(Ours)的视频令牌选择。 在相同的预算下,我们比较由原始音频-视频相似性保留的令牌与由我们公共空间对齐保留的令牌(在 3B 模型上)。Overlap 是两个保留集合的 Jaccard 相似性,Flipped 是保留/丢弃决策发生变化的令牌比例。

投影保留了大部分选择,且跨基准测试仅翻转了极小的边际比例。

基准测试 Overlap (Jaccard) Flipped MME 83.1 6.9% World. 83.7 6.7% OmniVid. 83.3 6.9% Daily. 83.2 6.8% Mean 83.3 6.8%

尽管投影音频显著性与原始音频显著性几乎不相关 ($\rho=0.01$),投影仍保留了大部分选择,且仅翻转了极小的边际比例,跨基准测试表现一致。

算法 1 ReMo 对单个块 $t$ 的推理 Require: 视觉令牌 $\{v_{t,j}\}_{j=1}^N$,音频令牌 $a_t$,音频冻结投影 $P_a, P_v$,预算 $\rho_{av}, \rho_l$,阈值 $\tau$ 1: $z_{at} \leftarrow (a_t – \mu_a)P_a$ \triangleright 将音频投影到公共空间 2: for each visual token $v_{t,j}$ do 3: $z_{vt,j} \leftarrow (v_{t,j} – \mu_v)P_v$ 4: $s_{vist,j} \leftarrow 1 – \cos(v_{t,j}, \bar{v}_t)$ \triangleright 视觉内显著性 5: $s_{audt,j} \leftarrow 1 – \cos(z_{vt,j}, z_{at})$ \triangleright 音频显著性 6: $s_{t,j} \leftarrow (1-\beta_t)s_{vist,j} + \beta_t s_{audt,j}$ \triangleright $\beta_t = \bar{s}_{vist} / (\bar{s}_{vist} + \bar{s}_{audt})$ 7: end for 8: 按 $s_{t,j}$ 保留前 $\lceil \rho_{av}N \rceil$ 个令牌 9: 按局部细节 $d_{t,j}$ 恢复前 $\lceil \rho_l N \rceil$ 个被丢弃的令牌 10: 检测对象类别;在其掩码质心处注入文本代理 11: for 相邻块中并置的令牌 $v_{t,j}, v_{t+1,j}$ do 12: $m_j \leftarrow \min(s_{t,j}, s_{t+1,j})$ 13: if $1 – \cos(v_{t,j}, v_{t+1,j}) < \tau$ and $m_j < \text{median of } \{m_j\}$ then 14: $\tilde{v}_j \leftarrow \frac{s_{t,j}v_{t,j} + s_{t+1,j}v_{t+1,j}}{s_{t,j} + s_{t+1,j}}$ \triangleright 显著性加权融合 15: 将 $\tilde{v}_j$ 写入较高显著性槽位

以及 -0.01)。因此,投影提供了互补的跨模态信号,而不仅仅是细化原始音频排名。如表 9 所示,仅靠视觉或音频显著性都不足以达到最佳效果,而将两者结合则表现最好。因此,残差显著性得分(公式 8)将投影后的音频显著性与视觉显著性融合,以前者为互补线索。

算法 1 总结了针对单个音频-视觉块的全 ReMo 流程。跨模态投影 $(P_a, P_v)$ 仅离线构建一次(第 4.1 节),并在每个块中重复使用。在推理阶段,每个块根据视觉冗余进行评分,修剪至选择预算,通过局部细节和文本代理进行增强,最后跨相邻块合并。所有步骤均无需训练,并在解码器之前运行。

B 进一步分析

投影对选择的影响。在投影之前,原始音频显著性与视觉显著性存在相关性(Daily 上为 $\rho=0.32$,MME 上为 0.50)。投影后,这种相关性降至接近零(0.02 和 0.00)。

在公式 (8) 诱导的选择下,表 10 考察了用公共空间相似度替换原始音频-视频相似度如何改变所选 Token。在相同的预算下,两种选择的 Jaccard 重叠率为 83.3%,仅有 6.8% 的保留/丢弃决策不同。这些值在基准测试中保持稳定,重叠率最多变化 0.6 个点,翻转决策比例变化 0.2%。因此,投影保留了清晰的决策,仅改变边界附近的一小部分 Token。这解释了为什么实质性的检索提升转化为下游准确率的适度增益:在融合的残差显著性得分中,改进的音频-视频对齐仅影响一小部分决策,从而在表 2 中产生一致的增益。

11

第 12 页

图 5:在 3B 模型上,跨解码器层对注入的文本代理(Text Proxy)的注意力分布。在平均注意力(mean attention)中,无论是块内查询(within-chunk queries)还是文本提示查询(text-prompt queries),在大多数层中对注入文本的注意力都高于对视频 token 的注意力。最大注意力(maximum attention)因层而异,但持续较高的平均值表明代理被广泛注意,而非仅由少数异常头(outlier heads)关注。

表 11:3B 模型上文本代理的 Token 预算,在四个基准测试上平均。ReMo 丢弃了大部分视频 token,并用一组极小的类别文本 token(每个检测到的类别一个)重新引入被剪枝的语义,实现了约 176:1 的缩减。

表 12:检测器尺寸消融实验。精度在 YOLO 骨干网络中保持稳健;仅检测器的边际(parallelized)延迟成本和自身的 GPU 占用量随尺寸增长,因此 ReMo 使用最小的(Nano)尺寸。

| Method | #Param | Mem (GiB)↓ | Latency (s)↓ | Acc.↑ | | :— | :— | :— | :— | :— | | Nano | 3.4M | 0.44 | 0.12 | 77.5 | | Small | 11.8M | 0.70 | 0.23 | 78.4 | | Medium | 27.3M | 1.26 | 0.35 | 78.4 | | Large | 46.0M | 1.33 | 0.43 | 77.5 |

Token 预算。表 11 报告了文本代理实际消耗的 token 数量。在四个基准测试的平均情况下,一个样本包含约 19,355 个视频 token,其中 ReMo 丢弃了 59%。最终被丢弃的语义仅通过平均 65 个类别文本 token(每个检测到的类别一个)重新引入。被丢弃的视频 token 与注入的文本 token 之比约为 176:1,这意味着每个注入的文本 token 总结了一大组冗余视觉 token 的共享语义,而非逐个替换它们。这正是“少数词替换大量视频 token”的具体含义。

注入文本的注意力分布。图 5 追踪了注入文本 token 在解码器各层中获得的注意力。在平均注意力中,注入文本在早期和中间层的块内查询下,以及在大多数层的文本提示查询下,其获得的注意力均显著高于视频 token,表明模型是在阅读这些代理而非忽略它们。最大注意力因层而异,有时偏向视频,但持续较高的平均值表明代理被广泛注意,而非仅由少数异常头关注。因此,代理在解码过程中被模型主动使用,而非惰性填充。这证实了有效的语义保留。

12

第 13 页

表13:局部细节连通性。在3B模型上,针对前景恢复,4-连通与8-连通邻居的空间方差。4-邻居规则更优。 表15:Qwen3-Omni-30B-A3B-Thinking配置。我们遵循官方推荐的解码设置。Thinking变体使用贪婪解码。 连通性 World.↑ Daily.↑ 参数 值 4-邻居 47.8 58.3 8-邻居 46.6 57.9 温度 0.6 top-p 0.95 top-k 20 表14:3B模型上的时间融合目标。跨匹配帧写入融合Token的位置。写入最高显著性槽位效果最佳或并列最佳。 表16:VGGSound上的音频到视频检索,针对Qwen3-Omni-30B。对于每个音频查询,我们对候选视频进行排名,对比原始嵌入(Raw)与我们的投影嵌入(Ours)。在小规模观察到的相同对齐增益在此延续,因此跨模态冗余在公共空间中保持可可靠测量。 目标 World.↑ Daily.↑ 最大显著性 47.8 58.3 固定 i 47.6 58.1 最小显著性 47.8 57.3 检测器大小。表12将YOLO骨干网络从Nano变化到Large。准确率在四种尺寸间基本持平,在一点范围内波动(77.5至78.4),且无一致趋势,因此更大的检测器并未带来可靠增益。随尺寸增长的是成本:内存从0.44 GiB升至1.33 GiB,检测器延迟从0.12秒增至0.43秒。由于文本代理仅依赖于检测到的对象类别,而最小模型已能恢复这些类别,ReMo使用YOLOv8n,并将预算分配给LLM而非检测器。

D Qwen3-Omni 细节

C 局部细节与时间融合

设置。我们在Qwen3-Omni-30B(Instruct和Thinking变体)上评估ReMo,所有实验均在单块NVIDIA RTX PRO 6000 Blackwell (96GB) GPU上运行。为保持与表1相当的压缩率,我们设置ρav = 0.45,同时保持其他超参数不变。

局部细节的邻居连通性。局部细节得分dt,j(公式(11))衡量Token与其空间邻居的差异程度。表13比较了使用四个直接相邻邻居与八个周围邻居的情况。四邻居版本在两个基准上均更优(World.上47.8对比46.6),因此ReMo采用此设置。八邻居变体通过对对角线Token(相关性较低)进行平均而模糊了得分,削弱了其标记真实局部结构的能力。

时间融合的目标。当跨相邻块合并两个位置相近的Token时,融合后的Token必须写入某个位置。表14比较了将其写入较高显著性槽位、不考虑显著性的较早块槽位(固定i),或较低显著性槽位的情况。写入最大显著性槽位效果最佳或并列最佳,因为它将融合内容锚定在两个帧中信息量更大的那个上。ReMo采用此选择。

配置。表15列出了Qwen3-Omni-30B-A3B Thinking变体的解码配置,该配置遵循官方推荐的采样设置,种子固定为42。Instruct变体使用贪婪解码。生成过程限制为1,024个新Token,这对于我们基准测试中的简短答案已足够。对于Thinking变体,我们解析推理块之后的答案。如果推理未在1,024个Token预算内结束,我们追加以下桥接提示以强制结束推理块,并让模型生成最多64个Token的简短结论,从而始终获得可解析的答案。

13

第 14 页

跨模态投影。为了验证投影在 Qwen2.5-Omni 之外具有泛化能力,我们在 Qwen3-Omni-30B 上重复了音频到视频检索分析(第 4.1 节)。表 16 显示了与较小骨干网络相同的模式。在原始嵌入空间中,音频和视频几乎无关,而经过我们的投影后,检索性能显著提升,中位排名降至个位数低位。因此,ReMo 所依赖的公共空间对齐在更大规模下同样成立。

14

发表评论