三分钟导读:Splash提出一种掩码隔离的触觉对齐框架,通过识别并训练LLM中的休眠参数子空间,在保持视觉-语言推理能力不丢失的前提下,为小型多模态大模型(sMLLMs)高效集成触觉感知能力。
英文题目:Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs
论文出处:arXiv 每日论文精选 · arXiv:2607.00302
原始论文:PDF / 论文页面
对应视频标题:加入触觉却不忘记视觉:Splash的小模型对齐方案|推荐指数:★★★★
这篇论文解决什么问题?
在小型多模态大模型(sMLLMs)中引入触觉模态时,由于参数预算有限,微调过程会导致严重的灾难性遗忘(Catastrophic Forgetting),即模型在获得触觉能力的同时丧失了原有的视觉-语言推理能力。
核心创新
- 提出掩码隔离的触觉对齐学习机制,通过冻结关键参数子空间来防止灾难性遗忘。
- 实现单阶段统一训练,同时优化触觉前端和LLM休眠子空间,无需多阶段对齐或额外的适配器模块。
- 在保持零额外推理延迟的情况下,使小型MLLMs具备触觉推理能力。
方法概览
Splash框架首先利用视觉相对重要性指标(基于权重和激活统计)量化预训练参数的重要性,将参数空间划分为“关键子空间”和“休眠子空间”。关键子空间被冻结以作为视觉-语言知识的稳定锚点,而休眠子空间则与触觉前端一起在单阶段统一训练中进行更新,从而实现非破坏性的模态扩展。
逐图理解论文
Splash核心方法

Splash框架提出掩码隔离的触觉对齐学习机制。它首先利用视觉相对重要性指标,量化预训练参数的重要性。通过权重和激活统计,将参数空间划分为关键子空间Critical Subspace和休眠子空间Dormant Subspace,为后续的非破坏性模态扩展奠定基础。
VTL基准表现

在SSVTP、TVL和TacQuad三个视觉-触觉-语言VTL基准上,Splash展现了卓越性能。Splash-3B在LLM Judge评估中平均得分4.91,优于TVL-Qwen2.5-VL-3B的4.50和UniTouch的3.74。即使在1B参数规模下,Splash-1B也取得了5.01的高分,证明了其高效性。
视觉能力保留

更重要的是,Splash在保持视觉-语言能力方面表现优异。在MMMU和MathVista等通用VL基准上,Splash-3B得分分别为55.3和65.3,优于对比基线,且接近Zero-shot基线水平。这表明掩码隔离策略有效防止了灾难性遗忘,保留了预训练知识。
实验与关键结果
- 在SSVTP、TVL和TacQuad三个视觉-触觉-语言(VTL)基准上评估触觉语义生成性能。
- 在MMMU、MathVista、MME和MMBench等通用视觉-语言(VL)基准上评估预训练能力的保留情况。
- 进行消融实验,分析稀疏率(Sparsity Ratio)、校准数据选择及触觉前端初始化对性能的影响。
- Splash-3B在VTL基准平均LLM Judge得分4.91,优于TVL-Qwen2.5-VL-3B (4.50) 和 UniTouch (3.74)(第 9 页)
- Splash-1B在VTL基准平均LLM Judge得分5.01,优于UniTouch (3.74)(第 9 页)
- Splash-3B在MMMUval得分55.3,MathVista得分65.3,优于TVL-Qwen2.5-VL-3B (50.0/52.8) 且接近Zero-shot基线 (53.1/62.3)(第 10 页)
- Splash-3B在TacQuad上得分4.86,显著优于TVL-(IA)3 (3.84),显示更好的泛化能力(第 9 页)
- 60%稀疏率被确定为最佳平衡点,兼顾VTL性能 (Avg 4.91) 和VL保留 (MMMUval 55.3)(第 11 页)
- Splash-3B P99延迟134.55ms,控制频率7.50Hz,与TVL-Qwen2.5-VL-3B相当,远低于LLaMA-7B基线 (202.37ms)(第 22 页)
阅读时需要注意
- 关键子空间在离线分割后是静态的,无法适应动态变化的激活模式或长期交互中的任务依赖变化。
- 当前实验仅针对单一DIGIT触觉传感器设置,跨传感器泛化能力尚未充分验证。
- 在极端触觉感知别名(如软织物与光滑刚性表面触觉相似)情况下可能出现材料误分类。
- 稀疏率设置对小型模型(如1B)的VL性能保留影响较大,需仔细调优。
- 虽然方法对校准数据选择鲁棒,但完全无意义的噪声数据校准虽有效,可能掩盖了特定语义对齐的潜在价值。
- 静态掩码可能无法完全捕捉长时间视觉-触觉推理中的参数利用率变化。
关联工作
- TVL [21]:基线方法,采用两阶段训练和LoRA适配,在小型模型上易导致灾难性遗忘(第 8 页)
- UniTouch [46]:基线方法,使用LLaMA-7B骨干,参数量大且推理成本高(第 8 页)
- Wanda [42]:灵感来源,用于计算参数重要性以识别休眠子空间(第 5 页)
- LoRA [24]:对比方法,加法式PEFT可能扰动整个参数流形,不如Splash的结构隔离稳定(第 6 页)
- (IA)3 [33]:对比方法,缩放式适配虽保留VL能力但触觉泛化能力不足(第 8 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
醒来吧,去感知触觉!在 MLLMs 中通过掩码隔离进行触觉对齐学习
Yoonhyung Park∗, Minji Kim∗, Sungwon Moon, 和 Jiyoung Lee†
爱丽达女子大学 人工智能与软件系
{pyoon0820, xxinzzi03}@ewhain.net, {sungwon268,lee.jiyoung}@ewha.ac.kr
http://mmai.ewha.ac.kr/splash/
2026 摘要。触觉提供了感知摩擦力和顺应性等内在材料特性所需的物理基础,而仅凭视觉往往难以解析这些特性。然而,近期为多模态大语言模型(MLLMs)赋予这种触觉感知的努力暴露了一种零和博弈式的权衡:紧凑模型的有限参数预算迫使我们在获取新的感官模态与保留既有的视觉-语言推理能力之间做出选择。我们提出了 Splash,一种用于 MLLMs 的掩码隔离触觉对齐学习框架。Splash 量化每个预训练参数的重要性,并将参数空间划分为休眠子空间和关键子空间。冻结的关键子空间作为稳定锚点以保护通用的视觉知识,而 Splash 更新被隔离的休眠子空间,以向大型语言模型(LLM)内部化触觉对齐。这种选择性的、非破坏性的扩展有效地防止了灾难性遗忘,并确保了非破坏性的模态扩展。大量实验表明,Splash 在 LLM 部分不增加额外推理开销的情况下,有效地实现了触觉推理,在包括 SSVTP、TVL 和 TacQuad 在内的视觉-触觉-语言(VTL)基准测试中展示了最先进的性能,同时保留了其原有的通用能力。
关键词:视觉-触觉-语言学习 · 灾难性遗忘 · 多模态大语言模型
1 引言
人类不仅通过观察,还通过触摸或按压物理世界来与之互动,以判断表面是滑腻的、顺应性的还是刚性的。这种感知摩擦力和顺应性等内在材料特性的先天能力,对于精确的物理交互至关重要。为了使具身机器人实现类似的灵巧性,感知细粒度的接触动力学对于物体操作至关重要。然而,基于视觉的系统往往难以推断这些特性,因为在主动操作过程中,这些特性经常被遮挡或在视觉上难以区分 [4,50]。
† 通讯作者。
- 这些作者对本工作贡献相同。
第 2 页
2 Y. Park 和 M. Kim 等人
语言提示 A. Qwen2.5-VL-3B “描述图像。” “图像显示一只手拿着一个罐头食品或 饮料。罐头被手电筒照亮,手电筒指向罐头的顶部。 视觉 背景似乎是一张桌子,上面有一些可见的电缆。罐头有一个 彩色的标签,但标签上的具体细节并不清楚。” 得分:9/10 多模态大语言模型 B. Qwen2.5-VL-3B + 触觉分支(无掩码引导对齐) “图像显示一只手拿着一个金属罐头,看起来是 打开的。罐头具有反光性,光线在其弯曲的表面上反射。这个人 正在使用一个黑色的、柔韧的橡胶工具,可能是橡皮筋,将其拉伸覆盖在罐头的 开口顶部。橡胶工具被按压” 得分:5/10
图 1: 多模态大语言模型(MLLMs)触觉对齐中的灾难性遗忘问题示例 (例如,TVL [21] 配合 Qwen2.5-VL-3B)。少量的触觉训练集往往会遗忘基础 MLLM 中的视觉感知。更多失败案例见附录。
为了弥补这一差距,最近的研究 [9, 16, 30, 47] 探索了学习视觉外观与触觉反馈之间的跨模态关联。这些方法通常学习一个共享的视觉-触觉-语言(VTL)表示空间。虽然在检索和分类等判别性任务中有效,但它们缺乏复杂具身决策所需的高级语义推理和指令遵循能力。此外,它们学到的表示对具有视觉模糊纹理的新颖对象泛化能力较差。这些观察结果表明,需要能够处理多模态感官输入的模型。 多模态大语言模型(MLLMs)[2, 8, 34] 是一个自然的契合点。通过利用其 LLM 骨干中编码的世界知识,MLLMs 支持对感官输入进行开放词汇推理,使机器人不仅能感知,还能推理其行动的物理后果。然而,大多数现有的 MLLMs 依赖于计算密集型骨干网络(例如 LLaMA-7B [43]),这限制了它们在资源受限的边缘机器人 [45] 中的实用性。这激发了能够在这种实际部署约束下进行触觉推理的紧凑 MLLMs 的发展 [11]。 这一挑战对于小型 MLLMs(sMLLMs,例如 ≤3B 规模)最为严峻,而这些模型正是边缘部署所真正需要的。它们有限的容量意味着引入新的触觉模态会干扰现有的视觉-语言表示。如图 1 所示,针对触觉信号优化此类模型会扭曲其预训练的视觉特征,导致灾难性遗忘和退化的视觉-语言(VL)推理性能。结果是扩展感官能力与保留 sMLLMs 预训练推理能力之间的根本权衡。 在本文中,我们提出了 Splash,这是一个新颖的框架,旨在将触觉信号对齐到 sMLLMs 中,同时减轻灾难性遗忘 [29, 41, 52]。其核心思想是将所有触觉适应限制在一个休眠的(即不太重要的)参数子空间中,同时保持关键参数冻结。我们使用从权重和激活统计信息计算出的基于 VL 相对性的指标来估计参数重要性,然后将梯度更新限制在休眠子空间中。由于
第 3 页
唤醒触觉!在 MLLM 中通过掩码隔离进行触觉对齐学习 3
冻结的关键参数是稳定的视觉-语言锚点,我们的选择性优化方法在保留预训练推理能力的同时,使模型能够整合触觉信息。通过隔离并重新激活内部权重,Splash 在不引入适配器(adapters)等外部模块的情况下(仅有一个可忽略不计的触觉前端),保持了原始 MLLM 的规模。此外,Splash 支持统一的单阶段训练,无需多阶段对齐和微调程序 [21, 46]。在视觉-触觉-语言(VTL)基准测试(包括 SSVTP [27]、TVL [21] 和 TacQuad [16])上的大量实验验证了 Splash 的有效性。值得注意的是,Splash-3B 达到了最先进(SOTA)的性能,优于之前的 7B 规模方法 [21,46]。此外,我们首次对 VTL 对齐在复杂通用视觉-语言(VL)基准测试中的保持能力进行了全面的性能分析。结果表明,使用 Splash 进行触觉对齐并不会损害 MLLM 主干网络的广谱智能。
我们将贡献总结如下:
1. 我们引入了 Splash,这是一个参数隔离的触觉适应框架,它将触觉感知集成到 sMLLMs 中,零额外推理开销,并缓解了与视觉相关的灾难性遗忘。 2. 通过利用冻结的关键参数作为稳定的结构锚点,Splash 实现了单阶段统一训练,同时优化触觉前端和休眠的 LLM 子空间。 3. 在包括 Qwen2.5-VL-3B 和 InternVL-1B 在内的小型 MLLM 上,Splash 在三个 VTL 基准测试中实现了 SOTA 性能,同时保护了模型的预训练通用能力。
2 相关工作
2.1 视觉-触觉-语言(VTL)对齐
视觉和触觉感知的整合长期以来一直是机器人感知的核心,主要作为一种解决任何单一模态歧义性的方法。早期工作确立了协同视觉-触觉整合在一系列机器人任务中的价值,如力估计 [6, 49]、跨模态合成 [47,50] 和机器人操作 [4, 23]。随着 MLLMs [2,8, 34] 的兴起,注意力转向了 VTL 对齐,其中触觉模态通过对比学习目标 [9,46,47] 与视觉-语言潜在空间对齐。随后的工作通过构建大规模 VTL 数据集 [9,21] 以及学习跨传感器视觉-触觉表示 [16,17,46](这些表示可泛化到异构触觉传感器),进一步推动了可扩展性。尽管取得了这些进展,如何将触觉感知整合到紧凑的多模态模型中仍然在很大程度上未被充分探索。在本工作中,我们直接解决这一空白,研究如何将触觉模态折叠到小型 MLLM 中,同时不牺牲其预训练能力。
第 4 页
4 Y. Park 和 M. Kim 等人
2.2 基于剪枝的多任务学习
我们的工作共享基于剪枝的多任务学习 [18,40] 的基本原理,即为不同任务分配不相交的参数子集,以减轻跨任务干扰。最近关于大语言模型(LLMs)的研究 [19,25,28,39] 强化了这一观点:与全量微调相比,仅更新一小部分参数即可实现具有竞争力的性能,同时有效遏制灾难性遗忘。这些结果表明,可以在不扰动整个参数空间的情况下,选择性地利用模型容量。然而,这些工作主要关注模态内适应,例如持续学习 [29,32,41],其主要目标是将多个任务打包到一个模型中,同时最小化它们之间的干扰。相反,我们将这一原则从任务级扩展到模态级参数隔离,以解决在新触觉感官对齐中遇到的严重表征差距问题。
3 Splash
3.1 动机与问题表述
多模态大语言模型(MLLMs)[8, 31, 43, 53] 通常由视觉编码器、模态适配器和一个对融合的多模态输入进行推理的大语言模型(LLM)组成。其中,LLM 的规模在很大程度上决定了推理能力和泛化能力。扩大 LLM 可以提高复杂任务的性能和零样本泛化能力,但代价是计算成本急剧增加。模型规模的这种扩张构成了机器人应用的关键瓶颈,因为机器人应用需要实时推理和有限的机载计算能力 [11,14,54]。更糟糕的是,简单地集成新的感官模态可能会引发灾难性遗忘:即使仅使用少量触觉数据,更新 LLM 参数的触觉指令微调也可能覆盖编码预训练视觉知识的权重配置。
为了解决这些挑战,我们提出了掩码引导的触觉对齐学习 Splash。给定自然图像(即 RGB 图像)$X_R$、触觉接触图像 $X_C$ 和文本提示 $X_T$,目标是生成自然语言形式的触觉描述 $Y$:
$$ Y = \texttt}(\mathcal(X_R),\mathcal(X_C),X_T) , \quad (1) $$
其中 $\theta$ 是语言模型参数。我们将由视觉编码器和模态适配器组成的视觉前端记为 $F$,自然图像前端和触觉前端分别由参数 $\phi$ 和 $\psi$ 参数化。我们使用来自预训练 sMLLMs [3] 的权重来初始化 $LLM_\theta$ 和 $F_\phi$,以继承其通用推理和视觉理解能力。对于触觉前端 $F_\psi$,我们采用在 ImageNet 上预训练 [12] 的视觉 Transformer (ViT) [13] 从接触图像中提取几何特征。在训练过程中,我们冻结视觉参数 $\phi$,并更新触觉参数 $\psi$ 以及由稀疏率 $\tau$ 确定的一部分 LLM 参数 $\theta$。接下来,我们将详细描述我们提出的框架的关键组件。
第 5 页
唤醒触觉!在 MLLM 中通过掩码隔离的触觉对齐学习 5
定位休眠子空间 训练:掩码隔离触觉对齐
N x Add & Norm 权重与激活重要性 文本输出:“柔软、有衬里、织物。”
下投影 𝐒𝑖,𝑗= 𝐖𝑖,𝑗∙𝐗𝑖 2 激活层 𝑠% 4 0 8 6 1 前端视觉 前端触觉 N x Add & Norm 门控投影 上投影 1 7 5 3 9 下投影 Add & Norm 6 8 2 5 4 激活层 门控投影 上投影 O 投影 关键子空间 休眠子空间 MHA Add & Norm 自然图像 图像 𝑋𝑐 𝑋𝑅接触 掩码 𝐌 O 投影 Q 投影 K 投影 V 投影 文本 提示 𝑋𝑇 0 1 0 0 1 “这张图片给出了 MHA
视觉 1 0 0 1 0 触觉感受?” Q 投影 K 投影 V 投影 分词器 可训练 前端 0 0 1 0 1 冻结 视觉-语言 分词器 LLM 目标层 校准集
图 2:Splash 的整体框架。为了减轻视觉方面的灾难性遗忘,我们在 sMLLMs 的 LLM 中训练一个用于触觉对齐的休眠子空间。 我们注意到,触觉前端也在统一的训练阶段中进行更新。
3.2 定位休眠子空间
给定一个预训练的 MLLM(例如,QwenVL-2.5 [3], InternVL [8]),Splash 首先识别出一个对预训练 VL 任务贡献最小的休眠参数子空间。这基于自然稀疏性假设 [18],该假设认为只有一部分参数对于维持模型功能至关重要。我们通过重新利用这些未充分利用的权重(称为休眠子空间)来利用这种冗余,将其作为触觉模态的可训练容量。 为了识别休眠参数,我们使用受 Wanda [42] 启发的视觉相对重要性度量。从 VL 数据中提取一个小校准集(例如,来自 CC12M [5] 的 128 个样本),我们对 LLM 线性层中连接第 i 个输入特征到第 j 个输出神经元的每个权重 Wi,j 的重要性进行评分。所得分数反映了每个参数对预训练 VL 行为的贡献。形式上,重要性分数 Si,j 定义为:
\s c ore _{ i ,j} =\|_2 , (2)
其中 | · | 表示权重幅度,∥xi∥2 表示相应输入激活的 ℓ2-范数。给定稀疏率 s%,我们设置一个阈值 τj(s),使得 {Si,j}dini=1 中的 s% 的分数低于该阈值,并在每一层中形成二元掩码:
\m a t h bf { M }_{i,j }\onemask\Bigl\score_{i,j}<_j(s)\Bigr(3)
其中 1(·) 表示指示函数。例如,当 s = 0% 时,所有参数都被视为关键参数并保持冻结,而 s = 100% 对应于 LLM 的全参数微调。我们还设置 Mi,j = 0 用于第一个和最后一个 Transformer 块,以保留输入接地和高级语义
第 6 页
6 Y. Park and M. Kim et al.
表示。从而确保训练稳定性,并防止在触觉适应过程中出现表示崩溃 [1,42]。因此,生成的掩码将 LLM 清晰地划分为冻结的关键权重和可训练的休眠权重,在保护模型预训练 VL 能力的同时实现触觉对齐。
3.3 掩码隔离的触觉对齐
现有的 VTL 对齐方法 [16, 21] 通常遵循两阶段训练方案。首先,将触觉编码器与视觉-语言 [21] 或视觉表示空间 [16] 对齐。其次,使用参数高效微调(PEFT)(例如 LoRA [24]、(IA)3 [33])对 LLM 进行适配,以实现多模态推理。Splash 则通过利用第 3.2 节中的参数划分,实现了统一的单阶段训练过程。具体而言,我们在保持关键参数冻结的同时,优化触觉前端 $F_\psi$ 和休眠的 LLM 参数。训练目标 $\mathcal{L}$ 最大化自回归生成的触觉描述的似然性,如下所示:
$$ \mathcal{L}_{thc} = – \sum_{n=1}^N \log P(y_n | Y_{<n}, X_R, X_C, X_T), \quad (4) $$
其中 $N$ 是输出序列 $Y$ 中的标记数量。我们将二元掩码 $M$ 应用于 LLM 主干参数,而触觉参数 $\psi$ 保持完全可训练。令 $\eta$ 表示学习率。参数更新定义如下:
$$ \theta^* \leftarrow \theta \odot (1 – M) + \theta \odot M – \eta \nabla_\theta \mathcal{L}, \quad (5) $$ $$ \psi \leftarrow \psi – \eta \nabla_\psi \mathcal{L}, \quad (6) $$
其中 $\odot$ 表示哈达玛积(Hadamard multiplication)。公式 (5) 为关键参数(即 $M_{i,j} = 0$)提供零梯度,并为休眠参数(即 $M_{i,j} = 1$)提供梯度更新,而公式 (6) 允许触觉分支完全训练。 鉴于我们保留了关键的视觉-语言权重,这些冻结的参数作为稳定的锚点,在适应过程中维持多模态流形的完整性。关键在于,与 LoRA ($\theta + \Delta\theta$) 等加法 PEFT 方法不同,后者可能会扰动整个参数流形,Splash 通过严格的结构隔离,将更新限制在休眠子空间内。这种稀疏替换机制确保预训练的 VL 推理路径根本不受影响,从而有效防止灾难性遗忘,且不会增加任何推理延迟。因此,该设计消除了单独对齐阶段的需求,简化了训练流程,显著降低了整体训练成本,并将触觉无缝整合到 MLLMs 的推理过程中。
第 7 页
唤醒触觉!掩码隔离的触觉对齐学习在多模态大语言模型中 7
4 实验
4.1 数据集
视觉-触觉-语言 (VTL)。对于 VTL 对齐学习,我们在基于 DIGIT 传感器的数据集 SSVTP [27] 和 TVL [21] 上训练 Splash。SSVTP 包含 4.5K 对齐的视觉-触觉对,而 TVL 包含 44K 对带有触觉属性自然语言描述的样本。我们使用官方的训练/测试划分,并将训练集进一步按 9:1 的比例划分为训练集/验证集。为了评估在分布偏移下的鲁棒性,我们还在 TacQuad [16] 的 DIGIT 传感器子集(72K 触觉样本)上进行了评估,该子集通过手持交互收集,以捕捉人类多样化的真实世界接触动力学。该数据集包含详细的语言描述,最初由 GPT-4o [26] 生成并经过人工修订。通过利用这一丰富标注的数据集,我们的评估实现了超越基于关键词评估的自然语言评估。
通用视觉-语言 (VL)。为了评估触觉适应后预训练 VL 能力的保持情况,我们在标准的视觉-语言基准上评估模型,包括用于专家级多学科推理的 MMMU [51]、用于视觉语境中复杂数学逻辑的 MathVista [38]、用于广泛感知和认知稳定性的 MME [20],以及用于双语语境评估的 MMBench [35]。这些基准评估了多样化的多模态推理和感知能力,使我们能够评估触觉适应是否保留了模型的预训练 VL 能力。
4.2 评估协议
遵循 TVL [21] 的评估协议,我们使用基于 LLM 的评估器(即 LLM-as-a-judge)在 SSVTP、TVL 和 TacQuad 上评估触觉语义生成。由于 TacQuad 由轨迹级触觉和视觉图像序列组成,并配有一个自由形式的文本描述,我们使用每个接触轨迹的中间帧作为代表性观察结果进行评估。具体而言,我们采用 GPT-4o [26] 作为纯文本裁判,对生成的触觉描述与真实触觉描述之间的语义相似性进行评分。评分范围为 1 到 10,分数越高表示语义对齐越好。该分数计算为所有样本的平均 GPT-4o 分数(完整评估提示见附录 B)。为了补充 GPT-4o 的语义评估并减少基于 LLM 评判可能带来的风格偏差,我们还报告了客观的触觉指标,包括基于关键词的 F1 分数和 Top-5 准确率。F1 是基于触觉关键词重叠计算的,而 Top-5 准确率衡量的是至少有一个预测的触觉属性与真实集合匹配的情况。
4.3 实现细节
为了验证 Splash,我们采用了两个高性能的开源 sMLLMs:Qwen2.5-VL 3B [3] 和 InternVL2.5-1B [7]。这些模型代表了当前的
第 8 页
8 Y. Park 和 M. Kim 等人
在紧凑多模态智能领域处于最先进水平,在复杂推理与部署效率之间提供了理想的平衡。为了最小化计算足迹,我们选择触觉编码器为 ViT-Tiny [13],使用 16 × 16 的 patch,并从 ImageNet 预训练 [12] 权重初始化。该编码器仅有 5.8M 参数。一个带有 LayerNorm 和 GELU 激活函数的两层 MLP 投影器将触觉特征映射到语言嵌入空间。自然图像和触觉接触图像均被调整为 224 × 224。遵循 Qwen2.5-VL 的公式化方法,触觉、视觉和文本 token 被连接成单个自回归序列。训练使用 AdamW 优化器 [37] 进行,权重衰减设置为 0.0。对于 Splash-3B,我们以 2 × 10−5 的初始学习率训练 1 个 epoch,采用余弦衰减调度,预热比例为 0.05。对于 Splash-1B,我们使用相同的优化设置训练 2 个 epoch。所有实验均在两块 NVIDIA RTX PRO 6000 Blackwell GPU 上进行。对于掩码引导微调,稀疏率设置为 s = 60%。对于 LoRA [24] 微调,我们使用秩 r = 8 且 α = 16。在推理过程中,我们使用以下指令:“列出图像中所示物体的 2-3 个触觉属性。仅使用单字描述符。输出一个逗号分隔的列表,不要包含其他文本。”以生成触觉描述。
4.4 基线方法
我们将 Splash 与现有的扩展 LLM 的 VTL 方法进行比较,包括 TVL-LLaMA [21] 和 UniTouch (Touch-LLM) [46]。这两种方法均使用 7B 参数的 LLaMA 模型作为骨干网络,其中 UniTouch 使用 LLaMA [43],TVL-LLaMA 使用 LLaMA-2 [44],并使用 OpenCLIP [10] 初始化视觉和触觉编码器。在多种触觉编码器规模(例如 Tiny、Small、Base)中,我们遵循 ViT-Tiny 设置。UniTouch 在其原始设计中采用更大的 ViT-L/14 编码器,我们在实验中遵循此默认配置。这两种方法 [21, 46] 都将触觉特征与语言模型对齐,并使用 LoRA [24] 适应 LLM。相比之下,我们的 Splash 采用现代视觉-语言模型(VLMs),包括 Qwen2.5-VL-3B 和 InternVL2.5-1B,作为骨干网络。由于 LLaMA-7B 是纯语言骨干网络,它需要额外的视觉指令微调才能执行零样本多模态任务。因此,为了确保严格且公平的比较,我们使用 Splash 中采用的相同 Qwen2.5-VL-3B 骨干网络建立了一个 TVL 风格的 LoRA 基线。这种比较在相同的初始化和训练条件下隔离了适应策略(LoRA 与掩码引导微调)的影响。我们进一步与 (IA)3 [33] 进行比较,以评估一种不同的 PEFT 范式,该范式引入学习到的缩放向量而不是加法权重更新。
4.5 VTL 任务上的性能比较
表 1 比较了三个基准测试上 VTL 任务的性能。我们包含了未经触觉适应的预训练 VLM 的零样本性能作为基线。在没有触觉对齐的情况下,零样本 InternVL-1B 和 Qwen2.5-VL-3B
第 9 页
唤醒触觉!MLLMs中的掩码隔离触觉对齐学习 9
表 1:使用 LLM 裁判在 10 分制上记录分数,在三个 VTL 基准测试(包括 SSVTP [27]、TVL [21] 和 TacQuad [16])上的整体性能比较。最高分加粗,次高分下划线。
方法 骨干网络 SSVTP TVL TacQuad 平均
零样本 InternVL2.5-1B 3.61 3.54 3.45 3.53 零样本 Qwen2.5-VL-3B 3.74 3.40 3.57 3.57
UniTouch [46] LLaMA1-7B 3.73 4.04 3.44 3.74 TVL [21] LLaMA2-7B 5.27 4.38 3.29 4.31 TVL [21] Qwen2.5-VL-3B 4.98 4.29 4.22 4.50 TVL-(IA)3 [21,33] Qwen2.5-VL-3B 5.17 4.26 3.84 4.42 Splash-1B InternVL2.5-1B 5.69 4.34 5.02 5.01 Splash-3B Qwen2.5-VL-3B 5.48 4.39 4.86 4.91
这些模型的平均得分仅为 3.53 和 3.57,表明其在推理触觉属性方面的能力有限。令人惊讶的是,Splash-1B 和 Splash-3B 显著优于 UniTouch,后者使用了更大的 LLaMA1-7B 骨干网络,但平均得分仅为 3.74。这突显了所提出的掩码隔离适配方法即使在较小的 MLLMs 中也具有有效性。
在相同的 Qwen2.5-VL-3B 骨干网络下,Splash-3B 在所有使用相同骨干网络的方法中实现了最佳的触觉-语义性能,平均得分为 4.91。相比之下,最强的基线方法 TVL [21] 在 Qwen2.5-VL-3B 上采用基于 LoRA 的适配,平均得分为 4.50。特别是,Splash-3B 在 SSVTP 上得分为 5.48(对比 TVL 的 4.98),在 TacQuad 上得分为 4.86(对比 TVL 的 4.22),这表明其在视觉-触觉对齐以及应对触觉分布偏移时的鲁棒性方面表现强劲。虽然 (IA)3 在相对较小的 VTL 数据集如 SSVTP 和 TVL 上表现出具有竞争力的性能,但在未见过的 TacQuad 数据集上性能大幅下降,得分仅为 3.84(对比 Splash 的 4.86)。这表明 (IA)3 缺乏泛化到真实世界触觉动态所需的表征能力。
为了验证我们方法的有效性不仅限于特定规模,我们进一步使用较小的 InternVL-1B 骨干网络部署 Splash。尽管
第 10 页
10 Y. Park and M. Kim et al.
表 2:在五个视觉-语言(VL)基准测试上的整体性能比较,包括 MMMU-val [51]、MathVista [38]、MMEsum [20]、MMBench-EN [35] 和 MMBench-CN [35]。 最高分加粗显示,次高分下划线标示。
方法 骨干网络 MMMUval MathVista MMEsum MMBench-EN MMBench-CN
零样本 InternVL2.5-1B 40.9 43.2 1950 70.7 66.3 零样本 Qwen2.5-VL-3B 53.1 62.3 2157 79.1 78.1
UniTouch [46] LLaMA1-7B 26.6 9.0 27 8.5 8.6 TVL [21] LLaMA2-7B 26.0 11.6 582 8.6 5.5 TVL [21] Qwen2.5-VL-3B 50.0 52.8 2168 76.8 76.5 TVL-(IA)3 [21,33] Qwen2.5-VL-3B 51.3 63.0 2216 78.4 78.9 Splash-1B InternVL2.5-1B 37.3 41.0 1786 70.2 60.4 Splash-3B Qwen2.5-VL-3B 55.3 65.3 2155 78.0 76.9
凭借其显著更小的参数量,Splash-1B 实现了具有竞争力的触觉语义性能,平均得分为 5.01。这些结果表明,即使对于紧凑的 VLM 骨干网络,所提出的掩码引导适配方法仍然有效。 除了基于 LLM 的评估外,我们还使用客观指标对触觉属性预测进行了定量评估。如图 3 所示,Splash 在 F1 分数和 Top-5 准确率方面均持续优于现有基线,表明其生成了更精确的触觉属性,并在多样化的触觉词汇库中表现出更强的鲁棒性。
4.6 VL 能力保持的性能比较
表 2 评估了在标准 VL 基准测试上经过触觉适配后的 VL 能力保留情况。Splash-3B 在所有 VL 基准测试中均持续优于 TVL 基线。具体而言,Splash 将 MMMUval 从 50.0 提升至 55.3,将 MathVista 从 52.8 提升至 65.3,并在 MMEsum 上保持了相当的性能。此外,与 TVL 相比,Splash 在 MMBench-EN 和 MMBench-CN 上均取得了更高的分数。与依赖更大规模 LLaMA-7B 骨干网络的 UniTouch [46] 相比,Splash 在所有基准测试上均实现了显著更强的 VL 推理性能。 我们注意到,TVL-(IA)3 [21, 33] 在三个基准测试(即 MMEsum、MMBench-EN 和 MMBench-CN)上取得了最高分,因为其基于缩放的适配仅对预训练权重进行了最小程度的扰动。然而,这种明显的优势是以牺牲触觉学习为代价的:如表 1 所示,TVL-(IA)3 在 TacQuad 上未能泛化(Splash-3B 为 4.86,而 TVL-(IA)3 仅为 3.84),这表明其有限的可塑性仅通过欠拟合触觉模态来保留 VL 能力。相比之下,Splash 在 MMMUval 和 MathVista 上取得了最佳分数,并在其余基准测试上保持竞争力,证明了掩码引导的隔离机制独特地平衡了触觉获取与 VL 保留——而不是以牺牲一方为代价换取另一方。值得注意的是,Splash 的性能与零样本 Qwen2.5-VL-3B 基线相当,后者在 MMMUval 上得分为 53.1,在 MathVista 上得分为 62.3,这证实了触觉
第 11 页
唤醒触觉!在 MLLM 中通过掩码隔离进行触觉对齐学习 11
表 3:Splash-3B 中稀疏率的影响。最佳分数加粗,次佳分数下划线。基于结果,我们将 60% 确立为基准稀疏率 (s=0.6)。
视觉-触觉-语言 视觉-语言 稀疏率 SSVTP TVL TacQuad 平均 MMMUval MathVista MMEsum MMBench-EN MMBench-CN
100% 5.02 4.36 4.81 4.73 22.0 38.4 982 10.4 28.3 80% 5.37 4.33 4.85 4.85 52.6 57.9 2070 56.0 69.5 60% 5.48 4.39 4.86 4.91 55.3 65.3 2155 78.0 76.9 50% 5.10 4.32 4.74 4.72 54.0 65.8 2167 78.3 77.7 40% 5.60 4.36 4.74 4.90 52.6 65.7 2204 78.6 78.6 30% 5.30 4.27 4.79 4.79 52.0 65.4 2210 78.0 78.8
适配过程并未降低预训练的视觉-语言 (VL) 能力。我们假设,选择性更新 VL-休眠子空间起到了一种剪枝诱导的正则化作用,从而在触觉适配期间稳定了预训练的推理流形 [15]。
4.7 消融研究
稀疏率。表 3 展示了用于掩码引导适配的稀疏率的消融研究,及其对 VTL 和 VL 性能的影响。我们观察到,适度的稀疏水平在触觉语义性能和 VL 能力保留之间提供了最佳权衡。具体而言,60% 的稀疏率实现了最高的触觉语义平均分 4.91,同时在 MMMUval 上获得了最佳的 VL 推理性能,并在 MathVista 和 MMBench 基准上取得了具有竞争力的结果。当稀疏率变得过大(例如 100%)时,过度的参数更新严重降低了 VL 推理性能,表明出现了预训练知识的灾难性遗忘。相反,当稀疏率变得过小(例如 30%)时,过度的参数冻结略微限制了触觉适配,导致触觉语义性能下降,而 VL 能力在很大程度上得以保留。这些结果突出了分配适当休眠子空间的重要性,该子空间平衡了触觉学习能力与预训练 VL 能力的保留。关于 InternVL-1B 稀疏率的分析在附录 A.2 节中进一步报告。
校准数据。表 4 评估了用于为 Splash-3B 构建休眠子空间掩码的不同校准数据集的有效性。我们首先对校准样本数量进行消融。所提出的方法在 64、128 和 256 个样本 across 基准测试中保持高度稳定,仅显示出微小的变化。虽然所有配置都取得了具有竞争力的性能,但我们选择 128 个样本作为默认设置,因为它在 VL 推理性能、稳定性和校准效率之间提供了最佳平衡。此外,使用 CC3M 或 TVL 作为校准数据集在 VTL 和 VL 基准测试上均产生了相当的性能(表 4(b))。VTL 平均分仅从 4.91 略微变化至 4.75,而 VL 基准测试结果在很大程度上保持稳定。
第 12 页
12 Y. Park and M. Kim et al.
表 4:在 Splash-3B 上针对校准数据选择、配置和样本量的性能评估。Splash 在不同设置下表现出稳健的性能,即使使用未配对的噪声数据也保持极具竞争力的表现,这表明它捕捉到了内在的架构冗余,而非过拟合到特定的语义对齐。
视觉-触觉-语言 视觉-语言 校准设置 SSVTP TVL TacQuad 平均 MMMUval MathVista MMEsum MMBench-EN MMBench-CN
(a) 样本量(数据 = CC3M 配对)
64 配对 5.15 4.30 4.87 4.77 56.0 64.9 2168 77.7 77.4 128 配对( ours) 5.48 4.39 4.86 4.91 55.3 65.3 2155 78.0 76.9 256 配对 5.28 4.35 4.86 4.83 56.0 65.6 2146 77.7 77.2
(b) 数据选择与配置(样本量 = 128)
CC3M 配对( ours) 5.48 4.39 4.86 4.91 55.3 65.3 2155 78.0 76.9 TVL 配对 4.98 4.35 4.93 4.75 58.0 62.9 2156 76.5 76.8 未配对(噪声) 5.45 4.31 4.89 4.88 55.3 64.9 2166 77.7 77.4
表 5:使用 TVL 中采用的相同触觉前端初始化进行的比较。
视觉-触觉-语言 视觉-语言 方法 SSVTP TVL TacQuad 平均 MMMUval MathVista MMEsum MMBench-EN MMBench-CN
TVL(Qwen2.5-VL-3B) 4.98 4.29 4.22 4.50 50.0 52.8 2168 76.8 76.5 Splash-3B 5.10 4.35 4.88 4.78 56.0 65.3 2195 78.7 76.7
这些观察结果表明,所提出的视觉相对重要性度量对校准语料库的选择具有鲁棒性。最令人惊讶的是,我们进一步评估了一种极端设置,即缺乏视觉-语言语义校准数据(即使用未配对的随机噪声图像和语义无意义的虚拟文本提示)。表 4(b) 中“未配对”设置下的性能显示,这种无需校准的变体仍然取得了极具竞争力的表现。因此,Splash 成功捕捉到了现代 MLLM 的内在架构冗余,而不仅仅是过拟合到特定数据集的激活模式。 触觉前端初始化。为了隔离触觉前端初始化的影响,我们使用 TVL 中采用的相同触觉预训练编码器初始化,对 Splash-3B 和 TVL 进行了额外比较。在表 5 中,Splash 在 VTL 和 VL 基准测试中均持续优于 TVL,表明性能提升主要源于所提出的掩码引导适应策略,而非前端初始化本身。
4.8 定性结果
图 4 和图 5 展示了 VTL 基准测试(包括 TVL、SSVTP 和 TacQuad)的定性比较。给定配对的 RGB 和触觉接触图像,模型被要求生成触觉属性描述。在所有基准测试中,Splash 生成的描述与真实情况(ground-truth)紧密匹配
第 13 页
唤醒触觉!在MLLMs中掩码隔离的触觉对齐学习 13
自然图像 𝑋! 接触图像 𝑋" 预测 UniTouch “1. 圆形 2. 有纹理的。” 3/10
TVL-LLaMA “光滑,反光,坚硬,抛光,有光泽。” 2/10
SPLASH 1B “有纹理的,不平整的,粗糙的,坚固的,颗粒状的。” 7/10
SPLASH 3B “颗粒状的,粗糙的,有纹理的,不平整的,有颗粒感的。” 8/10
GT:不平整的,粗糙的
自然图像 𝑋! 接触图像 𝑋" 预测 UniTouch “1. 圆形的 2. 有纹理的。” 3/10
TVL-LLaMA “有纹理的,坚固的,刚性的,颗粒状的。” 3/10
SPLASH 1B “颗粒状的,水平的,固体的,刚性的,抛光的。” 5/10
SPLASH 3B “颗粒状的,固体的,抛光的,坚硬的,光滑的。” 7/10
GT:光滑的,固体的,坚硬的
(a) TVL
自然图像 𝑋𝑅 接触图像 𝑋𝑐 预测
UniTouch “1. 有纹理的 2. 乡村风格的。” 3/10
TVL-LLaMA “金属的,有图案的,刚性的。” 3/10
SPLASH 1B “坚硬的,平坦的,光滑的,斑驳的。” 10/10
SPLASH 3B “坚硬的,金属的,光滑的。” 6/10
GT:坚硬的,平坦的,斑驳的,光滑的
自然图像 𝑋𝑅 接触图像 𝑋𝑐 预测
UniTouch “1. 有纹理的 2. 乡村风格的。” 3/10
TVL-LLaMA “有线条的,平坦的。” 3/10
SPLASH 1B “有线条的,有弹性的。” 7/10
SPLASH 3B “有线条的,织物。” 7/10
GT:织物,有线条的,有弹性的
(b) SSVTP
图 4:在 TVL [21] 和 SSVTP [27] 上的定性比较。Splash 展示了比 TVL-LLaMA7B [21] 和 UniTouch [46] 更高的准确率分数,具有更强的鲁棒性。特别是在 SSVTP 的示例中,Splash-1B 即使在 1B 参数规模下也取得了最佳分数。
第 14 页
14 Y. Park and M. Kim et al.
自然图像 $X_n$ 接触图像 $X_c$ 预测 UniTouch “1. 圆形 2. 光滑 3. 有光泽。” 4/10
TVL-LLaMA “哑光,有纹理,刚性。” 2/10
SPLASH 1B “光滑,反光,坚硬,凉爽,有光泽。” 8/10
SPLASH 3B “光滑,反光,坚硬,凉爽,平坦。” 7/10
GT:触觉传感器正在触摸一个白色塑料碗的小把手。接触点光滑、有光泽、坚硬且刚性,温度凉爽,粗糙度极低。材料感觉坚硬且光滑,没有明显的纹理或柔软度变化,表明其具有高硬度,这通常与塑料相关。
自然图像 $X_n$ 接触图像 $X_c$ 预测 UniTouch “1. 圆形 2. 光滑 3. 有光泽。” 3/10
TVL-LLaMA “光滑,平坦,刚性。” 3/10
SPLASH 1B “光滑,坚硬,凉爽,有光泽,平坦。” 8/10
SPLASH 3B “光滑,反光,坚硬,凉爽,有光泽。” 8/10
GT:触觉传感器触摸金属盒盖的右上角。接触点具有坚硬、光滑的金属材质,表面经过抛光处理,无粗糙感。金属表面散发冷感,提供金属典型的高硬度,触摸时无任何柔韧性或凹陷。
图 5:在 TacQuad [16] 上的定性比较。Splash-1B 和 Splash-3B 生成的预测比基线模型更多样化,并通过 LLM 裁判获得了更高的准确率分数。
触觉属性。TVL-LLaMA 和 UniTouch 经常生成视觉上合理但在触觉上不一致的属性(例如,对于粗糙表面预测为光滑或反光),或与潜在触觉属性无关的通用属性。这些不匹配导致在 GPT-4o 评估中语义相似度得分较低,而我们的模型在示例中始终获得更高的得分。总体而言,结果表明,当触觉接地较弱时,基线模型更依赖于视觉外观线索,而 Splash 更有效地整合触觉观察以推断物理上一致的表面属性。更多定性示例见附录 A.8 节。
4.9 局限性与未来工作 尽管 Splash 展示了强大的非破坏性触觉适应能力,但在离线步骤分割参数后,关键子空间是静态的。然而,在实际的机器人操作场景中,激活模式可能会根据交互状态、接触条件或任务进展而动态变化。因此,静态的休眠子空间可能无法完全捕捉长视距视觉-触觉推理过程中随时间变化的参数利用情况。未来的工作将探索动态自适应掩码策略,根据任务相关的激活统计信息在训练过程中更新休眠参数的分配。
第 15 页
身体交互。此外,我们目前的实验仅聚焦于单个 DIGIT 触觉传感器设置,跨传感器泛化仍是未来研究的重要方向。尽管如此,由于 Splash 采用前端无关(frontend-agnostic)的方式设计,它可以自然地扩展以整合替代的触觉编码器。
5 结论
我们提出了 Splash,一种新颖的掩码隔离触觉对齐框架,旨在不引发灾难性遗忘的情况下扩展小型多模态大语言模型(sMLLMs)的感知能力。Splash 通过视觉相对重要性指标识别并隔离休眠子空间。在训练过程中,仅休眠子空间与触觉前端同时更新,而负责基础视觉-语言(VL)推理的关键子空间参数则保持固定。在多样化的视觉-触觉-语言(VTL)和 VL 基准测试上的大量实验表明,Splash 有效地“唤醒”了未充分利用的参数以内化复杂的接触动力学,在实现最先进的触觉推理能力的同时,完全保留了通用能力。凭借其统一的单阶段训练和零额外推理成本,我们相信 Splash 为资源受限的边缘机器人实现高级触觉智能提供了一条切实可行的路径。
致谢
本研究得到了韩国国家研究基金会(NRF)资助的韩国政府(MSIT)项目(RS-2025-16065706)的支持。
参考文献
1. Alayrac, J.B., Donahue, J., Luc, P., Miech, A., Barr, I., Hasson, Y., Lenc, K., Mensch, A., Millican, K., Reynolds, M., et al.: Flamingo: a visual language model for few-shot learning. In: NeurIPS (2022) 2. Bai, J., Bai, S., Yang, S., Wang, S., Tan, S., Wang, P., Lin, J., Zhou, C., Zhou, J.: Qwen-VL: A versatile vision-language model for understanding, localization, text reading, and beyond. arXiv preprint arXiv:2308.12966 (2023) 3. Bai, S., Chen, K., Liu, X., Wang, J., Ge, W., Song, S., Dang, K., Wang, P., Wang, S., Tang, J., Zhong, H., Zhu, Y., Yang, M., Li, Z., Wan, J., Wang, P., Ding, W., Fu, Z., Xu, Y., Ye, J., Zhang, X., Xie, T., Cheng, Z., Zhang, H., Yang, Z., Xu, H., Lin, J.: Qwen2.5-VL technical report. arXiv preprint arXiv:2502.13923 (2025) 4. Calandra, R., Owens, A., Jayaraman, D., Lin, J., Yuan, W., Malik, J., Adelson, E.H., Levine, S.: More Than a Feeling: Learning to grasp and regrasp using vision and touch. IEEE RAL (2018) 5. Changpinyo, S., Sharma, P., Ding, N., Soricut, R.: Conceptual 12M: Pushing web- scale image-text pre-training to recognize long-tail visual concepts. In: CVPR (2021)
第 16 页
16 Y. Park 和 M. Kim 等人
6. Chelly, E., Cherubini, A., Fraisse, P., Ben Amar, F., Khoramshahi, M.: 基于触觉的力估计用于机器人手指的交互控制。arXiv 预印本 arXiv:2411.13335 (2025) 7. Chen, Z., Wang, W., Cao, Y., Liu, Y., Gao, Z., Cui, E., Zhu, J., Ye, S., Tian, H., Liu, Z., 等:通过模型、数据和测试时扩展扩展开源多模态模型的性能边界。arXiv 预印本 arXiv:2412.05271 (2024) 8. Chen, Z., Wu, J., Wang, W., Su, W., Chen, G., Xing, S., Zhong, M., Zhang, Q., Zhu, X., Lu, L., 等:InternVL:扩展视觉基础模型并使其适用于通用视觉-语言任务。在:CVPR (2024) 9. Cheng, N., Guan, C., Gao, J., Wang, W., Li, Y., Meng, F., Zhou, J., Fang, B., Xu, J., Han, W.: Touch100k:一个用于以触觉为中心的多模态表示的大规模触觉-语言-视觉数据集。信息融合 (2025) 10. Cherti, M., Beaumont, R., Wightman, R., Wortsman, M., Ilharco, G., Gordon, C., Schuhmann, C., Schmidt, L., Jitsev, J.: 对比式语言-图像学习的可复现缩放定律。在:CVPR (2023) 11. Chu, X., Qiao, L., Zhang, X., Xu, S., Wei, F., Yang, Y., Sun, X., Hu, Y., Lin, X., Zhang, B., 等:MobileVLM V2:更快且更强的视觉语言模型基线。arXiv 预印本 arXiv:2402.03766 (2024) 12. Deng, J., Dong, W., Socher, R., Li, L.J., Li, K., Fei-Fei, L.: ImageNet:大规模分层图像数据库。在:CVPR (2009) 13. Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., Houlsby, N.: 一张图片抵得上 16×16 个单词:用于大规模图像识别的 Transformer。在: ICLR (2021) 14. Driess, D., Xia, F., Sajjadi, M.S., Lynch, C., Chowdhery, A., Ichter, B., Wahid, A., Tompson, J., Vuong, Q., Yu, T., 等:PaLM-E:具身多模态语言模型。在:ICML (2023) 15. Evci, U., Gale, T., Menick, J., Castro, P.S., Elsen, E.: 操纵彩票:让所有彩票都成为赢家。在:ICML。PMLR (2020) 16. Feng, R., Hu, J., Xia, W., Gao, T., Shen, A., Sun, Y., Fang, B., Hu, D.: Any- Touch:跨多种视觉-触觉传感器学习统一的静态-动态表示。在:ICLR (2025) 17. Feng, R., Zhou, Y., Mei, S., Zhou, D., Wang, P., Cui, S., Fang, B., Yao, G., Hu, D.: AnyTouch 2:用于动态触觉感知的通用光学触觉表示学习。在:ICLR (2026) 18. Frankle, J., Carbin, M.: 彩票假设:寻找稀疏、可训练的神经网络。在:ICLR (2019) 19. Frantar, E., Alistarh, D.: SparseGPT:大规模语言模型可以一次性准确剪枝。在:ICML (2023) 20. Fu, C., Chen, P., Shen, Y., Qin, Y., Zhang, M., Lin, X., Yang, J., Zheng, X., Li, K., Sun, X., 等:MME:多模态大语言模型的综合评估基准。arXiv 预印本 arXiv:2306.13394 (2023) 21. Fu, L., Datta, G., Huang, H., Panitch, W.C.H., Drake, J., Ortiz, J., Mukadam, M., Lambeta, M., Calandra, R., Goldberg, K.: 用于多模态对齐的触觉、视觉和语言数据集。在:ICML (2024) 22. Gromov, A., Tirumala, K., Shapourian, H., Glorioso, P., Roberts, D.A.: 更深层的不合理无效性。在:ICLR (2025) 23. Heng, L., Geng, H., Zhang, K., Abbeel, P., Malik, J.: ViTacFormer:学习视觉-触觉灵巧操作的跨模态表示。arXiv 预印本 arXiv:2506.15953 (2025)
第 17 页
唤醒触觉!掩码隔离的触觉对齐学习在多模态大语言模型中 17
24. Hu, E.J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., Chen, W., 等:LoRA:大语言模型的低秩自适应。发表于:ICLR (2022) 25. Huang, W., Cheng, A., Wang, Y.:通过遗忘感知剪枝缓解大语言模型中的灾难性遗忘。发表于:EMNLP (2025) 26. Hurst, A., Lerer, A., Goucher, A.P., Perelman, A., Ramesh, A., Clark, A., Os- trow, A., Welihinda, A., Hayes, A., Radford, A., 等:Gpt-4o 系统卡片。arXiv 预印本 arXiv:2410.21276 (2024) 27. Kerr, J., Huang, H., Wilcox, A., Hoque, R., Ichnowski, J., Calandra, R., Goldberg, K.:自监督视觉-触觉预训练以定位和跟随服装特征。arXiv 预印本 arXiv:2209.13042 (2022) 28. Khaki, S., Li, X., Guo, J., Zhu, L., Plataniotis, K.N., Yazdanbakhsh, A., Keutzer, K., Han, S., Liu, Z.:SparseLoRA:利用上下文稀疏性加速 LLM 微调。发表于:ICML (2025) 29. Kirkpatrick, J., Pascanu, R., Rabinowitz, N., Veness, J., Desjardins, G., Rusu, A.A., Milan, K., Quan, J., Ramalho, T., Grabska-Barwinska, A., 等:克服神经网络中的灾难性遗忘。Proc. Natl. Acad. Sci. USA (2017) 30. Lei, W., Ge, Y., Yi, K., Zhang, J., Gao, D., Sun, D., Ge, Y., Shan, Y., Shou, M.Z.: ViT-Lens:迈向全模态表示。发表于:CVPR (2024) 31. Li, J., Li, D., Savarese, S., Hoi, S.:BLIP-2:通过冻结图像编码器和大型语言模型引导语言-图像预训练。发表于:ICML (2023) 32. Li, Z., Hoiem, D.:无遗忘学习。IEEE TPAMI (2017) 33. Liu, H., Tam, D., Muqeeth, M., Mohta, J., Huang, T., Bansal, M., Raffel, C.A.: 少样本参数高效微调优于上下文学习且成本更低。发表于:NeurIPS (2022) 34. Liu, H., Li, C., Wu, Q., Lee, Y.J.:视觉指令微调。发表于:CVPR (2023) 35. Liu, Y., Duan, H., Zhang, Y., Li, B., Zhang, S., Zhao, W., Yuan, Y., Wang, J., He, C., Liu, Z., 等:MMBench:你的多模态模型是全才吗?发表于: ECCV (2024) 36. Lloyd, J., Lin, Y., Lepora, N.F.:概率判别模型解决触觉感知别名问题。发表于:Robotics: Science and Systems (RSS) (2021) 37. Loshchilov, I., Hutter, F.:解耦权重衰减正则化。arXiv 预印本 arXiv:1711.05101 (2017) 38. Lu, P., Bansal, H., Xia, T., Liu, J., Li, C., Hajishirzi, H., Cheng, H., Chang, K.W., Galley, M., Gao, J.:MathVista:评估基础模型在视觉语境下的数学推理能力。发表于:ICLR (2024) 39. Ma, X., Fang, G., Wang, X.:LLM-Pruner:关于大语言模型的结构化剪枝。发表于:NeurIPS (2023) 40. Mallya, A., Lazebnik, S.:PackNet:通过迭代剪枝将多个任务添加到单个网络中。发表于:CVPR (2018) 41. McCloskey, M., Cohen, N.J.:连接主义网络中的灾难性干扰:序列学习问题。发表于:Psychology of learning and motivation. Else- vier (1989) 42. Sun, M., Liu, Z., Bair, A., Kolter, J.Z.:一种简单有效的用于大语言模型的剪枝方法。发表于:ICLR (2024) 43. Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.A., Lacroix, T., Rozière, B., Goyal, N., Hambro, E., Azhar, F., 等:LLaMA:开放且高效的基础语言模型。arXiv 预印本 arXiv:2302.13971 (2023) 44. Touvron, H., Martin, L., Stone, K., Albert, P., Almahairi, A., Babaei, Y., Bash- lykov, N., Batra, S., Bhargava, P., Bhosale, S., 等:Llama 2:开放基础 和微调聊天模型。arXiv 预印本 arXiv:2307.09288 (2023)
第 18 页
18 Y. Park 和 M. Kim 等人
45. Williams, J., Gupta, K.D., George, R., Sarkar, M.: Lite VLA: 在 CPU 受限的边缘机器人上进行高效的视觉-语言-动作控制。arXiv 预印本 arXiv:2511.05642 (2025) 46. Yang, F., Feng, C., Chen, Z., Park, H., Wang, D., Dou, Y., Zeng, Z., Chen, X., Gangopadhyay, R., Owens, A., Wong, A.: 将触觉绑定到一切:学习统一的 multimodal 触觉表示。在:CVPR (2024) 47. Yang, F., Ma, C., Zhang, J., Zhu, J., Yuan, W., Owens, A.: Touch and Go: 从人类收集的视觉和触觉中学习。在:NeurIPS (2022) 48. Yin, L., Wu, Y., Zhang, Z., Hsieh, C.Y., Wang, Y., Jia, Y., Li, G., Jaiswal, A., Pechenizkiy, M., Liang, Y., 等:异常值加权逐层稀疏性 (OWL):将 LLM 剪枝至高稀疏率的缺失秘密配方。在:ICML (2024) 49. Yuan, W., Dong, S., Adelson, E.H.: GelSight:用于估计几何形状和力的高分辨率机器人触觉传感器。Sensors (2017) 50. Yuan, W., Wang, S., Dong, S., Adelson, E.: 连接看与感:关联物理材料的视觉和触觉属性。在:CVPR (2017) 51. Yue, X., Ni, Y., Zhang, K., Zheng, T., Liu, R., Zhang, G., Stevens, S., Jiang, D., Ren, W., Sun, Y., 等:MMMU:面向专家级 AGI 的大规模多学科多模态理解和推理基准。在:CVPR (2024) 52. Zhai, Y., Tong, S., Li, X., Cai, M., Qu, Q., Lee, Y.J., Ma, Y.: 探究多模态大语言模型中的灾难性遗忘 (2023) 53. Zhu, D., Chen, J., Shen, X., Li, X., Elhoseiny, M.: MiniGPT-4:通过先进的大语言模型增强视觉-语言理解。arXiv 预印本 arXiv:2304.10592 (2023) 54. Zitkovich, B., Yu, T., Xu, S., Xu, P., Xiao, T., Xia, F., Wu, J., Wohlhart, P., Welker, S., Wahid, A., 等:RT-2:视觉-语言-动作模型将网络知识迁移至机器人控制。在:CoRL (2023)
第 19 页
唤醒触觉!MLLMs 中掩码隔离的触觉对齐学习 19
附录
A 补充讨论
A.1 视觉遗忘问题
我们的动机源于灾难性遗忘问题,特别是在视觉领域。为了说明这一问题,我们在图 A1 中提供了额外的定性示例。尽管原始的 Qwen2.5-VL 能够正确识别视觉对象和场景,但之前的触觉对齐模型(即 TVL)经常产生不准确或幻觉化的属性描述,这些描述缺乏视觉输入的支持。
语言提示 A. Qwen2.5-VL-3B “描述图像。” “图像显示了一只手拿着一个小透明塑料容器,带有盖子。该容器似乎由透明 材料制成,其表面有图案设计。背景是一个纯白色的 视觉 表面,可能是桌子或书桌。拿着容器的手位于 多模态大语言模型 这样的位置” 得分:8/10 B. Qwen2.5-VL-3B + 无掩码引导对齐的触觉分支 “图像显示了一个透明的塑料杯,略带纹理,边缘有棱纹。杯子 似乎稍微过满,有些液体溢出。塑料很薄, 柔韧且略微可弯曲。” 得分:5/10
语言提示 A. Qwen2.5-VL-3B “描述图像。” “图像显示了两只手正在与一个 小型木制物体互动,该物体看起来像一个木杯或容器。杯子被 视觉 一只手拿着,而另一只手正在触摸一个带有 红灯的小型矩形设备。该设备连接着一根黑色电缆。该…” 得分:9/10 多模态大语言模型 B. Qwen2.5-VL-3B + 无掩码引导对齐的触觉分支 “图像显示了一个木制物体,可能是一把木勺或 类似的餐具,被一个人的手拿着。木制物体被按压 在一个发光的红灯上,这看起来是一个小型的、圆形的发光物体, 可能是一个 LED 灯。背景是一个纯白色的,” 得分:6/10
语言提示 A. Qwen2.5-VL-3B “描述图像。” “图像显示了一只手拿着一个小型黑色设备, 上面有一个红灯,该设备放置在一个放在白色 视觉 表面上的青苹果上。背景包括一面白墙,墙上有一个通风口,部分可见一些文本。” 得分:9/10 多模态大语言模型 B. Qwen2.5-VL-3B + 无掩码引导对齐的触觉分支 “图像显示了一只手拿着一个发光的半透明物体,位于一个青苹果上方。 发光物体似乎正在发出光,可能来自光源或一个 设备。背景包括一个白色表面和一个金属结构,可能 是门或墙壁的一部分。图像中的光线明亮,…” 得分:6/10
图 A1:MLLMs 触觉对齐中灾难性遗忘问题的更多示例。
第 20 页
20 Y. Park and M. Kim et al.
表 A1:稀疏率对 Splash-1B 的影响。最高分加粗,次高分下划线。
视觉-触觉-语言 视觉-语言 稀疏率 SSVTP TVL TacQuad Avg MMMUval MathVista MMEsum MMBench-EN MMBench-CN
InternVL2.5-1B 3.61 3.54 3.45 3.53 40.9 43.2 1950.5 70.7 66.3
100% 5.89 4.30 5.07 5.09 1.3 19.0 48 2.1 4.4 80% 6.15 4.32 4.93 5.13 34.6 34.0 1474 62.3 55.0 60% 5.69 4.34 5.02 5.01 37.3 41.0 1786 70.2 60.4 50% 6.13 4.30 5.02 5.15 36.0 42.6 1782 69.8 61.6 40% 5.52 4.33 5.04 4.96 36.6 44.1 1839 71.2 62.7 30% 5.58 4.33 4.99 4.97 42.6 43.4 1930 70.8 63.4
A.2 SPLASH-1B 的稀疏性分析
我们进一步分析了稀疏性对 Splash-1B 的影响。如表 A1 所示,60% 的稀疏率为 Splash-1B 在 VTL 和 VL 性能之间提供了良好的平衡。Splash-1B 的 VL 性能在不同稀疏率水平之间变化更为显著,而 Splash-3B 的 VL 基准测试在 30% 到 60% 的稀疏率之间保持相对稳定。虽然 60% 的稀疏率与 Splash-3B 结合时能在 VTL 和 VL 性能之间提供良好的平衡,但将该相同的稀疏率应用于较小的 1B 主干网络会导致其 VL 性能略低于较低的稀疏率水平(30%-40%)。因此,1B 主干网络较小的容量使其对触觉适应期间掩码的比例更加敏感。
A.3 自适应稀疏分配
先前的研究表明,不同的 Transformer 层在权重剪枝过程中表现出不同程度的冗余性和敏感性 [48]。受此观察的启发,我们进一步探索了一种自适应稀疏分配策略,该策略在保持固定全局稀疏预算的同时优化逐层稀疏性。 具体而言,遵循 OWL [48] 框架,我们首先使用在小规模视觉-语言校准集上计算的激活-权重重要性统计信息来估计逐层异常值分布(LOD)。包含更多激活异常值的层被认为在保留预训练表示方面更为重要。因此,我们为具有较高 LOD 分数的层分配较低的稀疏率,而为具有较低 LOD 分数的层分配较高的稀疏率。为了避免 Transformer 块之间出现过度不平衡,逐层稀疏率被限制在以目标全局稀疏率为中心的有界范围内,然后进行全局重缩放以保留确切的整体稀疏预算。 图 A2 可视化了在 60% 全局稀疏设置下 Splash-3B 的逐层稀疏分布。表 A2 将自适应稀疏策略与默认的均匀稀疏分配进行了比较。虽然自适应稀疏策略带来了边际增益,但均匀稀疏在 VTL 指标和整体性能方面始终占优。因此,均匀稀疏确保了休眠子空间中触觉流的平衡。
第 21 页
为触觉唤醒!MLLMs 中掩码隔离的触觉对齐学习 21
图 A2:受 OWL 启发的在 60% 全局稀疏预算下的自适应稀疏分配。绿色条形图表示层外部分布(LOD),而橙色曲线表示分配给每个 Transformer 层的自适应稀疏率。
表 A2:在全局稀疏预算相同(s = 60%)的情况下,自适应稀疏分配策略与均匀稀疏分配策略的比较。
视觉-触觉-语言 视觉-语言 策略 SSVTP TVL TacQuad Avg MMMUval MathVista MMEsum MMBench-EN MMBench-CN
自适应 5.26 4.37 4.85 4.83 54.7 64.8 2160 77.3 77.1 均匀 5.48 4.39 4.86 4.91 55.3 65.3 2155 78.0 76.9
A.4 休眠子空间重要性得分
为了更好地理解 Splash 在触觉对齐过程中的内部机制,我们分析了原始预训练的 Qwen2.5-VL 3B 模型与我们提出的 Splash-3B(s = 60%)之间可训练休眠子空间(即 Mij = 1)内的参数变化。我们在 TVL 的一个子集上对这两个模型进行了评估。遵循我们的掩码策略,我们从中间 Transformer 块内的线性层中提取权重,排除第一个和最后一个块。我们在这些层中均匀采样了 1500 万个休眠参数。
我们将视觉相对重要性得分 Si,j = |Wi,j|·∥xj∥2 的变化分解为其两个构成因素:权重幅度的结构变化(|Wi,j|)和激活 ℓ2-范数(∥xj∥2)的响应性变化。图 A3 展示了这些组件的 ∆log10 分布。有趣的是,48.8% 的休眠权重表现出幅度的增加。相反,响应性变化(图 A3,中间)显示,对应激活中绝大多数(67.1%)在其 ℓ2-范数上表现出强烈的正向变化。这强烈表明,休眠通路变得高度敏感并明确响应新引入的触觉输入。因此,63.0% 的休眠权重显示出得分增加(图 A3,右侧)。这些发现从经验上验证了我们选择性可塑性的设计:Splash 通过沿选择性可训练的休眠通路动态放大输入驱动的激活,成功适应了新的模态。
A.5 冻结边界层
遵循先前的工作 [22],我们在视觉-触觉适应过程中冻结第一个和最后一个 Transformer 层,因为这些层已知特别敏感
第 22 页
22 Y. Park and M. Kim et al.
图 A3:可训练休眠子空间中的分解参数变化。图表展示了(左)权重幅度 $|W_{i,j}|$、(中)激活 $\ell_2$-范数 $\|x_j\|_2$ 以及(右)整体重要性得分 $S_{i,j}$ 的 $\Delta \log_{10}$ 分布(Splash 减去基线)。激活分布显著的右移证实了其在适应新引入的触觉模态中的主要作用。
表 A3:在 NVIDIA RTX PRO 6000 Blackwell 上使用固定 TVL 样本的部署成本对比。P99 延迟表示在稳态推理运行期间测量的第 99 百分位延迟。
模型 骨干网络 P99 延迟 (ms)↓ 控制频率 Hz↑
TVL LLaMA-7B 202.37 4.97 TVL, Splash Qwen2.5-VL-3B 134.55 7.50
分布偏移密切相关,并与保留预训练表示紧密相连。 经验上,我们观察到解冻边界层会使平均 VTL 得分降低 0.18 分,这表明更新这些层可能会对触觉适应与视觉-语言保留之间的平衡产生负面影响。 因此,我们在所有实验中保持边界层冻结,以实现稳定的适应。
A.6 推理成本
我们使用单个 NVIDIA RTX PRO 6000 Blackwell GPU,批量大小为 1,测量了所有方法在固定 TVL 样本上的端到端推理延迟。每个模型在相同的输入配置和提示下进行评估,生成最多 6 个输出 token。为了确保测量的稳定性,我们执行 50 次预热迭代,随后进行 200 次推理运行,其中前 50 次运行被丢弃以消除初始化开销的影响。对于基于 Qwen2.5-VL 的 TVL 基线,延迟是在将 LoRA 权重合并到骨干模型后测量的。 如表 A3 所示,TVL-Qwen2.5-VL 和 Splash 均实现了 134.55 ms 的 P99 延迟和 7.50 Hz 的控制频率。与基于 LLaMA-7B 的 TVL 基线(202.37 ms,4.97 Hz)相比,由于在推理过程中使用了更小的 Qwen2.5-VL-3B 骨干网络,这两种方法均表现出显著更低的延迟。 这些结果表明,触觉推理可以无缝集成
第 23 页
唤醒触觉!MLLMs 中掩码隔离的触觉对齐学习 23
失败案例 #1 自然图像 接触图像 预测
UniTouch “1. 有纹理的 2. 质朴的” 3/10
TVL-LLaMA “柔软,织物。” 8/10
SPLASH 1B “不平整,有图案。” 3/10
SPLASH 3B “坚硬,金属,光滑。” 1/10
真实标签 (GT): 柔软,有衬里,织物
失败案例 #2
自然图像 接触图像 预测
UniTouch “1. 光滑 2. 闪亮 3. 圆形” 2/10
TVL-LLaMA “坚硬,有纹理,光滑,凉爽。” 5/10
SPLASH 1B “光滑,坚硬,凉爽,有纹理,光泽。” 3/10
SPLASH 3B “光滑,反光,坚硬,凉爽,流线型。” 2/10
真实标签 (GT): 凹凸不平,有纹理,哑光
图 A4: 视觉-触觉感知中的定性失败案例。(顶部)在 SSVTP 上的材质误分类,其中柔软的织物表面被错误地预测为刚性金属材料。(底部)在 TVL 上的微纹理误读,其中凹凸不平的哑光表面被预测为光滑且有光泽。
在不牺牲推理效率的情况下将其压缩为紧凑的 VLM,使得 Splash 非常适合实时机器人感知循环。
A.7 失败案例分析
案例 1:触觉感知别名下的材质误分类。在图 A4 的顶部,第一个案例源自 SSVTP,我们提出的模型未能正确识别纺织材料的特性。我们认为,触觉感知别名 [36] 引入了固有的歧义,当织物表面在接触时变形极小时,产生的触觉印迹通常缺乏独特的结构模式,并在几何上与光滑刚性表面的印迹相似。因此,织物的重复线性纹理在视觉上类似于拉丝金属图案,导致 Splash-3B 生成如“金属”和“光滑”等刚性描述符,而 Splash-1B 的预测结果为“不平整,有图案”。
案例 2:微纹理误读与视觉主导。在图 A4 的底部,所有竞争模型(包括 Splash)都误解了底层表面的微几何结构。这一错误表明未能正确
第 24 页
24 Y. Park and M. Kim et al.
集成编码精细表面几何结构的触觉信号,这些信号可以通过高分辨率的触觉传感器(如具有微米级分辨率的 GelSight)有效捕捉 [49]。
A.8 更多定性结果
我们在图 A5、图 A6 和图 A7 中提供了 TacQuad、SSVTP 和 TVL 基准测试上的更多定性示例。这些示例进一步表明,与基线方法相比,我们提出的模型能够生成更多样化且细节更丰富的触觉描述。
B LLM 裁判提示词
遵循 TVL 的做法,我们使用 GPT-4o 作为 LLM judge(LLM作为裁判),在 VTL 基准测试上使用以下提示词来评估触觉描述。
VTL 基准测试评估提示词
[用户问题]: {prompt} [助手回复]: {assistant_response} [正确回复]: {correct_response} 我们希望征求您对 AI 助手针对上述用户问题表现的评价。用户通过观察图像提出问题。助手的回复后附有正确回复。 请根据助手回复与描述触觉感受的正确回复的匹配程度,评估助手的回复。请仅比较答案的语义。在评分时,请勿考虑语法错误。助手将获得 1 到 10 分的总体评分,分数越高表示整体表现越好。 请先输出一行,仅包含一个表示助手评分的数值。在随后的行中,请提供全面的评价解释,避免任何潜在偏见。
第 25 页
唤醒触觉!在 MLLM 中通过掩码隔离进行触觉对齐学习 25
自然图像 接触图像 预测
UniTouch “1. 有纹理 2. 粗糙 3. 球形” 2/10
TVL-LLaMA “光滑、平坦、刚性、坚固、哑光。” 4/10
SPLASH 1B “光滑、凉爽、坚硬。” 7/10
SPLASH 3B “哑光、坚固、光滑、坚硬。” 7/10
真实标签 (GT):触觉传感器正在触摸一个由白色塑料制成的光滑、坚硬的圆柱形管。接触点位于圆柱表面的中心。纹理光滑均匀,粗糙度低,硬度高,符合典型硬塑料的特征。
自然图像 接触图像 预测
UniTouch “1. 圆形 2. 有纹理” 3/10
TVL-LLaMA “哑光、有纹理、刚性、光滑。” 3/10
SPLASH 1B “有纹理、不平整、刚性、粗糙、坚固。” 7/10
SPLASH 3B “有纹理、粗糙、颗粒状、不平整、刚性。” 7/10
真实标签 (GT):触觉传感器触摸到有纹理、不规则图案的树皮表面。接触点具有粗糙、不平整的纹理,粗糙度水平高。硬度高,典型于木材。树皮具有坚固的脊状结构,触感刚性,整体感觉崎岖且极其坚固。
自然图像 接触图像 预测
UniTouch “1. 圆形 2. 光滑 3. 有光泽” 7/10
TVL-LLaMA “光滑、哑光、平坦。” 3/10
SPLASH 1B “光滑、有光泽、坚硬、凉爽、流线型。” 8/10
SPLASH 3B “光滑、反光、坚硬、凉爽、流线型。” 9/10
真实标签 (GT):触觉传感器触摸的对象是保温瓶的塑料盖;材料包括塑料,呈现出流线型、反光的纹理,粗糙度极小且硬度高。
自然图像 接触图像 预测
UniTouch “1. 圆形 2. 光滑 3. 有纹理” 4/10
TVL-LLaMA “光滑、哑光、柔软、柔韧、有纹理。” 3/10
SPLASH 1B “光滑、弯曲、坚硬、凉爽、反光。” 8/10
SPLASH 3B “光滑、反光、坚硬、凉爽、有光泽。” 8/10
真实标签 (GT):触觉传感器接触到一个光滑塑料盖的正中心。材料感觉坚固且有光泽,粗糙度低,硬度高。触摸区域具有圆形、滑溜的纹理,没有任何可察觉的形变,确保了坚实、不可屈服的表面。
图 A5:在 TacQuad 上的额外定性比较。每个示例展示了自然 RGB 图像 XR、触觉接触图像 XC,以及基线模型和我们模型的预测文本及其评估得分(满分 10 分)。
第 26 页
26 Y. Park 和 M. Kim 等
自然图像 接触图像 预测
UniTouch “1. 有纹理的 2. 质朴的。” 3/10
TVL-LLaMA “颗粒状,平坦的。” 3/10
SPLASH 1B “坚硬,斑驳,有光泽的。” 7/10
SPLASH 3B “坚硬,斑驳,有光泽的。” 7/10
真实标签 (GT): 坚硬,斑驳,平滑,平坦
自然图像 接触图像 预测
UniTouch “1. 有纹理的 2. 粗糙的 3. 厚实的” 6/10
TVL-LLaMA “平坦的,颗粒状的。” 3/10
SPLASH 1B “颗粒状的,织物。” 6/10
SPLASH 3B “织物,粗糙的。” 8/10
真实标签 (GT): 织物,粗糙,可变形
自然图像 接触图像 预测
UniTouch “1. 圆形的 2. 平滑的 3. 有纹理的” 3/10
TVL-LLaMA “坚硬,平坦,平滑,塑料的。” 5/10
SPLASH 1B “平坦的,坚硬的。” 7/10
SPLASH 3B “坚硬,平坦,平滑的。” 6/10
真实标签 (GT): 平坦,坚硬,不平整
自然图像 接触图像 预测
UniTouch “1. 粗糙的 2. 有纹理的” 2/10
TVL-LLaMA “有图案的,编织的,织物。” 2/10
SPLASH 1B “坚硬,平坦,斑驳,平滑的。” 8/10
SPLASH 3B “坚硬,斑驳,有光泽的。” 10/10
真实标签 (GT): 有光泽的,斑驳的,坚硬,平坦
图 A6: SSVTP 上的其他定性比较。
第 27 页
唤醒触觉!在 MLLM 中通过掩码隔离进行触觉对齐学习 27
自然图像 接触图像 预测
UniTouch “1. 有纹理 2. 粗糙 3. 有光泽” 2/10
TVL-LLaMA “坚硬、多孔、光滑、有光泽” 3/10
SPLASH 1B “光滑、平坦、坚硬、纸质、哑光。” 7/10
SPLASH 3B “光滑、平坦、坚硬、纸质、哑光。” 7/10
GT:光滑、平坦、哑光
自然图像 接触图像 预测
UniTouch “1. 圆形 2. 有纹理。” 3/10
TVL-LLaMA “有纹理、坚固、编织、灵活、编织状。” 3/10
SPLASH 1B “平坦、实心、坚硬、抛光。” 6/10
SPLASH 3B “凉爽、坚硬、实心、反光、光滑。” 6/10
GT:实心、有脊、坚硬、光滑
自然图像 接触图像 预测
UniTouch “1. 有纹理 2. 粗糙 3. 毛茸茸” 4/10
TVL-LLaMA “柔软、毛绒、有纹理、温暖、有垫感。” 6/10
SPLASH 1B “有纹理、柔软、毛绒、纤维状、不平整。” 7/10
SPLASH 3B “有纹理、柔软、毛绒、纤维状、有垫感。” 7/10
GT:纤维状、毛绒、布质、可弯曲
自然图像 接触图像 预测
UniTouch “1. 有纹理 2. 圆形 3. 光滑” 5/10
TVL-LLaMA “光滑、反光、滑溜、凉爽、有光泽。” 5/10
SPLASH 1B “光滑、反光、坚硬、弯曲、有光泽。” 6/10
SPLASH 3B “光滑、弯曲、有光泽、坚硬、反光。” 7/10
GT:光滑、坚硬
图 A7:TVL 上的其他定性比较。