视觉语言模型是脆弱的多语言关联器:跨语言概念绑定为何退化

快速导读:本文提出M2BIND基准,发现VLM的实体-属性概念绑定在多语言(尤其跨语系、跨文字)场景下显著退化,且准确率无法反映绑定保真度的下降。

视觉语言模型(VLM)在多语言场景下的表现通常用端任务准确率来衡量,但准确率接近天花板时,模型内部是否真正建立了跨语言的视觉实体与文本属性之间的概念绑定,仍然是一个未被探索的问题。本文提出M2BIND基准,在Shapes绑定任务上独立变化上下文语言和查询语言,从外部指标(Acc/FM)和内部因果干预(ICE)两个层面评估绑定。

核心发现是:VLM的跨语言概念绑定是脆弱的,尤其当上下文与查询语言跨语系、跨文字时,绑定保真度显著下降;而准确率往往保持高位,无法反映这种退化。分词器的不公平性和解码器计算层的后移是退化的两个可追溯来源。

英文题目:Vision-Language Models are Fragile Multilingual Associators

论文出处:arXiv 每日论文精选 · arXiv:2608.12333

原始论文:PDF / 论文页面

这篇论文解决什么问题?

现有VLM多语言研究主要基于端任务准确率评估,无法揭示模型内部是否真正将视觉实体与文本属性关联起来。人类可以轻松地在不同语言之间映射同一概念——一个法语使用者看到jaune能自然地联想到yellow,但VLM是否具备这种语言不变的绑定能力,此前没有系统性的探索。

概念绑定(concept binding)是VLM理解图像的核心机制:模型需要将图像中的物体与文本中的属性词在内部表示中关联起来。Jiahai Feng和Jacob Steinhardt(2024)提出Binding ID机制,用因果干预证明语言模型在激活中标记共指实体与属性token;Saravanan等人(2025)将这一分析扩展到VLM,在Shapes任务上证明图像token与文本指称共享标识符。本文直接采用其任务和模型,但将问题推进到多语言场景。

多语言场景引入了一个关键变量:输入语言的变化。当上下文用英语描述、查询用法语提问时,模型是否还能保持绑定?当上下文和查询语言跨语系、跨文字时,绑定是否退化?这些问题在现有文献中缺乏答案。

本文的研究动机在于:如果VLM的绑定能力依赖特定语言,那么在多语言应用中,即使准确率看起来正常,模型内部可能已经失去了正确的概念关联,这会导致不可靠的推理和回答。

核心创新

  • 提出M2BIND基准,首次独立变化上下文与查询语言以测试跨语言概念绑定
  • 结合外部任务指标(Acc/FM)与内部因果干预(ICE)双重评估绑定
  • 揭示准确率饱和掩盖绑定退化,FM和ICE能暴露更深层的绑定脆弱性
  • 从语言距离、分词器、解码器计算三个层面追溯绑定退化的来源

方法概览

提出M2BIND基准,在Shapes绑定任务上独立变化上下文语言和查询语言(跨语系4种、语系内6种,共8种语言),从外部(Acc/FM)和内部(交换干预ICE)两个层面评估绑定。

  • 提出M2BIND基准,在Shapes绑定任务上独立变化上下文语言和查询语言。上下文语言和查询语言从8种语言中选择:跨语系4种(英语、法语、普通话、阿拉伯语),语系内6种(日耳曼语族:英语、荷兰语、德语;罗曼语族:法语、意大利语、西班牙语),共覆盖16种跨语系组合和9种语系内组合。
  • 外部评估采用两个指标:准确率(Acc)和因子化边际(Factorization Margin, FM)。FM衡量正确项与干扰项得分差的均值,反映绑定的分离度。准确率接近天花板时,FM能暴露更细微的退化。
  • 内部评估采用交换干预(Interchange Intervention, ICE)。方法是将两个物体在某一解码器层的隐藏状态交换,测量正确项得分的下降量(ICE)。ICE峰值越高,说明该层的绑定关联越强。通过绘制ICE随解码器层变化的曲线,可以定位绑定计算发生在哪些层。
  • 分词器分析:计算单语设置下各语言的平均token数、截断率(Trunc.)和FM下降。分词器生育率(tokenizer fertility)指同一句子在不同语言下产生的token数量,非拉丁文字(普通话、阿拉伯语)通常需要更多token。
  • 语言类型学分析:使用WALS(世界语言结构地图集)和lang2vec编码语言类型学、地理、谱系距离,分析跨语系组合的绑定退化是否与语言距离相关。
  • 语系内评估:在日耳曼语族和罗曼语族内分别评估9种组合,检验语系内绑定是否保持稳定,以及是否需要锚语言(如英语)作为中介。
  • 跨模型复现:在Qwen2.5-VL-7B上复现跨语系绑定实验,验证发现的跨模型一致性。
  • 模板设计:颜色和形状术语填充上下文和查询的{color}和{shape}槽位,图像和gold item跨语言保持不变,只有表面形式变化,确保绑定退化的来源是语言本身而非视觉内容。

逐图理解论文

一个具体的失败案例

一个具体的失败案例
Figure 1: Concept binding across languages. (Top) The world map situates the languages in our study across continents, families, and scripts. (Bottom) A French speaker who also reads English effortlessly maps jaune onto the same concept as yellow, and so links the 1 im- age, the 2 French context, and the 3 English query to answer cone →I (✓). VLMs frequently fail this associ- ation (✗). We investigate whether such bindings survive when the context and query languages differ.

图1展示概念绑定跨语言的示意图:世界地图标注了研究中8种语言的地理分布,底部展示一个法语使用者如何将jaune映射到yellow的概念,从而正确回答cone→I。VLM经常在这种跨语言关联中失败,这正是本文要研究的问题。

研究空白:准确率掩盖绑定退化

研究空白:准确率掩盖绑定退化
Table 1: Cross-family VLM associations. Cross- lingual concept binding over En, Fr, Zh, and Ar; rows are context (ctx), columns are query (q). Each cell re- ports Acc. / FM; for both, higher (↑) is better. Worst cases are highlighted.

表1展示跨语系绑定的Acc/FM矩阵,行是上下文语言,列是查询语言。重点观察对角线(单语)与非对角线(跨语)的FM差异,以及普通话-阿拉伯语跨文字对的最低FM值。

退化来源:分词器不公平性与文字差异

退化来源:分词器不公平性与文字差异
Table 2: Impact of tokenization. Values reported are for monolingual setting. We report mean tokens of the image+context+query, truncation (Trunc.) against the context limit, and the FM drop relative to English. For all metrics, lower (↓) is better.

表2展示分词器影响:各语言的平均token数、截断率和FM下降。阿拉伯语和普通话的token数显著高于英语,截断率也更高,直接关联FM下降。

结论与意义

结论与意义
Table 4: Cross-family binding for Qwen2.5-VL-7B. Rows are context (ctx), columns are query (q). Each cell reports Acc. / FM. For both, higher (↑) is better. Worst cases are highlighted.

表4展示Qwen2.5-VL-7B的跨语系绑定结果,与LLaVA-1.5-OV-7B的模式一致:非拉丁文字组合的FM最低,验证了发现的跨模型一致性。

实验如何设计?

  • 跨语系绑定评估:LLaVA-1.5-OV-7B在英语、法语、普通话、阿拉伯语四种语言16种上下文-查询组合上的Acc/FM。
  • 分词器影响分析:单语设置下各语言平均token数、截断率、FM下降(表2,第3页)。
  • 因果定位:对单语和跨语组合进行交换干预,绘制ICE随解码器层变化曲线(图2,第4页)。
  • 语系内绑定:日耳曼语族(英语、荷兰语、德语)和罗曼语族(法语、意大利语、西班牙语)的9种组合评估(表3,第4页)。
  • Qwen2.5-VL-7B跨语系复现实验(表4,第8页)。
  • 语言类型学与词汇相似度分析:WALS特征对比(图3,第6页)和8种语言的词汇相似度矩阵(图4,第7页)。

关键结果与论文证据

  • 跨语系绑定显著退化:FM从单语英语的5.45降至普通话-阿拉伯语跨文字对的2.80,降幅2.65(表1,第3页)。
  • 准确率饱和掩盖退化:跨语系组合的准确率普遍保持高位,但FM显著下降,说明准确率不能作为绑定保真度的可靠指标。
  • 非拉丁文字是薄弱区域:阿拉伯语单语设置比英语多27.6%的token,12%的提示被截断,FM下降2.55(表2,第3页)。跨语系组合中非拉丁文字在查询侧比上下文侧难约0.25 FM。
  • 绑定计算层后移:单语ICE峰值在解码器约第15层,跨语组合右移至约第20层(图2,第4页),说明跨语言绑定需要更深的计算。
  • 语系内绑定保持稳定:语系内所有FM保持在5以上,最差下降0.45(德语到其他语言)(表3,第4页),说明类型学相近的语言之间绑定保持较好。
  • 跨模型一致性:Qwen2.5-VL-7B上单语普通话FM最低为3.71,阿拉伯语→普通话跨文字为3.76(表4,第8页),非拉丁文字的困难在跨模型中一致。
  • 词汇相似度解释部分退化:英语和法语词汇相似度仅27%,但诺曼法语借词使它们共享拉丁文字词汇,FM达5.20(图4,第7页),说明文字共享和借词能部分缓解跨语系退化。
  • 分词器不公平性是重要来源:非拉丁文字需要更多token,导致截断和上下文损失,直接关联FM下降(表2,第3页)。

阅读时需要注意

  • 使用程序化生成的Blender图像,未验证真实图像上的退化程度。
  • 主要基于LLaVA-1.5-OV-7B,商业闭源模型未覆盖。
  • Shapes任务仅涉及两个物体和简单形状/颜色,场景复杂度有限。
  • 未探索更多语言和语系,如非洲、南亚、东南亚语言。

关联工作

  • Jiahai Feng和Jacob Steinhardt(2024)提出Binding ID机制,用因果干预证明语言模型在激活中标记共指实体与属性token,为本文的ICE方法提供理论基础。
  • Saravanan等人(2025)将Binding ID分析扩展到VLM,在Shapes任务上证明图像token与文本指称共享标识符;本文直接采用其任务和模型。
  • Petrov等人(2023)揭示语言模型分词器引入语言间不公平性,本文将其与绑定退化关联。
  • Rust等人(2021)研究分词器质量对多语言性能的影响,本文引用其fertility概念解释token预算差异。
  • Pires等人(2019)发现多语言BERT中类型学相近语言在表示空间聚集,本文用其解释语系内绑定保持。
  • Conneau等人(2020)证明跨语言迁移随共享词汇和模型规模提升,本文引用支持语系内绑定无需锚语言。
  • Meng等人(2022)提出交换干预方法定位事实关联,本文采用其ICE方法定位绑定计算层。

发表评论