快速导读:本文发现并因果定位了视觉语言模型在多示例上下文学习中的“上下文崩塌”现象,并提出了一种可迁移的集成电路适配框架CircA进行修复。
多示例上下文学习(many-shot ICL)被广泛认为是提升视觉语言模型(VLM)性能的有效策略,但本文揭示了一个反直觉的现象:随着示例数量增加,部分VLM的准确率不仅没有提升,反而急剧下降,甚至低于随机水平。作者将这一现象命名为“上下文崩塌”(in-context collapse),并指出这是一种“干净的推理崩塌”——模型输出格式正常,但判断错误,因此极易被忽视。
本文的核心贡献在于,不仅系统地记录了这一现象在11个开源VLM和4个前沿API模型上的普遍性,更通过参数匹配的“损伤-修复”实验,因果性地将崩塌定位到视觉-语言集成通路(连接器和语言模型早期/中期层),而非晚期读出层。基于这一发现,作者提出了CircA(integration-circuit adaptation)框架,其核心“集成疫苗”仅需在单一合成任务上训练一次,即可将抗崩塌能力迁移到未见过的任务族,实现了跨任务、跨架构的可迁移修复。
英文题目:In-Context Collapse in Vision-Language Models and How to Mitigate it?
论文出处:arXiv 每日论文精选 · arXiv:2608.02830
原始论文:PDF / 论文页面
这篇论文解决什么问题?
上下文崩塌现象的核心特征在于,模型在零样本条件下能够正确回答的问题,在加入少量上下文示例后反而答错。以Qwen2-VL-2B在CIFAR-4上的表现为例,其标准准确率从0-shot的0.94骤降至16-shot的0.44(第23页)。更令人惊讶的是,这一现象同样出现在前沿API模型中:Claude Sonnet 4.5在CIFAR-4上的准确率从0-shot的0.88降至4-shot的0.12(第25页)。这表明上下文崩塌并非小模型的专属缺陷,而是与模型的对齐方案强相关。
作者通过引入“鲁棒性-学习分离”的分析框架,将模型行为划分为三个区域:抗崩塌(robust)模型在标准标签下保持准确率稳定;崩塌(collapse)模型在标准标签下准确率下降,但在remap标签下仍能学习;以及真正的学习者(learner),在两种标签下都能从示例中获益。这一分离表明,模型抵抗示例干扰的能力与从示例中学习新规则的能力是两个独立的维度,不能通过模型大小来推断其鲁棒性。
崩塌的机制根源在于模型对示例内容的整合失败。实验显示,崩塌模型在标准标签和打乱标签(shuffled)条件下的准确率高度一致,说明模型几乎不关心示例标签是否正确,而是依赖预训练先验进行判断。同时,复制率(copy rate)随示例数增加而上升,表明模型倾向于复制最近示例的标签,而非真正学习图像-标签的映射规则(第29页)。
在VQA任务上,崩塌同样存在。Qwen2-VL-2B在VQAv2和TextVQA等感知类基准上随示例增加而退化,而同一架构的7B模型则保持稳定,说明崩塌与模型规模并非简单线性关系,而是与具体的训练方案相关(第30-31页)。
核心创新
- 发现并定义了视觉语言模型中的“上下文崩塌”现象,即准确率随示例增加而下降,甚至低于随机水平。
- 揭示了模型对示例的鲁棒性(Robustness)和从示例中学习新规则的能力(Learning)是两个可分离的维度,并划分出三种模型状态。
- 通过参数匹配的“损伤-修复”实验,因果性地将崩塌定位到视觉-语言集成通路(连接器和早期/中期层),而非晚期读出层。
- 提出CircA框架,其核心“集成疫苗”仅需在单一合成任务上训练一次,即可将抗崩塌能力迁移到未见过的任务族。
- 发现并验证了上下文集成(integration)和基于权重的长期巩固(consolidation)发生在模型的不同位置(早期/中期 vs. 晚期层)。
方法概览
提出CircA(integration-circuit adaptation)框架,包含三个组件:(1) 疫苗(Vaccine):在视觉-语言集成通路(连接器和语言模型早期/中期层)一次性训练低秩适配器,赋予模型通用的抗崩塌能力;(2) 门控(Gate):在推理时通过监测复制率(copy rate)来限制示例数量,避免进入崩塌状态;(3) 注入(Inject):将示例块压缩为任务向量,注入集成通路以节省上下文。
- CircA框架包含三个互补组件:疫苗(Vaccine)、门控(Gate)和注入(Inject),均作用于视觉-语言集成通路(连接器和语言模型早期/中期层)。
- 疫苗组件是核心创新:在集成通路上一次性训练低秩适配器(LoRA),赋予模型通用的抗崩塌能力。训练仅在合成shapes remap任务上进行,无需接触目标任务数据。
- 门控组件在推理时通过监测复制率来限制示例数量,当复制率达到饱和时停止添加示例,避免模型进入崩塌状态。这一组件依赖于模型本身具备一定的集成能力。
- 注入组件将示例块压缩为任务向量,直接注入集成通路以节省上下文窗口。这与已有的多模态任务向量工作思路相似,但CircA将其与抗崩塌修复结合。
- 因果定位实验采用“损伤-修复”范式:在不同模型深度区域添加等容量的低秩适配器,比较其对remap准确率的修复效果。结果显示,连接器和早期/中期层的适配器能将准确率从随机水平修复至0.91,而等容量的晚期读出层适配器无效(第32页)。
- 跨架构验证在三种不同架构上进行:MLP-projector(Qwen2-VL-2B、Qwen2.5-VL-3B)和pixel-shuffle(InternVL3-2B),确认了集成通路定位的普适性,尽管pixel-shuffle架构上效果较弱且噪声较大(第35页)。
- 连续学习实验揭示了集成与巩固的双重分离:晚期读出层的LoRA在5任务类增量学习中取得了最高的平均准确率和最低的遗忘率,表明基于权重的长期巩固发生在读出通路,而非集成通路(第41页)。
- 疫苗的迁移能力通过跨任务评估验证:在shapes remap上训练后,在未见过的CIFAR-4和Fashion-4 remap任务上,16-shot准确率分别从随机水平提升至0.71和0.60(第37页)。
逐图理解论文
崩塌现象与直觉

想象一个能正确识别飞机的模型,你给它看了八张正确标注的图片后,它却把飞机叫成了鸟。这不是格式错误,模型输出完全正常,但判断全错了。作者把这种“干净的推理崩塌”称为上下文崩塌。更惊人的是,连Claude Sonnet这样的前沿模型也会崩塌——在CIFAR-4上,准确率从零样本的近九成,跌到四个示例后仅剩一成出头。崩塌在第一个示例加入时就可能发生,而且不会自己恢复。
核心区分:鲁棒性≠学习能力

这里有一个关键区分:模型抵抗示例干扰的能力,和从示例中学习新规则的能力,是两个完全独立的维度。作者用remap任务来证明这一点——把类别映射到模型从未见过的任意token,这样正确回答只能来自真正的上下文学习。结果发现,崩塌模型在标准标签下溃败,但在remap标签下却能学习。这说明模型并非丧失了集成能力,而是无法在预训练先验和上下文信息之间正确权衡。它倾向于复制最近示例的标签,而不是真正理解图像与标签的映射关系。
因果定位与修复框架

图2揭示了崩塌的因果定位:视觉-语言集成通路(连接器和早期/中期层,绿色)负责整合上下文示例,晚期读出层(红色)负责输出决策。崩塌可通过在集成通路添加适配器修复,但无法通过读出层修复;相反,长期巩固在读出层最有效,形成双重分离。
结论与双重分离

图16展示了集成疫苗的跨任务迁移能力:在shapes remap上训练后,疫苗在未见过的CIFAR-4和Fashion-4 remap任务上均将准确率从随机水平显著提升,而基线始终停留在随机水平。效果在MLP-projector模型上最大,pixel-shuffle模型上较温和。
实验如何设计?
- 模型面板:11个开源VLM(0.5B-11B参数),涵盖Qwen2-VL、Qwen2.5-VL、InternVL3、LLaVA-1.5、SmolVLM等系列,以及4个前沿API模型(Nova-Lite/Pro、Claude-Haiku-4.5、Claude Sonnet 4.5)。
- 任务设计:三类4-way分类任务——合成shapes(无污染)、CIFAR-4(强自然图像先验)、Fashion-4(细粒度),每类任务使用标准标签和remap标签两种条件。remap标签将类别映射到任意token,确保正确回答只能来自上下文学习。
- 评估协议:标准准确率衡量鲁棒性,remap准确率衡量学习能力,复制率诊断模型是否在复制而非推理。所有实验使用3个随机种子,报告均值和95%置信区间。
- 因果定位:在连接器、早期层、中期层、晚期层分别添加rank-8的LoRA适配器,比较remap准确率的修复效果。
- 疫苗迁移:在shapes remap上训练集成疫苗,在CIFAR-4和Fashion-4 remap上评估迁移效果。
- 连续学习:5任务类增量学习,比较集成通路和读出通路LoRA的平均准确率和遗忘率。
关键结果与论文证据
- 上下文崩塌在多个模型和任务上普遍存在:Qwen2-VL-2B在CIFAR-4标准标签下从0.94降至0.44(第23页),Claude Sonnet 4.5从0.88降至0.12(第25页)。
- 鲁棒性与学习能力是可分离的维度:崩塌模型在标准标签下退化,但在remap标签下仍能学习,说明模型并非完全丧失集成能力,而是无法在预训练先验与上下文信息之间正确权衡。
- 崩塌的因果定位在集成通路:连接器/早期/中期层的适配器能将remap准确率从0.39修复至0.91,而等容量晚期读出层适配器无效(第32页)。
- 集成疫苗具有跨任务迁移能力:在shapes remap上训练后,CIFAR-4 remap准确率从随机水平提升至0.71,Fashion-4 remap提升至0.60(第37页)。
- 跨架构验证确认了定位的普适性:三种架构上集成通路修复均优于读出通路,但pixel-shuffle架构效果较弱(第35页)。
- 集成与巩固发生在不同位置:晚期读出层在连续学习中表现最优(平均准确率0.76,遗忘率-0.04),优于集成通路,形成双重分离(第41页)。
- VQA任务上的崩塌与分类任务一致:Qwen2-VL-2B在VQAv2和TextVQA上退化,而7B模型保持稳定;ScienceQA因示例提供答案格式而非覆盖先验,两模型均受益(第30-31页)。
- 崩塌在第一个示例加入时即可能发生,且不会随示例数增加而恢复,简单的many-shot策略可能有害。
阅读时需要注意
- CircA的疫苗组件需要一次离线训练,无法直接应用于闭源API模型,限制了其在商业服务上的部署。
- 门控和注入组件依赖于模型本身具备一定的集成能力,对于已完全丧失集成能力的崩塌模型无法修复。
- 研究主要关注分类和VQA任务,未在生成式任务(如图像描述)上验证崩塌现象和修复方法的有效性。
- 因果定位和修复主要在MLP-projector架构上验证,在pixel-shuffle架构上效果较弱且噪声较大,跨架构泛化性有待进一步研究。
关联工作
- Flamingo开创了通过门控交叉注意力在冻结语言模型中实现多模态少样本ICL的方法,为本文研究的集成通路提供了架构基础。
- 多模态任务向量工作将示例块压缩为激活编辑向量以节省上下文,与CircA的注入组件思路相似,但未解决崩塌问题。
- VL-ICL Bench基准测试表明VLM难以利用大量ICL示例,零样本能力不能预测ICL能力,与本文的鲁棒性-学习分离现象一致。
- Neo等人和Cohen等人的机制解释性研究发现视觉信息在VLM的深层才变得可读,为本文的集成/读出通路划分提供了理论基础。