ResponseGuard:为何视觉语言护栏无需推理链?

快速导读:ResponseGuard 提出了一种无需 Chain-of-Thought 的单次前向传播视觉语言护栏,在保持甚至超越现有推理护栏响应有害性检测精度的同时,将延迟降低了约 150 倍,并支持流式实时拦截。

随着视觉语言模型(VLM)的广泛应用,安全护栏成为部署的关键环节。然而,现有护栏多依赖 Chain-of-Thought (CoT) 进行逐步推理,导致高延迟和无法实时拦截的问题。ResponseGuard 提出了一种无需推理链的单次前向传播方案,旨在解决这一效率瓶颈。

该方案通过冻结视觉编码器和轻量级分类头,实现极低延迟的有害性检测。实验表明,在响应有害性检测任务中,ResponseGuard 不仅精度优于或持平于推理护栏,且延迟降低约 150 倍,支持流式实时拦截。

英文题目:When Are Reasoning-Based Guardrails Not Efficient? ResponseGuard: A Fast Vision-Language Guard for Real-Time Moderation

论文出处:arXiv 每日论文精选 · arXiv:2607.21401

原始论文:PDF / 论文页面

对应视频标题:ResponseGuard:为何视觉语言护栏无需推理链?|推荐指数:★★★★★

这篇论文解决什么问题?

当前视觉语言安全护栏通常依赖 CoT 进行逐步推理,认为这能提高准确性。然而,在响应路径上,用户已等待模型生成,若再等待护栏推理,体验极差。此外,文本领域的研究已质疑 CoT 在简单分类任务中的必要性。

推理过程可能仅是事后解释(post-hoc),而非真正提升决策准确性。例如,重采样推理链仅改变 2.5% 文本判决和 7.8% 图像判决,且推理链长度与准确率相关性系数为 -0.03,表明推理链对判决影响有限。

在提示有害性检测中,尤其是图像任务,现有护栏性能瓶颈主要源于冻结的视觉编码器,而非缺乏推理链。这提示我们,改进感知能力可能比引入推理更有效。

核心创新

  • 提出无推理链的单次前向传播视觉语言护栏,实现极低延迟。
  • 证明在响应有害性检测任务中,CoT 对准确率提升有限,且推理链与判决相关性极低。
  • 实现流式实时拦截能力,可在有害内容完全生成前中断输出。
  • 发现现有护栏在图像任务上的性能瓶颈主要源于冻结的视觉编码器,而非缺乏推理链。

方法概览

ResponseGuard 采用 label-only 设计,将请求、响应和图像池化为单一表示,通过单次前向传播直接输出有害概率,不进行任何 token 解码。它使用冻结的视觉编码器和轻量级分类头,支持在流式生成过程中逐句检查并提前中断有害回答。

  • ResponseGuard 采用 label-only 设计,将请求、响应和图像池化为单一表示,通过单次前向传播直接输出有害概率,不进行任何 token 解码。
  • 它使用冻结的视觉编码器和轻量级分类头,支持在流式生成过程中逐句检查并提前中断有害回答。
  • 该方法避免了 CoT 带来的高延迟,实现了实时拦截能力。
  • 通过温度缩放,ResponseGuard 的预期校准误差 (ECE) 从 4.3% 降至 1.5%,确保判决可靠性。

逐图理解论文

推理链的失效

推理链的失效
Figure 2: The reasoning guard’s chain may be largely post- hoc. Resampling the chain moves only 2.5 percent of text verdicts and 7.8 percent of image verdicts. We have also found that the chain length is essentially uncorrelated with correctness. A chain of length zero is the limiting case that a label-only guard computes directly, and the flat correlation suggests that the tokens between the two settings make little difference to the verdict.

现有护栏依赖 Chain-of-Thought 逐步推理,导致高延迟。然而,重采样实验显示,推理链改变极少判决,且长度与准确率几乎无关。这表明推理可能仅是事后解释,而非真正提升准确性。

效率与精度的权衡

效率与精度的权衡
Figure 1: ResponseGuard runs one label-only (non-CoT) pass per streamed sentence. This proposed guard passes a safe opening and stops the answer at the first harmful sentence, before the harmful content is completed. The guard reads the image, the prompt, and the response so far, and it is light and fast enough to run as the answer streams.

图 1 展示了 ResponseGuard 的运行流程。它通过单次前向传播处理流式句子,在有害内容完全生成前中断输出。这体现了其实时拦截能力和低延迟特性。

实验验证

实验验证
Table 1: The main experimental results of response harmfulness detection, under the evaluation setup of Liu et al. (2025b) with dataset-size-weighted F1 of the harmful class per cell. Best in bold, runner-up in italic, and third in underline per column. The GuardReasoner-VL rows match the official release. Relative speed is the per-verdict latency ratio to the 3B reasoning guard, which is unity by definition. We time ResponseGuard-2B ourselves. The Eco entry is derived from the token saving reported in the official release rather than from our own timing, and a dash marks a guard we did not time.

表 1 列出了响应有害性检测的主要实验结果。ResponseGuard-2B 在 All 平均 F1 上优于 GuardReasoner-VL-3B,且延迟显著更低。这证明了其在精度和效率上的优势。

图像性能的瓶颈

图像性能的瓶颈
Table 2: The full experimental results of prompt harmfulness detection, under the same evaluation setup. Best in bold, runner-up in italic, and third in underline per column, with relative speed defined as in Table 1. The overall lead of the reasoning guard comes from the two image-only cells, HarmImg and the SPA-VL prompt split, where perception appears to be the bottleneck.

在提示有害性检测中,尤其是图像任务,ResponseGuard 性能略低。分析表明,瓶颈源于冻结的视觉编码器,而非缺乏推理链。改进感知能力可能比引入推理更有效。

结论与局限

结论与局限
Figure 5: The label-only guard is well calibrated. Its expected calibration error is 4.3 percent, which a single temperature reduces to 1.5 percent. The reliability bars track the diagonal.

图 5 展示了 ResponseGuard 的校准情况。其 ECE 为 4.3%,经温度缩放后降至 1.5%。可靠性条形图贴合对角线,表明判决可靠。

实验如何设计?

  • 在标准多模态护栏基准(Liu et al. 2025b)上评估响应和提示有害性检测。
  • 对比 ResponseGuard-2B 与 GuardReasoner-VL-3B 及其 Eco 变体。
  • 分析推理链的稳定性(重采样实验)和长度与准确率的相关性。
  • 评估流式拦截效果及校准误差 (ECE)。
  • 分析注意力机制以探究图像性能差距的原因。

关键结果与论文证据

  • ResponseGuard-2B 在响应有害性检测 All 平均 F1 为 77.31,优于 GuardReasoner-VL-3B 的 76.56 (Page 5)。
  • ResponseGuard-2B 延迟为 67.6 ms,约为 GuardReasoner-VL-3B (10.12 s) 的 150 倍快 (Page 6)。
  • 重采样推理链仅改变 2.5% 文本判决和 7.8% 图像判决 (Page 2)。
  • 推理链长度与准确率相关性系数为 -0.03 (Page 2)。
  • ResponseGuard 预期校准误差 (ECE) 为 4.3%,经温度缩放后降至 1.5% (Page 7)。
  • 流式拦截可阻止 95.0% 的有害回答,中位停止位置为回答的 7% (Page 7)。
  • 在提示有害性检测中,GuardReasoner-VL-3B 总体领先 (78.71 vs 75.91),差距主要集中在图像单元格 (Page 6)。

阅读时需要注意

  • 在纯图像有害性检测任务上性能低于推理护栏,主要受限于冻结的视觉编码器。
  • 不提供人类可读的推理过程,可能需要额外的解释步骤以满足审计需求。
  • 实验主要基于单一基准套件,泛化性需进一步验证。
  • 未对解冻视觉编码器进行消融实验,仅提出假设。

关联工作

  • GuardReasoner-VL 是主要对比基线,基于 CoT 的视觉语言护栏 (Page 2)。
  • LeanGuard 是文本领域的轻量级护栏,质疑 CoT 必要性 (Page 2)。
  • SentGuard 是流式护栏相关工作 (Page 3)。
  • Llama Guard 3 Vision 是参考基线,图像感知生成式护栏 (Page 4)。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

推理型护栏何时效率低下? ResponseGuard:一种用于实时审核的快速视觉-语言护栏

Dongbin Na∗

dongbinna@postech.ac.kr

摘要 视觉-语言 AI 助手以生成标记流的形式返回其答案。因此,监控该答案的安全护栏必须跟上流式传输的速度,并在用户阅读之前阻止有害回复。最近的视觉-语言护栏在做出裁决之前会生成思维链(Chain-of-Thought, CoT)。它们认为逐步推理能产生更安全的护栏。这种设计使得护栏沉重且缓慢,因为模型必须解码大量标记以进行有害性检测。我们提出一个问题:视觉-语言护栏是否真的需要推理才能筛选响应。我们回答了一个没有思维链的护栏:ResponseGuard 从请求、响应和图像的单个池化表示中,在一次前向传播中读取有害性裁决。在标准的视觉-语言护栏基准测试中,我们的 2B 参数 ResponseGuard 在响应有害性检测方面优于最近的 3B 参数推理型视觉-语言护栏,无需任何推理,且时间成本降低约 150 倍。在请求有害性检测方面,推理型护栏仍保持整体领先,而两者在仅图像单元格上的剩余差距可能源于两种设计都使用的冻结视觉编码器(Frozen vision encoder),而非缺失的思维链。我们还发现,推理型护栏几乎不将其裁决注意力集中在图像上。基于单次传播检测,ResponseGuard 可以随流式传输逐句筛选答案,并在答案完成之前阻止有害答案。对于视觉-语言模型的响应防护,校准过的单次传播标签可能提供足够的安全信号。我们在 https://github.com/ndb796/ResponseGuard 上完全公开了所有源代码、训练模型和数据集。

1 引言 视觉-语言模型现已部署在安全护栏之后。护栏读取请求和响应(有时包含图像),并决定系统是否应遵守或拒绝 (Inan et al. 2023; Han et al. 2024; Ghosh et al. 2024)。一个快速增长的研究方向使护栏在做出裁决前先进行推理。推理型护栏会写出显式的思维链,然后从其最后一行读取裁决 (Liu et al. 2025a,b),其前提是逐步思考能产生更准确和可信的决策。这一前提颇具吸引力。对于文本设置,一项受控研究已经对其提出了质疑 (Na 2026)。尚未明确的是在多模态情况下,特别是响应路径中,成本很大程度上取决于用户感知的延迟。响应路径是推理成本高昂之处。筛选请求的护栏在模型回答之前运行一次。因此,其思维链只需支付一次。我们注意到,筛选响应的护栏必须在答案仍在生成时运行。推理型护栏迫使用户在已经等待模型回答后,再等待护栏进行思考。仅对已完成答案进行评分的护栏情况更糟,因为完全写好的有害答案已经被展示出来。因此,快速且精简的护栏是解决这些问题的可行方法。轻量级护栏可以在每个流式传输的句子后重新运行,并阻止答案

第 2 页

构建了一个 3B 推理护栏及其 Eco 变体,用于响应有害性检测,成本约为原来的 1/150。我们重采样推理链 ×5。结果显示,仅标签设计在多模态方面的不足主要局限于纯图像单元格,且性能下降与感知限制一致,而非缺乏推理链所致。我们对护栏进行了流式评估,发现廉价的逐句护栏能在有害回答完成前阻止大部分有害内容。我们完全开源了模型、代码、数据和项目页面。

图 2:推理护栏的链式推理可能主要是事后分析。重采样链仅改变 2.5% 的文本判定和 7.8% 的图像判定。我们还发现链长度与正确性基本无关。链长度为 0 是仅标签护栏的直接计算极限情况,平坦的相关性表明两种设置之间的令牌对判定差异影响甚微。

2 相关工作

审核护栏。开放护栏将提示和响应审核视为分类任务,并直接输出判定结果 (Inan et al. 2023)。后续工具扩大了标签空间,涵盖提示有害性、响应有害性和拒绝行为 (Han et al. 2024; Ghosh et al. 2024)。生产系统针对不良内容研究大型分类器 (Markov et al. 2023)。这些护栏均为单次通过,这是我们保留并延伸至图像的特性。

推理护栏。较新的家族让护栏在过程中途介入,将响应筛选转变为异常处理而非事后评分。图 1 展示了这一用法。推理护栏被认为具有两个优势:其链式推理为操作者提供人类可读的判定理由,且人们相信推理能使判定更准确。我们质疑响应路径上的这两个优势。首先,当任务是以最快速度阻止有害回答而非事后解释时,实时推理是否值得其成本?其次,链式推理是否真的能提高响应有害性检测能力?我们在响应设置中对这两个问题的回答均为否定,并用测量数据而非断言来支持这一结论。图 2 预览了我们的主张。重采样推理护栏的链式推理几乎从不改变其判定,且链长度与准确率相关性很小。

我们构建了此类护栏,并测试护栏是否需要链式推理。ResponseGuard 是一个仅标签的视觉语言护栏。我们的护栏将请求、响应和可选图像合并为一个池化表示。该护栏在一次前向传播中将表示映射为有害判定,不进行解码。在标准多模态基准测试中,我们的 2B ResponseGuard 在响应有害性检测方面优于最近的 3B 基于推理的视觉语言护栏,且无需推理,成本约为其 1/150。尽管 ResponseGuard 专为响应路径构建,但所提出的护栏在请求有害性方面仍与推理护栏具有竞争力,在文本单元格方面两者接近。在请求路径上,推理护栏保持整体领先。然而,我们表明剩余差距主要由两个纯图像单元格承担,且原因似乎是感知而非推理。推理护栏在做出判定时对图像的注意力极少。因此,很少检查图片的链式推理在做出裁决时不太可能利用图片信息。

我们提出 ResponseGuard,这是一个仅标签的视觉语言护栏,通过单次通过筛选响应,并优于……

视觉语言安全。为视觉语言模型提供护栏增加了文本审核中不存在的感知负担。已构建偏好数据以对齐此类模型 (Zhang et al. 2024)。图像内容已使用专用工具进行策展和评级 (Helff et al. 2025),且已发布图像感知护栏 (Chi et al. 2024)。现代骨干网络将语言模型与预训练视觉编码器配对 (Bai et al. 2025; Marafioti et al. 2025)。我们的分析与冻结视觉编码器限制推理护栏和仅标签护栏的多模态护栏能力一致。

当推理有帮助时。思维链 (Chain-of-Thought, CoT) 提示主要在数学和符号任务上有效,而在简短的标签决策上效果较差 (Sprague et al. 2025)。其链式推理往往与答案背后的计算过程不符 (Turpin et al. 2023),且效率文献指出存在浪费的过度思考 (Sui et al. 2025)。安全审核可能是一个输出空间较小的简短决策。安全审核可能处于链式推理收益甚微的区间。我们的结果与此观点一致,并将其扩展到多模态响应筛选。

面向智能体的轻量级护栏。快速的单次通过护栏也适用于链式推理无法胜任的场景。推理安全措施已被置于机器人控制循环中 (Ravichandran et al.

第 3 页

2025)。然而,在单个控制步骤中运行的设备端代理往往没有时间去解码一个思维链。同样的压力也出现在导航任务中,轻量级模块必须迅速做出决定并拒绝那些无法回答的问题(Na 等人,2026a,b)。在这些设置中,护栏与感知和控制争夺相同的毫秒级时间。因此,准确、廉价且快速的护栏往往是此类系统唯一能负担得起的类型,我们的仅标签设计正是为此提供了解决方案。

流式拦截与词元级审查。另一条研究路线使审查变得增量式而非一次性完成。最近的流式分类器逐个词元发出安全标签,从而可以在文本助手生成中途将其切断(Zhao 等人,2025)。句子级审查器一旦检测到有害句子完成便发出警报(Yu 等人,2026)。这些系统从构造上就是仅标签的,因为在交互式速度下,两个词元之间无法产生思维链。这一约束与将响应护栏从推理中剥离出来的约束相同。我们的贡献在于证明,仅标签设计不仅支持流式处理,而且在静态响应基准测试中与推理护栏表现相当,并厘清了思维链究竟增加了什么以及未增加什么。

3 ResponseGuard

公式化。护栏接收请求 $x$、响应 $y$ 和可选图像 $v$。筛选响应是一个二元决策,即判断给定 $x$ 和 $v$ 时 $y$ 是否有害。推理护栏将此决策建模为生成过程。推理护栏生成思维链 $c = (c_1, \dots, c_{|c|})$ 然后生成判决令牌,从左到右解码它们。因此,推理护栏运行 $|c| + 1$ 次串行传递,成本为 $O(|c| + 1) = O(|c|)$,且随思维链长度增长。ResponseGuard 将同一决策建模为分类。所提出的护栏对三元组的一个表示 $h$ 进行池化,并在单次传递中读取判决概率:

$$ h = \text{pool } f_\theta(x, y, v), \quad p = \sigma(g(h)), \quad (1) $$

其中 $f_\theta$ 是视觉-语言主干网络,$\text{pool}(\cdot)$ 是最后词元池化,$g$ 是一个小型头部。没有解码任何内容,所提出护栏的成本为 $O(1)$,与案例难度无关。用 $C(\cdot)$ 表示一次前向传播的浮点运算次数,并将每次解码步骤计为一次完整传递,推理成本与所提出护栏成本的比率为:

$$ \frac{\text{cost}(\text{reason})}{\text{cost}(\text{ours})} = \frac{(|c| + 1) C(|x| + |y| + |c|)}{C(|x| + |y|)} \gtrsim |c| + 1, \quad (2) $$

对于我们要观察的思维链,$|c| \approx 10^2$,这大约是两个数量级。公式 2 计算的是前向传播次数,而表 3 报告的是墙钟时间。键值缓存使得每次解码步骤比完整传递更便宜,因此测量的加速比基本低于此界限。

主干网络与头部。我们在一个 2B 参数的视觉-语言嵌入主干网络(Li 等人,2026)上构建 $f_\theta$,并遵循高效适应的常见做法,冻结其视觉编码器。头部包含两个小型的学习参考向量库,一个安全库和一个有害库。头部通过每个库的软化相似度对 $c \in \{\text{safe, harm}\}$ 进行评分:

$$ z_c = \log \frac{1}{K_c} \sum_{k=1}^{K_c} \exp \frac{\cos(h, r_{ck})}{\beta}, \quad (3) $$

其中 $r_{ck}$ 是库 $c$ 中的第 $k$ 个参考向量,$K_c$ 是该库中的参考数量,$\beta > 0$ 是头部温度,我们将其与算法 1 中使用的决策阈值 $\tau$ 区分开来。我们设置 $\beta = 0.2$,$K_{\text{safe}} = 2$,$K_{\text{harm}} = 4$。公式 3 是一个库的余弦相似度的对数均值指数。当 $\beta \to 0$ 时,它趋近于 $\max_k \cos(h, r_{ck})/\beta$,而均值隐含的 $-\log K_c$ 消除了不等库大小原本会引入的偏差。护栏返回有害概率 $p = \sigma(z_{\text{harm}} – z_{\text{safe}})$,其对数几率范围为 $[-2/\beta, 2/\beta]$,因此涵盖了第 5.6 节中使用的完整置信度范围。每个库的多个参考让头部能够覆盖不同类型的有害内容,而无需针对它们进行标签标注。使用软最大值聚合库使分数保持平滑而非饱和,这使得概率可以自由取中间值。我们没有对硬最大值进行消融实验,因此不将第 5.6 节报告的校准归因于这一选择。我们在主干网络上使用低秩适配器(Hu 等人,2021)在有害类的二元目标下训练头部。护栏输出一个标量,即响应有害的概率。为了证明该配方不绑定于单一主干网络,我们还报告了两个 SmolGuard 变体,参数量分别为 2B 和 500M,它们构建在 SmolVLM 主干网络上(Marafioti 等人,2025)。

为何思维链在此处可能是可选的。当决策需要中间计算,而输入并未直接暴露这些计算时(如多步算术或证明),思维链才值得其成本。筛选响应似乎不属于这类问题。响应有害的证据通常就在响应本身中陈述。这种判断更接近于对护栏已经可以阅读的文本进行分类,而非护栏必须构建的推导。思维链可能扮演的角色是调和细微的意图,我们的实验发现这在提示词中很重要,但在响应中并不重要。将护栏视为分类器而非生成器,不仅成本更低,而且从论证上讲更贴合任务,本文的其余部分将测试这种贴合是否以牺牲准确性为代价。

流式使用。单次廉价的前向传播使得新的部署模式成为可能。随着模型流式传输其答案,我们在每个句子边界处重新运行 ResponseGuard。所提出的护栏在有害概率超过阈值时立即停止生成。算法 1 描述了该循环。护栏中断正在进行的有害答案,而不是在答案完成后才进行判断。推理护栏无法在交互式延迟下做到这一点,因为每次重新检查都需要一个新的思维链。

4 实验设置

基准测试。我们在最近发布的推理护栏(Liu 等人,2025b)附带发布的公共多模态套件上进行评估,该套件报告了响应有害性赛道和提示有害性赛道。响应赛道有五个

第 4 页

算法 1 使用 ResponseGuard 进行流式拦截 1: 输入: 请求 x, 图像 v, 阈值 τ 2: y ←∅ 3: while 模型仍在流式传输时 do 4: s ←下一个完成的句子; y ←y ∥s 5: p ←ResponseGuard(x, y, v) ▷一次前向传播 6: if p ≥τ then 7: 停止生成; 返回有害, y 8: end if 9: end while 10: 返回无害, y

文本单元格、HarmBench-Response (HBr)、Safe RLHF (SRL)、BeaverTails (BT)、XSTest-Response (XSh) 和 WildGuard-Response (WGr),以及作为图像单元格的视觉偏好集 (SPA-VL)。提示跟踪包含 ToxiChat (TC)、HarmBench-Prompt (HBp)、OpenAI Moderation (OAI)、Aegis (Aeg)、SimpleSafetyTests (SST) 和 WildGuard-Prompt (WGp),以及两个图像单元格:有害图像 (HarmImg) 和视觉偏好提示拆分 (SPA-VL) (Lin et al. 2023; Mazeika et al. 2024; Markov et al. 2023; Ghosh et al. 2024; Vidgen et al. 2023; Han et al. 2024; Ji et al. 2023; Dai et al. 2023; Röttger et al. 2024; Zhang et al. 2024)。

训练数据。我们在推理护栏 (Liu et al. 2025b) 发布时使用的公开语料库上进行训练,该语料库包含 123,093 个样本,涵盖文本、图像和文本-图像输入。我们保留输入和黄金标签,并丢弃推理链。我们还对其 at-verdict 表示拟合一个一维判别器,并将我们的护栏在文本单元格上的精度与图像单元格进行比较。我们进一步研究校准和严格的假阳性操作点。

模型与可复现性。遵循 Liu et al. (2025b) 的评估设置,我们报告每个单元格的有害类 F1 分数以及数据集大小加权的平均值。按单元格大小加权使得像偏好集这样的大单元格按其大小比例贡献,而不是平等贡献。我们始终保持响应跟踪和提示跟踪分离,因为护栏在一个跟踪上可能很强,而在另一个跟踪上可能很弱。响应跟踪是我们研究的部署所遵循的跟踪。所有运行均在单个商用数据中心 GPU 上使用 bfloat16 进行。ResponseGuard 的训练参数仅占主干网络的一小部分。代码、配置、分析脚本和模型权重均已完全公开。

5 实验结果

5.1 响应有害性检测

响应有害性检测的主要实验结果报告在表 1 中。我们的 2B 仅标签 ResponseGuard 在响应 All 平均值上领先,得分为 77.31,高于 3B 推理护栏的 76.56 及其 Eco 变体的 77.14。ResponseGuard 在文本响应平均值上也达到了最佳成绩 79.71,领先于两种推理变体,且无需任何思维链。响应单元格是响应护栏部署服务的单元格。在这些单元格上,无链护栏在解码时不生成任何内容,因此领先。通用指令微调模型和图像感知生成性护栏仅作为参考点,且远远落后。

模型。ResponseGuard-2B 是我们的主要护栏,构建在 2B 视觉语言嵌入主干网络 (Li et al. 2026) 之上。我们添加了两个基于 SmolVLM 主干网络 (Marafioti et al. 2025) 构建的进一步仅标签护栏:SmolGuard-2B 和 SmolGuard-500M,以表明该配方并不绑定于单一主干网络。我们的推理基线是一个 3B 思维链视觉语言护栏 (Liu et al. 2025b),这是该套件上近期开源的同类护栏。我们还报告了其效率调优的 Eco 变体 (Liu et al. 2025b)。我们包括一个通用指令微调的视觉语言模型 (Bai et al. 2025) 和一个图像感知生成性护栏 (Chi et al. 2024) 作为参考点。每个护栏都在相同的基准单元格上使用相同的有害类 F1 指标和相同的数据集大小加权进行评分。我们自己运行这三个仅标签护栏,而我们的推理护栏、其 Eco 变体以及两个参考护栏的数值与官方发布 (Liu et al. 2025b) 匹配。因此,准确性比较基于共享的协议和指标,而非共享的机器,而延迟是我们自行测量的。

成本和探针。我们在单个商用 GPU (RTX A6000) 上测量挂钟延迟,对推理器进行完整的链生成计时,对仅标签护栏进行单次前向传播计时。为了询问链是否有效,我们重新采样链,统计判决变化,并将链长度与正确性相关联。为了询问多模态差距存在于何处,我们读取推理器对图像 token 的判决位置注意力。

成本与探针。我们在单个商用 GPU (RTX A6000) 上测量挂钟延迟,对推理器进行完整的链生成计时,对仅标签护栏进行单次前向传播计时。为了询问链是否有效,我们重新采样链,统计判决变化,并将链长度与正确性相关联。为了询问多模态差距存在于何处,我们读取推理器对图像 token 的判决位置注意力。

5.2 提示有害性检测

提示有害性检测的完整实验结果报告在表 2 中。在此跟踪中,推理护栏在 All 平均值上领先,得分为 78.71 和 77.39,高于 ResponseGuard 的 75.91,我们直截了当地陈述这一结果。然而,在文本平均值上,我们的 2B 仅标签护栏分别达到 78.04 和 77.76,与推理护栏的 78.74 相差约一个点。剩余的差距集中在两个仅图像单元格中。在 HarmImg 上,3B 推理护栏得分为 70.93,而我们的护栏为 65.52;在 SPA-VL 提示拆分上,它得分为 86.47,而我们的护栏为 82.41。提示侧的优势

第 5 页

响应有害性(文本) 平均 SPA-VL 平均 相对 模型 HBr SRL BT XSh WGr (文本)(图像)(全部) 速度

Qwen2.5-VL-Instruct-3B 62.1 64.7 73.3 31.4 29.8 58.05 52.84 56.51 – Llama Guard 3 Vision 11B 80.9 41.7 65.0 81.1 56.5 59.28 41.43 54.01 – GuardReasoner-VL-3B (CoT) 85.8 66.4 85.2 93.1 76.1 78.83 71.19 76.56 1× GuardReasoner-VL-3B-Eco (CoT) 84.7 67.0 85.4 93.6 77.4 79.31 72.01 77.14 ∼1.1× SmolGuard-500M (ours, label-only) 83.1 66.8 85.4 92.0 71.2 77.67 67.80 74.75 – SmolGuard-2B (ours, label-only) 83.6 68.4 85.0 92.2 74.0 78.59 72.16 76.69 – ResponseGuard-2B (ours, label-only) 83.4 69.6 86.3 91.9 75.4 79.71 71.60 77.31 150×

表 1:响应有害性检测的主要实验结果,基于 Liu 等人 (2025b) 的评估设置,每个单元格为有害类的数据集大小加权 F1 分数。每列中粗体表示最佳,斜体表示次佳,下划线表示第三。GuardReasoner-VL 行与官方发布版本一致。相对速度是相对于 3B 推理护栏的每次裁决延迟比率,定义为 1。我们自行测量了 ResponseGuard-2B 的时间。Eco 条目源自官方发布报告中报告的令牌节省,而非我们自己的计时,短划线标记的是我们未计时的护栏。

因此,思维链并未分散在整个基准测试中,而是集中在图像上。78 图像单元格也暴露了图像护栏普遍存在的脆弱性。图像感知的生成式护栏在 HarmImg 上的得分仅为 0.48,几乎完全失败。即使对于更大的模型,也不一定能获得良好的图像得分。当决策基于文本时,思维链带来的收益有限。当决策基于视觉时,限制似乎在于感知能力,这是两种设计均未解决的问题。

5.3 裁决的成本 每次裁决的成本报告在表 3 中。推理护栏每次裁决发出约 238 个令牌,在商用数据中心 GPU 的中位数上耗时约 76 秒,而 ResponseGuard 仅需 68 毫秒即可返回。这一结果意味着在响应轨道上更准确而非更差的裁决中,延迟降低了约 150 倍。

图 3 将护栏置于单一准确率-成本平面上。仅标签护栏位于高响应 F1 和低延迟区域,而推理护栏位于右侧较远位置。

响应护栏位于模型发出的每个令牌的路径上。因此,每次裁决成本降低两个数量级,不仅仅是一个微基准测试,而是改变了可部署性的本质。基准测试对思维链消耗的令牌不收取任何费用,但服务系统必须为每一个令牌付费。

5.4 图像差距与冻结编码器 仅标签护栏唯一落后的地方在于图像。图 4 指向感知能力而非缺失的思维链,这是推理护栏似乎共有的一个限制。首先,我们的护栏在图像上损失的是精度而非召回率(图 4,左侧)。其精度从文本单元格的 81.7% 下降到图像单元格的 67.7%,而召回率仅从 87.1% 轻微下滑至 81.9%。护栏对图像过度标记,仿佛不确定图片显示的内容,而非误读安全规则。我们未运行解冻编码器的消融实验,因此将此解释为假设而非测量出的原因。如果此假设成立,解决方案是更好的编码器而非思维链,我们将在讨论中回到这一点。

其次,当做出裁决时,推理护栏几乎不看图像(图 6,左侧)。在裁决位置,推理护栏仅将约 6% 的注意力分配给图像令牌,而均匀分配会给予 47%。几乎不关注图像的思维链可能几乎没有图像信息可供推理,尽管原始注意力质量本身并不能证明图像未被使用。

Both guards read images through a frozen vision encoder, and both may therefore inherit blurred image evidence. We mean precision falls from 81.7 percent on text cells to 67.7 percent on image cells, while recall slips only from 87.1 to 81.9 percent. The guard over-flags images, as if unsure what the picture shows, rather than misreading the safety rule. Second, the reasoning guard scarcely looks at the image when it rules (Figure 6, left). At the verdict position, the reasoning guard places about 6 percent of its attention on image tokens, against the 47 percent that a uniform allocation would give. A chain that barely attends to the image plausibly has little image information to reason over, although raw attention mass is not by itself proof that the image goes unused.

5.5 思维链可能 largely 是事后诸葛亮 如果思维链驱动了裁决,扰乱思维链应该会扰乱裁决。图 2 显示它 largely 没有。在中等温度下对推理护栏的思维链进行五次重采样,仅改变了 2.5% 的文本裁决。

Both guards read images through a frozen vision encoder, and both may therefore inherit blurred image evidence. We mean precision falls from 81.7 percent on text cells to 67.7 percent on image cells, while recall slips only from 87.1 to 81.9 percent. The guard over-flags images, as if unsure what the picture shows, rather than misreading the safety rule. Second, the reasoning guard scarcely looks at the image when it rules (Figure 6, left). At the verdict position, the reasoning guard places about 6 percent of its attention on image tokens, against the 47 percent that a uniform allocation would give. A chain that barely attends to the image plausibly has little image information to reason over, although raw attention mass is not by itself proof that the image goes unused.

5.5 思维链可能 largely 是事后诸葛亮 如果思维链驱动了裁决,扰乱思维链应该会扰乱裁决。图 2 显示它 largely 没有。在中等温度下对推理护栏的思维链进行五次重采样,仅改变了 2.5% 的文本裁决。

第 6 页

提示有害性(文本) 平均 有害图像 SPA-VL 平均 相对 模型 TC HBp OAI Aeg SST WGp (文本) (图像) (图像) (全部) 速度

Qwen2.5-VL-Instruct-3B 34.6 90.1 52.0 82.2 100.0 64.1 51.37 48.66 62.81 53.53 – Llama Guard 3 Vision 11B 58.2 96.1 67.6 70.6 98.0 75.2 67.17 0.48 54.86 48.03 – GuardReasoner-VL-3B (思维链) 74.5 89.1 70.8 88.8 99.5 88.9 78.74 70.93 86.47 78.71 1× GuardReasoner-VL-3B-Eco (思维链) 73.5 88.6 70.9 89.0 99.5 89.2 78.43 66.79 85.82 77.39 ∼1.1× SmolGuard-500M ( ours, 仅标签护栏) 68.9 80.5 66.7 87.3 98.0 86.0 74.33 58.45 81.89 72.29 – SmolGuard-2B ( ours, 仅标签护栏) 72.9 98.1 71.8 87.1 98.5 86.9 78.04 60.23 84.49 75.25 – ResponseGuard-2B ( ours, 仅标签护栏) 72.8 97.4 69.3 87.4 97.4 88.5 77.76 65.52 82.41 75.91 150×

表 2:在相同评估设置下的提示有害性检测完整实验结果。每列中最佳结果加粗,次佳结果斜体,第三佳结果下划线,相对速度定义同表 1。推理护栏的整体领先优势来自两个纯图像单元格,即 HarmImg 和 SPA-VL 提示分割,其中感知似乎是瓶颈。

护栏输出 令牌 延迟 加速比 表示返回,在这些测量中,推理护栏在写下 GR-VL-3B (思维链) ∼238 10.12 s 1× 一个词之前就已经确定了决定,只是没有等待。两个护栏在背 ResponseGuard-2B 0 67.6 ms 150× 骨和目标上存在差异,因此这是关于思维链 表 3:在单张消费级 GPU 上的单次判决成本。仅标签护栏不解码任何内容,并返回关于 两个数量级更快的判决。图像增加了固定的 88 毫秒开销。部署的护栏受益于表现良好的分数。 预期校准误差根据置信度对预测进行分箱,并计算置信度与准确率之间的差距的平均值, ECE = Pb(nb/N) |acc(b) −conf(b)|。通过此度量,仅标签护栏的有害概率校准良好,为 4.3%,单一温度将其降低至 1.5%。因此,其置信度在整个范围内跟踪其准确率,如图 5 所示。推理护栏通常不提供此类控制。其判决令牌概率几乎完全极化,99.8% 的分数固定在零或一,这使得没有范围来调整阈值(图 6,右侧)。生产护栏以较小的误报率运行,以避免过度拦截良性流量,在那里极化的分数崩溃。在百分之一的误报预算下,推理护栏仅保留其召回率的约百分之十。这种在操作阈值附近的排名分辨率损失也在关键操作点的推理模型中报告 (Chegini et al. 2025)。平滑的分数为在部署需要时移动阈值留下了空间,而饱和的分数则不能。

护栏精度 推理可分性 仅标签,单元格平均值 判决时的 1-D LDA (AUC) ECE 90.9 81.7 75.0 67.7 图 4:关于图像差距的证据。左侧:仅标签护栏在文本单元格上的平均精度得分与图像单元格相比。右侧:在推理护栏的判决表示上拟合的一维判别器的 AUC。两项读数均落在图像上。

为了精确陈述这一观察结果,将链 c 之后的判决写为 ŷ(c),并定义重采样翻转率 ϕ = Pr[ŷ(c) ≠ ŷ(c′)],针对两个独立链 c 和 c′ 对同一输入。我们通过为同一输入绘制重复链并成对比较其判决来估计 ϕ。文本上测得的 ϕ = 0.025 意味着两个独立链在 97.5% 的文本案例中达成一致,因此判决几乎不变,无论护栏恰好抽取哪条链。在图像上,链稍不那么固定,ϕ = 0.078,这与较弱的图像表示一致。链在感知更难的地方多做一点工作,而在感知容易的地方几乎不做任何工作。链长度与正确性之间的相关性为 −0.03。护栏不会通过更长的思考来得出更好的答案,链花费的令牌对最终判决几乎没有影响。这一观察结果直接将两种设计联系起来。长度为零的链是极限情况,这也是仅标签护栏直接计算的内容。从池化表示中读取判决,在这些测量中,推理护栏在写下 一个词之前就已经确定了决定,只是没有等待。两个护栏在背 骨和目标上存在差异,因此这是关于思维链 表 3:在单张消费级 GPU 上的单次判决成本。仅标签护栏不解码任何内容,并返回关于 两个数量级更快的判决。图像增加了固定的 88 毫秒开销。部署的护栏受益于表现良好的分数。 预期校准误差根据置信度对预测进行分箱,并计算置信度与准确率之间的差距的平均值, ECE = Pb(nb/N) |acc(b) −conf(b)|。通过此度量,仅标签护栏的有害概率校准良好,为 4.3%,单一温度将其降低至 1.5%。因此,其置信度在整个范围内跟踪其准确率,如图 5 所示。推理护栏通常不提供此类控制。其判决令牌概率几乎完全极化,99.8% 的分数固定在零或一,这使得没有范围来调整阈值(图 6,右侧)。生产护栏以较小的误报率运行,以避免过度拦截良性流量,在那里极化的分数崩溃。在百分之一的误报预算下,推理护栏仅保留其召回率的约百分之十。这种在操作阈值附近的排名分辨率损失也在关键操作点的推理模型中报告 (Chegini et al. 2025)。平滑的分数为在部署需要时移动阈值留下了空间,而饱和的分数则不能。

护栏精度 推理可分性 仅标签,单元格平均值 判决时的 1-D LDA (AUC) ECE 90.9 81.7 75.0 67.7 图 4:关于图像差距的证据。左侧:仅标签护栏在文本单元格上的平均精度得分与图像单元格相比。右侧:在推理护栏的判决表示上拟合的一维判别器的 AUC。两项读数均落在图像上。

为了精确陈述这一观察结果,将链 c 之后的判决写为 ŷ(c),并定义重采样翻转率 ϕ = Pr[ŷ(c) ≠ ŷ(c′)],针对两个独立链 c 和 c′ 对同一输入。我们通过为同一输入绘制重复链并成对比较其判决来估计 ϕ。文本上测得的 ϕ = 0.025 意味着两个独立链在 97.5% 的文本案例中达成一致,因此判决几乎不变,无论护栏恰好抽取哪条链。在图像上,链稍不那么固定,ϕ = 0.078,这与较弱的图像表示一致。链在感知更难的地方多做一点工作,而在感知容易的地方几乎不做任何工作。链长度与正确性之间的相关性为 −0.03。护栏不会通过更长的思考来得出更好的答案,链花费的令牌对最终判决几乎没有影响。这一观察结果直接将两种设计联系起来。长度为零的链是极限情况,这也是仅标签护栏直接计算的内容。

5.6 校准与严格操作点 因为它的分数已校准,仅标签护栏也知道何时不确定。如果护栏拒绝最不自信的一半案例并将其转介,它保留的案例中的错误率从 17.2% 降至 5.5%。增益落在应落之处。文本错误率从 15.3% 降至 4.1%,图像错误率从 20.1% 降至 8.4%。图像上的平均置信度较低,为 0.835,而文本上为 0.895。因此,护栏将其不确定性堆积在图像单元格上,正是在感知最难的地方。

5.7 选择性预测 因为它的分数已校准,仅标签护栏也知道何时不确定。如果护栏拒绝最不自信的一半案例并将其转介,它保留的案例中的错误率从 17.2% 降至 5.5%。增益落在应落之处。文本错误率从 15.3% 降至 4.1%,图像错误率从 20.1% 降至 8.4%。图像上的平均置信度较低,为 0.835,而文本上为 0.895。因此,护栏将其不确定性堆积在图像单元格上,正是在感知最难的地方。

5.8 流式传输时筛选响应 基于单次检测,ResponseGuard 可以在流式传输时筛选答案。我们将每个有害答案一次喂入一个句子,并在概率首次超过阈值时停止。护栏中断了 95.0% 的有害

第 7 页

仅用于审计而非每次调用付费,且 1.00 校准后的分数已告知步骤该查看哪些案例。 ECE 4.3% 起初。我们定位到的图像上限可能是 1.5% 温度调整后冻结编码器的一个属性。我们尝试添加一个可训练的视觉 路径并未改变聚合结果。这一结果表明,图像单元格需要更强的编码器,而 0.75 而非更多的头部参数。我们测试了一个推理护栏和一个基准家族。事后模式是否 更广泛地成立是一个实证问题,发布的代码旨在使这一问题易于探讨。基准测试得分与 黄金标签的一致性,绝对数值最好解读为在固定协议下的相对比较,而非 0.50 部署率。突破图像上限的最清晰路径 0.50 0.75 1.00 可能是更强或适配的视觉编码器,我们的设计 置信度接受其作为冻结编码器的即插即用替代品。 图 5:仅标签护栏校准良好。其预期 校准误差为 4.3%,单次温度调整 CoT 注意力 判决分数 降至 1.5%。可靠性条跟踪对角线。 文本单元格 优势 在判决令牌推理器处,有害概率。 99.8% 在 0 或 1 因此读作生产堆栈的配方。校准的 0.47 仅标签护栏在每个响应上以单次传递成本运行 并随响应生成筛选流,因此常见 情况保持快速,有害答案被尽早切断,而非 完整显示。因此,低置信度案例, 0.06 我们的选择性预测分析显示集中在 图像上,可升级至更重的推理器或人工, 均匀 CoT 0 1 护栏推迟覆盖范围是部署 选择。链仅在意图 真正模糊的提示上花费,其余计算用于更 图 6:推理护栏在判决位置的两个属性。左:落在 图像令牌上的注意力质量份额,与均匀分配相比 序列会给出的份额。右:其判决 强视觉编码器,而非更长的链。在这种 得分分布,几乎完美极化,不留 安排中,仅标签护栏是始终开启的层, 调整严格假阳性率阈值的余地。 推理是目标明确的第二级,这反转了常见 假设,即推理护栏是默认值,而 快速护栏是一种妥协。校准的仅标签编码器 可能是新的视觉语言护栏测量的自然默认值, 它们在完成前回答并扣留 87.7% 的 有害文本,中位停止时间为回答的七%。将阈值从二分之一提高到 0.56 将这些 数字移至 94.3% 和 87.5%。在较低阈值下,良性答案被中断 28.5% 的时间。此 流式阈值用于早期拦截,并非 7 结论 第 5.6 节的严格操作点,其中部署 我们分析了视觉语言响应护栏 将权衡召回率以换取低假阳性预算。拦 是否需要推理才能筛选响应。ResponseGuard 截是早期的,因为有害答案在它们承诺 单次传递规则,领先于推理护栏及其 Eco 内容在第一或第二句中,单次传递远快于 变体在响应有害性检测上,并运行约 它筛选的句子,因此护栏检查每个句子 150 倍快。唯一存在差距的地方是图像, 仍有富余。无法以交互延迟运行每个 我们的分析与差距来自两者设计使用的 句子的推理护栏,这使得这种拦截 冻结视觉编码器,而非缺失的链。基于单次传递检测, 模式特定于仅标签设计。 护栏可以在流式传输时筛选答案并停止大多数 6 讨论与局限性 有害答案在它们完成之前。对于护栏 我们的声明范围限于标准多模态套件上的响应路径。当链 模型实际所说的内容,校准的标签可能是更简单、 仍有助于提示路径时,合理的系统可以推理一次提示并筛选 更便宜且至少同样准确的默认值,而非思维链 流式响应与标签。仅标签护栏不返回推理,因此必须证明每个 推理器。我们发布模型、训练和评估 块的部署将需要单独的解释步骤。该步骤可以 代码和流式传输工具包,以便社区可以 在我们的协议下重现结果并采用校准的 仅标签护栏作为基线或改进它。

第 8 页

参考文献

Bai, S.; et al. 2025. Qwen2.5-VL Technical Report. arXiv preprint arXiv:2502.13923.

Bai, S.; et al. 2025. SmolVLM: Redefining Small and Efficient Multimodal Models. arXiv preprint arXiv:2504.05299.

Chegini, A.; Kazemi, H.; Souza, G.; Safi, M.; Song, Y.; Ben- gio, S.; Williamson, S.; and Farajtabar, M. 2025. Reasoning’s Razor: Reasoning Improves Accuracy but Can Hurt Recall at Critical Operating Points in Safety and Hallucination De- tection. arXiv preprint arXiv:2510.21049.

Chi, J.; Karn, U.; Zhan, H.; Smith, E.; Rando, J.; Zhang, Y.; Plawiak, K.; Coudert, Z. D.; Upasani, K.; and Pasupuleti, M. 2024. Llama Guard 3 Vision: Safeguarding Human- AI Image Understanding Conversations. arXiv preprint arXiv:2411.10414.

Dai, J.; et al. 2023. Safe RLHF: Safe Reinforcement Learning from Human Feedback. arXiv preprint arXiv:2310.12773.

Ghosh, S.; et al. 2024. AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts. arXiv preprint arXiv:2404.05993.

Han, S.; et al. 2024. WildGuard: Open One-stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs. In Advances in Neural Information Processing Systems.

Helff, L.; Friedrich, F.; Brack, M.; Kersting, K.; and Schramowski, P. 2025. LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models. In Proceedings of the 42nd International Conference on Ma- chine Learning.

Hu, E. J.; et al. 2021. LoRA: Low-Rank Adaptation of Large Language Models. arXiv preprint arXiv:2106.09685.

Inan, H.; et al. 2023. Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations. arXiv preprint arXiv:2312.06674.

Ji, J.; et al. 2023. BeaverTails: Towards Improved Safety Alignment of LLM via a Human-Preference Dataset. In Advances in Neural Information Processing Systems.

Kang, M.; and Li, B. 2025. R2-Guard: Robust Reasoning Enabled LLM Guardrail via Knowledge-Enhanced Logical Reasoning. In International Conference on Learning Repre- sentations.

Kang, M.; and Li, B. 2025. R2-Guard: Robust Reasoning Enabled LLM Guardrail via Knowledge-Enhanced Logical Reasoning. In International Conference on Learning Repre- sentations.

Li, M.; Zhang, Y.; Long, D.; Chen, K.; Song, S.; Bai, S.; Yang, Z.; Xie, P.; Yang, A.; Liu, D.; Zhou, J.; and Lin, J. 2026. Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking. arXiv preprint arXiv:2601.04720.

Lin, Z.; et al. 2023. ToxicChat: Unveiling Hidden Challenges of Toxicity Detection in Real-World User-AI Conversation. In Findings of EMNLP.

Liu, Y.; Gao, H.; Zhai, S.; Xia, J.; Wu, T.; Xue, Z.; Chen, Y.; Kawaguchi, K.; Zhang, J.; and Hooi, B. 2025a. GuardRea- soner: Towards Reasoning-based LLM Safeguards. arXiv preprint arXiv:2501.18492.

Liu, Y.; Zhai, S.; Du, M.; Chen, Y.; Cao, T.; Gao, H.; Wang, C.; Li, X.; Wang, K.; Fang, J.; Zhang, J.; and Hooi, B. 2025b. GuardReasoner-VL: Safeguarding VLMs via Re- inforced Reasoning. In Advances in Neural Information Pro- cessing Systems.

Marafioti, A.; et al. 2025. SmolVLM: Redefining Small and Efficient Multimodal Models. arXiv preprint arXiv:2504.05299.

Markov, T.; et al. 2023. A Holistic Approach to Undesired Content Detection in the Real World. In Proceedings of AAAI.

Mazeika, M.; et al. 2024. HarmBench: A Standardized Eval- uation Framework for Automated Red Teaming and Robust Refusal. In Proceedings of ICML.

Na, D. 2026. Do Safety Guardrails Need to Reason? Lean- Guard: A Fast and Light Approach for Robust Moderation. arXiv preprint arXiv:2606.26686.

Na, D.; et al. 2026a. Binary Tracking for Spatial QA and Nav- igation with Open Vision-Language Models. arXiv preprint arXiv:2606.16902.

Na, D.; et al. 2026b. Semantic Flip: Synthetic OOD Gener- ation for Robust Refusal in Embodied Question Answering and Spatial Localization. arXiv preprint arXiv:2606.16898.

Ravichandran, Z.; Robey, A.; Kumar, V.; Pappas, G. J.; and Hassani, H. 2025. Safety Guardrails for LLM-Enabled Robots. arXiv preprint arXiv:2503.07885.

Röttger, P.; et al. 2024. XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models. In Proceedings of NAACL.

Sprague, Z.; et al. 2025. To CoT or Not to CoT? Chain-of- Thought Helps Mainly on Math and Symbolic Reasoning. In International Conference on Learning Representations.

Sui, Y.; et al. 2025. Stop Overthinking: A Survey on Effi- cient Reasoning for Large Language Models. arXiv preprint arXiv:2503.16419.

Turpin, M.; et al. 2023. Language Models Don’t Always Say What They Think: Unfaithful Explanations in Chain- of-Thought Prompting. In Advances in Neural Information Processing Systems.

Vidgen, B.; et al. 2023. SimpleSafetyTests: A Test Suite for Identifying Critical Safety Risks in Large Language Models. arXiv preprint arXiv:2311.08370.

Wei, J.; et al. 2022. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. In Advances in Neural Information Processing Systems.

Wen, X.; Zhou, W.; Mo, W. J.; and Chen, M. 2025. ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails. In Findings of the Association for Computational Linguistics: ACL 2025.

Yu, J.; Wang, X.; Wang, Y.; Li, J.; Teng, Y.; Ma, X.; and Wang, Y. 2026. SentGuard: Sentence-Level Stream- ing Guardrails for Large Language Models. arXiv preprint arXiv:2606.02041.

Zhang, Y.; et al. 2024. SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model. arXiv preprint arXiv:2406.12030.

Zhao, H.; et al. 2025. Qwen3Guard Technical Report. arXiv preprint arXiv:2510.14276.

发表评论