快速导读:问题的根源在于,压缩决策与层敏感度测量是脱节的。现有的剖析工具能告诉你每层有多敏感、计算量有多大,但如何将这些数据转化为具体的剪枝比例和量化位宽,仍然依赖工程师的经验判断。APQF 的核心洞察是:大语言模型恰好擅长阅读结构化数据并做出规划。如果把剖析报告以文本形式提供给 LLM,它就能像一位经验丰富的压缩工程师那样,为每一层量身定制压缩方案。
现代深度网络在边缘设备上部署时,计算与存储开销往往远超硬件承受能力。剪枝和量化是两种最主流的压缩手段,但它们的组合使用长期依赖专家手工调参:哪一层该剪多少、哪一层该用几比特量化,通常需要反复试错。APQF 提出了一种全新的自动化范式——让大语言模型(LLM)扮演“压缩工程师”的角色,根据实测的逐层剖析数据,为每一层制定个性化的剪枝比例和量化精度。
整个框架由五个协作智能体构成:ProfilingAgent 负责测量每层的敏感度和计算成本;PrunerAgent 在 LLM 指导下执行多阶段结构化剪枝;FineTuningAgent 通过参数高效微调或全量微调恢复精度;QuantAgent 规划混合精度量化感知训练(QAT)并辅以知识蒸馏;EvaluationAgent 则在固定验证集上持续评估所有中间模型。这套流水线在 ImageNet 上将计算量压缩至原始的 5.6%–7.7%,即 13–18 倍的 BOPs 缩减,而精度损失极小,DeiT-Tiny 甚至提升了 1.38%。
英文题目:APQF: Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning
论文出处:arXiv 每日论文精选 · arXiv:2608.05499
原始论文:PDF / 论文页面
这篇论文解决什么问题?
深度学习模型的压缩并非新话题,但现有方法普遍存在三个痛点。第一,压缩策略高度依赖专家经验:剪枝率、量化位宽、各层的分配比例都需要人工设定,不同架构之间难以迁移。第二,均匀压缩忽略层间敏感度差异:某些层对精度至关重要,另一些层则冗余度很高,一刀切的处理方式要么压缩不足,要么精度崩溃。第三,联合优化剪枝和量化的方法(如 GETA)通常需要大量训练数据和计算资源,在数据有限的场景下表现急剧恶化。
另一个常被忽视的问题是,现有的剖析工具(profiling tools)虽然能测量每层的计算量和敏感度,但它们与压缩决策是脱节的——工程师需要人工解读剖析报告,再手动调整压缩参数。APQF 的核心洞察在于:LLM 恰好擅长阅读结构化数据并做出规划决策,如果将剖析结果以文本形式提供给 LLM,它就能像一位经验丰富的工程师那样,为每一层量身定制压缩方案。
与 APQF 最直接的可比工作是 GETA,它通过梯度优化联合学习剪枝和量化参数。但 GETA 在数据受限时精度会大幅下降,而 APQF 的压缩策略由剖析数据驱动,对训练数据量的依赖要小得多。此外,APQF 的前身 ProfilingAgent 已经验证了 LLM 引导剪枝和训练后量化(PTQ)的可行性,APQF 则进一步将量化升级为训练感知的 QAT,并引入了知识蒸馏和自适应微调,使整个流水线更加完整和鲁棒。
核心创新
方法概览
问题的根源在于,压缩决策与层敏感度测量是脱节的。现有的剖析工具能告诉你每层有多敏感、计算量有多大,但如何将这些数据转化为具体的剪枝比例和量化位宽,仍然依赖工程师的经验判断。APQF 的核心洞察是:大语言模型恰好擅长阅读结构化数据并做出规划。如果把剖析报告以文本形式提供给 LLM,它就能像一位经验丰富的压缩工程师那样,为每一层量身定制压缩方案。
- ProfilingAgent 首先对原始模型进行逐层剖析,测量每层的 MACs、参数敏感度(通过注入微小扰动观察输出变化)以及计算瓶颈分布,生成一份结构化的敏感度 CSV 文件和一段自然语言的架构简报。这份简报会描述模型的整体结构、关键层的敏感度排名以及潜在的计算热点,为后续 LLM 决策提供“体检报告”。
- PrunerAgent 采用 LLM 引导的多阶段目标逼近剪枝。LLM 根据剖析简报和用户设定的目标压缩比,为每一层规划个性化的剪枝比例。剪枝过程分多个阶段进行,每阶段剪掉一部分通道后,立即用少量数据微调恢复精度;如果精度下降超过预设阈值,则触发自适应恢复——优先使用 LoRA、DoRA 等参数高效微调(PEFT)方法,若效果不足再升级为全量微调。这种“剪一点、恢复一点”的策略有效避免了单次激进剪枝导致的不可逆精度损失。
- 剪枝完成后,QuantAgent 接管模型,再次调用 LLM 规划混合精度量化方案。LLM 根据剪枝后模型的逐层敏感度,为每一层分配不同的权重和激活值位宽(如 8-bit、6-bit、4-bit),在计算效率和精度之间寻找最优平衡。量化采用 QAT 方式,即在训练中模拟量化误差,使模型学会适应低精度表示。
- QuantAgent 还集成了知识蒸馏(KD):以原始 FP32 模型为教师,压缩模型为学生,在 QAT 过程中同时优化任务损失和蒸馏损失。论文还设计了一个可选的“后量化 KD 恢复”阶段——当有充足数据时,对已量化的模型再跑约 5 个 epoch 的 KD,以极小的额外成本进一步缩小精度差距。
- FineTuningAgent 贯穿整个流程,负责剪枝后和量化后的精度恢复。它支持多种 PEFT 方法(LoRA、DoRA、rsLoRA、PiSSA、LoRA+)以及全量微调,根据精度下降幅度自动选择恢复策略。这种自适应机制使 APQF 在数据有限时也能有效恢复精度。
- EvaluationAgent 在固定验证集上评估所有中间检查点,确保每一步的精度变化都被记录和比较。所有智能体共享同一个评估管道,避免了不同评估设置带来的系统性偏差。
- 整个框架基于 DepGraph 进行依赖图分析,确保结构化剪枝不会破坏层间的数据依赖关系。APQF 的架构无关设计使其同时适用于 CNN(ResNet、VGG)和视觉 Transformer(ViT、DeiT、Swin),无需为不同架构定制剪枝逻辑。
- LLM 的输入包括:用户指定的压缩目标、ProfilingAgent 生成的敏感度 CSV 和架构简报、当前阶段的模型状态。LLM 输出结构化的逐层压缩配置,由各智能体解析执行。论文验证了六种不同 LLM(包括免费模型)作为规划器的效果,精度波动极小,说明框架对 LLM 选择具有鲁棒性。
逐图理解论文
失败的均匀压缩

图 6 的消融实验揭示了两个关键结论:均匀压缩(蓝色)精度最低,证明逐层差异化不可或缺;移除剖析数据(绿色)精度介于两者之间,说明 LLM 有一定推理能力,但剖析数据仍是决策质量的核心保障。
核心洞察:从人工经验到测量驱动的自动化决策

图 2 详细描绘了 ProfilingAgent 的内部流程:它接收原始模型,输出逐层敏感度 CSV 和自然语言架构简报。这份简报是后续 LLM 决策的唯一信息源,其质量直接决定压缩策略的合理性。
APQF 如何实现自动化压缩

图 1 展示了 APQF 的完整工作流:五个智能体依次协作,从剖析、剪枝、微调、量化到评估,形成一个闭环的自动化压缩管道。注意各智能体之间的数据流——剖析报告是连接测量与决策的关键纽带。
数据效率与压缩效果

图 5 直观对比了 APQF 与 GETA 在受限数据下的精度-计算权衡。APQF 的数据点(圆圈)集中在左上角(高精度、低 BOPs),而 GETA(菱形)精度随 BOPs 降低急剧恶化,清晰展示了剖析驱动策略的数据效率优势。
实验如何设计?
- 主要实验在 ImageNet-1K 上进行,使用 200K 训练样本的受限数据预算,模拟数据稀缺场景。评估指标为 Top-1 准确率和 Rel. BOPs(压缩模型 BOPs 与原始 FP32 模型 BOPs 的百分比)。
- 全数据 ImageNet 对比实验中,APQF 复用受限数据管道产出的模型,仅额外运行约 5 个 epoch 的后量化 KD 恢复,与 GETA 的全量训练结果进行对比。
- CIFAR-10 实验使用基线匹配的检查点:两种方法从完全相同的微调后模型出发,各自运行压缩管道,精度变化(∆)相对于各自测量的基线计算,确保公平性。
- VGG7/CIFAR-10 实验对比了纯量化方法(如 Bayesian Bits)和联合剪枝-量化方法(如 DJPQ、GETA),APQF 使用自己复现的 FP32 基线(92.95%)。
- 消融实验在 CIFAR-10 上对比三种配置:完整 APQF(逐层剪枝+混合精度)、均匀压缩(所有层相同剪枝率和位宽)、以及移除剖析数据的 APQF(LLM 仅根据架构信息决策)。
- LLM 规划器鲁棒性实验在 Swin-Tiny/CIFAR-10 上测试六种 LLM,包括 GPT-4o、Claude、Gemini 以及免费的开源模型,记录各自的精度和 Rel. BOPs。
关键结果与论文证据
- 受限数据 ImageNet 实验(Table 1, p.14):APQF 将四类架构的计算量压缩至原始 BOPs 的 5.6%–7.7%(13–18× 缩减),DeiT-Tiny 精度反超基线 1.38%,ResNet-50 和 Swin-Tiny 精度下降控制在可接受范围。相比之下,GETA 在同样数据预算下精度仅 51%–59%,几乎不可用。
- 全数据 ImageNet 对比(Table 2, p.15):APQF 在仅追加约 5 个 epoch KD 后,精度与 GETA 相差不到几个百分点,但 Rel. BOPs 低约 3 倍(如 ViT-Small: 5.73% vs. 19.37%),说明 APQF 的混合精度量化带来了显著的额外计算节省。
- CIFAR-10 基线匹配实验(Table 3, p.15):APQF 在五分之四的模型上达到更低的 Rel. BOPs,并在 DeiT-Tiny(+3.11)、ResNet-50(+0.79)、Swin-Tiny(+1.14)上实现精度正增长。GETA 仅在 ResNet-20 的精度和 ViT-Small 的 Rel. BOPs 上占优。
- VGG7/CIFAR-10 联合压缩对比(Table 4, p.16):APQF 以 0.41% 的 Rel. BOPs 达到 93.15% 的准确率,不仅超越自身 FP32 基线(+0.20),也优于同等 BOP 预算下的 GETA(92.57%),证明了结构化剪枝+混合精度 QAT 的协同优势。
- 消融实验(Figure 6, p.17):均匀压缩导致最大的精度损失,验证了逐层差异化策略的必要性。移除剖析数据后 LLM 的决策质量下降,但精度损失小于均匀压缩,说明 LLM 本身具备一定的架构推理能力,但剖析数据仍是关键的信息来源。
- LLM 鲁棒性(Figure 7, p.17):六种 LLM 规划器在 Swin-Tiny 上均达到 97.4%–97.9% 的准确率,包括免费的轻量模型。这表明 APQF 不依赖特定高端 LLM,用户可根据成本灵活选择。
- 数据效率优势(Figure 5, p.14):在 200K 训练预算下,APQF 的精度-计算曲线远优于 GETA。GETA 的梯度联合优化需要大量数据才能收敛,而 APQF 的剖析驱动策略在数据稀缺时仍能做出合理决策。
- 框架的模块化设计使各智能体可独立升级:例如,未来可将 DepGraph 替换为更先进的剪枝算法,或将 Brevitas QAT 模拟器替换为硬件感知的量化后端,而无需改动 LLM 规划逻辑。
阅读时需要注意
- 当前仅验证了图像分类任务,尚未扩展到目标检测、语义分割、大语言模型或多模态模型等更复杂的场景。
- LLM 规划器可能产生非确定性输出,尤其在未提供剖析数据或使用较弱模型时,偶尔会生成无效的压缩配置(如位宽超出支持范围),需要额外的格式校验。
- ImageNet 级别的压缩实验计算开销巨大,限制了配置数量和重复实验次数,部分结论的统计显著性有待更多验证。
- 框架仍需要少量人工介入:用户需选择 LLM 模型、设置采样参数、指定蒸馏超参数和压缩目标,尚未实现完全零人工的“一键压缩”。
- 与 GETA 的 ImageNet 对比中,GETA 仅使用了权重量化(因实现限制),而 APQF 使用了权重+激活值量化,这一差异使对比在一定程度上有利于 APQF,需在解读时注意。
关联工作
- DepGraph(p.4):APQF 在结构化剪枝阶段依赖 DepGraph 分析层间依赖关系,确保剪枝操作不会破坏网络拓扑。APQF 的贡献在于用 LLM 自动规划 DepGraph 所需的逐层剪枝比例,而非手动设定。
- GETA(p.5):作为直接竞争对手,GETA 通过梯度优化联合学习剪枝掩码和量化参数。APQF 在数据效率和计算压缩率上均展现出优势,但 GETA 在数据充足时仍是一种强基线。
- ProfilingAgent(p.5):APQF 的前身,首次提出用剖析数据引导 LLM 进行剪枝和 PTQ。APQF 将 PTQ 升级为 QAT,并引入 KD 和自适应微调,显著提升了压缩后的精度恢复能力。
- DJPQ 与 Bayesian Bits(p.5):两种经典的联合压缩方法,在 VGG7/CIFAR-10 上被用作对比基线。APQF 在极低 BOPs 下的精度优势验证了 LLM 引导的逐层差异化策略的有效性。