量化过程如何引发困惑并悄然破坏模型安全性
低位KV缓存量化可以在困惑度几乎不变的情况下消除模型的拒绝现象;这就是为什么标准指标无法检测到这一情况,以及应在门控机制中加入什么内容。
这一测量结果足以让所有处理压缩模型的开发者感到不安。在针对38亿到720亿参数的11种经过指令调优的模型进行的评估中,这些模型在五个基准测试和1,894个提示语的测试环境下被压缩,其中Mistral-7B在降低KV缓存位宽成本后,其拒绝率下降了15.2%。同样的压缩处理对困惑度的影响仅为1.03倍。3%的变动在大多数团队看来只是测量误差,根本无需过多关注。通常情况下,量化版本的合格标准是困惑度稳定、任务准确率稳定且延迟降低,这些标准本应使该版本通过审批。接下来将介绍记录这一现象的研究、解释其机制的内容,以及一系列针对量化阈值的微调方案,从而确保在所有指标均保持良好状态的同时不会丧失相关功能。
研究记录的内容
该作品是一篇预印本,题为《KV缓存量化导致的对齐崩溃:诊断与缓解方法》(arXiv:2606.09864)。其论点直接且令人不安:过度的KV缓存压缩会悄然破坏模型的安全对齐性;没有一种比特宽度在所有模型中都是安全的;而对齐崩溃会以一种突然而因模型而异的方式出现,以至于那些通常被指标团队所依赖的检测方法根本无法察觉。由于该研究尚未经过同行评审,合理的态度是将其视为一个有说服力的论据而非定论,这一点在文末值得再次探讨。
承载这一论点的关键词是不可见。它并非只是微弱或难以察觉,而是连常用仪器都无法检测到,因为那些仪器追踪的是与实际出问题参数不同的量。最生动的证明来自推测性解码技术,而这正是加速团队为让设备端推理得以实现所依赖的手段。当使用4位模型作为验证器时,拒绝率从63.2%降至0.0%,而通过率仍保持在23.5%,处理速度则为每秒17.0个标记,这些数值都处于正常运行范围之内。尽管所有观测指标看起来都很正常,但有一项能力却降到了零。
值得保留的机制
光是那些惊人的数字就能成为新闻标题;而其背后的原理才是可以据此构建流程的关键,这种原理具有几何特性。决定安全行为的特征位于激活空间中极为狭窄的一小部分区域内,研究估计该区域对压缩噪声的敏感度是“困惑度”所代表的广阔区域的100到1,000倍。
这一估计值得重视,因为它正是核心所在。“困惑度”是一个综合了模型所使用所有维度的单一数值。如果在这些维度中散布少量误差,这个综合数值就会显现出来;而如果完全消除三个维度的影响,同时保持其余千个维度不变,这个数值几乎不会发生变化,因为由未被影响的多数维度构成的总结依然保持稳定。
下一步将解释为何某个模型会失效而另一个则不会,其关键在于结构。对一组数值进行量化时,必须选择足够大的尺度以容纳其中最大的数值。激活值中存在异常值,即某些通道的幅度比其邻近通道高出一个数量级,而这些异常值决定了数值的范围。为了涵盖这些异常值,数值等级会被拉大,导致远低于第一个等级的任何数值都变为零。因此,某个模型的命运取决于一个简单的问题:编码你所依赖行为的通道是聚集在那些异常值附近,还是处于会被压缩消除的低幅度区域?
该论文的依据是此前的研究结果:模型的拒绝倾向仅受激活空间中少数几个方向的制约(Arditi等人2024年,Pan等人2025年),且对齐效应会集中在最初的输出标记中(Qi等人2025年)。压缩噪声如何影响这些方向,完全取决于相关通道是否与量化器为容纳异常值而必须舍弃的主导特征存在重叠。正是这种结构上的契合,而非参数数量或训练方法,决定了模型的存活能力。
为何不存在通用的位宽标准
决定论点走向的对比极为鲜明:Qwen-2.5-7B在6位精度下就表现糟糕,而Gemma-2-9B在3位精度下仍能正常运行。这两者都是70亿到90亿参数量级、经过指令微调的模型,且采用大致相似的训练流程,但本应可以互相替代的模型之间却存在着4位精度的巨大差距。因此,“我们的标准是4位精度KV缓存”这样的政策并无实际意义——对其中一个模型而言完全安全,但对另一个模型则可能造成灾难性后果,而且模型附带的任何文档都无法说明当前处于哪种情况。
为将这一问题转化为可在部署前进行测试的内容,该研究提出了一种名为“通道级降维”的诊断工具,能够提前将模型分类为三种不同的故障类型。这正是其实际应用价值所在,而且成本较低,足以纳入常规的部署前检查流程中。
研究未能进一步做出的推广
以上内容均涉及安全拒绝行为,且精确性至关重要:论文实际测量的仅有拒绝行为这一种。但再仔细看看该机制的要求——它需要一种集中在小子空间内的行为,同时还需要一个在较大空间上取平均的度量标准。拒绝行为在这两方面都符合要求。并没有明显理由表明它就是唯一满足条件的行为,将这一发现过度延伸其实属于外推,而非有据可查的结果。
以文档 AI 为例,其中有多种行为都具备完全相同的特征。其一便是对结构的遵循:输出的内容要么是符合预期结构的 JSON,要么就会反复出现相同的结构。另一个特征则是对空值与虚构值的处理:模型无法读取的字段是应显示为空,还是会被填充为看似合理的数值。在评估提取效果时,人们会刻意区分遗漏与虚构,因为两者的后果有着巨大差异——输入文档中出现的虚构数值会生成虚假的库存记录,而遗漏的字段仅会引发支持请求,只有前者能够隐藏起来。第三个特征则是工具调用的规范性:模型生成的要么是有效的调用结果,要么只是看似文本的普通输出。
上述每一种都属于某种行为,而非对标记的概率分布。模型在处理文档正文时虽然能给出相当合理的困惑度数值,却会暗中选择编造毫无依据的数值;而旨在实现字段级精确对应的量化处理方法实际上并不存在。这些行为是否也会以相同方式出现,目前仍是一个尚未有研究结果的开放性问题,这也正是为何应当通过测量而非猜测来加以验证的理由。
现在即可实施的三个简单改进
这些方法的成本都不高。在量化门中加入一种行为断言机制,该机制并非基于基准分数,而是对固定提示集下某种具体行为的原始计数——先以全精度进行统计,再在目标位宽下重新统计并两者对比;选择那些真正能让产品唤醒用户的行为作为判断标准。不要再把位宽视为整个团队共享的设置,因为它属于单个模型,甚至可能是某个特定版本的模型,因此每次升级时都必须重新执行该检查。同时要防止问题累积,正如投机解码案例所显示的那样:两种优化措施单独来看都不错,但合在一起却会破坏模型的某些功能,因此应验证量化、剪枝和投机解码整个流程的完整性,而非仅检查其中某一部分。
在引用数据之前先权衡各种限制因素
对证据保持坦诚是正确使用它的关键。这是一篇由三位研究人员撰写的预印本,目前仍在审稿中,全长约61页,包含九幅图表。内容相当丰富,但由于尚未通过同行评审,因此应将其视为有力的论据而非最终结论。该研究中的数据在arXiv上的版本与正在审稿的版本之间存在细微差异——后者标题不同,还增加了关于vLLM中FP8格式的研究结果。在引用任何具体数字之前,请直接获取最新的PDF文件进行核实,而非依赖他人的总结。关于提取行为的相关延伸内容同样是基于机制的推论,并非论文明确提出的观点;虽然逻辑上能够支持这一结论,但逻辑本身并不能等同于证据。
真正可以量化的安全范围比标题中给出的数字要窄且更严格:如果只衡量概率,就无法察觉某种行为何时会消失。在这项研究出现之前就已经如此了。该研究的贡献在于为这一现象给出了具体数值。
参考文献
- “KV缓存量化下的对齐崩溃:诊断与缓解”(预印本)。标识符为arXiv:2606.09864v2,发布于2026年8月8日。
- 一篇正在审稿中的修订版,围绕35分钟的部署审计重新命名,存储在OpenReview上,标识符为;该版本补充了vLLM中FP8格式的相关结果。
- Arditi及其同事(2024年)以及Pan及其同事(2025年)的研究指出,拒绝行为受少数激活空间方向的控制。
- Qi及其同事(2025年)的研究表明,对齐现象集中在最早的输出标记中。
相关阅读
- 前Anthropic研究人员发出的AI安全警告对开发者意味着什么 — 本文分析了为何研究人员关于AI风险的警告对普通开发者很重要,以及代理自主性与对齐问题应如何影响实际的安全习惯。
- Fugu Ultra:一种AI协调模型如何挑战GPT和Claude — 阐述了Sakana AI的Fugu Ultra v2如何通过多个专业模型而非单一大型语言模型来处理任务,以及在基准测试、价格和透明度方面的表现。
- 为何下载17 GB的模型并不代表运行它需要17 GB的内存 — 了解活跃参数、总参数、KV缓存增长以及推理开销如何决定在本地运行语言模型所需的实际内存和计算资源。