Когда этапы квантизации вызывают плексис и тайно нарушают безопасность модели
Квантизация кэша KV с низким количеством битов может устранить эффект отказа модели, при этом показатель перплекситета почти не меняется; вот почему стандартные метрики этого не фиксируют и что следует добавить в ваш механизм управления.
Один показатель уже должен насторожить тех, кто отправляет сжатые модели. В ходе оценки одиннадцати моделей, настроенных под конкретные задачи и имеющих от 3,8 млрд до 72 млрд параметров, протестированных на пяти тестовых заданиях с использованием 1 894 промптов, сжатие кэша KV при низкой ширине битов привело к тому, что Mistral-7B потерял 15,2% своих отказов в выполнении запросов. Изменение показателя перплексити при таком сжатии составило 1,03. Изменение на три процента — это уровень колебаний, который большинство команд считает шумом измерений и просто игнорирует. Обычные критерии одобрения квантизированной версии — стабильная перплекситет, стабильная точность выполнения задач и сниженная задержка — позволили бы одобрить эту версию. Далее приводится исследование, зафиксировавшее этот эффект, механизм, объясняющий его, а также набор кратких изменений в параметрах квантизации, позволяющих сохранить функциональность модели при том, чтобы все показатели на панелях управления оставались в нормальных значениях.
Что было зафиксировано в исследовании
Это предварительная публикация под названием «Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation» (arXiv:2606.09864). Её тезисы щекотливы и прямолинейны: агрессивное сжатие кэша KV может незаметно нарушить параметры безопасности модели; нет единого оптимального ширины бита, подходящей для всех моделей; кроме того, такое нарушение происходит внезапно, индивидуально для каждой модели, и метрики, на которые обычно полагаются специалисты, просто не способны его зафиксировать. Поскольку работа ещё не прошла рецензирование, разумно рассматривать её скорее как убедительный аргумент, чем как окончательный вывод, что стоит ещё раз обсудить в конце.
Слово, отражающее суть этой тезисы, — невидимый. Речь идет не просто о слабом или трудно заметном свойстве, а о полной невозможности обнаружения с помощью обычно используемых инструментов, поскольку эти инструменты отслеживают другую величину, чем та, которая дает сбой. Наиболее наглядная демонстрация основана на спекулативном декодировании, именно на котором опираются команды по ускорению обработки для снижения нагрузки на устройство. При использовании 4-битной модели в качестве верификатора уровень отклонений снизился с 63,2% до 0,0%, в то время как уровень одобрения остался на уровне 23,5%, а пропускная способность — 17,0 токенов в секунду; оба показателя находились в пределах нормальных значений. Одна из характеристик снизилась до нуля, в то время как все остальные показатели оставались в норме.
Механизм, который стоит сохранить
Уже сами пугающие цифры могут стать заголовком; именно логика, стоящая за ними, позволяет создать соответствующий процесс, причем эта логика имеет геометрическую природу. Факторы, обеспечивающие безопасное поведение, находятся в узком сегменте пространства активации, и исследование показывает, что этот сегмент в 100–1 000 раз более чувствителен к шумам компрессии, чем обширное пространство, описываемое показателем перплексити.
Эта оценка заслуживает внимания, поскольку именно она является ключевой. Перплексити — это единая цифра, рассчитываемая для каждой из размерностей, используемых моделью. Если небольшая ошибка распространится на тысячу таких размерностей, рассчитанная цифра это заметит. Если же три размерности полностью устранены, а оставшиеся тысяча останутся нетронутыми, цифра практически не изменится, поскольку общий показатель будет формироваться преимущественно на основе нетронутой большинственной части пространства, что сохраняет его стабильность.
Следующий шаг объясняет, почему одна модель терпит неудачу, а другая — нет, и всё сводится к структуре. Квантизация группы значений вынуждает выбирать масштаб, достаточно большой для вмещения самого крупного из имеющихся значений. Активации содержат аутлайеры — отдельные каналы, магнитуда которых в десять раз превышает магнитуду соседних каналов, — и именно эти аутлайеры определяют диапазон значений. При расширении уровней для их включения любое значение, значительно ниже первого уровня, сжимается до нуля. Таким образом, судьба конкретной модели зависит от одного вопроса: находятся ли каналы, кодирующие нужное вам поведение, рядом с этими аутлайерами или они оказываются в области низких магнитуд, которую удаляет процесс сжатия?
В основе этого лежат предыдущие исследования, показывающие, что склонность модели к отказу определяется лишь несколькими направлениями в пространстве активации (Arditi и соавторы в 2024 году, а также Pan и соавторы в 2025 году), причем согласованность реализуется уже в первых токенах вывода (Qi и соавторы в 2025 году). То, как шум компрессии влияет на эти направления, полностью зависит от того, перекрываются ли соответствующие каналы с доминирующими аутлайерами, для которых квантизатору приходится выделять место. Именно такое структурное совпадение, а не количество параметров или метод обучения, определяет возможность существования модели.
Почему не может существовать универсальный стандарт для ширины бита
Контраст, определяющий исход спора, крайне резок. Qwen-2.5-7B теряет работоспособность при 6 битах, в то время как Gemma-2-9B остается функциональной даже при 3 битах. Оба модели относятся к категории инструкционно настроенных моделей объемом от 7 до 9 миллиардов параметров, созданных с использованием практически одинаковых технологических процессов, однако разница в четыре бита приводит к тому, что эти модели, которые можно было бы считать взаимозаменяемыми, на самом деле несовместимы. Политика вида «наш стандарт — 4-битный кэш KV» поэтому не несет никакой практической пользы: она совершенно безопасна для одной из моделей, но катастрофична для другой, причем в самой модели отсутствует информация о том, к какому случаю относится текущая ситуация.
Чтобы превратить это в что-то, что можно проверить перед запуском, исследование предлагает диагностический инструмент под названием Per-Channel Reduction, который заранее классифицирует модель в одну из трех определенных категорий сбоев. Это и является его практической ценностью, к тому же он достаточно дешев, чтобы его можно было включить в стандартные процедуры предварительной настройки перед развертыванием.
Обобщение, к которому исследование не приходит
Всё вышесказанное касается отказов ради безопасности, и здесь важна точность: отказы — единственное поведение, которое фактически измерялось в исследовании. Однако взгляните ещё раз на требования механизма. Ему нужно поведение, сосредоточенное в небольшом подпространстве, в сочетании с метрикой, усредняющей показатели по более большому пространству. Отказы соответствуют обоим критериям. Нет очевидных причин, по которым именно они являются единственным таким поведением, и расширение этих выводов на столь широкие масштабы представляет собой экстраполяцию, а не задокументированный результат.
Возьмём Document AI, где несколько способов работы имеют именно такой профиль. Одним из них является соблюдение схемы: результатом должен быть JSON, соответствующий заданной структуре, или же модель будет постоянно возвращать к этой структуре. Ещё один аспект — решение о том, заполнять ли пустые поля или придумывать для них значения: если модель не может прочитать поле, оно должно отображаться как пустое или заполняться чем-то правдоподобным. Оценка процесса извлечения информации намеренно разделяет случаи пропуска данных и их фальсификации, поскольку последствия этих действий сильно отличаются: фальсифицированное значение во входящем документе приводит к созданию ложной записи о запасах, тогда как пропущенное значение лишь вызывает создание заявки на поддержку, причём только первый случай скрывает проблему. Ещё одним критерием является корректность вызова инструмента: модель должна выполнять действительно валидный вызов или же выдавать результат, который просто выглядит как текст.
Каждое из этих явлений представляет собой определённое поведение модели, а не распределение вероятностей между токенами. Модель может показать вполне приемлемый уровень перплексности для основного текста документа, при этом тайно выбирая значение, для которого у неё нет никаких оснований для его определения, причём квантизация, направленная на обеспечение точности на уровне отдельных полей, практически не существует. Вопрос о том, приводят ли эти явления к одинаковым результатам, остаётся открытым и, по-видимому, не опубликованным, что и является аргументом в пользу его измерения вместо угадывания.
Три простых изменения, которые можно внести сейчас
Ни один из этих факторов не стоит дорого. Добавьте в свой механизм квантизации проверку поведения, которая будет представлять собой не результат тестирования на производительность, а чистое количество проявлений определённого поведения для фиксированного набора запросов, измеренное с полной точностью, а затем при целевой ширине битов; сравните результаты напрямую. Выберите такое поведение, ради которого ваш продукт действительно будет способен разбудить человека. Перестаньте рассматривать ширину битов как параметр, который используется всей командой — она принадлежит конкретной модели, а возможно, и её версии, поэтому проверка должна выполняться заново при каждом обновлении. Также следует избегать кумулятивного эффекта, ведь пример спекулативной декодировки показывает: две оптимизации по отдельности казались хорошими, но вместе они устранили определённую функциональность; поэтому необходимо проверять весь комплекс методов квантизации, сокращения данных и спекулативной декодирования в целом, а не только отдельные их элементы.
Учтите все ограничения перед приведением цифр
Честность в отношении имеющихся доказательств является частью их правильного использования. Речь идет о предварительной версии статьи, написанной тремя исследователями, которая все еще находится на рассмотрении; она состоит примерно из 61 страниц с девятью рисунками. Это значительный объем материала, однако экспертная оценка еще не завершена, поэтому ее следует рассматривать скорее как убедительный аргумент, чем как окончательный вердикт. Приведенные в статье цифры также отличаются незначительно между публикацией на arXiv и версией, находящейся на рассмотрении: последняя имеет другое название и содержит дополнительный результат, касающийся форматов FP8 в vLLM. Прежде чем цитировать какое-либо конкретное число, необходимо скачать актуальную версию PDF и проверить ее лично, вместо того чтобы полагаться на косвенные сводки. Расширение концепции на поведение механизмов извлечения также является выводом на основе описанного механизма, а не утверждением самой статьи; логика подкрепляет это, но логика сама по себе не является доказательством.
То, что можно считать безопасным для использования, ограничено более узкими рамками и менее стабильно, чем указанные в заголовках цифры: если измерять только вероятности, то невозможно заметить момент, когда тот или иной вид поведения исчезает. Это было верно ещё до публикации данного исследования. Заслуга работы заключается в том, что она приводит конкретные цифры для подтверждения этого факта.
Список литературы
- "Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation" (предварительная версия). Идентификатор arXiv:2606.09864v2; опубликовано 8 августа 2026 года.
- Пересмотренная версия в системе OpenReview под идентификатором
BqKhzrtkGe, посвящённая аудиту процесса развертывания продолжительностью около 35 минут; в ней добавлены результаты по форматам FP8 в модели vLLM. - Ардити и соавторы (2024) и Пан и соавторы (2025) о том, что процесс отклонения контролируется несколькими направлениями в пространстве активаций.
- Ци и соавторы (2025) о том, что процесс согласованности происходит в первых же токенах вывода.
Связанная литература
- Что означают предупреждения об безопасности ИИ от бывших исследователей Anthropic для разработчиков — В этой статье объясняется, почему предупреждения исследователей о рисках ИИ важны для обычных разработчиков, и как автономия агентов и проблемы согласованности должны влиять на практические нормы безопасности.
- Fugu Ultra: Как модель-оркестратор ИИ бросает вызов GPT и Claude — Рассказывается, как Fugu Ultra v2 от Sakana AI распределяет задачи между специализированными моделями вместо использования одной огромной LLM, а также каковы её показатели в тестах, цены и уровень прозрачности.
- Почему загрузка модели объемом 17 ГБ не означает наличия 17 ГБ памяти для ее работы — Узнайте, как активные параметры, общее количество параметров, рост кэша KV и усилия по обработке информации определяют реальные затраты на память и вычисления при локальной работе с языковой моделью.