Коли етапи квантування спричиняють плутанину та тихо порушують безпеку моделі
Квантація кешу KV з низькою кількістю бітів може усунути ефект відмов моделі, при цьому показник перплекситету майже не змінюється; ось чому стандартні метрики це не фіксують та що слід додати до вашого механізму керування.
Одне лише це показник має занепокоїти кожного, хто використовує стиснуті моделі. У дослідженні, яке охоплювало одинадцять моделей, налаштованих під конкретні завдання, з кількістю параметрів від 3,8 млрд до 72 млрд, та протестувало їх на п’яти тестових сценаріях та 1 894 запитах, стиснення кешу KV при низькій ширині бітів призвело до того, що Mistral-7B відмовився у виконанні завдань на 15,2% частіше. Зміна показника перплекситету внаслідок цього стиснення склала 1,03. Зміна на три відсотки — це рівень змін, який більшість команд вважає шумом вимірювань та проходить повз без особливої уваги. Зазвичай для схвалення квантованої версії достатньо стабільного показника перплекситету, стабільної точності виконання завдань та зниженого часу відгуку, і саме ці критерії могли б схвалити цю версію. Далі наведено дослідження, яке зафіксувало цей ефект, механізм, що його пояснює, та невелику серію змін у параметрах квантації, щоб жодна з функцій не зникла, при цьому всі показники на панелі керування залишалися стабільно в нормі.
Що було задокументовано в дослідженні
Це попереднє видання роботи під назвою „Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation“ (arXiv:2606.09864). Її теза є неприємною та прямою: агресивне стиснення KV-кешу може тихо зруйнувати безпекову налаштованість моделі; жодна конкретна ширина біта не є безпечною для всіх моделей; крім того, це руйнування відбувається як раптова зміна для кожної окремої моделі, яку метричні команди зазвичай вважають недостатньо значущою для фіксації. Оскільки робота ще не пройшла рецензування, доцільно сприймати її як переконливий приклад, а не як остаточний висновок, що варто знову розглянути наприкінці.
Слово, яке несе в собі сенс цієї тези, — невидимий. Це не просто щось тьмяне чи важке для спостереження, а щось, що неможливо виявити за допомогою звичайних інструментів, адже ці інструменти вимірюють іншу величину, ніж та, яка не функціонує належним чином. Найяскравіша демонстрація використовує спекулятивне декодування — саме на ньому ґрунтуються команди з прискорення обробки даних, щоб робити процес інференсу на пристрої прийнятним. За допомогою 4-бітної моделі, яка виконувала роль верифікатора, частка відмов знизилася з 63,2% до 0,0%, тоді як частка успішних обробок залишилася на рівні 23,5%, а пропускна здатність — 17,0 токенів на секунду; обидва показники знаходилися у нормальних межах. Одна з характеристик опустилася до нуля, тоді як усі інші показники залишилися в нормі.
Механізм, який варто зберегти
Самі лише страшні цифри вже є заголовком новини; причина, яка стоїть за ними, — це те, навколо чого можна побудувати процес, і ця причина має геометричний характер. Функції, відповідальні за безпечну поведінку, знаходяться у вузькому сегменті простору активації, і дослідження оцінює, що цей сегмент у 100–1 000 разів чутливіший до шуму компресії, ніж великий простір, який описує показник перплексності.
Ця оцінка варта уваги, адже саме вона є ключовою. Перплексність — це єдине число, яке формується на основі кожного з вимірів, що використовується моделлю. Якщо розподілити невелику кількість похибок між тисячею таких вимірів, це число буде помічати зміни. Якщо повністю усунути три виміри, залишивши решту тисячу недоторканими, це число майже не зміниться, оскільки підсумок, який домінується недоторканою більшістю, залишається стабільним.
Наступний крок пояснює, чому одна модель не працює, а інша — працює, і все зводиться до структури. Квантування групи значень змушує обирати масштаб, достатньо великий для того, щоб вмістити найбільше значення. Активації містять винятки — окремі канали, амплітуда яких у багато разів перевищує амплітуду сусідніх, і саме ці винятки визначають діапазон. Коли рівні розтягуються, щоб охопити їх, будь-яке значення, яке значно нижче першого рівня, зменшується до нуля. Тож доля певної моделі залежить від одного запитання: чи знаходяться канали, які кодують поведінку, на яку ви покладаєтесь, поблизу цих винятків, чи вони опиняються у регіоні низької амплітуди, який стирається під час компресії?
У цій роботі ґрунтується на попередніх результатах, які показують, що схильність моделі до відмови керується лише кількома напрямками у просторі активації (Arditi та співавтори у 2024 році, а також Pan та співавтори у 2025 році), і що вирівнювання відбувається переважно у перших токенах вихідного результату (Qi та співавтори у 2025 році). Те, як шум компресії впливає на ці напрямки, залежить повністю від того, чи перетинаються залучені канали з домінантними відхиленнями, для яких квантизатор мусить знайти місце. Саме ця структурна збігненість, а не кількість параметрів чи метод навчання, визначає можливість існування моделі.
Чому не може існувати стандарт для ширини біта
Контраст, який визначає різницю між моделями, є різким. Qwen-2.5-7B припиняє функціонувати на рівні 6 біт, тоді як Gemma-2-9B залишається працездатною навіть при 3 біт. Обидві це моделі, налаштовані під виконання інструкцій, з обсягом параметрів від 7 до 9 мільярдів, створені за схожими технологічними процесами, проте різниця у чотирьох бітах робить їх незамінними одна для одної. Тож політика у форматі „Наш стандарт — це 4-бітний кеш KV“ не надає жодної корисної інформації: вона цілком прийнятна для однієї з моделей, але катастрофічна для іншої, причому жоден з елементів, що постачаються разом із моделлю, не вказує, у якому саме випадку ви знаходитеся.
Щоб перетворити це на щось, що можна протестувати перед впровадженням, дослідження пропонує діагностичний інструмент під назвою Per-Channel Reduction, який заздалегідь класифікує модель на одну з трьох окремих категорій несправностей. Це і є її практичною користю, крім того, використання цього інструменту достатньо недороге, щоб його можна було включити до звичайних процедур підготовки перед розгортанням.
Узагальнення, якого дослідження не робить
Усе вищесказане стосується відмов заради безпеки, і тут важлива точність: саме відмови — це єдина поведінка, яку насправді вимірювали у дослідженні. Проте знову подивіться, що вимагає цей механізм. Він потребує поведінки, концентрованої у невеликому підпросторі, у поєднанні з метрикою, яка бере середнє значення у великому просторі. Відмови відповідають обом критеріям. Не існує очевидної причини, чому саме ця поведінка єдина, яка їм відповідає, а розтягування цього висновку на такі межі є екстраполяцією, а не задокументованим результатом.
Візьмемо Document AI, де кілька моделей поводяться саме так. Одним із критеріїв є дотримання схеми: чи є результат у форматі JSON, який відповідає запланованій структурі, чи модель постійно повторює цю структуру. Ще одним критерієм є рішення щодо порожніх та вигаданих значень: чи поле, яке модель не може прочитати, відображається як порожнє, чи заповнюється чимось правдоподібним. Оцінка процесу вилучення даних навмисно розділяє випадки пропуску та фальсифікації, оскільки наслідки цих дій суттєво відрізняються – фальсифіковане значення у документі створює фіктивний запис інвентаря, тоді як пропущене значення лише викликає заявку на підтримку, причому лише перший випадок приховує справжню проблему. Ще одним критерієм є правильність виклику інструменту: чи модель створює коректний виклик, чи просто формує текстовий результат.
Кожен з цих варіантів є проявом певної поведінки, а не розподілом ймовірностей між токенами. Модель може показувати цілком прийнятний рівень перплексності для основного тексту документа, водночас таємно обираючи значення, яке у неї немає підстав читати, а квантизаційні методи, спрямовані на точне визначення значень на рівні полів, практично відсутні. Чи будуть ці прояви поведінки проявлятися таким самим чином, залишається відкритим питанням, яке, схоже, ще не було опубліковано; саме тому доцільно вимірювати це, а не здогадуватися.
Три прості зміни, які можна внести зараз
Жоден з цих елементів не коштує багато. Додайте до вашого механізму квантування поведінкове твердження, яке буде не показником бенчмарку, а суто кількісним підрахунком певної конкретної поведінки для фіксованого набору запитів, взятим з повною точністю та знову при цільовій ширині бітів, після чого їх потрібно порівняти один з одним; оберіть таку поведінку, заради якої ваш продукт справді мав би розбудити людину. Припиніть розглядати ширину бітів як параметр, який використовує вся команда, адже вона належить окремій моделі та, можливо, окремій версії моделі, тому перевірку потрібно проводити знову після кожного оновлення. Також слід уникати сумування ефектів, адже приклад спекулятивного декодування показує: дві оптимізації окремо здавалися хорошими, але разом вони позбавили модель певної функціональності, тому необхідно перевіряти весь комплекс процедур квантування, прунінгу та спекулятивного декодування, а не лише їх окремі частини.
Врахуйте усі обмеження перед наведенням цифр
Чесність щодо наявних доказів є частиною їхнього правильного використання. Це предпринт, написаний трьома дослідниками, який все ще перебуває на розгляді; його довжина становить приблизно 61 сторінку з дев’ятьма ілюстраціями. Це значна кількість інформації, але оскільки рецензування ще не завершено, його слід розглядати як переконливий аргумент, а не остаточний висновок. Наведені цифри також з’являлися у трохи іншій формі як у публікації на arXiv, так і у версії, що перебуває на розгляді — остання має іншу назву та додає результати щодо форматів FP8 у vLLM. Перш ніж цитувати будь-яку конкретну цифру, отримайте поточний PDF та підтвердьте його особисто, замість того щоб покладатися на сторонній огляд. Розширення цих механізмів на поведінку процесу вилучення інформації також є висновком, а не твердженням самої статті; логіка це підтримує, але логіка — це не доказ.
Те, що можна безпечно взяти з собою, є вужчим та міцнішим, ніж кажуть заголовкові цифри: якщо вимірювати лише ймовірності, ви не помітите моменту, коли певна поведінка зникає. Це було актуально ще до публікації цього дослідження. Внесок дослідження полягає у тому, що воно надає цьому конкретну цифру.
Посилання
- "Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation" (пре-принт). Ідентифікатор arXiv:2606.09864v2; опубліковано 8 серпня 2026 року.
- Ревізія у форматі огляду, перейменована після аудиту реалізації тривалістю близько 35 хвилин, на OpenReview під
BqKhzrtkGe; у ній додається результат щодо форматів FP8 у vLLM. - Arditi та співавтори (2024) та Pan та співавтори (2025) про те, що відмову контролюють кілька напрямків у просторі активації.
- Qi та співавтори (2025) про те, що узгодженість концентрується у найранніших токенах вихідного результату.
Пов’язана література
- Що означають попередження про безпеку ШІ від колишніх дослідників Anthropic для розробників — У цій статті пояснюється, чому попередження дослідників щодо ризиків ШІ мають значення для звичайних розробників, та як автономність агентів та прогалини у взаємодії мають впливати на практичні норми безпеки.
- Fugu Ultra: Як модель-оркестратор ШІ кидає виклик GPT та Claude — Пояснюється, як модель Fugu Ultra v2 від Sakana AI розподіляє завдання між спеціалізованими моделями замість одного величезного LLM, а також як вона порівнюється за показниками тестів, ціною та прозорістю.
- Чому завантаження моделі об’ємом 17 ГБ не означає, що для її роботи потрібно 17 ГБ пам’яті — Дізнайтеся, як активні параметри, загальна кількість параметрів, зростання кешу KV та складність міркувань впливають на фактичні витрати пам’яті та обчислень для роботи мовної моделі локально.