Strona główna / Artykuły / Gdy etapy kwantyzacji wprawiają w zakłopotanie i po cichu niszczą bezpieczeństwo modelu

Gdy etapy kwantyzacji wprawiają w zakłopotanie i po cichu niszczą bezpieczeństwo modelu

Kwantyzacja pamięci KV o niskiej liczbie bitów może wyeliminować sytuacje odrzucenia modelu, przy jednoczesnym prawie braku zmian w wartości perplexity; oto dlaczego standardowe metryki tego nie wykrywają oraz co należy dodać do swojego mechanizmu gate.

1625 słów

Jedna tylko miara powinna zaniepokoić każdego, kto wysyła skompresowane modele. W ocenie obejmującej jedenaście modeli dostosowanych do instrukcji o liczbie parametrów od 3,8 miliarda do 72 miliardów, przetestowanych na pięciu benchmarkach i przy użyciu 1 894 promptów, skompresowanie pamięci KV o niskiej szerokości bitowej spowodowało, że Mistral-7B odmówił realizacji zadań w 15,2% przypadków. Zmiana poziomu perplexity przy tej samej kompresji wyniosła 1,03. Przesunięcie o trzy procenty to taka zmiana, którą większość zespołów uznałaby za szum pomiarowy i odrzuciła bez dalszych rozważań. Zwykłe kryteria akceptacji dla wersji kwantyzowanej – stały poziom perplexity, stała dokładność wykonywania zadań oraz zmniejszona latencja – pozwoliłyby na zatwierdzenie tej wersji. Poniżej znajduje się opracowanie dokumentujące ten efekt, mechanizm go wyjaśniający oraz krótki zestaw zmian w mechanizmie kwantyzacji, dzięki którym dane funkcje nie znikną, podczas gdy wszystkie wskaźniki pozostaną na pożądanych poziomach.

To, co udokumentowało badanie

To jest wersja przedpublikacyjna artykułu zatytułowanego „Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation” (arXiv:2606.09864). Jego teza jest nieprzyjemna i bezpośrednia: agresywna kompresja pamięci KV może po cichu zniszczyć zgodność modelu z zasadami bezpieczeństwa; żadna szerokość bitowa nie jest bezpieczna we wszystkich modelach; a ten załam jest nagłą zmianą charakterystyczną dla konkretnego modelu, której wskaźniki, którym zwykle ufają zespoły analityczne, po prostu nie są w stanie wykryć. Ponieważ artykuł jeszcze nie przeszedł recenzji przez rówieśników, rozsądne jest traktowanie go jako przekonującego argumentu, a nie ostatecznego wniosku – kwestię tę warto ponownie rozważyć na końcu.

Słowo niosące ciężar tej tezy to niewidzialny. Nie chodzi tu tylko o słabo widoczność lub trudność w dostrzeżeniu, lecz o to, że nie da się go wykryć za pomocą powszechnie używanych narzędzi, ponieważ te narzędzia mierzą inną wielkość niż ta, która zawodzi. Najbardziej wymownym przykładem jest speculatywne dekodowanie, na którym polegają zespoły zajmujące się przyspieszeniem, aby umożliwić przetwarzanie na urządzeniu. Dzięki modelowi 4-bitowemu pełniącemu rolę weryfikatora, wskaźnik odrzuceń spadł z 63,2% aż do 0,0%, podczas gdy wskaźnik akceptacji pozostał na poziomie 23,5%, a prędkość przetwarzania na 17,0 tokenów na sekundę – oba wartości znajdują się w normie. Jedna z cech spadła do zera, podczas gdy wszystkie pozostałe wskaźniki wyglądały normalnie.

Mechanizm, który warto zachować

Samych przerażających liczb wystarcza, by stworzyć nagłówek; to logika stojąca za nimi pozwala opracować odpowiedni proces, a ta logika ma charakter geometryczny. Cechy odpowiadające za bezpieczne zachowanie znajdują się w wąskim fragmencie przestrzeni aktywacji, a badanie szacuje, że ten fragment jest od 100 do 1000 razy bardziej wrażliwy na szum kompresji niż cała rozległa przestrzeń opisana przez miarę perplexity.

To szacunki są istotne, ponieważ stanowią sedno sprawy. Perplexity to pojedyncza liczba obliczana na podstawie wszystkich wymiarów wykorzystywanych przez model. Jeśli rozproszyć niewielką ilość błędu na tysiącu z tych wymiarów, ta suma będzie to rejestrować. Jeśli natomiast całkowicie usunąć trzy wymiary, pozostawiając nienaruszone pozostałe tysiąc, liczba prawie się nie zmieni, ponieważ podsumowanie oparte na nienaruszonej większości wymiarów pozostaje stabilne.

Kolejny krok wyjaśnia, dlaczego jeden model przestaje działać, a inny nie – chodzi tu o strukturę. Kwantyzacja grupy wartości wymusza wybór skali wystarczająco dużej, aby pomieścić największą z nich. Aktywacje zawierają wartości ekstremalne, pojedyncze kanały, których wielkość przewyższa o rzęd wielkość sąsiadujących z nimi kanałów, i to właśnie te wartości ekstremalne określają zakres. Gdy poziomy są rozciągane, by je objąć, każda wartość znacznie poniżej pierwszego poziomu spada do zera. Dlatego los danego modelu zależy od jednego pytania: czy kanały kodujące zachowanie, na którym polegasz, są skupione w pobliżu tych wartości ekstremalnych, czy też znajdują się w obszarze o niskiej wielkości, który usuwa kompresja?

Artykuł opiera się na wcześniejszych wynikach pokazujących, że skłonność modelu do odrzucania jest determinowana jedynie przez kilka kierunków w przestrzeni aktywacji (Arditi i współpracownicy w 2024 roku oraz Pan i współpracownicy w 2025 roku), a zgodność z celem jest umieszczana już w pierwszych tokenach wyjściowych (Qi i współpracownicy w 2025 roku). To, w jaki sposób szum kompresji wpływa na te kierunki, zależy wyłącznie od tego, czy zaangażowane kanały pokrywają się z dominującymi wartościami odstępczymi, dla których kwantyzator musi znaleźć miejsce. To właśnie ta strukturalna zbieżność, a nie liczba parametrów czy metoda szkolenia, decyduje o przetrwaniu modelu.

Dlaczego nie może istnieć standard domowy dla szerokości bitu

Różnica, która decyduje o wyniku porównania, jest uderzająca. Qwen-2.5-7B przestaje funkcjonować przy 6 bitach, podczas gdy Gemma-2-9B pozostaje sprawna przy 3 bitach. Oba są modelami dostosowanymi do instrukcji o pojemności od 7 do 9 miliardów parametrów, stworzonymi przy użyciu w dużej mierze podobnych procesów, a jednak czterobitowa różnica oddziela dwa modele, które można by uznać za zamienne. Zasada w stylu „naszym standardem jest bufor KV o pojemności 4 bitów” nie dostarcza więc żadnych użytecznych informacji: jest w pełni bezpieczna dla jednego z tych modeli, ale katastrofalna dla drugiego, a żaden element dostarczany wraz z modelem nie wskazuje, który przypadek ma miejsce.

Aby przekształcić to w coś, co można przetestować przed wprowadzeniem do użycia, badanie proponuje narzędzie diagnostyczne o nazwie Per-Channel Reduction, które z góry klasyfikuje model do jednej z trzech odrębnych kategorii awarii. To jest jego praktyczna wartość, a koszt jego zastosowania jest na tyle niski, że można go włączyć do standardowych działań przed wdrożeniem.

Uogólnienie, którego badanie nie podejmuje

Wszystko powyższe dotyczy odmów związanych z bezpieczeństwem, a precyzja ma tu kluczowe znaczenie: to właśnie odmowy są jedynym zachowaniem, które faktycznie zmierzył ten artykuł. Jednak przyjrzyjmy się ponownie temu, czego wymaga ten mechanizm. Potrzebuje on zachowania skoncentrowanego w małym podprzestrzeni, połączonego z metryką, która przeciętnia wartości w dużym obszarze. Odmowa spełnia oba te warunki. Nie ma oczywistego powodu, dla którego to jedynie takie zachowanie je spełnia, a rozszerzanie tych ustaleń w ten sposób stanowi ekstrapolację, a nie udokumentowany wynik.

Weźmy przykład Document AI, gdzie kilka zachowań ma dokładnie taki sam profil. Jednym z nich jest przestrzeganie schematu: czy wynik to JSON zgodny z zamierzoną strukturą, czy też powtarza tę samą strukturę. Innym problemem jest decyzja dotycząca pustych wartości wobec wymyślonych: czy pole, którego model nie może odczytać, jest podawane jako puste, czy też uzupełniane czymś wiarygodnym. Oceny procesu wydobywania danych celowo rozróżniają pominięcia od fałszerstw, ponieważ ich konsekwencje są znacznie różne – wymyślona wartość w dokumencie powoduje powstanie fałszywego wpisu w inwentarzu, podczas gdy pominięcie danej informacji prowadzi jedynie do otwarcia zgłoszenia obsługi klienta, przy czym tylko pierwszy przypadek skutkuje ukryciem informacji. Trzecim elementem jest prawidłowe formułowanie wywołań narzędzi: czy model generuje ważne wywołanie, czy też wynik, który jest po prostu tekstem.

Każde z tych zachowań stanowi konkretną postawę modelu, a nie rozkład prawdopodobieństwa dla tokenów. Model może wykazywać całkiem przyzwoitą wartość perplexity w odniesieniu do treści dokumentu, jednocześnie potajemnie wybierając wartość, której nie miał podstaw do odczytania, a kwantyzacja mająca na celu uzasadnienie decyzji na poziomie poszczególnych pól praktycznie nie istnieje. To, czy te zachowania zachowują się w ten sam sposób, to otwarte pytanie, najwyraźniej jeszcze nieopublikowane, co stanowi dokładnie argument za pomiarami zamiast domysłów.

Trzy tanie zmiany, które można wprowadzić teraz

Rozważ wszystkie zastrzeżenia przed podaniem liczb

Bądźmy szczerzy co do dostępnych dowodów – to część ich prawidłowego wykorzystania. Jest to wersja przedpublikacyjna napisana przez trzech badaczy, nadal pod oceną recenzentów; ma około 61 stron i zawiera dziewięć rysunków. To spora ilość materiału, ale ponieważ recenzja nie została jeszcze zakończona, należy ją traktować jako mocny argument, a nie ostateczną decyzję. Przedstawione dane pojawiają się również w nieco innej formie pomiędzy wersją opublikowaną na arXiv a wersją poddawaną ocenie – ta druga ma inne tytuły i dodaje informacje na temat formatów FP8 w vLLM. Zanim przytoczymy jakąkolwiek konkretną liczbę, należy pobrać najnowszy plik PDF i sprawdzić go osobiście, zamiast polegać na streszczeniach pochodzących od innych. Rozszerzenie tego mechanizmu na zachowania związane z ekstrakcją jest również wnioskiem wynikającym z samego mechanizmu, a nie twierdzeniem zawartym w artykule; logika to potwierdza, ale logika sama w sobie nie jest dowodem.

To, co można bezpiecznie zabrać ze sobą, jest węższe i bardziej odporne niż podawane ogólne liczby: mierząc jedynie prawdopodobieństwa, pozostaniemy ślepi na moment, w którym dane zachowanie znika. Było to prawdą już przed publikacją tych badań. Zasługą tego badania jest nadanie temu wartości liczbowej.

Referencje

  • "Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation" (przedruk). Identyfikator arXiv:2606.09864v2; opublikowano 8 sierpnia 2026 roku.
  • Poprawka w formie recenzji, przemianowana pod kątem audytu implementacji trwającego około 35 minut, dostępna na OpenReview pod adresem BqKhzrtkGe; zawiera wyniki dotyczące formatów FP8 w vLLM.
  • Arditi i współpracownicy (2024) oraz Pan i współpracownicy (2025) na temat tego, że odmowy są kontrolowane przez kilka kierunków w przestrzeni aktywacji.
  • Qi i współpracownicy (2025) na temat koncentracji zgodności w najwcześniejszych tokenach wyjściowych.
  • Ashkboos i współpracownicy, „QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs”, arXiv:2404.00456.
  • Literatura pokrewna