Калі час перакантэнзацыя падвышае пэрплексітэт і таямні наражае на абяранне модэлю
Квантыяцыя кэша KV з нізкім коллекшанам бітоў можа усунуць адмовы модэлю, пры чым парапсіцыя практычна не зменяецца; гэтаму стандартныя метрыкі яго не фіксуюць, і што трэба дадаць у вашу систему кантролю.
Адзін показначык мусіць вызваць абяранне ў кожнага, хто апрабоўвае стиснутыя моделі. У аналізе, які включаў аж 11 модэляў, настроеных па спецыяльным інструкцыям, з колькасцю параметраў ад 3,8 мільярда да 72 мільярда, працаваныя на п’яці тэстовых сценарыях і з 1 894 запитамі, стысненне KV-кэша з метой змены шырыны біта прывела да таго, што Mistral-7B паспеў ухіліцца ад 15,2% своіх непрацяснаеў. Змена пэрплексітэту пад час такога ж стыснення склалася 1,03 раза. Змена на тры процэнты — гэта такі розмěр змян, які большасць командаў прыймае за шум меравання і не звертае на яго ўвагі. Звычны критэрыя для затверджэння квантаванага варыянта — стабільная пэрплексітэт, стабільная точнасць выканання задач і змена латэнціі — моглі б падтрымаць гэты варыянт. Далей прадстаўлены доследжэнне, якое зафіксаваў адзинак, механізм, які яго пояснюе, а таксама кароткі набор змян у прыстрое квантавання, якія дазволяюць падтрымваць усе можлівасці, калі всі показначыкі на панелі керування застаюцца стабільна позытывнымі.
Што задокументавала даследжэння
Эта праця ў виглядзе прадрукту пад назвай „Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation“ (arXiv:2606.09864). Яе тэза ўскладненая і прымусовая: агрэсіўнае стисненне KV-кеша можа таямна разрушыць аліняванне безпекі моделі; жадны конкрэтны шырыні біта не є безпечныя для всіх модэлей; а гэты злам выражаецца у раптовай, спецыфічной для кожнай моделі змяне, якую команды з метрык зазвычай вважаюць немагчымой зафіксаваць. Паколькі праця ўжо не пройшла рэвізію колег, правым падходам є спрыяць яе як пераконлівы прыклад, а не як вирок, што варта ўзглянуць знову напрыканце.
Слова, які выражаюць сэнс гэтай тэзы, — невядомае. Ёна не проста слабкая або важкадаступная, але і ўсіма звычайнымі прыборамі немагчыма яе выявіць, адколі гэтыя прыборы фіксуюць іншую величыну, чым тая, якая не працюе. Найболей яскравы прыклад — спекулятивная дэкодаванне, якае саме і викорыстоўваюць команды з працэй з прышвартаванням, каб робіць вырахункі на самым прыстрое можлівымі. За дапамогою 4-бітнага модэлю, які выступае ў ролі пераканальніка, практыка адхоўкі знизилася з 63,2% да 0,0%, тады калі практыка адзначэння застаўся на роўні 23,5%, а шырочае працэўванне — 17,0 токеноў за секунду; оба показнікі былі ў нормальных межах. Адна з характерыстыкаў вырашылася на нулі, тады калі всі іншы показнікі застаўся нормальнымі.
Механізм, які ўартуе зберагчы
Самыя страшныя цифры вже ўтвараюць загалоўку; прычыны, якія стояць за імі, — гэта тое, адносна чаго можна стварыць практычны процес, і гэтыя прычыны маюць геаметрычны характар. Функцыі, якія адпаведна за безбедную дзеяльнась, знаходзяцца ў вузкай частцы простора актываціі, і доследжэнне практычна вырахавала, што гэтая частка ў 100–1 000 разоў чутлівейшая да шуму компрэсіі, чым вялікі простор, які паспраўджвае панэрозцю.
Гэтыя практычна вырахаваны значэння вартуюць увагі, бо ў яных крыўця сэрца. Панэрозць — це адна-едынственная цифра, якая формуюцца на адной з усіх вымераў, якія викорыстоўвае модель. Якщо розпаставіць невялікую колькасць пакрыцця ў тыяй тысячы вымераў, то гэтае сумарнае значэнне будзе ўсё ж зазначальным. А якщо цэлыя тры вымеры будуць знишчаны, а рэшта тысяча застанется цілой, значэнне практычна не змяніцца, адтуды што панэрозць залишаецца стабільной, калі ёй домінуе недастрыжаная большасць вымераў.
Наступны выкладкі паяснююць, чаму адзін модель не працуючы, а іншы — працуе, і гэта залежыць ад структуры. Квантавацыя групы значэння вымагае выбору масштабу, дастаткова великага, каб ён пасваяў самаму большаму значэнню. Актывацыі маюць экстраполяты — адзінаковыя каналы, чыя велічыны на ступень перавышаюць велічыны суседніх, і саме гэтыя экстраполяты вялі за дыапазон. Калі рэвалюцыі растягваюцца, каб падыходзіць да ўсіх іх, будзь-якае значэнне, якое знаходзіцца далека пад першым рэвалюцыям, зменшваецца да нуля. Такім чынам, доля конкрэтнага модэля залежыць ад адной-едзінай запитання: чы розташаваны каналы, якія кодуюць патрабуемае вам прыменшэння, поблізу гэтых экстраполятаў, чы ўони застрялі ў регіёне низкай велічыны, які ствараецца пад час кампрэсіі?
У гэтай робаце апоўнюецца паказанымі ранейшымі рэзультатамі, якія паказваюць, што тэндэнцыя моделі да адмовы кантролюецца толькі калькама напрамоў у прасторе актывацыі (Arditi і саавтары у 2024 годзе, а таксама Pan і саавтары у 2025 годзе), а таксама што супаралелізацыя выражаецца ў першых токенах выходу (Qi і саавтары у 2025 годзе). Тое, як шум кампрэсіі паўтарыцца на гэтыя напрамы, зависіць абоўсюдзе ад таго, чыя каналы перакрываюцца з домінантнымі аўтсамостоямымі даннымі, для якіх квантайзеру трэба знайсці месца. Саме гэта структурнае збыранне, а не колькасць параметраў чы метод трэніравання, вялікае за выжыванне моделі.
Чаму не можа існаваць стандарт для шырыны біта
Контраст, які выявляецца пад час аналізу, ўражаючы. Модель Qwen-2.5-7B перестае працаваць пад 6 біт, тады як Gemma-2-9B застаецца справнай пад 3 біт. Ббы тое ўжо, аднае і другая — это моделі, налаштаваныя пад конкрэтыя інструкціі, з розмірам меморыі 7–9 мільярдаў елементаў, створаныя за аднаковымі тэхналогічнымі процесамі; пры тым чатырохбітная розніца разлучае два моделі, якія можна было б спачатку счыляць заменнымі. Палітрыка, якая гласіць «наш стандарт — 4-бітны KV-кэш», таму не несе жадных корыстных інформацый: яна абсалютна безпечная для одной з модэляў, але катастрофічная для іншай, пры тым жадных пазнакаў, якія б супроводзілі саму модель і паказалі, які самэў разыграўся случай, няма.
Ёбы ператворыць гэта на ўсё, што можна працаваць перад запускам, у даследжэнні пропонуецца дыагностычны інструмент пад назвай Per-Channel Reduction, які заздалегідь класіфікуе модель у адну з трох разных категорый несправнасцяў. Гэта і ёст тэхнічная частка цього інструмента, і ён настаўна дасканальны, ёбы яго можна было включыць у стандартныя прабыты пры падготовцы модэля да запуску.
Узагальненне, якога даследжэнне не робіць
Усе вышесказанае стосуецца адмовэнняў з метай безпекі, і тут важна точнасць: адмовэнняя ўсё, што на самай працы было вымерана. Аднак зноў пагляньце на тое, чыя трэба механізму. Яму патрэбна поведенчаска характэрыстыка, концентраваная ў маленькай падпросторы, якая была бы супакоўвана з метрыкай, якая выраховваеся на большой падпросторы. Адмовэння пасходзіць па обох критэрыях. Не існуе явных прычын, чаму самэўсёльва гэтае ёстабельнае поведанне, а распрашчэнне гэтых нараджэнняў так далека ёсць экстраполяцыяю, а не задокументаваным рэзультатам.
Узьмем, прыкладам, Document AI, дзе калькіяя поведэнцыяя маюць абсалютна такі ж профіль. Адпаведнае дагадваннея пра схему — гэта адна з ягоў ступеняў: чы результатам ёсць JSON, які адпавядае планаванай структурэй, чы ён проста прабуея перадаць вам тую ж структурэю знову. Іншыя ступені — гэта выбор межаю чыстам прострам і выдуманым дадзенням: чы поле, якое модэль не можа прачытаць, будзе паказана як порожнія, чы ёго будзе запаленна чым-небудзь правдападобным. Ацэнкі выкарыстоўванняя для адчыненняя дадзэнняя намеравана розлічваюць пропуск і выдумку, таму што ўслядкі яных суперашчотна разныя. Выдуманая колькасць у прыйнятым дадзенніяй стварае фантамны рэкорд інвентару, тады калі пропуск проста стварае запит на падтрымку, і толькі першыя сховваецца. Ще адна ступень — гэта правільная вызовая інструменту: чы модэль стварае правільны вызов чы проста выдаець тэкст, які можна прачытаць.
Кожна з гэтых рашточакоў ёсць паведамленне, а не распад верыятнасцей па токэнах. Модель можа паказваць цалкам прыемную ступень перплексітэты для тэксту дакумента, пры чым таямна выбірае выдумаць значэнне, якое ёй не было данацца на адлічэнне, а квантызацыйныя методы, спрямаваныя на базаванне на роўні полей, практычна не існуюць. Чы будуць гэтыя рашточакі дзейснавацца адной чыннай сутнасцю, — гэта нерашаная, вочыма не публікуемая прычына, якая самае сабой падкрэпляе неабходнасць яе меры замест адгадвання.
Тры простыя змены, якія трэба здзейсніць зараз
Ніякі з эўтах расходаў не ўскладненыя. Дадзіце асэрцыю пахованняя дзеянняў у вашу браму квантызаціі, якая не будзе стаўкай бенчмарку, а прыродным пісаннем адной конкрэтной дзеянняў у межах фіксаванага набора запрошэнняў, зьведамленым з усіяю точнасцю і праз тады ў цэльвай шырыні бітаў, і параванаваць іх адно з другім; выберыце тую дзеяння, зарады якой ваш продукт справядліва мог бы разбудзіць каго-небудзь. Перастаньце спрыяць шыроўці бітаў як настройцы, яку дзелае весь калектыв, таму што ёна належыць да адзінкавага модэлю, а можа і да адзінкавай версіі модэлю, таму пераказ павінен выканацца зноў праз кожную апдэйт. І захавацеся ад сумарнага эфекту, таму што прыклад спекулятивнага дэкодавання ёсьць урокам: две оптымізацыі кожная зь сабе выглядалі нормальна, а разам яны пазбавілі можлівасця, таму пераканайцеся ў цэлым комплексе квантызаціі, прычыску і спекулятивнага дэкодавання, а не толькі ў яго частках.
Узважніце на абмежэнняя пры цитаванні цых цифраў
Чыстасць ў пахаванні доказоў — частка ўсвядомленага іх выкорыстання. эта прэпрынт, напісаны трохам дзеячых навуковацак, які ўсё ще находзіцца на пераглядзе; ён складаеся з прыбліжна 61 стороніцы і мае дзевяць рисункоў. Хоць гэта значны матерыял, адзінакавы перагляд яшчо не завершаны, таму ўсё ж трэба спрыятаць гэты матерыял як пераконлівую аргументацыю, а не як остаточны вывод. Прыказаныя цифры таксама праказаны ў аднойчынныя формы ў публікацыі на arXiv і ў версіі, якая пераглядаецца: у другой версіі тытул іншы, а таксама даданы рэзультат па форматах FP8 у vLLM. Перш чым цітаваць будзь-які конкрэтны паказначык, неабходна завантажыць актуальны PDF і пераканацца ў яму безпасова, а не паводле чужога статыску. Распраўка пра аднойчынныя формы ўзятая таксама з механізму, а не ёсць тым, што працэва стверджуе; логіка яе падтрымляе, але логіка — гэта не доказ.
Тое, што можна без апатыі вынесці, ўзростае і стае моцнейшым, чым паказуюць загальныя цифры: якшо мераваць толькі верагатыбнасці, то не будзе можлівасці пазнакаць момент, калі якое-небудзь паведанне зникае. Гэта было правдай ўжо да выходу гэтага даследжэння. Дапамога даследжэння заключаецца у тым, што ён даёт конкрэтыя цифры для гэтага.
Спылакі
- "Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation" (прыедрасклад). Айдэнтыфікатор arXiv:2606.09864v2; опублікована 8 серпня 2026 года.
- Рэвізія ў рэцензаванні, перазначаная па результатам 35-хвіліннага аудыту запуску, на OpenReview пад
BqKhzrtkGe; ў яй даданы рэзультаты па форматах FP8 у vLLM. - Arditi і ўзгоднія (2024) асоцыяцыя Pan і ўзгоднія (2025) пра тое, што адмовы керуецца калькамі актывацыйнага прастору.
- Qi і ўзгоднія (2025) пра тое, што альянсаванне концентруецца ў першых токенах выходу.
Спаднёўшыя матэрыялы
- Што значаюць паведамленні пра безпеку AI ад калішняйх дзецэрнікаў Anthropic для разработчыкаў — У этай статыце пояснюецца, чаму паведамленні дзецэрнікаў пра рызыкі AI маюць значэнне для звычайных разработчыкаў, і як автаномія агентаў і прычыны неадаптацыі павинны вплываць на практычныя прыемы безпекі.
- Fugu Ultra: Як модэль-оркестратор AI канкуруе з GPT і Claude — Пасвячана таму, як Fugu Ultra v2 ад Sakana AI распрацоўвае задачы за дапамогою спецыялізаваных модэляў у замест на аднаго велікага LLM, і як ёў праганяе іншыя модэлі за показнікамі, цэнамі і працяйнасцю.
- Чаму завантажэнне моделі ў 17 ГБ не абяцвае 17 ГБ памяці для ўпрацоўкі яе — Дазвольце дазнацца, як актыўныя параметры, загальная колькасць параметраў, рост KV-кэша і зусілля на аналіз вялі за сабой рэальныя витраты на памяць і вычыслення для роботы мовной моделі локальна.