Accueil / Articles / Lorsque les passes de quantification dépassent le niveau de perplexité et compromettent discrètement la sécurité du modèle

Lorsque les passes de quantification dépassent le niveau de perplexité et compromettent discrètement la sécurité du modèle

La quantification de la mémoire cache KV à faible nombre de bits peut éliminer les refus d’un modèle sans que la perplexité ne change presque pas ; voici pourquoi les métriques standard ne le détectent pas et ce qu’il convient d’ajouter à votre mécanisme de contrôle.

1625 mots

Une telle mesure devrait inquiéter quiconque envoie des modèles compressés. Dans une évaluation portant sur onze modèles ajustés selon des instructions, avec un nombre de paramètres allant de 3,8 milliards à 72 milliards, testés sur cinq benchmarks et 1 894 prompts, la compression du cache KV à une largeur de bit faible a entraîné chez Mistral-7B 15,2 % de plus d’erreurs. La variation de la perplexité due à cette compression s’est élevée à un facteur de 1,03. Un changement de trois pour cent relève généralement du bruit de mesure, et la plupart des équipes l’ignoreraient sans hésiter. L’approbation habituelle pour une version quantisée — perplexité stable, précision de la tâche stable, latence réduite — aurait validé ce cas. Ce qui suit présente l’étude ayant enregistré cet effet, le mécanisme qui l’explique, ainsi qu’un ensemble de modifications à apporter au système de quantification afin que cette capacité ne disparaisse pas tout en maintenant tous les indicateurs dans des valeurs positives.

Ce que la recherche a documenté

Cet article est une version préprint intitulée « Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation » (arXiv:2606.09864). Sa thèse est dérangeante et directe : une compression agressive du cache KV peut discrètement compromettre l’alignement de sécurité d’un modèle ; aucune largeur de bit n’est sûre pour tous les modèles ; et cette dégradation se produit par une transition brutale propre à chaque modèle, que les équipes chargées des métriques, auxquelles on a habituellement confiance, ne parviennent tout simplement pas à détecter. Comme il n’a pas encore été soumis à un examen par des pairs, il est judicieux de le considérer comme un argument convaincant plutôt que comme une conclusion définitive, point qui mérite d’être revisité à la fin.

Le mot qui incarne l’essence de cette thèse est invisible. Il ne s’agit pas simplement d’un élément faible ou difficile à repérer, mais plutôt de quelque chose indétectable par les instruments couramment utilisés, car ces derniers mesurent une quantité différente de celle qui pose problème. La démonstration la plus éloquente fait appel à une décodage spéculatif, exactement celui sur lequel s’appuient les équipes d’accélération pour rendre les inférences sur appareil supportables. Avec un modèle à 4 bits servant de vérificateur, le taux de refus est passé de 63,2 % à 0,0 %, tandis que le taux d’acceptation est resté à 23,5 % et le débit à 17,0 tokens par seconde, tous deux bien dans les limites normales de fonctionnement. Une capacité est tombée à zéro, tandis que tous les autres indicateurs observés semblaient normaux.

Le mécanisme, qui est la partie à conserver

Seuls les chiffres effrayants suffisent à faire la une ; c’est la logique qui se cache derrière eux qui permet de mettre en place un processus, et cette logique est géométrique. Les caractéristiques responsables d’un comportement sûr se trouvent dans une petite zone du espace d’activation, et l’étude estime que cette zone est entre 100 et 1 000 fois plus sensible au bruit de compression que l’ensemble vaste que la perplexité résume.

Cette estimation mérite d’être prise au sérieux, car elle constitue l’essentiel. La perplexité est un seul chiffre obtenu en intégrant toutes les dimensions utilisées par le modèle. Si l’on répartit une petite quantité d’erreur sur mille de ces dimensions, ce chiffre intégré le détecte. En revanche, si l’on élimine complètement trois dimensions tout en laissant les mille restantes intactes, ce chiffre ne change presque pas, car un résumé dominé par la majorité intacte reste stable.

La étape suivante explique pourquoi un modèle échoue tandis qu’un autre fonctionne, et cela revient à la structure. La quantification d’un groupe de valeurs oblige à choisir une échelle suffisamment large pour englober la plus grande valeur présente. Les activations comportent des valeurs atypiques, des canaux individuels dont l’amplitude dépasse de beaucoup celle de leurs voisins, et ce sont ces valeurs atypiques qui déterminent l’échelle. Lorsque les niveaux sont étirés pour les inclure, toute valeur bien en deçà du premier niveau est réduite à zéro. Ainsi, le destin d’un modèle donné dépend d’une seule question : les canaux qui codent le comportement dont vous avez besoin sont-ils regroupés près de ces valeurs atypiques, ou bien se trouvent-ils isolés dans la région à faible amplitude que la compression efface ?

Cet article s’appuie sur des résultats antérieurs montrant que la tendance d’un modèle à refuser est déterminée par un petit nombre de directions dans l’espace d’activation (Arditi et al., 2024, ainsi que Pan et al., 2025), et que l’alignement est concentré dans les premiers tokens de sortie (Qi et al., 2025). La manière dont le bruit de compression affecte ces directions dépend entièrement du fait que les canaux concernés chevauchent ou non les valeurs atypiques dominantes pour lesquelles le quantificateur doit faire de la place. C’est cette coïncidence structurelle, et non le nombre de paramètres ou la méthode d’entraînement, qui détermine la survie du modèle.

Pourquoi il ne peut exister de norme universelle pour la largeur en bits

Le contraste qui établit ce constat est frappant : Qwen-2.5-7B cesse de fonctionner avec 6 bits, tandis que Gemma-2-9B reste opérationnelle avec 3 bits. Il s’agit de deux modèles optimisés pour des instructions, dans la gamme 7 à 9 milliards de paramètres, produits selon des processus globalement similaires, pourtant un écart de quatre bits sépare deux modèles que l’on aurait pu croire interchangeables. Une politique stipulant « notre norme est un cache KV de 4 bits » ne dit donc rien d’utile : elle est parfaitement sûre pour l’un d’eux et désastreuse pour l’autre, sans que aucun élément fourni avec le modèle ne permette de déterminer dans quel cas on se trouve.

Afin de transformer cela en quelque chose que l’on puisse tester avant le déploiement, l’étude propose un outil diagnostique appelé Per-Channel Reduction, qui classe à l’avance un modèle dans l’une de trois catégories d’échec distinctes. C’est là son utilité pratique, et il est suffisamment peu coûteux pour être intégré aux tâches habituelles de pré-déploiement.

Une généralisation à laquelle l’étude s’abstient

Tout ce qui précède concerne les refus pour raisons de sécurité, et la précision est essentielle : les refus constituent le seul comportement réellement mesuré dans cette étude. Pourtant, examinons à nouveau ce que le mécanisme exige. Il nécessite un comportement concentré dans un petit sous-espace, associé à une métrique qui prend en compte un espace plus vaste. Les refus répondent aux deux critères. Il n’y a aucune raison évidente pour qu’ils soient le seul comportement à le faire, et étendre cette conclusion à ce point relève d’une extrapolation plutôt que d’un résultat documenté.

Prenez Document AI, où plusieurs comportements partagent précisément ce profil. Le respect du schéma en fait partie : soit le résultat est un JSON conforme à la structure prévue, soit il se contente de répéter cette structure. La décision concernant les valeurs vides ou inventées en constitue une autre : un champ que le modèle ne peut pas lire doit-il être indiqué comme vide ou rempli automatiquement par une valeur plausible ? Les évaluations d’extraction séparent délibérément les omissions des fabrications, car leurs conséquences diffèrent fortement. Une quantité inventée dans un document génère une entrée d’inventaire fantôme, tandis qu’une omission ne fait que déclencher une demande de support ; seule la première reste cachée. Les appels à l’outil bien formatés en font un troisième critère : le modèle produit-il une requête valide ou simplement du texte lisible ?

Chacun d’eux représente un comportement, et non une distribution de probabilité sur les tokens. Un modèle peut présenter une perplexité tout à fait acceptable pour le corps du document, tout en choisissant discrètement d’inventer une valeur pour laquelle il n’avait aucune base de lecture, et les méthodes de quantification visant à assurer un ancrage au niveau des champs sont pratiquement inexistantes. La question de savoir si ces comportements se manifestent de la même manière reste ouverte, apparemment non publiée, ce qui justifie précisément la nécessité de les mesurer plutôt que de deviner.

Trois modifications peu coûteuses à apporter dès maintenant

Aucun de ces coûts n’est élevé. Ajoutez une assertion comportementale à votre porte de quantification qui ne soit pas un score de référence, mais un comptage brut d’un comportement concret sur un ensemble fixe de prompts, pris avec une précision maximale puis à nouveau avec la largeur de bits cible, et comparez-les côte à côte ; choisissez le comportement pour lequel votre produit serait réellement capable de réveiller quelqu’un. Cessez de considérer la largeur de bits comme une configuration partagée par toute l’équipe, car elle appartient au modèle individuel et éventuellement à sa version spécifique, ce qui oblige à exécuter à nouveau la vérification à chaque mise à jour. Prévenez également les effets cumulatifs, comme l’illustre le cas de la décodage spéculatif : deux optimisations semblaient bonnes chacune isolément, mais ensemble elles ont supprimé une fonctionnalité ; validez donc l’ensemble complet de la chaîne de quantification, d’élagage et de décodage spéculatif plutôt que ses composants séparés.

Évaluez les réserves avant de citer les chiffres

Être honnête quant aux preuves fait partie d’une utilisation adéquate de celles-ci. Il s’agit d’un préprint rédigé par trois chercheurs, encore en cours d’évaluation, d’environ 61 pages avec neuf figures. Cela constitue une quantité importante de contenu, mais comme l’évaluation par les pairs n’a pas encore été finalisée, il convient de le considérer comme un argument convaincant plutôt que comme une conclusion définitive. Les figures présentées apparaissent également sous une forme légèrement différente entre la publication sur arXiv et la version en cours d’évaluation, cette dernière portant un titre différent et ajoutant un résultat concernant les formats FP8 dans vLLM. Avant de citer un chiffre précis, téléchargez le PDF actuel et vérifiez-le directement plutôt que de vous fier à un résumé indirect. L’extension aux comportements d’extraction relève également d’une déduction issue du mécanisme décrit et non d’une affirmation explicite dans l’article ; la logique le soutient, mais la logique n’est pas une preuve.

Ce qui est sûr à retenir est plus restreint et plus fiable que les chiffres présentés en titre : si l’on ne mesure que les probabilités, on restera aveugle au moment précis où un comportement disparaît. Cela était déjà vrai avant la publication de cette étude. La contribution de celle-ci consiste à donner un chiffre concret à ce phénomène.

Références

  • "Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation" (préprint). Identifiant arXiv:2606.09864v2 ; publié le 8 août 2026.
  • Une révision en cours d’examen, rebaptisée suite à un audit de déploiement d’environ 35 minutes, sur OpenReview sous BqKhzrtkGe ; elle ajoute un résultat concernant les formats FP8 dans vLLM.
  • Arditi et ses collaborateurs (2024) ainsi que Pan et ses collaborateurs (2025) sur le fait que le refus est contrôlé par quelques directions dans l’espace d’activation.
  • Qi et ses collaborateurs (2025) sur le fait que l’alignement se concentre dans les premiers tokens de sortie.
  • Ashkboos et al., « QuaRot: Inférence 4 bits sans valeurs aberrantes dans des LLM rotatés », arXiv:2404.00456.
  • Lectures complémentaires