Inicio / Artículos / Cuando las pasadas de cuantización generan perplejidad y rompen en silencio la seguridad del modelo

Cuando las pasadas de cuantización generan perplejidad y rompen en silencio la seguridad del modelo

La cuantización de la caché KV de pocos bits puede eliminar las rechazos de un modelo mientras la perplejidad apenas cambia; aquí está por qué las métricas estándar no lo detectan y qué agregar a su mecanismo de control.

1625 palabras

Una medida así debería preocupar a cualquiera que envíe modelos comprimidos. En una evaluación que abarcó once modelos ajustados mediante instrucciones con entre 3.8 mil millones y 72 mil millones de parámetros, probados en cinco pruebas y con 1,894 prompts, al comprimir la caché KV a un ancho de bits más bajo, Mistral-7B tuvo un 15.2% menos de rechazos. El cambio en la perplejidad debido a esa misma compresión fue de un factor 1.03. Un cambio del tres por ciento es el tipo de variación que la mayoría de los equipos consideraría ruido en las mediciones y aprobaría sin pensarlo dos veces. La aprobación habitual para una versión cuantizada, con perplejidad estable, precisión en las tareas estable y menor latencia, habría dado el visto bueno a este caso. A continuación se presenta el estudio que registró el efecto, el mecanismo que lo explica y un conjunto breve de cambios en la configuración de cuantización para que una capacidad no desaparezca mientras todos los indicadores sigan mostrando valores positivos.

Lo que documentó la investigación

El trabajo es un preimpreso titulado “Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation” (arXiv:2606.09864). Su tesis es incómoda y directa: la compresión agresiva de la caché KV puede desmantelar silenciosamente la alineación de seguridad de un modelo; no existe un ancho de bit seguro para todos los modelos; y la falla se produce como una transición abrupta específica de cada modelo que las equipes de métricas, en general, confían en que simplemente no pueden detectar. Dado que aún no ha pasado por revisión por pares, la postura sensata es considerarlo como un caso convincente y no como uno resuelto, un punto que vale la pena revisar al final.

La palabra que encarna la esencia de esa tesis es invisible. No se trata simplemente de algo tenue o difícil de detectar, sino de algo que no puede ser identificado por los instrumentos de uso común, ya que estos miden una cantidad distinta a la que falla. La demostración más clara utiliza decodificación especulativa, precisamente la técnica en la que confían los equipos de aceleración para hacer tolerable la inferencia en el dispositivo. Con un modelo de 4 bits como verificador, la tasa de rechazo disminuyó del 63.2 % hasta el 0.0 %, mientras que la tasa de aceptación se mantuvo en el 23.5 % y el rendimiento en 17.0 tokens por segundo, ambos dentro de los rangos normales de funcionamiento. Una capacidad llegó a cero, mientras que todos los demás valores observados parecían normales.

El mecanismo, que es lo que merece conservarse

Solo las cifras alarmantes ya son suficientes para ser titulares; lo que realmente permite desarrollar un proceso es la lógica detrás de ellas, y esa lógica es geométrica. Las características responsables del comportamiento seguro se encuentran en una pequeña zona del espacio de activación, y el estudio estima que dicha zona es entre 100 y 1,000 veces más sensible al ruido de compresión que el amplio espacio que resume la perplejidad.

Esa estimación merece ser tomada en consideración, ya que constituye el núcleo del asunto. La perplejidad es un único número obtenido al integrar todos los valores de las dimensiones que utiliza el modelo. Si se distribuye una pequeña cantidad de error en mil de esas dimensiones, la cifra resultante lo detecta. En cambio, si se eliminan por completo tres dimensiones mientras se mantienen intactas las mil restantes, la cifra apenas cambia, ya que un resumen dominado por la mayoría sin afectar sigue siendo estable.

El siguiente paso explica por qué un modelo falla y otro no, y se reduce a la estructura. Cuantificar un grupo de valores obliga a elegir una escala lo suficientemente grande como para incluir el valor más alto presente. Las activaciones contienen valores atípicos, canales individuales cuyas magnitudes superan con creces a las de sus vecinos, y esos valores atípicos determinan el rango. Al estirar los niveles para alcanzarlos, cualquier valor muy por debajo del primer nivel se reduce a cero. Por lo tanto, el destino de un modelo dado depende de una sola pregunta: ¿están los canales que codifican el comportamiento del que dependes agrupados cerca de esos valores atípicos, o están aislados en la región de bajas magnitudes que la compresión elimina?

El artículo se basa en resultados anteriores que demuestran que la tendencia de un modelo a rechazar algo está determinada únicamente por unas pocas direcciones en el espacio de activación (Arditi y colaboradores en 2024, y Pan y colaboradores en 2025), y que la alineación se concentra en los primeros tokens de salida (Qi y colaboradores en 2025). La forma en que el ruido de compresión afecta esas direcciones depende por completo de si los canales involucrados se superponen con las anomalías dominantes para las cuales el cuantizador debe hacer espacio. Es esa coincidencia estructural, y no la cantidad de parámetros ni el método de entrenamiento, lo que determina si el modelo sobrevive.

Por qué no puede existir un estándar universal para la anchura de bits

El contraste que define la diferencia entre estos modelos es sorprendente. Qwen-2.5-7B deja de funcionar adecuadamente con 6 bits, mientras que Gemma-2-9B sigue operando sin problemas con 3 bits. Ambos son modelos ajustados para seguir instrucciones y pertenecen al rango de 7 a 9 mil millones de parámetros, desarrollados mediante procesos bastante similares; sin embargo, una diferencia de cuatro bits separa a dos modelos que uno podría pensar que son intercambiables. Por lo tanto, una política que establezca “nuestro estándar es un caché KV de 4 bits” no ofrece información útil: resulta perfectamente segura para uno de ellos pero desastrosa para el otro, y ningún elemento incluido con el modelo indica en qué caso se encuentra.

Para convertir esto en algo que pueda probarse antes del despliegue, el estudio propone un diagnóstico llamado Per-Channel Reduction que clasifica de antemano al modelo en una de tres categorías distintas de fallo. Esa es su utilidad práctica, y su costo es lo suficientemente bajo como para integrarlo en los procedimientos habituales previos al despliegue.

Una generalización a la que el estudio no llega

Todo lo anterior se refiere a las negativas por motivos de seguridad, y la precisión es clave: las negativas son el único comportamiento que realmente midió el estudio. Sin embargo, observe nuevamente qué exige el mecanismo. Necesita un comportamiento concentrado en un subespacio pequeño, combinado con una métrica que calcule el promedio en uno grande. Las negativas cumplen con ambos requisitos. No existe razón evidente por la cual sean el único comportamiento que lo hace, y extender este hallazgo hasta tal punto constituye una extrapolación en lugar de un resultado documentado.

Tomemos Document AI, donde varios comportamientos comparten exactamente ese perfil. La adhesión al esquema es uno de ellos: ya sea que el resultado sea JSON que se ajuste a la estructura prevista, o que simplemente repita esa misma estructura. La decisión entre dejar un campo vacío o inventar un valor es otro aspecto: si un campo que el modelo no puede leer se muestra como vacío o se rellena con algo plausible. Las evaluaciones de extracción separan intencionadamente la omisión de la fabricación, ya que sus consecuencias difieren drásticamente. Una cantidad inventada en un documento genera un registro de inventario falso, mientras que uno omitido solo da lugar a un ticket de soporte; solo el primero se oculta. Las llamadas al herramienta bien formateadas constituyen un tercer punto: si el modelo produce una llamada o resultado válido, o simplemente algo que se lee como texto.

Cada uno de ellos representa un comportamiento, y no una distribución de probabilidades sobre tokens. Un modelo puede presentar una perplejidad completamente aceptable en el cuerpo del documento, mientras que en silencio elige inventar un valor para el cual no tenía base alguna para leerlo, y las técnicas de cuantización orientadas a un anclaje a nivel de campo prácticamente no existen. Si estos comportamientos se manifiestan de la misma manera es una cuestión abierta, aparentemente sin publicar, lo cual constituye precisamente el argumento a favor de medirlo en lugar de adivinarlo.

Tres cambios económicos que se pueden realizar ahora

Ninguno de estos cuesta mucho. Añada una afirmación comportamental a su puerta de cuantización que no sea una puntuación de referencia, sino un recuento bruto de un comportamiento concreto en un conjunto fijo de prompts, tomado con precisión total y nuevamente con el ancho de bits objetivo, para luego compararlos lado a lado; elija el comportamiento por el cual su producto realmente despertaría a alguien. Deje de tratar el ancho de bits como una configuración que comparta todo el equipo, ya que pertenece al modelo individual y quizás a la versión específica de dicho modelo, por lo que la verificación debe realizarse nuevamente en cada actualización. Además, proteja contra efectos acumulativos, ya que el caso del decodificación especulativa sirve como ejemplo: dos optimizaciones que parecían buenas por separado, juntas eliminaron una capacidad del sistema, así que valide todo el conjunto de procesos de cuantización, poda y decodificación especulativa en lugar de solo sus partes.

Tome en consideración las limitaciones antes de citar las cifras

Ser sincero respecto a las pruebas forma parte de utilizarlas adecuadamente. Se trata de un preimpreso escrito por tres investigadores, aún en proceso de revisión, con aproximadamente 61 páginas y nueve figuras. Eso es considerable, pero como aún no ha sido aprobado por revisión por pares, merece considerarse más bien como un argumento contundente que como un veredicto. Las cifras presentadas también aparecen de forma ligeramente diferente entre la publicación en arXiv y la versión en revisión: esta última lleva un título distinto e incluye un resultado sobre los formatos FP8 en vLLM. Antes de citar cualquier número específico, obtenga el PDF actual y confírmelo directamente en lugar de basarse en un resumen de terceros. La extensión a los comportamientos de extracción es asimismo una inferencia del mecanismo y no algo que el artículo afirme; la lógica lo respalda, pero la lógica no es evidencia.

Lo que es seguro llevarse como resultado es más limitado y sólido que las cifras mencionadas en los titulares: si solo se miden las probabilidades, se pasará por alto el momento en que un comportamiento desaparece. Esto ya era cierto antes de la publicación de este trabajo. La contribución del estudio es darle un número concreto a ese fenómeno.

Referencias

  • "Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation" (preimpresión). Identificador arXiv:2606.09864v2; publicado el 8 de agosto de 2026.
  • Una revisión en OpenReview bajo el código BqKhzrtkGe, titulada según una auditoría de implementación de unos 35 minutos; añade un resultado sobre los formatos FP8 en vLLM.
  • Arditi y colaboradores (2024) y Pan y colaboradores (2025) sobre cómo el rechazo está controlado por unas pocas direcciones en el espacio de activación.
  • Qi y colaboradores (2025) sobre cómo la alineación se concentra en los primeros tokens de salida.
  • Ashkboos y colaboradores, “QuaRot: Inferencia de 4 bits sin valores atípicos en LLMs rotados”, arXiv:2404.00456.
  • Lecturas relacionadas