KronQ: Cuantización de LLMs mediante Hessiana factorizada por Kronecker
KronQ: LLM Quantization via Kronecker-Factored Hessian
July 8, 2026
Autores: Donghyun Lee, Yuhang Li, Ruokai Yin, Priyadarshini Panda
cs.AI
Resumen
La cuantización post-entrenamiento (PTQ, por sus siglas en inglés) es una técnica ampliamente adoptada para comprimir modelos de lenguaje grandes (LLMs) sin necesidad de reentrenamiento. Los métodos PTQ de segundo orden existentes, incluido GPTQ, construyen objetivos de cuantización exclusivamente a partir de estadísticas de activaciones de entrada, asumiendo implícitamente que todos los canales de salida contribuyen por igual al objetivo de reconstrucción por capa. Proponemos KronQ, un marco PTQ que desafía esta suposición al introducir la covarianza del gradiente en el proceso de cuantización. Bajo la aproximación de la Hessiana factorizada por Kronecker, la pérdida de cuantización depende conjuntamente tanto de las covarianzas de las activaciones como de los gradientes, y KronQ explota esto en dos niveles complementarios. (1) KronQ introduce un procesamiento de incoherencia bidireccional, extendiendo la rotación aleatoria del lado de entrada existente a la dimensión de salida mediante la covarianza del gradiente, reduciendo la varianza de la magnitud de los pesos en ambas dimensiones de entrada y salida. (2) KronQ deriva una nueva métrica de sensibilidad para la asignación de precisión mixta entre capas, impulsada por las trazas de la Hessiana del gradiente y de las activaciones. Notablemente, en el caso de la cuantización de solo pesos a 2 bits en LLaMA-3-70B, mientras que GPTQ y GPTAQ divergen o producen cuantizaciones degeneradas (perplejidad superior a 2000 en WikiText-2), KronQ alcanza una perplejidad de 7.93.
English
Post-training quantization (PTQ) is a widely adopted technique for compressing large language models (LLMs) without retraining. Existing second-order PTQ methods, including GPTQ, construct quantization objectives exclusively from input activation statistics, effectively assuming that all output channels contribute equally to the layer-wise reconstruction objective. We propose KronQ, a PTQ framework that challenges this assumption by introducing the gradient covariance into the quantization pipeline. Under the Kronecker-factored Hessian approximation, the quantization loss depends jointly on both the activation and gradient covariances, and KronQ exploits this at two complementary levels. (1) KronQ introduces bidirectional incoherence processing, extending the existing input-side random rotation to the output dimension using the gradient covariance, reducing weight magnitude variance across both input and output dimensions. (2) KronQ derives a new sensitivity metric for inter-layer mixed-precision allocation, driven by the gradient and activation Hessian traces. Notably, in the case of 2-bit weight-only quantization on LLaMA-3-70B, while GPTQ and GPTAQ diverge or produce degenerate quantizations (>2000 perplexity on WikiText-2), KronQ achieves 7.93 perplexity.