KronQ: Quantização de LLM via Hessiana Fatorada por Kronecker
KronQ: LLM Quantization via Kronecker-Factored Hessian
July 8, 2026
Autores: Donghyun Lee, Yuhang Li, Ruokai Yin, Priyadarshini Panda
cs.AI
Resumo
A quantização pós-treinamento (PTQ) é uma técnica amplamente adotada para comprimir grandes modelos de linguagem (LLMs) sem a necessidade de retreinamento. Métodos existentes de PTQ de segunda ordem, incluindo o GPTQ, constroem objetivos de quantização exclusivamente a partir de estatísticas de ativação de entrada, assumindo efetivamente que todos os canais de saída contribuem igualmente para o objetivo de reconstrução por camada. Propomos o KronQ, uma estrutura de PTQ que desafia essa suposição ao introduzir a covariância do gradiente no pipeline de quantização. Sob a aproximação da Hessiana fatorada por Kronecker, a perda de quantização depende conjuntamente tanto das covariâncias de ativação quanto de gradiente, e o KronQ explora isso em dois níveis complementares. (1) O KronQ introduz o processamento de incoerência bidirecional, estendendo a rotação aleatória existente no lado da entrada para a dimensão de saída usando a covariância do gradiente, reduzindo a variância da magnitude dos pesos nas dimensões de entrada e saída. (2) O KronQ deriva uma nova métrica de sensibilidade para alocação de precisão mista entre camadas, orientada pelos traços da Hessiana do gradiente e da ativação. Notavelmente, no caso da quantização de pesos de 2 bits no LLaMA-3-70B, enquanto o GPTQ e o GPTAQ divergem ou produzem quantizações degeneradas (>2000 de perplexidade no WikiText-2), o KronQ atinge 7,93 de perplexidade.
English
Post-training quantization (PTQ) is a widely adopted technique for compressing large language models (LLMs) without retraining. Existing second-order PTQ methods, including GPTQ, construct quantization objectives exclusively from input activation statistics, effectively assuming that all output channels contribute equally to the layer-wise reconstruction objective. We propose KronQ, a PTQ framework that challenges this assumption by introducing the gradient covariance into the quantization pipeline. Under the Kronecker-factored Hessian approximation, the quantization loss depends jointly on both the activation and gradient covariances, and KronQ exploits this at two complementary levels. (1) KronQ introduces bidirectional incoherence processing, extending the existing input-side random rotation to the output dimension using the gradient covariance, reducing weight magnitude variance across both input and output dimensions. (2) KronQ derives a new sensitivity metric for inter-layer mixed-precision allocation, driven by the gradient and activation Hessian traces. Notably, in the case of 2-bit weight-only quantization on LLaMA-3-70B, while GPTQ and GPTAQ diverge or produce degenerate quantizations (>2000 perplexity on WikiText-2), KronQ achieves 7.93 perplexity.