ChatPaper.aiChatPaper

KronQ : Quantification des LLM via la Hessienne factorisée par Kronecker

KronQ: LLM Quantization via Kronecker-Factored Hessian

July 8, 2026
Auteurs: Donghyun Lee, Yuhang Li, Ruokai Yin, Priyadarshini Panda
cs.AI

Résumé

La quantification post-entraînement (PTQ) est une technique largement adoptée pour compresser les grands modèles de langage (LLM) sans réentraînement. Les méthodes PTQ du second ordre existantes, dont GPTQ, construisent des objectifs de quantification exclusivement à partir des statistiques d'activation en entrée, supposant ainsi que tous les canaux de sortie contribuent de manière égale à l'objectif de reconstruction par couche. Nous proposons KronQ, un cadre PTQ qui remet en cause cette hypothèse en introduisant la covariance du gradient dans le pipeline de quantification. Sous l'approximation de Hessienne factorisée de Kronecker, la perte de quantification dépend conjointement des covariances d'activation et de gradient, et KronQ exploite ceci à deux niveaux complémentaires. (1) KronQ introduit un traitement d'incohérence bidirectionnel, étendant la rotation aléatoire côté entrée existante à la dimension de sortie à l'aide de la covariance du gradient, réduisant ainsi la variance de la magnitude des poids à la fois sur les dimensions d'entrée et de sortie. (2) KronQ dérive une nouvelle métrique de sensibilité pour l'allocation en précision mixte inter-couche, pilotée par les traces de Hessienne du gradient et de l'activation. Notamment, dans le cas de la quantification pondérale à 2 bits sur LLaMA-3-70B, alors que GPTQ et GPTAQ divergent ou produisent des quantifications dégénérées (perplexité supérieure à 2000 sur WikiText-2), KronQ atteint une perplexité de 7,93.
English
Post-training quantization (PTQ) is a widely adopted technique for compressing large language models (LLMs) without retraining. Existing second-order PTQ methods, including GPTQ, construct quantization objectives exclusively from input activation statistics, effectively assuming that all output channels contribute equally to the layer-wise reconstruction objective. We propose KronQ, a PTQ framework that challenges this assumption by introducing the gradient covariance into the quantization pipeline. Under the Kronecker-factored Hessian approximation, the quantization loss depends jointly on both the activation and gradient covariances, and KronQ exploits this at two complementary levels. (1) KronQ introduces bidirectional incoherence processing, extending the existing input-side random rotation to the output dimension using the gradient covariance, reducing weight magnitude variance across both input and output dimensions. (2) KronQ derives a new sensitivity metric for inter-layer mixed-precision allocation, driven by the gradient and activation Hessian traces. Notably, in the case of 2-bit weight-only quantization on LLaMA-3-70B, while GPTQ and GPTAQ diverge or produce degenerate quantizations (>2000 perplexity on WikiText-2), KronQ achieves 7.93 perplexity.