KronQ: Квантование LLM через Кронекер-факторизованный гессиан
KronQ: LLM Quantization via Kronecker-Factored Hessian
July 8, 2026
Авторы: Donghyun Lee, Yuhang Li, Ruokai Yin, Priyadarshini Panda
cs.AI
Аннотация
Пост-тренировочное квантование (PTQ) является широко распространённым методом сжатия больших языковых моделей (LLM) без повторного обучения. Существующие методы PTQ второго порядка, включая GPTQ, строят целевые функции квантования исключительно на основе статистики входных активаций, фактически предполагая, что все выходные каналы вносят равный вклад в реконструкционную целевую функцию на уровне слоя. Мы предлагаем KronQ — фреймворк PTQ, который ставит под сомнение это предположение, вводя ковариацию градиентов в процесс квантования. В рамках аппроксимации гессиана с разложением Кронекера потери при квантовании зависят как от ковариации активаций, так и от ковариации градиентов; KronQ использует это на двух взаимодополняющих уровнях. (1) KronQ вводит двунаправленную обработку некогерентности, расширяя существующее случайное вращение со стороны входных данных на выходное измерение с использованием ковариации градиентов, что уменьшает разброс значений весов как по входным, так и по выходным измерениям. (2) KronQ выводит новую метрику чувствительности для распределения смешанной точности между слоями, основанную на следах гессиана от градиентов и активаций. Примечательно, что в случае 2-битного квантования только весов для LLaMA-3-70B, в то время как GPTQ и GPTAQ расходятся или дают вырожденные квантования (перплексия более 2000 на WikiText-2), KronQ достигает перплексии 7,93.
English
Post-training quantization (PTQ) is a widely adopted technique for compressing large language models (LLMs) without retraining. Existing second-order PTQ methods, including GPTQ, construct quantization objectives exclusively from input activation statistics, effectively assuming that all output channels contribute equally to the layer-wise reconstruction objective. We propose KronQ, a PTQ framework that challenges this assumption by introducing the gradient covariance into the quantization pipeline. Under the Kronecker-factored Hessian approximation, the quantization loss depends jointly on both the activation and gradient covariances, and KronQ exploits this at two complementary levels. (1) KronQ introduces bidirectional incoherence processing, extending the existing input-side random rotation to the output dimension using the gradient covariance, reducing weight magnitude variance across both input and output dimensions. (2) KronQ derives a new sensitivity metric for inter-layer mixed-precision allocation, driven by the gradient and activation Hessian traces. Notably, in the case of 2-bit weight-only quantization on LLaMA-3-70B, while GPTQ and GPTAQ diverge or produce degenerate quantizations (>2000 perplexity on WikiText-2), KronQ achieves 7.93 perplexity.