ChatPaper.aiChatPaper

OrbitQuant: Quantização Agnóstica em Relação aos Dados para Transformadores de Difusão de Imagem e Vídeo

OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers

July 2, 2026
Autores: Donghyun Lee, Jitesh Chavan, Duy Nguyen, Sam Huang, Liming Jiang, Priyadarshini Panda, Timo Mertens, Saurabh Shukla
cs.AI

Resumo

Transformadores de difusão (DiTs) alcançam geração de imagens e vídeos de última geração, mas sua amostragem em múltiplas etapas e o número crescente de parâmetros tornam a inferência cara. A quantização pós-treinamento (PTQ) é o remédio natural, porém as ativações dos DiTs variam entre etapas temporais, prompts e ramos de orientação, forçando métodos anteriores a reajustar os dados de calibração para cada novo checkpoint ou modalidade. Apresentamos o OrbitQuant, um quantizador de pesos e ativações independente dos dados que contorna a estimação de faixas ao quantizar em uma base normalizada e rotacionada. Nessa base, uma rotação aleatória permutada por blocos de Hadamard (RPBH) concentra cada coordenada em torno de uma marginal fixa e conhecida, independentemente da entrada, de modo que um único código de Lloyd-Max atende a todas as etapas temporais, prompts e camadas de uma dada dimensão de entrada. Estendemos o mesmo quantizador para linhas de pesos offline, absorvendo a rotação nos pesos de modo que ela se cancele dentro de cada camada linear, restando apenas uma rotação adiante nas ativações em tempo de execução. A mesma receita é transferida de imagem para vídeo sem ajuste por modalidade. Em FLUX.1, Z-Image-Turbo, Wan 2.1 e CogVideoX, o método estabelece o estado da arte para PTQ em várias configurações de baixa precisão. Ele também leva a PTQ de transformadores de difusão de imagem a W2A4 com qualidade de geração utilizável.
English
Diffusion transformers (DiTs) achieve state-of-the-art image and video generation, but their multi-step sampling and growing parameter count make inference expensive. Post-training quantization (PTQ) is the natural remedy, yet DiT activations shift across timesteps, prompts, and guidance branches, forcing prior methods to re-fit calibration data for every new checkpoint or modality. We present OrbitQuant, a data-agnostic weight-activation quantizer that bypasses range estimation by quantizing in a normalized, rotated basis. In this basis, a randomized permuted block-Hadamard (RPBH) rotation concentrates each coordinate around one fixed, known marginal regardless of the input, so a single Lloyd-Max codebook serves all timesteps, prompts, and layers of a given input dimension. We extend the same quantizer to weight rows offline, absorbing the rotation into the weights so that it cancels inside each linear layer and only a forward rotation on the activations remains at runtime. The same recipe transfers from image to video with no per-modality tuning. Across FLUX.1, Z-Image-Turbo, Wan 2.1, and CogVideoX, it sets the state of the art for PTQ at several low-bit settings. It also pushes PTQ of image diffusion transformers to W2A4 with usable generation quality.