OrbitQuant: Data-agnostische kwantisering voor beeld- en videodiffusietransformers
OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers
July 2, 2026
Auteurs: Donghyun Lee, Jitesh Chavan, Duy Nguyen, Sam Huang, Liming Jiang, Priyadarshini Panda, Timo Mertens, Saurabh Shukla
cs.AI
Samenvatting
Difusietransformatoren (DiTs) bereiken de state-of-the-art op het gebied van beeld- en videogeneratie, maar hun meerstapsampling en het toenemende aantal parameters maken inferentie duur. Post-training kwantisering (PTQ) is de voor de hand liggende remedie, maar DiT-activaties verschuiven over tijdstappen, prompts en sturingsvertakkingen, waardoor eerdere methoden gedwongen worden om kalibratiegegevens opnieuw aan te passen voor elk nieuw controlepunt of elke modaliteit. We presenteren OrbitQuant, een data-agnostische gewichten-activatiekwantisator die bereikschatting omzeilt door te kwantiseren in een genormaliseerde, geroteerde basis. In deze basis concentreert een gerandomiseerde, gepermuteerde blok-Hadamard-rotatie (RPBH) elke coördinaat rond één vaste, bekende marginale verdeling, ongeacht de invoer, zodat één enkele Lloyd-Max-codeboek alle tijdstappen, prompts en lagen van een gegeven invoerdimensie bedient. We breiden dezelfde kwantisator offline uit naar gewichtsrijen, waarbij we de rotatie absorberen in de gewichten, zodat deze binnen elke lineaire laag wordt opgeheven en alleen een voorwaartse rotatie op de activaties tijdens de uitvoering overblijft. Hetzelfde recept wordt overgedragen van beeld naar video zonder per-modaliteit afstemmen. Over FLUX.1, Z-Image-Turbo, Wan 2.1 en CogVideoX heen zet het de stand der techniek voor PTQ bij verschillende lage-bit-instellingen. Het duwt PTQ van beeld-difusietransformatoren ook naar W2A4 met bruikbare generatiekwaliteit.
English
Diffusion transformers (DiTs) achieve state-of-the-art image and video generation, but their multi-step sampling and growing parameter count make inference expensive. Post-training quantization (PTQ) is the natural remedy, yet DiT activations shift across timesteps, prompts, and guidance branches, forcing prior methods to re-fit calibration data for every new checkpoint or modality. We present OrbitQuant, a data-agnostic weight-activation quantizer that bypasses range estimation by quantizing in a normalized, rotated basis. In this basis, a randomized permuted block-Hadamard (RPBH) rotation concentrates each coordinate around one fixed, known marginal regardless of the input, so a single Lloyd-Max codebook serves all timesteps, prompts, and layers of a given input dimension. We extend the same quantizer to weight rows offline, absorbing the rotation into the weights so that it cancels inside each linear layer and only a forward rotation on the activations remains at runtime. The same recipe transfers from image to video with no per-modality tuning. Across FLUX.1, Z-Image-Turbo, Wan 2.1, and CogVideoX, it sets the state of the art for PTQ at several low-bit settings. It also pushes PTQ of image diffusion transformers to W2A4 with usable generation quality.