Orthrus : Génération parallèle de tokens économe en mémoire par diffusion à double vue
Orthrus: Memory-Efficient Parallel Token Generation via Dual-View Diffusion
May 12, 2026
Auteurs: Chien Van Nguyen, Chaitra Hegde, Van Cuong Pham, Ryan A. Rossi, Franck Dernoncourt, Thien Huu Nguyen
cs.AI
Résumé
Nous présentons Orthrus, un cadre dual-architecture simple et efficace qui unifie la fidélité de génération exacte des grands modèles de langage (LLM) autorégressifs avec la génération parallèle à haute vitesse des modèles de diffusion. La nature séquentielle du décodage autorégressif standard constitue un goulet d'étranglement fondamental pour l'inférence à haut débit. Bien que les modèles de langage par diffusion tentent de franchir cette barrière via une génération parallèle, ils souffrent d'une dégradation significative des performances, de coûts d'entraînement élevés et d'un manque de garanties rigoureuses de convergence. Orthrus résout cette dichotomie de manière native. Conçu pour s'intégrer de manière transparente dans les Transformers existants, le cadre augmente un LLM figé avec un module léger et entraînable pour créer une vue de diffusion parallèle aux côtés de la vue autorégressive standard. Dans ce système unifié, les deux vues accèdent au même cache de clés-valeurs (KV) haute fidélité ; la tête autorégressive effectue le préremplissage de contexte pour construire des représentations KV précises, tandis que la tête de diffusion effectue la génération parallèle. En employant un mécanisme de consensus exact entre les deux vues, Orthrus garantit une inférence sans perte, offrant jusqu'à un gain de vitesse de 7,8x avec seulement un surcoût de cache mémoire O(1) et des ajouts minimaux de paramètres.
English
We introduce Orthrus, a simple and efficient dual-architecture framework that unifies the exact generation fidelity of autoregressive Large Language Models (LLMs) with the high-speed parallel token generation of diffusion models. The sequential nature of standard autoregressive decoding represents a fundamental bottleneck for high-throughput inference. While diffusion language models attempt to break this barrier via parallel generation, they suffer from significant performance degradation, high training costs, and a lack of rigorous convergence guarantees. Orthrus resolves this dichotomy natively. Designed to seamlessly integrate into existing Transformers, the framework augments a frozen LLM with a lightweight, trainable module to create a parallel diffusion view alongside the standard autoregressive view. In this unified system, both views attend to the exact same high-fidelity Key-Value (KV) cache; the autoregressive head executes context pre-filling to construct accurate KV representations, while the diffusion head executes parallel generation. By employing an exact consensus mechanism between the two views, Orthrus guarantees lossless inference, delivering up to a 7.8x speedup with only an O(1) memory cache overhead and minimal parameter additions.