Rapport Technique LongCat-Flash-Omni

Résumé

Nous présentons LongCat-Flash-Omni, un modèle omnimodal open-source de pointe comptant 560 milliards de paramètres, excellant dans l'interaction audio-visuelle en temps réel. En adoptant une stratégie d'entraînement progressive inspirée d'un curriculum pédagogique, qui transitionne de tâches de modélisation de séquences modales simples vers des tâches de plus en plus complexes, LongCat-Flash-Omni acquiert des capacités multimodales complètes tout en conservant de solides performances unimodales. S'appuyant sur LongCat-Flash, qui utilise une architecture haute performance de type Mixture-of-Experts (MoE) à connexions raccourcies avec des experts à calcul nul, LongCat-Flash-Omni intègre des modules efficaces de perception multimodale et de reconstruction de la parole. Malgré sa taille immense de 560 milliards de paramètres (dont 27B activés), LongCat-Flash-Omni atteint une interaction audio-visuelle en temps réel à faible latence. Pour l'infrastructure d'entraînement, nous avons développé un schéma de parallélisme à modalités découplées, spécialement conçu pour gérer l'hétérogénéité des données et du modèle inhérente à l'entraînement multimodal à grande échelle. Cette approche innovante démontre une efficacité exceptionnelle en maintenant plus de 90 % du débit atteint par un entraînement sur texte seul. Des évaluations approfondies montrent que LongCat-Flash-Omni obtient des performances de pointe sur des benchmarks omnimodaux parmi les modèles open-source. De plus, il produit des résultats très compétitifs sur un large éventail de tâches modales spécifiques, incluant la compréhension de texte, d'image et de vidéo, ainsi que la compréhension et la génération audio. Nous fournissons une vue d'ensemble complète de la conception de l'architecture du modèle, des procédures d'entraînement et des stratégies de données, et ouvrons le code du modèle pour favoriser les futurs travaux de recherche et développement dans la communauté.

English

We introduce LongCat-Flash-Omni, a state-of-the-art open-source omni-modal model with 560 billion parameters, excelling at real-time audio-visual interaction. By adopting a curriculum-inspired progressive training strategy that transitions from simpler to increasingly complex modality sequence modeling tasks, LongCat-Flash-Omni attains comprehensive multimodal capabilities while maintaining strong unimodal capability. Building upon LongCat-Flash, which adopts a high-performance Shortcut-connected Mixture-of-Experts (MoE) architecture with zero-computation experts, LongCat-Flash-Omni integrates efficient multimodal perception and speech reconstruction modules. Despite its immense size of 560B parameters (with 27B activated), LongCat-Flash-Omni achieves low-latency real-time audio-visual interaction. For training infrastructure, we developed a modality-decoupled parallelism scheme specifically designed to manage the data and model heterogeneity inherent in large-scale multimodal training. This innovative approach demonstrates exceptional efficiency by sustaining over 90% of the throughput achieved by text-only training. Extensive evaluations show that LongCat-Flash-Omni achieves state-of-the-art performance on omni-modal benchmarks among open-source models. Furthermore, it delivers highly competitive results across a wide range of modality-specific tasks, including text, image, and video understanding, as well as audio understanding and generation. We provide a comprehensive overview of the model architecture design, training procedures, and data strategies, and open-source the model to foster future research and development in the community.