ChatPaper.aiChatPaper

SenseNova-U1: Vereniging van multimodaal begrip en generatie met NEO-unify architectuur

SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

May 12, 2026
Auteurs: Haiwen Diao, Penghao Wu, Hanming Deng, Jiahao Wang, Shihao Bai, Silei Wu, Weichen Fan, Wenjie Ye, Wenwen Tong, Xiangyu Fan, Yan Li, Yubo Wang, Zhijie Cao, Zhiqian Lin, Zhitao Yang, Zhongang Cai, Yuwei Niu, Yue Zhu, Bo Liu, Chengguang Lv, Haojia Yu, Haozhe Xie, Hongli Wang, Jianan Fan, Jiaqi Li, Jiefan Lu, Jingcheng Ni, Junxiang Xu, Kaihuan Liang, Lianqiang Shi, Linjun Dai, Linyan Wang, Oscar Qian, Peng Gao, Pengfei Liu, Qingping Sun, Rui Shen, Ruisi Wang, Shengnan Ma, Shuang Yang, Siyi Xie, Siying Li, Tianbo Zhong, Xiangli Kong, Xuanke Shi, Yang Gao, Yongqiang Yao, Yves Wang, Zhengqi Bai, Zhengyu Lin, Zixin Yin, Wenxiu Sun, Ruihao Gong, Quan Wang, Lewei Lu, Lei Yang, Ziwei Liu, Dahua Lin
cs.AI

Samenvatting

Recente grote visie-taalmodellen (VTM's) blijven fundamenteel beperkt door een hardnekkige tweedeling: begrip en generatie worden als afzonderlijke problemen behandeld, wat leidt tot gefragmenteerde architecturen, trapsgewijze pijplijnen en niet-op elkaar afgestemde representatieruimten. Wij stellen dat deze scheiding niet louter een technisch construct is, maar een structurele beperking die de opkomst van native multimodale intelligentie in de weg staat. Daarom introduceren wij SenseNova-U1, een native uniform multimodaal paradigma gebouwd op NEO-unify, waarin begrip en generatie evolueren als synergistische aspecten van één enkel onderliggend proces. Wij lanceren twee native uniforme varianten, SenseNova-U1-8B-MoT en SenseNova-U1-A3B-MoT, respectievelijk gebouwd op dichte (8B) en mixture-of-experts (30B-A3B) begripsbaselines. Vanuit de eerste principes ontworpen, concurreren zij met top-visie-taalmodellen voor alleen begrip op het gebied van tekstbegrip, visie-taalperceptie, kennisredenering, agentische besluitvorming en ruimtelijke intelligentie. Tegelijkertijd leveren zij sterke semantische consistentie en beeldgetrouwheid, en blinken zij uit in conventionele of kennisintensieve willekeurig-naar-beeld (X2B)-synthese, complexe tekstrijke infographic-generatie en interleaved visie-taalgeneratie, met of zonder denkpatronen. Naast prestaties tonen wij gedetailleerd modelontwerp, datavoorbewerking, voor-/natraining en inferentiestrategieën om gemeenschapsonderzoek te ondersteunen. Last but not least tonen voorlopige resultaten aan dat onze modellen verder reiken dan perceptie en generatie, met sterke prestaties in visie-taal-actie (VTA)- en wereldmodel (WM)-scenario's. Dit wijst op een bredere routekaart waarin modellen niet tussen modaliteiten vertalen, maar er op een native manier over denken en handelen. Multimodale AI gaat niet langer over het verbinden van afzonderlijke systemen, maar over het bouwen van één uniform systeem en het vertrouwen dat de noodzakelijke vermogens van binnenuit naar voren komen.
English
Recent large vision-language models (VLMs) remain fundamentally constrained by a persistent dichotomy: understanding and generation are treated as distinct problems, leading to fragmented architectures, cascaded pipelines, and misaligned representation spaces. We argue that this divide is not merely an engineering artifact, but a structural limitation that hinders the emergence of native multimodal intelligence. Hence, we introduce SenseNova-U1, a native unified multimodal paradigm built upon NEO-unify, in which understanding and generation evolve as synergistic views of a single underlying process. We launch two native unified variants, SenseNova-U1-8B-MoT and SenseNova-U1-A3B-MoT, built on dense (8B) and mixture-of-experts (30B-A3B) understanding baselines, respectively. Designed from first principles, they rival top-tier understanding-only VLMs across text understanding, vision-language perception, knowledge reasoning, agentic decision-making, and spatial intelligence. Meanwhile, they deliver strong semantic consistency and visual fidelity, excelling in conventional or knowledge-intensive any-to-image (X2I) synthesis, complex text-rich infographic generation, and interleaved vision-language generation, with or without think patterns. Beyond performance, we show detailed model design, data preprocessing, pre-/post-training, and inference strategies to support community research. Last but not least, preliminary evidence demonstrates that our models extend beyond perception and generation, performing strongly in vision-language-action (VLA) and world model (WM) scenarios. This points toward a broader roadmap where models do not translate between modalities, but think and act across them in a native manner. Multimodal AI is no longer about connecting separate systems, but about building a unified one and trusting the necessary capabilities to emerge from within.