BrainJanus: Um Modelo Unificado para Compreensão e Geração em Cérebro, Visão e Linguagem
BrainJanus: A Unified Model for Understanding and Generation across Brain, Vision, and Language
June 29, 2026
Autores: Haitao Wu, Qirui Zhang, Zhouheng Yao, Shangquan Sun, Qihao Zheng, Mianxin Liu, Chi Zhang, Wanli Ouyang, Chunfeng Song, Changqing Zhang, Jiamin Wu
cs.AI
Resumo
Modelar a correspondência bidirecional entre estímulos sensoriais externos e a atividade neural interna emergiu como uma fronteira crítica na neurociência. Contudo, as abordagens existentes tratam predominantemente a codificação e decodificação cerebrais como tarefas isoladas, dependendo fortemente de alinhamento unimodal e de priores externos, enquanto negligenciam a natureza intrínseca do cérebro como um sistema de integração multimodal. Para superar essas limitações, propomos o BrainJanus, o primeiro modelo cerebral unificado que integra cérebro, visão e linguagem em uma única estrutura. Especificamente, introduzimos um Tokenizador Cerebral Unificado para quantizar a dinâmica neural contínua em tokens discretos alinhados com representações visuais e linguísticas em um espaço Omni compartilhado. Com base nisso, utilizamos uma arquitetura autoregressiva All-in-One que aproveita a predição do próximo token para viabilizar geração any-to-any sem emendas, abrangendo codificação de imagem para cérebro e de texto para cérebro, e decodificação de cérebro para imagem e de cérebro para texto. Experimentos extensos demonstram que o BrainJanus alcança desempenho superior em diversos benchmarks. Além disso, nossa estrutura exibe generalização zero-shot e preserva a topografia biológica interpretável, destacando seu potencial como um paradigma de modelagem cerebral de uso geral. O código está disponível em https://github.com/HaitaoWuTJU/BrainJanus{GitHub}.
English
Modeling the bidirectional correspondence between external sensory stimuli and internal neural activity has emerged as a critical frontier in neuroscience. However, existing approaches predominantly treat brain encoding and decoding as isolated tasks, relying heavily on unimodal alignment and external priors while overlooking the brain's intrinsic nature as a multimodal integration system. To address these limitations, we propose BrainJanus, the first unified brain model that integrates brain, vision, and language within a single framework. Specifically, we introduce a Unified Brain Tokenizer to quantize continuous neural dynamics into discrete tokens aligned with visual and linguistic representations in a shared Omni space. Building on this, we utilize an All-in-One autoregressive architecture that leverages next-token prediction to enable seamless any-to-any generation, which encompasses image-to-brain and text-to-brain encoding, and brain-to-image and brain-to-text decoding. Extensive experiments demonstrate that BrainJanus achieves superior performance across diverse benchmarks. Furthermore, our framework exhibits zero-shot generalization and preserves interpretable biological topography, highlighting its potential as a general-purpose brain modeling paradigm. The code is available at https://github.com/HaitaoWuTJU/BrainJanus{GitHub}.