BrainJanus: Een Geünificeerd Model voor Begrijpen en Genereren over Brein, Beeld en Taal
BrainJanus: A Unified Model for Understanding and Generation across Brain, Vision, and Language
June 29, 2026
Auteurs: Haitao Wu, Qirui Zhang, Zhouheng Yao, Shangquan Sun, Qihao Zheng, Mianxin Liu, Chi Zhang, Wanli Ouyang, Chunfeng Song, Changqing Zhang, Jiamin Wu
cs.AI
Samenvatting
Het modelleren van de bidirectionele correspondentie tussen externe sensorische stimuli en interne neurale activiteit is naar voren gekomen als een cruciaal grensgebied in de neurowetenschappen. Bestaande benaderingen behandelen hersenencodering en -decodering echter overwegend als geïsoleerde taken, sterk leunend op unimodale afstemming en externe prior, terwijl ze voorbijgaan aan de intrinsieke aard van het brein als een multimodaal integratiesysteem. Om deze beperkingen aan te pakken, stellen wij BrainJanus voor, het eerste geünificeerde breinmodel dat brein, visie en taal integreert binnen één enkel raamwerk. In het bijzonder introduceren we een Unified Brain Tokenizer om continue neurale dynamiek te kwantiseren in discrete tokens die zijn afgestemd op visuele en linguïstische representaties in een gedeelde Omni-ruimte. Hierop voortbouwend gebruiken we een All-in-One autoregressieve architectuur die gebruikmaakt van next-token predictie om naadloze any-to-any generatie mogelijk te maken, die beeld-naar-brein en tekst-naar-brein encodering, en brein-naar-beeld en brein-naar-tekst decodering omvat. Uitgebreide experimenten tonen aan dat BrainJanus superieure prestaties behaalt op diverse benchmarks. Bovendien vertoont ons raamwerk zero-shot generalisatie en behoudt het interpreteerbare biologische topografie, wat het potentieel ervan als een general-purpose hersenmodelleringsparadigma benadrukt. De code is beschikbaar op https://github.com/HaitaoWuTJU/BrainJanus{GitHub}.
English
Modeling the bidirectional correspondence between external sensory stimuli and internal neural activity has emerged as a critical frontier in neuroscience. However, existing approaches predominantly treat brain encoding and decoding as isolated tasks, relying heavily on unimodal alignment and external priors while overlooking the brain's intrinsic nature as a multimodal integration system. To address these limitations, we propose BrainJanus, the first unified brain model that integrates brain, vision, and language within a single framework. Specifically, we introduce a Unified Brain Tokenizer to quantize continuous neural dynamics into discrete tokens aligned with visual and linguistic representations in a shared Omni space. Building on this, we utilize an All-in-One autoregressive architecture that leverages next-token prediction to enable seamless any-to-any generation, which encompasses image-to-brain and text-to-brain encoding, and brain-to-image and brain-to-text decoding. Extensive experiments demonstrate that BrainJanus achieves superior performance across diverse benchmarks. Furthermore, our framework exhibits zero-shot generalization and preserves interpretable biological topography, highlighting its potential as a general-purpose brain modeling paradigm. The code is available at https://github.com/HaitaoWuTJU/BrainJanus{GitHub}.