CogniRoute: Aprendendo a Roteirizar Evidências Sociais em Modelos Onimodais
CogniRoute: Learning to Route Social Evidence in Omni-Modal Models
June 18, 2026
Autores: Yifan Shen, Pei Tian, Xinzhuo Li, Bowen Fang, Shujun Xia, Bingxuan Li, Ana Jojic, Wenming Ye, Xu Cao, James Matthew Rehg, Ismini Lourentzou
cs.AI
Resumo
Modelos omnimodais podem ingerir vídeo, áudio e texto, mas o acesso unificado a múltiplas modalidades não garante que um modelo utilize as evidências corretas. Essa lacuna é especialmente acentuada em perguntas e respostas de vídeos sociais, onde a resposta pode depender de um gesto, tom vocal, dica temporal ou incompatibilidade entre o que é dito e o que é visualmente expresso. Apresentamos o CogniRoute, uma estrutura de Mistura de Especialistas guiada por esquema para raciocínio omni social. O CogniRoute utiliza um esquema cognitivo exclusivo de treinamento que fatora cada exemplo por relação cross-modal, demanda de raciocínio e escopo temporal, e alinha assinaturas de roteamento globais com essa estrutura durante o ajuste fino supervisionado. Além disso, introduzimos o aprendizado por reforço consciente de rotas, que otimiza conjuntamente a geração de tokens e a alocação de especialistas usando recompensas por correção da resposta, raciocínio consistente entre modalidades e ancoragem temporal cognitiva. Para apoiar o treinamento e a avaliação, construímos o OmniSocialBench, um recurso de QA de vídeo social diagnóstico com 118 mil exemplos de treinamento estruturados, traços de raciocínio fundamentados, rótulos de esquema, intervalos de evidência temporal e uma divisão de avaliação verificada manualmente. O CogniRoute atinge 59,38% de acurácia média no OmniSocialBench, superando a linha de base proprietária mais forte em 15,33 pontos percentuais e a linha de base omni de código aberto mais forte em 26,77 pontos, com os maiores ganhos em perguntas que exigem coordenação audiovisual, resolução de conflitos e inferência social ancorada temporalmente.
English
Omni-modal models can ingest video, audio, and text, but unified access to multiple modalities does not guarantee that a model uses the right evidence. This gap is especially pronounced in social video question answering, where the answer may hinge on a gesture, vocal tone, temporal cue, or mismatch between what is said and what is visually expressed. We introduce CogniRoute, a schema-guided Mixture-of-Experts framework for social omni reasoning. CogniRoute uses a training-only cognitive schema that factorizes each example by cross-modal relation, reasoning demand, and temporal scope, and aligns global routing signatures with this structure during supervised fine-tuning. We further introduce route-aware reinforcement learning, which jointly optimizes token generation and expert allocation using rewards for answer correctness, modality-consistent reasoning, and cognitive temporal grounding. To support training and evaluation, we construct OmniSocialBench, a diagnostic social video QA resource with 118K structured training examples, grounded reasoning traces, schema labels, temporal evidence spans, and a manually verified evaluation split. CogniRoute achieves 59.38\% average accuracy on OmniSocialBench, improving over the strongest proprietary baseline by 15.33 percentage points and the strongest open-source omni baseline by 26.77 points, with the largest gains on questions requiring audio-visual coordination, conflict resolution, and temporally grounded social inference.