ChatPaper.aiChatPaper

CogniRoute: Leren om sociaal bewijs te routeren in omni-modale modellen

CogniRoute: Learning to Route Social Evidence in Omni-Modal Models

June 18, 2026
Auteurs: Yifan Shen, Pei Tian, Xinzhuo Li, Bowen Fang, Shujun Xia, Bingxuan Li, Ana Jojic, Wenming Ye, Xu Cao, James Matthew Rehg, Ismini Lourentzou
cs.AI

Samenvatting

Omni-modale modellen kunnen video, audio en tekst verwerken, maar uniforme toegang tot meerdere modaliteiten garandeert niet dat een model de juiste aanwijzingen gebruikt. Deze lacune is bijzonder uitgesproken bij sociale video-vraagbeantwoording, waar het antwoord kan afhangen van een gebaar, stemtoon, temporele aanwijzing of een mismatch tussen wat wordt gezegd en wat visueel wordt uitgedrukt. We introduceren CogniRoute, een schema-gestuurd Mixture-of-Experts-raamwerk voor sociale omni-redenering. CogniRoute gebruikt een uitsluitend voor training ingezet cognitief schema dat elk voorbeeld factoriseert op basis van cross-modale relatie, redeneerbehoefte en temporele reikwijdte, en stemt tijdens gesuperviseerde fine-tuning globale routeringssignaturen af op deze structuur. Verder introduceren we routebewust reinforcement learning, dat token-generatie en expert-toewijzing gezamenlijk optimaliseert met behulp van beloningen voor antwoordcorrectheid, modaliteitsconsistente redenering en cognitieve temporele verankering. Ter ondersteuning van training en evaluatie construeren we OmniSocialBench, een diagnostische sociale video-QA-bron met 118K gestructureerde trainingsvoorbeelden, gefundeerde redeneersporen, schemalabels, temporele bewijsspannen en een handmatig geverifieerde evaluatiesplitsing. CogniRoute behaalt een gemiddelde nauwkeurigheid van 59,38% op OmniSocialBench, een verbetering van 15,33 procentpunt ten opzichte van de sterkste propriëtaire basislijn en 26,77 procentpunt ten opzichte van de sterkste open-source omni-basislijn, met de grootste winst op vragen die audiovisuele coördinatie, conflictoplossing en temporeel gefundeerde sociale inferentie vereisen.
English
Omni-modal models can ingest video, audio, and text, but unified access to multiple modalities does not guarantee that a model uses the right evidence. This gap is especially pronounced in social video question answering, where the answer may hinge on a gesture, vocal tone, temporal cue, or mismatch between what is said and what is visually expressed. We introduce CogniRoute, a schema-guided Mixture-of-Experts framework for social omni reasoning. CogniRoute uses a training-only cognitive schema that factorizes each example by cross-modal relation, reasoning demand, and temporal scope, and aligns global routing signatures with this structure during supervised fine-tuning. We further introduce route-aware reinforcement learning, which jointly optimizes token generation and expert allocation using rewards for answer correctness, modality-consistent reasoning, and cognitive temporal grounding. To support training and evaluation, we construct OmniSocialBench, a diagnostic social video QA resource with 118K structured training examples, grounded reasoning traces, schema labels, temporal evidence spans, and a manually verified evaluation split. CogniRoute achieves 59.38\% average accuracy on OmniSocialBench, improving over the strongest proprietary baseline by 15.33 percentage points and the strongest open-source omni baseline by 26.77 points, with the largest gains on questions requiring audio-visual coordination, conflict resolution, and temporally grounded social inference.