UniVR: Denken in visuele ruimte voor uniforme visuele redenering
UniVR: Thinking in Visual Space for Unified Visual Reasoning
July 14, 2026
Auteurs: Zhongwei Ren, Yunchao Wei, Yao Zhao, Weibo Gong, Xiao Liu, Anran Wang, Xiangtai Li, Xiaojie Jin
cs.AI
Samenvatting
Het leren van brede wereldkennis rechtstreeks uit ruwe visuele data is een fundamentele eigenschap van intelligentie. We introduceren UniVR, het eerste onderzoek naar het gelijktijdig aanleren van complex redeneren, fijnmazige fysische dynamica en langetermijnplanning op basis van puur visuele demonstraties. De kern van UniVR wordt gevormd door VR-GRPO, een versterkend leerparadigma met complementaire globale beloningen en beloningen per stap. Deze aanpak waarborgt logische samenhang en fysische consistentie gedurende het hele redeneerproces, zonder dat er taakspecifieke heuristieken of beeld-tekst paren nodig zijn. Voor het trainen en evalueren van UniVR hebben we VR-X geconstrueerd, een grootschalige benchmark samengesteld uit 16 diverse bronnen die langetermijnmanipulatie, ruimtelijke puzzels en fysisch redeneren bestrijken. Het is de eerste uitgebreide verzameling om deze heterogene vaardigheden te beoordelen onder een puur visueel protocol. Opmerkelijk genoeg behaalt UniVR een verbetering tot 25% op VR-X, en het superieure visuele redeneervermogen verhoogt ook de prestaties op diverse multimodale begripsbenchmarks. Deze bevindingen onderstrepen het enorme potentieel van redeneren binnen visuele ruimtes, waarbij alle code, gegevens en modellen open source beschikbaar worden gesteld voor verder onderzoek.
English
Learning broad world knowledge directly from raw visual data is a fundamental capability of intelligence. We introduce UniVR, the first investigation into simultaneously learning complex reasoning, fine-grained physical dynamics, and long-term planning from pure visual demonstrations. At its core, UniVR features VR-GRPO, a reinforcement learning paradigm with complementary global and step-level rewards. This approach enforces logical coherence and physical consistency throughout the reasoning process without requiring task-specific heuristics or image-text pairs. To train and evaluate UniVR, we construct VR-X, a large-scale benchmark curated from 16 diverse sources spanning long-horizon manipulation, spatial puzzles, and physical reasoning. It is the first comprehensive suite to assess these heterogeneous capabilities under a purely visual protocol. Remarkably, UniVR achieves up to a 25% improvement on VR-X, and its superior visual reasoning also boosts performance on various multimodal understanding benchmarks. These findings underscore the vast potential of reasoning within visual spaces, with all code, data, and models are open-sourced for further research.