ChatPaper.aiChatPaper

UniVR : Penser dans l'espace visuel pour un raisonnement visuel unifié

UniVR: Thinking in Visual Space for Unified Visual Reasoning

July 14, 2026
Auteurs: Zhongwei Ren, Yunchao Wei, Yao Zhao, Weibo Gong, Xiao Liu, Anran Wang, Xiangtai Li, Xiaojie Jin
cs.AI

Résumé

Apprendre une connaissance étendue du monde directement à partir de données visuelles brutes est une capacité fondamentale de l'intelligence. Nous présentons UniVR, la première étude portant sur l'apprentissage simultané de raisonnements complexes, de dynamiques physiques fines et de planification à long terme à partir de démonstrations purement visuelles. Au cœur d'UniVR se trouve VR-GRPO, un paradigme d'apprentissage par renforcement doté de récompenses complémentaires globales et par étape. Cette approche garantit la cohérence logique et la cohérence physique tout au long du processus de raisonnement, sans nécessiter d'heuristiques spécifiques à la tâche ni de paires image-texte. Pour entraîner et évaluer UniVR, nous construisons VR-X, un benchmark à grande échelle compilé à partir de 16 sources diverses couvrant la manipulation à long horizon, les puzzles spatiaux et le raisonnement physique. Il s'agit de la première suite complète à évaluer ces capacités hétérogènes dans le cadre d'un protocole purement visuel. De manière remarquable, UniVR obtient jusqu'à 25 % d'amélioration sur VR-X, et sa capacité de raisonnement visuel supérieure améliore également les performances sur divers benchmarks de compréhension multimodale. Ces résultats soulignent l'immense potentiel du raisonnement dans les espaces visuels, et l'ensemble du code, des données et des modèles est rendu open source pour permettre des recherches ultérieures.
English
Learning broad world knowledge directly from raw visual data is a fundamental capability of intelligence. We introduce UniVR, the first investigation into simultaneously learning complex reasoning, fine-grained physical dynamics, and long-term planning from pure visual demonstrations. At its core, UniVR features VR-GRPO, a reinforcement learning paradigm with complementary global and step-level rewards. This approach enforces logical coherence and physical consistency throughout the reasoning process without requiring task-specific heuristics or image-text pairs. To train and evaluate UniVR, we construct VR-X, a large-scale benchmark curated from 16 diverse sources spanning long-horizon manipulation, spatial puzzles, and physical reasoning. It is the first comprehensive suite to assess these heterogeneous capabilities under a purely visual protocol. Remarkably, UniVR achieves up to a 25% improvement on VR-X, and its superior visual reasoning also boosts performance on various multimodal understanding benchmarks. These findings underscore the vast potential of reasoning within visual spaces, with all code, data, and models are open-sourced for further research.