ChatPaper.aiChatPaper

UniVR: Pensar en el Espacio Visual para el Razonamiento Visual Unificado

UniVR: Thinking in Visual Space for Unified Visual Reasoning

July 14, 2026
Autores: Zhongwei Ren, Yunchao Wei, Yao Zhao, Weibo Gong, Xiao Liu, Anran Wang, Xiangtai Li, Xiaojie Jin
cs.AI

Resumen

Aprender un amplio conocimiento del mundo directamente a partir de datos visuales sin procesar es una capacidad fundamental de la inteligencia. Presentamos UniVR, el primer estudio que investiga simultáneamente el aprendizaje de razonamiento complejo, dinámicas físicas detalladas y planificación a largo plazo a partir de demostraciones puramente visuales. En su núcleo, UniVR incorpora VR-GRPO, un paradigma de aprendizaje por refuerzo con recompensas complementarias a nivel global y de paso. Este enfoque garantiza coherencia lógica y consistencia física en todo el proceso de razonamiento, sin requerir heurísticas específicas de la tarea ni pares imagen-texto. Para entrenar y evaluar UniVR, construimos VR-X, un conjunto de datos a gran escala seleccionado de 16 fuentes diversas que abarcan manipulación a largo plazo, rompecabezas espaciales y razonamiento físico. Es la primera suite integral para evaluar estas capacidades heterogéneas bajo un protocolo puramente visual. De manera notable, UniVR logra una mejora de hasta el 25% en VR-X, y su razonamiento visual superior también potencia el rendimiento en diversos puntos de referencia de comprensión multimodal. Estos hallazgos subrayan el vasto potencial del razonamiento en espacios visuales; todo el código, los datos y los modelos se publican como código abierto para futuras investigaciones.
English
Learning broad world knowledge directly from raw visual data is a fundamental capability of intelligence. We introduce UniVR, the first investigation into simultaneously learning complex reasoning, fine-grained physical dynamics, and long-term planning from pure visual demonstrations. At its core, UniVR features VR-GRPO, a reinforcement learning paradigm with complementary global and step-level rewards. This approach enforces logical coherence and physical consistency throughout the reasoning process without requiring task-specific heuristics or image-text pairs. To train and evaluate UniVR, we construct VR-X, a large-scale benchmark curated from 16 diverse sources spanning long-horizon manipulation, spatial puzzles, and physical reasoning. It is the first comprehensive suite to assess these heterogeneous capabilities under a purely visual protocol. Remarkably, UniVR achieves up to a 25% improvement on VR-X, and its superior visual reasoning also boosts performance on various multimodal understanding benchmarks. These findings underscore the vast potential of reasoning within visual spaces, with all code, data, and models are open-sourced for further research.