ChatPaper.aiChatPaper

UniVR: Denken im visuellen Raum für einheitliches visuelles Schließen

UniVR: Thinking in Visual Space for Unified Visual Reasoning

July 14, 2026
Autoren: Zhongwei Ren, Yunchao Wei, Yao Zhao, Weibo Gong, Xiao Liu, Anran Wang, Xiangtai Li, Xiaojie Jin
cs.AI

Zusammenfassung

Das Erlernen von breitem Weltwissen direkt aus rohen visuellen Daten ist eine fundamentale Fähigkeit von Intelligenz. Wir stellen UniVR vor, die erste Untersuchung, die gleichzeitig komplexes Schlussfolgern, feinkörnige physikalische Dynamiken und langfristige Planung aus rein visuellen Demonstrationen erlernt. Im Kern von UniVR steht VR-GRPO, ein Paradigma des Verstärkungslernens mit komplementären globalen und schrittweisen Belohnungen. Dieser Ansatz gewährleistet logische Kohärenz und physikalische Konsistenz während des gesamten Schlussfolgerungsprozesses, ohne dass aufgabenspezifische Heuristiken oder Bild-Text-Paare erforderlich sind. Zum Training und zur Evaluierung von UniVR erstellen wir VR-X, einen groß angelegten Benchmark, der aus 16 verschiedenen Quellen zusammengestellt wurde und langfristige Manipulation, räumliche Rätsel sowie physikalisches Schlussfolgern abdeckt. Es ist die erste umfassende Testreihe, die diese heterogenen Fähigkeiten unter einem rein visuellen Protokoll bewertet. Bemerkenswerterweise erzielt UniVR eine Verbesserung von bis zu 25 % auf VR-X, und sein überlegenes visuelles Schlussfolgern steigert auch die Leistung bei verschiedenen multimodalen Verständnis-Benchmarks. Diese Ergebnisse unterstreichen das enorme Potenzial des Schlussfolgerns in visuellen Räumen; sämtlicher Code, Daten und Modelle werden für die weitere Forschung als Open Source bereitgestellt.
English
Learning broad world knowledge directly from raw visual data is a fundamental capability of intelligence. We introduce UniVR, the first investigation into simultaneously learning complex reasoning, fine-grained physical dynamics, and long-term planning from pure visual demonstrations. At its core, UniVR features VR-GRPO, a reinforcement learning paradigm with complementary global and step-level rewards. This approach enforces logical coherence and physical consistency throughout the reasoning process without requiring task-specific heuristics or image-text pairs. To train and evaluate UniVR, we construct VR-X, a large-scale benchmark curated from 16 diverse sources spanning long-horizon manipulation, spatial puzzles, and physical reasoning. It is the first comprehensive suite to assess these heterogeneous capabilities under a purely visual protocol. Remarkably, UniVR achieves up to a 25% improvement on VR-X, and its superior visual reasoning also boosts performance on various multimodal understanding benchmarks. These findings underscore the vast potential of reasoning within visual spaces, with all code, data, and models are open-sourced for further research.