UniVR: Мышление в визуальном пространстве для унифицированного визуального рассуждения
UniVR: Thinking in Visual Space for Unified Visual Reasoning
July 14, 2026
Авторы: Zhongwei Ren, Yunchao Wei, Yao Zhao, Weibo Gong, Xiao Liu, Anran Wang, Xiangtai Li, Xiaojie Jin
cs.AI
Аннотация
Обучение обширным знаниям о мире непосредственно на основе необработанных визуальных данных является фундаментальной способностью интеллекта. Мы представляем UniVR — первое исследование, посвященное одновременному обучению сложным рассуждениям, детальной физической динамике и долгосрочному планированию на основе чистых визуальных демонстраций. В основе UniVR лежит VR-GRPO — парадигма обучения с подкреплением, использующая взаимодополняющие глобальные и пошаговые вознаграждения. Этот подход обеспечивает логическую связность и физическую согласованность на протяжении всего процесса рассуждений, не требуя предметно-ориентированных эвристик или пар изображение-текст. Для обучения и оценки UniVR мы создали VR-X — крупномасштабный эталон, собранный из 16 разнообразных источников, охватывающих долгосрочные манипуляции, пространственные головоломки и физические рассуждения. Это первый комплексный набор для оценки этих разнородных способностей в рамках чисто визуального протокола. Примечательно, что UniVR достигает улучшения до 25% на VR-X, а его превосходные визуальные рассуждения также повышают производительность на различных эталонах мультимодального понимания. Эти результаты подчеркивают огромный потенциал рассуждений в визуальных пространствах; весь код, данные и модели открыты для дальнейших исследований.
English
Learning broad world knowledge directly from raw visual data is a fundamental capability of intelligence. We introduce UniVR, the first investigation into simultaneously learning complex reasoning, fine-grained physical dynamics, and long-term planning from pure visual demonstrations. At its core, UniVR features VR-GRPO, a reinforcement learning paradigm with complementary global and step-level rewards. This approach enforces logical coherence and physical consistency throughout the reasoning process without requiring task-specific heuristics or image-text pairs. To train and evaluate UniVR, we construct VR-X, a large-scale benchmark curated from 16 diverse sources spanning long-horizon manipulation, spatial puzzles, and physical reasoning. It is the first comprehensive suite to assess these heterogeneous capabilities under a purely visual protocol. Remarkably, UniVR achieves up to a 25% improvement on VR-X, and its superior visual reasoning also boosts performance on various multimodal understanding benchmarks. These findings underscore the vast potential of reasoning within visual spaces, with all code, data, and models are open-sourced for further research.