MentalThink: Формирование мыслей в ментальном мире SVG
MentalThink: Shaping Thoughts in Mental SVG World
July 3, 2026
Авторы: Kangheng Lin, Jisheng Yin, Dingming Li, En Yu, Yana Wei, Han Zhou, Liang Zhao, Hongyu Zhou, Hongbo Peng, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Jingyu Wang
cs.AI
Аннотация
Мы представляем MentalThink — парадигму визуально-символического рассуждения, которая наделяет мультимодальные большие языковые модели (MLLM) исполнимым механизмом «мысленной» визуализации. Основой MentalThink служит конвейер think-with-SVG, в котором модель учится генерировать, отображать и интерпретировать код масштабируемой векторной графики (SVG) в качестве промежуточного визуального представления для многошаговых рассуждений. Создавая структурированные векторные наброски, модель может экстернализировать пространственные гипотезы, проверять их с помощью детерминированной визуализации и рассуждать в рамках ограниченного геометрического пространства, эффективно имитируя человеческий процесс мысленных образов. Мы реализуем эту парадигму с помощью двухэтапной схемы обучения, объединяющей контролируемую тонкую настройку (SFT) для синтаксического согласования SVG с многошаговым обучением с подкреплением (RL), стимулирующим итеративную проверку, пересмотр и уточнение промежуточных визуальных гипотез. Обширные оценки показывают, что MentalThink достигает превосходных результатов в задачах пространственного понимания и рассуждения (например, 55,1% на VSIBench, 76,0% на MindCube), демонстрируя, что исполнимая векторная графика обеспечивает верифицируемое визуальное рабочее пространство для динамического восприятия перспективы, визуальной рефлексии и композиционного построения сцен.
English
We introduce MentalThink, a visual-symbolic reasoning paradigm that equips Multimodal LLMs (MLLMs) with an executable mechanism for "mental" visualization. The core of MentalThink is a think-with-SVG pipeline, where the model learns to generate, render, and interpret scalable vector graphics (SVG) code as an intermediate visual representation for multi-turn reasoning. By creating structured vector sketches, the model can externalize spatial hypotheses, inspect them through deterministic rendering, and reason within a constrained geometric space, effectively mimicking the human process of mental imagery. We instantiate this paradigm through a two-stage training framework, combining Supervised Fine-Tuning (SFT) for SVG syntactic alignment with multi-turn Reinforcement Learning (RL) to encourage iterative inspection, revision, and refinement of intermediate visual hypotheses. Extensive evaluations demonstrate that MentalThink achieves superior performance on spatial understanding and reasoning benchmarks (e.g., 55.1% on VSIBench, 76.0% on MindCube), showing that executable vector graphics provide a verifiable visual workspace for dynamic perspective taking, visual reflection, and compositional scene construction.