ChatPaper.aiChatPaper

MentalThink: Dando forma a los pensamientos en el mundo mental de SVG

MentalThink: Shaping Thoughts in Mental SVG World

July 3, 2026
Autores: Kangheng Lin, Jisheng Yin, Dingming Li, En Yu, Yana Wei, Han Zhou, Liang Zhao, Hongyu Zhou, Hongbo Peng, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Jingyu Wang
cs.AI

Resumen

Presentamos MentalThink, un paradigma de razonamiento visual-simbólico que dota a los LLMs multimodales (MLLMs) de un mecanismo ejecutable para la visualización "mental". El núcleo de MentalThink es un canal de pensamiento con SVG, donde el modelo aprende a generar, renderizar e interpretar código de gráficos vectoriales escalables (SVG) como representación visual intermedia para el razonamiento de múltiples turnos. Mediante la creación de bocetos vectoriales estructurados, el modelo puede externalizar hipótesis espaciales, inspeccionarlas a través de un renderizado determinista y razonar dentro de un espacio geométrico restringido, imitando eficazmente el proceso humano de imaginación mental. Implementamos este paradigma a través de un marco de entrenamiento en dos etapas, combinando el Ajuste Fino Supervisado (SFT) para la alineación sintáctica SVG con el Aprendizaje por Refuerzo (RL) de múltiples turnos para fomentar la inspección, revisión y refinamiento iterativos de hipótesis visuales intermedias. Evaluaciones exhaustivas demuestran que MentalThink alcanza un rendimiento superior en puntos de referencia de comprensión y razonamiento espacial (por ejemplo, 55.1% en VSIBench, 76.0% en MindCube), mostrando que los gráficos vectoriales ejecutables proporcionan un espacio de trabajo visual verificable para la toma de perspectiva dinámica, la reflexión visual y la construcción de escenas compositivas.
English
We introduce MentalThink, a visual-symbolic reasoning paradigm that equips Multimodal LLMs (MLLMs) with an executable mechanism for "mental" visualization. The core of MentalThink is a think-with-SVG pipeline, where the model learns to generate, render, and interpret scalable vector graphics (SVG) code as an intermediate visual representation for multi-turn reasoning. By creating structured vector sketches, the model can externalize spatial hypotheses, inspect them through deterministic rendering, and reason within a constrained geometric space, effectively mimicking the human process of mental imagery. We instantiate this paradigm through a two-stage training framework, combining Supervised Fine-Tuning (SFT) for SVG syntactic alignment with multi-turn Reinforcement Learning (RL) to encourage iterative inspection, revision, and refinement of intermediate visual hypotheses. Extensive evaluations demonstrate that MentalThink achieves superior performance on spatial understanding and reasoning benchmarks (e.g., 55.1% on VSIBench, 76.0% on MindCube), showing that executable vector graphics provide a verifiable visual workspace for dynamic perspective taking, visual reflection, and compositional scene construction.