MentalThink: Modelando Pensamentos no Mundo Mental SVG
MentalThink: Shaping Thoughts in Mental SVG World
July 3, 2026
Autores: Kangheng Lin, Jisheng Yin, Dingming Li, En Yu, Yana Wei, Han Zhou, Liang Zhao, Hongyu Zhou, Hongbo Peng, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Jingyu Wang
cs.AI
Resumo
Apresentamos o MentalThink, um paradigma de raciocínio visual-simbólico que equipa os Modelos de Linguagem Multimodais (MLLMs) com um mecanismo executável para visualização "mental". O cerne do MentalThink é um pipeline de pensar-com-SVG, no qual o modelo aprende a gerar, renderizar e interpretar código de gráficos vetoriais escaláveis (SVG) como representação visual intermediária para raciocínio em múltiplas etapas. Ao criar esboços vetoriais estruturados, o modelo pode externalizar hipóteses espaciais, inspecioná-las por meio de renderização determinística e raciocinar dentro de um espaço geométrico restrito, imitando efetivamente o processo humano de imaginação mental. Instanciamos este paradigma através de um framework de treinamento em dois estágios, combinando Ajuste Fino Supervisionado (SFT) para alinhamento sintático de SVG com Aprendizado por Reforço (RL) em múltiplas etapas, a fim de incentivar a inspeção, revisão e refinamento iterativos de hipóteses visuais intermediárias. Avaliações extensas demonstram que o MentalThink alcança desempenho superior em benchmarks de compreensão e raciocínio espacial (por exemplo, 55,1% no VSIBench, 76,0% no MindCube), mostrando que gráficos vetoriais executáveis fornecem um espaço visual verificável para tomada de perspectiva dinâmica, reflexão visual e construção composicional de cenas.
English
We introduce MentalThink, a visual-symbolic reasoning paradigm that equips Multimodal LLMs (MLLMs) with an executable mechanism for "mental" visualization. The core of MentalThink is a think-with-SVG pipeline, where the model learns to generate, render, and interpret scalable vector graphics (SVG) code as an intermediate visual representation for multi-turn reasoning. By creating structured vector sketches, the model can externalize spatial hypotheses, inspect them through deterministic rendering, and reason within a constrained geometric space, effectively mimicking the human process of mental imagery. We instantiate this paradigm through a two-stage training framework, combining Supervised Fine-Tuning (SFT) for SVG syntactic alignment with multi-turn Reinforcement Learning (RL) to encourage iterative inspection, revision, and refinement of intermediate visual hypotheses. Extensive evaluations demonstrate that MentalThink achieves superior performance on spatial understanding and reasoning benchmarks (e.g., 55.1% on VSIBench, 76.0% on MindCube), showing that executable vector graphics provide a verifiable visual workspace for dynamic perspective taking, visual reflection, and compositional scene construction.