ChatPaper.aiChatPaper

MentalThink: Het Vormgeven van Gedachten in de Mentale SVG-wereld

MentalThink: Shaping Thoughts in Mental SVG World

July 3, 2026
Auteurs: Kangheng Lin, Jisheng Yin, Dingming Li, En Yu, Yana Wei, Han Zhou, Liang Zhao, Hongyu Zhou, Hongbo Peng, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Jingyu Wang
cs.AI

Samenvatting

We introduceren MentalThink, een visueel-symbolisch redeneerparadigma dat multimodale LLM's (MLLM's) voorziet van een uitvoerbaar mechanisme voor 'mentale' visualisatie. De kern van MentalThink is een think-with-SVG-pijplijn, waarbij het model leert om schaalbare vectorafbeeldingen (SVG) te genereren, renderen en interpreteren als een tussenliggende visuele representatie voor meerstapsredeneringen. Door het creëren van gestructureerde vectorschetsen kan het model ruimtelijke hypothesen externaliseren, deze inspecteren via deterministische weergave en redeneren binnen een beperkte geometrische ruimte, waarmee het menselijke proces van mentale beeldvorming effectief wordt nagebootst. We implementeren dit paradigma via een tweefasig trainingsframework, waarbij we Supervised Fine-Tuning (SFT) voor SVG-syntactische uitlijning combineren met meerstaps Reinforcement Learning (RL) om iteratieve inspectie, herziening en verfijning van tussenliggende visuele hypothesen te stimuleren. Uitgebreide evaluaties tonen aan dat MentalThink superieure prestaties levert op benchmarks voor ruimtelijk begrip en redeneren (bijv. 55,1% op VSIBench, 76,0% op MindCube), wat aantoont dat uitvoerbare vectorafbeeldingen een verifieerbare visuele werkruimte bieden voor dynamisch perspectief nemen, visuele reflectie en compositorische scèneconstructie.
English
We introduce MentalThink, a visual-symbolic reasoning paradigm that equips Multimodal LLMs (MLLMs) with an executable mechanism for "mental" visualization. The core of MentalThink is a think-with-SVG pipeline, where the model learns to generate, render, and interpret scalable vector graphics (SVG) code as an intermediate visual representation for multi-turn reasoning. By creating structured vector sketches, the model can externalize spatial hypotheses, inspect them through deterministic rendering, and reason within a constrained geometric space, effectively mimicking the human process of mental imagery. We instantiate this paradigm through a two-stage training framework, combining Supervised Fine-Tuning (SFT) for SVG syntactic alignment with multi-turn Reinforcement Learning (RL) to encourage iterative inspection, revision, and refinement of intermediate visual hypotheses. Extensive evaluations demonstrate that MentalThink achieves superior performance on spatial understanding and reasoning benchmarks (e.g., 55.1% on VSIBench, 76.0% on MindCube), showing that executable vector graphics provide a verifiable visual workspace for dynamic perspective taking, visual reflection, and compositional scene construction.