ChatPaper.aiChatPaper

SketchVLM : Les modèles de vision par le langage peuvent annoter des images pour expliciter leur raisonnement et guider les utilisateurs.

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

April 23, 2026
Auteurs: Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen
cs.AI

Résumé

Lorsqu'ils répondent à des questions sur des images, les humains pointent, étiquettent et dessinent naturellement pour expliquer leur raisonnement. En revanche, les modèles vision-langage (VLM) modernes tels que Gemini-3-Pro et GPT-5 ne répondent que par du texte, ce qui peut être difficile à vérifier pour les utilisateurs. Nous présentons SketchVLM, un cadre agnostique aux modèles et ne nécessitant pas d'entraînement, qui permet aux VLM de produire des superpositions SVG non destructives et modifiables sur l'image d'entrée pour expliquer visuellement leurs réponses. Sur sept benchmarks couvrant le raisonnement visuel (navigation dans un labyrinthe, prédiction de trajectoire de chute libre et décompte d'objets) et le dessin (étiquetage de parties, relier les points et dessiner des formes autour d'objets), SketchVLM améliore la précision des tâches de raisonnement visuel jusqu'à +28,5 points de pourcentage et la qualité des annotations jusqu'à 1,48x par rapport aux méthodes de référence par édition d'image et par dessin avec fine-tuning, tout en produisant des annotations plus fidèles à la réponse énoncée par le modèle. Nous constatons qu'une génération en un seul tour atteint déjà une forte précision et qualité d'annotation, et que la génération multi-tours ouvre de nouvelles opportunités de collaboration humain-IA. Une démonstration interactive et le code sont disponibles à l'adresse https://sketchvlm.github.io/.
English
When answering questions about images, humans naturally point, label, and draw to explain their reasoning. In contrast, modern vision-language models (VLMs) such as Gemini-3-Pro and GPT-5 only respond with text, which can be difficult for users to verify. We present SketchVLM, a training-free, model-agnostic framework that enables VLMs to produce non-destructive, editable SVG overlays on the input image to visually explain their answers. Across seven benchmarks spanning visual reasoning (maze navigation, ball-drop trajectory prediction, and object counting) and drawing (part labeling, connecting-the-dots, and drawing shapes around objects), SketchVLM improves visual reasoning task accuracy by up to +28.5 percentage points and annotation quality by up to 1.48x relative to image-editing and fine-tuned sketching baselines, while also producing annotations that are more faithful to the model's stated answer. We find that single-turn generation already achieves strong accuracy and annotation quality, and multi-turn generation opens up further opportunities for human-AI collaboration. An interactive demo and code are at https://sketchvlm.github.io/.