ChatPaper.aiChatPaper

VFIG: Vectoriseren van Complexe Figuren in SVG met Vision-Language Modellen

VFIG: Vectorizing Complex Figures in SVG with Vision-Language Models

March 25, 2026
Auteurs: Qijia He, Xunmei Liu, Hammaad Memon, Ziang Li, Zixian Ma, Jaemin Cho, Jason Ren, Daniel S Weld, Ranjay Krishna
cs.AI

Samenvatting

Schaalbare Vectorafbeeldingen (SVG) zijn een essentieel formaat voor technische illustraties en digitaal ontwerp, omdat ze resolutie-onafhankelijkheid en flexibele semantische bewerkbaarheid bieden. In de praktijk gaan de oorspronkelijke vectorbrondbestanden echter vaak verloren of zijn ze niet toegankelijk, waardoor alleen 'platte' gerasterde versies (zoals PNG of JPEG) overblijven die moeilijk aan te passen of te schalen zijn. Het handmatig reconstrueren van deze figuren is een buitengewoon arbeidsintensief proces dat gespecialiseerde expertise vereist om de oorspronkelijke geometrische intentie te herstellen. Om deze kloof te overbruggen, stellen we VFIG voor, een familie van Vision-Language Modellen die zijn getraind voor complexe en hoogwaardige figuur-naar-SVG-conversie. Hoewel deze taak van nature data-gedreven is, zijn bestaande datasets doorgaans kleinschalig en missen ze de complexiteit van professionele diagrammen. Wij lossen dit op door VFIG-DATA te introduceren, een grootschalige dataset met 66K hoogwaardige figuur-SVG-paren, samengesteld uit een diverse mix van figuren uit echte wetenschappelijke artikelen en procedureel gegenereerde diagrammen. Omdat SVG's zijn opgebouwd uit terugkerende primitieven en hiërarchische lokale structuren, introduceren we een coarse-to-fine trainingscurriculum dat begint met supervised fine-tuning (SFT) om atomische primitieven te leren en overgaat naar reinforcement learning (RL)-verfijning om de globale diagramnauwkeurigheid, lay-outconsistentie en topologische edge cases te optimaliseren. Ten slotte introduceren we VFIG-BENCH, een uitgebreide evaluatieset met nieuwe metrieken die zijn ontworpen om de structurele integriteit van complexe figuren te meten. VFIG behaalt state-of-the-art prestaties onder open-source modellen en presteert vergelijkbaar met GPT-5.2, met een VLM-Judge-score van 0.829 op VFIG-BENCH.
English
Scalable Vector Graphics (SVG) are an essential format for technical illustration and digital design, offering precise resolution independence and flexible semantic editability. In practice, however, original vector source files are frequently lost or inaccessible, leaving only "flat" rasterized versions (e.g., PNG or JPEG) that are difficult to modify or scale. Manually reconstructing these figures is a prohibitively labor-intensive process, requiring specialized expertise to recover the original geometric intent. To bridge this gap, we propose VFIG, a family of Vision-Language Models trained for complex and high-fidelity figure-to-SVG conversion. While this task is inherently data-driven, existing datasets are typically small-scale and lack the complexity of professional diagrams. We address this by introducing VFIG-DATA, a large-scale dataset of 66K high-quality figure-SVG pairs, curated from a diverse mix of real-world paper figures and procedurally generated diagrams. Recognizing that SVGs are composed of recurring primitives and hierarchical local structures, we introduce a coarse-to-fine training curriculum that begins with supervised fine-tuning (SFT) to learn atomic primitives and transitions to reinforcement learning (RL) refinement to optimize global diagram fidelity, layout consistency, and topological edge cases. Finally, we introduce VFIG-BENCH, a comprehensive evaluation suite with novel metrics designed to measure the structural integrity of complex figures. VFIG achieves state-of-the-art performance among open-source models and performs on par with GPT-5.2, achieving a VLM-Judge score of 0.829 on VFIG-BENCH.