ShapeCodeBench : un benchmark renouvelable pour la reconstruction perception-vers-programme de scènes de formes synthétiques
ShapeCodeBench: A Renewable Benchmark for Perception-to-Program Reconstruction of Synthetic Shape Scenes
May 12, 2026
Auteurs: Shivam Kumar
cs.AI
Résumé
Nous présentons ShapeCodeBench, un banc de test synthétique pour la reconstruction perception-à-programme : à partir d'une image matricielle rendue, un modèle doit émettre un programme d'exécution dessinable qu'un évaluateur déterministe re-rend et compare avec la cible. Le DSL v1 comporte quatre primitives sur un canevas blanc de 512 × 512, mais chaque instance est générée à partir d'un générateur de nombres aléatoires ensemencé, ce qui permet de créer de nouveaux ensembles de retenue pour réduire la contamination par instances identiques. Nous publions une partition figée eval_v1 contenant 150 échantillons répartis en niveaux facile, moyen et difficile, évalués selon la correspondance exacte, la précision pixel à pixel, l'IoU du premier plan, le succès d'analyse syntaxique et le succès d'exécution. Nous évaluons un plancher de programme vide, une heuristique classique de vision par ordinateur, Claude Opus 4.7 en effort élevé et maximal, et GPT-5.5 en effort de raisonnement moyen et extra_élevé. L'heuristique est compétitive sur les scènes faciles, mais s'effondre lorsque les chevauchements fusionnent les composants ; la configuration multimodale la plus puissante préserve une grande partie de la structure du premier plan, mais échoue encore à la correspondance exacte en raison de petites erreurs de paramètres. La meilleure correspondance exacte globale reste faible, donc ShapeCodeBench est loin d'être saturé. Le code du banc de test, l'ensemble de données figé, les artefacts d'exécution et les sources de l'article sont publiés pour soutenir la réplication et l'extension indépendantes.
English
We introduce ShapeCodeBench, a synthetic benchmark for perception-to-program reconstruction: given a rendered raster image, a model must emit an executable drawing program that a deterministic evaluator re-renders and compares with the target. The v1 DSL has four primitives on a 512 x 512 black-on-white canvas, but every instance is generated from a seeded RNG, so fresh held-out sets can be created to reduce exact-instance contamination. We release a frozen eval_v1 split with 150 samples across easy, medium, and hard tiers, scored by exact match, pixel accuracy, foreground IoU, parse success, and execution success. We evaluate an empty-program floor, a classical computer-vision heuristic, Claude Opus 4.7 at high and max effort, and GPT-5.5 at medium and extra_high reasoning effort. The heuristic is competitive on easy scenes but collapses when overlaps fuse components; the strongest multimodal configuration preserves much of the foreground structure but still misses exact match because of small parameter errors. Best overall exact match remains low, so ShapeCodeBench is far from saturated. The benchmark code, frozen dataset, run artifacts, and paper sources are released to support independent replication and extension.