Além do NL2Code: Uma Pesquisa Estruturada sobre Inteligência de Código Multimodal
Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence
June 16, 2026
Autores: Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng Shi, Jian Hu, Zhixiong Zeng
cs.AI
Resumo
Embora os Grandes Modelos de Linguagem (LLMs) tenham avançado substancialmente a síntese de texto para código, muitas tarefas reais de programação especificam a intenção por meio de artefatos visuais, como capturas de tela, gráficos, desenhos vetoriais, vídeos e estados interativos. Essas tarefas exigem que os modelos conectem a percepção visual a programas executáveis, pois a correção depende não apenas da sintaxe, mas também do layout, da semântica dos dados, do comportamento interativo e de restrições específicas do domínio que se aplicam após a execução. Esta pesquisa examina a Inteligência de Código Multimodal, abrangendo sistemas que geram, editam, refinam ou raciocinam com código sob entradas e saídas visualmente fundamentadas. Primeiramente, formulamos o campo pelo papel que o código desempenha em cada tarefa, distinguindo código como um artefato renderizado, uma estrutura simbólica editável, uma representação científica, um traço de raciocínio intermediário ou uma política executável ou interface de ferramenta. Em seguida, organizamos benchmarks e métodos em quatro domínios: Interface Gráfica do Usuário, Visualização Científica, Gráficos Estruturados e Tarefas e Estruturas de Fronteira. Essa taxonomia conecta problemas maduros de geração de artefatos a configurações emergentes de agentes e unificadas, permitindo-nos comparar como diferentes tarefas tratam as evidências de correção. Olhando para o futuro, argumentamos que pesquisas futuras podem se beneficiar de quatro direções centradas em verificação. A validação multissinal pode combinar evidências complementares de correção, a verificação multiestado pode testar o comportamento ao longo de trajetórias de execução, o teste de transferência entre tarefas pode investigar habilidades visual-código reutilizáveis, e traços verificáveis de agentes podem revelar se as ações dos agentes são fundamentadas em evidências visuais. Juntas, essas direções podem mover este campo da imitação de saída única para sistemas executáveis fundamentados em evidências. Um projeto em andamento e recursos estão disponíveis em https://github.com/xjywhu/Awesome-Multimodal-LLM-for-Code{GitHub}.
English
While Large Language Models (LLMs) have substantially advanced text-to-code synthesis, many real programming tasks specify intent through visual artifacts such as screenshots, charts, vector drawings, videos, and interactive states. These tasks require models to connect visual perception to executable programs, because correctness depends not only on syntax but also on layout, data semantics, interaction behavior, and domain-specific constraints that apply after execution. This survey examines Multimodal Code Intelligence, covering systems that generate, edit, refine, or reason with code under visually grounded inputs and outputs. We first formulate the field by the role that code plays in each task, distinguishing code as a rendered artifact, an editable symbolic structure, a scientific representation, an intermediate reasoning trace, or an executable policy or tool interface. We then organize benchmarks and methods into four domains: Graphical User Interface, Scientific Visualization, Structured Graphics, and Frontier Tasks and Frameworks. This taxonomy connects mature artifact-generation problems to emerging agentic and unified settings and allows us to compare how different tasks treat evidence of correctness. Looking ahead, we argue that future research may benefit from four verification-centered directions. Multi-signal validation can combine complementary evidence of correctness, multi-state verification can test behavior across execution trajectories, cross-task transfer testing can probe reusable visual-code skills, and verifiable agent traces can reveal whether agent actions are grounded in visual evidence. Together, these directions may move this field from single-output imitation toward evidence-grounded executable systems. An ongoing project and resources are available on https://github.com/xjywhu/Awesome-Multimodal-LLM-for-Code{GitHub}.