ChatPaper.aiChatPaper

Metal-Sci: Um Benchmark de Computação Científica para Busca Evolucionária de Kernels de LLM em Apple Silicon

Metal-Sci: A Scientific Compute Benchmark for Evolutionary LLM Kernel Search on Apple Silicon

May 10, 2026
Autores: Víctor Gallego
cs.AI

Resumo

Apresentamos o Metal-Sci, um benchmark com 10 tarefas de kernels de computação Metal para Apple Silicon, abrangendo seis regimes de otimização (stencils, pares-todos em problemas de n-corpos, Boltzmann multicampo, dinâmica molecular com lista de vizinhos, EDP multi-kernel, FFT). Cada tarefa inclui uma referência de CPU, uma função de aptidão ancorada no roofline e um tamanho de generalização retido. Emparelhamos o benchmark com um arcabouço leve para busca automática de kernels, que compila cada candidato em tempo de execução, avalia seu desempenho em relação ao roofline em múltiplos tamanhos e fornece diagnósticos estruturados de compilação e de correção por tamanho de volta a um LLM congelado que conduz um loop evolucionário (1+1). Relatamos varreduras combinadas de modelo único do Claude Opus 4.7, Gemini 3.1 Pro e GPT 5.5 no M1 Pro: as auto-acelerações dentro da distribuição variam de 1,00x a 10,7x. Além da aceleração bruta, nossa alegação metodológica central é estrutural: a função de pontuação de portão retido Φ_T (avaliada uma vez ao final da execução em uma configuração que o agente nunca vê durante a busca) funciona como uma primitiva de supervisão mecânica barata nesse loop de busca automática, capturando, por exemplo, uma vitória do template Opus <uint D> HMC que retorna amostras erradas em dimensões não vistas, e um melhor GPT FFT3D que vence dentro da distribuição com aceleração de 2,95x, mas colapsa para 0,23x em um cubo retido de 256³, uma regressão silenciosa que a pontuação dentro da distribuição sozinha não consegue ver. Código em https://github.com/vicgalle/metal-sci-kernels
English
We present Metal-Sci, a 10-task benchmark of scientific Apple Silicon Metal compute kernels spanning six optimization regimes (stencils, all-pairs in n-body problems, multi-field Boltzmann, neighbor-list molecular dynamics, multi-kernel PDE, FFT). Each task ships a CPU reference, a roofline-anchored fitness function, and a held-out generalization size. We pair the benchmark with a lightweight harness for automatic kernel search that runtime-compiles each candidate, scores it against the roofline across multiple sizes, and feeds structured compile and per-size correctness diagnostics back to a frozen LLM driving a (1{+}1) evolutionary loop. We report matched single-model sweeps of Claude Opus 4.7, Gemini 3.1 Pro, and GPT 5.5 on M1 Pro: in-distribution self-speedups span 1.00times to 10.7times. Beyond raw speedup, our central methodological claim is structural: the held-out gate scoring function Φ_T (evaluated once at end-of-run on a configuration the agent never sees during search) functions as a cheap mechanical oversight primitive on this automatic search loop, catching e.g. an Opus template <uint D> HMC win that returns wrong samples at unseen dimensions, and a GPT FFT3D best that wins in-distribution at 2.95times speedup but collapses to 0.23times on a 256^3 held-out cube, a silent regression that the in-distribution score alone cannot see. Code at https://github.com/vicgalle/metal-sci-kernels