ChatPaper.aiChatPaper

Metal-Sci : Un benchmark de calcul scientifique pour la recherche évolutionnaire de noyau LLM sur Apple Silicon

Metal-Sci: A Scientific Compute Benchmark for Evolutionary LLM Kernel Search on Apple Silicon

May 10, 2026
Auteurs: Víctor Gallego
cs.AI

Résumé

Nous présentons Metal-Sci, un banc d’essai comprenant 10 tâches de noyaux de calcul scientifiques pour Apple Silicon Metal, couvrant six régimes d’optimisation (stencils, paires complètes dans les problèmes à N corps, Boltzmann multi-champs, dynamique moléculaire par liste de voisins, EDP multi-noyaux, FFT). Chaque tâche fournit une référence CPU, une fonction de fitness ancrée sur le roofline, et une taille de généralisation réservée. Nous associons ce banc d’essai à un environnement léger de recherche automatique de noyaux qui compile chaque candidat à l’exécution, l’évalue par rapport au roofline sur plusieurs tailles, et transmet des diagnostics structurés de compilation et de correction par taille à un LLM gelé pilotant une boucle évolutive (1 + 1). Nous rapportons des balayages appariés sur un modèle unique de Claude Opus 4.7, Gemini 3.1 Pro et GPT 5.5 sur M1 Pro : les accélérations auto-mesurées dans la distribution vont de 1,00× à 10,7×. Au-delà de l’accélération brute, notre revendication méthodologique centrale est structurelle : la fonction de score de validation réservée Φ_T (évaluée une seule fois en fin de parcours sur une configuration que l’agent ne voit jamais pendant la recherche) agit comme un mécanisme de supervision mécanique peu coûteux sur cette boucle de recherche automatique, détectant par exemple un modèle <uint D> HMC d’Opus gagnant qui renvoie des échantillons erronés pour des dimensions inédites, et un meilleur FFT3D de GPT qui gagne dans la distribution avec une accélération de 2,95× mais chute à 0,23× sur un cube réservé de 256³, une régression silencieuse que le seul score intra-distribution ne peut pas voir. Code sur https://github.com/vicgalle/metal-sci-kernels.
English
We present Metal-Sci, a 10-task benchmark of scientific Apple Silicon Metal compute kernels spanning six optimization regimes (stencils, all-pairs in n-body problems, multi-field Boltzmann, neighbor-list molecular dynamics, multi-kernel PDE, FFT). Each task ships a CPU reference, a roofline-anchored fitness function, and a held-out generalization size. We pair the benchmark with a lightweight harness for automatic kernel search that runtime-compiles each candidate, scores it against the roofline across multiple sizes, and feeds structured compile and per-size correctness diagnostics back to a frozen LLM driving a (1{+}1) evolutionary loop. We report matched single-model sweeps of Claude Opus 4.7, Gemini 3.1 Pro, and GPT 5.5 on M1 Pro: in-distribution self-speedups span 1.00times to 10.7times. Beyond raw speedup, our central methodological claim is structural: the held-out gate scoring function Φ_T (evaluated once at end-of-run on a configuration the agent never sees during search) functions as a cheap mechanical oversight primitive on this automatic search loop, catching e.g. an Opus template <uint D> HMC win that returns wrong samples at unseen dimensions, and a GPT FFT3D best that wins in-distribution at 2.95times speedup but collapses to 0.23times on a 256^3 held-out cube, a silent regression that the in-distribution score alone cannot see. Code at https://github.com/vicgalle/metal-sci-kernels