Reconexión Espectral para Exploración, Purificación y Fusión de Modelos
Spectral Rewiring for Exploration, Purification, and Model Merging
July 3, 2026
Autores: Zhilong Zhang, Hongli Yu, Huan-ang Gao, Hanlin Wu, Yuxuan Song, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou
cs.AI
Resumen
El aprendizaje por refuerzo se ha convertido en una receta estándar de post-entrenamiento para modelos de lenguaje grandes, pero las actualizaciones densas de parámetros completos generan dos cuellos de botella relevantes para el despliegue: un rendimiento de razonamiento suprimido, a menudo reflejado por una saturación prematura del escalado en tiempo de prueba, e interferencia al consolidar múltiples capacidades mediante entrenamiento multidominio o fusión de modelos. Demostramos que el componente efectivo para el razonamiento de estas actualizaciones se concentra en gran medida en el espacio espectral del modelo base, lo que motiva la Reconfiguración Alineada con Subespacio (SAR, por sus siglas en inglés), un método de edición a posteriori que retiene este núcleo espectral mientras elimina componentes ortogonales. Por lo tanto, SAR preserva las ganancias en razonamiento y filtra las direcciones residuales de actualización que suprimen el rendimiento o amplifican la interferencia entre dominios. En varias familias y escalas de modelos, SAR extrae núcleos de razonamiento compactos utilizando tan solo aproximadamente el 0.58% del total de parámetros: preserva más del 99% del rendimiento posterior al entrenamiento y mejora la exploración de alto k en razonamiento matemático, y se generaliza a la codificación agéntica mejorando seis de siete puntos de referencia abiertos en un modelo interno. SAR también purifica las actualizaciones de entrenamiento de dominio mixto al liberar la capacidad de codificación suprimida mientras mantiene el razonamiento matemático y el seguimiento de instrucciones. Además, permite la fusión de modelos entre expertos, generando una generalización entre dominios que supera las líneas base de fusión anteriores e incluso al mejor experto de un solo dominio. En general, SAR demuestra que extraer actualizaciones efectivas para el razonamiento a partir de la geometría de parámetros puede servir como un mecanismo sin entrenamiento para mejorar el razonamiento y el rendimiento multidominio.
English
Reinforcement learning has become a standard post-training recipe for large language models, but dense full-parameter updates create two deployment-relevant bottlenecks: suppressed reasoning performance, often reflected by premature saturation of test-time scaling, and interference when consolidating multiple capabilities through multi-domain training or model merging. We show that the reasoning-effective component of these updates is largely concentrated in the base model's spectral space, motivating Subspace-Aligned Rewiring (SAR), a post-hoc editing method that retains this spectral core while removing orthogonal components. SAR therefore preserves reasoning gains and filters residual update directions that suppress performance or amplify cross-domain interference. Across several model families and scales, SAR extracts compact reasoning cores using as little as approximately 0.58% of total parameters: it preserves over 99% of post-training performance and improves high-k exploration in mathematical reasoning, and generalizes to agentic coding by improving six of seven open benchmarks on an in-house model. SAR also purifies mixed-domain training updates by releasing suppressed coding capability while maintaining math reasoning and instruction following. It further enables model merging across experts, yielding cross-domain generalization that surpasses previous merging baselines and even the best single-domain experts. Overall, SAR shows that extracting reasoning-effective updates from parameter geometry can serve as a training-free mechanism to improve reasoning and multi-domain performance.