Спектральное переподключение для исследования, очистки и слияния моделей
Spectral Rewiring for Exploration, Purification, and Model Merging
July 3, 2026
Авторы: Zhilong Zhang, Hongli Yu, Huan-ang Gao, Hanlin Wu, Yuxuan Song, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou
cs.AI
Аннотация
Обучение с подкреплением стало стандартной методикой пост-обучения для больших языковых моделей, однако плотные обновления всех параметров создают два узких места, актуальных для развертывания: подавленная производительность рассуждений, часто проявляющаяся в преждевременном насыщении масштабирования во время тестирования, и интерференция при консолидации множества способностей посредством многодоменного обучения или слияния моделей. Мы показываем, что эффективная для рассуждений компонента этих обновлений во многом сосредоточена в спектральном пространстве базовой модели, что мотивирует разработку метода «Перестройка с выравниванием подпространства» (SAR) – метода пост-фактум редактирования, который сохраняет это спектральное ядро, удаляя ортогональные компоненты. Таким образом, SAR сохраняет улучшения в рассуждениях и отфильтровывает остаточные направления обновлений, подавляющие производительность или усиливающие междоменную интерференцию. На нескольких семействах моделей и масштабах SAR извлекает компактные ядра рассуждений, используя всего около 0,58% от общего числа параметров: он сохраняет более 99% производительности после обучения, улучшает исследование с высокими k в математических рассуждениях и обобщается на агентное программирование, улучшая шесть из семи открытых бенчмарков на внутренней модели. SAR также очищает смешанные обновления обучения по доменам, высвобождая подавленную способность к программированию при сохранении математических рассуждений и следования инструкциям. Кроме того, он позволяет объединять модели разных экспертов, обеспечивая междоменную генерализацию, которая превосходит предыдущие базовые методы объединения и даже лучших однодоменных экспертов. В целом, SAR показывает, что извлечение эффективных для рассуждений обновлений из геометрии параметров может служить механизмом без обучения для улучшения рассуждений и многодоменной производительности.
English
Reinforcement learning has become a standard post-training recipe for large language models, but dense full-parameter updates create two deployment-relevant bottlenecks: suppressed reasoning performance, often reflected by premature saturation of test-time scaling, and interference when consolidating multiple capabilities through multi-domain training or model merging. We show that the reasoning-effective component of these updates is largely concentrated in the base model's spectral space, motivating Subspace-Aligned Rewiring (SAR), a post-hoc editing method that retains this spectral core while removing orthogonal components. SAR therefore preserves reasoning gains and filters residual update directions that suppress performance or amplify cross-domain interference. Across several model families and scales, SAR extracts compact reasoning cores using as little as approximately 0.58% of total parameters: it preserves over 99% of post-training performance and improves high-k exploration in mathematical reasoning, and generalizes to agentic coding by improving six of seven open benchmarks on an in-house model. SAR also purifies mixed-domain training updates by releasing suppressed coding capability while maintaining math reasoning and instruction following. It further enables model merging across experts, yielding cross-domain generalization that surpasses previous merging baselines and even the best single-domain experts. Overall, SAR shows that extracting reasoning-effective updates from parameter geometry can serve as a training-free mechanism to improve reasoning and multi-domain performance.