ChatPaper.aiChatPaper

MinT : Infrastructure gérée pour l'entraînement et le déploiement de millions de LLM

MinT: Managed Infrastructure for Training and Serving Millions of LLMs

May 13, 2026
Auteurs: Mind Lab, Song Cao, Vic Cao, Andrew Chen, Kaijie Chen, Cleon Cheng, Steven Chiang, Kaixuan Fan, Hera Feng, Huan Feng, Arthur Fu, Jun Gao, Hongquan Gu, Aaron Guan, Nolan Ho, Mutian Hong, Hailee Hou, Peixuan Hua, Charles Huang, Miles Jiang, Nora Jiang, Yuyi Jiang, Qiuyu Jin, Fancy Kong, Andrew Lei, Kyrie Lei, Alexy Li, Lucian Li, Ray Li, Theo Li, Zhihui Li, Jiayi Lin, Kairus Liu, Kieran Liu, Logan Liu, Xiang Liu, Irvine Lu, Maeve Luo, Runze Lv, Pony Ma, Verity Niu, Anson Qiu, Vincent Wang, Rio Yang, Maxwell Yao, Carrie Ye, Regis Ye, Wenlin Ye, Josh Ying, Danney Zeng, Yuhan Zhan, Anya Zhang, Di Zhang, Ruijia Zhang, Sueky Zhang, Ya Zhang, Wei Zhao, Ada Zhou, Changhai Zhou, Yuhua Zhou, Xinyue Zhu, Murphy Zhuang
cs.AI

Résumé

Nous présentons MindLab Toolkit (MinT), un système d’infrastructure géré pour le post-entraînement et le service en ligne par adaptation de faible rang (LoRA). MinT cible un scénario où de nombreuses politiques entraînées sont produites à partir d’un petit nombre de déploiements coûteux de modèles de base. Au lieu de matérialiser chaque politique sous la forme d’un point de contrôle complet fusionné, MinT maintient le modèle de base résident et déplace les révisions d’adaptateurs LoRA exportés à travers les étapes de déploiement, mise à jour, exportation, évaluation, service et retour arrière, en dissimulant l’entraînement distribué, le service, l’ordonnancement et le transfert de données derrière une interface de service. MinT met à l’échelle ce chemin selon trois axes. La montée en échelle (Scale Up) étend le RL LoRA aux architectures denses et MoE de pointe, y compris les chemins d’attention MLA et DSA, avec un entraînement et un service validés au-delà de 1T de paramètres totaux. La descente en échelle (Scale Down) ne déplace que l’adaptateur LoRA exporté, qui peut représenter moins de 1 % de la taille du modèle de base dans des configurations de rang 1 ; le transfert exclusif de l’adaptateur réduit le temps mesuré d’un facteur 18,3x sur un modèle dense de 4B et de 2,85x sur un MoE de 30B, tandis que le GRPO concurrent multi-politiques réduit le temps réel d’un facteur 1,77x et 1,45x sans augmenter la mémoire de pointe. L’extension vers l’extérieur (Scale Out) sépare l’adressabilité durable des politiques des espaces de travail CPU/GPU : un déploiement parallèle tensoriel prend en charge des catalogues adressables à l’échelle de 10^6 (balayages mesurés d’un seul moteur à travers 100K) et des vagues actives de milliers d’adaptateurs à l’échelle du cluster, le chargement à froid étant traité comme un travail de service planifié et les tenseurs LoRA MoE compactés améliorant le chargement en direct du moteur de 8,5 à 8,7x. MinT gère ainsi des catalogues de politiques LoRA à l’échelle du million tout en entraînant et en servant des révisions d’adaptateurs sélectionnées sur des modèles de base partagés de classe 1T.
English
We present MindLab Toolkit (MinT), a managed infrastructure system for Low-Rank Adaptation (LoRA) post-training and online serving. MinT targets a setting where many trained policies are produced over a small number of expensive base-model deployments. Instead of materializing each policy as a merged full checkpoint, MinT keeps the base model resident and moves exported LoRA adapter revisions through rollout, update, export, evaluation, serving, and rollback, hiding distributed training, serving, scheduling, and data movement behind a service interface. MinT scales this path along three axes. Scale Up extends LoRA RL to frontier-scale dense and MoE architectures, including MLA and DSA attention paths, with training and serving validated beyond 1T total parameters. Scale Down moves only the exported LoRA adapter, which can be under 1% of base-model size in rank-1 settings; adapter-only handoff reduces the measured step by 18.3x on a 4B dense model and 2.85x on a 30B MoE, while concurrent multi-policy GRPO shortens wall time by 1.77x and 1.45x without raising peak memory. Scale Out separates durable policy addressability from CPU/GPU working sets: a tensor-parallel deployment supports 10^6-scale addressable catalogs (measured single-engine sweeps through 100K) and thousand-adapter active waves at cluster scale, with cold loading treated as scheduled service work and packed MoE LoRA tensors improving live engine loading by 8.5-8.7x. MinT thus manages million-scale LoRA policy catalogs while training and serving selected adapter revisions over shared 1T-class base models.