DecoupleMix: スケーラブルなVLMデータレシピのための分離比率探索と凸配分
DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes
July 27, 2026
著者: Jiahao Xie, Zhongbin Guo, Qianle Wang, Ruiqi Lu, Dongling Xiao, Wanxuan Sun, Cheng Yang
cs.AI
要旨
視覚言語モデル(VLM)のデータキュレーションはますます活発化しているが、事前学習用混合データを構築するための公開された実践は依然としてほとんどヒューリスティックである。実務者は品質フィルタを通過したデータセットを積み上げ、直感に基づいてクロスドメイン比率を設定し、新規データを受け入れるための原則的かつ帰属可能な基準を欠いており、最先端の手法は非公開のままである。本稿では、データ構築を系統的な混合最適化問題として定式化し、混合を能力間のクラス間比率とカテゴリ内のクラス内比率という直交する二つの部分問題に分解することで、再現可能な工学的アプローチへと転換する。クラス間配分には単一変数の反復探索を用い、クラス内構成には多次元のデータセットレベル評価(品質と難易度をスコア化)を適用し、選択を多様性目標を伴う制約付き凸最適化として定式化する。DecoupleMixフレームワークは、次に収集すべきデータを導出する能力と、データセットの検証を制御可能かつ帰属可能な実験とする能力という二つの重要な機能を提供する。実験により、我々のアプローチがヒューリスティックなベースラインを一貫して凌ぐことが示される。さらに、小規模プロキシで発見された最適比率は、再調整なしで大規模にシームレスに転移可能である。80Bの追加マルチモーダル継続事前学習トークンを用いた我々のVLMは、はるかに大規模なマルチモーダル予算で学習された強力なオープンソースモデルと競合する。
English
While data curation for Vision Language Models (VLMs) is increasingly active, public practice for constructing pretraining mixtures remains largely heuristic: practitioners stack datasets that pass quality filters, set cross-domain ratios by intuition, and lack a principled, attributable criterion for admitting new data, while frontier recipes remain undisclosed. We formulate data construction as a systematic mixture-optimization problem and turn it into a reproducible engineering discipline by decoupling the mixture into two orthogonal sub-problems: inter-class ratios across capabilities and intra-class ratios within a category. For inter-class allocation, we use a single-variable iterative search; for intra-class composition, we apply a multidimensional, dataset-level assessment scoring Quality and Difficulty, and formulate selection as a constrained convex optimization with a diversity objective. The DecoupleMix framework delivers two critical capabilities: guiding what data to collect next and rendering dataset validation a controlled, attributable experiment. Experiments show our approach consistently surpasses heuristic baselines. Moreover, optimal ratios discovered on small-scale proxies transfer seamlessly to larger scales without retuning. Using 80B additional multimodal continue-pretraining tokens, our VLM is competitive with strong open-source models trained with substantially larger multimodal budgets.