SPADE: 適応的合成実行可能環境における自己対戦
SPADE: Self-Play in Adaptive Synthetic Executable Environments
August 19, 2026
著者: Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques
cs.AI
要旨
継続的自己改善には、自己生成され、多様で、適応的な目標のプールが絶えず拡大し続けることが必要である。言語エージェントにおいて、既存の訓練環境プール(手作業で厳選されたもの、静的に合成されたもの、または固定検証器によるもの)は、学習器がスケールしても目標分布を固定したままにする。我々はSPADE(Self-Play in Adaptive Synthetic Executable Environments)を導入する。これは自己対戦強化学習フレームワークであり、単一のLLMが2つの役割を担う:完全で長期的な訓練環境をOpenAI Gymスタイルのreset()/step()インターフェースを持つ実行可能コードとして記述する環境設計器(Environment Designer)と、その環境内で行動することを学習する推論エージェント(Reasoning Agent)である。各環境は、状態を持つ多ターン環境(状態遷移、報酬関数、検証コード)であり、そのため単一のインターフェースで推論問題と多段階のエージェント的ツール使用の両方を扱える。推論エージェントのリグレットは、特権的ヒントがある場合とない場合の報酬の差を用いて推定される。このリグレット信号を最適化することで、環境設計器は、環境を達成可能に保ちながら、エージェントの能力の限界にある環境を標的とすることを学習する。広範な実験を通じて、成功に不可欠ないくつかの構成要素を見いだした:大規模な事前学習コーパスからサンプリングした文書に環境設計器を基づかせること、および蓄積された環境記憶を与えることである。30Bパラメータモデルにスケールすると、SPADEは、評価用に確保された8つの数学・科学・コード・推論ベンチマーク全体で最強の固定環境ベースラインを平均+5.3上回り、ツール使用設定ではBFCL-v4マルチターンで+5.7、ACEBench-Agentで+13.9向上させる。ゲーム設定では、最強ベースラインに対する差はモデルスケールとともに拡大する。環境設計自体を学習可能な構成要素とすることで、SPADEはオープンエンドな自己改善への具体的な一歩を踏み出す。
English
Continuous self-improvement requires an ever-expanding pool of self-generated, diverse, adaptive goals. For language agents, existing training environment pools (hand-curated, statically synthesized, or frozen-verifier) keep the goal distribution fixed as the learner scales. We introduce SPADE (Self-Play in Adaptive Synthetic Executable Environments), a self-play RL framework in which a single LLM plays two roles: an Environment Designer that writes complete, long-horizon training environments as executable code with an OpenAI Gym-style reset()/step() interface, and a Reasoning Agent that learns to act in them. Each is a stateful, multi-turn environment (state transitions, reward functions, and verification code), so one interface spans reasoning problems and multi-step agentic tool use. The Reasoning Agent's regret is estimated using the gap between its reward with and without privileged hints; in optimizing this regret signal the Environment Designer learns to target environments at the edge of the agent's capabilities while keeping them feasible. Through extensive experimentation, we find several components critical to success: grounding the Environment Designer on documents sampled from a large pretraining corpus, and giving it an accumulated environment memory. Scaling to 30B-parameter models, SPADE improves over the strongest fixed-environment baseline by +5.3 on average across eight held-out math, science, code, and reasoning benchmarks, and lifts the tool-use setting by +5.7 on BFCL-v4 multi-turn and +13.9 on ACEBench-Agent; on the games setting, the margin over the strongest baseline grows with model scale. By making environment design itself a learnable component, SPADE takes a concrete step toward open-ended self-improvement.