CalibForge:学習可能な終端タスクのスケーリングのための敵対的ソルバー校正
CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks
August 6, 2026
著者: Fanzhe Meng, Guoxin Chen, Jiale Zhao, Shuang Sun, Zhiyu Lin, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia
cs.AI
要旨
ターミナルエージェントの訓練には、実行可能かつ検証可能であり、単に解けるだけでなく、学習にとって適切な難易度を持つタスクが必要である。実行による検証は実現可能性を確立するが、与えられたソルバー設定に対してタスクがどのように振る舞うかを明らかにしない。本論文では、検証済みソルバーの挙動を利用し、敵対的ソルバーキャリブレーションを通じて候補タスクを改訂する、自律的なターミナルタスク合成システムCalibForgeを提案する。マルチソルバーキャリブレーションは異種ソルバープール内の不一致を対象とし、対照的ソルバーキャリブレーションは指定されたstrong-pass/weak-fail関係を対象とする。両者は、実証された解決可能性に基づくソルバー相対の学習可能領域を操作化するものである。CalibForgeを用いて、5,431件のキャリブレーション済みターミナルタスクを構築した。アブレーション実験により、両戦略はいずれも、タスクの作成と検証のみ、または通常の単一ソルバーフィードバックよりも効果的な教師信号をもたらすことが示された。全タスク集合で訓練したモデルは、Terminal-Bench 2.0において32.58%および47.57%を達成した。対応するベースモデルに対する最大の改善は、Terminal-Bench 2.0で24.71パーセントポイント、SWE-bench Proで27.68ポイント、Doc2Repoで30.04ポイントに達した。これらの結果は総合的に、ソルバー相対の学習可能性が、効果的かつ転移可能なエージェント訓練データを構築するための実用的な目標であることを支持する。
English
Training terminal agents requires executable and verifiable tasks that are not merely solvable, but appropriately challenging for learning. Executable validation establishes feasibility, yet does not reveal how a task behaves relative to a given solver setting. In this paper, we present CalibForge, an autonomous terminal-task synthesis system that uses verified solver behavior to revise candidate tasks through adversarial solver calibration. Multi-solver calibration targets disagreement within a heterogeneous solver pool, whereas contrastive solver calibration targets a designated strong-pass/weak-fail relation; both operationalize a solver-relative learnable zone anchored in demonstrated solvability. Using CalibForge, we construct 5,431 calibrated terminal tasks. Our ablations show that both strategies yield more effective supervision than authoring and validation alone or ordinary single-solver feedback. Models trained on the full collection achieve 32.58% and 47.57% on Terminal-Bench 2.0. The largest improvements over the corresponding base model reach 24.71 percentage points on Terminal-Bench 2.0, 27.68 points on SWE-bench Pro, and 30.04 points on Doc2Repo. Together, these results support solver-relative learnability as a practical target for constructing effective and transferable agent training data.