ChatPaper.aiChatPaper

CAST: 信頼性の高い長期的ツール呼び出しエージェントを訓練するための批判認識型教師信号

CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents

August 31, 2026
著者: Amir Saeidi, Zehua Zhang, Rishitosh Singh, Naman Ahuja, Vivek Gupta, Ali Payani, Gaowen Liu, Jayanth Srinivasa, Chitta Baral
cs.AI

要旨

大規模言語モデル(LLM)エージェントは、長期的な視野を要し、対話的かつ状態を保持する環境での展開が急速に進んでいる。このような環境では、誤った購入品の返金処理といった単一の誤ったアクションが、取り返しのつかないタスク失敗を引き起こす可能性があり、実行前にそのようなアクションを検知しなければならない。この種の失敗は毎回の実行時に発生するとは限らないが、反復試行の中で顕在化し得るため、ステップ間および試行間での信頼性が極めて重要となる。しかしながら、エージェントの信頼性を確保することは困難を伴う。最先端のLLMでさえ、アクションが誤りである理由を説明することに苦慮しており、特にドメイン固有のポリシーに支配された、長く複雑に絡み合った軌跡においてその傾向が顕著である。近年の研究の多くはプロンプトベースの批評エージェントに依存している一方で、最適化ベースの手法には、トレーニングのための豊富な検証根拠を体系的に生成する手段が欠けている。本稿では、このギャップに対処するため、批評認識型トレーニングフレームワークであるCASTを提案する。CASTは、スパースなタスク結果をアクションレベルの教師信号に変換し、批評学習とポリシー最適化を可能にする。CASTはエージェントの軌跡を解析し、部分観測下でのアクションの妥当性を説明する構造化された根拠を合成する。得られた批評モデルは、ポリシーモデルを最適化するための批評認識型トレーニングデータの構築に活用される。動的なツール呼び出しベンチマークにおいてQwen3ファミリーモデルをファインチューニングした結果、CASTはドメイン横断的な信頼性を向上させ、RetailタスクではGPT-OSS-120Bをpass@4で10%以上上回り、ドメイン外設定であるTelehealthではさらに9%の改善をもたらした。これらの結果は、批評認識型トレーニングが現実的な動的環境におけるLLMエージェントのロバスト性を向上させることを示している。
English
Large language model (LLM) agents are increasingly deployed in long-horizon, interactive, and stateful environments. In these settings, a single wrong action, such as refunding the wrong purchase, can cause irreversible task failure and must be intercepted before execution. Such failures may not appear in every single run, but can emerge across repeated trials, making reliability across steps and trials critical. However, ensuring agentic reliability is challenging: even frontier LLMs struggle to explain why an action may be wrong, especially in long, intertwined trajectories governed by domain-specific policies. Much recent work relies on prompt-based critique agents, while optimization-based methods lack a systematic way to produce rich verification rationales for training. We address this gap with CAST, a critique-aware training framework that converts sparse task outcomes into action-level supervision for critique learning and policy optimization. CAST analyzes agent trajectories to synthesize structured rationales explaining action validity under partial observability. The resulting critique model is used to construct critique-aware training data for optimizing the policy model. Fine-tuning Qwen3-family models on dynamic tool-calling benchmarks, CAST improves reliability across domains, outperforming GPT-OSS-120B by over 10% pass^4 on Retail tasks and yielding an additional 9% improvement on Telehealth in an out-of-domain setting. These results demonstrate that critique-aware training improves the robustness of LLM agents in realistic dynamic environments.