エージェントをハーネスと共に進化させる訓練:TaoLiveデジタルアバターエージェント技術レポート
Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
August 22, 2026
著者: TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen
cs.AI
要旨
AI搭載デジタルアバターストリーマーは、商品に関する質問に回答し、視聴者と交流し、マーケティング戦略をリアルタイムで実行する必要があり、低遅延、頻繁な戦略更新、正確かつ効果的な応答が求められる。スキル、フック、プロンプト、ツールをモデルの重みとは独立に更新できる進化可能なハーネスは、迅速な反復を可能にするが、トレードオフを生じさせる。すなわち、大規模モデルはゼロショットで適応できるものの遅すぎ、小型モデルは遅延目標を満たすものの固定されたハーネス構成に過適合する。本稿では、変化するハーネスに適応するよう小型モデルを訓練するハーネス認識トレーニング(HAT)を提案する。その主要な構成要素であるハーネス状態拡張(HSA)は、スキル識別子とその内容、ツールスキーマ、プロンプト構造、フック関数に対してタスクを維持する変換を適用する。学習は3段階で進む。HSA-SFTは多様な環境における強力なモデルの軌跡から推論とツール使用を学習し、汎用オンポリシー蒸留はSFT中に失われた汎化を回復し、HSA-RLは拡張環境での強化学習を通じて変化するハーネスに対するロバスト性を向上させる。4つの評価セットにおいて、HATはライブストリームQAで94.8(ベース:80.3、最強の汎用LLM:93.0)、ハーネス変種QAで94.6(ベース:75.4)を達成した。固定ハーネスSFTがベースモデルからIFEvalを7.7ポイント低下させるのとは異なり、HATはこの性能低下を回避して83.5に到達する。1基のNVIDIA H20 GPU上で、最適化されたシステムはP50およびP95レイテンシとして3.4秒および8.1秒を達成する。また、タオバオライブのデジタルアバターサービスに展開され、GMVおよび商品ページ閲覧数においても良好なオンラインA/Bテスト結果をもたらしている。
English
AI-powered digital avatar streamers must answer product questions, engage viewers, and execute marketing strategies in real time, demanding low latency, frequent strategy updates, and accurate yet effective responses. Evolvable Harnesses, whose Skills, Hooks, prompts, and tools can be updated independently of model weights, enable rapid iteration but expose a trade-off: large models adapt zero-shot yet are too slow, whereas compact models meet latency targets but overfit to fixed Harness configurations. We propose Harness-Aware Training (HAT), which trains compact models to adapt to changing Harnesses. Its key component, Harness-State Augmentation (HSA), applies task-preserving transformations to Skill identifiers and content, tool schemas, prompt structures, and Hook functions. Training proceeds in three stages: HSA-SFT learns reasoning and tool use from strong-model trajectories across diverse environments; General On-Policy Distillation restores generalization lost during SFT; and HSA-RL improves robustness to changing Harnesses through reinforcement learning in augmented environments. Across four evaluation sets, HAT achieves 94.8 on Live-Stream QA (base: 80.3; strongest general LLM: 93.0) and 94.6 on Harness-Variant QA (base: 75.4). Unlike Fixed-Harness SFT, which lowers IFEval by 7.7 points from the base model, HAT avoids this regression and reaches 83.5. On one NVIDIA H20 GPU, the optimized system delivers P50 and P95 latencies of 3.4 s and 8.1 s. Deployed in Taobao Live's digital-avatar service, it also yields positive online A/B test results for GMV and item-page views.