ChatPaper.aiChatPaper

AutoDesign:長期的エージェント型設計のためのメタハーネス最適化

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

August 13, 2026
著者: Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li
cs.AI

要旨

マルチモーダルな情報源を凝縮し構造化されたメディア出力へと変換するプロセスは、本質的には、モデルとハーネス(制御機構)を中心とした長期的視野に立つエージェント的プロセスとして捉えることができる。理想的なハーネスシステムは、人間の設計上の事前知識と整合し、経験的な探索を通じて再利用可能な経験を蓄積することで、再帰的な自己改善を推進するものであるべきだが、既存のパラダイムは静的であり、この能力には及ばない。本稿では、人間の設計上の事前知識と整合するフレームワークであるAutoDesignを提案する。このフレームワークでは、メタハーネス最適化器がコードエージェントを導き、ロールアウトフィードバックに基づいてハーネスを再帰的に改善する。このフレームワークを具体化し評価するため、我々は学術論文からポスターへの生成タスクに焦点を当て、5つの分野にわたる100本の論文からなるメイントラックと、制御評価用に共有される10本の論文からなるサブセットであるPosterBench-miniを含むPosterBenchを導入する。PosterBenchメイントラックにおいて、AutoDesignは最高スコア78.32を達成し、クローズドソースの商用システムであるClaude Designを7.45ポイント上回った。7つの制御されたコードエージェント・モデル構成全体において、学習済みのDesignHarnessを統合することで一貫して性能が向上し、平均PosterBenchスコアは54.99から67.39(+12.4%)に増加した。完全に自律的な長期的ループでは、3ドル未満のコストで40分以内に253回のツール呼び出しと11回の編集ターンを実行し、人間による評価において平均的な学会ポスター品質に達した。また、システムを盲検化した人間による評価では、AutoDesignが評価対象システムの中で最も高い人間の選好を達成したことが示された。
English
Transforming multimodal sources into condensed and structured media outputs can be fundamentally conceptualized as a long-horizon agentic process centered on a model-harness system. While an ideal harness system should align with human design priors and accumulate reusable experience through empirical exploration to drive recursive self-improvement, existing paradigms remain static and fall short of this capability. In this paper, we present AutoDesign, a framework that aligns with human design priors, where a meta-harness optimizer guides a code agent to recursively improve harness based on rollout feedback. To instantiate and evaluate this framework, we focus on the academic paper-to-poster generation task and introduce PosterBench, comprising a 100-paper Main Track spanning five disciplines and PosterBench-mini, a shared 10-paper subset for controlled evaluation. On the PosterBench Main Track, AutoDesign achieves the highest score of 78.32, surpassing the closed-source commercial system Claude Design by 7.45 points. Across seven controlled code-agent-model configurations, integrating the learned DesignHarness consistently improves performance, increasing the average PosterBench Score from 54.99 to 67.39 (+12.4%). In a fully autonomous long-horizon loop, it executes 253 tool calls and 11 editing turns within 40 minutes for under $3, reaching average conference-poster quality in human evaluation. A system-blind human study further demonstrates that AutoDesign achieves the highest human preference among evaluated systems.