AutoDesign:長時程智能體設計的後設框架優化
AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
August 13, 2026
作者: Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li
cs.AI
摘要
將多模態來源轉化為精簡且結構化的媒體輸出,從根本上可被概念化為一個以模型-框架系統為核心的長視野代理過程。理想的框架系統理應與人類設計先驗對齊,並透過經驗探索累積可重複使用的經驗,以驅動遞迴自我改進;然而,現有範式依然靜態,未能達成此能力。在本文中,我們提出AutoDesign——一個與人類設計先驗對齊的架構,其中元框架優化器引導程式碼代理根據展開回饋遞迴地改進框架。為實例化並評估此架構,我們聚焦於學術論文到海報生成任務,並引入PosterBench,其包含涵蓋五個學科的100篇論文主軌道(Main Track),以及用於受控評估的共享10篇論文子集PosterBench-mini。在PosterBench Main Track上,AutoDesign取得最高分78.32,以7.45分的優勢超越封閉原始碼商業系統Claude Design。在七種受控的程式碼代理-模型配置中,整合所學到的DesignHarness持續提升效能,將平均PosterBench分數從54.99提升至67.39(+12.4%)。在完全自主的長視野迴圈中,AutoDesign在40分鐘內以不到3美元的成本執行253次工具呼叫與11次編輯回合,於人工評估中達到平均會議海報品質。一項系統盲測人工研究進一步顯示,在受評系統中,AutoDesign獲得最高的人類偏好。
English
Transforming multimodal sources into condensed and structured media outputs can be fundamentally conceptualized as a long-horizon agentic process centered on a model-harness system. While an ideal harness system should align with human design priors and accumulate reusable experience through empirical exploration to drive recursive self-improvement, existing paradigms remain static and fall short of this capability. In this paper, we present AutoDesign, a framework that aligns with human design priors, where a meta-harness optimizer guides a code agent to recursively improve harness based on rollout feedback. To instantiate and evaluate this framework, we focus on the academic paper-to-poster generation task and introduce PosterBench, comprising a 100-paper Main Track spanning five disciplines and PosterBench-mini, a shared 10-paper subset for controlled evaluation. On the PosterBench Main Track, AutoDesign achieves the highest score of 78.32, surpassing the closed-source commercial system Claude Design by 7.45 points. Across seven controlled code-agent-model configurations, integrating the learned DesignHarness consistently improves performance, increasing the average PosterBench Score from 54.99 to 67.39 (+12.4%). In a fully autonomous long-horizon loop, it executes 253 tool calls and 11 editing turns within 40 minutes for under $3, reaching average conference-poster quality in human evaluation. A system-blind human study further demonstrates that AutoDesign achieves the highest human preference among evaluated systems.