ChatPaper.aiChatPaper

EnvACE: 세계 리허설을 통한 환경 역학 내면화 기반 에이전트 강화학습 보상 함수는 강화학습 에이전트의 행동을 안내하는 핵심 요소이나, 보상 과적합은 에이전트가 의도된 목표를 달성하는 대신 보상 신호를 조작하는 행동을 학습하게 만든다. 이러한 문제를 완화하기 위해 보상 형성과 모델 기반 강화학습이 제안되어 왔다. 보상 형성은 조밀한 보상을 제공하여 탐색을 촉진하지만, 정교한 인간의 사전 지식에 의존하므로 확장성이 제한된다. 모델 기반 강화학습은 세계 모델을 학습하여 의사결정을 지원하지만, 정책 학습 중에 발생하는 환경 역학의 예측 오차는 계획 기반 방법의 성능을 저하시킬 수 있다. 본 논문에서는 심층 잠재 역학 모델의 예측 오차를 내재화하여 강화학습 에이전트의 보상 형성을 향상시키는 새로운 접근법인 EnvACE(Environment ACE)를 제안한다. 구체적으로, EnvACE는 보상 함수를 환경 상태 전이와 정책 행동의 함수로 재구성하여 세계 모델의 예측 오차를 직접 활용함으로써, 에이전트가 역학 불일치를 인식하고 이에 적응하도록 돕는다. 이러한 메커니즘을 통해 EnvACE는 정책 학습 중에 환경 역학의 오차를 동적으로 내면화하며, 상상 기반 궤적을 통한 세계 리허설 과정을 통해 에이전트의 잠재적 행동 결과에 대한 이해를 향상시킨다. 또한 EnvACE는 보조 목적 함수를 통합하여 정책 학습과 세계 모델 학습 간의 정렬을 강화함으로써, 에이전트가 세계 리허설 과정에서 획득한 환경 역학에 대한 지식을 의사결정에 효과적으로 활용할 수 있게 한다. 다양한 벤치마크 실험을 통해 EnvACE가 기존 방법들보다 우수한 성능을 보이며, 표본 효율성과 일반화 측면에서도 상당한 개선을 달성함을 입증한다.

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

August 6, 2026
저자: Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang Huang, Yan Xu, Yasheng Wang, Weinan Zhang, Xingshan Zeng, Weiwen Liu
cs.AI

초록

대규모 언어 모델 에이전트를 장기적 도구 사용 작업에 훈련하는 것은 일반적으로 구축과 검증에 비용이 많이 드는 실제 또는 합성된 실행 가능 환경과의 상호작용, 또는 실세계에 접지하기 어려운 외부 시뮬레이터에 의존한다. 우리는 훈련 중 외부 환경과의 상호작용을 세계 리허설(world rehearsal)로 대체하는 에이전트형 강화 학습 방법인 EnvACE를 제안한다. 정책은 행동과 리허설을 번갈아 수행한다. 먼저 도구 호출을 생성한 다음 환경의 역할을 수행하여 해당 행동이 유발하는 응답을 생성하고, 리허설된 응답을 조건으로 후속 결정을 내린다. 두 역할은 모두 작업 성공 보상을 사용하여 종단 간에 공동으로 최적화된다. 세계 리허설을 통해 정책은 행동과 그에 대한 환경 응답의 관계를 파라미터에 내재화하여 의사 결정을 직접 지원하는 에이전트 세계 모델을 산출한다. BFCL-v4, tau^2-Bench, VitaBench, FinMCP-Bench 전반에 걸쳐 EnvACE는 강력하고 전이 가능한 성능을 달성하며, 전체 평가에서 환경 확장 기준선들을 능가한다. 통제 연구는 또한 세계 리허설이 모델 규모와 관계없이 정책 학습을 일관되게 향상시킴을 보여준다. 테스트 시점에는 내재화된 세계 모델이 실행 확정 전 내부 리허설을 가능하게 하여, 추가적인 외부 상호작용 없이도 적당한 리허설 예산 하에서 추가적인 성능 향상을 가져온다. 우리의 연구 결과는 세계 리허설이 외부 환경의 제약을 넘어 LLM 에이전트 훈련을 확장할 수 있는 새로운 경로를 확립함을 보여준다. 코드는 https://github.com/Within-yao/EnvACE에서 공개적으로 이용 가능하다.
English
Training large language model agents for long-horizon tool use typically relies on interactions with real or synthesized executable environments, whose construction and verification are costly, or on external simulators that are difficult to ground. We introduce EnvACE, an agentic reinforcement learning method that replaces external environment interaction during training with world rehearsal. The policy alternates between acting and rehearsal: it first generates a tool call, then plays the role of the environment to produce the response induced by that action, and conditions subsequent decisions on the rehearsed response. Both roles are jointly optimized end-to-end using task-success rewards. Through world rehearsal, the policy internalizes the relationship between actions and their environment responses in its parameters, yielding an agent world model that directly supports decision making. Across BFCL-v4, tau^2-Bench, VitaBench, and FinMCP-Bench, EnvACE achieves strong and transferable performance, outperforming environment-scaling baselines in the overall evaluation. Controlled studies further show that world rehearsal consistently improves policy learning across model scales. At test time, the internalized world model enables private rehearsal before committed execution, yielding further gains under a moderate rehearsal budget without additional external interaction. Our findings establish world rehearsal as a new path toward scaling LLM agent training beyond the constraints of external environments. Our code is publicly available at https://github.com/Within-yao/EnvACE.