Agent-BRACE: Het ontkoppelen van overtuigingen van acties in langetermijntaken via verbaliseerde toestandsonzekerheid
Agent-BRACE: Decoupling Beliefs from Actions in Long-Horizon Tasks via Verbalized State Uncertainty
May 12, 2026
Auteurs: Joykirat Singh, Zaid Khan, Archiki Prasad, Justin Chih-Yao Chen, Akshay Nambi, Hyunji Lee, Elias Stengel-Eskin, Mohit Bansal
cs.AI
Samenvatting
Grote taalmodellen (LLM's) worden steeds vaker ingezet voor langetermijntaken in gedeeltelijk waarneembare omgevingen, waar ze moeten handelen terwijl ze een complexe omgevingstoestand over vele stappen afleiden en volgen. Dit leidt tot twee uitdagingen: gedeeltelijke waarneembaarheid vereist het handhaven van onzekerheid over niet-waargenomen wereldkenmerken, en een lange interactiegeschiedenis zorgt ervoor dat de context onbegrensd groeit, waardoor taakrelevante informatie wordt verdund. Een principiële oplossing voor beide uitdagingen is een geloofstoestand: een posterieure verdeling over omgevingstoestanden gegeven eerdere waarnemingen en acties, die de geschiedenis compact codeert voor besluitvorming, ongeacht de epioedelengte. Bij LLM-agenten maakt het open karakter van tekst het echter onduidelijk hoe een dergelijke verdeling moet worden gerepresenteerd. Daarom introduceren we Agent-BRACE: Agent Belief State Representation via Abstraction and Confidence Estimation, een methode die een LLM-agent ontkoppelt in een geloofstoestandmodel en een beleidsmodel, die gezamenlijk worden geoptimaliseerd via reinforcement learning. Het geloofstoestandmodel produceert een gestructureerde benadering van de geloofsverdeling: een reeks atomaire natuurlijke taalclaims over de omgeving, elk geannoteerd met een ordinaal verbaal zekerheidslabel variërend van zeker tot onbekend. Het beleidsmodel baseert zich op deze compacte, gestructureerde benaderende geloofstoestand in plaats van de volledige geschiedenis, en leert acties te selecteren onder expliciete onzekerheid. In langetermijn-, gedeeltelijk waarneembare belichaamde taal omgevingen behaalt Agent-BRACE een gemiddelde absolute verbetering van +14,5% (Qwen2.5-3B-Instruct) en +5,3% (Qwen3-4B-Instruct), en presteert het beter dan sterke RL-baselines terwijl het een nagenoeg constant contextvenster handhaaft dat onafhankelijk is van de epioedelengte. Verdere analyse laat zien dat de geleerde geloofstoestand gedurende een epioede steeds beter gekalibreerd raakt naarmate bewijsmateriaal zich ophoopt.
English
Large language models (LLMs) are increasingly deployed on long-horizon tasks in partially observable environments, where they must act while inferring and tracking a complex environment state over many steps. This leads to two challenges: partial observability requires maintaining uncertainty over unobserved world attributes, and long interaction history causes context to grow without bound, diluting task-relevant information. A principled solution to both challenges is a belief state: a posterior distribution over environment states given past observations and actions, which compactly encodes history for decision making regardless of episode length. In LLM agents, however, the open-ended nature of text makes it unclear how to represent such a distribution. Therefore, we introduce Agent-BRACE: Agent Belief state Representation via Abstraction and Confidence Estimation, a method that decouples an LLM agent into a belief state model and a policy model, jointly optimized via reinforcement learning. The belief state model produces a structured approximation of the belief distribution: a set of atomic natural language claims about the environment, each annotated with an ordinal verbalized certainty label ranging from certain to unknown. The policy model conditions on this compact, structured approximate belief rather than the full history, learning to select actions under explicit uncertainty. Across long-horizon, partially observable embodied language environments, Agent-BRACE achieves an average absolute improvement of +14.5% (Qwen2.5-3B-Instruct) and +5.3% (Qwen3-4B-Instruct), outperforming strong RL baselines while maintaining a near-constant context window independent of episode length. Further analysis shows that the learned belief becomes increasingly calibrated over the course of an episode as evidence accumulates.