ChatPaper.aiChatPaper

MAP : Un paradigme de cartographie puis d'action pour le raisonnement d'agent interactif à long horizon

MAP: A Map-then-Act Paradigm for Long-Horizon Interactive Agent Reasoning

May 13, 2026
Auteurs: Yuxin Liu, Ziang Ye, Yueqing Sun, Mingye Zhu, Jinwei Xiao, Zhuowen Han, Qi GU, Xunliang Cai, Lei Zhang
cs.AI

Résumé

Les agents LLM interactifs actuels reposent sur une planification pas à pas conditionnée par des objectifs, où la compréhension de l’environnement est acquise de manière réactive pendant l’exécution plutôt qu’établie au préalable. Cette inversion temporelle conduit à une Perception Environnementale Différée : les agents doivent inférer les contraintes environnementales par essais et erreurs, ce qui génère un Goulot d’Étranglement Épistémique les piégeant dans des cycles d’échec inefficaces. Inspiré par la perception des affordances humaines et la théorie des cartes cognitives, nous proposons le Paradigme Map-then-Act (MAP), un cadre plug-and-play qui déplace la compréhension de l’environnement avant l’exécution. MAP comporte trois étapes : (1) Exploration globale, acquisition de connaissances préalables générales sur l’environnement ; (2) Cartographie spécifique à la tâche, construction d’une carte cognitive structurée ; et (3) Exécution augmentée par la connaissance, résolution de tâches ancrées sur cette carte. Les expériences montrent des gains constants sur divers benchmarks et modèles de LLM. Sur ARC-AGI-3, MAP permet aux modèles de pointe de dépasser une performance quasi nulle de base dans 22 des 25 environnements de jeu. Nous introduisons également MAP-2K, un ensemble de données de trajectoires de type map-then-act, et montrons que l’entraînement sur cet ensemble surpasse les traces d’exécution d’experts, suggérant que comprendre les environnements est plus fondamental que les imiter.
English
Current interactive LLM agents rely on goal-conditioned stepwise planning, where environmental understanding is acquired reactively during execution rather than established beforehand. This temporal inversion leads to Delayed Environmental Perception: agents must infer environmental constraints through trial-and-error, resulting in an Epistemic Bottleneck that traps them in inefficient failure cycles. Inspired by human affordance perception and cognitive map theory, we propose the Map-then-Act Paradigm (MAP), a plug-and-play framework that shifts environment understanding before execution. MAP consists of three stages: (1) Global Exploration, acquiring environment-general priors; (2) Task-Specific Mapping, constructing a structured cognitive map; and (3) Knowledge-Augmented Execution, solving tasks grounded on the map. Experiments show consistent gains across benchmarks and LLMs. On ARC-AGI-3, MAP enables frontier models to surpass near-zero baseline performance in 22 of 25 game environments. We further introduce MAP-2K, a dataset of map-then-act trajectories, and show that training on it outperforms expert execution traces, suggesting that understanding environments is more fundamental than imitation.