ChatPaper.aiChatPaper

Prédiction des décisions d'agents IA à partir d'une interaction limitée via une modélisation texte-tabulaire

Predicting Decisions of AI Agents from Limited Interaction through Text-Tabular Modeling

May 12, 2026
Auteurs: Eilam Shapira, Moshe Tennenholtz, Roi Reichart
cs.AI

Résumé

Des agents d’IA négocient et effectuent des transactions en langage naturel avec des interlocuteurs inconnus : un robot acheteur face à un vendeur inconnu, ou un assistant d’approvisionnement négociant avec un fournisseur. Dans ce type d’interactions, le LLM, les invites, la logique de contrôle et les solutions de repli fondées sur des règles de l’interlocuteur sont masqués, tandis que chaque décision peut avoir des conséquences monétaires. Nous nous demandons si un agent peut prédire la prochaine décision d’un interlocuteur inconnu après seulement quelques interactions. Afin d’éviter les facteurs de confusion liés à la journalisation dans le monde réel, nous étudions ce problème dans des jeux de négociation et de marchandage contrôlés, en le formulant comme une prédiction text-tabulaire adaptative à la cible : chaque point de décision est une ligne d’un tableau combinant l’état structuré du jeu, l’historique des offres et le dialogue, tandis que les K parties précédentes du même agent cible (l’interlocuteur modélisé) sont fournies dans l’invite comme exemples d’adaptation étiquetés. Notre modèle repose sur un modèle de base tabulaire qui représente les lignes à l’aide de caractéristiques de l’état du jeu et de représentations textuelles issues d’un LLM, et ajoute le LLM en tant qu’Observateur comme représentation supplémentaire : un petit LLM figé lit l’état et le dialogue au moment de la décision ; sa réponse est écartée, et son état caché devient une caractéristique orientée décision, faisant du LLM un encodeur plutôt qu’un prédicteur direct en quelques exemples. Entraîné sur 13 agents LLM de pointe et testé sur 91 agents avec échafaudage non vus, le modèle complet surpasse les approches de référence que sont l’invite directe du LLM en tant que Prédicteur et les caractéristiques combinant texte et jeu. Au sein de ce modèle tabulaire, les caractéristiques de l’Observateur apportent une contribution supplémentaire par rapport aux autres schémas de caractéristiques : à K=16, elles améliorent l’AUC de prédiction des réponses d’environ 4 points dans les deux tâches et réduisent l’erreur de prédiction des offres de marchandage de 14 %. Ces résultats montrent que formuler la prédiction de l’interlocuteur comme une tâche text-tabulaire adaptative à la cible permet une adaptation efficace, et que les représentations cachées des LLM exposent des signaux pertinents pour la décision que l’invite directe ne fait pas émerger.
English
AI agents negotiate and transact in natural language with unfamiliar counterparts: a buyer bot facing an unknown seller, or a procurement assistant negotiating with a supplier. In such interactions, the counterpart's LLM, prompts, control logic, and rule-based fallbacks are hidden, while each decision can have monetary consequences. We ask whether an agent can predict an unfamiliar counterpart's next decision from a few interactions. To avoid real-world logging confounds, we study this problem in controlled bargaining and negotiation games, formulating it as target-adaptive text-tabular prediction: each decision point is a table row combining structured game state, offer history, and dialogue, while K previous games of the same target agent, i.e., the counterpart being modeled, are provided in the prompt as labeled adaptation examples. Our model is built on a tabular foundation model that represents rows using game-state features and LLM-based text representations, and adds LLM-as-Observer as an additional representation: a small frozen LLM reads the decision-time state and dialogue; its answer is discarded, and its hidden state becomes a decision-oriented feature, making the LLM an encoder rather than a direct few-shot predictor. Training on 13 frontier-LLM agents and testing on 91 held-out scaffolded agents, the full model outperforms direct LLM-as-Predictor prompting and game+text features baselines. Within this tabular model, Observer features contribute beyond the other feature schemes: at K=16, they improve response-prediction AUC by about 4 points across both tasks and reduce bargaining offer-prediction error by 14%. These results show that formulating counterpart prediction as a target-adaptive text-tabular task enables effective adaptation, and that hidden LLM representations expose decision-relevant signals that direct prompting does not surface.