ChatPaper.aiChatPaper

Domestiquer l'asymétrie acteur-observateur chez les agents par l'alignement dialectique

Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment

April 21, 2026
Auteurs: Bobo Li, Rui Wu, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu
cs.AI

Résumé

Les agents de modèles de langage ont rapidement évolué, passant de générateurs de texte statiques à des systèmes dynamiques capables d'exécuter des flux de travail autonomes complexes. Pour améliorer leur fiabilité, les architectures multi-agents attribuant des rôles spécialisés sont de plus en plus adoptées afin de permettre l'auto-réflexion et l'audit mutuel. Bien que ce jeu de rôles exploite efficacement les connaissances d'experts du domaine, nous constatons qu'il induit simultanément un biais cognitif semblable à celui des humains, connu sous le nom d'asymétrie acteur-observateur (AOA). Plus précisément, un agent agissant en tant qu'acteur (pendant l'auto-réflexion) a tendance à attribuer les échecs à des facteurs externes, tandis qu'un observateur (pendant l'audit mutuel) attribue les mêmes erreurs à des défauts internes. Nous quantifions ce phénomène à l'aide de notre nouveau benchmark d'échecs ambigus, qui révèle que le simple fait d'échanger les perspectives déclenche l'effet AOA dans plus de 20 % des cas pour la plupart des modèles. Pour maîtriser ce biais, nous présentons ReTAS (Raisonnement par Thèse-Antithèse-Synthèse), un modèle entraîné par alignement dialectique pour imposer un raisonnement invariant à la perspective. En intégrant une chaîne de pensée dialectique à l'optimisation de politique relative au groupe, ReTAS guide les agents à synthétiser des points de vue conflictuels en un consensus objectif. Les expériences démontrent que ReTAS atténue efficacement l'incohérence attributionnelle et améliore significativement les taux de résolution des défauts dans des scénarios ambigus.
English
Large Language Model agents have rapidly evolved from static text generators into dynamic systems capable of executing complex autonomous workflows. To enhance reliability, multi-agent frameworks assigning specialized roles are increasingly adopted to enable self-reflection and mutual auditing. While such role-playing effectively leverages domain expert knowledge, we find it simultaneously induces a human-like cognitive bias known as Actor-Observer Asymmetry (AOA). Specifically, an agent acting as an actor (during self-reflection) tends to attribute failures to external factors, whereas an observer (during mutual auditing) attributes the same errors to internal faults. We quantify this using our new Ambiguous Failure Benchmark, which reveals that simply swapping perspectives triggers the AOA effect in over 20% of cases for most models. To tame this bias, we introduce ReTAS (Reasoning via Thesis-Antithesis-Synthesis), a model trained through dialectical alignment to enforce perspective-invariant reasoning. By integrating dialectical chain-of-thought with Group Relative Policy Optimization, ReTAS guides agents to synthesize conflicting viewpoints into an objective consensus. Experiments demonstrate that ReTAS effectively mitigates attribution inconsistency and significantly improves fault resolution rates in ambiguous scenarios.