DAR : Raisonnement déontique avec des harnais agentifs
DAR: Deontic Reasoning with Agentic Harnesses
June 3, 2026
Auteurs: Guangyao Dou, William Jurayj, Nils Holzenberger, Benjamin Van Durme
cs.AI
Résumé
Le raisonnement déontique consiste à répondre à des questions en appliquant des règles et politiques explicites à des faits propres à chaque cas, par exemple en calculant une obligation fiscale en vertu d'un texte de loi ou en déterminant l'issue d'un recours en matière d'immigration. Un défi technique majeur pour le raisonnement déontique basé sur les LLM est que l'ensemble des règles pertinentes peut être long et faire l'objet de renvois croisés, de sorte que les modèles peuvent encore échouer à localiser les règles nécessaires à une étape de raisonnement particulière. Nous introduisons le raisonnement déontique agentique (DAR), une configuration de raisonnement agentique dans laquelle le modèle interagit avec les textes de loi à la demande. Nous évaluons le DAR sous plusieurs harnais sur des sous-ensembles difficiles de DeonticBench. Dans ces configurations, nous constatons que les harnais agentiques peuvent repousser les limites des tâches de raisonnement déontique, mais les améliorations ne sont pas uniformes : les modèles plus faibles se dégradent souvent sur les tâches numériques tout en consommant beaucoup plus de jetons.
English
Deontic reasoning is the task of answering questions by applying explicit rules and policies to case-specific facts, for example computing tax liability under a statute or determining the outcome of an immigration appeal. A key technical challenge for LLM-based deontic reasoning is that the relevant ruleset can be long and cross-referenced, so models may still fail to locate the rules needed for a particular reasoning step. We introduce Deontic Agentic Reasoning (DAR), an agentic reasoning setup in which the model interacts with the statutes on demand. We evaluate DAR under multiple harnesses on hard subsets of DeonticBench. Across these settings, we find that agentic harnesses can push the frontier on deontic reasoning tasks, but improvements are not uniform: weaker models often degrade on numerical tasks while consuming far more tokens.