ChatPaper.aiChatPaper

LegalHalluLens: Auditoria Tipificada de Alucinações e Debate Multiagente Calibrado para IA Jurídica Confiável

LegalHalluLens: Typed Hallucination Auditing and Calibrated Multi-Agent Debate for Trustworthy Legal AI

June 16, 2026
Autores: Lalit Yadav, Akshaj Gurugubelli
cs.AI

Resumo

Sistemas de IA implantados em fluxos de trabalho jurídicos alucinam a taxas que métricas agregadas relatam em aproximadamente 52%, mas essa média oculta onde os erros se concentram e em que direção ocorrem, deixando os oficiais de conformidade sem um sinal acionável para uma implantação confiável. Apresentamos o LegalHalluLens, uma estrutura de auditoria com três componentes: perfis de alucinação tipificados em quatro categorias de reivindicações com motivação jurídica (numérica, temporal, obrigação/direito, factual) sobre o CUAD (Hendrycks et al., 2021); um Índice de Direção de Risco (IDR) que reduz o viés de omissão versus invenção a um escalar comparável entre implantações; e um pipeline de debate tipificado calibrado tanto para magnitudes quanto para direções. Em 510 contratos e 249.252 instâncias em nível de cláusula, medimos uma lacuna intra-modelo de aproximadamente 38 a 40 pontos percentuais entre reivindicações de obrigação/numéricas e temporais que o relato agregado oculta, e mostramos que dois sistemas com taxas combinadas de 52% podem carregar IDRs opostos. O pipeline de debate reduz detecções fabricadas em 45%, com ganhos por categoria que acompanham o diagnóstico, equiparando-se a APIs comerciais com um backbone substancialmente menor (4 bilhões de parâmetros ativos). Perfis tipificados e o IDR revelam modos de falha que métricas agregadas ocultam; adicionalmente, mostramos que esses diagnósticos servem como entradas de calibração para pipelines de debate multiagente, onde desafios do Cético e portas assimétricas direcionadas a modos de falha medidos superam o debate genericamente ajustado. A estrutura suporta aquisição ciente de direção, responsabilização e design de agentes para IA jurídica implantada no mundo real.
English
AI systems deployed in legal workflows hallucinate at rates that aggregate metrics report at ~52%, but this average conceals where errors concentrate and in which direction they run, leaving compliance officers without an actionable signal for trustworthy deployment. We present LegalHalluLens, an auditing framework with three components: typed hallucination profiles across four legally-motivated claim categories (numeric, temporal, obligation/entitlement, factual) over CUAD (Hendrycks et al., 2021); a Risk Direction Index (RDI) that reduces omission-versus-invention bias to a single deployment-comparable scalar; and a typed debate pipeline calibrated to both magnitudes and directions. Across 510 contracts and 249,252 clause-level instances we measure a within-model gap of approximately 38-40 pp between obligation/numeric and temporal claims that aggregate reporting hides, and show that two systems with matched 52% rates can carry opposite RDIs. The debate pipeline reduces fabricated detections by 45% with per-category gains tracking the diagnosis, matching commercial APIs with a substantially smaller backbone (4B active parameters). Typed profiles and RDI surface failure modes that aggregate metrics hide; we further show these diagnostics serve as calibration inputs for multi-agent debate pipelines, where Skeptic challenges and asymmetric gates targeted at measured failure modes outperform generically-tuned debate. The framework supports direction-aware procurement, accountability, and agent design for legal AI deployed in the wild.