ChatPaper.aiChatPaper

QVal: Avaliando Economicamente Sinais de Supervisão Densa para Agentes LLM de Longo Horizonte

QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents

June 30, 2026
Autores: Sergio Hernández-Gutiérrez, Matteo Merler, Ilze Amanda Auzina, Joschka Strüber, Ameya Prabhu, Matthias Bethge
cs.AI

Resumo

Os agentes de LLM atuam cada vez mais em horizontes longos, onde uma única trajetória pode conter centenas ou milhares de ações. Nesses cenários, recompensas apenas de resultado fornecem orientação muito esparsa, não informando o modelo sobre a qualidade das ações intermediárias. Métodos de supervisão densa visam resolver esse problema pontuando as etapas intermediárias, desde confiança intrínseca até autodestilação e similaridades de embeddings. No entanto, é prática comum avaliá-los medindo o desempenho downstream de um pipeline de treinamento que os integra. Isso é caro, confunde a qualidade da supervisão com fatores de confusão de engenharia de treinamento e torna diferentes famílias metodológicas, que exigem configurações de treinamento distintas, incomparáveis. Como resultado, métodos de supervisão densa raramente são avaliados comparativamente em um terreno comum. Apresentamos o QVal, um ambiente de teste livre de treinamento para avaliar diretamente sinais de supervisão densa. Dado um par estado-ação, o QVal mede o quão bem a pontuação de um método está alinhada com Q: se ordena as ações de acordo com os valores Q de uma política de referência forte. Isso permite comparar sinais antes de qualquer execução de treinamento e separar a qualidade do sinal de outras escolhas de engenharia. Implementamos o QVal como QVal-v1.0, avaliando comparativamente 21 métodos de supervisão densa em quatro ambientes diversos e sete famílias metodológicas, com mais de 1.2 mil experimentos de avaliação em seis backbones de modelo de pesos abertos. Constatamos que linhas de base simples de prompting superam consistentemente métodos recentes de supervisão densa da literatura, e que o desempenho se agrupa fortemente por família. Essas descobertas se mantêm em todos os tamanhos de modelo, ambientes e modalidades de observação. O QVal foi projetado para ser facilmente extensível a novos ambientes e métodos, permitindo que pesquisadores iterem sobre métodos de supervisão densa antes de qualquer execução de treinamento.
English
LLM agents increasingly act over long horizons, where a single trajectory can contain hundreds or thousands of actions. In these settings, outcome-only rewards provide too sparse guidance, failing to inform the model about the goodness of intermediate actions. Dense supervision methods aim to solve this problem by scoring intermediate steps, from intrinsic confidence to self-distillation and embedding similarities. However, it is common practice to evaluate them by measuring the downstream performance of a training pipeline that integrates them. This is expensive, conflates supervision quality with training engineering confounders, and renders different methodological families requiring distinct training setups incomparable. As a result, dense supervision methods are rarely benchmarked on common ground. We introduce QVal, a training-free testbed for directly evaluating dense supervision signals. Given a state-action pair, QVal measures how well a method's score is Q-aligned: whether it orders actions according to the Q-values of a strong reference-policy. This lets us compare signals before any training run and separate signal quality from other engineering choices. We instantiate QVal as QVal-v1.0, benchmarking 21 dense supervision methods across four diverse environments and seven methodological families, with over 1.2K evaluation experiments across six open-weight model backbones. We find that simple prompting baselines consistently outperform recent dense supervision methods from the literature, and that performance clusters strongly by family. These findings hold across model sizes, environments, and observation modalities. QVal is designed to be easily extensible to new environments and methods, enabling researchers to iterate on dense supervision methods before any training run.