ChatPaper.aiChatPaper

R^3-SQL: Ranqueamento, Recompensa e Reamostragem para Text-to-SQL

R^3-SQL: Ranking Reward and Resampling for Text-to-SQL

April 28, 2026
Autores: Hojae Han, Yeonseok Jeong, Seung-won Hwang, Zhewei Yao, Yuxiong He
cs.AI

Resumo

Sistemas modernos de Texto-para-SQL geram múltiplas consultas SQL candidatas e as classificam para determinar uma previsão final. No entanto, os métodos existentes enfrentam duas limitações. Primeiro, frequentemente pontuam consultas SQL funcionalmente equivalentes de forma inconsistente, apesar dos resultados de execução idênticos. Segundo, a classificação não consegue se recuperar quando a consulta SQL correta está ausente do conjunto de candidatos. Propomos o R³-SQL, uma estrutura de Texto-para-SQL que aborda ambos os problemas por meio de uma recompensa unificada para classificação e reamostragem. O R³-SQL primeiro agrupa os candidatos pelo resultado da execução e classifica os grupos para consistência. Para pontuar cada grupo, combina uma preferência pareada entre grupos com uma utilidade pontual derivada da classificação e do tamanho do melhor grupo, capturando preferência relativa, consistência e qualidade dos candidatos. Para melhorar a recuperação de candidatos, o R³-SQL introduz a reamostragem agentiva, que avalia o conjunto de candidatos gerado e reamostra seletivamente quando a consulta SQL correta provavelmente está ausente. O R³-SQL alcança 75,03% de precisão de execução no BIRD-dev, um novo estado da arte entre métodos que utilizam modelos com tamanhos divulgados, com ganhos consistentes em cinco benchmarks.
English
Modern Text-to-SQL systems generate multiple candidate SQL queries and rank them to judge a final prediction. However, existing methods face two limitations. First, they often score functionally equivalent SQL queries inconsistently despite identical execution results. Second, ranking cannot recover when the correct SQL is absent from the candidate pool. We propose R^3-SQL, a Text-to-SQL framework that addresses both issues through unified reward for ranking and resampling. R^3-SQL first groups candidates by execution result and ranks groups for consistency. To score each group, it combines a pairwise preference across groups with a pointwise utility from the best group rank and size, capturing relative preference, consistency, and candidate quality. To improve candidate recall, R^3-SQL introduces agentic resampling, which judges the generated candidate pool and selectively resamples when the correct SQL is likely absent. R^3-SQL achieves 75.03 execution accuracy on BIRD-dev, a new state of the art among methods using models with disclosed sizes, with consistent gains across five benchmarks.