ChatPaper.aiChatPaper

Quando Pensar, Quando Falar: Aprendendo Políticas de Divulgação para o Raciocínio de LLMs

When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning

May 6, 2026
Autores: Jiaqi Wei, Xuehang Guo, Pengfei Yu, Xiang Zhang, Wanli Ouyang, Siqi Sun, Qingyun Wang, Chenyu You
cs.AI

Resumo

Em interfaces autoregressivas de fluxo único, os mesmos tokens atualizam o estado do modelo e constituem um compromisso público irreversível. Este acoplamento cria um imposto do silêncio: a deliberação adicional adia o primeiro conteúdo relevante para a tarefa, enquanto o *streaming* precoce e ingênuo arrisca compromissos prematuros que enviesam as gerações subsequentes. Introduzimos o Raciocínio Intercalado Lado a Lado (SxS), que torna o momento da divulgação uma decisão controlável dentro da geração autoregressiva padrão. O SxS intercala divulgações parciais com raciocínio privado contínuo no mesmo contexto, mas libera conteúdo apenas quando este é apoiado pelo raciocínio até então. Para aprender tal ritmo sem incentivar preenchimento, construímos trajetórias intercaladas alinhadas por entailment, correspondendo prefixos de resposta a prefixos de raciocínio de suporte, treinando depois com SFT para adquirir a semântica de ação dual e com RL para recuperar o desempenho do raciocínio no novo formato. Em duas arquiteturas/escalas Qwen3 (MoE Qwen3-30B-A3B, denso Qwen3-4B) e *benchmarks* tanto intra-domínio (AIME25) quanto extra-domínio (GPQA-Diamond), o SxS melhora os compromissos de Pareto precisão-latência de conteúdo sob proxies a nível de token, como o tempo de espera entre atualizações.
English
In single-stream autoregressive interfaces, the same tokens both update the model state and constitute an irreversible public commitment. This coupling creates a silence tax: additional deliberation postpones the first task-relevant content, while naive early streaming risks premature commitments that bias subsequent generations. We introduce Side-by-Side (SxS) Interleaved Reasoning, which makes disclosure timing a controllable decision within standard autoregressive generation. SxS interleaves partial disclosures with continued private reasoning in the same context, but releases content only when it is supported by the reasoning so far. To learn such pacing without incentivizing filler, we construct entailment-aligned interleaved trajectories by matching answer prefixes to supporting reasoning prefixes, then train with SFT to acquire the dual-action semantics and RL to recover reasoning performance under the new format. Across two Qwen3 architectures/scales (MoE Qwen3-30B-A3B, dense Qwen3-4B) and both in-domain (AIME25) and out-of-domain (GPQA-Diamond) benchmarks, SxS improves accuracy--content-latency Pareto trade-offs under token-level proxies such as inter-update waiting.