ChatPaper.aiChatPaper

Voorbij de modus reiken: Reinforcement Learning voor distributioneel redeneren in taalmodel

Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models

March 25, 2026
Auteurs: Isha Puri, Mehul Damani, Idan Shenfeld, Marzyeh Ghassemi, Jacob Andreas, Yoon Kim
cs.AI

Samenvatting

Bij een gegeven vraag codeert een taalmodel (TM) impliciet een verdeling over mogelijke antwoorden. In de praktijk zorgen natreiningsprocedures voor TM's er vaak voor dat deze verdeling instort tot een enkele dominante modus. Hoewel dit over het algemeen geen probleem is voor benchmarkachtige evaluaties die uitgaan van één correct antwoord, houden veel taken in de praktijk inherent meerdere geldige antwoorden of onherleidbare onzekerheid in. Voorbeelden hiervan zijn medische diagnose, het beantwoorden van dubbelzinnige vragen en situaties met onvolledige informatie. In dergelijke gevallen willen we dat TM's meerdere plausibele hypotheses genereren, bij voorkeur met betrouwbaarheidsschattingen voor elk, en zonder computationeel intensieve herhaalde steekproeftrekking om niet-modale antwoorden te produceren. Dit artikel beschrijft een multi-antwoord reinforcement learning-benadering voor het trainen van TM's om distributioneel redeneren over meerdere antwoorden uit te voeren tijdens de inferentie. We passen het RL-doel aan om modellen in staat te stellen expliciet meerdere kandidaat-antwoorden te genereren in een enkele voorwaartse pass, waarbij aspecten van inferentie-tijd zoekopdrachten worden geïnternaliseerd in het generatieve proces van het model. Over vraag-antwoord-, medisch diagnostische- en programmeerbenchmarks heen observeren we verbeterde diversiteit, dekking en set-level kalibratiescores in vergelijking met baselines die zijn getraind op enkelvoudige antwoorden. Modellen die met onze aanpak zijn getraind, hebben minder tokens nodig om meerdere antwoorden te genereren dan concurrerende benaderingen. Bij programmeertaken zijn ze ook aanzienlijk nauwkeuriger. Deze resultaten positioneren multi-antwoord RL als een principiële en rekenzuinige alternatief voor inferentie-tijd schaalprocedures, zoals best-of-k. Code en meer informatie zijn te vinden op https://multi-answer-rl.github.io/.
English
Given a question, a language model (LM) implicitly encodes a distribution over possible answers. In practice, post-training procedures for LMs often collapse this distribution onto a single dominant mode. While this is generally not a problem for benchmark-style evaluations that assume one correct answer, many real-world tasks inherently involve multiple valid answers or irreducible uncertainty. Examples include medical diagnosis, ambiguous question answering, and settings with incomplete information. In these cases, we would like LMs to generate multiple plausible hypotheses, ideally with confidence estimates for each one, and without computationally intensive repeated sampling to generate non-modal answers. This paper describes a multi-answer reinforcement learning approach for training LMs to perform distributional reasoning over multiple answers during inference. We modify the RL objective to enable models to explicitly generate multiple candidate answers in a single forward pass, internalizing aspects of inference-time search into the model's generative process. Across question-answering, medical diagnostic, and coding benchmarks, we observe improved diversity, coverage, and set-level calibration scores compared to single answer trained baselines. Models trained with our approach require fewer tokens to generate multiple answers than competing approaches. On coding tasks, they are also substantially more accurate. These results position multi-answer RL as a principled and compute-efficient alternative to inference-time scaling procedures such as best-of-k. Code and more information can be found at https://multi-answer-rl.github.io/.