소형 언어 모델을 심판으로 활용한 루브릭 기반 강화 학습
Small Language Models as Judges for Rubric-Based Reinforcement Learning
August 30, 2026
저자: Fengyu Xie, Yilun Zhao, Bingsen Chen, Arman Cohan, Chen Zhao
cs.AI
초록
루브릭 기반 강화학습은 정답이 명확한 과제나 규칙 기반 검증기로 처리되는 작업을 넘어, 개별 사례(인스턴스)별 기준에 따라 응답을 채점함으로써 RL의 적용 범위를 확장한다. 그러나 이는 보상 계산을 비용이 많이 들게 만든다. 학습 과정에서 반복적인 루브릭 판정이 필요하며, 이는 흔히 독점 API 또는 7B(70억) 개 이상의 파라미터를 가진 로컬 생성형 LLM 판정기에 의존하기 때문이다. 우리는 더 작은 언어 모델이 효율적이고 신뢰할 수 있는 루브릭 기반 판정기로 기능할 수 있는지 연구한다. 이 질문을 측정 가능하게 만들기 위해, 우리는 인스턴스별 기준과 항목별 충족 라벨을 갖춘 두 개의 점별(pointwise) 루브릭 기반 평가 데이터셋인 PointRubric과 RaR-Science-Static을 구축한다. 우리는 소형 모델에서 기준 수준의 판정을 추출하는 세 가지 방법, 즉 생성형 판정(Generative verdicts), 예/아니오 로그확률 마진(Yes/No Logprob margins), 프로브 판정기(Probe judges)를 비교한다. 두 데이터셋 모두에서 Qwen3-1.7B 프로브 판정기는 이 방법들 중 가장 높은 기준 수준 일치도를 달성하여 생성형 및 로그확률 판정기를 능가한다. GRPO 보상 모델로 사용될 때, 프로브 판정기는 RaR-Science 루브릭 점수에서 정책을 0.232에서 0.643으로 훈련시키며, 이는 8B 생성형 판정기 기준선의 0.594와 비교된다. 반면 기준선은 보상 판정에 10.7배 더 많은 시간이 소요된다. 과제 및 도메인 전이 실험은 또한 프로브 판정기가 다양한 설정에서 기준 수준의 보상 구조를 보존함을 시사한다.
English
Rubric-based reinforcement learning extends RL beyond tasks with exact answers or rule-based verifiers by scoring responses against instance-specific criteria. However, this makes reward computation expensive: training requires repeated rubric judging, often with proprietary APIs or local generative LLM judges with 7B parameters or more. We study whether smaller language models can serve as efficient and reliable rubric-based judges. To make this question measurable, we construct PointRubric and RaR-Science-Static, two pointwise rubric-based evaluation datasets with instance-specific criteria and itemwise satisfaction labels. We compare three ways of extracting criterion-level judgments from small models: Generative verdicts, Yes/No Logprob margins, and Probe judges. Across both datasets, the Qwen3-1.7B Probe judge achieves the strongest criterion-level agreement among these methods, outperforming Generative and Logprob judges. Used as a GRPO reward model, it trains a policy from 0.232 to 0.643 on RaR-Science rubric score, compared with 0.594 for an 8B Generative judge baseline, while the baseline requires 10.7times more reward-judge time. Task and domain transfer experiments further suggest that Probe judges preserve criterion-level reward structure across settings.