ChatPaper.aiChatPaper

DecoEvo: テキスト空間におけるソルバーと評価基準生成スキルのスコア分離型共進化

DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

July 28, 2026
著者: Jiangwang Chen, Zixin Song, Junlin Liu, Shuaiyu Zhou, Haiyan Wu, Haihan Shi, Chenxi Zhou, Hanqing Li, Xiao Yang, Da Zhu, Guanjun Jiang, Hai Wan, Xibin Zhao
cs.AI

要旨

テキスト空間最適化は、モデルの重みではなく外部の自然言語成果物を編集することで大規模言語モデル(LLM)を適応させる手法であり、最適化された成果物は検査可能なままで、モデルをブラックボックスとして扱うことができる。しかし、既存のテキスト空間手法のほとんどは評価を固定している。オープンエンドなタスクでは、これがボトルネックとなる可能性がある。すなわち、ソルバーがルーブリックが測定する基準を改善すると、省略された次元は最適化信号に不可視のままになる。また、現在のソルバーのスコアによって更新を選択する場合、ルーブリック自体を進化させることも信頼性が低い。なぜなら、見かけ上の進歩はルーブリックを満たしやすくすることに起因し得るからである。本稿では、DecoEvo(分離共進化、Decoupled Co-Evolution)を提案する。これは、最適化中にゴールドルーブリックを使用せず、分離された目的の下でソルバースキルとルーブリック生成スキルを共進化させる手法である。ソルバースキルは基準レベルのフィードバックを用いて更新される一方、ルーブリック生成スキルはソルバーの総合スコアから独立した、要件カバレッジと応答の識別に関する補完的な監査を通じて修正される。この分離により、生成器の更新は新たに露呈したソルバーの弱点に集中し、ソルバーが既に満たしている基準への繰り返しの強調が軽減される。各ベンチマークの公式評価において、DecoEvoは5つのベンチマークと3つのLLMバックボーンにわたって比較した全手法を上回り、5ベンチマーク平均でSkillOpt比2.8~5.0%の相対的な改善を達成した。
English
Text-space optimization adapts large language models (LLMs) by editing external natural-language artifacts rather than model weights, so the optimized artifacts remain inspectable and the model can be treated as a black box. However, most existing text-space methods keep evaluation fixed. On open-ended tasks, this can become a bottleneck: once the solver improves on the criteria a rubric measures, omitted dimensions remain invisible to the optimization signal. Simply evolving the rubric is also unreliable when updates are selected by the current solver's score, because apparent progress can come from making the rubric easier to satisfy. We introduce DecoEvo (Decoupled Co-Evolution), which co-evolves a solver skill and a rubric-generator skill under decoupled objectives without using gold rubrics during optimization. The solver skill is updated using criterion-level feedback, while the rubric-generator skill is revised through complementary audits of requirement coverage and response discrimination that are independent of aggregate solver score. This separation focuses generator updates on newly exposed solver weaknesses, reducing repeated emphasis on criteria the solver already satisfies. Under each benchmark's official evaluation, DecoEvo outperforms all compared methods across five benchmarks and three LLM backbones, yielding 2.8--5.0\% relative gains over SkillOpt in the five-benchmark average.