ChatPaper.aiChatPaper

Au-delà de la recherche : un référentiel et un modèle multitâche pour la recherche de code

Beyond Retrieval: A Multitask Benchmark and Model for Code Search

May 6, 2026
Auteurs: Siqiao Xue, Zihan Liao, Jin Qin, Ziyin Zhang, Yixiang Mu, Fan Zhou, Hang Yu
cs.AI

Résumé

La recherche de code a généralement été évaluée comme une étape de recherche de premier niveau, bien que les systèmes en production reposent sur des pipelines plus larges intégrant le reclassement et des requêtes de type développeur. Les benchmarks existants souffrent également de contamination des données, de bruit dans les étiquettes et d'une pertinence binaire dégénérée. Dans cet article, nous présentons CoREB, un benchmark de recherche et de reclassement de code multitâche à contamination limitée, accompagné d'un reclasseur de code affiné, qui va au-delà de la simple recherche pour couvrir l'intégralité du pipeline de recherche de code. CoREB est construit à partir des problèmes de LiveCodeBench réécrits de manière contrefactuelle dans cinq langages de programmation, et est fourni sous forme de versions chronométrées avec des jugements de pertinence gradués. Nous évaluons onze modèles d'encodage et cinq reclasseurs sur trois tâches : texte-à-code, code-à-texte et code-à-code. Nos expériences révèlent que : (1) les encodages spécialisés dans le code dominent la recherche code-à-code (~2× par rapport aux encodeurs généraux), mais aucun modèle unique ne remporte les trois tâches ; (2) les requêtes courtes par mots-clés, le format le plus proche des recherches réelles des développeurs, réduisent tous les modèles à un nDCG@10 quasi nul ; (3) les reclasseurs prêts à l'emploi sont asymétriques selon la tâche, avec un écart de 12 points sur la tâche code-à-code et aucun bénéfice net de base sur toutes les tâches ; (4) notre reclasseur affiné CoREB-Reranker est le premier à obtenir des gains cohérents sur les trois tâches. Les données et le modèle sont publiés.
English
Code search has usually been evaluated as first-stage retrieval, even though production systems rely on broader pipelines with reranking and developer-style queries. Existing benchmarks also suffer from data contamination, label noise, and degenerate binary relevance. In this paper, we introduce CoREB, a contamination-limited, multitask code retrieval and reranking benchmark, together with a fine-tuned code reranker, that goes beyond retrieval to cover the full code search pipeline. CoREB is built from counterfactually rewritten LiveCodeBench problems in five programming languages and delivered as timed releases with graded relevance judgments. We benchmark eleven embedding models and five rerankers across three tasks: text-to-code, code-to-text, and code-to-code. Our experiments reveal that: \circone code-specialised embeddings dominate code-to-code retrieval ({sim}2{times} over general encoders), yet no single model wins all three tasks; \circtwo short keyword queries, the format closest to real developer search, collapse every model to near-zero nDCG@10; \circthree off-the-shelf rerankers are task-asymmetric, with a 12-point swing on code-to-code and no baseline net-positive across all tasks; \circfour our fine-tuned CoREB-Reranker is the first to achieve consistent gains across all three tasks. The data and model are released.