Além da Recuperação: Um Benchmark e Modelo Multitarefa para Busca de Código
Beyond Retrieval: A Multitask Benchmark and Model for Code Search
May 6, 2026
Autores: Siqiao Xue, Zihan Liao, Jin Qin, Ziyin Zhang, Yixiang Mu, Fan Zhou, Hang Yu
cs.AI
Resumo
A busca de código tem sido geralmente avaliada como recuperação em primeiro estágio, mesmo que sistemas de produção dependam de pipelines mais amplos com reclassificação e consultas no estilo de desenvolvedores. Os benchmarks existentes também sofrem com contaminação de dados, ruído de rótulos e relevância binária degenerada. Neste artigo, apresentamos o CoREB, um benchmark de recuperação e reclassificação de código multitarefa com limitação de contaminação, juntamente com um reclassificador de código ajustado, que vai além da recuperação para cobrir todo o pipeline de busca de código. O CoREB é construído a partir de problemas do LiveCodeBench reescritos contrafactualmente em cinco linguagens de programação e entregue como lançamentos temporizados com julgamentos de relevância graduados. Comparamos onze modelos de embeddings e cinco reclassificadores em três tarefas: texto-para-código, código-para-texto e código-para-código. Nossos experimentos revelam que: ① embeddings especializados em código dominam a recuperação código-para-código (cerca de 2× em relação aos codificadores gerais), embora nenhum modelo vença todas as três tarefas; ② consultas curtas com palavras-chave, o formato mais próximo da busca real de desenvolvedores, reduzem todos os modelos a nDCG@10 próximo de zero; ③ reclassificadores prontos para uso são assimétricos por tarefa, com uma variação de 12 pontos em código-para-código e nenhum baseline com ganho líquido positivo em todas as tarefas; ④ nosso CoREB-Reranker ajustado é o primeiro a obter ganhos consistentes em todas as três tarefas. Os dados e o modelo são disponibilizados.
English
Code search has usually been evaluated as first-stage retrieval, even though production systems rely on broader pipelines with reranking and developer-style queries. Existing benchmarks also suffer from data contamination, label noise, and degenerate binary relevance. In this paper, we introduce CoREB, a contamination-limited, multitask code retrieval and reranking benchmark, together with a fine-tuned code reranker, that goes beyond retrieval to cover the full code search pipeline. CoREB is built from counterfactually rewritten LiveCodeBench problems in five programming languages and delivered as timed releases with graded relevance judgments. We benchmark eleven embedding models and five rerankers across three tasks: text-to-code, code-to-text, and code-to-code. Our experiments reveal that: \circone code-specialised embeddings dominate code-to-code retrieval ({sim}2{times} over general encoders), yet no single model wins all three tasks; \circtwo short keyword queries, the format closest to real developer search, collapse every model to near-zero nDCG@10; \circthree off-the-shelf rerankers are task-asymmetric, with a 12-point swing on code-to-code and no baseline net-positive across all tasks; \circfour our fine-tuned CoREB-Reranker is the first to achieve consistent gains across all three tasks. The data and model are released.