对话式推荐系统中零数据冷启动的实证研究
An Empirical Study on Zero-Data Bootstrapping for Conversational Recommender Systems
August 28, 2026
作者: Rohan Surana, Junda Wu, Zhouhang Xie, Yu Xia, Nathan Kallus, Julian McAuley
cs.AI
摘要
对话式推荐系统(CRS)通常需要特定领域的对话数据,而这种数据成本高昂、稀缺,且在新领域中往往无法获得。本文对零数据CRS引导进行了系统的实证研究:即从非对话信号(商品评论、元数据和用户-项目交互)中生成合成对话监督,而无需任何领域内的对话语料库。我们比较了两种基于信息论的选择策略——Jensen-Shannon多样性和Fisher信息,并跨越不同领域信号、模型架构、数据集和微调范式进行了评估。结果表明,基于领域知识的合成数据在性能上始终优于零样本提示和朴素合成基线;主动选择相比随机采样能提升数据效率;元数据和协同过滤信号均能提高选择质量;此外,在低资源场景下,合成数据可以优于稀缺的真实对话数据,并进一步与之形成互补。这些发现确立了非对话领域信号作为无需对话训练数据即可构建CRS的可行路径。代码可在 https://anonymous.4open.science/r/zero_data_crs/ 获取。
English
Conversational Recommender Systems (CRS) typically require domain-specific dialogue data, which is costly, scarce, and often unavailable in new domains. We conduct a systematic empirical study of zero-data CRS bootstrapping: generating synthetic conversational supervision from non-conversational signals---item reviews, metadata, and user-item interactions---without any in-domain dialogue corpus. We compare two information-theoretic selection strategies, Jensen-Shannon diversity and Fisher information, across domain signals, model architectures, datasets, and fine-tuning paradigms. Our results show that domain-grounded synthetic data consistently outperforms zero-shot prompting and naive synthetic baselines; active selection improves data efficiency over random sampling; metadata and collaborative filtering signals each improve selection quality; and, in low-resource settings, synthetic data can outperform scarce real dialogues while further complementing them. These findings establish non-conversational domain signals as a viable path toward building CRS without conversational training data. The code is available at https://anonymous.4open.science/r/zero_data_crs/ .