DREAM 技术报告
DREAM Technical Report
August 13, 2026
作者: Bin Zhang, Bowen Zheng, Chao Yi, Chengyu Lai, Dian Chen, Dimin Wang, Gaoyang Guo, Jialin Zhu, Jian Wu, Jing Yu, Jiuning Lin, Lingqing Zhang, Lingyun Zheng, Mao Zhang, Mingming Pan, Ruiquan Lan, Shuai Zhong, Wen Chen, Wendong Zhang, Xiaodong Zhu, Xuan Chen, Xunke Xi, Yifan Lu, Yiheng Wang, Yue Zeng, Yujie Luo, Yuning Jiang, Zhe Hu, Zhibo Xiao, Zihong Huang, Binbin Cao, Bo Zheng, Danning Wang, Dixuan Wang, Ge Fan, Haixia Wu, Han Zhu, Hao Fang, Haoming Chen, Huiping Chu, Jian Wang, Jianjun Wu, Jiawei Wu, Jiaxin Yu, Jingwen Liu, Jinzhe Shan, Kai Meng, Kai Zhang, Keqin Xu, Kewei Zhu, Lang Tian, Leihui Chen, Li Chen, Licheng Xu, Lide Xiao, Ruitong Zhang, Shiyao Peng, Silu Zhou, Tao Wang, Wei Shi, Wenjun Yang, Xiang Chen, Xiang Gao, Xiao Ren, Xu Liu, Xuwen Wang, Yang Li, Yeqiu Yang, Yi Hu, Yichen Yuan, Yinnan Song, Yipeng Yu, Yuan Liu, Yunqi Gao, Zhiliang Huang, Zhujin Gao, Zongyuan Wu
cs.AI
摘要
工业推荐系统通常采用级联的召回、排序和重排序流水线。尽管高效,这些流水线却将信息和目标分散到各个模块,依赖刚性规则,且对实时意图的感知能力有限,导致浏览、比较和购买之间的会话级转换未能得到充分处理。我们提出了DREAM(Developing Recommender Engine with Agentic Methods,基于智能体方法的推荐引擎开发),一种自主优化控制架构,它在不替换现有流水线的前提下,在其之上增加了一个具有感知能力、可编排且可审计的策略层。DREAM包含两个核心组件。第一,三层意图引擎(Intent Engine)将设备端信号融合为结构化的L0/L1/L2意图表示;其边缘-云端触发链将上报量压缩至约8.7%。第二,元引擎(Meta Engine)利用元模型(MetaModel)进行M1到M2再到M3的分层推理:意图摘要、由策略记忆(Strategy Memory)指导的策略规划,以及参数转换。它通过带有安全护栏的统一出口分发生成的参数。奖励双循环(Reward Dual Loop)通过将离线模拟用于策略空间探索与在线反馈用于结果校准相结合,持续优化两个组件,形成生成、执行、评估和经验积累的闭环。在淘宝首页信息流上的大规模A/B测试表明,仅对重排序进行控制即可使IPV提升2.06%,核心IPV提升2.39%,GMV提升0.88%。将控制扩展至精排后,这些增益分别提升至2.71%、3.06%和1.31%,同时PV持续提升超过1%。这些增益既无需替换流水线模型,也不牺牲服务稳定性,支持智能体元控制作为工业推荐的可行范式。
English
Industrial recommender systems commonly use cascaded retrieval, ranking, and re-ranking pipelines. Although efficient, these pipelines fragment information and objectives across modules, rely on rigid rules, and have limited awareness of real-time intent, leaving session-level shifts among browsing, comparison, and purchase insufficiently addressed. We present DREAM (Developing Recommender Engine with Agentic Methods), an autonomous optimization control architecture that adds a perception-aware, orchestrable, and auditable policy layer atop existing pipelines without replacing them. DREAM has two core components. First, a three-tier Intent Engine fuses on-device signals into structured L0/L1/L2 intent representations; its edge-cloud trigger chain reduces reporting volume to approximately 8.7%. Second, a Meta Engine uses a MetaModel for layered M1-to-M2-to-M3 reasoning: intent summarization, strategy planning informed by Strategy Memory, and parameter translation. It dispatches the resulting parameters through a unified outlet with safety guardrails. A Reward Dual Loop continuously optimizes both components by combining offline simulation for strategy-space exploration with online feedback for outcome calibration, forming a cycle of generation, execution, evaluation, and experience accumulation. Large-scale A/B tests on Taobao's homepage feed show that re-ranking control alone improves IPV by 2.06%, Core IPV by 2.39%, and GMV by 0.88%. Extending control to fine ranking raises these gains to 2.71%, 3.06%, and 1.31%, respectively, while consistently improving PV by more than 1%. These gains require neither replacement of pipeline models nor compromise of serving stability, supporting agentic meta-control as a viable paradigm for industrial recommendation.