每日精选AI研究论文及翻译
当老年人漏服一剂药物后,软件智能体可以发送另一条提醒,具身智能体可以递送药物。然而,两者都无法解释该人是忘记了、感到困惑、出现了副作用,还是故意拒绝服药,也无法判断何种支持是适当的。这揭示了Agentic AI中的一个结构性缺口:数字智能体主要转换软件状态,而具身智能体转换物理状态;两者都未将人的动态状态及其能动性作为建模、干预和评估的首要对象。我们提出具身融合智能体(Combodied Agents),这是一种以人为中心的新范式,它通过软件工具、传感器、可穿戴设备、机器人和人类服务作为行动渠道而非最终目标,来感知、建模、预测并长期支持个体状态轨迹。我们将个人助手、健康智能体、AI伴侣和自适应人机系统中的碎片化能力统一为一个闭环:基于事件的多模态感知重建有意义的个人事件;纵向、可修正的记忆提供时间上下文;个人世界模型(Personal World Models)在备选决策和干预下估计未来个人状态与结果;可采纳的干预策略在同意、不确定性、安全性、可逆性和用户控制的前提下选择适度支持。来自人和环境的反馈持续更新该闭环。该框架无需构建完备的人类数字孪生(Human Digital Twin),而是采用目的受限、不确定性感知、用户可修正的表征。我们按人类状态目标、关系情境和智能体角色来组织设计空间,并提出以场景为中心的评估、能动性保持指标、基准测试要求、边缘原生个人模型和治理方向。具身融合智能体将Agentic AI从外部任务完成转向持续的人类福祉。
智能体系统日益被期望在部署后能够持续改进,然而单一实体的自我演化往往受限于静态学习环境,例如固定任务和固定反馈。本综述聚焦于智能体系统中的共演化——一种多组件的自我演化形式,其中多个智能体及其环境相互施加适应性压力。为系统组织现有文献,我们提出一个渐进式三阶段分类法,追踪系统如何逐步摆脱人类工程设计的约束。**智能体—智能体共演化**研究智能体如何通过动态同伴进行适应,包括对抗性、协作性和组织性适应。**智能体—环境共演化**将该演化循环拓展至随智能体变化的适应性任务、反馈和交互空间。**元共演化**进一步探索使演化机制本身成为可演化对象的可能性。我们还讨论了评估此类系统、在多组件间进行规模化扩展,以及保持日益自主的演化过程安全可控等方面的开放性挑战。本综述为构建超越固定人类设计路径、具有鲁棒性和开放性的智能体系统提供了统一基础。
4D生成能够从文本或图像等条件合成动态3D场景。现有方法要么使用独立的4D模型重建生成的RGB视频,要么调整特定的视频生成器直接预测几何信息。前者存在分布不匹配和误差传播的问题,而后者则将4D预测与特定生成器绑定,在生成器或条件机制发生变化时可能需要重新训练。我们探究共享变分自编码器(VAE)的视频模型的最终去噪潜变量能否作为可复用的接口,用于显式4D预测。基于这一洞见,我们提出了直接从潜变量到4D的生成方法,并将其实现为Latent-to-4D,该方法绕过RGB,将视频潜变量与预训练4D解码器的词元网格对齐,并通过逐帧和全局时空注意力进行精化。仅使用约1K个现有重建片段进行训练,单个检查点即可在同一VAE家族内的多个视频扩散Transformer之间无需修改地迁移。在Text4D-200和I4D-200数据集上,Latent-to-4D在基于投影的DINO-F1指标上分别超过匹配同潜变量Wan+4RC级联方法2.88–3.45分和5.81分,同时人工评估者在几何质量、时间稳定性和整体质量方面也更为偏好该方法。
构建交互式数字孪生需要同时恢复三维几何结构以及控制物体关节运动的运动学结构。然而,现有的铰接物体重建方法要求从多个关节状态中显式观测运动信息。我们提出了一种静息状态公式化方法,能够从单一闭合构型中重建铰接物体——这是一个本质上不适定的设定,需要依赖几何、语义和运动先验来弥补运动线索的缺失。我们的框架采用显式网格作为中间表示,以实现跨模型验证与融合,将视觉-语言模型和分割模型产生的噪声输出协调为空间一致的部件结构。为了在无观测运动的情况下估计关节参数,我们使用视频扩散模型合成关节运动假设,并通过几何一致性对其进行验证。我们的方法实现了精确的部件分解和物理上合理的关节运动,与基于运动观测的重建方法、生成方法以及模块化预训练模型基线相比,性能具有竞争力。
弗雷歇距离最近作为一种有效的分布级目标被引入生成器后训练,补充了传统的样本级扩散和流匹配损失。然而,直接优化弗雷歇目标可能导致弗雷歇作弊。目标指标持续改善,但视觉质量和其他特征空间中的弗雷歇对齐可能停滞或恶化。我们将这一失败归因于现有弗雷歇损失所使用的静态预训练特征空间。这些特征空间提供了真实分布与生成分布之间差异的不完整且固定的视角。为了解决这一局限性,我们提出了对抗弗雷歇距离(AdvFD),它通过经校准的对抗学习表示来补充FD-Loss中的静态表示目标。AdvFD用一个可学习表示增强原始静态弗雷歇目标,该表示对抗性地最大化真实样本与生成样本之间的弗雷歇差异,同时生成器在所得自适应特征空间中最小化相同差异。为了防止对抗表示通过特征放大平凡地增加目标,我们进一步引入了真实特征白化,它归一化其尺度和协方差几何,并稳定最小-最大优化。大量实验表明,AdvFD在JiT和pMF骨干以及不同模型规模上一致地改善了一步生成器后训练。
自我改进的编码智能体通过迭代式地重写自身源代码,已在编码任务上展现出令人瞩目的性能。然而,现有方案通常每次仅从单条失败轨迹中推导自我修改,忽视了智能体不断扩展的过往尝试档案中丰富的比较信号。根据孟德尔受控遗传原理,我们提出了孟德尔-哥德尔机(MGM)。除了常见的单轨迹克隆突变外,MGM 还引入了两种能够更好利用累积证据的新型自我修改方式:反应规范突变基于智能体在多个任务上的轨迹同时对其进行修改;跨谱系杂交则利用同一任务上另一谱系参考智能体的轨迹来修改智能体。在加性适应度景观模型下,我们从理论上证明并通过受控替代仿真演示,相较于单轨迹基线,新策略能够实现更快、更好的收敛。在 SWE-bench 和 Polyglot 上的实验证实,MGM 在性能、效率和泛化能力上均有持续提升。
大语言模型(LLM)智能体越来越多地被部署为个人助理。然而,现有评估大多使用静态环境中的简短、自包含的请求。日常生活辅助则不同:一项任务会持续数周而非数分钟;在智能体未被提示时,世界也在不断变化;许多约束从未被明确说明。一个仅仅回答眼前请求的智能体在此类任务中将会失败。相反,所需要的是一个保持主动性和一致性的智能体:它自行决定何时行动、何时提问、何时保持沉默;它注意到无人宣告的变化;它从第一天到最后一天都维持同一个连贯的计划。目前没有任何基准测试能衡量这一点。我们提出了 VibeLifeBench,这是一个包含200个长期任务、横跨十个日常生活领域的基准测试。每个任务都是一个脚本化的多周时间线,发生在包含22个模拟服务的模拟世界中。这个世界按自己的时钟推进,而且其许多变化都是静默的,因此只有重新检查世界的智能体才能发现它们。每个任务都通过细粒度、加权的检查来评分,这些检查只读取智能体实际留下的痕迹,涵盖最终状态、行动的及时性以及是否遵守了隐含约束。我们评估了七个前沿模型。它们的得分都很低,这显示了当前智能体与现实生活辅助之间的差距。我们将开源所有任务、环境和评估框架。
全模态对话模型能够理解多模态输入并生成语音回复,但它们的回复在视觉上仍然是无实体的。我们提出Ex-Omni-2D,一种全模态对话框架,能够生成包含文本、个性化语音和参考条件视频的协调回复。给定多模态查询、参考图像和参考音频,模型预测一个描述场景、情感和动作的结构化视觉思维计划(VTP),随后生成回复文本和原生多码本语音单元。这些单元构成一个共享的声学-时间接口:它们被解码为语音并与视频帧在线对齐。该接口使得回复路径和虚拟形象路径能够从异构的语音、对话和虚拟形象视频数据中学习,从而避免了对大规模查询—文本—语音—视频监督的需求。全序列视频生成器充当主要教师。为实现高效的增量生成,我们进一步将其蒸馏为少步块因果流式学生模型,其前缀流式机制在连续块之间携带干净的潜在表示,以减少后续块的累积退化。通过四步推理,完整的四GPU流水线在400×720/720×400分辨率下实现了1.293的端到端RTF,提供了一个实用的质量—效率工作点。
大语言模型评估通常聚焦于标称条件下的性能,这制造了一种能力错觉,仿佛模型能够轻松行走在一条狭窄且高度优化的生成走廊上。然而,在现实部署中,复杂的系统提示、安全护栏和结构性约束不断迫使模型偏离这一标称路径,导致基准分数与部署性能之间出现偏差。为解决这一问题,我们引入了“解码层禁忌”(Decoding-Level Taboo),一种零提示诊断压力测试方法,它在运行时直接干预logit空间,迫使模型脱离标称路径。通过在词边界动态屏蔽主要候选词元,Taboo迫使机器进行迂回表达。 在多个开放权重模型系列上对Taboo进行评估后发现,偏离路径的鲁棒性受参数规模和训练后指令对齐的显著影响,且鲁棒性通常随模型规模和指令对齐程度的提高而改善。除本文呈现的结果外,Taboo还为生成多样化合成数据集、对运行时安全护栏进行压力测试,以及在现实部署之前审计模型可靠性提供了一种新颖的原语。
长时程研究智能体通过迭代检索、聚合与综合来解决开放式任务,但上下文会迅速增长,而额外证据的边际价值往往随之下降。这导致最终报告生成时产生不必要的令牌成本、更高的延迟以及噪声更大的输入。我们研究了深度研究智能体中上下文管理的边际价值估计问题,并首次提出了跨流水线的剪枝策略的系统性阶段感知比较。我们在检索前、检索后和综合前阶段评估了轻量级启发式标准以及一种学习型价值模型。结果表明,剪枝的效果更多地取决于剪枝应用的阶段,而非具体的评分规则:早期剪枝带来最大的端到端节省,而后期剪枝主要优化最终综合上下文。轻量级启发式方法可将令牌使用量降低多达73%,且几乎不造成质量下降;学习型剪枝在特定权衡下仍具有竞争力;没有任何单一方法能在质量、效率和忠实性方面全面占优。这些发现为设计高效的长时程智能体系统提供了实用指导。
自我进化代理通过追加成功流程和失败修复来积累可复用技能。随着时间推移,相同需求常常在多个分支、示例和警告中被重复表述,而常见动作序列被复制而非复用。由此产生的技能变得注入成本高昂且难以维护。通用提示压缩并不适用于这一场景,因为技能并非一段平铺文本:其名称和描述定义了适用条件,工作流控制执行过程,工具和输出契约约束有效性,而罕见异常即使在没有采样任务激活它们时仍可能至关重要。评估引导的压缩可以检验这些行为,但会引入轨迹回放、成本开销以及对压缩时评估集的依赖。我们提出SkillZip,一种免评估的方法,通过寻找技能最短的忠实结构化解释来实现压缩。其直觉是:一次解释、多处引用——在适用作用域将重复规则陈述一次,将重复动作序列提取为共享过程,并仅将差异保留为显式异常。我们将这一直觉形式化为一个类型化的最小描述长度目标,作用于技能契约和残差,并施加硬覆盖约束以覆盖每个提取的触发器、工作流边、工具需求、义务和输出字段。该公式提供了简单的共享阈值,从构造上保留独特的罕见规则,并支持高效的局部更新。SkillZip具有单次模式(包含一次结构化提取调用和确定性优化)以及持续压缩即写(Zip-on-Write)模式(可整合每个自我进化补丁而无需重放任务或重新解析完整历史)。通过全面的实验评估,我们证明了SkillZip在压缩性能、泛化能力和成本开销方面的有效性与优越性。
稀疏混合专家(MoE)层通过条件计算扩展推荐能力,然而训练好的检查点仍然在其完整专家库上进行存储和路由。我们研究一个部署问题:在明确的专家预算下,将该检查点转换为更小的标准MoE,且不添加压缩专用的在线模块。为此,我们提出UniMoMo,一个形式化为约束图粗化问题的训练后压缩框架。UniMoMo不依赖参数距离,而是基于功能相似性对专家进行分组,使用无标签校准集来度量专家对共享推荐状态的响应相似程度。为防止性能下降,我们引入一种层自适应保护机制,根据路由暴露度限制高流量专家的合并。在Amazon Beauty、KuaiRec和TenRec上,使用含有2、4和6个MoE块的模型,最终的四专家检查点获得相对于源模型的五次运行平均NDCG@10比率为99.92%--102.30%,实测A100加速比为1.28倍--1.63倍。一种激进的二专家、top-1运行点获得98.36%--104.24%的比率和1.47倍--2.21倍的加速比。这些最终结果评估了完整的转换与适配工作流,并表明训练好的推荐MoE可以在多种服务预算下导出。
视觉文档检索(VDR)目前由数十亿参数模型主导,这些模型在全语料库规模上索引速度慢且服务成本高昂。此前的压缩路线要么从头训练一个更小的多向量编码器,要么只对查询侧进行蒸馏,两者都无法端到端地得到一个紧凑的单向量检索器。我们提出了 DistilVDR,一个 524M 参数的端到端 VDR 系统,在逐点余弦对齐损失下,从单个 8B 视觉-语言教师模型中双侧蒸馏而来。所有监督信号均来自冻结教师模型的嵌入空间,而该教师模型本身在训练时使用了相关性监督,因此学生目标函数无需相关性标签、负采样或对比项。我们用一个不对称的仅编码器学生模型来匹配 VDR 的文本查询—图像文档输入不对称性,将视觉能力集中在文档侧,查询侧参数保持为 70M。我们发布了两个变体,它们共享相同的编码器和训练过程,仅文档编码器的视觉令牌预算不同:DistilVDR-HiRes 在 ViDoRe v1+v2+v3 上取得 61.74 的平均 NDCG@5(达到 8B 教师模型的 86.9%),并在对高分辨率敏感的 v3 基准上领先所有已复现的 sub-1B 基线;DistilVDR-Fast 在视觉令牌预算仅为前者三分之一的条件下取得 59.98。两个变体都能将一百万文档存储在比最强的 sub-1B 多向量基线小 15.6 倍的索引中,并以快一个数量级的速度完成语料库索引。代码可在 https://github.com/Ryenhails/NanoVDR 获取。
大语言模型(LLMs)正越来越多地被部署为移动助手,其中的一个关键挑战是如何利用分散在多个应用程序(app)中的个人信息来完成用户指令。然而,由于缺乏专门的基准测试,它们的能力仍未得到充分理解。为弥补这一空白,我们提出了SPIEval——一个基于五种认知能力(即推理、消歧、整合、偏好推断和多意图分解)的人工策划基准测试。SPIEval包含250个任务,涵盖分布在10个应用中的4,335条个人记录,并通过21个工具支持多轮交互。分析表明,该基准具有场景多样、任务具有挑战性、信息分散、环境可控和结果可验证等特点。我们评估了九个代表性LLM,发现仍有很大的改进空间。表现最佳的模型GPT-5.5(xhigh)仅达到57.3%的准确率,而表现最弱的模型仅为16.4%。进一步分析显示,79%的失败源于信息定位不准确——LLM往往固守看似合理但错误的信息,而不是继续检索以进行验证。我们还发现,不到2%的检索操作采用了高级检索方法,且不同模型间的检索效率差异显著。这些发现揭示了当前基于LLM的移动助手的根本性局限性,并为该方向的未来研究提供了动力。数据和代码可在https://huggingface.co/datasets/Junjie-Ye/SPIEval获取。
我们研究使用开源大语言模型进行多语言机器翻译的无参考后训练。从监督微调的 MiLMMT-46-v0.1 模型出发,我们应用组相对策略优化(GRPO),其奖励函数以语言识别为门控,并对两个无参考质量估计模型取平均。随后,我们对监督微调(SFT)和强化学习(RL)模型的检查点进行线性插值,得到 MiLMMT-46-v1.0。在 46 种语言上,所得模型相较于其 SFT 对应模型持续提升了翻译质量,超越了近期强力的开源基线(包括 Seed-X、HY-MT2 和 TranslateGemma),并在与所评估的专有系统(如 Google Translate、Gemini 3 Pro 和 GPT-5)的比较中取得了领先的无参考分数。我们进一步研究了同策略蒸馏,发现其能够达到、但未能超越通过 RL 结合检查点插值所实现的质量前沿。我们发布模型和代码,以促进未来研究。
长文档理解通常需要对大量视觉内容丰富页面进行推理,这导致推理成本高昂且容易发生上下文腐化。在本工作中,我们提出 InSight-doc,一个智能体式视觉感知框架,将视觉分辨率视为一种自适应的推理时间资源。InSight-doc 从低分辨率出发,选择性放大到高分辨率区域以获取更精细的证据,完全无需外部检索器。为训练此类智能体,我们构建了一个包含 17.9K 高质量 SFT 样本的主动感知语料库,其中包含区域级放大轨迹,并配以 19.2K 困难 RL 样本。通过 SFT+RL 训练,InSight-doc-8B 在文档 VQA 基准上将基线提升了 4.3–16.4 个准确率百分点。在长文档上,它使幻觉减少超过 40%,推理延迟降低 41%–68%,同时保持准确率领先。我们的代码、数据集和模型已在 https://github.com/m-Just/InSight-doc 发布。
我们提出360CityArena,一个用于在由360度视频构建的照片级逼真环境中评估具身智能体城市探索能力的基准。现有的户外基准要么缺乏足够的逼真度,要么缺乏足够的复杂度,导致与现实城市环境之间存在相当大的差距。360CityArena基于日本东京秋叶原地区的真实感重建,使用覆盖85条街道的602段360度视频,并由175项人工精心设计的任务组成。它涵盖三类任务:环境理解、路径推理和空间推理,覆盖城市探索所需的基本能力,如定位、地标搜索、路径规划和关系空间推理,从而能够在真实城市场景中进行全面评估。我们使用基于LMM的最先进智能体进行的评估表明,即使是最强的模型Gemini 2.5 Flash,其表现也远低于人类水平(人类:77.3%对Gemini 2.5 Flash:17.1%),这揭示了城市规模的具身导航与推理中仍然存在的重大挑战。360CityArena为照片级逼真的城区环境中的导航与空间推理提供了一个必要且具有挑战性的测试平台。
基于查询的掩码变换器通过最终层查询预测之间的像素级竞争来组装分割输出,然而这一推理过程在训练中并未被显式优化。我们识别出两个关键的不匹配:具有最高概率-掩码分数的查询不一定产生最准确的掩码,且最终层解码可能丢弃来自中间层的更优预测。为解决这些问题,我们提出了推理感知学习(Inference-Aware Learning, iFAN),一种适用于普通掩码变换器的通用训练框架。iFAN引入调整概率-掩码排序(Adjusted Probability-Mask Ranking, APMR),将查询竞争与预测掩码质量对齐,并抑制高置信度但不准确的竞争者。我们进一步采用跨层自蒸馏(Cross-Layer Self-Distillation, CLSD)将更强的中间层预测迁移至最终层。排序和蒸馏目标仅用于训练,而推理仍保持高效的最终层解码。在COCO、ADE20K和Cityscapes上的实验表明,在全景、实例和语义分割任务中,以及不同架构、骨干网络规模和输入分辨率下均取得了一致的性能提升。总体而言,iFAN在平均性能上提升了1.20 PQ、1.30 AP和0.63 mIoU,而额外参数、FLOPs和推理延迟可忽略不计。
拼图求解需要同时推理视觉内容与几何约束,然而现有基准采用矩形切割,在纹理重复区域会产生模糊的真实标签。我们提出了 \ours{},这是一个采用凸块与凹槽互锁拼块的基准,其几何约束提供了强局部兼容性要求,与视觉内容结合后能够产生无歧义的真实标签。在四种网格密度(4×4 到 16×16)的 95K 个实例中,我们发现零样本视觉语言模型(VLM)在很大程度上缺乏几何推理能力:五个前沿模型中仅有一个(GPT-5.5)在 4×4 拼图上超过随机基线,其余所有模型均处于随机水平。虽然监督微调在 4×4 上能达到 97% 以上的准确率,但所有模型在更大网格上均出现性能崩溃:GPT-5.5 在 8×8 上从 70% 跌至接近随机水平,甚至微调后的模型在 12×12 上也低于 5%。这种“规模悬崖”表明,随着拼块数量增加,当前架构无法维持一致的约束满足。\ours{} 将可扩展的几何推理确立为视觉语言模型面临的一项开放挑战。
真实世界的数据科学涉及长周期工作流,涵盖数据整理、探索、建模、可视化和验证,并且需要在真实运行环境中协调使用 Notebook、IDE、终端、浏览器和数据库等工具。然而,现有基准缺乏真实计算机交互,无法评估智能体能否在真实计算环境中执行完整的端到端数据科学工作流,因而未能体现数据科学实践的多阶段、多工具特点。我们提出 DSAgentBench,这是首个在真实计算机环境中评估智能体能否自动化完整数据科学工作流的基准。DSAgentBench 包含 275 个多样化任务,覆盖数据科学全生命周期,反映了实际场景中所需的复杂性和工具协调能力。每个任务都要求智能体依据中间输出进行决策并协调使用工具,同时配备一个确定性评估器,用于验证分析正确性、可视化输出和模型性能,而非仅检查代码执行。我们对 15 个闭源和开源模型进行了大量实验,结果表明,即使是最强的智能体 Claude-4.6-Sonnet,也仅达到 56.70% 的任务成功率,而所有开源智能体的成功率均低于 1%,并且经常在工具编排、操作系统环境关联和多步推理上失败。这些结果揭示了当前智能体系统与真实数据科学工作流之间的巨大能力差距,使 DSAgentBench 成为开发基于真实环境、可验证、自主的数据科学智能体的基础。我们已在 https://github.com/vis-nlp/DSAgentBench 上发布 DSAgentBench。
人工智能(AI)的快速发展显著加速了时间序列分析的研究,尤其是在预测、分类和生成任务方面。最近的模型,尤其是基础模型,受益于时间序列数据集的相似性,因为这种相似性在微调的源数据集选择中起着重要作用。然而,许多现有的用于基准测试时间序列数据集相似性方法的实现是碎片化的且难以扩展。为了解决这一问题,我们提出了一个统一框架——时间序列数据集相似性工具箱(TSDS-Toolbox)。我们的工作实现了:(1)对时间序列数据集相似性方法进行系统且可复现的比较;(2)用户可灵活扩展以添加自定义数据集、相似性方法和下游时间序列任务;(3)通过集成的时间序列数据集归约器,对数据集级别和序列级别的相似性方法进行一致的评估。TSDS-Toolbox的有效性通过在不同实验设置下的综合实验得到了验证。我们的工具箱已公开可用。
基于幂律解码器表示的大语言模型(PLDR-LLM)及其注意力机制——幂律图注意力(PLGA)——将缩放点积注意力(SDPA)的固定双线性形式替换为学习到的、由输入生成的双线性算子G_{LM},该算子由正张量A_{LM}通过逐元素幂律构建而成。该架构具有完整的规范说明,并已对照固定的参考发布版本进行了验证;各项断言被标注为定理、条件定理、测量结果或猜想。无条件成立:PLGA在G_{LM}=I时精确包含SDPA;A_{LM}与A_P均为严格逐元素正,且A_{LM}具有Perron-Frobenius结构;DAG正则化器具有NOTEARS游走计数形式,正性阻碍了精确无环性;并且,在非共振条件下(标准旋转频率满足该条件),换位子判据可识别出哪些算子保持相对位置依赖性。推理坍缩定理:演绎输出的精确输入不变性将推理坍缩为具有常算子的广义SDPA。测量不变性:相对波动在10⁻⁶及以下;扰动界量化了缓存推理,但未能对其加以证明;所组装的代理指标未能捕获解码裕度。一个条件性三阶段机制(旋转扭曲、集中、行映射压缩)在已发布的检查点上测得。在全局Gram下进行的分块训练与评分被明确表述为在显式目标暴露下进行;在测试样本上,分块评分与序贯评分选择出相同的答案,且在已发表的TruthfulQA概率质量度量上每个条目的一致程度在5×10⁻⁵以内。自组织临界性作为一个具有内禀序参量的唯象框架被引入;未决断言转变为可证伪的猜想。选定的证明核心已在Lean 4中通过机器验证。
最近关于检索增强生成(RAG)的优化研究利用块级KV缓存复用来避免处理冗长的检索上下文以提高效率,但粗粒度块中仍存在显著的信息冗余和噪声。本文提出CoinRAG(面向长上下文RAG的上下文化信息片段KV缓存复用),在低预填充延迟约束下优化帕累托前沿并最大化准确性。该名称隐喻性地反映了我们的核心机制:正如将小面额硬币组合以累积更大价值,CoinRAG以组合方式复用离线计算的细粒度片段缓存,以更具语义相关性且更紧凑的形式高效构建学习到的上下文表示。具体而言,CoinRAG不进行整块编码,而是通过两阶段检索识别检索块中与查询相关的语义单元,并将其切片KV表示与块级上下文无缝组装在一起。在LongBench多跳问答任务上的广泛评估表明,CoinRAG显著降低了运行成本,在标准的快速预填充延迟预算下实现了新的帕累托前沿,答案质量(F1)平均相对提升5.3%,优于其他基线方法。