每日精选AI研究论文及翻译
自主智能体正开始端到端地开展机器学习(ML)研究。这类智能体将模型骨干与用于规划、执行、记忆和验证的框架相结合,但这一架构仍未将领域特有的专门知识纳入智能体内部。我们将这一缺失层称为操作知识——即区分“了解一种方法”与“让方法真正奏效”的专门诀窍。这类知识在领域中并不匮乏,它存在于代码库和论文中,但其形式是为人类读者编写的,且体量过大,无法在任务执行期间载入。一旦被蒸馏为紧凑且经过验证的技能,这类知识便可在不同任务间复用,而不必在每次运行中重新摸索。 我们提出 DisCo——一个技能驱动的研究智能体,它创建技能并在研究过程中加以使用。其蒸馏过程以两种互补的形式进行:任务无关蒸馏将该领域广泛使用的代码库凝练为可复用技能,任务导向蒸馏则产出具体任务所需的技能。前者应用于整个开放生态,产出了 AREX 技能库(AREX-Skill Library),其中包含从 1,000 个广泛使用的 ML 代码库中蒸馏出的 5,000 余项经过验证的技能,划分为 20 个领域和 178 个能力族。在 GPT-5.5 骨干、研究框架与下游执行预算均保持固定的条件下,配备技能的研究智能体在 MLE-bench 上的得分高出 134.3%,在 PaperBench 上高出 34.4%,在 FrontierCS 上高出 9.2%,在 PassNet 上高出 14.0%,均优于不配备技能的同一智能体。这些提升源于在上述固定设定下额外加入的经蒸馏的操作上下文。
随着代理从研究原型走向部署工具,其能力日益依赖于模型外部的执行基础设施,通常称为代理执行框架(agent harness)。在固定模型权重的情况下改变这一执行框架,会显著改变任务性能。当前的代理评测通常报告在特定执行框架下的下游性能,而模型自身开发执行框架的能力相对未被充分探索。我们提出了 HarnessDev 基准,它将评测单元从任务输出转变为可运行的执行基础设施。HarnessDev 涵盖两个阶段。在创建(Creation)阶段,代理从极简的种子代码和少量用例出发,构建完整的执行系统。在演进(Evolution)阶段,代理从自身创建的执行框架开始,利用下游执行反馈进行迭代修改,以提升基准性能为目标。随后,我们评估每个构建出的执行框架的能力(在保留基准上的任务成功率)和效率(执行令牌成本)。所报告的创建结果涵盖六个创建者 LLM、四个领域和五个下游基准,共包含 2,207 个独立的下游实例,并预留了隐藏评测任务以防止在开发过程中泄露。我们发现,生成的执行框架在代码、搜索与研究领域仍明显落后于成熟的人工设计参考,而在写作和机器学习实验领域则与所选参考相当甚至更优,同时执行成本差异很大。演进产生了一定的性能提升,但效果不稳定,且只能部分迁移到保留任务上。使用固定运行时模型的实验进一步表明,这些收益在很大程度上依赖于执行该框架的模型,说明跨模型的迁移能力有限。
人类许多重要的学习形式始于模糊的目标,例如“成为更好的物理学家”或“在研究方面取得进步”。学习者必须解读目标、识别能力差距、决定如何学习,并判断自己是否真正有所提升。相比之下,现有的关于大语言模型(LLM)自我进化的研究通常始于由人类明确设定的任务和评估指标,将自我进化简化为优化一个显式目标,而非自主决定学什么和怎么学。我们提出了ASPERE——一个面向模糊目标驱动型自我进化的基准测试。ASPERE仅提供一个自然语言形式的能力目标,而下游评估任务保持隐藏。智能体必须通过选择数据和更新方法、构建训练与验证信号、以及决定何时进行评估来将目标具体化。ASPERE在统一的交互式环境中同时支持模型权重进化和智能体框架(harness)进化,并在由专家撰写的、涵盖六个目标的520个隐藏条目上评估最终系统。我们的实验表明,模糊目标将搜索努力转向目标解读。当前的智能体能够常规性地完成训练和框架编辑循环,但权重层面的提升仍然稀少且不稳定,且进化得到的最强框架仍低于工程化设计的Qwen-Agent参考实现。智能体经常在数据不匹配的情况下进行训练,并过于相信狭隘的自我评估,导致局部提升无法迁移到隐藏评估中,而持续的搜索和训练甚至可能抹去先前取得的改进。
我们提出SolarWM,这是一个完全开放的基础框架,用于构建从数据准备到长时程推理的交互式视频世界模型。 跨异构数据源与视频主干网络进行训练颇具挑战性:数据集在时间尺度、相机几何、视觉质量、运动与描述风格上各不相同,而视频生成器则采用不同的表征与架构。 因此,朴素的数据混合与模型特化的实现会产生不一致的监督信号,并导致结果难以复现和比较。 SolarWM通过可重构的多源数据引擎与主干原生适配框架来解决这一耦合问题。该引擎将来自10个数据集的143万个规范片段转换为统一且帧对齐的数据契约,涵盖视觉观测、度量相机几何、描述、质量元数据、选择决策与溯源信息,同时将源数据处理与数据混合构建相解耦。 在共享的相机条件化、训练与推理接口下,我们基于Wan2.2、LTX-2.5和MiniMax-H3实例化了四个参数量为5B至33B的模型,同时保留其原生表征与优化目标。 统一的三阶段方案结合了双向适配、教师强制的自回归初始化与分布匹配蒸馏。 由此得到的因果模型在仅以5秒序列完成训练后,即可在从数分钟到数小时不等的推演中实现实时交互。 通过开源所得到的数据、流水线、方案、权重与框架,SolarWM为交互式世界模型研究提供了可复现且可扩展的基础。
评估LLM智能体对于指导其发展至关重要,然而这一过程已变得成本高昂得令人望而却步:前沿模型在智能体基准测试上单次运行就可能耗费数百至数千美元,且在迭代开发周期中这一代价会被反复支付。以往的研究工作以基准蒸馏为核心,减少了评估任务的数量,但并未降低执行每个保留任务的成本。在本工作中,我们引入早期结果预测(early outcome prediction),这是一条互补的效率优化路径,转而削减每个任务内部的成本。我们的关键洞察在于:智能体的最终结果往往在执行完成之前就能从其中间行为中明显看出。我们将该思想实例化为EarlyEval——一个轻量级框架,它训练一对基于行为、文本和参考答案特征的LightGBM成功与失败分类器,并在任一分类器越过校准后的置信度阈值时立即终止智能体运行,每步仅增加可忽略不计的开销。在SWE-bench Verified、TerminalBench和Toolathlon三个基准测试上,EarlyEval能够以89%-97%的预测准确率消除13%-26%的智能体执行步骤,并节省高达44.1%的输入token和29.4%的输出token,同时仅使各智能体的平均解决率产生一至两个百分点的扰动。
检索是现代搜索与广告系统的第一阶段,目的是从大规模物料全集中选取候选集,供下游排序与拍卖使用。近期研究日益借助大语言模型(LLM),通过查询扩展、数据合成与检索反馈训练来改进检索效果。然而,生成组件通常仅用于查询侧增广,最终匹配仍交由下游检索器完成。我们提出 CoGR——一种检索框架,其核心思路是直接训练 LLM 在查询侧与物料侧构建检索表征。每个生成器产出紧凑的关键词集合,并通过倒排索引直接完成匹配,从而保持与现有基于关键词检索基础设施的兼容性。CoGR 采用两阶段训练流程:监督微调先建立对齐的关键词空间,随后协同进化强化学习在对方侧索引保持冻结的条件下,以 GRPO 算法交替优化查询侧与物料侧生成器。双方共享相同的查询—物料检索 F₁ 目标:查询侧直接获得检索 F₁ 奖励,物料侧则获得反事实边际奖励,用以衡量其生成关键词所导致的查询侧 F₁ 变化。在 10 个具有代表性的稀疏、稠密与生成式基线上,CoGR 分别在内部 APP 应用市场数据集和公开 WANDS 基准上取得最佳性能,相对最强基线的 F₁ 提升幅度分别达到 10.9% 与 36.1%。进一步分析显示,训练过程中协同进化保持稳定,查询侧与物料侧关键词空间的对齐程度持续增强。
语言模型将大部分注意力集中在上下文的很小一部分上,却仍需读取整个KV缓存来找出少数几个关键token。如果用户在百万token的对话中询问此前的一个细节,全局注意力层在生成回复的每一个token时都必须扫描完整上下文。一种主流方法通过轻量级代理分数预先筛选相关token来缓解这一成本,但这种外在评分在每一步仍会产生O(N)的开销。我们采用一种内在方法,其出发点是一个简单的问题:模型自身难道不知道上下文中哪些部分是相关的吗?为此,我们提出声明式注意力(DA)——一种引导模型在思维链中声明其所需要关注的区域的协议,将生成过程划分为三种模式:<global>(完整上下文)、<focus>(特定区域)和<local>(仅最近的输出)。推理引擎像解析工具调用一样解析这些声明,从而跳过大部分KV缓存读取。在15项长上下文任务的零样本评估中,DA在现成模型(Gemma-4-31B、Qwen-3.6-27B)上显著减少了解码过程中被关注token的总量(分别减少52.0%和31.1%),准确率仅小幅下降(1.27个百分点、2.75个百分点),且下降幅度随模型规模增大而缩小。DA为稀疏注意力解锁了一个新的维度,在基于训练的方法下还有更大潜力,可供未来工作探索。
文本丰富的视觉输入要求模型能够在像素空间中直接读取、检索和压缩语言;然而,现有的像素文本编码器仍难以克服固定分辨率预训练带来的局限,并易受视觉捷径学习、视觉锚定不足以及多语言视觉文本理解困难等问题的困扰。在这项工作中,我们研究了实现稳健的视觉文本表示学习所需的基本设计原则。通过系统的受控消融实验,我们确定了四项关键要素:第一,可变的图像分辨率和渲染字体大小可为高分辨率文档泛化提供空间层面的代理信号;第二,自然图像-文本对是实现视觉锚定的基础,并能防止模型坍缩为仅依赖文本的模式;第三,布局感知渲染有助于抑制像素级捷径的习得;第四,两阶段多语言课程学习可实现有效的跨语言对齐。我们将这些原则整合为可扩展的训练方案,由此训练出 Pixel Linguist II——一种原生分辨率视觉编码器,其在 2.8 亿条训练样本上结合了动态渲染、统一对比式锚定与多语言课程学习。Pixel Linguist II 在英语、跨语言及多语言的 Visual STS 和 ViDoRe 基准上刷新了最优结果,并在 MLLM 的下游评测中带来更优表现。值得注意的是,Pixel Linguist II 在 80% 的视觉令牌压缩下依然保持稳健,展现出其在光学上下文压缩方面的巨大潜力。我们的代码与资源可在 https://github.com/Pixel-Linguist/Pixel-Linguist-II 获取。
大语言模型(LLMs)正越来越多地与外部环境交互,并在此过程中积累大量行为经验。然而,现有的智能体基准大多将它们作为固定策略进行评估,因此,智能体能否主动检验自身行为、评判由此产生的经验,并利用这些经验改进未来的决策,仍是一个悬而未决的问题。我们提出 S³Gym——一个通过三种相互耦合的能力(自我测试、自我评判与自我改进)来评估 LLM 自我改进能力的交互式基准。S³Gym 将宽松式探索与严格的留出式评估相分离,并在七个具备可执行环境验证器的文本游戏中实例化这一协议。我们评估了三种融入交互经验的路径:基于历史记录的上下文学习(History ICL)、以分数为条件的摘要记忆(Score-conditioned Summary Memory)以及参数训练(Parameter Training)。 实验结果表明,自我改进既非自动实现,也非整齐划一。上下文层面的经验提升了若干“模型-游戏”组合的性能,但最有效的路径在很大程度上取决于任务结构:当经验可以被压缩为可复用的策略性规则时,摘要更具优势;而当成功依赖于精确的、因状态而异的信息时,摘要往往不及原始历史记录。参数训练在某些任务上带来了显著提升,但在其他任务上则表现出不稳定的改进以及严重的负迁移。这些发现表明,仅仅识别出成功的行动并不足够;智能体还必须将反馈转化为可执行且可迁移的策略。S³Gym 为诊断这一过程、识别阻碍智能体将交互经验转化为可靠自我改进的瓶颈,提供了一个统一框架。
基于知识的视觉问答(KB-VQA)依赖于检索外部信息来回答涉及长尾实体的查询。然而,现有的检索流程主要采用CLIP风格的双编码器,其优先考虑表面视觉相似性而非实体级语义对齐。当语义相同的概念表现出较大的视觉差异,或不同实体在视觉上相似时,这种范式往往失效。为解决这一问题,我们提出KBMR——首个专为KB-VQA设计的基于MLLM的嵌入检索器。KBMR利用多模态大语言模型(MLLM)强大的自回归能力,将图像映射到能更好保持概念身份的语义空间中。为应对维基百科规模检索中噪声监督的挑战,我们引入了一种基于MLLM的语义判别器,用于生成连续的实体一致性权重。这些权重引导了一种新颖的连续语义蒸馏目标,从而在刚性二元标签之外实现有效的难负样本采样和软监督。大量实验表明,KBMR显著优于CLIP基线,在检索Recall@1上最高提升14.7%,在端到端VQA准确率上提升9.4%。代码已在 https://github.com/realHarryX/KBMR 公开。
多模态模型通常构建于为生成式视觉-语言建模而设计的架构之上,典型做法是将分别预训练的视觉编码器与因果语言模型相结合。视觉文档检索器(如ColPali)将此类模型重新用作编码器,从而在非生成式任务中沿用了视觉语言模型(VLM)的参数与计算开销。 我们提出NeoMME,这是一个包含260M与800M参数的多模态、多语言双向编码器系列,可在单一双向Transformer编码器中处理多语言文本和原始图像块。两个模型均以掩码离散扩散文本目标从零开始预训练;对于多模态样本,训练以可见图像块为条件。二者均支持16,384个token的上下文长度,足以编码多达两幅标准4K超高清图像。 为展示其下游能力,我们使用联合训练的稠密头部与后期交互头部对NeoMME进行微调。在ViDoRe v3基准上,由此得到的NeoMME-Retriever 260M以0.523的nDCG@10优于所有参数规模严格低于800M的被评估模型,而NeoMME-Retriever 800M达到0.556。在NVIDIA L40S上以统一的2048×2048图像输入尺寸进行测试时,NeoMME-260M的页面编码吞吐量约为ColModernVBERT的2倍。分层token池化与非对称量化可将后期交互多模态文档嵌入压缩255倍,同时保留基准nDCG@10的95%以上。我们将NeoMME贡献至Hugging Face Transformers,并在Apache 2.0许可下于https://hf.co/collections/Hcompany/neomme发布预训练骨干模型及检索兼容检查点。
紧凑的令牌序列对于高效的三维生成至关重要。然而,现有的三维令牌化器通常将潜在表示组织为空间区域形式或固定大小的全局令牌集合,这两者在压缩至极低令牌预算时都会出现严重的重建退化。在本文中,我们提出了ZipTok3D,一种专为从极短令牌序列中进行高保真重建而设计的三维令牌化器。其核心思想是将物体几何信息组织为逐步信息丰富的全局令牌前缀,并通过迭代解码展开这些紧凑表示。具体而言,嵌套丢弃法在编码后随机截断潜在序列,并要求每个保留的前缀都能重建出完整物体,从而将关键几何信息优先分配到前导令牌中。随后,解码器反复应用参数共享的Transformer模块,从每个前缀中恢复细粒度几何信息,而无需独立的生成式采样阶段。在相同令牌维度下,ZipTok3D在ShapeNet上仅需一个令牌即可达到与32令牌COD-VAE基线相当的重建质量,在TRELLIS上仅需四个令牌即可达到同等效果,分别使令牌序列缩短了32倍和8倍。
一幅图可能胜过千言万语,但大多数图像描述模型仅用寥寥数语来描述它。现代视觉语言模型能够生成流畅的高层次描述,却经常遗漏那些使图像在视觉上具备具体性的属性、数量、纹理、材质和空间关系。近期多阶段系统通过生成、分解、验证和重写等步骤恢复部分此类细节,但代价是推理延迟大幅增加。 我们提出SimLoss,一种用于单遍细粒度图像描述的无参考嵌入空间目标函数。SimLoss通过InfoNCE对比损失训练视觉语言模型,使其投影后的隐状态表示与冻结的图像嵌入对齐,从而在解码任何文本之前提供密集的视觉监督信号,且既不需要人工撰写的细粒度描述,也不需来自多阶段流程的伪描述。我们将其实例化为SimLoss FFT(通过本地可用的嵌入模型进行反向传播)和SimLoss GRPO(将该模型视为黑盒奖励)。 与单遍、多阶段验证、奖励优化及感知感知基线相比,全可微微调变体SimLoss FFT取得了最高的精确率,同时F1分数几乎与多阶段方法持平,并且保持单遍推理,运行速度约为多阶段流程的20倍。基于奖励的变体SimLoss GRPO则获得了最强的召回率。综合来看,这些结果表明,嵌入空间监督能够在单遍描述器的延迟水平下,恢复多阶段验证的质量。
基于可验证奖励的强化学习(RLVR)已成为大语言模型(LLM)后训练的一种强大范式,但其对粗粒度结果奖励的依赖导致对中间推理过程的指导十分有限。现有方法如过程奖励建模和在线策略蒸馏引入了额外约束,例如依赖专门的奖励模型,或假设教师与学生具有相同的推理模式。然而,我们观察到,一旦推理过程首次出现错误,对其后续推理的评估所能提供的额外信息十分有限,因为此时评估已基于一个无效前缀进行条件化。因此,我们提出Cliff,一种奖励塑形策略,利用现成的大语言模型作为教师来识别每次生成轨迹中的首个错误。由此,轨迹被自然地分解为两个部分:正确前缀和错误后缀。Cliff将该信号转化为词元级优势,对正确前缀赋予正向优势,并对其后的部分施加负向反馈。在12种不同场景下的实验表明,Cliff能够持续提升推理性能,相较于在线策略蒸馏平均提升15%,相较于标准GRPO平均提升7%,即使在教师模型能力有限的情况下亦然。此外,我们分析了“真值”在Cliff中的作用,并研究了其训练动态。这些结果确立了Cliff作为一种简单、通用且有效的方法,通过更丰富的细粒度监督来改进RLVR。
基于采样词元的在线蒸馏(OPD)高效地将能力从教师模型迁移至学生模型,其利用学生模型生成的词元,且仅需采样词元对应的教师概率。然而,该方法常遭遇多样性蒸馏失效问题:学生的pass@1提升,而pass@k却停滞不前,未能继承教师的多样性。为解释该现象,我们引入一阶局部熵影响(First-Order Local Entropy Influence),这是一种带符号的一阶代理指标,可将每次更新的熵效应解耦为师生对数概率差与学生局部概率结构两部分,并从经验上将熵收缩与负影响位置相关联。基于此,我们提出影响引导的自适应在线蒸馏(Influence-Directed Adaptive On-Policy Distillation, IDA-OPD):该方法不依赖成本高昂的全词表前向KL目标,而是保留熵增更新,同时用散度自适应优势收缩替代熵减更新,且仅使用教师对采样词元的对数概率。在面向推理的蒸馏实验表明,IDA-OPD一致性地提升pass@k,通过蒸馏继承教师的多样性,以严格更低的成本达到最强教师信息引导方法的性能,并在无需全词表教师信息的情况下广泛维持原始OPD的pass@1水平。
智能体性能由模型参数与负责管理上下文和控制流的可执行框架代码共同决定。单独优化其中任一组件,都可能让系统受制于另一保持冻结的组件,形成瓶颈:权重更新会改变哪种框架行之有效,框架更新则会改变模型展现出哪些能力。现有的联合自适应方法优化权重和文本提示,却让更广泛的框架保持固定。为此,我们提出权重-框架交替学习(Weight-Harness Alternating LEarning, WHALE),一种简单方法,交替执行两个阶段:先固定当前框架并更新模型,再在更新后的模型上搜索更优框架。这两个阶段分别由在线拒绝采样微调和 Meta-Harness 实例化。何时切换是关键的设计选择:为了将真实改进与噪声区分开,同时避免在另一组件不断变化时过度优化,WHALE 采用固定的阶段时长或基于训练信号的自适应耐心规则。在 SearchQA(搜索问答)、数学推理和国际象棋谜题三个领域中使用 Qwen3.5-2B/4B 智能体的实验表明,在最佳 mean@8 准确率上,WHALE 比仅权重、仅框架和 Fast-Slow Training 高出 4.15–24.38 个百分点。任一组件都可能成为瓶颈:在 SearchQA 中,框架搜索只需远少于仅权重优化的展开(rollout)次数即可达到后者的峰值准确率;但在数学任务上,框架搜索只有经过一次权重更新后才能提升准确率。此外,小步交错更新在准确率和展开成本上也优于先权重后框架的分阶段优化。代码已开源:https://github.com/krafton-ai/WHALE。
传统的说话人归属语音识别(speaker-attributed ASR)系统将语音识别和说话人日志(speaker diarization)视为两个独立的任务。近年来,VibeVoice-ASR 等端到端模型已将这两个任务统一到单一模型中。然而,现有的统一模型仍主要支持离线识别,难以满足实时语音助手和智能体的低延迟需求。为解决这一问题,我们提出了 VibeVoice-ASR-Streaming,这是首批基于大语言模型(LLM)的流式说话人归属语音识别端到端方法之一。该方法将固定大小的音频块、少量前瞻音频和先前文本交错输入,使模型能够在语音到达时实时输出"谁说了什么",而无需单独的说话人日志阶段。在转录准确率方面,我们的 7B 模型在五个评估集上取得了最低的平均词错误率(WER)/字符错误率(CER)。在说话人归属方面,该模型在 13 个评估设置中的 12 个上达到最佳或并列最佳。我们开源了 1.5B 和 7B 模型的权重以及推理代码。
历史报纸是公共生活的丰富记录,但其密集、不规则且有时杂乱的版面使得对这些材料的计算访问既具挑战性又十分有限。我们提出了机构报纸流水线(Institutional Newspapers Pipeline),这是一个我们与波士顿公共图书馆联合设计的模块化系统,用于从历史报纸扫描件中提取高质量、结构化的数据集。该系统的架构设计确保每个步骤保持可解释性和可定制性,同时整个流水线在计算上足够精简,能够在工作站级硬件上运行。该流水线对每份扫描件执行多步骤处理:将扫描件分割为独立的、不区分字体的图像块(crops),对每个分割结果执行OCR,随后对每个图像块进行文本分析、字体分类、阅读顺序检测、命名实体识别、主题分类、语言检测以及预计算嵌入的生成。我们对波士顿公共图书馆馆藏的一部分运行了该流水线,并将结果作为开放数据集发布。光学字符识别(OCR)输出涵盖163亿个o200k_base词元,来自8310万个独立图像块,这些内容提取自1795年至1930年间出版的1,473,635份公有领域报纸扫描件。本报告描述了我们在每个处理步骤中使用的方法、训练的小型模型,以及在此过程中收集的评估结果和数据集规模测量数据。本报告随流水线、模型和数据集的发布一同提供。我们将这项工作定位为向解锁数千万份报纸扫描件中的高质量数据迈出的重要一步。
竞技编程已成为检验大语言模型推理能力的关键测试,其中IOI和ICPC等国际竞赛代表了最具挑战性的场景。我们提出了一条端到端的专业化流水线,结合了大规模题目筛选、合成推理轨迹、监督微调(SFT)和强化学习(RL)。利用22,000道精选题目,我们通过SFT和RL训练了Nemotron-3-Nano-CC(30B-A3B),并仅使用SFT训练了Nemotron-3-Ultra-CC(550B-A55B)。我们进一步引入了GenCorrect,一种反馈驱动的测试时计算策略,能够迭代式地生成、评估和优化多样化解决方案。在IOI 2025上,Nano-CC在训练后从130分提升至291分,结合GenCorrect后达到468分,超过了438.3分的金牌门槛,而Ultra-CC则达到502分。在这些结果的指导下,我们开发了一个面向竞赛的Ultra-CC系统,并在IOI 2026期间进行了前瞻性评估。在与人类选手相同的时间、网络访问和提交限制条件下,该系统在600分中获得了535.4分,既超过了361.12分的金牌门槛,也超过了498.27分的最高人类选手得分。据我们所知,这是首个在IOI赛题集上超越最高分人类选手的AI系统。
长上下文大语言模型推理中,注意力预填充阶段的开销随序列长度呈二次方增长,使自注意力成为严重的计算瓶颈。传统稀疏注意力方法通过固定模式或离线分析来缓解这一问题,但缺乏对输入相关注意力结构的自适应灵活性。近年来,动态方法通过实时将注意力头路由至稀疏模式来应对这一挑战,但其依赖开销较大的间接路由代理,且其预算分配机制忽略了softmax后的质量层级结构。我们提出CRISP(悬崖感知的输入自适应稀疏预填充),识别并解决了该动态路由范式中的两个结构性挑战。首先,我们证明路由决策可以直接从代理注意力图的结构中读取。我们以结构代理C_struct取代基于Jensen-Shannon散度(JSD)的路由策略;C_struct在垂直-斜线兼容位置上度量质量分布,能够在复现JSD路由决策的同时,消除池化矩阵乘法及其后KL散度的开销。其次,我们对softmax后的质量悬崖进行了形式化刻画,并从理论上证明:在长上下文中,严格累积覆盖阈值会累积O(n)的背景噪声。CRISP通过一种基于噪声基底的汇感知阈值来规避这一问题。实验方面,在InfiniteBench、RULER和LongBench上对两个模型家族的评估显示,CRISP总体上是性能最强的稀疏方法,在检索密集型基准上达到甚至超越精确密集注意力;其检索任务表现相较基线最高提升28.0个百分点,在512k token下实现最高5.30倍的注意力加速——这主要得益于我们在选择过程中消除O(n)噪声的同时保持了结构完整性。
信息检索(IR)日益面向允许多元视角的开放式查询。然而,现有的 IR 基准主要聚焦于封闭式查询,即便是开放式基准,其查询所对应的支撑文档大多也局限于单一学科领域和单一模态。我们提出了 Multi³IR,这是一个基准测试,用于评估检索器如何覆盖跨领域、跨模态的开放式查询的多层面视角。该基准包含 104.9 万个 Stack Exchange 查询,每个查询都标注了用于刻画其隐含视角的视角描述。我们进一步提出了 SPIN,一种参数高效且标签高效的方法,通过学习噪声向量将嵌入引导至多样而有意义的语义方向。实验表明,现有的多模态检索器存在单视角偏差,而 SPIN 在 Multi³IR 上显著提升了视角覆盖率,并且能够很好地泛化到未见过的开放式 IR 基准。数据集和实验代码可在 https://github.com/seokwon99/Multi3IR 获取。
将研究论文忠实地转化为仓库级实现仍然充满挑战,因为论文通常仅在高层面上描述方法,对实现假设不做显式说明,同时要求生成的仓库保持方法逻辑、评估协议及跨文件的一致性。尽管论文到代码智能体(paper-to-code agent)近期取得了进展,但其中间输出往往呈现为自由形式的计划或摘要,下游编码智能体可能忽略、重新解读或压缩这些内容,从而导致算法简化及仓库结构不一致。为应对这些挑战,我们提出了PaperCompiler——一个论文到代码生成框架,能够将基于论文的证据编译为显式的仓库级实现规范。PaperCompiler在保留来源出处的同时锚定与实现相关的证据,并区分论文支持的信息、推断的信息、外部委托的信息及未解决的信息。由此生成的规范编码了非降级要求、归属分配、跨文件依赖及文件级约束。仓库生成在此类编译规范的指导下进行,同时保留对论文未限定的局部工程选择的灵活性。PaperCompiler在Paper2CodeBench上优于强基线模型,在基于参考的实现保真度上取得13.8%的相对提升(从3.64提升至4.15),并将高严重性评估批评从13.2%降至6.1%。
基于嵌入的代码检索是代码智能体和检索增强代码生成的核心组成部分;在此类任务中,检索到正确的代码比检索到词法相似的代码更重要。现有代码检索基准没有将“受控的、经过执行验证的单次编辑变体”植入搜索池——即对每条查询的标准实现进行一次编辑后得到的变体——因此,嵌入表示能否在功能层面区分正确代码与近似克隆但有缺陷的代码,这在检索场景中仍是一个悬而未决的问题。要解决它,需要一个其搜索池本身就包含相关反事实样本的基准:这些反事实样本是经执行验证的缺陷变体,与每个标准实现几乎完全相同。这样才能直接检验检索器的排序结果是在做功能判别,而非仅仅基于主题或文本同一性重叠。 为此,我们提出 ExecRetrieval。它包含 939 个 Python 任务,每个任务对应一个经执行验证的标准实现和至多四个经执行验证的缺陷干扰项;每个干扰项均由机械式变异生成,只做一次有针对性的编辑。我们在提供方原生调用方式下评估了 23 种稠密嵌入配置以及 BM25,并使用配对 McNemar 检验和查询级 bootstrap 置信区间进行分析。当搜索池中存在近克隆反事实样本时,表现最好的托管系统 exec@10 达到 1.00,但 exec@1 仅为 0.331;在四个领先系统上,当首位检索未命中时,91.5%–99.4% 的未命中结果就是配对的缺陷变体;并且在 67%–78% 的查询中,标准实现的得分低于其四个配对干扰项中的至少一个。完整数据集、执行预言机、嵌入矩阵、环境快照以及两两统计检验均已发布,详见附录 D 中的 URL。
大语言模型(LLM)正越来越多地被部署为编排器,通过自然语言协调专门的子代理来解决复杂任务。然而,在游戏对局和机器人等许多重要领域,目前可用的最强智能体并非语言模型。将非语言智能体与 LLM 集成需要语言化:即在每个交互步骤,将其丰富的连续表示压缩为稀疏的文本摘要。为了研究语言化是否会构成瓶颈,我们提出了 LLAMIA-Bench——一个包含六项多样化协作国际象棋任务的基准套件,涵盖行为模仿、状态评估和自然语言解释三个方面。每项任务都实例化了一个公认的国际象棋难题,而该难题单独靠 LLM 或单独靠国际象棋引擎都无法解决。为解决 LLM 与非语言智能体的协作问题,我们引入潜在状态内化:将子代理的连续表示作为学习得到的状态 token 直接投射到 LLM 的 token 流中,并在动作推进环境状态时进行动态重新编码。通过将内化与语言化集成进行比较,实验一致揭示出一种语言化债务:性能差距在训练过程中不断扩大,并在 LLM 从 4B 扩展到 14B 参数时持续存在。采用潜在状态内化训练的单一 14B 模型 LLAMIA,在所有基准任务上均能达到甚至超越任务专家和前沿模型,包括具备工具访问能力的 GPT-5.1;同时,它还能在任务特定微调模型失效的分布外场景中实现泛化。
移动AI如同一位视觉向导,使用户能够拍摄物体照片并获取相关信息。拍图问答检索已成为移动AI最常见的入口之一,然而照片往往模糊不清,文本问题也可能简短或拼写有误。现有基准测试仅在干净输入上评估,或未在拍图问答检索中独立验证配对鲁棒性。为此,我们提出SnapBench——首个面向鲁棒拍图问答多模态检索的配对基准,涵盖1,145个查询和9,085个候选集项目,覆盖53种受控损坏条件并包含人工标注。我们评估了16种多模态检索器,涵盖双塔编码器和基于嵌入的VLM。结果表明,图像损坏会显著降低检索性能,而文本损坏主要影响纯文本检索,对联合检索的影响有限。干净图像上的纯图像检索往往优于联合检索,揭示了粗粒度文本的拖累效应以及噪声输入下跨模态回退机制的缺失。SnapBench为拍图问答场景下的鲁棒检索评估提供了受控测试平台。我们进一步提出MOOR(模态锚定、离群值感知、最优重加权)——一种简洁的自适应融合方法,强调拍图问答检索中可靠性感知模态校准的必要性。
理解动物运动是动物行为与生物力学建模的基础,然而由于高质量运动数据的匮乏,该领域的进展远落后于人类运动研究。人类运动可以在受控环境中捕捉,但对于大多数动物物种而言这并不现实,由此产生的数据集规模小且局限于特定领域,制约了动画等下游应用。为应对这一挑战,我们提出了Kirin——一个从视频中重建运动、大规模学习运动先验,并生成可直接应用于动画资产的逼真运动的框架。利用大规模自然场景中的动物视频,我们重建了3D运动序列并配以文本描述,构建了AiM3D——首个为四足动物提供视频-文本-运动三元组对齐的大规模数据集。基于该数据集,我们开发了一种视觉引导的运动生成模型,以文本和图像为条件,引导生成跨多种动物物种的逼真运动。最后,通过利用现成的图像转3D模型,我们使用生成的运动自动为3D网格进行骨骼绑定与动画驱动,产出可直接渲染的动物动画。综上,我们的数据集与框架为大规模、文本与图像联合引导的动物运动生成与动画制作奠定了新基础。项目主页:https://kirin-ani.github.io/。
仅在文本和代码上训练的大型语言模型(LLMs)有时能生成绘制可识别图像的程序。然而,尚不清楚这是否反映了模型对二维空间布局的内部表征,还是仅仅意味着其具备将空间描述转化为代码的能力。我们引入了自回归马赛克(AM-Bench)基准,该基准将这些因素区分开来:首先,翻译任务以文字形式向模型提供一幅图像的完整几何描述作为提示,并要求其生成能产生该图像的代码;其次,布局任务要求模型根据一个不完整的提示来组合图像。在八个开放权重的仅文本和代码模型中,所有模型都能可靠地将指定几何描述转换为代码,但它们在开放式布局任务上的表现差异显著,这表明这些差异并不能仅用代码生成能力来解释。输出媒介消融进一步表明,模型所使用的表达接口或媒介至关重要:将程序化代码替换为原始SVG可提高所有模型的布局得分。最后,对模型激活的探测表明,模型在生成之前就已存在一个粗略的布局计划,但该计划仅反映提示词所隐含的布局。在生成过程中,模型跟踪不断演变的几何状态,而非执行一个最初固定的计划。总体而言,这些结果表明,纯文本LLMs中的二维空间性能同时取决于模型本身和输出媒介,且不能仅用代码生成能力来解释。
我们提出了FoldingAgent,一个智能体框架,能够直接从折纸演示视频中推断显式的参数化折叠程序。该框架利用预训练视觉-语言模型(VLM)的推理能力,并配备一系列专用工具,使智能体能够模拟几何变换、验证物理合理性、检索和比较视觉内容,以及评估自身的预测。为了将视觉内容转化为折叠程序,我们定义了一个参数空间,由纸张的几何结构与一组参数化折叠动作组成。与预测静态折痕图的模型不同,我们的智能体以顺序方式运行,并具备重新规划动作的能力,从而有效缓解多步折叠中固有的累积误差。我们的方法朝弥合人类折纸知识与计算方法之间的差距迈出了一步:前者主要通过非结构化视觉演示进行分享,而后者通常依赖结构化、参数化的表示,例如折痕图或可执行的参数化计划。我们在PurelandFold上评估了我们的方法,这是一个新整理的基准数据集,包含多种Pureland折纸视频,并附有真值几何与动作标签。结果表明,通过将VLM推理与一组专用工具及物理模拟相结合,我们能够成功地将非结构化视觉演示转化为可执行且物理上合理的折叠流程。
专业智能体任务往往依赖公共语料库中所没有的约定,但基准测试很少控制智能体能否访问这些约定。我们提出了一种知识门控的任务构建协议,将任务指令与一个紧凑工件相分离,该工件包含私有约定、参考表和实用算子。构建时的溯源、在提供与不提供工件两种条件下逐字节完全相同的任务指令、泄漏审计以及可执行见证,使得任务对工件的依赖变得明确且可检验。在十五个校准任务中,某一种前沿智能体配置在提供工件时取得68.0%的通过率,而在不提供工件时为0%;在其中一个任务上,即便提供看似合理但不正确的工件,五次试验的通过率也仍为0%。确定性求解器和规则语料库为结构化任务提供精确的真值;无法由单一可执行预言机检查的输出,则依靠具名的标准级评分量规来评估。经配置相对的校准筛选,我们保留了七个满足五次试验经验知识门控筛选要求的任务。这些实验验证了构建协议的行为,但并未证明所保留的任务能改善后训练。我们已在 https://github.com/DatagridsAI/Knowledge-Gated-Task-Construction 公开发布该任务套件的部分内容及配套工具。
模型压缩技术(如剪枝和量化)促进了大型语言模型(LLMs)的高效部署与加速。然而,近期研究表明,权重稀疏化方法(如SparseGPT)可能放大模型中已有的偏见,导致输出因提示中的人物线索不同而产生显著差异。在本文中,我们提出Debias-SparseGPT,一种结合表征去偏的训练后剪枝方法,该方法利用基于人口统计学对照输入定义的二阶项进行去偏。我们在多种生成式大型语言模型上对所提方法进行了实证验证。在各种模型和稀疏度设置(25%、50%以及结构化2:4稀疏)下,与SparseGPT相比,Debias-SparseGPT在保持模型困惑度和零样本准确率的同时,持续降低了剪枝引发的偏见。在最严格的2:4结构化稀疏模式(该模式对模型质量的损害最为严重)下,使用长上下文、内容丰富的样本扩充校准集,可进一步改善下游性能和公平性。总体而言,Debias-SparseGPT在保持稀疏模型计算效率的同时,推进了偏见-性能的权衡优化。
语言模型对下一个token的预测逐层形成,透镜方法通过将中间隐藏状态解码为token来追踪这一过程。然而,一次透镜读数既反映了隐藏状态,也反映了用于解码该状态的读出层(即去嵌入矩阵)。许多透镜是在某个语料库上拟合得到的;我们表明,仅拟合语料库不同的两个透镜,对相同的隐藏状态可能报告出不同的token。我们将这种依赖称为语料条件性。 为了在不依赖拟合语料库的情况下考察读出层结构,我们引入了稀疏读出棱镜(Sparse Readout Prism, SRP)。它仅利用读出层的权重对读出层进行分解,并将任意token的logit或logit差值表示为来自稀疏读出特征的贡献之和。这使读出特征成为透镜读数的一种新分析单元,揭示出可能被token身份所遮蔽的结构,并支持在token、上下文、层和透镜之间进行比较。 用SRP的稀疏近似替换原始读出层,比基于读出行间几何关系的六个基线中最强的一个,多重构了8.9—17.3个百分点的测试logit差值。对特征进行消融,会使logit差值按其特征的SRP贡献成比例偏移。尽管token读数随拟合语料库而变化,但主导的读出特征保持稳定。由于SRP在构建时不使用任何语料库,它为透镜分析提供了一个独立于拟合语料库的对照。
对话式推荐系统(CRS)通常需要特定领域的对话数据,而这种数据成本高昂、稀缺,且在新领域中往往无法获得。本文对零数据CRS引导进行了系统的实证研究:即从非对话信号(商品评论、元数据和用户-项目交互)中生成合成对话监督,而无需任何领域内的对话语料库。我们比较了两种基于信息论的选择策略——Jensen-Shannon多样性和Fisher信息,并跨越不同领域信号、模型架构、数据集和微调范式进行了评估。结果表明,基于领域知识的合成数据在性能上始终优于零样本提示和朴素合成基线;主动选择相比随机采样能提升数据效率;元数据和协同过滤信号均能提高选择质量;此外,在低资源场景下,合成数据可以优于稀缺的真实对话数据,并进一步与之形成互补。这些发现确立了非对话领域信号作为无需对话训练数据即可构建CRS的可行路径。代码可在 https://anonymous.4open.science/r/zero_data_crs/ 获取。
基于评分标准的强化学习通过依据实例特定的准则对回答进行评分,将强化学习扩展到了具有精确答案或基于规则的验证器的任务之外。然而,这使得奖励计算变得昂贵:训练过程需要反复进行评分标准的评判,通常依赖于专有API或参数量达70亿及以上的本地生成式大语言模型评判器。我们研究较小的语言模型是否能够作为高效且可靠的基于评分标准的评判器。为了使这一问题具有可度量性,我们构建了PointRubric和RaR-Science-Static这两个逐点评分式评估数据集,它们包含实例特定的准则和逐项满意度标签。我们比较了从小模型中提取准则级判断的三种方式:生成式裁决、是/否对数概率差值以及探针评判器。在两个数据集中,Qwen3-1.7B探针评判器在这些方法中取得了最强的准则级一致性,优于生成式和对数概率评判器。当将其用作GRPO奖励模型时,它使策略在RaR-Science评分标准上的得分从0.232提升至0.643,而8B生成式评判器基线为0.594,同时基线所需的奖励评判时间是其10.7倍。任务和领域迁移实验进一步表明,探针评判器在不同设置中能够保留准则级的奖励结构。
投资组合风险评估通常依赖于对跨资产收益协方差的可靠估计,而在短时期、高维度的面板数据中,这类估计难以获得。本文表明,企业层面的分布值特征反而能够提供投资组合风险的单边保证。在特征与系统性风险敞口之间以及敞口与收益之间的既有关联假设下,多企业Wasserstein-2离差可给出系统性投资组合方差的紧上界,并相应地给出标准化收益的界。加权成对松弛法产生一个在可检验条件下为凸的目标函数,且仅需边际波动率尺度,无需跨资产收益协方差。当企业特定松弛为零时,公共映射尺度会改变经认证的方差缩减幅度,但不会改变归一化配置,后者仅取决于观测到的信息几何。在2018—2022年的52家企业面板数据中,基于Qwen3-Embedding-8B新闻表示构建的配置在四种预先设定的封顶投资组合总体中位于样本内方差百分位数的0.69至1.33之间;等风险加权则位于21.1至28.6百分位数之间。相对于等风险加权的较低样本内方差排名,在所报告的冻结语言模型表示中同样成立。因此,该框架将分布值的企业信息转化为一致的风险界和一种可在无需跨资产收益协方差的情况下构建的可执行配置规则。
空间收益模型将交互矩阵视为给定,不对反馈进行解释。我们利用目标锚定的Wasserstein重心重建,从企业语言模型文章嵌入分布构建出一个无带宽场。通过二次暴露调整问题,反馈被映射为同行错位惩罚比率。对52家企业而言,由2018–2022年新闻冻结而得的该场,给出2023–2026年惩罚比率3.46(95%区间[2.89, 4.17]),且其条件拟似然高于等权重同行支持或对相同距离采用RBF加权的情形。重心场与新闻共现场的联合惩罚比率分别为2.33与0.86,对应的边界校准检验拒绝两者的排除设定。