每日精选AI研究论文及翻译
化学文献综述通常需要汇集分散在众多出版物中的具体发现,然而现有的文献检索系统主要返回排序后的文档列表。因此,科学家和AI智能体需要手动定位相关信息、验证其来源,并跨论文组装答案。我们提出AskChem,一种以主张为中心、支持跨论文化学检索的基础设施。AskChem将检索单位从论文转变为携带溯源信息的主张:每篇论文被转化为原子化、类型化的主张,每个主张都以来源DOI和逐字引用或明确的证据定位器为支撑。在这一共享主张存储之上,AskChem提供了互补的检索与综合结构:用于分层检索和浏览的稳定分面分类法、通过关系连接主张的证据图,以及将索引论文置于科学原理之下的探索性动态分类法。AskChem目前索引了来自147K篇论文的240万条主张,并提供网页界面,以及面向AI智能体的REST、SDK和MCP访问接口。在AskChem-Bench上,将GPT-5.5阅读器锚定于AskChem可达到100%的可解析DOI,而未使用检索时为88.3%,并且在五个测试系统中拥有最高的引用密度。AskChem已上线,访问地址为https://askchem.org。
GUI代理有潜力成为现有数字设备上的通用执行器。为推动其走向实际应用,我们设想这样的代理:能在真实设备上可靠运行、跨平台执行工作流、将GUI交互与命令行执行相结合、完成长时程任务、主动发起有用的服务,并以最少的人力投入自主提升能力。在这一愿景的指引下,我们提出Qwen-UI-Agent——一个以真实世界为核心的基座GUI代理,覆盖移动端、电脑操作、网页及DeepSearch环境。Qwen-UI-Agent将多样化的沙箱环境与大规模真实设备移动运行时相结合。其统一动作空间将GUI操作与命令行执行交织在一起,并在单次模型生成中输出批量动作。一个AutoResearch风格的数据飞轮利用代理来构建任务与环境、诊断失败并规划后续迭代。在线强化学习支持对超过100轮轨迹的训练,超过10,000个并发环境加速数据采集。一个轻量级封装层支持跨移动端和电脑的主动服务发起及有状态工作流。 在广泛的评测套件中,Qwen-UI-Agent在移动端使用基准上取得了最先进的性能,同时在电脑端和浏览器端任务上与前沿模型(包括Opus 4.8、Gemini 3.1 Pro和GPT-5.6 Sol)相比展现了具有竞争力的表现。在移动端使用中,其在MobileWorld上达到82.1%,在MobileWorld-Real上达到92.2%,在AndroidDaily上达到97.5%。在电脑端使用中,其在OSWorld-Verified上达到79.5%,在OSWorld-v2上取得40.0%的部分进展分数。在浏览器端使用和GUI定位方面,其分别在WebArena上达到73.6%,在ScreenSpot-Pro上达到81.5%。
近年来,AI智能体的进展日益将原生能力内化到其底层基础模型中,催生了多模态基础模型和大型推理模型。然而,智能体记忆仍主要通过外部模块实现,原生记忆能力在很大程度上尚未被探索。本文在这一方向上迈出第一步,提出记忆基础模型,赋予基础模型原生记忆能力。我们从两个视角形式化原生记忆:主干网络内持久且动态演化的记忆状态,以及通过模型计算自主存储和利用信息的原生记忆过程。我们表明,原生内存在架构、端到端优化和效率方面具有优势。基于这一形式化,我们提出Metis,这是记忆基础模型的第一个原型。Metis引入了一种新架构,为基础模型配备原生记忆状态,允许将历史信息压缩到模型中,并通过记忆注意力访问。我们构建了大规模记忆专用训练数据,并引入多种优化目标,通过中期训练习得这些原生记忆过程。Metis的在线记忆维护是无梯度的,记忆更新仅需一次前向传播。在推理时,所有学习到的模型权重保持冻结,而原生记忆状态通过标准前向计算自主转换。通过大量实验,我们表明Metis展现出原生记忆能力,并进一步对其优势、局限和行为进行了详细分析。为促进未来对记忆基础模型的研究,我们发布项目代码和模型检查点。
我们提出PhiZero——一个围绕物理语言构建的物理世界模型,其中物理语言是世界状态转移的一种紧凑离散表示。现有的物理世界模型通常直接在像素空间中预测未来视频,使底层世界动态隐含在高维视觉预测器中。受人类能够从视觉经验中抽象出预测结构、并将其组织为自然语言以进行显式推理的能力启发,我们通过自监督方式从野外视频中学习物理语言,并利用它显式推理物理世界如何演化。据此,PhiZero采用先推理后渲染的范式:它首先将未来世界演化推断为物理语言序列,再将推断出的转移渲染为视频。在生成与理解基准上的大量实验验证了PhiZero对物理一致的世界演化进行建模的能力。我们进一步展示了其在逼真且交互式世界建模、细粒度动作条件模拟以及零样本运动迁移方面的潜力。
递归自我改进(RSI)需要能够改进AI构建过程的AI系统(即AI4AI);机器学习工程(MLE)为研究这一能力提供了具体且可执行的测试平台。我们提出了OpenMLE,一个用于MLE中RSI研究的开源全栈系统,涵盖带执行反馈的可验证任务环境(OpenMLE-Gym)、算子学习(OpenMLE-RL)和长时程搜索(OpenMLE-Evo)。在这一技术栈上,我们将Frontis-MA1(35B)后训练为面向MLE的元演化智能体,使后训练和推理围绕四个原子程序演化算子进行对齐——起草(Draft)、改进(Improve)、调试(Debug)、交叉(Crossover):这些算子通过基于执行的监督微调(SFT)和强化学习(RL),在针对所有评估基准去重后的数据上进行训练,随后组合成长时程搜索,在单一循环中耦合学习与演化。在MLE-Bench Lite上,以单张RTX 4090(显存上限12 GB)每任务12小时为预算,Frontis-MA1(35B)借助OpenMLE-Evo在基座模型基础上将奖牌平均分(Medal Average)从39.39%提升至60.61%;使用OpenMLE-Evo-Max(基准无关的经验先验和异步搜索)时达到71.21%,超过GPT-5.5 + Codex,逼近GPT-5.6 Sol和2.8T参数的Kimi K3。在留出的NatureBench Lite上,两个组件均具有迁移性:固定框架时,换用训练后的模型将Match-SOTA从50%提升至70%;固定模型时,换用OpenMLE-Evo将其从20%提升至50%。我们发布了模型权重和完整的OpenMLE技术栈,以支持面向RSI的可执行AI4AI的可复现研究。代码:https://github.com/FrontisAI/OpenRSI
文生视频模型已取得了卓越的视觉质量,但由于场景的时间演化必须从高度压缩的文本提示中隐式推断,它们仍然难以生成物理一致的动力学。现有的思维链方法引入了中间计划或视觉状态,但这些表示通常不可执行或在时间上稀疏,限制了它们实例化和控制完整时空过程的能力。为解决这一局限性,我们提出了 VideoCoCo,一种智能体双引擎框架,其中可执行的 Blender 代码充当过程级思维链。给定文本提示,代码智能体生成一个 Blender 程序,该程序明确指定场景及其时间演化。可执行仿真引擎运行该程序以产生确定性的时空草稿,随后通过基于草稿条件的编辑,由生成式视频引擎将其转换为照片级真实感视频。这种分解将过程级推理与高保真视觉实现分离开来。为了使视频编辑器适配仿真草稿,我们构建了 VideoCoCo-3K,一个包含草稿-指令-目标三元组的精选数据集。VideoCoCo 将 OmniWeaving 基线在 PhyGenBench 上从 0.475 提升至 0.558,在 VBench-2.0 上从 52.18 提升至 77.88,在两个基准上均取得了最佳平均分数。这些结果表明,可执行代码为物理一致的视频生成提供了一种有效、可控且可检查的中间表示。
仅解码器语言模型将长期记忆与推理耦合在单一参数集中,使得难以独立扩展记忆容量。Memory Decoder引入了一个参数化长期记忆模块,但仅在相对较小的规模上进行了研究。在这项工作中,我们提出了大规模Memory Decoder,将记忆模型扩展到6.9B参数,并在300B词元上进行了预训练。在此数据规模下,索引与搜索的总成本使得标准的Faiss流程不可行。我们通过用于Faiss索引和检索的分布式流程,以及稀疏的、按批次加载的kNN分布,解决了这一瓶颈。在不同模型规模上,我们发现,将更多参数分配给记忆,相比单独扩展基础模型,能带来更好的参数-性能权衡。在17个基准测试上,将6.9B的通用记忆与Pythia-410M配对,将其平均得分从29.86提升到37.34,以总参数少39%的优势超过了Pythia-12B(37.24)。对于从0.6B到14B的Qwen3 Base模型,1.7B的领域记忆在每种规模下都将三个领域的平均得分提高了超过9分。总体而言,我们的结果表明,独立扩展预训练记忆为提升语言模型性能提供了一条更具参数效率的路径。
智能体视觉推理的根本目标在于提升多模态大语言模型(MLLMs)在复杂任务上的成功率,而非仅仅为模型配备一种看似精密却低效的推理范式。在本工作中,我们通过工具使用的两个关键维度重新审视智能体视觉推理:模式自适应性(Mode Adaptiveness, MA)与工具效应(Tool Effect, TE)。模式自适应性刻画了多模态大语言模型能否识别出工具真正必要的时机并据此调用工具,从而在避免不必要计算开销的同时,提升其在需要工具辅助的难题上的表现。工具效应则刻画了工具使用的实际影响:工具应当扩展模型在纯文本推理无法解决的问题上的能力,同时避免在模型无需工具即可解决的问题上引入额外错误。我们进行了全面分析以量化这两个性质,并通过实验揭示:现有的智能体视觉推理模型在模式自适应性上表现有限,且工具使用在难题上带来的收益,在很大程度上被其在模型本已能够解决的简单问题上引入的损害所抵消。基于这些观察,我们提出了Beacon,一种新型智能体视觉推理模型,其在整体性能、模式自适应性以及真实的工具驱动性能提升方面均表现更优。Beacon的核心在于强化学习阶段的“必要性感知自适应奖励”与“提示引导的能力扩展”机制,二者分别鼓励模型基于任务必要性进行自适应的工具调用,并强化模型在最具挑战性问题上的工具使用能力。在多个基准上的大量实验表明,Beacon在整体性能上表现优异,并在模式自适性与工具效应两方面均取得了显著提升。
检索增强生成(RAG)涵盖词法检索与稠密检索、基于图的索引以及智能体式搜索,但这些范式通常在不同基准上以单一语料库规模进行评估,导致其准确率与成本之间的权衡关系尚不清晰。为弥补这一空白,我们开展了一项受控研究,将语料库规模沿28个严格嵌套的层级进行变化,跨度约为450倍,同时保持查询问题以及一组固定的相关文档和对抗性文档不变。在统一的阅读器模型和统一的评判协议下,我们测定了官方准确率、构建与查询令牌数以及延迟。结果表明,存在一个随规模变化的交叉点,而非某种无条件的优胜方案。文件系统智能体在最小的共享层级上表现最佳,但其顺序式探索在基础语料库上消耗的查询令牌数高达39倍,且随着搜索空间的增大其有效性逐渐下降。在约1000万语料库令牌处,BM25超越该智能体,并在所有更大的共享层级上保持领先,在完整规模下优势接近20个百分点。BM25同时在没有基于LLM的构建的情况下锚定了帕累托前沿的低成本端点。稠密检索仍然高效但准确率较低,而基于图的RAG在达到部署规模之前便遭遇构建瓶颈,其可扩展变体在共享层级上仍落后于BM25。总体而言,语料库规模的增长日益有利于全局候选排序:词法检索是最强的可扩展默认方案,而智能体推理在排序发现之后使用效果最佳,而非替代排序发现。
在开放式领域中,大语言模型的训练缺乏可验证的奖励,使得任务偏好难以形式化为有效的监督信号。上下文可以传达此类偏好,但一旦被蒸馏到学生模型中,其提供的额外监督便十分有限,这促使人们探索随学生表现演化的上下文。然而,直接将演化中的上下文用作训练过程中的监督,会导致蒸馏目标不稳定以及分布相互冲突,因此需要相应的机制来稳定目标并降低冲突的权重。本文通过对反向KL目标进行分解来分析上下文的影响,并揭示了两个发现:学生模型被向着上下文条件化教师模型的几何平均进行蒸馏;同时,该目标包含一个冲突项,用于衡量这些教师模型之间的冲突程度。基于这一分解,我们提出Flux-OPD,一种在线策略蒸馏(OPD)范式,利用演化中的上下文作为训练过程中的监督,以捕捉开放式领域中的任务偏好。Flux-OPD将上下文条件化教师与无上下文教师之间的差异视为上下文差异信号,将其作为上下文修正注入无上下文教师锚点,并以冲突项为指标对这些修正的强度进行加权。在开放式任务上的实验表明,Flux-OPD优于现有的OPD范式,凸显了将教师监督与演化上下文相结合的潜力。
文本到图像及个性化编辑模型如今能够轻松合成高保真的单主体图像。然而,将多个具名人物置于共享接触动作(如拥抱、背负或扭打)中,仍暴露出重大缺陷:肢体融合、多余肢体出现以及身体相互穿透。现有评估大多忽视了这些解剖学和几何学问题,而“VLM即评判者”式的检查清单在交互维度上往往趋于饱和,尽管这些错误对人类而言显而易见。我们提出MPIE-Bench,一个包含2,500个样本的基准数据集,其样本源自视频挖掘的编辑三元组,涵盖405个场景、14种交互类别和四档接触密度(C0-C3)。同时,我们提出MPIE-Eval,其新增的两个评估轴通过冻结的公开多人体网格重建方法对接触时刻的几何质量进行评分。“解剖学”轴考察是否每一处类人体质量都能由一组完整重建的身体所解释,“交互”轴则考察这些身体之间的穿透程度和表面距离是否与指令所要求的接触相匹配。在十个编辑模型上的实验表明,网格解剖学得分在两种不同模型上最高仅为0.65,网格交互得分最高为0.72,因此没有任何单一编辑模型能在两个维度上均表现优异,而VLM检查清单对相同图像的评分却高于0.95。一项由五名评分员参与的研究证实,这两个评估轴均比零样本VLM评判者更贴近人类判断,并且在对所有权重和阈值进行消融后,排名结果依然保持稳定。
具身智能面临根本性的数据瓶颈。模型必须捕捉第一人称感知、全身运动、灵巧操作、物体状态、声音与触觉如何随着人类在时间推移中追求目标而协同演化。现有数据集将这种经验割裂于不同视角、模态或空间尺度之间,使得完整的感知-行动环路仅被部分观测。我们提出环境感知采集引擎(ACE),一个以人为中心的数据引擎,可将真实家庭环境转变为空间校准、时间同步的录制工作室。ACE 在两种互补尺度上运行:桌面级配置解析手-物操作,而房间级配置则捕捉带家具家庭环境中的全身运动、位移行走及交互行为。ACE 将第一人称与多视角外视角视频、全身与关节化手部运动、物体几何与六自由度轨迹、音频及触觉信号记录为统一的多感官数据流。利用ACE,我们构建了ACE-Data-0数据集,包含150小时、1700万帧视频,覆盖200个任务类别,由50名参与者在2个环境中执行,共计75,000个交互片段。该数据集涵盖原子操作、家务活动的长时程链条以及人-场景交互,同时通过目标级而非逐步指令的方式保留自然的行为变异性。我们进一步引入一个层级化基准,从信号逐步推进到场景组件,再进阶到交互。对现有最优方法的评估揭示了在接触、遮挡、自我运动及长时间跨度下的显著差距。ACE-Data-0提供了具有对齐的感知、运动学与接触监督的同步人类演示,为模仿学习、世界模型、视觉-语言-动作系统及具身AI提供了可扩展的基础。
角色扮演代理(RPAs)已成为大语言模型最重要的消费级应用之一。用户与RPAs进行多轮对话以获得情感安抚等体验,这使得可靠的评估对于衡量能力、比较系统及指导进一步改进至关重要。然而,现有基准通常要求RPA延续一段固定的对话历史,然后使用脱离用户的固定评估标准对延续内容进行评价。我们识别并通过实验证明了该设计的两个局限性。首先,RPA的输出受前序对话历史的影响,这使得在真实多轮场景中对其角色扮演能力进行具有科学依据的评估变得不可能。其次,用户体验在不同个体之间存在显著差异,而传统的固定评估标准未必与用户满意度一致。为此,我们提出PALATE(Person-Aligned LLM-Simulated-User Assessment with Tailored Evaluation,即面向个性化评估的LLM模拟用户对齐评测),一个基于用户模拟器的可扩展RPA基准。PALATE配备了一个包含300个角色档案的池子。其主评估训练五个每用户模拟器,并让它们基于预先冻结的角色档案面板与候选RPAs进行自由形式的多轮对话。除通用质量评估标准外,我们还构建了个性化评估标准以衡量用户满意度;在留出的标注数据上,个性化评估标准与人工判断的一致性高于通用评估标准。在对16个候选的主评估中,PALATE分别刻画了通用轮次质量、长时程会话能力和每位用户在由各候选共同构建的多轮轨迹上的个性化体验。由此,它产生对特定用户-RPA配对的可解释评估,而非将系统压缩为单一的、与用户无关的排名。
现有的视频字幕生成模型能够生成对视频内容的自然描述,但无法将局部视觉元素显式关联到多张参考图像上。我们提出了多参考图像引导的视频字幕生成这一新任务,该任务要求生成具有短语级参考定位的事实性视频描述,并为此设计了RefCaptioner——一个两阶段后训练框架。RefCaptioner将混合数据SFT与分层覆盖率折扣GRPO相结合,在保持通用视频字幕生成能力的同时,联合提升参考选择、短语级绑定、干扰项拒绝和跨参考一致性。为支持训练,我们构建了一个包含20,000个视频和171,354张参考图像的语料库。我们还提出了MRVBench基准,用于在真实世界视频和AI生成视频上评估字幕的事实准确性和多参考定位能力。实验表明,RefCaptioner在开源模型中取得了最佳的整体性能,同时在标准视频字幕生成基准上保持竞争力。人工评估进一步证实,其生成的字幕更受标注人员青睐,并且在使用开源和专有视频生成器时,能够实现更忠于来源的视频重构。
多模态大语言模型在推理过程中越来越多地使用草图、标注、工具和中间图像,但目前尚不清楚它们是否真正依赖这些视觉状态。现有基准测试既受限于任务集合覆盖范围窄或部分可通过文本求解的样本,也受限于评估方式仅关注最终答案而未诊断中间视觉状态如何生成、渲染和使用。我们提出See2Think,一个统一的评估框架,包含See2ThinkBench和视觉思维动作(Visual Action-of-Thought,VAoT)。See2ThinkBench包含1,200个开放式、依赖视觉的问题,涵盖12个任务类别,涉及2D结构化、3D场景和真实世界推理。VAoT在四种受控推理设置下记录文本思维、视觉动作、渲染状态及后续推理。通过对具有代表性的专有和开源多模态模型进行评估,我们发现视觉推理强烈依赖于模型和环境,没有任何单一设置能在各任务中持续占优。过程分析进一步表明,模型通常会选择相关的视觉操作,而忠实渲染仍是最明显的瓶颈,且高反馈采纳率并不必然转化为准确率的提升。在任务相关的扰动反馈条件下,模型表现出对视觉状态的行为依赖性,在受控干预中准确率下降超过10个百分点。
视觉语言模型(VLMs)越来越多地被用于具身智能体中,以解释视觉输入、推理空间关系,并基于该推理做出任务级决策。然而,一个根本性的能力错配依然存在:通用VLM能够推理整体任务,却往往遗漏决定成败的视觉细节;而专业视觉模型虽能捕捉这些细节,却无法将其转化为任务级决策。在本工作中,我们提出了SpatialCLI,一个教导VLM使用空间工具进行推理并逐步内化这些工具所提供的专业感知能力的框架。SpatialCLI分为三个阶段:(1)调用(Call)阶段将专业视觉模型作为空间工具提供给VLM,以增强其感知;(2)学习(Learn)阶段使用冷启动SFT和智能体强化学习来改进工具使用;(3)内化(Internalize)阶段将成功的工具使用轨迹言语化,从而内化专业感知能力。我们还引入了SpatialCLI-Bench,这是一个包含516个样本的基准,用于评估涵盖定位、分割、深度和位姿的组合感知能力。在MindCube上,SpatialCLI将Qwen3-VL-8B-Instruct从29.3%提升至84.6%(使用工具时),超过了使用工具的GPT-5.6 Sol(72.1%),同时在内化后无工具情况下仍保持73.8%的表现。
视觉生成日益需要高分辨率图像、长视频和多模态上下文,这使得全注意力的二次方成本变得难以承受。我们提出Chimera——一种具有原理性扩展策略的混合视觉扩散主干网络。Chimera在不使用位置编码的情况下,将文本、图像和视频令牌按单一光栅顺序流进行处理。它结合了具有O(N)复杂度的Kim Delta Attention(KDA)用于长上下文状态追踪、交错的多头潜在注意力(MLA)用于直接的全局交互,以及模态感知的短卷积用于局部时空上下文。稀疏混合专家(MoE)层在控制激活计算量的同时扩展了模型容量。为扩展这一异构架构,我们提出HeteroP——一种按模块划分的方案,根据每个张量的功能扇入和模型深度,在宽度和深度维度上迁移超参数。HeteroP产出一组一致调优的模型族,用于拟合Chinchilla风格的计算最优律,涵盖激活模型规模、训练令牌数量和图像-视频数据比例。在这些律的指导下,我们训练了一个具有20亿激活参数的110亿参数Chimera模型。实验表明三个结果。第一,以预训练扩散损失衡量,稠密主干网络的计算效率是对应的全注意力Wan-2.1 20亿基线的1.7倍,而完整系统达到7.3倍。第二,无需针对特定长度的微调,Chimera即可从5秒训练片段零样本外推至30秒视频,最后五秒的FID仅退化6.5%。第三,拟合的律表明,计算最优的图像预训练将计算量近乎均匀地分配给激活模型规模和训练令牌数量,而视频预训练在更高预算下则适度偏向模型规模。这些结果为设计和扩展高效长上下文扩散架构奠定了基础。
我们提出 ShadowDancer,一种面向交互式视频世界模型的任意动作、帧级控制的新方法。其障碍在于表示层面:现有接口要么对动作进行松散编码,将其如何展开留给模型自行即兴发挥;要么通过结构化信号进行精确编码,但此类信号只能服务某一类动力学且难以获取,因此在不同动力学之间实现精确控制仍然不可行。演示视频是天然的补救方案,可以逐帧指定任意动力学;然而,一段视频仅通过一种特定的外观来展示其动力学,即底层动力学的一个影子,因此从演示中学习到的动作难以迁移到新场景。ShadowDancer 通过两项关键创新解决这一问题:(1)影子对(shadow pairs),即在独立重采样的外观下重放相同动力学的视频对,并由我们的影子库(Shadow Library)大规模构建,从而使得某一动力学族可被精确控制当且仅当能够为其构建这样的视频对;(2)跨影子预测(cross-shadow prediction),即通过从一个影子预测另一个影子来学习动作;因此,配对过程中被重采样的部分在构造上被丢弃,而被保留的部分则成为动作,由此产生统一的动力学表示,驱动一个块因果(block-causal)世界模型。于是,任何演示片段都成为可复用的动作资产,无需动作标签、运动估计器或微调即可在新环境中重放。实验表明,在多样化的动力学族中,相比强潜动作(latent-action)基线和交互式世界模型基线,我们的方法在动作迁移和长时动作展开(rollout)上均有提升,在展开比较中平均盲测胜率达到 86%。视频结果见 https://ShadowDancer-1.github.io。
在线策略自蒸馏(OPSD)是改进推理语言模型的一种有前景的方法,但在实践中仍显脆弱:要使其可靠运行,往往需要大量的工程投入。我们识别出这一困难的根源:原始OPSD正是更广泛策略优化族中β=1的特例,其中β对锚定学生模型至参考策略的KL惩罚进行加权。这一等价关系将β从隐含固定为1的取值转变为可控的正则化参数,从而产生一种更通用的公式化表达,在接近参考策略与特权教师引导之间进行权衡。我们提出β-OPSD,并将其最优策略推导为参考策略与特权教师之间的几何插值。然而,直接使用强化学习优化该目标将代价高昂且方差较大。我们不直接优化强化学习目标,而是将其闭式解转化为蒸馏目标。每个β值沿参考策略到教师的路径选取一个目标,我们通过混合二者的词元级logits来高效实现。如此,低成本的蒸馏即可逼近高代价策略优化的解。回报归因(return-to-go)的信用分配进一步使词元更新与序列级目标对齐,同时保留OPSD的简洁性。在数学推理基准上的实验表明,β-OPSD持续优于原始OPSD,提升了优化稳定性与下游推理性能。我们的结果为从自蒸馏到策略优化再返回提供了一条原则性路径,且不牺牲使OPSD具备实用性的效率。
检索过往经验已成为增强大语言模型智能体的常用策略。然而,现有的大多数记忆增强智能体将检索到的经验视为要逐字重放的静态记录,无论其是否与智能体当前情境相符,都直接注入上下文。这种“重放”范式忽视了存储经验的抽象性与普适性同决策时所面临的具体且不断变化的状态之间的差距,常常导致负迁移。相比之下,人类很少逐字回忆过往经验;相反,他们会根据当前情境重组和调整检索到的记忆。受此启发,我们提出MemHarness框架,使大语言模型智能体能够基于当前情境主动利用并重构过往经验。在每个决策步骤中,统一策略模型会根据当前状态对检索到的经验进行评判与重构,在行动之前生成基于上下文的指导。这种重构能力通过GRPO的端到端训练自然涌现。在ALFWorld和WebShop上的实验表明,MemHarness显著优于纯强化学习基线和静态记忆增强基线,在分布外(OOD)场景中展现出较强的鲁棒性。此外,我们的分析表明,这种重构目标不仅防止了负迁移,还在训练期间起到潜在引导的作用,从根本上提升了智能体自身的推理能力。
母单执行是算法交易中的核心问题,其目标是将大额订单拆分为小额订单,同时降低执行成本。现有方法要么依赖事先设定的市场假设,而这类假设在实践中可能不成立;要么需要针对特定任务的训练,从而限制了其适应新场景的能力。为克服上述局限,我们首次对大型语言模型(LLM)用于母单执行进行了系统性研究。这将LLM在金融领域的应用从"交易什么"拓展到"如何执行"。我们提出PACE(Plan-Ahead Controlled Execution,前瞻规划受控执行)框架,这是一个分层框架,将母单执行分解为长视野规划与短视野执行两个环节,既不需要显式的市场假设,也无需针对特定任务的训练。在深圳证券交易所Level-1数据上的实验表明,PACE优于TWAP、Almgren-Chriss及基于学习的基线方法,比最强基线高出0.65个基点。行为分析揭示,LLM在执行决策上与人类投资者存在差异:较高的模型置信度预示着更好的绩效而非更差的收益,且模型倾向于提前交易而非拖延至截止时间。这些发现表明,LLM能够在执行决策中为人类交易员提供补充。
前向潜在世界模型预测动作如何改变场景,但仅通过昂贵的测试时搜索才能为期望变化恢复动作。我们提出 INTACT(INtent-To-ACTion,意图到动作),一种端到端 JEPA,将带动作标签、无奖励的轨迹转化为可部署的意图到动作接口。每次转移提供物理意图 z_{t+1}−z_t,而未来目标提供部署意图 sg(z_g)−z_t。该架构在局部与目标运动意图主干-输入图之间通过相同的四槽语法和共享参数保持同构,并通过由同一预测器诱导的动作法则语义(而非逐点潜在等价)在受支持的局部与目标运动意图族之间保持同构。INTACT 还提供从 RGB 证据到动作有效的潜在意图坐标、以及从意图族到其对应动作法则族的完整迁移。非对称端点梯度锚定物理后继并将未来目标固定为锚点,在不进行逐点潜在匹配或全局线性动力学的情况下联结表征学习与控制。所得坐标支持稳健的分布式动作法则:其条件均值可直接作为免搜索策略,同时采样仍可用于多样性或可选验证。在 LeWM 的四个官方任务上,单轮训练、零搜索模型达到 85.78%、100.00%、97.67% 和 97.89% 的成功率。以 Direct 计划为中心的可选局部 CEM 使用 384 个而非 9,000 个候选序列达到 96.86% 的宏观成功率,采样量减少 23.44 倍,同时较纯 CEM 提升 16.00 个点。一个共享的四任务编码器达到 89.39% 的 E5 Direct 宏观平均,并在每个任务上均优于联合训练的 LeWM;预测-专家动作族 kNN 以 r=0.954 跟踪 Direct 成功率。Direct 推理耗时 2.9–5.5 ms。
面向视觉问答的多模态智能体日益以多步轨迹形式运行,交织感知、检索与推理,然而评估仍主要归结为最终答案准确率。这一聚合信号无法判断正确答案究竟源于有依据的证据、语言先验,还是偶然的误差抵消。我们提出将多模态智能体轨迹视为一种溯源约束状态机:工具输出被规范化为结构化证据账本,作为轨迹状态;下游推理与决策断言仅可引用活动账本条目;锚定检查在实体与数值层面进行;修复以类型化状态转换的形式实现,若无工具生成的溯源则无法引入任何内容。我们将该设计实例化为LedgerMind(基于结构化证据账本的溯源约束多模态智能体推理),并辅以三层锚定协议、一个将推理深度与问题复杂度相匹配的自适应双路径调度器,以及一个具备形式化溯源非放大保证的事件触发式验证与修复引擎。我们利用LedgerMind针对最终答案准确率往往掩盖的四类反复出现的失败模式:无依据的中间推理、有引用支撑的实体幻觉(幻影锚定)、对简单查询的过度推理,以及修复时放大。在多个多模态推理基准和骨干多模态大语言模型上的实验表明,LedgerMind同时提升了答案准确率和轨迹级忠实性。
计算机使用智能体从自身行为所引发的改变中学习,因此训练这样的智能体需要可供其操作、破坏并重置的应用程序。其中最重要的应用往往需要登录且带有状态,于是合成环境便充当其替代品。近期的流水线可以批量生成此类环境,这使瓶颈从环境数量的多少转变为每个环境内部包含的内容。我们发现,回报来自三个特性:环境具备多少行为深度、是否针对智能体实际失败的交互,以及是否随模型一同改进。我们提出了 Echoverse,它将规格说明编译成有状态应用程序,其任务根据应用程序自身的数据库进行评分;同时提出一个协同进化循环,将每条带评分的轨迹读取两次:一次作为修复环境、任务及其验证器的依据,一次作为模型的训练信号。在十二个此类环境上训练后,一个 9B 模型在十四个评估划分上从 36.5% 提升至 67.1%,与训练它的、规模大得多的前沿模型相差在十四个百分点以内。我们依次考察了这些特性。在相同领域中,浅层环境把实际站点准确率压低到基础模型之下(从 80.0 降至 75.0),而深层环境则将其提升(80.0 升至 85.0,48.0 升至 65.0);对单个界面控件进行跨多种渲染的反复训练,能够迁移到留出的控件族和开放网络上;修复单个环境使基于该环境训练的模型从 16.2% 提升至 38.5%。这些环境同样可用作强化学习环境,其中,将基于数据库的验证器与稠密的逐步骤评判器相结合的奖励函数,把留出集得分从 58.8% 提升至 68.0%。我们发布了四个环境作为基准,包含其应用程序、种子数据和基于数据库的评分器。代码:https://aka.ms/echoverse
记忆对于长时程大语言模型(LLM)智能体至关重要,然而现有记忆系统主要保存交互内容,而非建模哪些智能体值得信任及其适用条件。这一局限在多智能体系统中尤为突出——中心模型可能无法直接验证看似合理或相互关联的对等体响应。我们提出Σ-Mem,一种在线可靠性记忆,它记录个体对等体的历史能力证据以及整个对等体集合中的对等体间关系证据。两类证据均以实对称状态维护,并根据决策后的正确性反馈进行更新。根据Weyl不等式,每次事件级更新引起的谱变化是有界的,从而无需重新训练底层模型即可实现稳定的在线自适应。Σ-Mem提供通用的写入—读取接口:同一记忆可用于中心模型的残差引导、无响应式对等体路由或可靠性加权投票。在五个Qwen系列模型上,Σ-Mem能够适应反事实的可靠性变化,并泛化至未见过的对等体和任务领域。在完整分布外(OOD)评估集上,直接记忆读取在性能上也优于多数投票和最佳固定对等体。此外,随着可获得更多正确性反馈,性能持续提升,表明Σ-Mem逐步积累了可操作的可靠性信息。这些结果确立了可靠性记忆作为基于LLM的多智能体系统中自适应协调的可复用基础。
Transformer通过单一的加性残差流沿深度方向传播信息:每个子层只读取最近的状态。注意力残差让每个子层通过一个学习到的softmax进行注意力操作,从而缓解了这一限制。然而,这种读取使用一个在整个宽度上共享的单一查询,因此每个特征子空间都必须通过同一个分布来读取深度历史。这种被迫妥协的代价随子空间在读取哪些层上的分歧程度而增长,且分歧随模型宽度增大。我们引入了多头注意力残差(MHAR):将路由查询重塑为H个按子空间划分的头,每个头对深度历史拥有各自的softmax。这种读取变为分块对角形式;重塑不增加任何参数,计算开销可忽略不计;H=1时精确恢复注意力残差。在基于Nemotron的去重退火语料库(经过质量过滤,且以STEM和代码为主)上从头训练后,MHAR在100M、350M和1B规模上的验证损失改进分别为-0.061、-0.149和-0.140。四种方法中,它在所有设置下均取得最佳结果,且增益从100M到更大规模不断增加。头数是一个真实的设计维度,而非一个可自由调节的旋钮:验证损失关于H呈U形,在不同规模上都在H=4或H=8处具有平坦的最优点。我们为大模型采用H=8;超过这一点的过度拆分(H=16)始终会损失一部分增益。对训练后查询的直接探测证实,学习到的子空间分歧是根本驱动因素。融合的Triton路由内核将注意力残差训练吞吐量从基线的0.2–0.5倍提高到0.55–0.88倍,同时保持接近基线的峰值显存。一种使用Δ注意力残差的保持恒等映射的转换支持8B模型的中途训练,在GSM8K上带来+3.2、在GPQA上带来+3.1的提升。
由AlexNet开启的深度学习革命告诉我们,端到端训练优于将问题分解为手工设计的阶段。然而,生成建模始终是个例外——尽管生成模型能力卓越,它们仍未实现端到端训练。其根本原因在于,生成建模的核心是处理具有众多模态的分布,而现有可扩展方法处理这一问题的方式相同,即通过分解生成过程,这阻碍了端到端生成。在本工作中,我们提出了探索式建模(Explorative Modeling),一种全新的范式,它转而分解训练循环:在模型生成与数据之间探索K个候选匹配,并基于最优匹配进行训练,从而使预测致力于模态而不是模糊它们。我们发现探索式模型(XMs)在两种场景下具有实用价值。首先,增加探索为现有生成模型在参数和数据之外增添了第三条预训练轴——在此轴上,扩展探索在连续域和离散域(图像、视频和语言)中均能单调地提升性能。值得注意的是,探索带来的收益随规模扩大而增加:随数据规模扩展,收益从7%攀升至36%;随模型规模增大,收益从13%提升至23%;在3倍计算量下,效率增益翻倍以上。具体而言,探索将FLOP效率提升4.1倍,样本效率提升6.2倍,参数效率提升47%,将最强图像生成方案在ImageNet上提升至近乎最先进的1.43 FID(无引导),使现有模型的端到端化程度得以扩展,并解锁了规模化泛化。其次,XMs实现了端到端重构式生成建模,在控制任务上以16-256倍更少的推理步数即可媲美扩散模型。综合这些结果,XMs既确立了作为现有生成模型新预训练轴的地位,也确立了一种独立的端到端生成建模范式。
已部署的大语言模型(LLM)智能体日益将其长期记忆以文件系统的形式存储:一个由Markdown文件构成的目录树,智能体通过通用文件工具自行读取、写入和重新组织。然而,研究在很大程度上忽视了这一介质:先前的系统设计定制了专门的记忆表征,并研究针对这些表征的检索,从而使得默认方案的两个工作假设未经检验——智能体能否在记忆不断积累、冲突和过期的过程中始终保持不断增长的记忆库有序组织,以及这种组织化能否带来回报。我们首次对基于文件系统的LLM智能体记忆进行了系统探索。我们将该场景形式化为围绕一个记忆文件系统的三个角色:管理智能体整合并组织传入的内容,搜索智能体以带引用的来源回答查询,执行智能体提供被提炼为技能的任务轨迹,从而在单一存储中统一了陈述性记忆与技能。在长对话基准和具身任务中,我们变化记忆形态(智能体组织的层级结构、逐字转储、分块检索)、数据流规模、工具框架(沙盒shell、记忆工具式函数、多种搜索工具)以及管理智能体和搜索智能体的能力,并在记忆增长过程中追踪答案质量、成本和存储健康状况。组织化所稳定带来的是搜索经济性:在材料规模较大时,有组织的存储使检索成本大致减半。然而,当今的智能体未能兑现默认方案的承诺:在我们的增长研究中,除最强的管理智能体之外,所有智能体的组织化程度都在退化,而且没有一个我们评测的智能体能够将组织化本身转化为更好的答案。此外,模型并非影响存储形态的唯一杠杆:仅更换工具集就能像更换模型一样显著地重塑存储形态。这项研究将文件系统默认方案从一种假设转变为智能体记忆的设计空间。
推测解码(Speculative Decoding, SD)通过允许轻量级草稿模型提出词元,并由更大的目标模型并行验证,从而加速大语言模型推理。近期方法引入有损验证方案,通过放宽严格的分布匹配来进一步提升效率。然而,这种放宽会悄然改写解码分布,由此带来的加速可能以不稳定的、有时甚至严重退化的生成质量为代价。在本工作中,我们对有损验证方法所诱导的分布进行了原则性分析。我们表明,许多看似不同的方法仅在表面上有所区别,可归类为两种类型:基于截断的验证和协作验证。我们进一步在精选基准上构建了诊断评估框架。对于基于截断的方法,我们发现了一个根本性陷阱:由于分布扭曲,其性能相较于真实的截断采样基线可能显著下降。对于协作验证,我们揭示了一个关键原则:控制草稿概率相对于目标概率的过冲(overshoot)对防止低质量输出至关重要。我们的代码可在 https://github.com/ZhouYuxuanYX/Fast-HSD 获取。
Deep Research智能体将基于LLM的助手扩展到涉及规划、检索、证据综合和报告生成的长周期工作流中,但它们在开放信息环境中的可靠性仍未得到充分探索。一个关键问题是,在此类环境中遇到的看似可信但事实上具有误导性的知识是否能够通过这些工作流传播,并在最终报告中被采纳为错误结论。为研究这一失效模式,我们提出MisKnow-Agent——一个用于构建和验证Deep Research任务中误导性知识的框架。MisKnow-Agent以可控的权威级别和风格生成误导性实例,基于DeepResearch Benchmark任务产生5,933个质量受控的实例。对开源和闭源Deep Research智能体的大量实验表明,即使仅接触少量误导性知识,也可能导致最终报告采纳错误结论,揭示了当前Deep Research智能体中普遍存在的可靠性漏洞。尽管具备搜索能力的验证模型在聚焦语料验证过程中一致地将保留实例识别为误导性,但在长周期研究过程中,相同实例仍可能被采纳,这揭示了聚焦验证与工作流级证据使用之间的脱节。最后,我们评估了研究前与研究后的防御措施,包括单独及组合使用,发现所有三种配置均能缓解但无法完全阻止错误结论的采纳。我们的研究结果表明,可靠的Deep Research需要在模型层面和框架层面同时具备证据验证与纠正能力,而不仅仅是提升规划、检索、证据整合或报告生成能力。
本文提出了 AI Tour Meeting,这是一个由多个基于大语言模型(LLM)的智能体驱动的群体旅行规划框架。这些智能体以不同的角色设定实例化,并通过自然语言讨论协作寻找满足各自约束和偏好的行程。该框架通过提供配置智能体角色、讨论工作流、监控及 LLM 部署的接口,实现了对此类讨论的轻松灵活编排。其主要用例是作为仿真工具,用于分析多个 LLM 智能体在旅行规划讨论中的行为。本文通过展示系统验证以及由该框架获得的若干分析结果,论证了该框架的实用性。
现有的面向全模态大语言模型的token压缩方法通常依赖单一模态来决定另一模态中应保留的内容。我们证明这一假设经常失效:对于同一查询,音频和视频的相关性往往在不同时刻达到峰值。这种跨模态显著性不匹配使得单向引导在激进压缩下容易丢弃回答关键线索。我们提出OmniScope,一种免训练的token压缩框架,以查询作为共享语义锚点,同时分别评估音频和视频的相关性。OmniScope分配模态特定的token预算,采用锚点-增量策略修剪视觉token,既保留全局上下文又保留时间变化,并在每秒内合并音频token以减少冗余同时维持时间连续性。在四个音视频基准测试和两种Qwen2.5-Omni模型规模下,OmniScope在所有压缩设置中均取得最佳平均准确率。在整体token保留率为25%时,它实现了高达3.53倍的预填充加速和超过15%的GPU显存减少,平均准确率仅下降0.35个百分点。这些结果表明了一个简单的OmniLLM推理设计原则:跨模态共享查询,但不共享显著性估计。代码可在https://github.com/MAC-AutoML/OmniScope获取。
本文提出了公平剪枝(Fairness Pruning),一种轻量级结构性干预方法,旨在用于大语言模型(LLMs)中人口统计偏差的管理与未来缓解。作为对该方法的初步实证验证,本文聚焦于因果偏差定位。通过使用最小对比提示对和推理时激活捕获,该方法能够识别GLU架构中在加工人口统计属性时产生差异性反应的神经元,并在down_proj输入处评估信号。实证评估在高达30亿参数的模型(Llama-3.2系列与Salamandra-2B)上进行,结合了标准化基准评估与定性文本生成实验。结果表明,将识别出的神经元置零会改变模型对相关人口统计变量的响应方式。然而,干预并未产生平坦化的缓解效果,而是引发了双向偏差失稳:由于BiasScore是无符号的,候选集混合了分别推动刻板印象增强与减弱方向的神经元,而聚合偏差的净效应取决于何种符号占主导。该干预极具外科手术式精度:在Llama-3.2-1B中至多置零40个神经元(不到总MLP宽度的0.031%),即可在推理和通用知识能力上实现99.49%的平均保持率。这些发现从经验上证实,人口统计偏差加工与模型能力运行于可分离的回路之上,从而为从盲目置零转向定向行为调制奠定了方法论基础。
强化学习(RL)搜索智能体通常将检索建模为自由形式的自然语言查询生成,并利用最终答案奖励来优化多轮交互。现有研究主要通过更密集或更结构化的信用信号来改进训练,但很少考察检索在策略-环境接口处是否得到了恰当的形式化表述。我们在Search-R1训练过程中观察到明显的检索混叠现象:同一问题的不同轨迹持续生成不同的查询字符串,但其累积的证据集却日益重叠。我们将这一现象称为检索等价坍缩;在此状态下,轨迹在检索决策上趋近于效用等价,使得组内回报缺乏有效的检索对比度。为解决这一问题,我们提出了Harness-G——一种重新设计该接口的图结构检索框架。它将自由形式查询生成重构为有限动作选择:策略选择一条证据句子或实体,或选择作答;环境则负责构建选项菜单、跟踪检索状态,并对每个选择进行验证和执行。该接口减少了语言混叠,并使同一状态下的备选动作之间可直接比较。在此接口基础上,我们引入了结构化非近视信用分配(Structured Non-myopic Credit, SNC),它使用冻结的答案评分器将所选动作与其备选动作进行比较,并将下游收益分配给促使这些收益实现的先前动作。在六个问答基准上,Harness-G在两种评估的模型规模下均取得了最高的平均F1值,分别比最强基线Graph-R1高出10.74个百分点(1.5B规模)和3.98个百分点(3B规模)。
稀疏混合专家(MoE)语言模型将每个token路由到多个专家,这提示了一个关于其优势的几何解释:共同被选中的专家应当贡献不同的表征方向。已有证据往往将路由一致性、候选质量和候选-上下文交互混为一谈。我们通过专家子空间分离指数(ESSI)、匹配路由残差和前缀控制的2×2因子设计来区分这些量;并通过冻结路由干预和受控Top-k研究来评估其功能价值。三组配对对比构成了研究发现的核心。 第一,在六种MoE架构中,专家子空间存在实质性重叠,但实际路由对token表征的解释优于匹配的替代方案。第二,在OLMoE、Mixtral和DeepSeek的39个因子设计单元中,所选候选在每个单元中对残差表征的解释均强于最强的未选中竞争者,然而实际前缀在所有单元中均收窄了这一优势:所有交互作用均为负值,且每个95%置信区间均低于零。第三,这种几何上的收窄并不意味着功能冗余:在39次冻结路由比较中,增加后续专家改善了其中24次的下一个token预测,其余15次估计不具结论性;一项受控训练研究在三个随机种子中也一致倾向于Top-2优于Top-1。我们将这一联合模式称为一致性重叠:路由从共享的几何邻域中选择与token相关的专家,同时,多专家计算的有用性在不具有不相交线性覆盖的情况下得以持续。区分这些量有助于阐明为何几何相似性本身无法决定冗余性或剪枝价值。
设备端语音情感识别(SER)对实时应用至关重要,然而在SER任务中表现优异的大型自监督模型对边缘设备而言成本过高。多教师知识蒸馏可将其压缩为轻量级学生模型,但仍面临两个挑战:教师可靠性在不同批次间存在差异,且logit级蒸馏忽略了样本间的关系结构。我们提出自适应多教师关系蒸馏(AMRD)以同时解决这两个问题。在每个教师的logit相似度矩阵上应用单类支持向量机,分配逐批次权重以偏向更一致的教师。关系蒸馏损失对齐教师与学生模型的相似度矩阵,捕获logit匹配所遗漏的结构信息。在IEMOCAP和CREMA-D数据集上,跨四种学生架构的实验表明,AMRD在大多数设置下优于单教师蒸馏基线,且消融实验证实两个组件能带来互补的性能提升。
在我们此前的工作《行人原型》中,我们将行人原型定义为能够唯一识别特定类型行人的行为集合。第一篇论文提出了12种行人原型,包括漫游者、醉汉、分心者、闪现者、犹豫者、盲行者、结群者、乱穿马路者、老年人、儿童、多事者以及驻留行人。引入这些原型是为了超越单一行为标签,从而以更自然的方式描述危险行人在真实交通场景中如何逐步表现出危险行为。然而,在对YouTube行车记录仪视频进行进一步标注后,我们识别出另外7种行人原型,它们与先前提出的原型在行为上存在可观察且显著的差异。这些新原型捕捉到了原有分类体系无法完全解释的行人行为模式。在本预印本中,我们介绍每一种新原型,定义其必要行为与可选行为,说明其与先前提出的原型之间的区别,并提供展示该原型实际表现的视频帧证据。