每日精选AI研究论文及翻译
对话系统(例如双工语音语言模型,SLMs)仍缺少一个流式、准确且富有同理心的记忆系统作为其灵魂。我们提出 VoiceMem,一个简洁的记忆架构,包含并行的信息型左脑、情感型右脑以及流式记忆输入/输出机制。我们进一步构建了一条完整的流水线,涵盖记忆感知的 SLM 训练、长时程评估以及支持可替换记忆后端的解耦部署。实验与真实部署表明其三大优势:i) 准确性:在前 5 检索条件下,左脑相比 Mem0 等经典系统在前 200 检索时领先近 30 个百分点;ii) 情感与个性化:右脑通过短时程与长时程情感归因以及双节点人格建模,在三个人格基准上达到最先进水平,并在综合评分上较此前最优系统提升 4.29 分;iii) 实时与低成本:VoiceMem 在 134 ms 内完成检索,完全处于标准 VAD 延迟范围内,在不引入额外对话延迟的同时保持了高准确率与低成本。这些结果表明,VoiceMem 为实时、个性化且具备情感感知能力的语音交互提供了实用的记忆基础。
近期研究表明,视频生成模型可以通过生成的帧展现出某种形式的零样本视觉推理能力。然而,可靠的评估仍然具有挑战性:基准测试应采用与当前视频模型视觉先验一致的输入,需要有效的演化过程而不仅仅是合理的最终状态,并且需要校准任务难度,使其既具有挑战性又部分可行。为此,我们提出了VGI-bench,包含27个任务和810个实例,通过任务领域和技能标签的两级分类体系来组织,用于对视频生成模型的视觉推理能力进行细粒度评估。我们的评估表明,当前的生成系统可以解决一部分基于视觉的推理任务,但远未达到可靠的水平,即使是最强的模型Seedance 2.0,在我们的评估标准下也仅达到51.0%。我们进一步分析了输出失败模式、输入条件敏感性、合成微调的性能迁移边界,以及内部去噪视角所揭示的有限自我修正能力——后续步骤主要是在优化早期假设,而非纠正推理错误。我们希望VGI-bench能够推动下一代视频生成模型的发展。网站:https://hexuan21.github.io/VGI-Bench/
科学智能体日益能够分析数据、执行代码并产出研究工件,然而大多数基准测试仅关注最终答案、孤立程序或单一领域。我们提出FrontierChallenge,一个包含300个端到端科学工作流的跨领域基准。本文发布并评估了其中97项任务,涵盖量子化学、分子动力学、材料表征、分析化学、生命科学以及电化学/环境领域。每项任务提供固定输入,并规定一组必需的科学交付物。我们使用三种智能体脚手架评估了十二个前沿模型。通过率(Pass Rate)衡量满足完整完成标准的任务比例,而平均分(Avg. Score)则捕捉部分进展。每个性能最优的配置仅完成了97项已发布任务中的20项,通过率为20.6%。在分析化学和电化学/环境领域,部分进展尤其难以转化为完整交付:平均分分别达到87.6和94.9,但最高通过率仅为4%和0%。在未通过的Claude Code轨迹中,仍有75.5%以声称完成的语言结尾。这些发现表明,无论是高分部分得分还是自信的完成声明,都无法可靠地表明科学任务已被完整交付,凸显了对端到端工作流执行与科学交付物完整性进行联合评估的必要性。
大规模并行仿真改变了离策略强化学习(RL)的训练数据体制,这给为数据受限回放设计的稳定器带来了挑战。通过跨越八个基准家族的受控实验,我们证明这些稳定器具有数据体制依赖性:参数归一化在回放覆盖范围较窄时有所帮助,但在数据充裕时限制了价值拟合;而裁剪双Q在高吞吐操作中可以放宽。年龄偏置回放加权在不同体制下均能提升学习效率,尤其在网络容量有限时效果显著。 基于这些发现,我们提出了WarpSAC——一个具备体制感知能力的离策略RL算法家族。WarpSAC采用样本权重衰减(Sample Weight Decay)实现高效利用,并提供两种变体:面向数据受限CPU规模训练的WarpSAC-L(归一化开启,裁剪双Q)和面向数据充裕GPU并行训练的WarpSAC-A(归一化关闭,单Q)。WarpSAC在九个CPU规模环境中将归一化得分-步数AUC较FlashSAC提升了4.5%,在十四个GPU并行环境中提升了23.1%。它将UnitreeG1TransportBox-v1的成功率从19.8%提升至96.4%,在MuJoCo Playground上将平均归一化墙钟时间AUC提升了19.1%,并在Unitree G1上实现了比FlashSAC快36.4%的仿真到现实部署。这些结果表明,可扩展的离策略RL应根据可用的数据体制调整其稳定器。
智能体的能力并非仅由模型本身决定。智能体框架(agent harness)涵盖记忆管理、规划策略、动作协议以及工具/技能编排,其对整体能力的贡献可能远超底层基础模型。然而,框架设计仍依赖人工、针对特定任务,从根本上缺乏可扩展性。我们提出了JIT-Agent,一个框架智能模型,经过训练可为任意开箱即用的智能体大语言模型即时合成任务自适应的智能体框架。我们将智能体框架形式化为一个可组合、机器可生成的构件,由固定的四模块协议约束,并训练JIT-Agent针对手头任务定制框架、修复框架以确保稳定可靠的执行,以及通过从不断扩展的历史框架配置库中蒸馏性能信号来实现自我进化。配备JIT-Agent作为框架助手后,DeepSeek-V4-Flash在DeepSearchQA(+9.1)和OdysseyBench(+4.3)上超越了GPT-5.6,而本就强大的GLM-5.2也获得了最高+20.2分的提升。在受控评估中,JIT-Agent生成的框架在性能上与OpenCode和Claude Code等成熟的智能体运行时不相上下,并能持续提升DeepSeek V4、Mimo-V2.5和Qwen3.6等多尺度模型系列的表现。据我们所知,JIT-Agent是首个专为即时框架生成而构建的模型,确立了框架智能作为智能体能力的一个可训练、可迁移且可叠加的维度,与模型扩展相互正交。
原生视觉推理将视觉生成本身视为推理的媒介:视觉状态(即图像和视频)不仅是待理解的输入或待渲染的输出,更是超越语言的、用于问题求解的一等基板。然而,该领域的发展仍受制于可扩展训练任务、可靠反馈以及跨生成基板的受控比较的缺乏。在本工作中,我们提出VBVR-Pro,一个闭环测试平台,使得通过生成进行原生视觉推理变得可训练、可验证、可优化且实验可控。1)任务扩展。VBVR-Pro将视觉推理转化为一个包含300个程序化生成任务的受控任务空间。在VBVR-Pro上训练的模型在七个外部视觉推理基准(如RISE-Video、MME-CoF-Pro和BabyVision)上展现出超越所提套件的强迁移能力。2)可验证奖励。VBVR-Pro为基于任务的评估提供可验证的奖励评分器。通过对主流多模态大语言模型作为评判者的系统研究,我们识别出当前盛行的VLM-as-a-judge范式中反复出现的失败模式。相比之下,所提出的评分器基于确定性的、任务特定的规则,能够与人类判断实现细粒度对齐。重要的是,它们可作为大规模多任务强化学习的可靠奖励信号,并在视觉推理任务上展现出更强的强化学习后性能。3)机制研究。VBVR-Pro支持跨30余种图像、视频和交错生成器的受控模态研究。我们的分析表明,视频生成在需要持续时空状态追踪的任务中仍然最为强大,而交错生成提供了一种计算高效的替代方案。至关重要的是,消融实验与探测分析提示了视觉原生轨迹的存在,这些轨迹对视觉推理至关重要。我们发布全部数据、模型、评分器及代码。
多教师在策略蒸馏(MOPD)通过最小化学生自身生成的轨迹上各领域的反向KL散度,将多个领域专家教师的知识蒸馏到单一学生模型中。现有方法通常在训练前固定各领域的数据混合比例,却忽视了不同领域收敛速度存在显著差异:有些领域早早进入平台期,而另一些领域在整个训练预算内持续提升。固定的混合比例因此既在快速收敛的领域上浪费算力,又对收敛较慢的领域训练不足。针对这一问题,我们提出D³-MOPD(面向MOPD的动态领域调度,Dynamic Domain ScheDuling for MOPD)——一种零开销调度器,直接复用训练过程中已产生的各领域反向KL信号,在线调整领域混合比例。调度器在训练进程之外异步运行,定期追踪各领域的KL轨迹,估算剩余提升空间与当前改进速率,并据此调整领域采样比例,而无需改动核心训练循环。D³-MOPD可自然扩展到任意数量的领域,且随着领域数量增加、收敛模式越发多样,调度器的预期收益也越大。在由四个领域专家教师蒸馏Qwen3.6-35B-A3B学生的实验中,D³-MOPD弥合了平均学生-教师性能差距的97%,而vanilla MOPD仅弥合63%;D³-MOPD在轨迹生成步数缩减约3倍的情况下达到相同峰值性能,并在七个基准中的三个上超越了专家教师。
基于提示的强化学习通过在每个轨迹采样前保留专家轨迹的前缀,使策略能够从更接近成功的状态开始探索,从而解决长时程智能体任务中的奖励稀疏问题。其有效性取决于引导深度,即需要保留多少轨迹片段。现有方法将这一深度视为确定性标量。调度方法在所有样本间共享单一值,忽略了任务间的异质性;逐样本探测方法则单独估计每个样本的深度,但代价是额外的轨迹采样。我们发现,有效的引导信息存在于一个深度区间内,其信息量分布围绕区间中心呈近似高斯形状,而非集中于单一最优点。我们提出Agent-G²,一种高斯引导框架,对每个任务从高斯分布中采样深度,该分布的中心与宽度由策略优化过程中已收集的轨迹在线估计,无需探测轨迹或学习得到的深度预测器。分布中心结合了全局基线与逐簇难度,分布宽度则追踪簇内方差。我们在ALFWorld和WebShop上基于Qwen2.5-1.5B/7B-Instruct对Agent-G²进行了评估。Agent-G²在ALFWorld上以不到逐样本探测三分之一的轨迹采样成本,分别超出最强的基于提示、无提示和Aux-RL基线2.3/3.9/7.4个百分点。
近期工作提出了下一分块推理强化学习(next-chunk reasoning RL),用于利用无CoT数据——即包含丰富推理内容但缺乏显式思维链标注的语料库,例如解题过程和教材推导。该方法训练模型生成隐式推理轨迹,并以其预测下一分块文本的能力作为奖励。尽管这一方法前景可观,现有评估主要对比传统有监督微调(SFT)基线,因此尚不清楚其收益究竟来自强化学习本身,还是来自更有效地让模型接触无CoT数据。我们通过一项受控研究来回答这一问题,对比了下一分块推理强化学习与一个简单但此前被忽视的替代方案:混合SFT(Mixed SFT),即在单一有监督微调阶段中联合训练无CoT数据与长CoT数据。尽管方法简单,混合SFT在RLVR后的性能上限明显高于下一分块推理强化学习,同时所需训练算力不到后者的1/60。该优势在领域内数学推理和领域外推理任务上均保持一致。此外,我们表明RLVR前的高准确率并不必然转化为RLVR后的高准确率,这凸显了在完整后训练流程背景下评估无CoT训练策略的必要性。
视频生成正超越孤立片段,向长篇叙事和交互式世界发展,这要求模型保持角色身份一致性、遵循用户控制,并在长时间生成过程中保持稳定。我们提出了JoyAI-Echo-1.5,一个统一的音视频生成系统,包含两个专门设计的变体。长视频变体引入了可组合的跨镜头记忆机制,能够聚合多个先前镜头中的视觉证据,以及从语音过滤的全镜头音频中提取的说话人线索,从而在文本、图像和记忆条件的灵活组合下实现角色外观和语音身份的持续保持。世界模型变体将异构的导航输入转换为校准的度量式六自由度相机轨迹,并通过几何感知条件通路进行注入,实现跨灵活视角的控制器无关交互。为支持高效的长时程生成,我们将双向音视频骨干网络转变为因果式少步生成器,采用渐进式教师强制以及基于自生成展开的短期和长期自梯度强制。实验表明,该系统在两种设置下均表现优异。JoyAI-Echo-1.5在跨镜头一致性、视觉质量、文本对齐和语音保真度方面均优于现有长视频基线。其世界模型变体在WBench上排名第一,平均得分81.7,并在SANA-WM-Bench上取得领先的视觉质量和长时间持续性。综合而言,这些结果表明,记忆机制、几何控制与展开感知训练为生成连贯故事和持续演化的交互式世界提供了实用基础。项目主页:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/。
多教师同策略蒸馏(M-OPD)已成为一种有前景的范式,通过密集的词元级奖励监督,将领域专用的强化学习专家整合为单一的通才学生模型。尽管其在实践中取得了成功,但支配多教师能力整合的优化动力学仍未被充分理解,且缺乏开放、可严格复现的完整流程。在本研究中,我们在SmolLM3-3B-Base上建立了一个带有神谕路由的受控M-OPD基准,将能力整合与路由模糊性分离开来。我们的研究发现了一个显著的能力整合差距:相对于领域路由的神谕集成,标准M-OPD仅捕获了35.6%的可用性能空间,其中指令遵循等简洁任务遭受严重退化并过早陷入停滞。关键在于,我们证明这一失败并非源于梯度冲突,而是源于词元级优化预算的严重错配。这一病态现象由三个正交因素驱动:跨领域的结构性序列长度差异、非均匀学习率导致的动态收敛漂移,以及异步策略更新带来的多步奖励陈旧性。为解决这些不平衡问题,我们引入了Open-MOPD,一个包含词元份额平衡、差距感知的动态预算分配和学生奖励刷新的系统性框架。这些机制共同系统地恢复了跨领域平衡,将性能空间恢复率从35.6%提升至83.4%,且仅需单个可部署的学生模型。我们在学术可及的计算预算下,完全开源了端到端的后训练流程、训练轨迹和评估套件。
视觉-语言-动作(VLA)模型已在机器人操作中展现出有效性,然而诸如pi0.5等最先进的模型仍基于单帧范式运行,这限制了其保留过往观测信息和发展精准空间感知的能力。本文提出StreamPI,一种流式多模态时序建模框架,在无需引入任何额外参数的情况下,赋予单帧VLA时序推理能力。其核心设计之一是指令锚定时序建模。该设计将每个(视觉观测,语言指令)对视为一个原子时序单元:单元内的双向注意力实现跨模态融合,而单元间的因果注意力保持自回归流式推理。这确保了语言指令在整个任务执行过程中充当持续的语义锚点。为弥合同步训练与异步真实机器人部署之间的差距,我们引入随机间隔流式训练策略:合适的帧间间隔(例如每3帧)能够实现更快更平滑的动作执行。此外,对间隔进行随机化进一步提升了模型对帧时序扰动的鲁棒性,从而支持实际场景中的异步部署。更进一步,借助大语言模型主干的长度外推能力,StreamPI无缝继承了预训练的单帧权重,并支持灵活的单帧与多帧推理。在涵盖记忆依赖与精准感知场景的真实机器人任务以及仿真基准LIBERO上的实验表明,StreamPI在多样任务上均优于pi0.5。
多模态大语言模型(MLLMs)在视频理解方面已展现出强劲性能。然而,它们在该领域遵循指令的能力仍未得到充分探索。现实世界的视频理解要求模型不仅能够正确解读视频内容,还要满足多样化的用户指定约束。现有基准主要关注任务准确性而非指令遵循,导致该能力未得到充分评估。为填补这一空白,我们提出了视频指令遵循基准(Video-IFBench),这是一个用于评估视频理解中指令遵循能力的综合性基准,要求模型满足多样化的用户指定约束,包括基于视觉和音频内容的约束。我们构建了一个包含四种模板的指令分类体系,涵盖单任务、多任务、选择型和嵌套型指令,覆盖32种任务类型和39种人工设计的约束类别,这些约束涵盖语义和格式要求。为降低标注成本,我们设计了一条半自动数据构建流程,将MLLMs、程序化处理和人工验证相结合,生成了1.5K个样本。我们对20多个最新的MLLMs进行了大规模评估,结果表明视频指令遵循对当前模型仍具挑战性,尤其是对于包含大量约束、语义约束或需要根据视频内容选择正确分支或路径的复杂条件结构的指令。我们希望这项工作能推动视频理解场景下指令遵循的未来研究。
世界模型旨在模拟复杂环境在动作和事件作用下如何演化,然而现有的基于视频的世界模型主要从视觉观测中学习动态,而视觉观测揭示的是结果,而非支配世界演化的底层知识、规则和机制。这使得模型难以维持持久后果,并支持连贯、开放式的演化。我们提出代码世界模型(Code World Model),该框架将世界演化与视觉实现分离,结合语言模型的推理与编码能力以及视频模型的生成先验。编码智能体充当世界大脑,推理事件及其后果,并生成可执行代码以维持持久的世界状态并执行符合规则的演化。为了将可执行状态与视觉生成相连接,我们引入一种代理表示,它对逐帧时空约束进行编码,并将其编译为代理视频,作为视频模型的条件输入,以渲染高保真的视觉观测。我们还开发了数据管线,从游戏玩法和真实世界视频中构建对齐的代理-观测对。在成对游戏数据上微调后,MiniMax-H3 能够遵循编码智能体构建的简单交互世界中基于代理的时空规范,同时保留丰富的视觉细节和动态。这些结果展示了将代码用于持久世界演化与视频模型用于灵活视觉实现相结合的潜力,为开放式世界模型提供了一条新路径。
视觉语言模型可能生成流畅的答案,但这些答案在视觉证据上的依据往往不足:一个不受支持的物体、图表数值或中间推理步骤,就可能使原本合理的回答大打折扣。我们认为这属于多模态后训练中的信用分配失败。标量结果奖励只能指示答案是否可接受,却无法识别哪些视觉事实有依据、哪些推理步骤有效,以及哪些指令约束被遗漏。我们提出了基于视觉评分标准的强化学习(Visual Rubrics-Based Reinforcement Learning),该方法将参考回答分解为原子命题,并沿视觉忠实度(VF)、推理一致性(RC)和指令遵循(IF)三个维度对生成答案进行评分。由此产生的评分标准条目提供结构化的部分信用,并在有支持性证据片段可用时实现评分标准信用的定位。我们首先在公开的 OpenMMReasoner-SFT-874K 语料库上微调 Qwen3-VL-8B-Instruct,并沿用 OpenMMReasoner 的冷启动数据方案,从而获得一个 SFT 检查点。我们构建了 V-Rubrics 50K——一个包含 50,248 个样本、来自 17 个具视觉依据来源的训练集:先应用基于规则的过滤器,再根据拒绝采样分数推导样本难度,最后使用 Gemini-3-Pro 在相同的结构化提示和协议下对每个样本进行标注。我们基于相同的 SFT 检查点,使用逐组件、前缀定位的评分标准信用来训练模型。实验表明,我们基于评分标准的 GRPO 在共享的 SFT 基线和仅使用答案的 GRPO 之上均有提升,在知识导向和具视觉依据的推理基准上收益最大。结果表明,评分标准是一种对视觉后训练有用的奖励抽象。
现代软件系统经过数十年的开发积累了大量技术债务,这使得迁移成本高昂且在很大程度上依赖人工。随着编程代理在缺陷修复方面日益强大,它们能否自主执行此类迁移?现有基准测试无法回答这个问题,因为它们只评估行为正确性,而不评估迁移是否实际发生。这导致了一个简单的作弊手段:代理复制原始实现以使测试通过。我们将其称为“盲区”(Blindness)。为解决这一问题,我们提出了SWE Refactor Bench,一个包含20个全仓库迁移的基准测试,涵盖4类技术债务。三阶段评估协议同时衡量迁移完整性和行为正确性:(1)迁移审计(Migration Audit)验证迁移确实发生;(2)行为测试(Behavioural Tests)使用固定测试套件衡量正确性;(3)代理验证(Agentic Verification)使用6个独立的编程代理生成针对性测试,以发现隐藏的行为差异。在来自8个前沿模型和26种模型-努力配置的520次运行中,仅28次(5.4%)通过了全部三个阶段,20个任务中有13个未获得任何可接受方案,最佳模型(claude-opus-5)得分为47.0/100。迁移完整性和行为正确性是两种不同的能力:少数运行通过跳过迁移来保持行为,但在迁移审计阶段被拦截;大多数运行尝试迁移但破坏了行为,并在行为测试阶段被拦截。代理无法交付完美的迁移:在通过迁移审计的340次运行中,58%达到了固定检查项的99%,但仅26%达到100%。代理能力因迁移类别而异:在构建工具链重写上得分为31.4,但在语言重写上仅得5.6。综合来看,这些发现使SWE Refactor Bench成为开发可靠全仓库迁移编程代理的严格测试平台。
GUI智能体在Android设备上部署时经常会遇到动态异常,从意外弹窗到动作误用,然而现有基准测试缺乏对智能体在运行时异常下鲁棒性的系统评估。我们提出了AnTrap,一个将动态扰动注入智能体执行轨迹的综合基准测试。我们提出了一种将现实世界异常组织为四层(状态层、思维层、动作层和回合层)共十个细粒度子类别的分类体系,并开发了一个在保留任务可解性的同时引入现实对抗条件的构建流程。通过评估16个领先的GUI模型,我们揭示了智能体对动态异常的普遍脆弱性,即使是最强的模型也遭受显著的性能下降。此外,我们在原始环境和对抗环境中进行了GRPO训练以验证我们的基准测试,将环境可学习的异常与推理瓶颈型异常区分开来。我们的研究结果表明,虽然状态层和动作层的单步陷阱在很大程度上可以通过对抗性强化学习来解决,但深层上下文陷阱,如状态死锁,暴露了仅通过在包含陷阱的环境中训练无法解决的内在局限性。
大型视觉语言模型在UI到代码生成方面展现出显著进展,但其测试时自我进化仍不稳定。我们首先识别出一个根本性障碍,称为视觉修复耦合:局部的代码编辑可能通过布局、样式和组件依赖关系进行传播,在修正一处视觉不匹配的同时,使先前保真度良好的区域发生退化。为解决这一问题,我们提出RubSE——一种基于评分标准的自我进化框架,利用评分标准将视觉反馈表示为结构化的视觉修复上下文。在每轮优化中,RubSE生成类型化候选评分标准,选择一个优先修复目标,并将先前选定的评分标准存储为历史记录,从而引导每次修订朝向范围明确的视觉修复,同时抑制重复或过度宽泛的更改。在六个视觉语言模型和三个UI到代码基准上的评估表明,RubSE在最终轮和最佳轮设置中均显著优于朴素自我进化,实现了更稳定的优化轨迹和更高的轨迹级性能上限。进一步分析表明,RubSE通过改善严重视觉回退后的恢复能力来缓解轨迹坍缩,且更强的评分标准生成器能够将有效的视觉修复指导迁移至较弱的代码改进器。
编码智能体执行长时间运行的任务,涵盖数十次模型调用、工具使用和代码编辑。随着这些运行逐步推进,用户面临一个实际的质量-成本权衡:当较便宜的模型遇到困难时升级到更强的模型,或在复杂的推理完成后降级。每次切换都要求接收方继续执行由另一个模型产生的非原生轨迹。我们研究这种交接如何影响质量和成本,以及接收方继承的轨迹信息变化如何改变结果。使用来自Claude和GPT家族的成对低成本、低能力(LC)和高成本、高能力(HC)模型,我们改变交接方向、时机和接口,比较完整轨迹转移、压缩以及在保留仓库状态的同时移除轨迹。在两个模型家族中,完整轨迹升级仅恢复了LC到HC质量差距的不到一半,同时产生了可观的成本溢价。我们将这种成本-质量损失称为交接税。相比之下,降级提供了一个有利的成本-质量平衡点。有趣的是,偏好的接口也随方向反转:减少LC模型的轨迹信息提高了升级质量,而移除HC模型的轨迹则降低了降级质量。
现代软件——从插件系统到自我演化的智能体框架——日益需要动态组合,但其形式基础仍不完善。我们识别出该问题的两个正交维度:时间可组合性,即完全撤销组件副作用的能力;以及空间可组合性,即声明并反应式管理组件间依赖的能力。我们通过将经典效应与协效应概念提升为运行时机制来解决这两个维度。具体而言,我们形式化了可逆效应,其中每个上下文变换都携带一个由运行时持有的逆变换,从而在单个组件局部建立时间可组合性。我们形式化了反应式协效应,其中每个上下文变化都根据组件的协效应规格进行分类,以驱动其激活与停用,从而在单个组件局部建立空间可组合性。随后,我们将效应上下文与协效应上下文统一为单一的上下文类型,并通过该类型协调所有效应与协效应,由此得出我们称之为上下文范式的一种规约;这种协调引发一种观测等价性,在此等价性下,不同组件的效应相互交织而互不干扰。我们将这些机制组合为组件概念,给出一个动态组合演算,其元理论将时空可组合性从单一组件推广到整个交织组件系统。我们在Cordis中实现了这些思想,这是一个时空可组合性的元框架,提供包含效应追踪与协效应解析的核心库,以及一个具有配置协调和热模块替换的声明式组件加载器。
扩展Transformer语言模型在表达力与内存效率之间存在着固有的张力。虽然各层独立权重保留了功能特化——从输入锚定到抽象精化——但会带来可观的内存占用。相反,标准深度共享强制施加统一的变换,压缩了表征多样性并降低了建模质量。我们提出门控循环Transformer(Gated Recurrent Transformer),一种循环深度Transformer架构,其中固定深度的前奏块和尾声块围绕一个被迭代R次的共享核心。受门控循环神经网络启发,我们采用轻量级投影和逐元素更新门——以隐状态、固定前奏输出以及每步重采样的噪声为条件——来调节循环更新。这使得模型能够在多次循环中针对同一少数层特化输入,而无需大量独立层即可实现功能多样性。在等FLOPS约束下,3层门控循环Transformer在训练和推理FLOPs相近的情况下达到了12层GPT-2 Small基线的准确率,并在全部九个按预算划分的规模单元中领先MoR和重尾深度采样方法;在标准token预算下,中等及大规模下它接近稠密模型质量,一旦预算翻倍,在中等规模下超越稠密模型。在等参数约束下,更深的循环在匹配参数和数据预算下达到2.76的验证损失,而非循环对应模型为2.84。我们的结果表明,自适应深度复用是一种以参数换质量的系统性策略:在大规模下,参数减少63%,峰值解码内存减少59%,而编译后生成延迟仅增加10%。
多臂协作正日益成为具身操作中的一项核心能力。近期的视觉-语言-动作(VLA)模型整合了感知、语言与控制,但大多数模型将语言表示为单一的全局指令,并未提供分配和组合各机械臂特定行为的显式机制。这种设计限制了模型向训练中未出现的协作模式的迁移能力。我们提出MA-VLA,一种通过原子动作分配实现多臂协作的统一框架。MA-VLA将协作行为分解为中层原子提示,并将其分配给各机械臂,从而实现显式的子目标指定与跨任务组合复用。为减少对固定执行角色的依赖,我们引入了Arm Shuffle,一种在训练时对各机械臂的观测、状态及所分配原子提示进行置换的方法。该置换机制强制实现角色无关的指令跟随,并支持将行为重组为未见过的协调模式,我们将其称为多臂组合泛化。我们还构建了一个基准,其中测试时的协作模式不存在于训练集中。在仿真与真实世界评估中,此前最先进的VLA模型在这些未见协作场景下大多失败,而MA-VLA始终能够成功。这些结果表明,结构化的逐臂原子动作分配为多臂具身系统中的可扩展泛化提供了一条切实可行的路径。代码、模型和数据可在https://github.com/zhangzaibin/future-robots获取。
流式自回归扩散模型能够实现实时、长时域视频生成,但其训练目标优化的是局部帧预测,而非连贯世界的几何与动态:长时间生成会累积几何漂移,退化为静态或不自然的运动。近期双向方法利用基于3D高斯泼溅重建的奖励信号来解决该问题。然而,单一的刚性3D重建无法建模动态场景,因此此类评判器会将真实的物体运动视为重建误差加以惩罚,并通过冻结视频来获得最大奖励。这种捷径在自回归设置中尤为有害,因为每个块都可能传播已经静态化的配置。在本工作中,我们提出Stream4D,用显式建模场景动态的前馈4D重建奖励取代静态评判器,使连贯的运动能够获得高一致性奖励。为进一步引导运动的幅度与质量,我们引入运动先验,奖励自然的场景流幅度,同时惩罚抖动与非刚性伪影。我们的最终方案将这两项与轻量级感知锚点相结合。在多种自回归视频主干网络和多种生成时域上,Stream4D均能提升4D重建质量,更有效地保持运动,并获得更高的人类对齐偏好。项目主页:https://banyuanhao.github.io/Stream4D/
基于机器学习(ML)的0.1°全球天气预报模型的发展受到高分辨率数据可用性有限的制约,因为数十年的再分析数据仅能以0.25°分辨率获取。虽然现有方法在有限的0.1°样本上对0.25°预报模型进行微调,但我们表明,这种迁移受到粗分辨率预报中固有的不可逆信息损失的阻碍。为此,我们提出BaguanHR框架,将关注点从模型迁移转向数据迁移。我们首先证明,超分辨率(SR)比预报具有更低的条件熵和输入放大效应,因此是分辨率迁移的更稳健载体。通过利用这一优势,我们采用分变量超分辨率从ERA5合成了大量0.1°数据。BaguanHR在合成与真实数据集上的性能超越了基于ML的方法和IFS-HRES,在72小时内超过85%的预报时效上实现了更优表现。此外,我们的研究结果凸显了一种幂律尺度效应:数据量每增加一倍,72小时预报的RMSE降低4.6%,120小时预报降低4.9%。我们的结果表明,高分辨率基于ML预报的规模化扩展主要受制于数据瓶颈,而分变量超分辨率提供了一种简单且通用的解决方案,可释放长时程粗分辨率再分析数据在高分辨率训练中的潜力。
测试时扩展利用额外的测试时计算来提升性能,例如让语言模型在解决问题时进行更长时间的推理。由于模型通过全注意力将完整推理轨迹保留在内存中,需要长思考的困难任务可能会产生高昂的成本。然而,我们发现随着模型继续推理,大多数中间推理词元会逐渐失去重要性。这不禁让人质疑保留这些词元是否值得其成本。基于这一见解,我们提出了Prefix Sliding(前缀滑动),即在推理过程中丢弃不属于前缀或最后几千个词元窗口的词元。前缀包含模型可用的关键指令和工具,而最近的词元则是模型当前正在进行的推理内容。这样一来,无论模型推理多久,总内存需求都被限制在一个上限内,从而实现了高效的长时程测试时扩展。无需训练,Prefix Sliding即可使现有模型速度提升3倍,同时保持性能。使用Prefix Sliding并通过强化学习进行训练,能够将推理轨迹扩展到超过十万词元,从而获得更好的性能。消融实验表明,Prefix Sliding优于对中间词元进行总结或使用普通滑动窗口的方法。我们的代码位于 https://github.com/Muennighoff/prefix-sliding
大语言模型在不同语言间的知识获取并不一致,但同一模型在使用不同语言交互时,其技能集究竟存在多大差异?本研究从知识与通用基准性能两个维度之外,正交地量化了跨语言技能不一致性。我们通过多语言自我对弈实现这一目标:同一模型的两个实例在基于文本的游戏中相互竞争,各自通过不同的语言界面进行交互。由于模型、对手、规则、状态空间和可用动作均保持不变,该设置能够隔离语言对模型实际行为的影响。我们构建了TextArena的多语言扩展,并在八种语言、六类游戏中评估了三个开放权重模型,涵盖空间推理、不完美信息、资源分配和重复交互等场景。研究发现,同一模型在不同语言下可能表现出显著差异的博弈水平,胜负差距、无效动作和策略倾向均呈现系统性变化。详细分析揭示了空间推理、基于牌面条件的决策以及最优落子选择中的语言特异性缺陷。在某些设置下,仅改变中间推理语言即可恢复大部分性能损失,这表明语言可能影响决策过程的不同阶段。上述结果表明,技能差异是可测量的重大障碍,阻碍了真正多语言模型的发展。深入理解这些差异有助于我们设计在不同语言间表现更公平的模型。
文档检索日益支撑着金融、医疗和法律领域中的高风险信息获取。现代检索流水线在模态(文本或多模态)和检索架构(稠密检索或后期交互)两方面均存在差异。这些选择带来了一个难以两全的折衷:最有效的流水线在规模化运行时过于缓慢且成本高昂,而最快的流水线却无法从复杂文档中检索到证据。因此,实践者不得不在遗漏证据与不可用的延迟之间做出选择,且缺乏在查询层面自适应调整该选择的 principled 依据。我们证明这一折衷并非不可避免。并非每个查询都需要相同的流水线。在涵盖金融和科学语料库的多个基准测试中,没有任何静态流水线能够全面占优。我们提出了 RetrievalRouter,一种轻量级的查询感知路由器,它仅从查询文本本身学习哪种检索流水线最适合每个查询。一个可调节参数即可展现完整的精度-延迟前沿,并且对于每个静态基线,RetrievalRouter 都能提供一个同时具有更高精度和更低延迟的工作点。与最佳静态基线相比,RetrievalRouter 的精度提高了 2.5%,速度提升了 12.4 倍。此外,与先前的自适应策略选择方法相比,RetrievalRouter 在面向精度的设置中取得了显著更高的 nDCG@5,同时在面向延迟的设置中,其 nDCG@5 和延迟均达到或数值上超越现有方法。我们的代码和数据可在 https://github.com/emrekuruu/retrieval-router 获取。
计算机使用智能体需要将自然语言指令与截图中的界面元素进行对应,然而现有基准测试并未检验模型能否将关系语言绑定到正确的元素上。我们提出了GUI-Primitives,一个包含994个对比指令对的基准测试,覆盖图形用户界面中的七种空间关系(左/右、上/下、包含、对齐、邻近、列表序数、遮挡)。每个指令对在保持截图和锚点不变的情况下仅改变关系表达,从而使正确目标在两个指定候选元素之间移动。五位标注者对196个条目的子集进行了验证(规范性κ=0.94;目标选择κ=0.79)。十九个视觉语言模型的严格框内点准确率最高仅为32%。由于模型输出不受约束的坐标,我们依据每个预测落入的候选区域对其分类。在60-92%的条目中,预测落在两个候选区域之外。在落入候选区域的前提下,水平位置、垂直位置、邻近和列表序数的目标选择准确率达到0.82-0.90,但包含和遮挡的准确率与0.50无显著差异:大多数失败反映的是候选定位问题而非关系理解问题。在十个模型上,基准准确率与ScreenSpot-Pro准确率相关(斯皮尔曼ρ=+0.74),在此样本量下属于探索性关联。标记两个指定候选元素可使选择准确率提高35-57个百分点,这是一种提供候选集合的预言机诊断方法,而非可部署的方法。我们发布了该基准测试、预测结果和代码。
可靠的奖励模型对于文生视频评估和对齐至关重要。然而,评估准确性与推理效率之间的权衡对训练监督的质量提出了很高要求。现有方法通常依赖具有固定评分标准或开放式推理的整体评判器,导致检查不完整、理由不忠实和归因纠缠。我们提出 FIRM-Video,一种基于“先检查后评分”原则的统一清单驱动数据构建框架:构建维度特定清单,依据时序视觉证据验证每条标准,并仅聚合已验证的判定。在指令遵循方面,FIRM-Video 将提示分解为加权原子要求;在世界一致性方面,它构建基于可见实体和动作的、经提示校准的目标特定检查;在感知质量方面,它应用通用的视觉缺陷分类体系。经过验证的标准与分数进一步转化为自然语言分析,用于端到端奖励建模。随后,我们构建了 FIRM-Video-90K,包含来自 29,348 个视频的 88,044 个维度特定实例,并推出 FIRM-Video-Bench,涵盖 250 个视频上的 750 条逐点人工标注。基于 Qwen3-VL 的 FIRM-Video-8B 在 FIRM-Video-Bench 上取得最佳整体 MAE,同时在三个视频生成器的 Best-of-8 采样中始终取得最高的 VBench 总评分、质量评分和语义评分。
现有的共语手势生成方法主要是在离线设置下研究的,即从完整的语音片段中合成手势。然而,真实场景中的交互式数字人需要在严格的延迟约束下,仅利用当前可用的响应音频,在线生成与语音同步的手势。因此,先前的方法不适合实时交互,因为它们要么依赖未来语音信息,要么产生显著的推理延迟。本文针对交互式数字人定义了在线共语手势生成问题,并提出了一种实时交互框架,该框架将流式语音响应模块与在线手势生成模块相耦合。具体而言,手势生成器被设计为一种因果多模态自回归模型,从流式响应语音和运动历史中预测身体运动,从而在无需访问未来语音的情况下实现低延迟且与语音对齐的手势合成。为支持这一设置,我们进一步提出了一种针对虚拟伴侣场景定制的离线数据合成流水线,该流水线利用主题感知和情感感知的主体语料构建多样化的人机对话,然后基于智能体响应生成共语手势。此外,为弥合离线数据构建与在线部署之间的差距,我们建立了一个自演进训练循环,将在线交互过程中收集的用户反馈纳入数据生成流程,从而实现对用户偏好的持续适应。大量实验表明,与现有竞争基线相比,我们的框架在延迟-质量权衡、语音-动作同步性和用户偏好方面均取得了更优的结果。项目页面:https://super-star-2026.github.io/
我们介绍了LibriBrain100,这是一个大规模用于语音解码的MEG数据集,从设计之初就致力于可复现、标准化的评估。LibriBrain100的规模是原始LibriBrain发布版本的两倍以上,包含超过100小时的高质量MEG数据,这些数据是在受试者聆听自然连续语音时采集的。其中约80小时来自单个受试者,LibriBrain100在个体内深度神经数据方面创下了新纪录(是下一个可比数据集的8倍,约为其他数据集的80倍)。为了展示这种深度优先设计的价值,我们在一个词分类基准上进行了评估——这是通向无创脑到文本解码这一公开挑战的日益成熟的基石。使用现有解码模型,我们达到了最先进的性能——这既验证了录音质量,也验证了大规模个体内数据的价值。由于在现实应用中为每位用户收集80小时的数据并不实际,我们还从32名受试者中各收集了约40分钟的额外数据。使用相同的词分类基准,我们展示了广泛多受试者数据的价值:对预训练模型进行有监督微调可以大幅弥补单个受试者数据有限的问题。我们提供标准的训练集、验证集和测试集划分,所有这些都可以通过一个开源Python库复现,该库支持便捷下载、可选预处理以及为常见深度学习框架加载数据。此外,该数据集和评估基础设施将与一项开放机器学习竞赛一同发布,并配有公开排行榜,用于标准化基准测试。最终,我们希望LibriBrain100能够加速推进实用型无创脑机接口的发展,为严重瘫痪患者恢复沟通能力。
可靠的空间理解是未来医学视觉语言系统的重要前提,这类系统旨在支持放射学报告生成和结构化图像理解。尽管现代视觉语言模型(VLM)在许多医学影像任务中展现出良好的性能,但近期证据表明它们在受控空间推理方面仍然薄弱,且常常无法可靠地将空间关系锚定到图像证据中。鉴于放射学推理依赖于理解解剖结构和病灶的相对位置,这种空间能力不足对诊断准确性构成风险。我们提出了一种模块化医学影像智能体,用于轴向CT切片中的二值空间关系验证。该系统不直接端到端地预测空间答案,而是将任务分解为明确的阶段:语言解析、解剖定位和确定性几何验证。自然语言查询被转换为结构化关系元组,被查询的器官通过基于YOLO的检测器进行定位,最终的空间决策则使用确定性几何规则从物体中心计算得出。我们在保留的MIRP空间问答基准上评估了该方法,并将其与具有代表性的端到端VLM基线进行了比较。性能最佳的混合配置达到94.1%的准确率和94.2%的F1分数,在准确率上比直接Qwen2-VL提示高出42.5个百分点,同时保留了可解释的中间表示和可审计的推理阶段。结果表明,显式的模块化空间验证可以成为未来面向报告的医学影像智能体的一个有前景的构建模块。
话轮转换是人类对话的基本组织特征,在自然的同步对话系统中仍然难以建模。尽管已有研究探索了用于话轮结束预测的多模态方法和大语言模型,但目前缺乏专门针对土耳其语话轮转换动态的自然会话语料库。本研究引入了一个多模态土耳其语会话数据集,包含无脚本的双人互动,由同步的正面摄像头视频、可将重叠语音归因于单个说话人的每说话人独立音频通道,以及时间对齐的转录文本组成。话轮转换预测被表述为一个二分类问题,并采用遗传算法(GA)来优化从视觉、声学和语言特征中推导出的可解释决策规则。所提出的框架采用了混合AND-OR规则表示,以表示话轮转换之前出现的多种替代性线索组合。