每日精选AI研究论文及翻译
我们介绍了Kimi K3,这是一个拥有2.8万亿参数的混合专家模型,具备1040亿激活参数、原生视觉能力以及百万token上下文窗口。Kimi K3基于Kimi Delta注意力机制和注意力残差结构构建,这些技术增强了信息在序列长度和模型深度上的流动。结合Stable LatentMoE(每个token有效激活896个路由专家中的16个)以及优化的训练和数据配方,这些进步使得整体扩展效率相比Kimi K2提升了约2.5倍。后训练阶段涵盖了通用领域、智能体领域和编程领域的强化学习,并引入了多层级推理强度,从而实现了组合泛化能力和稳健的长程执行能力。在2.8万亿参数规模下,Kimi K3得到了多个领域基础设施进步的支持:针对KDA的算法-系统协同设计、完美平衡的专家并行训练与高效内存管理、支持持续部署和沙盒状态的百万token智能体强化学习,以及部署创新。广泛评估表明,Kimi K3在长程编程、智能体、知识、推理和视觉任务上达到了前沿水平。尽管其整体性能仍略逊于最强大的专有模型(即Claude Fable 5和GPT-5.6 Sol),但在我们的评估套件中,Kimi K3始终优于其他开源和专有模型。为促进未来研究并加速前沿智能的广泛部署与应用,我们开放了完整的Kimi K3模型权重。
创意AI正从单步资产生成迈向长期多模态创作。尽管近期生成模型能够合成高质量图像、视频、音频片段、UI元素、故事板、演示文稿及其他创意资产,但真实世界的创意工作远不止于孤立的提示-输出交互。它涉及参考素材、草稿、备选方案、编辑修改、失败尝试、版本关系、工具操作、评估信号和人工反馈,这些共同构成一个不断演化的项目状态。现有的基于提示、对话或节点的生成系统仅能部分支持这种状态,因为它们常常丢弃中间上下文、依赖线性对话或需要手动指定工作流。近期商业系统已显示出向智能体辅助创意生产转变的趋势,但其封闭架构使得研究智能体如何表示上下文、选择工具、修订作品、从失败中恢复以及长期保持一致性变得困难。为弥补这一空白,我们提出JarvisHub——一个面向长期多模态创作的画布原生创意智能体框架。JarvisHub将可编辑画布视为用户工作空间、智能体外部记忆、动作空间和共享项目状态,将多模态作品、依赖关系、版本和反馈表示为带类型的画布节点与连接。通过画布状态、协议桥接和智能体运行时三层架构,JarvisHub使智能体能够在可检查、可编辑的创意状态中行动。这一设计将创意智能体从孤立的工具使用推向持续、可人为引导的创意自动化,智能体能够逐步规划、生成、修改和组织多模态项目,而用户在整个过程中可以检查、引导并随时介入。
机器人学习发生在动态环境和大行为空间中。终端成功信号仅告知机器人任务是否完成,却无法揭示当前行为是在推进进展、停滞不前还是造成倒退。为此,近年来越来越多的研究探索在任务执行过程中提供反馈的进度奖励机制。然而,当前文献缺乏统一框架:现有方法在观测数据、目标设定、输出信号、监督来源和评估协议上存在差异,导致难以进行方法比较并理解其验证结果的实际意义。本综述为机器人学习的进度奖励建模提供统一视角,将领域组织为三个关联环节。首先研究进度模型的接口——通过考察模型接收的信息及其产生的进度信号形式,从外部定义问题边界。继而深入模型内部,分析构建进度信号的方法,揭示进度估计与奖励生成背后的不同假设与机制。最后检验支撑这些方法的数据与基准,阐明进度监督的获取方式及不同评估的实际测量内容。这三个视角共同串联起进度模型的本质定义、构建方式与质量验证。我们进一步总结了现有方法的主要局限,并探讨了未来研究方向。
智能体搜索通过将多步推理与检索交错进行,使大语言模型能够解决知识密集型任务,然而使用基于结果的强化学习对此进行优化仅能提供稀疏的监督信号。知识蒸馏能够提供更密集的指导,而具有强大推理能力的高级专有模型则是极具潜力的教师模型。尽管从专有模型进行蒸馏可强化这一监督信号,但传统的对数几率匹配由于隐藏的对数几率和不匹配的词元化器而无法实现,而原始自然语言轨迹模仿则只是传递了浅层的文体伪影,而非核心推理能力。为解决异构蒸馏问题并弥合分布差距,我们提出了多智能体协议蒸馏(MAPD),这是一种联合蒸馏与强化学习框架,使用结构化的、风格标准化的协议作为中间表示。一个离线多智能体系统(MAS)对每个查询进行分解,检索支持性证据,修复失败的搜索,并将生成的探索轨迹转化为包含任务类型、推理计划和可提取的事实依据的JSON协议。在训练过程中,该协议仅提供给学生策略的一个特权分支,其词元分布在与稀疏强化学习目标并列的同时,提供了密集的蒸馏信号。在七个问答基准上的广泛评估表明,MAPD始终优于具有竞争力的蒸馏与强化学习方法,在Qwen3-1.7B上平均成功率达到39.4%,在Qwen3-4B上达到44.4%。关键是,该框架在不同专有教师模型间具有稳健的泛化能力,同时有效缓解了学生策略中的风格漂移和冗长退化问题。
在策略蒸馏(OPD)通过沿着当前学生模型生成的轨迹查询教师模型来适配扩散模型,但在无分类器引导(CFG,现代扩散系统的默认组件)下其行为模式尚不明确。现有OPD方法自然地将速度匹配扩展至CFG组合预测,直接对齐教师与学生模型的引导速度。我们证明该目标在分支层面存在欠辨识问题:正负分支误差可在引导预测中相互补偿。通过两个对比案例发现,在共享负条件下(即两分支误差协同下降),朴素匹配方法仍然有效。然而,当模型原生CFG架构在教师负分支中保留学生无法获取的特权信息时,这种协同下降机制失效,组合目标会引发对抗性分支误差动力学:在降低正分支误差的同时增加负分支误差。我们将此失效模式称为负分支非对称性(NBA)。为应对NBA,我们提出正向方向匹配(PDM),这是一种分支感知的OPD目标,可独立约束正向预测与CFG条件方向。我们将PDM应用于稠密到稀疏视频控制任务,在此场景下,朴素引导匹配对推理引导尺度高度敏感,而分支感知监督能实现更鲁棒有效的知识迁移。
计算机使用智能体通常通过强化感知能力来改进:构建更好的模型来读取截图并选择点击位置。然而,截图仅仅是底层程序状态(例如持有任务数据的文件、应用后端和DOM)的有损渲染。不同的状态可能生成相同的像素,而代码可以直接检查并修改该状态。StateAct正是基于这一区别构建的、以代码优先的多智能体框架。其主智能体通过使用代码直接与程序状态交互,而专门的GUI子智能体仅在少数需要截图与点击交互的子目标中发挥作用——在108个任务中仅有28个需要,且占主智能体步骤的1.1%。对程序状态的直接访问同样支持验证:独立的完成门控会双重检查保存结果是否存在结构性失败,例如输出缺失、未保存或写入错误路径。为了在数百个步骤中保持聚焦,主智能体将子目标交由新的子智能体处理,从而保持自身上下文的专注。在OSWorld 2.0上,StateAct将Claude Opus 4.8的二值成功率从20.6%提升至26.9%,部分成功率从54.8%提升至61.6%,而每个任务的成本比单纯依赖截图的同一模型低约9倍;无GUI子智能体的纯代码变体仅达到45.9%的部分成功率,低于基于截图的基线(54.8%)。总体而言,将行动、验证和记忆基于状态(我们称之为状态基础化)将主要瓶颈从感知转向推理:失败更多地取决于智能体的思考而非其视觉感知。
多模态基础模型通过摄取整个互联网数据学会了看和说。具身智能体则无法享有这种捷径,因为它们需要将观测与物理状态和动作相耦合的数据。多种数据源能以不同程度提供这类信号。在这项工作中,我们将具身数据生态系统组织成一个“金字塔”,涵盖五种互补来源:真实机器人数据、UMI式数据、第一人称和第三人称数据、仿真数据以及通用视觉-语言数据。我们围绕可扩展性与机器人对齐之间的张力构建这个金字塔,并进一步从数据质量、多样性、可复用性和物理保真度角度描述每种来源。随后,我们通过数据配方的视角分析近期具身基础模型,考察在预训练过程中如何选择、对齐和混合不同数据源。对于具身大脑模型、视觉-语言-动作模型以及世界-动作模型,我们将数据构成与感知、推理、规划、动作生成和世界预测等能力联系起来。最后,我们讨论六个未解决的挑战:构建大规模触觉数据集、收集失败与恢复数据、开发可扩展的数据收集管道、跨具身形态对齐动作、利用第一人称数据进行灵巧操作,以及为机器人学习设计原则性的数据配方。希望这项工作能为下一代具身系统的设计奠定基础。
扩散变换器对于高保真视频生成至关重要,但长令牌序列使得注意力机制成为主要的推理瓶颈。免训练的动态稀疏注意力通过仅计算选定的键值块来缓解这一瓶颈,然而现有方法在高效且精确地稀疏化注意力方面存在两个难点:(1)刚性、不可预测且高代价的路由:通过代理分数选取固定比例的前置块会施加固定预算,而保留块以达到目标累积代理概率质量虽能实现动态预算,却可能带来预算失衡;这两种方法均需因计算和物化代理分数而产生不可忽视的开销。(2)有损的保留或丢弃稀疏化:未选中的块被完全丢弃,在激进稀疏化条件下会降低精度。这些局限性促使我们探索更低成本的动态预算路由,同时限制精度损失。本文提出免训练的Sol-Attn(在线注意力稀疏化),该方法在单个在线softmax过程中统一了动态路由、稀疏计算和近似修正,在稀疏注意力中实现了更优的精度-效率权衡。Sol-Attn的核心是通过代理分数复用实现即时块阈值判断——在在线softmax过程中,通过将块代理分数与阈值进行比较来选择关键块。该设计无需物化代理地图即可实现动态可控的块预算,同时直接复用未选中块的代理分数来近似其贡献。在图像和视频生成任务上的实验表明,Sol-Attn推动了免训练稀疏注意力的质量-效率前沿,在保持视觉质量的同时,为视频生成和编辑分别实现了2.1倍和2.3倍的端到端加速。
最近的生成模型正从无声视频或独立音频合成转向同步音视频的联合生成。尽管取得了进展,但由于音视频在根本结构上的差异,联合生成具有细粒度跨模态对应的音视频仍具挑战性。现有方法大多使用分别训练的音频和视频VAE,导致两个隐空间缺乏跨模态对齐,下游生成模型需从零学习跨模态同步。我们提出OmniVAE,一个联合训练的音频-视频VAE,学习音频和视频隐表示之间的细粒度语义对齐。除重建外,OmniVAE使用段级音视频对比目标来捕获时序-语义对应并对齐两个隐空间。同时,它从预训练的模态特定语义编码器中蒸馏特征到各模态,提升两个隐空间的下游可学习性。大量实验表明,两个目标均一致提升了隐空间的可学习性,进而转化为下游文本到音视频生成中更高的生成质量和更准确的跨模态同步。这些发现强调了学习统一表示作为全模态建模基础的重要性。
我们提出Oxygen-TryOn,一个面向任意商品虚拟试穿的统一基础模型。与改造通用图像编辑器不同,Oxygen-TryOn是专为时尚原生设计的模型,通过专用数据引擎和针对试穿任务的训练构建。给定一个或多个参考商品(清晰的实物图或真实场景中的穿着照片)以及单张目标人物图像,它能合成人物穿着这些商品的照片级真实图像,覆盖几乎任何时尚品类。现有系统在影棚环境下处理单一服装品类,而近期的多参考方法仍以服装为中心;相比之下,Oxygen-TryOn支持多样化的商品和场景,包括全身和半身视图、可变数量的参考图以及自由的多商品组合,同时忠实保留人物身份和商品外观。我们不再采用基于掩码的修复方法,而是将试穿重新定义为多参考、理解驱动的生成任务。我们构建了一个数据引擎,能够大规模收集、制造、标注和筛选高质量试穿数据,并设计了持续预训练(CPT)、监督微调(SFT)和强化学习(RL)三阶段方案。RL阶段采用混合奖励,结合内部试穿奖励模型和专有的、基于评分指南的通用模型,共同监督细粒度一致性和指令级质量。它还能在同一流程中遵循通用编辑指令(如姿势变化)。在公开基准测试和我们内部的Oxygen-TryOn Bench上,它在单商品试穿上实现了最先进的一致性和真实感,在多商品试穿上领先,匹配或超越了领先的专有系统(Nano Banana Pro、GPT-Image-2、Seedream5 Lite)和开源模型(FLUX.2)。
多轮长程规划是基础模型智能体的关键能力,但其根本提升路径仍不明确。现有模型基于不可控且不透明的互联网数据进行训练,难以厘清规划能力如何获取、塑造与整合。为应对这一挑战,我们引入统一可控的多轮交互环境,实现精确控制,从而系统研究长程规划的三个阶段。(1)预训练阶段的规划能力获取。我们探究数据格式、分布与质量的影响:通过思维链状态转换建模构建显式世界模型,可增强长程泛化能力;原子技能不足以支撑组合泛化,而少量长程数据即可发挥效用;此外,次优轨迹会严重损害性能,原因在于错误在长程场景中会被逐级放大。(2)通过GRPO与OPD进行后训练的规划能力塑造。利用互信息,我们将通用规划模式与任务特有规划知识区分开来。针对规划模式,我们识别出后训练的三个应用区域:不必要、有效和不可支持。在低质量与长程场景下,OPD的有效区域比GRPO更广,因其提供更一致的更新方向。针对规划知识,若教师具有不同知识,从其蒸馏未见过程可能损害学生已有的世界模型,而未能充分建立新知识。(3)通过MOPD后训练实现规划能力整合。研究表明,多教师同策略蒸馏(MOPD)通过在不同环境中收敛至共享规划模式来整合能力:兼容模式可实现跨环境泛化,部分共享模式支持持续学习,而完全冲突模式则引发严重干扰。
本文旨在对高维视觉表示进行离散化,以弥合其与语言模型之间的鸿沟——这一挑战颇具难度,因为现有量化方法存在码本坍缩问题,在扩展时难以保持语义连贯性。我们发现根本原因在于度量失配:标准的欧几里得码本目标函数与表示空间的各向异性几何结构本质不匹配,导致码本嵌入产生高方差幅度尺度和不均匀的角度分布,从而阻碍可扩展性。为解决此问题,我们提出超球面量化(HSQ),该方法通过角度路由将语义内容与特征幅度解耦,避免码分配被尺度而非语义主导。由此得到的离散表示自编码器(dRAE)在保持语义完整性和支持可扩展码本预算的同时,实现了高保真重建。大量实验表明,当词汇表规模扩展至131,072时,该方法持续提升性能,同时实现100%码本利用率、简化训练流程,并在理解与生成任务中均展现出强劲表现。
多模态大语言模型(MLLMs)在革新临床实践中蕴含巨大潜力,但在医学领域的部署本质上是以视觉为核心的挑战:模型必须从异质的2D和3D医学影像中吸收知识,评估方案需与放射科医生的临床实践对齐,并提供准确、细粒度且基于事实的评估。本文提出ClinFusion——一种以视觉为中心、面向整体医学理解的多模态大语言模型,系统性地应对了上述限制。我们提出一种组合式级联视觉编码器架构,其中包含级联空间感知局部融合算子,可在融合编码器中统一处理多样化的2D与原生3D医学图像理解。我们还提出一种基于视觉的评估框架,包括用于指令遵循评估的MedIF-Bench基准,以及基于感兴趣区域的方法,用于临床对齐且基于事实的报告生成评估。研究表明,ClinFusion在涵盖视觉问答、报告生成、指令遵循以及医学文本任务的全面2D与3D多模态医学基准测试中均达到最优性能——在24项基准中的20项上超越领先的开源医学多模态大模型(如Hulu-Med、Lingshu),并在16项基准中的13项上展现出优于GPT-5.2和Gemini-3-Flash等强大商用模型的多模态能力。该模型还可通过智能体工具调用进一步增强,实现检索增强和工具辅助的临床工作流。由持有执业认证的放射科医生开展的双盲评估证实,ClinFusion可生成评级最高的报告,同时验证了基于感兴趣区域的评估指标在所有自动评估指标中实现了与专家判断的最强相关性。
大型推理模型(LRMs)在生成最终答案前会产生长程推理轨迹。尽管这些轨迹可能包含用于幻觉检测的有用信号,但有效利用它们并非易事,因为长序列常包含噪声步骤,模糊了与真实性评估相关的线索。本文识别出两种常见的推理噪声形式——无关步骤与重复步骤,并表明两者均会显著降低幻觉检测性能。现有基于置信度的评分及朴素嵌入过滤方法难以可靠区分噪声步骤与信息性步骤。针对这一挑战,我们提出REDE,一种用于去噪推理轨迹的新型学习框架。具体而言,REDE利用最终答案注意力机制作为自动监督信号,构建步骤级表示空间,从而生成能够可靠识别并过滤噪声步骤的精炼嵌入。通过去除噪声步骤后的过滤推理轨迹,REDE可便捷嵌入多种幻觉检测器。在多个推理基准上的大量实验表明,REDE相较于竞争基线方法能持续提升检测性能。
LLM作为评判者已成为自动化评估的标准方法,但存在成本高、延迟显著和决策不透明等局限性——这些缺陷削弱了其可扩展性和可靠性。我们提出一种简单高效的替代方案:程序蒸馏。不同于在评估时提示LLM,我们将其决策逻辑蒸馏为一个程序委员会,由该委员会直接对候选结果进行评分。这些程序化评判者具有透明性,易于审查或编辑,并且消除了每次样本的API成本。基于这一概念,我们引入了PAJAMA系统,该系统能够合成程序作为评判者,将它们的决策聚合为联合裁决,并集成了一种降级机制,可选择性地将低置信度案例升级至LLM处理。在五个数据集和四个模型家族上的实验表明,程序化评判者能够达到与13B规模LLM评判者相当的性能。当将程序输出用作路由信号时,PAJAMA在提升准确率和吞吐量的同时,进一步扩展了帕累托前沿。在评估之外,程序化评判者还能产生廉价且有效的奖励信号:在RewardBench上,从程序裁决中蒸馏得到的奖励模型,其性能优于基于专有LLM标签训练的模型,而API成本降低了两个数量级。
尽管面向视觉语言模型(VLM)的数据整理工作日益活跃,但构建预训练混合数据的公开实践仍高度依赖经验法则:从业者堆叠通过质量过滤的数据集,凭直觉设定跨领域比例,缺乏原则性且可归因的标准来接纳新数据,而前沿方案则始终秘而不宣。我们将数据构建形式化为一个系统的混合优化问题,通过将混合数据解耦为两个正交子问题——跨能力类间比例与同类能力内类内比例——将其转化为可复现的工程准则。针对类间分配,我们采用单变量迭代搜索;针对类内组合,我们运用多维数据集级评分(评估质量与难度),并将选择过程建模为带多样性目标的带约束凸优化问题。DecoupleMix框架提供两项关键能力:指导下一步数据采集方向,以及将数据集验证转化为可控可归因的实验。实验表明,我们的方法持续超越经验基线方法。此外,在小规模代理上发现的最优比例可直接迁移至更大规模场景而无需重新调参。仅使用800亿额外多模态持续预训练token,我们的VLM即可与使用显著更大多模态预算训练的强开源模型相匹敌。
视频生成技术的进步不断缩小着人工智能生成画面与专业制作镜头之间的视觉差距,然而,多数基准测试仍从网络来源或大语言模型模板中抽取提示词,并使用未经训练的通用多模态模型进行评分。更根本的是,其评估分类体系仍停留在初级水平(整体视觉质量、粗略的文本对齐和时间平滑度),而非电影实际制作与评判所依据的专业电影语言标准,因此它们评估的是基础视频合理性而非电影级别的工艺。我们提出FilmBench,一个基于电影学院传统专业电影语言的文本到视频(T2V)及参考视频到视频(R2V)基准,由北京电影学院与互境数字传媒娱乐集团电影工作室的导演和教授共同开发。它基于三个设计选择。第一,提示词由获奖影片片段逆向推导而来,涵盖20种电影类型并由专业导演挑选,因此每个提示词都基于经过验证的真人实拍参考;提示词遵循真实的镜头列表,且多数描述多个镜头(1,169条提示词中有1,056条为多镜头),这与先前仅单镜头的基准不同。第二,评估采用三级电影分类体系,包含3个轴、12个组件以及35个(T2V)加3个(仅R2V)子指标。第三,我们开发了内部专家级自动评估代理,并开源其核心电影语言算子套件(FilmOps)。通过对主流视频生成模型(9个T2V模型,7个R2V模型)进行基准测试,该评估器在模型级别复现了人类排名,Spearman相关系数ρ=0.95(T2V)和0.96(R2V)。得分远低于先前的网络风格基准,在动态美学方面存在两个一致差距,且从单镜头到多镜头的性能显著下降,较弱模型的下滑幅度更大。
如今改进语言模型仍意味着重新训练:巨大的算力消耗、每个周期产生一个新的不透明模型、以及非确定性输出。我们选择了一条相反路径:模型保持冻结状态,而在其旁侧不断积累已验证解决方案的持久化记忆。一旦某个问题族被解决并通过了从不查阅答案库的独立验证步骤,该族的每个新实例都能以零生成令牌、比特精确、确定性的方式得到解答。在跨越九大问题族的180个全新实例上,来自四家供应商的四种架构(包含密集模型与混合专家模型)均以每个答案零生成令牌获得180/180的完美得分:执行绑定的能力从此与参数规模解耦。阴性对照实验将全部能力归因于该记忆库——一旦清空记忆,系统便无法解决任何问题。同样的"先验证后存储"协议也适用于开放式推理:四种模型均达成88/88的一致性门控接受率、机器检验的形式化证明,以及77/80的推理方法迁移率。记忆选取耗时1.4微秒;一次完整重用在36毫瓦时功耗下仅需6-23毫秒。在包含4500项已验证条目的记忆库中,近似相似性检索的错误率达94.3%,而精确寻址则完全零错误。该记忆库还能作为工作上下文使用,其规模远超任何已部署引擎:在单块46GB GPU上以扁平内存实现600万令牌的可移动窗口,而vLLM在30,399令牌处停止,SGLang则在超过32,000令牌时静默截断。在公开基准测试中,前沿模型在原始从头推理能力上仍远超任何120亿参数模型;但对于本系统已解决并验证的所有任务,对比结果完全反转:前沿模型API调用每次查询都要执行全新的生成过程,而已验证重用的成本为零令牌,且每次返回完全相同的比特。本报告附带一个提供免费限流访问的公开测试平台:https://corbenic-galahad-bench.hf.space
人体头部参数化模型是传统计算机视觉与图形学中用于动画、渲染和重建的重要工具。近年来,它们还作为生成式大型视觉模型中的关键条件信号,能够对生成图像实现精准的空间控制。然而,现有公开模型通常在解剖学范围上存在局限,仅建模外部几何结构,忽略了口腔内和眼部结构,且常因低保真度输入数据集导致几何质量下降。本报告提出一种名为生成式人体测量模型(GNM)的新型参数化模型,其名称与人类基因组同音。GNM涵盖头部、面部、颈部、眼球、牙齿和舌头,并基于大规模高分辨率三维扫描数据库及高质量解剖学专家手工样本构建。本报告详述数据来源、模型架构(包括眼部和口腔内结构的专用子模型),并展示其在三维面部扫描拟合方面的最先进性能。为促进社区创新,完整的GNM框架已公开发布。
历史文献作为宝贵的知识档案,常因物理退化和损坏导致字迹模糊难以辨识。现有基于掩码语言建模的修复方法虽能有效利用局部上下文,但在需要外部历史知识的名词实体复原方面存在局限。为克服这一缺陷,我们提出一种基于检索增强生成的大型语言模型历史文献修复框架。通过融合预训练语言模型的内隐知识与显式检索获取的外延上下文,我们的ARI模型有效解决了依赖上下文之专有名词推断的难题。在朝鲜半岛历史文献上的大量实验表明,本方法显著优于基线模型,在通用字符与命名实体修复方面均实现显著提升。此外,包含专家评估在内的综合评测证实,ARI可作为领域专家的实用工具,有望加速历史档案的分析进程。
我们提出了一套用于自动化研究系统的术语表,这些系统由一个或多个智能体构建,旨在使设计选择更易于描述和比较。该术语表明确了:1) 智能体是谁;2) 系统中可用哪些操作;3) 谁可以调用这些操作;4) 智能体如何通信;5) 单次运行及多次运行间哪些信息可见;6) 如何选择下一步行动;7) 如何启动一次运行;8) 如何评估输出结果。轨迹记录的是从输入任务到最终产出物的完整运行过程。由于智能体、操作和初始化过程可能具有随机性,同一任务上的多次运行会在轨迹上形成分布,而非单一行为模式。 我们的术语表将结构性设计问题(例如智能体何时通信、何时获得或失去某项能力、何时跨运行传递信息)转化为可检验的选项。同时,它将评估器纳入系统组件,因为报告的性能提升取决于代理评分与真实质量之间的匹配程度。这种拆分也将“这些系统缺乏品味”这一模糊批评分解为两种具有不同解决方案的失效模式:生成品味指系统在观察到任何评分之前提出新颖轨迹的速率;评估品味则指代理评分与应匹配的真实质量之间的差距。我们以近期自动研究系统为例实例化该术语表,以证明其能够覆盖结构差异显著的设计。
可靠的视觉文档理解要求模型将每个答案归因于支持该答案的证据区域。近期基准测试和系统通过坐标接口实现这一步骤:模型输出标注文档中证据区域的边界框坐标。在此接口下,视觉语言模型即使答案正确也常无法识别正确区域,这种失败被称为归因幻觉。本研究探讨了这种失败是否部分受限于模型通过坐标所能表达的内容。我们在经过验证的双语CiteVQA子集上,将坐标接口与语言接口进行比较:后者模型仅输出文本并逐字引用证据,通过多模态检索器将每个引用的位置返回为布局解析器建议的页面区域(表格和图表通过标题或注释引用);该比较在六种开放视觉语言模型上重复进行。与坐标接口相比,证据召回率从最高8个百分点提升至26至47个百分点之间,归因幻觉率约降低一半,而答案质量几乎没有变化。基于此比较,我们使用相同的引用-检索流水线作为训练支架:由于为长文档收集区域级证据标签成本高昂,我们引入了一种GRPO策略,其奖励为裁判对标准答案和检索区域裁剪结果的解读,训练模型在无需任何区域标签的情况下生成更好的证据引用,将8B骨干模型的严格归因准确率从22.4提升至33.8。这些发现指明了一条实用路径——无需坐标接口和昂贵的区域级监督即可改进归因。
大型语言模型(LLMs)已革新了对话式人工智能,但高质量的多语言代码混合对话资源仍然稀缺,尤其是在印度语言场景中——说话者自然地在英语与母语之间切换,且同时使用本土文字和罗马化形式。我们提出IndicTalk,这是目前规模最大的多语言印度语言代码混合对话语料库之一,包含超过1,328,604个基于事件驱动的多轮对话,覆盖9种印度语言的18种语言变体。该语料库通过全自动流水线生成,结合了真实世界新闻事件驱动、基于多语言LLM的角色条件化对话生成以及自动化质量验证。广泛的语言学评估、自动评估及人工评估结果表明,IndicTalk在两种文字变体下均能生成流畅、连贯且自然的代码混合对话。我们将开放IndicTalk数据集,以支持代表性不足的印度语言多语言对话人工智能的开发与评估。数据集获取地址:https://huggingface.co/datasets/LingoIITGN/IndicTalk。
大型视觉-语言模型(LVLMs)仍受制于庞大的计算开销,难以部署在资源受限的边缘设备上。现有LVLMs压缩工作主要聚焦于视觉令牌压缩或更小的语言模型,但视觉编码器却被严重忽视——其通常以单块计算密集型特征提取器的形式部署。此外,此前尚无研究针对设备端延迟直接优化设计LVLMs的视觉编码器。本文提出UltraViT,一种专为设备端性能显式设计与优化的LVLMs视觉编码器。具体而言,通过考量实际设备端延迟,我们系统性地设计了一种金字塔架构,在宏块层面策略性地集成并适配异质空间混合器。为预训练UltraViT,我们提出新型两阶段生成式预训练策略:首先通过密集蒸馏培育丰富的空间特征,随后由混合容量冻结大语言模型进行直接生成式监督。相较于标准对比学习和自监督学习,我们的预训练方法在实现UltraViT所需的高层级语义锚定方面更为高效,为后续LVLMs训练的生成式多模态对齐奠定基础。大量实验表明,结合设备端延迟感知设计及定制化训练策略,UltraViT在高效LVLMs编码领域达到新高度,显著超越现有以编码器为中心的基线方法,同时以近1.7倍的速度在设备端运行。
参数化检索通过为每个API分配唯一的虚拟令牌,并训练模型通过受限集束搜索生成这些令牌,使大语言模型能够隐式检索工具。工具感知指出该机制存在两个关键缺陷:训练过程会破坏参数化工具知识,且其集束搜索解码速度过慢,难以满足实时部署需求。我们提出TRACE(基于增强思维链与企业规则的工具检索),这是一种通过两阶段课程学习解决该分离问题的方法。第一阶段复用工具感知中的多格式记忆化监督微调,利用低秩适配植入工具知识。第二阶段是我们的核心贡献:模型在生成JSON格式工具令牌列表之前,需要输出思维追踪过程,训练数据包含两类来源——工具感知中的RRB对,以及针对领域专家整理的业务规则所合成的查询——均附有推理追踪标记。该训练目标在保持第一阶段多项选择提问和问答探测准确率的同时,可实现生产级延迟下的单光束贪婪解码。在涵盖两个企业产品线共8300+工具的企业级工具库评估中,TRACE第二阶段训练不仅保留了工具理解能力,更实现了性能提升:与第一阶段相比,多项选择提问准确率提升3.2个百分点,问答探测准确率提升9个百分点。在检索任务中,TRACE在领域A上达到约86%的召回率,在领域B上达到约60%——相比之下,嵌入基线仅有约27%和52%——均采用单光束贪婪解码,可直接部署于生产环境。
近年来的许多机器人政策倾向于使用大型预训练视觉语言模型(VLM)作为动作主干,以实现更强的控制能力。为此,我们提出了WorldDiT——一种统一的扩散变换器架构,该架构将动作生成与视觉世界建模相结合,无需大型预训练VLM动作主干即可实现出色性能。在训练过程中,单个扩散变换器能够生成连续的动作片段,并从未来摄像头帧中预测归一化的RGB图像块目标。在四个LIBERO仿真套件中,WorldDiT在报告所有四个套件结果的方法中,其总模型参数与平均成功率均位于帕累托前沿。这些结果为未来的规模化研究提供了强有力的次十亿参数基线。
自Volta架构引入独立线程调度(ITS)以来,NVIDIA GPU一直被普遍认为以固定方式处理线程束分歧。我们以引入ITS之前的Pascal架构为基准,在Ampere、Hopper以及数据中心和消费级Blackwell GPU上验证了这一假设。通过结合周期精确的微基准测试、硬件计数器和编译器生成的SASS静态分析,我们将稳定行为与架构变化区分开来。在所有测试代际中,分歧路径的串行化时间与路径数量k呈线性关系,遵循T(k) ≈ sk,且无超线性再汇聚惩罚。线程束执行效率降至32/k,该惩罚与占用率无关,而断言预测(predication)可消除串行化开销。同样行为在Pascal上出现,表明这一程序员可见的代价模型早于ITS。然而,编译器发出的再汇聚机制已发生实质性变化。Pascal使用基于每线程束的SSY/SYNC指令栈,而后续代际则改用屏障寄存器指令。超越直接后支配点的延迟再汇聚案例从Ampere的29个降至Blackwell的2个。Blackwell还引入了双层汇聚屏障分类、均匀分支指令和显式部分掩码线程束同步,这些在Ampere和Hopper上均未出现。受控位翻转实验表明,新增的屏障分类是静态编译器分类,在我们的测试中未产生可观测的运行时影响。因此,即使NVIDIA的控制流ISA和再汇聚机制持续演进,分歧仍保持稳定且可预测的性能代价。
比特币次日内时间尺度价格预测是计算金融领域一项极具挑战性的开放性问题。比特币呈现肥尾收益、非平稳动态特性,且其价格发现过程受Reddit和Twitter社交舆论影响。传统方法通过静态拼接将OHLCV技术特征与情绪特征进行融合,无论市场状态如何均采用相同的融合权重。这与行为金融学文献的发现不一致——后者表明,零售情绪在波动时期最具预测力,而在平静时期则充满噪音。本文提出“状态感知多模态学习”(Regime-Aware Multi-Modal Learning, RAML),该方法将情绪特征与价格特征的融合置于动态检测的二元市场状态条件下。滚动24小时波动率将观测样本划分为稳定状态与波动状态;一个可学习的sigmoid门控机制可调整情绪嵌入相对于价格嵌入的权重,在波动期更信任情绪特征,在稳定期则更信任价格动态。该系统基于3,491个小时观测数据(2024年7月至2025年9月)进行评估,结合了比特币OHLCV数据与Reddit /r/Bitcoin子论坛的FinBERT情绪。对比了四种模型——仅价格BiLSTM、仅情绪分类器、静态拼接BiLSTM以及RAML——分别针对3小时和6小时预测窗口,并通过消融实验单独检验情绪分支、状态检测与自适应融合的效果。RAML在3小时窗口上达到0.5474的宏平均F1分数,在6小时窗口上达到0.5513,并在3小时窗口上取得最高AUC(0.5084),表明其校准更优。消融实验证实每个组件均不可或缺,若将自适应加权替换为静态拼接,则6小时窗口上的召回率崩溃(F1: 0.14)。这些结果确立了状态条件自适应融合作为多模态金融预测的必要设计原则。
驾驶风格捕捉了车辆驾驶中稳定且具有驾驶员特异性的模式。然而,在自然驾驶数据中,这种信号难以分离,因为驾驶员是在不同车辆、不同道路及不同条件下被观测的,因此模型可能将车辆或情境的特定规律误判为驾驶员的特异性风格。我们提出了DriveDNA,这是一个用于个性化驾驶风格建模的大规模自然数据集和基准,包含来自465名驾驶员的4121次行程,覆盖115种车型,总计975小时由人类驾驶的10Hz频率数据(含前视视频),数据采集自社区驾驶员的日常使用场景。DriveDNA将驾驶风格定义为:在相似条件下,车辆运动过程中表现出的稳定且具有驾驶员特异性的行为模式。该基准通过三个核心任务评估这一信号:少样本驾驶员重识别、个性化行为预测以及条件匹配比较,并提供行为标注及经大规模人工审核的276,248个规则生成事件(涵盖六类机动事件)。我们在固定多种子协议下评估了涵盖经典描述符、监督与自监督时间序列编码器、多模态融合、概率预测及零样本基础模型的基线方法。学习得到的表示在未见驾驶员上显著优于经典描述符(AUROC 0.935 vs. 0.707),并在匹配驾驶条件下保留了驾驶员特异性信息,而描述符性能接近随机。仅使用视频的模型在重识别精度上表现相当,但存在严重的路线泄露问题,表明强识别能力可能源于情境捷径而非驾驶行为。这些发现表明,可靠的驾驶风格评估必须同时评估学习表示的行为价值及其对车辆、行程和条件混杂因素的鲁棒性。
近年来,强大的文本到图像生成模型的进步,使得开发测试时方法以修改采样轨迹,生成更符合复杂组合提示的图像变得日益重要。我们提出TILT,一种无需训练的框架,通过测试时奖励对齐实现组合文本到图像生成。我们将组合失败解释为联合概念分布与单一概念分布之间的重叠模式,并定义一种奖励,优先选择所有概念同时存在的样本。该奖励基于基础模型自身,无需任何外部监督或奖励模型。这产生了一个KL约束目标,具有封闭形式的倾斜目标分布以及用于扩散采样的原则性引导步骤。概念分布与上述奖励的相互作用自然导致了两种不同的引导策略,而平衡两者优势的混合方法则产生了更强的性能。在T2ICompBench的提示上进行的实验表明,与先前基线相比,我们的方法在保持图像质量的同时,改善了组合对齐。