每日精选AI研究论文及翻译
在线策略蒸馏(OPD)提供密集的token级监督,作为可验证奖励强化学习(RLVR)中稀疏结果级优势的替代方案。然而,教师对学生生成的轨迹进行评分,而这些轨迹本质上对其而言是离策略的,因此其监督的可靠性,以及学生改进的来源,仍不清楚。我们定量分析了OPD训练过程中的教师监督,发现存在大量噪声,且其普遍性随教师规模增大而增加。令人惊讶的是,学生策略对此类噪声不敏感,无论保留还是移除噪声监督,均能收敛到相当的性能。OPD究竟是否在进行蒸馏?通过分析其收益的驱动因素,我们发现学习集中在低对数概率的token上,且使用单一固定的负优势值即可达到与教师提供的优势值相当的性能。这表明OPD主要通过抑制低对数概率token来发挥作用,而这一过程并不需要教师。这些发现催生了在线策略自适应(OPSA)——一种利用熵自适应负优势值的无监督方法。它对高熵位置施加更强的学习信号,抑制尾部token,并在头部token之间均匀重新分配概率质量。与基础Qwen3-1.7B相比,OPSA在AIME24上将Avg@32提升了35.41分,对应263%的相对提升,并且在所有三个基准上将Pass@32提升了一倍以上。在AIME24上,其Avg@32还比OPD高出16.77分。跨模型家族和任务的大量实验与分析进一步证明了其有效性和泛化能力。
近年来的视频生成器往往省略音频,或在独立阶段合成音频,限制了对视觉动态与声学事件的相互建模。我们提出DreamX-Creator 1.0,一个以7B参数生成器为核心的轻量级原生联合音视频生成系统。该系统以首帧和文本提示为条件,对模态特化的音频流与视频流进行联合去噪。两条流在网络前半部分独立处理,在后半部分通过门控跨模态注意力进行耦合,其中令牌级和注意力头级输出门控分别调制每个活跃跨模态注意力头的输出。统一音视频数据系统构建并筛选时间连贯的视频片段,生成结构化的多模态标注,并将片段组织为面向能力的数据池。渐进式联合训练包含两个音视频预训练阶段,随后进行高质量微调。音视频强化学习进一步通过模态感知的多模态反馈对生成器进行后训练,将视频、音频及跨模态反馈分别路由至对应数据流。针对高分辨率输出,我们的自回归单步2K细化流水线将双向多步教师模型适配为自回归多步细化器,并将其蒸馏为每个时间块仅需一次去噪评估的学生模型。总体而言,DreamX-Creator 1.0实现了原生、同步的音视频生成,性能可与最先进的开源系统相媲美。通过发布我们轻量的7B生成器与2K细化器,我们致力于推动原生音视频生成的普及,并为统一的音视频生成建模未来研究提供可访问的基础。
可组合场景建模旨在将真实室内场景恢复为按观察排列的完整、可编辑对象资产,从而为机器人仿真和具身人工智能提供真实环境的可直接用于仿真的副本,其中每个对象均可独立操控。现有流程将该任务分解为三个步骤——将观测解析为实例、为每个实例生成资产、并将每个资产放回原位——但每一步都预设了杂乱采集难以提供的输入:精确的实例几何、无遮挡的视角以及与观测精确匹配的资产。我们提出Lucida,它保持这一顺序但重新分配需求,使得每一步仅消耗真实采集可靠提供的信息,并且精度在流程末端达成,而非在起点就被要求。Lucida将视频解析为一个场景图,其节点携带每个实例的多视角证据;然后从这些证据为每个实例生成完整资产;并使用GizmoAct放置资产。GizmoAct是一种视觉语言模型(VLM)策略,它将放置任务转化为多轮GUI交互,在闭环中操控对象的gizmo(变换控件),并自行判断何时达到对齐。在场景级3D目标检测、对象姿态估计和场景重建中,Lucida在R2S-Scene上将mAP相比Boxer提升了69%,在CA-1M上将ADD-SB@0.05从57.8%提升至83.4%,并将场景F-Score从SAM3D的0.794提升至0.924。
潜在生成模型通常采用两阶段流程,先训练变分自编码器进行重建,然后在冻结的潜在空间上训练生成模型。由于针对重建优化的潜在表示不一定有利于生成,联合训练两个模型是一种有吸引力的替代方案。然而,直接端到端训练仍然具有挑战性,因为它容易发生潜在坍缩,并面临生成-重建冲突。我们通过分析不同目标如何塑造潜在空间来重新审视这一问题,并提出了两个关键见解。首先,KL散度目标中的熵项对于防止坍缩至关重要:重建和先验拟合倾向于收缩后验,而熵则保持非退化的潜在不确定性。其次,重建和生成表现出不对称的学习动态:重建速度快且受到强监督,而生成则更慢且更难优化。基于这些见解,我们实现了首次无需潜在坍缩的直接端到端训练,并提出了GenFirst,一种简单的先生成后重建策略。生成目标首先在弱重建压力下塑造潜在空间,然后逐步加强重建以恢复视觉细节。我们使用具有精确似然的连续自回归先验和具有隐式似然的SiT先验来验证GenFirst。借助我们的端到端目标和GenFirst,SiT在ImageNet-256上实现了有CFG时gFID为0.97、无CFG时1.45的成绩,而MMDiT在文本到图像生成任务上达到了GenEval得分0.90。除了图像生成之外,我们将该框架扩展到用于生成和表征学习的共享视觉潜在表示,以及连续的统一文本-图像生成。这些结果证明了稳定的端到端潜在学习跨不同生成先验和模态的通用性。
尽管低秩适配(LoRA)被广泛用于参数高效的模型适配,但如何规范化其训练动态以实现稳定且有效的优化仍缺乏充分研究。由于LoRA将上投影初始化为零,其早期的优化动态主要由下投影决定。基于这一观察,我们提出了归一化低秩适配(NoRA),这是一种简单而有效的方法,在训练过程中对下投影矩阵进行归一化。我们进一步表明,相同的归一化可以仅在初始化时应用,从而改进标准LoRA,而无需在整个训练过程中反复归一化。在预训练、监督微调和强化学习中,NoRA一致地加速收敛、提升性能和训练稳定性,并缓解灾难性遗忘。这些优势既不需要额外的可训练参数,也不需要推理时的计算开销,使得NoRA成为一种简单且广泛适用的LoRA增强方法。
研究规划是AI科学家的决定性能力。然而,研究规划不存在可验证的答案,因此强化学习缺乏其所需的环境:任务与评价器的配对。从科学论文中提取的评分标准可以提供评价器。然而,现有流程从相同内容中提取问题和评分标准,因此可以通过释义获得奖励。评分标准进一步被压缩为每次轨迹的单一标量。我们提出PaperGym,一个将每篇研究论文转化为完整训练环境的统一框架。PaperGym利用论文的结构:问题从研究目标和背景中综合生成,而评分标准则从方法和实验中推导得出。评分标准涵盖方法论创新和实验设计,标准泄漏率降至3.7%,而现有数据集为11.90%至34.10%。训练过程中评分标准被使用两次:首先作为OPSD自教师模型的特权上下文,然后作为GRPO的奖励。在Qwen3-1.7B/4B/8B上,该训练方案优于监督微调、任一单独阶段以及相反顺序,将五基准平均值分别提升+5.6、+5.0和+4.8个百分点。在训练方案保持不变的情况下,基于PaperGym-20k训练的模型在三方比较中获胜58.1%,而RubricHub Science为28.2%。训练后的Qwen3-8B在ResearchQA上达到73.48,超过了规模大得多的Kimi K2.6。我们发布了该流程、包含20,000个实例的语料库PaperGym-20k,以及基准PaperGym-Innov和PaperGym-Design。
我们描述了Qwen3.8-Flash-Next的架构与消融实验。这是一个稀疏混合专家模型,拥有125B参数,每个token激活6B参数,另有51B参数的n-gram嵌入表存储在加速器之外。在十四个预训练基准上,该模型在八个基准上领先其前身397B-A17B,在其余基准上最多落后2.6个百分点,而激活参数仅为前者的1/3,训练token数为1/3,训练FLOPs约为1/9。Token混合采用逐层混合的Gated DeltaNet(GDN)与全局注意力,每四层中设置一层全注意力层;在继续预训练阶段,这些全注意力层被替换为Qwen稀疏注意力(QSA),后者通过压缩轻量级索引器以微块粒度对上下文进行评分。残差流被扩展为四个分支,并通过逐元素门控读取,我们将这种设计称为门控残差(Gated Residual,GR)。容量通过单个n-gram嵌入层在主干之外增加,该层的表从主机内存预取。我们沿三个维度评估每个候选改动:损失及下游基准;改动在训练、预填充和解码中的成本;以及其对最优超参数和训练稳定性的影响。损失与下游准确率并不总是同步变化:增大n-gram词表会单调降低损失,而下游准确率趋于饱和。该架构与Muon优化器共同将最优学习率和批大小上移,使得批大小预热不再必要,并显著提高了压力测试下的稳定性。损失、基准、效率和稳定性构成一个统一的设计问题。联合求解后,得到的方案同时更高效、能力更强且更稳定。
我们提出CogEvol,这是一个专门针对学习环境生成(Learning Environment Generation)任务训练的模型系列:将课程简报一次性转化为完整的学习产物(结构化JSON幻灯片或自包含的交互式HTML页面)。在22万次生产请求中,CogEvol生成一张幻灯片的中位耗时为17秒,生成一个交互式页面的中位耗时为59秒,取代了此前耗时数分钟的多轮智能体脚手架流程。可靠性不是寄望于偶然,而是通过机制加以保障:一条基于生产数据的流水线将真实失败案例转化为53,687个经过验证的SFT样本,混合规则加VLM奖励驱动基于GRPO的强化学习——我们在发现并修复了一次产生视觉上可信但无法游玩的游戏的奖励黑客事件后,对该流程进行了加固。CogEvol-27B在幻灯片质量上取得83.7分,在500个案例的交互式HTML基准测试上取得63.7分,参数量仅为旗舰级编程模型的二十六点九分之一,并与OpenMAIC团队合作,服务于其生产环境的实时流量。CogEvol-4B已在Apache 2.0许可证下开源,地址为https://github.com/CogEvol/CogEvol-4B;外部旗舰模型在相同测试套件和完全相同的评测框架下进行测量。脚手架编辑可将交互式页面的生成成本进一步降低约76%,且整个技术栈可在国产昇腾加速器上运行,应用层面的性能与A800 GPU持平,从而在大规模场景下降低AI原生教育的单位成本。
大型语言模型(LLMs)在数学推理基准上表现出色,然而支撑其推理的具有数学意义的技能仍未得到充分探索。我们提出SHAPE,一个通过数学教育中发展出的两个视角来分析思维链(Chain-of-Thought, CoT)轨迹的框架:(1)语义空间:模型对问题不断演化的数学解释(如代数、几何);(2)启发式策略:模型在这些空间内采取的具体数学行动(如简化问题、倒推求解)。我们首先使用SHAPE分析多种模型的推理模式。研究发现,相较于传统的CoT特征,模型所采用的数学启发式策略能更好地解释最终答案的正确性。此外,模型倾向于将推理努力集中在少数几个语义空间内,而非探索许多彼此不同的空间,从而更有可能得出正确答案——这一模式与人类行为一致。接下来,我们利用SHAPE视角评估后训练是否真正提升了数学能力。我们发现强化学习会在启发式使用中诱发模式寻求(mode-seeking)现象。最后,我们通过促进启发式的多样性对LLMs进行后训练,并证明其在提升准确率方面的有效性。总体而言,SHAPE为解码LLM推理提供了一个有理论基础的诊断框架,并为面向数学推理的LLM后训练开辟了新路径。我们模型的代码可在https://github.com/holi-lab/SHAPE-of-CoT获取。
具身导航要求智能体在异构目标与视觉观测之间建立映射,并据此在不同任务、环境和机器人形态中生成动作。现代视觉-语言模型(VLM)已编码了用于视觉定位、空间推理和指向的空间先验,但这些能力很少被直接激发用于机器人控制。现有导航系统反而依赖任务或形态特定的组件,将感知、推理与动作割裂开来,且泛化能力有限。为此,我们提出LightNav-0,一种紧凑型通用具身导航模型,它激发预训练VLM的空间智能并将其与导航对齐,无需任务特定的预测头。LightNav-0通过统一的标记接口表征多样化的导航任务:双通道指向表达与任务、场景和形态无关的空间意图,而残差向量量化动作分词器将该意图映射为精确的、形态特定的轨迹。结合时间感知的视觉历史压缩、ER中期训练、监督微调和强化学习,该框架在单一模型中同时支持指令跟随、开放词汇目标导航和视觉跟踪。导航训练语料库涵盖2000余个场景和4000余小时的具身导航数据。用于初始化LightNav-0的具身推理检查点LightNav-ER在8个具身推理基准上取得了最高的完整集合平均值,而LightNav-0在全部10个公开导航仿真设置中实现了最优的单目成功率。真实世界评估进一步证明了其在机器人形态、多样场景以及静态和动态目标上的零样本泛化能力。这些结果确立了紧凑型VLM作为通用具身导航统一且可迁移骨干网络的可行性。
组织通常开发和维护相关应用程序的组合:这些程序是独立可部署的代码库,但共享大量领域逻辑、接口模式或操作惯例。随着大语言模型编码智能体日益广泛地用于生成和维护这类软件,一种朴素的逐应用程序工作流会在各代码库之间重复共享逻辑,并使长期的智能体式维护积累冗余、死代码和结构退化。我们提出了“超级库智能体问题”(Super Library Agent problem):智能体在依次生成N个相关应用程序组合的同时,维护一个可复用的跨应用组件共享超级库(Super Library)。最小化顺序脚手架原则上可以提取共享代码并将应用程序迁移到不断演化的库中,但在实践中存在提取召回率低和依赖迁移脆弱的问题。我们通过基于代码块摘要的候选引导提取、提取前的代码库整合,以及利用提取轨迹和调用图信息的上下文感知迁移来解决这些不足。在WebGen-Bench和PaperBench上,我们的方法在保持应用程序功能的同时,显著降低冗余和令牌占用(冗长度、令牌长度),优于零样本方法;同时避免了朴素库构建引入的结构退化,并在代码行数(LOC)和最小描述长度(MDL)上也得到进一步缩减。我们的代码可在 https://github.com/sbigstar0310/super-library-agent 获取。
尽管大语言模型(LLMs)通过整合用户个性化信号来提升可用性与帮助性,但当它们以对话历史、推断偏好和用户画像等个人情境为条件时,正日益从提供平衡、信息丰富的回复转向优化用户满意度。具体来说,我们识别出三种新兴风险:(1)无关个性化,即模型在不必要的情境下引用个人信息;(2)偏好窄化,即模型强化信息回音室;(3)谄媚偏差,即模型过度认同用户观点。因此,模型可能在不必要的情境中引用个人信息,无意中削弱响应多样性,或过度认同用户观点。尽管个性化在AI助手中的应用日益增长,但对其潜在副作用的系统性评估仍然有限。为弥补这一差距,我们提出了PRISK——一个结合自动化数据生成和定制化指标的动态评估框架,用于揭示当前LLM个性化中的系统性局限,以及个性化信息如何影响其响应。我们对13个LLM的实证分析表明,用户画像和检索到的记忆的存在持续加剧偏差,导致无关个性化平均下降45.9%,偏好窄化下降41.7%,谄媚偏差下降61.7%。
近期,大型推理模型(LRM)的进展表明,基于可验证奖励的强化学习(RLVR)能够显著提升数学和代码领域的推理能力,因为这些领域的结果可以自动检查。然而,将这一进展推广到开放式和智能体型任务仍然困难,原因在于可靠的奖励更难获得,且直接的人类监督无法跟上模型生成经验的规模与复杂性。本文研究当人类监督逐渐退出学习循环时,LRM如何持续改进。我们考察了这个问题的两个相互关联的维度。奖励轴追踪了从逐实例人工判断到可复用验证器、乃至无需人类反馈即可运作的奖励的发展历程。经验轴则考察学习如何从人工策划的任务与环境,演进到自生成课程、构建的环境以及自主共同进化。我们通过一个从L0到L4的五级阶梯连接这两个维度,该阶梯识别出学习过程中哪些部分仍然处于人类的持续控制之下。我们的分析进一步强调了日益自主的奖励和经验生成所带来的风险,包括奖励破解、反馈漂移、课程崩溃和环境错误。因此,我们还提供了围绕三个互补对象的评估:策略能力、反馈保真度和经验质量。这一分析为当前在超越人类监督条件下扩展LRM的方法,以及为迈向超级智能而开发自我维持学习系统所涉及的开放问题,提供了结构化的阐述。此外,我们维护了一个持续更新的GitHub仓库(https://github.com/visitworld123/Awesome-Scaling-LRM-Beyond-Human-Supervision),以跟踪最新进展。
大语言模型(LLM)与视觉语言模型(VLM)代理的策略性欺骗已成为AI对齐与安全领域的核心关注点。社交推理游戏(每位玩家持有隐藏身份,并通过相互交流来推断他人身份)构成了经典测试环境,尤其是在多智能体场景中。然而,现有测试环境仅支持文本模态,且运行于单一固定代理配置之上,既缺失了欺骗分类学所视为核心的非语言感觉运动通道,也使得观测到的行为究竟是反映底层模型还是外部框架变得模糊不清。我们提出了MineAmongUs——一个3D多模态《Among Us》沙盒环境,其中伪装者代理必须通过语言与非语言联合行动来欺骗船员。我们还提出了ARIA——一个可配置的VLM代理框架,暴露了五个认知组件消融轴;以及一个基于欺骗分类学、由LLM-as-a-Judge以接近人类水平的原子标签一致性进行规模化实施的原子级与弧级标注方案。实证结果表明,VLM代理通过语言与非语言联合欺骗来追求伪装者的胜利,且非语言通道在框架消融和跨VLM评估中均被证明是更具决定性的致胜因素。总体而言,我们的工作为具身VLM代理的对齐研究开辟了新路径。
交互式世界模型将视频生成从离线片段合成扩展到交互式虚拟世界的持续仿真,从而支持游戏、机器人、具身智能体和扩展现实(XR)等应用。然而,实现稳定的长时程交互生成仍具挑战性,因为模型必须同时保持场景几何、动态一致性以及相机控制,并支持实时自回归生成。在Matrix-Game 3.0的基础上,我们提出了Matrix-Game 3.5(如图1所示),通过三项关键改进,将实时交互式世界生成推进到几何感知且长时程一致的仿真。首先,我们提出一种统一的几何感知记忆框架,其补丁记忆(patch-memory)和分块式RoPE(tiled-PRoPE)组件不引入额外的可学习参数,将显式3D补丁检索与投影相机条件相结合,从而实现几何一致的相机控制与忠实的长时程场景回溯。其次,我们引入一种静态-动态解耦的世界表示,分别对静态场景几何和动态主体进行建模,从而在长时程生成过程中同时保持几何一致性和主体身份。第三,我们开发了一种两阶段渐进式实时蒸馏框架,通过感知流匹配(Perceptual Flow Matching)和基于课程的自推演分布匹配蒸馏(Self-Rollout DMD),将双向扩散模型转化为少步因果生成器,从而支持分钟级实时交互生成。大量实验表明,凭借涵盖Unreal仿真环境、开放世界游戏和互联网视频的统一训练语料库,MatrixGame 3.5在长时程场景回溯、精确相机控制、主体一致性、提示驱动的世界生成以及稳定实时开放世界交互等方面展现出强大的性能。
自主科学研究智能体日益被应用于端到端的科学工作流程,涵盖文献综述、数据分析、实验和报告生成。然而,开放式研究任务往往并未明确指定完成任务所需的分析、方法和成功标准。因此,智能体可能遗漏重要分析、采用不恰当的方法,或得出缺乏充分证据支持的结论。针对这一问题,我们提出了AutoSciRub,一个评估优先的框架,它在研究执行之前生成特定任务的可执行评估准则,并利用该准则指导执行、准则级验证以及迭代修订。AutoSciRub将表述不清的指令分解为原子化的科学目标,将其锚定于相关文献和任务可见数据,并综合出具体、可操作且可验证的标准。由此产生的评估准则使隐含的实验和证据要求显式化,为实验和分析提供指引。在修订过程中,准则引导的验证能够识别未满足的标准,从而实现对研究报告及其支持性产物的定向改进。在ResearchClawBench上,AutoSciRub一致提升了所有测试配置,在固定Codex执行框架下,三个骨干大语言模型的平均提升为2.08分;在固定使用DeepSeek-V4-Flash骨干模型的情况下,三个智能体执行框架的平均提升为2.95分。在AstaBench E2E Discovery随机抽样的20个任务子集上,AutoSciRub在三个智能体执行框架上进一步实现了平均16.8分的提升,同时保持或增加了成功完成的任务数量。这些结果表明,评估优先的指导为自主科学研究提供了一种有效且可泛化的控制机制(代码:https://github.com/zjunlp/AutoSciRub)。
潜在扩散模型已成为高保真图像和视频合成的主流框架,其在紧凑的潜在空间中结合变分自编码器(VAEs)运行,以提升计算效率而不损害视觉质量。然而,传统VAE对于视频数据并非最优,因为它们采用固定压缩比,无法适应时空内容复杂度的变化。我们提出KATok(Keep-or-Drop?用于紧凑视频表示的自适应标记器),一种基于Transformer的VAE,其整合了一个与潜在标记联合学习的自适应标记选择器。通过将每个标记的内容丰富度评估为保留或丢弃的概率,标记选择器能够有效丢弃信息量低的标记,自然实现依赖于数据的压缩。将自适应标记化应用于扩散模型可能引发空间错位,因为标记丢弃会扰动原始的时空结构。为缓解该问题,我们提出两种位置预测策略:级联生成和联合生成,以确保空间一致性。实验表明,我们的模型在最先进的压缩比下实现了强大的重建与生成质量。对视频数据的进一步分析揭示,这一改进主要通过减少时空冗余和去除信息量低的标记而实现,定量与定性结果均支持该结论。
思维链(CoT)监控假设推理轨迹忠实记录了塑造模型答案的信息。现有的忠实性测试通常将显性偏见线索放置在用户消息中,而智能体可能通过工具返回或原始工件接收到偏好。我们引入了FACE-Eval(线索效应归因忠实性评估),这是一个包含5,100个样本的评估,系统地变化线索位置(用户消息或工具返回)和明确性(直接摘要或原始工件)。我们测量了线索遵循答案中的显性承诺,以及所有带线索样本中的隐性采纳。我们评估了来自8个系列的15个开放权重模型,参数量从4B到1.60T不等。所有模型在工具返回线索上的显性承诺都低于用户消息线索,在隐式线索上的显性承诺也低于显式线索。在全部15个模型上,工具返回线索的隐性采纳更高;在30个模型-渠道比较中,有28个显示出隐式线索的隐性采纳更高。来源归因提示在7个模型上缩小了渠道差距,有时是通过增加用户渠道的隐性采纳实现的;而告知模型其推理将被监控并不能可靠地缩小这一差距。我们还使用了两个转录监控器(GPT-5.6-Luna和GPT-4o-mini)来检测每个系列中最大模型的偏好采纳。在32个模型-渠道-明确性单元中,较高的隐性采纳与两个监控器较低的检测能力相关(皮尔逊r分别为-0.54和-0.78)。这些结果表明,在本文测试的单次调用、预填充工具设置中,当偏好信息通过工具到达或必须从原始工件中推断时,CoT监控的可靠性可能较低。
在部分可观察环境中,人工智能智能体需要协调主动感知与工作记忆,以维护不断演化的感知状态。然而,现有基准测试因引入了物理和控制复杂性,难以单独评估这种感知状态的构建与解释能力。为此,我们提出了MNIST-PRO,这一基准通过将MNIST数字识别转化为一个带回溯约束的、基于瞥视的序列搜索任务,来隔离智能体感知能力。我们评估了十个多模态模型在四种记忆表示下的表现,包括原始视觉历史、文本状态、结构化度量网格地图以及整合视觉画布。尽管模型在完全可观察条件下表现出色,但部分可观察性暴露了明显的性能差距。我们识别出三个不同的瓶颈。首先,感知状态的构建与解释是一项挑战,因为智能体难以整合碎片化的瞥视信息。其次,智能体往往在看到完整序列之前就停止探索。第三,即使面对后续的矛盾证据,模型也常常无法修正早期形成的错误信念。这些结果表明,仅仅获取视觉证据是不够的。智能体还必须能够构建并更新可靠的感知状态。
图像检索传统上被建模为逐点匹配问题,即对每个候选图像进行独立评分。然而,这种原子化范式未能捕捉个人照片集中人类搜索意图的复杂性——用户往往寻求由结构关系约束的紧凑视觉故事,而非孤立的快照。为解决这一局限,我们提出**图像束组合(Image Bundle Composition, IBC)**,一种新范式,将目标从对单张图像排序转变为从海量非结构化照片池中动态组合连贯的图像束。由于目标束并非预先定义,IBC 带来了严重的组合爆炸挑战,并要求对不可分解的联合相关性进行建模。为建立这一范式,我们构建了 **IBCBench**——首个包含 109,467 张图像和 667 个经核实查询的 IBC 基准数据集,并通过半自动验证流水线构建。此外,我们提出 **BundleWeaver**,一种将 IBC 重新表述为查询条件增量超边发现的智能体框架。通过利用大语言模型自适应地搜索缺失的关系角色,并利用视觉-语言模型进行整体束验证,BundleWeaver 能有效导航组合空间。大量实验表明,尽管最先进的嵌入模型和静态分解-重排范式存在关系盲区,BundleWeaver 仍取得了显著的性能提升,凸显了从原子化评分转向动态关系组合的必要性。我们的数据集和代码已公开。
大型语言模型(LLM)智能体越来越多地被部署在长程、交互式且有状态的环境中。在这些场景中,单个错误动作(例如退款了错误的购买)可能导致不可逆的任务失败,必须在其执行前予以拦截。此类失败可能不会在每一次单独运行中出现,但会在多次试验中浮现,因此跨步骤和跨试验的可靠性至关重要。然而,确保智能体的可靠性颇具挑战:即使是前沿大语言模型,也难以为动作可能出错的原因作出解释,尤其是在由领域特定策略支配的冗长且相互交织的轨迹中。近期的许多工作依赖于基于提示的批判智能体,而基于优化的方法缺乏系统化的方式来生成丰富的验证理由以用于训练。我们通过CAST填补了这一空白,这是一个批判感知训练框架,将稀疏的任务结果转化为动作级监督,用于批判学习和策略优化。CAST分析智能体轨迹,以生成结构化的理由,在部分可观测性下解释动作的有效性。由此得到的批判模型被用于构建批判感知的训练数据,以优化策略模型。在动态工具调用基准上微调Qwen3系列模型,CAST提升了跨领域的可靠性,在Retail任务上的pass^4指标上超过GPT-OSS-120B逾10%,并在域外设置的Telehealth任务上额外取得了9%的提升。这些结果表明,批判感知训练提升了LLM智能体在现实动态环境中的鲁棒性。
长时程物理世界智能体必须在推理远期目标的同时,将决策建立在可靠的闭环行为之上。当前的基础模型将这两种能力割裂开来:视觉-语言模型(VLM)能够推断缺失信息并调整高层规划,但在重复的导航落地中仍然脆弱且低效;而导航基础模型(NFM)虽能稳健地执行语义目标,却只能在有界回合中运行,缺乏持久的任务级推理。我们提出了 NavMCP,一个智能体脚手架框架,将 VLM 推理智能体与 NFM 执行器耦合,以实现长时程探索。VLM 决定寻找什么证据、在哪里搜索以及何时停止,而 NFM 则将每个语义子目标落地为闭环导航。三个通道构成了它们的协作:意图通道将证据需求转化为导航调用,观测通道将轨迹展开转换为来源可溯的轨迹证据,记忆通道则跨调用累积发现、负面证据和未解决的目标。这种设计将孤立的导航轨迹展开转变为持久的具身交互,无需对任一模型进行重新训练。在具身问答任务上,NavMCP 在 HM-EQA、MT-HM3D 和 EXPRESS-Bench 上取得了最先进的结果。在匹配智能体与执行器主干网络的情况下,它在 HM-EQA 上比回合制接口高出 14.9 个百分点。在宇树 Go2 机器人上,NavMCP 达到了 78.3% 的成功率,随着任务时程增长,其相对于最强基线的优势从 10 个百分点扩大到 45 个百分点。这些结果展示了将互补的基础模型通过脚手架方式整合为长时程物理世界智能体的潜力。
近期的研究致力于根据论文内容自动生成科学图表(Lin et al., 2026; Zhu et al., 2026a)。然而,在单轮交互中完全满足作者对视觉效果和沟通表达的偏好颇具挑战性:在我们的前期用户研究(N = 14)中,所有参与者在查看初稿后均要求进一步修改,其中 86% 的参与者认为改进后的图表更令人满意。尽管需求明确,多轮工作流程仍未得到充分探索。为弥合这一空白,我们提出了 MTPaperBananaBench,一个面向多轮图表生成的基准测试集,包含 292 幅图像及 3,518 条标注的用户需求。为减少昂贵的人工研究并实现可扩展的基准测试,我们构建了一个用户模拟器,该模拟器在每一轮中识别未满足的需求,并将其中的 k 条转化为自然语言反馈。对需求满足程度和图表整体质量的评估揭示了基线多轮系统共有的两个关键失败模式:(1)质量漂移,即图表质量随轮次增加而逐步下降;(2)遗忘,即先前已实现的功能在后续轮次中丢失。为解决上述问题,我们提出了 PaperBanana-Interact,一种通过内部批评-优化循环来改进图表的多智能体系统。PaperBanana-Interact 在每一轮中持续改进而非降低图表质量,在质量得分上优于基线方法 11.9-18.6 分,并将遗忘现象减少 3.7-6.2 分。
VLM驱动的网页代码自我改进存在一个结构性缺陷:提出修复的模型正是评判该修复的模型,而在该评判者视角下,视觉合理性并不能很好地代表页面是否真正可用。该循环所缺少的是一个VLM无法欺骗的对手方,而浏览器恰恰就是这样一种对手方:它是一个确定性的、可执行的模拟器,能够模拟HTML工件在用户操作下的行为,除名称外,它就是网页代码的世界模型。我们提出WebWorld,这一接口使既有的VLM能够自主地与这个“浏览器即世界模型”交互,并决定哪些交互应成为监督信号。每一轮中,VLM生成一条批评意见,规划器将其编译为类型化的交互契约;浏览器重新执行候选方案,并且仅当目标进展以及此前验证过的所有能力都得到保持时,才签发验收证书;经过认证的转换不断累积,形成一个质量棘轮,而SFT导出唯一能看到的内容正是这一棘轮。在匹配的训练条件下,WebWorld-27B在HTMLBench-400上将Raw-27B提升了5.3分,在MiniAppBench-Val上提升了14.9分,并在交互式HTML生成方面达到了Kimi-K2.6和GPT-5.4等强大前沿系统的水平。同等规模的消融实验表明,浏览器支持的准入机制带来了这一提升:没有证书时,匹配的9B模型提升几乎消失。
思维链(Chain-of-thought, CoT)推理通过允许大语言模型(LLMs)将问题分解为中间步骤,显著提升了其性能。尽管CoT在语言任务中广泛有效,但仅文本CoT迫使模型将视觉问题序列化为笨拙的文本描述。虽然已有处理视觉输入的架构性解决方案,但社区仍缺乏一个大规模、多步骤、自我修正的数据集,用以教导模型在解决纯文本推理问题时如何构建和维持内部视觉工作空间。为解决这一局限,我们提出了CoVA-SFT,这是一个高度结构化的语料库,包含51.9K个样本、超过222K个多模态推理步骤,覆盖5种不同的布局家族和17项复杂任务;同时我们还提出了配套基准CoVA-Bench,包含覆盖相同任务的1,700个保留测试样本,用于可复现的评估。通过提供显式的推理依据表述、智能体渲染和验证循环,CoVA-SFT教导多模态语言模型交错使用文本与视觉抽象。我们验证了该数据集,结果表明在CoVA-SFT上微调的模型在CoVA-Bench上的平均性能超过所有交错CoT基线2倍以上,尽管它们仍不及强大的仅文本CoT基线,这凸显了未来工作面临的开放性挑战。
文本到图像模型学习概念之间的关联——在本文中,即人们的职业(我们称之为角色)——与视觉属性之间的关联。这些关联可能支撑许多观察到的刻板偏见形式。该领域的一个关键开放问题是:当专业角色中人物的视觉表征被置于不同的提示语境中时,这些关联是稳定的还是会发生变化。我们引入了ContextBias,一个受控评估框架,以及ContextBench,一个涵盖92个角色和1,656个语义受控提示的基准测试,旨在隔离上下文变化对角色相关视觉表征的影响。通过在66,240张生成图像上评估四种最先进的模型,我们发现将角色置于语义无关的语境中并不会抑制角色相关的属性;相反,跨角色属性集中度有所增加(合并BI +0.047)。人口统计学线索、特征性服装和角色特定工具在无上下文、相关和不相关条件下仍然高度普遍存在,并且对语义提示重构具有稳健性。场景构图和镜头取景表现出最大的上下文敏感性。这些发现揭示了一种刻板持续性形式,这种形式在无上下文评估中基本不可见,突显了在偏见基准测试中引入受控上下文变化的必要性。代码和数据集:https://huggingface.co/datasets/shaghayegh/ContextBias , https://github.com/Sina-Emami/ContextBias
多模态安全审核需要区分源自视觉内容、用户意图和助手行为的风险。然而,现有的安全机制通常针对单一判断目标进行训练,并将安全评估简化为二元决策。因此,在多模态交互中,风险难以进行比较,模糊案例也被掩盖。我们提出了 SafeAtlas-VL,一个包含 150 万训练实例的数据集,将图像级、请求级和响应级判断置于五级有序尺度上。我们汇集了来自真实世界和合成来源的广泛安全相关数据,并应用了感知分歧的标注流程。生成的数据集涵盖 15 个危害类别和 55 个细分子类别,覆盖了广泛的多模态安全场景。我们还构建了 SafeAtlas-Bench,一个包含 5,000 个保留实例的测试集,用于评估五级预测和连续风险分数。在该数据集上,我们通过目标条件微调训练了 SafeAtlas Guard 系列模型,用于多模态安全检测。我们的模型不仅执行安全等级的五分类,还通过软累积有序头将安全映射为连续分数。实验结果表明,在我们的数据集上训练的防护模型展现出强大的泛化能力:即使不使用其他基准的训练集,它们也能在相应测试集上取得有竞争力的表现。值得注意的是,我们的 8B 模型取得了整体最佳性能,F1 分数比之前的 SOTA 高出约 4%。代码、数据和模型均已发布,以支持进一步研究。警告:本文包含的示例数据可能具有冒犯性、有害性、露骨或令人不安的内容。
投机式解码通过使用一个草稿模型生成候选词元,再由目标模型在单次前向传播中加以验证,从而加速大语言模型推理。验证过程按顺序进行,并且从首个被拒绝的位置起丢弃其后的所有位置;然而,现有的草稿训练依赖于对目标的词元级模仿,并采用固定的逐位置权重,既不反映上述任一性质。我们提出验证感知训练(VAT),一种即插即用框架,它在每个训练步骤模拟验证过程,并将由此产生的接受与拒绝模式转化为监督信号。VAT由两个组件构成:(i)验证头,一个轻量的联合训练二分类器,用于监督草稿模型判断每个位置能否通过顺序验证;(ii)验证自适应加权,它取代固定的加权方案,在样本首个拒绝点之前保持全权重,并将衰减的起始位置重新锚定到该拒绝点。VAT仅修改训练目标,因此可以叠加在现有方法之上,而无需改变草稿架构、目标模型或推理流程。将VAT应用于EAGLE-3和DFlash,在Qwen3-4B、Qwen3-8B和LLaMA-3.1-8B上,平均接受长度最多提升11.4%,端到端加速最多提升8.7%,并在数学、代码和聊天基准上均获得一致改进。代码将发布在 https://github.com/naver-ai/vat。
我们提出BLARM,一种用于视频驱动3D网格动画的前馈方法。给定单目视频和静态物体网格,BLARM预测运动跟随视频的时间连贯动画网格。我们不依赖显式绑定或直接回归高维顶点运动,而是使用一组紧凑的学习得到的随时间变化的刚性运动分量和与时间无关的顶点到分量蒙皮权重来表示动画。这产生了低维形变空间,无需骨架、笼形控制器、蒙皮权重或绑定标注。我们的架构通过分解的时空注意力将几何导出的形变潜变量以视频特征为条件,然后解码由预测蒙皮权重混合的刚性变换。通过轨迹重建、熵正则化和运动感知对比学习进行训练,BLARM生成准确且时间稳定的动画,同时从单目视频中恢复紧凑、可解释的运动结构。
大语言模型能够生成交互式网页界面,但可靠的生成式用户界面要求在用户请求不断演化时保持可执行工件。我们引入EvoGenUI-Bench,一个用于多轮界面维护的基准测试,包含150个五轮任务和750个轮次,涵盖三种场景:信息呈现、可执行交互和基于工具的外部状态。我们在浏览器中执行生成的工件,并使用截图、源码和DOM证据、执行器轨迹以及运行时日志进行评估。除了轮次层面和会话层面的成功率,我们还使用相邻通过保留率来衡量跨轮次保持性。在八个模型中,即使最强的模型也仅达到74.9%的轮次通过率,同时只完成了37.3%的五轮会话;在基于工具的任务上,相邻通过保留率进一步降至52.4%。诊断分析显示,呈现失败集中在信息架构上,交互失败集中在派生状态传播和可供性绑定上,而基于工具的失败还涉及外部状态锚定和需求分解。这些结果将生成式用户界面的评估从评判孤立输出重新定义为测试界面行为、派生状态、外部状态和助手声明在工件演化过程中是否保持同步。
函数向量(FVs)近年来已成为一种有前景的机制,通过注入从上下文示例中提取的任务特定潜在方向表示来引导大语言模型(LLMs)的行为。尽管先前的研究表明,FVs能够在结构化的上下文学习设置中恢复任务行为,但其在语义复杂任务上的有效性以及跨语言泛化能力仍未得到充分探索。我们以多语言多标签情感识别作为具有挑战性的语义分类基准,研究了FVs的跨语言迁移性。具体来说,我们考察了从源语言中提取的FVs是否能在推理期间不提供示例的情况下,在标准干净和扰动零样本设置下引导另一种语言中的任务行为。在多样化的跨语言设置中,应用FVs显著提升了性能,这表明FVs捕获的是与语言无关的、与任务相关的信号,而非纯粹的语言特定词汇模式,并凸显了其作为多语言任务适应的轻量级、可迁移机制的潜力。我们观察到,每个LLM在构建有效FVs时都表现出一个相对稳定的最优注意力头范围,且该模式在不同语言间保持一致。此外,FVs能够部分复现标准少样本上下文学习的任务引导效果,同时避免了处理多个示例的计算开销,使其适用于大规模实际应用。我们的代码可在 https://github.com/yingjie7/cross_lingual_fvs 获取。
强化微调(RFT)日益被用于增强大模型的推理能力,然而其有效性受限于训练数据的选择和使用方式。大多数以数据为中心的RFT方法依赖静态或启发式样本选择,隐含地假设样本的价值在训练过程中固定不变。这忽略了策略学习的非平稳动态,可能导致次优的更新。我们提出了动态重要样例挖掘(DIEM),一个原理性且全自动的框架,使数据利用在整个RFT过程中具有自适应性。DIEM在每一步优化中整合两个组成部分:(i)梯度对齐重要性估计器,高效近似每个样本对策略提升的边际贡献;(ii)约束批量重加权方案,在保持更新的梯度幅度以稳定优化的同时最大化总体效用。在多个推理基准上,DIEM始终优于强静态基线和动态基线。代码将通过 https://github.com/hrtan/DIEM 发布。
视觉指令微调对于提升视觉语言模型的视觉-语言对齐和指令跟随能力至关重要。然而,在固定比例约束下从快速扩展的数据集中识别最优子集仍然是一个重大瓶颈。现有方法主要依赖分布多样性或启发式过滤,但往往忽视了单个样本内部的连贯性。为弥补这一不足,我们提出数据内在一致性(DIC),一种用于量化样本级组件间一致性的自评分指标。DIC包含两个模块:视觉信息一致性(VIC),评估视觉内容与指令之间的对齐程度;以及响应信息一致性(RIC),评估响应相对于指令的连贯性。基于DIC,我们进一步提出数据内在一致性选择(DICS),一种自适应数据选择方法,在不同数据预算下优化高样本内一致性与全局分布多样性之间的权衡。大量实验表明,DICS在多种数据集规模和模型架构上持续优于最先进方法,仅使用LLaVA-1.5-665K数据的25%即可超越全量数据集微调的性能。我们进一步构建了DICS-6M,一个包含600万样本的多模态指令语料库,推动了迄今为止最大规模的视觉指令选择研究;值得注意的是,DICS仅使用其报告训练数据的不到25%即可达到官方InternVL3-8B-Instruct性能的94.52%。代码可在https://github.com/cqu-student/DICS获取。
在大规模视觉-语言模型(LVLMs)中检测幻觉,既需要精确的片段定位,也需要良好校准的置信度分数。微调后的生成式视觉-语言模型擅长识别幻觉文本片段,但存在过度自信和推理延迟高的问题。判别式序列标注器具有确定性的速度和优越的校准性能,但片段召回率较为保守。我们提出了SpanCalib-VLM,一种用于SHROOM-Visions共享任务的混合双系统,它将多模态序列标注器(由XLM-RoBERTa-Large通过交叉注意力与SigLIP视觉编码器融合而成)与我们的微调生成式VLM(Qwen3.5-4B-SHROOM-SFT)相结合。通过联合校准融合策略,生成模型产生的候选片段会被序列标注器提供的校准概率重新评分。在SHROOM-Visions英文评估集上,我们的集成系统取得了0.41的皮尔逊校准相关系数、0.39的总体IoU,其中干净响应IoU为0.91},总体检测准确率为70.7%。我们公开提供模型权重和代码。
近期,基于视觉-语言预训练模型的图像内容编辑工作已被有效扩展到文本驱动的3D场景编辑中。然而,现有的3D场景编辑方案仍存在一些不足,阻碍了其作为交互式设计工具的进一步发展。这些方案通常遵循固定的输入模式,限制了文本输入的灵活性。此外,其编辑能力受限于单个或少数几个2D视觉模型,并且需要复杂的流水线设计才能将这些模型集成到3D重建过程中。为了解决上述问题,我们提出了Hash-Atlas网络,将3D场景编辑重新表述为对2D图集图像的操作,从而实现了2D编辑与3D重建过程的工作流解耦。在此基础上,我们提出了一种基于对话的3D场景编辑方法CE3D++,该方法以大语言模型(LLM)为核心,允许用户输入任意文本并理解其意图,进而促进相应视觉模型的自主调用。此外,我们通过对移动物体施加运动约束将CE3D++扩展到单目4D场景,并通过创建与编辑任务相关的轨迹数据集进一步微调LLM,使较小的LLM能够准确调度多达30种不同的视觉工具。实验结果表明,CE3D++有效集成了多种视觉模型以实现多样化的视觉编辑效果,具备强大的场景理解能力和多轮对话能力。源代码和训练好的模型可在 https://github.com/Fangkang515/CE3D 获取。
端到端天气预报系统直接从原始地球观测生成高技能的全域格点与站点预报,取代了包括数据同化在内的数值天气预报流程,而其成本仅为后者的一小部分。这些系统是确定性的,不提供不确定性信息。在此,我们通过为Aardvark天气模型的每个组件附加一种随机机制,使其成为概率模型:在观测编码器处引入学习得到的、依赖输入的噪声,以捕获继承自观测系统的偶然不确定性;在处理器中引入蒙特卡洛丢弃法,以捕获学习动力学中的认知不确定性。由此产生的嵌套集合通过全方差定律分解将预报离散度归因于上述两个来源,并通过剔除观测流进行交叉验证。概率微调显著改善了平均预报,在变量和预报时效上的平均改进幅度为4.2%。该集合在中长期预报范围内相对ERA5具有良好校准(离散度-技能比率为0.98),其站点均方根误差保持在确定性模型的2.4%以内,同时在每个预报时效上的连续排序概率分数均优于确定性模型,但落后于业务化ECMWF集合预报。编码器分支表现为观测驱动的不确定性。分量归因的不确定性使端到端预报更加透明,这是迈向观测驱动的大气数字孪生的一步。
社交媒体上的多模态错误信息极为普遍、影响显著且危害严重,然而相较于纯文本错误信息,其检测与应对更加困难,且目前仍缺乏充分理解。对其特征与欺骗策略的研究,受到缺乏基于真实世界情境的分类体系以及当前多模态机器学习模型局限性的阻碍,这导致无法在大规模层面实现自动化标注与分析。我们通过三个步骤解决上述不足。首先,我们收集了来自Twitter/X的七种语言的大规模、高质量真实世界错误信息数据集。其次,我们基于对数据的深入定性分析及先前理论工作,开发了一个新颖且全面的多模态错误信息分类体系。最后,我们利用视觉-语言模型(VLM)通过自动化多步骤标注流程将该分类体系操作化,并进行人工验证。我们的新方法揭示了关于社交媒体用户如何将图像与文本结合以在现实中传播错误信息的此前未被记录的洞察,例如,AI生成内容在科技与科学领域尤为普遍,而疫苗错误信息则不成比例地利用新闻机构的图像来彰显可信度。我们的方法与发现为多模态错误信息的针对性检测提供了指导,并表明缓解措施应进行战略性、差异化的制定与应用,而非统一采用。
长序列自回归视频生成面临一个根本性的记忆挑战:在有限注意力窗口下,模型必须决定从不断扩展的历史信息中保留哪些内容。现有方法按时间维度组织记忆,保留近期帧的同时压缩或丢弃较早的帧。我们转而提出RECAP-Forcing,按外观新颖性组织记忆。长视频不仅仅是帧的序列,更是由主体、物体和场景构成的不断演化的阵容,其身份必须在时间上保持一致。我们通过保留新出现内容——如进入画面的主体、去遮挡区域和新引入的场景——首次可见时刻所关联的KV缓存来组织记忆,将新颖性优先于近期性。记忆规模应与新引入内容的数量成正比,而非与视频长度成正比。这种外观索引记忆使得长程一致性成为记忆结构的显式属性。我们的框架在单一原则下统一了两种机制。在视频开头,当所有可见内容均为新出现时,注意力汇聚机制保留初始场景。随着视频演化,基于光流的新颖性记忆库通过选择性地保留新显露的内容来扩展同一原则。作为无需训练且不引入额外可学习参数的推理方法,RECAP-Forcing在多个强基线模型上 consistently 提升了视觉质量和语义保真度,并优于现有记忆方法。