每日精选AI研究论文及翻译
视频理解领域的最新进展涵盖了运动、长视频和流式交互,推动该领域走向实际应用。尽管取得了这些进步,当前的开源模型仍存在若干局限。它们往往难以泛化到多种类型的视频,仅在特定领域有效;高计算需求进一步限制了其效率与可扩展性。此外,大多数模型仅部分开放,关键组件如训练代码、策略或数据集不可用,阻碍了可复现性和社区驱动的开发。为解决这些问题,我们提出VideoChat3——一个完全开放、高效且通用的视频中心多模态大语言模型。VideoChat3通过两个互补设计推进视频理解。在效率方面,我们引入膨胀3D视觉Transformer(I3D-ViT)和面向流式视频感知的自适应帧分辨率,实现了高效的时空表示,并降低了训练和推理过程中处理视频输入的成本。在效果方面,我们开发了可扩展的视频数据合成流程,构建了三个多样化、高质量的训练数据集:VideoChat3-Academic2M、VideoChat3-LV116K和VideoChat3-OL617K,覆盖通用、长视频和流式视频场景,提升了模型跨领域的泛化能力。通过整合这些设计,VideoChat3实现了广泛泛化与计算效率的罕见平衡。在通用、长视频和流式基准测试上的实验表明,VideoChat3仅凭40亿参数和更高效率,超越了同等或更大参数量的先前开源模型。
大型语言模型正越来越多地被训练成交互式智能体,用于处理涉及多轮交互、工具使用和环境反馈的长期任务。基于结果的强化学习提供了一种实用的优化范式,但其稀疏的轨迹级奖励对中间决策提供的指导有限,导致回合级结果与令牌级策略学习之间存在监督差距。我们提出SEED(自我进化的在轨策略蒸馏),这是一个自我进化的框架,它将已完成的在轨轨迹转化为训练时的后见技能,并将其行为效果蒸馏回策略模型中。SEED首先微调策略,使其分析已完成的轨迹并生成自然语言技能,这些技能捕捉可重用的工作流、关键观察或失败规避规则。在强化学习过程中,当前策略既收集轨迹,又充当分析器从中提取后见技能。因此,策略更新同时改进了后续决策和技能分析,使得后见监督能够随策略共同进化。SEED随后在普通和技能增强的背景下对采样动作重新评分,将技能引起的概率转移转化为密集的令牌级在轨蒸馏信号。该信号与基于结果的强化学习联合优化,确保辅助监督与当前轨迹分布保持一致。在基于文本和基于视觉的智能体任务上的大量实验表明,SEED持续提升了性能和样本效率,并展现出对未见场景的稳健泛化能力。我们的代码可在 https://github.com/jinyangwu/SEED 获取。
工具集成大语言模型的最新进展使得网络搜索成为信息获取型智能体的核心能力。然而,随着交互历史的增长,智能体越来越难以追踪任务进度。当搜索尝试未能获得有价值的证据时,现有的单智能体和多智能体系统容易陷入重复循环,浪费搜索预算,最终影响最终输出的质量和完整性。我们提出SearchOS——一种系统级多智能体框架,将脆弱且隐式的搜索进度转化为显式、持久且共享的状态。首先,我们将开放域信息获取形式化为带有引文的关系模式补全,其中智能体发现实体、填充跨链接表的属性,并将每个值锚定到源证据。然后,我们设计了搜索导向型上下文管理(SOCM),将演化中的状态外化为前沿任务、证据图、覆盖图和失败记忆。基于SOCM,SearchOS采用流水线并行调度机制,该机制重叠执行子智能体,并持续用针对未解析覆盖缺口任务填充空出的槽位,从而提高利用率和吞吐量。为了调度和控制搜索智能体的执行,SearchOS引入了搜索工具中间件调控器,拦截模型与工具的交互以记录有依据的证据,并应对停滞或预算耗尽情况;同时提供可复用的分层技能系统,包括策略技能和访问技能,以增强智能体的搜索过程,避免在多次运行中重复失败的搜索模式。在WideSearch和GISA上,SearchOS在所有评估的单智能体和多智能体基线中领先各项指标,为实现鲁棒的信息获取协作铺平了道路。
推理上下文长度与强化学习后训练之间的差距正在不断扩大:推理系统已接近百万token级的上下文,而后训练任务通常仍保持在256K token或以下,并依赖部署时的长度泛化。这一差距对AI智能体尤为重要——其观测结果、工具输出、文档以及先前决策会在长时间轨迹中不断累积。LongStraw是一种在固定GPU预算下实现百万token级强化学习后训练的架构感知执行栈,基于分组相对策略优化(GRPO)实现。它评估共享提示时无需自动求导,仅保留后续token所需的模型特定状态,并逐一重放短响应分支,以增加重放时间为代价缩减实时训练图。我们针对混合循环与全注意力机制的Qwen3.6-27B模型以及压缩注意力混合专家模型GLM-5.2实现了该方案。在八块H20 GPU上,LongStraw在分组大小为2和8时完成了2.1M位置的分组Qwen评分与响应反向传播;将分组大小增加仅需额外0.21 GB峰值内存,而单独的压力测试则达到了4.46M位置。在32块H20 GPU上,我们验证了GLM-5.2全部78层在2.1M token提示下的端到端LongStraw执行路径。这些实验确立了执行能力而非完整的训练正确性,因为捕获的提示状态是分离的,且部分分布式前向传播与梯度组合路径尚未完善。
世界-动作模型正成为具身控制领域一个前景广阔的基础范式:这类模型并非单纯预测动作,而是学习一种将动作生成与未来世界预测耦合的表征。这种耦合通常被视为鲁棒性、可解释性与安全性的来源,因为原则上可将机器人动作与它所想象的未来进行对比检验。本文表明,这一假设并不稳固。我们提出BadWAM这一统一框架,用于建模与评估“世界-动作漂移攻击”:这是一类针对世界-动作模型的新型对抗攻击,通过施加微小的视觉扰动,破坏模型想象内容与实际执行动作之间的对齐。BadWAM沿两个自然维度刻画这一攻击面:攻击强度与隐蔽性。当攻击者优先破坏任务时,BadWAM实例化为纯动作对抗攻击,直接驱动模型产生导致任务失败的动作;当攻击者同时强调隐蔽性时,BadWAM实例化为保想象对抗攻击,在保持模型预测未来接近干净想象的前提下,诱导有害的动作偏移。这两种攻击共同涵盖了世界-动作模型特有的失效谱系:从显式的动作劫持,到更为隐蔽的场景——模型看似想象出一个合理的未来,却执行了失同步的动作。我们在多种世界-动作模型变体上评估了BadWAM。结果表明,在闭环执行条件下,我们的攻击显著降低了任务成功率。例如,纯动作攻击将模型性能从96.5%的成功率降至43.1%。而保想象攻击的结果进一步揭示了世界-动作模型特有的脆弱性:适度保留未来的正则化项能在维持较强攻击性能的同时,减少未来想象的漂移。
视频生成日益依赖基于关键帧的工作流程,创作者通过指定一系列参考图像来引导生成过程。尽管现有模型已支持多关键帧条件控制,但其能否在保持整体视频质量的同时忠实地复现指定关键帧仍不明确。我们提出KeyFrame-Compass,这是首个用于评估关键帧条件视频生成的综合性基准。该基准包含386个精心筛选的样本,覆盖三个应用领域、两种视频结构、两种提示粒度、两种条件格式及四种关键帧密度,可在多样化生成场景下实现受控分析。我们进一步引入自动化评估框架,同步测量关键帧执行度与整体视频质量。具体而言,我们将关键帧执行度分解为六个互补指标,涵盖存在性、保真度、时间顺序、定位精度、持续性与唯一性;同时通过基于证据的多模态大语言模型(MLLM)判断,并辅以专用感知模型,评估整体视频质量。对九种代表性视频生成系统的实验揭示了若干根本性局限:现有模型在忠实执行关键帧与自然视频合成之间呈现明显权衡;随着关键帧约束密度增加,模型性能进一步下降;多数开源模型无法将故事板网格输入正确解读为时序关键帧序列。
多参考到音视频生成(Multi-reference-to-audio-video, MR2AV)旨在基于多个参考样本与文本指令生成连贯的音频-视频内容。现有基准主要关注文本驱动生成、单参考主体保持或孤立的音视频对齐,而新兴的MR2AV设置尚未得到充分探索。与这些设置相比,MR2AV要求模型在生成同步视觉与音频内容的同时,对多个参考样本进行联合推理。模型不仅需要忠实保持每个参考样本的特征,还需正确绑定与组合多个被参考实体,以形成连贯的视听事件。为填补这一空白,我们提出MultiRef-Compass——用于MR2AV生成的统一基准。该基准包含350个精心构建的样本,通过可扩展且可控的资产组合流水线生成,覆盖多视角主体保持、多实体绑定以及人-物-场景组合。为提供可解释的评估,MultiRef-Compass定义了包含四个维度的评估协议:基础质量、参考一致性、视听一致性及指令遵循,并采用14项子指标。MultiRef-Compass将自动指标与基于重判增强的多模态大语言模型作为评判者(MLLM-as-a-Judge)框架相结合,实现了对感知保真度与参考条件组合的可扩展、可审计评估。在八个代表性MR2AV系统上的广泛实验揭示,多个评估维度仍存在显著改进空间,凸显了全面基准的必要性,并使MultiRef-Compass成为未来MR2AV研究的基础平台。
人类认知并非将理解与生成割裂开来。当教师在白板上边讲解边绘图时,两种模态相互重塑。本文将此耦合循环引入人工系统。掩码扩散模型(MDM)天然适合此任务,但现有采样器要么交错解码文本与图像,要么在并行分支中独立更新——这些分支仅共享前一步历史信息,却不包含同一步内另一模态的最新决策;加之MDM不具备重掩码能力,跨模态矛盾既无法被检测也无法被修复。我们提出自校正耦合马尔可夫跳跃过程(SC-CMJP)框架:在该框架中,一种模态的转移速率是另一模态置信度分数的泛函,该置信度由跨模态注意力加权。此外,当跨模态证据出现矛盾时,重掩码跳跃会立即撤回先前承诺。基于SC-CMJP,我们提出CO₂Jump(自校正耦合跳跃),一种无需训练的单遍采样器,专用于联合多模态生成。为训练与评估,我们创建并将发布三个大规模联合多模态生成语料库:JEdit-1M、JMaze-200K、JNono-200K,附带匹配的分布内与分布外基准测试。CO₂Jump在图像理解与编辑、视觉推理(迷宫与非图求解)中均取得最优联合性能。该采样器的性能随去噪步数单调提升,证明跨模态耦合的优势沿轨迹持续累积。项目页面:https://coupled-jump.github.io
构建能够根据玩家动作连贯响应的交互世界,长期以来一直是计算机图形学、游戏和人工智能领域的共同目标。近期视频生成模型提供了一种数据驱动的方法,通过根据用户动作预测未来观测结果来实现这一目标,并越来越被视为潜在的下一代游戏引擎。然而,实现真正交互的游戏世界需要遵循演化游戏条件规则所产生的交互结果、能够在长时间跨度内持续存在的后果,以及实时运行的生成循环。传统游戏引擎通过循环的"动作-状态-观察"流程实现这些特性:玩家动作根据预定义规则更新显式游戏状态,并从更新后的状态渲染出观察结果。本文以此循环为组织框架,从四个维度考察交互式游戏世界建模:玩家动作控制、游戏状态动态性、状态-观察持续性,以及实时交互生成。针对每个维度,我们从交互游戏世界所需的能力出发,将现有方法归入代表性类别,并讨论各类别的优势与权衡。作为分析补充,我们为《黑神话:悟空》设计了可扩展数据引擎,收集了超过90小时游戏视频,其中包含帧对齐的玩家动作、真实游戏状态及视觉观察,并配有结构化与语义化注释,为状态感知的游戏世界建模提供资源。希望本文能够清晰呈现该领域现状,推动交互式游戏世界的发展。
直接从原始视觉数据中学习广泛的世界知识是智能的基本能力。我们提出UniVR,这是首个研究如何从纯视觉演示中同时学习复杂推理、细粒度物理动力学和长期规划的探索。其核心在于VR-GRPO,一种结合全局级与步骤级互补奖励的强化学习范式。该方法在整个推理过程中强制保持逻辑连贯性与物理一致性,无需依赖特定任务启发式规则或图像-文本对。为训练和评估UniVR,我们构建了VR-X,一个涵盖长期操作、空间谜题和物理推理等16种多样化来源的大规模基准数据集。这是首个在纯视觉协议下评估这些异质能力的综合性测试集。值得注意的是,UniVR在VR-X上实现了高达25%的性能提升,其卓越的视觉推理能力也显著提升了多项多模态理解基准的表现。这些发现揭示了在视觉空间中进行推理的巨大潜力,所有代码、数据和模型均已开源以供进一步研究。
强化学习已成为大型语言模型的标准后训练方法,但密集的全参数更新带来了两个部署相关的瓶颈:一是推理性能受到抑制,通常表现为测试时缩放出现过早饱和;二是在通过多领域训练或模型合并整合多种能力时产生干扰。我们证明,这些更新的推理有效成分主要集中于基模型的谱空间中,由此提出了子空间对齐重连(SAR)——一种事后编辑方法,它在保留谱核心的同时移除正交分量。因此,SAR能够维持推理增益,并过滤掉那些抑制性能或放大跨领域干扰的残余更新方向。在多个模型家族和规模上,SAR仅使用约0.58%的总参数即可提取紧凑的推理核心:它保留了超过99%的后训练性能,改进了数学推理中的高k探索,并在内部模型上通过改进七个开放基准中的六个泛化至智能体编码任务。SAR还能净化混合领域训练更新,在保持数学推理和指令跟随能力的同时释放被抑制的编码能力。此外,它实现了跨专家模型合并,产生的跨领域泛化性能超越了以往的合并基线,甚至超过了最佳的单领域专家。总体而言,SAR表明,从参数几何中提取推理有效更新可以作为无需训练的机制,用于提升推理性能与多领域表现。
我们提出 Wan-Streamer v0.3,该版本将我们的原生流式交互模型重新定义为一个统一视角:视频即世界加事件流。世界是视频展开过程中持续存在的上下文,包括环境、场景、主体、环境声学条件、语音特征及其他相对稳定的状态。事件流则是该世界中随时间变化的一切,包括场景或环境变化、主体行为、语音及其他声音。由此,在大量真实视频上,我们构建了一个通用预训练任务:给定世界和输入信号,预测世界如何实时移动、变化并作出响应。由此获得的能力可被迁移至广泛的实时下游任务中。我们将其实例化于实时全双工音视频交互,其中事件流由智能体的语音及自由形式的行为构成。功能上,模型的多模态理解过程类似于视觉-语言-动作:它将多模态用户输入映射为语言形式的语音和行为动作。Wan-Streamer v0.3 保留了 v0.2 的运行指标:640×368 视频以 25 FPS 处理,160 毫秒的流式单元,约 200 毫秒的模型端响应延迟,以及在 350 毫秒双向网络预算下约 550 毫秒的总交互延迟。
同策略蒸馏已成为大语言模型后训练中的关键范式,但其训练动态仍缺乏深入理解。我们开展系统性研究,审视同策略蒸馏的作用、病态特征与调控机制。首先明确同策略蒸馏作为探索催化剂的功能:通过密集的令牌级引导,在不突破能力上限的前提下,将学生模型导向正确推理路径。通过实验证实,提示多样性比单问题采样数量更重要,且关键在于同策略蒸馏的有效性完全依赖于引导信号的质量。这种依赖性暴露出两种破坏探索的病态特征:当师生分布差距过大导致引导信号与任务正确性错位时,会产生师生失配现象,使探索方向适得其反;当聚合的令牌级目标产生长度相关捷径时,会引发长度利用问题,学生模型通过响应截断或冗余填充操纵奖励景观,从而探索退化长度模式而非推理策略。为遏制这些病态特征,我们研究轻量级信号调控机制:优势裁剪与对数尺度压缩,确保探索过程由可信信号引导。跨七个基准的实验表明,这些调控能缓解长度利用问题,实现有效蒸馏,稳定超越同策略蒸馏变体与强化学习验证推理基准,证实良好的信号质量(而非单纯的教师模型规模)才是同策略蒸馏中成功探索的决定性因素。
当前的机器人基础模型通常仅利用单步或短时间跨度的视觉-运动上下文。为此,我们提出机器人测试时训练策略(RoboTTT)——一种机器人模型与训练方案,可将视觉-运动上下文扩展至8000时间步,比现有最先进策略高出三个数量级,且推理延迟不增长。在该上下文长度下,我们解锁了新的机器人能力:从人类视频演示中进行一次性上下文模仿学习、实时策略改进、对扰动的鲁棒性,以及在多阶段长时域任务上更强的性能。我们首次观察到,随着预训练上下文长度增加,闭环性能呈现稳定提升。RoboTTT的核心是将测试时训练集成到视觉-语言-动作策略等机器人基础模型中,生成一种序列模型,其循环状态由快速权重构成——这些参数在训练和推理期间通过梯度下降更新,将历史信息压缩至权重空间,并检索上下文信息以实现长上下文条件控制。为扩展训练上下文长度,该方案结合了序列动作强制与截断时间反向传播。在具有挑战性的真实机器人操作任务上,RoboTTT相较于单步上下文基线整体性能提升87%,并完整完成了一项耗时五分钟、包含十个阶段的装配任务——这是所有基线方法均未能实现的。采用8000时间步上下文训练的RoboTTT,比同一模型在1000时间步下预训练的性能高出62%,表明上下文长度可作为机器人基础模型的新缩放维度。视频请见https://research.nvidia.com/labs/gear/robottt/。
MeanFlow生成器通过预测时间区间内的平均速度实现快速少步采样,使其成为高效生成的有力工具。强化学习已成为将扩散模型和流模型与人类偏好及任务特定目标对齐的强大方法。特别地,DiffusionNFT提供了一种高效的前向过程强化学习框架,无需逆过程轨迹或似然估计。然而,将此类强化学习方法应用于MeanFlow仍鲜有探索。DiffusionNFT优化瞬时速度,而MeanFlow使用平均速度进行采样。为弥合这一差距,我们提出MeanFlowNFT。受MeanFlow恒等式(桥接平均速度与瞬时速度)启发,我们构建了一个诱导的瞬时速度预测器。将DiffusionNFT目标应用于该预测器,使奖励优化对MeanFlow而言具有良好定义。采样仍基于平均速度,从而保留MeanFlow的快速少步生成特性。我们进一步证明MeanFlowNFT继承了DiffusionNFT严格的策略改进保证。在图像和视频生成上的实验表明,MeanFlowNFT持续改进基线方法。此外,它在大多数指标上(SD3.5-M上8项中的6项)优于先前的先进强化学习调优少步生成器,甚至能在仅使用少数采样步数的情况下超越多步强化学习调优扩散模型。例如,在Wan 2.1上,4步MeanFlowNFT达到84.33的VBench分数,超越了50步LongCat-Video RL(82.57)。
音乐生成基础模型近期引起了业界的广泛关注。然而,在实现高效生成高保真长音频的同时支持可控性,仍是一项挑战。为应对这些需求,我们提出了WanSong——一种简单但强大的方法,用于生成长格式、商业级歌曲。与自回归模型和级联多阶段管线(例如自回归后接扩散)不同,WanSong是一种纯扩散模型,可直接生成时长可达5分钟的高保真多语言歌曲,并一次性输出两个音轨(人声和背景音乐)。此外,我们的扩散框架通过步骤蒸馏实现了更快的推理,并提供高效的微调和定制路径,以支持下游编辑任务。
循环Transformer通过应用紧凑的物理模块堆栈进行多轮计算来扩展顺序计算,增加展开深度而不增加存储参数。这种复用改变了残差缩放问题:在非捆绑Transformer中,每个残差分支接收并应用自身的参数更新;而在循环Transformer中,一个共享的更新聚合了来自重复访问的梯度,并由这些相同的访问在下一次线性化前向传播中重新读取。我们通过一个由访问对齐系数κ_R控制的一阶扰动界限形式化了这种捆绑深度效应。当访问解相关时,该界限恢复DeepNorm指数,但在保守的对齐状态下,随着循环次数在固定物理深度下增长,要求指数从1/4增加到1/2。由此产生的方法DeepLoop保留了Post-LN DeepNorm架构,并将展开深度N的α和β分别设为(2N)^{1/2}和(8N)^{-1/2}。在GPT-2 small和GPT-2 medium规模的GPT风格循环语言模型上,当没有物理模块被重新访问时,DeepLoop保持中性;一旦激活循环深度,它便改善了验证损失和下游准确性。这些结果表明,稳定的循环深度需要考虑参数访问次数而不仅仅是名义层数的残差缩放规则。
视觉障碍人士(VIIs)因视觉信息获取受限,在日常活动中面临重大挑战。尽管多模态大语言模型(MLLMs)在通用视觉与语言任务上取得了显著成果,但其在真实场景盲人辅助中的实际应用价值仍鲜少被探索。为填补这一空白,我们提出VIABench——一个专门用于评估MLLMs在视觉障碍辅助场景中表现的综合视频基准测试集,其数据源自视觉障碍人士自身拍摄或共享的第一人称视频。VIABench定义了三项核心任务,分别针对视觉辅助中的不同需求:**主动提醒**(评估模型在实时解读视频内容的同时,主动预判并口头描述即将发生的导航关键事件的能力)、**视觉问答**(评价模型回答用户关于视频环境或物体提问的能力)、**视觉引导交互**(测试模型在用户与环境间实现意图交互时的上下文感知推理能力)。为确保评估的严谨性和公平性,我们设计了支持在线(实时)与离线两种模式的标准化基准测试流程。实验表明,当前MLLMs仍难以全面支持视觉障碍人士,尤其在需要精准预判和实时响应的主动提醒任务中表现不足。我们期望VIABench能够推动未来研究聚焦于定制化MLLMs的开发,从而切实改善视觉障碍人士的导航与交互体验。代码与数据将在https://github.com/MCG-NJU/VIABench公开。
我们报告了一种方法,可同时增强冻结小型语言模型的能力并大幅降低其成本,且无需调整任何权重。已验证的知识以字节精确的键值状态形式一次性存储,随后通过嫁接操作恢复至新的推理上下文中。该恢复过程为比特精确:在固定确定性配置下,嫁接后的逻辑输出与全新计算的结果逐字节一致(经SHA-256验证),零KL散度,且在五十个样本中实现100%的argmax一致。我们证明,在采用浮点旋转编码的模型上,自身位置嫁接是唯一数值精确的操作点,并在两种模型规模(12B、31B)及两个GPU目标上验证了字节精确性,其中一个目标通过预注册重放实现。在AIME 2025测试中,冻结的Gemma-4-12B模型在嫁接经过验证的解决方案库后,其性能从80.0%提升至93.3%,超越其自身77.5%的锚定值及其31B同类模型89.2%的已发布结果。在周期性任务中,基础模型在401,026个token预算内始终无法解决的八个问题,通过缓存的已验证解决方案仅用61个解码token完成回答,消耗token数减少6,574倍,能耗降低约8,700倍;其能力主张主要基于留存样本的迁移表现(31B模型上7/7全部成功)。相同的字节精确存储将可用上下文从32,768个token扩展至2,854,766个token,且无需额外加速器内存,并可在同构机器间实现字节一致迁移。我们从行为层面描述该系统;引擎为专有技术,所有报告数据均附有已提交的输入和输出哈希值,以便无需引擎即可重新验证评分结果。
上下文学习通常被解释为一种条件推断形式,其中提示指定了上下文,而模型的输出被视为对应条件分布的估计。若此解释成立,则大语言模型的估计应满足基本概率恒等式。特别地,全概率定律表明,先验加权条件分布可在总体任意有效划分下聚合为总体边际分布。本研究旨在探究大语言模型估计在多大程度上遵循这一自洽性原则。我们以二叉树作为评估框架,将总体递归划分为粒度渐细的子群体。随后,我们向大语言模型提供以自然语言表述的子群体描述作为上下文,将所得估计重新聚合为总体级估计,并在不同粒度划分间进行比较。将该方法应用于多个问题领域及最先进的前沿模型,我们发现基本一致性属性的广泛违反情况。对角色提示的深入研究表明一种称为“宏观谬误”的模式:由更细粒度子群体响应重建的估计通常比直接总体级估计更符合人类参考数据。该效应在树结构变化与估计任务变体中持续存在,且可通过隐式提示部分恢复。综上,这些发现表明模型具备相关子群体知识,但未能可靠地将其传播至聚合估计中。这一差距将统计自洽性确立为评估大语言模型的一个未饱和、无参考标准。
近期,可泛化的3D高斯泼溅模型在长序列新视角合成(NVS)领域取得进展,但代价是产生了大量冗余计算。我们发现这种冗余可通过以下两点观察加以缓解:(i)高质量新视角合成并不严格依赖高精度几何建模;(ii)外观学习通常比几何重建更易实现。基于这些见解,我们提出一种解耦几何与外观建模的非对称架构。几何分支以大部分参数处理粗粒度令牌以完成多视角重建,而外观分支则以显著更少的参数对细粒度令牌进行操作以捕捉细节。两分支通过双边连接实现交互,从而为各自任务提供相互引导。这种任务感知非对称性减少了计算冗余,更合理地分配计算资源,进而提升参数效率,使更小规模的模型也能取得强劲性能。在32视角960P输入下,我们的模型性能与基于优化的方法相当,同时实现近800倍加速,并以更少的参数量与更低的训练/推理开销超越现有最先进可泛化模型的零样本性能,实现了整体效率提升。
智能体检索增强生成(RAG)通过允许语言模型迭代推理、生成搜索查询、检索证据并预测答案,扩展了静态RAG。然而,模型仍难以决定何时进行检索、是使用词汇匹配还是语义相似度,以及如何控制上下文粒度以防止无关标记干扰智能体推理。本文提出GRASP,一种用于训练智能体在多步推理过程中自适应协调互补检索工具的强化学习(RL)框架。GRASP为智能体提供语义搜索、关键词搜索和段落阅读三种动作,使其能够检索句子级证据,并仅在必要时扩展更多上下文。我们通过联合考虑答案准确性、基于证据的阅读、互补搜索和轮次效率的奖励函数来训练策略。在多跳推理基准上的实验表明,与单步检索、基于提示的智能体RAG以及基于强化学习的检索基线相比,GRASP在检索召回率和下游问答性能上均有提升。定性和消融分析显示,学习到的策略展现出可解释的速读与精读行为:利用语义搜索进行广泛探索,通过段落阅读进行局部验证,并借助关键词搜索获取实体特定证据。这些结果表明,学习协调检索信号和上下文粒度对于智能体的正确推理至关重要。
具身认知要求智能体将高层任务推理与待实现的物理状态相连接。本文提出Hy-Embodied-RxBrain,一个具备语言-视觉联合推理与想象能力的具身认知基础模型。不同于侧重场景理解与文本决策的视觉语言模型,也不同于主要预测未来视觉状态的生成式世界模型,RxBrain通过单一规划序列表征具身规划,其中语言与视觉想象发挥互补作用:语言提供规划的抽象结构,包括任务分解、规划基元、约束条件、时序顺序与决策逻辑;而视觉想象则通过世界状态预测与联合子目标规划,将这一结构具体化,将每个规划步骤与中间及最终物理状态相关联。RxBrain采用统一的多模态混合Transformer架构,支持在一个模型中完成语言、图像和视频的理解与生成。为训练该能力,我们构建了一条自动流水线,通过将具身视频分解为规划步骤并与视觉状态转换对齐,将其转化为文本-视觉联合规划监督信号。我们进一步引入RxBrain-Bench评估基准,检验模型是否能够通过联合文本与视觉组件来表征具身规划,而非仅依赖单独的理解或生成能力。实验表明,RxBrain保留了具身理解与生成能力,并能生成耦合文本推理、世界状态预测与联合子目标规划的规划方案。我们还将RxBrain扩展至连续机器人动作生成,该模型在无需大规模动作数据预训练的情况下展现了有前景的实际机器人性能。这些结果为基础模型迈向具身认知提供了初步探索。
CAD到图像对齐的目标是从单张RGB图像中估计物体的9D姿态(旋转、平移及各向异性缩放),从而支持机器人技术和增强现实等应用。最近的零样本方法利用视觉基础模型将图像区域与CAD模型进行匹配,但这些对应关系通常依赖于外观驱动,在存在遮挡或模拟到现实领域偏移时会退化。为解决这些局限性,我们提出了SUFLECA(缩放特征学习以实现CAD对齐),这是一个用于零样本CAD对齐的弱监督框架,包含两项关键贡献。首先,SUFLECA通过归一化物体坐标(NOCs)监督在涵盖12个真实和合成数据集的674K图像上进行训练,从预训练的视觉表示中扩展了几何基础特征学习,学习出跨领域泛化的紧凑几何感知特征。其次,我们提出了一种几何一致的匹配算法,能够建立可靠的一对一CAD到图像对应关系。这些贡献共同实现了每物体实例亚秒级的精确对齐,无需迭代姿态优化。在ScanNet25k数据集上,SUFLECA在类别/实例准确率上分别达到33.4%/42.3%,以更小的计算开销超越了最强零样本基线10.3/12.2个百分点,并且在该基准测试中首次甚至超过了全监督方法。代码已开源:https://github.com/snt-arg/SUFLECA
视频模型正在向视觉基础模型演进,但仍缺乏类人的多步推理能力。流式自回归扩散模型虽高效,但推理能力有限;而双向扩散虽能实现全局修正,却因密集帧级去噪导致推理成本高昂。这两种范式均难以在复杂推理任务中兼顾逻辑一致性与低延迟流式输出。我们提出HDR(层次化视觉推理去噪),一种将层次化潜在变量融入因果视频生成的统一框架,用于多步推理。HDR将视频潜在变量组织为树状层次结构,支持在流式输出前进行由粗到细的推理。粗去噪层保留不确定假设以进行全局规划,细层则逐步将其精化为具体视觉状态。稀疏层次化注意力模式(SHAP)进一步降低了时序注意力成本。我们引入了一个包含分布外案例的分层多步视频推理基准,涵盖迷宫导航、汉诺塔、一笔画、滑动拼图、推箱子和倒水六类任务。与流式自回归扩散基线相比,HDR将成功率从34.22提升至60.29(相对增益76.2%),平均进度从76.00提升至89.56,展现出更一致的推理轨迹。HDR以每个潜在变量0.70秒保持低延迟流式输出,推理速度比双向扩散快54.2倍。在仅使用2%训练数据时,HDR仍能保留全数据性能的82.9%,而双向扩散仅保留52.0%。真实机器人实验进一步证明了HDR在物理交互与世界建模中的潜力。项目演示:https://hierarchical-diffusion-reasoning.github.io/。
验证自动驾驶系统需要多样化且符合法规的测试场景。在基于仿真的测试中,场景被定义为可执行脚本。然而,从法规描述中自动生成此类脚本仍是一个开放性挑战,现有方法面临根本性权衡。检索-组合方法虽能达到合理的编译成功率,但缺乏可扩展性;而基于检索的完整脚本生成则面临编译成功率低的问题。我们提出Chat2Scenic,首个采用迭代检索增强的框架,用于生成领域特定语言(DSL)的场景脚本。具体而言,Chat2Scenic提供支持交互式场景优化的聊天机器人界面,并集成检索增强生成(RAG)技术,使场景生成基于法规知识与DSL语法。此外,我们提出了一个开放的场景生成基准测试,包含来自美国国家公路交通安全管理局(NHTSA)、联合国车辆法规及其他来源的123个场景。基于最先进大语言模型的广泛评估表明,Chat2Scenic实现了76.42%的编译成功率与58.17%的框架准确率,显著优于现有方法(检索-组合方法编译成功率30.08%、框架准确率11.03%;检索全脚本生成编译成功率16.26%、框架准确率10.86%)。为促进后续研究,我们已将代码开源至https://github.com/TUM-AVS/chat2scenic。
本文提出令牌时间连续扩散模型(Token Time Continuous Diffusion, TTCD),这是一种新型扩散语言模型,其核心特性包括:(a)在连续空间中运行,将高斯噪声确定性映射为最终令牌画布,无需额外采样;(b)引入全新的逐令牌时间概念,部分令牌从噪声到令牌的转化速率快于其他令牌。连续空间建模使TTCD能够避免多令牌并行采样,而并行采样正是纯离散空间模型在高加速场景下精度损失的关键原因。逐令牌时间概念帮助TTCD更好地建模条件生成,允许置信度更高的令牌以更快速率推进,并在精炼过程中实现差异化的令牌间交互影响。在高加速条件下,TTCD性能优于离散模型。我们在OpenWebText数据集上训练了1.6亿参数的TTCD模型并对其进行自蒸馏;实验表明,在高加速条件下,我们的模型在无条件生成质量上与现有多个同等规模、同数据集训练并自蒸馏的模型相当,在条件生成任务中则表现更优。此外,我们在数独求解任务中也获得了类似的性能提升。