每日精选AI研究论文及翻译
对万亿参数规模MoE模型进行全参数后训练,给大规模分布式训练带来了系统级挑战,包括严重的内存压力、非重叠通信开销以及低效的内核执行。虽然大多数大规模LLM训练系统基于GPU集群构建,但本报告展示了在昇腾NPU超级集群(Ascend NPU SuperPOD)上的端到端优化实践。以DeepSeek-V4模型系列为目标负载,我们开发了一个分层优化框架,涵盖模型级并行策略、计算-通信编排以及底层内核执行。最终系统实现了34.22%的模型算力利用率(MFU),相比开源基线方案提升了2.93倍,同时保持了训练稳定性。在此优化基础设施的基础上,我们进一步为复杂运筹学(OR)任务构建了持续预训练(CPT)和监督微调(SFT)工作流程,并将该集成框架称为SLAI T-Rex。利用DeepSeek-V4-Flash模型,我们开发了面向运筹学的CPT和SFT数据流水线,融合了收集的领域资源与基于求解器验证的合成优化文档。最终数据集包含10K高质量SFT样本,覆盖四个任务类别和三种问题表示形式。该专用模型在评估模型中取得了最高的平均零样本Pass@1分数,达到71.81%,分别比GPT-5.4-Mini和基础DeepSeek-V4-Flash模型高出3.98和11.27个百分点。总体而言,本工作展示了从昇腾基础设施上高效的万亿参数模型后训练,到面向求解器驱动的数学建模的领域专用Flash模型的完整技术栈路径,推动了前沿模型系统在复杂推理方面的发展。
近期,自回归视频扩散方法逐渐以“自我强制”(Self Forcing)为基础构建,即学生模型基于自身展开(rollout)生成的历史序列,而非真实视频上下文进行训练。这减少了曝光偏差,但历史的键值缓存仍仅作为冻结的展开状态被后续帧使用。因此,后续帧的损失无法监督早期生成的潜变量应如何被写入更有用的键与值,以服务于后续视频潜变量的生成。我们将此问题称为“历史上下文-梯度鸿沟”。为此,我们提出“自梯度强制”(Self Gradient Forcing, SGF),一种双遍训练策略,无需通过完整串行展开进行反向传播,即可恢复缺失的监督信号。第一遍执行无梯度的自回归展开以匹配推理过程,并在采样的去噪退出步中,记录自生成上下文以及输入模型的噪声潜变量。第二遍针对记录的退出步进行并行的上下文梯度重建。生成的上下文作为梯度停止的干净潜变量输入,而模型重新计算上下文的键值表示以及未来到上下文的因果注意力。由此,SGF在原生的自回归训练目标中提供了缺失的记忆写入监督,利用未来视频潜变量的损失来训练模型将上下文编码为更有效的因果记忆。在多种初始化条件下,针对长程帧级和块级实验的广泛测试表明,SGF在长视频外推方面相较于自我强制方法表现更强,尤其在主体一致性、背景/布局一致性及时序稳定性方面。值得注意的是,仅使用5秒的训练窗口,SGF即可外推生成持续数分钟的视频。我们将公开代码与模型,以推动自回归视频生成的研究。
随着大语言模型和AI智能体成为搜索结果的主要消费方,文档集质量决定了下游生成任务的上限。然而,现有评估系统仍局限于对文档进行独立评分并通过nDCG聚合,忽略了文档间的交互关系(冗余、冲突、互补性),也无法回答“为何某个文档集优于另一个”的问题。为解决这些问题,我们提出了一套完整的评估-诊断-优化框架。我们设计了SetwiseEvalKit,一个覆盖短文本与长文本场景的三级九维度文档集评估基准,包含约2.8万条高质量评估准则。我们系统评估了12种重排序方法:即使最优方法覆盖率也不超过45%,跨文档协调维度普遍薄弱,且没有一种方法能在两种场景下均保持顶尖性能。在此基础上,我们提出Rubric4Setwise——一种无训练方法,将基于准则的评估标准转化为文档集选择信号,以更少的文档和搜索轮次实现了最优的下游生成性能。它是唯一在两种场景下均保持最先进结果的方法,验证了从评估到优化的闭环有效性。
人类视觉是一个闭环过程:注视方向不断被中间假设重新调整,而非依赖单一快照。数十年的心理物理学与认知科学研究表明,这种主动观察对广泛任务至关重要。当前的多模态大语言模型(MLLMs)是否具备主动观察能力,是一个现有视觉-语言基准无法回答的经验性问题。我们提出ActiveVision基准,通过包含3大类17项任务,使MLLMs的主动观察能力得以量化。这些任务强制要求模型进行重复视觉感知,而非仅依赖单次静态描述。前沿MLLMs在ActiveVision上表现崩溃:我们评估的最高分模型——采用最高推理努力层级的GPT-5.5,仅解决10.6%的任务项,且在17项任务中有11项得分为零;而Claude Fable 5尽管在多数推理与编程排行榜上领先,却仅解决3.5%的任务,远低于三位平均得分96.1%的人类参与者。此外,即便模型能自主编写并执行视觉代码,其性能差距仍显著存在:此类代码在真实图像中不可靠,而识别其自身失败恰恰需要模型所缺乏的主动感知能力。综合结果表明,当前MLLMs缺乏稳健的主动视觉观察能力,亟需设计能闭合感知-推理回路的架构与训练目标。
将事实知识大规模且可靠地注入大型语言模型仍是一个开放挑战。超网络为大规模知识注入提供了有前景的解决方案。尽管超网络通常用于测试时自适应,但我们探索其在训练时知识注入中的应用——即给定大规模事实语料库,训练超网络生成固定的LoRA适配器,当该适配器插入目标模型后,使模型能够回答关于这些事实的问题。本研究探究超网络能否用于执行训练时知识注入,以及这种能力如何随规模变化。超网络的缩放行为此前鲜有研究。我们的设计将超网络的注入能力与目标模型的通用能力解耦,从而首次能够严格研究超网络架构的缩放定律。我们刻画了损失、推理准确性及分布外泛化能力如何随超网络深度、宽度及目标网络规模变化。我们构建了大规模数据集MegaWikiQA,其中包含来自Wikidata5M样本的39个领域、数千万个多跳问答示例。研究结果揭示:(i) 基于超网络的注入在所有架构维度上展现出广泛的预测性幂律缩放规律;(ii) 超网络在规模增大时能够实现可靠的分布外泛化,表明超网络为LoRA微调和全微调等其他训练时自适应方法提供了有前景的替代方案,在所有分布外评估中表现出更陡峭的缩放指数。综合这些结果,超网络被确立为一种原理清晰且可扩展的训练时自适应基底,并首次提供了基于经验实证的缩放定律,以指导超网络在大型语言模型中的事实推理应用。
通过行为克隆(BC)在机器人演示数据上微调预训练视觉-语言模型(VLM),已成为视觉-语言-动作(VLA)策略的标准范式。然而,BC微调会逐步覆盖支持视觉与语义泛化的预训练表征。联合训练网络图像-文本数据这一常见补救措施无法阻止该现象;它仅在独立观测上施加语言损失与动作损失,导致VLA存在语言-动作错位,而标准操作基准测试无法暴露这一问题。我们提出Anchor-Align方法,在BC基础上增加两个目标:视觉-语言锚定(Vision-Language Anchoring)从冻结的VLM副本中蒸馏逐层表征以防止表征漂移,而语言-动作对齐(Language-Action Alignment)将每个动作目标转化为离散的运动方向标签,并在同一机器人观测上联合训练语言预测与动作预测。在物理xArm7机器人上,针对两种广泛使用的VLA架构,Anchor-Align分别将真实机器人成功率从28%提升至54%,以及从37%提升至60%。在仿真规模化实验中,我们在LIBERO-PRO、LIBERO-Plus和CALVIN上分别展示了在分布外扰动、感知鲁棒性和长程控制方面的持续改进,表明保留预训练表征与高效动作学习并非根本对立。项目页面:anchoralignvla.github.io
强化学习(RL)已成为增强大语言模型(LLM)推理能力的主导范式。然而,基于PPO-Clip的强化学习算法本质上受限于探索崩溃。后续工作仍主要停留在启发式层面,未能识别PPO-Clip失效的根本原因。本文揭示了PPO-Clip的根本缺陷:其隐式地使用欧几里得度量来衡量策略差异,这在理论上与策略黎曼流形上的固有几何结构不一致。这种几何不匹配导致在低概率区域更新过于保守,而在高概率区域更新过于激进,最终导致探索崩溃。为纠正这一几何缺陷,我们提出黎曼等距策略优化(RIPO),该方法保证在黎曼流形上进行等距策略更新,有效平衡探索与利用。我们进一步证明RIPO实现了有利的偏差-方差权衡,从而稳定优化过程。大量实验表明,RIPO在七个竞赛级基准测试中显著超越现有LLM强化学习算法(在AIME24上相比GRPO提升高达60%)。
随着自主智能体快速发展,其可靠操作普遍存在的数字文档的能力,已成为实现通用人工智能助手和自动化复杂工作空间工作流的关键。本文提出DocOps框架——一种确定性可验证的评估体系,该体系基于分层分类法,将源自真实实践的文档操作拆解为原子维度和递进式工作流复杂度。基于DocOps,我们系统评估了各类代理框架下具有代表性的闭源与开源模型,揭示出即使是最前沿的配置方案在处理高度耦合的长程任务时仍存在显著局限。进一步对现有智能体操作行为的细粒度分析,识别出三种关键故障模式:长期状态跟踪崩溃、浅层语义验证,以及结构元数据的破坏性编辑。最终,本研究揭示了智能体在维护全局文档一致性方面的能力边界,为未来在复杂数字生态系统中构建稳健、非破坏性的智能体指明了方向。
视频扩散Transformer需要处理长时空序列,使得自注意力成为高分辨率视频生成的主要瓶颈。免训练稀疏注意力虽能降低计算成本,但自适应Top-p路由在多GPU序列并行场景下会导致各注意力头负载不均。这种负载异构性使稀疏注意力演变为层级"掉队者"问题。本文提出免训练稀疏注意力系统,通过多GPU序列并行提升自适应稀疏注意力的分布式执行效率。该系统采用Top-p路由、Top-k安全下限及视频感知块组织作为稀疏路由前端,并在运行时修复生成的注意力掩码。运行时负载均衡通过点对点通信迁移少量重负载头,缩短当前关键路径;感知松弛稀疏增强用额外高价值块填充非关键层级的剩余松弛空间;计算重叠机制将调度与迁移开销隐藏于现有计算中。在分步精炼的Wan2.2 I2V模型上,该系统将平均负载不均衡度从1.34降至1.08,相较于FlashAttention实现4.41倍注意力加速,同时获得2.02–2.11倍DiT推理加速,并保持具有竞争力的视频质量。
基于可验证奖励的强化学习(RLVR)已显著提升语言模型的推理能力,但其在视觉语言模型上的扩展仍受限于缺乏同时具备广泛性、精确可验证性和可复现性的训练数据。我们提出Trace——一种基于分类法指导的多领域视觉推理环境。Trace将任务构建分解为场景语法与可执行任务程序,从而将视觉实现与答案计算相分离。共享语义状态决定了渲染图像、提示词、类型化答案、验证器状态以及可回放的实例轨迹。该环境最终包含跨越277种场景语法和11个视觉领域的1000个任务,语义与视觉变异受控。在64000个Trace实例上进行的RLVR实验,使得Qwen2.5-VL-3B在24个外部基准测试中的宏观平均值提升了3.51个百分点,Qwen2.5-VL-7B提升了4.06个百分点,这表明广泛的程序化训练能够迁移至生成任务分布之外。项目页面:https://maveryn.github.io/trace/。
基于可验证奖励的强化学习已成为在显式思维链推理器中实现测试时尺度扩展的主流范式。然而,这种扩展路径仍存在较高的计算成本,因为每个中间步骤都必须解码为语言标记。相比之下,潜在推理将中间计算以连续向量形式承载,并已在更短的计算步数内达到甚至超越显式思维链的性能。尽管前景广阔,潜在推理器仍主要受限于模仿学习,而显式思维链已通过基于结果奖励的强化学习超越了模仿阶段。潜在轨迹缺乏可处理的逐步骤似然度,且在固定思考预算下缺乏自适应终止接口,因此结果奖励无法激发潜在测试时尺度扩展。我们提出替代潜在策略优化(SLPO),将结果奖励强化学习引入自回归潜在推理器:通过潜在转移的实证替代策略密度实现轨迹级信用分配,并设计一个经正确性监督的终止头,结果奖励优化将其精炼为变视界策略。在连续与软思考设置下,SLPO提升了并行采样下的Pass@k指标,并将更长的潜在计算分配给更难的实例,同时实现更高的确定性准确率。
本工作介绍了G-MAD,这是一个开源框架,利用Arma3生成用于航空目标检测的同步多视角RGB-T数据。G-MAD解决了现实航空数据集构建中的关键局限性,包括视角控制受限、RGB-T对齐不完美以及标注成本高昂。该框架支持结构化场景配置、可控多视角相机布设、可见光/热红外同步采集,以及利用引擎级几何元数据的自动边界框标注。这些能力使得能够在航空目标检测中开展视角变化、多模态融合以及合成到真实迁移的受控研究。此外,基于G-MAD,我们构建并发布了AMOD,一个大规模多视角航空RGB-T目标检测新基准。源代码和数据集可在 https://unique-chan.github.io/G-MAD-Project 获取。
自然语言自编码器通过重构来评估隐藏激活的解释质量:若激活能从解释中再生,则该解释被视为忠实。该测试在结构上对个别虚假声明不敏感——若翻转某个声明不改变重构结果,则该声明不会受到惩罚。我们展示了该测试可通过两种方式通过,但两者均不忠实。在已发布的Qwen-2.5-7B语词化器上,解释的重构效果显著高于随机水平,而约2%的具体声明依赖于重构结果,因此得分反映的是主旨而非具体事实。在精确合成真实数据条件下,标准方案在5/5次运行中形成了共适应私有编码(重构依赖的虚假措辞),而保持目标模型不变的修复方案对此无效。我们贡献了两项审计协议:基于事实与真实交叉验证,以及评估器交换;以及RECAP(通过协同训练辅助预测器实现可读编码):在目标模型旁训练的线性头,以保持指定内容的可解码性。在经RECAP训练的沙箱模型上,全新语词化器能真实表述指定内容,且私有编码消失,额外代价仅为+0.001纳特。该结果在预训练的Pythia-160M上复现:指定内容变得可靠地可被探针解码,尽管全新语词化器仅能部分传达(真实性0.44-0.46,而对照组接近零)。对可解释性而言,高重构分数不能验证个别声明。对AI安全性而言,RECAP使指定内部内容可独立通过探针检验,而非依赖模型可操纵的散文式断言:独立探针对语词化器的真实声明评分高于虚假声明(AUC 0.96,而未使用RECAP时为0.82)。面对通过编辑解释以最大化重构分数同时说谎的对抗者(抑制约87%的说谎惩罚),RECAP探针仍能识别谎言(AUC 0.95),而对照探针降至随机水平(0.51)。
3D高斯溅射(3DGS)通过优化三维空间中自由放置的基元并在重建不足的区域自适应稠密化,实现了高质量的新视角合成。然而,现有前馈式3DGS方法在很大程度上丧失了这种场景自适应容量分配能力——这些方法通常在输入像素位置回归高斯体,并沿相机射线对其提升。这种像素对齐的公式使得基元的数量和布局依赖于图像分辨率和输入视角而非场景复杂度,导致生成的高斯集稠密且往往冗余。我们提出ATSplat,一种前馈式3DGS框架,通过自适应三维令牌恢复3DGS优化的自适应分配能力。ATSplat首先将粗略的块级深度和相机线索提升为稀疏的三维锚点令牌,形成场景的紧凑骨架。随后,每个令牌通过可学习的三维偏移回归为局部高斯体,从而将基元放置与输入图像网格解耦。自适应令牌扩展模块预测令牌级的不确定性分数(由渲染误差图监督),并通过可学习的扩展层选择性地扩展高不确定性令牌。这种稀疏到自适应的公式使ATSplat能够将基元集中在具有挑战性的区域,同时保持紧凑的表示。在RealEstate10K和DL3DV两个代表性数据集上的实验表明,ATSplat在实现最先进渲染质量的同时,相比稠密前馈式3DGS方法减少了超过5.7倍的高斯体数量。在512×960分辨率下使用12张输入图像时,ATSplat可在不到一秒内(单商用GPU)完成重建,并以1136 FPS(512×960)渲染高质量新视角,仅需311K个高斯体。
边缘设备上的实时脑电图分类受限于传统神经网络中的浮点运算。本研究探索了可微分逻辑门网络作为硬件原生替代方案,该方案将模型编译为可通过CPU位运算执行的纯布尔逻辑电路。通过在四个脑电图数据集(涵盖二分类痴呆检测和三分类情绪识别两种任务)上进行严格的等参数实验,我们在四个复杂度等级(5万至50万参数)下,将Diff-Logic与同等容量的多层感知机和二值化神经网络基线进行了对比。在痴呆筛查任务中,Diff-Logic的宏F1值达到80.2%,较MLP基线提升了6.8%。在情绪识别任务中,MLP虽然保持适度性能优势,但在功耗受限(7瓦)的Nvidia Jetson Orin Nano CPU(单核)上部署时,其延迟增加了2.3倍,模型体积扩大了14倍。关键发现是,当模型规模扩大10倍时,Diff-Logic的推理时间几乎保持不变,在最大复杂度等级上较MLP实现了2.9倍的峰值加速。我们的研究结果确立了基于逻辑的神经架构作为资源受限脑机接口的实用范式,能够在满足便携式边缘部署的延迟和内存约束的同时,实现具有竞争力或更优的性能。代码已开源:https://github.com/Shyamal-Dharia/eeg-difflogic
语境牵制是指模型倾向于让输入中的辅助性语境引导其输出,无论该语境是否相关、真实甚至有意义。近期,这一现象已在单模态语言模型中被识别并获得了机制性解释。然而,在视觉-语言模型(VLM)中,该现象是否以及如何表现尚缺乏系统研究,且该领域缺少专门构建的用于研究此现象的工具。我们认为,研究VLM中的语境牵制不能仅将现有的纯文本基准迁移至多模态场景:它需要一套基于分类学结构、具备双模态特性的工具,且测试条件需围绕当前项目(文本流中的描绘图像、视觉流中的文本查询)构建。我们主张,转向VLM的研究是本质性的而非渐进性的。这使得牵制成为一种双重现象,可分别由文本语境和视觉语境独立驱动,并开辟了一个真实性区分维度(即对描绘场景为假但在现实中可能成立的语境),这在以往仅依赖世界知识的单模态研究中没有对应物。为具体化并实现这一主张,我们引入了ENTRAP-VL(面向视觉与语言的牵制评估探测工具),这是一个手工整理的数据集,包含8个类别共1500个项目,按照涵盖双轴(即语境与项目的关联性及其与真实性之间的关系)的分类体系组织,并划分为文本牵制流(8种语境条件)和视觉牵制流(3种语境条件)。我们并非宣称能测量特定模型中的牵制现象;而是提供该工具、支撑其设计的分类学体系以及该工具所支持的评估协议,以便学界能够严谨地研究这一现象。我们将公开发布该数据集及其文档。
同步定位与地图构建是机器人领域的基础性问题之一,它使得机器人在真实场景中的自主操作成为可能。在低光照条件下,对比度降低、传感器噪声和运动模糊会削弱特征提取与匹配的效果,而采用激光雷达、深度传感器或热成像传感器进行补偿则会增加成本、功耗及系统集成复杂度。现有基准测试主要基于光照充足的室内或日光场景,尚不清楚标准RGB相机在黑暗环境中能实现何种程度的同步定位与地图构建性能。我们针对五种不同难度与光照条件的LaMARia序列,对涵盖基于特征、直接法、滤波法及学习型范式的六种系统——ORB-SLAM3、DSO、Kimera-VIO、OpenVINS、DPVO和DPV-SLAM——进行了基准测试,报告了绝对位姿误差、相对位姿误差及控制点召回率。Kimera-VIO是唯一能完整跟踪所有五个序列的系统,其相对位姿误差最低,但由于缺少回环检测,绝对误差持续增长;DPVO和DPV-SLAM从未丢失跟踪,但在低光照下绝对误差约为100米;经典单目管线(ORB-SLAM3、DSO)以及基于滤波的OpenVINS在大部分高难度和低光照序列中完全失效或发散。结果表明,仅依赖RGB相机的同步定位与地图构建只有在惯性融合与全局优化同时存在时,才能在低光照下维持稳定跟踪。要弥合剩余的性能差距,可能需要专用低光照学习型前端或回归互补传感方案。
复杂场景下的实用机器人抓取需要同时具备3D空间推理能力和任务特定需求的匹配能力。视觉语言模型(VLM)提供了一种通过语言描述这些需求的自然方式,但现有方法要么直接使用VLM预测抓取动作并受限于空间感知能力不足,要么将VLM与抓取模型联合训练,这需要显著更多的数据和计算量。这些限制阻碍了性能提升,并导致无法扩展到复杂场景中的多实体应用。针对这一问题,我们提出SeededGrasp——一种数据高效的新型框架,使VLM能够预测种子点,并将其作为条件输入后续轻量级抓取生成模型。我们的架构将高层语义推理与低层几何执行解耦,在避免昂贵端到端训练的同时支持多实体应用。为训练此类模型,我们发布了首个多实体桌面抓取数据集,包含杂乱场景中超过250万组抓取数据。实验结果表明,我们的方法优于现有基线方法,在仿真和真实世界抓取实验中分别达到72%和78%的成功率。详见项目网站获取数据与代码:https://uoft-isl.github.io/seeded-grasp/
文本到视频生成在过去五年中通过模型规模、数据和计算量的扩展取得了显著进展。与模型架构不同,训练数据往往未得到充分探索。现实世界的数据整理复杂且非琐碎,涉及从原始视频中挑选片段并进行字幕标注,以生成用于学习文本到视频映射的视频-文本对。我们研究了数据分布和字幕质量对文本到视频模型的影响。为进行受控实验,我们引入了动态字母表(Moving Alphabet),这是一个程序化测试平台,能够在黑色背景上以不同字体、颜色、大小和位置渲染字母,并以不同方向和速度移动。这一设计通过破坏真实元数据,实现了对数据分布和字幕质量的精确控制。我们的实验得出三项发现:a)视频内容和时长的多样性与均衡分布对泛化能力至关重要;b)字幕质量显著影响模型性能与训练效率,表明文本到视频模型的能力受限于视频理解水平;c)无分类器引导以及在高质量数据上的微调能够部分弥补在劣质字幕上训练的模型,但无法完全补偿预训练数据质量不足的问题。我们相信这些见解可为大规模文本到视频模型的开发提供参考,并呼吁对预训练数据的科学给予更多关注。