每日精选AI研究论文及翻译
具有可验证奖励的强化学习(RL)会构建轨迹级优势估计,然而在长视界、多轮智能体任务中,它往往无法对决定结果的少数关键决策进行信用分配。近期工作引入了用于信用分配的特权自蒸馏,以提供更密集的监督,但这类局部信号应如何表示序列信用仍不明确。我们提出 AgentOPSD,一种用于智能体强化学习中回合级信用分配的无评论家递归方法。AgentOPSD 将 token 级教师-学生对数概率差距聚合为回合级证据,并在对数几率空间中递归更新贝叶斯信念状态。这产生了一种有理论依据的重新加权方案,可将稀疏的结果监督转化为回合级信用信号,并通过相邻状态之间的边际信念修正来识别关键回合。该方法与标准策略优化完全兼容,既不需要额外的评论家,也不需要额外的 rollout。我们使用 Qwen2.5 模型在两种规模(3B 和 7B)下,在 ALFWorld、WebShop 和 Search-QA 上评估了 AgentOPSD。AgentOPSD 优于 GRPO 和强自蒸馏基线,在 ALFWorld 上使用 Qwen2.5-7B 取得了 89.1% 的成功率。消融实验将性能提升归因于回合级聚合和历史依赖的递归信念更新。
计算机使用智能体(CUAs)正在数字世界中快速发展。CUA轨迹记录了智能体的动作、状态和推理过程。验证其是否完成了任务指令,对于CUA的评估、数据整理和强化学习至关重要。人工编写的验证器和人工标注者都无法在规模上提供此类验证,因此该领域日益转向使用视觉语言模型(VLMs)作为CUA轨迹的裁判。但一个根本性问题长期以来未被审视:这些VLM裁判是否足够可靠?为了系统地研究这一问题,我们提出了OSReward,一个真实、高质量的基准,用于评估VLM裁判对CUA轨迹的判断。这些轨迹来自多种智能体骨干,在不同平台上执行经过人工验证的指令,随后通过多阶段人工标注严格标定真实结论。在此基础上,我们构建了OSReward-Hard,一个专注于真正困难案例的挑战集,以及OSReward-Multi,用于细粒度的效率和一致性评分。迄今为止最全面的VLM裁判评估发现,即使是最先进的模型也达不到理想裁判的标准,它们普遍存在系统性宽松偏差,将失败的运行误标为成功。少数足够可靠、值得信赖的模型在大规模运行上过于昂贵,而价格实惠的开源模型则远远落后。为了缩小这一差距,我们构建并发布了OS-Shepherd-100K,这是一个面向CUA社区的、带有推理标注的轨迹判断开放语料库。在此基础上,我们训练了OS-Shepherd(9B和35B),这些开源奖励模型提供低成本、稳定且可靠的奖励信号,以比前沿模型低30%-60%的成本达到与商业裁判相当的性能。广泛的分析进一步为大规模可靠CUA奖励的设计提供了启示。我们的代码、基准、数据集和模型检查点可在 https://os-copilot.github.io/OSReward-Home/ 获取。
通过以CLIP风格目标函数针对wav2vec 2.0音频嵌入训练的深度网络,可以从非侵入性脑磁图(MEG)记录中检索到感知语音的短片段。然而,其权重并不映射到电生理量上,目前仍不清楚哪些语音属性驱动了检索。 我们基于一个高性能的MEG到音频检索架构,但重新设计了其前端和解码器。其空间注意力作用于扁平传感器布局;我们将其替换为定义在三维MEG头盔几何结构上的球谐函数。我们将受试者特定表示从270个分支减少到25个,为每个分支添加时间滤波器以在空间和时间上匹配神经元源,并使卷积解码器变得更浅。在训练前移除眼动和心电成分,以降低刺激锁定捷径的风险。 在MEG-MASC上,该模型在六个训练模型的1005个候选中达到39.75 ± 0.34%的前1准确率,而解码器参数减少了约20倍。其权重映射到源空间,恢复了与语音感知网络一致的生成源,而左侧化分支携带了右侧不明显的高频节律成分。配对MEG遮挡显示,19个刺激特征中有15个有贡献,其中静音、声音强度、元音和声学起始的影响最大。随机词表则表现相反:将叙事性MEG替换到其中可改善检索,这表明没有叙事结构的活动所携带的可恢复信息少于连贯语音期间的活动。wav2vec目标可以减少到约十二个学习特征维度而不损失准确率,而强烈的时间压缩则导致明显损失。 总之,源映射和输入干预揭示了驱动检索的因素。
从开放式文本生成大规模、可自由探索的3D世界仍然是一项挑战,因为系统必须同时保持全局空间连贯性、丰富的局部内容,以及适合下游编辑和复用的显式资源。我们提出了WorldClaw,一个完全智能体驱动、由粗到细的开放世界3D场景生成框架。规划智能体将文本提示转换为关于区域、地形、资源、材质和空间关系的结构化规范。随后,WorldClaw通过语义布局、可复用资源、生成式或程序化材质以及区域感知高度场构建全局连贯的地形基础。对于细节要求高的区域,它生成地形条件化的组合,重建可编辑的带纹理网格,并恢复其在地形上的放置;基于渲染的智能体进一步细化地形、物体、外观和接触关系。在多样化的开放世界提示下,WorldClaw生成的大规模场景具有连贯的空间组织、视觉上引人入胜的局部内容,以及可编辑的实例级资源,同时保持一致的全局地形结构。
空间智能是具身智能体的基础,然而现有基准仅关注从单一或少数视角进行的局部空间感知,忽视了在连续、长时间跨度的视觉流中的全局空间意识。为解决这一局限,我们提出了全局-空间-时间基准(GST-Bench),这是一个用于视频理解中全局空间智能的视觉问答基准,包含从6,790分钟合成视频中提取并经人工验证的问题。该基准要求模型从输入视频中未出现过的全新视角进行准确的空间推断,并将第一人称观察映射到全局俯视图。对22个最先进的视觉语言模型(VLM)的综合评估揭示了模型与人类之间的显著差距:最强的零样本模型仅取得42.68分,远低于人类的79.08分。为探究这一差距的根源,我们构建了GST-Bench-Local,发现尽管模型在同一任务设定下表现出较强的局部空间理解能力,但仍无法将长时间跨度的观察整合为全局一致的场景表征。我们进一步提供了GST-Train,一个面向全局空间推理的数据集,作为补充资源,以促进未来对这一挑战的研究。
训练大型语言模型智能体进行长时程工具使用,通常依赖于与真实或合成可执行环境的交互,而这些环境的构建与验证成本高昂,或者依赖难以接地(ground)的外部模拟器。我们提出EnvACE,一种智能体强化学习方法,在训练期间用世界预演(world rehearsal)替代外部环境交互。策略在行动与预演之间交替:它首先生成一个工具调用,然后扮演环境角色,产生由该动作引发的响应,并基于预演的响应来调节后续决策。两个角色通过任务成功奖励进行端到端联合优化。通过世界预演,策略将动作与其环境响应之间的关系内化到参数中,形成一个直接支持决策的智能体世界模型。在BFCL-v4、tau^2-Bench、VitaBench和FinMCP-Bench上,EnvACE实现了强大且可迁移的性能,在整体评估中优于环境扩展基线。对照研究进一步表明,世界预演在不同模型规模上持续改善策略学习。在测试时,内化的世界模型能够在承诺执行之前进行私有预演,在适度的预演预算下,无需额外外部交互即可获得进一步增益。我们的发现确立了世界预演作为一条超越外部环境约束、扩展LLM智能体训练的新路径。我们的代码公开于https://github.com/Within-yao/EnvACE。
多模态大语言模型在被动感知方面表现出色,但在需要多步时序推理的复杂视觉认知任务中却面临困难。这种性能下降主要源于基于语言的推理固有一定的模糊性,难以准确描述连续的视觉变换。为解决这一问题,我们提出ChronoVision,一种旨在将视觉逻辑与潜在图像表征对齐的多模态框架。在监督微调阶段,重建视觉头(Reconstructive Visual Head)预测最终变换状态的潜在表示,而感兴趣区域注意力定位模块(ROI Attention Locating module)通过语义区间查询使模型聚焦于关键视觉证据。在后训练阶段,我们应用带有隐式过程对齐机制的强化学习,由复合奖励函数引导,该函数综合评估结果正确性、潜在过程对齐度以及无监督视觉聚焦度。此外,我们引入了Vbvr-VQA,一个新颖的数据集,通过将视频推理重构为严格的图像排序任务来评估时序跟踪能力。实验表明,ChronoVision在Vbvr-VQA上取得了最先进的性能,域内准确率达74.8%,域外准确率达71.6%,并在极具挑战性的跨域基准IntPhys2上取得55.0%的强劲准确率。
统一多模态检索旨在识别满足由异构输入所表达的复杂用户意图的候选。尽管基于大型视觉-语言模型(LVLM)的检索器高效且可扩展,但直接编码原始多模态输入往往忽略细粒度的判别性线索,导致语义相似的候选之间产生混淆。近期方法通过生成思维链(CoT)推理来丰富查询表示,从而缓解这一局限。然而,此类推理通常仅源于查询本身:它解释了查询描述了什么,而非检索器误解了什么。我们认为,有效的检索推理应以检索反馈为条件。基于这一见解,我们提出了UniME-R1,一种嵌入器-顾问框架,该框架学习对初始检索到的候选进行推理,并生成以检索为中心的思维链(RC-CoT)。顾问逐一分析候选,以识别嵌入器混淆的判别性线索。如果目标出现在初始Top-k集合中,UniME-R1直接对候选重排序;否则,它生成RC-CoT以优化检索方向,并使用双模式嵌入器进行全语料库重新检索。为了训练该框架,我们挖掘困难负样本以模拟真实检索失败场景,联合优化直接检索和RC-CoT增强检索,并通过监督学习和面向检索的强化学习将顾问与检索结果对齐。在MMEB-V2和多样化的通用多模态检索基准上进行的大量实验表明,UniME-R1在强基线上持续提升了检索性能。
经济世界模型(EWMs)是一类生成式经济模型,通过对异质性智能体及其信念与行动,以及它们相互作用产生总体结果所依托的市场与制度机制进行建模,模拟经济如何从内部演化。本文制定了一条实施路线图,旨在将经济世界模型构建为生成引擎,使异质性智能体在其中行动、交互、适应,并与市场和制度共同演化,从而从内部产生经济动态。我们将EWM系统组织为六级能力阶梯:从基于固定规则的智能体世界,到自适应和基于大语言模型的智能体世界,再到自我演化智能体、演化制度世界,以及与现实观测对齐的仿真到现实经济孪生。对这些层级的系统性文献综述表明,现有工作仍集中在较低层级的智能体和仿真环境中,而具备自我演化智能体、内生制度、持续实证对齐以及经过验证的经济机制的系统仍然罕见。通过将EWM议程转化为实施蓝图,本文旨在加速下一代经济仿真环境的发展,使其能够作为人类决策者的高保真沙盒,并作为AI智能体的训练、规划、评估和安全基础。我们发布了一份精选论文列表及相关资源,以支持未来研究。
随着大语言模型(LLM)越来越多地部署在智能体系统中,它们的能力不仅取决于模型权重,还取决于其外围的 harness——即围绕模型的提示、工具、控制流、记忆和编排代码。这使得自动化 harness 优化——由 AI 系统对 harness 进行迭代式、以评估为指引的改进——既是提升 AI 系统的重要途径,也是对 AI 系统自身的一项严苛能力要求。然而,社区目前缺乏一种通用协议来衡量前沿 LLM 在此任务上的表现。我们提出了 HarnessOpt-Bench,一个用于在昂贵且随机的评估条件下进行端到端 harness 优化的基准测试。优化器(一个 LLM 与一个编码 harness 配对)接收目标智能体的种子 harness、带评分的评估反馈以及固定的目标评估预算。它编辑 harness 并提名一个最终候选版本;该候选版本根据其在种子版本之上的归一化增益进行评分,评分基于在整个搜索过程中保持不可访问的预留测试分区。可信执行环境强制执行评估边界,计量目标智能体的资源使用情况,并保留各候选版本以供审计。我们在 4 个下游任务上,分别在共享编码 harness 和各自原生 harness 下,对 5 个前沿 LLM 作为优化器的表现进行了评估,共完成 111 次计分运行。实验结果表明,优化器模型之间的区分度大于其所借助的编码 harness 之间的区分度;原生 harness 并不始终更优;收益在不同任务和种子机制之间差异显著。这些结果将 harness 优化确立为一种可测量、可区分且仍有巨大提升空间的能力。
数据代理使得在组织工作空间中进行自然语言分析成为可能,而相关证据可能分散在数据库、结构化文件、长文档和多模态媒体中。现有基准测试大多将结构化查询、检索或开放式分析彼此割裂,未能充分统一异构证据发现、完整表格输出以及确定性评估。我们提出DataSpace,这是一个基准测试,其中的数据代理从任务本地的异构工作空间中生成可验证的表格结果。它包含410个跨语言任务和7,439个工件,总计15.01 GB,涵盖CSV、JSON、SQLite、Markdown、PDF和视频格式。DataSpace还作为KDD Cup 2026复杂数据分析数据代理竞赛的官方评估基准。每个代理仅接收一个问题和工作空间,并返回所请求的完整表格结果。我们使用DataSpace-Builder构建DataSpace,这是一个基于执行的框架,包含跨语言转换、约束感知的关系采样、模态路由与工件渲染,以及由11位领域专家进行的人工审核和任务修复。确定性评估器执行表头无关的列对齐、类型和精度感知的归一化以及顺序感知的行比较。在六种最新发布的前沿多模态模型和五种广泛使用的代理框架中,最佳准确率达到66.34%,而在固定主干模型的情况下,框架选择造成15.36个百分点的差距。多模态证据整合与连接操作在所有六种主干模型上持续降低准确率。这些结果表明DataSpace尚未饱和,并揭示了提升数据代理可靠性的关键挑战。
现代希腊语在NVIDIA的Nemotron检索模型以及主流多语言检索基准中均未涉及,尽管其在法律、能源、金融和医疗等领域的检索增强生成(RAG)应用中具有重要价值。我们提出了针对现代希腊语的Nemotron检索栈端到端适配方案,涵盖语料挖掘、合成监督、检索模型训练、重排序器适配、阅读器微调,以及一个新基准HERA。我们的研究表明,在专业希腊语语料上,无需参数训练的BM25基线表现优于多种现成的多语言稠密检索模型。在65,773个希腊语检索对上微调后,Nemotron 1B嵌入模型的nDCG@10从0.362提升至0.835,并显著优于未适配的原始模型。所学到的语言能力可迁移至通用领域的希腊语任务,但相对于BM25的优势仍具有领域依赖性。我们进一步适配了交叉编码器重排序器,并在各专业领域展示了持续的性能提升。最后,我们对Nemotron 30B-A3B混合专家阅读器进行LoRA调参以用于生成式问答,将人工评定的答案正确率从29.4%提升至66.9%,同时显著改善了忠实度和引文质量。我们还推出了HERA——首个大规模希腊语检索增强生成基准,并公开发布适配后的模型及基准,以支持希腊语RAG系统的未来研究。
在线策略蒸馏(OPD)正成为强化学习在LLM后训练中的一种有前景的替代方案,然而其在多语言场景下的有效性仍研究不足。我们研究了OPD及其进阶变体——在线策略增量蒸馏(OPD²),用于英语、韩语和日语的数学推理任务。OPD²通过利用后训练教师模型与其基础模型之间的概率差距作为学习信号,改进了OPD。基于Qwen3的实验表明,OPD²始终优于原始OPD,尤其在韩语和日语上提升显著,并且总体上缩小了英语与韩语之间的性能差距。我们进一步发现,仅使用英语数据的OPD也能提升韩语和日语的性能,但往往会使回复偏向英语,这凸显了多语言数据对于保持目标语言回复的重要性。
视觉-语言-动作(VLA)模型通常将主视角和腕部视角观测视为并行的视觉输入,忽略了它们在机器人操作中的不同作用。然而,精细操作受益于对腕部局部交互在全局任务上下文下如何演化的预期。为解决这一局限,我们提出了World-to-Wrist VLA(W2-VLA),一种面向精细机器人操作、具备任务条件化未来腕部建模能力的VLA模型。给定当前多视角观测和任务指令,W2-VLA将一组潜在建模令牌情境化为视觉-语言模型与腕部预测器之间的紧凑接口。在该接口及已观测腕部历史的条件下,预测器预测未来的腕部潜在表示,并将其转化为面向未来感知的上下文用于动作预测。此外,我们引入了W2-CoT,一种合成流水线,用于生成描述操作进展、物理过渡线索及腕部局部证据的结构化标注。这些标注提供了辅助监督,以塑造任务条件化的潜在接口。在LIBERO、RoboTwin 2.0及真实世界操作任务上的实验表明,该方法在单臂和双臂场景中均提升了精细操作和接触敏感操作性能,同时保持80 Hz以上的动作生成速率。
视觉-语言-动作(VLA)模型已成为机器人操作领域的一种强大范式,但为异构机器人本体训练单一通用策略仍是一个开放性问题。现有方法存在两个主要局限。首先,它们未能充分利用跨多样视觉与交互数据共享的动力学先验,限制了跨本体迁移能力。其次,它们需要大量人工预处理以将本体特有的动作转换为通用格式。为克服上述局限,我们提出DyPES-VLA,一种学习共享动力学先验(Dynamics Priors)与本体特有控制(Embodiment-Specific control)的跨本体VLA模型。首先,我们通过在跨本体数据上以未来预测目标训练视觉-语言模型(VLM)来学习共享动力学先验,促使共享查询表示捕捉物体运动、接触以及交互引发的场景变化。其次,一个本体特有的专家混合(MoE)动作头将这些共享动力学先验直接转换为各本体原生动作空间中可执行的控制指令,无需将异构动作人工预对齐为通用格式。该动作头共享注意力层以捕获共有的时序动作结构,同时其本体特有的前馈专家负责解析不同本体独特的运动学约束与控制语义。作为通用策略,我们的方法在仿真与真实世界评估中均达到最先进性能,在LIBERO上取得98.0%的成功率,在RoboCasa-GR1上达到59.25%,在RoboTwin 2.0上达到89.02%。
理解3D场景是具身智能的基础,需要对来自多种模态的异构信息进行联合推理,包括视觉和几何线索。然而,这些模态的相关性往往随查询而变化。现有的多模态大语言模型(MLLMs)通常依赖固定的模态组合,忽视了查询相关的模态需求。这种刚性设计可能引入来自无关模态的语义噪声,同时未能充分利用信息量更大的模态,导致计算浪费和推理效果削弱。为解决这些挑战,本文提出SmartMage——一个统一的多模态大语言模型,能够动态编排异构模态,实现语义感知的3D场景理解。具体而言,SmartMage包含:(1) 语义引导的模态自适应路由(SMART)模块,利用语义先验、文本-模态对齐和模态质量来选择任务相关模态;(2) 模态感知门控专家(MAGE)模块,利用模态先验引导专家激活,促进多模态推理中的自适应专门化。实验结果表明,SmartMage在五个3D场景理解基准上取得了最先进的性能,并在仅RGB视频理解基准上获得了具有竞争力的结果。在我们的诊断基准ScanFacet中,任务被划分为细粒度的语义类别,从而能够分析每种语义类型偏好的模态组合。观察到的模态-语义模式进一步证明了SmartMage的有效性。项目页面:https://yuecheong.github.io/SmartMage/。
计算机使用智能体需要付出完整的前沿模型推理成本,来重新推导其用户已经执行过的例行流程,因为当前智能体的记忆记录的是用户说过的话,而非用户做过的事。我们采用一条确定性、零模型的流水线,将被动捕获的屏幕活动编译为智能体记忆:该流水线将本地捕获流分割为类型化活动帧,即携带应用、站点、时间、输入量及指向原始行的证据指针的有界事件片段。流水线无需模型介入,因此输出字节一致、可缓存、可机械审计。在一位专业人士的单用户语料库上(51个活跃天,共128,756帧),该编译器将一天的原始捕获压缩为一个提示就绪的上下文块,体积缩小86倍,耗时68毫秒。读取该块的智能体在回答关于当天的问题时,以独立基准为参照达到98.4%的准确率(威尔逊95%置信区间:91.7-99.7%),而使用LLM对同一捕获生成的摘要仅能达到66-80%;中档模型读取该块的表现与前沿模型相当。 同一编译器还可充当需求侧成本工具。它从被动的、委托前的人类活动中读取数据,而非智能体运行轨迹,从而提供两个参数——例行流程开销比R和例行流程重复率h——智能体成本模型一直假设它们存在,但据我们所知尚未对其进行测量。我们报告R的首批数值(作为建模上限)为60-343倍;可委托重复率在样本内为9.0%、样本外为7.7%;在这些数值下,现实的全量智能体令牌上限接近8%。编译后的例行流程可在模型不介入的情况下确定性重放,并在一次守卫匹配命中时以零模型令牌完成了现场演示。模式、编译器和评估框架均已开源。
视频物体移除不仅需要消除目标物体,还需移除其引发的效应,同时保持高保真且时空一致的恢复效果。现有方法主要从预定义的效应类别和固定数据分布中隐式学习物体-效应对应关系,限制了其对复杂真实场景的泛化能力,这些场景涉及组合效应、空间分离或弱相关的效应、长尾物理现象以及动态演化的交互。我们提出EffectLearner,一种语义推理增强框架,将基于VLM的物体-效应推理器与基于DiT的视频擦除器相结合。在结构化效应分析提示的引导下,推理器对目标高亮视频进行跨模态推理,提取紧凑的效应感知上下文,从而引导视频擦除器实现全面的物体-效应移除。运动感知掩码引导与运动一致性监督进一步提升了物体运动和场景动态演化条件下的移除覆盖率与时空稳定性。为在挑战性真实场景中充分利用该框架,我们进一步构建了EffectWorld,一个专门针对复杂物体引发效应设计的成对视频数据集,并引入了一种结合通用监督与复杂效应数据的渐进式训练课程。在标准ROSE-Bench基准上,EffectLearner在大多数指标上优于现有基线,并在EffectWorld-Eval及更具挑战性的EffectWorld-Wild上均展现出明显优势,证明了其在复杂真实场景中提供高质量视频物体移除的能力。
训练终端智能体需要可执行且可验证的任务,这些任务不仅要可求解,还必须具备适合学习的适当挑战性。可执行性验证确立了可行性,却无法揭示任务相对于给定求解器配置的行为表现。本文提出CalibForge——一个自主式终端任务合成系统,通过利用经过验证的求解器行为,以对抗性求解器校准方式修订候选任务。多求解器校准针对异构求解器池中的分歧,而对比性求解器校准则针对指定的强通过/弱失败关系;两者均将锚定于已验证可解性的求解器相对可学习区间加以操作化。借助CalibForge,我们构建了5,431个经校准的终端任务。消融实验表明,相较于仅依赖编写与验证或普通单求解器反馈,这两种策略均能提供更有效的监督信号。在完整数据集上训练的模型在Terminal-Bench 2.0上分别达到32.58%和47.57%的成绩。相对对应基础模型的最大改进幅度在Terminal-Bench 2.0上达到24.71个百分点,在SWE-bench Pro上达到27.68个百分点,在Doc2Repo上达到30.04个百分点。综上,这些结果支持将求解器相对可学习性作为构建有效且可迁移的智能体训练数据的实用目标。
我们提出了 MameLoshnLM,这是首个专为意第绪语构建的开源 8B 参数语言模型。尽管意第绪语拥有丰富的文本传统,但其有限的数字存在以及可靠评估资源的匮乏,制约了意第绪语语言建模的进展。现有的多语言语料库和基准往往不能很好地代表该语言,其中包含大量带有噪声、机器翻译和错误分类的文本。我们通过引入 Oytser(一个结合当代网络原生来源与文学材料的高质量意第绪语预训练语料库)和 Kashes(一个涵盖翻译、语言分析、信息抽取和语言理解的多任务基准)来弥补这些不足。利用这些资源,我们对 Llama 3.1 8B 进行继续预训练,得到 MameLoshnLM。在该基准的各项任务中,MameLoshnLM 均优于同等规模的开源基线模型。我们的分析表明,这些提升不仅是数量上的:与通用多语言模型相比,MameLoshnLM 能更好地捕捉定义了该语言特征的词汇和形态模式,从而揭示了嘈杂的网络规模多语言数据在低资源语言上更普遍的失败模式。我们的研究结果既为意第绪语自然语言处理奠定了基础,也为在历史丰富但数字代表性不足的语言中开发语言模型提供了实用模板。
端到端文档解析器提供了统一接口,但将页面布局和区域内容序列化为单一自回归序列。这种建模方式迫使相互独立的区域进入一条解码路径,其长度随总内容增长;而基于裁剪的两阶段解析器则展现出区域级并行,代价是重复的视觉预填充和碎片化的页面上下文。为了在去除依赖的同时保留完整页面上下文,我们提出PaDoc——一种基于布局的解析器,它将预测的布局视为共享页面表示上的分支结构。在区域充分性假设下,我们推导出一种前缀条件分解,其中布局流和区域内容分支并发推进,将解码深度缩减为最长的布局-内容路径。我们在单个多模态大语言模型(MLLM)中实现了这一分解:打包的可变长度祖先注意力在标准下一词元训练下保持可见性,而掩码并行解码创建分支,由所评估的vLLM后端作为并发请求处理,并复用缓存中的共享前缀。在OmniDocBench Full上,PaDoc取得了91.1的总体布局F1,并且在端到端解析器中以94.24的顶级总体得分位居前列,同时取得了最佳Text Edit(0.038)和Formula CDM(95.59)。在一个384页子集和单张A800 GPU上,PaDoc在五个并发级别下均是最快的端到端解析器,相对于同骨干的Sequential SFT基线,有效页吞吐量提升了67.4%–118%,P95延迟降低了39.2%–54.9%。代码可在 https://github.com/Longin-Yu/Padoc 获取。
潜在扩散建模(LDM)作为一种重要范式,利用分词器将输入信号映射为压缩表示。这种依赖关系使分词器成为生成过程本身不可或缺的一部分,因为它影响学习速度、合成样本的质量,并为后续应用奠定基础。本报告介绍了一系列用于音频、图像和视频的KVAE分词器,所有模型均设计用于后续的文本条件生成:KVAE-Audio,一种连续全频带48 kHz分词器,具有50 Hz的64通道潜表示;KVAE-3D——两种因果视频分词器,分别实现4x16x16和4x8x8压缩;KVAE-2D,一种图像模型,以32通道将输入压缩8倍。我们证明,在重建指标(PSNR、LPIPS、PESQ等)以及生成结果的客观指标(弗雷歇距离、CLIP分数、CLAP分数等)和主观指标(并排对比评估)上,本方法匹配或超越了前沿开源分词器,例如来自Wan-2.2、HunyuanVideo-1.5、FLUX.2、MovieGen、StableAudio和MMAudio的VAE。考虑到开发难度,我们与社区分享训练细节、模型选择方法以及设计选择上的消融实验。代码公开于https://github.com/kandinskylab/kvae 和 https://github.com/kandinskylab/kvae-audio。
经典的持续学习(CL)主要聚焦于通过以参数为中心的机制来更新和保持知识,例如训练策略、架构设计和权重自适应。然而,新兴范式正在重塑持续学习的范畴,使其超越传统的模型适应性视角。例如,在策略学习拓展了更新机制的维度;测试时训练将持续学习从训练阶段延伸至推理阶段;而外部辅助组件,如记忆、技能库和交互协议,将模型能力的演化边界远远拓展至静态参数空间之外。总体而言,这些进展表明学习正从以参数为中心向系统级适应性转变。为刻画这一转变,我们通过三个维度审视持续学习的演化过程:学习发生的“何时”(When)、“如何”(How)与“何处”(Where)。其中,“如何”维度涵盖离策略、在策略及超越梯度的优化机制;“何时”维度涵盖预训练、后训练及推理时阶段的演化;“何处”维度则界定内部参数更新与外部结构约束之间的区别。以这一三轴框架为基础,我们对代表性方法进行了系统梳理,追踪持续学习正在经历的转变,并讨论了这一范式转移所带来的关键挑战、更广泛的影响以及未来发展方向。
深度视觉模型会利用捷径,依赖于与监督信号相关的线索。先前工作主要关注可见偏差,例如物体-背景或纹理相关性。我们识别出捷径学习的另一个来源:嵌入在像素级别的不可见元数据痕迹,这些元数据涉及图像处理和照片采集。我们假设大规模语义监督——无论是通过类别标签(ImageNet)还是十亿规模描述文本(LAION)——在预训练期间自然诱导出元数据-语义相关性,从而使模型将低层信号转化为预测性特征。通过引入受控的元数据-语义相关性,我们证明更强的相关性会导致对元数据痕迹的系统性更高敏感性,并在元数据分布偏移下带来更大的性能下降。我们进一步探索了在预训练期间和之后应用的缓解策略,这些策略不仅降低了对目标元数据的敏感性,也降低了对未见元数据的敏感性,同时不牺牲下游任务的性能。元数据敏感性也有积极的一面:它部分解释了一些编码器强大的生成图像检测能力,而缓解这种敏感性可以改善分布外泛化。代码:https://github.com/ryan-caesar-ramos/visual-encoder-traces
近期视频模型日益支持在单一模型内实现生成、参考条件控制和编辑,但通常将这些操作作为面向固定输入的独立功能。实际创作过程跨越多个镜头展开,要求模型既能根据文本生成,也能遵循参考或编辑源视频,同时保持共享历史。我们将这一设定形式化为交互式多镜头视频创作(IMVC),并提出ContextMaster——一种采用角色感知上下文表示来支持上述操作的统一模型。交互式模型必须持续访问不断扩展的历史,同时避免每次去噪步骤的上下文读取成本随之增长。ContextMaster将可复用的干净上下文状态与固定预算的稀疏上下文路由相结合,并使用ConstraintSink保持任务约束可见。针对稀疏上下文访问与少步去噪推理的双重挑战,我们提出了一种两阶段特权上下文蒸馏框架:首先通过一致性蒸馏从稠密教师模型中迁移完整上下文行为,随后通过分布匹配优化部署时的推理过程。在三个基础任务上的实验表明,与专用基线相比,该方法在任务完成度和跨镜头一致性方面均有提升。用户研究进一步验证了灵活组合的工作流程,且该模型在单块GPU上达到16 FPS。
当前的视频世界模型在多玩家环境中面临困难,因为它们将世界状态与视角相关的视觉潜变量纠缠在一起,导致计算冗余、视角不一致以及可扩展性差。我们提出MAS(基于权威共享状态的多玩家世界模型)来解决这一局限。受多玩家游戏架构启发,MAS将世界动态与视角渲染解耦。一个学习得到的逻辑引擎仅依据联合动作推进全局、权威的类型化状态,无需任何手写转移函数,并充当唯一的循环记忆与同步参考。基于这一共享状态,一个学习得到的渲染引擎能够按需为任意请求的视角生成独立且一致的视图。这种显式解耦使MAS在与最先进的多视角基线进行匹配多玩家贪吃蛇基准测试时,实现了更优的状态准确性和更低的跨视角不一致性。它能够以1,024个并发玩家推进预测世界10,000个循环步骤。我们的结果表明,显式的权威状态建模为可扩展且一致的多智能体世界模拟提供了实用基础。
机器人学习正在分化为两大方向:一类是将能力固化进冻结权重的策略(视觉-语言-动作模型,即VLA模型),另一类是以代码形式编写并不断优化自身可执行技能的智能体。本综述围绕"权重vs技能"这一主轴来组织该领域。其核心分析贡献在于深入梳理了代码即策略方法按自我改进程度的分布——从零样本程序合成,经闭环自修复和持久技能记忆,直至执行反馈、技能记忆与进化搜索融合为一个开放式循环的象限,而该象限目前研究者寥寥;仅有少数非常新的系统(如ASPIRE、ENPIRE和RoboClaw)占据此位置。我们同时梳理了互补的"技能"一极,涵盖从无监督强化学习技能发现到大语言模型技能库的各类方法,并表明"技能"一词至少存在五种不同的含义,其中只有代码意义上的技能能在无需梯度更新的情况下实现自我改进。随后,我们将该分类体系与新兴的技能经济联系起来:商用机器人技能市场目前可跨机器人分发一键技能,但仅提供静态回放,这暴露了适应性、跨具身可移植性、溯源、安全验证、组合与标准化等方面的开放性问题。这是一篇刻意聚焦的综述。它并非穷尽式地罗列该领域,而是通过一个分类体系和一组对比表,考察了六大技术类别中的77个代表性系统,并提供了自我改进机制的操作性定义,同时阐明了各类别的能力边界。
世界模型因其捕捉和预测物理世界结构与动态的能力而受到广泛关注。在这一新兴研究领域中,联合嵌入预测架构(JEPA)提供了一条尤为引人注目的方向。 我们研究了一个很大程度上未被探索的场景:全球南方人口稠密、拥挤且混乱的城市环境,我们称之为DENSEWORLD。与主导现有评估的低密度、车道结构化场景不同,这些场景呈现出软性空间边界、极端的智能体异质性、持续遮挡以及混行交通下快速的社会性协商。我们为该场景引入了首个大规模数据集:涵盖22个城市的1,000小时行车、步行和航拍视频。现有JEPA方案难以在异质性和部分可观测性条件下保留密集交互动态。 我们提出FactorJEPA,将世界结构作为一等预测原语。它并非将未来编码为单一整体的潜在表示,而是通过可见性门控和分离子空间组合布局、实体与交互,以保留仅部分可观测的智能体并抑制跨因子捷径。FactorJEPA改善了(i)未来潜在表示的准确性(未来帧L1)、(ii)干预敏感预测(因果L1)和(iii)对视觉证据减少的鲁棒性(掩码率斜率),同时展现出(iv)可复现的运动-信息权衡(运动余弦)。方法排名在2B和1B V-JEPA 2.1骨干网络上一致复现,ρ = 0.895至0.978。 我们公开发布了DENSEWORLD-115k数据集(https://huggingface.co/datasets/anonymousML123/denseworld-115k)和经surgery训练的FactorJEPA检查点(https://huggingface.co/datasets/anonymousML123/factorjepa-outputs/tree/main/outputs/full/vjepa_2_1_vitg_1B/train/m09c_surgery_3stage_DI_diheavy_encoder)。
多语言文本嵌入模型通常在不同任务上使用单一训练目标进行适配,尽管不同任务需要截然不同的优化策略。我们提出了任务条件流匹配(Task-Conditional Flow Matching, TCFM),这是一种多语言嵌入适配框架,它选择性地将流匹配应用于翻译任务,同时使用与检索、分类和成对分类任务学习动态更契合的目标来优化这些任务。TCFM 进一步结合了教师引导的表示保持与三阶段课程,以实现稳定的适配。在印度语系大规模文本嵌入基准(Indic Massive Text Embedding Benchmark)上的评估表明,TCFM 取得了新的最先进成果,在多种多语言任务中持续提升嵌入质量,并能跨嵌入模型家族进行泛化。论文被接收后,我们将公开发布代码库和数据集。
从重建场景中以最少用户操作选择完整3D物体,对于实际场景编辑和具身交互至关重要。现有的基于3DGS的方法要么重新训练高斯表示以嵌入逐对象标签,要么构建密集的多视图SAM观测,这两种方式都需要沉重的计算开销和密集的视角覆盖,而后者在实际中很少可用。我们提出GaussianSelector,一种无需训练的框架,可在稀疏视图和稀疏涂鸦引导下进行交互式3D物体选择。该方法直接操作原生高斯基元,将密集高斯粗化为几何连贯的超点,并利用外观与空间线索构建连续性加权图。稀疏用户涂鸦通过可见性感知的透射率覆盖被提升至3D,选择问题则被建模为全局图割能量最小化,从而将稀疏证据传播至完整3D物体。这一设计天然支持多轮细化,用户可从额外视角迭代修正选择,逐步改进结果。实验表明,GaussianSelector在达到与最先进的多视图SAM方法相当的选择质量的同时,所需的交互视图数量显著更少,计算开销大幅降低。这些特性使其非常适合在实际部署场景中用于人在回路的3D场景编辑和3D资产提取。