每日精选AI研究论文及翻译
基于可验证奖励的强化学习(RLVR)是改进语言模型推理能力的一种强大方法,但每次应用于新的强模型时成本高昂,因为目标模型在训练过程中需要生成大量轨迹采样。随着模型规模扩大,后训练本身成为了一个瓶颈。我们研究了一种“弱到强”的替代方案:在轨迹采样成本更低的较小模型上运行强化学习,然后将该强化学习的结果复用来改进更强的目标模型。直接蒸馏强化学习后的弱教师模型是不够的,因为教师模型的最终策略混合了强化学习带来的有用增益与小模型的固有局限。我们提出了直接在线策略蒸馏(Direct-OPD),该方法转移的是教师模型因强化学习引起的策略偏移。Direct-OPD将强化学习后的教师与其强化学习前的参考模型进行比较,并将其对数比值作为针对学生模型的密集隐式奖励。简单来说,这一检查点对告诉我们强化学习使弱模型更倾向于或更不倾向于采取哪些动作,而Direct-OPD在更强学生模型自身的在线策略状态上应用这一信号。这种方法直接复用了弱模型强化学习的监督信号,而无需在目标模型上运行稀疏奖励强化学习。实验表明,Direct-OPD能够一致地利用弱教师模型来改进更强的目标模型;值得注意的是,它使Qwen3-1.7B在AIME 2024上的成绩从48.3%提升至58.3%,仅需在8块A100 GPU上训练4小时。该方法优于步数匹配的直接强化学习,并且能够实现多个策略偏移的序列组合。我们的结果表明,强化学习的结果可以跨模型规模作为隐式奖励信号复用,而不仅仅是作为最终模型来模仿。
视觉语言导航基础模型旨在将深层推理能力与空间决策能力相统一,同时兼具广泛适应性以应对多样的具身任务。当前方法通常通过将观测直接映射为动作的单一策略来实现这一整合,但这类方法常面临坐标漂移以及对长尾语义处理不佳的问题。此外,这些黑箱映射缺乏可解释性,阻碍了通用性、鲁棒性与透明性的同步实现。我们提出ABot-N1,向通用视觉语言导航基础模型迈进一步。该方法通过双视觉-语言信号引导的慢-快架构,将认知与控制解耦,从而解决了上述挑战。具体而言,一个慢速视觉-语言推理器执行显式的思维链推理,同时生成一个像素目标。这一紧凑的图像空间锚点集合充当多种任务的通用接口,包括点目标、对象目标、兴趣点目标、指令跟随以及人物跟随。随后,一个快速动作专家利用文本线索和像素指引,以原生控制频率生成连续路径点。通过将高层意图与低层控制经由像素级锚点及显式语言轨迹相连接,我们的方法在仿真与真实世界基准测试中实现了鲁棒、通用且可解释的导航。ABot-N1刷新了多项最先进纪录,尤其是在城市场景导航中表现突出:兴趣点到达率提升35.0%(达到77.3%),在复杂室内外场景中分别达到95.4%和92.9%的成功率。同时,在物体到达、人物跟随和指令跟随任务中保持了卓越的鲁棒性。我们开源了新的点目标/兴趣点目标基准数据集,以推动城市场景导航领域的发展。
近期视觉语言模型(VLM)与视觉语言动作(VLA)系统提升了机器人感知与动作预测能力,但长时域具身智能体仍需通用运行时层来支持推理、记忆、工具使用、验证及跨本体执行。我们提出ABot-AgentOS——一种通用机器人代理操作系统,位于底层控制器之上,提供面向场景规划的审慎代理层、上下文隔离的技能执行、多阶段验证、多模态记忆及边云协同。为评估此类系统,我们引入EmbodiedWorldBench——一个包含16个室内外及混合场景、四个难度等级、涵盖导航、物体搜索、NPC对话、动态事件及基于轨迹评分的200余项任务的可执行基准测试。ABot-AgentOS进一步提出通用多模态图记忆(Universal Multi-modal Graph Memory),这是一种持久化、源锚定的基板,可将对话、视觉观测、空间上下文、时序关系及任务轨迹转化为类型化节点与边。其故障驱动的自我进化循环可将诊断出的记忆故障转化为门控运行时进化资产,仅后续评估分割可访问,既避免当前分割的真相泄露,又实现持续改进。在EmbodiedWorldBench初始子集上,ABot-AgentOS在任务成功率与目标完成度上均优于单控制器基线。跨记忆基准测试中,ABot-AgentOS静态版本在LoCoMo上达87.5,在OpenEQA EM-EQA上达59.9,在Mem-Gallery上达88.6,在NExT-QA上以76.5的整体准确率领先;自我进化进一步将LoCoMo提升至88.7,OpenEQA提升至60.4,Mem-Gallery提升至89.0。结果表明,通用Agent OS层可提升长时域具身执行能力,并为持续交互提供持久、可审计的记忆。
现有的动态人体体积捕捉技术虽然能通过密集相机阵列实现高保真度,但在现实场景中通常仅有少量低重叠相机可用,这会导致输出质量下降并留下大量未观测区域。近年来,4D重建方法虽聚焦于低重叠场景,但在未充分观测区域仍会产生明显伪影。视频扩散模型虽成为另一种选择,但应用于人体时会出现几何不一致的结果。为解决这些限制,我们提出StudioRecon——一种通过解耦背景与人体,从稀疏低重叠相机重建4D人体场景的流水线。我们利用视频扩散模型合成数百个受相机参数控制的新视角,从而增强背景监督信号。同时,我们结合跨视角身份关联与三角化多视角关键点拟合,稳健初始化可变形高斯人体模型。最后,我们提出的递归增强模块通过运动自适应一致性注入对合成输出进行调和,进一步消除残留伪影。在四个真实场景数据集上,我们实现了当前最优的新视角合成效果,并展示了新颖轨迹渲染与人体替换等应用。
移动和可穿戴设备上的个人AI助手通过视觉和音频流持续感知用户的日常生活。然而,回答关于过往经历的查询需要一种能够持续积累、组织和检索长期经历的轻量级多模态记忆系统,这仍然具有挑战性。为应对这一挑战,我们提出了LightMem-Ego,一种用于日常生活辅助的轻量级流式多模态记忆系统。该系统持续捕捉第一人称的视觉和音频流,将其对齐到统一的时间线上,并组织成由当前记忆、短期记忆和长期记忆组成的层次化记忆。当收到用户查询时,LightMem-Ego会动态地将检索路由到相应的记忆层级,并基于多模态证据生成答案。该演示可部署于智能手机和AI眼镜,支持物体查找、对话回忆、生活总结、日常模式发现以及个性化辅助。代码已开源:https://github.com/zjunlp/LightMem-Ego。
大型语言模型(LLMs)在高中及奥赛风格数学问题上取得了显著成绩,但其在高等数学领域的能力仍不为人知。现有基准评测在覆盖范围和评估粒度上均存在不足:一方面学科覆盖面有限,另一方面往往仅依赖最终答案的正确性或粗略判断,难以充分评估推理过程的有效性。为弥补这一缺陷,我们提出了AdvancedMathBench——一套专用于评估高等数学推理能力的基准套件。其核心证明生成基准ProverBench包含296道题目,覆盖本科水平及博士资格考试难度。为对生成证明进行可靠评估,我们开发了基于大规模专家标注训练的自动化验证流水线,既能给出正确性判定,又能对证明错误进行细粒度评估,且对预留的证明轨迹与人类专家高度一致。此外,我们引入VerifierBench,包含888条模型生成的证明轨迹及对应的专家标注真值,用于评估模型能否正确判断证明有效性并提供合理的验证解释。实验表明,AdvancedMathBench对前沿模型仍具挑战性。在证明生成任务中,最佳模型GPT-5.5-xhigh在UGD和QE子集上的得分分别仅为75.8和66.1,表明高等数学证明构建仍有较大提升空间。在证明验证任务中,最佳模型平衡F1得分仅为65.1,且各模型通常表现出较低的真负率,说明关键错误检测仍是主要瓶颈。
元认知是智力的基础组成部分,对有效学习、问题解决、决策制定、沟通等方面至关重要。近年来,它逐渐被视为构建强大、透明人工智能系统的核心要素。然而,尽管大语言模型(LLM)在多种现实任务中取得了显著进展,但目前尚不清楚它们何时、以何种方式以及在多大程度上能够展现或具备有效的元认知能力,也不清楚如何利用这些能力来提升AI系统的基础能力、可靠性和智能水平。本文通过首次系统梳理LLM元认知研究现状,填补了这一空白。我们分析并分类了这一新兴领域的格局,总结了最新技术进展,包括用于测量和评估LLM元认知能力的方法与基准、激发、改进和应用LLM元认知的技术,以及当前研究的发现与启示。我们还讨论了应用场景、开放问题与挑战,以及未来工作的潜在方向。旨在提供该主题的详尽、最新综述,并推动有意义的研究与讨论。相关文献列表可参见https://github.com/yale-nlp/LLM-Metacognition。
可操控性是通用机器人策略的核心能力,但由于缺乏大规模、语言对齐且动作精准的演示数据,这一能力在灵巧手系统中仍然基本缺失。为突破这一瓶颈,我们提出了一套全栈系统,该系统从第一人称人类视频中扩展灵巧VLA预训练,并实现了数据高效的实体机器人后训练。它集成了三个核心组件:EgoSmith数据管道——将野外第一人称视频整理成9600小时的高质量预训练数据,吞吐量较此前最优方法提升9倍且精度更高;一套用于遥操作和人在环路校正的统一机器人框架;以及EgoSteer——基于优化基础设施训练的、由世界模型增强的VLA模型。人类数据预训练赋予了EgoSteer语言引导的操作先验知识,这些先验知识通过机器人后训练落地,并借助DAgger改进得到优化。实验结果表明,EgoSteer能够稳健地执行40余种不同任务的自由形式指令,展现出故障恢复、灵巧操作和泛化能力。该预训练模型还能在两种实体上通过少样本学习适应复杂的长时程任务(包括折叠箱子),成功率超过75%。我们已在https://egosteer.github.io/开源了该系统、数据和模型。
后训练对提升大语言模型(LLMs)的领域特定能力至关重要,但现有的奖励优化和分布匹配方法将策略探索与分布对齐紧密耦合。这种耦合迫使模型直接在策略模型上进行昂贵的探索,严重阻碍了优化信号的异步生成、复用以及跨模型迁移。在本文中,我们提出代理引导的更新信号迁移(PUST),一种新型后训练框架,从根本上将更新信号的探索与分布对齐解耦。PUST 并非使用主模型进行昂贵的探索,而是采用轻量级代理模型作为高效的试验平台,用于发现高奖励行为。我们提取代理模型在初始状态与优化状态之间的相对改进信号,并将这一方向性更新迁移至主模型,以指导其策略对齐。这一解耦流程——包含代理探索、更新信号提取与信号迁移——显著降低了计算开销,并使优化信号能够异步生成、缓存和复用。关键在于,通过迁移相对改进而非绝对策略分布,PUST 天然支持从弱到强的改进以及无缝的跨模型迁移。在 Qwen3 系列模型上针对数学和代码领域的系统评估表明,从显著更弱的代理模型中提取的更新信号,能够稳健且可调节地增强更强的主模型。最终,PUST 将后训练从单一的在线优化过程转变为高度模块化、可复用且成本高效的范式。
探索对于多智能体系统的可靠自主性至关重要,然而当前尚不明确大语言模型(LLM)智能体在相互交互时能否有效进行探索。研究表明,现代LLM智能体在此方面表现不佳,常呈现出短视和两极化的交互模式,导致协调欠佳及遗憾值增加。我们将这一挑战形式化为多智能体探索问题,并将其建模为部分可观测随机博弈(POSG)问题,其中智能体需探测同伴以推断其能力并识别有效交互策略。为此,我们提出多智能体上下文探索(MACE)框架,这是一种通过结构化同伴选择显式促进探索的轻量级方法。在上下文多样性与参数多样性两类设定下,MACE显著改善了探索行为及下游任务性能。理论上我们进一步证明,探索的价值随智能体多样性增加而提升。总体而言,我们的结果凸显了当前LLM智能体的根本局限,并强调了明确引导探索对于可靠多智能体自主性的重要性。代码将发布在 https://github.com/deeplearning-wisc/mace。
理解复杂认知功能在人工系统中的组织方式,对于解释大型语言模型(LLMs)并将其与生物认知相关联至关重要。然而,尽管LLMs展现出广泛的类认知行为,其内部表征是否构成可复现的功能系统,从而解释行为、失败模式及与人类认知的联系,仍不清楚。在此,我们提出NeuroCogMap——一个受认知神经科学启发的框架,将LLMs的内部特征组织成功能分区,并将其与可解释功能、认知能力及认知层级相联系。这些分区形成稳定且语义连贯的组织结构,部分跨模型保守,并与模型输出在功能上关联。在该组织内,LLMs的主要失败模式,包括幻觉、偏见、拒绝失败及谄媚,对应于表征与行为控制系统中的不同干扰,从而产生用于机制引导的检测与定向干预的内部特征。超越模型行为层面,NeuroCogMap提升了自然语言理解过程中人类皮层反应的预测能力,其中高阶联合皮层的对应关系最为显著。在认知层面,其内部特征揭示了潜在策略,指导了对人类决策经典模型的改进。综合而言,这些发现将NeuroCogMap确立为一种系统级框架,用于映射人工系统的功能组织,并将该组织与人类皮层功能和认知行为相关联。
语言模型正越来越多地被用于跨语言和文化背景的道德决策,但现有研究在三个方面忽视了多语言性:1)多语言评估基准依赖直接翻译,未能适应文化特定内容;2)道德推理的推理时方法依赖于静态、以英语为中心的框架,且缺乏道德理论基础;3)道德决策的训练方法通常需要来自更强模型或人工标注者的昂贵监督。我们通过三项贡献填补这些空白。首先,我们提出了MCLASH,一个多语言道德决策基准,旨在捕获跨语言的文化嵌入道德直觉和社会规范。其次,我们提出了MET(基于理论推理的多语言伦理方法),这是一种两步提示方法,建立在来自心理学和哲学领域的专家策划、基于理论的依据之上:模型首先选择情境和特定文化的依据,然后用用户的母语进行推理。第三,我们提出了MET-D(MET蒸馏),该方法通过一个无需外部监督的自蒸馏训练阶段增强第二步。MET-D在三个不同规模和家族的模型(Qwen3-4B、Qwen3-8B、Gemma3-4B)上相比基础模型平均提高了MCLASH上的宏观F1 3.71分,在MMoralExceptQA上提高4.23分,其中在Qwen3-8B上马来语的MCLASH增益最高达到12.94分。我们进一步揭示,MET-D平均增加了62.13分的母语推理,并且有益依据在不同文化中存在系统性差异。这些贡献共同为文化对齐、理论奠基的多语言道德推理开辟了道路。
虚拟试穿(VTO)在将服装真实地迁移到目标人物身上取得了显著进展。然而,大多数系统几乎没有让用户控制服装的穿着方式——其尺码(宽松或合身)、款式(例如,塞入或外露、敞开或闭合)以及身体上的空间位置。我们通过两项互补贡献来填补这一空白。首先,我们通过VIP-SAM定义并解决了视觉实例提示分割(Visual-Instance-Prompt Segmentation)任务:给定一件服装的平铺图,在穿着该服装的人物照片中分割出该特定实例。这是一项实例级任务,区别于通常研究的类别级分割。其次,我们提出了CtrlVTON,这是一个可控的VTO框架,它将试穿重新定义为图像编辑问题,并添加分割掩码作为服装布局的像素级控制,包括款式、尺码和身体上的空间位置。VIP-SAM和CtrlVTON分别在各自任务上达到了最先进的结果。特别地,CtrlVTON生成的图像在遵循用户提供的布局方面远强于最强专有编辑系统,同时在服装保真度上与它们相匹配。
最近的基础图像和视频生成模型具备强大的泛化能力和可控性,但它们直接应用于具身场景时,受限于多视图一致性、几何一致性以及机器人具身约束等要求。现有方法通常使用有限的机器人数据微调基础模型,往往牺牲了在大规模预训练中获取的视觉知识。我们提出小米机器人-U0(Xiaomi-Robotics-U0),这是一个拥有380亿参数的多模态自回归模型,用于统一的具身合成。它将具身生成视为基础图像和视频生成的扩展,并联合优化了文生图、图像编辑、具身场景生成、具身迁移以及具身视频生成任务。这一统一框架在保留预训练世界基础模型泛化能力的同时,使其适应具身场景。小米机器人-U0是首个支持跨多种机器人具身形态的高质量多视图场景生成模型,并引入了结构化的、可控的具身迁移,实现细粒度编辑,同时保持多视图一致性和交互动态。它在单步和序列生成任务上取得了最先进的结果,在具身场景生成与迁移的人工评估中优于GPT-Image-2.0,在具身视频生成的世界竞技场(World Arena)中排名第一,并在具有挑战性的真实世界操控任务中将pi_0.5的分布外成功率从36.9%提升至63.2%。这些结果表明,基础世界模型既可以作为具身世界模型,也可以作为具身智能的可扩展数据引擎。代码和检查点可通过https://robotics.xiaomi.com/xiaomi-robotics-u0.html获取。
生成和编辑人脸需要极高的精度,因为即使是细微的改动也可能显著改变被识别对象的身份特征。然而,当前基于通用文本到图像模型的个性化与编辑方法,往往缺乏实现精细面部编辑所需的精度。我们提出了一种方法,用于对文本到图像个性化模型进行细粒度的身份微调。与标准图像编辑(对给定图像进行操作)不同,身份微调会修改特定身份的潜在表示,从而生成多种一致呈现同一编辑后身份的多样化图像。为了实现细粒度的潜在身份微调,我们探索了用于文本到图像个性化的预训练冻结编码器的潜在空间。我们的方法无需额外训练,而是利用冻结编码器的现有架构来揭示潜在语义方向。该空间由一组潜在标记组成,这些标记在捕捉身份的不同方面扮演着独特角色,并且通常对应于特定的空间或语义面部区域。我们证明了在该空间内以及由选定标记定义的子空间中,可以识别出有意义的语义方向,从而实现局部化、细粒度且语义连贯的编辑。通过定性和定量实验,我们验证了该方法能够在保持跨图像身份一致性的同时,实现多样化的局部面部编辑。项目页面:https://garibida.github.io/IdentityTuning/
本文探索了将一段视频中的运动迁移至另一段视频的技术,这对于动画中不同角色的动作生成至关重要。此前,视频运动迁移主要围绕人类及类人角色展开研究,推动了数字创作领域的诸多应用。然而,这些方法存在一个核心局限:相关技术流程高度依赖预定义的人体骨骼结构,并要求基于骨骼条件进行模型训练。一方面,这些方法难以泛化到不同物种的动物等多样角色,同时保留其独特的运动风格;另一方面,多样化骨骼的标注数据稀缺,进一步限制了该任务的大规模训练。在本文中,我们跳出基于骨骼的运动迁移框架,提出了一种无需训练的运动迁移框架——Motion4Motion。该框架通过建模视频中角色的运动流而非骨骼结构,从而更易于实现跨物种的运动迁移。大量实验与新颖应用表明,我们的方法显著优于基线模型。项目页面请见 https://lhchen.top/Motion4Motion。
在精心设计的潜在表示上进行流匹配,近期已成为一种用于拓扑感知网格生成的强大范式。然而,现有方法将顶点与连通性共同建模于一个联合潜在空间中,使得连续的顶点几何形状与离散的组合结构相互纠缠,这增加了流学习的复杂性,并表现为顶点漂移和表面断裂。我们提出LATO.2,一种分解式流匹配框架,它将网格生成分解为顶点流以及基于已生成顶点条件化的连通性流,且两个阶段均锚定于共享的粗体素支架。专用的VAE支撑这两个阶段,以亚体素精度恢复顶点,并将离散的连通性嵌入到连续潜在空间中。我们展示了这种分解独有的两大优势:(i)分部件生成——将支架划分为多个部分,每个部分以完整的潜在容量进行合成,从而生成比单一潜在表示所能实现的显著更高分辨率的网格;(ii)拓扑自适应编辑——通过操控第一阶段的顶点,无需重新优化即可诱导相应的连通性。实验表明,LATO.2在几何保真度和连通性质量上超越了当前最先进的拓扑感知网格生成方法。
为何基于简单图像与数据增强的对比学习能为下游任务生成有用的表征?我们通过分析计算针对一系列基础增强操作和任意具有平稳统计特性的图像数据集的对比损失最优表征来探讨这一问题。研究表明,对于某些增强操作,最优解可通过第一层滤波器为正弦函数的CNN实现,该网络随后依次接入逐点非线性变换、全局平均池化以及执行部分白化的最终线性层。我们还发现,对于更复杂的增强操作,此类CNN中的最优权重仍保持正弦形式。给定数据集的预期功率谱后,正弦函数的频率及其权重可通过简单的水注算法计算得出。针对不同图像数据集与增强操作的实验表明,经SGD训练后的此类CNN确实在其第一层学习到正弦函数并实现了部分白化。
当前视频大语言模型(Video LLMs)在问答任务中表现优异,但大多以黑箱方式运作,仅输出文本答案而缺乏可验证的视觉依据。现有的可解释性方法依赖于文本解释或稀疏的边界框,难以捕捉复杂的视频动态信息(如遮挡与非刚性变形)。为此,我们提出基于证据的视频问答(E-VQA)新任务,要求模型同时输出语义答案与精确的时空证据:即时间片段与密集、可追踪的对象分割掩码片段。为支持该任务,我们构建了ST-Evidence——首个经人工验证的基准数据集,用于判别式与生成式像素级定位。对现有最先进模型的评估揭示:问答准确率与真实视觉感知之间存在关键解耦,且仅靠规模扩展无法弥合这一差距。为解决此问题,我们开发了可扩展的自动化生成流程,构建了ST-Evidence-Instruct数据集(16万规模),将高层推理与细粒度定位相衔接。在此数据上微调具备空间定位能力的视频大语言模型,相较于同等规模的UniPixel基线模型获得了显著提升(例如7B模型上t-均值提升27.2,J&F指标提升13.8),为可解释、基于证据的视频理解建立了稳健基线。代码与数据已开源:https://github.com/SalesforceAIResearch/EVQA。