每日精选AI研究论文及翻译
语音和音频生成在动画配音、有声剧、电影、广告、游戏、播客和短视频制作中有着广泛需求。在这些场景中,创作者可能需要在没有参考录音的情况下设计声音,通过自然语言控制说话人风格,支持带有环境和音效的声学场景,并在后续复用所设计的声音。因此,支持同时面向指令任务和零样本任务的多说话人语音与音频生成至关重要。指令任务需要对环境、说话人风格和细粒度内容进行描述,而零样本任务则使用参考音频以及相同的细粒度内容。我们从数据和模型两方面着手应对这些挑战。首先,我们提出SwanData-Caption,对原始语音和音频数据进行清洗,补充有针对性的合成数据覆盖,并标注多样且准确的多层级描述。接着,我们提出SwanTale,一个支持零样本和指令任务的多说话人表现力语音与音频生成模型。我们引入SwanVAE以支持高质量的多音频模态生成,并采用奖励条件质量控制和印记条件(Engram conditioning),结合统一的混合专家模型(Unified MoE)实现多任务和多音频模态建模。此外,我们利用课程学习和GRPO后训练,使模型逐步学习并强化自身能力。实验结果表明,SwanTale在多个关键零样本和指令指标上处于领先地位,在两项任务中均取得最佳表现力得分,并支持涉及多说话人语音和音频的复杂指令生成。演示可在https://swanaigc.github.io/\#swantale查看。
大语言模型(LLM)智能体越来越多地承担需要跨多个相互依赖步骤进行持续推理、工具使用和修订的长程任务。然而,现有的智能体框架在持续增长的上下文中维护任务执行、任务状态和完成度评估,这使得状态难以追踪,并使错误的自我评估得以传播到后续决策之中。我们将长程执行重新表述为任务状态管理问题,并提出LongHorizon-Harness。该框架将任务状态显式地维护在执行过程之外,且仅使用从环境中独立验证的事实来更新状态。其管理-执行-审计(MEA)循环使用管理器来维护任务状态并确定下一个子任务,使用全新上下文的执行器来执行该子任务,并使用只读审计器在下一轮开始前验证生成的环境状态。一个轻量级的智能体适配器(AgentAdapter)支持模型和框架后端的可互换使用,而无需修改其原生智能体循环。LongHorizon-Harness将Qwen~3.7-Plus在WeaveBench上的准确率从51.8%提升至80.7%,在Terminal-Bench~2.1上从69.7%提升至77.2%,在OSWorld~2.0上从2.8%提升至8.3%。它还将Claude Opus~4.7在OSWorld2.0子集上的表现从20.0%提升至34.3%,展示了跨模型、框架和交互领域的一致改进。
在策略(自)蒸馏(OPSD)正越来越多地被应用于语言模型后训练。它通过特权信息强化教师模型,但可能引发特权幻觉:学生模型学习到依赖特权信息的行为,而这些行为在推理时无法从上下文中复现,然而学生模型却表现得仿佛训练时的特权信息仍然可用,最终导致性能下降。在本文中,我们指出特权教师与推理阶段学生模型之间的信息不对称是 OPSD 中这一失败的根源。为解决这一不对称问题,我们提出双锚定策略蒸馏(DAPD),一种具有两层锚定的统一框架。双路径锚定(DPA)引入自条件桥接,并沿两条信息匹配路径对齐参考行为与采样行为,防止依赖特权信息的行为被迁移到推理时的学生模型。双源锚定(DSA)在参考到采样和采样到参考两个方向上应用这些路径,减少对特权参考指导的依赖,同时保留正确性监督。大量实验表明,DAPD 显著缓解了特权幻觉,在 Qwen3-4B 上各项任务平均超越 OPSD +2.00 分。值得注意的是,其增益在不同规模上持续存在,在 4B 规模达到 +2.69,在 32B 规模达到 +2.78。
现有的技能生成方法在很大程度上依赖于启发式方法或流水线式整合,而这些方法必须针对不同的证据来源进行专门设计。相比之下,基于学习的方法提供了一种更统一的途径,能够在异构来源之间对技能生成进行建模。然而,基于学习的技能生成仍然具有挑战性,因为技能缺乏基于相关性或正确性的自然监督信号;其价值在很大程度上只能通过它们是否改善智能体在下游任务上的行为来判断。为应对这一挑战,我们提出了Skill-α,一种用于逐步生成高质量智能体技能的强化学习方法。具体而言,我们将技能生成形式化为一个序列化编辑过程,将技能构建分解为可单独评估的编辑步骤,并引入一种新颖的回滚奖励机制,该机制通过比较在锚定查询上原始技能与编辑后技能的下游执行效果来评估每次编辑。大量实验表明,在从文档到技能和从经验到技能两种设置下,Skill-α生成的技能均优于基于启发式或流水线的方法。在主要的GPT-4o工作模型下,与最强的技能生成基线相比,Skill-α在CL-Bench上平均下游成功率提升了3.3个百分点,在tau2-bench上提升了6.7个百分点。进一步的消融实验验证了回滚奖励和渐进式生成的重要性。
多模态在线策略蒸馏(OPD)通过特权视角教师对学生生成轨迹进行监督,从而迁移细粒度的视觉知识。然而,其下一词元修正属于源自混合性质,将视觉信号与语言先验及教师特定效应混杂在一起。关键挑战在于估计哪些修正受到视觉证据支持,而不仅仅是确定在何处或以多大强度进行蒸馏。我们提出视觉归因蒸馏(VAD),一种反事实目标重建算法,用于估计教师修正中可由视觉归因的部分。在每个学生生成的前缀处,VAD在相关证据存在与移除两种情形下评估同一固定教师。中心化对数概率的相应变化定义了u_t,即视觉证据方向的带符号代理,用于估计证据对候选词元是支持还是反驳的揭示程度。VAD将原始修正投影到该代理上,获得干预对齐分量和代理未解释残差,然后从前者的信息重建出学生锚定目标。在训练过程中,该重建目标提供主要监督信号,而特权视角教师仅贡献弱正则化。在4B和9B规模的六个细粒度视觉基准上,VAD优于直接特权视角蒸馏和视觉优势加权。词元级与受控目标分析表明,代理对齐分量富含任务相关的视觉修正,并能产生更强的目标偏移,尤其在证据反驳错误答案时效果更为显著。这些结果支持反事实目标重建作为源自混合监督的有效替代方案。
稀疏检索支撑着现代搜索系统,从网络搜索到检索增强生成皆是如此。现有工作已引入学习型稀疏检索(LSR),以突破精确词法匹配的局限,迈向更丰富的语义理解。然而,LSR迄今仍局限于编码器式双向架构,其向多模态场景的扩展也仍高度依赖辅助性的跨模态模块。为解决这些局限,我们提出UEmbed(统一嵌入),一种仅解码器的多模态嵌入模型,可在一次因果前向传播中同时生成稀疏词法表示和稠密表示。UEmbed向输入追加N个可学习的特殊标记,并将词表划分为N个互不相交的子集。每个标记的因果隐状态为其所属子集预测稀疏权重,N个子集拼接后形成完整的稀疏向量。我们在公开数据上训练并发布了2B、4B和9B三种规模的UEmbed。UEmbed-9B在MMEB-v2上达到71.8(稠密)和71.0(稀疏)的成绩,超越了基于公开数据训练的多模态嵌入模型(如RzenEmbed)。在BEIR上,UEmbed同样与强力的稠密和稀疏基线保持竞争力。此外,我们从有效性、效率以及智能体应用三个维度展示了UEmbed的实用价值。总体而言,UEmbed提供了一种新范式:它在单一模型中统一了稠密与稀疏嵌入,同时将稀疏检索进一步扩展到文本与多模态输入的统一处理。
计算机辅助设计(CAD)支撑着现代工程,但将现有形状转换为可编辑模型仍需大量专家工作。大多数AI系统一次性生成整个CAD程序,从不检查中间几何体。相比之下,人类工程师逐特征构建零件,在每次操作后检查还有哪些部分需要建模。我们提出CADENA(西班牙语中意为“链”),该模型将三维网格重建为参数化CAD程序,逐步扩展其操作序列,并在每一步中将目标与当前预测的几何体进行比较。我们还解决了机械零件逆向工程方法缺乏评估基准的问题,引入了CADENA-Bench——一个衡量各类机械零件性能的基准。CADENA在CADENA-Bench以及DeepCAD、Fusion 360和MCB数据集上均优于先前方法。代码可在https://github.com/zhemdi/cadena获取,模型权重可在https://huggingface.co/kulibinai/cadena获取,CADENA-Bench可在https://huggingface.co/datasets/kulibinai/cadena-bench获取。
可控视频生成模型正越来越多地被开发为世界模型。因此,在这一角色下对其进行评估,需要超越生成视频的表观外观,深入考察其所描绘世界的固有反应性:即从场景状态推断世界应如何反应,并生成输入中未明确描述的合理后果的能力。然而,现有基准测试主要评估视觉质量或显式指令执行情况(通过检查所请求的动作和交互结果是否实现),对固有反应性的考察不足。我们提出WorldExam,一个分层诊断基准测试,涵盖四个层级:视觉质量、控制遵从性、空间一致性和世界反应性。该基准包含八个专门任务中的1,474个案例,支持对相机驱动、动作驱动和语言驱动模型范式的统一评估。世界反应性层级评估超出输入显式规定的场景条件反应和目标导向行为。对20个代表性模型的评估揭示了明显的能力分化。相机驱动模型擅长相机控制,但其接口不支持动态交互;动作驱动模型对主体的控制更精确,但往往使世界缺乏响应;语言驱动模型在交互方面表现更好,但对复杂控制的遵循度较低。没有任何模型能同时兼顾广泛的任务覆盖和持续强劲的表现,这表明高视觉质量和显式指令执行并不能保证固有反应性。
近期用于自动驾驶(AD)的视觉-语言-动作(VLA)模型越来越多地利用思维链(CoT)监督来增强其视觉-语言模型(VLM)组件的推理能力,然而现有标注流程通常会让教师模型接触记录中的真值(GT)未来轨迹。我们通过实验证明,这会诱发轨迹锚定偏差:教师模型会对已揭示的结果进行合理化解释,而非根据场景证据推断决策,从而产生因果忠实度较低的思维链,并在因果挑战性场景中产生明显更严重的幻觉。移除GT轨迹可消除这一捷径,但开放式轨迹生成会将高层决策与精确的几何合成及低层动力学纠缠在一起。为使轨迹级驾驶决策无需开放式轨迹合成即可验证,我们引入了自动驾驶多项选择题(AD-MCQ),将规划问题转化为对显式轨迹候选项的选择。在此基础上,我们进一步提出DEFT-RLVR(Deferred Exposure of Future Trajectories for RLVR),将未来轨迹从决策前锚点转变为决策后验证目标。实验结果表明,DEFT-RLVR在提升AD推理能力的同时,保持甚至增强了通用视觉能力。凭借仅依赖VLM的推理方式以及通过候选轨迹构建实现的可控难度,AD-MCQ为未来可验证AD推理研究提供了灵活、可扩展且具备良好延展性的基础。
技能已成为为语言模型智能体配备可复用程序性知识的重要机制。然而,仅提供技能并不能保证现有模型能够有效地识别、应用和协调技能。为了提升技能使用能力,我们引入了SKT,一种经过验证的数据合成流程,它利用大量智能体技能构建基于技能的任务和可执行轨迹。SKT选择合适的单技能和多技能配置,通过基于规则和基于智能体的验证并辅以反馈引导的修复来合成任务,且仅保留充分使用了全部所需技能的成功轨迹。SKT利用2000个公开技能,生成了4000个任务包和27164条经过验证的轨迹。基于相同的流程和独立的测试池,我们进一步构建了SkillEval,这是一个用于评估技能使用的留出式可执行基准。跨多种模型、基准和智能体框架的实验表明,在SKT生成的轨迹上进行监督微调能够持续提升技能使用性能。验证消融实验、跨框架评估和扩展实验进一步证明,这些收益依赖于高质量监督,不仅限于单一智能体接口,并随着技能覆盖范围的扩大而增加。综合来看,这些结果确立了经过验证的数据合成作为技能使用训练的一种有效且可扩展的方法。
强化学习(RL)后训练视觉-语言-动作(VLA)模型在机器人操作领域展现出强大潜力。在各类RL方法中,基于评论家的方法依赖于价值估计器,而该估计器主要处理单帧观测或单帧VLM骨干网络的潜在表示,这与机器人控制的部分可观测特性存在根本性不匹配。将观测历史纳入评论家的朴素方法在高维视觉空间中会产生指数级复杂度,且仍然无法奏效,因为纯标量回报回归无法为学习跨时间动态提供充分监督。我们指出其根本原因在于状态近似问题:缺乏显式的世界建模目标时,评论家的表示无法捕捉准确价值估计所需的时间结构。为此,我们提出世界评论家模型(WCM),其构建于轻量级LeJEPA架构之上;WCM联合预测未来潜在状态并估计价值,从而使评论家的表示被显式训练以捕捉时间动态,而非仅仅回归标量回报。WCM可无缝集成到在线策略和离线策略训练流程中,并与包括Pi0、Pi0.5和OpenVLA-OFT在内的最先进VLA骨干网络兼容。在四个基准的149项任务上进行的大量实验表明,WCM在分布内和分布外场景中均持续取得最先进性能,尤其在泛化能力方面提升显著。我们进一步使用OpenVLA-OFT和Pi0.5结合离线策略RL,在七项真实世界操作任务上验证了WCM,证实了其在多样化场景中的稳定部署能力。
真实世界的软件开发要求编程智能体在共享工作空间中操作,用户可能在任务进行中检查并修改代码,然而现有的代码库级基准测试通常评估独立工作的智能体,或将用户参与限制为消息交流。这引出了一个问题:编程智能体如何理解并响应共享工作空间中的代码变更?我们提出SWE-Touch,一个通过经校验的反编辑(Counter-Edits)来压力测试这一场景的框架:反编辑是指与任务完成相冲突、但对任务相关代码而言看似合理的编辑。SWE-Touch从多条修复轨迹中挖掘任务关键区域,使用独立的用户补丁生成器来构造编辑,并在智能体到达相关代码时连同上下文相关的用户消息一起注入。我们在SWE-bench Verified上评估了九个编程模型,并在SWE-Bench Pro和DeepSWE的长时程任务上进行了补充实验。反编辑使SWE-bench Verified上的平均解决率降低了7.7个百分点,且这种性能退化在两个长时程基准上同样存在。轨迹分析将这些失败归因于对不断演变的工作空间的认知不足:智能体可能保留冲突代码,或在未充分重新检查代码库、未使用有针对性的测试验证修改后代码的情况下将其替换。这些发现表明,强大的自主性能尚不能确保共享工作空间协作所需的状态感知和自适应行为,并指出检测工作空间变更、协调冲突编辑与任务目标、以及验证受影响行为是未来优化的关键能力。
我们推出 DiffusionGemma,一个实验性的开放权重语言模型,使用离散扩散以极高速度生成文本。与逐 token 解码不同,DiffusionGemma 并行迭代精炼 256 个 token 的块,从而绕过了传统自回归(AR)大语言模型顺序解码的瓶颈。我们并非从零训练,而是通过对 mixture-of-experts 架构的 Gemma 4 模型进行微调得到 DiffusionGemma,其激活参数为 38 亿,总参数为 252 亿。我们计算高效的两阶段训练流程仅使用了初始自回归模型总训练 token 预算的不到 10%。第一阶段使用监督微调来教授双向去噪,第二阶段将强化学习与采样器蒸馏相结合,共同提升生成质量和推理效率。DiffusionGemma 在生成速度与模型能力之间的权衡中建立了新的 Pareto 前沿。在我们的完整评测套件上平均来看,它每次前向传播约生成 20 个 token,并在单个 NVIDIA H100 GPU 上达到每秒约 1,500 个输出 token,这显著快于即使采用了最先进推测解码的自回归模型。DiffusionGemma 还保留了初始模型对思考模式、多模态输入和长上下文的支持。尽管经过了扩散微调,它仍能以仅有轻微性能下降的方式进行自回归生成,这为混合扩散-自回归解码指明了一条路径。
基于优化的潜在推理通过在测试时优化实例特定的连续状态来提升大语言模型的输出,同时保持模型参数冻结。然而,现有方法通常通过解码词元将这些状态与推理轨迹连接起来,使得序列级信用分配变得间接,并模糊了潜在更新如何塑造后续推理。我们提出GradCuit(通过电路的梯度),它在选定的Transformer层中,于提示的隐表示与生成的续写之间插入可优化的潜在状态。因果自注意力为每个续写词元的对数概率提供了通向每个先前潜在状态的可微路径——经由剩余的Transformer模块——使得来自整个续写的奖励加权梯度能够直接分配给潜在状态。在五个指令微调骨干模型、三个推理基准和两种答案格式上,GradCuit实现了64.5%的平均准确率,比思维链提示高出6.6个百分点,比最强竞争方法高出2.4个百分点。GradCuit还展现出更强的鲁棒性:在七种学习率设置下,它持续优于LatentSeek,同时将准确率的标准差从1.53降至0.82,甚至其随机游走变体仍可与LatentSeek媲美。在可解释性方面,词元级梯度归因显示潜在影响集中于推理连接词元,而层分析则识别出早期至中期的Transformer层是最有效的优化空间。通过从结果反馈中直接优化内部推理,GradCuit开辟了鲁棒且可解释的测试时扩展的新维度——大语言模型调整自身的推理方式,而非仅仅重新生成、采样或重排输出。
视频运动迁移旨在利用参考视频中的动态来驱动目标对象。现有方法在很大程度上依赖固定的结构对应,当参考对象与目标对象在形态、关节结构或变形机制上存在显著差异时,这种对应关系便会失去明确定义。我们提出“超越形态的运动迁移”(Motion Beyond Morphology)这一视角,旨在突破固定结构对应的局限,通过保留在不同目标形态下依然具有意义的动态来实现迁移。为实现这一目标,我们提出了一个两阶段框架。第一阶段学习互补的多粒度抽象运动视图,并利用这些视图引导生成跨类别视频对,从而保留跨多样形态的可迁移动态。第二阶段将这种监督内化到直接的参考视频条件生成中,消除了推理时显式运动提取的需要。我们进一步引入了OpenVMT-Dataset和OpenVMT-Bench,用于在相同(Same)、相近(Near)和远距离(Far)类别差距下训练和评估基于图像与文本条件的运动迁移,并计划在论文被接收后发布这两项资源。大量实验表明,本方法在运动保真度和目标保留方面均达到了最先进的性能。项目主页:https://miniz233.github.io/MotionBeyondMorphology/
诸如GPTQ的自适应舍入方法(等价于Babai最近平面算法)在二次度量下将实数矩阵舍入为整数。它们按固定顺序逐个处理元素,并通过三角反馈矩阵将每次舍入误差传播到尚未处理的元素。我们研究该任务的双侧版本,其中固定的非奇异基矩阵同时作用于残差的左侧和右侧;常见的单侧情形是右基为单位矩阵的特殊情况。将矩阵向量化后,双侧目标变为一个二次度量,其Gram矩阵为Kronecker积,因此一维算法可以原样适用,但时间复杂度为矩阵维度的四次方。我们提出GPTQ-2D,它以立方时间产生相同的舍入矩阵。它按反对角线逐条舍入元素;同一条反对角线上的元素相互独立,可并行舍入。
大语言模型越来越多地编写和修复生产代码,但越来越多的证据表明,它们通过测试的补丁会让代码库更难维护。我们确定了一个具体来源:删除回避,即在预期编辑需要删除代码时,模型系统性地倾向于保留这些代码。 在官方 SWE-bench Verified 排行榜上的五个领先模型中,即使在所有五个模型都能解决的任务中,这些模型对开发者补丁的删除召回率最高仅为 71.7%;在超过 92% 的必需删除中,模型到达了正确的文件,但只有不到 52% 的情况切除了准确的代码行。相反,29.0% 通过测试的补丁将目标代码包裹在守卫或后备逻辑中,我们将这种模式称为“Guard-and-Go”。 这类补丁之所以能通过测试,是因为原始测试很少检查删除行为:当我们为 34 个 Verified 任务改造测试,使其在目标代码仍然存在时失败时,涵盖闭源和开源权重的四个前沿模型的通过率从 63.2% 下降到 41.9%。 由于真实的代码修复往往同时涉及删除和添加,我们构建了 CanItDelete 基准,包含从真实提交中挖掘的 200 个任务,这些任务所需的全部编辑操作就是删除。即使不再需要添加操作,最好的模型仍然每五个任务就失败一个,而较小的开源模型成功率降至 18.0%。 随后,我们在四种累积提示条件下对 GPT-5.6 Sol 进行消融实验;在提供精确代码行之前,成功率几乎没有变化,而提供精确行后,不完整删除几乎被消除,但成功率仅提高到 80.5%,因为模型随后会删除超出范围的内容,或转而添加代码。 最后,通过一项初步研究,我们展示了一种潜在的解决方案:在后训练阶段教授删除操作可以减少删除回避,并提升更广泛的代码编辑性能,这表明该行为是训练不足导致的,而非无法实现。
现有的室内布局生成器生成的布局在整体上看似合理,但仍可能存在局部违规,如碰撞、越界放置、开口受阻和动线堵塞。以往的大多数工作侧重于全场景合成或场景级优化,对识别责任对象和局部修复受影响区域的支持有限。我们提出了 Roomer,一个反思式修复框架,将这些违规视为稀疏的、以对象为基底的修复问题。Roomer 将布局编码为“RoState”,并使用“RoReview”将测量到的违规与相关对象绑定。一个几何条件视觉语言模型规划器提出结构化的局部编辑,而一个确定性求解器对其进行验证,并在需要时生成有限数量的候选编辑。每个候选只有在全场景验证确认其解决了目标违规且未引入新的硬违规或破坏受保护约束时才会被采用。我们在 Roomer-CC(一个受控损坏数据集)上训练规划器,该数据集将故障布局与对象级违规证据以及已知可行的逆状态补丁配对。由于现有基准很少评估物理有效的布局是否可用,我们引入了 Roomer-Eval 来评估分布质量、物理有效性和实际可用性。实验表明,Roomer 在保留有效区域的同时修复残余违规,提高物理有效性和可用性,并能跨外部生成器迁移。
多模态大语言模型(MLLMs)在视觉理解与推理方面取得了显著进展,但其静态参数化知识限制了其应对知识密集型及动态演变的开放世界问题的能力。为突破这一局限,多模态深度搜索应运而生,成为开放世界信息获取的关键方向,并正从单轮事实检索向由视觉证据引导的长程多轮搜索演进。然而,现有方法通常将视觉能力局限于输入或答案生成阶段,忽视了其在中间推理过程中的作用,且缺乏面向长程交互的专门设计。因此,视觉证据很少能驱动持续检索,交互深度与推理跨度均受到制约。为解决上述问题,我们提出了DeepVoyager-VL,一种面向视觉在环搜索的长程多模态深度搜索框架。具体而言,我们构建多模态事件图以驱动数据合成,生成具有中间视觉依赖关系和长推理链的问题;随后设计用于主动视觉获取与按需图像加载的智能体框架;最后在合成数据上对模型进行微调,无需强化学习。在十个多模态搜索基准上的大量实验验证了所提方法的有效性。
近期三维视觉-语言模型(3D VLMs)通过将二维视觉特征投影到世界坐标来构建几何感知令牌,从而实现对三维问答等任务的空间推理。然而,这种设计在每个场景中会生成数千个令牌,导致可观的计算和内存开销。尽管令牌压缩已在二维VLM中得到广泛研究,但现有方法依赖语义相关性或基于注意力的选择,忽视了三维令牌的结构化空间特性。此外,三维表示中的冗余无法仅通过空间邻近性解决,因为即使在空间聚合之后,物体级令牌不平衡仍然存在。为解决这一问题,我们提出3DZip,一种三阶段令牌压缩框架:首先应用粗体素化以去除点级冗余,然后通过行列式点过程基于特征空间多样性选择锚定令牌,最后在空间约束下合并剩余令牌以保持几何一致性。在三个三维问答基准上的实验表明,3DZip持续优于现有压缩方法,仅用128个令牌即可保留94.7%的原始性能,推理速度提升1.92倍。
长时且实时的说话头生成仍然面临延迟-质量权衡的挑战:低效的多步扩散方法无法支持流式生成,而实时的自回归方法则饱受误差累积和身份漂移之苦。为解决这一缺陷,我们提出LeapTalk,一种新颖的框架,通过单前向步骤实现稳定且实时的说话头生成,并可扩展至任意长度的视频。我们方法的核心在于单步桥接蒸馏方案。一方面,我们摒弃传统的噪声到数据范式,引入基于布朗桥的数据到数据传输公式。通过持久参考的锚定,该策略有效缓解身份漂移并增强长期时间稳定性。另一方面,为促进从预训练扩散教师模型到学生桥接模型的知识平滑迁移,我们探索了一种异构蒸馏框架,结合信噪比对齐的时间变换Φ(τ),从而弥合两个模型之间的功能差异。此外,我们提出一种音频驱动的无分类器引导机制,以在极端步数缩减下保持精细的唇形同步。大量实验表明,我们的方法仅需1步即可生成高保真且时间一致的视频,帧率高达200 FPS,在效率和稳定性方面均显著优于现有方法。项目页面:https://zhangrongxiang.github.io/leaptalk-page/
在操作过程中,准确预测物体轨迹对于形成感知-行动闭环至关重要。目前进展受限于两个方面:现有数据集缺乏细粒度的语言到运动标注,而现有预测器要么依赖视频、深度或CAD模型等特权输入,要么通过代价高昂且易出错的感知流水线从完全生成的视频中恢复运动。我们通过MOVE数据集填补了这一监督空白,该数据集包含5,038条以物体为中心的第一人称轨迹,每条轨迹都配有细粒度的自然语言指令,而非粗粒度的动词-名词标签。我们进一步提出DreamTraj,它仅凭单张RGB图像和一条任务指令即可预测物体6-DoF轨迹,推理时无需视频、深度或CAD模型:DreamTraj并非生成视频,而是在早期去噪步骤中从冻结的图像到视频扩散模型的内部表示中读取运动信息。一个轻量级的流匹配读取器将查询-键注意力轨迹与池化隐藏状态解码为相对6-DoF位姿。据我们所知,这是首个直接从视频扩散模型的中间表示而非生成像素中解码物体6-DoF轨迹的方法。在平移和旋转方面,DreamTraj均超越了使用多帧或特权输入的预测器,达到了新的最先进水平,且运行速度是先生成后提取流水线的4.6倍。
固定布局室内家具造型需要在保持规定的家具类别、位置、朝向和尺度不变的前提下,选择能够形成协调一致房间的资产。现有方法通常独立检索每个资产或依赖静态局部关系,因此在场景合成后容易出现形状、材质和色彩冲突。我们提出 StyleForge,一种基于动态超图风格场的场景级结构化选择框架。一个冻结的多模态大语言模型从未限定的风格请求和固定布局中提取结构化风格先验,同时 StyleForge 为每个家具槽位维护一个可学习的候选分布。在目标风格条件下,动态超图风格场自适应地激活并加权由布局诱导的超边,以捕捉家具之间的高阶依赖关系。随后,反事实风格偏好学习将每个候选视为当前风格场中的局部替换,并使用马氏能量评估其上下文兼容性。训练过程交替优化风格场和候选逻辑值。在推理阶段,模型保持冻结,测试时训练仅更新房间特定的候选逻辑值,随着全局场景上下文不断演化,逐步修正跨槽位风格冲突。在 3D-FRONT 上的实验表明,该方法在家具检索和场景级风格一致性方面达到了最先进的水平,生成的固定布局家具布置比对象级和场景级检索基线更加协调一致。
近期的图像生成器能够合成具有说服力的以人为中心的图像,然而生成一个有用的集合与生成单张成功图像是两回事。以人为中心的数据集必须覆盖多样化的人物与情境,避免不合理的属性组合,保留日常摄影的视觉特征,并在大规模尺度上公开质量控制决策。我们提出Poplar——一种可复现的“指定—渲染—审查”(Specify–Render–Inspect)流水线,用于以人为中心的图像数据集合成。“指定”阶段在常识约束下对结构化属性进行采样,并将其转化为面向摄影的提示词。“渲染”阶段采用经过真实感适配的图像生成器,结合构图感知的宽高比设置,并对明显的技术失败进行重试。“审查”阶段对每个候选图像执行单一的结构化视觉—语言评估,在保留原始提示词的同时,剔除内在图像缺陷或明显的提示词不匹配。利用Poplar,我们构建了Poplar-9K数据集:从11,765个经审查的候选中保留9,401对精选的以人为中心的图像—文本对(接受率79.9\%)。我们随数据集一并发布流水线、配置、不可更改的生成提示词以及可审计的审查记录,作为构建可定制以人为中心集合的紧凑资源。
为了在开放世界环境中稳健运行,自主智能体应当能够仅通过交互来推断陌生系统的行为,即使在缺乏文档的情况下也是如此。然而,现有的工具使用基准在静态环境中暴露语义工具模式,使得智能体可以依赖先验知识而非自主探索。为解决这一局限,我们引入了ScrambleToolBench——一个交互式终端基准,旨在隔离行为推理能力。通过移除语义线索并实施连续任务课程,该基准要求智能体完全通过试错交互来发现隐藏的工具行为。该基准进一步引入了动态挑战,包括映射漂移、随机动作失败和时间执行窗口,以评估智能体是否能够在环境变化时修正和调整其假设。我们对最先进语言模型的评估揭示,成功的最初发现并不能转化为稳健的适应能力。当面临如映射漂移等结构性变化时,智能体无法使用循环追踪等演绎策略,反而表现出信念惯性或退化为穷举搜索。增加测试时推理只会加剧这种代价高昂的暴力搜索,而非实现演绎性恢复。虽然为智能体配备持久记忆可以减少累积错误,但它们仍然无法高效推断结构性变化,凸显了当前智能体推理能力的不足。
现有的评估通常将智能体故障简化为系统级结果,从而掩盖了故障的根源所在以及哪项干预措施能够改进智能体系统。这引出了修复分配问题:相同的可见故障可能因其来源不同,而分别要求模型后训练、编排框架工程、环境重新设计或基准修复。由于智能体行为源于模型、编排框架、用户、工具、记忆和环境之间的交互,结果级标签往往不足以指导改进。现有的大多数故障分类体系对此助益有限,因为它们具有基准特异性且缺乏共享结构。我们提出了一种以交互为中心的故障分类体系,将故障定位到其产生的交互环节,并识别出责任组件。该体系通过将41种故障模式分配到两个组件之间的边上,并标注指示修复归属的故障侧,从而实现了可操作性:模型侧故障指明后训练目标,编排框架侧故障指向脚手架与工具集成修复,而环境或评分器故障则揭示需要重新设计的评估条件。该分类体系适用于各类智能体架构,从编码助手到长时程个人助手以及多智能体系统。我们在公开基准、模型系统卡、已发表报告和智能体轨迹日志的实例分析中对该分类体系进行了验证,并使用独立推理智能体作为评判器评估其可复现性。在四个前沿模型中,最强的评判器与人工类别标签的Cohen's κ达到0.76,表明这些类别捕捉到的是共享结构而非标注者特有的偏好。
优化现代推荐模型仍然在很大程度上依赖工程师手动迭代调整网络结构、目标函数和训练策略。尽管基于大语言模型(LLM)的智能体能够自动化这一试错过程,但让LLM同时负责选择修改方向和生成具体假设,往往在有限的实验预算下导致搜索过程不稳定。受上述挑战启发,我们提出RecHarness——一种基于Bandit路由的智能体框架,用于推荐模型的自动优化。RecHarness将优化过程拆分为两个步骤:bandit路由器根据历史验证反馈选择下一个修改方向,LLM则在所选方向内生成具体的优化假设和可执行的代码修改。为了维持长期探索,RecHarness引入了一种跳跃盆地(jump-basin)机制:当局部编辑陷入停滞时,激活结构跳跃臂(structural-jump arm)。在多个推荐任务、数据集和模型骨干上,RecHarness相比基于LLM推理的搜索方法,取得了更稳定的性能提升,并能更有效地利用有限的实验预算。在一个大规模短视频广告平台上进行的为期7天的在线A/B测试中,所选候选模型使ADVV提升2.084%、Revenue提升0.534%、Exposure提升0.559%。代码已开源:https://github.com/6lyc/RecHarness。
视觉-语言MoE批次包含不同数量的图像和文本token。图像分辨率、图像数量、分块方式以及提示长度都会改变这种token混合比例。我们将标准的token级Switch辅助损失称为Std-Aux。Std-Aux仅平衡混合负载,因此在某种混合比例下,图像和文本负载的较大误差可能相互抵消。在我们的主模型上,经过训练的同一路由器在不同图像分辨率下的负载不均衡程度变化超过五倍。我们固定图像和文本的负载分布,并推导出随token混合比例变化的精确负载曲线。图像-文本负载差距控制了对token混合比例的敏感度。物理预处理也可能改变条件负载分布,而固定分布定律排除了这类变化。为了设计解决方案,我们检查了路由器的输入结构。图像和文本占据不同区域,而视觉token按源图像强烈聚集。模态边界促使我们分别设置图像和文本项;图像边界则促使每个图像使用一个等权重的路由实例。ReBA,即“内部松弛、跨域平衡”(Relax Within, Balance Across),实现了这两种选择。在四个拆分骨干网络上,ReBA在所有报告的基准输入上都降低了负载,同时保持平均任务准确率与Std-Aux相当。ReBA还降低了测试范围内的平均负载,并降低了分辨率和分块变化下的最差物理负载。代码可在 https://github.com/ZiangWu-77/ReBA 获取。
LLM智能体需要记忆才能在长时间交互中保持一致的行为,但许多系统依赖额外的LLM调用来操作这些记忆。生成中间记录并协调其检索会增加持续的token和时间成本,而被省略或合并的细节可能掩盖原始证据。我们探究的问题是:结构化记忆访问是否根本需要生成过程。Zero-Mem引入了零token记忆操作:除最终问答之外的任何步骤都不会调用LLM,也不消耗LLM的输入或输出token;编码器计算被单独核算。Zero-Mem保留原始交互轨迹作为其记录来源,并以两种互补的方式组织这些轨迹。实体-上下文图揭示交互之间的连接,而时间层次结构保留对话的局部性和会话状态。对于每个查询,Zero-Mem权衡两种视图,从两者中检索,并沿着其结构恢复支持性关系或周围上下文。确定性校准首先丢弃矛盾证据,然后将阅读器的答案锚定在检索到的轨迹中。只有最终问答阅读器才会调用LLM。在长记忆和长上下文问答基准测试中,Zero-Mem在消除记忆操作中的LLM调用和LLM token消耗的同时,达到了具有竞争力的性能。在相同的最终问答阅读器和上下文预算下,与最快的对比基线相比,Zero-Mem将记忆操作的时间成本降低了57.6%。消融实验验证了两种视图及其查询依赖协调的贡献。总体而言,结果表明结构化智能体记忆无需生成过去的中间表示。经过同行评审后,代码和实现细节将在https://github.com/TheMoon0815/Zero-mem上提供。
使用多模态AI进行科学图形理解与推理,需要将视觉感知与领域特定推理相结合,以提取有意义的知识,而这些知识往往不会呈现在研究论文的文本中。Sci-ImageMiner基准数据集配合社区驱动的竞赛,通过构建一个涵盖四项端到端互补任务的综合性专家标注数据集,将先前科学竞赛的标准提升到了新的高度。该竞赛吸引了68名活跃参与者,在2026年1月9日至2026年4月8日期间共收到1,263份公开/私有提交。我们的结果表明,最先进的多模态模型在分类和摘要任务上表现良好,但在数据提取和科学推理方面存在困难,尤其是在视觉问答任务中。这些发现揭示了关键局限性,并凸显了改进领域感知多模态AI系统的挑战与机遇。总体而言,Sci-ImageMiner基准与竞赛为推进科学图形理解与推理研究建立了一个严谨的平台,同时展示了最先进方法在这一具有挑战性和复杂性的研究领域中的潜力。
多模态临床模型通常以所有模态都存在时的准确率来评判,但部署时模态会缺失;在心电图是常规检查的地方,超声心动图往往不可用。于是,除了准确率损失的大小之外,还有两个问题更为关键:缺失的是哪个模态,以及一旦该模态被丢弃,模型是“响亮地”失败还是“静默地”失败。这一区分是逐样本且模态级的,并且不同于事后特征归因(如SHAP)。模型经常被替换;而回答这些问题的评估是复用的。我们提出一个模型无关的模态失败框架:给定N个模态嵌入、任意掩码感知探针和标签,它返回逐样本失败分类、一个将误差归因到模态的逐模态互补性矩阵,以及一个显性/静默失败对比的模态丢弃概况,仅使用部署时可观测的信号,就能将可监测的失败与那些在远离决策边界处未触发任何标志便通过(即实际错误)的失败区分开来。我们将其发布为一个小型、经过单元测试的工具包,并用植入的真值进行验证。在不同随机种子下,它能够恢复所植入的模态主导性和互补子集,报告各模态的显性/静默失败率,并可扩展到三模态互补矩阵;由于植入的结构是构造时已知的,这验证的是逐样本归因的恢复能力,而非临床性能。随后,我们在配对的MIMIC-IV队列上,将该框架实例化于冻结的EchoJEPA和HuBERT-ECG嵌入上,用于预测左心室射血分数(LVEF)和EF≤40%的HFrEF判定阈值;在留出测试集(n=245)上,丢弃超声心动图后错误率几乎翻倍。超声心动图与心电图之间狭窄的交集限制了队列规模,而这本身就是一个关于心脏基础模型的部署发现。我们的所有工作可在 https://github.com/criticaldata/PRIMED-AI 获取。
长时程智能体日益将其KV缓存复用为记忆:服务系统保留一部分缓存条目,丢弃其余部分。因此,驱逐机制与情景记忆方案都建立在一个很少被直接检验的前提之上——即一条被保留的事件在产生它的观测消失之后仍然具有信息量。我们通过在其他方面完全相同的智能体历史中,从所服务的内容里省略一条较早的观测来检验这一前提。在对该观测敏感的项目中,答案压倒性地遵循被省略的值,尽管没有任何被提供的片段指明哪个值是正确的。我们称此为语义物化:下游事件的缓存行充当计算的一种可独立服务的视图,而其输入已不复存在。它也可以被有意写入。在Qwen3-8B上,一句精心措辞、不含答案的事件将与捐赠者一致的回取率从6%提升至51%,且从未提及该值;而被动地从长期对话中收获自然提及则未检测到任何优势。此类行所承载的内容是具体且有界的。紧凑状态得以存续,较大载荷则衰减至随机水平;某次构造是否写入取决于措辞而非单纯的意义,因此模型理解力相同的两种措辞可能产生截然不同的结果。其结果是面向稀疏事件KV服务的一份记忆契约:写什么、落在何处、以及源消失后什么得以存续。对任何执行驱逐的人来说,其推论是:丢弃一个源事件而未观察到精度损失,并不能说明该源是不必要的。
企业问答要求模型在不丧失通用能力的前提下获取专有知识。我们提出Wnuan——一种三阶段流水线:从文档中构建任务导向的监督信号,利用通用数据回放进行监督微调,并对残差错误应用强化学习。在包含707个问题的WnuanBench上,主要的32B路径将可接受答案率(AAR)从适配前的52.76%提升至SFT后的80.06%及RL后的91.51%。在匹配的100次更新协议下,残差错误采样分别比全池采样和规模匹配的随机采样高出3.11和2.97个百分点。两种对比的源聚类自助法置信区间均保持在零以上,同域验证集亦保持了该排序。通用基准平均分在整个路径中下降5.17分,主要集中在指令遵循维度。自动评估集成与权威领域专家在分层Wnuan-Inst响应样本上的一致率为90.5%。这些结果同时刻画了分阶段企业适配带来的收益与通用能力代价。
多模态大语言模型(MLLMs)通过将视觉输入与预训练语言模型的丰富先验知识相结合,取得了强劲的性能。然而,它们在以视觉为中心的任务上经常失败,尤其是在视觉证据与预训练知识相冲突时。我们使用两种诊断范式分别探究这些失败:(1)通过图像重建探测视觉信息是否可用;(2)测量多模态上下文敏感性,即模型在多大程度上遵循视觉上下文而非语言先验。为支持第二种范式,我们引入了WhatIfVis基准,涵盖五个粗粒度维度(时空、颜色、数量、大小和重量),其问题既可从图像也可从先验知识得到答案。我们的分析得出三个发现:(i)粗粒度的视觉证据得以保留,因为这些属性可以从冻结MLLM的最终层图像token中重建。因此,在这些属性问题上的失败指向感知后的利用问题,而非感知过程中视觉编码的退化。(ii)即使被明确指示使用或忽略视觉证据,基础模型(未在WhatIfVis上进行监督微调)仍表现出不稳定的视觉上下文敏感性。监督微调(SFT)改善了这种可控性并跨领域泛化,激活修补进一步将视觉-先验权衡定位到所有六个模型中架构特定的深度。(iii)视觉-先验权衡可沿学习到的向量进行控制。即使没有任何意图指令,应用这一导向向量也能提高相对于基础模型的可控性。综合来看,这些结果重新定位了瓶颈,表明对于我们所研究的粗粒度属性,MLLM编码了视觉证据,但无法可靠地控制对其的依赖。
地理空间基础模型旨在学习可跨区域和传感器迁移的表征,然而在特定任务上评估这些模型,需要大规模、高质量、多模态的基准数据集,以衡量此类模型从数据中提取价值的能力。就洪水制图而言,现有数据集很少能在较大规模上同时提供双时相SAR与配准的光学影像,导致基础模型在该下游任务中的价值在很大程度上未经测试。我们提出了GEOID-Flood,一个大规模多模态洪水分割基准,其数据来源于哥白尼应急管理服务(Copernicus Emergency Management Service)的启动任务,涵盖十年间65个国家的219起事件。该数据集提供超过14,000个图块,包含配准的哨兵一号(Sentinel-1)事件前后影像(GRD与RTC格式)、事件前哨兵二号(Sentinel-2)合成影像以及DEM,并附带人工验证的标注,可将背景与永久性水体和洪水水体区分开来。基于该基准,我们评估了基础模型与常规编码器在单影像、多时相和多模态协议下的表现。我们报告三项主要发现:基础模型提供了一致但适度的优势;光学与SAR融合结合微调最能解决瞬时洪水识别问题;在GEOID-Flood上训练的模型向未见事件的迁移能力优于在现有数据集上训练的模型。数据集和代码可在 https://github.com/links-ads/geoid-flood 获取。
世界动作模型(WAMs)将动作生成与未来状态预测相耦合。其有效性取决于未来动态能否在一个既与动作生成对齐、又具备足够几何感知能力以刻画动作在何处以及如何改变场景的空间中被建模。现有WAMs通常仅部分满足这一需求:要么依赖感知负担较重的观测空间目标,要么依赖未针对动作相关性与几何结构进行联合组织的辅助潜在空间。我们提出SG-WAM,一种自引导框架,直接在策略派生的表示空间中学习几何感知的动作条件动态。SG-WAM引入可学习的动态令牌(dynamics tokens)以及自引导世界预测器(Self-Guided World Predictor),后者在介入的机器人动作条件下预测令牌的未来潜在状态。预测目标由同一策略主干网络的指数移动平均副本生成,从而在动作专家所使用的表示族内提供稳定监督。几何监督进一步结构化了策略的图像令牌表示,为动态令牌提供空间锚定的上下文,并产生一个兼具动作相关性与几何感知能力的未来对齐空间。潜在未来预测、几何锚定与流匹配动作生成在统一框架中以端到端方式联合优化。SG-WAM基于0.9B参数模型,无需大规模具身预训练,在LIBERO上取得98.5%的平均成功率,在LIBERO-Plus上取得73%的平均成功率,并在分布内与分布外真实世界评估中均优于强基线。
像素空间扩散模型旨在直接在原始像素上学习端到端生成器。这颇具挑战性,因为单个模型必须在同一高维空间中同时捕获全局结构和局部纹理。尽管近期工作通过替代预测目标、训练目标和架构改进了像素扩散模型,但这些进展通常需要从头训练新模型。我们展示了一种更廉价且互补的策略:冻结的预训练像素扩散模型可以自我引导。我们的关键观察是,预训练像素扩散Transformer的中间层可以解码为捕获主要低频结构的粗糙预测,而最终层则逐步细化局部高频细节。因此,我们将轻量级预测头附加到中间层,保持主干网络冻结,并在采样过程中将中间预测与最终预测之间的差异用作自引导方向。为训练该预测头,我们进一步发现真实图像并非必需。相反,模型生成的样本足以训练该预测头,甚至在增强像素扩散往往欠拟合的高频分量方面优于真实图像。在ImageNet上的多个像素扩散模型中,我们的合成自引导(SSG)持续提升生成质量,而适配器训练所需计算量不到全模型训练计算量的1%:在无分类器引导(CFG)的情况下,它使所评估的JiT变体的FID降低超过50%,并进一步改进了使用CFG的强基线,例如JiT-H/16从1.86降至1.67,PixelREPA-H/16从1.81降至1.59。我们的代码可在https://github.com/zfu006/SSG获取。