每日精选AI研究论文及翻译
训练数据的质量从根本上决定了大型语言模型(LLM)的能力,但目前尚无统一的基准来衡量LLM、智能体以及数据驱动工作流在端到端准备训练数据方面的表现。我们认为,LLM驱动的数据准备包含两种互补的能力:数据构建——将原始数据源转化为监督训练数据;以及数据质量评估——在下游训练之前预测候选数据集的训练价值。在此过程中,“质量”指下游训练效用,而非表面文本属性。我们提出了DataPrep-Bench,这是首个在六个领域和多个基础模型上,采用统一的下游锚定协议联合评估这两种能力的基准。在数据构建方面,各种方法使用相同的原始数据源,并通过对模型输出与Dolly-15k联合微调基础模型来评分;与此同时,我们发布了Data-Construction-Skill,一个技能引导的智能体,它使Llama-3.1-8B在金融领域的纯Dolly基线提升了近20个绝对百分点,并在知识提取密集的领域与最先进的基于智能体和DataFlow的方法竞争。在数据质量评估方面,评分函数通过与共享候选池中下游性能的皮尔逊相关性来评分;我们发布了分布对齐分数(DAS),这是一种基于分布的评估器,使用候选数据集与领域代理之间的最大均值差异(MMD)。DAS在六个领域中的四个取得了最强的跨模型相关性,且是唯一在数学、科学和医学领域同时达到r > 0.70的指标,优于现有的基于质量、多样性和启发式的评估器。DataPrep-Bench提供了一个统一的、下游锚定的框架,用于衡量这两种能力作为LLM驱动数据准备的同等目标的进展。
大语言模型训练正从人工设计与标注转向基于交互驱动的自我进化。然而,现有自我进化方法在任务多样性与验证可靠性之间面临根本性困境:受限于环境的方案能获得精确反馈,却将学习局限于狭窄领域;而开放式自我生成虽拓展了任务空间,却因缺乏可靠验证,使误导性奖励污染训练循环。我们提出将智能体技能作为调和这一矛盾的有力中间地带:每种技能在特定场景中确保深度且可验证的执行,而跨技能的动态路由则维持开放式任务多样性。基于这一洞见,我们提出技能自博弈(Skill Self-Play, Skill-SP)——一个包含提案器、求解器和动态技能控制器的共进化框架。在强化学习循环的驱动下,这些组件通过持续的自博弈过程协同进化:提案器根据动态采样的技能生成具有挑战性的任务;求解器探索候选方案以突破自身能力边界;技能控制器收集执行反馈来更新和扩展技能库。这种交互式共进化有效弥合了结构化验证与开放式探索之间的鸿沟。在工具使用与推理基准上的实验评估表明,作为稳健的进化引擎,Skill-SP能持续推动强基座模型的性能天花板,同时为初始对齐不良的模型带来显著逆袭。我们的代码已开源:https://github.com/Qwen-Applications/skill-self-play。
主体性强化学习研究涉及持续的算法修改、新估计量、新流水线阶段、新展开方案,而在主流框架中,每一次改动都需要贯穿训练器、分布式后端和展开粘合层:每一次迭代的成本都落在研究者身上。Molt是一个基于PyTorch原生的训练框架,旨在保持低成本:代码库紧凑且清晰,足以让研究者牢记于心,也便于AI编程助手完整阅读并推理,从而能够端到端追踪和调整算法流程。主体是一个普通程序,通过一个异步循环训练多模态和混合专家策略,且永远不会训练一个未由其生成的token,在token、策略版本和模型语义上保持一致。简洁并非以性能为代价:在匹配的完全异步协议下,Molt在统计性能上可与基于Megatron的最先进架构相媲美。Molt为开源项目,提供配方和容器,访问地址为https://github.com/NVIDIA-NeMo/labs-molt。
生产环境中AI智能体的失败通常并非源于推理能力不足,而更多是因为它们无法有效管理自身推理上下文的内容:包括对话历史、冗长的提示词、复杂的工具定义以及持续膨胀的工具输出。智能体会被自身累积的历史信息淹没,每次交互都会产生更高的令牌成本,导致跨对话及对话内部的记忆缺失。现有方案将其视为存储-检索问题,但我们认为这种界定过于狭隘。主动管理智能体持有的信息是一个完整的生命周期过程,而不仅仅是存储行为:它涵盖决定需要记忆的内容、提取并结构化信息、按数据类型选择存储方式、在保留溯源信息的基础上进行整合与遗忘、判断当前相关的信息、预测下一步所需内容、以及在预算限制下压缩上下文而不丢失关键信息。在真实生产环境中,这套机制不仅作用于单个用户,更需跨越组织层级架构。我们将这一体系命名为"智能体上下文管理"(Agentic Context Management, ACM),并将其分解为五大原语:架构设计、信息摄取、范围界定、预测预判、压缩与整合。随后进行经济学论证:原始上下文累积会导致令牌成本随对话长度呈二次方增长,粗糙摘要虽能实现线性成本但伴随准确性断崖式下降,唯有经过验证的压缩方案方能保持线性成本与保真度。我们描述了参考实现系统Maximem Synap,该系统将五大原语作为多租户服务实现,在第六节详述的配置下,于LongMemEval基准测试中达到92%准确率,在LoCoMo测试中达到93.2%。最后探讨现有基准尚未覆盖的维度——延迟、令牌效率、语境衰退抵抗性,以及该领域未来将面临的决策层与组织层上下文管理挑战。
实验跟踪器能够展示训练的进展,但调整实时训练流程通常仍需要训练器专属代码。我们提出Interactive Training 2,这是一个通过共享协议引导训练的开源控制平面。训练应用声明其暴露的设置和操作,人类与自动化控制器通过同一接口提交请求,训练循环在安全控制点验证并执行这些请求。定制化的Aim工作区将实时指标和控件与请求及结果的按时间顺序记录相结合。我们在五个自然语言处理和强化学习工作流程中演示了该系统。发布的代码和轨迹为可审计的人工与智能体引导训练提供了可复用的基础。
尽管大型语言模型(LLMs)展现出卓越的推理能力,但其对纯文本预训练的依赖限制了其对多模态物理世界的感知。原生多模态预训练通过从零开始在多模态输入上进行训练,避免了这一局限,从而实现深层次的跨模态整合,并缓解了传统后期融合架构中固有的优化不对称性。尽管具有这些优势,该范式的缩放属性仍缺乏系统性表征。为弥补这一空白,我们探讨了在固定计算预算下训练基于Transformer的视觉-语言模型时,最优模型规模与token数量的关系。研究表明,最小化目标损失遵循可预测的计算定律,而计算最优的模型规模与token数量呈现幂律缩放规律。值得注意的是,语言目标与多模态目标展现出不同的缩放行为:语言分配律对数据组成基本不敏感,表明无论多模态数据比例如何变化,语言学习均保持稳定;而多模态分配律则对数据组成高度敏感。具体而言,文本密集数据仅在更大模型规模下才能实现计算效率,这迫使最优资源配置向更大模型容量倾斜。此外,通过建模数据组成对计算定律和分配指数的影响,我们推导出效率前沿曲线,明确了模型规模、token数量与数据混合比例的具体配置。下游评估进一步揭示,原生多模态预训练会引发正向跨模态迁移,从而增强纯文本空间推理能力,并实现稳健的多模态上下文学习。综上所述,本实证研究为可预测地缩放多模态基础模型奠定了关键基础。
现代生成模型通常依赖于对抗性判别器、预定义的噪声到数据路径或自回归分解。相反,我们证明适当的分布能量可以诱导样本级运动,并为一步生成器提供直接回归监督。用于生成的三体散射建模(TBSM)将能量距离转化为恒定大小的每次抛射体交互:每个抛射体被吸引向一个真实源,并被一个独立生成的源排斥。以抛射体及其条件为条件,该期望等于½ D_E²(P_θ, Q)的2-Wasserstein梯度流速度。一批B个冻结目标事件产生O(B)个样本级损失,每个损失使用一个参考作为其条件,而非像漂移模型(Drifting Models)等方法所使用的整个小批次全配对场。在线追踪这一条件期望可减少场噪声。使用冻结图像特征中的散射,TBSM在ImageNet-256上训练一步生成器,在像素空间PixelDiT-XL上实现FID=2.23,在潜在空间DiT-XL上在NFE=1时实现FID=1.63。我们提供了关联扩散相关监督、类漂移动力学和类GAN目标的设计图谱。这些结果确立了追踪散射作为高维一步生成的一条路径。代码:https://github.com/sp12138/TBSM。
工业视频异常检测(Industrial Video Anomaly Detection, IVAD)旨在识别工业过程中的异常物体与事件,这对现代制造业与质量控制体系至关重要。现有基于视觉语言模型(VLM)的异常推理方法虽能检测通用领域的开放式异常,但在工业场景中性能显著下降——此类场景常涉及复杂的物体变换、严格的物理规律及流程约束。为应对这种交互密集型检测的复杂性,我们提出了一种无需领域特定知识且无需训练的智能体框架,该框架强调像人类检验员那样追踪物体状态演化。其设计旨在捕捉被检测物体随时间变化的时空动态与潜在变换,进而基于逐物体的时间状态轨迹进行推理,以在定位帧中识别异常物体。本方法克服了先前方法的局限——这些方法需依赖正常片段重训练或在测试时注入领域知识作为上下文。在三个IVAD数据集上的大量实验表明,本方法不仅超越了前沿VLM、智能体框架以及在各自数据集上微调的传统视频异常检测(VAD)方法,还能针对异常过程与类型提供可解释的报告。
在多语言检索增强生成中,检索器能够检索出以多种语言撰写的相关文档,这些文档随后在答案生成之前会经过重排序处理。然而,现有的多语言重排序器在对语义相关的候选文档进行排序时,是否考虑了文档语言仍不明确。我们的分析表明,当跨语言存在语义等价的文档时,这些重排序器并未始终优先将与查询语言相同的文档排在前面,尽管文档语言会影响答案的生成。我们发布了LAMAR——一种具备语言感知能力的多语言交叉编码器,其训练目标兼顾语义相关性与语言一致性。LAMAR首先通过英语锚定相关性蒸馏,建立跨多语言输入的一致相关性评分,随后应用偏好对齐实现语言一致性,促使与查询语言相同的文档在保留语义相关性的前提下获得更高的排序位置。在评估语言一致性的受控实验中,LAMAR在整体性能及所有被单独考察的语言上均取得了最优结果。此外,LAMAR在已有的多语言重排序基准测试中仍保持竞争力。在实际检索场景中,对首阶段检索到的候选文档进行重排序时,LAMAR在所有报告指标上均取得了最佳结果。这些结果表明,LAMAR在兼顾语言一致性的同时,在通用多语言重排序基准测试中展现出强劲性能。
大型语言模型日益被部署为智能代理,但可靠的代理行为需要超越简单的下一个词预测。在推理阶段,理想情况下,代理应能自主决定是继续当前推理、将任务移交给更强模型、请求额外信息、调用外部工具,还是在给定设置下放弃回答。现有方法通过提示级路由、外部编排或任务特定微调来处理这些决策,这些方法主要依赖输入侧信号,且随着模型主干迭代升级,往往成本高昂且难以维护。我们探究能否直接从模型的潜在生成过程中推断此类控制决策。为此,我们提出多头部潜在控制层,这是一种轻量级架构,通过读取冻结大语言模型或视觉语言模型的隐藏状态轨迹,生成部署时的控制信号。能力头部预测当前模型能否解决该实例,或应移交至更强协作模型;决策头部则预测适当的解决决策类型——澄清、工具调用、放弃或直接回答。两个头部仅基于相同冻结大语言模型主干的潜在轨迹进行训练,从而在无需修改模型的前提下实现事后适配。在语言和视觉-语言场景中,多头部潜在控制持续改善多模型系统的质量-成本权衡,支持基于部分生成结果的早期移交和更精准的干预决策。在路由执行(小模型+大模型)场景中,该方法在AndroidWorld上减少大模型使用量高达90.7%,跨基准测试平均减少27%-53%,同时保留大模型大部分性能。此外,学习到的控制信号提升了工具调用决策质量,相对得分提升最高达158%,且遗漏必要工具调用的次数减少65.5%。
近期条件视频生成模型在将3D引擎渲染(如深度图和无纹理几何体)转化为逼真视频方面展现出巨大潜力,可应用于游戏和沉浸式内容创作。这类应用需要长时序自回归生成,即在保持持久3D世界的同时连续合成新帧。自回归生成器通过有限键值缓存逐块合成视频,因此当摄像机在其上下文被驱逐后重新访问某位置时,即使条件渲染结果(如深度图)与底层几何完美对齐,模型也常会生成不一致的外观。我们通过利用3D引擎已提供的对应关系来解决这种重访不一致性,无需任何后训练:时序对应关系将姿态匹配的历史潜变量块检索至键值缓存中作为闭环记忆;而通过相机姿态和深度重投影获得的空间对应关系,则使令牌级注意力偏向被检索块中几何对应的区域。我们在从TartanAir和TartanGround数据集中挖掘的闭环轨迹上验证了该方法,以模拟复杂的现实应用场景。结果表明,与现有免训练基线相比,该方法在保持整体视频质量的同时,在重访一致性上表现更优。项目页面:https://wenchao-m.github.io/ClosetheLoop.github.io/
近年来,大型语言模型(LLMs)显著推动了科学发现过程的自动化。然而,现有系统存在一个核心局限:它们独立地针对"质量"或"多样性"生成和优化想法,这往往导致生成的构思彼此高度相近,或产生大量琐碎、不严谨或模糊的概念。本研究提出,研究构思应被视作两项目标的结合,并构建为"质量-多样性(QD)搜索"框架。基于这一视角,我们引入IDEAgent——一个通过谱系管理想法演化的多智能体框架。我们利用多目标反馈联合驱动"质量",实现针对性的修复与优化;同时通过轻量级序列记忆与显式对比(对比已完成想法、历史祖先及被拒绝提案)实现"多样性"。为系统评估这种QD联合效应,我们开发了Yield指标——一种联合度量标准,用于计算满足预定质量阈值且彼此多样化的最大想法集合。最后,在横跨8个计算机科学领域的32个主题上的评估显示,IDEAgent在Yield指标上超越最佳基线3.89倍,并在8倍更多的主题上实现了非零Yield值。我们进一步通过质量改进分析佐证这些发现,表明修复与优化对于构建逻辑严谨性与清晰度(同时保留非显而易见性)至关重要。为鼓励基于QD搜索的构思研究,我们在https://github.com/declare-lab/IDEAgent开源了IDEAgent。
视觉语言模型(VLM)智能体越来越多地借助工具在3D场景中执行操作,而不仅限于描述场景。现有3D基准测试仅对文本响应或单物体操作进行评分,导致智能体在完整多物体3D场景中的操作能力缺乏评估。我们提出SceneActBench基准测试,在统一智能体-环境循环框架下对五种3D任务的视觉条件化操作能力进行评估。智能体基于PNG图像或采样视频帧(如适用,还可结合提供的3D资产)对3D环境执行操作。我们采用任务特定的几何度量指标,将每个最终输出与隐藏真实值进行对比评估。SceneActBench包含210个源实例构建的五种任务,形成包含配对输入条件的520个任务案例。为确保公平比较,每个任务均通过单一固定智能体循环执行。在十一种专有VLM配置中,总体得分范围为38.6-50.2,且没有任何配置能在所有任务中持续表现优异。我们进一步分析了故障发生的具体情境与成因。
扩散模型在迭代采样过程中通常会出现误差累积问题,即所谓的“曝光偏差”。我们发现训练与推理之间存在系统性的频率依赖性偏差,这可解释为信噪比(SNR)随频率变化的误差。关键的是,这种失配的方向会随模型和时间步长而变化,表明固定修正规则不具备泛化能力。为此,我们提出频谱对齐(Spectral Alignment, SPA),这是一种轻量级、基于引导的方法,可将中间预测的功率谱校准至预计算的先验分布。该方法包含两个阶段:(1)基于训练数据离线拟合参数化频谱模型;(2)通过基于FFT的高效梯度计算实现推理时引导。SPA仅引入3-4%的额外计算开销,且与无分类器引导(CFG)互补。我们在多种架构上验证了其一致性改进,涵盖像素空间模型(DDPM、ADM)、潜在扩散模型(SD2.0、SDXL)以及流匹配模型(SD3.5、FLUX)。实现代码见https://github.com/SonyResearch/SPA。
视觉语言模型(VLM)需要处理大量视觉令牌,导致显著的推理延迟和内存开销。这促使了针对视觉令牌压缩的广泛研究。尽管免训练策略依赖启发式指标,在高压缩比下性能严重下降,而许多基于训练的方法引入外部压缩模块,迫使VLM主干网络进行适配,这带来了大量重训练成本并损害了VLM的先前知识。有效的视觉令牌压缩依赖于强大的信息编码能力——预训练VLM已具备这一能力,但现有方法未能充分利用。受此启发,我们提出VisCo,一种训练高效的自我压缩框架,将预训练VLM本身复用为内在压缩器。VisCo是一种参数共享的自编码器,通过少量记忆令牌压缩视觉信息,并将层级化信息从编码阶段传递至解码阶段。实验表明,VisCo在所有评估压缩比下均超越先前方法,在更高压缩比下优势更大,甚至在极端单令牌设定下也能保持稳定。此外,当与原始视觉令牌结合使用时,学得的记忆令牌甚至能提升基础模型性能,这表明VisCo捕捉到了超出压缩范围的互补表示。
大多数自动说话人验证(ASV)系统通常基于单条语句运行,而现实交互场景往往包含多条语句。随着语音的累积,通过声学、韵律和语言线索可获取越来越丰富的说话人信息,这可能会挑战主要以嗓音特征为目标的说话人匿名化方法。我们研究了多语句、多模态场景下的ASV,并考察跨匿名化语音的信息聚合是否会影响隐私保护。首先,我们研究了仅基于多条匿名化语句的音频聚合,发现随着可用语音量的增加,性能持续提升。随后,我们引入韵律和语言信息,表明多模态系统优于单模态方法。最后,通过比较不同聚合策略,我们发现帧级聚合能够获得最低的等错误率(EER)。即使仅使用五条匿名化语句,结合音频与文本的方法相较于纯音频聚合,等错误率相对降低了15%以上,这表明尽管经过匿名化处理,大量具有说话人判别性的信息仍然可被获取。