每日精选AI研究论文及翻译
监督微调(SFT)与强化学习(RL)在提升大语言模型(LLM)的多任务推理能力时,表现出截然不同的行为特性。我们的初步实验揭示了一个现象:SFT 在多阶段训练下会遭受严重的任务冲突,而 RL 则能在不同任务之间实现稳定共存。在经验层面,我们将其追溯到参数级,观察到 RL 在不同任务上引起的更新是稀疏且近似正交的。我们通过分析多任务梯度干扰,为该机制提供了理论解释。结果表明二者存在本质区别:SFT 中的干扰受范数约束,随绝对梯度幅值缩放;而 RL 中的干扰受方差约束,其界限由优势归一化和在线策略优化所引入的梯度方差决定。这种较小的方差界限使得跨任务的优化方向近似正交。基于这一洞察,我们提出了 Parallel-RL,一种将多任务训练解耦的范式,显著提升了训练效率与灵活性。
近期的工作通过构建大规模多模态环境池来训练智能体。然而,我们发现单纯增加多模态环境的数量并不总是有益。我们通过一系列实验进一步分析了当前多模态环境分布中存在的局限。基于这些发现,我们从两个维度研究如何构建更有效的训练环境分布:**多样性**和**难度结构**。在多样性方面,我们提出**能力感知环境选择(AES)**以获取多样化的环境集合。在难度结构方面,我们提出**层次化难度课程(HDC)**,通过两个难度层级组织课程学习:约束减弱和状态规模递进。实验表明,AES和HDC能有效提升多模态智能体的训练效果。
世界-动作模型(WAMs)通过将视频动态先验迁移到动作预测中,提升了端到端自动驾驶的性能,但现有方法在推理时仍需昂贵的未来帧生成。我们提出SimWAM,一种简单而有效的WAM,将视频生成纯粹用作训练信号。它采用联合流匹配的方式,共同训练一个预训练视频专家和一个轻量级动作专家。隔离注意力掩码使动作预测独立于未来帧,模型训练后即可丢弃视频分支,留下一个可直接预测轨迹的自包含规划器。由于两个专家不共享参数,仅通过统一的注意力接口交互,因此可以在不修改学习目标或推理流程的情况下替换视频主干网络,并独立扩展动作专家。我们进一步应用强化学习来优化超越轨迹模仿的组合式驾驶奖励。我们的SimWAM在NAVSIM上达到91.5 PDMS,以显著更低的延迟超越了最先进的基于WAM的规划器,并实现零样本迁移至nuScenes。这些结果使SimWAM成为一个简单而稳固的基线,能够直接受益于视频生成的进展,实现高效自动驾驶。代码和模型权重可在 https://github.com/H-EmbodVis/SimWAM/ 获取。
从语言模型迁移而来的通用参数高效微调(PEFT)方法在实时检测器上可能静默失效,原因在于实时检测器的异构算子与检测专用组件对其施加了常规Transformer堆叠所不具备的放置约束。我们提出YOLO-PEFT,一种结构感知框架,将适配器放置形式化为可审计的约束规划问题。给定检测器计算图、PEFT请求和资源预算,YOLO-PEFT分配算子角色与语义角色,评估显式算子有效性、检测器语义、图接口及部署谓词,为每个被排除的模块记录原因代码,并输出带预算约束的目标模块方案,或在训练前返回拒绝(Refuse)决策。在官方VOC07+12训练验证集到VOC07测试集的协议下,规划器选定的RS-LoRA在YOLO11s和YOLO12s上分别达到0.7138和0.7307的mAP50-95,而全量监督微调(Full-SFT)分别为0.6428和0.6662。在RT-DETR-L上,所有七个被评估的LoRA系列配置均超过预定义的灾难性阈值,这支持在所评估覆盖范围内做出经校准的“拒绝-至-全量监督微调”(Refuse-to-Full-SFT)决策。受控的YOLO11审计进一步表明,LoRA将峰值训练内存降低43.9%,尽管训练耗时增加至1.72倍。在所评估的检测器家族、放置策略与校准覆盖范围内,YOLO-PEFT以显式、可检查的规划替代了手动目标模块试错,同时保留经过验证的训练-保存-合并-导出路径;对未见检测器架构的拒绝决策仍是一个有待验证的开放问题。项目主页:github.com/Tencent/YOLO-Master
在连续、真实世界环境中部署自主多模态智能体,要求其摄入无界的音视频流并维持小时级记忆。然而,当前的评估主要依赖于短视频片段和多项选择格式。这种设计使得仅处理最后四帧的最小基线模型能够匹配甚至超越复杂的流式模型,同时答案选项也暴露了语言捷径。我们提出StreamArena,一个面向小时级、交互式流式视频理解的基准测试。StreamArena包含243个全长视频,平均时长88.8分钟,以及3,646个经过严格标注的开放式问答对,用于评估实时感知、历史回溯、主动交互和多模态工具利用能力。跨多种系统的评估揭示了持续交互与长时程多模态理解之间的张力。仅保留最近帧的方法无法恢复遥远事件,将过去观察转换为文本的方法会丢失视觉证据,而反复压缩视觉记忆的方法难以随时间保留细粒度细节。针对这一张力,我们提出StreamMind,一种两层架构,将延迟关键型交互和主动监控分配给独立调度的前端工作者,而后端工作者异步构建持久化多模态记忆,并执行历史回召和外部搜索。StreamMind在全部四项能力上优于现有流式基线,并通过复用持久化状态降低了查询到回答的延迟。
对AI系统和数字产品进行人工评估成本高昂、速度缓慢且难以规模化。离线评估更具可扩展性,但往往忽略了人类多样性和交互行为。为此,我们引入MatrAIx——一个用于测试AI系统和数字产品、面向异构用户的大规模模拟用户评估基础设施。MatrAIx包含三个核心组件:第一,Persona 8B包含83亿条用户画像记录,由1,290个分类维度表示。这些记录要么从保留属性相关性的依赖图中采样,要么来源于人工撰写的画像。我们发布了一个经过质量过滤、约100万条用户画像的核心子集,其中包括599,847条基于人类数据的记录和400,000条合成记录。第二,MatrAIx Playground提供四种环境,让多样化用户评估数字产品并与之交互:问卷调查、AI聊天机器人、网页和应用。第三,MatrAIx提供1,010个应用任务,覆盖超过25个领域,包括商务、软件、金融和医疗健康。我们在八个代表性任务上进行了18,189次评估试验。用户画像智能体由三个大语言模型驱动:Claude Opus 4.5、GPT-5.5和Claude Haiku 4.5。所产生的反馈刻画了决策和偏好如何随用户画像背景而变化,包括价格上涨后的犹豫、AI助手失败后是否愿意继续,以及延迟容忍度。我们开展了两项主要验证研究:第一,一项包含400次试验的对照研究评估了跨十个行为属性和全部四种环境的用户画像遵从性。在366次试验(91.5%)中,声明的行为得到表达或被正确抑制。第二,人类评审员与LLM评审员评估了基于人类数据的用户画像的提取质量。总体而言,MatrAIx为使用多样化模拟人类用户评估AI系统和数字产品提供了一种端到端基础设施。
基于命令行界面(CLI)的软件工程智能体已迅速成熟,然而开放生态系统却收敛到了单一训练环境:用于微调开源模型的轨迹数据集几乎完全是在OpenHands下收集的。基于这些数据微调的模型在OpenHands下表现良好,但在任何非训练脚手架下部署时性能均显著退化。未训练的基座模型并不表现出这种差异,表明该差距由微调引起,且与训练脚手架的约定相关联。我们认为,一个起承重作用的脚手架特有行为是规划结构,这体现在本文所区分的两个层面上:显式规划,即作为一等产物生成的执行前规划;以及隐式规划,即在整个智能体循环中塑造执行过程的结构性约定。基于这一假设,弥合差距需要将规划从固定的脚手架产物转变为模型习得的能力。我们提出解耦CLI智能体脚手架(DCAS)——一种后端替换拦截层,可在不修改脚手架的前提下,在任意CLI脚手架与任意后端模型之间路由API流量,从而实现跨脚手架评估与规划感知的轨迹收集。借助DCAS,一项受控的规划来源干预证实规划质量是一个高杠杆组件,其取得的收益超过我们所观察到的跨脚手架性能下降。在单一脚手架下,基于少量DCAS收集的规划感知轨迹微调的模型,在非训练脚手架上均取得一致性提升;并且,上述两种层面的规划在训练数据中可经验性地加以区分。
激活预言器(AOs)是经过训练的语言模型,用于回答关于另一模型内部激活的自然语言问题。它们提供了一种灵活的接口,用于从模型状态中读取隐藏信息,尤其是在相关信息在内部有所表征但在可见行为中缺失或不完整的情况下。然而,AO本身也是习得系统:其答案受训练数据、目标函数以及习得的报告行为所塑造,而非对所表征信息的中立读出。我们在一个受控的禁忌词猜测场景中对此进行了研究,其中主体模型经过微调,在内部使用一个隐藏概念的同时避免直接披露。与"在这种主体上训练的AO会成为专门的读取器"这一预期相反,我们发现微调后的AO可能成为特定概念的反向读取器:它们选择性地无法恢复在其自身训练期间持续存在的概念。这一失败并不能简单地用该概念在主体或预言器表征中的缺失来解释:目标在预言器内部仍是可解码的,而对数几率透镜(LogitLens)和层消融分析表明,该失败产生于AO的读出通路。我们的结果表明,行为泄漏、表征层面的可解码性以及AO的可言语化能力三者可能彼此分离,这对习得式可解释性接口提出了可靠性方面的担忧。
小语言模型通常是在延迟、成本和本地部署约束较为严格的情况下唯一可行的部署选择,但这类模型很少从头开始训练:压缩模型通常通过知识蒸馏(KD)来恢复。这一恢复步骤在很大程度上决定了最终质量,然而其成本却很高。我们提出了一项面向实践者的蒸馏训练效率研究,围绕两个系统贡献展开。第一,我们表明离线KD(一次性缓存教师模型的Top-K logits,并让学生模型针对该缓存进行训练)能够在几乎相同的训练损失下与在线蒸馏持平,同时将教师模型从内存中移除,每次迭代运行速度提升约29%,在单个H200 GPU上吞吐量最高可提升41%。第二,我们引入了一种融合式分块KL损失,它从不实例化完整的词表大小的logit张量,从而使峰值内存与序列长度呈线性关系。这消除了原本会限制上下文长度的内存峰值,使我们能够在单个GPU上以四倍的上下文长度(32,768个token)进行训练。另一个仅包含输出头的玩具基准单独测试了损失核,并确认了其在4K到256K token范围内的内存和迭代速率扩展特性。这些改进共同使大规模恢复和数百次消融实验变得负担得起。我们还报告了关于损失设计和序列打包的辅助消融实验。我们发布了分块损失的实现:https://github.com/CompactifAI/Full-Chunked-KL-Loss。
音频推理对于机器理解声学世界至关重要。基于可验证奖励的强化学习能够激发此类推理,然而现有奖励设计在局限性上具有互补性:基于结果的奖励仅监督最终答案,使模型无需关注音频即可得出答案;而基于过程的奖励虽然对推理过程本身进行评分,却依赖于粗糙、手工设计且固定的标准,既无法适应每个问题,也难以锚定于声学证据。此外,不同问题对能力的要求各不相同,有的依赖于感知,有的依赖于多步推理,而任何静态标准都会随着策略的改进而逐渐失效。因此,使用细粒度、音频锚定且自适应的奖励来监督推理过程至关重要,但也极具挑战性,因为这类奖励难以针对每个样本手工设计。为此,我们提出AudioRubrics——一种使用自演化、音频锚定的评分标准奖励来监督音频推理的强化学习框架。AudioRubrics从原始波形中合成为每个样本定制的评分标准,并以模型自身的采样轨迹为条件,按组重新生成并重新加权这些标准,从而提供持续的学习信号,使静态标准趋于饱和时仍能持续针对当前策略的弱点进行优化。对三个音频推理基准的全面评估表明,AudioRubrics显著优于多种开源及基于训练的基线方法。此外,我们的分析表明,性能提升随评分标准生成器和评判器能力的增强而扩展,并且AudioRubrics会收敛到稳定的推理长度,既避免了退化性坍缩,也避免了无界增长。音频感知能力的提升进一步证明了将监督锚定于声学证据的有效性。我们的项目页面可在 https://audiorubrics.github.io 获取。
多模态表示学习是现代人工智能的基石。通过将多模态查询与目标编码为向量,它支撑着工业级搜索与推荐系统,并为现代智能体奠定基础。在抖音、小红书、YouTube等具有复杂模态和海量内容的真实平台中,既需要在十亿级索引下保持高效,也需要具备细粒度判别能力以应对困难匹配。现有的多模态大语言模型(MLLM)嵌入模型难以同时满足这两点。对比模型虽然高效,但依赖的成对监督过于粗糙,难以进行细粒度区分;而基于思维链(CoT)的模型虽通过显式生成提升了判别能力,却因生成开销过大而无法在线服务。我们提出了抖音多模态嵌入模型(Douyin Multimodal Embedding, DME),采用两阶段训练以兼取两者之长。第一阶段进行大规模对比预训练,构建统一的多模态嵌入空间,覆盖广泛的模态与任务。第二阶段通过两种机制补足语义充分性——即嵌入基于检索相关证据,并保留细粒度的对端语义。证据支撑的类型化潜在推理(Evidence-Grounded Typed Latent Reasoning)通过隐空间中的潜在推理来组织检索证据;跨条件重建(Cross-Conditional Reconstruction)则通过跨方向自回归重建来强化对端语义。这两种机制仅在训练阶段生效,且仅引入极小的查询端开销,因此DME的服务效率与标准对比编码器相当。在MMEB-v2基准上,DME的2B与9B变体在同等规模下均达到最先进水平(分别为74.8与78.4),在视频和视觉文档任务上表现尤为突出。在生产环境中,DME在抖音内部离线评测集上取得了2.92%的相对提升,已部署于抖音的生成式搜索、图片搜索和AI搜索等多个场景,并在抖音搜索的在线A/B测试中带来了0.1%的Lifetime(LT)提升。
空中图像目标导航要求无人驾驶飞行器(UAV)到达由目标图像指定的目标位置。现有的基于世界模型的方法利用预测的未来状态对候选轨迹进行排序,但通常仅依赖一个或少数几个点预测,这对于具有显著未来状态不确定性的大规模户外环境而言是不足的。为解决此局限,我们提出了不确定性感知导航世界模型(UA-NWM),一种用于空中图像目标导航的高效潜在世界模型,它将轨迹评分形式化为条件分布外检测。UA-NWM 用不确定性子空间表示可能的未来状态,并将预测与目标间的差异分解为不确定性可解释成分与不可解释成分。仅利用不可解释的残差进行评分,从而无需多个未来样本即可实现稳健选择。大量实验表明,UA-NWM 在保持低推理延迟的同时,持续优于现有导航世界模型。真实世界的 UAV 实验进一步验证了其实际适用性。项目页面:https://duryi.github.io/UA-NWM-Project-Page
硬提示压缩通过独立地对词元、句子或块进行评分,并在预算约束下保留得分最高的单元,来降低长上下文推理成本。我们发现了该过程的一个结构性缺陷:独立选择可能会拆分相互依赖的证据对,保留其中一个成员而删除另一个。当保留文本包含答案,而删除文本定义了解读该答案所需的实体时,我们称这一结果为指称悬空。在压缩率为0.30时,使用Qwen3-0.6B嵌入对连贯块进行排序的Beaver,在三个多跳问答数据集的桥接示例中,有34%-54%的示例答案路径不完整。在一个共享的HotpotQA桥接集合上,我们测试的全部六个硬压缩器均出现悬空现象,最高悬空率达60%;并且LongBench-v2单文档问答中的每篇文档都至少包含一个悬空引用。在使用Qwen3-8B评估的悬空示例上,重新插入缺失的支持段落并删除非支持段落以维持词元预算,可使准确率提升29-34个百分点(p < 0.0001),至少恢复了与保留两个支持段落的上下文之间差距的88%。更强的答案模型并不能弥补这一损失:在MuSiQue上,GPT-5.5在压缩上下文上的准确率比在保留两个支持段落的上下文上低8.8个百分点。最后,我们训练了一个精简分类器,根据被省略句子是否为解读保留文本所需对其进行排序,并在推理时无需支持标注即可重新插入排名靠前的候选句子。在HotpotQA上使用Qwen3-8B时,这种自动恢复将准确率提升了4.7个百分点,而压缩率仅从0.30变为0.31。硬压缩器应同时优化相关性和指称完整性。
我们研究交互式视频世界模型中的视觉持久性问题。这类模型依赖键-值(KV)缓存作为不断增长的视觉记忆,以携带先前生成的帧。然而,我们发现一旦展开(rollout)超出训练时域,模型便无法可靠地寻址已存储的内容,因为此时时间旋转位置编码(RoPE)的偏移量超出了训练期间所见范围,模型难以通过注意力机制检索相关视觉信息。此外,在RoPE旋转空间中朴素地压缩缓存,会因对不兼容的位置相位取平均而破坏记忆。为解决这一问题,我们提出WorldTrace——一种无需训练的面向长时域视觉持久性的记忆框架。WorldTrace通过为每个摘要槽分配一个不同的、处于分布内的虚拟位置,使压缩记忆保持可寻址性。在此可寻址缓存中,我们研究了两种记忆压缩方法:WorldTrace-Field压缩历史以实现时间一致性,而WorldTrace-Landmark在检测到的场景转换处存储逐帧的原始场景痕迹,以实现情景回召。我们进一步引入LoopBench,这是一个评估压缩缓存能否在长段迂回后重建先前访问场景的基准。在LoopBench上,WorldTrace-Field将时间一致性提升+15.5%,WorldTrace-Landmark将情景回召提升+19.5%,无需重训练即可扩展视觉持久生成的能力。
自回归模型在长程推演中会累积误差,但在部署时却没有可用于衡量该误差的真值。我们训练了一个条件潜扩散模型,它通过一个方向标志使动力系统在时间上向前或向后演化。我们表明,这种双向性提供了一种无需测量的测试时误差信号:前向推演i步再后向推演i步必须使模型返回起点,因此往返差异C_i是作为不可观测推演误差的自监督代理指标:无需集成、无需留出数据、无需控制方程,只需额外一次推演。我们在可压缩磁流体动力学(MHD)、天体物理湍流辐射混合层以及自然人脸视频(CelebV-HQ)上进行了验证。在留出的MHD轨迹上,C_i对推演误差进行排序(固定深度下斯皮尔曼相关系数为0.91–0.98;轨迹内为0.69±0.16),并且一个在训练推演上拟合的简单校准器能在接近标称覆盖率下,将其幅度预测在1.14倍(68%)和1.29倍(95%)以内——比仅基于深度的预测器多出一个nat,并可迁移到全部六个解码物理场。相同的信号在采样分散基线失效的地方,精确地标示出分布外的Orszag–Tang涡旋(AUROC 0.98;至深度10时达到1.0),并在80%覆盖率下将所产生的误差降低15%——是仅基于深度基线的三倍。双向训练的成本为负,在两个方向上都胜过单项方向专家,并且后向方向还可兼作快速逆向求解器。在LE-PDE-UQ的湍流Navier–Stokes基准上,一个双向模型仅以十分之一的训练成本,就达到了其十模型集成1.3倍以内的精度,并具有最佳的免训练像素级校准。往返一致性将可逆性转化为生成模型的实用信任信号。
测试时训练(TTT)将序列建模视为一个在线学习问题,其中快速权重通过内部学习规则进行更新。尽管TTT变体的数量不断增加,现有方法通常将每种变体分别硬编码,这使得设计新的TTT方法以及隔离每个组件的作用变得困难。为解决这一问题,我们提出了模块化TTT(Modular TTT),该框架将内部学习者表示为有向无环图,并将快速权重网络、损失函数、学习率、权重衰减和归一化作为显式的设计维度。模块化TTT自动将基元级别的训练视图前向、训练视图反向和因果查询视图规则组合成完整的图级别TTT计算,包括快速权重状态转移。利用模块化TTT,我们系统地消融了TTT的各个组件,发现较小的学习率初始化、权重衰减和单层非线性能够提升性能,而MSE和内积损失表现相当。更深的快速权重网络和归一化往往损害性能,因为它们会导致过大的激活值,而残差连接和门控带来的可衡量收益甚微。基于这些发现,我们训练了最优变体模型,参数量为4.1亿和14.5亿,在1000亿token上进行训练,观察到训练损失和基准性能与Gated DeltaNet相当。
神经缩放定律是语言模型发展的基础,然而标准公式在数据稀缺和过度训练的极端情况下,系统性地低估和高估了损失。这一失效的根源在于其潜在假设,即模型规模与训练数据对损失的影响是相互独立的。为解决此问题,我们引入了Skaling定律,一种广义函数形式,通过单一交互指数将模型能力与数据耦合起来。这一简单扩展在插值和外推两种机制下均将平均绝对百分比误差(MAPE)降低了1.5至3倍。当与仅限于低计算机制的稀疏网格策略相结合时,Skaling定律可实现准确的完整网格外推,所需计算量约为均匀扫描的十分之一。通过实现从小规模实验中进行可靠的性能预测,Skaling定律为下一代模型训练中的计算预算分配提供了更加稳健且资源高效的框架。
基于人类行为数据微调的大型语言模型已成为通用认知代理,但所需规模以及这些模型是处理任务结构还是利用统计捷径,仍是开放性问题。我们在Psych-101数据集上训练了十四个模型,参数规模从1.35亿到140亿,涵盖四个架构家族;Psych-101包含来自160项实验的1070万个试次水平选择。在分布内,规模几乎无关紧要。这些模型落在一个狭窄区间内,仿佛触及天花板;0.6B到1B参数就足以在留出被试上匹配70B基线模型。在分布外,这一区间展开为明显更陡的规模梯度,较大的模型在新任务结构的泛化上具有明显优势。为确定这些模型使用哪些信息,我们进行了两项诊断。我们在27项实验中逐步剥离四个提示通道——任务指令、实验刺激、结果反馈和选择历史——并打乱试次顺序。屏蔽刺激和反馈的内容破坏了75.7%的学习信息,并将模型推至低于随机水平,这表明仅凭选择历史无法解释其表现。顺序打乱的结果显示,在试次独立的任务上模型表现不变,但在试次顺序由先前反应决定的任务上则表现出敏感性。因此,小型认知微调模型有望成为心理实验的噪声上限估计器,但其适用范围仍受限于训练中见过的范式。
近期用于优化提示词、程序和机器学习工作流的系统通常依赖显式的外层循环控制器,如进化搜索、多臂老虎机或文本梯度方法。我们提出了一个根本不同的问题:这种搜索策略中有多少可以被单个使用工具的智能体内化?我们提出ReASearch——一个统一的推理驱动优化框架,其中智能体自主决定评估什么、如何诊断失败、进行哪些修改,以及何时验证或重启。该智能体不仅仅是由手工设计的启发式规则引导的提议生成器,而是主动分析结果、分配预算,并通过持久记忆在长时间跨度内优化其策略。凭借共享的智能体循环和领域专用工具,ReASearch以完全相同的框架实例化来优化提示词、程序和机器学习工作流。在14项不同的任务中,它与专门的优化系统相比具有竞争力,且大多数情况下表现更优,相比强领域特定基线实现了2%至40%的提升,在某些情况下发现的解决方案甚至优于此前人类已知的最佳结果。关键的是,我们观察到通常由显式控制器实现的复杂搜索行为,会自然地从智能体的推理过程中涌现。
AI编程助手的广泛集成无疑提升了工程开发速度。然而,近期研究指出了日益显著的权衡问题,揭示了代码质量和可维护性方面持续存在的挑战。包括前沿AI实验室在内的行业领导者也表达了类似担忧。随着大语言模型越来越多地被用于编写生产代码,理解其对交付软件质量的影响已成为关键优先事项。然而,由于可观测性障碍,在工业工作流程中评估这些影响仍然困难。我们在一家运营全球产品、每天服务数十亿用户的大型企业中,研究了AI生成代码对生产质量的影响。出于这种规模和用户信任,该组织高度重视代码质量,并为部署到生产环境的每一行代码建立了全面的可观测性,从而使我们能够克服测量障碍来评估这些影响。 本研究对2025年4月至2026年4月期间的AI生成C++代码进行了大规模实证分析,跟踪了该企业既有代码库中的352万次代码变更。核心目的是在大规模生产环境中,理解AI生成代码与人类编写代码相比在质量、性能和维护方面的特征。我们发现,AI生成的C++代码具有鲜明的质量特征,表现为接口与耦合负担、拷贝与分配开销的发生率更高,并且更倾向于使用显式循环而非经过优化的标准API。这些问题会转化为切实可见的下游成本,包括评审工作量增加以及计算资源消耗上升5%至8%。然而,我们证明,向模型提供有针对性的、基于分类体系的反馈可以缓解这些影响,使目标静态分析警告减少11.1%,并提升计算效率。
特权在策略蒸馏通过允许同步教师利用仅训练可用的参考(例如成功轨迹)在每个回合对学生响应进行重新评分,为多轮智能体提供密集监督。然而,在交互式环境中,学生先前采取的动作会持续改变执行状态。当学生采取不同动作或以不同顺序完成子目标时,其轨迹展开可能到达参考未覆盖的状态,使得参考对于实际到达状态而言成为不可靠的指导来源。因此,不加区分地应用特权蒸馏会造成状态-参考不匹配。这种不匹配引出了一个核心目标:提供与学生当前执行状态兼容的特权参考指导。我们提出了状态匹配路由与情境化自蒸馏(SMRC-SD),它显式地确定特权轨迹应在何时以及如何指导在策略学生。在每个回合,SMRC-SD 都会验证学生当前执行状态是否与参考轨迹上的某个受支持状态匹配;仅在匹配状态下应用蒸馏,从而过滤掉参考缺乏局部兼容指导的回合。对于每个匹配状态,SMRC-SD 进一步从成功轨迹构建状态条件的教师上下文,使监督基于实际到达的状态。在 ALFWorld 和 WebShop 上,SMRC-SD 始终优于无条件的成功全路径蒸馏。使用 Qwen3-1.7B,它在 ALFWorld 上将任务成功率从 0.746 提升到 0.865,在 WebShop 上从 0.574 提升到 0.693。受控路由与上下文消融实验表明,选择局部受支持的回合和构建状态兼容的教师上下文都是实现这些提升的贡献因素。代码可在 https://github.com/liujunzhuo/SMRC-SD 获取。
恶意使用生成式人工智能制造高度逼真的深度伪造视频,引发了严重的伦理关切,并对AI安全构成了重大挑战。然而,现有的深度伪造视频基准测试对近期合成方法的覆盖有限,且普遍缺乏可靠的细粒度文本标注。与此同时,传统检测器和多模态大语言模型(MLLMs)——无论是作为单一模型运行还是依赖单一分析视角——往往难以捕捉细微的伪造痕迹,限制了其向新兴AI生成方法的泛化能力。为解决上述局限,我们提出了FaceVid-Forensics-100K,一个大规模深度伪造视频数据集,包含10万条视频,涵盖人脸交换、人脸重建和全脸合成三大类共33种合成方法,包括Seedance 2.0等近期生成器。该数据集提供了视觉观察的细粒度文本标注和判决一致的取证解释,这些标注通过由先进MLLMs驱动的多模型聚合与冲突消解流程自动合成。基于该基准,我们提出了一个多智能体取证推理框架,采用四个专门的领域专家智能体,分别从纹理、光照、运动和物理四个视角独立分析伪造线索。随后,一个裁判智能体对它们的报告进行协调,以生成最终预测及解释。在跨域测试集上的广泛评估表明,尽管我们的框架完全由小型开源MLLMs组成,其性能仍优于包括闭源GPT和Gemini模型在内的所有方法,并在该基准的所有报告指标上排名第一。项目页面可在https://xavierjiezou.github.io/ARGUS/访问。
人格条件化LLM智能体(PC-Agents)越来越多地应用于情感支持、社会模拟和角色扮演,这推动了能够在长期交互中保持连贯性的终身智能体的发展。这种连贯性的一个关键组成部分是人格演化:智能体在不同情境中经历生活事件时,应发生合理的、有心理学依据的变化。尽管已有研究表明LLM的人格会在情境扰动下发生偏移,但这些偏移如何随特质、事件、人设和模型的不同而变化,目前仍知之甚少。 我们以大五人格特质作为心理测量锚点,研究了11个重大生活事件所诱发的人格变化,并参照人类人格心理学的纵向证据来解读由此产生的轨迹。在四个诊断维度上,PC-Agents对于有或无文献记载人类变化方向的事件-特质对,均展现出可测量的特质偏移,且发生率相近。即使偏移方向符合预期,其幅度通常也低于人类效应量范围。性别和文化区域提示几乎不表现出调节效应,而人设层面的离散度相对于人类样本被压缩至三分之一到四分之一。 为实现系统性比较,我们提出了BFI-Adapt,这是一个用于评估事件诱发人格变化方向保真度的可复用基准,并利用它对14个模型进行排名。验证套件表明,所测得的偏移超过无事件重测噪声,在独立改写的提示词下保持稳定,与基于场景的行为选择仅表现出有限且因模型而异的一致性,并且在插入无关对话后仍然存在。这些检查共同将所测轨迹确立为稳健的事件条件响应模式。我们的结果表明,当前的PC-Agents模拟了人类人格动力学的均值,但未能模拟其形态。
公开基准中的测试数据不可避免地泄漏到预训练语料中,一旦被记忆就会导致评估分数虚高。污染缓解评估通过干预解码过程来抑制记忆并恢复受污染模型的真实能力,但其主流指标 G-AP(Gap of Aggregate Performance)存在缺陷:离散的正确/错误读数无法刻画逐题表现;先平均再求差会让过度抑制和抑制不足相互抵消;均匀的逐题加权会诱导策略将解答概率推向干净模型的高频值。我们提出 SA-PPG(Stratified Aggregate of Per-question Probability Gaps):通过采样估计每道题的解答概率,与干净模型逐题求差,并在由干净模型解答概率定义的组内进行聚合。现有缓解策略首先估计污染所在,再基于该估计进行操作,因此其正确性取决于估计本身。相反,RailCap 在生成过程中判断污染:每当样本回落到贪心轨迹上时,将下一个轨迹词元限制为次优词元,持续累积抑制,直到响应分布足够分散。在多个受污染模型和基准上,SA-PPG 显示先前策略的恢复效果被显著高估,而 RailCap 取得了最低的 SA-PPG。
多模态大语言模型(MLLMs)的创造能力在设计、传播、教育和人机协作中具有重要意义,然而与面向准确性的任务相比,其评估仍然困难,因为明确的目标和奖励信号十分稀缺。跨概念理解是接受性创造力的核心认知能力,它使感知者能够从不显而易见但有意义的概念关系中恢复出预期含义。我们将题项构建操作化为跨概念编码,将模型推理操作化为跨概念解码。我们提出了C4,一个受认知启发的基于成语(Chinese idiom)的跨概念创造力(Cross-Concept Creativity)评估框架。其编码组件沿着人工标注并经第三方审核的跨概念网络中的桥梁路径,将目标槽映射到可成像的替代概念,从而支持具有明确结构、难度以桥梁数量和深度为指标、并具备精确答案的批量生成。利用该框架,我们实例化了C4评估集(C4-Eval),包含184个合成题项和37个人类创作的跨概念成语修辞表达(收集自在线来源)。我们对所收集修辞表达的跨概念关系、桥梁路径和推理过程进行了人工构建与审核。每个C4-Eval题项在五种任务设置中被实例化,共产生884个主要答案恢复用例。在十个被评估的MLLMs中,最强的闭源模型的主要准确率分别达到50.7%和48.0%,而开源模型则显著更低。候选约束显著提高了准确率,但桥梁提示和解释请求带来的提升有限。这些结果揭示了当前MLLMs在通过跨概念关系解码创造性编码含义方面存在显著差距。代码见补充材料。
一旦视觉内容进入AI处理流程,其所有者往往难以在技术上控制内容的使用方式。法律和监管手段可以应对滥用行为,但许多技术干预必须在更早阶段进行,即在内容发布或访问之时。本综述考察了围绕该干预点发展起来的保护范式,我们称之为“为善的对抗攻击”。长期作为对已学习模型的攻击来研究的扰动和结构化信号,如今反而被数据所有者、创作者、平台或审计者用来破坏未经授权的自动化,或为事后问责提供支持。五个研究社区在很大程度上独立地实现了这一反转,各自针对视觉资产生命周期的不同阶段:共享时的隐私过滤器以抵御非预期的识别,不可学习样本以防御未经授权的训练,生成式防护以抵御恶意编辑或模仿,对抗性验证码以对自动化代理进行访问控制,以及溯源机制以支持传播后的归因。尽管这些方法在不同的场合中提出,评价标准也互不兼容,但其中许多方法利用了人类感知、语义理解与机器推理之间持续存在的差距,这表明随着视觉处理流程向多模态模型和自主代理演进,该范式仍然具有相关性。为使各方结论可比,我们沿着可迁移性、适应性和部署就绪度三个共同维度评估这五个方法家族。纵观整个生命周期,我们发现大多数保护措施仍主要针对静态或弱自适应的对手进行验证,而超出受控基准测试的证据仍然稀缺。最后,我们整合了跨阶段的对策与开放问题,以推动健壮、可组合且可部署的所有者侧保护。
基于大语言模型的智能体正在快速发展,能够自主调用外部工具为用户完成多步任务。然而,智能体获取的敏感信息往往超出任务所需。现有的隐私基准测试主要审查智能体的响应或对外动作所泄露的内容,却忽视了获取阶段——即数据首次进入智能体上下文之时。过度获取的信息距离完全泄露仅一步之遥,一次粗心的操作或一次攻击便足以使其暴露。为评估这一问题的普遍性,我们提出了PrivacyPeek,一个用于评估基于大语言模型的智能体获取阶段隐私泄露的基准测试,涵盖7种获取行为和16个应用领域的1,182个案例。具体而言,获取检查(Acquisition Inspection)审查智能体的工具调用轨迹,包括其调用的工具和接收的数据,以检测其是否获取了超出任务范围的敏感信息。随后,探测诱导(Probe Elicitation)发出后续探测问题,衡量攻击者能多容易地诱导智能体泄露其已获取但未披露的敏感信息。我们在4个模型家族的10个基于大语言模型的智能体上进行的实验表明,不必要地获取敏感信息的现象普遍存在。此外,我们观察到任务完成能力与获取阶段泄露之间存在相关性。提示级防御仅能减少一小部分获取阶段的泄露,大部分泄露仍未得到缓解。这些结果使得审计获取阶段的隐私泄露既紧迫又必要。我们的数据集和代码可在https://github.com/Xuan269/PrivacyPeek-Resource获取。
序列模型必须决定将哪些内容写入记忆以及保留哪些内容。在量子与量子启发的序列学习中,非线性循环更新通常需要重复的电路评估和随时间的顺序反向传播,这使得长上下文的处理成本高昂。基于量子启发Kolmogorov-Arnold网络(QKAN)的门控快速权重编程器(FWP)通过将上下文存储在时变快速参数中来缓解这一瓶颈。然而,其标量门控对每个快速状态坐标施加单一的保留-写入平衡,迫使所有参数共享一个记忆时间尺度。我们引入了基于QKAN的自调制FWP,用低秩生成的逐元素调制取代这种广播门控,调制对象可以是新提议分支、有界旧状态分支,或两者。我们进一步提出互补矩阵门控(CMG),它使用一个sigmoid矩阵门来保留旧状态,并用其互补部分写入新提议。CMG提供逐坐标记忆控制,同时保持标量门控的有界凸更新和仿射前缀扫描结构,其代价仅为单分支规则的调制头。我们在四种FWP架构上比较了四种自调制规则与标量门控,这些架构结合了经典以及基于QKAN的慢速和快速编程器。在七个单步预测基准和五种序列长度上,对于快速编程器包含QKAN模块的架构,CMG提供了最一致的改进。在使用CUDA-Q Dynamics模拟的Jaynes-Cummings和transmon-谐振器动力学的直接多步预测中,CMG模型在4、8和16步的预测区间上保持均方误差在0.001或更低量级,同时其均方误差相较标量门控对应模型至少降低91.2%。这些结果确立了逐坐标互补调制作为基于QKAN的FWP的一种稳定且有效的更新方式。
世界生成模型通常通过其产出来使用:一段渲染的未来、一个以视频为条件的动作,或由昂贵生成分支计算出的潜在上下文。我们认为,它们更具可复用性的资产是构造未来的计算过程。当生成器将受损的未来转化为连贯轨迹时,其中间状态在不同抽象层级上组织外观、空间布局与交互。这种未来生成计算能否被内化为一种仅从当下推断出的表征?我们提出 Enfold,它将该计算转移为从当前视觉上下文和语言指令预测得到的表征。训练期间,生成器处理观测到的未来时所暴露的多层级状态,监督一个仅基于当前的编码器。学习到的表征被反馈以条件化未来生成,并被任务头读取,同时不允许任务梯度重塑编码器。部署时,动作预测不再执行生成器。在 LIBERO、RoboTwin2.0 和真实机器人任务中,Enfold 在实现强控制的同时,将动作延迟相对于 Fast--WAM 降低了 3.7 倍;Enfold-Flash 则达到 10.1 倍。表征分析表明,它抑制了干扰性变化,并优先捕捉在更长时域中涌现的变化。当当前场景因人为干预而改变时,生成的后续内容与执行的动作都会相应调整,这与固定轨迹回放不一致。这些结果将世界生成器重新定义为预测控制表征的来源:如果其内部结构能够被融入当下,则无需在每一步都将未来具体化。
话轮转换是全双工交互的核心组成部分。何种话轮转换行为恰当因场景而异,然而当前模型无论上下文如何均采用单一规范。这一局限源于其训练数据:人人对话语音语料库捕捉了自然时序现象,但缺乏角色定位或场景特定规范;而基于启发式或提示的合成方法注入话轮转换行为时,并未以人类偏好为依据。我们提出DuplexGen框架,通过针对少量槽位级人类偏好标注校准大语言模型预测,生成具有场景自适应话轮转换的对话。在六项合作与竞争性任务中,人类的话轮转换偏好存在系统性差异,而DuplexGen与这些偏好的契合度远高于未校准的提示方法或仅基于通用人人对话数据训练的方法;基于DuplexGen生成数据训练的全双工模型展现出明显符合人类偏好的独特话轮转换行为。这些结果表明,使话轮转换合成具备场景特异性所依赖的是人工校准,而非仅靠语料库规模或提示设计。
当狗张开嘴吠叫时,人类自然会识别这是什么声音以及它何时发生。构建具有相同能力的视听模型,需要能够同时捕捉语义和时间对齐的表征。现有方法在某一方面存在不足:嵌入模型匹配语义但丢失时间信息;同步模型捕捉时间偏移但缺乏语义理解。为弥合这一差距,我们提出FATE,即帧级视听时间嵌入(Frame-level Audio-visual Temporal Embedding)。与先前将每个模态池化为单一嵌入并丢弃时间信息的嵌入模型不同,FATE保留帧级序列,将其在物理时间线上对齐,并在严格对齐的帧对上计算相似度。与仅输出偏移预测的同步模型不同,FATE将同步编码在可复用的嵌入空间中,通过结合跨视频语义对比学习和视频内时间对比学习的联合目标进行训练,以同时捕捉声音内容及其发生时间。在三个任务中,FATE在时间和语义检索上大幅超越最强基线,在零样本设置下的事件定位上与全监督方法相当,并作为生成评估指标取得了与人类判断的最佳相关性。源代码可在https://github.com/guankaisi/FATE获取。
视觉-语言模型正日益成为具身智能体的推理核心。机器人执行本质上具有迭代性:每个动作都会重塑场景和物理状态,持续更新需要被感知、推理和验证的内容。满足这些需求需要具备在监督信号、预测格式和验证标准上各不相同的互补能力。现有方法通常针对孤立的、任务特定的目标来发展这些能力,而未阐明它们应如何围绕执行整体进行组织和整合。我们提出Capek 0.5,一个以执行为中心的能力分类体系为基础的具身视觉-语言模型。该分类体系不按数据集或任务组织训练,而是根据具身能力在执行过程中的功能角色对其进行分组,包含四个能力族:空间推理、时间理解、动作引导和状态验证。每种能力首先由专属专家模型通过基于共享主干网络的可验证奖励强化学习获得,随后通过权重空间合并及路由策略空间蒸馏,将各专家模型整合为单一的推理时模型。我们在2B和35B-A3B规模上实例化Capek 0.5,并从三个互补视角进行评估:综合基准测试套件(包括Capek-StateBench——一个新的状态验证基准);从专家模型到统一模型的能力保持受控研究;以及在模拟具身环境中的闭环评估。Capek 0.5在大多数匹配的基准测试条目上相对于其初始化模型有所提升,在一个检查点中以可量化的损失保留了全部四种专项能力,并成功迁移到闭环具身任务执行中。
基础模型用于从大量未标记数据中提取可迁移的表征,通常通过自监督学习(SSL)实现。然而,许多此类模型依赖于可解释性有限的架构,这在医学成像等高风险领域是一个关键问题。我们提出了DualIFM,一种通过BagNet骨干网络实现设计上可解释的基础模型,其小感受野生成忠实于模型决策过程的类别证据图。此外,DualIFM在预训练期间引入了二维投影层,能够直接可视化表征空间,提供数据集级别的学习结构视图,包括有意义的临床聚类以及潜在的虚假相关。我们在来自不同来源的超过80万张彩色眼底照片上训练了DualIFM,以学习适用于不同下游任务的泛化性强的表征。我们的模型取得了与参数数量为其16倍的RETFound相当的性能,同时在分布外数据上提供了可解释的预测。这些结果表明,大规模自监督预训练与固有的可解释性相结合,可以为视网膜影像产生稳健的表征。代码和预训练模型可在github.com/berenslab/interpretable_FM获取。
视频-语言模型的基准评测主要集中于短视频片段和单句指标,当前系统能否生成准确的长篇、段落级描述这一问题仍未得到解答。我们提出了 CLIP-CC-Bench,这是一个用于长篇视频描述的评测套件,基于5小时的电影内容构建,并将其分割为90秒的片段,每个片段配有专家撰写的段落式参考描述。该评测套件采用五种最先进的基于大语言模型的嵌入模型组成的集成,以提高可靠性并减轻单一模型的偏差,同时应用两种互补的方法论:(i) 粗粒度语义匹配和 (ii) 细粒度语义匹配,将模型生成的描述与 CLIP-CC-Bench 的参考描述进行比较。利用这一框架,我们评估了17个最先进的视频-语言模型,并报告了它们在 CLIP-CC-Bench 上的波达聚合排名及平均得分。我们还通过评估者间一致性和自助法排名稳定性,进一步量化了该评测协议的内部可靠性。我们在 https://github.com/Multimodal-Intelligence-Lab/CLIP-CC-Bench 上发布标准化的评测脚本、模型输出和聚合工具,以支持可复现性。CLIP-CC-Bench 为长篇视频描述提供了一个实用的评测框架,填补了现有短片段和纯问答基准所留下的空白。
多模态大语言模型(MLLMs)在情感智能方面已展现出卓越的能力。然而,现有研究主要集中于任务特定的专门化,常常忽视任务间的协同效应,使潜在推理能力未被充分挖掘。为弥合这一差距,我们提出了OneEmo,一个统一的情感通才模型,能够掌握情绪感知、理解与交互。为此,我们首先构建了EmoWorld-130K,一个综合性数据集,通过人在回路的流程将专门的情感知识提炼为显式推理轨迹。在该语料库上进行监督微调揭示了多任务学习带来的显著互惠效益。其次,为充分释放潜在推理能力,我们提出了Emo-Chord,一种新颖的强化学习策略,通过统一的多任务奖励分配稳定优化过程。大量实验表明,在大多数基准测试中,OneEmo相较于同等规模的基线模型取得了最先进的性能。值得注意的是,尽管参数数量远少于商业模型,OneEmo仍取得了极具竞争力的结果。本文为更可靠、可解释的情感计算铺平了道路。代码可在 https://github.com/waHAHJIAHAO/OneEmo 获取。