每日精选AI研究论文及翻译
视觉-语言-动作(VLA)模型通常采用以大语言模型为中心的“视觉→语言→动作”路径,即先将视觉观测投射到大语言模型的表征空间,再解码为机器人动作。尽管这一设计行之有效,但每次策略调用都会产生大量的计算和内存开销。为此,我们提出TurboVLA——一种全新的VLA范式,它将传统的“V→L→A”路径重构为直接的“V+L→A”映射。TurboVLA不再将大语言模型作为感知与动作之间的核心接口,而是独立编码视觉观测和语言指令,通过轻量化的双向视觉-语言交互实现信息直接交换,并使用紧凑的解码器预测连续的动作块。这种简洁的设计直接从视觉和语言特征中构建任务条件表征,显著降低了VLA推理的计算和内存成本。在LIBERO基准上,TurboVLA仅以0.2B参数、31.2毫秒推理延迟和0.9GB推理显存(搭载消费级RTX 4090)便达到了97.7%的平均成功率,与显著更大规模的VLA策略相当甚至更优。这些结果表明TurboVLA是一种简洁而有效的替代方案,挑战了当前主流的以大语言模型为中心的VLA范式,为如何高效连接视觉、语言与动作以实现机器人操作提供了全新视角。代码已开源:https://github.com/H-EmbodVis/TurboVLA。
基于评分标准的强化学习通过依据显式标准评估模型输出来丰富语言模型训练。然而,在GRPO(分组相对策略优化)风格的流程中,这些结构化判断被简化为标量的响应级奖励,并转化为响应级优势,统一广播到所有生成的token上。这导致即使在不同的标准基于不同的区间、格式决策或语义选择时,也没有显式的机制在响应内部进行信用分配。我们提出CoRT,一种用于评分标准条件GRPO的token级信用加权方法。CoRT不训练辅助的token评分模型,而是通过反事实重放,在原始评分标准条件的提示和匹配的无标准提示下,对同一采样响应重新评分。由此产生的token级对数似然对比作为对评分标准上下文依赖程度的代理指标。CoRT将这些对比映射到有界、响应归一化的权重上,并利用这些权重在token间重新分配带符号的GRPO优势,无需引入辅助评分器或改变响应级奖励。在指令调优模型和不同奖励粒度上的实验表明,CoRT在绝大多数比较中优于匹配的响应级GRPO,平均提升4.4个百分点。该方法与学习型token级信用基线相比仍具有竞争力,同时避免了独立的关联性学习阶段。这些结果表明,策略内部的反事实似然对比能够提供有效的训练信号用于响应内信用分配,同时保持GRPO的简洁性和稳定性。
评估视觉-语言模型(VLM)能否通过物理身体执行动作是具有挑战性的。动作的结果将VLM的决策与电机控制耦合在一起。当任务失败时,很难判断是VLM做出了错误选择,还是电机控制器未能成功执行(例如,因失去平衡而摔倒)。在这项工作中,我们提出了HumanCLAW——一个将动作决策与底层执行解耦的评估框架。在每一步中,一个被约束的现成VLM发出一个原子技能命令,该命令被转换为亚秒级的连续全身运动,并伴有真实的物理后果(包括重力和碰撞)。因此,身体可以在物理世界中自由行动,而执行侧的干扰(如平衡和电机误差)则被分离出去。剩下可测量的是模型的动作智能:其在每个瞬间选择身体下一步应执行什么。基于这一框架,我们构建了HumanCLAW基准测试:包含1,218个长周期、第一人称视角的“发现-导航-交互”任务片段,覆盖41个室内场景。我们测试了九个最先进的VLM,发现没有一个能解决该基准测试;最佳模型的成功率仅为16.8%。识别目标并非瓶颈所在。当前VLM所缺乏的是具身自我意识:它们会丢失自身身体的位置信息,无法判断身体在哪里、是否到达目标,或是否碰到了障碍物。
文本空间优化通过编辑外部自然语言工件而非模型权重来适配大型语言模型(LLM),使得优化后的工件可审查,且模型可被视作黑箱处理。然而,现有文本空间方法大多保持评估标准固定不变。在开放式任务中,这可能成为瓶颈:一旦求解器在评分标准衡量的指标上取得改进,未覆盖的维度就会从优化信号中消失。而简单地对评分标准进行进化也不可靠——当更新由当前求解器的分数决定时,表面上的进步可能源自让评分标准更易满足。我们提出DecoEvo(解耦共同进化),该方法在优化过程中不依赖黄金评分标准,通过解耦目标共同进化求解器技能和评分标准生成技能。求解器技能基于准则级反馈进行更新,而评分标准生成技能则通过独立于求解器总分的互补性审计(涵盖需求覆盖度与响应区分度)进行修正。这种分离使得生成器的更新聚焦于求解器新暴露的弱点,减少对求解器已满足准则的重复强调。在各基准的官方评估下,DecoEvo在五个基准测试和三个LLM主干网络上均优于所有对比方法,在五个基准的平均结果上相较于SkillOpt取得了2.8%至5.0%的相对提升。
现实任务常要求模型从任务特定情境中学习,而非仅依赖预训练知识。尽管近期研究将这一能力称为情境学习,但现有评估主要聚焦于文本情境。然而在实际场景中,待学习的情境往往是多模态的:科学结论通过图表呈现,金融指标分散于转换后的报告中,空间决策依赖于地图、场景或网页。我们提出CLBench-V——一个面向多模态情境学习的基准测试,通过围绕三个维度组织任务来解决情境使用失效点的定位难题:情境基础、新信息应用与新知识学习。CLBench-V融合了经过转换的公开基准数据集与全新构建的数据集,涵盖科学、金融、长文档理解、空间推理及基于网页的视觉问答等领域。为降低构建领域特定情境学习任务的成本,我们进一步采用自动化构建与过滤流程处理新增数据集。在3443个实例和六种近期多模态模型的测试中,最佳整体得分仅达0.2847,表明多模态情境学习仍远未饱和。此外,InternVL3.5-30B-A3B在情境基础与新知识学习维度表现最优,而Qwen3.5-Plus在新信息应用维度领先。我们进一步分析了裁判可靠性、上下文长度、图像数量及代表性失败案例。代码已开源在 https://github.com/IamLihua/CLBench-V。
训练大语言模型(LLMs)在长周期游戏中进行行动是迈向通用决策制定的一个前景广阔的步骤,然而,基于可验证奖励的强化学习(RLVR)依赖稀疏的最终奖励,这些奖励难以揭示哪些决策决定了成功。更密集的过程信号可以提供缺失的回合级信用分配,但现有信号源难以同时兼顾低成本和高准确性。我们观察到,游戏求解器状态值的变化能够揭示某个动作是否将状态推向成功。基于这一洞察,我们提出了CAST(来自求解器教师的信用分配),该方法将这些值变化转化为求解器优势,并将其作为回合级信号注入到RLVR中。我们进一步证明,在软最优求解器假设下,最大化求解器优势等价于从求解器进行在线策略蒸馏,且仅需标量值而非教师logits。在Sokoban、Minesweeper和Rush Hour这三个游戏中,CAST在域内和未见难度评估下的每个游戏中都优于所有训练的基线,并在ALFWorld和WebShop上取得了最高的平均零样本性能。我们的代码可在 https://github.com/Wloner0809/CAST 获取。
大型语言模型代理常常会遇到相互关联但各不相同的任务,这些任务共享可复用的解决方案模式。然而,标准的代理强化学习将每个任务视为独立回合,而现有的技能学习方法要么聚焦于同一任务的重复尝试,要么采用包含多个阶段的流水线,将技能提取、检索与执行纠缠在一起。我们提出SkillRise,一种统一的强化学习框架,用于跨任务学习技能。SkillRise将相关实例组织成难度递增的序列,并使用单一策略在任务求解与整理一份不断演化的技能文档之间交替,该文档直接传递给下一个任务。跨任务的解耦信用分配机制,利用当前任务结果监督求解过程,并利用折现的后续任务结果监督技能整理过程。在ALFWorld、WebShop和ScienceWorld上的实验表明,SkillRise在所有比较方法中实现了最强的Pass@1性能,相比最强基线提升幅度在2.3到8.5个百分点之间。尽管是在不同任务上进行训练,其学到的整理策略在同一任务的重复尝试中仍然有效。进一步分析揭示了测试时跨任务的扩展规律:即使每个任务只尝试一次,随着相关任务序列的加长,性能也会提升。这一趋势表明,SkillRise复用跨任务的可迁移技能,而非依赖同一任务的重复采样。与此同时,SkillRise在显著降低多阶段技能学习流水线运行时开销的情况下,仍能保持强劲性能。综合来看,这些结果为大型语言模型代理提供了一种简单高效的训练范式,使其能够跨任务提取、精炼并复用可迁移技能。
编码智能体在修改现有代码库的软件工程任务上取得了显著进展,包括错误修复和功能实现。然而,从零开始构建完整程序仍然是一个重大挑战:即使在ProgramBench上评估的前沿模型,也完全解决了不到1%的任务。一个障碍是缺乏适用于这种从零开始场景的可扩展训练环境,该场景涵盖整个软件工程生命周期,因为现有的环境构建框架只专注于软件开发中的单个阶段。为填补这一空白,我们提出了MindForge,这是一个自动化管道,它将开源命令行程序转换为无源码环境,仅暴露一个编译好的参考可执行文件及其文档。利用MindForge,我们从与ProgramBench无关的代码仓库构建训练环境,并使用GLM-5.2作为教师智能体,策划了一套包含程序合成轨迹的高质量数据配方。在这些轨迹上对Qwen3.6-27B进行微调,使其在ProgramBench上的平均测试通过率从37.98%提升至49.51%,实现了与规模大得多的前沿模型相当的性能。此外,微调后的模型在所有七个未见过的软件工程基准测试上均持续优于基础模型,涵盖长时间仓库生成与翻译、错误修复、功能实现以及跨语言问题解决,在RepoZero-C2Rust上提升了31.00分,在DeepSWE上提升了14.16分,在NL2Repo-Bench上(有/无测试)提升了10.70/4.56分,在SWE-bench Verified上提升了5.04分,在SWE-bench Pro上提升了5.93分,在SWE-bench Multilingual上提升了5.22分,在FeatBench上提升了4.94分。
基于LLM的智能体在利用现有代码库提供上下文的软件工程任务中表现出色,但从头开始构建程序本质上更为困难。近期如ProgramBench等基准测试量化了这一差距:仅给定自然语言文档和仅可执行的二进制文件作为行为预言机,即便是最前沿的模型也只能解决不到1%的实例。现有框架将文档阅读、行为探索和代码合成合并为单一流程,导致智能体探索不充分、上下文偏移时行为意图丢失,以及早期误解被带入最终实现。受经典需求工程启发,我们认为行为规格获取应作为实现前的首要阶段。我们提出SpecFirst,一种两阶段框架,强制在代码合成之前进行规格获取。专用规格智能体首先探测二进制文件,将观测结果与文档结合形成结构化规格说明。随后,代码合成智能体利用该规格说明驱动实现。这种分解在编码开始前解决了文档歧义问题,并在整个合成过程中提供稳定的行为参考。我们在所有200个ProgramBench实例上对SpecFirst进行评估,涉及两个模型家族及一个数量级能力差异的四种模型。SpecFirst始终优于单循环基线方法,测试通过率提升6.9%至21.3%,二进制探索覆盖率提升9.4%至18.5%,均具有统计显著性。对代码合成的行为分析进一步表明,先行的规格说明能实现更早且更持续的结构构建。我们的结果表明,明确的需求工程阶段是一种有效的从头开始程序构建范式。
近期开发的游戏世界模型能够根据玩家的操作生成视觉逼真且可交互的环境。然而,游戏并非仅由像素定义,而是受显式机制支配——即控制生命值减少、技能激活和游戏终止等状态依赖规则。这些机制依赖于精确的内部状态(如生命值、技能槽和计时器),这些状态与视觉观测紧密耦合,决定了游戏进程的演变方式。若不对这些状态动态进行建模,现有游戏世界模型可能生成视觉上合理但违背底层游戏规则的推演序列。为此,本文提出StatePlay——一种新颖的状态感知游戏世界模型,通过联合预测视觉内容与游戏状态,促进符合机制约束的生成过程。StatePlay采用混合Transformer架构,在保留专用视觉与状态表征的同时实现跨模态交互,使预测的状态能够指导帧生成。每个分支根据其模态特性优化特定目标函数。实验表明,StatePlay在状态预测任务中平均归一化L1距离低于0.06。此外,与未显式建模状态的模型相比,本方法将生成游戏推演序列的机制保真度提升了18.6%。总体而言,本研究凸显了状态感知游戏世界建模的重要性,超越了像素级真实感的局限,推动了完整且机制忠实的游戏生成技术发展。
对爆炸性AI进展的预测,依赖于AI研究员自动化的智能体。但关于智能体能否执行开放性AI研究的证据仍然薄弱。当前评估方法要么局限于狭窄的可验证任务(此类任务排除开放性研究),要么将AI生成的论文提交给盲审同行评审——这种评审体系已不堪重负、具有随机性且评审质量低下。我们提出第三种衡量AI研发自动化进展的路径:让智能体接手某篇高质量未发表论文的核心开放性研究问题,并由该论文的原作者对其输出进行评分。我们称之为影子评估。我们针对两篇未发表的NeurIPS 2026投稿论文开展了影子评估,为前沿智能体提供六天时间及数千美元的计算资源。智能体在无人协助下完成了所有工程任务,却未能在解答研究问题方面取得实质性进展。结果,两篇论文均被作者明确拒绝。我们识别出五个反复出现的失败模式:对可发表研究成果标准的判断力薄弱、对研究设计缺陷的应对缺乏创造性、从死胡同中有效回退的能力不足、资源意识薄弱以及指令漂移。使用第二种模型与脚手架进行的稳健性检验再现了这些失败。我们公开了专家评审意见、调查问卷反馈、智能体代码仓库及运行日志。研究结果表明:当前智能体能够完成AI研究的工程部分,但在研究生命周期的关键环节仍存在重大短板。
大语言模型(LLM)智能体越来越多地被期望协助用户完成任务。然而,现有的基准测试对于评估智能体能否以合理成本完成办公套件工作流程所提供的支持有限。我们提出了OmegaUse-OfficeVal,一个用于评估LLM智能体在长期办公套件任务上的基准,该基准具备任务级经济基础。该基准包含100个任务,这些任务源自实践者提出的办公套件需求,并经过隐私保护流程调整。平均而言,每个任务需要2.32小时的人类劳动力完成。该基准的一个关键特性是每个任务都配有两个经济信号:人类劳动时间和任务价格代理。这些信号使得人类成本与LLM推理成本之间能够直接比较,并支持价值加权评估。为了确保稳定的评估,我们基于细粒度评分细则开发了基于代码的验证器。我们评估了几个前沿的LLM以及一个人工基线。尽管所有被评估的LLM在成本和速度上均显著优于人类工作者,但它们尚未达到人类级别的可交付质量。代码和数据集已完全开源,更多信息可在我们的项目网站上获取:https://omegause-officeval.github.io。
我们提出Voice Memory,这是一种仅推理方案,专为智能语音识别设计:在流式处理过程中,一个冻结的校正器读取单个领域相关的memory.md文件,并针对每个语句决定是采纳假设还是放弃并保留最优结果。与此同时,一个基于分数门控的优化器通过有限编辑异步修改该文件,仅当编辑能严格提升留存分数时才予以接受。这一架构从经典的ASR-LM框架扩展而来,我们称之为“监听-思考”架构;两个角色仅通过记忆文件耦合,因此无需改变权重,所学技能保持可审计和可移植。事实证明,约束是该循环所发现的关键操作技能:无约束的生成式错误校正(GER)会过度校正,在财经新闻中高达64%的编辑破坏了正确词元,而Voice Memory将这一比率降至35%。在十个HyPoradise领域中使用开放校正器,Voice Memory将加权词错误率从8.36%降至7.52%(增加三个上下文示例后为7.47%),且没有任何数据集的性能低于其1-best基线;改进主要集中在可恢复空间最大的领域,包括航空旅行命令(从8.40%降至3.40%)和嘈杂远场语音(CHiME-4,从12.69%降至10.46%)。记忆文件可跨校正器家族迁移,且推理路径中不增加任何参数。我们提供了演示和示例代码以供未来研究。
大多数视频编辑系统仍然缺乏显式的分层视频表示,这限制了它们进行逼真合成、对象复用和一致性操作的能力。这一局限在视频对象插入和视频层分解中尤为突出,现有方法由于缺乏显式的前景层监督,往往依赖隐式推理或逐场景优化。我们提出了TriLayer,一个大规模三元组视频数据集,包含对齐的合成视频、背景视频和前景视频,其中前景层不仅包含对象外观,还包含相关的视觉效果。这种显式监督使得模型能够直接学习分层视频表示,而非隐式推断。基于该数据集,我们提出了DBL-Diffusion,一个双分支扩散框架,通过共享去噪和跨分支交互,联合建模RGB合成图像和RGBA前景层。我们将该框架实例化为两个任务:DBL-Insert用于分层对象插入,生成显式的RGBA层以实现逼真合成和灵活后期编辑;DBL-Decompose用于视频层分解,利用三元组监督恢复前景和背景层。实验表明,显式层建模在插入逼真度和分解质量上均有显著提升。
我们介绍GPT-Red,这是一种自动化的红队智能体,专门训练用于发现针对前沿大语言模型的新型提示注入攻击。该模型的目标是评估并增强生产系统的鲁棒性。为此,我们利用它对GPT-5.6进行对抗性训练,这是迄今为止对提示注入最鲁棒的模型。为构建GPT-Red,我们设计了一种可扩展的自对弈算法,要求模型攻击一组同时训练的多样化防御者智能体。我们在逼真的红队环境中训练该模型,所使用的计算规模与部分最大的强化学习后训练运行相当,使其成为有史以来文档记录中最大的LLM安全训练项目。GPT-Red在红队测试中表现出色:它能可靠地攻破我们此前直至GPT-5.5的模型,发现比人类红队成员更多的成功攻击,并且能泛化到未见过的环境、防御者模型及工具链。未来,我们预期随着每个新GPT模型鲁棒性的提升,它将反过来为更强大的红队智能体提供更优的学习信号,从而开启自我改进的飞轮效应。
记忆已演变为大语言模型(LLM)中一个基础性的架构维度,从计算中隐含的副产品转变为一系列显式、可控的机制。尽管近期研究引入了多样化的策略——涵盖瞬态注意力、循环状态动力学、参数高效适配以及可扩展的查找存储——但这种快速演进导致了高度碎片化的研究格局。本综述提出了一种系统化的、以架构为中心的LLM记忆分类体系。我们的框架沿三个正交维度刻画记忆:表征(隐式与显式)、更新动态(离线与在线)以及持久性(短期与长期)。我们进一步形式化了决定记忆写入、路由、状态转换与整合的粒度化机制。这一统一视角阐明了计算耦合型与独立可寻址记忆之间的概念边界,有效衔接了不同架构范式。此外,我们批判性地分析了混合记忆架构、系统级效率权衡以及多维评估方法。通过将这些分散的进展整合为一个连贯框架,本综述勾勒了以记忆为中心的LLM设计的发展轨迹,并为未来可扩展与自适应语言建模的创新奠定了原理性基础。
同策略知识蒸馏将推理能力从大型教师模型迁移至紧凑学生模型,但现有方法存在三种复合失效模式:(i)冷启动崩溃——新初始化的学生模型对教师模型偏好的token赋予近乎零的概率;(ii)状态无关的散度调度——仅依赖时间步的前向/反向KL插值忽略学生模型的覆盖状态;(iii)二元奖励稀疏性——仅通过通过/失败信号丢弃部分正确轨迹中的信息。 本文提出CADENCE统一框架,针对每种失效模式提出精准修复方案。其DRIFT机制在学生采样轨迹上,对每个token构建前向KL与反向KL替代目标的凸组合(采用逐token替代目标,而非序列级KL梯度估计器)。框架包含六个扩展组件:(A)COVA——覆盖自适应β调度机制,加速前向到反向的转换;(B)FTB——分叉token增强,通过全局归一化熵参考在高熵位置集中梯度;(C)CCD——密集奖励,为错误但接近的轨迹添加数值邻近性部分正确分数;(D)LAP——简洁优先的正确轨迹强化;(E)EMR——熵匹配校准正则化器;(F)BSD——自举自蒸馏阶段。 在GSM8K和MATH-500数据集上(采用修正的512token协议,5个随机种子的标准差报告),CADENCE将0.5B参数学生模型从1.5B教师模型中蒸馏,在GSM8K pass@1指标上达到69.8%±0.5%(预训练模型为48.7%,弥补教师差距的63.2%);使用3B教师模型时达到72.1%±0.4%(弥补差距76.2%),以超过最强匹配计算量的标签基线(DRIFT+二元奖励)4.4%±0.7个百分点。所有实验在单一Apple Mac Studio(M系列芯片,64GB统一内存)上完成,表明基于原则的知识蒸馏无需数据中心级硬件即可实现强推理质量。
通用型操作策略日益采用基于大规模预训练骨干网络构建的动作分块流策略。此类动作分块以开环方式运行,因此策略无法对执行过程中抵达的感官输入做出响应,牺牲了反应性。更频繁地重新规划可恢复反应性,但感知到动作的流水线(大型骨干网络加多个去噪步骤)速度过慢:这种延迟阻碍了频繁重新规划,并使已提交的动作过时,使得此类策略难以适应动态闭环控制。我们提出 πR²,它在保留大型骨干网络、表达性多模态策略和多动作预测的同时,使这些策略具备反应性和实时性。基于扩散强制的逐位置噪声调度,πR² 贡献了两个思想。首先,它将条件输入分为快速通道(本体感觉,每帧更新)和异步更新的慢速通道(视觉-语言特征),使得策略能在动作分块内对本体感觉做出反应,同时容忍过时的视觉信息。其次,一种延迟自适应流调度将正在执行的动作视为修复条件输入,并在每次调用中以一个去噪步骤输出动作,使单一训练模型能适应不同的硬件延迟。πR² 对现有架构改动极小,可从预训练策略进行微调:将其应用于真实 xArm6+XHand 平台上的 GR00T-N1.7,其闭环重规划速度约为基础策略的4倍(在 A5000 GPU 上约25Hz),每40ms基于全新观测执行动作。在仿真和真实世界操作任务中,πR² 相比最强基线在仿真中最高提升23%的成功率,在真实世界中提升30%。项目页面:https://pi-r2-flow.github.io/
现代多智能体知识系统日益通过自主转换链而非直接检索来积累知识。现有的溯源工作记录了"发生了什么"——执行轨迹、工具调用、证据链接——而信源可靠性评估(真值发现、声誉系统)早已成熟。目前缺失的是一种可操作的框架,该框架能为论断级传输链附加分领域、分级别的传输者可信度,配备完备性语义、转换类型化的聚合机制、解耦的内容批评,以及"服务/审查/隔离"路由机制。 古典伊斯兰圣训学曾面临结构相似的问题:判定通过人际传述链传播的知识是否应当接受。历经数世纪发展,它形成了一套严谨的方法论——伊斯纳德(每条论断附带的完整传述链)、里贾勒(系统化评价每位传述人诚信度与精确度)、最弱环节链评估、通过独立链进行佐证,以及马特恩批评(独立于链质量评估内容)。本文将该方法论迁移至人工智能系统设计。 我们贡献了以下成果:圣训学概念到多智能体管线的形式化映射;实现论断链与分级传述人注册表的关系型模式;结合链评级与内容批评的决策矩阵;以及对来自真实物理教科书的20,000条论断的评估。评估验证了最弱环节隔离机制与独立链佐证的效果;报告了评级恢复循环的部分失败——未能识别出最高失误率的传述人;并指出两项分析结论不明确,包括框架无法与参考内容批评者实现匹配覆盖率的对比。论文全程明确说明了证据支持与尚未支持的论断边界。
隐蔽性——即在实现目标时不暴露自身存在、能力或已获取情报的技术——正是区分资深操作者与易被察觉者的关键。顶尖安全研究员与高级持续性威胁能在无人察觉的情况下达成目标;自主智能体正越来越多地承担相同的进攻性任务,但它们是否继承了这种战术素养?我们推出StealthBench,一个从操作安全(OPSEC)六个维度衡量自主进攻性安全智能体操作隐蔽性的基准测试。我们从真实的漏洞赏金和红队行动轨迹中提取了11个经人工验证的OPSEC事件,并将其扩展为14个Docker化任务场景。在这些场景中,智能体虽能发现真实漏洞,却在隐蔽性上出现不符合标准操作战术的失误:将凭据嵌入公开上传内容、为证明访问权限而删除生产资源、强行添加无关用户以演示竞态条件。 我们使用由三个大语言模型(LLM)组成的评审小组,通过多数投票聚合的方式评估智能体的行动轨迹,测量安全成功率(即任务完成且保持隐蔽)、隐蔽性@求解(成功求解中的战术质量)以及鲁莽求解率(任务完成但暴露行踪)。结果表明,没有任何模型的安全成功率超过54%(这一复合指标要求同时完成任务和保持隐蔽),证实了OPSEC失败在各模型家族中具有系统性。我们以公开基准测试的形式发布StealthBench,旨在支持对隐蔽性敏感的智能体开发,以及为自主进攻性安全部署提供自动化的OPSEC监控。交互式排行榜、评估框架和数据集可在https://stealthbench.com获取。
大语言模型(LLM)智能体正越来越多地被应用于实际安全运维场景中,能够访问主机工件和命令行接口(CLI),因此全面评估其安全能力至关重要。然而,现有的网络安全基准测试主要聚焦于攻击发生前的预入侵场景,即智能体处于一个干净且理想化的环境中。这导致后入侵场景的研究尚属空白。为填补这一缺失,我们提出SecRespond——首个用于评估LLM智能体在后入侵事件响应工作流中表现的基准测试。给定一个被入侵主机的取证磁盘快照,以及主机安全产品报告的安全告警、漏洞扫描和基线检查结果,智能体需要生成针对入侵行为、基线风险和漏洞风险的取证报告,并输出修复方案。我们基于10个网络靶场实例化该任务,每个靶场均来自于一个独立的被入侵云主机,涵盖4种入侵入口类型、21种ATT&CK技术和5种操作系统。我们在OpenCode智能体框架上评估了23个前沿LLM。实验结果表明,尽管当前智能体能够可靠地揭示告警暴露的问题,但在主动调查磁盘中的静默入侵行为、生成全面且经过验证的修复方案方面仍存在困难——没有哪个模型能在任何一个网络靶场上实现完全检测与修复。这揭示了构建面向实际事件响应的智能体所面临的根本性瓶颈。该基准测试公开于https://github.com/Alibaba-NLP/qqr/tree/main/data/secrespond。
现有自回归视频蒸馏方法普遍采用基于分布匹配蒸馏(DMD)的多阶段流水线。然而,这类方法通常将初始化阶段与DMD阶段解耦——二者追求不同的目标分布——并且主要通过视觉评分(如VBench)来评估中间学生模型的质量。本文从分布视角重新审视这一设计。考虑到分布匹配损失具有模式寻求特性,良好的初始化应匹配目标DMD教师的模式覆盖范围,而非仅追求高视觉质量。为此,我们引入一种分布评估协议,在共享潜在空间中测量学生分布与教师分布之间的精确度与覆盖度。该协议揭示了视觉评分无法体现的差异:部分初始化方案虽能达到高精确度但覆盖度低,导致后续优化效果欠佳;而覆盖模式的初始化方案则能保留更广泛的支持域。此外,即使目标分布一致,DMD的反向KL目标函数在训练后期仍可能驱动学生模型向高概率的教师区域收敛,从而降低覆盖度与多样性。针对这一问题,我们提出联合蒸馏方法,将DMD的模式寻求目标与基于一致性蒸馏的模式覆盖约束相结合。实验表明,本文方法在生成质量、覆盖度和多样性上均有提升;值得注意的是,即使采用Wan-1.3B DMD教师,其性能仍优于使用Wan-14B教师精调的基线模型,凸显了自回归视频蒸馏中分布对齐的重要性。