每日精选AI研究论文及翻译
我们提出语义任务完成视频生成(Semantic Task Completion Video Generation),这是一种面向结果的视频生成任务。在该设定下,任务成功既要求达成预期结果,也要求满足语义对齐。语义对齐刻画了参考图像与生成结果之间与任务相关的高层语义对应关系。评估聚焦于生成结果,既不需要呈现完整中间任务步骤序列,也不要求与参考图像保持传统意义上的外观一致性。为支持系统化评估,我们构建了 SemComp-Data,一个覆盖六个领域的评估数据集。每个样本包含一张参考图像、一条详细指令、一条简洁指令以及一段以结果为中心的视频片段。可扩展的四阶段筛选流水线将原始视频转换为标准化的 SemComp-Data 样本。我们进一步提出 SemComp-Bench,一种使用视觉语言模型(VLM)回答结构化二值问题的评估协议。SemComp-Bench 分别报告用于衡量结果达成度与生成可靠性的 OA 分数和 GR 分数。在代表性视频生成模型上的实验表明,在达成预期结果的同时保持参考图像中与任务相关的语义对齐,仍然具有挑战性。
具身智能体越来越多地被用于弥合端到端策略模型留下的差距。然而,智能体路径尚未在物理执行中实现闭环学习:现有框架在很大程度上仍是开环的,在rollout期间遵循固定技能,并且仅在一个回合结束后才进行反思。这种事后反思无法在执行过程中对其进行治理,因为物理交互要求决策以超越当今大型智能体模型的频率来跟踪快速变化的机器人-环境状态。我们提出了Zetta,一种闭环具身框架,它在保持基础策略冻结的同时,在线演化基于代码的运行时评论器和恢复技能。通过三个时间尺度分离的环路,Zetta提供了动作频率治理、rollout级评论器-恢复提案以及验证门控的技能更新。与Z-Infra(一种将智能体逻辑与异构执行资源解耦的rollout基础设施)一起,Zetta在当前rollout预算下在LIBERO-Pro和RoboCasa上取得了最先进的成功,分别达到90.8%和93.6%,推理速度提升11.1倍;成功随自我探索经验持续扩展;学习到的技能可零样本迁移,并出现了清晰的机器人“顿悟时刻”。这些结果表明,闭环框架的自我演化为可靠的物理智能开辟了一条扩展路径。
可编程逻辑控制器(PLC)运行着工业设备,而大语言模型已经能够为其生成独立的程序组织单元(POU)。然而,此类逻辑能否集成到现有PLC项目中并正确运行,此前仅在有限的测试中得到验证。我们提出了SemaPLC,一个基于项目上下文且以验证为门控的智能体框架,它由常规工具组装而成,但受严格的完成规则约束。SemaPLC并非在模型判断自身输出足够时停止,而是仅在记录在案的外部检查确认通过后才宣布任务完成。这些检查覆盖规范、编译以及在实际运行时上的行为。在与现有基准匹配的117个独立POU任务上,SemaPLC在全部七个模型上取得了最高的严格验证通过率(平均72.6%)。在包含65个任务的项目上下文赛道中,生成逻辑必须在真实项目内编译并运行,SemaPLC在集成编译、静态行为和动态行为方面均取得了最高平均值。在这三个层面中,动态行为最具揭示性。我们通过将生成逻辑和参考逻辑部署到实际PLC运行时,并比较其执行轨迹来对其进行测量。所有方法的静态得分彼此相差均在10分以内,而动态得分则将它们明显区分开来:基线方法为22.4至31.4,SemaPLC则为52.2。总体而言,我们的验证门控框架在每个层面都提升了平均值,且在运行时层面提升最为显著。执行而非静态评分,才是检验生成的控制逻辑是否真正有效的可靠标准。SemaPLC已在 https://github.com/midea-ai/SemaPLC 开源。
强化学习(RL)已成为提升语言模型及视觉-语言模型推理能力的强大方法,然而其最显著的成功仍高度依赖于真值监督(例如可验证奖励)。此类标注获取成本高昂,且随着推理能力超越人类可靠评估的范畴,其可获得性日益稀缺。自奖励强化学习通过使模型能够从自身生成结果中推导奖励信号,减少了对这类标注的依赖。然而,仅基于自生成反馈进行训练可能强化既有偏差与次优行为,降低响应多样性,并最终导致响应同质化和训练崩溃。在本工作中,我们证明无监督推理可通过协作式多智能体训练得以涌现。我们提出了Co-RL框架,其中多个不共享参数的解耦模型通过基于同伴生成的奖励进行强化学习,实现同步优化。我们进一步表明,通过异构模型系列、不同规模以及改写后的训练样本提升队列多样性,可减少驱动自我强化反馈循环的相关误差。这种多样性持续提升了推理性能,保持了行为多样性,并缓解了训练崩溃。在纯文本和多模态领域,Co-RL均持续优于基础模型及先前的无标签方法,同时达到或超越有监督方法,且无需访问任何真值标签。具体而言,Co-RL在针对LLM的七个纯文本基准上平均提升3.0%-8.6%,在针对VLM的四个多模态基准上平均提升2.3%-7.2%。代码可在https://github.com/DrStranded/Co-RL获取。
基础模型的最新进展使AI科学家能够自动化日益完整的研究工作流程,从假设生成、代码执行到论文撰写。然而,仅覆盖工作流程并不能提供科学发现所依赖的完整证据。现有系统通常基于文本、代码、标签或预计算摘要进行推理,使得具有科学决定性的空间、时间、跨通道和程序性关系无法被智能体获取。我们引入OmniScientist,一个端到端的全模态AI科学家系统,可直接基于异质原始证据开展多学科研究。一个感知层和三个自主智能体(分别负责构思、实验和撰写)在确定性流水线中协同运作,使观察能够在整个研究生命周期中塑造研究问题、实验决策和最终结论。通过在代码中执行想法检查、严谨性检查和主张检查,系统实现了新颖性筛查、统计有效性、执行溯源和数值可追溯性。我们在涵盖5个学科大类、4类科学证据以及图像、信号、音频、视频、三维结构、轨迹、表格、公式和图等多种模态的36个真实数据案例上评估了OmniScientist。该系统在所有36个案例中完成了从原始数据到编译稿全文的完整路径,并在参考推理主干下取得了6.3分的平均论文综合评分。在与仅接收预计算标量特征的盲变体的配对比较中,直接感知在所有7个评估维度上均有所提升,并在85%的成对比较判断中胜出。这些结果表明,贯穿研究生命周期的感知能力对于基于证据的科学发现至关重要,并为构建广泛能力的AI科学家提供了切实可行的路径。
持续自我提升需要不断扩充由自我生成的、多样化的、适应性强的目标池。对于语言智能体而言,现有的训练环境池(人工精心设计的、静态合成的或固定验证器生成的)会使目标分布在学习者规模扩展时保持固定不变。我们提出 SPADE(自适应合成可执行环境中的自我对弈,Self-Play in Adaptive Synthetic Executable Environments),这是一种自我对弈强化学习框架,其中单个大语言模型扮演两个角色:一个环境设计者(Environment Designer),负责将完整的、长时程训练环境编写为带有 OpenAI Gym 风格 reset()/step() 接口的可执行代码;以及一个推理智能体(Reasoning Agent),负责学习在这些环境中行动。每个环境都是有状态的多轮交互环境(包含状态转移、奖励函数和验证代码),因此同一接口既可涵盖推理问题,也可涵盖多步智能体工具使用。推理智能体的遗憾通过其在有无特权提示两种情况下奖励之差来估计;在优化这一遗憾信号的过程中,环境设计者学会将目标锁定在智能体能力边界附近,同时保持这些目标可达成。通过大量实验,我们发现若干对成功至关重要的组件:将环境设计者基于从大规模预训练语料库中采样的文档进行锚定,并为其提供累积的环境记忆。在扩展至 300 亿参数模型后,SPADE 在八个保留的数学、科学、代码和推理基准上的平均性能比最强的固定环境基线高出 +5.3;在工具使用场景中,在 BFCL-v4 多轮任务上提升 +5.7,在 ACEBench-Agent 上提升 +13.9;在游戏场景中,相对于最强基线的优势随模型规模扩大而增长。通过将环境设计本身变为可学习组件,SPADE 向开放式自我提升迈出了切实的一步。
单步逆合成是计算机辅助合成规划的核心组成部分,然而其固有的“一对多”特性在单一答案评估与基准测试协议中难以得到充分体现。为解决这一问题,我们引入Top-K提示作为一种稳健的训练与推理范式,以更好地捕捉多样化且合理的反应预测。我们构建了CREED-CCV-2+USPTO-XL,一个包含约4560万个已验证反应的超大规模数据集,用于训练C3LM(化学约束一致性语言模型)。通过将基于ChemCensor的微调与面向新颖性的奖励相结合,我们的模型在OOD URSA-expert-2026基准上取得了最先进的性能。对反应独特性的进一步分析表明,大语言模型与传统模型探索了互补的反应空间,这为基于集成的逆合成系统提供了依据。总体而言,我们的研究结果确立了Top-K、合理性感知训练作为未来基于LLM的稳健合成规划的一个实用新方向。
开放权重语言模型经常被微调、量化、剪枝和合并,但其来源往往缺乏文档记录。我们研究无数据白盒谱系验证问题:仅凭权重能否揭示两个兼容模型检查点是否共享祖先? 残差训练会在分支产物中产生共享的身份对齐分量,因此仅凭该结构无法确立谱系关系。我们移除该分量,并比较跨残差块的检查点特有结构,从而得到一种以独立检查点进行校准的对称谱系评分。在残差MLP和GPT-2基准上,该评分能够将微调、LoRA合并、剪枝和量化后代与独立模型及蒸馏模型区分开来(AUROC=1.0),从而区分权重谱系与行为相似性。在保持功能的检查点清洗实验中,权重空间基线方法或裕度下降或完全失效;而我们的评分保持不变,并且在GPT-2上比最接近的稳健基线快76倍。投影配对信号出现在六个语言模型家族及更广范围的模型中;一项案例研究正确识别了3个相关和7个不相关的LLaMA-2公开检查点。综合而言,这些结果为兼容的开放权重语言模型检查点确立了一种被动式、无数据的谱系信号。
JEPA式潜在世界模型可以使用到目标潜在状态的欧氏距离作为模型预测控制(MPC)的成本函数。然而,对任务变量的强解码并不能保证该特定成本能够依据真实任务进展对候选动作序列进行排序。我们将后一种性质称为决策度量对齐。我们引入了计划-真实斯皮尔曼系数(Plan-Real Spearman),用于衡量随机计划上潜在排序与真实排序的一致性,以及CEM阶段斯皮尔曼系数(CEM-stage Spearman),用于衡量当交叉熵方法(CEM)搜索集中其提议分布时二者的排序一致性。我们分析了潜在距离保持真实成本排序的充分条件,识别出编码器失真、终端展开误差和候选裕度是控制量。在观测到的经验对齐差距的指导下,DA-LeWM在LeWM的基础上增加了逆动力学和演示条件化目标-动作头。在所有实验中,DA-LeWM相较于LeWM加速了收敛并取得了更高的在线成功率,同时探针得分保持相近。这些结果表明,动作条件化目标改善了基于欧氏成本、CEM的潜在MPC所使用的几何结构。
循环语言模型在推理基准上展现出令人瞩目的结果,但其在智能体工具使用方面的潜力尚未得到充分探索。我们在组合式工具调用的场景中研究该问题——在此类场景中,模型需要协调多个API调用、维护中间状态,并保持工具交互之间的依赖关系。我们在API-Bank、BFCL和NESTful上评估了原生与改造型循环语言模型,在匹配的监督微调设置下比较了循环和非循环模型,并考察了推理时不同循环深度的影响。受控实验表明,循环计算通常有助于组合式和依赖感知的工具使用,而对孤立API调用的提升较小且更依赖模型本身。多步工具使用的准确率总体上随循环深度增加而提高;然而,自适应推理通过仅在必要时分配额外计算,实现了更优的计算-性能权衡。我们的结果表明,循环语言模型是智能体系统的一种有前景的架构,尤其适用于需要可靠规划、协调与执行组合式工具使用工作流的场景。
热门事实在预训练期间会被记忆得更深,并且比罕见事实更难被移除,然而现有的大语言模型遗忘方法无论训练数据频率如何,都会施加均匀的梯度压力。我们提出了 AdaPop(自适应流行度)方法,该方法将局部 token 置信度与由外部代理(例如 Wikidata 站点链接、LLM 作为裁判)导出的逐事实流行度相关指数相结合,并通过一个对偶上升控制器在每个 epoch 调整保留惩罚,从而自动平衡遗忘与保留。在三个模型家族和两个基准上,AdaPop 在释义查询下泄露的遗忘内容约为竞争方法的 1/5,在对抗性改写下约为竞争方法的 1/1.6。我们使用内部指标来支持这一分析:在我们的方法下,遗忘集的隐藏状态相比其他方法更远离遗忘前模型的状态,而保留集的表示仍与遗忘前模型的表示保持接近。
面向大语言模型(LLM)的高质量创意写作数据仍主要以故事为中心,这限制了模型遵循多样化创意格式的结构与功能惯例的能力。我们提出了一种属性引导的体裁扩展框架,用于将创意写作数据扩展到故事生成之外。通过将主题广度与体裁形式控制相分离,该框架利用人工撰写的故事提示作为多样化的创意种子,同时借助人工整理的体裁属性来强制落实独特的结构、风格和格式规范。我们将这些要素结合起来,提示强大的大语言模型生成符合体裁的查询-响应对,并对其进行质量过滤。应用该框架,我们构建了多体裁集合(Multi-Genre Collection),这是一个包含5万个样本、涵盖13种创意体裁的语料库,包括故事、说唱、歌词、剧本、游戏设计、角色设计及其他创意格式。在分布外写作基准和留出体裁诊断上的实验表明,基于我们数据微调的模型不仅持续超越基础模型和写作专用基线,还超越了在现有写作语料库上训练的模型。体裁数量消融实验进一步表明,受控的体裁扩展——而非仅以故事为中心的数据扩展——是获得稳健创意写作能力的关键驱动因素。
语言模型智能体如今已能可靠地执行有界任务。然而,它们能否在长时间跨度内维持有效决策——其间行动会带来累积性后果,环境也会对它们的选择作出响应——在很大程度上仍未得到衡量。FM-Bench(足球管理基准)正是为此而设:一个LLM智能体通过26个工具以及约340至400个决策节点,在游戏中经营一家足球俱乐部长达20年。它以与所有竞争对手相同的预算组建阵容、交易球员、谈判合同、投资设施与青训、排定出场阵容,并向一个可以解雇它的董事会负责;与此同时,一个确定性引擎将每一年的表现累积为唯一的最终得分,无需LLM裁判或人工评分员参与。单模型赛道让15个前沿模型各自面对一个冻结的脚本化世界进行对局;Arena则将这些相同模型外加一个脚本化锚点模型置于同一个共享的20年世界中——据我们所知,这是该规模下首次进行的同场正面交锋式评估。我们衡量了得分背后的六种行为能力。在三个随机种子下,全部15个模型均完成了每一段完整历程,而盲脚本基线在大多数对应历程中出局;claude-fable-5在平均得分上位居单模型赛道榜首,并同样在Arena中胜出——不过Arena的冠军头衔会在十个模型之间轮换。模型规模、价格与供应商均无法预测最终排序;排序要到历程后期才尘埃落定,而首次游玩的人类最佳选手也仅能排在模型排行榜的末尾。将各个模型区分开来的并非计算能力,而是管理行为:得分较高的模型会在接近结束时减少迟效投资,让资金保持运转而非闲置,并远在截止期限之前就开启续约;而token消耗量则无法预测任何结果。没有模型能从数百次被拒的报价中学到市场的隐藏价格;自管理记忆则呈现出两种相反的失败模式——要么是一个只增不减的档案,要么是一份每个赛季都被重写的计划。代码可在 https://github.com/Analogy-AI/fm-bench 获取。
物理交互质量是可变形物体操作的核心,然而大多数基准仅评估任务是否成功。策略可能在完成任务的同时发生滑动或造成过度压缩。一个主要瓶颈是缺乏视觉-触觉数据集,这类数据集需在完整任务中将策略可见的接触观测与独立的物理真值配对。我们提出SoftVTBench,一个面向物理交互感知的可变形物体操作的视觉-触觉数据集,包含4,000条专家示范和50多个资源,涵盖体积可变形物体及视觉匹配的刚性孪生体。以20Hz频率,每个回合同步多视角RGB、双指触觉RGB和标记运动、本体感觉、语言、二值和连续夹爪动作,以及仅供评估器使用的有限元(FEM)状态。在此数据集基础上,我们建立了一个闭环基准,利用固定的物体特定校准来定义变形感知成功率(DSR),该指标仅当轨迹完成任务且峰值归一化变形保持在容差范围内时才判定为成功。在Diffusion Policy、π₀.₅和FastWAM中,所有12种分布内配置均包含违反变形容差的成功轨迹,占各配置成功轨迹数的0.7%至24%。在分布偏移下,视觉-触觉变体在所有六项策略—套件比较中取得更高的任务成功率,在五项中取得更高的DSR,而其分布内收益则优劣参半。这些结果表明,仅提供触觉并不能确保有效的多模态融合。因此,SoftVTBench提供了一个通用的视觉-触觉资源,不仅用于研究策略是否成功,还用于研究策略如何与可变形物体进行物理交互,以及触觉何时能改善这种交互。
语言特定能力(LSC)是指语言模型根据提示所用语言的不同而表现出更好或更差性能的现象。换言之,当使用不同语言提示相同的语义查询时,语言模型会输出不同(且可能不正确)的响应。先前工作将其归因于跨语言语义表征的内部错位。目前,文献中解决LSC的主要方法有两种:(1)将所有查询路由到英语,从而提升性能,但将语言表达能力限制为英语;(2)在语言平衡数据上训练,使模型性能在各语言间均衡,但会降低整体性能。在本工作中,我们采取以数据为中心的视角,引入了HOTFIXR:面向提升跨语言推理的难度优化训练数据生成框架。该框架利用模型探测并学习学生模型的多语言弱点,并生成数据以缓解这些弱点。HOTFIXR能够生成多语言合成训练数据,从而提升多语言性能。我们在三个分布内任务、三个分布外任务和四种分布外语言上进行了评估。平均而言,HOTFIXR(1)将分布内性能提升6.2%;(2)在分布外任务上将微调引发的灾难性遗忘降低3.7%;(3)在分布外语言上将灾难性遗忘降低7.1%。总体而言,由于许多现实世界应用需要多语言LLM,我们的工作为提升LLM的多语言熟练度做出了贡献。我们将于论文被接收后发布代码。
基于大语言模型的智能体可以代表用户访问云服务、调用工具或调用其他智能体。在会话开始时,智能体的权限被设定但保持静态,每个请求被独立评估,不考虑先前的操作。在其权限范围内,智能体可能违背委派任务行事,将单独允许的操作组合成被禁止的结果,或在未加限制的情况下将权限委派给子智能体。只有当智能体拥有执行此类操作的权限时,提示注入才会构成风险;因此,这不仅是模型问题,更是授权架构问题。智能体主体链(APC)追踪从一个主体到下一个主体的权限委派。APC使用六项授权检查,根据累积的会话状态评估每个请求。APC延续并约束委派的范围和预算。通过组合闭包,APC将请求与先前的操作进行对比检查,以防止被禁止的组合,并在模型之外强制执行决策。我们证明了APC实现的爆炸半径单调性和组合健全性;组合健全性仅限于在完整限制集和串行准入条件下的被禁止组合。我们评估了包括InjecAgent、AgentDojo和ASB在内的3,154个实例。我们的模型受损评估通过在第一次合法工具调用后插入真实攻击调用,独立于模型行为测试APC。在全部四个领域中,AgentDojo的数据外泄率从75-100%降至0%;APC阻止了所有544个InjecAgent数据窃取案例。意图绑定将破坏行为从38.6%降至4.0%,将操纵行为从90.5%降至12.1%。在空闲主机上,授权延迟在第99百分位为0.24毫秒;在949对AgentDojo任务-注入组合中,两种设置下的效用分别降低了8.6和13.9个百分点。实现代码、评估工具和数据均已公开提供。
智能体框架日益将程序性知识封装为技能:智能体按需读取的指令文件,而公共库中现已存储数千个此类技能。因此,读取哪个技能成为策略在回合中途自行做出的决策,然而目前没有任何现有信号训练这一决策。我们证明,默认的补救方案——在候选技能列表上进行结果奖励强化学习——无法教会该决策,其原因是一种结构性缺陷,我们将其识别并命名为“选择器信用匮乏”:在广播式的序列级优势下,命名所选技能的少数词元只承担趋近于零的损失份额,并且随着轨迹变长,它们继承的信用越发趋向错误符号。只要该选择之后的执行失败,即使这一选择本身是轨迹中最有价值的决策之一,它也会受到惩罚。对一次完整运行自身的训练产物进行审计,证实了上述三个性质,且每个性质都随轨迹长度单调恶化。SkillGate 从构造上消除了这一失效:它将词元支撑集划分为两个不相交的信用通道——结果信用只到达执行词元,而独立的动作局部优势恰好到达命名技能的词元,并且仅当轨迹中唯一一次读取是正确时才为正。在五个智能体基准测试中,面对16个候选技能的列表,SkillGate 将 9B 参数策略的试验成功率从 40.8% 提升至 53.2%,远超将相同预算仅用于结果奖励的效果,同时将暴露于误导性候选的比例削减三分之二,且读取的技能更少。
音乐编辑在现代音乐制作中发挥着至关重要的作用,其应用涵盖电影、广播和游戏开发等领域。近年来,音乐编辑系统的进展使得多样化的编辑任务成为可能,例如音色转移、乐器替换以及风格转换。然而,许多现有工作忽视了评估它们在编辑过程中保持不应改变的乐音层面的能力,我们将这一能力定义为音乐上下文保持(MuseCP)。尽管部分研究确实考虑了MuseCP,但其评估方案和指标尚不够全面。为此,我们提出了首个MuseCP评估框架——MuseCPEval,该框架涵盖四类音乐层面,并采用细粒度且针对性设计的指标来捕捉音乐属性的细微变化。客观验证和人类研究证明了这些指标的有效性。此外,对不同音乐编辑系统的案例研究展示了这些指标作为测试平台和诊断工具的实际效用,为现有系统的优势与局限提供了深刻洞见。我们希望所提出的指标和发现能为开发兼具强大MuseCP能力的更有效且可靠的音乐编辑策略提供实践指导。
激光雷达场景补全是自动驾驶中三维感知的关键组成部分,场景必须实时补全才能用于下游任务。现有方法通常遵循“初始化-细化”范式,即首先构建场景的粗初始化,再细化为完整的三维几何。生成模型速度较慢,因为它们需将随机高斯噪声迭代细化为场景;而非生成方法则以固定噪声尺度扰动部分场景,这限制了对大间隙和遮挡区域的覆盖,并且针对每种新传感器配置都需要手动重新校准。我们提出RapidLiDAR,一种将初始化本身作为学习得到的、数据驱动组件的激光雷达场景补全方法。我们提出自适应初始化模块,为每个部分输入点预测空间变化的位移,将部分观测扩展为适应局部几何的粗场景初始化,无需手动调整噪声。为了将该粗初始化细化为完整且连贯的场景,我们进一步提出多尺度重建模块,通过查询由输入扫描构建的多尺度三维体素和二维鸟瞰图(BEV)特征图来进一步细化点位置。通过用基于体素和BEV的特征提取替代最远点采样和K近邻搜索等点邻域算子,我们的架构速度更快,并且从设计上即可处理不同的输入分辨率。在SemanticKITTI和KITTI-360上的实验表明,我们的方法在补全性能上与最先进方法持平,同时可在0.1秒内完成整个场景,比此前最快方法快2.3倍。这与典型车载激光雷达传感器10 Hz的采集频率相匹配,向实时激光雷达场景补全迈出了一步。
词元级幻觉检测器基于单一信号独立地对每个词元打分,因此在生成模型自信地出错时恰恰会失效。本文转而将幻觉视为时间上延展的片段,并通过序列标注来检测它:每个词元的评分来自一个33维特征流,该特征流融合了文本统计量、自然语言推理(NLI)蕴含关系以及语言模型惊异度,且无法访问模型内部信息。基于这些特征的双向门控循环单元(BiGRU)在RAGTruth上达到0.840的AUC(10个随机种子),比独立的逻辑回归基线提升11个百分点(p = 0.002,Wilcoxon符号秩检验)。受控分解表明,大部分增益来自时间顺序而非模型容量:证据在片段内从置信位置传播到模糊的邻近位置。相同的0.845上限在循环、状态空间(Mamba)和注意力架构中反复出现,这表明瓶颈在于特征集而非模型。由于检测器只读取生成的文本和外部信号,它适用于闭源模型,并且对于训练时从未见过的语言模型生成的文本仍然有效,AUC损失低于4%。
目标检测器常常对其训练类别之外的目标产生过度自信的预测,从而导致所谓的分布外(OoD)幻觉。现有的检测或缓解这类幻觉的方法通常要么直接在习得的目标检测器表示上构建评分函数,要么修改目标检测器本身以抑制幻觉的产生。然而,这些表示中隐式编码的潜在先验在很大程度上仍未得到探索,也尚未被显式解码用于OoD检测。为了揭示并利用这些潜在先验,我们提出了结构化先验知识(SPK),一种面向幻觉的框架,能够从预训练目标检测器中显式地引出与OoD相关的先验。具体而言,SPK利用分布内数据和诱发幻觉的样本作为诊断性监督,以引出支撑目标检测器决策的部件级语义概念,而非仅仅将其用于拒绝或目标检测器适配。所引出的语义先验进一步与几何先验和上下文先验相结合,形成一种用于OoD检测的紧凑五维SPK表示。在多种目标检测器架构和多个OoD基准上的大量实验表明,SPK实现了最先进的OoD检测性能。我们的研究结果揭示,预训练目标检测器已经编码了远比通常用于OoD检测所利用的知识更丰富的潜在知识。更重要的是,这些知识可以被显式地引出,并组织成一个紧凑、结构化且可解释的知识空间,用于预测可靠性分析。这为通过显式揭示并利用潜在先验来提高目标检测器可靠性提供了一条有前景的主动路径。代码和数据可在以下网址获取:https://gricad-gitlab.univ-grenoble-alpes.fr/dnn-safety/spk