每日精选AI研究论文及翻译
基于可验证奖励的强化学习(RLVR)通过支持大规模优化,推动了面向推理的大语言模型(LLM)的近期进展。然而,其适用范围仍主要局限于数学和编程等领域,在这些领域中可以确定性验证正确性。开放式任务则通常依赖人类偏好、奖励模型或基于LLM的评判者,这引入了评估偏差、评判者能力瓶颈以及额外的推理成本。 借鉴自监督学习通过构造前置任务从数据本身获取监督信号的原理,我们提出基于自可验证奖励的强化学习(RLSVR),一种基于任务变换的训练范式,旨在将RLVR扩展到开放式任务。RLSVR将开放式任务转化为可验证的代理环境,其内部规则和交互结果自动生成奖励信号。我们以SpyRL实例化RLSVR,这是一种受《谁是卧底》启发的多智能体自博弈环境。智能体接收非对称信息,完成相同的目标任务,并通过投票识别指定的卧底。由于卧底身份是预先确定的,投票结果提供完全可验证的奖励,而成功识别与输出质量密切相关。在文本摘要、创意写作和数学推理上的实验表明,SpyRL在不可验证任务上优于现有自我改进方法,并在可验证推理任务上取得一致的提升。这些结果表明,任务变换可以将基于可验证RLVR的自我改进扩展到固有可验证领域之外。模型和代码已在 https://github.com/wangqinsi1/SpyRL 发布。
世界模型为规划和行动提供了预测性基础,然而现有公式仅仅回答了一个物理问题:事物是什么/在哪里,以及它将如何演化。然而,人类行为是由隐藏的心智状态(一个人相信什么、想要什么、意图做什么、感受什么,以及认为什么在社会层面是可被允许的)所驱动的,因此,一个跟踪物理场景但不跟踪每个智能体对其所知和所信的模型,会为看似正确的场景预测出错误的行动。我们提出了心智世界建模(MWM),这是一个通用的理论框架,将心智变量作为世界模型的核心组成部分,而非事后的解释理由:MWM 维持一个耦合的物理-心智世界状态,渲染目标特定的部分观察,并模拟候选行动如何联合更新这两个组成部分。我们在 MENTIS 中实例化了该框架,这是一个免训练且完全可检查的基线,它将过程分解为状态解析、目标观察生成、行动分解、耦合的物理与心智转移,以及分支级价值评估。在一个手工构建、质量控制的情境化决策场景数据集上(涵盖文本、图像和有声视频故事),使用 8 个基于现代大语言模型的世界模型进行的实验表明,显式建模心智状态对于预测人类决策至关重要。更深入的分析进一步揭示了当前心智世界建模的瓶颈。我们期望 MWM 成为世界建模的下一个阶段,从模拟物理场景转向模拟在其中行动的智能体的心智。
我们提出N_0-VTLA,一个视觉-触觉-语言-动作(VTLA)基础模型,能够实现:(1)具备触觉感知与触觉反馈控制的细粒度接触丰富操作;(2)利用已部署数据进行离线策略改进。在现有基于视觉的主干网络基础上,我们提出了一种触觉集成训练方案,包括视觉-触觉预训练、分阶段触觉通路集成和基于优势条件的离线策略改进。在预训练阶段,策略从NeoData(我们的大规模视觉-触觉机器人数据集)中学习广泛的接触先验;据我们所知,N_0-VTLA是首个在大规模触觉数据上预训练的VTLA模型。在后训练阶段,我们为策略添加一条预测性触觉通路,将在规模数据上学到的接触模式提炼为下游以触觉为中心的操作所需的精细动作调整。对于离线策略改进,我们提出了ALTER,一种基于优势条件的离线强化学习方法,它将相对进度与轨迹事件对比转换为二值优势标签,用于在固定部署语料库上进行策略训练,从而进一步提升接触丰富技能(如可变形物体操作)中的特定任务学习。在接触丰富基准测试中,N_0-VTLA以显著优势超越强基线:它赢得了NeoReal全部九项真实机器人任务,并在包含二十项任务的仿真套件上达到63.8%的平均成功率,而最强基线仅为44.0%。使用ALTER训练的N_0-VTLA策略在三个长时程真实机器人任务上达到75%至95%的成功率。这些结果为通用的触觉驱动操作策略奠定了基础。
多边形网格是现代三维管线中的标准表面表示方法,生成具有艺术家风格拓扑的高质量网格对于影视、游戏和交互式三维应用至关重要。主流方法将网格序列化为令牌序列并以自回归方式解码,这种方案推理速度慢且对误差累积敏感,难以满足交互式资产创建的实际需求。我们提出Meshy T2,一个基于流匹配构建的快速原生网格生成框架。其核心是顶点集网格变分自编码器(VAE),它将网格编码为每个顶点一个连续潜变量令牌,并一次性解码顶点、边连接关系和面缠绕顺序,在无需顶点量化或焊接的情况下保持高精度几何和艺术家创作的拓扑结构。生成过程采用由粗到精的两级流匹配级联:首先,图像条件体素流将整体形状勾勒为粗占用骨架;随后,网格流以图像、骨架及所请求的顶点预算为条件,用逐顶点潜变量令牌填充骨架。该设计实现了三项实用能力:通过并行的基于流合成实现交互式生成速度;通过所请求的顶点预算实现有效的面数控制;以及对多部件资产的天然支持,各部件直接由生成的连接关系涌现。在实验中,Meshy T2达到了最先进的几何保真度,并在中位数6秒内完成端到端的图像到网格生成,比自回归基线快一个数量级以上。代码和权重将在 https://github.com/meshy-dev/meshy-t2 上提供。
系统提示词是由开发者配置的指令,用于规范AI应用中基础模型的行为。它们被广泛应用于商业AI产品,却很少向公众或监管机构披露,这导致AI系统的大规模部署存在严重的信任与问责缺口。本文提出了人工智能系统提示词保障(AISPA)——一个以用户为中心的框架,用于系统性地审计AI系统中的系统提示词。AISPA对系统提示词的具体组成部分进行审查,并沿八个对用户至关重要的维度对其进行评估。我们随后运用该框架对88个商业AI产品中系统提示词的3,249条指令进行了审查,将每条指令分类为保护性(保护用户)或问题性。我们的审计揭示了四项核心发现。第一,系统提示词的设计在不同产品和开发者之间存在显著差异,部分组织平均每个产品包含超过60条保护性指令,而其他组织平均不足5条。第二,保护性指令得到广泛采用但覆盖深度不足:98.9%的产品至少包含一条保护性指令,但仅有24%的产品涵盖AISPA分类体系的全部八个维度。第三,系统提示词的长度和对用户的保护性持续增长,表明用户保护正成为商业提示词设计中日益受关注的问题。第四,尽管取得了上述进展,问题性指令仍然普遍存在:约40%的产品至少包含一条违背用户利益的指令,且保护性与问题性指令常常共存于同一提示词中。我们的研究结果表明,商业AI产品中的系统提示词亟需更高的透明度、标准化水平以及独立的监督机制。
我们提出 N_0-TWAM,一种用于接触密集型操作的触觉原生世界-动作模型,可同时预测未来的视觉与未来的接触。据我们所知,这是首个大规模训练的触觉世界-动作模型,并在接触密集型任务上展现出强大能力。我们利用视觉-触觉联合训练,在覆盖六种机器人本体和 450 个任务的触觉丰富演示上对 N_0-TWAM 进行大规模预训练。我们采用 NeoForce——一种统一的基于力的触觉表示——来形成物理上有依据的接触信号,从而对动作生成进行条件约束。为改善长时程、多阶段操作,我们引入触觉接触事件来进行任务阶段划分,并在执行过程中推进这些事件。为实现实时效率,我们采用非对称的 Mixture-of-Transformers 架构,将全宽度专家用于视频预测,同时以精简专家用于下游的动作和触觉预测。对真实与仿真基准的评估验证了 N_0-TWAM 在多种接触密集型任务上的能力,并展示了数据规模扩展对精确触觉和动作预测的益处。综上,N_0-TWAM 赋予世界-动作模型以预见视觉、触觉和动作的预测能力,为开放式接触密集型任务中的细粒度操作奠定坚实基础。代码库和模型检查点将公开发布,以促进触觉赋能机器人操作的进一步研究与发展。
潜在世界模型通过在紧凑的表征空间中预测未来状态来实现高效规划,但其性能关键取决于所学潜变量分布的质量。LeWorldModel(LeWM)利用Epps-Pulley(EP)目标将其潜变量正则化为各向同性高斯分布。我们表明,EP的修正梯度对于孤立的尾部样本会迅速消失,导致重尾偏差得不到充分控制。为解决这一局限性,我们提出QQWorld,用分位数-分位数匹配目标替代EP,直接将对齐后的投影潜变量样本与秩匹配的高斯分位数进行匹配,从而在尾部保持有效的修正梯度。我们进一步开发了跨批次QQ方法,利用先前批次的分离样本扩大有效排序池,并刻画了其偏差-方差权衡。在四个控制环境中,QQWorld有效提升了LeWM的平均规划成功率,同时持续获得更好的高斯对齐和更薄的潜变量尾部。
我们研究了视觉生成中文本条件的经验缩放性质。此类性质很少被测量,因为扩散损失并不随自然语言提示中的词元数量而缩放。令人惊讶的是,我们发现收敛的扩散损失与提示中结构化语言的数量呈缩放关系。为了量化结构化语言,我们采用了两种互补的度量:白盒似然度量(GPG)和黑盒属性度量(ED)。在受控的训练运行中,收敛的扩散损失随GPG近似线性下降,并随ED呈幂律关系。在这些缩放性质的指导下,我们通过构建带有从图像中提取的语义和几何注释的结构化提示来提高可扩散性,并通过监督微调、冷启动和验证器门控的同策略蒸馏来训练提示器,从而提高可提示性。所得到的系统在几乎所有的组合、推理和世界知识基准上均优于所有评估过的开放权重模型,同时在大多数评估中达到或超越最强的封闭权重模型。
具有可验证奖励的强化学习(RLVR)将单一的响应级奖励广播给每个词元,而同策略蒸馏(OPD)则针对每个词元与更强教师模型进行对比,以提供密集优势,但其性能上限受限于教师模型质量,并且会抑制超出该上限的探索。两者的互补性使得结合RLVR与OPD颇具前景,但我们发现,以固定系数融合这两种优势会因两种校准误差而引发熵崩溃:其一是数值量级不匹配,即词元级OPD优势可能激增至远超有界RLVR优势,从而湮没后者的信号;其二是时间维度不匹配,即持续全强度的OPD会不断将学生模型拉向教师模型,限制了超越教师模型所需的探索。为此,我们提出SAF(稳定优势融合)框架,通过一个轻量级、四阶段流水线仅对OPD优势进行处理,即可同时解决上述两个问题:采用“先稀疏化后压缩”机制进行数值量级控制,并搭配“先预热后退火”机制进行时间维度控制,其中每个阶段均可独立开关,且额外开销可忽略不计。我们以GRPO实例化RLVR,在Qwen3-1.7B/4B/8B上跨七个数学推理与代码生成基准对SAF进行评估:SAF避免了熵崩溃,并且在所有六种“模型—领域”设定中均一致优于固定系数GRPO+OPD融合方法,综合得分提升0.51%—2.70%,同时训练过程更加稳定。
AI辅助编程日益将非正式的用户意图转化为可执行软件,然而编程请求中往往包含以用户特定方式在不同任务和会话间反复出现的歧义。现有消歧方法通常在当前编程会话中孤立地处理每个歧义请求,往往通过引出额外的澄清来实现。然而,来自同一用户的已解决会话历史是否可以作为记忆,用于在新开启的会话中解决反复出现的个性化歧义,这一方向仍未得到充分探索。我们将个性化歧义适应定义为一个新任务:给定用户先前已解决的编程会话和一个新的歧义请求,助手应当识别反复出现的歧义模式,生成预期的可执行解决方案,并尽量减少澄清次数。为对该任务进行基准测试,我们引入了CAPA,它通过六种机制刻画个性化编程歧义,并使用受控的三阶段生成流水线将这些机制注入到无歧义的可执行任务中。CAPA包含60个均衡的用户-歧义组合单元下的600个编程会话,其中包括300个留出的评估会话。我们在无历史和同用户历史两种条件下,使用可执行成功率、首轮成功率和完成所需轮次三个指标评估了12个近期大语言模型。我们的分析考察了任务难度、用户身份和基于记忆的历史使用情况,并进一步提出同用户历史门控作为一种轻量级推理时方法。CAPA为开发长期编程助手奠定了基础,使其能够更好地将生成代码与用户意图对齐,同时减少重复澄清。
基于评分标准的强化学习近期在提升大语言模型处理开放式任务方面展现出良好前景。该范式一个广为人知的局限性在于探索不足:任何轨迹都未能满足的标准(Unexplored Criteria, UC)无法获得优化信号。近期方法通过在轨迹生成过程中引入评分标准信息作为外部引导来解决这一问题,但由此引入了训练-推理不一致:策略是在外部引导下生成的轨迹上进行优化的,而在推理阶段该引导并不存在,从而导致自回归解码过程中的误差累积。此外,这些以探索为导向的方法忽视了一种根本不同的失败模式,我们将其称为被抑制标准(Suppressed Criteria, SC)——即某些轨迹满足该标准,但其学习信号在优化过程中丢失,因为标量奖励聚合赋予了它们非正的聚合优势。我们的分析表明,SC现象极为普遍:在整个训练过程中,超过57%的样本表现出这种失败模式,平均每个样本存在1.8个SC。为了在不引入训练-推理不一致的前提下同时解决UC和SC问题,我们提出了标准蒸馏策略优化(Criterion-Distilled Policy Optimization, CriPO),该方法通过在线策略自蒸馏来增强基于评分标准的强化学习。针对UC,CriPO构建了一个标准注入式自教师模型,并计算局部前向KL散度损失,以将缺失行为注入策略。针对SC,CriPO采用反事实自教师模型,在负优势轨迹中定位与标准相关的词元,并将其词元级优势翻转为正值,从而保留原本会被抑制的有用模式。在医学和科学基准上的实验表明,CriPO始终优于基于评分标准的强化学习,并且仅需约二分之一的优化步数即可实现更强的最终性能。
企业工作流日益依赖智能体进行模式引导的抽取:给定一个文档和用户定义的模式,智能体忠实地遵循该模式,生成正确的输出,并以源证据作为溯源元数据。我们提出了 ExtractBench,一个用于模式引导抽取的基准;据我们所知,这是首个同时评估值准确性、大规模记录完整性、溯源性和实测成本的基准。该评估数据集包含 4,869 页,涵盖 370 份企业文档、8 个业务领域和 67 种文档类型,并带有清晰标签以区分各自面临的挑战场景。可扩展的模式与真值整理流程融合了真实文档的独立系统一致性、合成列表的已知值以及表单的人工验证。我们采用顺序不敏感的值 F1 来评估值准确性,并采用两个溯源指标(词级 F1 和页面级 F1)来评估源可追溯性。商用视觉语言模型在短文档上表现良好,但在长文档上经常截断记录列表;而编程智能体则以高得多的成本保持了更高的准确性。LlamaExtract Agentic Plus 在所有三项指标上均排名第一,其准确性与编程智能体相当,而成本仅为后者的一小部分。数据集和评估代码可在 https://huggingface.co/datasets/llamaindex/ExtractBench{HuggingFace} 和 https://github.com/run-llama/ExtractBench{GitHub} 获取。
尽管近年来的图像编辑模型取得了快速进展,多参考编辑仍然具有挑战性,尤其是在跨参考保持视觉一致性以及确保整体视觉和谐方面。强化学习已被证明对文本到图像生成和单图像编辑非常有效,但其向多参考编辑的扩展受到缺乏能捕捉多图像关系约束的合适奖励模型的阻碍。此外,直接将多模态大语言模型(MLLMs)用作零样本评估器,面临易产生幻觉的长文推理与推理能力有限的简短判断之间的关键矛盾。针对这些问题,我们提出多维评估-验证奖励(EVR)。EVR将评估分解为不同的视觉标准;对于每个标准,MLLM评估器生成多个候选假设,验证器以具体视觉证据为据核实每项声明并决定接受或拒绝,从而产生可靠且细粒度的奖励信号。结合可扩展的数据流水线,我们的方法无需改动架构即可对现成编辑器进行强化学习微调。大量实验表明,与基础Qwen-Image-Edit相比,我们的方法取得了显著提升,一致性和和谐性达到或超越了NanoBanana。
在我们所处的物理世界中,空间和时间本质上是连续的。然而,现有的世界建模机器学习范式大多局限于离散时间预测,因此在捕捉物理世界动态方面表现出显著的低效。我们引入了物理时间流(PT-Flow),一种学习在物理时间中运行的连续潜在速度场的新方法。关键在于,序列数据的底层动态由一个嵌入在结构化良好的表示空间中的常微分方程(ODE)进行参数化。在该范式下,未来预测可以被重新表述为在压缩潜在空间中通过ODE求解器进行时间积分。基于PT-Flow,我们构建了ODEWorld,一种既高效又通用的连续时间潜在世界模型。通过提取时变特征并在动态表示空间和潜在速度场上强制执行ODE属性,ODEWorld有效解决了潜在世界模型文献中长期存在的表示坍缩问题。这也使得即使在长时域预测之后也能实现高质量的图像重建。此外,其连续性允许任意时间分辨率甚至反向预测,这对于大多数离散时间模型来说是不可能的。最后,ODEWorld可以提供丰富的面向规划的信息,以促进下游策略学习。综合实验表明,ODEWorld成功地将利于规划的动力学抽象与视觉真实性相协调,在视频生成和机器人控制方面均表现出色。https://dstate.github.io/odeworld_website/{项目网站}。
网络越来越多地由AI智能体而非人类访问。每个智能体都需要知识,尤其是在生命科学领域,智能体流水线正快速增长。获取文献是满足这一需求的关键部分,Europe PMC等资源拥有超过4000万条索引记录,被广泛用于此目的。然而,这些资源并非为AI智能体而构建:它们接收关键词和复杂语法,并返回整篇论文,因此每个智能体都必须学习其语法、进行多次搜索并阅读全文,才能找到所需证据。我们推出了EMBL AI Librarian,这是一个知识层,将Europe PMC接口升级为面向AI智能体:智能体用自然语言提问,即可获得回答该问题的证据。单个LLM编排整个知识检索过程:它规划由实时Europe PMC搜索引擎执行的互补子查询,然后阅读选定的论文并定位相关证据。我们在四个基准上评估了Librarian:文献综合、声明验证、开放域问答,以及下游生物学任务(如实验方案问题和序列操作)。在ScholarQABench上,Librarian的引用F1比近期发布的强基线提高了超过16个百分点。作为现有声明验证流水线的检索层使用时,它提高了与专家共识的一致性;在开放式LitQA2基准上,GPT-5.4智能体基于Librarian时比使用网络搜索得分高出约8个百分点。总体而言,我们的结果表明,为生命科学智能体配备Librarian知识层可提高一系列任务的性能。我们在https://github.com/petroni-lab/librarian公开发布代码。
尽管视觉-语言-动作(VLA)模型赋予了令人印象深刻的视觉运动能力,但它们在具有挑战性和域外任务上的性能常常会下降。近期的测试时调控和缩放方法无需大量数据收集和重新训练即可提升性能,但动作样本往往仍集中在相似行为附近,因此继承了相关的失败模式。此外,现有方法在每个时间步都采用相同的干预策略,而不考虑基础策略是否已经可能成功。为了解决这些局限性,我们提出了RL^2,一种利用VLA潜变量上的强化学习的自适应推理时调控框架。首先,我们训练一个轻量级离线强化学习策略,该策略以从VLA动作专家中提取的表达性潜变量为条件,并在推理时将其流速度与冻结的VLA的流速度进行组合。这种组合式调控策略将大规模模仿学习的行为先验与离线强化学习在主导示范模式之外引发的动作多样性相结合。我们进一步发现,推理时调控在成功和失败状态下遵循根本不同的缩放定律,这表明当基础VLA可能失败时,动作多样性最为有益,但当成功可能时,它会不必要地扰动已经准确的动作。基于这一见解,RL^2仅在预测到失败时才激活组合式调控。在SIMPLER和PolaRiS基准测试中,RL^2在域外设置中将成功率提升高达17.3%,同时消融实验和缩放研究证明了潜变量表示和强化学习训练的重要性。最后,真实世界实验表明,这些收益能够迁移到模拟之外,使RL^2成为面向VLA部署的实用且模块化的调控框架。
群体中的每个机器人能否仅凭局部观测和带宽受限的消息预测相同的未来集体状态?我们将此形式化为去中心化共享状态预测,并引入集体状态JEPA(CS-JEPA)——一种循环联合嵌入预测架构,其在每个机器人处的输出表示一个共同的未来token场。在部署时,每个机器人使用16帧局部历史以及每条有向边一条由64个浮点数组成的循环消息;没有全局池化、目标编码器、回合时钟或已记录的未来动作。在无下游集体标签的预训练之后,使用在6、12或24个全局标记回合上拟合的岭回归探针评估冻结表示。与具有相同接收器锚点和部署容量但额外拥有9,607个仅训练时参数的原始未来重建相比,一项前瞻性注册的五种子后续实验在分布内、环形、相互kNN及未见规模族(最多108个机器人)上,改善了预测误差和机器人间一致性的标签预算AUC。所有效应在5/5个外层种子中均有利于CS-JEPA。在一项独立的密封八种子后续实验中,匹配的动作条件预测器在生成接收器局部的预测表示之前接收每个候选四步计划。CS-JEPA将分支值均方误差降低了45.5%,并将上下文内候选得分的皮尔逊相关性提高了0.1291;两项效应在8/8个种子中均有利,包括在未见过的N=32时亦然。这些结果支持将共同未来JEPA目标作为拓扑和规模变化下去中心化群体预测的标签高效基元,并提供了与规划相关的价值估计的额外证据。
训练后对齐往往较为浅层,容易在微调过程中发生退化。训练中干预能否与训练后阶段干净地分离开来,从而产生持久的对齐效果,这一问题尚未得到验证。我们通过宪法式训练中干预对此进行检验:在120B规模下,将基于原则、价值观的内容插入训练中阶段,并以仅重放作为对照组。我们基于Anthropic宪法构建了包含3.94亿个token的宪法式语料库,采用2×2因子设计(课程排序×审慎推理),产生了四种宪法式训练中条件及一个对照组,并在三个阶段的自我生成基准和既有基准上进行了评估,包括压力下的对齐、价值冲突解决、勒索以及涌现性错位,这三个阶段分别为:训练中阶段后、监督微调后以及良性微调后。宪法式训练中模型在对齐泛化性和持久性上优于对照组,尤其在勒索情境中表现显著:监督微调在所有模型中均诱发了勒索倾向,但宪法式训练中削弱了这一倾向,且该优势在良性微调后依然存在(-17.5个百分点)。然而,这种持久性并未延伸至需要积极抵抗上下文内压力或冲突的情境,在这些情境中该优势在监督微调后有所减弱。训练中阶段存在宪法内容比内容的结构方式更为重要,并且宪法式训练中在我们测试的能力指标(MMLU、ARC-Easy、piqa、GSM8K)上,在任何阶段平均均未带来损失。因此,在训练中阶段加入适量宪法内容有望产生广泛而持久的对齐收益,为以监督微调为核心的流水线提供了一种廉价且互补的补充方案。代码、数据和模型均已公开。
鲁棒的弱光成像仍然是该领域的一大挑战。近期研究尝试融合近红外(NIR)与含噪RGB以实现更好的增强,然而大多数方法依赖精心整理的训练数据对,在不同场景下的鲁棒性有限。本文引入三维感知神经建模,为RGB-NIR弱光成像提供了全新视角。无需干净RGB监督,即可优化出一个强模型,在三维空间中隐式融合含噪极重的RGB观测与NIR线索,从而有效恢复出清晰的RGB图像。所提模型免除了收集干净RGB数据的需求,并且能在不同噪声水平间泛化。在合成与真实数据上的大量实验证明了其优越性。代码:https://github.com/MyNiuuu/3DarkFusion
大语言模型的安全防护措施在尚未得知答案将如何被使用之前,就已决定是否作答。这给双重用途任务带来了一个基本问题:同一个答案既可能帮助授权专业人员,也可能帮助攻击者,而攻击者能够模仿良性请求和交互历史。我们将模型释放的能力与关于下游使用的可用证据分离开来。当这些证据可复制时,我们推导出了在保留有用回答的同时,攻击者所获协助的确切最坏情况下限。这一结果导致了安全三难困境:有用能力、可靠安全与开放访问无法共存。我们随后展示了可信凭证如何通过增添难以复制的信息来补充现有防护措施,这些信息能够预测实际的下游使用情况;我们还指出了消除该下限所需的更强条件。来自双重用途评估、自适应攻击和已部署的可信访问计划的证据,支持了这些条件的实际相关性。
RGB图像为地表地雷探测中的无人机/无人地面车辆(UAV/UGV)勘测支持提供了一种实用且低成本的方案,但目标检测器在这一安全关键领域仍未得到充分探索。有限的跨架构基准测试和不足的分布外(OOD)分析,使检测器能否在不同部署条件下泛化这一问题难以得到明确回答。公共RGB地雷数据集的稀缺进一步加剧了这一挑战,使SULAND成为PFM-1和PMA-2检测的关键基准。然而,检查发现SULAND存在标注缺失/错误、定位误差、可见性标准不一致、视觉伪影、时间标注不一致以及OOD类别ID约定反转等问题。我们提出SULAND_v2,一个经精炼的RGB地表地雷数据集与基准。在保留原始图像和划分的基础上,我们人工修订标注,以确保完整性、精确定位、标签有效性和类别一致性。SULAND_v2包含33,771张图像和12,433个边界框。我们评估了九个系列的35种检测器配置。标注精炼使YOLOv8在同分布(IID)测试中的mAP@50提高了14.6至19.6个百分点,而修正OOD类别ID约定使YOLOv8的平均OOD mAP@50提高了约25个百分点。在SULAND_v2上,YOLOv12-Small取得了最高的IID mAP@50(0.908),而RF-DETR-Large表现出最强的OOD性能(mAP@50为0.799,召回率为0.675)。我们的结果表明,高IID精度并不能保证部署就绪性。SULAND_v2为评估基于RGB的排雷行动勘测支持中的域偏移鲁棒性提供了可靠基准。
可验证奖励强化学习(RLVR)是提升大语言模型长思维链推理能力的核心方法。无评论家方法(如GRPO)将响应级奖励转化为优势值,并均匀地广播到所有词元上,忽视了各词元对最终结果的不平等贡献。相比之下,在线自蒸馏(OPSD)通过最小化无特权策略与特权自教师之间的前向KL散度来提供密集的分布级监督,其隐含假设是所产生的似然偏移编码了可靠的、与答案一致的信息。我们通过固定每条采样轨迹并在两种对立的输出条件下重新评分来检验这一前提:一种条件判定轨迹正确,另一种判定其错误。结果表明,大多数受影响词元在两种条件下的偏移方向相同,符号反转极少,且所引发的优化信号存在大量重叠。此外,大幅偏移集中在高度可替换的表层形式词元上,而承载问题特定推理内容的词元敏感度较低。这些发现表明,特权偏移无法提供可靠的、与答案一致的方向,其幅度主要反映反事实敏感度而非词元级学习价值。基于上述观察,我们提出反事实敏感度信用再分配(CSCR),这是GRPO的一种简单扩展,通过降低高度敏感词元的信用并重新归一化词元级优势值,以同时保留原始信用预算和验证器决定的方向。在长思维链数学推理基准上,CSCR在相同策略更新次数下持续优于GRPO基线。针对性消融实验进一步佐证了我们的诊断:特权引发的方向不可靠,适度降权最为有效,而更强的调制会破坏优化稳定性。
情感对话研究包含两个具有影响力的策略传统。共情对话优先理解说话者的情感体验;情感支持对话则针对寻求支持者当前的诉求,选择和编排相应的支持策略。持续使用引入了又一重目标:有效的支持应当在整个交互生命周期中,维持用户在情绪调节、应对方式、自我认同决策及社会联结方面的能力。我们提出“能力维持型情感对话”(capability-sustaining emotional dialogue, CSED),将其作为一种纵向研究范式,使支持策略与该目标保持一致,并围绕重复使用、非使用、转换与终止来组织数据、模型、系统设计、评估与治理。一项针对文献与语料库的定向审计支撑了这一立场。在PRISMA-ScR指南引导的样本中,60篇系统构建论文里有95%追求以缓解情绪为导向的目标;没有一篇评估能力或纵向结果,仅有一篇考虑了依赖性、自主性或终止风险。在300条ESConv支持者话语中,能力相关功能出现于43.0%的语句,而泛化建议占22.0%;相比之下,重评占4.0%,自我效能支持占6.7%,边界行为仅占0.3%。我们发布了一项将审计扩展至模型行为的协议。一个示例性过程模型将潜在的用户能力与六项设计承诺、四个评估时间尺度及生命周期约束联系起来。由此形成的研究议程使CSED在数据、策略设计、训练、评估与治理等层面均可测试。
自动驾驶系统(ADS)正迅速发展,并在现实应用中日益普及。这对开展有效测试以保障系统功能与安全性提出了日益增长的需求。然而,ADS测试仍然复杂,且在场景选择、性能评估和验收标准方面缺乏完善的标准。为更深入地了解当前ADS测试的实践与挑战,我们对来自六个国家九家公司的ADS开发与测试领域专家进行了访谈研究。通过主题分析,我们综合归纳了工业界的测试实践、挑战、潜在解决方案及未来趋势,并提出了一种以证据为中心的ADS闭环测试框架。研究结果表明,当前实践主要聚焦于基于场景的测试和X在环测试方法,并辅以多种工具、指标、基准和测试策略。参与者强调了与场景真实性、场景覆盖率、仿真保真度及验收标准相关的重大挑战,同时探讨了如利用人工智能、世界模型和端到端方法等潜在解决方案。此外,参与者展望未来ADS测试将在整个行业范围内变得更加自动化、数据驱动和透明。总体而言,本研究提供了基于工业实践的ADS测试全面概述,提出了一种以证据为中心的闭环测试框架,为ADS测试提供可操作的指导,并指出了未来研究与实践的重要方向。
随着大语言模型(LLMs)在复杂推理任务上持续进步,它们学会了高度优先处理输入中提供的显式条件。然而,在日常常识推理中,这一机制暴露出一个关键漏洞,我们称之为“显著性偏差”:模型容易被无用的显式干扰项(如数值)所劫持,从而忽略任务隐含的物理或常识前提。一个关键开放问题是,这种失败究竟反映常识知识的真正缺失,还是仅仅反映其在误导性任务框架下的抑制。为探究此问题,我们构建了SaliTrap基准测试集,这是一个覆盖四个陷阱维度的高质量数据集。通过评估12个最先进的大语言模型,我们发现所有主流模型都显著受到显著性偏差的影响,其严重程度随干扰项密度增加而上升,且检测到陷阱与实际避开陷阱往往相互脱节。至关重要的是,通过在剥离任务框架后重新激发相同模型,我们表明这主要是知识抑制而非知识缺失:仅凭无上下文知识探针便可恢复超过90%的谄媚性顺从失败,揭示所需常识内在地存在,但被显著干扰项主动排挤——这些干扰项诱使模型进行过度顺从的不必要计算。基于这一诊断,我们进一步表明,仅使用轻量级的推理时提示,无需任何重新训练,即可大幅缩小差距。我们的发现将常识推理失败的瓶颈从模型能力重新定位到知识激发,并发布SaliTrap作为针对这一盲点的测试平台。代码可在https://github.com/Wuzheng02/SaliTrap获取。
自主多车竞速要求在激烈交互中实时规划多样化的竞争性行为。现有规划器往往难以兼顾策略多样性与计算效率。针对这一挑战,我们提出基于采样的博弈论规划(SGTP)方法,这是一种将博弈论推理与GPU加速的控制序列采样及动力学展开相结合的实时框架。采样的轨迹通过博弈感知代价函数进行排序,以捕捉竞争性交互并生成多样化的竞速行为。随后,我们的规划器通过显式施加赛道边界约束和动态避碰约束来进行可行性选择,确保竞速策略之间安全可靠的切换。在具有挑战性的赛道上进行的大量仿真实验表明,SGTP在高交互性竞速中实现了95.24%的胜率和99.35%的任务完成率,且多轮迭代求解的平均计算时间为0.095秒。我们还展示了SGTP在多达10个智能体的大规模场景中的成功应用。我们公开了代码,并提供了多智能体自主竞速算法的开源基准测试,以促进未来研究。项目主页:https://sgtp-racing.github.io/。