每日精选AI研究论文及翻译
学习可部署的操作策略面临瓶颈,即缺乏同时具备高保真度和可扩展性的数据。真实机器人遥操作精确但扩展成本高昂;无机器人UMI数据采集易于扩展,当前实践中主要将产生的数据用于预训练,并在后训练阶段添加少量真实机器人数据作为“锚点”。我们探究:是否可以通过提升无机器人UMI数据的保真度(而非减少真实机器人数据的比例)来消除这一锚点。我们提出了HiFi-UMI,这是一个便携式UMI数据生产系统,其在轨迹精度、夹爪间相对位姿、同步性和视场方面进行了协同设计:头戴式离线双目惯性SLAM、原生而非重建的相对位姿、共享微秒级GPIO触发器,以及每只手配备两个覆盖约200度的广角摄像头。该系统无需外部追踪基础设施,即可实现3毫米级别的工作空间局部末端执行器精度。利用这一数据语料库,我们展示了零机器人后训练:仅基于HiFi-UMI演示数据进行后训练的策略可直接部署到真实机器人上,并在涵盖视觉-语言-动作和世界-动作模型家族的三个主干网络上,与领域内遥操作的性能相当;在StarVLA-QwenPI、OpenPI-pi_0.5和LingBot-VA上,成功率差异分别为-2.5、+3.1和-0.6个百分点。最强的策略在精密插入任务上达到85%的成功率,尽管遥操作基线在评估场景中采集,而HiFi-UMI轨迹从未在该场景中出现。在同一语料库上进行4000小时的预训练,将在十个未见任务上的动作误差降低41%,并在StarVLA-QwenPI上进一步提升真实机器人成功率18.1个百分点。我们开源了HiFi-UMI-2K,包含2000小时微秒级同步、超宽视场的演示数据,每条数据均通过仿真回放自动重建和验证,为机器人学习社区提供了一个大规模、高保真度的资源。
相关性是一种查询相关的估计,用于判断文档或片段是否包含有用证据。现有检索代理利用相关性选择top-k内容,但仅凭文档相关性无法定位、组合或验证复杂问题所需证据。直接语料库交互(DCI)通过grep式探索实现此类细粒度操作,但其忽略相关性的搜索可能较晚暴露有用线索,从而延迟收敛。近期进展利用相关性将语料库缩小为交互的工作空间。然而,一旦交互开始,相关性仍无法直接指导grep优先搜索哪些文档,或从大量匹配结果中区分出信息性片段,使大语言模型优先看到它们。我们提出相关性感知的RipGrep搜索代理(RARG),将相关性转化为语料库交互的执行先验。RARG提供由粗到细的相关性引导:它对文档进行排序以进行顺序的“ripgrep”遍历,从而更早暴露全局相关线索;用查询相关段落初始化有前景的入口点;并重新排序grep匹配结果,以凸显文档级排序可能掩盖的信息性片段。在具有挑战性的浏览问答和推理密集型检索中,RARG相较于基于检索和直接交互的代理提升了准确-效率边界。这些结果表明,相关性感知的交互能够实现更快、更可靠的搜索收敛。
编码代理不断搜索、导航并维护来自不断演变的代码库的上下文,但零散的索引、语言服务器以及任务局部历史迫使重复发现并掩盖了生命周期成本。CodeNib为每个仓库提交构建可复用的词汇、稠密和结构视图,将输出映射到仓库相对源范围,在编辑过程中维护所选视图,并通过一个运行时提供排序搜索、符号导航和有界上下文。 在100个快照中,我们映射了仓库上下文生命周期中的质量-成本边界。当输出与独立重建匹配时,图更新和向量更新的中位数速度分别提升8.7倍和25.4倍。在匹配标准化实时服务器位置的静态导航子集(占1,000个请求的63%)上,每次请求的实时/静态延迟中位数比值为4.7倍。在五个模型中,所选的上下文策略相比配对grep/read,以50-87%更少的轨迹令牌保持了局部性。综合来看,这些结果支持带明确、操作特定有效边界的多视图仓库上下文服务。
从栅格图像恢复可编辑设计文件是现代设计工作流中常见且成本高昂的瓶颈,然而这一过程至今仍具挑战性,因为可编辑性依赖于恢复多模态属性,例如排版、矢量几何、颜色、分组与图层顺序。我们提出了ReDesign——一种智能代理框架,通过跨模态选择并组合专用工具,逐步构建可编辑的层级结构。为使这一长决策过程在工具输出不完美的情况下依然可靠,我们在每次层级扩展中引入了优雅验证机制:通过局部接受、剪枝或重试反馈,防止误差累积,避免大规模重运行。为在大规模场景下评估可编辑性,我们引入了Figma编辑重放基准,包含909个原始Figma文件及14,796条受控编辑指令,用于在重建输出上重放编辑操作。在该基准及标准重建指标上的实验表明,ReDesign在保持高视觉保真度的同时,在布局、颜色和文本编辑方面实现了最高的可编辑性,显著优于基于图层分解的基线方法及串行工具使用流程。
在线策略蒸馏(OPD)通过学生自身轨迹提供令牌级监督,但存在前缀失败问题:一旦学生陷入错误的推理方向,后续生成均建立在此偏差之上,产生方向错误的连续输出,导致监督信号不可靠且计算资源浪费。我们识别出在失败前缀上存在师生延续不对称现象——教师倾向于重定向推理路径,而学生则延续原始方向——并将其转化为中继在线策略蒸馏(Relay-OPD)中无需标签的切换触发机制。在训练过程中,Relay-OPD通过让教师在检测到的触发点短暂接管生成"教师段",随后学生继续生成并基于完整轨迹进行优化,从而构建中继轨迹。有限的中继预算将干预集中在关键早期位置,同时限制对原学生策略的偏离。以Qwen3-4B-Instruct-2507为教师、Qwen3-0.6B/1.7B-Non-Thinking为学生模型,在八个数学推理基准上,Relay-OPD在每个基准均取得最优或次优结果:1.7B模型平均超越标准OPD达5.73%,超越最强基线FastOPD达1.49%;0.6B模型也保持稳定提升。训练轨迹长度减少超过50%。
长期记忆系统会将用户所述内容存储于外部存储器中,并在相关查询出现时予以检索。这一接口建立在一条看似理所当然却鲜少明言的假设之上:所需记忆必然与需要它的查询存在相似性。世界知识打破了这一假设。树坚果过敏应通过杏仁粉这一成分来改变对马卡龙请求的回答,然而两段文本之间并无检索器可识别的线索。我们将这种失效模式称为"隐含关联盲点",并提出了InMind——一个包含125项任务、经专家验证的基准测试集,覆盖十个生活领域,其中113项任务基于可引用的公开来源。其配对对照组分离了现有评估中混淆的三种解释:事实从未存储、模型缺乏关联知识、或事实已存储却未能浮现。结论清晰明确。当决定性的记忆被置于上下文中时,骨干模型能正确回答84.0%的间接查询;而当同一记忆必须通过检索获取时,六种向量、图与智能体记忆系统最高仅能达到14.4%,尽管它们在有需求时对相同事实的召回率可达100%。将嵌入维度提升八倍后,每个系统在答案无关的目标召回率上均有提高,但差距基本保持不变。一种在查询到来前保持记忆可见的最小诊断探针能弥合大部分差距,将失效根源定位在查询条件化接口本身,并指向路由选择——即决定哪些事实必须保持可见——作为InMind旨在评估的开放性问题。
标准视觉-语言模型(VLM)存在莫拉维克悖论:它们擅长复杂的离线视觉推理,却在简单的流式感知任务中表现不佳且处理效率低下。我们提出Mage-VL,一种高效的编解码原生流式基础模型,用于实时多模态理解与交互。其核心在于我们定制的分词器Mage-ViT,通过利用运动向量和残差能量选择性编码动态且熵值丰富的区域(稀疏锚定帧I与预测帧P),取代了均匀帧采样。在16×16块级操作下,视觉令牌消耗减少超过75%,同时保留了时空上下文。Mage-ViT基于约5.6亿未标注图像和1亿未标注视频帧从头训练,性能可媲美或超越在数十亿图像-文本对上训练的主流编码器。我们构建了涵盖提示-代码联合优化的多模态字幕生成AI4AI数据流水线,并引入基于AI的诊断指导训练策略。此外,通过仿生双系统架构——轻量级系统1事件门控与因果系统2解码器——Mage-VL实现了主动流式感知。大量评估表明,Mage-VL-4B在静态任务上与Qwen3-VL-4B持平,在视频理解及2D/3D空间推理上取得显著提升,推理速度最高提升3.5倍,全面超越150亿参数的Phi-4-reasoning-vision基线。除模型成果外,我们贡献了七项关键实证发现,涉及预训练数据效率、变分辨率缩放、编解码系统加速、VideoQA SFT冗余、运动-空间协同、AI4AI数据流水线,以及用于多模态强化学习的零视觉监督微调。
我们提出Wonder,一种通用视频世界模型,专为实时、摄像机可控的世界探索而设计。给定一张图像或一段条件视频,Wonder构建了一个可交互操作的虚拟世界,用户可通过移动摄像机实时、长期地导航、探索未见区域并重新访问已观察区域。实现这一能力需要系统级协同设计控制方法、记忆机制和训练策略。我们引入一种新颖的摄像机条件控制方法——使用密集坐标场,其渲染结果提供空间对齐的运动与方向线索,使模型能够将摄像机运动直接解释为视觉证据。为支持不断增长的生成上下文中的快速精准记忆检索,我们提出一种基于稀疏注意力的高效记忆机制,使模型在推理时能够选择性关注少量相关上下文标记,而无需考虑实际上下文长度。我们进一步开发多种技术修正自强制式蒸馏流程,提升学生模型遵循控制信号的能力,同时保持教师模型的多样化生成模式与长期记忆。这些组件的结合使Wonder能够以16 FPS速率合成多样化的分钟级视频,并在长程生成中保持几何、外观与动态的连贯性。除图像到视频的生成外,Wonder自然支持视频条件生成,使现有动态场景能够被实时重新拍摄。
在基础模型时代,模型的性能取决于其提示的质量。因此,提示工程已成为提升语言模型性能的关键技术。鉴于视频模型正逐步成为视觉任务(如视觉推理)的基础模型,我们在此探究它们是否能同样受益于视觉提示工程:即自动调整任务图像以改进模型表现。例如在视觉物理推理任务("球经过障碍物后落在何处?")中,可通过简单调用图像编辑模型将抽象草图场景转换为逼真版本。研究发现,视觉提示工程(简称VIPE)能显著提升各类视频推理任务的性能。事实上,对于视频模型而言,视觉提示工程的效果甚至优于传统文本提示工程或测试时扩展策略。最终,正如文本提示工程能系统性提升语言模型性能一样,视觉提示工程可作为简洁且计算高效的方案,有效激发视频模型的视觉推理能力。相关示例视频详见项目页面:https://visual-prompt-engineering.github.io/。
我们推出了Shieldstral,这是一个30亿参数的政策自适应多模态安全分类器,在文本安全基准测试中能够匹配甚至超越近七倍于其体量的模型,并在多模态安全分类领域树立了新的行业标杆。Shieldstral将内容审核重构为二元问答任务,这种简洁的表述将多样化的审核任务统一为简单的是/否问题,使得原本具有不同分类体系的异构安全数据集能够在同一训练框架下实现整合。我们详细阐述了数据构建方案,涵盖约5410万个样本的整理与生成流程,以及用于评估政策适应性的细粒度评估数据集。这些要素共同使这个小型自适应模型得以匹敌甚至超越规模更大的模型。
我们提出了PerceptionBench——一个专门用于评估多模态大语言模型(MLLMs)原子视觉感知能力的基准。现有基准往往无法隔离感知能力:整体评估将感知错误与推理或领域知识的失败混为一谈,而应用驱动的基准仅覆盖由启发式设计所塑造的狭窄、碎片化的领域。为克服这些局限,PerceptionBench采用自下而上的方法:通过诊断前沿MLLMs在42个现有基准中最早出现的失败点,我们构建了一个错误分类体系,其中感知分支定义了十种原子感知能力。在该分类体系的指导下,我们构建了3000个经过验证的问题,每个问题答案简短明确,且仅隔离单一能力,其难度源于感知而非推理或知识。在16个前沿MLLMs上的基准测试结果表明,原子感知能力基本尚未解决——没有模型达到60%的准确率,与感知相关的幻觉是平均表现最弱的能力,而相似的总分背后隐藏着截然不同的能力分布。因此,PerceptionBench为衡量和诊断MLLMs的视觉感知边界提供了能力层面的标准。
多模态自动事实核查(MAFC)通过检索外部证据并进行推理来验证声明。然而,现有大多数静态基准存在污染风险:它们主要由可通过大语言模型内部知识(无需外部证据)验证的过时声明组成。这可能导致性能评估虚高,且无法真实反映模型在处理需要最新信息的新型声明时的能力。为此,新兴动态基准专门收集在大语言模型知识截止日期之后发布的声明,并假定其未被污染。本研究重新审视了这一假设,通过实验探究当前最先进的静态AVerTeC基准与我们新构建的动态ClaimReview2025Q4基准中存在的污染风险,及其对MAFC评估的影响。实验获得16项发现,其中三个关键结果为:(1) 动态评估虽能降低但无法消除污染风险——17.09%–29.30%的截止日期后声明仍可能受污染;(2) 大量新发布声明可直接验证,或通过综合截止日期前已有的多条公开知识进行验证;(3) 污染会显著导致MAFC性能虚高,使宏F1分数最高提升11.34个百分点,并扭曲系统排名。基于这些发现,我们在严格污染控制条件下重新评估了当前最优的大语言模型。本研究为可信的MAFC评估提供了实用指南。
任意到任意模型能够在单一网络中,根据任意其他模态的组合预测任意模态,这种框架广泛应用于多模态视觉与视觉-语言模型,并逐步扩展至生态学、天文学等科学领域。现有任意到任意模型通常采用编码器-解码器或扩散架构从头训练,这限制了其性能,且无法利用强预训练的仅解码器模型作为先验知识。本研究探索了仅解码器的任意到任意多模态建模,该方法对称处理所有模态,支持任意模态作为输入或输出,无需模态特定的头部结构、损失函数或任务流水线。由于所有模态既是同一模型的输入又是输出,所提出的模型命名为Modus,可支持多种应用场景,例如通过中间模态进行链式生成,或利用另一生成模态对模型自身输出进行评分实现跨模态自验证。Modus展现出卓越的即用性能,在多个基准测试中,单一模型即可与专家模型及多任务基线相竞争。所有相关材料已开源发布于 https://modus-multimodal.epfl.ch/。
视频扩散模型或流模型的生成过程因迭代采样速度缓慢而计算成本高昂。当前最先进的加速方法严重依赖变分分数蒸馏(VSD)和对抗性损失,将扩散模型蒸馏为少步生成器。尽管这些训练方法能实现高质量视频生成,但其优化难度极大且易出现模式崩塌,导致视频多样性损失和运动缺乏。本文提出并行解码蒸馏(PDD)——一种简化且可扩展的轨迹蒸馏方法,用于扩散模型和流匹配模型的快速推理。我们的架构和训练流程与任何预训练模型兼容,并支持不同函数评估次数(NFE)的采样。PDD通过每轮网络评估预测多个去噪步骤来加速生成。从概念上看,它学习平均速度的表征,而无需通过雅可比向量积或有限差分近似回归其导数。我们的方法在LTX-2.3文生视频/音频、Wan 14B文生视频和Qwen-Image文生图任务上,以4-8次函数评估实现了最先进性能。此外,PDD在生成的视频多样性方面表现出显著提升。
面向代码正确性的强化学习已是成熟技术:让模型生成程序,将其与隐藏测试用例对照运行,并对通过测试的方案给予奖励。将其扩展至代码优化看似直接:只需将执行时间加入奖励函数。但在实践中,一旦执行时间驱动奖励,测量噪声、奖励稀疏性或GRPO不稳定等小问题便会淹没有效信号,导致强化学习失效:生成的方案速度提升甚微,且更多方案可能无法通过测试。我们通过三个阶段使执行时间成为可学习的要素:(1) 测试代码的方式——构建包含大规模优化测试与校准沙箱的DMC-Optim数据集;(2) 将执行速度转化为奖励的方式——在强化学习环境中组合正确性与速度,并利用离线模拟器预测最具潜力的配置;(3) 模型从该奖励中学习的方式——针对更稀疏、噪声更大的定时执行场景调整GRPO与评估方法。在DMC-Optim数据集上,最强优化感知配置将严格前50%的pass@1从Qwen 2.5 7B的18.0%提升至31.3%,CWM 32B则从30.7%提升至50.4%。这些增益在更严格的百分位(如前30%)进一步提升,CWM 32B实现125%的相对提升,同时保持纯正确性分数不变。当定时沙箱降级时,稳健优化强化学习相比标准RLVR在不同评估标准下获得100%至200%的改进。在LCB基准上,CWM 32B在样本中位数速度对比中最高胜出标准RLVR达83%。相较于每个问题的正确人类最快提交,其复杂度等级改进率约为人类水平的一半(14%对28%)。
新兴的全模态大语言模型(OmniLLMs)实现了文本、音频和视频的统一理解,但长序列的音频-视频标记带来了显著的存储和推理成本。现有的压缩方法主要关注在固定预算下选择重要标记,而对前置的预算分配问题探索不足。我们证明,查询与音频/视频之间的直接相似性对于模态间预算分配不可靠,而模态内统一预算可能在保留冗余内容的同时遗漏关键证据。为解决这些局限,我们提出OmniDelta——一种免训练、基于技能驱动的框架,将意图感知的模态间分配与内容感知的模态内分配相结合。OmniDelta首先构建音频和视频技能池,根据查询需求调整固定保留标记预算,随后利用局部复杂性和时间冗余度,在音频片段和视频帧之间重新分配模态预算。由此产生的局部预算可与现有剪枝策略结合,在保留总标记比率不变的情况下改变预算的分配位置。在四个音频-视频基准测试中使用两种Qwen2.5-Omni模型进行的实验表明,OmniDelta在不同剪枝比率下建立了新的精度-效率帕累托前沿。在Qwen2.5-Omni-7B模型上保留25%标记时,OmniDelta相比全标记推理减少22.0%的GPU内存,并实现1.64倍的端到端加速。
使用强化学习对参数量在70-500M范围内的小型语言模型(SLM)进行对齐通常被认为是不稳定的,但其潜在失效机制尚未得到系统性研究。在最新前沿研究中,采用近端策略优化(PPO)方法对十五种(模型,语料库)配置进行了训练。实验基于TinyStories、CNN/DailyMail和Wikitext-103语料库,涵盖了Pythia-70M/160M/410M及SmolLM2-135M/360M等模型。研究识别出小型语言模型中三种可复现的失效模式:标准PEFT/TRL流程中的静默LoRA参数冻结、使用bf16浮点格式时重要性比率数值溢出、以及奖励模型误差导致的灾难性策略崩溃。针对这些问题,分别采用了合并重初始化适配器技术、PPO更新时使用float32精度、以及包含奖励白化、重要性比率守护和权重回滚的三层级安全机制。本文提出容量余量假设,认为SLM规模的PPO性能同时依赖于流畅的有监督模型(困惑度<20)和具备区分性的奖励信号,而非模型参数量。所提系统在所有实验中均能稳定收敛,并在具备流畅先验和有效奖励信号的配置中较SFT基线提升了偏好胜率。此外,该系统以显著更少的训练数据超越了指令微调基线。所有检查点、偏好数据集及训练脚本均已公开发布。
压缩短文本生成器可能在两个不同环节失败:编解码器可能在生成开始前丢弃信息,或者潜在生成器可能产生弱编码。若无法区分这两种失效模式,研究人员可能将计算资源浪费在改进错误组件上。我们通过一个基于分层VQ-VAE-2编解码器和掩码离散扩散生成器(MDLM)构建的64-to-16 TinyStories受控案例研究来探讨该问题。采用分阶段验证协议,在统一外部GPT-2评分器下分别评估编解码器重建保真度、潜在生成质量及辅助潜在诊断指标,同时为几何研究提供互补语义指标。在所测试配置中,仅编解码器重建就将外部困惑度中位数从15.17提升至27.36(+80.4%),95%分位数从25.10提升至98.91(+294.1%),表明主要质量损失出现在潜在生成开始之前。在相同评分器下,代码空间MDLM仍显著优于令牌空间扩散,使均值、中位数和95%分位数分别降低32.9%、30.9%和36.6%。几何感知正则化可改善局部潜在代理指标,但在现有运行中未提升解码文本指标。本文贡献在于方法论层面而非算法层面:针对具体管道提出可复用的分阶段诊断方法,并表明在该设置下,编解码器保真度而非潜在去噪过程决定了实际质量上限。
联合嵌入预测架构(JEPA)通过表征空间中的预测而非像素重建来学习世界模型,使其成为基于离线示范日志进行潜在模型预测控制的自然基础框架。JEPA式训练优化短时域潜在预测,而规划需要根据目标进展情况对多步想象序列进行排序。先前的JEPA规划器通常从嵌入几何结构中继承这种排序方式(典型为潜在欧几里得距离),这种排序是表征学习的副产品,而非从日志中挖掘出的进度成本。我们提出时域距离JEPA(TD-JEPA),其保留了LeWM编码器-预测器骨干结构,并从无奖励轨迹中挖掘有向时间成本:同轨迹步序提供正样本,跨轨迹对作为启发式负样本,并通过滚动一致性项匹配规划器时域。这种挖掘式监督发挥双重作用:当进度具有拓扑特性时作为部署规划成本,当接触几何结构占主导时作为提升欧几里得规划性能的表征信号。在锁定评估下,部署该项成本使Two-Room成功率达到100.0%(LeWM为97.4%),而对同一经时间训练检查点采用共享欧几里得规划时,OGB-Cube较LeWM提升14.2个点,Push-T亦获改善。与LeWM及同期RC-aux基线在锁定评估下对比,TD-JEPA在所有环境中均达到或超越两者性能。消融实验表明,有向头、跨轨迹负样本及滚动一致性项各自发挥贡献。TD-JEPA通过挖掘离线日志中的时间进展结构并协同设计成本形式与规划期部署,缩小了JEPA世界模型规划器的训练-规划差距。代码已开源:https://github.com/HKBU-KnowComp/TD-JEPA。
我们提出了一种可复现的流水线,用于从自由文本的漏洞描述中,将通用漏洞与暴露(CVE)映射到MITRE ATT&CK企业技术。我们不再依赖CWE->CAPEC->ATT&CK的推导链(我们量化了该链中表格扩展的虚假现象),而是在由MITRE威胁知情防御中心的专家映射构建的1207个CVE策划黄金数据集上,训练了一个多标签分类器。与零样本嵌入相似性基线相比,该模型在recall@5上大约翻倍,并改进了所有排名指标。随后,我们研究了通过大语言模型辅助标注能否扩展黄金数据集。初步实验得出了矛盾的结论:单次运行表明性能下降,而对五个随机种子取平均值则显示轻微提升。然而,独立复现和扩展规模研究(增加100至984个CVE)表明,这种表面上的改进是评估假象。大语言模型生成的标签与专家标注的一致性约为0.39,在任何扩展规模下均未提供可靠改进,并在添加约1000个CVE时降低了稀有技术覆盖率(macro-F1下降0.04)。根本原因在于评估噪声。在较小的测试集上选择检查点实际上是在多个噪声评估上最大化,导致相同运行之间recall@5差异可达0.05。采用基于验证集划分检查点选择的修正协议后,仅使用黄金数据的模型达到recall@5为(0.673 ± 0.019),且重复关键实验确认了大语言模型扩展的零结果。最终规模研究表明,额外的专家策划数据能持续提升性能,而大语言模型标注的数据则不能,这表明分类器的瓶颈在于标签质量而非数据集规模。所有数据集、模型、代码和训练日志均已公开发布。
不同的研究路线以不同的方式使用“世界模型”这一术语,但它们共享一个共同目标:以支持感知、模拟和规划的形式,捕捉世界在行动作用下的演化过程。两种突出的实现方式是:在连续向量空间中学习动力学的神经预测器,以及暴露显式状态和物理定律的手工构建物理引擎。神经预测器可从数据中扩展,但将动力学形式隐含其中;物理引擎则可检查与编辑,但难以大规模构建。我们提出VisualPatchWorld(VPW),它将世界动力学表示为代码。VPW首先通过短暂的主动探测选择一种定性动力学形式,然后通过最小化多步预测误差,从记录的状态-动作轨迹中拟合该形式的自由参数。由此生成的程序可像模拟器一样向前推进,以源代码形式进行检查,并用于模型预测控制;图像衍生的场景图可在重新规划时提供实时状态。在与先前基于代码的世界模型的比较中,VPW实现了69.0%的平均规划成功率,比最强的代码基线高出23.5个百分点。最大的提升出现在正确选择定性动力学至关重要的情况下。在相同规划器下,诱导模型在导航和富含抓取的控制任务中接近真实物理引擎的成功率;在涉及接触的推挤任务中仍存在残余差距,而在引擎中检查少数有前景的方案即可弥补大部分差距。这些结果建立了一条实用路径,可自动构建对规划有用的代码世界模型。代码已开源:https://github.com/HKBU-KnowComp/VisualPatchWorld/。
现代编码代理通常通过是否最终生成正确的补丁来评估,但补丁生成依赖于早期的上下文获取阶段:即找到任务所需的仓库文件。我们提出Agent Retrieval Bench,这是一个针对该上游检索问题的文件级基准。样本基于真实编码工作流信号构建,并在冻结的基础提交仓库上进行评估,相关性由代理下一步需要的内容而非直接查询与文件的语义相似度来定义。该基准涵盖四项正检索任务:code2test、comment2context、trace2code和edit2ripple;第五个子集利用基于自然证据的无金标准案例和反事实的错误仓库控制来评估选择性检索。Agent Retrieval Bench包含来自25个仓库的427个样本:345个正例、50个自然无金标准示例和32个反事实控制项。语料库包括308个基础提交快照、392,000个文件和790万个块。我们评估了词汇检索、RepoMap、开源嵌入、选择性弃权以及记录的代理上下文选择。没有单一检索家族占据主导地位:Qwen3-Embedding-4B在正样本上获得最佳的样本加权MRR,Qwen3-Embedding-8B获得最佳的Recall@20,而RepoMap在8K token预算下获得最佳的上下文产出,不同任务层面的胜出者差异显著。使用反事实控制校准的选择性阈值并未提高自然无金标准案例上的选择性成功,揭示了校准差距。记录的轨迹在27%至35%的样本中也遗漏了所有金标准文件。一项受控的种子干预试验发现,与随机非金标准上下文相比,检索得到的初始上下文在种子后探索中能获得更高的文件F1分数,而Oracle金标准上下文则显示出显著的剩余提升空间。
在推理任务上训练的语言模型 p_θ(y mid x) 能够通过多种不同的策略来解决问题,但这些策略隐含在模型的响应分布中,相互纠缠。我们研究如何将给定预训练语言模型的响应分布分解为结构化的、以策略为条件的表示。具体而言,我们学习一个潜变量分解 p_θ(y mid x) leadsto (r_ϕ(z mid x), g_ϕ(y mid x,z)),其中路由器 r 将每个输入映射到潜策略 z 的分布,生成器 g 则根据该策略生成响应。一个关键挑战在于:生成器初始化自基模型,本身已能表示 p_θ(y mid x) 而无需使用 z。因此,标准变分推断无法激励模型通过 z 传递信息,并可能导致严重的后验坍塌。为解决此问题,我们提出一种变分目标函数,该函数衡量相对于基模型响应损失的分数量增益,并将重构压力集中在基模型惊讶度高的词元上,从而鼓励 z 编码与策略相关的响应变异。我们引入一个多策略算法任务的基准测试,并证明该目标函数能够在保留基模型响应分布的同时,恢复出与不同参考策略对齐的潜编码。
在RLHF流程中,奖励评分会阻塞策略更新。缓慢的评分成为整个循环的瓶颈,因为只有所有轨迹都获得评分后才能执行更新。然而,大多数配置只是默认使用PyTorch的eager模式或torch.compile,没人验证这究竟是不是最快的方案。评分本身计算量不大——典型RLHF步骤中,轨迹生成消耗要大得多。但评分和生成争用相同的CPU和GPU资源,因此更快的评分引擎本身并不会缩短每步时间,它主要释放出生成可以转而利用的计算能力。我们基于ONNX Runtime构建了一个原生C++推理引擎。第一步是确认正确性:输出与PyTorch参考结果在CPU上匹配误差为5.7×10⁻⁶,在GPU上为4.2×10⁻³,足够接近,可以信赖。随后我们在CPU和GPU上,与PyTorch eager模式、torch.compile以及FastAPI进行了对比测试。CPU结果是决定性的:我们的引擎击败了所有基线,置信区间甚至毫无重叠。GPU则呈现出不同图景:我们超越了PyTorch和FastAPI,但torch.compile表现更优。进一步测试发现,加速归功于ONNX Runtime本身,而非C++语言。而批处理策略的重要性超过了语言或运行时选择,甚至超出了我们的预期。上述结果均来自重复独立的多次运行,因为单次运行的可靠性不足以支撑结论。
现有BraTS-GLI数据集为成人胶质瘤MRI分割提供了广泛使用的基准,但其任务定义聚焦于肿瘤亚区,未能系统表征共存的脑白质高信号(WMH)。在联合分割场景中,此类未标注的异常区域会因将病理区域视为正常组织而引入特定任务的标签噪声。为弥补这一不足,我们提出BraTS-GLI-解剖-病灶数据集,这是一个基于BraTS 2023-GLI训练队列构建的受控访问、仅含标签的衍生资源。该资源提供1,251套与原始四模态MRI病例对齐的八类统一解剖-病灶标签集,其中包含116例需要修复图像输入病例的图像修复标签。队列被组织为394例纯化子集与857例扩展子集,附带涵盖标签来源、图像修复需求、质量控制状态、访问条件、校验和及发布边界的病例级元数据。相较于原始BraTS-GLI标注,该资源通过在统一标签空间中纳入健康脑组织及此前未标注的共存异常区域,显著扩展了前景监督范围。使用MedNeXt与T1/FLAIR输入的验证研究表明,基于WMH感知的监督能在领域内GLI数据集与外部WMH数据集上保持健康组织分割性能,同时相较于含噪对照训练,提升了对共存病灶的敏感性。该资源面向科学研究,支持联合解剖-病灶监督、标签噪声分析及可重复评估。数据获取地址:https://www.synapse.org/Synapse:syn75210889/wiki/,代码获取地址:https://github.com/xyx200/brats-gli-anatomy-lesion-code。数据资源DOI:https://doi.org/10.7303/SYN75210889。
高光谱成像(HSI)可用于材料鉴别,但实际地雷筛查的效率还取决于在发现目标前需要检查多少虚警。本文研究了利用光谱角映射(SAM)、匹配滤波器(MF)、自适应相干估计器(ACE)和约束能量最小化(CEM)方法,在无人机(UAV)可见光-近红外(VNIR)高光谱数据中探测PFM-1型地雷的问题。我们比较了三种光谱特征:地面测量的SVC光谱特征、完全基于场景内核心像素的特征,以及模拟人机交互的签名引导方法。除评估受试者工作特征曲线下面积和平均精度外,我们还报告了目标发现曲线和空间候选点审查数量。完全审查引导法在验证所有七个目标区域后达到了完全基于场景内核心像素特征的检测效果,但所需审查工作量差异显著:ACE方法仅需两轮共九次候选点审查即可确认所有区域,而SAM变体则需数千次候选点审查才能确定最终目标位置。相关代码已开源在 https://github.com/SagarLekhak/IEEE_WHISPERS_2026_UAV_HSI_PFM1。
热红外(TIR)成像技术对于无人机集群在视觉退化环境中的操作至关重要。然而,由于外观特征有限、频繁遮挡以及快速机动,微型无人机的跟踪仍然面临挑战。尽管以Anti-UAV挑战赛等基准为驱动的技术已取得显著进展,现有方法主要侧重于精度,却忽视了实时边缘部署的计算约束。标准卡尔曼滤波(KF)具备边缘设备所需的效率,但其恒速假设在无人机高度动态运动和热传感器抖动下常会失效。更复杂的非线性估计器可提升鲁棒性,但往往会引入额外计算成本。为填补这一空白,我们提出了一种以自适应运动学卡尔曼滤波(AKKF)为核心的边缘感知在线跟踪流水线,该滤波器在保持实时效率的同时,通过状态相关的运动学建模对线性KF进行增强。结合瞬态假阳性抑制与运动学驱动的预测滑行,所提流水线在具挑战性的热红外条件下改善了轨迹连续性。在超越强基线(BSB)基准上的实验通过联合评估跟踪性能与计算效率,为边缘感知的无人机跟踪提供了起点,并为未来实时部署提供了见解。
领域泛化(DG)旨在学习对分布偏移鲁棒的表示。近期几何对齐方法(如CPCANet)通过批量级公共主成分分析(CPCA)提取领域不变结构。然而,CPCANet因小批量训练中的小样本问题导致协方差估计秩不足。为解决此限制,我们提出投影追踪CPCANet(PP-CPCANet),这是一种无协方差框架,可在斯蒂弗尔流形上学习全局正交基,并通过凯莱变换将其与网络参数联合优化。我们进一步引入对称破缺的分离中位PP散度目标,以提取具有密集稳健优化信号的公共主成分(CPCs)。在四个DG基准上的实验表明,PP-CPCANet在保持稳定训练的同时实现了最先进的性能。
生物医学图像分析涵盖多种成像模态和任务,但实际部署受限于扫描仪、协议和患者群体之间的严重分布偏移。高性能模型因此需要反复进行领域特定微调,这一代价高昂的循环在标签稀缺或隐私限制数据共享时变得不可行。我们提出OPERA(离线策略引导的专家路由与自适应),这是一种多智能体集成框架,通过将专家权重分配视为离线策略学习问题来解决部署瓶颈:从一个小型验证集中学习路由策略,无需对任何专家智能体进行梯度更新,然后结合测试时自适应以应对分布偏移。OPERA通过互补机制协调异构专业智能体:专家画像模块离线学习选择策略,实现专业知识的合理分配;每个智能体通过温度调整进行置信度校准,确保更可靠的概率输出;还引入分布感知自适应,利用未标记测试数据的统计量在批级别动态调整类别权重。在实例级别,通过模型间一致性和预测熵将每个样本分配给最合适的专家。我们在涵盖眼底摄影、胸部X光、CT、MRI及多模态诊断基准的9个数据集上评估OPERA,与分类、分割和多模态场景下的30余种基线方法进行比较。OPERA持续提升了性能与校准质量,表明离线策略引导的专家智能体协调是一种无需重新训练即可实现可部署生物医学AI的实用路径。代码见https://github.com/HUANGLIZI/OPERA{GitHub}。