每日精选AI研究论文及翻译
长时程智能体即使其底层模型能够解决各个组成步骤,也可能失败。它们可能丢失可变状态的踪迹,无法重新启用先前执行中的经验教训,跳过已知流程,或过早停止。我们押注于扩展执行框架(harness scaling)来改进智能体周围的执行系统,而不改变其模型权重。我们引入了StateM,一种智能体原生的运行时,它围绕持久状态、阶段局部上下文、受检转换、可恢复运行手册以及智能体和用户可共同检查的版本化流程实践来组织执行。 在Terminal-Bench 2.1上,StateM将GPT-5.5 xhigh提升至92.1%,而参考值为83.1%,GPT-5.6 Sol Ultra为91.9%。该运行手册无需修改即可迁移到GPT-5.6。使用GPT-5.6 Sol xhigh,StateM在445次试验中达到了95.3%的原始准确率,并在全部89个任务上至少成功一次。冻结的配置将GPT-5.6 Luna从76.7%提升至85.4%,超过了84.9%的Sol xhigh参考值。 使用相同的运行时、运行手册结构和黄金规则,不到38美元的适配投入就能使DeepSeek-V4 Flash在标准超时下从82.7%提升至88.1%,并在88个任务的公共核心子集上达到89.1%。仅扩展剩余的延迟敏感任务即可匹配所报告的88.8% GPT-5.6 Sol最高结果。最终评分的API使用量约为15美元,而GPT参考为574.68美元;DeepSeek总支出为52.22美元。 在BusinessBench上,基于开发集构建的特定任务族运行手册在留出数据上分别带来0.55个宏平均点和1.34个微平均点的提升;两个机制匹配的任务族提升了10.04个百分点。当任务共享执行结构时,具体规则能够泛化,而控制方法论则广泛适用。StateM将选定的事后分析发现转化为持久的、可执行的先决条件与实践,通过有状态控制使习得的控制策略变得明确且可强制执行。代码见github.com/henryqin1997/statem。
一个基准评测应当提供的不只是单一分数:使评估值得信赖的是支撑该分数的推理过程。这一点对于世界模型尤为关键,因为评判一段生成轨迹需要理解物理规律、因果关系以及世界状态是否正确演化。人类能够自然地察觉此类违反之处,然而现有基准评测中没有任何一个能够自动化这种能力:评测指标以暴力计算方式生成,缺乏可供检查或验证的推理链。我们提出HarnessEval-W,一个智能体化的评估流水线,将LLM生态系统中的“harness”范式引入世界模型基准评测。与使用固定评分规则不同,HarnessEval-W会解读每个评估案例的上下文,将评估问题分解为可测量的子问题,并生成专门的子智能体,每个子智能体配备定制化上下文和诊断工具,针对自身子问题进行推理。随后,父智能体验证收集到的证据,并将其总结为最终判定。这一分层工作流将每次评估转化为一棵透明的证据树,其完整推理链为结果提供依据。我们基于330个评估案例,对18个具有代表性的世界模型应用了HarnessEval-W。其判断与人类偏好高度一致,同时为每条生成的轨迹提供可验证且细粒度的诊断。我们将完整流水线作为动态基准评测开源,并邀请广大社区在其发展过程中贡献新的技能与评估案例,以推动世界模型不断演进。
基于组相对优势的强化学习(RL)已成为语言模型推理器后训练的事实标准。然而,在优化多个奖励目标时,现有方法通常在分组标准化之前用固定加权和将奖励向量标量化。我们表明,这种设计导致两个根本性问题:具有不同奖励分布特征的采样轨迹可能获得相同的优势值,且所有目标均以固定的相对权重进行优化,而不考虑其当前的饱和程度。因此,训练持续将梯度预算分配给已经解决的目标,而非聚焦于具有更大剩余优化空间的目标。我们提出面向多奖励策略优化的饱和感知优势重加权方法(SA-MRPO),该方法独立地对每个奖励目标进行标准化,并根据批次级别的目标饱和程度估计自适应地折扣其贡献。这会将优化努力动态重新分配给优化不足的目标,同时在经验上保持已充分满足目标的性能。我们进一步表明,饱和感知重加权能够反转更新的符号,而不仅仅是重新缩放其幅度。在具有双目标和三目标奖励组合的数学推理任务中,SA-MRPO在15项基准比较中的12项上优于GDPO的正确性目标,在AIME24上提升高达5%。在自适应推理任务中,该方法在所有五个基准测试上均提升了准确率,平均提升3.8%,在AMC23上最高提升9.2%;在编程基准测试中,通过率提升最高达2.3%,同时在所有设置中均将较易目标维持在接近其已饱和水平的状态。
科学发现通常涉及在庞大、结构化且开放式的假设空间(如分子、蛋白质序列和计算机程序)中对评估代价高昂的目标进行优化。生成模型(如大型语言模型,LLM)为这类空间提供了富有表现力的先验,但其似然度和自我评估作为目标函数及经过校准的认知不确定性的代理指标并不可靠,尤其是对于观测数据分布之外的新颖候选方案。我们提出了大型发现模型(LDM),一种基于经验构建的循环架构,将生成模型与贝叶斯非参数奖励代理模型相结合。生成模型负责提出并优化候选设计,而代理模型则预测其性能并量化不确定性,从而产生一种具有不确定性感知的价值,用以指导候选方案的生成、优化和筛选。随着每一条新实验观测数据的到来,发现记忆和代理模型都会持续更新。我们在三种涵盖不同设计模态和目标的场景中评估了LDM,包括神经网络训练、抗体设计和分子优化。与仅依赖LLM反思或传统统计搜索的方法相比,LDM在这些领域中将验证BPB的降幅提升了2.4倍,结合能相对降低了18.2%,分子多目标性能相对提升了60%以上。这些结果表明,LDM可以作为在开放式假设空间中进行高效搜索的通用发现引擎。
根据用户查询构建交互式3D开放世界具有重要意义。然而,现有方法主要是在理想化、简单的查询上进行评估,这使得难以系统性地分析和比较多模态智能体如何理解用户意图、使用3D工具以及基于文本和视觉3D世界信息进行推理。为此,我们提出了VibeWorlding,一个用于对vibe worlding智能体进行基准测试和训练的统一框架。vibe worlding智能体是一种多模态智能体,能够在多轮智能体-环境交互过程中自主推断用户意图、规划场景布局、调用3D工具,并对多模态反馈进行反思。为实现这一目标,我们首先构建了VWE-BENCH基准,包含2,616个高质量3D资产、323个人工标注的种子3D世界以及6,828条反向合成的多模态用户查询,这些查询分为具有真值的已验证查询和带有精心设计量规的未验证查询。此外,我们开发了VibeWorlding-Gym,一个联合多模态强化学习后训练框架,它整合了(1)一个沙盒环境,将资产检索、编辑和图像渲染统一为MCP工具,以及(2)一个基于量规的验证器,结合物理可行性和意图实现验证,既支持公平的模型评估,也支持可扩展的多模态强化学习奖励服务。我们的实验表明,当前前沿的多模态大语言模型(MLLMs)远未解决vibe worlding智能体任务,即使是GPT-5.5和Qwen3.8-Max的成功率也低于60%,并将瓶颈归结为精确的3D世界编辑。我们进一步发现,强化学习训练可以缓解这一弱点,并使开源多模态大语言模型甚至超越闭源前沿模型:我们的VibeWorlder-8B与前沿MLLMs相当,而我们的旗舰模型VibeWorlder-30B-A3B在所有评估模型中取得了最佳的整体Pass@1。
我们提出MOSS-VL,一个开放视觉-语言模型系列,将实时交互——边说边感知——视为一项首要能力。该模型在整个技术栈上协同设计:语言解码器仅通过门控交叉注意力访问视觉信息,使得模型在生成时能自然感知新到的帧;一个合成的交互语料库监督何时发言、何时保持沉默、以及何时修正;一个分阶段的课程将全部实时特定训练集中在一个轻量级的最终阶段,并建立在强大的离线基础之上。在离线条件下,MOSS-VL-Instruct在可比规模上具有竞争力,并在时间推理视频集上领先。在四个流式基准测试中,MOSS-VL-Realtime在开源流式模型中于三个基准上取得最佳平均成绩(在第四个上位列第二),并全面覆盖直接测试主动行为的三个子集——在OmniMMI主动警报上达到66.0,而最佳基线为37.5。MOSS-VL拥有11.3B参数,但视觉token位于解码序列之外,随着视觉上下文的增长,其相对于同骨干Qwen3-VL-8B的首token时间优势从2.8倍扩大到5.1倍。我们已在https://github.com/OpenMOSS/MOSS-VL上发布全部五个检查点、训练课程以及实时推理代码。
基础GUI智能体可以自动化处理复杂的数字任务,但其部署受到训练数据稀缺且有偏、提示模糊以及执行不可靠等因素的阻碍。日常业务流程依赖于用户特定的工具和隐性约定,因此未明示的指令可能导致不同运行之间产生任意差异。我们提出UI-Mate,一个将基于环境的训练栈与上下文演示学习相结合的基础GUI智能体。UI-Mate做出三项贡献:可扩展的基于环境的训练栈:一个闭环数据引擎通过统一的任务-验证器捆绑包,在超大规模并行环境中自动化任务生成、环境构建、展开(rollout)、过滤、能力平衡、SFT和在线RL。上下文演示学习:一种将多模态演示转化为灵活的子任务级工作流、遵循相关演示步骤并从实时界面重新规划的机制。OSWorkerBench基准与洞察:一个包含41个应用中100项长周期办公任务的基准,支持纯指令和演示引导两种评测方式。其演示资源将33项任务的自演示设置与45项任务的变体演示设置区分开:前者由同一目标的成功强智能体展开轨迹构建,后者由相关但不相同任务的人类操作录制构建。实验表明,UI-Mate-27B在通用计算机使用基准上取得了开源权重模型的最新最优结果,在OSWorld-Verified上得分为77.0%,在WindowsAgentArena上得分为66.2%。在OSWorkerBench上,它达到41.0%的严格成功率和76.9%的进度,分别比其Qwen3.6-27B基础模型高出17.7和24.5个百分点。在33项任务的自演示子集上,单条演示将严格成功率从17.2%提升至35.4%,进度从67.9%提升至81.1%,大幅提高了长周期任务的可靠性。项目页面:https://ui-mate.github.io。
智能体框架(Agent harnesses)通过协调智能体与环境的交互,已显著提升了长时域任务的性能。然而,通过复杂框架进行强化学习仍 largely 未被探索,因为将此类训练扩展到长时域智能体任务会引入根本性挑战。在本研究中,我们提出了一种统一的黑盒强化学习框架,用于通过复杂框架对通用智能体进行稳定且可扩展的优化。具体而言,我们首先构建了一个基于沙箱的执行基础设施,将任务环境和框架隔离在临时沙箱中,以支持大规模并发 rollout。随后,我们将策略优化与不透明的框架执行解耦,并在模型边界处部署服务代理以捕获模型调用。为重构多轮轨迹并提升训练效率,我们将捕获的调用组织成前缀树,并进一步适配基于评论家的 PPO 和免评论家的 GRPO 算法,以在恢复的树结构上进行优化。同时,我们在整个优化过程中保持训练与推理的一致性。最后,我们引入了混合框架训练(mix-harness training),使单一模型能够通过异构框架进行联合优化。基于 Qwen3-30A3B,黑盒强化学习在 ClawGym-Bench 上通过 OpenClaw 和 Claude Code 分别将 Pass@1 提升了 9.98 和 14.81 个百分点,且在 200–400 步优化过程中保持稳定。此外,该框架在更具挑战性的任务(如 JobBench 和 OfficeQA)上也取得了持续的性能提升。总体而言,我们的框架通过黑盒框架实现了对通用智能体的有效、稳定且可扩展的优化,并支持跨异构执行系统的统一训练。
本文研究生成建模中一个日益重要的话题:像素空间扩散模型。尽管已有大量研究探讨该话题,但大多数工作集中于小型或类别条件设置。因此,训练能够匹敌或超越成熟潜在空间对应模型的像素空间模型的实用方案仍然难以确定。通过全面的实证研究,我们首先观察到,直接在像素空间进行大规模预训练的收敛速度显著慢于潜在空间。这一观察促使我们设计一种从潜在空间到像素空间的策略:在潜在空间中高效获取生成先验,并在后训练阶段过渡到像素空间。随后,我们系统研究了决定这一过渡的关键设计选择,包括权重初始化、数据构成、预测目标、解码器架构和噪声调度,并确定了一种实用方案。该方案使所得像素空间模型在性能上匹敌或超越潜在空间对应模型,同时实现3.18至4.75倍的端到端推理加速。我们希望这些发现能为未来像素空间生成研究提供有用的实证洞见和实用指导。
大语言模型(LLM)智能体正从对话式助手演化为自主系统,能够通过推理、工具使用、代码生成和工作空间操作来执行长时程任务。随着智能体日益在持久化环境和多步工作流中运行,它们面临着与事务性数据库系统所解决的挑战相类似的问题:可靠执行、结果一致性、安全并发以及持久化状态管理。我们引入智能体事务的概念,并提出一个符合ACID规范的智能体系统框架,通过四种语义保障重新诠释经典ACID属性在智能体执行中的含义:语义原子性、语义一致性、语义隔离性和语义持久性。这些属性共同为在模型不确定性和动态执行环境下构建可靠智能体系统提供了原则性基础。为实例化该框架,我们开发了一个符合ACID规范的数据智能体,通过事务性探索-执行-验证循环、事务性技能中心、基于分歧置信度的验证、语义依赖感知的隔离以及事务感知的语义状态管理来实现上述保障。在广泛使用的基准测试上的实验结果表明,我们的系统相较于包括Claude Code在内的最先进智能体实现了10.6%的性能提升。本工作开启了将事务性原则和系统架构扩展至构建可信、可扩展且自我进化的AI智能体系统的更广泛研究议程。
人工智能长期以来一直在辅助科学研究,但大语言模型和智能体框架的快速发展正在重塑这一格局。如今,单一系统即可完成从初始假设到最终论文发表的全流程研究,这种范式现被称为AutoResearch。现有评估对智能体的运作方式及其失效环节揭示甚少:任务范围狭窄,评估仅衡量性能而非过程,失败诊断缺乏系统性覆盖和产物级可见性。为弥补这一空白,我们提出了AutoResearchEval,其包含100项基于已发表前沿科学研究的任务,覆盖7个科学领域和完整的研究生命周期,包括构思、检索、执行、分析、写作和评审。通过评估8种调度框架-模型组合,我们获得了800条自动研究智能体轨迹,并进行了过程级标注。我们将这些见解归纳为AutoResearch失败分类法(ARFT),这是一个包含45种基于实证的失败模式的框架。为实现可扩展的细粒度归因,我们利用经人工校准的“智能体即裁判”流水线来检查完整轨迹和中间产物。失败模式汇聚到一个根本性局限:当前智能体缺乏元认知循环,即能够将自身产物与所获结果进行核对,在这些产物经不起推敲时进行修正,并质疑所采取路径是否合理的能力。这些模式在所有8种调度框架-模型组合中反复出现,包括所测试的最强模型,从而将缺陷定位于模型层面,而非任何特定框架所致。编排层面的干预能否弥补这一缺陷,是一个本工作未检验的开放问题。我们公开发布AutoResearchEval和ARFT,以促进自主科学发现领域的持续研究与发展。
Prior Labs 在关系学习领域的首次发布展现了我们对开放科学的持续承诺。我们开源三款软件,期望能加速该领域研究,推动其产生切实的现实世界影响。我们旨在根据社区的反馈并与社区合作,引导后续开发方向。鉴于当前仍处于早期开发阶段,我们的 α 版本主要面向研究人员和早期采用者。过去几年中,关系学习领域涌现了多种数据集和任务,但社区尚未就这些任务上不同方法的可靠、可复现比较方式达成共识。我们的 α 版本 RelArena-α 提供了一个统一框架,通过在 RelBench v1 上标准化数据加载、评估协议、调优机制,并支持自定义调优的体系,来运行和比较各基线方法,其灵感来源于 TabArena 等成熟的表格基准。我们计划与研究社区合作,进一步将 RelArena-α 发展为推动关系学习社区进步的催化剂。我们同时发布了 TabPFN-Rel 的初始版本,这是一个专为 TabPFN-3 设计的关系学习工具框架。TabPFN-Rel 目前在 RelArena-α 上排名第一,并在 RDBLearn 基础上做出了关键改进。除了排名优势之外,TabPFN-Rel 还作为一个强基线,进一步印证了将关系数据库展平为单一表格的方法在现实任务中仍能与专门的关系架构相竞争。 为了促进关系学习方法在研究和工业界的应用,我们发布了关系预测接口(Relational Predictive Interface, RPI)的初始 α 版本。RPI 是一个开源、与模型无关的接口,使早期采用者能够轻松地在新的数据库上定义问题,并应用 RelArena-α 中实现的任何模型(包括 TabPFN-Rel)来解决这些问题。
文本到图像(T2I)生成模型的快速发展已有效解决了原始像素合成的根本性挑战,将研究界的关注重心转向满足日益复杂精细的用户需求。尽管近年来的智能体图像生成工作流通过外部知识检索和迭代推理等高级能力增强了静态推理,但这些工作流大多以固定的“一刀切”拓扑在相互隔离的孤岛中运行。这不可避免地导致了严重的计算失配,即简单查询被迫经过计算量庞大的流水线。为弥合这一差距,我们提出了GenRouter——首个面向智能体图像生成的统一工作流路由框架。我们首先构建了GenCanvas,将多种多样的智能体流水线标准化为一组通用的基础原语和可执行模板。在这一统一空间之上,GenRouter通过(i)需求剖析、(ii)经验匹配和(iii)帕累托过滤,自适应地将异构提示词路由至其最优工作流。在多个基准上的大量实验表明,与重量级静态流水线相比,GenRouter在实现更优视觉对齐的同时,将执行成本降低超过95%,延迟降低65%。此外,该系统通过持续积累经验实现自我进化,支持鲁棒的零样本泛化,从而提升性能并将计算开销减半。
部件感知的三维物体生成对于可控建模、编辑和关节化等图形应用至关重要,其中物体被表示为语义部件的连贯装配体。然而,现有的部件感知生成方法难以扩展到高度复杂的物体。随着部件数量的增加,生成精细几何体所需的 token 长度和内存开销变得高得难以承受。我们提出 MegaParts,一种可扩展的自回归三维生成框架,通过将结构化序列建模与 token 高效的向量量化形状分词器相结合来应对这一挑战。我们的分词器学习部件级几何的离散潜在表示,在高保真重建的约束下最小化 token 使用量,从而能够根据几何复杂度进行自适应长度的 token 化。在这一紧凑表示的基础上,我们训练一个大语言模型,在统一的结构化序列中生成物体包围盒、部件包围盒和部件形状 token。再结合高效的长上下文训练策略,我们这种 token 高效的表示可扩展到部件数量多达 300、序列长度高达 256k token 的物体。这大幅扩展了部件感知三维生成的规模,同时保留了组合结构并实现了细粒度的部件级控制。我们的方法在网格质量上优于基线自回归模型和扩散模型,表明压缩的离散部件 token 不仅提升了可扩展性,还提升了生成几何体可达到的保真度。这些结果表明,对于大规模部件感知三维生成,LLM 原生的 token 高效自回归建模是扩散模型的有力替代方案。项目页面可在 https://expmaster.github.io/megaparts_webpage 获取。
由大语言模型(LLM)驱动的前沿智能体系统展现出类人的认知模式。随着这些系统在不同领域的深度融合,其认知参与给人类社会带来了尚未得到充分研究的重大关切。为弥补这一空白,我们遵循一个以认知范围界定的三层框架,从物理认知到社会认知,再到自我指涉认知,系统分析了认知能力扩展所引发的风险。我们针对每个认知层级,研究其对人类能动性、自主性和控制能力的潜在风险。最后,我们提出相应策略,以缓解这些风险并增强智能体AI系统的可控性,确保其长期安全发展。
基于指令的通用视频编辑旨在通过单一直观的界面统一多样化的编辑操作。现有方法通常依赖资源密集的条件建模,要么使用重量级分支,要么采用昂贵的源拼接。是否存在一种高效的方式来建模编辑意图?为此,我们提出了 GRNEdit,一个轻量级的两阶段框架。GRN 通过位的组合来编码视觉语义,这启发了我们的方法。通过任务特定的微调,我们进一步利用这一表示,将编辑语义重新表述为对单个位的局部保留或翻转决策。因此,源信息被建模为支持观测到的二值状态的逐坐标证据,而 GRN 主干网络仍负责将其全局组合解析为连贯的生成语义。在第一阶段,一个紧凑的编码器将离散的源编码转换为连续的证据信号,GRN 在二值细化过程中吸收这些信号。受无分类器引导中空提示训练的启发,我们进一步赋予空条件一种编辑特定的含义:空指令表示不进行编辑,并通过源重建进行监督。这条恒等路径不仅隐式地加强了对第一阶段的证据利用和内容保持,而且在与编辑状态相同的表示空间中产生一个源保持状态。因此,第二阶段可以直接将每个编辑状态与其源保持对应状态进行比较,并利用它们的差异来修正未解决的目标位决策。仅使用 0.6M 对训练数据,且条件参数占比不到 3%,GRNEdit-2B 和 GRNEdit-8B 在 OpenVE-Bench 上分别取得了 4.03 和 4.18 的分数。其中 2B 模型优于多个 14B 的开源编辑器,而 8B 模型的表现与领先的开源编辑器相当。
前沿大语言模型(LLM)的安全评估在很大程度上将有害生成视为一种攻击结果,而非分析对象。因此,人们对模型在不当行为期间产生的有害输出知之甚少,部分原因在于大规模、高质量的前沿LLM不当行为数据集难以获取。为弥补这一空白,我们引入了HarmProfile——一个以内容为中心的基准数据集,该数据集收集了跨多样危害类别和模型家族的模型不当行为,并将由此产生的有害输出分布定义为模型级风险画像。其前提是,正如语言行为可以通过话语语料库来刻画,模型风险也可以通过其安全失败的内容、严重程度和变化性来刻画。HarmProfile包含来自13个模型家族的23个前沿LLM的超过80,000个经验证的产物,组织为15个危害类别和57个子类别。利用该语料库,我们发现前沿LLM确实能够大规模产生有害内容,但表现出各自不同的风险画像;危害性和多样性均随模型能力而增长,这表明前沿LLM可能看似安全,却在对齐的表象之下潜藏着日益危险的知识。我们的源代码可在 https://github.com/fresh-ma/HarmProfile 获取。
随着大语言模型日益普及,部署开放权重模型的第三方提供商已成为生态系统的重要组成部分。因此,审计其推理API的质量是一个开放问题。我们将托管模型路由形式化为随机过程,并提出\textbf{Ventor-QTest},一种无需目标API提供任何概率信息的复合黑盒审计方法。其重复请求组件将每个冻结的受限上下文多次发送至目标,根据返回的文本计数重建类别输出分布,并报告平均保真度损失(AFL),作为零偏校正的窗口内平均粗化KL统计量。其长序列组件使用独立运行,通过运行级参考中心惊讶度统计量的经验上尾报告极端保真度损失(EFL)。在三个支持logprob的路由条件下,AFL与基于logprob的粗化KL比较器表现出强烈的线性描述性一致性。在七个路由快照中,20次运行的序列探针揭示了特定于路由的EFL变化。AFL和EFL与GPQA-Diamond准确率之间几乎不存在可检测的路由级关联。相反,随着任务暴露程度的增加,显著的EFL与Terminal-Bench通过率下降同时出现。这一模式可能源于长时程任务中正确性对极端保真度损失更为敏感。这些结果支持联合报告AFL和EFL,尤其是在审计长时程智能体任务时。开源实现可在https://github.com/Tencent/AI-Infra-Guard/tree/main/services/api_checker/ventor_qtest获取。
当前矩阵乘法指数ω的最佳上界是通过对激光方法的一种改进——称为组合损失分析——获得的(Duan等,2022;Williams等,2024;Alman等,2025)。在本文中,我们关注该方法核心的优化问题,并提出若干改进。首先,我们重新表述该优化问题,从而能够在比以往更广泛的设置中求解。其次,我们利用机器学习的最新进展,为该问题设计了一种新的优化算法。最后,我们通过AlphaEvolve对所得优化算法进行改进。我们的组合方法得到了ω < 2.371177的上界,改进了之前最佳上界2.371339。
在认知科学中,资源理性研究智能体应如何分配有限计算资源以最大化期望值。大多数推理与智能体基准采用独立的单任务预算;现有的共享预算研究未将套件整体性能与同一模型已展示的单问题能力进行校准。我们提出了R^3-Bench,该基准在数学、竞赛编程和抽象推理领域,以无工具和智能体两种设置评估共享预算下的六问题套件。匹配的单问题响应曲线在观测到的成功结果上定义了离线经验oracle。在六个模型的72个主表单元中,oracle均值在所有单元中均达到或超过竞赛均值,且在71个单元中严格更高。在适度的无工具压力下,均匀分配重放在六个模型中的四个上也超过了竞赛性能。轨迹诊断揭示了有限的策略更新和依赖压力的失败模式。在强智能体压力下的三模型诊断中,九个单元中有六个至少存在一个固定调度器超过竞赛均值,但没有任何策略在所有领域中占据主导。这些结果揭示了已展示能力与共享预算实现之间的持续差距。
自我进化智能体能够从交互经验中改进未来行为,然而现有评估通常仅在固定执行条件下进行优化,并未测试当这些条件发生变化后的恢复能力。为填补这一空白,我们提出PACE-Bench(基于代码演化的物理适配,Physics Adaptation via Code Evolution),这是一个基于模拟器的基准测试,涵盖六个物理域中的144个源到目标适配对。每个适配对将一个源环境与一个具有相同目标和接口的变异目标环境相连接。在源环境中可以成功运行的代码驱动设计会在目标环境中失效,智能体必须利用诊断性沙箱反馈,在有限的尝试预算内将其迭代适配为可工作的目标设计。我们比较了来自四种范式的十种自我进化方法。该基准测试远未饱和:Reflexion + Qwen3-14B仅在全部基准测试对的35.9%上取得成功,而GPT-5.5在完整预算下解决了静力学子集的66.7%。这些结果共同表明,基于模拟器的反思比未经验证的自我修正更为可靠,而记忆机制会将智能体锚定在早期设计上,宽泛的树搜索则只探索而不收敛。即使揭示确切的物理变化也无法提升性能上限,这表明核心瓶颈在于机制重设计而非参数推断。数据和代码可在https://github.com/thunlp/PACE-Bench获取。
尽管近年来面向多参考图像生成的统一多模态模型取得了显著进展,但现有基准测试仍围绕预定义任务类型(如“主体组合”)来组织,难以适应这种组合性场景,导致覆盖碎片化、复杂度不可控,且诊断价值有限。我们认识到多样化的多参考任务共享一组原子操作,因此采用能力导向的视角,形式化了四个算子:锚定(f)、解耦(g)、应用(⊕)和组合(C)。由此,任何多参考提示词都可以表示为基于这些算子的组合公式,其结构复杂度通过算子槽位数量来量化。基于这一形式化框架,我们构建了 TRACE-Bench,包含约 1,600 个评测用例,覆盖 1 至 8 个槽位数量,由 631 个公式模板和约 4,000 张涵盖多样艺术风格与真实世界主体的参考图像构建而成。公式结构直接驱动了用于按能力评分的算子对齐评估协议,以及用于递归失败定位的诊断树分析。对 9 个领先模型的评估揭示了整体评分无法呈现的洞见:主要瓶颈在于解耦(g)和属性绑定(⊕),而非场景级组合(C);即使最佳模型在属性保真度上也仅获得 0.74 分。项目主页:https://amuseum-whr.github.io/TraceBench
视频理解是评估多模态大语言模型(MLLMs)能力的基础任务。然而,现有领先模型在Video-MME排行榜上已达到约90%的准确率,这表明传统的单轮视频理解任务正日益趋于饱和,不足以评估先进多模态大语言模型的智能水平。为此,我们提出了VideoGAIA,一个面向通用人工智能(AI)助手的智能体视频理解基准。VideoGAIA超越了单轮视频问答的范式,将视频理解构建为多轮、工具增强的交互过程,模型必须迭代地感知视频、调用外部工具、收集补充信息,并跨轮次整合多模态证据。VideoGAIA包含271个由模型与人类协同设计的任务,覆盖多样且复杂的真实世界场景。每个视频-问题-答案实例均由三位人类专家独立验证,以确保正确性和适当的难度。所有被评估的多模态大语言模型,包括GPT-5.5和Kimi-K3等前沿模型,在VideoGAIA上的准确率均低于60%,这凸显了其作为评估下一代多模态大语言模型的高质量、及时基准的价值。我们希望VideoGAIA能够推动从传统视频理解向智能体视频理解的范式转变。
我们提出了 AnyTalk,一种无需任何动画数据即可为任意角色生成 3D 语音动画的新方法。现有基于音频驱动的 3D 语音动画方法依赖于特定角色的训练数据或繁琐的绑定/重网格化,而 AnyTalk 通过利用在大规模视频数据集上训练的最新视频扩散模型规避了这些限制。我们首先通过角色特定微调(CsF)技术将预训练的视频扩散模型适配到目标角色。通过将 3D 角色的渲染图像与置零的音频嵌入(表示“无运动”)配对进行微调,我们在保留大规模视频扩散模型运动先验的同时,消除了对动画数据的需求。随后,我们通过所提出的优化过程估计融合变形(blendshape)参数,将生成的说话头视频转化为 3D 语音动画。AnyTalk 能够在多种人脸网格和融合变形配置下实现口型同步动画,显著减少人工操作和数据需求。我们进一步将 AnyTalk 蒸馏为精简网络 AnyTalk_{RT},从而提升可用性并实现实时性能。通过利用说话头视频生成技术,我们的方法拓宽了音频驱动语音动画技术在任意角色上的应用渠道。代码公开于 https://serin-yoon.github.io/projects/anytalk/。
多模态大语言模型日益采用视觉思维链(Visual CoT)来对空间、时间及具身环境进行推理。通过生成中间推理图像,Visual CoT为视觉预判提供了一种直观机制,但同时也引入了显著的推理开销,这一问题在主动视频推理场景中尤为突出。我们探究模型能否在训练阶段学会视觉思考,而在推理阶段直接进行推理。为此,我们提出内化视觉思维(IVT),一种在后训练阶段联合优化文本预测与下一嵌入预测的框架,训练数据为无标注视频。给定部分观测的视频,IVT在预测目标文本答案的同时预测未来帧的潜在表征,从而促使模型捕获运动、物体状态变化、交互行为及潜在意图。在推理阶段,IVT直接生成答案,无需合成或重新编码未来帧。我们围绕目标表征、解码器设计、预测视界、数据混合、训练课程及预测目标开展了受控研究。实验结果表明,IVT在所有六项评测设置上均优于直接答案微调方法,同时保持相同的推理路径。与显式Visual CoT相比,IVT取得了相当或更优的性能,并将平均端到端延迟降低了5倍以上。综合而言,我们的研究结果表明,视觉思维链中推理阶段所采用的显式像素空间生成,对于有效的主动视频推理可能并非必需。预测性世界建模可以在训练阶段被内化,从而产生兼具更高准确性和显著更高效率的多模态推理模型。
文档解析旨在将非结构化文档转换为结构化且机器可读的表示形式。近年来,视觉语言模型(VLM)的进展显著推动了文档解析技术的发展。然而,现有方法仍面临两大挑战。首先,基于解耦式VLM的方法严重依赖精确的版面分析,而相机拍摄文档中的几何畸变可能引入级联误差。其次,尽管基于端到端VLM的方法缓解了对显式版面检测的依赖,但在高分辨率场景下,它们往往存在冗余生成、幻觉以及结构化推理能力不足等问题。为应对这些挑战,我们提出NaviDC-OCR,一个统一的文档解析框架。NaviDC-OCR引入形变感知学习,将几何感知能力融入VLM,并提出一种自适应采样机制用于复杂版面表示。此外,我们设计了一种内容-结构解耦学习策略,显式建模公式语法和表格结构,从而实现更高效的结构化表示学习。大量实验表明,NaviDC-OCR在多个文档解析基准上取得了当前最优性能。其在OmniDocBench v1.6、Wild-OmniDocBench和PureDocBench上分别获得96.87、88.53和78.41的综合得分,并在ICDAR 2026 Sci-ImageMiner挑战赛中排名第一。这些结果验证了NaviDC-OCR在复杂文档解析场景中的有效性和泛化能力。
视觉文档检索是多模态检索增强生成的一个关键组成部分,旨在从文档集合中识别与查询相关的页面,其中证据分布在文本、布局、图表和视觉结构中。近期为获得更细粒度监督的尝试主要依赖文本描述或局部视觉区域作为证据代理。然而,此类监督信号可能忽略复杂的视觉结构,或对底层证据产生不完整和不准确的表示。为解决这些局限性,我们提出了ConceptFormer,一种用于视觉文档检索的潜在概念表示学习框架。ConceptFormer将查询相关证据建模为连续的、以查询为条件的潜在概念,明确桥接局部视觉证据与语义相关性,既不需要文本中间表示,也不直接依赖原始视觉标注。在训练过程中,ConceptFormer使用强大的视觉语言模型动态确定潜在概念标记的数量,并将这些概念作为中间表示来弥合查询与文档之间的语义鸿沟,从而引导嵌入空间的学习。在多个视觉文档检索基准上的实验表明,ConceptFormer相比最强的视觉检索基线和最强的基于OCR的文本检索基线,平均NDCG@10分别取得了16.7%和22.1%的相对提升。进一步分析表明,潜在概念能够有效连接局部视觉证据与语义相关性,使检索器既能捕获细粒度文本线索,又能理解复杂的文档级视觉结构,同时保持强大的检索对齐能力。代码和数据可在https://github.com/Neuir/ConceptFormer获取。
企业问答通常被构建为检索内部文档并生成有依据答案的任务。然而,常规企业记录是工作副产品,所需的组织关系隐含于异构来源之中。现有基准虽然提供了真实的多源证据,但往往具体化了一条预定义的答案路径,因此测试的是对已陈述事实的组合能力,而非对语料库中缺失的目标关系的恢复能力。我们将后一种能力称为潜在组织推理。 我们提出 ENTLORE,一个基于图的基准构建框架,从常规文档、权威组织表和运营记录中重建一个经审计的企业世界。版本化的组织约定在真值图中认证派生关系,从而支持完整的金标准答案和证明证书。对齐的匿名化发布仅公开文档语料库,同时隐藏私有结构和目标关系。ENTLORE 包含来自三种来源类型的 2,341 份文档,以及 907 个问题,涵盖显式查找、跨源组合和潜在组织推理,并在 56 种模型和访问配置上进行了评估。将发布的世界构建为导出实体图或可导航知识库,可获得最强的可部署结果。然而,即便提供金标准文档,仍有 30.4% 的潜在问题无法回答,而显式问题和组合问题的未回答率分别为 12.6% 和 6.2%。因此,企业问答不仅依赖于文档召回,还取决于隐含的组织关系是否变得可用。基准、数据和代码已在 ENTLORE 公开提供。
自动化检查流水线日益倾向于让一个语言模型担任检查者,另一个(或同一个)模型担任修复者。我们探究这种连接方式是否会改变检查者所报告的内容。在将当前任务保持字节完全相同的前提下,对经过人工验证正确的ProcessBench轨迹测量误报率,我们发现:模型上下文中已存在一段完整的审计→修复过程,会使15种模型×措辞组合中的全部15种组合的误报率降低,降幅为2.8至11.5个百分点(相对于长度匹配的非审计对照),即相对该对照减少9%至25%。这一方向与累积消息文献所预测的相反:在审计报告了错误的场景中,误报率进一步降低——在该操纵干净生效的模型上,全部五种措辞均如此,尽管负性不对称性预测会有更多标记。对过程进行分解后发现,修复内容与审计结论具有互补性:不同组件在不同模型家族上承载该效应。信号检测分析将该变化定位于阈值而非辨别力——判据在15/15种组合中发生移动,其中13种在校正后仍然显著,而d′在没有任何组合中保持显著,尽管d′检验在构造上灵敏度减半——对50个误报的人工审查发现其中82%确实为错误,因此在该工作点上,这一偏移未必有害。在启用推理的情况下,该效应在所测试的两个模型上均保持其相对大小,阈值解读在这两个模型上同样成立。
大型语言模型(LLMs)越来越多地被用作合成调查受访者,但现有评估只关注其回答在个体层面是否看似合理。我们认为,正确的问题应当是心理测量学层面的:LLMs 是否保留了真实人类调查数据的联合分布、潜在结构、信度、中介路径和人口学效应?我们引入了一个立陶宛组织心理学数据集(n=263 名员工;Dunham 变革态度量表、UWES-17、Koopmans IWPQ;68 个条目,12 个子量表),并在五级角色披露阶梯、呈现方式与推理努力消融、反事实人口学交换(性别、角色、教育)、跨语言检查以及逐字回忆记忆探测条件下,让涵盖 OpenAI、Anthropic、Google 及十二个开放权重系列共 37 个模型的阵容基于真实受访者画像进行条件生成。由此得到的心理测量相似性得分(PSS)以五个非 LLM 统计基线及一个留出的人类-人类比较上限为锚点,并提供了受访者自助法置信区间以及用于 Tucker's phi 的项目置换零分布。LLMs 能复现人类心理测量关系的定性方向,但在样本驱动的 PSS 组成部分上,高斯 copula 基线优于所有 LLM;LLM“群体”彼此之间的相似度(平均 LLM 间 PSS 为 0.73)高于其与人类的相似度;记忆化并未驱动排行榜(recall-PSS 秩相关为 0.00)。反事实交换揭示了教育驱动的效应(平均 |d|=0.56),远超性别(0.12)和角色(0.18);在 37 个模型中,有 8 个模型的 UWES Tucker's phi 落在置换零分布范围内。在下游分析中,每个 LLM 都表现出强烈的默许偏差(+0.84 个标准差);在合成数据上训练的回归模型在留出的人类样本上失去预测效度(平均 R² 为 -0.18,而人类为 0.28);并且模型在 10 条安慰剂中介路径中的 3 条上虚构出间接效应。LLM 样本并不能直接替代人类调查数据。
在收集作业中,不断累积的有效载荷会逐渐减慢车辆速度,从而对路径规划效率产生累积性惩罚。车载无人机可以通过取回外围物品来抵消这种惩罚,从而缩短完工时间并提高运营利润。然而,行驶时间仍然依赖于载荷,且地面车辆每收集一件物品都会改变决定无人机起飞点与汇合点的到达时间。本文提出了带无人机的旅行窃贼问题(TTP-D),通过联合优化物品选择、车辆路径和飞行同步,最大化扣除基于时间的租赁成本后的收集利润。我们构建了一个混合整数线性规划模型,可将小规模实例求解至最优;针对更大规模的实例,我们开发了元启发式算法以及基于注意力的深度强化学习(DRL)策略。我们进一步提出一种学习器初始化的混合求解器,由DRL策略构造初始解,随后通过短时退火运行对其进行优化。在两个基准测试集上,该混合方法仅需一小部分计算预算即可达到元启发式基线的大部分质量,但最大规模的实例仍需基线方法在完整预算下运行。最后,敏感性分析表明,租赁比率是盈利能力的主要驱动因素,而车队参数仅对利润产生边际影响。
语言模型以可报告的形式承载潜在量;当任务要求灵活重用时,该形式中存在的量会更多。是什么导致表征进入该形式仍属未知,而“工作空间”一词暗示了一种准入式的解释:一道决定何者进入的闸门。我们使用雅可比透镜在开放权重模型上对此加以检验,基准的五个分支共享相同的上下文,结果在它预测有闸门之处并未发现任何闸门。任务需求将概念的透镜可见性提高到对给定值应用算子所产生的水平之上:在我们主要的检查点上,百分位排名提升+0.050 [+0.045, +0.057];在我们测量的全部四个检查点上均为正,尽管该分支的回答已达到上限,而且在该读出下,准确率匹配的对比更强。同时,一个共享的线性映射能从每个分支(包括对照组)解码出该变量,其数值为选择校正后下限的6.4至9.0倍。在查询位置产生后续可读形式的原因,是中间深度窗口内由注意力介导的汇集:将补丁深度与读出深度分离后,在非饱和读出下,该处的传输至少比任何更浅处高17倍,而窗口内没有任何经测试的MLP输出作出正向贡献。在饱和百分位排名下,同一网格无法定位该窗口,这是该度量本身的事实。一个完全不需要该变量的分支,其汇集程度低至七分之一,因此该窗口是需求特定的。该窗口有两个经测量的边界:低于它则存续失败,高于它则被破坏;它在64层混合模型和来自另一个家族的62层稠密模型中,处于相同的相对深度。我们定位的是变量被安装和读取之处,而非来自文本段落的路径——该路径不传输任何内容。但该读出并非使用量的校准度量:三个组件使读数彼此相差在12%以内,但它们对答案的影响却相差7.4倍。
随着AI数据中心淘汰功能正常的GPU,大量仍具计算能力的加速器流入二级市场。本文研究这些退役GPU能否迎来富有成效的“第二次生命”,构建一个能够服务现代LLM推理的DumpsterCluster,并探讨在何种条件下此类再利用在经济上可行且在环境上可持续。我们仅使用二手组件从零开始实际搭建了一个128-GPU的DumpsterCluster,并运行了一年。按当前市场价格计算(DumpsterCluster约2.2万美元,而8-GPU B200系统约60万美元),其经济优势十分显著。通过流水线并行优化,我们基于V100的DumpsterCluster实现了具有竞争力的LLaMA-70B吞吐量,验证了生产环境下的可行性。然而,我们的部署揭示了关键的情境依赖性。老旧GPU每token消耗的能量显著更高,使得总拥有成本仅在电价低廉的地区才具有优势。在电网平均碳强度下,与当前代际的硬件相比,二手系统在8B模型上每token产生的总碳排放量约为其4倍,在70B模型上则超过40倍。这些发现表明,GPU的“第二次生命”并非普遍可持续——硬件再利用必须与低碳能源进行战略性结合。当部署在能源经济性优越且电力清洁的地区时,二手GPU为扩大AI算力提供了一条可行路径,同时能够兼顾可负担性、能源安全与环境责任。
逐字段接受/审查——其选择性风险至多 alpha,即仅当被接受字段的错误率受到控制时才接受该字段——是文档抽取系统所需的信任契约;而自然流程在真实文档上会静默地违反这一契约。在来自 800 份 CORD 收据的 13,859 个真实 claude-sonnet-5 字段(49.0% 正确)上,我们诊断出三种失效模式:文档聚类(设计效应 1.84–2.45)、得分重拟合泄漏(风险 0.127 时覆盖率 0.416,在 95% 的划分中违反 alpha=0.10)、以及并列分数堆积病态(退化分数使阈值网格坍缩,0.030 到 0.001)。我们将修复方案组织成一个有效性阶梯,每一层都说明其保证形式。拟合/验证划分流程为学习融合恢复了期望选择性风险控制:在名义 alpha=0.10 下,风险 0.096 时覆盖率为 0.318,无容差带(生产变体为 0.326)——这是一个平均意义上的点,其实际风险在 47.5% 的重新划分中超过 alpha,并非保证。采用精确二项分布尾部的 Mondrian Learn-then-Test 产生逐组 PAC 保证:字段 iid 覆盖率 0.171(风险 0.068),聚类校正覆盖率 0.140,文档 iid 覆盖率 0.060——这是唯一与文档结构匹配的层级,但坦率地说目前近乎空洞。Support-bin(预先指定的来源分类法)在 Sonnet CORD 采集数据上的每个严谨性层级都胜出(p<1e-4,经 Bonferroni 校正)——这一胜出在使用 Haiku 或 Qwen 处理相同文档时无法复现;而在准确率更高的语料库上,合并阈值方法胜出:条件化恰恰在合并方法无法提供认证之处发挥作用,在其他地方则被学习得分所涵盖。在未参与选择的 claude-haiku-4-5 上进行的冻结配置确认在两个风险水平上均成立;一项由三名标注者进行的盲法人工金标准审计验证了实用层级的接受集风险为 1.3%,而其风险预算为 10%(Fleiss' κ=0.83;标注错误呈单边悲观倾向)。相关代码以 Apache-2.0 许可证发布,并附带种子固定、回归门控的流程。
基于大语言模型的智能体正日益被部署为科学发现中的协作者,然而当前大多数研究聚焦于"AI科学家"的自主能力。我们认为,这忽视了科学团队协作中的社会性维度,而将AI科学家作为人机智能体系统(HAS)来研究——即以人机智能体对为分析单元——既未得到充分探索,也未得到充分重视。我们通过文献分析和实证研究确立了上述论点,并着重指出近期的事件和研究表明,在科学中部署智能体而不考虑人机动态关系会带来近期风险,包括科学探究多样性的减少。通过对现实案例研究的分析,我们展示了科学家与智能体能够相互增强彼此的能力。我们呼吁采用人机智能体系统的视角开展新研究,以建立数学框架来理解和促进科学发现中的人机协同。
运动语言模型(MoLMs)通常通过将三维运动词元化,并利用语言模型处理生成的词元来理解人体运动。然而,从单目视频中获取准确的三维运动具有挑战性,限制了其在实际场景中的应用。为解决这一问题,我们引入了一种即插即用的二维运动接口,使得基于三维预训练的MoLMs能够接受二维运动输入,而无需修改或微调原始模型。在公开数据集上的实验表明,我们的方法在多种MoLMs上取得了与三维运动输入相当的性能,并且优于在二维运动上从头训练的MoLMs。我们进一步构建了一个单目真实世界视频运动评估数据集,并引入了一个真实视频适配器,证明了在所评估的单目姿态估计设置下,二维运动相较于三维运动更具实用性。这些结果表明,二维运动为MoLMs在真实运动理解场景中的部署提供了一种实用接口。代码已开源:https://github.com/irajisamurai/2D-Motion-Interface。
学习生成或重建可探索世界,需要视频不仅配以RGB,还需配以相机运动、场景几何、时间对应关系,以及对于交互模型而言的控制信号。真实采集可以提供部分此类信号,但稠密几何和长程对应通常依赖于估计或专用仪器。渲染能直接提供这些量,但现有的合成资源很少在同一帧上同时包含它们,并支持对视角和外观的受控变化。我们提出WorldRover,这是一个数据引擎,用于生成艺术家构建环境中带有丰富标注的长程探索。其核心WorldRover-Engine是一个Unreal Engine管线,负责执行并离线渲染分钟级路线,同时保留完整的轨迹和场景几何。同一次探索可从第一人称、第三人称和360度全景相机在不同环境状态下重放。利用WorldRover-Engine,我们构建了WorldRover-10M,其序列将RGB与度量深度、相机轨迹以及每次探索中由轨迹导出的动作信号配对。第三人称子集还额外提供稠密光流、带可见性的长程2D/3D点轨迹,以及与相机轨迹不同的角色轨迹。该引擎可以从第一人称、第三人称和360度全景视角渲染遍历过程,支持不同环境状态或使用中性白色材质,同时保持路线和场景几何不变。因此,WorldRover将长时程世界探索转化为一个可扩展的数据生成问题,为那些必须构建、维护并重新访问可探索世界的一致表征的模型提供监督。
多项选择基准广泛用于评估大型语言模型,但多项选择(MCQ)分数将知识与对选项顺序的敏感性混为一谈,使其成为模型知识不可靠的衡量标准。在本文中,我们测试了在模型确定答案时阻止其看到选项标签是否能消除位置影响,并进而提高性能。我们评估了两种不同的去偏策略。第一种采用“先生成后匹配”的方法,第二种则对选项进行独立评分,该方法在构造上对位置无偏。两种方法均未可靠地提高准确率。完整的分解分析表明,瓶颈在于隐藏选项,而非匹配步骤。唯一能够稳定匹配基线的配置是向模型展示所有选项并配以LLM匹配器的配置。然而,完全消除位置影响仍然无法可靠地带来准确率提升,而循环置换反而常常提高准确率。对于两阶段提示,召回不平衡的聚合度量以及直接的逐问题顺序敏感性度量均未能显示出可靠的去偏效果。
检索增强生成(RAG)对于增强大语言模型不可或缺。然而,RAG系统日益容易受到投毒攻击,即注入对抗性文档以操纵生成器的输出。以往的方法依赖于输出端信号(如困惑度和一致性检查)来检测此类攻击。然而,我们的分析表明,蓄意攻击往往引发虚假自信:被投毒输出的困惑度甚至低于良性输出,这使得基于不确定性的检测失效。为应对这一挑战,我们探索了生成器的内部动态,并识别出一种独特特征,即“注意力坍缩”(Attention Collapse)。与良性生成中注意力分散的情况不同,受攻击生成的注意力集中于被投毒文档,导致熵降低。基于这些发现,我们提出了D-SCAN(文档级信号坍缩分析),一种通过监测注意力动态来识别受攻击生成结果的轻量级检测框架。在多个攻击基准上的大量实验验证了我们方法的有效性。此外,即使攻击未能改变最终答案,D-SCAN也能检测到攻击。代码可在 https://github.com/yingtaoren/D-Scan.git 获取。
边界表示(B-Rep)生成是计算机辅助设计中的一项基本任务,然而直接合成高保真且结构有效的B-Rep仍然是一个重大挑战。现有的深度生成方法存在两种脆弱性:表示脆弱性,由潜在空间中的填充噪声和特征污染引起;以及生成脆弱性,源于顺序误差传播以及因不可微有效性约束而导致的训练-推理不一致。我们提出了HiFi-BRep,一种通过两项协同贡献解决这些局限性的新框架。首先,拓扑感知编码器通过可学习查询消除填充,并利用拓扑引导注意力防止特征污染,从而构建高保真的潜在表示。其次,单阶段解码器并行联合预测几何与拓扑,将核心流形约束嵌入为可微学习目标。该设计确保几何与拓扑之间的相互引导,同时避免级联误差。大量实验表明,HiFi-BRep在结构有效性和几何保真度方面均显著优于现有最先进方法,为高质量B-Rep合成提供了一种稳健的解决方案。代码和模型已公开于 https://github.com/1nnoh/HiFi-BRep。
流式视频理解要求从正在展开的视频的按因果方式观察到的前缀中直接产生响应。现有系统增加了推理时记忆、检索和压缩,但一种免训练的滑动窗口基线已经能与它们匹敌。因此,我们固定一个无记忆的近期窗口协议,并探究仅靠后训练能达到何种程度。基于可验证奖励的强化学习并不适合这种场景,它会鼓励冗长的“先思考后回答”生成;而同策略蒸馏(OPD)能在学生轨迹上提供密集的词元级教师监督,但只有当教师和学生模型都以思考模式训练时才是稳定的。这些观察促成了 StreamOPD,这是一种结合可验证流式视频数据、思考模式 OPD 与指令模式部署的方案。它将 StreamingBench 从 77.9% 提升到 83.9%——与 9B 教师相差不到 0.3 个百分点——并在推理不变的情况下,将排除幻觉检测子任务(HLD)的 OVO-Bench 提升了 9.1 个百分点。作为教师特权扩展,时空线索门控(ST-CueGate)将“有线索”与“无线索”的教师似然比聚合成一个组相对响应分数,用于重新加权 OPD。它在 OVO-Bench(排除 HLD)上达到 71.9%,在 Video-MME 上达到 64.9%,并且是唯一在所有四个基准上保持在基础模型之上的变体。将教师替换为学生初始策略的冻结副本——即同策略自蒸馏——保留了大部分收益,并将 HLD 提高到 57.0%,高于未训练的学生模型和 9B 教师,因此弃权损失并非该方案所固有。我们为开源流式视频研究提供了一个透明且可复现的参考。
音频-文本基础模型(ATM)在严重声学噪声下会灾难性失效,然而现有自适应策略要么依赖基于梯度的测试时自适应(TTA),这往往会强化噪声而非信号;要么依赖提示调优,但后者需要推理时无法获取的特权噪声标注。针对这些问题,我们提出PRISM(原型校正迭代自监督流形去噪)——一种无需训练、无需源数据的TTA框架,其理论基础是仿射噪声假设:严重声学噪声在多模态潜在空间中诱发低秩仿射偏移,且超过90%的失真能量集中于前60个主成分。PRISM利用冻结的文本原型作为几何锚点,通过仿射偏差回归将三种闭式几何校正合并为单个静态投影矩阵,从而从未标注目标批次中估计并逆转该失真。推理时,自适应仅需一次矩阵-向量乘法(0.0009毫秒),因此远快于基于梯度的TTA,且无需任何额外训练。在UrbanSound8K上,PRISM相比零样本基线提升12.94个百分点,并且尽管从未观察过预言机辅助TTA基线所拥有的特权增强噪声提示,仍以9.41个百分点的优势超越该基线。我们还识别出“复音陷阱”——一种针对宽带类别的子空间紧缩原理性失效模式,并通过置信度感知回归(CAR)加以解决,为受影响最严重的类别恢复了高达8.16个百分点。