每日精选AI研究论文及翻译
交互式世界模型必须支持持久记忆、响应式交互和长时程生成,然而这些要求对模型施加了相互冲突的需求。在去噪器上下文或键值缓存中维护历史会带来不断增长的额外开销,迫使在会话长度与记忆保留之间进行权衡;同时,低延迟交互依赖少步生成,而少步生成的能力受限于其教师模型。Evoke 通过外部化持久世界状态并重新设计面向长时程交互式生成的教师模型,解决了这两个局限。场景几何信息维护在一个外部的、按相机索引的世界状态库中,仅检索与当前视角相关的信息,从而使去噪器上下文在会话增长时保持有界。我们没有将教师模型视为固定的生成器,而是将其设计用于长时程监督:其稀疏注意力结合了分块分组、选定远帧检索以及线性注意力全局状态,在实现内存和计算线性增长的同时,能够对长时程进行监督。这种监督暴露了在短窗口内保持局部合理性的内容漂移,而逐块条件化则支持在整个序列中进行提示词更改和事件控制。在自强迫展开下应用的 30 秒分布匹配目标,将这两项能力迁移至不使用无分类器引导的三步学生模型,从而在保持响应式条件化的同时,提升对长期漂移的抵抗能力。凭借有界上下文和循环外部记忆,Evoke 支持开放式、持续演化的生成;在单块 H200 上、384×640 分辨率下,每个 1.5 秒的块仅需 2.11 秒即可生成。作为三步世界模型,Evoke 在 WBench 上达到了最先进水平,同时在 VBench-Long 和 VBench-2.0 上保持了竞争力。
没有任何单一大型语言模型(LLM)能在所有查询和预算约束下都表现最优,因此模型路由对经济高效的部署至关重要。现有路由器采用多种不同的公式和实现方式,导致公平比较和扩展变得困难。我们提出了LLM路由的统一表述,将其视为一个序列决策过程,由五个组件构成:上下文编码器、模型编码器、评分函数、决策规则和学习信号,涵盖单轮、多轮及个性化路由。基于这一表述,我们开发了一条自动化流水线,用于构建路由监督,并联合评估路由器的响应质量与推理成本。由此产生的基准xRouteBench覆盖通用LLM、记忆增强、视觉、时间序列和个性化路由任务。我们进一步推出了LLMRouter,这是一个开源模块化基础设施,包含超过16个代表性路由器。我们的实证研究表明,学习型路由器的相对性能超过最强固定模型基线14.6%,轻量级路由器在严格的成本约束下更具竞争力,且用户条件路由能够持续提升个性化效果。
我们提出DreamX-Phi 1.0,一个面向机器人操作的动作条件视频世界模型。给定一个观测帧、一条语言指令以及一段由末端执行器位姿和夹爪状态组成的指定动作序列,该模型能够预测后续的观测结果。然而,仅有逼真性并不能保证忠实性:一段看似合理的生成视频仍可能移动了错误的手臂或丢失了被操作物体。为确保预测结果严格遵循每条手臂的指令路径,我们通过PRoPE风格的几何编码将每条手臂的SE(3)变换注入注意力机制中,从而保持手臂的身份标识和刚体运动结构。仅靠动作控制无法完全约束场景几何或小操作物体的演化过程。为此,我们添加了一个轻量级深度分支来建模场景级几何,并利用SAM3掩码结合冻结的V-JEPA教师模型,在整个抓取过程中维持物体的一致性。我们进一步通过分布匹配蒸馏,将多步生成器蒸馏为少步学生模型,以实现高效部署。在撰写本文时,我们的方法在WorldArena 2.0挑战赛中取得了Track 1第一名和Track 2第二名的成绩。我们的模型和代码将公开发布。
智能体(LLM agent)的能力不仅取决于模型权重,还取决于其运行框架(harness):提示、工具、技能和控制流。自我改进循环已经能够编辑运行框架,但单谱系搜索具有路径依赖性,且局部改进往往会导致其他任务回退。我们提出DarwinX,它将自我进化视为在冻结模型条件下对运行框架种群的筛选:一个“保留并扩展”契约只允许那些在不导致回退的前提下扩展覆盖范围的变体;一个档案库保存替代谱系以供重组;来自失败、教师和自身的证据共享同一个编辑接口。适应性来自每个基准自身的验证器:不需要黄金解答,也不需要人工挑选的胜者。在四个逐步将进化信号与测试分离的基准上,单个循环平均增加约17个百分点:Terminal-Bench 2.1在匹配基座上提升7.7个百分点至83.2%,在更强基座上达到84.7%的已验证前沿;TerminalWorld的保留划分达到68.3%,超过所有现成智能体;WebArena-Infinity真实任务pass@1经审计干净后从43.5%提升至93.0%;一个Terminal-Bench 2.1运行框架原样迁移至SWE-bench Verified仍然有效。真正进化的是通用智能体能力,而非针对特定基准的补丁,因此它能够经受任务、验证器和基础模型的改变。冻结的模型未必是固定的智能体:运行框架选择将评估计算转化为持久能力。
科学发现日益需要能够对异构模态的科学证据进行推理、与科学工具和环境交互、并在长任务周期内持续取得进展的AI系统。我们提出Intern-S2-Preview,一系列旨在支持多模态科学理解、推理、生成和长周期任务的科学智能体基础模型。训练流程首先在渲染后的科学文档、图文交错数据和多样化科学语料上进行科学多模态预训练。从预训练检查点出发,我们应用统一的后期训练流程,包括监督微调、可扩展的多任务强化学习(RL)、黑盒与白盒智能体强化学习,以及同策略蒸馏。该流程得到多项实用技术的支撑,这些技术提升了rollout和训练的稳定性与效率,包括带离策略校正的部分rollout、自适应长度正则化、在线投机解码、稳健的多任务优化,以及面向智能体任务的轨迹感知经验组装。在架构层面,Intern-S2-Preview-397B将时间序列建模从高效的长序列理解扩展到数值预测,同时Memory Decoder作为一种独立的记忆增强路径被研究,用于在不修改冻结的397B主干网络的情况下实现快速科学领域专业化。在科学、多模态、智能体和通用基准测试上的评估表明,Intern-S2-Preview-397B在多种场景下取得了具有竞争力或领先的结果。时间序列模块提升了SciTS上的科学信号理解与预测能力,而独立的Intern-MemDec-4B扩展在无需修改冻结的397B主干网络的情况下,将Biology-Instructions平均得分从56.92提升至60.32。
随着大语言模型日益参与科学评估,我们研究了一种潜在的奖励作弊形式:在报告的科学内容保持不变的情况下,修辞选择如何影响AI评审判断,以及这些效应在不同评估条件下如何变化。我们构建了一个受控语料库,包含来源于120篇匿名ICLR 2026投稿的4,200篇完整论文手稿。两个LLM改写器沿六个修辞维度向相反方向改写,五个LLM评审员在标准和严格协议下评估由此产生的手稿。我们还测试了联合改写、递归改写和评审员引导的改写。我们的结果表明,修辞敏感性是结构化而非均匀的。证据框架和新颖性立场在总体评估中产生最大的正负对比,范围框架构成较弱的第二梯队;其余维度的影响较小或不太稳定。这一层级结构在不同的人工评定质量水平间保持一致,但分数变动强烈依赖于AI评审员的原始分数:较低分数趋于上升,较高分数趋于下降,方向性对比在中段范围内最为清晰。更精细的工作流程并不可靠地带来更大的收益。联合改写强烈依赖于改写器,评审员引导并不始终优于无引导的第二轮改写,而重复改写产生递减且依赖配置的收益。在各种条件下,改写器主要决定对立变体之间的分离程度,而评审员决定其分数效应的幅度和方向。严格评审使总体评估均值降低1.36分,但不持续改变修辞敏感性。这些发现揭示了修辞呈现何时影响AI科学评审,并促使构建对科学写作中内容保持性变化具有鲁棒性的评估系统。
将多模态源转化为精简且结构化的媒体输出,从根本上可以概念化为一个以模型-框架(model-harness)系统为核心的长周期智能体过程。理想情况下,框架系统应当与人类设计先验保持一致,并通过经验性探索积累可复用的经验,从而驱动递归式自我改进;然而,现有范式仍是静态的,无法实现这一能力。在本文中,我们提出AutoDesign,一个与人类设计先验对齐的框架,其中元框架优化器(meta-harness optimizer)引导代码智能体基于回滚反馈(rollout feedback)递归地改进框架。为实例化和评估该框架,我们聚焦于学术论文到海报生成任务,并引入PosterBench,该基准包含覆盖五个学科、共100篇论文的主轨(Main Track),以及PosterBench-mini——一个用于受控评估的10篇论文共享子集。在PosterBench主轨上,AutoDesign取得了78.32的最高分,超越闭源商业系统Claude Design达7.45分。在七种受控代码智能体-模型配置中,集成学习得到的DesignHarness持续提升性能,将平均PosterBench得分从54.99提升至67.39(+12.4%)。在完全自主的长周期循环中,该系统在40分钟内、成本不到3美元的条件下执行了253次工具调用和11轮编辑,在人工评估中达到平均会议海报质量。一项系统盲测人工研究进一步表明,AutoDesign在评估系统中获得了最高的人类偏好。
视频世界模型根据当前观测和用户动作模拟未来状态。近期系统在长序列上展现了令人印象深刻的视频一致性和动作可控性。然而,公平地比较这些交互式模型仍然具有挑战性。在实践中,人类玩家通常通过交互追求长期目标来评估世界模型。例如,用户可能会旋转360度以检查环境是否保持一致,或走入水中观察是否生成逼真的水波纹。为实现相同目标所需的动作序列在不同模型之间可能差异很大,这使得固定动作条件下的评估不适合用于跨模型比较。为解决这一问题,我们采用多模态智能体玩家与世界模型交互,以实现指定的长期目标。基于这一范式,我们推出了PlayWorld,一个提供171个场景的基准测试,每个场景都有明确的目标。为了全面评估性能,我们从四个核心维度对模型进行评测:几何一致性、交互保真度、视野外演化和洞察演化。此外,我们还引入了视频质量和可控性的基础能力指标。对九个最先进世界模型的实验表明,当前模型在长期交互目标上仍然不可靠,尤其是在保持空间一致性和持续状态演化方面。代码和数据可在 https://github.com/kxding/PlayWorld 获取。
空间智能正在成为具身智能体、机器人规划和多模态助手的基础。为提升VLM智能体的空间推理能力,现有工作主要沿两条路线展开:一条路线采用后训练方法,如监督微调和强化学习;另一条路线采用智能体范式,模型调用外部空间工具(如深度估计和三维重建工具)以收集中间空间证据。我们研究了一条互补且尚未被充分探索的路径:冻结的VLM智能体能否在不依赖外部专家空间工具推理的情况下,通过无参数更新的自我进化来提升其空间推理能力?我们提出空间记忆智能体(Spatial Memory Agent, SMA),一种基于经验的运行时框架,将经验证的空间经验转化为可复用的可迁移经验。在可验证的空间环境中,SMA查询冻结的VLM,获取预测答案和奖励,并利用验证器引导的反思从空间经验中提炼紧凑的可迁移经验。SMA进一步为每条经验分配一个迁移可靠性评分(Transfer Reliability Score, TRS),该评分初始化为均匀分布,并根据后续检索结果进行校准,作为未来迁移可靠性的访问证据。在只读部署阶段,SMA通过语义过滤器和相似度-TRS联合排序来检索经验,使检索到的记忆能够引导冻结模型的推理。在五个代表性空间基准和四个基础VLM上,SMA在每组基础模型上均取得最高宏平均准确率,并在20项评估中的大部分中取得最佳准确率,为所评估的冻结模型规模和环境中的空间自我进化建立了一条实用的无参数更新路径。
我们首次系统研究了层交错式HLA大语言模型中的大规模激活(MAs),并揭示了两种与架构对齐的形态:MAs在全注意力层之前立即尖峰,形成注意力前尖峰(PAS),并且可以穿过中间的线性注意力层持续存在,从而产生尖峰间平台(ISP)。随着全注意力层变得更加密集,连续的PAS通过ISP日益连接起来,最终恢复全注意力大语言模型所特有的稳定MA形态。我们验证了这种组织在五种线性注意力架构、六种混合配置、五个数据领域以及参数总量从1.2B到397B的具有代表性的开源混合模型中的复现性。基于GDN的混合模型在高达1.3B参数规模下的受控预训练表明,这两种形态都在早期出现,并对输出门控表现出不对称响应:全注意力输出门控强烈削弱其绝对幅度,但不会消除其逐层组织;而移除GDN门控则产生相对适度的放大。在机制上,我们的系统性离群值分析支持一个由MA取消时机支配的共享生命周期解释。PAS遵循局部化的写入-吸收-取消过程,而ISP的延长持续与延迟取消一致。在全注意力极限下,这一解释恢复了全注意力大语言模型的特征性稳定MA形态。我们的代码可在https://github.com/StartluxLabs/Massive-Activations-HLA获取。
姿态驱动的人体动画根据单张参考图像和驱动姿态流合成目标人物的视频。实时生成对于直播、远程临场和虚拟化身等交互式应用至关重要,然而基于扩散的系统生成单个片段需要数分钟到数小时,无法实现响应式交互。我们提出LiveAnimate,据我们所知,这是首个将实时流式生成与十亿参数规模下稳定长序列生成相结合的动画系统,基于一个140亿参数的视频扩散Transformer(DiT)。两阶段训练流程首先通过参考锚定的教师强制适应,将预训练的双向DiT适配为块因果自回归生成器,再通过块级自强制蒸馏将采样预算降至三步。为在长时间流式生成中保持外观一致,我们引入姿态检索Sink注意力(PR-Sink),这是一种有界KV缓存机制,结合了永久锚定首个生成块的静态Sink、持有姿态检索历史块的动态Sink,以及一个三槽滚动窗口。当某个姿态重复出现时,PR-Sink能恢复相关外观上下文而无须保留整个序列,因此内存占用和每块延迟均保持恒定,与流式时长无关。结合Ulysses序列并行与算子融合,这些设计使系统在两块NVIDIA H100 GPU上实现19.63 FPS的流式推理。在三分钟基准测试中,LiveAnimate从最初30秒到最后一分钟几乎保持恒定的感知质量和身份一致性,而此前系统对同样的长序列生成要么显著退化,要么需要数小时的离线计算。这些结果为交互式全身动画在质量、延迟和时长方面确立了新的工作点。
说话视频人物替换要求在协同迁移外观与声音的同时,保留源动作、场景、语言内容及音视频时序。现有方法对两种模态分别使用独立优化的模型,导致音视频一致性难以保证。我们提出UniSwap——首个在说话视频中实现流式联合音视频身份替换的框架。给定源视频、参考图像和参考语音片段,UniSwap在统一的音视频扩散Transformer中完成参考外观与声音音色的迁移,同时保留源内容与动态。为解决跨身份对齐训练对稀缺的问题,我们引入交换-重建流程,从真实片段中移除视觉与语音身份,并以原始片段作为重建目标。从双向骨干网络出发,我们通过上下文预训练(用于联合替换)、条件流式适配(用于块级因果KV缓存生成)以及高效自强制DMD(用于缓解暴露偏差并将每块去噪步数从30减少至3)逐步适配模型。高效多LoRA切换使三种DMD角色共享同一冻结骨干网络。特征RoPE分解将缓存位置保持在训练范围内,支持稳定的长序列推理。实验结果表明,该方法实现了强音视频同步、具有竞争力的身份保持、高效的流式生成以及稳定的长序列生成。
自回归Transformer沿两个轴进行计算:水平方向跨越生成的token,垂直方向贯穿模型深度。密集注意力赋予每个token对过去内容的广泛水平访问能力,但解码步骤之间的垂直反馈通道仍然狭窄:只有采样得到的token返回栈底,而顶层的隐状态被丢弃。我们引入了全带宽Transformer,通过潜变量反馈拓宽这一通道:在每个解码步骤,先前顶层的隐状态通过门控线性单元与采样的token嵌入融合,并作为下一输入反馈回去。潜变量反馈使得未被言语化的计算能够以全新的深度预算重新进入堆栈,同时保持标准Transformer架构、KV缓存和语言建模目标不变。为了在不损失并行教师强制训练能力的前提下训练全带宽Transformer,我们采用了一种调度式多遍目标,在预训练后期引入潜变量反馈,并混合少量更深的反馈通道以确保稳定性。我们训练了参数量为10亿、数据量高达4000亿token的全带宽Transformer,发现潜变量反馈改善了验证损失、5-shot语言模型评估、数学与代码生成以及指令微调性能。在逐token解码开销可忽略不计的情况下,全带宽Transformer能够匹配或接近使用约1.5倍token训练的 standard Transformer 的性能,并能在相同或更高准确率下生成更短的推理轨迹。
视觉标记剪枝能够显著降低多模态大语言模型(MLLMs)的推理成本,但现有方法主要依赖固定的手工启发式规则和代价高昂的专家试错。随着剪枝目标、预算和模型架构的多样化,人工在日益扩展的设计空间中探索变得越来越困难。本文旨在通过回答一个自然问题来构建面向视觉标记剪枝的AI4AI框架:大语言模型能否自动设计有效的视觉标记缩减算法?尽管大语言模型具备广泛的算法知识和强大的推理能力,但将这些通用知识转化为针对特定任务的有效解决方案仍然并非易事。我们认为,关键在于设计一种恰当的搜索状态表示,将大语言模型的内部知识与视觉标记剪枝的结构要求和约束联系起来。基于这一洞察,我们提出了AutoPrune,一个免训练的大语言模型驱动视觉标记剪枝策略设计框架。其核心是引入了一种标记剪枝领域特定语言(TPDSL),包含131个可复用原子组件,用于预算控制、标记评分、选择约束和标记重组。TPDSL的一个关键特性是,它将每个搜索状态表示为对强基础策略的残差修改。这种残差形式缩小了搜索空间,并将大语言模型的注意力引导到对性能影响最大的策略组件上。在14个多模态基准和三个MLLM骨干网络上的实验证明了AutoPrune的有效性、高效性和可迁移性。即使移除94.4%的视觉标记,AutoPrune仍能保留超过99%的全标记性能,同时将FLOPs降低9.9倍,预填充延迟降低6.4倍。
大规模操作数据对于机器人学习至关重要,然而采集机器人演示数据仍然成本高昂且难以规模化扩展。与此同时,丰富的第一人称人类操作视频提供了大量的行为经验,但由于人类手部与机器人末端执行器之间的差异,跨具身迁移仍然具有挑战性。视频世界模型的最新进展为实现从人类观察中合成以机器人为中心的操作视频提供了有前景的途径,但其跨具身迁移能力在很大程度上仍未得到探索。为此,我们提出了H2R-Bench,一个用于评估跨具身人至机器人操作视频生成的基准测试,其中模型在指定具身约束下将第一人称人类演示视频转化为机器人操作视频。该基准的每个实例包含一段人类演示视频、目标具身约束以及涵盖任务目标、动作事件、功能接触和物体响应的源标注信息。H2R-Bench从五个维度评估生成的视频,包括目标状态完成度、动作事件完成度、功能接触迁移、具身正确性和通用视频质量。我们评估了十一个最先进的视频生成模型,涵盖六个操作类别和两种机器人具身。评估结果表明,当前的视频世界模型在人至机器人操作迁移方面仍存在较大局限:即使是领先模型也常在具身一致性、功能交互和任务执行方面表现不足。H2R-Bench提供了一个系统化的诊断框架,用于评估视频世界模型是否能够弥合人至机器人之间的具身鸿沟,并将人类操作观察转化为以机器人为中心的训练资源。
测试时计算扩展是大型推理模型(LRMs)性能的主要驱动因素,但极度的低效限制了现有方法,并将关键问题从花费多少计算转变为将计算分配到哪里。我们将测试时推理形式化为在部分轨迹上的受限计算分配问题。在固定硬件预算下,现有范式无法主动将计算分配给最有前景的部分进展:传统的并行采样独立地处理轨迹,导致严重的内存瓶颈,而削减式剪枝则使硬件得不到充分利用,且无法主动且充分地改变输出分布。为克服这一两难困境,我们提出了 Gambit,一种执行思维级束搜索的推理算法。通过定期剪除无前途的轨迹并立即从高质量前缀进行分支,Gambit 通过轻量级评分器探测隐藏状态,动态地将计算集中到最有前景的推理轨迹上,同时保持持续的高硬件利用率。跨多个模型和基准的广泛评估表明,Gambit 严格优于现有基线。在相同硬件约束下,我们的方法相对于剪枝基线在 HMMT-24 上取得高达 +6.7% 的绝对准确率提升,在 AIME-25 上取得 +3.3% 的提升;将轨迹完成的吞吐量提高 2 倍以上,并且相对于标准并行采样,总词元消耗最多减少 68.5%。
智能体技能是将程序性知识与领域专长封装起来的标准化格式,在智能体框架系统中充当持续约束语言模型行为空间的关键机制,以实现可重复、高质量的任务执行。然而,由于强闭源模型推理成本高昂,当前流行的智能体框架(如Codex和OpenClaw)在部署这些技能以完成现实任务时,成本仍然高得令人望而却步。可在消费级GPU上部署的开源模型能力快速提升,为通过利用基于技能的行为约束大幅降低这些成本提供了极具吸引力的契机。尽管如此,针对这类小型模型自动生成行之有效的专属技能仍是一项重大的实践挑战。为此,我们提出SKILLER——一种自然语言驱动的强化学习框架,旨在为小型模型自动生成执行者专属技能。该框架将强模型作为行动者和评论家,将小型模型智能体系统视为环境,并完全通过自然语言传递所有强化学习信号。基于Qwen3.5-9B和Qwen3.5-4B在五个相关基准上的大量实验评估表明,SKILLER优于三种开源和一种闭源的技能生成或演化方法,在9B模型上取得了4.3至20.4个百分点的绝对提升,在4B模型上取得了1.8至13.3个百分点的绝对提升,同时在SkillsBench的单技能任务中表现卓越,与强闭源模型性能相当。项目代码可在 https://github.com/DANG-ai/SKILLER 获取。
交互式自回归视频生成既需要低延迟的生成过程,又需要精确的在线控制。少步蒸馏通过减少去噪步骤来加速生成,而在线控制则引入了因果约束:帧和块应依赖于历史信息以及生成时可获得的控制信号。然而,现有的视频分布匹配蒸馏(DMD)流程通常使用对完整片段评分的双向教师网络来监督因果少步学生模型。因此,某个目标的评分可能依赖于学生生成该目标时无法获得的未来帧和控制信号,从而使教师监督与学生模型的因果信息集产生错位。我们提出了上下文匹配蒸馏(CMD),这是一种因果 DMD 框架,它将教师监督与每个目标生成时可用的信息对齐。CMD 使用因果教师模型替代双向全片段评分:该教师模型在评估每个目标时无法访问未来帧或控制信号。同一个因果教师模型用于初始化少步学生模型,从而在教师训练、学生蒸馏和推理过程中建立一致的因果表述。除对齐时间信息边界之外,前缀评分(Prefix Scoring)通过在每个目标所对应的、已缓存的学生生成前缀下评估该目标,使监督与学生实际的生成上下文相匹配。前缀扰动(Prefix Corruption)通过扰动训练早期产生的不可靠前缀来进一步稳定训练,同时保持这种目标-上下文对齐。凭借简单的因果设定,CMD 自然可扩展到逐帧和逐块生成、长视频蒸馏以及相机条件蒸馏。实验表明,在短视频和长视频基准上,CMD 在自回归方法中取得了最先进的整体性能,并且显著提升了对时变相机控制的遵循程度。
我们提出了一种循环Transformer架构,其具有固定大小的记忆,能够泛化滑动窗口注意力,同时在训练期间保持可并行化。该架构由两个耦合模型组成:一个预填充器Q,利用完整注意力(在实际应用中,我们对Q采用交错的全注意力和滑动窗口注意力,因为这样能带来更强的性能;基本要求是Q比P更具表达力,并能访问完整历史)来生成记忆目标m'_t;以及一个解码器P,仅使用滑动窗口注意力和循环K/V注入来生成用于下一个词元预测的解码器记忆m_t。我们使用记忆一致性损失来训练该架构,使m_t与m'_t对齐,从而允许推理时仅使用P。实验结果表明,与滑动窗口和潜在循环Transformer基线相比,该方法在验证损失和下游预训练基准上均有改进。此外,在P和Q之间共享参数可在保留大部分收益的同时减少参数存储。
长视野LLM智能体必须保留过往交互中的信息以支持未来任务。现有记忆系统通常依赖即时整合机制,在每次交互后调用LLM来提取、总结或更新记忆。这种设计导致随着对话增长,记忆构建成本不断攀升。粗粒度的摘要可以降低构建成本,但可能丢弃细粒度的上下文证据,而更大的检索上下文或多跳LLM推理则将开销转移到查询阶段。我们提出LycheeMemory V2,一种高效的长时记忆框架,将回合级整合替换为语义片段级整合。LycheeMemory不对每次交互进行整合,而是将多次交互批量打包为片段,并将每个已完成的片段编码为上下文无关的类型化记忆记录。片段级批量处理降低了LLM编码频率,而语义边界检测相比固定窗口批量处理,有助于保留连贯的事件级和时间级证据。生成的记录通过轻量级结构化索引组织,以支持查询规划的证据检索。使用GPT-4.1-Mini的实验表明,LycheeMemory达到了最先进的性能,在LoCoMo上达到89.22%,在LongMemEval-S上达到92.20%。与A-Mem相比,它在LoCoMo上将构建token减少86.0%,在LongMemEval-S上减少75.9%,且没有增加查询时的token用量。更广泛地说,我们的结果表明,长时智能体记忆的准确率-成本权衡不仅取决于保留了什么信息,还取决于信息整合的粒度。
大语言模型在超出其能力范围的任务上会产生计算成本高昂但语义空洞的推理,由此带来风险——那些听起来合理但实际错误的推导可能误导用户。我们通过系统分析刻画了这一徒劳推理现象,揭示了普遍存在的能力越界以及能力与行为之间的系统性校准失准。主要的失败模式是似是而非的推理,其输出表面上看似合理,但包含细微错误,并随任务难度增加而加剧。为解决这一问题,我们提出了CaRL(能力对齐强化学习,Capability-aligned Reinforcement Learning),该方法通过奖励塑造激励模型拒绝徒劳推理,并通过事后拒绝增强将失败转化为拒绝监督,从而使模型行为与能力边界对齐。实验表明,该方法在不同任务难度下显著减少了徒劳推理,同时保持了性能,有效实现了能力对齐行为而不牺牲效用。https://github.com/icip-cas/Knowing-When-to-Quit
指令微调的语言模型在一系列生成任务上表现出色,但近期研究也表明它们会展现出表述性的过度自信。在问答任务中,模型表述性的过度自信可能与其生成的支撑推理依据的一致性相关。本文研究了指令微调所引发的模型置信度变化是否伴随着生成的答案推理依据在词汇多样性上的相应变化。我们在问答基准上评估了三组匹配的基础模型和指令微调模型,发现指令微调持续地改变了答案置信度,尽管预测准确率变化有限,且基于似然的校准有所下降。其次,我们观察到指令微调对推理依据多样性的影响是非均匀的:跨推理依据的多样性持续下降,而表层词汇多样性在方向和幅度上均随模型和基准的不同而变化。最后,我们发现这些差异在控制答案选择和推理依据长度后仍然存在,从而证实置信度和推理依据多样性捕捉的是指令微调的不同效应。
大语言模型(LLM)在自然语言任务中展现出卓越的性能,然而它们基于静态语料库进行训练,其知识在快速变化的世界中很快就会过时。这推动了知识编辑(KE)的发展,该技术在不改变无关知识的前提下更新LLM中的特定知识。近期研究从结构化知识三元组转向非结构化知识编辑(UKE),其中编辑内容是一段可以同时陈述多个事实的自由文本段落。然而,现有编辑器注入了这样的段落却未能加以利用:编辑后的模型能够回忆该段落,但既无法回答关于其事实的原子性问题,也无法将这些事实组合成多跳推理。我们将这种缺失的属性——称之为可组合性——归因于编辑器被动地依赖固定段落作为唯一学习来源。为此,我们将编辑转化为从同一模型的特权上下文状态进行的主动性自蒸馏,该方法无需外部监督。我们进一步揭示,由于注入知识的新颖性,编辑前模型自身的采样轨迹很少覆盖这些知识,这限制了纯在策略蒸馏的有效性。为弥补这一差距,我们提出了HPSE,它构建了一种混合轨迹,在学生的自身轨迹覆盖失败的位置精确介入以补充缺失的事实,同时在其他位置保持在策略内。我们从理论上分析了HPSE相较于纯在策略蒸馏的优势,并通过实验在四种LLM骨干模型和两种KE编辑器下、多种场景中确立了其即插即用的改进效果。
大型音频语言模型(LALMs)在理解多样化音频输入方面已展现出强大的能力。这种多样性包括人类听不见但仍能进入模型并影响其生成的低频信号。然而,此类低频输入对 LALMs 的实际影响在很大程度上仍未被探索。本文提出了一种不可听红队方法——间歇性低频锁定(ILL),用于在黑盒设置中利用通用波形模板评估这一风险。ILL 使用句子注意力尺度估计来确定活跃区间,并通过频率混淆迁移从语料谱变异中构建具有连续相位的低频波形。为缓解这一风险,我们提出了分布性重新查询防护(DRG),用于检测低频分布偏移,并有条件地请求第二次录音以进行语义恢复。在六个 LALMs 和多项音频理解任务中,ILL 将准确率降低了高达 67 个百分点,同时其平均人类可听度评分为 1.33,接近干净音频的 1.17;DRG 在干净音频重新获取后将平均受攻击准确率从 28.5\% 提升至 46.1\%。这些发现揭示了 LALMs 此前被忽视的安全风险,并为未来鲁棒音频理解研究提供了基础。
本文报告了一项关于AI编码代理在规范优先协议下执行大规模架构重构的单一、完全仪器化的案例研究,所生成的代码未经人工审查,亦无预先存在的预言机来验证目标行为。该任务——拆除一个庞大且相互依赖的代码库中的核心不变量——被作者评估为通过增量重构实际上不可行,属于传统上需要重写而非重构的变更类型。在本文所述的协议下,该代理成功完成了任务。 该系统是一个包含717,725行代码、横跨3,648个文件的生产级TypeScript应用。该任务要求拆除一个核心生命周期不变量:即UI面板在AI请求持续期间保持打开的保证。目标行为是流式生成在其面板关闭后仍能存活,并在重新打开时能够重新附着到同一实时流上,既不丢失也不重复。 该协议包括:由代理进行形式化规范编写,14轮针对源码审计该规范的精化循环,原子化实施,编译/测试反馈循环,以及随后17轮针对冻结规范审计代码的验证循环。在31轮审计中,共有201个缺陷在任何人实际运行程序之前被纠正。收敛标准是经验性的:连续两轮验证均返回零发现。 该变更涉及189个文件(其中31个为新文件);加上提取阶段,两次提交共计288个文件,34,770行插入,16,422行删除。在首次会话及随后大约三十次会话中,软件行为均符合规范,未观察到任何缺陷。耗时:三天;成本:2,430美元。 完整的规范文档和原始会话日志(超过1,500页,法语撰写)已作为证据公开,以便审查该过程,并可提交给语言模型进行一致性检验。
肋骨骨折在计算机断层扫描(CT)上常见且定位耗时。我们探究了在两张正交CT投影(前后位和侧位)中独立检出的骨折能否跨视图配对并三角化为可靠的3D点,同时将假输出率控制在预设水平;我们通过一项分阶段诊断研究回答了这一问题。投影几何是精确的,且在对应关系正确的前提下,定位是准确的(中位数4.0 mm,88%在10 mm以内,93.6%肋骨定位精确)。在一个封存的55例队列中,原则上很大一部分骨折是可恢复的(61.1%具有双视图可用性,58.4%的骨折在候选图中存在正确配对),但根本限制既非几何也非定位,而是受置信度限制的跨视图对应。一项检测器×对应的受控析因分析将操作增益归因于侧位检测器质量,而非所测试的匹配方法;重新训练侧位检测器产生了首个非零的受控预算重建结果。在刻意保守的承诺策略下,预先指定的封存测试将601处骨折中的15处提升为正确的3D定位,每例0.436个假点(端到端承诺产出率为2.50%),且所承诺的点位准确(中位数1.49 mm,93%肋骨定位精确)。低产出是置信度门控弃权的结果,而非几何或检测问题:该研究建立了一个可复现的选择性3D定位框架,并确定跨视图对应是主要操作瓶颈。
机器翻译(MT)系统常常无法正确翻译性别,尤其是在从英语这样的性别中立语言转换为罗马尼亚语等有语法性别的目标语言时。这种偏差导致译文默认使用阳性形式,或强化性别刻板印象。我们提出一种混合流水线,将基于大语言模型(LLM)的性别分类与神经机器翻译(NMT)相结合,以缓解这一问题。该系统使用微调后的 LLM 检测英语句子中目标词的预期性别,并插入行内性别提示标签。随后,这些带标签的句子被送入一个经过微调的 Transformer 模型,以生成形态学上正确的罗马尼亚语译文。为此,我们引入了三个用于性别消歧和翻译的新数据集。与基线 MT 系统相比,我们的方法在 WinoMT 和 WinoGender 基准上的性别准确率提升了超过 40 个百分点。这是首个同时利用 LLM 推理和标签感知翻译来明确处理并评估英语-罗马尼亚语机器翻译中性别偏差的方法。
航空运输中的极端事件,例如严重的到达延误和异常飞行时间,会引发级联性的网络中断,造成巨大的运行、经济和安全成本。此类事件在历史记录中较为罕见,导致机器学习模型可用的训练信号不足。合成数据增强提供了一种合理的解决方案,但传统生成模型对分布尾部的表征不足,且无法保证不产生运行上不可行的实例,例如短飞行时间与长飞行距离的组合。现有方法均无法同时解决混合类型表格数据中的这两个局限性。我们提出TailBooster,一个双层生成框架,将生成建模与两层异常检测相结合。统计层通过四分位距提取极端值,为专用生成模型(此处为表格变分自编码器)提供集中于尾部的训练信号。深度学习层随后应用基于自编码器的清洗,剔除违反从历史数据中学习的运行包络的合成记录。该框架在美国航班数据上从五个维度进行了评估:多样性、统计相似性、保真度、运行有效性和效用性,后两者为主要改进目标。数据驱动的清洗显著提高了运行有效性,而针对性增强则提升了极端事件预测的效用性。在六种回归算法中,相对于传统合成数据,基于该框架记录的训练在极端飞行时间预测上将平均绝对误差降低了47%–49%,在极端到达延误预测上降低了29%–57%;当真实记录与合成极端值相结合时,也获得了相当的增益。TailBooster完全基于数据驱动且与模型无关,可推广至极端事件预测至关重要且缺乏领域特定规则的其他领域。
半监督语义分割长期以来一直围绕着一个问题展开:该信任哪些伪标签。针对当时噪声大、置信度不足的ResNet教师模型,动态阈值、逐类课程、软置信度权重等一系列选择规则曾回答了这一问题。自监督基础编码器改变了这一格局:在使用DINOv2教师模型时,置信度趋于饱和,因此曾帮助弱教师模型的过滤策略反而可能伤害强教师模型。我们提出CW-BASS v2——一种饱和感知的伪标签选择方法,它读取教师模型的置信度状态,而非固守单一规则。它将留出校准(一种无偏的逐类噪声估计)与一个自适应置信度下限相结合,后者可证明地将保留率约束在远离1的范围内,并将二者组合为单遍门控:在留出切片上度量教师模型置信集合的可靠性(pi_kept = Pr[正确 | c ≥ tau]),当pi_kept ≥ tau满足所要求的置信度时进行严格过滤,否则回退到自适应下限。该边界是预先存在的操作阈值,而非针对mIoU调校的值;在六个DINOv2教师模型上,它能在盲测中正确判断应选择严格过滤还是下限。因此,CW-BASS v2在置信度饱和的基准上通过选择严格过滤恢复了UniMatch V2的操作点(Pascal VOC 1/8上为87.4,对比其报告的87.9;Cityscapes上相差不超过0.5),并在置信集合不可靠的情形下(pi_kept约89%,ADE20K)对其有所改进,此时下限方法略微领先(单一种子,+1.5 mIoU)。这一门控是有原则依据的,因为它所避免的失败是经度量而非假设的:在可靠且饱和的教师模型上,置信度分布的动态范围发生坍缩(Pascal中98%的像素置信度≥0.95),因此自适应截断会淹没保留掩码,自训练也随之退化为确认偏差。
分数蒸馏采样(Score Distillation Sampling, SDS)通过利用预训练的扩散先验优化渲染图像来实现文本到3D生成,但潜在SDS常常产生结构性的颜色伪影和高频纹理噪声。我们识别出潜在SDS的一种失效模式,其由VAE引发的像素漂移所导致:优化图像可能沿着像素空间中受VAE编码器约束较弱的方向移动,因此其潜在表示保持干净且语义有意义,而图像本身则累积可见伪影。我们通过受控的2D SDS实验、仅VAE优化和一项简化分析来支持这一诊断,该分析表明,当到像素的逆映射约束不足时,类编码器的潜在目标会放大图像空间中的噪声。基于这一观察,我们提出PixSDS——一种轻量级的VAE一致梯度修复方法。PixSDS对潜在SDS的前瞻步骤进行解码,并将解码后的图像用作像素空间优化的干净方向,从而无需重新训练扩散模型、更改渲染器或替换SDS目标,即可减少在VAE不一致方向上的移动。在2D优化和文本到3D生成上的实验表明,PixSDS在保留语义内容的同时显著减少了结构性伪影。代码可在https://sevashasla.github.io/pixsds-webpage/ 获取。