每日精选AI研究论文及翻译
LLM代理通过与环境交互进行学习,然而这些环境是手工构建且静态的:它们对代理的弱点视而不见,并随着代理能力的提升迅速被抛在身后。尽管最近的环境生成方法试图解决这一问题,但它们需要领域特定的流水线,依赖昂贵或不可靠的验证器,且生成的仍是静态环境。为减轻从零重建环境的工程负担,我们提出了环境调控框架(EnvHarness)——一个由即插即用组件构成的可编程层,它封装静态环境以重塑其行为,而无需修改底层逻辑。EnvHarness通过标准接口运作,可适用于多种领域,同时确保每个被重塑的环境都保留其原始验证器。为使该过程自动化,我们引入了EnvRigger:它将目标策略视为黑盒,观察其执行轨迹,合成针对已诊断缺陷的EnvHarness组件,并通过全新的展开对其进行验证。在四个领域的五个基准测试中,EnvHarness的表现优于原始环境和领域特定的环境生成流水线,在留出实例上实现了高达9.0分的提升,同时执行步骤减少了9.8%。此外,EnvHarness为强化学习提供了更优的优化信号,使策略与其环境能够持续、有针对性地协同进化。
训练终端智能体需要可扩展的可执行监督,但合成高质量终端任务仍具挑战性。每个任务将指令、初始化环境、参考解和可执行验证器耦合在一起;若这些工件由不一致的假设生成,则所得任务可能不可解或被错误评估。此外,多阶段合成可能丢弃原始来源中蕴含的目标、依赖关系、状态转换和过程约束。我们提出 FACET(可执行任务的细粒度智能体式构建,Fine-grained Agentic Construction of Executable Tasks)框架,同时解决信息保留与跨工件一致性问题。FACET 先将相关智能体技能重建为连贯且信息丰富的场景,再在生成最终任务工件之前实现并修复执行环境。所得容器状态作为指令、解和验证器的共享基础;基于执行的验证与针对性修复可纠正特定工件的失败,而无需不必要地重新生成有效组件。FACET 生成带有密集可执行检查的复杂终端任务,从这些任务中收集的成功轨迹提供了有效且数据高效的监督。对多种规模的模型进行微调持续提升了 Terminal-Bench 2.1 上的性能;对替代生成方案的分析也印证了基于环境的构建对任务有效性和解-验证器对齐的重要性。这些结果确立了源意图保留与共享可执行状态基础作为可扩展终端任务合成的关键原则。
软件日益成为科学仪器本身的一部分,这使得科学代码中的故障不仅可能损害程序行为,还可能危及支撑科学结论的证据。然而,现有对编码智能体的评估大多侧重于整体任务成功率,对于智能体在修复科学软件时为何失败所提供的洞察十分有限。我们提出 SWE-bench Science——一个面向科学软件工程的仓库级基准,包含来自 20 个科学领域、98 个 GitHub 仓库中的 119 个任务。每个任务归属于三种范式之一:问题驱动型、专家探索型和工程集成型。即使性能最优的智能体 Claude Code with Opus-5 (max),其 pass@1 也低于 50%,凸显了科学软件工程所带来的巨大挑战。我们识别出四种反复出现的失败机制:科学知识或抽象能力的欠缺、误导性探索或浅层修复、修复覆盖或系统集成不完整,以及在我们的分析中未能将科学知识推广到所观察案例之外的失败。我们进一步进行了配对消融实验,在保留仓库和可执行工程上下文的同时移除显式科学指导。结果表明,科学知识并非 uniformly 有益:充分依据的信息可以约束修复过程并提高平均性能和 Token 效率,而契合度欠佳的指导则可能引发锚定效应,且未必能提升精确修复成功率。综上,SWE-bench Science 为研究编码智能体在科学软件工程中的能力与失败机制提供了一个广泛的测试平台。
当场景必须包含多个指定人物时,身份保持图像生成的可靠性会显著下降。除了保留每个身份外,模型还必须将每个参考对象绑定到不同的具体人物和位置,而训练时的身份损失函数必须在多个含噪声的预测人脸之间建立对应关系。我们提出WithEveryone,一个统一的框架,可生成包含多达十个参考身份的群像图像。WithEveryone将每个选定的身份注入为带寻址的令牌,预测结构化的身份-布局规划,并将该规划渲染为视觉条件。其关键目标函数——布局锚定身份损失(Layout-Grounded ID Loss)——利用标注的人脸区域直接监督目标身份,避免了基于嵌入的不稳定人脸匹配;身份表示强制(ID Representation Forcing)进一步在图像合成前对每个身份进行预测训练。在身份不相交的基准测试上,WithEveryone取得了最高的目标-上下文身份相似度,将人脸相似度从GPT-Image-2的0.462提升至0.499,同时将复制粘贴伪影从0.169降低至0.055。此外,该方法覆盖了97.3%的所需身份,重复率仅为2.8%。这些结果表明,显式的身份-布局锚定使身份保持生成能够扩展到更大规模的群组,而无需依赖直接参考人脸的复制。
记忆已成为大语言模型的关键组成部分,使其能够保留信息并从长期交互中学习。然而,现有记忆基准主要评估信息是否被正确提取、存储和检索,而很大程度上忽视了检索到的记忆如何重塑模型推理并影响当前任务的表现。我们识别出记忆诱发的认知陷阱:即使是忠实记录且语义相关的记忆,也可能扭曲模型的推理或信念,并降低当前任务的表现。为了系统性地评估这些失败模式,我们引入了MemTrapBench,它涵盖两种形式的认知陷阱:推理固着和信念扭曲。在两个模型家族和五个代表性记忆框架上的实验表明,MemTrapBench具有挑战性:所有被评估的记忆策略均不如无记忆设置,即使最强的方法也下降了超过10%。为了缓解这些认知陷阱,我们提出了AdaptiveMem,一种简单而有效的推理时方法,指示大语言模型避开记忆陷阱。AdaptiveMem在MemTrapBench上缓解了认知陷阱,同时在多样化的记忆框架上保持或提升了标准记忆基准的性能。
智能体技能目前要么由人工编写,要么通过单次大语言模型生成过程产生,因此缺乏闭环机制,无法从它们实际引发的交互失败中改进。近期研究确实弥补了这一闭环,但其反馈来源于单轮问答评估。其后果是严重的不对称性:一旦第一轮修改修补了单次交换所能揭示的缺口,演化梯度便会衰减,仅在多轮交互中浮现的缺陷依然不可见,演化进程随之停滞。这些系统中的治理机制同样由端到端验证分数驱动——这是一种标量门控,能够拒绝退化候选体,却既无法定位其结构性原因,也无法加以修复。我们认为,制约技能持续演化的关键因素既不是编辑能力,也不是迭代次数,而是评估反馈能否持续提供可信的演化梯度。我们提出SkillEvo,其中可信反馈生成梯度,可控治理约束其方向。第一个组件将多轮用户模拟从评估端点重构为反馈生成器:后续问题层层暴露缺陷,使得每一轮修订既消耗反馈,又产生新反馈。第二个组件以独立治理层取代标量门控的被动拒绝,主动修复事实性退化和结构臃肿,从而防止梯度随着退化累积而漂移。在六类云服务、9个生产技能和98个技能参考文件上,SkillEvo分别超过基于自我反思的演化23.0分,以及单轮问答驱动的演化15.4分。
以动作条件的视频世界模型需要低延迟的因果生成以及对游戏原生控制的可靠响应。尽管因果蒸馏能够实现单步或少步视频合成,但将其扩展到交互式世界模型仍具挑战性,因为在因果训练和自回归展开过程中,离散的键盘状态和连续的鼠标运动必须与时间压缩的潜在块保持对齐。我们提出了 ForgeWM,一个渐进式框架,通过域适应、教师强制的因果训练、因果一致性蒸馏以及基于策略的分布匹配(与双向教师)将双向动作条件视频生成器转化为高效的少步世界模型。由此得到的预算特化学生模型在稳态去噪预算下分别以 1、2 和 4 步运行。ForgeWM 还支持双路径部署协议,将延迟关键交互与可选的回放时细化相结合,其中单步学生模型对其保存的草稿进行重新加噪并细化。在配对的 Minecraft 轨迹上,ForgeWM 在成像质量、参考对齐的运动剖面一致性、动作信号准确性和鼠标控制准确性方面均领先于所评估的系统,同时实现了最低的参考 LPIPS;相同的四阶段方案可迁移至由游戏手柄控制的 FPS 游戏玩法。回放时细化能够匹配四步参考质量,同时与真实经历轨迹的距离约为从噪声重新生成的三分之一。这些结果证明了 ForgeWM 在可控少步视频生成方面的有效性。
大语言模型智能体在代码生成方面取得了显著进展,但现有大多数系统都假设存在预定义的代码仓库架构。这一假设在从零到全量代码生成场景中并不成立,在该场景下,智能体必须直接从自然语言需求构建整个软件项目,并在整个开发过程中保持模块化的仓库架构。我们提出Repo0,一种用于从零到全量代码生成的持续结构演化框架。Repo0维护一个显式的架构状态,具体实例化为双有向无环图(Dual-DAG),由需求级DAG、组件级DAG及其对齐关系组成。从自然语言需求出发,它通过由模块化度量引导的结构化操作迭代演化组件边界,直至结构收敛,随后收敛后的架构指导测试驱动开发的代码生成。我们使用GPT-5 mini和DeepSeek V3.2在RepoCraft中的六个真实仓库上评估Repo0。Repo0在所有设置下均取得了最高的功能覆盖率(Functionality Coverage)和通过率(Pass Rate)。与最强的仓库规划基线RPG相比,Repo0的功能覆盖率最高提升20.08个百分点,通过率最高提升29.74个百分点。消融实验和结构演化分析进一步证明了Dual-DAG架构状态、模块化引导的结构演化以及显式结构收敛的重要性。
长上下文建模是大语言模型的一项关键能力,然而注意力机制的二次复杂度仍然是关键瓶颈,尤其是在计算密集的预填充阶段。我们先前的工作 FlashPrefill 通过即时模式发现和基于最大值的动态阈值化来缓解这一开销;然而,它仍是一个算法原型,距离生产部署尚有较大差距。本文提出 FlashPrefill V2,沿三个维度将 FlashPrefill 从原型推向实用的长上下文服务。首先,我们引入均值修正项,有效抑制近似误差,即使在极端稀疏度下也能将性能退化控制在可接受范围内。其次,我们利用 PackGQA 内存访问、warp 特化和乒乓流水线重新设计了稀疏注意力算子,使其与最新的 FlashAttention-3/4 实现完全对齐,并支持 FP8 推理以满足实际量化需求。第三,FlashPrefill V2 原生支持分页 KV 缓存和连续批处理,可作为注意力后端集成到 SGLang 等现代推理框架中。在 NVIDIA H20 GPU(最广泛部署的推理加速器之一)上进行的大量实验表明,在 128K 上下文长度下,FlashPrefill V2 在 FP8 和 BF16 精度下分别较 FlashAttention-2 实现了高达 47.26 倍和 27.19 倍的加速;在 FP8 下,相较于对齐 FA3/4 的稠密基线仍能实现 30.49 倍的加速。
以前沿混合专家模型(阿里巴巴、OpenAI、NVIDIA;每个模型活跃参数为36–40亿)为例,对它们进行微调,使其以低资源语言进行推理。在准确性基准测试上几乎没有任何变化;在此规模下,基准本身即是噪声:仅改变随机种子就会使分数变动7.7个百分点,超过我们所测量的所有数据与训练方案影响之和。这一零结果就是我们的第一个发现。真正的变化发生在准确性无法察觉之处。基础模型从不用希腊语思考:在1000条推理轨迹中为0,即使问题是用希腊语提出的,因此模型虽然回答正确,但其推理形式用户无法阅读、审计或纠正。经过监督微调(SFT)后,所有发布的检查点在约98%的项目上使用与问题相同的语言进行推理;其中一个模型家族所用token数减少至原来的三分之一;四个模型的语法性评估均有提升,通用能力与各自基础模型相比仅相差几个百分点:既没有遗忘任何能力,又获得了流畅性。我们提出了六个行为维度,使此类变化可被测量;每个维度都设有门控,以排除任何与输出长度相关的指标。我们还报告了自身工具如何“撒谎”:六类失败,每类都被对照组所识别。而SFT无法修复自身的缺陷:四分之一的回答未采用所要求的格式,答案泄漏到推理通道中,且明确要求“用英语思考”时,模型服从的时间不足一半。采用可验证奖励的强化学习(在训练前预先注册)彻底修复了前两个问题(格式回退从24%降至2.5%,泄漏从3.5%降至0.0%,均对比平坦随机奖励对照组),并使第三个问题改善9.1个百分点;同时,希腊语推理习惯在仅以准确性为导向的梯度训练中完好保留。我们发布了五个检查点。这些工具、对照组和预注册方案可迁移至任何低资源语言;希腊语正是让我们能够对其进行测量的案例。
如何高效微调机器人策略以即时学习新任务?最先进的机器人操作策略基于行为克隆,在大型遥操作数据集上对具有数十亿参数的视觉-语言-动作(VLA)模型进行训练。尽管这种简单方法已推动机器人操作取得显著进展,但微调VLA策略以学习新任务仍是一个开放性问题。特别是,收集遥操作数据集需耗费数百小时昂贵的人力,而替代方案——强化学习(RL)——的样本效率众所周知地低下,尤其是在长时程任务中。此外,由于模型规模和架构设计的限制,将RL与VLA结合使用还面临诸多挑战。在本工作中,我们提出EXIMO,一种用于VLA策略微调的高效算法。EXIMO分三个阶段运行:探索、模仿和优化。在探索阶段,EXIMO为VLA配备一个充当规划器的视觉语言模型(VLM)。VLM进行思考并将具有挑战性的长时程问题分解为较短的子问题供VLA处理。VLM与VLA协同工作,用于在新任务上收集编排数据集。在模仿阶段,利用编排数据对VLA进行微调。最后,在优化阶段,我们使用残差离策略强化学习进一步微调策略。在我们的实验中,我们对EXIMO的三个阶段进行了消融研究,结果表明其在样本效率和最终性能方面显著优于现有方法。
大型语言模型在推理阶段不检索源文档时,往往无法回答关于限定范围文档集合的问题。我们将这一场景研究为文档知识内化:将固定语料库转化为可用的参数化知识,以实现无检索问答。为此,我们提出 IAR(Inject, Align, and Recover,注入、对齐与恢复),一种三阶段后训练框架,将结构化文档知识注入、问答行为对齐和通用能力恢复分离开来。与常规持续预训练不同,Inject 阶段将源文档转换为续写、改写和指令条件重建目标;Align 阶段随后使用仅答案的问答监督适配注入后的模型;Recover 阶段则将领域适配模型与基础指令模型合并,以恢复通用能力。在 Common Corpus (CC) 和 CCI 上,以及 Llama、Phi、Qwen 和 SmolLM 模型族中,IAR 改善了无检索文档内化的领域主要能力与领域通用能力前沿。在主要对比中,IAR 在 8 个数据集-模型组合中的 7 个上,所有四项报告指标均优于普通 SFT;领域问答准确率平均提升 3.6 个百分点,在 IFEval、MMLU 和 MSBench 上的平均通用性能提升 12.1 个百分点。扩展的 CC 基线显示,LoRA 和 FAPM 可以在个别通用指标上获胜,但在同时达到领先或接近领先领域内化水平的方法中,IAR 仍然保持着最强的通用能力表现之一。
公共基准是自动语音识别(ASR)模型能力的重要衡量标准。然而,由于其公开性质,模型存在以不能很好地泛化到真实世界数据的方式针对这些基准进行优化的风险。我们提出了一种量化基准优化的方法论,重点关注音频对参考转录文本欠定的情况。我们确定了三类行为探针,它们揭示了模型在音频欠定的情况下复现基准参考片段的能力:参考标注不一致、掩码数字恢复和正字法切换。我们发现,得分最高的开源模型即使在相关音频是矛盾的、被掩码的或模糊的情况下,也会输出逐字的参考转录片段。通过使用多种机制探针,我们表明模型会响应狭窄的声学线索,以覆盖对音频的忠实表征,转而采用基准优化的策略。我们表明,这种基准优化行为可以通过低秩线性引导进行因果操纵,或者在某些情况下,只需在片段末尾追加音频即可触发。总体而言,我们的结果表明,高性能模型表现出基准条件化行为,这些行为可能虚增基准性能,而并不反映通用转录能力的提升。
长时程机器人操作要求机器人既能可靠地执行单个技能,又能在扩展任务中对技能进行连贯排序。大多数分层视觉-语言-动作(VLA)模型通过单次前向传播完成每一次决策,缺乏为困难或关键决策分配额外计算的机制。我们提出τ_0-VLA,一种分层机器人基础模型,将高层子任务生成表述为一种通过世界模型引导的测试时计算实现计算可扩展的推理问题。在每个推理步骤中,高层策略利用执行记忆生成子任务,并在必要时先对备选方案进行搜索再确定输出。随后,底层策略在多种机器人形态上执行生成的子任务。该策略在40,115小时异构真实世界数据上训练,并采用多模态协同训练。在域内与分布偏移场景下,分配额外的测试时计算能显著提升下一子任务预测准确率,且这些收益能够转化为长时程机器人操作任务上更高的闭环成功率。
人类不断从经验中学习,而传统大型语言模型(LLM)评估忽略了模型通过推理时交互进行改进的能力。在本文中,我们研究LLM如何在测试时从迭代经验中学习,我们将这一设定称为经验链(Chain-of-Experience, CoE),其中模型通过自我反馈或环境反馈的迭代交互积累经验轨迹,形成超越零样本推理的持续改进循环。我们通过多种反馈机制实例化CoE,包括模型自我反馈和环境信号(如正确性或公开编程测试通过率),并使用8个LLM(包括GPT-5、Gemini-2.5 Pro、Claude-4.5 Sonnet)在数学、编程和知识领域进行评估。我们的研究表明,利用迭代经验始终优于无反馈基线,仅凭自我反馈即可实现显著提升,同时在各任务和模型上总体改进5.6%,API成本降低19%。我们进一步表明,结合互补反馈通道(如模型信号和正确性信号)能带来额外收益,并且CoE比现有测试时策略实现更高的每token准确率。我们观察到LLM基础能力与改进能力之间存在正相关,并表明模型在弱反馈或虚假反馈下仍保持鲁棒性,不同反馈有助于不同的改进方面,且大部分收益出现在迭代早期。
客服大语言模型(LLM)智能体在代表用户执行操作时,必须遵循组织政策。合规失败既可能源于禁止性操作(例如批准不符合资格的变更),也可能源于遗漏程序性要求(例如身份验证或确认)。运行时防护机制可以对高风险操作进行干预,但仅针对单步操作的检查无法引导智能体完成多步骤流程。工作流遵循系统支持按预设流程执行,但其主要目标在于工作流完成,而非对智能体行为进行安全保障。相比之下,PolicyGuide 将每个领域策略编译为工作流图,并在每轮用户交互结束时调用主动验证器。验证器基于持久化的图状态,协调未决请求,并沿合规路径返回针对具体步骤的补救措施。在 τ^2-bench 基准的航空、零售和电信领域中,使用 GPT-5.4 作为智能体和验证器,PolicyGuide 将平均 Pass^4 从 0.42 提升至 0.62,其中电信领域提升幅度最大(从 0.19 到 0.61),该领域也是工作流结构化程度最高的领域。相同的工作流可迁移至 Claude Sonnet 4.6 和 Gemini 2.5 Pro 智能体。补充评估显示,在对抗性用户场景下,观测攻击成功率最低;在作者设计的工作流级验证中,程序合规性最强。
现代大语言模型智能体通常通过手动修改提示、工具或工作流来改进,而环绕模型的可执行骨架——即执行框架(harness)——在部署后往往被视为固定产物。本研究探讨一种替代方案:执行框架是任务特定且可持续演化的——每个任务族维护各自的执行框架,该框架通过固定的任务注入接缝在迭代间热切换,并利用环境反馈进行重写。我们提出分层自我改进(Hierarchical Self-Improvement, HSI)框架,其中单个冻结的大语言模型M在三个分层范围内运作:执行任务的任务执行框架H、重写H的演化器(evolver),以及在冻结外部锚点下重写演化器策略代码的元演化器(meta-evolver)。一种推理开关(thinking-on/off)设计通过在执行任务时禁用推理、在自我修改时启用推理,从而隔离执行框架演化的贡献。HSI受两个因素制约:反馈保真度界限——因为演化需要信息丰富的奖励信号来引导选择;以及骨干模型能力界限——因为执行框架的重设计无法克服冻结模型的局限。在BALROG基准上,以DeepSeek-V4-Flash-Preview作为冻结骨干模型,HSI在中等难度任务上相较初始执行框架取得了一致的提升(BabyAI上+39.3,Crafter上+33.0,TextWorld上+25.0,MiniHack上+15.0,均为原始%进度),同时在BabaIsAI子套件上获得了强大的留出泛化性能(在20%未见数据划分下,BreakStop最佳测试分数为0.98,GoTo为1.00)。在超出骨干模型能力的任务(NLE)上,执行框架演化未带来改进。这些结果表明,任务特定的执行框架演化是改进冻结大语言模型智能体的一个可行方向,但存在明确的实证界限。代码见 https://github.com/TailinZhou/hsi。
我们提出TinyCast,一种无注意力机制的零样本预测器,仅用146,505个参数即可输出预测分布,其设计前提是:在此规模下,上下文的周期结构值得显式计算而非学习获取。一个零参数频谱检测器提供主导周期,上下文按其相位折叠,随后由膨胀卷积编码器和块自回归分位数解码器对剩余部分建模。在GIFT-Eval榜单上,它是所有可确定参数量的零样本参赛模型中规模最小的。在概率精度上,它定义了规模-精度前沿。在声明无测试数据泄漏的零样本参赛模型中,它是唯一参数低于140万的能输出预测分布者,而所有得分更高的参赛模型至少拥有该参数量。在Chronos-ZS和fev-bench上,每一个排名在其之前的神经模型参数量至少为其28倍。由于其混合路径仅包含卷积和矩阵乘法,该模型可导出为静态INT8格式,并在嵌入式设备上端到端执行预测,无需逐信号拟合。
长视频理解涵盖的任务超越了孤立事件的检索,包括追踪不断演进的叙事脉络以及解读可能保持隐性的社会含义。然而,现有基准很少对这些能力进行联合评估,尤其是在高语境、非英语媒体中。为弥补这一空白,我们提出了NARU,一个专为评估日语长视频中叙事演进与文化理解推理而设计的基准。NARU包含1,481个问题,基于155个视频(总计146.8小时),涵盖四个叙事维度和五个文化维度。为了在该规模上构建基准,我们提出了一种基于层级化记忆的标注流程,将原始视频转化为结构化的情节、叙事和文化标注,然后通过任务导向的综合生成与迭代式快捷路径消除来生成问题。构建过程包括两个由68名标注者参与的目标语母语者验证阶段。对八种模型配置的评估揭示了长程叙事整合与文化根基推理方面的显著局限。通过揭示这些持续存在的差距,NARU为开发能够可靠解读长时长、高语境视频的多模态大语言模型(MLLMs)提供了系统化的测试平台。
当前的灵巧抓取规划器主要针对物理稳定性进行优化,关注物体能否被抓取,而非如何抓取以支持下游功能性任务。然而,以特定人类抓取分类法为条件来合成抓取,通常需要极其昂贵且带有物体标注的数据集。为解决这些局限,我们提出了CoToGrasp,一种新颖的生成式框架,能够严格以特定接触拓扑为条件,合成多样且稳定的抓取。为绕过数据收集瓶颈,CoToGrasp完全以物体无关的方式进行训练。我们引入了一种基于特征的规范工作空间,将局部物体特征投影到统一的以夹持器为中心的空间中,从而有效地将语义功能意图与任意物体几何形状解耦。通过在该工作空间中学习夹持器的内在接触流形,我们的模型在推理时实现了对未见物体的零样本泛化。在大规模DexGraspNet数据集上的广泛评估表明,CoToGrasp取得了最先进的性能,优于现有的分类引导规划器。最后,我们在物理机器人平台上验证了所合成接触拓扑的物理可行性与运动学可行性。代码可在项目网站 https://cea-list.github.io/cotograspweb/ 获取。
多指抓取是一项至关重要的机器人技能,但当前的深度学习抓取规划器往往难以泛化到新物体,原因在于它们是在有限的、特定物体的数据集上训练的。我们提出了一种根本不同的方法,其基础在于观察到夹持器与物体在相互接触点处具有相同的表面几何形状。我们提出了GOAG:一种面向灵巧机器人操作的生成式与物体无关抓取规划器,其作为一种新型深度生成模型,学习特定夹持器接触表面分布的紧凑潜在表征,从而无需依赖特定物体的训练数据即可高效采样有效的抓取构型。我们表明,仅在推理时引入物体特征,我们的模型便能有效检索与夹持器能力兼容的可行接触区域。我们通过在仿真和真实场景中遵循既定抓取协议开展大量实验来验证我们的方法,并展示了该方法在文献中不同夹持器上的有效性。我们的方法在MultiDex数据集的物体上取得了最先进的结果,平均成功率达到86.93%。在生成大量抓取时,该方法提供显著更快的处理速度,同时与专门在该数据集上训练的领先方法性能相当。与这些方法不同,我们的方法不依赖特定物体的训练数据,从而凸显了物体无关学习的优势。它有效解决了传统数据驱动抓取规划器所面临的泛化挑战。代码和视频可在我们的项目网站上获取:https://cea-list.github.io/goagweb/ 。
LLM 编码代理通过可能对模型输出进行序列化、包装和重新解析的接口发出 Bash 命令。仅靠匹配执行分数无法区分命令生成错误与生成后引入的失败。QuoteBench 通过在源自 14 个事件的 56 个单次任务上进行精确最终状态验证来测量这一边界,将生成契约与执行传输在一个故意未转义的附加解析器处交叉。在插值点进行转义可重现每个重放回复的原始路径结果,因此在披露边界下的任何恢复都必须来自模型改变其生成。在八种同一窗口配置中,通过附加解析器重放相同回复会使成功率降低 55.4 至 73.2 个百分点;披露可为六种配置恢复 30.4 至 60.7 个百分点,而另外两种配置的恢复为零或略为负。原始生成在前沿已接近饱和;边界适应才是仍然区分模型的要素。GPT-5.6-sol 的匹配差距为 -3.6 个百分点,掩盖了 -64.3 个百分点的损害与 +60.7 个百分点的补偿。部署配置会重新排列模型顺序:26 个可比较对中有一个明确反转,另有四个处于单任务边缘。对命令发出代理的评估应报告模型配置、生成契约、执行路径、操作点和最终状态验证器,而不应将匹配分数视为模型的内在属性。
您是否应该用大语言模型取代您的文本嵌入流水线?我们通过一项受控且考虑成本的比较来回答这一问题,该比较涵盖六个家族的十种大语言模型和26种嵌入模型(参数规模从1.18亿到140亿),在涵盖分类、语义文本相似度(STS)、聚类、配对分类和检索的37项任务上进行了评估。总体而言,两种范式基本打成平手:最佳大语言模型(Gemini 3.1 Pro,77.6)与最佳嵌入模型(77.2)仅相差0.4分。两者的优势因任务而异:大语言模型在推理密集型的检索任务上领先,嵌入模型在分类任务上领先,而两者在聚类、STS和配对分类上表现相当。达到这种同等水平代价高昂。大语言模型的成本是同等质量嵌入模型的最多1,431倍(每次基准测试通过需154美元,而嵌入模型仅需0.11美元),且在相同GPU上,所测试的开源大语言模型处理词元的速度慢2.5至736倍。推理词元占大语言模型推理成本的28%至81%;在我们的消融实验中,较低的推理预算对大多数模型的检索质量具有保持或改善作用。帕累托前沿包含领先的嵌入模型和一个大语言模型——Gemini 3.1 Pro。这些结果支持一种分工模式:在相似度、分类和聚类任务中使用嵌入模型,将大语言模型保留用于推理密集型的检索任务。我们的代码、数据集和结果公开于 https://github.com/embeddings-benchmark/embedders-dilemma。
自监督学习(SSL)推动了音频表示学习的重大进展,尽管现有方法日益依赖精心设计的预训练方案以达到具有竞争力的性能。语言建模及近期视觉表示学习中最具影响力的进展背后,是一种截然不同的预训练理念:模型并非被训练为静态特征提取器,而是学习从先前上下文预测下一个元素——无论是离散词元还是连续嵌入。由此,自回归预测提供了一种跨模态迁移的统一预训练接口,迫使模型学习底层数据分布。鉴于音频的时间结构使得patch嵌入的自回归预测成为天然适配,我们探究这种简单的因果范式是否能够催生强大的音频学习器。我们提出NAPE(Next-Audio-Patch-Embedding prediction,下一音频patch嵌入预测),一种自监督框架,其中因果Transformer从先前的对数梅尔频谱图patch嵌入中预测下一个patch嵌入,仅以因果掩码和停止梯度作为训练信号。该设计刻意保持极简,避免了重建解码器、声学词元器、师生架构和辅助正则化损失。在六个音频和语音基准测试中,NAPE在多项任务上取得了最先进的微调性能,在不同编码器规模上表现出一致的可扩展性,并产生了强大的线性探测结果。NAPE还在无需显式监督的情况下形成了结构化的注意力模式。
大语言模型智能体可以通过在推理时构建工作流来适应复杂任务,但单个回合中发现的过程通常会在执行后被丢弃。现有技能库提供可复用的可执行例程,但通常离线构建,且不能从智能体自身的工作流中增长。我们提出 FlowEvo,一种无需训练的框架,让工作流和技能在推理时共同演化。FlowEvo 将成功的工作流整合为可调用的技能,将其存储在持久化技能库中,并通过直接执行或作为构建新工作流的上下文来使用检索到的技能。它还跟踪每个技能的下游效用,并抑制导致负迁移的技能。在共享 GPT-4o-mini 主干下,FlowEvo 在 ALFWorld、HumanEval、MBPP、GSM8K 和 MATH-500 的完整标准划分上,于 8 个基线中取得最高准确率。在 ALFWorld 上,FlowEvo 达到 85.6%,比最强基线高出 26.4 个百分点,同时仅使用约三分之一的 token 数。在涵盖 7B 到 671B 参数的 10 个基座模型上,FlowEvo 在 50 个模型-数据集对比中优于 ExpeL 49 个。代码见 https://github.com/DEFENSE-SEU/FlowEvo。