每日精选AI研究论文及翻译
长程搜索智能体必须执行多个连续动作(步骤)来搜索、检索、验证并整合证据,最终得出答案。然而,现有的智能体训练方法通常在监督微调(SFT)和强化学习(RL)过程中对轨迹中的所有步骤一视同仁,未能区分有用动作与错误或冗余动作。本文提出答案回溯信用分配(Answer-Backtracked Credit Assignment,ABC),一种用于训练长程搜索智能体的细粒度信用分配框架,通过将稀疏的轨迹级结果转化为密集的步级监督信号,奖励有用动作(即使在失败的轨迹中),同时抑制错误或冗余动作。具体而言,给定一个可能晦涩的查询及其对应的标准答案,ABC首先执行答案回溯线索恢复(Answer-Backtracked Clue Recovery),从答案出发反向追踪,恢复解答问题所需的中间线索;随后应用线索锚定步骤评分(Clue-Anchored Step Scoring),对照这些线索评估每个搜索步骤,将稀疏的二元结果监督转化为密集的步级奖励。基于这些奖励,我们开发了ABC-SFT(对每轮损失进行重新加权)和ABC-GRPO(在GRPO中使用步级分数作为奖励)。在此框架基础上,我们仅使用8.5k条示例,基于Qwen3.5-4B训练了ABSeeker。ABSeeker在BrowseComp上达到37.3%,在BrowseComp-ZH上达到39.1%。加入上下文管理后,得分进一步提升至55.3%和52.9%,显著优于同规模(4B)智能体,甚至可与更大规模(约30B)的模型相媲美。这些结果证明了答案回溯式步级信用分配在训练长程搜索智能体方面的有效性。
文本到图像(T2I)模型能够生成视觉上吸引人的图像,但在需要复杂语义理解、多步推理和外部世界知识整合的开放世界任务上仍然受限。现有工作将智能体能力引入图像生成,但它们要么预设固定工作流,要么仅将开放世界图像生成过程的一部分置于智能体控制之下。因此,推理、工具调用和图像生成并未由单一策略协调。我们提出ToolArtist,一种完全智能体化的图像生成模型,通过对统一多模态模型(UMM)进行后训练获得。ToolArtist在单一统一策略内动态编排推理、外部工具使用和原生图像生成。在监督微调(SFT)阶段,我们为教师智能体配备搜索工具以及图像生成工具。然后,我们将收集到的轨迹转换为UMM兼容格式,其中图像生成工具被隐藏,而生成的图像被保留。在强化学习(RL)阶段,我们为UMM开发了智能体化强化学习基础设施,并引入Reason-Act-Draw GRPO(RAD-GRPO),利用互补的意图奖励和质量奖励联合优化模型。实验表明,将整个开放世界图像生成过程置于智能体策略之下,始终优于采用固定流水线或仅部分组件由智能体控制的方法。我们发布了训练数据和完整的后训练基础设施。
视觉为推进基础模型提供了一个关键轴心,推动其向原生统一的多模态预训练转变。尽管势头强劲,但统一训练过程中模态交互的设计空间与基本机制仍未得到充分探索。我们通过对多模态预训练的系统性探索,提供了实证层面的清晰认识。我们在合成数据集和大规模真实世界数据集上进行的受控实验,得出了关于多模态预训练机理的四点关键洞见:(i) 知识流动:我们厘清了语言、视觉理解与视觉生成如何跨模态传递知识,揭示了不同的影响模式与不对称性;(ii) 协同与竞争:我们表明,数据的"复杂度"在很大程度上决定了模态之间是协同还是竞争,识别出能够促进协同的架构选择——例如共享注意力与归一化配合模态特定的前馈层——并发现这些行为可泛化至不同的视觉分词器设计;(iii) 早期统一:从最初阶段就统一模态并进行联合训练,被证明比晚期对齐或顺序训练更为有效。这一过程揭示了"视觉惰性"现象,即延迟整合会导致模型依赖语言先验;(iv) 配方:我们推导出了高效的预训练配方,仅用5%的计算预算即可实现强生成性能。这些核心发现随后通过训练多个参数量为13.5B的MoE模型、在2T token上进行验证。我们希望这项研究能够为理解和扩展多模态预训练提供一个有原则的基础。
具有持久记忆的个性化大语言模型(LLM)正被日益广泛地部署,但其用户模型的忠实性仍未得到检验。我们研究过度推断(OI):即大语言模型捏造超出证据支持范围的用户属性的现象。我们提出MirageBench,包含150个在刻板印象、反刻板印象与中性画像之间均衡分布的用户画像,6个跨越“想象梯度”的个性化任务,一个由独立评判器操作化的四分类忠实性分类体系(以盲法人类标注者为参照,在400条陈述上验证:四分类科恩卡帕系数=0.863,二分类卡帕=0.900),以及一个涵盖7个系列共12个模型、基于143,616条经评判陈述的排行榜。我们发现过度推断普遍存在:12个模型中的每一个都对其35%–49%的陈述进行过度推断(跨模型均值41.6%;按陈述加权41.8%),本评估中没有任何模型能够避免这一点。最引人注目的是,我们揭示了一种“自我监控反转”:在模型选择层面,模型的自我评估OI与其评判器测量OI呈负秩相关(rho = -0.60,p = 0.044;探索性结果,自助法置信区间较宽[-0.90, +0.06],n = 12)。报告过度推断最少的模型往往被标记为捏造最多的模型,因此自我报告的置信度在比较模型时是一种误导性信号,尽管在单个模型内部,自我审计仍能对该模型自身的陈述进行较好的排序(AUROC 0.58–0.83)。我们进一步表明,OI随任务不同而变化(27%–59%),并且在多轮试点中,推断出的属性近似线性累积,且很少得到修正。MirageBench将外部验证而非模型自我报告定位为可信个性化更可靠的基础。
LLM智能体越来越多地被应用于涵盖工作、学习和生活的开放式日常请求。这些任务具有长时程、跨环境和多模态的特点,迫使智能体在导航异构工具和附件的同时,在众多步骤中保持目标和约束。虽然已有工作解决了目标漂移、状态丢失和上下文溢出等个别失效模式,但对于单一管控框架能否联合管理这些问题并在不同后端上保持有效性,相关研究仍然较少。我们提出了OneDayAgent,一个用于自主智能体的长时程管控框架。OneDayAgent将开放式请求转化为受管理的执行过程,将任务分解为有界的子任务,在上下文压力下维护执行记忆,并验证和修复最终交付物。我们在AgentIF-OneDay的104个任务上评估了OneDayAgent。使用GLM-5.2后端,OneDayAgent取得了0.821的总体得分,创下新的最优性能。同一框架可运行于来自三个模型族的五个后端LLM,表明该框架无需调优即可跨后端泛化,即使不同模型在同一工作流程下会展现出不同的执行风格。
智能体自我进化利用先前经验更新智能体的持久状态,并复用它以更有效地解决相关任务。评估自我进化十分困难:现有基准对具有经济价值的任务领域覆盖有限,且并不总能将训练任务和测试任务设计为能使测试阶段性能提升归因于训练经验,并且仍然容易受到数据污染的影响。我们提出了 GDPevo——一个原生支持自我进化的基准,以 GDP 相关的企业工作流为基础,并配套了一条全自动数据流水线来生成该基准。其核心机制——规则杂交(rule hybridization)——将每个企业工作流分解为原子业务规则,将这些规则的子集分配到训练任务中,并在留出的测试任务中重新组合这些规则,从而使测试阶段的性能提升可归因于训练经验。GDPevo 涵盖客户关系管理(CRM)、企业资源计划(ERP)、金融、医疗保健、法律以及以数据为中心的工作流。其 V1 版本包含 12 组共 120 个任务,每组有 5 个训练任务和 5 个留出测试任务。完全自动化使该流水线能够在两天内将测试套件扩展到 24 组共 240 个任务(V2),为数据污染问题提供了切实的应对方案。基于 GDPevo,我们在四种监督类型下评估了四个智能体,每个智能体由一个运行框架(harness)和一个模型组成。自我进化持续提升了留出集准确率,最高达 16.44 个百分点。但表现最好的进化后智能体仍远低于全知预言机(oracle)91.6% 的上限,这表明当前智能体的自我进化能力仍远未得到充分发挥。我们在 https://github.com/Prism-Shadow/GDPevo 公开发布了该流水线、基准以及完整的评估结果。
近期大语言模型中的长程推理要求模型在推理链内切换不同的技能,例如先进行数学推导,再利用推导结果来规划日程。我们将此类问题称为跨技能长程任务:这类任务包含多个步骤,各步骤需要不同的推理技能,并且依赖于前面的输出结果。现有基准通常单独评估各项技能,缺乏一种规范化的方法来衡量模型在技能之间切换的能力。我们从评估和训练两个方面来弥补这一空白。我们引入技能熵(Skill Entropy),用于度量从一种技能切换到另一种技能的难度;随后提出 Skill²-Bench——一个基于 558 个技能、覆盖 9 个可验证且开放式领域的跨技能长程任务基准。每个任务都被赋予一个任务级技能熵分数,并划分为三个难度等级。在 Skill²-Bench 上评估 8 个前沿模型和 4 个开源模型后,我们发现了一种技能切换差距:在技能熵更高的任务上,准确率会下降。接着,我们将技能熵从基准度量转化为训练信号,提出 Skill-Entropy RL——一种强化学习框架,其中模型不仅预测每一步的答案,还预测用于生成该答案的技能。奖励函数结合了步骤级正确性与技能熵奖励,后者用于衡量模型预测的技能序列与标准技能序列之间的一致性。在 Qwen3-4B-Instruct 和 Qwen3-1.7B 上,Skill-Entropy RL 将 Skill²-Bench 分数分别从 34.4% 提升至 68.4%、从 14.6% 提升至 40.1%,优于多个强基线方法。同一流程也可直接应用于 OpenR1-Math 等现成训练数据,表明技能熵是一种可复用的训练信号。代码见:https://github.com/Gen-Verse/Skill-Entropy-RL
同策略蒸馏(On-Policy Distillation, OPD)通过使用密集的token级教师信号来监督学生模型采样的轨迹,从而迁移教师能力。近期的选择性OPD方法通过优先处理高置信度、信息丰富或可学习的信号来改进该过程。然而,这些假设忽略了一个语言模型的根本性失效模式:其token级判断可能由与输入无关的语言先验、格式惯例或程式化推理模板所驱动,而非任务特定证据。我们将这种与优化相关但输入依据较弱的监督称为OPD中的伪信号(spurious signals);它们可能产生较大的梯度,却对任务改进方向贡献甚微。为缓解这一问题,我们提出SA-OPD,一种伪信号感知的同策略蒸馏框架,基于输入依据性和优化影响来识别并过滤具有误导性的token级监督。SA-OPD引入一个轻量级的输入依据性代理,用于估计token级蒸馏信号是否真正依赖于输入;随后仅过滤同时呈现低输入依据性和极端蒸馏差异的token,从而去除高影响的伪更新,实现细粒度的OPD优化。在大型语言模型(LLM)和视觉语言模型(VLM)设置上的大量实验表明,SA-OPD始终优于Vanilla OPD和具有竞争力的选择性方法。这些结果确立了输入依据性作为OPD监督选择的一个关键维度,并为缓解伪更新提供了一种简单有效的策略。
学习具有泛化能力的机器人操作策略需要大规模、多样化的示范数据。第一人称视角的人类操作视频蕴含丰富的场景与任务多样性,已有研究表明,将此类视频通过重定向与渲染转换为机器人格式的数据,能够在较小规模上生成有效的单任务策略。然而,该方法能否在规模化层面为视觉-语言-动作模型提供预训练收益,仍尚待探索。我们提出Ego2Robot,一种可扩展的流水线,通过动作重定向、机械臂视觉合成以及多层级质量筛选,将第一人称视角的人类操作视频转化为机器人训练数据。Ego2Robot同时支持精选数据集与野外自然视频,生成了涵盖15种机器人形态、总计18,561小时的机器人训练数据,是迄今最大的从第一视角到机器人的数据集。为评估泛化能力,我们扩展了RoboTwin2.0,引入涵盖视觉外观、场景布局、具身形态及任务语义的解耦扰动维度。实验表明,在Ego2Robot合成数据与真实机器人数据上进行联合预训练,能够持续提升多种扰动类型下的分布外泛化性能,并在真实机器人部署中验证了其有效性。项目主页:https://www-ye.github.io/ego2robot_blog/
我们提出 NOLLI,一个程序化生成的英韩谜题基准,旨在诊断韩语性能差距的来源。该基准包含 15 种谜题类型(25 个任务;7,500 个条目),每个实例均可通过种子重新生成、经验证具有唯一解,并以确定性方式评分。我们并不将“更难”等同于“更大”,而是通过行为表现来标定难度,调整每个生成器,直到固定参考模型落入目标准确率区间。其三层设计结合了匹配的直接翻译、基于韩文字母(音节下字母)的文字系统改编,以及植根于韩国文化或正字法的仅韩语任务。我们评估了 15 个前沿模型、开放权重模型和韩国开发的模型;在总体准确率下限超过 3% 的 12 个模型中,匹配的英韩准确率在 ±10 个百分点范围内统计等价(TOST),表明仅呈现语言本身带来的代价很小。高度依赖书写系统的任务展现出更明显的差距:韩语密码任务落后英语最多 68.7 个百分点,而使用相同韩文字母的字母算式任务则没有系统性劣势;韩文字母组合准确率可以预测韩语密码任务准确率。这些对比具有诊断意义而非因果意义,与多步骤亚音节执行的难度相一致。仅韩语任务将规则应用缺陷(方向各异)与亲属关系缺陷(在所有 12 个模型中均为正值)区分开来。最后,一个显著的规模度量在 15 种类型中有 7 种未能随难度从易到难增长,表明结构性规模难以作为经验难度的可靠代理指标。
尽管基于指令的视频编辑技术已取得快速发展,但真实世界视频中的音频与视觉信号紧密耦合,编辑其中一种模态往往需要另一种模态进行协同变化。现有基准主要评估静音片段上的视觉变换或孤立的音频编辑,导致复杂的音视频联合编辑与跨模态一致性仍缺乏充分探索。为此,我们提出 AVE-Compass,一个综合性基准,包含 145 个精选源视频、196 条音视频耦合编辑指令以及 2,688 个细粒度检查项。该基准通过基于检查项的多模态大语言模型评判和专门设计的真实感评分准则,评估指令跟随、保真度保持、真实感与编辑意图,并辅以自动化的跨模态、视频和音频指标。大量评估表明,现有最先进模型在执行跨模态指令的同时仍难以保持非目标内容不变。我们进一步提出 AVE-Agent,一个模块化智能体框架,可将复杂指令分解为相互依赖的子任务,并通过自我反思与评估器反馈迭代改进编辑结果。AVE-Agent 在联合编辑中显著提升了指令执行、保真度保持和音视频对齐能力,同时保持了具有竞争力的感知质量。
基于可验证奖励的强化学习(RLVR)已成为大语言模型(LLM)后训练的标准范式。尽管组相对策略优化(GRPO)被广泛采用,但它存在奖励信号稀疏的问题,并且当组内所有响应获得相同奖励时,梯度会完全消失。在策略蒸馏(OPD)通过提供来自教师模型的密集的、词元级别的监督信号,提供了一种自然的补救措施。然而,将GRPO与OPD朴素相结合会导致性能下降,其原因有三:并非所有样本都能从蒸馏中受益;过快拟合教师模型会削弱强化学习的探索能力;OPD的优势是不对称的,会抑制大多数词元。针对这些挑战,我们提出了RSTG(通过自适应教师指导恢复学习信号),该方法在最为关键之处选择性地、精准地应用蒸馏。在样本层面,OPD仅被限制应用于零方差负奖励提示,且每个样本按教师模型的置信度分数加权。在词元层面,蒸馏仅针对学生模型熵较高或教师-学生差异较大的词元。我们进一步使用教师模型生成的正确轨迹进行SFT来增强训练,在强化学习无法产生梯度的地方注入正向梯度信号。实验表明,RSTG在数学任务上比朴素GRPO+OPD显著提升4.02%,在代码任务上提升3.05%。
本技术报告介绍K-EXAONE 2.0,这是由LG AI研究开发的一个开放权重多语言基础模型,是我们迈向全球前沿规模基础模型征程中的一步。我们没有从头开始训练,而是对K-EXAONE进行升级改造并扩展其架构,形成了一个总参数量为750B、每个令牌激活约37B参数的混合专家(MoE)模型——其容量是前代模型的三倍以上。K-EXAONE 2.0支持高达256K令牌的上下文长度,并将多语言覆盖范围从六种语言扩展到十种语言。其训练流程结合了持续预训练、聚焦难度的中期训练和后期训练,以强化推理能力、智能体编码能力、多语言能力以及基于韩国社会文化语境的安全性。在九个为反映实际使用条件而选取的评估类别中,K-EXAONE 2.0相较于K-EXAONE有所提升,并与开放权重模型保持竞争力,其在智能体编码和长上下文理解方面提升最大,在长上下文检索和安全性方面优势最为突出。K-EXAONE 2.0在Apache 2.0许可证下发布,使更广泛的人工智能生态能够对其进行评估、部署、适配和二次开发,同时标志着我们挑战全球前沿的开始——而非终点。
记忆增强的视觉语言模型智能体依赖持久化空间知识进行决策,然而当环境发生变化时,这些知识会悄然变得陈旧。我们探究的问题是:当智能体必须调和一项自信的记忆断言与一条相互矛盾的观察时会发生什么,以及现有模型能否在冲突演变为与安全相关的错误之前察觉它。基于动态FrozenLake测试平台,我们将陈旧性检测任务与下游导航任务相结合,在三种闭源模型和三种开放权重视觉语言模型上,分别以文本和图像输入进行评测(共1,800次检测运行,以及4个LLM导航器在共享的50个随机种子规模下的12,000次文本模式导航回合)。我们得出三点发现。第一,文本可解性并不意味着视觉接地能力:能够可靠地从文本中标记陈旧条目的模型,在完全相同的网格上其视觉F1分数跨度从0.887低至0.067,且最弱的模型仍持续做出流畅、自信却无视图像的决策。第二,在未经审计的情况下使用陈旧记忆是一种安全隐患:在我们的主要GPT-4o设置中,完全信任原始记忆的智能体的死亡频率是完全没有记忆的同一智能体的两倍以上。第三,审计虽有助于改善但未能弥合差距:透明的读取时过滤器在文本模式下消解了大部分安全代价,然而即使在当前网格规模下引入真值陈旧标签也未带来进一步的显著收益;当视觉审计不可靠时,过滤并未产生一致的增益。综上所述,这些结果将空间记忆的陈旧性界定为一种安全失效模式,并将记忆-观察冲突下可靠的视觉接地与动作选择确立为记忆增强智能体的核心开放挑战。
尽管视频世界模型近期取得了显著进展,但用户与这些世界中的角色之间的社交互动仍未得到支持。为填补这一空白,我们提出了HelloWorld,一种支持与世界中角色进行社交互动的视频世界模型。用户只需按一下按钮,即可提示屏幕中的角色面向摄像头做出回应,例如转向观众、挥手、点头或说一句简短的问候。为了使这些互动自然流畅,我们提出了一种自蒸馏流水线,在模型自身合成的数据上对视频生成模型进行微调。每个合成片段同时包含社交互动和相机运动,使模型能够学习相机姿态条件控制,而不会降低互动质量。在推理阶段,我们进一步引入了一个无需训练模块,用于确定互动发生的时间。当按下按钮时,该模块调制DiT的交叉注意力掩码,使与互动相关的文本提示仅关注按下窗口内的帧,从而在时间上定位角色的回应。我们进一步构建了HelloWorldBench,一个包含400个样本的基准测试,包含三个社交互动指标和三个常规指标,用于评估。实验表明,HelloWorld在互动质量上超越了多种基线方法,同时保持了最先进的画面美学和相机姿态跟随能力。项目页面:https://github.com/AlayaLab/HelloWorld
GUI智能体必须同时记住先前任务中积累的有用经验以及当前交互中未完成的进度。潜在记忆通过将多模态轨迹压缩为少量连续令牌,提供了一种紧凑的解决方案。然而,现有方法通常将每条轨迹映射到一个固定的记忆块,并主要通过下一动作监督进行训练。这产生了三个实际问题:压缩过程中重要细节可能丢失、同一记忆块必须服务于不同的决策阶段、以及检索到的无关轨迹仍可能误导智能体。我们提出FocusMem,在紧凑的潜在记忆接口内分离这些职责。角色感知的内容基础鼓励情景记忆保留可复用的经验,工作记忆保留任务进度。状态条件化读出机制对同一存储证据生成决策特定的视图,而轻量级信任门控可抑制与当前步骤似乎无关的记忆块。所有组件均在GUI策略保持冻结的情况下进行训练。在五个GUI智能体基准测试中,FocusMem持续优于完全匹配的仅动作固定记忆基线和先前的潜在记忆改编方法。进一步分析表明,语义与功能监督保留了互补信息,状态条件化读出在周围轨迹上下文增长时更具鲁棒性,信任门控减少了注入无关情景证据造成的危害。这些结果表明,有效的潜在记忆不仅依赖于压缩过去的交互,还取决于保留什么、暴露什么以及允许什么。
基于技能的提示已成为提升大语言模型(LLM)智能体的一种实用机制,然而现有技能获取方法往往将技能视为经验总结、记忆条目或成功示范的直接摘要。这对于较弱的学生智能体造成了不匹配:当学生因缺乏任务知识或操作策略而失败时,其失败轨迹可能不包含足够的证据来推断缺失行为,而教师轨迹也可能过于隐晦,难以被内化为可复用的指导。我们提出SKILL-KD,一种对比式技能蒸馏框架,将技能视为不同能力智能体之间的显式蒸馏媒介。给定学生在同一任务上的失败轨迹和教师轨迹,SKILL-KD将它们的可操作差异蒸馏为文本技能补丁,通过重新运行学生来评估补丁,并在学生仍失败时迭代改进补丁。为防止重复的局部更新导致技能漂移,SKILL-KD进一步维护轨迹关联的编辑历史,并执行漂移感知的技能整合,决定每个补丁应添加新规则、删除或修改现有规则,还是被跳过。在五个智能体基准和两种学生设置中,SKILL-KD始终能提升冻结的学生智能体,优于固定模型适配基线。
模型检查点在数量和规模上都在不断增长,这使得归档、传输和部署的成本日益增加。通用压缩器能够降低存储需求,但忽略了张量结构,而现有的张量专用压缩器则依赖于固定且格式特定的流水线。我们提出Brevis,将无损张量压缩形式化为程序合成问题。我们设计了一种带类型的领域特定语言(DSL),通过一组可逆算子来捕获重复出现的张量结构,例如重复区域和浮点字段。给定一个张量,Brevis合成一个自包含的DSL程序,以逐位精确的方式重建该张量。从少量具有代表性的张量样本中学习得到的检查点专属先验知识,引导有界A*搜索合成紧凑程序,这些程序随后可直接执行以实现逐位精确解压。在涵盖语言、音频和图像生成模型的10个公开检查点上,Brevis将2.13 TB的检查点数据压缩至1.41 TB,实现了33.93%的存储缩减。与包括zstd和gzip在内的四种通用压缩器相比,它生成的归档文件最多缩小30.87%,并且生成的归档文件也小于张量专用压缩器ZipNN和DFloat11。在实际并发配置下,Brevis实现了3.60 GB/s的压缩速度和6.61 GB/s的解压速度,同时保留每一个源字节。
交互式视频世界模型对于长时程规划与探索至关重要,然而它们饱受复合误差之苦。强化学习(RL)等后训练方法可以改进这些模型,但会遇到验证瓶颈:对于任意的动作序列,不存在可用来衡量长期漂移的 ground-truth 未来状态。我们的关键洞察在于,可逆动作循环使得这种验证成为可能:由动作序列与其逆序列复合而成的序列必须分析性地返回初始状态,从而为长时程正确性提供无需标注的监督信号。基于此,我们提出了 WorldCycle,一个自验证的强化学习框架,该框架从普通动作序列中构造封闭动作循环及其重复执行,并优化两个互补的奖励信号:一个空间闭合奖励,强制对称的前向与反向片段之间保持对称性;以及一个时间一致性奖励,对齐跨多次循环执行的状态。这些奖励迫使模型将动作学习为一致的状态算子,而非记忆化的时间模式,并且能够自然地泛化到基础模型处理不佳的分布外复合动作循环。我们进一步发布了 CycleBench,一个针对复杂动作结构下状态返回能力的诊断基准。WorldCycle 将状态返回漂移最多降低了 44%,并将复合动作准确率相较于基础模型提升了近 4 倍,为物理上有依据的世界模型奠定了重要基础。
同策略自蒸馏(OPSD)已成为提升多模态大语言模型(MLLMs)视觉推理能力的标准后训练方法。现有方法从多种输入来源中提取特权信息来引导自蒸馏,但这些设计忽略了模态不平衡——一个MLLM推理中固有的挑战。当文本信息主导生成过程时,模型无法充分整合其多模态输入,因而精心设计的特权信息仍未得到充分利用,限制了OPSD的有效性。为探究这一局限,我们构建了使用放大图像的正教师和使用掩码图像的负教师,二者表现出不同程度的模态不平衡。它们的推理正确性与token logits的变化揭示出:模态平衡本身即可作为特权信息。受此发现启发,我们提出OPD-V,一种通过正教师和负教师实例化该信息的视觉OPSD范式。正教师的模态平衡Logits边际定义了一个模态平衡信任区域,用于选择进行自蒸馏的同策略词元。在6个基准、4个MLLM骨干网络和5种后训练方法上的实验表明,OPD-V在降低训练成本的同时持续提升了推理性能。
领先的开源文生图模型往往具备互补优势:一个可能在偏好对齐的美学效果上领先,而另一个则能更忠实地遵循构图指令。然而,由于各模型的自编码器和噪声调度存在差异,这些优势难以在模型之间迁移。本文提出了 Poly-OPD 框架,能够将异构教师模型的互补优势整合到一个紧凑的流匹配学生模型中。为弥合不同教师模型之间不兼容的潜在空间,Poly-OPD 通过像素桥进行同策略蒸馏。每个学生模型生成的图像经选定教师模型的编码器重新编码,并在该教师模型的噪声调度下从幅度匹配的噪声水平进行细化。所得目标进一步在冻结的 DINOv2 空间与学生模型进行匹配,从而在不兼容的潜在空间之间实现监督。为在无跨教师干扰的情况下保留互补能力,Poly-OPD 使用梯度兼容性诊断来组织其适配器:注意力 LoRA 模块在教师模型之间共享,而前馈适配器则保持教师特定。在蒸馏过程中,差距感知课程将更多训练分配给学生模型仍落后于教师模型的构图类别。随着各差距逐渐缩小,训练转向剩余差距更大的类别。通过将 FLUX.1-dev 和 Z-Image 蒸馏到 2.5B 的 SD3.5-Medium 学生模型中,Poly-OPD 将 GenEval 从 67.3 提升到 73.3,超越了两个更大的教师模型,并将 DrawBench HPSv3 从 9.34 提高到 11.35,从而在一个可切换模型中整合了双方的优点。
利用预训练的视觉-语言模型(VLM)构建视觉-语言-动作(VLA)模型,已成为三维机器人操作的一种颇具前景的范式。然而,现有的三维VLA方法仍依赖大量数据,在分布偏移下泛化能力有限,且缺乏对历史观测的显式记忆。这些局限性阻碍了其应用于数据稀缺、开放世界及依赖记忆的操作场景。我们此前的BridgeVLA工作通过在三维动作学习过程中保持预训练VLM的输入-输出对齐,提升了数据效率与泛化能力:原始点云被投影为多视角图像,并在生成机器人动作之前预测中间热图。在本工作中,我们通过为BridgeVLA配备统一的时空记忆架构,对持久的空间上下文与时序交互历史进行建模,从而发展了BridgeVLA++。由此产生的记忆增强框架能够在推理观测历史的同时,保持BridgeVLA的数据效率与泛化能力。大量实验表明,我们的框架在空间操作任务上取得了强劲性能,并展现出稳健的泛化能力。BridgeVLA++还在两个具有挑战性的依赖记忆的操作基准上取得了最先进的性能,且未牺牲原始BridgeVLA的数据效率与泛化能力。此外,BridgeVLA++在双臂操作设置中表现有效,并已在额外的真实机器人平台上得到验证,展示了其跨任务、跨环境及跨机器人平台的可扩展性。上述结果使BridgeVLA++成为一个统一的三维视觉-语言-动作框架,同时支持数据高效学习、稳健泛化及有效的记忆感知机器人操作。项目网站:https://bridgevla-plus.github.io/。
社交媒体上随手拍摄的单目视频和图像数量庞大,为沉浸式内容创作提供了宝贵来源,从这类稀疏观测中生成新视角可以极大提升用户体验。然而,当输入覆盖范围极为有限时,生成具有精确相机控制的照片级真实感且几何一致的视角仍然具有挑战性。基于重建的方法(如NeRF和3D高斯泼溅(3DGS))在稀疏输入下会严重退化,并且无法显式处理遮挡。生成方法放宽了数据需求,但由于几何引导不准确或隐式,仍然难以应对大基线视角合成。为了克服这些限制,我们提出了UniWorld-View,一个统一的框架,用于从单目输入进行可控的大基线新视角合成。UniWorld-View将显式3D引导与生成式扩散建模相结合,以实现精确的相机控制和几何一致的新视角生成。该几何引导通过一种遮挡感知的点云渲染策略获得,该策略解决了可见性歧义,并为基于扩散的合成提供了准确的先验。通过将该渲染策略与强大的视频扩散主干相结合,UniWorld-View即使在极端相机运动和大基线变化下也能实现高保真的新视角生成,并进一步为下游动态3DGS重建提供多视角视频。在WorldScore基准和零样本NVS基准上的实验证明了UniWorld-View在可控性、几何一致性和视觉保真度方面的有效性。
分子胶降解剂已成为一种前景广阔的靶向蛋白降解策略,其通过诱导E3泛素连接酶与靶蛋白之间形成三元复合物来发挥作用。尽管具有巨大的治疗潜力,分子胶的计算设计仍 largely 未被探索。与传统的基于结构的药物设计不同,分子胶设计受制于未知的蛋白质-蛋白质相互作用界面,需要同时模拟配体生成、蛋白质-蛋白质对接以及三元复合物组装。在本研究中,我们将分子胶设计形式化为一个三元复合物生成问题,并提出了一种受生物学启发的生成框架——TriGlue。受分子胶作用机制的启发,我们将三元复合物生成分解为两个耦合阶段:界面估计和界面条件下的复合物生成。首先,我们开发了一个SE(3)等变的界面估计模块,该模块能够从未结合的单体结构中预测具有几何约束的蛋白质-蛋白质相互作用界面。其次,我们引入了一个界面条件下的三元流匹配网络,该网络能够联合生成分子胶并预测组装三元复合物所需的刚体变换。大量实验表明,TriGlue能够生成化学上有效的分子并产生合理的三元复合物,这凸显了受生物学启发的生成建模在加速分子胶发现方面的潜力。我们的代码可在 https://github.com/yuliangyan0807/molecular-glue-design 获取。
随着图表图像、表格数据和可视化代码在众多领域中扮演越来越重要的角色,跨这些模态的跨表示理解对人工智能系统构成了根本性挑战:表示之间的关系本质上是一对多的,监督信号模糊且代价高昂,模型优化也缺乏一种既有方向适应性又具备表示泛化性的原则性信号,且该信号应超越特定任务目标。我们提出CoCoEvolve来提升图表、表格和代码表示之间的一致性。我们并未将跨表示映射视为一对多问题,而是定义明确的一一对应关系,并利用表示之间的一致性来优化模型,而无需额外标注。在训练阶段,CoCoEvolve@Train在图表-表格-代码循环中进行协同进化;CoCoEvolve@Test则在推理时应用相同的一致性目标,以实现测试时协同优化。我们还提出了CoCoEvolve@Eval,这是一个涵盖全部六项跨表示任务的评测套件。在四个基准上,CoCoEvolve在训练时和测试时设置中均提升了性能。我们的项目主页:https://xhguo7.github.io/CoCoEvolve/。
提示注入对LLM智能体构成了重大的安全风险。因此,高效且有效的红队测试对于评估这些风险以及收集训练数据以改进防御措施都至关重要。现有的先进提示注入红队测试方法主要依赖于强化学习(RL),其产生的攻击模型往往对新目标LLM的泛化能力较差。在本工作中,我们开发了PIMiner,一个用于提示注入红队测试的智能体系统。在训练阶段,PIMiner在一系列(数据集,目标模型)对上训练,并从零开始构建策略库。在测试阶段,学习到的策略库可以直接迁移到之前未见过的新目标LLM,无需额外训练。PIMiner对每个测试样本仅需少量查询目标智能体(例如10次)。实验结果表明,PIMiner取得了优异的性能。在IPIArena上,其对Gemini-2.5-Pro的攻击成功率(ASR)达到76.2%,对GPT-5.1达到61.9%,对Claude-Sonnet-4.5达到42.9%。在AgentDojo上,其对Gemini-2.5-Pro的ASR达到86.7%,对GPT-5.1达到53.3%,对Claude-Sonnet-4.5达到40.0%。
得益于LLM和自主智能体的进步,深度研究已成为被最广泛采用的智能体产品之一。然而,大多数深度研究系统生成通用报告,难以满足金融深度研究的需求。金融研究需要专业知识来分析历史模式并预测未来事件。因此,自动化金融深度研究既需要分层式的驱动框架来引导研究智能体,也需要一个可验证的时点基准,以防止未来信息泄露。我们提出FinanceHarness,这是一个运行面向金融的工具和从业者引导工作流的框架,能够端到端地自动化金融深度研究:包括环境和数据构建、智能体执行循环以及奖励建模。我们进一步提出FinanceGym,其中包含以投资论点驱动的研究问题,以及结合信息截止日前与截止日后标准的评分细则。专业专家验证通过率达82%。即使是领先的LLM和智能体,其在评分细则上的得分也低于40%,这表明FinanceGym具有挑战性,且仍有巨大的提升空间。在相同的开放权重骨干模型下,FinanceHarness将整体评分从25.3%提升至32.4%。FinanceHarness可在 https://github.com/Yijia-Xiao/FinanceHarness 获取。
大型语言模型正日益嵌入软件工程工作流程,作为能够检查代码仓库、调用工具、执行测试、调试故障并生成补丁的编码代理。然而,尽管软件开发是一个动态且富含反馈的过程——代码仓库不断演进、依赖关系持续变化、测试会失败、修复尝试会留下可复用的经验——大多数现有代理在部署后仍基本保持静态。这一矛盾催生了关于自我进化编码代理(self-evolving coding agents)的日益增长的研究工作,这类代理通过从先前的编码交互中更新其框架、记忆、技能、工具、模型或协作结构,来改进其未来的行为。在本综述中,我们对该新兴领域进行了系统性的综合梳理。我们首先定义自我进化编码代理,并将其与传统编码代理及通用自我进化代理区分开来。随后,我们构建了一个以对象为中心的分类体系,用以刻画这些系统中进化的对象,并通过两个正交视角加以补充:进化发生的时间以及驱动进化的软件特定证据。综合现有文献,我们发现可执行反馈、代码仓库级上下文和编码轨迹使软件工程成为一个独特的自然领域,适合代理自我进化,但同时也引入了反馈可靠性、基准过拟合、安全性、可维护性、成本和泛化能力等方面的新挑战。通过围绕这些维度组织现有工作,本综述旨在厘清自我进化编码代理的概念边界,并为设计更具适应性、更可靠且更具软件感知能力的智能体系统奠定基础。我们收集的论文可见于 https://github.com/zhouhao1024/Awesome-Self-Evolving-Coding-Agents。
多模态大语言模型(MLLMs)通过结合视觉和文本线索在真实场景中进行有根据的预测,然而现有基准很少揭示当这些证据来源发生冲突时模型如何在它们之间进行仲裁。我们提出SIGNPOST-Bench,一个用于评估文本-视觉冲突消解的可控反事实基准。每张源图像被转换为由原始(Original)、空白(Blank)、相似(Similar)、随机(Random)和对抗(Adversarial)变体组成的反事实五元组。合成的局部场景文本干预旨在保留非文本内容,从而能够对定位性能的变化以及由冲突文本引入的针对地理目标的定向偏移进行配对测量。SIGNPOST-Bench包含来自四个数据集的5,111个反事实组和25,555个图像变体。我们评估了来自七个提供商的20个MLLM。与原始图像相比,对抗变体将中位定位误差从282公里提高到1,347公里,增加了4.8倍。在可地理编码的对抗样本中,各模型有6.5%-20.1%的预测距离注入目标不到50公里,并且每个被评估模型都表现出从空白到对抗变体在目标距离上的正向平均配对缩减。兼容、无关和冲突的文本替换对模型预测产生不同的效应,而干净输入下的定位性能并不能完全预测对冲突文本的鲁棒性。这些结果将视觉地理定位确立为场景文本仲裁的连续诊断工具,并为评估MLLM如何解决冲突的多模态证据提供了一个受控框架。
诸如 pi0 之类的流匹配视觉-语言-动作(VLA)模型通过积分学习到的去噪速度场来生成机器人动作,并且据报道能够抵抗那些容易欺骗自回归 VLA 的对抗扰动。我们表明,这种鲁棒性在很大程度上是一种错觉:它源于先前的攻击忽略了多步去噪常微分方程(ODE)。我们提出了 DRIFT(通过对流匹配轨迹的输入扰动进行去噪重定向),这是一种放置在机器人夹爪上的测试时通用对抗补丁,用于攻击现成策略的去噪速度场。我们的核心发现是反直觉的:仅攻击去噪的第一步比攻击更宽的时间步窗口既更强又成本更低,我们通过输入空间优化特有的梯度冲突来解释这一点,而这与训练时后门机制恰好相反。在四个 LIBERO 套件上的 pi0 和 pi0.5 中,DRIFT 用一个很小的单一补丁便基本攻破了所有原本可解决的任务,远超动作空间和嵌入空间的攻击基线。
一个持久化执行状态以使运行可被中断、在崩溃后幸存并继续的框架,必须决定恢复对于已触发的副作用意味着什么。五个广泛部署的智能体工作流框架给出了不同的答案,没有一个暴露可机器检查的契约,且其行为甚至违反了它们所声明的片段。RESUME 契约规定了持久化 API 上的六个性质(前缀延续、副作用恰好一次、分叉确定性、检查点有效性、消费一次、恢复确定性),外加分叉意图和活性义务。一个 TLA+ 模型穷尽地检查参考语义,在缩放边界上保持不变(740 万个状态);一个 39 格故障矩阵产生了独立性所需的区分模型,而消费一次发生分裂,其消费子句独立于所有其他六个。一个确定性、无 LLM 的测试框架在固定版本上对其进行测量。LangGraph 1.2.9 持久地记录第二个恢复值但从不查阅它,静默地持久化模式无效的状态,并在真实 SIGKILL 后重新执行持久记录的已完成工作:在同一 API 上,跨中断为恰好一次,跨崩溃为至少一次。CrewAI 1.15.2 与其书面声明相反,重新执行已完成且带副作用的方法;pydantic-graph 1.x 在节点中途崩溃后无法恢复;所探测的框架中没有任何两个共享相同的符合性剖面。消费一次在顺序执行下成立,在并发投递下失败:k 个进程恢复一个挂起的中断会触发门控副作用 k 次,在 40 个格子中有 36 个饱和度为 1.0,且该失败跨越主机。REMIT 是一个参考序列器,其经 Verus 验证的恢复核心与发布的可执行文件逐行相同,修复了分叉和有效性格子。跨进程格子在读路径上被修复,且该修复已交付:一个自愿加入的门控在共享存储中声明消费,在任何节点执行之前,为一个竞态者提供服务并拒绝其余竞态者。
对AI模型的红队评估支持某些主张而不支持另一些主张,而这二者之间的界限是可以计算的,而不仅仅是一个判断问题。我们将评估的证据上限定义为一个结果在固定测试预算下能使信念移动的最大倍数,并针对基准测试的零结果以闭式形式推导出该上限,从而精确地定位上述界限。我们发现,在可计算的危害率之上,一个中等规模的基准测试足以按既定证据标准对某一类别给出认证;此时,零失败记录是两种可能观察中更强的一种,其证据分量超过单个可复现的失败。在该危害率之下,任何可行规模的被动基准测试都无法在固定评分规则和近似独立的试验结构下提供所要求的安全性证据。两种状态之间的交叉点具有闭式形式。这一界限并非基准测试所特有:以程序的假设条件引出率来表述,它也适用于自适应和自动化红队测试,并表明决定证据价值的是假设之间的区分,而非攻击是否成功。我们依据这一界限审计了八个评估套件,发现当前基准测试对高频危害类别来说是充分的,但对罕见且灾难性的危害类别则短缺几个数量级。安全基准测试并非没有信息量;它们提供的是关于一组特定且可计算的命题的信息,而它们所需要的规范是明确说明这些命题是什么。