每日精选AI研究论文及翻译
当AI导师能适应每个学生的优势、劣势和偏好的指导方式时,其作用最大。然而,关于哪种指导对哪个学生更有效,从真实学习者那里收集此类证据既稀疏、缓慢且成本高昂。学生模拟器可作为一种代理来提供此类信号,但现有方法存在局限:状态跟踪模型能拟合学生行为,却难以处理解释或纠正;而大语言模型(LLM)的角色扮演虽能流畅地遵循指导,却无法可靠地匹配所模拟学生的真实能力水平。为此,我们提出了StudentSim,一种训练框架,通过先进行汇总训练,再进行针对单个学生的特化,将稀疏的个体学生数据转化为个性化模拟器。由此产生的模拟器既能复现学生自身的回答,也能在导师指导下更新这些回答。我们还推出了StudentSimEval,一个标准化评估协议,覆盖国际象棋、第二语言英语写作和数学三个领域的60名学生,使用公开共享、记录经去标识化处理的学习者数据集。StudentSimEval衡量两个核心指标:行为保真度(F),即模拟器匹配学生回答的程度;以及指导响应度(R),即模拟器在导师指导下更新的难易程度。所有方法均在相同的记录上进行拟合并评估。在全部三个领域中,StudentSim在两项指标上均优于GPT-5.4。在国际象棋上,StudentSim达到F=0.51、R=0.91,而GPT-5.4仅为0.23和0.72,Maia2为0.45和0.27。作为概念验证,将StudentSim用作导师强化学习的奖励模型,训练出的国际象棋导师被人类专家评价为比无强化学习基线以及以GPT-5.4模拟器奖励训练的导师更准确、指导性更强且更加个性化。代码见https://github.com/microsoft/StudentSim。
我们提出了 Qwen-Drive-1.0,这是迈向自动驾驶视觉语言基础模型的初步探索。Qwen-Drive-1.0 保留了预训练视觉语言模型(VLM)的架构,并在统一框架内整合了三维感知、视觉问答与运动规划。一个外部的鸟瞰图(BEV)感知头联合执行三维目标检测、语义占用预测和 BEV 地图分割。它作为对共享表示中可用三维信息的探针,并为三维场景结构提供显式且可检查的接口。一个规划专家(Planning Expert)以共享的 VLM 表示为条件,生成未来的自车轨迹。分阶段的训练策略将驾驶监督与通用视觉语言数据相结合,以获取驾驶特定能力,同时帮助保持广泛的视觉理解与指令跟随能力。实验表明,该方法展现出强大的三维感知与驾驶场景理解能力,同时在很大程度上保持了通用视觉语言能力。在开环、伪闭环和闭环设置下的综合评估进一步显示,其运动规划性能具有很强的竞争力。
循环Transformer通过迭代一组共享层来增加有效深度,但大多数评估在固定模型规模下进行比较,从而将架构优势与额外FLOPs混为一谈。我们在混合专家Transformer上研究循环,同时严格控制每词元FLOPs、总非嵌入参数和KV缓存与基线匹配。通过一系列消融实验,我们得出一种称为SMELT(Sparse MoE Transformer,中间层循环两次)的方案:在三项预算均与无循环基线匹配的条件下,将中间一半的层循环两次。我们将SMELT扩展到四种规模,非嵌入参数最多达54B,并为每种架构分别拟合了一条Chinchilla式缩放定律。随着计算量增加,SMELT的损失下降更快,在计算最优前沿上可节省6.8%–18.0%的训练FLOPs。这一优势可迁移至下游基准,且幅度超过验证损失的预测范围;在代码任务上最为显著,并随样本长度和上下文示例数量的增加而增强。机制分析表明,第二次访问降低了注意力下沉现象,并将注意力权重重新分配至内容相关词元上,这一归纳偏置可能是上述性能提升的基础。这些结果表明,即使在预算匹配条件下,循环也能改进Transformer,为将深度复用转化为可测量收益提供了一种实用方案。
多模态GUI智能体已成为数字任务自动化的前沿范式,然而,从以基准测试为导向的模型迈向可靠的现实世界应用仍面临诸多挑战,其根源在于环境覆盖有限、任务构造脆弱以及奖励验证不可靠。为此,我们提出UI-Venus-2,一种通用型基础GUI智能体,能够通过统一的闭环推理—行动框架在移动、网页与桌面环境中运行。为弥合实际部署之间的鸿沟,我们对三个关键维度进行了协同扩展:(1) 环境维度,将覆盖范围扩展至170余个多语言移动应用及原生桌面操作系统;(2) 任务维度,引入深度研究流水线,实现基于功能的指令生成;(3) 验证维度,采用轨迹级与样本级评估器,并结合视觉关键点与多模型投票机制,从而为训练提供可靠的强化学习信号。此外,我们还整合了安全感知机制,确保关键操作得到受控执行。凭借自身能力强、效率高且开源的基座特性,UI-Venus-2推动了该领域向着更可泛化、更可验证、更可自省的现实世界应用智能体方向发展。
我们提出 H3-World,一个高效的框架,可将 33B 参数的 MiniMax-H3 视频生成器转化为交互式世界模型。我们的关键发现是:随着大型视频生成器能力的增强,语言正成为一种自然的控制接口。例如,MiniMax-H3 已支持通过自然语言指令对角色行为和摄像机运动进行零样本控制。在此基础上,H3-World 将该粗粒度语言接口转化为精确且时间锚定的世界控制,而无需引入专门的动作模块。具体而言,我们将每个动作表示为角色指令与摄像机指令的结构化组合,并将其与相应时间区间的视频潜在表示对齐。为了实现时间上的精确控制,我们进一步引入时间注意力路由机制,将每条指令限制在其预期的时间区间内,从而减少跨动作的控制泄漏。重要的是,H3-World 直接复用大规模视频预训练阶段学习到的语义表示,仅需轻量级适配。仅使用 8,000 个游戏样本、10,000 步 LoRA 优化和 0.199% 的可训练参数,H3-World 便实现了有效的角色与摄像机控制,同时保持了优异的生成质量,并能泛化到未见过的场景。这些结果表明,大型视频生成器中涌现出的控制能力可以被高效地转化为交互式世界控制。
机器人操作面临一个根本性的扩展挑战:鲁棒的泛化需要广泛的物理经验,然而带有动作标注的机器人轨迹采集成本高昂,且多样性天然受限。第一人称视频提供了一种可扩展性远为更高的具身经验来源,能够捕获跨多样环境中的物体交互、接触动力学、工具使用以及长时程行为。核心挑战在于如何将这种丰富但无动作标注的经验转化为有效的机器人控制。我们提出ZimaBlue,一个从大规模视频中学习可泛化世界动作模型(WAMs)的可扩展框架。ZimaBlue遵循三阶段训练课程:首先在大规模人类和机器人第一人称视频上进行因果具身视频预训练,然后通过采用统一动作表示的视频-动作中间训练,将所学到的视觉动力学锚定到异构机器人轨迹上,最后将模型特化到目标机器人以进行部署。为了使生成式WAMs适用于实时控制,ZimaBlue进一步采用异步快-慢双系统架构,其中高容量的慢速世界模型提供可泛化的时空表示,而轻量级的快速分支能够在NVIDIA RTX 4090上实现30 Hz的动作预测。在真实机器人的零样本评估中,将训练数据从仅目标机器人数据扩展到超过120,000小时的具身视频,成功率从36.1%提升至77.8%。ZimaBlue在多个基准测试中进一步展现出强劲性能,在未见任务上的提升尤为显著。
数据驻留约束迫使企业自托管大语言模型(LLM),但在不淘汰旧模型的情况下持续引入新模型,会不断扩充服务集群,使本已有限的GPU资源池进一步碎片化。我们通过生产环境错误分析,沿指令遵循、函数调用和内部任务分布三个维度识别并弥合质量差距,将来自200多个内部应用的流量整合到单一模型之上。质量由按生产流量分层构建的离线基准进行追踪,并由确定性验证器或经校准的LLM评估器评分。我们并未采用对所有目标联合优化的方式——这种方法会引入跨域奖励干扰——而是为每个维度分别训练一个GRPO专家,并通过两阶段球面线性插值(SLERP)进行融合。各专家的奖励信号分别暴露一种独特的失败模式:语义坍缩、过度调用和冗长性欺骗,每一种都需要领域针对性的修复方案。在非推理模式下,该方案在内部Arena基准中以69.6对65.8的成绩超越了总参数量约大7倍的基线模型,指令遵循得分为0.85对0.83,函数调用得分为0.79对0.77,同时提升了通用对话基准的表现。该模型以极小比例的服务成本承载了平台50%的流量——即每月1.16亿次请求。
多跳问答(QA)的一个核心瓶颈在于,问题的表达粒度通常与语料证据的可检索粒度不一致。现有方法通过在语料上施加固定图结构、迭代地改写查询,或执行一个在语料上生成的程序来应对这种不匹配;但这些策略并未明确判断一个查询单元何时已被证据支持、何时应当被进一步细化。我们将这一瓶颈形式化为“可检索粒度发现”,并引入Hi-Q——一种以证据为条件的分层查询细化框架。在每个查询节点上,一个解析算子会测试检索到的证据是否支持当前查询单元;已解析的节点终止,未解析的节点则由一个保持依赖关系的二元算子进行扩展,并通过语义覆盖验证器检验。因此,Hi-Q生成的查询树,其拓扑结构由语料支持信号决定,而非由固定分解模板或预构建图决定。 我们在三个多跳问答基准上评估了Hi-Q,主要采用全语料检索设置;在该设置中,答案所依赖的证据必须从开放域干扰项中定位,而非取自小型标注池。在此设置下,Hi-Q在三个基准上的平均EM为52.3、F1为64.0;在相同平均指标上,比迭代检索基线IRCoT高出15.1 EM / 18.2 F1;在MuSiQue-full上,比基于图的RAG基线PropRAG高出11.5 EM / 12.0 F1,且无需构建全语料图。在先前工作所用的受限支持/干扰项设置中,Hi-Q同样取得了最佳准确率,平均EM为57.9、F1为69.3,比PropRAG高出5.6 EM / 3.9 F1,比IRCoT高出13.7 EM / 15.8 F1。项目页面见 https://hi-q-project.github.io/。
多模态大语言模型(MLLMs)是图像和视频的强力感知器。我们探究这种能力在多大程度上可以延伸至行动领域:将MLLM直接置入无人机的控制回路,其全部动作空间仅通过提示词声明。近期系统虽已接近这一设定,但日益收窄模型的决策范围。我们将其重新拓宽。我们提出DroneCATS-Agent——一种将MLLM作为可替换组件的架构——以及DroneCATS,一个将模型视为自变量的基准。超越单纯飞向某个像素,我们的智能体将偏航与搜索、不确定时的深思熟虑、以及自主声明到达等任务全部托付给模型——无需微调或函数调用模式。我们在四项核心能力上评估前沿模型与开放模型——接近可见目标、追踪移动目标、在初始视野之外搜索、以及指挥多无人机编队——结果表明,即便最简单的具身设定也远未得到解决。关键在于,为了识别在边缘端率先失效的环节,我们的模型阵容下探至20亿参数。研究结果揭示了一个鲜明的悖论:失效的并非飞行本身。小型开放模型往往比前沿模型更可靠地飞入成功半径,却因过早或根本不声明到达而输掉回合。多机指挥进一步放大了这一差距,小型模型会因盲目地将单一坐标复制到不同视角而失败。从视觉-语言-行动智能体的视角来看,模型的空间感知尚能维持,但其行动协议却难以达标。区分可部署的边缘模型与前沿模型的,并非导航能力,而是持续执行既定协议并发出正确终止动作的纪律性。弥合这一差距所面临的开放问题,在于以机载计算成本实现——产生一个既能持续规划、又能在恰当时刻准确知晓任务完成的快速模型——而DroneCATS正是为度量这一距离而构建。
虽然统一多模态模型(UMMs)在单一模型内联合执行视觉理解与生成任务,但功能上的统一并不能保证学习上的协同效应:这两个目标可能相互促进、竞争模型容量,或仅仅是共存而已。我们在一个受控的、结构上原生、且无预训练视觉先验的设置中,从表征、任务和系统三个层面考察了它们之间的关系。在表征层面,我们发现每个目标都为另一个目标提供了有用的信号:生成为理解任务丰富了所学到的视觉特征,而理解则增强了生成任务所需的视觉-语言对齐。然而,当两个目标被迫经由同一条计算路径时,往往会出现一方主导的情况。一种任务解耦的架构,在保持语义交互的同时对相互冲突的视觉计算进行专门化处理,能够避免这种不对称的性能退化。在任务层面,通过三项案例研究,我们发现当理解任务和生成任务依赖共享知识时,会产生正向的双向迁移。在系统层面,我们表明,在明确需要同时具备图像理解与生成能力的复杂任务上,端到端的UMM要优于与之匹配的规划器-执行器流水线。综合来看,这些结果表明UMM的价值不仅限于统一接口:恰当的特化、共享的任务知识以及端到端优化,能够将共存转变为协同。
长时程复杂任务要求基础模型在长期交互中持续积累信息、维持内部状态并不断适应。安全性应当是模型自身的内在属性,而非仅仅依赖外部防护或事后对齐(如监督微调)等外部手段加以约束的行为。由此我们提出“由内而生的安全”(Safety from Within)理念:与安全相关的能力应在模型的原生计算中得到表征并被调用。我们基于这一理念构建了 Safin-1——一个通过记忆路由与状态演化实现该原则的基础模型系列。Safin-1 建立在跨上下文历史的记忆锚定路由(Memory-Anchor Routing across Context History, MARCH)架构之上。MARCH 维护结构化的记忆状态,并通过内容条件路由有选择地检索相关历史信息;同时,它支持在不反复修改主干网络的前提下对持久能力状态进行测试时自适应,从而在共享基础之上实现受控特化。我们以安全状态(Safety State)为接口,在下游安全任务上考察了这一机制,结果表明这种基于状态的自适应方式能够带来显著的安全性能提升。更广泛地看,路由状态接口将上下文记忆与持久能力自适应统一于模型的原生计算之中,使记忆从对先前上下文的被动记录,转变为维持并演化模型行为的主动基质。通用能力、长上下文理解、检索与效率等方面的评测进一步验证了 Safin-1。这些发现为将安全性塑造为一种状态原生、可自适应维护的能力指明了路径。需要指出的是,本工作仅是对“由内而生的安全”理念的初步架构探索,要实现这一更宏大的愿景仍需大量后续研究。
LLM评判器被广泛用于评估智能体工具调用系统,然而它们在结构化、依赖驱动工作流上的可靠性在很大程度上仍未得到检验。我们提出AgentJudgeBench,这是首个系统性地研究LLM作为评判器在工作流DAG智能体工具调用任务中可靠性的基准,区别于更广泛的开放式文本或偏好评估的LLM评判器任务。该基准包含3,808个实例,涵盖六种DAG拓扑结构和三个难度层级,使用五种生成器(30亿至700亿参数的开权重模型以及GPT-5.4)和六种评判器(200亿参数至前沿规模)在有无标准答案配对条件下进行评估。评判器对齐度随任务难度单调下降,无标准答案时的下降速度是有标准答案时的1.5倍;在无标准答案的困难查询上,所有六种评判器无论规模大小均收敛于狭窄的77%-82%区间,揭示了主要由任务难度驱动的结构性天花板,尽管其高度对较弱的生成器部分依赖于提示词,但模型容量本身无法突破这一限制。标准答案的暴露并非均匀有利:它降低了GPT-5.4(1.5个百分点)和Gemini-2.5-Pro(3.9个百分点)的对齐度,与过度锚定效应一致。在缓解策略中,思维链推理和评判器温度均影响甚微,而结构化评估量规可将对齐度提升最多6.5个百分点,但无法在评判器-生成器对之间均匀泛化。在有标准答案的条件下,QwQ-32B与程序化参考最匹配,而人工验证研究识别GPT-OSS-120B为最符合人类对齐的评判器;在无标准答案的条件下,前沿评判器仅在共有天花板内略微领先。这些结果揭示了当前LLM评判器的根本局限性,并为智能体系统的可靠评估提供了实用指南。
自博弈是语言模型自我进化的有效范式,但在缺乏引导的情况下,求解器的性能可能随轮次推进而停滞甚至下降。无引导方法通过难度、可学习性或多样性等信号驱动问题生成,这些信号使问题保持挑战性和多样性,但并未指明后续轮次应针对哪些未解决的内在推理薄弱点。有引导方法从外部任务资源(如人工示例、文档语料库或指定的难度目标)获取方向,因此依赖于自博弈循环之外提供的任务信息。我们证明所需的引导可以从求解器自身的失败历史中推导出来。我们提出了DiagEvo,其诊断器从失败历史中提取反复出现的错误原因,并将其存储于层级化的错误原因记忆中。该记忆将相关原因归组于技能节点之下,并根据针对性问题上的自一致性将每个节点标记为“活跃”或“已掌握”。挑战者利用这些状态及复发次数,在原因定向生成与自由探索之间取得平衡。双重置信度过滤仅在最常见求解器答案具有明显票数领先优势时,保留中等难度问题。DiagEvo从自博弈过程中产生的信息推导其课程,无需任何外部任务资源。在默认的4B诊断器配置下,对于三种求解器——Qwen3-4B、Qwen3-8B和OctoThinker-8B——DiagEvo在全部九个基准上的平均准确率均优于所有基线。在Qwen3-8B上,DiagEvo在五个数学推理基准上达到72.3%的平均准确率,比R-Zero高出4.5个百分点;在全部九个基准上的平均准确率为57.4%,比DARC高出1.1个百分点。消融实验表明,层级化错误原因记忆与双重置信度过滤均对此增益有所贡献。
本文研究自主软件开发——基于大语言模型(LLM)的编码智能体在无需人工干预的情况下,将高层次需求转化为完整、可运行、可用的软件系统。我们提出了 Harness-of-Harness(HoH)框架,使编码智能体能够在自主开发过程中持续改进软件。HoH 运行于现有编码智能体 harness 之上,并将其执行过程组织为迭代的“规划—编码—测试”循环。为了在各循环中维持持续改进,HoH 在修复与能力增长之间取得平衡,将开发范围界定为小而可验证的增量,将实现阶段的测试与独立评估相分离,并以可验证输出为约束而非预先规定智能体工作流。HoH 渐进式地开放交付物、角色专用工具与技能,鼓励复用而非重新创建,并维护带版本控制的项目历史。在 GameCraft-Bench、FrontierSWE 和 ProgramBench 上,针对三对 harness-模型组合(Codex with GPT-5.5、OpenCode with DeepSeek-V4-Pro、Pi with MiniMax-M3),HoH 均持续优于对应的独立 harness,经过三轮迭代后平均相对提升达 52.25%,最大提升达 82.86%。在一次持续多日、超过 70 次迭代的部署中,HoH 自主开发出一款第一人称射击游戏,该游戏具有连贯的故事情节、完整实现的核心玩法机制、可供人类玩家完整体验的可玩性、精致的视觉效果以及集成的音频。GitHub:https://github.com/Flesymeb/HarnessOfHarness 项目主页:https://flesymeb.github.io/HarnessOfHarness/
多模态记忆为长视频问答提供了一种可扩展的接口,但现有方法往往以孤立片段的形式检索字幕、帧、转录文本、摘要或图谱事实。这些片段虽然可被检索,却无法直接用于生成:语言模型必须在推理阶段重建跨模态与时间对齐,而该阶段上下文有限且归因困难。为此,我们提出EM^2Mem——一种以事件为中心的多模态记忆框架,在记忆构建过程中将异构证据绑定到事件锚点。每个以事件为索引的记忆单元对齐多模态记录、时间上下文、图谱关联关系、语义事实与来源信息,从而支持围绕锚定的多模态事件进行紧凑的证据读出,而非围绕模态特定的片段。在三个长视频问答基准上,EM^2Mem相较最强记忆基线将平均准确率分别提升2.0、2.4和3.7个百分点,将严格的事件级Top-5证据召回率提升7.0个百分点,并将单查询延迟降低4.67倍、推理词元总量减少63.66%(代码将整合至https://github.com/zjunlp/LightMem)。
认知语言智能体通过为语言模型配备记忆、工具和决策程序,使其能够在交互环境中进行推理和行动,从而取得了显著进展。现有框架在很大程度上将这些智能体视作求解用户指定的、有界任务的系统。一个日益重要的目标是:让语言智能体在用户需求、上下文和服务流程持续存在且不断变化的长期环境中提供持续性协助,并能在随时间涌现的各类任务中持续发挥作用。然而,我们仍然缺乏一种能够刻画持续型AI智能体、梳理现有工作并指导未来发展的框架。为此,我们提出了一种面向持续智能体的以感知为中心的架构(Perception-Centered Architecture for Persistent Agents, Pera)。Pera 将持久智能体描述为围绕感知组件与控制组件组织起来的系统:这些组件持续感知来自情节性任务执行、内部上下文以及周围环境变化中与服务相关的信号,并利用这些信号构建生命周期任务。这些任务驱动智能体服务流程的持续运行与适应。我们使用 Pera 对近期工作进行回顾性梳理,考察一个详细的案例研究,并为构建能力更强的持久智能体提供前瞻性洞见。正如软件工程从“小型编程”走向“大型编程”一样,Pera 也将语言智能体的演化框定为一种类似的架构转型,即朝向长期运行的自适应智能系统。
提示优化可以改进多智能体大语言模型系统,但被优化的提示往往同时承担两种相互交织的角色:生成任务相关内容,以及指定执行关键协议——如消息路由、输出格式化和终止信号——底层代码依赖这些协议运行。因此,旨在改进内容生成的提示编辑可能无意中破坏协议,导致整个智能体流水线失效。我们的关键观察在于,这两种角色具有不同的表征形式:执行协议通常是结构化的,而任务相关内容通常以非结构化语言表达。基于此,我们提出控制-数据流分离方法,其中执行关键控制被表示为类型化、已验证的程序对象,而任务相关语言则保留为可优化的数据流,用于智能体间通信。该设计使优化器能够改进多智能体行为,同时不将路由或格式化接口暴露于提示漂移的风险之下。在合成推理、协作式评审生成和保险评级工作流等任务中,我们的框架实验证明能够实现100%的最终协议有效性,同时持续改进任务性能。
长期智能体任务不仅仅是跨更多交互轮次的短期任务串联。其动态演变的环境和长期依赖关系要求大语言模型(LLM)在数千步之内持续探索、从经验中学习并调整策略。我们推出了E-Commerce Bench,这是首个将多轮对手方谈判和动态事件整合到长达一年商业运营中的开源基准测试。在365个日历年日中,一个LLM智能体同时运营多家在线商店,研究市场、与供应商谈判采购库存、优化销售策略、履行订单、处理退货并管理现金流,以最大化其年末总资产。为了构建逼真的商家侧运营环境,产品和供应商数据来源于真实的电商平台,而全年持续的促销活动、自然灾害和供应链冲击日历则不断重塑需求。为确保可复现性,市场双方均为确定性的:客户购买和退货遵循固定的需求模型,谈判内核决定供应商的定价、让步和决策,LLM仅用于将其语言化。我们从七个维度(包括年末资产)评估了18个前沿模型,发现没有任何单一模型占据主导地位。GPT-5.6 Sol赚取最多收益,将100,000初始资金增长为1,431,425,但在反欺诈维度上位列18个模型中的第16位,且在运营效率上落后于Fable5。在开放权重模型中,Qwen3.8-Max-Preview以416,252的成绩领先,比GLM 5.2(高)高出38%,并在整个时间跨度内展现出最强的学习能力,在重复订单中逐步压低谈判价格。我们的代码可在 https://github.com/QwenLM/E-CommerceBench 获取。
生成专业学术内容,如同行评审与反驳意见,需要领域推理与事实依据之间错综复杂的协同配合。本工作提出了一个综合框架,用于开发和评估专业学术智能体——InternReviewer与InternAdvocate。我们首先构建了一个大规模、高质量的学术数据集,并集成了一种高效率的arXiv检索工具,以实现主动的证据收集。为优化这些智能体,我们实施了一种由统一目标指标和奖励系统驱动的智能体强化学习范式。该系统通过采用多维标准,包括基于参考文献锚定的语义对齐、结构合规性,以及一种将引文与实时交互日志交叉核对以消除幻觉的严格验证机制,从而避免了基于主观模型评判的偏差。实验结果表明,在此闭环框架内训练的智能体在推理深度和引文准确性方面均展现出显著提升。
人工智能越来越多地被用于产生未来人工智能系统的研发过程中。我们研究了这种反馈何时会变得自我放大。我们的模型描述了人工智能能力增长速度如何取决于基线研究生产率、递归反馈以及研究进展日益增加的难度。我们推导出一个递归再生数R_{AI},它决定了改进在开发周期中是被放大还是被衰减。该量将反馈强度与进一步进展变得更加困难的速度进行比较。当R_{AI} > 1时,改进的效应在多个开发周期中叠加累积,使系统进入自我放大状态。当R_{AI} < 1时,其效应在周期中逐渐减弱。这一转变取决于人工智能研发反馈回路的结构,且不必发生在任何特定的模型能力水平上。因此,系统可能在加速变得可见之前就进入自我放大状态,而快速进展也可能在没有自我放大的情况下发生。更高的基线研究生产率可以加速进展,但不会改变系统是否自我放大,然而开发周期的时长成为放大的一个限制性时间尺度。研究难度的增加可以终结一段自我放大时期。将该模型扩展到多个研究主体表明,跨组织共享的改进可以使整个研究生态系统实现自我放大,即使在没有任何单一主体实现自我放大的情况下也是如此。该框架识别出人工智能研发系统的可测量属性,有助于将递归放大与由其他来源驱动的快速进展区分开来,这些属性包括递归反馈的强度、改进有效传播到后继系统的程度、周期时长以及进一步进展日益增加的难度。
测试时自适应(Test-time adaptation, TTA)通常假设模型参数可以在推理时更新。对于仅支持推理的加速器、冻结模型或第三方模型以及内存受限的部署而言,这一假设具有很强的限制性;同时,基于批归一化(BatchNorm)的标准TTA配置在没有批归一化的架构上也可能失效。本文研究已学习模型必须保持冻结时的适应问题。我们提出CASTER,一种无梯度方法:它在判别性子空间中存储源类别统计量,根据目标批次矩估计类别共享的仿射变换,并在分类前解析地迁移源类别分布。CASTER不需要反向传播、优化器状态或存储的源特征库。在四个骨干网络和七个数据集上,CASTER在28个骨干网络-数据集设置中的27个上优于使用相同冻结特征的k-NN,同时其中位状态量仅为k-NN的1/18。仿射迁移并非总是可靠。在ImageNet-C上,批次仅含64个样本而类别数为1000,无条件迁移导致top-1准确率下降21.2个百分点。因此,我们提出一种经验性的残差-间隔可迁移性证书。在307个评估单元中,所有损失超过10个百分点的迁移,其证书值均高于3.9,尽管良性情形与破坏性情形并未被完全区分开。门控将无条件迁移平均-3.35个百分点的效应转化为+1.69个百分点的收益,并且在很宽的阈值范围内,性能与最佳阈值下的结果相差不超过0.3个百分点。最后,我们证明该证书具有机制特异性:将其应用于Tent时,它只接受4.3%的更新,并仅保留Tent可用增益的0.6%。这些结果将CASTER定位为一种适用于冻结模型部署的轻量级适应机制,同时明确说明了其安全信号在何种情况下具有信息量、在何种情况下不具有信息量。
多模态几何推理要求视觉语言模型提取精确的视觉关系,并在多步推理中保持这些关系。现有的自由形式推理轨迹掩盖了决定答案的决策,而轨迹级强化学习则将单一的最终信号分配至整个响应。我们提出信用可寻址推理(credit-addressable reasoning)。在该原则下,推理过程中展现的语义单元同时界定了学习在何处比较备选方案并分配信用。我们以Code-CoT和CE-GRPO实例化这一原则:Code-CoT保留图形,将视觉关系表示为可逐行寻址的可执行代码,并将推理组织为类型化事件;CE-GRPO利用结构先验和类型归一化熵选择事件边界,从共享前缀中采样完整的后续生成,并将结果差异转化为局部优势。在九个几何基准上,CE-GRPO的平均准确率达到76.04,分别比Qwen3-VL-8B和轨迹级GRPO高出8.09和3.43个百分点。其相对优势随中间事件数量的增加而增大,这证明了表示与优化协同设计对于长链条、高依赖性的多模态推理的价值。
宝贵的数据仍嵌入于非结构化来源中:网页、报告、合同、申报文件、财报电话会议记录和PDF文档。企业AI领域的重大布局在于部署LLM智能体,使其能够对这些数据进行推理,为每位知识工作者解答复杂问题。如今智能体已能胜任此项任务,但成本高得令人却步。每个问题都会反复打开大型文档以检索分散的证据,消耗多达百万级token。然而,如果数据已经结构化,同样的问题只需进行一次廉价的数据库查询即可解决。例如,在FanOutQA基准测试中,基于理想预结构化存储的推理成本仅为原有的1/28,且随着问题在更多文档中扇出,这一差距可扩大至数量级。然而,预先将所有内容结构化并不可行:文档所蕴含的可能结构远超任何工作负载实际所需,而且有用的结构和文档在查询到来之前无从知晓。我们提出智能体数据破解(agentic data cracking)方法,该方法将非结构化数据作为推理过程本身的副产品,进行自适应性和推测性的结构化。其自适应性体现在观测到的查询决定了何时进行结构化以及何种结构最为重要;其推测性体现在它不仅服务于当前问题。每当智能体打开文档进行作答时,一个破解子智能体从已加载的上下文中以边际成本分叉而出,提取可能服务于未来相关查询的基于事实的结构。随着时间的推移,越来越多的查询完全由结构化数据覆盖,无需打开文档即可作答,从而使智能体的准确性保持在接近RAG成本的水平。在FanOutQA上,若每个测试问题仅附带一个相关问题进行扩展,破解方法可在保持准确性的同时将成本降低53%。智能体数据破解是迈向面向非结构化数据智能体推理的下一代数据基础设施的第一步:一个位于模型之下的共享基座,推理过程中已付出代价挖掘出的知识在此不断积累。
SAR-to-EO图像翻译旨在从合成孔径雷达(SAR)观测中生成光电(EO)图像。现有的潜在扩散方法通常继承预定的自编码器,尽管重建保真度在不同编解码器和模态之间可能差异显著。由于潜在编解码器影响SAR条件和EO目标在编码-解码往返过程中的保留,编解码器选择构成了一项基本设计选择;然而,现有方法大多依赖在自然图像上预训练的编解码器。针对此问题,我们提出了ReFlowSET,一个条件潜在流匹配框架,通过联合SAR–EO重建审计来选择其编解码器。ReFlowSET并未继承重型预训练生成器,而是在选定的潜在空间中从头训练一个显著更小的条件DiT(Diffusion Transformer),采用双流SAR条件化并随后进行联合特征细化。为了给这种从头训练提供语义指导,我们将中间噪声EO特征与由冻结的视觉基础模型提取的干净目标EO表示进行对齐。这种对齐仅用于训练阶段,不引入额外推理成本。在QXS-SAROPT和SAR2Opt上的实验表明,该方法在多种感知保真度和分布指标上取得了最先进的性能。代码和预训练权重可在https://github.com/KAIST-VICLab/ReFlowSET上公开获取。
传统的政治传播框架建立在线性、事件驱动的前提之上,将选民说服视为一种静态的、交易性的功能。本文引入动态同意工程(Dynamic Consent Engineering, DCE),这是一个新颖的跨学科范式,将爱德华·伯内斯(Edward Bernays)的公共关系基本原理与系统动力学的S-E-E-D(雪球、均衡、弹性、支配)框架加以综合。通过将伯内斯式的操作约束扩展为四维资源矩阵(在人力、智力和资本之外纳入算法媒体基础设施),我们从数学上形式化了民主制度如何建构、优化并维持政治支配地位。我们将伯内斯的经典八步工程工作流直接映射到非线性反馈回路、信息时间滞后和人口承载能力之上。通过对系统性反馈结构的严格建模,我们分离出政治弹性、政策阻力平台期以及阈值触发的信任崩塌的动态根源。最后,我们建立了一个四步诊断流程,并通过历史参照模式验证对该框架进行校验,证明长期政治稳定所依赖的并非转瞬即逝的修辞,而是政策执行与动态反馈校准之间的结构性同步。
商业短剧制作遵循多阶段链条:剧本、分镜、关键帧图像、镜头级视频,直至成片短剧。现有大多数基准仅使用预先编写的输入而非真实上游流水线输出,对视频生成单一阶段进行评估。这导致两个关键问题无法回答:每个阶段是否遵循原始剧本意图(而非仅遵循其直接输入提示),以及不同镜头在组装为多集作品后能否保持连贯性。我们提出DramaChain Bench,这是首个对完整制作链条中每一阶段进行评估的短剧基准。它基于三个共享同一维度系统的内部系统构建,即DramaChain Dimensions:在每一阶段实例化的五个评估轴,细化为63个叶子维度。DramaChain Agent在流程和成片短剧质量两方面均以商业短剧平台为校准基准,从而实现跨模型的阶段级公平比较。DramaChain Labeling System对全部5,785个项目中的每一项均由三名专业标注员独立评分,所有缺陷均进行时空定位,并从预定义的缺陷列表中选取。该流程产生17,488个有效评分和255,925条可追溯的归因记录。人工标注确认上游缺陷沿流水线级联传导,表明最终剧集质量并非仅由视频生成阶段决定。DramaChain Agentic Judge随后自动对每个叶子维度评分,在多个智能体回合中收集证据,再依据逐项检查清单进行评判;其复现模型排序的平均PLCC达0.918,足以在零标注成本下接纳新模型。
基于Logit的知识蒸馏(KD)用于通过更强的教师模型监督来训练较小的语言模型(LM),但其收益在训练各阶段是否一致仍不清楚。通过受控实验,我们发现,使用后训练(post-trained)教师模型的前向Kullback-Leibler(KL)蒸馏——即标准KD形式——在中期训练(mid-training)阶段表现截然不同,而中期训练是自监督学习中介于预训练与后训练之间的一个中间阶段,在精选语料库上进行。令人惊讶的是,尽管前向KD在预训练阶段相较于标准下一词预测(NTP)能同时提升推理能力和事实回忆能力,但在中期训练阶段,它却在持续提升推理能力的同时减慢了事实回忆的获取。我们将这种阶段依赖性归因于教师模型在不同数据领域上的置信度不对称性以及学生模型不断演进的知识状态:教师模型在程序性数据上比在知识密集型数据上更为自信,而学生模型在训练早期便获取了低熵的事实性知识。为缓解这种不平衡,我们提出Switch Distillation——一种简单的中期训练目标,它在教师模型具有较高置信度的词元上进行蒸馏,使用教师预测熵作为轻量级路由信号,否则回退到交叉熵。Switch Distillation在不同教师规模下均一致优于现有蒸馏目标。相较于标准NTP,它实现了1.61–1.71倍的推理性能和1.13–1.19倍的知识与常识性能,同时保留了96.7–96.8%的事实回忆能力。关键在于,这些收益在后训练后仍然持续:Switch Distillation弥合了事实回忆差距,同时分别在推理以及知识与常识方面保持1.25–1.32倍和1.13–1.20倍的增益。
通过模仿学习的灵巧操作策略通常针对场景、物体或指令的变化进行鲁棒性评估,但较少考察其在不同任务执行速度下的表现。这使得我们仍不清楚学习者相对于其模仿的专家保留了多大的时间鲁棒性。我们在相同的任务条件、初始条件采样和加速倍数下对专家和学习者进行了比较。我们将该评估实例化为 ParcelStow——一项接触丰富的任务,机器人需要抓取、重新定向并插入一个包裹。演示涵盖了包裹获取之后各操作阶段的加速范围。一个脚本化专家和基于该专家演示训练的 Action Chunking with Transformers(ACT)策略在标称速度下均达到100%的任务成功率。然而,两者的成功率在演示速度范围内出现分化:在最大演示速度下,专家成功率为84%,ACT成功率为53%。两个采用不同参数初始化的ACT策略表现出相似的性能下降,从标称速度到最大演示速度分别下降34和48个百分点,而专家仅下降16个百分点。阶段级分析表明,ACT在最大演示速度下的47次失败中,有35次是由于插入错位所致。在相对运动交接方式下,每一次由ACT完成的抓取都能在自由空间中的重新定向与传递阶段保持对包裹的把持,但完成整体任务的比例仅为64%,而在专家抓取后这一比例为95%。在所有被评估的策略和速度条件下,414次未形成力闭合的抓取均未完成任务。因此,标称任务成功率相同并不意味着专家性能在不同执行速度下得到保持。代码、数据和评估脚本可在 https://github.com/coenwerem/parcelstow 获取。