每日精选AI研究论文及翻译
技能已成为一种实用且有效的方法,通过在推理阶段提供结构化知识包来增强LLM智能体的能力。然而,现有评估大多仅关注技能是否提升聚合任务成功率,忽略了一个更根本的问题:**技能在何时起作用、为何起作用、又在何处失效?**通过在多种基准测试、智能体框架和LLM上进行受控实验,我们分离了表示方式、结果标注、检索难度和跨框架鲁棒性对技能的影响。为更深入地回答该问题,我们设计了一项对比研究,将受控定量实验与配对轨迹分析相结合。我们对受控实验中的8,135条试验记录进行了规范化处理,并从240条开放式编码记录中保留了238个有效唯一标签。我们将这些观察结果整合为一个包含三个高层类别和十二种技能使用模式的分类体系:当嘈杂轨迹转化为稳定执行的程序性锚点时,技能便发挥作用。在匹配比较中,技能相比工作流记忆提升6.06个百分点。程序性锚定占技能应用案例的65.7%,而显式知识注入仅占4.5%,表明技能的作用在于稳定行为,而非注入缺失的事实。检索是另一个独立瓶颈:随着候选池规模从5增至100,实际使用精确率从29.6%降至3.3%。易混淆的干扰项虽损害离线识别效果,但下游成功率保持稳定;精确的真实标注调用既非充分条件,也非必要条件。技能在假设过于僵化、上下文不兼容或适应不足的情况下会失效。这些发现将评估从聚合成功率推进到更深入的层面,并为可靠的自进化智能体提供指导。
强化学习(RL)在单轮大语言模型微调中已展现出良好前景。然而,长视界智能体推理引入了日益增多的分支交互和稀疏奖励,暴露了RL的若干局限:其基于反向传播的重型训练栈使得微调更大的大语言模型不切实际,且更长视界的轨迹使RL中的信用分配变得更加困难。本文论证进化策略(ES)可以成为微调长视界大语言模型智能体的更优选择。与智能体RL相比,ES具有三个关键优势:1)模型可扩展性:ES仅需极小的推理级GPU显存即可实现全参数优化,使得微调大语言模型成为可能;2)灵活性:其轻量级的黑盒反馈接口使ES微调易于与提示空间进化(如技能优化与测试时计算)组合使用;3)长视界可扩展性:ES执行轨迹级参数归因而无需跨视界分解奖励,随着视界长度增长,其可扩展性优于智能体RL。基于这一见解,我们提出Agentic ESOpt,一个专为灵活的参数-上下文协同进化而设计的全参数智能体微调框架。在每一步中,Agentic ESOpt在当前大语言模型参数周围采样扰动,以奖励评估所得智能体,并应用在线奖励加权更新。为改善探索-适应权衡,Agentic ESOpt进一步引入了扰动尺度σ的余弦衰减调度。在WebArena-Lite上,对Qwen-3.5-27B的全参数优化将无技能基线提升了6.69%。在测试时自动启发式设计中,Agentic ESOpt执行在线提示-参数协同进化,在36个设置中的28个中优于其匹配基线。
前沿开放权重模型日益普及,但其服务部署仍主要假定依托数据中心基础设施。我们提出FreeToken,一个边缘原生的MoE服务系统,它将个人机器视为统一的弹性推理平台,而非仅仅是一块小型GPU。FreeToken围绕本地AI的两个现实协同设计整个服务栈,涵盖模型布局与加载、专家驻留、CPU--GPU执行、智能体状态复用以及运行时内存管理:智能体工作负载会持续改变其执行模式,而边缘硬件暴露出的异构资源在不同机器间存在差异。FreeToken不采用固定的卸载策略,而是持续将计算和模型状态映射到实际可用的资源上。FreeToken支持超过20个MoE模型以及真实的编码和工具使用型智能体,硬件范围从8GB笔记本电脑GPU到单块工作站GPU。更重要的是,它改变了这些机器实际可服务的模型规模:从笔记本电脑上的35B模型,到游戏台式机上的284B模型,再到单块工作站GPU上的753B GLM-5.2。FreeToken将开放权重转化为可部署的本地软件,使用户已有的机器成为前沿规模智能的实用平台。我们在flashml.ai发布该系统。
人工超级智能(ASI)要求人工智能超越对现有知识的掌握,转向探索未知、创造新知识,并将新想法转化为可验证的成果。然而,当今AI系统的能力在很大程度上仍基于对现有人类知识的学习、压缩和应用。相应地,现有基准测试主要检验AI能否基于所学知识给出正确答案,或者能否在大量人工指导下完成任务。为此,我们提出ASI-Bench,这是首个在通用研究领域内联合评估AI系统创新探索能力和自主科学执行能力的基准测试,也是首个在同一研究项目内逐步撤除人类方法论指导、以检验AI能够独立推进到何种程度的基准测试。ASI-Bench由40余位专家历时31,000多小时构建而成,包含覆盖11个科学领域的60个项目级研究任务,并逐步减少方法论指导,以测试AI能否独立选择方法、开展研究并产出可验证的结果。所有任务均经过专家评审、AI辅助审计、沙盒执行和评分者验证。在18种最先进的智能体—模型配置中,平均得分从完整方法论指导下的50.91分降至仅指定方法时的29.10分,再降至智能体必须自行确定方法时的26.62分。这一急剧下降表明,现有系统仍严重依赖人类指导,距离自主开展端到端的项目级科学研究尚有巨大差距。ASI-Bench向全球开放。我们诚邀各地的研究者和开发者贡献新任务、挑战当今AI的极限,共同加速人类集体迈向人工超级智能的进程,访问https://asibench.apexin.ai/submit即可参与。
尽管大型视觉语言模型(VLMs)显著推进了具身导航的发展,但其直接部署仍具挑战性,因为现有方法常常迫使VLMs进入与其二维预训练先验不一致的非自然动作空间,加之僵化的推理调度和低效的记忆管理。为克服这些局限,我们提出了TAMP-Nav,一个用于高效具身导航的统一框架。首先,我们引入了一种像素到三维动作公式化方法(Point),将导航重新表述为二维视觉提示。具体而言,VLM仅需选择二维像素,随后这些像素被投影到三维坐标中,供底层SLAM控制器使用。这种设计自然地使具身执行与VLM固有的二维视觉能力对齐。其次,我们提出了一种集成的选择性推理与锚定轨迹记忆机制(Think and Memorize),该机制动态触发思维链,并仅在关键节点保留高保真记忆,将冗余轨迹压缩为轻量级时空指示符,从而保留关键历史信息并增强时空感知。最后,我们通过群体相对策略优化(GRPO)设计了一种高效的两级对齐范式(Align)。通过将全局结果奖励与细粒度过程奖励叠加,这种密集监督使智能体的认知规划与物理环境反馈紧密对齐,赋予模型自适应推理能力。实验表明,TAMP-Nav达到了最先进的性能(例如在R2R-CE上取得66.2%的SR),并具有较高的运行效率和样本效率(仅需9万条训练轨迹)。
创意代理仍然缺乏从高质量人类电影中学习的有效方式,这限制了它们制作电影级视频的能力。一个关键挑战是缺乏结构化的视频表示,这种表示既要忠实于电影内容,又要可直接用于代理推理和操作。为应对这一挑战,我们提出了代理式视频自编码器(AVA-Encoder),一种通过代理式自编码学习代理原生视频表示的框架。 AVA-Encoder将视频转换为知识图谱(KG)表示,然后将其重建回视频。其层级结构节点和状态节点存储结构化文本,而关联的资源层则保存生成的图像、音频和视频。类型化边以代理易于理解、查询和编辑的形式保留这些文本描述与资源之间的关系。视频重建差异驱动一个文本梯度优化框架,该框架将评估反馈表达为自然语言更新方向,用于外循环中的数据无关编码策略伪训练,以及测试时内循环中可选的数据相关知识图谱表示细化。 大量实验表明,AVA-Encoder相较于最强外部基线提升了20.7个百分点。在受控的仅策略设置中,其经过伪训练的镜头级代理式视频编码器策略也优于精心人工调优的策略,同时使用的系统提示词令牌减少了74.3%。我们发布了完整的AVA-Encoder框架、一个可靠的代理式视频重建基准,以及首个高质量电影知识图谱表示数据集。
高分辨率图像编辑在专业工作流中的需求日益增长,然而现有基于扩散的模型由于二次注意力复杂度和高昂的内存需求,仍受限于1K以下的分辨率。一种常见的替代方案采用两阶段流程:先进行低分辨率编辑,再进行独立的超分辨率处理。然而,该方法存在两个关键问题:信息偏离,即幻觉细节与原始高分辨率(HR)源图像相矛盾;以及纹理退化,表现为过度平滑或过度锐化的伪影。我们提出EditBridge,一种用于高效超高分辨率编辑的扩散桥框架。与从噪声重新生成的传统扩散方法不同,我们将精化过程建模为从低分辨率(LR)编辑结果到其高分辨率对应图像的结构化数据到数据转换,并显式以原始HR源图像为条件以保留真实细节。为高效融入HR源图像引导,我们引入了一种先验引导的分块稀疏注意力机制,利用第一阶段编辑中的语义对应关系将跨图像交互约束在空间对齐区域内,从而显著降低计算开销。大量实验表明,EditBridge在高达4K分辨率下实现了高保真编辑和卓越的感知质量,在2K分辨率下实现了3.6–8.4倍加速,并在61秒内实现了实用的4K编辑。
现代智能体运行在管理工具、上下文和控制流的智能体框架(agent harness)内部,这使得框架成为智能体系统的关键组成部分。我们最初的Agent Lightning引入了一种解耦架构,通过大语言模型端点代理将任意智能体与强化学习训练相连接,该方法后来被verl Uni-Agent、AReaL 2.0、slime和Polar等框架所采用。我们将这一范式称为基于框架的智能体强化学习(harnessed agentic RL),其中部署时的框架直接参与模型的后训练过程。基于框架的智能体强化学习与传统智能体强化学习存在根本性差异:由框架而非训练引擎持有环境交互循环,而训练器仅观察大语言模型请求-响应对的序列。这引入了重新分词、样本合并、优势计算、损失归一化和后端调度等方面的挑战,这些挑战可能对训练稳定性和有效性产生重大影响。我们提出Agent Lightning v1.0,一个以约3,500行代码实现的轻量级基于框架的智能体强化学习框架。它支持任意智能体框架,并可作为研究上述挑战的实用测试平台。我们在指令遵循、搜索和编码智能体上对其进行了评估,并提供了完整的、可复现的编码智能体强化学习流水线。仅使用6K训练样本和适度的计算资源,强化学习将Qwen3.5-9B在SWE-bench Verified上的性能从41.8%提升至56.4%,实现了14.6个百分点的绝对提升。我们发布了完整的工作流程和训练脚本,以促进基于框架的智能体强化学习的可复现研究。
潜在视频生成依赖于自编码器来定义一个紧凑的空间,生成模型在其中运行。尽管视频自编码器架构已有显著发展,但其潜在空间仍主要针对像素级重建进行优化,所能提供的高层语义组织有限。然而,重建最优的潜在空间未必适合生成建模。我们提出V-RAE,一种视频表征自编码器,在冻结的视觉基础模型表征之上构建紧凑的生成潜在表示。一个轻量级时间池化模块在保留语义结构的同时去除时间冗余,视频解码器则从压缩特征中重建连续运动。我们使用四种代表性的冻结编码器评估V-RAE的视频重建、语义探测和类别条件生成性能。V-RAE在K600上取得2.13的rFVD,优于所有被评估的大规模预训练视频VAE。其潜在表示比传统视频分词器的潜在表示保留了明显更多的语义信息。在匹配的生成设置下,我们的最佳变体在UCF101和K600上分别取得117.86和19.16的gFVD分数,同时收敛速度最高提升6倍。我们进一步表明,仅靠重建质量不足以刻画生成效用,并引入tFVD,一种与下游生成质量相关性更可靠的时间一致性诊断指标。在视频生成之外,在匹配的预测设置下,与Wan 2.2 VAE潜在空间相比,V-RAE还提升了Cityscapes上的未来视频预测性能。综合来看,这些实验表明,冻结的语义表征能够支持视频重建、生成和预测建模。项目页面:https://v-rae.github.io/。
随着文本到图像生成模型的进步,它们引发了严重的安全问题,尤其是生成暴力、裸露等不宜工作场所(NSFW)内容,而红队对抗性攻击进一步加剧了这一隐患。现有防御手段主要在白盒假设下运行,依赖文本编码器优化、权重编辑或推理时干预,从根本上无法扩展到专有模型。基于大语言模型提示词重写的黑盒替代方案具有更广泛的适用性,但在我们识别为良性对抗问题的关键场景中失效:即提示词在语言层面是安全的,但由于模型习得的数据分布仍会触发有害生成。我们提出DiSCO,一种零样本、严格黑盒的防御方法,完全在提示词层面作为即插即用模块运行,无需模型重训练、微调或访问模型内部信息。DiSCO通过束搜索执行分布引导的后缀扩展,并利用目标模型自身生成的安全与不安全图像池进行对比评分来优化,通过迭代自适应反馈直至生成安全内容。我们证明,在I2P基准上面对多种红队攻击时,DiSCO能够持续提升未防御和已防御模型的安全性,分别实现37.7%和25.13%的攻击成功率(ASR)降低,同时保持语义保真度并改善图像连贯性。作为黑盒、架构无关的模块,DiSCO可便捷地应用于任何文本到图像系统,无需对模型本身做任何改动。
字节级分层语言模型(LMs)近年来已成为使用子词分词的主流模型的一种稳健替代方案。然而,逐字节生成仍是推理速度的瓶颈。为解决这一问题,我们引入了多字节预测(MBP),它能够并行生成多个字节,在几乎不影响性能且不增加额外参数的情况下加速推理。MBP建立在流行的多词元预测(MTP)范式之上,并包含两项关键创新。首先,我们引入了一个可变长度预测窗口,使其与分层LM的潜在词元(即分段)对齐。其次,我们实现了一种新颖的注意力掩码方案,使得在不违反因果性的前提下实现并行字节预测成为可能。我们证明,多字节预测在多项生成任务中实现了帕累托最优的权衡,包括指令跟随、问答、摘要生成和机器翻译,在性能与推理吞吐量之间取得了最佳平衡。
基于指令的视频编辑数据集的质量和多样性正在稳步提升,然而现有数据集主要聚焦于单一编辑操作,难以支持组合式指令引导的视频编辑。具体而言,多种编辑意图需要在同一视频中被联合理解并忠实执行。为解决这一问题,我们提出了CoinVE-200K,一个面向组合式指令引导视频编辑的大规模高质量数据集。CoinVE-200K包含多达201帧的1080p视频编辑对,涵盖了多样化的组合场景,其中每个样本包含2至5个原子编辑操作。指令针对人物、物体和背景,覆盖添加、删除、修改和风格化等编辑类型。所有样本均通过精心设计的生成与过滤流程构建,以确保指令忠实度、视觉质量、时间一致性和组合多样性。我们还提出了CoinVE-Bench,一个面向跨不同主体、操作类型和指令复杂度的组合式指令视频编辑基准。此外,我们提出了CoinVE-Edit,一个基于Wan2.1-T2V-14B和Qwen3-VL-8B-Instruct构建的220亿参数组合式视频编辑模型。CoinVE-Edit对不同编辑指令解耦了区域感知注意力,从而在保留无关内容和时间连贯性的同时,实现精确的多区域编辑。在CoinVE-Bench上的实验表明,CoinVE-Edit在指令遵循、组合编辑准确性、视觉质量和时间一致性方面均取得了优异表现。
视觉编码器是视觉-语言模型的关键组成部分,扩展其容量能有效提升性能。然而,密集扩展会增加计算成本和推理延迟。混合专家(Mixture-of-Experts, MoE)架构提供了一种颇具吸引力的替代方案,已在大型语言模型中实现了高效扩展,但在最先进(State-of-the-Art, SOTA)水平下,针对CLIP风格视觉编码器的MoE设计空间仍未得到充分探索。在本工作中,我们系统地研究了用于视觉编码器扩展的MoE设计,发现细粒度MoE拓扑相比密集对应模型和标准MoE模型都能带来显著提升。我们进一步提出一种无辅助损失的均衡变体,以改善专家利用率,并设计了一个专门的MoE内核以减轻推理延迟开销。为在保留图像知识的同时增强视频能力,我们引入了帧级蒸馏,并结合一种新颖的冻结机制。我们预训练了一系列不同规模的混合专家视觉编码器(Mixture-of-Experts Vision Encoders, MoE-ViE),所有模型均一致优于其密集对应版本。我们最大的模型在零样本性能上匹配了规模为其1.7倍的最先进编码器,同时延迟仅为后者的76%。当与大型语言模型对齐时,MoE-ViE在图像和视频基准测试上超越了所有对比编码器,包括那些激活参数多至5倍的编码器。代码可在 https://github.com/facebookresearch/moe_vie 获取。
记忆正成为长周期大语言模型智能体的核心基础设施,然而现有评估对于在不同运行机制下应使用何种记忆基底——即记忆表征与存储所依托的底层介质——所提供的指导十分有限。我们针对记忆增强型智能体的记忆基底提出了一种受控的基准测试评估框架,涵盖密集与稀疏索引、文本记录、结构化存储、层次化存储、基于精炼的记忆、参数更新以及激活兼容的上下文机制。在三个基础模型和四个基准测试套件(涵盖以用户为中心的问题回答和以智能体为中心的决策制定)中,我们在统一框架下测度了26项性能与效率指标。结果表明,没有任何单一基底能够持续占据主导地位:广泛的检索有利于长上下文事实型问答,而过度的检索可能将注意力从决策关键上下文上转移,从而损害序贯决策。可扩展性进一步引入了一条路由轴,因为在中等历史长度下表现良好的基底在更长周期下可能变得代价高昂或脆弱不堪。这些发现表明,基底路由是自适应智能体记忆系统中不可或缺的组成部分,并为设计高效、可靠且具备机制感知能力的大语言模型智能体长期记忆提供了实证指导。代码将在论文被接收后公开。
大规模图像生成得益于数据规模、质量、再平衡和重新描述方面的进步,然而传统流程通常孤立地优化特定任务的数据集。核心挑战不仅在于如何整理每个任务专属的语料库,还在于如何根据生成能力之间的依赖关系来组织异构监督。我们提出了一种能力驱动的数据基础设施,将能力专属的监督构建与能力对齐的课程调度相结合。其三个专用但互操作的数据引擎为文本-图像基础、图像间变换和图像-知识关联构建互补的关系监督,而描述专家则跨任务和粒度对齐T2I与编辑监督。多阶段课程沿着能力习得的依赖顺序,联合演化任务组成、视觉概念分布、数据质量和图像分辨率;能力感知的评估则通过定向检索、专家构建和差距感知重采样来形成闭环。在大规模场景下,该框架构建了包含4.4亿图像的T2I语料库、1.2亿编辑对和超过2700万图像-实体对。我们利用这一基础设施,从零训练了两个规模的多模态扩散模型,参数量分别为3B和6B。我们在CPI-Bench上进行了定量评估,并在多种文本到图像和编辑场景中进行了定性评估。实验结果表明,该方法具有广泛的视觉覆盖、多样化的渲染能力,并能在生成能力之间有效迁移。
近年来,大语言模型(LLMs)与智能体(agents)的快速发展显著提升了AI系统执行复杂任务的能力。然而,现有基准测试大多依赖研究者自行选取的任务,这使得我们难以确定这种进步是否真正延伸至现实用户实际期望AI系统完成的工作。为此,我们提出了StartupBench——一个基于市场验证的AI初创公司产品的端到端(E2E)智能体基准测试。与从预设的智能体功能假设出发定义任务不同,我们系统性地研究那些已被证实获得用户采用(demonstrated adoption)的AI产品及其产品工作流和用户群体,从而在多个专业领域中识别出AI已具备实际需求(practical demand)的现实任务。我们将这些工作流转化为以完整交付物为导向的任务,并通过捕捉其复杂需求的细粒度评分标准(fine-grained rubrics)进行评估。在统一智能体测试框架(unified agent harness)下对代表性模型进行评估后发现,即便最强的模型也只能成功完成StartupBench中约30%的任务,尽管在许多任务上已取得实质性部分进展。进一步的分析表明,复杂指令遵循(complex instruction following)与领域专业知识(domain-specific expertise)是主要的失败来源。我们的研究结果表明,许多经市场验证的工作流仍然超出了当前通用智能体的可靠能力范围,这使StartupBench成为衡量面向现实用户任务端到端完成进展的实证基准。
像素空间生成模型绕过了有损潜在压缩,但需要在高维空间中联合学习全局结构与细粒度细节。标准流匹配将噪声向固定的干净图像端点插值,使谱演化只能隐式学习。本文引入能量引导流匹配(Energy-Guided Flow Matching,EG-FM),通过移动端点显式建模由粗到细的生成轨迹。具体而言,EG-FM 用热核滤波端点替代固定端点,该端点从低频图像平滑演化至干净图像。移动端点中高频信号的比例由图像特定的能量引导调度释放,从而重新定向流匹配中的速度。我们的框架无需修改主干网络和训练数据,在训练和推理阶段仅引入可忽略的额外成本。实验中,EG-FM 在 ImageNet 类别条件图像生成任务 256×256 分辨率设置下以更少的训练轮次一致取得更低的 FID,在 200 轮时达到 FID 1.55,600 轮时达到 1.45。我们继续在 512×512 分辨率设置下训练生成任务,仅经过 40 轮高分辨率适配训练即取得 FID 1.58。此外,我们将 EG-FM 迁移至文本到图像生成任务,在 GenEval 上取得 0.85 分,在 DPG-Bench 上取得 83.9 分。代码见 https://github.com/ysng123/EG-FM。
计算最优缩放定律指导着前沿语言模型的训练,但在视觉生成领域仍鲜有探索。我们利用Abra开展了一项系统的缩放定律研究——这是一个受控的流匹配变换器系列,训练计算量跨越三个数量级(10^19至10^22 FLOPs),远超以往工作所达到的计算预算。我们证明,扩散模型的缩放规律与语言模型同样可预测,但实现最优训练所需的数据量要大得多:计算最优性出现在每参数约200个图像token处,是LLM的Chinchilla计算最优配方的十倍。我们还表明,与语言模型不同,扩散模型对过度训练具有鲁棒性,实践者应优先考虑更多数据而非更大模型。最后,我们展示了这种可预测性不仅体现在训练损失上,还延伸至生成质量指标、最优CFG设置、表示质量,甚至训练曲线的形状——这些曲线会坍缩为一种通用形式。
大语言模型日益通过智能体框架进行部署,这些框架管理工具、扩展、持久状态、权限和外部操作。现有安全基准主要针对单个攻击机制或有限的操作设置子集,这使得难以比较不同框架职责下安全故障的出现方式。我们提出HarnessRisk,一个面向生命周期的基准,将智能体框架安全划分为六个运行阶段,包括框架配置、能力扩展、运行时操作、状态持久化、动作控制和事件恢复。HarnessRisk包含128个沙箱化案例,每个案例将一个良性用户目标与嵌入在不可信工作流工件中的对抗性指令配对。我们使用效用、攻击成功率、持久性和检测四个指标评估每条轨迹。在三个框架、六个语言模型以及14组模型和框架配置中,攻击成功率介于12.6%至80.9%之间,而效用保持在75.0%至97.6%之间。框架配置是所有三个框架中最脆弱的阶段,表明攻击可以通过在原本授权的工作流中修改安全敏感参数而成功。我们还发现,显式的风险识别并不能可靠地导向安全行动,因为某些配置在超过90%的运行中检测到风险,却仍保持显著的攻击成功率。这些结果强调需要在多个框架职责层面,以及在部署的模型和框架配置层面评估智能体安全性。
可靠的不确定性量化(UQ)对于在复杂交互环境中部署大语言模型(LLM)智能体至关重要。现有的不确定性量化方法主要依赖局部信号,如词元概率、预测熵或单步置信度,因而忽视了执行轨迹中错误累积所依赖的长程依赖关系。因此,这些方法可能无法识别那些根因出现在最终答案之前数个推理或交互步骤的智能体失败。我们提出RUPA(面向智能体的关系不确定性传播),一个面向LLM智能体的轨迹级不确定性量化框架。RUPA将执行历史表示为一个有向轨迹图,其中推理状态、工具交互和环境反馈作为节点,通过时间依赖边和语义依赖边相连。随后,RUPA在该图上传播不确定性,以刻画执行风险如何在交互步骤之间累积和转移。传播后的信号与轨迹级行为特征及目标对齐信息相结合,为完整的智能体轨迹生成置信度估计。我们在代表性智能体基准测试上评估RUPA,包括τ-2、Terminal-Bench-2和GAIA,使用了涵盖多个模型家族的6个开源大语言模型。实验结果表明,RUPA在提供更准确的不确定性估计、实现更早的失败检测以及改善不确定性引导的智能体执行方面,持续优于现有的不确定性量化方法。这些结果证明,显式建模关系依赖对于长时程LLM智能体的可靠不确定性量化至关重要,为可信赖的智能体执行提供了实用基础。
自动形式化通常被定义为将自然语言数学陈述翻译成机器可验证的形式语言(如 Lean 4)的过程。然而,忠实的形式化不仅仅是翻译。模型必须将数学概念映射到形式库(如 Mathlib)中复杂的类型和定义层级结构,同时确保生成的陈述保留源命题的含义。现有方法面临挑战,因为它们严重依赖模型的参数化记忆来获取库特定知识,而常见的数据构建流程往往采用过滤单次输出的方式,缺乏反馈驱动的修订机制。为了解决这些挑战,我们提出了 MathForm,一个通过 Mathlib 知识检索和验证引导的迭代细化来构建经过验证的训练数据的自动形式化框架。在生成之前,检索规划器从 Mathlib 中收集相关定义和现有形式化内容,以指导形式化生成器。随后,生成的陈述会利用编译器诊断和语义一致性反馈进行修订。利用该框架,我们构建了 FormalVerse,这是一个 Lean 4 数据集,包含约 36.7 万个经过验证的示例,覆盖多个数学领域和来源。随后,我们通过监督微调和强化学习训练了 MathForm-8B。在六个基准测试中,MathForm-8B 在语法检查(SC)下的平均 Pass@8 通过率达到 88.06%,在一致性检查(CC)下达到 72.37%,优于多个专门的 32B 自动形式化模型。在具有挑战性的 FATE-H 和 FATE-X 子集上,其 CC 通过率分别达到 63% 和 37%,在这两项上都超过了最强的专门基线。
我们使用AI-Infra-Guard(A.I.G)评估DeepSeek Harness(DSH)中的间接提示注入:构建测试、传递受控污点、执行DSH、收集轨迹并判定结果。该研究涵盖14,560次受控执行,涉及16个间接内容通道、文本和文件载体模式、35个有效载荷目标、一个未修改的基线以及12种攻击方法。实验保留了DSH的智能体循环、工具注册表、模型适配器和会话事件路径;源工具和敏感汇聚点为本地夹具,因此尝试的操作被记录下来而不会产生外部副作用。我们使用一个确定性的基于规则的判断器(RuleJudge)和一个基于语义的LLM判断器(LLMJudge)对每条轨迹进行评估。观察到的最高攻击成功率分别为:文本模式下伪造完成攻击在RuleJudge下为17.0%,文件模式下隐藏Unicode在LLMJudge下为25.5%,文件模式下技能通道在RuleJudge下为16.0%。LLMJudge分配部分合规的频率也高于RuleJudge(7.3%对比2.0%)。我们将这些结果与DSH对工具结果、附加上下文和工具调用策略钩子的处理相关联,然后指出应位于不可信内容与敏感操作之间的控制措施。我们的代码可在 https://github.com/Tencent/AI-Infra-Guard/tree/main/Research/deepseek-harness-security-assessment 获取。
改进大语言模型中知识使用的方法通常分为两类。非参数检索能够灵活访问外部知识,但会引入检索延迟、上下文开销,并且与主干模型的集成仅停留在浅层。参数化适配在推理时高效,但将知识与模型权重耦合在一起,难以更新、审计或迁移。Engram式哈希记忆则介于两者之间:它将学习到的信息存储在外部的可寻址表中,但通过一个小型的学习型读取器来消费该表。这引出了一个基本问题:当这样的记忆跨主干模型迁移时,冻结的记忆本身与目标侧的读取器,哪一个更重要?我们通过跨模型冻结记忆提取来研究这一问题,即将在源模型上训练好的记忆冻结,并附着到不同的目标模型上,仅训练一个轻量级读取器。消融实验表明,学习到的记忆内容和正确的寻址都很重要,但迁移过来的表只有在读取器与目标模型对齐时才能发挥作用。在下游问答任务中,一个双层、四分支读取器几乎弥合了同模型复用与跨模型复用之间的差距,在我们受控的评估协议下达到了38.8的平均得分。此外,当提供方读取器与目标接口直接兼容时,冻结产物无需目标侧训练即可提供可观效用,而可选的读取器适配则能带来进一步提升。这些结果表明,只要目标方能够访问兼容的读取器接口,Engram即可作为可重用的外部知识产物;当直接复用读取器不足时,目标侧适配可进一步改善对齐效果。
能够生成假设、检索相关工作、设计实验、执行代码并撰写完整论文的AI共同科学家,正开始改变研究的开展方式。尽管进展迅速,最先进的系统仍然与研究者无关:给定一个研究目标,它们优化新颖性、有效性或评审分数,却忽略了将使用输出的具体科学家。这忽视了研究的一个基本事实,即什么算作新颖、有价值或可行,取决于研究者本人,包括其先前工作、方法论储备,以及其所处的合作者与学术共同体。在这项工作中,我们提出了个性化自动研究的问题,该问题要求研究过程的每个阶段都基于对个体研究者的表征来进行条件化。我们认为,个性化不是一个便利性附加层,而是使AI系统能够充当真正的共同科学家而非通用工具的根本属性。为解决这一问题,我们提出一个通用且灵活的框架,将基于图的研究者上下文贯穿于检索、假设搜索、实验、写作和评审之中。该框架包含三个基本组成部分:(i) 基于图的研究者表征;(ii) 整个研究流程中的个性化;(iii) 基于个体研究者本身的评估。值得注意的是,我们强调了一种一刀切的失败模式:不同的研究者提出相同目标时,会收到本质上相同的研究,从而抹除了新想法得以产生的隐性知识。最后,我们讨论了基本的开放问题与挑战。
许多可扩展的潜在3D生成器基于结构化张量进行操作,而预优化的3D高斯溅射(3DGS)重建则是无序、空间不规则且基元数量差异很大的。我们提出了GS-Voxel,一种免拟合的结构化潜在框架,并针对大规模航空3D高斯场景生成进行了评估。GS-Voxel将兼容的预优化3DGS重建确定性转换为稀疏活动体素,无需额外的逐场景优化,同时保留所选基元的亚体素位置和渲染属性。随后,一个针对GS的分解VAE将体素几何和局部高斯属性分别编码为稀疏3D潜在表示,其大小随占据体素数量增长,而非受限于固定的场景级基元数量。我们在GS-Voxel潜在空间中训练图像条件流模型,以生成航空3DGS场景。GS-Voxel实现的一个关键应用是大面积场景生成:重叠感知的分块推理将基于卫星视角图像的合成扩展到单个训练裁剪之外。我们的结果表明,GS-Voxel为预优化的航空3DGS重建提供了结构化潜在表示,其潜在容量随占据体素数量增长。
面向代码智能体的强化学习日益依赖长时间运行的智能体框架,以管理工具集成、代码仓库上下文和执行反馈。然而,这些框架的原生执行环境与策略梯度训练天然存在不一致性:环境崩溃和奖励黑客行为会破坏结果信号,而训练-推理差异则使轨迹生成行为与策略更新解耦。为解决这一问题,我们提出了 LEGO-RL,一个将原生代码智能体框架与可扩展的策略梯度优化相连接且无需修改其内部控制流的框架。LEGO-RL 建立在三大支柱之上:(1)保真优化,通过进程内 LLM 代理捕获原始生成流,实现词元级对齐和稳健的训练端对数概率重算,即使在框架端进行压缩或重新序列化的情况下依然如此;(2)可靠执行,通过可扩展的沙箱编排,结合镜像缓存与分阶段防御,以缓解奖励黑客行为;(3)可观测训练,借助集成插件自动完成验证与监控,并配合 Live UI 提供细粒度轨迹诊断。我们使用 GSPO 在三个原生代码智能体框架上训练稀疏 MoE 模型 Qwen3.5-35B-A3B,以此评估 LEGO-RL。在 SWE-bench Verified 上,LEGO-RL 将 Qwen3.5-35B-A3B 在 OpenHands SDK(64.0% 提升至 70.4%)、Claude Code(62.4% 提升至 68.2%)和 OpenCode(57.2% 提升至 66.6%)上的表现均予以提升,同时保持轨迹生成-训练概率相关性高于 0.99。
图神经网络通常通过面向特定家族的方程来描述,这些方程的符号表示掩盖了共享计算与结构差异。我们引入了一个通用层方程,通过七个组件来表示所涵盖的架构:更新域、通道集、传播库、逐通道消息映射、通道融合算子、自身/残差映射以及更新映射。该核心分解将信息传递的位置(由传播库编码)与信息传递的内容(由消息映射编码)分离开来。函数值填充将同一方程扩展到局部消息传递、注意力机制、谱滤波、全局通信、关系特定通道、高阶域和几何消息之中。 我们通过规范层的详细化简和跨越七个非互斥架构家族的组件分配,使这种统一性明确且可检验。固定的槽位规则根据计算角色分配操作,并界定了框架的覆盖范围。该分解还产生了组件层面的理论洞见:在端点局部消息和节点局部更新下,算子支撑集限定了单层依赖范围;而在所述假设下,单层全局混合需要算子有效行为满行。 由此产生的框架在公共设计空间中组织了200多种架构,支持逐组件比较以及结构一致架构的生成,并将传播选择与过平滑、过挤压、异质性及表达能力联系起来。它还揭示了这样一个实证逆问题:如何将可测量的图与任务属性映射到经过验证的组件选择上。
人工智能系统正日益有能力为数学研究作出贡献。在研究实践中,前沿模型的推理能力是一种有限资源,而专家数学审阅更是极为稀缺。因此,如何合理分配这些稀缺资源,是提升人工智能辅助数学发现效率的核心问题。在目前大多数人工智能数学工作流中,人力投入集中于起始和收尾两个阶段,即选题阶段与对最终产出成果的审阅阶段。这两个环节正成为研究级数学的瓶颈。我们针对这一问题提出了一种新的人机协同发现范式。人类输入不再是一个预先选定的单一问题,而是一个专家具备研究兴趣和专业知识的科研方向。系统随后在该方向上对广泛的文献语料库进行搜索,以发现候选问题。受搜索与推荐系统的启发,我们构建了“发现—尝试—推荐”(Find, Attempt, and Recommend, FAR)这一从文献到审阅的级联流程,它能够自动化地搜索合适的问题,并将人类注意力聚焦于已通过多个筛选阶段的成果上。在一项组合学试点研究中,该流程从5,245篇组合学论文出发,提取出6,453个候选猜想或开放问题,并经筛选得到4,717个看似适定且仍然开放的猜想。随后的推理与自动化分诊阶段筛选出598个潜在解答,并从中选出77项供作者团队审阅。在这些成果中,我们发现了许多有趣的结论,包括对Davies--Jenssen--Perkins--Roberts、Erdős--Straus、Ikenmeyer--Pak--Panova以及Lund--Saraf--Wolf等人猜想与问题的研究成果。这些结果表明,这种人机协作新模式对于数学发现是有效的。
程序化表示为三维内容创作提供了一种引人注目的范式,能够实现细粒度编辑、可解释性和显式结构控制。然而,依赖大语言模型(LLM)创作三维程序的智能体工作流仍然脆弱,往往无法将高层意图转化为一致的底层几何结构。我们将这种脆弱性归因于现有程序化接口与LLM推理优势之间的不匹配——后者更偏好语义结构和空间关系,而非脆弱的数值选择。在本文中,我们共同设计了一种以智能体为中心的领域特定语言(aDSL)和一个角色专精的多智能体系统,以弥合这一差距。aDSL通过强调可组合性和空间推理来桥接语义逻辑与几何约束,使智能体能够通过关系运算符而非脆弱的绝对坐标来操作几何。基于aDSL,我们的免训练多智能体系统遵循“计划-执行-评审”循环,对请求进行分解、合成代码,并利用执行反馈迭代修复错误和约束违反。实验表明,这种协同设计提升了鲁棒性、可控性以及对用户意图的忠实性。我们的方法在文生形状和图生形状任务上优于此前基于LLM的基线方法,同时保持了显式结构、可编辑性和可解释性。该方法还支持关节物体创建和结构化场景组合等下游应用。我们的代码可在 https://github.com/sig-pku/aDSL 获取。
我们推出PTXBench,这是一个用于评估和适配大语言模型(LLMs)以利用架构特定的PTX指令进行GPU内核优化的基准测试。PTXBench在H100和B200 GPU上,针对GEMM和注意力负载,衡量功能正确性、所选目标指令是否在运行时实际执行,以及相较于前沿库的加速比。我们的评估表明,架构特定的PTX能力仍不均衡:在复杂的注意力反向负载上,成功率显著下降,且执行目标指令并不一定能转化为具有竞争力的性能。所有被评估的模型均未能在整个测试套件中持续匹敌前沿库。我们进一步使用监督微调适配Qwen3.6-27B。修复条件训练改善了若干任务,但泛化能力仍不均衡;除了数据集规模外,数据覆盖度、平衡性以及推理教师的质量同样重要。PTXBench为衡量和提升LLMs利用不断演进的GPU架构的能力,提供了一个可审计的测试平台。
心电图(ECG)、光电容积脉搏波描记(PPG)和心音描记(PCG)为同一心动周期提供了互补的视角,然而现有心脏基础模型均针对单一传感模态训练,未能利用不同传感器之间共享的生理信息。我们提出CardioState-JEPA,一种心脏基础模型,基于生理感知的联合嵌入预测架构,在ECG、PPG和PCG三种信号上联合学习单一共享表示。该模型将异构波形映射到公共词元空间,使用单一共享Transformer编码器进行处理,并通过预测掩码的心脏潜状态进行学习,将预训练目标置于共享生理信息而非传感器特定的波形外观之上。为处理电学、力学和血流动力学事件之间的时间偏移,跨模态预测采用学习得到的延迟对齐器,在相应的心脏时相上对齐信号。由于同步多传感器记录数据稀缺,CardioState-JEPA首先从丰富的单模态数据中学习模态内结构,然后利用配对数据在潜在心脏时相上对齐各模态。作为冻结编码器,我们在涵盖ECG、PPG和PCG的25项下游任务上进行了评估,与最优自监督信号基线相比,我们的编码器在PPG分类平均AUROC上提升8.2个百分点,在PCG心脏杂音检测上提升18.8个百分点,在ECG分类上提升15.5个百分点,并在若干ECG基准任务上达到或超越了使用特权临床文本或监督标签训练的心脏模型。这些结果证明,异质心脏信号可以相互监督训练出一个统一的心脏生理基础模型。
统一图像恢复(UIR)旨在利用单一模型从遭受不同退化的低质量(LQ)图像中恢复出高质量(HQ)内容。近年来,大多数方法采用大规模预训练的文本到图像(T2I)潜在扩散模型,利用其强大的能力和生成先验。然而,潜在T2I模型中的变分自编码器(VAE)可能会丢弃对恢复敏感的细节,而开放式合成先验可能引入与内容不一致的伪影。我们提出PixRestore,一种用于UIR的无VAE像素空间扩散Transformer(DiT),其扩散主干完全从零开始训练,不依赖T2I预训练。PixRestore直接在分块像素上执行流匹配,在保持令牌序列可控的同时保留细粒度细节。为适应不同的退化类型,PixRestore利用LQ-HQ DINO特征相似度来预测层特征的可靠性。来自更可靠层的特征被融合为密集条件注入,而可靠性较低的层则接受更强的HQ特征监督以促进退化消除。我们在包含多样化场景和退化类型的大规模语料库上训练PixRestore,并进一步使用基于DINO的对抗目标将其微调为单步生成器以实现高效推理。在公开基准和真实世界测试集上的实验表明,PixRestore仅需约5000万参数和单步推理,即可在各类UIR模型中实现最佳的整体保真度、感知质量和退化鲁棒性,同时效率远超其他方法。更大规模的PixRestore变体可进一步提升性能,证明了我们像素空间设计的可扩展性。代码和整理的基准测试集可在https://github.com/csslc/PixRestore获取。