每日精选AI研究论文及翻译
循环工程(Loop Engineering)正逐步成为围绕编码智能体组织开发工作的一种实践。与逐条手工编写提示词不同,实践者设计能够监控进度、分配任务、运行检查并决定智能体下一步动作的循环。即使拥有能力强大的编码智能体,循环仍可能信任过时的进度记录、跳过必要的验证、将预算消耗在错误方向上,或在任务尚不宜提交时提前终止。然而,单次端到端运行的最终结果无法区分成败究竟源自循环的引导,还是编码智能体执行任务的能力。我们提出 LoopArena,一个用于评估模型在长期任务中引导独立编码智能体的能力的基准。受评估的模型称为控制器(Controller):在每轮编码之后,它接收运行的结构化摘要,并指示一个独立的、固定的编码智能体——工作器(Worker)——下一步应执行或验证什么,或者决定是否终止。LoopArena 在三种在执行范围与成本上各有差异的互补设定下评估这一能力。第一类(Type I)通过经执行验证的问题对下一步循环合约(Loop Contract)的选择进行评分,评估时无需运行工作器。第二类(Type II)对完整任务的一个选定切片执行重复控制,而第三类(Type III)则从任务的原始状态出发评估配对的完整任务。在完整任务上,观测到的最高严格成功率为 24.69%,表明长时程循环控制仍有很大的改进空间。在所有控制器中,估计推理成本的成对降低平均为 64.4%,且第二类在核心(Core)主要指标下产生了相似的排序(斯皮尔曼相关系数 \(ρ=0.9747\))。我们在 https://github.com/AMAP-ML/LoopArena 发布了基准数据与评估代码。
为大型语言模型(LLM)配备多轮工具调用能力是构建自主智能体的关键。然而,由于依赖完整轨迹模仿,进展从根本上受到限制。对于包含多个顺序无关子目标的任务,最优解空间会形成庞大的组合菱形格。若强行将这种丰富的拓扑结构压缩为单条整体轨迹,将导致严重的拓扑坍缩,不加区分地惩罚有效的替代探索,并严重降低策略多样性。为解决该问题,我们提出DART-SD(面向自蒸馏的菱形拓扑感知检索与微调),该新框架将范式从全局强制转变为拓扑引导的局部修正。DART-SD首先将执行过程建模为收敛的交互状态转移图(ISTG),忠实刻画成功与失败探索路径中固有的菱形拓扑。在自主推演(rollout)中,框架识别关键拓扑断点(CTB),并检索具有成功支持的恢复参考。最后,我们通过CTB引导的局部监督引入渐进式自蒸馏范式,确保训练损失仅在生成的恢复步骤上计算,同时严格保护有效推理前缀免受破坏性梯度更新的影响。在复杂多轮工具调用基准上的实验表明,DART-SD显著优于传统的完整轨迹基线方法。
扩展机器人数据对于构建通用视觉-语言-动作(VLA)模型至关重要,但机器人轨迹比网络规模的图像-文本数据更难扩展,因为具身数据采集成本高昂且对物理世界的覆盖稀疏。这使得表征质量成为核心瓶颈:在固定的机器人数据预算下,持续预训练必须将有限的轨迹转化为可迁移的视觉-动作知识,而不仅仅是拟合动作序列。 我们提出了VLAct,一个面向VLA的视觉语言模型骨干网络,在广泛、异质、多具身的机器人数据上进行训练,然后进行任务特化微调。VLAct通过VLM先验保持、多头连续动作协同监督和部分统一的跨具身动作布局,保留了广泛的VLM先验并鼓励跨具身的共享动作语义,同时允许在微调阶段使用任务特定的动作头。在仿真、真实世界和未见具身迁移场景中,VLAct在固定微调协议下持续提升下游性能。在LIBERO-Plus和RoboTwin 2.0上,VLAct超越了包括ABot-M0和LingBot-VLA在内的工业级VLA系统,分别达到82.6%和92.5%的成功率。在RoboDojo上,VLAct的成功率在所有策略中排名第六,并在两项指标上均优于所有明确指定的世界动作模型(WAM)参赛方案。 最值得注意的是,在未见人形具身RoboCasa-GR1上,仅使用20%下游轨迹的VLAct超越了使用全量数据的GR00T-N1.6基线。这些结果完全基于开源数据,且仅使用16块GPU的训练配置,表明以表征为中心的持续预训练能够在适度的计算预算下取得极具竞争力的性能,是VLA进展中超越数据扩展的重要独立维度。
生成模型可以将自然语言提示转化为图像、文本、代码及其他内容,从而降低草稿与组件的生成成本。其实际影响力日益取决于这些产物能否成为完整、可靠的交付物。本综述审视了智能体工件创建(agentic artifact creation),我们将其定义为一种有状态构建过程:由AI系统实质性构建或修订交付物,且中间观察结果会重定向后续工作。在功能层面,该过程将工件的操作表示、构建策略与运行时验证相连接,后者的反馈可重定向后续操作。我们综述了截至2026年8月20日可获取的259篇文献:其中230个系统符合这一定义,另有29个用于智能体工件构建的基准。我们比较了六个工件族,随后将应用场景与评测实践作为独立维度进行分析。跨工件族而言,构建挑战不仅反映模态差异,还取决于决策之间的耦合紧密程度,以及失败是否在仍可修复时便被察觉。分解可以降低局部复杂性,但会增加协调与重组成本。当学习型评判器与生成器共享偏好或盲区时,其所能提供的独立证据可能极为有限。我们提出了若干原则:保持承诺与责任明确、将反馈转化为有针对性的修复、并在变更后重新验证受影响的状态。同时,我们也识别出随着工件、创作者意图与构建系统的演化,维持连贯且可追责控制的机会。精选论文列表见 https://github.com/GeminiLight/awesome-agentic-artifact-creation。
物理理解与推理依赖于对世界形成紧凑且可泛化的表征。尽管现代视觉-语言模型能够识别并解释多样的物理事件,它们往往缺乏对底层机制(如物体状态、物理参数及控制动力学)的显式表征,而这些机制正是可靠推理世界如何演化以及如何响应干预所必需的。在本工作中,我们提出Code-as-World范式,通过可执行的世界表征来表示物理世界。通过将物理组成、动态演化与视觉外观表达为可执行代码,Code-as-World提供了对物理世界的一种紧凑、定量可计算且可控的抽象。为了从多模态观测(如自然语言描述或真实世界视频)中构建此类表征,我们受溯因推理启发,开发了一种智能体发现循环,其中智能体对可执行的世界假设进行提出、执行、渲染、验证及迭代细化。作为具体应用,我们利用经过验证的可执行世界,为视觉-语言模型在定量物理推理任务上提供可扩展的物理监督。实验表明,Code-as-World-VL在QuantiPhy基准上达到了最先进的性能,并超越了领先的专有模型,凸显了可执行世界表征作为物理智能可扩展基础的潜力。
自进化语言模型近来已成为迈向超级智能的一条有前景的路径,其优势在于降低人类监督的成本。尽管在可验证领域已取得可观进展,但在不可验证领域中的自进化研究仍相对不足。我们提出了从零数据协同适应的评判者框架(J-Zero),这是一个统一的挑战者—求解者—评判者协同进化框架,可同时支持两个领域的自我改进。挑战者与求解者通过对抗性交互协同进化:挑战者生成难度递增的任务,而求解者学习为其产出更高质量的答案。与此同时,评判者利用偏好对进行协同适应,这些偏好对的顺序并非来自评判者自身的评分,而是根据各答案的生成方式预先确定,即求解者的答案优于挑战者的答案,其经分解重组后的答案优于其一次性生成的答案。J-Zero在可验证领域平均领先基线4.2分,在不可验证领域领先8.0分,并且可持续改进至少十次迭代,而基线方法在两次迭代后即出现性能退化。
语言模型预训练几乎已成为高昂成本的代名词,使得学术界和开源社区的大部分群体难以企及。尽管目前已有强大的开源成果,包括开放权重模型和开源训练配方,但一种成本高效、硬件可及且开源的预训练配方长期以来一直缺失。即便在小规模下,训练Llama-3.2-3B的成本也超过150万美元,而复现SmolLM3-3B需要超过70万美元。在本报告中,我们提出了一种旨在降低这一门槛的开放预训练配方。利用该配方,我们以FP8精度在消费级RTX 5090 GPU上从头训练了一系列Puro-2B模型,词元规模最高达1.4万亿。该系列中的模型在词元预算和所选配方变体上有所不同。我们最佳模型的计算成本低于6900美元,在我们的评估协议下接近Qwen2.5-1.5B的性能。这种成本效率得益于多种方法的结合,包括硬件选择、低精度训练、超球优化、课程模型平均以及数据配方。除配方本身外,我们还提供了两项额外成果。首先,基于Puro-2B系列,我们推导出Puro成本缩放定律,将训练成本与平均模型性能相关联;拟合结果表明,约4400美元(低于5090美元)即可达到Qwen2-1.5B的性能水平。其次,作为一项端到端案例研究,我们考察了预训练数据课程如何塑造后训练之后的下游性能。此类受控研究之所以成为可能,是因为我们能够访问完整的预训练流水线,而非仅获得模型权重。我们在https://huggingface.co/collections/thu-pacman/puro-2b 以Apache 2.0许可发布了Puro-2B的完整训练配方,包括数据、代码和模型权重。
从极长视频中进行流式3D重建需要在有界内存和计算条件下在线估计相机运动与场景几何。早期流式模型通过有限上下文缓冲区或紧凑的循环状态实现因果、有界成本的推理,但其估计往往随序列增长而退化。近期方法通过将短程上下文与持久化或多层级长程记忆相结合,改善了长程稳定性。我们则采用不同的路线:保持学习到的时间状态严格局部化,并构造预测目标使其独立于序列长度。我们提出ABot-Recon,一种简单的流式模型,仅缓存前11帧的KV特征。它在当前相机坐标系中预测点图,同时输出相邻帧间的相对位姿。这些预测在参考系变化下保持等变性,全局位姿与几何通过顺序组合恢复。为减少累积漂移,轻量级时间细化器利用近期视觉与运动上下文改善相对旋转,组合感知位姿损失则对多步位姿组合进行监督。在具有挑战性的长序列基准上的广泛评估证明了我们局部上下文方法的卓越长程性能。在Oxford Spires数据集上,ABot-Recon实现了4.35米的ATE和0.12°的RPE-R,相较先前最优结果,两项误差均降低约40%。
我们提出 StarHarness,一个在保持模型权重固定的同时演化特定于环境的智能体外壳的框架。演化后的外壳可包含提示与任务设定、工具接口、技能、基于MCP的提供者、子智能体结构以及智能体循环配置。StarHarness 通过根据基线失败行为对任务进行分层来构建紧凑的演化池,将提案者可见的搜索任务与对提案者隐藏的选择任务分离,并保留留出任务以评估泛化能力。在 ITBench SRE、EnterpriseOps-Gym ITSM 和 AutomationBench Finance 上,每个环境接受4至12次变更后,外壳演化将全基准性能相对于默认外壳提升了20至35个百分点。这些收益在未参与演化的任务上依然存在,并且无需重新演化即可跨 GPT 和 Qwen 模型系列迁移。轨迹分析将改进与接口修复、环境约定以及压缩搜索的操作知识联系起来,在多个场景中出现更少的假阳性诊断和更短的轨迹。因此,StarHarness 提供了一种实用的方法,以减少工具丰富的企业任务中持续的模型-环境不匹配。
视觉-语言-动作(VLA)模型能够将多模态上下文转化为机器人动作,但其动作解码器在很大程度上仍通过行为克隆进行训练。这种方式监督了所演示的电机指令,同时使指令下行为所服务的局部目标保持隐式。基于未来的监督通过帧、潜在观测、轨迹或运动表示来丰富动作学习,但这些信号捕捉的是可能发生的特定实现方式,而非未来行为所共享的语义目标。我们提出意图蒸馏(INDI),将行为层面的意图蒸馏到动作解码器中。在训练期间,冻结的教师VLM从当前观测、指令、粗粒度动作摘要及相应的执行视频中解读演示片段。部署的VLA从其标准输入中,在中间解码器层恢复由此产生的多模态意图表示,并利用该表示连同行为如何展开及其所实现目标的表示来组织动作预测。在SimplerEnv-Bridge上,INDI将GR00T-N1.7从64.3%提升至84.7%;在RoboCasa Kitchen上,将受控的GR00T-N1.7基线从64.1%提升至70.3%,并且在两个基准测试中对π_{0.5}均取得一致的提升。在真实世界任务中,INDI将平均成功率从62.0%提升至68.7%,在更长时程任务上提升高达12.0个百分点。进一步分析表明,恢复的潜在表示被解码器所使用,能够捕捉行为目标与执行进度,并以目标依赖的方式组织下游预测。这些结果表明,动作解码器受益于对其所生成行为的语义目标进行显式建模。
自回归视频扩散通过从有界近期上下文生成片段,实现了可扩展的长视频生成。虽然基于近因的缓存保留了局部连续性,但它会驱逐在主体、物体、场景或属性重新出现时所需的历史线索。现有的记忆机制使模型暴露于非局部历史,但仅能访问并不确保有效使用。我们的分析揭示,视频DiT层对当前、近期和远期上下文表现出不同的偏好,这表明长程记忆需要同时决定检索什么以及在哪里使用它。我们提出了LayerRecall,一种当前条件化的、层选择性的记忆路由器,它检索相关历史K/V状态,并仅将其注入骨干网络特定的记忆敏感层,同时在别处保留局部注意力。为了减少对稀缺的高质量长视野视频和显式记忆分配标签的依赖,我们进一步提出了跨视野预测匹配(CHPM),它使用特权长上下文参考在预测空间监督有界记忆路由器。在100个多镜头评估提示中,LayerRecall在MemoBench和MovieBench上取得了最佳总体结果,同时在其骨干网络上与VBench-Long表现相当,展示了更强的长程恢复能力而无需牺牲局部连续性。定性分析进一步揭示了记忆引导的自校正,即最初不匹配的局部属性恢复到其历史外观,而无需重置进行中的运动或场景结构。额外的分析显示了跨骨干网络的可移植性和可忽略的推理开销。
递归快速权重记忆与选择性状态空间模型将不断扩展的上下文压缩为固定大小的递归状态,使状态转换成为一种在线学习规则。我们在写后读自回归语义下研究该规则。对于本文考虑的前缀预测目标,第t步揭示的局部快速记忆示例是前缀对齐对(x_t,y_t)=(ϕ(k_{t-1}),v_t)。常见的同步关联(ϕ(k_t),v_t)仍保持因果性,但优化的是不同的内部目标。我们推导了平方误差回归和负内积目标的归一化一阶更新。回归族包括Falcon-1(标量NLMS更新)、Falcon-2(其逐列扩展)和Falcon-3(滑动窗口小批量更新);Falcon-1A/Falcon-2A/Falcon-3A是对应的内积变体。我们提供了递归、掩码并行和分块并行三种形式,以及数值稳定的正衰减重归一化方法。代表性变体在语言建模中保持竞争力,并在可变位数加法上改进了长度外推。该框架将递归序列模型中的时间对齐、可塑性、遗忘和有界复述明确区分开来。
长程智能体任务要求大语言模型在多轮交互中迭代式地检索、整合和维护分散的信息,但保留全部交互历史会导致工作上下文持续增长。现有的主动上下文管理方法允许模型通过专门工具编辑自身的工作上下文,但仍存在三个关键局限:(1) 受限的工具集,仅支持搜索、删除和摘要,缺乏全局规划、长期记忆和自适应压缩能力;(2) 低效的探索方式,对所有上下文管理动作一视同仁,尽管它们对最终结果具有差异性影响;(3) 粗粒度的信用分配,在强化学习过程中将最终的轨迹级奖励分配给所有中间上下文编辑动作。为弥补上述不足,我们提出ContextPilot——一个面向长程智能体推理的主动上下文管理框架。该方法系统性地扩展了工具集,新增规划、长期记忆和软上下文卸载工具。我们进一步提出一种针对上下文管理定制的强化学习方法,利用上下文和熵的变化识别关键编辑决策以进行分支采样,并从所有经过相应上下文编辑动作的分支轨迹中估计动作级优势。在长上下文问答和深度搜索任务上的实验表明,ContextPilot以更紧凑的工作上下文取得了更强的性能,在多种基座模型和基准上持续超越现有基线。代码已开源:https://github.com/Tencent/ContextPilot。
时空视频定位(STVG)要求模型识别所指事件发生的时间,并在该时段内定位目标实体。现有的多模态大语言模型通常以自回归方式串行生成密集定位轨迹,导致解码延迟随轨迹管长度增长,且定位误差会随时间传播。我们提出并行管解码(PTD),这是一种生成式建模方法,将定位分解为时序块及随后的时间条件空间块,并同步解码。这消除了标记级与轨迹级依赖,将串行解码深度降为固定的1+1轮,与轨迹管长度无关。为实现并行空间生成,我们引入解耦块注意力,在保留共享视频-查询上下文的同时消除跨框依赖,并配合面向时序边界与空间几何的定位感知策略优化。在VidSTG上,与标准自回归解码相比,PTD将轨迹管完成延迟降低79倍,将空间解码吞吐量提升92倍,同时提高了定位准确度。凭借紧凑的4B骨干网络,我们的模型在VidSTG和HC-STVG上表现优异,并可零样本泛化至时序定位、定位视频问答和指代视频目标跟踪任务。我们的结果表明,并行轨迹管生成是视频中自回归定位的一种高效且有效的替代方案。
事实性问答(QA)通常假设存在单一标准答案,这掩盖了大语言模型(LLMs)是否保留长尾事实的多元叙述这一问题。为弥补这一空白,我们提出ElephantBench,一个包含1,094个问题的闭卷知识探针,所有问题均通过可审计的基于图结构的流水线生成。该流水线从低曝光网络语料中检索相关文档,识别其中自然存在的分歧,并将其转化为多版本问答记录。每条答案均对照原始文档及权威公开网络来源进行核验,并由人工标注者进行审查。在32个模型的测试中,即使最强的模型也仅在52.4%的问题上同时还原两个版本,而在几乎所有剩余问题上,模型仅回忆起其中一个版本而遗漏另一个。扩大模型规模与增强推理时思考虽能提升召回率,但无法消除这种不完整性。语料分析进一步表明,曝光不均衡偏向主导版本,而少数方曝光越多,越有助于完整召回。这些发现使ElephantBench成为一个可复现的知识探针,用于诊断参数化记忆中的认知短视。更广泛地说,我们基于图结构的基准构建流水线提供了一种高效且可扩展的方式,将长尾语料转化为可溯源的知识探针,为评估和提升下一代LLM的认知严谨性提供支持。代码已开源至 https://github.com/Tencent/ElephantBench。
基于大语言模型的智能体可以通过工具调用与外部环境交互,但这种能力也带来了文件修改、信息泄露和未授权操作等安全风险。现有的防护机制通常评估已完成的轨迹,对步骤级动作的执行前监控则探索不足。我们提出StepGuard,一种步骤级防护模型,能够审计已完成的智能体轨迹,并在工具动作执行前对其进行检查。为训练StepGuard,我们引入了StepGen,一个自动数据引擎,可在风险步骤处生成上下文相同但动作不同的安全与不安全轨迹。为进一步减少过度防御和防御不足,我们提出Balance-GRPO,根据安全与不安全动作的观测准确率动态平衡两者的学习。实验表明,StepGuard在开放权重防护模型中取得了最高的平均准确率,性能与GPT-5.4相当。在AgentDojo和AgentDyn上用于保护智能体时,与无防护设置相比,StepGuard将平均攻击成功率降低了77.3%,而平均效用仅下降2.8个百分点。
由于二次注意力的特性,大语言模型(LLM)会消耗大量内存和能量。每一个新词元都比前一个词元消耗更多成本。每新增一个词元,其键和值都必须无限期地存储在内存中,这一点是难以持续的。 为了解决二次缩放问题,研究人员提出了多种替代方案,其中之一是将LLM改造为使用线性注意力。这一思路有望在低成本下解决二次缩放问题并保持最先进的性能,因而受到了广泛关注。然而,这一研究方向尚未与更简单的基线方法进行充分的比较。 在本工作中,我们表明,带有注意力汇点的滑动窗口注意力(SWA)的表现不亚于甚至优于后训练的线性注意力模型。我们在多个LLM和各种下游任务中观察到了这一结论。在长上下文推理任务(如大海捞针测试和BABILong)中,SWA的性能大幅领先(是线性注意力的2到10倍)。SWA无需后训练,速度极快,内存需求低;因此,它是一种极其廉价且可靠的解决方案。 为了降低推理时的内存开销,我们强烈建议改用SWA,而不是采用后训练的线性模型。线性注意力模型可能显示出一定前景,但为了达到与SWA相当的水平,它们很可能需要从头训练或进行大量后训练。
评估正在从静态问答转向智能体环境,其中模型通过外部工具进行交互。我们识别出该领域中一个关键但尚未充分探索的能力——灵巧视觉工具使用:精细粒度、闭环的参数化视觉动作,模型从视觉证据中推断工具参数,而这些参数直接决定最终结果。现有基准涵盖网页导航、图形界面操作和软件工程,但很少针对视觉证据与执行精度之间的这种耦合关系。我们提出EASEL,一个评估灵巧视觉工具使用受控实例的基准,采用参考引导的视觉重建作为其主要代理任务:智能体逐步绘制画布以匹配参考图像。EASEL还包含涵盖区域标注、手写和路径规划的语义任务。我们进一步提供EASEL-Data,一个包含44万样本的两阶段课程式数据集用于轨迹监督,以及EASEL-9B以研究其对该能力的影响。对25个模型的评估显示,当前多模态智能体在EASEL上系统性表现不佳。重建相似度瓶颈处于低水平(0.40-0.54),而轨迹诊断揭示了严重的闭环不稳定性——模型通常在早期饱和或在峰值后退化。语义任务揭示了精确标注和路径规划方面的尖锐能力边界。EASEL-9B在EASEL-Data上训练后,超越基础模型相对6.3%,在所有被评估模型中排名第三。
将视频生成扩展到长时程暴露了一个关键瓶颈:当前模型缺乏稳健的长期记忆。这一缺陷可以从两个关键方面进行研究:物体持久性,即在物体重新出现时精确再现其外观的能力;以及记忆容量,即处理超长上下文并利用远距离历史信息的能力。稳健的长期记忆两者皆需:缺乏足够上下文处理能力的物体持久性会限制时间范围,而缺乏持久性的长上下文则无法维持身份一致性。为解决这一问题,我们提出了环状强制(Ring Forcing),一种自回归视频扩散框架,旨在稳健地构建并精确利用长期记忆。我们的环状结构训练策略强制从远距离历史中进行检索,有效调和了严格历史遵循与生成多样性之间的权衡。为扩展记忆容量,我们引入了压缩与时间步组合策略。在固定序列长度约束下,该方法将有效历史跨度扩展至数分钟时长的片段,并实现了对完整历史的全面感受野。此外,我们提出了一种稀疏RoPE机制,以在充分利用预训练先验的同时实现灵活、可扩展的记忆自适应。大量实验表明,环状强制在数分钟级别的连贯性和物体持久性方面表现优异,显著优于现有最先进方法。
最近的几何估计生成方法利用预训练图像扩散模型,将任务视为图像条件生成。利用现成的图像扩散模型,它们要么(i)独立训练任务特定的几何模型(用于深度和表面法线估计),从而失去了探索这些几何目标内在关联的机会;要么(ii)联合微调修改过的图像扩散主干网络(例如改变自注意力),但这通常需要大量标注数据。为了从原理上克服这些限制,我们将预训练视频生成模型重新利用为统一且数据高效的几何估计框架,创新性地将其表述为下一帧预测任务。我们的方法 GeoNeXt 继承了视频模型中天然的结构化知识和更丰富的先验,同时进一步调整它们以适应图像与几何目标(图像 <-> 几何)的联合建模,使几何学习更加数据高效且有效。大量实验验证了我们的方法在多样数据集上的零样本单目深度和表面法线估计能力,在使用显著更少训练数据的情况下,超越了以往任务特定和统一生成式的对比方法。值得注意的是,我们的方法可与在超过100倍数据上训练的判别式最先进方法相媲美,甚至在多个基准上表现突出。
多模态大语言模型(MLLMs)能够整合长时间视觉历史、在部分可观测条件下进行推理,并能从少量示例中推断行为。然而,视觉-语言-动作(VLA)模型通常继承预训练表示,却未将这种上下文能力用作情节记忆。记忆依赖策略通过专门构建的历史机制来弥补这一差距。PonderPounce则复用MLLM原生的因果上下文作为机器人记忆。Ponder作为一个System2 MLLM,在其原生因果上下文中累积情节观测、演示和先前的认知过程,并能生成用于内部使用的子目标文本和演示推理。Pounce作为一个System1 VLA,直接接收当前观测、指令和本体感知;通过Ponder–Pounce接口,它仅异步接收最新的连续认知令牌及其年龄。两者无需专门构建的记忆模块或单独的桥接预训练,即可端到端联合训练。优化后的服务实现认知刷新p50延迟78ms、动作模型调用p50延迟25ms,支持20Hz动作播放。在基于基础规模训练数据的RoboMME上,PonderPounce在相同Pounce架构和接口下,9B模型达到60.83%,0.8B模型达到50.04%,而FrameSamp+Modul为44.51%,当前观测π_{0.5}为17.93%。在9倍数据下,PonderPounce达到75.54%,FrameSamp+Modul为57.88%。在RoboCasa-DC上,同一接口仅依靠动作监督学习即可达到12.5%,而最强已发表的演示条件基线为11.6%;当认知被学习到的空状态替代时,性能下降至8.6%。
LLM智能体越来越频繁地在运行时修改自身的提示词、工具、中间件、资源和执行框架。这种自我进化可以提升能力,但一次成功的变异可能留下持久影响,而这些影响在与其产生时不同的状态下无法被安全逆转。我们提出EvoUndo——一个用于跨反事实状态表示、综合、诊断和独立验证模型生成的自我修改之可恢复性的框架。在600个未见过的单次自我进化任务中,我们识别出197个未通过可恢复性验证的能力提升变异。在原始恢复表示下,传统修复策略未能恢复这些自然失败中的任何一个(0/197)。确定性预言机分析在原始恢复语言L0下恢复了48/197,而扩展恢复演算将经验预言机恢复提升至191/197。随后,一种协议锁定的2×2接地-表达力干预分离出两个瓶颈:在原始语言足够的条件下,精确状态地址接地将成功恢复率从0/48提升至38/48(79.2%),而扩展恢复语言使得预言机定义的S1层中142/143(99.3%)的失败得以恢复。在主要gpt-oss-120b主干模型上,向更丰富的语言添加精确地址诊断将恢复率降至133/143(93.0%);Qwen3.8-27B的重复实验重现了接地与表达力的效应,但未重现这一负面交互,表明后者具有模型依赖性。这些结果表明,可靠的智能体自我进化需要协同设计验证、状态接地、见证语义与恢复语言表达力,而非仅依赖迭代式提示。
交互式Web应用生成要求模型能够根据自然语言请求生成可用的HTML、CSS和JavaScript应用。与常规代码生成不同,应用质量取决于多个面向用户的功能需求,每个需求通常与局部代码区域相关,如事件处理器、状态更新、DOM片段或CSS选择器。标准GRPO将这些结构化结果压缩为单一的序列级奖励,并将所得优势值均匀应用于所有token,从而削弱了信用分配的效果。我们提出Rubric-to-Code信用分配(RCCA),一种强化学习框架,将评分标准级的功能反馈转化为针对生成代码的局部优化信号。RCCA围绕明确的功能评分标准构建训练任务,使用分层奖励来区分格式、源码、运行时和功能层面的失败,并将评估器生成的文本归因与对应的代码片段及生成token对齐。由此产生的模型Ling-RCCA-Flash在MiniAppBench上取得41.25分,较Ling-3.0-Flash提升32.20分,并略微超越Claude Opus 4.5。该模型在ArtifactsBench上达到76.19分,较SFT模型提升4.48分,并在官方ArtifactsBench排行榜设置下以超过GPT-5达3.64分的成绩刷新最高纪录,这表明其实现层面的改进具有可迁移性。
大语言模型的对齐高度依赖于以英语为中心的高质量偏好数据,这往往导致模型在其他语言中的性能欠佳。本文提出了跨语言排序偏好优化(CRPO)框架,该框架利用来自英语的稳健偏好知识来促进目标语言中的偏好对齐。我们在目标语言与英语之间的并行偏好对中设计了层级结构,以联合优化语内与语间偏好,从而增强语言适配性和输出质量。CRPO基于LambdaLoss框架,通过提供多个候选响应之间的相对排序信号,超越了基于二元比较的优化方式。我们在五种资源规模各异的语言上进行的实验表明,CRPO在指令遵循能力和知识利用能力方面均持续优于标准方法。值得注意的是,在不同权重方案下观察到的稳健性能提升进一步验证了我们的层级设计在多语言设置中的实证有效性。此外,我们的研究结果强调,CRPO显著提升了奖励边际和理想响应的对数概率,为跨语言对齐贡献了更稳定的偏好流形。我们的代码可在https://github.com/dltmddbs100/CRPO获取。
我们定义原子生成事实f=(u,tau,omega,z;rho),记录其起源、已实现变换、具体发生、生成结果与关系角色。将这些事实编译为生成事实图(GFG),可为AI原生、可编译的科学事实基底提供载体,并完整保留生成历史。我们建立了一种基于GFG的递归科学过程,其中分析、干预、回放与验证会为后续周期生成新事实。借助nanoGPT,我们确立了统一的训练-学习动力学。训练是带状态与记忆的参数-优化器系统的演化:每次实际训练动作进入接收状态,并产生一种由该状态及目标特异更新几何共同调控的有限振幅非线性函数响应。学习则是这些响应所引发的分布式功能支持的持续性重组;当目标特异状态对照其读出边界进行评估时,能力的形成、维持、衰退或恢复便成为可观测现象。三个主坐标——目标边界状态、目标特异更新几何以及参数-Adam接收状态——共同构成一个二阶预测器,可在更新后输出被读取之前进行预测。在留出运行中,该预测器在四种转变上达到了91.43%的准确率和91.49%的宏平均召回率。我们进一步将推理确立为训练-学习动力学的冻结投影。组件门控与回滚实验表明,训练期间形成的查询条件支持存在因果募集与非加性组合,并由此推导出由注意力实现的组织条件。受控反馈提示可能存在的双刃强化效应。ResNet/CIFAR-100与扩散模型/CIFAR-10实验进一步证实,在nanoGPT之外,接收状态条件响应、持续支持重组以及冻结推理投影同样成立。
大语言模型(LLM)正越来越多地采用分层防御进行部署,但恶意提示仍然可以绕过这些防御。可解释性方法能够揭示生成路径中模型内部的信号,这些信号可为防御执行提供依据,但这些信号本身并非安全控制措施。将其适配用于安全性的部署通常会将每个信号与各自的校准机制、策略逻辑和干预代码耦合在一起,因此每新增一个工件就会带来集成工作,而非强化共享防御。我们提出了语言模型安全模块(LMSM),这是一个借鉴Linux安全模块(LSM)的隔离理念并将其应用于LLM服务的安全框架。在LMSM中,选定的安全后端提供经校准的证据,版本化策略基于可信的逐请求上下文评估活动规则,而独立的门控模块则授权缓冲输出的发布。这种设计将仲裁正确性与策略有效性相分离,使得后端、规则或调度计划的变更无需重建请求处理或执行逻辑。我们的原型展示了这种隔离在实际中的运作:在Hugging Face Transformers和连续批处理的vLLM上,同一基础平台可承载基于工件的稀疏自编码器(SAE)和转码器部署以及任务适配的稠密探针,在调度器动态变化下保持逐请求决策的稳定性,并支持对每个请求选择性地执行和组合多条规则。在Qwen3-4B上,LMSM-Checkpoint将HarmBench攻击成功率从39.20%降至3.32%,XSTest误拒绝率从2.40%上升至4.40%,同时在32条活动序列下保留了匹配的无监控服务路径98.14%的吞吐量。LMSM为可解释性和模型内部分析的进展提供了通向运行时防御执行的共同路径。
在对话中纠正健康错误信息,需要的不仅仅是给出事实性反驳:用户所知道的、所相信的以及所需要听到的内容各不相同,因此有效的干预往往取决于首先提出恰当的澄清问题。然而,现有方法要么立即回应,要么不加区分地探询,将澄清视为要么没有必要、要么总是有益的。我们提出了奖励优化的探询-回应框架(RO-PnR),该框架能够学习何时提问是值得其成本的。在每个轮次中,RO-PnR 在进一步探询信息和给出最终纠正之间做选择,并由一个轮次级奖励引导,该奖励权衡探询的预期收益与其交互成本。为了捕捉用户异质性如何影响探询价值,我们为每个模拟用户建模,在健康素养和信念承诺维度上赋予其潜在状态。实验表明,RO-PnR 在三个健康错误信息数据集和三个基础模型上取得了最高的成本调整效用,且与始终探询的基线方法相比,使用的轮次减少了30%。
交互式对话游戏考验的是静态基准在很大程度上隐式保留的一种能力:模型必须在多轮对话中保持状态、解读反馈,并在不断变化的约束条件下选择有效动作。我们在LM Playschool挑战赛中使用一个20亿参数开放权重模型研究这一场景,发现许多失败不仅是广泛的知识缺陷,也是局部的决策缺陷:重复猜测、格式错误的动作,以及违反模型刚刚看到的反馈。这些诊断促使我们设计了一个围绕三个步骤组织的训练方案:通过监督微调获得广泛的游戏参与能力,使用回合局部的偏好对修复目标对话游戏家族内可机械验证的失败,并保持这些对话游戏之外的一般能力。在官方最终评估中,我们的提交将公开clemscore从10.67提升至38.92,封闭域内得分从13.41提升至41.17,同时大致保持聚合静态性能不变(基线为44.14对44.24)。域外clemscore仍较低,为7.88,最大增益集中在目标家族未见过的变体上。我们的结果表明,广泛的SFT带来了模型能力提升的大部分;当失败检测精确时,回合局部监督可以发挥有效作用,观察到的迁移主要集中于家族内部。
生成式视觉语言模型(VLMs)越来越多地应用于以人为中心的环境,但即使在图像仅在感知种族或性别等受控属性上存在差异时,它们仍可能产生人口统计偏差输出。然而,现有的推理时去偏器主要针对静态嵌入或类CLIP模型设计,而非生成式视觉语言模型。我们提出GGSS——测地线门控球面引导——一种保范干预方法,在单位超球面上发现反事实偏差子空间,沿测地线弧引导视觉标记,并使用自适应门控将修正集中于携带更强人口统计信号的标记上。我们在统一的单工作点协议下,针对十个适配的推理时去偏基线方法和基于提示词的缓解方法,对四种生成式视觉语言模型进行评测,涵盖类别、成对和职业-性别偏差测试,同时评估其通用视觉语言能力。GGSS在所有四个模型上均取得最低的平均偏差,在四个骨干网络中的三个上通过配对置换检验达到显著水平,同时将MMStar准确率保持在未引导基线±0.6个百分点以内。代码可在 https://github.com/dukesun99/GGSS 获取。
抽取式提示压缩有望通过去除低信息量词元来降低大语言模型的推理成本,而诸如LLMLingua-2等学习型压缩器在英语基准上报告了强劲的性能。大多数其他语言已经支付了词元溢价:相同内容的词元消耗比英语多1.3至1.8倍。我们探究的问题是:压缩是缩小还是扩大了这一差距。我们使用涵盖五种文字的十种语言的完全平行数据,在目标模型分词器中进行了预算匹配控制,将四种学习型压缩器与四种确定性基线进行对比审计,涉及来自十家供应商的十一个目标模型(超过25万次评估调用)。其中三种压缩器使用英语监督训练(LLMLingua-2 XLM-R/mBERT;来自生产级Headroom技术栈的Kompress-v2);第四种XProvence则采用多语言训练。首先,迁移差距真实存在,跨目标模型和压缩器骨干网络均可复现,且强烈依赖于保留率:在0.33的保留率下,英语保留了57-62%的归一化上下文利用率,而立陶宛语仅保留10-24%,中文则几乎为零——尽管中文的词元溢价最小。其次,这一差距与压缩监督数据相关,而非架构。所有三种英语训练的压缩器均表现出该差距,确定性方法未出现可比差距,而多语言训练的XProvence v1则完全没有差距。其v2版本在翻译数据上重新训练后,在激进阈值下清空了92%的中文上下文,且毫无预警。第三,在难度更高的长上下文场景中,激进的学习型压缩导致五种非英语语言中的三种其压缩后上下文效用降至与无上下文相当或更低。先翻译后压缩的流水线在五种测试语言中的三种中,以约一半的词元成本达到或超越了原生压缩的效果。我们公开了所有代码、压缩结果和模型输出。英语之外的安全压缩预算要小得多。
户外激光雷达语义场景补全(SSC)旨在从仅覆盖目标体积1%的扫描中恢复稠密语义体素网格,同时面临超过7,000倍的类别不平衡。我们将SSC重新表述为生成式语义场景补全(GSSC):一种以三种角色呈现的统一离散扩散框架。首先,配对稀疏-稠密场景合成(PS³)生成配对的稀疏激光雷达观测及其稠密语义补全,从源头解决长尾分布问题,并构建PS³-SemanticKITTI语料库,供我们与SemanticKITTI一同训练。其次,语义引导的生成式场景补全(SGSC)利用多项离散扩散从噪声中生成场景,并借助鸟瞰图语义图和稀疏3D特征流以稀疏扫描为条件进行引导。第三,同一框架还可通过单步流匹配来优化已有的补全结果:即结构化源离散扩散(S²D²)。无需对基线进行重训练或测试时自适应,S²D²即可提升SGSC自身输出以及所有经过测试的外部SSC基线的mIoU。在最强基线上,无需测试时增强的单步优化在SemanticKITTI隐藏测试集上达到38.8%的mIoU。据我们所知,这是该排行榜上最佳的因果式、单次扫描、单样本结果,比相同约束下的此前最佳已发表成绩高出2.1个百分点。在不受该约束的情况下,采用四步校正结合八视角测试时增强可达到39.2%的mIoU。