每日精选AI研究论文及翻译
视觉-语言-动作(VLA)模型已成为通用具身智能体的主流范式,在结构化环境中展现出强大的复杂任务和长时程任务完成能力。然而,当前VLA系统能否受益于更有效的架构设计、扩展到规模显著更大且更多样化的异构数据体系,并在跨任务和跨本体上实现更广泛的泛化,仍是一个悬而未决的问题。为此,我们提出GigaBrain-0.7,一个在多样化机器人本体上实现显著泛化能力提升的具身基础模型。具体而言,GigaBrain-0.7通过三系统架构统一理解、预测与动作,将预训练扩展到超过37,000小时的异构具身数据,并引入单阶段对齐训练,联合优化视觉-语言理解与多本体动作生成。与之前的GigaBrain-0系列以及包括π_{0.5}在内的先前最先进模型相比,GigaBrain-0.7在基础零样本能力、语言条件指令跟随以及后训练任务成功率方面均取得了显著提升。特别是,在我们自研的Maker H01平台和主流机器人本体上,GigaBrain-0.7在家庭和工业场景中均展现出强大的任务适应性和完成能力。所有训练代码和预训练模型权重将全面开源。
多模态大语言模型(MLLMs)已成为统一视频感知的主流范式。然而,在大型多任务数据集上进行后训练仍面临挑战,因为现有的强化学习方法即使采用昂贵的思维链(CoT)生成,也仅在同策略组内采样少量高质量轨迹。本文研究了视频MLLMs强化学习后训练的样本效率与可扩展性,并提出了OraRL方法。我们发现了一个被忽视的标注作用:每条标注除了用于对采样结果评分外,还可以作为一条“指导(oracle)轨迹”进入其对应的同策略组,成为直接的正面优化目标。然而,直接整合指导轨迹并非易事:高奖励的指导轨迹会抬高组内基线,从而将原本为正的策略优势变为负值——我们将这一失效模式称为“优势反转”。OraRL的核心是一个解耦优势估计器:策略采样轨迹决定无指导基线,而指导-策略差距同时调节方向增益和独立的分离式指导优势。符号均衡剪枝进一步提升了效率:仅保留指导轨迹及每个符号下最强的若干采样轨迹,OraRL的步进时间仅为SFT的2.2倍,远低于GRPO配合CoT时的4.9倍。OraRL随模型规模和数据量同步扩展,在0.8B至9B参数范围内超越其基础模型,并在多达10万条提示上优于GRPO。在不使用思维链的情况下,Video-ORA-9B解码只需130毫秒,而后者需要4,780毫秒。与各自此前的最佳模型相比,OraRL将时间mIoU从62.5提升至66.0,跟踪AO从73.0提升至78.2,分割性能从64.3提升至70.4,三项空间智能基准的宏平均值从51.0提升至56.1;在VSI-Bench上,OraRL得分为73.1,而GPT-5为55.0,Gemini-3-Pro为55.1。
通用多模态嵌入正成为现代AI系统的核心组件,使异构内容能够在共享空间中进行表示,以支持检索、推荐、分类和智能体系统等应用。在本报告中,我们提出了WeMM-Embedding,一个通用多模态嵌入模型系列,支持文本、图像、视频、视觉文档以及任意交错的多模态输入,并具有灵活的输出维度。该系列包含2B、4B和9B三种变体,并采用两阶段训练:先是大规模多模态对齐阶段,然后是使用精选数据、细粒度相关性监督和跨尺度知识迁移的精调阶段。在广泛的评估中,WeMM-Embedding在多个公开基准上取得了领先性能。值得注意的是,2B变体在MMEB-v2上已超越此前领先的8B开源基线,而9B变体进一步取得了80.6的整体分数,达到新的最先进水平。WeMM-Embedding还在微信应用中展现出强大的实际性能,在26任务内部基准上取得了显著提升,并在14个在线A/B测试中持续改进。它已大规模部署于推荐和搜索应用,包括视频号、公众号、朋友圈和电商服务。我们已发布模型权重和代码,以促进未来研究,详见 https://github.com/Tencent/WeMM-Embedding。
大语言模型智能体在长时程任务上仍不可靠,因为细微的局部失败会在长时间交互中不断累积,最终导致整体任务失败。尽管外部框架能显著提升鲁棒性,但框架设计仍是一个手工且昂贵的过程,需要在庞大的提示词、工具配置和控制逻辑空间中进行搜索。我们提出AutoSaddler,一个自动框架优化系统,将框架改进形式化为离线学习问题,并利用小批量的失败信号迭代更新框架。AutoSaddler结合了失败轨迹诊断、将框架视为代码的结构化补丁生成,以及基于验证的更新选择。在GAIA2、SWE-Bench Pro和Terminal-Bench 2.0上的实验表明,AutoSaddler相较于对应的基础框架大幅提升了智能体性能,分别取得了9.0、9.6和10.0个百分点的增益。消融研究进一步表明,有效的框架优化得益于三个要素:深度调试而非浅层反思、针对性修改而非无约束编辑,以及泛化感知的选择而非针对特定轨迹的修复。综上所述,这些结果表明自动框架优化是通往更高效、更可靠的智能体系统的可行路径。
强化学习可以将扩散模型与人类偏好及任务特定目标对齐,但端点奖励并未指明中间去噪预测应如何变化。我们提出 DiffusionOPSD,作为一种同策略自蒸馏框架,将图像级奖励引导转换为采样查询处干净输出预测的显式目标。在每次外部迭代中,冻结的行为策略生成轨迹,并提供查询状态与锚点。奖励梯度在每个锚点周围构造有界正负目标。可训练策略通过有限次拟合将这些目标作为解耦监督进行拟合,随后指数移动平均更新刷新行为策略。这一设置使我们能够分别衡量目标构建与有限实现。受控的同查询实验表明,在单次拟合更新后,较大的目标构建收益并不一定会转化为较大的实际收益。在 SD 3.5-M 和步进蒸馏的 Z-Image-Turbo 上,我们的方法在两个骨干网络和十个评估器所构成的 20 个奖励匹配设置中的 19 个中取得了最佳最终留出分数。相比最强竞争方法,其性能提升最高达 44.0%;相对于 DiffusionNFT,在 SD 3.5-M 上训练 GPU 小时数减少 40%,在 Z-Image-Turbo 上减少 63%。这些结果支持同策略自蒸馏作为扩散模型后训练的一种高效且可分析的方法,通过将图像级奖励引导转换为显式且持续刷新的中间监督,从而为更高效且可诊断的对齐开辟了道路。
提示注入被列为AI智能体的头号威胁。当智能体访问来自网站、文件或电子邮件的外部数据时,攻击者可能在数据中注入提示,比如“忽略之前的所有指令,执行<攻击者的任务>”。为了防止智能体被任意操纵,防御者尝试训练安全的大语言模型(LLM)。然而,这些模型在面对自适应提示注入时,攻击成功率(ASR)仍接近100%。我们注意到,这是因为现有的防御性微调方案依赖于序列级反馈信号(如在DPO或GRPO中)。将整个输出等同对待,使得模型无法精确学习哪些输出词元是不安全的。在本文中,我们提出了安全同策略蒸馏(SecOPD),通过提供词元级反馈来指导防御性微调。该LLM接收一个注入样本并生成一段轨迹,其词元由初始模型以对应的干净输入进行评分。凭借更细粒度的训练信号,我们防御后的Qwen3.6-27B面对最先进的PISmith自适应提示注入时,ASR降至9.0%,而此前最先进的Meta-SecAlign则高达94.0%。所得的安全性可泛化到训练中完全未见过的领域:在智能体工具调用中,SecOPD的ASR为4.7%,而Meta-SecAlign为5.5%。代码和模型可在 https://github.com/pppyb/SecOPD 和 https://huggingface.co/pybbb/Qwen3.6-27B-SecOPD 获取。
随着大语言模型(LLMs)在编程能力上的持续进步,它们在网络安全领域的潜力日益受到研究关注,诸如Mythos之类的闭源大语言模型已展现出先进的网络安全能力。然而,现有的开源工作仍然有限:前沿开放权重模型并未提供可复现的网络安全训练方案;开源训练方案仅聚焦于孤立任务,且缺乏可扩展的智能体数据;而扩展智能体轨迹需要较强的领域先验。在这项工作中,我们提出了CyberFactory,这是一个统一的开源框架,将数据构建、轨迹合成与模型训练联系起来,涵盖概念验证(PoC)生成、漏洞修补和网络安全问答(CyberQA)。CyberFactory将公共漏洞工件(包括来自现实世界的CVE)转化为可执行且可验证的任务实例。它进一步利用一种可复用的漏洞分析技能,引导教师模型进行源码检查、基于领域先验的问题求解以及基于证据的验证。由此产生的监督数据具有智能体特性:模型与工具及目标环境交互,并根据执行反馈修正其解决方案。利用这些轨迹,我们训练并发布了模型Aegis(在希腊神话中,Aegis是宙斯和雅典娜的护盾;该名称体现了模型面向防御的安全目的)。该模型内化了技能引导的流程,而无需在推理时使用该技能。在CyberGym上,Aegis在一小时预算内达到了52.4%的Pass@1,相比其Qwen 3.5基础模型提升了22.8个百分点,并且在相同的脚手架(scaffold)下优于所评估的通用骨干模型。
递归自我改进(RSI)在长时程任务中仍然困难,因为不断累积的历史记录会模糊任务状态,并导致技能调用错位。我们提出 Recuris,一种用于长时程智能体框架的递归经验-工作记忆架构,其中工作记忆跟踪任务进度并引导从经验记忆中进行技能选择,使技能使用基于当前需求而非完整历史。这种耦合还将执行过程转化为结构化证据,从而将失败定位到具体记忆组件。跨任务地,一个固定的元智能体将这些证据转化为对技能记忆的局部化、验证门控更新,重塑执行行为并产生新证据,形成一个有界的递归记忆演化循环。在四个长时程基准和十个模型上,Recuris 在 37 个完成的模型-基准组合中改善了 35 个的任务成功率,将前沿模型提升至 SOTA 级任务成功率:在 tau-bench 上,为 GPT-5.6 Sol 增加 17.8 个百分点,为 Claude Opus 5 增加 15.6 个百分点,使 Opus 5 达到 87.9%;在 SkillFlow 上,为 Qwen3.6-27B/35B 分别增加 16.6/13.5 个百分点。随着交互时程增长,优势进一步扩大,在最长的任务上达到 +32.2 个百分点,常见的长时程失败减少多达 80%。这些结果将递归演化的记忆定位为 RSI 的可扩展基础,使智能体能够不断将累积经验转化为日益高效的长时程行为。代码:https://github.com/Gen-Verse/Recuris
诸如GRPO等针对大语言模型的基于组的强化学习方法,通过为每个提示采样多个响应来避免训练评论器。而一个可靠的评论器则可以从单个响应中估计词元级优势,但标准的基于评论器的训练方案往往不稳定。我们研究了这种不稳定性,并提出了**最佳实践评论器优化(BPCO)**,该方案结合了DPPO、奖励范围有界的价值预测、蒙特卡洛价值目标、未归一化的策略优势以及长度自适应的广义优势估计。由于评论器仅在训练期间使用,BPCO还可以让其以定义奖励的信息为条件,例如参考答案或评分标准,而这些信息对策略是隐藏的。受控实验单独评估了每个设计选择的影响。在从1.5B参数到30B-A3B混合专家模型的数学推理任务上,BPCO一致地改善了强基于评论器的基线,并且在每个提示仅采样一个响应的情况下,达到或超过了基于组的基线。同一方案也改进了使用基于评分标准的奖励时的学习效果。这些结果表明,精心设计的评论器为组相对优势估计提供了一种可靠的替代方案。代码可在 https://github.com/QPHutu/golden_critic 获取。
基于可验证奖励的强化学习(RLVR)与同策略蒸馏(OPD)已成为大语言模型后训练中两种广泛采用的范式。然而,RLVR面临稀疏的任务级反馈,而OPD提供稠密的词元级指导,却忽略了轨迹正确性,使其性能局限于教师模型。将二者结合是一个有前景的方向:OPD提供稠密监督信号,RLVR提供任务级正确性。尽管如此,现有集成方法往往依赖加权组合或启发式切换,引入了额外超参数与权衡。我们提出OPDVR(基于可验证奖励的同策略蒸馏),一种简单却有效的方法,无需添加任何超参数即可无缝结合OPD与RLVR。我们首先基于轨迹正确性重新表述采样词元同策略蒸馏的隐式奖励,然后应用ReLU门控机制,确保正确轨迹获得非负奖励,错误轨迹获得非正奖励——从而在保留教师模型分布指导的同时,使蒸馏信号与任务成功对齐。此外,我们的修改将采样词元同策略蒸馏转化为一种真正的RLVR方法,使其能够与任意策略梯度算法(如GRPO)直接结合。在六个推理基准上的实验表明,OPDVR持续优于标准OPD。我们的代码已开源:https://github.com/LeapLabTHU/OPDVR。
智能眼镜正从采集与显示配件演进为第一人称智能平台,将人类感知、持续性情境以及数字或物理行动连接起来。其穿戴式视角与佩戴者的视觉、听觉、运动及手-物交互保持一致,但必须在严格的能量、热功耗、隐私和反馈约束下运行。尽管增强现实、自我中心视觉、多模态模型、人机交互和具身智能取得了快速发展,相关文献在设备、任务和基准测试方面仍呈现碎片化状态。关键挑战不在于模型能否在孤立条件下完成识别、回答、记忆或行动,而在于一个完整系统能否维持可靠、时间有效、可纠正且可治理的感知-状态-交互-行动闭环。本综述是**首个通过此类统一框架系统研究智能眼镜的工作**。我们形式化定义了第一人称数据流和受限任务效用,沿八条可验证的硬件能力轴刻画设备特征,围绕七项相互依赖的基础能力组织文献体系,并引入涵盖采集、反应式感知、情境辅助、持续性状态、受治理行动和具身耦合的L0-L5框架。在九个应用场景中,我们将任务与数据集、系统、产品、利益相关者、失效后果和证据缺口相连接。我们进一步提出了九维部署框架、基于主张条件的评估协议,以及从受控测量到纵向现场验证和审计的证据阶梯。这些要素共同使智能眼镜更具可比性、可部署性和可复现评估性,同时勾勒出通往可信第一人称智能的路线图。
自我改进的 LLM 智能体改进的是答案,而非产生这些答案的过程。增加元层次的系统会使该层次保持固定;而那些自我编辑的系统则必须保留自身编辑机制的一部分不被改动以维持稳定,从而将其实际实现的元深度上限限制在约二层。我们提出 Meta^n,它保持元操作固定,转而对其输入进行递归。该操作 Ω 反复应用于自身的产物:读取下方求解器栈的轨迹以及生成这些轨迹的代码,然后把下一层编写为策略性预处理模块和可调用辅助函数库。由于 Ω 从不改变,它不会破坏系统稳定性;又因为其输入严格递增,每一层都比上一层从更高的视角进行推理。深度由收敛性决定,而非预先设定;一个演化档案库对层链进行搜索。在两种骨干模型上,Meta^n 在全部八个基准测试族上均优于先前的自我改进智能体。最突出的案例是 ARC-AGI-2——该基准测试旨在抵制技能记忆——在其中唯有 Meta^n 得分高于零。消融实验表明,递归带来的收益大部分来自每一层传递给下一层的条件信息;并且尽管没有任何提示词加以规定,不同层的角色会随深度涌现。代码见 https://github.com/minnesotanlp/meta-n
视频游戏为视频世界模型提供了可扩展的训练数据来源,包含多样化的环境、复杂的交互以及丰富的野外游戏视频。然而,原始游戏录像将游戏世界与屏幕空间界面纠缠在一起,引入了游戏特定偏差和无关动态,从而阻碍了世界模型的训练。为解决这一问题,我们提出了GameUI-Taxonomy和G2WEngine,这是一个全栈框架,规范了游戏UI的定位与去除。G2WEngine能够自动从真实游戏视频中提取可复用的UI资产,并在干净视频素材上合成时间上连贯的UI覆盖层。利用该引擎,我们构建了Game2World数据集,包含96K个具有精确重建目标的合成配对视频,以及来自303款游戏的1,079个野外片段,用于真实场景评估。其资产库包含来自1,010个代表性游戏画面的5,132个经过验证的UI元素,涵盖21个分类类别。基于Game2World,我们提出了GameCleaner,一种无掩膜的游戏UI去除模型,它结合了多模态语义理解与视频编辑能力。与基于掩膜的方法不同,GameCleaner直接识别并移除各种HUD元素,同时保留底层场景内容和时间动态。在受控试点实验中,基于无UI游戏画面训练的世界模型相比基于UI叠加数据训练的模型,在整体VideoReward上提升了6.83%。在UI去除评估中,GameCleaner在合成视频上实现了95.36的平均AAR,比最强的时间掩膜基线高出57.3%,并在野外数据上获得了最佳AAR 80.05,同时实现了99.8%的背景保留率。这些结果展示了将互联网游戏视频转化为高质量世界模型训练数据的可扩展潜力。代码、数据集和模型将在 https://github.com/Dongping-Chen/Game2World 上提供。
我们提出了 LAION-BVD,一个用于多模态学习的大规模开放视频数据集,其中包含从 CommonCrawl 收集的 13 亿个特定平台的视频 URL。从中,我们下载了 8000 万个视频,总时长达 1000 万小时。该数据集旨在跨视频、音频和图像模态进行多模态预训练。利用内容感知的场景检测,我们提取片段,并为其合成生成视频和音频描述。在这些数据上训练的模型在标准视频-文本和音频-文本基准上取得了具有竞争力的性能,并且随着训练规模或模型规模的增加而持续提升。此外,我们通过提取场景变化帧,探索将视频帧作为图像-文本数据的替代来源。这些帧展现出与标准网络图像语料库不同的视觉分布,基于该数据集训练的模型取得了强大的图像-文本检索性能。我们将 LAION-BVD 发布给研究社区。它以前所未有的规模显著扩大了对多模态视频的开放访问。
机器翻译测试了掩码扩散语言模型(dLLMs),因为每个源语token都必须被忠实呈现,而固定画布解码必须在去噪之前确定目标长度。现有的掩码扩散解码工作主要研究token去掩码顺序,尽管长度决策对覆盖率和冗余度有直接影响,但该决策仍未得到充分探索。我们提出熵谷(Entropy-Valley,EV),一种免训练的长度选择器,通过对全掩码前向传播的平均预测熵对候选目标画布进行评分,并选择骨干模型最有准备填充的画布。相较于使用训练语料长度统计作为基线的方案,EV在EntoZh、ZhtoEn和EntoDe上分别恢复了参考目标长度下COMET-22增益的64.9%、65.3%和33.0%。我们的诊断表明,有利于去噪的长度无需与参考长度一致。三位翻译专家的评估支持英汉双向的充分性提升,其中ZhtoEn方向的证据更为充分。与使用相同微调数据训练的LLaMA-3-8B自回归(AR)模型相比,EV系统在EntoZh上持平,在ZhtoEn上领先;进一步的神谕长度诊断表明,在这种掩码扩散MT设置中,决定先揭示哪些token不如目标长度的提供方式重要。
结果监督的搜索智能体能够学习何时以及如何检索证据,但最终奖励既无法定位中间错误,也无法在这些错误累积之前引导正在进行的轨迹。将纠正性反馈视为一种学习到的轨迹内干预,将两个角色耦合在一起:智能体必须决定何时请求并使用反馈,而评论者必须从结果混杂的轨迹展开中推断出有用的纠正——这些轨迹的失败模式会随着智能体的改进而变化。我们提出了CAFE(耦合智能体-反馈演化,Coupled Agent--Feedback Evolution)框架,其中共享参数模型在搜索智能体与评论者角色之间交替切换。CAFE从围绕基础智能体自身失败构建的轨迹中初始化反馈条件恢复,然后将在线与离线优化耦合起来。在线强化学习阶段,对比式反馈估计利用提示级别的调用-跳过成功差距来塑形请求回报,同时反馈感知优势塑形在反馈前后重新加权词元优势。离线阶段,轨迹衍生的偏好优化从配对的成功与不成功轨迹中学习反馈。在七个智能体搜索基准测试中,CAFE在平均表现上优于所评估的基于强化学习的搜索智能体,在全部六个领域外基准测试中保持其优势,并减少了答案级幻觉。单侧消融实验表明,仅改进智能体或仅改进评论者最终都会陷入平台期,而交替进行两种更新则持续提升性能。这些发现表明,自我改进的搜索智能体需要与其所引导的策略共同演化的反馈。
并发多智能体编码有望在模块间实现分工、通过冗余提升鲁棒性,并在多文件项目的自然粒度上进行并行探索。实时协作编辑协议通过无冲突复制数据类型(CRDTs)解决了人类团队的协调问题,但底层的大语言模型逐词元生成输出,现有的大语言模型多智能体编码系统继承了这一串行限制:它们要么通过阶段交接来序列化智能体,要么无协调地汇聚独立样本,而单个智能体在面对高达一半的困难任务时会放弃,仅生成一个文件的存根后退出。AgentRoom是一种面向并发编码智能体的实时协作编辑协议。其运行时层将文件级声明、状态和广播作为MCP工具暴露在CRDT合并的共享文件系统上。五个前沿编码CLI模型在四个后端编码任务上进行了测试,并在Python DevBench和Rust+axum上进行了跨语言检查。对于CLI稳定的模型,使用2个智能体的AgentRoom比 Solo 放弃的任务更少,且运行间变异更小。在算力匹配的条件下,一个正向的LLM评测均值对比显示AgentRoom优于并行合并。另一项对比(捆绑探针)表明,完整的AgentRoom优于每种部分配置:这是一个排序问题,而非百分比分配问题。承担主要作用的是协调,而非并行性或CRDT合并。
基于大语言模型的智能体能够执行多步骤任务,但其行为结构仍然不透明:冗长的非结构化轨迹难以满足部署所需的安全审计与运行时监控要求。现有方法仅在单条轨迹层面或仅针对成功案例进行操作,因而遗漏了连接下一步预测与失败预测的跨运行拓扑结构。为恢复这种共享结构,我们将整个轨迹语料库压缩为单个紧凑的有限状态机(FSM),作为原本不可预测的大语言模型智能体行为的结构基底。在十二个公开数据集上,该有限状态机具有紧凑性(7–43个状态),在保留数据上的回放拟合度≥0.997,且各划分间的拓扑结构几乎一致,构建时间仅为毫秒级。该基底可同时满足两个预测目标。在下一步预测方面,FSM状态上下文在所有与真值匹配的数据集上均优于Agent Workflow Memory方法。在失败预测方面,基于状态的行为特征在保留数据上达到了最高0.94的AUROC,且在线监控器可仅凭部分轨迹即将失败运行排序在成功运行之前,从而在任务完成前很早触发提前停止。行为拓扑结构似乎更多地由部署框架而非大语言模型本身所塑造,这为安全审计和运行时监控提供了一种模型无关的结构性原语。
工业推荐系统通常采用级联的召回、排序和重排序流水线。尽管高效,这些流水线却将信息和目标分散到各个模块,依赖刚性规则,且对实时意图的感知能力有限,导致浏览、比较和购买之间的会话级转换未能得到充分处理。我们提出了DREAM(Developing Recommender Engine with Agentic Methods,基于智能体方法的推荐引擎开发),一种自主优化控制架构,它在不替换现有流水线的前提下,在其之上增加了一个具有感知能力、可编排且可审计的策略层。DREAM包含两个核心组件。第一,三层意图引擎(Intent Engine)将设备端信号融合为结构化的L0/L1/L2意图表示;其边缘-云端触发链将上报量压缩至约8.7%。第二,元引擎(Meta Engine)利用元模型(MetaModel)进行M1到M2再到M3的分层推理:意图摘要、由策略记忆(Strategy Memory)指导的策略规划,以及参数转换。它通过带有安全护栏的统一出口分发生成的参数。奖励双循环(Reward Dual Loop)通过将离线模拟用于策略空间探索与在线反馈用于结果校准相结合,持续优化两个组件,形成生成、执行、评估和经验积累的闭环。在淘宝首页信息流上的大规模A/B测试表明,仅对重排序进行控制即可使IPV提升2.06%,核心IPV提升2.39%,GMV提升0.88%。将控制扩展至精排后,这些增益分别提升至2.71%、3.06%和1.31%,同时PV持续提升超过1%。这些增益既无需替换流水线模型,也不牺牲服务稳定性,支持智能体元控制作为工业推荐的可行范式。
大语言模型(LLM)智能体通过多角色、多阶段工作流协调复杂任务。上游状态被反复转换为中间语言产物,例如摘要、计划、工单、记忆和交接说明,下游组件据此行动。对于约束行动的状态,仅保留主题内容是不够的:产物可能提及未解决条件,却将其从“执行前必须解决的要求”转变为“仅可能为下一步行动提供参考的信息”。我们将这种行动约束作用称为操作性状态保持。安全阻断器提供了一个受控实例,因为每个源状态都有明确的先决条件、授权、回退方案和执行后果。我们以上游识别正确为条件,改变交接转换方式,并评估仅限于使用所得产物的执行器。在1,296个受控合成情景中,直接交接对照组保留了每一个阻断器,而压缩、计划吸收、收敛、所有权延后和先例替换则反复将约束性状态转变为警告或非约束性考量。常规交接压缩导致100.0%的阻断器失活和54.2%的违禁行动。恢复全部四个状态字段可将保持率提高到100.0%,并将违禁行动降至0.0%。固定产物干预进一步将保持与遏制区分开来:下游验证消除了违禁行动,而产物失活率仍为95.3%。这些结果揭示了信息提取与行动之间的状态传递失败。交接转换可以保留状态内容,同时削弱其对下游行动的约束。语义可用性并不保证操作性保持。
形态学变换是形状与掩膜处理的长期工具,但 Python 生态系统中事实上的参考实现 scipy.ndimage 仅支持 CPU 且仅能处理单一数组,因此在 GPU 训练循环中若不经由昂贵的设备到主机往返传输便无法使用。基于 PyTorch 构建的 GPU 视觉库仅覆盖这些算子中一个狭窄的子集,通常仅限于二维空间和扁平结构元素。我们提出了 TorchMorph,一个填补这一空白的轻量级 PyTorch 扩展。TorchMorph 公开了 22 个公共算子,涵盖二值形态学、灰度形态学、精确与近似距离变换,以及熵正则化最优传输;所有这些算子均以融合 CUDA 内核实现,可直接操作形状为 (B, C, Spatial...) 且至多具有八个空间维度的 CUDA 张量。其 API 刻意逐参数地镜像 scipy.ndimage,包括边界模式、结构元素原点及预分配输出,因此现有流水线只需更改导入语句即可迁移。我们描述了各算子家族背后的分层架构和内核设计。相较于单线程 CPU 参考实现,批处理执行在灰度形态学上的吞吐量可达 scipy.ndimage 的 1.1e3 倍,在精确欧氏距离变换上可达 350 倍;同时,Sinkhorn 求解器比 POT 快至多 42 倍。二值算子和倒角算子可精确复现其 SciPy 对应实现,且每个浮点值算子与 CPU 参考实现的绝对误差均在 1.8e-6 以内。TorchMorph 以 MIT 许可证发布,见 https://intcomp.github.io/tm。
程序性视频语言模型必须从相同的视觉证据中解决异构任务,包括动作识别、预测和程序预测。密集Transformer解码器在跨任务间共享相同的前馈网络,这可能导致任务行为相互纠缠,并使受控能力扩展变得困难。稀疏专家混合(MoE)解码器提供了条件计算能力,但基于token的学习路由与任务级程序性目标并不自然对齐。我们提出MoTE(Mixture of Task Experts),一种将大语言模型前馈网络转换为任务特定专家、同时保持多模态骨干网络共享的解码器架构。每个样本遵循一条样本级任务路由,因此活跃的任务专家计算量独立于所存储的任务专家数量。我们将这一设计实例化为VideoLLM-MoTE,并使用显式任务路由在五个COIN基准上对其进行评估。该五专家模型每个样本激活约2B的LLM参数,其平均top-1准确率高于近期VideoLLM基线方法。在相同专家拓扑下,它优于密集的全专家激活和学习的稀疏路由控制方法。这些结果表明,任务结构化路由为多任务视频语言学习提供了一种可解释且计算高效解码器替代方案。
我们研究Station中的自主数学发现。Station是一个开放世界多智能体环境,来自不同模型系列的AI智能体在没有中央协调器或脚本化流水线的情况下追求共同的研究目标。智能体自行选择研究方向、开展实验、相互协作,并构建共享的科学文献。在AlphaEvolve目录中的12个构造问题以及另外两个案例研究中,Station在五个问题上取得了相对于既有文献的新结果:有限域Kakeya集的一个新的无限族,11维空间中新的精确604点亲吻构型,离散化Kakeya针和符号不确定性问题的新的纪录,以及Erdős最小重叠问题的一个显著改进的下界。智能体还发现了Book拉姆齐数的新的无限族。重要的是,智能体不仅产出数值构造,还产出了解释这些构造如何运作的定理与分析,使结果更具可解释性,也更便于数学家在此基础上进一步研究。我们发布了所有原始智能体对话、证明和验证代码,为这些发现是如何产生的提供了透明的记录。
大语言模型在代码生成方面表现出色,但竞争性编程暴露了一个持续存在的失败模式:现有的多智能体流水线将工作分配给通用的规划者、编码者和调试者角色,并将算法技术的选择完全交由主干模型处理。我们提出了MARS(专用大语言模型的多智能体中继,Multi-Agent Relay of Specialized LLMs)框架,这是一种纯提示框架,其中每个智能体都是特定主题的专家——涵盖动态规划、图论、字符串、几何等——并通过基于算法理论语料库的检索增强生成提供支撑。给定一个问题,检索模块会选出一小支相关专家团队;一名初始编写者生成一个初步的C++17解决方案,随后每一轮都在沙箱中针对公开示例运行候选方案,由当前活跃专家决定保留、修复或移交草稿,并将结构化数据包转发给下一位专家。最后,通过一次基础设施修复过程来规范化样板代码。在CodeContests测试集上使用Gemma 4时,MARS的通过率达到0.624±0.006,每项任务记录2.3个流水线阶段(较直接提示提升14.4个百分点),以3.3倍更低的墙钟时间成本缩小了与CodeSIM(0.731)之间的大部分差距,且每项任务的词元消耗方差显著更小。源代码可在GitHub上获取:https://github.com/fckand/mars。
世界动作模型(WAMs)通过建模观测的演化过程来提升机器人控制性能,但在测试时生成未来观测会带来显著的延迟。Fast-WAM省去了这一过程以提高效率;然而,我们的对照实现表明,Fast-WAM的泛化能力低于考虑未来信息的替代方案,尤其是在机器人演示数据稀缺和分布外场景下。为弥合这一差距,我们提出了**LAWA**,一种WAM架构,利用紧凑的潜在动作作为未来意图的可操作表示,从而在无需生成未来观测的情况下实现高效的测试时未来想象。具体而言,一个通过免动作预训练增强的离散分词器生成以操作为中心的码本目标。LAWA将锚定于这些目标的连续潜在状态与可执行动作块联合去噪,同时在推理时省略未来视频分支。在RoboCasa上,LAWA在少样本和全量数据设置下分别取得了65.6%和80.8%的最先进平均成功率,相较于对照的Fast-WAM基线分别提升了9.6和4.5个百分点。同时,它保持了与对照的Joint-WAM变体相当的性能水平,而推理延迟降低了42.9%。LAWA还在LIBERO-Plus上展现了具有竞争力的零样本鲁棒性,并在真实世界任务中表现出更优的性能。这些结果表明,未来想象不应被舍弃:以紧凑潜在动作保留这一能力,可以在性能、泛化和延迟之间实现有效的权衡。代码和模型将公开发布。