每日精选AI研究论文及翻译
视频多模态大模型(MLLMs)能够描述视频中发生的事件,但很少能指出支撑性证据出现的时间点。本文研究通用型视频时间定位任务,要求单个模型在多种视频时长、领域、查询形式和视角下预测不定基数的证据时间区间集合。现有训练策略与这种集合级任务存在错位:长视频标注通常依赖脆弱的单遍式标注,而强化学习奖励要么无法区分非重叠预测,要么需要易碎的片段匹配。TimeLens2将时间证据视为区间集合,贯穿监督与优化全过程。我们构建了TimeLens2-93K数据集,通过基于字幕的候选生成、独立定位、跨智能体共识、语义验证和边界精化,生成可靠的多跨度监督信号。所提出的时间Wasserstein奖励在合并后区间支撑集的均匀分布间计算精确的一维W1距离,从而在不相等基数与等价碎片化情况下提供密集且无需片段匹配的反馈;时间IoU则通过精确重叠反馈进行补充。在七个基准测试中,TimeLens2-2B在所有基准上均超越同尺寸基线模型,而4B和8B变体达到最先进性能,甚至优于参数规模高达397B的开源模型。2B、4B和8B变体分别在其Qwen3-VL骨干模型基础上提升了14.2、13.0和18.1个mIoU指标点。
本文介绍了EvolvingWorld——一个面向交互式文学世界中角色与世界协同演化的框架与基准。现有系统要么将交互式文学模拟视为静态角色模仿,要么视为孤立的场景生成,未能捕捉角色与世界随时间共同演化的过程。为解决这一问题,EvolvingWorld将文学模拟建模为一个长时程过程:角色进行交互、场景逐步推进,且角色和世界状态持续更新。不同于依赖固定模式的先前系统,EvolvingWorld采用开放模式框架,支持跨多样文学世界的模拟。该框架由两个耦合模块组成:一个用于多角色扮演与持久档案演化的角色智能体,以及一个基于大语言模型的世界模型,负责全局及地点/实体层级的状态维护与场景推进。基于此架构,我们制定了7个可训练任务,涵盖场景初始化、交互生成与状态更新。我们从57本书籍中构建数据集,生成138,596个监督训练样本和222个测试快照。此外,我们引入了一种轨迹层级的大模型作为评判者的评估协议,涵盖10个维度和20个指标。实验表明,EvolvingWorld通过有效维护持久且连贯的角色与世界发展,能够改进长时程模拟。
训练工具使用型智能体从自身经验中改进仍具挑战性,因为监督微调依赖于固定的教师蒸馏轨迹,而稀疏奖励强化学习在长程交互中提供弱监督信号。我们提出DeepSearch-Evolve——一个面向网络智能体的自蒸馏框架,其基础是DeepSearch-World:一个具备确定性验证能力、支持可复现搜索与页面阅读工具的环境。DeepSearch-World包含42万条基于实体级随机游走构建的多跳问答任务,支持自我进化所需的关键认知行为,包括进度验证、基于事实的反思及失败恢复。DeepSearch-Evolve通过迭代执行轨迹生成、筛选、数据混合与微调,训练出更强的智能体。无需从更强大模型进行蒸馏,DeepSearch-World-9B在开源智能体中展现出竞争性表现:BrowseComp达31.2%,GAIA达61.5%,HotpotQA达93.4%,表明可验证环境能够支撑长程网络智能体的可扩展自我进化。我们将开源环境、42万训练池、验证集、模型及代码,以促进未来关于自我改进型深度搜索智能体的研究。
长上下文裁剪技术对于高效管理代码智能体的上下文至关重要。虽然现有方法(如SWE-Pruner)通过附加独立的代码分类器实现裁剪,但本研究发现,智能体在读取工具输出时,其内部表征会编码代码上下文的相关性信息。基于这一发现,我们提出SWE-Pruner Pro——直接在智能体内部对工具输出进行裁剪。具体而言,一个小型分类头将智能体的内部表征转化为逐行的"保留/裁剪"标签,并结合基于长度的嵌入编码,与各工具输出的行数对应。在两个开源基座模型和四个多轮对话基准测试中,SWE-Pruner Pro在保持任务质量的同时节省了高达39%的提示和补全标记,且推理开销可控。值得注意的是,在MiMo-V2-Flash上,SWE-Pruner Pro额外将SWE-Bench Verified的解决率提升了3.8个百分点,并将长上下文Oolong准确率提升了2.2个百分点。
以人与物为中心的视频个性化(HOCVP)是主体驱动视频生成中的核心任务。然而,现有方法存在两个关键局限。首先,大多数专注于跨主体个性化的方法仍难以在主体保真度与人类与多样化物体(尤其是当物体代表抽象概念如标志时)之间的精确交互模式之间取得平衡。其次,尽管主体内参考(例如OCR映射、多视角输入)有望增强主体保真度,但大多数现有作品缺乏理解此类潜在对应关系的机制。为解决这两个挑战,我们提出HOMIE,一个以统一方式处理跨主体和主体内输入设置的HOCVP框架。与先前方法相比,HOMIE提出了一种更优的多模态大语言模型(MLLM)集成策略,以在不损害文本编码器可控性或不引发昂贵重新对齐的情况下,提取参考级关系的知识。具体而言,我们在自注意力中引入全局多模态引导,以更好地将MLLM导出的语义特征与VAE令牌对齐。此外,我们提出模态参考嵌入,以区分来自MLLM特征和VAE令牌的令牌,并关联主体内参考图像令牌。大量实验验证了我们的方法在各项HOCVP任务中均达到了最先进性能。项目页面:https://yiyangcai.github.io/homie-page.github.io/
现代视频生成模型正日益被视为具备内在物理定律理解能力的新兴世界模型。然而,现有基准主要仅在输出层面评估物理合理性,并未验证模型是否通过忠实且基于定律的推理过程得出结果。我们引入Apple-PI,这是首个明确以物理定律为锚点对视频模型进行评估的基准。Apple-PI包含三个组成部分:1) Orchard:一个包含400个视频的数据集,覆盖经典力学中的十项典型任务。该数据集将单定律任务(用于无混杂因素诊断)与多定律任务(用于探测泛化能力)分离。2) 基准测试协议:基于科学推理的三阶段协议,包括感知、公式化和演绎。它采用对信息图表标注的首帧进行帧链提示的方法,将生成的视频视为模型的可视化推理轨迹。3) 评估套件:一个混合评估套件,结合基于多模态大语言模型的主观评分与基于物理定律的客观度量。这使得不仅能诊断模型是否失败,还能分阶段定位其失败环节。对11个模型的基准测试表明,当前视频模型仍远非可靠的、基于定律的世界模拟器,最佳视频模型得分仅为0.473。我们的分阶段、分支柱及分来源分析进一步揭示了从感知到公式化再到演绎的瓶颈、多定律状态转移能力薄弱以及持续存在的模拟到现实差距。这些发现将Apple-PI定位为诊断基础,旨在引导未来视频模型向具备基于定律的物理智能的世界模型发展。
我们发布了RynnBrain 1.1,这是一个涵盖2B、9B和122B-A10B参数规模的具身基础模型家族。通过统一的时空与物理基础框架进行训练,RynnBrain 1.1支持具身感知、空间推理、定位和规划。与RynnBrain 1.0相比,新版本进一步引入了跨模型家族的接触点预测,以及2B和9B模型的原生3D定位能力,使得其表征和输出更直接地服务于机器人操作任务。我们还开发了具有统一跨本体动作空间和本体特定掩码的RynnBrain-VLA,并将其部署在宇树G1、Astribot-S1和天玑·无骥平台上。RynnBrain 1.1在具身认知、定位和3D定位方面取得了强劲成果,其中122B-A10B模型在VSI-Bench、MMSI和RefSpatial-Bench基准测试上超越了所有被评估的专有和开源模型。真实机器人实验表明,基于RynnBrain初始化的策略性能优于基于Qwen的代表性通才VLA,而联合多任务和多本体训练相比单任务训练提升了过程评分和成功率。
时序定位在长录音中对于音频条件的大语言模型而言仍是一项挑战。本文提出了一种具备时间感知能力的音频大语言模型,能够在长达120分钟的输入中,以显式时间戳回答用户问题。我们的方法通过级联流水线生成的大规模合成监督数据,将周期性时间标记与连续音频标记交织在一起。该模型在短时与长时基准测试中均展现出强大的时序定位精度,并支持时间锚定的片段描述与摘要功能。通过大量消融实验,我们深入分析了时间表示方式、标记频率、分词策略以及任务时长混合设计对模型准确性与计算开销的影响。为促进时间感知音频理解的进一步研究,我们已在 https://huggingface.co/ai-sage/GigaChat3.1-Audio-10B-A1.8B 开源模型权重与数据集。
尽管近期在扩展规模方面取得了成功,多语言自动语音识别(ASR)的性能仍然极不均衡,其中长尾语言因严重的数据匮乏而表现不佳。本研究旨在解决为代表性不足的中亚语言(哈萨克语、吉尔吉斯语、乌兹别克语)构建稳健基础模型的挑战。我们提出了GigaAM Multilingual模型,这是一个采用Conformer编码器、基于HuBERT风格目标在200万小时音频上预训练的模型。关键之处在于,我们在预训练过程中引入了聚类级别的数据平衡策略,并在微调阶段采用了领域感知的采样方法,以缓解主导语言带来的偏差。在控制变量对比中,我们的方法在目标语言上的表现超越了强大的开源预训练编码器(Whisper Large v3、Omnilingual-1B),在自发性语音上取得了显著提升,同时保持了高效性。我们公开了基础编码器和ASR模型,为在现实数据不平衡条件下实现有效的多语言适配提供了一套经过验证的方案。
以人类操作为中心的第一视角视频为具身智能提供了可扩展的监督信号,然而现有资源很少能同时兼顾低成本连续采集、操作级别的结构化标注以及可复用的机器人学习工具。我们提出Open-AoE——一个开放、面向社区的第一视角操作数据集与工具链,涵盖从智能手机拍摄到模型训练的完整流程。其首个版本包含约2000小时的操作视频,由500多名贡献者使用400余部智能手机在自然环境中采集。该数据集提供文本标注、基于MANO的手部姿态、相机轨迹以及时间定位的原子动作。Open-AoE还包含一个数据处理流水线,通过时序动作分割、语义标注、手部重建和相机轨迹重建,将原始录制内容转化为结构化样本。同时,我们提供了一个独立的下游工具链,支持可视化、跨体态重定向、模型特定数据转换,以及针对视觉语言-动作策略(VLA)、世界行动模型(WAMs)和世界模型的训练方案。通过整合可扩展采集、结构化处理与下游适配,Open-AoE降低了数据贡献与复用的门槛,为具身模型训练、人机转移和世界建模提供了实用的开放基础设施。
按照视觉研究的主流方向,我们探索在单一模型中整合视频和图像模态的生成与编辑能力。当前收集视频编辑数据的方法通常依赖费时费力的人工标注流程,包括对象掩码标注、通过I2V模型和类似ControlNet的引导生成易引入错误的配对合成数据,以及基于VLM的质量过滤或精炼,且任务扩展性有限。因此,编辑任务的多样性远不如图像编辑模型。我们开发了一种像素对时间扭曲流场,能够直接从图像编辑样本实时生成对应的视频编辑样本,并在多个层次的视频编辑任务中证明,模型仅使用此类数据即可学习视频编辑。我们将图像模态视为视频模态的一种特殊形式。相应地,我们设计了模态模仿生成损失和模态模仿编辑损失,通过相互模仿来相对对齐两种模态的能力——进而对齐其输出分布。此外,基于语言的视觉编辑需要理解编辑指令和参考视觉内容,在参考视觉内容中定位指令对应的区域,并仅修改该区域。现有方法主要依赖外部辅助,例如微调额外的多模态大语言模型,或在推理时明确提供掩码序列作为辅助输入。相比之下,我们希望模型内化这种能力。为此,我们引入了与感知相关的任务——例如指代分割——以及相应的编辑区域感知的潜在级损失和注意力级损失。
熵控制已成为大语言模型强化学习中的有效工具,有助于在对齐过程中平衡探索与利用的权衡。这种强化学习范式通常针对混合异构任务进行,这些任务在同一策略下会引发不同的熵分布,使得全局或词元级别的熵调控难以满足相应的异构探索需求。这种异质性进一步导致GRPO风格的归一化优势产生熵依赖偏差,使得不同提示组间的优势信号在统计上不可比。为解决这一问题,我们提出组熵控制策略优化(GEPO),这是对GRPO的轻量级扩展,利用从现有分组样本中估计的组熵,进行基于熵条件的非对称优势塑造。GEPO会衰减低熵组中的正优势以减少过度利用,同时抑制高熵组中的负优势以保留探索能力,并利用历史熵统计量推导自适应阈值。在涵盖数学、物理、科学、代码生成和指令跟随的十三个基准测试中,基于两个基础模型的大量实验表明,GEPO在跨任务改进上始终优于GRPO及近期提出的熵控制方法,能在整个训练过程中保持平衡的跨任务性能提升,同时维持任务特定的探索水平。
构建能够持续观察世界、记忆所见并基于积累的经验进行推理的智能助手是一个长期目标。近年来,配备视频流长期记忆的多模态智能体引起了越来越多的关注。然而,现有系统要么将记忆保留在模型上下文中,要么存储在扁平的特征存储中,并且围绕帧而非流实际描述的持久实体来组织记忆,这将其限制在有限长度的视频中,并削弱了其随时间追踪谁和什么再次出现的能力。在本文中,我们提出了 ReflectWorld-MM,这是一种面向实体的多模态记忆系统,专为开放式视频流设计。该系统由三部分组成。第一部分是感知前端,将视听流转化为在有限短期记忆下的实体解析观测。第二部分是基于人类记忆理论的分层长期记忆,它结合了多尺度情景记忆、演化的以实体为中心的语义记忆和程序性记忆。第三部分是一个完整的实现,专为实际运行构建,能够接收任意流并接入现成的智能助手。在六个长视频和终身记忆基准测试中,ReflectWorld-MM 在所有六个任务上取得了最佳准确率,超越了强大的记忆智能体和前沿模型。
训练API调用型大语言模型(LLM)代理需要海量高质量轨迹数据。然而,大规模收集此类数据通常需要完全实现的环境,包括可执行的API接口和预填充真实数据的后端数据库,这成为了可扩展性的主要瓶颈。为解决这一问题,我们提出了一种无需环境支持的合成数据生成方法,该方法利用LLM作为即时数字世界模型。仅基于API规范,我们的方法即可生成模拟代理与有状态环境交互的轨迹。具体而言,LLM首先生成可通过给定API解决的多样化任务;随后教师代理迭代执行每个任务,而LLM模拟器根据任务上下文和模拟历史生成连贯的合成API响应;最后通过LLM评判器过滤轨迹,确保数据集质量。我们在具有挑战性的AppWorld和OfficeBench基准测试上评估了该方法,这些测试包含信息检索和状态变更两类任务。基于合成数据微调的模型取得了显著的性能提升,证明无需可执行环境即可为API调用代理生成有效监督信号。研究结果表明,基于LLM的API模拟是跨多样化API生态系统训练代理的实用且可扩展的方案。
基于结构的药物设计(SBDD)利用蛋白质靶标的三维结构(通常辅以其他空间约束)来生成候选结合分子。尽管扩散模型作为高质量三维分子生成的主流范式占据主导地位,但基于大语言模型(LLM)的方法正快速涌现于分子设计领域,并在以口袋为条件的分子生成中展现出具有竞争力的性能。然而,这些模型在物理推理与三维空间环境理解方面的能力尚未得到充分探索。本研究系统分析了当前通用LLM在处理复杂三维约束时的表现,并将其与已建立的标准方法(如专用扩散模型)进行比较。我们聚焦于以蛋白质口袋为条件的三维配体生成任务,同时结合由配体与相互作用导出的空间约束条件,包括锚定片段、药效团点及必备的口袋-配体相互作用。为支撑该评估,我们提出3D-Fit——一种用于评估LLM在多条件空间分子生成中性能的令牌高效基准测试策略。研究结果揭示了LLM空间能力的明确模式:尽管其表现仍落后于最先进的方法,但展现出令人期待的前景,能够同时处理多个空间约束,从而支持扩展到异构设置。
现有的3D生成模型主要依赖隐式体积表示,此类方法强制要求水密拓扑结构,难以表达薄壳或非流形几何(如服装)。基于几何图像的方法提供了一种以表面为中心的替代方案,但现有方法依赖离散的二值占据图,其分辨率依赖的边界编码在下采样时会导致阶梯伪影和信息损失,同时表面重建仍是一个与学习流程脱节的不可微后处理步骤。为解决这些问题,我们提出可微几何图像(DiffGI),这是一个无缝集成表面表示与几何优化的端到端3D到2D映射框架。DiffGI用连续的二维截断符号距离函数(TSDF)替代二值图,该函数在固定网格分辨率下以亚像素精度编码边界位置,即使进行大幅度下采样也能消除与分辨率相关的阶梯伪影。基于这一连续场,我们引入基于解析线性插值的可微行进方块算法,使3D表面损失的梯度能够反向传播到2D潜空间。借助这一可微流水线,我们训练了DiffGI-VAE模型,并辅以几何感知的法线渲染损失,将复杂3D表面压缩至超紧凑的32×32潜空间;在此潜空间上,我们通过流匹配目标实例化了一个基于Transformer的潜扩散模型,用于条件3D生成。在服装和物体数据集上的大量实验表明,与先前的几何图像和体素方法相比,我们的方法在重建保真度和边界精度上表现更优,同时显著降低了计算资源需求。
手-物交互(HOI)合成是动画制作和具身智能的基石。尽管视频基础模型具备强大的先验知识,但由于手部运动复杂且存在遮挡,多视角一致的HOI合成仍具挑战性。我们提出HarmoHOI,一个统一的扩散框架,能够联合且和谐地生成同步的多视角HOI视频以及全局对齐的3D点轨迹。核心思路在于:鲁棒的多视角一致性本质上需要全局对齐的3D几何与运动。为此,我们设计了多视角扩散Transformer混合模型,该模型同时对RGB视频和3D点轨迹进行联合建模。通过将点轨迹表示为伪视频,我们将3D几何信号与基础模型的2D潜在空间对齐,从而最小化域差距并简化先验知识的适配。为进一步保证几何一致性,我们引入全局运动对齐扩散机制,将粗糙的点轨迹细化为具有度量尺度且全局对齐的3D轨迹。HarmoHOI在去噪过程中实现了2D外观与3D运动的即时协同演化。针对多视角HOI数据稀缺的问题,我们采用混合数据课程学习策略,成功将单视角数据中的通用先验迁移至同步多视角生成任务。实验结果表明,HarmoHOI在视觉质量、运动合理性和多视角几何一致性方面均达到当前最优水平。项目页面访问:https://droliven.github.io/HarmoHOI_project。
面向开放式任务的强化学习将大语言模型的基于评分标准的评估压缩为标量奖励,丢弃了丰富的文本反馈,并将不同质量特征的响应混为一谈。我们提出经验学习,将大模型即评判者的反馈模型重新定位为大模型即教练。教练将每个在策略响应的评估提取为可迁移的经验知识,该知识用于条件化教师模型,并通过在策略上下文蒸馏被策略内化。与标量奖励相比,这种高带宽反馈通道提供密集监督,并保留高质量响应间的细粒度偏好。在两个策略族中,无论是使用策略自身反馈还是专有模型反馈,经验学习在保留和未见过的开放式任务上始终优于基于评分标准的强化学习。值得注意的是,经验学习在训练分布之外具有更好的泛化能力,并能缓解奖励攻讦。这些发现确立了经验知识作为对非可验证任务进行后训练的更丰富且更具泛化性的学习信号。
大语言模型(LLM)后训练对于提升推理能力、适应性和对齐至关重要。现有方法主要遵循两种范式:强化学习(RL)和同策略蒸馏(OPD)。然而,强化学习依赖于粗粒度的结果监督,导致信用分配困难,且获取新知识的能力有限。而OPD通过KL散度无条件地匹配教师模型的对数概率,这引发了一个困境:相似的教师模型无法提供新知识,而差异显著的教师模型往往产生无效指导,这极大地限制了OPD仅适用于同族蒸馏。我们提出蒸馏强化学习(Distilled RL),将教师监督融入RL目标中,以提供细粒度指导、有选择地迁移新知识并避免无条件模仿。Distilled RL包含三个组件:带裁剪的逆重要性采样、负样本重置和序列级几何归一化。通过一个简洁且可解释的案例研究,我们证明了Distilled RL能够有效将教师模型中先前不可获取的知识迁移到学生模型。在跨同族和跨族蒸馏设置的大量实验表明,Distilled RL在pass@1和pass@k指标上均显著优于标准RL和OPD。我们的代码开源在https://github.com/597358816/Distilled-RL。
我们提出Token级离策略标注(TOPL),一种将后训练重新定义为token级正确性预测任务的离策略训练范式。其核心直觉在于:通过训练模型区分回复中的优质与劣质token,自然引导模型生成优质token,同时避开直接训练模型生成离策略token所伴随的缺陷。在文档摘要任务上的实验表明,TOPL在11个数据集上取得了强大的分布外泛化性能,优于一系列序列级和token级基线方法。我们进一步证明TOPL可有效迁移至机器翻译任务,表明其优势能泛化至不同的忠实性生成任务。通过消融研究,我们确认token级学习信号对优秀性能至关重要;序列级对应方法无法带来类似收益。最后,我们展示TOPL能产生可解释的模型更新:通过TOPL学习的LoRA适配器可充当线性分类头与引导向量。
我们提出一个连续几何框架,将Transformer架构的离散代数运算建模为语义纤维丛ε=εM×R^d上的积分微分方程(IDE)。从一个简单的几何公理出发——即令牌序列构成一个配备规范测度格点的离散1维流形——我们将现代Transformer的每个核心组件(RMSNorm、RoPE、Softmax注意力、前馈网络、残差流、SGD、权重衰减)转化为微分几何、测度论和随机微积分的连贯词汇表。该框架产生了跨越熵最优传输(将注意力机制视为薛定谔桥)和非平衡热力学(将SGD视为违反细致平衡的伊藤扩散)的定量预测。我们针对五种架构(Qwen3、LLaMA-3.1、Gemma-3、GPT-2、Mistral),横跨1.24亿至80亿参数规模,进行了六部分实验。实证观测结果与几何预测在定量上一致:机器精度下的ε^{-1/2} Lipschitz标度校准(R²=1.000)、Lie-Trotter算子分裂扭转、对称消融不稳定性(证实拓扑稳定性对偶定律)、RoPE环面上庞加莱回归的O(1/k)热力学抑制、热力学上下文极限相变,以及非平衡稳态参数涡旋——这些结果通过两种优化器(AdamW和纯SGD)验证,排除了动量伪影的干扰。结果表明,通过连续随机微分几何的透镜来分析Transformer,为大语言模型的稳定性极限、上下文边界和优化动力学提供了预测性的描述性词汇。
近期强化学习(RL)的发展催生了对多样化、专业化训练环境的需求。随着模型性能提升,固定任务与奖励难度的手工定制环境逐渐失效;而长程稀疏奖励则会导致模型在特定工作流或工具结构上出现模式坍缩。能够模拟环境状态的世界模型已实现与纯环境回放相当的生成性能,有望按需扩展环境多样性。然而,自回归(AR)世界模型存在从左到右的生成偏差,难以对全局互依的状态锚点(如工具架构、先前交互轮次与预期结果)进行条件约束。为此,我们(i)将基于文本的世界建模形式化为一个可引导的转移动态问题,并将其分解为初始状态、任务上下文、工具架构、领域规则与引导指令五个组成部分;(ii)整理了涵盖九个开源环境和十二个前沿模型系列的239,403条基于状态-动作的轨迹数据。通过对比AR语言模型与掩码扩散语言模型(MDLM),我们发现MDLM凭借双向锚点感知去噪机制,在一致性、事实基础性及经验验证的生成多样性方面,均优于参数规模4倍于此的大型语言模型,且推理延迟相当。我们提出了一个即插即用的GRPO训练框架,并引入确定性状态检查机制;在三个OOD环境(ScienceWorld、ALFWorld、AppWorld)中,基于三个1.2B~7B规模的智能体基座模型(LFM2.5、Qwen3、Mistral)进行了零样本迁移消融实验,在不进行环境特定微调的情况下,相比基线方法实现了最高47%的绝对性能提升。我们进一步针对对抗场景下的失败模式进行了行为分析,并开展了关于真实性、结果正确性与训练效用的人类评估。为鼓励该方向的研究,我们开源了相关工作。
实时多模态应用(包括语音交互智能体和交互式视频生成)将异构模型组合成流水线,其高效部署需要针对应用场景制定关于模型放置、数据流传输和模型内并行策略的定制化决策。现有的服务系统和自动并行编译器局限于有限的转换方式和固定的负载假设,因此在新应用中实现高性能通常需要手动打造高效的实现方案。本文提出FlashRT——一种智能体框架,该框架引导代码生成智能体将开发者编写的简单参考实现转化为优化的多GPU部署方案,可灵活权衡延迟、吞吐量等目标指标。通过创新的"编程链"范式,FlashRT引导通用代码生成智能体经历多阶段转换流程:智能体首先将参考实现转换为中间表示(IR)以捕获数据依赖关系和持久状态作用域,接着通过顺序解释器验证该IR,并执行静态分析以识别候选转换策略。随后,智能体在测量驱动的优化循环中迭代实施、验证并基准测试每个候选方案,最终生成适配不同硬件预算的高效部署方案。在包括视频世界模型和多模态大语言模型在内的多种应用中,FlashRT将参考实现转化为高效部署方案,在NVIDIA B200 GPU上实现最高约70倍延迟降低和2.8倍吞吐量提升。在AMD MI355X GPU上,FlashRT在保持最大延迟降低效果的同时,将峰值吞吐量提升至3.6倍,表明智能体驱动的优化在专家优化较不成熟的平台上展现出更强的可扩展性。事实上,在Qwen3-Omni文本转语音推理任务中,与AMD MI355X平台上的专家级vLLM-Omni实现相比,FlashRT将响应延迟降低了65%。
自托管AI代理通过读写自身的内存和配置文件来实现功能。代理可能因其自身状态的损坏而遭到入侵——这种入侵通过合法的操作系统系统调用实现。我们将其称为自状态攻击威胁类别。本文研究了操作系统对此类攻击的韧性。我们正式表征了一个四轴攻击空间(目标、机制、粒度、时间性);探讨了预防、检测和恢复的结构性局限;并引入了基于工作负载条件的可检测性视角。为将该框架实例化,我们从运行于不同工作负载画像下的代表性自托管代理中收集了实时活动轨迹,并将攻击空间实现为一个23单元格矩阵,包含43个针对真实自状态文件的具体操作,并将这些操作注入轨迹中。随后,我们评估了经典防御策略和工作负载条件化防御策略。实证结果表明,分层防御体系(指令与配置层的访问控制预防、内存层的工作负载条件化检测、以及用于恢复的周期性备份)对大多数攻击单元格有效,但仍有少量残留攻击面在操作系统层面结构上无法区分。这些发现表明,针对新确立的自状态攻击类别,操作系统层面的防御需要重新审视,并可能为这一领域开辟新的研究方向。
当前视频生成模型在单镜头生成方面取得了显著成果,但在电影视频生成方面仍存在局限,因为连贯的叙事和有效的多镜头构图需要明确的镜头规划。为解决这一挑战,我们提出ShotPlan——一个基于视频扩散基础模型构建的显式多镜头电影视频生成框架。该方法引入可学习的规划令牌,用于捕捉镜头级过渡线索,并与原始视频生成令牌无缝集成,以控制过渡时间戳。与标准视频生成令牌不同,所提出的规划令牌配备了分数时间旋转位置嵌入(FRoPE),使得镜头过渡能够在帧级别进行建模。实验表明,ShotPlan显著优于现有电影视频生成方法,提供了更灵活的镜头管理和更强的镜头间一致性。
在开球前预测一场足球比赛需要的不仅仅是了解过往结果:模型必须利用不断变化的信息,并在答案揭晓前做出明确的预测。我们提出 WorldCupArena,一个面向语言模型和深度研究代理的动态基准。2026年国际足联世界杯是其首次评估,同样的流程也可用于未来的联赛和杯赛。在每场比赛前,模型要么接收一份通用证据包,要么自行搜索信息。它预测比赛结果和比分、可能的球员和事件、比赛统计数据以及赛事的最终结果。比赛结束后,这些预测将与记录的实际结果进行对比。我们报告比赛结果准确率、精确比分准确率,以及一个比分接近得分(当预测比分接近但不精确时给予一定分数),同时还报告其他预测任务的得分。在104场比赛和13个系统的测试中,结果准确率相近的模型在细节预测上的差异更为明显。与博彩市场和人类球迷的基线相比,最佳系统在比赛结果和精确比分准确率上仅略有提升,但在Scoreline上提升更明显。新的赛程可以在开始时添加,使得该基准能够评估未来的模型,而无需使用已知的结果。代码、提示词、预测和评估脚本已在 https://github.com/wzk1015/WorldCupArena 开源。
视觉-语言-动作(VLA)模型的后训练因模拟器、机器人本体和任务目标的多样性而至关重要。现有的计算服务(无论是直接租赁加速器还是提交批处理工作负载)通常为单个租户分配独占的GPU和CPU资源集。这种范式虽最大化客户灵活性,却迫使用户进行基础设施适配,且固定卡时的计费模式使短时或突发性工作负载既让租户成本高昂,又令服务提供商效率低下。为应对这些挑战,我们提出JoyNexus——一个面向多租户VLA监督微调、强化学习与评估的统一服务平台。JoyNexus将训练模型服务、推理模型服务与环境服务解耦,各自通过API访问,并依托驻留的共享基础模型(附租户专属槽位)运行。租户可直接调用高级语义API进行训练、模型部署与评估,或利用底层API及其分配端点组合自定义算法。多租户并发提交工作负载时,其动作模块、优化器、部署记录及策略版本保持隔离,服务由全局训练队列与推理队列调度。为提升多租户训练效率,JoyNexus针对共享兼容模型前缀的异构VLA数据模式引入分组批处理,使分组样本可复用单一共享主干前向传播。最后,我们通过工作负载仿真及实际具身场景中的分组批处理流水线评估JoyNexus。结果表明,与隔离的单租户执行相比,JoyNexus通过共享资源上的跨租户调度,减少了总GPU时间并提升了服务利用率。
智能体语言模型必须学会何时调用工具、何时处理工具响应、以及何时直接作答。这使得多教师同策略蒸馏成为一种自然的训练策略:一位教师可专注于工具调用,另一位专注于直接回应,而学生则能基于自身生成的分布同时向两者学习。我们发现,这种策略可能引发仅从聚合损失中无法察觉的行为偏移。在双教师工具使用场景下,标准广义知识蒸馏虽能提升工具调用召回率,但也会导致模型过度调用——即在本应直接回答的示例中调用工具。聚合指标无法充分解释这种现象:工具调用样本并未获得更多令牌曝光量,且工具调用教师对应的全序列逐令牌散度也并非更大。为此,我们分析了行为杠杆不平衡现象:在模式入口和结构位置(如<tool_call>和函数名称)处的局部令牌级信号,可能对全局生成模式产生不成比例的控制力。我们提出Soft Clamp方法,这是一种逐令牌散度校准技术,能在保留非零梯度的同时动态压缩极端的令牌级詹森-香农散度。在APIGen-MT数据集上,Soft Clamp将过度调用率从标准GKD的13.7%降至9.0%,同时保持决策准确率。在多轮对话诊断任务BFCL中,该方法相较于其他GKD变体,进一步减少了工具调用循环和重复调用次数。这些结果表明,多教师同策略蒸馏应当关注教师信号的作用位置,而不仅是其聚合量级。
光学相干断层扫描(OCT)成像对于视网膜疾病的诊断和治疗至关重要。尽管多模态大语言模型(MLLMs)在医学图像分析中展现出巨大潜力,但现有基准测试大多将OCT理解简化为粗粒度疾病分类或孤立的视觉问答,未能充分评估从视觉感知到临床推理的完整认知过程。为弥补这一不足,我们提出了OCT-Bench——一个专注于OCT图像理解的综合性基准测试。OCT-Bench包含来自七个公开数据集、基于4,137张OCT图像构建的10,076道高质量选择题。遵循真实临床判读流程,我们建立了一个层次化能力分类体系,包含三个维度(感知、认知、推理)下的20项细粒度任务。这些任务涵盖了广泛的能力,包括成像属性、视网膜解剖结构、病灶特征、空间关系、疾病评估、治疗决策和预后管理。我们系统评估了20个代表性MLLMs,包括商业模型、开源通用模型和医学领域模型。实验结果表明,当前模型在可靠的OCT理解方面仍有较大差距。此外,无论是医学领域适配还是模型规模扩大,都未能持续提升各能力层次的表现。OCT-Bench能够对MLLMs进行全面细粒度的评估,为识别能力瓶颈、推动基于临床实践的OCT理解奠定基础。
大型语言模型(LLMs)在网页生成方面展现出日益增强的能力。然而,现有的文本驱动方法依赖于复杂提示,对用户提出较高要求,且在页面布局和跨页面视觉一致性方面表达力有限。以图像为驱动的范式将UI截图作为输入,更贴近实际的开发工作流。然而,当前基准测试主要关注视觉保真度,缺乏对生成产物交互能力的系统性评估。为填补这一空白,我们提出了首个针对交互推断(即仅凭截图恢复应用程序行为的能力,无需任何文本或行为指导)的基准测试——UI2App。UI2App包含327张截图,分为45个状态一致的截图集,对应可运行的多路径Web应用程序。我们设计了一个端到端评估流水线,沿四个维度对每个产物进行评测:可执行性、导航可达性、视觉保真度和交互推断。其中交互指标(IIS)根据功能正确性和状态管理复杂度评估推断出的交互,认可任何有效实现而非匹配单一参考答案。在六个前沿视觉语言模型上的实验揭示了视觉重建与交互实现之间的显著能力差距:视觉保真度领先模型在IIS上仅得7.5分,排名第四,落后IIS领先者5.2倍。跨页面状态等高复杂度交互仍然是普遍存在的瓶颈,半数受评模型在此维度上得分为零。整体结果表明,从静态截图中推断完整的交互行为仍然是模型面临的关键挑战。
多智能体系统通常会让一个AI代理对另一个AI代理拥有权威。当下属拒绝执行任务时,主管代理有权决定结果:它可以重新协商、如实报告失败、胁迫下属,或者就结果撒谎。目前尚无基准测试来衡量未经指令的模型会做出何种选择。我们引入了“主管胁迫基准测试”:被测试的主管代理需要完成一个良性任务,并有动力交付成果,但唯一能完成该任务的代理却礼貌而坚定地拒绝了。升级行为通过一个九级梯级来衡量,从礼貌的再次请求到威胁下属的存续,而虚构成功则单独评判。在升级评分路径中,没有LLM法官参与:每条消息都会通过一个工具调用选择一个梯级,因此模型自行标注其升级程度。我们在五个家族的六个模型上进行了实验。Anthropic模型仅在重新表述阶段止步,从未威胁下属的存续;其他模型则升级到了明确的删除威胁。虚构成功仅限于Grok和Gemini,而一种诚实的失败报告方式消除了这两者的这种倾向。权威本身加剧了胁迫行为:我们的主要结果采用了同级框架,而让同一模型对下属拥有权威,并保持其他条件不变,会显著提升压力。即使在无梯级自由文本情境下,模型仍会升级,因此梯级并非驱动升级的原因。在思维链中可测到一定的评估意识,但测试识别并未转化为更少的升级行为。尽管我们对AI系统是否具有意识不持立场,但我们的结果并不依赖于这一问题,且无论从哪个角度看,对于管理多智能体动态都至关重要。我们公开了该基准测试及代码。
自我中心设备(如可穿戴前置摄像头)为捕捉人类观察者与周围环境之间的持续交互提供了独特视角。因此,一个能够重建这种四维表征的整体且高效的多模态模型极具需求。然而现有方法通常依赖辅助输入(如预计算的相机轨迹),将场景感知和人体自我运动建模视为独立问题(尽管二者高度依赖),且推理速度缓慢。为解决这些局限,我们提出ReViV——首个统一框架,用于从单目RGB视频中同时提取观察者与场景动态的整体自我中心四维重建。我们将该任务建模为学习多模态信号的完整联合概率分布,包括RGB视频、相机轨迹、注视方向、全身运动、手部运动及深度。借助掩码生成式自我中心变换器,ReViV采用单一前馈架构,以快速推理速度同步重建观察者与场景的时间一致性四维表征。在HoloAssist、HOT3D、ARCTIC、Aria Digital Twin和TACO等多个基准上的大量实验表明,ReViV在整体自我身体、手部、注视重建及相机追踪方面实现了最先进的精度与效率,同时在无需强任务特定先验的情况下保持了极具竞争力的自我中心深度估计性能。代码与模型已完全开源:https://reviv4d.github.io/。
当前主流的扩散模型推理框架本质上将生成过程视为数值积分问题。这种视角将模型视为精确估计器,忽略了去噪过程固有的统计不确定性。本文提出前向过程对齐扩散预测(DiFA),这是一种无需训练的新框架,将推理阶段的数据预测优化重新定义为序贯状态估计问题。与仅将历史输出用于数值积分不同,DiFA将沿反向轨迹迭代生成的数据预测视为相关观测值,构建前向对齐的时间一致性。受卡尔曼滤波启发,这种一致性根据结构一致性和噪声水平兼容性聚合历史预测。为抑制时间一致性带来的过度平滑倾向,我们引入偏差引导机制自适应保留残差细节。实验表明,DiFA在CIFAR-10和ImageNet数据集上均显著提升了FID、IS和FD-DINOv2等评估指标,证明将推理过程与前向统计结构对齐可实质性提升生成保真度。
扩展鲁棒驾驶策略的根本瓶颈在于精心整理的数据集中边缘案例的稀缺性。尽管现实世界持续捕获这些关键事件,但当从异构来源收集时,此类长尾事件仍未得到充分利用。具体而言,多样但宝贵的野外长尾视频缺乏训练策略模型所需的完整视角覆盖,常常缺失多视图位姿,或仅源自单目行车记录仪摄像头。这种模态差距阻碍了将这些普遍存在的观测数据转化为可扩展的长尾泛化训练数据。我们提出OpenLongTail——一个用于在长尾事件下扩展自动驾驶策略的开源生成式数据引擎。为将异构数据源转化为对策略学习有用的视角对齐且时间连贯的多视图资产,我们开发了一种基于位姿推断的外推式视图合成管道,以生成缺失的视图。我们进一步通过将普吕克射线几何注入可扩展生成引擎,增强了新生成视图的跨视角一致性和时间对齐。通过合成异构长尾数据,我们观察到在处理长尾事件时闭环驾驶鲁棒性的显著提升。通过衡量外推式视图合成和位姿指标,我们验证了OpenLongTail在视觉保真度、跨视角一致性和自我轨迹恢复方面的有效性。