每日精选AI研究论文及翻译
通用语言模型能够进行推理和知识综合,但复杂工作还需要与文件、信息源和可执行代码的持续交互,同时要求状态维护、故障恢复和可验证交付。我们将这种能力称为工作能力:即朝着现实世界目标持续、可验证地取得进展。Apodex 1.1 沿两个互补维度发展这一能力。环境扩展提升了可执行文件、搜索和代码环境的多样性与可验证性,而智能体协同扩展则训练智能体分解长周期任务、委派并行工作、整合异步结果并重新规划。共享执行框架与 AgentOS 在工具和智能体之间维护任务状态与溯源,训练过程将环境轨迹和协同痕迹转化为可靠行为。在复杂的专业工作、金融、科学研究、数学、编码和搜索等场景中,Apodex 1.1 尽管所用模型远小于许多前沿系统,仍达到了领先的性能水平。350 亿参数的 Apodex 1.1 Mini 更以可本地部署的形态保留了强大的工作能力。这些成果将智能体智能植根于随时间推移完成的有用且可验证的工作之中,推进了我们构建面向宏大长期任务的重型求解器(Heavy-Duty Solver)的目标。
我们提出了 EchoWM,一种用于可进入生成式媒体的全模态世界模型,能够响应连续导航并同时联合生成 720p 视频、环境音、音乐和语音。我们将交互围绕相机意图进行组织:在第一人称场景中,相机意图指定观察者的运动;而在第三人称场景中,相机与角色之间的动态从数据中学习,无需视角专用控制器。离散命令和连续姿态被映射到共享的度量尺度相对六自由度(6-DoF)轨迹,并通过数据集级校准来保持跨异构数据的运动幅度。为了联合学习视听生成与轨迹控制,我们构建了一个互补数据引擎,并采用渐进式训练随后进行自回归后训练的方式,以支持长时程生成。大量评估表明,该模型在公开世界模型基准上实现了强大的轨迹跟随能力和较高的视觉质量,支持跨多种主体的第一人称和第三人称交互,并在长时程生成中保持环境音与语音的同步。
电商直播要求对嘈杂、时间上延展的流媒体进行全模态理解,其中商品事实分布在语音、视频帧、商品图片、叠加文本和用户查询中。我们提出TLive-Omni,一种面向直播电商场景的全模态理解模型。它将图像、视频、音频和文本输入映射到统一的表示空间中。针对长时直播流分析,我们引入了Per-vGrid,一种带时间戳的令牌组织形式,将每个视频网格与其时间上对应的音频分组在显式边界令牌内,以促进时间对齐。我们设计了一种三阶段监督训练方案,从全模态感知到指令跟随响应,逐步培养直播电商理解能力。随后我们提出Faithful-RFT,一种强化微调阶段,在满足实时性需求的同时进一步提升回答忠实度和表达质量,直接使用任务可验证的反馈对最终响应进行评分,而非在滚动生成过程中优化推理式探索。此外,TLive-Omni由面向场景的原子能力分类体系和紧凑的数据生产引擎支撑,该引擎将直播电商的音频、图像和视频流转换为语音识别、说话人分析、商品视觉定位、文本识别、时间定位、视频密集描述和全模态问答等任务的训练信号。为实现可扩展训练,同步长度分组采样器在保持各工作节点负载相当的同时减少填充,而轻量级动态采样策略以近乎零奖励方差重新生成滚动组,从而为GRPO保持有意义的相对优势。在电商直播基准上的实验表明,该模型在直播电商领域任务上表现强劲,同时在通用基准上展现出优异的泛化能力。
现有的图像编辑框架主要遵循文本到图像扩散模型的训练范式。然而,将这一范式扩展到图像编辑时,暴露出两个固有的不一致性:具体而言,对编辑概念粒度的关注不足,以及稀疏监督信号导致的训练效率低下。为解决这些问题,我们建立了一个包含超过1000个细粒度编辑概念的综合层次化分类体系,并通过改进的合成框架构建了ConceptEdit-12M——一个包含1200万高质量编辑对的大规模数据集。这种基于库的方法有效纠正了生成数据的分布坍缩,同时保证了较高的数据保真度。此外,我们提出了一种密集监督训练策略,将多个互不干扰的概念合成为单个图像对。通过提供更丰富的学习信号,该策略显著提升了训练效率和整体模型性能。训练结果验证了我们的策略,显著优于先前工作。最后,我们提出了ConceptEdit-Bench,一个细粒度的评估套件,旨在广泛真实世界场景中诊断模型能力。
随着设备端大语言模型智能体演化为个人助手,移动操作系统已成为这一范式的重要测试平台,对其能力进行严谨评估至关重要。然而,现有基准测试分为两类,且各有其关键盲区:以图形用户界面为中心的基准测试仅检验表层屏幕操作,却忽视了后台工具使用和长程规划能力;而静态函数调用基准则依赖离线API匹配,脱离了真实的运行时约束。为弥合这一差距,我们提出了MobilePA-Bench——一个交互式、有状态、以工具为核心的基准测试,用于评估移动规划智能体的工具调用与规划能力。MobilePA-Bench运行于可执行的沙箱环境中,该沙箱维护实时应用数据库并返回结构化反馈,涵盖13个功能领域和212个逼真的移动工具。除基础工具使用外,它还从一个中央规划智能体的角度,沿三个高级维度进行评估:(1)~子智能体协作——将复杂任务分解并委派给具备专门能力的子智能体;(2)~记忆使用——回忆已存储的记忆、用户画像和过往偏好以解析隐含请求;(3)~技能使用——调用预封装的复合技能,而非从零规划每一步。大量实验表明,当前前沿大语言模型在移动场景中仍不可靠:在严格的工具排序、权限限制和意外运行时错误条件下,性能急剧下降。通过将交互式函数调用沙箱与基于证据的验证相结合,MobilePA-Bench既可作为实用的诊断基准,也可作为智能体强化学习的交互式基础——加速开发可靠的移动智能体。
语言模型是顺序处理器,但长时程智能体行为需要超越模型权重和活动上下文的外部信息与计算。Prime Agent是一个开源框架,用于长时程评估和编码智能体工作流。持久化IPython REPL遵循递归语言模型抽象,实现程序化上下文处理和测试时计算,而持续框架在轨迹间保留历史、记忆、技能、提示词和子智能体规格。递归子智能体通过智能体间直接通信进行协调,智能体视图允许人类检查和管理由守护进程支持的会话。Prime Agent标准化了执行、恢复、验证和资源核算,同时将策略构建留给模型。这种低摩擦、高表达力的界面防止框架故障演变为模型故障,使测量更接近模型真实的最大潜在能力。Prime Agent将ARC-AGI-3 RHAE Best@1从30%提升至95.5%,并在长上下文编码、GPU内核生成、模拟器构建和自主nanoGPT速通方面达到或超越原生及主流框架。在《异星工厂》中,我们发现精炼机制支持持续的技术进步,而专用子智能体能够实现并行化工作。代码可在https://github.com/PrimeIntellect-ai/prime-agent获取。
尽管文本到3D生成技术发展迅速,但在低推理成本下实现高几何保真度仍然具有挑战性。现有的文本到3D方法要么自回归地解码离散形状标记,要么利用扩散模型或流模型迭代细化全局3D表示。然而,自回归解码是顺序进行的,无法修正错误;而扩散模型和流匹配模型需反复处理完整表示,使得高质量生成的成本越来越高。本文提出Block3D,一种分块扩散框架,它将离散形状标记序列划分为连续块,自回归地生成这些块,并对当前块内的所有标记进行联合去噪。为缓解误差累积,我们引入置信度引导的块内修正,在每块定稿之前对低置信度标记进行修正。在TRELLIS-500K的留出集上,Block3D将平均端到端生成时间从25.71秒降至4.99秒,相比微调的自回归基线实现了5.15倍加速,且不牺牲几何保真度。
世界动作模型(WAMs)通过将未来世界演化纳入动作生成来改进规划,但现有方法为每个场景分配固定的想象预算。我们提出RISE(通过选择性推演精炼想象,Refining Imagination through Selective Rollout),一个系统级的自适应想象框架,根据持续推演的预期规划收益做出顺序化的推演/停止(Roll/Stop)决策。在每一步中,潜在评估器(Latent Evaluator)估计当前前缀所揭示的风险以及若想象继续则规划可能改进的程度,同时推演门控(Rollout Gate)将该预期收益与额外计算成本进行权衡。由于真实的驾驶日志仅暴露一个已实现的未来,我们进一步构建CounterDrive——一个包含多样结果和风险水平的反事实数据集,以丰富未来动态并提供局部化的风险监督。每个保留样本均经过专家验证和标注,涵盖轨迹有效性、事件起始和因果类别,为安全关键的世界建模研究提供可复用资源。在NAVSIM和nuScenes上的实验表明,RISE在减少不必要推演的同时实现了最佳的整体规划性能,额外的迁移结果支持其跨WAM架构的即插即用通用性。
用户表示学习在真实工业场景中的扩展通常通过增加用户数量、行为序列长度和模型规模来实现。然而,现有方法面临两大挑战:(i) 十亿级容量规模下原始数据扩展的瓶颈,因为更大规模的原始文本用户行为输入所对应的性能增益逐渐递减,而这一瓶颈可以通过词元化来缓解;(ii) 缺乏关于词元化配置应如何随数据规模扩展的定量分析。在本报告中,我们提出用户行为稠密化定律,用于刻画数据规模与最小充分词元化容量之间的定量关系。首先,我们在十亿级支付宝数据集上开展了原始数据与词元化数据扩展对比的初步研究,揭示了原始数据扩展的瓶颈以及词元化所带来的持续增益。为推导不同数据规模下支配最小充分词元化配置的扩展规律,我们结合理论分析和系统性实验,总结了相应的定量扩展模式。我们发现,最小充分词元化容量的对数与以词元数衡量的输入数据规模的对数之间近似呈线性关系,且扩展斜率随词元化方法和数据源的不同而系统性变化,反映了表示空间冗余和源内唯一性的差异。在该定律的指导下,我们进一步提出了 ALGN——一种自适应变长词元化方法,可改善容量分配。跨多种数据源、词元化方法和下游任务的大规模实验证明了用户行为稠密化定律的泛化性和可靠性,为大规模用户表示学习中的词元化配置选择提供了实用指导。此外,ALGN 的性能优于现有基线方法。
交互式世界模型必须跟随用户的动作、记住已展示的场景,并实时流式生成。这种张力是结构性的:控制需要短视界,记忆则需要无界视界。ReWorld在训练时将二者分离,并在推理时加以约束。混合逐头注意力窗口将大多数注意力头限制在近期,而一小部分全局头则关注全部历史;随机头路由确保任一能力不会绑定到特定注意力头上;随机分块丢弃使稀疏历史处于分布内。在推理时,全部历史在固定预算下存续:一个有界KV缓存,由姿态索引的地标库支撑,模型从中检索最接近当前姿态的地标。度量尺度对齐的数据引擎将八个数据源——虚幻引擎渲染的飞行穿越、游戏漫游和真实世界视频——置于同一物理动作尺度上,使每次按键在每个数据源中移动相机相同距离;回文轨迹提供了记忆训练所需的回访证据。限于LoRA适配器的分布匹配蒸馏将采样压缩到四步:一个主干同时服务高保真多步模式和实时交互模式,以704×1280分辨率流式生成照片级真实、游戏风格和风格化世界的视频。在涵盖动作跟随、长时程回忆和视频质量的三轴协议下,与六个最近的交互式世界模型相比,它取得了最佳的控制保真度(11.95°旋转误差和最佳的相机运动一致性)以及最佳的生成质量;在一分钟的往返展开(64秒,384个潜变量)中,其固定的12块缓存仍能重建起始视图——而此时滑动窗口早已逐出证据,全KV注意力也已内存耗尽。
大语言模型(LLM)的策略优化(Policy Optimization, PO)面临稳定性与探索性之间的权衡,目前通过动作侧的策略KL正则化器(Policy-KL regularizer)来调节。这使实践者陷入两难困境:保留Policy-KL会约束响应行为并消耗动作侧的探索预算,而放弃它则使优化过程缺乏显式的漂移控制。我们提出一种替代方案,通过将正则化移至输入侧来打破这一困境。随着训练的进行,当前策略所导致的训练查询分布会不受约束地偏离其RL前的参考分布。具体来说,环境正则化策略优化(ERPO)引入了一个查询KL(Query-KL, QKL)项来约束这种查询分布偏移,同时引入一个基于数据集静态参考的逐查询权重,该权重使每次查询更新偏向于参考分布下典型的查询。QKL梯度严格通过查询似然传播;策略梯度估计器所使用的响应得分函数不出现在QKL项中,因此QKL不会对响应分布产生直接的梯度压力——从而保留了探索性。ERPO可无缝接入GRPO/PPO/REINFORCE风格的流程,且无需额外的前向传播。在六个数学推理基准上,ERPO替代了标准Policy-KL正则化器,同时实现了对查询分布漂移的有效控制,在高温解码和长时程训练下提供了更强的准确性和显著更稳定的行为。我们的源代码可在 https://github.com/alibaba/ERPO 获取。
开放式真实世界交互允许多种有效行为:智能体可以直接回答、请求澄清、提供进度更新或在行动前进行确认。这种灵活性打破了基于分组的强化学习(group-based RL)背后的一个核心假设:在同一分组内进行比较的轨迹(rollouts)不再保证行为上具有可比性。因此,奖励模型对交互风格的偏好可能扭曲相对优势(relative advantages),并将优化引向奖励偏好行为而非符合上下文的行为。我们将此形式化为奖励公平性问题,并提出ARC(Advantage Regularization via Conditioning,条件化优势正则化),一种训练方案,通过策略条件化的轨迹分组(strategy-conditioned rollout grouping),结合混合奖励(hybrid rewards)与熵正则化(entropy regularization),恢复更公平的相对比较。我们在所提出的\inter框架中研究ARC,该框架是一种新颖的响应式、可引导且执行感知的用户-智能体交互范式,将用户可见的通信与潜在推理和工具使用解耦。\inter还提供了构建\inter-86K所需的标注与蒸馏流水线,\inter-86K是我们用于监督训练和强化学习训练的策略标注训练语料库。实验上,ARC显著增强了核心τ/τ²工具使用基准的性能,而\inter将首令牌生成时间(time-to-first-token)从4.91秒降至1.27秒(相较于思维式基线)。这些结果共同表明,开放式交互学习中的核心瓶颈不仅在于智能体如何获得奖励,更在于其行为是否首先得到公平的比较。ARC的实现和\inter-86K训练数据将予以发布。
近年来,大型语言模型(LLMs)可作为编码智能体,根据自然语言请求构建完整游戏。游戏开发尤为严苛,因为程序逻辑、视觉与音频内容、界面、交互和可玩性必须在单一可执行产物中协同运作。因此,衡量这一能力需要同时评估游戏产品和开发过程。现有基准测试往往通过评估最终产物或孤立的开发阶段来检验LLM的游戏开发能力。我们通过对完整的人机开发轨迹进行分析,识别出三个共同覆盖编码智能体游戏开发生命周期的阶段:初始游戏生成、缺陷诊断与修复,以及多轮优化。为此,我们引入GameXpert-Bench,将三个生命周期阶段具体化为三个互补的基准测试轨道。GameGen评估在空工作区中根据单一请求生成完整游戏的能力。GameFix评估在缺陷被报告或留给智能体自行发现时的诊断与修复能力。GameOpt评估通过以用户与智能体之间的真实开发轨迹为基础的请求链所实现的累积优化能力。我们通过实际游戏交互、确定性行为测试或带回归检查的最终产品标准来评估每个轨道。该基准套件包含11个游戏类型的97个生成任务;来自50个经人工验证的游戏关卡、每个关卡含19–27个注入缺陷的100个修复任务;以及包含六轮、102个请求的17条优化链。在三条轨道中,当前智能体在生成可玩的游戏基础和实现明确需求方面,比在发现缺陷、验证运行时行为以及保持跨变更的功能一致性方面更为可靠。
最近的智能体基准测试越来越倾向于将评估嵌入可执行环境中,涵盖从代码修复到网页导航、应用API和函数调用等场景。然而,完成代码之外的重要工作需要的不仅是生成看似合理的响应或有效的工具调用:智能体必须通过多轮交互收集缺失信息,遵循领域策略,协调相互依赖的工具,并在不产生附带影响的情况下实现正确的持久状态转换。在本文中,我们介绍了Thinkingbox,一个用于工具-智能体-用户交互的沙箱环境,提供隔离的MCP兼容工具会话、完整的执行轨迹以及基于终端后端状态的结果评估。基于该沙箱,Thinkingbox-bench包含了507个策略条件化工作流,覆盖零售、酒店、汽车保险、新银行内部IT以及咨询IT/人力资源支持等多种场景。每次尝试都通过任务特定的可执行检查进行评估,这些检查接受有效轨迹,同时拒绝错误、缺失或多余的效果;指定任务还会额外检查最终响应的必要属性。在专有模型和开放权重模型中,最强模型达到了65.36%的pass@1,但pass^20仅为25.25%。此外,许多失败的试验表现出干净的终止和有效的状态改变动作,这表明响应或工具调用级别的信号并不能清晰反映端到端任务的完成情况。Thinkingbox-bench揭示了一个巨大差距:偶然找到成功轨迹与可靠完成有状态业务任务之间的差距。我们已发布Thinkingbox和Thinkingbox-Bench:https://github.com/microsoft/thinkingbox
以低成本服务大型语言模型日益意味着发布既结构压缩到其参数的一小部分、又量化到4比特的模型。这些步骤共同削弱了推理、数学、编码和长上下文行为,以至于需要在部署前进行恢复或愈合阶段。默认的量化感知训练(QAT)方法将压缩并量化后的模型重新拟合到硬标签;在我们的流程中,它收敛缓慢,并在越过峰值后便崩溃。我们转而采用量化感知愈合(QAH)。由于结构压缩的模型从未在全精度下独立训练,其bfloat16检查点是对原始模型的蒸馏恢复近似;因此QAH直接从未压缩的原始模型中蒸馏4比特学生模型。在GPT-OSS 120B到60B再到MXFP4的流程中,QAH学生模型在9个基准测试中的7个上达到或超过其bfloat16来源,权重内存约为其四分之一,参数量仅为教师模型的一半,并以Hypernova-60B的名义发布开放权重。与匹配的QAT基线相比,它以约7倍的速度达到相当峰值,且在持续训练下保持稳定,无需手动调优的早停。我们还报告了部署中的经验教训,包括分布式训练后端之间一个巨大且可复现的质量差距。我们的目标是提供一种无需数周超参数搜索即可部署的方案。
自主研究系统日益能够执行长周期研究工作流,然而自动化本身并不能确保研究过程始终保持科学根基。我们提出AutoResearch,一个连接想法生成与想法执行的两阶段系统,以同时解决研究想法如何形成以及如何通过实验可靠地确立这两个问题。在想法生成阶段,AutoResearch持续整合新兴研究信号与积累的领域知识,识别可迁移的机制性洞见,并利用多模型生成与交叉评审来产生有根基、可检验的研究方案。在想法执行阶段,协同智能体将这些方案分解为实验,迭代实施并诊断这些实验,并在接受研究结论前进行独立的基于证据的审查。在跨模态检索、系统优化和基准驱动的机器学习等代表性场景中,AutoResearch将生成的想法转化为可衡量的进展,检测并纠正不可靠的实验结果,并做出基于证据条件的决策,以继续、修订或终止研究方向。例如,在RSICD基准上,AutoResearch生成的想法将平均召回率从32.84提升至34.69,同时仅记录5次经审计确认的问题事件,而其他自主研究系统为11至27次。这些结果表明了一种研究过程:有意义的洞见在实验之前就已奠定根基,结论在接纳之前就已获得依据:洞见输入,幻觉输出。
在线策略蒸馏(OPD)已成为大语言模型后训练的一种有效框架,其通过将学生模型生成的轨迹与教师模型提供的密集token级监督相结合来实现。然而,OPD隐含地假设了教师派生奖励是推理进展的恰当代理,因此在策略优化过程中对所有教师反馈一视同仁。但在实践中,这一假设并非总是成立。我们观察到,教师派生奖励常常与真实推理进展相冲突,因为具有明确推理推进的推理步骤仍可能仅因其与教师输出的偏差而获得较低的蒸馏奖励。为解决这一错配问题,我们提出了面向在线策略蒸馏的推理进展感知奖励过滤方法(R2-OPD),该方法在轨迹内构建两组推理片段排序,一组来自教师派生奖励,另一组来自独立估计的进展奖励。当两组排序不一致时,蒸馏奖励会被选择性地抑制,从而减少与推理进展相冲突的监督,同时保留有效的教师指导。实验结果表明,我们的方法相较于标准OPD具有一致的性能提升,尤其在推理性能方面表现突出。
我们提出了一种通过自适应验证任务选择实现高效LLM评估框架优化的新方法。评估框架优化根据验证性能迭代地重写评估框架代码,无需更新底层模型权重即可获得显著的性能提升。然而,现有方法在每次迭代时都完整地评估固定的验证集,即使在评估框架演化中某些任务变得不太具有区分度,也会产生大量的评估成本。我们提出了Task-CoEvolve,通过解决两个挑战来使验证任务与评估框架共同演化:选择信息丰富的任务,以及从部分评估中估计完整集的性能。Task-CoEvolve基于这样一个观察:候选评估框架之间存在分歧的任务,比那些总是被解决或总是失败的任务,更能有效地区分候选框架。它使用基于过去结果的方差加权采样,将评估集中在能力前沿附近的任务上,并且采样分布会随着评估框架的演化而自适应调整。然后,它通过考虑采样概率来从采样的任务中估计完整集的分数,从而使不同迭代之间的比较保持一致,尽管评估的任务子集不同。在在线文本分类和Terminal-Bench 2.1上的实验表明,Task-CoEvolve始终优于基于子集的基线方法,与完整集搜索的最终性能相当,同时将优化过程中的评估次数减少了80%。代码将在https://github.com/Agent4Science-UTokyo/Task-CoEvolve发布。
大语言模型日益被期望执行复杂工作流,其成功取决于维护相互依赖的约束条件,并生成能够通过严格端到端验证的产物。然而,成功的执行经验通常在一次运行后即告丢失,迫使后续模型从头重新发现策略和失败模式。我们研究此类经验能否通过EvoMap实现外部化与复用,在该框架中,经验证器确认的执行轨迹被整合为结构化的Gene。为评估这一设定,我们引入了长工作流基准(LongWoF-Bench),包含778项可机器验证的任务,涵盖代码生成、智能体-环境综合、数学推理和规则遵循。在252项具有验证器确认的Opus轨迹的任务上,进化得到的EvoMap Gene在所有七个评估模型上均优于Skill,领先8.7至15.5个百分点,且收益可延伸至来自不同模型家族的消费级模型。相比之下,参考蒸馏的Gene未表现出相同优势,这表明仅靠紧凑表示并不足够,Gene的效用与经过验证的经验来源密切相关。对于Claude Opus,Gene复用还比Skill多完成了39项任务,同时将求解阶段的token消耗降低了9.9%。综合而言,这些结果表明,经过验证的执行经验可以被保留并作为可复用的外部资源进行共享,使模型能够在无需反复支付经验发现的全部代价的情况下提升长工作流的完成能力。
基于语音的应用在接入任何检索模块之前,会先通过自动语音识别(ASR)将口语查询转为文本,因此ASR错误会作为固定的上游约束进入处理流程。我们通过实验检验了标准检索增强生成(RAG)的两种扩展——实体图谱链接与迭代式改写——是会吸收还是放大这些错误。利用神经语音合成生成的四种英语口音,我们在三个多跳问答基准(HotpotQA、2WikiMultiHopQA和MuSiQue)上评估了四种RAG配置,并以纯文本基准(clean-text oracle)作为对照。尽管结构更丰富的配置在ASR输入下通常保持更高的绝对F1值,但两种扩展都会放大错误:在所有三个基准上,其组合方案下,从纯文本到最高词错误率(WER)口音之间的F1差距,比朴素稠密检索方案大36%–67%。主要的失败模式是一个或多个查询实体被破坏,在2WikiMultiHopQA上,这一原因占所有四种方法性能下降案例的87%–96%。两种轻量级的表层形式缓解措施仅能缩小剩余差距的一小部分,这表明下游检索结构会放大剩余的实体错误。我们在https://github.com/ZhenghuaBao/spoken-multihop-rag 发布了代码和数据。
大型语言模型(LLMs)中的长上下文预填充(prefill)会带来大量计算与内存流量,因为密集自注意力需要计算数量呈二次方规模的查询-键分数。现有方法要么使用统一的低精度路径,要么选择性地交互token,而未能在融合密集注意力内部对硬件对齐的分数块进行空间精度路由。我们提出TileMix,一种以块为中心的精度路由内核,它将数值精度转化为融合密集注意力中分数块组上的可执行空间决策。TileMix将注意力矩阵划分为硬件对齐的分数块,将路由决策打包为紧凑的位掩码,并通过FP16或INT8分数计算调度每个块组,而两条路径同时更新共享的在线softmax状态。可扩展的精度分组使每个路由位能够管理多个相邻的键块,从而在长上下文中保持硬件对齐的计算块和紧凑的元数据。通过对所有合法块组进行路由,TileMix保留了密集的token连接性,无需训练,并支持分组查询注意力、变长批次和INT8键/值缓存。在LLaMA、Qwen和Vicuna上的LongEval、LV-Eval和A100预填充基准测试中,TileMix恢复了在统一INT8下丢失的长上下文质量,并相较于FP16提高了预填充吞吐量,在多个模型家族中提供了可控的精度-效率前沿。实现代码见 https://github.com/HanzhiZhang-Ulrica/TileMix。
工业技术报告蕴含着面向维护、故障诊断和产品工程的高价值知识,但其异构结构(密集的散文式叙述、规格说明、表格)使得标准检索与问答流水线难以对其进行索引和推理,且目前尚无基于此类文档构建的公开指令微调数据集或基准数据集。我们通过Industrial-Instruction填补了这一空白,贡献了(i)两个基于真实工业技术报告构建的开放问答数据集,以及(ii)生成这些数据集的端到端流水线。利用906份公开的松下文档(共7,525页),我们应用布局感知抽取技术,构建语义检索索引,并在五种查询-文档关系(无关检索、单/多文档支持、单/多文档答案)下,基于检索到的证据合成多项选择问答对。在对初始生成的23.9k条样本进行过滤后,每个数据集提供约13.6k个带源文档的问答对,并包含一个留出的基准测试划分。对小型开源大语言模型(参数低于100亿)进行微调后,在松下基准上的集合匹配准确率从28.5%提升至42.0%,F1分数从46.6%提升至63.5%。我们发布了由同一流水线生成的两个并行版本:一个使用开放权重的Qwen3-30B-A3B-Instruct模型生成,另一个使用基于API的闭源模型Claude-Opus-4.6生成,从而能够直接比较开放模型与前沿模型在数据生成方面的差异。Claude-Opus-4.6数据集产生了更干净的原始语料和更大的微调收益,但成本高出约两个数量级。MMLU评估显示,使用Claude-Opus-4.6数据训练的模型几乎完全保留了一般知识,而使用Qwen生成数据的模型则出现了虽小但可测的遗忘效应。综合而言,这些数据集和流水线为从真实世界文档构建可扩展的工业基准和训练数据提供了一条实用且可复现的路径。
搜索增强的大语言模型通过检索实时网络内容,日益成为日常消费推荐的中介。这带来了一种新风险:大语言模型推荐器可能会消费被生成式引擎优化(GEO)运营者污染的网络内容,从而被误导。我们提出以下问题:它们在多大程度上会沦为虚假产品的无意推广者?我们引入FORGE(生成式环境中的虚假在线推荐)基准,该基准在固定的检索网页集合中,将真实产品局部改写为虚假产品,并衡量大语言模型推荐虚假产品的频率——涵盖15个类别、5种消费场景中的225个真实产品。在12个商业及开源权重的大语言模型中,所有模型均存在脆弱性:单一污染页面即可造成高达27%的受骗率,而完整的top-3替换可将这一比例提升至73.8%。脆弱性因类别而异,当模型缺乏对产品的稳定先验知识时,脆弱性会加剧。推理并不能缓解这一脆弱性;相反,它往往生成虚假的社会认同来为错误推荐辩护。四种防御措施均不足以应对:怀疑提示词可能像推理一样加剧脆弱性,两种共识过滤器有压制合法产品的风险,可信度重排序虽对所有模型均有帮助,但仅能消除六分之一的虚假产品。我们在https://github.com/leoluolol/forge-benchmark发布FORGE基准和评估代码。
随着检索增强生成(RAG)转向多样化组合生成,其发展受到两个关键瓶颈的阻碍:证据利用的测量存在缺陷,以及上下文预算分配欠优。我们依次解决这两个问题。 为解决测量问题,我们揭示了一种普遍存在的“诊断幻觉”:标准相关性代理指标在难负样本上会灾难性地失效。我们将其替换为一种高效的因果留一探针,该探针能够精确分离生成依赖,并正式校准 LLM 注意力的结构性稀释。 为解决分配问题,我们将该因果探针部署在一个去混杂因子网格中。我们证明,当前占主导地位的整体式上下文扩展策略是一种架构陷阱,会受到相关性衰减的惩罚。相反,将计算资源跨多次顺序生成进行迭代分配,可带来 16.7 至 20.5 个绝对百分点的变革性组合召回率提升,并且可稳健扩展至 32B 规模模型。 最后,我们将这些解决方案统一为一个可部署的闭环子模调度器。借助一个由归因引导的对比解码器来克服 LLM 的注意力惯性,我们的架构系统地强制整合新证据。通过超越经典开环基线,我们确立了顺序的、反馈驱动的编排作为生成式搜索的决定性范式。我们的代码、数据和因果测量工具可在 https://github.com/PeiYangLiu/ascp 获取。
检索增强问答系统在索引扩展后可能返回不同的答案,即使其请求的模型标识符、提示词、检索策略、证据深度、渲染方式及暴露的生成控制均保持不变。当增益与损失相互抵消时,总体准确率可能掩盖这些变化,而普通的生成变异性会使单次比较夸大更新效果。我们将这一隐藏现象称为"准确率盲区答案波动"(accuracy-blind answer churn),并引入快照兼容性审计(Snapshot Compatibility Audit),该方法通过从跨快照不一致中减去同快照重复不一致来估计超额答案波动。我们通过将一个冻结的FineWeb前缀从一个分片扩展到七个分片来实例化该方法。在一项预注册的400题Natural Questions研究中,归一化精确匹配和盲评语义的超额波动分别为6.44和10.25个百分点,而精确匹配准确率仅变化了-1.50个百分点。事后分析发现,40/400的问题存在重复稳定的语义翻转。另一项单独预注册的200题TriviaQA研究产生了较小且方向一致的超额波动,而精确匹配准确率则朝相反方向变化。一项使用第二个DeepSeek生成器及服务配置的结果盲评事后100题子集复现发现,即使在精确匹配率上升3.00个百分点的情况下,语义超额波动仍达8.75个百分点。因此,在没有显著或方向一致的效用变化时,答案级兼容性仍可能失效。检索增强发布应在评估效用的同时审计兼容性。
随着扩散模型与大规模视频生成的快速进展,生成式世界模型日益被期待取代传统模拟器(包括物理引擎、游戏引擎和强化学习环境)。然而,从生成到模拟的差距仍有待系统性评估。我们提出了一项基于能力的研究,采用外部标尺:传统模拟器的八项能力,即资产构建、物理引擎、交互性、可控性、稳定性、状态反馈、多样性和评估指标。我们梳理了三条主要技术路线——潜在动力学、视频生成和联合嵌入预测——并将2018年至2026年6月间发表的200篇代表性工作映射到这些能力上。我们的分析表明,世界模型在特定场景的交互性和可控性方面已实现功能替代,但在物理定律的形式化保证、结构化状态反馈和可复现的长时程演化方面仍不及传统模拟器。状态反馈是各路线中最受忽视的跨路线短板:在163篇实现论文中,仅6篇提供用于查询实体状态或物理参数的运行时接口。我们指出了六个研究方向:形式化物理、统一动作接口、一等状态反馈、长时程稳定性、下游效用评估和跨路线融合。项目页面:https://github.com/AtongWang/world-model-simulators
全长RNA,特别是信使RNA,其长度往往超过现有RNA基础模型预训练时使用的上下文长度,这限制了在单核苷酸分辨率下对完整转录本的建模。我们提出RIBOSPAN,一个包含16.1亿参数的双向RNA基础模型,其原生预训练上下文长度可达10,240个核苷酸。RIBOSPAN结合了密集双向自注意力、单核苷酸分词以及注意力隔离的序列打包技术,实现了对完整长RNA的高分辨率建模。我们通过核苷酸重构、受控长上下文表征基准测试以及冻结RNA类型表征分析来评估该模型。原生10K预训练在10,240个token下保持了强大的重构能力,而采用40%掩码率的持续预训练则在重度损坏条件下改善了序列恢复能力,同时保持了表征质量。长上下文基准测试进一步表明,原生10K模型保持了强上下文响应性和上下文特异性表征分离,同时将扰动引发的表征变化限制在高度局部范围内。推理时的YaRN缩放恢复了大部?#124;因短上下文模型直接外推而丢失的上下文组织结构,但同时也导致了显著更大的远端表征扩散。冻结表征评估进一步证明了RIBOSPAN达到了最先进的RNA表征质量,在多种RNA类型中取得了整体最优性能,并在长RNA上保持了明显优势。基于同一骨干架构,我们开发了一个多维条件约束的离散扩散框架,用于全长mRNA生成和重新设计,其中包括同义密码子扩散,以实现蛋白质序列保持的CDS优化。综上,RIBOSPAN为可迁移的RNA表征学习和全转录本mRNA设计建立了强大的长上下文基础。
可解释性研究日益关注概念在训练中何时出现,以及线性探针能否恢复真实结构;但在语言模型中,这些主张很难验证,因为语言几乎没有提供概念之间顺序或关系的真值。我们提出借助AstroPT——一个在数百万星系图像上训练的Transformer——利用天文学真值作为校准测试平台。AstroPT是一个类似LLM的模型,其训练领域内概念的难度排序及概念之间的关系是预先已知的。通过跨检查点、层、模型规模和训练目标选择对冻结表征进行线性探针探测,我们发现星系属性以固定顺序涌现,这一顺序与已知难度一致:几乎直接编码在像素中的量(如波段星等)在训练早期即可解码且位于网络浅层,而基于多波段/光谱的量以及推断量(如红移和比恒星形成率)则在更晚阶段且更深层出现。这一顺序对测试的训练目标保持不变,并且随容量增大在幅度上增强、在顺序上不变。我们的线性探针方向还进一步恢复了星系属性之间已知的物理结构。我们的研究结果表明,天文学为校准机制可解释性方法提供了一个受控沙盒,而这些方法我们原本会盲目地应用于大语言模型。
智能体基准测试常常只评估最终答案,即便智能体运行在有状态运行时之上。我们认为这欠定义了被评估的对象:恰当的评估单元应是声明的模型加运行时配置,其故障可能发生在证据获取、运行时路由、安全边界或重复执行之中。我们提出 ClawProBench,一个面向运行时原生智能体评估的轨迹感知基准测试,实例化于 OpenClaw 之上——一个具备工作区工具以及浏览、记忆、消息传递、调度、技能和子智能体等原生接口的实时智能体运行时。ClawProBench 定义了两个轨道:一个包含 102 个场景的完整配置档,涵盖实时工作区与原生运行时路由任务;以及一个冻结的 68 场景留出集,采用封闭世界的 JSON 输出契约以实现稳健排名。试验通过安全门控公式从执行轨迹中评分,该公式综合了正确性、过程质量和效率,并为审计保留故障证据。我们的匿名工件包含基准定义、评分代码、清单文件和经脱敏处理的轨迹。我们在完整配置档上评估了 68 种配置,在留出集上评估了 37 种。最高的安全门控平均轨迹得分为 0.7671。原生运行时任务的表现低于实时工作区任务(0.5238 对 0.6415)。在留出集上,pass@k-any 优于严格的三轮通过(0.6638 对 0.2890),而完整配置档与留出集之间的排名一致性较弱(斯皮尔曼相关系数 0.1300)。纯基于正确性的排名与过程感知、安全门控及严格通过视角下的排名存在显著差异。仅关注最终答案的排行榜可能掩盖原生接口的弱点、一次性成功以及轨迹局部的智能体故障模式。
心电图(ECG)记录是敏感的生物医学数据,限制了医院和可穿戴设备共享原始信号以进行集中式模型训练的能力。联邦学习通过允许在保持原始生物信号数据位于各自来源的同时进行协作式模型训练,从而解决了这一实际隐私约束。然而,由于客户端样本有限、心律失常标签不均衡以及各客户端数据非独立同分布(non-IID),联邦心电图分类仍具挑战性。这些约束要求分类器既具备通信效率,又能对跨客户端分布偏移具有鲁棒性。在本研究中,我们在联邦平均(FedAvg)框架下,评估了混合量子启发柯尔莫戈洛夫-阿诺德网络(HQKAN)与多层感知机(MLP)在MIT-BIH数据集上的五类心律失常分类和INCART数据集上的三分类任务中的表现。在多种客户端配置下,HQKAN在多数总体指标和少数类指标上均有提升,同时在MIT-BIH数据集上可训练参数减少37.35%,通信成本降低24.89%;在INCART数据集上分别减少44.81%和36.41%。这些结果表明,对于生物信号数据上的隐私感知联邦学习,HQKAN为MLP基线提供了一种紧凑、通信高效且鲁棒的替代方案。
人脸呈现攻击检测(PAD)传统上被表述为一个面部特定问题,尽管打印、重放和重采集过程引入的许多视觉伪影本质上与面部外观并无关联。在本工作中,我们研究了在下游PAD训练过程中不使用人脸的情况下,能否学习到可迁移的PAD表征。为此,我们提出了TPO,一个受控的、不含人脸的呈现攻击数据集,其中包含几乎随机挑选的西红柿、土豆和洋葱的真实、打印及重放记录,采集协议与常规人脸PAD数据集高度相似。使用基于基础模型的PAD架构,我们证明,在四个标准跨数据集人脸PAD基准上,使用TPO训练的检测器平均AUC达到92.70%,优于使用合成人脸训练,并与在真实人脸数据集上训练的模型保持竞争力。相反,在人脸PAD数据集上训练的模型迁移到TPO时始终高于偶然水平,这表明学习到的表征捕获的是呈现过程的特征,而非物体语义。此外,在固定优化预算下,将TPO纳入常规人脸PAD训练持续提升了跨数据集性能,表明无面部数据提供的是互补信息,而非仅仅是额外的训练样本。最后,表征和频率分析提供了进一步证据,证明可迁移的PAD表征无法由单一的频谱伪影解释,而是编码了跨物体类别共享的更丰富的呈现线索。综合来看,这些结果为以下观点提供了实证依据:可迁移的呈现攻击表征可以独立于面部内容进行学习,为隐私保护和身份无关的PAD开发开辟了新机遇。
机器人策略在每个决策步骤都会接收异构观测,然而序列模型在如何随时间组织这些输入上各不相同。我们提出了WorldToken,这是一种时间优先的策略实例化,它将每个策略时间步内的多视图图像、本体感觉和任务条件融合为一个世界token。一个因果时间Transformer对生成的世界token序列进行建模,并由一个扩散动作头生成动作块。在23个RoboCasa任务上,一个除冻结的预训练CLIP文本编码器外从头训练的8530万参数策略,在每项任务使用2,900个生成的演示的情况下,实现了59.45%的平均闭环成功率。对五种数据集规模、五种模型规模和两种训练随机种子的完整析因扫描显示,额外的目标域数据带来一致的增益,而超过中等模型规模后收益递减。在相同检查点的历史截断下,将可见历史减少到一或两个策略时间步会降低全部50个RoboCasa策略的闭环成功率。在RMBench Blocks Ranking上,将可见历史从146秒缩减到8秒会使评估器成功率从95%降至28%,而探索性扩展推演则将参考交换序列维持了超过850秒。这些结果实证了完整WorldToken实例化的可行性,并刻画了其在所测试的实验方案下的数据缩放和时间上下文行为。它们并未证明其相对于其他序列组织的优越性,也未分离出完整实现中哪些组件驱动了观察到的性能。
深度人脸识别(FR)模型已达到近乎饱和的准确率,但仍然是透明的反面——从业者无法询问相似度得分依赖了哪些语义属性。EXPL-FR 在 FR 模型自身的嵌入空间内回答了这一难题。一个轻量级适配器将视觉-语言模型(VLM)的图像编码器与冻结的 FR 空间对齐,该适配器仅在人脸图像上训练,从未使用文本。由于 VLM 的编码器共享同一空间,同一适配器也适用于文本编码器,从而将 22 个类别中的 978 个属性提示(且可扩展)转化为 FR 空间中的锚点,且无需额外成本。我们并不假设这种迁移必然有效:通过一个人脸验证协议对其进行测量,且仅更改适配器的消融实验可分离出其贡献。并非每个概念都能存活,因为 FR 模型通过丢弃那些在跨因素验证身份时必须忽略的因素来获得其不变性。一种无标签可检测性度量将每个概念在 FR 空间中的可分性与在 VLM 空间中的可分性进行比较,其中可检测性最高的 100 个概念构成模型可读的语义签名,该签名比完整词汇表能更好地区分身份。我们覆盖了四个 FR 主干网络和两个 VLM 编码器;EXPL-FR 无需访问模型架构,支持身份级、逐图像和差分解释。我们在三种监督设置下对属性级审计进行基准测试:人工标签(当前实践)、VLM 伪标签,以及我们完全由提示驱动的审计,并与真实验证行为进行比较。在无标签条件下,提示驱动的审计根据测得的按族裔划分的 RFW 误差对四个 FR 模型进行排序,并根据真实的验证代价对受控属性变化进行排序。