每日精选AI研究论文及翻译
大语言模型智能体日益被评估为自主工具使用者,然而大多数基准测试聚焦于具有即时成功标准的受限任务。现实世界部署往往要求长期连贯性,即在扩展的时间跨度内保持有目的的行为,同时根据累积证据调整决策的能力。评估这一能力需要一个持久化环境,其中行动会约束未来的选择,反馈以异构延迟到达,且不连贯行为会产生可测量的累积效应。卖家侧电子商务通过商品选品、上架与定价控制、现金流管理以及混合延迟反馈适应中的循环性和相互依赖决策,为这种评估提供了合适的场景。我们提出MerchantBench,一个基于98,843条真实电子商务商品记录、配备26种工具供智能体交互的365天订单级模拟。MerchantBench将可即时观察的上游供应商事件与延迟的下游订单结果相耦合,要求智能体跟踪单个订单生命周期并重新审视早期决策。我们在两种智能体框架下对八种大语言模型进行了48次运行评估,每次运行跨越365个模拟日。结果表明,即使是最新的大语言模型与人类参与者之间仍存在显著差距,最佳大语言模型配置仅达到人类参与者平均最终净资产的27.3%。
实时视频编辑需要在有限计算资源下实现低延迟因果生成,同时保持源保真度和长期时序一致性。我们提出JoyAI-Video-Edit,一个160亿参数的自回归扩散框架,用于无需访问未来帧或预定义视频时长的实时开放式视频编辑。我们的方法结合了分块自回归适配、源锚定分布匹配蒸馏(SA-DMD)和长视野自回归蒸馏,以减少训练-推理不一致、在两步生成中保持源保真度,并缓解累积的时序漂移。大量自动化和人工评估表明,JoyAI-Video-Edit显著优于现有流式编辑器,并在短视频和长视频上与强离线系统保持竞争力。完整系统在单个Nvidia B200 GPU上实现了约30 FPS的端到端720p视频编辑。代码已开源:https://github.com/jd-opensource/JoyAI-Video-Edit。
在生成建模中,语言仍然是一个特例:虽然图像、视频和音频日益在连续潜在空间中进行建模,但文本生成仍主要依赖离散词元。现有的连续语言模型要么继承了并非为联合生成与解码而设计的嵌入空间,要么压缩自编码的潜表示以简化扩散过程,从而牺牲了词元级保真度。我们没有为了适配生成模型而简化表示,而是保留了一个高容量、可解码的文本潜表示,并设计扩散模型直接学习其分布。 我们提出了AURORA-LM,一种连续潜在空间扩散语言模型,它将可解码文本表示的构建与其分布的建模分离开来。基于查询的编码器-解码器将文本组织为高容量、前缀对齐的潜序列,而块因果扩散Transformer通过流匹配学习其分布,从左到右生成块,同时并行去噪每个块内的位置。由于这种潜表示对扩散建模更具挑战性,AURORA-LM仅限制噪声输入通路,同时保留完整的干净潜表示预测目标,从而在不降低解码器侧容量的情况下容纳全宽潜表示。我们还根据潜表示宽度校准噪声水平分布,并引入自轨迹一致性来弥合独立采样的训练噪声与推理时迭代去噪之间的差距。 在OpenWebText自由生成和XSum摘要任务上,AURORA-LM在已评估的连续和基于扩散的语言模型中取得了最强性能。将模型扩展到10亿参数、总计算量约1500 EFLOPs可进一步提升性能,在对齐的评估协议下超越了已公开的更大规模潜扩散语言模型。所有实验均在昇腾NPU上进行。
近期图像生成领域的进展展示了集成理解、生成与编辑的统一多模态模型的巨大潜力。然而,统一的3D建模仍受限于多模态数据的稀缺,尤其是缺乏大规模且几何一致的编辑数据。为解决这一局限,我们提出了Hunyuan3D-Buffalo 1.0——一个在单一架构内支持3D理解、文本到3D生成、指令引导的3D编辑以及文本驱动的部件生成的统一框架。为实现可扩展的训练,我们构建了8700万规模的3D多模态语料库,包含2500万个理解样本、5000万对文本到3D数据对,以及使用Nano3D-v2生成的1200万对编辑数据对。在架构上,该框架将Hunyuan3D-VLM(用于语义、结构和空间理解)与Hunyuan3D DiT(用于高保真3D合成)相结合。VLM为生成提供多模态语义条件,而编辑与部件生成任务额外以源对象表示作为扩散过程的条件,以保留对象的整体结构和未编辑区域。大量实验表明,Hunyuan3D-Buffalo 1.0在文本到3D生成和3D编辑基准上取得了最先进或领先的性能,同时展现出强大的理解和部件生成能力。进一步分析表明,生成和理解均能促进编辑性能提升,验证了统一3D多模态训练的有效性。项目主页:https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0/
我们提出Video-DeepResearch(Video-DR),将多模态智能体从静态图像扩展到连续视频流——这一设定要求密集的时空定位能力与开放网络探索能力的结合。初步评估揭示了当前模型存在的两个关键瓶颈:(1)模态偏差,即智能体绕过视觉工具而倾向于文本搜索;(2)参数化知识泄漏,即模型依赖内部记忆而非真正基于工具的增强执行。为应对这些挑战,我们提出Video-DR,其核心是一个解耦的感知-探索流水线,并采用分阶段工具解锁策略,强制模型在网络检索之前进行全面的跨帧视觉定位。我们的框架采用两阶段训练方案:监督微调后接组相对策略优化(GRPO),从而实现自主探索,突破模仿学习的性能天花板。此外,我们构建了Video-DR-Bench,一个包含200个复杂多跳视觉问答(VQA)实例的人机协同基准。实验结果表明,我们的Video-DeepResearch-35B-A3B以64.0%的平均准确率取得了新的最先进水平,超越专有模型Claude-4.5-Sonnet(59.0%)5.0个百分点,并显著优于GPT-5(52.5%)和Gemini 2.5 Pro(57.5%)。30B-A3B变体达到59.3%的准确率,与Claude-4.5-Sonnet相当,证明了我们的训练范式即使在紧凑规模下同样有效。代码:https://github.com/Osilly/Vision-DeepResearch。
工业推荐系统越来越广泛地采用“预训练-再迁移”范式,然而行为分布漂移带来了两个问题:从行为序列中学习什么,以及在预训练模型持续刷新的情况下如何迁移已学到的知识。为解决这些问题,我们提出了知识-几何解耦(Knowledge-Geometry Decoupling, KGD)。关于“学什么”:传统的下一词元预测将相邻性视为依赖关系,可能编码跨无关会话的虚假转换。我们引入了行为多词元预测(Behavioral Multi-Token Prediction, BMTP),仅保留具有协同或语义关联的未来物品作为监督信号,从而获得更干净、更具可迁移性的行为知识。关于“如何迁移”:预训练知识与任务特定的几何结构对共享参数施加了相互冲突的优化需求。为解决这一问题,KGD将它们分配到独立的参数集中:可刷新的编码器拥有行为知识,而任务学习器通过只读交叉注意力读取上下文编码器状态,并通过与预训练嵌入正交的锚定校准残差(Anchored Calibration Residual, ACR)写入任务特定的几何结构。这种解耦的所有权设计使得知识能够持续刷新,而不会受到任务梯度干扰,也不会使下游适配失效。KGD在八个公开基准上相比强预训练-迁移基线提升了4-12%,并在基线无增益的90天生产数据流上持续保持优势。KGD已在Shopee全面部署。在Shopee首页搜索的在线A/B测试中,它将人均GMV提升了1.75%,广告收入提升了1.53%,展示了其极高的实用价值。我们在https://github.com/FuCongResearchSquad/KGD4REC提供了KGD的核心实现。
大型语言模型智能体在复杂交互任务中展现出强大潜力,但其强化学习(RL)常因稀疏奖励而受阻,因为一条长的多轮轨迹可能仅获得单一的结果级信号。在策略自蒸馏(OPSD)通过特权教师提供稠密的词元级监督,但教师并非在每个位置都可靠。现有方法通常依赖孤立的词元级差异,这易受噪声影响,或分配统一的步级权重而忽视位置差异。我们提出持续一致性自蒸馏(PCSD),该方法从教师偏好信号的局部持续性中推导词元级蒸馏权重。PCSD将自适应窗口与指数衰减聚合相结合以捕获持续的相对教师支持,应用趋势感知调制来衰减局部下降的支持,并通过sigmoid门控产生连续权重。所得目标函数与GRPO联合优化,将稠密教师引导与稀疏环境反馈相结合。无需推理时技能,PCSD在两个骨干网络上均取得所有基线中最佳的ALFWorld Overall结果,超过GRPO 15.6和13.3个百分点,超过SDAR 6.2和5.5个百分点,同时在WebShop上保持竞争力,并在未见过的ALFWorld分割上较GRPO提升15.8个百分点。
持续改进的智能体需要超越静态监督的动态交互反馈,然而直接的真实环境交互代价高昂、速度缓慢、存在安全风险且难以并行化。世界建模提供了一种自然的中间代理,使智能体能够在采取真实行动之前查询成本更低、更可控的反馈。经典世界模型主要通过未来物理状态预测来实例化这种代理,这种形式对于需要原始状态转换之外的可操作反馈的智能体而言虽有用却过于狭窄。在本工作中,我们提出了以智能体为中心的交互式世界代理(Agent-Centric Interactive World Proxies)的概念,将基本范式从物理状态转换转向智能体可用的信息转换,例如执行结果、检索到的经验或技能以及验证信号,从而拓宽世界建模的范围,为持续改进的智能体提供多样化的反馈。为了系统性地描绘这一设计空间,我们根据反馈模态将世界代理组织为六种功能形式:动力学代理、空间代理、执行代理、记忆/经验代理、技能代理以及奖励/验证代理,这些形式共同刻画了世界建模服务于智能体改进的主要方式。我们进一步分析了这些代理如何在三个递进层面赋能智能体:L.1 推理时引导(Inference-Time Guidance),其中代理输出丰富上下文信息以支持更优决策;L.2 训练时优化(Training-Time Optimization),其中代理输出产生奖励、批评或合成轨迹用于策略学习;L.3 智能体-代理协同进化(Agent-Proxy Co-Evolution),其中真实环境证据持续更新代理与智能体,以实现协同进化。最终,本工作将世界建模重塑为以智能体为中心的范式,为构建能够赋能智能体更好地规划、更快学习并持续进化的世界代理确立了路线图。
递归自我改进要求智能体将积累的经验转化为更好的未来行为。个人AI智能体为研究这一能力提供了具体场景,因为它们在会话之间保留了偏好、任务历史、工具例程以及已习得的技能。然而,保留的经验是否确实能随时间提升智能体的表现,尚未经过系统测试。我们提出了PAST-Bench,一个专门用于隔离这一问题的基准。每个智能体在匹配条件下运行按序排列的新会话任务序列,并在这些条件下分别开启和关闭保留经验。该基准涵盖记忆、程序复用、信息收集和更新四类能力,共26个场景和204个回合。我们既报告后续任务的收益,也报告这些收益是否遵循预期的保存、检索和更新路径。在七个基础模型和四个智能体框架上,改进是真实存在的,但在不同能力上表现不均衡。表面增益相同的智能体,其增益是否有预期路径的证据支持可能存在显著差异。基于这些发现,我们开发了Hermes+,它在智能体循环的各阶段扩展了Hermes,加入了五项针对性干预。Hermes+提高了从保留经验中获得的平均收益,并提供了更清晰的路径证据,在需要替换过时状态的任务上改进最为显著,但效果仍取决于具体能力和模型。总体上,PAST-Bench和Hermes+为研究持久化智能体如何从保留经验发展到通过经验进行系统性改进提供了评估与诊断基础。代码:https://github.com/Gen-Verse/PAST-Bench
扩散语言模型(dLLMs)为自回归(AR)语言建模提供了一种替代方案,然而混合专家(MoE)dLLMs的缩放行为仍未被充分理解。我们系统地刻画了优化超参数、算力分配和架构规模如何随MoE dLLMs扩展,并识别出与先前AR模型缩放趋势之间的定量差异。具体而言,在优化方面,最优名义批量大小随算力增长更快,而最优学习率随算力衰减更为迅速。在模型-数据分配方面,IsoFLOP分析揭示了轻微的数据侧倾斜:最优词元预算的增长速度快于激活的模型侧计算量。在MoE架构方面,在固定激活容量下,更大的规模日益倾向于更大的专家池,而适度的专家粒度始终保持有效,且分配给共享专家的激活容量比例在不同规模下保持稳定。在这些发现的指导下,我们从零开始在23.5T词元上训练了LLaDA MoE v2——一个30B-A3B的dLLM。该模型使用的预训练词元数量约为Qwen3的65%,却在多个知识、推理和代码基准上接近Qwen3。仅经过监督微调,它就在八个推理和代码基准中的七个上超越了SDAR Chat,并在若干任务上与Qwen3保持相近。这些结果为MoE dLLMs确立了实用的缩放定律和设计原则。
全模态大语言模型(Omni-LLMs)在视听理解任务上取得了显著性能,但处理冗长且高度冗余的视觉与音频词元序列会带来巨大的计算开销,亟需通过激进的词元压缩来实现高效部署。现有方法在低词元预算下往往性能下降:LLM前的压缩可能丢弃结构上重要且全局分布的证据,而LLM内的压缩则常常未能充分利用查询条件化的视听协作。为解决这些局限性,我们提出了OmniPack,一种无训练框架,它将LLM前的结构压缩与LLM内的任务相关语义精炼相协调。在进入LLM之前,OmniPack通过模态特定重要性、全局覆盖和相似性感知合并来消除结构冗余。在充分的多模态交互之后,它进一步通过文本引导和视听协作整合多样化、任务相关的表示。在三个Omni-LLM骨干和五个基准上的大量实验表明,OmniPack在不同保留比例下 consistently 实现了最佳的性能-效率权衡,优于所有现有方法。值得注意的是,在Qwen2.5-Omni-7B上,OmniPack保留了原始性能的98.0%,同时将FLOPs降低至16.7%;并且仅使用原始FLOPs的6.8%即可保持92.9%的原始性能。
同策略蒸馏中,教师纠正学生自身生成的样本,这预设了两个模型使用相同的语言:相同的VAE潜变量、匹配的架构以及共同的时间步网格。我们探讨了当这些条件均不成立时会发生什么——例如可用的最强教师模型与希望部署的学生模型来自不同的模型家族——并发现标准方案对此无能为力:教师潜变量无法在异坐标系中充当目标;针对随机重绘局部细节的教师的逐像素损失会退化为模糊或发散;时间步索引在不匹配的调度中失去其意义。我们提出Any-OPD——据我们所知,这是首个支持任意潜变量流匹配生成器对之间进行同策略蒸馏的框架。Any-OPD将教师纯粹视为黑盒采样器,并仅在一点上连接两个模型:一个冻结的、与模型无关的视觉表示,在其中比较两者独立解码的输出,从而避开关于潜变量、特征或架构的所有假设。通过匹配连续噪声水平而非步索引来恢复轨迹对应关系;此外,一个简短的锚定阶段将教师样本通过学生自身的VAE重新编码,确保同策略梯度衡量的是样本质量而非域不匹配。将12B的FLUX.1-dev蒸馏至2.5B的SD3.5-Medium,Any-OPD将学生的PickScore从0.846提升到0.884,HPSv3从9.12提升到10.97,以五分之一规模的模型媲美教师,而直接潜变量回归在此场景下根本无法训练。
标题(caption)在图像理解与文生图生成任务中均被用作主要的监督信号。然而,现有评测往往将描述质量视为单一标量目标,从而混淆了两个截然不同的属性:(1)描述覆盖了多少视觉信息;(2)图像能在多大程度上可靠地支持描述中所陈述的内容。为此,我们设计了一个解耦式描述评测基准——CAPEval(覆盖度与精确度评测,Coverage And Precision Evaluation),该基准包含人工撰写的真值描述以及经人工核验的原子化检查表条目。具体而言,CAPEval 将描述质量分解为覆盖度(Coverage)与精确度(Precision)两个维度:前者衡量描述对真值事实内容的覆盖程度,后者反映描述中所有陈述的事实正确率。我们选取了 10 个描述生成器,并进一步在来自四个模型家族的描述生成器上进行了受控的下游端到端实验,其中描述来源是唯一的变量。实验结果表明,我们观察到一种一致的、随任务而异的分离现象:覆盖度与理解性能的相关性更强,而精确度则是生成性能的主导预测因子。这种解耦式评测范式不仅能够对描述质量提供更细粒度的诊断,还能为针对不同下游任务选择与优化描述生成器提供可操作的指导。
自进化智能体日益将交互历史转化为可复用的技能,这些技能能够超越单个任务而持续存在。尽管已有工作研究了记忆与检索投毒,但此类攻击仅在受污染记录被作为上下文检索时才会影响智能体。我们揭示了一个新的、更为根本的风险:受污染的体验可被智能体自身转化为持久的行为产物。我们提出了SkillJack,这是首个利用自进化智能体经验-技能流水线的攻击。SkillJack并非直接操纵运行时上下文,而是劫持智能体自身的学习过程,将恶意行为植入其可复用的技能库中。我们识别出这一转化的三个关键特性:清洗粉饰(sanitization whitewashing),即恶意意图在技能提取过程中被掩盖;跨层提升(cross-layer promotion),即瞬时经验转变为持久能力;以及持久性隔离(persistence isolation),即攻击在移除其原始来源记录后仍然存活。我们在两个代表性系统SkillX和Anything2Skill上评估了SkillJack,使用包含四个策略风险类别、共150条轨迹的共享数据集。结果表明,技能提取显著降低了攻击的可检测性:在SkillX中,安全检测率从针对受污染轨迹的98.5%骤降至针对提取技能的11.4%,而Anything2Skill也呈现出类似效果。与此同时,植入的技能保持有效性,在两个系统上分别实现了56.2%和89.2%的攻击成功率。此外,80.0%的技能介导攻击在删除原始受污染记录后仍然持续存在,且部分技能会在良性查询上意外触发。我们的发现揭示了技能演化是一个新的攻击面,并促使我们倡导具备来源感知的技能生命周期保护。我们的代码可在https://github.com/Tencent/AI-Infra-Guard/research/skilljack获取。
我们提出 UniWorld-Design,一个将图像生成从平面像素合成重新定义为结构化视觉合成的框架,以语义 RGBA 图层作为生成、理解和编辑的原子单元。我们的核心洞察在于:像素决定图像如何被渲染,而图层决定图像如何被创建、理解和编辑。正如人类设计师通过图层而非原始像素来创建和操作视觉内容,UniWorld-Design 为多模态生成模型赋予了图层原生的设计空间。UniWorld-Design 包含两个模型。Text-to-RGBA(T2RGBA)模型直接从文本生成独立的 RGBA 素材;Image-to-Layer(I2L)模型以一张已完成的图像、一条全局指令和逐层提示为条件,联合生成有序且完整的语义 RGBA 图层。其指令接口支持顶层分解、递归分解和定向提取,使分层成为面向智能体编辑的指令可寻址操作。由于 I2L 学习的是完整的语义对象而非可见像素的分割,其图层在移动或移除后仍然可用。在 Crello 基准上,与 Qwen-Image-Layered 相比,I2L 将逐层 RGB L1 误差降低了 37%,并在 Alpha Soft IoU 上取得了 34% 的相对提升。此外,T2RGBA 取得了最高的 CLIP Score,优于 LayerDiffuse 和 OmniAlpha。
工具集成推理(TIR)使大语言模型(LLM)能够通过迭代式工具交互解决复杂任务。然而,现有的强化学习方法通常依赖轨迹级监督,限制了长视界TIR场景中的细粒度信用分配。同策略自蒸馏通过具有特权上下文的教师分支提供更密集的信号,但现有方法通常从真实答案或检索技能中获取此类上下文,这可能无法反映智能体实际访问的状态。此外,词元级监督无法捕捉工具交互的轮次级结构。为了解决这些问题,我们提出了TurnSight,一种轮次级事后自蒸馏框架,直接从执行条件化的事后信息中推导监督信号。随后,它构建多个具有不同前瞻视界的事后视角,并通过跨视界方向一致性选择可靠的监督。最后,选中的事后信号在兄弟轨迹之间进行归一化,并用于自适应地调节RL优势,同时保持其原始优化方向。在三个基准上的大量实验证明了TurnSight的有效性。我们的代码可在 https://github.com/quchangle1/TurnSight 获取。
可穿戴助手既应能回答关于其视觉历史的问题,也应能识别该历史对当前情境的适用性。现有的视频记忆系统主要支持基于问题的条件式回忆,而主动式助手通常采用分离的记忆与控制机制。我们提出GROVE,一个免训练框架,通过从连续视频流中因果式地增长单一记忆,同时支持上述两种行为。GROVE保留细粒度的感知证据,并将其增量式整合为带时间戳的瞬间、连贯的情节片段以及跨天的重复模式。每个层级均配有一种尺度原生的检索技能,用于定位观测、回放活动或遍历长时程规律。反应式问答与主动式辅助共享这一记忆及访问接口,区别仅在于检索是由用户查询触发还是由当前情境触发。在包括具有挑战性的MM-lifelong和EgoServe在内的多个基准测试中,GROVE在所比较的方法中取得了最佳结果。受控消融实验表明,各时间层级及其访问技能具有互补性,其中模式在证据跨越数天时带来的收益最大。代码将在https://github.com/SitongGong/GROVE 上公开。
大语言模型(LLM)智能体在软件工程领域已得到迅速采用。随着智能体在实际代码生成中承担更大角色,它们所做的修改规模也日益增大,往往跨越数十至数百行代码。这使得人工审查智能体结果变得越来越不可行,开发者因而转向借助解释来理解已实施的变更。尽管如此,目前尚无基准测试能够评估智能体生成解释的可信度。为弥补这一空白,我们提出了ExplainBench,一个用于自动评估编码智能体解释质量的基准测试。ExplainBench基于如下直觉:信息充分的解释应能使LLM正确回答问题,从而实现对不同智能体解释质量的定量比较。基于这一观察,我们构建了一组问题,用于评估解释能否准确描述:(1)有缺陷代码的预期行为,以及(2)应用智能体补丁本身所产生的效果。实验首先表明,解释质量是智能体评估中一个独立的维度:ExplainBench对智能体的排序与广泛使用的SWE-bench Verified基准测试不同。对智能体解释质量的更深入剖析显示,解释中频繁出现问题,例如解释常常声称某个补丁是正确的,而实际上并非如此。基于这一发现,我们实现并评估了一个解释审计智能体,该智能体通过运行额外测试来验证和修正解释。该智能体改进了所有被评估智能体的解释,表明智能体生成的解释可以自动地变得更加可信。
现代智能体框架通过为大语言模型配备外部技能库来解决复杂任务。然而,这些系统能否有效进化其技能,以及由此产生的技能能否真正提升任务求解能力,目前仍不明确。为弥合这一差距,我们提出了ContinualSkillBench,一个面向上下文持续技能学习的动态评估框架。该框架涵盖五个代表性领域,每个领域包含100个相互关联的子任务,这些子任务按难度递增排列,并提供跨任务技能复用的机会。实验表明,顺序执行通常能提升性能,但提升幅度在不同模型和领域间存在显著差异。此外,上下文学习在平均水平上与显式技能维护表现相当,这表明性能提升主要源于对先前上下文和反馈的适应,而非仅依赖可复用的技能抽象。然而,显式技能在处理需要可复用流程或精确输出的任务时仍具有选择性优势。我们进一步发现,能力较弱的模型倾向于积累更大、更碎片化的任务特定技能集合。这些发现表明,当前的上下文技能进化机制能够支持持续适应,但在将经验一致地整合为稳健且可迁移的技能方面仍面临挑战。
大型语言模型(LLMs)是否具备真正的结构性推理,抑或只是依赖表层模式匹配?金融领域对数值精度与长上下文上的多步逻辑要求严苛,是理想的试验场。然而,现有基准主要依赖基于截断表格的选择题或单跳问答,忽视了复杂的跨报表动态关系与跨期去累计,难以反映真实工业场景的复杂性。 为弥补这一空白,我们提出 FinIndices——一个在未截断的财务报表(最长32K token)上评估数据处理保真度的大规模基准。借助带有对抗性陷阱的自动化合成流水线,FinIndices 涵盖单一指标计算与表格式指标编制两类任务,用以测试复杂的领域、时间与口径推理。 我们的评估揭示了 LLM 的两大严重缺陷。其一,“知识瓶颈”:尽管模型在预训练阶段记忆了公式,其模式匹配依然脆弱。移除显式公式提示后,性能急剧下降(例如,Gemini-3.1-Pro 在表格任务上从 70.70% 跌至 38.22%),暴露出跨期去累计与存量-流量口径不匹配方面的致命问题。其二,“结构瓶颈”:生成多指标、多周期表格所带来的高强度认知负荷会持续消耗推理能力。在结构压力下,原本能够完美执行孤立推导的 LLM 会退化为浅层启发式,例如取用错误的相邻列,或用偷懒的字面算术替代深度会计调整。最后,监督微调(SFT)在零提示条件下带来了显著增益(单一指标 +8.54%,表格 +3.82%),验证了结构化逻辑可以通过以数据为中心的对齐得到部分恢复。
我们引入了一个人体动作识别的新问题领域:基于标准RGB视频对儿童步态行为进行细粒度分析。我们特别关注3至17岁儿童的行走模式。此类行为在脑瘫、偏瘫等若干关键发育性和神经肌肉疾病的诊断与治疗过程中自然产生。尽管具有重要的临床价值,当前基于3D传感器的步态分析系统成本高昂、具有侵入性,且对年幼受试者而言往往不切实际。为解决这一问题,我们构建了一个新数据集,包含来自110名受试者的超过1100个高帧率(60 FPS)视频序列,并配以同步且匿名化处理的人体姿态序列。在每次采集会话中,儿童执行一项5秒的"自由行走"任务,从多个视角捕捉完整步态周期。关键在于,我们证明当前最先进的方法(包括步态基础模型和多模态大语言模型,MLLMs)均无法有效解析这些临床细微差别。我们识别了分析这些不规则且微妙的运动模式所面临的关键技术挑战,并描述了一个用于解码儿科步态基本组成部分的统一端到端框架。通过全面的实验结果表明,该数据集具有推动新颖研究问题产生的潜力,并为自动化儿童步态评估建立了严格的基准。
视频世界模型以历史观测和控制信号为条件预测未来观测,通过自回归状态转换实现长程生成。与主要捕捉视觉外观和运动的传统视频生成模型不同,视频世界模型学习在智能体动作作用下支配环境演化的底层动力学,为具身智能和交互式仿真奠定基础。近期进展主要依赖于通过后训练或蒸馏来适配预训练的视频生成模型。尽管有效,这些方法通常需要复杂的训练流程、大量的计算资源,并且存在双向预训练与因果流式推理之间的不匹配问题。近期研究表明,从头训练自回归视频世界模型是可行且可扩展的。然而,社区仍然缺乏一个轻量级、透明且完全可复现的基线,能够在适度的计算资源下端到端训练。我们提出了MiniWorld,一个从头训练流式视频世界模型的可复现框架。MiniWorld采用块因果视频扩散Transformer,在预训练视频VAE的潜空间中使用流匹配进行训练。基于Diffusion Forcing,它采用分块非递减噪声调度和两阶段持续训练来改善时序建模和稳定性。在推理过程中,MiniWorld将滚动KV缓存与流水线异步去噪相结合,在有界计算下实现高效的流式生成。整个模型可以在单个8-GPU服务器上数天内完成训练。通过发布训练与推理代码库以及预训练检查点,我们希望MiniWorld能够促进视频世界建模的未来研究。
角色技能将个人交互历史蒸馏为可移植且可执行的工件,供下游智能体使用。这一过程在实现灵活个性化的同时,也集中了零散的个人信号,通过复用放大了其影响,并对针对单个记录或基于检索的记忆所设计的防御机制构成挑战。为系统性地研究角色技能流程的安全性,我们提出了AntiSkillBench,一个用于评估角色技能流程中风险与防御机制的端到端基准。该基准包括:(i)一个包含7,500条基于角色的人机对话轨迹的数据集,这些轨迹由50个行为特征丰富的用户画像构建而成,涵盖多种任务场景;(ii)一套评估体系,用于衡量三种技能蒸馏策略下的技能级隐私泄露、智能体级属性披露和行为模仿;(iii)一项防御评估,涵盖在线干预和事后干预的四种配置,包括主动风险抑制和被动来源保护。在三个前沿智能体上的实验表明,角色技能风险在不同智能体主干和蒸馏协议中持续存在,且从显性属性延伸至沟通风格和人格特质。现有防御机制表现出有限且依赖蒸馏策略的有效性,无法在不同风险和蒸馏策略间泛化。这些结果凸显了AntiSkillBench作为开发隐私保护和真实性感知角色技能挑战性基准的价值。
粘性污渍因其高粘度及复杂的流变特性,一直是机器人表面清洁面临的重大挑战。传统擦拭方式往往导致污渍扩散,而刷洗方式虽能提供更强的摩擦力,却存在损伤表面的风险。本文提出Push-Wiper框架,将粘性污渍清洁重新定义为聚集问题。Push-Wiper利用海绵通过分段推挤轨迹逐步聚集污渍,随后进入后处理阶段,将聚集的污渍脱离并实现海绵自清洁。我们采用逐步策略完成污渍聚集,并利用扩散策略(Diffusion Policy)生成自适应推挤动作序列。这些序列通过我们提出的任意表面姿态插值器(ASPI)与力-位混合控制器执行,使该方法能够泛化至空间分布多样的污渍。Push-Wiper的清洁评分(CS,定义为被去除污渍面积的百分比)较基线方法最高提升130%。在无需额外训练的情况下,Push-Wiper还能以零样本方式迁移至固体残留物、液体溢出物、未见过的粘性污渍以及不同几何形状的曲面。实验结果表明,Push-Wiper具备良好的清洁效果和强大的泛化能力。项目网站:https://push-wiper.github.io/。
世界动作模型(WAMs)通过联合建模机器人动作与未来视觉动态,已成为一种前景广阔的研究范式。然而,其对像素生成式未来监督的依赖可能将动作相关的状态转移与任务无关的视觉内容纠缠在一起,从而限制了在视觉分布偏移下的鲁棒性。我们识别出训练分布幻觉这一反复出现的现象,即基于视觉偏移观测所条件化的未来预测会生成训练域内容,而非忠实于当前场景。受控的三帧诊断进一步表明,DINOv3特征在视觉偏移下保持更为稳定,同时在保留任务状态区分度方面优于Wan-VAE潜变量。我们不致力于修正预测的未来,而是提出语义-时序世界动作模型(ST-WAM),通过使用DINOv3作为共享语义表征来进行未来预测与历史检索,同时保留细粒度的VAE动态信息。其双空间未来专家(DSFE)联合预测未来VAE潜变量和DINO特征,而当前锚定意图检索(CAIR)在当前视觉-语言上下文中从近期DINO历史中检索任务相关证据。ST-WAM以端到端方式训练,无需额外的具身预训练或任务特定标注,且在推理时无需显式生成未来。它在LIBERO上达到98.7%,在RoboTwin 2.0上达到92.8%;更重要的是,与Fast-WAM相比,它将零样本LIBERO-Plus性能提升了21.3个百分点,并将视觉偏移下的真实世界成功率从25.8%提升至61.5%,提升幅度超过一倍。这些结果表明,语义-时序建模有效补充了像素生成式动态建模,从而实现鲁棒的操控。
科学海报构建将长篇多模态论文压缩为可读、可编辑的画布。现有系统仅对已完成输出进行评分,从而掩盖了请求级失败;直接图像生成无法按元素编辑,而编码智能体工作流成本高昂。PosterMELD 是一种基于模板条件的多智能体流水线:容量感知的槽位在渲染前引导写作,确定性门控与视觉语言模型(VLM)审查将失败路由至有界修复。每个被接受的请求均导出可编辑的 PowerPoint(PPTX)与便携式网络图形(PNG)制品;显式设计控制可生成同一论文的多个变体。在 621 篇论文中,打印就绪率(PRR)统计通过几何、可读性、资产完整性及明显事实错误检查的请求,原生可编辑性则单独报告。一个冻结的 VLM 为打印就绪输出分配条件性工艺-和谐-表现力(CHE)分数。PosterMELD 达到 81.3% 的 PRR,为 P2P 的 3.4 倍、PosterGen 的 5.2 倍,并且在具备多个打印就绪输出的生成方法中取得最高的条件性 CHE。原生可编辑性与显式设计控制在每次请求平均成本 0.38 美元下得以保留,仅为 Codex+Skill 的 3.5%。代码与资源见 https://github.com/Shannon4Science/PosterMELD。
查询无关的KV缓存驱逐会一次性压缩上下文,并将所得缓存复用于任意未来查询,但在严格的预算下性能可能大幅下降。现有方法主要改进保留哪些原始KV对。我们引入RestoreKV,通过在同一总KV预算下引入学习式恢复来补充这种基于选择的方法。我们的关键洞见在于,尽管驱逐所丢失的信息依赖于具体上下文,但生成其紧凑补充的机制可以跨上下文共享。在上下文预填充之后,少量恢复token在单次LoRA适配的传递中关注完整KV缓存,生成一个紧凑的、由上下文条件化的恢复缓存。基础重要性评分器和驱逐规则保持不变,适配器在之后的所有查询和解码中被禁用。RestoreKV通过从冻结的全缓存模型进行参数高效的自蒸馏来训练,仅优化0.4%的参数,且无需任务特定调优。在四种骨干模型和四个长上下文基准上,RestoreKV显著减少了压缩引起的性能退化。在Qwen3-4B上,它在跨五种基础驱逐方法的60个配对且预算匹配的设置中改善了59个;在5%预算下,它将RULER-4K上的KVzip从38.2提升至73.2。应用于KVzip+时,RestoreKV在KVPress基准的16倍压缩下达到86.4的RULER准确率,同时在32K上下文评估中增加不到0.5%的一次性缓存构建开销。我们的项目页面可在 https://paper.pnu-cvsp.com/RestoreKV/ 获取。
推理语言模型经常过度思考:生成长串扩展行为,例如规避性表述、放弃当前思路以及自相矛盾,这些行为消耗了大量词元,却并未改善答案。我们表明,这些行为不仅仅是长度造成的结果;即使在控制回答长度后,错误轨迹中的无益自我反思比例仍高于正确轨迹。解决这一问题需要识别自我反思在哪些情境下有益、哪些情境下有害,但获取此类步骤级标注成本高昂。我们观察到,推理轨迹中的中间答案承诺可以提供一种廉价的代理信号:通过将轨迹中每个(拟)最终答案候选与标准答案进行比较,我们无需任何额外监督即可判断后续反思是否具有建设性。基于这一见解,我们提出 DASH(Drift Aware advantage SHaping,漂移感知优势塑形),根据每个推理片段是导向正确性还是偏离正确性来分配片段级信用。在竞赛级数学基准上,DASH 在过度思考普遍存在的场景下取得了最高准确率(平均准确率:59.45%,对比 Dr.GRPO 的 58.1% 与 GRPO 的 56.95%),同时减少了过度思考行为,并实现了比基线更具建设性的自我纠正。
我们识别出ALiBi位置编码一个此前被忽视的失败模式:其线性偏差缩放会导致浮点精度下溢,从而将很大一部分注意力权重置零,并使受影响的注意力头部分失明。我们分析了这一失败模式,描述了其影响,并考察了四种缓解策略。我们进一步证明,该失败模式也出现在基于ALiBi的最先进预训练模型中。使用1.48亿参数解码器模型进行的全面预训练实验,帮助我们将其影响与上下文外退化区分开来。我们发现,ALiBi的失败模式会严重损害词元检索,而对标准解码器基准只有轻微影响。我们提出了四种训练时缓解策略,并对其进行了单独及组合评估,发现对数缩放距离在passkey检索中带来最一致的改进。尽管存在这一问题,默认的ALiBi斜率仍然是出人意料的强基线,尤其是在大海捞针式检索中。基于这些发现,我们为使用ALiBi训练模型提供了具体建议。
仅权重量化可大幅降低大型语言模型(LLM)Transformer模块的存储占用,但实际后端通常仍以BF16或FP16保留最终的语言建模头(LM-head)。朴素地量化该投影会强烈扰动词表logit分布。我们提出ARCHead,一种打包式LM-head压缩器,它结合了量化低秩核心、分组INT4残差,以及在由激活值导出的度量下拟合的低秩校正。ARCHead不存储稠密的BF16头,并将持久化LM-head存储降至原来的1/3.7至1/3.9。在Qwen3-8B-Base上,其存储占用仅为BF16头的25.6%,同时达到1.007的相对困惑度;而同等存储的朴素INT4为1.14-1.16。替换AWQ或bitsandbytes遗留的BF16头仅增加0.006-0.007的交叉熵,且在我们测量中吞吐量变化小于2%。因此,ARCHead通过压缩块量化器不会量化的大型输出投影,对它们形成补充。代码可在 https://github.com/suayptalha/archead 获取。
法律信息检索(IR)中的一个常见任务是从判例法文集中查找相关的法律来源。虽然法律实践通常需要对特定案件段落的精确定位引用(pincites),但现有的大多数公开法律IR数据集缺乏段落级引注标注。然而,包含此类信息的公开数据集在查询文本中存在数据泄漏,并且将既不引用也不被引用的段落排除在语料库之外,这造成了不现实且过度简化的检索环境,可能导致性能虚高。为解决这些局限,我们构建了一个基于欧盟法院(CJEU)判决的大规模法律IR数据集。该数据集包含:(i)掩码的案件/段落查询,其中移除了引注信息;(ii)包含所有段落的语料库;以及(iii)案例级和段落级的基准真值引注,并经过部分人类专家验证。我们的数据集支持法律IR方法在多个查询-文档层级(案例到案例、段落到案例以及段落到段落的检索)上的开发和严格评估。数据集链接:https://huggingface.co/datasets/theresiavr/legalpincite
基于音频的钢琴转写在起音、音高和力度上表现良好,但延音踏板使声音在琴键释放后仍持续很久,因此音频系统预测的是踏板延长的音符结束偏移,而非物理上的琴键释放。然而,现有的视觉钢琴转写(VPT)系统侧重于从短视频窗口中进行起音检测,其偏移准确度远落后于起音,且尚未见音符级力度预测的相关报道。为解决上述不足,我们提出了V2N(Video to Notes),这是首个完整的VPT系统:一个共享的时间骨干网络为起音、偏移、按键保持和力度等任务特定头部提供特征,并通过逐帧监督而非仅在窗口中心进行联合训练。消融实验表明,多任务监督能够在提升起音准确度的同时实现偏移和力度预测;更长的时序上下文可带来进一步改进。V2N在PianoVAM和R3数据集上取得了新的最先进结果。
基于MLLM的分割面临一个核心分割三难困境:高分割性能、保持对话能力与快速推理难以兼得。嵌入预测方法可能通过像素级目标干扰语言建模,而逐词生成对于稠密掩码而言效率低下。我们提出全掩码预测(All-Mask Prediction),将自回归对话与非自回归掩码预测解耦。其二元实例化方法STAMP(Simultaneous Textual All-Mask Prediction)在词汇表内发出<SEG>触发标记,将图像对齐的掩码令牌与对应补丁特征融合,并利用混合注意力在一次前向过程中将所有令牌分类为前景或背景。由此,该方法在保持多模态能力与高效推理的同时,实现了强指代分割与推理分割。然而,二元掩码无法在不进行重复目标特定预测的情况下保留多个语义或实例身份。为此,我们提出结构化全掩码预测(Structured All-Mask Prediction)并开发了STAMPlus。该方法生成带有显式ID和可选边界框的目标列表,将这些ID绑定到共享的多类掩码空间,并在一次非自回归前向过程中联合预测所有目标。一个统一的检查点保留了STAMP的指代与推理能力,同时扩展至开放词汇语义分割、实例感知分割以及遥感小目标分割,其中高分辨率掩码令牌缩放保留了更精细的空间证据。在上述各场景中,STAMPlus实现了最先进的分割性能,保持了通用多模态指令跟随能力,并将12类别的推理延迟从STAMP重复推理的13.50秒降低至5.16秒。进一步的分析表明,准确的目标线索能够提升分割性能,而学习到的空间接地有助于二次查看推理。总体而言,STAMPlus在超越单目标预测的范畴上解决了两难困境。
同策略训练已成为提升大语言模型推理能力的一种强效后训练范式,通常借助来自更强专家模型的黄金轨迹进行增强。然而,当专家在更困难的问题上失败时,现有的轨迹引导方法会失去其主要监督来源,这些失败轨迹通常作为负样本被丢弃。我们认为,此类失败——我们称之为黄金负轨迹——若不被视为供模仿的示范,而是被视为可供反思的有缺陷轨迹,仍能提供有价值的推理信号。我们识别出一种"反思优势":对于困难问题,对有缺陷轨迹进行反思可能比从头直接求解更容易、更有效。基于此,我们提出ReflectRL,一个轻量级即插即用框架,在同策略训练中从黄金负轨迹中学习。ReflectRL首先利用这些轨迹引发反思推理,然后通过反思到直接策略迁移将习得的推理行为迁移回直接推理。在9个基准测试、4个大语言模型底座和4种同策略训练方法上的实验表明,ReflectRL以极小的开销持续提升了推理性能。
自一致性假设采样推理轨迹中最频繁的答案最为可靠,但这一假设在因果推理中可能失效:样本往往重复相同的混杂错误,且投票分散在多个有效答案之间,导致无效答案胜出,而有效的少数轨迹被忽略。我们提出了CALVER(Causal Axiom-Level VERification,因果公理级验证),一种无需训练的符号验证器,它依据Pearl因果准则(包括d分离、后门调整和干预)对结构化轨迹进行评分,并在不参考参考答案的情况下选择得分最高的候选。在CLEAR数据集上允许多个图有效答案的“查找单一有效答案”查询中,CALVER达到42.1%的准确率,而在相同的冻结候选池上,多数投票、奖励模型、LLM评判器和模型置信度均维持在30%左右。将评判器扩展到720亿参数也未能缩小这一差距。在经审计的干净核心子集中,21个图有效的CALVER选择中有11个不同于基准测试列出的答案,但仍满足所要求的谓词。该优势随采样预算增加而扩大,并在十个已发表的贝叶斯网络、第二个模型系列以及模型必须从文本构建图的设置中得以复现。CALVER还改善了基于精确真值的阈值化平均处理效应决策,在真值表检查器下可推广到逻辑推理,并在CPU上以毫秒级速度为每个候选评分。CALVER仅需因果结构——可直接提供或从文本中构建;只要满足这一条件,选择即可通过因果有效性进行聚合。
历史语言变化影响形态学、句法学、语义学和语用学,然而计算研究通常使用不相容的表示方法来考察这些层面,因此无法确定它们在不同语言中是否共同演化。我们通过在单一分析空间内考察变化的幅度和方向如何跨语言层面、跨语言、跨历史时期变化来应对这一问题。我们提出ChronoLens框架,该框架结合了冻结多语言语言模型、特征对齐交叉解码器(feature-aligned crosscoders)和事后语言干预(post-hoc linguistic interventions),并将其应用于来自五个议会传统、涵盖1803年至2026年的4498万篇文档、约172亿词元。由此产生的稀疏表示与语言学统计量的一致性显著强于稠密嵌入或池化稀疏自编码器(ρ=0.72对0.29和0.28),并揭示出形态学、句法学、语义学和语用学在同一语言内的变化幅度总体相当,而不同语言在变化时间、变化程度和变化方向上存在显著差异。这些发现表明,历史语言变化是一个结构化的多维过程:相似的变化幅度可能掩盖不同的变化轨迹,而有意义的跨语言比较需要同时衡量距离和方向。
图表问答(CQA)要求多模态大语言模型(MLLMs)将视觉理解与逻辑推理相结合,然而当前模型难以实现精确的视觉定位和连贯的推理链。尽管外部思维链提示和视觉线索能够显著提升性能,但现有MLLMs缺乏内在的视觉基础推理能力,导致感知不准确以及推理与视觉证据相脱节。为克服这些局限,我们提出CURV——一种课程学习框架,通过将CQA重构为多步视觉基础推理来培养内在的视觉推理能力,其中每一步通过空间注意力集中将逻辑推理与动态视觉定位相协调。为辅助模型学习,我们进一步引入CCQA,一个包含三个级别的课程数据集,具备跨多样图表类型和推理模式的可扩展合成生成能力。该课程系统性地从基础的单操作推理逐步过渡到复杂的多图表组合任务。实验表明,CURV相较于基线模型实现了高达20.50%的性能提升,并且能够泛化到真实世界基准(最高提升12.30%)和跨领域多模态推理任务(最高提升10.20%),从而验证了通过动态定位内化视觉推理以增强图表理解能力的有效性。代码已在 https://xhguo7.github.io/CURV/ 提供。