每日精选AI研究论文及翻译
视觉语言模型(VLM)在如DocVQA、ChartQA和MMLongBench-Doc等视觉文档理解基准测试上取得了优异表现。然而,真实世界的文档往往融合了多种因素,如文档长度、布局复杂度、模态构成和问题难度,这使得难以将模型失效归因于具体原因。我们提出SynthDocBench,一个全合成的长上下文视觉文档理解基准,能够系统控制文档长度、布局结构、模态组合和问题类型等因素。该基准采用组合设计构建,每个因素在生成的文档中独立变化,从而实现对模型行为的可控分析。文档通过LLM管道端到端生成,涵盖六种布局原型,并加入40%的随机覆盖以防止模型利用虚假相关性。此外,SynthDocBench包含比现有基准更长且结构更多样化的长上下文文档。通过评估七个前沿VLM,我们发现了现有基准无法揭示的三种失效模式:随着文档长度增加性能急剧下降;系统性的位置敏感性——五个模型中有六个(注:原文如此,应为“五个模型中的四个”或类似表述,但直译为“五分之六”显然有误,可能原文笔误,根据上下文推断为“五个模型中有四个”或“六个模型中的五个”更合理,但精确翻译保留原文)在文档中间三分之一部分表现最差,且六个模型中有五个呈现负向的早期到后期趋势(最大降幅达8.3个百分点);以及在长文档场景中图表理解能力的崩溃。这些结果表明,当前模型可能过度拟合基准测试中的人为特征,而非实现了鲁棒的长上下文视觉文档理解。
本文提出SpectraReward,一种无需训练的奖励函数,可将预训练多模态大语言模型(MLLMs)直接转化为图像生成强化学习的现成奖励模型。不同于要求MLLM评判生成图像或回答分解后的验证问题,SpectraReward通过单次图像条件化的教师强制前向传播,衡量从生成图像中恢复原始提示的准确程度。我们将平均图像条件提示对数似然作为奖励,直接复用MLLM预训练的图像-文本对齐能力,无需偏好标签或奖励模型微调。进一步地,我们引入Self-SpectraReward——针对统一多模态模型的特殊情况,其中策略自身的理解分支作为其生成分支的奖励模型,形成无需外部奖励模型或外部知识的闭环自我改进框架。大量实验验证了SpectraReward的有效性,涵盖两种扩散模型、三种强化学习算法、来自四个MLLM系列(参数规模从4B到235B)的九种奖励MLLM骨干网络,以及五个分布外文本到图像基准测试。结果表明,SpectraReward和Self-SpectraReward均能显著且一致地提升生成性能,并超越此前基于MLLM的奖励训练方法。进一步分析揭示,更大规模的奖励MLLM并非总是更好,而Self-SpectraReward能够匹配甚至超越规模更大的外部奖励模型,这表明奖励-策略对齐是图像生成强化学习的关键因素。项目主页:https://huangrh99.github.io/SpectraReward/
视觉生成器擅长渲染,却会自信地编造自身未知的内容。用户需求无穷无尽、持续演变且深度呈长尾分布:新角色、热门实体、截止日期后的事件等层出不穷。这种世界知识瓶颈在结构上是根本性的:生成器基于固定语料库训练,而视觉世界却是开放式的。我们构建了 SearchGen-20K 和 SearchGen-Bench 数据集,包含涵盖十二类故障模式、二十二个领域的20,839条提示词,并配套提供预执行的 SearchGen-Corpus-1M 多模态语料库,以支持离线、可复现的研究。在 SearchGen-Bench 上,前沿开源生成器满分100分仅得21至28分,较现有基准出现40分的断崖式下跌。自然的解决方案是引入搜索工具,实现智能体式视觉生成。然而我们发现,简单搜索并不可靠:它会无差别检索,向生成器原本能处理的提示词中注入噪声。我们追踪到根本原因在于生成器特有的、动态变化的知识边界——即生成器通过训练能够内化的知识与必须保留在外部上下文中的知识之间的分界线。虽然这一边界难以预先界定,但我们证明它可以通过"先教学后搜索"的协同训练框架来发现。即便是该协同训练方案的最小实现也能产生单调改进,为视觉生成领域实现递归式自我改进、满足世界知识驱动的需求奠定基础。我们发布完整数据集、协同训练语料库和搜索语料库,作为面向工具增强、基于世界知识的视觉生成的可复现测试平台。
现代AI模型在许多既定基准测试中表现优异,但在人类几乎能轻易完成的任务上仍然失败,例如操控一根绳子或画一只五条腿的狗。这些例子表明,现有基准测试可能低估了当前系统中持续存在的盲点。我们推出blind-spots-bench——一个旨在通过人类看似简单但对现代AI仍具挑战性的任务来暴露此类盲点的基准测试。我们从AI课程的学生中收集原始问题,进行清洗并添加结构化参考解决方案的注释,针对由此产生的235个样本数据集提出了一套任务分类体系。我们进一步开发了自动化评分流程,用于评估包括开源权重模型、闭源模型、视觉语言模型以及图像生成模型在内的广泛模型。我们对blind-spots-bench的分析发现,闭源前沿模型能够显著超越开源权重模型,差距甚至达到约10%,即便它们在现有基准测试中表现相当。更细粒度的分析表明,没有单一模型在所有任务类型上占据主导地位,且某些任务对所有评估模型而言依然充满挑战。这些结果凸显了blind-spots-bench作为诊断性压力测试的价值,有助于识别当前现代模型的具体弱点。
编码代理必须将外部工具返回结果整合到持续推理中——这一能力是标准从左到右代码预训练仅以其前向方向所暴露出来的。我们观察到,编码代理的动作-观察-持续循环在结构上同构于函数调用点,其中调用者绑定参数,被调用者返回在其他地方计算的值,而下游代码消费该值。这种条件化结构在普通代码中以互联网规模存在。我们通过函数感知的填充中间(FIM)中训练来利用这一点:这是一种自监督目标,它掩码通过程序依赖图分析以及复杂度-可推断性双标准所选择的函数。我们在一个来自968个GitHub仓库、经过去污染处理的26亿token语料上对Qwen2.5-Coder-Instruct(7B/14B)和Qwen3-8B进行中训练,然后应用现有的代理后训练流程。中训练在SWE-Bench-Verified上提升+2.8/+3.0(7B/14B),在Qwen3-8B上提升+3.2;在相同模型上SWE-Bench-Lite的提升分别为+3.7/+4.0/+5.4。该改进在两种后训练流程(R2E-Gym,SWE-Smith)以及非Qwen2.5基座(使用SWE-Lego的Qwen3-8B)上均保持一致。除了领域内增益,中训练还缓解了代理后训练否则会在非代理编码(如LiveCodeBench)和非编码工具使用基准(tau-bench,BFCL)上造成的能力侵蚀:尽管中训练语料仅包含Python代码,但函数调用归纳偏置在后训练中得以保留并产生一致增益。
基于大语言模型的编码智能体已在自动化软件问题修复方面取得显著进展,但其仍极易因对代码库理解不足而产生事实性错误。近期方法试图通过预修复阶段的代码库探索来缓解这一局限,然而这些修复驱动策略在未识别智能体知识空白的情况下进行探索,往往提供不精确的上下文信息,无法弥合根本性的认知缺陷。本文提出ACQUIRE——一个面向软件问题修复的问答驱动框架。如同经验丰富的开发者修复代码前先理解陌生代码库的运作方式,ACQUIRE在修复前显式获取代码库知识。该框架通过两个阶段将知识获取与补丁生成解耦:第一阶段,提问者与解答者协作获取结构化代码库知识,其中提问者提出针对性问题,解答者通过自主探索生成基于证据的答案;第二阶段,解析器利用生成的问答知识生成信息完备的补丁。通过将隐式知识空白转化为明确且事实可靠的理解,ACQUIRE加速了知识密集型修复环节,实现了更精准的问题修复。在SWE-bench Verified基准上的实验表明,ACQUIRE始终优于代表性的预修复方法,在适度增加成本和时间的前提下,将Pass@1提升了高达4.4个百分点。
现有的自动音乐转录方法通常局限于单乐器录音,或无法处理复杂的真实音乐混音。尽管已有研究使用合成训练数据,但得到的模型泛化能力差,在真实的多乐器场景中生成的转录结果基本不可用。本研究分析了合成数据在预训练中的有效性,并将其与真实音乐音频上的微调、以及使用强化学习的后训练相结合。我们进一步引入基于乐器存在状态的条件控制,以实现转录结果的定制化。最后,我们发布了MuScriptor——一个开放权重的多乐器音乐转录模型,该模型适用于来自多种音乐流派的真实世界音乐录音。
主流视觉编码器均基于自然图像进行预训练,无法直接有效应用于文档图像,因为密集文本和精细字符笔画要求模型具备字符级视觉感知能力。本文提出MonkeyOCRv2——面向文档AI的视觉-文本预训练模型。首先,我们构建MonkeyDoc v2,据我们所知是目前最大的文档图像预训练语料库,包含1.13亿张图像,涵盖17种语言。其次,我们提出一种联合学习图像到文本生成与像素级文档重建的预训练策略:前者将视觉表征与文本内容对齐,后者保留字符笔画和布局细节。我们在五项代表性文档分析任务上开展大量实验,包括文本识别、公式识别、文本检测、文档篡改检测和重叠文本分割。将原始编码器替换为MonkeyOCRv2后,五项任务性能均持续提升。最终,我们验证其作为多模态大语言模型视觉编码器在更具挑战性的文档解析与文档理解任务中的有效性。固定该编码器并配合轻量级语言模型,即可得到参数量为0.7B的文档解析模型,其在MDPBench(近期发布的涵盖17种语言数字原生及拍摄文档的基准测试)上创下新的开源最优性能,在视觉编码器规模约为1/11的情况下,比此前最佳3B参数模型dots.mocr绝对提升2.8%。该冻结编码器还赋能一款文档理解模型,在相同训练设置下,其在八个基准测试中的表现均优于基于CLIP、DINO和SAM的同类模型。这些结果表明,面向文档的视觉预训练可独立作为文档智能的基础。
从利用深度神经网络逼近状态-动作值函数,并借此攻克最具挑战性的游戏之一,到算法层面的突破使得即使不明确陈述待解决问题的规则也能完成求解,强化学习研究在过去十年间始终是科学进步的核心推动力。本文聚焦于这一研究进展中的关键要素,系统分析了强化学习领域经典的评估与设计范式。我们介绍了强化学习尺度化理论的数学基础,并证明强化学习算法的渐近性能在性能排名与数据规模区间之间并不存在单调关系。通过大规模实验,我们展示出在经典设计与评估范式指导下的一系列强化学习研究得出了错误结论。本文的分析与结果为深度强化学习的尺度化、容量与复杂度研究提供了核心理论依据。
大语言模型智能体正开始通过耦合规划、代码执行、调试和经验反馈来实现机器学习工程的自动化。然而,将该能力迁移至医学影像领域仍面临困难,因为每项任务都涉及模态特定的实验设置、严格的验证协议要求以及预测产物的准确性约束。本文提出AMID,一个用于医学影像模型开发的自主多智能体框架。AMID首先提出数据条件化方法规划,通过基于任务特定数据分析和可运行的医学影像资源,将粗粒度的任务级搜索空间细化为可执行、可并行化的方法路径。随后,AMID开发了验证引导的两阶段优化策略:从对多样化方法路径的广泛早期探索,转向对候选方案的定向利用,并在整个优化过程中强制实施对验证协议、评估指标计算和预测产物的严格核查。在涵盖多种模态和预测类型的20个医学影像挑战任务中,AMID的表现优于所评估的通用型机器学习工程系统,并在一部分任务中接近甚至达到了高水平人工设计的挑战解决方案。这些结果表明,AMID能够将特定任务的医学影像模型开发从定制化人工工程转变为一种面向异构任务、可产出高性能且可审计模型产物的智能体工作流。
本工作提出了一种视觉模型的统一框架,其中除自然图像外的多种视觉信息形式(如掩码、深度图及其他结构化视觉信号)均可表示为RGB图像,而通用视觉任务则可转化为一个标准的RGB到RGB图像编辑问题。在此范式下,不同类型的视觉信息在内部与自然图像共享相同的编码解码架构及参数,从而使单一模型能够通过统一的视觉接口跨任务迁移,其运作方式类似于语言模型对文本的处理。我们将这一框架称为RGB输入与RGB输出(RINO)。基于通用图像编辑骨干网络且无需任务特定微调,RINO在密集理解任务(如分割与深度估计,我们将输出统一为RGB)和密集条件生成任务(如姿态到图像生成,我们将输入统一为RGB)上均展现出稳健且具有竞争力的零样本性能。我们期望这项研究能为通用统一视觉-语言系统提供有益启示——在该系统中,多样化的视觉任务可通过共享的视觉语言进行表达、解释与求解。代码已开源:https://github.com/yangtiming/RINO。
针对预测任务微调的大型语言模型可能准确但校准不佳,其思维链推理也未必忠实反映预测背后的证据。我们探究内部表征是否能为这两方面提供更直接的视角。基于Eternis-Forecaster 8B模型与OpenForesight数据集,我们训练了中间激活的表征池化探针,发现其校准效果显著提升;这一结论同样适用于GLM-4.7-Flash和GLM-4.5-Air模型。随后,我们通过证据消融与干扰注入评估思维链的忠实性:移除提示中的关键信息常能改变模型预测,但推理轨迹却保持原样。相同的探针可作为谎言检测器:其激活值追踪行为变化的准确度远高于推理轨迹,且在84%的案例中能预测变化方向,包括当思维链掩盖扰动影响时。最后,强制回答实验表明,预测在推理开始前已基本固化:仅需一次推理前的传递即可复现既定答案与置信度,而根据预设答案分布的离散度路由问题,可在不损失准确率的前提下节省30-47%的生成词元。综合而言,这些结果确立了将内部表征探查作为校准、审计与分流语言模型预测系统(乃至更广泛的推理模型)的实用工具。