每日精选AI研究论文及翻译
AI智能体已能自主完成简短且定义明确的任务。然而,现有的终端基准主要聚焦于几分钟内可解决的简单问题,且仅通过最终结果进行评估。这种设置忽略了中间进展和部分解决方案,导致奖励信号稀疏,无法全面反映智能体能力。为此,我们提出长时终端基准(Long-Horizon-Terminal-Bench),这是一个包含46项长时任务的终端基准,覆盖实验复现、软件工程、多模态分析、交互游戏和科学计算等九大类别。每项任务均遵循终端基准风格,配有参考解决方案或仿真引擎,但进一步分解为细粒度的分级子任务。这一设计支持密集的中间奖励和部分得分,使评估不仅能判断智能体是否达成最终目标,还能衡量其在开放式工作流中的进展程度。该基准中的任务通常需要数百个回合和数分钟至数小时的执行时间,强调长时规划、长上下文管理及迭代调试,而非一次性的问题解决。我们对15个前沿模型进行了评估,发现智能体每项任务平均消耗990万token,每轮运行约需231个回合和85.3分钟的执行时间,这使得长时终端基准比此前基于终端的基准更具挑战性。即使是最强的测试模型,在部分奖励阈值为0.95时,pass@1也仅为15.2%,在完美奖励阈值1.0下则为10.9%;而所有模型在这两个阈值下的平均通过率分别为4.3%和1.7%。这些结果表明仍有巨大改进空间。我们进一步分析了失败模式和错误类型,并开源长时终端基准,以支持长时终端智能体的未来发展。
大型基础模型的快速进步主要依赖于在大规模文本语料库上的预训练。然而,许多知识通过视觉表征传递——图表、排版方程和页面布局承载着丰富的信息,这些信息仅凭文本无法准确或完整地捕捉。然而,当前的预训练方法丢弃了这些视觉线索,将文档和网页等视觉丰富的源材料转换为纯文本,以学习语言智能。本文挑战了语言模型必须在纯文本表示上训练这一默认假设,并证明视觉预训练是基础模型智能的一种可扩展学习方法。为此,我们对无需文本提取而直接利用视觉文档的无监督视觉预训练范式进行了系统研究。在多种骨干网络和基准测试中,对相同底层语料库进行的视觉预训练始终优于纯文本预训练,为可扩展的语言智能提供了一条高效路径。
在下一个词元预测的驱动下,自然语言处理从任务专用模型转向了强大的通用基础模型。那么,在计算机视觉中,实现通用模型所需的等效催化剂是什么?本文认为,大规模的文本到视频生成为计算机视觉提供了一个强有力的预训练范式,为通用视觉智能提供了必要的时空先验、视觉-语言对齐以及可扩展性。我们提出GenCeption,利用预训练的视频生成扩散骨干网络来定义一个前馈感知模型,该模型能够根据文本指令执行各种视觉任务。实验结果表明,GenCeption在深度估计、表面法线估计、相机位姿估计、表达式指代分割及3D关键点预测等一系列任务中达到了最先进性能,通常能匹配甚至超越专用模型(如DepthAnything3、SAM3、D4RT、VGGT-Omega、Sapiens、David、Genmo和Lotus-2)。此外,在可比设置下,视频生成预训练骨干网络优于其他预训练范式(如V-JEPA和Video MAE)。重要的是,GenCeption展现出初步的数据与模型缩放特性,以及卓越的数据效率——使用比D4RT和VGGT-Omega少7到500倍的训练数据即可达到与这些领先模型相当的性能。最后,GenCeption还表现出引人注目的涌现行为:仅使用合成人体视频训练的模型能够泛化到真实世界影像以及分布之外的目标类别(例如动物和机器人)。这些发现表明,视频生成不仅仅是一种合成工具,更是通向物理世界通用视觉智能的基础路径。项目页面:https://genception.github.io
宏大目标难以一蹴而就,分步实现更为明智。我们提出信任区域策略蒸馏(Trust Region Policy Distillation, TOP-D),通过动态构建邻近教师(proximal teacher),将原本极不稳定、高方差的在线策略蒸馏(On-Policy Distillation, OPD)转化为稳定的训练范式。理论层面,我们构建了一个严谨的框架,证明TOP-D能够内在地控制梯度方差;通过给出形式化的全局收敛分析与单调提升界,我们从数学上形式化了整体训练动态的可靠性与稳定性。实验层面,TOP-D在数学推理任务上显著提升了训练稳定性、样本效率与最终性能。更重要的是,TOP-D不引入任何额外计算开销,这使其成为成熟OPD范式的一个有前景的替代方案。
训练后量化(PTQ)是一种广泛采用的、无需重新训练即可压缩大型语言模型(LLM)的技术。现有的二阶PTQ方法(包括GPTQ)仅从输入激活统计信息构建量化目标,实际上假设所有输出通道对逐层重建目标的贡献均等。我们提出KronQ,一种通过将梯度协方差引入量化流水线来挑战这一假设的PTQ框架。在基于克罗内克因子分解的海森近似下,量化损失同时依赖于激活协方差和梯度协方差,而KronQ在两个互补层面上利用了这一特性。(1)KronQ引入双向非相干处理,通过梯度协方差将现有的输入侧随机旋转扩展到输出维度,从而在输入和输出两个维度上降低权重幅值的方差。(2)KronQ推导出一种新的灵敏度指标,用于基于梯度和激活海森迹的层间混合精度分配。值得注意的是,在LLaMA-3-70B的2比特权重量化场景中,当GPTQ和GPTAQ发散或产生退化量化(在WikiText-2上困惑度超过2000)时,KronQ实现了7.93的困惑度。
大规模文本到图像模型因其RGB生成预训练能学习丰富的语义、结构与几何先验,成为密集预测任务中极具吸引力的主干架构。现有生成式与编辑方法通过将密集预测转化为目标生成来复用这些先验:深度、法线、透明度蒙版、分割掩码、热力图等标注被编码至RGB预训练的VAE潜在空间,再解码为类图像目标。我们认为,这种做法继承了比密集预测所需更多的生成式输出接口——与RGB合成不同,密集预测要求在同一图像平面上输出像素精确、任务原生的场,而非渲染新的RGB内容。我们的关键观察是,预训练的DiT已通过图像平面上的"块到令牌到块"网格结构组织RGB输入,因此每个令牌索引一个固定的输出块,其通道可承载任务原生量而非RGB外观。我们将其实现为ReChannel:保留用于DiT输入分布的VAE编码器,但舍弃目标侧解码器;通过任务LoRA适配冻结的DiT,并通过共享的令牌局部线性头(约33K参数,无空间混合)将每个令牌映射至其p×p×K_t像素空间块。基于FLUX-Klein,我们在六个密集预测任务及十余个基准上评估了该方法。这一极简接口在无三元图抠图、KITTI深度和指代分割上创下新最优结果,并在法线、显著性、姿态估计上保持竞争力。在匹配的4B参数设定下,其准确率更高且速度比"编辑+潜在解码"方案快2.48倍——密集感知可从生成式预训练中获益,而无需继承其输出接口。
长上下文处理对于大语言模型(LLMs)正变得日益重要,但简单地扩展上下文窗口并不能保证有效利用长输入。随着输入长度增长,准确率往往会下降,这表明模型在识别和使用与问题最相关的证据方面仍存在困难。提升长上下文利用率的一种有前景的方法是测试时训练(TTT),该方法将测试上下文视为训练样本,进行实例特定的参数自适应。然而,将TTT应用于整个长上下文的计算成本过高,而在随机采样段落上进行自适应则会产生严重的噪声。由于长上下文中的大多数段落与特定问题无关,基于这些段落的训练甚至可能降低基础模型的性能。我们的前期研究表明,TTT对训练段落的质量高度敏感:在LongBench-v2上,对随机采样段落进行TTT会损害性能,而对理想段落进行TTT则能显著提升性能。受此启发,我们提出一种简单方法——自引导TTT(S-TTT):在自适应之前,模型先识别出应学习的证据段落,并仅对这些选定段落应用标准语言建模训练目标。在两个具有挑战性的长上下文推理基准(LongBench-v2和LongBench-Pro)上,S-TTT同时提升了Qwen3-4B-Thinking-2507和Llama-3.1-8B-Instruct的准确率,最高实现了15%的相对提升。
微调大语言模型以注入新知识面临一个关键挑战:模型能快速记忆新事实,却无法将其应用于下游推理任务。我们将这种失败形式化为**知用鸿沟**,其特点表现为准确率差距以及记忆与泛化之间的时间延迟。为理解这一现象,我们使用未知知识微调大语言模型,并采用一种名为"自修补"的新型干预技术,监测知识在模型内部的空间渗透动态。自修补能识别出通过重新定位表征可显著改善失败泛化案例的激活位置。这些结果与知识回路失调假说一致:记忆的表征可能存在于模型内部,但未被路由至计算有效的层。为验证这一诊断发现的实用性,我们设计了一种简单启发式策略,该策略可恢复58%-75%的理论优化空间,用于解决泛化失败问题。跨领域实验验证了该发现的稳健性。
在本工作中,我们旨在通过利用全景表示的旋转等变性(旋转可视为一种隐式几何变换)来解决全景世界模型中的长程记忆挑战。基于这一洞见,我们提出了PanoWorld,它通过固定航向将相机轨迹简化为平移,并利用密集全景射线条件(DPRC)和几何感知记忆增强(GMA)分别实现当前动作建模与长程记忆。随后,我们引入了一个三阶段训练流程,逐步优化每个组件。为了更好地评估在现有数据集相对稳定的大尺度空间变化和多样化光照条件下的物理一致性,我们构建了World360,这是一个包含通过全景无人机采集的真实世界视频片段以及通过AirSim360生成的高质量模拟片段的大规模数据集。在World360上的大量实验证明了PanoWorld的有效性,其性能远超其他方法。我们的模型、训练代码和数据集将公开发布。更多信息可访问我们的项目页面:https://lihaoy-ux.github.io/panoworld-page/。
真实且多样化的交通仿真对自动驾驶发展至关重要。然而,现有基准测试主要奖励真实性,近期方法也据此优化,导致多样性尚未得到充分探索。我们提出Flow-ERD,一种同时追求真实性与多样性的多智能体模拟器。其主干——智能体类型感知流匹配(AFM),将流匹配的多模态表达能力与类型特定的运动学执行相结合,在保持运动与各智能体类型一致的同时,保留精细粒度的多样性。第二阶段——熵正则化蒸馏(ERD),通过熵正则化的逆KL散度目标微调闭环轨迹分布,在缓解协变量偏移的同时,明确防止模型坍缩至高密度模式。我们采用无日志多样性度量及标准真实性评分评估Flow-ERD。Flow-ERD在WOSAC测试基准中排名第一,并在可复现基线中主导了真实性与多样性的帕累托前沿。项目页面详见https://seulbinhwang.github.io/flow-erd-project-page/{这里}。
医学本质上是多模态的,要求临床医生整合来自不同数据流的信息。然而,多模态基础模型的开发因大规模高质量临床数据获取受限而受到制约。尽管PubMed Central(PMC)提供了专家撰写的图像-文本数据作为补充来源,但现有基于PMC的数据集在保真度、可重复性和临床验证方面仍存在局限。我们提出MedPMC——一个自动化、可持续更新的框架,可将许可开放的文献转化为医学多模态模型的高保真基础设施。应用于610万篇PMC文章后,MedPMC整理出1100万对医学图像-文本数据。组件评估显示,在初始筛选(F1=93.2)、多面板图形检测(F1=96.5)、图形分离(mAP=89.8)、标题分离与对齐(F1=81.4;ROUGE-L=85.3)以及医学图形分类(F1=96.5)方面均表现优异。由五位标注员(其中三位具有医学背景)进行的人工审核发现,MedPMC图像中95.3%具有医学相关性,而此前基于PMC的数据集该比例仅为19.7%。在涵盖11个专科的26项基准测试中,使用MedPMC训练的CLIP风格模型在零样本AUC上平均比最强的架构匹配生物医学CLIP基线高出7.1个百分点,尽管其使用的图像-文本对数量不足后者一半。作为多模态大语言模型的视觉编码器,该模型在两个基准测试中将医学视觉问答性能分别提升了1.9和16.9个百分点。在耶鲁纽黑文健康系统的10524张皮肤病学照片中,该模型将形态学到图像检索的Recall@5提升了11.7个百分点。这些发现表明,高保真文献整理能够强化医学多模态基础模型在基准测试和临床场景中的表现。我们公开发布该框架、语料库、基准测试及预训练模型。
语音分割与识别本质上是相互关联的任务,但现代方法通常分别对二者进行建模。我们认为,音系结构已隐含在自监督语音模型(S3M)的表征中,只需引导这些模型即可解决这两项任务。我们提出基于S3M的音系激活映射(SPAM)方法,该方法将每个S3M表征帧映射为一个音系特征激活向量,例如发声性、鼻音性等特征。在SPAM基础上,我们引入了两个简单却有效的轻量级无梯度下降预测头:识别头与分割头。该方法仅需不到一分钟的音标转录数据,且能泛化到训练中未见的音素。在多种数据集上,我们的方法均取得了优异的分割与识别性能。
我们提出 Soofi S 30B-A3B,这是一个面向德语和英语的主权级、开源混合专家模型,采用 Mamba-Transformer 混合架构。其混合设计使得每 token 仅激活 30B 参数中的 3B,且推理缓存随上下文增长几乎保持恒定,在长上下文、高并发部署场景下,相比稠密模型具有显著的吞吐量优势。该模型在约 27 万亿 token 上预训练,并特意增加了德语权重,在英德综合基准测试上媲美稠密 14B 至 27B 模型,同时在 17 个开源基座模型中,于两种语言均取得了最佳代码综合得分,并超越了我们比较中的所有欧洲主权基线模型——包括那些活跃参数规模更大的模型。在所有完全开源模型中,Soofi S 取得了最高的英德评测得分,领先于 Olmo 3 32B 和 Apertus 70B。Soofi S 基于德国工业 AI 云实现端到端构建,该云是由德国电信在慕尼黑运营的主权级 HPC 规模 AI 基础设施。Soofi S 将以高度宽松的开源条款发布:包含权重、选定的中间检查点、完整的逐来源数据说明、超参数、训练与评测代码。在来源许可允许的情况下,数据构建工件将以宽松许可证发布;商业授权来源则以汇总统计数据和精确混合比例说明的形式记录。
视觉-语言模型(VLMs)通过将三维数字化与自然语言文物探索相结合,使交互式数字博物馆的可行性日益增强。然而,在诸如古希腊陶器等文化遗产领域,可靠的VLM辅助受限于两大挑战。首先,开放式解读要求将细粒度的二维/三维视觉证据锚定在专业的策展知识中,但检索过程可能引入弱来源和不可验证的引用。其次,当可用证据不完整、存在噪声或模糊不清时,VLMs往往给出自信但缺乏依据的答案,而非经过校准的不确定性。为应对这些挑战,我们提出VaseMuseum——一个面向古希腊陶器智能数字博物馆的轻量级、模块化多模态智能体框架。VaseMuseum将交互式虚拟博物馆与VaseAgent相结合,后者通过多模态感知、三维感知推理、外部知识检索以及推理时可靠性控制,同时支持二维图像和三维文物。具体而言,VaseAgent从权威网络和博物馆知识源中检索证据,并在生成前通过源级控制选择多样且可验证的证据。同时,响应级控制将生成的陈述与证据池进行核对,并在支持不足或存在矛盾时鼓励中立的、基于证据的答案。此外,一种免训练的GRPO风格选择机制更倾向于选择包含有效引用和校准置信度的响应,且无需更新VLM主干网络。在真实的数字博物馆模拟实验中,与支持检索的VLM基线相比,VaseMuseum提升了引用有效性,减少了知识密集型查询中的幻觉,并在模糊情境下生成更中立的答案。