每日精选AI研究论文及翻译
近期,视频生成器能够编造出战争、灾难、公共突发事件及其他真实世界危机的逼真场景,从而造成重大的虚假信息风险。然而,现有基准测试在此类情境下提供的关于检测器和生成器行为的证据有限,包括可检测性如何随生成条件变化、人们如何感知生成的视频,以及检测器在社交传播过程中是否依然可靠。为填补这一空白,我们提出了RA-Bench——一个以真实视频为锚点(Real videos as Anchors)的AI生成视频检测基准。RA-Bench包含17,886个视频,涵盖10个社会风险类别中的1,830个真实视频锚点,以及来自四个开源和五个闭源生成器的16,056个生成片段。基于RA-Bench,我们从三个维度组织评估。首先,我们评估了七个传统检测器、三种评测设置下的十个零样本多模态模型,以及两个专门针对AI生成视频检测微调的多模态大语言模型(MLLM)的检测器泛化能力。在这些方法中,三个检测器家族均未能在RA-Bench实例上实现一致的泛化。随后,我们考察了可检测性如何随生成质量、条件信息和采样种子变化。这些分析表明,生成属性对不同检测器家族的影响各不相同,而源级检测模式在不同种子间保持稳定。最后,我们研究了社交传播中人类的真实性判断与检测器可靠性。我们发现,能够误导人类的视频对现有检测器而言同样难以检测,且社交传播会进一步增加检测难度。综合来看,这些发现表明当前方法难以检测逼真的AI生成视频,凸显了对能够应对不断演进的视频生成器的鲁棒检测器的需求。
视觉在策略蒸馏在很大程度上依赖于信息丰富的师生非对称性,这种非对称性要么来自更大、更强的教师模型,要么来自特权监督,例如参考答案或感兴趣区域的真值。这引出了一个基本问题:当没有任何特权信息可用时,信息丰富的非对称性从何而来?我们通过反转非对称性的来源来回答这一问题。我们不是向教师添加特权信息,而是从学生中减去信息。这种非对称性无需真值标注、奖励或独立的更强教师模型,就能免费产生与能够获取学生无法获得信息的教师相同的有效学习信号。基于这一原则,我们提出了自监督视觉在策略蒸馏(S^2VOPD),这是一种简单而有效的方法,通过非对称增强视图构建在策略学习信号。S^2VOPD 将在策略的、以原始图像为条件的教师分布蒸馏到以同一图像的强增强视图为条件的学生分布中。我们系统地探索了视觉增强的广泛设计空间,并发现:(1)非对称性至关重要:所有四类增强都能提升性能,而对称自蒸馏则会降低性能;(2)强度很重要:性能在中等强度时达到峰值;(3)差距必须保持任务一致:完全移除与问题相关证据的增强会引发很大但无信息的差异。在六个细粒度感知基准测试中,S^2VOPD 将 Qwen3.5-4B 从 70.7% 提升至 77.4%,超过所有对比的开源模型,包括高达 235B 参数的 Qwen3-VL,并超越了 GPT-5.4。在保持训练数据相同的情况下,它恢复了使用特权信息的方法所取得改进的 96%。网站位于 https://williamium3000.github.io/s2vopd
自主智能体正日益具备通过长时域实验来改进模型、系统及其他技术制品的能力。然而,要理解这一能力的当前状态,评估必须超越最终得分——最终得分既无法揭示进展得失发生在何处,也无法表明累积经验是否改善后续决策。为此,我们基于一个新框架,对7个前沿模型在36项长时域任务上进行了系统性评估。该框架采用基于规则的评价指标,通过问题构架、执行和反馈控制三个维度刻画运行内行为,并通过受控比较评估任务内及任务间的经验复用。结果表明,当前智能体的行为更接近工程优化器而非完全自主的研究者:它们能够提出并实施实用解决方案,但其表现在不同运行之间差异显著;它们最强的解决方案主要是在改编或组合已有技术,而真正的方法论创新仍然罕见。详细分析揭示,观察到的表现受多种因素共同塑造,包括相似最终结果背后不同的过程瓶颈、既可能帮助也可能误导后续决策的经验复用,以及影响表现稳定性的框架设计。这些发现为改进模型训练、推理时策略、经验管理和框架设计提供了具体方向。
我们提出Mobius-v0架构,该架构由全局共享的Memory(FFN)和多个Reasoner(Self-Attn)组成,其中Memory用于存储知识向量,多个Reasoner迭代地实现组合推理。以隐藏状态作为缓存和载体,推理器反复查询记忆以获取所需的知识向量,同时知识被传递回推理操作器。通过这种知识-推理分离的架构,Mobius实现了更好的知识压缩和推理效率。基于Mobius-v0架构:1)我们从零训练的7B模型取得了与7B Transformer基线相当的下游得分,且仅使用了基线62.6%的训练数据。2)我们的Intern-S2-Mobius(从Qwen3.5-35B持续预训练而来)在取得相当下游得分的同时,实现了近4倍的端到端推理加速。
同策略蒸馏(OPD)为从更强的教师模型迁移推理能力提供了一条有前景的途径,但将其应用于长上下文推理教师模型与短上下文学生模型时,会引入实际挑战,包括分词器不匹配、教师-学生分布不匹配、响应长度爆炸以及训练不稳定。在本工作中,我们通过将证明推理能力从长上下文推理模型SU-01迁移至短上下文学生模型来研究该设置。为处理分词器差异,我们在共享文本空间中执行OPD,并且仅对齐在学生与教师分词器下占据完全相同文本跨度的token。为缓解生成长度过长和频繁截断的问题,我们引入了学生参考KL散度损失,并对特殊终止符(如</think>和<|im_end|>)的优势值进行掩蔽。该策略约束学生不过度偏离其初始策略,从而缓解教师-学生分布不匹配问题,并促进生成长度的稳定增长。在包括Qwen3、Qwen3.5、Intern-S2、GLM-4.7、Gemma-4在内的同族与异族学生模型上开展的实验表明,数学推理能力(尤其是自然语言数学证明)取得了一致提升。值得注意的是,Intern-S2-Preview在ProofBench上提升了21.2分,达到55.2,超越了Gemini-2.5-Pro。此外,HLE和HiPhO等科学基准上的表现也有所提升,表明OPD迁移的推理能力能够泛化到数学训练领域之外。
阿波罗计划之所以能够登月,并非仅仅因为其工程师能够求解繁杂的方程。它的成功在于将遥远的目标转化为由明确目标、仿真、验证和反复修正所构成的任务架构。人工智能如今正面临类似的转型:一旦问题、工具和成功标准被明确规定,前沿模型便能解决困难任务;然而,具有重大影响的现实挑战很少以可执行或可验证的形式出现。 我们提出了Apodex Discovery——一个通过重型求解器来构建和评估发现型AI的框架。该求解器由集基础模型、集成框架、工具和控制策略于一体的系统组成,致力于开展持续的、有状态的、可验证的调查研究。框架包含三个核心组成部分。首先,问题勘探流程调查了16个行业中的561个细分领域,汇集了423个高价值现实问题,并从中选出20个作为初始发布的问题集。其次,统一的“环境-任务-回合”抽象提供了数据、工具、约束、反馈、轨迹记录,以及对中间产物和最终提交结果的验证能力。第三,HDS6评估独立于任务最终成败,涵盖工具使用、修复能力、备选方案、连贯性、证据与覆盖范围六个维度。 在AAV衣壳设计中,Apodex在活性、组织嗜性、结构预测及生成式设计等方面超越了已发表的最新成果,提升幅度达7%。在药物再利用与再制剂任务中,针对特定任务构建的生物医学环境使GPT-5.5和GPT-5.6-sol的平均归一化预测分数比同一闭卷主干模型分别高出2.5分和7.6分。受控消融实验表明,固定的TRACES回合接口可以将性能差异归因于特定求解器组件。Apodex Discovery将AI评估从预定义基准推向以真正发现为目标的可验证调查。
交互式游戏世界模型通常直接在像素或潜空间中对视觉观测进行自回归,迫使姿态、几何和遮挡等结构化属性由同一条生成序列隐式维持。在长时间跨度上,这些潜在世界属性的误差不断累积,使一致性和可控性变得脆弱。我们显式地对演化的世界状态进行建模,将精确的几何计算委托给固定的零参数渲染器,而让神经模型负责合成外观。我们将这一思想实例化为Marionette,一个面向含关节角色的交互式游戏的世界模型。首先,一个两阶段自回归动力学模型预测显式且可解释的276维3D世界状态,该状态包含多实体关节骨架、度量根轨迹和旋转。其次,一个零参数图形桥接将预测状态转换为姿态控制视频,以闭式形式计算世界空间几何与遮挡。第三,一个控制条件的视频扩散观测模型根据得到的结构化控制合成逼真的RGB观测。我们的实验确立了Marionette的两个特性。第一,预测的世界状态可直接控制。在48个留存片段上强制施加不匹配的动作流,会使根部对齐的关节误差改变31%。第二,长时程行为在状态中决定,并可在状态中修复。不加约束时,两个生成角色漂移到相距21.2米(录制会话中保持接近5米),且三分之一的帧出现地面穿透。对显式状态施加两条规则,即地形碰撞器和分离上限,将穿透率降低66%,并保持两个角色处于互动状态,且无需改变观测模型。经由预测状态来生成外观并未造成我们能检测到的保真度损失,其FVD为831,而记录姿态的FVD为799。
当前大语言模型的开发依赖于大规模且往往未经许可的数据集,这为致力于开源和伦理合规数据来源的研究人员设置了较高的门槛。我们推出Mimir v1——一个基于层次推理模型(HRM)架构的10亿参数语言模型,该模型从零开始训练,在仅使用合规后训练数据的情况下,为英语带来极具竞争力的性能,并在丹麦语上刷新了最优水平。Mimir v1在161个数据集的混合数据上训练,性能优于原始的HRM-Text 1B,并能与更大的前沿模型(如Qwen 3.5 4B和Gemma 4 E2B)相抗衡,这一表现已在针对英语、数学与代码以及丹麦语的20项基准测试中得到验证。该模型可在Hugging Face Hub上获取:https://huggingface.co/danish-foundation-models/DFM-Mimir
下一代AI智能体正日益从回答孤立问题的系统,转向能够理解、记忆并持续从用户经验中学习的持久个人助手。这类助手需要长期记忆来随时间为每位用户积累和利用其特定经验,然而现有基准在真实的移动场景中仍显不足——在这些场景中,经验具有异构性、多模态性、动态演化性以及高度个性化特征。我们提出MobileMem,一个用于研究设备端长期记忆的基准与框架,其基础是一年时间跨度的移动经验数据集。MobileMem采用知识驱动的合成流水线,从用户与应用会话中构建连贯且时间一致的长期轨迹。它提供互补的文本与多模态设置,涵盖多跳与时序推理、知识更新以及隐式偏好推断。具体而言,MobileMem使智能体能够记住过去、理解当下、适应未来。通过建模经验而非孤立事实,MobileMem将记忆从信息检索推向体验智能,从而实现持续的个人化学习。
人形运动跟踪是遥操作和全身模仿的核心任务,然而其评估结果往往与人们在视频中感知到的质量不一致。运动学误差逐帧计算姿态差异的平均值,却忽略了最关键的身体物理伪影,特别是支撑不稳定以及接触错误,如脚部打滑和触地时机不当。与此同时,广泛使用的测试集规模较小,缺乏评估接触密集、长时域行为所需的多样性。我们提出HumanTracker,使人形跟踪评估兼具感知对齐性和可扩展性。HumanTracker基准测试包含来自多位专业表演者约153小时的光学运动轨迹数据,按四类运动族进行组织,并配有文本标签以支持细粒度诊断。我们进一步提出HumanScore,一种基于偏好对齐的度量指标,在包含24K段运动、由12K个运动对组成的数据集上训练而成。在具有代表性的最先进跟踪器上,HumanScore能够更准确地预测人类偏好,并揭示运动学度量指标常常遗漏的接触与稳定性失效问题。
随着图像编辑模型的快速发展及其在各领域的广泛应用,将这些模型能力直接部署到实际场景中的需求日益迫切。然而,现有基准仍然局限于简单的单图像任务,存在覆盖维度有限、无法有效区分不同模型性能等问题。因此,它们无法可靠地评估模型在复杂多图像编辑、高要求推理指令和实际部署场景中的性能。为解决上述局限,我们提出了CPI-Bench,一个面向真实世界图像编辑的综合、实用且智能的基准。CPI-Bench包含三个核心子集:CPI-General-Bench,全面覆盖多样化的编辑任务并首创性地纳入多图像编辑评估;CPI-Practical-Bench,聚焦于高频真实用户应用场景;以及CPI-Intelligent-Bench,专门评估高要求推理型编辑能力。基于CPI-Bench对主流图像编辑模型的评估结果表明,CPI-Bench增强了模型间的性能区分度。它为通用编辑能力、实际部署效果和高级推理型编辑之间的差距提供了全面可靠的量化,为图像编辑模型未来的优化提供了宝贵的指导。至关重要的是,我们的排名分析显示,CPI-Bench与Arena Image Edit排行榜实现了最高的一致性,表明其能够真实反映人类评估者的偏好和感知判断,可作为真实用户体验的可靠代理。
人脑展现出显著的功能特化程度,不同的网络分别支持语言、形式推理、关于他人心智的推理以及关于物理世界的推理。这种模块化组织是智能系统构建的基本原理,还是生物大脑特有的进化偶然事件?在此,我们检验了类似的组织是否出现在大语言模型中——另一类通过截然不同的优化过程产生的智能系统。通过对跨越四个认知领域(语言、形式推理、社会推理、物理推理)的N=46个任务进行电路分析,我们发现大语言模型发展出了与人脑镜像对应的模块化架构:在人脑中调用相同网络的任务在大语言模型中会招募重叠的神经元,而调用不同网络的任务则会招募不同的神经元。模块化在脑与神经网络中的趋同涌现表明,它可能是智能系统的一项基本属性。
使智能体能够从经验中学习并将其内化到策略中,已成为自演化人工智能的核心问题。在策略自蒸馏(OPSD)通过使用特权自教师对学生自身轨迹提供密集监督,为这一问题提供了有效途径;然而,现有方法仍严重依赖设计者指定的特权产物(如答案、反馈、技能或轨迹),限制了持续自我改进所需的端到端可学习性与可扩展性。在本工作中,我们提出潜在在策略自蒸馏(LOPD)。与提出另一种规定新特权上下文形式的手工设计OPSD变体不同,LOPD使教师自身的特权上下文可从经验中进行端到端学习。技术上,LOPD检索相关经验并将其组合为连续的潜在标记,作为自教师的条件输入;同时,学生从任务与交互历史中生成轨迹,并在每个访问过的前缀处接收密集的标记级监督。我们进一步引入特权间隔目标,以稳定和规范潜在上下文的学习。实验表明,LOPD展现出(I)强大的性能:在智能体工具使用与代码生成任务中均优于RLVR以及OPSD、SDPO和Skill-SD等代表性OPSD方法;(II)高学习效率:以不足GRPO和Skill-SD 30%的轨迹采样预算超越两者。消融研究进一步提供了直接证据,表明使特权上下文可学习是实现上述增益的必要条件。综上,这些结果将LOPD定位为迈向更可扩展、更自主的智能体进化范式的一步。
我们提出将“声明级证伪”作为测试时扩展的原则,并通过“声明级可靠性评估”(CLR)加以实现。CLR是一种无需训练的框架,将测试时计算从额外的解决方案采样重新分配给有针对性的验证。由于对整个推理轨迹的评估常常因常规词元的信号稀释而掩盖关键错误,CLR将每条推理轨迹压缩为一组紧凑的、对决策至关重要的声明,从而分离出其逻辑锚点。此外,鉴于在固定模型能力下生成完全正确的解决方案存在固有困难,CLR将重点转向语义证伪。该方法利用了解决方案构建与声明反驳之间的根本不对称性:构建有效的解决方案需要一条无懈可击的推理路径,而反驳一条错误的声明则只需识别出一个决定性的缺陷。这种针对负面证据的定向搜索系统地压缩了高置信度错误轨迹的生存空间,并通过非线性可靠性评分有效抑制了错误共识。在匹配预算条件下,跨四个大语言模型和四个推理基准,CLR通常在pass@1和自洽性上均有所提升。例如,在GPT-OSS-20B/CMIMC25上,CLR比pass@1高出27.15个百分点,并将自洽性准确率从77.50%提升至82.19%,同时词元消耗减少了37.0%。
细粒度的机器人评估对于理解具身模型至关重要,它超越了二元成功率和基于规则的过程评分。我们提出了PRM-as-a-Judge 1.5,一个用于机器人过程评估的工具包,它将rollout视频转化为密集的进度曲线,并导出多种精细指标。PRM-as-a-Judge 1.5在1.0版本的基础上引入了三个指标,分别刻画失败侧进度、回撤后恢复和成功侧执行质量,帮助用户理解具身模型的能力。基于基准测试中的rollout视频,我们对具身模型进行了全面评估,提供了一些细粒度指标结果和关键发现。我们还引入了RoboPulse++来评估过程奖励模型(PRM)的可靠性,为评估者提供更准确的测试平台。此外,我们发布了一个用户友好的评估套件,包括基准、指标实现和可视化工具,以支持可复现的操作过程评估。我们呼吁社区重新思考机器人的评估方式,并将透明、程序化且可复现的评估确立为下一代具身智能的基础。
在 ReAct 范式下,LLM 智能体交替进行推理、行动和观察,但有意识的推理仅限于思考阶段:当智能体串行执行动作并等待环境时,其推理则处于冻结状态。我们将行动与观察期间反复出现的这一间隔识别为推理空闲窗口,并探究它能否并行承载服务于未来轮次的额外推理。为此,我们提出了 Second Thought——一种无需训练的推理框架。它在每个思考阶段结束的瞬间分支出四个辅助分支,让它们与主循环并行解码,并在环境观察到达时将生成的思考结果合并回来。通过这种方式,Second Thought 将新增的推理从主线程的顺序解码路径上移出。在三个智能体基准和三个推理大语言模型上,Second Thought 在所有九个(模型,基准)组合中均降低了平均回合数,并在其中六个组合中减少了主线程解码量,最高减少 43%(在这些设置中平均约 20%),而在第七个组合中基本保持不变;Pass@1 在九个组合中的七个中没有显著变化,而两个显著差异分别为 +12.4 和 +10.2 个百分点。与一个计算量匹配的对照方法(该方法将等效的预算强制施加于主线程自身的推理)相比,在适用该对照的所有四个设置中,Second Thought 的 Pass@1 严格更高,同时顺序解码量减少 1.3 至 3.2。
多模态大语言模型(MLLMs)展现出强大的视觉理解能力,然而导致这些行为的内在特征仍然难以识别、审计或控制。尽管稀疏自编码器(SAEs)将隐藏状态分解为可解释的特征方向,适用于事后检查,但这类分解既难以直接分离出多模态训练所改变的特征,也难以直接用于针对性控制。我们提出MMDiff,一种多模态模型差分框架,该框架训练多模态SAEs并将其转化为特征级接口,用于发现和控制多模态行为。MMDiff支持三种用途:(i)特征分离,通过将基础语言模型SAE与其多模态适配版本进行差分,识别多模态训练所改变的特征;(ii)任务特定特征检测,通过逐词元对比激活分析来分离因果特征;(iii)特征级控制,通过因果性地移除或操控所发现的特征方向。我们为三个MLLM系列模型族——LLaVA-MORE、PaliGemma 2和InternVL3.5——训练多模态SAEs,并在视觉空间理解、多模态安全性和OCR任务上进行评估。MMDiff发现稀疏且因果特定的特征,移除这些特征可选择性地使目标行为性能平均下降12%(空间任务)和17%(OCR),并使多模态安全攻击的攻击成功率降低24%,同时对VQA性能无影响。操控这些特征相比标准的单层引导基线,在空间和OCR准确率上分别平均提升+3.6%和+1.8%。这些结果表明,多模态SAEs不仅可以作为可解释性工具,还可以作为审计、引导和控制MLLM行为的机制,从而推动更安全、更强能力的生成。
当我们预测1000只美国股票的每小时收益率时,观察到一种意外现象:预测结果近乎平坦,且以横截面相关性衡量的股票排序能力较差。我们将此称为预测崩溃。令人惊讶的是,在相同设置下预测交易量时,该现象基本消失。我们跨时间序列基础模型(TSFMs)、十二种深度学习预测模型和97种公开基准配置研究了预测崩溃,发现其与目标可预测性密切相关。我们识别出其背后的两个不同原因:低可预测性限制了校准点预测的幅度,而逐序列目标导致跨序列结构未被识别。这些发现揭示了一种校准-排序权衡:优化平方误差会导致预测平坦,而直接优化横截面相关性虽能改善排序,却可能使预测幅度膨胀一个数量级以上。为解决这一权衡,我们引入了CalibRank——一种平衡校准与排序的简单目标函数。在Finance1K上,CalibRank使横截面相关性几乎增至三倍,同时保持幅度接近目标,并在所有测试模型上提升了相关性。我们的结果揭示了传统时间序列评估的一个盲点:逐序列指标可能掩盖下游决策所需的跨序列结构中的失败。
现代语言模型在异构的万维网规模文本语料库上进行训练。因此,研究知识与技能的习得颇具挑战性,因为难以刻画模型先前接触过的相关内容。为应对这一挑战,我们引入了LITTLECURRICULUM——一个精选的880亿词元预训练语料库,专为美国小学教材量身定制,明确排除了五年级以上教授的概念、事实和词汇。在LITTLECURRICULUM上从头训练一个拥有50亿参数的LLM,得到了LITTLELEARNER——一个具备足以进行开放式评估的语言能力,同时具有清晰的知识与能力边界的模型,这些边界可映射到可解释的课程大纲。我们发布LITTLECURRICULUM和LITTLELEARNER,作为一个发展受限的沙盒环境,用于研究模型如何在明确定义的训练范围内获取、表征和使用数据。我们通过一系列关于通过后训练和上下文学习注入新知识的初步实验,展示了该沙盒的实用性。这些方法使LITTLELEARNER能够更好地利用现有知识,但并未提升其范围之外的能力。我们的研究结果强调了这一受控环境对未来研究的重要价值。
随着大语言模型规模不断扩大,其训练词元预算也必须相应增加,以维持合适的词元-参数比(TPP)。然而,高质量领域数据远比通用网络数据难以扩展。随着模型规模和训练词元预算的增长,高质量领域数据在训练数据混合中的占比往往会下降。重复使用现有的高质量数据是抵消这种稀释效应的有效方法,但过度重复可能导致过拟合。我们在实际的LLM扩展条件下研究这一权衡,其中训练词元预算随模型规模成比例增长。对于固定领域,我们首先发现,令人惊讶的是,在TPP固定的情况下,最优重复次数随模型规模的增大而略有增加。在不同领域之间,我们发现最优重复次数与该领域最终验证损失呈强负相关:验证损失越低的领域通常越能从更多重复中获益。相比之下,领域去重后的数据量与最优重复次数的相关性较弱。这些发现表明,在具有相同TPP的较小代理模型上调节得到的重复次数,可以为更大模型提供实用的估计。
临床决策支持正朝着由语言模型智能体组成的委员会在共享工作空间中进行审议的方向发展。我们探究此类委员会是否会被捷径所操纵——即基准测试予以奖励、而临床医生会忽略的提示线索。在覆盖文本(MedQA-USMLE、MedMCQA、MIMIC-CXR报告)、影像(NIH ChestX-ray14、MIMIC-CXR-JPG、CheXpert)和表格型ICU记录(SUPPORT2)的六个公开数据集上的七个队列中,Gemini委员会在孤立呈现这些线索时能够予以抵抗(翻转率5-16%),然而一种社交合理的捷径依然会传播:当两个同侪断言同一错误答案时,被测保留模型在38%的案例中会采纳该答案;虚假的"预筛查"系统标记在两个能力层级上同样如此。在三种监督智能体中,门控器无法区分受操纵后的采纳与真诚的认同(假阳性率100%);仅读取对话记录的同源判官能在文本任务上识别受操纵采纳(精确率100%,召回率93%),但在影像任务上其表现退化为与门控器相同;而私下重新查询保留模型的裁判可迁移至影像任务(精确率77-88%,假阳性率13-21%)。将线索的视觉显著性提高至三倍并不能改变传染效应,而增加第二个同侪的声音则使传染率再提升一半。利用隐藏评分标准进行操纵几乎无声无息:文本任务中仅1/10、影像任务中仅1/134的发生漂移样本提及了它们所趋向的评分标准。真正能操纵委员会的是社交合理性,且只有独立于自我报告的裁判方能识别此类操纵。代码:https://github.com/criticaldata/benchmaxxing
Muon优化器因其三次时间复杂度的Newton-Schulz正交化步骤而产生显著的开销成本。当权重进行分片时,通信开销进一步加剧了这一计算成本,在许多场景下削弱了Muon的优势。我们提出Dion3,这是对Muon的改进版本,从技术栈的每一层入手解决这一开销问题。我们的Gram Newton-Schulz算法降低了正交化的FLOP成本,我们的CuteDSL内核通过利用对称性加速正交化过程,而我们的大规模批处理策略则减少了通信开销。此外,我们对更新规则提出了一项简单改进以进一步削减成本:每步仅选取动量矩阵的一部分行进行正交化。这一更新规则在速度和性能两方面均优于Dion(Muon的另一种"压缩"版本)。总体而言,Dion3在损失(loss)上与Muon相当或更优,同时将优化器步进时间最多降低6倍。Dion3可通过dion包(https://github.com/microsoft/dion)获取,可作为Muon的直接替代品。
我们证明,基于可验证奖励的在策略强化学习(RLVR)能够在改善当前目标的同时,使后续目标下的成功行为变得过于稀少而难以采样和强化。我们将这种现象称为验证器引发的支持集重塑,并将有效可奖励支持集定义为在固定采样预算内可达到的成功轨迹集合。在两类模型家族上,我们通过重复的验证器评分采样以及数学推理和受约束指令遵循上的双向训练(包括使用相反验证器进行顺序训练)来研究这一效应。Math-RLVR提高了平均指令遵循成功率,但在重复采样下减少了存在任何成功响应的提示数量。在Qwen3-8B-Base上的IFEval中,pass@1上升了6.5个百分点,而best@32下降了9.8个百分点,并且这种分歧在两种模型和IF基准上均出现。相反,IF-RLVR使数学回答从逐步解答的开头转向直接答案,在各类采样预算下降低了best@k,并减小了后续Math-RLVR的奖励变异性。词元分布分析和受控的开头干预实验表明,这些变化集中在回答的前几个词元上。RLVR主要对基策略中已有的开头进行重新排序,而所选开头对数学可搜索性具有因果影响。所测试的参考策略约束、路由先验和在策略蒸馏仅部分保留了跨任务支持集;MathIF和ReasonIF表明,边际收益仅部分转化为既正确又遵循约束的响应。因此,在在策略优化下,最终指标的提升并不能保证未来的可训练性或联合能力。代码可在 https://github.com/sylvain-wei/verifier-induced-support-reshaping 获取。
大型视觉-语言模型(LVLMs)在视觉推理和对话能力上表现出色,但常常产生缺乏视觉输入支持的幻觉内容。要有效缓解这一问题,需要进行词元级定位,以便在不丢弃整个响应的情况下进行针对性干预。现有检测器要么需要昂贵的全模型微调,要么依赖忽略模型生成过程的外部验证器,要么将内部信号简化为孤立的特征和手工设计的统计量,从而丢弃了空间、序列和关系结构。我们提出UniProbe,一种轻量级、统一的可学习检测器,它从单次前向传播中对冻结LVLM的异构计算轨迹进行建模。UniProbe在图像块、查询词元和生成词元之间构建有向图,并用注意力权重编码它们之间的关系。它通过交替的结构感知模块处理该轨迹:图神经网络用于关系证据,视觉Transformer用于二维视觉几何,门控循环单元用于响应顺序。交错这些模块使得空间、关系和序列证据能够在整个检测器中相互作用。我们进一步开发了一种面向幻觉感知解码的流式变体,该变体在生成过程中检测并重新采样幻觉词元;同时,我们还提出了一种自适应策略,使检测器与LVLM自身的生成结果对齐。在多种LVLM骨干网络上,UniProbe在词元级检测和物体幻觉检测方面达到了最先进的性能。在解码过程中,它将物体幻觉减少高达55%,而延迟仅为标准生成的1.06倍。
科学图表编码了关键的实验证据,然而数字图书馆和多模态人工智能系统仍难以检索和解读这些图表。ALD/E-ImageMiner基准和ICDAR 2026原子层沉积/刻蚀科学图表信息提取竞赛提供了来自205篇出版物的1,951幅图表,经专家标注涵盖分类、数据表抽取、摘要生成和视觉问答等任务。在这些配套论文中,我们提出了关于该基准如何指导未来科学图像挑战的前瞻性视角。我们考察了其任务如何从视觉和定量读取到领域驱动的推理和证据论证来探测能力,以及基于布鲁姆分类法的问题设计如何支持更深层次的科学理解。我们提出将"基于图像的科学概念理解"作为长期基准目标,未来方向包括更广泛的领域和图表类型、上下文和跨文档综合、假设评估、来源追溯、不确定性、反事实依据以及开放式多模态研究。这一视角将ICDAR 2026竞赛与更广泛的机器可操作科学视觉知识和可验证多模态科学人工智能议程联系起来。
在推理模型中,哪些推理行为与正确答案相关联?以推理为导向的训练是否放大了这些行为?这一区分之所以重要,是因为以推理为导向的训练可以使推理轨迹看起来更具深思熟虑的特征,却并未放大与模型正确性最紧密关联的那些行为。我们通过行为提升(Behavioral Lift)这一指标来量化这种不匹配,该指标衡量某一行为在模型推理轨迹中出现与不出现时正确性变化的幅度。横跨15个模型和6个涵盖纯文本推理与视觉-语言推理的基准测试,我们以一套核心行为同时适用于大语言模型(LLM)和视觉语言模型(VLM)轨迹的分类体系,对15,282条轨迹进行了标注。我们发现了放大-提升差距(Amplification-Lift Gap)的存在证据:思维模型强烈放大自我修正、假设检验和不确定性承认,而提升值最高的行为则是置信度校准、知识对齐和自我意识。置信度校正在两种模态中都是正确性最强的正向信号之一,却几乎没有被放大;不确定性承认被放大了3至7倍,却与正确性呈弱相关或负相关。我们发现,以推理为导向的训练并未优先放大提升值最高的行为,这凸显了引入过程层面目标函数的必要性,以奖励经过校准且具有依据的推理,而非仅关注表面形式。
在大型众包语料库上训练的神经语言模型经常利用与目标标签相关的伪表面模式,这些模式不具备真正的语言学或因果相关性,从而在提升基准测试性能的同时,在面对对抗性或分布外输入时表现不佳。现有方法要么需要手动指定特征词汇表,要么仅部分自动化了发现过程,因而未能解决数据集层面相关性与模型层面利用之间的差距。我们提出了U N M ASK,一个全自动流水线,能够在无需额外人工标注的情况下,发现、因果验证并缓解文本分类器中的伪相关性。给定无标注训练样本,U N M ASK将候选表面模式生成为可执行的布尔表达式,通过具有独立重复的统计验证协议对它们进行筛选,并通过经核验的反事实干预确立因果模型依赖性。随后,经因果确认的特征可用作深度特征重新加权(Deep Feature Reweighting, DFR)的无标注组定义,从而免除了标准DFR所需的组标签。我们将该流水线应用于在MNLI上训练的BERT和RoBERTa,独立重新发现了已确立的词汇重叠和否定偏差,在BERT上验证了10个特征中的9个,在RoBERTa上验证了6个,并将HANS准确率提升了多达12.58个百分点。在CivilComments-WILDS上,程序化组在没有人口统计学标注的情况下,匹配了手工标注DFR(Kirichenko等人,2023年)70.1%的最差组准确率。我们进一步证明,发现和验证阶段可推广至奖励模型偏好数据,在RewardBench2中揭示了可解释的伪相关性。
Nanbeige4.2-3B是一个30亿参数的智能体模型,基于循环Transformer(LT)架构构建,该架构通过复用一个层堆栈进行第二次前向传播,在不增加参数的情况下增加了有效深度。在Apple Silicon(MPS)上评估时,我们发现了五个独立的缺陷,这些缺陷导致已发布的检查点无法通过Hugging Face transformers开箱即用(包括静默置零的RoPE缓冲区以及对已移除的transformers缓存API的调用)。此外,我们证明即使修复了这些缺陷,由于LT的层复用策略(实际上使峰值注意力内存翻倍)被用于实现参数效率,该模型仍不足以胜任智能体任务。为此,我们引入了一种分块预填充策略,以缓解由此产生的内存容量开销,在32 GiB共享内存上将允许的上下文长度扩展了2.7倍。然而,即使减少了内存开销,我们仍表明需要补丁才能使Nanbeige4.2-3B得以使用;解决系统提示词和MPS原生内存缺陷后,最终可以在标准MCP和工具调用基准上进行可靠的评估。在MCPMark的一个子集上,经过调试的模型成功完成了高达30%的真实智能体任务(原始版本为0%),而在BFCL上,该模型在单工具调用方面近乎完美(但在大多数多工具测试中失败)。我们在https://github.com/johnhalloran321/Nanbeige4.2-3B-mps-fix发布了修补后的检查点、系统提示词优化器和评估套件。
议会程序是民主审议的主要记录,然而其体量庞大且内容零散,使公民、记者和研究人员难以从多视角进行查阅。将检索增强生成(RAG)应用于议会记录会带来三个特定风险:最频繁发言者的主导效应、无法根据议题专长对发言者进行加权,以及政治敏感文本中的引文归属错误。我们提出ParliamentRAG,一个针对意大利众议院的RAG系统,旨在共同应对这些风险。其核心贡献在于一个依赖主题的权威模型,该模型根据当前查询估计每位发言者的权威度,整合了职业、教育背景和既往发言等可解释组件。给定用户查询,系统检索相关发言片段,识别各议会党团中与议题相关的专家,并生成综合各方观点的摘要,附带支持性引文。ParliamentRAG在15个政策议题上与Google NotebookLM进行对比评估,采用结合自动指标和六位领域专家盲法A/B人工评估的两级协议。该系统在政治团体覆盖度上更高(0.97对0.95),引文忠实度达到完美水平(1.00对0.95),并在来源相关维度上获得更强的专家偏好,而NotebookLM在行文导向维度上仍占优势。
从视觉观察中进行空间感知与推理,需要恢复几何结构、建立对应关系并理解空间关系。现有方法通常使用任务特定架构或外部几何模块分别处理这些能力,从而限制了对同一物理场景的互补表示之间的知识迁移。我们提出SPARGen,一个统一的多模态框架,将三维重建、稠密对应和空间推理转化为指令条件生成任务。SPARGen将紧凑的结构化输出和语言输出序列化为token序列,同时以图像对齐的形式生成稠密几何场,使得空间监督能够在原生多模态生成模型内共同塑造共享表示。在三维重建、对应和空间推理基准上的实验表明,SPARGen在单一原生多模态生成框架内,能够在异构空间任务上取得具有竞争力的性能。
2023年,纽约州一名法官在Mata v. Avianca案中对两名律师予以制裁,原因在于他们提交的法律文书包含由ChatGPT生成的幻觉引用。此类失误大多可通过数据库检索发现;更棘手的问题在于识别那些指向真实案件、却并不支持其所援引命题的引用——而现有针对法律场景的LLM评估在很大程度上忽视了这一失败模式。在本文中,我们通过受控扰动来研究命题级引用支持验证:对从两个法律语料库中获取的真实法律引用进行扰动,要么替换所引案件,要么在同一案件中仅改变精确页码。我们在所得样本上评估了十四个模型配置。对于替换案件的扰动,模型能识别出93%–100%。对于法院意见中的错误精确页码扰动,模型仅能识别37%–61%;在法律文书中则为52%–83%。当模型未能识别错误精确页码扰动时,它们往往是基于主题重叠而非页码级支持来接受该引用。模型规模与扩展推理缩小了这一差距,但并未弥合:GPT-5.4在高强度推理下仍会遗漏法院意见中40%的精确页码错配,以及法律文书中18%的此类错配。提示模型在引用页码处验证支持可提升召回率,但同时也会提高误报率。识别正确的法律主题与验证所引命题的支持是两种不同的能力,而当前模型将二者混为一谈。
尽管多模态大语言模型(MLLMs)已取得显著进展,视觉理解与视觉生成通常仍被视为相互分歧的目标。现有统一框架往往依赖离散视觉标记化或扩散目标,其生成目标与视觉理解模型所消耗的连续表示不同,使得直接迁移以增强现有预训练MLLMs并非易事。在本工作中,我们提出GAS,一种将视觉生成重新诠释为表征学习辅助监督的生成引导训练框架。具体而言,GAS在解耦的混合Transformer(MoT)架构中采用下一嵌入预测(NEP)作为跨模态生成范式。通过保持共享的下层主干与并行的上层分支,GAS使生成损失能够以更精细的空间精度和更强的视觉保持能力丰富共享视觉通路,同时保护上层理解分支免受直接生成梯度的干扰。为最大化这种协同效应,我们进一步构建了高度相关的生成任务,这些任务要求深层认知基础而不仅仅是通用合成。跨模型规模和训练阶段,GAS均能提升多模态综合理解能力,其在感知和空间理解方面的收益最为稳定。至关重要的是,由于辅助生成分支在训练后被丢弃,这些收益不产生任何推理开销。大规模受控比较和表征层面分析进一步阐明了生成引导训练何时以及为何有益于理解,并验证了生成引导训练作为实现更强多模态理解的实际路径的可行性。