每日精選AI研究論文及翻譯
視覺語言模型(VLM)已在 DocVQA、ChartQA 和 MMLongBench-Doc 等視覺文檔理解基準測試中展現出優異表現。然而,真實世界的文檔往往同時包含長度、版面複雜度、模態以及問題難度等多種因素,使得難以將模型失敗歸因於特定原因。為此,我們提出了 SynthDocBench——一個完全合成的長上下文視覺文檔理解基準,能夠系統性地控制文檔長度、版面結構、模態組成及問題類型等因素。該基準採用組合設計建構,每個因素在生成的文檔中獨立變化,從而實現對模型行為的可控分析。文檔透過 LLM 流程端到端生成,涵蓋六種版面原型,並內建 40% 的隨機覆蓋機制,以防止模型利用虛假相關性。此外,SynthDocBench 包含的文檔在長度和結構多樣性上遠超現有基準。通過評估七個前沿 VLM,我們發現了現有基準無法揭示的三種失敗模式:文檔長度增加時性能急遽下降;系統性的位置敏感性——五分之六的模型在文檔中間三分之一處表現最差,且五分之六的模型呈現負向的「早期至晚期」趨勢(最大下降幅度達 8.3 個百分點);以及在長文檔場景下圖表理解能力的崩潰。這些結果表明,當前模型可能過度擬合於基準測試的虛假特徵,而非真正實現了穩健的長上下文視覺文檔理解。
本文提出 SpectraReward,一种无需训练的奖励函数,可将预训练多模态大语言模型(MLLM)直接转化为图像生成强化学习的现成奖励模型。不同于要求MLLM直接评判生成图像或回答分解后的验证问题,SpectraReward通过一次图像条件下的教师强制前向传播,衡量原始提示词能从生成图像中恢复的程度。我们采用平均图像条件提示词对数似然作为奖励,直接复用MLLM预训练的图像-文本对齐能力,无需偏好标签或奖励模型微调。我们进一步引入 Self-SpectraReward——统一多模态模型的特殊情形,其中策略自身理解分支充当其生成分支的奖励模型,构成无需外部奖励模型或外部知识的闭环自我改进框架。大量实验验证了SpectraReward在广泛的图像生成强化学习研究中的有效性,涵盖两种扩散模型、三种强化学习算法、来自四个MLLM系列(参数规模从4B到235B)的九个奖励MLLM骨干网络,以及五个分布外文本到图像基准。结果表明,SpectraReward与Self-SpectraReward均能显著且稳定地提升生成性能,并超越先前基于MLLM的奖励训练方法。进一步分析发现,更大的奖励MLLM并非总是更好,而Self-SpectraReward能够匹配甚至超越更大的外部奖励模型,表明奖励-策略对齐是图像生成强化学习的关键因素。项目主页:https://huangrh99.github.io/SpectraReward/
视觉生成器在渲染方面表现卓越,但对于自身不了解的内容,它们会坚定地虚构。用户请求是无边界的、持续演进的,且呈现深度的长尾分布:新角色、流行实体、截止日期后的事件等等。这种世界知识的瓶颈是结构性的:生成器基于固定的语料库训练,而视觉世界是开放式的。我们构建了 SearchGen-20K 和 SearchGen-Bench,包含 20,839 个提示词,覆盖十二个失败类别和二十二个领域,并配有一个预执行的 SearchGen-Corpus-1M 多模态语料库,以支持离线、可复现的研究。在 SearchGen-Bench 上,前沿的开放生成器得分仅为 21 到 28 分(满分 100),与现有基准相比出现了 40 分的断崖式下降,这种下降在现有基准测试中完全不可见。自然的解决方案是使用搜索工具,实现智能体式的视觉生成。然而,我们观察到简单的搜索方式会失败:它不加区分地检索,将噪声注入到生成器本身已经能处理的提示词中。我们将根本原因归结为生成器特有的、不断演变的知识边界:即生成器通过训练可以内化的知识与必须保留在外部上下文中的知识之间的分界线。尽管这一边界难以预先确定,但我们证明它可以通过“先教学、后搜索”的协同训练框架来发现。即使这个协同训练方案的最简版本也能产生单调的改进,为视觉生成中的递归式自我改进奠定基础,从而满足需要世界知识支撑的请求。我们发布了完整的数据集、协同训练语料库和搜索语料库,作为工具增强、世界知识驱动的视觉生成的可复现测试工具集。
現代AI模型在許多既定基準測試中表現出色,但在人類幾乎視為簡單的任務上仍會失敗,例如操控一條繩子或畫一隻五條腿的狗。這些案例顯示,現有基準可能低估了當前系統中持續存在的盲點。我們提出 blind-spots-bench,這是一個旨在透過對人類看似簡單但對現代AI仍具挑戰性的任務來揭露此類盲點的基準測試。我們從AI課程的學生中收集原始問題,進行清理並加上結構化參考解答的註解,再根據由此產生的235個樣本資料集提出一套任務分類法。我們進一步開發自動評分流程,以評估多種模型,包括開放權重與閉源的語言、視覺語言及影像生成模型。我們在 blind-spots-bench 上的分析顯示,即使閉源前沿模型在現有基準測試上與開放權重模型表現相當,前者仍可顯著超越後者,差距甚至約達10%。更細粒度的分析表明,沒有任何單一模型在所有任務類型中佔據主導地位,且部分任務對所有受評模型仍具挑戰性。這些結果凸顯了 blind-spots-bench 作為診斷壓力測試的價值,有助於識別當前現代模型中的具體弱點。
編碼代理必須將外部工具回傳結果整合到持續推理中——這項能力是標準的從左到右程式碼預訓練僅在其前向方向上所展現的。我們觀察到,編碼代理的行動-觀察-延續迴圈在結構上與函式呼叫點同構,其中呼叫者綁定引數,被呼叫者回傳在其他地方計算的值,而後續程式碼則消費該值。這種條件結構在普通程式碼中普遍存在於網路規模。我們透過函式感知的中間填充(FIM)中間訓練來利用這一點:這是一種自監督目標,它遮罩透過程式依賴圖分析以及複雜度-可推論性雙重準則所選出的函式。我們在來自968個GitHub儲存庫、含有26億個詞元的去污染語料庫上對Qwen2.5-Coder-Instruct(7B/14B)和Qwen3-8B進行中間訓練,然後應用現有的代理後訓練流程。中間訓練使SWE-Bench-Verified在7B/14B上分別提升+2.8/+3.0,在Qwen3-8B上提升+3.2;SWE-Bench-Lite在同模型上分別獲得+3.7/+4.0/+5.4的提升。此改善在兩個後訓練流程(R2E-Gym、SWE-Smith)以及非Qwen2.5基礎模型(搭配SWE-Lego的Qwen3-8B)上均保持一致。除了領域內的提升之外,中間訓練還緩解了代理後訓練原本會對非代理編碼(例如LiveCodeBench)以及非編碼工具使用基準(tau-bench、BFCL)造成的能力侵蝕:儘管中間訓練語料庫僅包含Python程式碼,但函式呼叫的歸納偏置在後訓練中得以保留,並產生一致的提升。
基於大型語言模型的編碼智能體已顯著推進了自動化軟體問題解決,但由於對程式庫理解不足,它們仍極易產生事實性錯誤。近期方法試圖通過修復前的程式庫探索來緩解此限制;然而,這些以修復為導向的策略在探索程式庫時並未識別智能體的知識缺口,往往產生不精確的上下文,無法填補潛在的理解缺陷。本文提出ACQUIRE,一種基於問答的框架用於軟體問題解決。如同經驗豐富的開發者在嘗試修復前先理解不熟悉的程式碼,ACQUIRE在修復之前明確地獲取程式庫知識。該框架通過兩個階段將知識獲取與補丁生成解耦:第一階段,提問者與回答者協作獲取結構化的程式庫知識,提問者提出針對性問題,回答者通過自主探索生成基於證據的回答;第二階段,解決者利用所得的問答知識生成資訊充分的補丁。通過將隱含的知識缺口轉化為明確、事實可靠的認知,ACQUIRE加速了知識密集型的修復階段,並實現更準確的解決。在SWE-bench Verified上的實驗表明,ACQUIRE持續優於具代表性的修復前方法,以適度的額外成本與時間將Pass@1提升高達4.4個百分點。
現有的自動音樂轉錄方法通常僅適用於單一樂器錄音,或在處理複雜的真實音樂混音時表現不佳。儘管先前的研究使用了合成訓練數據,但所得到的模型推廣能力較差,導致在實際的多樂器場景中產生的轉錄結果幾乎無法使用。在本研究中,我們分析了合成數據在預訓練中的有效性,同時結合對真實音樂音頻的微調,以及使用強化學習進行後訓練。我們進一步引入了基於樂器存在的條件化處理,以自定義轉錄結果。最終,我們發布了MuScriptor,這是一個開放權重的多樂器音樂轉錄模型,能夠處理來自多樣音樂類型的真實世界音樂錄音。
主流視覺編碼器預訓練於自然圖像,未經面向文檔的適配便無法有效應用於文檔圖像,因為密集文字與細粒度的字符筆畫需要字符層級的視覺感知。我們提出 MonkeyOCRv2,這是一個專為文檔人工智慧設計的視覺-文字預訓練模型。首先,我們構建了 MonkeyDoc v2,據我們所知,這是目前最大的文檔圖像預訓練語料庫,包含 1.13 億張圖像,涵蓋 17 種語言。其次,我們提出了一種聯合學習圖像到文字生成與像素級文檔重建的預訓練策略:前者使視覺表徵與文字內容對齊,後者則保留字符筆畫與佈局細節。我們在五項具代表性的文檔分析任務上進行了大量實驗,包括文字識別、公式識別、文字檢測、文檔篡改檢測以及重疊文字分割。將原始編碼器替換為 MonkeyOCRv2 後,所有五項任務的性能均獲得持續提升。最後,我們在更具挑戰性的文檔解析與文檔理解任務中,驗證了其作為多模態大語言模型視覺編碼器的有效性。當保持凍結狀態並與輕量級語言模型配對時,它產生了僅 0.7B 參數的文檔解析模型,在 MDPBench(一個近期推出的基準測試,涵蓋數位原生與拍攝的文檔,跨越 17 種語言)上創下了新的開源最佳表現,以 2.8% 的絕對值超越了先前最佳的 3B 參數 dots.mocr 模型,而視覺編碼器大小約為其 1/11。該凍結編碼器亦驅動了一個文檔理解模型,在相同訓練設定下,於八個基準測試中超越了基於 CLIP、DINO 和 SAM 的同類模型。這些結果表明,面向文檔的視覺預訓練本身就足以成為文檔智能的基礎。
從利用深度神經網路逼近狀態-動作價值函數,進而攻克極具挑戰性的遊戲,到演算法上的進展使得無須明確陳述問題規則即可解決問題,強化學習研究在過去十年間一直是科學重大進展的核心。本文聚焦於此研究進展的關鍵要素,並分析強化學習中典型的評估與設計典範。我們引入強化學習中規模法則的理論基礎,並證明在漸近性能上,強化學習演算法的效能排名與數據範疇之間不存在單調關係。透過大規模實驗,我們的結果顯示,在典型設計與評估典範下進行的某些強化學習研究路線,導致了錯誤的結論。我們的分析與結果對深度強化學習的規模化、容量及複雜度提供了核心見解。
大型语言模型(LLM)智能体正通过耦合规划、代码执行、调试与实证反馈,逐步实现机器学习工程(MLE)的自动化。然而,将这一能力迁移至医学影像领域仍面临挑战,因为每项任务都需要针对特定模态进行实验设计,并对验证协议与预测工件提出严格要求。为此,我们提出AMID——一种面向医学影像模型开发的自主多智能体框架。AMID首先引入数据条件化方法规划(Data-Conditioned Method Planning),该策略将粗粒度的任务级搜索空间细化为可执行、可并行化的方法通道(method lanes),并基于任务特异性数据分析与可运行的医学影像资源进行构建。随后,AMID开发了验证引导的两阶段优化(Verification-Guided Two-Stage Optimization),从广泛探索多样化方法通道的初期阶段,过渡至选择性利用具有潜力的候选方案,同时在整个优化过程中对验证协议、指标计算以及预测工件实施严格的验证约束。在涵盖多种模态与预测类型的20项医学影像挑战任务中,AMID的表现均优于所评估的通用MLE系统,并在若干任务中达到或接近由人类专家精心设计的解决方案水平。这些结果表明,AMID能够将针对特定任务的医学影像模型开发,从定制化手工工程转化为一种智能化工作流,从而在异构任务中生成高性能且可审计的模型工件。
本研究提出了一種統一的視覺模型公式,其中將遮罩、深度圖及其他結構化視覺訊號等非自然圖像的多樣視覺資訊,皆表示為RGB影像,而一般視覺任務則可轉換為通用的RGB到RGB影像編輯問題。在此範式中,不同類型的視覺資訊在內部與自然影像共享相同的編碼與解碼架構及參數,使單一模型能透過統一的視覺介面跨任務遷移,此方式類似於語言模型對文字的運作機制。我們將此公式稱為RGB輸入與RGB輸出(RINO)。基於無需特定任務微調的通用影像編輯骨幹,RINO在密集理解任務(如分割與深度估計,我們將輸出統一為RGB)以及密集條件生成任務(如姿態到影像生成,我們將輸入統一為RGB)中,展現出穩健且具競爭力的零樣本效能。期望本研究能為通用統一的視覺語言系統提供實用見解,使多樣視覺任務可透過共享的視覺語言表達、解讀與解決。程式碼已公開於 https://github.com/yangtiming/RINO。
針對預測任務進行微調的大型語言模型,雖然能達到準確預測,但校準能力可能不佳,且其思維鏈推理未必能忠實反映預測背後的證據。我們探討內部表徵是否能為此兩者提供更直接的觀察窗口。透過在 OpenForesight 上使用 Eternis-Forecaster 8B 模型,我們訓練了基於中間層激活值的表示池化探針,發現這些探針能達到顯著更佳的校準效果;此結果同樣適用於 GLM-4.7-Flash 與 GLM-4.5-Air 模型。接著,我們透過證據消融與干擾注入來評估思維鏈的忠實度:移除提示中具影響力的來源時,往往會改變模型的預測結果,但推理歷程卻不受影響。相同的探針可作為謊言偵測器:其激活值追蹤行為變化的能力遠優於推理歷程,且在 84% 的案例中能預測變化方向,包括當思維鏈隱藏干擾影響時。最後,強制回答實驗顯示,預測結果在推理開始前就已大致確定:僅需單次推理前的傳遞,即可還原已確定的答案與信心程度;而依據此預設答案分佈的離散程度來分流問題,可節省 30% 至 47% 的生成 token 數量,且準確率不受影響。綜合以上結果,本研究確立了探測內部表徵作為一種實用工具,可廣泛應用於語言模型預測器與推理模型的校準、稽核及分流作業。