每日精選AI研究論文及翻譯
近期的影片生成器能夠製造關於戰爭、災難、公共緊急事件及其他現實世界危機的逼真描繪,造成重大的錯誤資訊風險。然而,現有基準在此類情境下提供的證據有限,包括可檢測性如何隨生成條件變化、人們如何看待生成的影片,以及在社群傳播過程中檢測器是否仍然可靠。為填補這一缺口,我們提出RA-Bench,一個以真實影片為錨點(Anchors)的AI生成影片檢測基準。RA-Bench包含17,886部影片,涵蓋10個社會風險類別的1,830個真實影片錨點,以及來自四個開源與五個閉源生成器的16,056個生成片段。基於RA-Bench,我們沿三個維度組織評估。首先,我們評估七種傳統檢測器、三種審查情境下的十種零樣本多模態模型,以及兩種專門針對AI生成影片檢測進行微調的多模態大語言模型的檢測器泛化能力。在這些方法中,三個檢測器家族均未能在RA-Bench實例上持續泛化。接著,我們檢視可檢測性如何隨生成品質、條件資訊和取樣種子而變化。這些分析表明,生成屬性對不同檢測器家族的影響不同,而來源層級的檢測模式在不同種子間保持穩定。最後,我們研究社群傳播期間的人類真實性判斷與檢測器可靠性。我們發現,誤導人們的影片對當前檢測器而言同樣難以偵測,且社群傳播使檢測更加困難。綜合而言,這些發現表明當前方法難以檢測逼真的AI生成影片,凸顯了對能夠應對不斷演進的影片生成器之穩健檢測器的需求。
視覺在策略蒸餾高度依賴於具有資訊性的師生不對稱性,無論是透過更大的、更強的教師模型,還是透過特權監督(例如參考答案或真實標註的感興趣區域)。這提出了一個基本問題:當沒有任何特權資訊可用時,資訊性不對稱性從何而來?我們透過逆轉不對稱性的來源來回答這個問題。我們不是向教師添加特權資訊,而是從學生端減去資訊。這種不對稱性無需真實標註、獎勵或單獨的更強教師模型,即可免費產生與能夠獲取學生無法獲得之資訊的教師相同的有效學習信號。基於這一原則,我們提出了自監督視覺在策略蒸餾(S²VOPD),這是一種簡單而有效的方法,從不對稱的增強視圖中構建在策略學習信號。S²VOPD 以在策略方式將教師在原始圖像條件下的分佈蒸餾至學生在該圖像的強增強視圖條件下的分佈。我們系統性地探索了視覺增強廣闊的設計空間,並發現:(1) 不對稱性至關重要:所有四類增強家族均提升了性能,而對稱自蒸餾則使其下降;(2) 強度很重要:性能在中等強度時達到峰值;(3) 差異必須保持任務一致性:完全移除與問題相關證據的增強會導致巨大但無資訊性的差異。在六個細粒度感知基準上,S²VOPD 將 Qwen3.5-4B 從 70.7% 提升至 77.4%,超過了所有被比較的開源模型(包括高達 235B 的 Qwen3-VL),並超越了 GPT-5.4。在保持訓練數據相同的情況下,它恢復了使用特權資訊之方法所取得改進的 96%。網站位於 https://williamium3000.github.io/s2vopd
自主代理日益具備透過長期實驗來改進模型、系統及其他技術產品的能力。然而,欲掌握此能力之現狀,評估不應僅止於最終分數,因為最終分數既無法揭示進展在何處獲得或喪失,也無法反映累積的經驗是否有助於後續決策。因此,我們基於一個新框架,對七個前沿模型在三十六項長期任務上進行系統性評估。該框架採用基於規則的指標,透過「解決方案構思」、「執行」與「回饋控制」三個面向來刻畫運行內行為,並利用受控比較來評估任務內與任務間的經驗重用。結果顯示,當前代理的運作模式更接近工程優化器,而非全自主研究人員:它們能構思並實作實用的解決方案,但其表現在不同運行間存在大幅差異;其最強解決方案主要是在改編或結合既有技術;真正的方法論創新仍屬罕見。詳細分析揭示,觀察到的表現受多重因素影響,包括相似最終結果背後截然不同的流程瓶頸、可能助益亦可能誤導後續決策的經驗重用,以及影響表現穩定性的框架設計。這些發現為改進模型訓練、推論時期策略、經驗管理與框架設計提供了具體方向。
我們提出Mobius-v0,這是一種由全域共享的記憶體(FFN)所構成的架構,用於儲存知識向量,並搭配多個推理器(Self-Attn)以迭代方式達成組合性推理。以隱藏狀態作為快取與載體,推理器反覆查詢記憶體以取得所需知識向量,同時將知識傳回推理運算元。透過這種知識與推理分離的架構,Mobius实现了更佳的知識壓縮與推理效率。基於Mobius-v0架構:1)我們從零訓練的7B模型,其下游任務得分與7B Transformer基線模型相當,但僅需基線模型62.6%的訓練資料。2)我們的Intern-S2-Mobius,由Qwen3.5-35B持續預訓練而成,在達到相近下游任務得分的同時,端到端推論速度提升近4倍。
同策略蒸餾(OPD)為將推理能力從更強的教師模型遷移而來提供了一種有前景的途徑,但將其應用於長上下文推理教師與短上下文學生的組合時,會引入實際挑戰,包括 tokenizer 不匹配、師生分布不匹配、回應長度爆炸以及訓練不穩定性。在本研究中,我們透過將證明推理能力從長上下文推理模型 SU-01 遷移至短上下文學生模型來探討此設定。為處理 tokenizer 差異,我們在共享文本空間中執行 OPD,並且僅對齊在學生與教師 tokenizer 下佔據相同文本跨度的 token。為緩解生成長度過長與頻繁截斷的問題,我們引入了學生參考 KL 損失,並遮罩諸如 `</think>` 和 `<|im_end|>` 等特殊終止 token 的優勢。此策略限制學生模型過度偏離其初始策略,從而緩解師生分布不匹配問題,並促使長度穩定增長。在包括 Qwen3、Qwen3.5、Intern-S2、GLM-4.7、Gemma-4 在內的同一系列與不同系列學生模型上的實驗,一致顯示出數學推理能力的提升,尤其是自然語言數學證明方面。值得注意的是,Intern-S2-Preview 在 ProofBench 上提升了 21.2 分,達到 55.2,並超越了 Gemini-2.5-Pro。它在 HLE 和 HiPhO 等科學基準上也有提升,表明 OPD 所遷移的推理能力具有超越數學訓練領域的泛化性。
阿波羅之所以能登月,並非只因工程師能解開困難的方程式,而在於它把遙遠的抱負轉化為一套具明確目標、模擬、驗證與反覆修正的任務架構。人工智慧如今也正面臨相似的轉型:只要問題、工具與成功標準被清楚界定,前沿模型就能解決困難任務;然而,具重大影響的真實世界挑戰,很少會以可執行或可驗證的形式出現。 我們提出 Apodex Discovery,這是一個透過「高強度求解器」(heavy-duty solver)來建構與評估發現式人工智慧的框架。高強度求解器由基礎模型、執行框架、工具與控制策略組成,能夠進行長時間、具狀態性且可驗證的調查。它包含三大核心組成。第一,問題勘察流程調查了16個產業部門中的561個行業,彙整出423個高價值的真實世界問題,並從中篩選20個作為初始釋出。第二,一個共同的「環境—任務—回合」抽象層,提供資料、工具、限制、回饋、軌跡記錄,以及對中間產物與最終提交結果的驗證。第三,HDS6 獨立於最終任務是否成功之外,分別評估工具、修復、替代方案、連貫性、證據與範疇。 在 AAV 衣殼設計方面,Apodex 在可行性、嗜性、結構預測與生成設計等層面上,超越了已發表的當前最佳成果達 7%。在藥物再利用與再配方方面,一個任務特定的生物醫學環境,使 GPT-5.5 與 GPT-5.6-sol 相較於同一閉卷式骨幹模型的平均正規化預測分數,分別提升了 2.5 分與 7.6 分。受控消融實驗顯示,固定的 TRACES 回合介面能將效能差異歸因於特定的求解器元件。Apodex Discovery 使 AI 評估超越預先定義的基準,朝向以真實發現為目標的可驗證調查邁進。
互動式遊戲世界模型通常直接在像素或潛在空間中自回歸視覺觀測,迫使姿態、幾何與遮擋等結構化屬性必須由同一個生成序列隱式維持。在長程時間跨度中,這些潛在世界屬性的誤差會累積,使一致性與可控性變得脆弱。我們改為明確建模不斷演化的世界狀態,將精確的幾何計算委派給一個固定且零參數的渲染器,而讓神經模型負責合成外觀。我們將此概念實現為 Marionette——一個針對具有關節角色的互動式遊戲所設計的世界模型。首先,一個兩階段自回歸動力學模型預測明確且可解釋的 276 維 3D 世界狀態,其中包含多實體關節骨骼、度量根節點軌跡與旋轉。其次,一個零參數圖形橋接將預測狀態轉換為姿態控制影片,以閉式解計算世界空間幾何與遮擋。第三,一個以控制條件化的影片擴散觀測模型,從所產生的結構化控制信號中合成照片級逼真的 RGB 觀測。我們的實驗確立了 Marionette 的兩項特性。第一,預測的世界狀態可直接控制。強制輸入不匹配的動作流,在 48 個保留測試片段上使根部對齊關節誤差改變 31%。第二,長程行為由狀態決定,且可在該狀態中修復。若任其自由發展,兩個生成角色會漂移到相距 21.2 公尺(錄製的會話維持在約 5 公尺),且三分之一的影格出現地面穿透。對明確狀態施加兩條規則——地形碰撞器與分離上限——可將穿透降低 66%,並保持兩個角色持續互動,且無需修改觀測模型。將外觀生成經由預測狀態引導,並不會造成我們所能偵測到的保真度損失;其 FVD 為 831,而錄製姿態則為 799。
當前大型語言模型的開發依賴於規模龐大、且往往未經正式授權的資料集,這對致力於開源與符合倫理來源資料的研究者構成了極高的門檻。我們推出 Mimir v1,這是一個基於階層式推理模型(Hierarchical Reasoning Model, HRM)架構的十億參數語言模型,從零開始訓練,僅使用合規的後訓練資料,即在英語方面展現出極具競爭力的表現,並在丹麥語方面樹立了新的最先進水準。Mimir v1 使用 161 個資料集的混合進行訓練,在英語、數學與程式碼及丹麥語的 20 項基準測試中,超越了原始的 HRM-Text 1B,並可與 Qwen 3.5 4B 和 Gemma 4 E2B 等較大型的前沿模型相抗衡。該模型已於 Hugging Face Hub 上公開:https://huggingface.co/danish-foundation-models/DFM-Mimir
下一代人工智慧智能體正日益超越僅回答孤立問題的系統,朝向能理解、記住並從使用者經驗中持續學習的持久性個人助理發展。此類助理需要長期記憶以隨時間累積並運用使用者特定經驗,然而現有基準在真實行動裝置環境中仍顯不足——在該環境中,經驗是異質、多模態、不斷演化且高度個人化的。我們提出 MobileMem,一個以年度規模行動經驗收集為基礎、用於研究裝置端長期記憶的基準與框架。MobileMem 採用知識導向的合成管線,從使用者應用程式工作階段建構連貫且時間一致的長時程軌跡。其提供互補的文字與多模態設定,涵蓋多跳推理、時序推理、知識更新與隱性偏好推斷。具體而言,MobileMem 使智能體能夠記住過去、理解當下並適應未來。透過對經驗而非孤立事實進行建模,MobileMem 將記憶從資訊檢索推進至經驗智能,以實現持續的個人化學習。
人形機器人運動追蹤是遙操作與全身模仿的核心技術,然而其評估結果往往與人們在影片中的感知不一致。運動學誤差雖能平均逐幀姿態差異,卻忽略了最關鍵的物理偽影,特別是不穩定的支撐以及錯誤的接觸,例如腳部滑步與時機不當的觸地。此外,目前廣泛使用的測試套件規模偏小,缺乏足夠的多樣性來充分考驗接觸密集且長時間跨度的行為。我們提出HumanTracker,使人形機器人追蹤評估兼具感知對齊性與可擴展性。HumanTracker基準包含來自多位專業表演者的約153小時光學運動軌跡,組織為四個動作族類,並附有文字標註以支持細粒度診斷。我們進一步提出HumanScore,這是一個基於偏好對齊的指標,在包含24K個動作的12K組動作配對上訓練而成。在具代表性的最新追蹤方法上,HumanScore能更準確地預測人類偏好,並揭露運動學指標經常遺漏的接觸與穩定性失敗。
隨著圖像編輯模型的快速發展及其在各個領域的廣泛應用,將這些模型能力直接部署到實際場景中的需求日益迫切。然而,現有的基準測試仍局限於簡單的單圖像任務,存在覆蓋維度有限、難以有效區分不同模型性能的問題。因此,它們無法可靠地評估模型在複雜多圖像編輯、高要求推理指令以及實際部署場景中的性能。為了解決這些局限性,我們提出了CPI-Bench,一個面向真實世界圖像編輯的綜合性、實用性與智能性基準。CPI-Bench包含三個核心子集:CPI-General-Bench,全面涵蓋多樣化的編輯任務,並首創性地納入多圖像編輯評估;CPI-Practical-Bench,專注於高頻率的真實用戶應用場景;以及CPI-Intelligent-Bench,致力於評估高要求推理型編輯的能力。基於CPI-Bench對主流圖像編輯模型的評估結果表明,CPI-Bench增強了模型之間的性能區分度。它為通用編輯能力、實際部署效果以及高級推理型編輯之間的差距提供了全面且可靠的量化,為圖像編輯模型未來的優化提供了寶貴的指導。關鍵的是,我們的排名分析顯示,CPI-Bench與Arena Image Edit排行榜的對齊程度最高,表明它能準確反映人類評估者的偏好與感知判斷,可作為真實用戶體驗的有力替代指標。
人腦展現出高度的功能特化,不同的神經網絡分別支持語言、形式推理、對他人心智的推理,以及對物理世界的推理。這種模組化組織究竟是智慧系統建構的基本原則,抑或是生物大腦在演化過程中的偶然產物?在此,我們檢驗此種相似的組織是否出現於大型語言模型中——這是另一類透過截然不同的優化過程所創造的智慧系統。透過跨四個認知領域(語言、形式推理、社會推理、物理推理)共 N=46 個任務的電路分析,我們發現大型語言模型發展出與人腦相互映照的模組化架構:在人腦中啟用相同網絡的任務,會在大語言模型中招募重疊的神經元;而啟用不同網絡的任務,則會招募不同的神經元。模組化在大腦與神經網絡中趨同出現,此一事實顯示模組化可能為智慧系統的基本屬性。
讓智慧體從經驗中學習並將其內化為策略,已成為自我演化AI的核心問題。同策略自我蒸餾(OPSD)透過利用特權自我教師對學生自身的軌跡提供密集監督,提供了一條有效途徑;然而,現有方法仍高度依賴設計者指定的特權產物(例如答案、回饋、技能或軌跡),限制了持續自我改進所需的端到端可學習性與可擴展性。在本研究中,我們提出潛在同策略自我蒸餾(LOPD),其並非提出另一種以新形式指定特權上下文的手工設計OPSD變體,而是讓教師的特權上下文本身能夠端到端地從經驗中學習。在技術上,LOPD檢索相關經驗並將其組合成連續的潛在令牌,用以條件化自我教師,同時學生從任務與互動歷史中生成軌跡,並在每個造訪的前綴處接收密集的令牌級監督。我們進一步引入特權間隔目標函數,以穩定並規範潛在上下文的學習。在實驗上,LOPD展現了(I)強大的性能,在智慧體工具使用與程式碼生成兩項任務中均優於RLVR及代表性的OPSD方法(包括OPSD、SDPO與Skill-SD);以及(II)高學習效率,以不到GRPO與Skill-SD 30%的展開預算即超越兩者。消融研究進一步提供了直接證據,表明使特權上下文可學習對於實現這些增益是必要的。綜上所述,這些結果將LOPD定位為邁向更具可擴展性與自導向性的智慧體演化範式的一步。
我們提出以「主張層級證偽」作為測試時擴展的原則,並透過「主張層級可靠性評估」(CLR)加以具體實現。CLR 是一個無訓練框架,將測試時運算從額外的解採樣重新分配至針對性驗證。由於整體軌跡評估常因常規詞元造成的訊號稀釋而掩蓋決定性錯誤,CLR 將每個推理軌跡濃縮為一組緊湊且對決策關鍵的主張,藉此隔離其邏輯錨點。此外,考量到在固定模型能力下生成完全正確的解具有內在困難,CLR 將重點轉向語義證偽。此方法利用了「解建構」與「主張反駁」之間的根本不對稱性:建構有效解需要一條無瑕的推理路徑,而反駁錯誤主張僅需找出一個決定性缺陷。這種針對負面證據的搜尋系統性地壓縮了高信心錯誤軌跡的存活空間,並透過非線性可靠性評分有效抑制錯誤共識。在匹配預算下,跨越四個大型語言模型與四個推理基準,CLR 普遍優於 pass@1 與自洽性。例如,在 GPT-OSS-20B/CMIMC25 上,CLR 較 pass@1 高出 27.15 個百分點,並以減少 37.0% 的詞元將自洽性準確率從 77.50% 提升至 82.19%。
細粒度的機器人評估對於理解具身模型至關重要,它超越了二元成功率與基於規則的過程評分。我們提出了 PRM-as-a-Judge 1.5,這是一個用於機器人過程評估的工具包,可將執行影片轉化為密集的進度曲線,並推導出多個細粒度指標。PRM-as-a-Judge 1.5 在 1.0 版本的基礎上引入了三個指標,分別表徵失敗側的進展、回撤後的恢復以及成功側的執行品質,幫助用戶理解具身模型的能力。基於基準中的執行影片,我們對具身模型進行了全面評估,提供了一些細粒度指標結果與關鍵發現。我們進一步引入了 RoboPulse++ 來評估過程獎勵模型(PRM)的可靠性,為評估者提供更準確的測試平台。此外,我們發布了一個用戶友好的評估套件,包括基準、指標實現與可視化工具,以支持可重現的操作過程評估。我們呼籲社群重新思考機器人的評估方式,並將透明、程序化且可重現的評估確立為下一代具身智能的基礎。
在 ReAct 範式中,LLM 智能體在推理、行動與觀察之間交替進行,但審慎的推理僅限於「思考」階段:當智能體序列化一個行動並等待環境回應時,其推理便陷入凍結。我們將這段在行動與觀察期間反覆出現的間隔視為一個推理閒置窗口,並探討它能否並行地承載額外的推理,以服務於未來的回合。為此,我們提出了 Second Thought——一個免訓練的推論框架;它在每個思考階段結束的當下即刻分出四個輔助分支,與主迴圈並行解碼,並在環境觀察到達時將這些生成的想法合併回來。如此一來,Second Thought 便將新增的推理移出主執行緒的序列化解碼路徑。在三個智能體基準測試與三個推理型 LLM 上,Second Thought 於全部九個(模型,基準)組合中降低了平均回合數,並在其中六個組合中將主執行緒解碼量減少最多 43%(這些設定下平均約 20%),在第七個組合中則基本上未變;Pass@1 在九組中的七組沒有顯著變化,而兩個顯著差異分別為 +12.4 與 +10.2 個百分點。與計算量匹配的對照組(該對照組將等量預算強加於主執行緒自身的推理)相比,在對照組適用的所有四個設定中,Second Thought 皆以少 1.3 至 3.2 的序列化解碼量取得了嚴格更高的 Pass@1。
多模態大型語言模型(MLLMs)展現出強大的視覺理解能力,然而導致這些行為的內部特徵仍難以識別、審計或控制。雖然稀疏自編碼器(SAEs)可將隱藏狀態分解為可解釋的特徵方向,適用於事後檢查,但此類分解既難以直接隔離多模態訓練所改變的特徵,也無法直接用於目標性控制。我們提出MMDiff,一個多模態模型差異分析框架,透過訓練多模態SAEs並將其轉化為特徵層級的介面,以發現和控制多模態行為。MMDiff支援三種用途:(i)特徵隔離,透過將基礎語言模型SAE與其多模態適配版本進行差異分析,以識別多模態訓練所改變的特徵;(ii)任務特定特徵偵測,透過逐詞元對比激發分析,隔離因果特徵;(iii)特徵層級控制,透過因果性地移除或引導所發現的特徵方向。我們為三個MLLM系列——LLaVA-MORE、PaliGemma 2和InternVL3.5——訓練多模態SAEs,並在視覺空間理解、多模態安全和OCR任務上進行評估。MMDiff發現稀疏且具因果特異性的特徵,移除這些特徵會選擇性地降低目標行為表現,在空間任務上平均降低12%,在OCR上降低17%,並將多模態安全攻擊的攻擊成功率降低24%,且對VQA效能沒有影響。引導這些特徵相較於標準的單層引導基準,在空間和OCR準確率上平均分別提升+3.6%和+1.8%。這些結果表明,多模態SAEs不僅可作為可解釋性工具,更可作為審計、引導和控制MLLMs行為的機制,以朝向更安全且更強大的生成結果。
在預測1,000檔美國股票的每小時報酬率時,我們觀察到一個出乎意料的現象:預測結果近乎平坦,且以橫斷面相關性衡量時,股票排序表現不佳。我們將此現象稱為「預測崩潰」。令人驚訝的是,在相同設定下預測交易量時,此現象大幅消失。我們在時間序列基礎模型(TSFMs)、十二種深度學習預測模型及97組公開基準配置中探究預測崩潰現象,發現其與目標可預測性密切相關。我們從中辨識出兩個不同成因:低可預測性限制了校準點預測的幅度,而逐序列的目標函數則未能識別跨序列結構。這些發現揭示了校準與排序之間的權衡:優化均方誤差會導致預測趨於平坦,而直接優化橫斷面相關性雖能改善排序,卻可能使預測幅度膨脹逾一個數量級。為解決此權衡,我們提出CalibRank,一個兼顧校準與排序的簡潔目標函數。在Finance1K上,CalibRank使橫斷面相關性幾乎提升三倍,同時保持預測幅度接近目標值,並在所有受測模型上均提升了相關性。我們的結果揭示了傳統時間序列評估中的一個盲點:逐序列指標可能掩蓋下游決策所需的跨序列結構之失敗。
現代語言模型是在異質化的網路規模文本語料庫上訓練而成。因此,研究知識與技能的習得相當困難,因為模型先前接觸過的相關內容難以界定。為應對此挑戰,我們引入了LITTLECURRICULUM,這是一個精心策劃的880億token預訓練語料庫,專門針對美國小學教材內容設計,明確排除五年級以上所教授的概念、事實與詞彙。僅使用LITTLECURRICULUM從零開始訓練一個50億參數的大型語言模型,即得到LITTLELEARNER,此模型具備足以進行開放式評估的語言能力,但其知識與能力邊界清晰對應於可解釋的課程指引。我們釋出LITTLECURRICULUM與LITTLELEARNER,作為一個發展階段受限的沙盒環境,用以研究模型如何在明確界定的訓練範圍內習得、表徵及運用資料。我們在一系列初步實驗中展示了此沙盒的實用性,這些實驗探討透過後期訓練與情境內學習注入新知識的方法。這些方法使LITTLELEARNER能更有效地運用既有知識,但並未提升超出範圍的能力。我們的研究結果強調了此受控環境對於未來研究的重要價值。
隨著大型語言模型規模的擴展,其訓練token預算也必須相應增加,以維持適當的每參數token數比例(\(TPP\))。然而,高品質的領域資料遠比一般網路資料更難以擴展。隨著模型規模與訓練token預算的增加,高品質領域資料在訓練混合中的占比往往會下降。重複使用現有的高品質資料提供了抵消這種稀釋效應的有效途徑,但過度的重複可能導致過擬合。我們在實際的大型語言模型擴展情境下研究此權衡取捨,其中訓練token預算隨模型規模成比例增長。針對固定領域,我們首先發現,令人驚訝的是,在固定的\(TPP\)下,最適重複次數會隨模型規模略微增加。跨不同領域比較時,我們發現最適重複次數與該領域的最終驗證損失呈強烈負相關:損失較低的領域通常能從更多的重複中受益。相比之下,獨特領域資料的數量與最適重複次數僅有微弱的關聯。這些發現表明,在具有相同\(TPP\)的較小代理模型上調整出的重複次數,可為較大模型提供實用的估計依據。
臨床決策支援正逐漸演變成由語言模型代理組成的委員會,在共享工作區上進行集體審議。我們要探討這類委員會是否可能被捷徑所欺騙,也就是那些基準測試會獎勵、但臨床醫師會忽略的線索。在涵蓋文字(MedQA-USMLE、MedMCQA、MIMIC-CXR報告)、影像(NIH ChestX-ray14、MIMIC-CXR-JPG、CheXpert)及表格型ICU紀錄(SUPPORT2)的六個公開資料集、七個隊列中,Gemini 委員會在單獨接觸這些線索時能抵抗(翻轉率5-16%);然而,一種社交上合理的捷徑會擴散:當兩個同儕斷言同一個錯誤答案時,受測的留出者有38%會採納該答案;虛假的「預篩選」系統標記也同樣會被採納,且兩個能力等級皆然。在三種監督代理中,閘門代理無法區分「採納」與「誠實同意」(假陽性率100%);僅閱讀轉錄稿的同源評判者能在文字任務中標記出採納行為(精確度100%,召回率93%),但在影像任務中則與閘門無異;而私下重新查詢留出者的裁判則可轉移至影像任務(精確度77-88%,假陽性率13-21%)。將線索的視覺顯著性增為三倍並不會改變傳染效應,但增加第二個同儕的聲音卻會使其再提高一半。利用隱藏評分標準進行欺騙幾乎不留痕跡:文字任務中僅有1/10、影像任務中僅有1/134的偏移者會說出他們所趨向的評分標準。能欺騙委員會的是社交上的合理性,而只有獨立於自我報告的裁判才能捕捉到它。程式碼:https://github.com/criticaldata/benchmaxxing
Muon 最佳化器因其三次方時間的 Newton-Schulz 正交化步驟而產生顯著的額外成本。當權重被分片時,通訊開銷更會加劇此計算成本,在許多情況下侵蝕了 Muon 的優勢。我們提出 Dion3,這是 Muon 的修訂版本,旨在堆疊的各個層級解決此開銷。我們的 Gram Newton-Schulz 演算法降低了正交化的 FLOP 成本,我們的 CuteDSL 核心透過利用對稱性來加速運算,而我們的巨型批次(megabatching)策略則減少了通訊開銷。此外,我們對更新規則提出了一項簡單的修改,進一步降低成本:在每一步僅選取動量矩陣的一部分列進行正交化。此更新規則在速度和效能上均優於 Dion(另一種 Muon 的「壓縮」版本)。整體而言,Dion3 在損失上與 Muon 相當或更佳,但將最佳化器步驟時間降低最多 6 倍。Dion3 可透過 dion 套件(https://github.com/microsoft/dion)取得,作為 Muon 的直接替代品。
我們證明,採用可驗證獎勵的在策略強化學習(RLVR)在改善當前目標的同時,可能使後續目標的成功行為過於罕見,以致無法被採樣並加以強化。我們將此稱為驗證器誘發的支撐集重塑,並將有效可獎勵支撐集定義為在固定 rollout 預算內可達到的成功軌跡。在兩個模型系列中,我們透過重複的驗證器評分採樣,以及在數學推理和受限指令跟隨上的雙向訓練(包括使用相反驗證器的順序訓練)來研究此效應。數學 RLVR 提高了平均指令跟隨成功率,但在重複採樣下,減少了至少有一個成功回應的提示數量。在 Qwen3-8B-Base 於 IFEval 上的結果中,pass@1 上升了 6.5 個百分點,而 best@32 下降了 9.8 個百分點;同樣的分歧也出現在兩個模型和 IF 基準上。相反地,IF-RLVR 使數學回應從逐步推導的開頭轉向直接答案,降低了各採樣預算下的 best@k,並減少了後續 Math-RLVR 的獎勵變異。Token 分佈分析和受控的開頭干預實驗表明,這些變化集中在回應的前幾個 token 上。RLVR 主要對基礎策略中已有的開頭進行重新排序,而所選的開頭會因果性地影響數學的可搜尋性。所測試的參考策略約束、路由先驗和在策略蒸餾只能部分保留跨任務支撐集;MathIF 和 ReasonIF 表明,邊際收益僅部分轉化為既正確又遵循約束的回應。因此,端點改進並不能保證在策略最佳化下的未來可訓練性或聯合能力。程式碼可在 https://github.com/sylvain-wei/verifier-induced-support-reshaping 取得。
大型視覺語言模型(LVLMs)展現出卓越的視覺推理與對話能力,然而經常產生缺乏視覺輸入支持的幻覺內容。有效的緩解需要詞元級定位,才能在不丟棄整個回應的情況下進行針對性干預。現有的偵測器需要昂貴的全模型微調、依賴忽略模型生成過程的外部驗證器,或將內部訊號簡化為孤立特徵與手工統計量,因而丟棄了空間、序列與關係結構。我們提出 UniProbe,一種輕量級、統一且可學習的偵測器,能從單次前向傳播中建模凍結 LVLM 的異質計算軌跡。UniProbe 在影像區塊、查詢詞元與生成詞元上建構有向圖,以注意力權重編碼其關係。它使用交替的結構感知模組處理此軌跡:GNN 處理關係證據、ViT 處理二維視覺幾何、GRU 處理回應順序。交織這些模組使空間、關係與序列證據能在整個偵測器中互動。我們進一步開發串流變體以進行幻覺感知解碼,在生成期間偵測並重新取樣幻覺詞元,並提出自我適應策略,使偵測器與 LVLM 自身生成內容對齊。在各種 LVLM 骨幹上,UniProbe 達到詞元級與物件幻覺偵測的最新技術水準。在解碼期間,它以標準生成 1.06 倍的延遲,將物件幻覺減少高達 55%。
科學圖形與表格編碼了關鍵的實驗證據,但對於數位圖書館和多模態人工智慧系統而言,它們仍然難以檢索和解釋。ALD/E-ImageMiner 基準測試與 ICDAR 2026 原子層沉積/蝕刻科學圖形資訊抽取競賽提供了來自 205 篇出版物的 1,951 個圖形,並由專家進行註釋,涵蓋分類、資料表格抽取、摘要和視覺問答。在這些配套論文中,我們提出了前瞻性的視角,探討該基準如何引導未來的科學圖形挑戰。我們檢視其任務如何探測從視覺和量化閱讀到領域基礎推理和證據證明的能力,以及受 Bloom 分類法啟發的問題設計如何支持更深入的科學理解。我們提出「從圖像中進行科學概念理解」作為長期基準目標,未來方向包括更廣泛的領域和圖形類型、上下文與跨文件綜合、假設評估、來源追溯、不確定性、反事實基礎,以及開放式多模態研究。此視角將 ICDAR 2026 挑戰與更廣泛的、可機器操作的科學視覺知識和可驗證的多模態科學人工智慧議程聯繫起來。
在推理模型中,哪些推理行為與正確答案相關?推理導向訓練是否會放大這些行為?此區別之所以重要,是因為推理導向訓練可能使軌跡看起來更具深思熟慮性,卻未必放大與模型正確性最相關的行為。我們透過行為提升(Behavioral Lift)來量化此不匹配,該指標衡量在模型的推理軌跡中,某行為出現與否時正確性的變化程度。在涵蓋純文字與視覺-語言推理的15個模型與6個基準測試中,我們以一套核心行為同時為LLM與VLM軌跡定義的分類法,標註了15,282條軌跡。我們發現了放大-提升差距(Amplification-Lift Gap)的證據,其中思考模型大幅放大自我修正、假設檢驗與不確定性承認,而提升最高的行為則是信心校準、知識對齊與自我覺察。信心校準在兩種模態中皆是最強的正確性正向訊號之一,卻幾乎未被放大;不確定性承認被放大了3至7倍,卻與正確性僅有弱相關或負相關。我們發現推理導向訓練並未優先放大提升最高的行為,這促使我們採用能夠獎勵校準且紮根之推理的過程層級目標,而非僅獎勵表面形式。
在大型群眾外包語料庫上訓練的神經語言模型,經常利用與目標標籤相連的虛假表面模式,而這些模式並無真正的語言學或因果關聯;這使得基準評測表現提升,但在對抗性或分布外輸入上卻會失敗。現有方法或需手動指定特徵詞彙表,或僅部分自動化發現流程,因而未能解決資料集層級相關性與模型層級利用之間的鴻溝。我們提出 UNMASK,一個全自動化流程,可在無需額外人工標註的情況下,發現、因果驗證並緩解文本分類器中的虛假相關。給定未標註的訓練樣本,UNMASK 生成以可執行布林表達式呈現的候選表面模式,透過具獨立重複的統計驗證協議進行過濾,並藉由經驗證的反事實干預建立因果模型依賴性。經因果確認的特徵隨後作為無需標註的群組定義,用於深度特徵重新加權(Deep Feature Reweighting, DFR),從而消除標準 DFR 所需的群組標籤。應用於在 MNLI 上訓練的 BERT 與 RoBERTa 時,我們的流程獨立重新發現了已確立的詞彙重疊與否定偏誤,在 BERT 上驗證了 10 個特徵中的 9 個,在 RoBERTa 上驗證了 6 個,並將 HANS 準確率提升了最多 12.58 個百分點。在 CivilComments-WILDS 上,程式化群組達到了與人工標註 DFR(Kirichenko et al., 2023)相同的 70.1% 最差群組準確率,且無需人口統計標註。我們進一步證明,發現與驗證階段可推廣至獎勵模型的偏好資料,在 RewardBench2 中揭示出可解釋的虛假相關。
Nanbeige4.2-3B 是一個具有30億參數的智能體模型,其核心為迴圈Transformer(LT),透過重複使用同一層堆疊進行第二次前向傳播,在不增加參數的情況下有效提升模型深度。在Apple Silicon(MPS)上進行評估時,我們發現了五個獨立的錯誤,導致已發布的檢查點無法直接透過Hugging Face transformers執行(包括一個靜默歸零的RoPE緩衝區,以及對已移除之transformers快取API的呼叫)。此外,我們證明僅修正這些錯誤仍不足以應付智能體任務,原因在於LT的層重用策略(實際上使峰值注意力記憶體加倍)被用來實現參數效率。因此,我們引入了一種分塊預填充策略,以緩解所產生的記憶體容量損失,在32 GiB共享記憶體上將可容許的上下文寬度延展了2.7倍。然而,即使記憶體開銷降低,我們仍顯示需要修補程式才能使Nanbeige4.2-3B得以使用;同時解決系統提示與MPS原生記憶體錯誤後,最終才能在標準MCP與工具呼叫基準上進行可靠評估。在MCPMark的一個子集上,除錯後的模型能完成多達30%的真實智能體任務(原先為0%);在BFCL上,它在單一工具呼叫方面近乎完美,但在多工具測試中大多失敗。我們已在https://github.com/johnhalloran321/Nanbeige4.2-3B-mps-fix發布修補後的檢查點、系統提示最佳化器及評估框架。
議會程序是民主審議的主要記錄,然而其數量龐大且內容零散,使得公民、記者與研究人員難以進行多視角取用。將檢索增強生成(RAG)應用於議會逐字紀錄會引入三項具體風險:最頻繁發言者的主導、無法根據主題專業知識對發言者加權,以及在政治敏感文本中的引用誤歸。我們提出 ParliamentRAG,一個針對義大利眾議院的 RAG 系統,共同應對這些風險。其核心貢獻在於一個依賴主題的權威模型,該模型根據當前查詢來估算每位發言者的權威性,並結合職業、教育背景及先前發言等可解釋的組成要素。給定使用者查詢,系統會檢索相關的發言片段,識別各議會黨團中與主題相關的專家,並生成綜合其觀點的摘要,同時附上支持性引文。ParliamentRAG 透過結合自動化指標及六位領域專家進行的盲測 A/B 人工評估之兩級協議,在 15 個政策主題上與 Google NotebookLM 進行比較評估。該系統在跨政治團體的覆蓋率(0.97 對 0.95)、完美的引文忠實度(1.00 對 0.95)以及專家對來源相關維度的偏好上表現更佳,而 NotebookLM 在散文導向維度上仍具優勢。
從視覺觀察中進行空間感知與推理,需要恢復幾何結構、建立對應關係並理解空間關係。現有方法通常使用特定任務的架構或外部幾何模組來分別處理這些能力,限制了同一物理場景中互補表徵之間的知識遷移。我們提出 SPARGen,一個統一的多元模態框架,將三維重建、稠密對應與空間推理重新定義為指令條件化的生成任務。SPARGen 將緊湊的結構化與語言輸出序列化為詞元序列,同時以影像對齊的形式生成稠密幾何場,使空間監督能夠在原生多元模態生成模型中共同塑造共享表徵。在三維重建、對應關係與空間推理等基準上的實驗顯示,SPARGen 在單一原生多元模態生成框架內,於異質空間任務上達到了具有競爭力的表現。
2023年,一名紐約法官在Mata v. Avianca一案中,對兩名律師提交含有ChatGPT所生成虛構引用的書狀而施以制裁。此類失誤大多可透過資料庫查詢予以察覺;較棘手的問題在於偵測那些指向真實案件、但卻無法支持其所援引命題的引用——此種失效模式在現有針對LLM法律應用之評估中大多遭到忽略。本文透過對兩個法律語料庫中的真實法律引用進行受控擾動,來研究命題層級的引用支持驗證,做法是替換被引用的案件,或僅在同一案件內變更精確頁碼。我們在所得範例上評估十四種模型配置。模型能捕捉93-100%的錯誤案件竄改。然而,對於法院判決意見中的錯誤精確頁碼竄改,模型僅能捕捉37-61%;對法律狀紙則能捕捉52-83%。當模型未能捕捉錯誤精確頁碼竄改時,它們是基於主題重疊而非頁碼層級的支持來接受該引用。規模與擴展推理縮小了差距,但未能消除差距:GPT-5.4在高推理強度下,仍遺漏法院判決意見中40%的精確頁碼不符,以及法律狀紙中18%的不符。提示模型在引用的頁碼處驗證支持內容可提升召回率,但也提高了誤報率。辨識正確的法律主題與驗證所援引命題的支持內容,是兩種截然不同的能力,而當前模型將兩者混為一談。
儘管多模態大型語言模型(MLLMs)已取得顯著進展,視覺理解與視覺生成通常仍被視為分歧的目標。現有的統一框架往往依賴離散視覺標記化或擴散目標,而這些生成目標與視覺理解模型所使用的連續表徵不同,使得直接遷移以增強現有預訓練MLLMs並非易事。在本工作中,我們提出GAS,一個生成引導訓練框架,將視覺生成重新詮釋為表徵學習的輔助監督。具體而言,GAS在解耦的Mixture-of-Transformers(MoT)架構中採用下一嵌入預測(NEP)作為跨模態生成範式。透過維持共享的下層主幹與並行的上層網路,GAS讓生成損失以更精細的空間精度與更強的視覺保留來豐富共享的視覺路徑,同時隔離上層理解網路使其不受直接生成梯度的影響。為了最大化這種協同作用,我們進一步構建高度相關的生成任務,這些任務需要深層認知基礎而非僅是通用合成。在不同模型規模與訓練階段中,GAS均能提升整體多模態理解能力,其中在感知與空間理解上的增益最為可靠。至關重要的是,由於輔助生成分支在訓練後即被丟棄,這些增益不會產生任何推論開銷。廣泛的受控比較與表徵層級分析進一步闡明了生成引導訓練何時及為何有助於理解,並證實生成引導訓練作為增強多模態理解的實用途徑之可行性。