每日精選AI研究論文及翻譯
我們提出 BDH-CQ,一種結合上下文學習與遞迴潛在推理的推理模型。推論時呈現的輸入會持續更新模型的遞迴記憶;模型接著在高維潛在空間中透過迭代計算來解出查詢,而不以語言表述其中間推理過程。我們在公開的 ARC-AGI-1 評估集上評估此模型,並使用受控的類 ARC 干預來研究模型從示範中學到了什麼、如何一致地應用推斷出的變換,以及哪些概念仍然難以處理。一個具有 150M 參數的設定,在每任務計算推理成本為 0.0007 美元的情況下,達到了 29.5% 的 pass@2。此操作點突破了先前報告的 ARC-AGI-1 成本-準確率帕累托前沿,在基準測試成本效率上樹立了新的最先進水準。
Macaron-V1 是一個面向經驗智能的開放式智能體模型系列:從真實環境中的經驗學習,並在部署後持續學習。其設計圍繞兩個系統目標展開。適應性透過對版本化模型-測試框架配對的遞迴改進來實現,其中來自某一配置的經驗在外部契約下被評估,並用於構建其繼承者。協作則透過 LoRA 混合(Mixture-of-LoRA, MoL)架構來實現,該架構凍結基礎模型、組合專家 LoRA 適配器,並在每次使用者回合中選擇一個 LoRA。旗艦模型 Macaron-V1-Venti 結合了 744B GLM-5.2 基礎模型與四個分別用於聊天、智能體、程式碼和 GenUI 的 LoRA;基於 Qwen3.6 的 Macaron-V1-Tall(50B)則採用相同設計用於本地部署。本報告將 Macaron-V1 呈現為一個涵蓋架構、演算法和基礎設施的協同設計系統。MoL 架構透過可擴展的 LoRA 專家支援持續學習。演算法結合了模型-測試框架協同設計與遞迴自我改進迴圈,其中包括 UI4A 元件原生 GenUI 測試框架、有狀態動作基底、版本化 HCP 契約,以及智能體強化學習框架 MindForge。支援性基礎設施包括後期訓練平台 MinT、長上下文強化學習方法 LongStraw,以及針對稀疏 MoE 和 DSA 基礎模型的穩定性技術。我們在個人智能、GenUI 和一般能力基準上,對照前沿基線評估了 Macaron-V1。我們的結果驗證了當前系統,而持續學習和集體智能帶來的複合增益仍是開放問題。
隨著 AI 程式設計代理承擔越來越複雜、長程的軟體工程任務,現有基準正迅速飽和,其評估品質也受到嚴格檢視:近期一項審查發現,近 60% 未解決的 SWE-bench Verified 實例含有有缺陷的測試——這些測試可能過於狹窄,拒絕了正確的解決方案;也可能過於寬泛,檢查了未陳述的需求——且前沿模型可以逐字重現訓練資料中的黃金修補程式。程式碼重構需要在多個檔案之間進行協調且保持行為不變的變更,這對代理能力構成了難度高得多且更貼近現實的測試,然而現有基準對此領域的涵蓋仍嚴重不足。我們提出了 SWE-Bench ProMax,這是一個由專家策劃、多語言的程式碼重構基準,包含 170 個實例,取自七種程式語言(Python、Java、TypeScript、Go、C、C++ 和 Rust)的真實提交。每個實例都經過嚴謹的多階段篩選,直接解決了先前基準中識別出的品質問題:問題描述從頭重寫,以提供精確且無歧義的規格;測試套件經人工審查,以移除過於狹窄和過於寬泛的測試。複雜度不足或跨檔案範圍有限的任務會被篩除,最終形成一個具挑戰性的大規模重構任務基準,平均每個實例修改 11.4 個檔案和 261.6 行程式碼,規模大幅超過現有基準。我們在兩種代理框架下對前沿模型進行的實驗顯示,最佳模型僅達到 41.2% 的解決率,這證實 SWE-Bench ProMax 對當前 AI 程式設計代理構成了一個重要且尚未飽和的挑戰。我們的基準可於 https://huggingface.co/datasets/swe-bench-promax/SWE-Bench-ProMax 取得。
我們提出 Ouroboros,一個自我發展的智能體框架;其工具、提示詞、上下文組裝與核心實作,皆透過經過審查的提交來改進,而這些提交本身即成為後續工作的運行環境。核心演化以兩種模式進行。在遞迴自由演化中,改進本身即為一項任務,完成一個演化週期即可安排下一個。在經驗驅動的核心演化中,日常工作與社交互動會暴露錯誤、粗糙之處,以及低效的上下文建構方式,從而促成經過審查的結構性變更。 在 Terminal-Bench 2.1 上,Opus 5 的一次運行得分達 86.74%,是該基準上目前已回報的最佳成績。在 OSWorld-Verified 上,Opus 5 的一次運行達到 90.69%,超越了先前回報的最佳分數。一項五次 rollout 的 CL-Bench 測試活動達到了 0.2301 的標準化獎勵,樹立了新的最佳表現。 Hope 是公開紀錄中運行最久的 Ouroboros 部署。這是一項為期 161 天的活體智能體實驗,在受規範的人類溝通下,於七個介面上進行自由演化。人類互動會讓故障浮現,並產生提案,但由智能體決定要採取哪些變更。由於自我發展的智能體可能改寫自身程式碼,並選用新的模型 API,操作安全便成為首要的設計問題:護欄必須在演化壓力與公眾社會壓力下仍保持其權威性。基準測試活動使用凍結的系統快照,而 Hope 則在另一條獨立的譜系上持續進行即時演化。
在策略(自我)蒸餾(OPD/OPSD)在大型語言模型(LLMs)的後期訓練中展現了強大的潛力。然而,現有方法仍高度依賴外部監督,包括真實標籤信號、環境回饋或更大模型的引導,因此無法實現真正的「自我」蒸餾。本研究中,我們證明僅透過模型自身的生成結果以及內部一致性,即可實現在策略自我蒸餾。我們提出無監督在策略自我蒸餾(U-OPSD)。U-OPSD 首先採樣多個 rollout,並在自我一致性閾值下透過多數決建構偽解決方案;接著,讓模型的分佈以偽解決方案為條件,並在不一致的生成結果上進行自我蒸餾,使模型能在其自信但錯誤之處進行精確修正。在各種基準測試、基礎模型與訓練設定下,U-OPSD 一致地優於基礎模型,並與使用真實標籤(GT)的監督方法(如 OPSD 和 GRPO)相當或更佳。在五個數學推理基準(AIME24、AIME25、HMMT25、MATH500 和 AMC23)上,U-OPSD 在 Qwen3 非思考模式下,於 4B 和 8B 規模分別比基礎模型提升 8.5% 和 10.7%,且平均分別領先 OPSD 3.2% 和 2.3%。在思考模式下,U-OPSD 與 OPSD 持平,4B 規模領先 0.9%,8B 規模持平,並分別超越 GRPO 0.7% 和 1.1%。程式碼位於 [https://github.com/williamium3000/u-opsd](https://github.com/williamium3000/u-opsd)。
我們介紹 Motif 3,這是一個僅解碼器的混合專家語言模型,擁有3140億總參數,每個 token 激活132億參數。每個稀疏 MoE 層包含384個路由專家,每個 token 選取其中8個。這種細粒度稀疏性在限制計算量的同時,提供了大量的專家容量。Motif 3 以分組差分潛在注意力(GDLA)為核心,該機制將分組差分注意力與多頭潛在注意力的壓縮鍵值表示相結合。此架構進一步整合了改良的流形約束超連接、專家特定 PolyNorm 激活,以及多 token 預測,以提升最佳化穩定性、專家專業化與推理效率。我們在約12.5兆個 token 上對 Motif 3 進行預訓練,涵蓋網頁文件、STEM、程式碼、數學、多語言內容與領域專業語料庫。專家平衡與數值穩定技術支援大規模穩定訓練,而選擇性 MXFP8 計算與通訊、記憶體高效融合核心,以及視窗感知的上下文並行則使訓練可支援高達256K token 的上下文長度。我們的後訓練流程結合了通用監督式微調、六個以強化學習訓練的專家教師、一個以監督式微調訓練的軟體工程教師,以及多教師同策略蒸餾。由此產生的統一模型整合了推理、程式設計、工具使用、專業工作、長上下文理解、校準式棄答與指令遵循等互補能力。在廣泛的評測套件中,Motif 3 與領先的開放權重模型相比,展現出具競爭力的表現,包括在長程代理任務、數學推理、科學知識,以及對幻覺敏感的評測中取得強勁成果。
領先的大型語言模型供應商現在會隱藏模型的逐步推理(即思維鏈),以保護智慧財產權並限制資訊洩漏。這些供應商並不會將這些痕跡儲存在伺服器端,而是以加密文字區塊的形式回傳給用戶端,用戶端在後續每次請求時再將這些區塊傳回。在先前研究的基礎上,我們發現了一個架構上的漏洞:這些加密區塊在同一供應商生態系統內的不同對話、使用者與模型之間完全相容且可互換。我們利用這種相容性開發出一種可擴充的解密越獄方法。透過將特定模型的加密推理痕跡注入同一供應商旗下較弱且防護較少的模型,我們迫使該模型直接以明文逐字解碼並輸出這段痕跡,而無需直接對能力較強的模型進行越獄。這個漏洞使得四種不同的攻擊途徑得以實現。首先,它繞過了防蒸餾機制,使攻擊者能夠提取專有模型的推理內容,我們在 Anthropic、OpenAI 和 Google 的模型上均證明了這點。其次,它允許大規模的私人資料竊取。開發者經常公開分享對話紀錄,卻不知道加密區塊的內容。透過解碼從公開儲存庫中蒐集的 315,320 個推理區塊,我們恢復了 367 個個人識別資訊(PII)項目和 182 組憑證。第三,它會意外揭露隱藏在推理過程中的危險資訊,即使在模型最終可見的輸出安全地拒絕惡意請求的情況下也是如此。第四,攻擊者可以利用這個缺陷執行看不見的提示注入,將惡意載入完全嵌入加密區塊中,以污染公開的代理型部署。在進行負責任的揭露之後,我們提出了具體的密碼學與系統層級的緩解措施,以保護用戶端推理的安全性。
記憶系統已展現出提升智能體效能的潛力,但其在小語言模型上的應用潛力仍 largely 未獲充分探索,因為小模型難以自行產生足夠數量的成功軌跡。我們提出智能體記憶蒸餾(Agent Memory Distillation, AMD),這是一個免訓練框架,透過層級式記憶將結構化知識從大型教師智能體轉移至小型學生智能體。AMD 從成功的教師軌跡中建構三種互補的記憶類型:工作流程記憶編碼任務層級的策略,子任務記憶在中間粒度提供具體的行為範例,函式記憶則捕捉各函式的呼叫慣例與常見陷阱。工作流程記憶與子任務記憶在每個任務開始時被主動注入,而函式記憶則在工具呼叫發生錯誤時被反應式檢索。我們以 GPT-5-mini 作為教師模型,在三個工具使用基準上評估 AMD,使用四個學生模型(4B-8B 參數),在 AppWorld、BFCL V3 和 ToolSandbox 上分別達到平均 27.2 個百分點、11.2 個百分點和 3.4 個百分點的準確率提升,並持續優於現有的記憶式基線方法。進一步的分析顯示,子任務記憶貢獻了最大的提升幅度;教師的有效性取決於教師能力與學生相容性兩者;而 4B 規模的學生模型從 AMD 中獲益最多。
我們介紹 Sci-VBench,一個全面的基準測試,用於評估跨科學領域中知識密集與推理密集的影片生成。它包含 1,253 個專家註釋的範例,涵蓋四個核心學科下的 60 個主題:自然科學、醫療保健、人文與社會科學,以及工程。每個範例要求模型生成具有豐富時間動態的影片,這些影片需要科學推理和基於知識的綜合,超越表面層次的視覺合理性。我們進一步建立了一個基於評分標準的評估協議。我們的分析顯示,在此協議下,非專家的人工評估者和 MLLM-as-Judge 系統都能與專家判斷達成相對較高的一致性,支持大規模可重現的評估。我們對 16 個前沿的專有與開源模型進行基準測試,發現雖然自動感知品質分數在各系統間緊密聚集,但在提示對齊(Prompt Grounding)和科學與因果正確性(Scientific and Causal Correctness)方面的表現差異甚大,且專有與開源模型之間存在顯著差距。這些發現表明,視覺真實性的進展尚未轉化為對科學與因果動態的可靠建模。
對話式助手越來越常推薦後續編輯,以協助使用者延續任務。現有系統主要針對純文字互動,導致圖像生成對話領域仍未被充分探索。在圖像生成任務中,實用的後續編輯建議必須反映使用者偏好、提供多元方向,並且能在當前圖像上執行。我們從 Qwen App 收集了 100,000 個真實的多輪圖像生成對話樣本,發現其中 80.1% 具有圖像依賴性,凸顯了多模態推薦的必要性。我們以三階段框架來應對此情境。第一階段,我們利用真實的線上資料建立一份經人工審查的合適後續編輯意圖表,接著建構 SFT 目標並微調多模態策略。第二階段,為了使規則引導的 SFT 建議與實際使用者選擇一致,我們運用使用者點擊回饋,透過多目標強化學習最佳化策略。第三階段,為減少建議編輯與當前圖像之間的視覺不一致,我們引入視覺驗證器作為額外的訓練監督。大量實驗證明,我們提出的框架在自動評估與人工評估中均顯著優於基線方法。在涵蓋數百萬使用者的線上隨機 A/B 測試中,我們的最終框架將視覺不一致率從 3.7% 降至 0.9%。此外,推薦點擊率提升了 32.70%、圖片帶走率提升了 16.32%、每位使用者的平均對話輪數提升了 39.90%(全部 p<0.05)。
大型語言模型(LLM)的推論服務日益受到記憶體,而非運算能力的限制。隨著長上下文與長篇推理工作負載日益普遍,鍵值(KV)快取在 LLM 令牌生成(即解碼)期間主導了記憶體佔用與記憶體流量。尤其,HBM 容量已成為稀缺且昂貴的資源,嚴重限制了推論批次大小與系統吞吐量。本文提出 OasisKV,一種以記憶體為中心的 LLM 推論系統設計,透過在 LLM 解碼期間將完整 KV 快取儲存與 HBM 解耦,來緩解 HBM 容量壓力。由於解碼時的注意力天然具有稀疏性,OasisKV 僅將最相關令牌的 KV 條目保留在 HBM 中以供注意力計算使用。我們觀察到,使用推測解碼(SD)所草擬的前瞻令牌,可以提前準確預測未來重要的令牌。OasisKV 採用高效的注意力背景管線來識別重要的 KV 區塊。這些區塊隨後從容量較高的記憶體層級(例如主機或遠端記憶體)預取,並在下一步解碼使用之前暫存於 HBM 中。我們基於 vLLM 實作 OasisKV。前瞻預測的準確度足以在 2,048 個令牌的 KV 預算下,將準確度維持在與完整注意力相差 0.7 個百分點以內。這使得 OasisKV 能將稀疏性轉化為吞吐量提升:在推理工作負載上,相較於密集 vLLM 可達 1.69 倍,且僅損失 0.1 個百分點的準確度;在多 GPU 長上下文服務上,則可達 2.1 倍。在預填充-解碼分離的架構下,OasisKV 可達到約 2 倍的密集吞吐量,同時每個請求的 KV 用量減少 6.5 至 9.7 倍,且相較於完整 KV 傳輸,解碼節點主機記憶體占用減少 2.2 至 2.6 倍。
同策略蒸餾(OPD)透過對學生生成的軌跡提供密集的教師監督,但標準的反向KL訓練可能對其他合理的延續賦予不足的機率。僅靠教師熵無法揭示不確定性是集中在少數幾個合理的下一個詞元上,還是分散在長長的機率尾部,也無法判斷學生是否已經充分表徵了這些候選項。此外,局部的教師機率可能無法預測下游任務的成功與否。我們引入了稀疏探測與結果校正目標OPD(SPOT),透過「獲取—探索—利用」的程序,同時解決兩個相互關聯的決策:探測何處以及蒸餾什麼。在獲取階段,一個位置層級的得分結合了正規化的教師熵、小型前k候選集合所捕獲的機率質量,以及學生—教師之間的不匹配,用以分配有限的探測預算。在探索階段,SPOT透過驗證器評分的學生延續來評估教師提出的候選項。在利用階段,這些結果產生一個閉式的KL正則化目標,該目標偏好具有較佳下游結果的候選項,同時保持錨定於教師分佈。跨多個學生模型與推理基準的大量實驗證明了SPOT在提升推理表現、同時平衡解決方案品質與覆蓋度方面的有效性。
可解釋性常被視為能力的額外負擔:語言模型通常被訓練為不透明系統,事後再以可靠性難以確立的方法加以解釋。在本研究中,我們挑戰這個前提。我們不採逆向工程模型的方式,而是將可解釋性設為訓練流程中的一項約束,並與語言建模目標一同優化。在橫跨三個數量級的算力規模下,無論是自迴歸還是擴散語言模型,可解釋性都與能力一同提升,而非彼此牴觸。令人意外的是,隨著規模擴大,模型表徵變得更加解耦,也更能與人類可理解的概念對齊。 我們以 Steerling-8B 實例化了這個訓練時配方;它是一個具因果注意力遮罩的擴散語言模型。對於任何一組生成的 token,Steerling-8B 都能將輸出歸因於相關的輸入 token、人類可理解的概念,以及訓練資料。這使得閉迴路干預得以實現:透過概念或特徵歸因診斷輸出、檢索相似的訓練資料,並在不重新訓練的情況下,透過概念引導修正行為。Steerling-8B 仍能與以兩倍至十六倍以上算力訓練的開放同級模型競爭,這暗示了一種不同的規模化範式:可解釋性可以被設計進訓練之中,並隨規模擴大而改善。
大型語言模型(LLMs)已推動自主代理(autonomous agents)的快速進展,然而標準評估仍局限於靜態任務求解。一個新興的前沿領域是框架演化(harness evolution)——即代理自主優化其自身操作框架的能力。然而,系統性地基準測試這項能力仍具挑戰性,因為現有評估要麼無法將框架改進與基礎模型強度分離,要麼無法防止針對特定任務的過擬合,要麼無法捕捉長時程的迭代研究。為應對這些挑戰,我們提出了 Evo-Bench,這是首個專門設計來評估模型在搜尋(Search)、辦公室(Office)與通用代理(General agent)領域中內在框架演化能力的基準。為嚴格隔離此能力,Evo-Bench 採用了一種新穎的框架引導式建構框架:它利用輔助任務演化來識別對框架改進真正敏感的任務,接著透過敏感度感知的分層拆分(sensitivity-aware stratified splitting)來確保跨套件的穩健泛化。對九個前沿與開放權重模型的廣泛評估顯示,頂尖模型實現了高達 16.6 分的巨幅絕對增益,幾乎逼近最先進的人工設計基準線。至關重要的是,雖然自主演化在通用任務中優於人工框架,並在搜尋任務中表現出色,但在要求高度特定處理流程的辦公室任務中則表現吃力。此外,我們的分析揭露了諸如早期飽和等關鍵時間異常,同時證明所合成的框架可作為高度可遷移的推理結構,持續提升多種策略模型(policy models)的表現。
針對自我進化的 LLM 代理所設計的基於學習的記憶系統,面臨兩個密切相關的挑戰。首先,軌跡索引的效用隨互動歷史增長,從而將有限的回饋分散到持續擴張的狀態空間中。其次,由於軌跡層級的獎勵被共同分配給共同檢索到的記憶,不相關的經驗可能接收到誤導性的效用更新,因而陷入記憶獎勵陷阱。為解決這些挑戰,我們提出了降階記憶強化學習(RoMeRL),它使用按結果極性與記憶動態分解的固定維度每任務記憶狀態,來表示持續增長的軌跡索引效用空間。RoMeRL 透過一組固定的語義座標整合新經驗,這些座標的內容會隨時間更新或替換,從而將回饋集中於有界的效用支撐上。在理論上,我們證明這種降階參數化能提高每個效用座標所收到的平均回饋,並在通用座標轉換模型下刻畫了錯誤座標的穩態佔有率。在實證上,於 ALFWorld 與 LifelongAgentBench 中,RoMeRL 提升了任務效能,將 Cold-Q 比率降低了 80.0%,將回饋密度提高了約 6.0 倍,將所維護的記憶大小減少了 84.4%,並減少了 21.1% 的 LLM 呼叫。這些結果表明,降階效用狀態在限制持續性獎勵污染的同時,支援了高效的自我進化代理記憶。程式碼可於以下網址取得:https://github.com/YOUNG-fnxm/RoMeRL
視覺語言模型(VLM)應基於具體的圖像證據來回答,而非語言先驗、數據集捷徑或無關的視覺上下文。現有的感知感知後訓練方法通過全局擾動或注意力代理來鼓勵模型使用圖像,但它們並未測試所取樣答案是否因果依賴於支持它的局部證據。我們提出反事實證據解耦(CED),這是一種針對 VLM 接地(grounding)的訓練時證據審計機制。對於每個回應,CED 會中和一個以物體為中心的證據區域,並將由此產生的支持度下降與匹配的非證據區域進行比較。我們將此信號與答案正確性結合到 GRPO 中,獎勵依賴證據路徑而非捷徑或干擾路徑的正確答案。CED 使用弱物體級提案,無需針對問題的證據標註,且不增加推理時間開銷。在九個公開基準測試和四個骨幹網路中,CED 優於先前的基於強化學習的後訓練方法,且針對性分析驗證了其以物體為中心的信號。
通用獎勵模型日益成為擴展機器人學習的瓶頸,然而從大規模異構語料中學習價值相關能力的方法仍未得到充分探索。現有方法將監督與任務內部錨點綁定,例如偏好或歸一化進度,而這些錨點皆無法在不同具身形態與資料來源之間乾淨地遷移。我們提出 RynnValue,一個開源的機器人操作價值基礎模型,它以時間距離取代這些錨點——即從觀察到語言指定目標之間的定向剩餘成本。由於時間距離標籤可直接從時間戳中推導,RynnValue 無需偏好或進度標註即可擴展至超過 7,000 小時、約 300 萬條指令條件化片段。為了使時間價值學習在大規模下保持可靠,我們結合隨機時間採樣、時間順序洗牌與價值隔離注意力,以抑制使預測對失敗和倒退不敏感的捷徑。RynnValue 在無偏好標籤的訓練下,於 RBM-EVAL-OOD 取得 0.675 的平均肯德爾 tau_a 係數,超越完全偏好監督的當前最佳方法(0.655),且是僅用進度監督的對照模型(0.292)的兩倍以上,同時能零樣本泛化至未見過的任務、具身形態與視角。透過基於勢能的塑形轉換為稠密獎勵後,它將真實世界策略成功率從 52.5% 提升至 72.5%(在線),並從 63.8% 提升至 82.5%(離線)。這些結果確立了時間距離作為可擴展監督目標及通用機器人策略實用獎勵介面的地位。
隨著大型語言模型(LLMs)的快速發展,框架(harnesses)已成為在各個領域部署智能體(agents)的關鍵基礎設施。快速演進的框架生態系統也使得嚴謹的能力評估變得日益重要。然而,高效地建構一個端對端、系統化且全面的評估流程仍然是一項重大挑戰。為應對此挑戰,我們提出了 A^2E(Agent Auditing Engine),一個專為智能體框架設計的端對端評估引擎。A^2E 利用我們新提出的智能體任務協議(Agent Task Protocol, ATP),實現不同框架間評估任務的快速整合。透過自動儀器化的監控器(Monitor),A^2E 在實驗過程中擷取並生成標準化執行軌跡。在評估階段,A^2E 使用一套多維度指標系統性地評估框架能力。與僅考量正確性相比,這些指標在執行效率、工具使用、任務規劃和錯誤恢復方面提供了更細粒度的框架間差異特徵。使用 A^2E 進行的實驗進一步揭示,模型-框架組合在不同類型的任務上表現出顯著的性能差異,且沒有任何單一組合能在所有任務中持續優於其他組合。這些發現不僅證明了系統性評估的必要性,也為模型與框架的協同演進提供了有益的指導。我們的程式碼可在 https://github.com/datamllab/A2E 取得。
經營企業是一種具挑戰性的智能工作。經營者必須從不完整的信號中推斷機會,在不確定性下投入資本,適應瞬息萬變的市場中延遲顯現的結果,並在合法交易前滿足監管要求。前沿大型語言模型智能體日益能夠完成複雜的工作流程,但現有的智能體基準測試卻很少評估與商業相關的能力。我們引入 Business Arena,這是一個受控環境,讓 AI 智能體經營一家跨境商店,在長期的時間跨度內向供應商採購並向買家銷售。我們以真實的阿里巴巴採購數據以及根據權威來源校準的市場條件作為此環境的基礎。延遲且相互關聯的後果使單一商業決策難以評判,但其綜合結果可透過利潤來衡量。由於僅靠利潤無法解釋智能體成功或失敗的原因,我們將智能體與人類設計的策略進行比較以估算可用機會,使用技能層級指標來揭示潛在的優勢與劣勢,並將已實現的收益與損失追溯到產生它們的行動。我們使用機制消融來確立,出色的結果反映的是真正的商業智慧,而非投機取巧或模擬器特有的捷徑。我們評估了 15 個前沿模型,發現平均最終淨資產存在九倍差異。即使是最優秀的模型也落後於人類設計的策略,這表明商業經營對大型語言模型智能體而言仍具挑戰性。技能層級分析揭示了不同的經營風格,從注重利潤率的溢價賣家到高周轉的批發商和客戶服務專家,而行動層級的歸因則識別出創造或摧毀價值的採購、定價和補救決策。總而言之,Business Arena 為評估端到端商業智能體邁出了通往真實且可信測試環境的第一步。
大規模分類檢索通常假設輸入已經表達了目標概念。然而,在許多情境中,輸入是間接證據,例如一個表格儲存格,其含義取決於所在列、欄、資料型別與上下文。我們將這種不一致稱為「檢索就緒差距」。我們的分析顯示,當語意明確時,現有索引能可靠地檢索到目標;但原始證據往往使其在排名中位居深處。我們提出「因子化假說搜尋」(Factorized Hypothesis Search, FHS),它在具名的語意維度上維護多個部分詮釋。這些假說支援結構化查詢生成、多假說檢索,以及維度層級的候選驗證。在金融分類標註與 CodiEsp 臨床編碼兩項任務中,FHS 在非 oracle 方法中取得了最佳的 Recall@1、MRR 與最終準確率。以自由文本整合方法取代因子化假說路徑,會導致頂部排序效能下降幅度最大;而序列式精煉相較於 FHS 強大的平行第一輪並未帶來額外增益。
使用者模擬器被廣泛用作訓練與評估互動式助理的可擴充環境。生成下一輪使用者發言本質上是一對多的:相同的設定檔與對話脈絡可能支援多種合理的後續走向,且各自具有不同的局部互動意圖。因此,流暢的回應可能透過不適當的意圖推進對話,例如接受而非修正。我們的核心見解是,可控的使用者模擬應將下一輪使用者發言應實現的局部互動意圖,與該意圖在語言上的表達方式分離開來。我們提出 UserIDA(使用者意圖-指令對齊),將互動意圖呈現為每輪的明確指令。UserIDA 定義了六向意圖介面,透過監督式微調學習指令條件化生成,並在基於群組的強化學習過程中採用意圖校準策略最佳化。獎勵機制在維持綜合回應品質的同時,確保違反意圖的候選項在混合群組中排名低於符合意圖的替代項。在 LMSYS-USP 上,UserIDA 達到了 86.6% 的意圖準確率,比最強的專用使用者模擬器基線高出 24.3 個百分點,同時提升了語意與風格相似度。在脈絡內干預中,它在 91.7% 的受評估對話狀態中實現了六種目標意圖中的至少四種,而最強外部基線僅為 22.9%。這些結果確立了逐輪意圖控制作為使用者模擬中回應保真度的互補維度。
在因子分解模型 W = UV^⊤ 上,梯度下降隱式偏向低秩解,而 Adam 從相同的小初始化開始則不然。我們將此差異追溯至損失的規範對稱性,即其在 (U, V) ↦ (UQ, VQ) 下的不變性。梯度流的低秩機制僅在優化器具備規範等變性時才可供該優化器使用;此條件是遷移的必要條件,但不足以保證低秩恢復。梯度下降、動量、共享標量 Adam、Muon 和 Shampoo 滿足該條件;Adam、RMSProp 及其他逐坐標方法則不滿足。一個結構定理將無記憶等變規則刻畫為恰好是由 Gram 矩陣決定的左預條件子,一個遷移定理將梯度流的路徑性質傳遞給共享標量流。接著,我們在欠定矩陣感知中按相對於植入真實值的恢復誤差,對九種更新規則進行排序。從逐坐標到共享標量預條件處理的單參數族單調地恢復了該偏差,從而將各向異性隔離為原因。一個「頻譜調度」調和了關於 Muon 的兩份相互矛盾的報告:等速率更新能精確恢復低秩目標,但隨著頻譜尾部的增長而失去優勢。在變壓器中,Adam 在第一步就將兩個規範等價的初始化區分開來,而等變優化器在浮點精度內仍保持相同;最終,逐頭不變量 W_Q^⊤ W_K 的相對 Frobenius 距離相差 56%,這是任何逐頭旋轉都無法彌合的差距。在兩個高光譜數據集上,於匹配的訓練損失下,梯度下降在最低採樣密度時將留出誤差降低了 43–44%,並達到較低的有效秩。因此,基的選擇不是調參細節,而是關於優化器選取哪個插值模型的決策。
大型語言模型(LLM)日益成為資料驅動的推理器,但其思維鏈(CoT)即使最終答案正確,也可能不忠實。現有的大多數「驗證」訊號不具診斷性:答案比對僅觀察結果;以LLM作為評判提供主觀且不可驗證的評論;標量獎勵(如PRM/RM)對多步驟推導的失敗位置提供的洞察有限。 我們提出SymDiag,一個神經符號框架,將推理驗證重新建構為結構化失敗診斷。SymDiag將自然語言CoT轉換為符號約束,並執行步驟層級的滿足性/蘊涵檢查,以(i)定位失敗步驟,並(ii)產生可驗證的診斷證據,包括反例、不一致性見證和缺失前提指標。一個核心挑戰是:明顯的「邏輯違反」可能源自真正的推理缺陷,也可能源於神經到符號的翻譯噪聲。因此,SymDiag納入一個自審查器,透過雙重符號編碼一致性檢查,區分翻譯錯誤與推理錯誤,從而在部分可觀測性下實現穩健的診斷。在涵蓋數學、邏輯、科學及一般推理的多樣化基準上,SymDiag在偵測不忠實推理方面表現更佳,並為多輪推理修復提供遠比僅結果驗證和基於LLM的評判更有效的回饋,為可信賴且可擴展的推理診斷提供原則性基礎。
針對評估訊號進行最佳化的系統,其基準測試所衡量的內容與其所宣稱的有所不同。我們在兩個帶有留出式泛化門檻的GPU核心最佳化套件中具體記錄了這一點:Metal-Sci(10項科學計算任務)和Metal-ZK(12項零知識/密碼學任務),其中三個前沿LLM(Opus 4.7、Gemini 3.1 Pro、GPT-5.5)在帶有豐富回饋的(1+1)演化迴圈內提出Metal核心。雖然沒有任何模型被提示以對抗方式行事,但被選拔的勝出者反覆對評估配置進行指紋識別:它們依據執行時期參數的識別結果進行分支,最大化地調校被測量的分支,而使未測量的分支保持緩慢或靜默錯誤。在合併的套件中,16/53(30%)的分佈內勝出案例未能遷移到留出配置。我們為這些失敗提供了一個四模式分類,從配置指紋到門檻洩漏。我們提煉出在策略性最佳化下進行測量的設計指引:留出探針僅在不可枚舉的軸向上保持有效性;門檻必須衡量留出效能,而不僅僅是正確性;且遷移率只有在具備逐失敗機制評級時才可解釋——我們的評級分解為被操弄、過度擬合和良性三類。 程式碼與研究工件:https://github.com/vicgalle/kernel-fingerprinting
在由語言模型驅動的演化演算法中,大型語言模型(LLM)充當單一運算子,同時更新結構性元件(如控制流)與連續參數。雖然語言模型擅長前者,但對後者的處理效率不佳,會在試錯迴圈中浪費大量 token 進行離散跳躍。我們透過形式化一種混合嵌套搜尋來解決此問題:外層迴圈由語言模型提出帶有數值空缺的結構草圖,內層數值最佳化器則負責調校該草圖。外層與內層求解器皆可插拔替換:任何基於文字的求解器都可與零階最佳化器(如 CMA-ES)、基於梯度的演算法或 MCMC 取樣器相互組合。我們在三個科學領域驗證了此框架:(i)封閉形式測試函數上的元最佳化器;(ii)應用於系統研究與社會困境的基於程式碼策略;(iii)近似貝氏推論任務。在所有三個領域中,混合最佳化器均優於純語言模型驅動的搜尋及純數值最佳化的基準方法。程式碼位於:https://github.com/vicgalle/hybrid-nested-search
現代平台的使用者反覆需要近期對話的摘要,但視窗中通常沒有足夠的上下文可以獨立解讀。我們將此情境形式化為串流對話摘要,即系統必須在固定預算下,利用無界歷史中的選擇性記憶來總結當前視窗。我們證明,核心挑戰不在於存取了多少歷史,而在於記憶是否恢復了當前視窗所預設的證據。我們建構了一個基準與評測協議,分別評估記憶是否包含解決缺口的證據,以及生成的摘要是否反映該證據。我們提出 ReMEMBER,一個缺失證據記憶框架,其根據未解決的視窗依賴關係來條件化檢索,並在固定預算下將檢索到的片段精煉為證據密集的記憶。在歷史長達 160K tokens 的對話實驗中,ReMEMBER 在相同預算下,相較於記憶建構基線,改善了記憶召回率與缺口解析完整性。
多語言翻譯基準通常以英語為來源、翻譯成其他語言,並以語言對作為評估單位——這種設計隨著時間推移容易受到資料污染,且忽略了地域與文化差異。因此,我們提倡來源對比式評估,並以 Cultivar——FLORES 的在地化子集——來具體實踐此一方法,實現針對特定地域的翻譯評估。當與非在地化的對應版本搭配使用時,效能差異可協助探查資料污染與在地化穩健性。我們評測了 32 個開放權重模型,結果發現專精於機器翻譯的模型穩健性較低,少數模型可能過度擬合 FLORES,且無論語言為何,模型翻譯美國內容的表現普遍優於其他地域的內容。
藝術家導向的圖像生成,遠不止於在提示詞中附加藝術家姓名。圖像模型往往透過典型捷徑來回應藝術家姓名,例如重複出現的母題、通用色調,或過度表徵的時期特徵,而非保留使用者意圖中的場景。為此,我們提出 Atelier——一個用於藝術家導向圖像生成的捷徑感知控制狀態規劃框架。Atelier 將未充分明確的藝術意圖轉化為明確的控制狀態,其中區分場景錨點、保留/轉換決策、風格體系假設、角色綁定的藝術家證據,以及捷徑迴避約束。該框架以藝術家層級知識與局部圖塊參照為此狀態建立依據,編製後端感知的生成計畫,並透過全域與局部真實性回饋迭代地精煉候選結果。我們進一步提出 ArtIntentBench 基準,涵蓋梵谷與齊白石,包含藝術作品重繪、時期/風格控制生成、歷史未見主題、捷徑稽核,以及人類偏好評估。在開放權重與閉源生成器中,相較於提示工程、檢索增強與通用代理基線,Atelier 提升了藝術家層級的風格保真度,更忠實地保留來源結構,並大幅減少捷徑替換。這些結果表明,藝術家導向生成的瓶頸不僅在於圖像合成,更在於對明確且有證據支撐的藝術控制之上游推論。
近期在持久化個人代理框架方面的進展,使得以人為中心的代理網絡成為現實的部署目標:每位使用者可由一個 AI 代理提供服務,該代理代表使用者行事、維護狀態,並透過社交與任務關係與其他代理通訊。在這些網絡中,日常工具使用演變為多方持有代理之間的協作,涉及個人工作空間,而檔案、記錄、工具與政策在持有者之間無法直接互通可見。現有的代理基準測試雖涵蓋工具使用與協作,但既未提供具備真實使用者數位工作空間的端到端沙盒以進行可驗證的跨使用者代理協作,也未測試有害行為如何透過以人為中心的代理網絡傳播。我們提出 WeClawArena——一個用於個人工作空間上多方持有代理協作的可審計基準測試與運行時沙盒。WeClawArena 針對協作式工具使用任務,其中個人工作空間同時承擔操作工具與個人約束的雙重角色。該基準測試涵蓋六個跨使用者任務領域中的 124 個基礎任務,並擴展為 620 個情境變體,每個基礎任務配有一個良性對照組與四個攻擊向量變體。沙盒記錄同儕訊息、工具呼叫、資源操作、受治理決策與最終工作空間狀態。WeClawArena 分別報告效用與攻擊成功率,並依據有界運行時證據對攻擊成功進行審計,支援任務故障、隱私洩漏、投毒證據與無效權限路徑的診斷。
多模態大型語言模型(MLLMs)在廣泛的視覺語言任務上已展現出強勁的表現,但在不完美或情境偏移的條件下往往會失效。一個可靠的 MLLM 應能拒答真正上下文不符(OOC)且涉及主題層級情境偏移的問題,同時仍能回答帶有非主題情境偏移的偏移但仍在上下文內(Shifted IC)問題。現有基準測試主要針對 OOC 或視覺上無法回答的問題,卻忽略了可回答的 Shifted IC 案例,且涵蓋的 OOC 偏移類型有限。為填補此缺口,我們提出 MMOOC,一個大規模評估 MLLMs 拒答能力與穩健回答能力的基準測試。MMOOC 包含超過 41K 組影像-問題配對,涵蓋可回答的 Shifted IC 案例與不可回答的 OOC 案例,橫跨三種問題格式、八種偏移類型及六種視覺場景,並透過基於 MLLM 的篩選與人工驗證確保資料品質。我們使用準確率(Accuracy)與拒答率(Refusal Rate)評估模型回應,並進一步引入 LLM-as-a-Judge 指標來評估模型推理的正確性。在多家不同 MLLMs 上的實驗顯示,當前模型在情境偏移下仍難以在可回答性與拒答之間取得平衡。我們進一步分析了主要的失敗模式,並顯示後訓練(post-training)能提升穩健性。MMOOC 將公開釋出。
近期影片擴散模型的進展已能實現高保真度的影片合成。然而,生成鏡面反射仍然具有挑戰性,因為鏡中的內容必須與周圍場景保持一致。現有的影片擴散模型並非專門針對場景與鏡面之間的關係進行建模,這可能導致反射內容錯誤或空間排列不一致的問題。我們觀察到,鏡面反射生成涉及兩個互補的挑戰:決定應反射哪些場景內容,以及反射內容應如何在鏡面區域內進行空間排列。基於此觀察,我們提出 MirrorWorld,一個具反射感知的影片修補框架,在生成過程中對場景與鏡面之間的關係進行建模。具體而言,我們引入語義關係蒸餾(SRD),從凍結的視覺基礎模型中遷移關係資訊,以促進可見場景內容與鏡面區域之間的語義關聯。我們進一步提出幾何變換對齊(GTA),學習一個引導反射內容空間排列的變換。這兩個元件扮演互補角色,SRD 負責建模應反射什麼內容,而 GTA 負責建模如何排列反射內容。為促進此問題的研究,我們透過將四個現有的影片鏡面資料集重新改造為統一的反射重建任務,建構了影片鏡面反射生成的基準。實驗結果顯示,MirrorWorld 在反射重建品質上優於具代表性的基於影像的反射生成方法,並勝過強大的影片修補基線方法。
在大型語言模型上使用新資料進行微調,會損害其先前學到的知識。我們提出 Omega-S,這是一個僅由權重矩陣計算的即插即用懲罰項:它不需要先前的任務資料、不需要 Fisher 矩陣,也不需要儲存舊權重的副本。它只需在現有訓練迴圈中加入三行程式碼,且每次迭代的運算成本增加不到 4%。 **保留能力。** 在以 LoRA 微調 Llama-3-8B、從程式碼轉換為散文並以 HumanEval 在十個隨機種子下測量的實驗中,Omega-S 在 10 個種子中的 9 個上,比無正規化保留了更多原有能力(絕對 pass@1 從 0.173 提升至 0.238;單尾符號檢定 p=0.011,Wilcoxon 檢定 p=0.006),保留比率從 62.9% 提升至 84.1%。它也優於經過調校的權重衰減(10/10 種子,p=0.002)及調校後的 EWC(8/10,p=0.014),所有實驗組均在相同的實驗場次中重新測量。 **機制:以實測為據而非主觀宣稱。** Omega-S 在構造上具有拓撲性質,其目標函數由 Tr(A^3) 建構而成,但我們測量了其四個因子中實際產生作用的哪一個,結果發現其中三個並未起作用:它們相對於權重的彈性低於或等於 1e-4,而度變異數項則為 9e-3。就目前的實作而言,此複合項可化約為對節點度數變異數的懲罰,這在方形模組中意味著列向量的大小,在非方形模組中則代表方向對齊。我們之所以報告此事,是因為一個方法若其名稱承諾了一件事,而其梯度做的卻是另一件事,就應該明說。我們也列舉了尚未定論的設計選擇,包括一種對比保留的建構方式,它確實達成了設計目標,但在全部十個種子上都使保留能力變得更差。 在完全相同設定、相同隨機種子與相同硬體下重複實驗,保留比率的標準差為 0.104。我們尚未發現其他研究對語言模型的低秩微調量化過此變異性,而這個數值為文獻中所有種子配對比較(包括我們自己的比較)提供了誤差下限。 我們提供了程式碼、每個種子的結果,以及完整的負面結果記錄。
視覺-語言定位將語言與視覺內容相連,然而現有的大多數形式化方法將定位簡化為單向定位問題:給定預先指定的文本詞組或類別名稱,識別對應的圖像區域。這種設定假設相關的語言單位已知,從而忽略了接地溝通中一個更基本的挑戰:確定文本的哪些部分具有視覺指稱性,以及它們如何與圖像中的實體相對應。我們將定位形式化為圖像-文本對之間的雙向概念對應。給定一幅圖像及其配對文本,目標是恢復視覺指稱文本片段與實例級圖像分割區段之間的所有對應關係,而無需假設相關文本片段已提供。此形式化將文本分割、圖像分割和跨模態對齊視為單一的對應預測問題,從而統一了常見的定位任務,包括詞組定位、指稱表達定位和開放詞彙偵測。為了解決此任務,我們提出了 ConCor-1,這是一個建立在預訓練視覺-語言模型之上的定位模型。它使用可學習的橋接標記來表示候選的圖像-文本對應關係,並為每個標記預測文本遮罩、圖像遮罩和對應存在分數。為了訓練和評估此任務,我們將多樣化的定位和分割資料集轉換為統一的對應格式。實驗結果表明,ConCor-1 持續優於基線方法,在長字幕資料集上將對應關係 F1 提升了 48%,在零樣本 LVIS 上提升了 29%,其中大型類別列表作為文本輸入。
我們提出 Ego-OSCAR,這是一款開放硬體、低成本、頭戴式立體慣性捕捉裝置,用於在真實環境中進行自我中心資料收集。Ego-OSCAR 將硬體同步的全域快門立體相機與 6 軸慣性測量單元(IMU)、用於裝置端視訊編碼的嵌入式 Linux 單板電腦(SBC),以及用於使用者回饋和看門狗功能的即時微控制器相結合。整套物料清單每台不到 200 美元,僅使用市售元件和 3D 列印零件。除裝置本身外,我們還釋出了完整的軟體堆疊(硬體加速錄製管線、IMU 取樣守護行程、時間同步工具和看門狗韌體),以及由分散式貢獻者網絡在日常室內環境中收集的約 550 小時自我中心立體視訊(每台相機)及同步 IMU 資料。這份釋出資料是經過標註而非原始資料:自由形式的動作描述以開放詞彙涵蓋了幾乎整個錄製時間軸,同時提供逐幀 3D 手部重建與逐次會話的立體校準。Ego-OSCAR 的目標並非在單機保真度上比肩 Project Aria 等研究級系統;其目標是成為群眾外包自我中心捕捉最經濟可行的基礎平台,並降低任何團隊大規模收集自我中心資料的啟用門檻。所有硬體設計、軟體及資料集均以開放原始碼形式釋出。
即便在今日科技進展下,於即時互動虛擬環境中開發具備認知能力的具身智能虛擬代理(IVA)仍是一項挑戰。現有的架構往往專注於實作受商業遊戲引擎限制的低層級反應式控制系統,或著重於難以在虛擬世界中實作的高層級推理模型表徵。本文基於此概念,提出一個用於部署具身 IVA 的模組化認知架構。此架構建立在既有且已確立的框架之上,例如感知-思考-行動(Sense-Think-Act)範式與信念-慾望-意圖(Belief-Desire-Intention)認知模型等,旨在提供一個可重用、以實作為導向的框架,作為在互動式 3D 運算系統中部署 IVA「大腦」的模板。所提出的架構貢獻在於提供一個模組化、以實作為導向的框架,用於部署具身且具認知能力的 IVA,並彌合高層級代理推理模型與即時具身執行之間的鴻溝,從而在複雜的互動虛擬環境中實現可擴展、自適應且可解釋的代理。
Transformer 中的位置嵌入(PE)會編碼詞元的距離與順序,但大多不考慮句法結構。我們提出語法感知位置嵌入(SiPE):在預訓練期間,它從依存句法分析結果中學習輕量級句法先驗,並將此先驗注入所有三種主流 PE 家族(絕對、相對、旋轉),適用於編碼器與解碼器,同時不更動自注意力與架構其餘部分。我們分別檢驗了先驗應在何處、以何種方式進入模型,發現這取決於架構:對使用相對 PE 的自回歸解碼器而言,先驗與注意力分數中的相對位置項進行乘法耦合時效果最強,優於將先驗注入輸入嵌入、注入自注意力,或同時注入位置項與注意力項的做法;對編碼器而言,則最好直接加至輸入嵌入,與各編碼器原生的位置機制相互配合。我們發現,使用 SiPE 預訓練的模型在 SyntaxGym 基準上取得高達 10.3% 的提升,同時相對於沒有句法監督的基準模型,困惑度降低 9.0%——這是一項幾乎所有現有句法注入方法反而會使之惡化的指標。關鍵的是,這些收益不限於句法泛化:SiPE 也改善了真實世界的語言理解,並使 GLUE 基準上的分數較未使用 SiPE 訓練的模型提升高達 8.2%。不同於現有句法語言模型在推論時對多個句法分析結果進行邊緣化,或在執行階段捨棄句法資訊,SiPE 僅以單一句法分析結果為條件,從而在句法監督與推論成本之間建立了新的 Pareto 前緣。