每日精選AI研究論文及翻譯
技能已成為一種實用且有效的方法,可在推理時透過結構化的知識包來增強大型語言模型智慧體。然而,現有評估大多僅衡量技能是否提升整體任務成功率,卻未深入探討一個更根本的問題:**技能何時有幫助、為何有效、又在何處失效?** 透過在各種基準、智慧體框架與大型語言模型上進行的受控實驗,我們分離出表徵、結果標註、檢索難度及技能跨框架穩健性的個別效應。為進一步回答此問題,我們設計了一項對比研究,結合受控量化實驗與成對軌跡分析。我們將受控實驗中的 8,135 筆試驗紀錄標準化,並從 240 筆開放編碼紀錄中保留 238 個有效唯一標籤。我們將這些觀察結果歸納為一個涵蓋三個高層級類別與十二種技能使用模式的分類法:當嘈雜軌跡轉變為能穩定執行的程序性錨點時,技能即發揮效用。在匹配比較中,技能較工作流記憶提升 6.06 分。程序性錨定佔技能案例的 65.7%,而顯式知識注入僅佔 4.5%,顯示技能的作用在於穩定行動,而非注入缺失的事實。檢索是另一個獨立瓶頸:當候選池從 5 個擴增至 100 個時,實際使用精確度從 29.6% 下降至 3.3%。易混淆的干擾項會損害離線識別,但下游成功率仍保持穩定;精確呼叫真實標籤既非充分條件也非必要條件。技能在假設脆弱、情境不相容或適應不足時會失效。這些發現將評估推昇至整體成功率之上,並為可靠的自演化智慧體提供指引。
強化學習(Reinforcement Learning, RL)在單回合大型語言模型微調上已展現潛力。然而,長時域代理式推理引入了日益分支化的互動與稀疏獎勵,暴露了 RL 的多項限制:其基於反向傳播的重量級訓練技術棧使得微調較大型語言模型不切實際,且更長的軌跡使 RL 中的信用分配變得更加困難。本文主張演化策略(Evolution Strategies, ES)可成為微調長時域語言模型代理的更好選擇。與代理式 RL 相比,ES 具有三項關鍵優勢:1) 模型可擴展性:ES 僅需最少、推論等級的 GPU 記憶體即可進行全參數最佳化,使得微調大型語言模型成為可能。2) 靈活性:其輕量、黑箱的回饋介面使 ES 微調易於與提示空間演化(例如技能最佳化與測試時計算)組合;3) 長時域可擴展性:ES 在不跨時域分解獎勵的情況下執行軌跡等級的參數歸因,隨著時域長度增長,其可擴展性優於代理式 RL。基於此洞察,我們提出 Agentic ESOpt,一個專為彈性參數–上下文共同演化而設計的全參數代理式微調框架。在每一步,Agentic ESOpt 在當前語言模型參數周圍採樣擾動,以獎勵評估所產生的代理,並應用線上獎勵加權更新。為改善探索–適應的取捨,Agentic ESOpt 進一步引入擾動尺度 σ 的餘弦衰減排程。在 WebArena-Lite 上,對 Qwen-3.5-27B 進行全參數最佳化將 No Skill 基準提升了 6.69%。在測試時自動啟發式設計中,Agentic ESOpt 執行線上提示–參數共同演化,在 36 個設定中的 28 個改善了其對應基準。
前沿開放權重模型日益普及,但服務這些模型仍大多預設在資料中心基礎設施上執行。我們提出 FreeToken,一套邊緣原生的 MoE 服務系統,它不將個人機器視為小型 GPU,而是視為一個統一且具彈性的推論平台。FreeToken 圍繞在地 AI 的兩項現實,共同設計了完整的服務堆疊,包括模型佈局與載入、專家駐留、CPU-GPU 執行、代理狀態重用,以及執行時期記憶體管理:代理工作負載會持續改變其執行模式,而邊緣硬體暴露了異質資源,其資源平衡因機器而異。FreeToken 不採用固定的卸載策略,而是持續將計算與模型狀態映射到實際可用的資源上。FreeToken 支援超過 20 個 MoE 模型,以及真實的編碼與工具使用代理,涵蓋從 8GB 筆電 GPU 到單一工作站 GPU 的各種硬體。更重要的是,它改變了這些機器實際能服務的規模:從筆電上的 35B 模型,到遊戲桌上型電腦上的 284B 模型,再到單一工作站 GPU 上的 753B GLM-5.2。FreeToken 將開放權重轉化為可部署的本地軟體,讓使用者既有的機器成為能承載前沿規模智慧的实际平台。我們在 flashml.ai 釋出此系統。
人工超級智慧(ASI)要求人工智慧超越對既有知識的掌握,轉向探索未知、創造新知識,並將新想法轉化為可驗證的成果。然而,當前人工智慧系統的能力仍主要建立在學習、壓縮與應用既有的人類知識之上。因此,現有基準主要測試人工智慧能否根據所學知識給出正確答案,或能否在大量人類指導下完成任務。為此,我們推出 ASI-Bench,這是首個在一般研究領域中同時評估人工智慧系統創新探索與自主科學執行能力的基準,也是首個在同一研究專案內逐步移除人類方法學指導,以測試人工智慧能獨立進展到何種程度的基準。ASI-Bench 由超過 40 位專家投入 31,000 以上工時建置,包含橫跨 11 個科學領域的 60 項專案級研究任務,並逐步減少方法學指導,以測試人工智慧能否獨立選擇方法、進行研究並產出可驗證的結果。所有任務皆經過專家審查、AI 輔助稽核、沙盒執行與評分者驗證。在 18 種最先進的代理-模型配置中,平均分數從完整方法學指導下的 50.91 分,降至僅指定方法時的 29.10 分,再降至代理須自行決定方法時的 26.62 分。這種急遽下降顯示當前系統仍高度依賴人類指導,離自主執行端對端、專案級科學研究尚有極大差距。ASI-Bench 現已向全球開放。我們邀請各地的研究人員與開發者貢獻新任務、挑戰當前 AI 的極限,並協助加速人類邁向人工超級智慧的集體進程,請參閱 https://asibench.apexin.ai/submit。
儘管大型視覺-語言模型(VLMs)已顯著推動具身導航的發展,其直接部署仍具挑戰性,因為現有方法往往迫使大型視覺-語言模型進入與其二維預訓練先驗不一致的非自然動作空間,再加上僵化的推理排程與低效率的記憶管理。為克服這些限制,我們提出 TAMP-Nav,一個用於高效具身導航的統一框架。首先,我們引入像素到三維動作公式化(Point),將導航重新建構為二維視覺提示。具體而言,大型視覺-語言模型僅需選擇二維像素,再將其投影至三維座標以供底層 SLAM 控制器使用。此設計自然地將具身執行與大型視覺-語言模型固有的二維視覺能力對齊。其次,我們提出整合式選擇性推理與錨定軌跡記憶機制(Think and Memorize),該機制動態觸發鏈式思考,並僅在關鍵節點保留高保真記憶,將冗餘軌跡壓縮為輕量級時空指示器,從而保留關鍵歷史資訊並增強時空感知。最後,我們設計了一個透過群體相對策略優化(GRPO)的高效兩層對齊範式(Align)。透過疊加全局結果獎勵與細粒度過程獎勵,此密集監督將智能體的認知規劃與物理環境回饋緊密對齊,賦予模型自適應推理能力。實驗表明,TAMP-Nav 達到了最先進的效能(例如在 R2R-CE 上成功率達 66.2%),且具有高運行效率和樣本效率(僅需 90k 訓練軌跡)。
創作型智能代理仍缺乏從高品質人類電影中學習的有效途徑,限制了其生成電影級影片的能力。一個關鍵挑戰在於缺乏一種結構化的視頻表示,既能忠實呈現電影內容,又能直接用於代理推理與操作。為應對此挑戰,我們提出了代理式視頻自編碼器(AVA-Encoder),這是一個通過代理式自編碼來學習代理原生視頻表示的框架。 AVA-Encoder 將視頻轉化為知識圖譜(KG)表示,再將其重建為視頻。其層次結構與狀態節點存儲結構化文本,而連結的資源層則保存生成的圖像、音頻和視頻。類型化邊以代理易於理解、查詢和編輯的形式,保留這些文本描述與資源之間的關係。視頻重建的差異驅動文本梯度優化框架,將評估反饋轉化為自然語言更新方向,用於外循環中的數據無關編碼策略偽訓練,以及測試時內循環中可選的數據依賴知識圖譜表示精煉。 大量實驗表明,AVA-Encoder 相比最強的外部基線提升了20.7個百分點。在僅策略的受控設置下,其偽訓練的鏡頭級代理視頻編碼策略也優於精心人工調校的策略,同時減少了74.3%的系統提示令牌。我們發布了完整的 AVA-Encoder 框架、一個可靠的代理式視頻重建基準測試,以及首個高品質電影知識圖譜表示數據集。
高解析度影像編輯在專業工作流程中的需求日益增加,然而現有的擴散模型因二次注意力複雜度與極高的記憶體需求,仍受限於低於1K的解析度。常見的解決方案採用兩階段流程:先於低解析度進行編輯,再以獨立的超解析度模型增強。然而,此方法存在兩個關鍵問題:資訊分歧——幻覺細節與原始高解析度(HR)來源產生矛盾;以及紋理退化——表現為過度平滑或過度銳利的人為痕跡。我們提出EditBridge,一個用於高效超高解析度編輯的擴散橋框架。與從雜訊重新生成的傳統擴散方法不同,我們將細化過程形式化為從低解析度(LR)編輯結果到其高解析度對應版本的結構化資料對資料轉換,並明確以原始高解析度來源為條件以保留真實細節。為有效納入高解析度來源引導,我們引入一種先驗引導的區塊稀疏注意力機制,利用第一階段編輯的語意對應關係,將跨影像交互限制在空間對齊的區域內,大幅降低計算開銷。大量實驗證明,EditBridge在高達4K的解析度下能實現高保真編輯與優異的感知品質,在2K下達到3.6至8.4倍的加速,並能在61秒內完成實用的4K編輯。
現代智能體在智能體外殼(agent harness)中運行,外殼負責管理工具、上下文與控制流,因此外殼成為智能體系統中的關鍵組成部分。我們最初的 Agent Lightning 提出了一種分離式架構,透過 LLM 端點代理器將任意智能體與 RL 訓練連接起來;此方法後來被 verl Uni-Agent、AReaL 2.0、slime 及 Polar 等框架採用。我們將此範式稱為外殼式智能體強化學習(harnessed agentic RL),其中部署時期的外殼直接參與模型後訓練。外殼式智能體強化學習與傳統智能體強化學習存在根本差異:環境互動循環由外殼掌控,而非訓練引擎;訓練器僅能觀察到 LLM 請求-回應對的序列。這在重新分詞、樣本合併、優勢計算、損失正規化與後端排程等方面引入了挑戰,而這些挑戰可能對訓練穩定性與效果產生顯著影響。我們提出了 Agent Lightning v1.0,一個以約 3,500 行程式碼實作的輕量級外殼式智能體強化學習框架。它支援任意智能體外殼,並可作為研究上述挑戰的實用測試平台。我們在指令跟隨、搜尋與程式碼生成智能體上對其進行評估,並提供一套完整的可重現管線,用於程式碼智能體強化學習。僅使用 6,000 筆訓練樣本與適度的運算資源,RL 在 SWE-bench Verified 上將 Qwen3.5-9B 的表現從 41.8% 提升至 56.4%,絕對增幅達 14.6 個百分點。我們釋出完整的工作流程與訓練腳本,以促進外殼式智能體強化學習的可重現研究。
潛在影片生成依賴於自編碼器定義一個緊湊的空間,生成模型在其中運行。儘管影片自編碼器架構已大幅演化,但其潛在空間仍主要針對像素級重建進行優化,因而提供的高層語義組織有限。然而,重建最優的潛在空間未必適合生成建模。我們提出 V-RAE,一種影片表徵自編碼器,它在凍結的視覺基礎模型表徵之上構建緊湊的生成潛在表示。一個輕量的時間池化模組在保留語義結構的同時移除時間冗餘,影片解碼器則從壓縮特徵中重建連續運動。我們使用四種具代表性的凍結編碼器,在影片重建、語義探測和類別條件生成上評估 V-RAE。V-RAE 在 K600 上達到 2.13 的 rFVD,優於所有評估過的大規模預訓練影片 VAE。其潛在表示比傳統影片 tokenizer 的潛在表示保留了顯著更多的語義資訊。在匹配的生成設定下,我們的最佳變體在 UCF101 和 K600 上分別達到 117.86 和 19.16 的 gFVD 分數,同時收斂速度最高提升 6 倍。我們進一步證明,僅靠重建品質不足以表徵生成效用,並引入 tFVD——一種與下游生成品質相關性更可靠的時間一致性診斷指標。除了影片生成之外,在匹配的預測設定下,V-RAE 在 Cityscapes 上的未來影片預測也優於 Wan 2.2 VAE 潛在空間。綜上所述,實驗表明凍結的語義表徵能夠支持影片重建、生成和預測建模。專案頁面:https://v-rae.github.io/。
隨著文生圖生成模型的進步,它們引發了嚴重的安全疑慮,尤其是生成如暴力與裸露等不宜工作場所(NSFW)內容的問題,而紅隊對抗攻擊更進一步加劇了此一情況。現有的防禦機制大多在白箱假設下運作,依賴於文本編碼器最佳化、權重編輯或推論時干預,從根本上無法擴展至專有模型。基於大型語言模型(LLM)提示詞改寫的黑箱替代方案提供了更廣泛的適用性,但在我們所指出的關鍵情境——良性對抗問題——中卻會失效:即提示詞在語言上安全,但因模型學到的資料分佈而仍觸發有害生成。我們提出 DiSCO,一種零樣本、嚴格黑箱的防禦機制,完全在提示詞層級運作,作為即插即用模組,無需模型重新訓練、微調或存取模型內部。DiSCO 透過束搜尋進行分佈引導的後綴擴展,並藉由對目標模型自身生成的安全與不安全圖像池進行對比評分來最佳化,同時採用迭代適應性回饋,直至產生安全內容。我們證明,DiSCO 在 I2P 基準上、多種紅隊攻擊下,能一致地提升未防禦與已防禦模型的安全性,分別達到 37.7% 與 25.13% 的攻擊成功率(ASR)降低,同時維持語義保真度並改善圖像連貫性。作為一個黑箱、與架構無關的模組,DiSCO 可輕鬆應用於任何文生圖系統,無需對模型本身進行任何修改。
位元組層級的分層語言模型(LMs)近年來已成為使用子詞分詞之主流對應模型的一種穩健替代方案。然而,一次生成一個位元組仍是推論速度的瓶頸。為了解決此問題,我們引入了多位元組預測(MBP),透過並行生成多個位元組來加速推論,同時將性能影響降至最低且無需增加額外參數。MBP建立在流行的多詞元預測(MTP)範式之上,並具備兩項關鍵創新。首先,我們引入了可變長度的預測視窗,使其與分層語言模型的潛在詞元或分段對齊。其次,我們實作了一種新穎的注意力遮罩機制,使並行位元組預測得以在不違反因果性的前提下實現。我們證明,多位元組預測在多種生成任務中達到了帕累托最優權衡,包括指令遵循、問答、摘要與機器翻譯,在性能與推論吞吐量之間實現了最佳取捨。
基於指令的影片編輯資料集的品質與多樣性持續提升,然而現有資料集主要聚焦於單一編輯操作,難以支援組合式指令引導的影片編輯。具體而言,多重編輯意圖必須在同一影片中被聯合理解並忠實執行。為了解決此問題,我們提出了CoinVE-200K,一個大規模、高品質的組合式指令引導影片編輯資料集。CoinVE-200K包含多達201幀的1080p影片-編輯對,涵蓋多樣化的組合式場景,其中每個樣本涉及2至5個原子編輯操作。指令針對人物、物體與背景,並涵蓋新增、移除、修改與風格化等編輯類型。所有樣本皆透過精心設計的生成與篩選流程建構,以確保指令忠實度、視覺品質、時間一致性與組合多樣性。我們亦提出了CoinVE-Bench,一個涵蓋多樣主題、操作類型與指令複雜度的組合式指令影片編輯基準。此外,我們提出了CoinVE-Edit,一個基於Wan2.1-T2V-14B與Qwen3-VL-8B-Instruct所建構的220億參數組合式影片編輯模型。CoinVE-Edit將不同編輯指令的區域感知注意力予以解耦,能夠在保留無關內容與時間連貫性的同時,實現精確的多區域編輯。在CoinVE-Bench上的實驗結果顯示,CoinVE-Edit在指令遵循、組合式編輯準確度、視覺品質與時間一致性方面均展現出優異表現。
視覺編碼器是視覺-語言模型的關鍵組成部分,有效擴展其容量可顯著提升性能。然而,密集擴展會增加計算成本與推論延遲。混合專家(Mixture-of-Experts, MoE)架構提供了一個極具吸引力的替代方案,已在大型語言模型中實現高效擴展,但在最先進(State-of-the-Art, SOTA)水準下,CLIP風格的視覺編碼器之MoE設計空間仍未得到充分探索。在本研究中,我們系統性地探討了MoE設計在視覺編碼器擴展中的應用,發現細粒度MoE拓撲結構相較於密集對應模型與標準MoE模型均能帶來顯著增益。我們進一步提出了一種無輔助損失的平衡變體,以提升專家利用率,並設計了專門的MoE內核以減輕推論延遲開銷。為在保留影像知識的同時增強影片能力,我們引入了幀級蒸餾搭配新穎的凍結機制。我們預訓練了一系列不同規模的混合專家視覺編碼器(Mixture-of-Experts Vision Encoders, MoE-ViE),所有模型均持續優於其密集對應模型。我們最大的模型以76%的延遲達到了規模為其1.7倍之最先進編碼器的零樣本性能。在與大型語言模型對齊後,MoE-ViE在影像與影片基準測試上超越了所有對比編碼器,包括激活參數量高達5倍的模型。程式碼已公開於 https://github.com/facebookresearch/moe_vie。
記憶正逐漸成為長時程大型語言模型(LLM)代理的核心基礎設施,然而現有的評估對於在不同運行模式下應使用何種記憶載體(即記憶表徵與儲存的底層媒介)所提供的指引仍然有限。我們提出了一個針對記憶增強型代理之記憶載體的受控測試框架評估,涵蓋密集與稀疏索引、文字記錄、結構化儲存、階層化儲存、基於精煉的記憶、參數更新,以及與激活相容的上下文機制。我們跨越三個骨幹模型與四套基準測試套件(涵蓋以使用者為中心的問答與以代理為中心的決策),在統一的測試框架下量測了26項效能與效率指標。我們的結果顯示,沒有任何單一載體能持續佔據主導地位:廣泛的檢索有益於長上下文的事實問答,但過度的檢索可能透過將注意力從對行動至關重要的情境中移開,而損害序列決策。可擴展性引入了另一個路由維度,因為在中等歷史長度下表現良好的載體,在更長的時程中可能變得昂貴或脆弱。這些發現促使載體路由成為自適應代理記憶系統的必要組成部分,並為設計高效、可靠且具運行模式感知的LLM代理長期記憶提供了實證指引。程式碼將於論文接受後提供。
大規模影像生成已受益於資料規模、品質、重新平衡與重新生成描述等方面的進展,然而傳統流程通常孤立地最佳化特定任務的資料集。核心挑戰不僅在於如何整理每個任務特定的語料庫,還在於如何根據生成能力之間的依賴關係來組織異質監督。我們提出一個以能力為驅動的資料基礎設施,將特定能力的監督建構與對齊能力的課程排程相結合。其中的三個專業但可互操作的資料引擎,分別為文字-影像對應、影像間轉換與影像-知識關聯建構互補的關係監督;同時,描述專家使文字到影像(T2I)與編輯監督在不同任務與粒度上保持一致。一個多階段課程依循能力習得的依賴順序,共同演進任務組成、視覺概念分布、資料品質與影像解析度;能力感知評估則透過針對性檢索、專家建構與差距感知的重新取樣來閉環。在大規模應用中,該框架整理了包含 4.4 億張影像的 T2I 語料庫、1.2 億個編輯對,以及超過 2700 萬個影像-實體對。利用此基礎設施,我們從零開始訓練兩種規模的多模態擴散模型,參數量分別為 3B 與 6B。我們在 CPI-Bench 上進行定量評估,並在各種文字到影像與編輯場景中進行定性評估。實驗結果展現了廣泛的視覺覆蓋、多功能的渲染,以及跨生成能力的有效遷移。
大型語言模型(LLMs)與代理的最新進展大幅提升了人工智慧系統執行複雜任務的能力。然而,現有基準測試大多依賴研究人員選定的任務,使得此類進展是否能延伸至真實世界使用者實際要求人工智慧系統執行的工作,仍屬未知。我們提出 StartupBench,這是一個以市場驗證之人工智慧新創產品為基礎的端對端代理基準測試。我們並非基於對代理有用能力的預設假設來定義任務,而是系統性地研究已被證實獲得採用的 AI 產品、其產品工作流程與使用者,以識別 AI 已在多種專業領域中展現實際需求的真實世界任務。我們將這些工作流程轉化為完整的、以交付成果為導向的任務,並以能夠捕捉其複雜需求的細粒度評分標準進行評估。在統一的代理測試框架下評估多個具代表性的模型時,即使最強的模型,也僅能成功完成約 30% 的 StartupBench 任務,儘管在許多任務上已取得顯著的部分進展。進一步的分析指出,複雜的指令遵循與特定領域專業知識等方面是主要的失敗來源。我們的結果顯示,許多經過市場驗證的工作流程仍超出當前通用代理的可靠能力範圍,這使 StartupBench 成為衡量朝向端對端完成真實世界使用者任務進展的實證指標。
像素空間生成模型繞過了有損的潛在壓縮,但卻需要在高維空間中同時學習全域結構與精細細節。標準的流匹配是將雜訊向固定的乾淨影像端點進行插值,使得頻譜演化必須被隱式地學習。在本論文中,我們提出了能量引導流匹配(Energy-Guided Flow Matching, EG-FM),透過移動端點來明確建模由粗到細的生成軌跡。具體而言,EG-FM 以熱核濾波端點取代固定端點,該端點會從低頻影像平滑地演化至乾淨影像。移動端點中的高頻訊號比例,由影像特定的能量引導調度釋放,從而在流匹配中重新定向速度。我們的框架無需調整骨幹網路與訓練資料,且在訓練與推論階段僅帶來可忽略的成本。在實驗中,EG-FM 在 ImageNet 類別條件影像生成任務上,以更少的時期持續取得較低的 FID,在 256×256 解析度下,200 個時期達到 FID 1.55,600 個時期達到 1.45。我們在 512×512 解析度設定下繼續訓練生成任務,僅經過 40 個高解析度適應時期,便達到 FID 1.58。此外,我們將 EG-FM 應用於文字轉影像生成,在 GenEval 得分上達到 0.85,在 DPG-Bench 上達到 83.9。程式碼已公開於 https://github.com/ysng123/EG-FM。
計算最優擴展定律引導著前沿語言模型的訓練,但在視覺生成領域仍在很大程度上尚未被探索。我們使用受控的流匹配 Transformer 家族 Abra,對文字到圖像擴散模型進行了系統性的擴展定律研究。我們在橫跨三個數量級的計算量(10^{19} 至 10^{22} FLOPs)上進行訓練,達到了遠超以往工作的計算預算。我們證明,擴散模型的擴展行為與語言模型同樣可預測,但要實現最優訓練所需的數據卻要多得多:計算最優性出現於每個參數約 200 個圖像 token,是 LLM 的 Chinchilla 計算最優配方的十倍。我們進一步表明,與語言模型不同,擴散模型對過度訓練具有穩健性;從業者應寧可增加數據,而非選擇更大的模型。最後,我們證明這種可預測性不僅適用於訓練損失,也延伸至生成質量指標、最優 CFG 設定、表徵質量,甚至訓練曲線的形狀——這些曲線會收斂到一個通用形式。
大型語言模型日益透過代理框架部署,該框架負責管理工具、擴充功能、持久化狀態、權限及外部操作。現有安全基準主要針對個別攻擊機制或有限的操作設定子集,使得難以比較不同框架職責下安全失效的產生方式。我們提出 HarnessRisk——一個生命週期導向的基準,將代理框架安全劃分為六個操作階段,包括框架配置、能力擴展、運行時操作、狀態持久化、行動控制及事件恢復。HarnessRisk 包含 128 個沙箱化案例,每個案例將良性用戶目標與嵌入於不受信任工作流程構件中的對抗性指令配對。我們使用效用、攻擊成功率、持久性及偵測率評估每個軌跡。在三個框架、六個語言模型以及 14 種模型與框架配置中,攻擊成功率介於 12.6% 至 80.9%,而效用維持在 75.0% 至 97.6% 之間。框架配置是三個框架中最脆弱的階段,顯示攻擊可透過在原本授權的工作流程中更改安全敏感參數而成功。我們也發現,明確的風險識別並不保證導致安全行動,因為某些配置在超過 90% 的運行中偵測到風險,但仍保有顯著的攻擊成功率。這些結果強調,需要跨多個框架職責,並在部署模型與框架配置的層級上評估代理安全。
可靠的不確定性量化(UQ)對於在複雜互動環境中部署大型語言模型(LLM)代理至關重要。現有的不確定性量化方法主要依賴局部信號,例如詞元機率、預測熵或逐步置信度,因而忽略了錯誤在執行軌跡中累積所需的長程依賴關係。因此,這些方法可能無法識別那些成因發生於最終答案之前數個推理或互動步驟的代理失敗。我們提出RUPA(Relational Uncertainty Propagation for Agents),一個針對LLM代理的軌跡層級不確定性量化框架。RUPA將執行歷史表示為一個有向軌跡圖,其中推理狀態、工具互動與環境回饋作為節點,並透過時間與語義依賴邊相互連接。隨後,它在此圖上傳播不確定性,以捕捉執行風險如何在互動步驟間累積與轉移。傳播後的信號與軌跡層級的行為特徵及目標對齊資訊相結合,以產生對完整代理軌跡的置信度估計。我們在具代表性的代理基準測試上評估RUPA,包括τ-2、Terminal-Bench-2與GAIA,並使用橫跨多個模型家族的6個開源LLM。實驗結果顯示,RUPA透過提供更準確的不確定性估計、實現更早的失敗偵測,以及在多樣化代理任務中改善不確定性引導的代理執行,持續優於現有的不確定性量化方法。這些結果表明,明確建模關係依賴對於長時程LLM代理的可靠不確定性量化至關重要,為可信賴的代理執行提供了實用的基礎。
自動形式化通常被描述為將自然語言數學陳述轉換為機器可驗證的形式語言(如 Lean 4)的過程。然而,忠實的形式化不僅僅是翻譯。模型必須將數學概念映射到形式化程式庫(如 Mathlib)中複雜的類型與定義階層,同時確保生成的陳述保留原始命題的意義。現有方法之所以困難,是因為它們高度依賴模型的參數化記憶來獲取程式庫特定知識,而常見的資料建構流程往往僅對單次輸出進行篩選,缺乏回饋驅動的修訂機制。為了解決這些挑戰,我們提出了 MathForm,這是一個自動形式化框架,透過 Mathlib 知識檢索與驗證引導的迭代精煉來建構經過驗證的訓練資料。在生成之前,檢索規劃器從 Mathlib 收集相關定義與現有形式化,以引導形式化生成器。隨後,生成的陳述會利用編譯器診斷訊息與語義一致性回饋進行修訂。利用此框架,我們建構了 FormalVerse,這是一個 Lean 4 資料集,包含來自不同數學領域與來源的約 367,000 個已驗證範例。接著,我們透過監督式微調與後續的強化學習來訓練 MathForm-8B。在六個基準測試中,MathForm-8B 在語法檢查(SC)下的平均 Pass@8 率達到 88.06%,在一致性檢查(CC)下達到 72.37%,優於多個專門化的 32B 自動形式化模型。在具有挑戰性的 FATE-H 與 FATE-X 子集上,其 CC 通過率分別達到 63% 與 37%,在兩種情況下均超過最強的專門化基準模型。
我們使用AI-Infra-Guard(A.I.G)評估DeepSeek Harness(DSH)中的間接提示注入,透過A.I.G建構測試、傳遞受控污點、執行DSH、收集軌跡並判定結果。本研究涵蓋16個間接內容通道、文字與檔案載體模式、35種負載目標、一個未修改的基線以及12種攻擊方法,共計14,560次受控執行。實驗保留了DSH的代理迴圈、工具註冊表、模型適配器與會話事件路徑;來源工具與敏感匯點均為本地測試裝置,因此嘗試的動作會被記錄而不產生外部副作用。我們使用基於規則的確定性評判器(RuleJudge)與基於語義的LLM評判器(LLMJudge)評估每一條軌跡。觀察到的最強攻擊成功率分別為:文字模式下虛假完成攻擊在RuleJudge下為17.0%,檔案模式下隱藏Unicode在LLMJudge下為25.5%,以及檔案模式下技能通道在LLMJudge下為16.0%。LLMJudge也比RuleJudge更頻繁地賦予部分符合(7.3%對比2.0%)。我們將這些結果與DSH處理工具結果、額外上下文及工具呼叫策略鉤子的方式相關聯,進而識別應置於不受信任內容與敏感動作之間的控制措施。我們的程式碼可在https://github.com/Tencent/AI-Infra-Guard/tree/main/Research/deepseek-harness-security-assessment取得。
在大型語言模型中改善知識使用的方法通常可分為兩類範式。非參數檢索能彈性存取外部知識,但會增加檢索延遲、上下文負擔,且與主幹模型的整合僅停留在淺層。參數式調適在推論時效率較高,但會將知識與模型權重糾纏在一起,難以更新、稽核或遷移。Engram 風格的雜湊記憶則屬於中間範式:它將學習到的資訊儲存在外部、可定址的表格中,並透過一個小型學習式讀取器來取用該表格。這引出了一個基本問題:當此類記憶被遷移至不同的主幹模型時,何者更為關鍵?是凍結的記憶本身,還是目標端的讀取器?我們透過跨模型凍結記憶抽取來研究此問題,也就是將在源模型上訓練的記憶凍結,並附加到不同的目標模型上,僅訓練輕量級讀取器。消融實驗顯示,學習到的記憶內容與正確的定址機制皆具重要性,但遷移後的表格唯有透過與目標模型對齊的讀取器,方能發揮效用。在下游問答任務中,雙層四分支讀取器幾乎縮小了同模型重用與跨模型重用之間的差距,在我們受控的評估協議下達到平均分數 38.8。此外,當提供端讀取器能直接相容於目標端介面時,凍結工件無需目標端訓練即可提供實質效用,而選擇性的讀取器調適則能進一步改善表現。這些結果顯示,只要目標端能取得相容的讀取器介面,Engram 便可作為可重用的外部知識工件;當直接重用讀取器不足時,目標端調適可進一步提升對齊程度。
能產生假說、檢索相關文獻、設計實驗、執行程式碼並起草完整論文的 AI 共同科學家,正開始改變研究的進行方式。儘管進展迅速,最先進的系統仍然不考慮研究者:在給定研究目標時,它們會最佳化新穎性、有效性或審稿人評分,而忽略了將使用其產出的個別科學家。這忽略了研究的一個基本事實,亦即,何謂新穎、有價值或可行,取決於研究者本身,包括其先前的工作、方法學儲備,以及其所處的合作者網絡與學術社群。在本研究中,我們引入個人化自動研究(personalized auto-research)的問題,此問題讓研究過程的每個階段都以個別研究者的表徵為條件。我們主張,個人化並非只是便利層,而是讓 AI 系統得以作為真正的共同科學家、而非通用工具的根本屬性。為了解決此問題,我們提出一個通用且靈活的框架,將以圖為基礎的研究者情境貫穿於檢索、假說搜尋、實驗、寫作與審查。該框架由三個基本組件構成:(i) 以圖為基礎的研究者表徵;(ii) 貫穿整個研究流程的個人化;(iii) 以個人為基礎的評估。值得注意的是,我們強調一種「一刀切」的失敗模式:不同的研究者提出相同目標時,會得到本質上相同的研究,從而抹除了孕育新穎想法的默會知識。最後,我們討論了根本的開放性問題與挑戰。
許多可擴展的潛在 3D 生成器作用於結構化張量,而預先優化的 3D 高斯潑濺(3DGS)重建則是無序、空間上不規則,且圖元數量差異極大。我們提出 GS-Voxel,一個免擬合的結構化潛在框架,並對其進行大規模空中 3D 高斯場景生成的評估。GS-Voxel 可將相容的預先優化 3DGS 重建確定性轉換為稀疏活躍體素,無需額外的逐場景優化,同時保留所選圖元的亞體素位置與渲染屬性。接著,一個 GS 特定的分解 VAE 將體素幾何與局部高斯屬性分別編碼為稀疏 3D 潛在表示,其大小隨佔用體素數量增長,而非受限於固定的場景範圍圖元數量。我們在 GS-Voxel 潛在空間中訓練以影像為條件的流模型,以生成空中 3DGS 場景。GS-Voxel 所實現的一項關鍵應用是大面積場景生成:重疊感知的分塊推論可將合成範圍擴展至單一訓練裁切之外,並以衛星視圖影像為條件。我們的結果顯示,GS-Voxel 為預先優化的空中 3DGS 重建提供了結構化潛在表示,且其潛在容量隨佔用體素數量增長。
針對編碼智能體的強化學習日益依賴長時間運行的智能體執行框架,以管理工具整合、程式碼庫上下文與執行反饋。然而,這些執行框架的原生執行環境本質上與策略梯度訓練不一致:環境崩潰與獎勵作弊會破壞結果信號,而訓練-推理差異則使採樣行為與策略更新脫節。為解決此問題,我們提出 LEGO-RL,這是一個在不修改原生編碼智能體執行框架內部控制流程的前提下,將其與可擴展的策略梯度優化橋接起來的框架。LEGO-RL 建立在三大支柱之上:(1) 透過進程內 LLM 代理實現忠實優化,該機制捕捉原始生成串流以進行 Token 層級的對齊,並在框架端進行壓縮或重新序列化時,仍能穩健地在訓練端重新計算對數機率;(2) 透過具備映像快取與分階段防禦的可擴展沙盒編排實現可靠執行,以緩解獎勵作弊;(3) 透過整合式外掛模組實現可觀測訓練,該模組自動化驗證與監控,並搭配即時 UI 以進行細粒度軌跡診斷。我們在三種原生編碼智能體執行框架上,使用 GSPO 訓練稀疏 MoE 模型 Qwen3.5-35B-A3B,以此評估 LEGO-RL。在 SWE-bench Verified 上,LEGO-RL 使 Qwen3.5-35B-A3B 於 OpenHands SDK(64.0% 提升至 70.4%)、Claude Code(62.4% 提升至 68.2%)及 OpenCode(57.2% 提升至 66.6%)上的表現均獲得改善,同時維持高於 0.99 的採樣-訓練機率相關性。
圖神經網路通常透過特定家族的方程式來描述,這些方程式的符號掩蓋了共享的計算與結構差異。我們提出一個通用層方程式,透過七個組件來表示所涵蓋的架構:更新域、通道集、傳播算子組、逐通道訊息映射、通道融合算子、自身/殘差映射,以及更新映射。此核心分解將「資訊在何處移動」(由傳播算子組編碼)與「移動的內容」(由訊息映射編碼)加以區分。函數值填充使同一方程式得以延伸應用於局部訊息傳遞、注意力、頻譜濾波、全域通訊、關係特定通道、高階域,以及幾何訊息。 我們透過對標準層的逐步化簡,以及橫跨七個非互斥架構家族的組件指派,使此統一框架明確且可驗證。一套固定的槽位規則依計算角色指派運算,並界定此框架的覆蓋邊界。此分解亦帶來組件層級的理論洞見:在端點局部訊息與節點局部更新的條件下,算子支撐限定了單層依賴關係;而在所述假設下,單層全域混合需要完整的有效算子行。 由此產生的框架在共同的設計空間中整理了超過 200 種架構,支援逐組件比較與結構一致架構的生成,並將傳播選擇與過度平滑、過度擠壓、異質性及表達力聯繫起來。它進一步揭示了實證逆問題:如何將可量測的圖與任務屬性對應到經驗證的組件選擇。
AI系統正日益具備對數學研究的貢獻能力。在研究實踐中,前沿模型的推理能力是有限的資源,而專家數學審查則受到更嚴格的限制。因此,妥善配置這些稀缺資源對於提升AI輔助數學發現的效率至關重要。在當前大多數AI數學研究工作流程中,人力投入集中在開始與結束兩個階段,即選擇合適的研究問題,以及後續審查所產出的成果。這兩個階段正成為研究級數學的瓶頸。我們通過提出一種新的人機協作發現典範來解決這些問題。人類輸入不再是事先選定的單一問題,而是專家具有興趣與專業知識的研究方向。系統隨後在廣泛的文獻語料庫中搜索該方向下的候選問題。受搜索與推薦系統啟發,我們構建了尋找、嘗試與推薦(Find, Attempt, and Recommend, FAR)系統,這是一個從文獻到審查的級聯流程,可自動化搜索合適的問題,並將人類注意力集中於已通過多階段篩選的成果上。在一項組合學試點研究中,該流程從5,245篇組合學論文出發,提取出6,453個候選猜想或開放問題,並將其篩選至4,717個表面良置且仍開放的猜想。隨後進行的推理與自動分流階段浮現出598個潛在解答,並選出77個項目供作者團隊審查。其中,我們發現了許多有趣的成果,包括關於Davies–Jenssen–Perkins–Roberts、Erdős–Straus、Ikenmeyer–Pak–Panova及Lund–Saraf–Wolf猜想與問題的結果。這些成果證明了這種新型人機協作模式在數學發現中的有效性。
程式化表示為3D內容創作提供了一個引人注目的範式,得以實現細粒度編輯、可解釋性與明確的結構控制。然而,依賴大型語言模型(LLMs)來編寫3D程式的代理式工作流程仍然脆弱,往往無法將高層級意圖轉化為一致的低層級幾何。我們將這種脆弱性歸因於現有程式化介面與LLM推理優勢之間的失配,後者偏好語義結構和空間關係,而非脆弱的數值選擇。在本文中,我們共同設計了一個以代理為中心的領域特定語言(aDSL)和一個角色專業化的多代理系統,以縮小這一差距。aDSL透過強調可組合性和空間推理來橋接語義邏輯與幾何約束;它使代理能夠透過關係運算符而非脆弱的絕對坐標來操控幾何。在aDSL的基礎上,我們的免訓練多代理系統遵循規劃-執行-評論迴圈,以分解請求、合成程式碼,並利用執行回饋迭代修復錯誤與約束違反。實驗表明,這種協同設計提升了穩健性、可控性和對使用者意圖的忠實度。我們的方法在文字到形狀和圖像到形狀任務上優於先前的基於LLM的基準方法,同時保留了明確結構、可編輯性與可解釋性。它還支援諸如關節物體創建和結構化場景組合等下游應用。我們的程式碼可於 https://github.com/sig-pku/aDSL 取得。
我們提出 PTXBench,這是一個用於評估與調適大型語言模型(LLMs)運用架構特定 PTX 進行 GPU 核心最佳化的基準測試。PTXBench 衡量功能正確性、所選目標指令是否在執行時期確實被執行,以及在 H100 和 B200 GPU 上,GEMM 與注意力機制工作負載相較於前沿函式庫的加速比。我們的評估顯示,架構特定的 PTX 能力仍參差不齊:在複雜的注意力反向傳播工作負載上,成功率大幅下降,且執行目標指令未必能轉化為具競爭力的效能。在所評估的模型中,沒有任何一個能在整套基準測試中持續匹敵前沿函式庫。我們進一步使用監督式微調來調適 Qwen3.6-27B。修復條件訓練改善了若干任務,但泛化能力仍不均;除了資料集規模之外,資料覆蓋範圍、平衡性以及推理教師模型的品質同樣至關重要。PTXBench 提供了一個可稽核的測試平台,用於衡量並改善 LLM 善用不斷演進之 GPU 架構的能力。
心電圖(ECG)、光體積變化描記圖(PPG)與心音圖(PCG)提供同一心臟週期的互補視角,然而現有的心臟基礎模型僅針對單一感測模態進行訓練,未能利用感測器之間共有的生理資訊。我們提出 CardioState-JEPA,這是一個心臟基礎模型,旨在跨 ECG、PPG 與 PCG 聯合學習單一共享表徵,其架構建立在具有生理感知能力的聯合嵌入預測架構之上。該模型將異質波形映射至共同的詞元空間,以單一共享 Transformer 編碼器進行處理,並透過預測遮罩的潛在心臟狀態來學習,將預訓練目標置於共享生理而非感測器特定的波形外觀上。為處理電學、力學與血流動力學事件之間的時間偏移,跨模態預測採用學習式延遲對齊器,在對應的心臟時間點匹配訊號。由於同步多感測器記錄稀少,CardioState-JEPA 首先從大量單模態資料中學習模態內部結構,再利用配對資料在潛在心臟時間中對齊各模態。在涵蓋 ECG、PPG 與 PCG 的 25 項下游任務中,以凍結編碼器進行評估,我們的編碼器在平均 PPG 分類上較最佳自監督訊號基線提升 8.2 個 AUROC 百分點,PCG 心雜音偵測提升 18.8 個 AUROC 百分點,ECG 分類提升 15.5 個 AUROC 百分點,並在多項 ECG 基準上達到或超越以特權臨床文本或監督標籤訓練的心臟模型。這些結果確立了異質心臟訊號能夠相互監督單一心臟生理基礎模型的學習。
統一影像修復(UIR)旨在使用單一模型,從具有不同退化的低品質(LQ)影像中恢復高品質(HQ)內容。近期多數方法採用大型預訓練的文字轉影像(T2I)潛在擴散模型,因其具有強大的容量與生成先驗。然而,潛在T2I模型中的變分自編碼器(VAE)可能丟棄對修復敏感的細節,而開放式生成先驗則可能引入與內容不一致的偽影。我們提出PixRestore,一種用於UIR的無VAE像素空間擴散Transformer(DiT),其擴散骨幹完全從零開始訓練,不依賴T2I預訓練。PixRestore直接在分塊化像素上執行流匹配,在保持令牌序列可處理的同時保留細粒度細節。為了適應不同的退化,PixRestore學習利用LQ-HQ DINO特徵相似度來預測層特徵的可靠性。來自較可靠層的特徵被融合作為密集條件,而較不可靠的層則接受更強的高品質特徵監督,以促進退化移除。我們在大規模多場景、多退化的語料庫上訓練PixRestore,並進一步使用基於DINO的對抗目標將其微調為單步生成器,以實現高效推理。在公開基準與真實世界測試集上的實驗顯示,僅約50M參數且單步推理,PixRestore在競爭的UIR模型中達到了最佳的整體保真度、感知品質與對退化的穩健性,同時效率遠高於其他模型。更大的PixRestore變體可進一步提升效能,證明我們像素空間設計的可擴展性。程式碼與精選基準可在 https://github.com/csslc/PixRestore 取得。