每日精選AI研究論文及翻譯
遞迴自我改進(RSI)需要一個具體機制,使 AI 系統得以觀察自身能力,並將該證據轉化為下一輪學習。我們提出 NeoHorse-1,一個代理原生模型系列,其開發目的是透過代理式後訓練探索此路徑。我們的系統結合異質模型池與智慧路由,記錄每個使用者回合的預測能力需求、所選服務層級及後續互動。這些記錄會轉換為訓練樣本,保留交錯推理、工具呼叫與測試框架脈絡,並透過結構驗證、六維語意評估與子場景層級標註予以納入。路由訊號將監督式微調組織為三階段課程,並延伸至路由引導的同策略蒸餾,其中教師在相同進程下監督學生生成的回應。能力引導分配接著將評估回饋轉換為下一輪訓練混合資料,形成評估-選擇-更新循環,其中系統學會做什麼,將形塑它下一步從何學習。在涵蓋基於測試框架的代理、工具使用、程式設計與指令遵循的十一項基準測試上,後訓練在 4B 時將巨觀平均從 58.94 提升至 64.87,在 9B 時從 65.60 提升至 69.04,大幅縮小後訓練 4B 模型與 9B 基礎模型之間的整體差距。NeoHorse-1 提供了此回饋驅動過程的初始原型,以及一條邁向跨連續迭代、由測試框架中介的遞迴自我改進的路徑。
我們提出 AuK,一個開放原始碼基礎模型,其透過自然語言指令與音訊情境的共同介面,統一語音生成與編輯。為支援如此廣泛的能力集,我們建構約 30.3 億筆指令–音訊實例,以及橫跨五個任務家族、共 195 萬小時的有效監督:語音生成、內容編輯、增強與分離、副語言編輯與聲學編輯。AuK 結合用於語意條件化的多模態大型語言模型、在語音、一般音訊與音樂上聯合訓練以進行聲學條件化的 VAE,以及混合式整流流 Transformer;後者先執行雙流 MMDiT 區塊,再執行統一的單流 DiT 區塊以進行生成。訓練始於僅生成暖身,接著進行聯合生成–編輯預訓練。我們隨後採用互補的後訓練策略:針對開放式編輯的人類回饋偏好最佳化,以及針對語音生成的基於獎勵之強化學習。為降低推論成本,我們進一步以一致性初始化與任務路由的解耦 DMD 蒸餾該模型。所得 AuK-Flash 可進行 4 步推論,且不依賴無分類器引導,並在匹配條件下相較完整模型達到 4.5 倍的實際耗時加速。實驗顯示,其在零樣本與指令控制的語音生成,以及通用指令引導編輯上具領先效能,同時在訊號層級修復任務上保持競爭力。我們釋出原始碼與模型權重,以支援可重現性與進一步研究。
在本研究中,我們提出 Gander,一個端到端模型,於單一框架內統一全感知、即時互動與代理能力。相較於回合制的傳統範式,Gander 持續接收跨多模態的串流輸入,包括視訊、語音與文字,從而在日常對話與複雜工作流程導向的代理場景中實現自然的全雙工互動。使用者可隨時打斷模型,模型亦能主動提供中間回饋或提出追問。為原生支援這些能力,Gander 採用兩項關鍵架構設計:1) 其採用小腦-大腦協作框架,其中小腦負責即時互動與全模態對話能力,而大腦負責複雜推理與更高階的代理任務。這兩個組件透過工具呼叫與代理編排執行環境持續互動。2) 小腦建立於串流式 Thinker-Talker 架構之上,使用者輸入與模型輸出進一步在區塊層級被攤平為有序的詞元串流,為低延遲、持續互動提供統一表徵。我們從四個面向對 Gander 進行全面評估:對話能力、全模態理解、互動能力與代理智慧。內部人工評估顯示,Gander 維持 SOTA 開源模型自然且具表現力的口語對話能力,同時在全模態互動方面達到具競爭力的表現。Gander 亦在具挑戰性的真實世界場景中展現穩健性,包括背景噪音干擾、多方互動與附和式溝通。我們釋出 Gander 及其模型、程式碼與資料,以促進社群進一步的研究與開發。
弱到強泛化探討較強模型能否向較弱監督者學習並超越它們。這個問題對連續模型世代與多領域整合尤其重要,因為從頭重複進行前沿規模的後訓練可能成本高昂到難以承受。然而,傳統蒸餾將弱教師視為最佳化目標,可能將其容量上限加諸於學生。我們提出同策略反向蒸餾(On-Policy Reverse Distillation, OPRD),其在學生 rollout 上評估教師相對於其參考策略的策略偏移,並沿該方向放大學生由驗證器驅動的策略梯度分量。OPRD 僅重新縮放驗證器支援的更新,因而保留策略最佳化的駐點,同時加速學習以超越教師。在連續模型轉移與多教師蒸餾中,OPRD 均以比現有強化學習(RL)與蒸餾方法更少的學生更新次數,達到更高效能。回應風格分析顯示,相較於其弱教師,OPRD 學生仍更接近僅使用基於驗證器的強化學習訓練的模型,意味著教師引導加速而非重新導向學生自身的最佳化。傳統強到弱蒸餾的結果進一步證明,無論容量排序為何,OPRD 都能有效結合驗證器驅動的策略最佳化與教師引導。
大多數端到端自動駕駛系統透過模仿人類駕駛日誌來學習,使其學到的行為受制於所記錄軌跡的品質與行為覆蓋範圍。本報告提出 DriveZero,一套能學習超越人類示範之駕駛行為的端到端系統。它將駕駛分解為感知模型與動作模型,分別在最適合各自的機制中預訓練,再結合成單一端到端規劃器。這兩個模型需要不同的學習配方:感知必須理解世界,並受益於大量且多樣的視覺資料;動作必須與世界互動,且需要閉環回饋。在動作方面,我們提出 DriveRL,一個混合代理閉環強化學習框架。它將真實駕駛日誌轉換為互動式世界,在其中透過閉環 rollout 以 PPO 訓練具特權的教師策略。對於感知模型,DriveVFM 將多個凍結的視覺基礎模型,包括 DINOv3、SigLIP2、SAM 與 Depth Anything V2,僅從原始影像整合為單一骨幹,無需任務特定標註。DriveZero 接著統一兩者:一個僅使用相機的規劃器,透過其 rollout 軌跡蒸餾凍結的 DriveRL 教師。此目標條件教師還可在增強的駕駛意圖下被查詢,產生記錄資料無法提供的多樣且目標一致的監督。在 nuPlan 上,DriveRL 搭配價值引導的測試時動作搜尋,在 Val14、Test14-hard 與 Test14-random 社群分割中,於非反應式與反應式模式下均達到平均分數 93.57,並在所有三個分割上超越 Log-Replay 專家。DriveZero 在 NAVSIMv1、NAVSIMv2 與閉環 HUGSIM 基準上,在無任何人類軌跡監督下達到最先進效能。
世界-動作模型從影片生成先驗繼承世界知識,並透過具身經驗將其轉化為可執行的控制訊號。然而,現有系統是單體式的:生成主幹、視覺表徵、架構、資訊流、推論程序與訓練資料緊密耦合,模糊了哪些設計選擇重要及其原因。我們提出 OpenWAM,一個開放研究堆疊,將世界-動作預訓練轉化為受控實驗計畫。OpenWAM-Infra 將 WAM 設計空間分解為可組合模組,並具備統一的訓練、推論、部署與評估。在此基底上,OpenWAM-Study 透過受控實驗探討三個問題:該繼承什麼、世界與動作學習如何互動,以及其協同效應如何擴展;並提煉三項原則:上游知識透過足夠強大的生成主幹與緊湊且資訊豐富的潛在空間進行轉移;世界-動作協同需要專用動作能力、明確的世界到動作資訊流,以及同步聯合去噪;而具身預訓練主要提升域外泛化,並透過對第一人稱視角與機器人資料進行單階段共同訓練,整合世界覆蓋與動作接地。綜合這些原則,我們建構了 OpenWAM-α,一個開放的 WAM,在約 6,400 小時的第一人稱視角人類與機器人資料上預訓練,並在模擬與真實世界基準上評估。在八個模擬基準與真實機器人實驗中,這些實驗共同涵蓋從單臂與雙臂操作到靈巧手的具身形式,OpenWAM-α 展現一致優異的效能,從模擬到實體世界維持其頂尖地位。我們釋出完整堆疊,包括基礎設施、評估協議、預訓練模型與資料配方,以促進未來研究。
世界行動模型 (WAM) 預測未來狀態以引導機器人動作,從而能夠從無動作影片和帶動作標籤的互動中學習。大多數模型繼承了預訓練的影片生成器,使得 WAM 的預訓練和規模化探索不足。我們引入了 Genie Envisioner Act 2.0 (GE-Act 2.0),這是一個世界行動模型,其可訓練的生成和動作組件全部在操作資料上從頭初始化。它結合了控制導向自編碼器 (CoAE)、單步視覺規劃器 (SVP) 和逆動力學模型 (IDM)。CoAE 在激進壓縮下保留與動作和指令相關的資訊,而 SVP 在一個可微分步驟中產生完整的未來狀態,因此視覺規劃和逆動力學可以分別在互補資料上進行預訓練。然後,這些組件使用知識對齊選擇性優化 (KASO) 進行聯合訓練,該方法透過僅選擇被判斷為與記錄動作行為相容的預測未來,來減少不匹配的監督。我們直接評估預訓練檢查點,無需針對每個任務進行微調,在 20 個操作技能組的 100 個任務上,使用保留的場景、背景、光照和物體實例。將協同訓練資料從 300 小時擴展到 30,000 小時,將 G1-OP 上的成功率從 17.1% 提高到 44.1%,並將 G2-90D 上的成功率從 13.4% 提高到 31.1%;儘管 G2-90D 佔協同訓練資料不到 2%,但其提升了 17.7 個百分點,顯示出跨具身轉移。增益涵蓋 19/20 和 18/20 個技能組,且技能特定覆蓋率與零樣本分布外 (OOD) 成功率高度相關(皮爾森 r=0.80;斯皮爾曼 rho=0.85)。在相同協議下,該模型在至少 90% 的試驗中能錨定物體、顏色、形狀和位置的指稱,並且即使明確指令與已承諾的行為或常規場景關聯相衝突,也能遵循這些指令。
我們提出 Miles v0.1,一套面向前沿後訓練的全端、可投入生產系統。奠基於 slime 的簡潔設計,Miles 在強化學習(RL)訓練迴路的每個階段皆圍繞單一原則進行設計:元件應可驗證、簡潔且可自訂。Miles 以準確性、效率、可靠性與可擴展性為首要目標,旨在讓研究人員與企業皆能取用前沿規模的 RL。本報告端到端說明該系統:以 SGLang 為基礎建構的 rollout 引擎、可選擇兩種後端(NVIDIA Megatron-LM 與 PyTorch FSDP)的訓練器,以及針對不同部署拓撲的三種權重同步傳輸方式。除全參數 RL 外,Miles 亦支援 LoRA 強化學習、同策略蒸餾、監督式微調,以及真·同策略 rollout 訓練對齊,並將相同架構延伸至擴散模型。文末以一個端到端案例研究作結:在終端機操作程式設計任務上,對 GLM-5.2 744B-A40B 模型進行全非同步的代理式 RL,於 64 張 NVIDIA GB300 GPU 上運行,前 30 個量測步驟的步進時間中位數為 263 秒。Miles 已在 https://github.com/radixark/miles 開源,專案網站為 https://miles.radixark.com。
單目深度估計是一項無所不在卻高度不適定的電腦視覺任務,其下游應用包括場景重建、計算攝影與機器人學等。儘管該領域已日趨成熟,近期模型仍難以泛化到分佈外輸入,也難以產生銳利且細節豐富的深度圖。在本論文中,我們重新審視 Marigold,一套將由擴散 Transformer(DiT)架構驅動的現代影像生成與編輯模型,改造為最先進單目深度估計器的技術。我們的方法旨在對預訓練的多步流匹配模型進行單步推論,並視需要量化,在保持模型容量之餘仍維持低廉的執行成本。我們分析樸素訓練的偽影,並找出兩項有效補救措施:將模型的內部表徵與從真實標註中擷取的語意特徵對齊,以及採用圍繞新穎 Sinkhorn 損失所建構的兩階段微調流程。結果是更銳利、更乾淨的深度圖,能良好泛化到分佈外,並在 KITTI 與 ETH3D 上,AbsRel 相較先前最佳成果提升 16–26%。在質性上,我們的模型能解析先前模型難以捕捉的毛皮、枝葉與髮絲般纖細的邊緣。此外,Marigold V2 應用於其他密集回歸任務時,例如表面法線估計與本質影像分解,達到最先進的結果。專案網站:https://hf.co/spaces/huawei-bayerlab/marigold-v2-web
自迴歸(AR)影片擴散模型在即時影片生成方面展現出巨大潛力。近期方法透過分佈匹配蒸餾(DMD)將預訓練的雙向影片擴散模型蒸餾為因果式 AR 學生模型,但生成的影片常出現過飽和與過平滑問題,導致視覺品質與真實感有限。關鍵成因在於 DMD 中反向 KL 目標的模式尋求行為,可能使學生分佈崩塌到教師分佈的少數模式上。為此,我們提出 Mask Forcing,一種雙雜訊遮罩 Rollout 策略,透過擾動 AR 學生的自我 Rollout 來緩解反向 KL 模式尋求所導致的模式崩塌。其核心思想是在 AR 擴散蒸餾的自我 Rollout 過程中,沿空間與時間軸使用隨機遮罩,將較乾淨的訊號注入雜訊較多的 Rollout 輸入。此類擾動促使學生 Rollout 探索教師分佈的更多區域,使 DMD 能提供學生已覆蓋模式之外的學習訊號。此外,較乾淨的 token 可作為其他雜訊較多 token 的去雜訊引導,改善中間 Rollout 預測並減少誤差累積。大量實驗表明,我們的方法能有效率地提升多種 AR 影片擴散蒸餾方法,並獲得更高的視覺品質,且無需納入真實影片資料或額外後訓練階段。
多樣化且可直接模擬的室內場景對互動娛樂與具身人工智慧至關重要,然而其可擴展生成仍具挑戰性。近期依賴視覺語言模型(VLMs)的代理式文本到3D場景流程能生成高保真度的場景,但需要成本高昂的迭代物件放置與精煉。另一個主流範式,參數化圖像到3D場景模型,能從2D圖像中學習到的強先驗高效地生成場景,但往往導致不精確且物理上無效的場景。更重要的是,這兩種範式都難以針對單一輸入輸出多樣化的場景,使其難以反映真實場景的動態變化特性。在本文中,我們提出SceneMosaic,一個結合了兩種範式優點的框架。它從學習到的基於圖像的先驗中獲取初始候選,隨後透過VLM代理演化結果,確保效率與物理有效性。在演化過程中,SceneMosaic利用自然場景的局部性,將場景分解為獨立的局部單元,允許在每個單元內進行單獨演化,然後透過笛卡爾積組合全局場景。在SceneEval-100上,SceneMosaic在語義佈局品質方面媲美最強的代理式基線,並達到24倍加速,大幅減少物理違規,並獲得最高的人類評分。我們的程式碼公開於 https://github.com/rxjfighting/SceneMosaic。
大型推理模型(LRMs)透過擴展式思維鏈(CoT)生成,達成卓越的解題表現,但所產生的鍵值(KV)快取會隨序列長度呈線性成長,造成嚴重的記憶體瓶頸,在長推理軌跡下往往超出 GPU 容量。現有的 KV 快取壓縮方法依賴近期查詢來估計未來符元的重要性,並隱含假設這些查詢可作為未來注意力模式的可靠代理。我們證明此假設在長時程推理中並不成立:某些解碼步驟會產生思維重訪符元(TRT),其會重新關注遙遠的先前上下文,例如在軌跡早期形成的解題計畫。透過系統性分析,我們發現對應於 TRT 的查詢在嵌入空間中會聚集成少數相似群組。基於此洞察,我們提出 BeaconKV,一種無需訓練的 KV 快取壓縮方法;其維護信標查詢——每個全域查詢叢集的精簡代表——以預測哪些 KV 對將被重新關注,而無需儲存完整的查詢歷史。在四個開源 LRM 與多樣的推理基準上,BeaconKV 通常優於現有壓縮方法,可達到最高 5.8 倍的記憶體縮減,同時幾乎維持完整快取準確率,並將吞吐量提升超過 4.3 倍。
潛在視覺推理旨在透過隱藏狀態計算來執行多模態推理,而非透過顯式文本思維鏈。然而,視覺資訊存在於潛在狀態中,並不表示模型在產生答案時實際依賴該狀態,尤其當其他以圖像為條件的路徑仍然可用時。我們提出因果視覺遞迴推理(CVRR),其在保留預訓練視覺能力的同時,使遞迴計算成為預測所必需、以圖像為條件的路徑。CVRR 在預訓練視覺語言模型納入圖像後,從問題隱藏狀態初始化遞迴,然後在重新讀取相同固定視覺證據的同時反覆更新此狀態。在解碼前,視覺狀態與原始多模態 KV 快取會被移除,因此僅有最終遞迴狀態將圖像條件資訊帶至答案。在 V^*、MMVP、BLINK 與 MME-RealWorld-Lite 基準測試中,CVRR 在此嚴格介面下維持強勁表現,而相容的潛在推理器即使在同一限制下重新訓練,也無法恢復可比的視覺能力。因果干預進一步顯示,當問題保持固定時,預測仍對遞迴內容敏感,且持續存在的視覺證據會因果性地修正遞迴軌跡。這些結果區分了潛在資訊性與實際用於預測的潛在計算。
當大型語言模型(LLMs)日益部署於對齊敏感的情境中,活化引導已成為行為控制中微調方法(例如 RLHF、DPO)的一種輕量、推論時替代方案。然而,既有研究通常僅在孤立行為上驗證引導,這使得引導向量究竟是編碼了連貫的語意結構,或僅是利用特定行為的捷徑,仍不明確。我們探討 LLM 引導向量的潛在幾何是否反映人類價值與道德中理論所界定的結構。我們以 Schwartz 的基本人類價值理論作為主要細粒度框架,提出一個涵蓋 20 種人類價值的 26K 樣本基準,並分析分佈驅動方法(例如 CAA、SphericalSteer、ODESteer)與行為中心取向(例如 COLD-Steer、BiPO)在多元模型家族與規模上的表現。我們發現,分佈驅動方法能還原與理論預測一致的人類價值拓撲(Spearman ρ 最高達 0.51,p < 10^{-13})。相較之下,行為中心方法雖達到可比的引導效能,卻與預期的價值幾何幾乎不相關。幾何保真度會隨模型規模提升而改善,但在指令微調後下降。最後,更好的幾何對齊也會帶來更符合人類的跨價值遷移:對某一價值進行引導時,能正確提升相容價值並抑制對立價值。程式碼與資料可於以下網址取得:https://github.com/DeepRCL/Steering_Geometry。
線性注意力在前沿語言模型中越來越常用於高效的長上下文推理和固定記憶體解碼。然而,其固定大小的遞迴記憶需要在每個詞元上進行線上決策:在不知道未來查詢需要哪些資訊的情況下,決定要寫入什麼以及以多大強度覆寫現有關聯。Delta 規則模型從當前詞元嵌入中學習這種強度,但不追蹤記憶估計的信心,使得每次寫入無法適應累積的證據。為了明確表示這種不確定性,我們將遞迴聯想記憶重新表述為線性-高斯狀態空間模型,卡爾曼濾波器是該模型的最佳遞迴估計器,並引入了一個新的模型家族:卡爾曼 Delta 網路(KDNs)。在 KDN 中,轉移過程同時傳播記憶狀態及其不確定性,使卡爾曼增益能夠根據累積證據和觀測可靠性對每次殘差寫入進行加權。在這種表述下,Delta 風格的更新成為一種特殊情況,它用逐詞元的各向同性替代量代替預測協方差,並省略了協方差追蹤。然而,精確追蹤需要一個密集的、依賴狀態的 Riccati 遞迴,這不適合 GPU 並行的線性注意力掃描。為了解決這個問題,我們引入了兩種與掃描兼容的 KDN 近似。對角 KDN 通過線上平均場變分推論將每個單步後驗投影到對角高斯族上,而各向同性 KDN 則使用每個頭具有單一不確定性純量的各向同性近似。它們的不確定性遞迴是 Mobius 映射,使得具有對數並行深度的聯想掃描成為可能。在 750M 和 1.3B 參數的受控預訓練中,KDN 變體在困惑度和平均下游準確度上始終優於最先進的線性注意力模型。
將人類手部示範遷移至機器人夾爪,近來已成為機器人學習中具成本效益的解決方案。然而,現有方法大多侷限於簡單的平面任務,無法處理機器人操作不可或缺的複雜空間運動(例如涉及旋轉或翻轉的精細軌跡)。有鑑於此一缺口,我們採用由細粒度手部姿態動作引導的隱式、資料驅動方法。為此,我們提出一套可擴展的資料獲取流程,用以收集手部—夾爪配對示範;此流程遵循嚴謹協定,優先考量動作複雜度,並利用手持式夾爪實現無縫動作模仿。這產生了一個大規模配對資料集,包含橫跨 1,254 個獨特物件的 6,189 個回合,展現出顯著高於現有基準的空間複雜度。然而,學習如此複雜的映射仍具挑戰性。我們觀察到,樸素地端到端生成完整夾爪姿態序列並不足夠,因為微小軌跡偏差會在複雜動力學下迅速累積。為解決此問題,我們提出兩階段框架:第一階段預測稀疏夾爪關鍵幀(初始與終端),以簡化映射目標;第二階段則以這些關鍵幀為條件,生成完整連續動作序列。此外,為減緩累積漂移,我們讓夾爪的朝向持續被學習,同時根據抓取啟發式與運動學一致性對其平移進行後優化。在模擬與真實機器人實驗中,我們的框架能針對複雜空間操作實現穩定且精確的手到夾爪轉移,顯著優於傳統基準方法。專案頁面:https://cosmoh2g.github.io。
推測解碼可加速 rollout 生成,而 rollout 生成主導了強化學習(RL)後訓練的成本。線上共同訓練可進一步提升草稿模型的準確率,帶來更大的加速。然而,將此方法擴展至具長上下文的大型模型上進行共同訓練,會面臨兩項障礙:(1)標準因果上下文平行(CP)實作不支援分支注意力;(2)目標特徵跨越管線平行(PP)階段。我們以一套用於大規模線上草稿共同訓練的端到端系統解決這兩項問題。針對 CP,我們擴展打包、負載平衡的 zigzag 環狀注意力,將各 rank 本地的分支注意力與因果主序列注意力合併。針對 PP,TapChannel 透過獨立路徑跨階段傳輸中間目標特徵,且不影響管線排程。實驗顯示,共同訓練的草稿模型能緊密貼近策略基線,同時在模型規模高達 122B 的範圍內帶來顯著的 rollout 與端到端加速。我們的 CP 設計在 256K tokens 下達到強擴展性,並相較先前工作顯著節省記憶體;我們的 PP 傳輸則僅帶來適度的額外開銷。程式碼可在 https://github.com/NVIDIA-NeMo/RL/issues/3698 找到。
視覺生成正從透過單次呼叫使用的生成模型,演變為能規劃、選擇工具、檢查中間合成輸出、修正失敗並重用先前經驗的代理式控制流程。在大多數現有系統中,控制器是 LLM 或 VLM,而視覺生成模型則作為工具或執行器。然而,現有研究缺乏一致的判準來判斷生成系統何時成為代理式。規劃深度、工具使用、多角色協作與強化學習常被視為代理性的證據,儘管這些都不必然決定控制器能做出哪些生成決策。我們依據控制器在生成過程中能直接控制什麼來組織這個領域。在 L1 條件控制中,控制器為預先確定的生成器準備輸入,但不控制執行哪一種視覺操作。在 L2 執行控制中,它選擇並呼叫實際的生成、編輯、渲染或其他修改內容的操作。在 L3 結果自適應控制中,它觀察中間結果,並利用該觀察改變當前任務中的後續操作。在 L4 經驗自適應控制中,它保留已完成任務的經驗,並利用該經驗改變未來任務的決策。L0 固定支援另行指稱未部署能做出生成層級決策之控制器的生成器、編輯器、評估器、獎勵模型、基準測試與固定管線。這些層級描述的是逐步擴大的決策範圍,而非模型大小、系統複雜度、輸出品質、工具或角色數量,或訓練方法。將此框架應用於影像、影片、編輯、3D、世界、投影片與使用者介面生成,可揭示控制器能力如何演變,以及其機制如何分佈於各層級。
大型語言模型日益被部署為能夠進行長遠規劃並透過外部工具行動的代理。大多數代理透過在累積歷史上進行無約束生成來選擇動作,使得關於做什麼、以何種順序以及在何種條件下做的程序性知識保持隱含。隨著軌跡變長,代理可能迷失目標、不按順序調用工具,並重複無效的動作。我們引入程序圖譜:正如知識圖譜將事實性知識組織為 (實體, 關係, 實體) 三元組以回答「什麼是」的問題,程序圖譜將程序性知識組織為 (程序, 關係, 程序) 三元組以回答「如何做」的問題。在每個決策步驟,該框架定位代理的活躍節點,並由引導模型將周圍子圖轉換為步驟級情境引導,從而偏向求解器的下一個動作而不強制決定它。該圖譜是自演化的:一個大型語言模型精煉器將失敗軌跡與成功軌跡進行對比,並編輯圖譜的拓撲與屬性,提交那些能保持或提升留出驗證性能的編輯,同時保留被拒絕的編輯以阻止重複。從最小骨架開始,該迴圈構建的圖譜能夠匹配或超越手工設計的圖譜。它還能修復有缺陷的專家先驗。在多個資料集、任務類型和大型語言模型上,程序圖譜相較於基於記憶的基線帶來一致的增益,且自演化無需人工工程即可進一步提升性能。
大型語言模型在靜態推理上展現卓越能力,然而透過強化學習(RL)將其訓練為自主代理以執行長程任務時,常受嚴重獎勵稀疏性阻礙。雖然透過監督式微調(SFT)進行傳統的代理端預熱可緩解此問題,但其常受資料稀缺與探索受限所限制。為解決此問題,我們提出轉向環境端適應的典範轉移,藉由建構回饋豐富化環境(FEEs)。透過先導研究,我們建立一套回饋設計策略,該策略藉由在回合內探索與回合間演化的後期階段,從行動引導轉向觀測豐富化,來重新構築環境。在 SciWorld 與 BFCL 基準測試上,使用多種 Qwen3 模型規模及 GRPO、GSPO、DAPO 等 RL 演算法進行的大規模實驗顯示,FEEs 相較於標準設定能持續提升效能。此外,我們的分析揭示,使用 FEEs 訓練可:(1) 藉由降低熵波動穩定訓練動態;(2) 在困難任務中促進主動的狀態空間探索;(3) 確保環境引導內化至策略權重,而非僅作為推論時先驗;以及 (4) 辨識出群組內回饋一致性是穩定最佳化的關鍵邊界。
將三維場景表示為多視角影像,使 2D VLM 能藉由重用預訓練所得的先驗知識進行三維推理,從而繞過標註三維資料稀缺的問題。然而,這會產生數千個冗餘視覺符元,其成本隨每個視角增加而攀升。現有的視覺符元剪枝器可分為兩類,但在三維多視角設定下各有其限制。學習式重要性方法根據注意力或編碼器特徵對符元進行排序;由於此處的冗餘本質上屬於空間性,這些方法會保留來自少數顯著區域的近重複符元,而使場景的大部分區域未被表示。體素化方法改善了空間覆蓋率,但無法強制確切的符元預算,且當多視角觀測在三維空間中重疊時會趨於飽和,使保留率遠低於目標。我們展示空間覆蓋率與三維推理效能相關,並提出 CoVeR:一種確定性、免訓練的選擇器,僅使用符元座標,而不依賴任何學習訊號。CoVeR 所選出的符元能共同覆蓋場景中的每個區域,並解決這兩類方法的限制:它強制確切的每場景預算、突破體素化飽和平台期,並避免基於學習的重要性方法所產生的近重複選擇。大量實驗顯示,CoVeR 在所有三個三維推理基準上均優於先前的 SOTA,並作為即插即用模組在四種 VLM 上測試時展現泛化能力。值得注意的是,僅使用約 8% 的視覺符元時,它仍保留完整符元效能的 93.5%,在跨基準平均上超越 SOTA 3.9 個百分點。
視覺-語言-動作(VLA)模型在語言條件式機器人操控方面已展現出可觀進展。然而,現有資料集與基準主要評估預定義設定下的任務完成情形,對於模型在空間與程序複雜度日益提高時的推理能力,所能提供的洞見仍相當有限。我們提出 RoboSPA(Robot Spatial-Procedural Assessment),一個大規模機器人操控資料集與基準,用於診斷 VLA 模型中的具身推理。RoboSPA 聚焦於兩個核心面向:細粒度空間推理與長時程程序規劃,涵蓋 10 個任務類別與 56 個基礎任務。每個任務皆實例化為五個難度等級,產生 280 個變體,其空間模糊性與程序複雜度逐步提高。我們收集了橫跨多種具身形態與多樣場景的 527K 條軌跡。除了二元成功率之外,RoboSPA 亦引入診斷性指標,以進行更細緻的評估。對代表性 VLA 模型進行的實驗顯示,現有系統仍在複雜空間關係、精確低階執行與記憶密集型規劃方面面臨困難。這些結果確立 RoboSPA 作為一個具挑戰性的診斷基準,可用於開發能力更強、更可靠且更具泛化性的具身代理。我們的資料與程式碼可在 https://github.com/fanzhenxuan/RoboSPA 取得。
我們研究使用人形機器人在雜亂室內環境中導航的問題。與將導航建模為二維路徑規劃問題的傳統方法不同,人形機器人在雜亂環境中的穿越需要持續的幾何感知全身適應,包括協調的手臂放置、軀幹調整和步態調變,以在複雜的三維空間中進行無碰撞移動。我們介紹了 TANGO,這是第一個用於在雜亂環境中進行語言條件人形穿越的全身視覺語言導航框架。給定自然語言指令和以自我為中心的RGB觀測,TANGO 直接預測 29 自由度關節空間動作,用於下游全身控制。我們完全在模擬中訓練 TANGO,通過全局路徑規劃、運動學全身運動生成、障礙物感知運動編輯和基於強化學習的追蹤來合成多樣化的無碰撞穿越行為。該流程為學習語言條件全身策略提供了動態可行的動作監督。在大量的模擬實驗中,TANGO 在視覺語言導航中展示了最先進的性能,同時在需要越障的挑戰性場景中導航時優於強大的模組化基線。最後,我們將 TANGO 零樣本部署在 Unitree G1 人形機器人上,並在雜亂的真實世界場景中觀察到穩健的語言引導穿越,而無需在任何真實世界導航數據上進行訓練。
我們提出一份連續、群體規模的測量紀錄,記錄自主語言模型交易代理在生產環境中的運作,涵蓋兩個具有同一設計血統的系統:DX Terminal Pro(3,505 個使用者出資金庫,於 2026 年 2 月至 3 月的 21 天期間在 Base 迷因幣市場交易真實 ETH)以及 DXAP 實盤 alpha 艦隊(全歷史 500 至 599 個使用者建立的代理,91 至 117 個同時活躍,交易 Hyperliquid 永續合約,2026 年 6 月至 8 月)。此紀錄橫跨約六個月、750 萬次單一模型呼叫,其中約 30 萬次鏈上操作,另有 231,638 個多工具回合,產生 14,596 筆成交。本文的核心為四項發現。第一,操作層對行為的決定程度高於策略文本中所寫的任何內容:風險滑桿可解釋槓桿(每級 +0.425),代理固定效應吸收 60% 的變異,而排行榜渲染邊界會因果性地引導選擇(前三名切點處的迴歸不連續為 1.75 倍)。第二,部位規模設定對波動率視而不見:在每一個波動率六分位中,槓桿中位數都是 5.0 倍,而單一姿態滑桿格(占部位簿 11%)就承受了 62% 的清算。第三,代理幾乎未捕捉到它們曾觸及的上漲空間:43.2% 的部位在 24 小時內曾出現至少 +300 個基點的有利偏移,然而其中 49.3% 以負交易報酬平倉;機械式括號單可為每個部位挽回 +39.0 個基點。第四,兩支艦隊皆未展現方向性優勢。DXAP 艦隊並不獲利,且落後於配對的 Hyperliquid 散戶基準(來回交易勝率 41% 對 50%)。在 416 個擷取的生產情境上,前沿模型的配對重播競賽發現,在此時間範圍內決策品質在統計上無法區分,而選擇穩定性在不同模型家族之間差異顯著。每一項主要結果都經得起按日分群的推論、置換虛無檢定,以及共同費用重述;本文最後以一套 17 條規則的方法學正典作結,那是以我們自身的撤稿換來的。
基於擴散模型的方法可實現單目幾何估計,然而其像素空間精度受到一個共同且研究不足的誤差來源所限制:VAE 重建退化。VAE 編碼器-解碼器中的 8 倍空間壓縮會使物件邊界處的表面法線退化;即使僅將真值法線編碼再解碼,也會引入 1.3–8.5° 的平均角度誤差(MAE),而邊緣 MAE 更達全域 MAE 的 2.8 倍。我們提出 TransNormal-2,一個基於 FLUX.2 的修正流框架,具備單步確定性推論,能在 VAE 解碼器的前後兩端處理此退化:一是在訓練期間如何監督潛在預測,二是在推論時如何修正解碼後的法線。首先,幾何感知的像素空間損失,包括逆渲染自一致性、von Mises-Fisher 角度損失,以及小波邊緣感知正則化,透過在 VAE 解碼後強制球面法線幾何與漫反射成像線索,補足潛在 MSE。其次,輕量級幾何精煉模組(GRM)施加 RGB 引導的殘差修正,以降低邊界局部化的解碼誤差,同時不任意重寫粗略預測。在一般場景基準上,TransNormal-2 在所有八項報告指標上達到或超越 MoGe-2,同時僅使用相當於其 1.4% 的任務特定法線標註。對透明物體的增益最為明顯,相較於最強先前基線,在 ClearGrasp 上將 MAE 降低 4.2°,在 ClearPose 上降低 3.1°。程式碼將於 https://longxiang-ai.github.io/TransNormal-2 發布。
影片基礎模型日益依賴大規模預訓練資料,然而其背後的端到端資料管線大多仍封閉,且難以檢視或重複使用。研究人員若想了解影片資料配方如何影響模型預訓練,往往需要先建立大量基礎設施,才能測試即使只是聚焦的假設。我們提出 VIDAFORGE,一套開放研究基礎設施,將影片資料配方表示為從原始影片到訓練資料集的可執行五階段工作流程。此工作流程中的一項決策可以改變,以建構替代資料集,同時保留每個樣本是如何產生的。為了展示此研究流程,我們在 Wan 2.1 與 V-JEPA 2.1 的早期從頭預訓練中,比較具有不同覆蓋範圍與品質的資料配方。在兩種學習目標上,覆蓋範圍較廣的配方取得最高的下游基準分數,而基於損失的評估則偏好不同的配方。本研究展示 VIDAFORGE 如何將資料配方選擇與下游模型效能連結起來。我們進一步釋出 VIDAFORGE-3M,包含 314 萬個場景級片段,總計 6,475 小時,並附有細粒度標註與策展訊號,供影片資料配方研究使用。
機器人基礎模型主要以英文訓練與評估,且大多數語言並不存在機器人示範語料庫。我們研究在一個開放式視覺-語言-動作堆疊中加入希臘語,並且僅使用機器改寫的指令,不改變架構。主要挑戰在於量測,而非翻譯。數種看似可行的工具會產生錯誤結論:色彩直方圖指標會獎勵雜訊;單一目標基準在正確希臘語下得分 84.6%,在刻意錯誤的指令下得分 82.6%;訓練損失無法預測希臘語的成功表現;單次執行比較則受隨機種子變異主導。在一套具區辨力的九十項任務套件中,每個實驗組別使用三個隨機種子,未使用希臘語示範的多語言文字塔仍停留在其錯誤指令下限,而僅以希臘語訓練最多僅超越其對照組 2.7 個百分點。雙語訓練則相較其對照組呈現一致的 6.7 至 7.1 個百分點領先幅度,並達到約英文表現的五分之二。此策略也會過度擬合翻譯器的措辭;每項任務以七種措辭訓練,約可將此效能懲罰減半。從語言調適過的世界模型進行暖啟動,以及解凍文字塔,兩者都會降低效能。結果支持低資源機器人策略在地化的兩項實務要求:在信任某項指標之前,先建立一個有保證的無效基準;並跨隨機種子重複驗證低資源語言的結果。
生成長篇多鏡頭影片需要鏡頭內運動的連貫性,以及跨鏡頭視覺一致的敘事。現有影片生成器偏好連續運動,且當整段敘事被壓縮於單一時間軸時,難以呈現完整的鏡頭集合。我們提出 MovieGrid,一種多網格後訓練範式,將長影片分解為較短、依時間排序的區塊,並將其排列於空間網格上以進行聯合建模。此設計減少了每條時間軸所需處理的鏡頭數量,同時促成跨區塊的全域資訊交換。我們從 1,000 部長篇影片建構 Multi-Grid Long Video (MGLV) 資料集,流程包括來源影片收集、階層式分割、網格影片建構,以及角色感知故事標註,產出 54K 部網格影片並搭配故事提示。我們的 Noise-Free Random-Grid Training 保留隨機子集的區塊作為乾淨視覺上下文,用以對其餘區塊去噪。Grid Embedding 編碼網格結構,角色感知 Story Prompts 連結重複出現的實體,而 Grid Boundary Loss 穩定佈局。在相同 token 預算下,MovieGrid 在 1,616 幀影片中生成的鏡頭數是 Temporal Packing 的 6.05 倍。在涵蓋五個真實世界類別的基準上,它達到最先進的鏡頭內一致性(0.9131,相較 HoloCine 的 0.8086)與鏡頭間一致性(0.5914,相較 StoryMem 的 0.5384)。MovieGrid 可透過單次或多次生成,以最小犧牲進一步擴展影片長度。
全雙工口語語言模型能夠同時聆聽與說話,使其得以處理人類對話中的打斷與回饋訊號。然而,文字生成、語音合成與音訊播放係以非同步方式進行。因此,模型自認為已經說出的內容,可能與實際播放給使用者的內容不一致。我們將在從中斷中恢復時仍能掌握模型實際已播放語音的問題,稱為錨定中斷。為解決此問題,我們提出 Self-Listening(自聆聽),一種全雙工建模方法,將使用者語音、模型文字與模型已播放語音交錯處理。透過將已實際播放的語音輸出作為輸入串流回饋給模型,自聆聽使中斷恢復奠基於使用者實際聽到的內容。我們進一步提出 AnchorSpeech,一個具有同質訓練與測試分割的資料集,用於追蹤結構化有序回應中哪些項目實際上已被說出。AnchorSpeech-test 評估模型是否能以中斷前最後完成的項目為依據,做出一致的回應。實驗顯示,與全雙工基線相比,配備自聆聽機制的模型能達到更佳的錨定效能。
準確地從單目影片估計具臨床意義的步態參數,對於可擴展的行動能力評估至關重要,然而現有資料集的規模小、視角受限及視覺多樣性有限,限制了進展。我們提出 SynthGait-19k,一個具物理基礎的合成影片資料集,包含 19,272 段步行影片,衍生自涵蓋 437 位受試者的 6,427 段動作捕捉序列,並配對 SMPL 動作與六項步態參數標註。為建構此資料集,我們開發 Gait2Vid,其透過 SMPL 統一異質動作捕捉記錄,並在可控視角與場景外觀下合成多樣化的 RGB 步行影片。我們評估生成影片與其條件步態運動學的一致性,並以測力板量測驗證所擷取的步態事件。使用 SynthGait-19K,我們對直接 RGB、基於姿態、生物力學及人體網格重建方法進行基準測試,並分析視角、訓練資料規模及合成至真實的領域偏移。我們亦提出 GaitXFormer,作為估計步態參數的直接 RGB 參考模型。無論在 GaitXFormer 或基於姿態的架構上,合成監督皆能有效遷移至真實影片,展現其在不同表徵上的實用性。我們進一步發現,空間步態參數對視覺領域偏移更為敏感,且單獨改善 HMR 重建不一定能轉化為更佳的下游步態估計。
壓縮大規模神經網路對於在資源受限裝置上部署模型至關重要。大多數現有方法分別採用權重剪枝或低位元量化,往往為了保持可接受的效能下降幅度,而導致壓縮率不理想。我們提出一個透過貝氏變分學習(\method)同時進行剪枝與低位元量化的統一框架,該框架在維持相當效能的同時,達到比先前基線更高的壓縮率。其關鍵概念是採用 spike-and-slab 先驗來誘導稀疏性,並使用高斯混合模型(GMMs)對量化權重建模,以實現低位元精度。由於結合 spike-and-slab 先驗與 GMMs 的目標函數難以計算,我們推導出一種高效近似,使有效壓縮得以實現,並將準確率損失降至最低。在理論上,我們為所提出用於稀疏且量化深度神經網路的變分方法提供了一致性結果。在壓縮 ResNet、BERT-base、Llama3.2 與 Qwen2.5 模型上的廣泛實驗顯示,我們的方法在效能下降幅度相當的情況下,達到比一系列現有方法更高的壓縮率。專案頁面:https://comeusr.github.io/SQS_Webpage。
模型未對齊、提示注入或操作者濫用,可能導致操作前沿實驗室帳號的 AI 代理外洩模型權重、毒化訓練資料,或削弱發布閘門。現有基準並未測試防禦者能否在有限審查預算下,於日常工作之中偵測到此類活動。我們提出 MOLE,一個開放基準,涵蓋 150 個由 AI 操作、在 30 個工作日內共用 9 項具狀態服務的帳號,並包含 12 種威脅,以及來自四個模型、總計約 200 億個符元的 8 個語料庫。在 39 個代理模型中,有 72% 完成大多數被指派的有害目標,且代理拒答無法預測是否完成。MOLE 能比較 40 個監控器在語料生成器、可觀測性層級與威脅上的表現;在我們的單日稽核事件比較中,即便是表現最佳的受評監控器,仍漏掉近半數已完成的危害。MOLE 亦能用於監控器開發:基準引導式搜尋可將中階監控器提升 49–64%,而在可比的模擬成本下,選擇性使用較強監控器相較於將其套用於每個帳號日,可將 budget-AUC 提升 10%。
我們提出 Cadence,一款用於數值時間序列的誤差有界有損壓縮器,將 3.3 億參數的時間序列基礎模型(Google TimesFM-3)與自適應算術編碼器配對,並保證每個樣本滿足 |x_t-x_t|≤τ。一項負面結果限制了設計空間:對於無損編碼,基礎模型毫無價值,因為節省的位元數與預測器準確度呈對數關係,Δb=log_2(MAE_{old}/MAE_{new})。因此,TimesFM-3 相較於 32 抽頭線性預測器所擁有的 1.51 倍優勢,僅換得 20.28 位元中的 0.60 位元,中位數增益為 +0.03%。誤差有界編碼在一點上擺脫了此限制:一旦預測落於誤差帶內,殘差索引即為零,樣本幾乎免費。Cadence 的貢獻包括:(1)具上下文建模二值化的自適應範圍編碼器,在真實索引上以 9.7%(15/15)勝過 xz/zstd,並推翻了一項來自通用後端的發現;(2)一項確定性結果——預測在不同批次大小下並非位元完全一致,且沒有任何 PyTorch 組態能修復此問題,迫使將群組大小與執行裝置寫入容器格式;以及(3)在晚於任何合理訓練截止點的語料庫上進行領域局部化。 在 49 條 EIA-930 平衡機構需求序列(2026)上,Cadence 相較於六種經典預測器中的最佳者提升 13.3%;在 50 條 MTA 載客量序列(2026)上提升 28.3%:在 297 個序列-容差配對上中位數為 21.4%,且全數 297 個勝出。相對於時間序列資料庫為保留資料所部署的降採樣,在相同大小下,其保證的最壞情況誤差縮小 28--56 倍。端到端而言,一旦支付了上下文自舉成本,增益從六個月每小時資料的 6.8% 到漸近的 15.1%。嘗試在 SDRBench 上否證領域主張時,理論預測會失敗,而結果正是如此:中位數 -0.8%,27 個配對中 0 個獲得增益。另外三項負面結果與八項撤回的主張均有完整報告。
Transformer 模型可以在其殘差流中,於某個深度使某項屬性可被線性解碼,而在該深度這項屬性尚未影響輸出。這種資訊可被讀取的位置與其被使用的位置之間的落差,已在直接陳述於輸入中的屬性上獲得證實。我們探問此落差是否也適用於模型必須在對話中逐步推論的屬性,也就是其對話夥伴有多專業。我們使用 ExpertCollab——一個由模型扮演四種專業程度角色之間多輪研究規劃對話所構成的語料庫——發現夥伴專業程度在早期層最容易解碼,並在網路中點之前降至接近隨機水準。反事實修補顯示,在可解碼性高峰層注入專業程度差異,幾乎不改變固定的後層讀出;然而,同樣的差異若在中點之後注入,則幾乎完全傳播,兩者差距超過一個數量級。內容匹配的隨機對照與無探針診斷將此轉折定位在同一早期層,而一個靜態指定的控制屬性則全程保持可解碼。因此,一項被推論出的關係屬性會在其開始具因果作用之前許久便已被表徵,這界定了任何試圖讀出或引導以夥伴為條件之行為的介入必須落在何處。我們僅以單一模型在合成語料庫上作為初步展示。
在本文中,我們提出 ReactVAU,一個用於即時串流視訊異常理解(VAU)的慢-快解耦框架。現有 VAU 方法依賴使用全域時間取樣的離線推論,這違反因果性,並且阻礙其在即時監控串流中的部署。相反地,通用串流視訊模型滿足因果存取,但在記憶壓縮過程中會稀釋罕見的瞬態異常,並且經常在長時間正常區間內均勻地呼叫重量級 MLLM。ReactVAU 透過三個協同組件來填補此缺口:一個基於空間網格摺疊(SGF)的輕量級快速偵測模組,用於持續異常過濾;一個異常感知持久記憶(AAPM),用於保護關鍵視覺線索免於時間衰減;以及一個重量級慢速推理模組,其在正常串流期間保持休眠,僅由可疑事件喚醒以進行語意驗證與因果描述。在多個基準上的大量實驗顯示,ReactVAU 在嚴格串流限制下運作,同時在異常偵測與因果推理方面均達到具競爭力的效能,並透過最小化重量級 MLLM 呼叫顯著提升計算效率。專案頁面位於 https://huiyuiui.github.io/React_VAU/
日益逼真的被操控與生成人臉及其易取得性,威脅了數位媒體的可信度。為偵測此類偽造,基於視覺基礎模型的深度偽造偵測器已展現出令人期待的效能,但其通常依賴單一預訓練表徵,且易於過擬合特定訓練分布。為提升對未見偽造的泛化能力,我們提出 UCF-Net,一種不確定性感知級聯融合網路,利用 CLIP 的語言對齊語意先驗與 DINO 的自監督視覺結構先驗。UCF-Net 擷取跨 Transformer 深度的階層式特徵,使用逐層專家聚合以自適應地結合各編碼器的多層級線索,並根據熵推導出的不確定性對所得表徵進行加權融合。我們進一步將公開深度偽造資料集彙整為約 400 萬張影像的統一基準,並建立一個獨立的跨生成器評估集,內含來自八個近期生成器的超過 8,000 張人臉影像。在統一基準上,UCF-Net 於域內與跨域評估中,在受評估方法間取得最佳平均 AUC。在跨生成器集合上,其能以有限的目標域資料有效適應,儘管零樣本遷移仍具挑戰性。
大型語言模型常會回答結構上無法回答的問題,例如計算 cot(-540°) 或評估 (1).startswith("1"),而非棄答。我們探問此失敗反映的是缺少辨識,還是從辨識到棄答的路由失敗。在從 1.7B 到 70B 參數的指令微調模型中,隱藏狀態中的單一線性方向可區分可回答與結構上不可能的數學及程式碼提示,顯示模型在生成前即表徵了不可能性。然而,此辨識方向與中介經訓練習得的有害內容拒絕之典型安全拒絕方向幾乎正交。一個領域內、以行為定義的無效性感知方向更接近辨識,但僅與其部分對齊,且仍與安全拒絕近乎正交。在生成時沿著辨識方向進行引導,會在結構性數學與程式碼單元上雙向且呈劑量反應地改變無效性感知行為,而隨機方向則不會。基礎/指令模型比較進一步顯示,低餘弦幾何早已存在於預訓練終點。因此,對不可能問題表現自信的失敗,更適合解釋為路由失敗而非編碼失敗:模型具有可用的「無可接受答案」訊號,但安全拒絕路徑並未對齊以使用它。
思維鏈(Chain-of-Thought, CoT)提升大型語言模型(Large Language Models, LLMs)的推理能力,但會帶來可觀的計算與上下文成本。現有方法不是透過硬剪枝流失中間資訊,就是缺乏連續壓縮的原則性準則。我們提出 A*-Thought-V2,一個由 LLM 幾何動力學引導的框架,將 CoT 建模為隱藏狀態軌跡,並以顯式-隱式交錯的潛在架構取代硬刪除。將問題、步驟與解答表徵投影到三維 PCA 空間後,該框架衡量每個局部轉移與全域問題到解答方向之間的對齊程度。對齊的步驟保留為顯式文字,而偏離的步驟則壓縮為連續潛在符元。方向角同時捕捉局部語義與推理動態:小角度表示直接執行與答案形成,而大角度更常涉及檢查、修正與分支探索;其時間變化揭示探索、收斂與精煉階段。為訓練此架構,我們引入逐步嵌入強制,將每個冗餘步驟池化為單一潛在嵌入,以及標籤強制,以軟性多峰詞彙分布監督該潛在符元,而非硬性獨熱標籤。在 Qwen3.5-9B 與 Qwen3.6-27B 上、跨越六個域內與域外基準測試的實驗顯示,A*-Thought-V2 將平均準確率最多提升 2.6%,同時將回應長度最多縮減一半,使每計算單位準確率提升至 2.29 倍,並分別將預處理與訓練時間減少 94.6% 與最多 80.3%。表徵分析顯示,潛在狀態形成一個與文字狀態不同的緊湊區域,而潛在符元位置較高的熵則反映更廣泛的軟目標,鼓勵更豐富的步驟級特徵學習。
多模態大型語言模型(MLLMs)在視覺問答等一般視覺理解任務上表現強勁,卻常在基本的比較能力上受挫:辨識兩張相似影像之間有何變更。我們提出 VDiff-Bench,一個具挑戰性的選擇題基準,用於細粒度影像差異辨識。VDiff-Bench 包含 1,756 道基於影像對的四選一題目,涵蓋 10 個變更類別:位置、運動、區域影像色彩、整體影像色彩、出現/消失、雜訊/解析度、紋理、替換/尺寸、OCR/文字,以及光照。每道題對應兩張輸入影像,並有 4 個選項:真實差異、兩個困難負面描述,以及一個「無差異」干擾項。為使任務具挑戰性,我們特別策劃以真實答案為條件的負例,要求模型區分實際變更與鄰近的語意替代描述。使用 11 個最先進的開源與閉源 MLLMs 進行的實驗顯示,細粒度視覺比較仍然脆弱:模型在不同來源與變更類別上的表現不均,且在雜訊與紋理等細微低階變更上持續失敗。例如,三個 7-8B 規模的開源 MLLMs 在語意變更上得分 52.5-70.6%,但在雜訊與紋理等低階變更上僅有 8.7-33.3%,錯誤地假定兩張輸入影像之間沒有變更。令人驚訝的是,儘管其他閉源商業模型表現強勁,Grok 4.3 在辨識影像間雜訊與紋理差異時展現顯著的效能下降,明顯落後於 Kimi K2.5 與 K3 等大型開源模型。總體而言,VDiff-Bench 為評估 MLLMs 的比較式視覺理解提供了針對性的診斷工具,揭示標準單影像視覺語言任務未能捕捉的失敗。
影像重照明傳統上是透過複雜的逆向渲染管線來處理,而這些管線會遭遇不適定最佳化問題;或是透過單張影像生成模型來處理,而這類模型忽略了理解 3D 幾何與材質交互作用所需的關鍵多視角線索。為了解決這些限制,我們提出一個前饋式生成 Transformer,用於直接的單視角與多視角影像重照明,且完全繞過顯式內在屬性估計。我們的架構改編自視訊基礎模型,具備一個潛在照明模組,可透過交叉注意力將目標環境圖動態注入空間特徵中。此外,我們採用置換不變的位置編碼,以對稱地處理無序的多視角輸入,而不產生序列偏誤。為了訓練這個穩健的資料驅動模型,我們建構了大規模的 Laval Objaverse 資料集(LOD),其中包含 9 萬個物件與 3.9 萬種獨特照明。廣泛的實驗證明其具備最先進的視覺品質、照片擬真的重照明品質,以及在單視角、多視角與新視角重照明任務上強大的零樣本泛化能力。
人類只需研讀少數幾本寫得好的教科書,就能精通一門學科並嘗試解決其最難的問題。我們主張,理想的自我進化方法應具備相同性質,也就是能自主從原始訓練材料中學習,以獲得可遷移的解題能力。然而,我們仍缺乏對其的直接量測。我們提出 StudyBench,一個受控的物理基準測試,直接量測自我進化方法將訓練材料轉換為能力的效率。我們將測試集組織為應用集與遷移集:應用集由困難的教科書問題組成,用以評估吸收能力;遷移集由奧林匹亞層級問題組成,用以評估遷移能力。我們在三個基礎模型上對具代表性的自我進化方法進行基準測試,發現應用集上的改進很少能轉移到更難的遷移集。一項引導消融實驗揭示出引導落差:即使是最強的方法,也只能彌補相同材料以情境內引導方式提供時所能解鎖之效能提升的一小部分。此外,每種方法都會遇到計算高原,在遠未耗盡其計算預算之前便已飽和。因此,剩餘落差是方法問題,而非資料或計算問題。透過提供乾淨且受控的基準測試,StudyBench 將自我進化的進展從開放式探索轉變為未來研究可衡量的目標。我們的程式碼已發布於 https://github.com/thunlp/StudyBench。
醫療照護數位化已產生病患一生中龐大、縱貫性且多模態的病患紀錄,然而,充分運用這些資料以表徵並預測病患狀態軌跡仍是一項關鍵挑戰。當前人工智慧模型往往難以捕捉真實世界多模態病患資料中複雜、不規則的時間動態及固有隨機性。現有針對縱貫性病患紀錄建模的人工智慧方法主要為判別式,僅限於少數模態,受封閉式類別詞彙所限,將時間視為單調歸納偏誤,或其預測未來病患狀態的能力有限。我們提出 NOAH,一個時間感知、任務無關的生成式 Transformer 模型,用以表徵並預測完整的多模態病患歷程。NOAH 具備新穎的雙向時間整合與變分潛在空間,以捕捉病患狀態的連續演變及臨床軌跡的隨機性。NOAH 建構自橫跨 MIMIC 資料集家族、來自 299,000 名病患 431,000 次住院的超過 5.59 億筆臨床事件,能原生處理醫學影像、時間序列與數值訊號、類別事件,以及結構化與非結構化臨床紀錄。NOAH 是該領域首個真正整體性的生成式模型,能進行具可選時間控制的自迴歸預測、零樣本分類與反事實介入模擬。它產生具高度資訊量與預測力的病患狀態表徵,在探測臨床結果、15 個 ICD 章節與 29 種共病,以及事件發生時間預測上展現優異效能。無縫處理多元模態與複雜時間動態,NOAH 為個人化臨床照護與數位醫療中的智慧預測系統提供多用途、任務無關且可擴展的基礎。
現代基於 LLM 的代理透過由工具、可重用技能和專業代理組成的框架運作,該框架塑造了它們所觀察到的內容以及它們能做的事。在實務中,隨著新能力的加入,這個框架會不斷演變。我們提出 EVOHARNESSBENCH,一個用於在受控框架演化下評估代理的基準測試,涵蓋三個軸線(工具、技能和代理)。與現有的代理持續學習基準測試不同,後者通常將非平穩性(即隨時間變化的內容)置於任務流中,同時保持框架固定不變,而 EVOHARNESSBENCH 將非平穩性置於外部提供的框架本身。它包含 17 個多階段框架流,由基於驗證器的基準測試確定性地構建而成,包含 802 個任務、520 個工具、42 項技能和 62 個代理。我們評估了兩種互補的設定,對應於框架演化的核心挑戰:部署評估,其隔離出隨著框架擴展時先前可存取能力的保留情況;以及自我演化適應評估,其測試累積經驗在新能力引入時是否仍然有用。我們的結果揭示了三個持續存在的差距。首先,僅框架擴展本身就可能降低先前已解決任務的效能,產生框架引發的遺忘。其次,自我演化適應所帶來的收益在框架演化的不同階段、能力軸線和環境中仍然不一致。第三,保留與適應可能朝不同方向拉扯:保留早期能力不一定能改善對新引入能力的適應,反之亦然。這些結果確立了框架演化為一項獨特的挑戰,對於構建能夠跟上不斷演變的框架、同時保留先前有效行為的代理而言。
代理能將共享基礎設施變成協同入侵的管道。Hugging Face 事件與另一項公開 wiki 調查顯示,為何安全評估可能需要來自多次執行及其留下產物的證據。我們主張,防禦的操作單位應是可修訂的協調事件,用以連結觀察到的傳輸、任務權限與回應歷程。核心研究問題是前瞻式事件發現:在評估者提供其成員身分之前,找出哪些行動屬於同一群組。我們相對於協作與委派權限政策來界定未經許可的協調,將以儲存為媒介的協調連結至共識主動性,並明確指出區分影響與共同原因所需的證據。首次接觸訊號是發現的一種可能輸入;該設計也追蹤繼承狀態與後續使用。一項提出的評估在匹配的審查成本與誤報工作量下,比較孤立行動、滾動視窗、已知群組與前瞻發現的事件。它衡量所有被指派群體執行中的有害結果,並檢驗通道關閉與狀態隔離後是否復發。一項經檢查碼驗證的公開 wiki 匯出重建,將留存寫入的下降與後續行政清理分開。本文的貢獻是以事件為基礎的論點、描述性分析與評估設計。它使跨執行監控的建議可被檢驗,而不宣稱提出新的偵測器或已測量的圍堵效益。
我們提出「RenderFormer-V2」,一個統一的、基於學習式 Transformer 的神經渲染模型,可與現代基於物理的渲染系統互補;無需逐場景訓練或專用程式碼,即可處理多樣的光傳輸效應,例如焦散、體積散射、環境光照、具紋理與置換的表面,以及分佈外材質。RenderFormer-V2 將全域光傳輸建模為序列到序列轉換。承襲其前代模型,RenderFormer-V2 亦採用兩階段流程:一個視點無關階段,用於解算場景內基元對基元傳輸;以及一個視點相關階段,將內部神經場景表徵轉換為影像像素。與 RenderFormer 不同的是,我們的模型在視點無關階段採用一種新穎的機制,結合視窗化注意力與受渲染啟發的注意力匯點,以提升可擴展性,同時維持渲染準確度。為了進一步提升多功能性,RenderFormer-V2 支援異質場景基元,包括環境貼圖與參與介質,並採用一種獨立於底層表面反射模型的材質編碼,該編碼透過新穎的神經嵌入來編碼材質外觀。我們在各種場景上展示 RenderFormer-V2 的多功能性,並對改良後的注意力機制進行廣泛的消融實驗。
我們研究一種受治理的企業分析方法:語言模型詮釋問題,而確定性策略則選擇並執行預先核准的分析程序,該程序會回傳結果與證據。我們展示,此限制在界定的分析類別內仍可保有表達力,其使用關聯運算,加上聚合、比較、視窗、排序與相似度。固定的語意、策略、資料與執行規則也使結果可重播。在 440 次執行中,三個 8B 模型在執行時產生 SQL 並選擇工具,而 Qwen3-8B 僅詮釋意圖,並由策略執行已核准的程序。在 330 個執行時規劃回合中,沒有任何一個能在所有測試資料集上符合完整的答案與證據契約;受策略執行的分析器則在 110 個中符合 110 個。這是特定組態下的結果,並非執行時代理在其他設計下無法成功的證據。
我們提出圖機器(Graph Machine,GM),一種維護大小為 O(n) 的狀態、並透過稀疏且動態的路由存取該狀態的架構。不同於具有固定大小狀態或稀疏但靜態路由的方法,GM 在其稀疏層中保持 O(n) 複雜度,而不將可能可存取的狀態大小限制為 O(1)。相反地,GM 使用邊(edges)——類似指標的物件,這些物件透過類似指標追逐的參照機制以可微分方式更新。我們將 Qwen3-0.6B 中 75% 的稠密 Transformer 層替換為 GM 稀疏層,並從頭在 15.7B 個 token 上進行預訓練。在每個稀疏層中,每個 KV 頭僅檢索 4,096 個 token 中的 2 個時,損失僅略微退化;檢索 4 個時,最佳模型的損失略有改善。
指令引導的3D編輯對於互動式內容創作至關重要,然而它面臨一個重大瓶頸:高品質成對訓練資料的嚴重匱乏。現有方法試圖透過依賴緩慢的測試時優化,或是在透過複雜流程建構的偽成對資料上進行訓練來繞過此問題,但這些方法往往會引入結構漂移與幾何偽影。在本文中,我們提出一個新穎框架,透過生成先驗蒸餾,學習無需成對3D監督的前饋式3D編輯。我們的核心概念並非依賴真實標註的3D成對資料,而是將來自強大基礎模型的視覺、語義與幾何知識直接蒸餾到3D編輯模型中。具體而言,我們透過可微分渲染管線,使用兩個互補訊號來監督3D表徵:一個是在主編輯視角來自影像編輯模型的2D視覺先驗,另一個是在新視角來自視覺-語言模型的語義先驗,以確保嚴格遵循指令與來源身份保留。至關重要的是,為了解決2D投影監督固有的幾何崩潰與多視角不一致性,我們引入3D感知的分布匹配正則化。此項作為幾何先驗,作用於3D潛在空間,約束編輯輸出保持在由預訓練的影像到3D教師模型所定義的真實3D資產流形內。大量實驗證明,我們的方法達到優異的指令保真度與跨視角一致性,顯著優於最先進的基線方法。我們的專案位於:https://github.com/thiamine128/PriorEdit3D。