每日精選AI研究論文及翻譯
大規模模型訓練的優化器選擇已成為一項系統層級的設計決策,受到計算資源、記憶體、調校預算及任務多樣性的共同約束,然而現有上百種方法仍顯得零散混亂。為此,我們提出 OmniOpt,為研究社群提供一份統整的優化器調查與基準食譜。OmniOpt 奠基於四個相互耦合的組件:第一,我們將每一種優化器更新視為透過五階段元管線進行的結構化轉換,並顯示多數方法僅涉及其中一至兩個階段;第二,我們利用範數約束的線性最小化預測器(LMO)來統一不同優化器;第三,這兩個觀點構成一個雙維度分類體系,一維將每種方法歸入機制家族,另一維記錄其欲改善的可量化訓練目標;第四,也是本文的核心,我們將完整的分類體系實例化為一個統一的跨領域基準,涵蓋代表性優化器、模型規模以及從語言模型預訓練到影像分類等訓練場景,系統性地分析各方法家族在多種效果目標上的表現,並揭示其取捨。OmniOpt 因此為研究社群提供了一個在明確機制與目標假設下選擇優化器的操作座標系,並為優化器社群的未來發展指引方向。
多模態基礎模型與智能體系統的最新進展,已將GUI代理從單一平台的任務執行推向跨平台互動。然而,構建多平台GUI代理仍然充滿挑戰。一方面,高質量且可執行的跨平台互動軌跡仍然稀缺,現有數據常受限於平台覆蓋範圍不足。另一方面,不同平台展現出截然不同的互動規範,使得聯合訓練或持續訓練容易出現行為模式混淆、特定平台能力衰退以及災難性遺忘等問題。為應對這些挑戰,我們構建了Uni-GUI,一個高品質的跨平台GUI互動資料集,並提出UI-MOPD——首個將多教師同策略蒸餾整合至GUI代理持續學習的方法。UI-MOPD能根據當前環境動態選擇平台專屬教師,並透過平台條件蒸餾將平台特定的行為先驗轉移至共享策略,從而在保留既有平台能力的同時,實現對新平台的適應。在OSWorld與MobileWorld上的實驗結果顯示,UI-MOPD分別達成了38.2%與12.0%的任務成功率,證明了其在跨平台能力保留與新平台適應之間的平衡效果。 專案頁面:https://elispectre.github.io/UI-MOPD/ 。
研究傳播——將論文轉化為海報、演講影片和部落格文章——仍然是一個需要手動處理的「最後一里路」。過去的自動化方法將每項產出視為獨立作業,各自從頭開始重新提取論文內容,通常產出單向渲染的結果,作者無法在PowerPoint或Word中重新開啟,而且品質受到軟性視覺語言模型(VLM)偏好評分的限制,這些評分在關鍵章節仍顯得空洞時便已停滯不前。我們認為,這最後一里路最適合以技能組合的方式建構:透過精簡的、可被AI代理讀取的合約,共享同一個上游提取器,並在一個可測量填充的迴圈中包裹確定性基本元件,其退出點是嚴格的「通過/失敗」渲染關卡。我們將此構想具體化為ResearchStudio-Reel:由五項Claude Code與Codex技能組成,組織為一個共享提取器(Paper2Assets)、三個可編輯生成器(Paper2Poster、Paper2Video、Paper2Blog),以及一個互動式收斂層(Paper2Reel)。Paper2Assets將每篇論文提取一次,產生一個可被所有下游技能重複使用的共享捆綁包;三個生成器分別產出可印刷的海報、同步的演講影片,以及中英雙語的部落格文章,內容保持一致且可透過PowerPoint或Word進行來回編輯;Paper2Reel則將三者整合為一個自包含的HTML檢視器,當使用者點擊某個章節時,會同步跳轉至影片、投影片、字幕和部落格的對應內容。在Paper2Poster基準測試中,我們的海報在每項美學與資訊子指標上,不僅優於先前的自動化系統,也勝過一次性生成的前沿大型語言模型(LLM);在兩位獨立視覺語言模型評審的評估下,我們的海報甚至超越原作者自行設計的版本,在84%至93%的論文上獲得整體勝出。能力審查進一步顯示,由於獨特地將與敘述對齊的投影片重點標示,以及透過版面感知的DOCX修復機制所產生的雙語部落格相結合,ResearchStudio-Reel是唯一能同時產出三項可編輯成果的完整管線。專案網址:https://aka.ms/ResearchStudio
3D重建與生成通常由不同的範疇處理:基於像素的回歸用於重建,潛在擴散用於生成。近期研究嘗試在潛在空間中統一兩者,但存在明顯缺點:擴散目標定義於潛在特徵而非底層3D表示,且兩個分支均受潛在編碼引入的資訊損失影響,同時需依賴預訓練的變分自動編碼器(VAE)或表示自動編碼器(RAE)。本文將這兩項任務重新架構於統一的像素空間擴散範疇,提出PixWorld——一個同時處理3D重建與生成的單一模型。透過直接在渲染影像上監督擴散,PixWorld消除了上述限制,並使優化與3D場景保真度對齊。除了在2D影像層級運作且缺乏3D幾何感知的光度與感知監督外,我們進一步引進幾何感知損失,將渲染視圖與其在預訓練3D基礎模型的幾何感知特徵空間中的真實標註對齊,提供3D結構監督。PixWorld持續優於先前的潛在空間生成方法,並可與最先進的重建方法匹敵,展現了統一像素空間方法的優越性。
大型語言模型讓研究構想的發想變得越來越容易,但有效的構想發展不僅僅是生成候選方向。研究人員必須將問題紮根於現有文獻,找出關鍵瓶頸,區別於現有解決方案,並在投入實作前評估風險。我們提出 ResearchStudio-Idea,作為一個可重複使用的技能套件,專門針對研究構想的起點里程。該套件包含 Paper-Search(一個獨立的多來源文獻搜尋技能)、Scoop-Check(一個獨立的既有成果碰撞檢查器,用於評估新穎性主張),以及 IdeaSpark(一個端到端的技能,結合了證據根基、模式引導生成、碰撞檢索、審計與構想卡片輸出於單一工作流程)。IdeaSpark 是基於 2021 至 2025 年間從 ICLR、ICML 與 NeurIPS 收集的 1,947 篇機器學習會議論文所建構,包含口頭報告論文、一個單獨追蹤的高引用子集,以及被拒稿的投稿。透過分析這些結果,我們歸納出 31 個反覆出現的構想子模式,並整合為 15 個可重複使用的構想模式。每個模式以結構化卡片的形式呈現,內容包括研究背景、瓶頸類型、差異化策略、支持的先例與常見失敗模式。給定一個研究問題與一組證據素材,IdeaSpark 會評估證據的完備性、重建周圍的研究背景、找出未解決的瓶頸、選擇相關模式、具體化一個候選方向、檢索可能衝突的既有研究,並執行以結果為導向的審計。這個工作流程將可重複使用的構想模式轉化為可追蹤的研究提案。透過盲審自動評判的評估結果顯示,IdeaSpark 持續產出比無技能及通用技能基準更強的研究提案,同時維持具競爭力的新穎性。
概念擦除旨在从表示中移除目标概念,同时保留其中编码的其他信息。这具有一定难度,因为表示编码了许多通常与擦除目标相关的概念,因此移除目标可能对这些概念造成损害。我们提出流形约束假说(MCH):若自然表示集中于结构化的低维流形,则干预应受限于该流形,从而在干预过程中更好地保留表示中编码的其他信息。我们将MCH实例化为一种新的概念擦除方法:流形感知概念擦除(MANCE)。MANCE利用预测目标概念的分类器提供的信号,对表示进行迭代更新。我们通过自然输入获得的表示估计流形,然后将概念移除的更新投影到估计的流形上。我们在涵盖文本和视觉的119个设置中进行了广泛评估,包括13个语言模型、三个NLP概念以及40个CelebA-CLIP属性。在先前方法之上应用MANCE始终取得了更好的泄露改善结果。我们还引入了MANCE+和MANCE++,它们在应用MANCE之前先使用封闭形式的擦除算法,相较于匹配的全空间更新,实现了更好的泄露-精准性权衡。我们的最佳方法MANCE++在非线性概念擦除上达到了最先进的结果。这些结果支持了擦除场景下的MCH:干预应受限于自然表示流形。
评估具身机器人基础模型仍是一个关键瓶颈:不同于可通过数字基准高效评估的大语言模型,机器人策略需要缓慢且成本高昂的真实世界部署,受限于硬件和人工监督——这推动了对世界模型作为代理策略评估器的兴趣,然而,使世界模型能够可靠进行策略评估的关键属性仍未被充分理解。本工作对用于机器人策略评估的世界模型进行了系统性研究,并引入了WMBench基准,该基准基于真实机器人遥操作数据及匹配的策略推演构建,涵盖多种操作任务,以实现跨模型家族、动作编码、推演时间范围和评估指标的受控比较。利用WMBench,我们分析了7个视频世界模型、4种动作表征方案,以及超过324,000次与真实机器人执行配对的模拟策略推演,并通过CVPR 2026 GigaBrain挑战赛的大规模社区提交、精心策展的合成轨迹以及超过12,000小时的训练视频进一步丰富了分析。我们的实验得出了三个核心见解:评估器质量主要取决于长周期、动作保真的推演一致性,而非短期视觉真实性;预训练的优势不仅来自数据规模,更源于通用世界知识与机器人特定可控性之间的平衡;而架构选择(包括动作编码、记忆设计和面向评估器的后训练)强烈决定了与真实机器人行为的一致性。基于这些结果,我们推导出实用设计路线图,并将其实现为GigaWorld-1——一个专为策略评估优化的世界模型,并完全公开了代码、模型、数据集和工具包,以推动具身基础模型的可扩展评估研究。
密集空間感知對物理智慧至關重要,視覺系統需從像素觀測中恢復結構化、公制且可操作的表徵。現代視覺基礎模型傾向於優先確保語義不變性,卻常以犧牲細緻空間理解為代價。本研究從邊界視角切入探討視覺預訓練,其核心假設在於:邊界與形狀不連續性能提供感知幾何屬性的關鍵線索。具體而言,我們提出遮罩邊界建模(Masked Boundary Modeling)——一種自我監督學習範式,透過動態學習次像素邊界表徵,並將此過程發現的邊界標記作為遮罩目標,促進密集視覺標記學習。透過擴展此框架,我們開發出LingBot-Vision,並以強基線DINOv3為對照,驗證其於多樣下游視覺任務中的效能。值得注意的是,LingBot-Vision推動了深度補償任務從LingBot-Depth 1.0到LingBot-Depth 2.0的躍進,從而實現增強的深度估計——此為具身人工智慧的關鍵支柱。我們的研究揭示:邊界建模不僅止於簡單線段,更能作為學習空間結構化視覺表徵的可擴展預訓練原則。
我們推出 Wan-Streamer v0.2,這是在即時串流、端到端影音互動模型上的延遲保持升級版本。v0.2 保留了 v0.1 的建模架構,但將互動輸出串流從 192x336 提升至 640x368,同時在 25 FPS 下維持約 200 毫秒的模型端訊號到訊號延遲。更高解析度的串流支援場景根基的中景代理,其在即時對話期間的姿態、視線、手勢、附近物體及局部場景佈局均保持清晰可辨。為支援更大的視覺串流而不增加用戶感知延遲,v0.2 保留了思考器作為單 GPU 低延遲路徑,負責串流感知、建立生成快取的短語言/狀態 Transformer 前向傳播,以及最終解碼。執行器則成為多 GPU 的 Ulysses 風格上下文並行群組,負責處理昂貴的下一個單元潛變量生成。每個執行器 rank 將傳入的 K/V 寫入預先分片的本地快取。長的高解析度潛在影片序列跨 rank 分片進行去噪,並透過 Ulysses 通訊聚合,而更短的音訊潛在序列則無需序列分片即可生成。在此拆分中,思考器的語言/狀態計算僅以 K/V 條件形式傳遞至執行器,因此執行器群組內部無需溝通單獨的語言序列。這使額外硬體集中於視覺生成,同時保持緊湊的思考器-執行器邊界,使得包含 350 毫秒雙向網路預算後的總遠端互動延遲約為 550 毫秒。
我們提出EVA-Client,這是一個開源框架,用於在真實機器人上部署、收集資料與評估訓練好的操作策略。EVA-Client 位於策略伺服器與實體硬體之間,將策略迭代循環中的真實機器人階段統一在單一程式碼庫中。它做出了三項貢獻:第一,一種組件解耦的架構,其中機器人後端、推理策略與傳輸中介層形成一個正交網格:新增機器人或策略只會影響其自身的層級。第二,透過「除錯(Debug)」、「收集(Collect)」與「評估(Eval)」工作流程實現可檢視的執行,模式從開環模擬到連續即時控制。第三,每次評估運行同時也是資料收集,會以訓練就緒的格式記錄完整的執行軌跡,並附帶詳盡的日誌與並排比較檢視器,因此每次評估都能為下一輪訓練提供資料,而非以未記錄的觀察結果告終。EVA-Client 進一步整合了主要的即時推理策略,包括同步與非同步執行、ACT 風格的時間集成(Temporal Ensembling)、即時分塊(Real-Time Chunking),以及一個簡單的非同步消融基線,全部透過單一配置介面管理。
机器人操控的统一模型旨在赋予单一策略以预训练视觉语言模型的语义先验,以及通过未来预测学习到的物理动力学。然而,现有设计在实践中往往会侵蚀预训练骨干网络的语义能力,导致异构目标之间的干扰,并在像素空间从头学习未来预测,从而未能充分利用预训练视频生成器的动力学先验。我们提出InternVLA-A1.5,该方法基于原生视觉语言模型骨干构建策略,使其持续在视觉问答和子任务预测上进行训练,并附加一个轻量化的统一专家模块用于连续动作生成。未来预测被重构为潜在查询问题:通过一组可学习的“前瞻令牌”,在冻结的预训练视频生成模型监督下,将任务相关的未来信息浓缩为紧凑的潜在编码,从而使策略继承世界模型的动力学先验,而无需学习像素级生成。推理阶段丢弃视频分支,保持实时控制能力。经过120万机器人交互片段和300万多模态样本的预训练,InternVLA-A1.5在全部六个模拟基准测试中取得最佳综合表现。在真实世界中,保留的语义能力在未见过的指令组合上展现最强的组合泛化性,而两项设计共同支撑了长时域任务的执行。
科學文獻搜尋往往不僅需要透過單一查詢來檢索論文:使用者的意圖往往不明確、依賴個人偏好,並在互動過程中不斷演變。現有的搜尋代理通常依賴固定流程或僅以隱性語言進行推理,導致其搜尋策略難以控制、檢視與調整。我們提出 PaperPilot,這是一個多輪文獻搜尋代理,將科學搜尋視為工作流程歸納。給定一篇錨定論文與使用者查詢後,PaperPilot 會建構一個可執行的論文搜尋運算子有向無環圖(DAG),包含關鍵字搜尋、引用擴展、篩選、評分、重新排序與證據提取。接著,使用者回饋被用來優化查詢內容與工作流程本身。我們透過監督式工作流程模仿與受控工作流程損壞下的偏好最佳化來訓練 PaperPilot。實驗結果顯示,在多輪互動情境下,PaperPilot-9B 相較於基礎的 Qwen3.5-9B 工具集代理,其 Hit@5 從 58.0 提升至 77.0,MRR 從 47.5 提升至 59.4,nDCG@10 從 26.8 提升至 32.5,同時工作流程執行錯誤率從 9.5% 降至 0%。這些結果表明,明確且可編輯的搜尋工作流程為將文獻搜尋代理與複雜的科學意圖對齊,提供了一個有效且可控的介面。
鍵值(KV)緩存增長是自迴歸解碼中的一個主要瓶頸,因為記憶體與頻寬會隨上下文長度線性擴展。現有的KV逐出方法通常依賴靜態啟發式或代理分數,這些方法難以追蹤未來標記的效用,一旦相關性發生變化,就會導致脆弱的逐出。為了解決此問題,我們引入了KVpop,它透過直接監督保留或丟棄決策,學習一種固定預算的KV逐出策略。該評分器針對一種新穎的未來注意力目標進行訓練,該目標可在不實體化密集注意力圖的情況下高效計算。我們進一步引入了一種基於延遲記憶的評分器,這在學習型逐出方法中獨樹一幟,它將評分推遲固定步數,以利用近未來上下文。在AIME和HMMT數學推理任務中,KVpop在Qwen3-4B模型上,以75%的KV緩存壓縮率保留了98%的全注意力效能,以88%的壓縮率保留了97%的效能,始終優於既有的逐出基線。Qwen3-8B模型表現出更強的結果,接近完全教師模型的效能。這些結果表明,使用未來注意力信號監督逐出,能夠在降低記憶體成本的同時保持品質。
多向量視覺語言檢索通過最大相似度後期交互保留了細粒度的視覺證據,但密集的圖像端令牌使得存儲和評分成本高昂。現有的令牌壓縮方法降低了這一成本,但它們可能移除或壓縮了未來查詢令牌可能需要選擇的物件級別和區域級別證據。我們提出SaMer,一個物體感知令牌合併框架,將圖像端投影後的令牌壓縮成K個代表性質心,同時保留原始的後期交互介面。SaMer僅在訓練期間使用物體註釋作為合併先驗,以抑制跨實例混合,在推理時不需要真實邊界框或檢測器,並且僅調整共享投影層,視覺和語言骨幹網絡保持凍結。在K=64的情況下,SaMer移除了超過93%的圖像端令牌,並將ColPali存儲減少16.09倍,同時在Flickr30K和MSCOCO上提升了R@1。這些提升源於物體感知合併保留了查詢可選擇的物體證據,而修剪或僅特徵池化可能移除或壓縮這些證據。SaMer還優於壓縮基準方法,並展現出更強的短語級別定位能力,表明高效的多向量檢索不僅取決於減少令牌數量,還在於保留未來查詢令牌需要選擇的證據。
擴散大型語言模型(dLLMs)透過反覆對遮罩序列進行去雜訊來生成文本,為自迴歸模型提供了一種並行替代方案,但透過訓練後優化來激發強大的推理能力仍然困難:監督式微調屬於離策略學習且會遭受暴露偏差,而强化學習僅能提供稀疏的序列層級獎勵,且在缺乏可處理序列似然的情況下難以應用。在策略自蒸餾(OPSD)提供了一個有前景的替代方案,使用同一個模型同時作為學生與教師,以提供密集的、詞元層級的在策略監督,但其效果取決於賦予教師特權資訊(PI)——通常是推理時無法取得的實例特定真實參考值——因此學生最終只能蒸餾出一個缺乏特權資訊的弱共識策略,對dLLM推理的提升微乎其微。我們提出了dOPSD,此方法直接從學生自身的去雜訊軌跡中推導出教師的特權,利用同一軌跡中較後、解碼程度較高的步驟來評估遮罩位置,而非使用外部標籤,因此教師的優勢來自模型自身的解碼過程;在Dream和LLaDA上,dOPSD提升了域內數學推理與域外程式碼生成,表現優於監督式與在策略基線方法。
我們介紹了第一個針對高度動態環境(由複雜物理交互主導)的多玩家世界模型。相較於單玩家世界模型將其他智能體視為環境的一部分,我們的模型以多個智能體的動作流為條件,學習將場景變化歸因於正確的玩家,並在任意動作組合下保持一致性。我們在《火箭聯盟》這款遊戲中研究此問題,玩家在快速且緊密耦合的動態環境中競爭與合作。利用由公開可用的機器人收集的一萬小時遊戲數據進行訓練,我們擁有五十億參數的潛在擴散模型能即時生成四玩家比賽,在單個Nvidia B200 GPU上每秒產生20幀畫面。儘管僅以短片片段訓練,其生成序列在遠超過訓練時長的情況下仍保持穩定:分佈品質在長達五分鐘(我們測量的最長時間)內維持穩定,實際觀察中生成序列可持續數小時且無崩潰跡象。我們系統性地探討了核心設計選擇:影片編解碼器、生成目標以及多玩家條件機制。此外,我們描述了行為如何隨模型與數據規模變化,包括湧現的能力與持續存在的失敗模式。我們進一步開發了針對性的評估,以探測模型的物理理解能力,而非僅限於視覺外觀。為支持多玩家世界模型的持續研究,我們開源了數據集、完整的訓練與推論程式碼庫,以及一個即時演示。
预训练缩放定律揭示了模型能力随数据和计算量的增加而呈现可预测的提升。然而,智能体在部署后从真实世界环境中学习的过程仍远未被充分理解。通过分析约38,000小时的智能体与环境交互数据(涵盖134项真实世界任务),我们首次发现——据我们所知——环境学习中的整体性能遵循对数S形缩放定律,且拟合精度极高(R² = 0.998)。跨模型代际的对比表明,智能体的学习速度大约每三个月翻一番。这一发现源于EdgeBench——一个包含134项超长周期真实世界任务的测试套件,涵盖科学发现、软件工程、组合优化、专业知识工作、形式化数学及交互式游戏。每项任务均需智能体在丰富的多级反馈下持续运行至少12小时,且由大量专家投入构建。我们公开发布了其中51项任务及完整的评估框架,以加速对智能体如何从真实世界经验中学习的研究。
我們提出了感知流匹配(PFM),這是一種簡單而有效的框架,用於流匹配模型中的少步生成。不同於傳統在VAE潛在空間中進行速度回歸,PFM利用預訓練的感知模型,在感知特徵空間中監督流匹配。這一簡單改變顯著提升了流匹配模型的少步生成能力,將採樣步數從35-50步減少到4-8步,同時保持生成品質。與現有的加速和蒸餾方法不同,PFM既不需要教師模型,也不需要輔助評分網絡,且能以最小改動整合至標準的流匹配訓練流程。在影像生成、視訊生成和影像編輯任務上的大量實驗證明,PFM能持續產出高品質結果,同時比現有基於蒸餾的方法產生更少的偽影。我們進一步證明,感知監督將回歸最小化器從均值尋求轉變為模式尋求,使預測偏向於流形上的模式,這些模式在粗略的少步積分下仍然準確。我們的結果揭示,當在適當的表示空間中進行監督時,標準的流匹配訓練自然能產出高品質的少步生成器。我們希望這一見解能啟發未來關於以表示為目標的高效生成建模研究。
扩展预训练、后训练和测试时计算已成为提升大语言模型性能的核心范式。在本研究中,我们将验证——即判断解决方案正确性的能力——确定为新的扩展维度。为突破这一限制并展示其有效性,我们提出了“LLM-as-a-Verifier(作为验证器的LLM)”框架,这是一个通用的验证框架,能够在不需额外训练的情况下为智能体任务提供细粒度反馈。与标准的大语言模型评判方式(即通过提示LLM为候选方案生成离散分数)不同,LLM-as-a-Verifier通过计算评分词元逻辑值分布上的期望来生成连续分数。这种概率化表述使得验证能够在多个维度上扩展:(1)评分粒度,(2)重复评估,以及(3)标准分解。特别是,我们展示了扩展评分粒度能够更好地区分正面与负面解决方案,从而产生更经校准的比较结果。此外,通过降低方差与复杂度,扩展重复评估与标准分解能持续提升验证精度。我们进一步提出了一种成本高效的排序算法,利用验证器的连续分数从候选方案中选出最佳方案。LLM-as-a-Verifier在Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)和MedAgentBench(73.3%)上取得了最先进的性能。除验证之外,LLM-as-a-Verifier生成的细粒度信号还可作为估计任务进展的代理。我们为Claude Code构建了一个扩展,使开发者能够监控并改进自己的智能体系统。最后,我们展示了LLM-as-a-Verifier能够为强化学习提供密集反馈,从而提高SAC与GRPO在机器人与数学推理基准上的样本效率。
音訊智慧涉及對音訊及語音的理解、推理與生成。在此研究中,我們推出了 Nemotron-Labs-Audex-30B-A3B(Audex),這是一個基於 Nemotron-Cascade-2-30B-A3B(一款強大的純文字 MoE 大型語言模型)所建構的統一音訊-文字大型語言模型。Audex 採用簡潔的統一設計,僅使用單一 Transformer 解碼器:音訊輸入經編碼後投射至文字嵌入空間,而生成過程中則將文字令牌與量化音訊輸出令牌視為同等處理。此架構實現了強效的音訊-文字融合、無縫的多模態生成,並能兼容標準的大語言模型訓練與推論基礎設施。在訓練方面,我們精心篩選了包含 1574 億個音訊令牌與 3205 億個文字令牌的音訊-文字資料集,並對這些資料進行多階段監督式訓練,隨後再進行純文字 Cascade 強化學習與多領域同軌蒸餾。Audex 在音訊理解、語音辨識與翻譯、文字轉語音、音訊生成及語音轉語音生成方面均達到當前最佳水準,同時在其純文字大語言模型骨幹的推理、對齊、知識、長上下文與代理能力上,僅有極少或完全沒有衰退。我們開放了模型檢查點,以促進開放式研究。
近期,视频扩散模型的进展使得通过时间自回归生成长时单视角视频,或通过双向注意力生成短时多视角视频成为可能。然而,针对动态场景生成时长一致、多视角连贯的视频仍未得到解决。本文提出MV-Forcing框架,该框架通过在逐次生成的视角之间引入4D几何桥接,将时间与视角维度的自回归整合于单一扩散模型之中。我们的核心洞察在于:自回归3D重建模型能够自然地衔接自回归生成的视角。给定一个已完成的源视角,我们重建其3D结构,并渲染出下一个目标视角的几何先验,扩散模型再将其精化为高质量视频。为了突破教师模型固定时间窗口的限制,我们引入联合去噪机制——训练时两个视角槽均从噪声初始化,从而实现时间无界生成。我们通过时空自强制分布匹配蒸馏(Distribution Matching Distillation with Spatio-Temporal Self-Forcing)对模型进行精炼,弥补了时间与视角序列自回归中训练-推理暴露偏差的差距。在合成数据与真实数据上的大量实验表明,MV-Forcing能够利用单一少步学生模型,以任意时长与视角数量生成动态场景的几何一致多视角视频。
LLM智能体通过外部工具日益自主地执行操作,导致复杂且不断演变的安全风险。然而,现有安全测试针对的是专家设计的违规行为,且对应结果由硬编码规则评估,这使得随着智能体的演进,扩展测试的代价高昂。为此,我们提出Vera,一个端到端的自动化安全测试框架,通过三阶段自强化流水线将软件工程测试原则实例化于非确定性智能体。首先,基于文献驱动的探索持续发现并结构化新兴风险,形成安全风险、攻击方法和工具执行环境的分类体系。其次,跨分类维度的组合式组合生成可执行安全用例,每个用例指定具体安全目标、程序化构建的初始状态以及基于可观测工件确定的验证谓词。第三,自适应执行在隔离沙箱中运行异构智能体,其中控制智能体基于运行时观测引导多轮交互,而基于证据的验证器通过环境状态和工具调用证据(而非模型自我报告)判断结果。我们在四个生产级智能体框架(OpenClaw、Hermes、Codex、Claude Code)上评估Vera,揭示了显著的安全弱点,多通道攻击下的平均攻击成功率达93.9%;我们还发布了Vera-Bench,包含1600个可执行安全用例,覆盖三种执行环境下的124个风险类别。这些结果表明,模块化、可执行的测试基础设施对于快速演进的智能体系统进行严格且可维护的大规模安全评估至关重要。代码已开源在 https://github.com/Yunhao-Feng/Vera。
長期行為預測旨在基於長序列歷史推斷用戶的下一步行動,在人工智慧領域扮演關鍵角色。大型語言模型的興起為序列行為預測提供了極具前景的方向,然而在處理長期行為預測時,大型語言模型面臨潛在行為模式歸納困難以及模型內在認知偏差等挑戰。先前的記憶管理方法遵循情境壓縮範式,試圖透過減輕歷史序列負擔來解決此任務,但未能根治核心問題。本文倡導範式轉移,將冗長歷史序列從負擔重新定義為可開發的寶貴資源,並提出PraMem方法——通過對長歷史序列進行預先練習來建立經驗記憶,作為輔助輸入以實現精準的長期行為預測。跨多樣任務的廣泛實驗表明,PraMem較先前方法展現出更優異的性能,而深入分析更為經驗記憶的機制與演化提供了寶貴洞見。程式碼:https://github.com/icip-cas/PraMem。
大型語言模型日益頻繁地處理長上下文,其中KV緩存成為主要的記憶體瓶頸:其大小隨序列長度線性增長,且需在解碼過程中全程保留,若無壓縮,完全在GPU上快取將因成本過高而不可行。現有的KV緩存壓縮方法難以在效率與忠實保留上下文之間取得平衡。標記驅逐會丟失資訊,而語義分組則在預填充階段固定壓縮決策;兩者都無法在生成過程中,當壓縮片段變得相關時,恢復其標記層級的細節。為了解決這個問題,我們提出SeKV,一種解析度自適應的語義KV緩存,它將上下文組織成熵引導的語義片段,並將其儲存在GPU-CPU記憶體層級中,而不丟棄任何資訊。每個片段在GPU上保留一個輕量級摘要向量用於粗略路由,並在CPU上保留一個低秩SVD基用於按需的標記層級重建。一個經過訓練的放大機制,在解碼過程中選擇性地展開與查詢相關的片段,從而實現精確檢索,而無需在GPU上完整實體化KV緩存。SeKV能實現自適應的標記層級重建,同時保持基礎LLM完全凍結,並僅增加少於0.05%的可訓練參數。在四個基準測試中,SeKV相較於最強的語義壓縮基線平均提升5.9%,同時在128K上下文長度下,相較於完整KV緩存減少53.3%的GPU記憶體用量。程式碼開源於 https://github.com/AmirAbaskohi/SeKV。
预测物体动态(即世界模型)是机器人操作领域的基础性挑战,而可变形物体因其高维状态空间和复杂材料特性,尤为棘手。当前世界模型主要通过两种范式解决这一问题:在二维像素空间或更明确的三维几何空间上学习动力学。然而,由于缺乏多样化、大规模的真实世界数据,对这两种范式相对优势与局限的系统性理解仍不明确。为应对这一挑战,我们提出Deform360——一个大规模视触觉数据集,涵盖198个日常物体、1980个交互序列,以及由41个环绕视角相机和双手触觉夹爪采集的超过215小时观测数据,以捕捉全局运动及接触诱发的局部形变。借助创新的无标记视触觉3D追踪流程提取密集几何与运动信息,我们系统评估了当前最先进的世界模型,对比了2D视频模型与3D粒子模型。最后,我们通过执行可变形物体上的机器人规划任务,初步展示了该数据集在真实世界中的适用性。我们的分析揭示了结构先验与可扩展性之间权衡的关键洞见,为未来通用可变形物体世界模型的研究提供了坚实基准。项目网站:https://deform360.lhy.xyz
仓库级漏洞复现是一项具有挑战性的软件工程(SE)任务:智能体必须检查代码库,推断到达漏洞路径的输入语法,构建概念验证(PoC),并验证崩溃在修补版本上不再出现。近期的大语言模型智能体在策略正确时通常能执行这些步骤,但仍会因选择错误的策略而失败。本文认为,对于此类SE智能体而言,策略——而非完整的动作轨迹——才是正确的学习单元:它足够简洁以进行优化,足够具体以指导执行,并且足够稳定以在多次尝试中储存和复用。我们提出了Mastermind,一种将可迁移策略学习与任务特定经验分离的双循环框架。可训练规划器通过监督微调(SFT)和基于里程碑的GRPO学习可复用的漏洞复现策略,而经验循环则维护任务局部的策略记录以指导后续尝试。规划器独立于执行器进行训练,使得策略学习能够在无需修改动作生成能力的情况下改进多个冻结的执行器。我们在CyberGym上使用260个训练任务和200个保留评估任务评估了Mastermind。以GPT-5.5作为冻结执行器,Mastermind实现了84.5%的通过率,优于开卷式PoC上下文(60.0%)、最佳8次采样(63.0%)和迭代改进(77.0%)。相同的规划器还将GPT-5.4 mini和GLM~5.1从45.0%和58.5%分别提升至60.0%和71.0%。这些结果表明,学习高层策略是改进仓库级SE智能体的有效且可迁移的机制。
在縱向臨床實務中,每張胸部X光片都是在參照病人先前檢查的情況下判讀,而放射科醫師報告的重點多半是從一次就診到下次就診的變化。據我們所知,我們提出了首個無需訓練的最佳N項取樣方案,用於預訓練的胸部X光報告生成器,該方案明確感知從縱向先前到當前的變化。我們稱之為「變化感知最佳N項取樣」:每份報告被拆分成句子並嵌入為R^d中的無序集合;每個(先前,當前)配對通過一個集合到集合的距離轉化為固定維度的方向向量,該距離設計用於編碼兩個集合之間的變化;候選者透過其候選變化向量與緩存的真實訓練變化向量庫之間的餘弦距離進行評分,並以最小值或kNN方式聚合。我們用四種方向性集合距離(均值移位、新穎殘差、有向離散豪斯多夫錨點、以及加權成本最優傳輸)實例化該框架,並在一個多次就診的AP-PA隊列上進行評估,在三種提示下對三個視覺語言生成器進行推理。變化感知最佳N項取樣全面優於隨機選取,其中「印象」章節的相對提升最大。
越来越多地,LLM推理服务将客户端请求代理到全球分布的引擎副本。负载均衡策略在优化延迟和首Token生成时间(TTFT)等指标时,必须综合考虑KV-cache局部性、副本负载和可变网络延迟等因素。然而,现有系统在其成本模型中仅评估了这些因素的子集,导致副本间负载和KV-cache分布不均。我们提出GORGO,一种代理架构,通过可调参数全面考虑网络延迟、预填充成本和排队延迟。由于LMSYS-Chat1M和WildChat-4.8M等开源聊天数据集缺乏长上下文、高前缀复用数据,我们发布了从长上下文生产元数据中生成的合成数据集ART-Chat-2.5M。在ART-Chat-2.5M的调优窗口上,进化策略引导GORGO策略的参数直接优化p95 TTFT。在保留的评估窗口期间,我们固定从调优中学习到的参数值,与简单的会话亲和性和前缀缓存等基线负载均衡策略相比,p95 TTFT改善了6.9-15.5%,p95端到端(E2E)延迟改善了14.3-30.9%。代码和ART-Chat-2.5M数据集可在https://github.com/Arcadia-Research-Team/GORGO 获取。
統一多模態模型(UMMs)在交錯式文字-圖像推理方面展現了優異能力,然而如何透過強化學習(RL)有效優化此類多輪生成仍是一項開放性挑戰。現有方法僅將RL應用於文字步驟,而將圖像生成交由監督式替代模型處理,使得策略梯度無法跨越異質模態的完整交錯軌跡進行傳播,導致RL在UMMs中的潛力未被充分發掘。本文提出BRAID(Bridging inteRleAved multI-modal reasoning as a unified Decision process),這是一個簡潔框架,將多輪文字-圖像-文字推理視為統一的馬可夫決策過程(MDP),從而透過單一、原則性的RL目標聯合優化文字與視覺生成。BRAID計算共享的軌跡層級優勢,並將其一致地傳播至文字令牌與圖像去雜訊路徑,各模態透過其原生策略梯度機制進行優化。為進一步處理長時程信用分配問題,BRAID採用視覺語言模型(VLM)裁判,根據各中間圖像的推理效用進行評分,提供密集的輪次級回饋,以強化關鍵視覺分支的學習。在空間推理與視覺感知基準測試上的實驗顯示,BRAID consistently 優於多種基線方法,證實以視覺思維引導的統一MDP公式對有效多模態推理至關重要。
我們在EXIST 2026中提出AI Wizards團隊針對迷因多模態性別歧視識別的提交成果。該任務包含三個難度遞增的子任務。我們將其分層建模為基於經驗標註者分佈的條件式軟標籤預測。我們的系統透過輕量級閘控多層感知器(Gated MLP)處理固定的Gemini Embedding 2視覺語言表徵,並使用KL散度與同方差不確定性加權進行訓練。我們的提交在官方軟-軟排行榜上,於任務2.3獲得第一名,任務2.1與2.2獲得第四名。程式碼已公開於 https://github.com/NLP-AI-Wizards/EXIST-2026。
視覺-語言-行動(VLA)模型透過大規模預訓練獲得廣泛的具身能力,然而其泛化能力遠比大型語言模型(LLM)與視覺語言模型(VLM)脆弱。常見的補救方式——透過監督式微調或強化學習進行後訓練——雖能提升特定任務的表現,卻會窄化預訓練所帶來的通用能力。我們發現一個關鍵瓶頸:VLA模型的失敗不僅源於動作生成,也源於動作評估。一項診斷性的pass@k研究證實,凍結的VLA在其輸出分佈中已包含具備能力的行為,整體成功率從pass@1的33%提升至pass@32的92%。受此啟發,我們提出SVA(Search, Value, and Act)框架,這是一個簡單的架構,能讓凍結的VLA策略具備長期後果感知能力。SVA首先在模擬中利用蒙地卡羅樹搜索充分探索VLA的輸出分佈,收集多樣化的軌跡並標註經驗回報;接著將這些知識蒸餾成輕量級的Q值模型,用以預測候選動作的預期後果;部署時,凍結的VLA提出多個候選動作,由評估器選出不確定性正則化後Q值最高的動作,過程中無需使用模擬器。透過將動作提案與後果評估分離,SVA保留了VLA主幹模型的泛化能力,同時顯著提升任務成功率。在多個具身基準的實驗中,SVA一致地提升了對未見任務的泛化能力,並展現出強大的測試時擴展行為。引人注目的是,SVA使一個9B參數的VLA模型以低27%的推論延遲,超越27B參數的VLA模型達7個百分點,這表明擴展測試時評估比擴展模型規模更具成本效益。
基於語音的抑鬱症檢測將從短音頻片段中提取的特徵壓縮為一個說話者層級的決策,這一步驟稱為時間聚合,但鮮少被單獨研究。大多數基準測試固定使用一個自監督編碼器和一個手動選擇的層,因此報告的改進可能反映的是整個流程的效果,而非聚合方法本身的貢獻。我們提出 DEPOOL,這是一個受控基準,在英語和普通話的抑鬱症語料庫上比較六種聚合架構與六種凍結的語音骨幹網絡,其中每種配置會自行學習哪些骨幹層重要,而非手動固定某一層。在最終的 72 個配置網格中,三分之一的配置崩潰為對每個說話者都預測同一類別,這種失敗與骨幹網絡和方法同樣相關;而在單一種子運行中最穩定的架構,在跨種子重複訓練時卻變得不可靠。對於臨床語音中的時間聚合,應將對骨幹網絡和種子的穩健性,而非單一流程下的平均準確率,作為首要的基準測試標準。
可控生成式三维医学影像模型能够合成具有特定临床属性的体素数据,但这要求样本同时具备高保真度、原生三维特性以及对条件约束的忠实还原。我们提出CONFLUX——一种面向胸部计算机断层扫描(CT)的潜在扩散模型:通过三维变分自编码器压缩每个体素数据,并采用整流流变换器在潜在空间中进行生成。生成过程通过自适应层归一化,以结构化放射学元数据(18种异常发现、性别、年龄和重建内核)为条件进行调控。该模型在三平面弗雷歇距离(FID)指标上显著超越强体积基线模型(CONFLUX得分32.3,MAISI得分74.6),同时实现了对临床属性的直接控制。为增强这种控制力,我们引入在线强化学习后训练阶段(组相对策略优化),通过奖励机制提升分类器从生成体积中准确恢复指定发现的可靠性。经独立分类器评估,后训练过程消除了与真实扫描可靠性之间的47%差距。我们开源该模型及约20万例合成胸部CT数据集,其条件元数据涵盖广泛临床发现类型。
我們提出 SynCity 3000,這是一個用於生成全局一致、同時支援細粒度佈局控制的 3D 場景框架。奠基於當前圖像轉 3D 生成器從單張圖像中產生複雜 3D 資產的能力,我們透過將生成器改造為可當作卷積運算元來應用,將此能力擴展至整個場景的規模。我們透過在場景類資料上微調模型來實現此目標,這些資料由我們提出的新型合成資料引擎所生成,旨在解決訓練中 3D 場景資料稀缺的問題。接著,卷積生成器被應用於根據使用者提示所生成的整個場景之斜二測圖像,從而產生任意大小與複雜度的 3D 場景。在各種提示和佈局中,SynCity 3000 生成了大型、連貫且細節豐富的場景,解決了先前 3D 場景生成方法的不足。
聲音與味覺之間的跨模態對應在心理學與神經科學領域已有充分確立,但在基於內容的多媒體檢索中卻幾乎未被探討。我們將從音訊預測味覺形式化為一個基於內容的音樂資訊檢索基準測試,採用經知覺驗證的多來源語料庫,比較來自四個HEAR系列中的十個凍結音訊編碼器,這些編碼器共用一個多任務回歸頭,並以門控後期融合作為可配置變體。為評估模型效能,我們計算絕對誤差與秩相關係數。最強系統在巨集均方根誤差(macro RMSE)為0.134的條件下預測五種味覺;在保留的真實音樂數據上,其誤差小於單一評分者與共識偏差的一半(RMSE 0.13 對比 0.28),因此該模型對群體共識的追蹤比平均人類評分者更為精準,且遠低於先前的最先進基準線(0.219)。在絕對誤差方面,編碼器表現統計上持平,單一VGGish模型即匹配最佳融合效果,但門控後期融合的優勢僅體現在秩相關上(巨集皮爾森相關係數 0.724 對比 0.666)。將其操作化為基於內容的檢索索引後,預測味覺空間對309個項目的資料庫進行排序,其精確度遠高於隨機水準的CLAP文字基準線;脊回歸探針與音訊帶阻消去測試則讀取出與已知聲音-味覺對應關係最強的表示。
基於動作條件世界模型的決策時間規劃已成為具身控制的主流範式。然而,標準規劃成本僅根據預測的最終狀態與目標的接近程度來評估候選方案,卻未檢查中間轉移的可行性——這意味著預測軌跡看似合理,但環境實際展開卻可能偏離該軌跡。本文提出 ACID,這是一個引入循環動作一致性的決策時間規劃框架:由逆向動力學模型從預測轉移中反向推斷出的動作,應能恢復原本條件化的動作。我們透過一個尺度不變的自適應權重,將此每一步的殘差納入規劃成本中。跨越四種動作條件世界模型與六項任務(涵蓋剛性與可變形物體操作、關節控制及視覺導航),ACID 持續改善規劃效果,並在顯著減少規劃計算量的情況下達到與基準相當的準確度。
為了讓機器人在商業與工業應用中可靠運作,近期代理型程式碼系統的進展能否將可解釋的機器人程式設計與無模型策略的開放世界適應能力相結合?我們聚焦於「變異自動化」(VA),這類任務的物體幾何與姿勢變異程度高於固定自動化。在需持續且可靠執行的商業與工業應用中,無模型策略往往難以彌補VA任務的可靠性差距。受任務與運動規劃(TAMP)及機器人作業系統(ROS)之前研究的啟發,我們提出「圖形即策略」(GaP),這是一種多代理程式碼編排框架,能從模組化開放機器人技能庫(MORSL)中生成包含感知、規劃與控制節點的有向計算圖。GaP接著建立內部模擬環境,平行排練不同圖形結構的任務實例,以迭代優化圖形結構與參數,提升成功率與吞吐量。透過8項新的開放VA任務基準測試(4項模擬、4項真實場景)評估,結果顯示GaP能達到顯著優於基線的成功率。詳細資訊、程式碼與數據可參見線上資源:https://graph-robots.github.io/gap
無監督音節分詞旨在從原始語音中學習離散的音節標記,以捕捉與潛在語言內容相關的結構。近年來的音節分詞方法採用預訓練HuBERT的教師-學生蒸餾技術,將潛在語音表徵組織成音節片段。然而,當使用語句層級的交叉熵目標進行訓練時,模型會預測說話者身份而非語言內容,從而損害音節標記的純淨性。為解決此問題,我們提出了一種說話人解耦的音節分詞器,該模型在固定長度區塊內將受到說話者擾動的學生表徵回歸至乾淨的教師目標。實驗結果顯示,我們提出的方法在音節邊界檢測與音節片段聚類中達到了最先進的性能。此外,基於我們的音節標記訓練的語音語言模型,在句法與語義理解上相較於音素層級的SpiRit-LM實現了7%的相對提升。
半監督語義分割(SSSS)長久以來圍繞一個核心問題打轉:該信任哪些偽標籤?並透過日益精細的信心過濾來回答。基礎模型骨幹改變了格局:使用 DINOv2 教師時,嚴格閾值已能保留經測量達 98% 純淨度的偽標籤集,因此殘留的準確率並非來自過濾器,而是來自類別如何結構化嵌入空間。我們提出 PixCon,一個乾淨正例像素對比框架。PixCon 維護每個類別的記憶庫,僅收納學生模型已正確分類的標註像素,從構造上保證無污染的正集(ρ_F=0),不同於先前基於信心過濾偽標籤的對比式 SSSS 記憶庫(如 ReCo、U^2PL)。PixCon 在一致性骨架之上採用單分支架構,無需推論階段額外參數,也不需特定於記憶庫的閾值。對監督式 InfoNCE 梯度的一階分析解釋了污染為何有害:其假正項以 ρ_F/(1-ρ_F) 比例增長,我們實際測量此值(在 Pascal 上為 0.018,在 ADE20K 上為 0.106),而非僅假設。在 Pascal VOC、Cityscapes 與 ADE20K 上,PixCon 在使用計算匹配的單一開關協議中,匹配或超越了基於強勁 DINOv2 的 UniMatch V2 基線:它提升了 Pascal-1/8 的每個種子(每種子約 +0.2 mIoU),其三種子平均值達到 87.90,即已發表的 UniMatch V2-B 數據。由於在基礎模型教師下污染已罕見,我們的分析表明,ρ_F=0 的保證主要作為教師弱化時的穩健性,而準確率提升來自更乾淨的正例監督,這使得乾淨正例對比成為基礎模型 SSSS 穩健且低成本的預設方案。
高吞吐量科學設施(如大型強子對撞機)依賴於在嚴格的頻寬、延遲與儲存限制下進行即時事件篩選(觸發)。實務上,觸發選單大多靜態且經手動調整,當偵測器條件、碰撞堆疊與背景組成隨時間漂移時,可能變得次優。我們將在線閾值調整視為序列決策問題:強化學習代理攝取近期觸發率與訊號敏感特徵的串流摘要,並更新觸發閾值,以在追蹤目標背景率(維持於容忍帶內)的同時最大化訊號效率。我們將群體過濾策略優化(Group-Filtered Policy Optimization, GFPO)適應於串流控制,並引入兩個變體(GFPO-F、GFPO-FR),於訓練期間強制背景率的可行性。 在一個模擬真實對撞機運行的基準測試中,我們研究了兩種代表性觸發:對碰撞堆疊變化敏感的總橫向能量(H_{T})觸發,以及基於重建損失的異常檢測(AD)觸發,用於稀有或非標準特徵。在蒙地卡羅串流上,我們的代理將符合容忍區間的時間比例提高了48%(H_T)與28%(AD),且在這些容忍區間內,訊號效率的累積增益高達2%。 從模擬轉移至真實碰撞數據(CMS運行283408)時,相同的代理無需微調,即在容忍度方面比基線提升56%(H_T)與28%(AD),並在兩種觸發上進一步獲得訊號效率增益。據我們所知,這是首次在真實大型強子對撞機碰撞數據上展示基於強化學習的觸發控制。程式碼可於 https://github.com/Zixind/GFPO_LHC 取得(詳見儲存庫)。