每日精選AI研究論文及翻譯
視覺-語言-動作(VLA)模型普遍採用以大語言模型為核心的「V→L→A」路徑,先將視覺觀測投影到大語言模型的表徵空間,再解碼為機器人動作。儘管此設計行之有效,但每次調用策略時會產生大量的計算與記憶體開銷。本研究提出TurboVLA,這是一種全新的VLA範式,將傳統的「V→L→A」路徑重塑為直接的「V+L→A」映射。不同於以大語言模型作為感知與動作的中樞介面,TurboVLA分別編碼視覺觀測與語言指令,透過輕量化的雙向視覺-語言交互直接在兩者之間交換信息,並以緊湊的解碼器預測連續動作片段。這種簡潔的設計直接從視覺與語言特徵中構建任務條件表徵,顯著降低了VLA推理的計算與記憶體成本。在LIBERO基準上,TurboVLA僅用0.2B參數、31.2毫秒推理延遲與0.9 GB推理顯存(在消費級RTX 4090上),即達到97.7%的平均成功率,與顯著更大的VLA策略相當甚至更優。這些結果確立了TurboVLA作為主流以大語言模型為核心的VLA範式之簡潔有效替代方案,為如何連結視覺、語言與動作以實現高效機器人操作提供了全新視角。程式碼開源於 https://github.com/H-EmbodVis/TurboVLA。
基於評分標準的強化學習透過根據明確標準評估模型輸出,來豐富語言模型的訓練。然而,在GRPO風格的流程中,這些結構化的評判被簡化為一個標量式的回應層級獎勵,並轉換為回應層級的優勢值,再均勻分配給所有生成的詞元。這使得即使不同評分標準對應到不同的文本區段、格式決策或語義選擇,回應內部仍缺乏明確的信用分配機制。我們提出CoRT,一種基於評分標準條件化GRPO的詞元層級信用加權方法。CoRT不訓練輔助性的詞元評分模型,而是透過反事實重播,在同一取樣回應上,分別根據原始評分標準條件化提示與匹配的無評分標準提示重新評分。由此產生的逐詞元對數似然對比,可作為對評分標準上下文依賴程度的代理指標。CoRT將這些對比映射為有界且經回應正規化的權重,並用其將帶正負號的GRPO優勢值重新分配至各詞元,過程中無需引入輔助評分器或改變回應層級的獎勵。在指令微調模型與不同獎勵粒度上的實驗顯示,CoRT在絕大多數比較中優於對應的回應層級GRPO,平均提升4.4個百分點。此方法在避免獨立學習相關性階段的同時,仍能與學習式詞元層級信用基準競爭。這些結果表明,策略內部的反事實對數似然對比能提供有效的訓練訊號,用於回應內部的信用分配,同時保留GRPO的簡潔性與穩定性。
評估一個視覺-語言模型是否能透過身體來行動是一項挑戰。行動的結果結合了視覺-語言模型的決策與運動控制。當任務失敗時,難以判斷是視覺-語言模型做出了錯誤選擇,還是運動控制器根本無法執行(例如失去平衡而跌倒)。在這項工作中,我們提出 HumanCLAW,這是一個能將行動決策與低階執行解耦的評估框架。在每一步中,一個被固定好的現成視覺-語言模型會發出一個原子技能指令,而該指令會被轉化為一段次秒級的連續全身動作,並伴隨真實物理效果(包括重力與碰撞)。因此,身體可以在物理世界中自由行動,同時執行層面的干擾(如平衡與運動誤差)則被排除在外。最終可測量的是模型的行動智能:它在每一刻選擇身體下一步該執行什麼的能力。基於此框架,我們建立了 HumanCLAW-Bench:涵蓋 41 個室內場景中 1,218 個長時域、以自我為中心的「尋找-導航-互動」片段。我們測試了九個最新的視覺-語言模型,發現沒有任何一個能通過這項基準測試;表現最佳的模型僅達到 16.8% 的成功率。辨識目標並非瓶頸。當前視覺-語言模型所欠缺的是具身自我意識:它們會遺忘自身身體的位置,無法判斷自己在哪裡、是否已抵達目標、或者是否已撞上障礙物。
文本空間優化透過編輯外部自然語言產物(而非模型權重)來調整大型語言模型,使優化後的產物保持可檢視性,且模型可作為黑箱處理。然而,現有文本空間方法大多固定評估標準。在開放式任務中,這可能形成瓶頸:一旦解題器在評分量尺衡量的準則上有所改進,其餘未涵蓋的維度便無法傳遞優化訊號。若僅根據當前解題器的分數來更新評分量尺,同樣不可靠——因為表面進步可能源於降低評分量尺的滿足難度。我們提出「解耦協同進化」(DecoEvo),該方法在無需黃金評分量尺的優化過程中,以解耦目標協同進化解題技能與評分量尺生成技能。解題技能根據準則層級的回饋進行更新,而評分量尺生成技能則透過對需求涵蓋率與回應鑑別度的互補審校(獨立於解題總分)進行修正。這種分離使生成器更新聚焦於新揭露的解題弱點,減少反覆強調解題器已滿足的準則。在各基準的官方評估下,DecoEvo 在五項基準測試與三種大型語言模型主幹中均優於所有對比方法,相較於 SkillOpt 在五項基準平均上獲得 2.8% 至 5.0% 的相對提升。
真實世界的任務常要求模型從任務特定情境中學習,而非僅依賴預先訓練的知識。儘管近期研究已將此能力稱為情境學習,但現有評測主要聚焦於文字情境。然而,在許多實際應用中,需學習的情境其實是多模態的:科學發現透過圖表呈現、財務指標散佈於轉換報告中、空間決策則依賴地圖、場景或網頁。我們提出CLBench-V,一個專為多模態情境學習設計的基準,藉由圍繞三個維度組織任務來解決定位情境使用失效處的困難:情境基礎、新資訊應用與新知識學習。CLBench-V結合了轉換後的公開基準與新構建的資料集,涵蓋科學、金融、長文件理解、空間推理及網頁視覺問答等領域。為降低建構特定領域情境學習任務的成本,我們進一步對新資料集採用自動化建構與篩選流程。在3,443個實例與六個近期多模態模型上,最佳整體分數僅為0.2847,顯示多模態情境學習仍遠未飽和。此外,InternVL3.5-30B-A3B在情境基礎與新知識學習上表現最佳,而Qwen3.5-Plus在新資訊應用上則名列前茅。我們進一步分析了評判者可靠性、情境長度、圖片數量及代表性失敗案例。程式碼已於 https://github.com/IamLihua/CLBench-V 公開。
訓練大型語言模型(LLM)在長時域遊戲中行動,是邁向通用型決策制定的一個有前途的步驟,然而,基於可驗證獎勵的強化學習(RLVR)依賴於稀疏的最終獎勵,這種獎勵幾乎無法揭示哪些決策決定了成功。更密集的過程信號可以提供這種缺失的回合級信用分配,但現有的來源很難同時保持低成本和高準確性。我們觀察到,遊戲求解器的狀態值變化揭示了某個動作是否使狀態朝成功方向前進。基於這一見解,我們提出了CAST(來自求解器教師的信用分配),它將這些狀態值變化轉換為求解器優勢,並將其作為回合級信號注入RLVR。我們進一步證明,在軟最優求解器假設下,最大化求解器優勢等價於從求解器進行在線蒸餾,僅需標量值而非教師的logits。在倉庫迷、踩地雷和交通堵塞等遊戲中,CAST在領域內及未見過的難度評估下,於每個遊戲中均優於所有訓練基線,並在ALFWorld和WebShop上達到最高的平均零樣本性能。我們的程式碼可在 https://github.com/Wloner0809/CAST 取得。
大型語言模型代理經常遇到相關但不同的任務,這些任務共享可重複使用的解決方案模式。然而標準的代理強化學習將任務視為獨立的情節,而現有的技能學習方法若非專注於單一任務的重複嘗試,就是使用多階段的管道來混雜提取、檢索和執行。我們提出 SkillRise,這是一個用於跨任務學習技能的統一強化學習框架。SkillRise 將相關實例組織成漸進挑戰的序列,並使用單一策略在任務解決與策劃直接傳遞給下一個任務的動態技能文件之間交替。跨任務的解耦信用分配使用當前任務結果來監督解決,並使用折扣的後續任務結果來監督策劃。在 ALFWorld、WebShop 和 ScienceWorld 上的實驗顯示,SkillRise 在比較方法中達到了最強的 Pass@1 表現,相較於最強基線的增益範圍為 2.3 到 8.5 個百分點。儘管在不同任務上進行訓練,其學到的策劃策略在相同任務的重複嘗試中仍然有效。進一步分析顯示,在測試時跨任務存在擴展性:即使每個任務僅嘗試一次,隨著相關任務序列的增長,表現也會提升。這一趨勢表明,SkillRise 跨任務重用可遷移的技能,而非從相同任務的重複抽樣中受益。此外,SkillRise 在大幅減少多階段技能學習管道的運行時開銷的同時,仍保持強勁的表現。綜合這些結果,為 LLM 代理提供了一種簡單且高效的訓練範式,使其能夠跨任務提取、精煉並重用可遷移的技能。
编程代理在修改现有代码库的软件工程任务上取得了显著进展,包括修复错误和实现功能。然而,从零开始构建完整程序仍是一项重大挑战:即便是在ProgramBench上评估的前沿模型,也仅有不到1%的任务能完全解决。其中一个障碍是缺乏适用于这种从零开始场景的可扩展训练环境,这类环境需覆盖整个软件工程生命周期,而现有的环境构建框架仅聚焦于软件开发中的单一阶段。为解决这一缺口,我们提出了MindForge,一个自动化流程,可将开源命令行程序转换为无源码的环境,仅暴露编译后的参考可执行文件及其文档。利用MindForge,我们从与ProgramBench不相关的代码仓库中构建训练环境,并使用GLM-5.2作为教师代理,精心设计了一套由程序合成轨迹组成的高质量数据配方。在Qwen3.6-27B上对这些轨迹进行微调,使其在ProgramBench上的平均测试通过率从37.98%提升至49.51%,性能与规模大得多的前沿模型相当。此外,微调后的模型在所有七个未见过的软件工程基准测试上持续优于基础模型,涵盖长期仓库生成与翻译、错误修复、功能实现以及跨语言问题解决,具体绝对提升为:RepoZero-C2Rust上31.00分,DeepSWE上14.16分,NL2Repo-Bench(含/不含测试)上10.70/4.56分,SWE-bench Verified上5.04分,SWE-bench Pro上5.93分,SWE-bench Multilingual上5.22分,以及FeatBench上4.94分。
基於LLM的智能體在軟體工程任務中表現優異,尤其是當現有程式碼庫提供上下文時,但從零開始建構程式本質上仍困難得多。近期如ProgramBench的基準測試量化了此差距:僅給定自然語言文件與僅可執行二進位檔作為行為預言,即使是前沿模型也無法解決超過1%的實例。現有框架將文件閱讀、行為探索與程式碼合成混為單一階段,導致智能體探查不足、行為意圖因上下文漂移而流失,並將早期誤解傳遞至最終實作。受經典需求工程啟發,我們主張應將行為規範獲取作為實作前的首要階段。我們提出SpecFirst,一個兩階段框架,強制在程式碼合成前進行規範獲取。專用的規範智能體首先探查二進位檔,將觀察結果與文件結合成結構化規範。接著,程式碼合成智能體利用此規範驅動實作。這種分解在編碼開始前澄清文件歧義,並在合成過程中提供穩定的行為參考。我們在200個ProgramBench實例上評估SpecFirst,涵蓋兩個系列的四種模型,能力跨數量級。SpecFirst始終優於單循環基線,測試通過率提升6.9%–21.3%,二進位檔探查覆蓋率提升9.4%–18.5%,均具統計顯著性。程式碼合成的行為分析進一步顯示,預先制定的規範能促成更早且更持續的程式碼建構。我們的結果證明,顯式需求工程階段是從零開始程式建構的有效範式。
近年来的游戏世界模型能够根据玩家动作生成视觉逼真且可互动的环境。然而,游戏并非仅由像素定义,而是受制于明确的机制,即控制生命值减少、技能激活及游戏终止的状态依赖规则。这些机制依赖于精确的内部状态(如生命值、技能条和计时器),这些状态与视觉观察紧密耦合,并决定游戏玩法的演进过程。若未能建模此类状态动态,现有游戏世界模型可能生成视觉上看似合理、但违反底层游戏规则的展开内容。本文提出StatePlay——一种新型状态感知游戏世界模型,该模型联合预测视觉内容与游戏状态,以促进符合机制的生成。StatePlay采用混合变换器(MoT)架构,在保持专用视觉与状态表征的同时实现跨模态交互,使预测状态能够引导帧生成。每个分支进一步针对其模态特性优化了独立目标函数。实验表明,StatePlay在状态预测上实现了平均归一化L1距离低于0.06。此外,与未显式建模状态的模型相比,我们的方法在游戏展开生成中的机制保真度提升了18.6%。总体而言,本研究凸显了状态感知游戏世界建模的重要性,并推动从像素级真实感迈向完整且机制忠实的游戏生成。
對人工智慧爆炸性進展的預測,往往建立在AI Agent能自動化進行AI研究的基礎上。然而,關於AI Agent能否執行開放式AI研究的證據仍然薄弱。現有的評估方式,要麼將Agent侷限於狹隘、可驗證的任務上,從而排除了開放式研究;要麼將AI生成的論文提交至雙盲同儕審查,而這種審查機制負擔過重、充滿隨機性,且審稿品質不佳。我們提出第三種衡量AI研發自動化進展的方法:讓AI Agent接手一篇高品質未發表論文的中心開放式研究問題,並由該論文的原始作者對其輸出進行評分。我們將此方法稱為影子評估。我們針對兩篇未發表的NeurIPS 2026投稿論文進行了影子評估,賦予前沿Agent六天的時間與數千美元的計算資源。這些Agent在沒有人類協助的情況下完成了所有工程任務,但在解答研究問題的核心方向上卻未能取得實質進展。因此,這兩篇論文均被原始作者明確拒絕。我們歸納出五種反覆出現的失敗模式:對於可發表研究的門檻判斷不佳、對研究設計缺陷缺乏創意回應、無法有效從死胡同中回頭、資源意識薄弱,以及指令漂移。我們使用第二組模型與框架進行穩健性檢驗,結果同樣再現了這些失敗。我們公開了專家評審意見、問卷調查結果、Agent程式碼儲存庫以及完整日誌。我們的研究結果提供了早期證據,證明當今的AI Agent能夠勝任AI研究的工程部分,但在研究生命週期的關鍵環節上仍有諸多困難。
大型語言模型(LLM)代理日益被期望協助用戶完成任務。然而,現有的基準測試在評估代理能否以合理成本執行辦公套件工作流程方面所提供的支援有限。我們推出 OmegaUse-OfficeVal,這是一個用於評估 LLM 代理在長期辦公套件任務上的基準測試,並具備任務層級的經濟基礎。該基準測試包含 100 項任務,這些任務源自從業者提出的辦公套件請求,並經過隱私保護流程進行改編。平均而言,完成這些任務需要 2.32 小時的人力工時。該基準測試的一個重要特點是每個任務都配備了兩個經濟信號:人力工時與任務價格代理。這些信號能夠直接比較人力成本與 LLM 推論成本,並進行加權價值評估。為支持穩定的評估,我們根據細粒度評分標準開發了基於程式碼的驗證器。我們評估了數個前沿 LLM,同時搭配人類基準。儘管所有受評 LLM 的成本與速度都遠優於人類工作者,但它們尚未達到人類等級的交付品質。程式碼與資料集已完全開源,更多資訊請參閱我們的專案網站:https://omegause-officeval.github.io。
我們提出 Voice Memory,一種專為代理語音識別設計的純推理方案:在串流處理時,一個凍結的校正器讀取單一領域記憶檔,並針對每個語句決定要採用假設結果,或放棄該結果而保留最佳辨識結果。非同步地,一個以分數為門檻的優化器會透過有界編輯來修訂該檔案,僅在編輯能確實改善保留分數時才予以接受。此架構延伸自傳統的 ASR-LM 框架,我們將此拆分稱為「聽者-思考者」架構;兩個角色僅透過記憶耦合,因此無需改變權重,且所學技能保持可審計與可移植性。約束被證明是此循環所發現的關鍵技能:在金融新聞領域中,無約束的生成式錯誤校正(GER)會過度校正,在其多達 64% 的編輯中破壞正確的詞元,而 Voice Memory 則將此比例降至 35%。在十個 HyPoradise 領域中,搭配開放校正器使用 Voice Memory,加權詞錯誤率從 8.36% 降至 7.52%(加入三個情境範例後更降至 7.47%),且沒有任何資料集的表現低於其最佳單一辨識基準線;收益集中在可恢復空間最大的領域,包括航空旅行指令(從 8.40% 降至 3.40%)與嘈雜的遠場語音(CHiME-4,從 12.69% 降至 10.46%)。此記憶可跨校正器家族遷移,且推理路徑不增加任何參數。我們提供示範與範例程式碼供未來研究使用。
大多數影片編輯系統仍缺乏明確的圖層式影片表徵,限制了其在真實合成、物件重複使用與一致化操作上的能力。此限制在影片物件插入與影片圖層分解中尤為明顯,現有方法因缺乏明確的前景圖層監督,只能依賴隱式推論或逐場景最佳化來處理。我們提出 TriLayer 資料集,這是一個大規模的三元組影片資料集,包含對齊的合成影片、背景影片與前景影片,其中前景圖層涵蓋物件外觀及其相關視覺效果。這種明確的監督使模型能直接學習圖層式影片表徵,而非透過隱式推論來取得。基於此資料集,我們提出 DBL-Diffusion,這是一個雙分支擴散框架,透過共享去噪與跨分支交互,共同建模 RGB 合成影像與 RGBA 前景圖層。我們將此框架實例化為兩個任務:DBL-Insert 執行圖層式物件插入,生成明確的 RGBA 圖層以實現真實合成與靈活的後製編輯;DBL-Decompose 執行影片圖層分解,利用三元組監督還原前景與背景圖層。實驗結果顯示,明確的圖層建模能顯著提升插入的真實度與分解的品質。
我們介紹 GPT-Red,這是一個自動化的紅隊測試代理,經過訓練能夠針對前沿的大型語言模型(LLM)發現新穎的提示注入攻擊。該模型的目標是評估並提升我們生產系統的穩健性。為此,我們使用它對 GPT-5.6 進行對抗性訓練,這是我們迄今為止對提示注入攻擊最穩健的模型。為了打造 GPT-Red,我們設計了一種可擴展的自對弈演算法,讓模型負責攻擊一群同時訓練的防禦代理。我們在逼真的紅隊測試環境中訓練該模型,使用的計算資源與我們最大規模的強化學習後訓練相同,這使其成為有史以來文獻記錄中規模最大的 LLM 安全訓練任務。GPT-Red 在紅隊測試方面表現優異:它能可靠地突破我們先前的模型(最高至 GPT-5.5),比人類紅隊測試者發現更多成功的攻擊,並能泛化至未見的環境、防禦模型及工具。未來,我們預期隨著每個新 GPT 模型穩健性的提升,它將為更強大的紅隊測試代理提供更好的學習信號,從而開啟自我改進的飛輪效應。
記憶已演變為大型語言模型(LLMs)中一個基礎性的架構維度,從計算過程中隱性的副產品,轉變為一系列明確且可操控的機制。儘管近期進展引入了多元策略——涵蓋短期注意力、遞迴狀態動態、參數高效調整與可擴展查找儲存——但此快速發展亦導致研究領域高度破碎化。本調查報告提出一套系統性、以架構為核心的LLMs記憶分類法。我們的分析框架沿三個正交軸向描述記憶:表徵(隱性 vs. 顯性)、更新動態(離線 vs. 在線)與持續性(短期 vs. 長期)。我們進一步形式化記憶寫入、路由、狀態轉換與整合的細粒度機制。此統一視角闡明了計算耦合記憶與獨立定址記憶之間的概念界線,有效銜接了不同架構典範。此外,我們批判性分析了混合記憶架構、系統層級效率權衡與多維度評估方法。透過將這些分散的進展整合為連貫框架,本調查報告描繪了以記憶為中心的LLM設計軌跡,並為未來可擴展且具適應性的語言模型創新提供了原則性基礎。
在线策略知识蒸馏将推理能力从大模型迁移至紧凑学生模型,但现有方法存在三种复合失效模式:(i)冷启动崩溃,即新初始化的学生模型对教师模型偏好的令牌赋予近乎零的概率;(ii)状态无关的发散调度,即仅依赖时间的前向/反向KL插值忽略了学生模型的覆盖状态;(iii)二元奖励稀疏性,即通过/失败信号丢弃了部分正确轨迹中的信息。 我们提出CADENCE,一个针对每种失效模式提供针对性修复的统一框架。其DRIFT机制在学生模型采样的轨迹上(基于逐令牌替代目标,而非序列级KL梯度估计器)调度前向KL与反向KL替代目标的逐令牌凸组合。六大扩展组件进一步强化该机制:(A)COVA——覆盖度自适应β调度,加速从正向到反向的过渡;(B)FTB——分叉令牌增强,通过全局归一化熵参考将梯度集中于高熵位置;(C)CCD——密集奖励,为错误但接近的轨迹添加数值邻近部分正确得分;(D)LAP——偏好简洁的正确轨迹强化;(E)EMR——熵匹配校准正则化器;(F)BSD——自举式自我蒸馏阶段。 在GSM8K和MATH-500数据集上(采用修正的512令牌协议,5个随机种子,报告标准差),CADENCE从1.5B教师模型蒸馏出0.5B学生模型,在GSM8K上达到69.8±0.5%的pass@1(预训练模型为48.7%;教师-学生差距的63.2%被弥合);当使用3B教师模型时达到72.1±0.4%(差距弥合76.2%),以+4.4±0.7个百分点的优势超越最强的匹配计算标签使用基线(DRIFT+二元奖励)。所有实验均在单台Apple Mac Studio(M系列,64GB统一内存)上运行,表明理论驱动的蒸馏方法无需数据中心级硬件即可达到强大的推理质量。
通用操作策略越来越多地采用基于大型预训练骨干网络的动作分块流策略。这类动作分块以开环方式运行,导致策略无法对执行过程中的感官输入做出响应,牺牲了反应能力。更频繁地重新规划可以恢复反应性,但感知到动作的流水线(大型骨干网络加上多个去噪步骤)过于缓慢:这种延迟阻碍了频繁重新规划,并使得已执行的动作变得过时,导致此类策略难以适用于动态的闭环控制。我们提出πR²,它使这些策略具备反应性和实时性,同时保留大型骨干网络、表达性多模态策略以及多动作预测能力。基于扩散强制的每位置噪声调度,πR²贡献了两项核心思想。第一,它将条件输入拆分为快速通道(本体感知,每拍刷新)和异步更新的慢速通道(视觉语言特征),使得策略能在动作分块内对本体感知做出反应,同时容忍陈旧的视觉信息。第二,一种延迟自适应流调度将正在执行中的动作视为修复条件,并在每次调用时通过单步去噪生成动作,使单一训练模型能适应不同硬件延迟。πR²只需对现有架构进行极小修改,即可从预训练策略微调得到:将其应用于GR00T-N1.7,在真实xArm6+XHand平台上,其闭环重新规划速度约为基础策略的4倍(在A5000 GPU上约25Hz),每40ms基于全新观测执行动作。在模拟和真实世界操作任务中,πR²相比最强基线,在模拟环境中成功率最高提升23%,在真实环境中提升30%。项目页面:https://pi-r2-flow.github.io/
現代多智能體知識系統日益透過自主轉換鏈而非直接檢索來累積知識。現有的溯源工作記錄了「發生了什麼」——執行軌跡、工具呼叫、證據連結——而來源可靠性評估(如真相發現、聲譽系統)早已確立。目前所欠缺的,是一個具備操作性的框架,能為主張層級的傳播鏈附加依領域劃分的可細粒度傳輸者可靠性評級,並納入完整性語義、經轉換類型聚合的機制、去耦的內容批評,以及提供、審查、隔離的流程管理。 古典伊斯蘭聖訓學曾面對結構類似的問題:判斷透過人類敘述者鏈條傳遞的知識是否應被接受。經過數個世紀的發展,它建立了一套嚴謹的方法論——伊斯納德(每一主張附帶完整傳播鏈)、里賈爾(系統評定每位敘述者的誠信與精確度)、最弱鏈評估機制、透過獨立鏈進行佐證,以及馬特恩批評(不依賴鏈品質而獨立評估內容)。本文將該方法論轉移至人工智慧系統設計。 我們提出的貢獻包括:從聖訓學概念到多智能體管線的形式化映射、實現主張鏈與評級敘述者註冊表的關聯式結構、結合鏈評級與內容批評的決策矩陣,以及在來自真實物理教科書的兩萬條主張上的評估。評估結果驗證了最弱鏈隔離與獨立鏈佐證的有效性;同時報告了評級恢復迴圈的部分失敗——該機制未能識別出最高錯誤率的敘述者;另有兩項分析結果無法得出結論,其中包括一項該框架因無法觸及對照內容批評者而未能完成的匹配覆蓋比較。本文自始至終明確指出哪些主張有證據支持,哪些尚無證據支持。
隱蔽,這門在不暴露自身存在、能力或所收集情報的情況下達成目標的技藝,是區分高水準操作者與可被偵測操作者的關鍵。頂尖安全研究員與先進持續威脅(APT)能在不被察覺的情況下達成目標;自主代理逐漸接手同樣的攻擊任務,但它們是否也繼承了這套實戰技藝?我們提出StealthBench,這是一個衡量自主攻擊安全代理在六個操作安全(OPSEC)維度上之操作隱蔽能力的基準測試。我們從真實的漏洞獎勵計畫與紅隊演練軌跡中,萃取出11個經人工驗證的OPSEC失誤事件,並將其擴展為14個Docker化的任務場景。在這些場景中,代理雖然找到了真實漏洞,卻犯了不符標準操作技藝的隱蔽失誤:將憑證嵌入公開上傳內容、刪除生產資源以證明存取權限、強行添加無關使用者來展示競爭條件(race condition)等。 我們使用一個由三個大型語言模型(LLM)組成的評審團(採多數決投票)來評估代理的軌跡,衡量安全成功率(成功解決且保持隱蔽)、隱蔽求解率(Stealth@Solve,即成功解決案件中的技藝品質),以及魯莽求解率(雖解決問題但暴露行蹤)。結果顯示,沒有任何模型的安全成功率(結合任務完成與隱蔽性的複合指標)超過54%,證實OPSEC失誤在各模型系列中均系統性存在。我們將StealthBench作為公開基準測試釋出,以支援開發具隱蔽意識的代理,以及為自主攻擊安全部署提供自動化的OPSEC監控。互動式排行榜、評估工具與資料集均可在 https://stealthbench.com 取得。
大语言模型(LLM)代理正越来越多地被应用于真实安全运维场景中,能够访问主机工件和命令行界面(CLI),因此对其安全能力进行全面评估至关重要。然而,现有的网络安全基准测试主要聚焦于攻击发生前的"预入侵"设定——代理在攻击开始前被置于一个干净、理想化的环境中。这导致"被入侵后"的设定未被充分探索。为填补这一空白,我们提出了SecRespond,这是首个用于评估LLM代理在"被入侵后"事件响应工作流中表现的基准测试。代理需要基于受损主机的取证磁盘快照,以及主机安全产品报告的告警、漏洞扫描和基线检查结果,生成入侵取证报告、基线风险评估报告、漏洞风险评估报告,并制定修复方案。我们基于10个网络靶场实例化该任务,每个靶场由一台不同的受损云主机构建,涵盖4种入侵入口类型、21种ATT&CK技术及5种操作系统。我们在OpenCode代理框架上评估了23个前沿LLM。实验结果表明,尽管当前代理能够可靠地揭示告警暴露的问题,但在主动调查磁盘中静默入侵行为、生成全面且经过验证的修复方案方面仍存在困难——没有任何模型能在单个靶场上实现完全的检测与修复。这揭示了构建用于真实世界事件响应代理的根本瓶颈。该基准测试已在 https://github.com/Alibaba-NLP/qqr/tree/main/data/secrespond 公开提供。
现有的自回归视频蒸馏方法通常采用基于分布匹配蒸馏(DMD)的多阶段流水线。然而,这些方法通常将初始化阶段与DMD阶段解耦——两者追求不同的目标分布——并主要依据VBench等视觉评分来评判中间学生模型。本文从分布视角重新审视这一设计。鉴于分布匹配损失具有模式寻求特性,良好的初始化应匹配目标DMD教师模型的模式覆盖范围,而非仅仅追求高质量。为分析此问题,我们提出一种分布评估协议,在共享潜空间中衡量学生与教师分布之间的精确度和覆盖度。该协议揭示了视觉评分所隐藏的差异:某些初始化达到高精确度但覆盖度低,导致优化效果欠佳;而覆盖模式的初始化则保留更广的支持范围。此外,即使目标分布已对齐,DMD的反向KL目标在训练后期仍会驱动学生模型趋向教师模型的高概率区域,从而降低覆盖度和多样性。为解决此问题,我们提出联合蒸馏方法,将DMD的模式寻求目标与基于一致性蒸馏的模式覆盖约束相结合。实验表明,我们的方法提升了生成质量、覆盖度和多样性;值得注意的是,即使使用Wan-1.3B DMD教师模型,我们的方法仍优于使用Wan-14B优化的基线,凸显了分布对齐在自回归视频蒸馏中的重要性。