每日精選AI研究論文及翻譯
技能是軟體代理程式中一種有用的抽象概念,能將人類與代理的經驗轉化為可重複使用的程序性知識。然而,現有的技能庫大多為手動撰寫、以文字為中心,或衍生自代理軌跡,導致教學影片及其他多模態人類資源未能充分利用。我們提出 RESOURCE2SKILL 框架,該框架將多模態資源(包括教學影片、儲存庫、文章及參考素材)提煉為軟體代理程式可執行的技能。RESOURCE2SKILL 將這些技能組織成一個分層式多模態技能維基,每個條目結合結構化文字、程式碼、視覺範例、後設資料及來源資訊。這種設計能保留來自不同資源的互補訊號:影片捕捉時間序列操作與視覺效果,程式碼捕捉可執行的工具模式,而文章或素材則提供概念與風格基礎。在推論階段,代理程式從維基中檢索並組合相關技能;若覆蓋範圍不足,相同的建構運算子可線上獲取新技能。在七個實際創作文領域中,RESOURCE2SKILL 相較於無技能代理程式,平均總分提升 11.9 個百分點,並在 28 個主要聚合模型-領域組合中的 26 個優於強基線。消融實驗證實了多模態技能格式、分層組織、來源多樣性、選擇策略及線上獲取的價值。
圖形檢索增強生成(GraphRAG)能為大型語言模型注入結構化知識,但現有系統僅透過單次提取過程建構知識圖譜,導致實體雜訊多且檢索脆弱。RAGU 作為開源模組化圖形檢索增強生成引擎,透過將提取與整合分離來解決此問題:實體與關係經過兩階段類型化提取、基於 DBSCAN 的去重、大型語言模型摘要以及 Leiden 社群檢測。一個關鍵洞察推動了緊湊型提取器的設計:管線內大型語言模型所需的技能——理解、提取、基於上下文推理——這些語言技能隨模型規模增長的幅度遠低於事實性世界知識。據此,我們訓練了 Meno-Lite-0.1,這是一個針對語言技能優化的 7B 模型,在知識圖譜建構上超越 Qwen2.5-32B(相對和諧平均提升 12.5%),並在英文圖形檢索增強生成任務上與其持平。在 GraphRAG-Bench(醫學)上,RAGU 在每個事實層級檢索到最完整的上下文(證據召回率最高達 0.84,對比 ≤0.76),並在合成任務上超越 HippoRAG2;而在多跳事實性問答中,HippoRAG2 的明顯優勢被證明主要是答案格式造成的假象。RAGU 可通過 `pip install graph_ragu` 安裝,運行於單張 GPU,並以 MIT 授權釋出。原始碼公開於 https://github.com/RaguTeam/RAGU,而 Meno-Lite-0.1 模型可從 https://huggingface.co/bond005/meno-lite-0.1 取得。
我們介紹 Loopie,這是目前為止最強大的循環式 Transformer 系列。Loopie 系列包含兩個混合專家(MoE)模型:一個 200 億參數模型(20B,其中 20 億為活躍參數),以及一個 60 億參數模型(6B,其中 6 億為活躍參數)。循環式 Transformer 長期以來面臨一項挑戰:若預訓練計算量增加 N 倍,將參數量提升 N 倍通常優於將模型循環 N 次。Loopie 成功解決了這項挑戰。大量的消融實驗(包括與普通 30B-A3B 模型的比較)顯示,在相同計算預算下,Loopie 明顯優於標準 Transformer 基準模型。我們新穎的後訓練流程賦予 Loopie 強大的推理能力。在 2025 年國際數學與物理奧林匹亞競賽中,Loopie 無需使用工具便達到了金牌水準。
我們推出小米機器人1號,這是一個基礎的視覺-語言-動作模型,具備兩項核心能力:(1) 能遵循多樣化的語言指令,在未見過的環境中開箱即用地執行廣泛的行動操作任務;(2) 能以最少微調資料高效適應新穎的下游任務。我們提出兩階段訓練方案,包含預訓練與後訓練。在預訓練階段,我們透過在超過10萬小時的真實世界操作軌跡(以UMI設備收集)上進行訓練,賦予模型廣泛且通用的動作生成能力。關鍵在於,我們開發了一套可擴展的自動標註流程,能以描述場景狀態變化的自然語言註解軌跡片段,為動作學習提供豐富且精準的條件。在後訓練階段,我們旨在將這些能力與機器人本體以及人類自然用以提示機器人的命令式指令進行對齊。大量實驗展現了強大的擴展行為。小米機器人1號在預訓練期間,隨著資料規模與模型大小的增加而持續進步。此擴展行為直接轉移至後訓練階段,更強大的預訓練模型能在未見過的環境中帶來更佳的開箱即用真實機器人表現。此外,小米機器人1號可作為一個強大的機器人基礎策略,在複雜、靈巧的任務上能高效微調,展現高資料效率。在多個模擬基準測試中,小米機器人1號超越了當前最佳方法。值得注意的是,它在RoboCasa365上以57.6%的成功率締造新基準,超越了先前的46.6%最佳成績。此外,它在RoboDojo上取得平均20.07分,大幅優於先前的最佳成績(13.07)。程式碼與模型檢查點將會釋出。專案頁面:https://robotics.xiaomi.com/xiaomi-robotics-1.html
超連接(HC)將Transformer的殘差流擴展為N條並行流,提供一種超越模型寬度和深度的記憶體擴展方式。流形約束超連接(mHC)在規模上穩定了此公式。從N=1到N=4的巨大增益表明,殘差流擴展是一個有前景的擴展維度。然而,現有的HC系列方法通常在N=4止步。我們的實驗揭示了原因:將mHC擴展到此點之外會產生遞減的效能增益和急劇增加的訓練成本。我們將此限制歸因於兩個瓶頸:寫回資訊不足以應付不斷增長的串流數量,以及殘差混合生成的成本與N呈立方擴張。為了解決這兩個瓶頸,我們提出了xHC(擴展超連接),這是首個在N=4之外實現有意義擴展的HC系列方法。xHC結合了時序特徵增強以實現更豐富的寫回,以及稀疏殘差流架構,該架構僅更新N=16條流中的k=4條,同時保留對完整殘差狀態的密集存取。在18B和28B MoE模型上,xHC帶來了強大且一致的下游改進。在一個18B MoE模型上,與mHC相比,xHC將平均下游分數提升了4.0分,同時僅在原始基線之上增加了適度的訓練FLOPs。縮放定律實驗顯示,原始方法和mHC分別需要xHC的1.50倍和1.19倍計算量才能達到相同的損失。實際的大N訓練還需要控制來自擴展殘差狀態的記憶體流量。因此,我們引入了xHC-Flash,它將每子層的記憶體流量從73.5C降低到40C,與mHC在N=4時所需的34C相當,同時保留了完整xHC的增益。xHC和xHC-Flash共同使大N殘差流擴展在LLM預訓練中變得有效且實用。
醫療領域涵蓋高風險溝通、專家推理及工作流程執行,然而能夠同時涵蓋這些應用場景的專業大型語言模型仍屬少數。一個醫療模型必須能夠處理病患諮詢、基於文字與影像的臨床推理、互動式診斷,以及使用電子健康記錄工具。這些能力在不同面向會產生不同的失效模式,針對單一任務的狹義更新可能導致其他任務表現下降。我們提出 Cura 1T,這是一個透過人工門控自我演化迴圈訓練的醫療專業大型語言模型。在每個演化回合中,訓練代理會規劃一個目標能力、訓練模型、評估基準軌跡,並根據觀察到的失敗案例調整資料混合。這個以資料為中心的迴圈透過有針對性的合成與精選範例來改進模型,而非僅進行一次通用醫療資料更新。在醫療評測套件中,Cura 1T 在頂尖基準模型中排名居首或接近頂尖,同時在跨領域推理與代理型基準測試中仍保持競爭力。
同策略蒸餾是強化學習中的一種替代性後訓練方法,透過教師模型提供的詞元層級監督,來減輕獎勵模型所施加的限制。儘管同策略蒸餾已在多種場景中被研究與應用,其基本設計仍未充分探索。本文提出一種新的蒸餾獎勵,稱為增量訊號,用以取代直接模仿教師的輸出分佈。增量訊號定義為教師模型與其進行推理能力指令微調前的基礎模型之間的差異。因此,它捕捉了推理微調所帶來的變化,並提供更直接的訊號以轉移推理能力。透過大量實證證據,我們證明增量訊號能顯著提升同策略蒸餾,並將此新蒸餾方法命名為同策略增量蒸餾(OPD^2)。在數學、科學與程式推理基準測試上的實驗結果顯示,OPD^2 一致優於傳統的同策略蒸餾,使推理大型語言模型僅需短暫的後訓練即可達成優異表現。程式碼將於 https://github.com/naver-ai/opd2 提供。
大型語言模型(LLMs)正在將推薦系統從對歷史行為中共現模式的比對,轉變為對驅動行為意圖的推理。RecGPT-V1 在淘寶上率先實踐此範式,以用戶理解為核心;RecGPT-V2 則透過協調式多智能體推理將其規模化;兩者均已部署於生產環境,並在使用者體驗與商業成效上持續帶來正面效益。然而,大規模運行 RecGPT 揭示了三大挑戰:(1) 無狀態行為建模——每次請求都需重新處理完整用戶歷史,浪費計算資源且捨棄先前分析結果;(2) 標籤至物品的資訊瓶頸——以自然語言標籤作為用戶理解與物品錨定之間的有損通道;(3) 低效率的顯式推理——冗長的思維鏈導致不可接受的延遲與計算開銷。 我們提出 RecGPT-V3,一種具狀態的混合模態推薦系統,它同時運用自然語言進行開放世界知識推理,以及語義 ID(SIDs)進行具體物品錨定。記憶中樞維護結構化且持續演進的用戶記憶,將長期行為濃縮為精簡單元,使使用者建模計算量降低 55.8%。混合模態基礎模型允許 LLM 共同對文字標籤與 SIDs 進行推理,開闢一條通往物品空間的高頻寬通道。潛在意圖推理將冗長的推理過程內化為緊湊的可學習潛在標記,這些標記仍可解碼為可讀的解釋,使輸出標記成本降低 200 倍。在淘寶「猜你喜歡」資訊流中部署後,RecGPT-V3 在大規模線上 A/B 測試中持續取得成效:IPV 提升 1.28%、CTR 提升 1.00%、TC 提升 1.97%、GMV 提升 3.97%,同時將端到端服務資源消耗降低 52.4%。
程式碼審查有助於在程式碼整合前維護軟體品質,但同時也為人工審查者帶來沉重的工作負擔。隨著生成式人工智慧成為軟體開發的一部分,程式碼審查正從以人類為主的審查流程,轉向由大型語言模型(LLM)審查者與AI代理審查者共同參與的AI輔助審查流程。然而,我們仍缺乏關於此轉變如何影響審查效率與審查品質的實證證據。在本論文中,我們研究了來自207個GitHub專案的102萬份已審查拉取請求,這些專案經歷了三個程式碼審查時代:以人類為中心的審查、LLM輔助審查,以及代理式程式碼審查。我們識別出三種AI審查者的採用模式:逐步AI採用、快速LLM採用,以及快速AI代理採用。我們進一步將拉取請求審查討論建模為審查者互動序列,以描述人類、LLM與AI代理審查者在審查過程中如何協作。結果顯示,涉及AI代理的協作模式,特別是那些由AI代理發起或涉及多位AI代理的審查,在逐步AI採用與快速AI代理採用下,與更快速的審查決策相關聯。然而,這些效率提升並未轉化為更好的審查品質。我們也發現,審查活動與拉取請求類型在各個時代仍屬重要因素,而一旦LLM與AI代理審查者參與後,人機協作模式便成為解釋審查效率的最強因子。這些發現為設計既能提升效率又不削弱審查品質的AI輔助程式碼審查流程提供了實證指引。
強化學習(Reinforcement Learning, RL)已成為改善大型語言模型(Large Language Models, LLMs)在複雜推理任務上表現的核心方法,然而,RL 的後訓練階段大多與其之前的預訓練階段分開研究。因此,兩個基本問題仍未解決:(1)預訓練的選擇(模型大小、數據)如何影響 RL 運算的效益回報,以及(2)RL 實際對模型做了什麼?這些問題在標準的大型語言模型設定中難以研究:預訓練語料庫龐大且不受控,使得難以將行為歸因於預訓練或 RL,而對兩個階段進行系統性的運算量掃描則成本過高。為了解決這些挑戰,我們使用西洋棋作為一個受控的測試平台,來研究從預訓練到後訓練的完整流程中的推理能力。我們遵循標準的大型語言模型訓練流程:先在人際對弈的西洋棋棋譜上預訓練參數量從 5M 到 1B 不等的語言模型,接著在合成推理軌跡上進行監督式微調(Supervised Fine-Tuning, SFT),最後對具有可驗證獎勵的西洋棋謎題執行 RL。透過這個框架,我們發現:在給定的 RL 運算量下,RL 後的表現可以透過預訓練損失來良好預測,而 RL 獎勵曲線的斜率大致上與預訓練的 token 數呈線性增長。除了規模效應之外,我們還發現 RL 並非僅僅強化 SFT 策略:在簡單的謎題上,它放大了 SFT 策略原本就已偏好的正確走法;而在困難的謎題上,它則浮現出 SFT 下幾乎不存在的正確走法。我們進一步測試這些發現是否能夠遷移至西洋棋以外的領域,方法是在數學領域文本上訓練一個 1B 參數量的語言模型,結果出現了相同的預測模式:預訓練時間更長的檢查點能達到更高的 RL 後表現,並且在 RL 下改善速度更快。總而言之,我們提供了預訓練與 RL 之間介面的量化描述,以及一個用於研究從預訓練到後訓練完整流程中推理科學的受控測試平台。
在本报告中,我们介绍Qwen-Music——一款强大的音乐生成模型,能够生成具有高度音乐性与高保真度、并包含完整人声演唱的歌曲。Qwen-Music支持两项核心任务:文字转音乐生成(Text to Music Generation),即根据文字描述、歌词及音乐属性创作全新歌曲;以及翻唱生成(Cover Song Generation),即用不同的风格和声音特征重新演绎现有歌曲。在架构上,Qwen-Music整合了三个核心组件:Qwen-Music-Tokenizer、Qwen-Music-LLM 和 Qwen-Music-Render。Qwen-Music-Tokenizer将音频压缩为25 Hz单码本流的音乐语义标记(Music Semantic Tokens),这些标记保留了语义与旋律信息,供大语言模型预测。基于这些标记,Qwen-Music-LLM进行自回归音乐语义建模,其关键创新在于一种基于旋律标记的链式推理(Melody-CoT)机制:在生成整首歌曲之前先规划旋律,从而提升创造性、音乐性、结构连贯性,并支持基于参考音频的旋律克隆。为克服离散语义标记在保真度上的局限,Qwen-Music-Render执行生成式立体声渲染,丰富声学细节,产生高保真立体声波形。最后,我们在超过500万小时的多语言音乐数据(涵盖数百种语言)上训练了Qwen-Music-LLM。我们首先应用质量感知的预训练课程,然后采用渐进式后训练——包括监督初始化、离线直接偏好优化(DPO)和在线生成式自我偏好优化(GSPO)——以进一步提升音乐性和指令遵循能力。在600条中英文提示的评估中,Qwen-Music在16项客观音乐性与音频质量指标中,有13项达到最先进水平。专业评估员也更倾向于选择Qwen-Music而非领先的专有系统。在翻唱生成任务中,Qwen-Music比领先的专有系统更准确地保留参考旋律。
在模型—框架協同演化下,框架不僅是推理時的支撐,更是數據生成組件,其執行軌跡可塑造未來的基礎模型。這推動了框架在環學習:優化框架以兼顧即時代理效能與未來模型訓練所用軌跡的品質。然而,持續更新提供者構建的支撐成本高昂且耗費人力。因此我們研究,以任務特定方式優化使用者構建的框架,是否能在保持運算輕量且僅需少量更新迭代的情況下,提升執行軌跡品質。為此,我們引入遞迴框架自我改進(RHI),將框架表示為代理循環的提示層級規範,並利用其自身修訂歷史上的成對反饋進行迭代精煉。在橫跨量化金融、機器人學與藥學的30個合成機器學習研究任務中,僅需少數RHI迭代即可大幅提升低推理努力代理的效能上限,超越對應的最大推理努力設定,同時將推理成本降低多達60%。我們證明這些增益主要源自透過更有效的代理間資訊流來改善任務特定上下文管理,而非更長的推理軌跡。最後,我們將此行為形式化為RHI隱含最佳化目標的資訊理論假說,提出RHI作為模型—框架協同演化範式下持續學習的實用演算法。
Muon在大型預訓練中與AdamW競爭力相當,但其在強化學習(RL)後訓練階段的價值仍不明確。我們透過在ALFWorld環境中使用Qwen2.5-0.5B-Instruct進行單一種子匹配比較,研究原始Muon在稀疏獎勵的智能體強化學習(agentic RL)中的表現。在分組內分組策略優化(GiGPO)下,僅對隱藏權重矩陣應用Muon可將最終視窗驗證成功率從0.290提升至0.546(增幅達88%);而高學習率的AdamW控制組則未出現更新後的成功。此效果取決於優勢估計器與學習率。在學習率3e-5時,Muon將GRPO從0.161提升至0.268,而GraphGPO的晚期視窗差距則接近飽和。在學習率1e-5時,GraphGPO搭配Muon可達到0.901,並將標準化驗證AUC從0.399提升至0.556,且分別提前30次與60次更新即達到0.5與0.75的成功率。這些探索性結果顯示Muon能為智能體強化學習帶來益處,並激勵我們聯合研究策略優化器、優勢估計器與學習率。多種子與跨任務驗證仍為待解決的課題。
我們提出 S1-Omni,一個用於科學理解、預測與生成的統一多模態推理模型。AI for Science (AI4S) 透過領域專用模型、工具增強的 LLM 以及科學語言模型取得了顯著進展。然而,模型能力仍然高度分散,限制了對異質數據、科學定律與專家知識的聯合建模。S1-Omni 透過將這些能力整合到一個單一且連貫的科學推理模型中,填補了這一空白。S1-Omni 的架構建立在三個核心組件之上:科學數據的統一表示、自然世界知識對齊,以及領域特定任務的解碼。首先,S1-Omni 將自然語言指令與科學物件(包括 CIF、SMILES、蛋白質序列、光譜以及科學圖像)映射到一個共享的表示空間。其次,它將科學定律和專家知識融入數據構建與訓練過程中,使模型能夠依據科學證據進行推理。第三,它執行任務特定的解碼,以支援廣泛的應用,包括屬性預測、光譜到分子生成、蛋白質位點與結構預測,以及科學圖像生成與編輯。S1-Omni 在 S1-Omni-Corpus 上進行訓練,該語料庫涵蓋 200 項科學任務並包含數百萬個推理樣本,並在超過 60 個科學基準測試上進行評估。它在大多數基準測試上優於 GPT-5.5 和 Gemini-3.1-Pro,並在多項基準測試上達到或超越領域專用模型的表現。總體而言,S1-Omni 為實現統一的科學建模提供了一條實用路徑。
基於可驗證獎勵的強化學習(RLVR)通常使用熵來進行優勢塑造。然而,熵無法區分有用的不確定性與有害的混淆,這限制了其作為正確性訊號的有效性。我們提出對比策略優化(CPO),該方法利用參考引導與一般生成分佈之間的詞元級對比分歧,來實現感知正確性的優勢塑造。理論與實驗結果均顯示,此分歧能可靠地指示詞元級的正確性。我們進一步證明,在策略蒸餾是CPO的一個特例,其中後驗分佈由外部教師模型實例化。CPO也解決了零優勢問題。在領域內與領域外基準測試上的實驗表明,CPO在保持強大泛化能力的同時,顯著優於基於熵的RLVR方法。進一步分析顯示,正確與錯誤的回應分別自然支持探索與利用,而平衡兩者能達到最佳性能。
視頻生成模型通常依賴於由3D變分自編碼器(3D-VAE)學習得到的潛在空間。然而,傳統的3D-VAE主要針對像素級重建進行優化,這可能限制了其潛在變量所捕捉的語義與時空結構。與此同時,V-JEPA 2和VideoMAEv2等視頻基礎模型(VFM)展現出強大的視頻理解能力,但其凍結表徵能否轉化為緊湊、可重建且利於生成的視頻潛在變量,仍有待探索。針對此問題,我們提出VideoRAE,這是一種表徵自編碼器,利用來自凍結視頻基礎編碼器的多尺度分層特徵,並透過輕量級1D自注意力投影器進行壓縮。VideoRAE支援用於擴散變換器的連續潛在變量,以及透過多碼書高維量化用於自迴歸模型的離散token。在解碼階段,與凍結VFM教師模型的局部與全域表徵對齊目標,可提升語義保留能力,並實現無需KL正則化的訓練。實驗顯示,VideoRAE在連續與離散模式下均能實現強勁的重建效果。在UCF-101上,分別以AR和DiT生成器獲得40和93的類別到視頻gFVD最新最佳結果,同時收斂速度比競爭的自編碼器基準快約5倍。在一項受控的2B規模文字轉視頻研究中,用VideoRAE取代LTX-VAE可在相近設定下實現更快的收斂。這些結果驗證了凍結VFM表徵作為通用且利於生成的視頻潛在變量的有效性。模型與程式碼將於https://zhxie0117.github.io/VideoRAE發布。
儘管在資料理解與決策方面能力強大,自主資料科學智能體仍高度依賴試錯工作流程,其中涉及昂貴的計算成本。此瓶頸促使研究人員開發能在實際執行前預測資料科學操作效果的模型。本文提出「資料科學世界模型」概念,該模型透過預測當前工作流程狀態與候選操作條件下的環境狀態轉移,來模擬資料科學執行環境。我們進一步提出實用框架 DSWorld,該框架結合了結構化狀態建構、成本感知路由、輕量級實際執行,以及針對昂貴操作的基於大語言模型的模擬器。為支援訓練,我們建構了一個 8000 規模的轉移軌跡資料集,並引入「反思世界模型優化」,這是一種用於改善轉移預測的錯誤感知強化學習策略。實驗結果顯示,DSWorld 能將基於強化學習的智能體訓練加速約 14 倍,並將基於搜索的推理加速約 3 至 6 倍,同時保持具競爭力的性能;在轉移預測任務上,DSWorld 比最強的大語言模型基準高出 35.6%。程式碼請見 https://anonymous.4open.science/r/DSWorld。
免訓練上下文分割允許在推理時透過單張標註參考圖像引入新的物體類別,從而消除類增量學習所需的重新訓練與記憶體開銷。當前方法透過結合用於語義對應的視覺基礎模型與如 SAM 這類可提示分割網路來實現此目標。然而,其效能根本受限於跨圖像相似度圖的品質;參考圖像與查詢圖像之間共享的上下文背景會系統性地提升非目標區域的相似度,從而降低提示定位的準確性。我們提出 REBASE,一個明確抑制這些虛假上下文對應的免訓練框架。我們的方法從參考圖像中識別出低秩背景特徵子空間,並以封閉形式將參考與查詢特徵投影至其正交補餘上,從而得到更乾淨的語義匹配。接著,我們使用相似度加權的最遠點採樣生成正點提示,並搭配改良的密集相似度先驗。在無需任何訓練或參數更新的情況下,我們的方法在 PACO-Part、FSS-1000 以及跨領域數據集(如 ISIC2018)上,於免訓練方法中達到最新最佳表現,證明明確的背景子空間移除是一種高效的一次性定位原則。
我們提出 Audio-Visual Flamingo(AV-Flamingo),這是一個完全開源、最先進的音訊-視覺大型語言模型(AV-LLM),專為對音訊、影像與長格式影片進行聯合理解與推理而設計。與先前主要專注於短片段音訊-視覺大型語言模型不同,AV-Flamingo 的設計目標是理解與推理長期且複雜的真實世界(音訊-視覺)影片。為此,我們做出三項關鍵貢獻:(i)Audio-Visual-Skills,一個大規模的真實世界影片資料集,包含約 700 萬筆描述與問答訓練實例,特別強調時間性、組合性與跨模態的音訊-視覺推理;(ii)一種新穎的三階段課程學習策略,逐步訓練模型從短時程感知進展到長時程多事件推理;(iii)時序音訊-視覺交錯思維鏈(Temporal Audio-Visual Interleaved Chain-of-Thought),這是一個推理框架,能將中間推理步驟明確對齊到長音訊-視覺串流中的時間戳記,從而改進時間對齊與可解釋性。在超過 15 項音訊-視覺、全模態、音訊與視覺基準測試上的廣泛實驗顯示,AV-Flamingo 明顯優於同等規模的開源模型,並且與更大規模的開放權重模型及封閉模型相比極具競爭力,在某些任務上甚至超越它們,特別是在長期且複雜的真實世界音訊-視覺理解與推理任務上。除了基準測試的表現外,AV-Flamingo 還展現出強大的現實世界實用性與良好的遷移至未見過任務的能力,突顯其穩健性與泛化能力。
基於可验证奖励(如GRPO)的強化學習是當今推理模型的驅動力,然而它僅對最終答案進行評分。在處理難題時,這種方法訓練模型寫得更多而非思考得更好,因為推理過程本身從未被評分,且沒有標註何謂良好的思考。我們提出Agon,讓兩個相互競爭的模型互為對方的評分者。兩者嘗試解決同一問題;在交替角色中,一個模型起草解答,另一個則在解題時閱讀該草案,每個模型因勝過對方而獲得獎勵。為了取勝,模型必須在推理上勝過一個已看過其工作成果的對手,因此推理能力在訓練過程中隱式地被評判,無需過程標籤,也無需獎勵模型。由於兩個模型都被優化,每個模型都面臨日益強大的對手,這是單一模型強化學習所無法提供的。兩者只需實力相當且行為上存在差異。在推理階段,這對模型以訓練時的方式部署——一種兩階段級聯模式:一個模型起草,另一個在閱讀草案後給出答案。在Deepmath的困難子集上(使用Qwen3),該方法使GRPO的pass@1翻倍,約為未經訓練的混合智能體相對於同一基礎模型所獲增益的八倍。這一結果在競賽編程代碼及不同模型家族(Qwen3.5、Gemma 4)中均得到復現。目前,模型以文本形式交流;下一步是讓它們在潛在空間中共同推理。
自主談判代理人逐漸被部署於保險與採購等高風險場景中。雖然密碼學技術能保護明確揭露的約束值,卻未能應對一項更微妙的威脅:行為隱私洩漏——攻擊者可從可觀察的談判動態(如讓步軌跡、時機與收斂模式)推斷出私有約束。本文探討多輪談判協議中的行為差分隱私。我們設計了一種自適應隨機談判策略,可同時保證 (ε, δ)-差分隱私、要價序列的幾乎必然收斂(在對手保留價值允許的情況下達成協議),以及高度的談判實用性。在 3,000 場合成雙邊談判的評估中,我們的機制將攻擊者的推斷準確度降低了 43-50%,同時維持超過 90% 的談判成功率與實用性,證明了在不顯著損失效能的前提下,能夠實現強大的隱私保障。
安全性代理的評估通常著眼於在充裕推理預算下的峰值攻擊能力,側重漏洞發現、漏洞利用開發、滲透測試及CTF解題。此類測量雖有助益卻不完整:在實際運營安全中,每一次推理步驟、工具調用、遙測查詢與情報補充皆會消耗預算。我們透過成本-成功視角,在攻擊型Cybench挑戰與防禦型Splunk BOTS v1調查挑戰中評估語言模型安全性代理。不同於僅報告最佳情況的成功率,我們在固定成本層級下比較各模型,並按其推理支出與工具支出拆解表現。結果顯示紅隊與藍隊任務呈現不同的擴展規律。攻擊型CTF表現隨測試階段計算量增加而提升,且擴展後的開源權重模型可接近前沿專有系統,同時保持成本競爭力。防禦型SOC調查並未以相同方式擴展:其成功更依賴於紀律性的工具使用、遙測數據導航及選擇性情報補充,而非單純的推理預算。我們主張安全代理基準應同時衡量經濟效率與運營契合度,而非僅評估任務成功。具成本意識、貼近SOC實務的評估,能更清晰呈現哪些模型今日具有實用價值,以及防禦代理仍需改進之處。我們提供互動式網站展示結果:https://evals.frontier.security
視覺-語言-動作(VLA)模型根據視覺觀察與語言指令預測機器人動作。這些動作定義在機器人自身的3D座標系中,但多數VLA模型卻在相機座標系中觀察場景,導致場景觀察與動作定義之間的座標系錯配。在固定視角下,此錯配影響較小,因為策略能記住單一觀察到動作的映射關係;然而當大規模資料集匯集來自不同相機設定的示範資料,且策略必須在不同視角間泛化此映射時,錯配問題便更為棘手。我們提出以機器人為中心的點圖(robot-centric pointmaps)來解決此問題:此類影像的像素儲存場景點在機器人座標系中的3D座標。點圖在提供機器人座標系3D幾何資訊的同時,保留了預訓練2D VLA模型所需的密集H×W網格結構,因此僅需極小架構調整即可整合至現有VLA模型。在RoboCasa上,點圖同時改善了pi0.5與SmolVLA模型,並優於代表性的相機視角與3D感知基準方法。在真實機器人實驗中,當相機被移動至訓練期間未出現的位置時,點圖相較於僅使用RGB的策略優勢更加明顯。
我們提出自我驗證推理器(Self-Verified Reasoner, SVR-R1),這是一種多輪強化學習框架,能將模型自身的驗證轉化為多模態推理的學習訊號。針對每個查詢,模型使用相同權重提出答案,並發布二元自我裁決(是/否)。「否」會觸發第二次機會的重新思考;「是」或達到輪次上限則輸出最終結果,用以計算基於結果的獎勵。SVR-R1 以 GRPO 和非同步多輪展開框架實現,無需外部監督或輔助評估器。我們在視覺語言推理基準上評估 SVR-R1,結果顯示其在準確率上大幅超越強大的標準 GRPO 基準。訓練動態顯示對驗證的依賴性降低——驗證輪數減少,但測試準確率卻更高——這表明隨著策略內化自我修正,並透過我們的框架選擇最有信心的答案,驗證與生成之間的差距逐漸縮小。SVR-R1 橋接了推理時自我優化與 VLM 強化學習訓練中較少被探索的交叉領域,為自舉多模態推理提供了一個簡單而有效的方案。我們將開源 SVR-R1,以促進 VLM 領域的未來研究。
托卡马克聚变装置的等离子体诊断模型几乎普遍基于干净、完整的传感器数据进行评估。然而在实际运行中,聚变诊断系统经常出现故障:采集系统启动延迟、单个传感器失效,且信号中断恰好在等离子体破裂临近时集中发生。我们首次提出针对等离子体诊断机器学习的系统性鲁棒性基准测试,使用包含11,573次MAST放电数据的TokaMark数据集,评估了XGBoost、LSTM、Transformer及TokaMark CNN基准模型在六种基于物理的故障场景和三种插补策略下的表现。我们引入鲁棒性评分(Robustness Score, RS)实现跨架构的标准化比较。核心发现是:临近破裂时的传感器故障(在最终窗口时间步注入的损坏)导致序列模型性能崩溃(LSTM的NRMSE增加212%),而统计特征模型保持相对稳定(XGBoost增加37%)。前向填充插补几乎消除了随机丢失对序列模型的所有退化影响(LSTM从+57%降至约0%),但在窗口末端数据损坏时几乎无效。基于真实破裂时间戳的放电级别报警评估显示,在临近传感器故障下LSTM报警检测性能崩溃(TPR=0.00),而均值填充插补可将其恢复至TPR=1.00,这与NRMSE中观察到的模式完全相反。在所有架构中,等离子体电流被证实为最关键的单通道诊断量(移除后误差增加73%至140%)。代码、数据和预训练检查点已公开于https://github.com/Neerav-Gupta/tokamark-robustness。