每日精選AI研究論文及翻譯
對話系統(例如雙工語音語言模型,SLM)仍缺乏一個流式、準確且具備同理心的記憶系統作為其靈魂。我們提出VoiceMem,這是一個簡單的記憶架構,具備並行的資訊型左腦、情感型右腦,以及流式記憶輸入/輸出機制。我們進一步建構了一套完整的流程,涵蓋記憶感知的SLM訓練、長時程評估,以及採用可替換記憶後端的解耦部署。實驗與真實世界部署展現了三項優勢:i) 準確性:在top-5檢索下,左腦的表現比Mem0等經典系統在top-200時高出近30個百分點;ii) 情感與個人化:右腦結合短程與長程情感歸因及雙節點人格建模,在三個人物性格基準測試中達到最先進的效能,並比先前最佳系統的綜合分數高出4.29分;iii) 即時且低成本:VoiceMem在134毫秒內完成檢索,遠低於標準VAD延遲,在不增加額外對話延遲的同時,維持高準確度與低成本。這些結果顯示VoiceMem為即時、個人化且情感感知的語音互動提供了實用的記憶基礎。
近期研究表明,影片生成模型可以透過生成的幀展現出某種形式的零樣本視覺推理。然而,可靠的評估仍具挑戰性:基準應採用與當前影片模型視覺先驗一致的輸入,要求有效的演化過程而不僅是合理的最終狀態,並校準任務難度,使其既有挑戰性又部分可行。為此,我們提出了 VGI-bench,包含 27 個任務和 810 個實例,按任務領域與技能標籤的兩級分類法組織,用於對影片生成模型的視覺推理能力進行細粒度評估。我們的評估顯示,當前的生成系統能解決一部分視覺基礎推理任務,但遠未達到可靠程度,即使是最強的模型 Seedance 2.0,在我們的評估標準下也僅達到 51.0%。我們的分析進一步探討了輸出失敗模式、輸入條件敏感性、合成微調的性能遷移邊界,以及內部去噪視角所揭示的有限自校正能力:後續步驟主要是在完善早期假設,而非糾正推理錯誤。我們希望 VGI-bench 能有助於推動下一代影片生成模型的發展。網站:https://hexuan21.github.io/VGI-Bench/
科學智能體日益廣泛地分析數據、執行程式碼,並產出研究產物,然而多數基準測試僅著重於最終答案、孤立程式或單一領域。我們提出了 FrontierChallenge,一個跨領域基準測試,包含 300 個端對端科學工作流程。在本論文中,我們公開並評估了其中 97 項任務,涵蓋量子化學、分子動力學、材料表徵、分析化學、生命科學,以及電化學/環境等領域。每項任務皆提供固定輸入,並指定一組必需的科學交付成果。我們以三種智能體框架評估了十二個前沿模型。通過率(Pass Rate)衡量滿足完整完成標準的任務比例,而平均分數(Avg. Score)則反映部分進展。每個表現最佳的配置僅完成了 97 項已公開任務中的 20 項,通過率為 20.6%。部分進展轉化為完整交付的成效,在分析化學及電化學/環境領域尤為不佳:平均分數分別達到 87.6 和 94.9,但最高通過率僅為 4% 和 0%。在未通過的 Claude Code 軌跡中,有 75.5% 仍以聲稱完成的語言作結。這些發現表明,無論是高分部分進展,還是自信的完成聲明,都無法可靠地指示科學任務已完整交付,這凸顯了同時評估端對端工作流程執行與科學交付成果完整性的必要。
大規模並行模擬改變了離策略強化學習(RL)的訓練數據體制,對為數據有限重放設計的穩定器構成挑戰。透過八個基準測試系列的對照實驗,我們顯示這些穩定器依賴於數據體制:參數正規化有助於狹窄的重放覆蓋,但在數據豐富時限制了價值擬合;而裁剪雙Q在高吞吐量的操作任務中可以放寬。年齡偏置的重放加權在各個體制下均能提升學習效率,尤其是在網絡容量有限時。基於這些發現,我們提出了 WarpSAC,一個數據體制感知的離策略 RL 算法家族。WarpSAC 使用樣本權重衰減來實現高效利用,並提供兩個變體:WarpSAC-L(參數正規化開啟,裁剪雙Q)用於數據有限的 CPU 規模訓練,以及 WarpSAC-A(參數正規化關閉,單Q)用於數據豐富的 GPU 並行訓練。與 FlashSAC 相比,WarpSAC 在九個 CPU 規模環境中將標準化分數-步數 AUC 提升了 4.5%,在十四個 GPU 並行環境中提升了 23.1%。它將 UnitreeG1TransportBox-v1 的成功率從 19.8% 提高到 96.4%,在 MuJoCo Playground 上將平均標準化牆鐘時間 AUC 提升了 19.1%,並實現了比 FlashSAC 快 36.4% 的 Unitree G1 模擬到現實部署。這些結果表明,可擴展的離策略 RL 應根據可用的數據體制調整其穩定器。
智能體能力並非僅由模型本身決定。涵蓋記憶管理、規劃策略、動作協議與工具/技能編排的智能體框架,其影響力可能遠超底層基礎模型的貢獻。然而,框架設計至今仍依賴人工、針對特定任務,且本質上無法規模化。我們提出 JIT-Agent——一個框架智能模型,經訓練可為任意現成的智能體 LLM 即時合成任務自適應的智能體框架。我們將智能體框架形式化為可組合、機器可生成的產物,受固定四模組協議規範,並訓練 JIT-Agent 為指定任務定制框架、修復框架以確保穩定可靠的執行,以及透過從不斷擴充的既有框架配置存檔中蒸餾效能訊號來自我演化。配備 JIT-Agent 作為框架輔助工具,DeepSeek-V4-Flash 在 DeepSearchQA(+9.1)與 OdysseyBench(+4.3)上超越 GPT-5.6,而本已強大的 GLM-5.2 更獲得高達 +20.2 分的提升。在受控評估中,JIT-Agent 生成的框架在效能上可與 OpenCode 和 Claude Code 等成熟的智能體執行環境相抗衡,並持續提升 DeepSeek V4、Mimo-V2.5 與 Qwen3.6 等多規模模型系列的表現。據我們所知,JIT-Agent 是首個專為即時框架生成而設計的模型,確立了框架智能作為一種可訓練、可遷移且可累積的智能體能力維度,與模型規模擴展相互正交。
原生視覺推理將視覺生成視為推理本身的媒介:視覺狀態(即圖像和影片)不僅僅是被理解的輸入或被渲染的輸出,而是超越語言的問題求解的一等基底。然而,由於缺乏可擴展的訓練任務、可靠的回饋,以及跨生成基底的受控比較,進展仍然受限。在本工作中,我們提出 VBVR-Pro,一個閉環測試平台,使以生成作為媒介的原生視覺推理變得可訓練、可驗證、可最佳化且可實驗控制。1) 任務擴展。VBVR-Pro 將視覺推理轉化為包含 300 個程序化生成任務的受控任務空間。在 VBVR-Pro 上訓練的模型,在 RISE-Video、MME-CoF-Pro 和 BabyVision 等七個外部視覺推理基準上,展現出超越本套件的強大遷移能力。2) 可驗證獎勵。VBVR-Pro 為基於任務的評估提供了可驗證的獎勵評分器。透過對領先多模態大語言模型作為評判者的系統性研究,我們識別出當前流行的「視覺語言模型作為評判者」範式的反覆出現的失敗模式。相比之下,所提出的評分器植基於確定性、任務特定的規則,並實現了與人類判斷的細粒度對齊。重要的是,它們可作為大規模多任務強化學習的可靠獎勵訊號,並在各種視覺推理任務上展現出更強的強化學習後性能。3) 機制研究。VBVR-Pro 支援對超過 30 種圖像、影片和交錯生成器進行受控模態研究。我們的分析顯示,對於需要持續時空狀態追蹤的任務,影片生成仍然是最強的,而交錯生成則提供了一種計算效率高的替代方案。至關重要的是,消融實驗和探測表明存在對視覺推理至關重要的視覺原生軌跡。我們發布所有資料、模型、評分器和程式碼。
多教師在策略蒸餾(MOPD)透過最小化學生自身軌跡上的逐領域反向KL散度,將數個領域專家教師蒸餾至單一學生。現有方法通常會在訓練前固定逐領域數據混合比例,卻忽略了不同領域的收斂速度差異極大:有些領域早期即趨於停滯,有些則在整個訓練預算期間持續提升。因此,固定的混合比例會將計算資源浪費在快速收斂的領域上,並對收斂較慢的領域訓練不足。為了解決此問題,我們提出了 D^3-MOPD(針對MOPD的動態領域調度),這是一種零開銷的調度器,它重新利用訓練過程中已產生的逐領域反向KL信號,在線調整領域混合比例。透過在訓練進程之外異步運行,一個進程外監視器會定期追蹤每個領域的KL軌跡,估算剩餘提升空間與當前改進速率,並相應調整領域採樣比例,而無需修改核心訓練迴圈。我們的 D^3-MOPD 能自然擴展至任意數量的領域,且隨著更多領域引入更多樣化的收斂模式供調度器利用,預期收益也隨之增加。在一個從四個領域專家教師蒸餾而來的 Qwen3.6-35B-A3B 學生上,D^3-MOPD 縮小了學生與教師平均性能差距的 97%,而原始 MOPD 僅縮小 63%;它還以約三分之一的軌跡步數達到相同的峰值性能,並在七個基準測試中的三個上超越了專家教師。
基於提示的強化學習透過在每次回合前保留專家軌跡的前綴,讓策略從更接近成功的狀態開始探索,藉此解決長程智慧體任務中的獎勵稀疏問題。其效果取決於引導深度:也就是要保留多少軌跡。現有方法將此深度視為確定性純量。排程式方法對所有樣本共用單一數值,忽略每個任務的異質性;逐樣本探測則以額外回合為代價,分別估計每個樣本的深度。我們發現,有用的引導落在一個深度區帶內,其資訊量輪廓在帶中心附近近似高斯分布,而非集中在單一最適點。我們提出 Agent-G^2,一個高斯引導框架,針對每個任務從高斯分布中抽取深度,該分布的中央與離散度是根據已收集用於策略最佳化的回合線上估計,不需額外探測回合或學習深度預測器。中心結合全域基線與每群集難度,離散度追蹤群集內變異數。我們在 ALFWorld 與 WebShop 上使用 Qwen2.5-1.5B / 7B-Instruct 評估 Agent-G^2。在不到逐樣本探測三分之一回合成本的情況下,Agent-G^2 在 ALFWorld 上比最強的提示式、無提示式與 Aux-RL 基線分別高出 2.3 / 3.9 / 7.4 分。
近期研究提出了下一區塊推理強化學習(next-chunk reasoning RL),用以利用無思維鏈(no-CoT)資料——例如解題步驟與教科書推導等語料庫,這些內容富含推理但缺乏明確的思維鏈標註。該方法訓練模型產生隱式推理軌跡,並依據其預測下一個文字區塊的能力給予獎勵。儘管此方法前景看好,現有評估大多僅與傳統的監督式微調(SFT)基線比較,因此尚未釐清其收益是來自強化學習(RL)框架本身,還是來自更有效地讓模型接觸 no-CoT 資料。我們透過一項針對 next-chunk reasoning RL 的對照研究,並提出一個簡單但先前被忽略的替代方案:混合監督式微調(Mixed SFT),即在單一監督式微調階段中,同時使用 no-CoT 與長思維鏈(long-CoT)資料進行訓練,來回答這個問題。儘管 Mixed SFT 十分簡單,它在 RLVR(可驗證獎勵強化學習)後的效能上限卻明顯高於 next-chunk reasoning RL,且所需訓練運算量少了超過 60 倍。此優勢在域內數學推理與域外推理任務中均保持一致。此外,我們證明 RLVR 前較高的準確度並不一定會轉化為 RLVR 後較高的準確度,這凸顯了在完整後訓練流程的脈絡下評估 no-CoT 訓練策略的必要性。
影片生成正從孤立的片段進展到長篇敘事與互動式世界,這要求模型能夠保持角色身分、遵循使用者控制,並在長時間推演中維持穩定性。我們提出 JoyAI-Echo-1.5,一個統一的音訊-視覺生成系統,包含兩個專用變體。長影片變體引入了可組合的跨鏡頭記憶,該記憶會彙整多個先前鏡頭的視覺證據,以及從語音過濾後的全鏡頭音訊中提取的語者線索,從而在文字、影像與記憶條件的靈活組合下,實現持久的角色外觀與語音身分。世界模型變體將異質導航輸入轉換為校準的公制六自由度相機軌跡,並透過幾何感知的條件控制路徑注入,從而在靈活視角下實現與控制器無關的互動。為了支援高效能的長時程生成,我們利用漸進式教師強制,以及在自生成展開序列上的短時程與長時程自梯度強制,將雙向音訊-視覺骨幹網路轉換為因果少步生成器。實驗證明在兩種設定下均展現出強大的效能。JoyAI-Echo-1.5 在跨鏡頭一致性、視覺品質、文字對齊與語音保真度方面均優於現有的長影片基線模型。其世界模型變體在 WBench 上排名第一,平均得分為 81.7,並在 SANA-WM-Bench 上取得領先的視覺品質與長時程持久性。綜合來看,這些結果表明記憶、幾何控制與展開感知訓練為生成連貫的故事與持續演化的互動世界提供了實用的基礎。專案頁面:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/。
多教師在線策略蒸餾(M-OPD)已成為一種前景廣闊的範式,透過密集的詞元級獎勵監督,將領域專精的強化學習專家整合為單一的通用型學生模型。儘管其在實踐上取得了成功,但驅動多教師能力整合的優化動態機制仍未被充分理解,且明顯缺乏公開且可嚴格重現的完整方案。在本研究中,我們在 SmolLM3-3B-Base 上建立了一個具備神諭路由的受控 M-OPD 基準,將能力整合與路由模糊性分離開來。我們的研究揭示了顯著的能力整合差距:標準 M-OPD 相對於領域路由的神諭集成,僅能捕捉 35.6% 的可用改善空間,其中諸如指令遵循等簡潔任務更出現嚴重的性能衰退與過早停滯。關鍵的是,我們證明此一失敗並非源於梯度衝突,而是源於詞元級優化預算的嚴重錯配。此病理現象由三個正交因素驅動:跨領域的結構性序列長度差異、非均勻學習率導致的動態收斂漂移,以及非同步策略更新造成的多步獎勵陳舊。為解決這些失衡問題,我們提出了 Open-MOPD——一個整合詞元份額平衡、差距感知的動態預算分配以及學生獎勵刷新的原則性框架。這些機制共同系統性地恢復了跨領域平衡,將單一可部署學生的改善空間恢復率從 35.6% 提升至 83.4%。我們在學術界可負擔的硬體預算下,完全開源了端到端的後訓練方案、訓練軌跡與評估套件。
視覺-語言-動作(VLA)模型已展現出在機器人操作中的有效性,然而諸如 pi0.5 等最先進模型仍以單幀範式運作,限制了其保留過往觀測與發展精確空間感知的能力。在本文中,我們提出 StreamPI,一種串流多模態時序建模框架,在不引入任何額外參數的情況下,賦予單幀 VLA 時序推理能力。核心設計之一是指令錨定的時序建模。該方法將每個(視覺觀測,語言指令)配對視為一個原子時序單元:配對內的雙向注意力實現跨模態融合,而配對間的因果注意力則保持自回歸串流推論。這確保了語言指令在整個任務執行過程中作為持續的語義錨點。為縮小同步訓練與非同步真實機器人部署之間的差距,我們引入隨機間隔串流訓練策略:適當的幀間間隔(例如每 3 幀)能實現更快、更平滑的動作執行。此外,隨機化間隔進一步增強了對幀時序擾動的穩健性,支援實際應用中的非同步部署。更進一步,透過利用 LLM 骨幹的長度外推能力,StreamPI 無縫繼承預訓練的單幀權重,並支援靈活的單幀與多幀推論。涵蓋記憶依賴與精確感知場景的真實機器人任務實驗,以及模擬基準 LIBERO 上的實驗,均表明 StreamPI 在多樣化任務上優於 pi0.5。
多模態大型語言模型(MLLMs)在影片理解方面展現了強大的效能。然而,它們在此領域中遵循指令的能力仍未得到充分探索。現實世界的影片理解要求模型不僅能正確詮釋影片內容,還需滿足使用者指定的多樣化約束條件。現有基準測試主要側重於任務準確度而非指令遵循,使得這項能力未能獲得充分評估。為填補此缺口,我們提出 Video-IFBench,一個全面的基準測試,用於評估影片理解中的指令遵循能力,其中模型必須滿足使用者指定的多樣化約束條件,包括基於視覺與音訊內容的約束。我們開發了一套指令分類法,包含四種模板:單一任務、多任務、選擇及巢狀指令,涵蓋 32 種任務類型與 39 種人工設計的約束類別,遍及語義與格式要求。為降低標註成本,我們建構了一套半自動資料建構流程,結合 MLLMs、程式化處理與人工驗證,產出 1.5K 筆樣本。我們對超過 20 個近期 MLLMs 進行了大規模評估,結果顯示影片指令遵循對當前模型而言仍具挑戰性,尤其對於包含大量約束、語義約束,或需要根據影片內容選擇正確分支或路徑的複雜條件結構之指令更是如此。我們期望這項工作能促進未來在影片理解情境中指令遵循的相關研究。
世界模型旨在模擬複雜環境在動作與事件作用下的演化方式,然而現有的基於視頻的世界模型主要從視覺觀測中學習動力學——視覺觀測只能呈現結果,而非支配世界演化的底層知識、規則與機制。這使得模型難以維持持續性的後果,也難以支持連貫且開放式的演化。我們提出「程式世界模型」(Code World Model),這是一個將世界演化與視覺實現分離的框架,透過結合語言模型的推理與編碼能力以及視頻模型的生成先驗來達成。編碼智能體充當世界大腦,負責推理事件及其後果,並生成可執行的程式碼以維持持久的世界狀態並執行符合規則的演化。為了將可執行的狀態與視覺生成相連接,我們引入了一種代理表示,該表示編碼了逐幀的時空約束,並被編譯為代理視頻,進而引導視頻模型渲染高保真的視覺觀測結果。我們進一步開發了數據管線,用於從遊戲實況與真實世界視頻中建構對齊的代理-觀測對。在配對的遊戲數據上進行微調後,MiniMax-H3 能夠遵循由編碼智能體所構建的簡單互動世界中的代理式時空規範,同時保留豐富的視覺細節與動力學特性。這些結果展示了將程式碼用於持久世界演化、將視頻模型用於靈活視覺實現的潛力,為邁向開放式世界模型開闢了新的路徑。
視覺語言模型能產生流暢的回答,但這些回答可能缺乏足夠的視覺證據支撐:單一個未經支持的物件、圖表數值或中間推理,就可能使原本看似合理的回答失效。我們主張這是多模態後訓練中的信用分配失敗。標量結果獎勵能指示回答是否可被接受,但無法指出哪些視覺事實有充分依據、哪些推理步驟有效、或哪些指令約束被遺漏。我們提出「基於視覺評分量規的強化學習」(Visual Rubrics-Based Reinforcement Learning),將參考回答分解為原子命題,並依照視覺忠實度(VF)、推理一致性(RC)與指令遵循(IF)來評分生成回答。所產生的評分量規項目提供結構化的部分給分,並在可取得支持性證據片段時,將評分量規信用定位至對應片段。我們首先在公開的 OpenMMReasoner-SFT-874K 語料庫上微調 Qwen3-VL-8B-Instruct,取得 SFT 檢查點,沿用 OpenMMReasoner 的冷啟動資料配方。我們建構了 V-Rubrics 50K,這是一個包含 50,248 個範例的訓練集,來源為 17 個視覺接地資料源;我們先套用規則式篩選,再根據拒絕抽樣分數推導範例難度,最後使用 Gemini-3-Pro 以相同的結構化提示與協定對每個範例進行標註。我們基於同一個 SFT 檢查點訓練模型,使用逐元件、前綴局部化的評分量規信用。實驗顯示,我們以評分量規為基礎的 GRPO 在共同的 SFT 基線與僅使用答案的 GRPO 上均有改善,在知識導向與視覺接地推理基準上提升最為顯著。結果表明,評分量規是視覺後訓練中一種有用的獎勵抽象。
現代軟體系統在數十年的開發過程中累積了大量技術債,使得遷移成本高昂且大部分依賴人工。隨著編碼代理在錯誤修復方面日益強大,它們能否自主執行此類遷移?現有基準測試無法回答這個問題,因為它們只評估行為正確性,而不評估遷移是否實際發生。這導致了一個容易的投機取巧方式:代理複製原始實作以讓測試通過。我們將此稱為盲目性(Blindness)。為了解決這個問題,我們提出了 SWE Refactor Bench,一個包含 20 個全倉庫遷移、涵蓋 4 種類型技術債的基準測試。三階段評估協議同時衡量遷移完整性與行為正確性。(1) 遷移審計(Migration Audit)驗證遷移是否確實發生。(2) 行為測試(Behavioural Tests)使用固定測試套件衡量正確性。(3) 代理式驗證(Agentic Verification)使用 6 個獨立編碼代理為隱藏的行為差異生成有針對性的測試。在來自 8 個前沿模型和 26 種模型-努力配置的 520 次運行中,僅有 28 次運行(5.4%)通過全部三個階段,20 個任務中有 13 個未獲得任何被接受的解決方案,最佳模型(claude-opus-5)得分為 47.0/100。遷移完整性與行為正確性是兩種不同的能力:少數運行透過跳過遷移來保持行為,在遷移審計階段被攔截;大多數運行嘗試遷移但破壞了行為,在行為測試階段被攔截。代理無法交付完美的遷移:在通過遷移審計的 340 次運行中,58% 達到了固定檢查的 99%,但僅有 26% 達到 100%。代理能力因遷移類別而異:代理在建置工具鏈重寫上得分 31.4,但在語言重寫上僅得分 5.6。綜合這些發現,SWE Refactor Bench 可作為開發可靠全倉庫遷移編碼代理的嚴謹測試平台。
GUI智能體在Android裝置上部署時經常遭遇動態異常,從意外的彈出視窗到動作誤用,然而現有基準測試缺乏對智能體面對執行期異常時魯棒性的系統性評估。我們引入AnTrap,一個將動態擾動注入智能體執行軌跡的綜合基準測試。我們提出一個分類框架,將真實世界的異常組織為四個層級(狀態、思考、動作和回合),包含十個細粒度子類別,並開發了一條構建流程,在保留任務可解性的同時引入現實的對抗性條件。通過評估16個領先的GUI模型,我們揭示了對動態異常的普遍脆弱性,即使是目前最強的模型也遭受顯著的效能下降。此外,我們在原始環境和對抗性環境中進行GRPO訓練以驗證我們的基準測試,將環境可學習的異常與推理瓶頸型異常區分開來。研究結果表明,雖然狀態層和動作層的單步陷阱在很大程度上可以通過對抗性強化學習來解決,但深層語境陷阱,例如狀態死鎖,則暴露出僅靠在有陷阱的環境中訓練無法克服的內在局限性。
大型視覺-語言模型在介面轉程式碼生成方面展現出顯著進展,然而其在測試時的自我演化仍不穩定。我們首先發現一個根本性障礙,稱之為視覺修復耦合:局部程式碼修改可能透過佈局、樣式和元件依賴關係傳播,在修正某一視覺不一致的同時,卻導致先前符合要求的區域退化。為了解決此問題,我們提出 RubSE,一個基於評分量表引導的自我演化框架,利用評分量表將視覺回饋表示為結構化的視覺修復語境。在每一輪求精過程中,RubSE 生成具類型的候選評分量表,選擇一個優先修復目標,並將先前選取的評分量表儲存為歷史紀錄,從而引導每次修訂朝向範圍明確的視覺修復,同時抑制重複或過度廣泛的變更。在六個視覺-語言模型和三個介面轉程式碼基準上的評估顯示,RubSE 在最終輪次和最佳輪次設定下均大幅優於樸素的自我演化方法,實現更穩定的求精軌跡和更高的軌跡層級效能上限。進一步分析表明,RubSE 透過改善對嚴重視覺退化的恢復能力來緩解軌跡崩潰,且更強的評分量表生成器能將有效的視覺修復指引遷移至較弱的程式碼改進器。
編碼代理執行長期運行的任務,涵蓋數十次模型呼叫、工具使用及程式碼編輯。隨著這些運行逐步展開,使用者面臨一項實際的成本與品質之間的權衡:當較便宜的模型難以應付時升級至更強的模型,或在艱難的推理階段完成後降級。每次切換都要求接收方延續由另一模型所產生的非原生軌跡。我們研究此交接如何影響品質與成本,以及改變接收方所繼承的軌跡資訊如何左右最終結果。我們使用來自Claude和GPT系列的成對低成本、低能力(LC)與高成本、高能力(HC)模型,改變交接方向、時機及介面,並比較完整軌跡轉移、壓縮,以及在保留儲存庫狀態的前提下移除軌跡這幾種做法。在兩個模型系列中,完整軌跡升級僅能恢復LC到HC品質差距中不到一半的品質,卻同時帶來可觀的成本溢價。我們將此成本-品質懲罰稱之為「交接稅」。相較之下,降級則提供了有利的成本-品質平衡點。有趣的是,偏好的介面也隨交接方向而反轉:減少LC模型的軌跡資訊可提升升級品質,而移除HC模型的軌跡則會降低降級品質。
現代軟體——從外掛系統到自我演化的代理支架——日益需要動態組合,但其形式基礎仍欠完備。我們識別出此問題的兩個正交維度:時間可組合性(temporal composability),即在移除元件時完全還原其副作用的能力;以及空間可組合性(spatial composability),即宣告並以反應式方式管理元件間依賴關係的能力。我們將經典的效果(effect)與共同效果(coeffect)概念提升至執行時期機制,以處理這兩個維度。具體而言,我們形式化了可還原效果(revertible effects),其中每一次上下文轉換皆伴隨一個逆變換,由執行時期持有,從而在單一元件內確立時間可組合性。我們形式化了反應式共同效果(reactive coeffects),其中每一次上下文變更皆根據元件的共同效果規格加以分類,以驅動其啟用與停用,從而在單一元件內確立空間可組合性。接著,我們將效果上下文與共同效果上下文統一為單一上下文型別,並透過該型別中介所有效果與共同效果,形成一種我們稱之為「上下文範式」(context paradigm)的規範;此中介導出一種觀察等價,在此等價之下,不同元件的效果得以交錯而不互相干擾。將這些機制組合為「元件」的概念後,我們提出一個動態組合的演算,其後設理論將時空可組合性從單一元件推展至整個交錯元件系統。我們在 Cordis 中實作了這些想法;Cordis 是一個時空可組合性的後設框架,提供具效果追蹤與共同效果解析的核心函式庫,以及具組態調解與熱模組替換的宣告式元件載入器。
擴展Transformer語言模型在表達力與記憶體效率之間造成了內在的張力。雖然各層獨特的權重保留了功能特化——從輸入錨定到抽象精煉——但這會產生可觀的記憶體佔用。相反地,標準的深度共享會強制執行均勻的轉換,消除表徵多樣性並降低建模品質。我們提出了門控遞迴Transformer(Gated Recurrent Transformer),一種遞迴深度Transformer架構,其中固定深度的前奏與尾聲區塊包夾著一個迭代R次的共享核心。受門控遞迴神經網路的啟發,我們採用輕量投影與逐元素更新閘——以隱藏狀態、固定前奏輸出及每一步重新採樣的雜訊為條件——來調制遞迴更新。這使得模型能夠在多次遞迴中將輸入特化到相同的少數幾層,而非需要許多獨特層來實現功能多樣性。在等FLOPS約束下,一個3層的門控遞迴Transformer在相似的訓練與推論FLOPS下,達到了12層GPT-2 Small基線的準確度,並在所有九個按預算縮放的單元中領先MoR與重尾深度採樣;在中型與大型規模下,它在標準token預算下接近密集模型的品質,且在中型規模下,一旦預算加倍,便能超越密集模型。在等參數量約束下,更深的遞迴在匹配的參數與資料預算下達到了2.76的驗證損失,而非遞迴對應模型為2.84。我們的結果表明,自適應深度重用是一種以參數換取品質的原則性策略:在大規模下,參數減少63%,峰值解碼記憶體減少59%,而編譯生成延遲僅增加10%。
多臂協作正成為具身操作中的核心能力。近期的視覺-語言-動作(VLA)模型整合了感知、語言與控制,但多數模型將語言表示為單一全局指令,且未提供明確機制來分配與組合各機械臂的特定行為。此設計限制了模型遷移至與訓練期間所觀察到的不同的協作模式。我們提出 MA-VLA,一個透過原子動作分配實現多臂協作的統一框架。MA-VLA 將協作行為分解為中層原子提示,並將其分配至各機械臂,從而實現顯式的子目標指定以及跨任務的組合式重用。為減少對固定執行角色的依賴,我們引入了 Arm Shuffle,這是一種在訓練時對每個機械臂的觀測、狀態與所分配的原子提示進行置換的方法。此置換強制模型遵循與角色無關的指令,並支持重組為未見過的協調模式,我們稱之為多臂組合式泛化。我們亦構建了一個基準測試,其中測試時的協作模式並未出現在訓練集中。在模擬與真實世界的評估中,先前的最先進VLA模型在這些未見過的協作場景下大多失敗,而 MA-VLA 則始終成功。這些結果表明,結構化的、按臂的原子動作分配為多臂具身系統中的可擴展泛化提供了實用途徑。程式碼、模型與資料可於 https://github.com/zhangzaibin/future-robots 取得。
串流自迴歸擴散模型實現了即時、長時程的視訊生成,但其訓練目標僅最佳化局部幀預測,而非一個連貫世界的幾何與動態:長時間的展開會累積幾何漂移,並退化為靜態或非自然的運動。近期的雙向方法利用基於3D高斯潑濺重建的獎勵訊號來解決此問題。然而,單一剛性3D重建無法建模動態場景,因此該評論器會將真實的物體運動視為重建誤差而加以懲罰,且可透過凍結視訊將其最大化。此捷徑在自迴歸(AR)設定中尤其有害,因為每個區塊都可能傳播已靜止的配置。在本工作中,我們提出Stream4D,以明確建模場景動態的前饋4D重建獎勵取代靜態評論器,使連貫運動能獲得高一致性獎勵。為進一步引導運動幅度與品質,我們加入一項運動先驗,獎勵自然的場景流幅度,同時懲罰抖動與非剛性偽影。我們最終的方案結合了這兩項以及一個輕量級感知錨點。在各種自迴歸視訊骨幹網路與各種生成時程下,Stream4D提升了4D重建品質、更有效地保留運動,並實現更高的人類對齊偏好度。專案頁面:https://banyuanhao.github.io/Stream4D/
基於機器學習(ML)的0.1°全球天氣預報模型的發展受到高解析度資料可用性有限的制約,因為數十年的再分析資料僅提供0.25°解析度。現有方法在有限的0.1°樣本上微調0.25°預報模型,但我們表明,此種遷移受到粗解析度預報固有的不可逆資訊損失所阻礙。為此,我們提出BaguanHR,一個將重點從遷移模型轉向遷移資料的框架。我們首先證明,超解析度(SR)的條件熵和輸入放大均低於預報,因此是更穩健的解析度遷移工具。藉由逐變量SR利用此優勢,我們從ERA5合成大量0.1°資料。BaguanHR在合成加真實資料集上的表現優於基於ML的方法及IFS-HRES,在72小時內的預報時效中,超過85%的時效實現優越表現。此外,我們的結果凸顯了冪律縮放效應:資料量增加一倍,72小時預報的RMSE降低4.6%,120小時預報的RMSE降低4.9%。我們的結果表明,擴展高解析度ML預報的主要瓶頸在於資料,而逐變量超解析度提供了一個簡單且通用的解決方案,可釋放長期粗解析度再分析資料以供高解析度訓練使用。
測試時擴展利用額外的測試時計算來提升效能,例如讓語言模型在解決問題時推理更久。由於模型透過完整注意力將整個推理軌跡保留在記憶體中,需要長時間思考的困難任務可能變得過於昂貴。然而,我們發現當模型持續推理時,大多數中間推理 token 的重要性會逐漸降低。這使我們質疑保留它們是否值得付出成本。基於此洞察,我們提出 Prefix Sliding(前綴滑動),在推理過程中丟棄那些既不屬於前綴、也不屬於最後數千個 token 視窗的 token。前綴包含提供給模型的關鍵指令與工具,而最近的 token 則是模型當前正在進行的推理。這使得無論模型推理多久,總記憶體需求都受到上限限制,從而實現高效的長時程測試時擴展。在無需訓練的情況下,Prefix Sliding 能讓現有模型速度提升 3 倍,同時維持效能。使用強化學習搭配 Prefix Sliding 進行訓練,則能透過將擴展能力延伸到超過十萬個 token 的推理軌跡,來達成更佳的效能。消融實驗顯示,Prefix Sliding 的表現優於對中間 token 進行摘要或使用傳統滑動視窗的方法。我們的程式碼位於 https://github.com/Muennighoff/prefix-sliding
大型語言模型在不同語言間的知識獲取並不 Consistent,但它們在使用不同語言互動時,其技能組合的差異程度為何?本研究從知識與一般基準測試表現中正交地量化跨語言的技能不一致性。我們透過多語言自我對弈來達成此目標:同一模型的兩個實例在文字型遊戲中競爭,各自透過不同的語言介面進行互動。由於模型、對手、規則、狀態空間與可用動作皆保持固定,此設定得以隔離語言對模型實際表現行為的影響。我們建構了 TextArena 的多語言擴充版本,並評估三個開放權重模型在八種語言、六種遊戲中的表現,涵蓋空間推理、不完全資訊、資源分配與重複互動。我們發現,同一模型在不同語言下可能展現出顯著不同的遊戲實力,勝負差距、無效動作與策略傾向皆呈現系統性變化。詳細分析揭示了空間推理、基於卡牌的決策以及最佳動作選擇中的語言特定失敗模式。在某些設定中,僅改變中間推理語言即可恢復大部分失去的效能,這顯示語言可能影響決策過程的不同階段。這些結果表明,技能差異是發展真正的多語言模型時一個可量測的重大障礙。更深入理解這些差異,有助於我們設計能在不同語言間表現更公平的模型。
文件檢索日益支撐金融、醫療保健與法律領域中高風險的資訊取得。現代檢索管線在模態(文字或多模態)與檢索架構(稠密或晚期交互)上各有不同。這些選擇構成了難以調和的取捨:最有效的管線在大規模運行時過於緩慢且昂貴,而最快的管線卻無法從複雜文件中檢出證據。因此,實務者必須在遺漏證據與無法使用的延遲之間做選擇,且缺乏在查詢層級調適此選擇的原則性依據。我們證明這種取捨並非必要。並非每個查詢都需要相同的管線。在涵蓋金融與科學語料的基準中,沒有任何靜態管線能全面勝出。我們提出 RetrievalRouter,一個輕量級的查詢感知路由器,僅從查詢文字本身學習哪條檢索管線最適合每個查詢。單一可調參數即可揭示完整的準確度-延遲前沿;而對每一條靜態基準管線,RetrievalRouter 都能提供一個同時更準確且更快的操作點。相較於最佳靜態基準,RetrievalRouter 的準確度提高 2.5%,速度快 12.4 倍。此外,與先前的自適應策略選擇方法相比,RetrievalRouter 在以準確度為導向的設定中取得顯著更高的 nDCG@5,而在以延遲為導向的設定中,其於 nDCG@5 與延遲兩方面均與之持平或數值上勝出。我們的程式碼與資料位於 https://github.com/emrekuruu/retrieval-router。
電腦使用代理透過將自然語言指令對應到截圖來定位介面元素,然而現有基準測試並未單獨檢驗模型是否能將關係語言綁定到正確元素。我們提出 GUI-Primitives,一個包含 994 個項目的基準測試,涵蓋圖形使用者介面中七種空間關係的對比指令對(左/右、上/下、包含、對齊、鄰近、列表序數、遮蔽)。每個指令對在保持截圖和錨點固定的情況下改變關係表達式,使得正確目標在兩個指定候選之間移動。五位標註者驗證了 196 個項目的子集(格式良好性 κ= 0.94;目標選擇 κ= 0.79)。十九個視覺語言模型的點在框內嚴格準確率最高僅達 32%。由於模型輸出非約束座標,我們根據預測落入的候選區域對每個預測進行分類。在 60–92% 的項目中,預測落在兩個候選之外。在落入候選區域的條件下,水平位置、垂直位置、鄰近和列表序數的目標選擇準確率達到 0.82–0.90,但包含和遮蔽的準確率與 0.50 無顯著差異:大多數失敗反映的是候選定位問題,而非關係理解問題。在十個模型中,基準測試準確率與 ScreenSpot-Pro 準確率相關(斯皮爾曼 ρ= +0.74),在此樣本量下為探索性關聯。標記兩個指定候選可將選擇準確率提高 35–57 個百分點,這是一種提供候選集合的神諭式診斷,而非可部署的方法。我們公開基準測試、預測和程式碼。
可靠的獎勵模型對於文字轉影片的評估與對齊至關重要。然而,評估準確性與推論效率之間的取捨,對訓練監督的品質提出了極高的要求。現有方法常依賴具固定評分標準或開放式推理的整體性評估器,導致檢查不完整、論證不可靠以及歸因混淆等問題。我們提出FIRM-Video,這是一個基於「先檢查後評分」原則的統一檢查清單驅動資料建構框架:建構各維度專屬的檢查清單,根據時序視覺證據逐一驗證標準,並僅彙總已驗證的決策。在指令遵循方面,FIRM-Video將提示詞分解為加權的原子化需求;在世界一致性方面,它基於可見的實體與動作,建構經提示詞校準且針對特定目標的檢查項目;在感知品質方面,它套用通用的視覺缺陷分類體系。已驗證的標準與分數進一步轉化為自然語言分析,以進行端到端的獎勵建模。隨後,我們從29,348部影片建構了包含88,044個維度專屬實例的FIRM-Video-90K,並推出了包含250部影片、共750筆逐點人工標註的FIRM-Video-Bench。基於Qwen3-VL的FIRM-Video-8B在FIRM-Video-Bench上取得最佳的整體MAE,同時在三個影片生成器的Best-of-8採樣中,持續獲得最高的VBench總分、品質分數與語意分數。
現有的共語手勢生成方法主要是在離線設定下研究,手勢從完整的語音片段中合成。然而,真實世界場景中的互動式數位人類需要在嚴格的延遲限制下,僅使用當前可用的回應語音,線上生成與語音同步的手勢。因此,先前的方法不適合即時互動,因為它們要么依賴未來的語音資訊,要么產生大量的推論延遲。在本文中,我們針對互動式數位人類定義了線上共語手勢生成問題,並提出了一個即時互動框架,該框架將串流語音回應模組與線上手勢生成模組結合。具體來說,手勢生成器被設計為一個因果多模態自迴歸模型,可從串流回應語音和動作歷史中預測身體動作,從而在無需存取未來語音的情況下實現低延遲且與語音對齊的手勢合成。為了支援此設定,我們進一步提出了一條專為虛擬伴侶場景設計的離線資料合成管線,該管線利用具備主題與情緒感知的主體語料庫來建構多樣化的人機對話,然後根據代理回應生成共語手勢。此外,為了縮短離線資料建構與線上部署之間的差距,我們建立了一個自我演化的訓練迴圈,將線上互動期間收集的使用者回饋納入資料生成過程,從而實現對使用者偏好的持續適應。大量實驗表明,與具有競爭力的現有基線方法相比,我們的框架在延遲與品質的取捨上表現更優、語音與動作同步性更強,並獲得了更高的使用者偏好。專案頁面:https://super-star-2026.github.io/
我們介紹 LibriBrain100,這是一個大規模的腦磁圖(MEG)語音解碼資料集,從根本上是為了可重現、標準化的評估而設計。LibriBrain100 將原始 LibriBrain 版本的規模擴大一倍以上,提供超過 100 小時的高品質腦磁圖資料,內容為受試者在聆聽自然連續語音時所記錄的訊號。憑藉來自單一受試者的約 80 小時資料,LibriBrain100 創下了受試者內神經資料深度的新紀錄(比下一個可比資料集多 8 倍,比其他資料集大約多 80 倍)。為了展示這種深度優先設計的價值,我們在詞彙分類基準上進行評估——這是朝向非侵入式腦到文本解碼這項開放挑戰日益成熟的踏腳石。我們使用現有的解碼模型,取得了最先進的效能——同時驗證了錄音品質以及大規模受試者內資料的價值。由於在實際應用中,每位使用者收集 80 小時的資料並不切實際,我們也從 32 位受試者每人收集了約 40 分鐘的額外資料。我們使用相同的詞彙分類基準,展示了廣泛的多受試者資料的價值:對預訓練模型進行監督式微調,可以大幅彌補每位受試者資料有限的問題。我們提供標準的訓練、驗證和測試分割,並可透過一個開源的 Python 函式庫完整重現,該函式庫支援輕鬆下載、可選的預處理,以及供常見深度學習框架使用的資料載入。此外,該資料集和評估基礎設施將與一場開放的機器學習競賽一同發布,並附有公開排行榜以供標準化基準比較。最終,我們希望 LibriBrain100 能加速實用非侵入式腦機介面的發展,使其有能力為嚴重癱瘓患者恢復溝通能力。
可靠的空間理解是未來醫學視覺語言系統的重要先決條件,這些系統旨在支援放射學報告生成與結構化影像理解。儘管現代視覺語言模型(VLM)在許多醫學影像任務上展現出優異表現,近期的證據顯示它們在受控空間推理方面仍然薄弱,且常無法可靠地將空間關聯錨定於影像證據之中。鑑於放射學推理高度依賴於理解解剖結構與病灶之間的相對位置,此空間理解能力的不足對診斷準確性構成風險。我們提出了一種模組化醫學影像代理,用於軸向CT切片中的二元空間關係驗證。該系統並非直接以端到端方式預測空間答案,而是將任務分解為明確的階段:語言解析、解剖定位與確定性幾何驗證。自然語言查詢會被轉換為結構化關係元組,查詢的器官經由基於YOLO的檢測器進行定位,最終的空間決策則利用確定性幾何規則由物體中心計算得出。我們在保留的MIRP空間問答基準上評估此方法,並將其與具代表性的端到端VLM基線進行比較。效能最佳的混合配置達到了94.1%的準確率與94.2%的F1分數,在準確率上較直接使用Qwen2-VL提示高出42.5個百分點,同時保留了可解釋的中間表示與可稽核的推理階段。結果表明,明確的模組化空間驗證可作為未來以報告為導向之醫學影像代理富有前景的建構基礎。
話輪轉換是人類對話的基本組織特徵,且在自然、同步的對話系統中仍難以建模。儘管現有研究已探索用於話輪結束預測的多模態方法與大型語言模型,但針對土耳其語話輪轉換動態的自然對話語料庫仍然缺乏。本研究提出一個多模態土耳其語對話資料集,內容為非腳本的雙人互動,包含同步的正面視訊、可將重疊語音歸屬至個別說話者的分軌音訊,以及時間對齊的轉寫。話輪轉換預測被表述為二元分類問題,並採用基因演算法(GA)來最佳化從視覺、聲學及語言特徵推導出的可解釋決策規則。在所提出的框架中,採用混合 AND-OR 規則表示法,以表示觸發話輪轉換之前的替代性線索組合。