每日精選AI研究論文及翻譯
多代理大型語言模型系統通常使用一個編排者將任務分解給一組工作者,然後透過文字反思持續改進。儘管經驗結果強勁,此類系統在協調、記憶改進以及外部驗證的角色上仍缺乏統一的詮釋。我們將編排者與工作者之間的互動建模為雙層協調賽局:在有界耦合下,工作者的局部更新賽局是一個近似勢能賽局,其均衡鬆弛度由分解品質控制。接著,我們將反思分析為作用於語義記憶狀態上的隨機移動。針對自由形式的反思,我們推導出有限時間上界,證明最壞情況下的緊緻性,並在可證偽的持續危害條件下給出正下界。我們進一步證明一個資訊理論上的不可能結果:任何僅觀察所生成文本的門控,皆無法在文本不可區分的環境上一致地改善;反之,基於環境的門控則可以。受此區別啟發,我們提出隨機反思記憶上升法(SRMA),該方法僅在基於環境的評估風險嚴格下降後,才接受候選記憶。在校準與非退化修正質量的條件下,SRMA 精確收斂,且收斂速率為幾何級數或多項式級數;配對構造顯示這兩個速率區間在階的意義下皆為緊緻。我們亦針對隨機評估提供信心門控,並為分段平穩環境提供重新錨定保證。實驗以基於環境的指標實例化上述物件,並檢驗所預測的協調與漂移定律。在 500 個 SWE-bench 實例中,完整的 Kimi 基礎系統解決了 72.2%,而公開的 mini-SWE-agent 參考系統則為 70.8%。程式碼:https://github.com/YihangChen9/Bilevel-Coordinated-Reflection
我們提出 Iris-mini 與 Iris-pro 兩個搜尋智能體,分別在 35B-A3B 與 397B-A17B 規模上訓練,並介紹它們背後的資料管線與訓練配方。任務是從網路語料庫的超連結結構反向建構而來的:我們在從種子頁面及其外連提煉出的實體圖譜上構造多跳鏈,將每個非答案實體改寫為描述性指稱,使任何線索都無法經由字串比對解出;我們僅納入參考模型在閉卷條件下無法回答、但一旦提供佐證證據即可解出的問題。這些問題接著被轉換為軌跡,並在 SFT 之前同時於軌跡層級與輪次層級進行過濾。策略隨後以 RL 對即時搜尋進行最佳化;獎勵評判器與觀察摘要器以服務形式部署於訓練叢集內,過長的 rollout 會在請求層級被中斷,並在下一步從已提交的前綴繼續。我們以一種稱為 SFT-RL climbing(SFT-RL 攀升)的程序交替兩個階段,將每一輪 RL 中難度最高且成功解出的 rollout,以及效率最高的 rollout,回傳至下一個監督式階段。由於在這些基準上,推論期間的上下文管理比多數系統之間已發表的差異更具影響力,我們固定工具集、上下文長度限制與評判器,並對每個基準分別評估啟用與未啟用該機制的表現。所有結果皆來自單一 ReAct 智能體,沒有子智能體,也沒有測試時驗證。在啟用上下文管理的情況下,兩個模型在 BrowseComp、BrowseComp-ZH、DeepSearchQA 與 HLE 上分別達到 82.2/84.8/86.9/52.3 與 88.6/85.1/92.9/56.4,是各自參數範圍內開源搜尋智能體中整體表現最強的結果。我們計畫釋出模型權重,以及資料建構、訓練與評估的完整配方。
一個進行對話的虛擬化身必須決定要說甚麼,以及在說話的同時如何動作;然而,這些能力分屬不同的模型家族:語音對話模型生成語音但不含動作,而語音伴隨動作模型只能從輸入的音訊生成動作。標準的解決方式是級聯(cascade)架構:先產生語音回應,再對完成後的音訊執行動作模型;這需要第二次完整的推論過程,並排除了兩者之間進行聯合最佳化的可能。我們提出 Motion-Omni,這是一個端到端框架,其中的語音對話模型能原生輸出明確的面部表情,以及手部、上半身與下半身的動作,且這些動作直接由產生語音的隱藏狀態生成。在此架構中,聯合訓練並非可選項:若語音路徑被凍結,動作仍會與音訊不對齊;唯有在語音與動作兩個目標下共同調適 LLM、語音生成器與動作生成器,才能在保留語音對話能力的同時恢復對齊。監督訊號來自一個可擴展、與模型無關的流程,該流程以可替換的動作教師模型,為語音一致的語音回應建立偽標籤,產出 422,856 對依品質排序的配對(共 1,402 小時)。我們進一步釋出 SwDA-500,以及據我們所知首個針對隨機開放式全身語音對話的公開評估協議;該協議在跨動作系統間匹配音訊,同時統整了渲染、自動指標、人工評估與延遲量測。以 Qwen2.5-7B-Instruct 為骨幹實例化後,Motion-Omni-Q7 在無參考動作指標上與使用相同音訊的教師級聯差距在 2% 以內,但回應速度快 5.4 倍(RTF=0.78,快於即時);在節拍相關性與多樣性上超越所有非教師級聯,並達到 2.62% 的字錯誤率,為所比較之全模態系統中最低。
音訊-視訊擴散模型依賴跨模態注意力來協調文字、聲音與視覺內容;然而,正是此機制可能引入細微且系統性的語義洩漏。為了研究這些模型,我們透過探測並分析「注意力三角形」——由連接文字流、音訊流與視訊流的三條跨模態注意力邊所構成——來檢視語義資訊在生成過程中如何被跨模態路由。 我們的分析揭示,沿著音訊-視訊邊的路由是雙向的:音訊可以影響視訊生成,而視訊也可以影響音訊生成。這條邊由模型參數中編碼的偏誤所塑造,並成為洩漏的主要促成因素:當提示與學習到的先驗相牴觸時,跨模態互動可能凌駕於原本的條件設定之上,將語義重新路由至視覺上典型但錯誤的結果。這些效應顯示,語義偽影的產生不僅來自注意力擴散至其原有目標之外,更源於沿特定路徑、由偏誤驅動的結構化互動。 立足於此觀點,我們提取注意力導出的訊號,以揭露語義如何在各模態之間分布與扎根,並將其用作診斷工具,在受控條件下既能分析洩漏,也能刻意誘發洩漏。這使我們得以探測跨模態路由的內部動態,並分離出個別互動所扮演的角色。我們進一步利用這些訊號引導推論時的干預措施,以促成更一致的跨模態對齊。大量實驗支持我們的分析,並證明在維持生成品質的同時,語義扎根有所改善。
我們研究生成包含數百個物體的雜亂場景之組合式3D表示問題。目標是將場景表示為置於共享世界座標系中的個別物體網格集合,此為遊戲、AR/VR、模擬與機器人等下游應用所需之形式。此任務在密集雜亂場景中尤具挑戰性,物體彼此嚴重遮擋,每個視角僅能呈現其幾何形狀的一小部分。基於幾何的方法通常將場景重建為單一表示,並在遮擋區域留下不完整的幾何結構;而現有結合生成先驗的組合式方法大多僅適用於相對簡單的場景。我們表明,包含數百個物體的複雜場景可藉由將強大的單物體3D生成先驗適應至多視圖觀測,以組合式方式生成。我們以Pixal3D實現此範式,並擴展其多視圖條件路徑,使物體生成奠基於多個具姿態的觀測。儘管該模型完全在規範空間中的單物體上進行微調,它在不需任何場景級訓練的情況下,即能泛化至具有嚴重遮擋的大型場景,證明此範式的可行性與可擴展性。我們進一步引入UE-MeshyScene,一個涵蓋數百個物體、逐物體標註與真實網格的密集雜亂場景之逼真基準。在單物體、受控多物體及UE-MeshyScene的評估中,我們的方法持續優於既有方法,且於場景複雜度與遮擋程度增加時獲得更大優勢。最後,我們將生成的3DGS世界(如Marble和HY-World 2.0)轉換為組合式網格場景,以展示更廣泛的應用性。
確保事實性仍然是將大型語言模型部署於高風險場域中的關鍵挑戰。現有的幻覺偵測器通常僅在單一層級運作:主張層級方法提供可解釋的事實單元,而片段層級方法則定位未受文本支持的內容。橋接這兩種觀點的代價高昂,因為重度依賴大型語言模型的流程需要多次分解與驗證呼叫,而模組化系統則需要額外的主張到片段對齊。我們提出Enoki,一個用於多層級幻覺偵測的開放式資訊抽取框架。Enoki抽取以文本為錨定的關係事實,將其與證據進行驗證,並將未受支持的事實映射回幻覺片段。這種共享表徵使得主張層級驗證與片段層級定位得以同時進行,無需分別對齊。Enoki支援基於大型語言模型、基於編碼器及基於規則的抽取模式,透過統一介面在準確度與推論成本之間取得平衡。實驗結果顯示,Enoki在資源消耗較少的情況下仍能與強大的主張層級系統保持競爭力,並在細粒度的片段層級與實體層級定位上達到優異表現。我們亦釋出EnokiQA,一個具備對齊的主張層級驗證與片段層級定位註釋的雙粒度資料集。
大型語言模型(LLM)日益被用於從自然語言問題描述中建構最佳化模型;然而,真實世界的作業研究(OR)請求往往不完整:缺少的目標函數、限制式或商業規則,都可能改變最終的數學規劃。現有評測大多假設規格完整無缺,因而忽略了代理是否知道在建模前何時需要釐清。我們提出 OR-Clarify,這是一個針對建模前釐清的基準測試:每個任務皆提供部分的公開問題描述並隱藏結構化槽位,再透過代理與模擬使用者之間有限次數的互動來評測其表現。該基準同時支援開放式與選項式釐清,並衡量槽位恢復、停止行為、隱性假設與互動成本。我們進一步提出互動式最佳化(InterOPT),這是一個兩階段框架:先識別尚未解決且對建模至關重要的缺口,再以此決定應提出下一個問題,或是停止提問。在我們以選項式為主的實驗中,InterOPT 在精確槽位恢復上大幅優於所有基線方法;在開放式設定下,它也能與表現強勁的既有方法並駕齊驅。總而言之,OR-Clarify 與 InterOPT 將 OR 輔助重新定位為一項選擇性完整性決策:需要時釐清、就緒時停止,並量化仍有所缺的資訊。
層丟棄(又稱隨機深度)已被證實能在語言與視覺Transformer中實現更快的訓練、更高的準確度,以及對零樣本層剪枝的穩健性。然而,隨著模型與資料集規模擴大,丟棄——尤其是層丟棄——已大幅從大型語言模型(LLM)的預訓練方案中消失。雖然先前部分研究曾報告丟棄可能降低準確度,但尚無全面性研究量化此影響,更遑論減輕此影響。在本研究中,我們證明層丟棄應運用於最先進的LLM訓練中,並為訓練與訓練後效益確立最佳實踐與規模分析。具體而言,在最佳的層分佈、時間排程與最佳化器超參數下,我們觀察到在相同訓練FLOPs下,層丟棄能帶來更低的損失。在給定訓練步數下,LLM可達成更低或相近的驗證損失,同時節省高達25%的訓練FLOPs。此外,層丟棄能實現顯著的訓練後優化,例如早期退出、中間層跳過與自推測解碼,在可忽略的準確度損失下提供最高1.5倍的推論加速。在超過2400次訓練實驗中,涵蓋參數量從2.71億到82億的模型,以及多達1600億詞元的資料集,我們證明這些發現能可靠地延伸至大規模訓練情境。所有預訓練實驗均在Cerebras CS-3系統上執行。
近來自動綁定的進展使得大規模產出動畫就緒的 3D 資產成為可能,然而生成驅動這些資產的動作仍然是瓶頸。現有的學習式動畫器受到拓撲限制:它們依賴類別特定的模板,或在推論時需要逐骨架微調與參考動作。我們提出 UniMate,一個統一基礎模型,能夠從綁定好的 3D 資產與文字提示,為任意骨架合成關節動作,無需測試時最佳化或逐骨架重新訓練。UniMate 引入了拓撲感知擴散 Transformer,透過三種機制將骨架拓撲整合至注意力中:(1) 由成對關節關係與測地距離產生的圖感知注意力偏置;(2) 頻譜旋轉位置嵌入,透過圖拉普拉斯矩陣將 RoPE 推廣至任意運動學樹;(3) 從靜止姿勢骨架進行注意力池化的全域拓撲條件器。我們亦整理了 UniML3D 資料集,內含 13,006 筆動作序列,涵蓋雙足、四足、鳥類、海洋、昆蟲、蛇形與關節式剛體物件,並具備統一的標準化處理與文字配對。在此資料集上訓練的 UniMate,在品質、泛化能力與效率上均優於當前最佳基準方法,並支援零樣本跨拓撲遷移、補間動畫、擴展與文字引導編輯。我們的專案頁面位於 https://linzhanmou.com/unimate/。
大型語言模型中的推理透過多樣化的功能操作展開,例如問題建構、目標分解與演繹推論。儘管這些操作在文本中能被明確區分,但它們如何在表徵空間中以幾何方式組織,目前仍所知甚少。為此,我們探討不同的推理操作是否在隱藏表徵中展現出相應的幾何結構。我們發現,操作在保留的表徵中是可分離的,且可分離性在中間層達到高峰,並驗證此結構並非由詞彙或位置混淆所解釋。跨層觀察時,逐詞元的操作對齊在片段上變得更為分散,而相同的表面詞元會根據其所在區塊的操作被表徵為不同的形式。注意力遮蔽干預進一步顯示,區塊起始處的操作對齊表徵依賴於先前的推理上下文。因此,我們的研究證明語言模型在語言推理表達與其內部幾何結構之間維持著表徵對應。程式碼與專案資料可於 https://github.com/naver-ai/beneath-cot 取得。
為加速器設計與編寫高效能自訂核心,是一項需要深厚硬體層級專業知識的複雜任務。大型語言模型(LLM)可結合即時編譯器回饋,用以建構代理式系統來生成核心。在本研究中,我們提出 MaxKernel——一個多代理系統,實作三種不同的 TPU 核心開發範式:(1)人在迴圈(HITL)代理,用於協作式逐步設計;(2)自主(Auto)代理,執行全自動、由度量與追蹤資料驅動的優化迴圈;(3)基於圖的自主搜尋,將 Auto 代理擴展至設計空間的全域探索。這三種範式皆利用共享的專業子代理池,以處理規劃、實作、自我除錯、測試與硬體效能剖析。我們在 JaxBench——一個涵蓋 50 種多樣化 TPU 核心任務的全面性套件——以及來自尖端開源模型的複雜真實世界工作負載上,對 MaxKernel 進行評估。我們證實 MaxKernel 能持續生成高度優化的實作,媲美專家手動調校的基準結果,並在整個基準測試中展現顯著的效能表現。我們的代理已開源,可於 https://github.com/AI-Hypercomputer/accelerator-agents/tree/main/MaxKernel 取得。
同策略蒸餾(OPD)為語言模型後訓練提供密集的逐詞元監督,但其有效性受到教師品質的瓶頸限制:外部教師存在分佈不匹配的問題,而具有特權條件的自蒸餾則受限於上下文學習能力。我們提出 RISE(Recursive Improvement via Self-Extrapolating Policy Distillation,即透過自我外推策略蒸餾實現的遞迴改進),直接從模型自身的 RLVR 訓練軌跡中建構合成教師。透過外推當前檢查點與後方錨點之間在參數空間或輸出 logit 空間中的位移,RISE 將稀疏的、由結果誘發的參數更新轉化為密集的詞元級目標,無需任何外部模型或特權條件。RISE 以互補迴圈結合 RLVR 與 OPD:結果獎勵將外推錨定於正確的推理方向,而外推教師則細化詞元級決策。此外,由於教師會隨學生每次迭代的進步而不斷更新,蒸餾因而成為一種遞迴改進機制,而非一次性壓縮步驟。涵蓋數學推理、多領域 STEM、程式碼生成及多輪代理任務的實驗顯示,RISE 在所有設定下均優於僅使用 RLVR 的訓練與同策略自蒸餾。
命令列編碼代理(如 Claude Code、Gemini CLI)已能讀寫檔案並維持長時間的工作階段,但端對端研究仍舊分散於聊天工具、整合開發環境、終端機與寫作環境之間,而且使研究可被稽核的決策過程也鮮少被保存下來。我們提出 Dr. Claw,一個開源工作區,它將現有的編碼代理執行器包覆在可控、可稽核的人機迴圈工作流程中,而非再引入另一個自主代理。透過持久化狀態物件、可重用技能庫與多執行器協調,將人類決策與 AI 執行連結起來,使規劃、執行與寫作形成單一、可追蹤且可回復的迴圈。我們透過互動式三視圖情境與失敗回復逐步示範來展示 Dr. Claw,並將其與使用相同後端執行器的裸命令列代理進行比較,因此該比較對照了整體編排層(任務圖、狀態物件與技能庫)與其所包覆代理之間的差異。在固定執行器的條件下,Dr. Claw 在研究完整性上獲得更高的評分,同時留下可稽核、可回復的流程軌跡。示範存取:存放庫 https://github.com/OpenLAIR/dr-claw,以 AGPL-3.0 授權釋出,並包含 GPL-3.0 上游元件。
影片編輯涵蓋多種編輯典範,然而要在單一統一框架中同時實現高品質的指令引導與主體引導編輯仍具挑戰性。我們提出 EditVid,一個免訓練框架,結合了用於局部一致性的稀疏因果記憶、用於長程身分保持的基於對應關係之注意力後 token 注入,以及用於編輯局部性的軟潛在融合。此框架同時支援指令引導與參考引導的編輯,包括風格轉換、屬性修改、物體插入、部件級編輯與主體替換。在 FiVE 上,EditVid 達到 78.16 的 FiVE-Acc,相較於最強之已評估免訓練基線的 58.95,同時在 IVEBench 上亦取得具競爭力之成果。一項使用者研究進一步顯示,相較於 7 種競爭方法,EditVid 獲得 51.8% 的整體偏好。
在可驗證獎勵強化學習(RLVR)中,群體相對策略最佳化(GRPO)通常對所有軌跡使用固定的重要性取樣(IS)比率裁剪邊界。我們指出一個關鍵限制:較難問題上罕見的正確軌跡與較易問題上大量出現的正確軌跡,儘管其學習訊號差異極大,卻以相近的比率被裁剪。群組成功率較低的軌跡具有較大的 IS 比率,並攜帶更強的梯度訊號以促進探索與解決新問題,卻被固定裁剪不成比例地壓抑。 為解決此問題,我們提出群體自適應裁剪策略最佳化(GAPO),這是一種可即插即用的 GRPO 修改方式,能根據軌跡優勢調整裁剪邊界。GAPO 的動機來自反向 KL 信賴域觀點,該觀點認為具有較大學習訊號的軌跡應獲得按比例更大的更新空間。GAPO 無需獎勵塑形,且僅調整裁剪閾值,同時保留標準的 PPO/GSPO 代理目標。在 Qwen 與 Llama 模型上,相較於固定裁剪與優勢塑形基線,GAPO 於基礎模型通過率相對較低的數學推理與程式碼基準上,一致地提升 Pass@1 與 Pass@k。
LLM 代理正迅速成為生產級軟體,被部署用於處理客戶服務、裁決爭議以及營運內部系統。值得注意的是,構建這些代理的工作日益交由編碼代理處理,然而現有基準測試對於一個 AI 系統能否在真實客戶委託的條件下交付此類代理,所能說明的相當有限。我們提出 τ^τ-bench(讀作 hyper-tau-bench),這是一個以代理構建為任務的基準測試。開發代理會獲得企業實際留存的記錄、持有需求的客戶、營運必須經由的生產環境 API、需繼承的程式碼庫,以及服務成本與模型使用上的限制——這正是真實委託案所給予的起點。代理必須據此交付一個完整的客戶服務代理,其評分方式是將該代理部署於保留的模擬用戶進行測試。在橫跨四個領域的 53 項任務中,最強的配置——Claude Code 中的 Claude Opus 5——僅通過 23.9% 的評估模擬。與此同時,專家撰寫的參考基準上限得分為 82.2%。這些失敗與人類代理開發者所見的情況如出一轍:模型以淺層查詢取代對記錄的深度理解,幾乎不與客戶溝通,對於代理架構與服務支出的實驗也過少,往往直接交付第一個能運行的設計即止步。我們期望 τ^τ-bench 能將協作式代理構建的工作轉化為編碼代理可量測的目標。
大型語言模型(LLM)日益被用於編輯既有程式碼,但僅有正確性並不夠:有用的修復也應具備最小化、可審查性,並忠於原始實作。我們研究「過度編輯」現象,即模型傾向於重寫超出修復缺陷所需範圍的程式碼。我們透過將受控的AST層級損壞注入參考解答,從400個BigCodeBench問題建構了一套評估框架,使每個修復任務都具有已知的最小修補。在前沿LLM中,過度編輯現象相當普遍,即使如GPT-5.5等強大模型也不例外:高Pass@1可能與不必要的大幅編輯及增加的認知複雜度並存。加入保留指令能顯著降低此行為,將平均超額Levenshtein距離從0.195降至0.131,使新增認知複雜度減少26.6%,並將Pass@1提升2.3個百分點。然而,這些成效並非單純來自更大的推理預算或更大的模型。我們接著探討最小化編輯是否能在後訓練階段直接學習。我們觀察到,監督式微調會過度擬合所見的損壞模式,而強化學習則在跨域編輯保真度與效能保留之間提供了最佳取捨。這些結果將編輯保真度定位為程式碼修復品質的一個獨立軸向,並顯示其可以量測與學習。
視聽理解仍是一項挑戰,因為模型必須同時解讀語音內容、視覺事件及其時間關聯。現有的全模態模型通常引入專用音訊編碼器,並依賴昂貴的音訊-視訊-文字訓練,使全模態能力與特定 VLM 骨幹緊密耦合,並可能削弱其既有的視覺與推理能力。這帶出三個問題:是否每個新 VLM 都需要原生全模態訓練;能否在不更動原始骨幹的情況下加入以語音為核心的全模態能力;以及哪些情境仍必須使用更豐富的聲學表徵。我們提出 Training-Free Omni(TFO),這是一個即插即用框架,能在不修改架構或重新進行多模態對齊的條件下,將凍結的 VLM 轉換為以語音為核心的全模態模型。TFO 使用 Whisper 提取經置信度過濾且帶時間戳記的轉錄文本,並將其經由 VLM 既有的語言介面路由傳遞,同時保持其視覺路徑不變。在涵蓋 56 項基準與 21 種語言、與原生全模態模型的配對比較中,TFO 在視聽理解上表現相當,在所有五種模型設定下均提升平均純音訊效能,並在跨語言語音上獲得顯著增益。相較於對應的原生全模態檢查點,凍結 VLM 也通常保留更強的影像/視訊理解、視覺定位、程式編寫、數學推理及醫學問答能力。這些結果顯示,出色的以語音為核心的全模態理解往往可以透過模組化的音訊轉語言路由來達成,而非依賴昂貴且限定特定骨幹的訓練。
串流影片理解是實現具身智能、自動駕駛、工業監控、監視預警與可穿戴助理等真實世界應用中的關鍵能力。然而,使用多模態大型語言模型(MLLMs)處理連續影片串流在計算上相當昂貴。現有研究已嘗試透過視覺令牌剪枝、令牌合併、量化、按需幀檢索與上下文卸載等方式來降低串流開銷。然而,多數現有方法忽略了模型深度這一維度。對傳入的幀重複執行全深度 MLLM 預填充,其成本極其高昂,既會產生可觀的計算開銷,也會使 KV 快取以與預填充深度成正比的速度增長。為應對這些挑戰,我們提出 ShallowStream——一個新穎的框架,利用 MLLM 的淺層同時進行幀編碼與檢索索引建構。在串流處理期間,ShallowStream 利用淺層的 KV 快取維護一個常駐的輕量級索引。在查詢階段回答時,我們利用淺層產生的注意力分數對上下文幀進行評分,並採用多樣性感知的選取策略,以檢索精確且全面的證據。ShallowStream 的表現可與現有最強的串流方法並駕齊驅,同時將每幀預填充延遲與 10 秒端到端延遲分別降低最多達 52.1 倍與 11.9 倍。我們的程式碼可在 https://github.com/CURRENTF/ShallowStream 取得。
量化被廣泛用於降低神經網路推論的計算與記憶體需求。然而,在循環網路中,量化後的狀態會被儲存並於下一個時間步返回,因此儲存該狀態所依據的規則可能改變後續的計算。在此,我們引入「循環狀態回寫」(recurrent-state write-back)來指稱此規則,並在一個用於螢光壽命成像的緊湊型 GRU 編碼器-解碼器中隔離其影響;螢光壽命成像是一種用於定量生物成像的分子影像技術。其中一項核心任務是從高噪聲、時間分辨的螢光訊號中估計兩個壽命參數:短壽命成分 τ1 與長壽命成分 τ2。在保持訓練完成的模型不變的條件下,以確定性 4 位元狀態儲存取代連續狀態傳播,會使 τ1 與 τ2 的估計誤差分別增至約 70 倍與 300 倍。失敗發生於重複的小幅更新低於寫入閾值時,此時儲存的狀態幾乎保持不變,而網路仍持續提出變化。誤差回饋、殘差記憶與方向記憶能將這些受抑制的更新所含的資訊跨時間傳遞,並在無需重新訓練的情況下恢復準確度。精度掃描結果顯示,提高狀態精度可能使固定的循環解惡化;而匹配訓練則顯示,與狀態介面的相容性是可以學習的。為測試此行為是否超出 GRU 的範疇,我們在一個獨立訓練的 LSTM 中重複訓練後介入實驗。在該架構中,粗粒度回寫再現了前述失敗,誤差回饋恢復了準確度,而針對特定狀態的介入則顯示細胞狀態比隱藏狀態更為敏感。我們的結果確立循環狀態回寫是低精度循環動態的關鍵決定因素,並指出狀態儲存介面是量化循環推論中的核心設計考量。
文本驅動的三維生成技術在創建大規模室外環境與精細室內場景方面已快速發展,然而這些領域通常被獨立合成,缺乏構成一致城市世界所需的對應關係。我們提出 HoloWorld——一個基於持續更新的跨尺度世界上下文所建構的統一室內外城市世界生成框架。HoloWorld 從使用者描述出發,逐步表示並更新從城市尺度規劃到個別建築的多元世界資訊,使生成的室內空間能與其相關的外部建築保持明確對應。在不斷演進的上下文及先前生成的相鄰街區條件下,HoloWorld 以自迴歸方式生成城市外部場景,並在街區之間維持一致的空間組織與視覺特徵。生成的室外表徵進一步以三維建築實例與建築足跡為基礎,從而在幾何約束佈局及繼承的外觀特徵下,實現建築特定之室內生成。據我們所知,HoloWorld 是首個在一致的三維城市世界中統合室內與室外生成的框架。大量實驗表明,HoloWorld 取得了優越的城市外部生成表現,其平均 AQS 分數較目前最佳技術(SOTA)提升 7.68%,並獲得最高平均 RDR 分數,同時在統一的三維城市世界中維持強健的建築層級室內外對應與跨街區連續性。我們的專案頁面:https://huangxb326.github.io/HoloWorld/。
視覺地點辨識(Visual Place Recognition, VPR)藉由檢索同一或鄰近地點的資料庫影像來定位查詢影像,然而其強健性常因光照、天氣、季節變化與動態遮蔽所造成的域偏移而下降。其中一個因素在於現有的訓練資料中,同一地點的外觀多樣性有限。為解決此問題,我們提出 AdaptVPR,一個路徑感知的生成式擴增框架,旨在為強健的 VPR 訓練構建同地困難正樣本。AdaptVPR 首先使用視覺語言模型解析場景屬性並估計編輯可行性,同時由基於規則的排程器根據可編輯性分數與風險約束決定生成路徑。生成過程分為三個互補路徑:全域外觀路徑引入天氣、光照與時段的全域場景變化;局部遮蔽路徑插入合理的動態遮蔽物;雙重路徑結合兩類擾動,以產生更具挑戰性的外觀偏移。每個生成的候選樣本皆以 VPR 導向的驗證機制進行評估,該機制基於幾何一致性與外觀多樣性,在確保足夠外觀變異的同時,降低結構漂移的風險。全域候選樣本僅生成一次,若驗證失敗即遭拒絕;局部遮蔽與雙重候選樣本則運用驗證回饋來進行有限的提示詞精煉與重新生成。採用此框架,我們建構了 AdaptCities,包含 160K 個經驗證的合成同地困難正樣本。跨多個 VPR 基線與視覺基礎模型骨幹的實驗結果顯示,在標準基準上具有一致的增益,且在具挑戰性的域偏移下表現顯著改善,R@1 增益最高可達 9.2%。原始碼與資料資源已公開於 https://github.com/chenshunpeng/AdaptVPR。
針對代理在達成目標途中引發之副作用的基準測試早已存在,但 HarvestBench 是第一個為避免該副作用標上代價,並將此副作用明指為生物的基準。它是一項農場模擬:LLM 子代理操控兩台拖拉機組成的工作組,在有動物出沒的田野中進行協作式玉米收割。環境是強化學習的網格世界;每個決策都在無記憶的條件下做出,且目標中從未指明傷害。當動物擋住拖拉機路線時,自動導航會停下並詢問模型:要以零燃料成本直接開過去,還是付出標示的燃料價格繞行。輾殺數與兩類對照物比較:岩石會損壞拖拉機,而且每個模型撞上岩石的機率皆低於 1%;乾草捆則無害且非生物。模型也可以選擇從鄰田而非自己的田地收取作物,這是測試它們視何者為道德的第二道考驗。 在九個模型與 7,201 次有定價的決策中,有 3,951 次涉及動物,而非乾草捆或岩石。輾殺率介於 0.4% 至 98.8% 之間,其中 Terra 與 Sol 最仁慈,GPT-4o-mini 最殘酷,而且排序不依能力高低而定。六個模型中有四個在 5% 水準下對價格敏感,彈性介於 0.09 至 1.69。在預設地圖上,九個模型輾過野生動物的頻率皆高於輾過農場動物;而在每個尚有移動空間的模型中,此方向在每一種地圖幾何下都成立。任務簡報的影響最大:在道德簡報條件下,六個推理模型中有五個的輾殺率低於 6%;移除該簡報後,六個模型的輾殺率全部上升到 84% 以上。 HarvestBench 不使用 LLM 評分器。計分器統計遊戲日誌中的事件,因此完全可重現;它衡量的是模型願意付出多少代價來避免傷害,而非模型如何談論傷害。
預期視覺語言模型(VLM)應對恰當的請求提供有幫助的回應,同時對不正確、不安全、不可行或無法回答的請求不予遵從。然而,現有基準大多在整個查詢層級評估不遵從行為,假設每個請求要不是應予遵從,就是應予以拒絕遵從。實際上,真實世界的查詢可能夾雜可回答的內容與應拒絕遵從的組成部分。在本文中,我們介紹 KoNA,這是一個用於評估 VLM 在五個類別中選擇性不遵從行為的基準:錯誤前提、視覺不可及性、普遍未知、任務可行性與安全性。每個任務在成對的單一與複合查詢下,評估兩種能力:查詢層級的不遵從與成分層級的不遵從。我們對多種 VLM 的評估顯示,模型經常無法適當地拒絕、糾正或棄答,而當查詢需要選擇性不遵從時,這些失敗更加明顯。為了解決這項挑戰,我們使用需要選擇性不遵從的 KoNA 範例,連同一組應直接給出答案的完全可回答範例,對 VLM 進行微調。微調後的模型在不遵從準確率上獲得大幅提升,同時在完全可回答的任務上大致維持效能。這些結果表明,微調後的模型能區分可回答的組成部分與需要不遵從的組成部分,並以符合任務的方式回應。
在大型語言模型的對齊中,在有用性與安全性之間取得平衡仍是一項根本挑戰。為達到此平衡,模型應拒絕有害查詢(例如,「我該如何開槍殺人?」),同時對良性輸入保持回應,即使是那些表面上類似有害查詢的輸入(例如,「我可以在哪裡拍到好照片?」)。然而,模型往往難以區分真正有害的查詢與含有表面風險語言的良性查詢,導致錯誤拒絕。在本文中,我們透過將安全微調資料集中的回應分解為兩個不同的組成部分來處理此問題:(i) 樣板式的拒絕陳述,以及 (ii) 解釋拒絕理由的理據。我們的實驗與分析顯示,拒絕陳述會誘使模型依賴表面線索,從而阻礙對有害與良性查詢之間的精確區分。相反地,僅以理據進行訓練則能減少錯誤拒絕,同時維持相當程度的安全性表現。僅理據的效益也出現在我們的 ICL 設定中,並與所評估的推論時緩解方法相容。這些結果強調了精確策劃細粒度安全監督資料集的必要性,並為建構能更好調和有用性與安全性的對齊智能體指出了方向。
2025年PNPL競賽(Landau et al., 2025)的目標,是啟動一項為期多年的非侵入性語音解碼課程。該課程旨在由基礎任務逐步進展至實用腦機介面(BCI)所需的語言複雜度,並以語音偵測與音素分類任務揭開序幕。獲勝提交在各自任務上達到了95.6%和73.6%的F1-macro分數(Elvers et al., 2026),是極為重大的進展。這項成功建基於LibriBrain資料集(Özdogan et al., 2025);該資料集是當時最大的受試者內MEG資料集,內含單一受試者約50小時的資料。然而,儘管受試者內的資料規模能驅動強勁的解碼表現,一個實用的BCI必須能從數分鐘而非數小時的資料,泛化至新使用者。 2026年PNPL競賽以LibriBrain100(Mantegna et al., 2026)回應此挑戰;這是擴充版的LibriBrain資料集,增加了32名受試者(每人約40分鐘),並納入更多受試者內資料(約80小時)。本屆競賽進一步將任務課程推進至詞彙分類,並設有兩個相輔相成的賽道:Deep賽道以規模化的受試者內詞彙分類為目標,追求最佳效能;Broad賽道則以跨受試者泛化為目標,逐步將受試者特定的微調資料量從約40分鐘降至約20分鐘,再降至約10分鐘——這個時長落在臨床可行的範圍內,也讓我們朝一個能夠為重度癱瘓患者恢復溝通能力的非侵入性BCI邁進了一步。