每日精選AI研究論文及翻譯
大型語言模型(Large Language Models, LLMs)的成功在很大程度上歸功於下一詞元預測(next-token prediction, NTP),但其自迴歸(autoregressive, AR)結構需要緩慢且依序地生成詞元。為克服此瓶頸,我們提出了擴散增強的大型語言模型(diffusion-augmented LLMs),這是一類在定義 AR 模型分佈的同時,利用擴散從該分佈中並行抽取多個詞元的新模型。我們將這些模型的參數解耦為兩組:使用標準 NTP 目標訓練的 AR 權重,以及訓練用於同時生成多個詞元的輕量擴散權重。擴散權重透過一個簡單的擴散蒸餾(Diffusion Distillation)階段來學習,該階段對現有 LLM 訓練流程所增加的額外開銷可忽略不計。我們也引入了 Ψ-Spec,這是一個取樣器家族,可在固定上下文長度下實現無損加速與推論時的擴展。與推測性解碼不同,我們的方法不需要獨立的草稿模型。與擴散式 LLM(d-LLM)不同,它在加速生成時不會犧牲底層 AR 模型的品質。由此產生的模型稱為 Uno,可從零開始訓練,也可藉由增強現有的開放權重 AR LLM 來建構。在每個受評估的批次大小上,Uno 的吞吐量均高於領先的推測性解碼方法;而且在裝置可支援的最大批次大小下,相較於基礎 AR 模型仍可獲得高達 3 倍的加速。值得注意的是,我們的 8B Uno 模型在智能體工具使用、程式編寫與長上下文推理的所有評估基準上,均優於領先的開放式 d-LLM——26B DiffusionGemma——以及專有的 Mercury 2。我們已於 https://s-sahoo.github.io/uno/ 釋出程式碼與檢查點。
推理模型能從自身的同策略經驗中改進,但此內部迴圈相當脆弱:終端驗證器提供可靠但稀疏的監督,而密集的模型自身引導則可能強化虛假信心,或使學習過度集中於狹窄的解題模式。我們提出 FlowBalance,一種基於驗證器的自我改進方法,在完整回應上學習正規化分佈。對每一條同策略軌跡,同一政策在訓練時的凍結視角利用特權上下文產生 token 層級的對數機率增益,並聚合為軌跡層級的自我引導分數。FlowBalance 以驗證器推導的群組優勢校準此分數:引導在正優勢軌跡上予以保留,在負優勢軌跡上予以反向,而當 rollout 群組未顯示結果偏好時則予以停用。由此產生的能量以指數形式對參考策略重新加權;剖析式軌跡平衡則以每個 rollout 群組一次對數配分估計來擬合正規化目標。此方法透過軌跡平衡實現結果校準式自我引導,無需額外的 token 層級模仿損失。我們的分析建立了群組內對比保持、最小變化的反向 KL 散度刻畫、驗證器對目標獎勵的單調控制,以及針對被拒絕回應上假陽性自我引導的精確校正。在數學推理方面,FlowBalance 在 Qwen3-4B 與 Qwen3-8B 上均較 FlowRL 提升平均表現,同時提升訓練速度與穩定性,避免直接 OPSD 的回覆長度崩塌,並在受控的 AIME24 診斷實驗中展現更高的正確策略多樣性。
我們提出ENEAS,這是一個統一、可文字提示的方法,用於實例追蹤與語意發現。可文字提示的分割模型,包括最新的基礎模型如SAM 3,仍然存在時間性幻覺、空間碎片化與語意誤分類的缺陷:當物體離開視野時,它們無法回報目標消失;在極端特寫中,它們分割局部紋理而非完整物體;且它們將視覺特徵置於本體論真實之上,因此雕像、畫作或倒影等視覺上相似的物件會被分割為目標實體。 ENEAS 以單一方法發揮雙重作用:一方面對單一實例進行精確追蹤與高品質分割,另一方面進行開放概念的發現——找出文字查詢所指稱的每一個實例,並由語意驗證層加以解析。在追蹤方面,我們在原本僅限於基於點互動的幾何穩健SeC架構上,擴充了一個文字提示介接器,並利用其時間記憶,使目標即使在消失期間仍能保持鎖定,不會漂移至干擾物;即使目標填滿整個視野,也仍能維持完整。在發現方面,驗證層結合高速視覺嵌入比對與條件式VLM精修,僅對模糊候選者啟動語意推理,過濾掉僅靠視覺模型無法區分的本體論錯誤,同時保持低延遲。ENEAS的設計以3D重建為考量——在該情境中,單一誤分類的干擾物便會破壞資產——因此它能對影片、大型資料庫,以及時間或空間上無序的資料集合,實現高品質的語意追蹤與分割;同時具備分辨真實實例與其「分身」——那些看起來相似但實際不同的事物——的判別能力。程式碼與模型已公開於 https://github.com/speridlabs/eneas
因果推論是從資料中估計處理或介入效應的實踐。傳統上,每個新問題都需要一套量身打造的流程:先提出因果機制,選擇相容的估計器,再加以訓練。與此同時,機器學習在各種不同情境與模態中,有很大一部分已轉向基礎模型的範式:以大規模預訓練一次網路,再無需微調即可應用於新任務。因果基礎模型(Causal Foundation Models, CFMs)將此範式帶入因果推論。CFMs 是預訓練神經網路,能在全新的資料集上利用上下文學習估計因果量(如平均處理效應),且無需更新模型。本文提供這個新興領域的實用導論;我們會在討論 CFMs 之前,先概述因果推論與機器學習的必要背景。全文包含範例程式碼與 Jupyter notebooks。
在策略蒸餾(on-policy distillation)會讓語言模型以自己的生成結果進行訓練,同時由教師模型逐詞元(token)評分。此方法結合了模仿學習的密集監督,以及強化學習的在策略取樣。然而,它需要第二個更大的模型來擔任教師。在策略自蒸餾(On-Policy Self-Distillation,OPSD)消除了這項成本。教師即為模型本身,但以學生在測試時無法取得的特權資訊(privileged information)作為條件,例如參考解答、計畫或環境回饋。教師並不比學生更強,只是擁有更充分的資訊。早期結果相當有前景,僅需生成一小部分詞元,即可達到與強化學習相當的準確度。然而,正是這種產生訊號的不對稱性,也使得訊號產生偏差。目前該領域由一種失敗模式主導:坍縮(collapse),亦即模型所能產生的推理路徑集合逐漸變窄。坍縮並非 OPSD 所獨有,但特權資訊會加劇此現象。本綜述將坍縮視為受三個槓桿調控的症狀:(i)訊號施加的位置,亦即詞元如何被加權;(ii)教師所見的內容,亦即特權資訊的性質;以及(iii)訊號何時改變,亦即教師的動態與引導的衰減。我們將範疇限定於數學推理,因為此方法起源於此,且其失敗模式在此有最完整的記錄。我們未報告新實驗。本文的貢獻在於結構性層面:為不同論文中以不同名稱描述的現象提供共享詞彙,並清楚劃分已定論與仍具爭議之處。
視覺-語言-動作(VLA)模型直接將視覺觀察與語言指令映射為機器人動作,然而長程任務所需的不僅是動作預測。智慧體必須在物理狀態演變的過程中,協調感知、規劃、執行、進度驗證與復原機制。單憑動作預測或模型生成的技能決策,並不足以保證所提出的操作在當前狀態下有效,亦無法保證其結果會被驗證。我們提出 EmbodiedSkills,一個統一框架,將每次技能決策視為一項執行提案:執行時期在執行前檢查其前置條件,並在執行後驗證其結果。一個共享的可執行技能介面,將高層級技能選取、受限的低層級 VLA 執行,以及動作後驗證串聯於單一智慧體循環之中。由於此介面保持固定,低層級 VLA 策略得以在不更改智慧體循環的前提下被替換或調整。該介面亦將規劃、執行、驗證與復原事件記錄為結構化軌跡,這些軌跡可為各別元件提供監督訊號,並在具備互動式回饋時支援選擇性的線上調適。我們以 Qwen3-VL 與 OpenPI/pi0.5 為基礎,在 RoboTwin 2.0 與 LIBERO 上實例化 EmbodiedSkills。經任務調適的低層級 VLA 策略在 RoboTwin 2.0 的 50 項任務中達到平均 86.20% 的成功率,並在四個 LIBERO 套件中達到 97.40% 的平均成功率。這些結果確立了 EmbodiedSkills 中所採用之任務調適低層級 VLA 策略的執行效能。在四項依賴記憶的 RMBench 任務中,相同的任務調適執行方法僅達到 12.5% 的平均成功率。本框架提供了一個可訓練且可檢視的智慧體層,用以將這些策略轉化為閉環具身系統。
在策略蒸餾(On-policy Distillation, OPD)透過在學生模型自身生成的軌跡上,由凍結的教師模型提供密集的 token 層級監督,加速後訓練。基本 OPD 將此監督均勻套用於所有提示,而未檢查教師模型對每個提示是否可靠。由於反向 KL 散度具有尋模態(mode-seeking)特性,一個自信但錯誤的教師可能引發強烈且具誤導性的更新。分布層面的代理指標(如熵,或教師與學生之間的似然一致性)能衡量不確定性或一致程度,但無法直接驗證結果的正確性。我們提出教師門控在策略蒸餾(Teacher-Gated On-Policy Distillation, TGOPD),其原則為:在允許密集監督之前,必須先在提示層級驗證教師的可靠性。TGOPD 從一小組由驗證器評分的教師探測樣本中估計可靠性,並在可靠性檢查通過時,將每個提示專門導向密集 OPD;否則,導向基於驗證器的 GRPO。在數學、程式碼與指令跟隨任務上,無論是 4B 還是 35B 的學生模型,TGOPD 在全部六種單一領域設定中皆優於基本 OPD,並在多領域訓練中於兩種模型規模下均達到更高的七項基準平均分數。此外,TGOPD 利用原本閒置的教師算力進行可靠性估計,因而降低了非同步 OPD 中教師端的算力浪費;在所量測的 4B 單一領域執行中,教師節點 GPU 利用率從 9.8% 提升至 78.9%。
許多自然語言處理任務,例如摘要和抽取式問答,皆可化約為在兩個約束之下從文件中檢索相關內容:其一是覆蓋率,即保留足夠的相關資訊以達成某目標;其二是簡潔性,即移除盡可能多的不相關資訊。共形預測方法已被用來保證覆蓋率,並須透過設計評分函數來最佳化簡潔性。當前最先進的評分函數使用人工設計的大型語言模型(LLM)提示詞,要求模型對內容的重要性進行評分;然而,人工提示工程既耗費人力,又具任務特異性。我們提出共形相關性框架(Conformal Relevance framework),利用上下文學習的範例篩選與集成方法來建構評分函數,使其能在最少人工投入下維持覆蓋率並增進簡潔性。我們在七個自然語言處理任務上展示此框架的應用,並在理論上研究多樣性對集成共形分數的影響:我們提出一個互補性條件,用以刻畫集成何時能改善最差情況下的句子分數,並給出一個針對集成改進的飽和界限。
安全對齊通常被表述為一個主題層級的問題:這個主題是否有害?然而實際部署所提出的問題更為狹隘。公民教育導師與公共部門助理可能共享同一個基礎模型,卻需要在同一主題內設定不同的界線——拒絕針對性的政治操控,同時仍回答關於同一場選舉的事實性問題。我們將此問題形式化為「狹窄邊界安全」,並提出一個離線自生成的框架,結合受控主題生成、覆蓋率修復、分布內補償資料,以及用於訓練與評估的有害-無害配對。單次生成會使19.88%的提示缺乏可被接受的拒答痕跡,而逐步升級的重試機制則將其降至0.20%。在以Qwen3-8B進行的政治說服任務中,使用透過Escalate完成的拒答資料進行訓練,可將目標領域的拒答率從9.47%提升至84.75%,並將三個更廣泛的傷害性基準測試中的平均不安全回應率從26.26%降至0.14%,但同時使XSTest的過度拒答率從2.00%上升至74.00%。在另一項配對比較中,以經過驗證的目標模型回應取代外部回應,可將過度拒答率從15.20%降至5.20%。邊界配對資料可將保留配對中順從側的過度拒答率從32.94%降至4.16%,而有害側的拒答率僅從91.88%小幅下降至87.72%。這些結果顯示,資料組成控制了安全性与可用性之間的取捨,且安全對齊應在預設拒答邊界的兩側同時進行評估。
大型語言模型(LLMs)常在對話中透過生成與修訂的反覆循環,協助使用者產生產物(artifact)。此處的挑戰在於,當使用者在修訂時僅指定一個局部變更,LLM 必須識別相關的依賴關係,並將該變更傳播到產物中所有受影響的部分。本文研究 LLM 在對話式生成產物上的此能力;在此情境中,產物上下文及其依賴關係可能嵌入於對話歷史中。為了貼近實際應用,我們也探索在此新情境中具成本效益的測試時計算。具體而言,我們為此情境引入一個新基準,並使用 gpt-oss-20b/120b、gpt-5.4-mini 與 qwen3.5-9b/27b/122b 在此基準上評估九種修訂方法,包括順序反思與並行取樣變體。結果顯示,基線方法的準確率介於 68.3% 至 93%;最具成本效益的方法是使用基於 LLM 的選取或 medoid(中心點)選取,從三個並行樣本中選擇一個,能將準確率提升 2.2% 至 9.7%。我們的程式碼與資料集位於 https://github.com/ntt-dkiku/llm-revision-propagation。
我們提出一個兩節點分割式LLM訓練系統的系統安全個案研究;該系統的隱私評估通過,但留下了一個可觀察通道未經測試。可信本地節點(TLN)將受保護的激活值傳送給不可信雲端節點(UCN),UCN回傳其輸出,而持有私有損失的TLN再回傳輸出梯度。UCN所接收的幀將真實行與誘餌行混在一起,而損失函數忽略誘餌行。誘餌行的梯度恰好為零,因此零值的模式便揭露哪些行是真實的。我們用一套事先固定的協議來量測此現象:先以已知強度注入一個洩漏,以證明量測工具能偵測到訊號;再使用隨機打亂標籤的控制組,以證明工具不會在沒有洩漏時誤報;並在運行前設定閾值。在九個種子下,零值模式在每一幀皆識別出真實行,每次執行的4,096個之中有4,096個被識別。針對幀內容的攻擊,相較於固定猜測基線,約每百個token多恢復一個token(+0.65至+1.50個百分點);隨機打亂標籤的控制組則未恢復出任何內容。第二組運行在將模型品質維持於預算內的配置上重複了此結果,因此該發現並不限於無人會採用的設定。在兩個資料集上,所有這類運行都通過了前向通道的隱私檢查與品質檢查,然而一旦把回傳的梯度納入檢查,便會在同一檢查中失敗。對梯度的每一行進行裁剪與加噪後,该洩漏被關閉,代價是留出交叉熵增加約0.01 nats。系統並非因此就安全:有五類攻擊從未被量測,包括那些跨訓練步驟累積觀察的攻擊。