每日精選AI研究論文及翻譯
沒有任何單一大型語言模型(LLM)能在所有查詢和預算限制下維持最優表現,這使得模型路由成為實現具成本效益部署的關鍵。現有的路由器採用多樣化的公式化表述與實作方式,使得公平比較與擴展變得困難。我們提出了一個統一的LLM路由公式化表述,將其視為一個序列決策過程,由五個組成部分刻畫:上下文編碼器、模型編碼器、評分函數、決策規則與學習信號,涵蓋單輪、多輪及個人化路由。基於此公式化表述,我們開發了一條自動化管線,用以建構路由監督訊號,並同時評估路由器在回應品質與推論成本上的表現。由此產生的基準測試xRouteBench涵蓋通用LLM、記憶增強、視覺、時間序列及個人化路由任務。我們進一步引入了LLMRouter,一個開源的模組化基礎設施,內含超過16個具代表性的路由器。我們的實證研究顯示,學習型路由器相對於最強的固定模型基準線有14.6%的相對提升;輕量級路由器在嚴格成本限制下更具競爭力;而使用者條件化路由則持續改善個人化效果。
互動式世界模型必須支援持久記憶、即時互動與長時域生成,然而這些需求對模型施加了相互衝突的要求。在去噪器上下文或鍵值快取中維護歷史會產生不斷增長的成本,迫使模型在會話長度與記憶保留之間進行取捨;而低延遲互動依賴於少步生成,其能力受到教師模型的限制。Evoke 透過外部化持久世界狀態並重新設計教師模型以實現長時域互動生成,解決了這兩項限制。場景幾何被維護在一個外部、以相機為索引的世界狀態庫中,僅從中檢索與視圖相關的資訊,從而使去噪器上下文在會話增長時保持有界。我們並未將教師模型視為固定的生成器,而是為其設計了長時域監督能力:其稀疏注意力結合了分塊分組、對所選遠距幀的檢索,以及線性注意力全局狀態,在記憶體與計算上實現線性增長,同時能夠在長時域上進行監督。這種監督暴露了在短時間窗口內仍保持局部合理性的內容漂移,而每塊條件化則允許在整個序列中進行提示變更與事件控制。在自強制展開下應用的 30 秒分佈匹配目標,將這兩種能力轉移至一個不使用無分類器引導的三步學生模型,在保留即時條件化的同時,增強了對長期漂移的抵抗能力。憑藉有界上下文與循環外部記憶,Evoke 支援開放式、持續演化的生成;在單張 H200 上、解析度為 384×640 時,每個 1.5 秒的區塊僅需 2.11 秒即可生成。作為一個三步世界模型,Evoke 在 WBench 上取得了最先進的效能,同時在 VBench-Long 與 VBench-2.0 上保持競爭力。
我們提出DreamX-Phi 1.0,一個用於機器人操作的動作條件化影片世界模型。給定一張觀察幀、一條語言指令,以及由末端執行器姿態與夾爪狀態所組成的指定動作序列,該模型可預測隨之而來的未來觀察結果。然而,僅有真實感並不足以保证忠實度:一個令人信服的生成序列仍可能移動錯誤的機械臂或遺失被操作的物體。為確保預測尊重每個機械臂的指令路徑,我們透過PRoPE風格的幾何編碼,將每個機械臂的SE(3)變換注入注意力機制中,以保留機械臂身份與剛體運動結構。僅靠動作控制無法完全約束場景幾何或小型操作物體的演變。因此,我們加入一個輕量級深度分支來處理場景級幾何,並使用SAM3遮罩搭配凍結的V-JEPA教師模型,在抓取過程中維持物體一致性。我們進一步透過分佈匹配蒸餾,將多步生成器蒸餾為少步學生模型,以實現高效部署。截至撰寫本文時,DreamX-Phi 1.0在WorldArena 2.0挑戰賽的Track 1中獲得第一名,並在Track 2中獲得第二名。我們的模型與程式碼將公開提供。
LLM 智能體的能力不僅取決於模型權重,還取決於其框架:提示詞、工具、技能與控制流。自我改進迴圈已經在編輯框架,但單一譜系搜尋具有路徑依賴性,且局部勝利常使其他任務退化。我們提出 DarwinX,將自我演化視為在模型凍結條件下對框架群體進行選擇:「保留並擴展」契約只接納能擴展覆蓋範圍且不造成退化的變體;檔案庫保存替代譜系以供重組;來自失敗、教師與自我產生的證據共享同一個編輯介面。適應度來自每個基準測試自身的驗證器:無需標準解答,無需人工挑選獲勝者。在四個逐步將演化訊號與測試分離的基準測試上,單一迴圈平均增加約 17 個百分點:Terminal-Bench 2.1 在匹配的基礎模型上提升 +7.7 至 83.2%,在更強的基礎模型上達到 84.7% 的驗證前沿;TerminalWorld 的保留測試分區達到 68.3%,領先所有現成智能體;WebArena-Infinity 真實任務 pass@1 從 43.5% 提升至 93.0%(經審計無誤);且 Terminal-Bench 2.1 的框架可不經修改地遷移至 SWE-bench Verified。演化出的是通用智能體能力,而非針對特定基準測試的補丁,因此它能經受任務、驗證器與基礎模型的改變。凍結的模型不必是固定的智能體:框架選擇能將評估計算轉化為持久能力。
科學發現日益需要能夠對異質模態的科學證據進行推理、與科學工具及環境互動、並能在長期任務跨度中持續取得進展的 AI 系統。我們提出 Intern-S2-Preview,一系列旨在支援多模態科學理解、推理、生成及長期任務的科學智能體基礎模型。訓練流程始於對渲染後的科學文檔、交錯圖文資料及多樣化科學語料庫進行的科學多模態預訓練。從預訓練檢查點出發,我們應用統一的後訓練流程,包含監督式微調、可擴展的多任務強化學習(RL)、黑箱與白箱智能體強化學習,以及在策略蒸餾。此流程由多項實用技術支撐,以提升 rollout 與訓練的穩定性及效率,包括帶離策略校正的部分 rollout、自適應長度正則化、線上推測解碼、穩健的多任務最佳化,以及針對智能體任務的軌跡感知經驗組裝。在架構層面,Intern-S2-Preview-397B 將時間序列建模從高效長序列理解擴展至數值預測,同時 Memory Decoder 作為一條獨立的記憶增強路徑被研究,用於在不修改凍結的 397B 主幹網路的前提下實現快速的科學專業化。在科學、多模態、智能體及通用基準測試上的評估顯示,Intern-S2-Preview-397B 在多種設定下取得了具有競爭力或領先的結果。時間序列模組提升了在 SciTS 上的科學訊號理解與預測能力,而獨立的 Intern-MemDec-4B 擴展則在不修改凍結的 397B 主幹網路的情況下,將 Biology-Instructions 平均分數從 56.92 提升至 60.32。
隨著大型語言模型日益參與科學評估,我們研究了一種潛在的獎勵駭取形式:在所報告的科學內容保持不變的情況下,修辭選擇如何塑造AI審稿判斷,以及這些效應如何隨評估條件而變化。我們建構了一個受控語料庫,包含4,200篇完整論文手稿,源自120篇匿名化的ICLR 2026投稿。兩個LLM改寫器在相反方向上轉換六個修辭維度,五個LLM審稿人在標準與嚴格協議下評估生成的手稿。我們也測試了聯合、遞迴及審稿人引導的改寫。結果顯示,修辭敏感性具有結構性而非均質性。證據框架與新穎性立場在總體評估中產生最大的正負對比,範圍框架構成較弱的第二層級;其餘維度的效應較小或較不穩定。此層級結構在人類評估的品質等級之間持續存在,但分數變化在很大程度上取決於AI審稿人的原始分數:較低的分數傾向於上升,較高的分數傾向於下降,而方向性對比在中間範圍最為清晰。更複雜的工作流程並不能可靠地帶來更大的收益。聯合改寫強烈依賴於改寫器的選擇,審稿人引導並不持續優於無引導的第二輪改寫,而重複改寫產生遞減且依賴配置的收益。在各種條件下,改寫器主要決定對立變體之間的分離程度,而審稿人則決定其分數效應的大小與符號。嚴格審查將平均總體評估(OA)降低1.36分,但不會持續改變修辭敏感性。這些發現識別了修辭呈現何時影響AI科學審查,並促使建構對科學寫作中保留內容的變異具有魯棒性的評估系統。
視頻世界模型根據當前觀測和用戶動作模擬未來狀態。近期的系統已在長序列上展現出令人矚目的視頻一致性和動作可控性。然而,公平地比較這些互動式模型仍然充滿挑戰。在實際應用中,人類玩家通常通過互動追求長期目標來評估世界模型。例如,用戶可能旋轉360度以檢查環境是否保持一致,或走入水中觀察是否生成逼真的水波紋。要達成相同目標所需的動作序列在不同模型之間可能差異很大,這使得固定的動作條件評估不適合跨模型比較。為了解決這個問題,我們採用多模態智能體玩家(Agent Players)與世界模型互動,以達成指定的長期目標。在此範式基礎上,我們提出了PlayWorld,一個提供171個場景的基準測試,每個場景都有明確的目標。為了全面評估性能,我們沿四個核心維度評估模型:幾何一致性、互動真實度、視野外演化,以及洞察演化。此外,我們還納入了視頻質量和可控性的基本能力指標。對九個最先進世界模型的實驗結果表明,目前的模型在長期互動目標上仍不可靠,特別是在維持空間一致性和持續狀態演化方面。代碼和數據可在 https://github.com/kxding/PlayWorld 獲取。
將多模態來源轉化為精簡且結構化的媒體輸出,從根本上可被概念化為一個以模型-框架系統為核心的長視野代理過程。理想的框架系統理應與人類設計先驗對齊,並透過經驗探索累積可重複使用的經驗,以驅動遞迴自我改進;然而,現有範式依然靜態,未能達成此能力。在本文中,我們提出AutoDesign——一個與人類設計先驗對齊的架構,其中元框架優化器引導程式碼代理根據展開回饋遞迴地改進框架。為實例化並評估此架構,我們聚焦於學術論文到海報生成任務,並引入PosterBench,其包含涵蓋五個學科的100篇論文主軌道(Main Track),以及用於受控評估的共享10篇論文子集PosterBench-mini。在PosterBench Main Track上,AutoDesign取得最高分78.32,以7.45分的優勢超越封閉原始碼商業系統Claude Design。在七種受控的程式碼代理-模型配置中,整合所學到的DesignHarness持續提升效能,將平均PosterBench分數從54.99提升至67.39(+12.4%)。在完全自主的長視野迴圈中,AutoDesign在40分鐘內以不到3美元的成本執行253次工具呼叫與11次編輯回合,於人工評估中達到平均會議海報品質。一項系統盲測人工研究進一步顯示,在受評系統中,AutoDesign獲得最高的人類偏好。
空間智能正逐漸成為具身智能體、機器人規劃與多模態助手的基礎能力。為提升VLM智能體的空間推理能力,現有工作主要沿兩條路線展開:一條採用後訓練方法,例如監督式微調與強化學習;另一條則採用智能體範式,使模型呼叫深度估計、3D重建等外部空間工具,以收集中間空間證據。我們研究了一條互補且尚未被充分探索的途徑:凍結的VLM智能體能否在推理時不依賴外部專家空間工具,透過免參數更新的自我演化來提升其空間推理能力?我們提出空間記憶智能體(Spatial Memory Agent, SMA),這是一個基於經驗的運行時框架,可將驗證過的空間經驗轉化為可重複使用、可遷移的經驗教訓。在可驗證的空間環境中,SMA查詢凍結的VLM,取得預測答案與獎勵,並利用驗證器引導的反思,從空間經驗中提煉出簡潔且可遷移的經驗教訓。SMA進一步為每條經驗教訓分配一個遷移可靠性評分(Transfer Reliability Score, TRS),該評分初始為均勻分佈,並根據後續檢索結果進行校準,作為未來遷移可靠性的訪問證據。在唯讀部署階段,SMA透過語義過濾器與相似度-TRS結合排序來檢索經驗教訓,使檢索到的記憶能夠引導凍結模型的推論。在五個具代表性的空間基準與四種基礎VLM上,SMA在每個基礎模型區塊中均達成最高的巨集平均,並在20項評估中的多數情況下取得所評估方法中最高的準確率,從而在所評估的凍結模型規模與環境中,為空間自我演化建立了一條實用的免參數更新路徑。
我們首次系統性地研究了層間交錯的混合線性注意力(HLA)大型語言模型中的大規模激活(MAs),並發現兩種與架構對齊的形態:MAs 會在全注意力層之前持續出現尖峰,形成注意力前尖峰(PAS),且可透過中間的線性注意力層持續存在,從而產生尖峰間平台(ISP)。隨著全注意力層變得更加密集,連續的 PAS 透過 ISP 日益相互連接,最終恢復全注意力 LLM 所具有的穩定 MA 形態。我們在五種線性注意力架構、六種混合配置、五個數據領域,以及參數總量從 1.2B 到 397B 的代表性開源混合模型中,確立了這種組織結構的重現性。基於 GDN 的混合模型在最高 1.3B 規模下的受控預訓練顯示,這兩種形態均在早期出現,並對輸出門控呈現不對稱反應:全注意力輸出門控會大幅衰減其絕對幅度,但不會消除其逐層組織結構;而移除 GDN 門控則僅造成相對溫和的放大。從機制上而言,我們的系統性離群值分析支持一個由 MA 抵消時機所主導的共享生命週期解釋。PAS 遵循局部化的寫入-下沉-抵消過程,而 ISP 的延長持續性則與延遲抵消一致。在全注意力極限下,此解釋恢復了全注意力 LLM 特有的穩定 MA 形態。我們的代碼可在 https://github.com/StartluxLabs/Massive-Activations-HLA 取得。
說話影片角色替換需要在保留來源動作、場景、語言內容及影音時序的同時,協調轉移外觀與聲音。現有方法針對兩種模態使用各自獨立優化的模型,使得影音一致性難以確保。我們提出UniSwap,這是首個在說話影片中進行串流式聯合影音身分替換的框架。給定來源影片、參考影像與參考語音片段,UniSwap在單一影音擴散Transformer中同時轉移參考外觀與嗓音音色,同時保留來源內容與動態。為了解決跨身分對齊訓練樣本稀缺的問題,我們引入交換-重建流程:從真實片段中移除視覺與語音身分,並以原始片段作為重建目標。我們從雙向骨幹網路出發,逐步調適模型,包括:情境內預訓練以實現聯合替換、條件式串流適應以實現區塊因果KV快取生成,以及高效自強制DMD以緩解曝光偏差並將每個區塊的去噪取樣步數從30步減少至3步。高效多LoRA切換使三種DMD角色得以共享單一凍結骨幹。特徵RoPE分解將快取位置保持在訓練範圍內,支援穩定的長序列推論。實驗結果展現了強勁的影音同步、具競爭力的身分保留、高效的串流能力以及穩定的長序列生成。
姿態驅動的人體動畫旨在從單張參考圖像與一條驅動姿態串流中,合成目標人物的影片。即時生成對於直播、遠距臨場與虛擬化身等互動應用至關重要;然而,基於擴散的系統生成一段剪輯需要數分鐘到數小時,無法支援即時互動。我們提出 LiveAnimate,據我們所知,這是第一個在十億參數量級上結合即時串流與穩定長序列生成的動畫系統,其核心為一個擁有 140 億參數的影片擴散 Transformer(DiT)。我們的兩階段訓練流程首先透過參考錨定教師強制適應(Reference-Anchored Teacher-Forcing Adaptation),將預訓練的雙向 DiT 改造為區塊因果自迴歸生成器;接著透過區塊式自強制蒸餾(Block-wise Self-Forcing Distillation),將取樣預算降至三步。為了在長串流中保持外觀,我們引入姿態檢索匯集注意力(Pose-Retrieval Sink Attention, PR-Sink)——一種有界 KV 快取機制,結合了永久錨定第一個生成區塊的靜態匯集(Static Sink)、保存姿態檢索歷史區塊的動態匯集(Dynamic Sink),以及一個三槽滾動視窗(Rolling Window)。當某個姿態再次出現時,PR-Sink 能還原相關的外觀上下文,而無需保留整個序列,因此記憶體使用量與每區塊延遲皆不隨串流時長增長。結合 Ulysses 序列平行與運算子融合,這些設計在兩張 NVIDIA H100 GPU 上實現了 19.63 FPS 的串流推論。在三分鐘的基準測試中,LiveAnimate 從前 30 秒到最後一分鐘幾乎維持恆定的感知品質與身份一致性,而既有系統在相同測試中要麼大幅衰退,要麼需要數小時的離線計算。這些結果為互動式全身動畫在品質、延遲與時長方面樹立了新的效能基準。
自回歸Transformer沿兩個軸向進行計算:水平方向跨越生成出的token,垂直方向貫穿模型深度。密集注意力讓每個token都能對過去進行廣泛的水平訪問,但解碼步驟之間的垂直反饋通道仍然狹窄:只有採樣出的token會返回堆疊底部,而頂層隱藏狀態則被丟棄。我們引入了全頻寬Transformer(full-bandwidth transformer),透過潛在反饋(latent feedback)拓寬此通道:在每個解碼步驟中,先前的頂層隱藏狀態會透過門控線性單元與採樣出的token嵌入融合,並作為下一個輸入反饋回去。潛在反饋讓未言語化的計算能以重新獲得的深度預算進入堆疊,同時保留標準Transformer架構、KV快取和語言建模目標。為了在不失去並行教師強制(teacher forcing)的情況下訓練全頻寬Transformer,我們使用一種排程多遍次目標:在預訓練後期才引入潛在反饋,並混合少量更深層的反饋遍次以維持穩定性。我們訓練了多達4000億token的10億參數全頻寬Transformer,發現潛在反饋改善了驗證損失、5-shot語言模型評估、數學與程式碼生成,以及指令微調的效能。在每token解碼開銷可忽略不計的情況下,全頻寬Transformer能夠匹配或接近以約1.5倍token訓練的標準Transformer,並且在相同或更好的準確度下產生更短的推理軌跡。
視覺 token 剪枝可以大幅降低多模態大型語言模型(MLLMs)的推論成本,然而現有方法大多依賴於固定、手工設計的啟發式規則,以及代價高昂的專家試誤。隨著剪枝目標、預算與模型架構日益多樣化,手動探索不斷擴大的設計空間變得越來越困難。本文旨在透過回答一個自然的問題來建構視覺 token 剪枝的 AI4AI 框架:大型語言模型能否自動設計出有效的視覺 token 縮減演算法?儘管 LLM 具備廣泛的演算法知識與強大的推理能力,但要將這類通用知識轉化為特定任務的有效解決方案仍非易事。我們認為,關鍵在於設計一種適當的搜尋狀態表示,將 LLM 的內部知識與視覺 token 剪枝的結構要求及約束聯繫起來。基於此洞察,我們提出 AutoPrune,一個免訓練的 LLM 驅動視覺 token 剪枝策略設計框架。AutoPrune 的核心在於引入了一種 Token 剪枝領域特定語言(TPDSL),其中包含 131 個可重用原子,涵蓋預算控制、token 評分、選擇約束與 token 重組。TPDSL 的一個關鍵特性是將每個搜尋狀態表示為一個強基礎策略的殘差修正。這種殘差形式縮小了搜尋空間,並將 LLM 的注意力引導至對性能最具影響力的策略組件。在 14 個多模態基準及三個 MLLM 骨幹上的實驗證明了 AutoPrune 的有效性、效率與可遷移性。即使移除 94.4% 的視覺 token,AutoPrune 仍能保留全 token 性能的 99% 以上,同時將 FLOPs 降低 9.9 倍、預填充延遲降低 6.4 倍。
大規模操作數據對於機器人學習至關重要,然而收集機器人示範數據仍然成本高昂且難以規模化。與此同時,豐富的第一人稱人類操作視頻提供了大量的行為經驗,但由於人類手部與機器人末端執行器之間的差異,跨具身遷移仍然充滿挑戰。視頻世界模型的最新進展為從人類觀測中合成以機器人為中心的操作視頻提供了有前景的途徑,但其跨具身遷移能力在很大程度上尚未被探索。為此,我們提出H2R-Bench,一個用於評估跨具身人機操作視頻生成的基準,其中模型需要在指定具身條件下將第一人稱人類示範轉換為機器人操作視頻。每個基準實例包含一段人類示範視頻、目標具身約束,以及涵蓋任務目標、動作事件、功能接觸和物體響應的源端對齊注釋。H2R-Bench從五個維度評估生成的視頻,包括目標狀態完成度、動作事件完成度、功能接觸遷移、具身正確性和一般視頻質量。我們對六個操作類別和兩種機器人具身條件下的十一個最先進視頻生成模型進行了基準評估。評估結果表明,當前的視頻世界模型在人機操作遷移方面仍然存在局限性:即使是領先模型也經常在具身一致性、功能交互和任務執行方面失敗。H2R-Bench提供了一個系統化的診斷框架,用於評估視頻世界模型能否彌合人機具身差距,並將人類操作觀測轉化為以機器人為中心的訓練資源。
創作型智能代理仍缺乏從高品質人類電影中學習的有效途徑,限制了其生成電影級影片的能力。一個關鍵挑戰在於缺乏一種結構化的視頻表示,既能忠實呈現電影內容,又能直接用於代理推理與操作。為應對此挑戰,我們提出了代理式視頻自編碼器(AVA-Encoder),這是一個通過代理式自編碼來學習代理原生視頻表示的框架。 AVA-Encoder 將視頻轉化為知識圖譜(KG)表示,再將其重建為視頻。其層次結構與狀態節點存儲結構化文本,而連結的資源層則保存生成的圖像、音頻和視頻。類型化邊以代理易於理解、查詢和編輯的形式,保留這些文本描述與資源之間的關係。視頻重建的差異驅動文本梯度優化框架,將評估反饋轉化為自然語言更新方向,用於外循環中的數據無關編碼策略偽訓練,以及測試時內循環中可選的數據依賴知識圖譜表示精煉。 大量實驗表明,AVA-Encoder 相比最強的外部基線提升了20.7個百分點。在僅策略的受控設置下,其偽訓練的鏡頭級代理視頻編碼策略也優於精心人工調校的策略,同時減少了74.3%的系統提示令牌。我們發布了完整的 AVA-Encoder 框架、一個可靠的代理式視頻重建基準測試,以及首個高品質電影知識圖譜表示數據集。
互動式自迴歸影片生成需要同時滿足低延遲展開與精確的線上控制。少步蒸餾透過減少去噪步驟來加速生成,而線上控制則引入了因果約束:幀與區塊只應依賴於生成時可得的歷史與控制訊號。然而,現有的影片分布匹配蒸餾(DMD)流程,常以對完整片段評分的雙向教師來監督因果少步學生模型。因此,對某個目標的評分可能依賴於學生生成該目標時尚不可得的未來幀與控制訊號,使得教師監督與學生的因果資訊集合不一致。我們提出上下文匹配蒸餾(CMD),這是一個因果 DMD 框架,能讓教師監督與生成每個目標時可得的資訊對齊。CMD 以因果教師取代雙向的整段片段評分;該教師在無法取得未來幀或控制訊號的情況下評估每個目標。相同的因果教師也用來初始化少步學生模型,從而在教師訓練、學生蒸餾與推論之間建立一致的因果表述。除了對齊時間資訊邊界之外,前綴評分進一步將監督對齊至學生實際展開的上下文,也就是在每個目標所依據的快取學生生成前綴之下評估該目標。前綴破壞則透過擾動訓練早期產生的不可靠前綴來穩定訓練,同時保留目標與上下文之間的對齊。憑藉簡單的因果表述,CMD 自然可延伸至逐幀與逐區塊生成、長影片蒸餾,以及相機條件蒸餾。實驗結果顯示,CMD 在短影片與長影片基準上,於自迴歸方法中達成整體最先進的表現,並大幅提升對時變相機控制指令的遵循度。
近期基礎模型的進展使人工智慧科學家能夠自動化日益完整的研究流程,從假說生成、程式碼執行到稿件準備。然而,僅有流程涵蓋範圍並無法讓代理取得科學發現所依賴的完整證據。現有系統通常僅基於文字、程式碼、標籤或預計算摘要進行推理,使得具有科學決定性的空間、時間、跨通道及程序關係無法被代理取得。我們提出 OmniScientist,一個端對端、全模態的人工智慧科學家,可直接從異質原始證據進行跨學科研究。感知層與三個分別負責構思、實驗與撰寫的自主代理在確定性流程中運作,使觀察能在整個研究生命週期中塑造研究問題、實驗決策與最終主張。透過以程式碼執行構思、嚴謹性與主張檢查,系統強制進行新穎性篩查、統計有效性、執行溯源與數值可追溯性。我們在涵蓋5個學科類別、4類科學證據以及包括影像、訊號、音訊、影片、3D結構、軌跡、表格、公式與圖形等模態的36個真實資料案例上評估 OmniScientist。該系統在所有36個案例中完成從原始資料到編譯稿件的完整路徑,並在參考推理主幹下獲得平均論文總分6.3。在與僅接收預計算標量特徵的盲測變體進行配對比較時,直接感知在所有7個評估維度上均有提升,並在85%的兩兩比較判斷中勝出。這些結果顯示,全生命週期感知對於基於證據的科學發現至關重要,並為實現廣泛能力的人工智慧科學家提供了切實可行的途徑。
智慧體技能代表了一種用於封裝程序性知識與領域專業知識的標準化格式,在智慧體框架系統中扮演關鍵機制,持續約束語言模型的行為空間,以實現可重複且高品質的任務執行。然而,由於強大的閉源模型涉及高昂的推論成本,目前主流的智慧體框架(如 Codex 和 OpenClaw)在部署這些技能以完成真實世界任務時,成本仍然過高而難以普遍採用。可在消費級 GPU 上運行的開源模型能力快速提升,為透過基於技能的行為約束大幅降低這些成本提供了極具吸引力的契機。儘管如此,針對此類輕量模型自動生成有效技能仍是一項重大的實際挑戰。為應對此問題,我們提出 SKILLER——一個以自然語言驅動的強化學習框架,專為小型模型自動生成執行者特定技能。該框架以強大模型作為行動者與評論家,將小型模型智慧體系統視為環境,並完全透過自然語言傳遞所有強化學習訊號。在五個相關基準測試上使用 Qwen3.5-9B 與 Qwen3.5-4B 進行的大規模實驗評估顯示,SKILLER 優於三種開源與一種閉源的技能生成或演化方法,在 9B 模型上取得 4.3 至 20.4 個百分點的絕對提升,在 4B 模型上取得 1.8 至 13.3 個百分點的提升,同時在 SkillsBench 的單技能任務上顯著匹敵強大閉源模型的效能。該專案可於 https://github.com/DANG-ai/SKILLER 取得。
大型語言模型(LLM)在自然語言任務中展現出卓越的效能,然而它們是以靜態語料庫進行訓練,在快速變遷的世界中,其知識很快便會過時。這促使了知識編輯(KE)的發展,其旨在更新LLM中的特定知識,同時不影響其他無關的知識。近期研究從結構化的知識三元組轉向非結構化知識編輯(UKE),其中編輯內容為一段自由形式的文本,可能同時陳述多個事實。儘管如此,現有的編輯器雖能注入此類文本,卻未能善加利用:編輯後的模型雖能回憶該文本,卻既無法回答關於其中事實的原子性問題,也無法將這些事實組合成多跳推理。我們將此缺失的屬性稱為可組合性,並將其歸因於編輯器被動地依賴固定文本作為唯一學習來源。為此,我們將編輯重新詮釋為一種從同一模型的特權情境內狀態進行的主動式自蒸餾,此過程無需外部監督。我們進一步揭示,由於所注入知識的新穎性,編輯前模型自身的軌跡展開(rollout)鮮少涵蓋這些知識,從而限制了純粹同策略蒸餾的有效性。為填補此差距,我們提出HPSE,其建構一種混合式軌跡展開,在學生的自身軌跡覆蓋不足之處精準介入,將缺失的事實置入其中,同時在其他位置保持同策略。我們在理論上分析了HPSE相較於純粹同策略蒸餾的優勢,並在實證上確立了其在四種LLM主幹模型與兩種KE編輯器於各種情境下的即插即用改進。
長程大語言模型代理必須保留過去互動中的資訊,以支援未來的任務。現有的記憶系統通常依賴急切式整合,在每次互動後呼叫大語言模型來提取、摘要或更新記憶。這種設計使得隨著對話增長,記憶建構的成本日益增加。粗略的摘要雖可降低建構成本,卻有丟失細粒度情境證據的風險;而擴大檢索上下文或採用多跳大語言模型推理,則會將開銷轉移至查詢階段。我們提出 LycheeMemory V2,一個以語意片段層級整合取代回合層級整合的高效長期記憶框架。LycheeMemory 不對每次互動進行整合,而是將多次交流批次化為片段,並將每個已定稿的片段編碼為與上下文無關的型別化記憶紀錄。片段層級批次處理可降低大語言模型的編碼頻率,而與固定視窗批次處理相比,語意邊界偵測有助於保留連貫的事件層級與時間證據。所產生的紀錄以輕量結構化索引組織,用於查詢規劃式證據檢索。使用 GPT-4.1-Mini 的實驗顯示,LycheeMemory 達到了最先進的效能,在 LoCoMo 上達到 89.22%,在 LongMemEval-S 上達到 92.20%。與 A-Mem 相比,它在 LoCoMo 上減少了 86.0% 的建構 token,在 LongMemEval-S 上減少了 75.9%,且未增加查詢階段的 token 使用量。更廣泛而言,我們的結果表明,長期代理記憶的準確度與成本之間的取捨,不僅取決於保留了哪些資訊,還取決於資訊整合的粒度。
大型語言模型在超出其能力的任務上,會產生計算成本高昂卻語義空洞的推理,此現象造成可聽起來合理但內容錯誤的推導過程誤導使用者,衍生諸多風險。我們透過系統性分析來刻畫此一徒勞推理現象,揭示普遍存在的能力越界,以及能力與行為之間系統性的校準失準。最主要的失敗模式為虛假推理,其輸出表面上看似有效,實則含有細微錯誤,且此問題隨任務難度提升而加劇。為解決此問題,我們提出CaRL(能力對齊強化學習),透過獎勵塑形機制激勵模型拒絕作答而非進行徒勞推理,並輔以事後拒絕增強機制將失敗案例轉化為拒絕監督訊號,從而將模型行為與能力邊界對齊。實驗結果顯示,該方法在維持各任務難度下表現的同時,大幅減少了徒勞推理,有效實現能力對齊行為而不損及實用性。https://github.com/icip-cas/Knowing-When-to-Quit
測試時計算擴展是大型推理模型(LRMs)效能提升的主要驅動力,但極度的低效率限制了現有方法,使得關鍵問題從「應投入多少計算」轉變為「應將計算配置於何處」。我們將測試時推理正式化為一個在部分軌跡上的受限計算配置問題。在固定的硬體預算下,現有典範無法主動將計算配置到最具潛力的部分進展上:傳統的並行抽樣將軌跡視為獨立處理,導致嚴重的記憶體瓶頸;而減除式剪枝則使硬體資源閒置,無法主動且充分地轉移輸出分佈。為了克服這種二分法,我們提出 Gambit,一種執行思路層級束搜尋的推論演算法。透過定期剪除缺乏前景的軌跡,並立即從高品質的前綴進行分支,Gambit 利用輕量級評分器探測隱藏狀態,動態地將計算集中於最具潛力的推理軌跡,同時維持持續的高硬體利用率。在多個模型與基準上的廣泛評估顯示,Gambit 嚴格優於現有基線方法。在相同的硬體限制下,我們的方法相較於剪枝基線,在 HMMT-24 上可獲得高達 +6.7% 的絕對準確率提升,在 AIME-25 上為 +3.3%;在軌跡完成上提供 >2 倍的吞吐量,並相較於標準並行抽樣,將總 token 消耗減少最多 68.5%。
我們提出 ,一種具有固定大小記憶體的循環Transformer架構,它推廣了滑動視窗注意力,同時在訓練期間保持可並行化。 由兩個耦合模型組成:一個預填充器 Q,它利用完整注意力(在實務上,我們對 Q 使用交錯的全注意力和滑動視窗注意力,因為這能帶來更強的效能。其基本要求是 Q 必須比 P 更具表達能力,並能存取完整的歷史記錄)來產生記憶目標 m'_t;以及一個解碼器 P,它僅使用滑動視窗注意力和循環 K/V 注入,來產生用於下一個詞元預測的解碼器記憶 m_t。我們以記憶一致性損失來訓練 ,使 m_t 與 m'_t 對齊,從而在推論時可僅使用 P。實驗上, 相比滑動視窗和潛在循環Transformer基線,改善了驗證損失以及下游預訓練基準。此外,在 P 與 Q 之間共享參數可減少參數記憶體,同時保留大部分的增益。
大型音訊語言模型(LALMs)已展現出理解多樣音訊輸入的強大能力。這種多樣性包含對人類不可聞的低頻訊號,這些訊號仍可進入模型並影響其生成。然而,此類低頻輸入對 LALMs 的實際影響仍未被充分探討。在本文中,我們提出間歇性低頻鎖定(Intermittent Low-Frequency Lockout, ILL),這是一種不可聞的紅隊測試方法,在黑箱設定下使用通用波形模板來評估此風險。ILL 使用句子注意力尺度估計(Sentence Attention Scale Estimation)來決定有效區間,並利用頻率混淆遷移(Frequency Confusion Transfer)從語料庫頻譜變化中建構具連續相位的低頻波形。為緩解此風險,我們提出分佈性重新查詢防護(Distributional Requery Guard, DRG),以偵測低頻分佈偏移,並有條件地要求第二次錄音以進行語意恢復。在六個 LALMs 與多個音訊理解任務中,ILL 使準確率降低高達 67 個百分點,同時其平均人類可聽度評分為 1.33,接近乾淨音訊的 1.17;DRG 在乾淨重新獲取後,將平均受攻擊準確率從 28.5% 提升至 46.1%。這些發現指出了先前被忽略的 LALMs 安全風險,並為未來穩健音訊理解研究奠定基礎。
本文報告了一個在規範優先協議下由AI編碼代理執行的大規模架構重構之單一、完整儀器化案例研究,其中生成之程式碼未經人工審查,亦無預先存在的測試基準(oracle)可用以驗證目標行為。該任務為拆除一個跨越大型相互依賴程式碼庫的核心不變式,作者評估其透過漸進式重構實際上不可行,此類變更傳統上需要改寫(rewrite)而非重構。在本文所述協議下,該代理成功完成了此任務。 該系統為一個由3,648個檔案組成、共717,725行程式碼的生產環境TypeScript應用程式。此任務需要拆除一個核心生命週期不變式:即保證UI面板在AI請求期間保持開啟。目標行為是串流生成在面板關閉後仍能持續,並可在重新開啟時重新連接至同一個即時串流,且無遺失或重複。 該協議包括:由代理進行正式規範制定、14輪針對原始碼審核該規範之精化循環、原子性實作、編譯/測試回饋循環,以及隨後17輪針對凍結規範審核程式碼之驗證循環。在31次審核通過中,共修正了201個缺陷,全程無任何人類執行該程式。收斂標準為經驗性的:連續兩次驗證通過且回報零發現。 此變更涉及189個檔案(其中31個為新增);加上提取階段,兩次提交共計288個檔案、34,770行新增、16,422行刪除。在首次及後續約三十次的會話中,該軟體均按規範運作,未觀察到任何錯誤。耗時:三天;成本:2,430美元。 完整的規範與原始會話日誌(超過1,500頁,法文)已作為證據公開,可供檢視整個流程,並可提交至語言模型進行一致性檢查。
指令微調語言模型在各種生成任務上表現強勁,但近期也被發現會展現言語化的過度自信。在問答中,語言模型的言語化過度自信可能與其生成的支持性理據的一致性有關。本文研究了由指令微調引起的模型置信度變化,是否伴隨著生成答案理據的詞彙多樣性產生相應變化。我們在問答基準上評估了三組匹配的基礎模型與指令微調模型,發現指令微調一致地改變答案置信度,儘管預測準確率變化有限,且基於似然度的校準有所下降。其次,我們觀察到指令微調對理據多樣性的影響並非一致:跨理據多樣性持續下降,而表層詞彙多樣性在不同模型與基準之間的方向及幅度皆有差異。最後,我們發現這些差異在控制答案選擇與理據長度後仍然存在,證實置信度與理據多樣性捕捉到指令微調的不同效應。
機器翻譯(MT)系統在翻譯性別時經常會出錯,特別是在從英語這類性別中立的語言轉換為像羅馬尼亞語這樣具有性別區分的目標語言時。這種偏差導致翻譯結果預設使用陽性形式,或強化性別刻板印象。我們提出了一個混合流程來緩解此問題,結合了基於大型語言模型(LLM)的性別分類與神經機器翻譯(NMT)。我們的系統使用經過微調的大型語言模型來偵測英語句子中目標詞彙的預期性別,並插入行內性別提示標記。這些帶有標記的句子隨後被送入一個經過微調的Transformer模型,以生成形態學上正確的羅馬尼亞語翻譯。為了支援此方法,我們推出了三個新穎的資料集,用於性別消歧與翻譯。與基準機器翻譯系統相比,我們的方法在WinoMT和WinoGender基準測試上的性別準確率提升了超過40個百分點。這是首個同時利用大型語言模型推論與標記感知翻譯,明確處理並評估英語-羅馬尼亞語機器翻譯中性別偏見的方法。
肋骨骨折在電腦斷層掃描(CT)上相當常見,且定位過程耗時。本研究探討在兩個正交的CT衍生投影(前後位與側位)中獨立偵測到的骨折,是否能跨視圖配對並三角定位為可靠的三維點,同時將偽輸出率控制在設定範圍內;我們以分階段診斷研究回答此問題。投影幾何具有精確性,且在對應關係正確的前提下,定位結果準確(中位數4.0毫米,88%落在10毫米內,93.6%肋骨層級精確)。在一個封閉的55例 cohort 中,原則上可恢復的骨折佔相當高的比例(61.1%具雙視圖可用性,58.4%的骨折在候選圖中存在正確配對),然而關鍵限制既非幾何亦非定位,而是受信心水準限制的跨視圖對應。一項受控制的「偵測器×對應方法」因子設計顯示,操作增益主要來自側位偵測器品質,而非所測試的匹配方法;重新訓練側位偵測器後,首次產生了非零的受控預算重建結果。在刻意保守的承諾政策下,一項預先指定的封閉測試將601處骨折中的15處提升為正確的三維定位,每例偽點數為0.436(端對端承諾產出率2.50%),且承諾點定位準確(中位數1.49毫米,93%肋骨層級精確)。低產出率源於信心門控的棄權機制,而非幾何或偵測問題:本研究建立了一個可重現的選擇性三維定位框架,並確認跨視圖對應為主要的操作瓶頸。
半監督語義分割長期以來圍繞著一個核心問題:哪些偽標籤值得信賴。一系列選擇規則——動態閾值、每類別課程式學習、軟置信度權重——在當時解決了雜訊多且置信度不足的 ResNet 教師模型所帶來的挑戰。自監督基礎編碼器改變了這一格局:當使用 DINOv2 教師模型時,置信度趨於飽和,因此曾經有助於弱教師的過濾機制反而可能傷害強教師。我們提出 CW-BASS v2,一種飽和感知的偽標籤選擇方法,它讀取教師模型的置信度狀態,而非固守單一規則。該方法將留出校準(一種無偏的每類別雜訊估計)與可證明能將保留率限制在 1 以下的自適應置信度下限相結合,並在單次通過的門控中加以整合:在留出切片上量測教師模型置信集合的可靠性,即 π_kept = Pr[correct | c ≥ τ],當其滿足所需置信度(π_kept ≥ τ)時進行嚴格過濾,否則退回到自適應下限。此邊界是既有的操作閾值,而非針對 mIoU 調校的數值;在六個 DINOv2 教師模型上,該方法能在盲測條件下做出正確的嚴格/下限取捨。因此,CW-BASS v2 透過選擇嚴格模式,在飽和的基準數據集上恢復了 UniMatch V2 的操作點(Pascal VOC 1/8 上為 87.4,其報告值為 87.9;Cityscapes 差距在 0.5 以內),並在置信集合不可靠之處(π_kept ≈ 89%,ADE20K)取得改進,此時下限模式略勝一籌(單一種子下 mIoU +1.5)。此門控具有原則性,因為它所避免的失敗是被量測的,而非假設的:在可靠且飽和的教師模型上,置信度分布的動態範圍急劇收縮(Pascal 中 98% 的像素 ≥ 0.95),因此自適應截止值會淹沒保留遮罩,使自訓練退化為確認偏誤。
航空運輸中的極端事件(例如嚴重抵達延誤與異常飛行時間)會引發連鎖式網絡中斷,造成可觀的營運、經濟與安全成本。此類事件在歷史紀錄中十分罕見,導致機器學習模型缺乏足夠的訓練訊號。合成數據增強提供了一個原理上可行的解決方案,但傳統生成式模型對分佈尾端的表徵不足,且無法保證不會產生營運上不可行的實例,例如短飛行時間搭配長飛行距離的組合。目前沒有任何既有方法能同時解決混合型表格紀錄的這兩項限制。我們提出 TailBooster,這是一個雙層生成式框架,結合生成式建模與兩個異常偵測層。統計層透過四分位距萃取極端值,為專用的生成式模型(此處為表格變分自編碼器)提供集中於分佈尾部的訓練訊號;深度學習層則套用基於自編碼器的清理機制,丟棄違反自歷史資料習得之營運包絡的合成紀錄。該框架以美國航班紀錄進行評估,涵蓋五個面向:多樣性、統計相似度、真實度、營運有效性與效用,其中後兩者為主要的改進目標。資料驅動的清理機制顯著提升了營運有效性,而針對性增強則強化了極端事件預測的效用。相較於傳統合成數據,在六種迴歸演算法上,使用該框架產製的紀錄進行訓練,可將極端飛行時間預測的平均絕對誤差降低 47–49%,極端抵達延誤預測則降低 29–57%;當以合成極端值擴充真實紀錄時,亦可獲得相當的增益。由於 TailBooster 完全以資料驅動且與模型無關,因此可延伸至極端事件預測至關重要、且缺乏領域特定規則的應用領域。
分數蒸餾採樣(SDS)透過使用預訓練的擴散先驗最佳化渲染影像來實現文字轉 3D 生成,但潛在 SDS(latent SDS)常產生結構性色彩偽影與高頻紋理雜訊。我們識別出由 VAE 引起的像素漂移所導致的潛在 SDS 失敗模式:最佳化後的影像可能沿著 VAE 編碼器約束較弱的像素空間方向移動,因此其潛在表徵保持乾淨且具有語意意義,而影像本身卻累積可見的偽影。我們透過受控的 2D SDS 實驗、僅 VAE 的最佳化,以及一項簡化分析來支持此診斷,該分析顯示當到像素的逆映射約束不足時,類似編碼器的潛在目標會放大影像空間的雜訊。受此觀察啟發,我們提出 PixSDS,一種輕量級且與 VAE 一致的梯度修復方法。PixSDS 解碼潛在 SDS 的前瞻步驟,並使用解碼後的影像作為像素空間最佳化的乾淨方向,減少在與 VAE 不一致方向上的移動,而無需重新訓練擴散模型、更換渲染器或取代 SDS 目標。在 2D 最佳化與文字轉 3D 生成中的實驗顯示,PixSDS 能大幅減少結構性偽影,同時保留語意內容。程式碼已公開於 https://sevashasla.github.io/pixsds-webpage/。