每日精選AI研究論文及翻譯
語音與音頻生成常用於動畫配音、有聲劇、電影、廣告、遊戲、播客與短影音製作等場景。在這些場景中,創作者可能需要在不依賴參考錄音的條件下設計聲音、以自然語言控制說話者風格、以環境與音效支援聲音場景,並在後續重複使用所設計的聲音。因此,同時支援多說話者語音與音頻生成,涵蓋指令任務與零樣本任務,具有重要意義。指令任務需要環境描述、說話者風格及細粒度內容的標註,而零樣本任務則使用參考音訊並搭配相同的細粒度內容。我們從資料與模型兩方面著手解決這些任務。首先,我們提出 SwanData-Caption,對原始語音與音頻資料進行清理、加入針對性的合成資料覆蓋,並標註多層級且多樣準確的描述。接著,我們提出 SwanTale,一個支援零樣本與指令任務的多說話者表現性語音與音頻生成模型。我們引入 SwanVAE 以支援高品質的多音頻模態生成。隨後,我們採用獎勵條件品質控制與 Engram 條件機制,搭配 Unified MoE 進行多任務與多音頻模態建模。此外,我們使用課程學習與 GRPO 後訓練,使模型逐步學習並強化其能力。實驗結果顯示,SwanTale 在多項關鍵零樣本與指令指標上領先,在兩項任務中均取得最佳表現性評分,並能支援涉及多說話者語音與音頻的複雜指令生成。示範影片可於 https://swanaigc.github.io/#swantale 參閱。
大型語言模型(LLM)智能體日益承擔需要持續推理、工具使用以及跨越多個相互依賴步驟進行修正的長時程任務。然而,現有的智能體框架在不斷增長的上下文中維護任務執行、任務狀態與完成度評估,使得狀態難以追蹤,且不正確的自我評估會傳播至後續決策中。我們將長時程執行重新表述為任務狀態管理問題,並提出LongHorizon-Harness,該框架在執行流程外部明確維護任務狀態,僅以從環境中獨立驗證的事實更新狀態。其管理-執行-審計(MEA)循環使用管理器維護任務狀態並決定下一個子任務,使用全新上下文的執行器執行子任務,並使用唯讀審計器在下一輪之前驗證結果環境狀態。輕量級的AgentAdapter支援可替換的模型與框架後端,無需修改其原生智能體循環。LongHorizon-Harness在WeaveBench上將Qwen 3.7-Plus從51.8%提升至80.7%,在Terminal-Bench 2.1上從69.7%提升至77.2%,在OSWorld 2.0上從2.8%提升至8.3%。它還將Claude Opus 4.7在OSWorld 2.0子集上從20.0%提升至34.3%,證明在模型、框架與互動領域之間的一致提升。
在策略(自)蒸餾(OPSD)日益被採用於語言模型的後訓練。它利用特權資訊強化教師模型,但可能引發特權幻覺:學生模型學習到依賴特權的行為,這些行為無法從推理時的上下文重現,卻表現得彷彿訓練時的特權資訊仍然可用,最終導致效能下降。在本文中,我們將推理時特權教師與學生之間的資訊不對稱,識別為 OPSD 中此失敗的根本原因。為了解決這種不對稱,我們提出了雙錨定策略蒸餾(Dual-Anchored Policy Distillation, DAPD),這是一個具有兩層錨定的統一框架。雙路徑錨定(Dual-Path Anchoring, DPA)引入了一個自條件橋樑,並沿兩條資訊匹配的路徑對齊參考與展開行為,防止依賴特權的行為被轉移到推理時的學生模型。雙來源錨定(Dual-Source Anchoring, DSA)在參考到展開以及展開到參考兩個方向上應用這些路徑,在減少對特權參考引導依賴的同時,保留正確性監督。大量實驗表明,DAPD 顯著緩解了特權幻覺,在 Qwen3-4B 上的各項任務平均比 OPSD 高出 +2.00 分。值得注意的是,其收益在不同規模下持續存在,在 4B 規模達到 +2.69,在 32B 規模達到 +2.78。
現有的技能生成方法在很大程度上依賴於啟發式規則或管線式整合,這些方法必須針對不同的證據來源進行特殊設計。相比之下,基於學習的方法提供了一種更統一的方式來對跨異質來源的技能生成進行建模。然而,基於學習的技能生成仍然具有挑戰性,因為技能缺乏基於相關性或正確性的自然監督信號;技能的價值在很大程度上只能通過其是否改善智能體在下游任務中的行為來判斷。為了解決這一挑戰,我們提出了Skill-α,一種用於逐步生成高質量智能體技能的強化學習方法。具體來說,我們將技能生成形式化為一個序列編輯過程,將技能構建分解為可獨立評估的編輯步驟,並引入了一種新穎的回滾獎勵機制,該機制通過在錨定查詢上比較原始技能與編輯後技能的下游執行結果來評估每次編輯。大量實驗表明,在文檔到技能和經驗到技能兩種設定下,Skill-α生成的技能都比基於啟發式或管線式的方法更有效。在以GPT-4o為主要工作智能體的情況下,與最強的技能生成基線相比,Skill-α在CL-Bench上的平均下游成功率提高了3.3個百分點,在tau2-bench上提高了6.7個百分點。進一步的消融實驗驗證了回滾獎勵和逐步生成的重要性。
多模態在策略蒸餾(OPD)透過特權視圖教師監督學生生成的軌跡,來遷移細粒度的視覺知識。然而,其下一個詞元的修正是來源混合的,結合了視覺信號、語言先驗與教師特定效應。關鍵挑戰在於估計哪些修正受到視覺證據的支持,而不僅是決定蒸餾的位置或強度。我們提出視覺歸因蒸餾(VAD),這是一種反事實目標重建演算法,用於估計教師修正中視覺可歸因的部分。在每個學生生成的前綴處,VAD 在相關證據存在與移除兩種情況下評估同一個固定教師。對應的中心化對數機率變化定義了 u_t,這是視覺證據方向的帶符號代理,用以估計證據支持或反駁候選詞元的揭示程度。VAD 將原始修正投影到此代理上,獲得干預對齊分量與代理未解釋殘差,再從前者重建出學生錨定的目標。在訓練期間,此重建目標提供主要的監督信號,而特權教師則貢獻一個弱正則化器。在 4B 與 9B 規模的六個細粒度視覺基準上,VAD 優於直接特權視圖蒸餾與視覺優勢加權。詞元層級與受控目標分析顯示,代理對齊分量富含與任務相關的視覺修正,並產生更強的目標偏移,尤其是當證據反駁錯誤答案時。這些結果支持反事實目標重建作為來源混合監督的有效替代方案。
稀疏檢索支撐著現代搜尋系統,從網頁搜尋到檢索增強生成皆然。既有研究已引入學習式稀疏檢索(Learned Sparse Retrieval, LSR),以突破精確詞彙匹配、邁向更豐富的語意理解。然而,LSR迄今仍受限於編碼器式的雙向架構,且其延伸至多模態場景時,仍高度依賴輔助的跨模態模組。為了解決這些限制,我們提出UEmbed(Unified Embedding),這是一個僅含解碼器的多模態嵌入模型,能在單次因果前向傳播中同時產生稀疏詞彙與密集表示。UEmbed在輸入後附加N個可學習的特殊標記,並將詞彙表劃分為N個互不重疊的子集。每個標記的因果隱藏狀態對其分配的子集預測稀疏權重,再將N個子集串接成完整的稀疏向量。我們使用公開資料訓練,並釋出2B、4B與9B三種規模的UEmbed模型。UEmbed-9B在MMEB-v2上達到71.8(密集)與71.0(稀疏)的成績,優於使用公開資料訓練的多模態嵌入模型(如RzenEmbed)。在BEIR上,UEmbed亦能與強大的密集與稀疏基線模型保持競爭力。此外,我們從三個面向展示了UEmbed的實用價值:有效性、效率與代理型應用。整體而言,UEmbed開創了一種新的範式:它在單一模型中統一了密集與稀疏嵌入,並進一步將稀疏檢索延伸至文字與多模態輸入的統一處理。
電腦輔助設計(Computer-Aided Design,CAD)支撐著現代工程技術,然而將既有形狀轉換為可編輯模型仍需要大量專家投入。大多數 AI 系統會以單次生成的方式輸出完整 CAD 程式,且從不檢視中間階段的幾何形狀。相較之下,人類工程師會逐個特徵建構零件,並在每次操作後檢查剩餘待建模的部分。我們提出 CADENA(西班牙語「鏈」之意),此模型能將 3D 網格重建為參數式 CAD 程式,以一次生成一個操作的方式逐步增長操作序列,並在每一步將目標與當前預測的幾何形狀進行比較。此外,針對機械零件逆向工程方法缺乏評測基準的問題,我們推出 CADENA-Bench——一個橫跨多個機械零件類別、衡量方法效能的基準測試集。CADENA 在 CADENA-Bench 以及 DeepCAD、Fusion 360、MCB 資料集上均優於先前方法。程式碼請見 https://github.com/zhemdi/cadena,模型權重請見 https://huggingface.co/kulibinai/cadena,CADENA-Bench 請見 https://huggingface.co/datasets/kulibinai/cadena-bench。
可控影片生成模型日益被開發為世界模型。因此,評估它們在此角色中的表現,需超越生成影片的表面外觀,延伸到其所描繪世界的內在反應性:即從場景狀態推斷世界應如何反應,並生成輸入中未明確描述的合理後果的能力。然而,現有基準評測主要透過檢查請求的動作和互動結果是否實現,來評估視覺品質或明確指令的達成度,導致內在反應性未被充分檢驗。我們提出 WorldExam,一個涵蓋四個層級的分層診斷基準評測:視覺品質、控制遵循度、空間一致性與世界反應性。它包含八項專門任務、共 1,474 個案例,並支持對攝影機驅動、動作驅動及語言驅動三種模型範式的統一評估。世界反應性層級評估超越輸入中明確指定內容的場景條件反應與目標導向行為。對 20 個具代表性模型的評估揭示了明顯的能力分化。攝影機驅動模型擅長攝影機控制,但其介面不支援動態互動;動作驅動模型能更精確地控制主體,但往往使世界缺乏反應;語言驅動模型在互動方面表現較佳,但對複雜控制的遵循度較低。沒有任何模型能同時兼顧廣泛的任務覆蓋與一致的強勁表現,顯示高視覺品質與明確指令達成並不能保證內在反應性。
近期用於自動駕駛(AD)的視覺-語言-行動(VLA)模型日益利用思維鏈(CoT)監督來增強其視覺語言模型(VLM)組件的推理能力,然而現有的標註流程通常會將教師模型暴露於記錄在案的真實(GT)未來軌跡。我們通過實驗證明,這會誘發軌跡錨定偏差:教師模型會合理化所揭示的結果,而非從場景證據中推斷決策,從而產生因果忠實度較低的思維鏈,並導致明顯更嚴重的幻覺,尤其是在因果關係具有挑戰性的場景中。移除真實軌跡能消除這一捷徑,但開放式的軌跡生成會將高層次決策制定與精確的幾何合成及低層次動力學糾纏在一起。為了使軌跡層面的駕駛決策可驗證,又無需開放式軌跡合成,我們引入了自動駕駛選擇題(AD-MCQ),將規劃轉化為在明確軌跡候選項之間進行選擇。更進一步,我們提出了用於可驗證獎勵強化學習的未來軌跡延遲暴露方法(DEFT-RLVR),將未來軌跡從決策前的錨點轉變為決策後的驗證目標。實驗結果表明,DEFT-RLVR在提升AD推理能力的同時,能保持甚至增強通用視覺能力。憑藉僅使用VLM的推理以及通過候選項構建實現的可控難度,AD-MCQ為未來可驗證AD推理研究提供了靈活、可擴展且可延伸的基礎。
代理技能已成為賦予語言模型代理可重用程序性知識的重要機制。然而,僅提供技能並不能保證當前模型能有效地識別、應用和協調這些技能。為了提升技能使用能力,我們提出了 SKT——一個經過驗證的資料合成流程,能從大量代理技能中建構基於技能的任務與可執行的軌跡。SKT 會選擇合適的單技能與多技能配置,透過基於規則與基於代理的驗證並搭配回饋引導的修復來合成任務,且僅保留充分使用了每項所需技能的成功軌跡。利用 2,000 個公開技能,SKT 產生了 4,000 個任務包與 27,164 條經驗證的軌跡。基於相同的流程和一個互不重疊的測試池,我們進一步建構了 SkillEval——一個用於評估技能使用的保留式可執行基準。跨多種模型、基準和代理框架的實驗顯示,在 SKT 生成的軌跡上進行監督式微調能持續提升技能使用表現。驗證消融實驗、跨框架評估與規模化實驗進一步證明,這些提升依賴於高品質的監督,其效益超越單一代理介面,並會隨技能覆蓋範圍擴大而增加。綜合而言,這些結果確立了經驗證的資料合成作為一種有效且可擴展的技能使用訓練方法。
強化學習(RL)對視覺-語言-動作(VLA)模型進行後訓練,已在機器人操作領域展現出強勁的潛力。在各種強化學習方法中,基於評論家(critic)的方法依賴於價值估計器,而該估計器主要處理單幀觀測或單幀VLM骨幹網絡潛在表徵,這與機器人控制本質上的部分可觀測特性存在根本性的不匹配。若以樸素方式將觀測歷史納入評論家網絡,會在高維視覺空間中造成指數級的複雜度,且由於純標量回報回歸所提供的監督訊號不足以學習跨時間動態,此方法仍會失效。我們將根本原因歸結為狀態逼近問題:在缺乏明確世界建模目標的情況下,評論家網絡的表徵無法捕捉準確價值估計所需的時間結構。為解決此問題,我們提出世界評論家模型(World Critic Model, WCM),其建立在輕量級LeJEPA架構之上;WCM聯合預測未來潛在狀態並估計價值,使得評論家網絡的表徵被明確地訓練以捕捉時間動態,而非僅是回歸標量回報。WCM可無縫整合至在策略(on-policy)與離策略(off-policy)訓練流程中,並與最先進的VLA骨幹模型(包括Pi0、Pi0.5及OpenVLA-OFT)相容。涵蓋四個基準、共149項任務的大量實驗表明,WCM在分佈內與分佈外設定下均 consistently 達到最先進效能,尤其在泛化能力上表現出顯著的提升。我們進一步利用OpenVLA-OFT與Pi0.5搭配離策略強化學習,在七項真實世界操作任務上驗證了WCM,確認其能在多樣化場景中穩定部署。
現實世界的軟體開發要求編碼代理在共享工作區中運作,在這種環境中,用戶可能在任務進行中檢查和修改代碼,然而現有的倉儲庫級別基準測試通常評估單獨工作的代理,或將用戶參與限制為訊息形式。這使我們提出疑問:編碼代理如何理解共享工作區中的代碼變更並做出回應?我們引入SWE-Touch,一個通過經過驗證的對抗性編輯(Counter-Edits)來壓力測試這種情境的框架:對任務相關代碼進行的合理編輯,但與任務完成相衝突。SWE-Touch從多個修復軌跡中挖掘任務關鍵區域,使用單獨的用戶補丁生成器來構建編輯,並在代理到達相關代碼時將編輯與情境化用戶訊息一起注入。我們在SWE-bench Verified上評估了九個編碼模型,並在SWE-Bench Pro和DeepSWE的更長時程任務上進行了額外實驗。對抗性編輯使SWE-bench Verified的平均解決率降低了7.7個百分點,退化現象在兩個更長時程的基準測試中持續存在。軌跡分析將這些失敗歸因於對不斷演變的工作區的有限感知:代理可能保留衝突的代碼,或在未充分重新檢查倉儲庫並用針對性測試驗證修訂後代碼的情況下將其替換。這些發現表明,強大的自主性能尚不能確保共享工作區協作所需的狀態感知和適應性行為,並指出檢測工作區變化、協調衝突編輯與任務之間的矛盾、以及驗證受影響行為是未來優化的關鍵能力。
我們推出 DiffusionGemma,這是一個實驗性的開放權重語言模型,利用離散擴散以極高速度生成文字。DiffusionGemma 並非逐個 token 解碼,而是並行地迭代精煉包含 256 個 token 的區塊,避開了傳統自迴歸(AR)大型語言模型循序解碼的瓶頸。我們並非從零開始訓練,而是透過微調 Gemma 4 混合專家模型取得 DiffusionGemma,該模型啟用 38 億個參數,總參數達 252 億。我們計算效率高的兩階段訓練流程,僅使用了原始 AR 模型總訓練 token 預算的不到 10%。第一階段使用監督式微調來教導雙向去噪,第二階段則結合強化學習與取樣器蒸餾,共同提升生成品質與推論效率。DiffusionGemma 在生成速度與模型能力之間的取捨上,建立了新的帕累托前沿。在我們完整的評估套件中平均而言,它每次前向傳播約生成 20 個 token,並在單張 NVIDIA H100 GPU 上達到每秒約 1,500 個輸出 token,即使與採用最新推論加速技術的自迴歸模型相比,速度也大幅領先。DiffusionGemma 也保留了原始模型對思考模式、多模態輸入與長上下文的支援。儘管經過擴散微調,它仍能以僅有輕微效能衰減的方式進行自迴歸生成,這暗示了通往混合擴散-自迴歸解碼的途徑。
基於優化的潛在推理透過在測試時優化每個實例的連續狀態來提升大型語言模型的輸出,同時保持模型參數凍結。然而,現有方法通常透過解碼後的詞元將這些狀態與推理軌跡連結起來,使得序列層級的信用分配變得不直接,並模糊了潛在更新如何塑造後續推理。我們提出GradCuit(透過電路的梯度),它在選定的Transformer層中,於提示的隱藏表示與生成延續之間插入可優化的潛在狀態。因果自注意力機制為每個延續詞元的對數機率提供一條可微分的路徑,使其經由其餘Transformer區塊通向每個先前的潛在狀態,從而使得來自整個延續的獎勵加權梯度能夠直接分配給潛在狀態。在五個經指令微調的骨幹模型、三個推理基準測試和兩種答案格式中,GradCuit達到了64.5%的平均準確率,比思維鏈提示高出6.6個百分點,比最強的對比方法高出2.4個百分點。GradCuit也展現出更強的穩健性:在七種學習率設定下,它持續優於LatentSeek,同時將準確率的標準差從1.53降至0.82,甚至其隨機遊走變體也能與LatentSeek保持競爭力。在可解釋性方面,詞元層級的梯度歸因顯示,潛在影響集中在推理連接詞元上,而層分析則指出早期至中期的Transformer層是最有效的優化空間。透過直接從結果回饋中優化內部推理,GradCuit開闢了一條穩健且可解釋的測試時擴展新軸線,使大型語言模型能夠調整其推理方式,而非僅僅重新生成、抽樣或重新排序輸出。
視頻運動遷移旨在利用參考視頻的動態來驅動目標對象。現有方法大多依賴固定的結構對應,但當參考對象與目標對象在形態、關節結構或形變機制上差異顯著時,這種對應關係便難以定義。我們提出「超越形態的運動」(Motion Beyond Morphology)這一視角,旨在超越固定結構對應來遷移運動,保留在不同目標形態下仍具意義的動態。為實現此目標,我們提出一個兩階段框架。第一階段學習互補的多粒度抽象運動視角,並利用這些視角引導生成跨類別視頻對,以保留在多樣形態間可遷移的動態。第二階段將此監督信號內化為直接以參考視頻為條件的生成過程,從而無需在推理時進行顯式運動提取。我們進一步推出 OpenVMT-Dataset 與 OpenVMT-Bench,用於訓練和評估在「同類」、「近類」與「遠類」類別差距下的圖像與文本條件運動遷移,並計劃在論文接收後公開釋出。大量實驗結果顯示,我們的方法在運動保真度與目標保持方面達到了當前最佳水平。項目主頁:https://miniz233.github.io/MotionBeyondMorphology/
自適應舍入方法(如 GPTQ,或等價地 Babai 的最近平面演算法)在二次度量下將實數矩陣舍入為整數矩陣。它們按固定順序逐項處理矩陣項,並透過三角回饋矩陣將每次舍入誤差傳播到尚未處理的項。我們研究此任務的雙邊版本,其中固定的非奇異基底矩陣同時作用於殘差的左側和右側;常見的單邊情形是右基底為單位矩陣的特例。將矩陣向量化可把雙邊目標轉換為二次度量,其 Gram 矩陣為 Kronecker 乘積,因此一維演算法可以原樣套用,但需要矩陣維度的四次方時間。我們提出 GPTQ-2D,能以三次方時間產生相同的舍入矩陣。它逐條反對角線地舍入矩陣項;同一條反對角線上的項彼此獨立,可並行舍入。
大型語言模型日益頻繁地撰寫與修復生產環境程式碼,然而越來越多的證據顯示,它們通過測試的修補程式反而讓程式碼庫更難維護。我們找出一個具體成因:刪除迴避(deletion avoidance),亦即系統性地傾向保留預期編輯中應刪除的程式碼。在官方 SWE-bench Verified 排行榜的前五大模型中,即便在五個模型皆能解出的任務上,相對於開發者修補程式的刪除召回率最高僅達 71.7%;對於需要刪除的程式碼,模型有超過 92% 的機率定位到正確的檔案,但精確刪除目標行的比率不到 52%。相反地,29.0% 的通過修補程式會將目標程式碼包覆在防護或備援機制中,我們將此模式稱為 Guard-and-Go(防護即走)。此類修補程式之所以能通過,是因為原始測試很少檢查刪除行為:當我們為 34 個 Verified 任務加裝「目標程式碼若保留即失敗」的測試後,橫跨閉源與開源權重的四個前沿模型,成功率從 63.2% 降至 41.9%。由於真實修復往往混合刪除與新增,我們建構了 CanItDelete 基準,包含 200 個從真實提交中挖掘、所需編輯全部為刪除的任務。即便少了新增的部分,最佳模型仍每五個任務失敗一個,而較小的開源模型更降至 18.0%。我們隨後在四種累加提示下對 GPT-5.6 Sol 進行消融實驗:在提供精確行數之前,成功率幾乎沒有變化;提供之後,雖幾乎消除了不完整刪除,成功率卻僅提升至 80.5%,因為模型會刪除超出目標範圍的內容,或轉而新增程式碼。最後,透過一項先導研究,我們展示了可行的解決方向:在後期訓練中教導刪除行為可減少刪除迴避,並提升整體程式碼編輯效能,顯示此行為源於訓練不足,而非無力克服。
現有的室內佈局生成器所產生的佈局,雖然整體上看似合理,但仍可能保留局部性的違規問題,例如碰撞、超出邊界、開口受阻,以及動線不通暢等。過往研究大多專注於全場景生成或場景層級的優化,對於辨識責任物體並局部修復受影響區域的支援相當有限。我們提出 Roomer,一個具反思能力的修復框架,將這些違規問題轉化為稀疏的、以物體為基礎的修復任務。Roomer 將佈局編碼為「RoState」,並利用「RoReview」將量測到的違規問題綁定到相關物體上。一個由幾何條件驅動的視覺語言模型規劃器會提出結構化的局部編輯,而一個確定性求解器則負責驗證該編輯,並在必要時產生一組有限的候選編輯。每個候選編輯只有在全場景驗證確認其能解決目標違規問題,且不會引入新的嚴重違規或破壞受保護約束時,才會被採用。我們在 Roomer-CC 上訓練該規劃器;Roomer-CC 是一個受控破壞資料集,將有缺陷的佈局與基於物體的違規證據以及已知可行的反向 StatePatch 配對。由於現有基準很少評估物理上有效的佈局是否真正可用,我們引入了 Roomer-Eval 來評估分佈品質、物理有效性與實際可用性。實驗顯示,Roomer 能夠修復殘餘違規問題,同時保留有效區域,提升物理有效性與可用性,並且能跨外部生成器遷移。
多模態大型語言模型(MLLMs)在視覺理解與推理方面取得了顯著進展,但其靜態參數化知識限制了其解決知識密集型且動態變化的開放世界問題的能力。為突破此一限制,多模態深度搜尋已成為開放世界資訊獲取的關鍵方向,並從單輪事實檢索演進至由視覺證據引導的長視野、多輪搜尋。然而,現有方法通常將視覺僅限制在輸入或答案階段,忽略了其在中間推理中的作用,且缺乏針對長視野互動的專門設計。因此,視覺證據難以驅動持續性檢索,制約了互動深度與推理範圍。為解決上述限制,我們提出了DeepVoyager-VL,一個用於視覺在環搜尋的長視野多模態深度搜尋框架。具體而言,我們構建多模態事件圖以驅動數據合成,生成具有中間視覺依賴與長推理鏈的問題。隨後,我們設計了具備主動視覺獲取與按需圖像加載能力的智能體框架。最後,我們在合成數據上對模型進行微調,無需強化學習。在十個多模態搜尋基準上的大量實驗驗證了我們方法的有效性。
近期3D視覺語言模型(3D VLMs)透過將2D視覺特徵投影至世界座標來建構幾何感知令牌,從而實現如3D問答等任務的空間推理能力。然而,此設計會為每個場景產生數以千計的令牌,導致大量的計算與記憶體開銷。儘管令牌壓縮已在2D VLMs中被廣泛研究,現有方法依賴於語義相關性或注意力機制選擇,忽略了3D令牌的結構化空間特性。此外,3D表示中的冗餘無法僅靠空間鄰近性來解決,因為即使在空間聚合之後,物件層級的令牌不平衡問題依然存在。為了解決此問題,我們提出3DZip,一個三階段的令牌壓縮框架:首先應用粗粒度體素化以消除點級冗餘,接著透過行列式點過程基於特徵空間多樣性選取錨點令牌,最後在空間約束下合併剩餘令牌以保持幾何一致性。在三個3D問答基準測試上的實驗表明,3DZip始終優於現有的壓縮方法,僅使用128個令牌即可保留94.7%的原始性能,並實現1.92倍的推論加速。
長篇即時說話人頭生成仍因延遲與品質之間的權衡而充滿挑戰:低效率的多步擴散無法支援串流生成,而即時自迴歸方法則飽受誤差累積與身分漂移之苦。為了解決此缺陷,我們提出 LeapTalk,一個新穎的框架,能以單次前向步驟實現穩定且即時的說話人頭生成,並可擴展至任意長度的影片。我們方法的核心在於單步橋接蒸餾方案。一方面,有別於傳統的雜訊到資料範式,我們引入基於布朗橋的資料到資料傳輸公式。以持久參考為錨定,此策略能有效減緩身分漂移並增強長期時間穩定性。另一方面,為了實現從預訓練擴散教師模型到學生橋接模型的平滑知識遷移,我們探索了一種異質蒸餾框架,搭配 SNR 對齊的時間變換 Φ(τ),以彌合兩個模型之間的功能差異。此外,我們提出了音訊驅動的無分類器引導機制,以在極端步數縮減下維持精細的唇形同步。大量實驗證明,我們的方法僅需 1 步即可生成高保真且時間一致的影片,幀率可達 200 FPS,在效率與穩定性上均顯著優於現有方法。專案頁面:https://zhangrongxiang.github.io/leaptalk-page/
在操作過程中準確預測物體軌跡,對於閉合感知-行動迴路至關重要。然而,進展在兩個方面受到限制:現有數據集缺乏細粒度的語言到動作標註,而現有的預測器要麼依賴特權輸入(如影片、深度或CAD模型),要麼透過昂貴且容易出錯的感知管線從完全生成的影片中恢復動作。我們透過MOVE數據集填補了監督差距,該數據集包含5,038條以物體為中心的自我中心軌跡,每一條都配有細粒度的自然語言指令,而非粗略的動詞-名詞標籤。我們進一步提出DreamTraj,它從單張RGB影像和任務指令預測六自由度物體軌跡,在推論時不需要影片、深度或CAD模型:它並非生成影片,而是在早期去噪步驟中,從凍結的影像到影片擴散模型的內部表示中讀取動作。一個輕量級流匹配讀取器將查詢-鍵注意力軌跡和池化隱藏狀態解碼為相對六自由度姿態。據我們所知,這是第一種直接從影片擴散模型的中間表示解碼物體六自由度軌跡、而非從生成像素中解碼的方法。DreamTraj在對抗使用多幀或特權輸入的預測器時,在平移和旋轉方面均創下了新的最佳表現,並且運行速度比先生成再提取的管線快4.6倍。
固定佈局室內家具風格化需要在保持指定家具類別、位置、方向或尺度不變的前提下,選取能構成協調房間的資產。現有方法通常獨立檢索每個資產,或依賴靜態的局部關係,因此在場景合成後容易產生形狀、材質與色彩方面的衝突。我們提出 StyleForge,一種建構於動態超圖風格場域之上的場景級結構化選取框架。一個凍結的多模態大型語言模型從開放式風格請求與固定佈局中抽取結構化風格先驗,同時 StyleForge 為每個家具槽位維護一個可學習的候選分佈。在目標風格的條件下,動態超圖風格場域會自適應地啟動並加權由佈局引發的超邊,以捕捉家具之間的高階依賴關係。反事實風格偏好學習隨後將每個候選視為當前風格場域中的局部替換,並使用馬氏能量評估其情境相容性。訓練過程在最佳化風格場域與最佳化候選 logits 之間交替進行。在推論時,模型保持凍結,測試時訓練僅更新特定於房間的候選 logits,並隨著整體場景脈絡的演進逐步修正跨槽位的風格衝突。在 3D-FRONT 上的實驗展示了最先進的家具檢索與場景級風格一致性,相較於物件級與場景級檢索基準,能產生更為一致的固定佈局家具配置。
近期的影像生成器能夠合成令人信服的以人為中心影像,但產出一個有用的集合不同於產出單張成功的影像。以人為中心的資料集必須涵蓋多元的人物與情境、避免不合理的屬性組合、保留日常攝影的特質,並在大規模下呈現品質控制的決策。我們提出 Poplar,一個可重現的「指定—渲染—檢查」流程,用於以人為中心的影像資料集合成。指定階段在常識約束下取樣結構化屬性,並將其表述為以攝影為導向的提示詞。渲染階段使用適應真實感的影像生成器,配合考量構圖的長寬比,並重試明顯的技術失敗。檢查階段對每個候選影像套用單一結構化視覺—語言審查,保留原始提示詞,同時拒絕內在影像缺陷或實質提示詞不符的情況。利用 Poplar,我們建構了 Poplar-9K:從 11,765 個經審查的候選影像中保留 9,401 個精選的以人為中心影像—文字對(接受率 79.9%)。我們同時釋出資料集與流程、設定、不可變的生成提示詞,以及可稽核的檢查記錄,作為建構可自訂以人為中心集合的精簡資源。
要在開放世界環境中穩健運作,自主智能體應能僅透過互動推斷陌生系統的行為,即使在缺乏文件的情況下亦然。然而,現有的工具使用基準在靜態環境中揭露語義工具架構,使智能體得以依賴先備知識而非自主探索。為解決此限制,我們引入 ScrambleToolBench——一個專為隔離行為推理所設計的互動式終端基準。透過移除語義線索並實施連續的任務課程,該基準要求智能體完全經由試誤互動來發掘隱藏的工具行為。此基準進一步引入動態挑戰,包括映射漂移、隨機行動失敗及時間執行窗口,以評估智能體能否在環境變化時修訂並調整其假設。我們對當前最先進語言模型的評測顯示,成功的初始發現並不能轉化為穩健的適應能力。面對映射漂移等結構性變化時,智能體無法運用諸如循環追蹤等演繹策略,反而表現出信念慣性,或退而訴諸窮舉搜尋。增加測試時推理只會放大這種昂貴的暴力搜尋,而非促成演繹性恢復。雖然為智能體配備持久記憶可減少複合錯誤,但它們仍無法有效推斷結構性變化,凸顯了當前智能體推理能力的缺口。
現有評估常將智能體失敗簡化為系統層級結果,掩蓋了錯誤的來源所在,以及何種干預措施能改善智能體系統。這形成了修復歸屬問題:同一可見失敗可能因來源不同而需要模型後訓練、框架工程、環境重新設計或基準修復。由於智能體行為源自模型、框架、使用者、工具、記憶與環境之間的互動,結果層級的標籤往往難以據以改善系統。多數失敗分類法因局限於特定基準且缺乏共享結構,對解決此問題幫助有限。我們提出一種以互動為中心的分類法,將失敗定位至其發源的互動,並識別應負責任的組成部分。該分類法將41種失敗模式組織起來,將每一種指派至兩個組成部分之間的邊,並標明修復歸屬所在的錯誤側。這使分類法具有可操作性:模型側失敗可識別後訓練目標,框架側失敗指向支架與工具整合的修復,而環境或評分器失敗則揭示需要重新設計的評估條件。此架構適用於各種智能體架構,從程式設計助手到長期任務個人助理以及多智能體系統。我們以公開基準、模型系統卡片、已發布報告及記錄的智能體軌跡中的具體實例為基礎建立此分類法,並使用獨立推理智能體作為評判者評估其可重現性。在四個前沿模型中,最強的評判者與人類類別標籤達到Cohen's κ=0.76,顯示這些類別捕捉到的是共享結構而非標註者特有的偏好。
優化現代推薦模型仍然高度依賴工程師手動迭代架構、目標函數與訓練策略的變更。雖然基於大型語言模型(LLM)的智能體可以自動化這種試錯過程,但若讓LLM同時負責選擇修改方向並生成具體假設,往往會在有限的實驗預算下導致搜尋不穩定。受上述挑戰啟發,我們提出RecHarness——一種用於自動化推薦模型優化的Bandit路由智能體框架(Bandit-Routed Agentic Harness)。RecHarness將優化流程拆解為兩個步驟:Bandit路由器根據歷史驗證回饋選擇下一步的修改方向,而LLM則在該選定方向內生成具體的優化假設與可執行的程式碼修改。為了維持長程探索,RecHarness使用跳躍盆地機制,在局部修改停滯時啟動結構跳躍臂。在多個推薦任務、資料集與模型骨幹上,RecHarness比LLM推理搜尋取得更穩定的效能提升,並更有效地利用有限的實驗預算。在一場為期7天的大規模短視頻廣告平台線上A/B測試中,所選候選方案使ADVV提升2.084%、收入提升0.534%、曝光量提升0.559%。程式碼已公開於 https://github.com/6lyc/RecHarness。
視覺-語言混合專家(MoE)模型的批次中,圖像與文本 token 的數量各不相同。圖像解析度、圖像數量、切分方式(tiling)以及提示詞長度都會改變這種 token 混合比例。我們將標準的 token 層級 Switch 輔助損失稱為 Std-Aux。Std-Aux 僅均衡混合後的負載,因此在某一混合比例下,圖像與文本的較大負載誤差可能相互抵消。在我們的主模型上,同一個已訓練的路由器在不同圖像解析度下,其負載不均衡程度會出現超過五倍的變化。我們固定圖像與文本的負載分布,進而推導出隨 token 混合比例變化的精確負載曲線。圖像與文本之間的負載差距控制著對 token 混合比例的敏感度。實際預處理也可能改變條件分布,而固定分布下的規律則不包含這類變化。為了設計解決方案,我們檢視了路由器的輸入結構。圖像與文本位於不同區域,而視覺 token 會強烈地依來源圖像分群。模態邊界促使我們為圖像和文本分別設置損失項;圖像邊界則促使我們對每張圖像採用一個等權重的路由實例。ReBA(Relax Within, Balance Across,即內部放鬆、跨組平衡)同時實現了這兩種設計。在四個分割骨幹網路上,與 Std-Aux 相比,ReBA 在所有已報告的基準輸入上都降低了負載,同時保持平均任務準確率相當。ReBA 還降低了測試範圍內的平均負載,並在解析度與切分變化下改善了最壞情況的實際負載。程式碼位於 https://github.com/ZiangWu-77/ReBA。
LLM 代理需要在長時間互動中保持一致的行為,因此需要記憶,然而許多系統使用額外的 LLM 調用來操作該記憶。產生中間記錄並調解其檢索會增加重複的 token 和時間成本,而省略或合併的細節可能掩蓋原始證據。我們探討結構化記憶存取是否根本需要生成。Zero-Mem 引入了零 token 記憶操作:在最終問題回答之外的任何步驟都不會調用 LLM,也不會消耗 LLM 輸入或輸出 token;編碼器計算則另行處理。Zero-Mem 保留原始互動軌跡作為其記錄來源,並以兩種互補的方式組織這些軌跡。實體-上下文圖揭示跨互動的連結,而時間層次結構保留對話局部性和會話狀態。對於每個查詢,Zero-Mem 權衡這兩種視圖,從兩者中檢索,並遵循其結構以恢復支持性關係或周圍上下文。確定性校準首先丟棄衝突證據,然後使閱讀器的答案奠基於檢索到的軌跡。只有最終問答閱讀器會調用 LLM。在長記憶和長上下文問答基準上,Zero-Mem 在消除記憶操作的 LLM 調用和 LLM token 消耗的同時,達到了具有競爭力的效能。在使用相同的最終問答閱讀器和上下文預算下,相對於最快的比較基準,它將記憶操作的時間成本降低了 57.6%。消融實驗支持這兩種視圖及其查詢相關協調的貢獻。總體而言,結果表明結構化代理記憶不需要生成過去的中間表示。同行評審後,程式碼和實作細節將在 blue{https://github.com/TheMoon0815/Zero-mem} 提供。
利用多模態AI進行科學圖表理解與推理,需要將視覺感知與領域特定推理相結合,以提取有意義的知識,而這些知識往往不會呈現在研究論文的文字中。Sci-ImageMiner基準資料集,搭配社群驅動的競賽,透過策劃一個涵蓋四項互補端到端任務的全面性、專家註解資料集,提升了先前科學競賽的標準。該競賽吸引了68位活躍參與者,並在2026年1月9日至2026年4月8日期間收到1,263份公開/私人提交。我們的結果顯示,最先進的多模態模型在分類與摘要任務上表現良好,但在資料提取與科學推理方面,特別是在視覺問答中,則面臨困難。這些發現揭示了關鍵限制,並凸顯了改善領域感知多模態AI系統的挑戰與機會。整體而言,Sci-ImageMiner基準與競賽為推進科學圖表理解與推理研究建立了一個嚴謹的平台,同時展現了最先進方法在具挑戰性且複雜的研究領域中的潛力。
多模態臨床模型通常是在所有模態都存在的情況下以準確率來評判,但在實際部署時某些模態會被移除;例如在心電圖為常規檢查的場景中,超聲心動圖往往並不可用。此時,除了準確率損失的大小之外,還有兩個問題至關重要:是哪個模態造成了失敗;以及一旦該模態被移除,模型是「大聲地」失敗還是「無聲地」失敗。這種區分是逐樣本、按模態層級進行的,且有別於事後特徵歸因(如 SHAP)。模型經常被替換,而回答這些問題的評估方法可以被重複使用。我們提出一個模型無關的模態失敗框架:給定 N 個模態嵌入、任意可感知遮罩的探針以及標籤,該框架會返回逐樣本的失敗分類法、一個按模態將誤差歸因的互補性矩陣,以及一個「大聲 vs. 無聲」的模態丟棄概況,僅使用部署時可觀測的信號,將可監測的失敗與那些在遠離決策邊界處未被標記就通過的失敗區分開來。我們以一個小型、經單元測試的測試工具(harness)形式發布該框架,並用人工植入的基準真相進行驗證。在不同的隨機種子下,它能恢復所植入的模態主導性與互補子集,報告各模態的「大聲 vs. 無聲」比率,並能擴展到三模態的互補性矩陣;由於植入的結構在構造時即已知,這驗證的是逐樣本歸因的恢復能力,而非臨床表現。接著,我們在一個配對的 MIMIC-IV 隊列上,針對 LVEF 以及 EF ≤ 40% 的 HFrEF 判定門檻,將該框架實例化於凍結的 EchoJEPA 和 HuBERT-ECG 嵌入之上;在留出的測試分割(n = 245)中,移除超聲心動圖會使誤差幾乎翻倍。限制隊列規模的「超聲心動圖-心電圖」重疊狹小,這本身就是一個關於心臟基礎模型的部署發現。我們的所有工作可在 https://github.com/criticaldata/PRIMED-AI 取得。
長時程代理日益將 KV 快取重用作記憶:服務系統保留一部分快取條目,丟棄其餘部分。因此,驅逐與情節記憶機制依賴於一個很少被直接測試的前提——一旦產生某個事件的觀測消失,該保留事件仍然具有資訊量。我們透過在原本完全相同的代理歷史中,從服務內容裡省略一個較早的觀測來檢驗此前提。在對該觀測敏感的項目中,答案壓倒性地跟隨被省略的值,儘管所服務的片段中沒有任何一處指出哪個值才是正確的。我們稱之為語義物化:下游事件的快取行充當了一種可獨立服務的視圖,而該視圖所對應的計算輸入已經消失。這種寫入也可以刻意為之。一個精心措辭、不含答案的事件,在不指名該值的情況下,將 Qwen3-8B 上與捐贈者對齊的恢復率從 6% 提升至 51%;然而,被動地從長期對話中收集自然提及則未檢測到任何優勢。這類行所承載的內容是特定且有界的。緊湊的狀態得以存續,較大的有效載荷則衰減至隨機水準;而某個構造是否會寫入,取決於措辭而非僅取決於意義,因此兩種模型理解程度相同的措辭可能產生截然不同的結果。其結果是一份適用於稀疏事件-KV 服務的記憶契約:寫入什麼、落於何處,以及來源消失後什麼能存續。對於任何執行驅逐的人而言,其推論是:丟棄一個來源事件且未觀察到準確率下降,並不能證明該來源是不必要的。
企業問答要求模型獲取專有知識,同時不喪失通用能力。我們提出 Wnuan,這是一個三階段流程:從文件中建構任務導向監督、以通用資料重播進行監督式微調,並對殘餘錯誤應用強化學習。在包含 707 道問題的 WnuanBench 上,主要 32B 路線將可接受答案率(AAR)從適配前的 52.76% 提升至 SFT 後的 80.06%,並於 RL 後達到 91.51%。在匹配的 100 次更新協議下,殘餘錯誤採樣分別優於全池採樣與規模匹配隨機採樣 3.11 與 2.97 個百分點。兩個對比的來源叢集自助法信賴區間均高於零,且同領域驗證集保持了相同的排序。沿著該路線,通用基準平均分數下降 5.17 分,主要集中在指令遵循方面。自動評估集成與權威領域專家在分層 Wnuan-Inst 回應樣本上有 90.5% 的一致性。這些結果同時刻畫了分階段企業適配的收益與通用能力成本。
多模態大型語言模型(MLLMs)通過將視覺輸入與預訓練語言模型的豐富先驗知識相結合,展現出強勁的性能。然而,在以視覺為中心的任務上,它們經常表現不佳,特別是在視覺證據與預訓練知識發生衝突時。我們通過兩種診斷範式分別探討這類失敗:(1)透過圖像重建探查視覺資訊是否可用;(2)衡量多模態語境敏感度,即模型在多大程度上遵循視覺語境而非語言先驗。為支撐第二種範式,我們提出了 WhatIfVis 基準測試,涵蓋五個粗粒度維度(時空、顏色、數量、大小與重量),其問題可分別從圖像或先驗知識中獲得答案。我們的分析得出三項發現:(i)粗粒度的視覺證據得以保留,因為這些屬性可以從凍結 MLLMs 的最終層圖像 token 中重建出來。因此,在針對這些屬性的問題上出現的失敗,指向的是感知後的利用階段,而非感知過程中視覺編碼的退化。(ii)即使在被明確指示使用或忽略視覺證據時,未經微調的基礎模型(未在 WhatIfVis 上進行監督式微調)仍表現出不穩定的視覺語境敏感度。監督式微調(SFT)提升了這種可控性,並能跨領域泛化;激活修補進一步將視覺與先驗之間的權衡定位於所有六個模型中架構特定的深度層。(iii)視覺與先驗之間的權衡可沿著一個學習到的向量加以控制。應用此引導向量,即使在沒有任何意圖指令的情況下,也能提升相對於基礎模型的可控性。綜合來看,這些結果重新定位了瓶頸所在,表明對於我們所研究的粗粒度屬性,MLLMs 能夠編碼視覺證據,但無法可靠地控制對其依賴程度。
地理空間基礎模型的目標是學習能跨區域與感測器遷移的表徵,然而,要在特定任務上評估它們,需要大規模、高品質、多模態的基準,以衡量此類模型如何從數據中提取價值。就洪水測繪而言,現有數據集很少在大規模尺度上結合雙時相SAR與共配準的光學影像,使得基礎模型在此下游任務中的價值大多未被測試。我們提出GEOID-Flood,一個大規模多模態洪水分割基準,源自哥白尼緊急管理服務(Copernicus Emergency Management Service)的啟動任務,涵蓋十年間65個國家的219起事件。該數據集提供超過14,000個圖塊,包含共配準的事件前後Sentinel-1影像(以GRD與RTC格式)、事件前Sentinel-2合成影像,以及DEM,並具備手動驗證的標籤,用以區分背景、永久水體與洪水。利用此基準,我們在單一影像、多時相與多模態協議下,比較基礎模型與傳統編碼器的表現。我們報告三項主要發現:基礎模型提供一致但溫和的優勢;光學與SAR融合搭配微調最能解決暫時性洪水;以及訓練於GEOID-Flood的模型,其遷移至未見事件的能力優於訓練於現有數據集的模型。數據集與代碼可在 https://github.com/links-ads/geoid-flood 取得。
世界動作模型(WAMs)將動作生成與未來狀態預測耦合。其有效性取決於未來動態是否在一個既與動作生成對齊、又具備足夠幾何感知能力以捕捉動作在何處及如何改變場景的空間中建模。現有的WAM通常僅滿足此要求的一部分,依賴於感知負擔較重的觀測空間目標,或未被同時針對動作相關性與幾何結構進行設計的輔助潛在空間。我們提出SG-WAM,一個自引導框架,直接在策略推導的表徵空間中學習幾何感知的動作條件動態。SG-WAM引入可學習的動態標記與自引導世界預測器,該預測器基於機器人介入動作來預測其未來潛在狀態。預測目標由同一策略骨幹的指數移動平均副本生成,在動作專家所使用的表徵家族內提供穩定的監督。幾何監督進一步結構化策略的圖像標記表徵,為動態標記提供具空間基礎的上下文,並產生一個既具動作相關性又具幾何感知的未來對齊空間。潛在未來預測、幾何基礎與流匹配動作生成在統一框架中進行端到端聯合優化。SG-WAM基於0.9B參數模型,無需大規模具身預訓練,在LIBERO上達到98.5%的平均成功率,在LIBERO-Plus上達到73%,同時在分布內與分布外的真實世界評估中均優於強基線。
像素空間擴散模型旨在直接學習一個端到端生成器,作用於原始像素。這具有挑戰性,因為單一模型必須在同一高維空間中同時捕捉全域結構與局部紋理。雖然近期研究透過替代的預測目標、訓練目標與架構來改善像素擴散,但這些進展通常需要從零開始訓練新模型。我們展示了一種更便宜且互補的策略:一個凍結的、預訓練的像素擴散模型可以自我引導。我們的主要觀察是,預訓練的像素擴散 Transformer 的中間層可以被解碼為捕捉主要低頻結構的粗略預測,而最終層則逐步細化局部高頻細節。因此,我們將一個輕量級預測頭附加到中間層,保持骨幹網路凍結,並在採樣過程中,將中間預測與最終預測之間的差異用作自我引導方向。為了訓練這個預測頭,我們進一步發現真實影像並非必要;相反,模型生成的樣本就足夠,甚至在訓練預測頭時優於真實影像,特別是在增強像素擴散往往欠擬合的高頻分量方面。在 ImageNet 上的多個像素擴散模型中,我們的合成自我引導(SSG)持續改善生成質量,而適配器訓練所需的運算量不到完整模型訓練的 1%:在無分類器引導(CFG)下,它將評估的 JiT 變體的 FID 降低了超過 50%,並進一步改善了使用 CFG 的強基線,例如,將 JiT-H/16 從 1.86 降至 1.67,將 PixelREPA-H/16 從 1.81 降至 1.59。我們的程式碼可在 https://github.com/zfu006/SSG 取得。