每日精選AI研究論文及翻譯
長程搜尋代理必須執行多次依序的行動(步驟),以搜尋、檢索、驗證並整合證據,最終得出答案。然而,現有訓練這些代理的方法,無論是在監督式微調(SFT)還是強化學習(RL)中,通常都將軌跡內的所有步驟一視同仁,無法區分有用的行動與錯誤或冗餘的行動。在本文中,我們提出「答案回溯信用分配」(Answer-Backtracked Credit Assignment, ABC),這是一個細粒度的信用分配框架,用於訓練長程搜尋代理;其做法是將稀疏的軌跡層級結果轉換為密集的步驟層級監督,獎勵有用的行動(即使在失敗的軌跡中),同時抑制錯誤或冗餘的行動。具體而言,給定一個可能隱晦的查詢及其對應的標準答案,ABC 首先執行「答案回溯線索還原」,從答案回溯,還原解決該問題所需的中間線索;接著套用「線索錨定步驟評分」,根據這些線索評估每個搜尋步驟,將稀疏的二元結果監督轉換為密集的步驟層級獎勵。基於這些獎勵,我們發展了 ABC-SFT,重新加權每一回合的損失;以及 ABC-GRPO,在 GRPO 中使用步驟層級分數作為獎勵。在此框架基礎上,我們僅用 8.5k 個範例,基於 Qwen3.5-4B 訓練了 ABSeeker。ABSeeker 在 BrowseComp 上達到 37.3%,在 BrowseComp-ZH 上達到 39.1%。在加入上下文管理後,分數分別進一步提升至 55.3% 與 52.9%,顯著優於相同規模(4B)的代理,甚至能匹配較大規模(約 30B)代理的表現。這些結果證明了答案回溯的步驟層級信用分配在訓練長程搜尋代理方面的有效性。
文字轉圖像(T2I)模型能夠產生視覺上引人入勝的圖像,但在需要複雜語意理解、多步推理及整合外部世界知識的開放世界任務上仍有所限制。現有研究嘗試將代理能力引入圖像生成,但這些方法不是預先規定固定工作流程,就是僅將開放世界圖像生成過程中的一部分交由代理控制。因此,推理、工具呼叫與圖像生成並非由單一策略協調。我們提出ToolArtist,一種透過對統一多模態模型(UMM)進行後訓練所獲得之完全代理式圖像生成模型。ToolArtist在單一統一策略中動態編排推理、外部工具使用與原生圖像生成。在監督式微調(SFT)階段,我們為教師代理配備搜尋工具與圖像生成工具。接著,我們將收集到的軌跡轉換為UMM相容格式,其中圖像生成工具被隱藏,而產生的圖像則被保留。在強化學習(RL)階段,我們為UMM開發了代理式RL基礎設施,並引入Reason-Act-Draw GRPO(RAD-GRPO),利用互補的意圖與品質獎勵來聯合優化模型。實驗結果顯示,將整個開放世界圖像生成流程置於代理策略之下,一貫地優於固定管線或僅部分代理控制元件的方法。我們釋出訓練資料與完整的後訓練基礎設施。
視覺為推進基礎模型提供了一條關鍵軸線,驅動著向原生統一多模態預訓練的轉變。儘管有這樣的發展勢頭,關於模態在統一訓練期間如何互動的設計空間與基本機制仍未被充分探索。我們透過對多模態預訓練的系統性探索提供了經驗性的清晰理解。我們在合成資料集與大規模真實世界資料集上進行的受控實驗,產出了關於多模態預訓練物理機制之四大關鍵洞見:(i) 知識流動:我們釐清了語言、視覺理解與視覺生成如何在各模態之間傳遞知識,揭示了截然不同的影響模式與不對稱性;(ii) 協同與競爭:我們表明資料的「複雜度」在很大程度上決定了模態之間是否具有協同作用,並識別出能促進協同作用的架構選擇,例如共享注意力與正規化搭配模態特定的前饋層,同時發現這些行為能推廣至不同的視覺分詞器設計;(iii) 早期統一:從非常早期的階段就統一各模態並進行聯合訓練,被證明比晚期對齊或循序訓練更為有效。此過程揭示了「視覺惰性」現象,即延遲整合會導致模型依賴語言先驗;(iv) 配方:我們推導出高效的預訓練配方,僅使用 5% 的計算預算即可實現強大的生成性能。這些核心發現隨後透過在多個 13.5B 混合專家模型上以 2T 詞元進行訓練而在大規模上得到驗證。我們希望這項研究能為理解與擴展多模態預訓練提供原則性的基礎。
具有持久記憶的個人化大型語言模型日益普及,然而其使用者模型的忠實度仍未受到檢驗。我們研究過度推論(OI):即大型語言模型在證據支持範圍之外捏造使用者屬性的現象。我們提出 MirageBench,包含:均衡分布於刻板、反刻板與中性輪廓的 150 個人物原型;涵蓋「想像梯度」的 6 項個人化任務;由獨立評判者操作化的四分類忠實度分類法(該評判者在 400 條斷言上對照一位盲測人工標註者進行驗證,四分類的柯恩卡帕係數 = 0.863,二元分類的卡帕係數 = 0.900);以及由 12 個模型(分屬 7 個家族)在 143,616 條經評判斷言上組成的排行榜。我們發現過度推論普遍存在:在此評估中,12 個模型無一例外,每個模型都在 35% 至 49% 的斷言上出現過度推論(跨模型平均值為 41.6%;以斷言加權後為 41.8%)。最引人注目的是,我們揭示了一種「自我監控反轉」:在模型選擇層面上,模型自我評估的過度推論與其經評判者測量的過度推論呈負等級相關(rho = -0.60,p = 0.044;探索性結果,自助法信賴區間寬廣,介於 [-0.90, +0.06],n = 12)。那些自我報告過度推論最少的模型,往往被標記為捏造最多的模型;因此,在比較模型時,自我報告的信心是誤導性的訊號,即使在單一模型內部,自我審查仍能對該模型自身的斷言進行中等程度的排序(AUROC 介於 0.58 至 0.83)。我們進一步顯示,過度推論具有任務依賴性(27% 至 59%),而且在多輪試驗中,推論出的屬性會近似線性地累積,且幾乎沒有修正。MirageBench 將外部驗證(而非模型自我報告)定位為實現值得信賴的個人化時更可靠的基礎。
LLM 智能體日益被應用於涵蓋工作、學習與生活的開放式日常請求。此類任務具有長時程、跨環境與多模態的特性,迫使智能體在瀏覽異質工具與附件時,於眾多步驟之間維持目標與約束。雖然先前的研究已處理個別的失敗模式,例如目標漂移、狀態遺失與上下文溢位,但對於單一架構能否同時管理這些問題,並在各種後端上維持有效性,相關研究仍然較少。我們提出 OneDayAgent,一個用於自主智能體的長時程管理框架。OneDayAgent 將開放式請求轉化為受管理的執行流程,將任務分解為有界限的子任務,在上下文壓力下維持執行記憶,並驗證與修復最終交付成果。我們在 AgentIF-OneDay 上評估 OneDayAgent,涵蓋 104 項任務。在以 GLM-5.2 為後端時,OneDayAgent 以 0.821 的整體分數創下新的最佳成果。相同的框架可在來自三個模型家族的五個後端 LLM 上運行,顯示此框架無需調校即可跨後端泛化,即使不同模型在同一工作流程下會產生不同的執行風格。
代理自我進化會根據先前經驗更新代理的持久狀態,並重用該狀態以更有效地解決相關任務。評估自我進化十分困難:現有基準測試對具有經濟價值的任務領域涵蓋有限,且並非總能設計訓練與測試任務,使測試階段的效能提升可歸因於訓練經驗,同時仍易受數據污染影響。我們提出了GDPevo——一個以GDP相關企業工作流程為基礎、立足於進化機制的基準測試,並配備了可全自動生成該基準的數據管線。其核心機制「規則雜交」將每個企業工作流程分解為原子業務規則,將這些規則的子集分配至訓練任務中,並在留出的測試任務中重新組合,從而使測試階段的效能提升具有可歸因性。GDPevo涵蓋客戶關係管理、企業資源規劃、金融、醫療保健、法律及數據中心工作流程。其V1版本包含12個組別共120項任務,每組各有五項訓練任務與五項留出測試任務。全自動化使該管線能在兩天內將套件擴展至24個組別共240項任務(V2版本),為數據污染問題提供了務實的應對方案。我們使用GDPevo評估了四種代理(各包含一個驅動框架與一個模型),涵蓋四種監督類型。自我進化持續提升留出測試的準確率,最高可提升16.44個百分點。然而,最佳進化代理仍遠低於完全知情的神諭上限91.6%,這表明當前代理的自我進化能力尚未充分發揮。我們已在https://github.com/Prism-Shadow/GDPevo公開釋出管線、基準測試及完整的評估結果。
近期大型語言模型(LLMs)中的長程推理要求模型在推理鏈中於不同技能之間切換,例如先進行數學推導,再利用結果規劃行程。我們將此類問題稱為跨技能長程任務:其步驟需要不同推理技能且依賴先前輸出的多步驟任務。現有基準常以單一技能評估,缺乏衡量模型在技能間切換能力的原理性方法。我們從評測與訓練兩方面填補此缺口。 我們提出技能熵(Skill Entropy),用以衡量從一種技能切換至另一種技能的困難度。接著我們提出 Skill²-Bench,這是一個跨技能長程任務基準,涵蓋 9 個可驗證且開放式領域中的 558 種技能。每項任務都被賦予任務層級的技能熵分數,並劃分為三個難度等級。在 Skill²-Bench 上評估 8 個前沿模型與 4 個開源模型後,我們發現了技能切換差距:在熵值較高的任務上準確率會下降。 接著我們將技能熵從基準量表轉化為訓練訊號。我們提出技能熵強化學習(Skill-Entropy RL),這是一個強化學習框架,模型不僅在每一步預測答案,也預測產生該答案所使用的技能。獎勵結合了步驟層級的正確性,以及衡量模型預測技能序列與黃金技能序列一致性的技能熵獎勵。在 Qwen3-4B-Instruct 與 Qwen3-1.7B 上,Skill-Entropy RL 將 Skill²-Bench 分數分別從 34.4% 提升至 68.4%、從 14.6% 提升至 40.1%,優於具競爭力的基線方法。相同的流程可應用於如 OpenR1-Math 等現成訓練資料,顯示技能熵是一種可重複使用的訓練訊號。 程式碼位於:https://github.com/Gen-Verse/Skill-Entropy-RL
同策略蒸餾(On-Policy Distillation, OPD)透過以密集的詞元層級教師訊號監督學生取樣的軌跡,來轉移教師能力。近年來的選擇性同策略蒸餾方法透過優先選擇具有信心、資訊量或可學習性的訊號來改善此流程。然而,這些假設忽略了語言模型一個根本的失效模式:其詞元層級的判斷可能受到與輸入無關的語言先驗、格式慣例或刻板推理模板所驅動,而非任務特定的證據。我們將此類與最佳化相關但輸入扎根程度薄弱的監督訊號稱為同策略蒸餾中的虛假訊號(spurious signals),它們可能產生較大的梯度,卻對任務改進方向貢獻甚微。為緩解此問題,我們提出 SA-OPD,一個基於輸入扎根程度與最佳化影響來識別並過濾誤導性詞元層級監督的虛假訊號感知同策略蒸餾框架(Spurious-Signal-Aware On-Policy Distillation)。SA-OPD 引入了一個輕量級的輸入扎根程度代理指標,用以估計詞元層級的蒸餾訊號是否真正依賴於輸入。接著,它僅過濾掉同時表現出低輸入扎根程度與極端蒸餾分歧的詞元,從而移除高影響力的虛假更新,達成細粒度的同策略蒸餾最佳化。在大型語言模型(LLM)與視覺語言模型(VLM)設定上的大量實驗顯示,SA-OPD 持續優於基礎同策略蒸餾(Vanilla OPD)及具競爭力的選擇性方法。這些結果確立了輸入扎根程度作為同策略蒸餾監督選擇的關鍵維度,並提供了一種簡單而有效的策略來緩解虛假更新。
學習可泛化的機器人操作策略需要大規模且多樣化的示範數據。第一人稱視角的人類操作影片提供了豐富的場景與任務多樣性,先前研究已表明,將此類影片重新定向並渲染成機器人格式數據,可以在小規模下產出有效的單任務策略。然而,此方法能否為視覺-語言-動作模型在大規模下提供預訓練益處,仍有待探索。我們提出 Ego2Robot,這是一個可擴展的流程,透過動作重定向、機器人手臂視覺合成以及多層級品質篩選,將第一人稱視角的人類操作影片轉換為機器人訓練數據。Ego2Robot 同時支援精選數據集與野外影片,產出橫跨 15 種機器人型態、共 18,561 小時的機器人訓練數據,使其成為迄今規模最大的自我中心至機器人數據集。為評估泛化能力,我們擴展 RoboTwin2.0,納入涵蓋視覺外觀、場景佈局、具身形態與任務語義的解耦擾動軸。實驗顯示,在 Ego2Robot 合成數據與機器人數據上進行聯合預訓練,能一致性地提升多種擾動類型下的分佈外泛化能力,其效益並已在真實機器人部署中獲得驗證。項目頁面:https://www-ye.github.io/ego2robot_blog/
我們介紹 NOLLI——一個程序化生成的英韓謎題基準,旨在診斷韓文效能差距的來源。它包含 15 種謎題類型(25 項任務;7,500 個題項),每個實例皆可透過種子重新生成、經驗證具有唯一解,並以確定性方式計分。我們並未將「更難」等同於「更大」,而是以行為層面校準難度,調整每個生成器,直到固定參考模型落入目標準確度區間。其三層設計結合了配對的直接翻譯、基於韓文 jamo(亞音節字母)的文字改編,以及根植於韓國文化或正字法的韓文專屬任務。 我們評估了 15 個前沿、開放權重及韓國開發的模型;在 12 個高於 3% 總體準確度下限的模型中,配對英韓準確度在正負 10 個百分點範圍內統計上等效(TOST),顯示單就呈現語言而言幾乎沒有代價。書寫系統密集度高的任務顯示出更明顯的差距:韓文密碼(Korean Cipher)落後英文最多達 68.7 個百分點,而使用相同 jamo 的密碼算術(Cryptarithmetic)卻沒有系統性的劣勢;此外,Jamo 組合的準確度可預測韓文密碼的準確度。這些對比是診斷性而非因果性的,與多步驟亞音節執行的困難度一致。韓文專屬任務將規則應用缺陷(其方向不一)與在所有 12 個模型中皆呈正向的親屬稱謂缺陷區分開來。最後,一個顯著的規模量度在 15 種類型中有 7 種未能從「簡單」到「困難」隨之增長,使結構規模成為經驗難度的不可靠代理指標。
儘管基於指令的影片編輯技術進展迅速,但真實世界影片中的音訊與視覺訊號緊密耦合,編輯其中一個模態往往需要對另一個模態進行協調變更。現有基準主要針對無聲片段上的視覺轉換或孤立的音訊編輯進行評估,使得複雜的視聽編輯與跨模態一致性探討不足。我們推出 AVE-Compass,一個全面的基準,包含 145 個精選來源影片、196 條視聽耦合的編輯指令,以及 2,688 個細粒度檢查表項目。它透過基於檢查表的多模態大語言模型評判與專門的真實感評分標準,評估指令跟隨、保真度維持、真實感與編輯意圖,並輔以自動化的跨模態、影片與音訊指標。廣泛的評估顯示,現有最佳模型在執行跨模態指令的同時仍難以保留非目標內容。我們進一步提出 AVE-Agent,一個模組化智慧體框架,能將複雜指令分解為相互依賴的子任務,並透過自我反思與評估者反饋迭代地改善編輯結果。AVE-Agent 在聯合編輯中提升了指令執行、保真度維持與視聽對齊,同時保持具有競爭力的感知品質。
可驗證獎勵的強化學習(RLVR)已成為大型語言模型(LLMs)後續訓練的標準範式。儘管群體相對策略最佳化(GRPO)被廣泛採用,但其存在獎勵訊號稀疏的問題,且當群組內所有回應獲得相同獎勵時,梯度會完全消失。在線策略蒸餾(OPD)透過提供來自教師模型的密集、token層級監督,提供了一種自然的解決方案。然而,單純將GRPO與OPD結合會導致效能下降,其原因有三:並非所有樣本都能從蒸餾中受益;過快貼合教師模型會削弱強化學習的探索能力;且OPD的優勢具有不對稱性,會抑制大部分token。為了解決這些挑戰,我們提出RSTG(透過自適應教師引導恢復學習訊號),該方法選擇性地且精確地在最關鍵之處應用蒸餾。在樣本層級,OPD僅限應用於負向零變異提示,且每個樣本均以教師模型的信心分數加權。在token層級,蒸餾僅針對具有高學生熵或較大教師-學生分歧度的token。我們進一步以教師模型生成的正確軌跡進行監督式微調(SFT)來增強訓練,在強化學習無法產生梯度的情況下注入正向梯度訊號。實驗表明,RSTG在數學任務上比單純的GRPO+OPD顯著提升+4.02%,在程式碼任務上提升+3.05%。
本技術報告介紹 K-EXAONE 2.0,這是由 LG AI Research 開發的開放權重多語言基礎模型,是我們朝向全球前沿規模基礎模型目標邁進的一步。我們並非從零開始訓練,而是對 K-EXAONE 進行升級再利用並擴展其架構,產生了一個總參數量為 750B 的混合專家(MoE)模型,每個 token 激活約 37B 參數——容量是前代模型的三倍以上。K-EXAONE 2.0 支援高達 256K tokens 的上下文長度,並將多語言涵蓋範圍從六種語言擴展至十種。其訓練流程結合持續預訓練、難度導向的中期訓練與後期訓練,以強化推理能力、智能體編程、多語言能力,以及根植於韓國社會文化脈絡的安全性。在九個為反映實際使用條件而選定的評估類別中,K-EXAONE 2.0 相較於 K-EXAONE 有所提升,並與其他開放權重模型保持競爭力,其中在智能體編程與長上下文理解方面進步最為顯著,在長上下文檢索與安全性方面則展現最明確的優勢。K-EXAONE 2.0 以 Apache 2.0 授權條款釋出,使更廣泛的 AI 生態系統得以評估、部署、改編並在此基礎上持續開發,同時也標誌著我們邁向全球前沿挑戰的起點——而非終點。
記憶增強型視覺語言模型代理依賴持久性空間知識運作,然而隨著環境變化,這些知識會悄然過時。我們探討當代理必須調和確信的記憶主張與相互矛盾的觀察時會發生什麼,以及當前模型能否在衝突演變為安全相關錯誤之前加以察覺。我們利用動態 FrozenLake 測試平台,將過時檢測任務與下游導航任務配對,涵蓋三種閉源模型與三種開放權重視覺語言模型,並在文本與圖像輸入兩種條件下進行(1,800 次檢測運行,以及四個大語言模型導航器在共享 50 種隨機種子規模下的 12,000 次文本模式導航回合)。研究得出三項發現。第一,文本可解性並不意味著視覺基礎能力:能夠可靠地從文本中標記過時條目的模型,在相同的網格上視覺 F1 分數卻從 0.887 降至 0.067,最弱的模型持續做出流暢而自信但忽略圖像的決策。第二,未經審計地使用過時記憶是一種安全隱患:在我們主要的 GPT-4o 設定中,信任原始記憶的代理死亡頻率是完全没有記憶的同一個代理的兩倍以上。第三,審計有所幫助但未能彌合差距:透明的讀取時過濾器在文本模式下消除了大部分安全成本,然而即使在當前網格規模下使用神諭級過時標籤也未帶來進一步的顯著提升,而當視覺審計不可靠時,過濾並未產生一致的效益。綜合來看,這些結果將空間記憶過時界定為一種安全失效模式,並將記憶─觀察衝突下的可靠視覺基礎與動作選擇,確立為記憶增強代理的核心開放性挑戰。
儘管近期影片世界模型取得了顯著進展,但使用者與這些世界中的角色之間的社交互動仍未被支援。為填補此缺口,我們提出 HelloWorld,一個能與世界內角色進行社交互動的影片世界模型。只需按一下按鈕,使用者即可提示畫面上的角色朝向鏡頭回應,例如轉向觀看者、揮手、點頭,或說出簡短的問候語。為了讓這些互動更自然,我們提出一個自我蒸餾(self-distillation)流程,在模型自身合成的資料上微調影片生成模型。每個合成片段同時包含社交互動與鏡頭運動,使模型能學習鏡頭姿態條件(camera-pose conditioning),而不會降低互動品質。在推論時,我們進一步引入一個免訓練(training-free)模組,用於判斷互動發生的時間點。一旦按下按鈕,該模組會調節 DiT 的交叉注意力遮罩(cross-attention masks),使與互動相關的文字提示僅關注按壓時間窗內的幀,從時間上定位角色的回應。我們亦建立 HelloWorldBench,一個包含 400 筆樣本的基準測試,具備三項社交互動指標與三項傳統指標,以供評估。實驗證明,HelloWorld 在互動品質上超越多種基線方法,同時維持最先進的畫面美學與鏡頭姿態跟隨能力。專案頁面:https://github.com/AlayaLab/HelloWorld
GUI 智能體必須同時記住先前任務中習得的有效經驗,以及當前互動中尚未完成的進度。潛在記憶透過將多模態軌跡壓縮為少量連續向量,提供了一種緊湊的解決方案。然而,現有方法通常將每個軌跡對應至一個固定的記憶區塊,並主要透過下一步動作監督來訓練。這造成了三個實際問題:壓縮過程中可能遺失重要細節、同一個記憶區塊必須服務於不同的決策階段,以及不相關的檢索軌跡仍可能誤導智能體。我們提出 FocusMem,在一個緊湊的潛在記憶介面中分離這些職責。角色感知的內容基底促使情節記憶保留可重用的經驗,而工作記憶則保留任務進度。狀態條件化讀取對相同的儲存證據產生決策特定的視圖,同時一個輕量級的信任閘門可抑制與當前步驟看似不相關的記憶區塊。所有元件均在 GUI 策略凍結的情況下進行訓練。在五個 GUI 智能體基準測試中,FocusMem 持續優於完全匹配的僅動作固定記憶基線,以及先前的潛在記憶改編方法。進一步分析顯示,語意監督與功能監督保留了互補的資訊;狀態條件化讀取在周圍軌跡上下文增長時表現得更為穩健;信任閘門則減少了注入不相關情節證據所造成的危害。這些結果表明,有效的潛在記憶不僅取決於對過去互動的壓縮,還取決於保留了什麼、暴露了什麼、以及允許了什麼。
基於技能的提示已成為提升大型語言模型(LLM)智能體的實用機制,然而現有的技能獲取方法往往將技能視為經驗總結、記憶條目或成功示範的直接摘要。這對較弱的學生智能體造成了不匹配:當學生因缺乏任務知識或操作策略而失敗時,其失敗軌跡可能不足以提供推斷缺失行為的證據,而教師軌跡則可能過於隱晦,難以內化為可重複使用的指導。我們提出 SKILL-KD,一個對比式技能蒸餾框架,將技能視為不同能力智能體之間的明確蒸餾媒介。針對同一任務中學生的失敗與教師軌跡,SKILL-KD 將兩者之間可行動的差異蒸餾為文字技能補丁,透過重新執行學生來評估該補丁,並在學生仍失敗時迭代精煉補丁。為防止重複的局部更新造成技能漂移,SKILL-KD 進一步維護軌跡連結的編輯歷史,並執行漂移感知技能整合,判斷每個補丁應新增新規則、刪除或修改既有規則,還是予以跳過。在五個智能體基準測試與兩種學生設定下,SKILL-KD 持續優於固定模型適應基線,提升凍結學生智能體的表現。
模型檢查點的數量與規模持續增長,使得保存、傳輸與部署的成本日益提高。通用型壓縮器雖能降低儲存需求,卻忽略張量結構;而現有的張量專用壓縮器則依賴固定且格式特定的管線。我們提出 Brevis,將無損張量壓縮表述為程式合成問題。我們設計了一個具型別領域特定語言(DSL),透過一組可逆運算子捕捉反覆出現的張量結構,例如重複區域與浮點數欄位。對於給定的張量,Brevis 合成一個自包含的 DSL 程式,以位元級精確地重建該張量。藉由從少量具代表性的張量樣本中學習而得、針對檢查點特定之生成先驗,我們引導有界 A* 搜尋合成精簡程式,之後可直接執行以進行位元級精確解壓縮。在涵蓋語言、音訊與影像生成模型的 10 個公開檢查點上,Brevis 將 2.13 TB 的檢查點資料縮減至 1.41 TB,儲存空間減少 33.93%。其所產生的壓縮檔比四種通用壓縮器(包括 zstd 與 gzip)小最多 30.87%,且產生的壓縮檔亦小於張量專用壓縮器 ZipNN 與 DFloat11。在實際的併發配置下,Brevis 達到 3.60 GB/s 的壓縮速度與 6.61 GB/s 的解壓縮速度,同時完整保留每一個來源位元組。
互動式影片世界模型對於長程規劃與探索至關重要,然而它們飽受累積誤差之苦。諸如強化學習(RL)等後訓練方法可以改進這些模型,但它們遭遇驗證瓶頸:對於任意動作序列,並不存在真實未來狀態可用於衡量長期漂移。我們的關鍵洞見在於,可逆動作循環使此驗證成為可能:由動作序列與其反向序列組成的封閉循環必須在分析上返回初始狀態,從而提供關於長程正確性的免標註監督。以此為基礎,我們提出WorldCycle,一個自驗證的強化學習框架,從普通動作序列構建封閉動作循環及其重複執行,並優化兩個互補獎勵:強制鏡像前向與反向區段之間對稱性的空間閉合獎勵,以及對齊重複循環執行間狀態的時間一致性獎勵。這些獎勵迫使模型將動作學習為一致的狀態算子,而非記憶化的時間模式,並能自然延伸至基礎模型處理不佳的分布外複合動作循環。我們進一步發布CycleBench,一個針對複雜動作結構下狀態返回能力的診斷基準。WorldCycle將狀態返回漂移減少達44%,並將複合動作準確度較基礎模型提升近4倍,為物理基礎的世界模型提供重要根基。
同策略自蒸餾(On-Policy Self-Distillation, OPSD)已成為提升多模態大型語言模型(MLLMs)視覺推理能力的標準後訓練方法。現有方法從多種輸入來源提取特權信息以引導自蒸餾。然而,這些設計忽略了模態不平衡——一個MLLM推理中固有的挑戰。當文本信息主導生成時,模型無法充分整合其多模態輸入。因此,精心設計的特權信息仍未被充分利用,限制了OPSD的有效性。為檢視此限制,我們以放大圖像建構正向教師,並以遮罩圖像建構負向教師,兩者展現不同程度的模態不平衡。其推理正確性與詞元邏輯值的變化顯示,模態平衡本身即可作為特權信息。受此發現啟發,我們提出OPD-V,一種視覺OPSD範式,透過正向教師與負向教師具體化此類信息。正向模態平衡邏輯值邊際定義了模態平衡信任區域,用以選取用於自蒸餾的同策略詞元。在6個基準、4個MLLM骨幹模型與5種後訓練方法上的實驗顯示,OPD-V在降低訓練成本的同時,持續提升推理表現。
領先的開放式文生圖模型往往具有互補優勢:一個可能在偏好對齊的美感上領先,另一個則更忠實地遵循構圖指令。然而,它們的自編碼器與噪聲調度之間的差異,使得這些優勢難以在不同模型間遷移。在本文中,我們提出 Poly-OPD,一個能將異質教師模型的互補優勢整合至單一緊湊的流匹配學生模型中的框架。為橋接不同教師之間不相容的潛在空間,Poly-OPD 透過像素橋接進行同策略蒸餾。每張學生生成的影像都會由所選教師的編碼器重新編碼,並在教師的噪聲調度下,從幅度匹配的噪聲水平開始細化。所得目標進一步在凍結的 DINOv2 空間中與學生匹配,從而在不相容的潛在空間之間實現監督。為在無跨教師干擾的情況下保留互補能力,Poly-OPD 使用梯度相容性診斷來組織其適配器:注意力 LoRA 模組在教師間共享,而前饋適配器則保持教師特定。在蒸餾過程中,差距感知的課程會將更多訓練分配給學生仍不如教師的構圖類別;隨著每個差距縮小,訓練會轉向剩餘差距較大的類別。透過將 FLUX.1-dev 和 Z-Image 蒸餾至一個 2.5B 的 SD3.5-Medium 學生模型,Poly-OPD 將 GenEval 從 67.3 提升至 73.3,超越兩個更大的教師模型,並將 DrawBench HPSv3 從 9.34 提高至 11.35,將兩者的優勢整合於一個可切換的模型中。
利用預訓練視覺-語言模型(VLM)構建視覺-語言-動作(VLA)模型,已成為實現3D機器人操作的一種前景廣闊的範式。然而,現有的3D VLA方法仍高度依賴數據,在分佈偏移下泛化能力有限,且缺乏對過去觀察的顯式記憶。這些局限性阻礙了它們在數據稀缺、開放世界及依賴記憶的操作場景中的應用。我們先前的工作BridgeVLA通過在3D動作學習過程中保持預訓練VLM的輸入-輸出對齊,改善了數據效率與泛化能力:原始點雲被投影為多視圖圖像,並在生成機器人動作之前預測中間熱圖。在本工作中,我們通過為BridgeVLA配備統一的時空記憶架構,對持續的空間上下文與時間交互歷史進行建模,進而開發了BridgeVLA++。由此產生的記憶增強框架能夠在保留BridgeVLA數據效率與泛化能力的同時,對觀察歷史進行推理。大量實驗表明,我們的框架在空間操作任務上表現強勁,同時展現出穩健的泛化能力。BridgeVLA++更進一步在兩個具有挑戰性的依賴記憶的操作基準上達到了最先進的性能,且未犧牲原始BridgeVLA的數據效率與泛化性。此外,BridgeVLA++在雙臂操作設定中亦表現有效,並已在額外的真實機器人平台上得到驗證,展示了其在任務、環境及機器人平台上的可擴展性。這些結果確立了BridgeVLA++作為一個統一的3D視覺-語言-動作框架,同時支持數據高效的學習、穩健的泛化以及有效的記憶感知機器人操作。專案網站:https://bridgevla-plus.github.io/。
社群媒體上隨手捕捉的單目影片與影像數量豐富,為沉浸式內容創作提供了有價值的來源,其中從此類稀疏觀測生成新視圖,能大幅提升使用者體驗。然而,當輸入覆蓋範圍極度有限時,要產生具有照片寫實度與幾何一致性的視圖,並具備精確的相機控制,仍具挑戰性。基於重建的方法(如 NeRF 與 3D 高斯潑濺(3DGS))在稀疏輸入下會嚴重退化,且無法明確處理遮擋。生成式方法雖降低了資料需求,但因幾何引導不準確或具隱式性,在大基線視圖合成上仍顯吃力。為克服這些限制,我們提出 UniWorld-View,一個用於從單目輸入進行可控大基線新視圖合成的統一框架。UniWorld-View 將顯式 3D 幾何引導與生成式擴散建模整合,以實現精確的相機控制與幾何一致的視圖生成。幾何引導是透過一種具遮擋感知的點雲渲染策略取得,該策略解決了可見性歧義,並為基於擴散的合成提供準確的先驗。透過將此渲染策略與強大的視訊擴散骨幹網路結合,UniWorld-View 即使在極端的相機運動與寬基線變化下,也能生成高保真的新視圖,並可進一步提供多視圖影片,以供下游的動態 3DGS 重建使用。在 WorldScore 基準與零樣本新視圖合成基準上的實驗,證明了 UniWorld-View 在可控性、幾何一致性與視覺保真度方面的有效性。
分子膠降解劑已成為一種有前景的標靶蛋白質降解策略,其原理是誘導E3泛素連接酶與標靶蛋白之間形成三元複合物。儘管具有治療潛力,分子膠的計算設計仍 largely 未被充分探索。與傳統的基於結構的藥物設計不同,分子膠設計受制於未知的蛋白質-蛋白質介面,且需要同時模擬配體生成、蛋白質-蛋白質對接以及三元複合物組裝。在本工作中,我們將分子膠設計表述為一個三元複合物生成問題,並提出一個受生物啟發的生成框架 TriGlue。受分子膠作用機制啟發,我們將三元複合物生成分解為兩個耦合階段:介面估計與介面條件下的複合物生成。首先,我們開發了一個 SE(3)-等變介面估計模組,可從未結合的單體結構預測受幾何約束的蛋白質-蛋白質介面。其次,我們引入一個介面條件下的三元流匹配網路,該網路聯合生成分子膠並預測組裝三元複合物所需的剛體變換。大量實驗表明,TriGlue 能生成化學上有效的分子並產生合理的三元複合物,這凸顯了受生物啟發的生成建模在加速分子膠發現方面的潛力。我們的代碼可在 https://github.com/yuliangyan0807/molecular-glue-design 取得。
隨著圖表圖像、表格數據與可視化代碼在諸多領域中扮演日益重要的角色,跨這些模態的跨表示理解對人工智慧系統構成了根本性的挑戰:表示之間的關係本質上是一對多的,監督訊號具有模糊性且成本高昂,而模型最佳化缺乏一個既具方向自適應性、又能超越任務特定目標而實現表示泛化的原則性訊號。我們提出CoCoEvolve以提升圖表、表格與代碼表示之間的一致性。我們不將跨表示映射視為一對多問題,而是定義明確的一對一對應關係,並利用表示之間的一致性來最佳化模型,無需額外的標註。在訓練期間,CoCoEvolve@Train在圖表-表格-代碼循環中進行共同演化,而CoCoEvolve@Test則在推論時應用相同的一致性目標,實現測試時共同最佳化。我們亦提出CoCoEvolve@Eval,一個涵蓋全部六種跨表示任務的評估套件。在四個基準測試中,CoCoEvolve在訓練時與測試時兩種設定下均提升了效能。我們的專案頁面:https://xhguo7.github.io/CoCoEvolve/。
提示注入對大型語言模型智能體構成重大的安全風險。因此,有效率且有效能的紅隊測試至關重要,無論是為了評估這些風險,還是為了收集訓練資料以改善防禦機制。現有的最先進提示注入紅隊測試方法主要依賴於強化學習(RL),其所產生的攻擊者模型通常難以泛化到新的目標大型語言模型。在本工作中,我們開發了PIMiner,一個用於提示注入紅隊測試的智能體系統。在訓練期間,PIMiner在一系列(資料集、目標模型)配對上進行訓練,並從零開始構建策略庫。在測試時,學到的策略庫可以直接遷移到先前未見過的目標大型語言模型,無需額外訓練。PIMiner對每個測試樣本僅需對目標智能體進行少量查詢(例如10次)。實驗結果表明,PIMiner取得了強勁的表現。在IPIArena上,它對Gemini-2.5-Pro達到76.2%的攻擊成功率(ASR),對GPT-5.1達到61.9%的ASR,對Claude-Sonnet-4.5達到42.9%的ASR。在AgentDojo上,它對Gemini-2.5-Pro達到86.7%的ASR,對GPT-5.1達到53.3%的ASR,對Claude-Sonnet-4.5達到40.0%的ASR。
受大型語言模型與自主智能體進展之推動,深度研究已成為最廣泛採用的智能體產品之一。然而,多數深度研究系統撰寫的是通用型報告,此類報告不足以應付金融深度研究。金融研究需要專業知識來分析歷史模式並預測未來事件。因此,自動化金融深度研究既需要一個分層式框架來驅動研究智能體,也需要一個可驗證、防止未來資訊洩漏的時點基準。我們提出了 FinanceHarness,這是一個運行金融導向工具與從業者引導工作流程的框架,可端到端自動化金融深度研究:包括環境與資料建構、智能體執行迴圈,以及獎勵建模。我們進一步提出 FinanceGym,其中包含以論點驅動的研究問題,以及結合截止前與截止後標準的評分量表。專業專家驗證產生了 82% 的通過率。即使是領先的大型語言模型與智能體,在評分量表上的得分也低於 40%,顯示 FinanceGym 具有挑戰性,並留有相當大的提升空間。在相同的開放權重基礎模型下,FinanceHarness 將整體評分從 25.3% 提升至 32.4%。FinanceHarness 可於 https://github.com/Yijia-Xiao/FinanceHarness 取得。
大型語言模型日益被嵌入軟體工程工作流程中,作為能夠檢查程式碼庫、呼叫工具、執行測試、偵錯失敗並產生修補程式的編碼代理。然而,即使軟體開發是一個動態且充滿回饋的過程——程式碼庫會演進、依賴關係會改變、測試會失敗,且修復嘗試會留下可重複使用的經驗——大多數現有代理在部署後仍基本保持靜態。這種緊張關係促成了越來越多的關於自我演化編碼代理的研究,這類代理透過根據先前的編碼互動更新其框架、記憶、技能、工具、模型或協作結構,來改善其未來行為。在本綜述中,我們對這一新興領域進行系統性的綜合整理。我們首先定義自我演化編碼代理,並將其與傳統編碼代理及通用自我演化代理區分開來。接著,我們提出一個以對象為中心的分類法,用以描述這些系統中演化的對象,並輔以兩個正交視角:演化發生的時機,以及哪些軟體特定證據驅動演化。整體文獻顯示,可執行的回饋、程式碼庫級別的上下文與編碼軌跡,使軟體工程在代理自我演化方面成為一個獨特而自然的領域,但同時也在回饋可靠性、基準過擬合、安全性、可維護性、成本與泛化方面引入了新的挑戰。透過圍繞這些維度組織現有工作,本綜述旨在釐清自我演化編碼代理的概念邊界,並為設計更具適應性、可靠性與軟體感知能力的代理系統奠定基礎。我們收集的論文可在 https://github.com/zhouhao1024/Awesome-Self-Evolving-Coding-Agents 查看。
Multimodal large language models (MLLMs) make grounded predictions in real-world scenes by combining visual and textual cues, yet existing benchmarks rarely reveal how they arbitrate between these evidence sources when they conflict. We introduce SIGNPOST-Bench, a controlled counterfactual benchmark for evaluating text-vision conflict resolution. Each source image is transformed into a counterfactual quintuplet of Original, Blank, Similar, Random, and Adversarial variants. Synthetic, localized scene-text interventions are designed to preserve non-textual content, enabling paired measurements of changes in localization performance and directed shifts toward geographic targets introduced by conflicting text. SIGNPOST-Bench contains 5,111 counterfactual groups and 25,555 image variants from four datasets. We evaluate 20 MLLMs from seven providers. Compared with Original images, Adversarial variants raise median localization error from 282 km to 1,347 km, a 4.8-fold increase. Among geocodable adversarial samples, 6.5-20.1% of predictions lie less than 50 km from the injected target across models, and every evaluated model exhibits a positive mean paired reduction in target distance from Blank to Adversarial. Compatible, unrelated, and conflicting text replacements produce distinct effects on model predictions, while clean-input localization performance does not fully predict robustness to conflicting text. These results establish visual geolocation as a continuous diagnostic of scene-text arbitration and provide a controlled framework for evaluating how MLLMs resolve conflicting multimodal evidence. --- 這是一個語音交互的範例,展示如何通過語音識別(ASR)、自然語言理解(NLU)和對話管理來處理用戶查詢。在語音交互系統中,環境噪音和多種口音會顯著影響語音識別準確率,因此在後端加入語音活動檢測(VAD)與說話人分離技術,可有效提升整體辨識效能。同時,意圖辨識的錯誤傳遞也會導致對話狀態追蹤偏離,進而影響最終回應的準確性。為降低此類錯誤,可在NLU模組中引入領域知識庫與上下文特徵,強化槽位填充與意圖分類的穩健性。此外,結合主動式對話策略與即時回饋機制,可讓系統在使用者表達不清時主動澄清,進一步優化互動體驗。 --- 原文: Medical document translation is a critical task in cross-lingual clinical communication. 這項任務要求翻譯人員同時具備醫學知識與語言能力,因為任何細微的錯誤都可能影響病人安全。尤其是藥物名稱、劑量、病歷記錄與臨床試驗文件,必須保持高度精確。研究顯示,採用雙向審查機制與術語一致性檢查,可顯著降低翻譯錯誤率。此外,機器翻譯輔助工具(如統計機器翻譯與神經機器翻譯)雖能提升效率,但最終仍需由專業醫學翻譯人員進行審閱與修正,以確保譯文符合原文語意及目標語言的文化脈絡。在臨床試驗文件翻譯中,efficacy 與 effectiveness 等術語的區別尤為重要,前者指在理想條件下的療效,後者則指在真實世界中的實際效果。這類細節不僅影響法規審查,也可能影響醫師對藥物使用的判斷。因此,醫學翻譯不僅是語言轉換,更是一項涉及倫理與專業判斷的嚴謹學術工作。文件翻譯的品質控管通常包括翻譯、校對、審閱及最終確認四個階段。每一階段皆須由具備相應專業背景的人員執行,並留下完整的紀錄以供追溯。針對大型跨國臨床試驗,翻譯一致性與術語統一性更為關鍵,需建立術語庫與翻譯記憶庫,以支持多語版本的協同作業。近年來,結合大型語言模型與醫學知識圖譜的自動翻譯系統逐漸受到重視,其透過語意推理與上下文理解,能處理較為複雜的醫學表述,然而仍無法完全取代人類專家的判斷。未來,人機協作的翻譯模式將成為醫學翻譯領域的重要發展方向,兼顧效率與精確性。在翻譯實務中,常見的挑戰還包括縮寫與多義詞的處理,例如 aspirin、acetaminophen 與 ibuprofen 等藥物名稱在不同語系中可能具有不同的拼寫與發音,翻譯時須依上下文選擇最適當的對應詞。此外,不同國家對於同一疾病名稱的用語亦可能有所差異,如 myocardial infarction 在中文常譯為心肌梗塞,而在部分地區則可能採用心肌梗死。這類差異需要透過跨國術語對照表與參考文獻加以確認。總體而言,醫學文件翻譯是一項高度專業化的工作,必須結合語言學、醫學知識與文化敏感度,並輔以嚴謹的品質控管流程,才能確保翻譯成果在臨床與研究場域中的可靠性與安全性。
流匹配視覺-語言-行動(VLA)模型(如 pi0)透過積分學習到的去噪速度場來生成機器人動作,且據報導能抵抗輕易欺騙自迴歸 VLA 模型的對抗性擾動。我們證明這種穩健性在很大程度上是虛幻的:它源於先前攻擊忽略了多步去噪常微分方程。我們提出 DRIFT(透過流匹配軌跡的輸入擾動進行去噪重定向),這是一種置於機器人夾爪上的測試時通用對抗補丁,用以攻擊現成策略的去噪速度場。我們的核心發現違反直覺:僅攻擊第一個去噪步驟比攻擊更寬的步驟窗口更強且更便宜,我們透過輸入空間優化中獨有的梯度衝突來解釋這一現象,而該衝突恰好與訓練時後門機制相反。在跨四個 LIBERO 套件的 pi0 與 pi0.5 上,DRIFT 僅用一個小型單一補丁即可破壞幾乎所有原本可解的任務,遠遠超越動作空間與嵌入空間的攻擊基線。
一個框架若要持久化執行狀態,使運行可以中斷、在崩潰後存活並繼續,就必須決定「恢復」對已觸發效應意味著什麼。五個廣泛部署的代理工作流程框架對此給出了不同答案,但沒有一個暴露可機器檢查的契約,且其行為甚至違反了她們所陳述的片段。「恢復契約」規定了持久化 API 上的六個屬性(前綴延續、效應恰好一次、分叉確定性、檢查點有效性、消費一次、恢復確定性),外加分叉意圖與活性義務。一個 TLA+ 模型窮盡檢查了參考語義,在擴展後的邊界(740 萬個狀態)下保持不變;一個 39 格的故障矩陣產生了獨立性所需的分離模型,而消費一次條款被獨立出來,其消費子句與其餘六者皆無關。一個確定性、無 LLM 的測試工具在固定版本上對這些框架進行測量。LangGraph 1.2.9 持久記錄了第二個恢復值但從不查詢它,靜默持久化 schema 無效的狀態,並在真實 SIGKILL 後重新執行已持久記錄的工作:在同一個 API 上,中斷時恰好一次,崩潰時至少一次。CrewAI 1.15.2 違背其書面聲明,重新執行已完成的有效應方法;pydantic-graph 1.x 在節點中途崩潰後無法恢復;沒有任何兩個受測框架共享相同的一致性配置。消費一次在順序執行下成立,但在併發傳遞下失敗:k 個進程恢復一個暫停的中斷,會觸發門控效應 k 次,40 格中 36 格的飽和度為 1.0,且該失敗跨越主機。REMIT 是一個參考序列器,其經 Verus 驗證的恢復核心與發布的可執行檔逐行相同,修復了分叉與有效性格子。跨進程格在讀取路徑上被修復,且該修復已發布:一個選擇加入的閘門在共享儲存中宣告消費,在任一節點執行前服務一個競爭者並拒絕其餘。
對AI模型的紅隊評估,會支持某些主張,而不支持其他主張;而這兩者之間的界線是可以計算的,而不只是判斷的問題。我們將一項評估的證據上限定義為:在固定測試預算下,某個結果能改變信念的最大倍數;並針對基準測試的零結果,以閉式形式推導出該上限,再用它精確定位這條界線。我們發現,當危害率高於某個可計算數值時,規模適中的基準測試即可依既定的證據標準認證某個類別;此時,零失敗紀錄是兩種可能觀察結果中較強的一種,其分量勝過單一的可重現失敗。當危害率低於該數值時,在固定評分規則與近似獨立的試驗結構下,沒有任何規模可行的被動基準測試能提供所指定的安全性證據。這兩個機制之間的交叉點具有閉式解。該上限並非基準測試所獨有;以某個程序在假設條件下的引出率來表述,它同樣涵蓋自適應與自動化的紅隊測試,並顯示出,決定證據價值的是假設之間的區辨,而非攻擊是否成功。我們對照這條界線審計了八個評估套件,發現當前的基準測試對於高頻危害類別是足夠的,但對於罕見且災難性的類別,則短少數個數量級。安全性基準測試並非不具資訊性。它們的資訊性是關於一組特定且可計算的命題;而它們所需要的紀律,便是明確指出是哪些命題。