每日精選AI研究論文及翻譯
訓練資料的品質從根本上決定了大型語言模型的能力,但目前尚無統一的基準能全面衡量大型語言模型、代理程式及資料中心工作流程如何端到端地準備訓練資料。我們將大型語言模型驅動的資料準備視為兩種互補能力的結合:資料建構——將原始來源轉換為監督式訓練資料,以及資料品質評估——在下游訓練前預測候選資料集的訓練價值;此處的「品質」指的是下游訓練實用性,而非表面的文字屬性。我們提出DataPrep-Bench,這是首個統一基準,能在六個領域及多個基礎模型上,基於共享的下游驗證協議,同時評估這兩種能力。在資料建構方面,各方法使用相同的原始來源,並透過將基礎模型在其輸出與Dolly-15k共同微調後的表現進行評分;我們同時釋出Data-Construction-Skill,這是一個技能導向的代理程式,在Llama-3.1-8B金融領域中將僅使用Dolly的基線提升了近20個絕對百分點,且在知識萃取密集領域中與最強的代理程式與基於DataFlow的方法表現相當。在資料品質評估方面,評分函數依據其對共享候選池下游表現的皮爾森相關係數進行評分;我們釋出分布對齊分數(DAS),這是一種基於分布的評估工具,透過候選資料集與領域代理之間的MMD進行評估。DAS在六個領域中的四個達到最強的跨模型相關性,且是唯一在數學、科學與醫學領域同時超越r > 0.70的指標,表現優於現有的品質、多樣性與啟發式評估工具。DataPrep-Bench提供了一個統一的、以下游為基礎的框架,用以衡量這兩種能力(作為大型語言模型驅動資料準備的同等重要目標)的進展。
大語言模型的訓練正從人工設計與標註,轉向以互動驅動的自我演化。然而,現有的自我演化方法在任務多樣性與驗證可靠性之間面臨根本性困境:受限於環境的方法能獲得精確回饋,但僅限於狹窄領域的學習;而開放的自我生成雖擴展了任務空間,卻缺乏可靠驗證,導致誤導性獎勵污染訓練循環。我們發現,智能體技能是調和此矛盾的強大中間地帶:每個技能確保特定情境下的深度、可驗證執行,而技能間的動態路由則維持開放的任務多樣性。基於此洞察,我們提出技能自我對弈(Skill Self-Play, Skill-SP),這是一個包含提案者、求解者與動態技能控制器的共同演化框架。透過強化學習循環的協調,這些組件在連續的自我對弈循環中共同演化:提案者根據動態取樣的技能產生具挑戰性的任務;求解者探索候選解決方案以突破能力邊界;技能控制器則收集執行回饋,以更新並擴充技能庫。這種互動式共同演化有效彌合了結構化驗證與開放式探索之間的鴻溝。在工具使用與推理基準上的實證評估顯示,Skill-SP 作為一個穩健的演化引擎,持續推升強力基線模型的能力上限,同時對初始不匹配的模型促成驚人的逆轉突破。我們的程式碼已開源於 https://github.com/Qwen-Applications/skill-self-play。
自主性強化學習研究涉及持續的演算法修改、新的估計器、新的管線階段、新的推展方案,而在主流框架中,每次變更都貫穿於訓練器、分散式後端及推展銜接層之中:這些成本每次迭代都落在研究者身上。Molt 是一個以 PyTorch 原生設計的訓練框架,旨在將此成本降至最低:其程式碼庫精簡且清晰,足以讓研究者牢記於心,也讓 AI 輔助程式碼工具能完整閱讀與推理,從而實現演算法流程的端到端追蹤與修改。代理程式是一個普通程序,透過一個非同步迴圈訓練多模態及混合專家策略,且從不對其未生成的 token 進行訓練,確保 token、策略版本與模型語意的一致性。輕量不損效能:在匹配的完全非同步協議下,Molt 的統計表現與基於 Megatron 的頂尖架構相當。Molt 為開源,並在 https://github.com/NVIDIA-NeMo/labs-molt 提供配方與容器。
生產型AI客服系統的失敗較少源於推理能力不足,更多來自無法妥善管理推理上下文中的內容:對話歷程、龐大提示詞、繁複工具定義與不斷膨脹的工具輸出結果。智能體在自身持續累積的歷史記錄中陷入困境,每輪對話都需支付不斷增長的代幣成本,導致跨對話與對話內部的記憶檢索缺失。當前主流應對方案將此視為儲存與檢索的問題,但我們認為這種框架過於狹隘。主動管理智能體所持有的思維內容應是一個完整生命週期,而非單純的儲存行為:涵蓋決定需記憶的內容、提取與結構化資訊、按資料類型選擇合適儲存方式、在保留溯源資訊的同時進行整合與遺忘、判斷當前相關資訊、預測後續需求,以及在預算限制下壓縮上下文而不遺漏核心要素。在實際生產環境中,此運作並非針對單一用戶,而是橫跨組織層級的權限範圍。我們將此學科命名為「智能體上下文管理」(Agentic Context Management, ACM),並將其分解為五大基礎要素:架構設計、資訊攝取、範圍界定、預測推斷、壓縮與整合。接著從經濟效益角度論證:單純累積上下文會使代幣成本隨對話長度呈二次方增長,粗略摘要雖將成本降至線性卻導致準確度斷崖式下降,唯有經驗證的壓縮技術方能實現線性成本與保真度的雙贏。我們提出名為Maximem Synap的參考實作,將五大要素實現為多租戶服務,在第六節所述配置下於LongMemEval獲得92%準確率、LoCoMo獲得93.2%準確率。最後點出現有基準尚未涵蓋的維度——延遲、代幣效率與上下文腐化抵抗力,以及該範疇未來在決策層級與組織層級上下文管理的發展方向。
實驗追蹤器能顯示訓練進度,但若要修改正在執行的訓練流程,通常仍需依賴訓練器專屬的程式碼。我們提出「交互式訓練 2」(Interactive Training 2),這是一個開放原始碼的控制平面,透過共享協定來引導訓練過程。訓練應用程式宣告其暴露的設定與操作,人類與自動化控制器透過同一介面提交請求,訓練迴圈在安全控制點驗證並應用這些請求。透過客製化的 Aim 工作空間,將即時指標與控制項,以及請求和結果的時序記錄整合在一起。我們在五個自然語言處理與強化學習工作流程中展示了此系統。所釋出的程式碼與軌跡記錄,為可稽核的人工與代理引導訓練提供了可重複使用的基礎。
儘管大型語言模型展現了卓越的推理能力,但其依賴純文本預訓練的限制,使其對多模態物理世界的感知有所不足。原生多模態預訓練透過從頭開始以多模態輸入訓練模型,避免了此限制,從而實現深層跨模態整合,並緩解傳統後期融合架構中固有的優化不對稱性。儘管具備這些優勢,該範式的縮放特性仍未獲得系統性表徵。為填補此研究缺口,我們探討在固定計算預算下,訓練基於Transformer的視覺語言模型時的最優模型規模與詞元數量。我們證明了最小目標損失遵循可預測的計算法則,而計算最優的模型規模與詞元數量則按冪次法則縮放。值得注意的是,語言目標與多模態目標展現出不同的縮放行為。語言分配法則對數據組成大致保持不變,顯示無論多模態數據比例如何,語言學習過程均維持穩定。相反,多模態分配法則對數據組成極其敏感。具體而言,文本密集型混合僅在較大模型規模下才能實現計算效率,從而將最優資源分配轉向更大的模型容量。此外,透過對數據組成影響計算法則與分配指數進行建模,我們推導出效率邊界,明確指定了模型規模、詞元數量與數據混合比例的精確配置。下游評測進一步揭示,原生多模態預訓練可誘發正向跨模態遷移,從而增強純文本空間推理能力,並實現穩健的多模態情境學習。總而言之,這項實證研究為可預測地縮放多模態基礎模型奠定了重要基礎。
現今的生成模型通常依賴對抗性判別器、預設的噪聲到資料路徑,或自回歸分解。然而,我們證明適當的分布能量可以誘導樣本層級的運動,並為單步生成器提供直接回歸監督。用於生成的三體散射建模(TBSM)將能量距離轉化為每個拋射體與固定大小相互作用的關係:每個拋射體被一個真實來源吸引,並被一個獨立生成的來源排斥。以拋射體及其條件為基礎,其期望值等於½D_E²(P_θ, Q)的2-Wasserstein梯度流速度。一批B個凍結目標事件會產生O(B)個樣本層級損失,每個損失使用一個參考作為其條件,而非如漂移模型(Drifting Models)這類方法所使用的全批次成對場域。在線追蹤此條件期望值可降低場域噪聲。透過在凍結影像特徵中進行散射,TBSM在ImageNet-256上訓練單步生成器,在像素空間PixelDiT-XL中達到FID=2.23,在潛在空間DiT-XL中達到FID=1.63(NFE=1)。我們提供了一個設計圖,將擴散相關監督、漂移式動力學及GAN式目標函數聯繫起來。這些結果確立了追蹤散射作為實現高維度單步生成的有效途徑。程式碼:https://github.com/sp12138/TBSM。
工業視頻異常檢測(IVAD)旨在識別工業流程中的異常物體與事件,這對現代製造與品質控制系統至關重要。現有的基於VLM的異常推理方法雖能檢測通用領域的開放式異常,但在具有複雜物體變形、嚴格物理約束與程序限制的工業環境中表現下降。為應對此類高度互動檢測的複雜性,我們提出了一種無需訓練、無需領域特定知識的智能體框架,其運作方式類似於人類檢查員,著重於物體狀態的演變。該框架旨在追蹤檢測物體隨時間變化的時空動態與潛在轉變,並基於物體層面的時間狀態軌跡進行推理,以在定位框架中識別異常物體。我們的方法克服了先前方法需基於正常片段重新訓練或在測試推論時注入領域知識作為上下文的限制。在三個IVAD數據集上的廣泛實驗表明,我們的方法優於前沿的VLM、智能體框架及在各自數據集上微調的傳統VAD方法,同時能提供關於異常過程與類型的可解釋報告。
在多語言檢索增強生成中,檢索器可檢索多種語言的相關文檔,這些文檔在答案生成前會先經過重排序。然而,現有之多語言重排序器在排序語義相關的候選文檔時,是否考慮文檔語言仍不明確。我們的分析顯示,當跨語言存在語義等效的文檔時,這些重排序器並未一致地優先排序與查詢同語言的文檔,儘管文檔語言可能影響答案生成。我們釋出LAMAR,一個基於語言感知的多語言跨編碼器,其訓練目標為同時考量語義相關性與語言一致性。LAMAR首先採用英文錨定相關性蒸餾,以建立跨多語言輸入的一致相關性評分,隨後應用語言一致性的偏好對齊,促使與查詢同語言的文檔獲得更高排序,同時保留語義相關性。在針對語言一致性設計的對照實驗中,LAMAR在整體及所有個別語言上均達成最佳表現。LAMAR在既有之多語言重排序基準上亦保持競爭力。在實際檢索場景中,當對第一階段檢索出的候選文檔進行重排序時,LAMAR在所有報告指標上均達成最佳結果。這些成果顯示,LAMAR在一般多語言重排序基準上表現強勁之餘,亦考量了語言一致性。
大型語言模型日益被部署為代理,但可靠的代理行為所需的遠不止於下一個token的預測。在推理階段,代理最好能自行決定是否繼續當前的推理過程、是否交由更強大的模型處理、是否請求額外資訊、是否調用外部工具,或是在當前設定下選擇放棄。現有方法透過提示層級路由、外部編排或任務專屬微調來處理這些決策,這些方法主要依賴輸入端的訊號,且隨著模型主幹的演進,往往成本高昂且難以維護。我們探討這類控制決策能否直接從模型的潛在生成過程中推斷出來。我們提出多頭潛在控制(Multi-Head Latent Control),這是一個輕量層,能從已凍結的大型語言模型(LLM)或視覺語言模型(VLM)中讀取隱藏狀態軌跡,以產生部署時的控制信號。能力頭(Capability Head)預測當前模型是否能解決該實例,或應交由更強大的協作者處理;而決議頭(Resolution Head)則預測適當的決議決策:釐清、工具使用、放棄,或直接回答。這兩個頭僅在相同凍結LLM主幹的潛在軌跡上進行訓練,從而實現無需修改模型的事後適應。在語言與視覺語言設定中,多頭潛在控制一貫改善了多模型系統的品質-成本權衡,實現了基於部分生成內容的早期交接與更準確的干預決策。在路由執行(小模型+大模型)中,它在AndroidWorld上減少了高達90.7%的大模型使用量,在各基準測試中平均減少27-53%,同時保留了大部分大模型的性能。此外,學習到的控制信號提升了工具使用決策的品質,帶來高達+158%的相對分數提升,並減少了65.5%的必要工具調用遺漏。
近期基於條件的視頻生成模型已展現出將三維引擎渲染(如深度圖與未紋理幾何)轉換為逼真影片的巨大潛力,可應用於遊戲與沉浸式內容創作。此類應用需要具備長程自回歸生成能力,能在持續合成新畫面的同時,維持穩定的三維世界表徵。自回歸生成器透過有限大小的鍵值緩存逐塊合成視頻,因此當相機在環境上下文被清除後重新訪問某個位置時,即使條件渲染(如深度)仍與底層幾何完美對齊,模型仍常生成不一致的外觀。我們提出一種無需後訓練的方法,利用三維引擎已提供的對應關係來解決此重訪不一致性:時間對應關係可將姿態匹配的歷史潛變量塊檢索至鍵值緩存中,作為回環閉合記憶;而源自相機姿態與深度重新投影的空間對應關係,則能引導Token級注意力偏向檢索塊中幾何對應的區域。我們在從TartanAir與TartanGround數據集中提取的回環閉合軌跡上驗證方法,以模擬複雜的真實應用場景。結果顯示,本方法在不犧牲整體視頻品質的前提下,在重訪一致性上優於現有無訓練基線。項目頁面:https://wenchao-m.github.io/ClosetheLoop.github.io/
大型語言模型(LLMs)在過去幾年中已大幅自動化科學發現的過程。然而,現有系統皆有一個核心限制:它們在生成與優化想法時,要嘛獨立追求品質,要嘛獨立追求多樣性。這常導致產出的想法彼此高度相近,或產生大量瑣碎、不健全或含義不清的概念。在本研究中,我們主張研究構思應同時兼顧這兩個目標,並將其框架為品質-多樣性(QD)搜尋問題。基於此觀點,我們提出IDEAgent,一個透過世系(lineage)管理想法演化的多智能體框架。我們利用多目標回饋專門進行修復與精煉,共同驅動品質提升;同時,透過輕量級序列記憶體以及與已完成的構想、其歷史祖先及被拒絕提案的明確比較,來實現多樣性。為系統性評估此品質與多樣性的結合,我們開發了Yield這個聯合指標,用以計算在滿足預設品質門檻下,最大的相互多樣化構想集合。最後,透過橫跨電腦科學8個領域共32個主題的評估,我們顯示IDEAgent在Yield指標上超越最佳基線3.89倍,並且在8倍於基線的主題數量上達到非零的Yield。我們進一步透過品質改善分析佐證這些發現,顯示修復與精煉對於建立邏輯嚴謹性與清晰度、同時保持非顯而易見性至關重要。為鼓勵未來基於QD搜尋的構想研究,我們將IDEAgent開源於 https://github.com/declare-lab/IDEAgent。
視覺語言模型(VLM)智能體越來越多地使用工具來對3D場景進行操作,而非僅止於描述。現有的3D基準測試僅針對文字回應或單物體操作進行評分,導致對智能體在完整多物體3D場景中的行動評估不足。我們提出SceneActBench,這是一個在統一智能體-環境循環下,針對五項3D任務的視覺條件行動基準。在給予PNG圖像或取樣視訊幀以及(若適用)提供的3D資產後,智能體對3D環境執行操作。我們使用任務專屬的幾何指標,將每個最終輸出與隱藏的真實標註進行比較評估。SceneActBench由210個來源實例建構的五項任務組成,產生520個任務案例,其中包括成對輸入條件。每個任務皆經由一個固定的智能體循環執行,以確保比較的公平性。在十一種專有VLM配置中,總體分數範圍為38.6至50.2,且沒有任何一種配置能在所有任務中表現一致良好。我們進一步分析了失敗的表現位置與方式。
擴散模型在迭代取樣過程中通常會累積誤差,此現象常被稱為暴露偏差。我們揭示了訓練與推理之間存在系統性的頻率相關偏差,可將其解讀為頻率相關的信噪比誤差。關鍵在於,此偏差的方向會隨模型與時間步階而變化,顯示固定修正規則無法通用。我們提出頻譜對齊法(Spectral Alignment, SPA),這是一種輕量級、基於引導的方法,可將中間預測的功率譜校準至預先計算的先驗。該方法包含兩個階段:(1) 根據訓練資料離線擬合參數化頻譜模型;(2) 在推理階段透過基於快速傅立葉轉換(FFT)的高效率梯度計算進行引導。SPA僅引入極小的計算開銷(約3-4%),並可與無分類器引導(Classifier-Free Guidance, CFG)互補。我們在多種架構上展現一致性的改進,涵蓋像素空間模型(DDPM、ADM)、潛變數擴散模型(SD2.0、SDXL)以及流匹配模型(SD3.5、FLUX)。本實作程式碼已公開於 https://github.com/SonyResearch/SPA。
視覺-語言模型(VLM)處理大量視覺令牌,導致顯著的推理延遲與記憶體開銷,因而促成視覺令牌壓縮的廣泛研究。無需訓練的策略依賴啟發式度量,在高壓縮比下效能大幅衰減;而許多基於訓練的方法引入外部壓縮模組,迫使VLM主幹網路進行適應,不僅帶來龐大的再訓練成本,也損害VLM的既有先驗知識。有效的視覺令牌壓縮仰賴強大的資訊編碼能力,此能力已內建於預訓練VLM中,卻未被現有方法充分利用。受此啟發,我們提出VisCo,一種訓練高效的自我壓縮框架,將預訓練VLM本身重複利用為內建壓縮器。VisCo是一個參數共享的自編碼器,透過少量記憶令牌壓縮視覺資訊,並將編碼階段的階層式資訊傳遞至解碼階段。實驗結果顯示,在所有評估的壓縮比下,VisCo均超越先前方法,在更激進的壓縮設定中優勢更大,甚至在極端的單一令牌設定下仍保持穩定。此外,當與原始視覺令牌結合時,所學習的記憶令牌甚至能提升基礎模型表現,顯示VisCo捕捉到超越壓縮層面的互補表徵。
大多數自動說話者驗證(ASV)系統均基於單一語句運行,儘管現實世界的互動通常由多個語句組成。隨著語音資料累積,透過聲學、韻律及語言學線索可獲得越來越豐富的說話者資訊,這可能對主要針對聲音特徵的說話者匿名化方法構成挑戰。我們在多語句、多模態情境下研究ASV,並探討跨匿名語音聚合資訊是否影響隱私保護。首先,我們研究僅基於音訊的多個匿名語句聚合,並觀察到隨著可用語音增加,效能持續提升。接著,我們納入韻律及語言學資訊,顯示多模態系統優於單模態方法。最後,我們比較不同聚合策略,發現幀級別聚合可達到最低的等錯誤率(EER)。即使僅使用五個匿名語句,結合音訊與文字相較於僅音訊聚合仍可降低超過15%的EER,證明匿名化後仍有大量說話者判別資訊可被利用。