每日精選AI研究論文及翻譯
強化學習(RL)搭配可驗證獎勵會建構軌跡層級的優勢估計,但在長時程、多輪智慧體任務中,往往無法將成果歸因於少數決定成敗的關鍵決策。近期研究引入特權自蒸餾來進行信用分配,提供更密集的監督,然而此類局部訊號應如何表示序列信用仍不明確。我們提出 AgentOPSD,一種無評論家、遞迴式的回合層級信用分配方法,應用於智慧體強化學習。AgentOPSD 將詞元層級的師生對數機率差距聚合為回合層級證據,並在對數勝算空間中遞迴更新貝氏信念狀態。這產生了一套具有理論依據的重新加權機制,將稀疏的結果監督轉化為回合層級的信用訊號,並透過連續狀態之間的邊際信念修正來識別關鍵回合。該方法與標準策略最佳化完全相容,既不需要額外的評論家,也不需要額外的軌跡採樣。我們使用 Qwen2.5 模型在 ALFWorld、WebShop 和 Search-QA 上,以兩種規模(3B 和 7B)評估 AgentOPSD。AgentOPSD 優於 GRPO 和強自蒸餾基線,在使用 Qwen2.5-7B 時於 ALFWorld 上達到 89.1% 的成功率。消融研究將效能提升歸因於回合層級聚合與依賴歷史的遞迴信念更新。
使用電腦的代理程式(CUA)正於數位世界中快速發展。CUA 軌跡記錄了代理程式的動作、狀態與推理過程。驗證其是否完成任務指令,是 CUA 評估、資料整理與強化學習的核心環節。無論是人類撰寫的驗證器或人類標注者,皆無法在此規模下提供此類驗證,因此該領域日益轉向以視覺語言模型(VLM)作為 CUA 軌跡的評判者。然而,一個根本性問題長久以來未獲審視:這些 VLM 評判者是否足夠可靠?為系統性探討此問題,我們提出 OSReward,一個真實且高品質的基準測試,用以評量 VLM 評判者在 CUA 軌跡上的表現。這些軌跡來自多元代理骨架,在跨平台環境中執行經人類驗證的指令,並透過多階段人工標注嚴謹地賦予真實標籤判定。在此基礎上,我們衍生出 OSReward-Hard,一個聚焦於真實困難案例的挑戰集,以及 OSReward-Multi,用於細粒度效率與對齊評分。迄今最全面的 VLM 評判者評估顯示,即使是最先進的模型仍未能達到理想評判者之標準,且普遍存在系統性的寬容偏差,將失敗的執行誤判為成功。少數足夠可靠的模型其執行成本過高,難以大規模運行,而價格可負擔的開源模型則遠遠落後。為縮短此差距,我們建構並釋出 OS-Shepherd-100K,一個為 CUA 社群提供具推理註解的軌跡判定開放語料庫。在此基礎上,我們訓練出 OS-Shepherd(9B 與 35B),這些開放獎勵模型能以低成本、穩定且可靠的方式提供獎勵訊號,以較前緣模型低 30–60% 的成本達到與商業評判者相當的表現。廣泛的分析進一步為大規模可靠 CUA 獎勵的設計提供啟發。我們的程式碼、基準測試、資料集與模型檢查點皆可於 https://os-copilot.github.io/OSReward-Home/ 取得。
感知語音的短片段可透過深度網路從非侵入性腦磁圖(MEG)記錄中檢索出來;這些深度網路以 CLIP 風格目標函數針對 wav2vec 2.0 音訊嵌入進行訓練。然而,其權重無法對應至電生理量,且目前仍不清楚哪些語音特性驅動了檢索。 我們基於一個高性能的 MEG 到音訊檢索架構,但重新設計了其前端與解碼器。原有的空間注意力作用於展平後的感測器佈局;我們以定義在三維 MEG 頭盔幾何結構上的球諧函數取代之。我們將受試者特定表徵從 270 個分支減少至 25 個分支,並為每個分支加入時間濾波器,使其在空間與時間上對應到神經元來源,同時將卷積解碼器改為更淺的結構。訓練前移除眼動與心臟成分,以降低依賴刺激鎖定捷徑的風險。 在 MEG-MASC 上,六個訓練模型中,該模型在 1005 個候選項目中達到 39.75 ± 0.34% 的 Top-1 準確率,且解碼器參數約為原本的二十分之一。其權重可映射至源空間,恢復出與語音感知網路一致的產生源;左側化的分支攜帶較高頻率的節律成分,而右側並不明顯。成對 MEG 遮蔽實驗顯示,19 個刺激特徵中有 15 個具貢獻,其中靜音、聲音強度、母音與聲學起始的效應最大。隨機詞表則表現相反:將敘述性 MEG 替換進去可改善檢索,這表示缺乏敘事結構的活動所攜帶的可恢復資訊,少於連貫語音期間的活動。wav2vec 目標可縮減至約十二個學習特徵維度而不損失準確率,但強烈時間壓縮則會造成明顯損失。 綜合而言,源映射與輸入干預揭示了檢索的驅動因素。
從開放式文本生成大規模、可自由探索的3D世界仍具挑戰性,因為系統必須同時維持全局空間一致性、豐富的局部內容,以及適合下游編輯和重用的顯式資產。我們提出 WorldClaw,這是一個完全智能體驅動、由粗到細的框架,用於開放世界3D場景生成。規劃智能體將文本提示轉換為區域、地形、資產、材質和空間關係的結構化規範。接著,WorldClaw 從語義佈局、可重用資產、生成式或程序化材質,以及區域感知的高度場,構建全局一致的地形基礎。對於細節要求高的區域,它生成地形條件化的組合,重建可編輯的紋理網格,並恢復它們在地形上的放置位置;基於渲染的智能體進一步細化地形、物體、外觀和接觸。在各種開放世界提示下,WorldClaw 生成具有一致空間組織、視覺上引人入勝的局部內容和可編輯實例級資產的大規模場景,同時保持一致的全局地形結構。
空間智能對具身智能體至關重要,然而現有基準多專注於單一或少量視角下的局部空間感知,忽略了在連續、長期的視覺串流中進行全域空間感知的能力。為解決此限制,我們提出全域-空間-時間基準(GST-Bench),一個針對影片理解中全域空間智能的視覺問答(VQA)基準,其問題皆由人工驗證,源自 6,790 分鐘的合成生成影片。此基準要求模型能從輸入影片中未出現的新穎視角進行精確的空間推論,並將自我中心觀察對應至全域俯視圖。我們對 22 個先進視覺語言模型(VLM)的全面評估,揭示了模型與人類之間的顯著差距:最強的零樣本模型僅達到 42.68,遠低於人類的 79.08。為探究此差距的成因,我們建構了 GST-Bench-Local,發現模型儘管在相同的任務形式下具有強大的局部空間理解能力,仍無法將長期的觀察結果整合為全域一致的場景表徵。我們進一步提供 GST-Train,一個專為全域空間推理設計的資料集,作為輔助資源,以促進未來對此挑戰的研究。
訓練大型語言模型智能體進行長程工具使用時,通常依賴於與真實或合成的可執行環境互動,這些環境的建構與驗證成本高昂;或者依賴難以落地的外部模擬器。我們提出 EnvACE,一種智能體強化學習方法,以世界預演取代訓練期間的外部環境互動。策略在行動與預演之間交替:首先產生一個工具呼叫,然後扮演環境的角色產生該行動所引發的回應,並以預演的回應作為後續決策的條件。這兩個角色利用任務成功獎勵進行端到端聯合優化。透過世界預演,策略在其參數中內化了行動與環境回應之間的關係,產生一個直接支援決策的智能體世界模型。在 BFCL-v4、tau^2-Bench、VitaBench 和 FinMCP-Bench 上,EnvACE 達到了強大且可遷移的效能,在整體評估中優於環境擴展基準。控制實驗進一步顯示,世界預演在不同模型規模下一致地提升策略學習。在測試時,內化的世界模型能夠在實際執行前進行內部預演,在適度的預演預算下無需額外的外部互動即可帶來進一步的收益。我們的研究結果將世界預演確立為一條超越外部環境限制、擴展大型語言模型智能體訓練的新路徑。我們的程式碼公開於 https://github.com/Within-yao/EnvACE。
多模態大型語言模型擅長被動感知,但在需要多步驟時間推理的複雜視覺認知任務上卻表現吃力。這種退化主要源於基於語言的推理固有的模糊性,其往往無法準確表述連續的視覺變換。為了解決此問題,我們提出 ChronoVision,這是一個旨在將視覺邏輯與潛在圖像表徵對齊的多模態框架。在監督式微調期間,重建式視覺頭會預測最終轉換狀態的潛在表徵,同時 ROI 注意力定位模組透過語義跨度查詢,將模型聚焦於關鍵視覺證據。在後訓練階段,我們應用帶有隱式過程接地機制的強化學習,並由一個複合獎勵函數引導,該函數評估結果正確性、潛在過程對齊以及無監督視覺聚焦。此外,我們提出了 Vbvr-VQA,這是一個新穎的資料集,透過將影片推理重新表述為嚴格的影像排序任務,來評估時間追蹤能力。實驗表明,ChronoVision 在 Vbvr-VQA 上達到了最先進的效能,域內準確率為 74.8%,域外準確率為 71.6%,同時在極具挑戰性的跨域基準 IntPhys2 上也取得了 55.0% 的強勁準確率。
統一多模態檢索旨在從異質輸入中識別能滿足複雜使用者意圖的候選項目。儘管基於大型視覺語言模型(LVLM)的檢索器具備高效能與可擴展性,直接編碼原始多模態輸入往往會遺漏細粒度的鑑別線索,導致語意相似的候選項目之間產生混淆。近期方法透過生成思維鏈(CoT)理由來豐富查詢表示,以緩解此限制。然而,此類推理通常僅源於查詢本身:它解釋了查詢所描述的內容,卻未解釋檢索器誤解了什麼。我們主張,有效的檢索推理應改以檢索回饋為條件。基於此觀點,我們提出 UniME-R1,這是一個嵌入器-顧問框架,學習對初始檢索到的候選項目進行推理,並生成以檢索為中心的思維鏈(RC-CoT)。顧問逐一分析候選項目,以辨識被嵌入器混淆的鑑別線索。若目標出現在初始的前 k 個集合中,UniME-R1 直接對候選項目重新排序;否則,它生成 RC-CoT 以修正檢索方向,並使用雙模式嵌入器對整個語料庫重新檢索。為了訓練此框架,我們挖掘困難負樣本以模擬真實的檢索失敗情況,聯合優化直接檢索與 RC-CoT 增強的檢索,並透過監督式學習及以檢索為導向的強化學習,使顧問與檢索結果對齊。在 MMEB-V2 及多樣化的通用多模態檢索基準上的大量實驗顯示,UniME-R1 在強基線方法之上持續提升了檢索效能。
經濟世界模型(Economic World Models, EWMs)是生成式經濟模型,透過建模異質主體、其信念與行動,以及其互動藉以產生總體結果的市場與制度機制,來模擬經濟如何從內部演化。本文制定了一份實施路線圖,旨在將經濟世界模型建構為生成引擎,在其中異質主體行動、互動、適應,並與市場和制度共同演化,從而由內而外地產生經濟動態。我們將 EWM 系統劃分為六級能力階梯,從固定規則基礎的主體世界,到自適應與基於大型語言模型(LLM)的主體世界、自我演化主體、演化制度世界,以及與真實觀測對齊的從模擬到真實(sim-to-real)經濟孿生。橫跨這些層級的系統性文獻回顧顯示,現有研究仍集中在較低層級的主體與模擬環境,而具備自我演化主體、內生制度、持續實證對齊以及經過驗證的經濟機制的系統仍然罕見。透過將 EWM 議程轉化為實施藍圖,本文旨在加速下一代經濟模擬環境的發展,使其既可作為人類決策者的高保真沙盒,也可作為 AI 智能體的訓練、規劃、評估與安全基底。我們發布了一份精選論文清單及相關資源,以支持未來研究。
隨著大型語言模型(LLM)日益部署於智能體系統中,其能力不僅取決於模型權重,還取決於框架(harness):即圍繞模型的提示詞、工具、控制流程、記憶體與編排程式碼。這使得自動化框架優化——由人工智慧系統對框架進行迭代式、以評估為導向的改進——既是提升人工智慧系統的重要途徑,也是人工智慧系統本身所需的高要求能力。然而,學界目前缺乏一套通用協議來衡量前沿大型語言模型在此任務上的表現。我們引入 HarnessOpt-Bench,一個針對昂貴且隨機評估情境下的端到端框架優化基準。優化器——一個配對編碼框架的大型語言模型——接收目標智能體的種子框架、分級評估回饋,以及固定的目標評估預算。它編輯框架並提名最終候選方案,該方案以相對於種子在保留測試分割上的歸一化增益進行評分,而該測試分割在整個搜尋過程中均無法存取。可信執行環境強制執行評估邊界、計量目標智能體的資源使用情況,並保留候選版本以供稽核。我們在共享編碼框架及其原生框架下,將 5 個前沿大型語言模型作為優化器,在 4 個下游任務中進行評估,共進行 111 次評分運行。實驗結果顯示,優化器模型之間的差異大於其所藉以運作的編碼框架之間的差異,原生框架並非一致地優越,且增益在不同任務與種子機制間存在顯著差異。這些結果確立了框架優化作為一項可衡量且具區辨力的能力,且尚有大幅改進空間。
數據代理使組織工作空間上的自然語言分析成為可能,其中相關證據可能分散於資料庫、結構化檔案、長篇文件與多媒體之中。現有基準測試大多將結構化查詢、檢索或開放式分析相互分離,導致異質證據發現、完整表格輸出與確定性評估未能充分統合。我們引入DataSpace,這是一個要求數據代理從任務局部的異質工作空間中產出可驗證表格結果的基準測試。其包含410項跨語言任務與7,439個工件,共計15.01 GB,涵蓋CSV、JSON、SQLite、Markdown、PDF及影片等格式。DataSpace同時作為KDD Cup 2026「複雜數據分析之數據代理」競賽的官方評估基準。每個代理僅接收一個問題與一個工作空間,並須回傳完整的請求表格結果。我們以DataSpace-Builder建構DataSpace,這是一個以執行為根基的框架,包含跨語言轉換、約束感知的關聯式採樣、模態路由與工件渲染,以及由11位領域專家執行的人工審查與任務修復。確定性評估器執行表頭不變的欄位對齊、類型與精度感知的正規化,以及順序感知的列比對。在六個近期發布的前沿多模態模型與五個廣泛使用的代理框架中,最佳準確率達66.34%,而在固定骨幹模型的情況下,代理框架之選擇造成15.36個百分點的差異。多模態證據整合與聯接在所有六個骨幹模型上均持續降低準確率。這些結果顯示DataSpace尚未飽和,並揭示了提升數據代理可靠性的關鍵挑戰。
現代希臘語在NVIDIA的Nemotron檢索模型及主流多語言檢索基準中均付之闕如,儘管其在法律、能源、金融及醫療應用中的檢索增強生成(RAG)領域至關重要。我們提出了一套針對現代希臘語的Nemotron檢索框架端到端改適方案,涵蓋語料庫挖掘、合成監督、檢索模型訓練、重排序器改適、閱讀器微調,以及一個名為HERA的新基準。我們的研究顯示,在專業希臘語語料庫上,無參數的BM25基線模型表現優於多個現成的多語言密集檢索模型。經由65,773個希臘語檢索配對微調後,Nemotron 1B嵌入模型將nDCG@10從0.362提升至0.835,並大幅優於未改適的對應模型。所習得的語言能力可遷移至通用領域的希臘語,但相較於BM25的優勢仍取決於領域。我們進一步改適了交叉編碼器重排序器,並在專業領域中展現一致的效能提升。最後,我們以LoRA微調了一個Nemotron 30B-A3B混合專家閱讀器以進行接地生成,將評判答案正確率從29.4%提升至66.9%,同時顯著改善了忠實度與引用品質。我們亦推出HERA——首個大規模希臘語檢索增強生成基準,並公開我們的改適模型及基準,以支援未來希臘語RAG系統的研究。
同策略蒸餾(On-Policy Distillation, OPD)正逐步成為大型語言模型後訓練中強化學習的可行替代方案,然而其在多語言情境下的有效性仍未獲得充分探討。我們研究了 OPD 及其進階變體——同策略Delta蒸餾(On-Policy Delta Distillation, OPD²)——在英語、韓語與日語數學推理任務上的表現。OPD² 透過利用後訓練教師模型與其基礎模型之間的機率差距作為學習訊號,進而改善了 OPD。基於 Qwen3 的實驗顯示,OPD² 的表現持續優於原始 OPD,在韓語與日語上尤其有顯著進步,且普遍縮小了英語與韓語之間的效能差距。我們進一步發現,僅使用英語資料的 OPD 也能提升韓語與日語的效能,但往往會使回應偏向英語,這凸顯了多語言資料對於維持目標語言回應的重要性。
視覺-語言-行動(VLA)模型通常將主視角與手腕視角的觀察視為並行的視覺輸入,忽略了它們在機器人操作中的不同角色。然而,細粒度操作受益於預測手腕局部互動在全局任務情境下如何演變。為了解決此限制,我們提出了世界到手腕VLA(W2-VLA),這是一種用於細粒度機器人操作、具備任務條件化未來手腕建模的VLA模型。在給定當前多視角觀察與任務指令的情況下,W2-VLA將一組潛在建模令牌情境化,作為視覺-語言模型與手腕預測器之間的緊湊介面。在此介面與已觀察手腕歷史的條件下,預測器預測未來手腕潛在表徵,並將其轉化為具有未來感知的情境,用於行動預測。此外,我們引入了W2-CoT,這是一個合成流程,產生描述操作進展、物理轉變線索與手腕局部證據的結構化註解。這些註解提供輔助監督,用以塑造任務條件化的潛在介面。在LIBERO、RoboTwin 2.0及真實世界操作任務上的實驗證明,在單臂與雙臂設定中,細粒度與接觸敏感的操控表現皆有提升,同時維持高於80 Hz的行動生成速率。
視覺-語言-動作(VLA)模型已成為機器人操作的強大範式,但針對異構機器人本體訓練單一通用策略仍是開放性問題。現有方法有兩個主要限制。首先,它們未充分利用跨多樣視覺與互動資料所共享的動力學先驗,限制了跨本體遷移。其次,它們需要大量人工前處理,以將本體特定動作轉換為通用格式。為克服這些限制,我們提出DyPES-VLA,一種學習共享動力學先驗與本體特定控制的跨本體VLA。首先,我們透過在跨本體資料上以未來預測目標訓練視覺-語言模型(VLM),學習共享動力學先驗,促使共享查詢表徵捕捉物體運動、接觸以及互動引起的場景變化。其次,本體特定的專家混合(MoE)動作頭將這些共享動力學先驗直接轉化為每個本體原生動作空間中的可執行控制,無需手動將異構動作預先對齊為通用格式。該動作頭共享注意力層以捕捉常見的時序動作結構,而其本體特定的前饋專家則解析不同本體的獨特運動學約束與控制語意。作為通用策略,我們的DyPES-VLA在模擬與真實世界評估中均達到最佳效能,在LIBERO上達到98.0%成功率,在RoboCasa-GR1上達到59.25%,在RoboTwin 2.0上達到89.02%。
理解3D場景是具身智能的基礎,這需要在多種模態的異構資訊上進行聯合推理,包括視覺與幾何線索。然而,這些模態的相關性往往會因查詢而異。現有的多模態大語言模型(MLLMs)通常依賴固定的模態組合,忽略了查詢依賴的模態需求。如此僵化的設計可能引入來自無關模態的語義雜訊,同時未能充分利用更具資訊量的模態,導致計算浪費與推理能力被稀釋。為了解決這些挑戰,本文提出SmartMage,一個統一的多模態大語言模型,能夠動態編排異構模態以實現語義感知的3D場景理解。具體而言,SmartMage包含:(1) 一個語義引導的模態自適應路由(SMART)模組,利用語義先驗、文本-模態對齊以及模態品質來選擇與任務相關的模態;以及 (2) 一個模態感知門控專家(MAGE)模組,利用模態先驗引導專家激活,從而在多模態推理中實現自適應的專業化。在實驗上,SmartMage在五個3D場景理解基準上達到了最先進的效能,並在僅RGB的影片理解基準上取得了具競爭力的結果。在我們的診斷基準ScanFacet中,任務被劃分為細粒度的語義類別,使得能夠分析每個語義類型所偏好的模態組合。所觀察到的模態-語義模式進一步提供了SmartMage有效性的證據。專案頁面:https://yuecheong.github.io/SmartMage/。
電腦操作代理為了重新推導使用者已經執行過的例行程序,須付出完整的前沿模型推理成本,因為代理的記憶目前記錄的是使用者「說了什麼」,而非使用者「做了什麼」。我們以一條確定性、零模型的管線,將被動捕捉的螢幕活動編譯成代理記憶:該管線將本機捕捉串流切割為具類型的活動幀,以及帶有應用程式、網站、時間、輸入量與指向原始列證據指標的有界事件片段;由於迴路中沒有模型,輸出在位元組層級完全相同、可快取且可機械稽核。 在一位專業人士的單一使用者語料庫(51個活躍日,128,756幀)上,編譯器將一天的原始捕捉縮減為可直接作為提示的上下文區塊,縮小86倍,耗時68毫秒;讀取該區塊的代理回答當天相關問題時,對照獨立基準的準確率為98.4%(Wilson 95%信賴區間 91.7–99.7%),而同一捕捉內容交由LLM生成摘要後的準確率僅有66–80%;中階模型讀取該區塊即可匹配前沿模型。 同一編譯器同時兼作需求面成本工具。由於其讀取的是委派前被動捕捉的人類活動,而非代理執行軌跡,它能提供代理成本模型假設存在、但據我們所知從未測量過的兩個參數:例行程序開銷比R與例行程序重現率h。我們報告R的首批數值(模型化的上限)為60–343倍,並報告可委派重現率在樣本內為9.0%、樣本外為7.7%,對應於接近8%的實際全代理群token上限;編譯後的例行程序可在模型不介入迴路的情況下被確定性重播,並在一個經守衛比對的命中案例上以零模型token即時示範。結構描述、編譯器與評估工具均已開源。
影片物件移除不僅需去除目標物件,還須消除其引發的效果,同時維持高保真度與時空連貫的還原。現有方法主要從預定義的效果類別與固定資料分布中隱式學習物件與效果之間的對應關係,因而限制其對複雜真實場景的泛化能力,包括組合效果、空間分離或弱相關效果、長尾物理現象,以及動態演變的互動。我們提出 EffectLearner,一個具語意推理增強的框架,結合了基於視覺語言模型(VLM)的物件-效果推理器與基於擴散變換器(DiT)的影片擦除器。在結構化效果分析提示的引導下,推理器對標記目標的影片進行跨模態推理,並提取精簡的效果感知上下文,進而引導影片擦除器達成全面的物件與效果移除。運動感知遮罩引導與運動一致性監督進一步提升在物件運動與場景動態演變下的移除覆蓋率與時空穩定性。為了在具挑戰性的真實場景中充分發揮此框架的效能,我們進一步建構 EffectWorld——一個專為複雜物件引發效果設計的成對影片資料集——並引入結合一般監督與複雜效果資料的漸進式訓練課程。在標準的 ROSE-Bench 上,EffectLearner 在多數指標上優於現有基線方法,並在 EffectWorld-Eval 及具挑戰性的 EffectWorld-Wild 上皆取得明顯優勢,展現其在複雜真實場景中提供高品質影片物件移除的能力。
訓練終端代理需要可執行且可驗證的任務,這些任務不僅要可解,還須具有適當的學習挑戰性。可執行驗證能確立任務的可行性,但無法揭示任務在特定求解器設定下的行為表現。本文提出 CalibForge,這是一個自主式終端任務合成系統,利用已驗證的求解器行為,透過對抗式求解器校準來修訂候選任務。多求解器校準針對異質求解器池內部的分歧,而對比式求解器校準則針對指定的強通過/弱失敗關係;兩者皆將求解器相對的可學習區間具體化,並以已證實的可解性為錨點。利用 CalibForge,我們建構了 5,431 個經校準的終端任務。消融實驗顯示,這兩種策略所提供的監督訊號,均優於僅依賴任務撰寫與驗證,或一般的單一求解器回饋。在完整資料集上訓練的模型,於 Terminal-Bench 2.0 達到 32.58% 與 47.57% 的成績。與對應的基礎模型相比,最大提升幅度在 Terminal-Bench 2.0 上達 24.71 個百分點、在 SWE-bench Pro 上達 27.68 個百分點、在 Doc2Repo 上達 30.04 個百分點。綜合而言,這些結果支持將求解器相對可學習性視為建構有效且可遷移的代理訓練資料之實用目標。
我們提出了MameLoshnLM,這是第一個專為意第緒語建構的開源80億參數語言模型。儘管意第緒語擁有豐富的文本傳統,但其有限的數位足跡與可靠評測資源的匱乏,制約了意第緒語語言建模的進展。現有的多語言語料庫與基準評測往往難以忠實反映該語言,其中包含大量雜訊文本、機器翻譯文本及誤分類文本。為填補這些缺口,我們引入了Oytser——一個高品質的意第緒語預訓練語料庫,結合了當代網路原生來源與文學材料——以及Kashes——一個涵蓋翻譯、語言學分析、資訊抽取與語言理解的多任務基準評測。利用這些資源,我們對Llama 3.1 8B進行持續預訓練,從而獲得MameLoshnLM。在基準評測的各項任務中,MameLoshnLM均優於同量級的开源基線模型。我們的分析表明,這些提升不僅體現在量化指標上:相較於通用型多語言模型,MameLoshnLM能更準確地捕捉定義語言特徵的詞彙與形態模式,這指向了雜訊網路規模多語言資料在低資源語言上的更廣泛失效模式。我們的研究成果既為意第緒語自然語言處理奠定了基礎,也為歷史上底蘊深厚但數位資源不足的語言提供了語言模型開發的實用範本。
端到端文檔解析器提供統一的介面,但將頁面佈局與區域內容序列化為單一自迴歸序列。此公式化迫使相互獨立的區域沿著一條解碼路徑依序生成,其長度隨總內容量增長;相較之下,基於裁剪的兩階段解析器雖能展現區域級並行性,卻需付出重複視覺預填充與頁面上下文碎片化的代價。為在保留完整頁面上下文的同時消除依賴,我們提出 PaDoc——一個以佈局為基礎的解析器,將預測出的佈局視為共享頁面表示之上的分支結構。在區域充分性假設下,我們推導出一種前綴條件分解,使佈局流與區域內容分支能並行推進,將解碼深度縮減至最長的佈局-內容路徑。我們在單一 MLLM 中實現此分解:打包的可變長度祖先注意力在標準下一詞元訓練下維持可見性,而遮罩並行解碼所建立的分支,由評測所用之 vLLM 後端以並發請求方式服務,並重用常駐快取中的共享前綴。在 OmniDocBench Full 上,PaDoc 的 Overall 佈局 F1 達到 91.1;在端到端解析器之中,Overall 分數達到頂尖的 94.24,同時取得最佳的 Text Edit(0.038)與 Formula CDM(95.59)。在 384 頁子集與單張 A800 GPU 設定下,PaDoc 在五種並發等級下均為最快的端到端解析器,相較於同骨幹的 Sequential SFT 基線,有效頁面吞吐量提升 67.4%–118%,P95 延遲降低 39.2%–54.9%。程式碼已公開於 https://github.com/Longin-Yu/Padoc。
潛在擴散模型(LDM)是一種重要的範式,利用標記器將輸入訊號映射至壓縮表徵。這種依賴關係使標記器成為生成過程本身不可或缺的一部分,因為它會影響學習速度、合成樣本的品質,並為後續應用奠定基礎。本報告介紹了一系列適用於音訊、影像與影片的 KVAE 標記器,所有這些標記器皆專為後續的文字條件生成而設計:KVAE-Audio 是連續全頻帶 48 kHz 標記器,其潛在表示頻率為 50 Hz,包含 64 個通道;KVAE-3D 包含兩個因果影片標記器,分別支援 4x16x16 與 4x8x8 壓縮;KVAE-2D 是影像模型,以 32 個通道將輸入壓縮 8 倍。我們證明,重建結果(PSNR、LPIPS、PESQ 等)與生成結果在客觀指標(Frechet Distance、CLIP score、CLAP score 等)及主觀指標(並排評估)上,均達到或超越前沿的開源標記器,例如來自 Wan-2.2、HunyuanVideo-1.5、FLUX.2、MovieGen、StableAudio 與 MMAudio 的 VAE。考量到開發的難度,我們與社群分享訓練細節、模型選擇方法,以及對設計選擇的消融實驗。程式碼公開於 https://github.com/kandinskylab/kvae 與 https://github.com/kandinskylab/kvae-audio。
經典的持續學習(CL)主要聚焦於透過以參數為中心的機制(例如訓練策略、架構設計與權重調適)來使模型能夠更新並保留知識。然而,新興的研究範式正重新形塑持續學習的範疇,使其超越傳統的模型調適觀點。舉例而言,在策略學習(on-policy learning)拓寬了更新機制的空間;測試時訓練(test-time training)將持續學習從訓練階段延伸至推論階段;而外部輔助元件(如記憶、技能庫與互動協定)則將模型能力的演化邊界拓展至遠超靜態參數空間之外。整體而言,這些發展顯示持續學習正從以參數為中心的學習轉向系統層級的調適。為了刻劃此一轉變,我們透過三個維度審視持續學習的演化歷程:學習發生的「何時」(When)、「如何」(How)與「何處」(Where)。「如何」維度涵蓋離策略(off-policy)、在策略(on-policy)與超越梯度的最佳化機制;「何時」維度涵蓋預訓練、後訓練與推論階段等不同時期的演化;「何處」維度則區分內部參數更新與外部結構約束。以此三軸框架為基礎,我們系統性地回顧具代表性的方法,追蹤持續學習正在發生的轉變,並探討此範式轉移所帶來的關鍵挑戰、更深層的意涵與未來研究方向。
深度視覺模型會利用捷徑,依賴與監督信號相關的線索。先前的研究聚焦於可見的偏誤,例如物體-背景或紋理相關性。我們識別出捷徑學習的另一種來源:嵌入於像素層級的不可見元數據痕跡,這些元數據涵蓋影像處理與照片獲取等資訊。我們假設大規模語義監督——無論是透過類別標籤(ImageNet)還是十億規模的標題描述(LAION)——在預訓練過程中自然地誘發元數據與語義之間的相關性,促使模型將低階信號轉化為預測性特徵。透過引入受控的元數據-語義相關性,我們證明較強的相關性會產生系統性更高的元數據痕跡敏感度,並在元數據分佈偏移下造成更大的效能衰退。我們進一步探討在預訓練期間及之後應用的緩解策略,這些策略不僅能降低對目標元數據的敏感度,也能降低對未見元數據的敏感度,且不犧牲下游任務的效能。元數據敏感度也有其正面意義:它部分解釋了某些編碼器強大的生成影像偵測能力,而緩解此敏感度則可改善分佈外泛化。程式碼:https://github.com/ryan-caesar-ramos/visual-encoder-traces
近期視頻模型日益支持在單一模型中進行生成、參考條件控制與編輯,但通常將這些功能作為對固定輸入的獨立操作來呈現。實際創作過程跨越多個鏡頭展開,需要模型既能從文本生成、跟隨參考,也能編輯源素材,同時保持共享的歷史信息。我們將這一設定形式化為互動式多鏡頭視頻創作(IMVC),並提出ContextMaster——一個具備角色感知上下文表示的統一模型,以支持上述操作。互動模型必須保持對不斷擴展之歷史信息的訪問能力,同時不允許每次去噪步驟的上下文讀取成本隨之增長。ContextMaster將可重用的乾淨上下文狀態與固定預算的稀疏上下文路由相結合,並利用ConstraintSink使任務約束始終可見。為應對稀疏上下文訪問與少步去噪推論的雙重挑戰,我們提出了一個兩階段特權上下文蒸餾框架,先通過一致性蒸餾從密集教師模型遷移完整上下文行為,再以分佈匹配優化部署階段的推論。在三種基本任務上的實驗表明,相較於專門設計的基線方法,本模型在任務完成度與跨鏡頭一致性上均有提升。用戶研究進一步驗證了靈活組合的工作流程,且該模型可在單張GPU上達到16 FPS的幀率。
當前的視頻世界模型在多人遊戲環境中表現不佳,因為它們將世界狀態與依賴視角的視覺潛在表示糾纏在一起,導致冗餘計算、視角不一致以及較差的可擴展性。我們提出具有權威共享狀態的多人世界模型(MAS,Multiplayer world models with Authoritative Shared State)來解決這個限制。受多人遊戲架構的啟發,MAS 將世界動力學與視角渲染解耦。一個學習的邏輯引擎根據聯合動作推進全局、權威的類型化狀態,無需任何手寫轉換函數,同時作為唯一的循環記憶和同步參考。基於這個共享狀態,一個學習的渲染引擎按需為任何請求的攝像機生成獨立且一致的視角。這種顯式解耦使得 MAS 在匹配的多人貪吃蛇基準測試中,與最先進的多視角基線相比,能夠實現更優的狀態準確性和更低的跨視角不一致性。它可推進具有 1,024 個並發玩家的預測世界,持續 10,000 個循環步驟。我們的結果表明,顯式、權威的狀態建模為可擴展且一致的多智能體世界模擬提供了實用基礎。
機器人學習正分裂為兩條路線:一是將能力固化於凍結權重中的策略(視覺-語言-行動模型,即 VLA 模型),二是以程式碼形式撰寫並完善自身可執行技能的代理。本綜述圍繞「權重 vs. 技能」這條軸線來組織該領域。其核心分析貢獻在於一項深入探討,依照自我改進程度排列「程式碼即策略」方法:從零樣本程式合成,經由閉迴路自我修復與持久技能記憶,再到一個鮮少有人佔據的格位——在其中,執行回饋、技能記憶與演化搜尋結合成為一個開放式迴圈;目前僅有少數非常新近的系統(如 ASPIRE、ENPIRE 及 RoboClaw)位居此格。我們亦描繪了互補的「技能」一極,從無監督強化學習的技能發現,到大語言模型的技能函式庫,並指出「技能」一詞至少承載五種不同涵義,其中唯有「程式碼」的涵義能在不經梯度更新的情況下自我改進。接著,我們將這套分類法連結至正在興起的技能經濟:商業機器人技能市集如今能跨機器人分發一鍵技能,但所出貨的僅是靜態播放,因而凸顯出適應、跨本體可攜性、來源溯源、安全驗證、組合與標準化等開放問題。這是一份刻意聚焦的綜述。它並未窮舉式地編列整個領域,而是透過一套分類法與一組對照表,檢視六個技術家族中的 77 個代表性系統,並為各種自我改進機制提供操作性定義,同時說明每個家族所不能做到的事。
世界模型因其捕捉與預測物理世界結構與動態的能力而備受關注。在此新興領域中,聯合嵌入預測架構(JEPA)提供了一個特別引人注目的方向。 我們研究了一個 largely unexplored 的領域:人口稠密、擁擠且混亂的全球南方城市環境,我們稱之為 DENSEWORLD。與現有評估中主導的低密度、車道結構化場景不同,這些場景展現出軟性空間邊界、極端的代理異質性、持續性遮擋,以及混合交通下的快速社會協商。我們引入了該領域第一個大規模資料集:涵蓋 22 個城市的 1,000 小時行車、步行及空拍影片。現有的 JEPA 公式在異質性與部分可觀測性條件下,難以保留密集的互動動態。 我們提出 FactorJEPA,將世界結構作為第一級預測原語。與其將未來編碼為單一潛在表示,它透過可視性閘門與分離子空間來組合佈局、實體與互動,以保留部分可觀測的代理並阻止跨因子捷徑。FactorJEPA 改善了 (i) 未來潛在表示準確度(Future-frame L1)、(ii) 干預敏感預測(Causal L1),以及 (iii) 對減少視覺證據的穩健性(Mask-ratio slope),同時展現 (iv) 一個可重現的運動資訊權衡(Motion cosine)。方法排名在 2B 與 1B V-JEPA 2.1 骨幹上重現,rho 值介於 0.895 至 0.978 之間。 我們公開釋出 DENSEWORLD-115k 資料集(https://huggingface.co/datasets/anonymousML123/denseworld-115k)以及經手術訓練的 FactorJEPA 檢查點(https://huggingface.co/datasets/anonymousML123/factorjepa-outputs/tree/main/outputs/full/vjepa_2_1_vitg_1B/train/m09c_surgery_3stage_DI_diheavy_encoder)。
多語言文本嵌入模型通常以單一訓練目標在多樣化任務中進行適配,儘管不同任務需要根本不同的最佳化策略。我們提出任務條件流匹配(TCFM),這是一個多語言嵌入適配框架,它選擇性地將流匹配應用於翻譯任務,同時以與其學習動態更為對齊的目標來最佳化檢索、分類及配對分類任務。TCFM 進一步結合教師引導的表示保留與三階段課程,以實現穩定適配。在 Indic 大規模文本嵌入基準上的評估中,TCFM 達到了新的最先進水準,在多樣化的多語言任務中持續提升嵌入品質,並跨嵌入模型家族進行泛化。我們將在論文被接受後公開釋出程式碼庫與資料集。
從重建場景中選取完整的3D物體,且僅需最少的使用者操作,對於實際場景編輯與具身互動至關重要。現有的基於3DGS方法,要不是重新訓練高斯表示以嵌入逐物體標籤,就是建構密集的多視圖SAM觀測,兩者皆需要大量計算與密集的視角覆蓋,而這在實務上很少能取得。我們提出GaussianSelector,這是一個免訓練框架,可從稀疏視圖與稀疏塗鴉引導中進行互動式3D物體選取。此方法直接操作於原生高斯基元,將密集高斯點粗化為幾何一致的超點,並利用外觀與空間線索構建連續性加權圖。我們透過可見性感知的透射率覆蓋,將稀疏的使用者塗鴉映射至3D空間,並將選取問題求解為全域圖割能量最小化,藉此將稀疏證據傳播至完整的3D物體。此設計自然支援多輪精化,使用者可從額外視圖迭代修正選取結果,以逐步提升成果。實驗顯示,GaussianSelector在選取品質上可與最先進的多視圖SAM方法媲美,同時需要顯著較少的互動視圖與大幅更低的計算開銷。這些特性使其非常適合在真實世界部署場景中,用於人在迴路的3D場景編輯與3D資產提取。