每日精選AI研究論文及翻譯
長視野代理即使其底層模型能解決構成步驟,仍可能失敗。它們可能失去對可變狀態的追蹤,未能重新啟用先前執行中的教訓,跳過已知程序,或過早停止。我們押注於框架擴展,以改善代理周遭的執行系統,而不改變其模型權重。我們引入 StateM,一個代理原生運行時,其圍繞持久狀態、階段局部上下文、受檢轉換、可恢復的運行手冊,以及可供代理與使用者共同檢視的版本化程序化實踐來組織執行。 在 Terminal-Bench 2.1 上,StateM 將 GPT-5.5 xhigh 提升至 92.1%,而參考基準為 83.1%,GPT-5.6 Sol Ultra 則為 91.9%。該運行手冊在不作修改的情況下轉移至 GPT-5.6。使用 GPT-5.6 Sol xhigh,StateM 在 445 次試驗中達到 95.3% 的原始準確率,並在 89 個任務中每一項至少成功一次。凍結的設定檔將 GPT-5.6 Luna 從 76.7% 提升至 85.4%,高於 84.9% 的 Sol xhigh 參考。 使用相同的運行時、運行手冊結構與黃金規則,少於 38 美元的調整使 DeepSeek-V4 Flash 在標準逾時下從 82.7% 提升至 88.1%,並在 88 個任務的公共核心上達到 89.1%。僅延長剩餘的延遲敏感任務,即可匹配已報告的 88.8% GPT-5.6 Sol 最高結果。最終評分的 API 使用量約為 15 美元,相比之下 GPT 參考為 574.68 美元;DeepSeek 的總支出為 52.22 美元。 在 BusinessBench 上,基於開發集建構的家族特定運行手冊,在保留集上分別產生 0.55 個宏觀點數與 1.34 個微觀點數的增益;兩個機制匹配的家族提升了 10.04 個點數。當任務共享執行結構時,具體規則得以泛化,而控制方法則廣泛適用。StateM 將選定的事後檢討發現轉化為持久、可執行的前置條件與實踐,透過狀態化控制使學得的控制明確且可強制執行。程式碼位於 github.com/henryqin1997/statem。
一個基準不應僅提供標量分數:評估之所以可信,在於支撐該分數的推理過程。這對世界模型尤其關鍵,因為判斷一次推演的優劣,需要理解物理、因果關係及世界狀態是否正確演進。人類能自然地察覺此類違背,然而現有基準均未自動化此能力:指標以暴力計算方式產生,未留下任何可審查或驗證的推理鏈。我們提出 HarnessEval-W,這是一個智能體化的評估管線,將 LLM 生態系中的測試框架(harness)範式引入世界模型基準測試。HarnessEval-W 不以固定評分標準進行評估,而是解讀每個評估案例的脈絡,將評估問題分解為可量測的子問題,並生成專門化的子智能體,每個子智能體配備量身打造的脈絡與診斷工具,就其各自的子問題進行推理。父智能體隨後驗證所蒐集的證據,並將其彙整為最終判定。此層級化工作流程將每次評估轉化為透明的證據樹,其完整的推理鏈為結果提供依據。我們將 HarnessEval-W 應用於 18 個具代表性的世界模型,涵蓋 330 個評估案例。其判定與人類偏好高度一致,同時為每次生成的推演提供可驗證且細粒度的診斷。我們將完整管線開源作為持續運行的基準,並邀請廣大社群共同貢獻,隨著世界模型的演進,持續拓展新的技能與評估案例。
具有群體相對優勢的強化學習(RL)已成為後訓練語言模型推理模型的事實標準。然而,在優化多個獎勵目標時,現有方法通常先在群體標準化之前,以固定加權和對獎勵向量進行標量化。我們表明,這種設計會導致兩個根本問題:具有不同獎勵特徵的軌跡可能獲得相同的優勢值;而且所有目標都以固定相對權重進行優化,無論其當前飽和程度如何。因此,訓練會持續將梯度預算分配給已解決的目標,而非專注於剩餘空間更大的目標。我們提出了用於多獎勵策略優化的飽和感知優勢重加權(SA-MRPO),該方法獨立地標準化每個獎勵目標,並根據目標飽和度的批次級估計,自適應地折扣其貢獻。這會動態地將優化努力重新分配給優化不足的目標,同時在實證上維持那些已充分滿足目標的性能。我們進一步表明,飽和感知重加權可以翻轉更新的符號,而不僅僅是重新縮放其幅度。在具有雙目標和三目標獎勵組合的數學推理中,SA-MRPO在15項基準比較中的12項中,於更困難的正確性目標上優於GDPO,在AIME24上的提升高達5%。在適應性推理方面,它在全部五個基準上提高了準確率,平均提高3.8%,在AMC23上最高提高9.2%;在程式碼基準上,通過率最高提高2.3%;同時在所有設定中,較容易的目標保持在其已滿足的水準附近。
科學發現通常涉及在廣闊、結構化且開放式的假設空間中優化評估成本高昂的目標,例如分子、蛋白質序列和電腦程式。諸如大型語言模型(LLMs)之類的生成模型為這類空間提供了表達力強的先驗,但其似然和自我評估對於目標及校準的認知不確定性而言,是不可靠的代理指標,尤其是對於超出觀測數據分佈的新候選項。我們引入了大型發現模型(LDM),這是一種基於經驗的循環架構,將生成模型與貝葉斯非參數獎勵代理模型結合在一起。生成模型提出並改進候選設計,而代理模型則預測其性能並量化不確定性,從而產生一個具不確定性感知的價值,用以引導候選項的生成、改進和選擇。發現記憶和代理模型會隨著每一次新的實驗觀測的到來而不斷更新。我們在跨越不同設計模式和目標的三種情境中評估LDM,包括神經網路訓練、抗體設計和分子優化。與僅使用LLM的反思或傳統統計搜索相比,LDM在這些領域中實現了驗證BPB額外2.4倍的降低,結合能相對降低18.2%,以及分子多目標性能超過60%的相對增益。這些結果表明,LDM可作為一種通用發現引擎,用於在開放式假設空間中進行有效搜索。
根據用戶查詢構建互動式3D開放世界至關重要。然而,現有方法主要是在理想化、簡單的查詢上進行評估,使得難以系統性地分析和比較多模態智能體如何理解用戶意圖、使用3D工具,以及基於文本和視覺3D世界信息進行推理。為此,我們提出了VibeWorlding,一個用於基準測試和訓練vibe worlding智能體的統一框架:該智能體能夠在多輪智能體-環境交互過程中自主推斷用戶意圖、規劃場景佈局、調用3D工具,並反思多模態反饋。為實現此目標,我們首先構建了VWE-BENCH,一個包含2,616個高質量3D資產、323個人工標註的種子3D世界,以及6,828條逆向合成的多模態用戶查詢的基準,分為具有真實標註的已驗證查詢和帶有精心設計評分標準的未驗證查詢。此外,我們開發了VibeWorlding-Gym,一個聯合多模態強化學習後訓練框架,整合了(1)一個將資產檢索、編輯和圖像渲染統合為MCP工具的沙盒環境,以及(2)一個基於評分標準的驗證器,該驗證器結合物理可行性和意圖滿足驗證,同時支持公平的模型評估和可擴展的多模態強化學習獎勵服務。我們的實驗表明,當前前沿的多模態大語言模型(MLLM)遠未能解決vibe worlding智能體任務,即使是GPT-5.5和Qwen3.8-Max的成功率也低於60%;我們進一步將瓶頸追溯到精確的3D世界編輯。我們進一步發現,強化學習訓練可以緩解這一弱點,並使開源MLLM甚至能超越閉源前沿模型:我們的VibeWorlder-8B可與前沿MLLM相媲美,而我們的旗艦模型VibeWorlder-30B-A3B在所有評估模型中取得了最佳的整體Pass@1。
我們提出 MOSS-VL,一個開放原始碼的視覺-語言模型系列,將即時互動——在說話的同時進行感知——視為一項首要能力。此模型在整個技術棧上進行協同設計:語言解碼器僅透過門控交叉注意力機制關注視覺訊息,使模型在生成時能自然地感知輸入畫面;一個合成的互動語料庫監督何時說話、何時保持沉默、以及何時修正;並採用分階段課程,將所有即時相關的訓練集中於一個輕量的最終階段,建立於強大的離線基礎之上。在離線設定中,MOSS-VL-Instruct 在相近規模下具有競爭力,並在時間推理影片集上取得領先。在四個串流基準測試中,MOSS-VL-Realtime 於開源串流模型中,在三個基準上取得最佳平均成績(第四個基準名列第二),並橫掃了直接測試主動行為的三個子集——在 OmniMMI Proactive Alerting 上取得 66.0,而最佳基線僅為 37.5。憑藉 113 億參數,且視覺 token 位於解碼序列之外,MOSS-VL 在視覺上下文增長時,將其相對於同骨幹架構之 Qwen3-VL-8B 的首 token 延遲優勢從 2.8 倍擴大至 5.1 倍。我們已於 https://github.com/OpenMOSS/MOSS-VL 釋出全部五個檢查點、訓練課程,以及即時推論程式碼。
基礎GUI代理可以自動化複雜的數位任務,但部署受到稀缺且有偏誤的訓練資料、模糊的提示以及不可靠的執行所阻礙。常規工作流程依賴於使用者特定的工具和默契慣例,因此未明說的指令可能在多次執行之間產生任意差異。我們提出UI-Mate,一個基礎GUI代理,整合了環境接地的訓練堆疊與上下文內的示範學習。UI-Mate有三項貢獻:可擴展的環境接地訓練堆疊:一個閉環資料引擎,透過統一的任務驗證器套件,在大規模並行環境中自動化任務生成、環境建構、展開、過濾、能力平衡、監督式微調(SFT)和線上強化學習。上下文內的示範學習:一種將多模態示範轉換為彈性子任務層級流程、遵循相關示範步驟並從即時介面重新規劃的機制。OSWorkerBench基準與洞見:一個橫跨41個應用程式、包含100個長時程辦公室任務的基準,支援僅指令和示範引導的評估。其示範資源將一個33任務的自我示範設定(由同一目標的成功強代理展開軌跡所建構)與一個45任務的變體示範設定(由相關但不完全相同任務的人類錄製所建構)加以區分。實驗顯示,UI-Mate-27B在一般電腦使用基準上樹立了新的開放權重最先進水平,在OSWorld-Verified上得分77.0%,在WindowsAgentArena上得分66.2%。在OSWorkerBench上,它達到41.0%的嚴格成功率和76.9%的進展,比其Qwen3.6-27B基礎模型高出17.7和24.5個百分點。在33任務的自我示範子集中,一個示範將嚴格成功率從17.2%提升至35.4%,進展從67.9%提升至81.1%,大幅提高了長時程可靠性。專案頁面:https://ui-mate.github.io。
Agent 框架(agent harnesses)透過協調代理與環境之間的互動,已大幅提升了長時程任務的表現。然而,透過複雜框架進行強化學習仍 largely 未獲探索,因為將此類訓練擴展至長時程代理任務會帶來根本性的挑戰。在本工作中,我們提出了一個統一的黑箱強化學習框架,用於透過複雜框架對通用代理進行穩定且可擴展的最佳化。具體而言,我們首先建構了一個基於沙箱的執行基礎設施,將任務環境與框架隔離於臨時沙箱中,以支援大規模並行軌跡生成。接著,我們將策略最佳化與不透明的框架執行進行解耦,並在模型邊界部署服務代理(serving proxy)以擷取模型呼叫。為了重建多輪軌跡並提升訓練效率,我們將擷取到的呼叫組織為前綴樹,並進一步調整基於評論家的 PPO 與無評論家的 GRPO,以在還原出的樹狀結構上進行最佳化。同時,我們在整個最佳化過程中維持訓練與推論之間的一致性。最後,我們引入了混合框架訓練(mix-harness training),使單一模型能夠透過異質框架進行聯合最佳化。採用 Qwen3-30A3B 時,黑箱強化學習在 ClawGym-Bench 上分別透過 OpenClaw 與 Claude Code 將 Pass@1 提升了 9.98 與 14.81 個百分點,且在 200–400 步最佳化過程中保持穩定。此外,該框架在更具挑戰性的任務(如 JobBench 與 OfficeQA)上也展現了持續的效能提升。整體而言,我們的框架實現了透過黑箱框架對通用代理進行有效、穩定且可擴展的最佳化,並支援跨異質執行系統的統一訓練。
本文探討生成建模中一個日益重要的主題:像素空間擴散模型。儘管已有大量研究探討此主題,但多數聚焦於小規模或類別條件設定。因此,要訓練出能與成熟的潛在空間模型匹敵甚至超越的像素空間模型,其實用配方仍然難以捉摸。透過一項全面的實證研究,我們首先觀察到,在像素空間直接進行大規模預訓練,其收斂速度明顯比在潛在空間中慢得多。此觀察促使我們提出一種「從潛在到像素」的策略,先在潛在空間中有效獲取生成先驗,再於後期訓練中轉換至像素空間。接著,我們系統性地探討了影響此轉換的關鍵設計選擇,包括權重初始化、資料組成、預測目標、解碼器架構與雜訊排程,並找出一個實用配方,使所產生的像素空間模型能與潛在空間模型相當或表現更佳,同時實現 3.18 至 4.75 倍的端到端推論加速。我們希望這些發現能為未來像素空間生成的研究提供有用的實證見解與實用指引。
大型語言模型(LLM)代理正從對話式助理演進為透過推理、工具使用、程式碼生成與工作區操作來執行長時程任務的自主系統。隨著代理日益在持久化環境與多步驟工作流程中運作,它們面臨著與交易式資料庫系統所處理之問題類似的挑戰:可靠執行、一致結果、安全並發與持久狀態管理。我們引入代理交易(agentic transaction)的概念,並提出一個符合ACID規範的代理系統框架,透過四種語意保證重新詮釋經典的ACID屬性於代理執行:語意原子性(Semantic Atomicity)、語意一致性(Semantic Consistency)、語意隔離性(Semantic Isolation)與語意持久性(Semantic Durability)。這些屬性共同為在模型不確定性與動態執行環境下建構可靠的代理系統提供了原則性的基礎。為具體實現此框架,我們開發了一個符合ACID規範的資料代理,透過交易式探索-執行-驗證循環、交易式技能中樞、基於信心分歧的驗證、語意相依性感知的隔離,以及交易感知的語意狀態管理來實現這些保證。在廣泛使用的基準測試上的實驗結果顯示,我們的系統比最先進的代理(包括Claude Code)提升了10.6%。這項工作開啟了將交易原則與系統架構延伸至建構可信、可擴展且自我進化的AI代理系統的更廣泛研究議程。
人工智慧長久以來協助科學研究,但大型語言模型與代理式支架的快速進展正重塑此一格局;單一系統現已能執行從初始假設到最終發表論文的全階段研究,此範式現被稱為「自動研究」(AutoResearch)。現有評估對這些智能體如何運作或在哪裡失敗所揭露的資訊甚少。任務範圍狹窄,評估測量性能而非過程,而失敗診斷缺乏系統性的涵蓋範圍或產物層級的可視性。為填補此缺口,我們提出 AutoResearchEval,其包含 100 項以已發表的前沿科學為基礎的任務,涵蓋 7 個科學領域與完整的研究生命週期,包括構思、檢索、執行、分析、寫作與審查。評估 8 種支架—模型組合,產生 800 條自動研究智能體的軌跡,並附有過程層級的註釋。我們將這些洞察組織成「自動研究失敗分類法」(AutoResearch Failure Taxonomy, ARFT),這是一個包含 45 種以實證為基礎的失敗模式的框架。為實現可擴展的細粒度歸因,我們利用一個經人類校準的「智能體即評審」流程來檢查完整軌跡與中間產物。失敗模式匯聚到一個單一的總體限制:目前的智能體缺乏後設認知迴圈,亦即缺乏將自身產出與所發現的事實進行比對、在對不上時進行修訂,以及質疑自身所採取路徑是否穩健的能力。相同的模式在全部 8 種支架—模型組合中重複出現,包括受測的最強模型;這將缺陷定位於模型層級,而非任何特定的支架。編排層級的介入能否彌補此缺陷,是一個本工作未測試的開放問題。我們公開釋出 AutoResearchEval 與 ARFT,以促進自主科學發現領域的持續研究與發展。
Prior Labs 在關聯式學習領域的首次發布,展現了我們對開放科學的持續承諾。我們開源了三項軟體,期望能加速該領域的研究,帶來具意義的實際影響。我們旨在根據社群的回饋,並與社群合作,來引導後續的發展。鑑於目前的開發仍處於早期階段,我們的 α 版本主要針對研究人員與早期採用的實踐者。 過去幾年來,雖然湧現了各式各樣的關聯式學習資料集與任務,但社群尚未就如何在這些任務上以可靠且可重現的方式比較不同方法達成共識。我們的 α 版本 RelArena-α 提供了一個統一框架,用於在 RelBench v1 上執行與比較基線模型,透過標準化資料載入、評估協議、調參機制,以及對自訂調參系統的支援;此框架的設計參考了如 TabArena 等已建立的表格型基準。我們計劃與研究社群合作,進一步將 RelArena-α 發展為推動關聯式學習社群進步的催化劑。 我們發布了 TabPFN-Rel 的初始版本,這是專為 TabPFN-3 設計的關聯式工具框架。TabPFN-Rel 目前在 RelArena-α 的模型排名中位居第一,並相較於 RDBLearn 做出了關鍵改進。除了排名之外,TabPFN-Rel 也作為一個強大的基線,進一步佐證了將關聯式資料庫攤平為單一表格的做法,在真實世界的任務中仍可與專門的關聯式架構一較高下。 為了促進關聯式學習方法在研究與產業中的採用,我們發布了關聯式預測介面 RPI 的初始 α 版本。RPI 是一個開源、與模型無關的介面,讓早期採用者能夠輕鬆地在新資料庫上定義問題,並將 RelArena-α 中實作的任何模型(包括 TabPFN-Rel)應用於這些問題。
文字轉圖像(T2I)生成模型的快速演進已有效解決了原始像素合成這項基礎挑戰,使社群的研究焦點轉向滿足日益複雜的使用者需求。雖然近期的代理式影像生成工作流程透過外部知識檢索與迭代推理等先進能力增強了靜態推論,但它們大多在彼此孤立的環境中運作,採用固定的「一體適用」拓撲結構。這不可避免地導致嚴重的計算不匹配,即簡單查詢被迫通過計算密集的管線處理。為彌補此一差距,我們提出 GenRouter,這是首個統一代理式影像生成的工作流程路由框架。我們首先建構 GenCanvas,將多樣化的代理式管線標準化為一組通用的基礎原語與可執行模板。在此統一空間中運作的 GenRouter 透過(i)需求剖析、(ii)經驗匹配及(iii)Pareto 過濾,自適應地將異質提示路由至其最佳工作流程。跨多樣化基準的廣泛實驗表明,與重量級靜態管線相比,GenRouter 在實現卓越視覺對齊的同時,將執行成本降低超過 95%,延遲降低 65%。此外,該系統透過累積經驗持續自我進化,實現穩健的零樣本泛化能力,在提升效能的同時將計算開銷減半。
部件感知的3D物體生成對於圖形學應用至關重要,例如可控建模、編輯與關節化,其中物體被表示為語義部件的連貫組合。然而,現有的部件感知生成方法在高度複雜的物體上難以有效擴展。隨著部件數量的增加,生成精細幾何形狀在token長度和記憶體方面的成本變得高得令人卻步。我們提出MegaParts,這是一個可擴展的自迴歸3D生成框架,透過結合結構化序列建模與token高效的向量量化形狀tokenizer來應對這項挑戰。我們的tokenizer透過在高保真重建的約束下最小化token使用量,學習部件級幾何形狀的離散潛在表徵,從而實現基於幾何複雜度的自適應長度token化。在此緊湊表徵的基礎上,我們訓練一個大型語言模型,在統一的結構化序列中生成物體邊界框、部件邊界框和部件形狀token。結合高效的長上下文訓練策略,我們的token高效方案可擴展到具有多達300個部件、序列長度高達256k個token的物體。這大幅擴展了部件感知3D生成的規模,同時保留組合結構並實現細粒度的部件級控制。我們的方法在網格品質上優於基線自迴歸模型與擴散模型,顯示壓縮的離散部件token不僅提升了可擴展性,也提升了生成幾何形狀可達到的保真度。這些結果表明,LLM原生的token高效自迴歸建模是擴散模型在大規模部件感知3D生成方面一個有吸引力的替代方案。
由大型語言模型(LLMs)驅動的前沿代理系統展現出類似人類的認知模式。隨著這些系統在不同領域中深度融合,其認知參與對人類社會引發了尚未被充分研究的重大關切。為填補此一空白,我們依照一個由認知範圍界定的三層級框架,系統性分析認知能力擴展所引發的風險,範疇從物理認知、社會認知,乃至於最終的自我指涉認知。我們針對每個認知層級,研究其對人類能動性、自主性與控制能力的潛在風險。最後,我們提出策略以減輕這些風險,並增強代理式AI系統的可控性,確保其長期安全發展。
基於指令的通用影片編輯旨在於單一直觀介面中統一多樣化的編輯操作。現有方法通常依賴資源密集型的條件機制,或採用重量級分支,或採用高成本的來源串接。是否存在一種高效方式來建模編輯意圖?為此,我們提出 GRNEdit,一個輕量級兩階段框架。GRN 透過位元組合編碼視覺語義,啟發了我們的方法。透過任務特定微調,我們進一步將此表示延伸,並將編輯語義重新表述為針對個別位元的局部保留或翻轉決策。來源資訊因而被建模為支援觀測二元狀態的逐座標證據,而 GRN 主幹網路仍負責將這些證據的全局組合解析為一致的生成語義。在第一階段,一個緊湊的編碼器將離散來源碼轉換為連續證據訊號,GRN 在二元細化過程中將其整合。受無分類器引導中空提示訓練的啟發,我們進一步賦予空條件一種編輯特定的含義:空指令表示不編輯,並透過來源重建進行監督。這條恆等路徑不僅在第一階段隱式地增強了證據利用與內容保留,還產生了與編輯狀態處於同一表示空間中的來源保留狀態。因此,第二階段可直接比較每個編輯狀態與其對應的來源保留狀態,並利用兩者之間的差異來修訂尚未解決的目標位元決策。僅使用 0.6M 對訓練資料且條件參數少於 3% 的情況下,GRNEdit-2B 與 GRNEdit-8B 在 OpenVE-Bench 上分別達到 4.03 與 4.18 的分數。其中,2B 模型優於多個 14B 開源編輯器,而 8B 模型則與領先的開源編輯器表現相當。
前沿大型語言模型(LLM)的安全評估,長期以來大多將有害生成視為攻擊結果,而非分析對象。因此,我們對模型在行為異常時所產生的有害輸出知之甚少,部分原因在於難以取得大規模且高品質的前沿 LLM 異常行為資料。為填補此一缺口,我們提出 HarmProfile,這是一個以內容為中心的基準資料集,收集了跨越多種危害類別與模型家族之模型異常行為,並將由此產生的有害輸出分布定義為模型層級的風險輪廓。其前提在於:正如語言行為可從語料庫中的話語加以刻畫,模型風險也可由其安全失敗的內容、嚴重程度與變異來描述。HarmProfile 收錄了來自 23 個前沿 LLM、涵蓋 13 個模型家族、超過 80,000 個經驗證的產出,並組織為 15 個危害類別與 57 個子類別。利用此語料庫,我們發現前沿 LLM 確實會大規模產生有害內容,但同時展現出各自的風險輪廓;危害性與多樣性皆隨模型能力增強而增加,這顯示前沿 LLM 或許看似安全,但在其對齊表層之下,卻潛藏著日益危險的知識。我們的原始碼可在 https://github.com/fresh-ma/HarmProfile 取得。
隨著大型語言模型日益普及,部署開放權重模型的第三方供應商已成為生態系統的重要組成部分。因此,稽核其推論API的品質是一項開放性問題。我們將託管模型路由形式化為隨機過程,並提出\textbf{Ventor-QTest},一種無需目標API提供任何機率資訊的複合式黑箱稽核方法。其重複請求組件會將每個凍結的受約束語境多次發送至目標,根據返回的文字計數重建類別輸出分布,並以平均忠實度損失(AFL)作為虛無假設偏差校正的窗內平均粗化KL統計量。其長序列組件使用獨立運行,透過運行層級以參考分布為中心的驚訝度統計量的經驗上尾來報告極端忠實度損失(EFL)。在三種具備對數機率能力的路由條件下,AFL與由對數機率推導的粗化KL比較器呈現強烈的線性描述性一致性。在七個路由快照中,20次運行的序列探測揭示了路由特定的EFL變異。AFL與EFL與GPQA-Diamond準確率之間幾乎沒有可偵測的路由層級關聯。相反地,明顯的EFL伴隨著Terminal-Bench通過率在任務暴露度增加時的下降。此模式可能源於長時程任務的正確性對極端忠實度損失更為敏感。這些結果支持在稽核長時程代理型任務時聯合報告AFL與EFL。開源實作可於https://github.com/Tencent/AI-Infra-Guard/tree/main/services/api_checker/ventor_qtest取得。
目前關於矩陣乘法指數 ω 的最佳上界,是透過雷射方法的一項改良——稱為組合損失分析——所獲得(Duan et al., 2022; Williams et al., 2024; Alman et al., 2025)。在本文中,我們處理此方法核心的最佳化問題,並提出若干改進。首先,我們重新表述此最佳化問題,使我們能在比以往更廣泛的情境下求解。其次,我們利用機器學習的最新進展,為此問題設計了一個新的最佳化演算法。最後,我們使用 AlphaEvolve 對所得的最佳化演算法進行精煉。我們的綜合方法得出 ω < 2.371177 的上界,改善了先前的最佳上界 2.371339。
在認知科學中,資源理性探討智能體應如何分配有限的計算資源以最大化期望值。大多數推理與智能體基準採用獨立的每任務預算;現有的共享預算研究並未將套件表現與同一模型在單一問題上展現的能力進行校準。我們引入 R^3-Bench,在無工具與智能體設定中,針對數學、競賽程式設計與抽象推理,評估共享預算下的六問題套件。匹配的單一問題反應曲線根據觀測到的成功定義了離線經驗oracle。在六個模型的72個主表格單元中,oracle平均值在所有單元中達到或超過競賽平均值,其中71個單元嚴格更高。在中等無工具壓力下,等額分配重播在六個模型中有四個也超過競賽表現。軌跡診斷揭示了有限的策略更新與依賴壓力的失敗模式。在強智能體壓力下的三模型診斷中,至少一個固定調度器在九個單元中的六個超過競賽平均值,但沒有任何策略在所有領域中佔優。這些結果揭示了已展現能力與共享預算實現之間的持續差距。
自我演化代理能從互動經驗中改善未來行為,然而現有評估通常在固定執行條件下進行優化,且未測試條件改變後的恢復能力。為填補此缺口,我們提出 PACE-Bench(透過程式碼演化進行物理適應,Physics Adaptation via Code Evolution),一個以模擬器為基礎的基準測試,涵蓋六個物理領域中的144組源環境到目標環境適應任務對。每組任務對將源環境與具有相同目標和介面的變異目標環境相連結。在源環境中成功的程式碼驅動設計於目標環境中會失敗,代理必須在有限的嘗試預算內,利用診斷式沙盒回饋,迭代地將其改編為可行的目標設計。我們比較了來自四種典範的十種自我演化方法。該基準測試遠未飽和:Reflexion + Qwen3-14B 在完整基準測試中僅成功完成35.9%的任務對,而 GPT-5.5 在完整預算下僅解決了 Statics 子集的66.7%。綜合這些結果顯示,以模擬器為基礎的反思比未經驗證的自我修訂更可靠,而記憶會使代理錨定於早期設計,廣泛的樹狀搜尋則探索卻無法收斂。即使揭露確切的物理變化也未能提升效能上限,這表明機制重新設計而非參數推斷才是核心瓶頸。資料與程式碼可於 https://github.com/thunlp/PACE-Bench 取得。
儘管近年來統一多模態模型在多參考圖像生成方面取得了進展,現有的基準仍圍繞預定義任務類型(例如「主題組合」)進行組織,而這種方式並不適合此類組合設定,導致覆蓋範圍零散、複雜度不可控且診斷價值有限。鑒於多樣化的多參考任務共享一組共同的原子操作,我們採取以能力為導向的視角,並形式化定義四個算子:錨定(Anchor, f)、解耦(Disentangle, g)、應用(Apply, ⊕)與組合(Compose, C)。任何多參考提示詞皆可表示為這些算子上的組合公式,其結構複雜度以算子槽位數量進行量化。基於此形式化框架,我們建構了 TRACE-Bench,包含約 1,600 個評估案例,槽位數涵蓋 1 至 8,由 631 個公式模板與約 4,000 張涵蓋多種藝術風格及真實世界主體的參考圖像所構成。公式結構直接驅動了算子對齊的評估協議,以進行按能力評分,並透過診斷樹分析實現遞迴失敗定位。對 9 個領先模型的評估揭示出整體評分無法察覺的洞見:主要瓶頸在於解耦(g)與屬性綁定(⊕),而非場景級組合(C);即使是最佳模型,其屬性保真度得分也僅為 0.74。專案頁面:https://amuseum-whr.github.io/TraceBench
影片理解是評估多模態大型語言模型(MLLMs)能力的一項基本任務。然而,現有領先模型在Video-MME排行榜上已達到約90%的準確率,顯示傳統的單輪影片理解任務正逐漸趨於飽和,已不足以評估先進MLLMs的智慧程度。為此,我們提出VideoGAIA,一個專為通用人工智慧(AI)助理設計的智能體驅動影片理解基準。VideoGAIA跳脫一次性影片問答的框架,將影片理解建構為一個多輪、工具增強的互動過程:模型必須迭代式地感知影片內容、呼叫外部工具、蒐集互補資訊,並跨回合整合多模態證據。VideoGAIA包含271個由模型與人類共同設計的任務,涵蓋多樣且複雜的真實世界場景。每個影片-問題-答案實例均由三位人類專家獨立驗證,以確保其正確性與難度適切。所有受評的MLLMs,包括GPT-5.5與Kimi-K3等前沿模型,在VideoGAIA上的準確率均低於60%,凸顯其作為評估下一代MLLMs之高品質且具時效性基準的價值。我們期望VideoGAIA能促進由傳統影片理解向智能體驅動影片理解的過渡。
我們提出AnyTalk,一種新穎方法,用於為任意角色生成3D語音動畫,且無需任何動畫資料。現有的音訊驅動3D語音動畫方法依賴於特定角色的訓練資料或繁重的綁定/重新網格化,而AnyTalk透過利用在大型影片資料集上訓練的最新影片擴散模型繞過這些限制。我們首先透過角色特定微調技術(CsF)將預訓練的影片擴散模型適應到目標角色。藉由在3D角色的渲染影像與歸零的音訊嵌入(表示「無動作」)配對上進行微調,我們消除了對動畫資料的需求,同時保留了大型影片擴散模型的動作先驗。接著,我們透過所提出的最佳化過程估計混合變形(blendshape)參數,將生成的說話頭部影片提升為3D語音動畫。AnyTalk能夠在各種面部網格與混合變形配置上實現口型同步動畫,大幅減少手動工作量與資料需求。我們進一步將AnyTalk蒸餾為精簡網路AnyTalk_{RT},從而實現即時效能,提升其可用性。透過利用說話頭部影片生成技術,我們的方法擴大了任意角色對音訊驅動語音動畫技術的可及性。程式碼已公開於 https://serin-yoon.github.io/projects/anytalk/。
多模態大型語言模型日益使用視覺思維鏈(Visual CoT)來推理空間、時間與具身環境。透過生成中間推理圖像,Visual CoT 提供了直觀的視覺預見機制,但卻引入了大量的推論開銷,這在主動式影片推理中尤其造成問題。我們探討模型是否能在訓練期間學習視覺思考,同時在推論時直接進行推理。我們提出內化視覺思維(Internalized Visual Thinking, IVT),這是一個後訓練框架,在未標記影片上聯合優化文本預測與下一嵌入預測。給定部分觀測的影片,IVT 與目標文本答案一同預測未來幀的潛在表徵,促使模型捕捉運動、物體轉換、互動以及潛在意圖。在推論時,IVT 直接生成答案,無需合成或重新編碼未來幀。我們針對目標表徵、解碼器設計、預測時域、資料混合、訓練課程及預測目標進行了受控研究。IVT 在所有六種評估設定上均優於直接答案微調,同時保留了相同的推論路徑。與顯式 Visual CoT 相比,IVT 達到相當或更佳的效能,並將平均端到端延遲降低超過 5 倍。綜上所述,我們的研究結果表明,視覺思維鏈中所使用的推論時顯式像素空間生成,對於有效的主動式影片推理可能並非必要。預測性世界建模可以在訓練期間被內化,以產出既更準確又更高效的多模態推理器。
文檔解析旨在將非結構化文檔轉換為結構化且機器可讀的表示形式。近年來,視覺-語言模型(VLMs)的進展顯著推進了文檔解析技術的發展。然而,現有方法仍然面臨兩大挑戰。首先,基於解耦的視覺-語言模型方法高度依賴精確的版面分析,而相機拍攝文檔中的幾何變形可能引入級聯誤差。其次,儘管基於端到端的視覺-語言模型方法減輕了對顯式版面檢測的依賴,但它們在高解析度場景中常常存在冗餘生成、幻覺以及結構推理不足的問題。為應對這些挑戰,我們提出了 NaviDC-OCR,一個統一的文檔解析框架。NaviDC-OCR 引入了變形感知學習,將幾何感知融入視覺-語言模型中,並針對複雜版面表示提出了自適應採樣機制。此外,我們開發了一種內容-結構解耦學習策略,以顯式建模公式語法和表格結構,從而實現更有效的結構化表示學習。大量實驗表明,NaviDC-OCR 在多個文檔解析基準測試中均取得了最先進的性能。它在 OmniDocBench v1.6、Wild-OmniDocBench 和 PureDocBench 上分別獲得了 96.87、88.53 和 78.41 的總體得分,並在 ICDAR 2026 Sci-ImageMiner 挑戰賽中排名第一。這些結果驗證了 NaviDC-OCR 在複雜文檔解析場景中的有效性和泛化能力。
視覺文件檢索是多模態檢索增強生成的關鍵組成部分,旨在從文件集合中識別與查詢相關的頁面,而這些文件中的證據分佈於文字、版面、圖表及視覺結構之中。近期追求更細粒度監督的研究,主要依賴文字描述或局部視覺區域作為證據代理。然而,此類監督訊號可能忽略複雜的視覺結構,或對潛在證據提供不完整且不精確的表示。為了解決這些限制,我們提出了ConceptFormer,一種應用於視覺文件檢索的潛在概念表示學習框架。ConceptFormer將查詢相關的證據建模為連續的、查詢條件化的潛在概念,這些概念明確地橋接了局部視覺證據與語義相關性,既不需要文字中介表示,也無須直接依賴原始視覺註釋。在訓練期間,ConceptFormer利用強大的視覺語言模型動態決定潛在概念標記的數量,並將這些概念作為中間表示,以縮小查詢與文件之間的語義差距,從而引導嵌入空間的學習。在多樣化的視覺文件檢索基準上的實驗表明,相較於最強的視覺檢索基線與最強的基於OCR的文字檢索基線,ConceptFormer在平均NDCG@10上分別實現了16.7\%和22.1\%的相對提升。進一步的分析揭示,潛在概念能有效連接局部視覺證據與語義相關性,使檢索器在保持強大檢索對齊的同時,能捕捉細粒度的文字線索與複雜的文件級視覺結構。程式碼與資料可在 https://github.com/Neuir/ConceptFormer 取得。
企業問答被定義為檢索內部文件並生成有根據的答案。然而,常規企業記錄是工作副產品,其中所需的組織關係在不同異質來源之間仍然隱含。現有基準提供了真實的多來源證據,但往往實現預先定義的答案路徑,因此測試的是對陳述事實的組合,而非恢復語料庫中不存在的目標關係。我們將後一種能力稱為潛在組織推理。 我們介紹 ENTLORE,一個基於圖譜的基準構建框架,從常規文件、權威組織表和營運記錄中重建一個經稽核的企業世界。具版本管理的組織慣例在真實圖譜中認證推導出的關係,從而提供完整的黃金答案和證明憑證。對齊的匿名化發布僅公開文件語料庫,同時隱藏私有結構和目標關係。ENTLORE 包含來自三種來源類型的 2,341 份文件和 907 個問題,涵蓋明確查找、跨來源組合和潛在組織推理,並在 56 種模型和存取配置上進行評估。將發布的世界建構為誘導實體圖或可導航知識庫可帶來最強的可部署結果。然而,即使提供黃金文件,仍有 30.4% 的潛在問題未被回答,而明確問題和組合問題分別為 12.6% 和 6.2%。因此,企業問答不僅依賴於文件召回,還取決於隱含的組織關係是否變得可用。該基準、數據和程式碼已在 ENTLORE 公開。
自動化檢查流程越來越常將一個語言模型設置為檢查者,並將另一個(或同一個)模型設置為修復者。我們探討這種連接方式是否會改變檢查者所回報的內容。我們在當前任務保持逐位元組相同的情況下,針對經人工驗證為正確的 ProcessBench 追蹤紀錄測量誤報,結果發現:模型上下文中若已存在一段完整的「稽核→修復」過程,在全部 15 種模型×措辭組合中都會降低誤報,相對於長度匹配的非稽核對照組降低了 2.8 至 11.5 個百分點,即相較於該對照組減少 9% 至 25%。此方向與累積訊息文獻所預測的結果相反:當該過程中的稽核回報了錯誤時,誤報會進一步降低;在該操作能明確生效的模型上,五種措辭皆然,儘管負面性不對稱預期會有更多標記。將該過程分解後發現,修復內容與稽核判定具有互補性:不同組成部分在不同模型家族上發揮效果。訊號偵測分析將改變定位於閾值而非辨別力——判準在 15 種組合中全部移動,其中 13 種在校正後仍然成立,而 d' 則無一在校正後成立,儘管 d' 檢定在設計上敏感度僅為其一半。此外,對 50 個誤報的人工稽核發現,82% 純屬錯誤,因此在該操作點上,此改變未必有害。在啟用推理的情況下,該效果在所測試的兩個模型上均保持其相對大小,且閾值的解讀在該情況下同樣成立。
大型語言模型(LLMs)日益被用作合成調查受訪者,但現有的評估僅在個體層面檢視答案是否看似合理。我們主張正確的問題應是心理測量學層面的:LLMs 是否保留了真實人類調查資料的聯合分布、潛在結構、信度、中介路徑及人口統計效應?我們引入一個立陶宛組織心理學資料集(n=263 名員工;包含 Dunham 變革態度量表、UWES-17、Koopmans IWPQ;共 68 題、12 個分量表),並在五級人物揭露階梯、呈現方式與推理努力度的消融實驗、反事實人口統計交換(性別、角色、教育程度)、跨語言檢核,以及逐字回憶記憶探測等條件下,讓橫跨 OpenAI、Anthropic、Google 及十二個開放權重系列的 37 個模型陣容基於真實受訪者輪廓進行作答。由此產生的心理測量相似度分數(PSS)以五個非 LLM 統計基線及一個保留的人類對人類上限為錨點,並使用受訪者自助抽樣法計算信賴區間,以及針對 Tucker's phi 的項目排列虛無假設檢定。LLMs 能再現人類心理測量關係的定性方向,但高斯連結函數基線在樣本驅動的 PSS 成分上擊敗所有 LLM;LLM「群體」彼此之間的相似度(平均 LLM 間 PSS 為 0.73)高於其與人類的相似度;而記憶效應並非驅動排行榜的因素(回憶-PSS 等級相關係數為 0.00)。反事實交換顯示教育程度驅動的效應(平均 |d|=0.56)遠大於性別(0.12)與角色(0.18);在 UWES 上,37 個模型中有 8 個的 Tucker's phi 落在排列虛無假設的區間內。在下游應用中,每個 LLM 都表現出強烈的默許偏差(+0.84 個標準差),以合成資料訓練的迴歸模型在保留的人類樣本上喪失預測效度(平均 R^2 從 0.28 降至 -0.18),且模型在 10 條安慰劑中介路徑中的 3 條上捏造出間接效應。LLM 樣本不能直接替代人類調查資料。
在收集作業中,累積的載重會逐漸降低車輛速度,對路線規劃效率造成累積性懲罰。車上搭載的無人機可透過取回偏遠物品來抵銷此懲罰,進而縮短總完工時間並提高營運利潤。然而,行駛時間仍取決於載重,且地面車輛每收集一件物品,都會改變決定無人機發射點與會合點的到達時間。本文提出「帶無人機的旅行竊賊問題」(Travelling Thief Problem with Drone, TTP-D),在扣除按時間計費的租賃成本後最大化收集利潤,並同時最佳化物品選擇、車輛路線規劃與飛行同步。我們建構了一個混合整數線性規劃,可將小規模實例求解至最佳;同時針對較大規模實例,分別開發了元啟發式演算法與基於注意力機制的深度強化學習(DRL)策略。我們進一步提出一個學習器初始化的混合求解器,由 DRL 策略建構初始解,再以短暫的退火流程進行細部改良。在兩組基準測試集上,此混合求解器能以一小部分的計算預算恢復元啟發式基線的大部分解品質,儘管最大規模的實例仍需基線方法以完整預算執行。最後,敏感性分析顯示,租賃比率是獲利能力的主要驅動因素,而車隊參數僅在邊際上影響利潤。
語言模型以一種它們可報告的形式持有潛在量;當任務需要靈活重用某個量時,更多的該量以這種形式存在。導致表徵進入該形式的原因仍無定論,而「工作空間」一詞引出一個准入的敘事:一個決定何者進入的閘門。我們在開放權重模型上,利用雅可比透鏡,在一個五個分支共享相同上下文的基準上檢驗這個假設,結果在它預測有閘門之處並未發現閘門。需求會將一個概念的透鏡可見性提升至超過對所提供值施加算子所產生的可見性:在我們的主要檢查點上,百分位排名提升 +0.050 [+0.045, +0.057],且在我們測量的全部四個檢查點上均為正,儘管該分支的回答已達上限,而在該讀出下,準確度匹配的對照更強。同時,一個共享的線性映射可從每個分支(包括對照組)解碼該變量,其水平為選擇校正後下限的 6.4–9.0 倍。在被查詢位置產生後續可讀形式的,是中等深度窗口內由注意力中介的匯聚:將補丁深度與讀出深度分離後,在非飽和讀出下,該處的傳輸至少比任何更淺處高出 17 倍,而窗口內所有受測的多層感知機輸出均無正向貢獻。在飽和的百分位排名下,同一網格無法定位該窗口;這是該度量本身的事實。一個完全不需要該變量的分支,其匯聚量低至七分之一,因此該窗口具有需求特異性。該窗口有兩個經測量的邊界:下方是存活失敗,上方是破壞;在一個 64 層混合模型與來自另一家族的 62 層稠密模型中,它落在相同的相對深度。我們定位的是變量被安裝與被讀取的位置,而不是來自段落的路徑——該路徑不傳輸任何東西。但該讀出並非校準的使用度量:三個成分的讀出值彼此相差在 12% 以內,但它們對答案的實際作用卻相差 7.4 倍。
隨著AI資料中心汰換仍具功能的GPU,大量效能尚可的加速器進入二手市場。本文探討這些退役GPU是否能找到具生產力的第二生命,形成可服務現代LLM推論的「垃圾場叢集」(DumpsterCluster),以及在何種條件下此類再利用在經濟上可行且環境上可永續。我們從零開始僅使用二手零件實際建構了一個128-GPU的DumpsterCluster,並運行了整整一年。以當前市場價格而言(DumpsterCluster約2.2萬美元,相較於8-GPU B200系統的60萬美元),其經濟優勢相當可觀。透過管線平行(pipeline-parallel)最佳化,我們以V100為基礎的DumpsterCluster在LLaMA-70B推論吞吐量上達到具競爭力的表現,驗證了實際生產應用的可行性。然而,我們的部署揭示了關鍵的脈絡依賴性。較舊世代的GPU每個token消耗顯著更多的能源,使得總擁有成本僅在電價低廉的地區才具優勢。在電網平均碳強度下,二手系統在8B模型上每token產生的總碳排放量約為當前世代硬體的4倍,在70B模型上更高達40倍以上。這些發現顯示GPU的第二生命並非普遍可永續——硬體再利用必須與低碳能源策略性地結合。當部署在能源經濟效益良好且電力潔淨的地區時,二手GPU提供了擴展AI算力的可行途徑,同時促進可負擔性、能源安全與環境責任。
逐欄位接受/審查,且選擇性風險至多為 alpha——唯有在已接受欄位中的錯誤率受控時才接受某欄位——是文件擷取系統所需的信任契約,而自然程序在真實文件上會靜默違反此契約。在來自 800 份 CORD 收據的 13,859 個真實 claude-sonnet-5 欄位(正確率 49.0%)上,我們診斷出三種失敗模式:文件聚類(設計效應 1.84–2.45)、分數重擬洩漏(風險 0.127 時覆蓋率 0.416,在 95% 的分割中違反 alpha=0.10),以及同分聚集病態(退化分數使閾值網格從 0.030 坍縮至 0.001)。我們將修正措施組織為有效性階梯,並按層級說明保證形式。擬合/驗證分割協議可恢復學習式融合的期望選擇性風險控制:在名義 alpha=0.10 下,風險 0.096、覆蓋率 0.318,無容忍帶(生產變體為 0.326)——這是一個平均意義上的操作點,在 47.5% 的重新分割中其實現風險超過 alpha,並非保證書。使用精確二項尾端的 Mondrian Learn-then-Test 可產生每組 PAC 保證書:欄位 iid 為風險 0.068 時覆蓋率 0.171,聚類校正為 0.140,文件 iid 為 0.060——這是唯一與文件特性相符的層級,但誠實而言目前近乎空洞。預先指定的來源分類法 Support-bin 在 sonnet CORD 資料集上贏得所有嚴格度層級(p<1e-4,Bonferroni 校正)——但此勝出在相同文件上使用 haiku 或 qwen 時無法重現——而在較高正確率的語料庫上,合併閾值勝出:條件化恰好有助於合併法無法提供保證之處,而在其他地方則被學習式分數所涵蓋。在未經選擇程序觸及的 claude-haiku-4-5 上進行凍結配置確認,在兩種風險水準下均成立;一項由三位標註者進行的盲式人工金標準稽核驗證實務層級接受集合的風險為 1.3%,相對於其 10% 的預算(Fleiss' kappa=0.83;標籤錯誤單側偏於悲觀)。以 Apache-2.0 授權釋出,並搭載種子固定與回歸測試把關的程序。
基於大型語言模型的智能體日益被部署為科學發現中的協作者,然而目前大多數研究聚焦於「AI科學家」的自主能力。我們主張,這種觀點忽略了科學團隊合作的社會層面,而將AI科學家視為人類-智能體系統(HAS)——其分析單位為人類-智能體對——來研究,既未得到充分探索,也未受到足夠重視。我們透過文獻與實證分析確立上述觀點,並強調近期的實例與研究顯示,在科學中部署智能體而不將人類-智能體動態納入考量,會帶來近期風險,包括科學探究多樣性的降低。透過對真實世界案例研究的分析,我們顯示科學家與智能體能夠相互增強彼此的能力。我們呼籲採用HAS視角進行新的研究,以建立數學框架,來理解並促進科學發現中的人類-AI協同。
動作語言模型(MoLMs)通常透過將3D動作進行token化,並使用語言模型處理所得的token來理解人類動作。然而,從單目影片中獲取精確的3D動作具有挑戰性,限制了其在現實世界中的適用性。為了解決此問題,我們引入了一個即插即用的2D動作介面,使預訓練於3D的MoLMs能夠接受2D動作輸入,而無需修改或微調原始模型。在公開資料集上的實驗表明,我們的方法在多個MoLMs上實現了與3D動作輸入相當的性能,並且優於在2D動作上從頭訓練的MoLMs。我們進一步構建了一個單目真實世界影片動作評估資料集,並引入了一個真實影片適配器,證明了在所評估的單目姿態估計設定下,2D動作相較於3D動作的實用性。這些結果表明,2D動作為在現實世界的動作理解場景中部署MoLMs提供了一個實用的介面。程式碼可在 https://github.com/irajisamurai/2D-Motion-Interface 取得。
學習生成或重建可探索的世界,需要將影片與超越 RGB 的更多訊號配對:相機運動、場景幾何、時間對應,以及針對互動模型的控制訊號。真實拍攝能提供其中部分訊號,但稠密幾何與長距離對應通常依賴估計或專門儀器。渲染能直接提供這些量,但現有的合成資源很少在同一幀上將它們結合,同時又支援對視角與外觀的受控變化。我們提出 WorldRover,這是一個資料引擎,用於生成對藝術家建構環境進行豐富標註的長距離探索。其核心 WorldRover-Engine 是一套 Unreal Engine 管線,可執行並離線渲染分鐘級的路徑,同時保留完整的軌跡與場景幾何。相同的探索可從第一人稱、第三人稱及 360 度全景相機,在不同的環境狀態下重播。利用 WorldRover-Engine,我們建構了 WorldRover-10M,其序列在每次探索中將 RGB 與公制深度、相機軌跡,以及由軌跡推導的動作訊號配對。第三人稱子集額外提供稠密光流、具有可見性的長距離 2D/3D 點軌跡,以及不同於相機軌跡的角色軌跡。該引擎能從第一人稱、第三人稱及 360 度全景視點渲染一次遍歷,可在不同的環境狀態下或使用中性白色材質,同時保留路徑與場景幾何。因此,WorldRover 將長程的世界探索轉化為一個可擴展的資料生成問題,為必須建構、維護並重新檢視可探索世界之連貫表徵的模型提供監督。
選擇題基準被廣泛用於評估大型語言模型,但選擇題分數將知識與對選項順序的敏感性混為一談,使其成為模型知識不可靠的衡量指標。在本文中,我們測試在模型作出選擇時防止其看到選項標籤,是否能去除位置影響,進而提升表現。我們評估了兩種減輕偏差的不同策略。第一種採用先生成後匹配的方法,第二種則單獨對選項評分,這種方法在設計上即無位置偏差。兩者都無法可靠地提升準確度。完整的分解分析顯示,瓶頸在於隱藏選項,而非匹配步驟。唯一能持續與基線相符的配置,是向模型展示所有選項並搭配 LLM 匹配器的配置。然而,完全消除位置影響仍然無法可靠地帶來準確度提升,而循環排列則經常能提升準確度。對於兩階段提示,召回率不平衡的總體指標以及每個問題順序敏感度的直接指標,都無法顯示可靠的去偏效果。
檢索增強生成(Retrieval-augmented generation, RAG)在增強大型語言模型方面不可或缺。然而,RAG 系統日益容易受到投毒攻擊,此類攻擊透過注入對抗性文件來操控生成器的輸出。先前的方法依賴輸出端訊號(如困惑度與一致性檢查)來偵測此類攻擊。然而,我們的分析顯示,蓄意攻擊常會誘發虛假信心,使受污染的輸出表現出比良性輸出更低的困惑度,導致基於不確定性的偵測失效。為應對此挑戰,我們探討生成器的內部動態,並識別出一種稱為「注意力崩潰」(Attention Collapse)的獨特特徵。與良性生成中注意力分散不同,受攻擊生成在注意力集中於受污染文件時會表現出熵的下降。基於這些發現,我們提出 D-SCAN(文件層級訊號崩潰分析,Document-level Signal Collapse Analysis),這是一個輕量級的偵測框架,透過監控注意力動態來識別受攻擊的生成。在多個攻擊基準上的大量實驗證明了我們方法的有效性。此外,即使攻擊未能改變最終答案,D-SCAN 也能偵測到此類攻擊。程式碼可於 https://github.com/yingtaoren/D-Scan.git 取得。
邊界表示(B-Rep)生成是計算機輔助設計中的一項基本任務,然而直接合成高保真度且結構有效的B-Rep仍然是一項重大挑戰。現有的深度生成方法存在兩種脆弱性:表示脆弱性,源於潛在空間中的填充噪聲與特徵污染;以及生成脆弱性,源於序列誤差傳播以及因不可微分的有效性約束而導致的訓練-推理不匹配。我們提出HiFi-BRep,一種新穎框架,通過兩項協同貢獻解決上述局限。首先,拓撲感知編碼器通過可學習查詢消除填充,並利用拓撲引導的注意力機制防止特徵污染,從而構建高保真度的潛在表示。其次,單階段解碼器同時並行預測幾何與拓撲,並將核心流形約束嵌入為可微分的學習目標。該設計確保幾何與拓撲之間的相互引導,同時避免級聯誤差。大量實驗表明,HiFi-BRep在結構有效性和幾何保真度方面均顯著優於最先進的方法,為高質量的B-Rep合成提供了穩健的解決方案。程式碼與模型公開於 https://github.com/1nnoh/HiFi-BRep。
串流影片理解要求直接從正在展開的影片之因果觀測前綴產生回應。現有系統加入推論時記憶、檢索與壓縮,然而一個無訓練的滑動視窗基準已經能與之匹敵。因此,我們固定一個無記憶的近期視窗協議,並探討僅靠後訓練能達到何種程度。具有可驗證獎勵的強化學習並不適合此設定,因為它會鼓勵產生冗長的「先思考、後回答」內容;而同策略蒸餾(OPD)能在學生軌跡上提供密集的 token 層級教師監督,但僅在兩個模型都以思考模式訓練時才穩定。這些觀察促成了 StreamOPD,一種結合可驗證串流影片資料、思考模式 OPD 與指令模式部署的方法。它將 StreamingBench 從 77.9% 提升至 83.9%——與 9B 教師模型相差不到 0.3 個百分點——並在不改變推論設定的情況下,將排除幻覺檢測子任務(HLD)後的 OVO-Bench 提升了 9.1 個百分點。作為教師特權的延伸,時空線索閘門(ST-CueGate)將「有線索相對於無線索」的教師似然比彙整為群體相對反應評分,用以重新加權 OPD。它在 OVO-Bench(排除 HLD)上達到 71.9%,在 Video-MME 上達到 64.9%,並且是唯一在所有四個基準上均維持在基礎模型之上的變體。將教師替換為學生初始策略的凍結副本——即同策略自我蒸餾——可保留大部分這些收益,並將 HLD 提升至 57.0%,高於未訓練的學生與 9B 教師,因此棄權損失並非此方法所固有。我們為開源串流影片研究提供了透明且可重現的參考。
音訊-文本基礎模型(ATMs)在嚴重的聲學噪聲下會災難性地失效。然而,現有的適應策略要麼依賴於基於梯度的測試時適應(TTA),此類方法強化的是噪聲而非訊號;要麼依賴於提示調整,但後者需要推論時無法取得的特權噪聲標註。我們透過PRISM(原型校正迭代自監督流形去噪)來應對這些失效。PRISM是一個免訓練、無需來源數據的TTA框架,其基礎是仿射噪聲假說:嚴重的聲學噪聲會在多模態潛在空間中引起低秩仿射偏移,且超過90%的失真能量集中於前60個主成分。PRISM以凍結的文字原型作為幾何錨點,透過仿射偏差回歸將三個閉式幾何校正整合為單一靜態投影矩陣,從而從未標記的目標批次中估計並逆轉此失真。在推論時,適應過程簡化為一次矩陣-向量乘法,耗時0.0009毫秒,因此遠快於基於梯度的TTA,且無需額外訓練。在UrbanSound8K上,PRISM比零樣本基線提升12.94個百分點,並超越具神諭輔助的TTA基線9.41個百分點,儘管它從未觀察過該基線的特權增強噪聲提示。我們進一步識別了複音陷阱,這是子空間縮減對寬頻類別的一種具原理性的失效模式,並透過置信度感知回歸(CAR)加以解決,為受影響最嚴重的類別恢復多達8.16個百分點。