每日精選AI研究論文及翻譯
我們引入「語義任務完成影片生成」這項以成果為導向的影片生成任務。在此架構下,成功需要同時達成預期結果與語義對應。語義對應描述了參考影像與生成結果之間,就任務相關的高層次語義而言的對應關係。評估重點在於生成的結果,既不需要呈現完整的逐步中間任務過程,也不要求與參考影像具備傳統的外觀一致性。為了支持系統性評估,我們建構了 SemComp-Data,一個涵蓋六個領域的評估資料集。每個實例包含一張參考影像、一份詳細指令、一份簡短指令,以及一段以成果為中心的影片片段。一個可擴展的四階段篩選管線將原始影片轉換為標準化的 SemComp-Data 實例。我們進一步引入 SemComp-Bench,這是一套評估協議,利用視覺語言模型(VLM)回答結構化的二元問題。SemComp-Bench 分別報告 OA 分數與 GR 分數,對應結果達成度與生成可靠性。在具代表性的影片生成模型上的實驗顯示,要在維持參考影像中與任務相關的語義對應的同時達成預期結果,仍然具有挑戰性。
具身智能體越來越常被用來填補端到端策略模型所留下的缺口。然而,智能體路徑尚未在物理執行中實現閉環學習:現有的框架在很大程度上仍屬開環,在執行期間遵循固定技能,僅在一個回合結束後進行反思。這種事後反思無法在執行展開的過程中進行調控,因為物理交互要求決策能夠以超越當今大型智能體模型的頻率,追蹤快速變化的機器人-環境狀態。我們提出Zetta,一個閉環具身框架,在保持基礎策略凍結的同時,線上演化基於程式碼的運行時評判器與復原技能。透過三個時間尺度分離的迴路,Zetta提供動作頻率調控、回合級評判-復原提案,以及驗證門控的技能更新。結合Z-Infra(一個將智能體邏輯與異構執行資源解耦的執行基礎設施),Zetta在我們當前的執行預算下於LIBERO-Pro和RoboCasa上達到了當前最優的成功率,分別達到90.8%和93.6%,並實現11.1倍的推理加速;成功率持續隨自我探索經驗而擴展;學習到的技能可零樣本遷移,並湧現出清晰的機器人「頓悟時刻」。這些結果表明,閉環框架的自我演化為可靠物理智能開闢了一條擴展路徑。
可程式邏輯控制器(PLC)驅動工業廠房,而大型語言模型已能為其生成獨立的程式組織單元(POU)。然而,此類邏輯是否能整合至既有 PLC 專案並正確運行,目前僅在有限的測試中受到檢驗。我們提出 SemaPLC:一個以專案為根基、以驗證為閘控的代理程式框架;它由既有工具組裝而成,但受嚴格的完成規則所支配。SemaPLC 不會在模型自認輸出已足夠時停止,而是僅在記錄的外部檢查確認後才宣告任務完成。這些檢查涵蓋規格、編譯,以及即時執行環境中的行為。在符合既有基準的 117 項獨立 POU 任務中,SemaPLC 於全部七個模型上達到最高的嚴格驗證通過率(平均值 72.6%)。在包含 65 項任務的專案情境軌道中(其生成的邏輯必須在真實專案內編譯並運行),SemaPLC 在整合編譯、靜態行為與動態行為上均取得最高平均值。三層之中,動態行為最具啟發性。我們將生成的邏輯與參考邏輯部署至即時 PLC 執行環境,並比較其執行軌跡,藉此加以衡量。所有方法的靜態分數彼此差距在 10 分以內;相反地,動態分數則將它們明顯區隔開來:各基準方法介於 22.4 至 31.4 分,而 SemaPLC 為 52.2 分。整體而言,我們的驗證閘控框架在各層級均提升平均值,且在執行階段提升最為顯著。實際執行而非靜態評分,才是檢驗所生成控制邏輯是否真正可行的可靠測試。SemaPLC 已開源於 https://github.com/midea-ai/SemaPLC。
強化學習(RL)已成為提升語言與視覺語言模型推理能力的強大方法,然而其最顯著的成功仍高度依賴於真實標籤監督(例如可驗證獎勵)。此類標註取得成本高昂,且隨著推理能力進展到人類難以可靠評估的程度,這類標註日益稀缺。自我獎勵強化學習透過讓模型從自身生成結果中推導獎勵訊號,降低了這種依賴。然而,僅依賴自我生成反饋進行訓練,可能強化既有偏見與次佳行為、降低回應多樣性,最終導致回應同質化與訓練崩潰。在本工作中,我們展示無監督推理可透過合作式多智能體訓練而湧現。我們提出 Co-RL 框架,其中多個不共享參數的解耦模型,利用來自同儕模型的獎勵,透過 RL 同時進行最佳化。我們進一步證明,透過異質模型家族、不同規模以及改寫後的訓練樣本提升群體多樣性,可減少驅動自我強化反饋迴圈的相關誤差。這種多樣性持續提升推理效能、維持行為多樣性,並減緩訓練崩潰。在純文字與多模態領域中,Co-RL 始終優於基礎模型與先前的無標籤方法,同時在無法取得任何真實標籤的情況下,達到或超越監督式方法的表現。具體而言,Co-RL 在 LLM 的七個純文字基準上平均提升 3.0-8.6%,在 VLM 的四個多模態基準上平均提升 2.3-7.2%。程式碼已公開於 https://github.com/DrStranded/Co-RL。
近期基礎模型的進展使人工智慧科學家能夠自動化日益完整的研究流程,從假說生成、程式碼執行到稿件準備。然而,僅有流程涵蓋範圍並無法讓代理取得科學發現所依賴的完整證據。現有系統通常僅基於文字、程式碼、標籤或預計算摘要進行推理,使得具有科學決定性的空間、時間、跨通道及程序關係無法被代理取得。我們提出 OmniScientist,一個端對端、全模態的人工智慧科學家,可直接從異質原始證據進行跨學科研究。感知層與三個分別負責構思、實驗與撰寫的自主代理在確定性流程中運作,使觀察能在整個研究生命週期中塑造研究問題、實驗決策與最終主張。透過以程式碼執行構思、嚴謹性與主張檢查,系統強制進行新穎性篩查、統計有效性、執行溯源與數值可追溯性。我們在涵蓋5個學科類別、4類科學證據以及包括影像、訊號、音訊、影片、3D結構、軌跡、表格、公式與圖形等模態的36個真實資料案例上評估 OmniScientist。該系統在所有36個案例中完成從原始資料到編譯稿件的完整路徑,並在參考推理主幹下獲得平均論文總分6.3。在與僅接收預計算標量特徵的盲測變體進行配對比較時,直接感知在所有7個評估維度上均有提升,並在85%的兩兩比較判斷中勝出。這些結果顯示,全生命週期感知對於基於證據的科學發現至關重要,並為實現廣泛能力的人工智慧科學家提供了切實可行的途徑。
持續自我改進需要不斷擴大的自我生成、多樣化且自適應的目標池。對於語言代理而言,現有的訓練環境池(人工精心策劃、靜態合成或凍結驗證器)在學習者規模擴大時,會使目標分布保持固定。我們提出 SPADE(自適應合成可執行環境中的自對弈),這是一個自對弈強化學習框架,其中單一大型語言模型扮演兩個角色:一個環境設計器,負責將完整、長視野的訓練環境編寫為具有 OpenAI Gym 風格 reset()/step() 介面的可執行代碼;以及一個推理代理,負責學習在這些環境中行動。每個環境都是具狀態的多輪環境(包含狀態轉換、獎勵函數和驗證代碼),因此單一介面即可涵蓋推理問題與多步驟代理型工具使用。推理代理的遺憾值透過其在有無特權提示情況下的獎勵差距來估計;在優化此遺憾信號的過程中,環境設計器學會針對代理能力邊緣的環境進行設計,同時保持這些環境的可行性。透過大量實驗,我們發現幾個對成功至關重要的組件:將環境設計器基於從大型預訓練語料庫中採樣的文件進行接地,並賦予其累積的環境記憶。將模型擴展至 300 億參數時,SPADE 在八個留出的數學、科學、代碼和推理基準上,平均比最強的固定環境基線提高 5.3;在工具使用設置上,於 BFCL-v4 多輪基準提升 5.7,於 ACEBench-Agent 提升 13.9;在遊戲設置中,與最強基線的差距隨模型規模增大而擴大。透過使環境設計本身成為可學習的組件,SPADE 向開放式自我改進邁出了具體的一步。
單步逆合成是電腦輔助合成規劃的核心組成部分,然而其本質上「一對多」的特性卻難以透過單一答案的評估與基準測試協議來充分呈現。為了解決此問題,我們引入Top-K提示作為一種穩健的訓練與推論範式,以更全面地捕捉多樣且合理的反應預測。我們彙編了CREED-CCV-2+USPTO-XL,這是一個包含約4,560萬條已驗證反應的超大規模資料集,用以訓練C3LM(化學約束一致語言模型)。透過將微調與基於ChemCensor及新穎性導向的獎勵機制相結合,我們的模型在OOD URSA-expert-2026基準上達到了最先進的效能。對反應唯一性的進一步分析顯示,大型語言模型與傳統模型探索了互補的反應空間,這為基於集成方法的逆合成系統提供了動機。整體而言,我們的結果確立了Top-K、具合理性感知的訓練作為未來穩健的基於大型語言模型之合成規劃的實用新方向。
開放權重的語言模型經常被微調、量化、剪枝與合併,但其來源往往缺乏文件記錄。我們研究無資料白箱血統驗證:權重本身能否揭示兩個相容的模型檢查點是否共享祖先? 殘差訓練會在分支產物中產生共享的恆等對齊分量,因此單憑此結構無法確立祖先關係。我們移除該分量並比較各殘差區塊中檢查點特有的結構,產出一個對獨立檢查點校準的對稱血統分數。在殘差MLP與GPT-2基準上,該分數能將微調、LoRA合併、剪枝與量化後的後代模型與獨立模型及蒸餾模型區分開來(AUROC=1.0),從而區分權重祖先關係與行為相似性。在保留函數的檢查點洗白實驗中,權重空間基線喪失區分度或完全失效;我們的分數保持不變,且在GPT-2上的運算速度比最穩健的近鄰基線快76倍。投影配對訊號出現在六個語言模型家族及其他模型中,一項案例研究正確識別了3個相關與7個無關的LLaMA-2公開檢查點。整體而言,這些結果為相容的開放權重語言模型檢查點建立了被動、無資料的來源追溯訊號。
JEPA 風格的潛在世界模型可以將到目標潛在表徵的歐氏距離用作模型預測控制(MPC)的成本。然而,對任務變數的強大解碼並不能保證此特定成本能依據真實任務進展對候選動作序列進行排序。我們將後者性質稱為決策-度量對齊。我們引入了 Plan-Real Spearman,用於衡量隨機計畫上潛在與真實排序之間的一致性;以及 CEM-stage Spearman,用於衡量當交叉熵法(CEM)搜尋集中其提議時,同一種一致性的表現。我們分析了潛在距離在何種充分條件下能保持真實成本排序,並指出編碼器失真、終端展開誤差與候選邊際為主要控制因素。在觀察到的經驗對齊差距引導下,DA-LeWM 以逆向動力學與示範條件化目標-動作頭增強了 LeWM。在我們所有的實驗中,DA-LeWM 加速了收斂,並在線上成功率上高於 LeWM,同時探測分數保持相似。這些結果表明,動作條件化目標改善了基於歐氏成本與 CEM 的潛在 MPC 所使用的幾何結構。
循環語言模型在推理基準上已展現出令人鼓舞的成果,然而其在智能體工具使用方面的潛力仍 largely 未被探索。我們在組合式工具呼叫的情境中研究此問題;在該情境下,模型必須協調多個 API 呼叫、維護中間狀態,並在工具互動之間保持依賴關係。我們針對 API-Bank、BFCL 與 NESTful 評估原生及改造的循環語言模型,比較在配對監督式微調設定及推論時不同循環深度下訓練的循環與非循環模型。在受控實驗中,循環計算通常有益於組合式及依賴感知的工具使用,而在單獨 API 呼叫上則提供較小且更依賴模型的增益。多步驟工具使用的準確度通常隨循環深度增加而提升;然而,自適應推論透過僅在需要時分配額外計算,達成更有利的計算-效能權衡。我們的結果表明,循環語言模型是適用於需要可靠規劃、協調及執行組合式工具使用工作流程之智能體系統的具有前景的架構。
在預訓練期間,常見事實被記憶得更深入,且比稀有事實更難被移除;然而現有的LLM遺忘方法無論訓練資料頻率如何,都施加統一的梯度壓力。我們提出AdaPop(自適應流行度)方法,該方法結合局部詞元置信度與從外部代理(例如維基數據站點連結、LLM作為評審)推導出的依事實流行度而定的指數,並透過對偶上升控制器自動調整遺忘-保留平衡,該控制器每個epoch調整保留懲罰。在三個模型家族和兩個基準測試中,AdaPop在改寫查詢下洩漏的已遺忘內容比競爭方法少約5倍,在對抗性重構下少約1.6倍。我們以內部指標支持我們的分析:在我們的方法下,遺忘集的隱藏狀態比在其他方法下更遠離遺忘前模型的狀態,而保留集的表徵則與遺忘前模型的狀態保持接近。
高品質的創意寫作數據對於大型語言模型(LLMs)而言,仍以故事為中心的數據為主,這限制了模型遵循多樣化創意格式之結構與功能慣例的能力。我們提出一個屬性引導的體裁擴展框架,用以將創意寫作數據擴展至故事生成之外。透過將主題廣度與體裁形式控制分離,我們的框架利用人工撰寫的故事提示作為多樣化的創意種子,同時運用人工策劃的體裁屬性,以確保其遵循獨特的結構、文體與格式規範。我們將這些元素結合,提示強大的LLMs生成符合體裁的查詢-回應對,再經由品質過濾。應用此框架,我們建構了多體裁合集(Multi-Genre Collection),一個包含5萬條示例的語料庫,涵蓋13種創意體裁,包括故事、饒舌、歌詞、劇本、遊戲設計、角色設計及其他創意格式。在分佈外寫作基準與保留體裁診斷上的實驗顯示,在我們數據上微調的模型不僅持續超越基礎模型與寫作專用基線,也勝過在現有寫作語料庫上訓練的模型。體裁數量的消融實驗進一步指出,受控的體裁擴展——而非僅以故事為中心的擴展——是穩健創意寫作能力的關鍵驅動因素。
語言模型代理目前能可靠地執行有限任務。然而,它們能否在長時間跨度中維持有效決策——在這種情境下,行動具有累積性後果,且環境會對其選擇做出回應——在很大程度上仍未被測量。FM-Bench(足球管理基準)正是用於衡量此能力。一個LLM代理透過26種工具及約340至400個決策節點,經營一家足球俱樂部達20個遊戲內賽季。它以與所有對手相同的預算組建陣容、交易球員、協商合約、投資設施與青訓、設定先發陣容,並向可將其解僱的董事會負責;與此同時,一個確定性引擎逐年累積所有結果,最終形成單一最終分數,全程無需LLM裁判或人類評分員。單人賽道讓15個前沿模型各自對抗一個固定腳本化世界,而競技場則將相同模型加上一個腳本化錨點置於同一個共享的20年世界之中;據我們所知,這是此規模下首次的正面對決評估。 我們衡量了分數背後六項行為能力。在三個隨機種子下,所有15個模型均完成每個時間跨度,而盲目腳本化基線則在它們的大多數時間跨度中消亡;claude-fable-5在平均分數上位居單人賽道榜首,亦在競技場奪冠,儘管冠軍頭銜在競技場中仍輪流落在十個模型之間。規模、價格或供應商均無法預測排名;排名要到時間跨度後期才趨於穩定,且最佳的人類首秀玩家僅落在模型排行榜末位。區分各模型的關鍵在於管理行為而非計算能力。得分較高的模型會在接近尾聲時減少延遲回報投資、保持資金持續投入而非閒置,並在截止日期前及早開啟續約;而Token消耗則無法預測任何結果。沒有任何模型能從數百次被拒絕的出價中學會市場的隱藏價格,而自我管理記憶則以兩種相反的模式失效:檔案庫只增不減,或計劃每賽季被重寫。程式碼可於 https://github.com/Analogy-AI/fm-bench 取得。
物理互動品質對於可變形物體操作至關重要,然而多數基準僅以任務成功與否作為評估標準。策略可能在容許滑移或造成過度擠壓的情況下完成任務。其主要瓶頸在於缺乏將策略可觀測的接觸觀測與完整任務過程中的獨立物理真實基準相互配對的視觸覺資料集。我們提出 SoftVTBench,一個針對物理互動感知之可變形物體操作所設計的視觸覺資料集。該資料集包含 4,000 筆專家示範及超過 50 個資產,涵蓋體積可變形物體與視覺匹配的剛體孿生。在 20 Hz 的頻率下,每個回合同步記錄多視角 RGB、雙指觸覺 RGB 與標記運動、本體感覺、語言描述、二元及連續夾爪動作,以及僅供評估者使用的有限元素狀態。在此資料集基礎上,我們建立了一個閉環基準,透過固定的物體特定校準來定義變形感知成功率(DSR),僅當 rollout 完成任務且其峰值正規化變形維持在容許範圍內時,才將其計為成功。在 Diffusion Policy、π₀.₅ 與 FastWAM 中,全部 12 個分佈內配置均包含違反變形容許範圍但仍成功的 rollout,佔各配置成功案例的 0.7% 至 24%。在分佈偏移下,視觸覺變體在六項策略—套件比較中皆達到較高的任務成功率,並在其中五項中達到較高的 DSR,而其分佈內的效益則好壞參半。這些結果顯示,提供觸覺資訊本身並不足以確保有效的多模態融合。因此,SoftVTBench 提供了一個共通的視觸覺資源,不僅可研究策略是否成功,更可探討策略如何與可變形物體進行物理互動,以及觸覺在何時能改善此類互動。
語言特定能力(LSC)是指語言模型因提示所使用的語言不同,而在表現上出現較好或較差的現象。換言之,當以不同語言提示相同的語義查詢時,語言模型會產生不同(且可能錯誤)的回應。先前研究將此現象歸因於內部語義表徵在不同語言之間存在錯位。目前文獻中主要有兩種方法來解決 LSC:(1)將所有查詢統一經由英文處理,雖然能提升效能,但將語言表達力限制在英文;(2)在語言平衡的資料上進行訓練,雖然能均衡模型在不同語言上的效能,但會降低整體表現。在本研究中,我們從以資料為中心的視角出發,提出 HOTFIXR:針對提升跨語言推理的難度最佳化訓練資料(Hardness Optimized Training data For Improving X-Lingual Reasoning)。這是一個資料生成框架,利用模型來探查並學習學生模型的多語言弱點,進而生成資料以緩解這些弱點。HOTFIXR 能生成多語言合成訓練資料,從而提升多語言效能。我們在三個分佈內任務、三個分佈外任務以及四種分佈外語言上進行評估。平均而言,HOTFIXR(1)在分佈內效能上提升了 6.2%,(2)在分佈外任務上將微調所引發的災難性遺忘降低了 3.7%,(3)在分佈外語言上降低了 7.1%。整體而言,由於許多真實世界應用都需要多語言大型語言模型(LLM),我們的研究有助於讓 LLM 具備多語言能力的相關努力。我們將在論文被接受後釋出程式碼。
基於大型語言模型的代理(LLM-based agents)可代表使用者存取雲端服務、呼叫工具或呼叫其他代理。在會話開始時,代理的權限即被設定完成,但此後保持靜態;每個請求皆被獨立評估,不考慮先前的動作。在權限範圍內,代理可能做出與所委派任務相悖的行為、將個別允許的動作組合成被禁止的結果,或在未加限制的情況下將權限委派給子代理。提示注入(prompt injection)只有在代理具備執行此類動作的權限時才會構成風險;因此,這本質上是授權架構的問題,而不僅是模型的問題。代理主體鏈(Agentic Principal Chain, APC)追蹤從一個主體到下一主體的委派權限。APC 使用六項授權檢查,針對累積的會話狀態評估每個請求。APC 會延續並限制委派範圍與預算。透過組合閉包(composition closure),APC 將請求與先前的動作進行比對,以防止被禁止的組合,並在模型之外強制執行此決策。我們證明了 APC 實作的爆炸半徑單調性(Blast Radius Monotonicity)與組合健全性(Composition Soundness);其中,組合健全性僅限於在完整限制集合與序列化准入下的被禁止組合。我們評估了 3,154 個實例,包括 InjecAgent、AgentDojo 與 ASB。我們的受損模型評估透過在第一個合法工具呼叫後插入真實攻擊呼叫,獨立於模型行為測試 APC。AgentDojo 的資料外洩在所有四個領域中從 75-100% 降至 0%;APC 阻擋了 InjecAgent 全部 544 個資料竊取案例。意圖綁定(intent binding)將破壞行為從 38.6% 降至 4.0%,將操縱行為從 90.5% 降至 12.1%。授權延遲在閒置主機上的第 99 百分位為 0.24 毫秒;在 949 組 AgentDojo 任務-注入配對中,效用分別在兩種設定下低了 8.6 和 13.9 個百分點。實作、評估工具與資料均已公開提供。
Agent框架日益將程序性知識封裝為技能:智能體按需讀取的指令檔案,而公開函式庫中現已存放數千個此類技能。因此,讀取哪個技能已成為策略本身在回合中途做出的決策,然而現有信號並未對其進行訓練。我們表明,預設的補救措施——對候選清單進行結果獎勵強化學習——無法教會這項決策,原因在於一個我們識別並命名為「選擇器信用飢餓」的結構性問題。在廣播式的序列級優勢下,少數命名所選技能的詞元承擔了損失中微乎其微的份額,而且隨著軌跡變長,它們繼承的信用在符號上越來越錯誤。只要其後的執行失敗,正確的選擇就會受到懲罰,儘管該選擇本身是軌跡中最有價值的決策之一。對一次完整運行自身的訓練產物進行審查,證實了這三個特性,且每個特性都隨軌跡長度單調惡化。SkillGate從構造上消除了這一失敗:它將詞元支撐集分割為兩個不相交的信用通道——結果信用僅到達執行詞元,而一個獨立的動作局部優勢則恰好到達命名技能的詞元,且僅當軌跡中唯一一次讀取是正確的時為正。在五個智能體基準上,面對16個候選的清單,SkillGate將一個9B策略的試驗成功率從40.8%提升至53.2%,遠超將相同預算僅用於結果獎勵的做法,同時將對誤導候選的接觸削減三分之二,並讀取更少的技能。
音樂編輯在現代音樂製作中扮演著至關重要的角色,其應用涵蓋電影、廣播與遊戲開發等領域。近年來,音樂編輯系統的進展已能支援多樣化的編輯任務,例如音色轉換、樂器替換以及曲風轉變。然而,許多現有研究忽略了評估其在編輯過程中保留應保持不變之音樂面向的能力,我們將此定義為「音樂語境保留」(Music Context Preservation, MuseCP)。儘管有些研究確實考量了MuseCP,但其評估協議與指標並不全面。為解決此問題,我們引入了第一個MuseCP評估框架——MuseCPEval,該框架涵蓋四類音樂面向,並採用細粒度且量身打造的指標,以捕捉音樂屬性中的細微變化。客觀驗證與人體研究證實了這些指標的有效性。此外,針對多樣音樂編輯系統的案例研究展示了這些指標作為測試平台與診斷工具的實用性,並提供對現有系統優勢與局限的洞察。我們期望我們的指標與研究發現能為開發更具效能且可靠的音樂編輯策略提供實用指引,並具備強大的MuseCP能力。
光達場景補全是自動駕駛中3D感知的關鍵組成部分,場景必須即時完成才能用於下游任務。現有方法通常遵循初始化-精煉範式,首先建構場景的粗略初始化,然後將其精煉為完整的3D幾何結構。生成式模型較慢,因為它們將隨機高斯雜訊迭代地精煉成場景,而非生成式方法則以固定雜訊尺度擾動部分場景,這限制了大間隙與遮擋區域的覆蓋範圍,並且需要針對每種新的感測器配置手動重新校準。我們提出RapidLiDAR,一種將初始化本身視為學習式、資料驅動元件的光達場景補全方法。我們提出一個自適應初始化模組,為每個部分輸入點預測空間變化的位移,將部分觀測擴展為適應局部幾何的粗略場景初始化,而無需手動雜訊調整。為了將此粗略初始化精煉為完整且連貫的場景,我們另提出一個多尺度重建模組,透過查詢從輸入掃描建構的多尺度3D體素與2D BEV特徵圖,進一步精煉點位置。透過以基於體素與BEV的特徵提取取代諸如最遠點採樣和k近鄰搜尋等點鄰域運算,我們的架構更快,且在設計上能處理不同的輸入解析度。在SemanticKITTI和KITTI-360上的實驗表明,我們的方法在補全效能上與現有最先進方法相當,同時在0.1秒內完成整個場景,比先前最快的方法快2.3倍。這匹配典型車用光達感測器的10 Hz擷取率,朝向即時光達場景補全邁進一步。
詞元層級的幻覺偵測器根據單一訊號獨立地對每個詞元進行評分,而當生成模型自信地出錯時,它們便會失效。本研究則將幻覺視為一段在時間上延伸的區間,並透過序列標註加以偵測:每個詞元由一個 33 維的特徵流進行評分,該特徵流融合了文本統計、自然語言推論(NLI)蘊涵關係以及語言模型的驚奇度,且無需存取模型內部。在這些特徵上使用雙向門控循環單元(BiGRU),於 RAGTruth(10 種隨機種子)上達到 0.840 的 AUC,比獨立邏輯迴歸基線高出 11 個百分點(p = 0.002,威爾科克森符號秩檢驗)。一項受控分解分析將大部分增益歸因於時間順序而非模型容量:在區間內,證據會從高信心位置傳播至鄰近的模糊位置。相同的 0.845 上限反覆出現在循環、狀態空間(Mamba)與注意力架構中,顯示瓶頸在於特徵集而非模型本身。由於偵測器僅讀取生成的文本與外部訊號,它適用於閉源模型,且對於訓練期間從未見過的語言模型所生成的文本仍能保持有效,AUC 損失低於 4%。
物體偵測器經常對其訓練類別之外的物體產生過度自信的預測,從而導致所謂的分布外(OoD)幻覺。現有的偵測或緩解此類幻覺的方法,通常要么直接在學習到的物體偵測器表徵上建構評分函數,要么修改物體偵測器本身以抑制幻覺的產生。然而,這些表徵中隱式編碼的潛在先驗在很大程度上仍未被探索,也尚未被明確解碼用於 OoD 偵測。為了揭示並利用這些潛在先驗,我們提出了結構化先驗知識(SPK),這是一個以幻覺為導向的框架,明確地從預訓練的物體偵測器中引出與 OoD 相關的先驗。具體而言,SPK 利用分布內數據和誘發幻覺的樣本作為診斷性監督,以引出支撐物體偵測器決策的部件級語義概念,而非僅將其用於拒絕或物體偵測器的適應。所引出的語義先驗進一步與幾何先驗和上下文先驗整合,形成緊湊的五維 SPK 表徵,用於 OoD 偵測。跨越多種物體偵測器架構和多個 OoD 基準的大量實驗表明,SPK 達到了最先進的 OoD 偵測性能。我們的研究結果揭示,預訓練的物體偵測器所編碼的潛在知識,遠比通常被利用於 OoD 偵測的知識要豐富得多。更重要的是,這些知識可以被明確引出並組織成一個緊湊、結構化且可解釋的知識空間,用於預測可靠性分析。這為通過明確揭示和利用潛在先驗來提高物體偵測器的可靠性,指明了一條有前景的主動式途徑。代碼和數據可在以下網址獲取:https://gricad-gitlab.univ-grenoble-alpes.fr/dnn-safety/spk