每日精選AI研究論文及翻譯
基於可驗證獎勵的強化學習(RLVR)已透過大規模優化推動了面向推理的大型語言模型(LLM)的近期進展。然而,其適用性在很大程度上仍局限於數學與程式編寫等可對正確性進行確定性驗證的領域。反之,開放式任務通常依賴人類偏好、獎勵模型或基於LLM的評判器,因而引入評估偏差、評判器能力瓶頸以及額外的推理成本。 借鑑自監督學習中建構前置任務以從數據本身獲取監督信號的原則,我們提出「基於自我可驗證獎勵的強化學習」(RLSVR),一種基於任務轉換的訓練範式,旨在將RLVR擴展至開放式任務。RLSVR將開放式任務轉換為可驗證的代理環境,其內部規則與互動結果可自動產生獎勵信號。我們以SpyRL實例化RLSVR;SpyRL是一個受「誰是臥底?」啟發的多智能體自博弈環境。智能體接收不對稱資訊,完成相同的目標任務,並投票指認指定的臥底。由於臥底身份預先確定,投票結果提供了完全可驗證的獎勵,同時成功指認仍與輸出品質密切相關。在文本摘要、創意寫作與數學推理上的實驗顯示,SpyRL在不可驗證任務上優於現有的自我改進方法,並在可驗證的推理任務上取得一致的增益。這些結果表明,任務轉換能將可擴展的、基於RLVR的自我改進擴展至本質上可驗證領域之外。模型與程式碼已於 https://github.com/wangqinsi1/SpyRL 發布。
世界模型為規劃與行動提供了可預測的基礎,但現有表述僅回答物理性問題:它是什麼/在哪裡,以及它將如何演變。然而,人類行為是由隱藏的心智狀態所驅動(一個人相信什麼、想要什麼、意圖做什麼、感受如何,以及認為什麼在社會上是被允許的),因此,一個僅追蹤物理場景、卻不追蹤每個智能體對場景所知與所信的模型,會在看似正確的場景中預測出錯誤的行動。我們提出了心智世界建模(Mental World Modeling, MWM),這是一個通用的理論框架,將心智變量作為世界模型的核心組成部分,而非事後解釋:MWM 維持一個耦合的物理-心智世界狀態,生成針對特定目標的部分觀測,並模擬候選行動如何共同更新這兩個組成部分。我們以 MENTIS 實例化該框架,這是一個免訓練且完全可檢視的基線模型,將過程分解為狀態解析、目標觀測生成、行動分解、物理與心智的耦合轉移,以及分支層級的價值評估。在一個人工建構、品質受控的情境化決策場景資料集上,該資料集涵蓋文字、圖像與有聲影片故事,使用 8 個現代基於大型語言模型(LLM)的世界模型所進行的實驗表明,明確建模心智狀態對於預測人類決策至關重要。更深層的分析進一步揭示了當前心智世界建模的瓶頸。我們期望 MWM 能成為世界建模的下一階段,從模擬物理場景,進展到模擬在其中行動的心智。
我們提出 N_0-VTLA,這是一個視覺-觸覺-語言-動作(VTLA)基礎模型,能夠 (1) 具備觸覺感知與觸覺回饋控制的精細接觸豐富操作,以及 (2) 從已部署資料中進行離線策略改進。我們在現有的視覺骨幹基礎上,提出一套觸覺整合的訓練流程,包含視觸覺預訓練、分階段觸覺路徑整合,以及優勢條件化離線策略改進。在預訓練期間,策略從 NeoData(我們的大規模視觸覺機器人資料集)學習廣泛的接觸先驗;據我們所知,N_0-VTLA 是首個在大規模觸覺資料上預訓練的 VTLA 模型。在後期訓練期間,我們為策略增加一條預測性觸覺路徑,將在大規模資料中學習到的接觸模式,蒸餾為下游觸覺為中心操作所需的精細動作調整。在離線策略改進方面,我們引入 ALTER,一種優勢條件化離線強化學習方法,將相對進展與軌跡事件比較轉換為二元優勢標籤,用於在固定部署語料庫上進行策略訓練,進一步提升接觸豐富技能(如可變形物體操作)的任務特定學習。在接觸豐富的基準測試中,N_0-VTLA 以大幅差距優於強基線:它在所有九項真實機器人 NeoReal 任務中勝出,並在二十項任務的模擬套件中達到 63.8% 的平均成功率,而最強基線為 44.0%。使用 ALTER 訓練的 N_0-VTLA 策略在三項長時程真實機器人任務中達到 75-95% 的成功率。這些結果為多功能觸覺驅動的操作策略奠定了基礎。
多邊形網格是現代 3D 管線中標準的表面表示方式,生成具有藝術家風格拓撲的高品質網格,對於電影、遊戲和互動式 3D 應用至關重要。主流方法將網格序列化為標記序列並以自迴歸方式解碼,這在推論時速度緩慢且對錯誤累積敏感,使其難以應用於互動式資產創作。我們提出 Meshy T2,一個基於流匹配的快速原生網格生成框架。其核心是一個頂點集網格 VAE,將網格編碼為每個頂點一個連續潛在標記,並在一次前向傳遞中解碼頂點、邊連通性和面繞序,在無需頂點量化或焊接的情況下,保留高精度幾何與藝術家創作的拓撲。生成過程以兩個流匹配模型的從粗到細級聯進行:首先,影像條件體素流將整體形狀草繪為粗略的佔用骨架;接著,網格流以每頂點潛在標記填充該骨架,並以影像、骨架及要求的頂點預算為條件。此設計提供了三項實用能力:透過基於流的平行合成實現互動式生成速度;透過要求的頂點預算實現有效的面數控制;以及對多部件資產的原生支援,其部件直接來自於生成的連通性。在我們的實驗中,Meshy T2 達到了最先進的幾何保真度,並在中位數 6 秒內完成端到端的影像到網格生成,比自迴歸基線快一個數量級以上。程式碼與權重將於 https://github.com/meshy-dev/meshy-t2 提供。
系統提示詞(system prompts)是開發者設定的指令,用以規範AI應用程式中基礎模型的行為。雖然系統提示詞廣泛應用於商業AI產品,但鮮少對公眾或監管機構公開,這在AI系統大規模部署中造成了嚴重的信任與問責缺口。本文提出人工智慧系統提示詞保證框架(Artificial Intelligence System Prompt Assurance, AISPA),這是一個以使用者為中心的框架,用於系統性地稽核AI系統中的系統提示詞。AISPA檢視系統提示詞的特定組成部分,並沿著八個對使用者至關重要的面向進行評估。我們接著運用此框架審查了88個商業AI產品中系統提示詞內的3,249條指令,將每條指令分類為保護性(保護使用者)或問題性(有礙使用者權益)。我們的稽核揭示了四項核心發現。首先,系統提示詞的設計在不同產品和開發者之間存在顯著差異,部分組織每個產品平均包含超過60條保護性指令,而其他組織平均不到5條。其次,保護性指令雖被廣泛採用但涵蓋範圍淺薄:98.9%的產品至少包含一條保護性指令,但僅有24%的產品涵蓋AISPA分類架構的全部八個面向。第三,系統提示詞已持續變得更長且更具使用者保護性,顯示使用者保護正成為商業提示詞設計中日益受關注的議題。第四,儘管有此進展,問題性指令仍然普遍存在:約40%的產品至少包含一條有違使用者利益的指令,且保護性與問題性指令經常共存於同一提示詞中。我們的研究發現凸顯了商業AI產品中系統提示詞需要更高的透明度、標準化以及獨立監督機制。
我們提出 N_0-TWAM,一個以觸覺為本的世界-動作模型,專用於接觸密集操作,並能同時預測未來的視覺與未來的接觸。據我們所知,這是首個大規模訓練的觸覺世界-動作模型,且在接觸密集任務上展現出強大能力。我們以視覺-觸覺聯合訓練方式,在涵蓋六種具身與 450 個任務的觸覺密集示範資料上,大規模預訓練 N_0-TWAM。我們使用 NeoForce——一種統一的基於力之觸覺表徵——來形成具有物理基礎的接觸信號,以條件化動作生成。為改善長時程與多階段操作,我們引入觸覺接觸事件以進行任務階段化,並在執行過程中依序推進這些階段。為達成即時效率,我們採用非對稱的 Mixture-of-Transformers 架構,將全寬專家用於視訊預測,並搭配精簡專家進行下游動作與觸覺預測。在真實與模擬基準上的評估,驗證了 N_0-TWAM 在各種接觸密集任務上的能力,並展現了資料規模擴展對於精確觸覺與動作預測的效益。總結而言,N_0-TWAM 賦予世界-動作模型預見視覺、觸覺與動作的預測能力,為開放式接觸密集任務上的精細操作奠定了堅實基礎。程式碼庫與模型檢查點將公開提供,以促進觸覺賦能機器人操作的後續研究與開發。
潛在世界模型透過在緊湊的表示空間中預測未來狀態來實現高效規劃,但其效能關鍵地取決於所學習到的潛在分布的品質。LeWorldModel(LeWM)使用 Epps-Pulley(EP)目標函數,以各向同性高斯分布為目標對其潛在變數進行正則化。我們證明,EP 的修正梯度對於孤立的尾部樣本會迅速消失,導致重尾偏差無法獲得充分控制。為了解決此限制,我們提出 QQWorld,以分位數-分位數(QQ)匹配目標函數取代 EP,直接將投影後的潛在樣本與秩匹配的高斯分位數對齊,從而在尾部維持有效的修正梯度。我們進一步開發了跨批次 QQ,利用先前批次的解耦樣本擴大有效排序池,並刻畫其偏差-方差權衡。在四個控制環境中,QQWorld 有效提升了 LeWM 的平均規劃成功率,同時持續表現出更佳的高斯對齊與更薄的潛在尾部。
我們研究了視覺生成中文本條件化的實證規模特性。此類特性鮮少被度量,因為擴散損失不隨自然語言提示中的詞元數量而規模化。令人意外的是,我們發現收斂後的擴散損失會隨提示中結構化語言的數量而規模化。為了量化結構化語言,我們採用了兩種互補的度量:一種白箱似然度指標(GPG)與一種黑箱屬性指標(ED)。在一系列受控的訓練運行中,收斂後的擴散損失隨 GPG 近似線性下降,並隨 ED 呈冪律下降。在上述規模特性的引導下,我們透過建構帶有從影像中提取之語義與幾何標註的結構化提示來提升可擴散性,並透過監督式微調、冷啟動與驗證器門控的同策略蒸餾訓練提示器來提升可提示性。由此產生的系統在幾乎所有組合性、推理與世界知識基準上均勝過所有受評估的開放權重模型,同時在多數評估中達到或超越最強的封閉權重模型。
具可驗證獎勵的強化學習(RLVR)將單一回應層級的獎勵廣播至每個詞元;而在策略蒸餾(OPD)則以更強的教師模型逐詞元評分,以提供稠密優勢,但其性能上限受限於教師品質,且會抑制超越教師品質的探索。兩者的互補性使得結合 RLVR 與 OPD 極具前景,但我們發現,以固定係數融合這兩種優勢會因兩類校準失誤而引發熵崩潰:一是量級失配,詞元級 OPD 優勢可能飆升至遠超有界的 RLVR 優勢,從而抹除其訊號;二是時間失配,持續全強度的 OPD 不斷將學生模型拉向教師模型,限制了超越教師所需的探索。我們提出 SAF,一個穩定優勢融合框架,透過僅應用於 OPD 優勢的輕量級四階段管線解決上述兩個問題:以「先稀疏化再壓縮」機制進行量級控制,並搭配「先預熱再退火」機制進行時間控制;每個階段均可獨立開關,且額外開銷可忽略不計。我們以 GRPO 實例化 RLVR,在七個數學推理與程式碼生成基準上、使用 Qwen3-1.7B/4B/8B 評估 SAF:SAF 避免了熵崩潰,且在所有六個模型-領域設定中持續優於固定係數的 GRPO+OPD 融合,將綜合分數提升 0.51% 至 2.70%,同時實現更穩定的訓練。
AI輔助程式設計日益將非正式的使用者意圖轉化為可執行的軟體,然而程式設計請求常包含歧義,這些歧義會在不同任務與工作階段中以使用者特定的方式反覆出現。現有的消歧方法通常僅在當前程式設計工作階段內孤立地處理每個歧義請求,常見方式是徵詢額外的澄清。然而,能否將同一使用者已解決的工作階段歷史作為記憶,用於解決新開啟工作階段中反覆出現的個人化歧義,此問題仍尚未被充分探索。我們將個人化歧義適應定義為一項新任務:給定使用者先前已解決的程式設計工作階段以及一個新的歧義請求,助手應識別反覆出現的歧義模式,產生預期的可執行解決方案,並盡量減少澄清次數。為了對此任務進行基準測試,我們提出了CAPA,它透過六種機制刻畫個人化程式設計歧義,並使用受控的三階段生成管線將這些機制注入無歧義的可執行任務中。CAPA涵蓋60個均衡的使用者-歧義組合,共600個程式設計工作階段,其中包括300個留出的評估工作階段。我們在無歷史紀錄與同一使用者歷史紀錄的條件下,使用可執行成功率、首回合成功率與完成所需回合數來評估12個近期的大型語言模型。我們的分析探討了任務難度、使用者身分與基於記憶的歷史紀錄運用,並進一步提出同使用者歷史門控作為一種輕量級的推論時方法。CAPA為開發長期程式設計助手奠定了基礎,使其能更有效地將生成程式碼與使用者意圖對齊,同時減少重複的澄清需求。
基於評分標準的強化學習(rubric-based RL)近期在改善大型語言模型(LLM)於開放式任務的表現上展現出潛力。其一個廣為人知的限制在於探索有限:沒有任何生成軌跡能滿足的標準(即未探索標準,Unexplored Criteria, UC)無法獲得任何最佳化訊號。近期方法透過在生成軌跡期間將評分標準資訊納入外部引導來解決此問題,但它們引入了訓練與推論不一致的現象:策略是在外部引導下產生的軌跡上進行最佳化,而在推論時卻沒有這種引導,導致自迴歸解碼過程中誤差累積。此外,這些以探索為重點的方法忽略了我們稱之為受抑制標準(Suppressed Criteria, SC)的根本不同失敗模式:某些標準雖有部分軌跡能滿足,但其學習訊號在最佳化過程中遺失,原因是標量獎勵聚合將它們的聚合優勢分配為非正值。我們的分析顯示,SC 非常普遍:在整個訓練過程中,超過 57% 的樣本出現此失敗模式,平均每個樣本有 1.8 個 SC。為了同時解決 UC 和 SC,且不引入訓練與推論不一致的問題,我們提出了標準蒸餾策略最佳化(Criterion-Distilled Policy Optimization, CriPO),透過在策略自蒸餾(on-policy self-distillation)來增強基於評分標準的強化學習。針對 UC,CriPO 建構了一個標準注入自教師(criterion-injection self-teacher),並計算局部化的前向 KL 散度損失,將缺失的行為注入策略中。針對 SC,CriPO 採用反事實自教師(counterfactual self-teacher),在負優勢的生成軌跡中定位與標準相關的 token,並將其 token 層級的優勢翻轉為正值,從而保留否則會被抑制的有用模式。在醫學和科學基準上的實驗表明,CriPO 持續優於基於評分標準的強化學習,能以約 2 倍更少的最佳化步驟達成更強的最終表現。
企業工作流程日益依賴代理程式進行結構化綱要引導的抽取:給定一份文件與使用者定義的結構化綱要,代理程式忠實遵循綱要,以來源證據作為溯源中繼資料,產出正確的輸出。我們提出 ExtractBench,一個用於結構化綱要引導抽取的基準,且據我們所知,是首個同時評量值準確度、大規模記錄完整性、溯源與實測成本的基準。評量系統包含 370 份企業文件共 4,869 頁,涵蓋 8 個商業領域與 67 種文件類型,並以明確標籤區分不同挑戰情境。可擴展的結構化綱要與真實答案建置流程結合了真實文件的獨立系統一致性、合成清單的已知值,以及表單的人工驗證。我們報告用於值準確度的順序不敏感值 F1,以及兩個用於來源可追溯性的溯源指標:詞級與頁級 F1。商業 VLM 在短文件上表現良好,但在長文件上經常截斷記錄清單;而編碼代理程式則能以高得多的成本維持較高準確度。LlamaExtract Agentic Plus 在所有三項指標上排名第一,其準確度與編碼代理程式相當,但成本僅為其一小部分。資料集與評量程式碼可在 https://huggingface.co/datasets/llamaindex/ExtractBench{HuggingFace} 與 https://github.com/run-llama/ExtractBench{GitHub} 取得。
儘管近期的圖像編輯模型已取得快速進展,多參考圖像編輯仍然充滿挑戰,特別是在不同參考圖像之間維持視覺一致性,以及確保整體視覺和諧方面。強化學習已被證明在文字生成圖像與單圖像編輯上非常有效,但將其擴展至多參考編輯卻受到缺乏合適獎勵模型所阻礙,因為這類模型需能捕捉多圖像之間的關係約束。此外,單純地將多模態大型語言模型(MLLMs)用作零樣本評估器,會面臨一個關鍵矛盾:容易產生幻覺的長篇推理,與短篇判斷有限的演繹能力之間的衝突。我們提出一種多維度評估—驗證獎勵(EVR)來解決這些問題。EVR 將評估分解為不同的視覺標準;針對每一項標準,MLLM 評估器會生成多個候選假設,而驗證器則將每個主張錨定於具體視覺證據,並據以接受或否決該主張,進而產生可靠且細粒度的獎勵信號。結合可擴展的資料管線,我們的方法使得無需修改架構即可對現成編輯器進行強化學習微調。大量實驗顯示,相較於基礎的 Qwen-Image-Edit,我們的方法有顯著提升,在一致性與和諧性上達到甚至超越 NanoBanana。
在我們所處的物理世界中,空間與時間從根本上是連續的。然而,現有的世界建模機器學習範式大多受限於離散時間預測,因此在捕捉物理世界動態方面表現出顯著的低效。我們提出了物理時間流(PT-Flow),一種新穎的方法,學習在物理時間中運作的連續潛在速度場。關鍵在於,序列數據的底層動態由一個嵌入於結構良好的表徵空間中的常微分方程(ODE)所參數化。在此範式下,未來的預測可以重新表述為透過ODE求解器在壓縮潛在空間中進行時間積分。基於PT-Flow,我們構建了ODEWorld,一個既高效又多用途的連續時間潛在世界模型。透過提取時變特徵並在動態表徵空間與潛在速度場上強制實施ODE性質,ODEWorld有效解決了潛在世界模型文獻中長期存在的表徵坍縮問題。這也使得即使在長期預測之後,仍能實現高品質的影像重建。此外,其連續性允許任意的時間解析度,甚至能進行反向預測,而這對大多數離散時間模型而言是不可能的。最後,ODEWorld能提供豐富的、有助於規劃的資訊,以促進下游策略學習。綜合實驗表明,ODEWorld成功調和了有利於規劃的動態抽象與視覺真實性,在影片生成和機器人控制方面均表現出色。https://dstate.github.io/odeworld_website/{Project Website}。
網路日益由AI代理而非人類所存取。每個代理都需要知識,尤其是在生命科學領域,該領域的代理式管線正快速成長。取得文獻是滿足此需求的關鍵環節,而像Europe PMC這類擁有超過4000萬筆索引記錄的資源,被廣泛用於滿足這項需求。然而,這些資源並非為AI代理而建:它們接受關鍵字和複雜語法,並回傳完整論文,因此每個代理都必須學習其語法、執行多次搜尋,並閱讀全文論文才能找到所需的證據。我們推出EMBL AI Librarian,這是一個知識層,將Europe PMC介面升級為適用於AI代理:代理以自然語言提問,並接收能回答問題的證據。單一大型語言模型(LLM)協調整個知識檢索流程:它規劃由即時Europe PMC搜尋引擎執行的互補性子查詢,然後閱讀所選論文並定位相關證據。我們在四個基準上評估Librarian:文獻綜合、主張驗證、開放領域問答,以及下游生物學任務,例如實驗流程問題和序列操作。在ScholarQABench上,Librarian比近期發表的強力基準高出逾16個百分點的引用F1分數。作為現有主張驗證管線的檢索層使用時,它提高了與專家共識的一致性;而在開放式LitQA2基準上,GPT-5.4代理在以Librarian為基礎時,比使用網路搜尋高出約8個百分點。整體而言,我們的結果顯示,為生命科學代理配備Librarian知識層可提升一系列任務的表現。我們在 https://github.com/petroni-lab/librarian 公開發布我們的程式碼。
儘管視覺-語言-動作(Vision-Language-Action, VLA)模型賦予了令人驚豔的視覺運動能力,但在具挑戰性與域外任務上,其表現往往會下降。近期的測試時引導與擴展方法無需大量資料收集與重新訓練即可提升效能,但動作樣本通常仍集中於相似的行為附近,因而繼承了彼此相關的失敗模式。此外,現有方法在每個時間步都施加相同的干預策略,而不論基礎策略是否已有可能成功。為了解決這些限制,我們提出 RL^2,一個自適應推論時間引導框架,利用 VLA 潛在特徵上的強化學習。首先,我們訓練一個輕量級離線強化學習策略,以從 VLA 動作專家提取的表達性潛在特徵為條件,並在推論時將其流場速度與凍結的 VLA 之流場速度進行組合。這種組合式引導策略結合了大規模模仿學習的行為先驗,以及離線強化學習在主導示範模式之外所誘發的動作多樣性。我們進一步發現,推論時間引導在成功與失敗狀態下遵循根本不同的規模定律,揭示出當基礎 VLA 可能失敗時,動作多樣性最為有益;但當成功可能性高時,動作多樣性卻可能不必要地擾動已屬準確的動作。基於此洞見,RL^2 僅在預測到失敗時才啟動組合式引導。在 SIMPLER 與 PolaRiS 基準上,RL^2 在域外設定中將成功率提升了最高 +17.3%,同時消融研究與規模研究證明了潛在表徵與強化學習訓練的重要性。最後,真實世界實驗證明這些增益可遷移至模擬之外,確立 RL^2 作為適用於 VLA 部署之實用且模組化的引導框架。
群體中的每台機器人能否僅憑局部觀測和頻寬受限的訊息,預測相同的未來集體狀態?我們將此問題形式化為分散式共享狀態預測,並提出集體狀態JEPA(CS-JEPA),這是一種遞迴聯合嵌入預測架構,其在每台機器人上的輸出代表一個共同的未來token場。在部署時,每台機器人使用16幀的局部歷史,以及每條有向邊一個64浮點數的遞迴訊息;沒有全域池化、目標編碼器、回合時鐘或記錄的未來動作。在未使用下游集體標籤進行預訓練後,以凍結表徵透過在6、12或24個全域標記回合上擬合的嶺迴歸探針進行評估。相對於具有相同接收端錨點和部署容量、但多出9,607個僅訓練用參數的原始未來重建方法,一項前瞻性註冊的五種子後續實驗,在最多108台機器人的分佈內、環狀、相互kNN及未見規模系列中,改善了預測誤差和機器人間一致性標籤預算AUC。所有效應在5/5外部種子中均有利於CS-JEPA。在一項獨立的密封八種子後續實驗中,匹配的動作條件預測器在產生接收端局部預測表徵之前,會接收每個候選的四步計畫。CS-JEPA將分支價值均方誤差降低了45.5%,並將上下文內候選分數的皮爾森相關提高了0.1291,兩項效應在8/8種子中均有利,包括在未見的N=32時。這些結果支持將共同未來JEPA目標作為在拓撲和規模變化下進行分散式群體預測的標籤高效基本單元,並提供了與規劃相關的價值估計的額外證據。
訓練後對齊往往流於表面,在微調過程中容易退化。中期訓練介入若能與訓練後階段完全隔離,是否能產生持久的對齊效果,至今仍未經驗證。我們透過憲法式中期訓練(constitutional midtraining)來測試此問題:在120B參數規模下,將基於原則、以價值觀為核心的內容插入中期訓練階段,並以僅重放(replay-only)的對照組進行比較。我們依據Anthropic的憲法建構了包含3.94億個token的憲法式語料庫,採用2x2因子設計(課程排序 × 審議式推理),產出四種憲法式中期訓練條件加上一個對照組,並在三個階段(中期訓練後、監督式微調(SFT)後、良性微調後)以自生成及既有基準進行評估,涵蓋壓力下的對齊表現、價值衝突解決、勒索情境及新興失序行為(emergent misalignment)。憲法式中期訓練的模型在對齊泛化與持久性上優於對照組,尤其在勒索情境中表現顯著:SFT使所有模型都產生勒索傾向,但憲法式中期訓練能削弱此傾向,且此優勢在良性微調後依然存在(-17.5個百分點)。然而,此持久性並未延伸至需要主動抵抗情境內壓力或衝突的場景,此類優勢在SFT後即減弱。中期訓練階段存在憲法式內容本身比其結構編排更為關鍵,且憲法式中期訓練在我們測試的任何階段中,平均而言對能力指標(MMLU、ARC-Easy、piqa、GSM8K)皆無損害。因此,在中期訓練階段加入適量的憲法式內容,可帶來廣泛且持久的對齊增益,為以SFT為核心的訓練流程提供低成本且具互補性的增強方案。程式碼、資料與模型均已公開。
穩健的低光源成像對研究學界而言仍是一項挑戰。近年來的研究探索將近紅外線(NIR)與帶雜訊的RGB影像融合,以達成更佳的影像增強效果,然而多數方法依賴於精心整理的訓練資料對,在不同場景下的穩健性有限。本文提出一個全新的觀點,藉由引入3D感知神經建模來處理RGB-NIR低光源成像問題。在無需乾淨RGB監督的情況下,一個強大的模型可以被最佳化,在3D空間中隱式地融合極度帶雜訊的RGB觀測與NIR線索,有效還原乾淨的RGB影像。所提出的模型免除了收集乾淨RGB資料的需求,並能泛化至不同的雜訊程度。在合成與真實資料上的廣泛評估證實了其優越性。程式碼已公開於:https://github.com/MyNiuuu/3DarkFusion
大型語言模型的防護措施在決定是否回答時,尚未看到答案將如何被使用。這對雙重用途任務構成一個基本問題:相同的答案既可能幫助授權專業人士,也可能幫助攻擊者,而攻擊者可以模仿良性的請求與互動歷史。我們將模型所釋放的能力,與關於下游使用的可得證據區分開來。當該證據是可複製的,我們推導出在保留有用答案的同時,攻擊者所能獲得協助的確切最壞情況下限。此結果產生一個安全三難困境:有用能力、可靠安全與開放取用無法共存。接著我們展示,可信憑證如何透過加入難以複製且能預測實際下游使用的資訊,來補充現有防護措施,並找出消除該下限所需的更嚴格條件。來自雙重用途評估、適應性攻擊及已部署的可信存取計畫的證據,支持了這些條件的實際相關性。
RGB 影像為無人機/無人地面載具(UAV/UGV)在地表地雷偵測中的勘測支援提供了實用且低成本的選項,然而物體偵測器在此安全關鍵領域中仍未被充分探索。跨架構基準測試的有限性以及分布外(OOD)分析之不足,使得偵測器能否在各種部署條件下泛化仍屬未知。此一挑戰因公開RGB地雷資料集的稀缺而更加嚴峻,使SULAND成為PFM-1與PMA-2偵測的關鍵基準。然而,經檢視發現SULAND存在缺失/錯誤標註、定位誤差、能見度標準不一致、視覺偽影、時間序列標註不一致,以及顛倒的OOD類別ID慣例等問題。我們提出SULAND_v2,一個經精煉的RGB地表地雷資料集與基準。在保留原始影像與分割的前提下,我們以人工方式修訂標註,以確保完整性、精確定位、標籤有效性及類別一致性。SULAND_v2包含33,771張影像與12,433個邊界框。我們針對九個架構家族共35種偵測器配置進行基準測試。標註精煉使YOLOv8同分布(IID)測試mAP@50提升14.6至19.6個百分點,而修正OOD類別ID慣例則使YOLOv8平均OOD mAP@50提升約25個百分點。在SULAND_v2上,YOLOv12-Small達到最高IID mAP@50(0.908),而RF-DETR-Large則展現最強的OOD表現(0.799 mAP@50,0.675召回率)。我們的結果證明,高IID準確率並不保證作戰就緒性。SULAND_v2為評估基於RGB之排雷勘測支援中的域移位穩健性,提供了可靠的基準。
帶有可驗證獎勵的強化學習(RLVR)對於改善大型語言模型中的長思維鏈推理至關重要。無評論家方法(如 GRPO)將回應層級獎勵轉換為優勢,並均勻地廣播至所有 token,忽略了它們對最終結果的不平等貢獻。相反地,在策略自蒸餾(OPSD)透過最小化非特權策略與特權自教師之間的前向 KL 散度,提供密集的分佈式監督,其隱含假設是:由此產生的似然偏移編碼了可靠的、與答案對齊的資訊。我們透過固定每個取樣軌跡,並在兩種相反的結果條件下重新評分來檢驗此前提:一種條件斷言正確,另一種斷言不正確。大多數受影響的 token 在兩種條件下朝相同方向偏移,很少出現符號反轉,且所誘發的最佳化訊號有顯著重疊。大的偏移也集中在高度可替代的表面形式 token 上,而攜帶問題特定推理內容的 token 則較不敏感。這些發現表明,特權偏移無法提供可靠的、與答案對齊的方向,而其幅度主要反映反事實敏感性,而非 token 層級的學習價值。基於這些觀察,我們提出反事實敏感性信用重新分配(CSCR),這是 GRPO 的一個簡單擴展,它減少對高度敏感 token 的信用,並重新正規化 token 層級優勢,以保留原始的信用預算和驗證器決定的方向。在長思維鏈數學推理基準上,CSCR 在相同數量的策略更新下持續優於 GRPO 基線。有針對性的消融實驗進一步證實了我們的診斷:特權誘導的方向不可靠,適度的降權最有效,而更強烈的調制會使最佳化不穩定。
情緒對話研究包含兩個具影響力的策略傳統。同理心對話優先考量理解說話者的情緒經驗。情緒支持對話則針對尋求者當前需求,選擇並排序支持策略。持續使用引入了進一步的目標。有效的支持應在整個互動生命週期中,維繫使用者進行情緒調節、因應、自我認同的決策以及社會連結的能力。我們提出「能力維繫型情緒對話」(capability-sustaining emotional dialogue, CSED)作為一項縱向研究典範,使支持策略與此目標一致,並圍繞重複使用、非使用、轉換與終止來組織資料、模型、系統設計、評估與治理。一項針對性的文獻與語料庫審查支持此一立場。在PRISMA-ScR指引的樣本中,60篇系統建構論文中,95%以緩解取向為目標。沒有任何一篇評估能力或縱向結果,僅有1篇考量依賴、自主性或終止風險。在300個ESConv支持者話輪中,能力相關功能出現於43.0%,而一般性建議佔22.0%,相較之下,重新評估僅佔4.0%、自我效能支持佔6.7%、界限行為佔0.3%。我們發布一項將審查延伸至模型行為的協議。一個示例性過程模型將潛在使用者能力連結至六項設計承諾、四個評估時間尺度與生命週期約束。由此產生的研究議程使CSED在資料、政策設計、訓練、評估與治理層面均可檢驗。
自動駕駛系統(ADS)正快速發展,並日益廣泛部署於實際應用中。這對於有效的測試需求不斷增長,以確保系統功能與安全性。然而,自動駕駛系統測試仍相當複雜,且在場景選擇、效能評估與驗收標準方面缺乏完善成熟的規範。為更深入理解當前自動駕駛系統測試的實務作法與挑戰,我們對來自六個國家、九家企業中從事自動駕駛系統開發與測試的專家進行了訪談研究。透過主題分析法,我們綜整了產業界的測試實務、挑戰、潛在解決方案與未來趨勢,並提出一套以證據為中心的閉環式自動駕駛系統測試框架。研究結果顯示,當前的實務作法主要聚焦於基於場景的測試與X-in-the-loop(X在環)測試方法,並輔以多樣化的工具、指標、基準測試與測試策略。受訪專家強調了與場景真實性、場景覆蓋率、模擬保真度及驗收標準相關的重大挑戰,同時也探討了運用人工智慧、世界模型與端到端方法等潛在解決方案。此外,受訪專家預期未來的自動駕駛系統測試將在整個產業中變得更加自動化、資料驅動且具備更高的透明度。整體而言,本研究提供了以產業實務為基礎的自動駕駛系統測試全面綜述,提出了一套以證據為中心的閉環測試框架,以提供可行的自動駕駛系統測試指導方針,並勾勒出未來研究與實務的重要方向。
隨著大型語言模型在複雜推理任務上持續進步,它們已學會高度優先考量輸入中所提供的明確條件。然而,在日常常識推理中,此機制暴露出一項我們稱之為「顯著性偏誤」的關鍵弱點:模型容易被無用的明確干擾項(例如數值)所劫持,從而忽略任務中隱含的物理或常識前提。一個關鍵的開放性問題是:這種失敗究竟反映了常識知識的真實缺口,抑或僅是常識知識在誤導性任務框架下被抑制。為探究此問題,我們建構了 SaliTrap 基準,一個涵蓋四個陷阱維度的高品質資料集。在評測 12 個最新的大型語言模型後,我們發現所有主流模型都明顯受到顯著性偏誤的影響,其嚴重程度隨干擾物密度而增加,且偵測到陷阱往往與實際避開陷阱並無關聯。重要的是,藉由在去除任務框架後重新徵詢相同的模型,我們顯示這主要是知識抑制而非知識缺失所造成的失敗:僅靠無上下文知識探測即可恢復超過 90% 的諂媚式順從失敗,這表明所需的常識內在存在,卻被顯著干擾項積極排擠,而這些干擾項會誘使模型進行過度順從、不必要的計算。基於此診斷,我們進一步證明,僅使用輕量級的推論時提示即可實質彌合差距,且無需任何重新訓練。我們的研究將常識推理失敗的瓶頸從模型能力重新定位至知識引出層面,並釋出 SaliTrap 作為此盲點的測試平台。程式碼可在 https://github.com/Wuzheng02/SaliTrap 取得。
自動駕駛多車輛競速需要在激烈互動中即時規劃多樣化的競爭行為。現有規劃器時常在策略多樣性與計算效率之間難以兼顧。為應對此挑戰,我們提出基於取樣的賽局理論規劃(Sampling-based Game-Theoretic Planning, SGTP),這是一個即時框架,結合賽局理論推理與GPU加速的控制序列取樣及動力學展開。取樣的軌跡透過賽局感知成本函數進行排序,以捕捉競爭互動並產生多樣化的競速行為。我們的規劃器隨後透過明確執行賽道邊界與動態碰撞避免約束來進行可行性篩選,確保競速策略之間安全且可靠的轉換。在具挑戰性的賽道上進行的廣泛模擬顯示,SGTP在高度互動的競賽中達成95.24%的勝率與99.35%的任務完成率,並在多個迭代求解步驟中達到平均0.095秒的計算時間。我們亦展示SGTP在最多10個智能體的大規模場景中的成功應用。我們釋出程式碼,並提供多智能體自動駕駛競速演算法的開源基準測試,以促進未來研究。專案頁面:https://sgtp-racing.github.io/。