每日精選AI研究論文及翻譯
近期在视频理解方面的进展已涵蓋動作、長視頻及串流互動,推動此領域朝向實際應用發展。然而,儘管有此進展,當前開源模型仍存在若干局限。它們往往難以在不同類型的視頻間泛化,僅在特定領域有效;高運算需求進一步限制了其效率與可擴展性。此外,多數模型僅部分開放,訓練代碼、策略或數據集等關鍵元件無法取得,阻礙了可重現性並減緩社群驅動的開發進程。為解決這些問題,我們提出 VideoChat3——一個完全開放、高效且通用的以視頻為中心的 MLLM。VideoChat3 透過兩種互補設計推進視頻理解。在效率方面,我們引入了膨脹3D視覺 Transformer(I3D-ViT)與自適應幀解析度串流視頻感知,實現高效的時空表徵,並降低訓練與推理過程中處理視頻輸入的成本。在效能方面,我們開發了一個可擴展的視頻數據合成流程,策劃了三個多樣化、高品質的訓練數據集:VideoChat3-Academic2M、VideoChat3-LV116K 與 VideoChat3-OL617K,涵蓋通用、長格式與串流視頻場景,從而提升模型跨領域的泛化能力。透過整合這些設計,VideoChat3 實現了廣泛泛化與運算效率的罕見平衡。在通用、長格式與串流基準測試上的實驗表明,VideoChat3 以僅 4B 參數與更高效率,超越了參數量相等或更大的既有開源模型。
大型語言模型正越來越被訓練為互動式代理,以處理涉及多輪互動、工具使用和環境反饋的長期任務。基於結果的強化學習提供了一種實用的優化典範,但其稀疏的軌跡層級獎勵對中間決策提供的指導有限,導致在回合層級結果與詞元層級策略學習之間存在監督差距。我們提出SEED(自我進化的同策略蒸餾),這是一個自我進化的框架,能將完成的同策略軌跡轉化為訓練時期的後見技巧,並將其行為效果蒸餾回策略模型中。SEED首先微調策略,以分析已完成的軌跡並生成自然語言技巧,這些技巧捕捉可重複使用的工作流程、關鍵觀察或避免失敗的規則。在強化學習期間,當前策略既收集軌跡,也充當從中提取後見技巧的分析器。因此,策略更新能同時改善後續的決策制定與技巧分析,使後見監督能隨著策略演進。然後,SEED在普通情境與技巧增強情境下重新評分取樣的動作,將技巧引起的機率偏移轉化為密集的詞元層級同策略蒸餾信號。該信號與基於結果的強化學習共同優化,使輔助監督與當前軌跡分布保持一致。在基於文本與基於視覺的代理任務上的大量實驗表明,SEED持續提升性能與樣本效率,並展現出對未見過場景的穩健泛化能力。我們的程式碼可在 https://github.com/jinyangwu/SEED 取得。
工具整合大型語言模型的最新進展,使網頁搜尋成為資訊搜尋代理的核心能力。然而,隨著互動歷史的增長,代理追蹤任務進度的難度也隨之增加。當搜尋嘗試未能取得有用證據時,現有的單一代理與多代理系統可能陷入重複迴圈,浪費搜尋預算,最終損害最終輸出的品質與完整性。我們提出SearchOS——一個系統層級的多代理框架,將脆弱且隱含的搜尋進度轉化為明確、持久且共享的狀態。首先,我們將開放式資訊搜尋形式化為帶有基礎引用的關聯式綱要補全任務,代理在其中發現實體、在連結表格中填入屬性,並將每個值錨定於來源證據。接著,我們設計了搜尋導向上下文管理(SOCM),將演化中的狀態外部化為前緣任務、證據圖、覆蓋圖與失敗記憶。基於SOCM,SearchOS應用了一種管線並行排程機制,該機制重疊執行子代理,並持續以針對未解決覆蓋缺口之任務填補釋出的空槽,以提升利用率與吞吐量。為排程與控制搜尋代理的執行,SearchOS引入了搜尋工具中介層集線器,攔截模型與工具的互動以記錄基礎證據,並在停滯或預算耗盡時做出反應;此外,還提供一套可重用的層級化技能系統,包含策略技能與存取技能,以增強代理的搜尋流程,並避免在多次運行中重複失敗的搜尋模式。在WideSearch與GISA上,SearchOS在所有評估的單一代理與多代理基線中領先所有指標,為穩健的資訊搜尋協作鋪平道路。
推論上下文長度與強化學習後訓練之間的差距日益擴大:推論系統正接近百萬級標記的上下文,而後訓練負載通常仍停留在256K標記或以下,並在部署時依賴長度泛化。這一差距對AI智能體尤為重要,因其觀察結果、工具輸出、文件以及先前的決策會在長時間軌跡中不斷累積。LongStraw是一個基於固定GPU預算、專為百萬級標記強化學習後訓練設計的架構感知執行棧,並以群體相對策略優化(Group Relative Policy Optimization, GRPO)實例化。該方法對共享提示進行不帶自動梯度的評估,僅保留後續標記所需的模型特定狀態,並逐一重播短回應分支,以額外重播時間為代價縮減即時訓練圖。我們針對混合循環與全注意力機制的Qwen3.6-27B以及壓縮注意力混合專家模型GLM-5.2進行了實作。在八張H20 GPU上,LongStraw針對群組大小為2和8的場景,完成了為2.1M位置分組的Qwen評分與回應反向傳播;增加群組大小僅額外增加0.21 GB的峰值記憶體配置量,而獨立的壓力測試則達到了4.46M位置。在三十二張H20 GPU上,我們驗證了GLM-5.2全部78層、2.1M標記提示的端到端LongStraw執行路徑。由於所捕獲的提示狀態為分離狀態,且部分分散式前向傳播與梯度組合路徑尚未完整,這些實驗僅建立了執行容量,而非完整的訓練正確性。
世界-行動模型(WAMs)正逐漸成為具身控制領域極具前景的基礎架構:此類模型不僅預測行動,更學習將行動生成與未來世界預測相耦合的表示方式。這種耦合常被視為強健性、可解釋性與安全性的來源——因為機器人的行動原則上可經由其想像中的未來進行校驗。然而,本文揭示此假設實為脆弱。我們提出BadWAM,這是一個針對「世界-行動漂移攻擊」進行建模與評估的統一框架。此類攻擊專屬於WAM模型,利用微小視覺擾動破壞模型想像與實際執行行動之間的一致性。BadWAM依據兩個自然準則——攻擊強度與隱蔽性——刻畫此攻擊介面。當攻擊者優先考慮破壞效果時,BadWAM實例化為純行動對抗攻擊,直接驅使模型執行導致任務失敗的行動;當攻擊者同時優先考慮隱蔽性時,BadWAM則實例化為保留想像的對抗攻擊,此攻擊致力於在保持模型預測未來接近其乾淨想像的同時,誘發有害的行動偏移。兩類攻擊共同涵蓋了WAM特有的失敗光譜:從顯性的行動劫持,到更隱蔽的情況——即模型看似想像出合理的未來,卻執行失調的行動。我們在不同WAM變體上對BadWAM進行評估。結果顯示,在閉環執行條件下,我們的攻擊顯著降低了任務成功率。例如,純行動攻擊使模型成功率從96.5%降至43.1%;保留想像的攻擊結果則進一步暴露了WAM特有的脆弱性:適度的未來保留正則化雖能維持高攻擊效能,同時卻減輕未來想像的漂移。
影片生成日益依賴以關鍵幀為基礎的流程,創作者指定一系列參考影像來引導生成過程。儘管近期模型已支援多重關鍵幀條件設定,但它們能否在維持整體影片品質的同時忠實重現指定的關鍵幀,仍有待釐清。我們提出 KeyFrame-Compass,這是首個專門評估關鍵幀條件影片生成的綜合基準。該基準包含 386 個精心挑選的樣本,涵蓋三個應用領域、兩種影片結構、兩種提示粒度、兩種條件設定格式及四種關鍵幀密度,能在多樣生成設定下進行受控分析。我們進一步引入一套自動化評估框架,同時衡量關鍵幀執行度與整體影片品質。具體而言,我們將關鍵幀執行度拆解為六項互補指標:存在性、保真度、時序正確性、定位準確性、持續性及唯一性;同時透過具備證據基礎的多模態大語言模型判斷,並輔以專門的感知模型,來評估整體影片品質。針對九個代表性影片生成系統的實驗揭示了數項根本限制。當前模型在忠實執行關鍵幀與自然影片合成之間存在明顯的權衡取捨。隨著關鍵幀約束密度增加,模型效能進一步下滑,且多數開源模型亦無法將分鏡格輸入解讀為時序排列的關鍵幀序列。
多參考音視頻生成(MR2AV)旨在基於多個參考與文字指令生成連貫的音視頻內容。現有基準測試主要聚焦於文字驅動生成、單一參考主體保留或獨立的音視頻對齊,使得新興的MR2AV設定在很大程度上未獲探索。與這些設定相比,MR2AV要求模型在生成同步的視覺與音頻內容時,對多個參考進行聯合推理。模型不僅須忠實保留每個參考,還須正確綁定並組合多個參考實體,形成連貫的音視頻事件。為填補此缺口,我們提出MultiRef-Compass,一個用於MR2AV生成的統一基準。該基準包含350個精心策劃的樣本,經由可擴展且可控的資產組合管道構建,涵蓋多視角主體保留、多實體綁定以及人物-物體-場景組合。為提供可解釋的評估,MultiRef-Compass定義了一個包含四個維度的評估協議:基本品質、參考一致性、音視頻一致性與指令遵循,並使用14項子指標。MultiRef-Compass將自動化指標與重新評判增強的MLLM作為評判框架相結合,實現對感知保真度與參考條件下組合的可擴展且可審計的評估。在八個具代表性的MR2AV系統上進行的廣泛實驗顯示,多個評估維度仍有顯著改善空間,凸顯全面基準測試的必要性,並將MultiRef-Compass定位為未來MR2AV研究的基礎。
人類認知並不區分理解與生成。站在白板前的教師邊說邊畫,每一種模態都在重塑另一種模態。在本論文中,我們將這種耦合循環引入人工系統。遮罩擴散模型非常適合這項任務,然而現有的取樣器要交錯解碼文字與圖像,要透過平行分支獨立更新,且這些分支僅共享前一步的歷史資訊,卻不共享同一時間步內另一模態的最新決策;再搭配上遮罩擴散模型無法重新遮罩的特性,跨模態的矛盾既無法被偵測也無法被修復。我們提出「自校正耦合馬可夫跳躍過程」,這套框架中,一個模態的轉移速率是另一個模態信心分數的函數,並以跨模態注意力加權。此外,一個重新遮罩跳躍會在建構跨模態證據反轉時撤回已做出的承諾。結合此框架,我們推出「CO_2Jump」,這是一種無需訓練、單遍取樣的耦合模態生成取樣器。為進行訓練與評估,我們建立了三個大規模的聯合多模態生成語料庫:JEdit-1M、JMaze-200K 以及 JNono-200K,並附上對應的分佈內與分佈外基準測試。CO_2Jump 在圖像理解與編輯,以及視覺推理(迷宮與黑白非邏輯解題)上均達到最佳的聯合表現。該取樣器的效能隨去噪步數單調遞增,顯示跨模態耦合的效益在整條軌跡中持續疊加。專案頁面:https://coupled-jump.github.io
長期以來,建立能根據玩家行動連貫回應的互動世界,始終是電腦圖形學、遊戲與人工智慧的共同目標。近期影片生成模型透過預測基於使用者行動的未來觀察結果,為此目標提供了數據驅動途徑,並日益被視為潛在的次世代遊戲引擎。然而,要實現真正可互動的遊戲世界,需要互動結果能遵循遊戲動態狀態的規則、後果能長時段持續存在,且生成循環能即時運作。傳統遊戲引擎透過循環的「動作-狀態-觀察」機制實現這些特性:玩家動作按照預設規則更新明確的遊戲狀態,再從更新後的狀態渲染出觀察畫面。本文以該循環為組織框架,從四個面向探討互動遊戲世界建模:玩家動作控制、遊戲狀態動態、狀態-觀察持續性,以及即時互動生成。針對每個面向,我們先界定互動遊戲世界所需的關鍵能力,再將現有方法歸納為具代表性的類別,並討論各類別的優勢與取捨。為補充此分析,我們針對《黑神話:悟空》開發了一套可擴展的數據引擎,收集超過90小時的遊戲過程,包含逐幀對齊的玩家動作、真實遊戲狀態與視覺觀察記錄,並附有結構化及語義標註,作為狀態感知遊戲世界建模的資源。期望本文能清晰描繪此領域的現狀,並推動互動遊戲世界的相關進展。
從原始視覺資料中學習廣泛的世界知識,是智能的一項基本能力。我們提出 UniVR,這是首度探討如何從純視覺示範中,同時學習複雜推理、細緻的物理動態以及長期規劃的研究。UniVR 的核心在於 VR-GRPO,這是一種結合全域與步驟層級獎勵的強化學習範式。此方法在推理過程中強化了邏輯一致性與物理一致性,無需依賴任務特定的啟發式規則或圖文配對。為了訓練與評估 UniVR,我們建構了 VR-X,這是一個大規模基準測試,彙整了來自 16 個不同來源的資料,涵蓋長期操作、空間拼圖與物理推理。這是首個在純視覺協議下評估這些異質能力的綜合性測試集。值得注意的是,UniVR 在 VR-X 上實現了高達 25% 的效能提升,而其卓越的視覺推理能力也提升了多項多模態理解基準測試的表現。這些發現凸顯了在視覺空間中進行推理的巨大潛力,所有程式碼、數據與模型均已開源,以供後續研究使用。
強化學習已成為大型語言模型的標準後訓練配方,但稠密的全參數更新會產生兩個部署相關的瓶頸:壓抑推理效能(常表現為測試時擴展的過早飽和),以及透過多領域訓練或模型合併整合多重能力時的干擾。我們證明,這些更新中對推理有效的部分大多集中在基礎模型的譜空間,由此提出子空間對齊重接(SAR),這是一種事後編輯方法,能保留此譜核心並移除正交分量。因此,SAR能保留推理增益,並濾除壓抑效能或放大跨領域干擾的殘餘更新方向。在數個模型系列與規模中,SAR使用僅約0.58%的總參數提取出緊湊的推理核心:它能保留超過99%的後訓練效能,在數學推理中改善高k探索,並透過在內部模型上改善七個開放基準中的六個,泛化至智能體式編碼。SAR也能透過釋放受壓抑的編碼能力同時維持數學推理與指令跟從,純化混合領域的訓練更新。此外,它還能實現專家間的模型合併,產生的跨領域泛化超越先前的合併基準,甚至超越最佳單一領域專家。總體而言,SAR顯示從參數幾何中提取推理有效的更新,可作為一種無訓練機制來改善推理與多領域效能。
我們提出 Wan-Streamer v0.3,該版本將我們的原生串流互動模型重新框架化為一個統一的觀點:影片是一個世界加上一個事件流。世界是影片展開的持續背景,包含環境、場景、主體、環境聲學條件、語音特徵及其他相對穩定的條件。事件流是世界內隨時間變化的一切,包括場景或環境變化、主體行為、語音及其他聲音。這產生了一個基於大量真實影片的通用預訓練任務:給定一個世界和輸入,預測世界如何即時移動、變化與回應。所獲得的能力可專門應用於廣泛的即時下游任務。我們將其實例化於即時全雙工視聽互動場景,其中事件流是智能體的語音及自由形式的行為。功能上,該模型的多模態理解過程類似於視覺-語言-動作:它將多模態使用者輸入映射為語言形式的語音與行為動作。Wan-Streamer v0.3 保留了 v0.2 的操作設定:640×368 解析度影片、25 FPS、160 毫秒串流單元、約 200 毫秒模型端回應延遲,以及在 350 毫秒雙向網路預算下的約 550 毫秒總互動延遲。
在線策略蒸餾(OPD)已成為大型語言模型後訓練的關鍵範式,但其訓練動態仍未被充分理解。我們進行了一項系統性研究,探討OPD的角色、病理現象及調節機制。首先,我們釐清OPD作為探索催化劑的角色:它透過密集的詞元層級引導,將學生模型導向正確的推理路徑,而不擴展能力上限。我們透過證明提示多樣性比每問題採樣數量更重要,以及關鍵的是,OPD的有效性完全取決於其引導訊號的品質,來確認這一點。此依賴性暴露了兩種破壞探索的病理現象。師生模型不匹配發生於大型教師-學生分佈差距導致引導訊號與任務正確性不一致,使探索轉向反效果的方向。長度利用則源於聚合的詞元層級目標產生與長度相關的捷徑,使學生模型能透過回應截斷或冗餘填充來操縱獎勵景觀,從而探索退化長度模式而非推理策略。為控制這些病理現象,我們研究輕量級訊號調節機制:優勢裁剪與對數尺度壓縮,確保探索由可靠訊號引導。在七個基準測試上的實驗表明,這些調節機制能減輕長度利用並實現有效蒸餾,穩定超越OPD變體與RLVR基線,從而確認良好調節的訊號品質(而非單純的教師模型規模)是OPD中成功探索的關鍵。
近期的機器人基礎模型僅能處理單步或短歷史的視覺運動上下文。我們引入了測試時訓練機器人策略(RoboTTT),這是一種機器人模型與訓練方法,能將視覺運動上下文擴展至8000時間步,比當前最佳策略高出三個數量級,且不增加推理延遲。在如此上下文長度下,我們解鎖了新的機器人能力:從人類影片示範中進行單次上下文模仿、即時策略改進、對擾動的穩健性,以及在多階段、長時間任務中的更強表現。我們也首次觀察到,隨著預訓練上下文長度擴展,閉環性能持續提升。其核心是,RoboTTT將測試時訓練整合到如視覺-語言-行動策略等機器人基礎模型中,產生一個序列模型,其遞迴狀態由快速權重組成,這些參數在訓練與推理期間皆透過梯度下降更新,將歷史壓縮至權重空間,並檢索上下文資訊以實現長上下文條件化。為了擴展訓練上下文長度,該方法結合了序列動作強制與截斷時間反向傳播。在具挑戰性的真實機器人操作任務中,RoboTTT相較於單步上下文基準提升了87%的整體表現,並完整完成一項五分鐘、十階段的組裝任務,這是任何基準方法從未達到的。以8000時間步上下文訓練的RoboTTT,其表現比相同模型以1000時間步預訓練高出62%,這表明上下文長度可作為機器人基礎模型的一個新擴展軸。影片請見 https://research.nvidia.com/labs/gear/robottt/
MeanFlow生成器通過預測時間區間內的平均速度,實現了快速的少步採樣,使其在高效生成中具備吸引力。強化學習(RL)已成為一種將擴散模型和流模型與人類偏好及任務特定目標對齊的強大方法。特別是,DiffusionNFT提供了一種高效的順向過程RL框架,無需反向過程軌跡或似然估計。然而,將此類RL方法應用於MeanFlow仍未得到充分探索。DiffusionNFT優化瞬時速度,而MeanFlow則使用平均速度進行採樣。為彌補這一差距,我們引入了MeanFlowNFT。受橋接平均速度與瞬時速度的MeanFlow恆等式的啟發,我們構建了一個誘導的瞬時速度預測器。我們將DiffusionNFT目標應用於該預測器,從而使獎勵優化對MeanFlow而言定義明確。採樣仍基於平均速度,保留了MeanFlow快速的少步生成能力。我們進一步證明MeanFlowNFT繼承了DiffusionNFT的嚴格策略改進保證。在圖像和視頻生成上的實驗表明,MeanFlowNFT持續改進基線模型。此外,它在大多數指標上(SD3.5-M上8項中的6項)優於先前的最先進RL調優少步生成器,甚至可以在僅使用少量採樣步驟的情況下超越多步RL調優擴散模型。例如,在Wan 2.1上,4步MeanFlowNFT達到84.33的VBench分數,超越了50步LongCat-Video RL(82.57)。
音樂生成基礎模型近期引起了業界的廣泛關注。然而,如何在支援可控性的同時,實現高效率生成與高保真長音頻仍是一大挑戰。為滿足這些需求,我們提出 WanSong——一個簡單而強大的方案,用於生成商用級別的長格式歌曲。與自回歸(AR)及級聯多階段流程(例如先執行 AR 再進行擴散)不同,WanSong 是一個純粹基於擴散的模型,能夠直接生成長達 5 分鐘的高保真多語言歌曲,並在一次執行中輸出雙音軌(人聲與背景音樂)。此外,我們的擴散框架透過步驟蒸餾實現更快的推論速度,並提供高效率的微調與定制途徑,以支援下游編輯任務。
循環Transformer通過將一組緊湊的物理區塊多次應用,來擴展序列計算,從而增加展開深度而不增加儲存參數。這種重複使用改變了殘差縮放問題:在非共享Transformer中,每個殘差分支會接收並應用自身的參數更新;而在循環Transformer中,一個共享更新會聚合來自多次訪問的梯度,並在下次線性化前向傳遞中被相同的訪問再次讀取。我們透過一個由「訪問對齊係數」κ_R 控制的一階擾動界限,將這種綁定深度效應形式化。當訪問之間失去相關性時,此界限恢復了 DeepNorm 指數;但在保守的對齊狀態下,隨著固定物理深度中循環次數增加,需要將指數從 1/4 提升至 1/2。由此產生的方法 DeepLoop 保留了 Post-LN DeepNorm 架構,並針對展開深度 N 設定 α=(2N)^{1/2} 及 β=(8N)^{-1/2}。在 GPT-2 小規模與中規模的 GPT 風格循環語言模型中,當沒有物理區塊被重新訪問時,DeepLoop 表現為中性;一旦啟動循環深度,則能改善驗證損失與下游任務準確率。這些結果顯示,穩定的循環深度需要考慮參數訪問的殘差縮放規則,而不僅是名義上的層數。
視覺障礙者因獲取視覺資訊受限,在日常生活中面臨諸多重大挑戰。儘管多模態大型語言模型(MLLMs)在通用視覺與語言任務上已取得顯著成果,但其在真實盲人輔助場景中的實用性仍鮮少被深入探討。為填補此一缺口,我們提出VIABench,一個專門設計用以評估MLLMs於視覺障礙輔助情境表現的綜合性影片基準測試,該測試採用視覺障礙者自身錄製或分享的第一人稱影片資料。VIABench定義了三項核心任務,分別對應視覺輔助中的不同需求。**主動提醒**:評估模型在解讀即時影片內容的同時,能否主動預測並以口語描述即將發生的導航關鍵事件;**視覺問答**:評估模型回答使用者針對影片中環境或物體所提出問題的能力;**視覺引導互動**:測試模型具備情境感知推理能力,以完成使用者與環境間的有意識互動。為確保評估的穩健性與公平性,我們提出一套嚴謹的基準測試流程,同時支援線上(即時)與離線兩種設定。實驗結果顯示,現有MLLMs仍難以為視覺障礙者提供全面支援,尤其在需要準確預測與即時回應的主動提醒任務中表現不足。我們期望VIABench能推動未來研究朝向開發專為真實輔助情境客製化的MLLMs邁進,最終提升視覺障礙者的導航與互動體驗。程式碼與資料將於 https://github.com/MCG-NJU/VIABench 公開釋出。
我們報告一種能同時讓凍結的小型語言模型更具能力且大幅降低成本的方法,且無需改變任何權重。經驗證的知識以位元組精確的鍵值狀態工件形式一次性儲存,隨後透過嫁接方式恢復到新的推論上下文中。此恢復是位元精確的:在固定的確定性配置下,嫁接後的logits與全新計算在位元組上完全一致(SHA-256雜湊相等),零Kullback-Leibler散度,並在五十個樣本上100%的argmax一致。我們證明,在具有浮點旋轉編碼的模型中,自身位置嫁接是唯一的數值精確操作點,並在兩個模型規模(12B、31B)和兩個GPU目標上驗證了位元組精確性,其中一個目標通過預註冊的重放進行驗證。在AIME 2025上,凍結的Gemma-4-12B在嫁接經驗證的解決方案庫後,從80.0%提升至93.3%,高於其自身的77.5%及其31B同款的89.2%已發布基準。在重複案例中,基礎模型在401,026個token預算內從未解決的八個問題,通過緩存的經驗證解決方案在總共61個解碼token內得到回答,token數量減少了6,574倍,能耗降低約8,700倍;能力主張的恰當依據在於保留的遷移測試(31B上7/7全數通過)。相同的位元組精確儲存將可用上下文從32,768個token擴展到2,854,766個token,且不增加加速器記憶體,並在相同架構的機器之間實現位元組級別的遷移。我們從行為層面描述此系統;引擎為專有技術,每個報告的數字都有已提交的輸入和輸出雜湊支援,因此無需引擎即可重新檢查評分。
上下文學習通常被解讀為一種條件推論形式,其中提示指定了背景脈絡,而模型的輸出則被視為對應條件分布之估計。若此解讀成立,則大型語言模型的估計應滿足基本的機率恆等式。具體而言,全機率定律主張先驗加權的條件分布會在任何有效的族群分割上匯總成族群層級的邊際分布。在本研究中,我們探討大型語言模型的估計在多大程度上遵循此自洽性原則。我們使用二元樹作為評估框架,藉以遞迴分割族群,形成日益細緻的子群體。接著,我們透過提示向大型語言模型提供語言化的子群體描述,將由此得出的估計結果匯總回族群層級,並比較不同粒度分割下的估計值。將此方法應用於多個問題領域及當前最先進的前沿模型後,我們發現基本一致性性質普遍遭到違反。針對角色提示的深入分析揭示了一種我們稱之為「宏觀謬誤」的模式:從更細緻子群體回應中重建的估計,往往比直接取得的族群層級估計更貼近人類參考數據。此效應在樹狀結構與估計任務的變化中持續存在,並可經由隱式提示部分復現。綜合而言,這些發現顯示模型具備相關的子群體知識,但無法可靠地將其傳播至匯總估計中。此差距使得統計自洽性成為一項未飽和、且無需參考點的評估大型語言模型之準則。
近期可泛化的3D高斯泼溅模型在长序列新视角合成(NVS)方面取得了进展,但代价是大量冗余计算。我们基于两项观察认为该冗余可被缓解:(i) 高质量NVS并不严格需要高精度几何;(ii) 外观学习通常比几何重建更容易。受此启发,我们提出一种解耦几何与外观建模的非对称架构。几何分支以粗粒度令牌(token)处理多视角重建,并承载大部分参数;外观分支则以细粒度令牌运行,用显著更少的参数捕捉细节。两分支通过双向连接实现交互,从而为各自任务提供相互引导。这种任务感知的非对称性减少了计算冗余,使计算分配更为合理,进而提升参数效率,使较小模型也能达到强性能。在32视角960P输入下,我们的模型与基于优化的方法性能相当,同时实现近800倍加速;并以显著更少的参数及更低的训练/推理开销,超越最先进可泛化模型的零样本性能,实现整体效率提升。
代理式檢索增強生成(RAG)透過允許語言模型反覆進行推理、生成搜尋查詢、檢索證據及預測答案,從而擴展了靜態RAG。然而,模型在決定何時檢索、是否使用詞彙匹配或語義相似度,以及如何控制上下文粒度以避免無關詞彙干擾代理推理方面,仍面臨挑戰。本文提出GRASP,一個用於訓練代理在進行多步推理時能自適應協調互補檢索工具的強化學習(RL)框架。GRASP賦予代理語義搜尋、關鍵字搜尋及段落閱讀等行動,使其能檢索句子級證據,並僅在必要時擴展更多上下文。我們透過一項同時考慮答案準確度、實證閱讀、互補搜尋及輪次效率的獎勵函數來訓練策略。在多跳推理基準上的實驗顯示,與單步檢索、基於提示的代理式RAG以及基於RL的檢索基準相比,GRASP在檢索召回率與下游問答表現上均有提升。定性分析與消融分析表明,學習到的策略發展出可解釋的略讀與掃讀行為:使用語義搜尋進行廣泛探索,利用段落閱讀進行局部驗證,並以關鍵字搜尋尋找實體特定證據。這些結果顯示,學習協調檢索信號與上下文粒度對於代理的正確推理至關重要。
體現認知要求智能體能將高層次的任務推理與待實現的物理狀態相連結。我們提出Hy-Embodied-RxBrain,一個具備語言與視覺聯合推理與想像能力的體現認知基礎模型。不同於強調場景理解與文字決策的視覺-語言模型,或主要預測未來視覺狀態的生成式世界模型,RxBrain在單一規劃序列中表達體現計畫,其中語言與視覺想像扮演互補角色。語言提供計畫的抽象結構,包括任務分解、規劃基元、約束條件、時間順序與決策邏輯,而視覺想像則透過世界狀態預測與聯合子目標規劃來具體化此結構,將每個規劃步驟與中間及最終的物理狀態連結起來。RxBrain採用統一的混合式Transformer多模態架構,能在單一模型中支援語言、圖像與影片的理解與生成。為訓練此能力,我們建立自動化流程,將體現影片分解為規劃步驟,並將其與視覺狀態轉換對齊,從而將影片轉換為聯合文本-視覺規劃監督信號。我們進一步提出RxBrain-Bench,以評估模型是否能透過聯合文本與視覺成分來表達體現計畫,而非僅僅進行分離的理解或生成。實驗顯示,RxBrain保有體現理解與生成能力,並能產出包含耦合文本推理、世界狀態預測與聯合子目標規劃的計畫。我們亦將RxBrain擴展至連續機器人動作生成,在不經大規模動作資料預訓練的情況下,即在真實機器人上展現出有前景的表現。這些成果為邁向體現認知基礎模型提供了初步步驟。
CAD到图像对齐的目标是从单张RGB图像中估计物体的9自由度姿态(旋转、平移及各向异性缩放),从而支持机器人与增强现实等应用。现有零样本方法利用视觉基础模型将图像区域与CAD模型匹配,但这类对应关系通常依赖外观驱动,在遮挡或仿真到真实领域迁移时表现不佳。为解决这些问题,我们提出SUFLECA(针对CAD对齐的扩展特征学习框架),这是一种用于零样本CAD对齐的弱监督框架,包含两项关键贡献。首先,SUFLECA通过标准化物体坐标监督,在涵盖12个真实与合成数据集的67.4万张图像上,从预训练视觉表征中扩展几何扎根特征学习,从而学习到跨领域泛化的紧凑几何感知特征。其次,我们提出一种几何一致性匹配算法,建立可靠的CAD到图像一对一对应关系。这些贡献使得每个物体实例能够实现精准、亚秒级对齐,无需迭代姿态优化。在ScanNet25k数据集上,SUFLECA达到33.4%/42.3%的分类/实例准确率,以更小的计算开销超越最强的零样本基线10.3/12.2个百分点,并且在该基准上首次超越全监督方法。代码地址:https://github.com/snt-arg/SUFLECA
視頻模型正逐漸演變為視覺基礎模型,但仍缺乏人類般的多步驟推理能力。串流自迴歸擴散模型雖具效率,但在推理上有所局限;而雙向擴散雖能實現全局修正,卻因密集的逐幀去噪而導致高昂的推論成本。這兩種典範在處理複雜推理任務時,皆難以兼顧邏輯一致性與低延遲串流。我們提出 HDR(分層去噪視覺推理),這是一個統一框架,將分層潛變量整合至因果式影片生成中,以實現多步驟推理。HDR 將影片潛變量組織成樹狀層級結構,能夠在串流輸出前先進行由粗到細的推理。粗層去噪保留不確定假設以利全局規劃,而細層則逐步將這些假設精煉為具體的視覺狀態。此外,稀疏分層注意力模式(SHAP)進一步降低了時間注意力成本。我們引入一個包含分布外案例的層級分層多步驟影片推理基準,涵蓋六項任務:迷宮導航、河內塔、一筆畫、滑塊拼圖、倉庫番及倒水問題。與串流自迴歸擴散基線相比,HDR 將成功率從 34.22 提升至 60.29(相對增益 76.2%),並將平均進度從 76.00 提升至 89.56,展現更一致的推理軌跡。HDR 維持每個潛變量 0.70 秒的低延遲串流,推論速度比雙向擴散快 54.2 倍。此外,HDR 在僅使用 2% 訓練資料的情況下,仍保留 82.9% 的完整資料效能,而雙向擴散僅為 52.0%。實際機器人實驗更進一步證明 HDR 在物理互動與世界模型方面的潛力。專案展示:https://hierarchical-diffusion-reasoning.github.io/。
驗證自動駕駛系統需要多樣化且符合法規的測試場景。在基於模擬的測試中,場景被定義為可執行的腳本。然而,從法規描述中自動生成此類腳本仍是一項開放性挑戰,現有方法面臨根本性的權衡取捨。檢索-組裝方法可達到合理的編譯率,但缺乏可擴展性;而基於檢索的完整腳本生成則遭遇編譯成功率低的問題。我們提出Chat2Scenic,首個用於生成領域特定語言(DSL)場景腳本的迭代式檢索增強框架。具體而言,Chat2Scenic提供了一個支援互動式場景優化的聊天機器人介面,並整合了檢索增強生成(RAG),將場景生成建立在法規知識與DSL語法的基礎上。此外,我們提出了一個開放的場景生成基準測試,包含來自美國國家公路交通安全管理局(NHTSA)、聯合國車輛法規及其他來源的123個場景。與最先進(SOTA)大型語言模型(LLM)的廣泛評估顯示,Chat2Scenic實現了76.42%的編譯成功率(CSR)與58.17%的框架準確率(FA),優於現有方法(檢索-組裝:30.08% CSR、11.03% FA;檢索完整腳本生成:16.26% CSR、10.86% FA)。為促進未來研究,我們在https://github.com/TUM-AVS/chat2scenic開源了程式碼。
本文提出令牌时间连续扩散(TTCD),一种新型扩散语言模型,其核心特性包括:(a)在连续空间中运行,将高斯噪声确定性地映射至最终令牌画布,无需额外采样;以及(b)引入全新的逐令牌时间概念,使得部分令牌从噪声到令牌的推进速率快于其他令牌。连续空间建模有助于TTCD避免并行采样多个令牌——这是纯离散空间迭代模型在高加速比下出现不准确性的关键来源。逐令牌时间概念使TTCD能更好地建模条件生成,允许确定性更高的令牌以更快速率推进,并在精炼过程中实现差异化的令牌间相互影响。在高加速比下,TTCD表现优于离散模型。我们在OpenWebText上训练了1.6亿参数的TTCD模型,并对其进行自蒸馏;结果发现,在高加速比下,我们在无条件生成质量上与若干同规模、同数据训练并自蒸馏的现有模型相当,且在条件生成中表现更优。在数独求解任务中,我们也取得了类似的性能提升。