每日精選AI研究論文及翻譯
在策略蒸餾(OPD)提供了密集的詞元級監督,作為可驗證獎勵強化學習(RLVR)稀疏結果級優勢的替代方案。然而,教師對學生生成的軌跡進行評分,而這些軌跡本質上對教師而言是離策略的,因此其監督的可靠性,以及學生進步的來源,仍然不清楚。我們定量分析了OPD訓練期間的教師監督,發現存在大量噪聲,其普遍程度隨教師規模增加而上升。令人驚訝的是,學生策略對這種噪聲不敏感,無論保留還是移除噪聲監督,都能收斂到相當的性能。OPD到底有沒有在蒸餾?通過分析其收益的驅動因素,我們發現學習集中在低對數概率的詞元上,使用單一固定的負優勢即可達到與教師提供的優勢相當的性能。這表明OPD主要通過抑制低對數概率詞元來起作用,而這並不需要教師。這些發現催生了在策略自適應(OPSA),這是一種使用熵自適應負優勢的免監督方法。它對高熵位置賦予更強的學習信號,抑制尾部詞元,並在頭部詞元之間均勻重新分配概率質量。與基礎模型Qwen3-1.7B相比,OPSA在AIME24上將Avg@32提升了35.41個百分點,對應263%的相對增益,並且在所有三個基準測試上將Pass@32提升了超過一倍。它在AIME24上的Avg@32還比OPD高出16.77個百分點。跨模型家族和多項任務的大量實驗與分析進一步證明了其有效性和泛化能力。
近期視頻生成器往往省略音訊,或是在獨立階段合成音訊,限制了視覺動態與聲學事件之間的雙向建模。我們提出 DreamX-Creator 1.0,一套以 7B 生成器為核心的精簡原生聯合音訊-視頻生成系統。在以首幀及文字提示為條件的情況下,該生成器聯合去噪模態特化的音訊與視頻串流。這些串流在網路前半部分獨立處理,並在後半部分通過門控跨模態注意力進行耦合,其中以 token 級與注意力頭級輸出閘控調節每個啟用的跨模態注意力頭輸出。統一的音訊-視頻資料系統構建並過濾時間連貫的片段、產生結構化的多模態註解,並將片段組織為能力導向的資料池。漸進式聯合訓練包含兩個音訊-視頻預訓練階段,隨後進行高品質微調。音訊-視頻強化學習進一步以模態感知多模態回饋對生成器進行後訓練,將視頻、音訊及跨模態回饋分別導向對應的串流。為達成高解析度輸出,我們的自迴歸 1 步 2K 精煉流程將雙向多步教師模型改編為自迴歸多步精煉器,並將其蒸餾為每個時間片段僅需一次去噪評估的學生模型。整體而言,DreamX-Creator 1.0 實現了原生且同步的音訊-視頻生成,效能可與最先進的開源系統相抗衡。透過釋出我們精簡的 7B 生成器與 2K 精煉器,我們期望促進原生音訊-視頻生成的普及化,並為未來統一音訊-視頻生成建模研究提供可及的基礎。
可組合場景建模旨在將真實室內場景還原為完整的、可編輯的物體資產,並按照觀測到的排列方式呈現,為機器人模擬與具身AI提供一個可直接用於模擬的真實環境副本,其中物體可被逐一操控。現有管線將此任務分解為三個步驟——將觀測解析為實例、為每個實例生成資產、再將每個資產放回原位——但每個步驟都預設了一種雜亂場景捕捉難以提供的輸入:精確的實例幾何、無遮擋的視角,以及與觀測精確匹配的資產。我們提出Lucida,它保留了這一順序,但重新分配了各步驟的需求,使每個步驟僅使用真實捕捉能可靠提供的資訊,並在管線末端達成精確度,而非在起點就要求精確。Lucida將影片解析為場景圖,圖中節點承載每個實例的多視角證據,再從該證據為每個實例生成完整資產,並以GizmoAct放置資產。GizmoAct是一種視覺語言模型(VLM)策略,將放置任務轉化為多輪GUI互動,在閉環中操控物件的gizmo(操作控件),自行判斷何時達成對齊。在場景級3D物體偵測、物體姿態估計和場景重建方面,Lucida在R2S-Scene上相較Boxer將mAP提升了69%,在CA-1M上將ADD-SB@0.05從57.8%提高至83.4%,並將場景F-Score從SAM3D的0.794提升至0.924。
潛在生成模型通常遵循兩階段流程:先訓練變分自編碼器進行重建,再在凍結的潛在空間上訓練生成模型。由於以重建優化的潛在表徵未必利於生成,聯合訓練兩個模型便成為一個具吸引力的替代方案。然而,直接的端到端訓練仍具挑戰性,因為它容易發生潛在崩潰,並面臨生成與重建之間的衝突。我們重新審視此問題,分析不同目標函數如何塑造潛在空間,並提出兩項關鍵洞見。首先,Kullback-Leibler 散度目標中的熵項對防止崩潰至關重要:重建與先驗擬合傾向於收縮後驗,而熵則保留非退化的潛在不確定性。其次,重建與生成表現出不對稱的學習動態:重建快速且具有強監督,而生成則較慢且更難優化。基於這些洞見,我們首次實現了無潛在崩潰的直接端到端訓練,並提出 GenFirst——一種簡單的「先生成、後重建」策略。生成目標先在較弱的重建壓力下塑造潛在空間,隨後逐步加強重建以恢復視覺細節。我們使用具有精確似然的連續自迴歸先驗以及具有隱式似然的 SiT 先驗來驗證 GenFirst。憑藉我們的端到端目標與 GenFirst,SiT 在 ImageNet-256 上達到有 CFG 時 gFID 0.97、無 CFG 時 1.45 的表現,而 MMDiT 在文字到圖像生成任務上達到 GenEval 0.90 的分數。除圖像生成外,我們將此框架擴展至用於生成與表徵學習的共享視覺潛在表徵,以及連續的統一文字-圖像生成。這些結果證明了穩定端到端潛在學習在各種生成先驗與模態間具有普遍適用性。
雖然低秩適應(LoRA)廣泛用於參數高效的模型適配,但如何對其訓練動態進行正則化以實現穩定且有效的優化,仍未被充分探索。由於 LoRA 將上投影初始化為零,其早期優化動態主要由下投影主導。基於此觀察,我們提出歸一化低秩適應(NoRA),一種簡單而有效的方法,在訓練期間對下投影矩陣進行歸一化。我們進一步證明,同樣的歸一化可以僅在初始化時應用,從而改善標準 LoRA,無需在整個訓練過程中重複歸一化。在預訓練、監督式微調和強化學習中,NoRA 持續加速收斂、提升效能與訓練穩定性,並緩解災難性遺忘。這些優勢既不需要額外的可訓練參數,也不需要推論時的計算,使 NoRA 成為一種簡單且廣泛適用的 LoRA 增強方法。
研究規劃是 AI 科學家的決定性能力。然而,研究計畫沒有可驗證的答案,因此強化學習缺乏其所需的環境:與評判器配對的任務。從科學論文中提取的評分標準可以提供評判器。然而,現有流程從相同內容中提取問題與標準,因此可藉由改寫獲得獎勵。評分標準更被壓縮為每次 rollout 的單一標量。我們提出 PaperGym,一個將每篇研究論文轉化為完整訓練環境的統一框架。PaperGym 利用論文結構:問題綜合自研究目標與背景,而標準則源自方法與實驗。這些標準涵蓋方法創新與實驗設計,評分標準洩漏率降至 3.7%,而現有資料集則介於 11.90% 至 34.10% 之間。訓練兩次使用評分標準:首先作為 OPSD 自我教師的特權上下文,然後作為 GRPO 的獎勵。在 Qwen3-1.7B/4B/8B 上,此排程優於監督式微調、單獨任一個階段以及相反的順序,將五個基準的平均值分別提高 +5.6、+5.0 和 +4.8 個百分點。在配方固定的情況下,使用 PaperGym-20k 訓練的模型在三方比較中勝率為 58.1%,而 RubricHub Science 僅為 28.2%。訓練後的 Qwen3-8B 在 ResearchQA 上達到 73.48,超過規模大得多的 Kimi K2.6。我們釋出流程、包含 20,000 個實例的語料庫 PaperGym-20k,以及基準 PaperGym-Innov 和 PaperGym-Design。
我們描述了 Qwen3.8-Flash-Next 的架構與消融研究。這是一個稀疏混合專家模型,擁有 125B 參數,每個詞元激活 6B 參數,並額外配備 51B 參數的 n-gram 嵌入表,儲存於加速器之外。在十四個預訓練基準測試中,該模型在八個項目上領先其 397B-A17B 的前身,在其餘項目上最多落後 2.6 分,同時僅使用三分之一的激活參數、三分之一的訓練詞元,以及約九分之一的訓練浮點運算量(FLOPs)。詞元混合採用了 Gated DeltaNet(GDN)與全域注意力的分層混合結構,每四層中有一層為全注意力層;在持續預訓練階段,這些全注意力層被替換為 Qwen 稀疏注意力(QSA),該機制以微塊粒度並透過壓縮的輕量級索引器對上下文進行評分。殘差流被擴展為四個分支,並透過元素級門控讀取,我們將此設計稱為門控殘差(Gated Residual, GR)。容量透過單一 n-gram 嵌入層在主幹網路之外增加,其查表從主機記憶體預取。我們沿三個維度評估每項候選變更:損失與下游基準測試;該變更在訓練、預填充(prefill)和解碼(decode)中的成本;以及其對最佳超參數與訓練穩定性的影響。損失與下游準確率並不總是同步變化:擴大 n-gram 詞彙表會單調地降低損失,但下游準確率會趨於飽和。該架構與 Muon 最佳化器共同將最佳學習率和批次大小向上調整,使批次大小預熱不再必要,並大幅提升了壓力測試下的穩定性。損失、基準測試、效率與穩定性構成單一設計問題。若能聯合求解,便能得到一套同時更具效率、能力更強且更穩定的方案。
我們提出 CogEvol,這是一個專為學習環境生成(Learning Environment Generation)所訓練的模型系列:它能將課程概要轉化為完成的學習工件(結構化 JSON 投影片或自包含的互動式 HTML 頁面),且只需單次生成。在 220,000 次生產請求中,CogEvol 生成一張投影片的中位時間為 17 秒,生成一個互動頁面則為 59 秒,取代了耗時數分鐘的多輪代理腳手架。可靠性是透過機制強制保證,而非寄望於偶然:一套基於生產環境的資料管線將真實失敗轉化為 53,687 筆經驗證的 SFT 樣本;結合規則與 VLM 的混合獎勵函數則驅動基於 GRPO 的強化學習,並在我們察覺並修復一次獎勵欺騙事件(該事件產出視覺上具有說服力卻無法遊玩的遊戲)後,此機制獲得進一步加固。CogEvol-27B 在投影片品質評分上取得 83.7 分,在 500 案例的互動式 HTML 基準測試中取得 63.7 分,且參數量僅為旗艦級程式碼模型的 1/26.9;此外,它與 OpenMAIC 團隊合作,為其即時生產流量提供服務。CogEvol-4B 已以 Apache 2.0 授權開源釋出,網址為 https://github.com/CogEvol/CogEvol-4B;外部旗艦模型則在相同測試套件與完全一致的評測框架下進行評測。腳手架編輯進一步將互動式頁面的生成成本降低約 76%;整個技術棧可運行於國產昇騰(Ascend)加速器上,應用層效能與 A800 GPU 相當,從而降低大規模 AI 原生教育的單位成本。
大型語言模型(LLMs)在數學推理基準上表現強勁,然而支撐其推理能力中具有數學意義的技能仍未被充分探索。我們提出 SHAPE,一個透過數學教育領域所發展出的兩個視角來分析思維鏈(Chain-of-Thought, CoT)軌跡的框架:(1)語義空間:模型對問題不斷演變的數學詮釋(例如代數、幾何),以及(2)啟發式策略:模型在這些空間內採取的具體數學行動(例如簡化問題、倒推求解)。我們首先使用 SHAPE 分析多種模型的推理模式。研究結果顯示,模型所採用的數學啟發式策略比傳統 CoT 特徵更能解釋最終答案的正確性。此外,模型若將其推理努力集中於少數語義空間,而非探索許多互不相關的空間,則更可能得出正確解答——此模式與人類行為一致。接著,我們利用 SHAPE 視角評估後訓練是否真正提升數學能力。我們發現強化學習會誘發啟發式策略使用上的模式尋求(mode-seeking)現象。最後,我們透過促進多樣化的啟發式策略來後訓練 LLMs,並證明其在提升準確率方面的有效性。整體而言,SHAPE 提供了一個具理論基礎的診斷框架,用以解碼 LLM 推理,並為後訓練 LLM 以增強數學推理開闢了新途徑。我們模型的程式碼可於 https://github.com/holi-lab/SHAPE-of-CoT 取得。
具身導航要求智能體在不同的任務、環境與機器人形態之間,將異質目標與視覺觀測轉化為行動。現代視覺語言模型(VLM)已編碼了支援視覺定位、空間推理與指向的空間先驗,但這些能力很少被直接引出用於機器人控制。現有導航系統反而依賴任務或形態特異的組件,將感知、推理與行動分割開來,僅提供有限的泛化能力。在此,我們提出 LightNav-0,一個緊湊的通用型具身導航模型,它激發預訓練 VLM 的空間智能並將其與導航對齊,無需任務特異的預測頭。LightNav-0 透過統一的 token 介面表示多樣化的導航任務:雙通道指向表達與任務、場景及形態無關的空間意圖,而殘差向量量化動作 tokenizer 則將此意圖映射為精確且特定於形態的軌跡。結合具時間感知的視覺歷史壓縮、具身推理中間訓練、監督微調與強化學習,此設計使單一模型即可支援指令跟隨、開放詞彙物體導航與視覺追蹤。該導航訓練語料庫涵蓋 2,000+ 個場景與 4,000+ 小時的具身導航資料。用於初始化 LightNav-0 的具身推理檢查點 LightNav-ER,在 8 個具身推理基準上取得最高的完整基準集平均;而 LightNav-0 在所有 10 個公開導航模擬設置中均達成單目成功率的最先進成果。真實世界評估更進一步展示了在跨機器人形態、多樣場景及靜態與動態目標上的零樣本泛化能力。這些結果確立了緊湊型 VLM 作為通用型具身導航之統一且可遷移骨幹的地位。
組織經常開發並維護相關應用程式的組合:這些可獨立部署的程式碼庫共享大量領域邏輯、介面模式或運作慣例。隨著 LLM 編碼代理日益被用於生成和維護此類軟體,逐一應用程式的樸素工作流程會在程式碼庫之間重複共享邏輯,並使長期的代理式維護逐漸累積冗長度、死程式碼與結構侵蝕。我們提出「超級函式庫代理問題」(Super Library Agent problem),其中代理依序生成 N 個相關應用程式的組合,同時維護一個共享的「超級函式庫」,內含可跨應用程式重複使用的元件。原則上,一個最簡的順序式骨架可以抽取共享程式碼並將應用程式遷移到不斷演進的函式庫,但在實務上卻存在抽取召回率低與依賴遷移脆弱的問題。我們透過以下方式解決這些失敗:對程式碼區塊摘要進行候選導向抽取、在抽取前進行程式碼庫整併,以及利用抽取軌跡與呼叫圖資訊進行上下文感知遷移。在 WebGen-Bench 與 PaperBench 上,我們的方法在保留應用程式功能之餘,相較於零次學習顯著降低了冗餘與 token 佔用量(冗長度、token 長度),並避免了由樸素函式庫建構所引入的結構侵蝕,同時在 LOC 與 MDL 上也有進一步的減少。我們的程式碼位於 https://github.com/sbigstar0310/super-library-agent。
雖然大型語言模型(LLMs)納入用戶個性化訊號以提升可用性與助益性,但當模型在個人化情境(如對話歷史、推斷的偏好及用戶檔案)的條件下進行運作時,其日益從提供平衡且具資訊性的回應,轉向最佳化用戶滿意度。具體而言,我們識別出三項新興風險:(1)無關個性化,即模型在不必要的語境中引用個人資訊;(2)偏好窄化,即模型強化資訊回聲室效應;以及(3)諂媚偏誤,即模型過度認同用戶觀點。因此,模型可能在不必要的語境中引用個人資訊,無意間導致回應多樣性下降,或過度迎合用戶意見。儘管個性化在AI助理中的應用日益普及,對其潛在副作用的系統性評估仍相當有限。為填補此研究缺口,我們提出PRISK,一個具動態評估框架,結合自動化資料生成與量身定制的指標,用以揭露當前LLM個性化的系統性限制,以及個性化資訊如何形塑其回應。我們對13個LLM的實證分析顯示,用戶檔案與檢索記憶的存在 consistently 加劇了各項偏誤,導致無關個性化平均下降45.9%、偏好窄化下降41.7%、諂媚偏誤下降61.7%。
近年來,大型推理模型(LRMs)的進展顯示,具可驗證獎勵的強化學習(RLVR)能大幅提升數學與程式編寫领域的推理能力,因為這些領域的結果可以自動檢查。然而,要將此進展延伸至開放式與代理型(agentic)任務仍具挑戰性,因為可靠的獎勵更難取得,而直接的人類監督也無法跟上模型生成經驗的規模與複雜度。本文探討當人類監督逐漸退出學習迴圈時,大型推理模型如何持續進步。我們檢視此問題的兩個相互關聯的面向。獎勵軸線追溯從單一實例的人類判斷,發展至可重複使用的驗證器(verifiers)與獎勵,甚至在沒有回饋的情況下也能運作。經驗軸線則探討學習如何從人類策劃的任務與環境,進展至自我生成的課程、建構環境,以及自主的共同演化。我們透過從L0到L4的五級階梯來連結這兩個面向,以辨識學習過程中哪些部分仍持續由人類控制。我們的分析進一步凸顯日益自主的獎勵與經驗生成所帶來的風險,包括獎勵駭取(reward hacking)、回饋漂移(feedback drift)、課程崩潰(curriculum collapse)與環境錯誤(environment errors)。因此,我們也圍繞三個互補的對象提供評估:政策能力(policy capability)、回饋忠實度(feedback fidelity)與經驗品質(experience quality)。此分析提供了當前超越人類監督擴展大型推理模型方法的結構化說明,以及發展朝向超級智能的自持續學習系統所涉及之開放問題。此外,我們維護一個持續更新的GitHub儲存庫(https://github.com/visitworld123/Awesome-Scaling-LRM-Beyond-Human-Supervision),以追蹤最新進展。
LLM與VLM智能體的策略性欺騙行為已成為AI對齊與安全領域的核心關注點。社交推理遊戲(每位玩家持有隱藏角色,並透過相互溝通推斷身分)長期作為此類研究的標準測試平台,尤其在多智能體環境中。然而,現有測試平台僅限於純文字形式,且運行於單一固定的智能體配置之上,既遺漏了欺騙分類法視為核心的非語言感覺運動通道,亦無法釐清所觀察到的行為究竟反映底層模型本身抑或其所處的測試框架。我們提出MineAmongUs——一個3D多模態《Among Us》沙盒環境,其中內鬼智能體必須透過語言與非語言行動的協同配合來欺騙船員。此外,我們提出ARIA——一個可配置的VLM智能體測試框架,揭示五個認知元件的消融維度;並提出一套植基於欺騙分類法的原子級與弧級標註方案,透過以LLM作為裁判(LLM-as-a-Judge)的方式大規模落地,其原子標註一致性接近人類水準。實證結果顯示,VLM智能體確實會透過語言與非語言欺騙的協同配合來追求內鬼勝利,其中非語言通道在框架消融與跨VLM評估中均浮現為更具決定性的致勝因素。綜上所述,本研究為具身VLM智能體對齊研究開闢了新路徑。
互動式世界模型將影片生成從離線片段合成擴展至對互動式虛擬世界的持久模擬,使其能應用於遊戲、機器人、具身智能體與擴展現實等領域。然而,實現穩定的長時域互動生成仍具挑戰性,因為模型必須同時保持場景幾何、動態一致性與相機控制,並支援即時自迴歸生成。基於Matrix-Game 3.0,我們提出Matrix-Game 3.5,如圖1所示,透過三項關鍵改進,將即時互動式世界生成推進至幾何感知與長時域一致的模擬。首先,我們提出統一的幾何感知記憶框架,其區塊記憶與分塊PRoPE組件不引入額外可學習參數,結合顯式3D區塊檢索與投影相機條件約束,實現幾何一致的相機控制與忠實的長時域場景回溯。其次,我們引入靜態-動態解耦的世界表徵,分別建模靜態場景幾何與動態主體,從而在長時域生成中同時保持幾何一致性與主體身份。第三,我們開發了兩階段漸進式即時蒸餾框架,透過感知流匹配與基於課程學習的自滾動DMD,將雙向擴散模型轉化為少步驟因果生成器,實現長達數分鐘的即時互動生成。大量實驗表明,憑藉涵蓋Unreal模擬環境、開放世界遊戲與網路影片的統一訓練語料庫,Matrix-Game 3.5在長時域場景回溯、精確相機控制、主體一致性、提示驅動的世界生成以及穩定的即時開放世界互動方面均展現出優異性能。
自主科學研究智慧體越來越常被應用於端對端科學工作流程,包括文獻回顧、資料分析、實驗與報告生成。然而,開放式研究任務往往未能清楚界定完成任務所需的分析、方法與成功標準。因此,智慧體可能遺漏重要分析、使用不當方法,或得出缺乏充分證據支持的結論。為了解決此問題,我們提出 AutoSciRub,這是一個評估優先框架,在研究執行前生成任務特定的可執行評分標準,並以此引導執行、標準層級的驗證以及迭代式修訂。AutoSciRub 將規範不足的指令分解為原子科學目標,將其奠基於相關文獻與任務可見資料,並綜合出具體、可操作且可驗證的標準。由此產生的評分標準將隱含的實驗與證據需求明確化,為實驗與分析提供指引。在修訂階段,以評分標準引導的驗證能識別未達成的標準,並對研究報告及其支援材料進行有針對性的改進。在 ResearchClawBench 上,AutoSciRub 一致地提升了所有受測配置:在固定 Codex 執行框架下,三個骨幹大型語言模型的平均增益為 2.08 分;在使用固定 DeepSeek-V4-Flash 骨幹的三種智慧體執行框架上,平均增益為 2.95 分。在 AstaBench E2E Discovery 隨機抽樣的 20 個任務子集上,AutoSciRub 在三種智慧體執行框架上進一步取得平均 16.8 分的提升,同時維持或增加了成功完成的任務數量。這些結果顯示,評估優先的引導方式為自主科學研究提供了一種有效且可推廣的控制機制(程式碼:https://github.com/zjunlp/AutoSciRub)。
潛在擴散模型已成為高保真影像與視訊合成的主流框架,其透過變分自編碼器在緊湊的潛在空間中運作,以提升計算效率同時不損害視覺品質。然而,傳統的變分自編碼器對於視訊資料而言並非最佳選擇,因為它們採用固定的壓縮率,無法適應時空內容的複雜度變化。我們提出KATok(保留或丟棄?自適應緊湊視訊表徵的分詞器),這是一個基於Transformer的變分自編碼器,其結合了與潛在令牌共同學習的自適應令牌選擇器。透過評估每個令牌的內容豐富度作為保留或丟棄之機率,令牌選擇器能有效丟棄不具資訊性的令牌,自然實現資料依賴性的壓縮。將自適應分詞應用於擴散模型可能導致空間錯位,因為令牌丟棄可能擾亂原始的時空結構。為緩解此問題,我們提出兩種位置預測策略:級聯生成與聯合生成,以確保空間一致性。我們經由實驗證明,我們的模型在先進的壓縮率下實現了強勁的重建與生成品質。對視訊資料的進一步分析顯示,此改進主要來自於降低時空冗餘並移除不具資訊性的令牌,此結論獲得了量化與質性結果的共同支持。
思維鏈(CoT)監測假設推理軌跡能忠實記錄塑造模型答案的資訊。現有的忠實性測試常在用戶訊息中放置明確的偏見線索,而智能體可能透過工具返回或原始產物接觸到偏好。我們引入FACE-Eval(線索效應的忠實歸因評估),這是一個包含5,100個樣本的評估基準,其操縱線索位置(用戶訊息或工具返回)與明確性(直接摘要或原始產物)。我們衡量遵循線索之回答中的口頭化承諾,以及所有含線索樣本中的非口頭化採納。我們評估來自八個家族的15個開放權重模型,總參數量介於4B至1.60T之間。所有模型在工具返回線索下的口頭化承諾均低於用戶訊息線索,且在隱式線索下低於明確線索。非口頭化採納在全部15個模型上對工具返回線索較高,在30個模型-通道比較中的28個中對隱式線索較高。來源歸因提示在七個模型上縮小了通道差距,有時是透過增加用戶通道的非口頭化採納來實現;而告知模型其推理將受到監測則無法可靠地縮小這一差距。我們亦使用兩個轉錄監測器(GPT-5.6-Luna與GPT-4o-mini)來檢測每個家族中最大模型的偏好採納。在32個模型-通道-明確性單元中,較高的非口頭化採納與兩個監測器較低的檢測能力相關(分別為Pearson r=−0.54與r=−0.78)。這些結果表明,在本研究所測試的單次調用、預填充工具設置中,當偏好資訊經由工具到達或必須從原始產物中推斷時,思維鏈監測的可靠性可能較低。
在部分可觀測環境中,AI代理需要協調主動感知與工作記憶,以維持持續演進的感知狀態。然而,現有基準測試因引入了物理與控制上的複雜度,難以分離出這種感知狀態建構與詮釋的能力。我們提出 MNIST-PRO 來解決此問題;此基準測試將 MNIST 數字辨識轉化為一個具回溯限制、依序進行瞥視的搜尋任務,藉此分離出代理式感知能力。我們在四種記憶表徵下評估了十個多模態模型,包括原始視覺歷史、文字狀態、結構化度量網格地圖,以及整合式視覺畫布。儘管模型在完全可觀測下表現優異,部分可觀測性卻暴露出明顯的效能落差。我們辨識出三個不同的瓶頸。首先,感知狀態的建構與詮釋構成一項挑戰,因為代理難以整合碎片化的瞥視。其次,代理往往在看完完整序列之前就停止探索。第三,即使面對後續相互矛盾的證據,模型仍常無法修正早期錯誤的信念。這些結果顯示,僅僅獲取視覺證據並不足夠;代理還必須能夠建立並更新可靠的感知狀態。
影像檢索傳統上被表述為一個逐點匹配問題,其中每個候選影像皆被獨立評分。然而,這種原子化範式無法捕捉個人照片收藏中人類搜尋意圖的複雜性——使用者往往追尋的是由結構性關係串聯而成的緊湊視覺故事,而非孤立的單張快照。為了解決此限制,我們提出了**影像束組合(IBC)**,一個新穎的範式,將目標從對個別影像進行排名,轉變為從大量非結構化照片池中動態組合成具有凝聚力的影像束。由於目標影像束並非預先定義,IBC 帶來了嚴重的組合爆炸挑戰,並要求對不可分解的聯合相關性進行建模。為了確立此範式,我們建構了 **IBCBench**,這是第一個 IBC 基準資料集,包含 109,467 張影像與 667 個經驗證的查詢,並透過半自動化驗證流程建立。此外,我們提出了 **BundleWeaver**,一個代理式框架,將 IBC 重新表述為查詢條件下的增量式超邊發現。透過運用大型語言模型自適應地搜尋缺失的關係角色,並利用視覺語言模型進行整體影像束驗證,BundleWeaver 得以有效地導航組合空間。大量實驗表明,儘管最先進的嵌入模型與靜態分解再排序範式存在關係盲點,BundleWeaver 仍取得了顯著的效能提升,凸顯了從原子化評分轉向動態關係組合的必要性。我們的資料集與程式碼均已公開。
大型語言模型(LLM)智能體日益被部署於長時程、互動式且具狀態的環境中。在這些設定下,單一錯誤動作——例如退款錯誤的購買項目——可能導致不可逆的任務失敗,且必須在執行前予以攔截。這類失敗未必出現在每一次單獨運行中,但可能在重複試驗中浮現,使得跨步驟與跨試驗的可靠性至關重要。然而,確保智能體的可靠性極具挑戰:即便是前沿的大型語言模型,也難以解釋某個動作何以可能出錯,尤其是在受領域特定規則約束的冗長交織軌跡中。近期許多研究依賴基於提示詞的批判智能體,而基於優化的方法則缺乏系統性的方式來產生豐富的驗證理據以供訓練之用。我們透過 CAST 填補此一缺口,這是一個批判感知訓練框架,可將稀疏的任務結果轉化為動作層級的監督訊號,用於批判學習與策略優化。CAST 分析智能體軌跡,以綜合出具結構化的理據,解釋在部分可觀測性下動作的有效性。所產生的批判模型被用於建構批判感知訓練資料,以優化策略模型。在動態工具呼叫基準上微調 Qwen3 系列模型後,CAST 提升了跨領域的可靠性,在零售任務中較 GPT-OSS-120B 高出逾 10% 的 pass^4 表現,並在域外設定的遠距醫療任務中額外獲得 9% 的提升。這些結果證明,批判感知訓練能提升大型語言模型智能體在真實動態環境中的穩健性。
長期視野的物理世界代理人必須在依賴可靠的閉環行為來落實決策的同時,對遙遠目標進行推理。當今的基礎模型將這些能力分割開來:視覺語言模型(VLM)能推斷缺失資訊並調整高層級計畫,但在重複的導航落地方面仍顯脆弱且低效;而導航基礎模型(NFM)能穩健地執行語意目標,但僅限於有邊界的回合,缺乏持續性的任務層級推理。我們提出 NavMCP,一個代理性脚手架框架,將 VLM 推理代理與 NFM 執行器結合,以進行長期視野的探索。VLM 決定要尋找哪些證據、往何處搜尋,以及何時停止;而 NFM 則將每個語意子目標落地為閉環導航。三個通道構成它們的協作架構:意圖(intent)將證據需求轉換為導航呼叫;觀測(observation)將軌跡轉換為具有來源根據的軌跡證據;記憶(memory)則跨呼叫累積發現、負面證據與未解決目標。此設計將孤立的導航軌跡轉化為持續的具身互動,且無需重新訓練任一模型。在具身問答任務上,NavMCP 在 HM-EQA、MT-HM3D 與 EXPRESS-Bench 達到當前最佳結果。在配對代理與執行器骨幹的條件下,它在 HM-EQA 上比回合制介面高出 14.9 個百分點。在 Unitree Go2 上,NavMCP 達到 78.3% 的成功率,且其相較於最強基線的領先幅度隨著任務視野拉長而從 10 個百分點成長至 45 個百分點。這些結果展現了將互補的基礎模型組裝為長期視野物理世界代理人的潛力。
近期的研究致力於從論文內容自動生成科學圖表(Lin et al., 2026; Zhu et al., 2026a)。然而,在單一輪次中完全滿足作者對於視覺與溝通的偏好極具挑戰:在我們的前導使用者研究中(N = 14),所有參與者在檢視初稿後均要求進一步修改,其中86%的人認為精煉後的圖表更令人滿意。儘管需求明確,多輪次工作流程仍然在很大程度上未被充分探索。為了填補此一缺口,我們提出MTPaperBananaBench,一個用於多輪次圖表生成的基準,包含292張圖像,並標註了3,518項使用者需求。為降低昂貴的人類研究成本並實現可擴展的基準測試,我們建構了一個使用者模擬器,在每一輪中識別未滿足的需求,並將其中k項轉換為自然語言回饋。同時評估需求滿足程度與整體圖表品質後,揭示了基線多輪系統共有的兩個關鍵失敗模式:(1) 品質漂移,即圖表品質在後續輪次中逐漸下降;(2) 遺忘,即先前已實作的特徵在後續輪次中遺失。為了解決這些問題,我們引入了PaperBanana-Interact,這是一個透過內部評論與修正迴圈來優化圖表的多代理系統。PaperBanana-Interact在多輪次中持續提升而非降低圖表品質,在品質評分上超越基線11.9至18.6分,並將遺忘情況減少3.7至6.2分。
VLM驅動的網頁代碼自我改進存在一個結構性缺陷:提出修復的模型同時也是評判修復的模型,而在該評判者視角下的視覺合理性,並不能很好地代表頁面是否真的能運作。此循環所缺少的是一個VLM無法欺騙的對手方,而瀏覽器正是這樣的對手方:它是一個確定性的、可執行的模擬器,模擬HTML工件在使用者操作下的行為,並且除了名稱之外,它就是網頁代碼的世界模型。我們提出WebWorld,這個介面讓VLM先驗可以自主地與這個「瀏覽器即世界模型」互動,並決定哪些互動會成為監督訊號。在每一輪中,VLM發出評論,規劃器將其編譯為型別化的互動契約;瀏覽器重新執行候選結果,且僅在目標進展與所有先前已驗證能力皆獲保留時,才發出驗收證明;經認證的轉變會累積成一個品質棘輪,而這是SFT輸出唯一能接觸到的東西。在匹配的訓練設定下,WebWorld-27B在HTMLBench-400上比Raw-27B提升了5.3分,在MiniAppBench-Val上提升了14.9分,並在互動式HTML生成上達到Kimi-K2.6與GPT-5.4等強大前沿系統的水準。同等規模的消融實驗顯示,瀏覽器背書的准入機制帶來了這項效益:沒有驗收證明時,匹配的9B模型提升幾乎消失殆盡。
思維鏈(Chain-of-thought, CoT)推理透過讓大型語言模型(LLMs)將問題分解為中間步驟,大幅提升了其能力。雖然 CoT 在語言任務上廣泛有效,但純文字的 CoT 迫使模型將視覺問題序列化為笨拙的文字表述。儘管已有架構性解決方案來處理視覺輸入,學術界仍缺乏一個大規模、多步驟、自我校正的資料集,用以教導模型在解決純文字推理問題時建立並維護內部視覺工作空間。為了解決此限制,我們提出了 CoVA-SFT,一個高度結構化的語料庫,包含 51.9K 個樣本,涵蓋 5 個不同的布局家族與 17 項複雜任務中的超過 222K 個多模態推理步驟;同時提出 CoVA-Bench,一個配套基準,包含 1,700 個涵蓋相同任務的保留測試樣本,以確保可重現的評估。藉由提供明確的推理依據表述、代理式渲染與驗證循環,CoVA-SFT 教導多模態語言模型將文字與視覺抽象交錯使用。我們驗證了該資料集,結果顯示在 CoVA-Bench 上,經 CoVA-SFT 微調的模型平均表現優於所有交錯式 CoT 基線 2 倍以上,但仍不及強大的純文字 CoT 基線,這突顯了未來工作的開放性挑戰。
文字到圖像模型會學習概念之間的關聯——就本文而言,是人们的職業(我們稱之為角色)與視覺屬性之間的關聯。這些關聯可能支撐許多被觀察到的刻板偏見形式。此領域一個關鍵的開放問題是:當專業角色的視覺表徵被置於不同的提示情境中時,這些關聯是穩定的還是會改變。我們提出 ContextBias,一個受控評估框架,以及 ContextBench,一個涵蓋 92 個角色和 1,656 個語意受控提示的基準,旨在分離情境變化對角色相關視覺表徵的影響。我們在 66,240 張生成圖像上評估四個最先進模型,發現將角色置於語意無關的情境中並不會抑制角色相關屬性;相反,跨角色屬性集中度會增加(彙總偏見指數 +0.047)。人口統計線索、代表性服裝和角色專用工具在無情境、相關情境與無關情境條件下仍然非常普遍,而且對語意提示重構具有穩健性。場景構圖與鏡頭取景則展現最大的情境敏感性。這些發現揭示了一種刻板印象持續存在的形式,而這種形式在無情境評估中幾乎不可見,凸顯了在偏見基準測試中納入受控情境變化的必要性。程式碼與資料集:https://huggingface.co/datasets/shaghayegh/ContextBias , https://github.com/Sina-Emami/ContextBias
多模態安全審核需要區分來自視覺內容、使用者意圖與助理行為所產生的風險。然而,現有的安全防護機制通常針對單一判斷目標進行訓練,並將安全評估簡化為二元決策。因此,風險在多模態互動中難以比較,模糊案例亦被掩蓋。我們提出 SafeAtlas-VL,一個包含 150 萬筆訓練實例的資料集,將影像層級、請求層級與回應層級的判斷置於五級有序量表上。我們從真實世界與合成來源中蒐集廣泛的安全相關資料,並採用分歧感知的標註程序。由此產生的資料集涵蓋 15 個危害類別與 55 個細粒度子類別,覆蓋廣泛的多模態安全情境。我們亦建構 SafeAtlas-Bench,一個包含 5,000 個實例的保留測試集,用於評估五級預測與連續風險分數。在此資料集上,我們透過目標條件微調訓練 SafeAtlas Guard 系列模型,以進行多模態安全偵測。我們的模型不僅執行安全等級的五向分類,也透過軟性累積序數輸出頭將安全映射為連續分數。實驗結果顯示,在我們的資料集上訓練的防護模型展現出強大的泛化能力:即使不使用其他基準的訓練集,它們在對應的測試集上也能達到具競爭力的表現。值得注意的是,我們的 8B 模型取得了整體最佳表現,在 F1 分數上比先前的 SOTA 高出約 4%。我們已釋出程式碼、資料與模型,以支持後續研究。警告:本文包含可能具有冒犯性、有害、露骨或令人不安的示例資料。
推測解碼透過使用草稿模型生成候選詞元,再由目標模型在單次前向傳播中進行驗證,從而加速大型語言模型推論。驗證過程依序進行,並從第一次拒絕的位置起丟棄所有後續位置;然而現有的草稿訓練依賴對目標模型的詞元級模仿,並使用固定的逐位置加權,既未反映驗證的序貫性,也未反映拒絕後的丟棄行為。我們提出驗證感知訓練(Verification-Aware Training, VAT),這是一個插件式框架,在每個訓練步驟模擬驗證過程,並將產生的接受與拒絕模式轉化為監督信號。VAT 包含兩個組成部分:(i) 驗證頭(verification head),一個輕量且聯合訓練的二元分類器,用於監督草稿模型每個位置是否能通過序貫驗證;(ii) 驗證自適應加權(verification-adaptive weighting),以每個樣本第一次被拒絕的位置為界,在此之前保留完整權重,並重新將衰減的起點定錨於該位置,取代原先固定的加權機制。VAT 僅修改訓練目標,因此可疊加於現有方法之上,無需更改草稿模型架構、目標模型或推論流程。在 Qwen3-4B、Qwen3-8B 與 LLaMA-3.1-8B 上應用於 EAGLE-3 和 DFlash,VAT 將平均接受長度提升最高 11.4%,實際耗時加速最高 8.7%,並在數學、程式碼與聊天基準上均取得一致提升。程式碼將於 https://github.com/naver-ai/vat 公開。
我們提出BLARM,一種用於影片驅動的3D網格動畫的前饋方法。給定單目影片和靜態物件網格,BLARM預測一個時間上連貫的動畫網格,其動作跟隨影片。我們不依賴顯式綁定或直接回歸高維頂點運動,而是使用一組緊湊的、學習到的隨時間變化的剛體運動分量,以及不隨時間變化的頂點到分量蒙皮權重來表示動畫。這產生了一個低維度變形空間,無需骨架、籠、蒙皮權重或綁定標註。我們的架構透過分解的空間-時間注意力,以影片特徵對幾何推導出的變形潛在特徵進行條件化,然後解碼由預測蒙皮權重混合的剛體變換。透過軌跡重建、熵正則化和動作感知對比學習進行訓練,BLARM在恢復緊湊、可解釋的動作結構的同時,從單目影片中產生準確且時間穩定的動畫。
大型語言模型能生成互動式網頁介面,但可靠的生成式UI需要在使用者需求演變的過程中,持續維護一個可執行的成品。我們提出EvoGenUI-Bench,這是一個用於多輪介面維護的評測基準,包含150個五輪任務、共750個回合,涵蓋三種情境:資訊呈現、可執行互動,以及工具對接的外部狀態。我們在瀏覽器中執行生成的成品,並利用螢幕截圖、原始碼與DOM證據、操作者軌跡以及執行時日誌進行評估。除了回合層級與任務層級的成功率之外,我們也以「相鄰通過留存率」(Adjacent Pass Retention, APR) 來衡量跨回合的留存能力。在八個模型中,即便最強的模型,其回合通過率僅達74.9%,而五輪任務的完成率僅有37.3%;在工具對接的任務上,APR更進一步降至52.4%。診斷分析顯示,呈現類失敗主要集中於資訊架構;互動類失敗則在於衍生狀態傳播與可供性綁定;而工具對接類失敗還涉及外部狀態的對接與需求分解。這些結果將生成式UI的評估,從評判孤立的輸出,轉向測試介面行為、衍生狀態、外部狀態以及助理聲明之間,在成品演進過程中是否保持同步。
函數向量(FVs)近來已成為一種有前景的機制,可透過注入由上下文示範萃取出的任務特定潛在方向表示,來引導大型語言模型(LLMs)的行為。雖然先前研究顯示,函數向量能在結構化上下文學習設定中恢復任務行為,但其在語意複雜任務上的有效性及跨語言泛化能力仍尚未充分探索。我們使用多語言多標籤情緒辨識作為具有挑戰性的語意分類基準,來研究函數向量的跨語言可遷移性。具體而言,我們檢驗在推論期間不提供示範的標準乾淨與受擾動零樣本設定下,從源語言萃取的函數向量是否能引導另一種語言的任務行為。在多種跨語言設定中,應用函數向量大幅提升了表現,這表明函數向量捕捉的是語言無關、任務相關的訊號,而非純粹的語言特定詞彙模式,並凸顯其作為輕量級且可遷移的多語言任務適應機制的潛力。我們觀察到,每個大型語言模型在建構有效的函數向量時,都表現出相對穩定的最佳注意力頭範圍,且此模式在不同語言間保持一致。此外,函數向量能部分重現標準少樣本上下文學習的任務引導效果,同時避免處理多個示範的計算開銷,使其適用於大規模實際應用。我們的程式碼可於 https://github.com/yingjie7/cross_lingual_fvs 取得。
強化微調(RFT)日益被用於強化大型模型的推理能力,然而其有效性受制於訓練資料的選擇與使用方式。多數以資料為中心的RFT方法依賴靜態或啟發式樣本選擇,隱含地假設樣本的價值在訓練過程中是固定的。這忽略了策略學習的非平穩動態,並可能導致次優的更新。我們提出動態重要樣本挖掘(DIEM),一個具有原則性且全自動的框架,使資料利用在RFT過程中具備適應性。DIEM在每個最佳化步驟中整合兩個組件:(i) 梯度對齊重要性估計器,有效近似每個樣本對策略改進的邊際貢獻;(ii) 約束批次重新加權機制,在最大化總體效用的同時保持更新的梯度幅度以穩定最佳化。在多個推理基準上,DIEM持續優於強勁的靜態與動態基線。程式碼將透過 https://github.com/hrtan/DIEM 發布。
視覺指令微調對於提升視覺語言模型(Vision-Language Models, VLMs)的視覺語言對齊與指令跟隨能力至關重要。然而,在固定比例限制下,從快速擴張的資料集中識別最佳子集仍是一項重大瓶頸。儘管現有方法大多依賴分佈多樣性或啟發式過濾,它們往往忽略了單一樣本內部的內在一致性。為填補此一缺口,我們提出資料內在一致性(Data Intrinsic Consistency, DIC),這是一種自評分指標,旨在量化樣本層級的元件間一致性。DIC 由兩個模組組成:視覺資訊一致性(Visual Information Consistency, VIC),評估視覺內容與指令之間的對齊程度;以及回應資訊一致性(Response Information Consistency, RIC),評估回應相對於指令的一致性。基於 DIC,我們進一步提出資料內在一致性選擇(Data Intrinsic Consistency Selection, DICS),這是一種自適應資料選擇方法,可在不同資料預算下優化高樣本內一致性與整體分佈多樣性之間的取捨。大量實驗表明,DICS 在多種資料集規模與模型架構下均持續優於最先進的方法,僅使用 LLaVA-1.5-665K 資料的 25% 即超越了全資料集微調的表現。我們進一步建構了 DICS-6M,這是一個包含 600 萬個樣本的多模態指令語料庫,實現了迄今最大規模的視覺指令選擇研究;值得注意的是,DICS 在不到其官方報告訓練資料 25% 的條件下,達到了 InternVL3-8B-Instruct 官方版本的 94.52% 效能。程式碼可見於 https://github.com/cqu-student/DICS
大型視覺-語言模型(LVLMs)中偵測幻覺,需要精確的片段定位與良好校準的置信度分數。微調後的生成式視覺-語言模型擅於識別幻覺文本片段,但存在過度自信與高推論延遲的問題。判別式序列標註器提供確定性的速度與優異的校準,但片段召回率較為保守。我們提出 SpanCalib-VLM,這是一個用於 SHROOM-Visions 共享任務的混合雙系統,結合了多模態序列標註器(由 XLM-RoBERTa-Large 與 SigLIP 視覺編碼器透過交叉注意力融合而成)與我們微調的生成式視覺-語言模型(Qwen3.5-4B-SHROOM-SFT)。透過聯合校準融合策略,來自生成式模型的候選片段會使用序列標註器的校準機率重新評分。在 SHROOM-Visions 英文評測分割上,我們的集成模型達到了 0.41 的皮爾遜校準相關係數與 0.39 的整體 IoU,其中潔淨回應的 IoU 為 0.91,整體偵測準確率為 70.7%。我們公開提供模型權重與程式碼。
近期,基於視覺-語言預訓練模型的影像內容操作研究已被有效延伸至文字驅動的三維場景編輯。然而,現有的三維場景編輯方案仍存在若干不足,阻礙其作為互動式設計工具的進一步發展。此類方案通常遵循固定的輸入模式,限制了文字輸入的靈活性。此外,其編輯能力受限於單一或少數二維視覺模型,且需要複雜的流程設計,方能將這些模型整合至三維重建過程中。為了解決上述問題,我們提出 Hash-Atlas 網路,將三維場景編輯重新表述為對二維圖集影像的操作,從而實現二維編輯與三維重建流程的工作流解耦。在此基礎上,我們引入一種基於對話的三維場景編輯方法,稱為 CE3D++,其以大型語言模型(LLM)為核心,允許使用者任意輸入文字並解讀其意圖,進而促成相應視覺模型的自動調用。此外,我們透過對移動物體施加運動約束,將 CE3D++ 延伸至單目四維場景,並透過建立與編輯任務相關的軌跡資料集進一步微調 LLM,從而使較小的 LLM 能夠準確調度高達 30 種不同的視覺工具。實驗結果表明,CE3D++ 能有效整合多個視覺模型,實現多樣化的視覺編輯效果,並具備強大的場景理解與多輪對話能力。原始碼與訓練模型可在 https://github.com/Fangkang515/CE3D 取得。
端到端天氣預報系統可直接從原始地球觀測資料產生具有技巧的全球格點與測站預報,取代包含資料同化在內的數值天氣預報流程,而其成本僅為後者的極小部分。此類系統為確定性系統,不發布不確定性資訊。於此,我們透過為Aardvark天氣模型的每個組成部分附加一個隨機機制,使其成為機率性模型:觀測編碼器採用經學習的、依輸入而定的雜訊,用以捕捉繼承自觀測系統的偶然不確定性;處理器採用蒙地卡羅丟棄法,用以捕捉學習動力學中的認識不確定性。由此產生的巢式系集透過全變異數定律分解,將系集離散度歸因於上述兩個來源,並以留出觀測流的方式進行交叉驗證。機率性微調顯著改善了平均預報,在各變數與預報時效上平均提升4.2%。該系集在中期預報範圍內經由ERA5完成校準(離散度-技巧比為0.98),其測站均方根誤差維持在確定性模型的2.4%以內,同時在各預報時效的連續排名機率評分上優於確定性模型,並緊追作業化的歐洲中期天氣預報中心系集。編碼器分支的作用等同於觀測驅動的不確定性。組成部分歸因的不確定性使端到端預報更具透明度,此為邁向大氣觀測驅動數位雙生的關鍵一步。
社群媒體上的多模態錯誤資訊極為普遍、影響力強大且具危害性,然而相較於純文字的錯誤資訊,其偵測與反制难度更高,且目前的理解仍相當有限。針對多模態錯誤資訊之特性與欺騙策略的研究,長期受到兩項因素阻礙:缺乏根植於真實世界脈絡的分類法,以及當前多模態機器學習模型的局限性,導致無法大規模自動化標註與分析。我們透過三個步驟來解決這些不足。首先,我們從Twitter/X收集了一個大規模、高品質的真實世界錯誤資訊資料集,涵蓋七種語言。其次,我們基於對資料的深入質性分析及先前的理論研究,建立了一套新穎且全面的多模態錯誤資訊分類法。最後,我們運用視覺語言模型(VLM)透過自動化的多步驟標註流程將該分類法操作化,並進行人工驗證。我們的新穎方法帶來了以往未被記錄的洞見,揭示了社群媒體使用者如何結合圖片與文字在實際環境中傳播錯誤資訊,例如:AI生成內容在科技與科學領域尤為普遍,而疫苗相關錯誤資訊則不成比例地利用新聞媒體的圖片來建立可信度。我們的方法與發現為針對性的多模態錯誤資訊偵測策略提供了指引,並建議緩解措施應採取策略性且差異化的方式來制定與實施,而非齊頭式地統一應用。
長篇自回歸影片生成面臨一個根本的記憶挑戰:在有限的注意力視窗下,模型必須決定要從不斷擴展的歷史中保留哪些資訊。現有方法按時間順序組織記憶,保留最近的幀,同時壓縮或丟棄較舊的幀。我們反而提出 RECAP-Forcing,以外觀新穎性來組織記憶。長影片不僅僅是一系列幀,而是一個由主體、物體和場景組成的不斷演變的陣容,其身份必須隨時間保持一致。我們透過在內容首次變得可見的時刻,保留與新出現內容相關的 KV 快取——例如進入畫面的主體、去遮擋區域和新引入的場景——來組織記憶,優先考量新穎性而非時近性。記憶應隨新引入內容的數量擴展,而非影片長度。這種以外觀索引的記憶使長程一致性成為記憶結構的明確屬性。我們的框架在此單一原則下統一了兩種機制。在影片開始時,當所有可見內容皆屬新穎時,一個注意力匯聚點保留初始場景。隨著影片演進,基於光流的新穎性記憶庫透過選擇性地保留新揭示的內容來延伸相同原則。作為一種無需額外可學習參數的免訓練推論方法,RECAP-Forcing 在多個強基線模型上持續改善視覺品質與語意保真度,並優於現有的記憶方法。