每日精選AI研究論文及翻譯
扩展世界模型的一种常见策略是利用更多算力在更多抓取的视频上进行训练。我们认为这一策略效率低下:扩展世界模型还需要一个能够提供有根基的奖励信号的递归数据引擎。代码智能体的成功恰好说明了这一点为何至关重要。由于代码是可执行的,编译器和运行时可以为大语言模型(LLM)的强化学习(RL)后训练提供高质量的奖励。相比之下,空间生成仍主要依赖诸如CLIP分数之类的模糊代理指标。这些信号既模糊又带有偏差,难以支撑强化学习后训练。与此相比,游戏开发为空间世界模型提供了一个缺失的奖励环境。由游戏引擎编码的场景是一种可执行的世界规范:引擎能够高效地检查碰撞、物理、可导航性以及有界的可玩性,而开发者则通过判断场景是否应当被接受来提供全局验证信号。游戏开发还为强化学习后训练提供了真实世界中的长时程轨迹数据。因此,我们提出一种基于人类与引擎联合验证的强化学习范式(RLHEV),这是一种后训练范式,它将稠密的引擎信号与来自开发过程的隐式人类接受反馈相结合。
近期的影片生成模型越來越常被視為世界模型。許多物理過程可能以多種有效方式展開。因此,世界模型不僅應重現合理的軌跡,還應重現相同初始觀測與動作下可能行為的分布。我們將這種分布層級的要求稱為機率對齊。然而,現有的評測大多評估單一影片的合理性,並未檢驗重複生成是否能還原正確的分布。這引出一個核心問題:目前的影片生成器距離機率對齊的世界建模還有多遠?為了解答這個問題,我們將機率對齊形式化為世界模型的分布性標準,並引入 PAWBench,一個用於評測影片生成器作為世界動態隨機採樣器的基準。我們進一步提出 PAWEval,一個結果層級的協議,將重複的影片推演轉換為可能物理行為上的經驗分布。在五十個情境與十一個現有系統中,沒有任何模型能在還原有效行為範圍的同時,一致地匹配參考機率。在確立此差距後,我們測試語言提示、初始雜訊採樣或模型訓練是否能重塑模型的預測分布。我們相信我們的工作可作為未來邁向機率對齊世界建模的基礎。
多模態大型語言模型(MLLMs)能夠解讀街道景觀,但城市行動能力取決於當智能體開始移動後,這些局部證據是否仍然有用。在本文中,我們探討當前的 MLLM 智能體如何在複雜的真實規模城市中,將局部的城市感知轉化為可靠的行動。我們提出 UrbanGround,這是首個使此問題得以測試的沙盒,其環境是根據覆蓋全港的三維地理空間數據所建構、且受物理約束的香港複製城市。UrbanGround 支援第一人稱視角的閉環互動,並提供互動式地圖以供導航。智能體可以直接進入三維城市,並以第一人稱視角進行探索。我們的分析循著空間問題的擴展,透過三個研究問題逐步推進。首先,我們測試智能體在主動觀察後,是否能充分錨定局部場景以回答空間問題。接著,我們探討當目的地變得更遠、更不明確時,這種錨定能力是否足以支援導航。最後,我們檢視所產生的行為能否在路線可用性與行人運動的變化下維持。當代 MLLM 智能體通常在視覺辨識與短距離空間推理方面展現有用的基礎能力,但方向感與具行人感知的移動仍不可靠。其核心失敗出現在長時間的探索過程中:局部能力無法組合成持續的目標導向行為,且錯誤在缺乏有效修正下持續累積。我們希望 UrbanGround 能促進更廣泛的研究,探討當前 MLLM 智能體在複雜、開放的都市環境中能可靠探索多遠。
近期突出的後訓練方法,例如強化學習(RL)與在策略自蒸餾(OPSD),已大幅推動大型語言模型在數學推理上的進展;然而,這些方法依賴真實標籤,因此無法進行測試時訓練(TTT)。以多數投票偽標籤取代真實標籤是自然的替代方案,但其相當脆弱:一次錯誤的投票便會污染教師模型,並誤導所有詞元。我們觀察到這種失敗模式具有不對稱性:與偽標籤不一致的軌跡通常是錯誤的,無論投票本身是否正確。基於此觀察,我們提出測試時策略優化(TTPO),這是一種不對稱目標函數,透過 OPSD 蒸餾一致的軌跡,並以分組 RL 懲罰不一致的軌跡。詞元層級選擇進一步細化這兩個分支:蒸餾會降低已收斂位置的權重,而 RL 僅懲罰高置信度的錯誤。即使偽標籤頻繁出錯,兩種更新依然保持穩健;且隨著模型改進,多數投票路由會產生更精確的自監督。在完全沒有標籤的情況下,TTPO 在五個競賽級基準上與標籤監督的 OPSD 並駕齊驅,將 Qwen3-1.7B 在 TTT 中從 38.0% 提升至 45.2%,在未進行思考時獲得 +25.2% 至 +36.4% 的提升,並展現出強勁的跨任務泛化能力。
同策略蒸餾(On-policy distillation, OPD)利用預訓練的專業教師模型提供密集監督信號,已在大型語言模型(LLMs)中取得顯著成功,並於近期被應用於流匹配模型。然而,此範式存在兩大問題:首先,為每個新目標訓練一個獨立且任務特定的教師模型會造成高昂的計算成本;其次,教師與學生分佈之間的差異常導致生成軌跡上的累積誤差。本文提出 Self-OPD,一種針對流匹配模型的無教師 OPD 框架,將學生自身的自我探索轉化為逐步監督。在每個時間步,Self-OPD 將確定性的下一狀態預測分支為 K 個隨機 SDE 候選,使用 ODE 採樣器對其進行展開,並將其獎勵與確定性自參照基準比較,以獲得歸一化優勢。速度場透過全分支推拉目標進行優化,其中在方向感知衰減與 SDE 方差歸一化下,高優勢分支吸引學生,低優勢分支排斥學生。在多目標對齊方面,Self-OPD 在獎勵層級融合歸一化分數,避免直接的梯度衝突。在單一與混合獎勵基準上的實驗表明,Self-OPD 在無需任務特定教師的情況下優於先前的 RL 和 OPD 方法。
LLM代理日益依賴於生成的互動資料來學習如何與外部環境互動。代理性資料生成必須在環境、任務、互動與成功訊號之間維持一致性,同時產出有用而非僅是大量的經驗。現有研究涵蓋眾多代理領域,但以領域為中心的組織方式與異質化的評估標準,往往掩蓋了共同的生成機制,並將候選建構與驗證和篩選混為一談。本研究為該領域建立了一個雙層框架。首先,我們將代理性資料表示為一個共同的分解物件(E,q,τ,v),包含環境規格、任務訊號、互動實現及可選的驗證器。我們依其主要錨點與依賴結構來組織生成範式。其次,我們透過「準確性-複雜性-多樣性」(ACE)視角,將生成形式化為約束分佈設計。準確性確立了具接地性且內部一致的資料之可行支撐範圍。在此支撐範圍內,複雜性依據所宣告的學習者能力與執行配置來配置學習質量,而多樣性則控制資料的覆蓋度與冗餘度。藉由該框架,我們探討既有研究如何驗證生成的經驗、如何建構並校準難度,以及如何擴展行為覆蓋範圍。文獻呈現出一種轉向:朝向以執行為基礎的準確性、以學習者為相對基準的複雜性,以及超越表面變化或資料集規模的多樣性。我們進一步透過ACE視角討論代理性資料生成的更廣泛方向與新興趨勢,包括其對規模化、資料來源、訓練機制與自適應學習的啟示。總體而言,核心挑戰不在於單純生成更多資料,而在於隨著代理與環境的演進,持續配置有效、具資訊性且不冗餘的經驗。
AI 驅動的數位虛擬主播必須即時回答產品問題、與觀眾互動並執行行銷策略,這要求低延遲、頻繁的策略更新以及準確且有效的回應。可演化的 Harness(框架)其技能、Hook、提示詞與工具可獨立於模型權重進行更新,從而實現快速迭代,但也揭示了一種取捨:大型模型能零樣本適應但速度太慢,而緊湊型模型雖能滿足延遲目標,卻會過度擬合於固定的 Harness 配置。我們提出 Harness 感知訓練(HAT),訓練緊湊型模型以適應不斷變化的 Harness。其關鍵組件 Harness 狀態擴增(HSA)對技能識別碼與內容、工具結構描述、提示詞結構以及 Hook 函式施加保留任務的轉換。訓練分三個階段進行:HSA 監督式微調(HSA-SFT)從跨多種環境的強模型軌跡中學習推理與工具使用;通用同策略蒸餾恢復 SFT 期間喪失的泛化能力;HSA 強化學習(HSA-RL)則在擴增環境中透過強化學習提高對不斷變化的 Harness 的穩健性。在四個評估集上,HAT 在直播問答(Live-Stream QA)上達到 94.8(基線:80.3;最強通用 LLM:93.0),在 Harness 變體問答(Harness-Variant QA)上達到 94.6(基線:75.4)。與固定 Harness 的 SFT 不同——後者使 IFEval 比基線模型下降 7.7 分——HAT 避免了這項退化,達到 83.5。在單張 NVIDIA H20 GPU 上,優化後的系統達到 P50 延遲 3.4 秒及 P95 延遲 8.1 秒。該系統部署於淘寶直播的數位虛擬主播服務中,並在 GMV 與商品頁瀏覽量上取得正向的線上 A/B 測試結果。
現代電子遊戲結合了第一人稱感知、快速視覺變化、持續的世界狀態,以及異質的原生控制。現有的遊戲代理直接將視覺與任務情境映射為動作,但缺乏明確的世界動態建模;而互動式遊戲世界模型雖可根據提供的動作預測視覺未來,但並不能作為任務策略。世界-動作模型(WAMs)統一了這些目標,但在電子遊戲的動態性與開放式互動下仍 largely 未被探索。我們提出 GameWAM,據我們所知,這是第一個用於原生閉環遊戲遊玩與 GUI 控制的 WAM。GameWAM 透過並行的視覺與動作生成過程,結合區塊因果條件化與流匹配,共同生成未來的視覺觀察與可執行的鍵盤-滑鼠軌跡。為支援世界-動作聯合學習,我們建構了同步的遊戲遊玩與 GUI 軌跡。為處理異質的原生控制,GameWAM 在每個動作步驟預測遊戲遊玩/GUI 模式,並以特定模式的預測分佈與連續動作正規化生成動作。對於長時程互動,區塊循環控制會預測超出已承諾的時域範圍,僅執行短動作前綴,並根據新的觀察重新規劃;同時,循環內部的細粒度上下文與跨循環的階層式歷史保持了時間連續性。實驗結果顯示,與對比代理相比,我們的方法在執行較少原生動作的情況下,仍可達到具有競爭力的任務成功率。我們進一步揭示了低頻動作來源印記(LASI)現象:在固定條件下,所取樣動作來源的低頻成分會系統性地引導粗略的生成攝影機運動,這揭示了生成式控制中一個對來源敏感的失敗模式。專案頁面可於 https://yunncheng.github.io/GameWAM/ 查看。
長視野的代理執行會產生經驗,這些經驗既能改善當前執行,也能改善未來工作。大多數自我改進方法僅在執行結束後處理這些經驗,因此無法重新導向正在進行的執行,也無法立即應用並驗證從中所學到的教訓。我們主張自我改進應改為即時進行,利用湧現的經驗既重新導向當前執行,也更新持續存在的執行框架。現有的代理架構無法完全支持這一目標。單代理自我校正將任務執行與軌跡評估結合在同一個情境中,而子代理委派雖然將執行分離,但通常無法重新導向正在運作的子代理。我們提出 PILOT,這是一個監督者-工作者執行框架,透過兩種耦合機制實現即時自我改進:(1)即時引導使獨立的監督者能在執行期間重新導向或中止正在運作的工作者;(2)即時自我演化將執行期間浮現的程序與失敗模式提煉為可重複使用的技能與記憶。在兩個凍結骨幹模型與三個基準測試中,PILOT 在六種配置中的五種中排名第一。在 Terminal-Bench 2.0 上,PILOT 比對應的執行框架高出最多 9.8 個百分點。在自我改進設定中,PILOT 在使用 GLM-5.1 時提升 14.6 分,使用 Kimi-K2.6 時提升 12.4 分。平均輸出詞元分別下降 42.9% 與 47.4%,而每百萬輸出詞元的成功評估次數則分別上升 110.3% 與 134.0%。
零樣本跨任務泛化——即策略必須執行訓練期間從未見過的操作任務——仍是機器人學習中的核心挑戰。在大語言模型中,一項新任務只需在上下文中指定即可執行,無需任何參數更新。這種形式的上下文學習(in-context learning, ICL)將泛化轉化為任務規格的問題。為了實現跨任務泛化,我們將此範式引入機器人操作,並主張操作任務的自然規格是人類影片:與語言不同,人類影片提供了關於預期任務演變的豐富視覺線索。我們提出 Zero-WAM,這是一個因果影片-動作模型,透過遵循以人類影片為上下文的引導來執行未見過的任務。為了解決任務豐富的人類-機器人配對資料稀缺的問題,我們提出一個自動化流程,將任務取樣所得的機器人軌跡轉換為語義匹配的人類影片,從而生成 HumanGen 資料集,其中包含 8.6K 個任務的 74.2K 個人類-機器人 ICL 配對。在模型訓練方面,我們進一步引入了上下文未來片段預測(in-context future chunk prediction, IFP)目標,以抑制從已見任務中學到的捷徑,並迫使策略從影片提示中提取任務資訊。在 RoboTwin 2.0 模擬環境的七個未見過任務上,Zero-WAM 達到了 47.0% 的平均成功率,比最強的影片-動作基線方法絕對提升了 29.5 個百分點。在真實世界評估中,它能遵循人類影片引導,泛化到涉及多物體場景、長程操作和精細插入的未見過任務配置。
演化策略(ES)近年來已成為大型語言模型(LLM)推理的一種記憶體高效後訓練範式。然而,ES 的最佳化行為仍缺乏深入研究,因此難以界定其相較於主流後訓練範式(例如群組相對策略最佳化,GRPO)的優勢範圍。透過系統性探究 ES 的動態與機制,本文首先指出 ES 相較於 GRPO 具有性能優勢,並從理論與實證兩方面證明 ES 能導致更廣泛的推理覆蓋範圍,從而更充分地發揮預訓練 LLM 的推理能力。理論上,我們證明 ES 群體中經驗證器投影的 Jensen-Shannon 多樣性有助於提升 Pass@K 性能。實證上,不同於表現出熵崩潰的 GRPO,ES 在提升 Pass@1 的同時,也能達到比 GRPO 更高的 Pass@K。我們進一步開發了一種序列式 GRPO-ES 訓練策略,結合 GRPO 在 Pass@1 的優勢與 ES 在 Pass@K 的增益。其次,我們發現儘管整體模型參數漂移顯著,ES 的任務性能增益僅由稀疏的子集、較大幅度的更新所貢獻。這種功能稀疏性表明,參數的大幅移動不一定意味著廣泛的功能變化,而保留資料的評估進一步顯示,這也不必然導致災難性遺忘。最後,我們研究超參數設計如何影響 ES 的有效性,證明在較大的 LLM 中,ES 需要較小的群體規模。這些發現將 ES 定位為一種獨特的推理後訓練範式,而非 GRPO 那種效果較差、僅具記憶體效率的替代方案。
智能體技能將專業知識與工作流程封裝為可重複使用的資源,以擴展 AI 智能體的能力。近期研究從智能體的經驗中自動發掘此類技能,使智能體能透過互動逐步適應。然而,引導技能發展的洞見通常散落於最佳化歷程中,限制了它們在反覆迭代中系統性重用。我們提出 WikiSkill,一個讓智能體技能與持久性知識庫(wiki)共同演化的框架。在高層次上,WikiSkill 將原始執行經驗、累積知識與可執行技能分離,並持續將經驗整合進 wiki,而後續的技能更新可奠基於此。在各種基準測試與模型中,WikiSkill 持續優於最先進的技能演化方法,並在大多數模型-基準測試組合中優於無技能基線。我們發現技能演化與模型規模擴展互補:較大的模型通常從演化技能中受益更多,而具備技能的小型模型可以勝過規模大得多但沒有技能的模型。我們也發現演化技能在模型與模型家族之間能有效遷移,且由其他模型演化的技能可能優於自我演化的技能。最後,我們的消融研究證實,在 wiki 中持續累積知識對於技能的有效演化至關重要。這些結果展示了系統性累積與精煉智能體經驗,對於發展可重用且可遷移技能的益處。
原生3D生成器現在能從單張圖像還原出令人驚豔的網格幾何。然而,在機械加工物體應呈現銳利邊緣之處,稠密網格仍舊是柔軟的;它不具備零件分解結構,也未暴露任何用戶可編輯的參數。為了解決這些問題,我們探索「將3D形狀視為程式碼」的範式,利用並擴展大型語言模型在3D建模上的程式編寫能力。我們提出 Procedura,一個新穎的3D建模代理框架,能將物體撰寫為程序化組裝——一個參數化程式,其具名零件通過具有型別且可機器檢查的配合關係相互連接。根據文字提示,該代理將物體規劃為組裝圖,並逐零件編寫程式;每個放置位置都從配合的參考座標系求解,而非依賴猜測,且僅在編譯、配合與連通性檢查全部通過後才接受該零件。接著,一個解耦的視覺評論者會一次一項診斷修復,逐步精煉組裝。此外,同一張圖還承載每個零件的材質以及經模擬器驗證的關節結構。我們在 P3D-Bench 上以其組裝評判標準進行評估,並在我們自製的硬表面基準 MechBench-36 上使用同一評判標準。在兩項基準中,Procedura 在評判品質上均優於最先進的原生3D生成器及所有先前的3D程式碼代理;在我們評估的所有方法中,它產生了最銳利的邊緣,且是唯一輸出為可編輯、具零件結構程式的方案。
現代遊戲開發高度依賴傳統圖形管線。高品質的視覺內容需要建模、材質製作、動畫、光影、特效及執行期最佳化,使得美術資產的生產成本高昂,並延長了遊戲原型的開發週期。近年來,影片基礎模型開始改變電影與影片的製作方式,但遊戲不同於線性媒體,它不僅需要連續且逼真的影像,更需要穩定且可重現的遊戲規則、物體狀態與互動結果。我們提出 Magpie,一個適用於互動式遊戲的即時生成式世界渲染系統。Magpie 將遊戲邏輯執行與視覺生成分離。設計者在遊戲引擎中定義場景與規則。在執行期間,遊戲引擎解析玩家動作並維護世界狀態,而獨立的渲染伺服器則根據引擎產出的白盒框架生成視覺輸出。Magpie 為將生成式模型應用於即時遊戲渲染提供了系統層級的實作路徑。它保留了遊戲玩法的可設計性與可重現性,並降低了早期遊戲原型對完整視覺資產的依賴。
大型視覺語言模型(VLMs)已在廣泛的多模態任務中展現出卓越的多樣性。然而,理解幽默仍具挑戰性,因為幽默內容往往依賴於實體、事件、情境以及跨影像與文字模態之間的隱性互動。這些互動可能涉及複雜的推理鏈,難以透過傳統提示或線性思維鏈推理來捕捉。在本工作中,我們提出CaRGo-T(Causal Reasoning Graph-of-Thought,因果推理思維圖譜),這是一個推理框架,將多模態幽默背後的因果與情境關係表示為輕量級的圖形化推理結構。該圖結構被序列化為由VLM生成的程式碼式表徵,隨後可由相同或不同的VLM進行解譯,以在零樣本或上下文學習設定中產生最終預測。我們在四個涵蓋多種喜劇內容形式(包括諷刺、譏諷與迷因)的資料集上評估CaRGo-T的幽默理解與幽默偵測表現。實驗採用最先進的商業與開源VLM,結果顯示CaRGo-T consistently 優於現有的推理式基線方法,在幽默理解上提升約1–20%,在幽默偵測上提升約1–3%。進一步的互信息分析顯示,CaRGo-T產生的推理表徵比基線推理方法所生成者包含更多與目標輸出相關的資訊。程式碼可於 https://github.com/abhi1nandy2/CaRGo-T 取得。
可重用技能庫使大型語言模型(LLM)代理能夠跨任務重用程序性知識,但也將記憶存取轉變為一個具有挑戰性的檢索問題。全庫提示以高上下文成本保留覆蓋範圍,向量檢索返回緊湊鄰域卻將技能視為獨立文本,而基於圖的檢索則僅在承載相關性的邊可靠時才能恢復工作流上下文。我們提出 CaSKG,一個反事實因果技能圖框架,在檢索前校準程序性關係。CaSKG 首先從語義、詞彙、輸入/輸出及結構證據中建構一個高召回率的有向候選圖,並透過修復證據與可選的 LLM 評判器進一步細化候選分數。接著,它應用方向條件化文本反事實探針,對技能對進行刪除、替換與重排,以貝葉斯平滑聚合證據,並發布一個狀態過濾的加權圖,以供任務條件化擴展使用。該圖離線建構,在使用時無需改變下游代理策略或任務介面。在 ALFWorld ID-140 與 ScienceWorld U211 上,跨六個 LLM 骨幹模型,CaSKG 在全部十二種模型與基準組合中取得了最高任務分數。相較於 Graph-of-Skills (GoS),CaSKG 將六模型 ScienceWorld 宏平均分數從 72.62 提升至 80.50,將 ALFWorld 成功率從 80.01% 提升至 86.79%,同時在兩個基準上均減少了平均環境步數。定性分析與消融分析進一步表明,校準後的邊有助於檢索保留前置條件、狀態改變動作、驗證流程及最終完成步驟。這些結果表明,邊置信度校準是實現大規模緊湊且可執行技能檢索的有效途徑。程式碼可於:https://github.com/ZhiyuanLi218/Caskg 取得。
近期在推論時擴展(inference-time scaling)方面的進展已顯著提升了大型語言模型(LLMs)的推理性能。然而,這些方法通常依賴於重複生成或外部驗證。為了解決此限制,我們提出 CritICL,一個新穎的推論時框架,能在保持高效率的同時改善推理能力。我們的關鍵洞察是,同一家族內不同規模的 LLM 會表現出結構化的失敗模式。CritICL 不將失敗視為不理想的輸出,而是將其利用為指導來源。具體而言,我們利用從較弱模型推導出的失敗模式,並透過基於評論的上下文範例(critique-based in-context examples)將其納入推論。我們提出兩個變體:CritICL-dynamic,它自適應地預測特定於輸入的失敗模式並檢索評論;以及 CritICL-static,它使用全域失敗模式概況提供穩定的指導。實驗結果顯示,CritICL 持續優於標準的上下文學習,並達到與測試時擴展方法競爭或更優的性能,同時所需的生成次數和 token 成本顯著更低。程式碼位於:https://github.com/umwyf/CRITICL
接觸豐富的操作需要適應在動作時域內可能大幅演變的接觸狀態。然而,基於區塊的視覺-語言-動作模型會根據執行前收集的觀測結果預測完整的動作區塊,使得觸覺條件化在執行期間逐漸過時。現有的觸覺反應式方法通常依賴於獨立的高頻控制器,這增加了架構和訓練的複雜性。在本文中,我們提出TacForcing,一個流式動作生成框架,能有效整合執行期間的觸覺回饋。TacForcing並非採用獨立的反應式控制器,而是以流式動作專家取代標準動作專家,以執行期間獲得的即時觸覺觀測為條件來生成動作。TacForcing還引入了執行感知觸覺注意力(EATA),將觸覺條件化限制在接近執行的動作上,從而減少觸覺獲取與動作執行之間的時間錯配。在六個模擬UniVTAC任務和三個真實世界的接觸豐富操作任務中,TacForcing分別達到了65%和69%的平均成功率,在兩種設定下均優於強基線模型。
儘管生成式人工智慧已顯著推動影片編輯的發展,現有方法仍主要專注於單鏡頭或短影片片段。利用多條指令編輯長影片依然是一項嚴峻的挑戰。樸素的分塊策略(如固定時長分割)往往導致實體碎片化、嚴重的編輯幻覺以及時間連續性中斷。為填補此一空白,我們提出了多指令多鏡頭長影片編輯(Multi-Instruction Multi-Shot Long-Video Editing, MMLVE)任務,該任務圍繞三個核心目標建構:跨鏡頭編輯一致性(Cross-Shot Editing Consistency, CSEC)、多指令解耦(Multi-Instruction Decoupling, MID)與時空結構零破壞(Zero-Destruction on Spatiotemporal Structure, ZDSS)。為應對這三項獨特挑戰,我們提出了一種智慧體編輯框架,利用大型語言模型(Large Language Models, LLMs)與視覺語言模型(Vision-Language Models, VLMs)之協同作用,實現鏡頭層級的影片解耦及精確的指令解析。此外,為全面評估此任務,我們建構了MMLVE-Bench——一個以MMLVE為核心的資料集,其特徵在於複雜的真實世界時空動態、高密度異質指令,以及稀疏且隨機的實體分佈。我們並進一步採用三項針對MMLVE的評估指標,以衡量編輯結果的品質。大量實驗證實,我們的MMLVE-Agent優於現有的閉源最先進(SOTA)方法(如Seedance 2.0),成功消除了編輯幻覺、保持了跨鏡頭編輯一致性,並實現了無縫的時空過渡。
顯式視覺中間表徵可以幫助多模態大型語言模型(MLLMs)外化空間證據與更新的視覺狀態,但其效用取決於影像編輯器能否忠實實現所需的轉換。我們提出Aphanta,一個針對「MLLM → 影像編輯器 → MLLM」管線的自動化任務發現與閉環診斷框架。Aphanta評估三種條件:直接推理、使用編輯器生成的中間表徵進行推理,以及使用理想化參考中間表徵進行推理,以區分潛在的視覺提升空間與當前編輯器的實際效用。在20個候選任務及多種「編輯器-MLLM」組合中,我們發現效用具有強烈的任務條件依存性。增益集中於視覺線索注入、視覺定位與反事實狀態實現,而需要符號敏感建構或結構外推的中間表徵則明顯較不可靠。在選定的正向任務子集上,我們整合的Qwen管線將平均任務分數從0.343提升至0.445(+10.2分;相對提升29.7%);同時,完整研究亦保留了被篩選與未成功的任務,以揭示其界限。這些結果將影像編輯定位為一個專門的視覺工作空間,而非通用的推理機制,並確立Aphanta作為一個可重用的協議,用於衡量任務-表徵對齊、編輯器實現能力以及下游管線效用。
評估工件指定一個前向計算:任務、評分器與回報指標。它們不一定授權該指標所附帶的主張,因為重放該主張所需的歷史證據與替代語義可能未綁定。我們透過凍結基質 D、接地族 F、主張查詢 q 及由此產生的識別集合,將此缺失的主張重放層形式化。隨後,我們針對一固定提交版本,盤點全部 124 個機械上符合資格的 Inspect Evals 單元。每個單元皆獲得終止處置;其中 110 個在確定性推論之前即停止,因為所需的歷史證據或語義接地不可取得。在執行收斂之處,精確數值、勝者、完整排序與成對關係依主張解析及主要族與審查族之別而分離。因此,該審計回傳型別化停止、不穩定性見證與穩定子結構,而非強加單一的評估者意義或單一的穩健/非穩健標籤。
傳統影片編輯主要專注於場景層級的內容,而直播則更強調人物主體。然而,將現有影片編輯方法直接應用於以人為中心的直播仍然具有挑戰性,因為這些方法可能引入面部表情不一致的問題,且通常依賴於多個離線推論步驟,因此不適合即時互動。我們提出 EditaLive,一個用於即時串流角色影片編輯的新型框架。具體而言,我們從一個預訓練的圖像動畫模型(Wan-Animate)出發,該模型自然地將外觀與動作解耦,並透過參考幀編輯以及利用我們收集的 CharEdit-50K 資料集進行影片重建,將其重新定位為基於指令的以人為中心的影片編輯基礎模型。此外,我們將模型從離線雙向生成改適為因果串流生成,並設計了一種對齊式自展開蒸餾策略,將模型壓縮為兩步取樣器。其中,固定的 RoPE 與對齊強制(align forcing)可減少訓練與推論之間的差異,而保留首幀的稀疏注意力則可過濾多餘的歷史資訊,以減輕外觀漂移。大量實驗表明,EditaLive 提供了最先進的編輯效能,能忠實保留面部表情,並實現低延遲的即時串流推論。