每日精選AI研究論文及翻譯
我們提出ABot-World-0,這是一個以動作條件為基礎的影片世界模型,用於即時、長時程的閉環互動。該模型藉由涵蓋AAA遊戲、模擬引擎與網路影片的多源資料基礎設施,學習可控的世界動態。WorldExplorer根據訓練回饋進行智能體驅動的資料收集,而統一流程則應用14項確定性品質檢查、基於VLM的評估,以及同步的動作與文字標註。我們透過教師強迫與ODE蒸餾,逐步將雙向動作條件教師模型蒸餾為因果學生模型,並引入LongForcing以將學生的長自迴歸推論與擴展時程的教師對齊,從而緩解累積分佈偏移與自迴歸漂移。原始鍵盤動作為場景漫遊與第三人稱角色互動提供了統一的控制介面,而參考角色記憶則在第三人稱推論中提供持續的外觀線索,以維持身份一致性。在部署方面,我們協同設計了一個串流推理棧,包含輕量級VAE解碼器、高效注意力機制、記憶體感知排程,以及低比特DiT推理。在優化的低比特配置下,ABot-World-0可在單張NVIDIA RTX 5090桌面GPU上以高達16 FPS的速度串流720P影片,動作到首幀延遲為1.2秒,峰值VRAM約19GiB。在WorldRoamBench與擴展互動推論實驗中,展現了具競爭力的可控性與連貫的長時程世界演化。
大型語言模型(LLMs)正日益被用於自動化資料處理工作流程,然而編碼代理通常產生的腳本並不會自動具體化為持久、可編輯的平台工件。我們將這種斷裂稱為 NL2Pipeline 差距。為彌合此差距,我們引入了 DataFlow-Harness,這是一個引導 LLM 代理透過型別化增量變異(而非自由形式腳本)來構建平台原生有向無環圖(DAG)的平台。該平台結合了用於程序性指導的 DataFlow-Skills、一個暴露即時運算符註冊表與當前管線狀態的模型上下文協議(MCP)層,以及能將對話式創作與視覺化 DAG 編輯器同步的 DataFlow-WebUI。在一個包含 12 項任務的數據工程基準測試中,DataFlow-Harness 達到了 93.3% 的觀察端到端通過率。相較於 Vanilla Claude Code,其測量貨幣成本降低了 72.5%,生成延遲降低了 49.9%;其觀察通過率與 Context-Aware Claude Code 基準相差僅 0.9 個百分點,而成本卻低了 42.8%。逐任務分析表明,Skills 在建構依賴隱含程序性知識時最為有效。這些結果顯示,即時平台接地能夠生成持久、可編輯的工作流程工件,其觀察可靠性接近腳本生成基準,同時建構成本和延遲更低。
文本到图像扩散变换器(DiTs)联合处理文本和图像令牌,但其在去噪过程中的内部计算机制仍不明确。我们引入了一种针对现代大规模DiTs的因果可解释性框架,该框架将注意力分解与跨令牌跨度、注意力头及层级的定向干预相结合。通过该框架将提示内容令牌与结构模板令牌分离,我们发现结构令牌在编码器输出中携带的提示特定信息极少。然而令人意外的是,它们成为主导的图像到文本注意力汇聚点,并在DiT内部因果性地维持目标身份,充当隐式语义寄存器。研究表明,这些结构令牌间接获取这种身份:提示语义首先注入图像潜在表征,随后被读回模板令牌,而非直接从提示令牌传递。受上述发现启发,我们为DiTs设计了一种无需训练的剪枝规则。那些对提示令牌注意力最强的注意力头是可舍弃的,剪除它们可在GenEval指标上仅降低1.4分的情况下减少20%的注意力FLOPs。我们进一步揭示了DiT中生成计算如何跨注意力头和深度进行组织,将语义路由与视觉合成分离,并从身份形成、传播到精炼逐步推进。本工作不仅表明输入时编码语义的令牌未必是生成过程中维持语义的令牌,还为DiTs内部机制提供了因果视角。
生成式世界渲染器AlayaRenderer接收從物理引擎導出的結構化世界狀態,並合成RGB幀。與透過文字/控制提示生成幀的模型不同,AlayaRenderer在不改變底層世界動態的情況下保留場景結構,這展示了實現互動式世界建模與使用者可控遊玩的一條替代路徑。然而,原始AlayaRenderer的計算成本過高,無法即時部署。本技術報告介紹AlayaRenderer-Flash,這是一個面向即時運算的生成式前向世界渲染器,將AlayaRenderer從0.56 FPS提升至31.54 FPS,達到可遊玩的速度。AlayaRenderer-Flash將原始渲染器重新表述為少步自迴歸串流模型,並引入輕量級蒸餾編解碼器,以實現高效的潛在編碼與幀重建。它保留了教師模型的G-buffer與文字提示介面,同時支援對無界長度輸入串流的連續渲染。我們在G-buffer串流上評估AlayaRenderer-Flash的內容保留、時間一致性、跨視窗穩定性、提示可控性及執行效率。結果顯示,AlayaRenderer-Flash大幅降低推論成本,同時保留教師模型的核⼼渲染能力。透過將AlayaRenderer-Flash與物理引擎整合,我們構建了一個以30 FPS運行的完全可玩生成式世界。
大規模視覺生成模型的能力日益增強,但其訓練、微調與部署成本高昂。我們提出Mage-Flow,一個緊湊的4B規模生成堆疊,用於高效文字到影像生成與基於指令的影像編輯。該堆疊由兩個協同設計的元件構成:Mage-VAE(輕量高保真潛在分詞器),以及使用整流流匹配訓練的原生解析度多模態擴散變壓器。Mage-VAE採用一步擴散式編碼/解碼與錨點潛在正則化,在維持強大公共VAE重建品質的同時,將分詞成本降低一個數量級以上。結合原生解析度打包與堆疊級CUDA核心融合,該堆疊支援彈性解析度訓練,並將端到端訓練吞吐量提升約2.5倍。在此基礎上,我們開發了完整的模型系列,包含用於生成與編輯的Base、RL對齊與Turbo變體。擴散NFT改善了提示跟隨、文字渲染、美學品質與編輯保真度,而結合對抗性感知引導的少步蒸餾則產生了適用於低延遲推論的4步Turbo模型。儘管規模緊湊,Mage-Flow與Mage-Flow-Edit在標準生成與編輯基準測試中仍展現出競爭力。更重要的是,Turbo變體使高解析度生成與編輯可用於互動場景:在單張NVIDIA A100 GPU上,以1024²解析度,Mage-Flow-Turbo可在0.59秒內生成影像,Mage-Flow-Edit-Turbo可在1.02秒內編輯影像,同時維持較小的記憶體佔用。這些結果表明,精心的分詞器-骨幹網路-系統協同設計,能在高效的4B模型家族中實現強大的高解析度生成與編輯。
與傳統依賴勞動密集型管線進行資產製作、動畫、物理及程式開發的電玩遊戲不同,影片世界模型能從使用者輸入即時生成互動環境。它讓我們能透過文字、圖片或影片,創造出可自訂、可探索且持續演進的虛擬世界。實現此願景需要四項緊密耦合的能力:互動性、持久的時空一致性、穩定的長時程生成,以及高效的反應速度。我們提出 AlayaWorld,這是一個互動式長時程影片世界模型,能以 540p 和 720p 的解析度生成每秒 24 幀的影片。該模型建構於 15B 參數的影片擴散變壓器之上,能根據攝影機軌跡及可切換的文字提示,以自迴歸方式生成短暫的潛在區塊。其有界視覺脈絡結合了持久的容器幀、壓縮的時間歷程、符合幾何結構的空間記憶,以及近期幀條件設定。為減少長期漂移,模型會利用其自身推論過程中收集的損毀歷程與預測殘差進行訓練。我們進一步引入一種離散自迴歸蒸餾公式,結合分佈匹配蒸餾、自我強迫++與一致性蒸餾,將每個區塊的推理從約 30 個取樣步驟減少至 4 個步驟。在 iWorld-Bench 上,AlayaWorld 在長時程生成方面達到了最佳表現。作為一個全棧、開源且長期的專案,AlayaWorld 旨在為未來互動式影片世界模型的研究提供一個可擴展的基礎。
擴散語言模型(Diffusion Language Models, DLMs)近期已成為自迴歸模型之外一個有前景的替代方案。與標準的基於擴散的方法不同,DLMs 並非明確地以時間步為條件,這引發了一個自然問題:這些模型是否在內部表徵去噪進度,而此類資訊又如何在下游被利用?在本工作中,我們證明 DLMs 確實在其殘差流中編碼了與擴散時間步相關的潛在表徵。我們發現,此訊號可透過跨層的探測器可靠地提取,顯示去噪進度可從內部激活中解碼。我們進一步證明,沿著與推斷時間步相關的低維子空間引導模型,能讓我們系統性地調節其對去噪進度的認知,從而導致模型置信度與熵的可預測變化。最後,我們分析所辨識表徵的幾何結構,顯示其在激活空間中具有結構化且可解釋的性質,並闡明這類訊號如何被這些模型處理。
非同步強化學習透過將軌跡生成與最佳化過程解耦以提升吞吐量,但陳舊性(staleness)是不可避免的副產物,其成因包括策略延遲、引擎延遲及專家混合路由。從信賴區域(trust-region)的觀點來看,此失配問題至關重要:訓練-推論分歧決定了有限時域界限中的近似誤差,而PPO裁切(PPO clipping)僅能限制抽樣的向外更新,作為一種抽樣替代而非全局策略約束。因此,在陳舊軌跡影響最顯著的非同步機制下,高陳舊性更新依然缺乏有效控制。 我們提出適應性陳舊度信賴區域(Staleness-Adaptive Trust Region, SAT),該方法利用分離的抽樣對數比作為實用的陳舊度代理,透過基於陳舊度的核縮放識別每一批次內的高失配尾部,並僅收縮名義PPO區間中符號選取的端點。此舉在普通詞元上保留基準行為,同時對新攔截的向外帶實施更保守的更新。我們證明了相較於PPO的局部區間包含性與逐點悲觀性,展示了適應性規則如何在異質陳舊度下重塑更新幾何結構。 我們在基於Qwen3-30B-A3B-Base建構的解耦非同步RL設定中評估SAT,採用SGLang作為推理引擎、Megatron進行訓練。在此設定下,SAT-GSPO搭配R3達到了觀測到的最佳AIME24平均@8,在滯後1為35.83、滯後8為34.79;而SAT-GSPO在滯後1達到34.17。適應性裁切與路由重播分別針對失配尾部與路由不一致性,作為互補的穩定器。總體而言,使裁切區間與陳舊度異質性對齊,能有效穩定非同步強化學習。
LLM代理的故障難以除錯,因為錯誤顯現的步驟通常並非導致錯誤的根源。現有的可觀測性工具會重播執行軌跡,但在識別根本原因或將診斷轉化為復原方面提供的支援有限。我們提出AgentDebugX,一個開源除錯框架,將除錯組織為偵測、歸因、復原與重新執行的閉環。其核心DeepDebug透過全局軌跡理解、結構導向調查與交叉檢驗,執行多輪根本原因診斷。在Who and When基準測試中,DeepDebug在兩個受測的開放權重骨幹模型上,均達到評估方法中最高的嚴格歸因準確率,在qwen3.5-9b上達到28.8%的精確代理與步驟準確率,而最強的單次通過基準為21.7%。在GAIA上,DeepDebug在單次重新執行中修復了73個失敗任務中的13個,而三個去耦自我修正基準僅修復4到6個,將整體準確率從55.8%提升至63.6%。AgentDebugX透過Python函式庫、命令列介面、網頁控制台與可安裝的代理技能公開此工作流程,並提供選擇加入的錯誤中心,用於分享已清洗的故障-診斷-修復套件,並將其重複使用作為除錯記憶。
結構保真度對科學方法論圖表至關重要。為傳達研究邏輯,這些圖表須忠實呈現元件、方向關係及文字註解。由於單一錯誤(例如箭頭反向或方程式難以辨識)可能使整個圖形失效,結構保真本質上具有合取性:在某個面向上的正確性無法補償另一面向的失誤。現有開源模型未能滿足此項標準。監督式微調(SFT)可學習合理的佈局,但無法可靠確保結構正確性;而基於標量獎勵的後訓練則模糊了哪個結構面向發生錯誤。為解決此問題,我們提出 SciForma,一個用於科學方法論圖表結構保真生成的框架。具體而言,SciForma 將圖表品質分解為三個結構軸向:元件、箭頭與文字,並以結構清單為引導。在此基礎上,我們策劃了 SciFormaData-700K 用於結構化訓練,以及 SciFormaBench-2K 用於邏輯驗證評估。為填補 SFT 留下的差距,我們開發了多維合取偏好最佳化(M-DPO),該方法強制所有軸向同時正確,並在後訓練中自適應地將梯度導向最不足的維度。相同的結構清單還能於推論時進行疊代編輯,以修正殘留錯誤。此組合使 SciForma-9B 在 SciFormaBench-2K 與 AIBench 上均超越所有開源基準及 GPT-Image-1.5,將開放科學圖表生成提升至接近專有等級的結構保真度。我們的程式碼與數據將公布於:https://github.com/microsoft/SciForma。
高效的團隊協作通常結合全域協調與並行執行,然而這一原則尚未在基於統一視覺語言模型(VLM)的文件解析器中得到充分體現。現有的統一解析器雖能共同處理整頁內容,但其輸出過程卻依賴單一的逐詞自回歸生成軌跡,這形成了隨文件長度增長的序列化瓶頸。這種全頁序列生成忽略了文件解析的關鍵特性:版面結構需全域分析,而區塊內容則可並行解析。基於此觀察,我們提出HPD-Parsing,以分層並行解碼(Hierarchical Parallel Decoding)典範取代全頁自回歸生成。主版面分支負責組織整體文件結構,並動態分配區塊級內容解碼至並行分支,同時漸進式多詞預測(P-MTP)進一步減少各分支內的解碼步驟。在公開基準測試中,HPD-Parsing每秒可處理4,752個詞元,吞吐量達到現有最快文件解析模型的2.62倍,以及傳統自回歸基線模型的3.06倍,同時維持具競爭力的解析準確率。這些結果證明了分層並行解碼可作為全頁自回歸生成的有效替代方案,為高效統一文件解析開闢了新方向。
評估長篇生成內容的事實性,主要聚焦於精確度,即衡量模型所提出的主張是否正確。主流的「分解-搜尋-驗證」流程確實能有效捕捉不正確的主張,但對於回應是否包含所有應有資訊,卻著墨甚少。衡量事實完整性——事實性的缺失一半——更加困難:它需要列舉一個完整答案應包含的全部事實,而這些事實很少能形成一份扁平清單。它們通常涉及開放的集合(其中覆蓋率才是關鍵)、有序的流程,以及事實間的關係,這些關係是獨立布林檢查清單所無法捕捉的。我們提出一個兩層級的元評分量表框架來評估開放式生成,並將其具體化為 Gamut(多模態事實性的基礎評估),一個針對長篇生成事實完整性的基準。該框架建立在兩層級的評分量表表示法之上:一個結構化的元評分量表捕捉所需內容的組織與重要性,然後機械性地編譯成一份由二元、機器可評分的評分量表組成的扁平檢查清單,讓大型語言模型評分者能可靠地打分。我們建構了 1,813 個問題,這些問題基於來自 10 個多元領域的真實可穿戴裝置影像,每個問題都附有由專家人工註釋者驗證的、有證據支持的評分量表。由於該框架與模態無關,我們也釋出了一個純文字版本。評估 14 個前沿模型與開放權重模型後,我們發現該基準確實具有挑戰性(最佳分數為 Gemini 3.1 Pro 的 58.7%),區分度極高,且對評分者的選擇具有穩健性。
我們提出AutoIndex,這是一個用於學習表示程式的框架:可執行的轉換,將原始文檔映射到檢索系統所暴露的表示。不同於調整檢索器、重新排序器或一小組預處理超參數,AutoIndex在索引之前搜尋對文檔進行切片、豐富、正規化、重新加權或重新組織的程式。在每次迭代中,AutoIndex執行驗證引導的程式搜尋,其中智能體診斷當前程式的失敗並合成候選更新,僅保留在結果索引下能提升檢索品質的更新。我們在CRUMB(一個異質檢索任務基準)上評估AutoIndex,所有實驗皆固定使用BM25。學習到的程式在所有8個任務上,相較於靜態全文BM25基準,均提升了召回率,平均Recall@100提升8.4%,nDCG@10提升8.3%,最大提升分別為Recall@100提升30.5%,nDCG@10提升43.6%。這些結果表明,文檔表示不應被視為檢索開始前的固定預處理選擇,而應作為明確的優化目標。可重現我們結果的程式碼已於https://github.com/auto-index/autoindex公開。
基於可驗證獎勵的強化學習(RLVR)正迅速推進語言模型的推理能力,然而,將獎勵反饋轉化為權重空間更新的優化層卻仍未被充分理解。基於我們先前的研究(Zhu 等人,2025),我們透過模型權重的奇異結構來探討這個缺失的層,並發現了譜繼承現象:RLVR 能夠重複使用基礎模型的權重譜,同時透過相關的輸入與輸出奇異幀的變化來獲得新的行為。 我們將譜繼承具體實現為等譜優化(ISO),這是一個原生於 RLVR 的固定譜優化框架,並提供互補的離線與線上實例。離線版本 ISO-Merger 將共享基礎模型之專家成員的幀變化合併為單一固定譜模型,無需任何合併後的數據、交互取樣、梯度更新或在策略蒸餾(OPD)。它恢復了互補的專家能力,並在比較的無數據合併方法中達到了最強的綜合性能。線上版本 ISO-Optimizer 將選定的基礎優化器(包括 AdamW 與 Muon)應用於幀變量,同時保持基礎譜固定。在參數規模從 1.5B 到 8B 的推理與程式碼任務中,ISO-Optimizer 在報告的運行中提升了準確率,並以顯著更少的訓練步數達到匹配的分數。以 Qwen3-8B-Base 為例,AdamW 在 270 個訓練步數後達到 0.495 的聚合準確率,而 ISO-AdamW 僅需 100 個訓練步數便達到相同準確率,並在 210 個訓練步數後進一步提升至 0.509。綜上所述,ISO 為 RLVR 中缺失的優化層提供了具體解答:與其全盤繼承預訓練的優化方式,不如在獎勵驅動的適應結構基礎上設計後訓練——繼承譜,優化幀。
現代自動語音辨識模型在異質標註資料上訓練時,會將轉寫風格(逐字對比意圖)視為未受控制的潛在變數,導致可測量的解碼不穩定性、評估混淆(多達60%的詞錯誤率差異源自風格不匹配),以及不可靠的詞層級時間戳記。我們證明模型實際上已編碼兩種風格;問題在於如何受控地啟用。透過在平行逐字/意圖轉寫配對上訓練的覆蓋感知解碼器任務標記,我們在僅接受英文訓練的情況下,將德語不流暢F1分數從10%零樣本提升至79%。純英文微調在逐字準確率、不流暢偵測及兩種語言的意圖模式品質上,均超越所有基準模型。我們進一步引入監督式交叉注意力微調,此法改善不流暢語音上的詞層級時間戳記,表現優於強制對齊基準。最後,我們提出「逐字化」這項新任務,可擴展地建立及豐富語料庫,並產出高品質的標準逐字轉寫。
视频模型吸收了关于视觉世界如何运动、交互以及响应接触的丰富先验知识,使其成为机器人世界建模的理想基底。核心挑战在于如何将动作传达给这类模型——既需要以与其学习交互先验的视觉空间一致的形式表达,又必须植根于物理操作。我们提出掩码视觉动作(Masked Visual Actions),一种像素空间控制接口,将动作表示为视频中任意实体部分显现的运动轨迹。揭示机器人运动可使模型充当正向动力学模型,预测场景对低级机器人动作的响应;而揭示期望的物体运动则能使同一模型恢复与该结果一致的机器人行为。仅通过15小时来自真实视频和模拟的掩码示例进行微调,单个检查点便能在多样化场景和多形态实体中实现高视觉保真度与可控性。在下游操作场景中,该模型可生成与真实世界执行结果相关联的想象展开序列,用于策略评估;通过基于模型的规划中对候选未来状态进行排序来改进决策;并支持逆向建模,从期望的物体运动合成机器人运动。
基于可验证奖励的强化学习(RLVR)在提升大语言模型推理能力方面取得了显著进展,特别是在数学推理和代码生成等任务上。然而,大多数RLVR方法为完整轨迹分配标量结果奖励,导致监督信号稀疏且词元级信用分配受限。在线策略蒸馏(OPD)通过从更强的教师模型中蒸馏词元级分布来提供更密集的监督,但需要额外的教师模型且通常假设共享词汇表。在线策略自蒸馏(OPSD)通过使同一模型基于特权信息构建教师策略来消除这一依赖。然而,直接匹配教师分布可能导致信息泄露和优化不稳定。RLSD通过仅利用教师信号调节更新幅度来避免直接匹配,但当采样推理失败时无法提供明确的修正方向。为应对这一权衡,我们提出H²SD——一种混合事后自蒸馏框架,根据轨迹正确性差异化使用教师信号。对于成功轨迹,教师接收经确认为正确的学生回答及重述指令,并利用其对原始回答词元的概率来调节更新幅度,而不改变由奖励确定的更新方向。对于失败轨迹,我们使教师基于包含关键推理步骤与已验证答案的参考提示进行条件生成,并最小化学生分布相对于教师分布的反向KL散度。在多个具有挑战性的推理基准上的实验表明,H²SD在保持稳定优化和高效生成的同时,持续优于代表性的RLVR、OPSD和RLSD基线方法。
优化器状态是混合专家(MoE)模型训练中内存预算的最大单一开销项:对于一个67.8亿参数的MoE语言模型,AdamW需要占用50.6 GB的一阶和二阶动量来更新12.6 GB的bfloat16权重。我们研究SkewAdam优化器,其构建基于以下观察:MoE的三种参数群体——密集骨干网络、专家模块和路由模块——在规模与梯度统计特性上差异显著,不应共享相同状态。SkewAdam为骨干网络(占参数5%)保留float32动量及因式分解二阶动量,为专家模块(占参数95%)仅保留因式分解二阶动量,为路由模块(占参数<0.01%)保留精确二阶动量。由此产生的状态仅占用1.29 GB,相当于AdamW的2.6%,训练峰值内存从81.4 GB降至31.3 GB,完全适配40 GB加速器的预算。在基于相同初始化的受控比较中(训练8.2M token),SkewAdam达到验证困惑度108.4,领先于AdamW(126.8)、Muon(120.2)和Lion(393.7),并将路由负载均衡度稳定在均匀分布基线的1%以内。这种层级分配并非困惑度提升的核心原因:层级消融实验在使用二十倍状态量时仍能复现相同效果,而共享因式化估计量但丢弃动量的Adafactor优化器则落后40个困惑度点。层级设计以零精度代价换取内存节省,真正的精度提升来自动量保持——而这恰恰是统一优化器同样具备的特性。通过扫描基线方法的学习率可缩小差距但无法消除:最优调参后的AdamW达到118.5,Adafactor达到139.7。这些结果表明,优化器状态的位置分布,其重要性至少不亚于状态量的大小。
跨視角地理定位旨在將地面觀測與帶有地理標籤的衛星影像進行匹配。近期方法顯示,如影片片段這類序列化查詢能提供比單張影像更豐富的時空線索,然而這些方法忽略了另一種互補的序列化模態:路線描述——它以更高層次的抽象捕捉相同軌跡,並且往往是唯一可用的輸入(例如,用戶引導自動駕駛車輛前往接駁點)。為填補此缺口,我們提出SeqGeo-VL資料集,包含模擬39K組影片-文字-衛星三元組,以及TrajLoc統一框架,能同時處理影片片段與路線描述。透過利用密集視覺語義與抽象語言語義,TrajLoc使這些模態能夠相互強化跨視角匹配。我們進一步提出輕量級模組TrajMod,該模組根據軌跡幾何條件化查詢嵌入,從而產生空間感知表徵。實驗結果顯示,TrajLoc在影片與文字地理定位任務上均顯著優於現有最先進方法。專案頁面可於 https://humblegamer.github.io/trajloc/ 查閱。
精確的大規模農業田塊邊界劃定是確保糧食安全、供應鏈透明度及碳核算的基礎任務。儘管像SAM這類視覺基礎模型展現出卓越的零樣本能力,但在地理空間領域中,由於拓撲複雜性、農田紋理模式以及缺乏物理尺度感知,這些模型經常失效。本研究提出Delineate Anything v2,一個專為大面積田塊邊界繪製設計、可全球擴展的基礎模型。我們構建了FBIS-73M資料集,該資料集包含跨越61個國家、總計7300萬個實例的多解析度資料。為解決普遍存在的多田塊行政地塊合併問題,我們引入了一套解析度特定的資料整理流程,該流程利用拓撲影像空間適應來均質化合併後的地塊,並強化薄弱的物理邊界。此外,我們建立了一個新穎且經人工篩選的評估基準,涵蓋100個國家,用以評估獨立的零樣本泛化能力。結果顯示,Delineate Anything v2在mAP@0.5指標上超越了當前最先進的Delineate Anything框架0.284(相對提升103.3%),同時保持了適合快速國家及全球規模部署的執行速度——這在烏克蘭全國範圍製圖(603,000平方公里)中獲得驗證:僅需5.4小時即可在消費級工作站上完成。程式碼、預訓練權重、FBIS-73M資料集以及可直接使用的國家級向量邊界產品均已公開於https://github.com/Lavreniuk/Delineate-Anything。
教學影片正逐漸成為主要的教育媒介,因此對於其教學品質進行可擴展評估的需求也日益增長。現有的自動評判系統並未能完全應對此情境,因為教學品質取決於多模態證據,且應根據預期的學習者來評估,而非將其視為普遍屬性。我們提出了EduPanel,這是一個基於評分量規、以學習者為條件的LLM評判系統,它將評估任務分解到專門的代理中,從而為教學品質的不同層面提供可解釋的評估結果。透過專家研究、架構消融實驗以及學習者角色分析,EduPanel達到了與人類專家中位數相當的信度。在專家評估中,其反饋提升了評分準確度(平均絕對誤差從0.87降至0.73),同時專家仍能偵測到不可靠的輸出(AUC = 0.77),而非盲目接受。這些結果表明,EduPanel可作為教育評估的有效輔助工具,而非取代人類專家。
可控图像生成对创意专业人士而言仍具挑战,他们常需对材质、物体身份及空间布局进行精确的区域控制,而仅靠文本提示无法可靠实现。扩散变换器(DiTs)能够原生处理来自文本和图像的异质令牌,但缺乏决定这些令牌在何处及如何影响输出的机制。我们提出了外观指针——紧凑型令牌,通过将文本或图像输入与用户指定的遮罩对齐,引导DiTs在正确的空间位置获取正确的外观线索。外观指针由区域对应网络生成,并通过空间聚合机制进行优化,使模型能够处理多个区域描述,同时不会显著增加令牌负载。我们的方法首次在无需从头重新训练基础模型的情况下,为DiT引入了模态无关的区域多模态控制接口。在一系列指标上,我们的单一模型达到或超越了特定模态的最先进方法,为生成式图像合成中精确、区域感知的多模态指导提供了一条简单且可扩展的路径。
迷因、卡通與漫畫中的多模態幽默對人工智能系統而言仍具挑戰性,因為預期意義依賴於非字面機制、共享文化知識及溝通意圖,而非單純的場景字面描述。本調查聚焦於單圖及多格作品中的視覺幽默理解,同時將幽默生成視為新興的前沿應用領域。我們有別於先前的幽默、諷刺及通用多模態大語言模型(MLLM)綜述,並以能力為核心的分層架構來組織文獻,涵蓋辨識、解讀與推理,以及生成等層面。在此視角下,我們綜合分析基準設計、評估協議與建模範式,追蹤該領域從任務專用融合模型,朝基於多模態對齊、證據基礎推理及受控生成的大型模型方法的轉變。最後,我們指出阻礙進展的主要障礙:易受捷徑影響的評估、有限的文化與敘事覆蓋範圍、薄弱的證據基礎,以及未解決的安全與版權疑慮。
视频空间推理对于面向导航的感知与长视频问答至关重要,在此类任务中,模型必须在视角不断变化的长时程范围内推断空间关系。然而,现有的大语言多模态模型仍以语义为中心,往往无法从冗余的视频观测中可靠地聚合一致的空间证据,导致推理效率低下或不稳定。为解决这些问题,我们提出ConsiSpace,一种基于几何一致性感知的框架,专门用于几何敏感的视频空间推理,将空间一致性同时转化为证据组织原则与显式的后SFT学习信号。我们构建了包含隐式证据标记与显式几何线索的几何一致记忆模块,并利用高效的组织策略紧凑地保留与任务相关的空间证据。此外,我们采用监督微调后的统一一致性自监督强化学习,通过答案一致性、度量一致性与拓扑一致性奖励,提升跨视角稳定性。在三个空间推理基准测试(VSI-Bench、OSI-Bench与MMSI-Video-Bench)上的广泛实验显示,该方法相较于最强基线模型平均提升了12.6分,取得了持续的性能改善。