每日精選AI研究論文及翻譯
在开放世界中进行机器人操作,不仅需要识别场景的视觉外观,还需预测其三维结构在交互过程中如何变化。我们认为,同步的RGB、深度与光流信息(即RGB-DF)能够提供一种物理上的有根基的表示,捕捉场景背后的四维动态。相较于二维像素视频,这种多模态融合将视觉外观、几何结构与时序运动对齐,构建出一个更接近机器人系统所需低级末端执行器动作的表示空间,从而缩小了世界预测与策略学习之间的差距。基于这一洞察,我们提出了RynnWorld-4D——一个生成式模型,它能够在统一的扩散过程中,从单张RGB-D图像与一条语言指令出发,共同生成未来的RGB帧、深度图与光流。该4D世界模型采用三分支架构,集成跨模态注意力与逐帧三维旋转位置编码(3D RoPE),确保外观、几何与运动的一致性演化。为提供大规模训练数据,我们整理了Rynn4DDataset 1.0——一个包含超过2.544亿帧的大规模数据集,涵盖自我中心视角的人类与机器人操作视频,并附有高质量的深度与光流伪标签。我们进一步提出了RynnWorld-4D-Policy——一个逆动力学头,能够通过单次前向传播直接消费RynnWorld-4D的内部4D表示,绕过耗时的多步去噪过程,以闭环方式输出机器人动作。实验表明,RynnWorld-4D能够生成时空一致的4D预测,而RynnWorld-4D-Policy在真实世界的灵巧双臂操作任务中达到了最先进的性能,尤其在需要空间精度与时间协调的任务中表现卓越。
傳統遊戲世界通常透過高勞動密集的生產流程構建,導致開發成本高昂、難以客製化,且部署後修改不易。近期影片世界模型的進展提供了截然不同的典範:這類模型無需逐一明確設計虛擬環境中的所有元件,而是根據當前的世界狀態與使用者互動,以自回歸方式合成未來的觀察結果,從而實現即時生成可遊玩的世界。這些模型同時以遊戲錄影與真實世界影片進行訓練,能夠捕捉多樣的視覺表徵與物理動態,為超越遊戲範疇的互動式應用(包括具身智慧)開創了新的可能性。本文提出 AlayaWorld——一套用於建構互動式生成世界的全端開源框架。AlayaWorld 支援開放式的即時互動,允許使用者自由探索並執行戰鬥、施法、召喚怪物等多樣化的動作。該框架將完整的開發流程——從資料準備、模型架構、模型訓練、推理加速到部署——統一在一個模組化且可擴充的架構中。伴隨框架的釋出,我們同時公開了可重現的流程、參考實作、評估工具與完整的文件,為生成式世界模型的未來研究與即時應用奠定了實務基礎。
扩展机器人学习需要大量、多样化的轨迹数据,然而目前数据的采集受限于物理遥操作——每次演示都需要操作者在特定硬件和工作站上投入时间。为此,我们提出数字遥操作这一范式,通过用生成式世界模型替代真实机器人,将数据采集从物理约束中解耦出来。在该框架下,操作者的手部姿态流驱动一个以机器人为中心的生成式世界模型,基于单张参考图像合成高保真的自我中心视角视频。记录的姿态流作为无具身依赖性的动作标签,可通过标准重定向技术迁移至任意目标机器人,从而生成独立于物理硬件的完整状态-动作轨迹,用于模仿学习。我们将这一范式具体实现为RynnWorld-Teleop系统,该系统集成了深度感知的骨骼条件建模、渐进式人-机器人训练(基于视频扩散变换器)以及流式自回归蒸馏。该流水线将生成过程压缩为单次推理,在单张H100 GPU上实现40帧/秒以上的实时交互式生成。仅使用RynnWorld-Teleop生成的数据训练的策略,能够在多种灵巧及双臂协作任务中实现有效的零样本仿真到现实迁移。此外,用我们的数字遥操作数据增强真实世界数据集,能够持续提升任务成功率,证明RynnWorld-Teleop可作为面向下一代机器人智能体的高保真、可扩展的数据引擎。
擴展現代大型語言模型(LLMs)至長上下文的能力受到兩大限制:二次計算成本與密集注意力的弱長度外推能力。分塊稀疏注意力提供了有前景的替代方案,但現有方法因不精確的區塊選擇而無法達到全注意力的效果。我們提出分層地標稀疏注意力(HiLS Attention),這是一種可學習區塊選擇的分塊稀疏注意力機制,能在語言建模損失下進行端到端的區塊選擇學習。HiLS 將注意力分解為分層結構:每個查詢獨立對每個檢索到的區塊進行注意力計算,以提取區塊特定信息,並根據區塊檢索分數融合輸出結果。透過將檢索分數納入前向注意力計算,HiLS 能直接以語言建模損失優化這些分數,實現端到端的檢索學習與原生稀疏訓練。實驗結果顯示,HiLS-Attention 在域內上下文長度下可達到與全注意力相當甚至更優的表現。同時,HiLS-Attention 能以 90% 的檢索準確率,外推至訓練上下文長度的 64 倍以上,遠超全注意力。此外,現有的全注意力模型可透過輕量級持續預訓練轉換為 HiLS-Attention,在保持域內表現的同時獲得超長上下文外推能力。結合其稀疏的 KV 存取與計算,HiLS-Attention 打破了常見的效率-性能權衡,使長上下文 LLM 在一般長上下文任務上比全注意力對應版本更高效且更有效。
我們將電腦視覺表述為統一的多模態生成任務,將異質的視覺任務表達在統一多模態模型的原生文字與影像生成空間中,而無需任務專屬的架構。在此表述下,SenseNova-Vision 使用自然語言指令與可選的視覺提示來指定任務、目標區域或視角,以及解碼慣例,並以文字生成符號輸出、以影像生成密集空間預測、或以文字與影像混合輸出處理組合性任務。為支援大規模訓練,我們將多樣的電腦視覺標註轉換為與這些生成空間相容的指令-回應範例,從而建立 SenseNova-Vision 語料庫——一個涵蓋文字、影像與混合目標的電腦視覺指令-回應語料庫。SenseNova-Vision 從現成的預訓練統一多模態模型出發,主要在此語料庫上進行訓練,並輔以多模態資料作為能力保留的混合資料,且無需任務專屬的預測頭或架構修改。最終的模型涵蓋廣泛的視覺任務,包括偵測、OCR、關鍵點估計、分割、深度估計、表面法線預測、點雲與相機姿態估計,同時支援由語言定義的變體,這些變體結合了類別、顏色、區域及其他視覺線索。實驗顯示,單一統一模型能在結構化視覺理解、密集幾何預測、分割與多視角視覺幾何方面,與領先的任務專屬系統匹敵。這些結果表明統一多模態生成是將電腦視覺能力整合至通用基礎模型的一條可擴展路徑。該模型與語料庫已公開提供。
我們介紹 Gemma 4,這是 Gemma 模型系列中新一代的開放權重、原生多模態語言模型。為了提升計算效率與推理能力,Gemma 4 模型套件採用了密集架構與混合專家(MoE)架構,參數量從 2.3B 到 31B 不等。除了為所有模型規模改進視覺與音訊編碼器外,我們也為 12B 模型提出了一種統一的、無編碼器(encoder-free)架構,可直接處理原始音訊與影像區塊。此外,我們整合了思考模式,讓 Gemma 模型能在回應之前先產生推理軌跡。我們透過關鍵設計選擇,提升了推論速度、記憶體與計算效率,以及長上下文能力。Gemma 4 在 STEM、多模態及長上下文基準測試中實現了效能飛躍,並能在人工評分任務中與更大規模的前沿開放模型相匹敵。
智能體視頻理解賦能模型長期記憶,使其能自主處理並回應連續、長時域的多模態串流。然而,先進的視頻智能體通常依賴「偵探式」迭代推理來進行動作控制(例如搜索)與證據聚合,導致高昂的成本與延遲。我們認為,此類繁重推理主要用於補償全域脈絡的缺失以及檢索語義對齊不足。本文提出Light-Omni,一個用於反射式與輕量級視頻理解的多模態智能體框架。它通過雙重脈絡狀態在單次前向傳播中即時構建所需脈絡。首先,我們維護一個全域狀態,即從情景記憶中持續壓縮而成的有限大小多模態腳本,作為Light-Omni的全域脈絡。通過層次化合併,它在保留近期細節的同時總結過往事件。其次,基於此全域脈絡,我們生成一個參數化潛狀態,直接驅動自主動作並產出檢索嵌入,延遲極低。得益於這種耦合設計,Light-Omni實現了語義對齊檢索與反射式回應,避免了迭代推理。大量實驗驗證了Light-Omni在多個視頻基準上的有效性。值得注意的是,它相較於M3-Agent平均準確率提升2.4%,速度提升12.1倍,GPU記憶體效率提升2.6倍。此外,它可作為記憶系統增強現有MLLM的性能與效率。專案頁面:https://clare-nie.github.io/Light-Omni。
推测解码通过将草稿生成与目标验证解耦,加速了大语言模型(LLM)的推理过程。尽管近期提出的并行草稿生成器能够在单次前向传播中高效生成较长的令牌序列,但由于缺乏令牌间的依赖关系,这些序列的接受率会快速衰减。此外,不加区分地验证这些扩展块,会浪费关键批量容量来处理具有高拒绝风险的令牌,从而严重降低高并发服务系统的吞吐量。我们提出了DSpark,一种将高吞吐量并行生成与自适应、负载感知验证相统一的推测解码框架。为了维持草稿质量,DSpark采用半自回归架构,将并行主干与轻量级顺序模块相结合,引入块内依赖建模,缓解后缀衰减问题。为了优化系统效率,DSpark采用置信度调度验证,根据估计的前缀存活概率以及引擎特有的吞吐量特征,动态调整每个请求的验证长度。在跨多种领域的离线基准测试中,与最先进的自回归和并行草稿生成器相比,DSpark显著提升了接受的令牌长度。当部署在DeepSeek-V4服务系统中并面对真实用户流量时,DSpark成功缓解了验证浪费问题。与已投产的基准(MTP-1)相比,DSpark在相同吞吐量水平下将每位用户的生成速度提升了60%到85%。更重要的是,通过防止在严格交互性约束下出现严重的吞吐量下降,DSpark实现了此前难以企及的性能档次,推动了我们服务系统的帕累托前沿发生位移。
虽然自主智能体的技能优化已日益受到关注,但现有方法依赖于复杂的流水线。这留下了一个根本问题尚未得到解答:什么构成了技能优化的最小可行流水线,其中每个组件都经过理论或经验必要性的证明?我们通过零阶优化(ZO)将技能优化形式化,将经典方法(中心差分、信任区域)与近期文献对应起来。我们注意到,与经典ZO中盲目的数值扰动不同,技能轨迹可作为可解释的调试反馈。基于Claude Code理念和PAC学习,我们建立了收敛与泛化的三条原则:基于文件系统的轨迹探索、共识属性挖掘、以及独立验证门控。去除冗余后,我们提出了SkillOpt-Lite。它加速了收敛,并全面超越了完整版SkillOpt:在GPT-5.5上提升LiveMath +8.8分,在GPT-5.4-nano上提升+25.4分,使nano模型超越了经SkillOpt优化的标准GPT-5.4。最后,我们将框架集成到VSCode Copilot等生产级编码智能体中,使开发者能够通过一条情境指令演化智能体技能。由于我们的框架将所有智能体组件视为标准可编辑代码,这一最小流水线自然可以推广到完整的工具优化(HarnessOpt)。在SpreadsheetBench上,HarnessOpt使GPT-5.4-nano达到0.7758的准确率,超越了使用标准流水线的更大模型GPT-5.5(0.7620)。代码已开源至https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite。
密集视频描述旨在生成帶有時間定位的視頻事件描述,有助於事件層級的視頻理解與生成。在此領域中,自回歸視頻大語言模型因其強大的生成能力與跨模態建模能力,已成為主流範式。然而,在逐 token 生成模式下產生密集描述,嚴重限制了推論效率,並隨視頻長度與事件密度增加而阻礙可擴展性。本研究提出一個並行化自回歸框架,不僅提升了生成效率,也強化了時間定位描述的性能。我們的關鍵洞察在於利用跨時間事件間的弱局部依賴性,重構因果依賴圖,從而實現無損的並行生成。具體而言,具有弱跨事件依賴關係的 token 可進行並行解碼,而每個事件內部緊密耦合的 token 則保留序列解碼以維持局部語義連貫性。為實現此洞察,我們引入了兩項關鍵元件以達成無損並行解碼:(1) 一種潛在全局規劃機制,可自動學習事件層級結構,產生編碼全局事件間因果關係的緊湊 token,同時自適應聚合事件層級的視聽語義,引導後續的依賴重構與並行解碼;(2) 一種事件分解的並行解碼機制,有效平衡局部關注與全局事件間感知。在多個基準測試上的實驗結果顯示,我們的方法在全模態事件定位與描述上,無論在效率或性能方面均具有明顯優勢。專案網站:https://github.com/showlab/PadCaptioner。
儘管近期視覺語言動作(VLA)基礎模型取得了進展,但實驗室條件與真實世界應用之間的差距仍持續阻礙其實際部署。為彌合此差距,我們提出 LingBot-VLA 2.0,透過三個功能領域的改進來推進 LingBot-VLA。(1)任務與具身形態的通用化。相較於前一版本,我們徹底改造資料處理流程,並整理約六萬小時的預訓練資料,其中包括五萬小時涵蓋二十種機器人配置的機器人軌跡,以及一萬小時的自我中心人類影片。(2)除了雙臂硬體平台之外,擴展動作空間。具體來說,我們的系統支援頭部、腰部、移動底座及靈巧手的自由度,從而使機器人能夠在實際場景中處理更複雜的任務。(3)預測動力學建模以改善時間推理。具體而言,我們將未來預測制定為代理任務,並透過影片表徵模型提供語意先驗知識,以及深度估計模型提供幾何線索。在通用設定下於 GM-100 基準進行的評估,驗證了這些提出的修改所帶來的正面影響。此外,得益於涵蓋全身自由度的擴展預訓練資料,LingBot-VLA-2.0 在兩個機器人平台上展現了強大的跨具身形態長程移動操作能力。
同策略蒸餾(OPD)透過在學生自身的軌跡上匹配更強教師的策略來訓練學生策略,為語言智能體的訓練提供了一個有前景的框架。然而,其在長程智能體任務中的應用仍有待充分探索。我們發現基礎智能體OPD存在兩個關鍵效率問題:(1)完整軌跡的滾動通常會浪費牆鐘資源在尾部回合上,而這些回合提供的KL監督既微弱又帶有雜訊;(2)軌跡層級的KL目標將大部分損失集中在淺層詞元上,一旦初始行為對齊後,更深層的決策回合便訓練不足。為解決這些挑戰,我們提出TurnOPD——一種針對長程智能體高效同策略蒸餾的回合級預算策略。TurnOPD包含兩個預算控制器:自適應滾動深度預算,利用基於探測的回合統計數據決定滾動長度;以及漸進式回合歸一化損失預算,逐步將KL加權從詞元級別轉向回合平衡的監督。在ALFWorld、WebShop以及使用任務專門化教師模型的多跳搜索任務上的實驗表明,在相等的牆鐘訓練預算下,TurnOPD實現了更優的驗證準確率,並將準確率-時間前沿推向超越基礎OPD。
我們介紹 MentalThink——一種視覺-符號推理典範,賦予多模態大型語言模型(MLLMs)一套可執行的「心理」視覺化機制。MentalThink 的核心是一條「思考搭配 SVG」流程,讓模型學會生成、渲染並解釋可縮放向量圖形(SVG)程式碼,作為多輪推理的中間視覺表徵。透過建立結構化的向量草圖,模型能將空間假設外化,經由確定性渲染進行檢查,並在受限的幾何空間中推理,有效模仿人類心理意象的過程。我們透過兩階段訓練框架實例化此典範,結合監督式微調(SFT)來達成 SVG 語法對齊,以及多輪強化學習(RL)來鼓勵對中間視覺假設進行疊代檢查、修正與精煉。廣泛的評估結果顯示,MentalThink 在空間理解與推理基準(例如 VSIBench 達 55.1%、MindCube 達 76.0%)上表現卓越,證明了可執行向量圖形能為動態視角轉換、視覺反思與組合場景建構提供可驗證的視覺工作空間。
強化學習(RL)在非可驗證指令遵循任務中,越來越依賴搭配特定提示評分標準的 LLM 裁判作為獎勵訊號。近期方法雖能在訓練過程中根據策略演進調整評分標準,但訓練提示本身仍維持靜態,來自固定語料庫。此種靜態作法常導致提示難度與策略能力之間出現嚴重錯位:當提示無法讓不同生成結果之間產生有效的品質差異時,裁判便無法提取出具區分力的獎勵訊號。為解決此錯位問題,我們提出「LLM-as-a-Tutor」框架,將 LLM 的角色從裁判擴展為導師:單一模型同時扮演考官與生成器——考官對策略的輸出進行成對比較,藉此偵測不具挑戰性的提示;生成器則為這些提示附加原子約束。此種僅追加新約束的設計,使難度隨策略能力同步單調提升,從而產生無需外部難度調度機制的自我校準訓練訊號。在三項複雜的指令遵循基準測試中,我們的方法持續優於不考慮策略的基線方法,以及先前調整評分標準或改寫提示的策略自適應方法,顯示提示調適是非可驗證強化學習中一個被忽視的策略感知維度。
大規模生成式模型的最新進展已大幅推進了影片生成技術,然而現有方法仍受限於僵硬的推理範式。雙向擴散模型在全局連貫性與視覺保真度上表現優異,但推理速度緩慢;而自回歸模型則能提供高效且串流式的生成,卻以長程一致性與曝光偏差為代價。我們提出Flex-Forcing,一個統一的訓練與推理框架,使影片擴散模型能同時在雙向與自回歸生成模式下無縫運作。其核心概念是一種沿時間軸與去噪步驟共同定義的靈活分塊機制。此設計使模型能夠:(1) 根據不同裝置的運算預算執行靈活分塊;(2) 跨分塊進行雙向推理以規劃全局結構,同時在每個分塊內部以自回歸方式生成影格,達成高效且細粒度的合成;(3) 在無嚴格因果限制下,實現任意順序、任意時間步的自回歸生成。在多項影片生成基準上的大量實驗顯示,相較於採用固定推理排程的強基線模型,Flex-Forcing能持續產出更佳的影片品質與長片穩定性,同時提供更快的推理速度。
複雜的影像創作與編輯往往需要的不僅是單一的生成或編輯模型。使用者需求可能包含合成影像、定位物件、分割區域、編輯選取內容、組合中介素材、讀取文字,以及強化最終成果。這類任務將多模態代理從增強感知的推理,轉變為以操作為核心的視覺創作,其中的工具必須主動改變視覺狀態,而非單純進行檢視。然而,現有的多模態工具使用代理大多針對感知、搜尋或特定領域的編輯進行最佳化,缺乏大規模可執行影像創作軌跡的監督訊號。本文提出 CanvasCraft,這是一個大規模的多模態工具使用資料集,用於複雜影像創作與編輯,以及 CanvasAgent,這是一個工具增強的的多模態代理,能夠學習透過多輪互動來協調異質視覺工具。CanvasCraft 包含 14 萬條完整標註的可執行軌跡,以及 1 萬個強化學習任務規格。CanvasAgent 首先經由 SFT 訓練,學習可執行的推理-行動軌跡,接著使用 GRPO 進行最佳化,採用結合結果層級與過程層級訊號的混合獎勵。在推論過程中,CanvasAgent 會檢查中間結果、追蹤視覺資產,並根據不斷演變的視覺狀態調整工具決策。實驗評估了最終影像品質與軌跡行為,證明了 CanvasAgent 與所提出資料集在複雜多工具影像創作流程中的有效性。
以自我为中心的3D场景生成仍面临挑战,原因在于视图重叠有限,且个体视角对场景解读具有主导性影响。这些因素阻碍了生成视角一致且语义对齐的视觉内容,以及构建准确的几何结构。本文提出CGGS——一个文本到3D的框架,旨在提升3D内容感知能力并解决以自我为中心的场景生成中的几何畸变问题。首先,我们提出以自我为中心的生成器,通过采用一致性增强损失对多视图潜在扩散模型进行微调,以生成与文本描述对齐的一致、高保真2D内容。然后,布局装饰器利用光流和点轨迹对应关系估计深度,从而从以自我为中心的2D先验中生成密集点云作为粗略布局。在此初始化的基础上,我们提出几何精炼器,通过基于熵的互信息深度损失(MID)结合分层优化方案,提升3D高斯重建的视觉质量与几何结构。大量实验表明,CGGS在生成连贯且准确的文本驱动3D场景方面优于先前方法。项目页面:https://cggs-26.github.io/cggs26/。
当前最先进的单张图像三维重建方法通常依赖复杂的混合架构与损失函数,或将几何形状压缩至潜在空间以利用预训练的潜在扩散模型。本研究表明,此类架构上的冗余与复杂的损失函数设计并非必要。我们提出一种极简的像素空间扩散Transformer,基于普通ViT构建,直接对原始三维点图块进行操作,并以预训练DINOv3的图像标记为条件。与现有的潜在扩散方法不同,我们从头训练扩散骨干网络,无需点图分词器。尽管设计简洁,该方法性能超越复杂的潜在扩散模型,同时显著简化了混合方案。值得注意的是,它能生成更锐利的几何结构,并在高模糊区域(如透明物体)中更具鲁棒性。
我們推出了 Nemotron-Labs-Diffusion,這是一個三模式語言模型(LM),可將自迴歸(AR)、擴散模型與自推測解碼整合在單一架構中。透過聯合 AR-擴散的訓練目標,Nemotron-Labs-Diffusion 能動態切換模式,在不同部署環境與並行程度下維持高吞吐量。我們的研究顯示:(1) AR 與擴散目標具有互補性:擴散改進了前瞻規劃能力,而 AR 則提供了從左至右的語言先驗。(2) 在自推測模式下,擴散模型負責生成草稿,AR 負責驗證,其接受率與實際設備效率均優於多令牌預測(MTP)方法。(3) 從光速分析進一步證明了擴散模型的長期潛力,在最佳取樣器下,每次前向傳遞可較自推測模式多產生 76.5% 的令牌。將模型規模擴展至 3B、8B 與 14B 參數後,我們的 Nemotron-Labs-Diffusion 系列(包含基礎版、指令版及視覺語言模型)在準確度與速度上均持續優於最先進的開源 AR 與擴散語言模型。例如,Nemotron-Labs-Diffusion-8B 每次前向傳遞可解碼的令牌數量為 Qwen3-8B 的 6 倍,同時在 GB200 GPU 上搭配 SGLang 於 SPEED-Bench 基準測試中,吞吐量更提升達 4 倍。
群體相對策略最佳化(Group Relative Policy Optimization, GRPO)在當前策略已能對有用推理軌跡進行取樣時效果良好,但面對正確解模式位於學生在策略支持範圍之外的困難提示時,則會陷入停滯。我們提出 TREK(教師引導探索透過前向KL),這是一種簡單的分階段程序,其利用蒸餾的目的並非模仿,而是擴展探索支持範圍。TREK 的關鍵優勢在於其通用性:由於它僅需使用已驗證的輸出軌跡,因此可採用外部黑盒教師、白盒教師,或在額外推論上下文下使用相同模型;即使無法取得教師內部資訊,也能有效辨識哪些困難提示樣本最值得鞏固。TREK 首先找出未受輔助學生通過率極低的提示,向提案來源查詢以產生經驗證的候選解,保留由當前學生似然排序的前 r 個提案,進行短暫的前向KL階段以將這些已驗證的解模式拉入學生的支持範圍,然後回到標準的在策略 GRPO 微調。在數學推理方面,使用 DeepSeek-V4 提案的 TREK 在 AIME 2024 與 AIME 2025 的所有測試規模上均提升了 Qwen3 模型表現;對於 Qwen3-8B,它在 AIME 2025 上從 36.9 提升至 40.3,在 AIME 2024 上從 47.9 提升至 51.1(avg@16),而自我上下文變體在無外部教師的情況下分別達到 38.5 與 49.6。在代理任務上,TREK 將 ALFWorld 的成功率從 75.8 提升至 82.8,ScienceWorld 的成功率從 12.5 提升至 26.7;值得注意的是,在最困難的任務類型中,TREK 在訓練初期即達到高成功率,而未受輔助的 GRPO 則需要顯著更多最佳化步驟才能達到相當水準。
我們提出 Rank-Then-Act (RTA) 框架,這是一種無需環境獎勵、僅從專家影片示範學習控制策略的方法。RTA 離線訓練一個視覺語言模型 (VLM),使其成為基於進展的順序評分器,並使用群組相對策略最佳化 (GRPO) 目標對打亂的幀序列進行訓練,迫使模型從視覺語義而非時間線索中恢復時間順序。關鍵在於,我們不直接將評分器用作標量獎勵模型,而是提出一種基於相關性的獎勵函數,用於強化學習:在每個互動視窗中,我們計算預測進展排名與真實時間索引之間的斯皮爾曼等級相關,從而產生一個有界、尺度不變的學習訊號。這種設計將獎勵學習與絕對校準脫鉤,並能穩定地在不同任務與環境之間遷移。我們在離散控制基準(PyBoy:Catrap、Kirby)與連續控制任務(PointMaze、MetaWorld)上評估 RTA。RTA 始終達到或超越先前的基於影片的獎勵學習方法與基於排名的基準,同時展現單一預訓練進展評分器在跨任務重複使用上的強勁能力。我們的結果表明,基於影片衍生的順序訊號的相關結構化監督足以進行策略學習,為明確的獎勵設計提供了一種可擴展的替代方案。
使用 MaxSim 相似度函数的晚期交互检索模型在实证中展现出强大性能,通常优于单向量稠密检索和稀疏检索模型。尽管已有实证发现,但关于 MaxSim 的表示能力及其与其他检索方法的理论对比仍知之甚少。本文通过构造方法证明,MaxSim 相似度能够精确复现任意两个非负 k-稀疏向量(可能具有无限维度)之间的内积,且仅需 O(k) 表示空间。此外,存在某些相似度关系是 MaxSim 可以表达,而相同表示空间下的标准向量内积无法表达的。基于我们的理论框架,我们引入了 Signed MaxSim,使晚期交互模型能够精确复现任意实值内积,而标准 MaxSim 被证明无法实现这一点。我们还表明,MaxSim 可作为软 OR 操作的聚合函数,以及正合取范式逻辑表达式的评估器。研究结果表明,对于任何非负向量,MaxSim 至少与标准向量内积能力相当,而我们的扩展 Signed MaxSim 对于任何向量均具备同等能力。这两种相似度均具有内积无法复现的额外能力,这为晚期交互方法提供了首批理论依据与量化分析。理论发现得到实证支持:在包含否定查询的检索任务中,Signed MaxSim 相比标准 ColBERT/MaxSim 基线显著提升了域外性能,当词汇偏移时 nDCG@10 从 0.597 提升至 1.000,在仅含否定查询时从 0.008 提升至 0.788。
LLM智能體日益依賴檢索緩衝區來儲存並重用過往經驗,然而管理這些緩衝區的快取策略仍 largely 停留在臨時性做法。我們將此問題形式化為一個具有切換成本的在線語義快取替代問題——其中項目透過嵌入相似度進行匹配,且命中品質是連續而非二元。透過在MemoryBench-Full(LoCoMo、DialSim)兩個資料集上,以8種替代策略進行的實驗,我們揭示了一個令人驚訝的發現:經典啟發式策略(LRU、LFU)在語義工作負載上 consistently 遜於樸素的FIFO基線,原因在於缺乏時間局部性與頻率集中性。我們提出SOLAR,這是一個學習增強的框架,其修改時機來自遺憾累積(達到sim17%的修改率),而內容選擇則基於對隱式檢索反饋的貝氏在線學習。我們證明SOLAR達到一個常數競爭比≤3,此比值與快取大小及時間跨度無關(相較於FIFO的Ω(K)),且逐出遺憾為O(KTlog T),在最壞情況下與Ω(KT)下界相比僅差對數因子。實驗表明,在緊繃的快取大小下,SOLAR相較FIFO有5%至75%的相對改進,並在工作集邊界處呈現出清晰的相變特徵。使用5000項目的合成實驗進一步揭示項目池大小與檢索品質之間的倒U型關係,從而論證容量限制本質上是一種檢索噪音現象,而非儲存限制。
數學推理已成為評估和調校推理型大型語言模型(Reasoning LLMs)的核心任務,然而現有的基準測試仍嚴重偏向高資源語言,英語和中文在預訓練語料庫及評估套件中佔據主導地位。近期發表的 PolyMath 資料集(Wang 等人, 2025)雖是重要進展,但其涵蓋範圍仍僅限於 18 種高資源語言。為彌補此缺口,我們提出 PluraMath——將 PolyMath 擴展至另外 18 種涵蓋 6 個語系的低資源語言,範圍從中等資源到極低資源情境。我們透過人工策劃流程構建資料集,由母語人士徹底驗證預先計算的翻譯結果。利用 PluraMath,我們進一步對 27 個推理型 LLM 進行基準測試,涵蓋小型、中型、大型及封閉源整合模型等四種模型規模,探討最新模型在多樣語言條件下的多語言數學推理能力。我們的細粒度分析證實,高資源語言與低資源語言之間的數學推理表現持續存在差距,且較強的結果大致與較佳的指令遵循能力相關。我們將資料集、資料取得流程及評估框架完全開源,目標是降低低資源社群發展多語言基準測試的門檻。
多模态大语言模型(MLLMs)在演化上下文中整合视觉与语言信息,以自回归方式生成回复。现有可解释性研究多聚焦于单个层与电路(即“何处”),而对生成过程中多模态计算在Token级的时间动态(即“何时”)探索不足。为填补这一空白,我们基于语义角色研究注意力转移,逐Token(OTaT)追踪模型对图像、文本、指令及先前生成Token的注意力。我们设计了需在单次回复中显式切换视觉与文本上下文的多模态任务。在两个主流模型家族及四种不同规模的开源MLLM中,我们发现了统一模式:对图像的注意力在需要图像信息的Token处达到峰值,任务转换时指令Token被重新关注,而随着生成推进,对先前生成Token的注意力逐步增强。因果注意力阻断干预验证了这些趋势的功能性作用。我们分析了模型在注意力受扰时的行为,观察到回复出现语言先验回退、跨模态泄露、否认或恢复等现象。最后,基于这一新颖分析所揭示的注意力动态,我们提出了一种简单的测试时干预方法,在恰当时机增强对相关模态的注意力,显著提升了多模态任务表现。
層級式視覺-語言-動作(VLA)模型將高層規劃與低層控制解耦,以提升機器人操作的泛化能力。該範疇的近期研究使用視覺-語言模型(VLM)預測的2D末端執行器軌跡,作為下游策略的明確指導。然而,當前最先進的低層策略是在3D度量空間中處理點雲,若餵入缺乏深度資訊的2D引導,每個路徑點必須強制賦予其下方場景表面的深度,導致產生幾何失真的軌跡。我們提出3D HAMSTER,一種層級式架構,透過讓規劃器直接輸出度量可靠的3D軌跡來填補此差距。我們為VLM加上專用深度編碼器與密集深度重建目標,用以預測3D路徑點序列,並將其直接整合至基於點雲的低層策略中。在3D軌跡預測、模擬及真實世界操作任務中,3D HAMSTER持續優於專有VLM與2D引導基線,尤其在外觀變動情境與未見過的語言、空間及視覺條件下獲得最大增益。專案頁面位於 https://davian-robotics.github.io/3D_HAMSTER/。
我們提出HunyuanOCR-1.5,一款輕量級的端到端OCR專用視覺語言模型。HunyuanOCR將文檔解析、文字定位、資訊提取、文字-圖像翻譯以及多圖像文檔理解,統一在單一的端到端VLM中。基於HunyuanOCR-1.0的輕量級架構,HunyuanOCR-1.5並未重新設計主幹網路,而是系統性地提升了效率與能力。在效率方面,我們將DFlash適配至OCR解碼,顯著降低了密集文檔、表格與公式等長結構化輸出的延遲,同時保持輸出分佈不變。藉由DFlash,HunyuanOCR-1.5在Transformer推理上實現了6.37倍加速,在vLLM下實現2.14倍加速,成為輕量級OCR VLM中推理速度最快的模型。在能力方面,我們提出了Agentic Data Flow,這是一個基於智能體(agent)的數據構建系統,能將模型弱點轉化為可執行的數據需求,並自主進行資料搜索、品質驗證與流程開發。該系統顯著提升了古文字OCR、細粒度圖表與表格解析、多圖像文本中心問答、低資源多語言解析以及文檔幻覺評估等長尾能力。HunyuanOCR-1.5在OmniDocBench v1.6上位居頂尖端到端OCR解決方案之列,同時在這些長尾任務上創下新的性能里程碑。結合升級的預訓練與後訓練方案,HunyuanOCR-1.5進一步擴展了其在高解析度、長上下文以及多任務場景下的能力。實驗證明了更快的推理速度、更廣泛的OCR能力覆蓋,以及輕量級端到端模型的部署優勢。我們將釋出模型權重與訓練程式碼,以支援未來的研究與實際OCR應用。
強化學習(RL)已成為大型語言模型(LLM)後訓練的核心環節,然而目前對於RL適應性如何在Transformer層之間分佈的理解仍十分有限。現有方法通常均勻更新所有模型參數,隱含假設每一層對RL後訓練所獲得的性能提升貢獻相似。在本研究中,我們透過系統性的逐層研究來挑戰這一假設。令人驚訝的是,我們發現僅訓練單一Transformer層即可恢復全參數RL訓練所獲得的大部分增益,在某些情況下甚至能超越之。為量化此現象,我們引入了「層貢獻」這一指標,用以衡量單獨訓練某一層所恢復的全參數RL改進比例。在涵蓋兩個模型家族(Qwen3、Qwen2.5)、三種RL演算法(GRPO、GiGPO、Dr. GRPO)以及包括數學推理、程式碼生成與自主決策在內的多個任務領域的七個模型中,我們觀察到一個極為穩定的模式:RL增益高度集中於一小部分,且在許多情況下甚至僅集中於單一Transformer層。更引人注目的是,相同的結構模式始終如一地浮現:高貢獻層集中在Transformer堆疊的中間部分,而靠近輸入與輸出端的層貢獻則明顯較小。由此產生的層級排序在不同資料集、任務、模型家族與RL演算法之間均呈現高度相關性。
程式編碼代理越來越多地為實際軟體問題生成拉取請求(PR),但一次性 PR 生成仍處於開環狀態:PR 在未經系統性審查、診斷或修訂的情況下直接提出。我們提出 SWE-Review 框架,透過代理式程式碼審查來閉合此迴路。給定一個問題與 AI 生成的 PR,審查代理會探索程式碼倉庫,決定 PR 是否應被接受,並提供結構化的修訂反饋。我們使用提出的 SWE-Review-Bench 來評估此設定,衡量審查正確性與下游修訂的有用性。我們進一步整理 SWE-Review-Traj 資料集,以研究代理式審查的更廣泛應用,並填補開放式審查訓練的資料稀缺缺口。實驗顯示,代理式審查透過「生成-審查-修訂」循環持續改進 PR,在決策準確性與修訂後解決率上均優於單輪固定上下文審查,其能力可遷移至審查之外、提升問題解決模型,並實現有效且高效的測試時擴展。這些結果將代理式程式碼審查定位為實用機制,推動 AI 編碼代理從一次性 PR 生成朝向閉環問題解決邁進。
视听艺术涵盖多种创造性学科,包括电影、视觉艺术、舞台表演和游戏设计。在这些艺术形式中,艺术意义源自视觉、听觉与叙事元素的精心组合(例如,通过幽闭空间的构图放大恐惧感,或借助静默与特写镜头传达悲伤)。真正的艺术理解不仅在于识别所描绘的内容,更在于推理为何选择特定的创作表达方式。尽管多模态大语言模型取得了显著进展,但这一关键的艺术理解层面仍未被充分探索——现有基准测试大多衡量感知识别能力,而忽视了创作意图的推理。为弥补这一空白,我们提出了Musebench,这是一个旨在评估多模态大语言模型对细微艺术理解能力的综合基准。它包含4016道题目,涵盖电影艺术、静态视觉艺术、舞台表演艺术和游戏艺术,这些题目从超过1万个融合专业评论与视觉演示的候选视频中提炼而成。为了大规模捕捉艺术分析的开放性特征,该基准结合了单选题和变选项多选题。所有题目均通过一个包含快捷筛选、对抗性干扰项和专家验证的四阶段迭代流程生成并优化。对28个最先进多模态大语言模型的全面零样本评估显示,即使表现最佳的模型准确率也仅为48.29%,远低于人类专家的87.18%,这暴露了当前模型在创造性领域专业知识上的显著差距。
视觉-语言-动作(VLA)模型通常通过大规模机器人演示数据集的模仿学习进行训练,但由于数据存在冗余、噪声和覆盖不均,数据量增加并不一定能带来更优的策略。现有数据选择方法通常从轨迹或状态-动作层面评估演示,忽略了构成长期行为结构的可重用模块。本文提出SIEVE,一种面向VLA模仿学习的结构感知数据选择方法。SIEVE将演示视为可重用基元与过渡接口的组合,首先从分段轨迹中发现视觉运动基元,然后在收益递减条件下通过最大化结构重用覆盖度来为组合模式分配选择预算,最后在每个组合模式桶内选取medoid轨迹,保留核心、稳定且利于模仿的演示。在多个数据集、基准测试和VLA模型上的实验表明,SIEVE持续优于竞争性数据选择基线。值得注意的是,SIEVE仅使用50%的演示数据和50%的训练步数即可超越全数据训练效果,这表明通过基元和过渡捕获的可重用结构,是实现高效VLA模仿学习的重要信号。
每一个读取SMILES的化学语言模型都始于分词器,然而该领域几乎未经审视地继承了自然语言处理中的字节对编码(BPE)。在自然语言中,BPE的主要替代方案——Unigram-LM——已知会构建结构不同的词汇表。这种差异是否存在于化学领域尚不明确。我们报告了在固定165词元化学基组上、于词元嵌入可学习的小词汇量规模下,对BPE与Unigram-LM进行的受控对比研究,覆盖三种语料类型(多样性、类药、天然产物)及两种预分词边界策略。两者并未收敛。在所有22组匹配条件下,它们构建了近乎不重合的子词词汇表:跨算法下,学习到的词片段的杰卡德重叠系数从未超过0.161;若加权偏向模型更新最频繁的高频片段,则至多为0.05。Unigram-LM还将保留分子分割成29%–41%更多的词元;两种方法在何处切分上基本一致,但在切分深度上不同——在80%–99%的分子上,BPE的分割是Unigram-LM的严格粗化版本。这种分离在语料、边界和词汇量维度上均成立,甚至在规模扩大八倍时依然存在。因此,子词算法是一项建模决策,而非默认选项。本研究未训练任何语言模型。
不同語言人群在憂鬱症的診斷與臨床表現上存在顯著差異。基於語音的憂鬱症檢測在單語環境中表現良好,但跨語言的泛化仍是開放性挑戰。其中一個關鍵原因在於,先前研究採用未區分說話者的片段級隨機劃分,導致身份洩漏,進而虛報評估指標。我們提出 CLeaD 框架,這是一個監督式對比對齊架構,能將英語與普通話的 WavLM 嵌入映射至共享的臨床空間,無需平行資料或目標語言微調。在評估 52 位普通話說話者時,對比對齊在留一說話者交叉驗證下略優於基線(F1:0.640 vs. 0.622)。同時,在中間層(第 7-8 層)改善了憂鬱類別召回率,但測試集規模較小限制了泛化能力。兩項發現具有穩健性:模型擴張在提升單語英語表現的同時,反而降低了跨語言效能;此外,說話者身份洩漏曾使先前報告的普通話 F1 分數人為膨脹至 0.954,我們重現並量化了此偽影。
學術產出的生成過程散落在破碎的工具鏈中:文獻探索使用一個應用、參考文獻管理使用另一個、在 LaTeX 編輯器中撰寫、手動套用會議格式模板,再透過另一個入口網站提交。每個工具之間的銜接都強迫研究者進行上下文切換、格式轉換或手動複製貼上,而這些累積的成本佔據了研究人員花在非研究活動上的大部分時間。我們提出 Bibby AI,這是一個以編輯器為核心的平台,將此工具鏈壓縮成一條以雲端 LaTeX 編輯器為基礎的「研究-撰寫-發表」單一管線。不同於透過瀏覽器擴充功能附掛在既有編輯器上的輔助工具,Bibby AI 掌握完整的文件狀態、編譯管線與修訂歷史,使其智能代理能將基於檢索的引用插入、結構編輯以及符合模板格式的重排,當作一級、可驗證的操作,而非單純的文字建議。該平台整合了:(i) 可將 PDF、DOCX 與手寫數學式轉換為乾淨 LaTeX 的導入管線;(ii) 基於學術元數據的檢索層,該層並納入來自 USPTO PatentsView 與 Marx-Fuegi 引用語料庫的專利-論文引用訊號,以呈現候選參考文獻的轉譯影響力;以及 (iii) 針對文獻篩選、草稿撰寫、修訂與會議格式等任務範圍的智能代理,這些代理直接作用於文件的抽象語法表示上。Bibby AI 已正式上線部署,服務超過 5,000 名活躍研究人員,涵蓋 50 多所簽約大學。我們將說明其架構、以編輯器為核心所帶來的設計決策,以及用來評估該平台相較於破碎基線的工作流程層級時間節省框架。
我們提出 RuleChef,一個利用大型語言模型(LLMs)為 NLP 任務(如文本分類、命名實體辨識(NER)或關係抽取)生成可執行規則的框架。這些規則根據任務描述和一組標註範例生成,接著根據更多範例以及對現有規則的人工回饋進行迭代改進。RuleChef 也可用於引導規則的建立:透過觀察任何現有模型在給定任務上的輸入-輸出對來初始化規則。LLMs 僅在學習階段使用,負責合成規則,並根據在留出驗證集上測得的失敗情況進行迭代修補。此流程的產物是一套快速、確定性且可檢視的規則系統。初步評估在分類與 NER 任務上進行。我們以 Apache 2.0 授權釋出 RuleChef 為開源軟體。
幾何條件化的3D場景生成技術能從使用者提供的幾何結構創建3D環境,直接控制場景結構與物體佈局。為生成此類3D場景,現有方法通常採用三階段設計:首先定義視圖排程,接著沿排定視角合成多視角觀測結果,最後從生成影像重建3D表徵。然而,對於室外場景而言,定義視圖排程成為主要瓶頸——大型、非結構化且無邊界的幾何結構使得難以獲得兼顧充分覆蓋率與穩定生成的視角。為解決此瓶頸,我們提出SceneFrom3D框架,該框架能自動從室外輸入幾何結構排定視圖。SceneFrom3D建構一個有向生成圖,其中節點代表錨定視圖,邊代表插值軌跡,藉此定義需合成的視圖、需內插的視角對,以及生成進行的順序。除自動視圖排程外,SceneFrom3D更透過物體級條件控制提升可控性:為每個物體分配用於外觀引導的識別影像,以及用於區域級幾何遵循參數。實驗證明,SceneFrom3D在幾何條件化室外3D場景生成中達到最先進水準,能產出高品質場景,同時具備可控物體外觀與幾何遵從性。
具身导航旨在构建能够理解多模态目标、在三维空间中推理并在现实世界中可靠地到达目的地的智能体。然而,由于缺乏可拓展、高保真度且具备物理真实感的交互环境,该领域的进展仍受到制约。尽管真实世界扫描数据集提供了视觉真实感,但其规模有限。相比之下,合成仿真器虽更易拓展,却常存在较大的仿真到现实差距。我们提出Image2Sim——一种实时神经模拟框架,能从带位姿的RGB-D图像序列中构建高质量交互环境。其核心思想是将3D空间锚定与逼真观察合成解耦。在场景构建方面,Image2Sim采用前馈特征高斯模型,通过单次前向传播将带位姿的RGB-D观测提升为3D特征高斯表示。在渲染方面,我们提出几何感知一步像素流模型,能将稀疏且带噪声的高斯投影转化为高质量全景RGB-D观测。此外,Image2Sim还可作为全自动具身数据引擎,大规模生成高保真观测、可执行动作及多样化导航指令。它可将大量视频与图像转换为近2万个交互场景,并合成超过1000万个导航训练样本。完全在这些神经环境中训练的导航模型在主流基准测试上取得显著提升,并能有效迁移至现实世界的零样本场景。这些结果表明,可拓展的神经模拟可成为大规模具身导航的实用训练基础。
近期,聯合嵌入預測架構(JEPAs)作為自監督表徵學習的重要框架,引起了電腦視覺與機器學習領域的廣泛關注。與重建像素的遮罩自編碼器不同,JEPA 模型透過預測遮罩區域的潛在嵌入來學習表徵。現有的基於 JEPA 的方法(如 I-JEPA 和 V-JEPA)通常採用學生網路中的單一編碼器。相比之下,在學生網路中使用孿生編碼器更自然地符合腦啟發表徵學習框架,然而其在 JEPA 模型中的作用仍未得到充分探討。本文研究了孿生學生編碼器對基於 JEPA 的表徵學習的影響。為此,我們提出了 SiamJEPA,即配備指數移動平均(EMA)教師網路的遮罩孿生學生編碼器。SiamJEPA 也可被視為腦啟發表徵學習模型 PhiNet 的 JEPA 形式。透過在 ImageNet 線性探測上的大量實驗,我們證明孿生編碼器作為 JEPA 目標的有效正則化項,能夠提升表徵的可分離性,並加速訓練初期的學習進程。此外,在有限的訓練預算下,SiamJEPA 始終優於可比的單一編碼器 JEPA 變體,並達到比需要更長訓練時間的遮罩自編碼器(MAE)更高的線性探測準確率。我們的研究發現,孿生學生編碼器不僅僅是架構選擇,更構成了預測表徵學習的重要歸納偏置。這些結果為基於 JEPA 的模型設計提供了新視角,並表明引入孿生學生架構是改進自監督表徵學習的一種簡單而有效的方法。
大型音頻語言模型(LALMs)日益融入日常應用,但其生成性偏誤仍未被充分探討。現有的語音公平性基準依賴合成語音與選擇題(MCQs),兩者皆僅提供片面的公平性觀點。我們提出 VIBE 框架,透過開放式任務(如個人化推薦)並使用真人錄製語音評估生成偏誤。與選擇題不同,我們的方法讓刻板聯想能在無預設選項的情況下自然浮現,且易於擴展至新任務。評估 12 個最先進的大型音頻語言模型後,結果顯示在真實情境中存在系統性偏誤:性別與口音線索皆引發統計上顯著的分布偏移,而偏誤幅度與任務類型高度相關。