每日精選AI研究論文及翻譯
全参数后训练万亿参数级MoE模型,给大规模分布式训练带来了系统层面的重大挑战,包括严重的内存压力、非重叠的通信开销以及低效的内核执行。虽然大多数大规模LLM训练系统基于GPU集群构建,但本报告展示了一项基于昇腾NPU SuperPOD的端到端优化实践。以DeepSeek-V4模型系列为目标负载,我们开发了一个层次化优化框架,涵盖模型级并行、计算-通信协同调度以及底层内核执行。由此构建的系统实现了34.22%的模型FLOPS利用率(MFU),相比开源基线方案提升了2.93倍,同时保持了训练稳定性。在此优化基础设施之上,我们进一步为复杂的运筹学(OR)任务建立了持续预训练(CPT)和监督微调(SFT)工作流。我们将这一集成框架称为SLAI T-Rex。利用DeepSeek-V4-Flash,我们开发了面向OR的CPT和SFT数据流水线,将收集的领域资源与求解器验证的合成优化文档相结合。最终数据集包含10K高质量SFT样本,涵盖四种任务类别和三种问题表示形式。该专用模型在评估模型中取得了最高的平均零样本Pass@1分数,达到71.81%,分别超出GPT-5.4-Mini和基础DeepSeek-V4-Flash模型3.98和11.27个百分点。总体而言,本工作展示了从基于昇腾基础设施的高效万亿参数模型后训练,到面向求解器支撑的数学建模的领域专用Flash模型的完整技术路径,推动了面向复杂推理的前沿模型系统发展。
近期,自回归视频扩散方法日益建立在「自强制」(Self Forcing)框架之上——学生模型在其自身展开生成的历史序列而非真实视频上下文中进行训练。这虽然减少了曝光偏差,但历史键值缓存仍仅作为冻结的展开状态供后续帧使用。因此,未来帧的损失无法监督早期生成的潜变量应如何被写入对后续视频潜变量生成更有用的键值与值中,我们将此称为「历史上下文-梯度鸿沟」。为此,我们提出「自梯度强制」(Self Gradient Forcing, SGF),一种无需对整个串行展开过程进行反向传播的双阶段训练策略,用以恢复缺失的监督信号。第一阶段执行无梯度的自回归展开,其过程与推理一致,并在采样的去噪退出步骤中,同时记录模型自生成的上下文与输入的噪声潜变量。第二阶段针对记录的退出步骤执行并行的上下文梯度重建:自生成的上下文作为停止梯度的干净潜变量输入,模型在此阶段重新计算上下文的键值表示以及从未来帧到上下文的因果注意力。由此,SGF能够在原生自回归训练目标中补全缺失的记忆写入监督,利用未来视频潜变量的损失来训练模型将上下文编码为更有效的因果记忆。在不同初始化条件下的大规模长程逐帧与逐块实验中,SGF均实现了比自强制更强的原生长视频外推能力,尤其是在主体一致性、背景/布局稳定性及时间稳定性方面。值得注意的是,仅使用5秒的训练窗口,SGF即可外推生成持续数分钟的视频。代码与模型将公开,以推动自回归视频生成研究的发展。
隨著大型語言模型與AI代理逐漸成為搜尋結果的主要使用者,文檔集的品質決定了下游生成任務的上限。然而,現有的評估系統仍局限於獨立評分各文檔並透過nDCG進行彙總,忽略了文檔間的交互作用(如冗餘、衝突、互補性),也無法回答為何某個文檔集優於另一個。為解決這些問題,我們提出了一套完整的「評估-診斷-優化」框架。我們設計了SetwiseEvalKit——一個三層次、九維度的文檔集評估基準,涵蓋短文本與長文本兩種場景,包含約28,000條高品質評估準則。我們系統性地評估了12種重排序方法:即使是最佳方法,其覆蓋率也不超過45%;跨文檔協調維度的表現普遍薄弱;且沒有任何一種方法能在兩種場景下同時維持頂尖表現。基於此,我們提出Rubric4Setwise——一種無需訓練的方法,能將基於準則的評估標準轉化為文檔集選擇信號,在減少文檔數量與搜尋輪次的情況下,達到最佳的下游生成表現。此方法是唯一能在兩種場景下皆維持最優成果的方法,驗證了從評估到優化的閉環有效性。
人類視覺是一個閉環:目光會基於中間假設不斷重新定向,而非一次性快照。數十年的心理物理學與認知科學研究指出,這種主動觀察對廣泛任務至關重要。當今多模態大語言模型(MLLM)是否具備主動觀察能力,是一個現有視覺語言基準測試無法解答的實證問題。我們提出ActiveVision,這是一個能衡量MLLM主動觀察能力的基準測試,包含三大類別共17項任務。任務設計旨在強迫模型進行重複性的視覺感知,而非依賴單一靜態描述。尖端MLLM在ActiveVision上表現崩潰:我們評估中得分最高的模型GPT-5.5(暴露於最高推理努力層級),僅能解決10.6%的項目,並在17項任務中有11項得零分;即便是在多數推理與程式碼排行榜上位居首位的Claude Fable 5,也只解決了3.5%,遠落後於三位平均得分96.1%的人類參與者。此外,即使模型撰寫並執行自己的視覺程式碼,大部分差距依然存在:這類程式碼在真實影像上不可靠,且偵測其失誤本身就需要模型所缺乏的主動感知能力。綜合這些結果顯示,當前MLLM缺乏穩健的主動視覺觀察能力,這促使我們需要設計能閉合感知-推理迴路的架構與訓練目標。
將事實知識可靠地且大規模地注入大型語言模型仍是一項開放性挑戰。超網絡為大規模知識注入提供了有前景的解決方案。儘管超網絡通常應用於測試時適應,但我們探討其在訓練時知識注入中的應用,即給定一個大規模事實語料庫,訓練一個超網絡來生成固定的LoRA適配器,當該適配器插入目標模型時,使模型能夠回答有關這些事實的問題。本研究探討超網絡是否可用於執行訓練時知識注入,以及此能力如何隨規模變化。超網絡的標度行為迄今仍未得到充分研究。我們的設計將超網絡的注入能力與目標模型的通用能力解耦,從而首次能夠對超網絡架構的標度定律進行嚴謹研究。我們描述了損失、推理準確率以及分佈外泛化如何隨超網絡深度、寬度及目標網絡大小而變化。我們構建了一個大規模數據集,名為MegaWikiQA,其中包含來自Wikidata5M示例構建的39個領域中的數千萬個多跳問答示例。我們的結果顯示:(i)基於超網絡的注入在所有架構維度上表現出廣泛的預測性冪律標度;以及(ii)超網絡能夠在不斷增大的規模下實現可靠的分佈外泛化,表明超網絡為LoRA微調和全微調等其他訓練時適應方法提供了有前景的替代方案,在所有分佈外評估中表現出更陡峭的標度指數。綜合這些結果,超網絡被確立為一種有原則且可擴展的訓練時適應基質,並提供了首個經驗基礎的標度定律,以指導超網絡在大型語言模型中進行事實推理。
將預訓練的視覺語言模型(VLM)透過行為克隆(BC)在機器人示範資料上進行微調,已成為視覺語言動作(VLA)策略的標準做法。然而,BC微調會逐步覆蓋支撐視覺與語義泛化能力的預訓練表徵。常見的補救措施——在網路圖文資料上進行協同訓練——並無法避免此問題;它將語言與動作損失應用於不同的觀測資料,導致VLA存在語言與動作不對齊,而標準操控基準測試並未揭露此缺陷。我們提出Anchor-Align方法,在BC中增加兩個目標函數:視覺語言錨定(Vision-Language Anchoring)從凍結的VLM副本中蒸餾逐層表徵以預防此偏移;語言動作對齊(Language-Action Alignment)則將每個動作目標轉換為離散的運動方向標籤,並在同一機器人觀測資料上同時訓練語言與動作預測。在實體xArm7機器人上,針對兩種廣泛使用的VLA架構,Anchor-Align分別將真實機器人成功率從28%提升至54%、從37%提升至60%。在模擬環境大規模實驗中,我們分別在LIBERO-PRO、LIBERO-Plus與CALVIN上觀察到其對分佈外擾動(OOD)、感知穩健性及長程控制均有持續改善,顯示保留預訓練表徵與有效學習動作之間並非根本衝突。專案頁面:anchoralignvla.github.io
強化學習(RL)已成為提升大型語言模型(LLM)推理能力的主流典範。然而,採用PPO-Clip的強化學習演算法本質上受到探索崩潰的限制。後續研究大多仍停留在啟發式方法,未能辨識出PPO-Clip失效的根本原因。本研究揭示了PPO-Clip的基礎缺陷:它隱含地使用歐幾里得度量來衡量策略差異,這在理論上與策略黎曼流形的內在幾何結構不一致。這種幾何失配導致在低機率區域過度保守更新,而在高機率區域則過於激進,最終使探索崩潰。為矯正此幾何缺陷,我們提出黎曼等距策略優化(RIPO),該方法保證在黎曼流形上進行等距策略更新,有效平衡探索與利用。我們進一步證明RIPO能達到有利的偏差-變異權衡,從而穩定最佳化過程。廣泛的實驗顯示,在七個競賽級基準測試中,RIPO顯著優於現有的LLM強化學習演算法(在AIME24上相較GRPO提升高達60%)。
随着自主智能体的快速发展,其可靠操控各类数字文档的能力已成为实现通用人工智能助手及自动化复杂工作空间工作流的关键。本文提出DocOps——一个基于分层分类法的确定性可验证评估框架,该框架受真实实践启发,将文档操作解构为原子维度与逐步升级的工作流复杂性。基于DocOps,我们系统评估了代表性闭源与开源模型在不同智能体框架下的表现,揭示即使最先进的前沿配置在处理高耦合、长跨度任务时仍存在根本性局限。进一步,通过细粒度分析现有智能体的操控行为,我们识别出三种关键失败模式:长期状态追踪崩溃、浅层语义验证及结构性元数据的破坏性编辑。最终,本研究揭示了智能体在维护全局文档一致性方面的能力边界,为未来复杂数字生态系统中稳健、非破坏性智能体的设计提供了启示。
視訊擴散變換器處理長時空序列,使得自注意力成為高解析度視訊生成的主要瓶頸。訓練免稀疏注意力降低了此成本,但自適應 Top-p 路由在多 GPU 序列並行下會產生不均勻的每頭計算負載。由此產生的負載異質性將稀疏注意力轉變為秩層級的拖後腿問題。我們提出 ,這是一套訓練免稀疏注意力系統,可在多 GPU 序列並行下提升自適應稀疏注意力的分散式執行效率。 採用 Top-p 路由、Top-k 安全下限及視訊感知區塊組織作為稀疏路由前端,並在運行時修復具體化的遮罩。運行時負載平衡透過點對點通訊遷移少量重頭來縮短當前關鍵路徑。寬鬆感知稀疏增強則以額外高價值區塊填補殘餘的非關鍵秩空閒,同時重疊運算隱藏排程與遷移的開銷。在步蒸餾的 Wan2.2 I2V 上, 將平均負載不平衡從 1.34 降至 1.08,並相較於 FlashAttention 實現 4.41 倍的注意力加速,同時在具競爭力的視訊品質下達到 2.02 至 2.11 倍的 DiT 推論加速。
可驗證獎勵強化學習(RLVR)已大幅改善語言模型的推理能力,然而其延伸至視覺語言模型仍受限於缺乏同時具備廣泛性、可精確驗證且可再現的訓練資料。我們提出Trace,一個由分類學引導的多領域視覺推理環境。Trace將任務建構分解為場景語法與可執行任務程式,從而將視覺實現與答案計算分離。一個共享的語義狀態決定了渲染影像、提示、類型化答案、驗證器狀態與可重播的實例軌跡。最終環境涵蓋277個場景語法與11個視覺領域中的1,000個任務,並具有受控的語義與視覺變異。在64,000個Trace實例上進行可驗證獎勵強化學習,使得Qwen2.5-VL-3B在24個外部基準上的巨集平均提升了3.51個百分點,Qwen2.5-VL-7B提升了4.06個百分點,此結果證明了廣泛的程序化訓練能夠遷移至生成任務分佈之外。專案頁面:https://maveryn.github.io/trace/。
基於可驗證獎勵的強化學習已成為引導顯式思維鏈推理器進行測試時擴展的主要方法。然而,這種擴展路徑在計算上仍然昂貴,因為每個中間步驟都必須解碼為語言標記。相反,隱式推理以連續向量承載中間計算,並且在遠更短的視野內已能匹配或超越顯式思維鏈。儘管具有此潛力,隱式推理器仍主要受侷限於模仿,而顯式思維鏈已通過結果獎勵強化學習超越了模仿。隱式軌跡缺乏可處理的每步似然性以及在固定思考預算下的自適應停止介面,因此結果獎勵無法引導隱式測試時擴展。我們引入替代隱式策略優化(SLPO),將結果獎勵強化學習帶入自迴歸隱式推理器:一種基於隱式轉換的實證替代策略密度,用於軌跡層級的信用分配;以及一個由正確性監督的停止頭,通過結果獎勵優化將其精煉為可變視野策略。在連續與軟性思考設定中,SLPO 提升了並行採樣下的 Pass@k 指標,並將更長的隱式計算分配給更困難的實例,同時保持更高的確定性準確率。
本工作介紹了G-MAD,這是一個開源框架,利用Arma3生成同步多視角RGB-T數據,應用於空中目標偵測。G-MAD解決了真實空中數據集建構的主要限制,包括有限的視角控制、不完美的RGB-T對齊以及高昂的標註成本。該框架支援結構化場景規範、可控的多視角相機佈置、同步可見光/熱成像擷取,以及利用引擎層級的幾何元資料進行自動邊界框標註。這些功能使得在空中目標偵測中,能夠進行視角變化、多模態融合以及合成到真實遷移的受控研究。此外,利用G-MAD,我們建構並發佈了AMOD,這是一個全新的大規模多視角空中RGB-T目標偵測基準。原始碼與數據集可於https://unique-chan.github.io/G-MAD-Project取得。
自然語言自編碼器通過重建來評分隱藏激活的解釋:若激活能從解釋中重建,則該解釋被視為忠實。該測試在結構上對個別虛假宣稱不敏感:若翻轉某一宣稱不改變重建結果,該宣稱就不會受到懲罰。我們展示了該測試通過的兩種方式,但兩者皆不忠實。在已發布的 Qwen-2.5-7B 口頭化器上,解釋的重建效果顯著高於隨機水準,但僅約2%的具體宣稱依賴於重建,因此評分追蹤的是大意,而非具體事實。在精確的合成真實基準下,標準配方在5/5次運行中發展出共同適應的私有代碼(重建所依賴的虛假措辭),且不改變目標模型的修復措施並無幫助。我們貢獻了兩種審計協議:基於真實的交叉檢驗和評估者交換,以及RECAP(通過共同訓練輔助預測器實現可讀編碼):與目標模型同時訓練的線性頭部,以保持指定內容可解碼。在經過RECAP訓練的沙盒模型上,新的口頭化器能真實陳述指定內容,且代碼消失,成本為+0.001納特。這在預訓練的Pythia-160M上復現:內容變得可透過探針可靠解碼,儘管新的口頭化器僅部分傳達(真實度0.44-0.46,對比接近零的控制組)。就可解釋性而言,高重建並不能證明個別宣稱。對於人工智慧安全,RECAP使指定的內部內容可透過探針獨立檢查,而非由模型可能操縱的散文所宣稱:獨立探針對口頭化器的真實宣稱評分高於虛假宣稱(AUC 0.96,對比無RECAP時的0.82)。面對一個通過編輯解釋以最大化重建評分同時說謊(壓制約87%的謊言懲罰)的對手,RECAP探針仍能標記謊言(AUC 0.95),而控制探針則降至隨機水準(0.51)。
3D高斯泼溅(3DGS)通过优化三维空间中自由放置的基元并在重建不足区域自适应地加密这些基元,实现了高质量的新视点合成。然而,这种场景自适应容量分配能力在现有的前馈式3DGS方法中基本丧失——这些方法通常将高斯分布在输入像素上并沿相机光线进行提升。这种像素对齐的公式使得基元的数量和位置取决于图像分辨率和输入视点而非场景复杂度,导致高斯集密集且往往冗余。本文提出ATSplat,一种前馈式3DGS框架,通过自适应3D令牌恢复3DGS优化中的自适应分配能力。ATSplat首先将粗略的补丁级深度和相机线索提升为稀疏的3D锚点令牌,形成场景的紧凑骨架。每个令牌随后通过可学习的3D偏移量回归为局部高斯分布,将基元放置与输入图像网格解耦。自适应令牌扩展模块预测一个受渲染误差图监督的令牌级不确定性评分,并通过可学习的扩展层选择性地扩展高不确定性令牌。这种稀疏到自适应的公式使ATSplat能够将基元集中在具有挑战性的区域,同时保持紧凑的表示。在两个代表性数据集RealEstate10K和DL3DV上的实验表明,ATSplat在实现最先进渲染质量的同时,将高斯数量减少至密集前馈式3DGS方法的5.7倍以上。在12张512×960分辨率的输入图像下,ATSplat使用单块商用GPU可在不到一秒内完成重建,并以仅31.1万高斯在1136帧/秒(512×960)的速度渲染高质量新视点。
在邊緣裝置上進行即時腦電圖(EEG)分類,其瓶頸在於傳統神經網路所需的浮點運算。我們探討了可微邏輯閘網路(Diff-Logic)作為一種硬體原生的替代方案,該方案將模型編譯為純布林電路,並可透過位元層級的CPU運算執行。我們在涵蓋兩項分類任務(二元失智症檢測與三類情緒辨識)的四個EEG資料集上,進行了嚴格的等參數實驗,將Diff-Logic與同等容量的多層感知器(MLP)及二值化神經網路(BNN)基準模型,在四個複雜度層級(5萬至50萬個參數)進行比較。在失智症篩檢中,Diff-Logic達到了80.2%的巨觀F1分數,較MLP基準模型高出6.8%。在情緒辨識方面,MLP保有適度的效能優勢,但當部署於功耗受限(7瓦)的NVIDIA Jetson Orin Nano CPU(單核心)上時,其延遲高出2.3倍,模型大小則達14倍。關鍵的是,Diff-Logic的推論時間在模型規模擴大10倍的情況下幾乎保持恆定,在最高複雜度層級中,相較於MLP取得了2.9倍的峰值加速。我們的研究結果確立了基於邏輯的神經架構作為資源受限腦機介面的實用範式,能夠在滿足可攜式邊緣部署延遲與記憶體限制的同時,達到具有競爭力或更優越的效能。程式碼已公開於GitHub:https://github.com/Shyamal-Dharia/eeg-difflogic
上下文引導(Contextual entrainment)指的是模型傾向於讓輸入中的輔助性上下文影響其輸出,而無關該上下文是否相關、真實甚至有意義。近期研究已在單模態語言模型中識別此現象並提出機制性解釋。然而,此現象在視覺語言模型(VLM)中是否及如何表現,在很大程度上仍未經檢驗,且該領域缺乏專為研究此現象設計的工具。我們認為,研究VLM中的上下文引導不僅需要將現有純文字基準移植到多模態環境中,更需建立一個基於分類結構的雙模態工具,其實驗條件需圍繞當前項目(文字串流中的描繪圖像、視覺串流中的文字查詢)構建。我們主張,過渡到VLM是實質性而非漸進性的進展——這使得引導成為雙重現象,可分別由文字上下文和視覺上下文獨立驅動,並開啟了前人所研究的單模態(僅基於世界知識)中不存在的真實性區分(即上下文對描繪場景為虛假但世界可能存在的情況)。為將此立場具體化且具可操作性,我們提出ENTRAP-VL(視覺與語言之引導評估探針),這是一個由人工校訂的資料集,包含1,500個項目,分屬八個類別,並依據橫跨兩軸的分類體系組織——即上下文與項目的關聯性及其與真實性的關係——再拆分為文字引導串流(八種上下文條件)與視覺引導串流(三種上下文條件)。我們不宣稱能測量任何特定模型的引導程度,而是提供這一工具、其背後的分類學依據以及所支援的評估協議,使學界能嚴謹地探究此現象。我們將公開釋出該資料集及其相關文件。
同時定位與地圖構建(SLAM)是機器人學中的基本問題之一,因其能使自主系統在現實場景中運作。在低照度條件下,對比度降低、感測器雜訊及運動模糊會同時削弱特徵提取與特徵匹配的表現;而透過光達(LiDAR)、深度感測器或熱感測器進行補償,則會增加成本、功耗與系統整合複雜度。現有基準測試多以照明充足的室內或白天序列為主,因此標準RGB相機SLAM在黑暗中能達到何種程度仍是未解之題。我們針對五組難度與照明條件各異的LaMARia序列,對六種涵蓋基於特徵、直接法、濾波器式及學習型典範的系統——ORB-SLAM3、DSO、Kimera-VIO、OpenVINS、DPVO與DPV-SLAM——進行基準測試,並報告其絕對與相對姿態誤差以及控制點召回率。Kimera-VIO是唯一能完整追蹤所有五組序列的系統,它在達到最低相對姿態誤差的同時,因缺乏閉環檢測而導致絕對誤差持續增長;DPVO與DPV-SLAM雖從未失去追蹤,但在低光照下絕對誤差約達100公尺;而經典的單眼視覺管線(ORB-SLAM3、DSO)與濾波器式OpenVINS則在多數較困難與低光照序列中直接失效或發散。結果顯示,僅使用RGB相機的SLAM唯有在同時具備慣性融合與全局優化時,才得以維持穩定的低光照追蹤。若要彌補其餘差距,可能需要開發專門應對低光照的學習型前端,或回歸互補式感測方案。
在复杂场景中进行实用的机器人抓取,既需要三维空间推理能力,也需要与具体任务要求保持一致。视觉语言模型提供了一种自然的方式,通过语言来指定这些要求,但现有方法要么直接使用视觉语言模型预测抓取位置并受限于有限的空间感知能力,要么将视觉语言模型与抓取模型联合训练,这需要显著更多的数据和计算资源。这些局限性阻碍了性能提升,并使得该方法难以扩展到复杂场景中的多形态机器人。为解决这一问题,我们提出了SeededGrasp,一种新颖的数据高效框架,使视觉语言模型能够预测一个种子点,并将其作为条件输入给后续轻量级的抓取生成模型。我们的架构将高层语义推理与低层几何执行解耦,在避免昂贵端到端训练的同时,支持多形态机器人。为了训练此类模型,我们发布了首个多形态桌面抓取数据集,其中包含杂乱场景中超过250万个抓取点。实验结果表明,我们的方法优于现有基线,在仿真实验中达到72%的成功率,在实际抓取实验中达到78%的成功率。数据和代码详见我们的项目网站:https://uoft-isl.github.io/seeded-grasp/
過去五年間,透過擴大模型規模、數據量與運算能力,文字生成影片技術已取得顯著進展。不同於模型架構,訓練數據的潛力往往未被充分探索。真實世界的數據策展過程複雜且不簡單,涉及從原始影片中選取片段並添加字幕,以建立用於學習文字與影片對應關係的影片-文字配對。我們研究數據分佈與字幕品質如何影響文字生成影片模型。為了進行受控實驗,我們引入「移動字母表」——一個程序化測試平台,能在黑色背景上生成不同字體、顏色、大小與位置的字母,並以不同方向與速度移動。此設計能透過破壞真實標註元數據,精準控制數據分佈與字幕品質。我們的實驗得出三項發現:a) 影片內容與時長的多樣化且均衡分佈,對泛化能力至關重要;b) 字幕品質顯著影響模型表現與訓練效率,暗示文字生成影片模型受限於影片理解能力;c) 無分類器引導與高品質數據微調,雖能部分補償基於劣質字幕訓練的模型,但無法完全彌補不佳的預訓練數據。我們認為這些見解有助於大規模文字生成影片模型的開發,並呼籲更重視預訓練數據的科學研究。