每日精選AI研究論文及翻譯
结构-性质关系是生物学、化学和材料科学的基础,功能、反应性和物理响应均源于空间、化学和周期性的组织。对这些关系进行机理上的解释,需要借助科学原理和物理约束来解读结构证据,涵盖立体化学、成键、对称性、能量学和周期性有序等层面。然而,将人工智能应用于这一过程带来了表征与推理的双重挑战:模型必须保留领域原生的结构信息,同时展示在特定约束下具体证据如何支持预测。在此,我们提出SciReasoner,一个面向蛋白质、小分子和无机晶体的原生结构推理多模态科学基础模型。SciReasoner将坐标、拓扑结构和周期性连接离散化为统一的结构感知词汇表,在推理过程中将结构标记视为可寻址的证据单元。在同源性控制的基因本体预测中,SciReasoner改善了对低同源性及类似孤儿蛋白的细胞组分注释,将F_max从0.42提升至0.55。在化学领域,它将单步逆合成准确率从0.63提升至0.72,并生成了片段级断键与前体验证轨迹。在材料科学中,其表征能够区分元素相与化合物相,并分辨高带隙与低带隙区域。在86个基准测试中,SciReasoner在67个任务上达到了最先进水平。双盲专家评估显示,在98%的情况下,其推理轨迹被评价为优于或至少与前沿大语言模型相当。通过将结构作为在科学约束下可检验的推理基础,SciReasoner将准确预测与可解释的科学推理连接起来。
主流视觉-语言-动作(VLA)模型基于马尔可夫假设,主要从当前观测预测动作,因此在处理长时域、时间依赖型任务时表现不佳。现有的记忆增强型VLA方法要么扩展观测窗口,要么从记忆库中检索历史信息作为辅助策略上下文。然而,这些方法将记忆置于VLA推理的原生潜嵌入空间之外,阻碍了历史经验与多模态推理及动作生成过程的无缝交织。为此,我们提出LaMem-VLA——一种原生潜记忆框架,通过将历史经验重构为潜记忆标记,并将其直接融入VLA推理流程。其核心包含四个协同组件:(i)策展器,将历史经验组织为互补的短期与长期记忆库;(ii)搜索器,基于多模态认知对两个记忆库进行查询以检索上下文相关证据;(iii)压缩器,将检索到的证据重构为紧凑的短期与长期潜记忆标记;(iv)编织器,将这些记忆标记与当前观测和指令注入到一个连续的嵌入序列中。通过在连续潜空间中完成历史经验的表征、检索与消耗,LaMem-VLA使记忆能够直接参与VLA推理,并在有限上下文约束下引导动作生成。在SimplerEnv和LIBERO上的大量实验证明了LaMem-VLA的优越性。
儘管近期在機器人控制方面取得了令人振奮的進展,但影片生成模型因主要專注於內容創作,仍面臨領域不匹配的問題。例如,其設計本質上優先考慮視覺保真度與創造力,而非計算效率與物理真實性。在本研究中,我們提出 LingBot-Video——一種專門為具身智慧量身打造的、基於擴散Transformer(DiT)的影片預訓練範式。從架構角度,我們採用混合專家(MoE)框架而非密集框架,以實現模型容量與推論效率之間更佳的平衡,並成功從零開始將該方法擴展規模。從資料角度,我們建構了一套資料特徵分析引擎,將大量以機器人為導向的影像——涵蓋操作、導航與自我中心視角——融入標準網路影片中,使基礎模型內建對動作與世界動態的固有理解。從訓練角度,我們發展了一套多維獎勵系統,以強化在物理合理性與任務完成度方面的對齊,超越了諸如美學、指令遵循與動作一致性等標準準則。全面的評估驗證了其作為影片基礎模型的性能與效率。我們將 LingBot-Video 貢獻給社群,作為首個大規模、開源的 MoE 影片基礎模型,這是連結數位創意與物理執行的一項開創性努力。
我們提出LingBot-World 2.0(亦稱LingBot-World-Infinity),此為LingBot-World的高階迭代版本,具備四項獨特升級。(1) 我們的模型實現了無限互動範圍,同時維持一致的輸出品質,此優勢來自精心設計的因果預訓練範式。(2) 透過從基礎模型中蒸餾出即時變體,我們的系統確保了快速回應時間,足以驅動60 fps的720p影像串流。(3) 相較於前一版本,本次更新引入了高度多樣化的互動元素,涵蓋更廣泛的動作(例如攻擊、射箭、施法與射擊),以及更豐富的文字驅動事件。(4) 我們率先在世界建模領域整合了智能體控制機制,其中領航智能體負責規劃與執行角色行為,而導演智能體則負責在場景進展中合成新穎的環境元素。此外,為促進共享體驗,我們開發了一套介面,允許多位玩家同時沉浸於此生動的世界模擬器中。我們將主要的14B模型與輕量級的1.3B模型配對,以支援在單一GPU上輕鬆部署。
通用型机器人操控策略近年来发展迅速,但现有基准测试在系统评估其能力方面仍存在局限。许多基准测试依赖于简单、短时程或技能单一的任务,能力覆盖范围有限,且通常仅在仿真或现实环境中进行。仿真虽能实现可扩展的反馈,但忽略了物理部署的实际挑战;而现实环境评估成本高、耗时长且难以复现。为此,我们提出RoboDojo——一个统一的模拟与真实基准测试,用于全面评估通用型机器人操控策略。RoboDojo包含42个仿真任务与18个现实任务,覆盖多样化且互补的操控能力。仿真基准从五个维度进行评估:泛化性、记忆能力、精度、长时程执行以及开放式指令跟随;而现实基准则将策略置于具有挑战性的物理世界部署条件下。RoboDojo通过Isaac Sim中的异构并行仿真支持可扩展的评估,并提供RoboDojo-RealEval——一个可复现的现实评估系统,具备远程云端访问、标准化硬件、场景重置、评估协议及部署接口。结合XPolicyLab,策略可一次性集成,并在仅需最小调整的情况下在模拟与现实环境中进行评估。我们将30种策略集成至XPolicyLab,并在RoboDojo上对其进行评估,建立了公开排行榜与当前策略性能的系统性分析。相关网站详见http://robodojo-benchmark.com/。
強化學習在大型語言模型後訓練中的應用日益重要。先前的LLM強化學習流程多採用同步與批次交錯模式,在處理長時域智能體任務時效率低下。近期,非同步強化學習透過在軌跡生成時即時更新模型,成為更高效的替代方案。然而,現有非同步強化學習系統往往著重於吞吐量,對訓練穩定性與任務有效性探討不足。例如,廣泛使用的GRPO框架中的分組採樣機制難以自然契合非同步智能體訓練。為解決非同步強化學習中的穩定性與異策略挑戰,本文提出單一軌跡非同步優化方法。為降低異策略效應並提升泛化能力,我們以單一軌跡採樣取代分組採樣,即每個提示僅使用一條軌跡。我們進一步結合實用的價值模型訓練設計優化了單軌跡策略。為提升優化穩定性,我們引入了嚴格的雙側詞元級裁剪策略。SAO能夠穩定訓練超過一千步,並在智慧體編碼與推理基準(如SWE-Bench Verified、BeyondAIME及IMOAnswerBench)上持續優於GRPO及其變體。我們同時證明,在模擬線上學習環境中(模型需適應動態變化的環境),單軌跡強化學習特別有效。為此,SAO已成功部署於開源GLM-5.2模型(750B-A40B)的智能體強化學習訓練流程中。
具身智能體通常以感知、記憶、規劃與行動模組的手工設計組合方式構建。此模組化特性暴露了廣闊的架構設計空間,但現有系統仍依賴研究者直覺來決定資訊儲存位置、觀測處理方式以及模型調用間的連接關係。智能體架構搜索(AAS)雖能自動化文本領域智能體的此類設計,但尚未透過模擬器部署實驗對具知覺能力的智能體進行系統性評估。本研究探討此跨域遷移。我們提出AgentCanvas——一種類型化圖執行環境,其將具身執行器託管為可編輯的節點-線程程式,並具備模擬器感知執行與回合級日誌功能;以及KDLoop——一種編碼智能體搜索程序,透過提案、評審、實驗與蒸餾的循環運作,並在停滯後觸發反思機制。我們針對四種涵蓋視覺語言導航、具身問答及語言條件操縱的具身執行器,評估了三種AAS變體。由此產生的3x4矩陣表明,架構層級搜索能在具身任務中產生可部署且具方向性的成功率提升,而一個看似高分的候選方案則因存在資訊洩漏而被排除。與此同時,實驗揭示了文本領域AAS中被掩蓋的限制:最佳化訊號可能被部署雜訊掩蓋、搜索可能陷入局部編輯盆地,且即使擁有詳細日誌,回合級信用分配仍僅能部分浮現。這些結果既展現了具身智能體自動化架構搜索的潛力,也凸顯其當前的局限性。
線性注意力模型具備固定的狀態大小及每個詞元的固定計算量。然而,由於其有限的狀態容量,這類模型在長上下文回憶能力上不及基於 Softmax 注意力的變壓器架構。增加線性注意力的狀態大小能改善回憶表現,但代價是更高的浮點運算數(FLOPs)。在本研究中,我們提出稀疏增量記憶(Sparse Delta Memory,SDM),這是一種利用稀疏定址機制將門控線性遞迴神經網路的隱藏狀態擴充數個數量級容量的架構。SDM 擴展了 Gated DeltaNet 架構,以對大型明確記憶體的稀疏讀寫取代密集的鍵值外積。我們證明,在等 FLOP 限制下且參數量相同的情況下,更高的狀態記憶容量能顯著提升上下文學習與長上下文檢索任務的表現。此外,透過學習 SDM 記憶體的初始狀態並將其用作參數記憶體,我們顯示該模型在廣泛的常識與推理任務上能進一步獲得改善。
我們提出 AgentLens,一個基於生產評估的互動式程式碼智慧體基準測試。多數程式碼智慧體基準測試將一次執行簡化為單一位元——任務是否通過?——但實際使用這些智慧體的人們體驗的是整個軌跡:智慧體如何遵循指令、使用工具、驗證自身工作、從錯誤中恢復,以及沿途與使用者交流。AgentLens 評估整個軌跡。它將存在客觀檢查的形式化驗證,與 LLM 撰寫的軌跡審查及並排比較配對,使每次執行都能產出一份可讀的解釋,說明為何得到該評分。這讓 AgentLens 不僅用於模型排名:我們用它來診斷模型行為、比較我們自身智慧體的連續版本,並在夜間評估管線中捕捉產品回歸。我們在 https://github.com/agent-lens/agent-lens-bench 以開源形式發布該基準測試。
人類能夠在陌生的城市中導航,並逐步形成涵蓋數十平方公里、連貫的空間心智地圖。人工智慧是否能建構同等規模的空間表徵?儘管近期基礎模型在場景重建與具身智能方面取得了進展,但要擴展至整個城市仍是一項開創性的挑戰,主因在於缺乏城市規模的數據。為填補這一差距,我們引入了WildCity——一個由自動駕駛車隊在複雜城市環境中行駛所收集的真實世界多模態數據集。該數據集包含18條軌跡,每條平均長度為83.7公里,並保留了野外感知的核心挑戰,例如動態物體、光照變化及不完美的相機姿態。我們進一步建立了一個專為城市環境量身訂製的重建基準,並將重建後的環境轉化為封閉迴路模擬器。除了數據集與基準之外,我們系統性地分析了邁向可模擬的城市數位孿生之路上的關鍵挑戰:可擴展性、外推能力及不確定性。最終,WildCity旨在不僅推動城市規模的渲染進展,更廣泛地促進人工智慧在與人類認知規模相當的空間中,能夠感知、記憶與推理的能力。專案頁面:https://han-xiangyu.github.io/Wild-City/
從人類影片、遠端操作與機器人示範中學習的視覺策略,提供了可擴展的動作先驗,但在高接觸力的操作任務中時常失效,因為這類任務的成功與否高度取決於局部作用力與接觸幾何。觸覺感測能提供這些互補訊號,然而觸覺資料收集成本高昂,且難以在感測器、機器人與任務之間進行泛化。我們提出「OmniTacTune」,一種與策略無關的真實世界強化學習流程,透過殘差校正將觸覺回饋適應至預先訓練的視覺策略。OmniTacTune採用兩階段設計:首先從自主基礎策略的滾動探索中啟動觸覺感知學習,接著透過線上互動學習輕量化的觸覺殘差策略。廣泛的實驗顯示,OmniTacTune能泛化至多樣化的高接觸力任務、視覺基礎策略與觸覺表徵。在四項真實世界的高接觸力任務中,它將視覺基礎策略的成功率從5-40%提升至85-100%,且僅需40-80分鐘的訓練時間,展現了將觸覺回饋適應至可擴展視覺機器人策略的有效途徑。專案頁面:https://colinyu1.github.io/omnitactune-site/
大型語言模型(LLMs)為自動化程式碼撰寫開啟了新的可能性,並成為多數程式碼補全工具的基礎。雖然 LLMs 在主流程式語言上表現出色,但它們往往缺乏對所謂低資源語言(訓練資料稀少)的支援,導致這些語言的程式碼補全工具品質落後於它們所服務的社群。具體實例為 Pharo,這是一種受 Smalltalk 啟發的語言,其 IDE 目前僅提供單一語彙單元(token)的補全功能。在本研究中,我們報告了將基於 LLM 的程式碼補全引入 Pharo 的經驗。首先,我們描述了一個端到端管線,該管線結合了 Pharo 專屬的資料策展、繼續預訓練以及開源程式碼 LLM 的微調。其次,我們介紹了一系列 Pharo 程式碼補全基準測試,旨在評估模型是否(i)學會 Pharo 的語法,以及(ii)能準確補全來自真實 GitHub 儲存庫的遮蔽 Pharo 程式碼。第三,我們以實證數據顯示,Pharo 特化模型不僅顯著優於其原始基礎檢查點,且在 Pharo 補全任務上準確度也超過了規模更大的程式碼 LLM。整體而言,我們的個案研究證明了將強效的基於 LLM 的程式碼補全帶入低資源程式語言的可行性,且所使用的模型足夠小巧,能在 IDE 內提供「即時」支援。
預訓練的影片生成模型在視覺運動控制中作為骨幹極具潛力,但它們想像的未來情境往往偏離任務意圖,且無法可靠地以動作條件為基礎。因此,這些模型在規劃或策略提取上不易使用。為克服這些限制,我們提出RoboTALES,一個學習任務對齊模擬未來情境,並利用其訓練機器人策略的單階段框架。我們的方法包含兩項關鍵創新:(1)一個基於層級LLM的規劃器,將複雜任務分解為一系列子目標,以引導模型的想像;以及(2)一個基於VLM的評判器,評估這些「想像的」未來情境,並利用基於獎勵的反饋,使模型的內部表徵專注於目標。透過將影片生成器錨定在抽象推理上,我們能產出時間一致的情境展開與更連貫的動作。我們在RoboCasa與LIBERO10的多樣化操作任務上評估RoboTALES,結果顯示我們的方法持續優於現有方法,尤其在長程任務中表現更佳。我們的程式碼與模型已公開於https://github.com/hananshafi/RoboTALES。
像素級地球觀測(EO)基礎模型現可透過生成的空間嵌入達到最先進的效能。然而,此類模型的縮放行為及如何最佳分配預訓練預算,至今仍未被充分理解。我們提出了迄今規模最大的EO受控縮放研究:在固定像素級Barlow Twins架構下,於1,024個GH200超級晶片進行395次訓練,每次訓練均在15項下游任務上評估。我們發現,預訓練損失幾乎無法預測下游任務效能(皮爾森相關係數|r| < 0.2),因此根據損失選擇模型會浪費大量運算資源。此外,我們還發現,隨著訓練預算增加,編碼器與資料量應同步成長,而投影器則保持固定,這為運算資源分配提供了一個簡單規則。依據此規則,我們訓練了一系列像素級模型(0.5B與1B,另有2B模型正在訓練中),並將其蒸餾為緊湊的學生模型,以利於嵌入即資料的部署。參數量僅2,100萬的蒸餾模型TESSERA v2-1B-M,在總體表現上優於所有受測的開源與商業模型,其中部分模型的參數量高出數個數量級。這些學生模型可產生套娃式表征,且部署成本低廉:僅使用16維前綴即可保留完整128維92%的效能,而儲存量僅為1/8。訓練完成後,我們計畫釋出覆蓋2017至2025年的v2全域嵌入。綜合上述結果,我們提出了一個具體且經實證支持的縮放像素級EO基礎模型策略:訓練大型編碼器、根據下游效能進行篩選,並蒸餾為靈活的學生模型。所有程式碼將於 https://github.com/ucam-eo/tessera 公開釋出。
精確的乳房X光攝影乳癌分類需要有效整合頭尾向(CC)與內外斜位(MLO)視角所提供的互補資訊,從而更完整地刻劃乳房異常特徵。然而,現有多視角學習方法通常依賴於特徵層級的聚合或單階段交叉注意力,這可能導致視角特定表徵與共享表徵相互糾纏,並限制交互作用僅發生於有限的網路深度。為解決此問題,我們提出一個以令牌為中心的雙視角學習框架,該框架在凍結的視覺Transformer骨幹網路中統一了基於提示的適應性調整與跨視角融合。本框架將視角間交互重新建構為結構化的令牌層級通訊,其中專用融合令牌經由交叉注意力機制明確編碼CC與MLO視角之間的雙向資訊交換,作為跨視角依賴關係的中間載體,而非依賴直接的特徵融合。與傳統方法僅在單一層級進行融合不同,融合模組被插入於多個Transformer深度,從而實現編碼器階層中的漸進式與重複性交互。融合令牌被重新整合至令牌序列中,並經由後續Transformer層進行細化,在保留視角特定結構的同時促進互補資訊的階層式傳播。在VinDr-Mammo與CMMD資料集上的實驗結果顯示,本框架相較於線性探測、僅提示適應及傳統融合基線方法均有一致性提升。在VinDr-Mammo的BI-RADS分類任務中,本框架達成了50.40%的F1分數與0.8090的AUC,其中在二元設定下,相較於雙視角融合基線方法提升了0.10的AUC。消融研究進一步驗證了基於令牌的融合與多深度交互設計的有效性。
觸覺提供了感知材料固有屬性(如摩擦力和柔順度)所需的物理基礎,而這些屬性僅靠視覺往往無法分辨。然而,近期為多模態大語言模型配備此觸覺感知能力的努力,卻暴露出一個零和取捨:緊湊模型的有限參數預算迫使在獲取新感知模態與維持既有視覺語言推理能力之間做出選擇。我們提出 Splash——一種基於掩碼隔離的觸覺對齊學習框架,適用於多模態大語言模型。Splash 量化了每個預訓練參數的重要性,並將參數空間劃分為休眠子空間與關鍵子空間。在關鍵子空間凍結作為穩定錨點以保護通用視覺知識的同時,Splash 更新隔離的休眠子空間,將觸覺對齊內化至大語言模型中。這種選擇性、無破壞性的擴展有效防止了災難性遺忘,並確保了模態擴展的非破壞性。大量實驗表明,Splash 能在不增加大語言模型部分額外推理開銷的情況下有效實現觸覺推理,在視覺-觸覺基準測試(包括 SSVTP、TVL 和 TacQuad)上展現出最先進性能,同時保持其原有的通用能力。
長期視域下的世界模型失敗通常被歸因於誤差累積,但這種泛泛的表述並未區分是哪一類誤差在累積。我們提出一個「運動學 vs 動力學」的重構框架:世界模型傾向於以運動學而非動力學的方式進行想像。我們將其操作化為「想像運動學一致性誤差」(iKCE),這是一種每步診斷指標,用於衡量模型推演偏離封閉式運動學零假設的程度;同時搭配一個擾動實驗方案,用以檢驗當物理條件跨過相態邊界時 iKCE 是否會產生響應。我們在已發布的、於 DMC walker-walk 任務上訓練的 DreamerV3 檢查點上實例化此診斷,結果顯示模型想像出的 iKCE 約比匹配的真實物理推演高出兩個數量級。在一組跨越步態崩潰邊界的摩擦係數掃描中,即便訓練策略的回報在同一範圍內急遽下降,模型的 iKCE 在統計上仍保持平穩,這正是「運動學而非動力學」的特徵。該診斷能在時間跨度超過軀體步態週期時,區分運動學想像與動力學想像。