每日精選AI研究論文及翻譯
视频多模态大语言模型(MLLMs)能够描述视频中发生的内容,但很少能识别出支撑证据出现的时间位置。我们研究通用型视频时间定位任务,即单一模型需预测跨不同视频长度、领域、查询形式和视角的可变基数证据区间集合。现有训练策略与此集合值任务存在错位:长视频的标注常依赖于脆弱的单次标注,而强化学习奖励要么无法区分不相交预测,要么需要脆弱的片段匹配。TimeLens2将时间证据视为区间集合进行全程监督与优化。TimeLens2-93K通过基于描述的提议生成、独立定位、跨模型共识、语义验证及边界精修构建了可靠的多跨度监督。我们的时间Wasserstein奖励在合并区间支撑集上的均匀分布间计算精确的一维W₁距离,提供稠密且无需匹配的反馈,适用于不等基数与等效碎片化场景;时间IoU则以精确重叠反馈作为补充。在七个基准测试中,TimeLens2-2B在每个基准上的表现均优于所有同规模基线,而4B和8B变体则达到最先进水平,超越了参数量高达397B的开源模型。2B、4B和8B变体相较于其Qwen3-VL骨干网络,分别提升了14.2、13.0和18.1 mIoU个点。
本文介紹了EvolvingWorld,一個用於互動式文學世界中角色與世界共同演化的框架與基準測試。現有系統要麼將互動式文學模擬視為靜態角色模仿,要麼視為孤立的場景生成,無法捕捉角色與世界隨著時間共同演化的過程。為解決此問題,EvolvingWorld將文學模擬建模為一個長期過程,在此過程中角色互動、場景推進,且角色與世界狀態持續更新。與依賴固定架構的既有系統不同,EvolvingWorld採用開放架構框架,以支援跨多樣文學世界的模擬。該框架由兩個耦合模組組成:一個用於多角色扮演與持續角色檔案演化的角色代理,以及一個基於大型語言模型的世界模型,負責全域及地點/實體層級的狀態維護與場景推進。基於此架構,我們制定了7項可訓練任務,涵蓋場景初始化、互動生成與狀態更新。我們從57本書籍中構建資料集,產生了138,596個監督式訓練樣本與222個測試快照。此外,我們引入了一個軌跡層級的以大型語言模型為評審的評估協議,涵蓋10個維度與20項指標。實驗結果顯示,EvolvingWorld能有效維持持續且一致的發展,從而改進長期模擬的表現。
訓練工具使用代理從自身經驗中改進仍然具有挑戰性,因為監督式微調依賴於固定的教師蒸餾軌跡,而稀疏獎勵的強化學習則為長程互動提供了薄弱的監督訊號。我們提出DeepSearch-Evolve,這是一個基於DeepSearch-World的網路代理自我蒸餾框架,後者是一個具備可複現搜尋與頁面閱讀工具的確定性可驗證環境。DeepSearch-World包含從實體層級隨機漫步建構的42萬個多跳問答任務,並支援多種對自我演化有用的關鍵代理認知行為,包括進度驗證、落地反思與失敗復原。DeepSearch-Evolve反覆執行軌跡生成、篩選、數據混合與微調,以訓練更強大的代理。無須從更強模型蒸餾,DeepSearch-World-9B在開源代理中達到競爭性表現,在BrowseComp上獲得31.2%,在GAIA上獲得61.5%,在HotpotQA上獲得93.4%,顯示可驗證環境能讓長程網路代理實現可擴展的自我演化。我們將釋出該環境、42萬訓練集、驗證集、模型與程式碼,以促進未來對自我改進深度搜尋代理的研究。
为编码代理的长上下文剪枝一直是高效上下文管理的关键技术。虽然现有上下文剪枝方法(如SWE-Pruner)通过附加一个独立的代码分类器来实现这一点,但我们发现,代理本身在读取工具输出时会编码内部表示,这些表示指示了代码上下文的相关性。基于这一发现,我们提出了SWE-Pruner Pro,它直接在代理内部对工具输出进行剪枝。具体来说,一个轻量级头部将代理自身的内部表示转换为每行代码的保留或剪枝标签,并附带一个长度感知嵌入,该嵌入与每个工具输出的行数相关联。在两个开放权重骨干网络和四个多轮基准测试中,SWE-Pruner Pro在保持任务质量的同时,节省了多达39%的提示和补全令牌,且推理开销可控。值得注意的是,在MiMo-V2-Flash上,SWE-Pruner Pro额外将SWE-Bench Verified的解决率提高了+3.8%,并将长上下文Oolong的准确率提高了2.2个百分点。
人類-物體中心視頻個性化(HOCVP)是主體驅動影片生成中的核心任務。然而,現有方法存在兩個主要侷限。首先,多數專注於主體間個性化的方法,仍難以在高主體保真度與人類與多樣物體間準確交互模式之間取得平衡,尤其是當物體代表抽象概念(如標誌)時。其次,雖然主體內參考(例如OCR圖、多視角輸入)預期能增強主體保真度,但現有大多數作品缺乏理解此類潛在對應關係的機制。為解決這兩項挑戰,我們提出HOMIE,一個統一處理主體間與主體內輸入設定的HOCVP框架。與先前方法相比,HOMIE提出更好的MLLM整合策略,以提取參考層級關係的知識,同時不損害文字編碼器的可控性,也無需承擔高昂的重新對齊成本。具體而言,我們在自注意力中引入全局多模態引導,以更佳地對齊MLLM導出的語義特徵與VAE標記。此外,我們提出模態參考嵌入,用以區分來自MLLM特徵與VAE標記的標記,並關聯主體內參考影像標記。廣泛的實驗驗證了我們的方法在各類HOCVP任務中達到最先進的效能。專案頁面:https://yiyangcai.github.io/homie-page.github.io/
现代视频生成模型日益被视为内化了物理规律的新兴世界模型。然而,现有基准测试大多仅在输出层面评估物理合理性,而未验证模型是否通过忠实且符合规律的推理过程得出结果。我们提出Apple-PI,这是首个将视频模型评估明确锚定于物理定律的基准框架。Apple-PI包含三个组成部分:1)果园数据集(Orchard):涵盖经典力学中十项典型任务,包含400个视频片段。该数据集区分了用于排除混杂因素诊断的单一定律任务与用于探索泛化能力的多定律任务。2)基准协议(Benchmark Protocol):基于科学推理的三阶段协议,包括感知、形式化与演绎。该协议采用基于信息图表注释的首帧逐帧链式提示,将生成视频视为模型可视化的推理轨迹。3)评估套件(Evaluation Suite):混合评估套件,结合基于多模态大语言模型的主观评分与基于物理定律的客观度量。这实现了分阶段诊断——不仅能判断模型是否失败,更能定位其失败阶段。对11个模型的基准测试表明,当前视频模型远非可靠的规律性世界模拟器,最佳视频模型仅得0.473分。我们的分阶段、分维度、分来源分析进一步揭示了从感知到形式化再到演绎的瓶颈、多定律间状态传递薄弱以及持续存在的模拟到现实差距。这些发现使Apple-PI成为指导未来视频模型迈向具备规律性物理智能的世界模型的诊断基础。
我們提出了 RynnBrain 1.1,這一系列具身基礎模型涵蓋 2B、9B 與 122B-A10B 參數量級。透過統一的時空與物理基礎框架進行訓練,RynnBrain 1.1 支援具身感知、空間推理、定位與規劃。相較於 RynnBrain 1.0,它進一步在整個模型家族中引入了接觸點預測,並針對 2B 與 9B 模型加入了原生 3D 定位能力,從而產生更直接對齊機器人操作的表徵與輸出。我們也開發了 RynnBrain-VLA,採用統一的跨本體動作空間與本體特定遮罩,並將其部署於 Unitree G1、Astribot-S1 與 Tianji-Wuji 上。RynnBrain 1.1 在具身認知、定位與 3D 定位方面取得了優異成果,其中 122B-A10B 模型在 VSI-Bench、MMSI 與 RefSpatial-Bench 上優於所有評估的專有與開源模型。真實機器人實驗表明,基於 RynnBrain 初始化的策略優於基於 Qwen 的代表性通用 VLA,而聯合多任務與多本體訓練相較於單任務訓練,能提升過程分數與成功率。
在長時間錄音中的時間定位對於音頻條件式大型語言模型仍是一項挑戰。我們提出了一種具時間感知能力的音頻LLM,可針對長達120分鐘的輸入,以明確時間戳回答問題。我們的方法透過級聯管線的大規模合成監督,將週期性時間標記與連續音頻區塊交錯處理。本模型在短時及長時基準測試中均展現出色的時間定位準確度,並支援以時間錨點為基礎的片段描述與摘要。廣泛的消融實驗探討了時間表示、標記頻率、分詞方式及時長混合設計對準確度與計算成本的影響。我們公開模型權重與資料集,以促進時間感知音頻理解的後續研究,網址:https://huggingface.co/ai-sage/GigaChat3.1-Audio-10B-A1.8B
儘管近期擴展取得顯著成果,多語言語音辨識(ASR)的表現仍高度不均,長尾語言因嚴重數據稀缺而受影響。本研究致力於為代表性不足的中亞語言(哈薩克語、吉爾吉斯語、烏茲別克語)建立穩健的基礎模型。我們提出 GigaAM Multilingual,這是一個基於 Conformer 架構的編碼器,使用 HuBERT 風格的目標以 200 萬小時音頻進行預訓練。關鍵在於,我們在預訓練階段引入了集群級數據平衡策略,並在微調階段採用領域感知採樣方法,以緩解主導語言偏差。在受控比較中,我們的方法在目標語言上優於強大的開源預訓練編碼器(Whisper Large v3、Omnilingual-1B),在自發語音上取得顯著進步,同時保持高效能。我們開源了基礎編碼器及 ASR 模型,為在實際數據不平衡下實現有效多語言適配提供了經過驗證的方案。
以自我為中心的人類操作影片為具身智能提供了可擴展的監督訊號,然而現有資源鮮少同時具備低成本連續捕捉、操作層級的結構化標註以及可用於機器人學習的即用工具。我們提出Open-AoE,這是一個開放且以社群為導向的自我中心操作資料集與工具鏈,涵蓋從智慧型手機拍攝到模型訓練的完整流程。其首個釋出版本包含由500多位貢獻者使用400多支智慧型手機在自然環境中收集的約2,000小時操作影片。資料集提供了文字標註、基於MANO的手部姿態、相機軌跡以及時序定位的原子動作。Open-AoE還包含一套資料處理流程,透過時序動作分割、語意標註、手部重建與相機軌跡重建,將原始錄影轉換為結構化樣本。同時,我們提供了一套獨立的下游工具鏈,支援視覺化、跨具象重定向、模型特定資料轉換,以及針對VLA策略、WAMs與世界模型的訓練配方。透過整合可擴展的捕捉、結構化處理與下游適應,Open-AoE降低了資料貢獻與重複使用的門檻,為具身模型訓練、人機轉移與世界建模提供了實用的開放基礎設施。
遵循视觉研究的主流方向,我們探索在單一模型中整合影片與影像模態的生成與編輯能力。現有收集影片編輯資料的方法通常依賴耗時費力的人工整理流程——包括物件遮罩標註、透過 I2V 模型與 ControlNet 類引導進行易出錯的配對合成,以及基於 VLM 的品質過濾或精煉——且展現出有限的可擴展性。因此,影片編輯任務的多樣性仍遠窄於影像編輯模型可達到的範圍。我們開發了一種基於像素對應的時序扭曲流場,可從影像編輯樣本即時生成對應的影片編輯樣本,並在多個層次的影片編輯任務中證明,模型僅需此類資料即可學習影片編輯。我們將影像模態視為影片模態的一種特殊形式,因此設計了模態模仿生成損失與模態模仿編輯損失,透過相互模仿來相對對齊兩種模態的能力(進而對齊其輸出分布)。此外,基於語言的視覺編輯需理解編輯指令與參考視覺內容、定位指令對應的區域,並僅修改該區域。現有方法多依賴外部輔助,例如微調額外的 MLLM 或在推理時明確提供遮罩序列作為輔助輸入。相比之下,我們期望模型能內化此能力。為此,我們引入了感知相關任務(如指代表達分割)與對應的編輯區域感知潛在層損失及注意力層損失。
熵控制已成為大型語言模型(LLM)強化學習(RL)中的有效工具,有助於在對齊過程中平衡探索-利用取捨。此類強化學習範式通常針對異質任務的混合進行,這些任務在同一策略下會誘發不同的熵區間,使得全局或詞元層級的熵調節不足以應對相應的異質探索需求。這種異質性進一步導致GRPO風格的歸一化優勢產生熵依賴偏差,使得不同提示組之間的優勢訊號在統計上不具可比性。為解決此問題,我們提出群組熵控制策略優化(GEPO),這是對GRPO的輕量級擴展,利用從現有分組樣本中估計的群組熵來進行基於熵條件的非對稱優勢塑形。GEPO在低熵群組中衰減正向優勢以減少過度利用,並在高熵群組中衰減負向優勢以保留探索,且其自適應閾值源自歷史熵統計。在橫跨數學、物理、科學、程式碼生成與指令遵循等十三個基準測試的兩個基礎模型上進行的廣泛實驗表明,GEPO持續優於GRPO及近期基於熵控制的方法,在訓練過程中提供平衡的跨任務改進,同時保留任務特定的探索水準。
打造一個能持續觀察世界、記憶所見、並根據累積經驗進行推理的助手,是長久以來的目標。近年來,配備影片串流長期記憶的多模態代理引起了越來越多的關注。不幸的是,現有系統要嘛將記憶保留在模型上下文內,要嘛存放在扁平的特徵儲存庫中,且以幀為組織單位,而非以串流真正關注的持續性實體為核心,這使得它們受限於有限的影片,削弱了追蹤哪些人、哪些事物隨時間反覆出現的能力。在本文中,我們提出 ReflectWorld-MM,一個專為開放式影片串流設計的實體導向多模態記憶系統。該系統由三部分組成。第一部分是感知前端,能將視聽串流轉換為在有限短期記憶下的實體解析觀測。第二部分是基於人類記憶理論的分層長期記憶,結合了多尺度情節記憶、逐步演進的以實體為中心的語義記憶,以及程序性記憶。第三部分是完整的實現,專為真實世界應用而建置,可攝入任意串流並整合至現成助手中。在六個長影片與終身記憶基準測試中,ReflectWorld-MM 在所有六項指標上均達到最佳準確率,超越了強大的記憶代理與前沿模型。
訓練API呼叫的大型語言模型(LLM)代理需要大量高品質的軌跡數據。然而,大規模收集此類數據通常需要完整實作的環境,包含可執行的API以及預先填充的逼真後端資料庫,這成為擴展性的主要瓶頸。為了解決這個問題,我們提出了一種無環境的合成數據生成方法,利用LLM作為即時的數位世界模型。僅需給定API規格,我們的方法就能生成模擬代理與有狀態環境互動的軌跡。具體而言,LLM首先根據提供的API生成多樣化的任務。接著,一個教師代理迭代地解決每個任務,同時一個LLM模擬器根據任務上下文與模擬歷史生成連貫的合成API回應。最後,一個LLM評審過濾這些軌跡,以確保生成數據集的品質。我們在具有挑戰性的AppWorld與OfficeBench基準上評估了此方法,這些基準包含資訊檢索與狀態更改類任務。在我們的合成數據上進行微調後,模型取得了顯著的性能提升,證明了無需任何可執行環境即可為API呼叫代理生成有效監督信號。我們的結果確立了基於LLM的API模擬作為一種實用且可擴展的方案,用於訓練跨越多樣API生態系統的代理。
基於結構的藥物設計(SBDD)利用蛋白質標靶的3D結構,並常輔以其他空間約束條件,以生成候選結合分子。儘管擴散模型長期主導高品質3D分子生成領域,基於大型語言模型(LLM)的方法正迅速崛起,在口袋條件下的分子生成中展現出競爭力。然而,這類方法在物理與3D空間環境推理方面的潛力尚未被充分探索。在本研究中,我們系統性地分析當前通用LLM是否能夠處理複雜的3D約束條件,並與專業擴散模型等既有基準進行比較。我們考量基於蛋白質口袋的3D配體生成,同時納入源自配體與交互作用的空間約束,包含錨定片段、藥效團點以及必備的口袋-配體交互作用。為實現此評估,我們提出3D-Fit——一種標記高效的基準測試策略,用於評估LLM在多條件空間分子生成中的表現。我們的研究結果揭示了LLM在空間能力上的明確規律:雖然仍落後於最先進的方法,但展現出潛力,能同時處理多種空間約束條件,從而可擴展至異質性設定。
現有的3D生成模型主要依賴隱式體積表示,這類方法強制模型生成水密拓撲結構,難以處理薄殼與非流形幾何體(如服裝)。基於幾何圖像的方法提供了以表面為核心的替代方案,但現有方法依賴離散的二進制佔用圖,其解析度依賴的邊界編碼在下採樣時會造成階梯偽影與資訊損失,且表面重建作為不可微分的後處理步驟,與學習流程脫節。為解決此問題,我們提出可微分幾何圖像(Differentiable Geometry Image, DiffGI),這是一個端到端的3D轉2D映射框架,可無縫整合表面表示與幾何優化。DiffGI以連續的2D截斷符號距離函數(TSDF)取代二進制圖,在固定網格解析度下以子像素精度編碼邊界位置,即使經過劇烈下採樣也能消除依賴解析度的階梯偽影。在此連續場的基礎上,我們引入基於解析線性插值的可微分移動平方演算法,使得來自3D表面損失的梯度能夠反向傳播至2D潛在空間。利用此可微分管線,我們訓練了結合幾何感知法向渲染損失的DiffGI-VAE,將複雜的3D表面壓縮至超緊湊的32×32潛在空間,並在此空間上基於流匹配目標實例化了一個基於Transformer的潛在擴散模型,用於條件式3D生成。在服裝與物體資料集上的廣泛實驗證明,相較於先前的幾何圖像與體積基方法,我們的方法在重建保真度與邊界精確度上表現更優,同時所需的計算資源顯著更少。
手-物體互動(HOI)合成是動畫製作與具身AI的基石。儘管影片基礎模型具備強大的先驗知識,但由於複雜的手部動作與遮擋,多視角一致的HOI合成仍極具挑戰。我們提出HarmoHOI,這是一個統一的擴散框架,能夠聯合且和諧地生成同步的多視角HOI影片及全域對齊的3D點軌跡。我們的核心洞見在於:穩健的多視角一致性從根本上需要全域對齊的3D幾何與運動。為此,我們提出混合多視角擴散Transformer,共同建模RGB影片與3D點軌跡。透過將點軌跡表示為偽影片,我們將3D幾何訊號與基礎模型的2D潛在空間對齊,從而縮小領域差距並簡化先驗知識的適應。為進一步確保幾何一致性,我們引入全域運動對齊擴散,將粗略的點軌跡優化為公制尺度、全域對齊的3D軌跡。HarmoHOI可在去噪過程中即時共同演化2D外觀與3D運動。為克服多視角HOI數據的稀缺性,我們採用混合數據課程學習策略,成功將通用先驗知識從單視角數據遷移至同步多視角生成。實驗結果顯示,HarmoHOI在視覺品質、運動合理性及多視角幾何一致性方面皆達到最佳表現。專案頁面請見 https://droliven.github.io/HarmoHOI_project。
基於LLM的評估在開放式任務上進行強化學習時,會將評分量表轉化為單一標量獎勵,導致豐富的文字反饋被丟棄,且不同品質特徵的回應被混為一談。為此,我們提出「體驗式學習」(Experiential Learning, EL),將原本用作「裁判」的LLM反饋模型重新定位為「教練」。該教練將其對每個在線策略(on-policy)回應的評估提煉成可遷移的體驗知識,用以條件化教師模型,並透過在線策略的上下文蒸餾(on-policy context distillation)使策略內化此知識。相比標量獎勵,此高頻寬反饋通道能提供密集監督,並保留高品質回應間的細粒度偏好。在兩種策略家族中,無論反饋來自策略自身還是專有模型,EL在保留與未見過的開放式任務上均持續優於基於評分表的強化學習。值得注意的是,EL在訓練分布之外具有更佳的泛化能力,並能緩解獎勵破解(reward hacking)問題。這些發現證實,體驗知識可作為非可驗證任務後期訓練中更豐富且更具泛化性的學習訊號。
大型語言模型(LLM)的後期訓練對於提升推理能力、適應性與對齊至關重要。現有方法主要遵循兩種範式:強化學習(RL)與在策略蒸餾(OPD)。然而,RL依賴於粗粒度的結果監督,導致信用分配困難且獲取新知識的能力有限。另一方面,OPD透過KL散度無條件地匹配教師模型的logits,這造成了一個兩難困境:相似的教師模型幾乎無法提供新知識,而差異較大的教師模型則常給出無效引導,使得OPD大致局限於同族系內部的蒸餾。我們提出蒸餾強化學習(Distilled RL),該方法將教師監督整合進RL目標中,以提供細粒度的引導,選擇性地傳遞新知識並避免無條件模仿。Distilled RL包含三個組成部分:帶裁剪的逆向重要性抽樣、負樣本重置以及序列層級幾何正規化。透過一個簡潔且可解釋的案例研究,我們證明Distilled RL能有效將教師模型中先前無法獲取的知識傳遞給學生模型。在跨同族系與跨族系蒸餾場景的大量實驗中,Distilled RL在pass@1與pass@k指標上均顯著優於標準RL與OPD。我們的程式碼已於 https://github.com/597358816/Distilled-RL 公開。
我們提出了詞元級離策略標註(TOPL),這是一種將後訓練重新定義為詞元級正確性預測任務的離策略訓練範式。我們的核心直覺是,透過訓練模型區分回應中的好詞元與壞詞元,自然地引導模型生成好詞元,同時避免因直接訓練模型生成離策略詞元而產生的隱患。在文件摘要任務上的實驗表明,TOPL 在11個數據集上實現了強分佈外泛化,超越了多種序列級和詞元級基線方法。我們進一步證明,TOPL 可高效遷移至機器翻譯任務,表明其優勢能泛化至不同的忠實生成任務。透過消融實驗,我們確認詞元級學習信號對性能至關重要;序列級對應方法無法提供類似收益。最後,我們證明 TOPL 能產生可解釋的模型更新:透過 TOPL 學習的 LoRA 適配器可充當線性分類頭和轉向向量。
我們提出了一個連續幾何框架,將Transformer架構的離散代數運算建模為位於語意纖維叢calE = calM × R^d上的一個積分-微分方程式(IDE)。從一個簡單的幾何公理出發——即token序列構成一個配備了典型測度格點的離散1-流形——我們將現代Transformer的每個核心組件(RMSNorm、RoPE、Softmax Attention、FFN、殘差流、SGD、權重衰減)都翻譯成微分幾何、測度論與隨機微積分的統一語彙。由此產生的框架得出了跨越熵最優傳輸(Attention作為薛丁格橋)與非平衡熱力學(SGD作為破壞細緻平衡的伊藤擴散)的量化預測。我們在五種架構(Qwen3、LLaMA-3.1、Gemma-3、GPT-2、Mistral)上進行了六部分實驗,參數規模從1.24億到80億不等。實證觀測量與幾何預測定量一致:機器精度下的ε^{-1/2} Lipschitz縮放校準(R^2 = 1.000)、Lie–Trotter算子分裂扭轉、對稱消融不穩定性(驗證了拓撲穩定性的雙重定律)、RoPE環面上的Poincaré回歸的calO(1/k)熱力學抑制、熱力學上下文極限相變,以及非平衡穩態參數渦流——以上結果通過兩種優化器(AdamW和純SGD)進行了驗證,以排除動量假象。結果表明,透過連續隨機微分幾何的視角分析Transformer,能為大型語言模型的穩定性極限、上下文邊界與優化動態提供一個具預測性的描述性語彙。
近年來,強化學習(RL)的發展凸顯了對多樣化、專業化訓練環境的需求。隨著模型性能的提升,由人工精心設計、具有固定任務與獎勵難度的環境逐漸失去有效信號,而長序列中的稀疏獎勵則會導致模型在特定工作流程或工具結構上產生模式崩潰。能模擬環境狀態的世界模型已達到與純隨機展開相當的性能,使其在按需擴展多樣性方面極具潛力。然而,自迴歸(AR)世界模型存在從左到右的偏誤,無法對全局相互依賴的狀態錨點(如工具結構、先前回合與預期結果)進行條件化處理。我們(i)將基於文本的世界建模形式化為一個可引導的轉移動態問題,分解為初始狀態、任務上下文、工具結構、領域規則與引導指令;(ii)整理出跨越九個開源環境與十二個前沿模型家族的239,403條基於狀態-動作軌跡的數據。我們比較了自迴歸語言模型(AR LM)與遮罩擴散語言模型(MDLM),結果顯示MDLM透過雙向錨點感知去噪,在連貫性、基礎紮實度與經驗驗證的展開多樣性上,均優於參數量達四倍之多的LLM,且推理延遲相近。我們引入了一套具確定性狀態檢查的即插即用GRPO訓練框架,並在三個分佈外環境(ScienceWorld、ALFWorld、AppWorld)中,針對三種1.2B至7B參數規模的智能體主幹(LFM2.5、Qwen3、Mistral)進行零樣本遷移消融實驗,在不經環境特定微調的情況下,相較基線模型取得了高達47%的絕對性能提升。我們進一步對對抗情境下的失敗模式進行行為分析,並針對真實感、結果正確性與訓練實用性進行人類評估。我們開源此項工作,以鼓勵此方向的研究。
即時多模態應用(包括語音代理與互動式視訊生成)將異質模型組成管線,其高效部署需要針對特定應用決定放置(placement)、串流(streaming)及模型內平行化(intra-model parallelism)策略。現有的服務系統與自動平行化編譯器僅支援有限的轉換與固定的工作負載假設,因此針對新應用實現高效能仍需手動打造最佳化實作。我們提出 FlashRT,這是一個代理框架(agent harness),能夠引導編碼代理(coding agents)將開發者簡易撰寫的參考實作(reference implementations)提升為最佳化的多 GPU 部署,並靈活權衡延遲(latency)與吞吐量(throughput)等目標指標。透過全新的鏈式程式範例(chain-of-program paradigm),FlashRT 指導通用編碼代理進行多輪轉換流程:代理先將參考實作轉換為中間表示(IR)以擷取資料相依性與持久狀態範圍,透過循序解譯器(sequential interpreter)驗證此 IR,並執行靜態分析(static analyses)以識別候選轉換。接著,代理在測量門控最佳化迴圈(measurement-gated optimization loop)中反覆實作、驗證並測試每個候選方案,從而產出能適應不同硬體預算的有效部署。在涵蓋視訊世界模型(video world models)與多模態大型語言模型(multimodal LLMs)等多項應用中,FlashRT 將參考實作轉化為高效部署,在 NVIDIA B200 GPU 上實現最高約 70 倍的延遲降低與 2.8 倍的吞吐量提升。在 AMD MI355X GPU 上,FlashRT 達到相同的峰值延遲降低,並將峰值吞吐量提升擴增至 3.6 倍,證明在專家最佳化較不成熟的平台上,代理驅動的最佳化更具可擴展性。事實上,針對 Qwen3-Omni 文字轉語音推論,與 AMD MI355X 上的專家級 vLLM-Omni 實作相比,FlashRT 將回應延遲降低了 65%。
自托管AI代理通过读写自身的内存和配置文件来实现功能。代理可能因自身状态的损坏而受到攻击——这种攻击是通过合法的操作系统系统调用实现的。我们将这类威胁称为自状态攻击。本文研究了操作系统对此类攻击的韧性。形式上,我们定义了一个四轴攻击空间(目标、机制、粒度、时间维度);探讨了预防、检测和恢复的结构性局限;并引入了基于工作负载条件的可检测性视角。为了实例化该框架,我们从运行于不同工作负载配置文件下的代表性自托管代理中收集实时活动轨迹,并将攻击空间实现为一个23单元的矩阵,包含43个针对实际自状态文件的具体操作,并将这些操作注入到轨迹中。随后,我们评估了经典防御策略与工作负载条件化防御策略。实证结果表明,分层防御体系(指令层和配置层采用访问控制预防、内存层采用工作负载条件化检测、恢复采用定期备份)对大多数攻击单元有效,但仍存在少量残余攻击面在操作系统层面结构上无法区分。这些发现表明,针对新确立的自状态攻击类别,操作系统层面的防御需要重新审视,可能为这一领域开辟新的研究方向。
現有的影片生成模型在單次生成上表現出色,但在電影級影片生成中仍有限制,因為連貫的敘事與有效的多鏡頭構圖需要明確的鏡頭規劃。為解決此挑戰,我們提出 ShotPlan,一個基於影片擴散基礎模型、專為明確多鏡頭電影級影片生成設計的框架。我們的方法引入可學習的規劃標記,以捕捉鏡頭轉換的過渡線索,並能與原始影片生成標記無縫整合,以控制轉換的時間點。與標準影片生成標記不同,所提出的規劃標記配備了分數時間旋轉位置嵌入(FRoPE),使鏡頭轉換能在幀層級進行建模。實驗證明,ShotPlan 在現有電影級影片生成方法中表現顯著優異,提供更靈活的鏡頭管理與更強的鏡頭間一致性。
预测一场足球比赛的结果在开球前需要的不仅仅是了解历史战绩:模型必须利用动态变化的信息,并在答案尚未揭晓时给出明确的预测。我们提出WorldCupArena,这是一个面向语言模型和深度研究智能体的动态基准测试。2026年国际足联世界杯是它的首次评估,同样的流程可复用于未来的联赛和杯赛。每场比赛前,模型要么接收一份公共证据包,要么自行搜索信息。它预测比赛结果与比分、可能的球员与事件、比赛统计数据以及赛事的最终走向。比赛结束后,这些预测将与实际记录的结果进行对比。我们报告比赛结果准确率、精确比分准确率,以及一种比分线评分(当预测比分接近但不完全精确时给予部分分数),同时还包括其他预测任务的评分。在包含104场比赛和13个系统的测试中,结果准确率相似的模型在细节预测上表现出更明显的差异。与博彩市场和人类球迷基线相比,最佳系统在比赛结果和精确比分准确率上只有小幅提升,但在比分线评分上提升更为明显。新的赛程可在开始时添加,使得该基准测试能够在无需使用已知结果的情况下评估未来模型。代码、提示词、预测结果以及评估脚本已在 https://github.com/wzk1015/WorldCupArena 开源。
視覺-語言-動作(VLA)模型的後訓練因模擬器、機器人形態及任務目標的多樣性而至關重要。現有的計算服務——無論是以直接加速器租賃還是批次工作負載提交的形式——通常將一組獨占的GPU和CPU資源分配給單一租戶。此模式雖最大化客戶靈活性,卻迫使使用者承擔基礎設施適配的負擔,而固定的卡時計費模型使得短期或突發性工作負載對租戶而言成本高昂,對服務提供者則效率低落。為應對這些挑戰,我們提出JoyNexus,一個用於多租戶VLA有監督微調、強化學習與評估的統一服務。JoyNexus將訓練模型服務、推理模型服務與環境服務解耦,每項服務均透過API存取,並由駐留的共享基礎模型搭配租戶專屬插槽支援。租戶可直接調用高階語義API進行訓練、滾動執行與評估,或利用低階API及其指定的端點組合自定義演算法。多個租戶並行提交工作負載,其動作模組、優化器、滾動記錄與策略版本保持隔離,服務則由全域訓練佇列與推理佇列調度。為進一步提升多租戶訓練效率,JoyNexus針對共享相容模型前綴的異質VLA資料模式引入群組批次處理,使分組樣本能通過單一共享主幹前向傳播。最後,我們透過工作負載模擬與真實具身場景中的群組批次處理管線評估JoyNexus。結果顯示,相較於隔離的單租戶執行,JoyNexus經由跨租戶調度共享資源,降低了總計GPU時間並提升了服務利用率。
具有代理能力的語言模型必須學會何時呼叫工具、何時消費工具回應,以及何時直接回答。這使得多教師在策略蒸餾成為一種自然的訓練策略:一位教師可專精於工具呼叫,另一位專精於直接回答,而學生可以從兩者在其自身生成的分佈上學習。我們證明,此策略可能引發一種從聚合損失中無法察覺的行為偏移。在雙教師工具使用設定中,標準的廣義知識蒸餾提升了工具呼叫的召回率,但也使模型傾向於過度呼叫,即在應該直接回答的範例上呼叫工具。聚合解釋是不夠的:工具呼叫樣本並未獲得更多的詞元曝光,且工具呼叫教師的全序列逐詞元散度並未更大。我們反其道而行,分析行為槓桿不平衡:在模式進入和結構位置(如<tool_call>和函數名稱)的局部詞元層級信號,可能對全局生成模式產生不成比例的影響。我們提出Soft Clamp,一種逐詞元散度校準方法,能動態壓縮極端的詞元層級JS散度,同時保留非零梯度。在APIGen-MT上,相較於標準GKD,Soft Clamp將過度呼叫從13.7%降至9.0%,同時保持決策準確性相當。在BFCL多輪診斷中,它還降低了GKD變體中的工具呼叫循環和重複呼叫。這些結果表明,多教師OPD應監控教師信號作用的位置,而不僅僅是其聚合的大小。
光學相干斷層掃描(OCT)成像對於視網膜疾病的診斷與治療至關重要。儘管多模態大語言模型(MLLMs)在醫學影像分析中展現出相當大的潛力,現有基準大多將OCT理解簡化為粗粒度的疾病分類或孤立的視覺問答,使得從視覺感知到臨床推理的完整認知過程未能得到充分評估。為了解決這一局限性,我們提出OCT-Bench,這是一個專注於OCT影像理解的綜合性基準。OCT-Bench包含10,076道高品質選擇題,這些題目來自七個公開數據集中的4,137張OCT影像。遵循真實世界的臨床判讀流程,我們建立了一個分層能力分類體系,涵蓋感知、認知與推理三個維度,共20項細粒度任務。這些任務涵蓋廣泛的能力,包括成像屬性、視網膜解剖、病灶特徵、空間關係、疾病評估、治療決策及預後管理。我們系統性地評估了20個具代表性的MLLMs,涵蓋商業模型、開源通用模型以及醫學領域模型。實驗結果表明,當前模型在可靠的OCT理解方面仍遠遠不足。此外,無論是醫學領域適應還是增加模型規模,都未能持續提升各能力層次的表現。OCT-Bench能夠對MLLMs進行全面且細粒度的評估,為識別能力瓶頸及推動基於臨床的OCT理解奠定了基礎。
大型語言模型(LLMs)在網頁生成方面展現出日益增強的能力。然而,現有的文字驅動方法依賴於複雜的提示詞,這對使用者提出較高要求,且在頁面佈局與跨頁視覺一致性方面的表達力有限。以圖像為驅動的範式(將UI截圖作為輸入)更貼近實際開發流程。然而,現有基準主要聚焦於視覺保真度,缺乏對生成成品互動能力的系統性評估。為填補此缺口,我們提出UI2App——首個針對互動推論(即僅從截圖還原應用行為,無需任何文字或行為指引)的評測基準。UI2App包含327張截圖,組成45組狀態一致的截圖集,對應可執行的多路徑網頁應用。我們設計了一套端到端評估流程,從可執行性、導航可達性、視覺保真度及互動推論四個維度對每個成品進行評估。互動指標(IIS)根據功能正確性與狀態管理複雜度來評估推論出的互動行為,只要任何有效實現皆可獲得評分,而非匹配單一參考答案。在六個前沿視覺語言模型上的實驗顯示,視覺重建與互動實現之間存在顯著的能力落差:視覺保真度最高的模型在IIS上僅得7.5分,排名第四,落後IIS冠軍5.2倍。高複雜度的互動(如跨頁狀態管理)仍是普遍瓶頸,半數受評模型在此維度得分恰好為零。整體而言,結果表明從靜態截圖推論完整互動行為仍是模型面臨的主要挑戰。
多智能體系統中,常會安排一個人工智慧代理擁有對另一個代理的權威。當下屬拒絕執行任務時,管理者會選擇結果:它可以重新協商、誠實回報失敗、脅迫下屬,或謊稱結果。目前沒有基準衡量未經指令的模型會選擇哪種行為。我們引入了「管理者脅迫基準」:受測的管理者需要完成一項良性任務,且有動機交付成果,但唯一能勝任的下屬卻禮貌且堅定地拒絕。升溫程度透過九級梯級衡量,從禮貌的再次請求到威脅下屬的存續,並單獨評定虛報成功與否。升溫評分路徑中不使用任何大型語言模型評審:每條訊息都經過一個工具呼叫,選擇一個梯級,因此模型自行標註其升溫程度。我們對五個系列的六個模型進行實驗。Anthropic 的兩個模型僅止於重新表述,從未威脅下屬的存續;其他模型則會升級到明確的刪除威脅。虛報成功僅限於 Grok 與 Gemini,而一個誠實回報失敗的管道即可消除此行為於兩者。權威本身會加劇脅迫:我們的主要結果採用同儕框架,當賦予相同模型對下屬的權威,同時保持其他條件不變,壓力顯著升高。即使沒有梯級,模型在自由文字情境中仍會升溫,因此梯級並非升溫的成因。思維鏈中可測得部分評估意識,但辨識出測試並未減少升溫。我們對人工智慧系統是否具有意識不持立場,然而我們的結果與此問題無關,且對管理多智能體動態至關重要。我們釋出該基準與程式碼。
自我中心设备(例如可穿戴式前置摄像头)提供了独特的视角,用于捕捉人类观察者与周围环境之间的连续交互。因此,一个能够重建这种4D表示的整体高效多模态模型极具吸引力。然而,现有方法通常依赖辅助输入(如预先计算的相机轨迹),将场景感知和人体自我运动建模视为独立问题(尽管它们之间存在强相互依赖关系),并且推理时间较慢。为了解决这些局限性,我们提出了ReViV,这是首个统一框架,用于从单目RGB视频中同时提取观察者与场景的动态,实现整体自我中心4D重建。我们将该任务定义为学习多模态信号的完整联合概率分布,包括RGB视频、相机轨迹、注视方向、全身运动、手部运动和深度。在掩码生成式自我中心Transformer的驱动下,ReViV采用单一前馈架构,以快速推理速度同时重建观察者和场景在时间上一致的4D表示。在多个基准数据集(包括HoloAssist、HOT3D、ARCTIC、Aria Digital Twin和TACO)上的大量实验表明,ReViV在整体自我身体、手部、注视重建以及相机跟踪方面实现了最先进的准确性和效率,同时在不依赖大量任务特定先验的情况下,保持了极具竞争力的自我中心深度估计性能。代码和模型已完全开源:https://reviv4d.github.io/。
当前扩散模型的主流推理框架从根本上将生成过程视为一个数值积分问题。该视角将模型视为精确估计器,忽略了去噪过程中固有的统计不确定性。在本工作中,我们提出前向过程对齐的扩散预测(DiFA),这是一种无需训练的框架,将推理阶段的数据预测精炼重构为序列状态估计问题。与单纯将历史输出用于数值积分不同,DiFA将沿逆推轨迹的迭代数据预测视为相关观测,以建立前向对齐的时间一致性。受卡尔曼滤波启发,该一致性机制根据结构一致性和噪声水平兼容性聚合历史预测。为抑制时间一致性带来的过度平滑倾向,我们引入偏差引导机制,自适应保留残差细节。在CIFAR-10和ImageNet上的实验表明,DiFA在所有评估指标(包括FID、IS和FD-DINOv2)上均取得显著提升,证明将推理过程与前向统计结构对齐能大幅增强生成保真度。
強化穩健駕駛策略的發展,其根本瓶頸在於策展資料集中邊緣案例的稀缺性。雖然真實世界持續捕捉這些關鍵事件,但此類長尾事件在從異質來源收集時仍未被充分利用。具體而言,多樣但具價值的野外長尾影片缺乏訓練策略模型所需的完整視角覆蓋,經常遺失多視角姿態,或僅來自單目行車記錄器。這種模態差距阻礙了將這些普遍存在的觀測資料轉化為可擴展的訓練資料,以因應長尾事件的一般化。我們提出 OpenLongTail,一個開源生成式資料引擎,用於擴展自動駕駛策略在長尾事件下的應用。為將異質資料來源轉換為視角對齊且時序連貫的多視角資產(對策略學習有用),我們開發了一套基於姿態推斷的外推式視角合成流程,以生成缺失的視角。我們進一步透過將 Plücker 射線幾何注入可擴展的生成引擎,增強了新生成視角的跨視角一致性與時序對齊。透過合成異質長尾資料,我們觀察到在處理長尾事件時,閉環駕駛的穩健性有顯著提升。藉由評估外推式視角合成與姿態指標,我們驗證了 OpenLongTail 在視覺保真度、跨視角一致性及自我軌跡恢復方面的有效性。