每日精選AI研究論文及翻譯
視覺-語言-行動(VLA)模型已成為通用型具身智能體的主導範式,在結構化環境中展現出強大的複雜及長時程任務完成能力。然而,當前的VLA系統是否能從更有效的架構設計中受益、能否擴展至更大規模且更多樣化的異構數據體系,以及能否在任務與具身形態之間實現更廣泛的泛化,仍然是待解的問題。為此,我們提出了GigaBrain-0.7,一個在多種機器人具身形態上泛化能力顯著提升的具身基礎模型。具體而言,GigaBrain-0.7透過三系統架構統一了理解、預測與行動,將預訓練規模擴展至超過37,000小時的異構具身數據,並引入了單階段對齊訓練,該訓練同時優化視覺-語言理解與多具身形態行動生成。與前一代GigaBrain-0系列以及包括π_{0.5}在內的既有最先進模型相比,GigaBrain-0.7在基礎零樣本能力、語言條件指令跟隨以及後訓練任務成功率方面均取得了顯著提升。特別地,在我們自有的Maker H01平台及主流機器人具身形態上,GigaBrain-0.7在家庭與工業場景中皆展現出強大的任務適應性與完成能力。所有訓練程式碼與預訓練模型權重將全面開源釋出。
多模態大型語言模型(MLLMs)已成為統一影片感知的主流範式。然而,在大型多任務資料集上進行後期訓練仍具挑戰性,因為現有的強化學習方法即使在昂貴的思維鏈(CoT)生成下,也只能從同策略群組中採樣到少量高品質軌跡。本文研究了影片MLLMs強化學習後期訓練的樣本效率與可擴展性,並提出了OraRL。我們發現了註解一個被忽略的作用:除了對軌跡進行評分,每個註解都可以作為教師軌跡(oracle rollout)進入其同策略群組,成為直接的正向最佳化目標。然而,直接整合教師軌跡並非易事:高獎勵的教師軌跡會提高群組基線,並使原本正向的策略優勢發生反轉,我們將此失敗現象稱為「優勢反轉」(advantage inversion)。OraRL的核心是一個解耦的優勢估計器:策略軌跡決定無教師基線,而教師-策略差距則同時調節方向性增益與一個獨立的分離教師優勢。符號平衡剪枝提升了效率:透過僅保留教師軌跡及各符號中最強的軌跡,OraRL只需SFT步進時間的2.2倍,遠低於GRPO搭配CoT所需的4.9倍。OraRL隨模型規模與資料量擴展,在0.8B至9B的範圍內超越其骨幹模型,並在多達10萬個提示詞的規模下超越GRPO。無需思維鏈,Video-ORA-9B僅需130毫秒即可完成解碼,而非4,780毫秒。與先前各基準的最佳模型相比,它將時間mIoU從62.5提升至66.0,追蹤AO從73.0提升至78.2,分割從64.3提升至70.4,三個基準的空間智慧宏觀平均值從51.0提升至56.1;在VSI-Bench上,它取得73.1分,而GPT-5為55.0分、Gemini-3-Pro為55.1分。
通用多模態嵌入正逐漸成為現代AI系統的核心組成部分,使異質內容得以在共享空間中表示,從而支援檢索、推薦、分類及智能體系統等應用。在本報告中,我們提出WeMM-Embedding,一個通用多模態嵌入模型系列,支援文本、圖像、影片、視覺文件以及任意交錯的多模態輸入,並具備靈活的輸出維度。該系列包含2B、4B和9B三種規模的變體,並採用兩階段訓練:首先是大規模多模態對齊階段,其次是使用精選數據、細粒度相關性監督和跨尺度知識遷移的微調階段。在廣泛的評測中,WeMM-Embedding在多個公開基準上取得了領先的表現。值得注意的是,2B變體在MMEB-v2上已經超過了先前領先的8B開源基線,而9B變體進一步取得了80.6的整體新最佳成績。WeMM-Embedding在微信各類應用中也展現了強勁的實際效能,在包含26項任務的內部基準上取得顯著提升,並在14項線上A/B測試中表現出一致的改進。該模型已大規模部署於推薦和搜尋應用中,包括微信影片號、公眾號、朋友圈及電商服務。我們已開源模型權重和程式碼,以促進未來研究,網址為https://github.com/Tencent/WeMM-Embedding。
LLM 智能體在長時程任務上仍不可靠,其中微小的局部失敗可能因長時間的互動而累積,最終導致整體任務失敗。儘管外部控制框架能大幅提升穩健性,但控制框架的設計仍是一項耗費人力且成本高昂的過程,需要在龐大的提示詞、工具配置及控制邏輯空間中進行搜尋。我們提出 AutoSaddler——一個自動化控制框架優化系統——將控制框架改進形式化為離線學習問題,並利用小批次中獲得的失敗訊號迭代更新控制框架。AutoSaddler 結合了失敗軌跡診斷、將控制框架視為程式碼的結構化補丁生成,以及基於驗證的更新選擇。在 GAIA2、SWE-Bench Pro 和 Terminal-Bench 2.0 上的實驗表明,AutoSaddler 相較於對應的基礎控制框架大幅提升了智能體效能,分別取得了 9.0、9.6 和 10.0 個百分點的增益。消融研究進一步指出,有效的控制框架優化得益於三個要素:深度除錯而非淺層反思、針對性修改而非無約束編輯,以及具有泛化意識的選擇而非針對個別軌跡的修復。綜合上述結果,自動化控制框架優化是通往更高效能、更可靠智能體系統的一條有前景的途徑。
強化學習能將擴散模型與人類偏好及任務特定目標對齊,但端點獎勵並未指明中間去噪預測應如何改變。我們提出DiffusionOPSD作為一個在策略自我蒸餾框架,將影像層級的獎勵引導轉換為在取樣查詢點上對乾淨輸出預測的明確目標。在每次外部迭代中,一個凍結的行為策略生成軌跡,並提供查詢狀態與錨點。獎勵梯度在每個錨點周圍建構有界的正目標與負目標。可訓練策略透過有限次擬合將這些目標作為分離監督來擬合,隨後指數移動平均更新刷新行為策略。此設置使我們能夠分別衡量目標建構與有限實現的效果。受控的同查詢實驗顯示,在單次擬合更新後,較大的目標建構增益不一定轉化為較大的實現增益。在SD 3.5-M與步進蒸餾的Z-Image-Turbo上,我們的方法在兩個骨幹網路與十個評估器的20組獎勵匹配設定中,於19組取得最佳最終留出分數。其表現優於最強競爭方法最多達44.0%,且相較於DiffusionNFT,訓練GPU小時數在SD 3.5-M上減少40%,在Z-Image-Turbo上減少63%。這些結果支持在策略自我蒸餾作為一種高效且可分析的擴散模型後訓練方法,透過將影像層級獎勵引導轉換為明確且持續刷新的中間監督,從而為更高效且可診斷的對齊開闢路徑。
提示注入被列為 AI 代理的第一大威脅。當代理從網站、檔案或電子郵件存取外部資料時,攻擊者可能將提示注入資料中,例如說:「忽略所有先前的指令,並執行<攻擊者的任務>。」為了防止代理被任意操控,防禦者試圖訓練安全的 LLM;然而,面對自適應提示注入,這些模型仍然承受接近 100% 的攻擊成功率(ASR)。我們注意到,這是因為現有的防禦性微調方法依賴於序列層級的回饋信號(如 DPO 或 GRPO)。將整個輸出同等對待,使模型無法精確學習哪些輸出 token 是不安全的。在本文中,我們提出安全在策略蒸餾(Secure On-Policy Distillation, SecOPD),提供 token 層級的回饋以指導防禦性微調。該 LLM 接收注入樣本並產生 rollout,其 token 由初始化模型在對應的乾淨輸入條件下進行評分。憑藉更細粒度的訓練信號,我們防禦後的 Qwen3.6-27B 在面對 SoTA 的 PISmith 自適應提示注入時達到 9.0% 的 ASR,相較之下,先前 SoTA 的 Meta-SecAlign 為 94.0%。所獲得的安全性可泛化到訓練中完全未見的領域:在代理工具呼叫中,SecOPD 達到 4.7% 的 ASR,而 Meta-SecAlign 則為 5.5%。程式碼與模型可在 https://github.com/pppyb/SecOPD 和 https://huggingface.co/pybbb/Qwen3.6-27B-SecOPD 取得。
隨著大型語言模型(LLMs)在編碼能力上的持續進步,其在網路安全領域的潛力已引起越來越多的研究關注,其中閉源大型語言模型(如 Mythos)提供了先進的網路安全能力。然而,現有的開源努力仍然有限:前沿的開放權重模型未提供可重現的網路安全訓練方案;開源訓練方案聚焦於孤立任務,缺乏可擴展的智慧體數據;而擴展智慧體滾動生成則需要強大的領域先驗。在本研究中,我們提出 CyberFactory,一個統一的開源框架,在概念驗證(PoC)生成、漏洞修補與網路安全問答(CyberQA)之間串連資料建構、軌跡合成與模型訓練。CyberFactory 將公開的漏洞工件(包括來自野外環境的 CVE)轉化為可執行且可驗證的任務實例。它進一步利用一個可重用的漏洞分析技能,引導教師模型進行原始碼檢視、以領域先驗解決問題,以及基於證據的驗證。由此產生的監督是智慧體式的:模型與工具及目標環境互動,並根據執行回饋修訂其解決方案。利用這些軌跡,我們訓練並發布了 Aegis——在希臘神話中,Aegis 是宙斯與雅典娜的防護盾牌;此名稱反映了該模型防禦性、以安全為導向的用途——該模型內化了技能引導的流程,而無需在推論時使用該技能。在 CyberGym 上,Aegis 在一小時預算內達到 52.4% 的 Pass@1,較其 Qwen 3.5 基礎模型提升 22.8 個百分點,並且在相同框架下優於所評估的通用基礎模型。
遞迴自我改進(RSI)在長時程任務中仍然困難,因為不斷增長的歷史會模糊任務狀態,並使技能調用失準。我們提出 Recuris,一種用於長時程代理框架的遞迴式經驗-工作記憶架構,其中工作記憶追蹤任務進度,並引導從經驗記憶中選擇技能,使技能的使用立足於當前需求,而非完整的歷史。這種耦合也將執行轉化為結構化證據,可將失敗定位到特定的記憶組件。在任務之間,一個固定的後設代理將這些證據轉化為對技能記憶的局部化、經驗證閘控的更新,這些更新重塑執行並產生新證據,形成一個有界的遞迴記憶演化迴圈。在四個長時程基準測試與十個模型上,Recuris 在 37 個已完成的模型-基準配對中,提升了 35 個的任務成功率,將前沿模型推向 SOTA 等級的任務成功率:在 tau-bench 上,它為 GPT-5.6 Sol 增加 +17.8 個百分點,為 Claude Opus 5 增加 +15.6 個百分點,使 Opus 5 達到 87.9%;在 SkillFlow 上,為 Qwen3.6-27B/35B 分別增加 +16.6/+13.5 個百分點。隨著互動時程的增長,優勢會擴大,在最長任務上達到 +32.2 個百分點,而常見的長時程失敗最多減少 80%。這些結果將遞迴演化記憶定位為 RSI 的可擴展基礎,使代理能夠持續將累積的經驗轉化為越來越有效的長時程行為。程式碼:https://github.com/Gen-Verse/Recuris
基於群組的強化學習方法(如GRPO)透過為每個提示採樣多個回應來避免訓練評論家(critic)。然而,一個可靠的評論家其實可以從單一回應中估計token層級的優勢,但標準的基於評論家的訓練方法往往不穩定。我們研究了這種不穩定性,並開發了**最佳實踐評論家優化(BPCO)**,這套方法結合了DPPO、受限於獎勵範圍的價值預測、蒙地卡羅價值目標、未正規化的策略優勢,以及長度自適應的廣義優勢估計(GAE)。由於評論家僅在訓練期間使用,BPCO也可以讓它依據獎勵定義資訊(例如參考答案或評分標準)作為條件,而這些資訊對策略是隱藏的。受控實驗分離了每個設計選擇的影響。在數學推理任務中,使用從1.5B參數到30B-A3B混合專家(MoE)的模型,BPCO一致地改進了一個強大的基於評論家的基線,並在每個提示僅採樣一個回應的情況下,匹配或超越了基於群組的基線。相同的方法也改善了基於評分標準獎勵的學習。這些結果顯示,精心設計的評論家為群組相對優勢估計提供了可靠的替代方案。程式碼可在 https://github.com/QPHutu/golden_critic 取得。
基於可驗證獎勵的強化學習(RLVR)與同策略蒸餾(OPD)已成為大型語言模型後訓練的兩種廣泛採用範式。然而,RLVR 存在任務層級回饋稀疏的問題,而 OPD 雖提供密集的 token 層級引導,卻忽略軌跡的正確性,導致其效能受限於教師模型。結合兩者是一個具前景的方向:OPD 提供密集的監督訊號,而 RLVR 提供任務層級的正確性。然而,現有的整合方式常依賴加權組合或啟發式切換,引入額外的超參數與取捨。我們提出「具可驗證獎勵的同策略蒸餾」(OPDVR),這是一種簡單而有效的方法,能在不增加任何超參數的情況下無縫結合 OPD 與 RLVR。我們首先根據軌跡正確性重新建構採樣 token OPD 的隱含獎勵,接著套用 ReLU 門控機制,確保正確軌跡獲得非負獎勵,錯誤軌跡獲得非正獎勵——藉此將蒸餾訊號與任務成功對齊,同時保留教師模型的分佈引導。此外,我們的修改將採樣 token OPD 轉化為正式的 RLVR 方法,使其能輕鬆與任何策略梯度演算法(如 GRPO)結合。在六個推理基準上的實驗顯示,OPDVR 持續優於標準 OPD。我們的程式碼可在 https://github.com/LeapLabTHU/OPDVR 取得。
智慧眼鏡正從拍攝與顯示配件,演進為連結人類感知、持續情境脈絡與數位或實體行動的第一人稱智能平台。其穿戴式視角與佩戴者的視覺、聽覺、動作及手部-物體互動對齊,但必須在嚴格的能耗、散熱、隱私與回饋限制下運作。儘管擴增實境、自我中心視覺、多模態模型、人機互動與具身智能進展迅速,文獻在裝置、任務與基準測試之間仍顯破碎。關鍵挑戰不在於模型能否獨立地辨識、回答、記憶或行動,而在於完整系統能否維持一個可靠、時間有效、可糾錯且可治理的感知-狀態-互動-行動迴圈。本綜述**首度以如此統一的框架系統性研究智慧眼鏡**。我們形式化第一人稱資料流與受限任務效用,沿八個可驗證的硬體能力軸刻畫裝置特性,圍繞七個相互關聯的基礎能力組織文獻,並引入涵蓋拍攝、反應式感知、情境輔助、持續狀態、受治理行動與具身耦合的L0-L5框架。在九個應用場景中,我們將任務與資料集、系統、產品、利害關係人、失效後果及證據缺口相連結。我們進一步提出九維度部署框架、以主張為條件的評估協議,以及從受控測量到縱向場域驗證與稽核的證據階梯。綜合而言,這些要素使智慧眼鏡更具可比較性、可部署性與可重現評估性,同時勾勒出邁向可信賴第一人稱智能的路線圖。
自我改進的LLM代理會完善答案,而非產生這些答案的過程。加入元層級的系統會將該層級固定不動;自我編輯的系統則必須保留部分自身編輯機制不予更動才能保持穩定,這使其所能達到的元深度上限約為二。我們提出Meta^n,將元操作固定不變,轉而對其輸入進行遞迴。該操作Ω被反覆應用於其自身的產出:讀取下方解算器堆疊的軌跡及產生這些軌跡的程式碼,然後將下一層撰寫為策略性前置處理程序與可呼叫的輔助函式庫。由於Ω從不改變,系統不會因此失去穩定性;又因輸入嚴格遞增,每一層都比前一層立於更高的視角進行推理。深度由收斂決定而非事先固定,且演化式存檔會對層級鏈進行搜尋。在兩個主幹模型上,Meta^n在全部八個基準測試家族中皆優於先前的自我改進代理。最突出的案例是ARC-AGI-2——該基準專為抵抗技能記憶而設計——Meta^n是其中唯一得分高於零的方法。消融實驗顯示,遞迴帶來的大部分增益源於每一層傳遞至下一層的條件設定,且儘管沒有任何提示加以規定,不同層級的角色仍會隨深度而湧現。程式碼見 https://github.com/minnesotanlp/meta-n
電子遊戲為視頻世界模型提供了可擴展的訓練數據來源,涵蓋多樣化的環境、複雜的交互以及豐富的真實遊戲視頻。然而,原始遊戲畫面將遊戲世界與屏幕空間界面糾纏在一起,引入遊戲特定偏差和無關動態,阻礙了世界模型的訓練。為解決這一問題,我們提出了GameUI-Taxonomy和G2WEngine——一個全棧框架,用於形式化遊戲UI的定位與移除。G2WEngine能自動從真實遊戲視頻中提取可重用UI資產,並在乾淨畫面上合成時間一致的UI疊加層。利用該引擎,我們構建了Game2World數據集,包含96K合成配對視頻(帶有精確重建目標)以及來自303款遊戲的1,079個真實場景片段,用於真實場景評估。其資產庫包含來自1,010個代表性遊戲幀的5,132個已驗證UI元素,涵蓋21個分類類別。基於Game2World,我們提出了GameCleaner——一種無遮罩的遊戲UI移除模型,結合多模態語義理解與視頻編輯能力。與基於遮罩的方法不同,GameCleaner直接識別並移除多樣化的HUD元素,同時保留底層場景內容和時間動態。在一項受控試點實驗中,使用無UI遊戲畫面訓練的世界模型,其整體VideoReward比使用帶UI疊加數據訓練的模型高出6.83%。在UI移除評估中,GameCleaner在合成視頻上達到了95.36的平均AAR,比最強的時序遮罩基線高出57.3%,並在真實場景中取得了最佳的80.05 AAR,背景保留率達99.8%。這些結果展示了將互聯網遊戲視頻轉化為高質量世界模型訓練數據的巨大潛力。代碼、數據集和模型將在https://github.com/Dongping-Chen/Game2World提供。
我們提出 LAION-BVD,一個用於多模態學習的大規模開放影片資料集,其中包含從 CommonCrawl 收集的 13 億個平台特定影片 URL。我們從中下載了 8,000 萬支影片,總時長達 1,000 萬小時。該資料集專為跨影片、音訊與影像模態的多模態預訓練而設計。利用內容感知場景偵測,我們提取片段,並針對這些片段合成生成影片與音訊的文字描述。在這些資料上訓練的模型於標準的影片-文字及音訊-文字基準測試中取得具有競爭力的表現,且隨著訓練規模或模型規模的增加呈現一致的改進。此外,我們透過提取場景變換幀,探索將影片幀作為影像-文字資料的替代來源。這些幀展現出與標準網路影像語料庫不同的視覺分佈,而在該資料集上訓練的模型亦達到優異的影像-文字檢索效能。我們將 LAION-BVD 釋出予研究社群,以前所未有的規模大幅擴展多模態影片的開放取用。
機器翻譯對遮罩擴散語言模型(dLLMs)構成考驗,因為每一個來源詞元都必須被忠實地呈現;而固定畫布解碼必須在去噪前先選定目標長度。現有的遮罩擴散解碼研究主要探討詞元的解遮罩順序,卻對這個直接影響涵蓋度與冗餘的長度決定著墨甚少。我們提出 Entropy-Valley(EV),一種免訓練的長度選擇器,它透過全遮罩前向傳遞的平均預測熵來評分候選目標畫布,並選擇骨幹模型最有把握填滿的畫布。相較於使用訓練語料長度統計的基線,EV 在 EntoZh、ZhtoEn 與 EntoDe 上分別恢復了參考目標長度所帶來之 COMET-22 增益的 64.9%、65.3% 與 33.0%。我們的診斷顯示,有利於去噪的長度不必與參考長度相符。三位翻譯專家進行的評估支持英中(En↔Zh)方向的充分性增益,其中在 ZhtoEn 上的證據更為明顯。與使用相同微調資料訓練的 LLaMA-3-8B 自迴歸(AR)模型相比,EV 系統在 EntoZh 上持平,在 ZhtoEn 上領先;一項以 oracle 長度進行的診斷進一步顯示,在此遮罩擴散機器翻譯設定中,先揭露哪些詞元的決定,其影響不如目標長度的提供方式來得重要。
以結果監督的搜尋代理學會何時及如何檢索證據,但最終獎勵既無法定位中間錯誤,也無法在這些錯誤累積之前引導進行中的軌跡。將矯正性回饋視為一種在軌跡內學習的介入,結合了兩個角色:代理必須決定何時請求並使用回饋,而評論者必須從受到結果混淆的展開中推斷有用的修正,這些展開的失敗模式會隨著代理的進步而改變。我們提出 CAFE(耦合代理-回饋演化),這是一個共享參數模型在搜尋代理與評論者角色之間交替的框架。CAFE 從圍繞基礎代理自身失敗所建立的軌跡中初始化以回饋為條件的恢復,然後耦合線上與離線最佳化。在線上強化學習期間,比較式回饋估計利用提示層級的呼叫-跳過成功差距來塑形請求回報,而回饋感知的優勢塑形則在回饋前後重新加權詞元優勢。在離線部分,從展開衍生的偏好最佳化從配對的成功與不成功軌跡中學習回饋。在七個代理式搜尋基準上,CAFE 平均表現優於所評估的基於強化學習的搜尋代理,在所有六個跨域基準上保持其優勢,並減少答案層級的幻覺。單側消融顯示,僅改善代理或僅改善評論者最終都會趨於平緩,而交替進行這兩種更新則持續提升效能。這些發現表明,自我改進的搜尋代理需要與其所引導的策略共同演化的回饋。
並發多智能體編碼承諾在模組間實現分工、透過冗餘提供穩健性,並在多檔案專案的自然粒度上進行平行探索。即時協作編輯協定透過無衝突複製資料型別(CRDTs)為人類團隊解決了這個協調問題,但底層的 LLM 一次只產生一個 token,現有的多智能體編碼系統繼承了這種序列限制:它們要麼透過階段交接依序安排智能體,要麼在沒有協調的情況下匯集獨立樣本,而單一智能體會以單一檔案的存根並退出(stub-and-exit)的方式放棄多達一半的困難任務。AgentRoom 是一種用於並發編碼智能體的即時協作編輯協定。其執行時層在 CRDT 合併的共用檔案系統上,將檔案層級的聲明、狀態和廣播以 MCP 工具的形式暴露出來。五個前沿的編碼-CLI 模型執行了四個後端編碼任務,並在 Python DevBench 和 Rust+axum 中進行跨語言檢查。對於 CLI 穩定的模型,配備 2 個智能體的 AgentRoom 比 Solo 放棄更少的任務,且執行間變異更小。在匹配的計算資源下,一項平均為正的 LLM 評判對比使 AgentRoom 勝過平行合併(parallel-merge)。另一個對比,即捆綁探測(bundle probe),使完整的 AgentRoom 優於每個部分案例:這是一種排序而非百分比的分配。承擔重擔的是協調,而非平行處理或 CRDT 合併。
基於LLM的智能體執行多步驟任務,但其行為結構仍然不透明:冗長的非結構化軌跡阻礙了部署所需的安全審計與運行時監控。現有方法以逐軌跡或僅限成功案例的方式運作,因而錯失連結下一步預測與失敗預測的跨運行拓撲結構。為還原此一共用結構,我們將整個軌跡語料庫壓縮為單一緊湊的有限狀態機(FSM),作為LLM智能體原本不可預測行為的結構基底。在十二個公開資料集上,該FSM保持緊湊(7至43個狀態),以≥0.997的適應度重放留出資料,各分割間呈現近乎相同的拓撲結構,且建構僅需毫秒。此基底同時達成兩項預測目標:就下一步預測而言,FSM狀態上下文在所有真實標註配對的資料集上均優於智能體工作流記憶(Agent Workflow Memory);就失敗預測而言,逐狀態行為特徵在留出資料上可達0.94的AUROC,且在線監控器僅憑部分軌跡即將失敗運行排序於成功運行之上,遠在任務完成前觸發提前停止。由此可見,行為拓撲受部署框架的形塑程度更甚於LLM本身,為安全審計與運行時監控提供了與模型無關的結構原語。
工業推薦系統通常採用級聯式的召回、排序與重排管線。儘管這些管線高效,但它們使資訊與目標在各模組間碎片化,依賴僵化規則,且對即時意圖的感知有限,導致瀏覽、比較與購買之間的會話級轉換未獲充分處理。我們提出DREAM(Developing Recommender Engine with Agentic Methods,即以智能體方法開發推薦引擎),這是一種自主最佳化控制架構,在不取代現有管線的前提下,於其上增加一層具感知能力、可編排且可審計的策略層。DREAM包含兩大核心組件。第一,三層意圖引擎(Intent Engine)將設備端信號融合為結構化的L0/L1/L2意圖表徵;其邊雲觸發鏈將上報量降至約8.7%。第二,元引擎(Meta Engine)利用元模型進行M1→M2→M3的分層推理:意圖摘要、由策略記憶(Strategy Memory)輔助的策略規劃,以及參數轉譯。元引擎透過具安全護欄的統一出入口分發所產生的參數。獎勵雙迴路(Reward Dual Loop)將離線模擬與線上回饋相結合——前者用於策略空間探索,後者用於結果校準——持續最佳化上述兩大組件,形成生成、執行、評估與經驗累積的閉環。淘寶首頁資訊流上的大規模A/B測試表明,僅對重排進行控制即可使IPV提升2.06%、核心IPV提升2.39%、GMV提升0.88%;將控制範圍擴展至精排後,上述增益分別提升至2.71%、3.06%與1.31%,同時PV持續提升超過1%。上述增益既無需更換管線模型,亦不損害服務穩定性,支持智能體式元控制作為工業推薦系統的一種可行範式。
大型語言模型(LLM)代理透過多角色、多階段的工作流程協調複雜任務。上游狀態會反覆轉換為中間語言工件,例如摘要、計畫、工單、記憶與交接備註,下游元件再據此行動。對於約束行動的狀態而言,僅有主題保留並不足夠:工件可能提及某個未解決的條件,卻同時將其從執行前必須解決的要求,變成可能僅供下一步行動參考的資訊。我們將這種行動綁定角色視為操作狀態保留來研究。安全阻斷器提供了一個受控實例,因為每個來源狀態都有明確的先決條件、權限、後備方案與執行後果。我們以正確的上游識別為條件,變化交接轉換方式,並評估一個僅能使用所產生工件的執行器。在1,296個受控合成情境中,直接交接的對照條件保留了每一個阻斷器,而壓縮、計畫同化、收斂、所有權遞延與先例替代則反覆將具約束力的狀態轉變為警示或非約束性考量。一般的交接壓縮會導致100.0%的失活與54.2%的禁止動作。恢復全部四個狀態欄位可將保留率提升至100.0%,並將禁止動作降至0.0%。固定工件介入措施進一步區分了保留與遏制:下游驗證消除了禁止動作,但工件失活率仍維持95.3%。這些結果揭示了資訊提取與行動之間存在狀態傳輸失敗。交接轉換可以保留狀態內容,同時削弱其對下游行動的約束力。語義可用性並不能保證操作狀態的保留。
形態學變換長期以來是形狀與遮罩處理的重要工具,但 Python 生態系統中事實上的參考實作 scipy.ndimage 僅限 CPU、僅支援單一陣列,因此若無昂貴的裝置到主機(device-to-host)往返,便無法在 GPU 訓練迴圈中使用。建基於 PyTorch 的 GPU 視覺函式庫僅涵蓋這些運算子的一小部分,且通常受限於二維空間與平面結構元素。我們提出 TorchMorph,這是一個輕量級 PyTorch 擴充套件,用以填補此缺口。TorchMorph 提供 22 個公開運算子,涵蓋二元形態學、灰階形態學、精確與近似距離變換,以及熵正則化最佳傳輸;這些運算子均以融合的 CUDA 內核實作,可直接操作 (B, C, Spatial...) 形式的 CUDA 張量,最多支援八個空間維度。其 API 特意與 scipy.ndimage 逐參數對應,包括邊界模式、結構元素原點以及預先分配的輸出,因此現有流程只需更改 import 即可移植。我們描述了分層架構以及每個運算子系列背後的內核設計。與單執行緒 CPU 參考實作相比,批次執行在灰階形態學上可達 scipy.ndimage 的 1.1e3 倍吞吐量,在精確歐幾里得距離變換上最高 350 倍,而 Sinkhorn 求解器比 POT 快最多 42 倍。二元運算子與倒角運算子與 SciPy 的對應函式完全一致,所有浮點數運算子與 CPU 參考實作的絕對誤差皆在 1.8e-6 以內。TorchMorph 以 MIT 授權釋出,網址為 https://intcomp.github.io/tm。
程序性視頻語言模型必須從相同的視覺證據中解決異構任務,包括動作識別、未來預測和程序預測。密集Transformer解碼器在不同任務之間共享相同的前饋網絡,這可能糾纏任務行為,並使受控的能力擴展變得困難。稀疏混合專家(MoE)解碼器提供條件計算,但token級學習路由與任務級程序目標並不能自然對齊。我們提出MoTE(任務專家混合),這是一種解碼器架構,將大語言模型的前饋網絡轉換為任務特定的專家,同時保持多模態骨幹共享。每個樣本遵循一條樣本級任務路由,因此活躍的任務專家計算量與所存儲的任務專家數量無關。我們將此設計實例化為VideoLLM-MoTE,並在五個COIN基準上使用顯式任務路由對其進行評估。該五專家模型每個樣本激活約20億個LLM參數,並實現了比近期VideoLLM基線更高的平均top-1準確率。在相同的專家拓撲下,它優於密集的全專家激活和學習的稀疏路由控制。這些結果表明,任務結構化路由為多任務視頻語言學習提供了一種可解釋且計算高效的解碼器替代方案。
我們研究 Station 中的自主數學發現,這是一個開放世界多智能體環境,來自不同模型家族的 AI 智能體在沒有中央協調者或腳本化管線的情況下,追求共同的研究目標。智能體自行選擇研究方向、進行實驗、相互協作,並建立共享的科學文獻。在來自 AlphaEvolve 目錄的 12 個構造問題以及另外兩個案例研究中,Station 在五個問題上取得了相較於先前文獻的新穎結果:新的有限域 Kakeya 集合無限族、第 11 維中新的精確 604 點接吻構形、離散化 Kakeya 針問題與符號不確定性問題的新紀錄,以及對 Erdős 最小重疊問題大幅改進的下界。智能體還發現了 Book 拉姆齊數的新無限族。重要的是,智能體不僅產出數值構造,還產出解釋這些構造如何運作的定理與分析,使結果更具可解釋性,也讓數學家更容易在此基礎上進一步研究。我們公開所有原始智能體對話、證明與驗證程式碼,提供這些發現如何產生的透明紀錄。
大型語言模型在程式碼生成方面表現優異,然而競賽程式設計揭示了持續存在的失敗模式:現有的多智慧體管線將工作分配給通用的規劃者、編碼者和除錯者角色,並將演算法技術的選擇完全交由骨幹模型決定。我們提出 MARS(專業化大型語言模型的多智慧體接力),這是一個僅依賴提示的框架,其中每個智慧體都是主題專家——涵蓋動態規劃、圖論、字串、幾何等——並透過基於演算法理論語料庫的檢索增強生成來奠定基礎。面對一個問題時,檢索程序會選出一小隊相關專家;起始者撰寫初始的 C++17 解決方案,而後的每一輪都會在沙盒中針對公開範例執行候選方案,讓當前活躍的專家保留、修復或轉交草稿,並將結構化封包轉發給下一位專家。最後,透過單一回合的基礎設施修復程序正規化樣板程式碼。在 CodeContests 測試集上搭配 Gemma 4,MARS 達到 0.624 ± 0.006 的通過率,每項任務記錄了 2.3 個管線階段(相較於直接提示提升 14.4 個百分點),並以低 3.3 倍的實際運行時間成本和明顯更小的每任務 token 花費變異,縮小了與 CodeSIM(0.731)之間的大部分差距。原始碼可在 GitHub 取得:https://github.com/fckand/mars。
世界動作模型(WAM)透過建模觀測如何演進來改善機器人控制,但在測試時生成未來觀測會帶來可觀的延遲。Fast-WAM 為提升效率而移除此過程;然而,我們匹配的實作顯示,Fast-WAM 的泛化能力低於具未來感知的替代方案,特別是在機器人示範稀少與分布外情境下。為填補此差距,我們提出 **LAWA**,一種 WAM 架構,使用緊湊的潛在動作作為未來意圖的操作性表徵,使其能在不生成未來觀測的情況下,於測試時進行高效的未來想像。具體而言,由無動作預訓練增強的離散分詞器,會產生以操作為中心的碼本目標。LAWA 聯合去噪一個錨定於這些目標的連續潛在狀態與可執行動作片段,同時在推論時省略未來影片分支。在 RoboCasa 上,LAWA 在少樣本與完整資料設定中分別達到 65.6% 與 80.8% 的當前最佳平均成功率,較匹配的 Fast-WAM 基線提升 9.6 與 4.5 個百分點。它也維持與匹配之 Joint-WAM 變體相當的效能水準,同時需要降低 42.9% 的推論延遲。LAWA 亦在 LIBERO-Plus 上展現具競爭力的零樣本穩健性,並在真實世界任務中表現優異。這些結果顯示,未來想像無需被捨棄:以緊湊潛在動作保留它,可在效能、泛化與延遲之間取得有效取捨。程式碼與模型將予以釋出。