每日精選AI研究論文及翻譯
迴圈工程(Loop Engineering)正逐漸成為一種圍繞編碼代理組織開發工作的實務做法。與其逐一手工編寫提示詞,從業者設計迴圈來監控進度、分配工作、執行檢查,並決定代理下一步該做什麼。即使擁有能力強大的編碼代理,迴圈仍可能信任過時的進度記錄、跳過必要的驗證、將預算浪費在錯誤的方向上,或在任務尚未達到可安全提交的狀態前就提前停止。然而,單次端到端執行的最終結果無法分辨成功或失敗究竟反映了迴圈的引導能力,還是編碼代理執行任務的能力。我們提出 LoopArena,一個用於評估單一模型能否妥善引導另一個獨立編碼代理完成長時間執行任務的基準。受評估的模型稱為控制器(Controller):在每一輪編碼結束後,它接收執行的結構化摘要,指示另一個固定的獨立編碼代理——工作代理(Worker)——接下來應執行或驗證什麼,或決定是否停止。LoopArena 在三個執行範圍與成本各異的互補設定中評估此能力。Type I 透過經執行驗證的問題,對下一步迴圈合約(Loop Contract)的選擇進行評分,評估時無需實際執行工作代理。Type II 對完整任務的選定片段執行重複控制,而 Type III 則從任務的原始狀態評估配對的完整任務。在完整任務上,觀察到的最佳嚴格成功率(Strict Success Rate)為 24.69%,顯示長時間跨度迴圈控制仍有大幅改進空間。在各個控制器之間,估計推論成本的配對平均降低幅度為 64.4%,且 Type II 在主要核心指標下產生了相似的排序(斯皮爾曼 ρ=0.9747)。我們在 https://github.com/AMAP-ML/LoopArena 發布基準資料與評估程式碼。
賦予大型語言模型(LLM)多輪工具調用能力,對於構建自主智慧體(autonomous agents)至關重要。然而,該領域的進展從根本上受到對全長軌跡模仿(full-length trajectory imitation)之依賴的限制。對於涉及多個順序無關之子目標的任務,最優解空間會形成一個龐大的組合鑽石晶格(combinatorial diamond lattice)。將這種豐富的拓撲結構強行壓縮為單調的軌跡,會導致嚴重的拓撲坍縮(topological collapse),不分青紅皂白地懲罰合理的替代性探索路徑,並嚴重削弱策略多樣性。為了解決這一問題,我們提出了 DART-SD(Diamond-topology Aware Retrieval and Tuning for Self-Distillation,基於鑽石拓撲感知的檢索與自蒸餾調優),這是一個新穎的框架,將範式從全局強制轉變為拓撲引導的局部修正。DART-SD 首先將執行過程建模為一個收斂的交互狀態轉移圖(Interaction-State Transition Graph, ISTG),忠實地捕捉成功與失敗探索路徑中所蘊含的鑽石拓撲結構。在自主滾動(autonomous rollouts)過程中,該框架會識別關鍵拓撲斷點(Critical Topological Breakpoint, CTB),並檢索由成功經驗支持的恢復參考。最後,我們通過 CTB 引導的局部監督引入了一種漸進式自蒸餾範式,確保訓練損失僅在生成的恢復步驟上計算,同時嚴格保護有效的推理前綴免受破壞性梯度更新的影響。在複雜多輪工具調用基準上的實驗表明,DART-SD 顯著優於傳統的全軌跡基線方法。
擴展機器人數據對於建構通用視覺-語言-動作(VLA)模型至關重要,然而機器人的軌跡數據比網路規模的圖像-文字數據更難擴展,因為具身數據收集成本高昂且對物理世界的覆蓋稀疏。這使得表徵品質成為核心瓶頸:在固定機器人數據預算下,持續預訓練必須將有限的軌跡轉化為可遷移的視覺-動作知識,而非僅僅擬合動作。我們提出VLAct,一個面向VLA的視覺語言模型(VLM)骨幹網路,在任務特定微調之前,先於廣泛、異構、多本體的機器人數據上進行訓練。VLAct透過VLM先驗保留、多頭連續動作聯合監督以及部分統一的跨本體動作佈局,保留了廣泛的VLM先驗並鼓勵跨本體的共享動作語義,同時允許在微調階段使用任務特定的動作頭。在模擬、真實世界以及未見本體遷移等場景中,VLAct在固定微調協議下持續提升下游效能。在LIBERO-Plus和RoboTwin 2.0上,VLAct超越了包括ABot-M0和LingBot-VLA在內的工業級VLA系統,成功率分別達到82.6%和92.5%。在RoboDojo上,VLAct的成功率在所有策略中排名第六,並在兩項指標上均超越了所有明確指定的世界動作模型(WAM)參賽作品。最值得注意的是,在未見人形本體RoboCasa-GR1上,僅使用20%下游軌跡數據的VLAct便超越了使用完整數據的GR00T-N1.6基線。這些成果完全基於開源數據,且僅需16顆GPU的訓練配置即可達成,顯示以表徵為中心的持續預訓練能在適度的計算預算下帶來極具競爭力的效能,且是VLA進展中獨立於數據擴展之外的重要軸線。
生成式模型能將自然語言提示轉化為圖像、文字、程式碼及其他內容,從而降低草稿與元件產製的成本。其實務影響力日益取決於這些片段能否成為完整且可靠的交付成果。本調查檢視「代理式成品創作」(agentic artifact creation),我們將其定義為一種具狀態的建構過程:在此過程中,AI 系統實質地建構或修訂交付成果,且中間觀測結果會引導後續工作。就功能而言,此過程連結了成品的作業表徵、建構策略,以及執行期驗證——其回饋可導引後續動作。我們審閱了截至 2026 年 8 月 20 日可取得的 259 篇文獻:其中 230 個系統符合此定義,另有 29 個代理式成品建構之衡量基準。我們比較了六個成品類別,再分別就應用情境與評測實務兩個面向進行分析。跨類別而言,建構挑戰不僅反映模態差異,也反映決策之間的耦合緊密程度,以及失敗在仍可修復時是否會顯現。分解雖可降低局部複雜度,卻會增加協調與重組的成本。當學習式評判器與生成器共享相同的偏好或盲點時,其所能提供的獨立證據可能相當有限。我們提出若干原則,以確保承諾與責任的明確性、將回饋轉化為標靶式修復,以及在變更後重新驗證受影響的狀態。我們亦指出在成品、創作者意圖與建構系統持續演進之際,維持連貫且可課責之控制的可能性。完整的論文清單請見 https://github.com/GeminiLight/awesome-agentic-artifact-creation。
物理理解與推理依賴於對世界形成緊湊且可泛化的表徵。儘管現代的視覺-語言模型能夠辨識並解釋多樣化的物理事件,但它們往往缺乏對底層機制的顯式表徵——例如物體狀態、物理參數以及支配動力學——而這些正是可靠推理世界如何演化以及如何回應干預所需的。在本工作中,我們提出「代碼即世界」(Code-as-World),一種透過可執行的世界表徵來表示物理世界的範式。透過將物理組成、動態演化與視覺外觀表達為可執行程式碼,Code-as-World 提供了對物理世界的一種緊湊、具量化基礎且可控的抽象。為了從多模態觀測(例如自然語言描述或真實世界影片)中建構此類表徵,我們開發了一種受溯因推理啟發的智能體驅動發現迴圈,其中智能體提出、執行、渲染、驗證並迭代精煉可執行的世界假設。作為一項具體應用,我們使用經過驗證的可執行世界來提供可擴展的物理監督,以訓練視覺-語言模型進行定量物理推理。實驗表明,Code-as-World-VL 在 QuantiPhy 上達到了最先進的性能,並超越了領先的專有模型,凸顯了可執行世界表徵作為物理智慧可擴展基礎的潛力。
自我演化語言模型近來已成為通往超級智能的一條極具前景的途徑,其優勢在於能降低人工監督的成本。儘管在可驗證領域已取得相當進展,自我演化在不可驗證領域中的探索仍明顯不足。我們提出了「零資料裁判共同適應」(Judge co-adaptation from Zero data, J-Zero)框架,這是一個統一的「挑戰者—求解者—裁判」共同演化架構,可同時支援兩大領域的自我改進。挑戰者與求解者透過對抗性互動共同演化:挑戰者生成難度漸增的任務,而求解者則學習產出更高品質的回應。與此同時,裁判透過偏好對進行共同適應,這些偏好對的排序在生成階段即已事先確定,係根據各回應的產生方式而定,亦即求解者的答案優於挑戰者的答案,以及求解者分解再重組後的答案優於其單次生成的答案,而非依賴裁判自身的評分。J-Zero在可驗證領域平均領先基線模型4.2分,在不可驗證領域平均領先8.0分,且至少可持續改善十次迭代,而基線模型在兩次迭代後即開始衰退。
語言模型預訓練幾乎已成為高昂成本的代名詞,使學術界與開源社群中的大部分研究人員難以企及。儘管目前已存在强大的開源成果,包括開放權重模型與開源訓練配方,但一個兼具成本效益、硬體可及性與開源特性的預訓練配方長期以來仍然缺失。即便在小規模下,訓練 Llama-3.2-3B 的成本即超過 150 萬美元,而複現 SmolLM3-3B 也需要超過 70 萬美元。在本報告中,我們提出了一套旨在降低這道門檻的開放預訓練配方。利用此配方,我們在消費級 RTX 5090 GPU 上,以 FP8 精度從零開始訓練了一系列 Puro-2B 模型,涵蓋多達 1.4 兆個 token。該系列中的模型在 token 預算與所選配方變體上有所不同。我們的最佳模型以低於 6,900 美元的計算成本完成訓練,在我們的評估協議下性能接近 Qwen2.5-1.5B。這種成本效率得益於多種方法的結合,包括硬體選擇、低精度訓練、超球優化、課程模型平均以及資料配方。除了配方本身之外,我們還提供了兩項額外的成果。首先,我們在整個 Puro-2B 系列上推導出「Puro 成本擴展定律」,用以關聯訓練成本與模型平均性能;擬合結果顯示,約 4,400 美元(低於 5,090 美元)的成本即足以達到 Qwen2-1.5B 的性能。其次,作為一項端到端案例研究,我們考察了預訓練資料課程如何影響後訓練之後的下游性能。此類受控研究之所以可行,是因為我們能夠取得完整的預訓練管線,而非僅有模型權重。我們在 Apache 2.0 許可下,於 https://huggingface.co/collections/thu-pacman/puro-2b 發布了 Puro-2B 的完整訓練配方,包括資料、程式碼與模型權重。
從極長影片進行串流式3D重建需要在有界記憶體與運算下,線上估計相機運動與場景幾何。早期的串流模型利用有限的上下文緩衝區或緊湊的循環狀態,實現因果且有界成本的推論,但其估計往往隨著序列增長而退化。近期方法透過將短程上下文與持久性或多層級長程記憶結合,提升了長時程穩定性。我們採取不同的途徑:我們保持學習的時序狀態嚴格局部化,並建構目標與序列長度無關的預測。我們提出ABot-Recon,一個簡單的串流模型,僅快取前11幀的KV特徵。它預測當前相機座標系中的點圖以及相鄰幀的相對姿態。這些預測在參考幀變換下保持等變,全局姿態與幾何透過序列組合恢復。為了減少累積漂移,輕量化的時序精化器利用近期視覺與運動上下文改善相對旋轉,同時組合感知姿態損失監督多步姿態組合。在具挑戰性的長序列基準上的廣泛評估,證明了我們局部上下文方法優越的長時程效能。在Oxford Spires上,ABot-Recon達到了4.35公尺的ATE與0.12度的RPE-R,相較於先前最佳結果,兩項誤差均降低了約40%。
我們提出 StarHarness,一個在保持模型權重不變的條件下演化環境特定代理執行框架的框架。演化後的執行框架可包含提示與任務表述、工具介面、技能、由 MCP 支援的提供者、子代理結構,以及代理迴圈配置。StarHarness 根據基線失敗行為對任務進行分層,建構出精簡的演化池;它將提議者可見的搜尋任務與對提議者隱藏的選擇任務分開,並保留一組留出任務以評估泛化能力。在 ITBench SRE、EnterpriseOps-Gym ITSM 與 AutomationBench Finance 中,每個環境在接受 4 至 12 次變更後,執行框架演化將完整基準測試的效能相對於預設執行框架提升了 20 至 35 個百分點。這些增益在未參與演化的任務上持續存在,且無需重新演化即可遷移至 GPT 與 Qwen 模型系列。追蹤分析將這些改進與介面修復、環境慣例,以及能壓縮搜尋空間的運維知識聯繫起來;在若干情境中,這也伴隨著更少的假陽性診斷與更短的軌跡。因此,StarHarness 提供了在工具密集型企業任務中減少模型與環境之間持續不匹配的實用途徑。
視覺-語言-動作(VLA)模型能將多模態情境轉化為機器人動作,但其動作解碼器在很大程度上仍透過行為克隆來訓練。這種方式監督了被示範的馬達指令,卻隱含地忽略了該行為在指令下所服務的局部目標。基於未來的監督學習透過幀、潛在觀測、軌跡或運動表示來豐富動作學習,但這些訊號捕捉的是可能發生的特定實現方式,而非即將到來行為的共享語義目標。我們提出意圖蒸餾(INDI),將行為層級的意圖蒸餾進動作解碼器。在訓練期間,一個凍結的教師視覺語言模型從當前觀測、指令、粗略動作摘要及對應的執行影片中解讀示範片段。部署中的VLA則從其標準輸入中,在解碼器的中層恢復出相應的多模態意圖表示,並利用它結合行為如何展開及其達成結果的表示來組織動作預測。在SimplerEnv-Bridge上,INDI將GR00T-N1.7從64.3%提升至84.7%;在RoboCasa Kitchen上,其將受控的GR00T-N1.7基線從64.1%提升至70.3%,且在兩個基準上對π_{0.5}均取得一致的增益。在真實世界任務中,INDI將平均成功率從62.0%提升至68.7%,在長期任務上提升達12.0個百分點。進一步分析顯示,恢復出的潛在表示確實被解碼器所使用,能捕捉行為目標與執行進度,並以依賴目標的方式組織後續預測。這些結果表明,對所生成行為的語義目標進行顯式建模,能有效提升動作解碼器的效能。
自迴歸影片擴散透過從有限的近期上下文生成片段,實現可擴展的長影片生成。雖然基於近期性的快取能保持局部連續性,但當主體、物體、場景或屬性重新出現時,它會逐出所需的歷史線索。現有的記憶機制讓模型得以接觸非局部歷史,但僅有存取並不能確保有效利用。我們的分析揭示,影片DiT層對當前、近期與遙遠上下文表現出不同的偏好,這表明長程記憶需要同時決定檢索什麼以及在何處使用。我們提出LayerRecall,這是一個以當前狀態為條件、具層級選擇性的記憶路由器,它檢索相關的歷史K/V狀態,並僅將其注入主幹網路特有的記憶敏感層,同時在其他層保留局部注意力。為了減少對稀缺的高品質長視野影片及明確記憶配置標籤的依賴,我們進一步提出跨視野預測匹配(CHPM),該方法在預測空間中使用特權長上下文參考來監督有限記憶路由器。在100個多鏡頭評估提示中,LayerRecall在MemoBench和MovieBench上取得最佳整體結果,同時在VBench-Long上與其主幹網路表現相當,展現了在不犧牲局部連續性的前提下更強的長程恢復能力。定性分析進一步揭示記憶引導的自我修正機制,即最初不匹配的局部屬性會恢復至其歷史外觀,同時不會重置正在進行的運動或場景結構。額外分析顯示其具備跨主幹網路的可攜性以及可忽略的推論開銷。
遞迴快速權重記憶與選擇性狀態空間模型將不斷擴展的上下文壓縮為固定大小的遞迴狀態,使狀態轉變成爲一種在線學習規則。我們在讀後寫自迴歸語義下研究此規則。對於此處考慮的前綴預測目標,步驟 \(t\) 揭露的局部快速記憶樣本是前綴對齊對 \((x_t, y_t) = (\phi(k_{t-1}), v_t)\)。常見的同步驟關聯 \((\phi(k_t), v_t)\) 保持因果性,但優化的是不同的內部目標。我們推導了平方誤差迴歸與負內積目標的歸一化一階更新。迴歸家族包含 Falcon-1(純量 NLMS 更新)、Falcon-2(其逐列擴展)以及 Falcon-3(滑動視窗小批量更新);Falcon-1A/Falcon-2A/Falcon-3A 是對應的內積變體。我們提供了遞迴、遮罩平行與區塊平行形式,以及數值穩定的正衰減重整化。具代表性的變體在語言建模中保持競爭力,並改善了可變位數加法上的長度外推。此框架在遞迴序列模型中分離了時間對齊、可塑性、遺忘與有界複述。
長視域代理任務要求大型語言模型(LLMs)在多輪互動中反覆檢索、整合並維護分散的資訊,但保留所有互動歷史會導致工作上下文持續增長。近期的主動式上下文管理方法允許模型透過專用工具編輯自身的工作上下文,但仍面臨三個關鍵限制:(1)工具集有限,僅限於搜尋、刪除和摘要,不支援全局規劃、長期記憶和自適應壓縮;(2)探索效率低下,將上下文管理動作視為同質處理,儘管它們對最終結果的影響具有異質性;(3)粗粒度的信用分配,在強化學習期間將最終的軌跡層級獎勵分配給所有中間的上下文編輯動作。為填補這些差距,我們提出了ContextPilot,一個用於長視域代理推理的主動式上下文管理框架。我們的方法系統性地擴充工具集,納入規劃、長期記憶和軟性上下文卸載工具。我們進一步提出了一種專為上下文管理設計的強化學習方法,該方法利用上下文與熵的變化來識別關鍵的編輯決策以進行分支採樣,並從所有通過對應上下文編輯動作的分支軌跡中估計動作層級優勢。在長上下文問答和深度搜索任務上的實驗表明,ContextPilot以更緊湊的工作上下文實現了更強的效能,在各種基礎模型和基準上 consistently 優於現有基線方法。程式碼可在 https://github.com/Tencent/ContextPilot 取得。
時空影片定位(STVG)要求模型識別所指事件發生的時間,並在該時段內定位目標實體。現有的多模態大型語言模型通常以自迴歸方式序列化稠密定位軌跡,導致解碼延遲隨時空管長度增加,並使定位誤差隨時間傳播。我們提出並行時空管解碼(Parallel Tube Decoding, PTD),這是一種生成式框架,將定位分解為一個時間區塊,後接多個時間條件化的空間區塊並同時解碼。這同時消除了標記層級與軌跡層級的依賴,將順序解碼深度降至固定的 1+1 輪,且與時空管長度無關。為實現並行空間生成,我們引入解耦區塊注意力(Decoupled Block Attention),在保留共享影片-查詢上下文存取的同時消除跨框依賴,並搭配針對時間邊界與空間幾何的定位感知策略最佳化。在 VidSTG 上,與標準自迴歸解碼相比,PTD 將時空管完成延遲降低 79 倍,空間解碼吞吐量提升 92 倍,同時也提升定位準確度。在緊湊型 4B 骨幹下,我們的模型在 VidSTG 與 HC-STVG 上表現良好,並能零樣本泛化至時間定位、定位式影片問答及指稱性影片物件追蹤。我們的結果顯示,並行時空管生成是影片中自迴歸定位的一種高效且有效的替代方案。
事實問答(QA)通常假定存在單一標準答案,因而掩蓋了大型語言模型(LLMs)是否保留長尾事實分歧敘述的問題。為填補此缺口,我們提出 ElephantBench,這是一個包含 1,094 道問題的閉卷知識探針,透過可稽核的圖形化管線生成。該管線從低曝光度的網路語料庫中檢索相關文件,辨識自然發生的分歧,並將其轉化為多敘述問答紀錄。每個答案都會對照原始文件與權威的公開網路來源進行驗證,再由人工標註者審查。在 32 個模型中,即使是最強大的模型,也僅在 52.4% 的問題上能還原兩種敘述;而在其餘幾乎所有問題中,它只記得一種敘述,卻遺漏另一種。擴大模型規模與增加推論時的推理能提升召回率,但無法消除這種不完整性。語料庫分析進一步顯示,曝光不平衡有利於主流敘述,而少數方曝光度越高,則與更完整的召回表現相關。這些發現確立了 ElephantBench 作為可重現的知識探針,用於診斷參數化記憶中的認知近視。更廣泛而言,我們基於圖形的基準建構管線提供了一種高效且可擴展的方式,能將長尾語料庫轉化為可追溯來源的知識探針,以支持評估與提升下一代大型語言模型認知嚴謹性的相關工作。程式碼已公開於 https://github.com/Tencent/ElephantBench。
基於LLM的智能體可以透過工具調用與外部環境互動,但此能力也引入了安全風險,例如檔案修改、資訊洩露與未授權操作。現有的護欄機制通常評估已完成的軌跡,導致步驟級動作的執行前監控仍未獲充分探索。我們提出StepGuard,一種步驟級護欄模型,既能審計已完成的智能體軌跡,也能在工具動作執行前進行檢查。為訓練StepGuard,我們引入StepGen,一個自動化資料引擎,可生成具有相同上下文但在風險步驟採取不同動作的安全與不安全軌跡。為進一步減少過度防禦與防禦不足,我們提出Balance-GRPO,該方法根據安全與不安全動作的觀測準確率,動態平衡對兩者的學習。實驗結果顯示,StepGuard在開放權重護欄模型中達到最高平均準確率,效能可與GPT-5.4相匹敵。在AgentDojo與AgentDyn上守護智能體時,相較於無護欄設定,StepGuard將平均攻擊成功率降低了77.3%,而平均效用僅下降2.8個百分點。
由於二次複雜度注意力(quadratic attention)的特性,大型語言模型(LLM)會消耗大量記憶體與能源。每增加一個新詞元,成本都比上一個更高。每個額外詞元的鍵(key)與值(value)都必須無限期地儲存在記憶體中,這是不可持續的。 為了解決二次方縮放(quadratic scaling)問題,已有數種替代方案被提出,其中之一是將 LLM 改造為使用線性注意力。鑑於此方法有望以低成本解決二次方縮放問題,同時維持最先進的效能,這個想法已吸引大量關注。然而,此研究方向尚未與更簡單的基線方法進行適當比較。 在這項工作中,我們證明帶有 sink 詞元的滑動視窗注意力(SWA)的效能不亞於,甚至優於後訓練的線性注意力模型。我們在多個 LLM 與各種下游任務中都觀察到此結果。在長上下文推理任務(例如 Needle-in-a-Haystack 與 BABILong)中,SWA 的效能大幅領先(比線性注意力高出 2 至 10 倍)。SWA 不需要後訓練、速度極快,且記憶體需求低;因此,它是一個極低成本且可靠的解決方案。 為了降低推論時的記憶體成本,我們強烈建議改用 SWA,而非對線性模型進行後訓練。線性注意力模型或許展現出一些潛力,但它們很可能需要從頭訓練或進行大量後訓練,才能勉強與 SWA 匹敵。
評估正從靜態問答轉向智能體情境,在這些情境中,模型透過外部工具採取行動。我們在此領域中辨識出一項關鍵卻尚未被充分探索的能力——靈巧的視覺工具使用:一種細粒度、閉環的參數化視覺動作,模型從視覺證據推斷工具參數,而這些參數直接決定最終結果。現有基準涵蓋網頁導航、圖形介面操作與軟體工程,但很少針對視覺證據與執行精度之間的這種耦合。我們提出 EASEL,一個評估靈巧視覺工具使用之受控實例的基準,採用以參考引導的視覺重建作為其主要代理任務:智能體逐步在畫布上繪製,以匹配參考圖像。EASEL 另外包含涵蓋區域標註、手寫與路徑規劃的語義任務。我們進一步提供 EASEL-Data——一個包含 440k 樣本、兩階段課程式的軌跡監督資料集——以及 EASEL-9B,以研究其對此能力的影響。對 25 個模型的評估顯示,當前的多模態智能體在 EASEL 上系統性地表現不佳。重建相似度在低水平(0.40–0.54)出現瓶頸,而軌跡診斷揭露嚴重的閉環不穩定性——模型通常過早飽和或在峰值後退化。語義任務揭示了精確標註與路徑規劃方面鮮明的能力界限。在 EASEL-Data 上訓練的 EASEL-9B 相對基礎模型提升 6.3%,在所有受評模型中排名第三。
將影片生成擴展至長時間持續時,揭露了一個關鍵瓶頸:現有模型缺乏穩健的長期記憶。此缺陷可從兩個關鍵面向加以探討:物體恆存性,即物體重新出現時能精確重現其外觀的能力;以及記憶容量,即處理超長上下文並運用遙遠歷史資訊的能力。穩健的長期記憶需要兩者兼備:僅有物體恆存性而缺乏足夠的上下文處理,會限制時間範圍;反之,僅有長上下文而缺乏恆存性,則無法維持物體身分的一致性。為了解決此問題,我們提出 Ring Forcing,這是一個自迴歸影片擴散框架,旨在穩健地建構並精確運用長期記憶。我們的環狀結構訓練策略強制從遙遠歷史中檢索,有效調和了嚴格遵循歷史與生成多樣性之間的取捨。為了擴展記憶容量,我們引入了壓縮與時間步組合策略。在固定序列長度限制下,此方法將有效歷史跨度延伸至長達數分鐘的持續時間,並對整個歷史達成全面的感受野。此外,我們提出一個稀疏 RoPE 機制,以在充分利用預訓練先驗的同時,實現靈活且可擴展的記憶適應。大量實驗顯示,Ring Forcing 在數分鐘的連貫性與物體恆存性上表現卓越,顯著優於目前最先進的方法。
近期針對幾何估計的生成式方法會調整預訓練的影像擴散模型,並將任務視為影像條件生成。透過利用現成的影像擴散模型,這類方法要麼 (i) 獨立訓練特定任務的幾何模型(用於深度與表面法向量估計),因而失去探索這些幾何目標內在關聯的機會;要麼 (ii) 聯合微調修改後的影像擴散主幹網路(例如改變自注意力機制),這通常需要大量標註資料。為了以有原則的方式克服這些限制,我們將預訓練的影片生成模型重新定位為一個統一且資料高效的幾何估計框架,並創新地將此任務表述為下一幀預測。我們的方法 GeoNeXt 繼承了影片模型中自然結構化的知識與更豐富的先驗,同時進一步調整它們以聯合建模影像與幾何目標(影像 <-> 幾何),從而實現更具資料效率且更有效的幾何學習。大量實驗驗證了我們的方法在各種資料集上進行零樣本單目深度與表面法向量估計的效能,不僅優於先前的任務特定與統一生成式競爭方法,且使用的訓練資料大幅減少。值得注意的是,我們的方法能夠與使用超過100倍資料訓練的判別式最先進方法相抗衡,甚至在數個基準上脫穎而出。
多模態大型語言模型(MLLMs)能夠整合長時間的視覺歷史、在部分可觀測性下進行推理,並從少數範例中推斷行為。然而,視覺-語言-動作(VLA)模型通常繼承預訓練表徵,卻未將此上下文能力用作情節記憶。依賴記憶的策略透過專門設計的歷史機制來彌補此差距。PonderPounce 則直接重用 MLLM 原生的因果上下文作為機器人記憶。Ponder 是一種 System2 MLLM,在其原生因果上下文中累積情節觀察、示範與先前的認知,並可生成子目標文字與示範推理供內部使用。Pounce 是一種 System1 VLA,直接接收當前觀察、指令與本體感覺;透過 Ponder–Pounce 介面,它僅非同步接收最新的連續認知token及其年齡。兩者以端到端方式聯合訓練,無需專門設計的記憶模組或單獨的橋接預訓練。優化後的服務達到 78ms 的 p50 認知更新延遲與 25ms 的動作模型調用延遲,支援 20Hz 的動作播放。在採用基礎規模訓練資料的 RoboMME 上,PonderPounce 在相同的 Pounce 架構與介面下達到 60.83%(9B)與 50.04%(0.8B),而 FrameSamp+Modul 為 44.51%,僅觀察當前畫面的 π₀.₅ 為 17.93%。在 9 倍資料下,PonderPounce 達到 75.54%,FrameSamp+Modul 為 57.88%。在 RoboCasa-DC 上,相同介面僅從動作監督學習,達到 12.5%,而最強的已發布示範條件基線為 11.6%;當認知被學習到的空狀態取代時,降至 8.6%。
LLM 智能體日益在執行期間自我修改提示詞、工具、中介軟體、資源與執行框架。此類自我演化雖可提升能力,但成功的變異可能留下持久效應,而這些效應在與其創建時不同的狀態下無法安全復原。我們提出 EvoUndo,一個用於表示、合成、診斷並獨立驗證模型生成之自我修改在跨反事實狀態下可恢復性的框架。在 600 項未見過的單次自我演化任務中,我們識別出 197 個提升能力但未能通過可恢復性驗證的變異。在原始恢復表示下,傳統修復策略對這 197 個自然失敗案例的恢復數為 0/197。確定性預言機分析在原始恢復語言 L0 下恢復 48/197,而擴展恢復演算將經驗預言機恢復提升至 191/197。隨後,一項協議鎖定的 2×2 接地×表達力干預區分出兩個瓶頸:在原始語言足夠時,精確狀態位址接地將成功恢復從 0/48 提升至 38/48(79.2%),而擴展恢復語言使預言機定義之 S1 層級中的 142/143(99.3%)失敗案例得以恢復。在主要 gpt-oss-120b 主幹模型上,向更豐富語言加入精確位址診斷會使恢復率降至 133/143(93.0%);Qwen3.8-27B 重現實驗保留了接地與表達力效應,但未保留此負面交互作用,表明後者具有模型依賴性。這些結果表明,可靠的智能體自我演化需要共同設計驗證、狀態接地、見證語意與恢復語言表達力,而非僅依賴迭代提示。
互動式網頁應用程式生成要求模型能根據自然語言請求,產出可用的 HTML、CSS 與 JavaScript 應用程式。與傳統程式碼生成不同,應用程式品質取決於多個面向使用者的功能性需求,而每項需求通常對應到局部化的程式碼區域,例如事件處理器、狀態更新、DOM 片段或 CSS 選擇器。標準 GRPO 將這些結構化結果壓縮為單一的序列層級獎勵,並將所得優勢均勻地應用於所有 token,從而削弱了信用分配的效果。我們提出 Rubric-to-Code Credit Assignment(RCCA),這是一個強化學習框架,能將評分標準層級的功能性回饋轉化為生成程式碼上的局部最佳化訊號。RCCA 圍繞明確的功能性評分標準建構訓練任務,使用分層獎勵來區分格式、原始碼、執行時期與功能性失敗,並將評估器生成的文本歸因與對應的程式碼區段及生成 token 對齊。由此產生的模型 Ling-RCCA-Flash 在 MiniAppBench 上取得 41.25 分,較 Ling-3.0-Flash 提升 32.20 分,並小幅超越 Claude Opus 4.5。該模型在 ArtifactsBench 上亦達到 76.19 分,較 SFT 模型提升 4.48 分,並在官方 ArtifactsBench 排行榜設定下以超越 GPT-5 3.64 分的成績創下新高,顯示出可遷移的實作層級增益。
大型語言模型的對齊高度依賴以英語為中心的高品質偏好資料,這往往導致在其他語言上的表現次佳。在本文中,我們提出跨語言排序偏好最佳化(Cross-lingual Ranking Preference Optimization, CRPO),一個新穎的框架,利用來自英語的穩健偏好知識,以促進目標語言中的偏好對齊。我們在目標語言與英語的平行偏好對中設計了一種階層式結構,共同最佳化語言內與跨語言的偏好,從而增強語言適應與輸出品質。基於 LambdaLoss 框架,CRPO 超越了基於二元比較的最佳化,透過跨多個候選回應提供相對排序訊號。我們在五種資源規模不同的語言上進行的實驗顯示,CRPO 在指令遵循與知識利用能力上均一致地優於標準方法。值得注意的是,在不同加權方案下觀察到的穩健效能增益,進一步驗證了我們階層式設計在多語言設定中的實證有效性。此外,我們的發現強調,CRPO 顯著改善了獎勵邊際與理想回應的對數機率,有助於形成更穩定的偏好流形以實現跨語言對齊。我們的程式碼可在 https://github.com/dltmddbs100/CRPO 取得。
我們將原子生成事實 f=(u,tau,omega,z;rho) 定義為記錄來源、實現變換、具體發生、生成結果與關係角色的基本單元。這些事實被編譯為生成事實圖(Generation-Fact Graph, GFG),提供了一種AI原生、可編譯的科學事實基底,保存生成歷史。我們建立了一個基於GFG的遞歸科學過程,其中分析、干預、重放與驗證為後續循環形成事實。利用nanoGPT,我們建立了統一的訓練-學習動力學。訓練是帶有狀態與記憶的參數-優化器系統的演化:每個實際訓練動作進入接收狀態,並在該狀態與目標特定更新幾何的條件下產生有限幅度非線性函數響應。學習是這些響應對分佈式功能支援的持續重組;當目標特定狀態根據其讀出邊界進行評估時,能力形成、維持、衰退或恢復變得可觀測。三個主要坐標——目標邊界狀態、目標特定更新幾何與參數-Adam接收狀態——產生一個在更新後輸出被讀取之前運作的二階預測器。在留出運行中,它在四種轉換上達到了91.43%的準確率和91.49%的宏平均召回率。我們進一步將推理確立為訓練-學習動力學的凍結投影。組件門控與回滾顯示了訓練期間形成的查詢條件支援的因果募集與非加性組合,推導出由Attention實現的組織條件。受控反饋顯示可能的雙刃強化效應。ResNet/CIFAR-100與擴散模型/CIFAR-10實驗證實了nanoGPT之外的接收狀態條件響應、持續性支援重組與凍結推理投影。
大型語言模型(LLM)的部署日益仰賴分層防禦,然而惡意提示詞仍可繞過這些防禦。可解釋性方法能夠揭露生成路徑上可為執行強制提供依據的模型內部訊號,但這些訊號本身並非安全控制機制。將這些訊號改編用於安全目的的部署,通常會將每個訊號與其各自的校準、策略邏輯與介入程式碼耦合,因此每新增一個工件只會增加整合工作量,而非強化共享防禦。我們提出語言模型安全模組(LMSM),這是一個借鑒 Linux 安全模組(LSM)分離架構的安全框架,用於 LLM 服務。在 LMSM 中,所選定的安全後端揭露已校準的證據,版本化策略在受信任的逐請求上下文上評估啟用規則,而獨立的閘門則授權緩衝輸出的釋放。此設計將中介正確性與策略有效性分離,使後端、規則或排程的變更毋須重建請求處理或執行強制邏輯。我們的原型展示了此分離在實務中的運作:在 Hugging Face Transformers 與持續批次處理的 vLLM 環境下,同一基礎架構可同時承載以工件為後盾的稀疏自編碼器(SAE)與轉碼器部署、以及任務適配的密集探針,在排程器變動下仍能保留逐請求的決策,並能針對每個請求選擇性地執行與組合多條規則。在 Qwen3-4B 上,LMSM-Checkpoint 將 HarmBench 攻擊成功率從 39.20% 降至 3.32%,XSTest 誤拒率從 2.40% 上升至 4.40%,同時在 32 條活動序列下保留了與不執行監控工作的對照服務路徑 98.14% 的吞吐量。LMSM 為可解釋性與模型內部分析方面的進展提供了通往執行期強制執行的共同路徑。
修正健康錯誤資訊的對話不僅需要提出事實反駁:使用者所知、所信以及需要聽到的內容各不相同,因此有效的介入往往取決於先提出正確的澄清問題。然而,現有方法不是立即回應,就是不加以區別地探詢,要嘛認為澄清沒有必要,要嘛認為它永遠有益。我們提出「獎勵最佳化的探測與回應」(RO-PnR)框架,用以學習何時提問值得付出其成本。在每個回合,RO-PnR 會根據一個回合級獎勵,在探詢更多資訊與決定最終修正之間做出選擇;該獎勵權衡了探測的預期收益與其互動成本。為了捕捉使用者異質性如何影響探測價值,我們為每個模擬使用者建立一個包含健康素養與信念承諾的潛在狀態模型。實驗顯示,RO-PnR 在三個健康錯誤資訊資料集與三種基礎模型上達到最高的成本調整後效用,且比「總是探詢」的基線方法少用 30% 的回合。
互動式對話遊戲所考驗的能力,大多在靜態基準中未被明言:模型必須在回合間維護狀態、詮釋回饋,並在不斷變化的約束下選擇有效動作。我們在 LM Playschool 挑戰賽中,以一個 20 億參數的開放權重模型研究此一情境,發現許多失敗不僅源自廣泛的知識缺漏,也來自局部的決策失誤:重複猜測、格式錯誤的動作,以及違反模型剛才才看到的回饋。這些診斷結果促成了一套以三個步驟為架構的訓練方案:首先透過監督式微調獲取廣泛的遊戲參與能力;其次在單一目標對話遊戲家族內,利用回合局部的偏好對修復可機械驗證的失敗;最後則是在這些對話遊戲之外,保留通用能力。在官方最終評測中,我們的提交將公開 clemscore 從 10.67 提升至 38.92,封閉域內分數從 13.41 提升至 41.17,同時大致保留了靜態整體表現(基準為 44.14 對 44.24)。域外 clemscore 仍偏低,僅為 7.88,最大幅度的提升集中於目標家族未見過的變體。我们的结果提示,廣泛的 SFT 帶來了模型能力提升的大部分效益;當失敗偵測足夠精確時,回合局部的監督可以發揮效用,而觀察到的遷移主要集中於家族內部。
生成式視覺語言模型(VLMs)日益廣泛應用於以人為中心的場景,然而即使影像僅在感知種族或性別等受控屬性上有所不同,它們仍可能產生具人口統計偏誤的輸出。然而,現有的推論時去偏方法大多針對靜態嵌入或類似CLIP的模型設計,而非生成式視覺語言模型。我們提出GGSS——測地線門控球面引導(Geodesic-Gated Spherical Steering)——一種保範數干預方法,在單位超球面上發現反事實偏誤子空間,沿測地線弧引導視覺標記,並利用自適應閘門專注於修正攜帶較強人口統計訊號的標記。我們在統一的單操作點協議下,針對類別、成對及職業-性別偏誤測試,評估四個生成式視覺語言模型與十種改編的推論時去偏基線及基於提示詞的緩解方法,同時衡量一般視覺語言能力。GGSS在所有四個模型上達成最低平均偏誤,其中在四個骨幹模型中的三個上,經配對置換檢驗達顯著差異,同時將MMStar準確度維持在未引導基線的±0.6個百分點以內。程式碼可在 https://github.com/dukesun99/GGSS 取得。
抽取式提示詞壓縮旨在透過移除低資訊 token 來降低 LLM 推論成本,而 LLMLingua-2 等學習式壓縮器在英文基準上報告了強勁的結果。然而,大多數其他語言已經在付出 token 溢價:相同內容所需的 token 數量比英文多 1.3 至 1.8 倍。我們要問的是,壓縮是否縮小還是擴大了這個差距。我們使用涵蓋五種文字系統的十種語言的完全平行資料,並在目標模型分詞器的預算匹配控制下,針對四種確定性基準方法審核了四種學習式壓縮器,涵蓋來自十家供應商的十一種目標模型(超過 25 萬次評估呼叫)。其中三種壓縮器以英文監督訓練(LLMLingua-2 XLM-R/mBERT;來自生產級 Headroom 技術棧的 Kompress-v2);第四種 XProvence 則以多語言方式訓練。首先,遷移差距確實存在,跨目標模型與壓縮器骨幹皆可重現,且強烈依賴保留率:在 0.33 的保留率下,英文保留了 57-62% 的正規化上下文利用率,立陶宛文保留了 10-24%,而中文幾乎沒有保留,儘管中文的 token 溢價最小。其次,這個差距源於壓縮監督資料,而非架構。所有三種英文訓練的壓縮器都顯示出此差距,確定性方法沒有類似的差距,而多語言訓練的 XProvence v1 則沒有。其 v2 版本使用翻譯資料重新訓練,在激進閾值下毫無預警地清空了 92% 的中文上下文。第三,在更困難的長上下文設定中,激進的學習式壓縮在五種非英文語言中的三種中,將壓縮後上下文推向無上下文效用水準或更低。在五種受測語言中,先翻譯後壓縮的流程在三種語言中與原生壓縮相當或更好,且 token 成本約為一半。我們釋出所有程式碼、壓縮結果與模型輸出。在英文之外,安全的壓縮預算要小得多。
戶外光達語意場景完成(SSC)從僅觀測目標體積 1% 的掃描中還原稠密語意體素網格,且類別不平衡超過 7,000 倍。我們將 SSC 重新定義為生成式語意場景完成(GSSC):一個以三種角色運作的單一離散擴散架構。第一,成對稀疏-稠密場景合成(PS^3)生成匹配的稀疏光達觀測及其稠密語意完成,從源頭處理長尾問題,並產出我們與 SemanticKITTI 一同訓練所用的 PS^3-SemanticKITTI 資料集。第二,語意引導生成式場景完成(SGSC)使用多項式離散擴散從雜訊生成場景,並以稀疏掃描為條件,透過鳥瞰圖語意地圖與稀疏 3D 特徵流傳遞條件。第三,同一架構改以單一流匹配步驟精化現有的完成結果:結構化來源離散擴散(S^2D^2)。S^2D^2 提升了 SGSC 自身輸出以及所有受測外部 SSC 基礎模型的 mIoU,且無需基礎模型重新訓練或測試時適應。在最強的基礎模型上,單一步驟且無測試時資料增強在 SemanticKITTI 隱藏測試集上達到 38.8% 的 mIoU。據我們所知,這是該排行榜上最佳的因果、單次掃描、單樣本結果,在相同限制下比先前最佳公開分數高出 2.1 個百分點。四次修正步驟搭配八視圖測試時資料增強則達到 39.2%,此結果不在此限制內。