每日精選AI研究論文及翻譯
化學文獻的綜合整理往往需要彙整分散在眾多出版物中的具體發現,然而現有的文獻檢索系統主要回傳按相關性排序的文件列表。因此,科學家和 AI 智能體必須自行定位相關資訊、驗證其來源,並手動彙整跨論文的答案。我們提出 AskChem,這是一個以主張為核心的跨論文化學檢索基礎設施。AskChem 將檢索單位從論文轉變為帶有出處的主張:每篇論文被轉換成原子化、類型化的主張,每個主張以來源 DOI 與逐字引用或明確的證據定位器為依據。在此共享主張庫之上,AskChem 提供了互補的檢索與綜合結構:供層級檢索與瀏覽使用的穩定化分面分類法、透過關係連接主張的證據圖譜,以及將已索引論文置於科學原則之下的探索性動態分類法。AskChem 目前索引了來自 14.7 萬篇論文的 240 萬條主張,並提供網頁介面,以及供 AI 智能體使用的 REST、SDK 與 MCP 存取介面。在 AskChem-Bench 上,以 AskChem 作為 GPT-5.5 閱讀器的檢索依據,可解析的 DOI 比例達 100%(無檢索時為 88.3%),並在五個受測系統中取得最高的引用密度。AskChem 已上線,網址為 https://askchem.org。
GUI代理有望成為現有數位裝置上的通用執行器。為推動其邁向真實世界應用,我們設想代理能在真實裝置上可靠運作、跨平台執行工作流程、結合GUI互動與CLI執行、完成長時程任務、主動發起有用服務,並以最少的人力投入自主提升其能力。在此願景指引下,我們提出Qwen-UI-Agent,一個以真實世界為核心的基礎GUI代理,涵蓋行動裝置、電腦操作、網頁及DeepSearch等環境。Qwen-UI-Agent結合多樣化的沙箱環境與大規模真實裝置行動執行環境。其統一動作空間將GUI操作與CLI執行交錯結合,並在單一模型回合中產生批次動作。自動研究式資料飛輪利用代理來建構任務與環境、診斷失敗原因,並規劃後續迭代。線上強化學習支援超過100回合的軌跡訓練,並以超過10,000個並行環境加速資料蒐集。輕量化的中介層支援行動裝置與電腦之間的主動服務發起及有狀態工作流程。 在一系列廣泛的評測中,Qwen-UI-Agent在行動裝置使用基準上達到最先進效能,同時在電腦及瀏覽器操作任務上展現與前沿模型(包括Opus 4.8、Gemini 3.1 Pro與GPT-5.6 Sol)相當的競爭力。在行動裝置使用方面,其在MobileWorld上達到82.1%、在MobileWorld-Real上達到92.2%、在AndroidDaily上達到97.5%。在電腦操作方面,其在OSWorld-Verified上達到79.5%,並在OSWorld-v2上取得40.0%的部分進展得分。在瀏覽器操作與GUI定位方面,其分別在WebArena上達到73.6%,以及在ScreenSpot-Pro上達到81.5%。
近年來,AI 智能體的進展日益將原生能力內化至其底層基礎模型中,催生了多模態基礎模型與大型推理模型。然而,智能體記憶仍主要透過外部模組實現,原生記憶能力在很大程度上尚未被探索。在本文中,我們朝此方向邁出第一步,引入記憶基礎模型,賦予基礎模型原生記憶能力。我們從兩個角度形式化原生記憶:骨幹內部的持久且動態演化的記憶狀態,以及透過模型計算自主儲存與利用資訊的原生記憶程序。我們證明,原生記憶在架構、端到端優化與效率方面具有優勢。基於此形式化,我們提出 Metis,即記憶基礎模型的第一個原型。Metis 引入了一種新架構,為基礎模型配備原生記憶狀態,使歷史資訊能被壓縮至模型中,並透過記憶注意力進行存取。我們建構了大規模的記憶專用訓練資料,並引入多種優化目標,以透過中期訓練習得這些原生記憶程序。Metis 的線上記憶維護是無梯度的,記憶更新僅需一次前向傳播。在推論時,所有已學習的模型權重保持凍結,而原生記憶狀態則透過標準前向計算自主轉換。透過大量實驗,我們證明 Metis 展現出原生記憶能力,並進一步詳細分析其優勢、限制與行為。為促進未來對記憶基礎模型的研究,我們釋出我們的專案與模型檢查點。
我們提出 PhiZero,一個以物理語言為核心建構的物理世界模型;物理語言是對世界狀態轉換的緊湊離散表徵。現有的物理世界模型通常直接在像素空間中預測未來影片,將底層的世界動態隱含在高維度視覺預測器之中。受到人類能從視覺經驗中抽象出預測結構,並將其組織為自然語言以進行明確推理的能力所啟發,我們透過自我監督從真實世界影片中學習物理語言,並利用它來明確推理物理世界如何演化。因此,PhiZero 採用了「先推理、後渲染」的典範:它首先將未來世界演化推斷為物理語言序列,接著將推斷出的狀態轉換渲染成影片。在生成與理解基準上的大量實驗驗證了 PhiZero 建模物理一致世界演化的能力。我們進一步展示了它在真實且互動的世界建模、細粒度動作條件模擬,以及零樣本動作轉移方面的潛力。
遞迴自我改進(RSI)需要能改進 AI 建構過程的 AI 系統(即 AI4AI);機器學習工程(MLE)為研究此能力提供了具體且可執行的測試平台。我們提出 OpenMLE,這是一個用於 MLE 中 RSI 研究的開放式全端系統,涵蓋具執行回饋的可驗證任務環境(OpenMLE-Gym)、算子學習(OpenMLE-RL),以及長時程搜尋(OpenMLE-Evo)。在此技術堆疊上,我們對 Frontis-MA1(35B)進行後訓練,使之成為用於 MLE 的後設演化代理,並使後訓練與推論圍繞四個原子程式演化算子(Draft、Improve、Debug、Crossover)對齊:這些算子透過以執行結果為基礎的 SFT 與 RL,在與所有評測基準去重後的資料上進行訓練,接著組合成長時程搜尋,在單一迴圈中耦合學習與演化。在 MLE-Bench Lite 上,於單張 RTX 4090(VRAM 上限 12 GB)、每項任務 12 小時的預算下,Frontis-MA1(35B)使用 OpenMLE-Evo 時,將 Medal Average 從其基礎模型的 39.39% 提升至 60.61%;使用 OpenMLE-Evo-Max(與基準無關的經驗先驗與非同步搜尋)時則達到 71.21%,超越 GPT-5.5 + Codex,並接近 GPT-5.6 Sol 與 2.8T Kimi K3。在保留的 NatureBench Lite 上,兩個組成部分皆可遷移:框架固定時,換用訓練後的模型可將 Match-SOTA 從 50% 提升至 70%;模型固定時,換用 OpenMLE-Evo 可將其從 20% 提升至 50%。我們釋出模型權重與完整 OpenMLE 技術堆疊,以促成朝向 RSI 之可執行 AI4AI 的可重現研究。程式碼:https://github.com/FrontisAI/OpenRSI
文字轉影片模型已達到卓越的視覺品質,然而此類模型仍難以生成物理一致的動態,原因在於場景的時間演化必須從高度壓縮的文字提示中隱式推斷。現有的思維鏈方法引入了中間計畫或視覺狀態,但這些表徵通常不可執行或時間上過於稀疏,限制了其例示與控制完整時空過程的能力。為解決此限制,我們提出 VideoCoCo,一個代理式雙引擎框架,其中可執行的 Blender 程式碼作為過程層級的思維鏈。給定文字提示,編碼代理會合成一個 Blender 程式,明確指定場景及其時間演化。可執行的模擬引擎執行該程式以產生確定性的時空草稿,隨後由生成式影片引擎透過草稿條件化編輯將其轉化為照片級真實的影片。此分解方式將過程層級的推理與高保真度的視覺實現分離開來。為使影片編輯器適應模擬草稿,我們建構了 VideoCoCo-3K,一個經篩選的草稿-指令-目標三元組資料集。VideoCoCo 將 OmniWeaving 基線在 PhyGenBench 上從 0.475 提升至 0.558,在 VBench-2.0 上從 52.18 提升至 77.88,在兩個基準上均達到最佳平均分數。這些結果證明,可執行程式碼為物理一致的影片生成提供了有效、可控且可檢視的中間表徵。
僅解碼器語言模型將長期記憶與推理耦合在單一參數集中,使得獨立擴展記憶容量變得困難。Memory Decoder 引入了參數化長期記憶模組,但僅在相對較小的規模下進行研究。在本工作中,我們提出了大規模 Memory Decoder,將記憶模型擴展至 6.9B 參數,並在 300B 詞元上進行預訓練。在此資料規模下,索引與搜尋的總成本使得標準 Faiss 管線不可行。我們透過分散式的 Faiss 索引與檢索管線,以及 kNN 分佈的稀疏批次式載入,來解決此瓶頸。在各種模型規模下,我們發現將更多參數分配給記憶模組,比僅擴展基礎模型能帶來更佳的參數-效能取捨。在 17 個基準測試上,將 6.9B 通用記憶與 Pythia-410M 結合,可將其平均分數從 29.86 提升到 37.34,以少 39% 的總參數超越了 Pythia-12B (37.24)。對於從 0.6B 到 14B 的 Qwen3 Base 模型,1.7B 領域記憶模組在每個規模下都能將三個領域的平均分數提升超過 9 分。總體而言,我們的結果證明,獨立擴展預訓練記憶為提升語言模型效能提供了更具參數效率的途徑。
智能體式視覺推理的根本目標,在於提升多模態大型語言模型(MLLMs)在複雜任務上的成功率,而非僅為其配備一套精緻卻低效的推理範式。在本工作中,我們透過工具使用的兩個關鍵維度重新審視智能體式視覺推理:模式適應性(MA)與工具效果(TE)。模式適應性用以表徵多模態大型語言模型能否辨識工具真正必要的時機並據此加以呼叫,藉此避免不必要的計算負擔,同時提升在需要工具輔助的困難問題上的表現。工具效果則用以表徵工具使用的實際影響:工具應在模型無法僅靠純文字推理解決的問題上擴展其能力,同時避免在模型無需工具即可解決的問題上引入額外錯誤。我們進行了全面的分析以量化這兩個性質,並實證揭示現有智能體式視覺推理模型的模式適應性有限,而工具使用在困難範例上帶來的增益,很大程度上被其在模型已能解決的簡單範例上所引入的損害所抵銷。受這些觀察啟發,我們提出了 Beacon,一個新穎的智能體式視覺推理模型,其在整體表現、模式適應性以及真正的工具誘發效能增益方面均取得更佳成果。Beacon 的核心在於強化學習階段的「必要性感知自適應獎勵」與「提示引導能力擴展」機制,前者分別根據任務必要性鼓勵自適應的工具呼叫,後者則強化模型在最具挑戰性問題上的工具使用能力。跨多樣化基準的廣泛實驗證明了 Beacon 的強大整體表現,以及其在模式適應性與工具效果兩方面的顯著提升。
檢索增強生成(RAG)涵蓋詞彙檢索、稠密檢索、基於圖的索引與代理式搜尋,但這些範式通常在不同基準上以單一語料庫規模進行評估,導致其準確度-成本擴展特性不明。為填補此差距,我們提出一項受控研究,沿著 28 個嚴格嵌套的層級變動語料庫規模,涵蓋約 450 倍的範圍,同時保持問題以及一組固定的相關與對抗性文件(bedrock)不變。在單一閱讀器模型與單一評判協議下,我們量測官方準確度、建構與查詢 token,以及延遲。結果顯示存在依賴規模的交叉,而非無條件的勝者。檔案系統代理在最小的共享層級領先,但其序列式探索在 bedrock 上耗費 39 倍的查詢 token,且隨著搜尋空間擴大而效果下降。在約 1,000 萬個語料庫 token 附近,BM25 超越該代理,並在之後每個更大的共享層級都保持領先,於完整規模時差距接近 20 個百分點。BM25 也無需基於 LLM 的建構,即錨定帕累托前沿的低成本端。稠密檢索仍屬高效但準確度較低,而基於圖的 RAG 在部署規模前便遭遇建構瓶頸,其可擴展變體在共享層級上仍低於 BM25。整體而言,語料庫成長日益有利於全局候選排序:詞彙檢索是最強的可擴展預設,而代理式推理在排序發現之後運作最佳,而非取代排序發現。
在開放式領域中,大型語言模型的訓練缺乏可驗證的回報,使得任務偏好難以被形式化為有效的監督。上下文可以傳達這類偏好,然而一旦被蒸餾至學生模型中,便只能提供很少的額外監督,這激勵了隨學生表現而演化的上下文。然而,直接將演化中的上下文用作訓練中的監督,會導致不穩定的蒸餾目標與相互衝突的分布,因此需要機制來穩定目標並降低衝突的權重。在本文中,我們透過對反向KL目標的分解來分析上下文的效果,揭示了兩個發現:學生會被蒸餾至上下文條件教師的幾何平均,且該目標包含一個衡量這些教師之間衝突的衝突項。基於此分解,我們提出了Flux-OPD,一種使用演化上下文作為訓練中監督、以捕捉開放式領域任務偏好的OPD範式。Flux-OPD將上下文條件教師與無上下文教師之間的差異視為上下文差異信號,將其作為上下文校正注入到無上下文教師錨點中,並以衝突項作為指標來加權其校正強度。在開放式任務上的實驗表明,Flux-OPD優於現有的OPD範式,凸顯了將教師監督與演化上下文結合的潛力。
文字生成影像與個人化編輯模型現在能輕鬆合成高保真度的單一主體影像。然而,要將多位具名人物置入如擁抱、抱起或扭打等共享接觸動作中,仍會暴露重大缺陷:肢體融合、虛構的四肢,以及身體相互穿透。現有評估大多忽略這些解剖學與幾何學問題,而以視覺語言模型(VLM)作為評審的檢查清單在「互動」(Interaction)指標上往往達到飽和,但這些錯誤對人類而言仍顯而易見。我們提出MPIE-Bench,一個包含2,500個樣本的基準測試,取材自影片探勘的編輯三元組,涵蓋405個場景、14個互動類別與四種接觸密度(C0-C3)。我們亦提出MPIE-Eval,其兩個新評估軸向利用凍結的公開多人網格重建來評分接觸時的幾何關係。「解剖學」(Anatomy)軸向探討每一塊類人質量是否皆能被一組完整的重建身體所解釋,而「互動」(Interaction)軸向則探討這些身體之間的穿透量與表面距離是否符合指令所要求的接觸程度。在十個編輯器的測試中,兩個不同模型上的網格解剖學指標最高僅達0.65,網格互動指標最高僅達0.72,因此沒有任何單一編輯器能在兩個軸向上皆表現優異,而VLM檢查清單對相同影像的評分卻高於0.95。一項五位評分員的研究證實,這兩個軸向比零樣本VLM評審更貼近人類判斷,且在對每個權重與閾值進行消融測試後,排名依然成立。
具身智慧面臨著根本性的資料瓶頸。模型必須捕捉第一人稱感知、全身動作、靈巧操作、物體狀態、聲音與觸覺如何隨著人類在時間中追求目標而共同演化。現有資料集將這些經驗分散在不同的視角、模態或空間尺度中,使得完整的感知-行動迴圈僅能被部分觀察。我們提出環境捕捉引擎(Ambient Capture Engine, ACE),這是一套以人為中心的資料引擎,能將真實居家環境轉化為空間校準、時間同步的錄製工作室。ACE 在兩個互補的尺度上運作:桌面尺度配置可解析手部與物體的操作,而房間尺度配置則捕捉在佈置完整的居家環境中的全身動作、移動與互動。ACE 記錄自我中心視角與多視角外部視角的影片、全身與關節化手部動作、物體幾何與六自由度軌跡、音訊及觸覺訊號,形成統一的多元感官資料流。利用 ACE,我們建構了 ACE-Data-0,包含 150 小時、1,700 萬幀影片,涵蓋 200 個任務類別,由 50 位參與者在 2 個環境中執行,總共產生 75,000 個互動片段。該資料集涵蓋原子操作、長時程家務活動鏈,以及人與場景的互動,同時透過目標層級而非逐步指令來保留自然的行為變異。我們進一步提出一個層級式基準測試,從訊號逐步推進至場景要素,再進展到互動。對最新方法的評估揭示了在接觸、遮擋、自我運動及長時程時間範圍下仍存在重大差距。ACE-Data-0 提供帶有對齊的感知、運動學與接觸監督的同步人類示範,為模仿學習、世界模型、視覺-語言-行動系統及具身智慧提供了可擴展的基礎。
角色扮演代理(RPAs)已成為大型語言模型最重要的消費級應用之一。使用者透過與RPA進行多輪對話,以獲得情感慰藉等體驗,因此可靠的評估對於衡量能力、比較系統及引導後續改進至關重要。然而,現有的基準測試通常要求RPA延續一段固定的對話歷史,再以脫離使用者的固定評分標準來評估其續接內容。我們識別出此設計的兩項限制並以實證加以證明。首先,RPA的輸出會受到先前對話歷史的影響,這阻礙了在真實多輪情境中對其角色扮演能力進行具有科學基礎的評估。其次,使用者體驗在不同個體之間存在顯著差異,而傳統的固定評分標準未必能與使用者滿意度一致。因此,我們提出PALATE(Person-Aligned LLM-Simulated-User Assessment with Tailored Evaluation,即個人對齊的大型語言模型模擬使用者評估與客製化評分),這是一個建立在使用者模擬器之上的可擴展RPA基準測試。PALATE配備了300個角色設定檔的資料庫。其主要評估流程訓練五個針對個別使用者的模擬器,讓它們與候選RPA在一組預先固定的角色設定檔上進行自由形式的多輪對話。除了通用品質評分標準外,我們還建構了個人化評分標準來衡量使用者滿意度;在留出的標註資料上,個人化評分標準與人類判斷的一致性高於通用評分標準。在16個候選系統的主要評估中,PALATE分別描繪了一般性回合品質、長程對話能力,以及各候選系統在共同建構的多輪軌跡上所呈現的個別使用者體驗。如此一來,它能針對特定的使用者-RPA配對產生可解釋的評估,而非將系統壓縮為單一、與使用者無關的排名。
現有的影片字幕生成模型雖能生成自然的影片內容描述,但無法將局部視覺元素明確地對齊至多張參考影像。我們提出多參考影像對齊的影片字幕生成任務,這是一項新任務,要求生成具事實性的影片描述,並在詞組層級上對齊參考影像。為此,我們提出 RefCaptioner,一個適用於此任務的兩階段後訓練框架。RefCaptioner 結合混合資料的監督式微調與分層覆蓋折扣 GRPO,在保留一般影片字幕生成能力的同時,共同改善參考影像選擇、詞組層級綁定、干擾項排除與跨參考一致性。為支援訓練,我們建構了一個包含 20,000 部影片與 171,354 張參考影像的語料庫。我們進一步提出 MRVBench,這是一個用於評估描述事實性與多參考對齊能力的基準,涵蓋真實世界影片與 AI 生成影片。實驗結果顯示,RefCaptioner 在開源模型中達到最佳整體表現,同時在標準影片字幕生成基準上仍具競爭力。人工評估進一步證實,其生成的描述更受標註者偏好,且能透過開源與專有的影片生成器達成更忠於來源的影片重建。
多模態大型語言模型在推理過程中日益頻繁地使用草圖、註解、工具及中間圖像,但目前仍不清楚它們是否真正依賴這些視覺狀態。現有基準的侷限性體現在兩個方面:任務集合覆蓋範圍狹窄或包含部分可透過文字解決的樣本,以及評估側重於最終答案而未診斷中間視覺狀態如何被生成、渲染及使用。我們提出 See2Think,一個統一的評估框架,包含 See2ThinkBench 與視覺思維行動(Visual Action-of-Thought, VAoT)。See2ThinkBench 包含 1,200 個開放式、依賴視覺的問題,涵蓋 12 個任務類別,橫跨二維結構、三維場景與真實世界推理。VAoT 則在四種受控推理設定下記錄文字思維、視覺行動、渲染狀態及後續推理。透過評估具代表性的專有與開源多模態模型,我們發現視覺推理高度依賴模型與環境,沒有任何單一設定能在各任務中持續佔據主導地位。過程分析進一步表明,模型通常會選擇相關的視覺操作,而忠實渲染仍是最明顯的瓶頸,且高回饋吸收率並不一定轉化為準確度的提升。在任務相關的受損回饋條件下,模型表現出對視覺狀態的行為依賴,在控制性干預下準確度下降超過 10 個百分點。
視覺-語言模型(VLMs)日益被用於具身智能體中,以解釋視覺輸入、推理空間關係,並基於該推理做出任務層級的決策。然而,一個根本性的能力錯配仍然存在:通用視覺-語言模型能夠推理整體任務,但往往遺漏決定成敗的視覺細節;而專業視覺模型雖然能捕捉這些細節,卻無法將其轉化為任務層級的決策。在本工作中,我們提出 SpatialCLI,一個教導視覺-語言模型使用空間工具進行推理,並逐步內化這些工具所提供之專業感知能力的框架。SpatialCLI 分三個階段進行:(1)調用(Call)將專業視覺模型暴露為空間工具,以增強視覺-語言模型的感知能力;(2)學習(Learn)利用冷啟動監督微調(Cold-Start SFT)和智能體強化學習(agentic RL)來改善工具使用;(3)內化(Internalize)將成功的工具使用軌跡語言化,以內化專業感知能力。我們進一步引入 SpatialCLI-Bench,一個包含 516 個範例的組合式感知基準,涵蓋定位、分割、深度和姿態。在 MindCube 上,SpatialCLI 使 Qwen3-VL-8B-Instruct 從 29.3% 提升至搭配工具時的 84.6%,超越了搭配工具時的 GPT-5.6 Sol(72.1%),同時在內化後不搭配工具的情況下仍保持 73.8% 的表現。
視覺生成日益需要高解析度影像、長影片以及多模態上下文,使得全注意力機制的二次方成本變得難以承受。我們提出 Chimera,一種具有原則性擴展策略的混合視覺擴散主幹網路。Chimera 以單一光柵順序串流處理文字、影像與影片 Token,且無需位置編碼。它結合了具有 O(N) 複雜度的 Kimi Delta Attention(KDA)以進行長上下文狀態追蹤、交錯的 Multi-head Latent Attention(MLA)以實現直接的全域交互,以及模態感知的短卷積以捕捉局部時空脈絡。稀疏混合專家(MoE)層在控制啟用計算量的同時擴展了模型容量。為擴展此異構架構,我們提出 HeteroP,一種模組級的擴展方案,根據每個張量的功能性扇入與模型深度,在寬度與深度之間轉移超參數。HeteroP 產生了一組一致調校的模型家族,用以擬合 Chinchilla 風格的計算最優定律,涵蓋啟用模型規模、訓練 Token 數量以及影像-影片資料比例。在這些定律的引導下,我們訓練了一個具有 20 億啟用參數的 110 億參數 Chimera 模型。實驗結果顯示三項發現。第一,以預訓練擴散損失衡量,密集主幹網路的計算效率是配對的全注意力 Wan-2.1 2B 基線的 1.7 倍,而完整系統則達到 7.3 倍。第二,無需針對特定長度進行微調,Chimera 即可從 5 秒的訓練片段零樣本外推到 30 秒的影片,且最後五秒的 FID 僅退化 6.5%。第三,擬合的定律顯示,計算最優的影像預訓練將計算資源近乎均勻地分配給啟用模型規模與訓練 Token 數量,而影片預訓練在高預算下則略微偏好模型規模。這些結果為設計與擴展高效能的長上下文擴散架構奠定了基礎。
我們提出 ShadowDancer,一種對互動式影片世界模型進行任意動作、逐幀控制的新方法。其障礙在於表徵層面:現有介面要麼鬆散地編碼動作,讓模型自行即興演繹其展開方式;要麼透過結構化信號精確編碼動作,但這些信號僅服務於單一動力學家族且難以獲取,因此跨多樣動力學的精確控制仍不切實際。示範影片是自然的解決方案,能逐幀指定任意動力學;然而,影片僅透過某一特定外觀來展示其動力學,也就是底層動力學的單一影子,因此從示範中學到的動作難以遷移到新場景。ShadowDancer 以兩項關鍵創新解決此問題:(1) 影子對——在獨立重新採樣的外觀下重播相同動力學的影片對,由我們的 Shadow Library 大規模構建;因此,一個動力學家族唯有在能為其構建此類對時,才得以被精確控制;(2) 跨影子預測——透過從一個影子預測另一個影子來學習動作;如此一來,配對所重新採樣的一切在構造上被丟棄,而其所保留的一切則成為動作,進而產生統一的動力學表徵,驅動區塊因果世界模型。因此,任何示範片段都成為可重複使用的動作資產,可在無動作標籤、無運動估計器、也無需微調的情況下,在新環境中重播。實驗表明,在多樣動力學家族中,相較於強大的潛在動作基線與互動式世界模型基線,本方法在動作遷移與長程動作展開上均有改進,在展開比較中的平均盲測勝率為 86%。我們在 https://ShadowDancer-1.github.io 展示影片結果。
在策略自蒸餾(OPSD)是一種有望改善推理語言模型的方法,但在實踐中仍然脆弱:要使其可靠運作,往往需要大量的工程努力。我們辨識出此困難的結構性來源:基本版OPSD正是更廣泛策略最佳化家族中β=1的特例,其中β加權KL懲罰,將學生模型錨定至參考策略。此等價關係將β從固定為一的隱含值轉變為可控的正則化參數,從而產生更一般的表述,可在接近參考策略與特權教師引導之間進行取捨。我們引入β-OPSD,並推導出其最佳策略為參考策略與特權教師之間的幾何插值。然而,直接用強化學習最佳化此目標將成本高昂且具有高變異。我們不直接最佳化RL目標,而是將其閉式解轉化為蒸餾目標。每個β值會沿著從參考到教師的路徑選擇一個目標,我們透過混合兩者的詞元層級logits來有效實現。如此一來,廉價的蒸餾可近似昂貴的策略最佳化之解。剩餘回報信用分配進一步使詞元更新與序列層級目標對齊,同時保留OPSD的簡潔性。在數學推理基準上的實驗顯示,β-OPSD持續優於基本版OPSD,改善了最佳化穩定性與下游推理效能。我們的結果提供了一條從自蒸餾到策略最佳化再返回的原則性途徑,且不犧牲使OPSD實用的效率。
檢索過往經驗已成為增強大型語言模型代理的常用策略。然而,現有的記憶增強代理大多將檢索到的經驗視為靜態紀錄,以逐字重播的方式注入情境中,而不論這些經驗是否與代理當前面臨的情境相符。這種「重播」模式忽略了儲存經驗的抽象概括本質與決策當下具體多變狀態之間的鴻溝,常導致負向遷移。相比之下,人類鮮少逐字回顧過往經驗,而是會重新組織並調整檢索到的記憶,以適應當前情境。受此啟發,我們提出 MemHarness——一個使大型語言模型代理能根據當下情境主動利用並重建過往經驗的框架。在每個決策步驟中,統一的策略模型會依據當前狀態對檢索到的經驗進行批判性評估與重建,在行動前產生植根於情境的引導。此重建能力可透過 GRPO 的端對端訓練自然湧現。在 ALFWorld 與 WebShop 上的實驗顯示,MemHarness 顯著優於純強化學習與靜態記憶增強的基準方法,在分布外(OOD)情境中展現出強大的穩健性。此外,我們的分析揭示,此重建目標不僅能防止負向遷移,在訓練期間更能作為潛在引導,從根本層面提升代理的內在推理能力。
母單執行是演算法交易中的核心問題,其目標是將大額訂單拆分為較小的訂單,同時降低執行成本。現有方法要么依賴於可能無法在實務中成立的預設市場假設,要么需要限於特定任務的訓練,從而限制了其對新情境的適應能力。為克服這些限制,我們提出了首個針對大型語言模型用於母單執行的系統性研究。這將大型語言模型在金融領域的應用從「交易什麼」擴展到「如何執行」。我們提出PACE(前瞻規劃受控執行),這是一個將母單執行分解為長期規劃與短期執行的分層框架,既不需要明確的市場假設,也不需要特定任務的訓練。在深圳證券交易所Level-1資料上的實驗表明,PACE優於TWAP、Almgren-Chriss以及基於學習的基線方法,比最強基線高出0.65個基點。行為分析揭示,大型語言模型做出執行決策的方式與人類投資者不同:較高的模型信心預示著更好的表現,而非更差的報酬,且模型會提前交易,而非拖延至截止時間。這些發現表明,大型語言模型可以在執行決策中補充人類交易員的不足。
前瞻性潛在世界模型預測動作如何改變場景,但僅能透過昂貴的測試時搜尋來為期望的變化恢復動作。我們提出INTACT(意向到動作,INtent-To-ACTion),一種端到端聯合嵌入預測架構(JEPA),將帶動作標籤、無獎勵的軌跡轉化為可部署的意向到動作介面。每個轉移提供物理意向z_{t+1}-z_t,而未來目標則提供部署意向sg(z_g)-z_t。該架構在局部與目標動作意向骨幹輸入圖之間透過相同的四槽語法與共享參數實現同構,並在受支持的局部與目標動作意向族之間透過由同一預測器所誘導的動作規律語義實現同構,而非逐點潛在相等性。INTACT亦提供從RGB證據到動作有效潛在意向座標,以及從意向族到其對應動作規律族的完整遷移。非對稱端點梯度將物理後繼者落地,並將未來目標固定為錨點,在無需逐點潛在匹配或全局線性動力學的情況下結合表徵學習與控制。所產生的座標支持穩健的分布性動作規律:其條件均值可直接作為免搜尋策略,而取樣仍可用於多樣性或可選驗證。在四個官方LeWM任務上,單輪訓練、零搜尋模型分別達到85.78%、100.00%、97.67%與97.89%的成功率。以直接計畫為中心的可選局部交叉熵法(CEM)以384條而非9,000條候選序列達到96.86%的宏觀成功率,將取樣量減少23.44倍,同時比純CEM提升16.00個百分點。一個共享的四任務編碼器達到89.39%的E5直接宏觀成功率,並在每項任務上優於聯合訓練的LeWM,而預測-專家動作族kNN以r=0.954追蹤直接成功率。直接推論僅需2.9–5.5毫秒。
用於視覺問答的多模態智能體日益以多步軌跡的形式運作,交錯執行感知、檢索與推理,然而評測方式仍大幅簡化為最終答案的準確率。此類聚合信號無法判別正確答案究竟是經由有依據的證據、語言先驗,抑或是偶然的錯誤相互抵消而達成。我們主張將多模態智能體軌跡視為受溯源約束的狀態機:工具輸出被標準化為結構化證據帳本,作為軌跡狀態;下游推理與決策主張僅能引用帳本中活躍的條目;接地檢查在實體與數值層級進行;修復則以型別化狀態轉換實現,此類轉換若缺乏工具產生的溯源資訊便無法引入新內容。我們將此設計具體化為 LedgerMind(搭載結構化證據帳本、受溯源約束的多模態智能體推理),並輔以三層接地協議、根據問題複雜度匹配推理深度的自適應雙路徑調度器,以及具備形式化溯源非放大保證的事件觸發驗證與修復引擎。我們運用 LedgerMind 針對四種反覆出現、且常被最終答案準確率掩蓋的失敗模式:缺乏支持的中間推理、具引用背書的實體幻覺(Phantom Grounding)、對簡單查詢的過度推理,以及修復時的資訊放大。跨多個多模態推理基準與骨幹多模態大型語言模型的實驗顯示,LedgerMind 同時提升了答案準確率與軌跡層級的忠實度。
電腦操作代理從其行動所改變的事物中學習,因此訓練這類代理需要它能操作、破壞並重置的應用程式。最重要的應用程式通常設有登入門檻且具有狀態,因此以合成環境代替。近期的管線能大量產生這類環境,使瓶頸從「環境有多少」轉移到「每個環境內部有什麼」。我們發現,效益來自三個特性:環境承載多少行為深度、是否鎖定代理實際會失敗的互動、以及是否隨模型一同改進。我們提出 Echoverse,它將規格編譯為有狀態的應用程式,其任務會依據應用程式自身的資料庫進行評分;同時提出一個共同演化迴圈,將每個已評分的軌跡讀取兩次:一次作為對環境、其任務及其驗證器的修復,另一次作為模型的訓練訊號。在十二個這類環境上訓練後,一個 9B 模型在十四個評估分割上的表現從 36.5% 提升至 67.1%,與教導它的、規模大得多的前沿模型相差在十四個百分點以內。我們依序檢視每個特性。在相同領域中,淺層環境會將真實網站準確率壓到低於基礎模型(80.0 降至 75.0),而深層環境則能提升它(80.0 升至 85.0,48.0 升至 65.0);在多種渲染中反覆操練單一介面控制項,可遷移至留出的小工具家族及開放網路;而修復單一環境,能將在其上訓練的模型從 16.2% 提升至 38.5%。這些相同的環境也可用作強化學習環境,其中結合基於資料的驗證器與稠密逐步驟評判器的獎勵,可將留出分數從 58.8% 提升至 68.0%。我們釋出四個環境作為基準,包含其應用程式、種子資料與基於資料的評分器。程式碼:https://aka.ms/echoverse
記憶對於長時程的大型語言模型代理(LLM agent)至關重要,然而現有的記憶系統主要保存互動內容,而非建模哪些代理值得信賴及其信賴條件。此限制在多代理系統中尤為重要,因為中央模型可能無法直接驗證看似合理或相互關聯的同儕回應。我們提出Σ-Mem,一種線上可靠性記憶,它記錄個別同儕的歷史能力證據,以及跨同儕集合的同儕關係證據。兩種類型的證據皆以實對稱狀態(real symmetric state)維護,並從決策後的正確性回饋中更新。根據Weyl不等式,每次事件級更新所導致的頻譜變化是有界的,使得系統無需重新訓練底層模型即可進行穩定的線上適應。Σ-Mem提供通用的寫入與讀取介面:同一記憶可用於中央模型的殘差引導(residual steering)、無回應同儕路由(response-free peer routing),或可靠性加權投票(reliability-weighted voting)。在五個Qwen系列模型中,Σ-Mem能適應反事實可靠性偏移(counterfactual reliability shift),並泛化至未見過的同儕與任務領域。直接記憶讀取在完整的分布外(OOD)評估集上也優於多數決投票與最佳固定同儕。此外,隨著更多正確性回饋的取得,效能持續提升,表明Σ-Mem能逐步累積可操作的可靠性資訊。這些結果確立了可靠性記憶作為基於LLM的多代理系統中適應性協調的可重用基礎。
Transformer透過單一的加性殘差流在深度維度上傳播資訊:每個子層僅讀取最近的狀態。注意力殘差透過讓每個子層經由學習到的softmax進行注意力運算,放寬了此限制。然而,該讀取操作使用一個跨整個寬度共享的單一查詢,因此每個特徵子空間都必須透過同一個分佈來讀取深度歷史。此強迫性取捨的代價會隨著子空間在應讀取哪些層面上的分歧而增長,而分歧又隨模型寬度增加而加劇。我們提出多頭注意力殘差(Multi-Head Attention Residuals, MHAR):將路由查詢重塑為H個按子空間劃分的頭,每個頭對深度歷史各有其softmax。讀取操作因此成為區塊對角(block-diagonal),重塑不增加任何參數且計算量可忽略,而H = 1時則精確還原為注意力殘差。在經過去重、品質過濾且以STEM和程式碼為主的Nemotron退火語料庫上從頭訓練,MHAR在100M、350M和1B規模下相較於標準Transformer均改善了驗證損失(分別為-0.061、-0.149和-0.140)。它在所有設定中皆為四種方法中表現最佳者,且增益從100M到更大規模持續增加。頭數是一個真正的設計軸而非可自由調整的旋鈕:驗證損失相對於H呈U形分佈,在不同規模下於H = 4或H = 8處有平坦的最優區間。我們在大型模型中採用H = 8;超過此點過度分割(H = 16)會一致性地部分回吐增益。對訓練後查詢的直接探測證實,學習到的子空間分歧是背後的驅動因素。融合的Triton路由內核將注意力殘差訓練吞吐量從基線的0.2-0.5倍提升至0.55-0.88倍,同時維持接近基線的峰值記憶體。利用δ注意力殘差進行保恆等變換(identity-preserving conversion)支援8B中期訓練,在GSM8K上提升+3.2,在GPQA上提升+3.1。
深度學習革命由 AlexNet 開啟,教會我們端到端訓練優於將問題分解為手工設計的階段。然而,生成建模一直是個例外——儘管生成模型能力顯著,它們仍未被端到端訓練。這是因為生成建模的核心在於處理具有多個模態的分佈,而現有的可擴展方法皆以相同方式處理此問題:將生成過程分解,這阻礙了端到端生成。在本工作中,我們提出探索式建模(Explorative Modeling),一種新典範,其分解的是訓練迴圈而非生成過程:探索模型生成與資料之間的 K 個候選匹配,並在最佳匹配上訓練,使預測專注於模態而非模糊化它們。我們發現探索式模型(XMs)在兩種情境下具有價值。首先,增加探索為現有生成模型增添了一條超越參數與資料的第三條預訓練軸線——在連續與離散領域(影像、視訊與語言)中,擴展探索能單調地提升效能。值得注意的是,探索帶來的增益隨規模擴大而增加:隨資料擴展從 7% 攀升至 36%,隨模型成長從 13% 提升至 23%,而在 3 倍計算量下的效率增益更超過兩倍。具體而言,探索使 FLOP 效率提升 4.1 倍、樣本效率提升 6.2 倍、參數效率提升 47%,將最強的影像生成方案推升至 ImageNet 上無引導的近最佳 1.43 FID,實現現有模型端到端程度的擴展,並解鎖擴展泛化能力。其次,XM 實現了端到端的重建式生成建模,在控制任務上以 16–256 倍更少的推論步驟媲美擴散模型。綜合而言,這些結果確立了 XM 既作為現有生成模型的新預訓練軸線,也作為一種獨立的端到端生成建模典範。
已部署的LLM代理日益將其長期記憶保存為檔案系統:一個由Markdown檔案組成的目錄樹,代理本身透過通用檔案工具來讀取、寫入與重新組織這些檔案。然而,研究在很大程度上忽略了這種媒介:先前的系統設計了特製的記憶表徵,並研究在這些表徵上的檢索,使得此預設方法的兩項運作假設未經檢驗:其一,代理能否在記憶不斷累積、發生衝突與過時的情況下,持續維持一個不斷成長的儲存庫的組織性;其二,這種組織是否值得付出代價。我們提出了首個針對LLM代理基於檔案系統記憶的系統性探索。我們將此設定形式化為圍繞單一記憶檔案系統的三個角色:管理代理整合並組織進入的內容,搜尋代理以引用的來源回答查詢,執行代理提供任務軌跡並將其蒸餾為技能,從而在單一儲存庫中統一陳述性記憶與技能。在長對話基準測試與具身任務中,我們變異了記憶形狀(代理組織的階層結構、逐字傾印、區塊檢索)、串流規模、工具框架(沙盒shell、記憶工具風格的函式、多樣化的搜尋工具),以及管理代理和搜尋代理的強度,在記憶成長的過程中追蹤答案品質、成本與儲存庫健康度。組織所能穩定買到的是搜尋經濟性:當資料量大時,有組織的儲存庫約可將檢索成本減半。然而,當今的代理未能兌現此預設方法的承諾:在我們的成長研究中,除了最強的管理代理之外,所有情況下的組織性都會逐漸侵蝕,而且我們所測量的代理中,沒有任何一個能將組織本身轉化為更好的答案。此外,模型並非影響儲存庫形狀的唯一槓桿:僅更換工具集對儲存庫形狀的改變程度,與更換模型一樣顯著。本研究將檔案系統的預設做法從一個假設轉變為代理記憶的設計空間。
推測解碼(Speculative Decoding, SD)透過允許輕量級的草稿模型提出候選詞元,再由較大的目標模型進行平行驗證,以加速大型語言模型的推論。近期方法引入了有損驗證機制,透過放寬嚴格的分布匹配來進一步提升效率。然而,此類放寬會默默改寫解碼分布,所帶來的加速可能以不穩定、有時甚至嚴重劣化的生成品質為代價。在本研究中,我們對有損驗證方法所引發的分布提出了原則性分析。我們證明許多看似不同的方法僅在表面上有所差異,可歸類為兩大類:基於截斷的驗證與協作式驗證。我們進一步在精心挑選的基準測試上建構了一個診斷性評估框架。對於基於截斷的方法,我們發現一個根本性的陷阱:由於分布失真,其效能相較於真正的截斷取樣基準可能顯著下降。對於協作式驗證,我們揭示了一項關鍵原則:控制草稿機率相對目標機率的超出量,對於防止低品質輸出至關重要。我們的程式碼位於 https://github.com/ZhouYuxuanYX/Fast-HSD。
深度研究代理(Deep Research agents)將基於大型語言模型的助理擴展至涵蓋規劃、檢索、證據綜合與報告生成的長時程工作流程,然而其在開放資訊環境中的可靠性仍未獲充分探討。一個關鍵疑慮在於:在此類環境中所遭遇的表面可信但事實上有誤導性的知識,是否可能透過這些工作流程傳播,並在最終報告中被採納為錯誤結論。為研究此一失效模式,我們提出 MisKnow-Agent,一個用於建構並驗證深度研究任務中誤導性知識的框架。MisKnow-Agent 以可控的權威等級與風格生成誤導性實例,在 DeepResearch Benchmark 任務的基礎上產出 5,933 個品質受控的實例。涵蓋開源與閉源深度研究代理的大量實驗顯示,即使僅接觸少量的誤導性知識,也可能導致最終報告中錯誤結論的採納,揭示當前深度研究代理普遍存在的可靠性漏洞。儘管具備搜尋能力的驗證模型在聚焦式語料庫驗證中,能持續將保留的實例識別為具有誤導性,惟相同實例在長時程研究過程中仍可能被採納,顯示聚焦式驗證與工作流程層級之證據使用之間的脫節。最後,我們分別評估研究前與研究後的防禦機制,並檢視其組合效果,結果發現此三種配置雖能緩解錯誤結論的採納,卻無法完全防止其發生。我們的研究結果表明,可靠的深度研究需要在模型與框架層面同時具備證據驗證與修正能力,而非僅仰賴規劃、檢索、證據整合或報告生成能力的改進。
本文提出 AI Tour Meeting,一個由多個大型語言模型(LLM)代理驅動的團體旅遊規劃框架。這些代理以不同的角色實例化,並透過自然語言討論,協同尋求滿足其限制與偏好的行程。該框架提供介面以設定代理角色、討論工作流程、監控及 LLM 部署,從而易於且靈活地編排此類討論。其主要的應用情境是作為一個模擬工具,用於分析多個 LLM 代理在旅遊規劃討論過程中的行為。本文透過呈現系統驗證以及由該框架獲得的若干分析結果,來展示此框架的效用。
現有的全模態大型語言模型詞元壓縮方法通常依賴單一模態來決定另一模態中應保留的內容。我們證明此假設經常失效:對於同一查詢,音訊與視訊的相關性往往在不同時刻達到峰值。這種跨模態顯著性錯配使得單向引導在激進壓縮下容易丟棄答案關鍵線索。我們提出 OmniScope,一個免訓練的詞元壓縮框架,以查詢作為共享語義錨點,同時分別估計音訊與視訊的相關性。OmniScope 分配模態專屬詞元預算,使用錨點-差值策略剪枝視覺詞元,同時保留全域上下文與時序變化,並以每秒為單位合併音訊詞元,以減少冗餘同時維持時序連續性。在四個音訊-視訊基準測試與兩個 Qwen2.5-Omni 模型規模上,OmniScope 在所有壓縮設定下均達到最佳平均準確率。在25%整體詞元保留率下,它實現高達3.53倍的預填充加速與超過15%的GPU記憶體減少,平均準確率僅下降0.35個百分點。這些結果為 OmniLLM 推論提供了一個簡單的設計原則:跨模態共享查詢,但不共享顯著性估計。程式碼可在 https://github.com/MAC-AutoML/OmniScope 取得。
本工作提出「公平性剪枝」(Fairness Pruning),一種輕量級的結構性介入方法,旨在管理並於未來緩解大型語言模型(LLMs)中的人口統計偏誤。作為該方法的基礎實證驗證,本工作聚焦於因果偏誤定位。透過最小對比提示詞對與推論時激活值擷取,該方法可識別在GLU架構中處理人口統計屬性時產生差異反應的神經元,並在down_proj輸入端評估其訊號。實證評估係於最高達30億參數的模型(Llama-3.2系列與Salamandra-2B)上進行,結合標準化基準評測與質性文本生成實驗。結果顯示,將所識別之神經元歸零會改變模型對相關人口統計變項的回應方式。然而,此介入並非產生扁平化的緩解效果,而是造成雙向的偏誤去穩定化:由於BiasScore為無符號指標,候選集合中混雜了促成刻板印象與對抗刻板印象的神經元,而對整體偏誤的淨效應取決於何種符號居於主導地位。此介入極具精準性:在Llama-3.2-1B中至多歸零40個神經元(低於總MLP寬度的0.031%),即可在推理與一般知識能力上達到99.49%的平均保留率。這些發現實證確認了人口統計偏誤處理與模型能力可運作於可分離的電路上,為從盲目歸零邁向方向性行為調變建立了方法論基礎。
強化學習(RL)搜尋代理通常將檢索建模為自由形式的自然語言查詢生成,並使用最終答案獎勵來最佳化多輪互動。當前研究主要透過更密集或更有結構的信用訊號來改善訓練,但很少檢視檢索在策略-環境介面上是否被適當建構。我們觀察到 Search-R1 訓練期間存在顯著的檢索別名化:相同問題的展開軌跡持續生成不同的查詢字串,但它們累積的證據集卻日益重疊。我們將此現象稱為檢索等價崩潰;在此狀態下,軌跡在檢索決策方面趨近效用等價,導致組內回報缺乏有效的檢索對比。為了解決此問題,我們提出 Harness-G,一個重新設計此介面的圖結構檢索框架。它將自由形式的查詢生成重新建構為有限動作選擇:策略選擇一個證據句子或實體,或選擇回答,而環境負責建構選單、追蹤檢索狀態,並驗證與執行每個選擇。此介面減少了語言別名化,使同狀態下的替代方案可直接比較。在此介面基礎上,我們引入結構化非短視信用(SNC),它使用凍結的答案評分器將選定動作與其替代方案進行比較,並將下游收益分配給促成這些收益的較早動作。在六個問答基準上,Harness-G 在兩個評估的模型規模下均達成最高的平均 F1,在 1.5B 和 3B 規模下分別超越最強基線 Graph-R1 10.74 分和 3.98 分。
稀疏混合專家(MoE)語言模型將每個 token 路由至多個專家,這暗示其效益可由幾何學觀點解釋:共同被選中的專家應貢獻不同的表徵方向。既有證據往往混淆了路由一致性、候選品質,以及候選與上下文之間的交互作用。我們使用專家子空間分離指數(ESSI)、匹配路由殘差與前綴控制的 2×2 因子設計區分這些量;並以凍結路由干預與受控 Top-k 研究評估其功能價值。三組配對對比組織了研究結果。首先,在六種 MoE 架構中,專家子空間大幅重疊,但實際路由對 token 表徵的解釋力仍優於匹配的替代方案。其次,在 OLMoE、Mixtral 與 DeepSeek 的 39 個因子設計單元中,被選中的候選者對殘差表徵的解釋力皆高於最強的未選中競爭者;然而,實際前綴在每個單元中都縮小了此優勢:所有交互作用皆為負向,且每個 95% 信賴區間都低於零。第三,此幾何縮窄並不意味著功能性冗餘:在 39 個凍結路由比較中,有 24 個顯示添加後續專家能改善下一個 token 預測,其餘 15 個估計則不具結論性;一項受控訓練研究也在全部三個隨機種子中偏好 Top-2 勝於 Top-1。我們將此聯合模式稱為「一致性重疊」:路由從共享的幾何鄰域中選取與 token 相關的專家,而實用的多專家計算仍然存在,無需不相交的線性覆蓋。區分這些量有助於釐清為何僅憑幾何相似性無法決定冗餘性或剪枝價值。
裝置端語音情緒辨識(SER)對即時應用至關重要,然而在 SER 上表現優異的大型自監督模型對邊緣裝置而言成本過高。多教師知識蒸餾可將這些模型壓縮為輕量級學生模型,但仍存在兩項挑戰:教師模型的可靠性會因批次而異,且 logit 層級的蒸餾忽略了樣本間的關係結構。我們提出自適應多教師關係蒸餾(AMRD)來處理這兩個問題。透過對每個教師的 logit 相似度矩陣採用單類別支援向量機,指派每批次權重,傾向於一致性較高的教師。關係蒸餾損失函數對齊教師與學生的相似度矩陣,捕捉 logit 匹配所遺漏的結構。在 IEMOCAP 與 CREMA-D 資料集上,跨越四種學生架構,AMRD 在多數設定下優於單一教師蒸餾的基線方法;消融實驗亦證實兩項組成能產生互補的增益。
在我們先前的研究《Pedestrian Archetypes》中,我們將行人原型定義為能獨特識別特定類型行人的行為集合。第一篇文章提出了12種行人原型,包括Wanderer、Drunk、Distracted、Flash、Indecisive、Blind、Flock、Jaywalker、Elderly、Kid、Eventful與Parked Pedestrian。這些原型的提出,旨在超越單一的行為標籤,並提供一種更自然的方式,來描述危險行人在真實交通情境中實際上如何逐步地表現其行為。然而,在進一步標註YouTube行車記錄器影片後,我們識別出7個額外的行人原型,這些原型與先前提出的原型相比,具有可觀察且顯著的行為差異。這些新原型捕捉到了原始分類法無法完全解釋的行人行為模式。在本預印本中,我們介紹每個新原型,定義其必要行為與可選行為,解釋它與先前提出的原型有何不同,並提供影片幀證據,展示該原型的實際運作。