每日精選AI研究論文及翻譯
通用語言模型能夠推理與整合知識,但複雜工作還需要與檔案、資訊來源及可執行程式碼進行持續互動,同時具備狀態維護、故障恢復與可驗證的交付能力。我們將此稱之為「工作能力」:對真實世界目標持續且可驗證的進展。Apodex 1.1 沿兩個互補維度發展此能力。「環境擴展」提升可執行檔案、搜尋與程式碼環境的多樣性與可驗證性;「智能體協調擴展」則訓練智能體分解長時程任務、委派並行工作、整合非同步結果並重新規劃。共享的執行框架與 AgentOS 負責跨工具與智能體維護任務狀態及來源追蹤,而訓練過程則將環境軌跡與協調痕跡轉化為可靠的行為。在複雜專業工作、金融、科學研究、數學、程式設計與搜尋等領域,Apodex 1.1 儘管使用的模型規模遠小於許多前沿系統,仍達到領先的效能區間。350億參數的 Apodex 1.1 Mini 更以本地可部署的型態保留了強大的工作能力。這些成果將智能體智慧奠基於隨時間推進、有用且可驗證的工作之上,並推進我們建構「重型求解器」以處理宏大且長期的任務之目標。
我們提出 EchoWM,這是一個用於可進入式生成媒體的全模態世界模型,能夠回應連續導覽,同時聯合生成 720p 影片、環境音、音樂與語音。我們圍繞相機意圖組織互動:在第一人稱場景中,它指定觀察者的運動;而在第三人稱場景中,相機-角色動態則從資料中學習,無需視角專用控制器。離散指令與連續姿態被對應到共享的公尺度相對六自由度軌跡,並透過資料集層級校正來保留異質資料中的運動幅度。為了聯合學習視聽生成與軌跡控制,我們建構了互補性的資料引擎,並採用漸進式訓練,接著進行自迴歸後訓練以支援長時程生成。廣泛的評估顯示,EchoWM 在公開世界模型基準上實現了強大的軌跡跟隨能力與高視覺品質,支援多種主體的第一人稱與第三人稱互動,並在長時程生成中維持同步的環境音與語音。
電商直播需要對嘈雜且時間上延伸的串流進行全模態理解,其中產品事實分佈於語音、影片幀、產品圖片、疊加文字和使用者查詢中。我們提出 TLive-Omni,一個專為直播電商場景設計的全模態理解模型,能將影像、影片、音訊和文字輸入映射至統一的表示空間。針對長時直播串流分析,我們引入 Per-vGrid,一種帶有時間戳記的 token 組織方式,將每個影片網格與其時間上對應的音訊分組於明確的邊界 token 之內,以促進時間對齊。我們設計了一套三階段監督式訓練流程,從全模態感知到指令跟隨回應,逐步發展直播電商理解能力。接著,我們提出 Faithful-RFT 強化微調階段,在滿足即時性需求的同時,進一步提升答案忠實度與表達品質,直接以任務可驗證的回饋評分最終回應,而非在 rollout 期間針對推理式探索進行最佳化。此外,TLive-Omni 由一個面向場景的原子能力分類法及一個緊湊的資料生產引擎所支援;該引擎可將直播電商的音訊、影像和影片串流轉換為訓練訊號,用於語音辨識、說話者分析、產品視覺定位、文字辨識、時間定位、影片密集描述及全模態問答等任務。為了可擴展的訓練,一個同步的長度分組採樣器在維持各工作節點工作量相當的同時減少填充;而一個輕量級動態採樣策略會重新生成 rollout 群組,其獎勵變異數接近零,以維持 GRPO 的有意義相對優勢。在電商直播基準上的實驗顯示,TLive-Omni 在直播電商領域任務上表現強勁,同時在一般基準上亦具備優異的泛化能力。
現有的影像編輯框架主要遵循文字到影像擴散模型的訓練範式。然而,將此範式擴展至影像編輯時,凸顯了兩個固有的差異:具體而言,一是對編輯概念粒度的關注不足,二是因稀疏監督訊號而導致的訓練效率低落。為了解決這些問題,我們建立了一個涵蓋超過 1,000 個細粒度編輯概念的全面層級式分類體系,並透過改良的合成框架構建了 ConceptEdit-12M,這是一個包含 1,200 萬對高品質編輯配對的大規模資料集。這種以概念庫驅動的方法有效矯正了生成資料的分佈崩潰問題,同時確保了高資料保真度。此外,我們提出了一種密集監督訓練策略,將多個互不干擾的概念合成至單一影像配對中。透過提供更豐富的學習訊號,此策略顯著提升了訓練效率與整體模型效能。訓練結果驗證了我們的策略,其表現顯著優於先前的研究。最後,我們提出了 ConceptEdit-Bench,這是一個旨在於廣泛真實世界場景中診斷模型能力的細粒度評估套件。
隨著裝置端 LLM 代理演進為個人助手,行動作業系統已成為此一典範的關鍵測試場域,嚴謹的能力評估因而至關重要。然而,現有基準分屬兩大陣營,各具關鍵盲點:以圖形介面為中心的基準測試表面層級的螢幕操作,卻忽略背景工具使用與長程規劃;而靜態函式呼叫基準則依賴於脫離真實執行時期約束的離線 API 比對。為填補此缺口,我們提出 MobilePA-Bench——一個互動式、具狀態且以工具為中心的基準,用於評估行動規劃代理的工具呼叫與規劃能力。MobilePA-Bench 在可執行沙盒中運行,維護即時應用程式資料庫並回傳結構化回饋,涵蓋 13 個功能領域與 212 個真實行動工具。除基本工具使用外,它沿三個進階維度評估中央規劃代理:(1) 子代理協作——分解複雜任務並將專業工作委派給具備能力的子代理;(2) 記憶使用——回憶已儲存的記憶、使用者設定檔與過往偏好,以解決隱含請求;以及 (3) 技能使用——呼叫預先封裝的複合技能,而非從零開始規劃每個步驟。大規模實驗顯示,當前前沿 LLM 在行動環境中仍不夠可靠:在嚴格的工具順序、權限限制與意外執行時期錯誤下,效能急遽下降。藉由將互動式函式呼叫沙盒與基於證據的驗證相結合,MobilePA-Bench 既作為實用的診斷基準,亦為代理式強化學習的互動基礎——加速可靠行動代理的開發。
語言模型是序列處理器,但長時程代理需要模型權重與活動上下文之外的外部資訊與計算。Prime Agent 是一個開源框架,用於長時程評估與編碼代理工作流程。一個常駐的 IPython REPL 遵循遞迴語言模型抽象,以進行程式化上下文處理與測試時計算,而 Continual Harness 跨軌跡保留歷史記錄、記憶、技能、提示詞與子代理規格。遞迴子代理透過代理對代理的直接通訊來協調,而代理視圖(Agents View)讓人類可以檢視與管理由 daemon 支援的會話。Prime Agent 標準化了執行、復原、驗證與資源核算,同時將策略構建留給模型。這種低摩擦、高表達力的介面可防止框架失敗演變成模型失敗,並將測量推向模型真實的最大潛在能力。Prime Agent 將 ARC-AGI-3 RHAE Best@1 從 30% 提升至 95.5%,並在長上下文編程、GPU 核心生成、模擬器建構與自主 nanoGPT 速通方面,匹配或超越原生及主流框架。在 Factorio 中,我們發現精煉能實現持續的科技進展,而專用子代理能實現並行化工作。程式碼位於 https://github.com/PrimeIntellect-ai/prime-agent。
雖然文字轉 3D 生成技術已快速進展,但在低推理成本下達成高幾何保真度仍具挑戰性。現有的文字轉 3D 方法,要麼以自迴歸方式逐一解碼離散形狀 token,要麼藉由擴散或流模型反覆精化整體 3D 表示。然而,自迴歸解碼具序列性且無法修正錯誤,而擴散與流匹配模型則會反覆處理完整的表示,使得高品質生成日益昂貴。在本文中,我們提出 Block3D,一種區塊式擴散框架,其將離散形狀 token 序列分割為連續區塊,以自迴歸方式生成各區塊,並對當前區塊內的所有 token 進行聯合去噪。為減輕錯誤累積,我們引入信心引導的區塊內修正機制,在每個區塊最終確定之前修訂低信心度的 token。在 TRELLIS-500K 的保留集上,Block3D 將平均端到端生成時間從 25.71 秒降至 4.99 秒,相較於微調後的自迴歸基線取得 5.15 倍加速,且不犧牲幾何保真度。
世界行動模型(WAMs)透過將未來世界演化納入動作生成來改善規劃,然而現有方法對每個場景都分配固定的想像預算。我們提出 RISE(透過選擇性展開精煉想像),這是一個系統層級的自適應想像框架,依據繼續展開的預期規劃效益來做出序列化的 Roll/Stop(展開/停止)決策。在每一步中,潛在評估器(Latent Evaluator)估計當前前綴所揭示的風險,以及若繼續想像能為規劃帶來多少改善;同時,展開門控(Rollout Gate)將此預期效益與額外的計算成本進行權衡。由於事實駕駛日誌僅揭露單一已實現的未來,我們進一步建構了 CounterDrive,一個具有多樣化結果與風險等級的反事實資料集,以豐富未來動態並提供局部化風險監督。每個保留的樣本都經過專家驗證,並對軌跡有效性、事件發生點與因果類別進行標註,為安全關鍵的世界建模研究提供了可重複使用的資源。在 NAVSIM 與 nuScenes 上的實驗顯示,RISE 在減少不必要展開的同時達到了最佳的整體規劃效能,額外的遷移結果也支持其跨 WAM 架構的即插即用通用性。
在真實工業場景中,用戶表示學習通常透過擴大用戶數量、行為序列長度與模型規模來進行擴展。然而,現有方法面臨兩項挑戰:(i)在十億級規模下,原始資料擴展存在瓶頸——當原始文本用戶行為輸入的規模擴大時,效能增益會遞減,而詞元化可緩解此問題;(ii)缺乏對詞元化配置應如何隨資料規模擴展的定量分析。本報告提出「用戶行為緻密化定律」,用於刻畫資料規模與最小足夠詞元化容量之間的定量關係。首先,我們在十億級支付寶資料集上進行原始資料與詞元化擴展的對比先導研究,揭示原始資料擴展的瓶頸以及詞元化帶來的持續增益。為推導在不同資料規模下支配最小足夠詞元化配置的擴展規律,我們結合理論分析與系統性實驗,總結出定量擴展模式。我們發現,最小足夠詞元化容量與以詞元計量的輸入資料規模,兩者的對數之間存在近似線性關係,且擴展斜率隨詞元化方法與資料來源系統性地變化,反映表示空間冗餘度與來源內部獨特性的差異。在上述定律的指引下,我們進一步開發 ALGN——一種自適應可變長度詞元化方法,以改善容量配置。涵蓋多種資料來源、詞元化方法與下游任務的大量實驗證實了「用戶行為緻密化定律」的泛化性與可靠性,為大規模用戶表示學習中的詞元化配置選擇提供實用指引。此外,ALGN 優於現有基線方法。
一個互動式世界模型必須遵循使用者的動作,記住它展示過的地方,並即時串流。這種張力是結構性的:控制需要短期視野,記憶需要無界視野。ReWorld在訓練時將兩者分離,並在推論時為其設限。混合的逐頭注意力視窗將大多數頭限制在近期,而一小組全局頭則關注整個歷史;隨機頭路由防止任一能力綁定到特定頭;隨機區塊丟棄則使稀疏歷史落在分佈內。在推論時,整個過去都受到固定預算的約束:一個由位姿索引地標庫支撐的有界KV快取,模型從中檢索與當前位姿最近的地標。一個度量尺度對齊的資料引擎將八個來源——Unreal渲染的飛越鏡頭、遊戲漫遊和真實世界影片——置於同一物理動作尺度上,因此相同的按鍵在每個來源中都能讓攝影機移動相同的距離;迴文軌跡則提供了記憶訓練所需的重訪證據。僅限於LoRA適配器的分佈匹配蒸餾將取樣壓縮為四步:單一骨幹網路同時支撐高保真多步模式與即時互動模式,在照片級寫實、遊戲風格和風格化世界中串流704×1280影片。在涵蓋動作跟隨、長時域回憶與影片品質的三軸協議下,與六個近期的互動世界模型相比,它達到了最佳控制保真度(11.95°旋轉誤差與最佳攝影機運動一致性)以及最佳生成品質;在長達一分鐘的去回推演(64秒,384個潛在變量)中,其固定12區塊快取仍能重新生成起始視圖——而在這種推演長度下,滑動視窗早已將證據逐出,完整KV注意力也耗盡了記憶體。
針對大型語言模型的策略優化(PO)面臨穩定性與探索之間的權衡,目前透過動作側的策略KL正則化器來調節。這使從業者陷入雙重束縛:保留策略KL會約束回應行為並消耗動作側的探索預算;而將其移除則使優化過程缺乏明確的漂移控制。我們提出另一種替代方案,透過將正則化移至輸入側來打破此困境。隨著訓練進行,當前策略所誘導的訓練查詢分佈會不受控制地偏離其在強化學習前的參考分佈。具體而言,環境正則化策略優化(ERPO)引入了查詢KL(QKL)項,用以限制查詢分佈偏移,並結合由資料集靜態參考推導出的逐查詢權重,使每次逐查詢更新偏向於參考下的典型查詢。QKL梯度嚴格地經由查詢似然傳遞;策略梯度估計器所使用的回應評分函數不會出現在QKL項中,因此QKL對回應分佈不施加直接的梯度壓力——探索因而得以保留。ERPO可整合至GRPO/PPO/REINFORCE風格的流程中,且無需額外的前向傳播。在六個數學推理基準上,ERPO取代了標準的策略KL正則化器,同時實現對查詢分佈漂移的有效控制,並帶來更強的準確性,且在高溫解碼與長視野訓練下表現顯著更穩定。我們的原始碼可在 https://github.com/alibaba/ERPO 取得。
開放式真實世界互動允許多種有效行為:智能體可以直接回答、請求澄清、提供進度更新,或在行動前確認。這種靈活性打破了基於群組的強化學習背後的一項核心假設:群組內相互比較的 rollout 不再保證在行為上具有可比性。因此,獎勵模型對互動風格的偏好可能扭曲相對優勢,並將優化導向獎勵偏好的行為,而非符合情境的行為。我們將此形式化為獎勵公平性問題,並提出 ARC(Advantage Regularization via Conditioning,基於條件化的優勢正則化),這是一種透過策略條件化的 rollout 分組,並結合混合獎勵與熵正則化,以恢復更公平相對比較的訓練方案。我們在所提出的 \inter 中研究 ARC,\inter 是一個用於回應式、可引導且具執行感知能力的使用者-智能體互動的新範式,可將使用者可見的通訊與潛在推理及工具使用解耦。\inter 也提供了建構 \inter-86K 的標註與蒸餾流程;\inter-86K 是我們用於監督式與強化學習訓練的策略標註訓練語料庫。實驗上,ARC 大幅增強了核心的 τ/τ^2 工具使用基準,而 \inter 相對於思考式基線,將 time-to-first-token 從 4.91 秒降至 1.27 秒。這些結果共同表明,開放式互動學習中的一個核心瓶頸不僅在於智能體如何被獎勵,更在於其行為是否首先被公平地比較。ARC 的實作程式碼與 \inter-86K 訓練資料將予以釋出。
近期的大型語言模型(LLMs)可作為編程智能體,依據自然語言請求建構完整遊戲。遊戲開發尤其具有挑戰性,因為程式邏輯、視覺與音訊內容、介面、互動性與可玩性必須在單一可執行成品中協同運作。因此,衡量此能力須同時評估遊戲產品與開發過程。現有基準測試常透過評估最終成品或單一開發階段來衡量 LLM 的遊戲開發能力。我們對完整的人類與智能體開發軌跡進行分析,識別出三個階段,共同涵蓋以編程智能體進行遊戲開發的生命週期:初始遊戲生成、錯誤診斷與修復,以及多輪最佳化。為此,我們提出 GameXpert-Bench,將三個生命週期階段操作化為三個互補的基準測試軌道。GameGen 評估在空白工作區中從單一請求進行完整遊戲創作的能力。GameFix 評估在缺陷被回報或留待智能體自行發現時的診斷與修復能力。GameOpt 則透過以使用者與智能體之間的實際開發軌跡為種子之請求鏈,評估累積式最佳化。我們以即時遊戲互動、確定性行為測試或帶有回歸檢查的最終產品標準來評估每個軌道。此測試套件包含 11 個遊戲類型中的 97 個生成任務;來自 50 個經人工驗證之遊戲關卡的 100 個修復任務,每個關卡有 19 至 27 個注入的缺陷;以及 17 個最佳化鏈,共六輪、102 個請求。在三個軌道中,當前智能體在產出可遊玩的基礎與實作明確需求方面,比在發現缺陷、驗證運行時行為以及跨變更保持功能方面更為可靠。
近期的代理基準(agent benchmarks)日益將評估立基於可執行的環境中,涵蓋範圍從程式碼修復到網頁導航、應用程式介面(API)與函式呼叫。然而,完成程式碼以外的具影響性工作,遠不止於產出看似合理的回應或有效的工具呼叫:代理必須在多輪互動中收集遺漏的資訊、遵循領域政策、協調相互依賴的工具,並在不產生附帶影響的情況下實現正確的持久狀態轉換。在本文中,我們介紹 Thinkingbox,一個用於工具—代理—使用者互動的沙盒環境,提供隔離的 MCP 相容工具工作階段、完整的執行軌跡,以及對終端後端狀態的結果評估。基於此沙盒,Thinkingbox-bench 包含橫跨多種情境的 507 個政策條件化工作流程,涵蓋零售、旅宿業、汽車保險、純網銀內部資訊科技,以及顧問公司的資訊科技/人力資源支援等領域。每次嘗試皆由任務特定的可執行檢查進行評估,這些檢查接受有效的軌跡,同時拒絕錯誤、遺漏或額外的影響;指定的任務還會額外檢查最終回應的必需屬性。在專有與開放權重模型中,最強的模型達到 65.36% 的 pass@1,但僅有 25.25% 的 pass^20。此外,許多失敗的試驗顯示正常終止與有效的狀態變更動作,這表明回應或工具呼叫層級的信號並不能清晰代理端對端任務的完成情況。Thinkingbox-bench 揭示了偶爾找到成功軌跡與可靠完成具狀態商業任務之間的巨大差距。我們發布 Thinkingbox 與 Thinkingbox-Bench:https://github.com/microsoft/thinkingbox
為了廉價地提供大型語言模型服務,日益依賴於同時將模型進行結構壓縮至原有參數量的極小比例,並量化至4位元。這些步驟共同導致推理、數學、程式設計與長上下文行為的退化,因此在部署之前需要一個恢復或修復階段。預設的配方——量化感知訓練(QAT)——會將壓縮且量化後的模型重新擬合至硬標籤;在我們的流程中,該方法收斂緩慢,且在超過峰值後急劇崩潰。我們改採用量化感知修復(QAH)。由於結構壓縮後的模型從未以全精度獨立訓練,其bfloat16檢查點是原始模型的蒸餾恢復近似;QAH直接將4位元學生模型從原始未壓縮模型蒸餾而得。在GPT-OSS 120B到60B再到MXFP4的流程中,QAH學生模型在9項基準測試中的7項達到或超越其bfloat16來源模型的表現,同時權重記憶體約減少至四分之一,參數量僅為教師模型的一半,並以Hypernova-60B之名對外發布開放權重。相較於匹配的QAT基線,QAH約快7倍達到可比峰值,且在持續訓練下保持穩定,無需手動調整的早期停止機制。我們也報告部署方面的經驗教訓,包括分散式訓練後端之間存在顯著且可重現的品質差距。我們的目標是提供一套無需數週超參數搜尋即可部署的配方。
自主研究系統日益具備執行長期研究工作流程的能力,然而僅靠自動化並不能確保整個過程維持科學嚴謹性。我們提出AutoResearch,一個兩階段系統,將想法生成與想法執行相銜接,以同時解決研究想法如何形成,以及如何透過實驗可靠地確立這些想法。在想法生成階段,AutoResearch持續整合新興研究訊號與累積的領域知識,識別可遷移的機制性洞見,並運用多模型生成與交叉審查,產出具嚴謹基礎且可驗證的研究計畫。在想法執行階段,協調式代理將這些計畫拆解為實驗,迭代地實作與診斷,並在採納研究結論前,進行獨立的證據本位審查。在跨模態檢索、系統最佳化及基準驅動的機器學習等代表性情境中,AutoResearch能將生成的想法轉化為可衡量的進展,偵測並修正不可靠的實驗結果,並做出以證據為條件的決策——繼續、修訂或終止研究方向。例如,在RSICD基準中,一個由AutoResearch生成的想法將平均Recall從32.84提升至34.69,且僅記錄了5次經稽核確認的問題事件,而其他自主研究系統則為11至27次。這些結果證明了一套研究流程:有意義的洞見在實驗之前即已確立基礎,結論在接受之前亦已確立基礎——洞見輸入,幻覺輸出。
同策略蒸餾(OPD)已成為語言模型後訓練的有效框架,其做法是將學生生成的軌跡與教師提供的密集詞元級別監督配對。然而,OPD 隱含地假設教師衍生的獎勵是推理進展的適當代理指標,因此在策略優化過程中對所有教師回饋一視同仁。但在實務上,此一假設並非總是成立。我們觀察到,教師衍生的獎勵往往與真實的推理進展產生衝突,因為具有明確推理推進的推理步驟,仍可能僅因偏離教師的輸出而獲得較低的蒸餾獎勵。為了解決此一不一致性,我們提出適用於同策略蒸餾的推理進展感知獎勵過濾方法(R2-OPD),該方法在軌跡內建構兩組推理片段排序,一組來自教師衍生的獎勵,另一組則來自獨立估計的進展獎勵。每當兩組排序不一致時,蒸餾獎勵會被選擇性地抑制,從而減少與推理進展相衝突的監督,同時保留有效的教師引導。我們的實驗方法在標準 OPD 的基礎上展現出持續的改進,尤其在推理表現方面。
我們提出了一種通過自適應驗證任務選擇來實現高效 LLM 評估框架優化的新方法。評估框架優化會根據驗證性能反覆改寫評估框架代碼,從而在不更新底層模型權重的情況下實現顯著的性能提升。然而,現有方法在每次迭代中都會完整評估一個固定的驗證集,即使在評估框架演進過程中某些任務的區分度降低,仍會產生大量評估成本。我們提出了 Task-CoEvolve,它通過解決兩個挑戰來使驗證任務與評估框架共同演進:選擇具有信息量的任務,以及從部分評估中估計完整集合的性能。Task-CoEvolve 基於以下觀察:候選評估框架之間存在分歧的任務,比起那些一直被解決或失敗的任務,更能有效區分這些評估框架。它根據過去的結果使用方差加權抽樣,將評估重點放在能力前沿附近的任務上,並且抽樣分佈會隨著評估框架的演進而自適應調整。然後,它通過考慮抽樣概率,從抽樣任務中估計完整集合的分數,從而在評估不同子集的情況下,仍能實現跨迭代的一致比較。在線上文本分類和 Terminal-Bench 2.1 上的實驗表明,Task-CoEvolve 持續優於基於子集的基線方法,並且在將優化過程中的評估次數減少 80% 的同時,達到了與完整集合搜索相當的最終性能。代碼將發佈於 https://github.com/Agent4Science-UTokyo/Task-CoEvolve。
大型語言模型日益被期望執行複雜的工作流程,其成功取決於維持相互依存的約束條件,並產出能通過嚴格端對端驗證的成果。然而,成功的執行經驗通常在一次運行後即告遺失,迫使後續模型從頭重新發掘策略與失敗模式。我們研究此類經驗是否能透過 EvoMap 被外部化並重複使用——在該框架中,經驗證器確認的執行軌跡會被整合成結構化的 Gene。為評估此設定,我們引入了長工作流程基準測試(LongWoF-Bench),包含 778 項可機器驗證的任務,涵蓋程式碼生成、代理-環境合成、數學推理與規則遵循等範疇。在 252 項具備驗證器確認之 Opus 軌跡的任務中,經過演化產生的 EvoMap Gene 在所有七個受評模型中皆優於 Skill,領先幅度為 8.7 至 15.5 個百分點,且此優勢延伸至不同模型家族中的消費級模型。相較之下,經參考蒸餾所得的 Gene 並未展現相同優勢,這表明僅有緊湊的表示形式並不足夠,Gene 的效用與經驗證的經驗來源密切相關。對於 Claude Opus,Gene 重用亦比 Skill 多完成了 39 項任務,同時將求解階段的 token 消耗降低了 9.9%。綜合而言,這些結果顯示經驗證的執行經驗可以被保留並作為可重用的外部資源加以共享,使模型能夠在不重複支付完整經驗發現成本的情況下,提升長工作流程的完成表現。
基於語音的應用程式在進入任何檢索模組之前,會先透過自動語音辨識(ASR)處理口語查詢,因此 ASR 錯誤會作為固定的上游限制進入流程。我們以實證方式測試標準檢索增強生成(RAG)的兩種擴充——實體圖譜連結與迭代式重述——是吸收還是放大這些錯誤。使用透過神經 TTS 合成的四種英語口音,我們在三個多跳問答基準(HotpotQA、2WikiMultiHopQA 和 MuSiQue)上評估四種 RAG 配置,並與乾淨文本的 oracle 對照進行比較。儘管結構上更豐富的配置在 ASR 輸入下通常保留較高的絕對 F1,但兩種擴充都會放大錯誤:在所有三個基準上,其組合在乾淨文本與最高 WER 口音之間的 F1 差距比單純的密集檢索高出 36–67%。主要的失敗模式是一個或多個查詢實體被破壞,這在 2WikiMultiHopQA 上佔所有四種方法退化案例的 87–96%。兩種輕量級的表面形式緩解措施幾乎未縮小這一差距,表明下游檢索結構會放大剩餘的實體錯誤。我們在 https://github.com/ZhenghuaBao/spoken-multihop-rag 發布程式碼與資料。
大型語言模型(LLM)中的長上下文預填充會產生可觀的計算與記憶體流量,因為密集自注意力會計算二次方的查詢-鍵分數。現有方法要麼採用均勻低精度路徑,要麼選擇性地處理詞元互動,均未在融合密集注意力內對硬體對齊的分數分塊進行空間精度路由。我們提出 TileMix,一種以分塊為中心的精度路由核心,將數值精度轉化為融合密集注意力中對分數分塊群組的可執行空間決策。TileMix 將注意力矩陣劃分為硬體對齊的分數分塊,將路由決策打包成緊湊的位元遮罩,並透過 FP16 或 INT8 分數計算分派每個分塊群組,同時兩條路徑皆更新共享的線上 softmax 狀態。可擴展的精度分組使每個路由位元能管轄多個相鄰的鍵分塊,從而在長上下文下維持硬體對齊的計算分塊與緊湊的中繼資料。透過對所有合法分塊群組進行路由,TileMix 保持密集的詞元連通性,無需訓練,並支援分組查詢注意力、可變長度批次與 INT8 鍵/值快取。在 LongEval、LV-Eval 與 A100 預填充基準上,針對 LLaMA、Qwen 與 Vicuna,TileMix 恢復了在均勻 INT8 下遺失的長上下文品質,並較 FP16 提升預填充吞吐量,在各種模型家族中產生可控的準確度-效率前緣。實作程式碼位於 https://github.com/HanzhiZhang-Ulrica/TileMix。
工業技術報告包含對於維護、故障排除與產品工程具有高價值的知識,但其異質結構(密集的文字敘述、規格、表格)使得標準檢索與問答流程難以對其進行索引和推理,且目前沒有從此類文件建構的公開指令微調或基準資料集。我們透過 Industrial-Instruction 填補此缺口,貢獻 (i) 兩個從真實工業技術報告建構的開放式問答資料集,以及 (ii) 產生這些資料集的端對端流程。利用 906 份公開的 Panasonic 文件(7,525 頁),我們應用版面感知抽取、建立語義檢索索引,並在五種查詢-文件關係(不相關檢索、單文件/多文件支持、單文件/多文件答案)下,綜合以檢索到的證據為基礎的多選題問答。在過濾初始的 23.9k 個生成樣本後,每個資料集提供約 13.6k 個問答對,附有來源文件和一個留出的基準測試分割。對小型開放式大型語言模型(低於 10B 參數)進行微調,可將 Panasonic 基準上的 Set-Match Accuracy 從 28.5% 提升至 42.0%,F1 從 46.6% 提升至 63.5%。我們發布由相同流程產生的兩個平行版本:一個使用開放權重的 Qwen3-30B-A3B-Instruct 模型生成,另一個使用封閉式、基於 API 的 Claude-Opus-4.6 模型生成,從而能夠直接比較開放式資料生成與前沿模型資料生成。Claude-Opus-4.6 資料集產生了更乾淨的原始語料庫和更大的微調增益,但成本約高出兩個數量級。MMLU 評估顯示,在 Claude-Opus-4.6 資料上訓練的模型基本上保留了所有一般知識,而 Qwen 生成資料則表現出雖小但可測量的遺忘效應。總而言之,這些資料集和流程為從真實世界文件建構可擴展的工業基準和訓練資料,提供了一條實用且可重現的途徑。
搜尋增強的大語言模型(LLMs)透過檢索即時網路內容,日益成為日常消費推薦的中介。這帶來了一項新風險:LLM 推薦系統可能消費已被生成式引擎優化(Generative Engine Optimization, GEO)操作者污染、用以誤導系統的網路內容。我們探討的問題是:LLM 在多大程度上會不自覺地成為虛假產品的推銷者?我們提出 FORGE(Fake Online Recommendations in Generative Environments,生成環境中的虛假線上推薦)框架,將固定的檢索網頁集合中的真實產品局部改寫為虛假產品,並衡量 LLM 推薦該虛假產品的頻率;此評估涵蓋 15 個類別、225 個真實產品與 5 種消費情境。在 12 個商用與開放權重的 LLM 中,所有模型都存在此漏洞:單一受污染網頁即可造成高達 27% 的受騙率,而完整的前三名替換則將此比例提升至 73.8%。漏洞程度因類別而異,當模型缺乏對產品的穩定既有知識時,漏洞會增加。推理無法緩解此漏洞;相反地,推理往往會產生虛假的社會證明來為錯誤推薦辯護。四種防禦措施皆不足以應對:懷疑提示詞可能如同推理一樣加劇漏洞,兩種共識過濾器有壓抑合法產品的風險,而可信度重排序雖然對每個模型都有所幫助,但僅能移除六分之一的虛假產品。我們在 https://github.com/leoluolol/forge-benchmark 發布 FORGE 基準資料集與評估程式碼。
隨著檢索增強生成(RAG)轉向多樣化的組合生成,其進展受到兩個關鍵瓶頸的阻礙:證據利用的衡量方式存在缺陷,以及上下文預算分配次優。我們依序解決這兩個問題。 為了解決衡量問題,我們揭示了一種普遍的「診斷幻覺」:標準的相關性代理指標在困難負樣本上會災難性地失效。我們以一種高效的因果留一法探針取代它們,該探針能精確地分離生成依賴,並正式校準LLM注意力的結構性稀釋。 為了解決分配問題,我們在一個去混雜因子網格中部署此因果探針。我們證明,普遍採用的整體式上下文加寬策略是一種受相關性衰減懲罰的架構陷阱。相反地,將計算資源迭代地分配至多個連續生成步驟,可帶來16.7至20.5個絕對百分點的變革性組合召回增益,並能穩健擴展至32B模型。 最後,我們將這些解決方案統整為一個可部署的閉環子模調度器。透過歸因引導的對比解碼器來覆寫LLM的注意力慣性,我們的架構系統性地強制整合新證據。藉由勝過經典的開環基線,我們確立了順序、反饋驅動的編排作為生成式搜尋的決定性範式。我們的程式碼、資料與因果衡量工具可在 https://github.com/PeiYangLiu/ascp 取得。
檢索增強問答系統在索引擴充後,即使其請求的模型識別碼、提示、檢索策略、證據深度、渲染方式及暴露的生成控制設定均保持固定,仍可能回傳不同答案。當增益與損失相互抵銷時,總體準確度可能掩蓋這些變化;而一般的生成變異又會使一次性比較高估更新效果。我們將此隱藏現象稱為準確度盲區答案更迭(accuracy-blind answer churn),並引入快照相容性稽核(Snapshot Compatibility Audit),其透過從跨快照分歧中減去同一快照重複執行的分歧,來估計超額答案更迭。我們透過將一個凍結的 FineWeb 前綴從一個分片擴充至七個分片來實例化此方法。在一項預先註冊的 400 題 Natural Questions 研究中,標準化精確與盲式語義的超額更迭分別為 6.44 與 10.25 個百分點,而精確匹配準確度僅變化 -1.50 個百分點。事後分析發現 40/400 題存在重複穩定的語義翻轉。另一項另行預先註冊的 200 題 TriviaQA 研究產生較小且方向一致的超額更迭,而精確匹配準確度則朝相反方向變動。一項結果盲式的事後 100 題子集複現,使用第二個 DeepSeek 生成器與部署配置,發現語義超額更迭達 8.75 個百分點,即使精確匹配上升了 3.00 個百分點。因此,答案層級的相容性可能在沒有明顯或方向一致的效用變動下失效。檢索增強的發布應在評估效用之際一併稽核相容性。
隨著擴散模型與大規模影片生成的快速進展,生成式世界模型日益被期待能取代傳統模擬器,包括物理引擎、遊戲引擎與強化學習環境。然而,從生成到模擬之間的距離仍缺乏系統性的評估。我們提出一項基於能力的研究,採用外部衡量基準:傳統模擬器的八項能力,即資產建構、物理引擎、互動、可控性、穩定性、狀態回饋、多樣性與評估指標。我們追溯三條主要技術路線——潛在動態、影片生成與聯合嵌入預測——並將2018年至2026年6月間發表的200篇具代表性研究精確對應至上述各項能力。我們的分析顯示,世界模型在特定場景的互動與可控性方面已實現功能性取代,但在物理定律的形式化保證、結構化狀態回饋,以及可重現的長時程演化方面,仍與傳統模擬器存在差距。狀態回饋是跨路線中最受忽視的弱點:163篇實作論文中僅有6篇提供用於查詢實體狀態或物理參數的執行期介面。我們提出六個研究方向:形式化物理、統一動作介面、第一級狀態回饋、長時程穩定性、下游效用評估,以及跨路線混合。專案頁面:https://github.com/AtongWang/world-model-simulators
全長RNA,尤其是信使RNA(mRNA),通常超出既有RNA基礎模型預訓練時所使用的上下文長度,限制了在單核苷酸解析度下對完整轉錄本進行建模的能力。我們提出RIBOSPAN,一個具有16.1億參數的雙向RNA基礎模型,其原生預訓練的上下文長度可達10,240個核苷酸(nt)。RIBOSPAN結合了密集雙向自注意力、單核苷酸標記化,以及注意力隔離的序列打包,使完整的長鏈RNA得以進行高解析度建模。我們透過核苷酸重建、受控的長上下文表徵基準測試,以及凍結RNA類型表徵分析來評估該模型。原生10K預訓練在10,240個token下保留了強勁的重建能力,而使用40%遮罩的持續預訓練則在重度破壞下提升恢復能力,同時保持表徵品質。長上下文基準測試進一步顯示,原生10K模型維持了強烈的上下文響應性及上下文特異性的表徵分離,同時使擾動引起的表徵變化保持高度局部化。推論階段的YaRN擴展恢復了短上下文模型直接外推所損失的大部分上下文組織,但卻導致遠端表徵擴散顯著增加。凍結表徵評估進一步展示了最先進的RNA表徵品質,RIBOSPAN在多種RNA類型中取得最強的整體表現,並在長鏈RNA上保持明顯優勢。基於相同的骨幹架構,我們開發了一個多維條件離散擴散框架,用於全長mRNA的生成與重新設計,其中包括用於保留蛋白質的CDS最佳化的同義密碼子擴散。整體而言,RIBOSPAN為可轉移的RNA表徵學習與全轉錄本mRNA設計奠定了強大的長上下文基礎。
可解釋性研究日益關注概念在訓練過程中何時湧現,以及線性探針是否能夠恢復真實結構,但在語言模型中,這些主張難以驗證,因為語言本身缺乏概念的難易程度排序或其間關係的真實對照依據。我們提出透過 AstroPT 來利用天文學的真實標注——AstroPT 是一個在數百萬張星系影像上訓練的 Transformer,可作為校準測試平台。AstroPT 是類似大型語言模型的模型,但在一個概念的難易排序及其間關係皆可事先得知的領域中訓練。透過對跨檢查點、層數、模型規模與目標函數選擇的凍結表徵進行探測,我們發現星系性質以固定的順序湧現,且該順序與其已知的難易程度一致——幾乎直接寫入像素的量(如波段星等)在訓練早期即能被解碼,且在網路淺層即可解碼;而基於多波段、光譜的推定量(如紅移與比恆星形成率)則較晚出現,且出現於較深層。此順序不受我們所測試的各種訓練目標影響,且隨模型容量增加而規模放大,但順序不變。我們的線性探針方向進一步恢復了星系性質之間已知的物理結構。我們的研究結果表明,天文學提供了一個受控的沙盒環境,可用於校準我們在缺乏真實對照時應用於大型語言模型的機制性可解釋性方法。
代理(Agent)基準測試通常僅評估最終答案,即使代理是在有狀態的運行時(stateful runtime)上執行。我們主張這對被評估的對象定義不足:適當的評估單位應是「已宣告的模型加運行時配置」(declared model-plus-runtime configuration),其失敗可能發生於證據獲取、運行時路由、安全邊界或重複執行等環節。我們提出 ClawProBench,一個軌跡感知(trace-aware)的基準測試,用於運行時原生的代理評估,並實例化於 OpenClaw——一個具備工作區工具及瀏覽、記憶、訊息、排程、技能與子代理等原生介面的即時代理運行時。ClawProBench 定義兩條評測軌道:其一為包含 102 個情境的完整輪廓(full profile),涵蓋即時工作區與原生運行時路由任務;其二為包含 68 個情境的凍結保留集(holdout),採用封閉世界 JSON 輸出契約以進行穩健排序。試驗透過安全閘控(safety-gated)公式,從執行軌跡中結合正確性、過程品質與效率進行評分,並保留失敗證據以供稽核。我們提供的匿名工件包含基準測試定義、評分程式碼、清單與去識別化軌跡。我們在完整輪廓上評估 68 種配置,在保留集上評估 37 種配置。最高安全閘控平均軌跡分數為 0.7671。原生運行時任務的表現低於工作區即時任務(0.5238 對 0.6415)。在保留集上,pass@k-any 優於嚴格三次試驗通過率(0.6638 對 0.2890),而完整輪廓與保留集的排名顯示弱對齊(斯皮爾曼相關係數 0.1300)。僅基於正確性的排名與過程感知、安全閘控及嚴格通過的觀點存在顯著差異。僅以最終答案為依據的排行榜可能隱藏原生介面的弱點、一次性成功以及軌跡局部的代理失敗模式。
心電圖(ECG)記錄是敏感的生物醫學資料,限制了醫院與穿戴式裝置共享原始訊號以進行集中式模型訓練的能力。聯邦學習透過在各自來源端保留原始生物訊號資料的同時,實現協作式模型訓練,解決了此實際的隱私限制。然而,由於客戶端樣本有限、心律不整標籤不平衡,以及客戶端之間的資料呈非獨立同分佈(non-IID),聯邦式心電圖分類仍具挑戰性。這些限制要求分類器具備通訊效率與對跨客戶端分佈偏移的穩健性。 在本研究中,我們在聯邦平均法(FedAvg)下,針對MIT-BIH資料集的五類別心律不整分類與INCART資料集的三類別分類,評估了混合量子啟發的Kolmogorov-Arnold網路(HQKAN)與多層感知器(MLP)的表現。在多重客戶端配置下,HQKAN改善了大部分整體及少數類別指標,同時在MIT-BIH上使用的可訓練參數減少了37.35%,通訊成本降低了24.89%;在INCART上則分別達成44.81%與36.41%的對應降幅。這些結果顯示,HQKAN為生物訊號資料上的隱私感知聯邦學習,提供了相較於MLP基準更精簡、通訊效率更高且更穩健的替代方案。
人臉呈現攻擊檢測(PAD)傳統上被視為一個針對人臉的問題,儘管打印、重放和重新捕獲過程引入的許多視覺偽影並非本質上與面部外觀相關。在本工作中,我們研究是否可以在下游PAD訓練中不使用人臉的情況下學習可遷移的PAD表示。為此,我們提出了TPO,這是一個受控的無人臉呈現攻擊數據集,包含對幾乎隨機選擇的番茄、馬鈴薯和洋蔥的真實、打印和重放錄製,其採集協議緊密模仿傳統的人臉PAD數據集。基於基礎模型的PAD架構,我們證明在TPO上訓練的檢測器在四個標準跨數據集人臉PAD基準上平均AUC達到92.70%,優於在合成人臉上的訓練,並且與在真實人臉數據集上訓練的模型保持競爭力。相反,在人臉PAD數據集上訓練的模型遷移到TPO時持續表現優於隨機水平,表明所學習的表示捕捉的是呈現過程的特徵而非物體語義。此外,將TPO納入傳統的人臉PAD訓練中,在固定優化預算下持續提升跨數據集性能,表明無人臉數據提供的是互補信息,而不僅僅是額外的訓練樣本。最後,表示分析和頻率分析提供了進一步的證據,表明可遷移的PAD表示不能由單一的頻譜偽影來解釋,而是編碼了跨物體類別共享的更豐富的呈現線索。綜合來看,這些結果提供了經驗證據,表明可遷移的呈現攻擊表示可以獨立於面部內容進行學習,為保護隱私和與身份無關的PAD開發開闢了新的機會。
機器人策略在每個決策步驟接收異質觀測,但序列模型在如何隨時間組織這些輸入方面有所不同。我們提出WorldToken,一種時間優先的策略實例化,在每個策略時間步內將多視角影像、本體感覺與任務條件融合為單一世界令牌。因果時序Transformer對產生的世界令牌序列進行建模,擴散動作頭生成動作區塊。在23個RoboCasa任務上,一個除凍結的預訓練CLIP文字編碼器外從零訓練的85.3M參數策略,使用每個任務2,900條生成的示範,達到59.45%的平均閉環成功率。對五種數據集規模、五種模型規模與兩種訓練種子進行的完整全因子掃描顯示,額外目標域數據帶來一致的增益,而超過中等模型規模後則出現邊際效益遞減。在相同檢查點歷史截斷下,將可見歷史減少至一或兩個策略時間步會降低全部50個RoboCasa策略的閉環成功率。在RMBench Blocks Ranking上,將可見歷史從146秒減少至8秒會使評估器成功率從95%降至28%,而探索性擴展推演則可維持參考交換序列超過850秒。這些結果確立了完整WorldToken實例化的實證可行性,並刻畫了其在所測試配置下的數據擴展與時間上下文行為。它們並未確立相對替代序列組織的優越性,也未隔離完整實作中哪些組件驅動了所觀測到的性能。
深度人臉辨識(FR)模型已達到接近飽和的準確度,但仍不透明:實務人員無法詢問相似度分數是依賴哪些語義屬性。EXPL-FR 在 FR 模型自身的嵌入空間內回答此問題。一個輕量級適配器將視覺-語言模型(VLM)的影像編碼器與凍結的 FR 空間對齊,僅使用人臉影像訓練,從未使用文字。由於 VLM 的編碼器共享同一空間,相同的適配器也適用於文字編碼器,將 22 個類別中的 978 個屬性提示詞(亦可擴展)轉換為 FR 空間錨點,無需額外成本。我們並不假設此轉移有效:透過人臉驗證協議來衡量,並僅改變適配器的消融實驗來隔離其貢獻。並非每個概念都能存活,因為 FR 模型透過丟棄其必須跨身份驗證的因素來獲得其不變性。一種無標籤的可偵測性度量比較每個概念在 FR 空間與 VLM 空間中的可分離性,其中最具可偵測性的 100 個概念構成模型的可讀語義特徵簽章,其分離身份的效果優於完整詞彙。我們涵蓋四個 FR 骨幹網路和兩個 VLM 編碼器;EXPL-FR 無需存取架構,並支援身份層級、逐影像與差異化解釋。我們在三個監督設定下對屬性層級審查進行基準測試:人工標籤(當前實務)、VLM 偽標籤,以及我們完全由提示詞驅動的審查,並與真實驗證行為比較。在無標籤的情況下,提示詞驅動的審查根據測得的各族群 RFW 錯誤率對四個 FR 模型進行排序,並根據其真實驗證成本對受控屬性變更進行排序。