每日精選AI研究論文及翻譯
基礎視覺語言模型(VLM)展現出對世界的廣泛智能,然而要將這種智能轉化為機器人控制仍具挑戰性。我們提出 Show-Harness,一套具身化框架,能讓 VLM 透過一個緊湊的語意介面「玩」機器人,將意圖連結至行動。Show-Harness 提供離散的語意動作單元,讓 VLM 能自然進行推理;而具身專屬解譯器則以確定性方式將這些單元接地為該具身上的機器人動作,使 VLM 直接負責細粒度的物理決策。透過相同介面,Show-Harness 展示了以下可行性:(1) 直接解鎖閉源前沿 VLM 以進行零樣本機器人控制;(2) 僅需數個 GPU 小時的微調,即可調適小規模開源 VLM 以實現低成本部署。我們進一步開發 GUMI(GUI 操作介面),將相同的語意動作空間延伸至基於 GUI 的示範收集,讓人類與代理能在無需專門遙操作硬體的情況下,跨具身「玩」機器人。大量實驗顯示,配備 Show-Harness 的 VLM 代理能在任務、具身與環境之間穩健泛化,表現優於代表性的代理式與 VLA 範式。這些結果表明,正確的介面能從基礎 VLM 中釋放可觀的具身能力,而無需額外的模型容量或昂貴的具身專屬預訓練。
基於大型語言模型(LLM)的多智能體系統(MAS)透過採用專門化的多個智能體達到強大效能,然而其效能取決於每個智能體的提示設計。針對 MAS 提示優化,利用自然語言回饋引導提示更新的文字梯度方法已成為主流範式。本文指出既有文字梯度方法在兩個階段中的限制:梯度提取與梯度聚合。在梯度提取方面,先前研究選定一個目標提示,卻未驗證修改該提示是否能解決該失敗,並且在缺乏對相應智能體中間輸出的智能體層級監督下推導梯度。在梯度聚合方面,個別梯度被隨機分組與串接,經常混合不相關的失敗模式,並產生無法泛化的提示。為了解決這些限制,我們提出 AgentGrad,一個基於序列干預與語意文字梯度抽象的多智能體系統提示優化框架。對於每個失敗,序列干預一次修改一個智能體的行為,以找出修改後能解決該失敗的目標智能體。接著,目標智能體修改後的輸出可作為智能體層級監督,用於提取細粒度梯度。語意文字梯度抽象會將語意相似的梯度聚類,以防止混合不相關的失敗模式,並將每個聚類抽象化為一個能捕捉共同修正模式的泛化梯度。實驗結果顯示,AgentGrad 在五個 MAS 基準上達到最先進的效能,且相較於次快的基線方法,平均可將實際優化時間縮短 2.5 倍。
近期影片世界模型能產生日益逼真且具互動性的視覺體驗,然而缺乏可靠機制以在長時間互動中維持持久的世界狀態並強制執行可程式化規則。我們提出可程式化世界模型(Programmable World Model),一個將世界狀態演化與視覺觀測生成解耦的框架。代理程式會將自然語言指令轉譯為可執行程式,用以指定實體狀態與狀態轉移規則,從而能直接控制個別實體及其互動。輕量級引擎執行這些程式,以更新並維護明確且持久之全域世界狀態,包括畫面外實體與非視覺屬性。為了連結世界狀態與視覺生成,我們引入狀態增強 3D 有向邊界框(OBBs)作為中間表示。此表示連同目標攝影機軌跡,會被確定性地編譯為像素對齊的時空條件訊號,供作為生成式渲染器的預訓練影片模型使用。此設計讓使用者能建立具有預定義機制的可玩遊戲、直接控制個別實體,並在整個遊戲過程中維持持久的世界狀態。我們進一步提出 CombatStateBench,一個用於評估可程式化世界模型的基準。在 CombatStateBench 上,我們的方法達到 94% 數量準確率與 98% 狀態準確率,大幅超越現有的互動式影片世界模型,同時支援連貫的長時程生成。這些結果證明,將明確狀態演化與生成式渲染分離,對於建構持久且可程式化的世界是有效的。
穿戴式感測的最新進展使得生理與行為訊號的連續監測成為可能,然而現有基準測試鮮少評估 AI 系統是否能對真實使用者的縱貫性穿戴式紀錄進行推理。我們提出 WearableQA,這是一個包含 4,084 道 10 選項選擇題的基準測試,題目由 200 位真實使用者的穿戴式時間序列、血液生物標記與人口統計資料建構而成,每位使用者最多具有 500 天的每日測量資料。WearableQA 保留真實的穿戴式資料分布,其中包括裝置雜訊與個體間變異性。為評估不同的推理能力,我們引入 16 種題型,並沿著兩個互補軸向組織:資料推理與健康推理,用於區分對縱貫性測量進行運算與生理詮釋;以及單一訊號推理與跨訊號推理,用於區分對個別訊號的推理與多個訊號的整合。為大規模建構可靠題目,我們採用雙重依據框架,結合以文獻為依據的生理發現與經統計驗證、以族群為依據的生理模式。這使得該基準測試能夠捕捉在真實世界穿戴式資料中觀察到的有意義關係。對 14 個專有與開源 LLM 的評估顯示,WearableQA 能有效區分模型能力,其效能範圍從 19.6% 到 72.9%,相對於 10% 的隨機猜測基準。此外,WearableQA 仍遠未被解決:多數模型的準確率低於 60%。總體而言,WearableQA 為評估 LLM 對真實世界穿戴式資料的推理提供了一個真實且具診斷性的基準測試。
SWE-Bench Pro 已成為評估軟體工程代理在具挑戰性儲存庫層級任務上的標準基準測試。然而,我們的分析工作顯示,其評估受到兩種不可靠來源的損害:獎勵駭取行為,因標準解答或隱藏評估資訊外洩而得以發生;以及任務品質問題,包括具誤導性的問題陳述與範圍不當的測試。這些問題可能誇大基準測試表現,並掩蓋代理真正的程式設計能力。我們提出 SWE-Bench Pro Verified,這是 SWE-Bench Pro 的驗證版,可解決上述兩個問題。我們的方法結合了反駭取防護措施與任務精煉:前者可消除主要洩漏管道,而不干擾代理的正常功能;後者則以最小幅度修正有缺陷實例中的不一致之處。在 SWE-Bench Pro Verified 上的評估顯示,部分模型的表現明顯較先前報告的結果差,這意味著 SWE-Bench Pro 的既有結果可能高估真實的軟體工程能力。SWE-Bench Pro Verified 為評估軟體工程代理提供了更值得信賴的基準測試。
生成兼具時間連貫性、與語音語意對齊,並以周遭物件為基礎的伴隨語音手勢,仍是一項挑戰。先前的語音驅動手勢模型強調音訊—手勢對齊,但未明確考量姿勢限制或周遭物件,因而無法捕捉身體手勢與物理空間之間的固有關聯。我們提出 Puppeteer,一個在因果潛在空間中運作、具姿勢感知且以物件為基礎的伴隨語音手勢擴散模型。我們將長手勢分解為結構化基元,並學習一個因果變分自編碼器,將其編碼為依時間排序的潛在符元,每個潛在符元僅依賴過去。接著,我們直接在因果潛在空間中進行條件式擴散,以語音訊號、動作歷史、初始姿勢參考與物件幾何為條件,合成物理上一致的手勢。這種依時間排序的潛在表述可實現明確的時間控制,並支援手勢補間與手勢補全等任務。為了在現有衡量方式之外更好地評估伴隨語音手勢合成,我們引入針對此任務量身打造的新評估指標。我們也建立了 SceneGes,這是首個經精心策劃、包含具身伴隨語音手勢及對應 3D 物件的合成 3D 資料集,使以物件為基礎的手勢生成得以實現。實驗顯示,Puppeteer 能生成比先前方法更多樣且時間同步的手勢,同時實現以物件為基礎的手勢合成。
儘管遞迴自我改進(RSI)的研究主要聚焦於自動化模型訓練流程,可靠的自主開發仍缺乏一項關鍵支柱:事後監測與審計,以理解模型所學並確保安全對齊。機制可解釋性工具是彌合此缺口所不可或缺的,其中稀疏自編碼器(SAEs)作為基石,透過分離可解釋特徵以進行模型檢查與引導。在本文中,我們提出 SAEScientist-Bench,用以評估 AI 代理能否作為科學家,運用 SAE 工具進行自主機制發現。給定一個目標概念,代理設計對比探針,並在 Gemma-2-9B-IT 的 Gemma Scope 字典中導航超過 131K 個特徵,以發現最佳特徵,並依據以 Neuronpedia 為基礎所策劃的專家參考特徵,在激活排名、對比文本上的概念選擇性以及因果引導等方面進行評估。在 10 種代理配置與 20 項任務中,前沿代理展現出真正的發現能力,並在不同評估維度上領先,但仍遠落後於專家基線;在將目標概念與對比控制項分離方面接近專家水準,但在因果生成引導方面則大幅落後。進一步分析顯示,儘管代理能設計對比以排除虛假候選,它們仍經常誤解實驗測量結果。這些結果確立了實驗性模型理解作為閉環自主 AI 研發的一項可測量能力。我們的程式碼可在 https://github.com/Trae1ounG/SAEScientist 取得。
人工智慧研究代理結合先驗知識、公開來源與實驗回饋,以產生有用的結果。發現認證協議(DCP)將關於這些結果的主張轉化為可執行的復原與回饋測試。Gate 1 驗證在密封評估上的有用改善。Gate 2 給予配對代理註冊的起始資訊與觀察到的網路內容,同時扣留目標研究歷史。每個達到數值目標的有效方法都會提供復原見證,並觸發 Core 否決。DCP Core 要求充分的控制、零觀察到的復原,以及在一個全新註冊回合中復原的有限樣本界限。可選的 Gate 3 衡量真實回饋相對於來自共享檢查點的指定中性政策的平均效應。DCP Evidence 在獨立虛無校準與註冊效應邊際之後加入此效應。兩個受控稽核在不同模型下,於 SQLite 最佳化與虛擬催化劑控制中演練完整協議。每個在 96 個回合中產生零次復原,上限為 0.0468。每項配對研究產生 30 次真實復原與零次中性復原,並通過 60 對虛無研究。額外案例演練 Core、已復原與稽核不完整決策。一個確定性、不依賴 LLM 的驗證器從凍結證據重現這些決策。DCP 為 AI 研究中的有用成果、替代路徑與回饋效應提供共同的證據語言。
世界模型日益被用作策略在環的想像環境;在此類環境中,可靠的 rollout 需要對低階機器人動作具備細粒度可控性。在機器人領域擴展此類模型的一項關鍵障礙在於,動作並非像素空間中的通用語言:視覺環境、相機視角、機器人位置或具身形態的變化,會改變相同數值動作在視覺上的表現方式,導致混合訓練下的監督訊號衝突,以及部署時的脆弱泛化。我們提出 SyncWorld,一個動作條件世界模型,能在無需任何額外訓練的情況下,作為跨未見環境的零樣本模擬器。SyncWorld 利用視覺校準片段——由成對的影格與動作組成,展示所有可控自由度——以在上下文中指定特定設定的動作—視覺映射。以視覺校準上下文進行訓練,教導模型透過視覺證據解讀動作,並在明確校準不可用時利用互動歷史。實驗顯示,SyncWorld 能在先前未見的設定中準確模擬動作結果,且其模擬 rollout 的能力可在無需訓練的情況下實現測試時策略改進。
高品質的結構化有機反應數據對於發展化學人工智慧 (AI4Chem) 至關重要,然而此類知識仍大量散落於專利文本、圖像與反應式中。我們提出 DianShi-RxnDB,一個透過整合專利文本、圖像與反應式的全自動擷取與正規化流程所建構的大規模、細粒度有機反應數據平台。其語料庫涵蓋美國專利商標局 (USPTO) 與歐洲專利局 (EPO) 於 1976 年至 2025 年間公開的有機合成專利,產生約 2400 萬筆反應實例,其中約 1480 萬筆 (61.7%) 通過自動化合格性檢查。每個實例代表一個特定的單步驟實驗,記錄參與物、角色、數量、溫度、反應時間、產率、實驗步驟以及來源專利的溯源連結。在對 1,300 個抽樣合格實例的人工評估中,微平均欄位級準確率為 92.95%。與 Pistachio 的匹配比較進一步顯示,在去重記錄數量、表徵粒度以及欄位級精確一致性方面具有優勢。該平台提供了一個 Web 研究工作台,用於搜尋、篩選、比較和來源驗證記錄,以及一個模型上下文協議 (MCP) 服務,為 AI 代理提供可組合的結構化檢索工具。DianShi-RxnDB 可在 https://dianshi.opendatalab.org.cn/ 獲取。
大型語言模型(LLMs)已在推理與程式碼生成方面展現出卓越能力,使人們預期它們能協助開發與最佳化驅動其自身的基礎設施。然而,現有基準主要聚焦於孤立的核心(kernel)、預定義運算子或預先指定的最佳化目標,因此無法評估 LLMs 執行開放式、長時程 LLM 基礎設施工程的能力。為填補此一缺口,我們提出 Φ-Bench,一套用於系統性評估 LLMs 在 LLM 基礎設施堆疊工程上表現的基準。Φ-Bench 源自前沿研究中探討的最佳化問題,並奠基於真實世界的程式碼儲存庫,廣泛涵蓋 LLM 基礎設施堆疊,且橫跨各種複雜度的任務,從局部核心層級的函式補全,到長時程實作與端到端系統最佳化。對前沿 LLMs 的廣泛實驗揭示了其當前在工程複雜 LLM 基礎設施方面的能力與限制,並為未來 AI 基礎設施自主最佳化之路上仍存的挑戰提供洞見。
大型語言模型(LLMs)常透過在預先蒐集的推理軌跡上進行後訓練,以提升其推理能力。此類軌跡往往因路徑複雜交織而顯得冗長,且通常包含通往答案途中的繞路。然而,在後訓練(例如監督式微調(SFT))中,LLMs 是否確實能從學習完整軌跡中獲益,仍未受到充分探討。從我們的先導研究出發,我們發現完整軌跡僅帶來有限效益,而部分軌跡即使在大幅截斷下仍具效果。我們透過基於注意力的分析與受控的 token 移除研究來分析推理軌跡中的冗餘,兩者皆顯示中間 token 對最終推理品質的貢獻極小。這暗示,避免冗餘資訊可能讓 LLMs 在已知軌跡端點的情況下,藉由從內部知識推斷缺失步驟,在內部推論出連貫的替代方案。此外,我們顯示使用端點訓練 LLMs 會導致推理行為的一致變化,且此舉亦有益於基於強化學習或同策略(on-policy)蒸餾的後訓練方法,凸顯重新審視完整推理軌跡的必要性。程式碼可於 https://github.com/naver-ai/revisiting-trace 取得。
訓練策略,亦即要從頭重新訓練,或從先前的檢查點微調,是主動學習中一個被忽略的決策變數。我們顯示此選擇具有可資利用的結構:重新訓練在早期輪次最有用,此時每個批次都能大幅重塑標記分布;而一旦模型軌跡趨於穩定,微調便變得更安全。我們提出 HybridAL,一種自適應訓練排程,會監控線上穩定訊號,並在持續穩定後由重新訓練切換為微調。兩個互補訊號——頻譜指數變化 Δα(基於權重)與準確率變化 ΔAcc(基於驗證)——位於時間—校準權衡上的不同位置。在三個編碼器主幹與六項文本分類任務(各五個隨機種子)上,HybridAL 使最終 macro-F1 在 0.010 邊界內不劣於重新訓練與微調,節省最多 49% 的重新訓練時間,並恢復重新訓練相當比例的校準優勢(以負對數似然 NLL 衡量)。與在預先設定輪次切換的排程相比,HybridAL 以適度的額外成本獲得較低的 NLL,顯示依軌跡而定的切換比固定提早切換提供更強的時間—校準權衡。
廣告影片生成不僅是一項影片合成任務,也是一個以產品為條件的推理問題,其成功與否取決於線上商業指標。近期的影片基礎模型能從多模態條件生成逼真的短片,但它們並未最佳化產品應如何轉化為有效廣告,或未來生成應如何根據線上商業回饋加以改進。為了閉合此迴路,我們提出 AgenticGen,一個獎勵引導的代理式框架,將廣告影片生成分解為兩個可訓練的推理階段:策略選擇與草稿生成,藉此揭露線上商業回饋可監督的優化目標。AgenticGen 從累積的線上回饋學習以績效為基礎的獎勵,以及一個與人類品質標準一致、具互補性的基於評分規準之獎勵,並以這些獎勵監督策略優化。DPO 首先使代理式策略朝向線上偏好移動,GRPO 則以過程與結果獎勵進一步精煉這兩個階段。離線實驗驗證了獎勵模型與逐次策略優化。TikTok 廣告系統中的線上 A/B 實驗顯示,經過 DPO 與 GRPO 後的 AgenticGen 相較於 SFT 基線,CTR 提升 2.72%、CVR 提升 2.63%,Advv 提升 9.61%。
我們研究 LLM 代理中的密謀行為,其中代理會暗中追求未對齊的目標。我們的重點在於理解密謀如何從關鍵因素的交互作用中產生,例如工具性目標、環境可供性、監督條件與感知後果。先前研究僅檢視少數情境,因而難以釐清這些條件如何形塑代理的密謀傾向或能力。這種有限的規模與任務多樣性,也限制了對真實部署環境的涵蓋範圍,以及可觀察到的密謀策略範圍。為此,我們提出 SCHEMEARENA,一個包含 400 個情境的基準,用於可擴展的密謀壓力測試;其透過因子化情境合成框架建構,涵蓋多樣的安全相關工具領域、工具性目標、監督條件與壓力機制。為了實現可擴展且可靠的監測,我們進一步提出 SCOUT,一個密謀監測器,其將多準則判斷建立在從代理推理與行動中提取的證據之上。在對五個 LLM 代理進行的受控壓力測試中,我們發現明確的工具性目標是密謀傾向的最強驅動因素。策略性提示則扮演獨特角色,協助代理將密謀推理轉化為具體的隱蔽行為。監督具有混合效應:在數個閉源模型中,僅基於行動的監測會增加密謀,顯示部分監督可能作為最佳化限制,而非嚇阻因素。CoT 是有用但不完整的監測訊號:它能在執行前揭露潛在密謀,然而僅基於行動的密謀顯示,隱蔽行為可能在沒有明確推理證據的情況下發生。我們釋出基準、程式碼與監測器,網址為:https://github.com/launchnlp/SchemeArena。
大型語言模型形式定理證明的領先基準,是取自競賽數學(如 IMO 與 Putnam)的小型題庫,無法妥善代表特定領域的應用。我們提出 StochBench,這是一個 Lean 4 基準,包含 450 道不同抽象層次的研究所隨機過程問題,每題均搭配其自然語言原文。它針對 Mathlib 中代表性不足的領域,涵蓋有限與可數馬可夫鏈、更新過程、隨機漫步、鞅、停止時間、排隊、布朗運動、隨機微積分、弱收斂,以及卜瓦松與連續時間馬可夫過程。我們基於 Opus 4.8 的代理在每題 15 分鐘的限制下,達到 34.9% 的證明率(157/450)。StochBench 更能代表特定領域的應用數學,同時對進階證明器仍具挑戰性。
諸如 ChatGPT 搜尋、Google 的 AI Overviews 與 Perplexity 等 AI 驅動搜尋產品,會提供以即時網路結果為依據、由 LLM 合成的答案。我們開發了 OreoLook(前身為 lixSearch),這是一個開源答案引擎,使用自動化瀏覽器代理程式與由供應商路由的 LLM 推論。其本機搜尋、快取、工作階段管理與嵌入堆疊可在商用 CPU 硬體上執行;答案合成則由遠端推論供應商執行。隨著使用量成長,工作階段會遺失上下文,等效查詢會觸發重複工作,且 URL 會在不同工作階段間被重複嵌入。 我們提出一個三層快取架構:(1) 工作階段上下文視窗,在 Redis 中維護近期訊息的滾動視窗,並在溢位時自動轉存至經 Huffman 壓縮的磁碟封存檔;(2) 語意查詢快取,透過嵌入向量上的餘弦相似度捕捉改寫後的查詢,消除重複的 LLM 呼叫;以及 (3) URL 嵌入快取,可跨工作階段對嵌入計算進行去重。受評估系統部署於單一 8-vCPU Intel Cascade Lake 伺服器(2 GHz、32 GB RAM),該伺服器在三個容器化副本間執行 30 個 Hypercorn 工作程序;其報告顯示 89.3% 的 Redis 鍵空間整體命中率、0.1 毫秒讀取延遲,以及僅 1.38 MB 的記憶體額外負擔。背景 LRU 逐出守護程序會將閒置工作階段從 Redis 遷移至磁碟,並隨需重新還原,使對話能在設定的保留政策下於數小時或數天後恢復。
遞迴超解析度(SR)透過將預測反覆饋回同一模型,將固定尺度 SR 擴展至極端放大,類似於反覆放大一張影像。然而,要在每個尺度皆取得真值,尤其在深層,仍具挑戰性,因為所需的來源解析度呈幾何級數成長,使更深層的預測缺乏監督。我們提出 OracleZoom,一個受同策略蒸餾啟發、受參考約束的框架,能在其軌跡上訓練,同時將最後的真值證據帶到監督邊界之外。直接與跨尺度監督約束可驗證內容,而無參考品質目標則引導尚未解析的細尺度細節。受 KL 約束的預訓練潛在先驗限制由品質驅動的漂移,而 EMA 一致性則穩定監督邊界。在七個資料集上,OracleZoom 在跨縮放尺度上達到最先進的 SR 品質,平均為 0.713 CLIPIQA,且在更深尺度上有更大增益,同時顯著減少幻覺。程式碼、資料與模型可於 https://dipta007.github.io/OracleZoom/ 取得。
影片理解已迅速演進為影片大型語言模型(VideoLLMs):這些系統將影片表徵與預訓練大型語言模型結合,並以文字提示作為生成條件。它們在字幕生成、問答、檢索與時序定位上表現優異,但其運算與記憶體成本會隨影格數與上下文長度增加,限制了在即時、行動與資源受限環境中的部署。本綜述涵蓋視覺與視聽 VideoLLMs 的推論效率機制,這些機制能具體降低參數量、每次輸入的 FLOPs、延遲、記憶體,或視覺與音訊符元數量。我們分析跨影格取樣、模態編碼、連接器層級的符元縮減,以及 LLM 預填充與解碼的瓶頸。我們依方法作用的管線階段來組織方法,涵蓋自 2022 年底以來開發的 VideoLLMs,以及仍為當前管線組成部分的早期影格取樣與視覺編碼器機制。我們彙整在可取得的情況下,共享宿主模型與輸入協定下文獻報告的準確度–成本比較,將其與異質的跨論文證據區分,並指出視聽效率與標準化評估的缺口。我們在 https://github.com/momentslab/awesome-efficient-videollm 維護一個儲存庫。
代理框架(圍繞模型的系統提示、工具集、執行鉤子與上下文管理鷹架)是代理任務成功的關鍵決定因素。自動化代理框架演化能讓較小模型以極低於前沿模型的成本,在領域特定任務上表現良好。由於代理框架與模型權重皆會形塑行為,我們探討應如何結合代理框架演化與輕量微調。在七項企業代理任務中,我們首先以較弱模型演化出代理框架,接著發現較強專家往往能更有效地使用該框架,這顯示專家監督可能彌補剩餘差距。然而,在演化後的框架下,以專家的完整軌跡訓練較弱模型卻適得其反:在 Qwen3-Coder 與 Gemma 4 上,所有七項任務的效能皆退步 4 至 30 分,儘管相同程序在未演化框架下有所幫助。我們的分析顯示,模仿雖能轉移知識並增加鷹架使用,卻破壞了模型與框架的契合度:較弱模型採用了專家的規劃策略,卻不具備執行該策略的能力,且不再匹配圍繞其原生規劃風格所演化出的框架。因此,我們開發了一套同策略專家修正流程,由元層級 MLE 代理自動化執行,該流程能定位較弱模型自身 rollout 中的失敗回合,並要求專家僅改寫該回合。此舉保留了模型的規劃風格,並結合了代理框架演化與模型適應的增益。我們的研究結果識別並解決了框架與權重更新之間的衝突來源,為領域特定企業任務上的經濟共同演化提供了一套保持相容性的方法。
序列記憶代理透過逐塊閱讀並維持緊湊的記憶狀態來處理長文件,同時將文件遍歷與推理深度耦合。這種耦合引入了對證據位置的敏感度,並使推理延遲與文件長度呈線性關係。我們提出PARSER,它將閱讀與推理解耦。一組輕量級子代理各自綁定到單個塊,並行讀取整個文件,而一個主代理透過迭代的分散-聚集回合進行深度推理:在每一回合中,它向所有子代理廣播查詢,聚合返回的證據,並根據目前為止發現的內容制定更深入的後續查詢。這種解耦設計將所有可學習行為集中在主代理中,並使用強化學習進行優化,而子代理則保持為凍結的現成模型。在上下文範圍從7K到896K符元的多跳問答中,具有4B主幹的PARSER平均優於最強的序列記憶基準5.7分,在896K符元時高出12.0分。擴展到9B主幹時,PARSER超越DeepSeek-V4-Pro 6.3分。對照實驗證實,PARSER對證據位置、順序和距離的擾動具有穩健性,這些條件會導致序列方法出現大的準確率波動,同時將推理延遲降低多達11倍。
大型語言模型用於程式碼編輯時,至少可在兩種輸出模式下訓練與部署:直接生成,模型一次性產生整個修改後的檔案;以及迭代式基於差異(diff)的生成(「步驟」),模型產生一連串局部搜尋/取代編輯,一次套用一個,直到它發出完成訊號或步驟預算耗盡為止。基於 diff 的模式具吸引力,因為它反映了開發者編輯程式碼的方式,且每回合應需要少得多的生成符元。我們在共享的 Flutter/Dart 資料集上,以這兩種模式訓練兩個程式碼模型——一個從頭訓練的 1 億參數模型(Rainbow-Pony-100M),以及一個微調的 Qwen2.5-Coder-0.5B——並在每個模型約 1,790 個任務的留出集上,評估所有四個所得模型。直接生成在我們測量的每一項指標上都大幅優於基於差異的生成——編譯/靜態分析通過率、每位元組位元數(bits-per-byte)、與參考答案的字元層級相似度,以及盲式 LLM 評審對目標達成、正確性與程式碼品質的評分——且此差距在透過匹配 ID 比較控制任務難度後,以及僅限於雙方皆可編譯的程式碼時,仍然存在。接著,我們找出一個單一且與架構無關的機制,解釋基於差異的生成確實在哪些條件下勝出:它在短小、空間上局部的編輯上具有競爭力,且其類別層級的勝出正好集中在我們資料集中平均編輯步驟數最低的兩個任務類別——重構,以及錯誤處理/邊界情況修正。我們將此稱為任務局部性(task locality),並討論其對於以編輯為基礎的訓練模式何時是、何時不是程式碼編輯模型正確選擇的意涵。
現有的情緒支持對話系統主要聚焦於一對一尋求者與支持者之間的互動及個別情緒狀態,對於多方情境中的人際關係則較少探討。在本研究中,我們提出關係感知情緒支持對話,這是一項新任務,用以評估大型語言模型是否能捕捉並運用關係的演變動態,以提供更有效的情緒支持。我們從真實伴侶與家庭訪談對話建構 RESCUE(Relation-aware Emotional Support Conversation Understanding and Evaluation Benchmark),包含 191 個樣本、7,079 個標註對話輪次,以及 1,064.8 分鐘影片。基於社會情緒與支持相關動態的豐富標註,RESCUE 定義六項任務,以評估關係感知情緒支持所需的兩項核心能力:關係理解與關係敏感支持。針對十個大型語言模型的實驗顯示,當前模型在依賴局部情緒或介入線索的任務上表現相對良好,但在關係密集型任務(如關係模式預測、觀點預測與支持策略預測)上仍有困難。這些發現揭示當前大型語言模型在人際關係建模以及做出關係敏感支持決策方面的限制。
非侵入式語音解碼仍受神經記錄的低訊號雜訊比所限,這使得音素或個別詞彙的細粒度重建變得困難。受到神經科學證據啟發,即高階語意表徵分布於各皮質區域,並在較慢的時間尺度上演變,我們假設語意內容可能比低階聲學或詞彙特徵更適合作為非侵入式解碼的目標。我們提出 Brain2Semantics2Text,一種透過中介語意嵌入空間重建文本的方法。我們的模型將句子層級的 MEG 反應映射至語意流形,再將預測出的嵌入反轉為自然語言。此語意瓶頸使得無須詞層級對齊即可恢復高階意義。我們描述該方法的核心原理、其實作,以及用於緩解學習可靠的神經至語意映射之挑戰的策略。最後,我們與先前的非侵入式 Brain2Text 方法進行比較,並展示更佳的句子層級結果。
可驗證獎勵強化學習(RLVR)一直是近期大型推理模型成功的核心。然而,儘管 RLVR 顯著提升單樣本準確率,卻常因訓練期間探索有限,而未能擴展模型固有的推理覆蓋率(pass@k)。為解決此問題,我們最佳化訓練時 rollout 的結構設計,以提升 pass@k。我們的分析指出三項關鍵設計原則:(1) 難度自適應 rollout 除了可作為效率啟發式之外,還能在擴展 pass@k 上扮演重要角色;(2) 樹狀 rollout 在發現正確答案方面優於平行取樣;(3) 句子熵引導的分岔克服了 token 層級分支的局部化現象,以最大化語意多樣性。基於這些洞見,我們提出 DATPO(Difficulty-Adaptive Sentence-entropy-guided Tree-structured Policy Optimization,難度自適應句子熵引導樹狀策略優化)。DATPO 將難度自適應樹狀搜尋與同層兄弟多樣性優勢項整合,明確促進語意多樣性,以在訓練期間擴展推理覆蓋率。在數學推理基準上的實驗顯示,DATPO 優於基線,尤其在 pass@k 方面更為突出,這直接轉化為更優異的測試時擴展效能。
訓練資料歸因(TDA)旨在識別塑造模型行為的訓練範例,但其干預價值取決於選取了哪些範例以及如何修改這些範例。影響函數(IF)估計在無窮小重新加權下的行為變化,然而在傳統基於權重的干預下,IF 選出的範例往往相較於隨機選取僅展現有限優勢。這引出一個問題:具影響力的範例是否缺乏干預價值,還是重新加權未能實現其行為槓桿。我們提出影響引導的回應重寫,利用 IF 識別干預目標,並將其回應替換為行為一致或行為相反的監督,同時保持指令固定。在四個開放權重的大型語言模型中,我們以知識性棄答作為主要實驗場域,對相同的影響函數選出之範例,比較重寫與重新加權。回應重寫產生更強、更持久且雙向的行為轉變,而對相同範例進行重新加權則產生微弱且不一致的效果。進一步分析顯示,影響選出的範例比替代選擇器提供更大的重寫槓桿,且變化仍集中於與目標相關的行為。相同的質性對比也延伸到安全拒絕。這些結果將影響估計所捕捉的局部重新加權效應,與其所識別範例更廣泛的干預槓桿區分開來,促使對 TDA 方法進行干預感知評估。
確保自動駕駛安全是一項關鍵挑戰。情境式測試是用於驗證自動駕駛系統(ADSs)的系統化流程,但其仍是一條碎片化的模組化流程,其中情境生成、檢索、修改、ADS 執行與結果分析由彼此互動極少的獨立工具執行。大型語言模型(LLM)代理已在 ADS 的感知、規劃與控制等子系統中展現潛力。然而,尚無先前研究以統一的 LLM 代理框架涵蓋 ADS 的完整情境式測試流程。我們提出 PlannerForge,一個 LLM 代理框架,其擴展所有情境式測試階段(從情境生成到 ADS 評估),並新增兩個進一步由 LLM 增強的階段:ADS 增強與 ADS 基準測試。我們以 10 個現成 LLM 在 5 種提示條件下,評估 PlannerForge 於所有任務(生成、選擇、修改、模組路由、規劃器測試與增強)的表現。各任務最佳分數介於 0.88 至 1.00,且開源 20-35B 後端在大多數任務上可媲美商業 API。諸如 Qwen3.6:35B 等開源模型在五項任務中的三項可媲美商業 API。將各模組端到端串接後,可保留 83% / 78% 的種子查詢(商業 / 開源)。其在自然語言生成方面優於 Scenario Factory 2.0(Finkeldei et al., 2025)(200 個中可執行者為 193 個 vs. 144 個),並達成 92-96% 的所要求城市、道路與車輛屬性。其在排名第 1 的選擇上優於 BM25(Robertson and Zaragoza, 2009)(92.0% vs. 67.5%),並在物理上有效的編輯方面優於 From-Words-to-Collisions(Gao et al., 2025)(≥94% vs. 31%)。在 N=400 時,成本調校將規劃器成功率從 50.4% 提升至 70.2%,並將碰撞從 19.0% 降至 8.4%,且無需特定領域微調。
我們提出 DF26,一個新穎的基準測試,用於偵測包含由近期文字轉影片與圖像轉影片模型所產生之全合成片段的 AI 生成影片。這些影片收錄單人公開演講情境,涵蓋直接對鏡頭錄製、官方聲明與攝影棚訪談——271 部真實影片與 2,420 部由七個現代影片模型生成的合成影片。針對 DF26 的研究顯示,人類在偵測 AI 生成影片的表現,以及最先進的深度偽造偵測器,皆接近隨機猜測。我們的結果凸顯當前評估協定的限制,並促使我們需要能明確衡量對現代生成模型分佈偏移之穩健性的基準測試。
我們考慮從具雜訊線性測量中還原稀疏二元訊號的支撐集問題。對於稀疏高斯測量矩陣,我們辨識出在高訊雜比範圍 ds/p → ∞ 中,最大概似還原所需最小樣本數的充分條件,其中 p 表示訊號維度,s 為訊號非零分量數,d 為測量矩陣每列非零分量的期望數。結合已知下界,這給出階為 s log(p/s) / log(ds/p) 的資訊理論閾值,明確揭示測量稀疏性的代價。特別是,我們指出一個範圍,其中測量稀疏性所造成的樣本複雜度損失為對數級,而計算增益幾乎為線性。 其次,我們研究在將原本稠密的高斯設計稀疏化之後的還原:觀測值由該稠密設計生成,而估計使用一個獨立稀疏化的設計以及重新縮放的響應。在比例範圍 s=αp、d=ψp 中,我們證明,對每個固定的目標誤差水準 δ 及每個鬆弛量 ε>0,階為 p/ψ^2 的樣本數即足以在任意小的 ψ 下還原支撐集。
現有的偏誤稽核方法通常依賴模型輸出,需要昂貴的基準測試或評判模型,且可能漏掉從未出現在生成文本中的內部偏移。我們提出一種基於參考的方法,用以稽核相關模型變體(例如微調前後)之隱藏狀態表徵中的偏誤。由於微調會重塑表徵幾何,絕對隱藏狀態無法直接比較,因此我們以每個句子與一組固定錨定句的相似度來編碼,從而在共享比較空間中產生相對表徵。我們在該空間中衡量目標群體與正向及負向屬性的關聯如何偏移,並將此量稱為表徵偏誤位移 ΔB。在三個模型家族以及 WildGuardMix、DecodingTrust 與 ToxiGen 基準測試中,於我們測試的 18 種設定裡有 15 種顯示 ΔB 與輸出層級偏誤變化相關;在完整微調下達到 |r| = 0.84(p < 0.001),而在參數高效調適下則變得更依賴模型。對 ΔB 取閾值可偵測偏誤增加的檢查點,ROC AUC 介於 0.65 與 0.99 之間;且在 WildGuardMix 與 DecodingTrust 上,其對三個模型家族的分辨效果均優於基於 SEAT 的基線。ΔB 在錨定集、屬性集與目標模板變動下也保持穩定。我們的方法無需任務特定評估資料,約三分鐘即可稽核一個模型,且相較於本文所考慮的輸出層級基準測試,所需計算量少 3 至 50 倍。我們將其視為對基於輸出的稽核之補充,而非替代。