每日精選AI研究論文及翻譯
當一位年長者漏服藥物時,軟體智能體可以再發送一次提醒,具身智能體則可以將藥物送來。然而,兩者都無法說明該人是忘記了、感到困惑、出現副作用,還是刻意拒絕服藥,也無法判斷什麼樣的支援才適當。這揭示了智能體人工智慧(Agentic AI)中的結構性缺口:數位智能體主要轉換軟體狀態,具身智能體則轉換物理狀態;兩者都沒有將一個人不斷變化的狀態與能動性作為建模、介入與評估的主要對象。我們引入共體智能體(Combodied Agents),這是一種以人為中心的典範,它隨著時間感知、建模、預測並支援個人的狀態軌跡,並將軟體工具、感測器、穿戴式裝置、機器人及人類服務視為行動管道,而非最終目標。 我們將分散在個人助理、健康智能體、AI 伴侶與適應性人機系統中的能力統整為一個閉環:基於事件的多模態感知重建有意義的個人事件;縱貫式、可修正的記憶提供時間脈絡;個人世界模型(Personal World Models)估算在不同決策與介入下未來的個人狀態與結果;而一套可允許的介入策略則在同意、不確定性、安全性、可逆性與使用者控制等條件下,選擇適度的支援。來自個人與環境的回饋會持續更新此閉環。 此框架不要求建立詳盡的人類數位孿生,而是採用目的限定、不確定性感知且使用者可修正的表徵。我們以人類狀態標的、關係情境與智能體角色來組織設計空間,並提出以情境為中心的評估、能動性保存指標、基準測試需求、邊緣原生個人模型與治理方向。共體智能體將智能體人工智慧從外部任務完成,轉向持續的人類福祉。
代理系統日益被期望在部署後持續改進,然而單一實體的自我進化往往受限於靜態的學習情境,例如固定的任務與回饋。本綜述聚焦於代理系統中的共同進化,這是一種多組件形式的自我進化,其中多個代理及其環境彼此施加適應壓力。為組織現有文獻,我們提出一個漸進式的三階段分類架構,用以追蹤系統如何逐步擺脫人為設計的限制。代理—代理共同進化研究代理如何透過動態同儕互動而適應,包括對抗性、協作性與組織性適應。代理—環境共同進化將此循環延伸至隨代理一同變化的適應性任務、回饋與互動空間。後設共同進化則進一步探索使進化機制本身具備可進化性的可能性。我們亦討論了在評估此類系統、將其擴展至多個組件,以及確保日益自主的進化過程安全且可控等方面的開放性挑戰。本綜述為建構穩健且開放式的代理系統提供了統一的基礎,使系統能夠超越固定的人為設計路徑持續改進。
4D生成從文字或影像等條件合成動態3D場景。現有方法要么使用單獨的4D模型重建生成的RGB影片,要么調整特定的影片生成器以直接預測幾何形狀。前者存在分布不匹配與誤差傳播的問題,而後者將4D預測綁定到特定生成器,當生成器或條件設定改變時可能需要重新訓練。我們探討能否將共享變分自編碼器(VAE)的影片模型之最終去噪潛變量,作為通往明確4D預測的可重用介面。基於此洞見,我們引入直接從潛變量到4D的生成方法,並將其實現為Latent-to-4D,該方法透過將影片潛變量與預訓練4D解碼器的token網格對齊,再以逐幀與全域時空注意力進行精煉,從而繞過RGB。僅在約1K段現有重建片段上訓練後,單一檢查點即可未經修改地遷移到同一VAE家族內的多個影片擴散Transformer。在Text4D-200和I4D-200基準上,Latent-to-4D在基於投影的DINO-F1指標上超越匹配的相同潛變量Wan+4RC級聯,分別高出2.88–3.45和5.81個百分點,同時在幾何形狀、時間穩定性和整體品質方面也更受人類評估者偏好。
建構互動式數位孿生需要同時恢復物體的三維幾何與其關節運動所遵循的運動學結構。然而,現有的關節物體重建方法需要從多個關節狀態中明確觀察其運動。我們提出一種靜止態表述,可從單一閉合構型重建關節物體;此設定本質上是不適定的,需藉由幾何、語義與運動先驗來彌補運動線索的缺失。我們的框架採用顯式網格作為中間表示,以進行跨模型驗證與融合,將視覺-語言模型與分割模型所產生的雜訊輸出調和為空間一致的部件結構。為在無觀測運動之情況下估計關節參數,我們使用影片擴散模型合成關節運動假設,並透過幾何一致性加以驗證。我們的方法實現了精確的部件分解與物理上合理的關節運動,在效能上可與基於運動觀測的重建方法、生成方法及模組化預訓練模型基線並駕齊驅。
弗雷歇距離近來已成為生成器後訓練中有效的分布層級目標,補充了傳統的樣本層級擴散與流匹配損失。然而,直接最佳化弗雷歇目標可能導致弗雷歇作弊。目標指標持續改善,但其他特徵空間中的視覺品質與弗雷歇對齊可能停滯甚至惡化。我們將此失敗歸因於現有弗雷歇損失所使用的靜態預訓練特徵空間。這些特徵空間提供了不完整且固定的真實分布與生成分布之間差異的視角。為了解決此限制,我們提出了對抗式弗雷歇距離(AdvFD),以經校準的對抗式學習表徵補充 FD-Loss 中的靜態表徵目標。AdvFD 以可學習表徵增強原始靜態弗雷歇目標,該表徵對抗性地最大化真實樣本與生成樣本之間的弗雷歇差異,同時生成器在所得的自適應特徵空間中最小化相同的差異。為防止對抗式表徵透過特徵放大平凡地增加目標,我們進一步引入真實特徵白化,以正規化其尺度與共變異數幾何,並穩定最小—最大最佳化。大量實驗顯示,AdvFD 在 JiT 與 pMF 兩種骨幹網路以及不同模型規模上,皆一致地改善單步生成器後訓練。
自我改進的編碼智能體透過迭代重寫自身原始碼,已在編碼任務上展現出令人矚目的表現。然而,現有解決方案通常一次僅從單一失敗軌跡推導自我修改,忽略了智能體不斷擴充的過往嘗試存檔中可用的豐富比較訊號。根據孟德爾受控遺傳原理,我們提出了孟德爾·哥德爾機器(MGM)。除了通用的單軌跡克隆突變之外,MGM 還包含兩種類型的自我修改,以更好地利用累積的證據:反應規範突變根據智能體在多個任務上的軌跡同時對其進行編輯,而跨譜系雜交則利用來自另一譜系的參考智能體在同一任務上的軌跡來編輯智能體。在加性適應度景觀模型下,我們從理論上證明並透過受控代理模擬展示,新策略相較於單軌跡基線能促進更快且更好的收斂。在 SWE-bench 和 Polyglot 上的實驗確認了 MGM 在效能、效率和泛化能力上的一致提升。
大型語言模型(LLM)智能體日益被部署為個人助理。然而,現有的評測大多使用靜態環境中的簡短、自包含請求。日常生活輔助則不同:一項任務持續數週而非數分鐘;當智能體未被提示時,世界持續變化;許多限制條件從不直接言明。只會回應眼前請求的智能體,必將在這種任務上失敗。反之,所需要的是一個能保持主動性與一致性的智能體:它自行決定何時行動、何時詢問、何時保持沉默;它能察覺無人宣告的變化;它讓同一個計畫從第一天到最後一天都保持一致。目前沒有任何評測基準衡量這類能力。我們提出 VibeLifeBench,這是一個涵蓋十個日常生活領域、共 200 個長時程任務的評測基準。每個任務都是一條腳本化的多週時間線,位於一個由 22 個模擬服務組成的模擬世界中。世界依自身時鐘推進,且其中許多變化是靜默的,因此只有會重新檢視世界的智能體才能發現這些變化。每個任務都以細粒度、加權的檢查來評分,這些檢查只讀取智能體實際留下的痕跡,涵蓋最終狀態、行動的及時性,以及是否遵守了隱含約束。我們評估了七個前沿模型。所有模型得分都很低,這顯示當前智能體距離真實生活輔助仍有很大差距。我們將開源所有任務、環境與評測框架。
全模態對話模型能理解多模態輸入並生成口語回覆,然而其回覆在視覺上仍缺乏實體。我們提出 Ex-Omni-2D,一個全模態對話框架,可生成包含文字、個人化語音與參考條件化影片的協同回覆。給定多模態查詢、參考影像與參考音訊,此模型先預測描述場景、情感與動作的結構化視覺思維計劃(VTP),隨後生成回覆文字與原生多碼本語音單元。這些語音單元構成共享的聲學-時間介面:它們被解碼為語音並與影片畫格線上對齊。此介面使回覆路徑與虛擬化身路徑得以從異質的語音、對話與化身影片資料中學習,避免了對大規模查詢-文字-語音-影片監督資料的需求。全序列影片生成器作為主要教師模型。為實現高效的增量生成,我們進一步將其蒸餾為少步區塊因果串流學生模型,其前綴串流機制在連續區塊間攜帶乾淨的潛在表示,以減少後期區塊的累積退化。在四步推論下,完整的四 GPU 管線在 400×720/720×400 解析度下達成 1.293 的端到端即時因子(RTF),提供了一個兼具品質與效率的實用操作點。
大型語言模型的評測通常聚焦於名義條件下的表現,製造出一種能力幻覺,使模型得以舒適地行走在一條狹窄且高度最佳化的生成走廊上。然而,在實際部署中,複雜的系統提示、安全護欄與結構性約束會持續迫使模型偏離這一名義路徑,導致基準分數與部署效能之間產生落差。為解決此問題,我們提出「解碼層級禁忌」(Decoding-Level Taboo),這是一種零提示診斷壓力測試,在執行時期直接介入 logit 空間,強迫模型脫離其名義路徑。透過在詞邊界動態遮罩主要候選詞元,Taboo 強迫機器進行迂迴表述。 在多個開放權重模型家族上評估 Taboo 的結果顯示,路徑外穩健性深受參數規模與後訓練指令對齊的影響,且穩健性通常隨模型規模與對齊程度提升而增加。除了本文呈現的結果外,Taboo 亦提供了一種新穎的基礎工具,可用於生成多樣化的合成資料集、對執行時期的安全護欄進行壓力測試,以及在實際部署前審查模型可靠性。
長程研究代理透過迭代檢索、彙整與綜合來解決開放式任務,但隨著脈絡快速增長,額外證據的邊際價值往往遞減。這導致不必要的代幣成本、更高的延遲,以及最終報告生成時更嘈雜的輸入。我們研究深度研究代理中脈絡管理的邊際價值估計,並提出首個系統性的跨流程階段感知修剪策略比較。我們在檢索前、檢索後與綜合前三個階段,評估輕量級啟發式標準與學習式價值模型。結果顯示,修剪效果更多取決於應用的階段而非具體評分規則:早期修剪能帶來最大的端到端節省,而後期修剪主要優化最終綜合脈絡。輕量級啟發式方法最多可減少73%的代幣使用量,且品質下降極小;學習式修剪在特定取捨下仍具競爭力,但沒有任何單一方法能在品質、效率與忠實度上全面勝出。這些發現為設計高效的長程代理系統提供了實務指引。
自我演化智能體透過附加成功流程與失敗修正來累積可重用技能。隨著時間推移,同一需求常在多個分支、示例與警告中被重複表述,而常見動作序列被複製而非重用。由此產生的技能變得注入成本高昂且難以維護。通用提示壓縮不適合此情境,因為技能並非一段平面文本:其名稱與描述定義了適用時機,其工作流程控制執行,其工具與輸出契約約束有效性,而且即使沒有抽樣任務觸發,罕見例外仍可能至關重要。評估引導式壓縮可以測試這些行為,但它引入了推演(rollouts)、成本,以及對壓縮時評估集的依賴。我們提出 SkillZip,一種免評估方法,透過尋找技能最短且忠實的結構化解釋來壓縮技能。其直覺是「一次解釋,多處引用」:將重複規則在其適用作用域內陳述一次,將重複的動作序列抽取為共享程序,並只保留差異作為明確例外。我們將此直覺形式化為一個型別化最小描述長度目標,作用於技能契約與殘差,並對每個抽取出的觸發條件、工作流邊、工具需求、義務與輸出欄位施加硬性覆蓋約束。該公式提供簡單的共享閾值,在構造上保留獨特且罕見的規則,並支援高效能的局部更新。SkillZip 具有一次性模式,只需一次結構化提取呼叫與確定性最佳化;以及持續的 Zip-on-Write 模式,可整合每個自我演化補丁,而無需重播任務或重新解析完整歷史。透過全面的實驗評估,我們展示了 SkillZip 在壓縮效能、泛化能力與成本開銷方面的有效性與優越性。
稀疏混合專家(MoE)層透過條件計算擴展了推薦系統的容量,然而訓練完成的檢查點仍會在其完整的專家庫上進行儲存與路由。我們研究一個部署問題:在明確的專家預算下,將該檢查點轉換為較小的標準MoE,且不添加任何壓縮專用的線上模組。為了解決此問題,我們提出UniMoMo,這是一個以約束圖粗化問題形式建構的訓練後壓縮框架。有別於依賴參數距離,UniMoMo根據專家的功能相似性進行分組,使用未標註的校準集來衡量專家對共享推薦狀態的反應相似程度。為防止效能退化,我們引入了一種層自適應保護機制,根據路由曝光度限制高流量專家的合併。在Amazon Beauty、KuaiRec和TenRec上,分別使用2、4和6個MoE區塊,最終的四專家檢查點獲得了相對於原始模型的五次運行平均NDCG@10比率為99.92%–102.30%,以及實測A100加速比為1.28倍–1.63倍。一個激進的兩專家、top-1操作點則獲得了98.36%–104.24%的比率和1.47倍–2.21倍的加速比。這些端點結果評估了完整的轉換與調適流程,顯示訓練完成的推薦MoE可以依照多種服務預算進行匯出。
視覺文件檢索(VDR)主要由數十億參數的模型所主導,這些模型在完整語料庫規模下建置索引緩慢,且部署成本高昂。先前的壓縮方法要不是從零開始訓練較小的多向量編碼器,就是只對查詢端進行蒸餾;這兩種方法都無法端到端地產生緊湊的單向量檢索器。我們提出 DistilVDR,這是一個 524M 的端到端 VDR 系統,在逐點餘弦對齊損失下,從單一 8B 視覺-語言教師模型進行雙向蒸餾。所有監督皆來自凍結的教師模型嵌入空間,而該空間本身是透過相關性監督訓練的,因此學生模型的目標不需要相關性標籤、負採樣或對比項。我們以非對稱的僅編碼器學生模型來匹配 VDR 的文字查詢與圖像文件輸入不對稱性,將視覺容量集中在文件端,並將查詢端維持在 70M 參數。我們發布兩個變體,它們共享相同的編碼器和訓練,僅在文件編碼器的視覺區塊預算上有所不同:DistilVDR-HiRes 在 ViDoRe v1+v2+v3 上達到 61.74 的平均 NDCG@5(相當於 8B 教師模型的 86.9%),並在高解析度敏感的 v3 基準上領先所有已重現的低於 10 億參數基準模型;而 DistilVDR-Fast 在視覺令牌預算僅為前者的三分之一時達到 59.98。兩個變體將一百萬份文件儲存在比最強的低於 10 億參數多向量基準模型小 15.6 倍的索引中,並以快一個數量級的速度對語料庫進行索引。程式碼可於 https://github.com/Ryenhails/NanoVDR 取得。
大型語言模型(LLMs)日益被部署為行動助理,其中一項關鍵挑戰在於善用分散於多個應用程式(apps)中的個人資訊來完成使用者指令。然而,由於缺乏專用基準,其能力至今仍未被充分理解。為填補此一缺口,我們提出SPIEval,一個以五項認知能力(即推理、消歧、整合、偏好推斷與多意圖分解)為基礎的人工策劃基準。SPIEval包含250項任務,涵蓋分散於10個應用程式中的4,335筆個人記錄,並透過21種工具支援多輪互動。分析顯示,此基準具備多樣化情境、具挑戰性的任務、分散的資訊、可控的環境與可驗證的結果。我們評估了九個具代表性的LLM,發現仍有大幅改善空間。表現最佳的模型GPT-5.5(xhigh)僅達到57.3%的準確率,而表現最弱者僅達16.4%。進一步分析揭示,79%的失敗源於資訊定位不精確,因為LLM往往執著於看似合理但錯誤的資訊,而非持續檢索以求驗證。我們亦發現,少於2%的檢索動作採用進階搜尋方法,並觀察到各模型在搜尋效率上存在顯著差異。這些發現揭露了當前基於LLM的行動助理之根本限制,並激勵了此一方向的未來研究。資料與程式碼可在https://huggingface.co/datasets/Junjie-Ye/SPIEval取得。
我們研究以開放式大型語言模型進行多語言機器翻譯的無參考後訓練。從經過監督式微調的 MiLMMT-46-v0.1 模型出發,我們應用群體相對策略最佳化(GRPO),其獎勵為兩個無參考品質評估模型的平均,並以語言識別作為門控。接著,我們對監督式微調(SFT)與強化學習(RL)模型檢查點進行線性插值,得到 MiLMMT-46-v1.0。在 46 種語言上,所得模型相較於其 SFT 對應版本一致地提升了翻譯品質,勝過近期強大的開放式基準模型(包括 Seed-X、HY-MT2 與 TranslateGemma),並且在針對 Google Translate、Gemini 3 Pro 與 GPT-5 等受評專有系統的評估中取得領先的無參考評分。我們進一步探討在策略蒸餾,發現其可達到、但未能超越透過 RL 搭配檢查點插值所實現的品質前沿。我們釋出模型與程式碼,以促進未來研究。
長文件理解通常需要在許多視覺豐富的頁面上進行推理,導致推論成本高昂且容易發生上下文衰減。在這項工作中,我們提出 InSight-doc,一個代理式視覺感知框架,將視覺解析度視為自適應的推理時間資源。InSight-doc 從低解析度開始,選擇性地放大到高解析度區域以獲取更精細的證據,且不依賴任何外部檢索器。為了訓練這樣的代理,我們建構了一個主動感知語料庫,包含 17.9K 個高品質 SFT 範例,帶有區域級別的放大軌跡,並附有 19.2K 個高難度 RL 範例。透過 SFT+RL,InSight-doc-8B 在文件 VQA 基準上將基線提升了 4.3 至 16.4 個準確度百分點。在長文件上,它將幻覺減少了超過 40%,並將推論延遲降低了 41% 至 68%,同時保持準確度領先。我們的程式碼、資料集和模型已公開於 https://github.com/m-Just/InSight-doc 。
我們提出360CityArena,這是一個用於評估具身智能體在由360度影片構建之照片級寫實環境中進行城市探索能力的基準。現有的戶外基準要不是缺乏足夠的照片級寫實度,就是缺乏複雜度,導致與真實城市環境存在相當大的差距。360CityArena 建構於日本東京秋葉原地區的真實重建,使用了涵蓋85條街道的602段360度影片,並包含175個由人工精心設計的任務。它涵蓋三個任務類別:環境理解、路徑推理與空間推理,涵蓋城市探索所需的基本能力,例如定位、地標搜尋、路徑規劃與關係空間推理,從而能在真實城市場景中進行全面評估。我們使用基於最新大型多模態模型(LMM)的智能體進行評估,結果顯示即使是最強的模型 Gemini 2.5 Flash,其表現仍遠低於人類水準(人類:77.3% 對比 Gemini 2.5 Flash:17.1%),揭示了城市規模的具身導航與推理仍存在重大挑戰。360CityArena 為照片級寫實城市區域導航與空間推理提供了一個必要且具挑戰性的測試平台。
基於查詢的遮罩 Transformer 透過最終層查詢預測之間的像素級競爭來組裝分割輸出,然而此推理過程並未在訓練期間被明確最佳化。我們識別出兩個關鍵的不匹配:具有最高機率-遮罩分數的查詢不一定產生最準確的遮罩,且最終層解碼可能丟棄來自中間層的更優預測。為了解決這些問題,我們提出推理感知學習(iFAN),一個適用於普通遮罩 Transformer 的通用訓練框架。iFAN 引入了調整後機率-遮罩排序(APMR),其將查詢競爭與預測遮罩品質對齊,並抑制高置信度但不準確的競爭者。我們進一步採用跨層自蒸餾(CLSD),將更強的中間層預測轉移至最終層。排序與蒸餾目標僅用於訓練,而推理則保留高效的最終層解碼。在 COCO、ADE20K 和 Cityscapes 上的實驗,展示了在全景分割、實例分割和語義分割,以及不同架構、骨幹網路規模和輸入解析度上的一致改進。整體而言,iFAN 平均提升了 1.20 PQ、1.30 AP 和 0.63 mIoU 的效能,同時僅增加可忽略不計的參數量、FLOPs 和推理延遲。
拼圖問題的求解需要同時推理視覺內容與幾何約束,然而現有基準採用矩形切割,在紋理重複區域會產生具有歧義的真實值。我們提出了 \ours{} 基準,其使用帶有凸榫與凹槽的互鎖拼圖塊;其中幾何約束提供了強烈的局部相容性要求,與視覺內容結合後可產生無歧義的真實值。在四種網格密度(4×4 至 16×16)的 95,000 個實例中,我們發現零樣本視覺語言模型(VLM)在很大程度上缺乏幾何推理能力:五個前沿模型中只有一個(GPT-5.5)在 4×4 拼圖上超過隨機基線,而其他所有模型的表現均與隨機水平相當。雖然監督式微調在 4×4 上可達到 97% 以上的準確率,但所有模型在更大的網格上都出現崩潰:GPT-5.5 在 8×8 上從 70% 降至接近隨機水平,即便是微調後的模型在 12×12 上也低於 5%。這種「擴展懸崖」表明,當拼圖塊數量增加時,目前的架構無法維持一致的約束滿足能力。該基準確立了可擴展的幾何推理作為視覺語言模型的一項開放挑戰。
真實世界的資料科學涉及涵蓋資料整理、探索、建模、視覺化與驗證的長期工作流程,並要求在真實作業環境中協調使用筆記本、整合開發環境(IDE)、終端機、瀏覽器與資料庫等工具。然而,現有的評測基準缺乏真實電腦互動,且未評估代理能否在真實運算環境中執行完整的端對端資料科學工作流程,因而未能捕捉資料科學實務中多階段、多工具的特性。我們提出 DSAgentBench,這是首個評估代理能否在真實電腦環境中自動化完整資料科學工作流程的評測基準。DSAgentBench 包含 275 項多元任務,涵蓋完整的資料科學生命週期,反映實務所需的複雜度與工具協調能力。每項任務都要求將決策建立在中間輸出之上並協調使用工具,同時配備確定性評估器,用以驗證分析正確性、視覺化輸出與模型效能,而非僅檢查程式碼執行。我們對 15 個閉源與開源模型進行的廣泛實驗顯示,即使是最強大的代理 Claude-4.6-Sonnet,任務成功率僅達 56.70%,而所有開源代理的成功率皆低於 1%,且經常在工具編排、作業系統落地與多步驟推理上失敗。這些結果揭示了當前代理系統與真實資料科學工作流程之間存在顯著的能力差距,使 DSAgentBench 成為發展具落地性、可驗證且自主運作的資料科學代理的基礎。我們於 https://github.com/vis-nlp/DSAgentBench 發布 DSAgentBench。
人工智慧的快速發展顯著加速了時間序列分析的研究,特別是在預測、分類和生成任務方面。近期模型,尤其是基礎模型,受益於時間序列資料集之間的相似性,因為該相似性在微調的來源資料集選擇中扮演關鍵角色。然而,許多現有的時間序列資料集相似性方法基準評測實作分散且難以擴展。為了解決此問題,我們提出了一個統一框架,即時間序列資料集相似性工具箱(TSDS-Toolbox)。我們的工作實現了:(1) 對時間序列資料集相似性方法進行系統性且可重現的比較;(2) 提供靈活的可擴展性,讓使用者能新增自定義資料集、相似性方法及下游時間序列任務;以及 (3) 透過整合的時間序列資料集縮減器,對資料集層級與序列層級的相似性方法進行一致的評估。TSDS-Toolbox 的有效性已透過多樣實驗設定下的全面實驗得到驗證。我們的工具箱已公開提供。
PLDR-LLM(冪律解碼器表示之大型語言模型)及其注意力機制 PLGA(冪律圖注意力)以一個由輸入生成、經學習得到的雙線性算子 G_{LM},取代了縮放點積注意力(SDPA)的固定雙線性形式;該算子係由正張量 A_{LM} 經逐元素冪律建構而成。此架構已被完整定義,並對照固定的參考版本進行驗證;各項主張分別標記為定理、條件定理、測量結果或猜想。無條件成立者包括:PLGA 在 G_{LM}=I 時精確包含 SDPA;A_{LM} 與 A_P 均為嚴格逐元素正,且 A_{LM} 具有佩隆-弗羅貝尼烏斯結構;DAG 正則化器具有 NOTEARS 遊走計數形式,且正性阻礙精確的無環性;在非共振條件下(標準旋轉頻率滿足此條件),交換子判準可識別哪些算子保留相對位置依賴性。推論坍縮定理:演繹輸出的精確輸入不變性會將推論坍縮為具有常數算子的廣義 SDPA。測量的不變性:相對波動在 10^{-6} 及以下;擾動界限雖可量化但無法認證快取推論;所組裝的代理指標遺漏了解碼餘量。一個條件性三階段機制(旋轉扭絞、集中化、列映射收縮)已在公開的檢查點上測量驗證。在全局 Gram 下的分塊訓練與評分有明確的目標揭露聲明;在所測樣本上,分塊評分與序列評分選出相同答案,並在已發表的 TruthfulQA 機率質量指標上於每項 5×10^{-5} 範圍內一致。自組織臨界性作為一種具有內稟序參數的現象學框架引入;開放性主張因而成為可證偽的猜想。部分選定的證明核心已於 Lean 4 中完成機器驗證。
近期針對檢索增強生成(RAG)的最佳化研究利用區塊層級的 KV 快取重用,以避免處理冗長的檢索上下文以提升效率,然而粗粒度區塊中仍存在顯著的資訊冗餘與雜訊。本文提出 CoinRAG(Contextualized Information Nugget KV Cache Reuse for Long-Context RAG),在低預填充延遲限制下最佳化柏拉圖效率前沿,同時最大化準確度。此名稱以比喻方式反映我們的核心機制:如同將小額代幣(或「硬幣」)組裝以累積更大的價值,CoinRAG 以組合方式重用離線計算的細粒度資訊碎片快取,以更具語意相關性且更精簡的方式高效率地形成學習式上下文表徵。具體而言,CoinRAG 不進行完整區塊編碼,而是透過兩階段檢索識別檢索區塊中與查詢相關的語意單元,並將其切片後的 KV 表徵與區塊層級上下文無縫組裝。在 LongBench 多跳問答任務上的廣泛評估表明,CoinRAG 顯著降低營運成本,並在標準快速預填充延遲預算下,以新的柏拉圖效率前沿和平均 5.3% 的答案品質(F1)相對提升優於其他基準方法。