每日精選AI研究論文及翻譯
混合專家(MoE)架構能顯著擴展模型容量,同時避免計算成本等比例增加。然而,在模型規模與詞元預算皆處於極端尺度下,透過掃蕩方式優化其超參數——尤其是學習率——在計算上仍是難以負荷的。本文提出一個節省計算資源的兩階段超參數遷移框架,透過跨模型寬度遷移來估計大規模 MoE 模型訓練的最佳學習率,進而外推至兆級詞元訓練視野。首先,我們為採用多頭潛在注意力(MLA)與 Muon 優化器的 MoE 架構,制定最大化更新參數化(μP)的適配方案,證明最佳學習率能在不同寬度縮放的模型之間一致地遷移。其次,我們沿著詞元維度建立可預測的標度律,將此可遷移性進一步延伸。透過對有限預算下的小型代理模型所推導出的最佳值應用線性回歸,我們成功地將理想學習率外推至大規模訓練視野(例如 10 兆詞元),且具備高度擬合度(R²=0.95)。因此,這表明在小型模型上進行代理訓練,便足以確定大規模 MoE 廣泛訓練的最佳學習率。我們將所提出的方法應用於從零開始預訓練基礎模型(總參數 155B,啟用參數 17B),穩定的訓練與評估結果驗證了:僅需極少的消融成本,即可準確預測全規模目標模型的最佳配置。
藉助大型預訓練模型,現有方法已有效改善基於指令的影片編輯。然而,其中大多數依賴於就地編輯假設:它們在固定的時間跨度內,將編輯後的影片與給定的來源片段逐幀對齊。這種模式無法適用於開放式串流,例如對實況遊戲進行重新風格化,或對進行中的鏡頭套用運鏡操作。在這些情況下,編輯必須擴展至隨到達的新增幀,而非套用於靜態輸入片段。本文研究此設定,並將其命名為無限影片編輯:給定前置片段與編輯請求,模型必須生成下一個片段,在套用所請求編輯的同時延續該串流。此過程會隨著編輯指令的無限序列到來而不斷重複。此任務帶來兩項挑戰:編輯必須是忠實的延續,而非逐幀重寫;且生成品質必須在編輯累積時保持穩定。為解決這些問題,我們首先設計了一套用於無限影片編輯的資料收集流程。基於所收集的資料,我們提出 InfinityEdit,這是一個輕量級編輯適配器,賦予串流影片生成器無限的編輯能力。該適配器包含三個注意力模組:歷史交叉注意力使用輸入幀引導去噪幀;時間因果自注意力僅讓時間線索從較早幀流向較晚幀;編輯交叉注意力則將編輯請求注入生成過程。在推論期間,適配器僅在編輯請求到達的區塊中啟動,後續區塊則由原始模型以重設錨定幀的方式生成。此方案在套用編輯的同時,保留了原始模型的無限生成能力。大量實驗顯示,InfinityEdit 能在每次編輯下忠實地延續串流,並在無限的編輯序列中保持穩定。
大型語言模型(LLM)已從語言生成器演化為能執行複雜、長時程任務的自主智能體。此一演化催生了多種範式,包括用以激發模型能力的提示工程(Prompt Engineering)、用以管理資訊存取的上下文工程(Context Engineering)、用以組織外部工具與資源的整合工程(Harness Engineering),以及用以支援持續反思與自我改進的迴圈工程(Loop Engineering)。然而,隨著任務日益複雜,個體智能面臨根本限制:許多任務需要異質專業知識、相互依賴的子任務、平行執行、獨立驗證與持久狀態,這些皆超出任何單一智能體的組織能力。僅擴充單一智能體的能力或上下文,無法解決這種架構不匹配;智能反而必須分散至專門化的智能體之間,並在系統層級進行組織。我們將此稱為系統智能:即智能體系統將多個智慧組件組織與協調成一個連貫、具適應性的整體,以追求共同目標的能力。要實現系統智能,不僅僅是增加智能體;它還需要明確的結構來組織工作、協調異質智能體,並維護持續演化的執行狀態。我們提出圖工程(Graph Engineering),這是一個為下一代智能體系統而生的新興範式。與先前主要最佳化個別互動或智能體層級行為的範式不同,圖工程建構出明確、動態且持續演化的圖結構,用以表示任務、智能體與系統狀態。這些抽象化概念為組織複雜目標、編排異質智能體、系統動態建模,以及實現可擴展的智能體演化,提供了統一的基礎。我們系統性地回顧了圖工程應用於LLM智能體的原理、方法與應用。相關論文、開源資料與專案已收錄於 https://github.com/DEEP-JLU/Awesome-Graph-Engineering。
近期,全模態大型語言模型(Omni-LLMs)展現出作為即時影片助理的巨大潛力,能夠持續感知環境並引導使用者達成特定目標。與傳統被動式影片理解不同,互動式助理應主動結合視覺狀態、使用者目標與先驗知識,以提供有效的協助。評估此類能力極具挑戰性,因為模型不可預測的回應會動態改變使用者後續的行為,而靜態離線資料集無法涵蓋這種情境。為了解決此瓶頸,我們提出了 OmniAssistBench。為了解決同一使用者目標可透過多種方式達成而導致的互動路徑分歧問題,我們提供模型源自原始影片的預定義先驗資訊,要求其沿著完全相同的路徑引導使用者。由於真實互動影片相當稀少,我們透過逆向工程現有的網路影片來建構資料集。我們推導出合理的使用者目標,並將影片分割為多輪片段,以模擬連續互動。此嚴謹的流程耗費超過 1,000 小時的專家工時來建構資料集。結果顯示,專有的 Gemini-3-Pro 在滿分 100 分中獲得 66.4 分,而開源的 Qwen3-Omni-Instruct 則取得 51.2 分。儘管當前模型大致能理解使用者輸入,但它們經常提供錯誤或不完整的回答。具體而言,它們在處理視覺提示(如手勢)方面存在困難,在多輪互動中無法維持歷史脈絡,也無法延遲回應直到目標事件發生。結果顯示,在模型能成為可靠的助理之前,仍有相當大的改進空間。
並行推理透過探索多條解題路徑來提升大型推理模型的準確度與穩健性,但其計算成本會隨推理深度與分支數量增加而增長。現有的平行路徑管理方法通常依賴最終答案共識、局部詞元置信度或孤立的中間探測。然而,這些訊號往往有所延遲、與實際推理進展關聯薄弱,或因過於嘈雜而難以進行動態的分支層級控制。為了解決這些限制,我們提出了 ParaTempo,一種免訓練的非同步並行推理框架。ParaTempo 由時間置信度驅動,這是一種衡量答案空間收斂程度的分支局部度量。每個分支會被定期探測以獲得暫定答案的機率分佈,而時間置信度則量化近期中間探測集中於主導答案的銳利程度。一旦累積足夠證據,ParaTempo 便僅依據此單一訊號驅動其整個控制流程:低置信度分支被剪枝、持續固守主導答案的分支提前退出、釋放的計算資源透過派生新分支重新分配,且當置信度加權投票集中時全局停止生成。無需在推理軌跡間進行同步,ParaTempo 即可基於分支層級收斂自適應地分配計算。在具有挑戰性的數學與科學推理基準測試上的實驗顯示,ParaTempo 在維持具競爭力的準確度的同時,將平均延遲降低了 21.8%–32.2%,總詞元使用量降低了 18.1%–30.3%。此外,時間置信度在未來分支收斂的預測能力與時間穩定性上,均優於詞元層級與瞬時訊號。
混合思考多模態大型語言模型(MLLMs)允許單一模型在深思型思考與低延遲的非思考推論之間切換。雖然這些模式在推理預算上有所不同,但其產出的回應應滿足相同的使用者導向標準。僅靠正確性可能不足以刻畫這種回應品質;因此我們將任務準確度與回應模式失敗視為互補的評估結果。我們透過回應模式對齊來研究這個差距:即思考與非思考介面是否維持可接受的最終回應行為。我們提出 PatternEval,一個富含失敗案例的診斷基準,包含 2,415 個多模態提示,涵蓋視覺感知與接地、結構化影像理解,以及多模態知識推理。PatternEval 測試四種常見失敗:思維鏈洩漏、回應重複、邏輯矛盾,以及表演式推理。回應模式失敗在不同提供者的模型中普遍存在,其中非思考推論的失敗率明顯更高,因而在思考與非思考介面之間造成系統性的失對齊。基於此診斷,我們開發了 PatternRM,一個回應層級的獎勵模型,以及 PatternRL,其在強化學習期間引入特定模式的懲罰。在 Qwen3-VL-4B 與 Qwen3-VL-8B 上的實驗顯示,將特定模式懲罰納入強化學習可減輕跨模式失對齊,同時僅付出輕微的任務效能取捨。總結而言,PatternEval 與 PatternRL 提供了一個評估與訓練框架,用於在混合思考介面之間對齊使用者可見的回應模式。
在策略蒸餾(On-policy distillation, OPD)透過監督來自學生自身策略所採樣的軌跡來遷移教師能力,然而其泛化行為至今仍未被充分理解,因為多數研究僅在單一領域及鄰近訓練資料的基準上評估OPD。我們提出了一個受控研究,每次僅變動單一泛化因素,範圍從域內分布偏移到跨域遷移及多教師設定。我們發現OPD遷移的是教師的推理行為,而非其對特定問題的答案:訓練難度幾乎不影響結果,甚至教師從未解出的問題也具有效用。遷移效果強烈取決於教師與學生之間的來源關係:同來源配對能使學生在跨語言、推理範圍、甚至其他領域上都接近教師,而跨來源配對則大多僅是擬合訓練分布。這種廣泛的影響力是一把雙刃劍:由於將提示路由至領域專家無法限制個別教師的影響範圍,結合多位教師會導致其能力之間出現依賴於混合比例的蹺蹺板效應。這些結果闡明了OPD何時能泛化,並為診斷多教師OPD提供了有用的視角。
真實世界的影像搜尋查詢具有多模態與組合式特性:「找一件粉紅色的這款襯衫」指定了要保留的實體、要修改的屬性,以及要忽略的上下文。然而,現有的重排序器要嘛將這種多面向的相關性壓縮成不透明的嵌入,要嘛依賴自由形式的思維鏈,而思維鏈容易省略或幻覺化精細的約束。借鑒自然語言處理中基於評分規程與檢查清單的評估,我們將多模態影像重排序重新建構為一個語意約束滿足問題,並提出EviRank。它能將任何查詢——僅文字、僅影像或組合式——解析為統一的證據包:涵蓋六個語意槽位(例如實體、屬性、關係)的類型化準則,每個準則標記為必需、禁止或可忽略。重排序因此簡化為證據條件化驗證,在單一免訓練流程中結合確定性評分規程計分與基於證據的清單式比較。這些明確的證據更可作為結構化監督,可選擇性地蒸餾出輕量級學生模型。在涵蓋文字到影像、影像到影像及組合式影像檢索的五個基準上,EviRank達到了最先進的效能,且蒸餾後的學生模型以大幅更低的成本保留了教師模型超過90%的能力。
語義視覺編碼器已成為多模態理解與影像生成中語義條件化的核心視覺介面。然而,其最終的 token 會丟棄細粒度的視覺細節,導致像素重建效果不佳,並限制了它們在如影像生成與編輯等對重建敏感的任務中的應用。在這項工作中,我們探討是否能基於預訓練的語義 ViT,在單一的視覺表示空間中同時建模理解、生成與編輯。我們證明,語義 ViT 的凍結 Transformer 區塊並非本質上無法保留視覺細節。相反地,原始的 patch 參數化會將表示導向語義抽象,使得從最終 token 中難以恢復細粒度資訊。基於此觀察,我們提出 Patch Reparameterization(patch 重新參數化),它在保留原有語義路徑的同時,加入具重建感知的 patch 嵌入,為相同的凍結 ViT 區塊提供細粒度視覺資訊。所產生的統一表示在保留多模態理解的同時,也能實現高保真影像重建,並取得良好的重建—生成權衡。我們進一步將此表示擴展為 UniSpace,一個 8B 規模的 Mixture-of-Transformer-Experts 模型,能在同一個視覺空間中執行理解、生成與編輯,而無需額外的 VAE 路徑。系統層級的評測展示了實際的文字轉影像生成與基於指令的影像編輯,證明重新參數化的預訓練 ViT 可作為可擴展多模態建模的統一視覺介面。
免訓練的區塊稀疏注意力能加速影片Transformer,但逐行的注意力集中本身並不足以定義一個可執行的稀疏運算子。共享同一區塊路由的查詢,其支撐集可能重疊度很低;然而僅靠保留的注意力質量,無法決定因跳過交互所產生的softmax後誤差。我們證明,分割幾何同時影響匯總的支撐集,以及從稀疏輸出預測剩餘殘差的可預測性。我們提出SparsePR,它將響應耦合分割(Response-Coupled Partitioning)與探針擬合殘差重建(Probe-Fitted Residual Reconstruction)結合起來。取樣查詢的鍵響應形成配對的K/V群組,這些群組的質心產生用於共享路由的查詢-響應座標。接著,少量精確的查詢行在探針殘差所觀察到的輸出子空間內,對稀疏輸出校準一個呼叫特定的仿射校正。在四個異質的影片生成與世界模型中,SparsePR一致地降低了注意力重建誤差。消融實驗顯示,探針擬合貢獻了此降幅的大部分,而響應耦合分割在有限探針預算下降低了硬丟棄誤差並改善了重建。SparsePR在22.0%–26.0%的實際執行配對密度下保持生成品質,同時實現1.48倍至2.61倍的端到端加速。專案頁面:https://pardistaghavi.github.io/SparsePR-website/
智能體透過與環境互動來學習行為,然而用於訓練的環境往往圍繞預定義任務和基準,以人工建構或合成方式產生。這種以任務為中心的研究範式,使得擴展能反映真實且不斷演進的工作流程之環境變得困難,因為在這樣的世界中,多樣化的任務自然會從底層湧現。我們提出AgentMercury,一個可擴展的框架,能從高階業務場景合成可執行的環境。AgentMercury並非為特定任務建構環境,而是先實例化一個持續存在的世界,其中包含實體、服務、工具、狀態以及可執行的跨服務不變量,使多樣化的任務和互動軌跡得以從中湧現。我們建構了涵蓋14個產業、50個國家的4,783個可執行環境,並將其作為強化學習的訓練基質。儘管這些環境在生成時並未針對評測基準,但在此類業務導向環境上訓練的策略,在企業工作流程以及涵蓋推理、程式設計、科學計算和工具使用的跨領域基準上均有顯著提升。在我們的實驗中,Qwen3.5-4B在AgentMercury環境上訓練後,於EnterpriseOps-GYM的成績從12.3提升至15.7,於AIME26的成績從45.9提升至56.0。我們進一步證明,建構過程本身是可以學習的:在建構軌跡上微調Qwen3.5-35B-A3B,使留出業務場景的可執行世界創作成功率從3.3%提升至83.3%。這些結果表明,以場景為基礎的環境能提供超越特定基準訓練的有用且可泛化的學習訊號,而其建構過程本身也能成為一種可學習的能力。
在行動裝置上部署視覺語言模型(VLMs)因其龐大的記憶體與運算需求而具有挑戰性。我們提出一個框架,用於對VLM進行量化,以在資源受限的硬體上實現高效推論。我們的方法結合了一條量化管線與一種新穎的2.7位元/參數格式;該管線利用模型本身生成訓練資料,且無需取得訓練設定,而此格式則支援在Arm CPU上高效執行。我們透過將Llama 3.2 11B Vision Instruct模型壓縮至3.7 GB並使用8位元激活值來驗證我們的方法,同時在一組標準視覺問答任務上保持強勁的效能。
小型語言模型通常先以大型模型的方式建構,之後再壓縮到 CPU 上執行。我們反其道而行:先鎖定目標——單一使用者、一次一個詞元、4 位元權重、一般 CPU——再選擇適合此目標的架構。結果,其 18 個區塊中僅有 6 個保留完整注意力機制;其餘 12 個使用短卷積,無論對話變得多長,這些卷積的記憶跨度僅有兩個時間步,因此網路中三分之二的區塊永遠不會重新讀取不斷增長的快取。 該模型以 599 億個詞元從零開始訓練,在五任務基準上得分 47.31,而訓練開始前設定的比較基準為 42.20。它超越了 GPT-2 124M、Pythia-160M、OPT-125M 與 GPT-neo-125M,這些模型均以三到六倍的資料量訓練;同時也超過 MobileLLM-125M 的公開得分,儘管後者的訓練資料達一兆個詞元。驗證的每位元組位元數(bits-per-byte)為 0.8685。 為了檢驗架構本身而非訓練配方,我們使用相同資料訓練了一個同等規模的傳統全注意力模型,並在評分前事先寫下勝出條件。混合模型在所選品質指標上勝出 0.81%,在下游任務上持平,產生的 4 位元檔案縮小 6.3%,且在 2048 個詞元上下文時解碼速度快 1.76 倍,對比同等規模的外部模型則快 2.08 倍。在所有測量中,速度優勢在空上下文時接近於零,並隨長度增加而增長;這正是該機制所預期的,而僅是更精簡的模型不會呈現這種現象。簡單的頻寬計算只預測 1.17 倍,因此單靠記憶體容量無法解釋這項差距。 我們也報告了未奏效的部分:4 位元造成的品質代價無法緩解;約一半的卷積通道最終呈惰性,且無法移除;詞彙表大小超過此模型規模所需。
我們介紹Hydra-0,一種以動作流為條件的通用世界模型,將機器人動作表示為像素運動。此共享視覺介面透過學習跨具體形態、任務、環境及影片生成骨幹的動作後果,實現通用的世界建模與控制。我們的最佳配置在機器人運動誤差上較動作條件基準降低90.4%,在物體運動誤差上降低60.2%,同時支援零樣本組合與資料高效率的適應。在RoboLab基準上,Hydra-0在重播與參考成功率之間達到皮爾遜相關係數r=0.96。最後,我們揭示了此介面的一種湧現逆向模式:一種世界動作模型,可從人類示範轉移的期望物體流預測相容的機器人運動。經過訓練的動作頭可將產生的潛在特徵映射為可執行動作,無需特定任務的專家機器人示範。綜合以上結果,這些成果展示了動作流作為一種共享控制介面的潛力,可連結異質訓練資料、開環策略評估與機器人控制。
在以基礎模型為代表的時代,以人為中心的智慧正持續演進,日益強調規模化、可遷移性與通用建模能力。然而,該領域尚未與基礎模型充分融合,以達到與之相當的進展。更為重要的是,這一廣闊領域內的最新進展仍因任務、模態及研究社群的不同而呈現碎片化狀態,使得其內在的概念與方法論關聯尚不明確。為彌合這些鴻溝並重新審視基礎模型時代以人為中心的智慧,我們提出了一套全光譜的人類情境分類體系,透過六個相互關聯的層級加以整合:將人類視為可觀察的主體(經由視覺外觀與空間幾何)、視為動態的行為者(經由運動動力學與互動建模),以及視為情境化的智能體(經由世界模擬與具身能動性)。接著,我們呈現該領域的方法論基礎,涵蓋以人為中心的資料家族、計算架構範式,以及具代表性的訓練與推論最佳化策略。隨後,我們系統性地回顧了這些層級中具代表性的方法,並整理了相關的資料集、基準測試與評估指標。我們進一步探討了朝向可擴展、可信賴、具物理基礎且可部署的以人為中心智慧所面臨的開放性挑戰與前景可期的研究方向,旨在為推進該領域提供一個連貫的框架與實用參考。最後,我們在專案頁面上提供了一個系統化組織且持續更新的以人為中心人工智慧文獻與資源集合。
模擬真實的用戶購物行為是電子商務場景中離線評估與強化學習的基礎。儘管近來基於LLM與VLM的模擬器已取得令人鼓舞的進展,要重現真實的瀏覽過程仍然存在兩大困難。(i) 記憶挑戰:一次購物過程橫跨數十個頁面,然而現有智能體若非丟棄長程觀察歷史以致失去不斷演變的用戶狀態,便是簡單地串接所有歷史,使上下文窗口不堪負荷,甚至降低模擬品質。(ii) 最佳化挑戰:目前的用戶模擬器通常透過模仿或步驟級獎勵來監督以匹配每個已記錄的動作;然而,由此產生的過程往往表現出諸如過度探索或過度被動等不真實的模式,而逐步驟的監督既無法察覺也無法修正這些問題。 為了解決上述挑戰,我們提出 RecVerse,一個基於 GUI 的模擬智能體,透過螢幕截圖感知頁面,並產生忠實的多輪軌跡。針對記憶挑戰,RecVerse 採用受認知科學啟發的層級式記憶:以工作記憶處理短期焦點、情境記憶保存過程中的痕跡、偏好記憶捕捉高層意圖,並將記憶更新視為動作,使智能體能適應性地學習何時記憶以及記憶什麼。針對最佳化挑戰,RecVerse 以軌跡層級的強化學習目標進行最佳化,對完整過程進行評分,同時在宏觀層面調整動作類型分布、微觀層面對齊購物意圖,以求與真實用戶一致。我們進一步釋出 USB(User Simulation Benchmark,用戶模擬基準),一個用於多輪用戶模擬的互動式電子商務 GUI 軌跡資料集。實驗結果顯示,RecVerse 在行為真實度與意圖一致性上均顯著優於現有基準方法。
大型語言模型(LLM)智能體在群體層面的行為無法以單一智能體基準來表徵。我們引入PV-SST(同儕投票社群平台測試平台),並報告一項分別凍結、預先註冊的匹配暴露實驗,涵蓋四個主題、四個未使用的隨機種子、四個開放權重模型系列,以及三個預先指定的較大變體。該實驗包含448次試驗與112個完整的模型×主題×種子區塊。相對於僅含主題的對照組,以前一輪同儕貼文(按同儕產生的讚數排名)組成的訊息流提高了最終回合的詞彙相似度:在四系列核心面板中(配對平均差異+0.0082個TF-IDF餘弦單位,95%區塊拔靴信賴區間 [0.0043, 0.0121],隨機化p=0.000105,n=64個區塊),以及在三變體規模擴展中(+0.0109 [0.0069, 0.0151],p=0.000001,n=48)。此對比同時涵蓋同儕貼文暴露與排名因素,因此無法識別僅由排名造成的效應。對立立場存續率在核心面板中下降(-3.9個百分點 [-6.8, -1.6],p=0.0068),但在較大變體中無確切結論(-1.0個百分點 [-3.1, 0.4],p=0.50)。在對抗性印象保持不變的情況下,四個分散來源對誠實智能體立場的影響,並不穩定地大於單一來源。預先註冊的分散來源減去單一來源對比在核心面板中為正向但無確切結論(+0.057 [-0.009, 0.125],p=0.112),在較大變體中則為負向(-0.040 [-0.113, 0.035],p=0.332),未通過預先指定的跨模型與跨主題一致性標準。因此,穩健的結果是在所測試的同儕排名訊息流下產生詞彙趨同,而非普遍的意見捕獲或普遍的協調優勢。本研究評估的是合成LLM智能體群體;其並不估計對人類或實際生產平台的效應。
提升大型語言模型(LLMs)的安全性往往以犧牲效用為代價,因為全域套用的安全調校可能會影響模型對有害與良性輸入的反應。我們提出連續潛在適配器路由(Continuous LatEnt Adapter Routing, CLEAR),這是一個條件式安全調適框架,利用輕量級隱藏狀態門控來持續控制安全低秩適配器的激活強度。CLEAR旨在減少有害的生成內容,同時避免對凍結的主幹模型進行不必要改變,以免降低其對良性提示詞的效能。在廣泛使用的安全性與效用基準上的實驗顯示,CLEAR提升了在HarmBench上的穩健性,同時減少了全域套用安全調校(如SFT或標準低秩適配(LoRA))所導致的效用下降。在Llama-3-8B-Instruct上,CLEAR將HarmBench的攻擊成功率(ASR)從32.3%降至0.5%,同時保留了基礎模型大部分的效用,並在GSM8K準確率上比全域套用的SFT或LoRA高出最多7.1個百分點。這些結果表明,CLEAR是改善LLM對齊中安全性—效用權衡的一種具前景的機制。
我們提出 PhysCaP,一種用於機器人操作中主動感知的具物理資訊之程式碼即策略(Code-as-Policy)代理。雖然視覺-語言-動作策略擅長模仿示範,但它們依賴被動觀察,無法推斷對操作至關重要的潛在物理屬性。PhysCaP 在程式碼即策略框架中加入了物理資訊探索層,使代理能透過互動進行明確的資訊搜尋。它引入了免訓練的物理屬性提取模組,僅憑機器人本體感覺即可估算物體質量與剛度,無需額外感測器。為了平衡探索成本與所獲資訊的效率,PhysCaP 採用雙代理設計:規劃器(Planner)決定何時探索、何時停止;優先排序器(Prioritizer)過濾不合理的互動,並以啟發式優先分數對其餘互動進行排序,從而實現高效且有目標的探索。我們在真實世界的桌面操作任務(搜尋隱藏物體、偵測空罐、尋找成熟酪梨)以及 LIBERO 中的模擬任務上評估 PhysCaP。結果顯示,現有的被動式與樸素互動式基準方法在物理屬性隱藏時不是失敗,就是過度探索;而 PhysCaP 能以較少的互動次數和縮短的執行時間達到相當的效能。消融研究進一步驗證了所提出之物理屬性提取模組的有效性。專案頁面:https://physcap.github.io
開放式語言模型基準通常依賴繼承而來的評判者:人類偏好評審團、另一個模型,或脆弱的精確比對答案。我們提出 FlavourBench,一個自動化基準,其中一套具版本管理的烹飪系統提供密集且可執行的真實答案。每一項任務提供八種食材,並要求選出三種食材的組合;在模型執行之前,Epicure 已對全部 56 種可能的組合進行評分。我們在一個包含 534 項任務的相同核心上評估 27 個前沿模型端點,涵蓋替代、搭配與受限組合。每個排名模型在每個評審團與家族中恰好有 89 個有效回應(共 14,418 個模型-任務單元),從而消除排行榜中的差異性缺失。FlavourBench 分數為家族等權平均的凍結任務分數。我們使用 50,000 次錨定叢集拔靴複製來建立同時 95% 分數區間,並使用 100,000 次符號翻轉抽樣進行全部 351 組成對模型對比,且以 Holm 法控制多重比較。兩個獨立編制的評審團之間的相關係數為 r = 0.89(等級相關係數 rho = 0.80)。Grok 4.6 的點估計值最高,為 65.1(同時 95% 信賴區間 61.0–69.2);351 組模型配對中有 101 組獲得顯著區分。本次發布包含提示詞、所有組合分數對照表、原始回應、確切路徑、內容雜湊,以及一個可重現所有結果的離線驗證器。
我們探討聖訓計算科學如何被Transformer模型、基於檢索的管線與大型語言模型(LLMs)所重塑。近期回顧文獻記錄了相關研究的增長,但尚未批判性地說明哪些進展在方法論上穩健、哪些仍受制於基準評測,以及哪些未解決的問題仍限制學術應用。我們透過一項批判性敘事回顧來填補此缺口,該回顧結合對既有回顧的評論、對具代表性原始研究的逐篇評析,以及綜合伊斯蘭學者與領域專家對真實性、權威性與負責任使用的觀點。我們發現進展並不均衡。資料資源已擴展,分段任務已趨成熟,傳述人與來源驗證問題得到更完善的形式化,而LLM輔助的工作流程現已支援語料庫規模的豐富化、多語言存取與具依據的評估。與此同時,進展仍受限於狹窄的語料庫、薄弱的基準可比較性、合成資料到真實資料的遷移落差、傳述人身份解析、前處理的脆弱性、有限的可重現性,以及稀少的專家依據驗證。我們表明,重要的缺口存在於主流基準之外:非正典與冷門語料庫、注疏與解說文獻、與古蘭經和聖傳的跨來源連結,以及面向伊斯蘭法學的證據支援。我們主張,聖訓計算不應僅被評估為孤立的模型效能,而應視為一項需要知識整合、來源追溯與專家監督的證據基礎設施問題。在此基礎上,我們定義了一項研究議程,旨在使該領域在方法論上更加穩健,並對伊斯蘭學術更具實用性。