每日精選AI研究論文及翻譯
AI智能體在持久環境中運作,環境中早期的狀態變化可能對遙遠未來的決策產生影響。與傳統語言模型互動不同,智能體行為是透過一個共享狀態來調節的,該狀態在長時程工作流程中被反覆修改並重用。目前的安全基準測試往往因聚焦於短暫且靜態的任務,而無法捕捉這些累積風險。為了解決這些限制,我們引入了OpenART——一個透過環境演化實現可擴展智能體紅隊測試的開放式競技場。OpenART提供了涵蓋50個領域、超過10,000個經驗證的有狀態場景,並從超過500,000個工具與技能的資源池中汲取素材。這些任務的中位數工具呼叫次數為97次,並支援跨75種不同智能體模型配置的統一評估。為了系統性地探索這些持續演化的攻擊面,我們提出了演化馬可夫超圖攻擊(EMHA)。EMHA是一種黑箱策略,透過協調授權的狀態轉換來執行回饋驅動的環境演化,無需進行參數更新。在整個評估過程中,任務目標保持固定,僅有環境狀態發生變化。在所有配置中,EMHA達到了85.0%的彙總攻擊成功率(ASR)。相較於僅指令演化,其優勢從簡單環境中的約2%擴大到最複雜環境中的超過17%,顯示隨著任務複雜度的增長,環境演化日益暴露安全缺陷。此外,我們的分析表明,智能體的具體運行時實作解釋了超出底層模型能力之外的安全變異的顯著部分。這些結果確立了OpenART作為在複雜、演化環境中研究智能體安全的可擴展基礎。
將研究構想轉化為完整論文需要的不只是文字生成:系統必須檢索文獻、設計並執行實驗、根據證據修訂主張、產出可出版的圖形,並在漫長的生成過程中保持一致性。我們提出 Spark-to-Paper,這是一個端到端的研究論文生成系統,以現有程式碼助手內部的十三個可組合技能實現,無需獨立的代理平台或編排服務。Spark-to-Paper 將基於模型的判斷與可直接執行和驗證的確定性操作分離。它進一步將實驗規劃與報告分離,使所需證據在觀察結果之前即被指定,而稿件主張則根據實測結果進行修訂。為了提升長研究軌跡的可靠性,系統結合確定性完整性檢查與自我批判,並限制了我們稱為「自我反駁迴圈」的失敗模式——在該模式中,重複的實驗持續否決原始研究目標。Spark-to-Paper 也透過程式化繪圖為實驗結果產出可編輯的向量圖形,並以程式碼重建方式生成方法圖表。在八個受控研究主題中,Spark-to-Paper 達到 99.5% 的引用有效性和 96.4% 的圖形可編輯性。受控消融實驗將虛構偵測率從單次生成草稿的 14% 提升至完整完整性與審查堆疊的 92%,而對抗式審查達到 74% 的精確率。完整系統使用 1,190 萬個標記,每篇稿件花費 8.1 美元,平均需要 3.2 小時。這些結果表明,端到端的研究論文生成可以作為現有程式碼助手內部的輕量級、可組合工作流程來實現,同時保持實驗證據在主張被接受、修訂或放棄過程中的核心地位。
近期關於蒸餾的研究,常透過教師強制、在策略蒸餾及相關的訓練時間方法,更新較小模型的參數,將大型模型的能力轉移給較小模型。在本論文中,我們探討此類轉移是否可以在測試時間發生。我們研究強對弱鷹架:較強的建構者模型是否可以建構推論時間框架,在沒有任何參數更新的情況下,幫助較弱的目標模型更可靠地解決任務。我們使用四個具代表性的心智理論基準,每個建構者模型使用 5% 的資料作為驗證集,透過多輪迭代來精煉其框架,之後在完整測試集上評估最終定稿的框架。實證上,此種測試時間能力轉移非常有效,將目標模型的平均效能從 0.49 提升至 0.91,幾乎翻倍。我們的分析顯示,這些增益主要來自於將不穩定的模型推理卸載到確定性程式碼、基準特定的路由,以及嚴格的答案格式強制執行,而非來自於鼓勵目標模型進行更廣泛的推理或更廣泛的抽樣。我們進一步發現,建構者模型的推理投入會單調地提升框架品質;相對於建構者模型自身的能力,平台效應是有限的;而較弱的目標模型獲得的增益最大。這些結果顯示,推論時間框架設計是傳統訓練時間蒸餾的重要補充,使得強模型無需重新訓練即可將認知結構轉移給較弱的模型。
AI模型在眾多領域取得了卓越成就,然而其能力背後的機制以及可能帶來的風險仍未被充分理解。隨著AI開發速度加快且日益自動化,機制探索在很大程度上仍依賴人工,這使得模型的能力與我們理解和控制它們的能力之間的差距不斷擴大。為彌補這一差距,我們提出了Mechanist——一個將AI作為科學儀器、用於自主發現AI智能背後機制的智慧體系統。為支持自主機制發現,我們建構了一個以可解釋性為核心、包含約13,000篇論文的知識圖譜,並將其與一個涵蓋26個領域、共4,300萬篇論文的跨學科資料庫進行整合。我們進一步整理了包含32種基礎方法的函式庫,涵蓋機制分析、因果干預與驗證。與Claude Code及現有的AI科學家系統相比,Mechanist能產生更有價值的機制假設,並更可靠地執行實驗。Mechanist亦展現了從發現模型行為到解釋與控制AI模型的進展。具體而言,Mechanist首先在科學實驗室中發現了一個違反直覺的安全風險,顯示不安全特徵可透過看似安全的訓練資料在模態之間轉移。接著,Mechanist發展了一套關於信念的機制理論,揭示了模型如何表徵世界知識、形成信念、推斷他人的信念,以及這些機制如何在預訓練過程中湧現。最後,Mechanist將這些機制洞見轉化為實際干預措施,在多種場景下提升模型效能,並引導科學基礎模型生成具有指定屬性的DNA序列。
大型語言模型(LLMs)日益作為智能體運作,其程序性知識以可重用的技能套件形式儲存,並在推論時載入。隨著技能庫不斷增長,一個核心挑戰是如何在有限的上下文預算下,暴露最小且充分的可執行上下文。現有系統難以在整個技能層級之下重用常規流程、在壓縮過程中保持程序契約、確保留壓縮後的常規流程可執行且可擴展,以及隨著技能演進而更新壓縮庫。這些挑戰揭示了一個單元錯配:技能以套件形式被檢索,以文字形式被壓縮,並在檢索後才轉換為執行圖,而可靠的復用需要一個承載契約的程序單元。我們提出 SkillZip,一個執行感知的程序抽象框架,它在區段級圖上執行保持契約的壓縮。SkillZip 將重複出現的契約有效模式改寫為可逆的移植宏,同時保留邊界簽名、依賴閉包、驗證器可達性及源級擴展。在推論時,它水合出一個緊湊且依賴閉合的上下文,並僅在需要時展開宏。ReZip 進一步整合新技能,並利用執行證據修訂高風險宏。在技術與具身智能體基準上的綜合實驗表明,SkillZip 持續優於最強基線多達 12.2 個百分點,同時實現 3.46 倍壓縮比、99.2% 的依賴保持率與 98.7% 的驗證器可達率。擴展性分析進一步確認了在 200 至 100K 技能庫範圍內的穩健檢索能力。
大型語言模型(LLMs)的快速進展正透過實現開放式且流暢的互動敘事,徹底改變遊戲人工智慧領域。然而,現有研究大多忽略了在面對不受約束的使用者干預時,維持長時程邏輯一致性與敘事完整性的關鍵挑戰。為了解決此問題,我們將此挑戰定義為「敘事承諾保持」(Narrative Commitment Preservation, NCP),並以互動敘事作為我們的測試平台。我們引入了 NCP-Bench,一個由 100 個改編自電影情節梗概的敘事環境所組成的基準測試。每個環境都包含一個結構化的敘事規範(軌跡、承諾與初始事實),我們可在玩家代理與敘事代理互動的過程中自動進行檢查。跨越多個最先進 LLM 的實驗結果揭示了一個顯著的長時程一致性缺口:高語言品質並不保證承諾的保持;即便是強大的模型,在面對對抗性干預時也經常生成邏輯衝突的內容,其中表現最佳的模型(GPT-5.2)在 20 回合後的存活率僅達 42%,各模型的事實衝突率介於 40% 至 68% 之間,且僅有少數孤立回合能在 100 回合的限制內滿足所有成就承諾。
預視化是電影、遊戲、建築與都市設計中,介於構思與製作之間的中間層。它讓創作者能以疊代方式精煉場景、動作、攝影機與時空動態。然而,現有的生成方法依賴簡單的提示詞,透過一次性的影像或影片合成來共同控制所有這些因素,導致可控性薄弱,且對疊代編輯的支援有限。從根本而言,一個世界由多個具備幾何、外觀及其他屬性的元素,以及攝影機所組成。不同的畫面是透過對這個共享狀態進行局部修改或重組而產生的,而這個狀態在大多情況下會被重複使用。因此,我們認為所缺少的是一個明確且持久的工作狀態。為了解決這個問題,我們提出 StateFlow,一個以狀態為中心的生成式預視化框架。StateFlow 並非一次性生成影片,而是使用可編輯的 3D 世界來組織場景結構、演化過程與攝影機,同時在需要更高保真度時,借助現成的影片模型來提升視覺品質。這個世界被維護為一個由場景元素與攝影機配置所構成的持久化結構化 3D 狀態,作為預視化的核心工作表徵。基於此洞見,StateFlow 包含三個階段,分別用於建構、演化與取用世界狀態。狀態建構階段透過先驗引導、衝突感知的雙視圖初始化,將生成的 2D 內容提升為連貫的 3D 世界。狀態演化階段則在使用者意圖轉化為結構化狀態轉換的同時,保留世界記憶,避免每次編輯都需重新生成整個場景。狀態取用階段利用渲染回饋的反思機制,將攝影機規劃精煉為視覺上可行的軌跡,避免僅依賴 VLM 的語意理解。實驗結果顯示,StateFlow 能為影片創作與類遊戲原型開發產生高品質的 3D 世界。
近期的視覺基礎模型(VFM)能夠在單次前向傳播中預測深度、相機姿態與點圖,無需逐場景優化,並展現出強大的泛化能力。然而,強制執行顯式的多視圖幾何一致性(例如透過光束法平差)計算成本高昂,因此在 VFM 預訓練階段並未施加此約束,從而可能導致不一致性的產生。為了解決此問題,先前研究雖在測試時施加源自模型輸出(如點圖、特徵)的隱式自一致性,但其帶來的效能提升本質上有限,尤其當預訓練 VFM 在特定場景中的預測極不準確時更是如此。與此類隱式信號不同,我們提出 Self-Geometry——一個即插即用的測試時自適應流程,直接利用二維像素對應關係作為偽真值,施加顯式的多視圖幾何約束。我們提出的 Self-Geometry 包含三個組成部分:幾何解耦優化(Geometric Disentanglement Optimization),結合多視圖一致性損失與對極一致性損失,並透過梯度解耦(Gradient Disentanglement)避免梯度衝突;幀角度鄰域(Frame Angular-Neighbor),一種基於 SO(3) 測地距離的視圖取樣器,用於輕量地施加上述約束;以及輕量級測試時自適應(Lightweight TTA),透過 LoRA 對 VFM 進行適配。我們的方法在六個 VFM(VGGT、π³、DA3-Giant/Large/Base/Small)與四個基準測試(7Scenes、ETH3D、ScanNet++、HiRoom)上,於姿態估計與幾何估計兩個面向均取得一致的效能提升。
世界建模是一個尚未定型的領域:架構、訓練目標與狀態表示之間存在複雜的交互作用,且沒有任何單一方案能橫跨各種環境佔據主導地位。這使其成為以自主研究人員角色運作的 AI 編碼代理的理想試驗場——在這種情境中,改進方向並非事先指定,這與當前代理基準測試中佔主導地位的按規格工程任務形成對比。我們推出 AutoModel-Bench,這是一個閉環基準測試,其中前沿編碼代理在固定計算預算下自主改進所提供的世界模型起點程式。該基準測試涵蓋八個遊戲環境,統一採用結構化狀態表示——從每個遊戲中提取的真實實體狀態,並透過共享的張量格式進行消費——如此可將動力學建模與感知分離,使每次運行僅需數分鐘即可完成疊代。在 64 場會話中,Codex-5.4 與 Claude Opus 4.6 在其中 63 場成功改進了起點程式;在 91% 的會話中,勝出的編輯屬於非平凡的科研型修改——新目標、新表示、新 rollout 程序或架構變更——而非超參數微調。我們的基準測試提供了一個情境,使前沿編碼代理得以在開放式研究而非按規格工程問題上接受評估。
具身智能體日益以基礎模型為核心來構建系統,其效能不僅取決於模型權重,也取決於環繞模型的技能、情境、動作介面與執行框架。雖然監督式微調與強化學習能使智能體適應新環境,但它們需要額外的資料、獎勵與訓練運行;與此同時,許多免訓練且以程式碼為中心的方法依賴可程式化機器人API,而這些API在固定介面設定中可能無法取得。我們提出SHAPER,一個用於免訓練具身適應的自演化框架:它保持模型參數凍結,並透過在目標環境中的展開,演化可重用的技能與情境-程式碼執行框架,從而改進非參數化代理系統。在SHAPER中,同一個凍結模型既可充當規劃器也可充當優化器,在無需更新參數的情況下精煉其外部技能與情境-程式碼執行框架。我們在VLABench與ESI-Bench上評估SHAPER,涵蓋具備不同低階動作介面的具身智能體,並與純執行、監督式微調以及測試時擴展基線(如無驗證器選擇與投票)進行比較。結果表明,當模型訓練成本高昂、不可得或不理想時,技能與執行框架優化是實現自演化具身智能體的一條務實途徑。
與外部工具整合的大型語言模型(LLM)代理容易受到嵌入在環境狀態中的間接提示注入攻擊。然而,現有研究大多依賴手動實作或重複使用的環境、基於 LLM 的隨機工具模擬,以及預先定義的注入位置,限制了在更廣泛領域中進行可擴展的安全研究。為填補此一差距,我們提出了 **ToolHazard**,一個可擴展的對抗性環境合成框架,可減少人工工程,並支援透過額外的種子領域和計算資源進行擴展。透過環境模擬器、攻擊者代理和使用者模擬器,ToolHazard 能合成可執行的有狀態環境、發現可行的注入點並產生特定環境的攻擊載荷,以及建構基於狀態的長時程任務。基於 ToolHazard,我們建立了 **ToolHazard-Bench**,用於在複雜工作流程和多樣化環境攻擊下對代理進行壓力測試。實驗揭示了代理存在重大漏洞,並顯示注入時機和位置會影響攻擊有效性。此外,ToolHazard 產生的對齊數據能提升 ToolHazard-Bench 和 AgentDojo 上的安全性,同時保持良性任務的效用。
世界按照其動力學——即運動定律——演進。然而,主流影片擴散模型在很大程度上僅是擬合像素,而並未建模像素隨時間的轉換過程。因此,它們能渲染出視覺上合理的幀,但未必精確遵循物理定律。為純粹從像素中捕捉動力學,我們提出了潛在動力學推理(LDR)。LDR將潛在狀態轉換明確表述為運動學積分,其中低階動力學以數值方式積分,模型僅回歸驅動推演的第三階及以上殘差。為使此積分具備更強的外推能力,LDR在結構化潛在表示而非密集卷積特徵上進行運算。遵循PhyWorld,我們在涵蓋五項任務(勻速運動、拋物線、碰撞、彈跳、逼近)的受控白盒物理基準上驗證LDR,並聚焦於分布外場景,以揭示模型是否真正學習到了底層動力學。LDR能大幅更優地外推所學動力學:在256²解析度下,無論是單任務還是聯合任務訓練,其分布內外誤差之間的差距比影片擴散基線小逾20倍,同時參數量減少26倍,運行速度提升143倍。LDR甚至能在嚴重的分布偏移下進行泛化:例如,僅以紅球自左向右運動的數據訓練後,它能正確預測藍色方塊自右向左的運動。據我們所知,這是首個能將所學動力學外推至訓練分布之外的影片世界模型。專案頁面:https://lat-dyn-reason.github.io/
透過玻璃拍攝的影片常含有反射,這些反射會降低視覺品質並干擾下游視覺任務。雖然單張影像的反射移除已獲廣泛研究,但影片反射移除在很大程度上仍未被充分探索,原因在於缺乏成對的影片資料、具時間連貫性的移除模型,以及專門的評測基準。我們提出一個閉環框架,統一了基於物理的反射模擬、基於擴散的影片去反射與基準評測。我們的 S2R-Synthesis 流程在結構空間中執行基於物理的增強,並使用訓練過的影片擴散渲染器渲染逼真的反射影片,從而生成成對的含反射與無反射影片;該增強模擬了與玻璃相關的主要效果,包括粗糙度引起的模糊、厚度引起的重影以及反射率變化。基於這些合成資料,我們提出 S2R-Removal,這是第一個基於擴散的影片反射移除模型。它透過反射感知的潛在空間適應與單步像素-幾何精化,來適應預先訓練的影片擴散先驗,並在單次去噪步驟中恢復乾淨的透射成分。我們進一步建構 S2R-Bench,這是第一個用於影片反射移除的基準,支援全參考評估與真實世界的人類感知評估。在 S2R-Bench 和多個公開影像基準上的實驗顯示,我們的方法達到最先進的效能,且推論速度甚至比非擴散基線更快,並驗證了 S2R-Synthesis 的有效性。專案頁面:https://codingwzp.github.io/VideoDereflection_S2R。
「以圖思考」(thinking-with-images)典範為多模態大型語言模型配備主動的視覺操作,例如裁剪與縮放。然而,使用這些操作的模型相較於直接推論,往往僅能獲得邊際甚至負面的增益,卻伴隨顯著更高的 token 成本。它們也可能重複裁剪無關區域,並在直接推論能正確回答的問題上失敗。我們追問:返回的視覺證據是否對答案產生因果效應?為回答此問題,我們將視覺工具使用形式化為一個因果圖,將觀測中介的路徑與動作誘發的捷徑區分開來。接著我們透過三個層級的干預對其進行審計:策略層級(比較工具使用與直接推論)、軌跡層級(在推演過程中破壞所有觀測),以及步驟層級(在固定前綴下反事實地替換單一觀測)。我們的步驟層級估計量——視覺證據增益(Visual Evidence Gain)——隔離了每個返回觀測的貢獻。在六個代表性模型與五個細粒度感知基準上,我們發現策略校準不良,存在兩種失敗模式。在「不看就呼叫」(Calling Without Looking)中,返回的觀測對答案沒有因果效應。在「不規劃就看」(Looking Without Planning)中,觀測具有資訊量,但呼叫排程不一致。軌跡層級的診斷將策略層級的準確率增益分解,並顯示增益集中在「校準良好的少數」上。我們將此差異稱為視覺工具使用的幻覺:儘管整體準確率有所提升,視覺工具使用在廣泛的推演範圍中並非因果有效地發揮作用。程式碼位於 https://github.com/OpenCausaLab/CauAudit。
由大型語言模型(LLM)驅動的代理系統為商業構思開闢了新的契機。然而,現有方法仍局限於純文字模式,儘管現實世界情境本質上具有多模態特性。為此,我們提出MBA-Bench,這是首個用於訓練與評估商業構思代理的多模態基準,涵蓋六個領域共30,000個樣本,每個領域皆具備無法僅靠文字完整傳達的獨特視覺線索。具體而言,我們自動為圖像生成標註,並透過檢索查詢生成、市場證據檢索與證據增強合成,使用GPT-4o針對三個商業問題各生成五個參考構思。遵循既有研究,我們以多模態大型語言模型作為評審(MLLM-as-a-Judge),依六項商業導向標準評估代理效能。為考量標準隱藏或公開的不同設定,我們分別提出MBA-b(盲測)與MBA-k(已知標準)。兩者皆以兩個新穎的獎勵目標——創造性與可行性——進行訓練,而MBA-k另針對六項公開標準進行優化,共計八個目標。兩者均採用基於LoRA的有監督微調,再以針對各設定獎勵的群體相對策略優化進行訓練。為在MBA-Bench上進行全面實驗,我們設置了兩個基線,分別容納僅標註輸入與多模態輸入,其中後者在多項指標上接近閉源效能。MBA-b與MBA-k相較標註基線分別提升63.9%與77.1%,相較多模態基線則分別提升25.6%與35.8%。
複雜軟體系統的開發時間跨度往往超過任何單一編碼智能體的生命週期。多數智能體軟體系統透過持久化會話、記憶、管理器或共享上下文來維持連續性。我們提出 EvoX Genesis(以下簡稱 Genesis),其做法相反——讓軟體專案保持持久,而本地智能體則維持有限生命週期。Genesis 將軟體表示為一個持久的遞迴世界:每個本地世界由已接受的版本與儲存庫路徑所定位,有限生命週期的智能體提出本地變更,遞迴委派將工作跨路徑移動,唯有被接受的結果才能推進持久的版本歷史。我們在形成、延續與再開發三個階段評估此組織方式。從一個沒有編譯器實作的儲存庫出發,Genesis 使用 DeepSeek V4 Flash 建構了一個約 25 萬行追蹤程式碼的 Rust 語言 C 編譯器;整個運行歷時超過 120 小時,歸檔了 1,000 多個智能體回合,而模型代幣費用僅花費 44 美元。該編譯器通過了完整的 c-testsuite 以及大部分 LLVM 和 Csmith 測試。在另一個使用 GLM 5.2 生成的獨立編譯器世界中,開發在反覆更換智能體後仍持續進行,同時完整保留測試表現。Genesis 也將 13 個 MESA 模組(超過 10 萬行 Fortran 程式碼)重新實作為一個接近 9 萬行 Rust 程式碼的 Rust 工作區;在六個數值工作負載中,達到了 1.55 至 6.87 倍的中位數加速。這些結果表明,長時程軟體開發可以圍繞持久化的專案來組織,而非依賴持久化的智能體。
長期以來,探索一直是強化學習研究的核心主題。近期,越來越多的證據顯示,探索也是大型語言模型(LLM)強化學習訓練流程中的重要組成部分,可對下游表現產生顯著影響。許多現有方法在動作空間中控制探索,例如透過溫度縮放。然而,這類方法無法重新排列詞元,僅能影響輸出分佈的變異數,因而限制了探索的範圍,可能導致訓練發散或停滯。在本研究中,我們探討參數空間探索——透過從後驗分佈中採樣不同的策略來生成軌跡,而每個策略皆可能探索不同的軌跡。因此,採樣多樣性較低或較高的策略,成為一種互補的探索控制手段。我們提出一系列稱為「擾動參數策略最佳化」(Perturbed Parameter Policy Optimization,簡稱3PO)的方法,這些方法採用不同的採樣策略與不同的軌跡分組方式來估計獎勵。在OLMo-3-1025-7B與Qwen2.5-Math-7B上針對數學推理與程式碼生成任務進行的實驗顯示,與標準GRPO相比,這些方法在近乎相同的FLOPs成本下,一致地改善了平均下游表現。此外,與GRPO及動作空間基線相比,使用多個參數樣本在訓練過程中所產生的零優勢群組,以及格式錯誤或不正確的軌跡數量也更少。整體而言,我們的研究為參數空間探索能改善大型語言模型的強化學習提供了實證支持。
用於類別生成的離散擴散模型由一個損壞核所定義,該核決定了中間狀態空間及相關的反向預測問題。我們研究均勻離散擴散,並探討其訓練目標與反向轉換能否在不改變底層類別損壞過程的前提下得以增強。我們提出Simplax,這是一種精確的Dirichlet-類別增強方法,將每個受損的類別狀態與一個輔助的單純形值變量耦合,同時保留原始均勻擴散過程作為其類別邊緣分佈。該增強方法產生了易於處理的Rao-Blackwellized反向橋接目標及相應的隨機反向採樣器,同時保留受損的類別狀態作為去噪器的輸入。實驗上,Simplax改善了無條件OpenWebText生成的生成困惑度-熵權衡。在數獨任務中,僅以含30個提示數的謎題訓練的模型,在所有評估的提示數密度下(包括最小唯一可解的17提示數情境)均達到與對比方法相比的最高準確率,同時在無條件生成中也取得了最高的有效性。
主流典範將AI安全視為透過RLHF、DPO或憲法式AI在模型訓練階段所注入的屬性。我們主張,對於會執行程式碼、修改檔案、發送訊息及更動資料庫的自動化智慧體而言,此種做法在結構上並不充足。智慧體安全應是由運行框架(harness)強制執行的一項運行時契約,且此契約具有兩個互補面向。預防性面向透過沙箱、權限閘門、輸出過濾器與軌跡監控器,在危險動作發生前加以阻擋。證據性面向則要求可驗證的證明,確認良好動作確實發生,並以測試執行、日誌擷取、檔案差異比對及引用溯源等具體證據作為任務提交的門檻。我們以四條公開證據鏈來支撐此立場,並在補充JSON檔案中釋出行層級協定與資料:一項針對52起已記錄之AI智慧體與LLM安全事故的調查、一項包含31個無爭議核心案例及1個具爭議性說明案例的虛假完成審計、一項針對12個公開智慧體系統與運行框架的軌跡模式審計,以及一項針對NeurIPS、ICML與ICLR 2023-2025年共28,560篇錄取論文之標題層級審計,顯示訓練時與部署時出版量之間存在合併8至12倍的失衡。兩個先前需要強制執行安全的社群——電腦安全與實驗科學——最終皆走向兼具預防性與證據性元素的運行時契約;智慧體AI如今同樣面臨此壓力。我們正式提出「智慧體軌跡模式與證據鏈」,基於標準監控器組合提出組合式閘控命題,並勾勒研究議程。智慧體AI中正確的安全單元是「具可查核證據的軌跡」,而非模型本身。
大型語言模型(LLM)的多模態擴展賦予了新的感知能力,但往往會損害預訓練期間獲得的語言智能。在本工作中,我們從內部適應動態的角度研究此現象,並發現預訓練 LLM 中的神經元在多模態學習過程中表現出異質可塑性:有些神經元對保留語言能力至關重要,而另一些則更能適應多模態知識。基於此洞見,我們提出 NeuPAT(神經元感知的可塑性分配調優),這是一個輕量級且與架構無關的框架,在多模態指令調優期間分配神經元級別的更新約束。NeuPAT 使用小規模的探測階段來估計神經元適應模式,並選擇性地保護對語言敏感的神經元,同時通過更具可塑性的神經元促進多模態適應。跨多種 LLM 家族的實驗表明,NeuPAT 在 11 個語言基準測試上恢復了普通調優造成的語言能力退化中的 94.5%,同時保持相當的多模態性能,為保持能力的多模態擴展提供了一種有效方法。
從非受控環境圖像中估計人類注視目標是一項重要且艱巨的任務。現有方法主要採用脆弱的多階段流程,需要顯式輸入(如頭部邊界框和人體姿態)來識別注視分析的對象。因此,檢測錯誤可能會級聯並導致失敗。此外,這些先前的工作缺乏透過自然語言提示來指定注視分析任務的靈活性,而這種方法在其他圖像分析任務中已被證明在便利性和可擴展性方面具有顯著優勢。為了克服這些限制,我們引入了可提示式注視目標估計(Promptable Gaze Target Estimation, PGE)任務,這是一種新的端到端、概念驅動的注視分析範式。PGE 以靈活的用戶文字或視覺提示(例如「穿紅衣服的男孩」或「位於 [0.52, 0.48] 點的人」)為條件來進行注視預測,以識別特定的注視分析對象。這種方法整合了對象定位與注視估計,並消除了對中間分析階段的剛性依賴。我們開發了一個可擴展的數據引擎,用以生成 Gaze-Co(帶有概念的注視估計),這是一個包含 120K 對高質量、提示標註圖像對的數據集和基準。我們還提出了 GazeAnywhere,這是第一個專為 PGE 設計的模型。GazeAnywhere 使用基於 Transformer 的檢測器,融合來自凍結編碼器的特徵,並同時解決對象定位、畫面內外存在性以及注視目標熱圖估計。GazeAnywhere 在多個 PGE 基準上實現了最先進的性能,即使在困難的跨領域真實世界臨床數據集上,也為這個新問題樹立了強勁的基線。GazeAnywhere 已在 github.com/IrohXu/GazeAnywhere 開源。
模擬由許多大型語言模型(LLM)智能體組成的社會代價高昂,但這類模擬通常要回答的是宏觀問題:相行為、典型化事實,以及隨智能體數量 N 的標度行為,而非單一智能體的認知。我們將統計物理學中的一個觀察轉化為方法:以低參數模型取代每個 LLM 智能體,該模型從數百到數千次廉價查詢中擬合而成,然後在筆記型電腦上以任意 N 運行該社會。這種方法是否有效,在模擬執行前就已決定,主要取決於每個智能體感知到的內容。我們引入「交互階數 × 記憶」分類法,將感知與記憶映射到有效理論,並預測替代誤差的 N 趨勢。我們在 LLM 宏觀經濟 EconAgent 的忠實重新實現以及其他七個具名 LLM 模擬上驗證了該分類法,其中智能體決策是從真實 LLM 誘發(主要為 DeepSeek)中克隆而來,成本僅數美元;預測的誤差趨勢逐格成立,而兩個被推翻的預測——皆涉及強烈飽和的響應,並追溯至其曲率——也由該理論在無自由參數的情況下定量匹配。
雖然視覺-語言-動作(VLA)模型推動了具身人工智能的發展,但其根本上的反應式範式嚴重限制了在部分可觀測及長時程任務中的表現。當僅限於單一腕戴式相機時,此類模型不可避免地面臨兩大問題:物體離開視野時產生的感知遺忘,以及多步驟執行過程中的時序任務進度遺忘。為克服這些瓶頸,我們提出AtlasVLA——一個新穎框架,透過持久世界-自我狀態,將直接反應式操控轉變為主動推理。AtlasVLA具備雙記憶架構:4D持久世界狀態記憶,將短暫的2D觀測提升為全域更新、以體素哈希儲存的空間狀態,以解決視覺盲區;以及自我工作狀態記憶,用於追蹤歷史自我狀態與任務進度。透過將擴散變換器(DiT)以聯合世界-自我狀態為條件,AtlasVLA實現了穩健的空間推理。在LIBERO、RLBench及真實世界基準上的廣泛評估表明,AtlasVLA僅使用腕戴式相機即達到了最先進的性能。尤為值得注意的是,它大幅超越了多視角基線方法,在LIBERO-Long上取得了9.4%的絕對成功率提升,在真實世界長時程任務中則提升了17.5%。
LLM 代理服務在模型呼叫與工具呼叫之間反覆執行小規模的確定性轉換:路由結果、更新狀態,並發出下一個效果。我們探討這條控制路徑何時會展現出足夠的並行工作以供 GPU 執行,以及當 GPU 計算出的路由決策保留在裝置上時會有何不同。我們使用固定分割份額 F、精確離線份額 P*、區域性上限 U 與線上達成份額 A 來形式化就緒群組邊界。在零服務時間、無限容量與相等的相對啟動截止時間下,一項專用動態規劃可精確計算 P*。 在對一個固定的 851 會話公共蹤跡面板進行平穩泊松重放時,主要條件在 100,000 個目標活躍會話、K=256 且啟動截止時間為 50 ms 下,得到 F=30.19%、P*=43.00% 與 U=45.85%。精確打包收回了固定視窗邊界所損失機會的 81.83%。 由結果推導出的路由鍵是條件代理,而非可執行身分的證明。另一項機制研究將 GPU 計算出的二元決策保留在裝置上,而非將四個位元組傳回主機並重新分派。在四種指定的 GPU 放置方案中,裝置常駐路徑在所有 36 種配置下都更快;同一放置方案內的行中位數比率介於 1.19 倍到 2.39 倍之間。在兩種可接受的機制中,所有 14,557,440 次受測的批次呼叫都與單獨實作的主機預言機相符。 一個不移除任何主機決策的固定巢狀裝置圖,在五種放置方案的所有 60 種配置中都較慢。整體而言,這些研究為 GPU 代理控制建立了兩個可量測的門檻:截止時間可行的群組供應量,以及觀測放置。 要衡量 A、CPU 置換與服務層級效益,需要一個整合式的有限線上執行期。
手部姿態估計(HPE)是擴增實境/虛擬實境(AR/VR)與機器人技術等各種應用中的基礎技術。在這些應用中,影像中每個手部關節的可見性對於在遮擋情況下評估估計結果的可靠性至關重要。然而,大多數現有的HPE方法僅輸出關節位置,並未明確指示其可見性。儘管有些方法考量了遮擋或可見性,但可見性估計主要被用作改善姿態估計的輔助信號。據我們所知,逐關節的手部可見性估計尚未作為一項獨立任務進行系統性研究。在本研究中,我們提出了手部可見性偵測器(Hand Visibility Detector),這是一個用於估計個別手部關節可見性的模型,並對作為獨立任務的可見性估計進行了首次系統性研究。我們證明,利用在大規模資料上預訓練的HPE模型作為骨幹,並運用其先驗知識,能在這項任務中取得高效能。我們進一步展示了手部可見性偵測器在一個下游任務中的效用:透過二維關鍵點的多視角三角測量來進行三維手部姿態標註,結果顯示可見性加權三角測量能降低重投影誤差。我們的方法已作為即用型套件發布,程式碼與示範可於 https://github.com/ryhara/hand_visibility_detector 取得。
ReRound(重建式捨入)是一種訓練後量化方法,旨在解決標準最近值捨入(round-to-nearest, RTN)機制在量化權重接近量化區間中心時所固有的中點模糊性問題。該方法從預訓練的大型語言模型(LLM)出發,訓練一個條件擴散模型,以產生該 LLM 低位元權重的連續重建;這些重建權重作為引導訊號,用以消除位於區間中點附近之權重的捨入方向歧義。為了將這種重建引導的捨入與傳統 RTN 整合,ReRound 引入一個容忍度指標,衡量量化權重(而非最終量化整數)偏離中點的程度:位於中點周圍容忍區域內的量化權重,使用基於擴散模型的重建來量化;而更接近量化邊界的權重則以 RTN 量化。透過掃描容忍度參數,ReRound 生成多個候選的量化整數權重矩陣,並選取其反量化後權重矩陣的主奇異值與原始全精度權重最為接近的候選,由此決定 ReRound 所用的容忍度參數。ReRound 對較小型的 LLM 尤其有效。在一系列此類模型中,它在 3 位元與 4 位元權重量化上持續優於標準 RTN。與大量的免校正方法相比,ReRound 能達到更優的準確度;與依賴校正的方法相比,也具備競爭力,且完全離線運作,在低位元推論期間不引入任何額外開銷。ReRound 策略代表了低位元量化的一種新途徑。該方法可應用於 LLM 以外的 AI 模型;本文則聚焦於其在小型 LLM 上的應用。