每日精選AI研究論文及翻譯
LLM 智慧體透過與環境互動來學習,然而這些環境皆為手工構建且靜態不變:它們對智慧體的弱點視而不見,並在智慧體進步的同時迅速被拋在身後。儘管近期環境生成方法試圖解決此問題,但它們需要特定領域的處理流程,依賴昂貴或不可靠的驗證器,且仍會產生靜態環境。為減輕從零開始重建環境的工程負擔,我們提出環境韁繩(EnvHarness),這是一個由可插拔元件組成的可程式化層,它能包裹靜態環境以重塑其行為,而無需修改底層邏輯。EnvHarness 透過標準介面運作,適用於多種不同領域,同時確保每個重塑後的環境皆保留其原始驗證器。為自動化此流程,我們引入 EnvRigger,它將目標策略視為黑箱,觀察其執行軌跡以針對診斷出的弱點合成 EnvHarness 元件,並透過全新展開來驗證這些元件。在涵蓋四個領域的五個基準測試中,EnvHarness 的表現優於原始環境及特定領域的環境生成流程,在保留實例上實現高達 9.0 分的提升,同時減少了 9.8% 的執行步驟。此外,EnvHarness 為強化學習提供了更優越的最佳化訊號,使策略與其環境得以持續進行有針對性的共同演化。
訓練終端智能體需要可擴展的可執行監督,然而合成高品質的終端任務仍然具有挑戰性。每個任務都耦合了指令、初始化環境、參考解答和可執行的驗證器;如果這些工件是基於不一致的假設生成的,最終任務可能無法解決或遭到錯誤評估。與此同時,多階段合成可能會丟棄原始來源中所編碼的目標、依賴關係、狀態轉換和程序性約束。我們提出 FACET(Fine-grained Agentic Construction of Executable Tasks,可執行任務的細粒度智能體式建構),這是一個同時處理資訊保存與跨工件一致性的框架。FACET 將相關的智能體技能重構為連貫且資訊豐富的情境,然後在生成最終任務工件之前實現並修復執行環境。最終的容器狀態可作為指令、解答和驗證器的共享基礎,而以執行為基礎的驗證與針對性修復則能修正特定工件的失敗,無須不必要地重新生成有效元件。FACET 產生了具有密集可執行檢查的複雜終端任務,而從這些任務中收集的成功軌跡提供了有效且資料效率高的監督。跨多種規模微調模型持續提升了在 Terminal-Bench 2.1 上的效能,而對替代生成方案的分析則支持了以環境為基礎的建構對於任務有效性及解答與驗證器一致性的重要性。這些結果確立了原始意圖保留與共享可執行狀態基礎,作為可擴展終端任務合成的關鍵原則。
軟體日益成為科學儀器本身的一部分,使得科學程式碼的故障不僅可能損害程式的行為,也可能危及支撐科學結論的證據。然而,現有的編碼代理評估大多側重於整體任務成功率,對於代理在修復科學軟體時為何失敗所提供的洞察相當有限。我們提出 SWE-bench Science,一個針對科學軟體工程的儲存庫層級基準,包含來自 20 個科學領域、98 個 GitHub 儲存庫的 119 項任務。每項任務皆歸類為三種典範之一:問題驅動、專家探索與工程整合。即便是表現最佳的代理——搭載 Opus-5 (max) 的 Claude Code——其 pass@1 仍低於 50%,凸顯了科學軟體工程所帶來的重大挑戰。我們識別出四種反覆出現的失敗機制:科學知識或抽象化能力的不足、探索方向錯誤或僅進行表面修復、修復覆蓋範圍不完整或系統整合不足,以及在分析中未能將科學知識推廣到觀察案例之外。我們進一步進行配對消融實驗,在保留儲存庫與可執行的工程脈絡之同時,移除明確的科學指引。結果顯示,科學知識並非一律有益:有充分根據的資訊能約束修復範圍,並提升平均表現與詞元效率;而對齊不良的指引則可能引發錨定效應,且不一定能提升精確修復的成功率。總而言之,SWE-bench Science 提供了一個廣泛的測試平台,用以研究編碼代理在科學軟體工程中的能力與失敗機制。
身份保持影像生成在場景必須包含多位指定人物時,其可靠性會大幅下降。除了保留每位人物的身份之外,模型還必須將每個參考影像綁定到特定人物及位置,同時訓練時的身份損失函數必須在多個雜訊預測人臉之間建立對應關係。我們提出 WithEveryone,一個統一框架,可生成最多包含十位參考身份的群體影像。WithEveryone 將每個選定身份注入為具位址的標記,預測結構化的身份–佈局計畫,並將該計畫渲染為視覺條件。其關鍵目標函式「佈局對齊身份損失」(Layout-Grounded ID Loss)利用標註的人臉區域直接監督預期的身份,避免了不穩定的基於嵌入的人臉匹配;「身份表徵強制」(ID Representation Forcing)則在影像合成之前進一步針對每個身份訓練預測。在身份不相交的基準測試上,WithEveryone 達到了最高的目標情境身份相似度,將臉部相似度從 GPT-Image-2 的 0.462 提升至 0.499,同時將複製貼上偽影從 0.169 降低至 0.055。此外,其對所請求身份的涵蓋率達 97.3%,重複率僅 2.8%。這些結果表明,明確的身份–佈局對齊能使身份保持生成擴展至更大的群體,而無需依賴直接參考人臉的複製。
記憶已成為大型語言模型的關鍵組成部分,使其能夠保留資訊並從長期互動中學習。然而,現有的記憶基準主要評估資訊是否被正確提取、儲存與檢索,卻在很大程度上忽略了被檢索的記憶如何重塑模型推理並影響當前任務的表現。我們辨識出記憶誘發的認知陷阱:即使是忠實記錄且語意相關的記憶,也可能扭曲模型的推理或信念,並降低當前任務的效能。為系統性評估這些失敗模式,我們提出 MemTrapBench,涵蓋兩種形式的認知陷阱:「推理固著」與「信念扭曲」。涵蓋兩個模型家族與五個具代表性記憶框架的實驗顯示,MemTrapBench 具有相當的挑戰性:所有被評估的記憶策略表現均不如無記憶設定,即便是最強的方法也出現超過 10% 的效能下降。為緩解這些認知陷阱,我們提出 AdaptiveMem,一種簡單而有效的推論時方法,透過指令引導大型語言模型避開記憶陷阱。AdaptiveMem 在 MemTrapBench 上緩解了認知陷阱,同時在各種記憶框架的標準記憶基準上維持或提升了表現。
智能體技能目前要不是由人工編寫,便是在單次大型語言模型(LLM)生成過程中所產生,因此缺乏可供其從自身實際引發之互動失敗中改進的閉環。近期研究確實形成了閉環,但其回饋來自單回合問答評估,其後果是嚴重的失衡:一旦第一輪修補了單次互動所能揭露的缺口,演化梯度便衰減;唯有跨越多回合才會浮現的缺陷依然隱而未現,演化因而停滯。這些系統中的治理同樣由端到端驗證分數驅動;該分數是一道標量閘門,能拒絕劣化的候選者,卻既無法定位也無法修復其結構性成因。我們主張,限制技能持續演化的關鍵約束既不是編輯能力,也不是迭代次數,而是評估回饋能否持續供給可信的演化梯度。我們提出 SkillEvo,其中可信回饋產生梯度,可控治理則約束其方向。第一個組成部分將多回合使用者模擬從評估端點重塑為回饋生成器:追問逐層揭露缺陷,使每一輪修訂既消耗回饋,又產生新的回饋。第二個組成部分以獨立治理層取代標量閘門的被動拒絕,主動修復事實性退化與結構膨脹,防止梯度在退化累積時漂移。在六類雲端服務、9 個生產級技能,以及 98 個技能參考檔案中,SkillEvo 比基於自我反思的演化高出 23.0 分,也比單回合問答驅動的演化高出 15.4 分。
動作條件的影片世界模型需要低延遲的因果生成,以及對遊戲原生控制項的可靠回應。儘管因果蒸餾能實現單步或少步的影片合成,但將其擴展至互動式世界模型仍具挑戰性,因為在因果訓練與自回歸展開期間,離散鍵盤狀態與連續滑鼠移動必須與時間壓縮的潛在區塊保持對齊。我們提出 ForgeWM,一個漸進式框架,透過域適應、教師強制因果訓練、因果一致性蒸餾,以及與雙向教師的同策略分佈匹配,將雙向動作條件的影片生成器轉化為高效率的少步世界模型。所產生的預算特化學生模型以 1、2、4 步的穩態去噪預算運作。ForgeWM 進一步支援雙路徑部署協定,結合延遲關鍵互動與可選的重放時細化,其中單步學生模型會對其儲存的草稿重新加噪並進行細化。在配對的 Minecraft 軌跡上,ForgeWM 在成像品質、參考對齊的運動輪廓一致性、動作訊號準確度與滑鼠控制準確度方面領先所有受評系統,同時達到最低的參考 LPIPS;相同的四階段配方也能遷移至使用遊戲手把控制的 FPS 遊戲。重放時細化可達到四步參考品質,同時與實際經歷軌跡的貼近程度約為從雜訊重新生成的三倍。這些結果證明了 ForgeWM 在可控少步影片生成上的有效性。
大型語言模型智能體在程式碼生成方面已取得實質進展,然而現有系統大多假設存在預先定義的程式碼庫架構。這個假設在從零到完整的程式碼生成中並不成立,因為在此情境下,智能體必須直接從自然語言需求建構整個軟體專案,並在整個開發過程中維持模組化的程式碼庫架構。我們提出 Repo0,一個用於從零到完整程式碼生成的持續結構演化框架。Repo0 維護一個明確的架構狀態,以雙有向無環圖(Dual-DAG)實例化,由需求層級 DAG、元件層級 DAG 及其對齊關係組成。從自然語言需求出發,Repo0 透過由模組化指標引導的結構動作,迭代地演化元件邊界,直到結構收斂;隨後,收斂後的架構引導測試驅動開發的程式碼生成。我們在 RepoCraft 的六個真實世界程式碼庫上,使用 GPT-5 mini 與 DeepSeek V3.2 評估 Repo0。Repo0 在所有設定下均達到最高的功能覆蓋率與通過率。與最強的程式碼庫規劃基線 RPG 相比,Repo0 的功能覆蓋率最多提升了 20.08 個百分點,通過率最多提升了 29.74 個百分點。消融分析與結構演化分析進一步證明了 Dual-DAG 架構狀態、模組化引導的結構演化以及明確的結構收斂的重要性。
長上下文建模是大型語言模型的關鍵能力,然而注意力機制的二次複雜度仍然是嚴重的效能瓶頸,特別是在計算密集的預填充階段。我們先前的工作 FlashPrefill 透過即時模式發現與基於最大值的動態閾值方法來降低此成本;然而,它仍僅是一個演算法原型,距離生產環境部署尚有相當距離。在本文中,我們提出 FlashPrefill V2,沿三個維度將 FlashPrefill 從原型推向實際的長上下文服務。首先,我們引入均值修正項,有效抑制近似誤差,即使在極端稀疏度下仍能將效能衰減控制在可接受範圍內。其次,我們以 PackGQA 記憶體存取、warp 專用化及乒乓流水線重新設計稀疏注意力運算子,使其完全對齊最新的 FlashAttention-3/4 實作,並支援 FP8 推論以滿足實際量化需求。第三,FlashPrefill V2 原生支援分頁 KV 快取與連續批次處理,使其能夠作為注意力後端整合至 SGLang 等現代推論框架中。在 NVIDIA H20 GPU(最廣泛部署的推論加速器之一)上的大量評測結果顯示,FlashPrefill V2 在 128K 上下文長度下,相較於 FlashAttention-2 於 FP8 與 BF16 精度分別可達到最高 47.26 倍與 27.19 倍的加速;此外,在 FP8 精度下,相較於對齊 FA3/4 的密集基線仍可實現 30.49 倍的加速。
取三個前沿混合專家模型(阿里巴巴、OpenAI、NVIDIA;每個約36至40億個活化參數),對它們進行微調,使其能以低資源語言推理。在準確度基準上幾乎沒有任何變化,而且在此規模下,基準本身即為噪聲:僅改變隨機種子就會讓分數移動7.7分,超過我們所測量到的所有數據與訓練配方效應。這個零結果是我們的第一項發現。真正的變化發生在準確度看不見的地方。基礎模型從不以希臘語思考:1,000條推理軌跡中有0條如此,即使問題是以希臘語提出;因此模型雖然正確作答,卻是以使用者無法閱讀、稽核或修正的形式在推理。在監督式微調(SFT)之後,所有釋出的檢查點在約98%的項目上會以問題的語言推理,其中一個模型家族使用的token數少了三分之二;經評判的語法正確性在全部四個模型上都有所提升,而一般能力與各基礎模型相差不過數分:沒有遺忘任何事物,也獲得了流暢性。我們提出六個行為維度,使這類變化可以被測量;每個維度都設有門控,以排除任何與輸出長度相關的指標,並報告我們自己的儀器如何撒謊:六次失敗,每一次都被某個對照組識破。SFT無法做到的,是修復其自身的缺陷:四分之一的回答跳過了要求的格式,答案洩漏到推理通道中,而且明確的「用英文思考」指令被遵循的時間不到一半。使用可驗證獎勵的強化學習(於訓練前預先註冊)直接修復前兩者(回退率從24%降至2.5%,洩漏率從3.5%降至0.0%,兩者皆相對於一個恆定的隨機獎勵對照組),並使第三項提升了9.1個百分點;與此同時,希臘語推理習慣在僅針對準確度的梯度下絲毫不受影響。我們釋出五個檢查點。這些儀器、對照組與預先註冊方法可遷移至任何低資源語言;希臘語是讓我們得以測量它們的案例。
如何高效微調機器人策略以即時學習新任務?目前最先進的機器人操作策略是基於行為克隆,即在龐大的遙操作資料集上訓練具有數十億參數的大型視覺-語言-動作(VLA)模型。雖然這種簡單方法已推動機器人操作取得顯著進展,但微調VLA策略以學習新任務仍然是個待解決的問題。具體而言,收集遙操作資料集需要數百小時昂貴的人力,而另一種替代方案——強化學習(RL)——則以樣本效率低下而聞名,尤其在長時程任務中。此外,將RL用於VLA會因模型規模與架構設計而帶來諸多挑戰。在本研究中,我們提出EXIMO,一種用於微調VLA策略的高效演算法。EXIMO分三個階段運作:探索、模仿與優化。在探索階段,EXIMO為VLA配備一個作為規劃器的視覺語言模型(VLM)。VLM會思考,並將具挑戰性的長時程問題分解為較短的子問題,以供VLA處理。VLM與VLA共同用於收集新任務的編排資料集。在模仿階段,使用編排資料對VLA進行微調。最後,在優化階段,我們使用殘差離策略強化學習進一步微調策略。在實驗中,我們對EXIMO的三個階段進行消融實驗,結果顯示其在樣本效率與最終性能上皆顯著優於現有方法。
大型語言模型在推論時若未檢索來源文檔,往往無法回答關於特定文件集的問題。我們將此情境研究為文檔知識內化:將固定語料庫轉換為可用的參數化知識,以實現無檢索問答。我們提出 IAR(Inject, Align, and Recover,注入、對齊與恢復),這是一個三階段的後訓練框架,將結構化文檔知識注入、問答行為對齊與一般能力恢復分離開來。與傳統的持續預訓練不同,Inject 階段將來源文檔轉換為續寫、改寫與指令條件式重建目標。Align 階段隨後以僅含答案的問答監督方式調整注入後的模型,而 Recover 階段則將領域適應後的模型與基礎指令模型合併,以恢復一般能力。在 Common Corpus(CC)與 CCI 上,以及 Llama、Phi、Qwen 和 SmolLM 模型家族中,IAR 皆改善了無檢索文檔內化的領域主要—領域一般能力前緣。在主要比較中,IAR 在 8 個資料集—模型設定中的 7 個,於全部四項報告指標上優於 Vanilla SFT,領域問答準確率平均提升 3.6 個百分點,而 IFEval、MMLU 與 MSBench 的一般能力平均值則提升 12.1 個百分點。擴展的 CC 基線結果顯示,LoRA 與 FAPM 可在個別一般能力指標上勝出,但在同時達到領先或接近領先領域內化表現的方法中,IAR 仍保有最強的一般能力輪廓之一。
公開基準是衡量自動語音辨識(ASR)模型能力的重要指標。然而,由於這些基準本質上具有公開性,模型存在針對這些基準進行最佳化的風險,而此類最佳化可能無法有效泛化至真實世界資料。我們提出一套量化基準最佳化的方法論,聚焦於音訊對參考轉錄文本呈現欠定性(underdetermined)的情境。我們識別出三類行為探針(behavioral probes),可用以揭示模型在音訊欠定的情況下再現基準參考片段的能力:參考不一致(reference disagreement)、遮罩數字還原(masked-number recovery),以及正字法切換(orthographic switching)。我們發現,得分最高的開源模型即使在相關音訊出現矛盾、被遮罩或模糊不清時,仍會輸出與基準參考轉錄片段完全一致的內容。透過多種機制性探針,我們證明模型會回應狹義的聲學線索,以覆蓋對音訊的忠實表徵,轉而採用基準最佳化策略。我們進一步顯示,此基準最佳化行為可透過低秩線性引導(low-rank linear steering)進行因果性操控,在某些情況下甚至只需在片段末尾附加音訊即可觸發。整體而言,我們的結果表明,高分模型表現出受基準條件制約的行為,此類行為可能虛增基準效能,卻未必反映通用轉錄能力的實質提升。
長期機器人操作要求機器人既能可靠地執行單一技能,也能在延伸任務中連貫地排列這些技能。大多數分層視覺-語言-動作(VLA)模型僅以單次前向傳遞做出每個此類決策,缺乏將額外計算分配給困難或重大選擇的機制。我們提出τ_0-VLA,一個分層機器人基礎模型,透過世界模型引導的測試時計算,將高階子任務生成形式化為可擴展計算的推論問題。在每個推論步驟中,高階策略使用執行記憶體生成子任務,並在必要時於提交輸出前搜尋替代方案。隨後,低階策略在多種機器人實體上執行所生成的子任務。該策略透過多模態共同訓練,在40,115小時的異質真實世界資料上進行訓練。在域內與分佈偏移的設定下,分配額外的測試時計算能大幅提升下一子任務的預測準確度,而這些提升轉化為長期機器人操作任務上更高的閉環成功率。
人類持續從經驗中學習,而傳統的大型語言模型(LLM)評估方式卻忽略了模型透過推論時互動來提升能力。在本論文中,我們研究LLM如何在測試階段從迭代經驗中學習,我們將此設定稱為「經驗鏈」(Chain-of-Experience, CoE),在此設定下,模型透過與自身或環境回饋的迭代互動累積經驗軌跡,形成超越零樣本推論的持續改進循環。我們以多樣化的回饋機制實例化CoE,包括模型自我回饋以及正確性判斷或公開程式碼測試通過率等環境訊號,並使用8個LLM(包括GPT-5、Gemini-2.5 Pro、Claude-4.5 Sonnet)在數學、程式設計和知識領域進行評估。我們的研究顯示,利用迭代經驗 consistently 優於無回饋的基線方法,僅憑自我回饋即能獲得顯著提升,且在各種任務和模型上整體提升5.6%,API成本降低19%。我們進一步證明,結合互補的回饋管道(例如模型訊號與正確性訊號)能帶來額外增益,且CoE在每個token的準確率上優於現有的測試時策略。我們觀察到LLM的基礎能力與改進能力之間存在正相關,並顯示模型在弱回饋或虛假回饋下仍能保持穩健性,不同的回饋有助於不同的改進面向,且大多數增益在迭代初期即已出現。
客服大型語言模型代理在使用者代理行事時必須遵循組織政策。合規失敗可能源於被禁止的行為(例如核准不合資格的變更)或遺漏的程序要求(例如身分驗證或確認)。執行期防護措施可以介入有風險的行為,但僅針對單一動作的檢查無法引導代理完成多步驟程序。遵循工作流程的系統支援既定流程的執行,但其主要目標是完成工作流程,而非保障代理行為的安全。相對地,PolicyGuide 將每個領域政策編譯成工作流程圖,並在使用者回合邊界呼叫主動式驗證器。驗證器從持續保存的圖狀態中,調解待處理的要求,並沿著符合政策的路徑回傳針對特定步驟的補救措施。在 τ^2-bench 的航空、零售與電信領域中,搭配 GPT-5.4 代理與驗證器,PolicyGuide 將平均 Pass^4 從 0.42 提升至 0.62,其中電信領域的增幅最大(從 0.19 到 0.61),該領域最具工作流程結構。相同的工作流程可遷移至 Claude Sonnet 4.6 與 Gemini 2.5 Pro 代理。補充評估發現,在對抗性使用者情境下,觀察到的攻擊成功率為最低;而在作者設計的工作流程層級驗證中,程序合規性表現最強。
現代LLM代理通常透過手動修改提示、工具或工作流程來改進,而圍繞模型的可執行支架——即執行框架——在部署後通常被視為固定產物。本研究探討另一種做法:執行框架是任務特定且可持續演化的。每個任務系列維護自己的執行框架,透過固定的任務注入接口在迭代間熱插拔,並利用環境反饋重新編寫。我們提出分層自我改進(HSI),一個單一凍結LLM M在三種層級範圍內運作的框架:執行任務的任務執行框架H、重寫H的演化器,以及在凍結的外部錨點下重寫演化器策略程式碼的元演化器。思考開啟/關閉設計透過在任務執行期間停用推理、在自我修改期間啟用推理,隔離了執行框架演化的貢獻。HSI受到兩個因素限制:反饋保真度界限——因為演化需要資訊豐富的獎勵訊號來引導選擇;以及骨幹能力界限——因為執行框架的重新設計無法克服凍結模型的限制。在BALROG上,以DeepSeek-V4-Flash-Preview作為凍結骨幹,HSI在中度困難任務上相較初始執行框架取得一致的提升(BabyAI +39.3,Crafter +33.0,TextWorld +25.0,MiniHack +15.0,均為原始進度百分比),同時在BabaIsAI子套件上獲得強勁的留出泛化(來自20%未見分割的BreakStop最佳測試成績0.98,GoTo為1.00)。在超出骨幹能力的任務(NLE)上,執行框架演化沒有提供改進。這些結果表明,任務特定的執行框架演化是在明確的經驗限制下改進凍結LLM代理的一個可行方向。程式碼可於 https://github.com/TailinZhou/hsi 取得。
我們提出 TinyCast,一個無注意力機制的零樣本預測器,僅以 146,505 個參數即可輸出預測分佈。其設計前提在於:在此規模下,上下文的週期結構值得計算而非學習。一個零參數頻譜檢測器提供主導週期,上下文按其相位進行摺疊,再由膨脹卷積編碼器與區塊自迴歸分位數解碼器處理其餘結構。在 GIFT-Eval 排行榜中,凡是可確認參數量的零樣本參賽模型,TinyCast 均比其更小。就機率性準確度而言,它定義了規模-精度前沿。在聲明無測試資料洩漏的零樣本參賽模型中,它是唯一低於 1.4M 參數且能輸出預測分佈的模型;所有得分更高的參賽模型至少都具備該參數量。在 Chronos-ZS 與 fev-bench 上,所有領先於它的神經模型,其參數量至少為它的 28 倍。由於其混合路徑僅包含卷積與矩陣乘法,因此可匯出為靜態 INT8 格式,並在嵌入式裝置上進行端到端預測,無需逐訊號擬合。
長篇影片理解涵蓋超越單純檢索孤立事件的任務,包括追蹤不斷演進的敘事以及詮釋可能保持隱含的社會意義。然而,現有基準很少聯合評估這些能力,特別是在高情境、非英語媒體中。為填補此缺口,我們提出NARU,一個專為評估日語長篇影片中敘事演進與文化理解推理而設計的基準。NARU包含1,481道問題,植基於155部影片,總時長146.8小時,涵蓋四個敘事維度與五個文化維度。為了在此規模下建構基準,我們提出一個基於階層式記憶的標註流程,將原始影片轉化為結構化的事件、敘事與文化標註,再透過任務導向合成與迭代式捷徑移除來生成問題。建構過程包含兩個由68位母語驗證者參與的母語者驗證階段。跨八種模型組態的評測揭露了長程敘事整合與文化基礎推理兩方面的顯著局限。透過揭露這些持續存在的缺口,NARU為發展能夠可靠詮釋長篇、高情境影片的多模態大型語言模型提供了系統性的測試場域。
當前的靈巧抓取規劃器主要優化物理穩定性,專注於物體能否被抓取,而非如何抓取以支持下游功能任務。然而,基於特定人類抓取分類法來條件化抓取合成,通常需要成本高昂且帶有物體標註的數據集。為了解決這些限制,我們提出 CoToGrasp,這是一個新穎的生成式框架,能夠嚴格基於特定接觸拓撲合成多樣且穩定的抓取。為了繞過數據收集瓶頸,CoToGrasp 完全以與物體無關的方式進行訓練。我們引入了一個基於特徵的規範工作空間,將局部物體特徵投影到統一的以夾爪為中心的域中,有效地將語義功能意圖與任意物體幾何形狀解耦。通過在該工作空間中學習夾爪的內在接觸流形,我們的模型在推理時實現了對未見過物體的零樣本泛化。在大規模 DexGraspNet 數據集上的廣泛評估表明,CoToGrasp 達到了最先進的性能,優於現有的分類法引導規劃器。最後,我們在實體機器人平台上展示了所合成接觸拓撲的物理可行性和運動學可行性。代碼可在我們的項目網站 https://cea-list.github.io/cotograspweb/ 上獲取。
多指抓取是一項關鍵的機器人技能,但當前的深度學習抓取規劃器常因訓練於有限且特定物體的資料集,而難以泛化至新物體。我們提出一種根本不同的方法,其基礎在於觀察到夾爪與物體在相互接觸點上具有相同的表面幾何。我們提出 GOAG:適用於靈巧機器人操作的生成式且與物體無關的抓取規劃器(Generative and Object-Agnostic Grasp Planner for Dexterous Robotic Manipulation),這是一種新穎的深度生成模型,學習特定夾爪接觸表面分布的緊湊潛在表示,從而能在不依賴特定物體訓練資料的情況下,高效取樣有效的抓取構型。我們證明,僅在推論時引入物體特徵,我們的模型便能有效檢索與夾爪能力相容的可行接觸區域。我們透過在模擬與真實世界場景中,針對既有抓取協議進行廣泛實驗來驗證我們的方法,並展示其在不同文獻中的夾爪上的有效性。我們的方法在 MultiDex 資料集的物體上達到最先進的結果,平均成功率為 86.93%。它在生成大量抓取時提供顯著更快的處理速度,同時匹配專門在此資料集上訓練的領先方法的效能。與這些方法不同,我們的方法不依賴特定物體的訓練資料,凸顯了與物體無關學習的優勢。它有效解決了傳統資料驅動抓取規劃器所面臨的泛化挑戰。程式碼與影片可在我們的專案網站取得:https://cea-list.github.io/goagweb/ 。
大型語言模型程式碼代理透過可能對模型輸出進行序列化、包裝和重新解析的介面發出 Bash 指令。僅靠配對執行分數無法區分指令生成錯誤與生成後引入的失敗。QuoteBench 透過在來自 14 個源自事件的系列中的 56 個單次任務上進行精確的最終狀態驗證來衡量此邊界,並圍繞一個刻意未跳脫的附加解析器,將生成契約與執行傳輸層交叉結合。在插值點進行跳脫可重現每個重播回覆的原始路徑結果,因此在揭露的邊界下任何恢復都必須來自模型改變其生成內容。在八種相同視窗配置中,透過附加解析器重播相同回覆會使成功率降低 55.4 至 73.2 個百分點;揭露邊界對六種配置恢復了 30.4 至 60.7 個百分點,對另外兩種配置則恢復為零或略微負值。原始生成在前緣已接近飽和;邊界適應才是仍然區分模型表現的因素。GPT-5.6-sol 的 -3.6 點配對差距隱藏了 -64.3 點的損害和 +60.7 點的補償。部署配置會重新排序模型:26 個可比較配對中有一個逆轉是明確的,另有四個處於單一任務的邊際上。對發出指令的代理進行評估時,應報告模型配置、生成契約、執行路徑、操作點和最終狀態驗證器,而不應將配對分數視為模型的內在屬性。
您應該用大型語言模型取代文本嵌入管道嗎?我們以受控且考量成本的比較來回答這個問題,比較對象涵蓋六個家族的十個大型語言模型,以及二十六個嵌入模型(參數量從1.18億到140億),並在三十七項任務上進行評估,涵蓋分類、語意文本相似度(STS)、聚類、配對分類與檢索。整體而言,兩種範式幾乎打成平手:最佳大型語言模型(Gemini 3.1 Pro,77.6)與最佳嵌入模型(77.2)僅相差0.4分。兩者的強項因任務而異:大型語言模型在推理密集的檢索上領先,嵌入模型在分類上領先,而兩者在聚類、STS與配對分類上表現相當。然而要達到此等水準的平手代價高昂。大型語言模型的成本可高達品質相近之嵌入模型的1,431倍(每次基準測試通過花費154美元對比0.11美元),而在相同GPU上,所測試的開放大型語言模型處理token的速度慢了2.5至736倍。推理token佔大型語言模型推論成本的28%至81%;在我們的消融實驗中,對多數模型而言,較低的推理預算可維持或甚至提升檢索品質。帕雷托前緣包含領先的嵌入模型以及一個大型語言模型,即Gemini 3.1 Pro。這些結果支持分工的做法:相似度、分類與聚類任務使用嵌入模型,而將大型語言模型保留給推理密集的檢索。我們的程式碼、資料集與結果公開於 https://github.com/embeddings-benchmark/embedders-dilemma。
自監督學習(SSL)已在音頻表徵學習中推動了實質性進展,儘管現有方法日益依賴繁複的預訓練方案,才能達到具有競爭力的性能。然而,一種截然不同的預訓練理念支撐了語言建模以及近期視覺表徵學習中最具影響力的進展:不是將編碼器訓練成靜態特徵提取器,而是訓練模型從先前上下文預測下一個元素——無論是離散詞元或連續嵌入。如此一來,自迴歸預測提供了一個統一的預訓練介面,可跨模態遷移,促使模型學習潛在的數據分佈。我們想探討:鑑於音頻的時間結構使區塊嵌入的自迴歸預測成為自然契合,這種簡單的因果範式能否產生強大的音頻學習器?我們提出了 NAPE(下一音頻區塊嵌入預測,Next-Audio-Patch-Embedding prediction),這是一個自監督框架,其中因果 Transformer 以因果遮罩和停止梯度作為唯一的訓練信號,根據先前的區塊嵌入逐個預測對數梅爾頻譜圖的下一個區塊嵌入。該設計刻意保持極簡,避免使用重建解碼器、聲學詞元器、師生架構以及輔助正則化損失。在六個音頻與語音基準上,NAPE 在多項任務上達到了最先進的微調性能,在不同編碼器大小下均一致地擴展,並在線性探測中展現了強勁的結果。此外,NAPE 在沒有顯式監督的情況下,也能產生結構化的注意力模式。
大型語言模型代理可透過在推論時建構工作流程來適應複雜任務,但在單一執行回合中發現的程序通常會在執行後被捨棄。現有的技能庫提供可重複使用的可執行常式,但通常是在離線狀態下組裝,且不會從代理自身的工作流程中成長。我們提出 FlowEvo——一個免訓練框架,讓工作流程與技能在推論時共同演化。FlowEvo 將成功的工作流程編譯為可呼叫的技能,存放在持久化的技能庫中,並透過直接執行或作為建構新工作流程的上下文來使用檢索到的技能。它也會追蹤每個技能的下游效用,並抑制導致負遷移的技能。在共享的 GPT-4o-mini 骨幹模型下,FlowEvo 在 ALFWorld、HumanEval、MBPP、GSM8K 與 MATH-500 的完整標準分割上,於 8 個基準方法中達到最高準確率。在 ALFWorld 上,它達到 85.6%,比最強基準高出 26.4 個百分點,且使用的 token 數量約為其三分之一。在涵蓋 7B 至 671B 參數的 10 個基礎模型上,FlowEvo 在 50 個模型-資料集比較中有 49 個優於 ExpeL。程式碼已公開於 https://github.com/DEFENSE-SEU/FlowEvo。