每日精選AI研究論文及翻譯
監督式微調(SFT)與強化學習(RL)在提升大型語言模型(LLMs)多任務推理能力時,表現出根本不同的行為。我們的初步實驗揭示了一項現象:SFT 在多階段訓練下會遭遇嚴重的任務衝突,而 RL 則能使多樣任務穩定共存。在經驗上,我們將其追溯到參數層面,觀察到 RL 在不同任務間會產生稀疏且近似正交的更新。我們透過分析多任務梯度干擾,為此機制提供了理論解釋。我們的結果揭示了一項區別:SFT 中的干擾是範數受限的,隨絕對梯度大小而擴增;而 RL 中的干擾則是變異數受限的,由優勢正規化與同策略最佳化所誘發的梯度變異數界定。此一微小變異數界限導致跨任務的最佳化方向近乎正交。基於此洞察,我們提出了 Parallel-RL,一種將多任務訓練解耦的範式,顯著提升了效率與靈活性。
近期的研究透過建構大規模多模態環境池來訓練智能體。然而,我們發現單純增加多模態環境的數量並不總是帶來益處。我們進一步透過一系列實驗分析當前多模態環境分佈的局限性。基於這些發現,我們從兩個維度研究如何建構更有效的訓練環境分佈:多樣性與難度結構。在多樣性方面,我們提出能力感知環境選擇(Ability-aware Environment Selection, AES)以取得多樣化的環境集合。在難度結構方面,我們提出階層式難度課程(Hierarchical Difficulty Curriculum, HDC),透過兩個難度層級組織課程學習:束縛弱化與狀態規模遞進。實驗結果顯示,AES 與 HDC 能有效提升多模態智能體的訓練成效。
世界-動作模型(WAMs)透過將影片動態先驗轉移至動作預測來提升端到端自動駕駛,但現有方法在推論時需要昂貴的未來生成。我們提出 SimWAM,一個簡單而有效的 WAM,將影片生成純粹用作訓練訊號。它利用聯合流匹配共同訓練一個預訓練的影片專家與一個輕量級的動作專家。隔離的注意力遮罩使動作預測獨立於未來幀,從而在訓練後可丟棄影片分支,留下一個可直接預測軌跡的自包含規劃器。由於兩個專家不共享參數,且僅透過統一的注意力介面互動,影片骨幹可被替換,動作專家也可獨立擴展,而無需修改學習目標或推論流程。我們進一步應用強化學習來最佳化超越軌跡模仿的組合式駕駛獎勵。我們的 SimWAM 在 NAVSIM 上達到 91.5 PDMS,以顯著更低的延遲超越基於 WAM 的最先進規劃器,並零樣本遷移至 nuScenes。這些結果使 SimWAM 成為一個簡單而穩健的基線,可輕鬆受益於影片生成技術的進展,實現高效自動駕駛。程式碼與模型權重可在 https://github.com/H-EmbodVis/SimWAM/ 取得。
通用參數高效微調(PEFT)方法自語言模型遷移後,在即時偵測器上可能靜默失效;此類偵測器的異構算子與偵測特定元件施加了放置約束,而一般 Transformer 堆疊中並不存在這些約束。我們提出 YOLO-PEFT,一個結構感知框架,將適配器放置形式化為可稽核的約束規劃問題。給定偵測器圖、PEFT 請求與資源預算,YOLO-PEFT 指派算子角色與語義角色,評估明確的算子有效性、偵測器語義、圖介面與部署謂詞,為每個被排除的模組記錄原因碼,並在訓練前要麼輸出符合預算的目標模組計劃,要麼返回「Refuse」。在官方 VOC07+12 trainval 至 VOC07 測試協議下,規劃器選取的 RS-LoRA 於 YOLO11s 與 YOLO12s 上分別達到 0.7138 與 0.7307 的 mAP50-95,而 Full-SFT 僅分別為 0.6428 與 0.6662。在 RT-DETR-L 上,所有七個受評估的 LoRA 家族配置均跨越預先定義的災難性門檻,支持在所評估覆蓋範圍內做出經校準的「Refuse-to-Full-SFT」決策。一項受控的 YOLO11 稽核進一步顯示,LoRA 將峰值訓練記憶體降低 43.9%,但訓練時間延長為 1.72 倍。在所評估的偵測器家族、放置策略與校準覆蓋範圍內,YOLO-PEFT 以明確且可檢視的規劃取代手動的目標模組試錯,同時保留已驗證的訓練-儲存-合併-匯出路徑;對未見過的偵測器架構進行拒絕仍是一個開放的驗證問題。專案頁面:github.com/Tencent/YOLO-Master
在連續、真實世界環境中部署自主多模態代理,需要其攝入無界定的音訊-視覺串流,並維持小時級的記憶。然而,目前的評測主要依賴簡短片段與選擇題形式。此設計使僅處理最後四幀的極簡基線方法得以媲美或超越複雜的串流模型,同時答案選項亦暴露了語言捷徑。我們提出StreamArena,一個針對小時級、互動式串流影片理解所設計的基準測試。StreamArena包含243部完整影片,平均長度為88.8分鐘,以及3,646組經嚴謹註釋的開放式問答對,用以評估即時感知、歷史回顧、主動互動與多模態工具利用等能力。對多種系統的評估揭示了連續互動與長時程多模態理解之間的張力。僅保留近期幀的方法無法回溯遙遠事件;將過往觀察轉化為文字的方法會流失視覺證據;而反覆壓縮視覺記憶的方法則難以隨時間保留細粒度的細節。我們以StreamMind來應對此張力,其為一種兩層式架構,將延遲關鍵的互動與主動監控分配給獨立調度的前端工作者,同時由後端工作者非同步建構持久化的多模態記憶,並執行歷史召回與外部搜尋。StreamMind在所有四項能力上皆優於現有串流基線方法,並透過重用持久化狀態降低查詢至回答的延遲。
對AI系統與數位產品進行人類評估的成本高昂、速度緩慢,且難以規模化。離線評估較具可擴展性,但往往忽略了人類的多樣性與互動行為。因此,我們提出MatrAIx,一個用於測試AI系統與數位產品、涵蓋異質使用者的群體規模模擬使用者評估基礎設施。 MatrAIx包含三個核心元件:第一,Persona 8B包含83億筆人物誌紀錄,以1,290個類別維度表示。這些紀錄可從保留相關屬性的依賴圖中抽樣,亦可衍生自人類撰寫的設定檔。我們釋出一個經品質篩選的核心集,約含100萬個人物誌,其中包括599,847筆真人基礎紀錄與400,000筆合成紀錄。第二,MatrAIx Playground提供四種環境,讓多元使用者評估數位產品並與之互動:調查、AI聊天機器人、網頁與應用程式。第三,MatrAIx提供1,010項應用任務,涵蓋超過25個領域,包括商務、軟體、金融與醫療保健。 我們在八個代表性任務中進行了18,189次評估試驗。人物誌代理由三個大型語言模型驅動:Claude Opus 4.8、GPT 5.5與Claude Haiku 4.5。所產生的回饋捕捉了決策與偏好如何隨人物誌背景而異,包括漲價後的猶豫、AI助理失敗後繼續使用的意願,以及延遲容忍度。 我們進行了兩項主要驗證研究:首先,一項400次試驗的對照研究評估了人物誌在十項行為屬性與全部四種環境中的一致性。在366次試驗(91.5%)中,聲明的行為被表達或正確抑制。其次,人類與LLM評審評估了真人基礎人物誌的萃取品質。整體而言,MatrAIx提供了一個端到端基礎設施,用於以多元模擬人類使用者來評估AI系統與數位產品。
基於 CLI 的軟體工程代理已迅速成熟,然而開源生態系卻收斂於單一訓練環境:用於微調開源模型的軌跡資料集幾乎完全在 OpenHands 環境下收集。在此資料上微調的模型在 OpenHands 下表現良好,但在任何非訓練框架下部署時,效能會大幅下降。未經訓練的基礎模型並未展現此差異,表明該差距是由微調所誘發,且與訓練框架的慣例密切相關。我們主張,一項具承重作用的框架特定行為是規劃結構——此處以本文所區分的兩種意義來理解:顯式規劃,即作為一級產物在執行前產生的計畫;以及隱式規劃,即在整個代理迴圈中塑造執行的結構性慣例。在此假設下,縮小差距需要將規劃從固定的框架產物轉變為學習到的模型能力。我們引入解耦 CLI 代理框架(DCAS),這是一個後端替換攔截層,可在不修改框架的情況下,於任何 CLI 框架與任何後端模型之間路由 API 流量,從而實現跨框架評估與具規劃意識的軌跡收集。利用 DCAS,一項受控的規劃來源干預證實,規劃品質是高槓桿的組成部分,其收益超過我們觀察到的跨框架下降幅度。在單一框架下,於少量 DCAS 收集的具規劃意識軌跡上微調的模型,能在非訓練框架上持續獲得增益,且兩種規劃意義在訓練資料中可經驗性地分離。
激活預言機(Activation Oracles, AOs)是語言模型,經訓練用來回答關於另一個模型內部激活值的自然語言問題。它們提供了一個靈活的介面,用於從模型狀態讀取隱藏資訊,尤其是在相關資訊已在內部表徵、但在可見行為中缺席或不完整的時候。然而,AOs 本身也是學習系統:它們的答案由訓練資料、目標以及習得的報告行為所形塑,而非對表徵資訊的中性讀出。我們在一個受控的「禁忌詞猜測」(Taboo Word Guessing)情境中研究此問題,其中受試模型經微調以在內部使用一個隱藏概念,同時避免直接揭露。與「在如此受試者上訓練的 AO 會成為專業讀取器」的預期相反,我們發現經微調的 AOs 可能變成概念特異性的反讀取器:它們選擇性地無法恢復在其自身訓練期間持續存在的概念。此失敗並不能簡單地用概念從受試模型或預言機表徵中消失來解釋:目標在預言機內部仍然可解碼,而 LogitLens 與層級消融分析顯示,失敗發生在 AO 的讀出路徑。我們的結果表明,行為洩漏、表徵層級的可解碼性以及 AO 的可語言化能力可能彼此脫節,這對學習式可解釋性介面的可靠性提出了擔憂。
小型語言模型通常是滿足嚴格延遲、成本與本地部署限制時的唯一選擇,但它們很少從零開始訓練:壓縮模型通常是透過知識蒸餾(KD)從較大模型中回復而來。這個回復步驟在很大程度上決定了最終品質,然而其成本高昂。我們提出一項實務導向研究,探討如何讓蒸餾訓練更有效率,並圍繞兩項系統貢獻進行組織。首先,我們展示離線知識蒸餾(將教師模型的頂層 K 個邏輯值快取一次,並讓學生模型針對該快取進行訓練)能在訓練損失幾乎相同的情況下媲美線上蒸餾,同時將教師模型移出記憶體,每次迭代速度快約 29%,且在單張 H200 GPU 上吞吐量最高可提升 41%。其次,我們引入一種融合的分塊 KL 損失,此損失從不實體化完整的詞彙量級邏輯張量,使峰值記憶體隨序列長度呈線性成長。這消除了原本會限制上下文長度的記憶體尖峰,讓我們能在單張 GPU 上以四倍上下文長度(32,768 個 token)進行訓練。一個獨立的僅輸出層小型基準測試將損失核心單獨隔離,並確認其在 4K 至 256K token 範圍內的記憶體與迭代速率擴展特性。兩者結合使大規模修復訓練與數百次消融實驗變得可負擔。我們亦報告關於損失設計與序列打包的輔助消融實驗。我們釋出分塊損失的實作:https://github.com/CompactifAI/Full-Chunked-KL-Loss。
音訊推理對於機器理解聲學世界至關重要。具有可驗證獎勵的強化學習能夠誘發此類推理,然而現有獎勵設計的局限性是互補的:基於結果的獎勵僅監督最終答案,使模型在未關注音訊的情況下即可得出答案;而基於過程的獎勵則對推理過程本身評分,但依賴於粗略、人工設計且固定的標準,既無法適應每個問題,也無法始終立足於聲學證據。此外,問題的要求各不相同,有些取決於感知,有些取決於多步推理,而任何靜態標準都會隨著策略的改進而失效。因此,以細粒度、以音訊為依據且自適應的獎勵來監督推理過程至關重要,但這也具有挑戰性,因為針對每個樣本人工設計此類獎勵並不切實際。為此,我們提出了 AudioRubrics,這是一個以自我演化、以音訊為依據的評分標準獎勵來監督音訊推理的強化學習框架。AudioRubrics 從原始波形合成每個樣本的評分標準,並以模型自身的生成軌跡為條件,按群組重新生成並重新加權標準,提供持續的學習信號,從而在靜態標準飽和之際持續針對當前策略的弱點。在三個音訊推理基準上的全面評估顯示,AudioRubrics 大幅優於眾多開源及基於訓練的基線。此外,我們的分析表明,收益隨評分標準生成器與評判器的能力而擴大,且 AudioRubrics 收斂到穩定的推理長度,既避免退化性崩潰,也避免無界增長。音訊感知的改善進一步證明了將監督錨定於聲學證據的有效性。我們的專案頁面位於 https://audiorubrics.github.io。
多模態表徵學習是現代人工智慧的基石。透過將多模態查詢與目標編碼為向量,它驅動了工業級搜尋與推薦系統,並支撐現代智能體的運作。諸如抖音、小紅書與 YouTube 等真實平台,因其複雜的模態與海量內容,既需要在十億級索引下的高效率,也需要對困難匹配進行細粒度區分。現有的多模態大型語言模型(MLLM)嵌入模型很少能同時滿足這兩項要求。對比式模型雖然高效,但依賴於成對監督,其粒度過粗,難以應對細粒度區分;而基於思維鏈(CoT)的模型雖能透過顯式生成提升區分能力,但在線上服務中卻不切實際。我們提出抖音多模態嵌入(Douyin Multimodal Embedding, DME),這是一個以兩階段訓練來結合兩者優勢的模型。第一階段進行大規模對比式預訓練,建立一個具有廣泛模態與任務覆蓋的統一多模態嵌入空間。第二階段則透過兩種機制補充語義充分性——即嵌入係奠基於檢索相關證據,並保留細粒度的對側語義之性質。其一為證據基底的類型化潛在推理(Evidence-Grounded Typed Latent Reasoning),透過隱空間中的潛在推理來組織檢索證據;其二為跨條件重建(Cross-Conditional Reconstruction),透過跨方向的自迴歸重建來強化對側語義。兩者僅在訓練期間運作,且僅增加微小的查詢端開銷,因此 DME 的服務效率與標準對比式編碼器相同。在 MMEB-v2 上,DME 的 2B 與 9B 變體在可比規模下達到最先進的結果(分別為 74.8 與 78.4),尤其在影片與視覺文件任務上表現突出。在實際部署中,DME 在抖音內部離線評測集上取得 2.92% 的相對提升,已部署於抖音的生成式搜尋、圖像搜尋與 AI 搜尋等場景,並在抖音搜尋的線上 A/B 測試中獲得 0.1% 的 Lifetime(LT)增益。
空中影像目標導航要求無人機(UAV)抵達由目標影像指定的目標位置。現有的基於世界模型的方法利用預測的未來狀態對候選軌跡進行排序,但通常僅依賴於一個或少數幾個點預測,這在具有大量未來狀態不確定性的大規模戶外環境中並不足夠。為了解決此限制,我們提出了不確定性感知導航世界模型(UA-NWM),這是一種用於空中影像目標導航的高效潛在世界模型,其將軌跡評分表述為條件式分佈外偵測。UA-NWM 以不確定性子空間表示可能的未來狀態,並將預測與目標之間的差異分解為可歸因於不確定性的成分與無法解釋的成分。僅使用無法解釋的殘差進行評分,從而無需多個未來樣本即可實現穩健的選擇。大量實驗表明,UA-NWM 在保持低推論延遲的同時,持續優於現有的導航世界模型。真實世界的無人機實驗進一步驗證了其實際應用性。專案頁面:https://duryi.github.io/UA-NWM-Project-Page
硬性提示壓縮透過獨立評分詞元、句子或區塊,並在預算限制下保留得分最高的單元,以降低長上下文推論成本。我們在此程序中發現一個結構性缺陷:獨立選擇可能拆散相依的證據對,保留其中一個成員而刪除另一個。當保留的文字包含答案,但被刪除的文字定義了解讀答案所需的實體時,我們稱此結果為指涉懸置。在壓縮比率為0.30時,使用Qwen3-0.6B嵌入對連貫區塊進行排序的Beaver,在三個多跳式問答資料集中,有34-54%的橋接範例留下不完整的答案路徑。在共享的HotpotQA橋接集合上,我們測試的所有六種硬性壓縮器都表現出高達60%的懸置率,且LongBench-v2單文件問答中的每份文件都包含至少一個懸置指涉。在使用Qwen3-8B評估的懸置範例中,重新插入缺失的支持段落並移除不支持段落以維持詞元預算,可將準確率提升29-34個百分點(p < 0.0001),並恢復至少88%與保留兩個支持段落的上下文之間的差距。更強的答案模型並未吸收此損失:在MuSiQue上,GPT-5.5在壓縮上下文上的準確率比保留兩個支持段落的上下文低8.8個百分點。最後,我們訓練一個輕量級分類器,依據被省略的句子是否為解讀保留文字所需來排序,並在推論時無需支持註釋即可重新插入排名最高的候選句子。在HotpotQA搭配Qwen3-8B的實驗中,這種自動還原將準確率提升了4.7個百分點,而壓縮比率僅從0.30變化至0.31。硬性壓縮器應同時最佳化相關性與指涉完整性。
我們研究互動式影片世界模型中的視覺持久性。這類模型依賴鍵值(Key-Value, KV)快取作為持續成長的視覺記憶,以延續先前生成畫面所攜帶的資訊。然而,我們發現一旦推論軌跡(rollout)超出訓練範圍,模型便無法可靠地定址已儲存的內容;原因是時間性旋轉位置編碼(Rotary Positional Embeddings, RoPE)的偏移量會落在訓練期間未見過的區間,使模型難以透過注意力機制檢索相關的視覺資訊。此外,若直接在 RoPE 旋轉後的空間中樸素地壓縮快取,會因將彼此不相容的位置相位平均在一起而破壞記憶。為了解決此問題,我們提出 WorldTrace,一個無需重新訓練的記憶框架,專為長時程視覺持久性而設計。WorldTrace 為每個摘要槽位指派一個獨特且位於分布內的虛擬位置,使壓縮後的記憶仍可被定址。在此可定址快取中,我們研究了兩種記憶壓縮方法:WorldTrace-Field 壓縮歷史以達成時間一致性,而 WorldTrace-Landmark 則在偵測到的場景轉換處儲存原樣場景軌跡,以支援情節回憶。我們進一步提出 LoopBench 基準,用以評估壓縮快取能否在長時間繞行後重建先前造訪過的場景。在 LoopBench 上,WorldTrace-Field 將時間一致性提升了 +15.5%,WorldTrace-Landmark 則將情節回憶提升了 +19.5%,從而在無需重新訓練的情況下延伸視覺持久生成的能力。
自迴歸模型在長程展開中會累積誤差,然而部署時並無真實值可供比對衡量。我們訓練單一條件潛在擴散模型,透過方向標記使動力系統在時間上向前或向後步進,並證明此雙向性提供了無需量測的測試時誤差訊號:向前展開 i 步再向後展開 i 步必須將模型帶回起點,因此往返差異 C_i 即為不可觀測展開誤差的自監督代理指標:無需集成、無需留出數據、無需控制方程,只需一次額外展開。我們在可壓縮磁流體動力學(MHD)、天文物理湍流輻射混合層以及自然人臉影片(CelebV-HQ)上進行驗證。在留出的 MHD 軌跡上,C_i 能對展開誤差排序(固定深度下 Spearman 0.91–0.98;軌跡內 0.69 ± 0.16);在訓練展開上擬合的簡單校正器,能預測其量級,68% 與 95% 的情況下分別落在 1.14 倍與 1.29 倍以內,且覆蓋率接近名義值——比僅以深度為輸入的預測器多出一個自然對數單位(nat),並可遷移至全部六個解碼物理場。同一訊號在分布外的 Orszag-Tang 渦流上發出預警(AUROC 0.98;深度 10 時達 1.0),而正是在此處採樣分散度基線的表現發生反轉;該訊號在 80% 覆蓋率下將產生的誤差降低 15%——為僅深度基線的三倍。雙向訓練具有負成本,在兩個方向上均勝過單向專家模型,且反向過程可兼作快速逆向求解器。在 LE-PDE-UQ 的湍流 Navier-Stokes 基準上,單一雙向模型以十分之一的訓練成本達到其十模型集成精度的 1.3 倍以內,並提供最佳的免訓練像素級校準。往返一致性將可逆性轉化為生成模型的實用信任訊號。
測試時訓練(TTT)將序列建模視為一個線上學習問題,其中快速權重透過內部學習規則進行更新。儘管 TTT 變體的數量持續增加,現有方法通常分別對每個變體進行硬編碼,這使得設計新的 TTT 方法以及區分每個組成部分的作用變得困難。為了解決這個問題,我們提出模組化 TTT(Modular TTT),此框架將內部學習器表示為有向無環圖,並將快速權重網路、損失函數、學習率、權重衰減與正規化暴露為明確的設計維度。模組化 TTT 自動將基元層級的訓練視角前向、訓練視角反向與因果查詢視角規則組合成完整的圖層級 TTT 計算,包括快速權重狀態轉換。我們使用模組化 TTT 系統性地消融 TTT 的各個組成部分,發現較小的學習率初始化、權重衰減與單層非線性有助於提升效能,而 MSE 與內積損失的表現則相近。較深的快速權重網路與正規化往往會損害效能,因為它們會導致過大的激活值;而殘差連接與門控則幾乎沒有提供可衡量的益處。根據這些發現,我們將效能最佳的變體訓練為 4.1 億與 14.5 億參數的模型(使用 1000 億個 token),並觀察到其訓練損失與基準評測表現與 Gated DeltaNet 相當。
神經網絡縮放定律是語言模型發展的基礎,然而標準公式在資料匱乏與過度訓練的極端情境下,會系統性地低估及高估損失。此一缺陷源於其底層假設——模型規模與訓練資料對損失的影響彼此獨立。為了解決這個問題,我們提出 Skaling 定律,這是一個廣義函數形式,透過單一交互指數將模型容量與資料耦合。這個簡單的擴展在內插與外推兩種範圍內,均將平均絕對百分比誤差(MAPE)降低了 1.5 至 3 倍。當與僅限於低計算量範圍的稀疏網格策略搭配使用時,Skaling 定律能以約比均勻掃描少 10 倍的計算量,實現精確的全網格外推。透過從小型實驗中實現可靠的效能預測,Skaling 定律為下一代模型訓練中的計算預算分配提供了一個更穩健且資源高效的框架。
在人類行為數據上微調的大型語言模型,已成為通用認知代理,但這所需的規模,以及這些模型究竟是處理任務結構還是利用統計捷徑,仍是未解的問題。我們在 Psych-101 資料集上訓練了十四個模型,參數量從 1.35 億到 140 億不等,涵蓋四個架構家族;該資料集包含來自 160 個實驗、共 1070 萬次試次級別的選擇。在分佈內,規模幾乎無關緊要。這些模型落在一個狹窄的區間內,彷彿觸及了天花板;0.6B 到 1B 的參數量即足以在留出參與者上匹配 70B 的基線。在分佈外,這個區間展開為明顯更陡峭的縮放梯度,較大的模型在泛化到新穎任務結構時明顯具有優勢。為了確定這些模型使用了哪些資訊,我們執行了兩項診斷。我們在 27 個實驗中逐步剝離四個提示通道——任務說明、實驗刺激、結果回饋與選擇歷史——並置換試次順序。遮蔽刺激與回饋的內容摧毀了 75.7% 的已學習資訊,並使模型低於隨機水準,證明僅憑選擇歷史並不能解釋其表現。置換則揭示了模型在具有獨立試次的任務上具有不變性,但在試次順序由先前反應決定的情況下則表現出敏感性。因此,小型的認知微調模型作為心理學實驗的雜訊上限估計器展現出潛力,儘管其適用範圍仍受限於訓練中所見的範式。
近期針對提示詞、程式與機器學習工作流進行最佳化的系統,通常依賴明確的外迴圈控制器,例如演化搜尋、強盜演算法或文本梯度方法。我們提出一個根本不同的問題:這種搜尋策略有多少部分可以被單一使用工具的智能體內部化?我們提出 ReASearch,一個以推理驅動最佳化的統一框架,其中智能體自主決定要評估什麼、如何診斷失敗、進行哪些修改,以及何時驗證或重新開始。ReASearch 不僅僅是藉由人工設計的啟發式方法所引導的提案生成器,它還會主動分析結果、分配預算,並透過持久記憶體在長時間跨度中不斷調整其策略。憑藉共享的智能體迴圈與特定領域工具,ReASearch 以完全相同的骨架來實例化最佳化提示詞、程式與機器學習工作流的流程。在 14 項多樣化任務中,它與專門的最佳化系統相比具有競爭力,且在多數情況下表現更佳,相較於強大的特定領域基線取得了 2% 至 40% 的提升,並在某些情況下發現了超越先前人類已知最佳結果的解決方案。關鍵的是,我們觀察到通常由明確控制器實作的複雜搜尋行為,會自然地從智能體的推理過程中湧現。
AI 編碼助手的廣泛整合無疑提升了工程開發速度。然而,近期研究指出一個日益明顯的取捨,揭示了程式碼品質與可維護性方面持續存在的挑戰。包括前沿AI實驗室在內的業界領導者,也呼應了這些擔憂。隨著大型語言模型日益被倚重來編寫生產程式碼,了解其對交付軟體品質的影響已成為至關重要的優先事項。然而,由於可觀測性障礙,在工業工作流程中評估這些影響仍然困難。我們在一家大型企業內部研究AI生成程式碼對生產品質的影響;該企業營運的全球產品每天有數十億用戶依賴。基於如此規模與用戶信任,該組織高度重視程式碼品質,並為每一行部署至生產環境的程式碼建立了全面的可觀測性,使我們得以克服量測障礙來評估這些影響。 本研究針對2025年4月至2026年4月期間AI生成的C++程式碼進行大規模實證分析,追蹤該企業既有程式碼庫中的352萬次程式碼變更。核心目的在於了解AI生成程式碼與人類編寫程式碼在規模化生產環境中的品質、效能與維護特性差異。我們發現AI生成的C++程式碼具有獨特的品質特徵,表現出較高的介面與耦合負擔、複製與配置開銷,並傾向使用顯式迴圈而非經最佳化的標準API。這些問題轉化為具體的下游成本,包括審查工作量增加,以及計算資源消耗增加5%至8%。然而,我們證明,為模型提供具針對性且基於分類學的回饋,可以減緩這些影響,使目標靜態分析警告減少11.1%,並提升計算效率。
特權型同策略蒸餾透過允許同步教師模型在每一輪利用僅訓練可得的參考(例如成功軌跡)重新評分學生模型的回應,為多輪代理提供密集監督。然而,在互動環境中,學生模型先前的動作會持續改變執行狀態。當學生模型採取不同動作或依不同順序完成子目標時,其展開軌跡可能到達參考軌跡未涵蓋的狀態,使得參考對於實際到達的狀態成為不可靠的引導來源。因此,不加區別地應用特權蒸餾會造成狀態-參考不匹配。此不匹配促使一項核心目標:提供與學生模型當前執行狀態相容的特權參考引導。我們提出狀態匹配路由與情境化自蒸餾(State-Matched Routing and Contextualized Self-Distillation, SMRC-SD),明確決定特權軌跡應在何時以及如何引導同策略學生模型。在每一輪,SMRC-SD 驗證學生模型當前的執行狀態是否與參考軌跡中的受支援狀態匹配。蒸餾僅在匹配的狀態上應用,過濾掉參考缺乏局部相容引導的輪次。對於每個匹配的狀態,SMRC-SD 進一步從成功軌跡建構狀態條件化的教師上下文,將監督立足於實際到達的狀態。在 ALFWorld 與 WebShop 上,SMRC-SD 持續優於無條件的成功完整路徑蒸餾。使用 Qwen3-1.7B 時,SMRC-SD 在 ALFWorld 上將任務成功率從 0.746 提升至 0.865,在 WebShop 上從 0.574 提升至 0.693。受控的路由與上下文消融實驗顯示,選擇局部受支援的輪次與建構狀態相容的教師上下文兩者皆為這些增益的促成因素。程式碼已公開於 https://github.com/liujunzhuo/SMRC-SD。
惡意利用生成式人工智慧製造高度逼真的深度偽造影片,引發嚴重的倫理疑慮,並對人工智慧安全構成重大挑戰。然而,現有的深度偽造影片基準測試對近期合成方法的涵蓋範圍有限,且普遍缺乏可靠的細粒度文字註解。與此同時,傳統偵測器與多模態大型語言模型(MLLMs),無論是單一模型運作或依賴單一分析視角,往往無法捕捉細微的偽造痕跡,因而限制了其對新興人工智慧生成方法的泛化能力。為了解決這些限制,我們提出了 FaceVid-Forensics-100K,這是一個大規模的深度偽造影片資料集,包含 100,000 部影片,涵蓋 33 種合成方法,橫跨人臉交換、人臉重演與全臉合成,包括 Seedance 2.0 等近期生成器。該資料集提供了視覺觀察的細粒度文字註解,以及與判決一致的鑑識解釋;這些內容是透過一個由先進 MLLMs 驅動的多模型彙整與衝突解決流程自動合成而成。在此基準的基礎上,我們提出一個多代理鑑識推理框架,採用四個專門的領域專家代理,從紋理、光線、動作與物理四個面向獨立分析偽造線索。接著,一個裁判代理會整合這些報告,產出最終預測與解釋。在域外測試集上的廣泛評估顯示,儘管我們框架完全由小型開源 MLLMs 組成,其效能仍優於所有方法,包括閉源 GPT 與 Gemini 模型,並且在此基準的所有回報指標上名列第一。專案頁面位於 https://xavierjiezou.github.io/ARGUS/。
人格條件化 LLM 智能體(PC-Agents)日益廣泛應用於情緒支持、社會模擬與角色扮演,進而推動了能在長時間互動中保持連貫性的終身智能體之發展。此類連貫性的關鍵組成在於人格演化:智能體應在經歷不同情境下的生活事件時,展現合理且具心理學基礎的改變。儘管既有研究顯示 LLM 的人格可能因情境擾動而產生偏移,但這些偏移如何隨特質、事件、人物設定及模型而變化,仍缺乏充分理解。本研究以五大人格特質作為心理計量錨點,探討 11 個重大生活事件所誘發的人格改變,並對照人類人格心理學之縱貫性證據來詮釋所產生的軌跡。跨四個診斷軸向的結果顯示,無論事件-特質配對是否有文獻記載的人類改變方向,PC-Agents 皆以相似速率呈現可量測的特質偏移。即使在偏移方向符合預期的情況下,其幅度通常仍低於人類效應量範圍。性別與文化地區提示詞僅顯示微弱的調節效果,而相較於人類樣本,人物設定層級的離散程度被壓縮了三至四倍。為促進系統性比較,我們提出 BFI-Adapt——一個可重複使用的評測基準,用以評分事件誘發人格改變的方向忠實度——並以此對 14 個模型進行排名。驗證套件顯示,所量測到的偏移超過無事件重測噪音,在獨立改寫的提示詞下保持穩定,與情境式行為選擇僅呈現有限且依模型而異的收斂性,並且在穿插無關對話後仍持續存在。綜合而言,這些檢驗確立了所量測軌跡為穩健的事件條件化反應模式。我們的結果表明,現有的 PC-Agents 模擬了人類人格動態的平均值,但未能模擬其形態。
公開基準測試的測試資料無可避免地滲入預訓練語料庫,一旦被記憶便會虛增評估分數。污染緩解評估透過介入解碼過程來壓制記憶,並恢復受污染模型的真實能力,但其主流指標 G-AP(聚合效能差距,Gap of Aggregate Performance)存在缺陷。離散的正確/錯誤讀數無法刻畫每題表現;先平均再相減會讓過度抑制與不足抑制相互抵消;而每題均勻加權則容易誘使策略將解題機率推向乾淨模型的高頻值。我們提出 SA-PPG(分層聚合的每題機率差距,Stratified Aggregate of Per-question Probability Gaps):透過抽樣估計每題的解題機率,逐題與乾淨模型相減,並以乾淨模型解題機率定義的群組內進行聚合。現有緩解策略先估計污染所在,再基於該估計運作,因此其正確性取決於估計的正確性。RailCap 則在生成過程中直接判斷污染:每當樣本落回貪婪軌跡時,下一個軌跡 token 便被限制為次高選項,累積抑制直到回應分佈變得足夠分散。在多個受污染模型與基準測試中,SA-PPG 揭示先前策略的恢復效果被大幅高估,而 RailCap 達到最低的 SA-PPG。
多模態大語言模型(MLLMs)的創造能力在設計、溝通、教育以及人機協作中至關重要;然而,與以準確度為導向的任務相比,這類能力因明確目標與獎勵訊號稀缺而仍難以評估。跨概念理解是支撐接受性創造力的核心認知能力,它使感知者能夠從不明顯但具有意義的概念關係中還原出所欲傳達的含義。我們將題目建構操作化為跨概念編碼,並將模型推論操作化為跨概念解碼。我們提出 C4——一個受認知啟發、用於評估基於成語之跨概念創造力(Chengyu-based Cross-Concept Creativity)的框架。其編碼組件沿著橋接路徑,將目標槽位映射至可意象的替代概念;這些路徑位於人工標註並經第三方審查的跨概念網絡中,因而能實現批量生成具有明確結構、以橋接數量與深度作為難度指標、且帶有精確答案的題目。利用此框架,我們建構了 C4 評估集(C4-Eval),包含 184 個合成題目,以及 37 個從線上來源收集、由人類創作的跨概念成語修辭。我們為所收集的修辭表達人工建構並審查其跨概念關係、橋接路徑與推理過程。每個 C4-Eval 題目在五種任務設定下實例化,共產生 884 個主要的答案還原案例。在十個受評測的 MLLM 中,最強的封閉模型達到 50.7% 與 48.0% 的主要準確率,而開源模型的表現則明顯較低。候選項約束能大幅提升準確率,但橋接提示與解釋要求僅帶來溫和的增益。這些結果揭示了當前 MLLM 在透過跨概念關係解碼創造性編碼意義方面存在顯著差距。程式碼位於補充材料中。
一旦視覺內容進入AI管道,其擁有者往往對其使用方式幾乎無法保留技術上的控制權。法律與監管救濟措施可以處理濫用問題,但許多技術性干預必須更早應用,即在內容發布或存取之時。本综述檢視了圍繞此干預點所形成的防護範式,我們稱之為「為善而用的對抗性攻擊」。長期以來被研究為對學習模型之攻擊的擾動與結構化訊號,如今反而由資料擁有者、創作者、平台或稽核人員所應用,用以破壞未經授權的自動化處理或支援後續的課責機制。五個研究社群基本上各自獨立地達成了此一逆向應用,各自因應視覺資產生命週期的不同階段:分享時的隱私濾波器以對抗非預期的辨識、不可學習範例以對抗未經授權的訓練、生成式防護機制以對抗惡意編輯或模仿、用於存取控制的對抗性CAPTCHA以對抗自動化代理程式,以及用於流通後歸屬追溯的來源驗證機制。儘管這些方法在不同的場域中發展,且成功標準互不相容,其中許多方法利用了人類知覺、語意詮釋與機器推論之間持續存在的落差,這顯示此範式在視覺管道朝向多模態模型與自主代理演進之際仍具有相關性。為了使各方法的主張具有可比性,我們沿著可遷移性、適應性與部署就緒程度等共同軸向來評估這五個家族。貫穿整個生命週期,我們發現大多數防護機制仍主要針對靜態或弱適應性對手進行驗證,而受控基準測試之外的證據仍然稀缺。我們最後整合了跨階段的對策與開放性問題,以實現穩健、可組合且可部署的所有者端防護。
基於大型語言模型(LLM)的代理正迅速發展,能夠自主呼叫外部工具,為使用者完成多步驟任務。然而,代理往往會取得比任務所需更多的敏感資訊。現有的隱私基準稽核的是代理的回應或對外動作所揭露的內容,卻忽略了資料首次進入代理上下文時的取得階段。如此一來,過度取得的資訊距離徹底洩漏僅差一次粗心的操作或一次攻擊。為了評估這種現象的普遍程度,我們提出了 PrivacyPeek,這是一個用於評估基於 LLM 的代理在取得階段隱私洩漏的基準,涵蓋 7 種取得行為與 16 個應用領域,共 1,182 個案例。具體而言,取得檢查(Acquisition Inspection)檢視代理的工具呼叫軌跡,包括其所呼叫的工具與所接收的資料,以偵測其何時取得超出任務範圍的敏感資訊。接著,探測誘發(Probe Elicitation)發出後續探測,衡量攻擊者能多容易地引出代理已取得但未揭露的敏感資訊。我們在橫跨 4 個模型家族的 10 個 LLM 代理上進行的實驗顯示,不必要的敏感資訊取得現象相當普遍。此外,我們觀察到任務完成能力與取得階段洩漏之間存在相關性。提示層級的防禦措施僅能減少一小部分的取得階段洩漏,大多數洩漏仍未獲得緩解。這些結果使得稽核取得階段的隱私變得既迫切又必要。我們的資料集與程式碼可於 https://github.com/Xuan269/PrivacyPeek-Resource 取得。
序列模型必須決定要將什麼寫入記憶體,以及保留什麼。在量子與量子啟發的序列學習中,非線性循環更新通常需要重複的電路評估與隨時間的順序反向傳播,使得長上下文處理成本高昂。基於量子啟發柯爾莫哥洛夫-阿諾德網路(QKANs)的閘控快權重程式器(FWPs)通過將上下文儲存於隨時間變化的快參數中,緩解了此瓶頸。然而,其純量閘控將單一的保留-寫入平衡應用於每個快狀態座標,迫使所有參數共享同一記憶時間尺度。我們引入了自調製的基於QKAN的FWPs,以低秩生成的逐元素調製取代此廣播閘控,作用於新提案分支、有界舊狀態分支,或兩者。我們進一步提出互補矩陣閘控(CMG),其使用一個sigmoid矩陣閘控來保留舊狀態,並以其補數寫入新提案。CMG提供逐座標記憶控制,同時保留了純量閘控的有界凸組合更新與仿射前綴掃描結構,僅需單分支規則的調製頭成本。我們在結合經典與QKAN基礎的慢速與快速程式器的四種FWP架構中,比較了四種自調製規則與純量閘控。在七個單步預測基準與五種序列長度中,CMG對其快速程式器包含QKAN基礎模組的架構提供了最一致的改進。在利用CUDA-Q Dynamics模擬的Jaynes-Cummings與transmon-resonator動力學的直接多步預測中,CMG模型在4、8和16步的預測範圍內維持均方誤差在0.001或更低之數量級,同時比其對應的純量閘控版本至少改善91.2%。這些結果確立了逐座標互補調製作為基於QKAN的FWPs之一種穩定且有效的更新機制。
世界生成模型通常通過它們所產生的內容來使用:渲染的未來、視頻條件化的動作,或由昂貴的生成分支計算出的潛在上下文。我們認為,它們更具可重複使用價值的資產是構建未來的計算過程。當生成器將受損的未來轉化為連貫的軌跡時,其中間狀態在不同抽象層次上組織外觀、空間佈局和交互。這種未來生成計算能否被內化為僅從當前狀態推斷出的表徵?我們提出 Enfold,它將此計算轉移到一種從當前視覺上下文和語言指令預測的表徵中。在訓練期間,生成器處理觀察到的未來時暴露出的多層級狀態,監督一個僅使用當前輸入的編碼器。學習到的表徵被反饋以條件化未來生成,並由任務頭讀取,而不允許任務梯度重塑編碼器。在部署時,動作預測不再執行生成器。在 LIBERO、RoboTwin2.0 和真實機器人任務上,Enfold 支持強控制,同時相對於 Fast--WAM 將動作延遲降低了 3.7 倍,而 Enfold-Flash 達到了 10.1 倍。表徵分析表明,它抑制了干擾性變異,並優先捕捉在更長時域中出現的變化。當當前場景被人為干預改變時,生成的續接和執行的動作都會適應,這與固定軌跡重放不一致。這些結果將世界生成器重新定義為預測控制表徵的來源:如果其內部結構可以被摺疊進當前狀態,那麼其未來無需在每一步中被實體化。
話輪轉換(turn-taking)是全雙工互動的核心組成部分。何種話輪轉換行為為適當,會隨情境而異,然而現有模型無論情境為何,皆套用單一規範。此限制源於其訓練資料:人與人對話語料庫捕捉了自然的時序現象,但缺乏角色定錨或情境特定規範;而啟發式或提示驅動的合成方法雖能注入話輪轉換行為,卻未以人類偏好為基礎。我們提出 DuplexGen,一個透過將大型語言模型(LLM)預測對齊於少量槽位層級人類偏好標註,來生成具情境適應性話輪轉換對話的框架。在六項合作與競爭任務中,人類的話輪轉換偏好呈現系統性差異,而 DuplexGen 相較於未經校準的提示方法或僅以通用人與人資料訓練之模型,能顯著更貼近這些偏好;以 DuplexGen 生成資料訓練的全雙工模型,展現出獨特且為人類所偏好的話輪轉換行為。這些結果顯示,人類校準(而非語料庫規模或提示設計本身)才是使話輪轉換合成得以具備情境特定性的關鍵。
當狗張開嘴吠叫時,人類自然而然能辨識該聲音為何以及發生於何時。建構具備同等能力的音視頻模型,需要能同時捕捉語義與時間對齊的表示。現有方法總在某一面向有所欠缺:嵌入模型匹配語義但喪失時間資訊;同步模型捕捉時間偏移但缺乏語義理解。為彌補此差距,我們提出 FATE,幀級音視頻時間嵌入(Frame-level Audio-visual Temporal Embedding)。不同於先前將各模態池化為單一嵌入並丟棄時間資訊的嵌入模型,FATE 保留幀級序列,在物理時間軸上對其對齊,並於嚴格對齊的幀對上計算相似度。不同於僅輸出偏移預測的同步模型,FATE 將同步編碼於可重複使用的嵌入空間中,並以結合跨視頻語義與視頻內時間對比學習的聯合目標進行訓練,以同時捕捉聲音為何及發生於何時。在三個任務中,FATE 在時間與語義檢索上大幅超越最強基線,在零樣本設定下的事件定位上媲美完全監督方法,並作為生成評估指標時,達到與人工評判的最佳相關性。原始碼可在 https://github.com/guankaisi/FATE 取得。
視覺語言模型日益成為具身智能體的推理核心。機器人執行本質上是迭代的:每個動作都會重塑場景與物理狀態,持續更新需要被感知、推理和驗證的內容。滿足這些需求需要具備互補的能力,而這些能力在監督信號、預測格式和驗證標準上各不相同。現有方法通常針對孤立的、任務特定的目標來發展這些能力,卻未闡明它們應如何圍繞整體執行進行組織與整合。我們提出 Capek 0.5,這是一個以執行為核心的能力分類體系所建構的具身視覺語言模型。該分類體系不以資料集或任務來組織訓練,而是依據具身能力在執行過程中的功能角色進行分組,包含四個能力家族:空間推理、時間理解、行動引導與狀態驗證。每個能力首先由專門的專家模型透過基於共享骨幹網路的可驗證獎勵強化學習來習得,隨後透過權重空間融合及後續的路由策略空間蒸餾,將各專家模型整合為單一的推理時模型。我們在 2B 與 35B-A3B 規模上實例化 Capek 0.5,並從三個互補的視角對其進行評估:全面的基準測試套件(包括新推出的狀態驗證基準 Capek-StateBench);從專家模型到統一模型的能力保留受控研究;以及在模擬具身環境中的閉環評估。Capek 0.5 在絕大多數對應基準測試項目上優於其初始化模型,在單一檢查點中保留了全部四種專業化能力(附帶量化損失),並能遷移至閉環具身任務執行。
基礎模型用於從大量未標記資料中學習可遷移的表徵,通常透過自監督學習(SSL)達成。然而,許多此類模型依賴於可解釋性有限的架構,這在醫學影像等高風險領域中是一項關鍵問題。我們提出 DualIFM,這是一個在設計上即具可解釋性的基礎模型,其透過 BagNet 骨幹網路中較小的感受野產生忠實反映模型決策過程的類別證據圖。此外,DualIFM 在預訓練期間納入一個二維投影層,使表徵空間得以直接視覺化,提供資料集層級的學習結構視圖,包括具臨床意義的聚類以及潛在的虛假相關性。我們在來自不同來源的逾 80 萬張彩色眼底照片上訓練 DualIFM,以學習適用於不同下游任務的可泛化表徵。我們的模型在分布外資料上提供可解釋的預測,同時其表現可與參數量多 16 倍的 RETFound 相媲美。這些結果表明,大規模自監督預訓練結合內在可解釋性,可為視網膜影像帶來穩健的表徵。程式碼與預訓練模型已公開於 github.com/berenslab/interpretable_FM。
影片-語言模型的基準測試大多聚焦於短片與單句指標,尚待探討現有系統能否生成準確的長篇段落級描述。我們提出 CLIP-CC-Bench,這是一個用於長篇影片描述的評估套件,從 5 小時的電影內容建構而成,分割為 90 秒的片段,每個片段搭配專家撰寫的段落式參考描述。該評估套件採用五個最先進的基於大型語言模型(LLM)的嵌入模型所組成的集成,以提高可靠性並減輕單一模型的偏誤,並應用兩種互補方法:(i) 粗粒度語意比對與 (ii) 細粒度語意比對,以比較模型生成的描述與 CLIP-CC-Bench 參考描述。利用此框架,我們評估了 17 個最先進的影片-語言模型,並報告它們在 CLIP-CC-Bench 上的 Borda 聚合排名與平均分數。我們進一步透過評分者間一致性與拔靴法排名穩定性來量化該協定的內部信度。我們在 https://github.com/Multimodal-Intelligence-Lab/CLIP-CC-Bench 發布標準化評估腳本、模型輸出與聚合工具,以支持可重現性。CLIP-CC-Bench 為長篇影片描述提供了實用的評估框架,填補了現有短片與僅限問答基準所留下的缺口。
多模態大型語言模型(MLLMs)在情感智能方面已展現出卓越的能力。然而,當前研究主要集中於任務特定的專門化,往往忽略了任務間的協同效應,使得潛在的推理潛力未被充分發掘。為填補這一空白,我們提出 OneEmo,一個統一的情感通用模型,能夠掌握情感感知、理解與互動。為此,我們首先構建了 EmoWorld-130K,一個綜合性資料集,透過人在迴路工作流程將專門的情感知識提煉為明確的推理軌跡。基於該語料庫的監督式微調顯示,多任務學習能帶來顯著的相互效益。其次,為充分釋放潛在推理潛力,我們提出 Emo-Chord,一種新穎的強化學習策略,透過統一的多任務獎勵分配來穩定最佳化過程。大量實驗表明,OneEmo 在大多數基準測試中均達到與同規模基線模型相當的最佳性能。值得注意的是,儘管 OneEmo 的參數量遠少於商業模型,其結果仍極具競爭力。本文為更可靠且可解釋的情感計算開闢了道路。程式碼已公開於 https://github.com/waHAHJIAHAO/OneEmo。