每日精選AI研究論文及翻譯
AI代理已能自主完成短時間內定義明確的任務。然而,現有的終端基準評測大多聚焦於幾分鐘內可完成的簡單問題,且僅以最終結果進行評估。這種設定忽略了中間進度與部分解決方案,導致獎勵訊號稀疏,無法完整呈現代理能力。我們提出「Long-Horizon-Terminal-Bench」,這是一個包含46項長週期任務的終端基準評測,涵蓋九大類別,包括實驗複現、軟體工程、多模態分析、互動遊戲與科學計算。每項任務均採用Terminal-Bench風格的設定,附帶參考解決方案或模擬引擎,但進一步拆解為細粒度的分級子任務。此設計能提供密集的中間獎勵與部分分數,使評估不僅能判斷代理是否達成最終目標,還能反映其在開放式工作流程中的進展程度。「Long-Horizon-Terminal-Bench」中的任務通常需要數百回合執行,耗時數分鐘至數小時,著重測試長週期規劃、長上下文管理與反覆除錯能力,而非一次性問題解決。我們評估了15個前沿模型,發現代理平均每項任務消耗990萬個token,約執行231回合及85.3分鐘,使「Long-Horizon-Terminal-Bench」比先前基於終端的基準評測更具挑戰性。即使是最強的受測模型,在部分獎勵閾值0.95下僅達到15.2%的pass@1,在完美獎勵閾值1.0下為10.9%;而所有模型在兩種閾值下的平均通過率分別為4.3%與1.7%。這些結果顯示仍有極大改進空間。我們進一步分析失敗模式與錯誤類型,並釋出「Long-Horizon-Terminal-Bench」,以支援未來在長週期終端代理領域的進展。
大型基础模型的快速进步主要归因于在大规模文本语料库上的预训练。然而,许多形式的知识是通过视觉表征传递的,其中图表、排版公式和页面布局蕴含了文本单独无法忠实或完整捕捉的丰富信息。然而,当前的预训练方法通过将视觉丰富的资源(例如文档和网页)转换为纯文本来进行语言智能学习,从而丢弃了这些视觉线索。本文挑战了语言模型必须在纯文本表征上训练的默认假设,并展示了视觉预训练是基础模型智能的一种可扩展学习器。为此,我们对直接利用视觉文档而无需文本提取的无监督视觉预训练范式进行了系统性研究。在多个骨干网络和基准测试中,基于相同底层语料库的视觉预训练始终优于纯文本预训练,为可扩展的语言智能提供了一条高效路径。
在下一詞預測的驅動下,自然語言處理從特定任務模型轉變為強大的通用基礎模型。那麼,在電腦視覺中,實現通用模型所需的等價催化劑是什麼?在本文中,我們主張大規模文字轉影片生成可作為電腦視覺中強有力的預訓練範式,為通用視覺智能提供所需的時空先驗、視覺語言對齊和可擴展性。我們提出 GenCeption,該方法利用預訓練的影片生成擴散骨幹網路來定義一個前饋感知模型,能夠根據文字指令執行多種視覺任務。實驗結果表明,GenCeption 在深度估計、表面法向量與相機姿態估計、表情參照分割以及 3D 關鍵點預測等多元任務中達到了最先進的性能,往往能與甚至超越專門模型(例如 DepthAnything3、SAM3、D4RT、VGGT-Omega、Sapiens、David、Genmo 和 Lotus-2)。此外,在可比設定下,影片生成預訓練骨幹網路的表現優於其他預訓練範式(例如 V-JEPA 和 Video MAE)。重要的是,GenCeption 展現了初步的數據與模型擴展特性,以及卓越的數據效率——僅需 D4RT 和 VGGT-Omega 等領先模型 7 到 500 分之一的訓練數據,即可達到與之相當的性能。最後,GenCeption 還展現出引人注目的湧現行為:僅在合成人體影片上訓練的模型,能夠泛化至真實世界影像以及超出分佈的物體類別(例如動物和機器人)。這些發現表明,影片生成不僅僅是一種合成工具,更是邁向物理世界通用視覺智能的基礎路徑。專案頁面:https://genception.github.io
宏大目標難以一蹴而就,將其分解為小步驟更為明智。我們提出了信任區域策略蒸餾(Trust Region Policy Distillation, TOP-D),通過動態構建近端教師,將原本不穩定、高方差的同策略蒸餾(On-Policy Distillation, OPD)轉化為穩定的訓練範式。理論上,我們建立了一個嚴謹的框架,證明TOP-D能從本質上控制梯度方差。通過提供正式的全局收斂分析和單調改進界限,我們從數學上形式化了整體訓練動態的可靠性與穩定性。實證方面,TOP-D在數學推理任務中顯著提升了訓練穩定性、樣本效率以及最終性能。更重要的是,TOP-D不引入任何額外計算開銷,使其成為成熟OPD範式的一個極具前景的替代方案。
後訓練量化(Post-training quantization, PTQ)是一種廣泛應用於壓縮大型語言模型(LLMs)而無需重新訓練的技術。現有的二階PTQ方法(包括GPTQ)僅基於輸入激活統計量構建量化目標,實質上假設所有輸出通道對逐層重建目標的貢獻均等。我們提出KronQ,這是一個透過將梯度共變異數引入量化流程來挑戰此假設的PTQ框架。在克氏因子(Kronecker-factored)海森近似下,量化損失同時取決於激活與梯度共變異數,而KronQ在兩個互補層級利用此特性:(1)KronQ引入雙向非相干處理,利用梯度共變異數將現有的輸入側隨機旋轉擴展至輸出維度,從而降低跨輸入與輸出維度的權重幅度變異;(2)KronQ推導出一種新的敏感度度量,用於層間混合精度分配,該度量由梯度與激活海森跡所驅動。值得注意的是,在LLaMA-3-70B模型的2位元權重量化情境中,當GPTQ與GPTAQ發散或產生退化量化(在WikiText-2上困惑度大於2000)時,KronQ達到了7.93的困惑度。
大规模文本到图像模型因其RGB生成预训练能够学习丰富的语义、结构与几何先验,成为密集预测任务中极具吸引力的主干网络。现有生成式与编辑方法通过将密集预测重构为目标生成任务来复用这些先验:深度、法线、Alpha遮罩、掩膜与热力图等标注被编码至基于RGB训练的VAE潜空间,再解码为类似图像的目标输出。我们认为这种方式继承了生成式输出接口中超出密集预测需求的部分——与RGB合成不同,密集预测要求在同一图像平面上生成像素精确、任务原生的场域,而非渲染新的RGB内容。我们的核心观察在于:预训练的DiT已通过从图块到令牌再到图块的晶格结构在图像平面上组织RGB输入,因此每个令牌索引一个固定输出图块,其通道可承载任务原生量而非RGB外观。我们将其实现为ReChannel:保留VAE编码器以适配DiT的输入分布,但移除目标端的解码器,通过任务LoRA微调冻结的DiT,并利用共享的令牌级线性头部(约33K参数,无空间混合)将每个令牌映射至其p×p×K_t像素空间图块。基于FLUX-Klein,我们在六项密集预测任务与十余个基准上进行了评估。这一极简接口在无三元图抠图、KITTI深度与指代分割任务上创下新纪录,并在法线、显著性及姿态估计中保持竞争力。在匹配的4B参数设置下,其精度更高且速度比"编辑+潜解码"方案快2.48倍——密集感知可从生成式预训练中获益,而无需继承其输出接口。
長上下文處理對大型語言模型(LLMs)日益重要,但單純擴展上下文窗口並不能保證有效利用長輸入。隨著輸入長度增長,準確率往往下降,顯示模型仍難以辨識並運用與問題最相關的證據。提升長上下文利用率的一個有前景的方法是測試時訓練(TTT),將測試上下文視為訓練樣本進行實例特定的參數調整。然而,對整個長上下文進行TTT在計算上過於昂貴,而在隨機取樣的片段上進行適應則會引入嚴重噪音。由於長上下文中大部分片段與具體問題無關,對這些片段進行訓練甚至可能降低基礎模型的性能。我們的初步研究顯示,TTT對訓練片段的品質極為敏感:在LongBench-v2中,對隨機取樣片段使用TTT會損害性能,而對最佳證據片段(oracle spans)使用TTT則能顯著提升性能。受此啟發,我們提出一個簡單方法:自引導測試時訓練(S-TTT)。在適應前,模型自行識別應學習的證據片段,並僅對這些選定的片段應用標準語言模型訓練目標。在兩個具挑戰性的長上下文推理基準——LongBench-v2與LongBench-Pro上,S-TTT分別提升了Qwen3-4B-Thinking-2507與Llama-3.1-8B-Instruct的準確率,最高達到15%的相對提升。
微調大型語言模型以注入新知識面臨一個關鍵挑戰:模型能快速記憶新事實,卻無法將這些知識用於下游推理任務。我們將此失敗情形形式化為「**知用鴻溝**」,其特徵在於記憶與泛化之間存在準確率差距及時間延遲。為理解此現象,我們以未見知識微調大型語言模型,並運用名為「自我修補」的新型干預技術,監控知識在模型內部的空間滲透動態。自我修補能辨識出透過重新定位表徵可顯著改善失敗泛化案例的活化位置。這些結果與「知識電路錯位假說」一致:記憶的表徵可存在於模型內部,但可能未被導向至計算有效的層級。為驗證此診斷發現的實用性,我們設計一套簡單啟發式策略,可在泛化失敗案例中回復 58–75% 的理論上限改善空間。實驗跨領域進行以確保此發現的穩健性。
在本研究中,我們旨在透過利用全向表示中的旋轉等變性質來解決全景世界模型中的長程記憶挑戰,其中旋轉可視為一種隱含的幾何變換。基於此洞察,我們提出PanoWorld,透過固定航向將相機軌跡簡化為平移,並藉由密集全景光線條件(DPRC)與幾何感知記憶增強(GMA)實現當前動作建模及長程記憶。接著,引入三階段訓練流程逐步優化各組件。為在現有數據集相對穩定的情況下,更好評估大規模空間變化與多樣光照條件下的物理一致性,我們建構World360——一個大規模數據集,包含透過全景無人機收集的真實世界影片片段,以及由AirSim360生成的高品質模擬片段。在World360上的大量實驗證明了PanoWorld的有效性,其表現大幅優於其他替代方法。我們的模型、訓練程式碼及數據集將對外公開。更多資訊可參閱專案頁面:https://lihaoy-ux.github.io/panoworld-page/。
真实且多样的交通模拟对自动驾驶开发至关重要。然而,现有基准测试主要强调真实性,近期方法也据此优化,导致多样性研究不足。我们提出Flow-ERD,一种联合追求真实性与多样性的多智能体模拟器。其核心架构——类型感知流匹配(AFM),将流匹配的多模态表达能力与类型特定的运动学执行相结合,在保持与各智能体类型一致运动的同时,保留细粒度多样性。第二阶段——熵正则化蒸馏(ERD),通过熵正则化反向KL散度目标对闭环滚动分布进行微调,既缓解协变量偏移,又明确防止向高密度模态坍缩。我们采用无日志多样性指标与标准真实性评分对Flow-ERD进行评估。Flow-ERD在WOSAC测试基准中排名第一,并在可复现基线中主导了真实性与多样性的帕累托前沿。项目页面见https://seulbinhwang.github.io/flow-erd-project-page/。
醫學本質上即為多模態,臨床醫師需綜合來自不同數據流的信息。然而,多模態基礎模型的開發受到大規模、高質量臨床數據取得限制。雖然PubMed Central(PMC)提供了專家撰寫的圖文數據作為補充來源,但現有PMC衍生資源在保真度、可重複性及臨床驗證方面仍有限。我們提出MedPMC,這是一個自動化、可持續更新的框架,可將許可寬鬆的文獻轉化為醫學多模態模型的高保真基礎設施。應用於610萬篇PMC文章後,MedPMC整理出1100萬對醫學圖文數據。元件評估顯示,初步篩選(F1=93.2)、多面板圖檢測(F1=96.5)、圖像分離(mAP=89.8)、標題分離與對齊(F1=81.4;ROUGE-L=85.3)及醫學圖像分類(F1=96.5)均表現優異。經五位註釋員(其中三位具醫學背景)人工審查,MedPMC中95.3%的圖像具醫學相關性,而先前PMC衍生數據集僅為19.7%。在涵蓋11個專科的26項基準測試中,以MedPMC訓練的CLIP風格模型平均零樣本AUC較最強的架構匹配生物醫學CLIP基線提升7.1個百分點,即便其使用的圖文對數量不到後者一半。作為多模態大型語言模型的視覺編碼器,該模型在兩項醫學視覺問答基準測試中分別提升1.9及16.9個百分點。在耶魯紐黑文健康系統(Yale New Haven Health System)的10,524張皮膚科照片中,其將型態至圖像檢索的Recall@5提升11.7個百分點。這些結果顯示,高保真文獻整理能強化醫學多模態基礎模型在基準測試與臨床場景中的表現。我們公開釋出此框架、語料庫、基準測試及預訓練模型。
音素切割與辨識本質上是相互關聯的任務,然而現代方法通常各自獨立建模。我們主張,自監督語音模型(S3Ms)的表示中早已潛藏著音韻結構,僅需引導這些模型即可同時解決兩項任務。我們利用基於S3M的音韻激活映射(SPAM),將每個S3M表示幀映射為一組音韻特徵激活向量,例如清濁音與鼻音化。在此基礎上,我們引入兩種簡單而有效的輕量級、免梯度下降預測頭:辨識頭與切割頭。本方法僅需不到一分鐘的音標轉寫資料,且能泛化至訓練中未見過的音素。在涵蓋多樣化資料集的情況下,我們的方法達到了優異的切割與辨識表現。
我們推出 Soofi S 30B-A3B,這是一個主權開源的混合專家(MoE)模型,結合 Mamba 與 Transformer 架構,專為德語與英語設計。其混合設計使每個 token 僅啟動 30B 參數中的 3B,且隨著上下文增長,推論快取大小幾乎保持恆定,這使其在長上下文、高併發部署場景中,相較於密集模型具有顯著的吞吐量優勢。該模型在約 27 兆個 token 上進行預訓練,並特意調高德語資料權重。Soofi S 在英語與英語的綜合基準測試中,表現與 14B 至 27B 參數的密集模型相當,並在 17 個開放基礎模型中,於兩種語言上取得最佳的程式碼綜合表現,同時超越我們比較中的所有歐洲主權基線模型,包含那些活躍參數量更大的模型。在完全開放的模型中,Soofi S 在英語與德語評估中獲得最高分數,領先 Olmo 3 32B 與 Apertus 70B。Soofi S 是基於德國工業 AI 雲端(由德意志電信在慕尼黑營運的主權 HPC 規模 AI 基礎設施)端到端建構而成。Soofi S 將以高度寬容的開放存取條款發布:包含權重、精選的中間檢查點、完整的按來源資料核算、超參數,以及訓練與評估程式碼。在原始碼授權許可的情況下,資料建構產物將以寬容授權發布;商業授權來源則會以彙總統計與精確的混合比例核算方式記錄。
視覺語言模型(VLMs)透過將3D數位化與自然語言文物探索相結合,使互動式數位博物館日益可行。然而,在古希臘陶器等文化遺產領域中,可靠的VLM輔助仍面臨兩項挑戰。首先,開放式詮釋需要將細粒度的2D/3D視覺證據與專業策展知識相結合,但檢索過程可能引入薄弱來源與不可驗證的參考資料。其次,當可用證據不完整、有雜訊或模稜兩可時,VLM常產生看似可信卻缺乏依據的回應,而非校準後的不確定性表達。為解決這些挑戰,我們提出VaseMuseum——一個專為古希臘陶器智慧數位博物館設計的輕量化模組化多模態智能體框架。VaseMuseum結合互動式虛擬博物館與VaseAgent,後者透過多模態感知、3D感知推理、外部知識檢索與推理時可靠性控制,同時支援2D影像與3D文物。具體而言,VaseAgent從權威網站與博物館知識來源檢索證據,並透過來源層級控制,在生成前選取多樣化且可驗證的證據。同時,回應層級控制針對生成的主張與證據池進行比對,在證據不足或衝突時鼓勵中性、受證據約束的回應。此外,我們採用無需訓練的GRPO風格選擇機制,在不更新VLM主幹的前提下,傾向選取具有效參考與校準信心的回應。在真實數位博物館模擬實驗中,VaseMuseum相較於啟用搜尋的VLM基準,能提升引用有效性、減少知識密集型查詢的幻覺,並在模糊情境下產生更中性的回應。