每日精選AI研究論文及翻譯
帶可驗證獎勵的強化學習(RLVR)是提升語言模型推理能力的有效方法,但每當訓練更強的新模型時,目標模型必須在訓練過程中生成大量交互軌跡(rollouts),使得這個過程成本高昂。隨著模型規模擴大,後續訓練(post-training)本身也成為瓶頸。我們研究了一種「由弱至強」(weak-to-strong)的替代方案:先在較小模型上執行強化學習(因其交互軌跡成本較低),再將該強化學習過程中學到的成果加以重複利用,以提升更強的目標模型。直接將強化學習後的弱教師模型進行知識蒸餾並不足夠,因為教師模型的最終策略混合了強化學習帶來的有效增益與較小模型自身的侷限性。為此我們提出「直接線上策略蒸餾」(Direct On-Policy Distillation, Direct-OPD),該方法傳遞的是教師模型經由強化學習所產生的策略偏移,而非最終策略本身。Direct-OPD 將強化學習前後的教師模型進行比對,並將其對數比值(log-ratio)視為提供給學生模型的密集隱含獎勵。簡而言之,這個檢查點配對告訴我們強化學習使得較弱模型更傾向於或更不傾向於採取哪些動作,而 Direct-OPD 則將此信號應用於更強學生的在線策略狀態上。如此一來,我們直接重複利用了弱模型強化學習過程中的監督信號,而無需在目標模型上執行稀疏獎勵的強化學習。實驗顯示,Direct-OPD 能持續利用較弱教師模型來提升更強目標模型;值得關注的是,它僅需在 8 塊 A100 GPU 上訓練 4 小時,便將 Qwen3-1.7B 在 AIME 2024 上的成績從 48.3% 提升至 58.3%。該方法不僅勝過按步驟匹配的直接強化學習,還能實現多個策略偏移的序列組合。我們的研究結果表明,強化學習的成果可以透過隱含獎勵信號的形式跨模型規模重複使用,而不僅僅是做為最終模型來模仿。
视觉语言导航基础模型旨在将深度推理与具身空间决策统一起来,同时保持广泛通用性以应对多样化的具身任务。当前方法通常通过将观测直接映射到动作的单一策略来实现这种整合,但常受坐标漂移和长尾语义处理不佳的困扰。此外,这些黑箱映射缺乏可解释性,难以同时实现通用性、鲁棒性和透明性。我们提出ABot-N1,朝向通用视觉语言导航基础模型迈进,通过双视觉-语言信号引导的慢快架构将认知与控制解耦,从而解决上述挑战。具体而言,慢速视觉-语言推理器执行显式链式思维推理,同时生成像素目标。这一紧凑的图像空间锚点集合作为通用接口,支持点目标、物体目标、兴趣点目标、指令跟随和人物跟随等多样任务。随后,快速动作专家利用文本线索和像素引导,以原生控制频率生成连续航点。通过像素级锚点桥接高层意图与底层控制,并辅以显式语言痕迹,我们的方法在仿真和真实世界基准测试中确保了鲁棒、可泛化且可解释的导航。ABot-N1确立了新的最先进纪录,尤其在城市场景导航中实现了显著提升:兴趣点到达率提升35.0%(达到77.3%),并在复杂室内外场景中取得了95.4%/92.9%的成功率。此外,在物体到达、人物跟随和指令跟随任务中保持了卓越的鲁棒性。我们开源了新的点目标/兴趣点目标基准测试,以推动城市场景导航领域的发展。
近期的VLM與VLA系統已顯著提升機器人的感知與動作預測能力,然而長時域具身智能體仍需一套通用的運行時層,以支援推理、記憶、工具使用、驗證及跨本體執行。我們提出ABot-AgentOS,這是一套通用的機器人智慧體作業系統,位於低階控制器之上,提供一個慎思式智慧體層,實現場景條件規劃、上下文隔離的技能執行、多階段驗證、多模態記憶以及邊緣-雲端協作。為評估此類系統,我們引入EmbodiedWorldBench,這是一個可執行的基準測試,涵蓋16個室內、室外及混合場景,四個難度等級,以及超過200個任務,包含導航、物體搜尋、NPC對話、動態事件與軌跡導向評分。ABot-AgentOS更進一步引入通用多模態圖形記憶,這是一個持久性的源導向基底,可將對話、視覺觀測、空間脈絡、時間關係與任務軌跡轉化為具類型的節點與邊。一套失敗驅動的自我演化循環會將診斷出的記憶缺陷轉化為門控運行時進化資產,這些資產僅在後續的評估拆分中提升,從而防止當前拆分中的真值洩漏,同時實現持續改進。在EmbodiedWorldBench的初始子集上,ABot-AgentOS在任務成功率與目標完成度上均優於單一控制器基線。在記憶基準測試中,ABot-AgentOS靜態版於LoCoMo達到87.5,於OpenEQA EM-EQA達到59.9,於Mem-Gallery達到88.6,於NExT-QA達到76.5的Acc@All;自我演化進一步將LoCoMo提升至88.7,OpenEQA提升至60.4,Mem-Gallery提升至89.0。這些結果表明,通用智慧體作業系統層能夠改善長時域具身執行,同時為持續互動提供持久且可稽核的記憶。
現有的動態人體體積捕捉技術透過密集的相機陣列可達到高保真度,但在實際場景中,僅有少數低重疊相機可供使用,這會降低輸出品質並留下大片未觀測區域。近期的4D重建方法雖已針對低重疊設定進行研究,但在觀測不足的區域仍會產生明顯的偽影。影片擴散模型雖然成為另一種選擇,但其在幾何一致性上對人體表現不佳。為解決這些限制,我們提出StudioRecon,這是一種透過分離背景與人體,從稀疏低重疊相機重建4D人體場景的流程。我們透過影片擴散模型合成數百個受相機控制的新視角,以稠密化背景監督。同時,我們利用跨視角身分關聯與三角化多視角關鍵點擬合,穩健地初始化可形變高斯人體。最後,我們提出的遞迴增強模組搭配運動自適應一致性注入,協調合成輸出,進一步避免殘留偽影。我們在四個真實世界資料集上達成最先進的新視角合成,並展示新軌跡渲染與人體替換等應用。
個人AI助手在行動與穿戴式裝置上,透過視覺與音訊串流持續感知使用者的日常生活。然而,回答關於過往經歷的查詢需要能持續累積、組織並檢索長期經歷的輕量多模態記憶,這仍是一項挑戰。為解決此問題,我們提出LightMem-Ego,一個專為日常生活輔助設計的輕量串流多模態記憶系統。該系統持續擷取第一人稱視角的視覺與音訊串流,將其對齊至共同時間軸,並組織成包含當前記憶、短期記憶與長期記憶的階層式記憶結構。當使用者提出查詢時,LightMem-Ego會動態將檢索導向至適當的記憶層級,並根據多模態證據生成答案。此示範可部署於智慧型手機與AI眼鏡上,支援物品尋找、對話回憶、生活摘要、習慣發現與個人化輔助等功能。程式碼已於 https://github.com/zjunlp/LightMem-Ego 公開。
大型語言模型(LLMs)在高中與奧林匹亞風格的數學問題上已展現卓越表現,但其在高等數學領域的能力仍未被充分理解。然而,現有基準在範疇與評估粒度上皆有不足:它們的學科覆蓋範圍有限,且往往僅依賴最終答案的正確性或粗略的判斷,導致推理過程的有效性難以獲得充分評估。為填補此缺口,我們提出AdvancedMathBench,一套專為評估高等數學推理能力而設計的基準套件。其核心的證明生成基準ProverBench包含296道題目,涵蓋大學部與博士資格考的水平。為提供可靠的證明評估,我們開發了一套專用的自動驗證流程,該流程基於大規模專家註釋進行訓練,不僅能給出正確性判斷,還能對證明中的錯誤進行細粒度評估,且在保留的證明軌跡上與人類專家展現高度一致性。我們進一步引入VerifierBench,其中包含888組模型生成的證明軌跡及專家真實結果,用以評估模型能否正確判斷證明的有效性,並提供合理的驗證依據。實驗結果顯示,AdvancedMathBench對前沿模型仍構成挑戰。在證明生成方面,表現最佳的模型GPT-5.5-xhigh在UGD與QE分組上分別僅達到75.8與66.1,顯示在高等數學證明的構建上仍有顯著改進空間。而在證明驗證方面,最佳模型的平衡F1分數僅為65.1,且各模型普遍呈現低真陰性率,顯示關鍵錯誤的檢測仍是一大瓶頸。
後設認知是智慧的基本組成部分,對於有效學習、問題解決、決策制定、溝通等方面至關重要。近年來,它越來越被視為具備能力且透明的AI系統的基石。然而,儘管大型語言模型在各種現實任務中取得了顯著進展,但目前仍不清楚它們何時、如何或在何種程度上能夠展現或具備有效的後設認知能力,也不清楚如何調整這些能力以提升AI系統的基本功能、可靠性與智慧。本文透過提供關於大型語言模型後設認知知識現狀的首份全面綜述來填補這一缺口。我們分析並分類這一新興領域的版圖,總結近期的技術進展,包括衡量與評估大型語言模型後設認知能力的方法與基準、引發、改善及應用大型語言模型中後設認知的技術,以及當前研究的發現與啟示。我們也討論了應用、開放性問題與挑戰,以及未來工作的有前景方向。我們的目標是提供關於此主題的詳細且最新綜述,並激發有意義的研究與討論。相關論文的有組織列表可見於 https://github.com/yale-nlp/LLM-Metacognition。
操控性是通用型機器人策略的核心能力,但在靈巧手系統中仍嚴重缺乏,原因在於缺乏大規模、語言對齊且動作精準的示範資料。為解決此瓶頸,我們提出一套全端系統,可從第一人稱人類影片擴展靈巧VLA預訓練,並支援資料高效的真實機器人後訓練。該系統整合了EgoSmith資料管線,可將野外第一人稱影片整理成9,600小時的高品質預訓練資料,其吞吐量比先前最佳技術高出9倍,準確性也更高;還有統一的機器人堆疊,用於遠端操作與人機協作修正;以及EgoSteer,這是一個基於優化基礎設施訓練的世界模型增強型VLA。人類資料預訓練賦予EgoSteer語言引導的操作先驗,再透過機器人後訓練紮根,並經由DAgger改進強化。實證結果顯示,EgoSteer能在40多種多樣任務中穩健執行自由形式指令,展現故障恢復、靈巧性與泛化能力。預訓練模型還能少樣本適應複雜的長時程任務,包括在兩種實體上摺疊紙盒,成功率超過75%。我們已在https://egosteer.github.io/ 開源系統、資料與模型。
後訓練對於提升大型語言模型(LLMs)的領域專用能力至關重要,然而現有的獎勵優化與分佈匹配方法將策略探索與分佈對齊緊密耦合。這種耦合迫使模型直接在策略模型上進行昂貴的探索,並嚴重阻礙了優化信號的非同步生成、重複使用以及跨模型遷移。本文提出了一種新穎的後訓練框架——代理引導更新信號傳遞(Proxy-guided Update Signal Transfer, PUST),從根本上將更新信號探索與分佈對齊解耦。PUST 不直接使用主模型進行高成本探索,而是採用輕量級代理模型作為高效測試平台,以發現高獎勵行為。我們提取代理模型初始狀態與優化後狀態之間的相對改進信號,將這種方向性更新傳遞給主模型,引導其策略對齊。這種由代理探索、更新信號提取與信號傳遞組成的解耦流程,顯著降低了計算開銷,並使優化信號能夠非同步生成、緩存及重用。關鍵在於,通過傳遞相對改進而非絕對策略分佈,PUST 自然支持從弱到強的改進以及無縫的跨模型遷移。在 Qwen3 系列模型上針對數學和程式碼領域的系統評估表明,從明顯較弱的代理模型中提取的更新信號,能夠穩健且可調控地增強較強的主模型。最終,PUST 將後訓練從單一性的在線優化過程轉變為高度模組化、可重用且具成本效益的新範式。
探索對於多智能體系統中可靠的自動化至關重要,然而目前尚不清楚大型語言模型(LLM)智能體在彼此互動時能否有效地進行探索。我們發現,現代LLM智能體在這方面表現不佳,經常呈現短視且極化的互動模式,導致協調不佳並增加遺憾。我們將此挑戰正式定義為「多智能體探索問題」,將其建模為部分可觀測隨機博弈(POSG)問題,其中智能體必須探測同伴以推斷其能力並找出有效的互動策略。為了解決這個問題,我們提出了「多智能體情境探索」(MACE),這是一個輕量級框架,通過結構化的同伴選擇明確促進探索。在情境多樣性和參數多樣性兩種設定下,MACE顯著改善了探索行為與下游任務表現。我們進一步從理論上證明,探索的價值隨著智能體多樣性增加而提升。總體而言,我們的結果凸顯了當前LLM智能體的基本限制,並強調了明確引導的探索對於可靠的多智能體自動化的重要性。程式碼將於 https://github.com/deeplearning-wisc/mace 發布。
理解人工系統中複雜認知功能的組織方式,是解讀大型語言模型(LLMs)並將其與生物認知連結的核心。然而,儘管LLMs展現出廣泛的認知行為,其內部表徵是否形成可再現的功能系統——足以解釋行為、失敗機制以及與人類認知的關聯——目前仍不明確。本文提出NeuroCogMap,一個受認知神經科學啟發的框架,將LLM的內部特徵組織為功能分區,並將其與可解釋功能、認知能力及認知層級結構相連結。這些分區形成穩定且語意一致的組織,在不同模型間部分保留,並與模型輸出在功能上相關聯。在此組織中,LLM的主要失誤——包括幻覺、偏見、拒絕失敗與諂媚——各自對應於表徵系統與行為控制系統的特定干擾,從而產生可供機制導向檢測與目標性干預的內部特徵。超越模型行為之外,NeuroCogMap能改善對自然語言理解過程中人類大腦皮質反應的預測,其中與高階聯合皮質的對應最為強烈。在認知層面上,其內部特徵揭露了潛在策略,可引導對人類決策經典模型的修正。綜合這些發現,NeuroCogMap建立了一套系統層級的架構,用以繪製人工系統的功能組織,並將此組織與人類大腦皮質功能及認知行為連結起來。
語言模型日益被用於跨不同語言與文化脈絡的道德決策,然而現有研究在以下三方面忽略了多語言性:1)多語言評估基準依賴直接翻譯,未能適應文化特有項目;2)道德推理的推論階段方法依賴靜態且以英語為中心的腳本,且缺乏道德理論基礎;3)道德決策的訓練方法通常需要來自較強模型或人類標註者的昂貴監督。我們透過三項貢獻填補這些缺口。首先,我們提出MCLASH,一個多語言道德決策基準,用以捕捉跨語言的具體文化道德直覺與社會規範。其次,我們提出MET(基於理論推理的多語言倫理學),這是一個兩步驟提示方法,其基礎來自心理學與哲學領域專家策劃的理論根據:模型先選擇特定情境與文化的根據,再以使用者的母語對其進行推理。第三,我們提出MET-D(MET蒸餾),透過一個無需外部監督的自我蒸餾訓練階段來強化第二個步驟。MET-D在三個不同規模與家族(Qwen3-4B、Qwen3-8B、Gemma3-4B)的模型上,相對於基礎模型,在MCLASH上平均提升3.71個巨觀F1分數,在MMoralExceptQA上平均提升4.23分數,其中Qwen3-8B在馬來語上的MCLASH提升最高達12.94分。我們進一步揭示,MET-D平均提升母語推理62.13分數,且有益的根據在不同文化間系統性地有所差異。綜合而言,這些貢獻為文化對齊、理論基礎的多語言道德推理開闢了道路。
虚拟试穿(VTO)在将服装逼真地迁移至目标人物方面取得了显著进展。然而,大多数系统对用户如何穿着服装的控制十分有限——包括其尺寸(宽松或贴身)、款式(如扎入或外露、敞开或闭合)以及身体上的空间位置。我们通过两项互补性贡献填补了这一空白。首先,我们定义并解决了基于VIP-SAM的视觉实例提示分割问题:给定服装的平铺图像,从穿着该服装的人物照片中分割出该特定实例。这是一项实例级任务,与通常研究的类别级分割截然不同。其次,我们引入了CtrlVTON,一个可控的VTO框架,它将试穿重新定义为图像编辑问题,并添加分割掩码作为像素级控制,以调整服装布局,包括风格、尺寸以及身体上的空间位置。VIP-SAM和CtrlVTON各自在其任务上取得了最先进的结果。特别是,CtrlVTON生成的图像在遵循用户提供的布局方面远胜于最强大的专有编辑系统,同时与之在服装保真度上不相上下。
近期推出的基礎影像與影片生成模型雖具備強大的泛化能力與可控性,但其直接應用於具身場景時,仍受限於多視角一致性、幾何連貫性及機器人實體約束等要求。現有方法通常以有限的機器人資料微調基礎模型,卻往往犧牲大規模預訓練階段所習得的視覺知識。我們提出「小米機器人-U0」,這是一個擁有380億參數的多模態自回歸模型,專為統一化的具身合成而設計。該模型將具身生成視為基礎影像與影片生成之延伸,並共同優化文字轉影像生成、影像編輯、具身場景生成、具身遷移以及具身影片生成等任務。此統一框架在保留預訓練世界基礎模型泛化能力的同時,將其適應至具身設定。小米機器人-U0是首個能支援多種機器人實體下高品質多視角場景生成的模型,並引入結構化、可控的具身遷移技術,實現細粒度編輯,同時維持多視角一致性與互動動態。在單步生成與序列生成任務中,該模型達到業界最佳成果:於具身場景生成與遷移的人類評估中勝過GPT-Image-2.0,在World Arena具身影片生成排行榜上名列第一,並將pi_0.5在具挑戰性的真實世界操作任務中,其分佈外成功率從36.9%提升至63.2%。這些結果顯示,基礎世界模型既能作為具身世界模型,也能作為具身智慧的可擴展資料引擎。程式碼與檢查點已公開於 https://robotics.xiaomi.com/xiaomi-robotics-u0.html。
生成和编辑人脸需要极高的精度,因为即便是细微的修改也可能显著改变被识别对象的身份特征。然而,当前基于通用文本到图像模型构建的个性化与编辑方法,往往缺乏实现精细面部编辑所需的精度。我们提出一种用于文本到图像个性化模型的细粒度身份调优方法。与标准图像编辑(操作给定图像)不同,身份调优会修改特定身份的潜在表示,从而生成持续呈现同一编辑后身份的多样化图像。为实现细粒度的潜在身份调优,我们探索了用于文本到图像个性化预训练冻结编码器的潜在空间。该方法无需额外训练,而是利用冻结编码器现有架构揭示潜在语义方向。该空间由一组潜在标记构成,这些标记在捕捉身份不同方面中扮演独特角色,通常对应特定空间或语义面部区域。我们证明,在此空间及由选定标记定义的子空间中可识别有意义的方向,从而实现局域化、细粒度且语义一致的编辑。通过定性与定量实验验证了该方法在实现多样化局域面部编辑的同时保持跨图像身份一致性。项目页面:https://garibida.github.io/IdentityTuning/
本論文探討將運動從一部影片遷移到另一部影片的技術,這對於動畫中多樣化角色的製作至關重要。過去,影片運動遷移主要集中於人類與類人角色之間,從而推動了許多數位創作應用的發展。然而,這些方法面臨一項主要限制:相關技術流程高度依賴預定義的人體骨骼結構,並因此需要基於骨骼條件的模型訓練。一方面,這類方法難以泛化至不同物種的動物等多樣化角色,同時保留其獨特的運動風格。另一方面,多樣化骨骼的標註數據有限,進一步限制了該任務的大規模訓練。本文跳出基於骨骼的運動遷移框架,提出一種免訓練的運動遷移框架,稱為 Motion4Motion。Motion4Motion 透過建模影片中角色的運動流(motion flow)而非骨骼,從而更容易實現跨物種的運動遷移。大量的實驗結果與新穎應用顯示,我們的方法在效能上明顯優於基準方法。專案頁面請見 https://lhchen.top/Motion4Motion 。
基於精心設計的潛在表示的流匹配(Flow Matching)近期已成為一種強大的拓撲感知網格生成範式。然而,現有方法將頂點與連通性共同建模於一個聯合潛在空間中,使連續的頂點幾何與離散的組合結構糾纏在一起;這使得流學習變得複雜,並表現為頂點漂移與表面斷裂。我們提出 LATO.2,一種分解式流匹配框架,將網格生成分解為一個頂點流,隨後再進行一個以已生成頂點為條件的連通性流,且兩個階段均錨定於共享的粗略體素支架。專用的變分自編碼器(VAE)支撐這兩個階段,以子體素精度重建頂點,並將離散的連通性嵌入連續的潛在空間。我們展示了這種分解方式獨有的兩項優勢:(i) 逐部分生成:將支架分割,每個部分以完整的潛在容量合成,從而產生遠比單一整體潛在空間所允許的更高解析度網格;(ii) 拓撲自適應編輯:操縱第一階段的頂點,無需重新最佳化即可誘發對應的連通性。實驗表明,LATO.2 在幾何保真度與連通性品質上超越了當前最先進的拓撲感知網格生成器。
為何使用簡單圖像與資料增強的對比學習能夠為下游任務產出有用的表徵?我們透過解析計算針對一系列基礎資料增強方法與任何具備平穩統計特性的圖像資料集,在對比損失函數下的最優表徵來探討此問題。我們證明,對於某些資料增強方法,最優解可由一類卷積神經網路達成:其第一層濾波器為正弦波,接續逐點非線性函數、全局平均池化,以及執行部分白化的最終線性層。我們亦顯示,針對更複雜的資料增強方法,此類卷積神經網路中的最優權重仍為正弦波。這些正弦波的頻率及其權重可透過簡單的注水演算法,依據資料集的期望功率譜計算得出。透過在不同圖像資料集與資料增強方法上進行實驗,我們發現此類以隨機梯度下降訓練的卷積神經網路,在經驗上會於第一層學習到正弦波,並執行部分白化。
当前视频大语言模型(Video LLMs)在问答(QA)任务中表现出色,但大多作为黑箱运行,仅输出文本答案而缺乏可验证的视觉归因。现有的可解释性方法依赖于文本解释或稀疏边界框,难以捕捉诸如遮挡与非刚性形变等复杂视频动态。我们提出证据支持的视频问答(E-VQA),这一新任务要求模型同时输出语义答案与精确的时空证据:时间片段及密集的、带有跟踪目标分割掩码片段。为此,我们引入ST-Evidence,这是首个经人工验证的、同时涵盖判别式与生成式像素级定位的基准。对当前最优模型的评估揭示了问答准确率与真实视觉感知之间存在关键性解耦,单纯依靠规模扩展无法弥合这一差距。为解决该问题,我们开发可扩展的自动化生成流程,构建ST-Evidence-Instruct——一个16万规模的数据集,桥接高层推理与细粒度定位。基于此数据对具备视觉定位能力的视频大语言模型进行微调,使得对应尺寸的UniPixel基线模型获得显著提升(例如,7B模型在t-mean上提升+27.2,在J&F上提升+13.8),为可解释、证据支持的视频理解建立了稳健基线。代码与数据开源于 https://github.com/SalesforceAIResearch/EVQA。