每日精選AI研究論文及翻譯
我們推出Kimi K3,這是一個擁有2.8兆參數的混合專家模型,具備1,040億激活參數、原生視覺能力,以及100萬個token的上下文視窗。Kimi K3基於Kimi Delta注意力機制與注意力殘差構建,這些技術改善了資訊在序列長度與模型深度間的流動。結合每顆token有效啟動896個路由專家中的16個的穩定潛在MoE,以及優化的訓練與數據配方,這些進步使整體縮放效率相較Kimi K2提升了約2.5倍。後訓練階段重點在於涵蓋通用、代理與編碼領域的強化學習,並加入多種推理努力程度,從而實現組合泛化與穩健的長期執行能力。在2.8兆規模下,Kimi K3獲得多項基礎設施進步的支持:針對KDA的演算法-系統協同設計、完美平衡的專家並行訓練與高效記憶體管理、百萬token級別的代理強化學習(包含持續部署與沙盒狀態),以及部署創新。廣泛評估顯示,Kimi K3在長週期編碼、代理任務、知識、推理與視覺任務上均達到前沿水準。儘管其整體效能仍落後於最強大的專有模型,即Claude Fable 5與GPT-5.6 Sol,但Kimi K3在我們評估套件中持續優於其他開源與專有模型。我們釋出完整的Kimi K3模型權重,以促進未來研究,並加速前沿智慧技術的廣泛部署與應用。
创意AI正从单步资产生成向长周期多模态创作演进。尽管近期生成的模型能够合成高质量的图像、视频、音频片段、界面元素、故事板、幻灯片及其他创意资产,但现实世界的创意工作远不止孤立的提示输出交互。它涉及参考素材、草稿、备选方案、修改、失败尝试、版本关系、工具操作、评估信号及人类反馈,这些共同构成一个不断演变的项目状态。现有的基于提示、对话或节点的生成系统仅能部分支持这种状态,因为它们常丢弃中间上下文、依赖线性对话或需要手动指定工作流。近期商业化系统已显露出向智能体辅助创意生产转变的趋势,但其封闭架构使得研究智能体如何表征上下文、选择工具、修正制品、从失败中恢复以及随时间保持一致性变得困难。为弥补这一空白,我们提出JarvisHub——一款以画布为核心的创意智能体工具集,专为长周期多模态创作设计。JarvisHub将可编辑画布同时视为用户工作区、智能体的外部记忆、动作空间及共享项目状态,将多模态制品、依赖关系、版本及反馈表示为带类型的画布节点与链接。通过画布状态、协议桥梁与智能体运行时的三层架构,JarvisHub使智能体能够在可检查、可编辑的创作状态中行动。这一设计将创意智能体从孤立的工具使用推向可持续、可人为引导的创意自动化——智能体能够逐步规划、生成、修改并组织多模态项目,而用户始终能全程检查、引导并干预。
機械人學習發生在具有大規模行為空間的動態環境中。最終的成功訊號僅能告訴機械人任務是否完成,卻無法說明當前行為是否正在取得進展、保持不變,或是在抵消先前的進展。為此,近期的研究越來越重視在任務執行過程中提供反饋的進度獎勵。然而,當前文獻缺乏一個共同的框架。現有方法使用了不同的觀測量測、目標規格、輸出訊號、監督來源與評估協議。這使得難以對它們進行比較,也難以理解其實際驗證了什麼結果。在本篇綜述中,我們針對機械人學習中的進度獎勵建模提出一個統一的觀點。我們將此領域組織為三個相互關聯的步驟。首先,我們研究進度模型的外部介面,透過探討模型接收什麼資訊以及產生何種形式的進度訊號,從外部定義問題。接著,我們深入模型內部,研究構建此訊號所用的方法。這揭示了進度估計與獎勵生成背後不同的假設與機制。最後,我們檢視支持這些方法的資料與基準測試。這說明了進度監督是如何獲取的,以及不同的評估實際衡量了什麼。這三個觀點共同連結了進度模型是什麼、如何構建以及其品質如何驗證。我們進一步總結當前方法的主要限制,並討論未來的研究方向。
代理搜索通過將多步驟推理與檢索交織,使大型語言模型能夠解決知識密集型任務,然而以結果為基礎的強化學習(RL)進行優化僅能提供稀疏的監督信號。知識蒸餾則能提供更密集的引導,而具備強大推理能力的高階專有模型正是理想的教師模型。雖然從專有模型進行蒸餾可以強化此監督信號,但傳統的logit匹配因隱藏logit與不匹配的分詞器而無法實現,而純粹的自然語言軌跡模仿僅會傳輸表面的風格痕跡,而非核心推理能力。為了解決異質蒸餾問題並彌合分佈差距,我們提出多智能體協議蒸餾(Multi-Agent Protocol Distillation, MAPD),這是一個結合蒸餾與RL的框架,採用結構化且風格標準化的協議作為中間表示。一個離線多智能體系統(MAS)會將每個查詢分解、檢索支持證據、修復失敗的搜索,並將最終的探索軌跡轉換為包含任務類型、推理計畫及提取式基礎事實的JSON協議。在訓練過程中,該協議僅提供給學生策略中的特權分支,其token分佈在稀疏的RL目標之外,提供了密集的蒸餾信號。在七個問答基準測試上的廣泛評估顯示,MAPD始終優於具競爭力的蒸餾與RL方法,在Qwen3-1.7B上平均成功率達39.4%,在Qwen3-4B上則達44.4%。關鍵在於,該框架能穩健地泛化至多種不同的專有教師模型,同時有效減輕學生策略的風格漂移與冗餘退化問題。
同策略蒸餾(OPD)透過沿當前學生模型生成的軌跡查詢教師模型來調整擴散模型,但其在無分類器引導(CFG)——現代擴散系統的預設組件——下的運作方式仍未被充分理解。現有OPD方法自然將速度匹配延伸至由CFG組合成的預測,直接比對教師與學生模型的引導速度。我們證明此目標在分支層級存在欠識別問題:正分支與負分支誤差可在引導預測中相互補償。透過兩個對比案例,我們發現樸素匹配在共享負條件下仍有效,此時兩個分支誤差共同下降。然而,當模型原生CFG架構在教師模型的負分支中保留學生無法取得的特權資訊時,此共同下降機制便失效,組合目標將引發對抗性的分支誤差動態——降低正分支誤差卻增加負分支誤差。我們將此失敗模式稱為「負分支不對稱性」(NBA)。為解決NBA,我們提出「正向方向匹配」(PDM),這是一種分支感知的OPD目標,能分別約束正向預測與CFG條件方向。我們將PDM應用於密集至稀疏影片控制,在此場景中,樸素引導匹配對推論引導尺度非常敏感,而分支感知監督則能實現更穩健有效的知識遷移。
使用電腦的智能體通常透過強化感知能力來改進:更好的模型用於讀取螢幕截圖並選擇點擊位置。然而,螢幕截圖僅是底層程式狀態(例如,包含任務資料的檔案、應用後端和DOM)的一種有損渲染。不同的狀態可能產生相同的像素,而程式碼可以直接檢查和修改該狀態。StateAct 是基於這種區別而構建的代碼優先、多智能體框架。其主要智能體通過使用程式碼直接與程式狀態交互,而專用的GUI子智能體則在少數需要它的子目標上處理螢幕截圖與點擊互動——僅佔108項任務中的28項,以及主要智能體步驟的1.1%。對程式狀態的直接存取也支援驗證:一個獨立的完成閘門會雙重檢查保存結果是否存在結構性錯誤,例如輸出遺失、未保存或寫入錯誤路徑。為了在數百個步驟中保持正確方向,主要智能體將子目標交給新的子智能體處理,保持自身上下文的專注。在 OSWorld 2.0 上,StateAct 將 Claude Opus 4.8 的二元成功率從20.6%提升至26.9%,部分成功率從54.8%提升至61.6%,且每項任務的成本約為僅使用螢幕截圖驅動相同模型的九分之一;沒有GUI子智能體的純代碼變體僅達到45.9%的部分成功率,低於基於螢幕截圖的基準線54.8%。總體而言,將行動、驗證和記憶接地於狀態(我們稱之為狀態接地)將主要瓶頸從感知轉向推理:失敗更多取決於智能體的想法而非所見。
多模態基礎模型通過消費整個網際網路學會了看與說。具身智能體則不容許此類捷徑,因為它們需要將觀測與物理狀態及動作相耦合的數據。這些信號可由多種數據源以不同程度提供。在本工作中,我們將具身數據生態系統組織為一個「金字塔」,涵蓋五種互補的數據源:真實機器人數據、UMI風格數據、自我中心與外部中心數據、模擬數據以及通用視覺-語言數據。我們圍繞可擴展性與機器人對齊之間的張力來組織此金字塔,並進一步從數據品質、多樣性、可重用性及物理保真度等維度刻畫每種數據源。接著,我們透過數據配方的視角分析近期具身基礎模型,探討在預訓練過程中如何選擇、對齊及混合不同數據源。無論是具身腦模型、視覺-語言-動作模型還是世界-動作模型,我們都將數據組成與感知、推理、規劃、動作生成及世界預測等方面的能力相關聯。最後,我們討論六個開放性挑戰:構建大規模觸覺數據集、收集失敗與恢復數據、開發可擴展的數據收集流程、對齊跨具身型的動作、利用自我中心數據進行靈巧操作,以及為機器人學習設計有原則的數據配方。希望本工作能為下一代具身系統的設計奠定基礎。
擴散變換器對高保真度影片生成至關重要,但長序列的標記使得注意力機制成為推論的主要瓶頸。無訓練的動態稀疏注意力通過僅計算選定的鍵值區塊來緩解此瓶頸,然而現有方法在有效且準確地稀疏化注意力方面存在兩個難點:(1)剛性、不可預測且成本高昂的路由選擇:根據代理分數選擇固定比例的最高排名區塊會帶來固定預算,而保留區塊以達到目標累積代理機率質量則會產生動態但可能不平衡的預算;這兩種方式都因計算和實例化代理分數而產生不可忽略的開銷。(2)有損的保留或捨棄稀疏化:未被選取的區塊被完全丟棄,在高稀疏度下會降低準確度。這些限制促使我們尋求更廉價的動態預算路由,同時限制精度下降。本文提出無訓練的Sol-Attn(在線稀疏注意力),該方法在單一在線softmax過程中統一了動態路由、稀疏計算與近似校正,實現了稀疏注意力中更好的精度與效率權衡。Sol-Attn的核心是即時區塊門檻值設定與代理分數重用,通過在在線softmax過程中將區塊代理分數與門檻值進行比較來選取關鍵區塊。此設計在無需實例化代理映射圖的情況下達成動態且可控的區塊預算,同時直接重用未選取區塊的代理分數來近似其貢獻。在圖像與影片生成任務上的實驗顯示,Sol-Attn推進了無訓練稀疏注意力的品質與效率邊界,分別為影片生成與編輯帶來了2.1倍與2.3倍的端到端加速,同時保持視覺品質。
近年來的生成模型已從無聲影片或獨立音訊合成,進展至同步生成音訊與影片的聯合生成。儘管如此,由於音訊與影片在基本結構上的差異,要生成具有細粒度跨模態對應的同步音訊與影片仍具挑戰性。現有多數方法使用各自獨立訓練的音訊與影片變分自編碼器(VAE),導致兩個潛在空間缺乏跨模態對齊,使得下游生成模型必須從頭學習跨模態同步。我們提出 OmniVAE,這是一個聯合訓練的音訊-影片 VAE,能夠學習音訊與影片潛在表徵之間的細粒度語義對應。除了重建之外,OmniVAE 採用片段層級的音訊-影片對比目標,以捕捉時間-語義對應並對齊兩個潛在空間。同時,它也從預訓練的模態特定語義編碼器中蒸餾特徵至每個模態,從而改善兩個潛在空間的下游可學習性。大量實驗顯示,這兩個目標一致地提升了潛在空間的可學習性,進而在下游文字到音訊-影片生成中轉化為更高的生成品質與更準確的跨模態同步。這些發現凸顯了學習統一表徵作為全模態建模基礎的重要性。
我們提出 Oxygen-TryOn,一個針對任意品項的虛擬試穿統一基礎模型。不同於將通用型影像編輯器改作他用,Oxygen-TryOn 是專為時尚而生,透過專用資料引擎及試穿專屬訓練所打造。給定一個或多個參考品項(乾淨的商品照或非棚拍的穿著照)以及一張目標人物影像,它能合成出該人物穿著這些品項、且橫跨幾乎所有時尚類別的逼真影像。先前的系統僅能在棚拍環境中處理單一衣物類別,而近期的多參考方法仍以衣物為中心;相較之下,Oxygen-TryOn 支援多樣品項與場景,包括全身與半身視角、可變數量的參考,以及自由的多品項組合,同時忠實保留人物身分與品項外觀。我們不以遮罩式修補為基礎,而是將試穿重新定義為一項多參考、以理解為導向的生成任務。我們建立一個能大規模收集、製造、標註並篩選高品質試穿資料的資料引擎,並設計一套三階段的訓練配方:持續預訓練(CPT)、監督式微調(SFT)以及強化學習(RL)。RL 階段採用混合獎勵,結合內部試穿獎勵模型與專有、以評分指引為基礎的通用模型,共同監督細粒度一致性與指令層級品質。在同一流程中,它也能遵循一般的編輯指令(例如姿勢變化)。在公開基準測試與我們內部的 Oxygen-TryOn Bench 上,它在單品項試穿上達到最先進的一致度與真實感,並在多品項試穿上領先,能匹配或超越領先的專有系統(Nano Banana Pro、GPT-Image-2、Seedream5 Lite)與開源模型(FLUX.2)。
多輪長程規劃對於基礎模型代理至關重要,然而如何從根本上提升此能力仍不明確。現有模型訓練於不可控且不透明的網路資料,難以釐清規劃能力的獲取、塑造與整合過程。為解決此挑戰,我們引入一個統一且可控的多輪環境,得以精確調控,並系統性地研究長程規劃的三個階段:(1) 預訓練階段的規劃能力獲取。我們探討資料格式、分佈與品質。透過思維鏈狀態轉換建模進行明確的世界模型建構,能產生更強的長程泛化能力。僅靠原子技能不足以實現組合泛化,而少量的長程資料便能奏效。此外,次優軌跡會嚴重損害效能,原因在於誤差在長程中會累積放大。(2) 經由GRPO與OPD後訓練的規劃能力塑造。透過互信息,我們區分通用規劃模式與任務特定的規劃知識。針對規劃模式,我們辨識出後訓練的三種應用區域:不必要、有效與無法支撐。在低品質與長程設定下,OPD的有效區域較GRPO更廣,因其提供更一致的更新方向。針對規劃知識,從具不同知識的教師模型中蒸餾未見過的程序,可能損害學生既有的世界模型,同時未能完整建立新知識。(3) 經由MOPD後訓練的規劃能力整合。我們證明多教師同策略蒸餾(MOPD)能透過收斂至環境間共享的規劃模式來整合能力。相容的模式能實現跨環境泛化,部分共享的模式支援持續學習,而完全衝突的模式則導致嚴重干擾。
在本研究中,我們旨在對高維視覺表徵進行離散化,以彌合其與語言模型之間的差距——這是一項非平凡的挑戰,因為現有量化方法面臨碼簿崩潰問題,無法在保持語義一致性的同時進行擴展。我們發現根本原因在於度量不匹配:標準的歐幾里得碼簿目標函數從根本上與表徵空間的各向異性幾何不一致,導致碼簿嵌入產生高方差量值尺度與不均勻的角度分佈,進而阻礙可擴展性。為解決此問題,我們提出超球面量化(HSQ),透過角度路由將語義內容與特徵量值解耦,避免碼分配受到尺度而非意義的支配。所產生的離散表徵自編碼器(dRAE)在保持語義完整性並支援可擴展碼簿預算的同時,實現了高保真重建。大量實驗顯示,隨著詞彙規模擴展至131,072,效能持續提升,同時達成100%碼簿利用率、簡化的訓練流程,並在理解與生成任務中均展現優異表現。
多模態大型語言模型(MLLMs)在革新臨床實務方面擁有巨大潛力,然而將其部署至醫療領域本質上是一項以視覺為核心的挑戰:模型必須從異質的二維與三維醫學影像中吸收知識,且評估協議須與放射科醫師的臨床實務一致,並提供準確、細粒度且以事實性為導向的評量。本文提出 ClinFusion,一個以視覺為核心、專為全面醫學理解所設計的多模態大型語言模型,系統性地解決上述限制。我們提出一種組合式與級聯視覺編碼器架構,其中包含級聯空間感知局部融合運算子,能在單一融合編碼器中統一處理異質的二維與原生三維醫學影像理解。我們進一步引入以視覺為基礎的評估框架,包括用於指令遵循評估的 MedIF-Bench,以及一種基於興趣區域的方法,用於臨床一致且事實性驅動的報告生成評估。我們證明,ClinFusion 在涵蓋視覺問答、報告生成與指令遵循的全面二維與三維多模態醫學基準測試套件,以及文字類醫療任務中,樹立了新的業界最佳標準——在 24 項基準中於 20 項超越領先的開源醫療多模態大型語言模型(如 Hulu-Med、Lingshu),並在 16 項基準中有 13 項展現出優於 GPT-5.2 與 Gemini-3-Flash 等強大專有模型的多模態能力;此外,它還能進一步透過代理工具使用進行增強,以實現檢索增強與工具輔助的臨床工作流程。由具專科證書的放射科醫師所進行的盲審評估證實,ClinFusion 產生的報告排名最高,同時也驗證了我們所提出的以興趣區域為基礎的指標,在所有受檢驗的自動評估指標中,與專家判斷之間具有最強的相關性。
大型推理模型(LRMs)在生成最終答案前會產出長串推理軌跡。儘管這些軌跡可能包含對幻覺檢測有用的信號,但利用它們並非易事,因為長軌跡中常夾雜雜訊步驟,模糊了與真實性評估相關的線索。本文識別出兩種常見的推理雜訊形式,即無關步驟與重複步驟,並證明兩者均顯著降低幻覺檢測效能。現有的信心分數型方法與單純的嵌入過濾法無法可靠區分雜訊步驟與資訊步驟。為解決此挑戰,我們提出REDE,一個用於對推理軌跡去噪以進行幻覺檢測的新型學習框架。具體而言,REDE利用最終答案注意力作為自動監督信號來塑造步驟層級的表示空間,產生能可靠識別並過濾雜訊步驟的精煉嵌入。REDE透過在移除雜訊步驟後的過濾推理軌跡上運作,可輕易整合至多種幻覺檢測器中。在多個推理基準上的廣泛實驗顯示,REDE相較於競爭基準方法能持續提升檢測效能。
以LLM為評判已成為自動評估的標準做法,但其成本高昂、延遲顯著且決策過程不透明,這些限制削弱了其可擴展性與可靠性。為解決此問題,我們提出一個簡單且高效的替代方案:程式蒸餾。此方法在評估階段不直接提示LLM,而是將其決策邏輯蒸餾至一個由多個程式組成的委員會中,由這些程式直接對候選項目進行評分。這些基於程式的評判者具備可解釋性,易於檢視或修改,並消除了每次樣本的API成本。基於此概念,我們推出PAJAMA系統,該系統能綜合生成多個評判程式,將其決策匯總為聯合裁定結果,並內建備援機制,選擇性地將低可信度案件升級至LLM處理。在五個資料集與四個模型系列上的實驗顯示,基於程式的評判者可達到13B參數LLM評判者的效能水準。當使用程式輸出作為路由訊號時,PAJAMA能同時提升準確率與吞吐量,並推進帕雷托前沿。在評估範疇之外,基於程式的評判者還能提供低成本且有效的獎勵訊號:在RewardBench上,從程式裁定結果蒸餾出的獎勵模型,其效能優於訓練自專有LLM標籤的模型,而API成本卻降低了兩個數量級。
隨著視覺語言模型(VLM)的資料策展日益活躍,建構預訓練混合集的公開實務仍大致停留於啟發式層面:實務者疊加通過品質過濾的資料集、憑直覺設定跨領域比例、缺乏原則性且可歸因的標準來接納新資料,而前沿配方則保持不公開。我們將資料建構系統性地表述為一個混合優化問題,並通過將混合集解耦為兩個正交的子問題——跨能力類別的間比例與單一類別內的內部比例——將其轉化為可再現的工程學科。對於類別間分配,我們採用單變量迭代搜索;對於類別內組成,我們應用基於資料集層級的多維度評估,評分品質與難度,並將選擇表述為帶有多樣性目標的約束凸優化。DecoupleMix框架提供了兩項關鍵能力:引導下一步該收集哪些資料,以及使資料集驗證成為可控且可歸因的實驗。實驗結果顯示,我們的方法始終優於啟發式基線。此外,在小規模代理上發現的最優比例可直接遷移至更大規模,無需重新調整。利用額外800億個多模態持續預訓練token,我們的VLM在競爭性上可與使用更大多模態預算訓練的強開源模型相媲美。
視訊生成技術的進展持續縮小人工智慧生成影片與專業製作影片之間的視覺差距,然而多數基準測試仍從網路來源或大型語言模型模板提取提示,並以未經訓練的通用多模態模型進行評分。更根本的問題在於,這些評測的分類體系仍相當粗淺(整體視覺品質、粗略文字對齊與時間連續性),而非專業電影製作與評判所依據的「電影語言」準則,因此它們僅評估影片的基本合理性,而非電影級別的工藝。我們提出FilmBench——一個根植於電影學院傳統專業電影語言、並與北京電影學院及互晶數位媒體娛樂集團電影製片廠的導演與教師共同開發的文字生成影片(T2V)與參考影片生成(R2V)基準。該基準基於三項選擇。第一,提示是從涵蓋20種電影類型的獲獎影片片段中逆向工程生成,並由專業導演挑選,因此每個提示都錨定於經過驗證的真人拍攝參考;提示遵循實際鏡頭清單,且大多數腳本包含多個鏡頭(1,169個提示中有1,056個為多鏡頭),有別於以往的單一鏡頭基準。第二,評測遵循一個三層級的電影分類體系,包含3個軸向、12個組成部分及35個(T2V)+3個(僅R2V)子指標。第三,我們開發了一個內部的專家級自動評測代理,並開源其核心電影語言運算子套件(FilmOps)。在對領先的視訊生成模型(9個T2V模型、7個R2V模型)進行基準測試時,該評測器在模型層級上重現了人類模型排序,其斯皮爾曼相關係數分別為0.95(T2V)與0.96(R2V)。分數遠低於先前的網路風格基準,存在兩個持續的差距:動態美學方面,以及從單鏡頭到多鏡頭的性能顯著下降,且此下降在較弱模型中更為明顯。
現今改善語言模型通常需要重新訓練:耗費大量運算、每個週期產生新的不透明模型、以及非確定性輸出。我們採取相反路徑:模型保持凍結,同時在模型旁增長一個關於已驗證解決方案的持久記憶體。一旦某問題家族被解決,並通過了從不查閱答案的獨立驗證步驟,該家族的每個新實例都能以零生成詞元、位元精確、確定性的方式得到回答。在橫跨九個問題家族、來自四個供應商的四種架構(密集型與專家混合型)的180個新實例中,每個模型在每次回答使用零生成詞元的條件下均獲得180/180分:執行綁定能力已與參數縮放脫鉤。一項陰性對照將能力完全歸因於記憶體:一旦清空記憶體,系統便無法解決任何問題。同樣的「驗證再儲存」契約也適用於開放式推理:所有四個模型均達到88/88的一致性門控接受、機器可檢查的形式化證明,以及77/80的推理方法遷移率。記憶體選取僅需1.4微秒;完整重用則在6至23毫秒內完成,功耗36毫瓦時。在一個包含4,500項驗證記憶體的儲存中,近似相似性檢索在精確定址零錯誤的情況下,有94.3%的機率選錯項目。該記憶體還能作為工作上下文使用,其規模是任何已發布引擎都無法比擬的:在單一46 GB GPU且記憶體平穩的條件下,可提供600萬詞元的可移動視窗,而vLLM在30,399詞元處即停止,SGLang則在超過32,000詞元時默默截斷。在已發表的基準測試中,前沿模型在原始從頭推理上仍遠勝任何12B模型;但針對本系統已解決並驗證過的所有問題,比較結果出現逆轉:前沿API呼叫每次查詢都需支付全新的生成過程代價,永不停止;而驗證後重用則耗費零詞元,且每次返回完全相同的位元。本報告附帶一個提供免費、限速存取的公開測試平台:https://corbenic-galahad-bench.hf.space
人體頭部的參數化模型是傳統上應用於計算機視覺與圖形學中動畫、渲染及重建的重要工具。近年來,這些模型更成為生成式大型視覺模型中的關鍵條件信號,得以對生成圖像進行精確的空間控制。然而,現有的公開模型通常在解剖學範圍上有所局限,僅能建構外部幾何形狀,而忽略了口腔內部及眼部結構,且常因輸入數據集保真度不足導致幾何品質下降。本報告提出一種名為「生成式人體測量模型」(Generative Anthropometric Model, GNM)的新型參數化模型,其名稱與「人類基因組」(human genome)形成同音對應。GNM涵蓋頭部、臉部、頸部、眼球、牙齒及舌頭,並建立於包含高解析度3D掃描及優質解剖學專家手繪樣本的大型資料庫之上。本報告詳述數據來源、模型架構(包括專為眼部及口腔內部結構設計的子模型),並展示其在3D臉部掃描配準任務中的最先進效能。為促進學術社群創新,完整的GNM框架將公開釋出。
歷史文獻作為寶貴的知識檔案,常因物理劣化與損毀而難以辨識。現有的修復方法雖基於遮蔽語言建模有效利用局部語境,但在處理需外部歷史知識的命名實體時力有未逮。為解決此限制,我們提出一新穎的歷史文獻修復框架,結合大型語言模型與檢索增強生成技術。透過融合預訓練語言模型的內隱知識與明確檢索的外在語境,我們的模型ARI有效克服推論語境依賴專有名詞的挑戰。廣泛的韓國歷史文獻實驗顯示,本方法顯著優於基準模型,在還原一般字符與命名實體上均取得重大進展。此外,包含專家評估的全面性評量證實ARI可作為領域專家的實用工具,有望加速歷史記錄的分析。
我們引入一個由一個或多個智能體構建的自動化研究系統的詞彙表,以便更輕鬆地描述和比較其設計選擇。該詞彙表明確說明了:1) 智能體的身份,2) 系統中可用的操作,3) 誰可以調用這些操作,4) 智能體之間如何通信,5) 單次運行及跨運行中可見的資訊,6) 下一步行動如何選擇,7) 運行如何開始,以及8) 輸出如何評估。一條軌跡記錄了從輸入任務到返回產物的完整運行過程。由於智能體、操作和初始化可能具有隨機性,對相同任務進行多次運行會產生軌跡分佈,而非單一的行為。 我們的詞彙表將結構性設計問題(例如智能體何時應進行通信、獲取或失去某項能力、或在運行之間傳遞資訊)轉化為可測試的選擇。該詞彙表還將評估器視為系統的一個組成部分,因為報告的性能提升取決於代理評分與真實品質的接近程度。這種分離也將「這些系統缺乏品味」這一模糊批評拆解為兩個具有不同解決方案的失敗:生成品味是指系統在觀察到任何評分之前提出新穎軌跡的速率,而評估品味則是代理評分與其應匹配的品質之間的差距。我們以近期多個自動研究系統為例來實例化該詞彙表,以說明它能夠涵蓋結構差異巨大的設計。
可靠的視覺文件理解要求模型將每個答案歸因於支持該答案的證據區域。近期的基準測試與系統透過座標介面來實現此步驟:模型輸出標記文件中證據區域的邊界框座標。在此介面下,視覺語言模型即使回答正確,也時常無法識別正確區域,此情況稱為「歸因幻覺」。我們提出一項研究,探討此失敗是否部分受限於模型透過座標所能表達的範圍。在一個經驗證的雙語 CiteVQA 子集上,我們比較座標介面與語言介面:後者中模型僅輸出文字,逐字引用其證據,並由多模態檢索器返回每個引用的位置,作為版面解析器所提出的頁面區域(表格與圖形則透過其標題或註釋引用);此比較在六個開放式視覺語言模型上重複進行。與座標介面相比,證據召回率從最高 8 個百分點提升至 26 到 47 之間,且幻覺率約減半,而答案品質幾乎不變。基於此比較,我們將相同的引用與檢索流程用作訓練支架:由於針對長文件收集區域級證據標籤成本高昂,我們引入一種 GRPO 方法,其獎勵為評判者對黃金答案及檢索區域裁切內容的解讀,訓練模型在無任何區域標籤的情況下引用更好的證據,並將 8B 基礎模型嚴格的歸因準確率從 22.4 提升至 33.8。這些發現指出一條實際路徑,可在無需座標介面且無需昂貴的區域級監督下改善歸因表現。
大型語言模型(LLMs)已徹底改變了對話式 AI,然而高品質的多語種語碼混合對話資源仍然稀缺,特別是在印度語言中,使用者無論使用原生文字還是羅馬化形式,都經常在英語與母語之間自然切換。我們提出 IndicTalk,這是一個大型多語種印度語碼混合對話語料庫,涵蓋 18 種語言變體(涵蓋 9 種印度語言),包含超過 1,328,604 輪以事件為基礎的多輪對話。該語料庫透過全自動化流程生成,結合真實新聞事件作為基礎、使用多語種 LLM 進行基於個性的對話生成,以及自動化品質驗證。廣泛的語言學、自動化及人工評估顯示,IndicTalk 在兩種文字變體中均能產出流暢、連貫且自然語碼混合的對話。我們將公開 IndicTalk,以支援代表性不足的印度語系多語種對話式 AI 的開發與評估。該資料集可於以下網址取得:https://huggingface.co/datasets/LingoIITGN/IndicTalk。
大型视觉語言模型(LVLMs)仍受龐大計算開銷所限,阻礙其部署於資源受限的邊緣設備。儘管壓縮LVLMs的努力主要集中於視覺標記減少或更小的語言模型,視覺編碼器卻在很大程度上被忽略,通常以單體式、計算密集的特徵提取器部署。此外,此前並無任何研究設計出直接針對設備上延遲進行優化的LVLMs視覺編碼器。本文提出UltraViT,這是一款專為LVLMs設計並針對設備上性能進行優化的視覺編碼器。具體而言,通過考慮實際設備上的延遲,我們系統性地設計了一種金字塔式架構,該架構在宏塊層級策略性地整合並適配異質空間混合器。此外,為預訓練UltraViT,我們提出了一種新穎的兩階段生成式預訓練策略:首先通過密集蒸餾培養豐富的空間特徵,隨後由混合容量的凍結大型語言模型提供直接生成式監督。與標準的對比學習及自監督學習相比,我們證明該預訓練方法對於實現UltraViT所需的、用於後續LVLM生成式多模態對齊的高階語義基礎更為有效。大量實驗表明,我們以設備上延遲為導向的設計結合量身訂製的訓練策略,為高效LVLM編碼建立了新的最佳基準,在運行於設備上且速度提升近1.7倍的同時,顯著優於現有的以編碼器為中心的基線方法。
參數式檢索透過為每個API分配一個唯一的虛擬標記,並訓練模型透過受限束搜尋產生該標記,從而使大型語言模型(LLM)能夠隱式地檢索工具。ToolSense 指出,這種機制有兩個關鍵缺陷:它在訓練過程中破壞了參數化工具知識,並且其束搜尋解碼速度過慢,無法滿足即時部署的需求。我們提出 TRACE(透過增強式思維鏈與企業規則進行工具檢索),這是一個兩階段的課程機制,用以解決此脫節問題。第一階段重複使用 ToolSense 的多格式記憶化監督式微調(SFT),並以低秩適應(LoRA)植入工具知識。第二階段是我們的核心貢獻:模型被訓練在產生 JSON 格式的工具標記列表之前,先輸出一個思考軌跡,其使用了兩種資料來源——來自 ToolSense 的 RRB(重述-推理-分支)配對,以及針對領域專家制定的商業規則所合成的查詢——兩者均經由推理軌跡增強。此訓練目標保留了第一階段的單選題(MCQ)與問答(QA)探測準確率,同時能在生產級延遲下實現單束貪婪解碼。在一個涵蓋兩個企業產品線、總計超過 8,300 項工具的綜合企業目錄上進行評估,TRACE 的第二階段訓練不僅保留了工具理解能力,更進一步提升:MCQ 準確率相較第一階段提升 3.2 個百分點,QA 探測準確率提升 9 個百分點。在檢索方面,TRACE 在領域 A 達到約 86% 的召回率,在領域 B 達到約 60%——相較於嵌入基準方法的約 27% 與約 52%——且兩者均採用單束貪婪解碼,使其可直接以生產級延遲部署。
近期許多機器人政策試圖透過採用大型預訓練視覺語言模型作為動作主幹,以實現更強的控制能力。我們提出世界擴散變換器(WorldDiT),這是一個統一的擴散變換器架構,將動作生成與視覺世界建模結合,在無需大型預訓練視覺語言模型動作主幹的情況下即展現出優異表現。在訓練過程中,單一擴散變換器會生成連續動作區塊,並從未來攝影機影像中預測正規化的RGB區塊目標。在四個LIBERO模擬套件中,WorldDiT在所有四個套件皆有報告的方法中,其總模型參數與平均成功率均位於所報導的帕累托前沿上。這些結果為未來規模擴展研究提供了強而有力的十億參數以下基準。
自Volta架構引入獨立執行緒排程(ITS)以來,NVIDIA GPU普遍被認為以固定方式處理執行緒分歧。我們以ITS之前的Pascal架構為基準,在Ampere、Hopper以及資料中心與消費級Blackwell GPU上測試此假設。結合週期精確的微基準測試、硬體計數器以及編譯器產生的SASS靜態分析,我們區分出穩定行為與架構變遷。在所有測試世代中,分歧路徑的序列化時間與路徑數k呈線性關係,遵循T(k) ≈ s×k,且無超線性再聚合懲罰。執行緒執行效率下降為32/k,此懲罰與佔用率無關,而預測執行消除了序列化成本。相同行為亦見於Pascal,顯示此程式設計師可見的成本模型早在ITS之前即已存在。然而,編譯器發出的再聚合機制已有大幅改變:Pascal使用基於每執行緒的SSY/SYNC指令堆疊,而後續世代則改用屏障暫存器指令;超過立即後支配節點的延遲再聚合案例,從Ampere的29個降至Blackwell的2個。Blackwell亦引入雙層聚合屏障分類、均勻分支指令,以及明確的部分遮罩執行緒同步——這些機制在Ampere或Hopper上均未出現。受控位元翻轉實驗指出,新的屏障分類屬於編譯器靜態分類,在我們的測試中無可觀察的運行時效應。因此,即使NVIDIA的控制流ISA與再聚合機制持續演化,分歧仍維持穩定且可預測的效能成本。
比特幣價格在亞日時間尺度下的預測是計算金融領域中一個艱鉅的開放性問題。比特幣表現出厚尾收益率、非平穩動態,以及受Reddit和Twitter社交討論影響的價格發現過程。傳統方法透過靜態拼接將OHLCV技術特徵與情緒特徵融合,無論市場狀態為何皆採用相同的融合權重。這與行為金融學文獻不一致——後者顯示零售情緒在波動期最具預測力,而在平穩期則充滿雜訊。本文提出「狀態感知多模態學習」(Regime-Aware Multi-Modal Learning,RAML),該方法將情緒與價格特徵的融合條件設定為動態偵測的二元市場狀態。滾動24小時波動率將觀測值劃分為穩定狀態與波動狀態;一個可學習的S型門控會根據價格嵌入相對於情緒嵌入的權重進行調整,在波動期間更信任情緒訊號,在穩定階段則更依賴價格動態。該系統在3491個小時級觀測值(2024年7月至2025年9月)上進行評估,結合比特幣OHLCV數據與Reddit /r/Bitcoin的FinBERT情緒分析。比較了四種模型——僅使用價格的BiLSTM、僅使用情緒的分類器、靜態拼接BiLSTM,以及RAML——針對3小時與6小時預測區間,並搭配消融研究來分離情緒分支、狀態偵測與自適應融合。RAML在3小時取得宏平均F1值0.5474,在6小時取得0.5513,且3小時的AUC最高(0.5084),顯示校準效果更佳。消融實驗證實每個組件皆不可或缺,若以拼接取代自適應加權,將導致6小時預測的召回率崩潰(F1值:0.14)。這些結果確立了「以狀態為條件的自適應融合」作為多模態金融預測的必要設計原則。
駕駛風格捕捉了車輛駕駛過程中穩定且具駕駛員特定性的模式。然而,在自然駕駛資料中,此訊號難以分離,因為駕駛員在不同車輛、不同道路及不同條件下被觀測,因此模型可能將車輛或情境特定規律誤認為駕駛員特定風格。我們提出 DriveDNA,一個大規模自然駕駛資料集與基準測試,用於個人化駕駛風格建模,包含來自 465 位駕駛員、涵蓋 115 種車輛型號的 4,121 趟行程,總計 975 小時以 10 Hz 取樣的人類操控駕駛,並附有前方影像,資料源自社群駕駛員的日常使用。DriveDNA 將駕駛風格定義為在相似條件下車輛移動時具一致性且駕駛員特定的行為模式。該基準測試透過三項核心任務評估此訊號:少樣本駕駛員重新識別、個人化行為預測及條件匹配比較,並提供行為標註,以及經大規模人工審核的 276,248 筆涵蓋六類規則生成的操作事件。我們在固定多重種子協議下評估了多種基準方法,包括經典描述符、有監督與自監督時間序列編碼器、多模態融合、概率預測及零樣本基礎模型。學習表徵在未見過的駕駛員上顯著優於經典描述符(AUROC .935 對比 .707),且在匹配駕駛條件下保留駕駛員特定資訊,而描述符表現則接近隨機。僅使用影像的模型達到可比的重新識別準確度,但表現出嚴重的路線洩漏,顯示強識別能力可能源於情境捷徑而非駕駛行為。這些發現表明,可靠的駕駛風格評估必須同時評估學習表徵的行為價值,及其對車輛、行程與條件混雜因素的穩健性。
近期,強大的文字到圖像生成模型取得了進展,使得開發測試時方法來修改取樣軌跡,以產生更忠於複雜組合提示的圖像變得日益重要。我們提出 TILT,這是一個透過測試時獎勵對齊來實現組合式文字到圖像生成的免訓練框架。我們將組合失敗解釋為聯合分布與單一概念分布之間的重疊模式,並定義一個獎勵,偏好所有概念共同存在的樣本。此獎勵是基底模型內在的,不需要任何外部監督或獎勵模型。這產生了一個具有封閉形式傾斜目標分布的 KL 約束目標,以及用於擴散取樣的原則性引導步驟。概念分布與上述獎勵的互動自然導致了兩種不同的引導策略,而一種平衡其各自優勢的混合方法則產生了更強的表現。在來自 T2ICompBench 的提示上進行的實驗顯示,與先前的基準相比,我們的方法在保持圖像品質的同時,改善了組合對齊。