每日精選AI研究論文及翻譯
我們推出Vidu S1,這是一個支援語音控制數位角色的即時互動式影片生成模型。使用者可透過語音指令隨時控制影片生成內容。Vidu S1支援無限制長度的即時影片生成,無模糊、漂移或視覺失真。基於TurboDiffusion與TurboServe技術,Vidu S1能在一般消費級GPU上以高達42 FPS的幀率輸出540p即時影片。使用者可上傳真人、動漫及寵物的自訂圖像,並選擇不同的語調以獲得個人化體驗。實驗結果顯示,Vidu S1在所有測試指標中均達到最佳表現,同時完全滿足即時推論需求。線上示範版本可於 https://vidu.com/vidu-stream 體驗。
視頻理解的內在複雜性,使得難以斷定 Video-LLM 的基準表現究竟源自視覺感知、語言推理,還是知識先驗。儘管已有許多基準測試用於評估高階推理能力,但評估影片理解的共通標準仍普遍被忽略。本研究不另提出新的基準,而是回歸根本,重新檢視評估影片理解的標準。我們推出 Video-Oasis,這是一套可持續運作的診斷工具,能系統性地審視現有影片理解基準。審查結果顯示,現有基準中有 55% 的樣本在缺乏視覺輸入或時間脈絡的情況下仍可解答。在排除這些捷徑後,留存下來的影片原生挑戰揭露了顯著的能力差距:當前最佳模型的表現僅略優於隨機猜測。基於這些發現,我們將篩選出的挑戰作為測試平台,探討哪些演算法設計選擇有助於形成穩健的影片理解。期望本研究能為建構嚴謹的影片基準及評估未來 Video-LLM 提供實務基礎。程式碼已公開於 https://github.com/sejong-rcv/Video-Oasis。
零樣本組合動作識別(ZS-CAR)要求辨識由先前觀察到的基本元素組成的新型動詞-物件組合。在本研究中,我們針對一個關鍵的失敗模式進行處理:模型透過物件驅動的捷徑(即依賴標註的物件類別)而非時間證據來預測動詞。我們認為稀疏的組合監督與動詞-物件學習不對稱性可能促進物件驅動的捷徑學習。透過提出的診斷指標分析顯示,現有方法過度擬合訓練共現模式,且未充分利用時間性動詞線索,導致對未見組合的泛化能力薄弱。為解決物件驅動捷徑,我們提出強健組合表徵(RCORE),包含兩個組成部分。共現先驗正則化(CPR)為未見組合添加明確監督,並透過將其視為困難負樣本,對模型進行正則化以對抗頻繁共現先驗。組合時序順序正則化(TORC)則強制模型具備時間順序敏感性,以學習基於時間的動詞表徵。在Sth-com與EK100-com數據集上,RCORE降低了捷徑診斷指標,進而改善了組合泛化能力。
大型語言模型與多模態大型語言模型的快速發展,加速了具備主動能力的智能體(Agent)的出現,這些智能體能夠操作日常工具並在真實環境中協助用戶。然而,現有基準測試難以有效評估此類智能體,原因在於它們通常依賴沙盒化環境與單輪評估模式。此外,其基於場景的任務分類將多種模型能力混雜在同一任務類別中,使得智能體失敗的根本原因難以辨識。為了解決這些限制,我們提出UniClawBench,這是首個以能力為導向的基準測試,旨在動態真實環境中評估主動智能體。UniClawBench圍繞五項基礎模型能力建構:技能運用、探索、長文本推理、多模態理解與跨平台協調。基於這些能力,我們設計了400項雙語真實世界任務。不同於依賴靜態預錄答案的既有基準測試,我們的基準測試在即時Docker容器中,透過細粒度、逐步完成的檢查點來評估智能體。此外,我們設計了一套閉環評估策略,包含執行智能體、隱藏監督智能體與用戶智能體,以模擬真實多輪人類反饋,同時不洩漏評分標準。為了將基礎模型能力與框架層級的設計選擇區分開來,我們在多個智能體框架下評估了當前最先進的模型。透過模型與框架間的全面比較,我們展示基礎模型能力與智能體框架設計如何共同影響真實環境中的表現。為促進未來研究,我們將基準測試與程式碼公開於 https://github.com/HKU-MMLab/UniClawBench。
科學概念很少從零開始。它們繼承機制、修補已知限制、重組先前工作的片段,與生物基因組極為相似。目前的基準測試仍很少能說明AI系統是否能遵循這種繼承結構。我們提出IdeaGene-Bench(IG-Bench),一個針對科學譜系推理與基於譜系的構想生成的基準。IG-Bench圍繞IdeaGene框架組織:每篇論文或提案被表示為一組最小化、帶類型、以證據為基礎的Idea Genome物件,而GenomeDiff對齊這些物件,以在六種操作演化動力學下記錄繼承、突變、遺失、外部導入和新穎插入。該基準包含1,961條黃金譜系軌跡、1,085個經策劃的Idea Genome物件,以及920個成對GenomeDiff記錄,涵蓋10個科學領域。它支援兩種評估。IG-Exam(42種任務類型,1,029個實例)測試閉式譜系推理,涵蓋Idea Genome抽象、繼承追蹤、演化推理和譜系驗證。IG-Arena則以基於譜系的群體演化分數(PES)評估生成能力,檢驗一個提案能否作為給定譜系群體的連貫後代插入:它應繼承正確的Idea Genome物件、與鄰近工作有意義地差異化,並為未來研究提供選擇價值。在14個基於LLM的科學家系統上的實驗揭示了一個組合性瓶頸。最強的系統在譜系推理上僅達到27.3%的精確準確率,且結構化的譜系背景會重新洗牌系統排名,而非均勻地幫助所有參與者。
從稀疏事件流中恢復高質量視頻是一項具挑戰性的任務。回歸方法常導致紋理模糊,而現有生成模型則難以維持長期穩定性。我們提出 LongE2V,一種新穎方法,利用預訓練的視頻擴散先驗共同處理基於事件的視頻重建、預測與幀插值。透過微調基礎視頻模型,我們的方法實現了高數據效率與卓越的感知質量。我們引入自回歸展開與自適應上下文切換,以減輕極長序列中的時間漂移問題。同時提出跨殘差修正的重新編碼對齊,確保幀插值過程中的精確雙向一致性。此外,事件體素密度增強機制保障了跨不同傳感器解析度的穩健性。在真實世界基準上的大量實驗表明,LongE2V 在三項任務中均優於最先進方法,展現出卓越的時間一致性與零樣本泛化能力。項目頁面:https://cdfan0627.github.io/LongE2V-page/
在本研究中,我們提出 Canvas360——一個兩階段的情境全景生成框架,結合幾何感知預訓練與下游任務特化微調。為解決缺乏針對情境全景任務的大規模高品質訓練資料之難題,我們建構了 Canvas360Dataset,包含100萬組高品質配對全景樣本,涵蓋風格轉換、修補、擴展與編輯等任務,能在多樣的情境生成場景中提供有效監督。在建模方面,Canvas360 透過並行深度生成、速度循環填充與相似性損失正則化強化文字至全景生成能力,使模型學習幾何感知表徵、捕捉物體變形細節,並增進幾何一致性與全局連貫性。此外,憑藉強大的全景先驗知識,Canvas360 實現統一的情境全景生成框架,透過詞元層級串接支援多樣下游任務,在任務覆蓋率與建模靈活性上均超越先前方法。大量實驗顯示,Canvas360 能提升全景影像真實度,特別在全景專屬 FAED 指標上表現優異,並在報告的各項量化評估中取得具有競爭力或領先的成果。更多資訊請參閱我們的專案頁面:https://zry000.github.io/Canvas360/
当前用于药物设计的计算方法通常专注于生成以特定靶点或通用分子性质为条件的分子,往往忽略了疾病背景对靶点行为及治疗效果的影响。为弥补这一不足,我们提出DrugGen-2——一种新型生成模型,能够同时以疾病本体论和靶点蛋白序列为条件设计小分子。DrugGen-2通过在包含已批准药物及其关联疾病与靶点的精选数据集上微调预训练的GPT-2模型开发而成,采用了两阶段策略:先进行监督微调,再通过基于群体的相对策略优化(GRPO)进行强化学习。这一过程由优化化学有效性、新颖性、多样性及高预测结合亲和度的奖励函数指引。在针对糖尿病肾病相关的五个蛋白靶点进行评估时,DrugGen-2显著优于基线模型(DrugGPT与DrugGen)。它展现出更强的生成独特分子能力,与已批准药物具有更高的结构相似性,并在所有靶点上实现了更优的预测结合亲和度。分子对接分析进一步佐证了这些发现,识别出具有强结合潜力的候选配体,其中包括预测亲和度(-9.917、-9.485及-9.367)超过参考药物(如血管紧张素转换酶抑制剂依那普利的-8.283)的化合物。通过将疾病特异性背景融入分子生成过程,DrugGen-2推动了AI辅助药物发现的发展,为考虑疾病与分子靶点间复杂相互作用的从头药物设计及药物重定位提供了强大工具。
行動裝置上日益增長的圖像轉影片生成需求,越來越聚焦於電影級動態效果,如子彈時間、推軌縮放、慢動作等。儘管擴散變換器(DiTs)在影片生成方面表現出色,但其龐大的參數量與多步驟迭代去噪過程導致巨大的運算開銷,使得在行動裝置上實現高效生成極具挑戰。我們提出CineMobile以填補此鴻溝。具體而言,CineMobile採用三重優化策略:(1)利用蒸餾引導剪枝方法,推導出一個精簡而高效的模型,同時保留電影效果所需的核心影片生成能力;(2)透過擴散蒸餾與強化學習的結合,將壓縮後的模型優化為4步生成器;(3)採用混合訓練後量化策略,將模型大小壓縮至1 GB以下。實驗結果顯示,相較於採用Wan 2.1架構的教師模型,CineMobile在生成速度上實現40倍加速,同時保持可比的視覺品質。具體而言,CineMobile在NVIDIA H200 GPU上生成49幀480p影片時,每步去噪延遲為0.6秒;在聯發科天璣8400 Ultimate 5G平台上,則為20秒,峰值記憶體使用量為1.8 GB,證明了其在行動裝置圖像轉影片生成中的實際應用可行性。
現代大型語言模型(LLM)日益被部署於長上下文應用中,例如檢索增強生成、倉庫級程式碼編寫,以及代理型工作流程——這些場景中累積的推理與工具痕跡常使輸入長度超過預訓練窗口一個數量級,因此零樣本上下文擴展成為開放權重模型的主要部署路徑。現有的大多數零樣本方法會在事前固定單一重新縮放因子,導致激進的因子犧牲短上下文忠實度,而保守的因子則在長上下文時失效。我們提出Jet-Long,一種免調參的零樣本方法,其結合一個局部RoPE忠實窗口與一個長程窗口,後者的重新縮放因子會根據當前序列長度動態調整,從而在短輸入時精確還原基礎模型,並在長輸入時乾淨地進行外推。透過包含-排除注意力合併與即時RoPE校正旋轉,此雙焦點結構在推論時幾乎沒有額外成本;將其融合為單一CuTe內核後,長上下文預填充在H100上可達1.39倍FA2的吞吐量(接近僅限Hopper的FA4),且單批次生成在所有長度下僅增加不超過4%的開銷。在Qwen3-1.7B/4B/8B模型上,於128K上下文範圍內,Jet-Long在1.7B/4B/8B規模下分別比最強基線高出+4.79/+2.18/+2.03個百分點的RULER分數,在HELMET-RAG(被HELMET認定為預測下游長上下文表現最有效率的基準)上達到整體最佳準確率,並取得最低的PG-19困惑度。Jet-Long亦能泛化至混合注意力架構(如Jet-Nemotron),無需重新訓練即可進一步改善長上下文表現,且對超參數具有韌性,便於部署。
自注意力机制使每个词元能够从整个上下文检索信息,但其在序列长度上的二次方成本限制了长上下文训练与推理。本文对softmax注意力与四种近期提出的循环线性注意力架构进行了比较研究:DeltaNet、门控DeltaNet、Kimi Delta注意力与门控DeltaNet-2。我们采用统一的循环记忆表示法对这些机制进行表述,明确揭示了它们在表达能力、记忆衰减、擦除与写入控制、训练吞吐量以及实现复杂度方面的差异。实验以15B词元训练的350M参数模型为核心,涵盖了优化器与学习率比较、混合堆叠与纯堆叠对比、序列长度运行时间测量、1.3B与3B参数规模下的更大DeltaNet运行实验,以及少量下游任务评估。文中报告的速度结果衡量的是训练吞吐量与迭代时间,未提供推理速度的经验基准。在报告的350M参数、15B词元调优范围内,采用Muon优化器的Kimi Delta注意力达到了最低的最终验证损失;使用AdamW训练的纯门控DeltaNet堆叠实现了最高归一化训练吞吐量;混合堆叠通常以吞吐量成本换取损失改善;而在我们评估的匹配架构设置中,Muon相对于AdamW始终能降低最终验证损失。我们引入并评估了面向DeltaNet风格记忆的轻量级跨层路由机制。最自然的基于DeltaNet的构想——将下层的delta规则写入误差转发至上层值目标——并未超越匹配基线。而将路由导向对齐的隐藏流并转发写入值则在所报告的匹配运行中带来了适度改进:跨层值路由(CLVR)同时降低了DeltaNet与门控DeltaNet的最终验证损失。
強化學習(RL)已成為提升大型語言模型(LLMs)複雜推理能力的標準框架。為實現樣本效率,現代 RL 框架依賴於重要性採樣(IS)。然而,這類演算法面臨探索與穩定性的兩難困境:純粹的 IS 常導致災難性的訓練不穩定,而為緩解此問題所使用的標準裁剪機制則嚴格限制了策略更新預算。透過形式化「概率容量」(Cap)概念,我們揭示出保守的裁剪機制會過早截斷正確但低置信度推理路徑的更新預算,從而在結構上抑制探索。為突破這些限制,我們提出「無界正向非對稱優化」(UP),這是一種通用且即插即用的目標函數。UP 透過停止梯度運算元將策略錨定於當前狀態,從理論上重構優化過程。此非對稱設計能為正向優勢提供未經裁剪的穩定梯度,以最大化探索能力;同時對負向優勢保留標準裁剪機制,以防止訓練不穩定。此外,我們的公式可輕鬆擴展至不同優化粒度,包括詞元層級(GRPO、DAPO)與序列層級(GSPO)框架。大量實驗證明,UP 能增強探索能力,並在多元 RL 演算法(DAPO、GSPO 及 GRPO)、模型架構(密集、混合專家及視覺語言)以及訓練模式(語言與多模態)中獲得優越的推理準確率,驗證了 UP 作為基於 RL 訓練的通用即插即用增強工具之有效性。
在長時程任務中,與決策相關的狀態往往散落在不斷擴展的軌跡中,而行動代理必須將其提取並加以執行。隨著軌跡增長,任務要求、環境事實、先前的嘗試、診斷結果以及未完成的子目標可能被埋沒在上下文視窗內,甚至被推至視窗外,從而在需要時無法影響決策。我們將這種失效模式稱為「行為狀態衰減」。本研究將記憶視為一種主動干預機制,而非被動檢索。一個獨立的記憶代理與未經修改的行動代理並行運行,從近期軌跡中更新結構化記憶庫,並決定是注入一則基於記憶的提醒還是保持沉默。該模組可即插即用於前沿行動代理與現有代理框架中。在 Terminal-Bench 2.0 與 τ^2-Bench 上,此方法分別提升了較弱與較強行動代理的 pass@1 指標,在 Terminal-Bench 上提高 8.3 個百分點,在 τ^2-Bench 上提高 6.8 個百分點。消融實驗顯示,選擇性干預優於被動記憶庫暴露、持續注入、僅顧問式指導以及一般檢索。作為朝向開放權重記憶策略的初步嘗試,我們使用監督式微調與群組相對策略最佳化在 SETA 上訓練 Qwen3.5-27B,提升了驗證獎勵,並在 Terminal-Bench 上實現了部分遷移。
磁振造影超解析對於提升診斷可近性至關重要,然而多數方法將其視為從固定低解析度輸入到高解析度目標的確定性映射。這種做法忽略了磁振造影成像物理的一項關鍵特性:空間解析度與訊號雜訊比本質上相互耦合,使得任何給定的低解析度掃描僅是在不同成像權衡下眾多可能實現之一。我們將磁振造影超解析重新構想為一個物理感知的重建問題,其目標在於辨識出最優的解析度-訊噪比配置,進而透過超解析獲得高品質磁振造影結果。此架構的一項關鍵含義在於,磁振造影解析度將成為動態而非固定的。為處理此類解析度異質性輸入,我們將二維高斯潑濺法(2D GS)改編應用於磁振造影,將重建問題表述為基於座標、無關解析度的渲染問題。為進一步提升保真度,我們引入三項創新:(1)先驗感知高斯表示法,結合「解剖結構先驗」用於組織特異性核初始化,以及「成像系統先驗」透過共變異數字典捕捉硬體特性;(2)物理約束訊號建模方案,可預測內在組織參數(質子密度ρ與有效弛豫率R₂),並透過支配物理方程式合成訊號強度,確保生物物理上合理的對比;(3)元學習框架,透過在模擬資料上預訓練並適應真實世界條件,減輕成對資料稀缺問題。在動態解析度資料集與標準基準上的大量實驗證明,我們的方法達到了最先進的表現,突顯其在臨床部署上的強大潛力。
文本到圖像生成中的推理時間擴展已從簡單的最佳N採樣(BoN)發展到引導式搜索方法,此類方法在中間去噪步驟中驗證並引導候選軌跡。這些方法專注於去噪過程中何時及多頻繁進行驗證,但很大程度上將生成過程本身的成本視為固定值。此外,標準的比較方法根據函數評估次數(NFEs)僅計算去噪前向傳遞,而忽略驗證器的開銷,這可能扭曲效率排名。我們證明,在掛鐘時間評估下,簡單的BoN已能匹配或超越多種引導式搜索技術,表明計算資源更應投入於廣泛探索,而非反覆的中間驗證。這促使我們提出Flash-BoN,其通過結合三種互補的加速手段(時間步長截斷、層跳越、激活代理),並針對每個模型一次性優化配置,生成大量低成本的草稿候選。隨後,高效的多階段驗證程序可識別最有潛力的草稿,並以完整質量進行精煉。在三項基準測試與三種模型規模下,Flash-BoN在固定掛鐘時間預算內持續優於所有基線,且優勢隨模型規模擴大而增長(AUC提升+8%)。我們進一步證明,此策略能與現有的正交技術(如基於反射的提示優化,AUC提升+16%)良好結合並加以改進。性能提升與候選多樣性增加相關,這也使草稿引導選擇能加速強化學習後訓練的收斂。
語義音頻應用日益需要在普通硬體和嵌入式硬體上實現可控生成,而非透過框架繁重的資料中心堆疊。我們提出 aria,一個無依賴的原生執行時,可在普通 GPU、僅 CPU 的機器以及 Raspberry Pi 5 上運行 Stable Audio 3 (SA3) 的完整文字轉音樂流水線,底層無需 Python 或深度學習框架。我們的主要貢獻是對量化的研究:以更低數值精度運行模型以適應緊張的記憶體預算,就地節省記憶體而非增加記憶體。由於執行時擁有所有內部張量,它還暴露了激活引導(activation steering),一種低成本引導模型生成內容的方式。我們透過輸出的三個獨立衡量指標(提示遵循度、整體音頻品質、品味保持度)來評判品質代價,每個指標均與隨機種子間的普通變異進行比較。八位精度在任何指標上均未顯示可測量的品質損失,同時大幅削減記憶體,並且是 GPU 上最快的模式;四位精度則增加了一個較小且有界代價,但足以將參數量達 12 億的模型壓縮至可在 8 GB 的 Pi 上運行。與官方實現相比,aria 的生成速度相當或更快,且啟動速度快約七倍。一個關於引導介面的案例研究生成了帶有品味關聯(聲音調味)的音樂,對部分屬性具有真實但有界的控制。這些結果使得緊湊、量化且內置控制的執行時成為物聯網聲音環境中設備端語義音頻的實用基礎。aria 執行時已在 https://github.com/matteospanio/aria 發布。
大型語言模型(LLMs)正日益成為整合型的數據科學代理,將抽象推理與進階工具使用相結合。然而,相關的基準測試領域大致上分裂為兩類:一類是缺乏真實數據分析的符號因果推理基準,另一類則是缺乏具備原則性因果數據生成結構的數據分析基準。此外,現有的因果評估資料集通常僅來自既有來源的精心挑選範例,其多樣性來自有限的模板化變異,而非系統性地生成新穎的合成因果結構。我們提出 CausalDS,這是一個用於評估代理型數據科學工作流程中因果推理能力的基準測試。每個基準測試案例(scene)包含一個取樣自結構因果模型(SCM)的場景,並附有生成的觀測數據,以及一個植基於真實領域的合成自然語言故事。我們可選擇性地將基準測試元件的組成,奠基於從真實世界資料集中獲得的經驗分布,從而在完全合成生成的過程中,保留經驗結構,同時降低「因果鸚鵡」的風險。從每個場景中,我們推導出涵蓋 Pearl 所有三個階層的任務,其中典型的數據科學預測任務歸屬於第一階層。多數任務包含數據科學編碼環節,模型通常需要使用多種工具才能得出最終答案,這是因為任務中經常存在由觀測模型生成的不完美觀測。此外,辨識出問題何時無法得出有根據的答案並予以棄權,會被視為一項有明確評分的結果。因此,該基準測試同時評估了符號因果推理、數據科學、不確定性量化、棄權判斷以及工具使用/編碼能力。
在一类称为峰值电路的量子电路中,目标是预测电路输出端最可能出现的比特串。由于此类电路的设计使其输出分布呈现尖锐峰值,理论上应可借助包含有限数量项的截断态向量(即占总概率质量的一部分)对其进行模拟。这种近似模拟可在经典计算机上通过稀疏表示实现——仅存储态向量中的非零振幅,而非多数量子模拟器常见的密集表示。为提升效率,对态向量的所有操作应尽可能实现矢量化,并在可用时利用硬件加速。本文描述了如何在开源实现中达成这些要求,并讨论其性能与局限性。
現代影片物件分割(VOS)涉及追蹤並分割使用者指定的目標。儘管近期方法在單目標場景中已展現卓越表現,將其擴展至多目標設定時,通常需為每個個別目標複製單目標處理流程,導致隨著目標數量增加,畫面更新率(FPS)下降且延遲無上限。基於分割一切 2(SAM2),我們提出 SAM-MT,透過將模型轉化為即時多目標影片分割的互動式框架來解決此問題。SAM-MT 使用顯式查詢來表示不同個別目標,並同時以共享表徵處理全域上下文。它採用解耦遮罩注意力機制,以維持個別身份不受跨目標干擾,並利用稀疏記憶體實現穩定的時序演進,同時針對遮擋處理與重疊預防設計專門策略。SAM-MT 成功將延遲與目標數量脫鉤,實現與單目標基準相當的即時速度(對 10 個目標達 >36 FPS),同時維持 SAM2 穩健的影片分割表現。
阿拉伯语自然语言处理面临的一个关键挑战是,相较于现代标准阿拉伯语(MSA),方言数据的稀缺性,这导致大语言模型(LLMs)过度生成MSA,而难以生成准确符合方言特征的文本。从可解释性的角度来看,这引出一个根本性问题:方言特征在模型内部编码于何处、如何编码,以及这些表征能否在不进行微调的情况下用于改进方言生成?本研究探讨了两种互为补充的推理阶段方法,这些方法同时充当可解释性探针和控制机制。首先,我们进行神经元层级的分析,识别出编码方言特定特征的稀疏神经元群体,并证明放大或抑制这些神经元可以将模型输出导向目标方言。其次,鉴于方言特征在单神经元层面存在纠缠现象,我们应用一种向量引导方法,提取方言特定的激活方向,并在推理过程中注入这些方向。综合来看,这些方法揭示了阿拉伯语大语言模型中方言知识的空间结构特征,并提供了一个基于可解释性的原则性框架,用于在不经方言特定微调的情况下实现方言控制。
我們介紹PAST-TIDE,這是一個立場檢測系統,旨在解決NakbaNLP@LREC-COLING 2026的StanceNakba共享任務中的兩個子任務。核心思路是語句微調。我們將立場重新定義為完形填空式的遮罩語言模型(MLM),透過詞彙映射器將標籤詞對應到立場類別,並利用預訓練的MLM頭部,而非附加隨機初始化的分類頭部。我們進一步結合原型對比學習,該方法使用可學習的類別原型進行獨立於批次大小的對比訓練,並採用主題條件層正規化來處理跨主題的阿拉伯語立場檢測。PAST-TIDE在官方排行榜上分別於子任務A和子任務B達到0.75和0.74的巨集F1分數,顯示在低資源環境中,對預訓練模型進行最小的架構調整仍能保持競爭力。