每日精選AI研究論文及翻譯
學習可部署的操作策略面臨瓶頸,原因在於同時具備高保真度與可擴展性的資料極為稀缺。真實機器人遙控操作精準但擴展成本高昂;無機器人UMI資料收集則易於擴展,現行實務主要將所得資料用於預訓練,並在後訓練階段加入少量真實機器人資料作為「錨點」。我們探討:提升無機器人UMI資料的保真度(而非縮減真實機器人資料比例),是否能移除該錨點。我們提出HiFi-UMI,這是一套可攜式UMI資料生產系統,針對軌跡精度、夾爪間相對位姿、同步性與視野共同設計:頭戴式離線立體慣性SLAM、原生而非重建的相對位姿、共享微秒級GPIO觸發器,以及每隻手配備兩顆涵蓋約200度的廣角攝影機。該系統在無外部追蹤基礎設施下,可達到工作空間內末端執行器3公釐的局部精度。利用此資料庫,我們展示零機器人後訓練:僅以HiFi-UMI示範資料進行後訓練的策略,可直接部署於真實機器人,並在三個涵蓋視覺-語言-動作與世界-動作模型系列的骨幹架構上,與領域內遙控操作表現相當——在StarVLA-QwenPI、OpenPI-pi_0.5與LingBot-VA上的成功率差異分別為-2.5、+3.1與-0.6個百分點;最強的策略在一項精密插入任務上達到85%的成功率,儘管遙控操作基準線是在評估場景中收集的,而無任何HiFi-UMI軌跡來自該場景。使用同一資料庫中4,000小時的資料進行預訓練,在十項未見過任務上的動作誤差降低了41%,並在StarVLA-QwenPI上進一步將真實機器人成功率提升18.1個百分點。我們開源HiFi-UMI-2K,包含2,000小時微秒同步、超廣視野的示範資料,每段資料皆自動重建並透過模擬重演驗證,為機器人學習社群提供大規模、高保真度的資源。
相关性是一种依赖于查询的估计方式,用于判断文档或摘要是否包含有用证据。现有检索代理利用相关性选择top‑k内容,但仅凭文档相关性无法对复杂问题所需的证据进行定位、组合或验证。直接语料交互(DCI)通过grep式的探索实现此类细粒度操作,然而其与相关性无关的搜索方式可能延迟暴露有用线索,从而拖慢收敛速度。最新研究利用相关性将语料库收窄为交互工作空间。一旦交互开始,相关性仍无法直接指导grep优先搜索哪些文档,也无法从大量匹配项中区分出信息丰富的摘要,使大语言模型优先看到它们。我们提出相关性感知的RipGrep搜索代理(RARG),它将相关性转化为语料库交互的执行先验。RARG提供由粗到细的相关性引导:它对文档进行排序以实现顺序式ripgrep遍历,从而更早暴露全局相关的线索;用与查询相关的段落初始化有前景的入口点;并对grep匹配结果进行重排序,以呈现文档级排名可能掩盖的信息丰富摘要。在具有挑战性的浏览式问答和推理密集型检索任务中,RARG在准确率‑效率前沿上超越了基于检索的代理和直接交互代理。这些结果表明,相关性感知的交互能够实现更快、更可靠的搜索收敛。
編碼代理反覆搜尋、導航並從持續演進的儲存庫中保留上下文,但中斷的索引、語言伺服器以及任務本地的歷史記錄,迫使代理重複發現並掩蓋生命週期成本。CodeNib 為每個儲存庫提交建立了可重複使用的詞彙、密集及結構化視圖,將輸出對應至儲存庫相對應的源範圍,在編輯過程中維護選定視圖,並透過單一執行環境提供排序搜尋、符號導航及有限上下文服務。 在 100 個快照中,我們繪製了儲存庫上下文生命週期中的品質-成本邊界。當輸出與獨立重建相符時,圖形與向量更新的中位數速度分別提升 8.7 倍與 25.4 倍。在靜態導航子集(與標準化即時伺服器位置匹配,佔 1,000 個請求的 63%)中,每個請求的即時/靜態延遲中位數比率為 4.7 倍。在五個模型中,選定的上下文策略保存了定位能力,同時比配對的 grep/read 減少 50% 至 87% 的軌跡令牌。總體而言,這些結果支持具有明確、操作特定有效性邊界的多視圖儲存庫上下文服務。
从栅格图像中恢复可编辑设计文件,是现代设计工作流中常见且代价高昂的瓶颈,但由于可编辑性依赖于恢复多模态属性(如排版、矢量几何、颜色、分组及图层顺序),这项工作至今仍具挑战性。我们提出ReDesign——一种智能体框架,通过跨模态选择并组合专用工具,逐步构建可编辑的图层层次结构。为使这一长程决策过程在工具输出不完美时仍保持可靠性,我们在每次扩展环节引入优雅验证机制,通过局部接受、修剪或重试反馈,防止错误累积且避免大规模重运行。为在大规模场景下评估可编辑性,我们提出了Figma编辑回放基准测试(Figma Edit Replay Benchmark),包含909个原始Figma文件与14,796条受控编辑指令,可在重建输出上回放编辑操作。在该基准测试及标准重建指标上,ReDesign在实现高视觉保真度的同时,在布局、颜色和文本编辑方面均展现出最优的可编辑性,性能优于基于层次分解的基线方法及串行工具调用管线。
在策略蒸馏(OPD)将词元级别的监督建立在学生自身轨迹之上,却受困于前缀失败问题:一旦学生走向错误推理方向,后续所有生成都建立在该偏差之上,产生方向错误的延续内容,不仅引发不可靠的监督,还浪费计算资源。我们识别出失败前缀上存在师生延续不对称性——教师倾向于重新引导方向,而学生则沿原方向继续——并将其转化为接力在策略蒸馏(Relay-OPD)中无标签的交接触发信号。训练时,Relay-OPD 通过让教师在检测到的触发点短暂接管以生成一段教师轨迹,随后学生继续生成并在整条接续轨迹上接受优化,从而构建接力轨迹。有限的接力预算将干预集中在关键的早期位置,同时限制与学生策略的偏离。以 Qwen3-4B-Instruct-2507 为教师、Qwen3-0.6B/1.7B-Non-Thinking 为学生模型,在八个数学推理基准上,Relay-OPD 在每个基准上均取得最佳或次佳结果,在 1.7B 模型上平均超越标准 OPD 5.73%、超越最强基线 FastOPD 1.49%,在 0.6B 模型上亦持续取得提升。训练轨迹长度减少超过 50%。
長期記憶系統將使用者所言儲存於外部儲存器中,並在相關查詢到來時將其檢索出來。此類介面基於一個極其自然以致鮮少明言的假設:所需的記憶將與需要該記憶的查詢相似。世界知識打破了這一假設。樹堅果過敏本應透過馬卡龍中的杏仁粉成分改變對馬卡龍請求的回答,然而這兩段文字之間並無檢索器可見的線索。我們將此種失敗模式稱為「隱含關聯盲點」,並引入InMind——一個涵蓋125項任務、經專家驗證的基準測試,橫跨十個生活領域,其中113項任務奠基於可引用的公開來源。其配對對照組將現有評估中混淆的三種解釋區分開來:事實從未被儲存、模型缺乏橋接知識、或事實已被儲存但從未浮現。結論清晰明確。當關鍵記憶置於上下文中時,骨幹模型能回答84.0%的間接查詢;而當同一記憶必須被檢索出來時,六個向量、圖及智能體記憶系統的表現最多僅達14.4%,儘管它們按需回憶相同事實的準確率可達100%。嵌入維度提升八倍雖能提高每個系統的無答案目標召回率,但差距基本保持不變。一種在查詢到達前保持記憶可見的最小診斷探針,恢復了大部分差距,將失敗定位於查詢條件介面本身,並指向路由——決定哪些事實必須保持可見——作為InMind旨在評分的開放問題。
标准视觉-语言模型(VLM)面临莫拉维克悖论:它们擅长复杂的离线视觉推理,但在简单的流式感知任务上表现不佳且处理效率低下。我们提出Mage-VL,一种高效的编解码器原生流式基础模型,专为实时多模态理解与交互设计。其核心在于自定义分词器Mage-ViT,该分词器通过利用运动向量和残差能量,在稀疏锚点帧(I帧)和预测帧(P帧)上选择性编码动态、高熵区域,取代均匀帧采样。在16×16块级别上运行时,该技术将视觉令牌消耗降低超过75%,同时保留时空上下文。Mage-ViT从头训练于约5.6亿张无标签图像和1亿个无标签视频帧,其性能匹敌或超越在数十亿图像-文本对上训练的旗舰编码器。我们建立了AI4AI数据管道,涵盖提示词-代码联合优化的多模态描述生成,以及AI驱动的性能诊断以指导训练策略。此外,通过受生物启发的双系统架构——轻量级系统1事件门控与因果系统2解码器——Mage-VL实现了主动式流式感知。大量评估表明,Mage-VL-4B在静态任务上与Qwen3-VL-4B性能相当,同时在视频理解与2D/3D空间推理上取得显著提升,推理速度提升高达3.5倍(墙钟时间),并全面超越15B参数的Phi-4-reasoning-vision基线。除模型本身外,我们贡献了七项关键实证发现,涵盖预训练数据效率、可变分辨率缩放、编解码器系统加速、VideoQA SFT冗余性、运动-空间协同、AI4AI数据管道,以及用于多模态强化学习的零视觉微调(Zero-Vision SFT)。
我們提出 Wonder,一個通用的影片世界模型,用於即時、可控制相機的世界探索。給定一張影像或一段條件影片,Wonder 建構一個可遊玩的世界,使用者可透過移動相機進行互動式導航,即時且長期地探索未見區域,並重新造訪先前觀察過的地方。實現此能力需要系統層級的控制方法、記憶機制與訓練策略的協同設計。我們提出一種新穎的相機條件控制方法,利用密集座標場的渲染結果提供空間對齊的運動與方向線索,使模型能將相機運動直接解讀為視覺證據。為支援在不斷增長的生成上下文中的快速且精確的記憶檢索,我們提出一種基於稀疏注意力機制的有效記憶方法,使模型在推理時能根據實際上下文長度,選擇性地關注少量相關的上下文標記。我們進一步開發多項技術來修正自強迫式蒸餾流程,提升學生模型遵循控制訊號的能力,並維持教師模型的多樣生成模式與長期記憶。這些元件共同使 Wonder 能以每秒 16 幀的速度合成多樣、長達數分鐘的影片,同時在長時間推演中保持一致的幾何、外觀與動態。除了影像到影片的生成,Wonder 也自然支援影片條件生成,允許即時重新拍攝現有的動態場景。
在基础模型时代,模型性能与其提示质量成正比。因此,提示工程已成为提升语言模型性能的关键技术。鉴于视频模型正逐步成为视觉基础模型(如视觉推理),我们在此探究视觉提示工程是否能为其带来类似增益:通过自动优化任务图像来提升模型性能。例如,在视觉物理推理任务("球体穿过障碍物后将落在何处?")中,抽象草图场景可通过简单调用图像编辑模型转换为逼真版本。研究发现,视觉提示工程(简称VIPE)能全面提升视频推理任务的表现。事实上,对于视频模型而言,视觉提示工程甚至比传统文本提示工程或测试时缩放更为有效。最终,正如文本提示工程系统性地提升语言模型性能那般,视觉提示工程可作为一种简洁高效的计算方案,有效激发视频模型更优的视觉推理能力。项目页面示例视频请访问:https://visual-prompt-engineering.github.io/。
我們推出 Shieldstral,這是一個擁有 30 億參數的政策自適應多模態安全分類器。在文本安全基準測試中,其表現與規模近七倍的模型相當或更優,並在多模態安全分類領域樹立了新的技術標杆。Shieldstral 將內容審核形式化為二元問答任務。這種簡潔的表述將多樣化的審核任務統整為單一的「是/否」問題,使具備不同分類架構的異質安全資料集能在同一訓練框架下整合。我們詳述資料建構方法,涵蓋約 5,410 萬筆樣本的策劃與生成,以及用於評估政策適應性的細粒度評估集。這些要素共同使一個小型自適應模型能與規模大得多的模型匹敵甚至超越。
我們提出了PerceptionBench,這是一個專門設計用來評估多模態大型語言模型(MLLMs)原子視覺感知能力的基準測試。現有的基準測試往往無法孤立地評估感知:整體評估將感知錯誤與推理或領域知識的失敗混為一談,而應用導向的基準測試僅涵蓋由啟發式設計形成的狹窄且零碎的領域。為了解決這些限制,PerceptionBench採用自下而上的方法:透過診斷前沿MLLMs在42個現有基準測試中回應的最早失敗點,我們建立了一個錯誤分類體系,其感知分支定義了十項原子感知能力。在此分類體系的引導下,我們建構了3,000個經過驗證的問題,每個問題具有簡短明確的答案,且各自獨立測量單一能力,其難度源自感知而非推理或知識。在十六個前沿MLLMs上的基準測試結果顯示,原子感知在很大程度上仍未獲得解決——沒有模型達到60%的準確率,與感知相關的幻覺是平均表現最弱的能力,而相似的整体分數掩蓋了截然不同的能力輪廓。因此,PerceptionBench為衡量和診斷MLLMs的視覺感知邊界提供了能力層面的標準。
多模態自動事實查核(MAFC)透過檢索並推理外部證據來驗證主張。然而,現有靜態基準大多存在污染風險:它們主要由過時的主張構成,這些主張僅需利用大型語言模型(LLM)的內在知識即可驗證,無需外部證據。這可能高估效能估算,無法真實反映模型在處理需要最新資訊的新穎主張時的能力。為解決此問題,新興的動態基準收集在LLM知識截止日期後發布的主張,假設其未被污染。本研究重新審視此假設,透過實驗探討最先進(SOTA)靜態基準AVeriTeC與我們新建構的動態基準ClaimReview2025Q4中的污染風險,及其對MAFC評估的影響。實驗得出16項發現,凸顯三大關鍵結果:(1)動態評估雖降低但未消除污染風險,截至截止日後仍有17.09%–29.30%的主張可能受污染;(2)許多新發布的主張可直接驗證,或透過綜合截止日前已公開的多項知識進行驗證;(3)污染可能導致MAFC效能出現統計顯著的高估,使宏觀F1分數最多提升11.34個百分點,並扭曲系統排名。基於這些發現,我們在嚴格控制的無污染環境下重新評估SOTA LLM。本研究為可信的MAFC評估提供實務指引。
任意到任意模型能够在一个统一网络中,根据任意其他模态的组合预测任意模态,这种范式常用于多模态视觉与视觉-语言模型,并逐渐扩展到生态学、天文学等科学领域。现有的任意到任意模型通常采用编码器-解码器或扩散架构从零训练,这限制了其性能,且无法利用强大的预训练仅解码器模型作为先验。本研究探索了基于仅解码器的任意到任意多模态建模方法,该方法对称处理所有模态,支持任意模态作为输入和输出,无需特定模态的解码头、损失函数或任务流程。由于每种模态同时是该模型的输入和输出,所提出的模型命名为Modus,能够支持多种应用场景,例如通过中间模态实现链式生成,或通过利用另一生成模态对模型自身输出进行评分来实现跨模态自验证。Modus模型开箱即用性能强大,在多个基准测试中仅凭单一模型即可与专家模型和多任务基线模型相媲美。所有材料已开源至 https://modus-multimodal.epfl.ch/。
影片擴散或流模型中的生成因取樣過程緩慢且迭代而計算成本高昂。當前最先進(SOTA)的加速方法高度依賴變分分數蒸餾(VSD)與對抗性損失,將擴散模型蒸餾為少步生成器。然而,這類訓練損失雖能生成高品質影片,卻因難以優化且易發生模式崩潰而聲名狼藉,導致影片多樣性喪失及動態不足。本文提出並行解碼蒸餾(PDD),一種簡化且可擴展的基於軌跡蒸餾方法,用於加速擴散與流匹配模型的推論。我們的架構與訓練流程可適用於任何預訓練模型,並支援不同函數評估次數(NFE)的取樣。PDD透過在每次網路評估中預測多個去噪步驟來加速生成。概念上,它學習平均速度的表示,而無需使用雅可比向量積(JVPs)或有限差分近似來回歸其導數。我們的方法在LTX-2.3文字轉影片/音訊、Wan 14B文字轉影片及Qwen-Image文字轉圖像上,以4-8 NFE達到SOTA性能。此外,PDD在生成影片的多樣性方面展現了顯著提升。
用於程式碼正確性的強化學習現在已確立:讓模型生成程式,對照隱藏測試案例執行,並獎勵通過的解。將此概念擴展至程式碼最佳化看似直接:只需將執行時間加入獎勵。然而在實務中,一旦時間驅動獎勵,測量雜訊、獎勵稀疏或 GRPO 不穩定性等小問題便會壓過訊號,使強化學習失敗:生成程式碼幾乎沒變快,且更多程式會失敗。我們透過三個階段讓執行時間成為可學習的目標:(1) 程式碼的測試方式——建構 DMC-Optim,搭配大型最佳化測試與校準後的沙盒;(2) 速度如何轉化為獎勵——在強化學習環境中組合正確性與速度,並使用離線模擬器預測最有潛力的配置;(3) 模型從該獎勵中學習的方式——調整 GRPO 與評估方法,以適應更稀疏、更具雜訊的計時執行環境。在 DMC-Optim 上,最佳的最佳化感知配置將 Qwen 2.5 7B 的嚴格前 50% pass@1 從 18.0% 提升至 31.3%,CWM 32B 則從 30.7% 提升至 50.4%。這些提升在更嚴格的百分位(如前 30%)進一步擴大,CWM 32B 的相對進步達 125%,同時保留了純正確性分數。當計時沙盒品質下降時,穩健的最佳化強化學習依評估標準不同,較標準 RLVR 提升了 100% 至 200%。在 LCB 上,CWM 32B 在基於中位數樣本的速度比較中,對上標準 RLVR 最高可贏得 83%。相較於每位問題最快的正確人類提交,其複雜度類別提升率約為人類的一半(14% 對 28%)。
新興的全模態大型語言模型(OmniLLMs)能實現對文字、音訊與視訊的統一理解,但其長長的音訊-視訊令牌序列帶來了巨大的記憶體與推理成本。現有的壓縮方法主要聚焦於在固定預算下選取重要令牌,而忽略了前置的預算分配問題。我們證明,直接以查詢與音訊/視訊之間的相似度進行跨模態預算分配並不可靠,且均勻的模態內預算可能遺漏關鍵證據,同時保留冗餘內容。為解決這些限制,我們提出 OmniDelta——一種免訓練、基於技能驅動的框架,將意圖感知的跨模態分配與內容感知的模態內分配相結合。OmniDelta 首先構建音訊與視訊技能池,根據查詢需求調整固定的保留令牌預算,再透過局部複雜度與時間冗餘性將模態預算重新分配至音訊片段與視訊幀。最終得到的局部預算可與現有剪枝策略結合,在改變預算花費位置的同時保留總保留令牌比例。在兩個 Qwen2.5-Omni 模型上的四項音訊-視訊基準測試結果顯示,OmniDelta 在各剪枝比例下建立了全新的準確率-效率帕累托前沿。在 Qwen2.5-Omni-7B 模型上保留 25% 令牌時,OmniDelta 相較於全令牌推理可減少 22.0% 的 GPU 記憶體,並實現 1.64 倍的端到端加速。
使用强化学习对参数量在70-500M范围内的小型语言模型(SLMs)进行对齐通常被认为不稳定,但其潜在失败机制尚未得到系统性研究。在最新研究中,通过近端策略优化(PPO)训练了十五个(模型、语料库)配置组合。实验包括在TinyStories、CNN/DailyMail和Wikitext-103语料库上分别训练Pythia-70M、160M、410M以及SmolLM2-135M、360M。在小型语言模型中识别出三种可复现的失败模式:标准PEFT/TRL流程中LoRA参数的静默冻结、使用bfloat16时重要性比率数值溢出,以及由奖励模型误差引发的灾难性策略崩溃。针对这些问题,采用合并与重新初始化的适配器技术、在PPO更新中使用float32精度,以及包含奖励白化、重要性比率防护和权重回滚的三层安全机制加以解决。本文提出容量余量假说,认为PPO在SLM尺度上的性能既依赖于流畅的监督模型(PPL<20),又依赖于具备判别能力的奖励信号,而非模型参数数量。所提系统在所有实验中均稳定收敛,且在具备流畅先验和有效奖励信号的配置中,相较于SFT基线提升了偏好胜率。此外,该系统在显著减少训练数据量的同时,性能优于指令微调基线。所有检查点、偏好数据集及训练脚本均已公开发布^§。
壓縮短文本生成器可能在兩個不同環節失效:編解碼器可能在生成開始前就丟棄資訊,或者潛在生成器可能產生較弱的編碼。若未區分這些失效模式,研究人員可能將計算資源浪費在改進錯誤的組件上。我們在一個由層級式 VQ-VAE-2 編解碼器與遮罩離散擴散生成器(MDLM)構建的控制型 64 對 16 TinyStories 案例研究中探討此問題。我們採用分階段驗證協議,在共享的外部 GPT-2 評分器下分離編解碼器重建保真度、潛在生成品質及輔助潛在診斷指標,同時為幾何研究報告互補的語義指標。在測試配置中,僅編解碼器重建即導致外部困惑度中位數從 15.17 升至 27.36(+80.4%),第 95 百分位數從 25.10 升至 98.91(+294.1%),顯示主要品質損失發生在潛在生成開始之前。在同一評分器下,編碼空間 MDLM 仍顯著優於詞元空間擴散,平均值、中位數及第 95 百分位數分別降低 32.9%、30.9% 及 36.6%。幾何感知正規化改善了局部潛在代理指標,但在現有運行中未提升解碼後文本指標。本文貢獻在於方法論而非演算法:為具體管線提出可重複的分階段診斷方法,並證明在此設定下,編解碼器保真度而非潛在去噪過程設定了實際品質上限。
聯合嵌入預測架構(JEPAs)透過在表徵空間中進行預測而非重建像素來學習世界模型,使其成為從離線示範日誌進行潛在模型預測控制(latent model predictive control)的天然基礎架構。JEPA風格的訓練最佳化短期潛在預測,而規劃則需要根據目標進度對想像中的未來進行多步驟排序。先前的JEPA規劃器通常從嵌入幾何(embedding geometry)繼承該排名,通常是潛在歐幾里得距離(latent Euclidean distance),而這只是表徵學習的副產物,並非從日誌中挖掘出的進度成本。我們提出時序距離JEPA(TD-JEPA),其保留LeWM編碼器-預測器骨幹,並從無獎勵軌跡中挖掘有向時序成本:同軌跡步驟順序提供正目標,跨軌跡配對作為啟發式負樣本,以及一個展開一致性項(rollout-consistency term)以匹配規劃器視野。所挖掘的監督訊號扮演兩個角色:當進度是拓撲性質時,作為部署的規劃成本;以及當接觸幾何主導時,作為改善歐幾里得規劃的表徵訊號。在鎖定評估(locked evaluation)下,部署挖掘的成本將Two-Room的成功率提升至100.0%,相較之下LeWM為97.4%;而在相同時序訓練的檢查點上共享歐幾里得規劃,則使OGB-Cube比LeWM提升14.2個百分點,並改善了Push-T。在鎖定評估下,與LeWM及同期RC-aux基線相比,TD-JEPA在每個環境上都達到或超越了這兩種方法。消融實驗顯示,有向頭(directed head)、跨軌跡負樣本及展開一致性各有貢獻。TD-JEPA透過在離線日誌中發現時序進度結構,並將成本形式與規劃時部署共同設計,從而縮小了JEPA世界模型規劃器的訓練-規劃差距。程式碼已公開於 https://github.com/HKBU-KnowComp/TD-JEPA。
我們提出了一套可重現的流程,能從自由文字格式的漏洞描述,將通用漏洞與暴露(CVE)映射至MITRE ATT&CK企業技術。此流程不依賴於CWE→CAPEC→ATT&CK的推導鏈(我們量化了該鏈中表格擴展所產生的偽影),而是在一份由MITRE威脅知情防禦中心專家所建立、包含1,207個CVE的優質黃金資料集上,訓練一個多標籤分類器。結果顯示,該模型在recall@5上約為零樣本嵌入相似度基線的兩倍,且所有排序指標均有所提升。隨後,我們探討是否可藉助大語言模型輔助標註來擴展黃金資料集。初步實驗呈現矛盾結論:單次實驗顯示效能下降,而對五個隨機種子取平均則顯示小幅提升。然而,經獨立重複驗證及擴展規模研究(增加100至984個CVE)後發現,表面上的改善其實是評估偽影所致。大語言模型生成的標籤與專家標註的一致率約為0.39,在任一擴展規模下均無法提供可靠的改善,且在約新增1,000個CVE時,稀有技術的覆蓋率反而下降(macro-F1降低0.04)。根本原因在於評估雜訊。若在小型測試集上選取檢查點,實質上相當於在多個帶雜訊的評估中最大化結果,導致原本相同的實驗之間recall@5差異可達0.05。根據基於驗證集檢查點選取的正確流程,僅使用黃金資料的模型recall@5為(0.673 ± 0.019);重複關鍵實驗後,確認大語言模型擴展並無顯著效果。最終的規模擴展研究顯示,加入更多專家策劃的資料能持續提升效能,但加入大語言模型標註的資料則否,這表明分類器的限制來自標籤品質而非資料規模。所有資料集、模型、程式碼及訓練記錄均已公開釋出。
不同的研究線路對「世界模型」一詞各有界定,但它們的共同目標是:以支援感知、模擬與規劃的形式,捕捉世界在行動作用下的演化過程。兩種顯著的實現方式分別為:在連續向量空間中學習動力學的神經預測器,以及暴露明確狀態與物理定律的手工建構物理引擎。神經預測器可從數據中規模化學習,但動力學形式隱含其中;物理引擎則可檢視與編輯,卻難以大規模建構。我們提出 VisualPatchWorld (VPW),該方法將世界動力學表示為程式碼。VPW 首先透過短暫主動探測選取定性動力學形式,再從記錄的狀態-行動軌跡中,透過最小化多步預測誤差來擬合該形式的自由參數。所產生的程式可像模擬器一樣向前滾動運算,可檢視原始碼形式,並可用於模型預測控制;影像衍生的場景圖可在重新規劃時提供即時狀態。與先前的基於程式碼的世界模型相比,VPW 平均規劃成功率達 69.0%,並超越最強程式碼基線 23.5 個百分點。最大的提升出現在正確選取定性動力學至關重要的情境中。在同一規劃器下,所誘導的模型在導航與抓取豐富的控制任務上接近真實引擎的成功率;在接觸豐富的推動物件任務中仍存在殘餘差距,而在引擎中檢查少數有前景的規劃方案即可縮小大部分差距。這些結果為自動建構可用於規劃的程式碼世界模型開闢了實用途徑。程式碼見 https://github.com/HKBU-KnowComp/VisualPatchWorld/。
現代的程式碼撰寫代理(coding agents)通常以其最終能否產出正確的修補程式(patch)來評估,但修補程式的生成仰賴於前期的「語境獲取」(context-acquisition)階段:即找出任務所需的儲存庫檔案。我們提出**Agent Retrieval Bench**,這是一個專注於此上游檢索問題的檔案層級基準測試。其樣本來自真實的程式碼工作流程訊號,並針對固定的基準提交版本(base-commit)儲存庫進行評估。相關性(relevance)的定義並非基於查詢與檔案之間的直接語義相似度,而是取決於代理下一步需要什麼。 該基準涵蓋四項正向檢索任務:code2test(程式碼到測試)、comment2context(註解到語境)、trace2code(追蹤到程式碼),以及edit2ripple(編輯到連鎖影響)。此外,第五個子集則利用基於自然證據的「無金標準案例」(no-gold cases)與反事實的「錯誤儲存庫對照組」(counterfactual wrong-repository controls),來評估選擇性檢索能力。 **Agent Retrieval Bench**包含來自25個儲存庫的427個樣本:345個正向範例、50個自然的無金標準範例,以及32個反事實對照組。語料庫涵蓋308個基準提交快照、392,000個檔案,以及790萬個區塊。我們評估了詞彙檢索(lexical retrieval)、RepoMap、開源嵌入模型(open-source embeddings)、選擇性棄權(selective abstention),以及記錄下來的代理語境選擇(logged agent context selection)。 沒有任何單一檢索家族佔據主導地位:在正向樣本上,Qwen3-Embedding-4B 取得了最佳的樣本加權 MRR;Qwen3-Embedding-8B 取得了最佳的 Recall@20;而 RepoMap 則在 8K token 預算下取得了最佳的語境產出率(budgeted context yield)。各任務層級的表現冠軍差異甚大。基於反事實對照組校準的選擇性門檻(selective thresholds),並未改善自然無金標準案例上的選擇性成功(selective success),揭示了校準上的落差。記錄下來的軌跡(Logged trajectories)在 27% 至 35% 的樣本中,遺漏了每一個金標準檔案。 一項受控的初始干預試驗(seed-intervention pilot)發現,由檢索得出的初始語境(retrieval-derived initial context)比隨機的非金標準語境(random non-gold context),能產出更高的檔案 F1 分數,且所需的種子後探索(post-seed exploration)更少;而神諭級的金標準語境(oracle gold context)則顯示仍有相當大的進步空間。
一個在推理任務上訓練的語言模型 p_θ(y mid x) 能透過多種不同的策略來解決問題,但這些策略是隱含且糾結在模型的反應分佈之中。我們研究如何將給定預訓練語言模型的反應分佈,分解為一個結構化的、以策略為條件的表徵。具體而言,我們學習一個潛在變數分解 p_θ(y mid x) 轉化為 (r_ϕ(z mid x), g_ϕ(y mid x,z)),其中路由器 r 將每個輸入映射到一個關於潛在策略 z 的分佈,而生成器 g 則根據該策略產生反應。一個關鍵挑戰在於,從基礎模型初始化的生成器,在沒有使用 z 的情況下就已經代表了 p_θ(y mid x)。因此,標準的變分推論無法激勵模型透過 z 來傳遞信息,可能導致嚴重的後驗坍塌。為了解決這個問題,我們提出一個變分目標函數,該函數衡量相對於基礎模型反應損失的分數信息增益,並將重建壓力集中在基礎模型高驚奇度的標記上,從而鼓勵 z 編碼與策略相關的反應變化。我們引入一個多策略演算法任務的基準測試,並證明此目標函數能恢復與不同參考策略對齊的潛在編碼,同時保持基礎模型的反應分佈。
在RLHF(基於人類回饋的強化學習)管線中,獎勵評分環節會阻礙策略更新。評分速度慢會拖累整個循環,因為必須等到所有生成結果都獲得評分後,才能執行更新。然而,多數設定仍直接採用PyTorch的即時模式或torch.compile,沒有人確認這是否真的最快。評分本身的運算量並不大,生成生成內容在典型的RLHF步驟中耗費的資源遠多於評分。但評分與生成會競爭同一批CPU與GPU資源,因此單純加快評分引擎並不能直接縮短步驟時間,主要效益是釋放出更多資源供生成環節使用。我們基於ONNX Runtime建構了一個原生C++推理引擎。第一步:驗證正確性。其輸出在CPU上與PyTorch參考結果的差異為5.7 × 10⁻⁶,在GPU上為4.2 × 10⁻³,精準度足以信賴。接著我們在CPU與GPU上分別與PyTorch即時模式、torch.compile及FastAPI進行比較。結果在CPU上相當明確:我們的引擎全面超越所有基準,信賴區間甚至沒有重疊。GPU則呈現不同情況:我們勝過PyTorch與FastAPI,但torch.compile表現更佳。進一步測試發現,加速主要來自ONNX Runtime本身,而非C++語言的優勢。而批次處理策略的影響比語言或運行時選擇更大,遠超出我們原先預期。這些結果皆來自重複且獨立的運行測試,因為單次運行的結果根本不夠可靠,不足以採信。
現有的BraTS-GLI數據集為成人膠質瘤MRI分割提供了廣泛使用的基準,但其任務定義專注於腫瘤子區域,並未系統性地表徵共存的白質高信號(WMH)。在聯合分割設定中,此類未標註的異常區域會將病理區域視為正常組織,從而引入特定任務的標籤噪聲。為解決此限制,我們推出BraTS-GLI解剖病變數據集(BraTS-GLI Anatomy-Lesion),這是一個基於BraTS 2023-GLI訓練隊列構建、受控訪問且僅含標籤的派生資源。該資源提供1,251套統一的八類解剖-病變標籤集,與原始的四模態MRI病例對齊,其中包括116個需要修復影像輸入病例的影像修復標籤。此隊列組織為394例的純化子集與857例的擴展子集,並包含病例層級元數據(涵蓋標籤來源、影像修復需求、質控狀態、訪問條件、校驗和及發布邊界)。與原始BraTS-GLI標註相比,此資源透過在統一標籤空間中納入健康腦組織與先前未標註的共存異常,大幅擴展了前景監督範圍。使用MedNeXt與T1/FLAIR輸入的驗證研究顯示,WMH感知監督在域內GLI與外部WMH數據集中均能維持健康組織分割效能,同時相較於噪聲對照訓練,能提升對共存病變的敏感性。此資源專為科學研究設計,支援聯合解剖-病變監督、標籤噪聲分析及可重現評估。數據可於https://www.synapse.org/Synapse:syn75210889/wiki/獲取,程式碼可於https://github.com/xyx200/brats-gli-anatomy-lesion-code獲取。數據資源DOI為https://doi.org/10.7303/SYN75210889。
高光谱成像(HSI)有助於材料辨識,但實際地雷篩查的效率更取決於在發現目標之前需檢查多少虛警。本文研究基於無人機(UAV)可見光與近紅外(VNIR)高光譜影像,運用光譜角映射器(SAM)、匹配濾波器(MF)、自適應相干估計器(ACE)及約束能量最小化(CEM)進行PFM-1地雷偵測。我們比較了三種光譜特徵:地面實測的SVC光譜、完全已知的場景內核心像素光譜,以及模擬人機迴圈的自助法(bootstrap)特徵。除了接收操作特徵曲線下面積與平均精度外,我們亦報告目標發現曲線及空間候選點審查次數。在完整審查的自助法中,經所有七個目標區域驗證後可達到完全已知場景內光譜特徵的表現,但所需的檢查工作量差異顯著:ACE僅需兩輪及九次候選點審查即可確認所有區域,而SAM變體則需數千次候選點審查才能鎖定最終目標位置。相關程式碼已開放於 https://github.com/SagarLekhak/IEEE_WHISPERS_2026_UAV_HSI_PFM1。
熱紅外線(TIR)成像在視覺退化環境中對無人機集群操作至關重要。然而,由於外觀線索有限、頻繁遮蔽及快速機動,追蹤微型無人機仍極具挑戰。儘管Anti-UAV挑戰賽等基準的推動取得了顯著進展,現有方法主要優先考慮精確度,卻忽視了即時邊緣部署的計算限制。標準卡爾曼濾波器(KF)具備邊緣設備所需的效率,但其恆速假設在高度動態的無人機運動及熱感應器抖動下常會失效。更複雜的非線性估計器可提升穩健性,但往往增加額外計算成本。為解決此差距,我們提出以自適應運動卡爾曼濾波器(AKKF)為核心的邊緣感知線上追蹤管線,該濾波器在保留即時效率的同時,以狀態相關運動模型增強線性KF。結合瞬態假陽性抑制與運動驅動預測慣性滑行,所提出的管線提升了具挑戰性TIR條件下的軌跡連續性。在超越強基線(BSB)基準上的實驗為邊緣感知無人機追蹤提供了起點,透過聯合評估追蹤性能與計算效率,為未來即時部署提供了見解。
域泛化(Domain Generalization, DG)旨在學習對分佈偏移具有穩健性的表徵。近期如CPCANet等幾何對齊方法,通過批次式共同主成分分析(Common Principal Component Analysis, CPCA)提取域不變結構。然而,CPCANet因小批量訓練中的小樣本量問題而面臨協方差估計秩不足的困境。為解決此限制,我們提出投影追蹤CPCANet(Projection Pursuit CPCANet, PP-CPCANet)——一種無需協方差的框架,可在斯蒂弗爾流形(Stiefel manifold)上學習全局正交基底,並透過凱萊變換(Cayley transform)將其與網絡參數聯合優化。我們進一步引入對稱性破缺的分離中位數PP離散度目標,以提取具有密集且穩健優化信號的共同主成分(CPCs)。在四個域泛化基準測試上的實驗顯示,PP-CPCANet在實現最先進性能的同時,保持了穩定的訓練過程。
生物医学图像分析涵盖多种模态与任务,然而在实际部署中,扫描仪、协议及患者群体的严重分布偏移构成了主要障碍。高性能模型因此需要针对特定领域反复进行微调,这一高成本循环在标签稀缺或隐私限制数据共享时变得不可行。我们提出OPERA(离线策略引导的专家路由与自适应),一种多智能体集成框架,通过将专家权重分配视为离线策略学习问题来解决这一部署瓶颈:从少量验证集中学习路由策略,无需对任何专家智能体进行梯度更新,随后结合测试时自适应以应对分布偏移。OPERA通过互补机制协调异构专业智能体:专家画像模块离线学习选择策略,实现专业化知识分配;各智能体通过温度调整进行置信度校准,确保更可靠的概率输出;OPERA还引入分布感知自适应,利用无标签测试数据统计信息在批次级别动态调整类别权重;实例级路由通过模型间一致性与预测熵将每个样本分配给最合适的专家。我们在涵盖眼底照片、胸部X光、CT、MRI及多模态诊断基准的9个数据集上评估OPERA,与分类、分割及多模态场景下的30余种基线方法进行对比。OPERA在性能与校准质量上持续提升,表明离线策略引导的专家智能体协调是无需重新训练即可实现可部署生物医学AI的实用路径。代码见https://github.com/HUANGLIZI/OPERA{GitHub}。