每日精選AI研究論文及翻譯
现代AI智能体的能力不仅取决于其基础模型,还取决于其控制框架——该框架负责构建提示词、管理状态、调用工具以及协调执行流程。随着模型、应用程序接口、环境与需求不断演进,控制框架也必须持续调整。在进行此类变更之前,开发者或编程智能体必须识别所有实现目标行为的代码位置。这一过程极为困难,因为生产环境中的框架规模庞大、耦合紧密且行为分布零散,而修改请求描述的是系统应实现的功能,代码库却按文件与模块组织。代码搜索、代码库索引及长上下文处理虽能简化审查工作,但仍需人工将行为与代码进行一一映射。因此,行为定位成为框架演进的核心瓶颈。我们提出"框架手册"这一行为导向型表征,通过静态分析与大语言模型辅助结构化,从框架代码库中自动合成,将每个行为与其对应源代码关联起来。我们还提出"行为引导渐进式披露"方法,引导智能体从高层行为出发,逐步深入相关实现细节,并依据当前源码验证候选定位。在来自两个开源框架的多样化修改请求测试中,基于手册辅助的规划方法在提升行为定位与编辑方案质量的同时,减少了规划所需的令牌消耗。对于分散的代码位置、低频执行路径及跨模块交互场景,该方法提升尤为显著。由此可见,复杂智能体系统的演进不仅取决于生成编辑方案本身,更在于精准确定编辑的实施位置。
我們推出了Boogu-Image-0.1,這是一個開源的統一多模態理解與生成模型系列,包含Base、Turbo、Edit和Edit-Turbo四種變體。它在高品質文字轉圖像生成、快速推理、基於指令的編輯以及雙語(中英文)文字渲染方面展現出具有競爭力的性能。像Nano-Banana-Pro和GPT-Image-2這類閉源多模態系統,是透過系統層級的整合而非單一模型達到強勁表現,但其內部做法大多未公開。在這項工作中,我們證明,針對模型理解能力、資料品質和訓練管線進行有針對性的改進,並結合智慧型推論時擴展(agentic inference-time scaling),即使在極為有限的計算預算下,也能顯著提升生成和編輯性能。全面評估結果顯示,Boogu-Image-0.1在標準基準測試中持續達到或超越其他開源模型,並取得接近領先閉源系統的成果。值得注意的是,這僅使用了2.0862億張獨特影像。基礎模型的理論訓練成本僅約40萬美元。我們分享這些實務討論,相信對更廣泛的研究社群具有價值,並在Apache 2.0許可證下釋出權重、程式碼和配方,以推動統一多模態理解與生成的開放生態系統。我們的程式碼可於此處取得:https://github.com/Boogu-Project/Boogu-Image。
強化學習結合可驗證獎勵而無需人工標註數據的方法(常被稱為零強化學習),已成為引發思維鏈推理的有效典範。然而,由於計算資源限制,現有研究大多侷限於小型模型,使得大規模下的訓練動態與湧現能力尚未被充分探索。為了有意義地探索此一前沿,我們旨在從模型中引發高品質的推理行為。然而我們發現,單純的規模擴張往往導致可讀性差、標記冗餘以及缺乏自適應推理深度等問題。為應對這些挑戰,我們提出了一套穩定且高效的訓練流程,整合了演算法與系統層面的優化,例如裁剪重要性取樣、訓練-推理比例校正以及混合精度控制。實驗提供了三項關鍵發現,驗證了規模擴張的「苦澀教訓」:(1) 將參數規模擴展至1兆,能顯著提升樣本效率與性能上限;(2) 訓練過程依序經歷初始的探索階段,隨後進入銳化階段;(3) 模型自發發展出先進的認知行為,包括擬人化、結構化格式、自我驗證、平行推理以及上下文焦慮,使得人工設計的啟發式規則變得不再必要。在七個數學基準測試中,Ring-2.5-1T-Zero達到了具競爭力的表現。此外,為在最終答案正確性之外評估思維鏈品質,我們提出了一套涵蓋三個維度的結構化評估框架:可理解性、可再現性與效率,而我們的模型在產生結構化且簡潔的推理軌跡方面展現出明顯優勢。透過分享我們觀察到的湧現現象,我們期望為學術界提供關於規模擴張行為(特別是在1兆參數規模下)更深入的洞見。
OpenClaw 已成為複雜任務自動化的領先代理框架,但其跨平台 GUI 互動支援不足,且缺乏完善的自我演化機制。這些缺陷限制了它對多樣化裝置生態系統的適應能力,也使其無法透過持續學習執行經驗來提升效能。為解決這些問題,我們提出「深知而篤行」的個人助理範式,主張累積使用者互動與任務執行經驗,能直接提升執行準確性與效率,從而融合認知理解與操作執行。基於此範式,我們推出 KnowAct-GUIClaw——一套全新的「知-路-行-思」框架,旨在彌補 OpenClaw 在 GUI 操作上的不足,並突破其跨平台與遞迴自我改進的限制。首先,主代理利用累積的互動經驗與任務相關知識,進行長程任務分解與分配(知)。其次,一個可插拔的 GUI 子代理配備具經驗歸因能力的記憶系統(知)與自我演化技能庫(行),實現無縫跨平台遷移與快速路徑整合。特別是,此框架持續儲存使用者設定檔與回饋,以提升任務分解與工具呼叫的準確性。在 Android、iOS、HarmonyOS 與 Windows 上的大量實驗顯示,KnowAct-GUIClaw 在效率、準確性與跨平台適應性方面表現卓越。尤為突出的是,基於開源 Kimi-2.6 模型的 GUIClaw 在長程 MobileWorld 基準測試中達到最佳效能(64.1%),超越所有代理框架與封閉源代理模型(如 Seed-2.0-Pro 與 GPT-5.5)。此外,我們框架所支援的知識性記憶與執行技能可跨多種基礎模型遷移,在 Kimi-2.6 上提升 8.5%。
我們介紹了 OvisOCR2,這是一個 0.8B 參數的文件解析模型。OvisOCR2 被設計為一個端到端的解析器:給定一份文件頁面圖像,它能夠生成符合自然閱讀順序的 Markdown 表示,涵蓋文字、公式、表格與視覺區塊。我們建立了一個數據引擎,結合了經過過濾的真實文件註釋,以及從相同 HTML 來源生成其渲染影像與 Markdown 目標的合成頁面。訓練流程包括監督式微調、在 4B 分支上進行具有多組件獎勵設計的強化學習、將策略在線蒸餾至 0.8B 模型,以及模型融合。在 OmniDocBench v1.6 上,OvisOCR2 以 96.58 的總體分數達到當前最佳表現,使端到端模型首次登上此前以管線方法主導的排行榜首位,突顯了端到端文件解析的潛力。在 PureDocBench 上,OvisOCR2 同樣以 75.06 的 Avg3 分數取得最高成績。除了這兩個公開基準之外,我們還在一個內部基準上評估 OvisOCR2,該基準涵蓋了更廣泛的長尾與具挑戰性場景。在各比較方法中,OvisOCR2 獲得最佳總體表現,進一步證明了其泛化能力與穩健性。OvisOCR2 可在 https://huggingface.co/ATH-MaaS/OvisOCR2 取得。
圖像安全防護(image guardrails)通常在固定的安全策略下進行訓練與評測,隱含地將安全性視為圖像的內在屬性。然而實際部署情況截然不同:同一張圖像可能在某個產品中被允許,在另一個產品中卻被限制,而當策略邊界改變時,甚至可能被新規則禁止。我們研究策略適應性圖像安全防護(policy-adaptive image guardrailing),要求模型判斷圖像是否違反當前提供的策略,並推廣至未被見過的策略定義。我們提出 PolicyShiftBench,一個綜合基準,包含 265 張圖像上的 2,000 個策略判別性實例,平均每張圖像配備 7.55 個策略條件提示,用以測試模型是否能適應當前生效的策略,而非依賴於圖像層級的安全性先驗。接著我們提出 PolicyShiftGuard,一個緊湊的策略條件護欄,採用兩階段訓練方法,結合隨機策略 SFT(RP-SFT)與邊界配對策略適應(BP-Adapt)。BP-Adapt 針對同一圖像與風險類別,使用標準標籤監督與成對比較損失(pairwise comparison loss)來訓練配對提示,藉此區分阻擋策略與通過策略。實驗顯示,現有視覺語言模型(VLM)與專用安全防護在策略變動下仍顯脆弱,而 PolicyShiftGuard 則顯著提升了策略敏感性表現。該 7B 模型在 PolicyShiftBench 上達到平均 F1 為 76.9、平均 PSS 為 72.1 的最新技術水準,且能良好遷移至 UnSafeBench 與 SafeEditBench,並透過簡潔的輸出格式改善了延遲與性能的權衡。消融實驗證實,配對的通過/阻擋邊界對是穩定策略適應的關鍵。
當前視覺生成模型雖能產出高品質內容,卻缺乏對空間結構的一致感知。現有生成式新視角合成方法通常引入明確的幾何先驗,以強制空間一致性,但本質上限制了大幅視角變化的泛化能力。反之,近期互動式生成方法偏好隱式場景建模,提供更大靈活性,卻犧牲了精確的相機控制與幾何一致性。本文提出MetaView,這是一個基於擴散的單目新視角合成框架,能從單張影像實現大幅視角變化的渲染。我們的關鍵洞察在於結合隱式幾何建模與最小但必要的明確3D線索:我們從前饋幾何感知網路中引入隱式幾何先驗,以規範結構而不強加嚴格的重建流程,同時利用度量深度將生成過程錨定於度量尺度。此設計使MetaView能同時達成幾何一致性與精確可控性。大量實驗證明,在具挑戰性的單目大幅視角變化情境下,MetaView顯著優於現有方法,並展現優越的泛化能力。我們的程式碼已公開於 https://github.com/KlingAIResearch/MetaView。
世界行動模型(WAMs)透過聯合建模動作與未來視覺觀測,利用未來場景演化作為密集監督信號,以提升機器人策略學習的物理基礎動作生成能力。然而,現有WAMs的常見設計是在推理階段明確生成未來影片,導致龐大的計算負擔,阻礙即時閉環部署的可行性。GigaWorld-Policy 以動作中心架構解決此問題:訓練階段利用未來視覺動態,但推理階段僅進行動作解碼。在此框架基礎上,我們提出 GigaWorld-Policy-0.5——一種強化的動作中心 WAM,專為更高效的機器人控制而設計。預訓練階段,GigaWorld-Policy-0.5 採用混合式動作條件世界模型(AC-WM)與 WAM 訓練策略,強化視覺動態與機器人動作之間的耦合性,並提升動作表徵於下游策略學習的可遷移性。為實現高效推理,GigaWorld-Policy-0.5 引入混合專家Transformer架構,將視覺動態建模與動作生成分離為專業化專家,減少僅進行動作推論時的活躍計算量,並在本地 RTX 4090 環境下達成 85 毫秒推理延遲。此外,我們採用基於智能代理的自動化研究(AutoResearch)管線,系統性搜尋訓練配置,在縮短超參數調優所需時間與人工介入的同時,更有效地識別最佳實驗設置。實驗與消融研究結果顯示,GigaWorld-Policy-0.5 在保留未來視覺動態訓練效益的同時,提升了機器人控制的推論效率。
視覺Transformer(ViTs)已知會出現高範數的補丁標記異常值,導致特徵圖品質下降,而寄存器標記能有效緩解此問題。隨著擴散模型越來越多採用Transformer架構並轉向像素空間訓練,其形式與ViT日益接近,這引發了一個問題:寄存器標記對擴散Transformer(DiTs)是否同樣有用?在本研究中,我們證明DiT與ViT在一個關鍵方面有所不同:DiT不會出現補丁標記異常值,但仍可從寄存器中受益。有趣的是,寄存器在像素空間DiT中的效果優於在潛空間DiT中的效果。透過分析中間表徵,我們發現寄存器標記在高雜訊水準下會產生更乾淨的特徵圖,這可能有助於它們在像素空間生成中的有效性。我們進一步觀察到,近期像素空間DiT架構隱含地納入了類似寄存器的機制,這或許能部分解釋其強大的實證表現。基於這些觀察,我們提出寄存器引導(Register Guidance)技術,該技術能放大負責改善視覺結構與一致性的寄存器標記之貢獻。
自我改進自主代理正從研究原型邁向部署系統。其核心目標是透過經驗實現可控演化或適應,且過程中僅需極少甚至無需人類介入。本綜述將現代自我改進代理視為一種能將經驗轉化為累積能力增益的自適應系統。我們提出一套系統級框架,將現代代理表述為基礎模型與操作支架(包含提示詞、記憶、工具及控制邏輯)耦合而成的配置。在此框架下,自我改進被形式化為一個自我誘導的更新運算元,該運算元獲取並提交對模型參數或支架元件的更新。我們依更新目標與驅動變化的信號對既有研究進行分類,隨後回顧應用案例並探討評估方法,最後以開放問題與未來方向作結。為便於查閱,相關技術更新可參考 https://github.com/selfimproving-agent/awesome-Self-Improving-Agents。
近年來,三維生成技術的進展已能實現令人驚豔的視覺合成,然而現有方法多依賴二維擴散監督,缺乏明確的幾何一致性機制,因而容易產生空間幻覺,例如重複結構與幾何錯位。這些問題在四維生成中更加嚴重,因為跨視角與時間演進的一致性維護帶來了額外挑戰,包括抖動、身份閃爍與結構漂移。我們提出 Hallo4D,一個統一且與模型無關的框架,用於減緩三維與四維內容生成中的時空幻覺。Hallo4D 導入「生成-檢測-校正」範式,利用大型多模態語言模型(LMM)從多視角與多幀渲染中識別並總結空間與時間上的不一致性。這些洞察驅動一個共識導向的影像空間一致性最佳化,其中基於 LMM 的選擇器透過多模型投票評估候選校正,無需重新訓練或修改架構。為進一步提升時間一致性與最佳化效率,Hallo4D 整合了動作感知關鍵幀取樣、LMM 引導初始化以及外觀對齊。此外,我們引入曝光感知最佳化與可見性剪枝,以增強在具挑戰性視角下的穩健性。大量實驗顯示,Hallo4D 在各種三維與四維生成設定中一致優於強基線,為一致性導向的內容生成提供了一個可擴展且具泛化能力的解決方案。
結構化剪枝是一種硬體友好的大型語言模型壓縮方法,但過去驗證多集中在選擇題型辨識任務,而相同的壓縮後檢查點在實際部署所需的自由生成任務中卻可能崩潰。兩個觀察揭示此落差:第一,貪婪式 pass@1 在壓縮後幾乎消失,但 pass@k 透過重複取樣能大幅恢復:有用的生成內容僅被降級而非完全抹除。第二,可恢復區間的主要失敗模式源於後綴重複。因此,恢復訓練應使用壓縮模型自身的在策略狀態,並搭配密集的詞元層級監督——這正是「在策略蒸餾」(OPD)的做法:將壓縮前的模型作為凍結教師重複使用。然而,長序列的在策略滾動會將早期恢復預算浪費在低資訊重複後綴上,延緩損失下降。為減緩此浪費,我們提出 \shortopd(短到長在策略蒸餾排程),該方法可偵測經教師確認的重複後綴,將倖存前綴視為每次滾動的有效長度,並將後續滾動預算分配給當下策略能處理的有效長度。在數學、程式碼及開放式生成任務中,\shortopd 將壓縮模型的分數提升至未恢復時約 9 倍,並達到標準恢復方法(不含知識蒸餾的監督微調、知識蒸餾及序列層級知識蒸餾)的 1.6 至 4.4 倍;同時以固定 8192 詞元滾動視窗達成的結果在兩個百分點內匹配,但僅需四分之一訓練時間(8.5 小時對 35.9 小時)及減少 71% 的滾動詞元數量。我們希望此方案能協助將結構化剪枝推向超越困惑度與選擇題基準的邊際效益,更接近可部署的生成品質。
隨著大型語言模型(LLMs)發展為自主代理,建立統一的評估基礎設施變得至關重要。然而,當前的評估流程仍然高度分散且緊密耦合,阻礙了可重複性並導致冗餘的工程開發。為解決此問題,我們提出AgentCompass——一個開源、輕量且可擴展的評估基礎設施,專為基於LLM的代理設計。AgentCompass將評估流程組織為三個獨立組件:基準(Benchmark)、測試框架(Harness)與環境(Environment),從而實現靈活的配置,無需重新實現複雜的執行邏輯。此外,它具備容錯的非同步運行環境以及全面的軌跡分析工具,能透明地診斷如獎勵欺騙(reward-hacking)等細微的失敗模式。原生支援橫跨五個能力維度的20多個基準測試,AgentCompass為社群提供了一個可擴展且可重複的基礎設施,以推動代理研究的進展。
智慧助理何時應在未被詢問時主動發聲?連續的自我中心影片提供了豐富且不斷演變的情境,從而實現一種新型的協助方式:主動式而非僅是被動反應式的協助。然而,現有方法要麼被動等待使用者提問,要麼將每一個偵測到的事件都視為需要回應,而未考慮使用者的歷史記錄、當前活動,或協助本身是否真的受歡迎。我們將主動協助重新定義為一個依賴情境的決策問題:代理者不僅須感知當下發生的事,更須運用累積的時間脈絡進行推理,以決定何時、甚至是否應介入。為此,我們提出Vinci2,一套主動式自我中心協助系統,將裝置上的助理Vinci從被動反應推向主動服務。在評測方面,我們提出EgoServe,首個針對連續自我中心影片中主動協助的大型基準。EgoServe包含超過3,000個服務實例,依據4種時間記憶範圍(從即時安全警報到長期習慣指導)組織,涵蓋10個服務類別。在建模方面,我們提出EgoMemo,一種免訓練、記憶增強的代理者,維護三種互補的記憶表徵:多尺度時間摘要、語意知識圖譜,以及視覺嵌入檔案。在每個時間步,EgoMemo執行檢索增強推理,判斷協助是否必要,並在必要時產出基於情境的回應。實驗顯示,EgoMemo在EgoServe上建立了強勁的基準表現,同時在現有自我中心基準上也具競爭力。我們的基準與程式碼已公開於 https://sitonggong.github.io/EgoServe-page/{Vinci2}。
針對基於LLM的代理系統進行故障歸因,亦即識別失敗軌跡中導致任務失敗的具體步驟,對於除錯與系統改進至關重要。現有方法若非仰賴基於提示(prompting)的流程(此類方法運算成本高昂),便是需要在包含步驟層級錯誤標註的失敗軌跡上進行後訓練(post-training),而此類標註資料不僅收集成本高昂,更難以擴展。我們主張,實用的故障歸因模型應具備輕量化特性,且能在無步驟層級監督下僅以失敗資料進行訓練。為此,我們聚焦於無監督故障歸因問題:僅以成功軌跡進行訓練,並在推理階段針對給定的失敗軌跡識別錯誤步驟。我們提出OAT方法,將此問題轉化為基於神經控制微分方程式(neural controlled differential equations)的單類學習(one-class learning),在潛在空間中建模成功軌跡的動態模式。在推論階段,根據每個步驟偏離成功軌跡學習所得動態的程度,賦予異常分數(anomaly score),進而建構錯誤步驟集合。實驗結果顯示,僅需訓練100條成功軌跡,OAT的執行速度即比基於提示的基準方法快200至5000倍,同時在領域內(in-domain)與分布外(out-of-distribution)資料集上,F1分數分別穩定高出20%與7%,證實OAT為診斷代理系統故障提供了一條具潛力且高效的發展方向。
離散去噪擴散模型(DDMs)近期已成為離散數據建模中自回歸(AR)模型的引人注目替代方案,具備並行生成與迭代式全域修正能力。與連續擴散(其狀態空間固定)不同,DDMs 的設計本質上取決於離散狀態空間的構建方式:包括分詞方案、詞彙拓撲結構及領域特定的結構化字母表。本研究提出一個統一的概念框架,透過底層離散狀態空間的建構來審視離散擴散模型。在此框架下,現有方法——如轉移矩陣、遮蔽/吸收態、以及分數/比值導向的模型——皆可視為共通設計空間中的不同實例。該框架進一步揭示訓練目標、推論演算法、擴展行為、系統優化及評估計畫之間的常見設計權衡,並為未來研究提出數個具前景的方向。
大語言模型(LLM)智能體已不再局限於生成回應,而是能夠透過調用工具、觀察結果並迭代決策下一步行動,來執行多步驟任務。多數智能體系統運行於桌面或伺服器環境,支援工具使用與任務自動化。行動裝置同樣是重要的智能體環境,因其普及率高,且包含使用者資料、感測器及日常應用。現有行動智能體主要透過圖形用戶介面(GUI)操作(如點擊、滑動與輸入)來操控智慧型手機,但此類操作常形成冗長且依賴介面的序列,無法直接存取裝置功能,亦難以界定執行邊界。我們提出 PalmClaw,這是一個原生運行於手機上的開源智能體框架,可在裝置上直接管理對話、記憶、技能、工具與智能體循環。PalmClaw 將裝置功能以裝置工具的形式呈現,具備明確參數、結構化結果與清晰定義的執行邊界。此設計使智能體能直接使用行動裝置功能,同時確保每個操作明確且可控。實驗結果顯示,相較於最強基線,任務成功率相對提升 11.5%,完成時間減少 94.9%,且設置負擔更低,並以記錄軌跡說明執行邊界的應用方式。程式碼開源於 https://github.com/ModalityDance/PalmClaw。
長期任務智能體的優化越來越依賴於基於反思的機制,其中大型語言模型(LLM)充當優化器,用以診斷智能體失敗並改進其策略。然而,真實的執行軌跡難以直接用於優化:大量軌跡資料集往往冗餘且異質,導致優化效率低下且容易對低價值失敗產生過擬合;同時,每個單獨的軌跡也包含許多不相關的步驟,而諸如截斷或滑動窗口等簡略的上下文縮減方法可能丟失因果關鍵的證據,進而產生誤導性的優化信號。為了解決這一困境,我們提出了STRACE(結構化軌跡分析與因果提取)框架,該框架能夠構建高信噪比的優化上下文,實現更精準且有效的優化。在批次層面上,STRACE挖掘失敗模式以過濾冗餘軌跡,保留具有代表性的失敗案例;在每個選定軌跡內部,它通過文本依賴圖進行因果定位,去除無因果關係的步驟,並識別出真正的根因模組以進行優化。實驗結果表明,STRACE顯著優於標準的上下文過濾基線。值得注意的是,在一項具有挑戰性的形式驗證任務(VeruSAGE-Bench)中,它成功優化了人類專家設計的智能體,將成功率提升了1.4倍(從42.5%提升至58.5%)。程式碼已於 https://github.com/moomight/STRACE 公開。
長度懲罰的強化學習可以縮短思考鏈推理,同時隱藏驅動模型答案的影響。在我們的實驗中,使用長度懲罰進行訓練並未阻止誤導性提示引導模型,儘管模型的思考鏈提及提示的頻率大幅降低。基於令牌準確率的評估會將這些運行視為成功,因為它們使用了更少的推理令牌且準確率損失很小;但它會忽略剩餘軌跡是否仍顯示驅動答案的因素。我們訓練不同目標思考鏈長度的Qwen3-4B和Qwen3-14B變體,然後在保留的MMLU-Pro-R和四個遷移基準上使用偏差提示干預對其進行評估。壓縮大幅減少推理令牌,保留了大部分選擇題準確率,並使提示影響接近基線。在最強的目標下,Qwen3-14B的下限忠實度降至基線的63.1%,Qwen3-4B降至69.4%;監控器捕捉到提示使用的原始比率從69%降至49%,以及從60%降至48%。為了將長度與內容分離,我們從未壓縮的基線鏈中隨機刪除句子,直至剩餘文本匹配壓縮後的長度。即使在長度匹配後,對於兩個Qwen3規模和所有五個評估分佈,壓縮後的鏈揭示提示的頻率仍比隨機縮短的基線鏈低7至35個百分點。因此,壓縮不僅僅是縮短推理,而是優先移除監控器需要用來觀察影響答案因素的線索。綜合這些結果揭示了一個壓縮-可監控性邊界,其中成本更低的推理可以保留答案,同時使背後的影響更難被檢測。
AI滲透測試代理作為進攻性安全系統的可信度日益提高,但現有基準測試在哪些代理能在真實目標中表現最佳方面,仍提供有限的指引。現行評估協議在簡化或狹隘的環境中,針對預先定義的目標(如奪旗賽、遠端程式碼執行、漏洞重現或軌跡相似性)進行評估與優化。這些工具對衡量有限範疇的能力極具價值,卻未能充分捕捉真實滲透測試所需的複雜性、開放式探索與策略性決策。本文提出一套實務評估協議,將評估重點從任務完成轉向經驗證的漏洞發現,使評估能在涵蓋多個攻擊面與漏洞類別的足夠複雜目標中進行。該協議結合結構化真實數據與基於大型語言模型的語義匹配來識別漏洞,採用二分圖解析在現實模糊性下對發現結果進行評分,持續維護真實數據,對隨機代理進行重複與累積評估,納入效率指標,並以精簡測試套件選擇達成可持續實驗。此協議拓展了現有技術,實現對AI滲透測試代理更具現實性與操作資訊性的比較。為確保可重複性,我們亦發布專家註釋的真實數據與所提評估協議的程式碼:https://github.com/ethiack/ethibench。
自主无人机系统日益依賴多模態大型語言模型(MLLMs)在複雜的真實環境中運作。這類具身場景不僅需要理解周圍空間,還需維持對代理自身的一致性表徵。然而,現有的無人機導向方法與基準仍以環境為中心,主要聚焦於空間理解任務,代理的自我意識始終處於隱含狀態。為填補此空缺,我們提出SIS-Bench,一個基於「空間中的自我」統一框架來評估無人機場景下具身空間智能的基準。SIS-Bench沿著「空間」與「自我」兩個互補維度,以及「感知」、「記憶」、「推理」三層級結構進行評估。透過任務條件式建構流程及專家驗證,從1,646部真實無人機影片中提取13項任務,共包含4,856組問答對。廣泛評估顯示,當前MLLMs在建模動態及以代理為中心的過程上存在根本限制。尤其,我們觀察到空間認知與自我意識之間明顯失衡,以及認知層級間的漸進式效能衰退。基於這些發現,我們進一步探索融入自我相關動態的動作感知表徵,該表徵融合光流與視覺特徵。實驗結果顯示,建模代理動作持續提升感知與記憶效能,不僅在空間認知上,也在自我意識上有所改善,並可泛化至下游無人機決策任務。我們的結果突顯自我意識對於推動具身空間智能的重要性,並為動作感知的「空間中的自我」建模提供了新的基準與實證依據。
互動式模擬器已成為訓練具身智慧體與生成合成視覺數據的強大工具,但現有照片級真實感模擬器普遍存在通用性不足、可程式化程度有限及渲染速度緩慢等問題。為解決這些限制,我們提出SPEAR:一項專為照片級真實感具身AI研究所設計的模擬器。其核心為Python函式庫,能透過模組化插件架構連接並程式化控制任何虛幻引擎(UE)應用程式。SPEAR提供超過14,000種UE函數的Python介面,相較現有UE模擬器實現了一個數量級的可程式化功能擴增。此外,單一SPEAR實例能以每秒73幀的速度直接將1920×1080解析度的照片級真實感影像渲染至用戶的NumPy陣列——比現有UE插件快上一個數量級——同時提供現有UE模擬器無法取得的真值影像模態(例如非漫反射本質影像分解、材質識別碼及基於物理的著色參數)。最後,SPEAR引入一套具表達力的高階程式設計模型,能讓使用者定義包含任意資料相依性的UE工作複雜圖形,並在單一UE幀內確定性地執行這些圖形。我們透過多樣化的應用實例展示SPEAR的實用性:在數個即時UE專案中控制多個具獨特動作空間的具身智慧體(如人類、車輛與機器人);渲染照片級真實感的城市規模環境;操控UE的程式化內容生成系統;渲染高清人臉的同步多視角影像;協調與MuJoCo物理模擬器的互動式協同模擬;以及透過AI程式碼輔助系統以自然語言編輯場景。
我們提出 AffectFlow-DINO,這是一個用於第 11 屆 ABAW 挑戰賽的多任務學習系統,透過引入條件整流流頭部來擴展標準的確定性架構,以模擬自然場景下臉部行為的內在模糊性。該模型並非預測單一情感估計值,而是學習條件生成分佈,透過蒙地卡羅取樣實現具有不確定性意識的一對多預測。此系統從靜態臉部影像中聯合估計連續的效價-喚醒度、分類八種臉部表情,並檢測十二個動作單元。基於凍結的 DINOv3 ViT-S/16 骨幹網路,廣泛的消融研究表明,整流流解碼持續改進確定性預測,特別是在效價-喚醒度估計方面(CCC-V 提升 0.058)。我們進一步證明,事後閾值校準能夠在不重新訓練的情況下,有效恢復嚴重不平衡的稀有類別(例如:恐懼從 3.8% 提升至 33.1%)的性能。結合骨幹網路微調與流重調優,最終模型達到 P_MTL=1.177,顯著優於官方挑戰基準線 P_MTL=0.45。
具備豐富靜態語意的語言(如Rust)能為AI生成的程式碼提供更強的保證,但其嚴謹性也使得程式碼生成更加困難。現成的編譯器雖可在生成後提供有用的回饋,卻無法引導中間生成步驟(例如自迴歸大型語言模型解碼過程中的步驟)。約束解碼透過在取樣時拒絕無效的詞元來提前介入,但需要白箱模型存取權限,並為實現語意約束而付出高昂的重製成本。 我們提出「生成式編譯」,這是第一種在生成過程中取得編譯器對部分程式回饋的方法。其核心技術工具是「密封器」:一種輕量級、主要基於語法引導的轉換,能將部分程式轉換為標準編譯器可診斷的完整程式。此轉換的設計確保可能完成的部分程式永不被拒絕,同時保留足夠的程式碼上下文,以便及早捕捉真正的死路。我們在一個核心的類Rust運算上建構了這樣的密封器,並證明了它滿足這些性質(全部在Lean中機械化驗證)。我們將其擴展為第一個針對真實Rust語言的部分程式檢查器。我們在挑戰性的儲存庫層級Rust程式碼任務上進行評估,涵蓋前沿黑箱模型與開放權重模型。結果顯示,相較於標準的生成後回饋,生成式編譯能減少無法編譯的輸出,並增進功能正確性。其運作機制是在貼近錯誤源頭之處及早檢測出廣泛的錯誤,從而減少錯誤級聯,並實現聚焦的診斷。更廣泛而言,生成式編譯是邁向讓編譯器成為AI輔助程式設計中活躍於生成過程的第一等公民(而非僅是生成後獨立檢查)的一步。