每日精選AI研究論文及翻譯
深入研究需要智能体找出同时满足多重约束的答案。发现此类答案成本高昂,而验证候选答案通常可分解为易于处理的逐约束校验。这种发现与验证之间的不对称性表明,研究智能体不应仅延长搜索时间,更应通过验证中间结果,并利用部分验证状态引导后续优化,以递归方式改进当前答案。我们提出AREX——一类递归自改进的深度研究智能体。AREX在内层研究循环中收集证据并构建临时答案,在外层自改进循环中逐约束审计答案,识别未解决的论点,并启动针对性后续研究。为支撑长期递归自改进,AREX学习了一种自主上下文更新工具,将不断增长的交互历史压缩为紧凑的改进状态,保留已验证证据和未解决约束,且无需依赖外部模型。我们通过智能体中期训练和长视域强化学习,在经验证的合成任务及高质量轨迹上训练AREX。为缓解长视域学习中稀疏的最终奖励问题,我们强调在获取决定性证据或纠正错误研究方向的关键步骤。我们实例化了一个密集4B模型和一个122B-A10B混合专家模型。在BrowseComp、WideSearch、DeepSearchQA、人类最后的考试(HLE)及其他推理与工具使用基准测试中,AREX显著优于同规模基线,并与使用更多激活参数的模型保持竞争力。
具身视觉跟踪(EVT)要求移动智能体仅依靠机载视觉持续追踪自然语言描述的特定目标。尽管最新的视觉-语言-动作(VLA)策略统一了目标识别与轨迹规划,但其思维链(CoT)推理往往在抽象的潜在空间中进行,难以监督且与显式图像空间检测的关联性较弱。为解决此问题,我们提出ReferTrack——一种“先指认再跟踪”的范式,通过单个前视摄像头实现具身视觉跟踪。该模型首先从索引化的边界框集合中选定目标,然后基于该图像级决策解码跟踪路径点。为持续保留目标运动线索,ReferTrack维护一个滑动窗口队列存储先前选定的边界框,并通过时间-视角-边界框指示(TVBI)令牌将其几何特征注入视觉历史。我们进一步通过自建的Refer-QA数据集进行协同训练来增强目标识别能力。在EVT-Bench基准测试中,ReferTrack在单目标、干扰目标和歧义跟踪三个子任务上分别取得89.4%、73.3%和74.1%的成功率,达到单视角方法的最优水平,甚至在识别密集型任务上匹配甚至超越多摄像头基线方法。最后,在足式机器人与人形机器人上的真实部署验证了其鲁棒的仿真到现实迁移能力。代码已开源:https://github.com/MedlarTea/referTrack。
大型語言模型日益廣泛應用於K-12教育,然而現有基準主要測試應試問答能力,而非理解課程知識如何被結構化與視覺化呈現。我們將此能力稱為「課程認知」,涵蓋先決條件鏈、概念分類體系、實驗-概念連結、教學排序及視覺基礎。我們提出K12-KGraph,這是一個根據官方人民教育出版社中小學數學、物理、化學與生物課本所擷取、對齊課程的知識圖譜,包含九種節點類型與十四種關係類型,涵蓋課程結構與視覺基礎。由此圖譜衍生出K12-Bench,一個包含23,640道多選題的基準測試,涵蓋五大任務族:基礎定位(Ground)、先決條件(Prereq)、鄰近概念(Neighbor)、證據(Evidence)與定位(Locate)。我們亦建構K12-Train,一個由7,335個樣本組成的圖譜引導監督微調語料庫,其中包含2,267個純文字問答對與5,068個多模態視覺問答對。在K12-Bench上,Gemini-3-Flash僅達57%完全匹配,Gemma-4-31B-IT則達46%,其中先決條件與鄰近概念為最困難任務。我們的訓練實驗顯示,領域特定的監督資料可縮小此差距。在匹配的2,300樣本預算下,K12-Train-Text在GaokaoBench與EduEval上始終優於八個主流指令微調語料庫中同等大小的子集。對於視覺語言模型,儘管K12-Train-Full使用的樣本數少於完整的DataFlow與WizardLM基準線,仍在Gaokao-MM、MDK12-medium與K12Vista上取得所有比較訓練配置中最佳的整體結果。同時,其表現超越純文字與純多模態變體,顯示文字與視覺監督具有互補性。我們公開釋出該圖譜、基準測試、訓練資料及完整的建構流程。
同策略自蒸馏(OPSD)因其无需同策略蒸馏(OPD)所需的外部教师模型而具有前景,但其仍需教师与学生之间存在信息不对称,以确保自教师提供比学生更强的学习信号。现有方法通过特权答案或视觉证据来创造这种不对称性。我们探究是否可同时消除这两者,从而得到一种纯粹由输入条件驱动、形式更简化的OPSD。为此,我们提出视觉对比自蒸馏方法VCSD,将图像内容移除转化为同策略自蒸馏信号。在每个学生生成的响应前缀处,EMA教师在同一提示与前缀下产生两个下一词元分布——一个以原始图像为条件,另一个以内容擦除后的控制图为条件。两者在词元级别的对数概率差异,突出显示了那些因实例级视觉内容而可能性显著提升的候选词元。我们利用这种对比,在教师原始图像分布的合理支持范围内锐化该分布,并将所得全分布目标蒸馏至学生模型。基于ViRL39K数据集,VCSD在Qwen3-VL与Qwen3.5模型上始终优于对照的OPSD方法。例如,在Qwen3-VL上,VCSD将七个基准的聚合得分从2B规模的62.27%提升至67.04%,4B规模从71.30%提升至73.16%,8B规模从72.51%提升至76.26%。此外,VCSD无需外部教师、特权答案、视觉证据信号、推理轨迹,也不增加额外的推理时开销。
空間智能對於智慧體從靜態語義理解邁向與物理世界互動至關重要。許多空間任務根植於連續的視覺場景,其中位置、區域與路徑透過指點、標記或繪製來表達,遠比報告精確座標或離散文字符號更為自然。然而,現有的空間推理基準通常要求座標、選項或文字,為圖像生成模型造成答案介面不匹配的問題。這使得即便圖像生成模型能直接在像素空間中外部化空間判斷,仍難以在與文字輸出視覺語言模型(VLM)相同的任務語義下進行評估。我們提出 ProVisE(Protocolized Visual Evaluation,協議化視覺評估),這是一個與基準無關的框架,能從圖像生成模型中引出受協議約束的視覺答案,並將其解析為與原始度量相容的結構化預測。ProVisE 還包含一個智能代理建構器,可為新基準建構並驗證任務專屬協議。我們進一步引入 SpatialGen-Bench,這是一個精心策劃的診斷性基準,包含 470 個樣本,涵蓋 14 個空間子任務、四個能力層級及多樣化的答案形式。我們在統一設定下評估具代表性的文字輸出 VLM 與圖像生成模型,並在六個外部空間基準上驗證智能代理協議的建構。結果顯示,當空間答案可直接在像素空間中外部化時,圖像生成模型具有競爭力;而文字輸出 VLM 在組合空間推理上仍保有明顯優勢。這些發現揭示了像素空間表達與文字推理的互補優勢,並為研究圖像生成模型中的空間認知建立了度量相容的測試平台。
傳統代理開發分散於提示模板、工具架構、回呼程式碼與工作流程圖中。我們提出NVIDIA物件導向代理(NOOA),這是一個無關模型的Python框架,用於建構可靠的AI代理。NOOA採用更簡潔的方式:代理即為Python物件。其方法為模型可採取的動作、欄位為其狀態、文件字串為提示詞、型別註解則為契約。程式碼主體僅含「...」的方法在執行時由LLM驅動的代理迴圈完成,而具有正常主體的方法則維持標準的確定性Python程式碼。這使得開發者與代理擁有相同的介面,因此代理行為可像其他軟體一樣被測試、追蹤、重構與改進。 本文提出三項貢獻:(1) 我們介紹「代理即Python物件」的程式設計模型及其背後的設計原則。凡Python既有抽象概念之處,我們直接採用。代理特定的能力——如上下文、事件、狀態渲染、長期記憶與經驗證的LLM迴圈——通過簡單的Python風格API揭露,使開發者與代理共享同一熟悉的程式設計模型。(2) 我們識別六個模型導向的概念,據我們所知,NOOA是首個將這些概念整合於單一表面的框架:型別化輸入/輸出、對活躍物件的傳址引用、程式碼即行動、可程式化迴圈工程、明確物件狀態,以及模型可呼叫的上下文與事件管理API。我們發現學界已逐漸趨向這些概念中的多項——常以實驗性或部分功能的形式呈現——並呈現比較以鼓勵進一步採用。(3) 我們證明當前模型能有效使用此介面,無論是在針對性能力測試中,還是在如SWE-bench Verified、Terminal-Bench 2.0與ARC-AGI-3等代理與推理基準測試上。
當真實場景經由智慧型手機相機捕捉並顯示於螢幕時,所呈現的影像在色彩、亮度與對比度上往往與原始場景存在顯著差異。儘管現代相機與顯示器均有大幅進展,此差距依然存在。關鍵原因在於,多數影像處理流程將「從捕捉到顯示」的高維度過程,拆分為各自獨立校正的相機與顯示器兩個階段,再以低維度的色彩轉換加以連結,導致資訊瓶頸與無可避免的誤差累積。為解決此系統性挑戰,我們提出「色彩直通」(Color Pass-Through)——一個直接作用於已捕捉影像的端對端學習框架。我們的關鍵洞見在於,將相機與顯示器視為一個耦合系統,而非分別獨立校正。將兩者耦合可帶來兩項實際優勢:(1)透過端對端最佳化,將整個真實場景呈現於顯示器上;(2)經由完整的「捕捉到顯示」路徑,為每個特定觀察者實現高效的一次性校正。我們利用數位與人眼觀察者驗證了色彩直通方法。與代表性基準方法相比,我們的方法在使用者研究(5分量表)中平均提升2.0分,在定量指標上更提升超過兩倍,展現出對原始場景感知色彩更佳的再現能力。
我們介紹騰訊WorkBuddy Bench,這是一個針對編碼智能體的多領域評估套件;本報告記錄其構建方法、評分協議以及跨模型排行榜。其核心是一個統一的評估框架,用於在四個工作領域——代碼、網頁、辦公和安全——構建和執行基於分佈資訊的編碼智能體任務。每個任務並非改編自公開的議題文本,而是從真實的提交(commit)、拉取請求(pull request)或商業場景中逆向工程而來,並重寫為簡短、口語化、角色扮演式的請求,使得任務的提示無法透過網路搜尋底層的議題、拉取請求或提交討論串來還原。由於數據集是公開釋出的——包含任務目錄、環境映像、評估框架、測試案例和參考解決方案——其抗污染能力依賴於此種構建方式以及數據集版本控制,而非依賴於保密性。四個子集——儲存庫級工程、前端開發、辦公與商業工作流程,以及紅藍隊安全——各自探討真實工作的互補面向,每個子集都有其獨特的驗證風格。所有任務均以統一的任務目錄格式打包,並在統一且可重現的協議下,於兩個智能體框架(CodeBuddy Code 和 Claude Code)上執行;完整的公開釋出使基準測試能夠端到端重現並直接接受審計,因為任何第三方都可以重新執行每個任務並檢查其內容。由於每個子集使用不同的評分工具,各子集之間的分數無法相互比較,因此該套件不報告整體平均分數。我們提供了涵蓋多個模型家族的跨模型排行榜。
我們介紹SANA-Video 2.0,這是一種混合式影片擴散Transformer,在統一架構下分別以5B和14B兩種規模實例化。此模型專為在單一GPU上生成高達720p的高品質影片而設計,在品質上可與全softmax影片DiT匹敵,同時保留了線性注意力在長序列擴展上的優勢。為避免整體使用二次注意力,混合線性-軟最大值注意力(Hybrid Linear-Softmax Attention)將門控線性注意力(用於O(N)主導的混合)與週期性門控軟最大值錨點以3:1的比例結合,恢復了純線性注意力所缺乏的全秩令牌交互。為了在深度上傳播這些更新後的表示,區塊注意力殘差(AttnRes)將完成的區塊摘要路由至後續線性層,實現錨點特徵重用,並將深層有效秩提升約12%。透過從頭訓練,SANA-Video 2.0直接學習完整的混合結構,而非將預訓練模型線性化,同時透過降低解析度的代理研究確立25%的softmax為最佳品質與效率權衡。採用40步取樣時,SANA-Video 2.0在單一H100上以480p解析度、13.2秒內達到VBench分數84.30,與規模更大的softmax影片DiT相比,在延遲大幅降低的情況下仍具競爭力。其編譯後的DiT前向傳遞在720p/60秒時比匹配的全softmax基線快3.2倍,且差距隨影片時長擴大。此外,全棧Sol-Engine優化(核心融合、快取與稀疏注意力)進一步將此硬體友善的骨幹網路加速3.58倍,使5B管線在720p/5秒時達到13.06秒,在單一H100上比Wan 2.2-A14B快120倍。總體而言,我們的混合設計以顯著降低的成本恢復了softmax級別的表達力,實現了可擴展的長時長、高解析度影片生成。
隨著大型語言模型(LLM)的能力日益增強,它們越來越常被部署為協作代理,透過反覆互動來執行使用者委派的任務。然而,真正的互動本質上是動態的:使用者鮮少在一開始就明確表達其意圖,反而會在對話過程中逐步揭露、修正與重塑目標。儘管如此,目前LLM仍大多在單輪、完全指定的情境下進行評估或訓練,這留下了一個根本問題:當使用者的意圖在對話中持續演變時,LLM能多好地追蹤並據此行動?為此,我們提出一個框架,將靜態的單輪任務轉化為動態的多輪對話——在對話過程中,使用者的意圖會逐步揭露、修正,甚至中途轉向——同時保留每項任務原有的評估協議,使現有基準可作為受控測試平台重複使用,無需新增標註。在多項任務中,我們觀察到一致的現象:在靜態設定中表現優異的模型,並未將此優勢延伸到意圖演變的情境,且各模型家族的效能均大幅下滑。我們的發現指向一個根本缺口:當今的LLM尚無法確實追蹤並依據使用者演變中的意圖採取行動,這項能力在靜態評估中隱而未見,但對於未來的協作代理卻至關重要。
理解影片中的運動是視覺學習的一項基本挑戰,因為影格之間的變化糾纏了兩種動態來源:攝影機運動與物體運動。這種分解在表徵學習中仍未被充分探索,部分原因在於這些因素在自然影片中緊密耦合,難以分別進行監督。然而,恢復這種分解對於學習能夠將有意義的物體動態與攝影機引起的變化區分開來的穩健運動表徵至關重要。我們研究是否可以從預訓練的影像視覺變換器的凍結特徵中恢復此類結構化運動表徵。我們提出了結構化動態模型(Structured Dynamics Model, SDM),該模型通過未來特徵預測,明確地將時間變化的主要來源與殘餘動態分離開來,而不是使用單一糾纏的潛在變量或非結構化的空間密集轉換標記來表示影片變化。訓練結合了在真實影片上的自監督式學習與在合成Kubric數據上對場景動態的弱監督。我們在ProbeMotion上評估SDM,這是一個新的評估套件,涵蓋了具有攝影機運動、物體運動及兩者結合動態的合成與真實影片。SDM在使用全域CLS或平均池化特徵的骨幹基線方法中表現更優,並且在若干探測任務上與強監督表徵(如VGGT)相比毫不遜色,儘管使用了明顯較弱的監督信號。這些結果表明,預訓練的影像模型可以輕易地被重新用於結構化的影片動態表徵,為學習與分析潛在影片動態提供了有用的歸納偏置。
多智能體互動式世界模型不僅應生成一致的觀測結果,還需維持跨智能體持久存在並隨視角演化的世界狀態。現有的自回歸影片擴散管線將觀測歷史作為條件上下文傳遞,這使得共享狀態在多重智能體與多重視角設定下難以維持。我們提出WorldWeaver(W^2),一種串流多智能體影片擴散模型,該模型在推論過程中引入跨智能體世界狀態暫存器:可學習的標記(token)用以儲存共享世界資訊、追蹤個別智能體狀態,並在每個生成區塊後動態更新。我們透過涵蓋個別智能體狀態、全局視角狀態(包括鳥瞰圖)及場景文本的監督訊號來奠基這些暫存器。此外,我們以混合Transformer(Mixture-of-Transformers)設計改善架構,分別使用獨立權重進行世界狀態建模與視覺畫面建模。在雙智能體Minecraft影片生成的大量實驗中顯示,明確的世界狀態建模能提升邏輯一致性與生成品質。
大型語言模型(LLMs)的強化學習通常依賴信任區域掩碼來穩定離策略更新。主流的PPO風格方法使用取樣詞元的重要性比率作為兩項準則的依據:一為鄰近準則,用以檢查策略是否已偏離行為策略過遠;二為方向準則,用以評估更新是否使策略進一步背離。近期提出的DPPO方法透過以行為策略與訓練策略之間的概率散度取代PPO基於比率的測試,改進了鄰近準則。然而,其方向準則仍沿用PPO的設計——只有當取樣詞元的重要性比率偏離1時,該詞元才會被掩蓋。我們觀察到,這種基於比率的方向準實質上是一種單樣本代理指標,其正負號可能與定義鄰近準則之散度的變化方向不一致。為此,我們提出預測性散度掩碼,該方法能判定下一個策略梯度步驟將增大還是減小與信任區域相同的散度。針對LLM強化學習中使用的離散Softmax策略,我們推導出此預測的封閉形式解。由於生產環境中的推論引擎僅暴露詞彙表的截斷(Top-K)視圖,我們開發了兩種輕量化的Top-K估計器來進行此預測。詳細分析表明,相較於取樣比率,基於散度的方向準則更能與散度的實際變化保持一致;由此產生的掩碼能在不同模型規模與精度設定下改善強化學習訓練。
大规模部署导航系统需要一种最小化感測器假設、能跨機器人形態泛化且高效訓練的方案。然而,現今最佳系統依賴深度感測器、多攝影機套件或預先建構的地圖,限制了其所支援的硬體並增加部署成本。我們提出Robostral Navigate,這是一個基於此規模化目標打造的80億參數視覺語言模型。該模型僅需單目RGB影像串流——此為機器人平台中最普及的感測器——並透過在當前攝影機視角中指向下一個目標位置來預測航點。由於完全在影像空間而非機器人特定座標系中運作,此策略能自然適應攝影機內參與場景尺度的變化,從而在無需重新校準的情況下部署於輪式、足式與空中機器人。我們在35萬個模擬場景中生成240萬條軌跡,以降低對真實世界資料收集的依賴並易於擴展。我們進一步引入一種前綴緩存訓練方案,將整個情節打包成單一訓練序列,使訓練令牌減少22倍,並將訓練時間從數月縮短至數日。基於樹狀結構的注意力遮罩可防止模型依賴先前的真實動作進行條件化,從而鼓勵基於視覺的動作預測;強化學習則用於進一步改善探索與復原能力。在連續環境中的室內到室內(R2R-CE)與跨室內環境(RxR-CE)基準測試中,Robostral Navigate創下新里程碑。在R2R-CE上,儘管僅使用單一RGB攝影機,其仍達到77.4%的成功率,超越最佳單目方法10.5個百分點,並領先最強的深度或多攝影機系統5.3個百分點。在RxR-CE上,其達到75.1%的成功率,優於所有單目基準模型。
我們研究面向智能體任務的在線策略蒸餾(OPD),其中大型語言模型智能體與環境進行多輪互動,學生模仿教師在這些多輪互動歷史中的行為。完全在線的 OPD 成本高昂,因為每次更新都需要學生透過環境進行新的 rollout,並在訪問過的歷史狀態上查詢教師。我們提出重放前綴在線策略蒸餾(ReOPD),這是一種脫離環境的替代方法,重複利用預先收集的教師軌跡作為重放前綴:學生在選定步驟行動,而教師提供密集的逐步驟監督,無需執行新的環境互動。我們表明多輪 OPD 引入了一個前綴陷阱:使歷史更符合學生在線策略能提高與學生的相關性,但可能在其目標不可靠的歷史狀態上查詢教師。這造成了學生佔用分佈與教師可靠性分佈之間的雙向偏移。ReOPD 通過將多輪 OPD 視為一個可靠性感知的前綴分佈設計來解決這一問題,並採用簡單的逐步衰減取樣排程來實現,該排程強調早期、低偏移的前綴。在數學推理、Python 和搜尋環境,以及多種教師和學生模型規模下,ReOPD 保持或提高了 OPD 級別的準確率,在學生訓練期間使用零工具呼叫,並且每次 rollout 至少比 OPD 快 4 倍。因此,ReOPD 將昂貴的智能體-環境互動轉變為可重複使用的離線資源,能夠跨工具、任務和環境實現可擴展的蒸餾。
現實世界中的智能體學習往往受限於昂貴的環境互動,例如執行耗時的實驗或獲取人類回饋。情境學習提供一種高度樣本效率的方式,讓智能體能從自身的互動歷史中學習,但一旦該經驗從情境中被移除,其效益便會消失。另一方面,情境蒸餾提供了一種將情境資訊內化至模型權重的機制。然而,將其應用於智能體的互動歷史且不犧牲環境樣本效率,目前仍未被充分探討。我們將此問題稱為「經驗蒸餾」,並開發出一種無需在已收集經驗之外進行額外環境互動的實作方法。在749個精選軟體工程任務與六個文字冒險遊戲上的實驗顯示,該方法能保留至少64.8%來自情境學習的增益,而直接對收集到的經驗進行監督式微調僅能恢復3.8%的增益。相較於傳統的強化學習基準方法,透過嘗試-錯誤經驗進行情境學習再搭配經驗蒸餾,能以至少9.6倍的環境樣本減少達到相同的效能。
我們研究正弦遞迴作為隱式神經表示中諧波頻譜增強的迭代機制。我們的分析揭示,正弦激活函數會產生諧波線譜,從而從頻譜角度解釋了遞迴展開如何有效增強有效頻譜支持。我們通過一個共享的正弦區塊實現此原理,該區塊通過迭代優化潛在表示。我們針對前饋式隱式神經表示、非正弦遞迴變體以及平衡態正弦模型,通過實驗驗證了所導致的頻譜行為。作為補充,我們在圖像和三維表示任務上評估了所提出的架構。在RGB圖像基準測試中,我們的方法以更少的參數和更少的優化步驟實現了比前饋基線更高的保真度,並進一步在超解析度、神經輻射場和符號距離函數任務中展現出良好的遷移表現。
可泛化機器人操作策略的發展本質上受到大規模、高保真場景資料可用性的限制。雖然近期的自動化合成方法試圖透過文字到佈局生成或簡化程序化生成來填補此缺口,但它們常因物理不合理性以及無法捕捉真實人類環境中複雜密集的雜亂場景而表現不佳。本文提出 TableVerse,一個全自動的真實到模擬流程,將研究典範從想像佈局生成轉向基於非結構化真實世界影像資料的確定性重建。我們的框架能無縫處理未經編排的網路媒體內容,生成具有精確度量尺度、真實拓撲結構與驗證機械穩定性的高保真模擬就緒桌面環境。此外,我們整合了自動任務條件化軌跡生成框架,用於合成高品質、無碰撞的拾取與放置示範。藉由此完整流程,我們建構了 TableVerse-100K 資料集,這是一個包含十萬個獨特且物理一致的環境的大型語料庫,並配對互動式操作軌跡。透過捕捉多樣化的資產組合、真實的空間分佈與高品質示範,TableVerse-100K 建立了高度可擴展且高保真的資料基礎,為未來可泛化機器人操作任務的研究提供了重要價值。
代理推理因其整合大规模信息并生成可靠准确内容的能力,已成为金融分析领域的一场变革性力量。然而,在处理复杂的现实问题时,不同代理仍表现出显著的性能差异。本文设计了Finance-LaTeX SKILL——一种基于专家知识合成复杂版式金融文档的技能。利用基于该技能构建的代理工作流,我们生成了2,000份专业金融文档及6,000个高质量问答对。为全面评估代理的综合能力,我们引入FinanceComplexQA——一个贴近真实场景的金融文档综合性开放生成基准。该基准包含2,026项深度研究任务,覆盖1,009份金融文档。FinanceComplexQA具有八大核心特征:双语支持;覆盖六类主流场景及七类任务;具备专家级文档推理问题;支持复杂版式深度研究;提供相对稳定且可永久参考的标准答案;通过"代理即裁判"机制结合多项评估指标实现精准评价。利用FinanceComplexQA,我们对领先的RAG系统及代理推理工具在金融文档问答中的表现进行了全面评估。通过识别与分析失败案例,我们深入研究了这些工具在数值计算、多跳推理、内容摘要及行业分析等方面的能力。
可控視頻生成仍具挑戰性,原因在於文本提示或主要約束像素運動的運動控制輸入難以精確指定多物件互動。實務上,基於軌跡的控制常要求使用者為多個物件繪製精確路徑,此做法在場景複雜度增加時擴展性不佳,且遇遮蔽或重疊時會產生歧義。為實現靈活且精確的多主體控制,我們提出GraphVid——一種以圖形為條件的影像轉視頻生成模型,能透過結構化交互圖實現互動式控制。我們進一步整理GraphVid-Bench,一個大規模以互動為核心的視頻資料集,內含結構化關係註釋,以利訓練具互動感知能力的視頻生成模型。儘管使用的訓練資料與可訓練參數遠少於先前的運動控制方法,GraphVid仍展現出強大的可控性與視頻品質。相較於Motion-I2V,GraphVid的FID降低了39.9%,FVD降低了37.6%,同時PSNR(9.87提升至15.98)與SSIM(0.38提升至0.61)皆有進步。我們的研究成果凸顯了結構化語義介面作為可控視頻生成強大典範的潛力。
現代AI代理依賴如Claude Code、Codex和OpenClaw等複雜的推理框架來驅動多輪推理、工具使用以及外部系統的存取。儘管功能強大,這些複雜的框架也使得代理難以在開放基礎設施上進行端到端訓練,因為其SFT/RL堆疊無法原生表達具狀態、多流程的框架推理。為了解決這個問題,我們提出了OpenForgeRL,一個開源框架,用於在多樣化環境中對基於框架的代理進行端到端訓練。OpenForgeRL透過一個輕量級代理來實現此目標——該代理為框架的模型呼叫提供服務,同時將其記錄為標準RL程式碼庫(例如veRL)的訓練資料,並搭配一個Kubernetes編排器,讓每次執行軌跡都在各自的遠端容器中運行,從而能在任何環境中對任何框架進行大規模訓練。透過將訓練與推理解耦,OpenForgeRL讓研究者能夠直接在代理實際部署的真實框架與環境中,輕鬆訓練、研究並改進代理。我們在多種複雜的框架與環境中驗證了我們的框架,涵蓋基於工具/爪類的代理,以及多模態GUI瀏覽器與電腦使用代理。僅使用數百到數千個任務,OpenForgeClaw在ClawEval上達到了31.7 pass^3與55.9 pass@3,在QwenClawBench上達到了33.7。OpenForgeGUI在OSWorld-Verified上達到37.7,在Online-Mind2Web上達到63.0,在WebVoyager上達到72.3。兩者在幾乎所有基準測試中都優於相似大小的開放基線,且在GUI設定中達到或超越數倍規模更大的模型。除了基準測試之外,我們也分析了框架選擇(例如ZeroClaw、OpenClaw、Codex)與強化學習如何塑造代理行為。我們發現某些框架比起其他框架難學很多,而且強化學習提升了代理的可靠性,例如自我驗證、工具涵蓋範圍以及完成多步驟計畫,但關鍵能力如錯誤恢復仍然薄弱。
我們重新審視數據集蒸餾,從以結果為導向的觀點出發。與其對齊過程代理(每步梯度或訓練軌跡),影響匹配(Inf-Match)對齊訓練的最終結果:它學習一個緊湊的合成數據集,其對收斂參數的影響與完整數據集相匹配。具體而言,我們引入了一個完全可微分的、樣本層級的影響估計器,量化添加或移除數據所導致的參數變化,無需耗時的逆黑塞矩陣乘積或凸性假設。該估計器通過展開優化動力學並應用一階泰勒近似,以線性時間運行。然後,我們通過最小化合成數據集的影響與真實數據集影響之間的差異來學習合成數據集,從而實現結果對齊而非啟發式過程模仿。Inf-Match在標準分類基準上達到了最佳準確率。例如,在Tiny-ImageNet(IPC=10)上,Inf-Match達到31.5%,比NCFM提升了4.7%。超越分類任務,Inf-Match擴展到Flickr30K上的視覺-語言蒸餾,優於強大的過程匹配基線。例如,使用200到1000個合成樣本,我們的模型在圖像/文本檢索任務上取得了領先的出色平均表現,比NCFM高出2.5%。代碼將通過 https://github.com/hrtan/infmatch 發布。