每日精選AI研究論文及翻譯
AI導師在適應每位學生的優勢、劣勢以及偏好的引導方式時最具效用,但關於哪種引導對哪種學生有效的證據,從真實學習者身上收集既稀疏、緩慢且成本高昂。學生模擬器可作為代理提供此一訊號,然而現有方法有其局限:狀態追蹤模型雖能貼合學生行為,但在處理解釋或糾正方面卻有困難;而LLM角色扮演雖能流暢地遵循引導,卻無法可靠地匹配被模仿學生的能力。我們提出StudentSim,這是一個訓練框架,透過彙整訓練接著進行個別學生的特化,將稀疏的每學生資料轉化為個人化的模擬器。所產生的模擬器既能反映學生自身的回應,也能在導師引導下更新這些回應。我們亦提出StudentSimEval,這是一項標準化評估方案,涵蓋60名學生,橫跨西洋棋、第二語言英語寫作與數學領域,並使用公開的學習者資料集,其中包含為研究而共享的去識別化記錄。StudentSimEval衡量行為保真度(F,即模擬器與學生回應的匹配程度)以及引導回應性(R,即在導師引導下更新的容易程度);所有方法皆以相同的記錄進行擬合與評估。在這三個領域中,StudentSim在兩項指標上皆優於GPT-5.4。在西洋棋方面,StudentSim達到F=0.51與R=0.91,相較之下GPT-5.4為0.23與0.72,Maia2則為0.45與0.27。作為概念驗證,以StudentSim作為導師強化學習的獎勵模型所訓練出的西洋棋導師,人類專家評其比無RL基線以及以GPT-5.4模擬器獎勵訓練的導師更準確、引導更佳且更具個人化。程式碼可在 https://github.com/microsoft/StudentSim 取得。
我們提出 Qwen-Drive-1.0,這是朝向自動駕駛視覺-語言基礎模型的第一步。Qwen-Drive-1.0 保留了預訓練視覺-語言模型(VLM)的架構,並在統一框架中整合了 3D 感知、視覺問答與運動規劃。一個外部鳥瞰圖(BEV)感知頭聯合執行 3D 物體偵測、語義佔用預測與 BEV 地圖分割。它作為從共享表徵中可獲取 3D 資訊的探針,並提供一個明確且可檢視的介面來理解 3D 場景結構。一個規劃專家模組以共享的 VLM 表徵為條件,生成未來的自車軌跡。分階段的訓練配方將駕駛監督與通用視覺-語言資料結合,以獲得駕駛特定能力,同時有助於保留廣泛的視覺理解與指令跟隨能力。實驗表明,模型具備強大的 3D 感知與駕駛場景理解能力,同時在很大程度上保留了通用視覺-語言能力。在開環、偽閉環與閉環設定下的全面評估進一步顯示出其極具競爭力的運動規劃表現。
循環Transformer透過反覆執行共享的層區塊來增加有效深度,但多數評測是在固定模型大小下進行比較,將架構優勢與額外的FLOPs混為一談。我們在緊密匹配每個token的FLOPs、非嵌入參數總數與KV快取的前提下,研究循環機制應用於混合專家(Mixture-of-Experts, MoE)Transformer的效果。透過一系列消融實驗,我們提出一個稱之為SMELT(Sparse MoE Transformer, middle layers Loop Twice,即稀疏MoE Transformer中間層循環兩次)的方法:將中間一半的層循環兩次,同時在上述三項預算上皆與未循環的基線匹配。我們將SMELT擴展至四種規模,最大達540億非嵌入參數,並為每種架構分別擬合了一條Chinchilla式縮放定律。SMELT的損失隨計算量增加而下降得更快,在計算最優前沿上節省了6.8%至18.0%的訓練FLOPs。此優勢會轉移到下游基準測試,且幅度超過驗證損失所預測的程度;在程式碼任務上最為明顯,並隨樣本長度與上下文範例數量增加而增強。機制分析顯示,第二遍通過會減少注意力匯集點(attention sink),並將權重質量重新導向至與內容相關的token;這種歸納偏置可能是觀察到性能提升的底層原因。這些結果表明,即使在預算匹配的條件下,循環仍能改善Transformer,提供了一個將深度重用轉化為可量測收益的實用方法。
多模態GUI代理已成為數位任務自動化的一個前景可期的典範,然而,由於環境覆蓋範圍有限、任務建構脆弱以及獎勵驗證不可靠,從以基準為導向的模型過渡到可靠的實際應用仍然充滿挑戰。在本研究中,我們提出了 UI-Venus-2,這是一個通用型基礎GUI代理,旨在透過統一的閉環推理-行動框架,在行動裝置、網頁和桌面環境中運行。為縮小通往實際部署的差距,我們聯合擴展了三個關鍵維度:(1) 環境——將覆蓋範圍擴展至逾170個多語言行動應用程式及原生桌面作業系統;(2) 任務——採用深度研究管線進行以功能為根基的指令生成;(3) 驗證——採用具有視覺關鍵點與多模型投票的軌跡層級與樣本層級評估器,以確保為訓練提供可靠的強化學習訊號。此外,我們整合了安全感知機制,以確保高影響力行動的受控執行。透過提供一個功能強大、高效且開源的基礎,UI-Venus-2 推動該領域朝向更可泛化、可驗證且具自我反思能力的代理邁進,以因應實際世界的應用需求。
我們提出 H3-World,一個將 33B MiniMax-H3 影片生成器轉化為互動式世界模型的高效框架。我們的核心發現是,隨著大型影片生成器的能力日益增強,語言正逐漸成為一種自然的控制介面。以 MiniMax-H3 為例,它已支援透過自然語言指令對角色行為與鏡頭運動進行零樣本控制。在此基礎上,H3-World 將此粗略的語言介面轉化為精確且具時間定位的世界控制,且無需引入專門的動作模組。具體而言,我們將每個動作表示為角色指令與鏡頭指令的結構化組合,並將其與對應時間範圍的影片潛在特徵對齊。為使控制在時間上更為精確,我們進一步引入時間注意力路由,將每個指令限制在其預期的時間區間內,藉此減少動作之間的控制洩漏。重要的是,H3-World 直接重用在大規模影片預訓練期間所習得的語義表示,僅需進行輕量級適配。僅使用 8,000 筆遊戲畫面樣本、10,000 步 LoRA 最佳化步驟,以及 0.199% 的可訓練參數,H3-World 便能在維持強大生成品質的同時,實現有效的角色與鏡頭控制,並能泛化至未見過的情境。這些結果表明,大型影片生成器中所湧現的控制能力,可被高效率地轉化為互動式世界控制。
機器人操作面臨一個根本性的擴展挑戰:穩健的泛化需要廣泛的物理經驗,然而帶有動作標註的機器人軌跡不僅收集成本高昂,其多樣性也本質上受限。第一人稱影片提供了一種更具可擴展性的具身經驗來源,能夠捕捉跨越多樣環境的物體互動、接觸動力學、工具使用及長時程行為。核心挑戰在於如何將這種豐富但缺乏動作標籤的經驗轉化為有效的機器人控制。我們提出 ZimaBlue,一個從大規模影片中學習可泛化世界動作模型(WAMs)的可擴展框架。ZimaBlue 遵循三階段訓練課程:首先在大規模人類與機器人第一人稱影片上進行因果具身影片預訓練;接著透過影片-動作中間訓練,以統一的動作表示將所學習的視覺動力學扎根於異質機器人軌跡中;最後將模型特化至目標機器人以進行部署。為使生成式 WAMs 能實際應用於即時控制,ZimaBlue 進一步採用了非同步慢-快雙系統架構,其中高容量的慢速世界模型提供可泛化的時空表示,而輕量的快速分支則能在 NVIDIA RTX 4090 上實現 30 Hz 的動作預測。在真實機器人零樣本評估中,將訓練資料從僅有目標機器人資料擴展至超過 120,000 小時的具身影片,使成功率從 36.1% 提升至 77.8%。ZimaBlue 在多個基準測試上均展現強勁性能,尤其在未見任務上的增益最為顯著。
資料駐留限制迫使企業自行託管大型語言模型,但持續採用新模型而不淘汰舊模型,會導致服務叢集不斷擴張,使有限的 GPU 資源更加碎片化。我們透過生產環境錯誤分析,沿三個軸向彌合品質差距,將來自 200 多個內部應用程式的流量整合到單一模型上:指令遵循、函式呼叫及內部任務分佈。品質透過依生產流量分層的離線基準來追蹤,並由確定性驗證器或經校準的 LLM 評審員評分。我們不採用聯合優化所有目標的做法(此舉會引入跨領域獎勵干擾),而是針對每個軸向分別訓練一個 GRPO 專家模型,並透過兩階段 SLERP 進行合併。每個專家的獎勵函數揭示了不同的失敗模式,分別為語義崩潰、過度呼叫及冗長駭入,每一種都需要針對特定領域的修正。在非推理模式下,此方法在內部 Arena 上超越了總參數量約 7 倍的基準模型,指標分別為 69.6 對 65.8;指令遵循為 0.85 對 0.83;函式呼叫為 0.79 對 0.77,同時提升了通用對話基準表現。該模型以極低的服務成本吸收了平台 50% 的流量,即每月 1.16 億次請求。
多跳問答(QA)的核心瓶頸之一在於:問題表述的粒度,往往與語料庫證據可被檢索的粒度不同。既有方法透過在語料庫上施加固定的圖結構、迭代地重新表述查詢,或是在語料庫上執行一個所生成的程式來處理此種不一致,但這些策略並未明確判斷某一查詢單元何時已受證據支持、何時應被細化。我們將此瓶頸表述為「可檢索粒度發現」,並提出 Hi-Q——一個以證據為條件的階層式查詢細化框架。在每個查詢節點上,解析運算子會檢驗所檢索到的證據是否支持目前的查詢單元;已解析的節點即終止,未解析的節點則由一個保留依賴關係的二元運算子進行擴展,並經由語意涵蓋驗證器檢查。因此,Hi-Q 會建立一棵查詢樹,其拓撲結構由語料庫的支持信號決定,而非由固定的分解模板或預先建構的圖形決定。我們在三個多跳問答基準上評估 Hi-Q,主要是在全語料庫檢索設定下進行;在此設定中,相互依賴的證據必須在開放領域的干擾項之間定位,而非在小型的人工標註池中。在此設定下,Hi-Q 在三個基準上的平均達到 52.3 EM 與 64.0 F1,在該平均上領先迭代檢索基準 IRCoT 15.1 EM / 18.2 F1;在 MuSiQue-full 上,相較於基於圖形的 RAG 基準 PropRAG 領先 11.5 EM / 12.0 F1,且無須進行全語料庫的圖建構。在先前研究所使用的受限支持/干擾設定中,Hi-Q 同樣達到最佳準確度:平均 57.9 EM 與 69.3 F1,領先 PropRAG 5.6 EM / 3.9 F1,並領先 IRCoT 13.7 EM / 15.8 F1。專案頁面可於 https://hi-q-project.github.io/ 取得。
多模態大型語言模型(MLLMs)對影像與影片具有強大的感知能力。我們要追問的是:這份能力在多大程度上能延伸至行動層面——亦即直接將一個 MLLM 放入無人機的控制迴路中,而其完整動作空間僅在提示(prompt)中宣告。近期已有系統朝此設定發展,卻日益限縮模型的決策空間。我們反向將其重新放寬。我們提出 DroneCATS-Agent,一個將 MLLM 視為可抽換元件的架構,以及 DroneCATS,一個以模型為自變數的基準。我們的智能體不只是朝向某個像素飛行,而是將偏航與搜索、在不確定時斟酌判斷、以及自我宣告抵達的責任都交由模型承擔——全程無需微調,也無需函式呼叫的結構化定義。我們針對四項核心能力評估前沿模型與開放模型——接近可見目標、追蹤移動目標、搜索初始視野之外的區域,以及指揮多無人機機隊——結果顯示,即便最簡單的具身場景也遠未獲得解決。關鍵的是,為了找出在邊緣端最先失靈的環節,我們的模型陣容一路縮小至 2B 參數。研究結果揭露一個鮮明悖論:失敗的並非飛行本身。小型開放模型往往比前沿模型更可靠地進入成功半徑,卻因過早宣告抵達、或從不宣告抵達,而在該回合中落敗。多無人機指揮更加劇了這種差距——小型模型的失敗方式,是在不同視角之間盲目複製單一座標。若將這些模型視為視覺-語言-行動智能體,其空間感知仍然站得住腳,但行動協議卻崩潰了。區分可部署的邊緣模型與前沿模型的,不是導航能力,而是能否紀律性地維持已宣告的協議、並輸出正確的終止動作。待解的開放問題,在於以機載運算成本縮小此差距——亦即打造一個既能持續規劃、又確切知道何時完成的快速模型——而 DroneCATS 正是為了衡量這段距離而建構。
雖然統一多模態模型(UMMs)能在單一模型內同時執行視覺理解與生成任務,但功能上的統一並不保證學習上的綜效:這兩種目標可能相互增強、競爭容量,或僅是並存。我們在一個受控、結構原生且無預訓練視覺先驗的設定中,從表徵、任務與系統三個層面探討兩者之間的關係。在表徵層面,我們發現每個目標都能為另一個目標提供有用的訊號:生成任務豐富了用於理解任務的視覺特徵,而理解任務則強化了生成任務所需的視覺-語言對齊。然而,當兩種目標被強迫經由同一條計算路徑時,往往會有一方主導另一方。一種將衝突的視覺計算加以專業化、同時保留語義互動的任務解耦架構,能夠避免這種不對稱退化。在任務層面,透過三個案例研究,我們發現當理解與生成任務依賴共享知識時,會產生正向的雙向遷移。在系統層面,我們證明在明確需要同時具備影像理解與生成能力的複雜任務上,端到端UMM的表現優於條件相當的規劃器-執行器流程。綜合以上結果,我們顯示UMM的價值不僅止於統一的介面:適當的專業分工、共享的任務知識以及端到端最佳化,能將並存轉化為綜效。
長時間跨度的複雜任務要求基礎模型在擴展的互動過程中累積資訊、維持內部狀態並進行適應。安全性應是模型本身的內在屬性,而非僅依賴外部防護措施或事後對齊(如監督式微調)的行為約束。這催生了「由內而生的安全性」(Safety from Within)理念,亦即透過模型自身的原生計算來表徵與調用與安全相關的能力。我們提出 Safin-1,一個透過記憶路由與狀態演化實現此原則的基礎模型系列。Safin-1 建構於 MARCH(Memory-Anchor Routing across Context History,跨上下文歷史的記憶錨點路由)架構之上,該網路架構能維護結構化的記憶狀態,並透過內容條件化路由選擇性地檢索相關歷史資訊。它支援在測試期間適應持續性的能力狀態,而無需反覆修改主幹網路,從而在共享基礎上實現受控的專門化。我們透過「安全狀態」(Safety State)在下游安全任務上探討此一介面,並展現了基於狀態的有效適應,帶來顯著的安全性提升。更廣泛而言,路由狀態介面將上下文記憶與持續性能力適應統一於模型的原生計算之中,將記憶從被動的先前行上下文記錄,重新詮釋為一個用於維持與演化模型行為的主動基質。整體能力、長上下文理解、檢索與效率等方面的評測進一步驗證了 Safin-1 的有效性。這些發現為「將安全性作為一種狀態原生且可持續適應的能力」提供了實現路徑。本工作僅是「由內而生的安全性」之初步架構探索,要實現此更宏大的願景,仍需大量後續研究。
LLM評判者被廣泛用於評估代理式工具呼叫系統,然而其在結構化、依賴驅動的工作流程上的可靠性仍未受到充分檢視。我們提出 AgentJudgeBench,這是第一個系統性研究在 workflow DAG 上,LLM 作為評判者對代理式工具呼叫之可靠性的基準測試;此任務有別於更廣泛的開放式文本或偏好評估之 LLM-as-a-judge 任務。該基準包含 3,808 個實例,涵蓋六種 DAG 拓樸與三個難度等級,並以五個生成器(3B-70B 開放權重模型與 GPT-5.4)和六個評判者(20B 至前沿規模)在成對的有真值與無真值條件下進行評估。評判者一致性隨任務難度單調下降,在無真值條件下下降速度快 1.5 倍;而在無真值的困難查詢上,六個評判者無論規模大小均收斂至狹窄的 77–82% 區間,顯示出一個主要受任務難度驅動的結構性上限;雖然對較弱生成器而言,該上限的高度部分取決於提示詞,但僅靠模型容量無法突破。暴露真值並非一律有益:它使 GPT-5.4 的一致性下降 1.5 個百分點,使 Gemini-2.5-Pro 下降 3.9 個百分點,與過度錨定現象一致。在緩解策略中,思維鏈推理與評判者溫度皆影響可忽略,而結構化評估準則最多可提升 6.5 個百分點的一致性,但並非在所有的評判者-生成器配對上均勻適用。在有真值時,QwQ-32B 與程式化參考標準最為吻合;人類驗證研究則指出 GPT-OSS-120B 是與人類判斷最一致的評判者;在無真值時,前沿評判者僅在共同上限內略微領先。這些結果揭露了當前 LLM 評判者的根本限制,並為代理式系統中的可靠評估提供了實用指南。
自我對弈是語言模型自我進化的有效範式,但在缺乏引導的情況下,求解器的表現可能在後續回合中停滯甚至衰退。無引導方法利用難度、可學習性或多樣性等訊號來引導題目生成。這些訊號使題目具有挑戰性且多樣化,但並未指明後續回合應針對哪些未解決的推理弱點。引導方法則從外部任務資源取得方向,包括人類範例、文件語料庫或指定的難度目標,因此依賴於自我對弈迴圈之外所供給的任務資訊。我們證明,所需的方向可以改由求解器自身的失敗歷史推導而來。我們提出 DiagEvo,其中的診斷器從此歷史中萃取反覆出現的錯誤成因,並將其儲存在階層式錯誤成因記憶中。該記憶將相關成因歸類於技能節點之下,並根據目標題目上的自我一致性,將每個成因標記為「活躍」(Active)或「已掌握」(Mastered)。挑戰者利用這些狀態與重現次數,在針對成因的題目生成與自由探索之間取得平衡。雙重置信過濾僅在求解器最常見答案具有明顯票數領先時,才保留中等難度的題目。DiagEvo 從自我對弈過程中所產生的資訊推導其課程,而無需外部任務資源。在預設的 4B 診斷器之下,對於三個求解器——Qwen3-4B、Qwen3-8B 和 OctoThinker-8B——DiagEvo 在全部九個基準上的平均準確率均勝過所有基線。在 Qwen3-8B 上,它在五個數學推理基準上的平均準確率達 72.3%,比 R-Zero 高出 4.5 個百分點;其在全部九個基準上的平均準確率為 57.4%,比 DARC 高 1.1 個百分點。消融實驗顯示,階層式錯誤成因記憶與雙重置信過濾對這些提升皆有貢獻。
本文研究自主軟體開發,在此類開發中,基於大型語言模型(LLM)的編碼代理能於無人為介入的情況下,將高階需求轉化為完整、功能正常且可用的軟體系統。我們提出了 Harness-of-Harness(HoH)框架,使編碼代理能夠在自主開發過程中持續改進軟體。HoH 以現有的編碼代理框架為基礎,將其執行過程組織為「規劃—編碼—測試」的迭代循環。為了在迭代間維持改進,HoH 平衡了修復與能力增長之間的關係,將開發範疇切分為小而可驗證的增量,將實作期間的測試與獨立評估分離,並以可驗證的輸出作為約束,而非預先規定代理的工作流程。此外,它逐步提供可交付成果、角色專用工具與技能,鼓勵重用而非重新建立,並維護具有版本管理的專案歷史。在 GameCraft-Bench、FrontierSWE 與 ProgramBench 上,三組框架—模型配對(Codex 搭配 GPT-5.5、OpenCode 搭配 DeepSeek-V4-Pro,以及 Pi 搭配 MiniMax-M3)中,HoH 的表現一貫優於對應的獨立框架,在三輪迭代後達成了 52.25% 的平均相對增益,最高增益則達 82.86%。在一場歷時多日、超過 70 次迭代的部署中,HoH 自主開發了一款第一人稱射擊遊戲,具備連貫的故事情節、完整實作的核心機制、可供真人遊玩的體驗、精緻的視覺效果與整合的音訊。GitHub:https://github.com/Flesymeb/HarnessOfHarness 專案頁面:https://flesymeb.github.io/HarnessOfHarness/
多模態記憶為長影片問答提供了可擴展的介面,但現有方法常將字幕、影格、逐字稿、摘要或圖譜事實檢索為孤立片段。雖然這些片段具可搜尋性,卻尚未達到可直接用於生成的程度:語言模型必須在上下文有限且歸因困難的推論階段,重建跨模態與時間性的對齊。我們提出 EM^2Mem,一個以事件為中心的多模態記憶框架,在記憶建構時將異質證據綁定至事件錨點。每個以事件為索引的記憶單元對齊多模態記錄、時間脈絡、圖譜關聯關係、語意事實與來源出處,使得模型能在有依據的多模態事件上進行精簡的證據讀取,而非處理特定模態的片段。在三項長影片問答基準上,EM^2Mem 相較於最強的記憶基線,平均準確度分別提升 2.0、2.4 與 3.7 個百分點;嚴格的事件層級 Top-5 證據召回率提升 7.0 個百分點;每次查詢延遲降低至原來的 1/4.67,總推論 token 數減少 63.66%(程式碼將整合至 https://github.com/zjunlp/LightMem)。
認知語言智能體透過為語言模型配備記憶、工具與決策程序,已取得顯著進展,使智能體得以在互動環境中進行推理與行動。現有框架大多將此類智能體視為用以解決使用者指定之有界限任務的系統。一個日益重要的目標,是使語言智能體能在長期運作的環境中提供持續性協助——在此類環境中,使用者需求、情境與服務程序既持續存在亦不斷變化——並使其在隨時間湧現的廣泛任務中持續發揮效用。然而,我們仍缺乏一套能夠表徵持續性AI智能體、統整既有研究並引導未來發展的框架。為此,我們提出了「以感知為中心的持續性智能體架構」(Perception-Centered Architecture for Persistent Agents, Pera)。Pera描述了一種圍繞感知與控制元件所組織的持續性智能體;這些元件持續感知來自片段式任務執行、內部脈絡及周遭環境變化的服務相關訊號,並運用這些訊號建構生命週期任務,進而驅動智能體服務程序的持續運作與調適。我們運用Pera回顧性地梳理近期研究、檢視一項詳細的案例研究,並為建構更具能力的持續性智能體提供前瞻性見解。正如軟體工程從「小型程式開發」邁向「大型程式開發」,Pera將語言智能體的演進,定位為一場朝向長期運作、具適應性智慧系統的架構性轉變。
提示優化可以改善多智能體大型語言模型系統,但被優化的提示往往同時扮演兩個相互糾纏的角色:產生與任務相關的內容,以及指定執行關鍵協定,例如訊息路由、輸出格式化和終止訊號,而底層程式碼依賴這些協定。因此,本意為改善內容生成的提示修改,可能在不經意間破壞協定,導致整個智能體管線失敗。我們的核心觀察是,這兩個角色具有不同的表徵:執行協定通常是結構化的,而與任務相關的內容通常以非結構化語言表達。基於此,我們提出控制流與資料流分離,其中執行關鍵控制以帶型別且經驗證的程式物件表示,而與任務相關的語言則保持為可最佳化的資料流,用於智能體之間的通訊。此設計允許最佳化器在不將路由或格式化介面暴露於提示漂移的情況下改善多智能體行為。在合成推理、協作式審查生成和保險評定工作流程中,我們的框架實驗性地實現了100%的最終協定有效性,同時持續提升任務表現。
長時間跨度的代理任務並不止於在更多互動回合中串接短期任務。其持續演變的動態環境與長程依賴,要求大型語言模型(LLMs)在數千個步驟中持續探索、從經驗中學習,並調整其策略。我們提出 E-Commerce Bench,這是第一個將多輪交易對手談判與動態事件整合為一年期商業營運的開源基準。在365天的年度內,一個 LLM 代理同時經營多家線上商店:研究市場、與供應商談判以取得庫存、最佳化銷售策略、履行訂單、處理退貨,並管理現金流,以最大化年終總資產。為了建構逼真的商家端營運環境,產品與供應商資料皆來自真實的電子商務平台,同時一份橫跨一年的促銷、天然災害與供應鏈衝擊事件日曆持續重塑需求。為確保可重現性,市場的兩端均採確定性設計:顧客購買與退貨遵循固定需求模型,而談判核心決定供應商的定價、讓步與決策,LLM 僅被用來將這些結果轉化為語言。我們在七個維度上評估了18個前沿模型,包含年終資產,結果發現沒有任何單一模型全面主導。GPT-5.6 Sol 賺得最多,將100,000的初始資本增長至1,431,425,但在詐騙規避上排名18個模型中的第16位,且營運效率落後於 Fable5。在開放權重模型中,Qwen3.8-Max-Preview 以416,252領先,比 GLM 5.2 (high) 高出38%,並在整個營運期間展現最強的學習能力,能在重複訂單中逐步議價壓低價格。我們的程式碼已公開於 https://github.com/QwenLM/E-CommerceBench。
生成專業學術內容,如同儕評審與答辯,需將領域推理與事實依據進行縝密的協同整合。本研究提出一套全面性框架,用於開發與評估專業化學術智能體——InternReviewer 與 InternAdvocate。我們首先建立一個大規模、高品質的學術資料集,並整合高效率的 arXiv 檢索工具,以實現主動式證據蒐集。為最佳化這些智能體,我們實作了一種以統一目標指標與獎勵系統驅動的智能體強化學習(RL)範式。該系統透過採用多維度評判標準,避免基於主觀模型評判的偏差,其標準包括以參考文獻為錨定的語義對齊、結構合規性,以及一套嚴格的驗證機制——該機制將引用與即時互動日誌進行交叉比對,以消除幻覺現象。實驗結果表明,在此閉環框架內訓練的智能體,在推理深度與引用準確性方面均展現出顯著提升。
人工智慧日益被用於研製未來人工智慧系統的研發過程。我們研究此回饋在何種條件下會變成自我放大。我們的模型描述了人工智慧能力成長率如何取決於基線研究生產力、遞迴回饋,以及研究進展難度的遞增。我們推導出一個遞迴再生數 R_AI,用以判定改進在跨開發週期中是被放大還是衰減。此量比較回饋的強度與進一步進展變得更加困難的速率。當 R_AI > 1 時,改進的效應會跨開發週期複合累積,使系統進入自我放大狀態;當 R_AI < 1 時,其效應會隨週期更替而減弱。這一轉變取決於人工智慧研發回饋迴路的結構,而不必然發生在模型能力的某個特定水平。因此,系統可能在加速現象可見之前即進入自我放大狀態;快速進展也可能在沒有自我放大的情況下發生。較高的基線研究生產力可以加速進展,但不會改變系統是否處於自我放大狀態;然而,開發週期的時長會成為放大的限制性時間尺度。研究難度的增加則可終結一段自我放大時期。將模型擴展至多個研究行動者後顯示,跨組織共享的改進可以讓整體研究生態系統進入自我放大狀態,即使沒有任何個別行動者如此。該框架識別出人工智慧研發系統中可測量的屬性,有助於區分遞迴放大與由其他來源驅動的快速進展,這些屬性包括:遞迴回饋的強度、改進有效傳播至後繼系統的程度、週期時長,以及進一步進展所面臨的難度遞增。
測試時適應(TTA)通常假設模型參數可在推論期間更新。此一假設對僅供推論的加速器、凍結或第三方模型,以及記憶體受限的部署而言具限制性;此外,標準的以BatchNorm為基礎之TTA設定,在沒有BatchNorm的架構上也可能失效。我們研究在學習模型必須保持凍結時的適應問題。我們提出CASTER,一種無梯度方法:在判別性子空間中儲存來源類別統計量,並由目標批次的動差估計一個類別共用的仿射變換,在分類前以解析方式將來源類別分佈傳輸至目標。CASTER不需要反向傳播、優化器狀態,也不需要儲存的來源特徵庫。在四個骨幹網路與七個資料集上,於28個骨幹-資料集設定中,有27個設定表現優於使用相同凍結特徵的k-NN,且其中位數狀態量僅為k-NN的1/18。仿射傳輸並非總是可靠。在ImageNet-C上,每個批次僅含64個樣本卻涵蓋1000個類別,無條件傳輸損失了21.2個top-1百分點。因此,我們引入一個以殘差-邊際比為基礎的經驗性可傳輸性驗證。在307個評估單元中,所有損失超過10個百分點的傳輸,其驗證值皆高於3.9;不過,良性與破壞性情形的分佈並非完全分離。門控機制能將無條件傳輸平均-3.35個百分點的效果轉為+1.69個百分點的增益,且在一段廣闊的閾值範圍內,效能與最佳閾值之間的差距維持在0.3個百分點以內。最後,我們證明此驗證具有機制特異性:將其應用於Tent時,僅接受4.3%的更新,並保留了Tent可用增益的0.6%。這些結果將CASTER定位為適用於凍結模型部署的輕量級適應機制,同時清楚說明其安全訊號何時具有資訊性、何時不具有。
多模態幾何推理要求視覺語言模型(VLM)擷取精確的視覺關係,並在多步驟演繹過程中加以保留。現有的自由形式軌跡模糊了決定最終答案的關鍵判斷,而軌跡層級的強化學習則將單一終端訊號分配至整個回應之中。我們提出可歸因信用推理(credit-addressable reasoning),其核心概念在於推論過程中所暴露的語義單元,同時也界定學習過程中比較替代方案與指派信用的位置。我們以兩項具體實作來落實此原則:其一為 Code-CoT,它保留圖形、將視覺關係表示為可逐行定址的可執行程式碼,並將推理過程組織為型別化事件;其二為 CE-GRPO,它利用結構先驗與型別正規化熵來選定事件邊界,從共享前綴取樣完整的後續生成,並將結果差異轉化為局部化優勢。在九個幾何基準測試中,CE-GRPO 達到 76.04 的平均準確率,分別優於 Qwen3-VL-8B 與軌跡層級 GRPO 達 8.09 與 3.43 個百分點。其相對優勢隨著中間事件數量的增加而擴大,彰顯了表徵與最佳化協同設計(representation–optimization co-design)對於冗長且高度依賴關係的多模態推理之價值。
寶貴的資料仍深埋在非結構化來源之中:網頁、報告、合約、申報文件、財報電話會議,以及 PDF 檔案。企業 AI 的一大賭注,是部署可對這類資料進行推理的大型語言模型(LLM)代理,為每位知識工作者回答複雜問題。代理如今已能做到,但成本高得難以負擔。每個問題都得反覆開啟大文件、搜羅散落的證據,動輒消耗上百萬個 token。然而,假使資料早已結構化,同樣的問題便會化簡為成本低廉的資料庫查詢。舉例來說,在 FanOutQA 基準上,若基於理想的預先結構化儲存進行推理,成本可便宜 28 倍;而當問題擴及更多文件時,差距更會拉大至數個數量級。不過,預先將一切結構化並不可行:文件能承載的可能結構,遠多於任何工作負載所會用到的;而有用的結構與文件,也必須等查詢出現後才能確定。為此,我們提出「代理式資料裂解」(agentic data cracking):此方法在推理本身進行之際,以適應性與推測性的方式,將非結構化資料結構化。它之所以具有適應性,是因為觀察到的查詢會決定結構化的時機與重點;它之所以具有推測性,是因為其結構化範圍超出目前的問題。每當代理開啟文件作答時,一個裂解子代理便會自已載入的上下文中以邊際成本分叉而出,擷取可能服務於日後相關查詢、且有文件根據的結構。隨著時間過去,完全由結構化資料涵蓋的查詢比率逐漸提高;那些查詢無須開啟文件即可獲得解答,因此代理式準確度得以保持,成本則接近 RAG。在 FanOutQA 上,若每個測試問題只額外搭配一個相關問題,裂解法便能在維持準確度的前提下,讓成本下降 53%。代理式資料裂解,是邁向新一代資料基礎設施的第一步——一套位於模型之下的共享底層,讓推理早已付出代價才發掘出的知識得以在此持續累積,從而支撐對非結構化資料的代理式推理。
SAR-to-EO 影像轉換旨在從合成孔徑雷達(SAR)觀測生成電光(EO)影像。現有的潛在擴散方法通常繼承一個預設的自編碼器,然而重建保真度可能因編解碼器和模態而有顯著差異。由於潛在編解碼器會影響 SAR 條件與 EO 目標在往返過程中的保留程度,因此編解碼器的選擇構成基本的設計決策;然而,現有方法大多依賴在自然影像上預訓練的編解碼器。為了解決此問題,我們提出 ReFlowSET——一個條件潛在流匹配框架,透過聯合 SAR–EO 重建審核來選擇其編解碼器。ReFlowSET 並非繼承重量級的預訓練生成器,而是在所選的潛在空間中從零開始訓練一個規模小得多的條件式 DiT,先使用雙流 SAR 條件化,再進行聯合特徵細化。為了對這種從零開始的訓練提供語義引導,我們將中間的含雜訊 EO 特徵與由凍結的視覺基礎模型所抽取的乾淨目標 EO 表徵進行對齊。此對齊僅在訓練期間使用,且不會引入額外的推論成本。在 QXS-SAROPT 與 SAR2Opt 上的實驗,於多種感知保真度與分佈指標上展示了最先進的效能。程式碼與預訓練權重可於 https://github.com/KAIST-VICLab/ReFlowSET 公開取得。
傳統政治傳播框架運作於線性、事件驅動之預設下,將選民說服視為一種靜態的交易性功能。本文提出「動態同意工程」(Dynamic Consent Engineering, DCE),這是一套新穎的跨學科典範,將愛德華·伯內斯(Edward Bernays)的公共關係基礎原則與系統動力學之S-E-E-D(滾雪球、均衡、彈性、主導)框架加以綜合。透過將伯內斯式操作限制擴展為四維資源矩陣(在人力、心智資本與財務資本之外,納入演算法媒體基礎設施),我們以數學方式形式化民主制度如何建構、優化並維繫政治主導權。我們將伯內斯經典的八步驟工程流程直接映射至非線性回饋迴路、資訊時間滯延及人口承載力之上。透過對系統性回饋結構的嚴謹建模,我們分離出政治彈性、政策阻力高原期與閾值觸發之信任崩潰的動態根本成因。最後,我們建立四步驟診斷流程,並透過歷史參考模式驗證該框架,證明長期政治穩定並非取決於短暫的修辭操作,而在於政策執行與動態回饋校準之間的結構性同步。
商業短劇製作遵循多階段鏈條:劇本、分鏡、關鍵幀圖像、鏡頭級視頻,以及最終成片短劇。多數現有基準僅使用預先撰寫的輸入而非真實上游管線輸出,來評估視頻生成階段。這使得兩個關鍵問題無法回答:每個階段是否遵從原始劇本意圖(而非僅遵從其直接輸入提示),以及不同鏡頭在組裝為多集發布後是否保持連貫性。我們提出 DramaChain Bench,首個評估完整製作鏈條中每一階段的短劇基準。它建構於三個共享同一維度系統的內部系統之上,即 DramaChain Dimensions:五個評估軸在每個階段實例化,解析為 63 個葉節點維度。DramaChain Agent 在工作流程與成片短劇品質兩方面均以商業短劇平台為校準基準,從而實現跨模型的階段級公平比較。DramaChain Labeling System 讓三位專業標注員獨立為全部 5,785 個項目評分,所有缺陷均進行時空定位,並從預先定義的缺陷清單中選取。此過程產生 17,488 個有效分數與 255,925 條可追溯的歸因記錄。人工標注證實上游缺陷會沿管線級聯傳播,表明最終劇集品質並非僅由視頻生成單獨決定。DramaChain Agentic Judge 隨後自動為每個葉節點維度評分,在對照逐項目檢查清單進行判定之前,透過多輪智能體回合收集證據;其以平均 PLCC 0.918 重現模型排序,足以在零標注成本下接納新模型。
基於logit的知識蒸餾(KD)常用於透過較強教師模型的監督來訓練較小的語言模型(LM),但其效益在不同訓練階段是否一致仍不清楚。透過受控實驗,我們發現採用後訓練教師的前向Kullback-Leibler(KL)蒸餾——即標準的KD形式——在中期訓練期間表現出根本不同的行為;中期訓練是指在精選語料上進行自監督學習的中間階段。令人意外的是,雖然前向KD在預訓練期間相對於標準下一個詞元預測(NTP)同時提升了推理與事實記憶能力,但在中期訓練期間,它卻在推理能力持續增進的同時減緩了事實記憶的習得。我們將這種階段依賴性追溯至教師信心在不同資料領域間的不對稱性,以及學生不斷演化的知識狀態:教師在程序性資料上的信心高於知識密集型資料,而學生則在訓練較早階段便獲取了低熵的事實知識。為緩解此失衡,我們提出Switch Distillation,這是一種簡單的中期訓練目標:它使用教師的預測熵作為輕量級路由信號,在教師信心較高的詞元上進行蒸餾,否則回退至交叉熵。無論教師規模大小,Switch Distillation都一致地優於現有的蒸餾目標。相對於標準NTP,它在保留96.7–96.8%事實記憶的同時,達到了1.61–1.71倍的推理表現,以及1.13–1.19倍的知識與常識表現。關鍵的是,這些效益在後訓練之後依然存在:Switch Distillation在維持推理方面1.25–1.32倍增益,以及知識與常識方面1.13–1.20倍增益的同時,縮小了事實記憶的差距。
透過模仿學習的靈巧操作策略,其穩健性通常以場景、物體或指令的變化來評估,但這些策略在不同任務執行速度下的表現則較少受到檢視。這使得學習者相對於其所模仿的專家能保留多少時間上的穩健性,仍是懸而未決的問題。我們在相同的任務條件、初始條件抽樣與加速倍數下,比較專家與學習者。我們將此評估具體實現在 ParcelStow 任務中,這是一項接觸密集的任務,機器人需抓取、重新定向並插入包裹。示範涵蓋了包裹抓取後各操作階段的加速倍數範圍。由專家示範訓練而來的腳本化專家,以及利用Transformer進行動作分塊(Action Chunking with Transformers, ACT)的策略,在標稱速度下皆達到 100% 的任務成功率。兩者的成功率在示範的速度範圍內出現分歧:在最大速度下,專家成功率為 84%,ACT 為 53%。兩個採用不同參數初始化的 ACT 策略展現出類似的性能退化,從標稱速度到最大示範速度分別下降了 34 與 48 個百分點,而專家僅下降 16 個百分點。階段層級分析顯示,ACT 在最大示範速度下的 47 次失敗中,有 35 次是插入錯位。在相對運動交接機制下,每一次 ACT 的抓取都能在自由空間中完成重新定向與轉移並保持對包裹的掌控,但只有 64% 能完成整體任務,相較之下,專家抓取後的完成率為 95%。在所有被評估的策略與速度中,沒有力閉合的 414 次抓取皆未能完成任務。因此,標稱任務成功率相同,並不代表在不同執行速度下仍能保持專家的表現。程式碼、資料與評估腳本可於 https://github.com/coenwerem/parcelstow 取得。