ChatPaper
近 7 天全球 AI 研究者都在按讚的論文,白話解讀
看影片對AI來說很吃資源,但VideoChat3就像一個「輕功高手」——只用4B參數(約為其他模型十分之一)就能在理解力上超越更大模型。它的秘訣有兩個:一是全新3D視覺變壓器I3D-ViT,能像人一樣流暢感知影片中的動態;二是自適應幀率,只挑關鍵畫面處理,省力又精準。再加上三個高質量訓練集(共2M+樣本),讓它無論是短片還是長片都能應對。這項進展讓高效能影片AI不再只是大公司的專利,一般研究者也能複現與擴展。
想像一下,學生不用從頭解題,只要看老師的筆記就能學會捷徑。Direct-OPD就是這樣——它把弱模型經過RL後產生的「策略偏移」(log-ratio),當作隱含獎勵傳給強模型,省去強模型自己的RL訓練。結果?Qwen3-1.7B在AIME 2024上從48.3%進步到58.3%,只需4小時、8張A100 GPU。這讓改進大模型變得更快更省錢。
人類導航會先思考再行動,但機器人常「腦衝」——感知和動作混在一起,一出錯就迷路。ABot-N1 把認知和執行分開:先用「慢系統」理解語言指令、鎖定目標像素(像在地圖上標記),再交給「快系統」精準移動。結果?城市級導航中,找到指定地點的成功率從 35% 暴增到 77.3%,室內外複雜場景的成功率也高達 95.4% 和 92.9%。這套設計讓導航更穩、更易懂,未來機器人送貨、救災才真的靠得住。
就像電腦有作業系統,機器人現在也有了——ABot-AgentOS。它不只控制動作,還具備終身多模態記憶,能記住過去經驗並自我改進。在全新 EmbodiedWorldBench(16 種場景、200 多項任務)上,靜態版本已拿下 LoCoMo 87.5、OpenEQA 59.9。更厲害的是「失敗驅動自我演化」:從記憶錯誤中學習,自動產生更新,卻不洩漏未來資料。演化後分數再攀升:LoCoMo 88.7、OpenEQA 60.4。這代表機器人能像人類一樣從經驗中成長,真正處理長期複雜任務。
想像AI做完任務後自己寫檢討報告,提煉出「下次要怎麼做」的小撇步——這就是SEED。它讓模型分析自己完成的任務,自動產生自然語言技能,然後在後續決策時,比較有無技能提示的差異,把這個差異變成密集的學習訊號。由於技能分析師就是AI自己,這套機制會隨著AI成長而進化。這讓AI在稀疏獎勵的長程任務中,能自給自足地進步,特別適合多輪互動或工具使用等複雜場景。
想像一下,你查資料時把查到哪、還缺什麼都寫在便條紙上,跟夥伴共享——這就是SearchOS的核心:把隱形的搜尋進度變成明確、持續、共享的狀態。傳統AI搜尋常常繞來繞去重複問,SearchOS把它們串成「關聯式表格補完」任務,每條答案都附引用。在多個基準測試中,SearchOS在所有單一與多智能體方法中拿下第一。為什麼重要?它讓資訊搜尋更可靠、更有效率,減少白做工,提升答案品質。