ChatPaper
2026-07-17 · 每天 5 分鐘,讀懂今天最值得知道的論文
看影片對AI來說很吃資源,但VideoChat3就像一個「輕功高手」——只用4B參數(約為其他模型十分之一)就能在理解力上超越更大模型。它的秘訣有兩個:一是全新3D視覺變壓器I3D-ViT,能像人一樣流暢感知影片中的動態;二是自適應幀率,只挑關鍵畫面處理,省力又精準。再加上三個高質量訓練集(共2M+樣本),讓它無論是短片還是長片都能應對。這項進展讓高效能影片AI不再只是大公司的專利,一般研究者也能複現與擴展。
想像AI做完任務後自己寫檢討報告,提煉出「下次要怎麼做」的小撇步——這就是SEED。它讓模型分析自己完成的任務,自動產生自然語言技能,然後在後續決策時,比較有無技能提示的差異,把這個差異變成密集的學習訊號。由於技能分析師就是AI自己,這套機制會隨著AI成長而進化。這讓AI在稀疏獎勵的長程任務中,能自給自足地進步,特別適合多輪互動或工具使用等複雜場景。
想像一下,你查資料時把查到哪、還缺什麼都寫在便條紙上,跟夥伴共享——這就是SearchOS的核心:把隱形的搜尋進度變成明確、持續、共享的狀態。傳統AI搜尋常常繞來繞去重複問,SearchOS把它們串成「關聯式表格補完」任務,每條答案都附引用。在多個基準測試中,SearchOS在所有單一與多智能體方法中拿下第一。為什麼重要?它讓資訊搜尋更可靠、更有效率,減少白做工,提升答案品質。
想像你要訓練一個AI智能體閱讀長篇小說再決策,但目前的RL訓練就像只能用短句練習——上下文一長就爆記憶體。LongStraw提出「先評估共享提示(不計算梯度),再逐一重播回應分支」的策略,讓訓練圖動態縮減。結果在8張H20 GPU上,分組Qwen模型就能處理210萬個位置的評分與反向傳播;每增加一組,峰值記憶體只多0.21GB。這項架構感知執行法,為AI代理的長上下文決策開啟了實用的大門。
就像你看著綠燈卻踩煞車,世界模型在BadWAM攻擊下,想像中的未來與實際動作完全錯位。研究人員利用微小視覺擾動,破壞模型「想像」與「執行」的同步。在模擬中,純動作攻擊讓任務成功率從96.5%暴跌至43.1%。模型看似想像出合理的下一步,但實際執行的動作卻已歪斜。這暴露了世界模型在安全性和可解釋性上的致命弱點——它們可能看起來強健,卻容易被騙去做錯事。