ChatPaper
2026-07-17 · 1日5分、今日知る価値のある論文をわかりやすく
たった40億パラメータの軽量モデルVideoChat3が、従来の大規模モデルを凌駕しました。まるでコンパクトなエンジンで大型車を追い抜くような驚きの効率性です。その秘密は、新設計の3D視覚変換器(I3D-ViT)と、動画の解像度を状況に応じて調整する技術にあります。さらに、3種類の高品質データセットを自動生成するパイプラインにより、多様な動画を幅広く理解できます。この成果は、動画AIの再現性とアクセス性を大きく向上させ、より多くの研究者や開発者が高度な動画理解を実現できることを意味します。
ロボットやAIエージェントが複雑なタスクを学ぶとき、報酬が少なすぎると迷子になりがちです。新しい手法SEEDは、エージェント自身が過去の行動を分析して「この手順は使える」「ここで失敗した」といった技能を自然言語で抽出し、それを次の学習に活かします。いわば、自分で自分にコツを教えるようなもの。これにより、スパースな報酬でも効率的に学習でき、長い対話やツール操作など実用的な課題で性能が向上します。
SearchOSは複数のAIエージェントが協力して情報を探す仕組みです。従来は各エージェントが頭の中だけで検索の進み具合を把握していたため、行き止まりにぶつかると同じ場所をぐるぐる回ってしまう問題がありました。SearchOSはこの進捗状況を目に見える形で共有するようにしました。まるで迷路で足跡を残すように、どこまで調べたかがはっきり分かるのです。その結果、ベンチマークテストで既存手法を上回る性能を達成しました。これにより、情報検索をより確実で効率的にし、無駄な検索を減らして回答の質を高めることが期待できます。
AIエージェントの長文脈対応には大量トークンでの強化学習(RL)が不可欠ですが、従来は訓練グラフが大きくなりメモリが課題でした。新手法「LongStraw」は、共有プロンプトを自動微分(autograd)なしで評価し、応答ブランチを一つずつ再生することでグラフを圧縮。まるで書類を必要な部分だけ抜き出すような効率です。8台のH20 GPUで210万ポジションの処理を実現し、グループサイズを増やしてもピークメモリは0.21GBの増加にとどまりました。固定GPU予算で数百万トークン規模のRL後処理が可能になり、長文脈を要するAIエージェントの意思決定を大きく前進させます。
世界行動モデル(WAM)は、未来を想像しながら行動を決めるAIです。BadWAMは微小な視覚的摂動を加えるだけで、その想像と行動の同期を壊します。あたかも地図を正しく読んでいるのに足が勝手に違う方向へ進むようなものです。実験では、行動だけを標的にした攻撃で成功率が96.5%から43.1%に急落しました。モデルは正しい未来を想像しているように見えますが、実際にはずれた行動を実行しています。この脆弱性は、WAMの安全性と解釈可能性の約束を危うくします。