ChatPaper

AI論文ランキング

この1週間、世界のAI研究者が注目した論文をやさしく解説

  1. 1
  2. 2

    RESOURCE2SKILL: 人間が作成したマルチモーダルリソースから実行可能なエージェントスキルを抽出する

    🔥 1132026-07-16深く読むarXiv 原文RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources
  3. 3

    RAGU: コンパクトなドメイン適応型LLMを用いたマルチステップグラフRAGエンジン

    🔥 1112026-07-13深く読むarXiv 原文RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM
  4. 4

    たった4Bパラメータで、大規模モデルを凌駕する動画AI

    たった40億パラメータの軽量モデルVideoChat3が、従来の大規模モデルを凌駕しました。まるでコンパクトなエンジンで大型車を追い抜くような驚きの効率性です。その秘密は、新設計の3D視覚変換器(I3D-ViT)と、動画の解像度を状況に応じて調整する技術にあります。さらに、3種類の高品質データセットを自動生成するパイプラインにより、多様な動画を幅広く理解できます。この成果は、動画AIの再現性とアクセス性を大きく向上させ、より多くの研究者や開発者が高度な動画理解を実現できることを意味します。

    🔥 1082026-07-16深く読むarXiv 原文VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
  5. 5

    Boogu-Image-0.1: オープンソースの統一マルチモーダル理解と生成の促進

    🔥 1072026-07-14深く読むarXiv 原文Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
  6. 6

    直接オンポリシー蒸留による弱から強への汎化

    🔥 932026-07-08深く読むarXiv 原文Weak-to-Strong Generalization via Direct On-Policy Distillation
  7. 7

    ABot-N1: 汎用視覚言語ナビゲーション基盤モデルを目指して

    🔥 812026-07-11深く読むarXiv 原文ABot-N1: Toward a General Visual Language Navigation Foundation Model
  8. 8

    Ring-Zero:創発的推論を実現する1兆パラメータへのZero RLのスケーリング

    🔥 792026-07-14深く読むarXiv 原文Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
  9. 9

    ABot-AgentOS: 生涯持続型マルチモーダルメモリを備えた汎用ロボットエージェントOS

    🔥 682026-07-11深く読むarXiv 原文ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
  10. 10

    AIが自分で「振り返り」を教える学習法

    ロボットやAIエージェントが複雑なタスクを学ぶとき、報酬が少なすぎると迷子になりがちです。新しい手法SEEDは、エージェント自身が過去の行動を分析して「この手順は使える」「ここで失敗した」といった技能を自然言語で抽出し、それを次の学習に活かします。いわば、自分で自分にコツを教えるようなもの。これにより、スパースな報酬でも効率的に学習でき、長い対話やツール操作など実用的な課題で性能が向上します。

    🔥 662026-07-16深く読むarXiv 原文SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
  11. 11
  12. 12

    Xiaomi-Robotics-1: 10万時間以上の実世界軌跡データを用いた視覚言語行動モデルのスケーリング

    🔥 542026-07-16深く読むarXiv 原文Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
  13. 13

    SynthDocBench: 長文脈ビジュアル文書理解のための制御されたベンチマーク

    🔥 522026-07-11深く読むarXiv 原文SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
  14. 14

    検索の「暗黙の進捗」を外に出せば精度が上がる

    SearchOSは複数のAIエージェントが協力して情報を探す仕組みです。従来は各エージェントが頭の中だけで検索の進み具合を把握していたため、行き止まりにぶつかると同じ場所をぐるぐる回ってしまう問題がありました。SearchOSはこの進捗状況を目に見える形で共有するようにしました。まるで迷路で足跡を残すように、どこまで調べたかがはっきり分かるのです。その結果、ベンチマークテストで既存手法を上回る性能を達成しました。これにより、情報検索をより確実で効率的にし、無駄な検索を減らして回答の質を高めることが期待できます。

    🔥 492026-07-16深く読むarXiv 原文SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
  15. 15

    xHC: 拡張ハイパー接続

    🔥 472026-07-16深く読むarXiv 原文xHC: Expanded Hyper-Connections
  16. 16

    KnowAct-GUIClaw:深く知り、完璧に行動する——自己進化する記憶とスキルを備えたパーソナルGUIアシスタント

    🔥 442026-07-15深く読むarXiv 原文KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill
  17. 17

    Cura 1T: エージェント型ヘルスケアに特化したモデル

    🔥 432026-07-15深く読むarXiv 原文Cura 1T: Specialized Model for Agentic Healthcare
  18. 18

    OvisOCR2 技術報告

    🔥 422026-07-15深く読むarXiv 原文OvisOCR2 Technical Report
  19. 19

    Read It Back: 事前学習済みMLLMはテキストから画像生成のためのゼロショット報酬モデルである

    🔥 422026-07-13深く読むarXiv 原文Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
  20. 20

    低重複撮影からの4D人間-シーン再構成

    🔥 412026-07-10深く読むarXiv 原文4D Human-Scene Reconstruction from Low-Overlap Captures

1日5分でAIの最前線をキャッチ

毎日、話題の論文5本をやさしい言葉で解説。ミニクイズ付き。

今日の号を読む →