翻訳付きの日次キュレーションされたAI研究論文
構造-物性関係は、生物学、化学、材料科学の基盤であり、そこでは機能、反応性、物理的応答が空間的、化学的、周期的な組織化から生じます。これらの関係を機構的に説明するには、立体化学や結合から対称性、エネルギー論、周期秩序に至るまで、科学的原理と物理的制約を通じて構造的証拠を解釈する必要があります。しかし、このプロセスに人工知能を適用することは、表現と推論の二重の課題を提示します。すなわち、モデルはドメイン固有の構造情報を保持しつつ、特定の証拠がこれらの制約下でどのように予測を支持するかを示さなければなりません。本稿では、タンパク質、低分子、無機結晶を対象としたネイティブ構造推論のためのマルチモーダル科学基盤モデル「SciReasoner」を紹介します。SciReasonerは、座標、トポロジー、周期結合性を統合的な構造認識語彙に離散化し、推論時に構造トークンをアドレス指定可能なエビデンス単位として扱います。相同性制御下での遺伝子オントロジー予測において、SciReasonerは低相同性タンパク質やオーファン様タンパク質に対する細胞成分アノテーションを改善し、F_{max}を0.42から0.55に向上させました。化学分野では、単段階逆合成の精度を0.63から0.72に引き上げると同時に、フラグメントレベルの開裂と前駆体検証のトレースを生成します。材料科学においては、その表現は元素相と化合物相を分離し、高バンドギャップ領域と低バンドギャップ領域を識別します。86のベンチマークにおいて、SciReasonerは67のタスクで最先端の性能を達成しました。二重盲検の専門家評価では、その推論トレースは、98%のケースで最先端の大規模言語モデルと同等かそれ以上に好ましいと評価されました。科学制約下での推論において構造を検査可能な基盤とすることにより、SciReasonerは正確な予測と解釈可能な科学的推論を結びつけます。
主流の視覚・言語・行動(VLA)モデルは、マルコフ性仮定のもとで主に現在の観測から行動を予測するため、長期的かつ時間依存的なタスクに苦戦している。既存のメモリ拡張型VLAは、観測ウィンドウを拡大するか、メモリバンクから履歴を補助的なポリシー側のコンテキストとして取得する。しかし、それらはメモリをVLA推論の本来の潜在埋め込み空間の外に置いたままであり、履歴経験がマルチモーダル推論や行動生成と流動的に統合されるのを妨げている。そこで我々はLaMem-VLAを提案する。これは、履歴経験を潜在メモリトークンに再構築し、VLA推論に直接織り込む潜在メモリネイティブフレームワークである。その中核として、LaMem-VLAは4つの連携コンポーネントを導入する:(i) 履歴経験を補完的な短期・長期メモリ保管庫に整理するキュレーター、(ii) マルチモーダル認知を用いて両方の保管庫をクエリし、コンテキストに関連する証拠を取得するシーカー、(iii) 取得した証拠をコンパクトな短期・長期潜在メモリトークンに再構築するコンデンサー、(iv) これらのメモリトークンを現在の観測と指示とともに1つの連続的な埋め込みシーケンスに注入するウィーバー。履歴経験を同一の連続潜在空間で表現・取得・消費することにより、LaMem-VLAはメモリが直接VLA推論に参加し、制限されたコンテキスト下で行動生成を導くことを可能にする。SimplerEnvおよびLIBEROにおける広範な実験により、我々のLaMem-VLAの優位性が実証された。
ロボット制御における最近の期待にもかかわらず、動画生成モデルは主にコンテンツ生成に焦点を当てているため、ドメインミスマッチの問題を抱えている。例えば、その設計は本質的に、計算効率や物理的リアリズムよりも視覚的忠実性と創造性を優先している。本研究では、具現化知能に特化したDiTベースの動画事前学習パラダイムであるLingBot-Videoを提案する。アーキテクチャの観点からは、密なフレームワークではなくMixture-of-Experts (MoE)を採用することで、モデリング能力と推論効率のより良いトレードオフを実現し、ゼロからスケールアップすることに成功した。データの観点からは、標準的なインターネット動画に、操作、ナビゲーション、自己中心視点を含む広範なロボット向け映像を拡充するデータプロファイリングエンジンを構築し、基本モデルに行動と世界のダイナミクスに対する内在的理解を備えさせる。訓練の観点からは、美的品質、プロンプト追従、動作一貫性といった標準的な基準を超え、物理的合理性とタスク完了に関する整合性を強制する多次元報酬システムを開発する。包括的な評価により、動画基盤モデルとしての性能と効率が検証された。我々は、デジタル創造性と物理的行動を橋渡しする先駆的取り組みとして、初の大規模オープンソースMoE動画基盤モデルであるLingBot-Videoをコミュニティに提供する。
我々は、LingBot-World 2.0(LingBot-World-Infinityとしても知られる)を提案する。これはLingBot-Worldの高度な改良版であり、4つの明確なアップグレードを特徴とする。(1)本モデルは、注意深く設計された因果的事前学習パラダイムの恩恵を受け、出力品質を一定に保ちながら、無限の対話ホライズンを実現する。(2)ベースモデルからリアルタイム変種を蒸留することで、本システムは高速な応答時間を保証し、60fpsでの720p映像ストリーム駆動を可能にする。(3)以前のバージョンと比較して、本アップデートは多様性に富んだインタラクティブ要素を導入し、より幅広いアクション(例:攻撃、弓術、魔法詠唱、射撃)と、より豊富なテキスト駆動イベントを包含する。(4)我々は、世界モデリングの領域におけるエージェント的ハーネスの統合を先駆けて行う。ここで、パイロットエージェントはキャラクターの行動を計画・実行する役割を担い、ディレクターエージェントはシーンの進行に伴い新たな環境要素を合成する責任を持つ。さらに、共有体験を促進するために、複数のプレイヤーがこの鮮やかな世界シミュレーターに同時に没入できるインターフェースを開発する。我々は、主要な14Bモデルと軽量な1.3Bモデルを組み合わせ、単一GPUでの容易な展開をサポートする。
汎用ロボット操作ポリシーは急速に進歩しているが、既存のベンチマークはその能力を体系的に評価する上で限界がある。多くは単純、短期、または狭いスキルのタスクに依存しており、能力のカバレッジが限られており、シミュレーションのみ、または実世界のみで実施されることが多い。シミュレーションはスケーラブルなフィードバックを可能にするが、物理的な展開の課題を見落とし、一方で実世界での評価はコストが高く、時間がかかり、再現が困難である。本稿では、汎用ロボット操作ポリシーの包括的な評価のための、シミュレーションと実世界を統合したベンチマークであるRoboDojoを紹介する。RoboDojoは、多様で補完的な操作能力を網羅する42のシミュレーションタスクと18の実世界タスクを含む。シミュレーションベンチマークは、汎化、記憶、精度、長期実行、オープンボキャブラリ指示追従の5つの次元を評価し、実世界ベンチマークはポリシーを困難な物理世界展開条件にさらす。RoboDojoは、Isaac Simにおける異種並列シミュレーションを通じてスケーラブルな評価をサポートし、リモートクラウドアクセス、標準化されたハードウェア、シーンリセット、評価プロトコル、展開インターフェースを備えた再現可能な実世界評価システムであるRoboDojo-RealEvalを提供する。XPolicyLabと連携することで、ポリシーを一度統合すれば、最小限の適応でシミュレーションと実世界の両方の設定で評価できる。我々は30のポリシーをXPolicyLabに統合し、RoboDojo上で評価して、公開リーダーボードと現在のポリシーパフォーマンスの体系的分析を確立する。ウェブサイトは http://robodojo-benchmark.com/ で公開されている。
強化学習(RL)は、大規模言語モデル(LLM)のポストトレーニングにおいてますます重要性を増している。これまでのLLM向けRLパイプラインは主に同期型であり、バッチをインターリーブする方式であったため、長期的なエージェントタスクには非効率であった。近年、非同期RLが、ロールアウトが到着するたびにモデルを更新する、より効率的な代替手法として登場している。しかし、既存の非同期RLシステムはスループットを重視する一方で、訓練の安定性やタスクの有効性についてはほとんど検討されていない。例えば、広く用いられているGRPOフレームワークにおけるグループ単位のサンプリングは、非同期エージェントトレーニングには自然に適合しないという重要な課題がある。本論文では、非同期RLにおける安定性とオフポリシーの課題に対処するために、シングルロールアウト非同期最適化(SAO)を提案する。オフポリシーの影響を低減し汎化性能を向上させるため、グループ単位のサンプリングをシングルロールアウトサンプリング、すなわちプロンプトあたり1つのロールアウトを用いる方式に置き換える。さらに、このシングルロールアウト戦略を実用的な価値モデル訓練設計により改善する。最適化の安定性を向上させるために、厳格な両側トークンレベルのクリッピング戦略を導入する。SAOは1000ステップにわたって安定した訓練が可能であり、SWE-Bench Verified、BeyondAIME、IMOAnswerBenchなどのエージェントコーディングおよび推論ベンチマークにおいて、GRPOおよびその派生手法を一貫して上回る性能を示す。また、モデルが変化する環境に適応しなければならないシミュレーションされたオンライン学習環境において、シングルロールアウトRLが特に効果的であることを実証する。これにより、SAOはオープンモデルGLM-5.2(750B-A40B)の訓練におけるエージェントRLパイプラインに実際に導入されている。
身体化エージェントは、通常、知覚、記憶、計画、行動モジュールを手作業で設計した構成として構築される。このモジュール性は広大なアーキテクチャ設計空間を提供するが、現在のシステムでは、情報の保存場所、観測の処理方法、モデル呼び出しの接続方法の選択に依然として研究者の直感に依存している。エージェントアーキテクチャ探索(AAS)は、テキスト領域のエージェントに対してそのような設計を自動化するが、シミュレータロールアウトを通じた知覚的身体化エージェントに対する系統的評価は行われていない。本研究では、この転送を調査する。我々は、身体化実行器を編集可能なノード・ワイヤプログラムとしてホストし、シミュレータを認識した実行とエピソードレベルのログを備えた型付きグラフランタイムであるAgentCanvasと、提案、批判、実験、蒸留のサイクルを繰り返し、停滞後にトリガーされるリフレクションを備えたコーディングエージェント探索手順であるKDLoopを導入する。視覚言語ナビゲーション、身体化質問応答、言語条件付き操作にわたる4つの身体化実行器に対して、3つのAAS変種を評価する。結果として得られる3x4行列は、アーキテクチャレベルの探索が身体化タスクにおいて展開可能かつ方向性のある成功率向上をもたらす一方で、見かけ上高スコアの候補の1つはリークを含むものとして棄却されることを示している。同時に、実験はテキスト領域のAASでは抑えられていた制約、すなわち最適化シグナルがロールアウトノイズによってマスクされる可能性、探索が局所的な編集盆地に陥る可能性、詳細なログが利用可能であってもエピソードレベルのクレジット割り当てが部分的にしか出現しないことを露呈する。これらの結果は、身体化エージェントのための自動アーキテクチャ探索の可能性と現在の限界の両方を特徴づけるものである。
線形アテンションモデルは、固定の状態サイズとトークンあたりの固定計算量を可能にする。しかし、状態サイズが限られているため、線形アテンションモデルは、ソフトマックスアテンションに基づくトランスフォーマーアーキテクチャと比較して、長文脈の想起において劣っている。線形アテンションの状態サイズを増加させると想起性能は向上するが、より多くのFLOPsを要する。本研究では、スパースアドレッシング方式を用いてゲート付き線形RNNの隠れ状態を桁違いに高い容量に拡張するアーキテクチャであるSparse Delta Memory(SDM)を紹介する。SDMは、Gated DeltaNetアーキテクチャを拡張し、密なキーと値の外積を、大規模な明示的メモリへのスパース読み取りおよび書き込みに置き換える。我々は、isoFLOP制約下かつ同一パラメータ数において、より高い状態メモリ容量がインコンテキスト学習および長文脈検索タスクの性能を大幅に向上させることを示す。さらに、SDMメモリの初期状態を学習し、それによりそれをパラメトリックメモリとして使用することで、モデルが多様な常識知識および推論タスクにおいてさらに改善することを示す。
我々は、対話型コードエージェント向けのプロダクション評価型ベンチマークであるAgentLensを提案する。多くのコードエージェントベンチマークは、実行結果を1ビット(タスクに合格したかどうか)に還元するが、実際にこれらのエージェントを使用するユーザーは、エージェントが指示に従い、ツールを使用し、自身の作業を検証し、ミスから回復し、その過程でユーザーと対話する、軌跡全体を体験する。AgentLensはその軌跡全体を評価する。客観的なチェックが存在する形式的検証と、LLMによる軌跡レビューおよび並行比較を組み合わせることで、各実行結果に対してスコアがその値となった理由を読みやすく説明する。これにより、AgentLensはモデルのランキング付け以上に有用となる。我々はこれを用いてモデルの振る舞いを診断し、自社エージェントのバージョン間比較を行い、ナイトリー評価パイプラインで製品の回帰を検出する。本ベンチマークはオープンソースとして https://github.com/agent-lens/agent-lens-bench で公開する。
人間は、見知らぬ街を移動しながら、数十平方キロメートルに及ぶ一貫した空間的な心的地図を徐々に形成することができる。AIも同様の規模で空間表現を構築できるだろうか。近年の基盤モデルはシーン再構成や身体性知能の進展をもたらしたものの、都市全体へのスケーリングは主に都市規模のデータ不足により未解決の課題である。このギャップを埋めるため、我々は複雑な都市環境を走行する自律走行車群によって収集された実世界マルチモーダルデータセット「WildCity」を紹介する。本データセットには18の軌跡が含まれ、各軌跡の平均長は83.7kmであり、動的物体、照明変動、不完全なカメラ姿勢といった野外知覚の核心的な課題を保持している。さらに、都市向けに調整された再構成ベースラインを確立し、再構成された環境をクローズドループシミュレータへと変換する。データセットとベースラインに加え、シミュレーション対応型都市デジタルツインへの道筋における主要な課題、すなわちスケーラビリティ、外挿、不確実性を体系的に分析する。最終的にWildCityは、都市規模のレンダリングだけでなく、人間の認知に匹敵する規模で空間を知覚・記憶・推論できるAIの追求全般を促進することを目指す。プロジェクトページ: https://han-xiangyu.github.io/Wild-City/
人間の映像、遠隔操作、ロボットデモンストレーションから学習された視覚ポリシーは、拡張可能な動作の事前分布を提供するが、接触を伴う操作タスクではしばしば失敗する。そのようなタスクでは、成功は局所的な力と接触形状に大きく依存する。触覚センシングはこれらの補完的な信号を提供するが、触覚データの収集は依然としてコストがかかり、センサー、ロボット、タスク間での一般化が困難である。本稿では、事前学習済みの視覚ポリシーに触覚フィードバックを残差補正により適応させる、ポリシー非依存の実世界RLパイプラインであるOmniTacTuneを紹介する。OmniTacTuneは二段階設計を採用しており、まず自律的なベースポリシーのロールアウトから触覚認識学習をブートストラップし、次にオンラインインタラクションを通じて軽量な触覚残差ポリシーを学習する。大規模な実験により、OmniTacTuneが多様な接触を伴うタスク、視覚ベースポリシー、触覚表現にわたって汎化可能であることを示す。4つの実世界の接触を伴うタスクにおいて、視覚ベースポリシーの成功率を5-40%から85-100%に、40-80分以内で改善し、拡張可能な視覚ロボットポリシーへの触覚フィードバック適応の効率的な経路を実証する。プロジェクトページ: https://colinyu1.github.io/omnitactune-site/
大規模言語モデル(LLMs)は自動コード記述において新たな可能性を切り開き、ほとんどのコード補完ツールの基盤となっている。LLMsは主流の言語では優れた性能を発揮するが、学習データが不足しているいわゆる低リソース言語に対するサポートは不足していることが多い。その結果、これらの言語はコミュニティが利用できるコード補完ツールの品質において遅れをとっている。具体例として、Smalltalkに触発された言語であるPharoが挙げられる。そのIDEは現在、単一トークンの補完しか提供していない。本稿では、LLMベースのコード補完をPharoに導入した経験について報告する。第一に、Pharo固有のデータキュレーション、オープンコードLLMの継続事前学習およびファインチューニングを組み合わせたエンドツーエンドのパイプラインについて説明する。第二に、モデルが(i) Pharoの構文を学習し、(ii) 実際のGitHubリポジトリからマスクされたPharoコードを正確に補完するかを評価するための一連のPharoコード補完ベンチマークを紹介する。第三に、Pharoに特化したモデルが元のベースチェックポイントを大幅に上回り、かつPharo補完においてはるかに大規模なコードLLMの精度をも超えることを実証的に示す。全体として、本研究のケーススタディは、低リソースプログラミング言語に対して、IDE内で「リアルタイム」のサポートを提供できるほど小規模なモデルを用いて、強力なLLMベースのコード補完を導入することの実現可能性を示している。
事前学習済み動画生成モデルは視覚運動制御のための有望な基盤技術であるが、その生成する未来予測はタスクの意図から乖離することが多く、確実に行動条件付きであるとは限らない。そのため、これらのモデルを計画や方策抽出に利用することは困難な場合がある。これらの制約に対処するため、我々はRoboTALESを提案する。これはタスクに整合したシミュレーション未来を学習し、それを用いてロボット方策を訓練する単一ステージフレームワークである。本手法は以下の2つの主要な革新を導入する。(1) 複雑なタスクを一連のサブゴールに分解し、モデルの想像を誘導する階層的LLMベースのプランナー。(2) これらの「想像された」未来を評価し、報酬ベースのフィードバックを用いてモデルの内部表現を目標に集中させるVLMベースの批評家。動画生成器を抽象的推論に固定することにより、時間的に一貫したロールアウトとより整合性の高い行動を生成する。我々はRoboTALESをRoboCasaおよびLIBERO10の多様な操作タスクで評価し、本手法が既存手法、特に長期タスクにおいて一貫して優位であることを示す。コードとモデルはhttps://github.com/hananshafi/RoboTALESで公開している。
ピクセル単位の地球観測(EO)基盤モデルは、生成された空間埋め込みにより、現在最先端の性能を達成している。しかし、これらのモデルのスケーリング方法や、事前学習予算の最適な配分については、十分に理解されていない。本論文では、地球観測におけるこれまでで最大の制御されたスケーリング研究を提示する:固定されたピクセル単位のBarlow Twinsファミリー内で、1,024個のGH200スーパーチップ上で395回の学習実行を行い、各モデルを15の下流タスクで評価した。我々は、事前学習損失が下流性能をほとんど予測しない(|ピアソンr| < 0.2)ことを発見した。したがって、損失によってモデルを選択することは、計算資源の大部分を無駄にすることになる。また、学習予算が増大するにつれて、エンコーダとデータは同時に拡大すべきであり、プロジェクタは固定したままにするという、計算資源配分のための単純なルールを見出した。このルールを用いて、我々はピクセル単位のモデル群(0.5B、1B、および訓練中の2Bモデル)を学習し、それらをコンパクトな生徒モデルに蒸留して、埋め込みをデータとして展開する。蒸留された2100万パラメータのTESSERA v2-1B-Mは、テストされたすべてのオープンおよびプロプライエタリモデル(中には桁違いに大規模なものもある)を総合的に上回る性能を示した。これらの生徒モデルは、サービス提供コストの低いマトリョーシカ表現を生成する:16次元のプレフィックスで、128次元の完全性能の92%を保持し、ストレージは1/8で済む。学習完了後、2017年から2025年をカバーするv2グローバル埋め込みを公開する予定である。これらの結果は、ピクセル単位の地球観測基盤モデルをスケーリングするための、具体的かつ経験的に裏付けられたレシピを提供する:大規模なエンコーダを学習し、下流性能で選択し、柔軟な生徒モデルに蒸留する。すべてのコードは https://github.com/ucam-eo/tessera で公開される。
マンモグラフィーからの正確な乳がん分類には、頭尾方向(CC)像と内外斜位方向(MLO)像という相補的な情報の効果的な統合が必要であり、これにより乳房異常のより完全な特徴付けが可能となる。しかし、既存のマルチビュー学習アプローチは、通常、特徴レベルの集約や単一層のクロスアテンションに依存しており、ビュー固有の表現と共有表現が絡み合い、相互作用が限られたネットワーク深度に制限される可能性がある。これらの限界に対処するため、我々は、凍結されたビジョントランスフォーマーバックボーン内でプロンプトベースの適応とクロスビューフュージョンを統合する、トークン中心のデュアルビュー学習フレームワークを提案する。本フレームワークは、ビュー間の相互作用を構造化されたトークンレベルの通信として再構築し、専用の融合トークンがクロスアテンションを介してCC像とMLO像間の双方向情報交換を明示的に符号化し、直接的な特徴融合に依存するのではなく、クロスビュー依存関係の中間キャリアとして機能する。単一層で融合を適用する従来の方法とは異なり、融合モジュールは複数のトランスフォーマー深度に挿入され、エンコーダ階層全体にわたる漸進的かつ反復的な相互作用を可能にする。融合トークンはトークンシーケンスに再統合され、後続のトランスフォーマー層によって洗練され、ビュー固有の構造を保持しつつ、相補情報の階層的伝播を促進する。VinDr-MammoおよびCMMDデータセットでの実験により、線形プロービング、プロンプトのみの適応、および従来の融合ベースラインに対して一貫した改善が示された。VinDr-MammoのBI-RADS分類タスクにおいて、本フレームワークはF1スコア50.40%、AUC 0.8090を達成し、二値設定ではデュアルビュー融合ベースラインに対してAUCが0.10向上した。アブレーション研究により、トークンベースの融合と多深度相互作用設計の有効性がさらに検証された。
触覚は、摩擦やコンプライアンスといった本質的な物体の材料特性を知覚するために必要な物理的な基盤を提供するが、視覚だけではしばしばこれらの特性を識別できない。しかし、マルチモーダルLLMにこの触覚を付与する最近の試みでは、ゼロサム的なトレードオフが露呈している。すなわち、コンパクトなモデルの限られたパラメータ予算では、新たな感覚モダリティを獲得することと、既存の視覚・言語推論能力を維持することの間で選択を迫られるのである。本稿では、MLLM向けのマスク分離型触覚アライメント学習フレームワークであるSplashを提案する。Splashは、学習済みパラメータの重要度を定量化し、パラメータ空間を休眠部分空間と重要部分空間に分割する。重要な部分空間は凍結され、一般的な視覚知識を保護する安定したアンカーとして機能する一方、Splashは分離された休眠部分空間を更新し、LLMへの触覚アライメントを内在化させる。この選択的かつ非破壊的な拡張は、破滅的忘却を効果的に防止し、モダリティの非破壊的拡張を保証する。広範な実験により、SplashはLLM部分に追加の推論オーバーヘッドを発生させることなく触覚推論を実現し、SSVTP、TVL、TacQuadなどの視覚・触覚ベンチマークにおいて最先端の性能を示すと同時に、本来の汎用能力を維持することを実証した。
長期地平線における世界モデルの失敗は、従来、誤差の蓄積として一般化されてきたが、この枠組みではどの種類の誤差が蓄積するのかが区別されていない。本研究では、運動学的対動的という再枠組みを提案する。すなわち、世界モデルは動的にではなく運動学的に想像する傾向がある。これを、閉形式運動学的ヌルからロールアウトがどの程度逸脱するかを計測するステップごとの診断指標である想像上の運動学的一貫性誤差(iKCE)として具体化し、物理条件が領域境界を越えた際にiKCEが応答するかを検証する摂動プロトコルと組み合わせる。本診断指標を、DMC walker-walkで学習された公開済みDreamerV3チェックポイントに適用したところ、想像上のiKCEは対応する実物理ロールアウトよりも約2桁大きい値を示した。歩容崩壊境界をまたぐ摩擦スイープにおいて、学習済み方針の報酬が同じ範囲で崩壊する一方、モデルのiKCEは統計的に平坦なまま推移し、運動学的であって動的ではないという兆候が得られた。本診断指標は、身体の歩容周期よりも長い地平線において、運動学的想像と動的想像を区別する。