翻訳付きの日次キュレーションされたAI研究論文
検証可能な報酬を用いた強化学習(RL)は軌道レベルのアドバンテージ推定を行うが、長期かつマルチターンのエージェントタスクにおいて結果を左右する数少ない重要決定にクレジットを正しく割り当てられないことが多い。最近の研究では、クレジット割り当てのための特権的自己蒸留が導入され、より密な教師信号が提供されるが、そのような局所的な信号が逐次的なクレジットをどのように表現すべきかは依然として不明である。我々は、エージェント強化学習におけるターンレベルのクレジット割り当てのための、クリティック不要かつ再帰的な手法であるAgentOPSDを提案する。AgentOPSDは、トークンレベルの教師-生徒対数確率ギャップをターンレベルのエビデンスに集約し、対数オッズ空間でベイズ信念状態を再帰的に更新する。これにより、疎な結果の教師信号をターンレベルのクレジット信号に変換する原理に基づく再重み付けスキームが得られ、連続する状態間の周辺信念の改訂を通じて決定的なターンを特定する。本手法は標準的な方策最適化と完全に互換性があり、追加のクリティックも追加のロールアウトも必要としない。我々はAgentOPSDをALFWorld、WebShop、Search-QA上で、Qwen2.5モデル(3Bおよび7Bの2スケール)を用いて評価する。AgentOPSDはGRPOおよび強力な自己蒸留ベースラインを上回り、Qwen2.5-7Bを用いたALFWorldで89.1%の成功率を達成する。アブレーション研究により、その改善はターンレベルの集約と履歴依存の再帰的信念更新に起因することが示される。
コンピュータ利用エージェント(CUA)はデジタル世界全体で急速に発展している。CUAの軌跡は、エージェントの行動、状態、推論を記録する。タスク指示を達成したかどうかを検証することは、CUAの評価、データキュレーション、強化学習の中核をなす。人間が書いた検証器も人間のアノテーターも、このような検証を大規模に提供することはできないため、この分野ではCUAの軌跡の判定者として視覚言語モデル(VLM)に頼る傾向が強まっている。しかし、これらのVLM判定者が十分に信頼できるのかという根本的な疑問は、長い間検討されないままであった。 この問題を体系的に研究するため、我々はCUAの軌跡に対するVLM判定者を評価する、現実的で高品質なベンチマークOSRewardを紹介する。この軌跡は、複数のプラットフォームにわたって人間が検証した指示を実行する多様なエージェントバックボーンから得られ、多段階の人間によるアノテーションを通じて正解の判定結果が厳密にラベル付けされる。これに基づき、真に困難な事例を集めたチャレンジセットOSReward-Hardと、きめ細かい効率性とアライメントのスコアリングのためのOSReward-Multiを導出する。 これまでで最も包括的なVLM判定者の評価により、最先端のモデルでさえ理想的な判定者には及ばず、共通して、失敗した実行を成功として誤ってラベル付けするという体系的な寛大さバイアスを持つことが明らかになった。信頼に足る少数のモデルは大規模に実行するにはコストが高すぎる一方、手頃なオープンモデルははるかに遅れを取っている。 このギャップを埋めるため、我々はCUAコミュニティ向けに、推論注釈付きの軌跡判定のオープンコーパスOS-Shepherd-100Kを構築し公開する。これを用いて、最先端モデルよりも30〜60%低いコストで商用判定者に匹敵する、低コストで安定した信頼性の高い報酬信号を提供するオープン報酬モデルOS-Shepherd(9Bおよび35B)を訓練する。広範な分析は、大規模な信頼性の高いCUA報酬の設計にさらなる知見をもたらす。我々のコード、ベンチマーク、データセット、モデルチェックポイントは、https://os-copilot.github.io/OSReward-Home/ で入手可能である。
短い音声知覚区間は、wav2vec 2.0オーディオ埋め込みに対するCLIPスタイルの目的関数を用いて訓練された深層ネットワークにより、非侵襲的な脳磁図(MEG)記録から検索できる。しかし、その重みは電気生理学的量に直接対応しておらず、どの音声特性が検索を駆動しているかは依然として不明である。 我々は、高性能なMEG-to-audio検索アーキテクチャを基盤としつつ、そのフロントエンドとデコーダの両方を再設計する。その空間的注意は平坦化されたセンサー配置に作用するが、我々はこれを3次元MEGヘルメット形状上で定義される球面調和関数に置き換える。被験者固有の表現を270ブランチから25ブランチに削減し、各ブランチに時間フィルタを追加して空間的・時間的に神経源と対応させ、畳み込みデコーダをより浅い構造にする。訓練前に眼球性および心臓性の成分を除去し、刺激同期型の近道学習のリスクを低減する。 MEG-MASCにおいて、本モデルは6つの訓練済み解にわたり、1005候補中のTop-1精度39.75±0.34%を達成し、デコーダのパラメータ数は約20分の1である。その重みはソース空間に写像され、音声知覚ネットワークと整合する生成源を回復する一方、左半球優位のブランチは右側では明瞭でない高周波数の律動的成分を担う。ペアMEGオクルージョンにより、19の刺激特徴のうち15が寄与し、無音、音強度、母音、および音響開始が最も大きな効果を示す。ランダムな単語リストでは逆の挙動が見られる:ナラティブMEGをそれらに置換すると検索が改善され、ナラティブ構造を伴わない活動は、一貫した音声中の活動よりも回復可能な情報が少ないことを示す。wav2vecターゲットは、精度を損なうことなく約12の学習特徴次元に削減できるが、強い時間的圧縮は明確な損失を引き起こす。 総合すると、ソースマッピングと入力介入は、何が検索を駆動するかを明らかにする。
自由形式のテキストから大規模かつ自由に探索可能な3Dワールドを生成することは、システムがグローバルな空間的一貫性、豊かなローカルコンテンツ、および下流の編集・再利用に適した明示的なアセットを同時に維持する必要があるため、依然として困難な課題である。本稿では、オープンワールド3Dシーン生成のための完全エージェント型コース・ツー・ファインフレームワークであるWorldClawを提案する。プランニングエージェントは、テキストプロンプトを領域、地形、アセット、マテリアル、空間関係の構造化仕様に変換する。WorldClawは次に、セマンティックレイアウト、再利用可能なアセット、生成的または手続き型のマテリアル、および領域認識型高さ場から、グローバルに一貫した地形基盤を構築する。詳細を要求する領域に対しては、地形条件付き合成を生成し、編集可能なテクスチャ付きメッシュを再構成して、地形上での配置を復元する。さらに、レンダリングベースのエージェントが地形、オブジェクト、外観、および接触を精緻化する。多様なオープンワールドプロンプトにわたって、WorldClawは一貫したグローバル地形構造を維持しつつ、空間的に整合性のある構成、視覚的に魅力的なローカルコンテンツ、および編集可能なインスタンスレベルのアセットを備えた大規模シーンを生成する。
空間知能は身体性エージェントにとって基本的な能力であるが、既存のベンチマークは単一または少数の視点からの局所的空間知覚に焦点を当てており、連続的かつ長期的な視覚ストリームにわたるグローバルな空間認識を見落としている。この限界に対処するため、我々はビデオ理解におけるグローバル空間知能のためのVQAベンチマークであるGlobal-Spatial-Temporal Benchmark(GST-Bench)を紹介する。GST-Benchは、6,790分の合成生成ビデオから導出された人間検証済みの質問で構成される。これは、モデルが入力ビデオには存在しない新規視点から正確な空間推論を行い、自己中心的観察をグローバルな俯瞰画像にマッピングすることを要求する。22の最先端の視覚言語モデル(VLM)に対する包括的な評価は、モデルと人間の間の顕著なギャップを浮き彫りにする:最強のゼロショットモデルは42.68しか達成できず、人間のスコア79.08を大きく下回る。このギャップの原因を探るため、我々はGST-Bench-Localを構築し、モデルが同一のタスク形式の下で強力な局所的空間理解を示すにもかかわらず、長期的な観察をグローバルに一貫したシーン表現へと統合することに依然として失敗することを見出した。さらに、この課題に関する将来の研究を促進するための補完的リソースとして、グローバル空間推論のためのデータセットGST-Trainを提供する。
長期的なツール使用を行う大規模言語モデルエージェントの訓練は、通常、構築と検証にコストがかかる実環境または合成された実行可能環境とのインタラクション、あるいは現実世界に結びつけることが難しい外部シミュレータに依存している。本稿では、訓練中の外部環境とのインタラクションを世界リハーサルに置き換えるエージェンティック強化学習手法であるEnvACEを提案する。方策は行動とリハーサルを交互に行う。すなわち、まずツール呼び出しを生成し、次に環境の役割を担ってその行動によって誘発される応答を生成し、リハーサルされた応答に基づいてその後の決定を条件付ける。両方の役割は、タスク成功報酬を用いてエンドツーエンドで共同最適化される。世界リハーサルを通じて、方策は行動と環境応答の関係をそのパラメータに内在化し、意思決定を直接支援するエージェント世界モデルを獲得する。BFCL-v4、tau^2-Bench、VitaBench、FinMCP-Benchにわたり、EnvACEは強力で転移可能な性能を達成し、総合評価では環境スケーリングベースラインを上回る。さらに、対照実験により、世界リハーサルがモデル規模を問わず方策学習を一貫して改善することが示された。テスト時には、内在化された世界モデルにより、確定実行の前に内部リハーサルを行うことができ、中程度のリハーサル予算のもとで、追加の外部インタラクションなしにさらなる性能向上が得られる。本研究の知見は、外部環境の制約を超えたLLMエージェント訓練のスケーリングに向けた新たな道として世界リハーサルを確立するものである。コードはhttps://github.com/Within-yao/EnvACEで公開している。
マルチモーダル大規模言語モデルは受動的知覚には優れているものの、多段階の時間的推論を必要とする複雑な視覚認知タスクには苦戦している。この性能低下は、言語ベースの推論に本来備わる曖昧さに大きく起因しており、連続的な視覚変化を正確に言語化することがしばしば困難である。この問題に対処するため、我々は視覚的論理と潜在イメージを整合させるマルチモーダルフレームワークであるChronoVisionを提案する。教師ありファインチューニングでは、再構成型視覚ヘッドが最終変換状態の潜在表現を予測し、関心領域注意定位モジュールが意味的スパンクエリを介してモデルを重要な視覚的証拠に集中させる。ポストトレーニングでは、結果の正確性、潜在プロセスの整合性、教師なし視覚的焦点を評価する複合報酬関数に導かれた、暗黙的プロセス接地メカニズムを備えた強化学習を適用する。さらに、ビデオ推論を厳密な画像順序付けタスクに再構成することにより時間的追跡を評価する新しいデータセットVbvr-VQAを導入する。実験により、ChronoVisionはVbvr-VQAにおいてドメイン内精度74.8%、ドメイン外精度71.6%という最先端の性能を達成し、さらに高い難易度のクロスドメインベンチマークであるIntPhys2においても55.0%という堅牢な精度を達成することを実証する。
統一マルチモーダル検索は、異種入力によって表現される複雑なユーザ意図を満たす候補を特定することを目的とする。大規模視覚言語モデル(LVLM)に基づく検索器は効率的かつスケーラブルであるが、生のマルチモーダル入力を直接符号化すると、細かい識別的手がかりを見落としがちであり、意味的に類似した候補間の混同を引き起こす。近年の手法では、チェーン・オブ・ソート(CoT)推論を生成してクエリ表現を豊かにすることで、この限界を緩和している。しかしながら、そのような推論は通常、クエリのみから導出される。つまり、クエリが記述している内容は説明するが、検索器が何を誤解しているかは説明しない。我々は、効果的な検索推論は、むしろ検索フィードバックに条件付けられるべきであると主張する。この知見に基づき、我々は、初期検索で得られた候補について推論し、検索中心チェーン・オブ・ソート(RC-CoT)を生成することを学習する、埋め込み器・アドバイザ構成のフレームワークであるUniME-R1を提案する。アドバイザは候補を個別に分析し、埋め込み器が混同している識別的手がかりを特定する。ターゲットが初期のtop-k集合に含まれる場合、UniME-R1は候補を直接再ランキングする。そうでない場合、RC-CoTを生成して検索方向を洗練し、デュアルモード埋め込み器を用いてコーパス全体の再検索を実行する。本フレームワークの学習では、現実的な検索失敗を模擬するためにハードネガティブをマイニングし、直接検索とRC-CoT拡張検索を共同で最適化し、教師あり学習と検索指向強化学習を通じてアドバイザを検索結果と整合させる。MMEB-V2および多様な一般マルチモーダル検索ベンチマークにおける広範な実験により、UniME-R1が強力なベースラインと比較して検索性能を一貫して向上させることが実証された。
経済世界モデル(EWM)は、異質的エージェント、その信念と行動、ならびにそれらの相互作用が集計的成果を生み出す市場および制度メカニズムをモデル化することにより、経済が内部からどのように進化するかをシミュレートする生成的経済モデルである。本稿は、異質的エージェントが行動し、相互作用し、適応し、市場および制度と共進化することによって、経済ダイナミクスを内部から生成する生成エンジンとしての経済世界モデル構築のための実装ロードマップを開発する。我々はEWMシステムを、固定ルールベースのエージェント世界から、適応型およびLLMベースのエージェント世界、自己進化型エージェント、進化する制度世界、実観測データと整合するシミュレーションから実世界への経済ツインに至るまで、6段階の能力ラダーとして体系化する。これらの段階にわたる系統的文献調査により、既存研究は依然として低次のエージェント・シミュレーション環境に集中しており、自己進化型エージェント、内生的制度、持続的な実証的整合性、検証済みの経済メカニズムを備えたシステムは依然として稀であることが明らかになる。EWMのアジェンダを実装ブループリントに変換することにより、本稿は、人間の意思決定者にとっての高忠実度サンドボックスとして、またAIエージェントにとっての訓練・計画・評価・安全性の基盤として機能し得る、次世代の経済シミュレーション環境の開発を加速することを目的とする。我々は、将来の研究を支援するために、厳選された論文リストと関連リソースを公開する。
大規模言語モデル(LLM)がエージェント型システムにますます組み込まれるにつれ、その能力はモデルの重みだけでなく、ハーネス、すなわちそれらを取り巻くプロンプト、ツール、制御フロー、メモリ、およびオーケストレーションコードにも依存するようになっている。これにより、自動化されたハーネス最適化——AIシステムによる反復的かつ評価に導かれたハーネスの改善——は、AIシステムを改善するための重要な経路であると同時に、AIシステム自身にとって高度な能力要件ともなっている。それにもかかわらず、コミュニティには、最先端のLLMがこのタスクをどの程度うまく遂行するかを測定するための共通プロトコルが存在しない。本稿では、高コストで確率的な評価下でのエンドツーエンドのハーネス最適化のためのベンチマークであるHarnessOpt-Benchを紹介する。オプティマイザ(コーディング用ハーネスと組み合わせたLLM)は、対象エージェントのシードハーネス、段階的な評価フィードバック、および固定された対象評価予算を受け取る。オプティマイザはハーネスを編集し、最終候補を指名する。その最終候補は、探索全体を通じてアクセスできない保留テスト分割において、シードに対する正規化された改善度によってスコアリングされる。信頼できる実行環境が評価境界を強制し、対象エージェントのリソース使用量を測定し、監査用に候補バージョンを保存する。我々は、共有コーディングハーネスの下とネイティブハーネスの下の両方で、4つの下流タスクにわたり、111回のスコアリング済み実行において、5つの最先端LLMをオプティマイザとして評価した。実験結果は、オプティマイザモデル間の差異が、それらが作用するコーディングハーネス間の差異よりも大きいこと、ネイティブハーネスが一貫して優れているわけではないこと、および改善度がタスクとシードの体制によって大きく異なることを示している。これらの結果は、ハーネス最適化が、測定可能かつ判別可能な能力であり、改善の余地が大きいことを確立するものである。
データエージェントは、組織のワークスペース上での自然言語による分析を可能にする。そこでは、関連するエビデンスがデータベース、構造化ファイル、長文ドキュメント、マルチメディアに散在している可能性がある。既存のベンチマークは、構造化クエリ、検索、オープンエンド分析を概ね個別に扱っており、異種エビデンスの発見、完全な表形式出力、決定的評価を十分に統合していない。我々は、データエージェントがタスク固有の異種混在ワークスペースから検証可能な表形式結果を生成するベンチマークである DataSpace を提案する。DataSpace には、410 の言語横断タスクと 7,439 のアーティファクトが含まれ、CSV、JSON、SQLite、Markdown、PDF、ビデオにわたり合計 15.01 GB に及ぶ。DataSpace はまた、KDD Cup 2026 Data Agents for Complex Data Analysis コンペティションの公式評価ベンチマークとしても使用された。各エージェントは質問とワークスペースのみを受け取り、要求された完全な表形式結果を返す。我々は、DataSpace-Builder を用いて DataSpace を構築した。DataSpace-Builder は、言語横断変換、制約認識リレーショナルサンプリング、モダリティルーティングとアーティファクトレンダリング、および 11 名のドメイン専門家による人間レビューとタスク修正から構成される実行基盤型フレームワークである。決定的評価器は、ヘッダー不変の列整列、型および精度を考慮した正規化、順序認識の行比較を実行する。最近リリースされた 6 つの最先端マルチモーダルモデルと、広く使用されている 5 つのエージェントハーネスを用いた評価では、最高精度は 66.34% に達し、バックボーンを固定した場合のハーネス選択により 15.36 ポイントの差が生じた。マルチモーダルエビデンスの統合とジョインは、6 つのバックボーンすべてにおいて精度を一貫して低下させた。これらの結果は、DataSpace が未飽和であることを示し、データエージェントの信頼性向上に向けた重要な課題を明らかにする。
現代ギリシャ語は、法務、エネルギー、金融、医療アプリケーションにおける検索拡張生成(RAG)にとって重要であるにもかかわらず、NVIDIAのNemotron検索モデルや主要な多言語検索ベンチマークには含まれていません。本稿では、コーパスマイニング、合成教師データ、検索モデルのトレーニング、リランカーの適応、リーダーのファインチューニング、およびHERAと呼ばれる新しいベンチマークを含む、現代ギリシャ語向けNemotron検索スタックのエンドツーエンド適応を提示します。本研究は、パラメータフリーのBM25ベースラインが、専門分野のギリシャ語コーパスにおいて、いくつかの既製の多言語高密度検索モデルを上回ることを示しています。65,773件のギリシャ語検索ペアでファインチューニングした後、Nemotron 1BエンベッダーはnDCG@10を0.362から0.835に改善し、未適応のモデルを大幅に上回ります。学習された言語能力は一般領域のギリシャ語にも転移しますが、BM25に対する優位性は依然としてドメイン依存です。さらに、クロスエンコーダーリランカーを適応し、専門分野全体で一貫した改善を示します。最後に、根拠に基づく生成のためにNemotron 30B-A3B混合エキスパートリーダーをLoRAチューニングし、判定された回答の正確性を29.4%から66.9%に向上させるとともに、忠実性と引用品質を大幅に改善します。また、検索拡張生成のための初の大規模ギリシャ語ベンチマークであるHERAを導入し、ギリシャ語RAGシステムの今後の研究を支援するために、適応したモデルとベンチマークを公開します。
オンポリシー蒸留(OPD)は、LLMのポストトレーニングにおける強化学習に代わる有望な手法として注目されているが、多言語環境での有効性はまだ十分に検討されていない。本研究では、英語・韓国語・日本語における数学的推論に対して、OPDとその発展版であるオンポリシーデルタ蒸留(OPD^2)を検証する。OPD^2は、ポストトレーニング済みの教師モデルとそのベースモデル間の確率ギャップを学習信号として用いることで、OPDを改善する。Qwen3を用いた実験では、OPD^2が元のOPDを一貫して上回り、特に韓国語と日本語で顕著な改善が見られ、英語-韓国語間の性能ギャップも概ね縮小することが示された。さらに、英語のみのOPDでも韓国語と日本語の性能が向上する可能性があるが、応答が英語に偏ることが多く、対象言語の応答を維持するには多言語データの重要性が強調される。
視覚-言語-行動(VLA)モデルは、主視点と手首視点の観測を並列的な視覚入力として扱うことが多く、ロボット操作におけるそれらの異なる役割を見落としている。しかしながら、高精度な操作は、グローバルなタスクコンテキストの下で手首の局所的インタラクションがどのように進展するかを予測することで恩恵を受ける。この限界に対処するため、我々はタスク条件付きの未来手首モデリングを備えたVLAモデルであるWorld-to-Wrist VLA(W2-VLA)を提案する。現在の多視点観測とタスク指示が与えられると、W2-VLAは潜在モデリングトークンの集合を視覚-言語モデルと手首予測器の間のコンパクトなインターフェースとして文脈化する。このインターフェースと観測された手首履歴に条件付けられて、予測器は未来の手首潜在表現を予測し、それが行動予測のための未来認識コンテキストへと変換される。さらに、操作の進展、物理的遷移の手がかり、および手首の局所的証拠を記述する構造化アノテーションを生成する合成パイプラインであるW2-CoTを導入する。これらのアノテーションは、タスク条件付き潜在インターフェースを形成する補助的な教師信号を提供する。LIBERO、RoboTwin 2.0、および実世界の操作タスクにおける実験により、単腕および両腕の両設定において高精度で接触に敏感な操作が改善されることが実証され、同時に80Hzを超える行動生成レートが維持される。
視覚・言語・動作(VLA)モデルはロボット操作の強力なパラダイムとなっているが、異種のロボット形態に対する単一の汎用ポリシーを訓練することは依然として未解決の問題である。既存手法には主に2つの限界がある。第一に、多様な視覚データおよび相互作用データに共有されるダイナミクス事前知識を十分に活用しておらず、クロスエンボディメント転送を制限している。第二に、形態固有の行動を共通形式に変換するために大規模な手動前処理を必要とする。これらの限界を克服するため、我々は共有のダイナミクス事前知識と形態固有の制御を学習するクロスエンボディメントVLAであるDyPES-VLAを提案する。まず、クロスエンボディメントデータ上で視覚・言語モデル(VLM)に未来予測を目的とした訓練を行うことで共有のダイナミクス事前知識を学習し、共有クエリ表現が物体の動き、接触、および相互作用に起因するシーン変化を捉えるように導く。次に、形態固有のMixture-of-Experts(MoE)行動ヘッドが、異種の行動を共通形式に手動で事前整列させることなく、これらの共有ダイナミクス事前知識を各形態のネイティブな行動空間で直接実行可能な制御に変換する。このヘッドは、共通の時間的動作構造を捉えるために注意層を共有し、形態固有のフィードフォワード専門家が異なる形態に固有の運動学的制約と制御セマンティクスを解決する。汎用ポリシーとして、提案手法はシミュレーションおよび実世界評価の両方で最先端の性能を達成し、LIBEROで98.0%、RoboCasa-GR1で59.25%、RoboTwin 2.0で89.02%の成功率を記録した。
3Dシーンの理解は身体化知能の基盤であり、視覚的・幾何学的手がかりを含む複数のモダリティからの異種情報を統合的に推論することが必要である。しかしながら、これらのモダリティの関連性はクエリごとに異なることが多い。既存のマルチモーダル大規模言語モデル(MLLM)は通常、固定されたモダリティの組み合わせに依存しており、クエリ依存のモダリティ要件を見落としている。このような硬直的な設計は、無関係なモダリティからの意味的ノイズを導入し、より情報量の多いモダリティを十分に活用しないため、計算の無駄と推論の希薄化を引き起こす可能性がある。これらの課題に対処するため、本論文では、意味を考慮した3Dシーン理解のために異種モダリティを動的に統制する統一MLLMであるSmartMageを提案する。具体的には、SmartMageは以下の要素を組み込む。(1)意味的先行知識、テキストとモダリティの整合性、モダリティ品質を用いてタスクに関連するモダリティを選択するSemantic-guided Modality Adaptive RouTng(SMART)モジュール、(2)モダリティ先行知識を活用してエキスパートの活性化を導き、マルチモーダル推論における適応的特化を促進するModality-Aware Gating Expert(MAGE)モジュール。実験的に、SmartMageは5つの3Dシーン理解ベンチマークで最先端の性能を達成し、RGBのみのビデオ理解ベンチマークでも競争力のある結果を得る。我々の診断用ベンチマークScanFacetでは、タスクが細粒度の意味カテゴリに分割され、各意味タイプが好むモダリティの組み合わせの分析を可能にする。観察されたモダリティと意味のパターンは、SmartMageの有効性をさらに裏付けるものである。プロジェクトページ: https://yuecheong.github.io/SmartMage/。
コンピュータ利用エージェントは、ユーザーがすでに実行したルーチンを再導出するために、フロンティアモデルによる推論コストをすべて負担している。というのも、今日のエージェントのメモリは、ユーザーが「言った」ことを記録しても、「行った」ことを記録しないからである。我々は、受動的にキャプチャされた画面アクティビティを、決定論的かつモデルを一切使用しない(ゼロモデル)パイプラインでエージェントメモリにコンパイルする。このパイプラインは、ローカルのキャプチャストリームを型付きアクティビティフレーム、すなわちアプリケーション、サイト、タイミング、入力量、および生の行へのエビデンスポインタを保持する有界エピソードに分割する。ループ内にモデルが存在しないため、出力はバイト単位で同一となり、キャッシュ可能で、機械的に監査可能である。ある専門職1名のシングルユーザーコーパス(51活動日、128,756フレーム)において、コンパイラは1日分の生キャプチャを、68ミリ秒で86分の1のサイズのプロンプト対応コンテキストブロックに削減し、そのブロックを読んだエージェントは、独立したオラクルを基準として、その日の質問に対して98.4%の精度(ウィルソンの95%信頼区間91.7-99.7%)で回答した。同じキャプチャのLLM要約では66〜80%であり、ブロックを読む中位のモデルはフロンティアモデルに匹敵した。 この同じコンパイラは、需要側のコスト測定手段としても機能する。エージェントのロールアウトではなく、委任前の受動的な人間の活動から読み取ることで、エージェントコストモデルが仮定しているが、我々の知る限り測定されていない2つのパラメータ、すなわちルーチンオーバーヘッド比Rとルーチン反復率hを提供する。我々は、モデル化された上限であるRの最初の値として60〜343倍を報告し、委任可能な反復率としてサンプル内9.0%、サンプル外7.7%を報告する。これにより、現実的な全フリートのトークン上限は約8%となる。コンパイルされたルーチンは、モデルをループ外にして決定論的に再生され、ガード一致ヒットではゼロモデルトークンでのライブ実演が行われた。スキーマ、コンパイラ、評価ハーネスは公開されている。
ビデオ物体除去では、対象物体だけでなく、それによって誘発される影響も除去しつつ、高忠実度かつ時空間的に一貫した復元を維持する必要がある。既存手法は主に、事前定義された効果カテゴリと固定されたデータ分布から物体と効果の対応関係を暗黙的に学習するため、合成的な効果、空間的に分離または弱い相関しか持たない効果、ロングテールな物理現象、動的に進化する相互作用などを含む複雑な実世界シーンへの汎化が制限される。本論文では、意味推論を強化したフレームワークであるEffectLearnerを提案する。これは、VLMベースの物体・効果推論器とDiTベースのビデオ消去器を組み合わせたものである。構造化された効果分析プロンプトに導かれ、推論器は対象物体を強調したビデオに対してクロスモーダル推論を行い、コンパクトな効果認識コンテキストを抽出する。これにより、ビデオ消去器は包括的な物体・効果除去へと導かれる。さらに、動き認識マスクガイダンスと動き一貫性監視により、物体の動きやシーンの動的変化の下での除去範囲と時空間的安定性が向上する。挑戦的な実世界シナリオで本フレームワークを十分に活用するため、複雑な物体誘発効果に特化して設計されたペアビデオデータセットEffectWorldを構築し、一般的な監視と複雑効果データを組み合わせた段階的トレーニングカリキュラムを導入する。標準的なROSE-Benchでは、EffectLearnerは既存ベースラインをほとんどの指標で上回り、EffectWorld-Evalおよび挑戦的なEffectWorld-Wildの両方で明確な優位性を達成し、複雑な実世界シーンにおける高品質なビデオ物体除去の能力を示している。
ターミナルエージェントの訓練には、実行可能かつ検証可能であり、単に解けるだけでなく、学習にとって適切な難易度を持つタスクが必要である。実行による検証は実現可能性を確立するが、与えられたソルバー設定に対してタスクがどのように振る舞うかを明らかにしない。本論文では、検証済みソルバーの挙動を利用し、敵対的ソルバーキャリブレーションを通じて候補タスクを改訂する、自律的なターミナルタスク合成システムCalibForgeを提案する。マルチソルバーキャリブレーションは異種ソルバープール内の不一致を対象とし、対照的ソルバーキャリブレーションは指定されたstrong-pass/weak-fail関係を対象とする。両者は、実証された解決可能性に基づくソルバー相対の学習可能領域を操作化するものである。CalibForgeを用いて、5,431件のキャリブレーション済みターミナルタスクを構築した。アブレーション実験により、両戦略はいずれも、タスクの作成と検証のみ、または通常の単一ソルバーフィードバックよりも効果的な教師信号をもたらすことが示された。全タスク集合で訓練したモデルは、Terminal-Bench 2.0において32.58%および47.57%を達成した。対応するベースモデルに対する最大の改善は、Terminal-Bench 2.0で24.71パーセントポイント、SWE-bench Proで27.68ポイント、Doc2Repoで30.04ポイントに達した。これらの結果は総合的に、ソルバー相対の学習可能性が、効果的かつ転移可能なエージェント訓練データを構築するための実用的な目標であることを支持する。
我々は、イディッシュ語に特化して構築された初のオープンソース80億パラメータ言語モデルであるMameLoshnLMを提案する。イディッシュ語は豊かな文書伝統を有するにもかかわらず、その限られたデジタル上の存在感と信頼性の高い評価リソースの不足により、イディッシュ語の言語モデリング研究の発展は制約されてきた。既存の多言語コーパスやベンチマークは、この言語にとって不十分な代替手段となることが多く、かなりの量のノイズを含む機械翻訳テキストや誤分類されたテキストが含まれている。我々はこれらのギャップに対処するため、現代のウェブ由来の情報源と文学作品の両方を組み合わせた高品質なイディッシュ語事前学習コーパスであるOytserと、翻訳、言語分析、情報抽出、言語理解にわたるマルチタスクベンチマークであるKashesを導入する。これらのリソースを用いて、Llama 3.1 8Bの継続事前学習を実施し、MameLoshnLMを獲得した。ベンチマーク内のタスク全体において、MameLoshnLMは同規模のオープンベースラインモデルを上回る性能を示す。我々の分析は、これらの改善が単に定量的なものではないことを示している。すなわち、汎用多言語モデルと比較して、MameLoshnLMは言語を特徴づける語彙的・形態的パターンをより適切に捉えており、これは低リソース言語に対するノイズの多いウェブ規模の多言語データのより広範な失敗モードを示唆している。本研究の成果は、イディッシュ語NLPの基盤を提供するとともに、歴史的に豊かでありながらデジタル上では過小評価されている言語に対する言語モデル開発の実践的な雛形を提供するものである。
エンドツーエンド文書パーサーは統一インターフェースを提供するが、ページレイアウトと領域コンテンツを単一の自己回帰シーケンスに直列化する。この定式化は、独立した領域を、総コンテンツ量に応じて長さが増大する復号経路に強制する。一方、クロップベースの二段階パーサーは、繰り返されるビジュアルプリフィルと断片化されたページコンテキストを犠牲にして、領域レベルの並列性を実現する。依存関係を除去しつつ全ページコンテキストを保持するために、我々はPaDocを提案する。PaDocは、予測されたレイアウトを共有ページ表現上の分岐構造として扱う、レイアウト基盤のパーサーである。領域十分性の仮定の下で、レイアウトストリームと領域コンテンツの分岐が並行して進むプレフィックス条件付き因子分解を導出し、復号深度を最長のレイアウト・コンテンツパスに削減する。我々はこの因子分解を単一のMLLM内で実現する。パックされた可変長祖先アテンションは、標準的な次トークン学習の下で可視性を保持し、一方マスク並列復号は、評価対象のvLLMバックエンドがキャッシュ常駐の共有プレフィックス再利用を伴う並行リクエストとして処理する分岐を生成する。OmniDocBench Fullにおいて、PaDocはOverallレイアウトF1 91.1を達成し、エンドツーエンドパーサーの中では、トップクラスのOverallスコア94.24を、最高のText Edit(0.038)およびFormula CDM(95.59)とともに達成する。384ページのサブセットと1つのA800 GPU上で、5つの並行度レベルにおいて最速のエンドツーエンドパーサーであり、同一バックボーンのシーケンシャルSFTベースラインと比較して、有効ページスループットを67.4〜118%向上させ、P95レイテンシを39.2〜54.9%削減する。コードはhttps://github.com/Longin-Yu/Padocで公開されている。
潜在拡散モデリング(LDM)は、主要なパラダイムとして、トークナイザーを用いて入力信号を圧縮表現にマッピングする。この依存関係により、トークナイザーは生成プロセス自体の不可欠な構成要素となり、学習速度や合成サンプルの品質に影響を与え、その後の応用の基盤を築く。本レポートでは、音声・画像・動画向けの一連のKVAEトークナイザーを紹介する。これらはすべて、テキスト条件付き生成のために設計されている:KVAE-Audio(64チャンネルの50Hz潜在表現を備えた連続フルバンド48kHzトークナイザー)、KVAE-3D(4x16x16および4x8x8圧縮のための2つの因果的ビデオトークナイザー)、KVAE-2D(32チャンネルで入力を8分の1に圧縮する画像モデル)である。再構成(PSNR、LPIPS、PESQなど)および客観的指標(Frechet Distance、CLIP score、CLAP scoreなど)と主観的指標(サイドバイサイド評価)による生成結果が、Wan-2.2、HunyuanVideo-1.5、FLUX.2、MovieGen、StableAudio、MMAudio などのVAEを含む最先端のオープンソース・トークナイザーに匹敵するか上回ることを実証する。開発の難しさを考慮し、トレーニングの詳細、モデル選択方法、設計選択に関するアブレーションをコミュニティと共有する。コードは https://github.com/kandinskylab/kvae および https://github.com/kandinskylab/kvae-audio で公開されている。
古典的な継続学習(CL)は、主にモデルが知識を更新・保持することを可能にするパラメータ中心のメカニズム、例えば学習戦略、アーキテクチャ設計、重み適応などに焦点を当ててきた。しかし、新たなパラダイムが出現し、従来のモデル適応という視点を超えてCLの射程を再形成しつつある。例えば、オン方策学習は更新メカニズムの空間を拡張し、テスト時訓練はCLを学習フェーズから推論フェーズへと拡大し、メモリ、スキルライブラリ、対話プロトコルなどの外部ハーネス構成要素は、モデル能力の進化的境界を静的なパラメータ空間をはるかに超えて拡張する。総体的に、これらの発展はパラメータ中心の学習からシステムレベルの適応への移行を示している。この移行を特徴づけるため、我々は継続学習の進化を「いつ(When)、どのように(How)、どこで(Where)」学習が生じるかという三つの次元を通して考察する。How次元は、オフ方策、オン方策、および勾配を超えた最適化メカニズムを包含する。When次元は、事前学習、事後学習、推論時の各段階にわたる進化を捉える。Where次元は、内部パラメータ内で生じる更新と外部の構造的制約内で生じる更新を区別する。この三軸フレームワークに基づき、我々は代表的な手法を体系的に調査し、継続学習の進行中の移行を追跡し、このパラダイムシフトから生じる主要な課題、より広範な含意、および将来の方向性について議論する。
深層視覚モデルは、教師信号と相関する手がかりに依存することで、ショートカットを利用する。先行研究は、物体-背景相関やテクスチャ相関などの可視的なバイアスに焦点を当ててきた。我々は、ショートカット学習の別の源泉を特定する:画像処理や撮影などのメタデータについて、ピクセルレベルに埋め込まれた不可視のメタデータ痕跡である。我々は、カテゴリラベル(ImageNet)であれ、十億規模のキャプション(LAION)であれ、大規模な意味的教師信号が事前学習中にメタデータ-セマンティクス相関を自然に誘発し、その結果モデルが低レベル信号を予測的特徴へ変換するようになると仮定する。制御されたメタデータ-セマンティクス相関を導入することにより、相関が強いほどメタデータ痕跡に対する感度が系統的に高くなり、メタデータ分布シフト下での性能低下も大きくなることを示す。さらに、事前学習中および事前学習後に適用する緩和戦略を探求する。これらの戦略は、下流タスクの性能を犠牲にすることなく、対象としたメタデータだけでなく未見のメタデータに対する感度も低減する。メタデータ感度には肯定的な側面もある:それは一部のエンコーダが持つ強力な生成画像検出能力を部分的に説明する一方、その緩和は分布外汎化を改善できる。コード:https://github.com/ryan-caesar-ramos/visual-encoder-traces
近年のビデオモデルは、単一モデル内で生成、参照条件付け、編集をますますサポートするようになっているが、通常これらは固定入力に対する個別の操作として公開されている。実際の制作は複数のショットにまたがって展開され、単一のモデルがテキストからの生成、参照への追従、ソース映像の編集を行いながら、共有履歴を維持することが求められる。我々はこの設定を対話型マルチショットビデオ生成(IMVC)として形式化し、これらの操作のためのロール認識型コンテキスト表現を備えた統合モデルであるContextMasterを提案する。対話型モデルは、拡大し続ける履歴へのアクセスを維持しつつ、各デノイジングステップにおけるコンテキスト読み取りコストを増大させない必要がある。ContextMasterは、再利用可能なクリーンコンテキスト状態と固定予算のスパースコンテキストルーティングを組み合わせ、タスク制約を可視化し続けるためにConstraintSinkを用いる。スパースコンテキストアクセスと少数のデノイジングステップによる推論という二重の課題に対処するため、我々は二段階の特権コンテキスト蒸留フレームワークを提案する。これは、一貫性蒸留を通じて高密度教師から完全なコンテキスト挙動を転移し、その後、分布マッチングによりデプロイメント時のロールアウトを洗練する。三つの基本タスクに関する実験は、専門特化したベースラインと比較して、タスク達成度とショット間の一貫性が向上することを示す。ユーザー研究はさらに、柔軟に構成されたワークフローを検証しており、モデルは単一GPU上で16 FPSを達成する。
現在のビデオワールドモデルは、マルチプレイヤー環境において、ワールド状態と視点依存の視覚的潜在変数を絡み合わせてしまうため、冗長な計算、視点間の不整合、およびスケーラビリティの低下を招くという課題を抱えている。我々はこの限界を解決するために、MAS(Multiplayer world models with Authoritative Shared State:権威的共有状態を用いたマルチプレイヤーワールドモデル)を提案する。マルチプレイヤーゲームのアーキテクチャに着想を得て、MASはワールドダイナミクスと視点レンダリングを分離する。学習されたLogic Engineは、手書きの遷移関数を一切用いずに、協調動作からグローバルかつ権威的な型付き状態を前進させ、唯一のリカレントメモリおよび同期基準として機能する。この共有状態から、学習されたRendering Engineは、任意の要求カメラに対して独立かつ整合的な視点をオンデマンドで生成する。この明示的な分離により、MASは、同等のマルチプレイヤーSnakeベンチマークにおいて、最先端のマルチビューベースラインと比較して、優れた状態精度と低い視点間不整合性を達成する。また、1,024人の同時プレイヤーによる予測ワールドを10,000リカレントステップにわたって前進させる。我々の結果は、明示的かつ権威的な状態モデリングが、スケーラブルで整合的なマルチエージェントワールドシミュレーションの実用的な基盤を提供することを示している。
ロボット学習は、凍結された重みに能力を焼き込むポリシー(視覚・言語・行動モデル、すなわちVLAモデル)と、自身の実行可能なスキルをコードとして書き、洗練させるエージェントという二つの賭けに分かれつつある。本サーベイは、この「重み対スキル」という軸に沿って当該分野を整理するものである。その中心的な分析上の貢献は、コード・アズ・ポリシー手法を自己改善の度合いに応じて配置した深掘り調査であり、ゼロショットプログラム合成から、閉ループ自己修復、永続的スキルメモリ、そして実行フィードバック・スキルメモリ・進化的探索が単一のオープンエンドなループに組み合わさる、まだ疎らにしか埋められていないセルにまで及ぶ。このセルを占めるのは、ごく最近の少数のシステム(例えばASPIRE、ENPIRE、RoboClaw)のみである。我々は、教師なし強化学習によるスキル発見から大規模言語モデルによるスキルライブラリに至る、相補的な「スキル」側の極もマッピングし、「スキル」という語が少なくとも五つの異なる意味で使用されており、そのうち勾配更新なしで自己改善するのはコードの意味だけであることを示す。続いて、このタクソノミーを新興のスキル経済へと結び付ける。商用ロボットスキルマーケットプレイスは現在、ワンタップスキルをロボット間で配布しているが、それは静的な再生のみを出荷しており、適応、異なる身体間の移植性、来歴、安全性検証、合成、標準化といった未解決の問題を浮き彫りにしている。これは意図的に焦点を絞ったサーベイである。分野を網羅的にカタログ化するのではなく、一つのタクソノミーと一連の比較表を通じて、六つの手法ファミリーにわたる77の代表的なシステムを検討し、自己改善メカニズムの操作的定義を提供するとともに、各ファミリーが何をできないかを明記するものである。
世界モデルは、物理世界の構造とダイナミクスを捕捉・予測する能力により、大きな注目を集めている。この新たな領域において、Joint Embedding Predictive Architectures(JEPA)は特に有力な方向性を提供する。我々は、ほとんど未探索の領域を研究する。すなわち、人口が多く、混雑し、混沌としたグローバル・サウスの都市環境であり、これをDENSEWORLDと呼ぶ。既存の評価を支配する低密度でレーン構造化された設定とは異なり、これらのシーンは、曖昧な空間的境界、極端なエージェントの不均一性、持続的な遮蔽、および混合交通下での迅速な社会的交渉を示す。我々は、この領域のための最初の大規模データセット、すなわち22都市にわたる1,000時間の走行映像、歩行映像、および航空映像を導入する。既存のJEPA定式化は、不均一性と部分的可観測性の下で、密集した相互作用ダイナミクスを保持することが困難である。我々は、世界構造を第一級の予測プリミティブとするFactorJEPAを導入する。将来をモノリシックな潜在表現にエンコードするのではなく、可視性ゲートと分離された部分空間を用いて、部分的に観測されたエージェントを保持し、因子間のショートカットを防ぎながら、レイアウト、エンティティ、および相互作用を構成する。FactorJEPAは、(i) 将来潜在精度(Future-frame L1)、(ii) 介入に敏感な予測(Causal L1)、(iii) 視覚的証拠の減少に対する頑健性(Mask-ratio slope)を改善し、その一方で、(iv) 再現可能な運動情報のトレードオフ(Motion cosine)を明らかにする。手法のランキングは、2Bおよび1BのV-JEPA 2.1バックボーン間で再現され、ρ = 0.895〜0.978である。我々は、DENSEWORLD-115kデータセット(https://huggingface.co/datasets/anonymousML123/denseworld-115k)と、サージェリー訓練済みのFactorJEPAチェックポイント(https://huggingface.co/datasets/anonymousML123/factorjepa-outputs/tree/main/outputs/full/vjepa_2_1_vitg_1B/train/m09c_surgery_3stage_DI_diheavy_encoder)を公開する。
多言語テキスト埋め込みモデルは、タスクごとに根本的に異なる最適化戦略が必要であるにもかかわらず、多様なタスクにわたって単一の学習目的で適応されることが一般的である。我々は、タスク条件付きフローマッチング(TCFM)を導入する。これは、翻訳タスクにはフローマッチングを選択的に適用し、検索、分類、ペア分類タスクには各自の学習ダイナミクスにより適合した目的関数で最適化する多言語埋め込み適応フレームワークである。TCFMはさらに、教師誘導による表現保持と3段階カリキュラムを組み合わせることで、安定した適応を可能にする。Indic Massive Text Embedding Benchmark上で評価した結果、TCFMは新たな最先端を確立し、多様な多言語タスクにわたって埋め込み品質を一貫して向上させ、埋め込みモデルファミリー間で一般化することを示す。論文採録後、コードベースとデータセットを公開する予定である。
再構築されたシーンから完全な3Dオブジェクトを最小限のユーザー労力で選択することは、実用的なシーン編集と身体性インタラクションにとって不可欠である。既存の3DGSベースの手法は、オブジェクトごとのラベルを埋め込むためにガウス表現を再学習するか、または高密度な多視点SAM観測を構築するかのいずれかであり、どちらも重い計算と、実際にはほとんど利用できない密な視点カバレッジを必要とする。我々は、スパースな視点とスパースなスクリブルガイダンスからインタラクティブな3Dオブジェクト選択を行うための、トレーニング不要のフレームワークであるGaussianSelectorを提案する。ネイティブなガウスプリミティブに直接作用し、密なガウスを幾何学的にコヒーレントなスーパーポイントへ粗粒化し、外観と空間的手がかりを用いて連続性重み付きグラフを構築する。スパースなユーザースクリブルは、可視性を考慮した透過率カバレッジを介して3Dに持ち上げられ、選択は、スパースな証拠を完全な3Dオブジェクトに伝播させるグローバルなグラフカットエネルギー最小化として解かれる。この設計は自然にマルチラウンドの改良をサポートし、ユーザーは追加の視点から選択を反復的に修正して、結果を段階的に改善することができる。実験により、GaussianSelectorは最先端の多視点SAMベースの手法と競合する選択品質を達成しつつ、はるかに少ないインタラクションビューと大幅に低い計算オーバーヘッドを必要とすることが実証された。これらの特性により、実世界の展開シナリオにおける人間参加型の3Dシーン編集と3Dアセット抽出に非常に適している。