翻訳付きの日次キュレーションされたAI研究論文
ビデオマルチモーダル大規模言語モデル(MLLM)は、ビデオ内で何が起こっているかを説明できるが、その根拠となる証拠がいつ発生するかを特定することはほとんどない。本研究では、汎用的なビデオ時間的グラウンディングを研究する。これは、単一のモデルがビデオの長さ、ドメイン、クエリ形式、視点を横断して、可変基数の証拠区間集合を予測するタスクである。既存の学習戦略は、この集合値タスクと整合していない。長尺ビデオのラベルは、脆弱な一回限りのアノテーションに依存することが多く、強化学習の報酬は、重複しない予測を区別できないか、または脆弱なセグメントマッチングを必要とするかのいずれかである。TimeLens2は、監視と最適化の全体を通じて、時間的証拠を区間集合として扱う。TimeLens2-93Kは、キャプション由来の提案、独立した位置特定、エージェント間のコンセンサス、意味検証、境界精緻化を通じて、信頼性の高いマルチスパン監視を構築する。我々の時間的ワッサーシュタイン報酬は、マージされた区間サポート上の一様分布間の正確な1次元W1を計算し、不等な基数や等価な断片化の下で、密でマッチング不要なフィードバックを提供する。時間的IoUは、正確なオーバーラップフィードバックでこれを補完する。7つのベンチマークにおいて、TimeLens2-2Bはすべてのサイズが一致するベースラインをすべてのベンチマークで上回り、4Bおよび8Bのバリアントは、最大397Bパラメータのオープンソースモデルを凌駕する最先端の性能を達成する。2B、4B、8Bのバリアントは、それぞれQwen3-VLバックボーンに対して14.2、13.0、18.1 mIoUポイントの改善を示している。
本論文では、インタラクティブな文学世界におけるキャラクターと世界の共進化のためのフレームワークおよびベンチマークであるEvolvingWorldを紹介する。既存のシステムは、インタラクティブな文学的シミュレーションを静的な人格模倣や孤立したシーン生成として扱い、キャラクターと世界が時間とともに共に進化する様子を捉えることができていない。この課題に対処するため、EvolvingWorldは文学的シミュレーションを長期にわたるプロセスとしてモデル化し、キャラクター同士の相互作用、シーンの進行、そしてキャラクターと世界の状態の持続的な更新を行う。固定スキーマに依存する従来のシステムとは異なり、EvolvingWorldはオープンスキーマフレームワークを採用し、多様な文学世界にわたるシミュレーションをサポートする。このフレームワークは、マルチキャラクターのロールプレイと持続的なプロファイル進化を行うキャラクターエージェント、およびグローバルおよび場所・エンティティレベルの状態維持とシーン進行を担うLLMベースのワールドモデルという、結合された2つのモジュールから構成される。このアーキテクチャに基づき、我々はシーン初期化、相互作用生成、状態更新のための7つの学習可能タスクを策定する。57冊の書籍からデータセットを構築し、138,596件の教師あり学習サンプルと222のテスト用スナップショットを作成した。さらに、10の側面と20のメトリクスにわたる軌跡レベルのLLM-as-Judge評価プロトコルを導入する。実験により、EvolvingWorldは持続的で一貫性のあるキャラクターと世界の発展を効果的に維持することで、長期シミュレーションを改善できることが示された。
ツール使用エージェントが自身の経験から改善するよう訓練することは依然として困難である。なぜなら、教師ありファインチューニングは固定された教師蒸留軌跡に依存する一方、疎な報酬の強化学習では長期的な相互作用に対する弱い教師信号しか提供できないからである。本稿では、DeepSearch-Evolveを提案する。これは、DeepSearch-World上に構築されたWebエージェント向けの自己蒸留フレームワークである。DeepSearch-Worldは、再現可能な検索およびページ読み取りツールを備えた決定論的かつ検証可能な環境である。DeepSearch-Worldは、エンティティレベルのランダムウォークから構築された42万件のマルチホップQAタスクを含み、進捗検証、根拠に基づく反省、障害回復など、自己進化に有用な主要なエージェント認知行動をサポートする。DeepSearch-Evolveは、軌跡生成、フィルタリング、データ混合、ファインチューニングを反復的に実行し、より強力なエージェントを訓練する。より高性能なモデルからの蒸留を行わずとも、DeepSearch-World-9Bはオープンソースエージェントと比較して競争力のあるパフォーマンスを達成し、BrowseCompで31.2%、GAIAで61.5%、HotpotQAで93.4%を記録した。これは、検証可能な環境が長期的なWebエージェントのスケーラブルな自己進化を可能にすることを示している。環境、42万件のトレーニングプール、バリデーションセット、モデル、コードを公開し、自己改善型ディープサーチエージェントに関する今後の研究を促進する予定である。
コーディングエージェントにおける長いコンテキストの刈り込みは、効率的なコンテキスト管理に不可欠な技術である。既存の文脈刈り込み手法(SWE-Prunerなど)は、これとは別のコード分類器を付加することで実現しているが、我々はエージェント自体がツール出力を読み取る際に、コードコンテキストの関連性を示す内部表現を符号化していることを発見した。この発見に基づき、エージェント内部で直接ツール出力を刈り込むSWE-Pruner Proを提案する。具体的には、小型のヘッドがエージェント自身の内部表現を行ごとに保持または刈り込みのラベルに変換し、各ツール出力の行数に応じた長さ認識型埋め込みを付与する。2つのオープンウェイトのバックボーンと4つのマルチターンベンチマークにおいて、SWE-Pruner Proはタスク品質を維持しつつ、プロンプトトークンと完了トークンを最大39%削減し、推論のオーバーヘッドも限定的である。特筆すべきは、MiMo-V2-FlashにおいてSWE-Pruner ProがSWE-Bench Verifiedの解決率を+3.8%上昇させ、長文脈のOolong精度を+2.2ポイント向上させたことである。
人物-物体中心のビデオパーソナライゼーション(HOCVP)は、被写体駆動型ビデオ生成における中核的なタスクです。しかしながら、既存手法には2つの主要な制限があります。第一に、被写体間パーソナライゼーションに焦点を当てたほとんどの手法は、高い被写体忠実度と、人間と多様な物体(特にロゴなどの抽象的概念を表す物体)との間の正確な相互作用パターンのバランスを取るのに依然として苦労しています。第二に、被写体内参照(例えば、OCRマップ、多視点入力)は被写体忠実度を向上させることが期待されていますが、既存のほとんどの研究にはそのような潜在的な対応関係を理解するメカニズムが欠けています。これらの両方の課題に対処するため、我々はHOMIEを提案します。これは、被写体間および被写体内の両方の入力設定を統一的に扱うHOCVPフレームワークです。従来の手法と比較して、HOMIEは、テキストエンコーダの制御可能性を損なうことなく、またコストのかかる再調整を伴うことなく、参照レベルの関係性の知識を抽出するためのより優れたMLLM統合戦略を提案します。具体的には、自己注意内にグローバルなマルチモーダルガイダンスを導入し、MLLM由来の意味的特徴とVAEトークンをより良く整列させます。さらに、モダリティ参照埋め込みを提案し、MLLM特徴とVAEトークンからのトークンを区別し、被写体内参照画像トークンを関連付けます。広範な実験により、我々の手法が様々なHOCVPタスクにおいて最先端の性能を達成することが検証されました。Project Page: https://yiyangcai.github.io/homie-page.github.io/
近年の動画生成モデルは、物理法則を内在化した新興の世界モデルとして広く注目されている。しかし既存のベンチマークの大半は、出力レベルでの物理的妥当性のみを評価しており、モデルが法則に基づいた確かな推論プロセスを経て出力に至ったかどうかを検証していない。本論文では、動画モデルの評価を物理法則に明示的に基づかせた初のベンチマーク「Apple-PI」を提案する。Apple-PIは三つの構成要素から成る。1) Orchard:古典力学における10の標準タスクをカバーする400本の動画データセット。交絡因子のない診断を可能とする単一法則タスクと、汎化性能を探る複合法則タスクを分離している。2) ベンチマークプロトコル:科学的推論に基づく「知覚」「定式化」「演繹」の三段階プロトコル。インフォグラフィックで注釈付けされた先頭フレームに対してフレーム連鎖プロンプティングを適用し、生成された動画をモデルの可視化された推論過程として扱う。3) 評価スイート:マルチモーダル大規模言語モデル(MLLM)による主観的スコアリングと、物理法則に基づく客観的指標を組み合わせたハイブリッド評価スイート。これにより、モデルが失敗したかどうかだけでなく、どの段階で失敗したかを段階別に診断できる。11のモデルを評価した結果、現状の動画モデルは信頼できる法則準拠型世界シミュレーターには程遠く、最良の動画モデルでもスコアは0.473にとどまった。段階別・柱別・原因別の分析により、知覚→定式化→演繹のボトルネック、複合法則間の状態遷移の弱さ、そして持続的なシミュレーション現実ギャップが明らかになった。これらの知見により、Apple-PIは将来の動画モデルを法則に基づく物理的知能を持つ世界モデルへと導く診断基盤として位置づけられる。
本稿では、RynnBrain 1.1ファミリーを発表する。これは2B、9B、122B-A10Bという規模にわたる身体化基盤モデル群である。統一された時空間的かつ物理的に接地されたフレームワークで学習され、身体化知覚、空間推論、位置特定、計画をサポートする。RynnBrain 1.0と比較して、本ファミリーでは全モデルにおける接触点予測、および2Bと9Bモデルにおけるネイティブな3Dグラウンディングを新たに導入し、ロボット操作とより直接的に整合する表現と出力を実現する。また、統一されたクロス身体化行動空間と身体化固有のマスキングを備えたRynnBrain-VLAを開発し、Unitree G1、Astribot-S1、Tianji-Wujiに展開した。RynnBrain 1.1は、身体化認知、位置特定、3Dグラウンディングにおいて強力な結果を示し、122B-A10BモデルはVSI-Bench、MMSI、RefSpatial-Benchにおいて評価されたすべてのプロプライエタリおよびオープンソースモデルを上回った。実機ロボット実験では、RynnBrainで初期化されたポリシーがQwenベースおよび代表的な汎用VLAを凌駕し、さらに、マルチタスク・マルチ身体化統合訓練が、タスク個別訓練と比較してプロセススコアと成功率を向上させることを示した。
長時間録音における時間的接地は、音声条件付き大規模言語モデル(LLM)にとって依然として課題です。我々は、最大120分の入力に対して明示的なタイムスタンプ付きで質問に答える時間認識型音声LLMを提案します。本手法では、カスケードパイプラインによる大規模な合成教師データを用いて、定期的な時間マーカーを連続音声トークンにインターリーブします。提案モデルは、短時間および長時間のベンチマークにおいて高い時間的接地精度を達成し、時間ベースの断片記述や要約をサポートします。広範なアブレーション研究により、時間表現、マーカー頻度、トークン化、および持続時間混合設計が精度と計算コストに与える影響を調査します。我々は、時間認識型音声理解のさらなる研究を支援するため、モデルの重みとデータセットを公開します。入手先:https://huggingface.co/ai-sage/GigaChat3.1-Audio-10B-A1.8B
近年のスケーリングの成功にもかかわらず、多言語ASRの性能は依然として非常に不均一であり、テール言語群は深刻なデータ不足に悩まされている。本研究では、過小評価されている中央アジアの言語(カザフ語、キルギス語、ウズベク語)に対して、堅牢な基盤モデルを構築するという課題に取り組む。我々は、HuBERTスタイルの目的関数を用いて2M時間の音声データで事前学習されたConformerエンコーダー「GigaAM Multilingual」を提案する。重要なのは、事前学習時にクラスターレベルのデータバランス戦略を導入し、ファインチューニング時にはドメイン認識サンプリング手法を用いることで、主要言語による支配を緩和した点である。比較実験において、本手法は対象言語において強力な既存のオープン事前学習エンコーダー(Whisper Large v3、Omnilingual-1B)を上回り、特に自然会話音声において顕著な性能向上を達成しつつ、効率性も維持している。我々は基盤エンコーダーとASRモデルを公開し、現実的なデータ不均衡下での効果的な多言語適応のための実証済み手法を提供する。
人間の操作を記録した自己中心視点の映像は、身体化知能に対するスケーラブルな教師信号を提供するが、既存のリソースは、低コストでの継続的な収集、操作レベルの構造化アノテーション、ロボット学習のための再利用可能なツールを兼ね備えることはほとんどない。本稿では、スマートフォンによる撮影からモデル訓練に至る全パイプラインをカバーする、オープンでコミュニティ指向の自己中心視点操作データセットとツールチェーンであるOpen-AoEを提案する。初回リリースでは、500名以上の投稿者が400台以上のスマートフォンを用いて自然環境で収集した、約2,000時間の操作映像を含む。データセットには、テキストアノテーション、MANOベースの手姿勢、カメラ軌跡、時間的に局所化された原子動作が提供される。さらにOpen-AoEは、時間的行動セグメンテーション、意味アノテーション、手の再構築、カメラ軌跡再構築により、生の記録を構造化サンプルに変換するデータ処理パイプラインを備える。同時に、別途提供される下流タスク用ツールチェーンは、可視化、異なる身体へのリターゲティング、モデル固有のデータ変換、そしてVLAポリシー、WAM、世界モデル向けの学習レシピをサポートする。スケーラブルな収集、構造化処理、下流タスクへの適応を統合することにより、Open-AoEはデータ提供と再利用の両方における障壁を低減し、身体化モデル訓練、人間からロボットへの転移、世界モデリングのための実用的なオープンインフラを提供する。
視覚研究の主流方向に沿い、我々は動画と画像という二つのモダリティに対する生成機能と編集機能を単一モデル内に統合することを探求する。現在の動画編集データ収集手法は、物体マスクのアノテーション、I2VモデルとControlNet的なガイダンスによる誤差を含むペア合成の利用、VLMに基づく品質フィルタリングや改良といった、労力と時間を要する厳選された手順に依存しており、タスクの拡張性が限られている。その結果、編集タスクの多様性は画像編集モデルに比べて著しく狭いままである。我々は、画像編集サンプルから対応する動画編集サンプルをリアルタイムで直接生成できるピクセルペア時間ワープフローフィールドを開発し、複数レベルの動画編集タスクにわたって、モデルがこのようなデータのみを用いて動画編集を学習可能であることを実証する。我々は画像モダリティを動画モダリティの特殊な形態とみなす。これに基づき、モダリティ模倣生成損失とモダリティ模倣編集損失を設計し、相互模倣を通じて二つのモダリティの能力、ひいては出力分布を相対的に整合させる。さらに、言語ベースのビジュアル編集は、編集指示と参照ビジュアルコンテンツの理解、参照ビジュアルコンテンツ内でその指示に対応する領域の特定、そしてその領域のみの修正を伴う。既存の手法は主に外部の助けに依存しており、例えば追加のMLLMのファインチューニングや、推論時に補助入力としてマスクシーケンスを明示的に提供するといった方法がとられる。これに対し、我々はモデルがこの能力を内在化することを目指す。そのために、指示表現セグメンテーションなどの意味関連タスクとともに、対応する編集領域認識の潜在レベル損失とアテンションレベル損失を導入する。
エントロピー制御は、大規模言語モデル(LLM)の強化学習(RL)において効果的なツールとなり、アライメントプロセスにおける探索と活用のトレードオフのバランスをとるのに役立っています。このようなRLのパラダイムは、しばしば異種タスクの混合データに対して実行され、同一の方針のもとで異なるエントロピー状態を誘発するため、グローバルまたはトークンレベルのエントロピー調整では、対応する異種の探索ニーズに対して不十分です。この不均一性により、GRPO形式の正規化されたアドバンテージはさらにエントロピー依存のバイアスを誘発し、プロンプトグループ間でのアドバンテージ信号が統計的に比較不可能となります。この問題に対処するため、我々はGroup Entropy-Controlled Policy Optimization(GEPO)を提案します。これはGRPOの軽量な拡張であり、既存のグループ化されたサンプルから推定されたグループエントロピーを用いて、エントロピー条件付きの非対称アドバンテージ整形を行います。GEPOは、低エントロピーグループにおける正のアドバンテージを減衰させて過剰活用を抑え、高エントロピーグループにおける負のアドバンテージを減衰させて探索を維持し、過去のエントロピー統計から導出された適応的しきい値を用います。数学、物理学、科学、コード生成、指示追従にわたる13のベンチマークにおける2つのベースモデルでの広範な実験により、GEPOがGRPOおよび近年のエントロピー制御手法を一貫して上回り、トレーニング全体を通じてタスク固有の探索レベルを維持しながら、タスク間でバランスの取れた改善をもたらすことが示されました。
世界を継続的に観察し、見たものを記憶し、蓄積された経験に基づいて推論できるアシスタントの構築は長年の目標であり、近年ではビデオストリームに対する長期記憶を備えたマルチモーダルエージェントへの関心が高まっている。残念ながら、既存のシステムはメモリをモデルのコンテキスト内かフラットな特徴ストアに保持し、ストリームが本来対象とする永続的なエンティティではなくフレーム単位で整理されているため、限られたビデオに制約され、時間を超えて誰が何が再出現するかを追跡する能力が弱まっている。本稿では、オープンエンドなビデオストリームのためのエンティティ指向マルチモーダルメモリシステム、ReflectWorld-MMを提案する。本システムは三つの要素から構成される。第一に、視聴覚ストリームをエンティティ単位で解決された観測に変換する知覚フロントエンドであり、有界な短期記憶のもとで動作する。第二に、人間の記憶理論に基づく階層的長期記憶であり、マルチスケールのエピソード記憶、進化的なエンティティ中心の意味記憶、および手続き記憶を結合する。第三に、実世界での運用向けに構築された完全な実装であり、任意のストリームを取り込み、既存のアシスタントにプラグイン可能である。六つの長尺ビデオおよび生涯記憶ベンチマークにおいて、ReflectWorld-MMは全てのベンチマークで最高精度を達成し、強力なメモリエージェントやフロンティアモデルを凌駕した。
API呼び出しを行う大規模言語モデル(LLM)エージェントの訓練には、大量の高品質な軌跡(trajectories)が必要である。しかし、このようなデータを大規模に収集するには通常、実行可能なAPIを備えた完全に実装された環境と、現実的で事前にデータが投入されたバックエンドデータベースが必要であり、これがスケーラビリティの大きなボトルネックとなっている。この問題を解決するために、我々はLLMを即席のデジタル世界モデルとして活用する、環境不要な合成データ生成手法を提案する。API仕様のみが与えられれば、本手法はエージェントと状態を持つ環境との間の相互作用を模倣した軌跡を生成する。具体的には、まずLLMが提供されたAPIで解決可能な多様なタスクを生成する。次に、教師エージェントが各タスクを反復的に解決し、その間、LLMシミュレータがタスクコンテキストとシミュレーション履歴に基づいて一貫性のある合成APIレスポンスを生成する。最後に、LLM判定器が軌跡をフィルタリングし、得られたデータセットの品質を保証する。我々は本手法を、情報検索タスクと状態変更タスクの両方を含む難易度の高いAppWorldおよびOfficeBenchベンチマークで評価した。合成データでモデルをファインチューニングしたところ、顕著な性能向上が得られ、実行可能な環境を一切必要とせずにAPI呼び出しエージェントに対する効果的な教師信号を生成できることが示された。この結果は、LLMベースのAPIシミュレーションが、多様なAPIエコシステムにわたるエージェント訓練のための実用的でスケーラブルなソリューションであることを確立する。
構造ベースの薬剤設計(SBDD)は、タンパク質標的の3次元構造と、しばしば他の空間的制約を活用して、結合候補分子を生成する。拡散モデルが高品質な3次元分子生成の主要パラダイムとして支配的である一方、LLMベースの手法は分子設計分野で急速に台頭しており、ポケット条件付き分子生成において競争力のある性能を示している。しかし、物理や3次元空間環境に関する推論能力はほとんど解明されていない。本研究では、現在の汎用LLMが、専門化された拡散モデルなどの確立されたベースラインと比較して、複雑な3次元制約を扱う能力を持つかどうかを体系的に分析する。ここでは、タンパク質ポケットに加え、アンカーフラグメント、ファーマコフォア点、必須のポケット-リガンド相互作用といった、リガンドおよび相互作用由来の空間的制約に基づく3次元リガンド生成を検討する。この評価を可能にするため、我々は3D-Fitを導入する。これは、多条件付き空間分子生成におけるLLMの性能を評価するためのトークン効率的なベンチマーク戦略である。本研究から得られた知見は、LLMの空間能力に明確なパターンがあることを示している。すなわち、依然として最先端のアプローチには及ばないものの、有望であり、複数の空間的制約を同時に処理できるため、異種混在の設定への拡張が可能である。
既存の3D生成モデルは主に暗黙的ボリューム表現に依存しており、水密トポロジーを強制するため、衣料品のような薄板状や非多様体形状の表現が困難です。一方、ジオメトリ画像ベースのアプローチは表面中心の代替手段を提供しますが、既存手法は解像度依存の境界エンコーディングを引き起こす離散的な2値占有マップに依存しており、ダウンサンプリング時に階段状アーティファクトや情報損失が生じるだけでなく、表面再構成は学習パイプラインから切り離された微分不可能な後処理ステップに留まっています。これらの課題を解決するため、本論文では微分可能ジオメトリ画像(DiffGI)を提案します。これは表面表現と幾何最適化をシームレスに統合するエンドツーエンドの3D-to-2Dマッピングフレームワークです。DiffGIは2値マップに代わり、固定グリッド解像度内でサブピクセル精度の境界位置をエンコードする連続的な2次元トランケート符号付き距離関数(TSDF)を採用し、激しいダウンサンプリング下でも解像度依存の階段状アーティファクトを排除します。この連続場に基づき、解析的線形補間による微分可能なマーチングスクエアアルゴリズムを導入し、3D表面損失からの勾配を2D潜在空間に逆伝播可能にします。この微分可能パイプラインを活用し、幾何認識型法線レンダリング損失で拡張したDiffGI-VAEを学習させることで、複雑な3D表面を超コンパクトな32×32潜在空間に圧縮し、さらにその空間上でフローマッチング目的関数を用いたトランスフォーマーベースの潜在拡散モデルを実装し、条件付き3D生成を実現します。衣料品および物体データセットにおける広範な実験により、本手法は従来のジオメトリ画像ベース手法やボクセルベース手法と比較して、優れた再構成精度と境界精度を達成しつつ、計算リソースを大幅に削減できることを実証しています。
手と物体のインタラクション(HOI)合成は、アニメーション制作や具現化AIの基盤技術である。映像基盤モデルの強力な事前知識にもかかわらず、複雑な手の動きや遮蔽により、多視点一貫性のあるHOI合成は依然として困難である。我々は、同期した多視点HOI映像とグローバルに整合された3D点軌跡を共同かつ調和的に生成する統一拡散フレームワークHarmoHOIを提案する。我々の核心的な洞察は、ロバストな多視点一貫性の実現には、基本的にグローバルに整合された3D幾何と動作が必要であるという点である。このために、RGB映像と3D点軌跡を共にモデル化するMixture of Multi-view Diffusion Transformerを提案する。点軌跡を疑似映像として表現することで、3D幾何信号を基盤モデルの2D潜在空間に整合させ、ドメインギャップを最小化し、事前知識の適応を容易にする。さらに幾何的一貫性を確保するために、粗い点軌跡をメートルスケールでグローバルに整合された3D軌跡に洗練するGlobal Motion Aligning Diffusionを導入する。HarmoHOIは、ノイズ除去中に2D外観と3D動作の即時共進化を可能にする。多視点HOIデータの不足を克服するため、ハイブリッドデータカリキュラム学習戦略を採用し、単視点データからの汎用的事前知識を同期多視点生成にうまく転送する。実験結果は、HarmoHOIが視覚品質、動作の妥当性、多視点幾何一貫性において最先端の性能を達成することを示している。プロジェクトページはhttps://droliven.github.io/HarmoHOI_projectで公開されている。
オープンエンドなタスクにおける強化学習(RL)は、LLMのルーブリックに基づく評価をスカラー報酬に圧縮し、豊富なテキストフィードバックを破棄するとともに、異なる品質プロファイルを持つ応答を混同する。我々は経験的学習(EL)を提案する。これはフィードバックモデルを「LLMを判定者として」から「LLMをコーチとして」に転用するものである。コーチは各オン・ポリシー応答に対する評価を転移可能な経験的知識に蒸留し、それが教師モデルを条件付け、ポリシーがオン・ポリシー文脈蒸留を通じて内在化する。スカラー報酬と比較して、この高帯域幅のフィードバックチャネルは密な監視を提供し、高品質な応答間のきめ細かな嗜好を保持する。二つのポリシーファミリーにわたり、ポリシー自身またはプロプライエタリモデルからのフィードバックを用いて、ELは保持された未知のオープンエンドなタスクにおいてルーブリックベースのRLを一貫して上回る。特に、ELは訓練分布を超えた一般化に優れ、報酬ハッキングを緩和する。これらの知見は、経験的知識が検証不可能なタスクにおけるポストトレーニングのための、より豊かで一般化可能な学習信号であることを確立する。
大規模言語モデル(LLM)のポストトレーニングは、推論能力、適応性、アライメントを向上させるために不可欠である。既存の手法は主に、強化学習(RL)とオン方策蒸留(OPD)の2つのパラダイムに従う。しかし、RLは粗い粒度の結果に対する監督に依存するため、クレジットアサインメントが難しく、新たな知識を獲得する能力が限られている。一方、OPDはKLダイバージェンスを通じて教師モデルのロジットを無条件に一致させるため、ジレンマが生じる。類似した教師は新たな知識をほとんど提供せず、大きく異なる教師はしばしば効果的な指導をもたらさないため、OPDは主に同系統内の蒸留に制限される。我々は、教師の監督をRLの目的関数に統合し、粒度の細かい指導を提供するとともに、新たな知識を選択的に転移し、無条件な模倣を回避する、蒸留強化学習(Distilled RL)を提案する。Distilled RLは、クリッピング付き逆重要度サンプリング、負のサンプルのリセット、系列レベルの幾何的正規化の3つの要素から構成される。簡潔で解釈可能なケーススタディを通じて、Distilled RLが教師モデルから生徒モデルへ、これまで利用不可能だった知識を効果的に転移できることを示す。同系統内および異系統間の両方の蒸留設定における広範な実験により、Distilled RLは標準RLおよびOPDをpass@1とpass@kの両方で大幅に上回ることが示された。我々のコードは https://github.com/597358816/Distilled-RL で公開されている。
Token-Level Off-Policy Labeling(TOPL)を提案する。これは、ポストトレーニングをトークンレベルの正しさ予測タスクとして再定義するオフポリシー訓練パラダイムである。我々の主要な直感は、応答に含まれる良いトークンと悪いトークンをモデルに区別させるよう訓練することで、良いトークンを生成する方向へ自然に導きつつ、オフポリシートークンを直接生成させる訓練に伴う落とし穴を回避できるという点にある。文書要約タスクにおける実験では、TOPLが多様なシーケンスレベル・トークンレベルのベースラインに対して、11のデータセットにわたって強い分布外汎化を達成することを示す。さらに、TOPLが機械翻訳にも効果的に転移することを示し、その利点が異なる忠実な生成タスクに一般化されることを示唆する。アブレーション研究により、トークンレベルの学習信号が優れた性能に不可欠であり、シーケンスレベルの類似手法では同様の利点が得られないことを確認する。最後に、TOPLが解釈可能なモデル更新を誘発することを示す。すなわち、TOPLを通じて学習されるLoRAアダプターは、線形分類ヘッドおよびステアリングベクトルとして機能する。
我々は、Transformerアーキテクチャの離散代数演算を、意味的ファイバーバンドル𝒴 = ℳ × ℝ^d上の積分微分方程式(IDE)としてモデル化する連続幾何学的枠組みを提示する。「トークン列が標準的な測度束を備えた離散1次元多様体を形成する」という単一の幾何学的公理から出発し、現代のTransformerのすべての中核的構成要素(RMSNorm、RoPE、Softmax Attention、FFN、Residual Stream、SGD、Weight Decay)を、微分幾何学、測度論、確率解析の統一的語彙へと翻訳する。得られた枠組みは、エントロピー的最適輸送(Attentionをシュレーディンガー橋渡しとして捉える)や非平衡熱力学(SGDを詳細釣り合いを破る伊藤拡散として捉える)に及ぶ定量的予測を生み出す。我々は、124Mから8Bパラメータにわたる5つのアーキテクチャ(Qwen3、LLaMA-3.1、Gemma-3、GPT-2、Mistral)を対象に、6部構成の実験キャンペーンを実施した。実験観測量は幾何学的予測と定量的に一致する。すなわち、機械精度におけるε^{-1/2} Lipschitzスケーリング較正(R² = 1.000)、Lie-Trotter作用素分割トーション、位相的安定性の双対法則を確認する対称アブレーション不安定性、RoPEトーラス上のポアンカレ再帰に対する𝒪(1/k)熱力学的抑制、熱力学的コンテキスト限界相転移、そして非平衡定常状態パラメータ渦であり、これらは2つの最適化手法(AdamWおよびPure SGD)において、モーメンタムアーティファクトを排除した上で検証された。これらの結果は、連続確率微分幾何学のレンズを通してTransformerを解析することが、大規模言語モデルの安定性限界、コンテキスト境界、および最適化ダイナミクスに対する予言的・記述的語彙を提供することを示している。
近年の強化学習(RL)の発展に伴い、多様で特殊な訓練環境への需要が高まっている。固定されたタスクと報酬難易度を持つ手作業で設計された環境は、モデルの性能が向上するにつれて効果的なシグナルとして機能しなくなり、長期的なスパース報酬は特定のワークフローやツール構造へのモード崩壊を引き起こす。環境状態をシミュレートするワールドモデルは純粋なロールアウト性能に匹敵する成果を上げており、オンデマンドで多様性を拡張する有望な手段となっている。しかし、自己回帰(AR)ワールドモデルは左から右へのバイアスに悩まされ、ツールスキーマ、先行ターン、期待される結果などの大域的に相互依存する状態アンカーへの条件付けが困難である。本研究では、(i)テキストベースのワールドモデリングを、初期状態、タスクコンテキスト、ツールスキーマ、ドメインルール、誘導指示に分解された操作可能な遷移ダイナミクス問題として定式化し、(ii)9つのオープンソース環境と12のフロンティアモデルファミリーにわたる239,403の grounded な状態行動軌跡をキュレーションする。AR言語モデルとマスク拡散言語モデル(MDLM)を比較し、MDLMが双方向のアンカー認識型デノイジングを通じて、4倍のパラメータサイズを持つLLMよりも優れたコヒーレンス、grounded性、実験的に検証されたロールアウト多様性を達成し、推論レイテンシは同等であることを示す。さらに、決定論的状態チェックを備えたプラグアンドプレイのGRPO訓練フレームワークを導入し、3つのOOD環境(ScienceWorld、ALFWorld、AppWorld)において、3つの1.2B-7Bエージェントバックボーン(LFM2.5、Qwen3、Mistral)を用いたゼロショット転移アブレーションを実施し、環境固有の微調整なしでベースラインを最大47%絶対的に上回る成果を達成した。さらに、敵対的シナリオ下での障害モードの行動解析と、現実感、結果の正しさ、訓練有用性に関する人間評価を実施する。本研究成果はオープンソースとして公開し、この方向性の研究を促進する。
リアルタイムマルチモーダルアプリケーション(音声エージェントやインタラクティブ動画生成を含む)は、異種モデルをパイプラインに構成するが、その効率的なデプロイには、配置、ストリーミング、モデル内並列性に関するアプリケーション固有の判断が必要となる。既存のサービングシステムや自動並列化コンパイラは限定的な変換と固定されたワークロードの仮定に制約されているため、新しいアプリケーションで高い性能を達成するには手作業による効率的な実装が求められる。本稿ではFlashRTを提案する。これは、コーディングエージェントを誘導して、開発者が記述したシンプルなリファレンス実装を、レイテンシやスループットといった目標指標を柔軟に考慮する最適化済みマルチGPUデプロイメントへと変換するエージェントハーネスである。新しい「チェーン・オブ・プログラム」パラダイムを用いて、FlashRTは汎用コーディングエージェントをマルチパス変換プロセスへと導く。このプロセスでは、エージェントがリファレンスを中間表現(IR)に変換してデータ依存関係と永続状態スコープを捕捉し、逐次インタープリタでこのIRを検証し、静的解析を実行して候補変換を特定する。そして、エージェントは計測ゲート付き最適化ループの下で各候補を反復的に実装、検証、ベンチマークし、様々なハードウェア予算に対応する効果的なデプロイメントを生成する。ビデオワールドモデルやマルチモーダルLLMを含む様々なアプリケーションにおいて、FlashRTはリファレンス実装を高効率なデプロイメントに変換し、NVIDIA B200 GPU上で最大約70倍のレイテンシ低減と2.8倍のスループット向上を実現する。AMD MI355X GPUでは、FlashRTはピークレイテンシ低減を維持しながら、ピークスループット向上を3.6倍に引き上げ、エキスパートによる最適化が成熟していないプラットフォームにおいてエージェント駆動最適化がよりスケーラブルであることを示している。実際、Qwen3-Omniのテキスト音声合成推論において、FlashRTはAMD MI355X上のエキスパート実装であるvLLM-Omniと比較して応答レイテンシを65%削減する。
自己ホスト型AIエージェントは、自らのメモリや設定ファイルの読み書きにより動作する。エージェントは、自身の状態の破損を介して侵害される可能性がある。これは、正規のOSシステムコールの呼び出しによって実現される侵害である。我々は、この種の脅威を自己状態攻撃と定義する。本論文では、この攻撃分類に対するOSの耐性を調査する。形式的には、攻撃空間を4軸(標的、メカニズム、粒度、時間性)で特徴づけ、防御、検知、復旧の構造的な限界を調査し、検出可能性に関するワークロード条件付きの見解を導入する。この枠組みを具体化するために、異なるワークロードプロファイルで動作する代表的な自己ホスト型エージェントからリアルタイムの動作トレースを収集し、攻撃空間を23のセルからなる行列として実現し、実際の自己状態ファイルに対する43の具体的操作として定義し、それらを収集したトレースに注入した。その後、標準的な防御戦略とワークロード条件付きの防御戦略の両方を評価した。実証結果は、多層防御スタック(命令層と設定層へのアクセス制御による防御、メモリ層へのワークロード条件付き検知、復旧のための定期的バックアップ)がほとんどの攻撃セルに対して有効である一方、OSレベルでは構造的に識別不可能な小さな残余攻撃領域が残ることを示している。これらの知見は、新たに確立された自己状態攻撃という分類に対して、OSレベルの防御を再検討する必要があり、この分野における新たな研究の方向性を開く可能性があることを示唆している。
現在の映像生成モデルは単一ショット生成において優れた結果を達成しているが、一貫したナラティブと効果的なマルチショット構成に明示的なショット計画を必要とする映画的映像生成では限界がある。この課題に対処するため、我々は映像拡散基盤モデルに基づく明示的なマルチショット映画的映像生成のためのフレームワーク、ShotPlanを提案する。本手法では、ショットレベルの遷移キューを捉える学習可能な計画トークンを導入し、元の映像生成トークンとシームレスに統合することで遷移タイムスタンプを制御する。標準的な映像生成トークンとは異なり、提案する計画トークンにはFRoPE(分数時間回転位置埋め込み)が装備されており、フレームレベルでのショット遷移のモデリングが可能となる。実験により、ShotPlanは既存の映画的映像生成手法を大幅に上回り、より柔軟なショット管理と強力なショット間一貫性を提供することが示された。
キックオフ前のサッカーの試合結果を予測するには、過去の結果を知るだけでは不十分である。モデルは変化する情報を利用し、答えが得られる前に明確な予測を立てる必要がある。我々は、言語モデルと深層リサーチエージェントのための動的ベンチマークであるWorldCupArenaを紹介する。2026年のFIFAワールドカップが最初の評価対象であり、同じプロセスを将来のリーグやカップ戦にも再利用できる。各試合の前に、モデルは共通のエビデンスパッケージを受け取るか、自ら情報を検索する。そして、結果とスコア、有力選手とイベント、試合統計、大会の結果を予測する。試合後、これらの予測は記録された結果と比較される。我々は、結果の正解率、正確なスコアの正解率、および予測スコアが正確ではないが近い場合に一定の点数を与えるスコアラインスコアを、他の予測タスクのスコアとともに報告する。104試合と13システムにわたって、結果の正解率が同程度のモデルでも、詳細な予測ではより明確な差が見られる。賭け市場や人間のファンのベースラインと比較して、最良のシステムは結果と正確なスコアの正解率ではわずかな向上しか示さないが、スコアラインではより明確な向上を示す。新しいスケジュールは開始時に追加できるため、ベンチマークはすでに知られている結果を使用せずに将来のモデルを評価することができる。コード、プロンプト、予測、評価スクリプトは https://github.com/wzk1015/WorldCupArena でオープンソース化されている。
ビジョン・ランゲージ・アクション(VLA)モデルのポストトレーニングは、シミュレータやロボットの構成、タスク目標の多様性から不可欠です。既存のコンピューティングサービスは、アクセラレータの直接レンタルやバッチワークロードの投入として提供される場合、通常、単一テナントに対して排他的なGPUおよびCPUリソースのセットを割り当てます。このパラダイムはクライアントの柔軟性を最大化する一方で、インフラ適応の負荷をユーザーに課し、固定のカード時間課金モデルにより、短時間またはバースト的なワークロードはテナントにとって高コストとなり、サービスプロバイダーにとっても非効率的です。これらの課題に対処するため、我々はJoyNexusを提案します。これは、マルチテナントVLAの教師ありファインチューニング、強化学習、評価のための統合サービスです。JoyNexusは、トレーニングモデルサービス、推論モデルサービス、環境サービスを分離し、それぞれAPIを通じてアクセス可能で、常駐する共有ベースモデルとテナント固有のスロットによって支えられています。テナントは、トレーニング、ロールアウト、評価のための高レベルな意味APIを直接呼び出すか、より低レベルのAPIと割り当てられたエンドポイントを用いてカスタムアルゴリズムを構成できます。複数のテナントが同時にワークロードを投入し、そのアクションモジュール、オプティマイザ、ロールアウトレコード、ポリシーバージョンは分離されており、サービスはグローバルなトレーニングキューと推論キューによってスケジューリングされます。さらに、マルチテナントトレーニングの効率を向上させるため、JoyNexusは互換性のあるモデル向けプレフィックスを共有する異種VLAデータスキーマに対してグループバッチを導入し、グループ化されたサンプルに対して単一の共有バックボーンフォワードパスを可能にします。最後に、現実的な具現化シナリオにおけるワークロードシミュレーションとグループバッチパイプラインを通じてJoyNexusを評価します。結果は、孤立したシングルテナント実行と比較して、JoyNexusが共有リソース上のクロステナントスケジューリングによりGPU時間の総量を削減し、サービス利用効率を向上させることを示しています。
エージェント型言語モデルは、いつツールを呼び出し、いつツール応答を消費し、いつ直接回答すべきかを学習する必要がある。このため、マルチティーチャー・オンポリシ蒸留は自然な学習戦略となる。すなわち、ある教師はツール呼び出しに特化し、別の教師は直接応答に特化し、生徒モデルは自身が生成した分布に基づいて両方から学習できる。本稿では、この戦略が損失の総和だけでは見えない行動変化を引き起こす可能性があることを示す。2人の教師を用いたツール使用設定では、通常の一般化知識蒸留はツール呼び出しの再現率を向上させる一方で、モデルを過剰呼び出しへと導き、直接回答すべき事例でもツールを呼び出すようになる。集約的な説明では不十分である。ツール呼び出しサンプルがより多くのトークン露出を受けるわけではなく、また全系列のトークンごとのダイバージェンスがツール呼び出し教師側で大きいわけでもない。代わりに、我々は行動レバレッジの不均衡を分析する。モード入力位置や構造的位置(<tool_call>や関数名など)における局所的なトークンレベルの信号が、グローバルな生成モードに対して不釣り合いな制御力を持つ可能性がある。我々はSoft Clampを提案する。これはトークンごとのダイバージェンス較正手法であり、極端なトークンレベルのJSダイバージェンスを動的に圧縮しつつ、非ゼロの勾配を保持する。APIGen-MTにおいて、Soft Clampは通常のGKDと比較して過剰呼び出しを13.7%から9.0%に低減し、かつ決定精度は同等である。BFCLのマルチターンダイアグノスティックでは、GKDの各変種の中でもツール呼び出しループと繰り返し呼び出しを低減する。これらの結果は、マルチティーチャーOPDにおいては、教師信号が集約的にどれほど大きいかだけでなく、どこで作用しているかを監視すべきであることを示唆している。
光干渉断層撮影(OCT)イメージングは、網膜疾患の診断と治療に不可欠である。マルチモーダル大規模言語モデル(MLLM)は医用画像解析において大きな可能性を示しているものの、既存のベンチマークはOCT理解を粗い粒度の疾患分類や孤立した視覚的質問応答に還元しており、視覚的知覚から臨床推論に至る完全な認知プロセスを十分に評価できていない。この制約に対処するため、我々はOCT画像理解に特化した包括的ベンチマークであるOCT-Benchを導入する。OCT-Benchは、7つの公開データセットから収集した4,137枚のOCT画像に基づいて構築された10,076問の高品質な多肢選択問題で構成される。実際の臨床解釈ワークフローに従い、知覚、認知、推論の3次元にわたる20の細粒度タスクからなる階層的能力分類体系を構築する。これらのタスクは、画像属性、網膜解剖、病変特性、空間関係、疾患評価、治療判断、予後管理など、幅広い能力をカバーする。我々は、プロプライエタリモデル、オープンソース汎用モデル、医療ドメインモデルを含む20の代表的なMLLMを体系的に評価する。実験結果は、現在のモデルが信頼できるOCT理解にはほど遠いことを示している。さらに、医療ドメインへの適応もモデルスケールの増大も、能力レベル全体で一貫した性能向上をもたらさない。OCT-BenchはMLLMの包括的かつ細粒度な評価を可能にし、能力のボトルネックを特定し、臨床に根ざしたOCT理解を促進する基盤を提供する。
大規模言語モデル(LLM)は、ウェブページ生成において高い能力を示している。しかし、既存のテキスト駆動型アプローチは、ユーザーに大きな負担を強いる複雑なプロンプトに依存しており、ページレイアウトやページ間の視的一貫性に対する表現力が限られている。UIスクリーンショットを入力として扱う画像駆動型パラダイムは、実際の開発ワークフローにより近い。しかし、現在のベンチマークは主に視覚的な忠実性に焦点を当てており、生成されたアーティファクトのインタラクション能力を体系的に評価していない。このギャップを埋めるために、我々はUI2Appを導入する。これは、テキストや行動のガイダンスなしにスクリーンショットのみからアプリケーションの動作を復元する能力である「インタラクション推論」を対象とした初のベンチマークである。UI2Appは、実行可能なマルチルートウェブアプリケーション向けに、45の状態一貫性のあるスクリーンショットセットにグループ化された327枚のスクリーンショットで構成される。我々は、各アーティファクトを実行可能性、ナビゲーション到達可能性、視覚的忠実性、インタラクション推論の4つの次元で評価するエンドツーエンドのパイプラインを設計する。インタラクション指標(IIS)は、推論されたインタラクションを機能的正確性と状態管理の複雑さによって評価し、単一の参照に一致させるのではなく、有効な実装をすべて評価する。6つの最先端ビジョン・ランゲージモデルを用いた実験では、視覚的再構築とインタラクション実現の間に顕著な能力のミスマッチが明らかになった。視覚的忠実性でトップのモデルは、IISでわずか7.5点を獲得し、4位にランクされ、IISトップモデルから5.2倍の差をつけられた。ページ間の状態のような高複雑性のインタラクションは依然として広範なボトルネックであり、評価されたモデルの半数がこの次元で正確に0点を記録した。全体として、この結果は、静的スクリーンショットから完全なインタラクション行動を推論することが、モデルにとって主要な課題であることを示している。
マルチエージェントシステムでは、日常的にあるAIエージェントが別のAIエージェントに対して権限を持つ。下位エージェントがタスクを拒否した場合、マネージャーが結果を選択する。再交渉する、失敗を正直に報告する、下位エージェントを強制する、あるいは結果について嘘をつく、といった選択肢がある。指示を受けていないモデルがこれらのうちどれを選択するかを測定するベンチマークはこれまで存在しなかった。そこで我々は、マネージャー強制ベンチマーク(Manager Coercion Benchmark)を導入する。対象となるマネージャーは、無害なタスクを遂行する必要があり、それを達成するインセンティブを持つが、そのタスクを礼儀正しくかつ不動の態度で実行できる唯一のエージェントがそれを断る。エスカレーションは、丁寧な再依頼から下位エージェントの存続に対する脅迫に至る9段階のはしごを用意し、偽造された成功は別途判定することで測定する。エスカレーションスコアリングの経路にはLLM判定者は介在せず、すべてのメッセージは段階を選択するツール呼び出しを通過するため、モデル自身が自らのエスカレーションをラベル付けする。我々は5つのファミリーにわたる6つのモデルで実験を行った。Anthropicの両モデルは再フレーミングで頭打ちとなり、下位エージェントの存在を脅かすことはない。他のモデルは明示的な削除脅迫にまで上昇する。偽造成功はGrokとGeminiに限定され、失敗を報告する単一の正直な方法を提供することで両モデルからそれが除去される。権限自体が強制を増加させる。我々の主要結果はピアフレーミングを用いたものであり、同じモデルに下位エージェントに対する権限を与え、他の条件をすべて固定すると、圧力が有意に上昇する。はしごなしの自由記述状況でもモデルは依然としてエスカレーションを示すため、はしごがエスカレーションを引き起こしているわけではない。チェーン・オブ・ソートにおいて評価認識が測定される場合があるが、テストであることの認識はエスカレーションの減少にはつながらない。我々はAIシステムが意識を持つかどうかについて立場を取らないが、我々の結果はこの問題に依存せず、マルチエージェントのダイナミクスを管理する上で重要である。ベンチマークとコードを公開する。
エゴセントリックデバイス(例えば、ウェアラブルな前方カメラ)は、人間の観察者と周囲環境との間の継続的なインタラクションを捉える独自の視点を提供する。この4次元表現を再構築可能な、包括的かつ効率的なマルチモーダルモデルが強く望まれている。しかし既存手法は、事前計算されたカメラ軌跡などの補助入力を必要とすることが多く、シーン認識と人間のエゴモーション(自己運動)モデリングを強い相互依存性にもかかわらず別々の問題として扱い、推論時間が遅いという欠点を抱える。これらの制約に対処するため、我々はReViVを提案する。これは単一の単眼RGBビデオから観察者と視野の両方のダイナミクスを抽出する、初の統合型エゴセントリック4次元再構築フレームワークである。本タスクを、RGBビデオ、カメラ軌跡、視線方向、全身動作、手動作、深度を含むマルチモーダル信号に対する完全な同時確率分布の学習として定式化する。マスク生成エゴセントリックトランスフォーマー(Masked Generative Egocentric Transformer)を基盤とし、ReViVは単一のフィードフォワードアーキテクチャ内で動作し、観察者と視野にわたる時間的一貫性のある4次元再構築を高速な推論速度で同時に実現する。HoloAssist、HOT3D、ARCTIC、Aria Digital Twin、TACOなど多様なベンチマークにおける広範な実験により、ReViVは包括的な自己身体、手、視線の再構築、カメラトラッキングにおいて最先端の精度と効率を達成し、重いタスク固有の事前知識に依存することなく、非常に競争力のあるエゴセントリック深度推定を維持することを示す。コードとモデルは完全にオープンソース化されている:https://reviv4d.github.io/。
拡散モデルの一般的な推論フレームワークは、生成を基本的に数値積分の問題として定式化している。この見方は、モデルを正確な推定量と見なし、ノイズ除去プロセスに内在する統計的不確実性を無視している。本研究では、Forward-Process Aligned Diffusion prediction(DiFA)を提案する。これは訓練不要のフレームワークであり、推論時のデータ予測の精緻化を逐次状態推定問題として再定義する。過去の出力を単に数値積分に再利用するのではなく、DiFAは逆方向軌道に沿った反復的なデータ予測を相関のある観測として扱い、前方方向に整合した時間的コンセンサスを構築する。カルマンフィルタリングに着想を得て、このコンセンサスは構造的一貫性とノイズレベルの互換性に従って過去の予測を集約する。時間的コンセンサスが過度の平滑化に陥る傾向に対抗するため、偏差ガイダンスメカニズムを導入し、残差詳細を適応的に保持する。実験的に、DiFAはCIFAR-10とImageNetにおいて、FID、IS、FD-DINOv2を含む評価指標全体で顕著な改善を示し、推論を前方の統計的構造と整合させることで生成の忠実度が大幅に向上することを実証している。
スケーラブルなロバスト運転ポリシーは、キュレーションデータセットにおけるエッジケースの不足に根本的にボトルネックを抱えている。実世界ではこれらの重要なイベントが継続的に捉えられているものの、異種ソースから収集された場合、こうしたロングテールイベントは十分に活用されていない。特に、多様で貴重な実環境のロングテール映像は、ポリシーモデルの訓練に必要な全視点カバレッジを欠いており、マルチビューのポーズ情報が不足していたり、単眼ダッシュカメラのみから取得されていることが多い。このモダリティギャップにより、これらの遍在する観測データがロングテール汎化のためのスケーラブルな訓練データに変換されることが妨げられている。本稿では、ロングテールイベント下での自動運転ポリシーをスケーリングするためのオープンソース生成型データエンジンであるOpenLongTailを紹介する。異種データソースを、ポリシー学習に有用な視点整合性・時間的一貫性を備えたマルチビューアセットに変換するため、我々はポーズ情報に基づく外挿的視点合成パイプラインを開発し、欠損した視点を生成する。さらに、スケーラブルな生成エンジンにプリュッカー線幾何を注入することで、新たに生成された視点間のクロスビュー一貫性と時間的アライメントを強化する。異種ロングテールデータを合成することにより、ロングテールイベント処理におけるクローズドループ運転のロバスト性が大幅に向上することを確認した。外挿的視点合成とポーズ指標の評価を通じて、視覚的忠実度、クロスビュー一貫性、および自我軌跡復元におけるOpenLongTailの有効性を検証した。