翻訳付きの日次キュレーションされたAI研究論文
我々はABot-World-0を提案する。これは、リアルタイムかつ長期的な閉ループインタラクションのための行動条件付きビデオワールドモデルであり、AAAゲーム、シミュレーションエンジン、インターネット動画にわたるマルチソースデータインフラに支えられ、制御可能な世界ダイナミクスを学習する。WorldExplorerは、訓練フィードバックに導かれたエージェント主導の収集を実行し、統一パイプラインは14の決定論的品質チェック、VLMベースの評価、同期された行動・テキスト注釈を適用する。我々は、教師強制とODE蒸留を通じて双方向行動条件付き教師モデルを因果的生徒モデルへと段階的に蒸留し、LongForcingを導入することで、長期の生徒自己ロールアウトを拡張時間軸の教師モデルと整合させ、累積的な分布シフトと自己回帰ドリフトを軽減する。生のキーボード行動は、シーン探索や三人称キャラクターインタラクションのための統一制御インターフェースを提供し、参照キャラクターメモリは三人称ロールアウト中にアイデンティティ一貫性のための持続的な外見的手がかりを提供する。デプロイメントのために、我々は軽量VAEデコーダ、効率的なアテンション、メモリ認識スケジューリング、低ビットDiT推論を備えたストリーミング推論スタックを共同設計する。最適化された低ビット構成において、ABot-World-0は単一のNVIDIA RTX 5090デスクトップGPU上で最大16FPSの720P動画をストリーミングし、アクションから初フレームまでのレイテンシは1.2秒、ピークVRAMは約19GiBである。WorldRoamBenchおよび拡張インタラクティブロールアウトにおける実験は、競争力のある制御可能性と、首尾一貫した長期的な世界の進化を示している。
大規模言語モデル(LLM)はデータ処理ワークフローの自動化にますます利用されるようになっているが、通常、コーディングエージェントが生成するスクリプトは、永続的で編集可能なプラットフォーム成果物として自動的に具現化されるわけではない。我々はこの非連続性を「NL2Pipelineギャップ」と呼ぶ。このギャップを埋めるために、我々はDataFlow-Harnessを導入する。これは、LLMエージェントを誘導し、自由形式のスクリプトではなく、型付きかつ増分的な変更を通じて、プラットフォームネイティブの有向非巡回グラフ(DAG)を構築させるプラットフォームである。このプラットフォームは、手続き的ガイダンスのためのDataFlow-Skills、生のオペレータレジストリと現在のパイプライン状態を公開するModel Context Protocol(MCP)レイヤー、そして対話型のオーサリングをビジュアルDAGエディタと同期させるDataFlow-WebUIを組み合わせている。12タスクのデータエンジニアリングベンチマークにおいて、DataFlow-Harnessは93.3%の観測されたエンドツーエンド合格率を達成した。バニラのClaude Codeと比較して、計測された金銭的コストを72.5%、生成レイテンシを49.9%削減し、観測された合格率はContext-Aware Claude Codeベースラインと0.9ポイント差以内でありながら、コストは42.8%低い。タスクごとの分析によると、Skillsは構築が暗黙の手続き的知識に依存する場合に最も有用であることが示された。これらの結果は、ライブプラットフォームによる基盤付けが、スクリプト生成ベースラインに近い観測信頼性と、より低い計測された構築コストおよびレイテンシで、永続的で編集可能なワークフロー成果物を生成できることを示している。
テキストから画像への拡散トランスフォーマー(DiTs)はテキストトークンと画像トークンを共に処理するが、ノイズ除去中の内部計算は未だ十分に理解されていない。我々は、注意機構分解とトークンスパン、ヘッド、レイヤーにわたる対象的介入を組み合わせた、現代の大規模DiTのための因果的解釈可能性フレームワークを導入する。これを用いてプロンプト内容トークンと構造テンプレートトークンを分離したところ、構造トークンはエンコーダ出力においてプロンプト固有の情報をほとんど保持していないことがわかった。しかし驚くべきことに、それらは支配的な画像からテキストへの注意シンクとして現れ、DiT内部で物体同一性を因果的に維持し、暗黙的意味レジスタとして機能する。我々は、これらがこの同一性を間接的に獲得することを示す。プロンプトの意味情報は最初に画像潜在変数に注入され、その後テンプレートトークンに読み戻されるのであって、プロンプトトークンから直接転送されるのではない。上記の発見に触発され、我々はDiTのための訓練不要のプルーニングルールを設計する。プロンプトトークンに最も強く注意を向けるヘッドは不要であり、それらをプルーニングすると注意FLOPsの20%が削減され、GenEvalのスコアはわずか1.4ポイント低下する。さらに我々は、DiTにおける生成計算がヘッドと深さにわたってどのように編成されているかを明らかにする。意味ルーティングと視覚合成を分離し、同一性形成から伝播、洗練へと進行する。我々の研究は、入力時に意味を符号化するトークンが生成中にそれを維持するトークンである必要はないことを明らかにするだけでなく、DiT内部メカニズムの因果的見解を提供する。
生成的ワールドレンダラーAlayaRendererは、物理エンジンから出力された構造化ワールド状態を受け取り、RGBフレームを合成する。テキストや制御ヒントからフレームを生成するモデルとは異なり、AlayaRendererは基礎となるワールドダイナミクスを変えることなくシーン構造を保持する。これは、インタラクティブなワールドモデリングとユーザー制御可能なプレイに向けた代替経路を示すものである。しかし、元のAlayaRendererは計算コストが高く、リアルタイム展開には不向きである。本テクニカルレポートでは、リアルタイム指向の生成的順方向ワールドレンダラーであるAlayaRenderer-Flashを紹介する。これはAlayaRendererを0.56 FPSから31.54 FPSへと高速化し、プレイ可能な速度を実現する。AlayaRenderer-Flashは、元のレンダラーを数ステップの自己回帰ストリーミングモデルとして再構成し、効率的な潜在エンコーディングとフレーム再構成のために軽量な蒸留コーデックを導入する。教師モデルのGバッファおよびテキストプロンプトインターフェースを維持しつつ、無制限長の入力ストリーム上での連続レンダリングを可能にする。AlayaRenderer-Flashを、Gバッファストリーム上でコンテンツ保存、時間的一貫性、ウィンドウ間安定性、プロンプト制御可能性、実行時効率の観点から評価する。評価結果は、AlayaRenderer-Flashが教師モデルの中核的なレンダリング能力を維持しつつ、推論コストを大幅に削減することを示す。AlayaRenderer-Flashを物理エンジンと統合することで、30 FPSで動作する完全にプレイ可能な生成的世界を構築する。
大規模な視覚生成モデルは高性能化が進んでいるが、訓練、微調整、デプロイに多大なコストを要する。本稿では、高効率なテキスト画像生成と指示ベースの画像編集を実現するコンパクトな4B規模生成スタック「Mage-Flow」を紹介する。このスタックは、軽量で高忠実度な潜在トークナイザ「Mage-VAE」と、整流流れマッチングで訓練されたネイティブ解像度対応マルチモーダル拡散Transformerという、共設計された2つのコンポーネントで構成される。Mage-VAEは、ワンステップの拡散型符号化・復号化とアンカー潜在正則化を採用し、既存の強力な公開VAEの再構成品質を維持しつつ、トークン化コストを一桁以上削減する。さらに、ネイティブ解像度パッキングとスタックレベルのCUDAカーネル融合により、柔軟な解像度での訓練を可能にし、エンドツーエンドの訓練スループットを約2.5倍向上させる。この基盤の上に、生成と編集の両方に対応したBase、RL整合、Turboの各バリアントからなる完全なモデルファミリを開発する。Diffusion-NFTはプロンプト追従性、テキストレンダリング、美的品質、編集忠実度を向上させ、敵対的知覚ガイダンスによる少数ステップ蒸留により、低レイテンシ推論のための4ステップTurboモデルを生成する。コンパクトな規模にもかかわらず、Mage-FlowとMage-Flow-Editは標準的な生成・編集ベンチマークで競争力のある性能を達成する。さらに重要なことに、Turboバリアントは高解像度の生成と編集をインタラクティブな用途に実用的なものにする。すなわち、単一のNVIDIA A100 GPU上で1024^2解像度での動作時、Mage-Flow-Turboは0.59秒で画像を生成し、Mage-Flow-Edit-Turboは1.02秒で画像を編集し、かつメモリフットプリントも小さい。これらの結果は、トークナイザ、バックボーン、システムの注意深い共設計により、効率的な4Bモデルファミリ内で強力な高解像度生成と編集を実現できることを示している。
従来のゲーム開発がアセット制作、アニメーション、物理演算、プログラミングといった労働集約的なパイプラインに依存していたのとは異なり、ビデオワールドモデルはユーザー入力から即座にインタラクティブな環境を生成する。これにより、テキスト、画像、あるいは動画から、カスタマイズ可能で探索可能、かつ継続的に進化する仮想世界を創り出すことができる。このビジョンを実現するには、インタラクション、持続的な時空間一貫性、安定した長期生成、そして効率的な応答という、密接に関連した4つの能力が必要となる。本稿では、540pおよび720pの解像度で24fpsの動画を生成する、インタラクティブな長期ビデオワールドモデルであるAlayaWorldを提案する。AlayaWorldは、150億パラメータのビデオ拡散トランスフォーマー上に構築されており、カメラ軌道と切り替え可能なテキストプロンプトの下で、短い潜在チャンクを自己回帰的に生成する。その有界視覚コンテキストは、永続的なシンクフレーム、圧縮された時間履歴、幾何学的に整合された空間記憶、および直近フレーム条件付けを組み合わせたものである。長期ドリフトを低減するため、モデルは自身のロールアウトから収集された破損履歴と予測残差を用いて訓練される。さらに、分布一致蒸留、自己強制++、および一致性蒸留を組み合わせた離散自己回帰蒸留定式化を導入し、1チャンクあたりの推論を約30サンプリングステップから4ステップに削減する。iWorld-Benchにおいて、AlayaWorldは長期生成において最高の性能を達成した。フルスタックでオープンソース、かつ長期的なプロジェクトとして構想されたAlayaWorldは、インタラクティブなビデオワールドモデルに関する将来の研究のための拡張可能な基盤を提供することを目的としている。
拡散言語モデル(DLM)は、近年、自己回帰モデルに代わる有望な手法として登場した。標準的な拡散ベースの手法とは異なり、DLMはタイムステップに明示的に条件付けられていないため、自然な疑問が生じる:これらのモデルは内部でノイズ除去の進行状況を表現しているのか、またそのような情報は下流でどのように利用されるのか?本研究では、DLMが実際に残差ストリーム内に拡散タイムステップに関連する潜在表現を符号化していることを示す。この信号は層を横断したプローブを用いて確実に抽出可能であり、ノイズ除去の進行状況が内部活性化から復号可能であることがわかる。さらに、推定されたタイムステップに関連する低次元部分空間に沿ってモデルを操縦することで、ノイズ除去の進行に関するモデルの概念を系統的に変調でき、その結果、モデルの信頼度とエントロピーに予測可能な変化が生じることを実証する。最後に、特定された表現の幾何学を解析し、活性化空間において構造化され解釈可能な特性を示すこと、またそのような信号がこれらのモデルによってどのように処理されるかを明らかにする。
非同期強化学習は、ロールアウト生成と最適化を分離することでスループットを向上させるが、ポリシーの遅れ、エンジンの遅延、混合専門家ルーティングによって悪化する陳腐化は不可避な副産物である。信頼領域の観点からは、この不一致は深刻である。学習と推論の乖離が有限地平線のバウンドにおける近似誤差を支配する一方、PPOクリッピングはサンプリングされた外側への更新のみを制限し、全ポリシー制約ではなくサンプリングされた代理関数として機能する。その結果、陳腐化したロールアウトが最も重大となる非同期設定では、高陳腐化更新の制御が弱いままとなる。 本稿では、陳腐化適応信頼領域(SAT)を導入する。これは、分離されたサンプリング対数比を実用的な陳腐化プロキシとして用い、陳腐化ベースのカーネルスケーリングにより各バッチ内の高不一致テールを特定し、名目PPO区間の符号選択された端点のみを縮約する。これにより、通常のトークンでは基本動作を維持しつつ、新たに捕捉された外側帯域ではより保守的な更新を強制する。我々は、PPOに対する局所区間包含と点ごとの悲観性を証明し、適応ルールが不均一な陳腐化下で更新幾何をどのように再形成するかを示す。 我々は、Qwen3-30B-A3B-Baseをベースとし、SGLangを推論エンジン、Megatronを学習に用いた分離型非同期RL設定においてSATを評価する。この設定で、SAT-GSPO w/ R3は最高のAIME24 avg@8を達成し、ラグ1で35.83、ラグ8で34.79となり、SAT-GSPOはラグ1で34.17となった。適応的クリッピングとルーティングリプレイは、それぞれ不一致テールとルーティングの不一致を対象とした相補的な安定化手法として機能する。全体として、クリッピング区間を陳腐化の不均一性と整合させることで、非同期RLを効果的に安定化できる。
LLMエージェントの障害は、エラーが表面化するステップが原因となるステップと一致しないことが多いため、デバッグが困難である。既存の可観測性ツールは実行トレースを再生するものの、根本原因の特定や診断から復旧への変換を支援する機能はほとんど提供していない。本稿では、デバッグを「検出(Detect)」「特定(Attribute)」「復旧(Recover)」「再実行(Rerun)」の閉ループとして整理するオープンソースのデバッグフレームワークAgentDebugXを提案する。その中核をなすDeepDebugは、グローバルな軌跡理解、構造誘導による調査、および相互検証を通じて、多ターンの根本原因診断を実行する。Who and Whenベンチマークでは、DeepDebugは評価対象のすべての手法の中で、テストした両方のオープンウェイトバックボーンにおいて最高の厳密な帰属精度を達成し、qwen3.5-9bではエージェントとステップの完全一致精度が28.8%となり、最も強力なシングルパスベースラインの21.7%を上回った。GAIAでは、DeepDebugは73件の失敗タスクのうち13件を1回の再実行で修復し、3つの分離型自己修正ベースラインの4~6件と比較して、全体の精度を55.8%から63.6%に向上させた。AgentDebugXは、このワークフローをPythonライブラリ、CLI、Webコンソール、およびインストール可能なエージェントスキルとして公開し、オプトイン型のError Hubを提供することで、スクラブ(機密情報除去)済みの障害・診断・修復バンドルの共有と、デバッグメモリとしての再利用を可能にする。
構造的忠実性は、科学的方法論の図にとって不可欠である。研究のロジックを伝達するためには、これらの図は構成要素、方向性関係、およびテキスト注釈を忠実に表現しなければならない。矢印の向きの間違いや判読不能な数式といった単一の誤りが図全体を無効にする可能性があるため、構造的忠実性は本質的に連言的である。すなわち、ある軸での正確性は別の軸での失敗を補償できない。現在のオープンソースモデルは、この基準を満たしていない。教師ありファインチューニング(SFT)は見た目に妥当なレイアウトを学習するが、構造的正確性を確実に保証することはできず、スカラー報酬に基づくポストトレーニングは、どの構造的次元で失敗したかを不明瞭にする。この問題に対処するため、我々はSciFormaを紹介する。SciFormaは、科学的方法論の図を構造的に忠実に生成するためのフレームワークである。具体的には、SciFormaは図の品質を、構造的インベントリに基づいて、構成要素、矢印、テキストの三つの構造的軸に分解する。この基盤の上に、構造化トレーニング用のSciFormaData-700Kと、ロジック検証済み評価用のSciFormaBench-2Kをキュレーションする。SFTによって残されたギャップを埋めるために、我々は多次元連言選好最適化(M-DPO)を開発する。これは、全軸にわたる同時的正確性を強制し、ポストトレーニングにおいて最も不足している次元に適応的に勾配をルーティングする。同じ構造的インベントリにより、推論時における反復編集も可能となり、残差誤差を修正できる。この組み合わせにより、SciForma-9BはSciFormaBench-2KとAIBenchの両方において、すべてのオープンソースベースラインおよびGPT-Image-1.5を上回り、オープンな科学図生成をプロプライエタリレベルの構造的忠実性に近づける。我々のコードとデータは以下で公開される予定である:https://github.com/microsoft/SciForma。
効率的なチームワークは通常、グローバルな調整と並列実行を組み合わせるが、この原則は統合型Vision-Language Model(VLM)ベースの文書パーサーにはまだ完全には反映されていない。既存の統合型パーサーはページ全体を一括で処理するが、その出力はトークン単位の単一の自己回帰軌道を通じて生成され、文書の長さに応じて拡大する逐次的なボトルネックを生み出している。このようなページ全体の逐次生成は、文書解析の重要な特性を見落としている。すなわち、レイアウトはグローバルに分析されなければならない一方、ブロックコンテンツは並列に解析できる。この観察に基づき、我々はHPD-Parsingを導入する。これは、ページ全体の自己回帰生成を階層的並列デコーディングパラダイムに置き換えるものである。メインレイアウトブランチが文書全体の構造を整理し、ブロックレベルのコンテンツデコーディングを動的に並行ブランチに割り当てる一方、プログレッシブマルチトークン予測(P-MTP)が各ブランチ内のデコーディングステップをさらに削減する。公開ベンチマークでの実験により、HPD-Parsingは毎秒4,752トークンを達成し、既存の最速文書解析モデルの2.62倍、バニラ自己回帰ベースラインの3.06倍のスループットを実現しつつ、競争力のある解析精度を維持していることが示された。これらの結果は、階層的並列デコーディングがページ全体の自己回帰生成に対する効果的な代替手段であることを確立し、効率的な統合文書解析の新たな方向性を切り開くものである。
長文生成の事実性評価は、主に精度(モデルが述べる主張が正しいかどうか)に焦点を当ててきた。主流である分解・検索・検証のパイプラインは、誤った主張をよく捉えるものの、応答が必要な情報をすべて含んでいるかどうかについてはほとんど示さない。事実完全性(事実性の欠けている半分)の測定はより困難である。なぜなら、完全な回答が含むべき事実の全集合を列挙する必要があり、これらの事実が単純な一覧になることは稀だからだ。それらは、カバレッジが重要となる非閉じた集合や、順序付けられたプロセス、独立したブールチェックのリストでは捉えられない事実間の関係を含むことが多い。本稿では、非閉じた生成を評価するための2段階メタルーブリックフレームワークを導入し、それを長文生成における事実完全性のベンチマークであるGamut(グラウンデッド・アセスメント・オブ・マルチモーダル・ファクチュアリティ)として具体化する。このフレームワークは、2段階のルーブリック表現に基づく。構造化されたメタルーブリックが、必要な内容の構成と重要度を捉え、それを機械的に、LLM判定器が信頼性高くスコアリングできる2値・機械評価可能なルーブリックのフラットなチェックリストにコンパイルする。我々は、10の多様な領域にわたる実際のウェアラブル画像に基づく1,813の質問を構築し、各質問には専門家による人間の注釈者によって検証されたエビデンスに基づくルーブリックを付与した。このフレームワークはモダリティに依存しないため、テキストのみのバリアントも公開する。14の最先端およびオープンウェイトモデルを評価した結果、本ベンチマークは真に挑戦的であり(最高スコアはGemini 3.1 Proの58.7%)、識別力が高く、判定器の選択に対してもロバストであることが判明した。
本稿では、生ドキュメントを検索システムに露出される表現へと変換する実行可能な変換である、表現プログラムを学習するためのフレームワークAutoIndexを提案する。AutoIndexは、検索器や再ランク付け器、あるいは少数の前処理ハイパーパラメータを調整するのではなく、インデックス作成前にドキュメントをスライス、拡張、正規化、再重み付け、または再編成するプログラムを探索する。各イテレーションにおいて、AutoIndexは検証に基づくプログラム探索を実行し、エージェントが現在のプログラムの障害を診断し、候補となる更新を合成し、その結果のインデックスの下で検索品質を向上させる更新のみを保持する。我々はAutoIndexを、多様な検索タスクからなるベンチマークCRUMBで評価し、全実験でBM25を固定した。学習されたプログラムは、静的全文BM25ベースラインと比較して、全8タスクにおいて再現率を向上させ、Recall@100で平均+8.4%、nDCG@10で平均+8.3%の向上を示し、最大の向上はRecall@100で+30.5%、nDCG@10で+43.6%であった。これらの結果は、ドキュメント表現は検索開始前に行われる固定された前処理の選択として扱われるべきではなく、明示的な最適化対象として捉えるべきであることを示唆している。結果を再現するコードはhttps://github.com/auto-index/autoindexで公開されている。
検証可能な報酬を用いた強化学習(RLVR)は、言語モデルの推論能力を急速に向上させているが、報酬フィードバックを重み空間の更新に変換する最適化層については、依然として理解が不十分である。我々は先行研究(Zhu et al., 2025)に基づき、モデル重みの特異構造を通じてこの欠落した層を研究し、スペクトル継承を特定した。すなわち、RLVRはベースモデルの重みスペクトルを再利用しながら、関連する入力・出力特異フレームの変更を通じて新しい振る舞いを獲得することができる。 我々はスペクトル継承を等スペクトル最適化(ISO)として具体化する。これはRLVR固有の固定スペクトル最適化フレームワークであり、オフラインとオンラインの相補的な実装を持つ。オフラインでは、ISO-Mergerが共有ベースの専門家モデルのフレーム変更を単一の固定スペクトルモデルに統合し、マージ後のデータ、ロールアウト、勾配更新、オン・ポリシー蒸留(OPD)を一切必要としない。これにより相補的な専門家能力を回復し、比較対象としたデータフリーのマージ手法の中で最も強い総合性能を達成する。オンラインでは、ISO-OptimizerがAdamWやMuonなどの選択したベース最適化手法をフレーム変数に適用し、ベーススペクトルは固定したままとする。1.5Bから8Bパラメータの推論およびコーディングタスクにおいて、ISO-Optimizerは報告された実行で精度を向上させ、大幅に少ないトレーニングステップで同等のスコアに到達する。Qwen3-8B-Baseでは、AdamWが270トレーニングステップ後に0.495の総合精度に達する。ISO-AdamWはわずか100トレーニングステップで同じ精度に達し、210トレーニングステップ後には0.509にさらに改善する。総合すると、ISOはRLVRの欠落した最適化層に対する具体的な回答を提供する。すなわち、事前学習の最適化をそのまま継承するのではなく、報酬駆動型適応の構造に合わせてポストトレーニングを設計する。スペクトルを継承し、フレームを最適化するのである。
不均一に注釈付けされたデータで訓練された現代のASRモデルは、転写スタイル(逐語的 vs. 意図的)を制御されていない潜在変数として扱い、その結果、測定可能な復号の不安定性、評価の交絡(報告されたWERの最大60%がスタイルの不一致に起因する)、および信頼性の低い単語レベルのタイミングを引き起こす。我々は、モデルが既に両方のスタイルを符号化していること、課題は制御された活性化にあることを示す。カバレッジを考慮したデコーダタスクトークンを、並列な逐語的/意図的転写ペアで訓練することにより、英語のみの訓練にもかかわらず、ドイツ語の非流暢性F1をゼロショットで10%から79%に向上させる。完全な英語のみの微調整は、両言語において、逐語的正確性、非流暢性検出、および意図モード品質においてすべてのベースラインを上回る。さらに、強制アライメントのベースラインを超えて、非流暢な音声に対する単語レベルのタイムスタンプを改善する教師ありクロスアテンション微調整を導入する。最後に、高品質な正準逐語転写を用いた音声コーパスのスケーラブルな作成と拡充を可能にする新しいタスクであるverbatimize(逐語化)を提案する。
ビデオモデルは、視覚世界がどのように動き、相互作用し、接触に応答するかという豊富な事前知識を吸収しており、ロボットの世界モデリングのための有望な基盤となる。中心的な課題は、こうしたモデルに対して、それらが相互作用の事前知識を学習した視覚空間と整合しつつ、物理的な操作に根差した形で行動を伝達する方法にある。本稿では、マスク可視行動(Masked Visual Actions)を導入する。これはピクセル空間を介した制御インターフェースであり、行動をビデオ内の任意のエンティティの軌跡が部分的に明らかにされたものとして表現する。ロボットの動作を明らかにすることで、モデルは低レベルのロボット行動に対するシーンの応答を予測する前方動力学モデルとして機能する。一方、目的とする物体の動きを明らかにすることで、同じモデルがその結果と整合するロボットの振る舞いを回復する。実ビデオとシミュレーションからのマスク例をわずか15時間で微調整した単一のチェックポイントは、多様なシーンや複数の実施形態にわたって高い視覚的忠実性と制御可能性を達成する。下流の操作設定では、このモデルは、実際の実行結果と相関する想像上のロールアウトを生成し、政策評価を支援する。さらに、モデルベース計画における候補となる未来の順位付けにより意思決定を改善し、目的とする物体の動きからロボットの動作を合成する逆モデリングをサポートする。
検証可能な報酬による強化学習(RLVR)は、数学的推論やコード生成といったタスクにおいて、大規模言語モデルの推論能力を大幅に向上させてきた。しかしながら、ほとんどのRLVR手法は軌跡全体に対してスカラーの結果報酬を割り当てるため、教師信号が疎になり、トークンレベルのクレジット割り当てが限定的となる。オン・ポリシー蒸留(OPD)は、より強力な教師モデルからトークンレベルの分布を蒸留することで密な教師信号を提供するが、追加の教師モデルを必要とし、通常は共有語彙を仮定する。オン・ポリシー自己蒸留(OPSD)は、同一モデルに特権情報を条件付けることで教師方策を構築し、この依存性を除去する。しかしながら、教師分布を直接マッチングすると、情報漏洩や不安定な最適化を引き起こす可能性がある。RLSDは、教師信号を更新規模の調整にのみ用いることで直接的なマッチングを回避するが、サンプリングした推論が失敗した際に明示的な修正方向を提供できない。このトレードオフに対処するため、我々はH²SD(ハイブリッド・ハインドサイト・自己蒸留)を導入する。これは軌跡の正誤に応じて教師の使い方を変える枠組みである。成功軌跡に対しては、教師は正解と確認された生徒の応答と言い換え指示を受け取り、元の応答トークンに対するその確率を、報酬が決定する方向を変えずに更新規模の調整に用いる。失敗軌跡に対しては、教師に重要な推論ステップと検証済み解答を含む参照ヒントを条件付け、生徒から教師への逆KLダイバージェンスを最小化する。複数の困難な推論ベンチマークを用いた実験により、H²SDは代表的なRLVR、OPSD、RLSDのベースラインを一貫して上回り、安定した最適化と良好な生成効率を維持することを示す。
オプティマイザ状態は、混合エキスパート(MoE)学習のメモリ予算において最大の単一項目である。6.78BパラメータのMoE言語モデルでは、AdamWは12.6GBのbfloat16重みを更新するために、50.6GBの一次モーメントと二次モーメントを保持する。本研究では、MoEの3つのパラメータ集団(高密度バックボーン、エキスパート、ルータ)がサイズと勾配統計量において十分に異なり、同一の状態を受け取るべきではないという観察に基づいたオプティマイザであるSkewAdamを研究する。SkewAdamは、バックボーン(パラメータの5%)にはfloat32の運動量と因子分解された二次モーメントを、エキスパート(95%)には因子分解された二次モーメントのみを、ルータ(0.01%未満)には正確な二次モーメントを保持する。結果として得られる状態は1.29GBを占め、AdamWの2.6%に相当し、ピークトレーニングメモリは81.4GBから31.3GBに減少し、40GBアクセラレータの予算内に収まる。同一初期化から8200万トークンにわたる制御比較において、SkewAdamは検証パープレキシティ108.4を達成し、AdamW(126.8)、Muon(120.2)、Lion(393.7)を上回り、ルータの負荷バランスを均一下限の1%以内に収めた。この割り当て自体がパープレキシティをもたらすわけではない。階層アブレーションでは、20倍の状態量で同様の結果を示し、因子分解推定器を共有するが運動量を削除したAdafactorは40ポイント遅れをとる。階層は精度を犠牲にすることなくメモリを節約し、精度は運動量を保持することに由来するが、これは均一オプティマイザも同様に共有する。ベースラインの学習率を掃引しても差は縮まるが完全には埋まらず、最適調整されたAdamWは118.5、調整されたAdafactorは139.7に達する。これらの結果は、オプティマイザ状態がどこに存在するかが、その量と少なくとも同等に重要であることを示唆している。
クロスビュー地理的位置推定は、地上観測を地理タグ付き衛星画像と照合する手法である。近年の手法では、ビデオクリップのような逐次クエリが単一画像よりも豊かな時空間的手がかりをもたらすことが示されているが、補完的な逐次モダリティであるルート記述は見落とされている。ルート記述は同一の軌跡をより高度な抽象化レベルで捉え、しばしば唯一利用可能な入力となる(例えば、ユーザーが自動運転車を集荷地点に誘導する場合)。このギャップを埋めるため、我々はsim39Kのビデオ-テキスト-衛星三つ組データセットであるSeqGeo-VLと、ビデオクリップとルート記述の両方を処理可能な統一フレームワークTrajLocを導入する。TrajLocは密な視覚的意味論と抽象的な言語的意味論の両方を活用することで、これらのモダリティがクロスビューマッチングを相互に強化することを可能にする。さらに、クエリ埋め込みを軌跡形状に条件付ける軽量モジュールTrajModを提案し、空間認識表現を生成する。実験により、TrajLocはビデオおよびテキスト地理的位置推定の両方において最先端手法を大幅に上回ることを示す。プロジェクトページはhttps://humblegamer.github.io/trajloc/で公開されている。
大規模な農業用圃場境界の正確な抽出は、食料安全保障、サプライチェーンの透明性、および炭素会計の基盤となる課題である。SAMのようなビジョン基盤モデルは顕著なゼロショット能力を示すものの、トポロジーの複雑さ、農地のテクスチャパターン、物理的なスケール認識の欠如により、地理空間領域ではしばしば失敗する。本研究では、広域圃場境界マッピングに特化して設計された、グローバルにスケーラブルな基盤モデル「Delineate Anything v2」を提案する。我々は、61カ国を網羅する7300万インスタンスのマルチ解像度データセット「FBIS-73M」を構築した。多圃場の行政区域ポリゴン融合という広範な問題に対処するため、解像度特化型データキュレーションパイプラインを導入し、トポロジカルな画像空間適応を活用して融合ポリゴンを均質化し、弱い物理境界を強化する。さらに、100カ国をカバーする新規の手動キュレーション評価ベンチマークを確立し、独立したゼロショット汎化性能を評価する。実験結果から、Delineate Anything v2は現行の最先端手法(Delineate Anythingフレームワークを含む)を0.284 mAP@0.5(+103.3%の相対利得)で上回り、かつ消費者向けワークステーション上でのウクライナ全国マッピング(603,000 km²)を5.4時間で完了するなど、国家・全球規模での迅速な展開に適した実行速度を維持することを示す。コード、学習済み重み、FBIS-73Mデータセット、および即利用可能な国家規模ベクトル境界プロダクトは、https://github.com/Lavreniuk/Delineate-Anything で公開されている。
教育ビデオは主要な教育媒体となりつつあり、その教育的品質をスケーラブルに評価する必要性が高まっている。既存の自動評価器は、教育の質がマルチモーダルな証拠に依存し、普遍的な特性としてではなく、対象とする学習者に照らして評価されるべきであるという点で、この状況に完全には対応していない。我々はEduPanelを提案する。これはルーブリックに基づき、学習者条件付きで動作するLLM評価器であり、専門エージェント間で評価を分解し、教育品質の異なる側面について解釈可能な評価を生成する。専門家による研究、アーキテクチャのアブレーション実験、学習者ペルソナ分析を通じて、EduPanelは専門家中央値に匹敵する信頼性を達成した。専門家による評価では、そのフィードバックにより採点精度が向上し(MAE 0.87→0.73)、同時に専門家は信頼性の低い出力を盲目的に受け入れるのではなく検出できる(AUC = 0.77)。これらの結果は、EduPanelが人間専門家の代替ではなく、教育的評価のための効果的なアシスタントとして機能し得ることを示唆している。
制御可能な画像生成は、創造的なプロフェッショナルにとって依然として課題であり、彼らはしばしば素材、オブジェクトのアイデンティティ、空間配置に対して、テキストプロンプトだけでは確実に実現できない精密な領域制御を必要とします。拡散トランスフォーマー(DiTs)は、テキストや画像に由来する異種トークンをネイティブに取り込むことができますが、これらのトークンが出力にどのように、どこで影響を与えるべきかを決定するメカニズムを欠いています。我々は「外観ポインタ(appearance pointers)」を導入します。これはコンパクトなトークンであり、テキストや画像の入力をユーザー指定のマスクと整合させることで、DiTを正しい空間位置における正しい外観の手がかりへと導きます。外観ポインタは領域対応ネットワークによって生成され、空間集約メカニズムを通じて洗練され、トークン負荷を大幅に増加させることなく、モデルが複数の領域記述を処理できるようにします。本手法は、基礎モデルをゼロから再トレーニングすることなく、DiTにおける局所的なマルチモーダル制御のための最初のモダリティ非依存インターフェースを導入します。さまざまな指標において、我々の単一モデルはモダリティ固有の最先端手法の性能に到達するか、それを上回り、生成的画像合成における精密で領域認識型のマルチモーダルガイダンスへのシンプルかつ拡張可能な道を提供します。
マルチモーダルなユーモア(ミーム、風刺漫画、コミック等)は、意図された意味が文字通りの情景記述ではなく、非字義的なメカニズム、共有された文化的知識、および伝達意図に依存するため、AIシステムにとって依然として困難である。本サーベイでは、単一画像および複数パネルからなる作品における視覚的ユーモア理解に焦点を当てつつ、ユーモア生成を新たな下流フロンティアとして位置づける。我々は、既存のユーモア、皮肉、および一般的なMLLMサーベイに対して本文献を位置づけ、認識・解釈と推論・生成を網羅する能力中心の階層構造を用いて整理する。この観点に基づき、ベンチマーク設計、評価プロトコル、モデリングパラダイムを統合し、タスク特化型融合モデルからマルチモーダルアライメント、エビデンスに基づく推論、制御可能生成を活用した大規模モデルアプローチへの分野の移行を追跡する。最後に、進歩を阻む主要な障壁として、ショートカットに依存しやすい評価、限定的な文化的・物語的カバレッジ、弱いエビデンスの根拠付け、および未解決の安全性・所有権に関する懸念を強調する。
ビデオ空間推論は、ナビゲーション指向の知覚や長尺ビデオ質問応答において不可欠であり、モデルは視点が変化する長期的な時間スパンにわたって空間関係を推論する必要がある。しかし、既存のマルチモーダル大規模言語モデル(MLLM)は依然としてセマンティクス中心であり、冗長なビデオ観測から一貫した空間的証拠を確実に集約できず、非効率または不安定な推論を引き起こすことが多い。これらの問題に対処するため、我々はConsiSpaceを提案する。これは、幾何学的一貫性を考慮したフレームワークであり、空間的一貫性を証拠整理の原理として、また教師付きファインチューニング(SFT)後の明示的な学習信号として活用する。我々は、暗黙的証拠トークンと明示的な幾何学的手がかりを含む幾何一貫メモリ(GCM)を構築し、効率的な整理戦略を活用してタスク関連の空間的証拠をコンパクトに保持する。さらに、教師付きファインチューニング後に統一的一貫性自己教師あり強化学習(UC-SSRL)を適用し、回答、メトリクス、トポロジーの一貫性に関する報酬を用いて、ビュー間の安定性を向上させる。3つの空間推論ベンチマーク(VSI-Bench、OSI-Bench、MMSI-Video-Bench)における広範な実験により、一貫した改善が示され、最強のベースラインと比較して平均スコアが12.6ポイント向上した。