翻訳付きの日次キュレーションされたAI研究論文
近年の動画理解の進歩は、動作、長時間動画、ストリーミングインタラクションに及び、この分野を実世界のアプリケーションへと押し進めています。この進歩にもかかわらず、現在のオープンソースモデルにはいくつかの点で限界があります。多様な動画タイプにわたって汎化することが難しく、特定の領域でのみ有効であることが多いです。高い計算負荷が効率性とスケーラビリティをさらに制限しています。さらに、ほとんどのモデルは部分的にしかオープンではなく、トレーニングコード、戦略、データセットなどの主要コンポーネントが利用できないため、再現性が損なわれ、コミュニティ主導の開発が遅れています。 これらの問題に対処するため、完全にオープンで効率的かつ汎用的な動画中心のMLLMであるVideoChat3を導入します。VideoChat3は、2つの相補的な設計を通じて動画理解を進化させます。効率性のために、膨張型3Dビジョントランスフォーマー(I3D-ViT)とストリーミング動画認識のための適応フレーム解像度を導入し、効率的な時空間表現を可能にし、トレーニングおよび推論中の動画入力処理のコストを削減します。効果性のために、スケーラブルな動画データ合成パイプラインを開発し、汎用、長時間形式、ストリーミング動画シナリオをカバーする3つの多様で高品質なトレーニングデータセット(VideoChat3-Academic2M、VideoChat3-LV116K、VideoChat3-OL617K)をキュレーションし、モデルのドメイン間での汎化を向上させます。これらの設計を統合することで、VideoChat3は幅広い汎化と計算効率の稀なバランスを達成します。汎用、長時間形式、ストリーミングの各ベンチマークにわたる実験は、VideoChat3が同等またはそれ以上のパラメータ数を持つ従来のオープンソースモデルを、わずか4Bパラメータでより高い効率性をもって凌駕することを示しています。
大規模言語モデルは、マルチターン対話、ツール使用、環境フィードバックを伴う長期的なタスクを遂行する対話型エージェントとして訓練されることが増えている。成果ベースの強化学習(RL)は実用的な最適化パラダイムを提供するが、そのスパースな軌跡レベルの報酬は中間的な決定に対するガイダンスが限られており、エピソードレベルの成果とトークンレベルの方策学習の間に監督のギャップが生じる。我々はSEED(SElf-Evolving On-Policy Distillation)を提案する。これは、完了したオン方策軌跡を訓練時のハインドサイトスキルに変換し、その行動効果を方策モデルに蒸留する自己進化型フレームワークである。SEEDはまず、方策を微調整して完了した軌跡を分析し、再利用可能なワークフロー、決定的な観測、失敗回避ルールを捉えた自然言語スキルを生成する。RL中、現在の方策は軌跡を収集すると同時に、そこからハインドサイトスキルを抽出するアナライザとして機能する。したがって、方策の更新はその後の意思決定とスキル分析を同時に改善し、ハインドサイト監督が方策とともに進化することを可能にする。次にSEEDは、通常の文脈とスキル拡張文脈の下でサンプリングされた行動を再スコアリングし、スキルによって誘発される確率変化を密なトークンレベルのオン方策蒸留信号に変換する。この信号は成果ベースのRLと共同で最適化され、補助的な監督を現在の軌跡分布に適合させたままにする。テキストベースおよびビジョンベースのエージェントタスクに関する広範な実験により、SEEDが一貫してパフォーマンスとサンプル効率を向上させ、未知のシナリオに対する頑健な汎化を示すことが明らかになった。コードは https://github.com/jinyangwu/SEED で公開している。
近年のツール統合型大規模言語モデルの進展により、ウェブ検索は情報探索エージェントの中核的能力となった。しかし、相互作用履歴が増大するにつれ、エージェントはタスクの進捗を追跡することがますます困難になっている。検索試行が有用な証拠を得られなかった場合、現在の単一エージェントおよびマルチエージェントシステムは反復ループに陥り、検索予算を浪費し、最終的な出力の品質と完全性を損なう可能性がある。本稿では、脆弱で暗黙的な検索進捗を明示的で永続的かつ共有可能な状態に変換するシステムレベルのマルチエージェントフレームワークであるSearchOSを提案する。まず、オープンドメイン情報探索を、根拠付き引用を伴う関係スキーマ補完として定式化する。これにより、エージェントはエンティティを発見し、リンクされたテーブル間で属性を入力し、各値をソースエビデンスに固定する。次に、Search-Oriented Context Management (SOCM)を設計し、進化する状態をフロンティアタスク、エビデンスグラフ、カバレッジマップ、失敗記憶に外部化する。SOCMに基づき、SearchOSはパイプライン並列スケジューリング機構を適用し、サブエージェントの実行を重複させ、未解決のカバレッジギャップを対象としたタスクで解放されたスロットを継続的に補充することで、利用率とスループットを向上させる。検索エージェントのスケジューリングと実行制御のために、SearchOSはSearch Tool Middleware Harnessを導入し、モデルとツールの相互作用をインターセプトして根拠付き証拠を記録し、停滞や予算枯渇に反応する。さらに、戦略スキルとアクセススキルからなる再利用可能な階層的スキルシステムを提供し、エージェントの検索プロセスを強化し、実行間で失敗した検索パターンの反復を回避する。WideSearchおよびGISAにおいて、SearchOSは評価されたすべての単一エージェントおよびマルチエージェントベースラインの中で全指標でトップとなり、堅牢な情報探索協調への道を切り開く。
推論コンテキスト長とRL後トレーニングの間には、拡大する乖離が存在する。推論システムは100万トークン規模のコンテキストに近づいている一方、後トレーニングのワークロードは多くの場合256Kトークン以下に留まり、デプロイ時の長さの一般化に依存している。この乖離は、エージェントが長期間にわたる軌跡の中で観測、ツール出力、ドキュメント、過去の判断を蓄積するAIエージェントにとって特に重要である。LongStrawは、固定GPU予算の下で100万トークン規模のRL後トレーニングを実現するアーキテクチャ認識型の実行スタックであり、Group Relative Policy Optimization(GRPO)を用いて実現されている。本システムは、共有プロンプトをautogradなしで評価し、後続のトークンに必要なモデル固有の状態のみを保持し、短い応答ブランチを一度に一つずつリプレイすることで、追加のリプレイ時間と引き換えに訓練中の生グラフを削減する。我々はこれを、ハイブリッドリカレント・全注意機構を備えたQwen3.6-27Bと、圧縮注意機構を備えた混合エキスパートモデルGLM-5.2に実装した。8台のH20 GPU上で、LongStrawはグループ化されたQwenのスコアリングおよび応答逆伝播を、グループサイズ2および8において210万ポジションで完了する。グループサイズを増加させても、ピーク時割り当てメモリは0.21 GBしか増加せず、別途のストレステストでは446万ポジションに達する。32台のH20 GPU上では、GLM-5.2の全78層にわたる210万トークンのプロンプトに対して、LongStrawのエンドツーエンド実行経路を検証する。これらの実験は、完全なトレーニングの正確性ではなく実行容量を確立するものである。なぜなら、キャプチャされたプロンプト状態は切り離されており、分散フォワードおよび勾配合成経路の一部が未完了のままであるためである。
世界行動モデル(WAM)は、身体化制御の有望な基盤として台頭しつつある。これは行動のみを予測するのではなく、行動生成と未来世界予測を結合する表現を学習する。この結合は、ロバスト性、解釈可能性、安全性の源泉とみなされることが多く、ロボットの行動が原則としてその想像上の未来と照合可能だからである。本論文では、この仮定が脆弱であることを示す。我々はBadWAMを導入する。これはWAM特有の敵対的攻撃の新たなクラスである世界行動ドリフト攻撃をモデル化・評価するための統一的枠組みであり、小さな視覚的摂動を用いてWAMが想像するものと実行するものとの間の整合性を破壊する。BadWAMは、攻撃強度とステルス性という2つの自然な基準に沿ってこの攻撃面を特徴づける。攻撃者が破壊を優先する場合、BadWAMは行動のみの敵対的攻撃を具体化し、モデルをタスク失敗行動へと直接駆動する。攻撃者がさらにステルス性を優先する場合、BadWAMは想像保存型敵対的攻撃を具体化し、モデルの予測する未来をクリーンな想像に近づけつつ、有害な行動シフトを誘発する。これら2つの攻撃は、顕在的な行動ハイジャックから、モデルがもっともらしい未来を想像しながらも非同期な行動を実行するよりステルスなケースに至るまで、WAM特有の障害のスペクトルを捉える。我々は様々なWAMの変種にわたってBadWAMを評価する。結果は、我々の攻撃が閉ループ実行下でのタスク成功率を大幅に低下させることを示す。例えば、行動のみの攻撃ではモデルの性能が成功率96.5%から43.1%に低下する。想像保存型攻撃の結果はさらに、WAM特有の脆弱性を露呈する。すなわち、適度な未来保存正則化は、未来想像ドリフトを抑えながら高い攻撃性能を維持できるということである。
ビデオ生成はますますキーフレームベースのワークフローに依存するようになっており、クリエイターは一連の参照画像を指定して生成を誘導する。近年のモデルは複数キーフレームによる条件付けをサポートしているものの、全体的なビデオ品質を維持しながら指定されたキーフレームを忠実に再現できるかは不明である。本稿では、キーフレーム条件付きビデオ生成を評価するための初の包括的ベンチマークであるKeyFrame-Compassを提案する。このベンチマークは、3つの応用ドメイン、2つのビデオ構造、2つのプロンプト粒度、2つの条件付け形式、4つのキーフレーム密度にわたる386の厳選サンプルを含み、多様な生成設定下での制御された分析を可能にする。さらに、キーフレームの実行と全体的なビデオ品質を共同で測定する自動評価フレームワークを導入する。具体的には、キーフレーム実行を、存在性、忠実性、時間的順序、局所性、持続性、一意性をカバーする6つの補完的メトリクスに分解し、一方で全体的なビデオ品質は、専門的な知覚モデルで拡張された証拠に基づくMLLM判断を通じて評価する。9つの代表的なビデオ生成システムに関する実験により、いくつかの根本的な限界が明らかになった。現在のモデルは、忠実なキーフレーム実行と自然なビデオ合成の間に明確なトレードオフを示している。さらに、キーフレームの制約が密になるにつれて性能は低下し、ほとんどのオープンソースモデルはストーリーボードグリッド入力を時間的に順序付けられたキーフレームシーケンスとして解釈できない。
マルチ参照から音声・映像(MR2AV)生成は、複数の参照とテキスト指示に基づいて整合性のある音声・映像コンテンツを生成することを目的とする。既存のベンチマークは主にテキスト駆動生成、単一参照の被写体保存、または独立した音声・映像の整合性に焦点を当てており、新たに登場したMR2AV設定はほとんど未開拓のままである。これらの設定と比較すると、MR2AVはモデルに、同期した視覚・音声コンテンツを生成する際に複数の参照を共同で推論することを要求する。モデルは各参照を忠実に保存するだけでなく、複数の参照エンティティを正しく結びつけ、整合性のある音声・映像イベントに合成する必要がある。このギャップに対処するため、我々はMR2AV生成のための統一ベンチマークであるMultiRef-Compassを導入する。これは、スケーラブルで制御可能なアセット合成パイプラインを通じて構築された350の厳選されたサンプルから成り、マルチビュー被写体保存、マルチエンティティ結合、人間-物体-シーン合成をカバーする。解釈可能な評価を提供するため、MultiRef-Compassは14のサブ指標を使用して、基本品質、参照一貫性、音声・映像一貫性、指示追従の4次元からなる評価プロトコルを定義する。MultiRef-Compassは、自動指標と再判定強化型MLLM-as-a-Judgeフレームワークを統合し、知覚的忠実性と参照条件付き合成の両方のスケーラブルで監査可能な評価を可能にする。8つの代表的なMR2AVシステムに対する広範な実験は、複数の評価次元において改善の余地が大きいことを明らかにし、包括的なベンチマークの必要性を強調し、MultiRef-Compassを将来のMR2AV研究の基盤として位置づける。
人間の認知は、理解と生成を分離しない。ホワイトボードの前で教師は話しながら描き、それぞれのモダリティが互いを再形成する。本論文では、この結合ループを人工システムに導入する。マスク拡散モデル(Masked Diffusion Models; MDMs)はこの課題に理想的に適合するが、既存のサンプラーはテキストと画像を交互に復号するか、あるいは前のステップの履歴のみを共有し同一ステップ内で他方のモダリティの最新の決定を共有しない並列分岐で独立に更新する。これに加え、MDMが再マスクできないことにより、クロスモーダルな矛盾は検出も修正もされない。本稿では、自己修正結合マルコフ跳躍過程(Self-Correcting Coupled Markov Jump Processes; SC-CMJP)を導入する。これは、一方のモダリティの遷移速度が、クロスモーダル注意機構で重み付けされた他方のモダリティの信頼度スコアの汎関数となる枠組みである。さらに、再マスク跳躍により、クロスモーダルな証拠が逆転した瞬間にコミットメントを撤回する。SC-CMJPと併せて、学習不要のシングルパスサンプラーであるCO₂Jump(Self-Correcting COupled Jump)を導入する。これは、マルチモーダル共同生成のための新たなサンプラーである。訓練および評価のために、大規模なマルチモーダル共同生成コーパス3種(JEdit-1M、JMaze-200K、JNono-200K)を作成し、公開する。これらには、ドメイン内およびドメイン外のベンチマークが付随する。CO₂Jumpは、画像理解・編集、ならびに視覚的推論(迷路およびノノグラムの解法)において最良の共同性能を達成する。サンプラーの性能はノイズ除去ステップ数に単調に比例し、クロスモーダル結合の利点が軌跡全体にわたって累積されることを示す。プロジェクトページ:https://coupled-jump.github.io
プレイヤーのアクションに一貫して応答するインタラクティブな世界の構築は、長年にわたりコンピュータグラフィックス、ゲーム、人工知能に共通する目標であった。近年の映像生成モデルは、ユーザーのアクションに条件付けられた将来の観測を予測することで、この目標に向けたデータ駆動型のアプローチを提供し、次世代のゲームエンジンとして期待されるようになっている。しかし、真にインタラクティブなゲーム世界を実現するには、進化するゲーム条件に従ったインタラクション結果、長期にわたって持続する結果、そしてリアルタイムで動作する生成ループが必要である。従来のゲームエンジンは、再帰的なアクション-状態-観測ループを通じてこれらの特性を実現する。このループでは、プレイヤーのアクションが所定のルールに従って明示的なゲーム状態を更新し、その結果の状態から観測がレンダリングされる。本論文では、このループを整理の視点として、インタラクティブなゲーム世界モデリングを、プレイヤーアクション制御、ゲーム状態ダイナミクス、状態-観測持続性、リアルタイムインタラクティブ生成の4つの次元に沿って検討する。各次元について、インタラクティブなゲーム世界に必要な能力から出発し、既存のアプローチを代表的なファミリーに分類し、各ファミリーの長所とトレードオフを議論する。この分析を補完するものとして、我々はBlack Myth: Wukong向けのスケーラブルなデータエンジンを提示する。これは、フレームアライメントされたプレイヤーアクション、正解ゲーム状態、視覚観測、ならびに構造化および意味論的アノテーションを備えた90時間以上のゲームプレイを収集し、状態認識型ゲーム世界モデリングのリソースとして提供する。本論文がこの分野の現状を明確に示し、インタラクティブなゲーム世界への進展を促進することを願っている。
生の視覚データから直接、広範な世界知識を学習することは、知能の基本的な能力である。本稿では、純粋な視覚的デモンストレーションから、複雑な推論、精細な物理ダイナミクス、長期計画を同時に学習する初の試みであるUniVRを紹介する。その中核となるのは、VR-GRPOと呼ばれる、相補的な全体報酬とステップ単位の報酬を備えた強化学習パラダイムである。この手法は、タスク固有のヒューリスティックスや画像-テキストペアを必要とせずに、推論プロセス全体を通じて論理的一貫性と物理的整合性を強制する。UniVRの学習と評価のために、長期操作、空間パズル、物理的推論にわたる16の多様なソースから厳選された大規模ベンチマークであるVR-Xを構築した。これは、純粋な視覚的プロトコルの下でこれらの異種能力を評価する初の包括的スイートである。注目すべきことに、UniVRはVR-X上で最大25%の改善を達成し、その優れた視覚的推論は様々なマルチモーダル理解ベンチマークの性能も向上させる。これらの知見は、視覚空間内での推論の広大な可能性を強調するものであり、すべてのコード、データ、モデルはさらなる研究のためにオープンソース化されている。
強化学習は大規模言語モデルにおける標準的な事後学習パラダイムとなっているが、密な全パラメータ更新は、デプロイメントに関連する二つのボトルネックを生み出す。すなわち、テスト時スケーリングの早期飽和としてしばしば現れる抑制された推論性能と、マルチドメイン学習やモデルマージによる複数能力の統合時の干渉である。本稿では、これらの更新のうち推論に有効な成分がベースモデルのスペクトル空間に主に集中していることを示し、このスペクトル核を保持しつつ直交成分を除去する事後編集手法である部分空間調整再配線(SAR)を提案する。SARは推論の利得を維持し、性能を抑制したりクロスドメイン干渉を増幅する残余更新方向をフィルタリングする。複数のモデルファミリーとスケールにわたり、SARは全パラメータの約0.58%というわずかな量でコンパクトな推論核を抽出する。事後学習性能の99%以上を維持し、数学的推論における高k探索を改善し、社内モデルにおいて7つのオープンベンチマークのうち6つを改善することでエージェンティックコーディングに一般化する。またSARは、数学的推論と指示追従を維持しつつ抑制されていたコーディング能力を解放することで、混在ドメイン学習更新を浄化する。さらにエキスパート間のモデルマージを可能にし、従来のマージベースラインや最良の単一ドメインエキスパートをも凌駕するクロスドメイン汎化を実現する。全体としてSARは、パラメータ幾何学から推論に有効な更新を抽出することが、推論とマルチドメイン性能を向上させる訓練不要のメカニズムとして機能することを示している。
我々はWan-Streamer v0.3を提案する。これは、単一の整理された見解の下でネイティブストリーミング対話モデルを再構築するものである:ビデオとは「世界」と「イベントストリーム」から成る。世界とは、ビデオが展開される持続的なコンテキストであり、環境、シーン、被写体、周囲の音響条件、音声特性、その他の比較的安定した状況を含む。イベントストリームとは、その世界の中で時間とともに変化するすべてのものであり、シーンや環境の変化、被写体の行動、発話、その他の音を含む。これにより、大量の実ビデオに対する汎用的な事前学習タスクが導かれる:与えられた世界と入力に対して、世界がどのように動き、変化し、リアルタイムで応答するかを予測する。得られた能力は、幅広いリアルタイム下流タスクに特化させることができる。我々はこれを、エージェントの発話と自由形式の行動からなるイベントストリームを用いた、リアルタイム全二重音声-視覚対話に実装する。機能的には、モデルのマルチモーダル理解プロセスは視覚-言語-行動に類似している:マルチモーダルなユーザー入力を、言語形式の発話と行動のアクションにマッピングする。Wan-Streamer v0.3はv0.2の動作点を維持している:640x368ビデオを25 FPS、160 msのストリーミング単位、約200 msのモデル側応答レイテンシ、および350 msの双方向ネットワーク予算の下で約550 msの総対話レイテンシ。
オンポリシー蒸留(OPD)は、大規模言語モデル(LLM)の事後学習において重要なパラダイムとなっているが、その学習ダイナミクスは未だ十分に理解されていない。本稿では、OPDの役割、病理、および調整法を体系的に検討する。まず、OPDの役割を探索の触媒として明確化する。すなわち、OPDは高密度なトークンレベルのガイダンスを通じて生徒モデルを正しい推論経路へと導くが、能力の上限を拡大するものではない。この点は、問題あたりのサンプリング数よりもプロンプトの多様性の方が重要であること、そしてOPDの有効性がその誘導信号の質に完全に依存することを示すことで確認する。この依存性は、探索を妨げる2つの病理を露呈させる。学生-教師のミスマッチは、教師と生徒の分布に大きな乖離がある場合、誘導信号がタスクの正しさと一致せず、探索を逆効果な方向へ導く現象である。長さの搾取は、集約されたトークンレベルの目的関数が長さに依存した近道を生み出し、生徒が応答の切り詰めや冗長なパディングによって報酬の状況を操作し、推論戦略ではなく劣化した長さモードを探索する現象である。これらの病理を抑制するため、我々は軽量な信号調整法、すなわちアドバンテージクリッピングと対数スケール圧縮を検討し、信頼性のある信号によって探索が導かれるようにする。7つのベンチマークを用いた実験では、これらの調整法が長さの搾取を緩和し、効果的な蒸留を可能にし、OPDの変種やRLVRのベースラインを安定的に上回ることが示された。これにより、OPDにおける探索の成功は、単なる教師モデルの規模ではなく、適切に調整された信号の質に依存するという知見が確認された。
近年のロボット基盤モデルは、単一ステップまたは短い履歴の視覚運動コンテクストで動作する。本稿では、Test-Time-Trainingロボットポリシー(RoboTTT)を導入する。これは、推論遅延を増大させることなく、視覚運動コンテクストを最先端ポリシーの3桁以上にあたる8Kタイムステップに拡張するロボットモデルおよび学習手法である。このコンテクスト長により、新たなロボット能力が解放される。すなわち、人間のビデオデモンストレーションからのワンショット・インコンテクスト模倣、オンザフライでのポリシー改善、摂動に対するロバスト性、そして多段階・長時間ホライゾンタスクにおける強化された性能である。また、事前学習のコンテクスト長の拡大に伴い、閉ループ性能が安定的に向上することを初めて観察した。RoboTTTの核心は、Test-Time TrainingをVision-Language-Actionポリシーなどのロボット基盤モデルに統合することである。これにより、リカレント状態が高速重み(訓練時および推論時に勾配降下法で更新されるパラメータ)から成る系列モデルが得られ、履歴を重み空間に圧縮し、長コンテクスト条件付けのための文脈情報を検索する。学習コンテクスト長を拡大するため、手法は系列行動強制と打ち切り逆伝播法(Truncated Backpropagation Through Time)を組み合わせる。挑戦的な実機ロボット操作タスクにおいて、RoboTTTは単一ステップコンテクストベースラインと比較して全体性能を87%向上させ、全ベースラインが達成できなかった5分間・10段階の組立タスクを完全に完了する。8Kタイムステップコンテクストで訓練されたRoboTTTは、1Kタイムステップで事前学習された同一モデルを62%上回り、コンテクスト長がロボット基盤モデルの新たなスケーリング軸であることを示唆する。ビデオはhttps://research.nvidia.com/labs/gear/robottt/ で公開されている。
MeanFlow生成器は時間間隔における平均速度を予測することで高速な少数ステップサンプリングを実現し、効率的な生成において魅力的な手法である。強化学習(RL)は拡散モデルやフローモデルを人間の嗜好やタスク固有の目的に合わせるための強力な手法として台頭している。特にDiffusionNFTは、逆過程の軌跡や尤度推定を必要としない効率的な前向き過程RLフレームワークを提供する。しかし、このようなRL手法をMeanFlowに適用することは十分に検討されていない。DiffusionNFTが瞬間速度を最適化するのに対し、MeanFlowは平均速度を用いてサンプリングを行う。この乖離を埋めるために、我々はMeanFlowNFTを導入する。平均速度と瞬間速度を橋渡しするMeanFlow恒等式に着想を得て、誘導型瞬間速度予測器を構築する。我々はこの予測器にDiffusionNFTの目的関数を適用し、MeanFlowに対する報酬最適化を明確に定義する。サンプリングは引き続き平均速度に基づき、MeanFlowの高速な少数ステップ生成を維持する。さらに、MeanFlowNFTがDiffusionNFTの厳格な方策改善保証を継承することを証明する。画像および動画生成実験において、MeanFlowNFTは一貫してベースラインを改善する。さらに、先行する最先端のRL調整済み少数ステップ生成器をほとんどの指標(SD3.5-Mでは8項目中6項目)で上回り、わずかなサンプリングステップで多段階RL調整拡散モデルを凌駕することさえある。例えばWan 2.1では、4ステップのMeanFlowNFTがVBenchスコア84.33を達成し、50ステップのLongCat-Video RL(82.57)を上回っている。
音楽生成基盤モデルは近年、業界から大きな注目を集めている。しかし、効率的な生成と高忠実度の長時間音声を実現しつつ、制御可能性をサポートすることは依然として課題である。これらのニーズに応えるため、我々はWanSongを提案する。これは、長時間かつ商用グレードの楽曲生成のためのシンプルかつ強力なアプローチである。自己回帰(AR)モデルやカスケード型マルチステージパイプライン(例:ARに続いて拡散モデル)とは異なり、WanSongは純粋な拡散ベースモデルであり、最大5分間の高忠実度で多言語の楽曲を直接生成し、1回の実行でデュアルステム(ボーカルとバックグラウンドミュージック)を出力する。さらに、我々の拡散フレームワークは、ステップ蒸留による高速な推論を可能にし、下流の編集タスクをサポートするためのファインチューニングやカスタマイズへの効率的な経路を提供する。
ループ型トランスフォーマーは、物理ブロックのコンパクトなスタックを複数ラウンドにわたって適用することにより、格納パラメータを増やすことなく展開深度を増加させ、逐次計算を拡張する。この再利用により、残差スケーリング問題が変化する。すなわち、非結合型トランスフォーマーでは各残差枝が自身のパラメータ更新を受け取り適用するのに対し、ループ型トランスフォーマーでは一つの共有更新が繰り返し訪問からの勾配を集約し、次の線形化順伝播において同じ訪問によって読み戻される。我々はこの結合深度効果を、訪問整列係数κ_Rによって制御される一次摂動境界を通じて形式化する。この境界は、訪問が無相関化する場合にはDeepNorm指数を回復するが、保守的な整列領域では、固定された物理深度でループ数が増加するにつれて指数が1/4から1/2に増加することを必要とする。得られた手法であるDeepLoopは、Post-LN DeepNormアーキテクチャを維持し、展開深度Nに対してα=(2N)^{1/2}およびβ=(8N)^{-1/2}と設定する。GPT-2 smallおよびGPT-2 mediumスケールのGPTスタイルのループ型言語モデルにおいて、DeepLoopは物理ブロックが再訪問されない場合には中立的であり、再帰深度が活性化されると検証損失と下流精度を改善する。これらの結果は、安定な再帰深度には、名目上の層数だけでなくパラメータ訪問を考慮した残差スケーリング則が必要であることを示している。
視覚障碍者(VIIs)は、視覚情報へのアクセスが限られていることから、日常生活において多くの困難に直面している。マルチモーダル大規模言語モデル(MLLMs)は、一般的な視覚・言語タスクにおいて目覚ましい成果を挙げているものの、実際の視覚障碍者支援における実用的な有用性はまだ十分に探求されていない。このギャップを埋めるため、我々はVIABenchを提案する。これは、視覚障碍者自身が記録または共有した一人称視点の映像を用いて、視覚障碍者支援シナリオにおけるMLLMsを評価するために特別に設計された包括的なビデオベンチマークである。VIABenchは、視覚支援におけるそれぞれ異なる要件を対象とした3つの中核タスクを定義している。プロアクティブリマインダー:モデルが進行中のビデオコンテンツを解釈し、同時に将来のナビゲーション上重要なイベントを予測して口頭で説明する能力を評価する。視覚質問応答(VQA):モデルがビデオ内の環境や物体に関するユーザーの質問に答える能力を評価する。視覚誘導インタラクション:ユーザーと環境の間の意図的なインタラクションを達成するための文脈認識推論をテストする。堅牢で公平な評価を確保するため、オンライン(リアルタイム)およびオフラインの両方の設定をサポートする厳格なベンチマークパイプラインを提案する。実験の結果、現在のMLLMsは、特に正確な予測とリアルタイム応答性が求められるプロアクティブリマインダータスクにおいて、視覚障碍者への包括的な支援を提供するには依然として困難があることが示された。VIABenchが、実世界の支援向けにカスタマイズされたMLLMsの開発に向けた今後の研究を促進し、最終的に視覚障碍者のナビゲーションとインタラクション体験を向上させることを期待する。コードとデータは https://github.com/MCG-NJU/VIABench で公開予定である。
本稿では、重みを一切変更することなく、凍結された小型言語モデルを同時により高性能かつ劇的に低コストにする手法を報告する。検証済みの知識は、一度バイト完全なキー値(KV)状態アーティファクトとして格納され、後に移植によって新たな推論コンテキストに復元される。この復元はビット完全である。すなわち、固定された決定論的構成下では、移植されたロジットは新たに計算されたものとバイト単位で同一(SHA-256一致)となり、KLダイバージェンスはゼロ、50サンプルにわたるargmax一致率は100%となる。浮動小数点回転エンコーディングを使用するモデルにおいて、同一位置への移植が唯一の数値的に厳密な動作点であることを示し、2つのモデル規模(12B、31B)と2つのGPUターゲット(うち1つは事前登録されたリプレイ経由)でバイト完全性を検証する。AIME 2025において、凍結されたGemma-4-12Bは、検証済みの解答ライブラリを移植することで80.0%から93.3%に向上し、これは同モデルの公開ベースライン77.5%および31B版の89.2%を上回る。反復的な問題では、ベースモデルが401,026トークンの予算内で決して解けない8つの問題が、キャッシュされた検証済み解答からわずか61トークンのデコードで回答され、これはトークン数で約6,574分の1、エネルギーで約8,700分の1の削減となる。能力の主張自体は、保持された転送タスク(31Bで7件中7件)に基づく。同一のバイト完全ストアは、利用可能なコンテキストを追加のアクセラレータメモリゼロで32,768トークンから2,854,766トークンに拡張し、同一アーキテクチャのマシン間でバイト単位の同一性を維持する。本システムを行動レベルで記述する。エンジンはプロプライエタリであり、報告されたすべての数値はコミットされた入力および出力ハッシュによって裏付けられているため、スコアリングはエンジンなしで再検証可能である。
インコンテキスト学習は、一般的に条件付き推論の一形態として解釈される。この推論では、プロンプトがコンテキストを指定し、モデルの出力が対応する条件付き分布の推定値として扱われる。この解釈が成り立つならば、LLMの推定値は基本的な確率恒等式を満たすはずである。特に、全確率の法則は、事前分布で重み付けされた条件付き分布が、母集団の任意の有効な分割に対して母集団レベルの周辺分布に集約されることを主張する。本研究では、LLMの推定値がこの自己整合性原理にどの程度従うかを調査する。評価の枠組みとして二分木を用い、母集団を再帰的に分割して、より細かい粒度の部分母集団を生成する。次に、コンテキスト内で言語化された部分母集団の記述をLLMにプロンプトとして与え、得られた推定値を母集団レベルの推定値に再集約し、異なる粒度の分割間で比較する。このプロトコルを様々な問題領域と最先端のフロンティアモデルに適用した結果、基本的な整合性特性の広範な違反が観察された。ペルソナプロンプティングの詳細な研究により、マクロ誤謬と呼ぶパターンが明らかになった。より細かい粒度の部分母集団の応答から再構築された推定値は、直接的な母集団レベルの推定値よりも人間の参照データとよく一致することが多い。この効果は木構造や推定タスクの変化に関わらず持続し、暗黙的プロンプティングによって部分的に再現できる。これらの知見は、モデルが関連する部分母集団の知識を持っているものの、それを集計推定値に確実に伝播させていないことを示唆している。このギャップは、統計的自己整合性を、LLM評価のための未飽和かつ参照不要の基準として位置づける。
近年の汎化可能な3Dガウシアンスプラッティングモデルは長系列の新規視点合成(NVS)を進展させたが、その代償として大量の冗長な計算を伴う。我々は、この冗長性が2つの観察に基づいて軽減可能であることを特定する:(i) 高品質なNVSには高精度な幾何学は厳密には必要ないこと、(ii) 外観学習は一般的に幾何学復元よりも容易であること。これらの洞察に動機づけられ、我々は幾何学と外観モデリングを分離する非対称アーキテクチャを提案する。幾何学ブランチは粗粒度トークンを処理し、多視点再構成のためにほとんどのパラメータを使用する一方、外観ブランチは細粒度トークンを操作し、大幅に少ないパラメータで詳細を捉える。2つのブランチは双方向接続を通じて相互作用し、それぞれのタスクの相互ガイダンスを可能にする。このタスク認識非対称性は計算の冗長性を低減し、計算をより適切に配分することで、パラメータ効率を高め、より小規模なモデルでも強力な性能を達成できるようにする。32視点の960P入力において、我々のモデルは最適化ベースの手法に匹敵しつつ、約800倍の高速化を実現し、顕著に少ないパラメータと低減された訓練/推論オーバーヘッドで最先端の汎化可能モデルのゼロショット性能を上回り、全体的な効率改善を達成する。
エージェント型検索拡張生成(RAG)は、言語モデルが反復的に推論し、検索クエリを生成し、証拠を取得し、回答を予測できるようにすることで、静的なRAGを拡張する。しかし、モデルがいつ検索すべきか、字句一致と意味的類似性のどちらを使用すべきか、また、エージェントの推論を妨げる無関係なトークンを防ぐために文脈の粒度をどのように制御すべきかを決定することは、依然として困難である。本稿では、強化学習(RL)フレームワークGRASPを導入し、エージェントが多段推論中に補完的な検索ツールを適応的に連携するように訓練する。GRASPはエージェントに意味検索、キーワード検索、段落読み取りの行動を提供し、必要な場合にのみ文レベルの証拠を取得し、さらに文脈を拡張することを可能にする。我々は、回答の正確性、根拠に基づく読み取り、補完的な検索、ターン効率を共同で考慮した報酬を用いてポリシーを訓練する。多段推論ベンチマークでの実験により、GRASPは単一段階検索、プロンプトベースのエージェント型RAG、およびRLベースの検索ベースラインと比較して、検索再現率と下流の質問応答性能の両方を向上させることが示された。質的およびアブレーション分析により、学習されたポリシーは解釈可能なスキミングとスキャニング行動を発展させることが示される。すなわち、広範な探索には意味検索を、局所的な検証には段落読み取りを、エンティティ固有の証拠にはキーワード検索を使用する。これらの結果は、検索シグナルと文脈の粒度を連携させることを学習することが、エージェントの正しい推論にとって重要であることを示唆している。
身体化認知は、エージェントが高レベルのタスク推論と達成すべき物理的状態を結びつけることを必要とする。我々は、言語‐視覚の共同推論と想像力を備えた身体化認知基盤モデルHy-Embodied-RxBrainを紹介する。シーン理解やテキストによる意思決定を重視する視覚言語モデルや、主に未来の視覚状態を予測する生成的世界モデルとは異なり、RxBrainは単一の計画シーケンス内で身体化計画を表現し、言語と視覚想像力が補完的な役割を果たす。言語はタスク分解、計画プリミティブ、制約、時間的順序、意思決定ロジックなど計画の抽象的な構造を提供し、視覚想像力は世界状態予測と共同サブゴール計画を通じてこの構造を具体化し、各計画ステップを中間および最終的な物理的状態に関連付ける。RxBrainは統一されたマルチモーダルなMixture-of-Transformersアーキテクチャを採用し、言語、画像、動画の理解と生成を単一モデル内で実現する。この能力を訓練するために、我々は身体化ビデオを計画ステップに分解し、それらを視覚状態遷移と整合させることで、ビデオをテキスト‐視覚共同計画の教師信号に変換する自動パイプラインを構築する。さらに、モデルが個別の理解や生成ではなく、テキストと視覚の共同コンポーネントを通じて身体化計画を表現できるかを評価するために、RxBrain-Benchを導入する。実験により、RxBrainは身体化理解と生成の能力を維持し、結合されたテキスト推論、世界状態予測、共同サブゴール計画を伴う計画を生成することが示された。また、RxBrainを連続的なロボット動作生成に拡張し、大規模な動作データによる事前学習なしで有望な実ロボット性能を示す。これらの結果は、身体化認知のための基盤モデルに向けた最初の一歩を提供する。
CAD-to-imageアラインメントは、単一のRGB画像から物体の9次元姿勢(回転、平行移動、異方性スケール)を推定することを目的とし、ロボティクスや拡張現実における応用を可能にする。近年のゼロショット手法では、視覚基盤モデルを用いて画像領域とCADモデルを対応付けるが、典型的にはその対応関係は見た目に依存しており、オクルージョンやシミュレーションから実世界へのドメインシフトの下で性能が低下する。これらの限界に対処するため、我々はSUFLECA(Scaling Up Feature LEarning for CAD Alignment)を提案する。これはゼロショットCADアラインメントのための弱教師ありフレームワークであり、2つの主要な貢献を持つ。第一に、SUFLECAは、12の実世界および合成データセットにわたる674K画像に対する標準化物体座標(NOC)の教師信号を通じて、事前学習済み視覚表現から幾何学的に基づいた特徴学習をスケールアップし、ドメイン間で汎化するコンパクトな幾何認識特徴を学習する。第二に、信頼性の高い1対1のCAD-to-image対応関係を確立する幾何学的に一貫したマッチングアルゴリズムを提案する。これらの貢献により、反復的な姿勢最適化を必要とせず、物体インスタンスごとにサブ秒単位で正確なアラインメントを実現する。ScanNet25kにおいて、SUFLECAはカテゴリ精度33.4%、インスタンス精度42.3%を達成し、より小さな計算負荷で、最強のゼロショットベースラインを10.3/12.2パーセントポイント上回り、このベンチマークで初めて完全教師あり手法をも凌駕する。コードは以下で入手可能: https://github.com/snt-arg/SUFLECA
ビデオモデルは視覚基盤モデルへと進化しつつあるが、人間のような多段階推論は依然として欠如している。ストリーミング自己回帰拡散モデルは効率的だが推論に限界があり、一方双方向拡散はフレーム単位の高密度なノイズ除去により高い推論コストを伴うが、グローバルな修正を可能にする。両パラダイムとも、複雑な推論タスクにおいて論理的一貫性と低遅延ストリーミングを達成するのが困難である。本稿では、階層的潜在変数を因果的ビデオ生成に統合し、多段階推論を実現する統一フレームワークHDR(Hierarchical Denoising for Visual Reasoning、視覚的推論のための階層的ノイズ除去)を提案する。HDRはビデオの潜在変数を木構造の階層に編成し、ストリーミング出力前に粗密の推論を可能にする。粗いノイズ除去層は不確かな仮説を保持してグローバルな計画を立て、細かい層がそれらを段階的に具体的な視覚状態に洗練する。さらに、スパース階層的注意パターン(SHAP)により時間的注意のコストを削減する。我々は、分布外のケースを含む、迷路ナビゲーション、ハノイの塔、一筆書き、スライディングパズル、倉庫番、水注ぎの6タスクをカバーする、レベル別多段階ビデオ推論ベンチマークを導入する。ストリーミング自己回帰拡散ベースラインと比較して、HDRは成功率を34.22から60.29(76.2%の相対向上)に改善し、平均進捗を76.00から89.56に向上させ、より一貫した推論軌跡を示す。HDRは潜在変数あたり0.70秒の低遅延ストリーミングを維持し、双方向拡散と比較して54.2倍高速な推論を達成する。また、訓練データの2%のみで全データ性能の82.9%を保持し、双方向拡散の52.0%を上回る。実世界のロボット実験は、物理的相互作用と世界モデリングにおけるHDRの可能性をさらに示している。プロジェクトデモ:https://hierarchical-diffusion-reasoning.github.io/。
自動運転システムの検証には、多様かつ規制に準拠したテストシナリオが必要である。シミュレーションベースのテストでは、シナリオは実行可能スクリプトとして定義される。しかし、規制記述からそのようなスクリプトを自動生成することは依然として未解決の課題であり、既存の手法は根本的なトレードオフに直面している。検索アセンブル手法は妥当なコンパイル率を達成するがスケーラビリティに欠け、一方で検索ベースの全スクリプト生成はコンパイル成功率が低い。本稿では、ドメイン固有言語(DSL)でシナリオスクリプトを生成する初の反復的検索拡張フレームワークであるChat2Scenicを提案する。具体的には、Chat2Scenicは対話的なシナリオ洗練を支援するチャットボットインターフェースを提供し、検索拡張生成(RAG)を統合することで、規制知識とDSL構文に基づいたシナリオ生成を実現する。さらに、NHTSA(米国道路交通安全局)や国連車両規則など、様々な規制およびその他の情報源から収集した123のシナリオからなる、シナリオ生成のための公開ベンチマークを提案する。最先端(SOTA)大規模言語モデル(LLM)を用いた広範な評価により、Chat2Scenicはコンパイル成功率(CSR)76.42%、フレームワーク精度(FA)58.17%を達成し、既存手法(検索アセンブル:CSR 30.08%、FA 11.03%、検索ベース全スクリプト生成:CSR 16.26%、FA 10.86%)を上回る性能を示した。今後の研究促進のため、コードをオープンソースとしてhttps://github.com/TUM-AVS/chat2scenicで公開する。
本論文では、トークン時間連続拡散(TTCD)を導入する。これは新しい拡散言語モデルであり、(a) 連続空間で動作し、ガウスノイズをさらなるサンプリングなしで最終的なトークンキャンバスに決定論的にマッピングする。そして重要なことに、(b) トークンごとの時間という新しい概念を組み込んでおり、一部のトークンは他のトークンよりも速い速度でノイズからトークンへと進行する。連続空間モデリングにより、TTCDは複数トークンの並列サンプリングを回避できる。これは、離散空間のみで反復するモデルにおいて高速化時に不正確さの主な原因となる。トークンごとの時間の概念は、TTCDが条件付き生成をより適切にモデル化する助けとなり、より確実なトークンがより速い速度で進行することを可能にし、精緻化の際にトークン間の影響に差別化をもたらす。TTCDは高速化時に離散モデルを上回る性能を示す。我々はOpenWebText上で1億6000万パラメータのTTCDモデルを訓練し、その後自己蒸留を行った。その結果、高速化時において、非条件付き生成品質で同等であり、条件付き生成では、同じデータで訓練・自己蒸留された同程度の規模の既存のいくつかのモデルを上回る性能を達成した。数独解決においても同様の利得を得ている。