翻訳付きの日次キュレーションされたAI研究論文
ワールドモデルをスケーリングする一般的な戦略は、より多くの計算リソースを使って、より多くのクロール動画を学習させることである。我々は、この戦略は非効率であると主張する。ワールドモデルのスケーリングには、基盤のある報酬信号を提供する再帰的データエンジンも必要である。コードエージェントの成功は、このことがなぜ重要かを示している。コードは実行可能であるため、コンパイラやランタイムはLLMの強化学習(RL)によるポストトレーニングに対して高品質な報酬を提供できる。対照的に、空間生成は依然としてCLIPスコアのような曖昧な代理指標に大きく依存している。これらの信号は曖昧で偏りがあり、RLポストトレーニングを支援するのが難しい。これらと比較して、ゲーム開発は空間ワールドモデルにとって欠けている報酬環境を提供する。ゲームエンジンによって符号化されたシーンは実行可能なワールド仕様である。エンジンは衝突、物理、ナビゲーション可能性、制約付きプレイ可能性を効率的にチェックでき、開発者はシーンを受け入れるべきかどうかを判断することでグローバルな検証信号を提供する。ゲーム開発はまた、RLポストトレーニングのための現実世界の長期的な軌跡データを提供する。そこで我々は、人間とエンジンによる検証を用いた強化学習(RLHEV)を提案する。これは、密集したエンジン信号と、開発プロセスからの暗黙的な人間の受け入れフィードバックを組み合わせたポストトレーニングパラダイムである。
近年のビデオ生成モデルは、ますます世界モデルとして捉えられるようになっている。多くの物理的プロセスは、複数の妥当な経路で進行し得る。したがって、世界モデルは、もっともらしい軌道だけでなく、同一の初期観測と行動の下で可能な行動の分布も再現すべきである。我々は、この分布レベルの要件を確率的アライメントと呼ぶ。しかしながら、既存の評価は主に個々のビデオの妥当性を評価しており、繰り返し生成が正しい分布を回復するかどうかを検証していない。これにより、中心的な疑問が生じる:現在のビデオ生成モデルは、確率的に整合した世界モデリングからどれほど離れているのか? これに答えるため、我々は確率的アライメントを世界モデルの分布的基準として形式化し、世界力学の確率的サンプラーとしてビデオ生成モデルを評価するベンチマークであるPAWBenchを導入する。さらに、繰り返しビデオロールアウトを可能な物理的行動に関する経験分布に変換する、結果レベルのプロトコルであるPAWEvalを導入する。50のシナリオと11の現在のシステムにわたって、妥当な行動の範囲を回復しつつ参照確率に一貫して一致するモデルは存在しなかった。このギャップを確認した上で、我々は言語プロンプト、初期ノイズサンプリング、またはモデル学習がモデルの予測分布を再形成できるかを検証する。我々は、本研究が確率的に整合した世界モデリングに向けた今後の取り組みの基盤となると考えている。
マルチモーダル大規模言語モデル(MLLM)は街並みの眺望を解釈できるが、都市における行動能力は、エージェントが移動を開始した後もそのような局所的証拠が有用であり続けるかどうかに依存する。本論文では、現在のMLLMエージェントが複雑な実規模の都市において、局所的な都市認識をどの程度信頼性の高い行動へと変換できるかを調査する。我々は、領土全体の3D地理空間データから構築した香港の物理的制約を備えたレプリカにおいて、この問いを検証可能にする最初のサンドボックスであるUrbanGroundを提案する。UrbanGroundは一人称視点からの閉ループ相互作用をサポートし、ナビゲーション用の対話型地図を提供する。エージェントは3D都市に直接入り、一人称視点で探索できる。我々の分析は、3つの研究課題を通じて空間的問題の拡大に従う。まず、能動的観察後に局所シーンを十分に接地させ、空間的質問に回答できるかどうかを検証する。次に、目的地がより遠く、より曖昧になるにつれて、その接地がナビゲーションを支援するかどうかを問う。最後に、結果として生じる行動が経路の利用可能性と歩行者の動きの変化に対して頑健であるかどうかを調べる。現代のMLLMエージェントは通常、視覚認識と短距離空間推論において有用な原子的能力を示す一方、方位認識と歩行者を考慮した移動は依然として信頼性が低い。その中心的欠陥は、拡張探索中に顕在化する。局所的能力が持続的な目標指向行動へと統合されず、誤差が効果的な修正なしに蓄積されるのである。我々はUrbanGroundが、複雑で開放的な都市環境において現在のMLLMエージェントがどの程度信頼性高く探索できるかについてのより広範な研究を支援することを期待する。
最近の代表的ポストトレーニング手法、例えば強化学習(RL)やオンポリシー自己蒸留(OPSD)は、大規模言語モデルの数学的推論における急速な進歩を牽引してきたが、正解ラベルへの依存によりテスト時訓練(TTT)は不可能である。正解ラベルを多数決による擬似ラベルに置き換えることは自然な代替手段だが、これは脆弱である。誤った投票が教師を汚染し、すべてのトークンを誤らせるためである。我々は、この障害モードが非対称であることを観察する。擬似ラベルと一致しないロールアウトは、投票自体が正しいかどうかに関係なく、通常は誤っている。この観察に基づき、我々はテスト時方策最適化(TTPO)を提案する。これは、一致するロールアウトをOPSDで蒸留し、一致しないロールアウトをGrouped RLで罰する非対称な目的関数である。トークンレベルの選択はさらに両ブランチを洗練する。蒸留はすでに収束した位置の重みを下げ、RLは確信度の高い誤りのみを罰する。両方の更新は、擬似ラベル誤りが頻繁に発生する状況下でも十分に根拠づけられたままであり、多数決ルーティングはモデルの改善に伴ってより厳密な自己教師信号を生成する。ラベルを一切用いないTTPOは、5つの競技レベルのベンチマークでラベル教師ありOPSDに匹敵し、TTTにおいてQwen3-1.7Bを38.0%から45.2%に向上させ、思考なしでは+25.2%から+36.4%の向上をもたらし、強力なタスク横断的汎化を示す。
オン方策蒸留(OPD)は、事前学習済みのタスク特化型教師モデルを利用して密な教師信号を提供する手法であり、大規模言語モデル(LLMs)で大きな成功を収め、近年ではフローマッチングモデルにも適用されている。しかし、このパラダイムには二つの重大な問題がある。第一に、新しい目的ごとにタスク特化型の教師を別途訓練するには高い計算コストがかかる。第二に、教師分布と生徒分布の乖離が、生成軌道に沿った誤差の累積を引き起こすことが多い。本論文では、フローマッチングモデル向けの教師不要OPDフレームワークであるSelf-OPDを提案する。Self-OPDは、生徒自身の自己探索をステップ単位の教師信号へと変換する。各時間ステップにおいて、Self-OPDは決定論的な次状態予測をK個の確率的SDE候補へ分岐させ、それらをODEサンプラーでロールアウトし、その報酬を決定論的な自己参照ベースラインと比較して正規化アドバンテージを得る。速度場は、全分岐のpull-push(引き寄せ・反発)目的関数によって最適化される。この目的関数では、方向を考慮した減衰とSDE分散の正規化の下で、高アドバンテージの分岐が生徒を引き寄せ、低アドバンテージの分岐が生徒を反発させる。多目的アライメントのため、Self-OPDは正規化されたスコアを報酬レベルで融合し、勾配の直接的な競合を回避する。単一報酬および混合報酬のベンチマーク実験では、Self-OPDはタスク特化型教師を必要とせず、従来のRLおよびOPD手法を上回る性能を示す。
LLMエージェントは、外部環境との相互作用方法を学習するために、生成された相互作用データに依存することが増えている。エージェント的データ生成(agentic data generation)は、環境、タスク、相互作用、成功シグナルの間で一貫性を維持しつつ、単に豊富であるだけでなく有用な経験を生み出さなければならない。既存の研究は多くのエージェント領域に及んでいるが、領域中心の整理と不均質な評価は、共通の生成メカニズムを曖昧にし、候補構築と検証・選択を混同することが多い。本稿では、この分野に対して2層の枠組みを構築する。第一に、エージェント的データを共通の分解されたオブジェクト(E,q,τ,v)として表現する。これは、環境仕様、タスク信号、相互作用の実現、任意の検証器から構成される。我々は、生成パラダイムをその主要なアンカーと依存構造によって整理する。第二に、生成を、正確性-複雑性-多様性(Accuracy-Complexity-divErsity: ACE)の観点を通した制約付き分布設計として定式化する。正確性は、接地され内部整合性のあるデータの実行可能な台集合を確立する。この台集合内において、複雑性は、宣言された学習器と実行構成の能力に相対する学習質量を配置し、多様性はデータのカバレッジと冗長性を制御する。この枠組みを用いて、先行研究が生成された経験をどのように検証し、難易度を構築・較正し、行動のカバレッジを拡張しているかを考察する。文献レビューは、実行に接地された正確性、学習器に相対的な複雑性、および表面的な変動やデータセットサイズを超えた多様性への移行を示している。さらに、ACEの観点を通してエージェント的データ生成におけるより広範な方向性と新たなトレンドを議論し、スケーリング、データソース、訓練レジーム、適応的学習への影響を含める。全体として、中心的な課題は単により多くのデータを生成することではなく、エージェントと環境が進化するにつれて、有効で情報量が多く非冗長な経験を継続的に割り当てることである。
AI搭載デジタルアバターストリーマーは、商品に関する質問に回答し、視聴者と交流し、マーケティング戦略をリアルタイムで実行する必要があり、低遅延、頻繁な戦略更新、正確かつ効果的な応答が求められる。スキル、フック、プロンプト、ツールをモデルの重みとは独立に更新できる進化可能なハーネスは、迅速な反復を可能にするが、トレードオフを生じさせる。すなわち、大規模モデルはゼロショットで適応できるものの遅すぎ、小型モデルは遅延目標を満たすものの固定されたハーネス構成に過適合する。本稿では、変化するハーネスに適応するよう小型モデルを訓練するハーネス認識トレーニング(HAT)を提案する。その主要な構成要素であるハーネス状態拡張(HSA)は、スキル識別子とその内容、ツールスキーマ、プロンプト構造、フック関数に対してタスクを維持する変換を適用する。学習は3段階で進む。HSA-SFTは多様な環境における強力なモデルの軌跡から推論とツール使用を学習し、汎用オンポリシー蒸留はSFT中に失われた汎化を回復し、HSA-RLは拡張環境での強化学習を通じて変化するハーネスに対するロバスト性を向上させる。4つの評価セットにおいて、HATはライブストリームQAで94.8(ベース:80.3、最強の汎用LLM:93.0)、ハーネス変種QAで94.6(ベース:75.4)を達成した。固定ハーネスSFTがベースモデルからIFEvalを7.7ポイント低下させるのとは異なり、HATはこの性能低下を回避して83.5に到達する。1基のNVIDIA H20 GPU上で、最適化されたシステムはP50およびP95レイテンシとして3.4秒および8.1秒を達成する。また、タオバオライブのデジタルアバターサービスに展開され、GMVおよび商品ページ閲覧数においても良好なオンラインA/Bテスト結果をもたらしている。
現代のビデオゲームは、一人称視点の知覚、急速な視覚変化、永続的な世界状態、そして異種混在のネイティブ操作を組み合わせる。既存のゲームエージェントは視覚的およびタスクの文脈を直接行動に写像するが、明示的な世界ダイナミクスのモデリングを欠いている。一方、対話型ゲームワールドモデルは、与えられた行動から視覚的な未来を予測するが、タスクポリシーとしては機能しない。ワールド・アクションモデル(WAM)はこれらの目的を統合するが、ビデオゲームのダイナミクスとオープンエンドな相互作用の下では依然としてほとんど未探索である。我々は、我々の知る限り、ネイティブなクローズドループゲームプレイとGUI制御のための初のWAMであるGameWAMを紹介する。GameWAMは、ブロック因果的条件付けとフローマッチングを備えた並列的な視覚生成プロセスと行動生成プロセスを通じて、将来の視覚観測と実行可能なキーボード・マウスの軌跡を同時に生成する。世界行動の同時学習を支援するため、同期されたゲームプレイとGUIの軌跡を構築する。異種混在のネイティブ操作を扱うため、GameWAMは各行動ステップでゲームプレイ/GUIモードを予測し、モード固有の予測分布と連続行動の正規化を用いて行動を生成する。長期的な相互作用のために、ブロックサイクル制御はコミットされた予測範囲を超えて予測し、短い行動プレフィックスのみを実行して新しい観測から再計画する。一方、サイクル内の細粒度コンテキストと階層的なサイクル間履歴が時間的連続性を保持する。実験では、比較対象のエージェントよりも少ないネイティブ操作の実行で、競争力のあるタスク成功率を示す。さらに、低周波行動ソースインプリンティング(LASI)を発見する。これは、固定条件付けの下で、サンプリングされた行動ソースの低周波成分が生成された粗いカメラ運動を体系的に方向付けるものであり、生成的制御におけるソース感応性の失敗モードを明らかにする。プロジェクトページは https://yunncheng.github.io/GameWAM/ で入手可能である。
長期的なエージェント実行によって生成される経験は、現在の実行と将来の作業の両方を改善できる。ほとんどの自己改善手法はこの経験を実行終了後にのみ処理するため、進行中の実行を方向転換したり、そこから得られた教訓を即座に適用・検証したりすることはできない。我々は、自己改善は代わりにライブであるべきであり、生成された経験を進行中の実行の方向転換と永続的ハーネスの更新の両方に活用すべきだと主張する。既存のエージェントアーキテクチャはこの目標を完全には支持していない。単一エージェントの自己修正は、タスク実行と軌跡評価を単一のコンテキスト内で組み合わせる一方、サブエージェント委譲は実行を分離するものの、通常は進行中のサブエージェントを方向転換できない。我々は、2つの結合されたメカニズムによるライブ自己改善のためのスーパーバイザー・ワーカーハーネスであるPILOTを提案する:(1) ライブ誘導により、独立したスーパーバイザーが実行中にアクティブなワーカーを方向転換または中止できる。(2) ライブ自己進化により、実行中に明らかになる手順と失敗モードを再利用可能なスキルとメモリに蒸留する。2つの凍結バックボーンと3つのベンチマークにわたり、PILOTは6つの構成のうち5つで第1位を獲得した。Terminal-Bench 2.0では、PILOTは比較対象のハーネスを最大9.8パーセントポイント上回る。自己改善設定では、PILOTはGLM-5.1で14.6ポイント、Kimi-K2.6で12.4ポイントの向上を達成した。平均出力トークンはそれぞれ42.9%および47.4%減少し、100万出力トークンあたりの成功評価数はそれぞれ110.3%および134.0%増加した。
ゼロショットのクロスタスク汎化、すなわちポリシーが訓練中に一度も見たことのない操作タスクを実行しなければならない問題は、ロボット学習における中心的な課題であり続けている。大規模言語モデルでは、新しいタスクはパラメータ更新を一切行わずに、コンテキスト内で指定するだけで実行できる。このインコンテキスト学習(ICL)の形式は、汎化をタスク指定の問題へと転換する。クロスタスク汎化を達成するために、我々はこのパラダイムをロボット操作に導入し、操作における自然なタスク指定は人間のビデオであると主張する。言語とは異なり、ビデオは意図されたタスクの進展に関する豊かな視覚的手がかりを提供するからである。我々は、インコンテキストの人間ビデオガイダンスに従って未見タスクを実行する因果ビデオアクションモデル、Zero-WAMを提案する。タスクに富んだペアの人間-ロボットデータの不足に対処するため、我々はタスクサンプリングされたロボット軌道を意味的に整合した人間ビデオへ変換する自動パイプラインを提案し、8.6Kタスクにわたる74.2Kの人間-ロボットICLペアからなるデータセットHumanGenを生成する。モデル訓練のために、さらに、既知タスクから学習されるショートカットを抑制し、ポリシーがビデオプロンプトからタスク情報を引き出すことを強制する、インコンテキスト未来チャンク予測(IFP)目的関数を導入する。RoboTwin 2.0シミュレーションにおける7つの未見タスクでは、Zero-WAMは平均成功率47.0%を達成し、最強のビデオアクションベースラインに対して29.5パーセントポイントの絶対的な改善を示す。実世界評価では、人間のビデオガイダンスに従い、複数物体シーン、長期にわたる操作、高精度な挿入を含む未見のタスク構成へ汎化する。
進化戦略(ES)は近年、LLM推論のためのメモリ効率的な事後学習パラダイムとして登場している。しかし、ESの最適化挙動は未解明のままであり、主流の事後学習パラダイム(例:グループ相対方策最適化(GRPO))と比較した場合の優位性の範囲を定義することは困難である。本論文は、ESのダイナミクスとメカニズムを体系的に調査することにより、まずESがGRPOに対して性能上の優位性を持つことを明らかにし、理論的および実証的に、ESがより広範な推論カバレッジをもたらし、それによって事前学習済みLLMの推論能力をより良く活用できることを示す。理論的には、ES集団全体にわたる検証器投影Jensen-Shannon多様性が、より高いPass@K性能に寄与することを示す。実証的には、エントロピー崩壊を示すGRPOとは異なり、ESはPass@1を改善しつつ、GRPOよりも高いPass@Kを達成する。さらに、Pass@1におけるGRPOの強みとPass@KにおけるESの利得を組み合わせた逐次GRPO-ES訓練戦略を開発する。第二に、モデル全体のかなりのパラメータドリフトにもかかわらず、ESのタスク性能の向上は、より大きい更新量を持つ更新のスパースな部分集合のみに起因することが分かる。この機能的スパース性は、大きなパラメータの移動が必ずしも広範な機能変化を意味する必要がないことを示唆しており、ホールドアウト評価はさらに、それが必ずしも破滅的忘却につながらないことを示している。最後に、ハイパーパラメータ設計がESの有効性にどのように影響するかを調査し、より大きなLLMではESがより小さな集団サイズを必要とすることを示す。これらの発見は、ESを、GRPOのより効果の低いメモリ効率的な代替手段ではなく、明確に区別される推論の事後学習パラダイムとして位置づけるものである。
エージェントスキルは、専門知識とワークフローを再利用可能なリソースにパッケージ化し、AIエージェントの能力を拡張する。最近の研究では、エージェントの経験からそのようなスキルを自動的に発見し、それによってエージェントが相互作用を通じて段階的に適応できるようにしている。しかしながら、スキル開発を導く洞察は通常、最適化履歴全体に散在したままであり、反復間での体系的な再利用が制限されている。我々は、エージェントスキルと永続的な知識ベース(wiki)を共進化させるフレームワークであるWikiSkillを導入する。大まかに言えば、WikiSkillは生の実行経験、蓄積された知識、実行可能なスキルを分離し、経験を継続的にwikiに統合することで、その後のスキル更新がその上に構築できるようにする。多様なベンチマークとモデルにわたって、WikiSkillは最先端のスキル進化手法を一貫して上回り、ほとんどのモデル・ベンチマーク設定でスキルなしのベースラインよりも改善する。我々は、スキル進化がモデルスケーリングを補完することを見いだした。すなわち、大規模なモデルほど進化したスキルから一般的に恩恵を受ける一方で、スキルを持つ小規模なモデルは、スキルを持たないはるかに大規模なモデルを上回ることができる。また、進化したスキルがモデル間およびモデルファミリー間で効果的に転移すること、そして他のモデルによって進化されたスキルが自己進化したスキルを上回り得ることも見いだした。最後に、我々のアブレーション研究は、wikiにおける永続的な知識蓄積が効果的なスキル進化にとって重要であることを確認する。これらの結果は、再利用可能で転移可能なスキルを開発するために、エージェントの経験を系統的に蓄積し洗練することの利点を示している。
ネイティブ3D生成器は現在、単一の画像から印象的なメッシュ形状を復元できるようになった。しかし、高密度メッシュは、機械加工された物体が鋭利であるべき箇所では柔らかくなったままであり、部品分解を持たず、ユーザーが編集できるパラメータも公開しない。この問題に対処するため、我々は「3D形状をコードとして扱う」パラダイムを探求し、3DモデリングのためにLLMのコーディング能力を活用・拡張する。我々はProceduraを紹介する。これは、オブジェクトを手続き的アセンブリとして記述する新しい3Dモデリングエージェントフレームワークであり、名前付き部品が、型付きで機械検証可能なマテによって結合されたパラメトリックプログラムである。テキストプロンプトから、エージェントはオブジェクトをアセンブリグラフとして計画し、プログラムを部品ごとに記述する。各配置は推測ではなくマテフレームから求解し、コンパイル、マテ、接続性のチェックがすべて合格した場合にのみ部品を受理する。分離されたビジョン批評器は、診断された修正を一度に1つずつ適用しながらアセンブリを洗練する。さらに、同じグラフは部品ごとのマテリアルと、シミュレータで検証された関節構造を保持する。我々は、P3D-Benchをそのアセンブリ評価器で評価し、同じ評価器を用いて、我々のハードサーフェスベンチマークであるMechBench-36でも評価する。両方において、Proceduraは判定品質で最先端のネイティブ3D生成器および従来のすべての3Dコードエージェントを上回り、評価したどの手法よりも鋭いエッジを生成し、出力が編集可能で部品構造化されたプログラムである唯一の手法である。
現代のゲーム開発は、従来のグラフィックスパイプラインに大きく依存している。高品質なビジュアルコンテンツには、モデリング、マテリアル作成、アニメーション、ライティング、エフェクト、ランタイム最適化が必要であり、アセット制作のコストが高く、ゲームプロトタイプの開発サイクルを長期化させている。近年、ビデオ基盤モデルが映画・映像制作を変え始めているが、ゲームは線形メディアとは異なり、連続的かつ写実的な映像だけでなく、安定かつ再現可能なゲームプレイのルール、オブジェクトの状態、インタラクションの結果も要求される。本稿では、インタラクティブゲームのためのリアルタイム生成型ワールドレンダリングシステムであるMagpieを提案する。Magpieは、ゲームプレイの実行とビジュアル生成を分離する。デザイナーはゲームエンジン上でシーンとルールを定義する。実行時には、ゲームエンジンがプレイヤーのアクションを解決し、ワールド状態を維持する一方、独立したレンダーサーバーが、エンジンによって生成されたホワイトボックスフレームからビジュアル出力を生成する。Magpieは、生成モデルをリアルタイムゲームレンダリングに適用するためのシステムレベルの実装経路を提供する。これにより、ゲームプレイの設計可能性と再現性が保持され、初期のゲームプロトタイプが完全なビジュアルアセットに依存する度合いが低減される。
大規模視覚言語モデル(VLM)は、多様なマルチモーダルタスクにわたって顕著な汎用性を示してきた。しかし、ユーモアの理解は依然として困難である。なぜなら、ユーモアを含むコンテンツは、画像とテキストのモダリティにまたがるエンティティ、イベント、コンテキスト、暗黙的な関係性の間の微妙な相互作用に依存することが多いからである。こうした相互作用は複雑な推論連鎖を伴うことがあり、従来のプロンプティングや線形のチェーン・オブ・ソート推論では捉えることが難しい。本研究では、マルチモーダルなユーモアの背後にある因果関係と文脈関係を、軽量なグラフベースの推論構造として表現する推論フレームワークであるCaRGo-T(Causal Reasoning Graph-of-Thought)を提案する。このグラフはVLMによって生成されるコードベースの表現にシリアライズされ、その後、同一または異なるVLMによって解釈され、ゼロショットまたはインコンテキスト学習設定で最終予測を生成できる。我々は、風刺、皮肉、ミームなど多様なコメディコンテンツを含む4つのデータセットにおいて、ユーモア理解とユーモア検出のタスクでCaRGo-Tを評価する。最先端の商用およびオープンソースVLMを用いた実験により、CaRGo-Tは既存の推論ベースのベースラインと比較して一貫して性能を向上させ、ユーモア理解では約1〜20%、ユーモア検出では約1〜3%の改善を達成することを示す。相互情報量を用いたさらなる分析は、CaRGo-Tによって生成された推論表現が、ベースラインの推論手法によって生成された表現よりも、対象出力に関連する情報を多く含むことを示している。コードは https://github.com/abhi1nandy2/CaRGo-T で公開している。
再利用可能なスキルライブラリにより、大規模言語モデル(LLM)エージェントはタスク横断的に手続き的知識を再利用できるが、その一方でメモリへのアクセスは困難な検索問題となる。全ライブラリのプロンプティングは高いコンテキストコストを伴いつつも網羅性を維持し、ベクトル検索はコンパクトな近傍を返すがスキルを独立したテキストとして扱う。またグラフベースの検索は、関連性を担うエッジが信頼できる場合にのみワークフローコンテキストを回復できる。我々は、検索に先立って手続き的関係を較正する反事実因果スキルグラフフレームワークであるCaSKGを提案する。CaSKGはまず、意味的・語彙的・入出力・構造的エビデンスから高再現率の有向候補グラフを構築し、修復エビデンスと任意のLLM判定器によって候補スコアをさらに精緻化する。次に、スキルペアを削除・置換・並べ替える方向条件付きテキスト反事実プローブを適用し、ベイズ平滑化でエビデンスを集約し、タスク条件付き展開のための状態フィルタ付き重み付きグラフを出力する。このグラフはオフラインで構築され、下流のエージェントポリシーやタスクインターフェースを変更することなく使用される。ALFWorld ID-140およびScienceWorld U211において、6つのLLMバックボーンにわたって、CaSKGはモデルとベンチマークの全12の組み合わせで最高のタスクスコアを達成する。Graph-of-Skills(GoS)と比較して、6モデルのマクロ平均ScienceWorldスコアを72.62から80.50へ、ALFWorld成功率を80.01%から86.79%へ改善し、また両ベンチマークにおける平均環境ステップ数を削減する。定性的・アブレーション分析はさらに、較正されたエッジが検索において前提条件、状態変化アクション、検証ルーチン、最終完了ステップを保持するのに役立つことを示す。これらの結果により、エッジ信頼度の較正は、大規模な環境でもコンパクトかつ実行可能なスキル検索を実現する効果的な経路として位置づけられる。コードは https://github.com/ZhiyuanLi218/Caskg で公開されている。
近年の推論時スケーリングの進歩により、大規模言語モデル(LLM)の推論性能は大幅に向上した。しかしながら、これらの手法は通常、反復生成または外部検証に依存している。この制限に対処するため、我々は高い効率を維持しながら推論を改善する新しい推論時フレームワークであるCritICLを導入する。我々の重要な洞察は、LLMの失敗モードが同一ファミリー内のモデル規模を横断して構造化されたパターンを示すことである。失敗を望ましくない出力として扱う代わりに、CritICLはそれらをガイダンスの源泉として活用する。具体的には、我々はより弱いモデルから得られた失敗モードを利用し、批判ベースのインコンテキスト例を通じてそれらを推論に組み込む。我々は2つの変種を提案する:入力固有の失敗モードを適応的に予測して批判を検索するCritICL-dynamicと、グローバルな失敗モードプロファイルを使用して安定したガイダンスを提供するCritICL-staticである。実験結果は、CritICLが標準的なインコンテキスト学習を一貫して上回り、テスト時スケーリング手法と同等またはそれ以上の性能を達成しつつ、大幅に少ない生成回数と低いトークンコストで済むことを示している。コードはhttps://github.com/umwyf/CRITICLで入手可能である。
接触リッチな操作は、行動ホライズン内で大幅に変化し得る接触状態への適応を必要とする。しかし、チャンクベースの視覚言語行動(VLA)モデルは、実行前に収集された観測から完全な行動チャンクを予測するため、実行中に触覚条件付けが陳腐化する。既存の触覚リアクティブなアプローチは通常、別個の高頻度コントローラに依存し、アーキテクチャと学習の複雑さを増大させる。本論文では、実行時の触覚フィードバックを効果的に組み込むストリーミング行動生成フレームワークTacForcingを提案する。TacForcingは、別個のリアクティブコントローラを採用する代わりに、標準的な行動エキスパートをストリーミング行動エキスパートに置き換え、実行中に取得される変化する触覚観測を条件として行動を生成する。さらにTacForcingは、実行考慮型触覚注意(EATA)を導入し、触覚条件付けを実行間近の行動に限定することで、触覚取得と行動実行の間の時間的ミスマッチを低減する。シミュレーション環境における6つのUniVTACタスクと実世界の3つの接触リッチな操作タスクにおいて、TacForcingはそれぞれ65%と69%の平均成功率を達成し、両設定で強力なベースラインを上回る。
生成AIはビデオ編集を大幅に進歩させたが、既存の手法は主にシングルショットまたは短いビデオクリップに焦点を当てている。複数の指示を含む長尺動画の編集は、依然として極めて困難な課題である。例えば固定長セグメンテーションのような単純なチャンキング戦略は、しばしばエンティティの断片化、深刻な編集ハルシネーション、時間的連続性の破壊を引き起こす。このギャップを埋めるために、我々はマルチ指示・マルチショット長尺ビデオ編集(MMLVE)タスクを提案する。これは、クロスショット編集一貫性(CSEC)、マルチ指示デカップリング(MID)、時空間構造に対するゼロ破壊(ZDSS)という3つの中核的な目的に基づいて構成されている。これらの3つの独自の課題に取り組むために、我々は大規模言語モデル(LLM)と視覚言語モデル(VLM)の相乗効果を活用し、ショットレベルのビデオ分離と正確な指示解析を実現するエージェント型編集フレームワークを導入する。さらに、このタスクを包括的に評価するために、複雑な実世界の時空間ダイナミクス、高密度で異種混合の指示、疎でランダムなエンティティ分布を特徴とするMMLVEに特化したデータセットであるMMLVE-Benchを構築する。編集結果の品質を評価するために、MMLVEに特化した3つの評価指標をさらに活用する。大規模な実験により、我々のMMLVE-Agentは既存のクローズドソースのSOTA手法(例:Seedance 2.0)を上回り、編集ハルシネーションの排除、クロスショット編集一貫性の維持、シームレスな時空間遷移の達成に成功することを実証する。
明示的な視覚的中間表現は、マルチモーダル大規模言語モデル(MLLM)が空間的証拠や更新された視覚状態を外在化することを可能にするが、その有用性は、画像エディタが必要とされる変換を忠実に実現できるかどうかに依存する。本稿では、MLLM→画像エディタ→MLLMというパイプラインのための自動タスク発見と閉ループ診断フレームワークであるAphantaを紹介する。Aphantaは、直接推論、エディタ生成中間表現を用いた推論、理想化された参照中間表現を用いた推論という3つの条件を評価することで、現在のエディタの実用的有用性から潜在的な視覚的改善余地を分離する。20の候補タスクと複数のエディタ・MLLMの組み合わせにわたって、有用性はタスクに強く依存することがわかった。改善効果は、視覚的手がかりの注入、グラウンディング、反事実的状態の実現に集中する一方、記号に敏感な構築や構造的外挿を必要とする中間表現は、かなり信頼性が低い。選択されたポジティブタスク部分集合では、統合したQwenパイプラインにより平均タスクスコアが0.343から0.445へ改善した(+10.2ポイント、相対+29.7%)。一方、全研究では、フィルタリングされたタスクや失敗したタスクも保持し、その適用限界を明らかにしている。これらの結果は、画像編集を普遍的な推論メカニズムではなく、専門的な視覚的ワークスペースとして位置づけ、Aphantaを、タスクと表現の整合性、エディタの実現能力、下流パイプラインの有用性を測定するための再利用可能なプロトコルとして確立するものである。
評価アーティファクトは、タスク、スコアラー、および報告メトリクスからなる順方向計算を指定する。しかし、それらは、そのメトリクスに付随する主張を必ずしも正当化するものではない。というのも、それを再現するために必要な歴史的証拠や代替的意味論が未結合のままである可能性があるからだ。我々は、この欠落した主張再現層を、凍結基盤D、接地された族F、主張クエリq、および結果として得られる識別集合によって形式化する。次に、固定されたコミット時点で機械的に適格な124のInspect Evalsユニットをすべて悉皆調査する。各ユニットは終局的な処遇を受ける。110は、必要な歴史的証拠または意味的接地が利用できないため、決定的推論の前に停止する。実行が完了する場合、正確な値、勝者、完全な順序、およびペアごとの関係は、主張の解決の有無と、一次ファミリーかレビューファミリーかによって区別される。したがって、監査は、単一の評価器の意味や単一の頑健/非頑健ラベルを強制するのではなく、型付き停止、不安定性の証人、および安定した部分構造を返す。
従来のビデオ編集は主にシーンレベルのコンテンツに焦点を当てるのに対し、ライブ配信では人間の被写体により重点が置かれます。しかし、既存のビデオ編集手法を人間中心のライブ配信に直接適用することは依然として困難です。これらの手法は表情の不整合を引き起こす可能性があり、通常は複数のオフライン推論ステップに依存するため、リアルタイムインタラクションには不向きです。我々は、リアルタイムストリーミングキャラクタービデオ編集のための新しいフレームワークであるEditaLiveを提案します。具体的には、外観と動作を自然に分離する事前学習済み画像アニメーションモデル(Wan-Animate)を起点とし、収集したCharEdit-50Kデータセットを用いた参照フレーム編集とビデオ再構成によって、指示ベースの人間中心ビデオ編集のベースモデルとして転用します。さらに、モデルをオフライン双方向生成から因果的ストリーミング生成へ適応させ、モデルを2ステップサンプラーに圧縮するアライン型自己ロールアウト蒸留戦略を設計します。この戦略では、固定されたRoPEとアラインフォーシングが訓練と推論の乖離を低減し、先頭フレーム保持型スパースアテンションが冗長な履歴情報をフィルタリングして外観ドリフトを軽減します。広範な実験により、EditaLiveが表情の忠実な保持と低遅延リアルタイムストリーミング推論を備えた最先端の編集性能を達成することを実証します。