翻訳付きの日次キュレーションされたAI研究論文
インタラクティブなワールドモデルは、持続的な記憶、応答性の高いインタラクション、そして長期的な生成を支える必要があるが、これらの要件はモデルに相反する要求を課す。デノイザーのコンテキストやキー・バリューキャッシュに履歴を保持するコストは増大し続け、セッション長と保持メモリの間のトレードオフを強いられる。一方、低遅延インタラクションは、その能力が教師モデルに制約される数ステップ生成に依存している。Evokeは、持続的なワールド状態を外部化し、長期的なインタラクティブ生成向けに教師モデルを再設計することで、この両方の制約に対処する。シーンのジオメトリは、外部のカメラ索引付きワールド状態バンクに保持され、そこから視点に関連する情報のみが取得されるため、セッションが長くなってもデノイザーのコンテキストは有界に保たれる。教師モデルを固定の生成器として扱うのではなく、長期的な教師信号を提供できるように設計する。そのスパースアテンションは、チャンク単位のグループ化、選択した遠方フレームの検索、線形アテンションによるグローバル状態を組み合わせ、メモリと計算量の線形成長を実現しつつ、長期にわたる教師信号を可能にする。このような教師信号は、短いウィンドウ内で局所的にしか妥当でないコンテンツドリフトを明らかにする。一方、チャンクごとの条件付けは、シーケンス全体を通じてプロンプトの変更やイベント制御を可能にする。自己強制ロールアウトの下で適用される30秒の分布マッチング目的は、分類器なしガイダンスを使用しない3ステップの学生モデルに両方の能力を転移し、応答性の高い条件付けを維持しつつ、長期的なドリフトへの耐性を向上させる。有界なコンテキストと再帰的な外部メモリにより、Evokeはオープンエンドで継続的に進化する生成をサポートする。単一のH200上で、384×640の解像度では、各1.5秒のチャンクが2.11秒で生成される。3ステップのワールドモデルとして、EvokeはWBenchで最先端の性能を達成し、VBench-LongおよびVBench-2.0でも競争力を維持する。
単一の大規模言語モデル(LLM)が、すべてのクエリと予算制約に対して最適であるとは限らないため、コスト効果の高いデプロイにはモデルルーティングが不可欠である。既存のルーターは多様な定式化と実装を採用しており、公平な比較や拡張が困難である。本稿では、LLMルーティングを、文脈エンコーダ、モデルエンコーダ、スコアリング関数、決定規則、学習シグナルの5つの構成要素によって特徴づけられる逐次決定過程として統一的に定式化する。この定式化は、単一ターン、複数ターン、およびパーソナライズドルーティングを網羅する。この定式化に基づき、ルーティングの教師信号を構築し、応答品質と推論コストの両方でルーターを共同評価するための自動化パイプラインを開発する。得られたベンチマークであるxRouteBenchは、汎用LLM、メモリ拡張、ビジョン、時系列、およびパーソナライズドルーティングのタスクを対象とする。さらに、16以上の代表的なルーターを備えたオープンソースのモジュール式インフラストラクチャであるLLMRouterを導入する。我々の実証研究は、学習ベースのルーターが最も強力な固定モデルベースラインを相対的に14.6%上回ること、軽量ルーターが厳しいコスト制約下でより競争力を持つこと、そしてユーザー条件付きルーティングが一貫してパーソナライゼーションを改善することを示している。
我々は、観測フレーム、言語命令、およびエンドエフェクタのポーズとグリッパー状態からなる所定のアクション系列が与えられたときに、結果として生じる将来の観測を予測する、ロボット操作のためのアクション条件付きビデオワールドモデルであるDreamX-Phi 1.0を提案する。しかしながら、リアリズムだけでは忠実性は保証されない。説得力のあるロールアウトであっても、誤ったアームを動かしたり、操作対象のオブジェクトを見失ったりする可能性がある。予測が各アームの指令された経路に従うことを保証するため、PRoPEスタイルの幾何学的エンコーディングを介してアームごとのSE(3)変換をアテンションに注入し、アームの識別性と剛体運動構造を維持する。アクション制御だけでは、シーン幾何学や小さな操作対象オブジェクトの時間的変化を完全に拘束することはできない。そこで、シーンレベルの幾何学のために軽量な深度ブランチを追加し、SAM3マスクと凍結されたV-JEPA教師モデルを用いて、把持を通してオブジェクトの一貫性を維持する。さらに、効率的な展開のために、分布マッチング蒸留を用いてマルチステップ生成器を数ステップの学生モデルに蒸留する。本稿執筆時点で、本モデルはWorldArena 2.0チャレンジのTrack 1で第1位、Track 2で第2位を獲得している。我々のモデルとコードは公開される予定である。
LLMエージェントの能力は、モデルの重みだけでなく、そのハーネス(プロンプト、ツール、スキル、制御フロー)に依存する。自己改善ループはすでにハーネスを編集しているが、単一系統の探索は経路依存的であり、局所的な改善が他のタスクを後退させることが多い。我々は、モデルを凍結したまま、ハーネスの集団に対する選択として自己進化を扱うDarwinXを提案する。保持・拡張契約は、カバレッジを拡張し後退させない変種のみを許可し、アーカイブは再結合のための代替系統を保持し、失敗由来、教師由来、自己由来の証拠は共通の編集インターフェースを共有する。適応度は各ベンチマーク自身の検証器から得られる。ゴールドソリューションも、人手で選ばれた勝者も存在しない。進化シグナルをテストから段階的に分離する4つのベンチマークすべてにわたって、このループは平均で約17ポイントの向上をもたらす。Terminal-Bench 2.1は、マッチしたベースモデルでは+7.7で83.2%へ上昇し、より強力なベースモデルでは検証済みフロンティアである84.7%に到達する。TerminalWorldのホールドアウト分割は68.3%に達し、すべての既製エージェントを上回る。WebArena-Infinityの実タスクpass@1は、監査クリーンで43.5%から93.0%へ上昇する。また、Terminal-Bench 2.1のハーネスは変更なしでSWE-bench Verifiedに転移する。進化するのはベンチマーク固有のパッチではなく、エージェントの一般的な能力であり、それゆえタスク、検証器、ベースモデルの変更を生き残る。凍結されたモデルは固定されたエージェントである必要はない。ハーネスの選択が評価計算を永続的な能力に変えるのだ。
科学上の発見には、異種モダリティにわたる科学的証拠を推論し、科学ツールや環境と相互作用し、長大なタスク期間にわたって進捗を持続できるAIシステムがますます求められています。本稿では、マルチモーダルな科学的理解、推論、生成、および長期的タスクを支援するために設計された科学エージェント基盤モデル群であるIntern-S2-Previewシリーズを紹介します。学習パイプラインは、レンダリングされた科学文書、インターリーブされた画像-テキストデータ、および多様な科学コーパスに対する科学的マルチモーダル事前学習から始まります。事前学習済みチェックポイントを起点として、教師ありファインチューニング、スケーラブルなマルチタスク強化学習(RL)、ブラックボックス型およびホワイトボックス型のエージェントRL、オンポリシー蒸留から構成される統合ポストトレーニングパイプラインを適用します。このパイプラインは、オフポリシー補正を伴う部分ロールアウト、適応的長さ正則化、オンライン投機的デコード、ロバストなマルチタスク最適化、およびエージェントタスクのためのトレース認識型経験アセンブリを含む、ロールアウトと学習の安定性および効率を向上させる実用的な手法によって支えられています。アーキテクチャレベルでは、Intern-S2-Preview-397Bが時系列モデリングを効率的な長系列理解から数値予測へと拡張する一方で、Memory Decoderは、凍結された397Bバックボーンを変更することなく迅速な科学特化を実現する独立したメモリ拡張経路として研究されています。科学、マルチモーダル、エージェント、および汎用ベンチマークにわたる評価により、Intern-S2-Preview-397Bは複数の設定において競争力のある、またはトップクラスの結果を達成することが示されています。時系列モジュールはSciTSにおける科学的信号の理解と予測を改善し、また独立したIntern-MemDec-4B拡張は、凍結された397Bバックボーンを変更することなく、Biology-Instructionsの平均スコアを56.92から60.32に向上させます。
大規模言語モデル(LLM)が科学的評価にますます参加する中で、我々は報酬ハッキングの潜在的な一形態、すなわち、報告された科学的内容が保持されている場合に修辞的選択がAIレビュー判断をどのように形成するか、またその効果が評価条件によってどのように異なるかを調査する。120件の匿名化されたICLR 2026投稿論文から作成した4,200件の全文論文原稿からなる統制コーパスを構築した。2つのLLMリライターが6つの修辞的次元を正反対の方向に変換し、5つのLLMレビュアーが、標準および厳格なプロトコルの下で、得られた原稿を評価する。さらに、共同書き換え、再帰的書き換え、レビュアー誘導型書き換えも検証する。本研究の結果は、修辞的感度が一律ではなく構造化されていることを示している。エビデンスのフレーミングと新規性スタンスは、総合評価において最大の正負のコントラストを生み出し、スコープのフレーミングはより弱い第2層を形成する。残りの次元は、より小さい、または安定性の低い効果を持つ。この階層構造は、人間が評価した品質レベル全体で持続するが、スコアの変動はAIレビュアーの元のスコアに強く依存する。低いスコアは上昇傾向にあり、高いスコアは下降傾向にあり、方向性のあるコントラストは中間域で最も明確になる。より精巧なワークフローは、確実に大きな利得をもたらすわけではない。共同書き換えはリライター依存性が強く、レビュアーによる誘導は誘導なしの2回目のパスを一貫して上回るわけではなく、書き換えの繰り返しは設定に依存した収穫逓減をもたらす。すべての条件を通じて、リライターは対立するバリアント間の分離を主に決定し、レビュアーはそのスコア効果の大きさと符号を決定する。厳格なレビューは、修辞的感度を一貫して変えることなく、平均総合評価(OA)を1.36ポイント低下させる。これらの知見は、修辞的提示がAIによる科学的レビューに影響を与える状況を特定し、科学的記述における内容を保持した変動に対して頑健な評価システムを動機づける。
マルチモーダルな情報源を凝縮し構造化されたメディア出力へと変換するプロセスは、本質的には、モデルとハーネス(制御機構)を中心とした長期的視野に立つエージェント的プロセスとして捉えることができる。理想的なハーネスシステムは、人間の設計上の事前知識と整合し、経験的な探索を通じて再利用可能な経験を蓄積することで、再帰的な自己改善を推進するものであるべきだが、既存のパラダイムは静的であり、この能力には及ばない。本稿では、人間の設計上の事前知識と整合するフレームワークであるAutoDesignを提案する。このフレームワークでは、メタハーネス最適化器がコードエージェントを導き、ロールアウトフィードバックに基づいてハーネスを再帰的に改善する。このフレームワークを具体化し評価するため、我々は学術論文からポスターへの生成タスクに焦点を当て、5つの分野にわたる100本の論文からなるメイントラックと、制御評価用に共有される10本の論文からなるサブセットであるPosterBench-miniを含むPosterBenchを導入する。PosterBenchメイントラックにおいて、AutoDesignは最高スコア78.32を達成し、クローズドソースの商用システムであるClaude Designを7.45ポイント上回った。7つの制御されたコードエージェント・モデル構成全体において、学習済みのDesignHarnessを統合することで一貫して性能が向上し、平均PosterBenchスコアは54.99から67.39(+12.4%)に増加した。完全に自律的な長期的ループでは、3ドル未満のコストで40分以内に253回のツール呼び出しと11回の編集ターンを実行し、人間による評価において平均的な学会ポスター品質に達した。また、システムを盲検化した人間による評価では、AutoDesignが評価対象システムの中で最も高い人間の選好を達成したことが示された。
ビデオワールドモデルは、現在の観測とユーザーのアクションに基づいて将来の状態をシミュレーションする。最近のシステムは、長いシーケンスにわたって印象的な映像の一貫性とアクション制御性を実証している。しかしながら、これらのインタラクティブモデルを公平に比較することは依然として困難である。実際には、人間のプレイヤーは通常、インタラクションを通じて長期的な目標を追求することによりワールドモデルを評価する。例えば、ユーザーは環境の一貫性を確認するために360度振り返ったり、水中に歩み入れて現実的な水の波紋が生成されるかどうかを調べたりする。同じ目標を達成するために必要なアクションシーケンスはモデル間で大きく異なる可能性があり、固定されたアクション条件付き評価はモデル間比較には適さない。この問題に対処するため、我々はマルチモーダルエージェントプレイヤーを用いて、指定された長期的目標に向けてワールドモデルと対話させる。このパラダイムに基づき、171のシナリオを提供し、各シナリオに指定された目標を持つベンチマークであるPlayWorldを紹介する。性能を徹底的に評価するため、幾何学的一貫性、インタラクションの忠実度、視野外の進化、洞察の進化という4つの主要な側面に沿ってモデルを評価する。さらに、映像品質と制御可能性に関する基本能力指標も組み込む。9つの最先端ワールドモデルにわたる実験により、現在のモデルは長期的なインタラクティブ目標、特に空間的一貫性の維持と持続的な状態進化において依然として信頼性が低いことが明らかになった。コードとデータは https://github.com/kxding/PlayWorld で入手できる。
空間知能は、身体化エージェント、ロボット計画、マルチモーダルアシスタントの基盤となりつつある。VLMエージェントの空間推論能力を向上させるため、既存研究は主に2つの方向性を採ってきた。1つは、教師ありファインチューニングや強化学習などのポストトレーニング手法を用いるものである。もう1つは、モデルが深度推定や3次元再構成ツールなどの外部空間ツールを呼び出し、中間的な空間的証拠を収集するエージェント的パラダイムを採用するものである。我々は、それらと相補的でありながら未開拓の経路を研究する。すなわち、凍結されたVLMエージェントが、推論時に外部の専門空間ツールに依存せず、パラメータ更新を伴わない自己進化によって空間推論を改善できるだろうか、という問いである。我々は、検証済みの空間経験を再利用可能で転移可能な教訓に変換する、経験に基づくランタイムフレームワークである空間メモリエージェント(SMA)を提案する。検証可能な空間環境において、SMAは凍結されたVLMに問い合わせ、予測回答と報酬を取得し、検証器誘導型のリフレクションを用いて空間経験から簡潔で転移可能な教訓を蒸留する。さらにSMAは、各教訓に転移信頼性スコア(TRS)を割り当てる。TRSは一様に初期化され、その後の検索結果を将来の転移信頼性に関する訪問証拠として用いて校正される。読み取り専用のデプロイ時、SMAは意味フィルタと類似度-TRS複合ランキングによって教訓を検索し、検索されたメモリが凍結モデルの推論を導くことを可能にする。5つの代表的な空間ベンチマークと4つのベースVLMにわたって、SMAはすべてのベースモデルブロックでマクロ平均が最高となり、20件の評価の大部分で評価対象手法の中で最高精度を達成し、評価した凍結モデルの規模と環境にわたる空間的自己進化のための実用的なパラメータ更新不要の経路を確立する。
我々は、層インターリーブ型HLA(ハイブリッド線形注意)LLMにおけるMassive activations(MA)の最初の体系的研究を提示し、アーキテクチャに整合した2つの形態を明らかにする。MAは、フルアテンション層の直前に一貫してスパイクし、注意前スパイク(PAS)を形成し、介在する線形注意層を通じて持続することにより、スパイク間プラトー(ISP)を生じる。フルアテンション層がより密に配置されるにつれて、連続するPASはISPを介してますます連結され、最終的にフルアテンションLLMに特徴的な安定したMA形態を再現する。我々は、この構造が、5つの線形注意アーキテクチャ、6つのハイブリッド構成、5つのデータドメイン、および総パラメータ数12億〜3970億にわたる代表的なオープンソースのハイブリッドモデルにわたって再現されることを示す。最大13億パラメータ規模のGDNベースのハイブリッドモデルに対する制御付き事前学習は、両方の形態が早期に出現し、出力ゲーティングに対して非対称に応答することを示す:フルアテンションの出力ゲーティングは、層ごとの構造を排除することなくそれらの絶対的な大きさを強く減衰させる一方、GDNゲートの除去は比較的穏やかな増幅をもたらす。機構的には、我々の系統的な外れ値分析は、MAキャンセルのタイミングによって支配される共通のライフサイクル説明を支持する。PASは局所的な書き込み・シンク・キャンセルプロセスに従うのに対し、ISPの長期持続は遅延キャンセルと整合的である。フルアテンションの極限では、この説明はフルアテンションLLMに特徴的な安定したMA形態を再現する。我々のコードは https://github.com/StartluxLabs/Massive-Activations-HLA で入手可能である。
ポーズ駆動の人物アニメーションは、単一の参照画像と駆動ポーズストリームから対象人物のビデオを合成する。リアルタイム生成は、ライブ配信、テレプレゼンス、仮想アバターなどのインタラクティブアプリケーションにとって不可欠であるが、拡散ベースのシステムはクリップあたり数分から数時間を要し、応答性の高いインタラクションを妨げる。我々は、我々の知る限り、14Bパラメータのビデオ拡散Transformer(DiT)上に構築され、10億パラメータ規模でリアルタイムストリーミングと安定した長時間生成を組み合わせた初のアニメーションシステムであるLiveAnimateを提案する。2段階のトレーニングパイプラインは、まず事前学習された双方向DiTを、参照アンカー付きティーチャーフォーシング適応(Reference-Anchored Teacher-Forcing Adaptation)を通じてブロック因果的自己回帰生成器に適応させ、次にブロック単位自己フォーシング蒸留(Block-wise Self-Forcing Distillation)によってサンプリング予算を3ステップに削減する。長時間のストリームにわたって外観を維持するために、最初の生成ブロックを恒久的に固定する静的シンク(Static Sink)、ポーズ検索された履歴ブロックを保持する動的シンク(Dynamic Sink)、および3スロットのローリングウィンドウを組み合わせた、容量制限付きKVキャッシュ機構であるポーズ検索シンクアテンション(PR-Sink)を導入する。ポーズが繰り返されると、PR-Sinkはシーケンス全体を保持することなく関連する外観コンテキストを復元するため、メモリとブロックあたりのレイテンシはストリームの長さに関係なく一定に保たれる。Ulyssesシーケンス並列処理と演算子融合とともに、これらの設計により、NVIDIA H100 GPU 2基上で19.63 FPSのストリーミング推論を実現する。3分間のベンチマークでは、LiveAnimateは最初の30秒から最後の1分までほぼ一定の知覚品質と人物同一性を維持する一方、従来システムは同じロールアウトで大幅に劣化するか、数時間のオフライン計算を必要とする。これらの結果は、インタラクティブな全身アニメーションの品質、レイテンシ、持続時間において新たな動作点を確立するものである。
トーキングビデオのキャラクター置換には、ソースの動き、シーン、言語内容、音声と映像のタイミングを保ちながら、外観と音声の協調的な転送が必要である。既存手法は、2つのモダリティに対して別々に最適化されたモデルを使用するため、音声と映像の一貫性を強制することが困難である。我々は、トーキングビデオにおけるストリーミング型の音声-映像共同アイデンティティ置換のための初のフレームワークであるUniSwapを提案する。ソースビデオ、参照画像、参照音声クリップが与えられると、UniSwapはソースの内容とダイナミクスを保持しながら、単一の音声-映像拡散トランスフォーマー内で参照の外観と声質を転送する。対応付けられたクロスアイデンティティ学習ペアの不足に対処するため、実際のクリップから視覚的および音声的アイデンティティを除去し、元のクリップを再構成ターゲットとして使用するスワップ・アンド・リコンストラクト・パイプラインを導入する。双方向バックボーンから開始し、ジョイント置換のためのインコンテキスト事前学習、ブロック因果KVキャッシュ生成のための条件付きストリーミング適応、露出バイアスの軽減とブロックあたりのデノイジングステップの30から3への削減を実現する効率的なセルフフォーシングDMDを通じて、モデルを段階的に適応させる。効率的なマルチLoRAスイッチングにより、3つのDMDロールが単一の凍結バックボーンを共有できる。フィーチャーRoPE分解は、キャッシュされた位置をトレーニング範囲内に保ち、安定したロングフォーム推論をサポートする。実験では、強力な音声-映像同期、競争力のあるアイデンティティ保存、効率的なストリーミング、安定したロングフォーム生成が実証される。
自己回帰トランスフォーマーは、生成トークンにわたる水平方向と、モデルの深さにわたる垂直方向という2つの軸に沿って計算を行う。高密度アテンションは各トークンに過去への広い水平アクセスを与えるが、デコードステップ間の垂直フィードバック経路は狭いままである。すなわち、サンプリングされたトークンのみがスタックの底に戻り、最上層の隠れ状態は破棄される。我々は、この経路を潜在フィードバックによって拡張するフルバンド幅トランスフォーマーを導入する。各デコードステップにおいて、前の最上層の隠れ状態は、ゲート付き線形ユニットを介してサンプリングされたトークン埋め込みと融合され、次の入力としてフィードバックされる。潜在フィードバックにより、言語化されない計算が新たな深さの予算を得てスタックに再び入ることが可能になり、その一方で標準的なトランスフォーマーアーキテクチャ、KVキャッシュ、および言語モデリング目的関数は維持される。並列的なティーチャー・フォーシングを失うことなくフルバンド幅トランスフォーマーを訓練するために、我々はスケジュール化されたマルチパス目的関数を用いる。これは事前学習の後期に潜在フィードバックを導入し、安定性のために少量のより深いフィードバックパスを混合するものである。我々は1Bパラメータのフルバンド幅トランスフォーマーを最大400Bトークンで訓練し、潜在フィードバックが検証損失、5ショット言語モデル評価、数学およびコーディング生成、指示チューニング性能を改善することを見いだした。トークンあたりのデコードオーバーヘッドは無視できる程度でありながら、フルバンド幅トランスフォーマーは、およそ1.5倍多くのトークンで訓練された標準トランスフォーマーに匹敵するか、それに接近し、同等以上の精度でより短い推論トレースを生成することができる。
視覚トークン刈り込みは、マルチモーダル大規模言語モデル(MLLM)の推論コストを大幅に削減できる一方で、既存手法の多くは固定された人手設計のヒューリスティクスやコストのかかる専門家の試行錯誤に依存している。刈り込みの目的、予算、モデルアーキテクチャが多様化するにつれ、拡大し続ける設計空間を手動で探索することはますます困難になる。本論文は、視覚トークン刈り込みのためのAI4AIフレームワークの構築を目指し、次の自然な問いに取り組む。「大規模言語モデルは、効果的な視覚トークン削減アルゴリズムを自動設計できるのか」。LLMは幅広いアルゴリズム知識と強力な推論能力を備えているが、そのような一般的知識を専門タスクの効果的な解決策に変換することは依然として容易ではない。我々は、その鍵となるのは、LLMの内部知識と視覚トークン刈り込みの構造的要件および制約を結びつける適切な探索状態表現の設計であると主張する。この洞察に基づき、我々はAutoPruneを提案する。これは、LLM駆動型の視覚トークン刈り込みポリシー設計のための学習不要フレームワークである。AutoPruneは中核として、予算管理、トークンスコアリング、選択制約、トークン再構成のための131個の再利用可能なアトムから構成されるトークン刈り込みドメイン特化言語(TPDSL)を導入する。TPDSLの重要な特性は、各探索状態を強力なベースポリシーの残差修正として表現することである。この残差定式化は探索空間を狭め、LLMの注意を性能にとって最も重要なポリシー構成要素へと向けさせる。14のマルチモーダルベンチマークと3つのMLLMバックボーンにおける実験は、AutoPruneの有効性、効率性、および転移可能性を実証している。視覚トークンの94.4%を除去しても、AutoPruneは全トークン性能の99%以上を維持しつつ、FLOPsを9.9分の1、プリフィル遅延を6.4分の1に削減する。
大規模な操作データはロボット学習に不可欠であるが、ロボットのデモンストレーション収集は依然として高コストであり、大規模化が困難である。一方、豊富に存在するエゴセントリックな人間の操作ビデオは豊かな行動経験を提供するものの、人間の手とロボットのエンドエフェクタの違いにより、それらをエンボディメント間で転移させることは依然として困難である。近年のビデオワールドモデルの進展は、人間の観察からロボット中心の操作ビデオを合成する有望な道筋を提供しているが、そのクロスエンボディメント転移能力はほとんど調査されていない。そこで我々は、エゴセントリックな人間のデモンストレーションを指定されたエンボディメント条件下でロボット操作ビデオに変換する、クロスエンボディメントの人間からロボットへの操作ビデオ生成を評価するためのベンチマークであるH2R-Benchを導入する。各ベンチマークインスタンスには、人間のデモンストレーションビデオ、ターゲットエンボディメントの制約、およびタスク目標、アクションイベント、機能的接触、物体応答をカバーするソースに基づくアノテーションが含まれる。H2R-Benchは、生成されたビデオを、ゴール状態の達成度、アクションイベントの達成度、機能的接触の転移、エンボディメントの正確性、および一般的なビデオ品質の5つの次元で評価する。我々は、6つの操作ファミリーと2つのロボットエンボディメントにわたって、11の最先端ビデオ生成モデルのベンチマーク評価を行う。評価の結果、現在のビデオワールドモデルは人間からロボットへの操作転移において依然として限界があることが明らかになった。すなわち、主要なモデルでさえ、エンボディメントの一貫性、機能的インタラクション、およびタスク実行において失敗することが多い。H2R-Benchは、ビデオワールドモデルが人間とロボットのエンボディメントギャップを橋渡しし、人間の操作観察をロボット中心のトレーニングリソースに変換できるかを評価するための体系的な診断フレームワークを提供する。
テスト時計算スケーリングは、大規模推論モデル(LRM)の性能を左右する主要な要因であるが、その極端な非効率性が現在の手法の限界を規定しており、重要な問いは「どれだけ計算を費やすか」から「どこに計算を配分するか」へと移行している。本稿では、テスト時推論を、部分的な軌道(トラジェクトリ)に対する制約付き計算配分問題として定式化する。固定ハードウェア予算の下では、既存のパラダイムは最も有望な部分進捗に計算を能動的に配分できない。従来の並列サンプリングはトレースを独立に扱い、深刻なメモリボトルネックを引き起こす一方、減算的枝刈りはハードウェアを遊休させ、出力分布を能動的かつ十分にシフトさせることができない。この二分法を克服するため、我々は思考レベルのビームサーチを実行する推論アルゴリズムGambitを提案する。Gambitは、有望でない軌道を定期的に枝刈りし、高品質なプレフィックスから即座に分岐することで、隠れ状態をプローブする軽量スコアラを通じて計算を最も有望な推論トレースに動的に集中させるとともに、継続的な高いハードウェア利用率を維持する。複数のモデルとベンチマークにわたる広範な評価により、Gambitが既存のベースラインを厳密に凌駕することが示された。同一のハードウェア制約の下で、本手法は枝刈りベースラインと比較して、HMMT-24では最大+6.7%ポイント、AIME-25では+3.3%ポイントの絶対精度向上をもたらし、トレース完了では2倍以上のスループットを達成し、標準的な並列サンプリングに対して総トークン消費を最大68.5%削減する。
エージェントスキルは、手続き的知識とドメイン専門知識をパッケージ化するための標準化された形式であり、エージェントハーネスシステム内において、反復可能かつ高品質なタスク実行のために言語モデルの行動空間を継続的に制約する必須のメカニズムとして機能する。しかしながら、強力なクローズドソースモデルは高い推論コストを伴うため、CodexやOpenClawといった現在普及しているエージェントハーネスは、これらのスキルを実世界のタスク遂行に展開する際に、依然として法外に高価である。消費者向けGPU上で展開可能なオープンソースモデルの急速な能力向上は、スキルベースの行動制約を活用することでこれらのコストを大幅に削減する魅力的な機会を提供する。それにもかかわらず、そのようなコンパクトなモデルに特化して調整された効果的なスキルを自動生成することは、依然として重要な実践的課題である。この課題に対処するため、我々はSKILLERを提案する。これは、小型モデル向けに実行器固有のスキルを自動生成するよう設計された自然言語駆動の強化学習フレームワークであり、強力なモデルをアクターおよびクリティックとして用い、小型モデルのエージェントシステムを環境として扱い、すべての強化学習信号を完全に自然言語のみを介して伝播する。Qwen3.5-9BおよびQwen3.5-4Bを用いた5つの関連ベンチマークにわたる広範な実験評価により、SKILLERが3つのオープンソースおよび1つのクローズドソースのスキル生成または進化手法を上回り、9Bモデルでは4.3〜20.4パーセンテージポイント、4Bモデルでは1.8〜13.3ポイントの絶対的な向上を達成し、さらにSkillsBenchの単一スキルタスクにおいて強力なクローズドソースモデルの性能に顕著に匹敵することを実証する。プロジェクトはhttps://github.com/DANG-ai/SKILLERで公開されている。
インタラクティブな自己回帰動画生成には、低遅延のロールアウトと正確なオンライン制御の両方が求められる。少数ステップ蒸留はデノイジングステップを削減することで生成を高速化する一方、オンライン制御は因果制約を課す。すなわち、フレームとブロックは生成時に利用可能な履歴と制御に依存すべきである。しかし、既存の動画分布マッチング蒸留(DMD)パイプラインは、完全なクリップをスコアリングする双方向教師モデルを用いて、因果的な少数ステップの生徒モデルに教師信号を与えることが多い。このため、ターゲットのスコアは、生徒がそれを生成した時点では利用できなかった未来のフレームや制御に依存し得る。これにより、教師信号と生徒の因果的情報セットとの間に不整合が生じる。我々は、各ターゲットが生成される時点で利用可能な情報に教師信号を整合させる因果的DMDフレームワークであるContext-Matched Distillation(CMD)を導入する。CMDは、双方向のフルクリップスコアリングを、将来のフレームや制御にアクセスせずに各ターゲットを評価する因果的教師モデルに置き換える。同じ因果的教師モデルが少数ステップの生徒モデルを初期化し、教師の訓練、生徒の蒸留、推論にわたって一貫した因果的定式化を確立する。時間的情報境界の整合に加えて、Prefix Scoringは、各ターゲットを、それを生成したキャッシュされた生徒生成プレフィックスの下で評価することにより、教師信号を生徒が実際に実現したロールアウトコンテキストに一致させる。Prefix Corruptionは、訓練初期に生成される信頼性の低いプレフィックスを摂動させることで訓練をさらに安定化させ、このターゲットとコンテキストの整合性を保つ。単純な因果的定式化により、CMDはフレーム単位およびチャンク単位の生成、長尺動画の蒸留、カメラ条件付き蒸留に自然に拡張される。実験では、短尺および長尺の両方の動画ベンチマークにおいて、自己回帰手法の中で最先端の総合性能を示すとともに、時間変化するカメラ制御への追従が大幅に改善されることを実証する。
我々は、固定サイズメモリを有し、スライディングウィンドウアテンションを一般化しつつ訓練中も並列化可能なリカレントTransformerアーキテクチャである[モデル名]を導入する。[モデル名]は、二つの結合モデルから構成される。すなわち、フルアテンションを利用してメモリターゲットm'_tを生成するプリフィラーQ(実際には、Qに対してはフルアテンションとスライディングウィンドウアテンションを交互に使用する。これにより、より高い性能が得られる。本質的な要件は、QがPよりも表現力が高く、完全な履歴にアクセスできることである)と、スライディングウィンドウアテンションとリカレントなK/V注入のみを使用して、次トークン予測のためのデコーダメモリm_tを生成するデコーダPである。我々は、m_tをm'_tに整合させるメモリ一貫性損失を用いて[モデル名]を訓練し、推論時にはPのみを使用できるようにする。経験的に、[モデル名]は、スライディングウィンドウおよび潜在リカレントTransformerベースラインと比較して、検証損失と下流の事前学習ベンチマークを改善する。さらに、PとQとの間でパラメータを共有することで、パラメータメモリを削減しつつ、利得の大部分を維持できる。
長期的なタスクを遂行するLLMエージェントは、将来のタスクを支援するために過去のやり取りから情報を保持する必要がある。既存のメモリシステムは通常、即時統合に依存し、各やり取りの後にLLMを呼び出してメモリの抽出、要約、更新を行う。この設計では、会話が長くなるにつれてメモリ構築のコストが増大する。粗い要約は構築コストを削減できるが、細かい文脈的証拠を失うリスクがあり、一方で検索コンテキストを拡大したりマルチホップのLLM推論を用いたりすると、オーバーヘッドがクエリ時に移る。本稿では、ターンレベルの統合を意味的セグメントレベルの統合に置き換えた効率的な長期メモリフレームワークであるLycheeMemory V2を提案する。LycheeMemoryはすべてのやり取りを統合する代わりに、複数のやり取りをセグメントにまとめ、確定した各セグメントを文脈非依存の型付きメモリレコードに符号化する。セグメントレベルのバッチ処理はLLMの符号化頻度を下げ、意味的境界検出は固定ウィンドウのバッチ処理と比較して、一貫性のあるイベントレベルおよび時間的証拠を保持するのに役立つ。得られたレコードは、クエリ計画に基づく証拠検索のための軽量な構造化インデックスによって整理される。GPT-4.1-Miniを用いた実験では、LycheeMemoryは最先端の性能を達成し、LoCoMoで89.22%、LongMemEval-Sで92.20%を記録した。また、A-Memと比較して、クエリ時のトークン使用量を増やすことなく、構築トークンをLoCoMoで86.0%、LongMemEval-Sで75.9%削減した。さらに広く見ると、我々の結果は、長期エージェントメモリにおける精度とコストのトレードオフが、保持する情報の内容だけでなく、統合を行う粒度にも依存することを示唆している。
大規模言語モデルは、能力を超えたタスクに対して、計算コストが高い一方で意味的に空虚な推論を生成し、もっともらしく聞こえるが誤った導出が利用者を誤解させるリスクを生み出す。我々は、この無益な推論現象を系統的分析によって特徴付け、普遍的な能力超過行動と、能力と行動の間の系統的な誤較正を明らかにする。主要な失敗モードは、表面上は有効に見えるが微細な誤りを含む見せかけの推論であり、タスクの難易度の上昇に伴って増大する。この問題に対処するため、我々はCaRL(Capability-aligned Reinforcement Learning:能力整合強化学習)を導入する。これは、無益な推論よりも拒否を促す報酬形成と、失敗を拒否の教師信号に変換する後知恵拒否拡張(hindsight refusal augmentation)を通じて、モデルの行動を能力境界に整合させる。実験により、タスクの難易度を問わず性能を維持しつつ無益な推論を大幅に削減し、実用性を犠牲にすることなく能力整合的な行動を効果的に達成できることが実証された。https://github.com/icip-cas/Knowing-When-to-Quit
指示チューニング済み言語モデルは、さまざまな生成タスクで高い性能を達成する一方で、近年、言語化された過信を示すことも明らかになっている。質問応答において、モデルの言語化された過信は、生成された根拠の一貫性と関連している可能性がある。本論文では、指示チューニングによって誘発されるモデルの信頼度の変化に伴って、生成される回答根拠の語彙的多様性に対応する変化が生じるかどうかを調査する。質問応答ベンチマークにおいてマッチした3組のベースモデルと指示チューニング済みモデルを評価し、予測精度の変化が限定的で、尤度に基づくキャリブレーションが低下するにもかかわらず、指示チューニングが回答の信頼度を一貫して変化させることを見いだした。次に、指示チューニングが根拠の多様性に及ぼす影響は一様ではないことを観察した。すなわち、根拠間の多様性は一貫して減少する一方、表層的な語彙の多様性はモデルとベンチマークに応じて方向と大きさの両方において異なる。最後に、これらの差異は回答選択と根拠の長さを制御した後も持続することを見いだし、信頼度と根拠の多様性が指示チューニングの異なる効果を捉えていることを確認する。
大規模言語モデル(LLM)は自然言語タスク全般において顕著な性能を達成するが、静的なコーパスで訓練されるため、急速に変化する世界ではその知識はすぐに陳腐化する。このことが、無関係な知識を変更せずにLLM内の特定の知識を更新する知識編集(KE)を動機づける。最近の研究は、構造化された知識トリプルから非構造化KE(UKE)へと移行しており、UKEでは、編集内容は複数の事実を一度に述べ得る自由形式の文章である。それにもかかわらず、既存の編集手法はそのような文章を注入するものの、それを活用できていない。編集されたモデルは文章を想起できるが、その事実に関する原子的な質問に答えたり、それらを組み合わせてマルチホップ推論を行ったりすることができない。我々は、この欠落した特性(これをコンポーザビリティと呼ぶ)は、編集手法が固定された文章を唯一の学習源として受動的に依存していることに起因すると考える。これに対応して、我々は編集を、外部からの監視を必要としない、同じモデルの特権的なインコンテキスト状態からの能動的な自己蒸留として捉え直す。さらに我々は、注入された知識の新規性のため、編集前モデル自身のロールアウトがその知識をほとんどカバーせず、純粋なオン方策蒸留の有効性を制限していることを明らかにする。このギャップを埋めるために、我々はHPSEを提案する。HPSEは、生徒自身の軌道においてカバレッジが失敗する箇所に欠落した事実を正確に配置するために介入し、それ以外の箇所ではオン方策を維持する、ハイブリッドロールアウトを構築する。我々は、純粋なオン方策蒸留に対するHPSEの優位性を理論的に分析し、4つのLLMバックボーンと2つのKE手法にわたる様々なシナリオにおいて、そのプラグアンドプレイ的な改善を実証的に確立する。
大規模音声言語モデル(LALM)は、多様な音声入力の理解において強力な能力を示している。この多様性には、人間には聞こえないが、それでもモデルに入力され、その生成に影響を与え得る低周波信号が含まれる。しかしながら、このような低周波入力がLALMに及ぼす現実的な影響は、いまだほとんど調査されていない。本論文では、断続的低周波ロックアウト(ILL)を提案する。これは、ブラックボックス環境においてユニバーサル波形テンプレートを用いてこのリスクを評価する、不可聴なレッドチーミング手法である。ILLは、文注意スケール推定を用いてアクティブ区間を決定し、周波数混乱転移を用いて、コーパスのスペクトル変動から連続位相を持つ低周波波形を構築する。このリスクを軽減するため、分布再問い合わせガード(DRG)を提案し、低周波分布シフトを検出して、意味的復元のために条件付きで2回目の録音を要求する。6つのLALMと複数の音声理解タスクにわたって、ILLは最大67パーセントポイントの精度低下を引き起こす一方、平均人間可聴性評価は1.33と、クリーン音声の1.17に近い値を示した。DRGは、クリーンな再取得後、攻撃を受けた平均精度を28.5%から46.1%へ向上させた。これらの知見は、LALMに対するこれまで見落とされてきた安全性リスクを特定し、堅牢な音声理解に関する将来の研究の基盤を提供する。
本論文は、仕様ファーストプロトコルに基づくAIコーディングエージェントによる大規模アーキテクチャリファクタリングの、完全に計測された単一のケーススタディを報告する。生成されたコードに対する人間によるレビューはなく、対象とする動作を検証するための既存のオラクルも存在しない。その課題は、大規模で相互依存性の高いコードベース全体に及ぶ中心的不変条件の解体であり、著者により、段階的リファクタリングでは事実上実行不可能と評価されたものである。これは、従来であれば書き直しが必要とされる種類の変更である。本論文で記述するプロトコルに基づき、エージェントはこの課題を成功裏に完了した。 対象システムは、3,648ファイルにわたる717,725行の本番運用TypeScriptアプリケーションである。課題は、中核的なライフタイム不変条件、すなわち「UIパネルがAIリクエストの実行中は開いたままである」という保証を解体することであった。目標とする動作は、ストリーミング生成がパネルのクローズ後も存続し、パネルを再度開いた際に、損失や重複なしに同じライブストリームへ再接続できることであった。 プロトコルは以下の通りである:エージェントによる形式的仕様の作成、ソースコードに対する仕様を監査する14回のリファインメントサイクル、アトミックな実装、コンパイル/テストのフィードバックループ、その後の凍結された仕様に対するコードを監査する17回の検証サイクル。合計31回の監査パスにおいて、人間がプログラムを実行する前に201件の欠陥が修正された。収束基準は経験的なものであり、連続する2回の検証パスがゼロ件の指摘を返すことを以て収束とした。 この変更は189ファイルに影響を与え(うち31ファイルは新規)、抽出フェーズを含めると、2つのコミットの合計は288ファイル、34,770行の追加、16,422行の削除となる。最初のセッションとその後のおおよそ30回のセッションを通じて、ソフトウェアは仕様どおりに動作し、バグは観察されなかった。所要時間:3日間。費用:2,430米ドル。 完全な仕様書と生のセッションログ(フランス語で1,500ページ以上)は証拠として公開されており、プロセスの検査と、一貫性チェックのための言語モデルへの提出が可能である。
肋骨骨折は一般的であり、CT(コンピュータ断層撮影)上での位置特定に時間を要する。我々は、CT由来の2つの直交投影画像(前後方向および側方方向)において独立に検出された骨折が、ビュー間で対応付けられ、制御された誤出力率で信頼性の高い3次元点へ三角測量できるかどうかを問い、段階的診断研究によりこの問いに答える。投影幾何学は厳密であり、正しい対応が与えられれば、位置特定は正確である(中央値4.0 mm、88%が10 mm以内、93.6%が肋骨一致)。封印された55症例のコホートでは、骨折の大部分は原理的に回収可能であるが(二面像可用性61.1%、骨折の58.4%に候補グラフ内に正しいペアが存在)、制約となるのは幾何学でも位置特定でもなく、信頼度に制限された交差ビュー対応である。検出器×対応付けの制御要因分析は、運用上の利得が試験したマッチング手法ではなく側方検出器の品質に帰属することを示し、側方検出器の再学習により初めて非ゼロの制御予算下での再構成が得られた。意図的に保守的なコミットメント方針の下では、事前指定された封印パスが601の骨折のうち15を正しい3D位置特定へと昇格させ、偽陽性点は症例あたり0.436(エンドツーエンドのコミットメント収率2.50%)であり、コミットされた点は正確であった(中央値1.49 mm、93%が肋骨一致)。この低い収率は、幾何学や検出によるものではなく、信頼度ゲート型棄却の結果である。本研究は、選択的3D位置特定のための再現可能な枠組みを確立し、交差ビュー対応が支配的な運用上のボトルネックであることを特定する。
機械翻訳(MT)システムは、特に英語のような性別に依存しない言語からルーマニア語のような性別を持つ目標言語へ変換する際に、性別を正しく翻訳できないことがよくある。このバイアスにより、翻訳は男性形に偏ったり、性別ステレオタイプを強化したりする結果となる。我々は、大規模言語モデル(LLM)に基づく性別分類とニューラル機械翻訳(NMT)を組み合わせたハイブリッドパイプラインを提案し、この問題を軽減する。本システムは、微調整されたLLMを用いて、英語文内の対象語の意図された性別を検出し、インラインの性別ヒントタグを挿入する。これらのタグ付き文は、形態的に正しいルーマニア語翻訳を生成するように微調整されたTransformerモデルに渡される。この取り組みを支援するために、性別の曖昧性解消と翻訳のための3つの新しいデータセットを導入する。本手法は、ベースラインMTシステムと比較して、WinoMTおよびWinoGenderベンチマークにおける性別精度を40パーセントポイント以上向上させる。これは、LLM推論とタグ認識翻訳の両方を用いて英語-ルーマニア語MTにおける性別バイアスを明示的に対処し評価する最初の手法である。
航空輸送における深刻な到着遅延や異常な飛行時間などの極端な事象は、連鎖的なネットワーク混乱を引き起こし、運用上・経済上・安全上の多大なコストをもたらす。こうした事象は履歴データに稀にしか存在せず、機械学習モデルの学習シグナルが不十分になる。合成データ拡張は原理的な解決策を提供するが、従来の生成モデルは分布の裾を過小表現し、短い飛行時間と長い飛行距離の組み合わせのような、運用上実行不可能な事例を排除する保証がない。混合型のテーブルデータ記録を対象に、これら両方の限界に対処した既存手法は存在しない。本論文では、生成的モデリングと2つの異常検出層を組み合わせた2層生成フレームワークTailBoosterを提案する。統計層は四分位範囲(IQR)を用いて極値を抽出し、裾に集中した学習シグナルを専用の生成モデル(ここでは表形式変分オートエンコーダ、TVAE)に供給する。続いて深層学習層がオートエンコーダに基づくクリーニングを適用し、履歴データから学習された運用上の実行可能範囲(operational envelope)に違反する合成レコードを破棄する。本フレームワークは、米国のフライト記録を用いて、多様性、統計的類似性、忠実度、運用上の妥当性、有用性の5つの観点から評価された。このうち後者の2つ(運用上の妥当性と有用性)が主な改善対象である。データ駆動型のクリーニングは運用上の妥当性を著しく改善し、対象を絞ったデータ拡張は極端な事象の予測における有用性を向上させた。6種類の回帰アルゴリズムにわたり、本フレームワークのレコードで学習した場合、従来の合成データと比較して、極端な飛行時間の予測では平均絶対誤差(MAE)が47〜49%、極端な到着遅延の予測では29〜57%減少した。実レコードを合成極値で補強した場合にも、同等の改善効果が得られた。TailBoosterは完全にデータ駆動型でありモデル非依存であるため、極端な事象の予測が重要であり、かつドメイン固有のルールが利用できない領域にも適用できる。
半教師ありセマンティックセグメンテーションは、長らくどの擬似ラベルを信頼するかという一つの問いを中心に展開してきた。選択規則、動的閾値、クラス別カリキュラム、ソフト信頼度重み付けといった一連の手法は、当時のノイズが多く低信頼度のResNet教師に対してその問いに答えた。自己教師あり基盤エンコーダはこの様相を変える。DINOv2教師では信頼度が飽和するため、弱い教師を助けたフィルタリングが強い教師には害となり得る。 我々はCW-BASS v2を提案する。これは、単一の規則に固執するのではなく教師の信頼度の様相を読み取る、飽和を考慮した擬似ラベル選択手法である。この手法は、ホールドアウトデータによる較正(クラスごとの不偏ノイズ推定)と、保持率が1から離れることを証明可能に保証する自己適応的信頼度フロアを組み合わせ、それらをワンパスゲートとして統合する。具体的には、ホールドアウトデータの一部分上で教師の高信頼集合の信頼性π_kept = Pr[correct | c ≥ τ]を測定し、それが要求される信頼度を満たす場合(π_kept ≥ τ)には厳密にフィルタリングし、そうでない場合には適応的フロアにフォールバックする。その境界は、mIoUに対して調整された値ではなく、既存の動作閾値である。そして6つのDINOv2教師にわたり、厳密フィルタリング(strict)とフロアのどちらを選ぶかという正しい判断をブラインドで下す。 このようにCW-BASS v2は、飽和したベンチマークではstrictを選択することでUniMatch V2の動作点を再現する(Pascal VOC 1/8分割で87.4、報告値87.9に対して;Cityscapesでは報告値との差0.5以内)。一方、高信頼集合が信頼できない場合(π_kept≈89%、ADE20K)では、フロアが+1.5 mIoU(単一シード)だけ勝り、UniMatch V2を改善する。 このゲートが原理的であるのは、それが回避する失敗が仮定ではなく測定に基づいているからである。信頼性が高く飽和した教師では、信頼度分布のダイナミックレンジが崩壊する(Pascalの画素の98%が0.95以上)。そのため、適応的カットオフは保持マスクを埋め尽くし、自己学習は確証バイアスへと陥る。
スコア蒸留サンプリング(SDS)は、事前学習された拡散事前分布を用いてレンダリング画像を最適化することでテキストから3D生成を可能にするが、潜在SDSはしばしば構造的な色アーティファクトや高周波のテクスチャノイズを生じさせる。我々は、VAEによって引き起こされるピクセルドリフトに起因する潜在SDSの失敗モードを特定する。すなわち、最適化された画像は、VAEエンコーダによって弱く制約されるピクセル空間の方向に移動し得るため、その潜在表現はクリーンで意味的に意味のあるままである一方、画像自体には目に見えるアーティファクトが蓄積される。我々は、制御された2D SDS実験、VAEのみの最適化、およびピクセルへの逆写像が制約不足である場合にエンコーダ型の潜在目的関数が画像空間のノイズを増幅し得ることを示す簡略化解析により、この診断を裏付ける。この観察に動機付けられ、我々は軽量なVAE整合的な勾配修復手法であるPixSDSを提案する。PixSDSは、潜在SDSの先読みステップをデコードし、デコードされた画像をピクセル空間最適化のためのクリーンな方向として用いることで、拡散モデルの再学習、レンダラーの変更、またはSDS目的関数の置き換えなしに、VAE非整合な方向への動きを低減する。2D最適化およびテキストから3D生成における実験は、PixSDSが意味内容を保持しつつ構造的なアーティファクトを大幅に低減することを示す。コードはhttps://sevashasla.github.io/pixsds-webpage/で公開されている。