翻訳付きの日次キュレーションされたAI研究論文
視覚言語行動(VLA)モデルは一般的に、LLM中心のV→L→Aパスを採用しており、視覚観測を大規模言語モデルの表現空間に射影した後、ロボットの行動にデコードする。効果的ではあるが、この設計はポリシー呼び出しのたびに大きな計算とメモリのオーバーヘッドを生じる。本研究では、従来のV→L→Aパスを直接的なV+L→Aマッピングとして再構成する新しいVLAパラダイム、TurboVLAを提案する。TurboVLAは、大規模言語モデルを知覚と行動の中心的なインターフェースとして使用する代わりに、視覚観測と言語命令を独立してエンコードし、軽量な双方向視覚言語相互作用を通じてそれらの間で直接情報を交換し、コンパクトなデコーダで連続的な行動チャンクを予測する。このシンプルな設計は、視覚特徴と言語特徴から直接タスク条件付き表現を構築し、VLA推論の計算コストとメモリコストを大幅に削減する。LIBEROにおいて、TurboVLAはわずか0.2Bパラメータ、31.2msの推論レイテンシ、コンシューマグレードのRTX 4090上で0.9GBの推論VRAMで平均成功率97.7%を達成し、はるかに大規模なVLAポリシーと同等かそれ以上である。これらの結果は、TurboVLAが主流のLLM中心のVLAパラダイムに対するシンプルで効果的な代替手法であり、効率的なロボット操作のための視覚、言語、行動の接続方法に関する新たな視点を提供することを示している。コードはhttps://github.com/H-EmbodVis/TurboVLAで入手できる。
ルーブリックベースの強化学習は、明示的な基準に照らしてモデルの出力を評価することで、言語モデルの学習を強化する。しかしGRPOスタイルのパイプラインでは、これらの構造化された評価は、スカラーの応答レベルの報酬に縮約され、応答レベルのアドバンテージに変換された後、生成されたすべてのトークンに一律に伝播される。このため、異なる基準が異なるスパン、フォーマット上の選択、意味上の選択に基づいている場合でも、応答内でクレジットを割り当てる明示的なメカニズムが存在しない。本稿では、ルーブリック条件付きGRPOのためのトークンレベルのクレジット重み付け手法であるCoRTを提案する。CoRTは、補助的なトークンスコアリングモデルを学習する代わりに、反実仮想リプレイを用いて、同じサンプリングされた応答を、元のルーブリック条件付きプロンプトと、基準を含まない対応するプロンプトの下で再スコアリングする。得られたトークン単位の対数尤度の差は、ルーブリックコンテキストへの依存度の代理指標として機能する。CoRTはこれらの差を有界で応答正規化された重みにマッピングし、それらを用いて符号付きGRPOアドバンテージをトークン間で再分配する。この際、補助的なスコアラーを導入したり、応答レベルの報酬を変更したりする必要はない。指示チューニング済みモデルと報酬の粒度にわたる実験では、CoRTは比較の大部分において、対応する応答レベルのGRPOよりも改善を示し、平均4.4パーセントポイントの向上を達成した。本手法は、学習されたトークンレベルのクレジットベースラインと競合しつつ、別途の関連性学習段階を回避する。これらの結果は、方策内部の反実仮想尤度比較が、GRPOの単純さと安定性を維持しながら、応答内クレジット割り当てのための効果的な学習信号を提供することを示唆している。
視覚言語モデル(VLM)が物理的な身体を通じて行動できるかを評価することは困難である。行動の結果は、VLMの判断とモーター制御が結合したものとなる。タスクが失敗した場合、VLMが誤った選択をしたのか、単にモーター制御がそれを実行できなかったのか(例えば、バランスを崩して転倒した場合など)を区別するのは難しい。本研究では、行動決定を低レベルの実行から分離する評価フレームワークHumanCLAWを提案する。各ステップにおいて、装着された既製のVLMがアトミックスキルコマンドを発行し、そのコマンドは重力や衝突を含む現実の物理的影響を伴う、秒未満の連続的な全身動作に変換される。これにより、身体は物理世界で自由に行動できる一方で、バランスやモーターエラーといった実行側の外乱は除外される。測定可能となるのは、モデルの行動知能、すなわち身体が次に何を実行すべきかという瞬間ごとの選択である。このフレームワークに基づき、HumanCLAW-Benchを構築した。これは、41の屋内シーンにわたる1,218件の長期的かつ一人称視点の「発見・移動・操作」エピソードからなる。9つの最先端VLMをテストした結果、いずれもベンチマークを解くことはできず、最良のモデルでも成功率はわずか16.8%であった。目標物体の認識がボトルネックではない。現在のVLMに欠けているのは身体化された自己認識であり、自身の身体がどこにあるのか、目標に到達したかどうか、障害物に衝突したかどうかを把握できず、見失ってしまうのである。
テキスト空間最適化は、モデルの重みではなく外部の自然言語成果物を編集することで大規模言語モデル(LLM)を適応させる手法であり、最適化された成果物は検査可能なままで、モデルをブラックボックスとして扱うことができる。しかし、既存のテキスト空間手法のほとんどは評価を固定している。オープンエンドなタスクでは、これがボトルネックとなる可能性がある。すなわち、ソルバーがルーブリックが測定する基準を改善すると、省略された次元は最適化信号に不可視のままになる。また、現在のソルバーのスコアによって更新を選択する場合、ルーブリック自体を進化させることも信頼性が低い。なぜなら、見かけ上の進歩はルーブリックを満たしやすくすることに起因し得るからである。本稿では、DecoEvo(分離共進化、Decoupled Co-Evolution)を提案する。これは、最適化中にゴールドルーブリックを使用せず、分離された目的の下でソルバースキルとルーブリック生成スキルを共進化させる手法である。ソルバースキルは基準レベルのフィードバックを用いて更新される一方、ルーブリック生成スキルはソルバーの総合スコアから独立した、要件カバレッジと応答の識別に関する補完的な監査を通じて修正される。この分離により、生成器の更新は新たに露呈したソルバーの弱点に集中し、ソルバーが既に満たしている基準への繰り返しの強調が軽減される。各ベンチマークの公式評価において、DecoEvoは5つのベンチマークと3つのLLMバックボーンにわたって比較した全手法を上回り、5ベンチマーク平均でSkillOpt比2.8~5.0%の相対的な改善を達成した。
現実世界のタスクでは、モデルが事前学習された知識のみに頼るのではなく、タスク固有のコンテキストから学習することが求められることが多い。近年の研究ではこの能力がコンテキスト学習として注目されているが、既存の評価は主にテキストコンテキストに焦点を当てている。しかし、多くの実用的な設定では、学習すべきコンテキストはマルチモーダルである。科学的研究結果は図表で伝えられ、財務指標は変換されたレポートに散在し、空間的な判断は地図、シーン、ウェブページに依存する。我々は、マルチモーダルコンテキスト学習のベンチマークであるCLBench-Vを紹介する。これは、コンテキストの利用がどこで失敗するかを特定する難しさに対処するため、タスクを「コンテキストグラウンディング」「新情報の適用」「新知識の学習」の3次元で整理している。CLBench-Vは、既存の公開ベンチマークを変換したものと、科学、金融、長文書理解、空間推論、ウェブベースの視覚的質問応答などのドメインをカバーする新たに構築したデータセットを組み合わせている。ドメイン固有のコンテキスト学習タスクを構築するコストを削減するため、新たに構築したデータセットに対して自動構築およびフィルタリング手順をさらに用いている。3,443のインスタンスと6つの最近のマルチモーダルモデルにおいて、最高の総合スコアはわずか0.2847であり、マルチモーダルコンテキスト学習がまだ飽和状態には程遠いことを示している。さらに、InternVL3.5-30B-A3Bはコンテキストグラウンディングと新知識の学習において最も優れた性能を示し、Qwen3.5-Plusは新情報の適用において最も優れた性能を示した。さらに、評価者の信頼性、コンテキスト長、画像数、代表的な失敗事例について分析する。コードは https://github.com/IamLihua/CLBench-V で入手可能である。
長期間にわたるゲームで大規模言語モデル(LLM)を動作させるように訓練することは、汎用的な意思決定に向けた有望な一歩である。しかし、検証可能な報酬を用いた強化学習(RLVR)は、どの意思決定が成功を決定づけるかをほとんど明らかにしない、疎な最終報酬に依存している。より密なプロセス信号が、この不足したターン単位のクレジットを供給できる可能性があるが、既存の情報源は低コストかつ高精度を両立させるのが難しい。我々は、ゲームソルバーの状態値の変化が、ある行動が状態を成功に近づけるかどうかを明らかにすることに着目した。この洞察に基づき、我々はCAST(ソルバー教師からのクレジット割り当て)を提案する。これは、これらの値の変化をソルバーアドバンテージに変換し、ターン単位の信号としてRLVRに注入するものである。さらに、ソフト最適ソルバーの仮定の下では、ソルバーアドバンテージの最大化は、ソルバーからのオン政策蒸留と等価であり、教師のロジットではなくスカラー値のみを必要とすることを示す。Sokoban、Minesweeper、Rush Hourにおいて、CASTは、ドメイン内評価と未見難易度評価の両方で、すべての訓練ベースラインを上回る性能を示し、ALFWorldとWebShopでは平均ゼロショット性能で最高を達成した。我々のコードはhttps://github.com/Wloner0809/CAST で公開されている。
大規模言語モデルエージェントは、再利用可能な解決パターンを共有する、関連しているが異なるタスクに直面することが多い。しかし、標準的なエージェント強化学習はタスクを独立したエピソードとして扱い、既存のスキル学習手法は単一タスクの反復試行に焦点を当てるか、抽出、検索、実行を絡めた複数段階のパイプラインを用いる。本稿では、タスク間でスキルを学習するための統一強化学習フレームワークであるSkillRiseを紹介する。SkillRiseは関連インスタンスを段階的に難易度が上がる系列に整理し、単一のポリシーを用いてタスク解決と、進化するスキル文書(次のタスクに直接受け渡される)のキュレーションを交互に行う。タスク間での分離されたクレジット割り当てにより、現在のタスクの結果を用いた解決と、割引された下流の結果を用いたキュレーションを監督する。ALFWorld、WebShop、ScienceWorldでの実験により、SkillRiseは比較手法の中で最も高いPass@1性能を達成し、最強ベースラインに対し2.3~8.5パーセントポイントの向上を示した。異なるタスクを横断して学習されるものの、学習されたキュレーションポリシーは同一タスクの反復試行に対しても有効である。さらなる分析により、テスト時におけるタスク間でのスケーリングが明らかになった。各タスクが一度だけ試行される場合でも、関連タスクの長い系列によって性能が向上する。この傾向は、SkillRiseが同一タスクの反復サンプリングの恩恵ではなく、タスク間で転送可能なスキルを再利用していることを示唆する。さらにSkillRiseは、複数段階のスキル学習パイプラインの実行時オーバーヘッドを大幅に削減しつつ、高い性能を維持する。これらの結果は、LLMエージェントがタスク間で転送可能なスキルを抽出、洗練、再利用するための、シンプルで効率的な学習パラダイムを提供する。
以下が日本語訳です。 コーディングエージェントは、既存のコードベースを修正するソフトウェアエンジニアリングタスク(バグ修正や機能実装など)において大きな進歩を遂げてきた。しかし、スクラッチから完全なプログラムを構築することは依然として主要な課題であり、ProgramBenchで評価された最先端モデルでも、タスクの1%未満しか完全に解決できていない。その障害の一つは、ソフトウェアエンジニアリングのライフサイクル全体をカバーする、このスクラッチからの開発設定に対応したスケーラブルなトレーニング環境が不足していることである。既存の環境構築フレームワークは、ソフトウェア開発の単一フェーズのみに焦点を当てている。このギャップに対処するため、我々はMindForgeを導入する。これは、オープンソースのコマンドラインプログラムを、コンパイル済みのリファレンス実行ファイルとそのドキュメントのみを公開するソースフリー環境に変換する自動パイプラインである。MindForgeを用いて、ProgramBenchとは異なるリポジトリからトレーニング環境を構築し、教師エージェントとしてGLM-5.2を用いたプログラム合成軌跡からなる高品質なデータレシピをキュレートする。Qwen3.6-27Bをこれらの軌跡でファインチューニングした結果、ProgramBenchの平均テストパス率が37.98%から49.51%に向上し、大幅に大規模な最先端モデルに匹敵する性能を達成した。さらに、ファインチューニングされたモデルは、長期的なリポジトリ生成と翻訳、バグ修正、機能実装、クロス言語問題解決にわたる、未見の7つのソフトウェアエンジニアリングベンチマークすべてにおいて、ベースモデルを一貫して上回り、RepoZero-C2Rustで31.00ポイント、DeepSWEで14.16、NL2Repo-Bench(テスト有り/無し)で10.70/4.56、SWE-bench Verifiedで5.04、SWE-bench Proで5.93、SWE-bench Multilingualで5.22、FeatBenchで4.94の絶対的な向上を示した。
LLMベースのエージェントは、既存のコードベースが文脈を提供するソフトウェアエンジニアリングタスクでは優れているが、プログラムをゼロから構築することは根本的に難しい。ProgramBenchのような最近のベンチマークはこのギャップを定量化している。自然言語のドキュメントと実行専用のバイナリを行動オラクルとして与えられた場合、最先端のモデルでも1%未満のインスタンスしか解決できない。既存のフレームワークは、ドキュメントの読み取り、行動探索、コード合成を単一のパスに混同しており、エージェントが十分に探索できず、コンテキストのずれによって行動意図を失い、初期の誤解を最終的な実装に伝播させている。古典的な要件工学に着想を得て、我々は行動仕様の引き出しを実装に先立つ第一級のフェーズとすべきだと主張する。我々はSpecFirstを提案する。これはコード合成の前に仕様引き出しを強制する二段階フレームワークである。専用の仕様エージェントがまずバイナリを探索し、観察結果とドキュメントを組み合わせて構造化された仕様を作成する。次に、コード合成エージェントがこの仕様を使って実装を進める。この分解により、コーディング開始前にドキュメントの曖昧さが解消され、合成全体を通じて安定した行動参照が提供される。我々はSpecFirstを、2つのファミリーにまたがり能力が一桁異なる4つのモデルを用いて、ProgramBenchの全200インスタンスで評価した。SpecFirstは一貫してシングルループベースラインを上回り、テスト合格率を6.9%~21.3%、バイナリ探索カバレッジを9.4%~18.5%改善し、すべて統計的に有意である。コード合成の行動分析はさらに、事前の仕様により早期かつ持続的なコード構築が可能になることを示している。我々の結果は、明示的な要件工学フェーズがゼロからのプログラム構築に効果的なパラダイムであることを示している。
近年のゲームワールドモデルは、プレイヤーのアクションに応じて視覚的にリアルでインタラクティブな環境を生成できるようになっている。しかし、ゲームはピクセルだけで定義されるわけではない。ゲームは明確なメカニクス、すなわち体力減少、スキル発動、ゲーム終了を制御する状態依存ルールによって支配されている。これらのメカニクスは、ヒットポイント、スキルメーター、タイマーといった正確な内部状態に依存しており、それらは視覚的な観測と密接に結合し、ゲームプレイの展開を決定する。既存のゲームワールドモデルは、このような状態のダイナミクスをモデル化しない場合、視覚的にもっともらしいロールアウトを生成できるものの、背後にあるゲームルールに違反する可能性がある。本論文では、視覚コンテンツとゲーム状態を共同で予測し、メカニクスに一貫した生成を促進する、新しい状態認識型ゲームワールドモデル「StatePlay」を提案する。StatePlayは混合トランスフォーマー(MoT)スタイルのアーキテクチャを採用し、特殊化された視覚表現と状態表現を保持しつつ、クロスモーダルな相互作用を可能にし、予測された状態がフレーム生成を導く。各ブランチはさらに、そのモダリティに適した個別の目的関数で最適化される。実験により、StatePlayは状態予測において平均正規化L1距離が0.06未満を達成する。さらに、明示的な状態モデリングを行わないモデルと比較して、生成されたゲームロールアウトにおけるメカニクス忠実度が18.6%向上する。全体として、本研究は状態認識型ゲームワールドモデリングの重要性を浮き彫りにし、ピクセルレベルのリアリズムを超えて、完全でメカニクスに忠実なゲーム生成へと前進させる。
爆発的なAI進歩の予測は、AIエージェントがAI研究を自動化することに依存している。しかし、エージェントが開かれたAI研究を遂行できるかどうかについての証拠は乏しい。現在の評価手法は、検証可能な狭いタスクでエージェントをテストするもの(開かれた研究を除外する)か、AIが生成した論文を盲検査読に提出するもの(過負荷で確率的、かつ査読品質が低い)に限られる。我々は、AI研究開発の自動化に向けた進歩を測定する第三の方法を導入する。エージェントは、未発表の質の高い論文の中心的かつ開かれた研究課題に取り組み、その論文の原著者がエージェントの出力を評価する。我々はこれをシャドウ評価と呼ぶ。未発表のNeurIPS 2026投稿論文2本に対してシャドウ評価を実施し、最先端エージェントに6日間と数千ドルの計算リソースを与えた。エージェントはすべてのエンジニアリング作業を人間の助けなしで完了したが、研究課題に回答するための実質的な進展は達成できなかった。その結果、両論文とも原著者により明白に却下された。我々は5つの再発する失敗パターンを特定した:出版可能な研究の基準に関する判断力の低さ、研究デザインの欠点に対する創造性のない対応、行き詰まりからの非効率的な後退、リソース認識の低さ、指示の逸脱である。別のモデルとスキャフォールドを用いたロバスト性チェックでも、これらの失敗が再現された。我々は専門家による査読結果、調査回答、エージェントのリポジトリ、ログを公開する。本研究の結果は、今日のエージェントがAI研究のエンジニアリングを実行できる一方、研究ライフサイクルの重要な部分に苦慮しているという初期の証拠を提供する。
大規模言語モデル(LLM)エージェントは、ユーザーがタスクを完了するのを支援することがますます期待されている。しかし、既存のベンチマークでは、エージェントがオフィススイートのワークフローを妥当なコストで実行できるかどうかを評価するためのサポートは限られている。我々は、タスクレベルの経済的根拠に基づいて、長期にわたるオフィススイートタスクを評価するためのベンチマーク「OmegaUse-OfficeVal」を導入する。このベンチマークは、実務者から提案されたオフィススイートのリクエストから派生し、プライバシー保護プロセスを経て調整された100のタスクで構成されている。これらのタスクは平均して2.32時間の人間の労働時間を要する。このベンチマークの重要な特徴は、各タスクに人間の労働時間とタスク価格の代理という2つの経済的信号が対応付けられている点である。これらの信号により、人間のコストとLLMの推論コストの直接比較、および価値加重評価が可能になる。安定した評価を支援するため、詳細なルーブリックからコードベースの検証器を開発した。我々は、いくつかの最先端LLMを人間のベースラインとともに評価した。評価されたすべてのLLMは人間の作業者よりも大幅に低コストかつ高速であるが、人間レベルの納品品質にはまだ達していない。コードとデータセットは完全にオープンソース化されており、詳細はプロジェクトウェブサイト(https://omegause-officeval.github.io)で入手可能である。
**Voice Memory を提案する。これはエージェント型音声認識のための推論専用手法である。ストリーム時には、凍結された訂正器が単一のドメイン別メモリ.mdを読み込み、発話ごとに仮説に基づいて行動するか、または棄権して1-bestを保持するかを決定する。非同期には、スコアゲート型最適化器が制限付き編集を通じてそのファイルを改訂し、保留スコアを厳密に改善する場合にのみ編集を受け入れる。古典的なASR-LMフレームワークから拡張し、この分割をリスナー・シンカーアーキテクチャと呼ぶ。両者の役割はメモリのみを介して結合されるため、重み変更は一切行われず、学習されたスキルは監査可能かつ可搬性を保つ。抑制こそが、このループが発見する主要スキルであることが判明した。制約のない生成的誤り訂正(GER)は過剰訂正を引き起こし、金融ニュースでは編集の最大64%で正しいトークンを破壊する。一方、Voice Memoryはこの割合を35%に低減する。オープンな訂正器を用いた10のHyPoradiseドメインにおいて、Voice Memoryは加重単語誤り率を8.36%から7.52%に低下させ(3つのインコンテキスト例を追加すると7.47%)、どのデータセットも1-bestベースラインを下回ることはない。改善は、回復可能な余地が最も大きい領域、特に航空旅行コマンド(8.40%から3.40%)や雑音下遠距離発話(CHiME-4、12.69%から10.46%)に集中する。メモリは訂正器ファミリー間で転送可能であり、推論パスにパラメータを追加しない。今後の研究のために、デモとサンプルコードを提供する。
多くの映像編集システムは依然として明示的なレイヤー構造を持たず、現実的な合成、オブジェクトの再利用、一貫した編集操作に制約がある。この制約は特に、映像オブジェクト挿入や映像レイヤー分解のタスクにおいて顕著であり、既存手法は前景レイヤーを明示的に監督するデータが不足しているため、暗黙的な推論やシーンごとの最適化に依存している。本稿では、合成映像、背景映像、前景映像が位置合わせされた大規模三重項映像データセット「TriLayer」を提案する。前景レイヤーにはオブジェクトの外観に加えて、関連する視覚効果も含まれる。この明示的な教師情報により、モデルは暗黙的に推論するのではなく、直接的にレイヤー構造を学習できる。さらに、このデータセットを基盤として、二重ブランチ拡散モデル「DBL-Diffusion」を提案する。本フレームワークは、共有のノイズ除去処理とブランチ間相互作用により、RGB合成画像とRGBA前景レイヤーを同時にモデル化する。このフレームワークを二つのタスクに応用する。一つは「DBL-Insert」であり、レイヤー化されたオブジェクト挿入を行い、明示的なRGBAレイヤーを生成することで現実的な合成と柔軟な後編集を実現する。もう一つは「DBL-Decompose」であり、三重項教師情報を用いて前景と背景のレイヤーを復元する映像レイヤー分解である。実験により、明示的なレイヤーモデリングが挿入の忠実性と分解の品質の両方を大幅に向上させることを実証する。
本稿では、最先端LLMに対する新たなプロンプトインジェクション攻撃を発見するために訓練された自動レッドチーミングエージェント「GPT-Red」を紹介する。本モデルの目的は、本番システムの堅牢性を評価・改善することである。そのために、我々はGPT-Redを用いて、現時点でプロンプトインジェクションに対して最も堅牢なモデルであるGPT-5.6を敵対的訓練する。GPT-Redを構築するにあたり、同時に訓練される多様な防御エージェント群に対して攻撃を仕掛けるタスクをモデルに課す、スケーラブルな自己対戦アルゴリズムを設計した。我々は、最大規模の強化学習事後訓練実行と同等の計算資源を用いて、現実的なレッドチーミング環境でモデルを訓練した。これは、これまでに文書化された中で最大規模のLLM安全性訓練実行である。GPT-Redはレッドチーミングに優れており、過去のモデル(GPT-5.5まで)を確実に突破し、人間のレッドチーマーよりも多くの攻撃成功を発見し、未見の環境、防御モデル、ハーネスに対して汎化する。今後、各新世代GPTモデルの堅牢性が向上するにつれ、さらに強力なレッドチーミングエージェントのための学習シグナルが改善され、自己改善のフライホイールが回り始めるものと期待される。
メモリは大規模言語モデル(LLM)において基礎的なアーキテクチャの次元へと進化し、暗黙的な計算の副産物から、明示的で制御可能な一連のメカニズムへと移行してきた。最近の進歩は、一過性の注意、リカレント状態ダイナミクス、パラメータ効率的適応、スケーラブルなルックアップストレージなど多様な戦略を導入しているが、この急速な進化により研究分野は高度に断片化されている。本サーベイでは、LLMにおけるメモリの体系的かつアーキテクチャ中心の分類法を提示する。我々のフレームワークは、メモリを三つの直交軸に沿って特徴づける:表現(暗黙的対明示的)、更新ダイナミクス(オフライン対オンライン)、および持続性(短期対長期)。さらに、メモリへの書き込み、ルーティング、状態遷移、統合を決定する詳細なメカニズムを形式化する。この統一的な視点は、計算結合型メモリと独立してアドレス指定可能なメモリとの間の概念的な境界を解明し、異なるアーキテクチャパラダイムを効果的に橋渡しする。さらに、ハイブリッドメモリアーキテクチャ、システムレベルの効率トレードオフ、多次元評価方法論を批判的に分析する。これらの散在する進歩を一貫したフレームワークに統合することにより、本サーベイはメモリ中心のLLM設計の軌跡を明らかにし、スケーラブルで適応的な言語モデリングにおける将来の革新のための原理的な基盤を提供する。
オン方策知識蒸留は、大規模な教師モデルからコンパクトな学生モデルへ推論を転移するが、既存手法には三つの複合的な失敗モードがある。(i) 冷起動崩壊:新しい学生モデルが教師の好むトークンにほぼゼロの確率を割り当てる。(ii) 状態非依存の発散スケジューリング:時間のみに基づくforward-KL/reverse-KLの補間が学生のカバレッジ状態を無視する。(iii) 二値報酬の疎性:成功/失敗の信号が部分的に正しい軌跡からの情報を捨てる。 本稿では、それぞれに対する的を絞った修正を備えた統一フレームワークCADENCEを提案する。そのDRIFT機構は、学生がサンプリングした軌跡上で、トークンごとのforward-KLとreverse-KLの代理目的関数の凸混合をスケジュールする(トークンごとの代理、系列レベルのKL勾配推定器ではない)。六つの構成要素がそれを拡張する。(A) COVA:forward-to-reverse遷移を加速するカバレッジ適応型βスケジュール。(B) FTB:大域的正規化エントロピー参照を用いて高エントロピー位置に勾配を集中させるフォーキングトークンブースト。(C) CCD:誤っているが近い軌跡に対して数値的近接性の部分点を追加する密報酬。(D) LAP:簡潔性優先の正解ロールアウト強化学習。(E) EMR:エントロピーマッチング校正正則化器。(F) BSD:ブートストラップ自己蒸留フェーズ。 GSM8KおよびMATH-500において(修正済み512トークンプロトコル、5シード、標準偏差を報告)、CADENCEは、1.5B教師から0.5B学生への蒸留により、GSM8K pass@1で69.8±0.5%を達成(事前学習時48.7%から向上、教師との差の63.2%を埋める)、3B教師では72.1±0.4%を達成(差の76.2%を埋める)、最も強力な同一計算量のラベル使用ベースライン(DRIFT+二値報酬)を+4.4±0.7ポイント上回る。全実験は単一のApple Mac Studio(Mシリーズ、64GBユニファイドメモリ)で実行されており、原理に基づく蒸留がデータセンター規模のハードウェアなしで強力な推論品質に達することを示している。
汎用的な操作ポリシーは、大規模な事前学習済みバックボーン上に構築されたアクション・チャンキング・フローポリシーの形をとることが増えている。このようなチャンクは開ループで動作するため、実行中に得られる感覚入力に反応できず、応答性が犠牲になる。より頻繁な再計画を行えば応答性は回復するが、知覚から行動へのパイプライン(大規模バックボーンと複数のデノイジングステップ)は低速であり、このレイテンシが頻繁な再計画を妨げ、確定したアクションを古くしてしまう。そのため、このようなポリシーは動的で閉ループな制御には不向きである。本稿では、大規模バックボーン、表現力豊かなマルチモーダルポリシー、およびマルチアクション予測を維持しながら、これらのポリシーを応答性とリアルタイム性を備えたものにするπR^2を提案する。πR^2は、拡散フォーシングの位置ごとのノイズスケジュールに基づき、2つのアイデアを導入する。第一に、条件付けを高速チャネル(毎ティック更新されるプロプリオセプション)と非同期で更新される低速チャネル(視覚・言語特徴量)に分割し、古い視覚情報を許容しつつ、チャンク内でプロプリオセプションに反応できるようにする。第二に、レイテンシ適応型フロースケジュールにより、実行中のアクションをインペインティング条件として扱い、1回の呼び出しあたり1ステップのデノイジングでアクションを出力する。これにより、1つの訓練済みモデルがさまざまなハードウェアレイテンシに適応できる。πR^2は既存のアーキテクチャへの最小限の変更で済み、事前学習済みポリシーからファインチューニング可能である。実際のxArm6+XHandプラットフォーム上でGR00T-N1.7に適用したところ、基本ポリシーと比較して約4倍高速(A5000 GPU上で約25Hz)で閉ループ再計画を行い、40ミリ秒ごとに新しい観測に基づいて行動する。シミュレーションおよび実世界の操作タスクにおいて、πR^2は最強のベースラインと比較して、シミュレーションで最大23%、実世界で最大30%の成功率向上を達成した。プロジェクトページ: https://pi-r2-flow.github.io/
現代のマルチエージェント知識システムは、直接的な検索ではなく、自律的な変換の連鎖を通じて知識を蓄積する傾向が強まっている。既存の来歴研究は、実行トレース、ツール呼び出し、証拠リンクといった「何が起こったか」を記録しており、ソース信頼性の推定(真実発見、評判システム)も長年にわたり確立されている。しかし不足しているのは、主張レベルの伝達連鎖に対して、ドメイン別に段階付けられた送信者信頼性を付与し、完全性の意味論、変換タイプ別の集約、内容批判の分離、配信/レビュー/隔離ルーティングを備えた、運用可能なフレームワークである。 古典的なイスラム聖訓学(ハディース学)は、構造的に類似した問題に直面していた。すなわち、人間の伝承者の連鎖を通じて伝達された知識を受け入れるべきかどうかを判断することである。何世紀にもわたって、厳格な方法論が発展してきた。すなわち、イスナード(あらゆる主張に付随する完全な伝達連鎖)、リジャール(各伝承者の誠実性と正確性を体系的に等級付け)、最弱リンクによる連鎖評価、独立した連鎖による裏付け、そしてマトン批判(連鎖の品質とは独立に内容を評価する)である。本稿は、この方法論をAIシステム設計に応用する。 我々の貢献は、ハディース学の概念からマルチエージェントパイプラインへの形式的マッピング、主張連鎖と等級付き伝承者レジストリを実装する関係スキーマ、連鎖等級と内容批判を組み合わせた決定マトリックス、および実際の物理学の教科書から得られた20,000件の主張に対する評価である。評価では、最弱リンク隔離と独立した連鎖による裏付けを検証した。また、最も欠陥の多い伝承者を見逃した等級回復ループの部分的な失敗を報告し、フレームワークが参照用の内容批判器との一致範囲比較に到達できなかったことを含む2つの分析を結論不確定として報告する。本稿では、証拠が裏付ける主張とまだ裏付けていない主張について、一貫して明示的に述べている。
ステルスとは、自身の存在、能力、収集した情報を露呈することなく目的を達成するための技術であり、洗練されたオペレーターと検出可能なオペレーターを分ける要素である。エリートセキュリティ研究者や高度な持続的脅威(APT)は気付かれることなく目的を達成する。自律エージェントはますます同じ攻撃的タスクを引き継いでいるが、その専門技術も継承しているのだろうか?本稿では、自律型攻撃セキュリティエージェントにおける運用上のステルスを、6つの作戦安全保障(OPSEC)次元にわたって測定するベンチマークであるStealthBenchを紹介する。 実際のバグ報奨金やレッドチームの軌跡から、手作業で検証した11のOPSECインシデントを抽出し、14のDocker化タスクシナリオに拡張した。これらのシナリオでは、エージェントは実際の脆弱性を発見したにもかかわらず、標準的な運用専門技術に反するステルス失敗を犯している。具体的には、認証情報を公開アップロードに埋め込む、アクセスを証明するために本番リソースを削除する、競合状態を示すために無関係なユーザーを強制的に追加する、などである。 エージェントの軌跡を評価するために、多数決集約を用いた3モデルの大規模言語モデル(LLM)判定パネルを使用し、安全成功率(解決かつステルス)、Stealth@Solve(成功した解決における専門技術の質)、無謀解決率(解決したが露見)を測定した。結果は、どのモデルも54%の安全成功率(タスク完了とステルスの両方を要求する複合指標)を超えず、OPSECの失敗がモデルファミリー全体で系統的であることを確認した。 StealthBenchを公開ベンチマークとしてリリースし、ステルスを考慮したエージェントの開発と、自律型攻撃セキュリティ展開のための自動OPSEC監視の両方を支援する。インタラクティブなリーダーボード、評価ハーネス、データセットは https://stealthbench.com で入手可能である。
大規模言語モデル(LLM)エージェントは、ホストアーティファクトやコマンドラインインターフェース(CLI)へのアクセスを伴う実際のセキュリティ運用において採用が進んでおり、そのセキュリティ能力を徹底的に評価することが重要となっている。しかし、既存のサイバーセキュリティベンチマークは、攻撃発生前のクリーンで理想化された環境にエージェントを配置する侵害前設定に焦点を当てており、侵害後の設定は十分に探求されていない。このギャップに対処するため、我々はSecRespondを導入する。これは、侵害後のインシデント対応ワークフローにおけるLLMエージェントを評価する初のベンチマークである。侵害を受けたホストのフォレンジックディスクスナップショットと、ホストセキュリティ製品が報告したアラート、脆弱性スキャン、ベースラインチェックが与えられたとき、エージェントは侵入、ベースラインリスク、脆弱性リスクに関するフォレンジックレポートと、修復計画を作成する必要がある。このタスクを、4種類のエントリポイント、21のATT&CKテクニック、5種類のオペレーティングシステムにわたる、それぞれ異なる侵害を受けたクラウドホストから構築された10のサイバーレンジで具体化する。我々は、OpenCodeエージェントハーネス上で23の最先端LLMを評価した。実験結果から、現在のエージェントはアラートによって明らかになった問題を確実に発見できるものの、ディスクを能動的に調査してサイレント侵入を検出したり、包括的で検証済みの修復計画を作成したりすることには苦労しており、単一のレンジにおいて完全な検出と修復を達成したモデルは存在しないことが示された。これは、実世界のインシデント対応のためのエージェント構築における根本的なボトルネックを明らかにしている。ベンチマークはhttps://github.com/Alibaba-NLP/qqr/tree/main/data/secrespondで公開されている。
既存の自己回帰型ビデオ蒸留手法は、一般的に分布マッチング蒸留(DMD)に基づく多段階パイプラインを採用しています。しかし、これらの手法は初期化段階とDMD段階を分離して扱い、それぞれ異なる目標分布を追求する一方で、中間的な生徒モデルを主にVBenchなどの視覚スコアで評価する傾向があります。本論文では、この設計を分布の観点から再検討します。分布マッチング損失が持つモード探索的な性質を考慮すると、優れた初期化とは単に高品質を追求するのではなく、目標とするDMD教師のモード被覆に適合するものであるべきです。この分析のため、共有潜在空間における生徒分布と教師分布の精度と被覆率を測定する分布的評価プロトコルを導入します。この手法により、視覚スコアでは隠されていた差異が明らかになります。すなわち、一部の初期化は高い精度に達するものの被覆率が低く、最適な精緻化に至らない一方、モード被覆型の初期化はより広いサポートを保持します。さらに、目標分布が一致している場合でも、DMDの逆KL目的関数は学習後期において生徒を教師の高確率領域へと誘導し、被覆率と多様性を低下させる可能性があります。この問題に対処するため、DMDのモード探索目的関数と一致性蒸留に基づくモード被覆制約を組み合わせた、統合蒸留を提案します。実験結果は、本手法が生成品質、被覆率、多様性を改善することを示しています。特筆すべきは、Wan-1.3B DMD教師を用いた場合でも、Wan-14Bで精緻化されたベースラインを上回る性能を達成しており、自己回帰型ビデオ蒸留における分布的一致の重要性を強調しています。