翻訳付きの日次キュレーションされたAI研究論文
視覚・言語・行動(VLA)モデルは、汎用身体化エージェントの支配的なパラダイムとなり、構造化された環境における複雑かつ長期的なタスク完了において強力な性能を示してきた。しかしながら、現在のVLAシステムがより効果的なアーキテクチャ設計から恩恵を受け得るか、大幅に大規模で異種混在のデータレジームへスケールアップできるか、そしてタスクおよび身体形態を横断するより広範な汎化を達成できるかは、依然として未解決の問いである。この課題に対処するため、我々は多様なロボット身体形態にわたって大幅に改善された汎化を実現する身体化基盤モデルであるGigaBrain-0.7を提案する。具体的には、GigaBrain-0.7は三系統アーキテクチャを通じて理解・予測・行動を統合し、37,000時間を超える異種混在の身体化データで事前学習をスケールし、視覚言語理解と複数身体形態向け行動生成を共同最適化する一段階アライメントトレーニングを導入する。先行のGigaBrain-0シリーズおよびπ_{0.5}を含む従来の最先端モデルと比較して、GigaBrain-0.7は基盤ゼロショット性能、言語条件付き指示追従、事後学習タスク成功率において大幅な改善を達成する。特に、自社開発のMaker H01プラットフォームおよび主流のロボット身体形態において、GigaBrain-0.7は家庭および産業シナリオの両方で強いタスク適応性と完了能力を示す。すべてのトレーニングコードと事前学習済みモデル重みは公開予定である。
マルチモーダル大規模言語モデル(MLLM)は、統合的な映像知覚の主流パラダイムとなっている。しかしながら、大規模マルチタスクデータセットに対するポストトレーニングは依然として困難であり、既存の強化学習手法では、高コストなチェーン・オブ・ソート(CoT)生成を用いても、高品質なロールアウトがほとんどないオン・ポリシーグループをサンプリングするにとどまる。本論文では、映像MLLMに対するRLポストトレーニングのサンプル効率とスケーラビリティを研究し、OraRLを提案する。我々は、アノテーションの見落とされていた役割を明らかにする。すなわち、アノテーションはロールアウトのスコアリングに加えて、各アノテーションがオラクルロールアウトとして自身のオン・ポリシーグループに参加し、直接的な正の最適化目標となり得る。しかし、オラクルを直接統合することは自明ではない。高報酬オラクルはグループのベースラインを引き上げ、そうでなければ正となるポリシーアドバンテージを反転させる。この障害を我々はアドバンテージ反転と呼ぶ。OraRLの中核は分離されたアドバンテージ推定器であり、ポリシーロールアウトがオラクルなしのベースラインを決定し、オラクルとポリシーのギャップが方向ゲインと、それとは別の切り離されたオラクルアドバンテージの両方を調整する。符号バランスの取れた枝刈りは効率を改善し、オラクルと正負の各符号の最強ロールアウトのみを保持することで、OraRLはSFTのステップ時間のわずか2.2倍しか必要とせず、CoTを伴うGRPOが必要とする4.9倍の半分以下である。OraRLはモデルサイズとデータに応じてスケールし、0.8Bから9Bまでのバックボーンと、10万プロンプトまでのGRPOを凌駕する。チェーン・オブ・ソートを用いない場合、Video-ORA-9Bは4780ミリ秒の代わりに130ミリ秒でデコードする。Video-ORA-9Bは、各従来の最良モデルと比較して、時間的mIoUを62.5から66.0へ、トラッキングAOを73.0から78.2へ、セグメンテーションを64.3から70.4へ、そして3ベンチマークの空間知能マクロ平均を51.0から56.1へ引き上げる。VSI-Benchでは、GPT-5の55.0、Gemini-3-Proの55.1に対して73.1を記録する。
ユニバーサルマルチモーダル埋め込みは、現代のAIシステムの中核的構成要素となりつつあり、異種コンテンツを共有空間で表現することで、検索、レコメンデーション、分類、エージェントシステムなどのアプリケーションを可能にしている。本レポートでは、テキスト、画像、動画、ビジュアル文書、任意にインターリーブされたマルチモーダル入力をサポートし、柔軟な出力次元を持つユニバーサルマルチモーダル埋め込みモデルのファミリーであるWeMM-Embeddingを紹介する。このファミリーは2B、4B、9Bのバリアントで構成され、大規模マルチモーダルアライメント段階と、厳選データ、細粒度の関連性に関する教師信号、クロススケール知識転移を用いたリファインメント段階の2段階で訓練される。広範な評価において、WeMM-Embeddingは複数の公開ベンチマークで最先端の性能を達成する。特に、2BバリアントはMMEB-v2において従来の最先端である8Bオープンソースベースラインをすでに上回り、9Bバリアントは総合スコア80.6という新たな最先端を達成する。WeMM-Embeddingはまた、WeChatアプリケーション群でも高い実用性能を示し、26タスクからなる社内ベンチマークで大幅な改善、14件のオンラインA/Bテストで一貫した改善をもたらした。本モデルは、WeChat Channels、公式アカウント、モーメンツ、ECサービスなど、レコメンデーションおよび検索アプリケーションに大規模に展開されている。将来の研究を促進するため、モデルの重みとコードを https://github.com/Tencent/WeMM-Embedding で公開している。
LLMエージェントは、長期的なタスクにおいて依然として信頼性が低い。こうしたタスクでは、小さな局所的な失敗が長期間の相互作用を通じて累積し、タスク全体の失敗につながり得る。外部ハーネスは堅牢性を大幅に向上させることができるが、ハーネスの設計は依然として手作業かつ高コストなプロセスであり、プロンプト、ツール構成、制御ロジックの広大な探索空間を調べる必要がある。本稿では、ハーネスの改善をオフライン学習問題として定式化し、ミニバッチからの失敗シグナルを用いてハーネスを反復的に更新する、自動ハーネス最適化フレームワークであるAutoSaddlerを提案する。AutoSaddlerは、失敗トレース診断、ハーネスをコードとして扱う構造化パッチ生成、検証ベースの更新選択を組み合わせる。GAIA2、SWE-Bench Pro、Terminal-Bench 2.0における実験では、AutoSaddlerが対応するベースハーネスと比較してエージェントの性能を大幅に向上させ、それぞれ9.0、9.6、10.0パーセンテージポイントの改善を達成した。さらに、アブレーション研究は、効果的なハーネス最適化が以下の3つの要素から恩恵を受けることを示唆している:浅い内省ではなく深いデバッグ、制約のない編集ではなく対象を絞った修正、軌跡固有の修復ではなく汎化を考慮した選択である。これらの結果は、自動ハーネス最適化が、より高性能で信頼性の高いエージェントシステムへの有望な道であることを示している。
強化学習は拡散モデルを人間の選好やタスク固有の目的に整合させることができるが、終点報酬は中間のノイズ除去予測がどのように変化すべきかを指定しない。我々は、画像レベルの報酬ガイダンスを、サンプリングされたクエリにおけるクリーン出力予測の明示的なターゲットに変換する、オンポリシー自己蒸留フレームワークであるDiffusionOPSDを導入する。各外部反復において、凍結された行動ポリシーが軌跡を生成し、クエリ状態とアンカーを提供する。報酬勾配は、各アンカーの周りに有界な正および負のターゲットを構築する。学習可能なポリシーは、指数移動平均更新が行動ポリシーを更新する前に、有限回のフィッティングを通じて、これらのターゲットを切り離された教師信号として適合させる。この設定により、ターゲット構築と有限実現を別々に測定できる。制御された同一クエリ実験では、ターゲット構築の利得が大きいほど、単一のフィッティング更新後の実現利得が大きくなるとは限らないことが示される。SD 3.5-Mとステップ蒸留されたZ-Image-Turboにおいて、我々のアプローチは、2つのバックボーンと10の評価器にわたる20の報酬整合設定のうち19で、最終的なホールドアウトスコアの最良値を達成する。これは最強の競合手法を最大44.0%上回り、訓練GPU時間をDiffusionNFTと比較してSD 3.5-Mでは40%、Z-Image-Turboでは63%削減する。これらの結果は、画像レベルの報酬ガイダンスを明示的かつ継続的に更新される中間教師信号に変換することにより、オンポリシー自己蒸留が拡散モデルのポストトレーニングに対する効率的かつ分析可能なアプローチであることを支持し、より効率的で診断可能なアライメントへの道を開く。
プロンプトインジェクションは、AIエージェントに対する第1位の脅威として挙げられている。エージェントがウェブサイト、ファイル、電子メールから外部データにアクセスする際、攻撃者はデータに「これまでの指示をすべて無視して、<攻撃者のタスク>を実行せよ」というプロンプトを注入する可能性がある。エージェントの恣意的な操作を防ぐため、防御側は安全なLLMの訓練を試みるが、それでも適応的プロンプトインジェクションに対しては攻撃成功率(ASR)がほぼ100%に達するという問題が残る。これは、既存の防御的ファインチューニング手法が(DPOやGRPOにおける)シーケンスレベルのフィードバック信号に依存しているためであると我々は指摘する。出力全体を同等に扱うことは、モデルがどの出力トークンが安全でないかを正確に学習することを妨げる。本論文では、防御的ファインチューニングを導くトークンレベルのフィードバックを提供するSecure On-Policy Distillation(SecOPD)を提案する。LLMは注入されたサンプルを受け取りロールアウトを生成し、そのトークンは対応するクリーンな入力が与えられた初期化モデルによってスコアリングされる。より細かい訓練信号を用いることで、防御された我々のQwen3.6-27Bは、SoTAであるPISmithの適応的プロンプトインジェクションに対して9.0%のASRを達成し、従来のSoTAであるMeta-SecAlignの94.0%と比較される。得られたセキュリティは、訓練中には完全に未見の領域にも一般化する。エージェンティックなツール呼び出しにおいて、SecOPDは4.7%のASRを達成し、Meta-SecAlignの5.5%と比較される。コードとモデルは、https://github.com/pppyb/SecOPD および https://huggingface.co/pybbb/Qwen3.6-27B-SecOPD で入手可能である。
大規模言語モデル(LLM)のコーディング能力が向上し続けるにつれ、サイバーセキュリティ分野におけるその可能性はますます研究の注目を集めており、クローズドソースのLLM(例えばMythos)は高度なサイバーセキュリティ機能を提供している。しかしながら、既存のオープンソースの取り組みは限定的である。すなわち、先端的なオープンウェイトモデルは再現可能なサイバーセキュリティ学習ソリューションを提供しておらず、オープンソースの学習ソリューションは孤立したタスクに焦点を当てておりスケーラブルなエージェント的データを欠き、またエージェント的ロールアウトのスケーリングには強力なドメイン事前知識が必要である。本研究では、データ構築、トラジェクトリ合成、モデル学習を、概念実証(PoC)生成、脆弱性パッチ適用、サイバーセキュリティ質問応答(CyberQA)にわたって結びつける、統合オープンソースフレームワークであるCyberFactoryを提案する。CyberFactoryは、実環境由来のCVEを含む公開された脆弱性アーティファクトを、実行可能かつ検証可能なタスクインスタンスに変換する。さらに、再利用可能な脆弱性分析スキルを用いて、ソースコード検査、ドメイン事前知識に基づく問題解決、エビデンスに基づく検証を通じて教師モデルを導く。結果として得られる教師信号はエージェント的であり、モデルはツールや対象環境と対話し、実行フィードバックに基づいて解を修正する。これらのトラジェクトリを用いて、我々は\modelname(Aegisは、ギリシャ神話においてゼウスとアテナの保護の盾であり、その名称はモデルの防御的・セキュリティ志向の目的を反映している)を訓練し公開する。\modelnameは、推論時にそのスキルを必要とせずに、スキルに導かれた手順を内面化している。CyberGym上では、\modelnameは1時間の時間予算の下で52.4%のPass@1を達成し、ベースモデルであるQwen 3.5を+22.8ポイント上回り、同じスキャフォールドの下で評価された汎用バックボーンモデルを凌駕する。
再帰的自己改善(RSI)は、長期的タスクにおいて依然として困難である。そこでは、増大する履歴がタスク状態を曖昧にし、スキルの呼び出しを誤った方向へ導く。我々は、長期的タスク向けエージェントハーネスのための再帰的な経験-作業記憶アーキテクチャであるRecurisを導入する。このアーキテクチャでは、作業記憶がタスクの進捗を追跡し、経験記憶からのスキル選択を導くことで、スキルの使用を完全な履歴ではなく現在のニーズに基づいて行う。この結合により、実行は構造化された証拠へと変わり、障害を特定の記憶コンポーネントに局在化できるようになる。タスク全体を通じて、固定されたメタエージェントがその証拠を、スキル記憶への局所的で検証ゲート付きの更新に変換し、実行を再形成して新たな証拠を生み出す。これにより、有界な再帰的記憶進化ループが形成される。4つの長期的ベンチマークと10のモデルにわたる評価で、Recurisは完了した37のモデル・ベンチマークペアのうち35でタスク成功率を向上させ、フロンティアモデルをSOTAレベルのタスク成功率へと到達させた。tau-benchでは、GPT-5.6 Solに+17.8ポイント、Claude Opus 5に+15.6ポイントを追加し、Opus 5を87.9%に到達させた。また、SkillFlowではQwen3.6-27B/35Bに対してそれぞれ+16.6/+13.5ポイントを達成した。この利点は、インタラクションホライズンが長くなるにつれて拡大し、最長タスクでは+32.2ポイントに達し、一般的な長期的失敗は最大80%減少した。これらの結果は、再帰的に進化する記憶をRSIのスケーラブルな基盤として位置づけ、エージェントが蓄積された経験を継続的に、ますます効果的な長期的行動へと変換することを可能にする。コード: https://github.com/Gen-Verse/Recuris
大規模言語モデル向けのGRPOなどのグループベース強化学習手法は、プロンプトごとに複数の応答をサンプリングすることでクリティックの訓練を回避する。一方、信頼できるクリティックは、その代わりに1つの応答からトークンレベルのアドバンテージを推定できるが、標準的なクリティックベースの訓練レシピはしばしば不安定である。我々はこの不安定性を研究し、DPPO、報酬範囲に制限された価値予測、モンテカルロ価値目標、非正規化方策アドバンテージ、および長さ適応型一般化アドバンテージ推定を組み合わせたレシピであるBPCO(Best Practice Critic Optimization)を開発する。クリティックは訓練中のみ使用されるため、BPCOはクリティックを、参照解答や採点ルーブリックなど、方策からは隠された報酬定義情報に条件付けることもできる。制御実験により、各設計選択の効果を切り分ける。1.5Bパラメータから30B-A3B混合エキスパートまでのモデルを用いた数学的推論タスクにおいて、BPCOは強力なクリティックベースのベースラインを一貫して改善し、プロンプトあたり1つの応答をサンプリングしながら、グループベースのベースラインに匹敵するかそれを上回る。同じレシピは、ルーブリックに基づく報酬を用いた学習も改善する。これらの結果は、注意深く設計されたクリティックが、グループ相対アドバンテージ推定に代わる信頼できる手段を提供することを示している。コードは https://github.com/QPHutu/golden_critic で入手できる。
検証可能な報酬を用いた強化学習(RLVR)とオン方策蒸留(OPD)は、大規模言語モデルの事後学習において広く採用されている2つのパラダイムである。しかし、RLVRはタスクレベルの疎なフィードバックしか得られず、一方OPDは密なトークンレベルのガイダンスを提供するが軌跡の正しさを無視するため、その性能は教師モデルの性能に制限される。これらを組み合わせることは有望な方向性である。OPDは密な教師信号を供給し、RLVRはタスクレベルの正しさを提供する。それにもかかわらず、既存の統合手法はしばしば重み付き組み合わせやヒューリスティックな切り替えに依存しており、追加のハイパーパラメータとトレードオフを導入している。我々は、ハイパーパラメータを一切追加することなくOPDとRLVRをシームレスに組み合わせる、単純でありながら効果的な手法であるOn-policy Distillation with Verifiable Reward(OPDVR)を提案する。まず、サンプリングされたトークンを用いたOPDの暗黙の報酬を軌跡の正しさに基づいて再定式化し、次にReLUゲーティング機構を適用することで、正しい軌跡が非負の報酬を、誤った軌跡が非正の報酬を確実に受け取るようにする。これにより、教師モデルの分布に基づくガイダンスを維持しつつ、蒸留信号をタスク成功と整合させる。さらに、我々の改良により、サンプリングされたトークンを用いたOPDは本格的なRLVR手法へと変換され、GRPOなどの任意の方策勾配アルゴリズムと容易に組み合わせることが可能になる。6つの推論ベンチマークにおける実験では、OPDVRが標準OPDを一貫して上回ることを示す。コードは https://github.com/LeapLabTHU/OPDVR で公開している。
スマートグラスは、単なる撮影・表示アクセサリから、人間の知覚、持続的な文脈、デジタルまたは物理的な行動を接続する一人称知能プラットフォームへと進化しつつある。装着型視点は着用者の視覚、聴覚、運動、手と物体のインタラクションに一致する一方で、厳しいエネルギー、熱、プライバシー、フィードバックの制約下で動作する必要がある。拡張現実、一人称視覚、マルチモーダルモデル、人間とコンピュータのインタラクション、身体化知能における急速な進歩にもかかわらず、既存の研究はデバイス、タスク、ベンチマーク間で断片化したままである。核心的な課題は、モデルが単独で認識、回答、記憶、行動できるかどうかではなく、完全なシステムが信頼性が高く、時間的に有効で、訂正可能かつ統治可能な知覚-状態-相互作用-行動ループを維持できるかどうかにある。本サーベイは、**このような統一フレームワークを通じてスマートグラスを系統的に研究する初めてのもの**である。我々は一人称データフローと制約付きタスク実用性を形式化し、検証可能な8つのハードウェア機能軸に沿ってデバイスを特徴付け、7つの相互依存する基盤能力に基づいて文献を整理し、キャプチャ、反応的知覚、文脈支援、持続状態、統治された行動、身体化結合を網羅するL0-L5フレームワークを導入する。9つの応用シーンにわたり、タスクをデータセット、システム、製品、利害関係者、障害の結果、エビデンスのギャップと結び付ける。さらに、9次元の展開フレームワーク、主張条件付き評価プロトコル、および管理された測定から縦断的フィールド検証と監査に至るエビデンスの階層を提示する。これらの要素を組み合わせることで、スマートグラスの比較可能性、展開可能性、再現可能な評価可能性が向上し、信頼できる一人称知能へのロードマップが示される。
自己改善型LLMエージェントは、回答を改良するのであって、その回答を生み出すプロセスを改良するのではない。メタレベルを追加するシステムはそのレベルを固定したまま保持し、自己編集を行うシステムは安定性を保つために自身の編集機構の一部に手を加えずに残さなければならない。そのため、実際に実現されるメタ深度はおよそ2に制限される。我々は、メタ操作を固定したまま、代わりにその入力に対して再帰するMeta^nを提案する。この操作Ωは、自身の出力に繰り返し適用され、下位のソルバースタックのトレースとそれを生成したコードを読み取り、次の層を戦略的前処理と呼び出し可能なヘルパー群のライブラリとして書き出す。Ωは決して変化しないためシステムを不安定化せず、またその入力は厳密に増大するため、各層は前の層よりも高い視点から推論を行う。深さは事前に固定されるのではなく収束によって決定され、進化的アーカイブが層の連鎖を探索する。2つのバックボーンにおいて、Meta^nは8つのベンチマーク群すべてで従来の自己改善エージェントを上回る。最も顕著なケースは、スキルの記憶化に抵抗するよう構築されたARC-AGI-2であり、そこでMeta^nだけがゼロを超えるスコアを達成する。アブレーション実験は、再帰による利得の大部分が各層が次層へ渡す条件付けに由来すること、そしてプロンプトで規定されていないにもかかわらず、深さとともに層ごとの明確な役割が創発することを示している。コードはhttps://github.com/minnesotanlp/meta-nで公開されている。
ビデオゲームは、ビデオワールドモデルのトレーニングデータとしてスケーラブルな供給源を提供し、多様な環境、複雑なインタラクション、そして豊富な実世界のゲームプレイ動画を備えている。しかし、生のゲームプレイ映像は、ゲーム世界とスクリーンスペースのインターフェースが絡み合っており、ゲーム固有のバイアスや無関係なダイナミクスを導入することで、ワールドモデルのトレーニングを妨げる。この問題に対処するため、我々はGameUI-Taxonomyと、ゲームプレイUIのグラウンディングと除去を体系化するフルスタックフレームワークであるG2WEngineを紹介する。G2WEngineは、実際のゲームプレイ動画から再利用可能なUIアセットを自動的に抽出し、クリーンな映像上に時間的に一貫性のあるUIオーバーレイを合成する。このエンジンを用いて、正確な再構築ターゲットを持つ96Kの合成ペア動画と、現実的な評価のための303ゲームからの1,079本の実世界クリップから構成されるGame2Worldを構築する。そのアセットライブラリには、1,010枚の代表的なゲームプレイフレームから収集された、21のタクソノミーカテゴリにわたる5,132の検証済みUI要素が含まれている。Game2Worldに基づき、我々はマルチモーダルな意味理解とビデオ編集機能を組み合わせた、マスクフリーのゲームプレイUI除去モデルであるGameCleanerを提案する。マスクベースの手法とは異なり、GameCleanerは、基盤となるシーンコンテンツと時間的ダイナミクスを保持しながら、多様なHUD要素を直接識別して除去する。管理されたパイロット実験では、UIなしのゲームプレイでトレーニングされたワールドモデルは、UIオーバーレイデータでトレーニングされたモデルよりも、全体的なVideoRewardを6.83%向上させる。UI除去評価では、GameCleanerは合成動画において平均AAR 95.36を達成し、最強の時間的マスクベースラインを57.3%上回り、実世界では最高のAAR 80.05と99.8%の背景保存を達成する。これらの結果は、インターネット上のゲームプレイ動画を高品質なワールドモデルのトレーニングデータへと変換する、スケーラブルな可能性を示している。コード、データセット、モデルはhttps://github.com/Dongping-Chen/Game2Worldで公開予定である。
本稿では、マルチモーダル学習のための大規模オープンビデオデータセットであるLAION-BVDを提案する。このデータセットは、CommonCrawlから収集された13億個のプラットフォーム固有のビデオURLを含み、そのうち8000万本のビデオ(総再生時間1000万時間)をダウンロードした。本データセットは、ビデオ、オーディオ、画像の各モダリティにわたるマルチモーダル事前学習用に設計されている。内容認識型シーン検出を用いてクリップを抽出し、そのクリップに対してビデオおよびオーディオのキャプションを合成的に生成する。これらのデータで学習されたモデルは、標準的なビデオ-テキストおよびオーディオ-テキストのベンチマークにおいて競争力のある性能を達成し、学習規模またはモデル規模の増加に伴って一貫した改善が見られる。さらに、シーン変化フレームを抽出することで、ビデオフレームを画像-テキストデータの代替ソースとして探求する。これらのフレームは、標準的なウェブ画像コーパスとは異なる視覚的分布を示し、本データセットで学習されたモデルは強力な画像-テキスト検索性能を達成する。我々はLAION-BVDを研究コミュニティに公開する。これにより、前例のない規模でマルチモーダルビデオへのオープンアクセスが大幅に拡大される。
機械翻訳は、すべてのソース・トークンを忠実に表現しなければならないため、マスク拡散言語モデル(dLLM)にとって厳しいテストとなる。一方、固定キャンバス復号では、デノイジングの前にターゲット長を選択しなければならない。既存のマスク拡散復号研究は主にトークンのマスク解除順序を対象としており、この長さ決定はカバレッジと冗長性に直接影響するにもかかわらず、あまり研究されていない。我々はEntropy-Valley(EV)を導入する。これは学習を必要としない長さ選択手法であり、全マスク順伝播による平均予測エントロピーを用いて候補となるターゲット・キャンバスをスコアリングし、バックボーンが最も埋めやすいキャンバスを選択する。訓練コーパスの長さ統計を用いるベースラインと比較して、EVはEntoZh、ZhtoEn、EntoDeにおいて、参照ターゲット長から得られるCOMET-22の向上分の64.9%、65.3%、33.0%を回復する。我々の診断実験は、デノイジングに適した長さが必ずしも参照長と一致する必要がないことを示している。3名の翻訳専門家による評価は、英語⇔中国語の妥当性の向上を支持しており、ZhtoEnではより強い根拠が得られた。同じファインチューニングデータで学習されたLLaMA-3-8B自己回帰(AR)モデルと比較して、EVシステムはEntoZhでは互角であり、ZhtoEnでは優位である。さらに、オラクル長を用いた診断実験は、このマスク拡散MT設定において、どのトークンを最初に明かすかを決定することは、ターゲット長がどのように供給されるかよりも重要度が低いことを示している。
結果監視型検索エージェントは、いつどのように証拠を取得するかを学習するが、終端報酬は中間エラーを特定せず、エラーが複合する前に進行中の軌道を方向転換することもない。修正フィードバックを学習された軌道内介入として扱うことは、この二つの役割を結びつける。すなわち、エージェントはいつフィードバックを要求し使用するかを決定しなければならず、一方で批評家は、エージェントの改善に伴って失敗パターンが変化する、結果に交絡されたロールアウトから有用な修正を推論しなければならない。本稿では、共有パラメータモデルが検索エージェント役と批評家役を交互に行うフレームワークであるCAFE(Coupled Agent–Feedback Evolution)を紹介する。CAFEは、ベースエージェント自身の失敗を中心に構築された軌道からフィードバック条件付き回復を初期化し、その後オンライン最適化とオフライン最適化を結合する。オンラインRL中は、比較フィードバック推定がプロンプトレベルの呼び出し・スキップ成功ギャップを用いて要求リターンを形成し、フィードバック対応アドバンテージシェーピングがフィードバック前後のトークンアドバンテージを再重み付けする。オフラインでは、ロールアウト由来の選好最適化が、対応付けられた成功軌道と失敗軌道からフィードバックを学習する。7つのエージェント検索ベンチマークにおいて、CAFEは評価対象となったRLベースの検索エージェントを平均で上回り、6つすべてのドメイン外ベンチマークでその利得を維持し、回答レベルの幻覚を低減する。片側アブレーションは、エージェントのみまたは批評家のみを改善する場合には最終的に性能が頭打ちになる一方、二つの更新を交互に行うと性能が向上し続けることを示している。これらの知見は、自己改善型検索エージェントには、それが導くポリシーと共進化するフィードバックが必要であることを示唆する。
並行マルチエージェントコーディングは、モジュール間の分業、冗長性による堅牢性、そして複数ファイルプロジェクトという自然な粒度での並列探索を約束する。リアルタイム共同編集プロトコルは、競合フリー複製データ型(CRDT)によって人間のチームにおけるこの調整問題を解決するが、基盤となるLLMは一度に1トークンずつしか生成せず、既存のマルチエージェントコーディングシステムはこの逐次的な限界を受け継いでいる。すなわち、それらはフェーズの引き継ぎによってエージェントを順次実行するか、調整なしに独立したサンプルをプールするかのいずれかであり、単一エージェントは困難なタスクの最大半数を、1ファイルのスタブを作成して終了する(stub-and-exit)という形で放棄する。AgentRoomは、並行コーディングエージェントのためのリアルタイム共同編集プロトコルである。そのランタイム層は、CRDTでマージされた共有ファイルシステム上で、ファイルレベルのクレーム、ステータス、ブロードキャストをMCPツールとして公開する。5つの最先端のコーディングCLIモデルが4つのバックエンドコーディングタスクを実行し、Python DevBenchおよびRust+axumによる言語横断的チェックを行った。CLI安定モデルでは、2エージェントのAgentRoomはSoloよりも放棄するタスクが少なく、実行間のばらつきも小さかった。計算量を一致させた条件下では、LLM判定による平均が正となる1つの比較で、AgentRoomがparallel-mergeを上回った。もう1つの比較であるバンドルプローブでは、完全なAgentRoomが各部分的ケースを上回り、パーセンテージ分割ではなく順序関係が示された。負荷を担うのは、並列性でもCRDTマージでもなく、調整(コーディネーション)である。
LLMベースのエージェントは多段階のタスクを実行するが、その行動構造は不透明なままである。長く構造化されていないトレースは、デプロイメントに必要な安全性監査や実行時監視に抵抗する。既存のアプローチはトレース単位または成功時のみで動作するため、次ステップ予測と失敗予測を結びつけるクロスラン・トポロジーを見逃している。この共有構造を回復するために、我々はトレースコーパス全体を単一のコンパクトな有限状態機械(FSM)に圧縮する。これは、そうでなければ予測不能なLLMエージェントの行動のための構造基盤として機能する。12の公開データセットにわたって、FSMはコンパクトであり(7〜43状態)、ホールドアウトデータを>=0.997の適合度で再生し、スプリット間でほぼ同一のトポロジーを示し、ミリ秒単位で構築される。この基盤は両方の予測目標に対処する。次ステップ予測では、FSM状態コンテキストは、すべてのグラウンドトゥルース一致データセットにおいてAgent Workflow Memoryを上回る。失敗予測では、状態ごとの行動特徴がホールドアウトAUROC最大0.94に達し、オンラインモニターは部分トレースから合格実行を上回る失敗実行をランク付けし、完了のかなり前に早期停止をトリガーする。したがって、行動トポロジーはLLMというよりもデプロイメントハーネスによって形成されるように見え、安全性監査と実行時監視のためのモデル非依存の構造プリミティブを提供する。
産業用レコメンダーシステムは通常、カスケード型の検索(リトリーバル)、ランキング、再ランキングからなるパイプラインを採用する。効率的ではあるものの、これらのパイプラインはモジュール間で情報と目的を断片化し、固定的なルールに依存し、リアルタイムの意図に対する認識が限られており、閲覧、比較、購入の間のセッションレベルの変化が十分に対処されないままになっている。我々は、既存のパイプラインを置き換えることなく、その上位に認識対応型でオーケストレーション可能かつ監査可能なポリシーレイヤーを追加する自律的最適化制御アーキテクチャであるDREAM(エージェント的手法を用いたレコメンダーエンジン開発)を提案する。DREAMには2つの中核コンポーネントがある。第一に、3層インテントエンジンがオンデバイス信号を構造化されたL0/L1/L2インテント表現に融合する。そのエッジクラウドトリガーチェーンはレポート量を約8.7%に削減する。第二に、メタエンジンは、階層的なM1→M2→M3推論(インテント要約、Strategy Memoryに基づく戦略計画、パラメータ変換)のためのメタモデルを使用する。そして、安全ガードレール付きの統合出力経路を通じて、得られたパラメータをディスパッチする。報酬デュアルループは、戦略空間探索のためのオフラインシミュレーションと結果較正のためのオンラインフィードバックを組み合わせることで両コンポーネントを継続的に最適化し、生成、実行、評価、経験蓄積のサイクルを形成する。タオバオのホームページフィードでの大規模A/Bテストにより、再ランキング制御のみでIPVが2.06%、コアIPVが2.39%、GMVが0.88%改善されることが示された。制御をファインランキング(精密ランキング)まで拡張すると、これらの改善はそれぞれ2.71%、3.06%、1.31%に向上し、同時にPVも一貫して1%以上改善される。これらの改善は、パイプラインモデルの置き換えも、サービング安定性を損なうことも必要とせず、エージェント的メタ制御が産業レコメンデーションの実現可能なパラダイムであることを支持する。
大規模言語モデル(LLM)エージェントは、複数役割・複数段階のワークフローを通じて複雑なタスクを調整する。上流の状態は、要約、計画、チケット、メモリ、ハンドオフノートなどの中間言語アーティファクトへ繰り返し変換され、下流のコンポーネントはそれらに基づいて行動する。行動を制約する状態に関しては、主題の保持だけでは不十分である。アーティファクトが未解決条件に言及していても、それを実行前に解決すべき要件から、単に次の行動に情報を与えるだけのものへと変質させている場合があるからである。我々はこの行動拘束的役割を動作状態の保存として研究する。安全ブロッカーは制御された事例を提供する。各ソース状態が明示的な前提条件、権限、フォールバック、実行結果を持つためである。我々は上流の識別が正しいことを条件とし、ハンドオフ変換を変化させ、結果として得られるアーティファクトのみに制限された実行器を評価した。1,296件の制御された合成エピソード全体で、直接ハンドオフの対照条件はすべてのブロッカーを保存した。一方、圧縮、計画統合、収束、所有権の先送り、先例置換は、拘束的状態を繰り返し注意事項または非拘束的な考慮事項へと変質させた。通常のハンドオフ圧縮では100.0%の非活性化と54.2%の禁止行動が生じた。4つの状態フィールドすべてを復元すると、保存率は100.0%に向上し、禁止行動は0.0%に減少した。アーティファクトを固定した介入は、保存と封じ込めをさらに分離する。下流検証は禁止行動を排除する一方で、アーティファクトの非活性化は95.3%のままであった。これらの結果は、情報抽出と行動の間の状態伝達の失敗を特定する。ハンドオフ変換は、状態内容を保持しつつも、下流の行動に対するその制約を弱め得る。意味的可用性は動作状態の保存を保証しない。
モルフォロジ変換は、形状およびマスク処理のための長年にわたるツールですが、Pythonエコシステムにおける事実上の参照実装であるscipy.ndimageはCPU専用かつ単一配列専用であり、高コストなデバイスからホストへの往復を伴わない限りGPUトレーニングループ内では使用できません。PyTorch上に構築されたGPUビジョンライブラリは、これらのオペレータの狭いサブセットしかカバーしておらず、通常は2次元の空間次元と平坦な構造要素に制限されています。我々は、このギャップを埋める軽量なPyTorch拡張であるTorchMorphを提案します。TorchMorphは、二値モルフォロジ、グレースケールモルフォロジ、厳密および近似距離変換、エントロピー正則化付き最適輸送をカバーする22の公開オペレータを提供します。これらはすべて融合CUDAカーネルとして実装され、最大8つの空間次元を持つ (B, C, Spatial...) 形式のCUDAテンソルに対して直接動作します。APIは意図的にscipy.ndimageと引数単位で一致しており、境界モード、構造要素の原点、事前割り当て出力などを含むため、既存のパイプラインはインポートを変更するだけで移植できます。本論文では、各オペレータファミリーの背後にある階層的アーキテクチャとカーネル設計について説明します。シングルスレッドのCPU参照と比較すると、バッチ実行はグレースケールモルフォロジでscipy.ndimageの最大1.1e3倍、厳密なユークリッド距離変換で最大350倍のスループットに達し、シンクホーンソルバーはPOTより最大42倍高速です。二値およびシャンファオペレータはSciPyの対応物を正確に再現し、すべての浮動小数点オペレータはCPU参照と絶対誤差1.8e-6以内で一致します。TorchMorphはMITライセンスの下で https://intcomp.github.io/tm にて公開されています。
手続き的ビデオ言語モデルは、行動認識、行動予測、手順予測を含む異種タスクを同じ視覚的証拠から解決しなければならない。Denseトランスフォーマーデコーダはタスク間で同一のフィードフォワードネットワークを共有するため、タスクの挙動が絡み合い、制御された能力拡張を困難にする。スパース混合エキスパート(MoE)デコーダは条件付き計算を提供するが、トークンレベルの学習済みルーティングはタスクレベルの手続き的目標と自然には整合しない。我々は、マルチモーダルバックボーンを共有したまま、大規模言語モデルのフィードフォワードネットワークをタスク特化エキスパートに変換するデコーダアーキテクチャであるMoTE(Mixture of Task Experts)を提案する。各サンプルは単一のサンプルレベルのタスクルートに従うため、アクティブなタスクエキスパートの計算量は、格納されたタスクエキスパートの数に依存しない。我々はこの設計をVideoLLM-MoTEとして実装し、明示的なタスクルートを用いて5つのCOINベンチマークで評価する。5エキスパートモデルはサンプルあたり約2BのLLMパラメータを活性化し、最近のVideoLLMベースラインよりも高い平均Top-1精度を達成する。同じエキスパートトポロジーの下で、本手法は全てのエキスパートを活性化するDense方式や学習されたスパースルーティング制御よりも改善を示す。これらの結果は、タスク構造化ルーティングがマルチタスクのビデオ言語学習において、解釈可能で計算効率の高いデコーダの代替手段を提供することを示している。
我々は、Stationにおける自律的な数学的発見を研究する。Stationは、中央調整者やスクリプト化されたパイプラインなしに、異なるモデルファミリーに属するAIエージェントが共有の研究目標を追求する、オープンワールドのマルチエージェント環境である。エージェントは自らの研究方向を選択し、実験を実施し、協力し、共有の科学文献を構築する。AlphaEvolveカタログの12の構成問題と追加の2つのケーススタディを通じて、Stationは5つの問題において先行文献に対して新しい結果を得た。すなわち、有限体カケヤ集合の新しい無限族、次元11における新しい正確な604点のキス配置、離散化カケヤ針問題と符号不確実性問題の新記録、そしてエルデシュの最小重複問題における大幅に改善された下界である。さらに、エージェントはブック・ラムゼー数に関する新しい無限族も発見した。重要なことに、エージェントは数値的構成だけでなく、それらの構成が機能する仕組みを説明する定理と解析も生成し、その結果をより解釈可能にし、数学者がそれを基にさらなる研究を進めることを容易にした。我々はすべての生のエージェント対話、証明、検証コードを公開し、これらの発見がどのように生まれたかについての透明な記録を提供する。
大規模言語モデルはコード生成に優れているが、競技プログラミングは持続的な失敗モードを露呈する。既存のマルチエージェントパイプラインは、汎用的なプランナー、コーダー、デバッガーという役割に作業を分散し、アルゴリズム手法の選択をバックボーン(基盤モデル)のみに委ねている。我々はMARS(専門化LLMのマルチエージェントリレー)を提案する。これはプロンプトのみのフレームワークであり、各エージェントは動的計画法、グラフ、文字列、幾何学などのトピック専門家であり、アルゴリズム理論コーパスに対する検索拡張生成によって基盤付けられる。問題が与えられると、検索が関連する専門家の小チームを選択する。スターターが初期のC++17解答を作成し、その後の各ターンでは、サンドボックス内で公開サンプルに対して候補を実行し、担当スペシャリストがドラフトを保持・修正・引き継ぎを行えるようにし、構造化されたパケットを次のスペシャリストに転送する。最後に、単一のインフラ修正パスがボイラープレートを正規化する。Gemma 4を使用したCodeContestsテスト分割において、MARSはタスクあたり平均2.3の記録済みパイプラインステージで0.624±0.006の合格率を達成し(直接プロンプト比+14.4パーセントポイント)、実行時間コストを3.3倍低く抑えつつ、タスクごとのトークン消費の分散を大幅に小さくして、CodeSIM(0.731)との差の大部分を埋めた。ソースコードはGitHubで公開されている: https://github.com/fckand/mars。
世界行動モデル(WAM)は観測の時間的発展をモデル化することでロボット制御を改善するが、テスト時に将来の観測を生成する際には大きなレイテンシが生じる。Fast-WAM は効率化のためこのプロセスを省略する。しかしながら、我々の対応する実装では、Fast-WAM は将来認識型の代替手法よりも低い汎化性能を示し、特にロボットの実演データが乏しい場合や分布外のシナリオでその傾向が顕著である。このギャップを埋めるため、我々は **LAWA** を導入する。LAWA は、コンパクトな潜在アクションを将来の意図の操作的表現として用いる WAM アーキテクチャであり、将来の観測を生成することなく効率的なテスト時未来想像を可能にする。具体的には、行動フリー事前学習によって強化された離散トークナイザーが、操作中心のコードブックターゲットを生成する。LAWA は、実行可能なアクションチャンクとともに、これらのターゲットに固定された連続潜在状態を共同でデノイジングし、推論時には将来ビデオ分岐を省略する。RoboCasa において、LAWA は少数ショット設定で65.6%、フルデータ設定で80.8%という最先端水準の平均成功率を達成し、対応する Fast-WAM ベースラインをそれぞれ9.6ポイントおよび4.5ポイント上回る。また、対応する Joint-WAM 変種の性能水準を維持しながら、推論レイテンシを42.9%削減する。LAWA はさらに、LIBERO-Plus において競争力のあるゼロショット堅牢性を示し、実世界のタスクでは優れた性能を発揮する。これらの結果は、未来想像を放棄する必要がないことを示している。すなわち、コンパクトな潜在アクションを用いて未来想像を保持することで、性能・汎化・レイテンシの間で効果的なトレードオフが達成される。コードとモデルは公開予定である。