翻訳付きの日次キュレーションされたAI研究論文
大規模モデル学習におけるオプティマイザの選択は、計算資源、メモリ、チューニング予算、タスク多様性によって共同で制約されるシステムレベルの設計判断となっている。しかし、100以上の手法が存在する状況は断片的なままである。そこで我々は、研究コミュニティ向けの統一されたオプティマイザのサーベイおよびベンチマーククックブックであるOmniOptを提案する。OmniOptは4つの連携した構成要素に基づいている。第一に、すべてのオプティマイザの更新を5段階のメタパイプラインを通した構造化変換として捉え、ほとんどの手法がこれらの段階のうち1つまたは2つだけを使用していることを示す。第二に、ノルム制約付き線形最小化オラクル(LMO)を用いて異なるオプティマイザを統合する。第三に、これら2つの視点が二重次元の分類法を基礎付けており、一方の次元では各手法をメカニズムファミリに割り当て、もう一方の次元では改善を目指す測定可能なトレーニング目標を記録する。第四に、そして本論文の核心として、代表的なオプティマイザ、モデル規模、および言語モデルの事前学習から画像分類に至るトレーニング手法を網羅した統一的なクロスドメインベンチマークで完全な分類法を具現化し、複数の効果目標にわたって各手法ファミリを体系的に分析し、そのトレードオフを明らかにする。このようにOmniOptは、明示的なメカニズムと目標の仮定の下でオプティマイザを選択するための実用的な座標系を研究コミュニティに提供し、オプティマイザコミュニティの将来の発展の方向性を示すものである。
近年のマルチモーダル基盤モデルとエージェントシステムの進展により、GUIエージェントは単一プラットフォーム上のタスク実行からクロスプラットフォーム対話へと進化している。しかし、複数プラットフォームに対応するGUIエージェントの構築には依然として課題が残る。一方では、高品質で実行可能なクロスプラットフォーム操作軌跡が依然として不足しており、既存のデータはプラットフォーム網羅範囲が限られていることが多い。他方では、異なるプラットフォームは異なる操作慣習を示すため、共同訓練や継続訓練では行動パターンの混合、プラットフォーム固有の能力低下、破滅的忘却が生じやすい。これらの課題に対処するため、我々は高品質なクロスプラットフォームGUI操作データセットUni-GUIを構築し、さらにGUIエージェントの継続学習にマルチ教師オン方策蒸留を初めて導入する手法UI-MOPDを提案する。UI-MOPDは現在の環境に応じてプラットフォーム固有の教師を動的に選択し、プラットフォーム条件付き蒸留を通じてプラットフォーム固有の行動事前知識を共有方策に転移することで、既存プラットフォームの能力を維持しつつ新たなプラットフォームへの適応を可能にする。OSWorldとMobileWorldでの実験では、UI-MOPDはそれぞれ38.2%と12.0%のタスク成功率を達成し、クロスプラットフォームの能力保持と新プラットフォーム適応のバランスにおける有効性を示している。 プロジェクトページ: https://elispectre.github.io/UI-MOPD/
研究発表、すなわち論文をポスター、トーク動画、ブログ記事に変換する作業は、依然として手動のラストマイルである。従来の自動化は各成果物を独立して扱い、それぞれが論文をゼロから再抽出し、通常は一方向のレンダリングを出力するため、著者はPowerPointやWordで再編集できず、品質はソフトなVLM嗜好スコアに依存するが、そのスコアは頭打ちになり、負荷の高いセクションが依然として空虚に読めてしまう。我々は、このラストマイルをスキルの合成として構築するのが最善であると主張する。すなわち、上流の抽出器を共有する軽量なエージェント読み取り可能な契約であり、決定論的プリミティブを測定フィルループで包み込み、その出口は厳格な合格/不合格レンダリングゲートとする。 我々はこれをResearchStudio-Reelとして具体化する。5つのClaude CodeおよびCodexスキルから構成され、1つの共有抽出器(Paper2Assets)、3つの編集可能な生成器(Paper2Poster、Paper2Video、Paper2Blog)、および1つの対話的収束層(Paper2Reel)に整理される。Paper2Assetsは各論文を一度だけ抽出し、下流のすべてのスキルで再利用可能な共有バンドルを生成する。3つの生成器は、印刷可能なポスター、同期されたトーク動画、および事実に一貫性がありPowerPointやWordで往復編集可能なバイリンガルブログを生成する。Paper2Reelはこれら3つを自己完結型HTMLビューアに結合し、セクションレベルのクリックで動画、スライド、キャプション、ブログを一致するコンテンツにジャンプさせる。 Paper2Posterベンチマークでは、我々のポスターは、従来の自動システムおよび単発のフロンティアLLMの両方に対して、すべての美的基準および情報サブ基準で優位に立ち、2つの未見のVLM判定器による美学評価では著者自身を上回り、84%から93%の論文で総合的に勝利した。さらに、能力監査により、ナレーションに合わせたスライド上のハイライトとレイアウト認識型DOCX修復でゲートされたバイリンガルブログを独自に組み合わせることで、ResearchStudio-Reelが3つすべての編集可能な成果物を提供する唯一のパイプラインであることが示された。 プロジェクトは https://aka.ms/ResearchStudio で公開されている。
3次元再構築と生成は通常、別々のパラダイム、すなわち再構築には画素ベースの回帰、生成には潜在拡散モデルによって扱われてきた。近年の研究ではこれらを潜在空間で統合しようと試みているが、顕著な欠点がある。拡散目的関数が基礎となる3次元表現ではなく潜在特徴量に定義されていること、そして両方のブランチが潜在エンコーディングによる情報損失の影響を受け、さらに事前学習された変分オートエンコーダ(VAE)または表現オートエンコーダ(RAE)を必要とすることである。本論文では、これら二つのタスクを統一された画素空間拡散パラダイムの下で再定式化し、3次元再構築と生成を同時に扱う単一モデルPixWorldを提案する。拡散をレンダリング画像に直接適用することで、PixWorldは上記の制約を取り除き、最適化を3次元シーンの忠実性と整合させる。2次元画像レベルで動作し3次元幾何学的認識を欠く光度および知覚的監督に加えて、さらに幾何認識損失を導入する。これは、事前学習された3次元基盤モデルの幾何認識特徴空間において、レンダリングされたビューをその正解データと整合させ、3次元構造的監督を提供する。PixWorldは、従来の潜在空間生成手法を一貫して上回り、最先端の再構築手法と同等の性能を示し、統合された画素空間アプローチの優位性を実証している。
大規模言語モデルにより研究アイデア創出の敷居は低くなったが、効果的なアイデア開発には候補方向の生成以上のものが求められる。研究者は、問題を最新の文献に基づいて位置づけ、意味のあるボトルネックを特定し、既存の解決策との差別化を図り、実装に着手する前にリスクを評価しなければならない。本稿では、研究アイデア創出の最初の段階(ファーストマイル)のための再利用可能なスキル群として、ResearchStudio-Ideaを提案する。このスキル群には、マルチソースからの文献検索を独立して行うPaper-Search、新規性の主張に関する先行技術の衝突をチェックする独立型のScoop-Check、そしてエビデンスに基づく位置づけ、パターン誘導型生成、衝突検索、監査、アイデアカードのレンダリングを1つのワークフローに統合したエンドツーエンドスキルであるIdeaSparkが含まれる。IdeaSparkは、2021年から2025年にかけてICLR、ICML、NeurIPSから収集した1,947件の機械学習関連会議論文(Oral論文、別途追跡された高被引用サブセット、不採択論文を含む)のコーパスから構築されている。これらの成果物の分析により、31の反復的なアイデア創出サブパターンが明らかになり、15の再利用可能なアイデア創出パターンに集約された。各パターンは、研究コンテキスト、ボトルネックの種類、差別化戦略、裏付けとなる先行事例、および一般的な失敗モードを含む構造化カードとして運用される。IdeaSparkは、研究問題とエビデンス群が与えられると、エビデンスの準備状況を評価し、周辺の研究コンテキストを再構築し、未解決のボトルネックを特定し、関連パターンを選択し、1つの候補方向を具体化し、潜在的に対立する先行研究を検索し、成果に基づく監査を実行する。このワークフローにより、再利用可能なアイデア創出パターンがトレーサブルな研究提案へと変換される。ブラインド自動評価者による評価の結果、IdeaSparkは、スキルなしおよび汎用スキルのベースラインと比較して、競争力のある新規性を維持しつつ、一貫してより強力な研究提案を生成することが示された。
概念消去は、表現から対象概念を除去しつつ、その表現に符号化された他の情報を保持することを目的とする。これは困難である。なぜなら、表現は消去対象としばしば相関する多くの概念を符号化しており、対象を除去するとそれらを損なうリスクがあるからである。我々は多様体制約仮説(MCH)を提案する。すなわち、自然表現が構造化された低次元多様体に集中するならば、介入はその多様体に制約されるべきであり、介入中に表現に符号化された他の情報をよりよく保持できるというものである。我々はこのMCHを新たな概念消去法である多様体認識型概念消去(MANCE)に具現化する。MANCEは、対象概念を予測する分類器からの信号を用いて表現を反復的に更新する。自然入力から得られた表現を用いて多様体を推定し、その後、概念除去の更新を推定された多様体に射影する。我々は、13の言語モデル、3つのNLP概念、40のCelebA-CLIP属性を含む、テキストとビジョンにわたる119の設定で広範な評価を行う。従来手法にMANCEを適用することで、リーク結果が一貫して改善されることを示す。また、MANCE+とMANCE++を導入する。これらはMANCEの前に閉形式消去アルゴリズムを前置し、対応する全空間更新と比較してリークと精緻性のトレードオフを改善する。我々の最良手法であるMANCE++は、非線形概念消去において最先端の結果を達成する。これらの結果は、消去設定におけるMCHを支持する。すなわち、介入は自然表現多様体に制約されるべきである。
具現化ロボット基盤モデルの評価は依然として重要なボトルネックである。大規模言語モデルがデジタルベンチマークにより効率的に評価できるのとは異なり、ロボットポリシーはハードウェアや人間の監視に制約された低速でコストのかかる実機展開を必要とする。このため、代理ポリシー評価器としてのワールドモデルへの関心が高まっているが、ポリシー評価においてワールドモデルを信頼できるものにするための主要な特性は未だ十分に理解されていない。本研究では、ロボットポリシー評価のためのワールドモデルに関する体系的な研究を提示し、実機ロボットの遠隔操作データとそれに対応するポリシーロールアウトから構成されるベンチマークWMBenchを導入する。WMBenchは多様な操作タスクをカバーし、モデルファミリ、行動エンコーディング、ロールアウト期間、評価指標にわたる制御比較を可能にする。WMBenchを用いて、7つのビデオワールドモデル、4つの行動表現手法、および実機ロボットの実行と対になる32万4千以上のシミュレーションポリシーロールアウトを分析する。さらに、CVPR 2026 GigaBrain Challengeからの大規模コミュニティ投稿、厳選された合成軌道、および12,000時間を超える訓練動画を用いて分析を充実させる。実験から得られた3つの核心的な知見は以下のとおりである。評価器の品質は、短期的な視覚的リアリズムよりも、長期的で行動に忠実なロールアウトの一貫性によって決まる。事前学習の利得はデータ規模だけでなく、一般的な世界知識とロボット固有の制御可能性のバランスから生じる。行動エンコーディング、メモリ設計、評価器重視の追加学習などのアーキテクチャ上の選択が、実機ロボットの動作との整合性を強く決定する。これらの結果に基づき、実用的な設計ロードマップを導出し、それをポリシー評価に特化して最適化されたワールドモデルGigaWorld-1として具現化する。また、コード、モデル、データセット、ツールキットを完全に公開し、具現化基盤モデルのスケーラブルな評価研究を推進する。
密な空間認識は物理的知能にとって不可欠であり、視覚システムはピクセル観測から構造化された計測可能で行動可能な表現を復元することが期待される。現代の視覚基盤モデルは意味的不変性を優先する傾向があり、その代償として詳細な空間理解が損なわれることが多い。本研究では、境界と形状の不連続性が幾何学的特性を知覚するための本質的な手がかりを提供するという前提に基づき、境界中心の視点から視覚事前学習を考察する。具体的には、自己教師あり学習パラダイムであるマスク境界モデリングを提案する。これは、動的にサブピクセル境界表現を学習し、その後発見された境界を含むトークンをマスク対象として活用することで、密な視覚トークン学習を促進するものである。この枠組みをスケールすることで、我々はLingBot-Visionを開発し、その有効性をDINOv3を強力なベースラインとする多様な下流視覚タスクにおいて実証する。特筆すべきは、LingBot-Visionが深度補完のためのLingBot-Depth 1.0からLingBot-Depth 2.0への進化を促進し、それによって具現化人工知能の重要な基盤である深度推定を向上させた点である。本研究の成果は、境界モデリングが単なる線分を超え、空間的に構造化された視覚表現を学習するためのスケーラブルな事前学習原理として機能することを示している。
Wan-Streamer v0.2を紹介します。これは、ネイティブストリーミング型のエンドツーエンド音声・映像対話モデルにおいて、遅延を維持しながらアップグレードしたバージョンです。v0.2はv0.1のモデル化手法を踏襲しつつ、対話出力ストリームを192×336から640×368に引き上げ、25FPSにおいて約200ミリ秒のモデル側信号間遅延を維持しています。この高解像度ストリームにより、実時間対話中に姿勢、視線、手、近傍の物体、局所的なシーンレイアウトが明瞭に判別可能な、シーンに基づくミッドショットエージェントをサポートします。v0.2は、ユーザーに認識可能な遅延を増やすことなく、より大きな視覚ストリームに対応するため、シンカーを単一GPUの低遅延パスとして維持し、ストリーミング認識、生成キャッシュを構築する短い言語・状態Transformerパス、および最終デコードを担当します。パフォーマーは、高コストな次ユニット潜在生成のために、マルチGPUによるUlyssesスタイルのコンテキスト並列グループとなります。各パフォーマーランクは、入力されたK/Vを事前にシャーディングされたローカルキャッシュに書き込みます。長く高解像度の潜在ビデオシーケンスは、ランク間で分割されてノイズ除去され、Ulysses通信によって収集されます。一方、はるかに短いオーディオ潜在シーケンスは、シーケンスシャーディングなしで生成されます。この分割において、シンカーの言語・状態計算は、K/V条件付けとしてのみパフォーマーに到達するため、パフォーマーグループ内で別個の言語シーケンスを通信する必要はありません。これにより、コンパクトなシンカー・パフォーマー境界を維持しつつ、追加のハードウェアを視覚生成に集中させ、350ミリ秒の双方向ネットワーク予算を含めた場合、総リモートインタラクション遅延は約550ミリ秒となります。
本稿では、実ロボット上での学習済み操作ポリシーのデプロイ、データ収集、評価のためのオープンソースフレームワーク「EVA-Client」を紹介する。EVA-Clientはポリシーサーバと物理ハードウェアの間に位置し、ポリシー反復ループにおける実ロボット段階を単一のコードベースに統合する。本フレームワークは三つの貢献を行う。第一に、ロボットバックエンド、推論戦略、トランスポートミドルウェアが直交グリッドを形成するコンポーネント分離アーキテクチャである。これにより、ロボットや戦略の追加はそれぞれの層のみに影響を与える。第二に、Debug、Collect、Evalのワークフローを通じた検査可能な実行を実現し、開ループシミュレーションから連続リアルタイム制御に至るモードを備える。第三に、すべての評価実行は同時にデータ収集として機能し、完全なロールアウトを訓練準備済み形式で記録するとともに、詳細なログと並列比較ビューアを提供する。これにより、各評価が記録されない印象で終わることなく、次の訓練ラウンドに情報を提供する。さらにEVA-Clientは、主要なリアルタイム推論戦略(同期・非同期実行、ACTスタイルのテンポラルアンサンブリング、Real-Time Chunking、naive-asyncアブレーションベースライン)を単一の設定インターフェースの背後に統合する。
ロボット操作のための統一モデルは、事前学習済みVLMが持つ意味論的な事前知識と、未来予測を通じて学習される物理ダイナミクスの両方を単一のポリシーに組み込むことを目的としている。実際には、既存の設計は事前学習済みバックボーンの意味論を損ない、異種目的間での干渉を受け、ピクセル空間で未来予測をゼロから学習するため、事前学習済み動画生成モデルのダイナミクス事前知識を活用できていない。本稿ではInternVLA-A1.5を提案する。これは、VQAとサブタスク予測を継続的に学習するネイティブVLMバックボーン上にポリシーを構築し、連続行動生成のための軽量統一エキスパートを付加する。未来予測は潜在クエリ問題として再定義され、少数の学習可能な先見トークンが、凍結済みの事前学習済み動画生成モデルの監督下でタスク関連の未来をコンパクトな潜在コードに圧縮する。これにより、ポリシーはピクセルレベルの生成を学習することなく、世界モデルのダイナミクス事前知識を継承する。動画ブランチは推論時に破棄され、リアルタイム制御を維持する。1.2Mのロボットエピソードと3Mのマルチモーダルサンプルで事前学習されたInternVLA-A1.5は、6つのシミュレーションベンチマークすべてで最高の総合結果を達成する。実世界では、保持された意味論により未見の指示束縛に対して最も強力な構成的一般化を実現し、これら2つの設計により長期実行が持続される。
科学文献検索は、単一のクエリから論文を取得する以上のものを必要とすることが多い。ユーザの意図は過少指定されており、選好に依存し、インタラクションを通じて進化する。既存の検索エージェントは通常、固定パイプラインや暗黙的な言語のみの推論に依存しており、その検索戦略は制御、検査、改善が困難である。本稿では、科学的検索をワークフロー誘導として捉えるマルチターン文献検索エージェントPaperPilotを紹介する。アンカー論文とユーザクエリが与えられると、PaperPilotはキーワード検索、引用拡張、フィルタリング、スコアリング、再ランキング、証拠抽出を含む論文検索オペレータからなる実行可能なDAGを構築する。そして、ユーザフィードバックを用いてクエリとワークフロー自体の両方を洗練する。PaperPilotは、教師ありワークフロー模倣と、制御されたワークフロー破壊に対する選好最適化により学習される。実験結果によれば、マルチターンインタラクションにおいて、PaperPilot-9BはベースのQwen3.5-9Bツールセットエージェントを上回り、Hit@5は58.0から77.0、MRRは47.5から59.4、nDCG@10は26.8から32.5に改善し、ワークフロー実行エラーは9.5%から0%に減少した。これらの結果は、明示的で編集可能な検索ワークフローが、複雑な科学的意図に文献検索エージェントを適合させるための効果的かつ制御可能なインターフェースを提供することを示している。
キーバリュー(KV)キャッシュの増大は自己回帰型デコードにおける主要なボトルネックであり、メモリと帯域幅がコンテキスト長に比例して線形に増加するためである。既存のKV退避手法は、静的ヒューリスティクスやプロキシスコアに依存することが多く、これらは将来のトークンの有用性を適切に追跡できず、関連性の変化に伴って脆弱な退避を引き起こす。この問題に対処するため、我々はKVpopを提案する。KVpopは、保持か削除かの判断を直接教師あり学習することで、固定予算のKV退避ポリシーを学習する。スコアラー(評価器)は、密なアテンションマップを生成することなく効率的に計算される、新規な将来アテンションターゲットに対して訓練される。さらに、学習ベースの退避手法の中でユニークな点として、一定数ステップのスコアリングを遅延させて近い将来のコンテキストを活用する、遅延メモリベーススコアラーを導入する。AIMEおよびHMMTの数学的推論において、KVpopはQwen3-4Bで75%のKVキャッシュ圧縮時にフルアテンション性能の98%、88%圧縮時に97%を維持し、確立された退避ベースラインを一貫して上回る。Qwen3-8Bではさらに強力な結果を示し、ほぼ完全な教師性能に達する。これらの結果は、将来アテンションシグナルを用いた退避の教師あり学習が、品質を維持しながらメモリコストを削減することを示している。
マルチベクトル視覚言語検索は、最大類似度後期相互作用によって細かい粒度の視覚的証拠を保持するが、画像側の高密度トークンによりストレージとスコアリングのコストが高くなる。既存のトークン圧縮手法はこのコストを削減するものの、将来のクエリトークンが選択する必要があるオブジェクトや領域レベルの証拠を除去または潰してしまう可能性がある。本論文では、画像側のプロジェクタ後トークンをK個の代表セントロイドに圧縮しつつ、元の後期相互作用インターフェースを保持する、オブジェクト認識型トークン統合フレームワークSaMerを提案する。SaMerは学習時のみオブジェクトアノテーションを統合の事前情報として利用し、インスタンス間の混合を抑制する。推論時には正解バウンディングボックスや検出器を必要とせず、視覚・言語バックボーンを凍結して共有投影層のみを適応する。K=64において、SaMerは画像側トークンの93%以上を除去し、ColPaliのストレージを16.09倍削減しながら、Flickr30KとMSCOCOでR@1を改善する。この向上は、オブジェクト認識型統合が、刈り込みや特徴量のみのプーリングでは除去または潰され得る、クエリ選択可能なオブジェクト証拠を保持するために生じる。SaMerは圧縮ベースラインを上回り、より強力なフレーズレベルのグラウンディングを示すことから、効率的なマルチベクトル検索はトークン数の削減だけでなく、将来のクエリトークンが選択する必要のある証拠を保持することに依存することが示唆される。
拡散大規模言語モデル(dLLM)は、マスクされた系列を反復的にデノイジングすることでテキストを生成し、自己回帰モデルに対する並列的な代替手段を提供する。しかし、事後学習を通じて強力な推論を引き出すことは依然として困難である。教師ありファインチューニングはオフポリシーであり、露出バイアスに悩まされ、強化学習は疎な系列レベルの報酬しか与えず、扱いやすい系列尤度なしでは適用が難しい。オンポリシー自己蒸留(OPSD)は有望な代替手段であり、一つのモデルを学生と教師の両方として使用し、密でトークンレベルのオンポリシーな監督を提供する。しかし、その有効性は教師に特権情報(PI)を与えることに依存しており、PIは通常、推論時には利用できないインスタンス固有の正解参照であるため、学生は弱いPIなしのコンセンサスポリシーを蒸留することになり、dLLMの推論にほとんど改善をもたらさない。我々はdOPSDを導入する。dOPSDは、教師の特権を学生自身のデノイジング軌跡から直接導出し、外部ラベルではなく同じ軌跡のより後ろの、よりデコードが進んだステップを用いてマスクされた位置を評価する。これにより教師の優位性はモデル自身のデコードプロセスから生じる。DreamおよびLLaDAにおいて、dOPSDはドメイン内の数学推論とドメイン外のコード生成の両方を改善し、教師ありベースラインとオンポリシーベースラインを上回る。
本論文では、複雑な物理的相互作用によって支配される高度に動的な環境を対象とした、初のマルチプレイヤー世界モデルを提案する。シングルプレイヤー世界モデルが他のエージェントを環境の一部として扱うのに対し、本モデルは複数エージェントの行動系列に条件付けを行い、場面の変化を正しいプレイヤーに帰属させる学習と、任意の行動の組み合わせ下での一貫性の維持を実現する。我々は、高速で密結合なダイナミクスのもとでプレイヤーが競争と協力を行うゲーム「ロケットリーグ」においてこの問題を研究した。公開ボットを用いて収集した1万時間のゲームプレイデータで学習した50億パラメータの潜在拡散モデルは、単一のNVIDIA B200 GPU上で毎秒20フレームを生成し、4人プレイのマッチをリアルタイムで再現する。短いクリップでのみ学習されているにもかかわらず、そのロールアウトは学習時系列をはるかに超えて安定する。分布品質は測定した最長の5分間にわたって安定して維持され、実際には数時間にわたって崩壊の兆候なくロールアウトが継続することを確認している。我々は、ビデオコーデック、生成目的関数、マルチプレイヤー条件付け方式という中心的設計選択について体系的に調査する。さらに、モデルとデータのスケールに応じて行動がどのように変化するかを、創発する能力と残存する障害モードを含めて特徴づける。また、視覚的外観のみならず物理的理解を評価する、標的を絞った評価手法を開発する。マルチプレイヤー世界モデルに関する研究の継続を支援するため、データセット、学習・推論コードベースの全容、およびライブデモを公開する。
事前学習スケーリング則は、データと計算量の増加に伴いモデルの能力が予測可能な形で向上することを示しています。しかし、デプロイ後に実環境から学習するプロセスについては、まだ理解がはるかに進んでいません。134の実環境タスクにおける約38,000時間のエージェントと環境とのインタラクションを分析した結果、我々は、環境学習中の全体的なパフォーマンスが、驚くべき精度(R^2 = 0.998)で対数シグモイドスケーリング則に従うという、我々の知る限り初めての証拠を発見しました。また、モデル世代を超えて、エージェントの学習速度が約3ヶ月ごとに倍増することも明らかになりました。この発見は、科学発見、ソフトウェアエンジニアリング、組合せ最適化、専門知識業務、形式数学、インタラクティブゲームにわたる、超長時間の134の実世界タスクスイートであるEdgeBenchに基づいています。各タスクは、豊富で多層的なフィードバックのもとで少なくとも12時間の連続エージェント動作を維持し、多大な専門家の労力をかけて構築されています。我々は、エージェントが実世界の経験からどのように学習するかという研究を加速するために、51のタスクと評価フレームワーク全体を公開します。
我々は、フローマッチングモデルにおける数ステップ生成のためのシンプルかつ効果的なフレームワークである、知覚的フローマッチング(PFM)を提案する。従来のVAE潜在空間での速度回帰ではなく、PFMは事前学習された知覚モデルを用いて知覚的特徴空間におけるフローマッチングを教師する。この単純な変更により、フローマッチングモデルの数ステップ生成能力が大幅に向上し、サンプリングステップ数を35〜50から4〜8に削減しながら生成品質を維持する。既存の高速化や蒸留の手法とは異なり、PFMは教師モデルや補助スコアネットワークを必要とせず、最小限の修正で標準的なフローマッチング学習パイプラインに統合できる。画像生成、動画生成、画像編集タスクにおける広範な実験により、PFMは既存の蒸留ベースの手法よりもアーティファクトが少なく、一貫して高品質な結果を生み出すことを示す。さらに、知覚的教師が回帰の最小化を平均探索からモード探索へと移行させ、粗い数ステップ統合でも正確さを保つオン・マニフォールドモードへの予測の偏りを生むことを明らかにする。この結果は、標準的なフローマッチング学習が適切な表現空間で教師されることで、自然に高品質な数ステップ生成器を生み出せることを示している。この洞察が、効率的な生成モデリングのための表現認識型目的関数に関する今後の研究を促進することを期待する。
事前学習、事後学習、およびテスト時の計算のスケーリングは、LLMの能力を向上させるための中心的パラダイムとなっている。本研究では、解の正当性を判断する能力である検証を、新たなスケーリング軸として特定する。これを実現しその有効性を示すために、追加の学習を必要とせずにエージェント的タスクに対してきめ細かいフィードバックを提供する汎用検証フレームワーク「LLM-as-a-Verifier」を導入する。標準的なLM判定器がLLMに対して候補解の離散スコアを生成させるのとは異なり、LLM-as-a-Verifierはスコアリングトークンロジットの分布に対する期待値を計算し、連続スコアを生成する。この確率的定式化により、検証は複数の次元に沿ってスケーリング可能になる。(1)スコアの細粒度、(2)繰り返し評価、(3)基準の分解。特に、スコアの細粒度を拡大することで、正解と不正解の解の分離が改善され、より較正された比較が可能になることを示す。さらに、繰り返し評価と基準の分解をスケーリングすることで、分散と複雑性の低減を通じて検証精度が一貫して向上する。また、検証器の連続スコアを用いて候補の中から最適な解を選択するためのコスト効率の良いランキングアルゴリズムを導入する。LLM-as-a-Verifierは、Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)、MedAgentBench(73.3%)において最先端の性能を達成する。検証を超えて、LLM-as-a-Verifierからのきめ細かい信号は、タスクの進行状況を推定するための代理指標としても機能する。Claude Codeの拡張機能を構築し、開発者が自身のエージェントシステムを監視・改善できるようにする。最後に、LLM-as-a-Verifierが強化学習に対して密なフィードバックを提供し、ロボティクスおよび数学的推論ベンチマークにおけるSACとGRPOのサンプル効率を改善することを示す。
音声インテリジェンスは、音声と発話の理解、推論、生成を含みます。本研究では、強力なテキスト専用MoE LLMであるNemotron-Cascade-2-30B-A3Bを基盤とした、統一オーディオテキストLLMであるNemotron-Labs-Audex-30B-A3B(Audex)を紹介します。Audexは単一のTransformerデコーダによるシンプルな統一設計を採用しており、音声入力をエンコードしてテキスト埋め込み空間に投影し、テキストトークンと量子化された音声出力トークンを生成時に均等に扱います。このアーキテクチャにより、強力な音声テキスト融合、シームレスなマルチモーダル生成、そして標準的なLLMの学習・推論インフラとの互換性が実現されます。学習には、1574億の音声トークンと3205億のテキストトークンから構成される音声テキストデータセットを丹念にキュレーションしました。これらのデータセットに対して多段階の教師あり学習を適用し、その後、テキスト専用のカスケードRLとマルチドメインのオン方策蒸留を行います。Audexは、最先端の音声理解、音声認識と翻訳、テキストから音声への変換、音声生成、および音声から音声への生成を実現しつつ、そのテキスト専用LLMバックボーンが持つ非常に優れた推論、アライメント、知識、長文脈、エージェント的能力を、ほとんど、あるいは全く後退させることなく維持しています。オープンな研究を促進するため、モデルチェックポイントを公開します。
近年のビデオ拡散モデルの進歩により、時間的自己回帰による長い単視点生成、または双方向注意機構による短い多視点合成が可能になりました。しかし、動的シーンの長く多視点で一貫性のあるビデオを生成することは未解決の課題です。本研究では、逐次的に生成される視点間に4次元的な幾何学的ブリッジを導入することで、単一の拡散モデル内で時間的および視点方向の自己回帰を組み合わせるフレームワーク、MV-Forcingを提案します。我々の重要な洞察は、自己回帰的3D再構成モデルが自己回帰的に生成された視点間を自然に仲介するという点です。完了したソース視点が与えられると、その3D構造を再構成し、次のターゲット視点の幾何学的事前情報をレンダリングします。これを拡散モデルが高品質なビデオに洗練します。教師モデルの固定された時間窓を超えて生成を拡張するために、訓練中に両方の視点スロットをノイズから初期化する共同ノイズ除去方式を導入し、時間的に制限のない生成を可能にします。我々は、時空間的自己強制(Spatio-Temporal Self-Forcing)を伴う分布マッチング蒸留(Distribution Matching Distillation)によりモデルを蒸留し、時間的および視点順序的自己回帰の両方について訓練-推論の露出バイアスギャップを解消します。合成データと実世界データの両方での広範な実験により、MV-Forcingが単一の数ステップの生徒モデルを使用して、任意の長さと視点数の動的シーンの幾何学的に一貫した多視点ビデオを生成できることを示します。
LLM代理(LLM agents)日益通过外部工具自主执行操作,这带来了复杂且不断演变的安全风险。然而,现有安全测试主要针对专家设计的安全违规行为,且相应结果通过硬编码规则进行评估,随着代理的演化,这些规则的扩展成本高昂。为此,我们提出Vera——一种端到端的自动化安全测试框架,通过三阶段自增强流水线,将软件工程测试原则实例化应用于非确定性代理。首先,文献驱动的探索持续发现并结构化新兴风险,将其整理为安全风险、攻击方法和工具执行环境的分类体系。其次,跨分类维度的组合编排生成可执行的安全用例,每个用例指定明确的安全目标、程序化构建的初始状态,以及基于可观测物件的确定性验证谓词。第三,自适应执行在隔离沙箱中运行异构代理,由控制代理基于运行时观测引导多轮交互,同时基于证据的验证器依据环境状态和工具调用证据(而非模型自我报告)判断结果。我们在四个生产级代理框架(OpenClaw、Hermes、Codex、Claude Code)上评估Vera,揭示了显著的安全缺陷,多在渠道攻击下平均攻击成功率高达93.9%;我们还发布了Vera-Bench,包含1600个可执行安全用例,覆盖三种执行环境下的124个风险类别。这些结果表明,模块化、可执行的测试基础设施对于大规模、严谨且可维护的快速演进代理系统安全评估至关重要。代码已公开于 https://github.com/Yunhao-Feng/Vera。
長期的行動予測は、長期間の履歴系列に基づいてユーザの次の行動を推測することを目的とし、人工知能分野において重要な役割を果たす。大規模言語モデル(LLM)の台頭は、系列行動予測に有望な方向性をもたらしたが、LLMは長期的行動予測に取り組む際、潜在的な行動パターンの誘導やモデル固有の認知バイアスに課題を抱えている。従来のメモリ管理手法は、コンテキスト圧縮パラダイムに従い、履歴系列の負荷を軽減することでこのタスクに対処しようとしてきたが、核心的な課題を解決するには至っていない。本論文では、長期間の履歴系列を負荷から活用すべき貴重なリソースへと再定義するパラダイムシフトを提唱し、それに基づきPraMemを提案する。PraMemは長期間の履歴系列に対して事前演習を行い、経験的記憶を構築し、それを補助入力として正確な長期的行動予測を実現する。多様なタスクにわたる大規模な実験により、PraMemは従来手法よりも優れた性能を達成し、さらに詳細な分析によって経験的記憶のメカニズムと進化に関する貴重な洞察が得られた。コード: https://github.com/icip-cas/PraMem。
大規模言語モデルはますます長いコンテクストを扱うようになっており、KVキャッシュがメモリの支配的なボトルネックとなっている。そのサイズはシーケンス長に比例して増加し、デコード中は保持され続けるため、圧縮なしではGPUへの完全なキャッシュは法外に高価になる。既存のKVキャッシュ圧縮手法は、効率性と忠実なコンテクスト保存のバランスを取るのに苦慮している。トークン削除は情報を破棄し、意味的グループ化はプリフィル時に圧縮の決定を固定する。どちらも、生成中に圧縮されたスパンが関連性を持つようになった後で、トークンレベルの詳細を復元することはできない。本稿では、この問題に対する解決策としてSeKVを提案する。SeKVは解像度適応型の意味的KVキャッシュであり、コンテクストをエントロピー誘導型の意味的スパンに整理し、情報を破棄することなくGPU-CPUメモリ階層に格納する。各スパンは、GPU上に軽量なサマリーベクトル(粗いルーティング用)と、CPU上に低ランクSVD基底(オンデマンドのトークンレベル再構成用)を保持する。訓練されたズームインメカニズムは、デコード中にクエリに関連するスパンを選択的に拡大し、フルKVキャッシュをGPU上に具現化することなく精密な検索を可能にする。SeKVは、ベースとなる大規模言語モデルを完全に凍結したまま、0.05%未満の学習可能パラメータを追加するだけで、適応的なトークンレベル再構成を実現する。4つのベンチマークにおいて、SeKVは最強の意味的圧縮ベースラインを平均5.9%上回り、128KコンテクストにおいてフルKVキャッシュと比較してGPUメモリを53.3%削減する。コードはhttps://github.com/AmirAbaskohi/SeKVで公開されている。
物体の動力学の予測(すなわち世界モデリング)は、ロボット操作における基本的な課題であり、特に変形可能物体のモデリングは、その高次元な状態空間と複雑な材料特性のために極めて困難なケースとなっています。現在の世界モデルは、2次元ピクセル空間上でのダイナミクス学習か、より明示的な3次元幾何空間上でのダイナミクス学習という、2つの異なるパラダイムでこの問題に取り組んでいます。しかし、多様で大規模な実世界データが不足しているため、これらのパラダイムの相対的な強みと限界に関する体系的な理解は依然として困難です。 この問題に対処するために、我々はDeform360を提案します。これは、日常生活で使用される198個の物体、1,980のインタラクションシーケンス、41台の全方位カメラと両手触覚グリッパーによる215時間以上の観測データを含む大規模な視覚触覚データセットであり、全体的な動きと接触に起因する局所的な変形の両方を捉えます。新規のマーカーレス視覚触覚3Dトラッキングパイプラインを活用して高密度な幾何形状と動きを抽出し、現在の最先端世界モデルを体系的に評価し、2Dビデオモデルと3D粒子モデルを比較します。最後に、変形可能物体に対するロボット計画タスクを実行することで、我々のデータセットの実世界での適用可能性を示す予備的な実証を提供します。 我々の分析は、構造的先行知識とスケーラビリティの間のトレードオフに関する重要な洞察を明らかにし、一般化可能な変形可能物体中心の世界モデリングにおける将来の研究のための堅固なベンチマークを提供します。プロジェクトウェブサイト: https://deform360.lhy.xyz
リポジトリレベルの脆弱性再現は、ソフトウェア工学(SE)における高度なタスクである。エージェントはコードベースを調査し、脆弱なパスに到達する入力の文法を推測し、概念実証(PoC)を構築し、修正版ビルドでクラッシュが消失することを検証しなければならない。最近のLLMエージェントは、アプローチが正しければこうしたステップを実行できることが多いが、戦略の選択を誤ることで失敗するケースが依然として存在する。本論文は、SEエージェントにとって、完全な行動の軌跡ではなく戦略こそが適切な学習単位であると主張する。すなわち、戦略は最適化に十分コンパクトであり、実行を導くのに十分具体的であり、試行を超えて保存・再利用するのに十分安定している。本稿では、転移可能な戦略学習とタスク固有の経験を分離する二重ループフレームワークMastermindを提案する。学習可能なプランナーは、SFTとマイルストンベースのGRPOを通じて再利用可能な脆弱性再現戦略を学習し、経験ループはタスクローカルな戦略記録を保持してその後の試行を導く。プランナーは実行器とは独立に訓練されるため、実行器のアクション生成能力を変更することなく、複数の固定された実行器に対して戦略学習を改善できる。我々はMastermindを、260の訓練タスクと200の未学習評価タスクを用いてCyberGym上で評価した。固定実行器としてGPT-5.5を用いた場合、Mastermindは84.5%の成功率を達成し、オープンブックPoCコンテキスト(60.0%)、Best-of-8サンプリング(63.0%)、反復改善(77.0%)を上回った。同一のプランナーは、GPT-5.4 miniとGLM-5.1においても、それぞれ45.0%と58.5%から60.0%と71.0%へと改善した。これらの結果は、高レベルの戦略を学習することが、リポジトリ規模のSEエージェントを改善するための効果的かつ転移可能なメカニズムであることを示している。
縦断的臨床診療において、すべての胸部X線画像は患者の過去の検査の文脈で読影され、放射線科医が伝える情報の多くは受診間の変化に関するものである。我々の知る限り、この縦断的な過去から現在への遷移を明示的に考慮した、事前学習済み胸部X線レポート生成器のための初の学習不要なBest-of-Nサンプリング手法を提案する。これを遷移認識型Best-of-Nサンプリングと呼ぶ。各レポートは文に分割され、R^d上の非順序集合に埋め込まれる。各(過去、現在)ペアは、二つの集合間の変化を符号化するように設計された集合間距離を介して固定次元の方向ベクトルに縮約される。そして、候補は、その候補遷移ベクトルと、キャッシュされた正解訓練遷移ベクトルのバンクとのコサイン距離によってスコアリングされ、最小値またはkNNとして集約される。本フレームワークを、4つの方向性集合距離(平均シフト、新規性残差、方向付きハウスドルフアンカー、コスト加重最適輸送)で具体化し、複数回訪問のAP-PAコホートで評価し、3つの視覚言語生成器に対して3つのプロンプトで推論を実行した。遷移認識型Best-of-Nサンプリングは、全般的にランダム選択を上回り、特にImpressionセクションで最大の相対的な改善が見られた。
近年、LLM推論サービスはクライアントからのリクエストをグローバルに分散されたエンジンレプリカにプロキシするようになっている。負荷分散ポリシーは、レイテンシやTTFTなどの指標を最適化する際に、KVキャッシュの局所性、レプリカの負荷、変動するネットワークレイテンシなどの要因を総合的に考慮する必要がある。しかし、既存のシステムはそのコストモデルでこれらの要因の一部しか評価しておらず、レプリカ間で負荷とKVキャッシュが不均一に集中する原因となっている。我々はGORGOを提案する。これは、調整可能なパラメータを用いてネットワークレイテンシ、プリフィルコスト、およびキューイング遅延を総合的に考慮するプロキシアーキテクチャである。LMSYS-Chat1MやWildChat-4.8Mのようなオープンソースのチャットデータセットは長文脈で高いプレフィックス再利用のデータを欠いているため、我々は長文脈のプロダクションメタデータから合成データセットART-Chat-2.5Mを公開する。ART-Chat-2.5Mのチューニングウィンドウにおいて、進化戦略によりGORGOポリシーのパラメータを導き、p95 TTFTを直接最適化する。保留された評価ウィンドウでは、チューニングで学習したパラメータ値を固定し、単純なセッションアフィニティやプレフィックスキャッシュなどのベースライン負荷分散ポリシーと比較して、p95 TTFTを6.9~15.5%、p95エンドツーエンド(E2E)レイテンシを14.3~30.9%改善する。コードとART-Chat-2.5Mデータセットはhttps://github.com/Arcadia-Research-Team/GORGOで入手できる。
統一マルチモーダルモデル(UMM)は、テキストと画像が混在した推論能力において有望な成果を示しているが、強化学習(RL)を用いてこのようなマルチターン生成を効果的に最適化することは依然として未解決の課題である。既存の手法ではRLをテキストステップにのみ適用し、画像生成は教師ありの代理タスクに委ねているため、ポリシー勾配が異種モダリティ間の全インタリーブ軌道に伝播しない。これにより、UMMにおけるRLの可能性はほとんど活用されていない。本論文では、マルチターンのテキスト-画像-テキスト推論を統一マルコフ決定過程(MDP)として捉えるシンプルなフレームワークBRAID(Bridging inteRleAved multI-modal reasoning as a unified Decision process)を導入する。これにより、単一の原理に基づくRL目的関数を通じて、テキスト生成と画像生成の統合的最適化が可能となる。BRAIDは共有の軌道レベルのアドバンテージを計算し、それをテキストトークンと画像デノイジングパスの両方に一貫して伝播させる。それぞれのモダリティ固有のポリシー勾配メカニズムによって最適化される。さらに、長期的なクレジット割り当てに対処するため、BRAIDは視覚言語モデル(VLM)判定器を採用し、各中間画像の推論有用性をスコアリングすることで、重要な視覚分岐において学習を強化する密なターンレベルのフィードバックを提供する。空間推論と視覚知覚のベンチマーク実験により、BRAIDは様々なベースラインを一貫して上回り、視覚的思考のガイダンスを備えた統一MDPの定式化が効果的なマルチモーダル推論に不可欠であることが確認された。
私たちは、EXIST 2026 への AI Wizards チームの投稿として、ミームにおけるマルチモーダルな性差別識別について発表します。このタスクは、難易度が順に高くなる3つのサブタスクで構成されています。それらを、経験的アノテーター分布に対する条件付きソフトラベル予測として階層的にモデル化します。本システムは、固定の Gemini Embedding 2 視覚言語表現を、KLダイバージェンスと等分散不確実性重み付けで学習した軽量なゲート付きMLPを通してマッピングします。公式の Soft-Soft リーダーボードにおいて、Task 2.3 で1位、Task 2.1 および Task 2.2 で4位を獲得しました。コードは https://github.com/NLP-AI-Wizards/EXIST-2026 で公開されています。
視覚言語行動(VLA)モデルは大規模な事前学習を通じて広範な身体的能力を獲得するが、その汎化性能はLLMやVLMと比較してはるかに脆弱なままである。一般的な対策として、教師ありファインチューニングや強化学習による事後学習はタスク固有の性能を向上させるが、事前学習の価値を生み出す汎用的能力を狭めてしまう。我々は重要なボトルネックを特定する:VLAの失敗は行動生成だけでなく行動評価にも起因する。診断的pass@k研究により、凍結されたVLAがその出力分布にすでに有能な行動を含んでいることが確認され、全体の成功率はpass@1で33%からpass@32で92%に上昇する。この知見に着想を得て、我々はSVA(Search, Value, Act)を提案する。これは凍結されたVLAポリシーに長期的な結果認識を付与するシンプルなフレームワークである。SVAはまずシミュレーション内でモンテカルロ木探索を用いてVLAの出力分布を完全に探索し、経験的なリターンで注釈付けされた多様な軌跡を収集する。この知識は次に、候補行動の期待される結果を予測する軽量なQ値モデルに蒸留される。展開時には、凍結されたVLAが複数の候補を提案し、評価器が最も不確実性調整済みQ値の高いものを選択する。これにはシミュレータへのアクセスは不要である。行動提案と結果評価を分離することで、SVAはVLAバックボーンの汎化能力を維持しつつ、タスク成功率を大幅に向上させる。身体性ベンチマークを横断した実験により、SVAが未見のタスクに対する汎化性能を一貫して向上させ、強力なテスト時スケーリング動作を示すことが明らかになった。注目すべきことに、SVAは9BパラメータのVLAが27BパラメータのVLAを7ポイント上回り、推論レイテンシを27%低減することを可能にする。これはモデルサイズを拡大するよりもテスト時評価をスケーリングする方が費用対効果が高いことを示唆している。
音声に基づくうつ病検出は、短い音声セグメントから特徴を圧縮して1つの話者レベルの判断にまとめる。このステップは時間的集約(temporal aggregation)と呼ばれ、単体での研究はほとんど行われていない。ほとんどのベンチマークは、単一の自己教師ありエンコーダと単一の手動で選択された層を固定しているため、報告された性能向上は集約手法そのものではなくパイプライン全体を反映している可能性がある。我々はDEPOOLを提案する。これは、英語と中国語(マンダリン)のうつ病コーパスにおいて、6つの集約アーキテクチャと6つの凍結された音声バックボーンを比較する統制されたベンチマークである。各構成は、手動で固定するのではなく、どのバックボーン層が重要かを学習する。結果として得られた72の構成からなるグリッド全体で、3分の1の構成がすべての話者に対して単一のクラスを予測する状態に陥っている。この問題は手法と同様にバックボーンにも起因しており、単一のシードでの実行で最も安定していたアーキテクチャも、シードを変えて訓練を繰り返すと信頼性が低下する。臨床音声における時間的集約のベンチマーク基準としては、単一パイプラインの平均精度ではなく、バックボーンとシードに対するロバスト性を最重要基準とすべきである。
制御可能な3次元医用画像生成モデルは、指定された臨床属性を持つボリュームを合成できるが、そのためには高い忠実度、本来の3次元性、そして要求された条件への忠実性を同時に満たすサンプルが必要となる。本論文では、胸部CT(コンピュータ断層撮影)のための潜在拡散モデルであるCONFLUXを提案する。3次元変分オートエンコーダが各ボリュームを圧縮し、整流フロートランスフォーマーが潜在空間で生成を行う。生成は、適応型層正規化を通じて構造化された放射線学的メタデータ(18種類の異常所見、性別、年齢、再構成カーネル)に条件付けられる。本モデルは、強力なボリュームベースライン(MAISIの74.6に対してFID 32.3)を達成し、臨床属性の直接的な制御を可能にする。この制御を強化するため、オンライン強化学習による事後学習段階(グループ相対ポリシー最適化)を追加し、生成された各ボリュームから分類器が要求された所見をどれだけ確実に復元できるかを報酬とする。別の独立した分類器による評価では、事後学習により実スキャンの信頼性に対する不足分の47%が解消された。本モデルと、幅広い臨床所見にわたる条件付けメタデータを備えた約20万件の合成胸部CTデータセットを公開する。
SynCity 3000を提案する。これは、全体として一貫性を持ちながら、きめ細かいレイアウト制御を可能にする3Dシーン生成フレームワークである。現在の画像から3Dへの生成器が単一画像から複雑な3Dアセットを生成できる能力を基盤とし、この生成器を畳み込み演算子として適用可能に適応させることで、その能力をシーン全体の規模に拡張する。これは、モデルを新たな合成データエンジンによって生成されたシーン状データでファインチューニングすることで実現する。このデータエンジンは、トレーニング用の3Dシーンデータの不足に対処するために提案する。次に、畳み込み生成器を、ユーザープロンプトから生成されたシーン全体の二軸測投影画像に適用し、任意のサイズと複雑さを持つ3Dシーンを生成する。多様なプロンプトとレイアウトにわたって、SynCity 3000は大規模で一貫性があり、かつ詳細なシーンを生成し、従来の3Dシーン生成手法の欠点に対処する。
音と味覚の間のクロスモーダル対応は心理学や神経科学では確立されているが、コンテンツベースのマルチメディア検索ではほとんど用いられていない。本研究では、音声から味覚を予測するタスクを、知覚的に検証されたマルチソースコーパスを用いたコンテンツベースの音楽情報検索ベンチマークとして形式化する。4つのHEARファミリーに属する10種類の凍結オーディオエンコーダを、共有マルチタスク回帰ヘッドの下で比較し、ゲート付き後期融合を設定可能なバリアントとして導入する。モデルの有効性を評価するため、絶対誤差と順位相関係数を算出する。最も性能の高いシステムは、5つの味覚をマクロRMSE 0.134以内で予測し、未見の実音楽データでは、単一評価者のコンセンサスからの乖離の半分未満の誤差(RMSE 0.13 vs. 0.28)を示した。すなわち、モデルは平均的な人間の評価者よりもグループコンセンサスに密接に追従し、従来の最先端ベースライン(0.219)を大きく下回る。絶対誤差に関しては、エンコーダ間に統計的に有意な差はなく、単一のVGGishが最良の融合と同等の性能を示すが、ゲート付き後期融合の優位性は順位相関係数に限定される(マクロPearson r 0.724 vs. 0.666)。コンテンツベースの検索指標として運用すると、予測された味覚空間は、偶然レベルの性能にとどまるCLAPテキストベースラインよりもはるかに忠実に309アイテムのプールをランク付けする。リッジプローブとオーディオ帯域除去ノックアウトにより、文献上の音と味覚の対応関係に対して最も強い表現が読み取られる。
決定時計画において、行動条件付き世界モデルを用いた手法は、具現化制御の一般的なパラダイムとなっている。しかし、標準的な計画コストは、予測された終端状態が目標にどれだけ近いかだけを評価し、中間遷移の実現可能性は検証されない。そのため、予測軌道がもっともらしく見えても、環境ロールアウトがそこから乖離することがあり得る。本論文では、ACIDという決定時計画フレームワークを提案する。これは、循環行動整合性(cycle action consistency)を導入したものである。すなわち、逆力学モデルによって予測遷移から逆向きに推論された行動が、元々条件付けられた行動を復元可能であることを要請する。このステップごとの残差を、スケール不変の適応的重みによって計画コストに組み込む。剛体操作、柔軟物操作、関節制御、視覚ナビゲーションにわたる4つの行動条件付き世界モデルと6つのタスクにおいて、ACIDは一貫して計画性能を向上させ、ベースラインと同等の精度を大幅に少ない計画計算量で達成した。
商業および産業用途においてロボットが確実に動作するためには、近年のエージェント的コーディングシステムの進歩が、解釈可能なロボットプログラミングとモデルフリーポリシーのオープンワールド適応性を組み合わせることは可能だろうか? 我々は「バリエーショナルオートメーション」(VA)に焦点を当てる。これは、固定自動化と比較して物体の形状や姿勢のバリエーションが大きいタスクのクラスである。モデルフリーポリシーは、商業・産業用途で持続的かつ確実に実行されなければならないVAタスクの信頼性ギャップを埋めるのに困難を伴うことが多い。Task and Motion Planning (TAMP) および Robot Operating System (ROS) に関する先行研究に動機づけられ、我々は Graph-as-Policy (GaP) を導入する。これは、モジュール型オープンロボットスキルライブラリ (MORSL) から知覚、計画、制御ノードを持つ有向計算グラフを生成するマルチエージェントコーディングハーネスである。GaPは次に、異なるグラフを持つタスクインスタンスを並行してリハーサルする内部シミュレーション環境を生成し、グラフ構造とパラメータを反復的に洗練して成功率とスループットを向上させる。8つの新しいオープンVAタスクベンチマーク(4つはシミュレーション内、4つは実世界)を用いた評価により、GaPはベースラインを大幅に上回る成功率を達成できることが示唆される。詳細、コード、データはオンラインで入手可能:https://graph-robots.github.io/gap
教師なし音節トークン化は、生の音声から潜在的な言語内容に関連する構造を捉える離散的な音節トークンを学習することを目的としている。近年の音節トークン化手法では、事前学習済みHuBERTの教師-生徒蒸留を利用し、潜在的な音声フレーム表現を音節セグメントに整理する。しかし、発話レベルの交差エントロピー目的関数で学習すると、モデルは言語内容ではなく話者識別を予測するため、音節トークンの純度が損なわれる。この問題に対処するため、固定長チャンク内で話者に摂動を加えた生徒表現をクリーンな教師ターゲットに回帰する、話者非絡み合い音節トークン化器を提案する。実験結果は、提案手法が音節境界検出と音節セグメントクラスタリングにおいて最先端の性能を達成することを示している。さらに、提案する音節トークンで学習した音声言語モデルは、音素レベルのSpiRit-LMと比較して、統語的・意味的理解において7%の相対的な改善を達成する。
半教師ありセマンティックセグメンテーション(SSSS)は長年にわたり、いかなる擬似ラベルを信頼するかという一つの問いに直面し、より慎重な信頼度フィルタリングによってそれに答えてきた。ファンデーションバックボーンはこの状況を一変させる。DINOv2教師を用いれば、厳格な閾値でも測定上98%のクリーンな擬似ラベルセットが保持されるため、精度を左右するのはフィルタではなく、クラスごとに埋め込み空間がどのように構造化されるかにかかっている。本稿では、クリーンポジティブなピクセルコントラスト学習フレームワークPixConを提案する。PixConはクラスごとのメモリバンクを維持し、生徒がすでに正しく分類できているラベル付きピクセルのみを許容する。これにより、従来のコントラスト学習を用いたSSSSのバンク(ReCo、U²PL)が信頼度フィルタリング済みの擬似ラベルから構築されていたのに対し、PixConでは構造上、無汚染のポジティブセット(ρ_F=0)を保証する。この手法はコンシステンシーバックボーン上の単一ブランチであり、推論時のパラメータを追加せず、バンク固有の閾値も必要としない。教師ありInfoNCE勾配の一次解析により、なぜ汚染が有害であるかが説明できる。その偽陽性項はρ_F/(1-ρ_F)の割合でスケールし、これを我々は仮定するのではなく実測している(Pascalでは0.018、ADE20Kでは0.106)。Pascal VOC、Cityscapes、ADE20Kにおいて、PixConは強力なDINOv2ベースのUniMatch V2ベースラインと計算量を一致させたワンスイッチプロトコルで同等かそれ以上の性能を示す。すべてのPascal 1/8シードで改善が見られ(シードあたり約+0.2 mIoU)、3シード平均は87.90に達し、公表されているUniMatch V2-Bの数値と同じである。ファンデーションモデル教師のもとでは汚染がすでにまれであるため、我々の分析は、ρ_F=0の保証は主に教師が弱体化した場合のロバスト性として機能し、精度向上はよりクリーンなポジティブ監督からもたらされることを示している。これにより、クリーンポジティブコントラスト学習は、ファンデーションモデルを用いたSSSSにおいてロバストで低コストなデフォルト手法となる。
大型ハドロン衝突型加速器のような高スループットの科学施設は、帯域幅、レイテンシ、ストレージに関する厳しい制約の下で、リアルタイムのイベントフィルタリング(トリガー)に依存しています。実際には、トリガーメニューは主に静的で手動調整されており、検出器状態、パイルアップ、背景構成が時間とともに変動するにつれて、最適でなくなる可能性があります。我々はオンライン閾値チューニングを逐次意思決定問題として捉えます。すなわち、強化学習エージェントが最近のレートと信号に敏感な特徴量のストリーミング要約を入力として取り込み、目標背景レートを許容帯内に追跡しながら信号効率を最大化するようにトリガー閾値を更新します。我々はグループフィルタリング政策最適化(GFPO)をストリーミング制御に適応させ、訓練中に背景レートの実現可能性を強制する2つの変種(GFPO-F、GFPO-FR)を導入します。現実的な衝突器動作を模擬したベンチマークにおいて、我々は2つの代表的なトリガーを研究します。すなわち、パイルアップ変動に敏感な全横エネルギー(H_T)トリガーと、希少または非標準的なシグネチャに対する再構成損失に基づく異常検出(AD)トリガーです。モンテカルロストリームにおいて、本エージェントは許容範囲内の時間間隔の割合を48%(H_T)および28%(AD)向上させ、これらの許容範囲内区間における信号効率で最大2%の累積利得を達成します。シミュレーションから実衝突データ(CMSラン283408)への転用において、同一エージェントはファインチューニングなしで、ベースラインに対して56%(H_T)および28%(AD)の許容範囲内改善を達成し、両トリガーでさらなる信号効率の利得も得られます。我々の知る限り、これは実Large Hadron Collider衝突データにおけるRLベースのトリガー制御の初の実証です。コードはhttps://github.com/Zixind/GFPO_LHCで入手可能です(詳細はリポジトリ参照)。