翻訳付きの日次キュレーションされたAI研究論文
スキルはソフトウェアエージェントにとって有用な抽象概念であり、人間やエージェントの経験を再利用可能な手続き的知識へと変換する。しかし、既存のスキルライブラリはほとんどが手動で作成され、テキスト中心か、エージェントのトレースから導出されたものであり、チュートリアル動画やその他のマルチモーダルな人的リソースはほとんど活用されていない。本稿では、チュートリアル動画、リポジトリ、記事、参考成果物といったマルチモーダルリソースを、ソフトウェアエージェント向けの実行可能スキルに抽出するフレームワークRESOURCE2SKILLを提案する。RESOURCE2SKILLは、これらのスキルを階層的なマルチモーダルスキルWikiとして整理する。各エントリは、構造化テキスト、コード、視覚的例、メタデータ、来歴を組み合わせたものである。この設計により、異なるリソースからの相補的な信号、すなわち動画が捉える時間的操作や視覚効果、コードが捉える実行可能なツールパターン、記事や成果物が提供する概念的・スタイル的基盤が保持される。推論時には、エージェントがWikiから関連スキルを取得し構成する。カバレッジが不十分な場合には、同じ構築オペレータがオンラインで新しいスキルを獲得する。7つの実用的なオーサリングドメインにおいて、RESOURCE2SKILLはスキルなしエージェントと比較して平均総合スコアを11.9パーセントポイント向上させ、28の主要集計モデル・ドメインセルのうち26で強力なハーネスベースラインを上回った。アブレーション実験により、マルチモーダルなスキル形式、階層的構成、ソース多様性、選択戦略、オンライン獲得の有効性が確認された。
グラフ検索拡張生成(GraphRAG)は大規模言語モデルに構造化知識を付与するが、既存システムは単一抽出パスで知識グラフを構築するため、ノイズの多いエンティティと脆弱な検索を生み出す。オープンソースのモジュラー型GraphRAGエンジンであるRAGUは、抽出と統合を分離することでこの問題に対処する。エンティティと関係は二段階の型付き抽出、DBSCANによる重複除去、LLMによる要約、Leidenコミュニティ検出を経る。重要な洞察がコンパクトな抽出器を動機付けている。パイプライン内のLLMに必要なスキル(理解、抽出、文脈上の推論)は言語スキルであり、事実に関する世界知識とは異なり、モデルサイズに応じて弱くしか成長しない。これに基づき、言語スキルに最適化された7BパラメータモデルMeno-Lite-0.1を訓練し、知識グラフ構築においてQwen2.5-32Bを上回り(調和平均で相対12.5%向上)、英語のGraphRAGタスクでは同等の性能を達成した。GraphRAG-Bench(医療)において、RAGUはあらゆる事実レベルで最も完全なコンテキストを検索し(エビデンス再現率最大0.84対0.76以下)、合成タスクではHippoRAG2を凌駕する。マルチホップ事実QAでは、HippoRAG2の見かけ上の優位性は主に回答形式のアーティファクトであることが示される。RAGUはpip install graph_raguでインストール可能であり、単一GPUで動作し、MITライセンスで公開されている。ソースコードはhttps://github.com/RaguTeam/RAGUで、Meno-Lite-0.1モデルはhttps://huggingface.co/bond005/meno-lite-0.1で入手できる。
本稿では、これまでで最も強力なループ型TransformerであるLoopieを発表します。Loopieシリーズは2つのMixture-of-Experts(MoE)モデルから構成され、20Bパラメータ(アクティブパラメータ2B)のモデルと6Bパラメータ(アクティブパラメータ0.6B)のモデルがあります。ループ型Transformerは長年、ある課題に直面してきました。すなわち、事前学習の計算量がN倍増加した場合、通常はパラメータ数をN倍に増やす方が、モデルをN回ループさせるよりも優れた性能を発揮するというものです。Loopieはこの課題を解決します。標準的な30B-A3Bモデルとの比較を含む広範なアブレーション研究により、Loopieは同じ計算予算で学習された標準的なTransformerベースラインを大幅に上回ることが示されました。新規のポストトレーニングパイプラインにより、Loopieは強力な推論能力を獲得します。2025年の国際数学オリンピック(IMO)および国際物理オリンピック(IPhO)では、Loopieはツールを使用せずに金メダル級の性能を達成しました。
以下は日本語訳です。 我々は、Xiaomi-Robotics-1を提案する。これは基盤的な視覚・言語・動作モデルであり、(1)多様な言語指示に従い、未見の環境で幅広いモバイル操作タスクを即座に実行でき、(2)最小限の微調整データで新規の下流タスクに効率的に適応可能である。我々は、事前学習と事後学習からなる2段階の訓練手法を提案する。事前学習では、UMIデバイスにより収集された10万時間以上に及ぶ実世界の操作軌跡データを用いて訓練し、広範かつ汎用的な行動生成能力をモデルに付与する。重要な点として、我々はスケーラブルな自動ラベリングパイプラインを開発し、シーンの状態遷移を記述した自然言語で軌跡クリップに注釈を付与することで、行動学習のための豊富かつ正確な条件付けを提供する。事後学習では、これらの能力をロボットの身体性や、人間がロボットを促すために自然に使用する命令文と整合させることを目指す。大規模な実験により、強いスケーリング特性が示された。Xiaomi-Robotics-1は、事前学習においてデータ規模とモデルサイズの増加に伴い一貫して性能が向上する。このスケーリング特性は事後学習にも直接的に転移し、より強力な事前学習モデルが未見環境での即時的な実ロボット性能の向上をもたらす。さらに、Xiaomi-Robotics-1は強力なロボット基盤方針として機能し、複雑で器用なタスクに対しても高いデータ効率で効率的に微調整できる。複数のシミュレーションベンチマークにおいて、Xiaomi-Robotics-1は最先端手法を凌駕する。特筆すべきは、RoboCasa365において成功率57.6%で新たな最先端記録を達成し、従来の最良値46.6%を上回ったことである。さらに、RoboDojoでは平均スコア20.07を獲得し、従来の最先端値13.07を大きく上回った。コードとモデルチェックポイントは公開予定である。プロジェクトページ: https://robotics.xiaomi.com/xiaomi-robotics-1.html
Hyper-Connections(HC)は、Transformerの残差ストリームをN本の並列ストリームに拡張し、モデルの幅や深さを超えたメモリスケーリングの形態を提供する。多様体制約付きHC(mHC)は、この定式化を大規模でも安定させる。N=1からN=4への大きな性能向上は、残差ストリームの拡張が有望なスケーリング軸であることを示唆している。しかし、既存のHCファミリーの手法は通常、N=4で止まる。本実験ではその理由を明らかにする。すなわち、これを超えてmHCをスケーリングすると、性能向上は減少し、学習コストは急速に増加する。この限界は、二つのボトルネックに起因する。一つは、拡大するストリーム数に対する書き戻し情報の不足であり、もう一つは、コストがNの三乗で増加する残差混合の生成である。これらのボトルネックに対処するため、我々はxHC(Expanded Hyper-Connections)を提案する。これは、N=4を超える有意義な拡張を初めて実現するHCファミリーの手法である。xHCは、よりリッチな書き戻しを実現する時間的特徴拡張と、N=16のストリームのうちk=4のみを更新しつつ、完全な残差状態への密なアクセスを保持するスパース残差ストリームアーキテクチャを組み合わせる。18Bおよび28BのMoEモデルにおいて、xHCは強力で一貫した下流タスクの改善をもたらす。18B MoEモデルでは、xHCはmHCと比較して平均下流スコアを4.0ポイント向上させ、バニラベースラインに対する訓練FLOPsの増加はわずかである。スケーリング則実験では、同じ損失に達するためにバニラとmHCはそれぞれxHCの1.50倍および1.19倍の計算量を必要とする。実用的な大規模N訓練では、拡張された残差状態からのメモリトラフィックの制御も必要である。そこで我々はxHC-Flashを導入する。これは、サブレイヤあたりのメモリトラフィックを73.5Cから40Cに削減し、N=4のmHCが必要とする34Cと同等にしつつ、完全なxHCの利点を維持する。xHCとxHC-Flashは、大規模Nの残差ストリーム拡張をLLM事前学習において効果的かつ実用的にする。
ヘルスケアは、高いリスクを伴うコミュニケーション、専門家による推論、ワークフローの実行にわたる分野であるにもかかわらず、これらのユースケースをまとめてカバーする専門的な大規模言語モデル(LLM)は依然として限られている。ヘルスケアモデルは、患者との診察、テキストと画像にわたる臨床推論、対話型診断、電子健康記録(EHR)ツールの使用を処理できなければならない。これらの能力はそれぞれ異なる形で失敗し、あるタスクに対する狭い改善が別のタスクの性能を低下させる可能性がある。本稿では、人間がゲート制御する自己進化ループ(human-gated self-evolution loop)を通じて訓練された、ヘルスケア特化型LLMであるCura 1Tを提案する。進化の各ラウンドでは、訓練エージェントが目標とする能力を計画し、モデルを訓練し、ベンチマークのパフォーマンス軌跡を評価し、観察された失敗からデータ混合を洗練させる。このデータ中心のループにより、単一の汎用医療データ更新ではなく、ターゲットを絞った合成データおよび厳選データの例を通じてモデルが改善される。ヘルスケア評価スイート全体において、Cura 1Tは最先端のベースラインモデル群の中でトップまたはトップに近い評価を達成しつつ、ドメイン外の推論およびエージェントベンチマークにおいても競争力を維持している。
オンポリシー蒸留は、強化学習における代替のポストトレーニング手法であり、教師モデルからのトークンレベルの指導を提供することで報酬モデルによって課される制約を緩和する。オンポリシー蒸留はさまざまな設定で研究・応用されてきたが、その基本的な設計はまだ十分に探求されていない。本論文では、教師の出力分布を直接模倣する代わりに、デルタ信号と呼ばれる新たな蒸留報酬を導入する。デルタ信号は、推論能力のための指示チューニング前の教師モデルとそのベースモデルとの差分として定義される。したがって、これは推論チューニングによって生じた変化を捉え、推論能力を転移するためのより直接的な信号を提供する。広範な実証的証拠を用いて、デルタ信号がオンポリシー蒸留を大幅に改善することを示し、この新しい蒸留法をオンポリシーデルタ蒸留(OPD^2)と呼ぶ。数学、科学、コード推論のベンチマークにわたる実験は、OPD^2が従来のオンポリシー蒸留を一貫して上回り、推論LLMが短期間のポストトレーニングで強力な性能を達成することを可能にすることを示している。コードはhttps://github.com/naver-ai/opd2で公開される予定である。
大規模言語モデル(LLM)は、レコメンダーシステムを、過去の行動における共起パターンのマッチングから、その行動を駆動する意図の推論へと変革している。RecGPT-V1は、ユーザー理解を中心に据えることで淘宝(タオバオ)上でこのパラダイムを開拓し、RecGPT-V2はマルチエージェント推論の協調によりそれを拡大した。いずれも本番環境にデプロイされ、ユーザー体験と商業指標の一貫した改善を達成している。しかし、RecGPTを大規模に運用する中で、次の3つの課題が明らかになった。(1)ステートレスな行動モデリング:各リクエストが過去の履歴全体を再処理するため、計算リソースを浪費し、過去の分析結果が破棄される。(2)タグからアイテムへの情報ボトルネック:自然言語タグが、ユーザー理解とアイテム具体化の間に損失のあるチャネルを形成する。(3)非効率な明示的推論:長大な思考連鎖(Chain-of-Thought)が、許容困難なレイテンシと計算オーバーヘッドを引き起こす。 本稿では、オープンワールドの知識には自然言語を、具体的なアイテムの具体化にはセマンティックID(SID)を用いて推論する、ステートフルでハイブリッドモーダルなレコメンダーであるRecGPT-V3を提案する。メモリハブは、構造化され継続的に進化するユーザーメモリを維持し、長期的な行動を凝縮された単位に蒸留することで、ユーザーモデリングの計算量を55.8%削減する。ハイブリッドモーダル基盤モデルは、LLMがテキストタグとSIDを共同で推論できるようにし、アイテム空間への高帯域チャネルを開放する。潜在意図推論は、冗長な根拠説明をコンパクトで学習可能な潜在トークンに内面化し、それを可読な説明にデコード可能にすることで、出力トークンコストを200倍削減する。淘宝の「おすすめ」フィードにデプロイされたRecGPT-V3は、大規模オンラインA/Bテストにおいて一貫した改善を達成した。IPV +1.28%、CTR +1.00%、TC +1.97%、GMV +3.97%、同時にエンドツーエンドのサービングリソース消費を52.4%削減した。
コードレビューはコード統合前にソフトウェア品質を維持するのに役立つが、人間のレビュアーに多大な作業負荷を課す。生成人工知能がソフトウェア開発の一部となるにつれて、コードレビューは主に人間が行うプロセスから、大規模言語モデル(LLM)レビュアーやAIエージェントレビュアーが人間レビュアーと共に参加するAI支援レビュープロセスへと移行しつつある。しかしながら、この移行がレビュー効率やレビュー品質にどのような影響を与えるかについての実証的証拠は依然として不足している。 本論文では、三つのコードレビュー時代(人間中心レビュー、LLM支援レビュー、エージェント型コードレビュー)を経て変遷する207のGitHubプロジェクトから収集した102万件のレビュー済みプルリクエストを分析する。我々は三つのAIレビュアー導入手法(段階的AI導入、急激なLLM導入、急激なAIエージェント導入)を特定する。さらに、プルリクエストのレビュー議論をレビュアー間の相互作用シーケンスとしてモデル化し、レビュープロセスにおいて人間、LLM、AIエージェントのレビュアーがどのように協力するかを特徴づける。 結果によると、エージェントが関与する協業パターン、特にAIエージェントによって開始されるレビューや複数のAIエージェントが関与するレビューは、段階的AI導入および急激なAIエージェント導入においてより迅速なレビュー決定と関連している。しかしながら、これらの効率向上はレビュー品質の改善にはつながらない。また、レビュー活動量とプルリクエストの種類はどの時代でも重要な要素であり続ける一方、LLMレビュアーやAIエージェントレビュアーが参加すると、人間とAIの協業パターンがレビュー効率の最も強い説明要因となることが明らかになった。これらの知見は、レビュー品質を損なうことなく効率を向上させるAI支援コードレビュープロセスの設計に実証的な指針を提供する。
強化学習(RL)は、複雑な推論タスクにおける大規模言語モデル(LLM)の性能向上において中心的な役割を果たしている。しかし、RLによる事後学習は、それに先立つ事前学習とは切り離して研究されることが大半である。その結果、次の二つの基本的な問いが未解決のまま残されている。(1)事前学習の選択(モデルサイズ、データ)はRLの計算資源へのリターンをどのように形成するのか、(2)RLはモデルに実際に何をもたらすのか。これらの問いは、標準的なLLMの設定では研究が困難である。事前学習のコーパスは膨大かつ統制が効かず、行動を事前学習とRLのどちらに帰すべきか判断しにくく、両段階にわたる体系的な計算資源のスイープは実行不可能なほど高コストだからである。これらの課題に取り組むため、本研究ではチェスを、事前学習から事後学習に至る全パイプラインにおける推論研究のための制御されたテストベッドとして用いる。標準的なLLM訓練パイプラインに従い、人間のチェスの棋譜を用いて5Mから1Bパラメータの言語モデルを事前学習し、合成された推論トレースで教師ありファインチューニング(SFT)を施し、検証可能な報酬を伴うチェスパズルでRLを実行する。この枠組みを用いて、以下の知見を得た。特定のRL計算量レベルにおけるRL後の性能は事前学習損失からよく予測でき、RLの報酬曲線の傾きは事前学習トークン数にほぼ比例して向上する。スケーリングを超えて、RLは単にSFT方針を研ぎ澄ますだけではない。簡単なパズルでは、SFT方針が既に好んでいた正しい手を増幅する一方、難しいパズルでは、SFTのもとではほぼ存在しなかった正しい手を表面化させる。さらに、これらの知見がチェス以外にも転移するかを検証するため、数学領域のテキストで1B言語モデルを訓練したところ、同じ予測パターンが現れた。すなわち、より長く事前学習されたチェックポイントはRL後の性能が高く、RL下での改善も速い。まとめると、本研究は事前学習とRLのインターフェースを定量的に説明し、事前学習から事後学習に至る全パイプラインにおける推論の科学的探求のための制御されたテストベッドを提供する。
本レポートでは、高い音楽性と忠実度を備え、完全なボーカル歌唱を含む楽曲を生成可能な強力な音楽生成モデル、Qwen-Musicを紹介します。Qwen-Musicは2つのコアタスクをサポートします。テキストから音楽を生成する「Text to Music Generation」は、テキスト記述、歌詞、音楽的属性から全く新しい楽曲を生成します。また、「Cover Song Generation」は、既存の楽曲を異なるスタイルやボーカル特性で再解釈します。アーキテクチャとして、Qwen-Musicは3つのコアコンポーネント(Qwen-Music-Tokenizer、Qwen-Music-LLM、Qwen-Music-Render)を統合しています。Qwen-Music-Tokenizerはオーディオを25Hzの単一コードブックストリームであるMusic Semantic Tokensに圧縮し、LLM予測のためのセマンティックおよびメロディ情報を保持します。これらのトークンに基づき、Qwen-Music-LLMは自己回帰的な音楽セマンティックモデリングを実行します。主要な新規性は、メロディトークンベースのChain-of-Thought(Melody-CoT)メカニズムであり、楽曲全体の生成前にメロディを計画することで、創造性、音楽性、構造的一貫性、および参照オーディオベースのメロディクローニングを向上させます。離散セマンティックトークンの忠実度の限界を克服するため、Qwen-Music-Renderは生成的ステレオレンダリングを実行し、音響的詳細を豊かにし、高忠実度のステレオ波形を生成します。最後に、Qwen-Music-LLMを数百の言語をカバーする500万時間以上の多言語音楽データで学習します。まず品質認識型の事前学習カリキュラムを適用し、次に段階的事後学習(教師あり初期化、オフラインDPO、オンラインGSPOから構成)を用いて、音楽性と指示追従能力をさらに向上させます。600の中国語と英語のプロンプトにおいて、Qwen-Musicは16の客観的な音楽性および音質評価指標のうち13で最先端の結果を達成しました。専門評価者も、主要なプロプライエタリシステムよりもQwen-Musicを好みます。カバーソング生成において、Qwen-Musicは主要なプロプライエタリシステムよりも正確に参照メロディを保持します。
モデル・ハーネス共進化の枠組みにおいて、ハーネスは単なる推論時のスキャフォールドではなく、その実行トレースが将来の基盤モデルを形成しうるデータ生成コンポーネントである。このことは、即時的なエージェント性能と将来のモデル訓練に用いるトレースの品質の両方に対してハーネスを最適化する、ハーネス・イン・ザ・ループ学習の重要性を動機づける。しかし、プロバイダが構築したスキャフォールドを継続的に更新することは、コストと労力を要する。そこで我々は、ユーザが構築したハーネスをタスク特化型で最適化することが、計算的に軽量で少数の更新反復のみを要しつつ、実行トレースの品質を向上させ得るかどうかを検討する。この目的のために、我々は再帰的ハーネス自己改善(RHI)を導入する。RHIはハーネスをエージェントループのプロンプトレベルの仕様として表現し、自身の改訂履歴に対するペアワイズフィードバックを用いてそれを反復的に洗練する。量的金融、ロボティクス、医薬品にわたる30の合成機械学習研究タスクにおいて、わずか数回のRHI反復で、低推論労力エージェントの性能上限を大幅に引き上げ、対応する最大推論労力設定を上回りつつ、推論コストを最大60%削減できることを示す。これらの利得は主に、より長い推論トレースではなく、エージェント間の情報フローをより効果的にする改良されたタスク特化型コンテキスト管理に起因することを明らかにする。最後に、この振る舞いをRHIの暗黙的な最適化目的に関する情報理論的仮説として形式化し、RHIをモデル・ハーネス共進化のパラダイムにおける継続学習の実用的アルゴリズムとして提案する。
Muonは大規模事前学習においてAdamWと競合しますが、強化学習(RL)後訓練におけるその価値は依然として不明瞭です。我々は、Qwen2.5-0.5B-Instructを用いたALFWorldにおいて、AdamWとの単一種子比較により、疎報酬エージェント型RLにおけるバニラMuonを研究します。グループ内グループ方策最適化(GiGPO)において、Muonを隠れ重み行列にのみ適用すると、最終ウィンドウの検証成功率が0.290から0.546へと上昇します(+88%)。高学習率のAdamW制御では、更新後の成功率はゼロのままです。この効果はアドバンテージ推定器と学習率に依存します。3e-5では、MuonはGRPOを0.161から0.268へ改善する一方、GraphGPOの後期ウィンドウの差は飽和に近づくにつれて縮小します。1e-5では、GraphGPO Muonは0.901に達し、正規化された検証AUCを0.399から0.556に引き上げ、成功率0.5および0.75にそれぞれ30回および60回早い更新で到達します。これらの探索的結果は、Muonがエージェント型RLに利益をもたらす可能性を示し、方策最適化器、アドバンテージ推定器、学習率を統合的に研究する動機を与えます。複数種子およびタスク横断の検証は未解決のままです。
本稿では、科学理解・予測・生成のための統一的なマルチモーダル推論モデル「S1-Omni」を提案する。AI for Science(AI4S)は、ドメイン特化型モデルやツール拡張型大規模言語モデル、科学用言語モデルの発展により大きく進歩してきた。しかし、各モデルの能力は依然として高度に断片化されており、異種データや科学法則、専門家知識の統合的モデリングに限界がある。S1-Omniは、これらの能力を単一の一貫した科学推論モデルに統合することで、この課題に取り組む。S1-Omniのアーキテクチャは、科学データの統一表現、自然世界の知識アライメント、ドメイン固有タスクのためのデコードという3つの中核要素から成る。第一に、S1-Omniは自然言語による指示と、CIF、SMILES、タンパク質配列、スペクトル、科学画像を含む科学オブジェクトを、共有表現空間にマッピングする。第二に、科学法則と専門家知識をデータ構築とトレーニングに組み込み、モデルが科学的根拠に基づいて推論できるようにする。第三に、タスク固有のデコードを実行し、物性予測、スペクトルから分子への生成、タンパク質部位・構造予測、科学画像の生成・編集など、幅広いアプリケーションをサポートする。S1-Omniは、200の科学タスクをカバーし数百万の推論サンプルを含むS1-Omni-Corpusでトレーニングされ、60以上の科学ベンチマークで評価された。その結果、ほとんどのベンチマークでGPT-5.5やGemini-3.1-Proを上回り、いくつかのベンチマークではドメイン特化型モデルと同等かそれを上回る性能を達成した。全体として、S1-Omniは統一的な科学モデリングへの実用的な道筋を提供する。
検証可能な報酬を用いた強化学習(RLVR)では、一般的にアドバンテージの形成にエントロピーが使用される。しかし、エントロピーは有用な不確実性と有害な混乱を区別できないため、正しさのシグナルとしての有効性が制限される。本稿では、参照ガイド付き生成分布とバニラ生成分布の間のトークンレベルの対照的不一致を正しさを考慮したアドバンテージ形成に用いる、対照的方策最適化(CPO)を提案する。理論的および実証的結果の両方から、この不一致がトークンレベルの正しさを確実に示すことが示される。さらに、オン方策蒸留はCPOの特別なケースであり、その場合の事後分布は外部の教師モデルによって具体化されることを示す。CPOはまた、ゼロアドバンテージ問題を解決する。ドメイン内およびドメイン外のベンチマーク実験により、CPOがエントロピーベースのRLVR手法を大幅に上回る性能を示し、かつ強力な汎化性能を維持することが実証された。さらなる分析から、正しい応答と誤った応答はそれぞれ探索と活用を自然に促進し、両者のバランスが最良のパフォーマンスにつながることが明らかになった。
ビデオ生成モデルは一般に、3D変分オートエンコーダ(3D-VAE)によって学習された潜在空間に依存している。しかし、従来の3D-VAEは主にピクセルレベルの再構成に最適化されており、その潜在表現が捉える意味的・時空間的な構造に限界がある。一方、V-JEPA 2やVideoMAEv2などの映像基盤モデル(VFM)は強力な映像理解能力を示すが、それらの凍結表現をコンパクトで再構成可能かつ生成に適した映像潜在表現へと変換できるかどうかは、ほとんど未解明のままである。本稿では、この問いにVideoRAEで答える。VideoRAEは、凍結された映像基盤エンコーダからのマルチスケール階層的特徴を活用し、軽量な1次元自己注意プロジェクタで圧縮する表現オートエンコーダである。VideoRAEは、拡散トランスフォーマー(DiT)向けの連続潜在表現と、マルチコードブック高次元量子化による自己回帰モデル(AR)向けの離散トークンの両方をサポートする。復号時には、凍結VFM教師モデルとの局所・大域表現アライメント目的関数により意味的保存性が向上し、KL正則化なしでの学習を可能にする。実験では、VideoRAEが連続・離散の両方の設定で高い再構成性能を達成する。UCF-101では、AR生成器およびDiT生成器を用いて、クラスからビデオへの生成FVD(gFVD)でそれぞれ40と93という最先端の値を達成し、競合するオートエンコーダベースラインと比較して約5倍の高速収束を実現する。制御された2B規模のテキストからビデオへの生成研究では、LTX-VAEをVideoRAEに置き換えることで、同等の設定下でより速い収束が得られた。これらの結果は、凍結VFM表現が多用途で生成に適した映像潜在表現であることを実証している。モデルとコードは https://zhxie0117.github.io/VideoRAE で公開予定である。
データ理解と意思決定において強力な能力を持つ一方で、自律的なデータサイエンスエージェントは依然として高コストな計算を伴う試行錯誤のワークフローに大きく依存している。このボトルネックが、実際の実行前にデータサイエンス操作の効果を予測できるモデルの動機となっている。本論文では、データサイエンスワールドモデルの概念を紹介する。これは、現在のワークフロー状態と候補操作に基づいて環境状態遷移を予測することで、データサイエンス実行環境をモデル化するものである。さらに、構造化状態構築、コスト考慮ルーティング、軽量な実際の実行、および高コスト操作のためのLLMベースのシミュレータを組み合わせた実用的フレームワークDSWorldを提案する。訓練を支援するため、8K規模の遷移軌跡データセットを構築し、遷移予測を改善するためのエラーを考慮した強化学習戦略であるリフレクティブワールドモデル最適化を導入する。実験により、DSWorldは競争力のある性能を維持しつつ、RLベースのエージェント訓練を約14倍、探索ベースの推論を約3~6倍高速化し、遷移予測タスクにおいて最強のLLMベースラインを35.6%上回ることが示された。コードは https://anonymous.4open.science/r/DSWorld で入手可能である。
訓練不要のコンテキスト内セグメンテーションは、推論時に単一の注釈付き参照画像から新たな物体カテゴリを導入することを可能にし、クラス増分学習における再訓練やメモリオーバーヘッドを排除する。近年のアプローチでは、意味対応のための視覚基盤モデルと、SAMのようなプロンプト可能なセグメンテーションネットワークを組み合わせることでこれを実現している。しかし、その性能は本質的に画像間類似度マップの品質に制約される。参照画像とクエリ画像の間で共有される文脈的背景が、非対象領域の類似度を系統的に高め、プロンプトの位置特定を劣化させる。本稿では、これらの偽の文脈的対応を明示的に抑制する訓練不要フレームワークREBASEを提案する。提案手法は、参照画像から低ランク背景特徴部分空間を特定し、参照特徴とクエリ特徴をその直交補空間へ閉形式で投影することで、よりクリーンな意味対応を実現する。その後、類似度重み付き最遠点サンプリングを用いて正の点プロンプトを生成し、洗練された密な類似度事前分布と組み合わせる。一切の訓練やパラメータ更新を行わずに、本手法はPACO-Part、FSS-1000、およびISIC2018などのクロスドメインデータセットにおいて、訓練不要手法の中で新たな最先端を確立する。これは、明示的な背景部分空間除去がワンショット位置特定に対して極めて効果的な原理であることを示している。
私たちは、音声、画像、長時間の動画を統合的に理解・推論するための、完全オープンな最先端音声視覚大規模言語モデル(AV-LLM)であるAudio-Visual Flamingo(AV-Flamingo)を提案する。従来のAV-LLMが主に短いクリップに焦点を当てていたのに対し、AV-Flamingoは複雑な実世界の(音声・視覚)動画を長時間にわたって理解・推論できるよう設計されている。これを実現するため、本研究では以下の3つの重要な貢献を行う。(i)約700万件のキャプションと質問応答の訓練インスタンスからなる大規模な実世界動画コレクション「Audio-Visual-Skills」。これは時間的、構成論的、およびクロスモーダルな音声・視覚推論を重視して設計されている。(ii)短期の知覚から長期的なマルチイベント推論へと段階的にモデルを訓練する、新規な3段階カリキュラム。(iii)音声・視覚の長いストリームにおける中間推論ステップを明示的にタイムスタンプに紐づける推論フレームワーク「Temporal Audio-Visual Interleaved Chain-of-Thought」。これにより、時間的整合性と解釈可能性が向上する。15以上の音声・視覚、オムニモーダル、音声、視覚のベンチマークを用いた広範な実験により、AV-Flamingoは同程度のサイズのオープンモデルを明確な差で上回り、特に長く複雑な実世界の音声・視覚理解・推論タスクにおいて、はるかに大規模なオープンウェイトモデルやクローズドモデルと非常に競争力があり、場合によってはそれらを凌駕することを示す。ベンチマーク性能に加えて、AV-Flamingoは実世界での高い有用性を示し、未知のタスクへの転移も良好であり、そのロバスト性と汎化能力を強調している。
検証可能な報酬を用いた強化学習(例:GRPO)は、今日の推論モデルを支える原動力ですが、最終的な答えだけを評価します。難しい問題では、思考過程自体が評価されず、良い思考に対するラベルが存在しないため、この手法はモデルにより良い思考ではなく、より多くの出力を生成するよう訓練してしまいます。そこで我々は、2つの競合するモデルを互いの評価者とするAgonを提案します。両モデルは同じ問題に取り組み、役割を交代しながら一方が解答の草案を作成し、もう一方がそれを読みつつ問題を解きます。各モデルは相手よりも優れた解答を出すことで報酬を得ます。勝つためには、自身の作業を見た相手よりも優れた推論をしなければならず、その結果、訓練中に過程ラベルや報酬モデルを必要とせず、推論が暗黙的に評価されます。両方のモデルが最適化されるため、各モデルは徐々に強くなる相手に直面します。これは単一モデルの強化学習では実現できません。2つのモデルは、同等の強さと行動の違いがあれば十分です。推論時には、訓練時と同じように、一方のモデルが草案を作成し、もう一方がその草案を読んだ後に答える2段階のカスケードとして展開されます。Qwen3を用いたDeepMathのハード分割では、この手法はGRPOのpass@1を倍増させ、同一ベースに対する未訓練のMixture-of-Agentsパスの利得の約8倍になります。この順序は、競技プログラミングのコードやモデルファミリー(Qwen3.5、Gemma 4)でも再現されます。現在のところ、モデルはテキストで対話しますが、次のステップは潜在空間で一緒に推論させることです。
自律交渉エージェントは、保険や調達といった高リスクな環境での導入が進んでいる。暗号技術は明示的に開示された制約値を保護するものの、より微妙な脅威である行動プライバシーの漏洩には対処できない。すなわち、敵対者が観察可能な交渉のダイナミクス(譲歩の軌跡、タイミング、収束パターンなど)から、プライベートな制約を推測するという問題である。本稿では、複数ラウンドの交渉プロトコルにおける行動差分プライバシーを調査する。我々は、(ε, δ)-差分プライバシーと、提示系列のほとんど確実な収束(相手の留保価格が許す場合に合意に達する)、および高い交渉効用を同時に保証する適応型確率的交渉ポリシーを設計する。3,000件の合成二国間交渉で評価した結果、本メカニズムは敵対的な推測精度を43~50%削減しつつ、交渉成功率と効用を90%以上に維持しており、性能を大きく損なうことなく強力なプライバシー保証が達成可能であることを示している。
セキュリティエージェントの評価では、通常、潤沢な推論予算の下で最大限の攻撃能力を測定し、脆弱性の発見、エクスプロイト開発、ペネトレーションテスト、CTF(Capture The Flag)の完了に重点が置かれます。このような測定方法は有用ですが、不完全です。運用セキュリティにおいては、あらゆる推論ステップ、ツール呼び出し、テレメトリクエリ、エンリッチメント要求が予算を消費するからです。本稿では、攻撃的なCybenchチャレンジと防御的なSplunk BOTS v1調査チャレンジにおいて、このコスト対成功率の観点から言語モデルベースのセキュリティエージェントを評価します。最良の場合の成功率のみを報告するのではなく、固定コストレベルでモデルを比較し、推論費用とツール費用別にパフォーマンスを分解します。その結果、レッドチームとブルーチームのタスクでは明確に異なるスケーリングの傾向が見られました。攻撃的なCTFのパフォーマンスは、テスト時計算量の増加とともに向上し、スケールされたオープンウェイトモデルは、コスト競争力を維持しながら最先端のプロプライエタリシステムに近づくことができます。一方、防御的なSOC調査は同じようにはスケーリングしません。その成否は、単純な推論予算の多さよりも、規律あるツールの使用、テレメトリのナビゲーション、選択的なエンリッチメントに大きく依存します。セキュリティエージェントのベンチマークは、タスクの成功率に加えて、経済効率と運用適合性を測定すべきであると我々は主張します。コストを考慮した、SOCネイティブな評価は、現在どのモデルが実用的に有用であり、防御エージェントがどこを改善すべきかをより明確に示します。結果はインタラクティブなWebサイト(https://evals.frontier.security)で公開しています。
視覚言語行動(VLA)モデルは、視覚観察と言語指示からロボット行動を予測する。これらの行動はロボット自身の3次元座標系で定義されるが、ほとんどのVLAはカメラ座標系でシーンを観測するため、シーンの観測と行動の定義との間に座標系の不一致が生じる。この不一致は固定視点では問題にならない。固定視点では方策が単一の観測から行動への写像を記憶できるからである。しかし、大規模データセットが多様なカメラ設定にわたるデモンストレーションを集約し、方策がこの写像を視点間で一般化する必要がある場合、その困難は増大する。我々はこの不一致をロボット中心点群マップで解決する。これは、ピクセルにロボット座標系におけるシーンポイントの3次元座標を格納した画像である。点群マップはロボット座標系の3次元形状を提供しながら、事前学習済み2D VLAが期待する高密度のH×Wグリッドを保持するため、最小限のアーキテクチャ変更で既存のVLAに統合できる。RoboCasaにおいて、点群マップはpi0.5とSmolVLAの両方を改善し、代表的なカメラ視点および3次元認識ベースラインを上回る性能を示した。実ロボット実験では、訓練中に見られなかったカメラ配置にカメラを移動させた場合、RGBのみの方策に対する点群マップの優位性が拡大した。
本稿では、マルチターン強化学習フレームワークであるSelf-Verified Reasoner(SVR-R1)を提案する。これは、モデル自身の検証プロセスをマルチモーダル推論の学習シグナルとして活用するものである。各クエリに対し、モデルは同一の重みを用いて回答を生成し、それに対して自己判定(Yes/No)をバイナリで下す。「No」の場合には再考の機会が与えられ、「Yes」の場合、またはターン数の上限に達した場合には、最終的な出力として結果ベースの報酬計算に用いられる。SVR-R1はGRPOと非同期マルチターンロールアウトフレームワークを用いて実装されており、外部からの監視や補助的な批評家モデルを必要としない。我々はSVR-R1を視覚言語推論ベンチマークで評価し、強力な標準GRPOベースラインと比較して高い精度向上を示した。訓練のダイナミクスを観察すると、検証ターン数が減少する、すなわち検証への依存度が低下する一方で、テスト精度は向上しており、これは本フレームワークによって自己修正が内化され、最も確信度の高い回答が選択されることで、検証と生成の乖離が縮小することを示している。SVR-R1は、推論時における自己洗練とVLMの強化学習訓練という、これまであまり探求されてこなかった交点を橋渡しするものであり、マルチモーダル推論をブートストラップする簡潔かつ効果的な手法を提供する。将来のVLM研究を促進するため、SVR-R1をオープンソース化する予定である。
核融合トカマク装置向けのプラズマ診断モデルは、ほぼ常にクリーンで完全なセンサーデータに基づいて評価されている。しかし実際には、核融合診断装置は頻繁に故障する:データ収集システムの起動遅延、個別センサーの故障、そしてプラズマディスラプションが近づくまさにそのタイミングで信号欠損が集中する。本研究では、11,573ショットのMASTデータから成るTokaMarkデータセットを用いて、プラズマ診断機械学習に対する初の系統的なロバスト性ベンチマークを提示する。XGBoost、LSTM、Transformer、およびTokaMark CNNベースラインを、物理的に根拠のある6つの故障シナリオと3つの補完戦略にわたって評価する。標準化されたアーキテクチャ間比較のためのロバスト性スコア(RS)を導入する。中心的な知見は、ディスラプション近接時のセンサー故障(最終窓タイムステップでの破損注入)が系列モデルの性能を著しく低下させる(LSTMでNRMSEが+212%)一方、統計的特徴量モデルは比較的安定している(XGBoostで+37%)ことである。前方補完(forward-fill)による補完は、系列モデルに対するランダム欠損からの劣化をほぼ完全に除去する(LSTMで+57%から約0%へ)が、窓の末尾が破損した場合にはほとんど効果がない。真値のディスラプションタイムスタンプを用いたショットレベルの警報評価では、LSTMの警報検出が近接センサー故障時にTPR=0.00にまで低下する一方、平均値補完によってTPR=1.00に回復する。これはNRMSEで観察されたパターンとは逆である。プラズマ電流は、全アーキテクチャにわたって最も重要な単一診断項目として浮上する(除去時に+73%から+140%の悪化)。コード、データ、学習済みチェックポイントはhttps://github.com/Neerav-Gupta/tokamark-robustnessで入手可能である。