翻訳付きの日次キュレーションされたAI研究論文
学習データの品質は、大規模言語モデル(LLM)の能力を根本的に決定する。しかしながら、LLM、エージェント、データ中心のワークフローが実際に学習データをエンドツーエンドでどの程度準備しているかを測定する統一されたベンチマークは存在しない。我々は、LLM主導のデータ準備は、互いに補完する二つの能力から構成されると考える。すなわち、生のソースを教師あり学習データに変換するデータ構築と、下流の学習前に候補データセットの学習価値を予測するデータ品質評価である。本稿を通じて「品質」とは、表面的なテキスト特性ではなく、下流の学習における有用性を指す。 我々は、六つのドメインと複数のベースモデルにわたって、共通の下流タスクに基づくプロトコルの下で両方の能力を統合的に評価する初めての統一ベンチマークであるDataPrep-Benchを紹介する。データ構築については、各手法は同一の生ソースを入力として消費し、その出力を用いてDolly-15kと共にベースモデルをファインチューニングした結果に基づいてスコア付けされる。このトラックに加えて、我々はData-Construction-Skillを公開する。これはスキル誘導型エージェントであり、Llama-3.1-8B FinanceにおいてDollyのみのベースラインを絶対値で約20ポイント上回り、知識抽出密度の高いドメインでは最強のエージェントベースおよびDataFlowベースの手法と同等の性能を示す。 データ品質評価については、各スコアリング関数は共通の候補プールにおける下流性能とのピアソン相関によって評価される。我々は、候補データセットとドメインプロキシ間のMMD(最大平均誤差)を用いる分布ベースの評価指標であるDistributional Alignment Score(DAS)を公開する。DASは六つのドメインのうち四つで最も強いクロスモデル相関を達成し、数学、科学、医療において同時にr>0.70を超える唯一の指標であり、既存の品質ベース、多様性ベース、ヒューリスティックベースの評価指標を上回る。 DataPrep-Benchは、LLM主導のデータ準備における同等に重要な目標として、両方の能力に関する進捗を測定するための統一された下流タスクに基づくフレームワークを提供する。
LLMの訓練は、手動による設計やアノテーションから、インタラクション駆動型の自己進化へと移行しつつある。しかし、既存の自己進化手法は、タスクの多様性と検証の信頼性の間に根本的なジレンマを抱えている。環境に依存する手法は正確なフィードバックを得られるものの、学習を狭い領域に制限してしまう。一方、開かれた自己生成はタスク空間を広げるが、信頼できる検証が欠如しており、誤った報酬が訓練ループに混入する恐れがある。我々は、エージェントスキルがこの緊張関係を緩和する強力な中間領域であると特定した。各スキルは特定のシナリオにおいて深く検証可能な実行を保証し、スキル間の動的なルーティングが開かれたタスクの多様性を維持する。この洞察に基づき、我々は提案者、解法者、動的スキル制御器からなる共進化フレームワークであるSkill Self-Play(Skill-SP)を導入する。これらは強化学習ループを通じて調整され、継続的な自己対戦ループの中で共進化する。提案者は動的にサンプリングされたスキルに条件付けられた困難なタスクを生成し、解法者は能力の限界を押し広げるために候補解を探索する。スキル制御器は実行フィードバックを収集し、スキルライブラリを更新・拡張する。このインタラクティブな共進化により、構造化された検証と開かれた探索の間のギャップを効果的に埋めることができる。ツール使用および推論ベンチマークにおける実証評価は、Skill-SPが堅牢な進化エンジンとして機能し、有能なバックボーンの性能上限を一貫して押し上げる一方、初期に不整合なモデルに対しても顕著な好転を触媒することを示している。コードはhttps://github.com/Qwen-Applications/skill-self-playで公開している。
エージェント強化学習の研究では、アルゴリズムの修正、新しい推定器、新たなパイプライン段階、新しいロールアウト方式が絶えず行われており、主流のフレームワークでは、各変更がトレーナー、分散バックエンド、ロールアウトのグルーコードにわたって浸透するため、そのコストは研究者に毎反復かかる。Moltは、このコストを小さく保つために設計されたPyTorchネイティブの訓練フレームワークである。コードベースはコンパクトでクリーンであり、研究者が頭の中に保持でき、AIコーディングアシスタントが全体を読んで理解できるため、アルゴリズムの流れをエンドツーエンドで追跡および変更できる。エージェントは通常のプログラムであり、1つの非同期ループがマルチモーダルおよび混合専門家ポリシーを訓練しつつ、自身が生成したトークンに対してのみ学習を行い、トークン、ポリシーバージョン、モデルセマンティクスにおいて一貫性を保つ。軽量さは性能を犠牲にしない。完全に非同期のプロトコルを一致させた条件下で、Moltは最先端のMegatronベースのスタックと統計的に同等である。Moltはオープンソースであり、レシピとコンテナをhttps://github.com/NVIDIA-NeMo/labs-moltで提供している。
プロダクションAIエージェントの失敗は、推論能力の不足よりも、むしろ推論コンテキスト内の情報(会話履歴、大規模なプロンプト、大規模なツール定義、肥大化するツール出力)を適切に管理できないことに起因することが多い。エージェントは蓄積される自身の履歴に埋没し、ターンごとに増大するトークンコストを支払いながら、会話内および会話間での想起欠落を引き起こす。従来の対応策はこれを保存と検索の問題として扱うが、我々はその枠組みが狭すぎると主張する。エージェントが保持すべき情報を能動的に管理することは、単なる保存領域ではなく、ライフサイクル全体を対象とする。すなわち、何を記憶すべきかの決定、その抽出と構造化、データタイプに応じた適切な保存先の選択、出典を保持したままの統合と忘却、現在の関連性の判断、次に必要となる情報の予測、そして重要な情報を失わずにコンテキストを予算内に圧縮すること、これら全てを包含する。本格的なプロダクション環境では、これは単一ユーザーではなく、組織全体のスコープ階層にわたって動作する。我々はこの学問領域を「エージェンティックコンテキスト管理(Agentic Context Management: ACM)」と命名し、その基本要素を5つに分解する:アーキテクチャ設計(architecting)、取り込み(ingesting)、スコーピング(scoping)、予測(anticipating)、圧縮と統合(compacting & consolidation)。次に経済的根拠を示す:ナイーブなコンテキスト蓄積は会話長に対してトークンコストが二次関数的に増大し、粗い要約では線形コストを達成する代わりに精度の急激な低下を招き、検証済みの圧縮のみが忠実度を保ちながら線形コストを実現する。我々はこの5つの基本要素をマルチテナントサービスとして実現した参照実装「Maximem Synap」を説明し、第6節で詳述する構成においてLongMemEvalで92%、LoCoMoで93.2%のスコアを報告する。最後に、既存のベンチマークが未だ捕捉していない次元(レイテンシ、トークン効率、コンテキストローテーション耐性)と、このカテゴリが指向する意思決定レベルおよび組織レベルのコンテキストのフロンティアについて述べる。
実験トラッカーはトレーニングの進行状況を示すが、ライブランを変更するには依然としてトレーナー固有のコードが必要となることが多い。本稿では、共有プロトコルを通じてトレーニングを操作するためのオープンソース制御プレーンであるInteractive Training 2を提案する。トレーニングアプリケーションは公開する設定とアクションを宣言し、人間と自動制御装置は同一のインターフェースを介してリクエストを送信し、トレーニングループはそれらを検証し安全な制御ポイントで適用する。カスタマイズされたAimワークスペースは、ライブメトリクスと制御を、リクエストと結果の時系列記録と組み合わせる。我々は、このシステムを5つのNLPおよび強化学習ワークフローで実証する。公開されたコードとトレースは、監査可能な人間およびエージェント誘導トレーニングのための再利用可能な基盤を提供する。
大規模言語モデル(LLM)は顕著な推論能力を示すものの、テキストのみの事前学習に依存しているため、マルチモーダルな物理世界の認識に制約が生じる。ネイティブなマルチモーダル事前学習は、マルチモーダル入力に対してモデルをスクラッチから訓練することでこの制約を回避し、深いクロスモーダル統合を実現するとともに、従来の後期融合アーキテクチャに内在する最適化の非対称性を緩和する。これらの利点にもかかわらず、このパラダイムのスケーリング特性は体系的に特徴づけられていない。このギャップを埋めるため、我々は固定された計算予算のもとでトランスフォーマーベースの視覚言語モデルを訓練する際の最適なモデルサイズとトークン数を調査する。最小目的損失は予測可能な計算則に従う一方、計算最適なモデルサイズとトークン数はべき乗則に従ってスケーリングすることを示す。特に、言語とマルチモーダルの目的関数は異なるスケーリング挙動を示す。言語配分則はデータの構成に対してほぼ不変であり、マルチモーダルデータの比率によらず安定した言語学習を示唆する。対照的に、マルチモーダル配分則はこの構成に非常に敏感である。具体的には、テキスト中心の混合データは大規模モデルでのみ計算効率が向上し、より大きなモデル容量への最適リソース配分をシフトさせる。さらに、データ構成が計算則と配分指数に与える影響をモデル化することで、モデルサイズ、トークン数、およびデータ混合の正確な構成を指定する効率フロンティアを導出する。下流評価ではさらに、ネイティブなマルチモーダル事前学習が正のクロスモーダル転移を誘発し、純粋テキストの空間推論を強化するとともに、頑健なマルチモーダル文脈内学習を可能にすることを明らかにする。要約すると、この実証研究はマルチモーダル基盤モデルを予測可能にスケーリングするための基本的な基盤を確立する。
現代的な生成モデルは、典型的には敵対的批評器、規定されたノイズからデータへの経路、または自己回帰的因子分解に依存している。これに対して我々は、適切な分布的エネルギーがサンプルレベルの運動を誘導し、一段階生成器に対して直接的な回帰監督を提供できることを示す。生成のための三体散乱モデリング(TBSM)は、エネルギー距離を発射体ごとの定数サイズの相互作用に変換する。各発射体は1つの実データ源に引き寄せられ、独立に生成された1つの源から反発される。発射体とその条件に基づき、その期待値は1/2 D_E^2(P_θ,Q) の2-Wasserstein勾配流速度に等しい。B個の凍結ターゲット事象のバッチはO(B)個のサンプルレベル損失をもたらし、各損失は条件として1つの参照を用いる。これはDrifting Modelsなどの手法で用いられるミニバッチ全体の全対場とは対照的である。この条件付き期待値をオンラインで追跡することで、場のノイズを低減できる。凍結画像特徴における散乱を利用して、TBSMはImageNet-256上で一段階生成器を訓練し、ピクセル空間PixelDiT-XLでFID=2.23、潜在空間DiT-XLでNFE=1でFID=1.63を達成する。我々は拡散関連の監督、Drift類似のダイナミクス、GAN類似の目的関数を関連付ける設計マップを提供する。これらの結果は、追跡散乱が高次元の一段階生成への経路となることを確立する。コード: https://github.com/sp12138/TBSM。
産業ビデオ異常検出(IVAD)は、産業プロセスにおける異常な物体や事象を識別することを目的としており、現代の製造業や品質管理システムにおいて極めて重要である。既存のVLM(視覚言語モデル)ベースの異常推論手法は、一般的な領域における未定義の異常を検出できる。しかし、複雑な物体変形、厳格な物理法則、工程上の制約が特徴的な産業環境では、その性能は低下する。このような相互作用が頻繁な検出の複雑さに対処するため、我々は訓練不要でドメイン固有の知識を必要としないエージェンティックフレームワークを導入する。これは人間の検査員のように、物体の状態進化に重点を置く。本手法は、検出された物体の時間的・空間的ダイナミクスとその背後にある変形を経時的に追跡し、物体ごとの時間的状態軌跡に基づいて推論を行うことで、グラウンディングされたフレーム内の異常物体を識別する。本手法は、正常クリップでの再学習やテスト時推論のためのコンテキストとしてのドメイン知識の注入に依存する従来手法の限界を克服する。3つのIVADデータセットを用いた広範な実験により、本手法が最先端のVLM、エージェンティックフレームワーク、および各データセットで微調整された従来のVAD手法を上回る性能を示すとともに、異常プロセスとその種類に関する解釈可能なレポートを提供することを実証した。
多言語検索拡張生成において、検索器は複数言語で書かれた関連文書を取得し、それらは回答生成前に再順位付けされる。しかし、既存の多言語再順位付け器が、意味的に関連する候補を順序付ける際に文書の言語を考慮しているかどうかは明らかではない。我々の分析によれば、これらの再順位付け器は、言語間で意味的に等価な文書が利用可能であっても、クエリと同じ言語で書かれた文書を一貫して優先するわけではない。これは文書の言語が回答生成に影響を与える可能性があるためである。我々は、意味的関連性と言語的一貫性の両方を考慮するよう学習された、言語認識型多言語クロスエンコーダであるLAMARを公開する。LAMARはまず、英語を基盤とした関連性蒸留を用いて、多言語入力にわたって一貫した関連性スコアリングを確立し、次に言語的一貫性のための選好アラインメントを適用することで、意味的関連性を維持しつつ、クエリと同じ言語で書かれた文書がより高い順位を得るように促す。言語的一貫性を評価するために設計された統制実験では、LAMARは全体的および個別に調査されたすべての言語において最高の性能を達成した。また、LAMARは確立された多言語再順位付けベンチマークにおいても競争力を維持している。実用的な検索設定において、LAMARは第1段階で取得された候補を再順位付けする際、報告されたすべての指標で最良の結果を達成した。これらの結果は、LAMARが言語的一貫性を考慮しつつ、一般的な多言語再順位付けベンチマークで強力な性能を達成することを示している。
大規模言語モデルはエージェントとしてますます展開されているが、信頼性の高いエージェント的行動には次トークン予測以上のものが必要である。推論時には、エージェントが現在の推論を続行するか、より強力なモデルに委ねるか、追加情報を要求するか、外部ツールを呼び出すか、与えられた設定の下で棄権するかを決定できることが望ましい。既存のアプローチは、これらの決定をプロンプトレベルのルーティング、外部オーケストレーション、またはタスク固有のファインチューニングを通じて処理しており、これらは主に入力側シグナルに依存し、モデルバックボーンが進化するにつれてしばしばコストがかかり、維持が困難である。我々は、かかる制御決定がモデルの潜在的な生成プロセスから直接推論できるかどうかを問う。我々はマルチヘッド潜在制御を導入する。これは、凍結されたLLMまたはVLMから隠れ状態の軌跡を読み取り、デプロイ時制御信号を生成する軽量な層である。能力ヘッドは、現在のモデルがインスタンスを解決できるか、より強力な協力者に委ねるべきかを予測し、解決ヘッドは適切な解決決定(明確化、ツール使用、棄権、直接回答)を予測する。両ヘッドは同じ凍結されたLLMバックボーンからの潜在トレースのみで訓練され、モデルを変更することなく事後適応を可能にする。言語設定および視覚言語設定において、マルチヘッド潜在制御はマルチモデルシステムの品質とコストのトレードオフを一貫して改善し、部分的な生成からの早期ハンドオフとより正確な介入決定を可能にする。ルーティング実行(小規模+大規模モデル)では、AndroidWorldで大規模モデルの使用率を最大90.7%削減し、ベンチマーク全体で平均27~53%削減しつつ、大規模モデルの性能の大部分を維持する。さらに、学習された制御信号はツール使用決定の品質を向上させ、相対スコアで最大+158%の向上と、必要なツール呼び出しの見逃しを65.5%削減する。
近年の条件付き動画生成モデルは、深度マップや未テクスチャ形状などの3Dエンジンレンダリングを、ゲームや没入型コンテンツ制作向けのフォトリアリスティックな動画に変換する有望な可能性を示している。これらの応用には、永続的な3Dワールドを維持しながら新たなフレームを連続的に合成する、長期的な自己回帰生成が必要となる。自己回帰生成器は、有界のKVキャッシュを用いて動画をチャンク単位で合成するため、カメラが過去のコンテキストを追い出した後に同じ場所を再訪した場合、条件付けとなるレンダリング(例:深度)が基礎となる幾何形状と完全に一致しているにもかかわらず、モデルはしばしば一貫性のない外観を再生成してしまう。本稿では、3Dエンジンが既に提供する対応関係を活用することで、事後学習を一切行わずにこの再訪時の非一貫性を解決する。時間対応は、ポーズと一致する過去の潜在チャンクをループクロージャメモリとしてKVキャッシュに再取得し、空間対応は、カメラポーズと深度再投影により、取得したチャンクの幾何的に対応する領域に向けてトークンレベルの注意を偏らせる。本手法を、複雑な実世界応用シナリオを反映させるためにTartanAirおよびTartanGroundデータセットから抽出したループクロージャ軌跡上で評価し、全体の動画品質を損なうことなく再訪一貫性において既存の学習不要ベースラインを上回る結果を示す。プロジェクトページ: https://wenchao-m.github.io/ClosetheLoop.github.io/
大規模言語モデル(LLMs)は、ここ数年で科学発見のプロセスを大幅に自動化してきた。しかしながら、既存システムには一つの根本的な限界がある。すなわち、アイデアを生成・最適化する際に、質(Quality)か多様性(Diversity)のいずれか一方のみを独立して考慮する点である。このため、互いに近接したアイデアや、大量の些細で不健全、あるいは不明瞭な概念が生成されることが多い。本研究では、これに代わり、研究アイデア創出は両方の目的を連携して扱うべきであり、質-多様性(QD)探索として捉えるべきだと主張する。この観点に基づき、アイデアの系統を通じた進化を管理するマルチエージェントフレームワーク、IDEAgentを導入する。質(Quality)については、専用の修復と洗練のための多目的フィードバックを用いて共同で推進し、多様性(Diversity)については、軽量な逐次記憶と、完成済みアイデア、その履歴上の祖先、却下された提案との明示的な比較を通じて達成する。このQD連携を体系的に評価するために、あらかじめ設定された質の閾値を満たす、相互に多様なアイデアの最大集合を計算する結合指標であるYieldを開発する。最後に、コンピュータ科学の8つの領域にわたる32のトピックでの評価を通じて、IDEAgentがYieldにおいて最良のベースラインを3.89倍上回り、8倍多いトピックで非ゼロのYieldを達成することを示す。さらに、質の改善の分析を通じてこれらの知見を裏付け、修復と洗練が、非自明性を維持しつつ論理的厳密性と明確性を構築する上で重要であることを示す。QD探索に基づくアイデア創出に関する今後の研究を促進するため、IDEAgentをhttps://github.com/declare-lab/IDEAgentでオープンソースとして公開する。
視覚言語モデル(VLM)エージェントは、3Dシーンを記述するだけでなく、それらに対して行動するためにツールを利用するようになってきている。既存の3Dベンチマークはテキスト応答や単一オブジェクト操作を評価しており、複数オブジェクトからなる完全な3Dシーンにおけるエージェントの行動は評価が不十分なままである。我々はSceneActBenchを提案する。これは、統一されたエージェント・環境ループのもとでの5つの3Dタスクにわたる、視覚に基づく行動のベンチマークである。PNG画像またはサンプリングされたビデオフレーム、および該当する場合は提供された3Dアセットが与えられると、エージェントは3D環境で行動する。各最終出力を、タスク固有の幾何学的指標を用いて隠された正解データと照合して評価する。SceneActBenchは、210のソースインスタンスから構築された5つのタスクから成り、ペアとなる入力条件を含む520のタスクケースを生成する。比較の公平性を保つため、すべてのタスクは1つの固定されたエージェントループを通じて実行される。11のプロプライエタリなVLM構成において、総合スコアは38.6から50.2の範囲にわたり、どの構成もタスク間で一貫して良好なパフォーマンスを示さなかった。我々はさらに、失敗がどこでどのように発生するかを分析する。
拡散モデルは、反復サンプリング中に誤差が蓄積する問題、一般に露出バイアスとして知られる現象に悩まされる。我々は、トレーニングと推論の間に系統的な周波数依存の不一致が存在することを明らかにする。これは周波数依存のSNR誤差として解釈できる。重要なことに、このミスマッチの方向性はモデルやタイムステップによって異なり、固定された補正ルールでは汎化できないことを示している。我々は、中間予測のパワースペクトルを事前に計算された事前分布に合わせる軽量なガイダンスベースの手法「スペクトルアライメント(SPA)」を提案する。本手法は2段階で構成される:(1) トレーニングデータからパラメトリックなスペクトルモデルをオフラインでフィッティングする段階、(2) 効率的なFFTベースの勾配計算による推論時のガイダンス段階である。SPAは計算オーバーヘッドが最小限(3~4%)であり、分類器不要ガイダンス(CFG)と相補的な関係にある。我々は、ピクセル空間モデル(DDPM、ADM)から潜在拡散モデル(SD2.0、SDXL)、フローマッチングモデル(SD3.5、FLUX)に至るまで、多様なアーキテクチャで一貫した改善を実証する。実装は https://github.com/SonyResearch/SPA で公開している。
視覚言語モデル(VLM)は大量の視覚トークンを処理するため、推論レイテンシとメモリオーバーヘッドが大きくなる。これにより、視覚トークン圧縮に関する広範な研究が動機づけられている。訓練不要の戦略はヒューリスティックな指標に依存し、高い圧縮率では著しい性能劣化を被る一方で、多くの訓練ベースの手法は外部圧縮モジュールを導入し、VLMバックボーンに適応を強いるため、再訓練コストが大きく、VLMの事前知識を損なう。効果的な視覚トークン圧縮は強力な情報符号化に依存しており、その能力は事前学習済みVLMに既に備わっているが、既存の手法では十分に活用されていない。この動機に基づき、我々はVisCoを提案する。これは訓練効率の高い自己圧縮フレームワークであり、事前学習済みVLM自体を内在的な圧縮器として再利用する。VisCoはパラメータ共有型オートエンコーダであり、少数のメモリトークンを用いて視覚情報を圧縮し、符号化から復号への階層的情報の転送を行う。実験により、VisCoは評価されたすべての圧縮率において従来手法を上回り、より積極的な圧縮下では大きな利得を示し、極端な単一トークン設定でも安定した性能を維持することが示された。さらに、元の視覚トークンと組み合わせた場合、学習されたメモリトークンはベースモデルを改善することさえ可能であり、VisCoが圧縮を超えた補完的な表現を捕捉していることを示唆している。
ほとんどの自動話者認証システムは個別の発話に対して動作するが、現実の対話は典型的には複数の発話から構成される。発話が蓄積されるにつれて、音響的、韻律的、および言語的手がかりを通じてますます豊富な話者情報が利用可能になり、主に声音特性を標的とする話者匿名化手法に潜在的な課題を提起する。本稿では、複数発話かつマルチモーダルな設定における自動話者認証を調査し、匿名化された発話にわたる情報の集約がプライバシーに影響を与えるかどうかを検討する。まず、複数の匿名化発話にわたる音声のみの集約を研究し、より多くの発話が利用可能になるにつれて一貫した性能向上を観測する。次に、韻律的および言語的情報を取り入れ、マルチモーダルシステムが単一モーダル手法よりも優れていることを示す。最後に、集約戦略を比較し、フレームレベルの集約が最も低い等価誤り率を達成することを見出す。わずか5つの匿名化発話であっても、音声とテキストの組み合わせにより、音声のみの集約と比較して等価誤り率が15%以上低下し、匿名化にもかかわらずかなりの話者識別情報が依然として利用可能であることを実証する。