翻訳付きの日次キュレーションされたAI研究論文
化学文献の統合には、多数の出版物に散在する特定の知見を収集することがしばしば必要となるが、既存の文献検索システムは主としてランク付けされた文書リストを返すに留まる。このため、科学者やAIエージェントは関連情報の特定、出典の検証、論文横断的な回答の手動による統合を行う必要がある。本論文では、論文横断的な化学検索のためのクレーム中心インフラストラクチャであるAskChemを提案する。AskChemは検索の単位を論文から出典情報を伴うクレームへと変更する。すなわち、各論文は原子的かつ型付けされたクレーム群に変換され、各クレームはソースDOIと逐語的な引用、または明示的なエビデンス位置特定子によって裏付けられる。AskChemはこの共有クレームストア上に、検索と統合のための相補的な構造を提供する。すなわち、階層的検索と閲覧のための安定化されたファセット分類体系、関係を通じてクレームを結びつけるエビデンスグラフ、そして索引付けされた論文を科学的原理に基づいて位置づける探索的な動的分類体系である。AskChemは現在、147K件の論文から240万件のクレームを索引付けしており、ウェブインターフェースに加え、AIエージェント向けのREST、SDK、およびMCPアクセスを提供する。AskChem-Benchにおいて、GPT-5.5リーダーをAskChemに基づかせた場合、解決可能なDOIは100%となり、検索を用いない場合の88.3%を上回り、また5つの比較対象システムの中で最も高い引用密度を達成した。AskChemはhttps://askchem.orgで公開されている。
GUIエージェントは、既存のデジタルデバイスに対する汎用実行器となる可能性を秘めている。実世界での利用に向けて、我々は、実デバイス上で信頼性高く動作し、プラットフォーム横断的にワークフローを実行し、GUI操作とCLI実行を組み合わせ、長期的なタスクを完了し、有用なサービスを能動的に開始し、最小限の人間の労力で能力を自律的に向上させるエージェントを構想している。このビジョンに基づき、我々は、モバイル、コンピュータ利用、ウェブ、DeepSearch環境にわたる実世界中心の基盤GUIエージェントであるQwen-UI-Agentを提案する。Qwen-UI-Agentは、多様なサンドボックス環境と大規模な実機モバイルランタイムを組み合わせる。その統一されたアクション空間は、GUI操作とCLI実行を織り交ぜ、単一のモデルターンでバッチ化されたアクションを生成する。AutoResearch方式のデータフライホイールは、エージェントを使用してタスクと環境を構築し、障害を診断し、その後の反復を計画する。オンライン強化学習は、100ターンを超える軌跡でのトレーニングをサポートし、10,000を超える並行環境がロールアウトを高速化する。軽量なハーネス層は、モバイルとコンピュータにわたる能動的なサービス開始とステートフルなワークフローをサポートする。 広範な評価スイートにわたり、Qwen-UI-Agentは、モバイル利用ベンチマークで最先端の性能を達成しつつ、Opus 4.8、Gemini 3.1 Pro、GPT-5.6 Solなどのフロンティアモデルに対して、コンピュータ利用およびブラウザ利用タスクで競争力のある性能を発揮する。モバイル利用では、MobileWorldで82.1%、MobileWorld-Realで92.2%、AndroidDailyで97.5%を達成する。コンピュータ利用では、OSWorld-Verifiedで79.5%、OSWorld-v2で部分進捗スコア40.0%を達成する。ブラウザ利用とGUIグラウンディングでは、それぞれWebArenaで73.6%、ScreenSpot-Proで81.5%を達成する。
近年のAIエージェントの進展により、その基盤となる基盤モデルへのネイティブな能力の内在化が進み、マルチモーダル基盤モデルや大規模推論モデルが生み出されている。しかしながら、エージェントメモリは依然として主に外部モジュールを通じて実装されており、ネイティブな記憶能力はほとんど未探求のままである。本稿では、基盤モデルにネイティブな記憶能力を付与するメモリ基盤モデルを導入することで、この方向性に向けた第一歩を踏み出す。我々は、ネイティブメモリを二つの観点から形式化する:バックボーン内部における持続的かつ動的に進化するメモリ状態、およびモデル計算を通じて情報を自律的に保存・活用するネイティブな記憶手続きである。ネイティブメモリは、アーキテクチャ、エンドツーエンド最適化、効率性の面で利点をもたらすことを示す。この定式化に基づき、メモリ基盤モデルの最初のプロトタイプであるMetisを提案する。Metisは、基盤モデルにネイティブなメモリ状態を組み込む新しいアーキテクチャを導入し、履歴情報をモデル内に圧縮してメモリ注意機構を通じてアクセスすることを可能にする。我々は大規模なメモリ特化訓練データを構築し、中間訓練を通じてこれらのネイティブな記憶手続きを獲得するための複数の最適化目的を導入する。Metisのオンラインメモリ保守は勾配フリーであり、メモリ更新には順伝播計算のみが必要である。推論時には、学習済みのモデル重みはすべて凍結されたまま、ネイティブなメモリ状態が標準の順伝播計算を通じて自律的に変換される。大規模な実験を通じて、Metisがネイティブな記憶能力を示すことを実証し、その強み、限界、挙動について詳細な分析を提供する。メモリ基盤モデルに関する今後の研究を促進するため、我々のプロジェクトとモデルチェックポイントを公開する。
我々は、物理言語を中心に構築された物理世界モデルであるPhiZeroを紹介する。物理言語とは、世界状態遷移のコンパクトな離散表現である。既存の物理世界モデルは通常、将来のビデオをピクセル空間で直接予測し、基盤となる世界のダイナミクスを高次元の視覚予測器内に暗黙のうちに残している。人間が視覚経験から予測構造を抽象化し、それを明示的推論のために自然言語で整理する能力に動機づけられ、我々は自己教師あり学習を通じて実世界のビデオから物理言語を学習し、それを用いて物理世界の進化を明示的に推論する。これに基づき、PhiZeroは「推論してからレンダリングする」パラダイムを採用する。すなわち、まず将来の世界進化を物理言語シーケンスとして推論し、次に推論された遷移をビデオにレンダリングする。生成および理解ベンチマークにわたる広範な実験により、PhiZeroが物理的に整合的な世界進化をモデル化する能力が検証される。さらに、現実的かつ対話的な世界モデリング、きめ細かな行動条件付きシミュレーション、ゼロショット動作転移におけるその可能性を示す。
再帰的自己改善(RSI)には、AIを構築するプロセス自体を改善するAIシステム(すなわちAI4AI)が必要である。機械学習エンジニアリング(MLE)は、この能力を研究するための具体的かつ実行可能なテストベッドを提供する。我々は、MLEにおけるRSI研究のためのオープンなフルスタックシステムであるOpenMLEを導入する。これは、実行フィードバックを伴う検証可能なタスク環境(OpenMLE-Gym)、オペレータ学習(OpenMLE-RL)、および長期的探索(OpenMLE-Evo)にわたる。このスタック上で、我々はFrontis-MA1(35B)をMLE用のメタ進化エージェントとしてポストトレーニングし、ポストトレーニングと推論を4つの原子的プログラム進化オペレータ(Draft、Improve、Debug、Crossover)を中心に整合させる。同じオペレータは、すべての評価ベンチマークに対して重複排除されたデータ上で、実行に基づくSFTとRLを用いて訓練され、その後、長期的探索に組み込まれ、学習と進化を単一のループで結合する。MLE-Bench Liteにおいて、1台のRTX 4090(VRAM 12GB上限)でタスクあたり12時間の予算の下、Frontis-MA1(35B)は、OpenMLE-Evoを用いることで、ベースモデルと比較してMedal Averageを39.39%から60.61%に改善し、OpenMLE-Evo-Max(ベンチマーク非依存の経験事前分布と非同期探索)では71.21%に達し、GPT-5.5 + Codexを上回り、GPT-5.6 Solおよび2.8T Kimi K3に迫る。保持されたNatureBench Liteでは、両方のコンポーネントが転移する。フレームワークを固定した場合、訓練済みモデルに交換するとMatch-SOTAが50%から70%に上昇し、モデルを固定した場合、OpenMLE-Evoに交換すると20%から50%に上昇する。我々は、RSIに向けた実行可能なAI4AIに関する再現可能な研究を可能にするため、モデルの重みとOpenMLEスタック全体を公開する。コード: https://github.com/FrontisAI/OpenRSI
テキストから動画を生成するモデルは目覚ましい視覚的品質を達成しているが、シーンの時間的発展が高度に圧縮されたテキストプロンプトから暗黙的に推論されなければならないため、物理的に一貫したダイナミクスを生成することには依然として課題が残る。既存のチェーン・オブ・ソート(思考連鎖)手法は中間的な計画や視覚状態を導入するが、これらの表現は通常、実行不可能であるか時間的に疎であり、完全な時空間プロセスを具体化し制御する能力を制限している。この限界に対処するため、我々はVideoCoCoを導入する。これはエージェント型のデュアルエンジンフレームワークであり、実行可能なBlenderコードがプロセスレベルの思考連鎖として機能する。テキストプロンプトが与えられると、コーディングエージェントがシーンとその時間的発展を明示的に指定するBlenderプログラムを合成する。実行可能なシミュレーションエンジンがプログラムを実行して決定的な時空間ドラフトを生成し、その後、生成型ビデオエンジンがドラフトに条件付けられた編集によってこれをフォトリアリスティックな動画に変換する。この分解により、プロセスレベルの推論と高忠実度の視覚的実現が分離される。ビデオエディタをシミュレーションによるドラフトに適応させるために、我々はドラフト・指示・ターゲットのトリプレットからなる厳選データセットであるVideoCoCo-3Kを構築した。VideoCoCoは、PhyGenBenchにおいてOmniWeavingベースラインを0.475から0.558へ、VBench-2.0において52.18から77.88へ改善し、両ベンチマークで最高平均スコアを達成した。これらの結果は、実行可能なコードが物理的に一貫した動画生成のための、効果的で制御可能かつ検査可能な中間表現を提供することを示している。
デコーダのみの言語モデルは、長期記憶と推論を単一のパラメータセットに絡み合わせるため、記憶容量を独立して拡張することが難しい。Memory Decoderはパラメトリックな長期記憶モジュールを導入するが、それは比較的小規模でのみ研究されている。本研究では、メモリモデルを69億パラメータまでスケールし、3000億トークンで事前学習する、大規模Memory Decoder(Memory Decoder at Scale)を提示する。このデータ規模では、インデックス作成と検索の複合コストにより、標準的なFaissパイプラインは実行不可能となる。我々はこのボトルネックを、Faissのインデックス作成と検索のための分散パイプラインと、kNN分布のスパースかつバッチ単位のロードによって解決する。モデル規模を横断して、メモリにより多くのパラメータを割り当てる方が、ベースモデルのみをスケールするよりも優れたパラメータ-性能トレードオフをもたらすことが分かった。17のベンチマークにおいて、69億の汎用メモリをPythia-410Mと組み合わせることで、その平均スコアは29.86から37.34に上昇し、総パラメータ数が39%少ないにもかかわらず、Pythia-12B(37.24)を上回る。0.6Bから14BのQwen3 Baseモデルに対しては、17億のドメインメモリが、あらゆるスケールで3つのドメインにわたる平均スコアを9ポイント以上向上させる。全体として、我々の結果は、事前学習済みメモリを独立してスケールすることが、言語モデルの性能向上に対してよりパラメータ効率的な経路を提供することを示している。
エージェント型視覚推論の根本的な目的は、マルチモーダル大規模言語モデル(MLLMs)の複雑なタスクにおける成功率を向上させることであり、単に洗練されているものの非効率な推論パラダイムを備えさせることではない。本研究では、ツール使用の二つの重要な側面、すなわちモード適応性(MA)とツール効果(TE)を通じて、エージェント型視覚推論を再考する。モード適応性は、MLLMがツールが本当に必要であるタイミングを認識し、それに応じてツールを呼び出せるかどうかを特徴づけるものであり、不要な計算オーバーヘッドを回避しつつ、ツール支援を必要とする困難な問題における性能を向上させる。ツール効果はツール使用の実際の影響を特徴づける。すなわち、ツールはテキストのみの推論では解決できない問題に対してモデルの能力を拡張すべきであり、一方でツールなしでもモデルが既に解決できる問題に対しては追加のエラーを引き起こすことを回避すべきである。我々はこれら二つの特性を定量化するための包括的な分析を行い、既存のエージェント型視覚推論モデルはモード適応性が限定的であること、そして難しい例におけるツール使用による利得が、モデルが既に解ける簡単な例において生じる悪影響によって大きく相殺されることを実証的に明らかにする。これらの観察に動機づけられ、我々はより強力な全体的性能、改善されたモード適応性、そして真のツール由来の性能向上を達成する新しいエージェント型視覚推論モデルBeaconを提案する。Beaconの中核を成すのは、強化学習段階における「必要性認識型適応報酬(Necessity-Aware Adaptive Reward)」と「ヒント誘導型能力拡張(Hint-Guided Capability Expansion)」メカニズムであり、それぞれタスクの必要性に基づく適応的なツール呼び出しを促進し、最も困難な問題に対するモデルのツール使用能力を強化する。多様なベンチマークにわたる広範な実験により、Beaconの強力な全体的性能と、モード適応性およびツール効果の両方における大幅な改善が実証される。
検索拡張生成(RAG)は、語彙検索、密検索、グラフベースのインデキシング、エージェント型検索にまで及ぶが、これらのパラダイムは通常、単一のコーパス規模で異なるベンチマークを用いて評価されており、精度とコストのスケーリング特性は不明確なままである。このギャップを埋めるため、我々は統制比較実験を実施した。本実験では、質問セットと、関連文書および敵対的文書からなる固定の基盤文書群を不変に保ったまま、コーパス規模を約450倍に及ぶ28段階の厳密に入れ子構造の階層で変化させた。単一のリーダーモデルと単一の判定プロトコルの下で、公式精度、構築時およびクエリ時のトークン数、レイテンシを測定した。その結果、あらゆる条件下で最良となる手法は存在せず、規模に依存した順位の逆転が明らかになった。ファイルシステムエージェントは最小の共有階層で首位に立つが、その逐次探索は基盤セットにおいて39倍のクエリトークンを消費し、探索空間が拡大するにつれて効果が低下する。コーパス規模が約1000万トークンに達するとBM25がこれを逆転し、それ以降のより大きなすべての共有階層で首位となり、フルスケールでは20ポイントに迫る差を付ける。さらにBM25は、LLMを用いた構築を伴わずにパレートフロンティアの低コスト側の端点を形成する。密検索は効率的ではあるものの精度は低く、一方、グラフベースのRAGは実運用規模に達する前に構築の壁に直面し、そのスケーラブルな派生手法も共有階層においてBM25を下回る。総じて、コーパスの拡大はグローバルな候補ランキングをますます有利にする。すなわち、語彙検索が最も強力なスケーラブルな既定手法であり、エージェント型推論はランキングによる候補発見の代替としてではなく、その後に適用することで最も高い効果を発揮する。
オープンエンド領域における大規模言語モデルの学習は検証可能な報酬を欠いており、タスク選好を効果的な監督として形式化することを困難にしている。コンテキストはそのような選好を伝えることができるものの、生徒に蒸留されると追加の監督をほとんど提供しないため、生徒の性能に応じて進化するコンテキストが動機付けられる。しかしながら、進化するコンテキストを訓練中の監督として直接使用すると、蒸留ターゲットが不安定になり、分布が矛盾するため、ターゲットを安定化し、矛盾を低重み付けするメカニズムが必要となる。本論文では、逆KL目的関数の分解を通じてコンテキストの影響を分析し、以下の2つの知見を得る。すなわち、生徒はコンテキスト条件付き教師の幾何平均へ向けて蒸留され、また目的関数にはこれらの教師間の矛盾を測定する矛盾項が含まれる。この分解に基づき、オープンエンド領域におけるタスク選好を捉えるために、進化するコンテキストを訓練中の監督として使用するOPDパラダイムであるFlux-OPDを提案する。Flux-OPDは、コンテキスト条件付き教師とコンテキスト非依存教師の差分をコンテキスト差分シグナルとして扱い、それらをコンテキスト修正としてコンテキスト非依存教師アンカーに注入し、矛盾項を指標としてそれらの修正強度を重み付けする。オープンエンドタスクに関する実験により、Flux-OPDが既存のOPDパラダイムを上回ることが示され、教師監督と進化するコンテキストを組み合わせる可能性が強調される。
テキストから画像を生成するモデルやパーソナライズ編集モデルは、現在では高忠実度の単一被写体画像を容易に合成できる。しかし、抱擁、運搬、格闘といった複数の名前付き人物が共有する接触動作を生成する場合、四肢の融合、幻の四肢、身体同士の貫入といった重大な失敗が依然として発生する。既存の評価手法はこれらの解剖学的・幾何学的問題をほとんど考慮しておらず、VLMを判定者とするチェックリストはInteraction軸において飽和しがちである一方、人間にはこれらの誤りが明らかである。我々は、405シーン、14のインタラクションカテゴリ、4つの接触密度(C0〜C3)にわたる2,500サンプルのビデオマイニング編集トリプレットからなるベンチマークMPIE-Benchを導入する。さらに、固定した公開の多人数メッシュ再構成から接触時の幾何形状を評価する2つの新しい軸を備えたMPIE-Evalを提案する。Anatomy軸は、すべての人体状の塊が完全な再構成身体群によって説明されるかを問い、Interaction軸は、それらの身体間の貫入量と表面距離が指示された接触と一致するかを問う。10種類のエディタの評価において、メッシュベースのAnatomyは最大でも0.65、メッシュベースのInteractionは最大でも0.72に留まり、両方に優れた単一エディタは存在しない一方、VLMチェックリストは同じ画像を0.95以上と評価する。5人の評価者による研究は、両軸がゼロショットVLM判定者よりも人間の判断をより忠実に反映することを確認し、そのランキングはすべての重みと閾値のアブレーションでも維持される。
身体化知能(Embodied Intelligence)は、根本的なデータボトルネックに直面している。モデルは、人間が時間をかけて目標を追求する過程で、一人称知覚、全身動作、巧緻操作、物体状態、音、触覚がどのように共進化するかを捉えなければならない。既存のデータセットは、こうした経験を視点、モダリティ、空間スケールの間で断片化しており、完全な知覚-行動ループは部分的にしか観測されていない。本稿では、実在の家庭環境を空間的に較正され、時間的に同期された録音スタジオへと変革する、人間中心のデータエンジンであるAmbient Capture Engine(ACE)を紹介する。ACEは、相互補完的な2つのスケールで動作する。テーブルスケール構成は手-物体間の操作を高解像度で捉え、ルームスケール構成は家具の備えられた家庭内での全身動作、移動、インタラクションを捉える。ACEは、一人称視点および多視点の三人称視点映像、全身および関節構造を持つ手の動き、物体の形状と6自由度軌道、音声、触覚信号を、統合されたマルチ感覚ストリームとして記録する。ACEを用いて、2つの環境において50名の参加者によって遂行された、200のタスクカテゴリにわたる150時間・1,700万映像フレーム、合計75,000のインタラクションエピソードから成るACE-Data-0を構築した。このデータセットは、原子的操作、長時間にわたる家事活動の連鎖、人間-シーン間インタラクションを網羅し、ステップごとの指示ではなく目標レベルの指示を通じて、自然な行動のばらつきを保持している。さらに、信号からシーン構成要素、そしてインタラクションへと段階的に進む階層的ベンチマークを導入する。最先端手法の評価により、接触、遮蔽、自己運動、長い時間的視野の下での実質的なギャップが明らかになった。ACE-Data-0は、整合された知覚的・運動学的・接触的教師信号を伴う同期された人間のデモンストレーションを提供し、模倣学習、ワールドモデル、視覚-言語-行動システム、および身体化AIのためのスケーラブルな基盤を提供する。
ロールプレイングエージェント(RPA)は、大規模言語モデルにおける最も重要な消費者向けアプリケーションの一つとなっている。ユーザーは、感情的な慰めなどの体験を得るためにRPAと多ターン対話を行うため、能力の測定、システムの比較、さらなる改善の指針となる信頼性の高い評価が不可欠である。しかし、既存のベンチマークは通常、RPAに固定された対話履歴を続けさせ、その続きをユーザーから切り離された固定のルーブリックを用いて評価する。我々は、この設計には二つの限界があることを特定し、実証的に示す。第一に、RPAの出力は先行する対話履歴に影響されるため、実際の多ターン設定におけるロールプレイング能力の科学的に根拠のある評価が妨げられる。第二に、ユーザー体験は個人間で大きく異なり、従来の固定ルーブリックはユーザー満足度と必ずしも一致しない。そこで我々は、ユーザーシミュレータに基づくスケーラブルなRPAベンチマークであるPALATE(Person-Aligned LLM-Simulated-User Assessment with Tailored Evaluation)を導入する。PALATEには300のキャラクタープロフィールのプールが付属している。その主要評価では、ユーザー個別の5つのシミュレータを訓練し、事前に固定されたキャラクタープロフィールのパネルを用いて、候補RPAと自由形式の多ターン対話を行わせる。一般的な品質ルーブリックに加えて、ユーザー満足度を測定するための個別化ルーブリックを構築する。保留された注釈付きデータでは、個別化ルーブリックは一般ルーブリックよりも人間の判断との一致度が高いことを示す。16の候補を対象とした主要評価において、PALATEは、各候補が共同構築した多ターンの軌跡上で、一般的なターン品質、長期的なセッション能力、ユーザーごとの体験をそれぞれ別個に特徴付ける。これにより、システムをユーザー非依存の単一ランキングに圧縮するのではなく、特定のユーザーとRPAのペアに対する解釈可能な評価を生成する。
既存のビデオキャプショニングモデルは、ビデオコンテンツの自然な記述を生成できるが、局所的な視覚要素を複数の参照画像に明示的に接地することはできない。本稿では、フレーズレベルの参照接地を伴う事実に基づくビデオ記述を必要とする新しいタスクであるマルチ参照画像接地ビデオキャプショニングを導入し、このタスクのための2段階ポストトレーニングフレームワークであるRefCaptionerを提案する。RefCaptionerは、混合データSFTと階層的カバレッジ割引GRPOを組み合わせることで、参照選択、フレーズレベルのバインディング、ディストラクタ棄却、および参照間一貫性を同時に改善しつつ、一般的なビデオキャプショニング能力を維持する。トレーニングを支援するため、20,000本のビデオと171,354枚の参照画像を含むコーパスを構築する。さらに、実世界およびAI生成ビデオの両方において、キャプションの事実性とマルチ参照接地を評価するためのベンチマークであるMRVBenchを導入する。実験により、RefCaptionerは標準的なビデオキャプショニングベンチマークにおいて競争力を維持しつつ、オープンソースモデルの中で最良の総合性能を達成することが示された。さらに、人間による評価により、そのキャプションがアノテータに選好され、オープンソースおよびプロプライエタリの両方のビデオ生成モデルにおいて、よりソースに忠実なビデオ再構成を可能にすることが確認された。
マルチモーダル大規模言語モデルは、推論中にスケッチ、注釈、ツール、中間画像をますます活用しているが、これらの視覚的状態に本当に依存しているかは依然として不明である。既存のベンチマークは、カバレッジが狭いタスクコレクションやテキストのみで部分的に解けるサンプルに限定されているだけでなく、中間的な視覚的状態がどのように生成、描画、利用されるかを診断することなく最終回答のみを重視する評価にも制約されている。我々は、See2ThinkBenchとVisual Action-of-Thought(VAoT)からなる統合評価フレームワークであるSee2Thinkを提案する。See2ThinkBenchには、2D構造化推論、3Dシーン推論、実世界推論にわたる12のタスクカテゴリに及ぶ1,200問のオープンエンドで視覚依存的問題が含まれる。VAoTは、4つの制御された推論設定下で、テキストによる思考、視覚的行動、描画された状態、その後の推論を記録する。代表的ないくつかのプロプライエタリおよびオープンソースのマルチモーダルモデルを評価した結果、視覚的推論はモデルと環境に強く依存し、タスク間で一貫して優位な単一の設定は存在しないことが判明した。プロセス分析により、モデルは通常関連する視覚的操作を選択する一方で、忠実な描画が最も明確なボトルネックであり、高いフィードバック取り込み率が必ずしも精度向上につながらないことがさらに示された。タスク関連の破損フィードバック下では、モデルは視覚的状態への行動的依存を示し、制御された介入において精度が10パーセントポイント以上低下した。
視覚言語モデル(VLM)は、身体化エージェントにおいて、視覚入力を解釈し、空間関係を推論し、その推論に基づいてタスクレベルの意思決定を行うためにますます利用されている。しかし、根本的な能力のミスマッチが依然として存在する。すなわち、汎用VLMはタスク全体については推論できるものの、成功を左右する視覚的詳細を見落とすことが多く、一方で専門的な視覚モデルはそのような詳細を捉えられるものの、それをタスクレベルの意思決定に変換することができない。本研究では、VLMに空間ツールを用いた推論を教え、それらが提供する専門的な知覚能力を段階的に内面化させるフレームワークであるSpatialCLIを提案する。SpatialCLIは3つの段階で進行する。(1) Callは、専門的な視覚モデルを空間ツールとして公開し、VLMの知覚を拡張する。(2) Learnは、コールドスタートSFTとエージェント強化学習を用いてツール使用を改善する。(3) Internalizeは、成功したツール使用の軌跡を言語化し、専門的な知覚能力を内面化する。さらに、位置特定、セグメンテーション、深度、姿勢にわたる合成知覚のための516例のベンチマークであるSpatialCLI-Benchを導入する。MindCubeにおいて、SpatialCLIはQwen3-VL-8B-Instructをツール使用時に29.3%から84.6%へと向上させ、ツールを使用するGPT-5.6 Sol(72.1%)を上回る一方、内面化後はツールなしでも73.8%を維持する。
ビジュアル生成はますます高解像度の画像、長い動画、マルチモーダルな文脈を必要としており、フルアテンションの二次コストは法外なものになっている。我々は、原理に基づくスケーリング手法を備えたハイブリッド視覚拡散バックボーンであるChimeraを導入する。Chimeraは、テキスト・画像・動画トークンを位置埋め込みなしで単一のラスタ順ストリームとして処理する。これは、O(N)計算量の長文脈状態追跡を実現するKimi Delta Attention(KDA)と、直接的な大域相互作用のためのインターリーブ型マルチヘッド潜在アテンション(MLA)、局所的な時空間文脈のためのモダリティ認識短畳み込みを組み合わせる。スパース混合エキスパート(MoE)層は、活性化計算量を制御しつつ容量を拡大する。この異種混在アーキテクチャをスケールするために、各テンソルの関数上のファンインとモデル深さに応じてハイパーパラメータを幅と深さの間で転送するモジュール単位の手法であるHeteroPを導入する。HeteroPは一貫して調整されたファミリーを生成し、これを用いて活性化モデルサイズ、学習トークン数、画像-動画データ比に関するChinchilla流の計算最適則を当てはめる。これらの法則に基づき、我々は活性化パラメータ20億を持つ110億パラメータのChimeraを学習する。実験では以下の3つの結果が示される。第一に、事前学習拡散損失で測定すると、高密度バックボーンは一致させたフルアテンションのWan-2.1 2Bベースラインの1.7倍の計算効率を達成し、完全なシステムでは7.3倍に達する。第二に、長さ特化のファインチューニングなしで、Chimeraは5秒の学習クリップから30秒の動画へゼロショットで外挿し、最後の5秒間ではわずか6.5%のFID劣化しか示さない。第三に、当てはめた法則は、計算最適な画像事前学習が計算量を活性化モデルサイズと学習トークン数にほぼ均等に配分するのに対し、動画事前学習ではより高い計算予算においてモデルサイズをやや優先することを示す。これらの結果は、効率的な長文脈拡散アーキテクチャの設計とスケーリングのための基盤を確立する。
本稿では、インタラクティブビデオ世界モデルにおける任意アクションのフレームレベル制御を実現する新しい手法、ShadowDancerを提案する。その障害は表現上のものにある。既存のインターフェースは、アクションを緩く符号化してその展開をモデルの即興に委ねるか、あるいは特定のファミリーにしか対応せず取得が困難な構造化信号を通じてアクションを厳密に符号化するかのどちらかであり、多様なダイナミクスにわたる精密な制御は依然として実用的でない。デモンストレーションビデオは、任意のダイナミクスをフレーム単位で指定できる自然な解決策である。しかし、ビデオはそのダイナミクスを特定の見た目を通して、すなわち根底にあるダイナミクスの単一の影としてしか示さないため、デモンストレーションから学習されたアクションは新しいシーンへの転移が乏しい。ShadowDancerは、以下の2つの主要な革新によってこの問題に対処する。(1) シャドウペア:独立に再サンプリングされた見た目の下で同一のダイナミクスを再生するビデオペアであり、Shadow Libraryによって大規模に構築される。これにより、あるダイナミクスファミリーは、そのようなペアが構築可能である場合に限り制御可能になる。(2) クロスシャドウ予測:一方のシャドウからもう一方を予測することでアクションを学習する。これにより、ペアリングが再サンプリングするものは設計上破棄され、保存されるものがアクションとなる。その結果、ブロック因果的世界モデルを駆動する統一的なダイナミクス表現が得られる。したがって、デモンストレーションされた任意のクリップは再利用可能なアクション資産となり、アクションラベル、モーション推定器、ファインチューニングを必要とせずに新しい環境で再生できる。実験では、多様なダイナミクスファミリーにわたって、強力な潜在アクションベースラインおよびインタラクティブ世界モデルベースラインと比較し、アクション転移と長期的なアクションロールアウトの改善を示した。ロールアウト比較における平均ブラインド勝率は86%である。ビデオ結果は https://ShadowDancer-1.github.io で公開している。
オン方策自己蒸留(OPSD)は、推論言語モデルを改善する有望な手法であるが、実際には依然として脆く、確実に動作させるにはしばしばかなりの工学的労力が必要である。我々は、この困難さの構造的な原因を特定する。バニラOPSDは、より広範な方策最適化ファミリーにおけるβ=1の構成要素にほかならない。ここでβは、生徒モデルを参照方策に固定するKLペナルティの重みである。この等価性により、βは暗黙的に1に固定された値から、制御可能な正則化パラメータへと転換され、参照方策への近さと特権的教師によるガイダンスとの間のトレードオフを実現する、より一般的な定式化が得られる。我々はβ-OPSDを導入し、その最適方策を参照方策と特権的教師との間の幾何学的補間として導出する。しかしながら、この目的を強化学習で直接最適化することは、コストが高く、高分散になるであろう。我々はRL目的を直接最適化する代わりに、その閉形式解を蒸留ターゲットへと変換する。各βの値は、参照から教師への経路に沿ったターゲットを選択し、これは両者のトークンレベルのロジットを混合することで効率的に実装される。このようにして、低コストな蒸留は、高コストな方策最適化の解を近似する。さらに、return-to-goクレジット割り当ては、OPSDの単純さを保ちながら、トークン更新を系列レベルの目的と整合させる。数学的推論ベンチマークにおける実験は、β-OPSDがバニラOPSDを一貫して上回り、最適化の安定性と下流の推論性能を改善することを示している。我々の結果は、OPSDを実用的にする効率性を犠牲にすることなく、自己蒸留から方策最適化へ、そしてその逆へと向かう原理に基づく経路を提供する。
過去の経験を検索することは、大規模言語モデルエージェントを強化するための一般的な戦略となっている。しかしながら、既存のメモリ拡張エージェントのほとんどは、検索された経験をそのまま再生されるべき静的な記録として扱い、それがエージェントの現在の状況と一致するかどうかにかかわらずコンテキストに注入する。この「再生」パラダイムは、蓄積された経験の抽象的かつ一般的な性質と、意思決定時に直面する具体的で絶えず変化する状態との間のギャップを無視しており、しばしば負の転移を引き起こす。対照的に、人間は過去の経験を逐語的に想起することはほとんどなく、検索された記憶を整理し、現在の文脈に適合するよう適応させる。この着想に基づき、我々はMemHarnessを提案する。これは、LLMエージェントが現在の文脈に基づいて過去の経験を能動的に活用し、再構築することを可能にするフレームワークである。各意思決定ステップにおいて、統合ポリシーモデルが現在の状態に条件付けられた検索経験を批判し再構築し、行動する前に文脈に基づくガイダンスを生成する。この再構築能力は、GRPOによるエンドツーエンドの学習を通じて自然に獲得される。ALFWorldとWebShopにおける実験では、MemHarnessが純粋なRLおよび静的メモリ拡張ベースラインを大幅に上回り、分布外(OOD)シナリオにおいて強いロバスト性を示すことが実証された。さらに、我々の分析は、この再構築目的が負の転移を防ぐだけでなく、学習中の潜在的なガイダンスとしても機能し、エージェントの本質的な推論能力を根本的に向上させることを明らかにしている。
親注文の執行はアルゴリズム取引における中核的な課題であり、大口注文をより小さな注文に分割しつつ執行コストを削減することが目的である。既存のアプローチは、実際には成立しない可能性のある所定の市場仮定に依存するか、新たな環境への適応性を制限するタスク固有の訓練を必要とする。これらの限界を克服するため、本稿では、親注文執行に対する大規模言語モデル(LLM)の初の体系的研究を提示する。これにより、金融におけるLLMの活用は「何を売買するか」から「どのように執行するか」へと拡張される。我々は、親注文の執行を長期計画と短期執行に分解する階層的フレームワークであるPACE(Plan-Ahead Controlled Execution)を提案する。これは、明示的な市場仮定もタスク固有の訓練も必要としない。深セン証券取引所のレベル1データを用いた実験では、PACEはTWAP、アルムグレン-クリス、および学習ベースのベースラインよりも優れた成績を示し、最良のベースラインを0.65bps上回った。行動分析により、LLMは人間の投資家とは異なる方法で執行決定を行うことが明らかになった。すなわち、モデルの信頼度が高いほど、リターンの悪化ではなく優れたパフォーマンスが予測され、モデルは執行期限まで先延ばしするのではなく早期に取引を行う。これらの結果は、LLMが執行決定において人間のトレーダーを補完できることを示唆している。
順方向潜在世界モデルは、行動がシーンをどのように変化させるかを予測するが、所望の変化に対する行動を回復するには、高コストなテスト時探索のみに頼ることになる。我々は、行動ラベル付きかつ報酬なしの軌道を、展開可能な意図-行動インターフェースへ変換するエンドツーエンドのJEPAであるINTACT(INtent-To-ACTion)を提案する。各遷移は物理的意図 z_{t+1}-z_t を提供し、将来の目標は展開意図 sg(z_g)-z_t を提供する。本アーキテクチャは、同一の4スロット文法と共有パラメータを通じて、局所および目標の動作意図バックボーン入力グラフ間で同型であり、また、点ごとの潜在表現の等価性ではなく同一予測器によって誘導される行動法則の意味論を通じて、対応する局所および目標の動作意図族間で同型である。INTACTはさらに、RGB証拠から行動に有効な潜在意図座標への完全な転移と、意図族から対応する行動法則族への完全な転移を提供する。非対称な端点勾配は物理的後続状態を定位し、将来の目標をアンカーとして固定することで、点ごとの潜在表現マッチングや大域的に線形なダイナミクスを必要とせずに、表現学習と制御を結合する。得られた座標は頑健な分布型行動法則を支える。すなわち、その条件付き平均は探索不要の方策として直接機能し、一方でサンプリングは多様性や任意の検証のために引き続き利用可能である。公式の4つのLeWMタスクにおいて、1エポック・ゼロ探索モデルは85.78%、100.00%、97.67%、97.89%の成功率を達成する。Directプランを中心とした任意の局所CEMは、9,000個の代わりに384個の候補系列を用いて96.86%のマクロ成功率を達成し、サンプリングを23.44倍削減しつつ、純粋なCEMを16.00ポイント改善する。共有された単一の4タスク用エンコーダは89.39%のE5 Directマクロを達成し、共同訓練されたLeWMを全タスクで上回る。一方、予測-専門家の行動族kNNはDirect成功率とr=0.954で相関する。Direct推論には2.9〜5.5ミリ秒を要する。
視覚的質問応答のためのマルチモーダルエージェントは、知覚・検索・推論を織り交ぜたマルチステップ軌跡として動作することが増えているが、評価は依然として大部分が最終回答の正解率に還元されている。この集約的な指標は、正解が裏付けられたエビデンス、言語的な事前知識、あるいは偶然の誤差の相殺によって達成されたのかを判別できない。我々は、マルチモーダルエージェント軌跡を来歴制約付き状態機械として扱うことを提案する。すなわち、ツール出力は軌跡状態として機能する構造化エビデンス台帳(Structured Evidence Ledger)に正規化され、後続の推論および決定の主張はアクティブな台帳エントリのみを引用でき、グラウンディングはエンティティおよび数値レベルで検証され、修復は型付き状態遷移として実現され、ツール生成の来歴なしに内容を導入することはできない。我々はこの設計を、LedgerMind(構造化エビデンス台帳を用いた来歴制約付きマルチモーダルエージェント推論)として具体化する。これは、三層グラウンディングプロトコル(Three-Layer Grounding Protocol)、質問の複雑さに応じて推論の深さを調整する適応的二経路ディスパッチャ(Adaptive Dual-Path Dispatcher)、および形式的な来歴非増幅保証を備えたイベント駆動型検証・修復エンジン(Event-Triggered Verification-and-Repair engine)によって拡張される。我々はLedgerMindを用いて、最終回答の正解率では覆い隠されがちな四つの反復的失敗パターンに対処する:根拠のない中間推論、引用を伴うエンティティ幻覚(ファントム・グラウンディング)、単純なクエリへの過剰推論、および修復時の増幅である。複数のマルチモーダル推論ベンチマークとバックボーンMLLM(マルチモーダル大規模言語モデル)にわたる実験により、LedgerMindが回答精度と軌跡レベルの忠実性の両方を改善することが示される。
コンピュータ利用エージェントは、自身の行動によって変化するものから学習する。したがって、その訓練には、操作・破壊・リセットが可能なアプリケーションが必要となる。最も重要なアプリケーションはログイン必須かつステートフルであるため、合成環境がその代替となる。近年のパイプラインはそのような環境を大量に生成するため、ボトルネックは「どれだけ存在するか」から「それぞれの内部に何があるか」へと移る。我々の見いだしたところでは、その効果は三つの特性に由来する。すなわち、環境がどれほどの行動的深さを備えているか、エージェントが実際に失敗するインタラクションを対象としているか、そしてモデルと共に改善されるかである。我々はEchoverseを提案する。これは、仕様をステートフルなアプリケーションへとコンパイルし、そのタスクをアプリケーション自身のデータベースに照らして採点するものである。また、採点済みのすべてのロールアウトを二重に利用する共進化ループを導入する。すなわち、環境・タスク・検証器への修復として、そしてモデルへの訓練信号としてである。そのような12環境で訓練された9Bモデルは、14の評価分割にわたって36.5%から67.1%へと改善し、その教師であるはるかに大規模なフロンティアモデルとの差を14ポイント以内にまで縮める。以下、各特性を順に検証する。同じドメインでは、浅い環境は実サイト精度をベースモデル未満に押し下げるが(80.0から75.0)、深い環境はそれを引き上げる(80.0から85.0、および48.0から65.0)。多数のレンダリングにわたって一つのインターフェースコントロールを集中的に訓練すると、その効果は未見のウィジェット群やオープンウェブに転移する。また、単一の環境を修復するだけで、その環境で訓練されたモデルは16.2%から38.5%に向上する。同じ環境群は強化学習環境としても機能する。そこでは、データベースに基づく検証器とステップごとの密な判定器を組み合わせた報酬が、未見スコアを58.8%から68.0%へと引き上げる。我々は、アプリケーション、シードデータ、データベースに基づく採点器を備えた4つの環境をベンチマークとして公開する。コード: https://aka.ms/echoverse
メモリは長期的なタスクを遂行するLLMエージェントにとって中心的な役割を果たすが、既存のメモリシステムは主に対話内容を保持するものであり、どのエージェントがどのような条件下で信頼できるかをモデル化するものではない。この制約は、中央モデルがもっともらしい、または相関したピア応答を直接検証できない可能性があるマルチエージェントシステムにおいて特に重要である。我々はΣ-Memを導入する。これは、個々のピアの過去の能力に関する証拠と、ピア集合全体にわたるピア間関係の証拠を記録するオンライン信頼性メモリである。両方の証拠は実対称状態として保持され、意思決定後の正誤フィードバックから更新される。ワイルの不等式により、各イベント単位の更新によって生じるスペクトル変化は有界であり、基盤となるモデルを再学習することなく安定したオンライン適応が可能になる。Σ-Memは汎用的な書き込み・読み出しインターフェースを提供し、同じメモリを中央モデルの残差誘導、応答不要のピアルーティング、あるいは信頼性重み付き投票に使用できる。5つのQwenファミリーのモデルにわたり、Σ-Memは反事実的な信頼性シフトに適応し、未見のピアやタスク領域へ一般化する。また、メモリの直接読み出しは、OOD評価セット全体において多数決投票や最良の固定ピアを上回る性能を示す。さらに、より多くの正誤フィードバックが利用可能になるにつれて性能は一貫して向上し、Σ-Memが実行可能な信頼性情報を漸進的に蓄積していることを示している。これらの結果は、LLMベースのマルチエージェントシステムにおける適応的連携のための再利用可能な基盤として、信頼性メモリを確立するものである。
Transformerは、単一の加算的残差ストリームを通じて情報を深さ方向に伝播する。すなわち、各サブレイヤーは最新の状態のみを読み取る。アテンション残差は、各サブレイヤーが学習されたソフトマックスを通じてすべての過去の状態にアテンションできるようにすることで、この制約を緩和する。しかし、その読み取りは幅全体で共有される単一のクエリを使用するため、すべての特徴部分空間が単一の分布を通じて深さ方向の履歴を読み取らなければならない。この強制された妥協のコストは、各部分空間がどの層を読み取るかについてどの程度不一致であるかに応じて増大し、その不一致はモデル幅とともに拡大する。 本稿では、Multi-Head Attention Residuals(MHAR)を導入する。ルーティングクエリを、深さ方向の履歴に対してそれぞれ独自のソフトマックスを持つH個の部分空間別ヘッドに再形成する。読み取り操作はブロック対角的になり、この再形成はパラメータを一切追加せず、計算コストも無視できる程度である。H=1の場合、アテンション残差と正確に一致する。 重複除去され、品質フィルタリングされ、STEMおよびコードに重点を置いたNemotronベースのアニールコーパスでゼロから学習したMHARは、100M、350M、1Bの各規模で標準Transformerに対する検証損失を改善する(それぞれ-0.061、-0.149、-0.140)。これは、すべての設定で4つの手法の中で最良の結果を達成し、その利得は100Mからより大規模へと向かうにつれて増加する。 ヘッド数は自由に調整できるつまみではなく、実際の設計軸である。検証損失はHに関してU字型であり、各規模でH=4またはH=8に平坦な最適点がある。大規模モデルではH=8を採用する。この点を超える過分割(H=16)は、一貫して利得の一部を失うことになる。学習済みクエリを直接プローブすることで、学習された部分空間の不一致が根本的な要因であることが確認される。 融合Tritonルーティングカーネルは、ベースラインとほぼ同等のピークメモリを維持しながら、アテンション残差の学習スループットをベースライン比0.2〜0.5倍から0.55〜0.88倍に引き上げる。デルタアテンション残差を用いた恒等性を保持する変換は、8B規模の途中学習を可能にし、GSM8Kで+3.2、GPQAで+3.1の改善をもたらす。
深層学習革命は、AlexNetによって幕を開け、問題を手設計の段階に分解することよりも、エンドツーエンドの学習が優れていることを我々に教えた。しかし、生成モデリングは依然として例外であり続けている。生成モデルは驚くほど高性能であるにもかかわらず、いまだにエンドツーエンドでは学習されていない。これは、その核心において、生成モデリングが多峰性を持つ分布の扱いに関するものであり、既存のスケーラブルなアプローチはすべて、生成手順を分解することによって同じ方法でこの問題を処理しており、それがエンドツーエンド生成を妨げているためである。本研究では、代わりに学習ループを分解する新しいパラダイムである探索的モデリング(Explorative Modeling)を導入する。これは、モデルの生成とデータの間でK個の候補マッチを探索し、最良のマッチに基づいて学習することで、予測がモードをぼかすのではなくモードにコミットするようにする。我々は、探索的モデル(XM)が2つの設定で有用であることを見出した。第一に、探索の増加は、既存の生成モデルにとってパラメータとデータを超えた第三の事前学習軸を追加し、この軸における探索のスケーリングは、連続領域と離散領域(画像、動画、言語)の両方にわたって性能を単調に改善する。注目すべきことに、探索による利得は規模とともに増大し、データ規模の拡大に伴い7%から36%へ、モデル規模の拡大に伴い13%から23%へと上昇し、計算量3倍では効率の利得が2倍以上となる。具体的には、探索はFLOP効率を4.1倍、サンプル効率を6.2倍、パラメータ効率を47%改善し、画像生成レシピの中でも最強のものを、ガイダンスなしでImageNet上で最先端に近い1.43のFIDへと引き上げ、既存モデルのエンドツーエンド性のスケーリングを可能にし、スケーリング汎化を実現する。第二に、XMはエンドツーエンドの再構成型生成モデリングを可能にし、制御タスクにおいて16〜256倍少ない推論ステップで拡散モデルに匹敵する。これらの結果は総合的に、XMが既存の生成モデルの新たな事前学習軸であると同時に、スタンドアロンのエンドツーエンド生成モデリングパラダイムであることを確立する。
実運用されているLLMエージェントは、長期記憶をファイルシステムとして保持することが増えている。すなわち、エージェント自身が汎用ファイルツールを通じて読み書き・再編成する、マークダウンファイルのディレクトリツリーである。しかし研究はこの媒体をほぼ素通りしてきた。既存システムは特注の記憶表現を設計し、その上での検索を研究しており、デフォルトの二つの作業仮説は未検証のままである。すなわち、記憶が蓄積・衝突・陳腐化するにつれてエージェントが成長するストアを組織化し続けられること、そしてその組織化が効果をもたらすことである。本論文では、LLMエージェントのためのファイルシステムベース記憶の初の体系的探求を提示する。この設定を、単一の記憶ファイルシステムをめぐる三つの役割として定式化する。管理エージェントは入来コンテンツを統合・組織化し、検索エージェントは引用元付きでクエリに回答し、実行エージェントはスキルへと蒸留されるタスク軌跡を供給する。これにより宣言的記憶とスキルが単一のストアに統合される。長文会話ベンチマークと身体性タスクにわたり、記憶の形状(エージェント組織化階層、逐語ダンプ、チャンク検索)、ストリーム規模、ツールハーネス(サンドボックス化シェル、メモリツール風関数、多様な検索ツール)、ならびに管理・検索エージェントの強度を変化させ、記憶が成長するにつれて回答品質、コスト、ストアの健全性を追跡する。組織化が確実にもたらすのは検索の経済性である。すなわち、組織化されたストアは、資料が大きい場合に検索コストをおよそ半減させる。しかし今日のエージェントはデフォルトの約束には及ばない。我々の成長研究では、最強の管理エージェントを除くすべてにおいて組織化が劣化し、測定したいずれのエージェントも組織化自体をより良い回答に変換できなかった。さらに、ストアの形状を左右するのはモデルだけではない。ツールセットを変更するだけでも、モデルを交換するのと同程度にストアを再形成する。本研究は、ファイルシステムというデフォルトを、エージェント記憶のための前提から設計空間へと転換するものである。
投機的デコーディング(SD)は、軽量なドラフトモデルがトークンを提案し、その後により大きなターゲットモデルが並列に検証することを可能にすることで、大規模言語モデルの推論を高速化する。近年のアプローチでは、厳密な分布一致を緩和することにより効率をさらに向上させるために、非可逆検証方式を導入している。しかし、そのような緩和はデコーディング分布を暗黙に書き換え、結果として得られる高速化は、不安定で、時には深刻に劣化した生成品質という代償を伴うことがある。本研究では、非可逆検証手法によって誘起される分布の原理的分析を提示する。我々は、多くの一見異なるアプローチが表面的にしか異ならず、トランケーションに基づく検証と協調的検証という2つのカテゴリに分類できることを示す。さらに、厳選されたベンチマークにわたる診断的評価フレームワークを構築する。トランケーションに基づく手法については、根本的な落とし穴を特定する:分布の歪みにより、真のトランケーションサンプリングのベースラインと比較して性能が大幅に低下し得る。協調的検証については、重要な原理を明らかにする:ターゲット確率に対するドラフト確率のオーバーシュートを制御することが、低品質な出力を防ぐために不可欠である。我々のコードは https://github.com/ZhouYuxuanYX/Fast-HSD で公開されている。
ディープリサーチエージェントは、LLMベースのアシスタントを、計画立案、検索、エビデンス統合、レポート生成を含む長期的ワークフローへと拡張するが、オープンな情報環境におけるそれらの信頼性は依然として十分に調査されていない。主要な懸念事項は、そのような環境で遭遇する一見もっともらしいが事実に反する誤誘導的知識が、これらのワークフローを通じて伝播し、最終レポートにおいて誤った結論として採用され得るかどうかである。この障害モードを研究するため、我々はMisKnow-Agentを紹介する。これはディープリサーチタスク向けの誤誘導的知識を構築・検証するためのフレームワークである。MisKnow-Agentは、制御可能な権威レベルとスタイルを持つ誤誘導的インスタンスを生成し、DeepResearchベンチマークタスクに基づいて5,933件の品質管理済みインスタンスを生成する。オープンソースおよびクローズドソースのディープリサーチエージェントにわたる広範な実験により、限られた誤誘導的知識への曝露でも最終レポートにおける誤った結論の採用を誘発し得ることが示され、現在のディープリサーチエージェントにおける広範な信頼性の脆弱性が明らかになった。検索機能を備えた検証モデルは、焦点を絞ったコーパス検証中に保持されたインスタンスを一貫して誤誘導的と識別する一方で、同じインスタンスが長期的研究の過程では依然として採用され得る。これは、焦点を絞った検証とワークフローレベルのエビデンス利用との間の乖離を明らかにするものである。最後に、研究前および研究後の防御策を個別および組み合わせの両方で評価し、3つの構成すべてが誤った結論の採用を軽減するものの完全には防止しないことを見いだした。我々の知見は、信頼性の高いディープリサーチには、計画立案、検索、エビデンス統合、レポート生成能力の改善を超えて、モデルレベルとフレームワークレベルの両方でのエビデンス検証および修正機能が必要であることを示唆している。
本論文では、複数の大規模言語モデル(LLM)ベースのエージェントによって駆動されるグループ旅行計画フレームワークであるAI Tour Meetingを提案する。エージェントはそれぞれ異なるペルソナを持たせてインスタンス化され、自然言語での議論を通じて、各自の制約と嗜好を満たす旅程を協調的に探索する。本フレームワークは、エージェントのペルソナ設定、議論ワークフロー、モニタリング、LLMのデプロイメントのためのインターフェースを提供することで、そのような議論の容易かつ柔軟なオーケストレーションを可能にする。主なユースケースは、ツアー計画の議論中における複数のLLMエージェントの行動を分析するためのシミュレーションツールである。本論文では、システム検証と、本フレームワークによって得られたいくつかの分析結果を示すことにより、フレームワークの有用性を実証する。
既存のオムニモーダル大規模言語モデル向けトークン圧縮手法は、典型的にはあるモダリティを基準として、もう一方のモダリティで保持すべきトークンを決定する。本研究では、この前提がしばしば成り立たないことを示す。同じクエリに対して、音声と映像の関連性は異なる時点でピークに達することが多いのである。このモーダル間の顕著性の不一致により、単方向ガイダンスは高圧縮下で回答に決定的な手がかりを破棄しやすくなる。そこで本研究では、クエリを共有の意味的アンカーとして使用しつつ、音声と映像の関連性を別々に推定する、トレーニング不要のトークン圧縮フレームワークであるOmniScopeを提案する。OmniScopeは、モダリティ固有のトークン予算を割り当て、グローバルな文脈と時間的変化の両方を保持するアンカー差分戦略を用いて視覚トークンを刈り込み、さらに1秒単位で音声トークンを統合することで冗長性を削減しつつ時間的連続性を維持する。4つの音声・映像ベンチマークと2つのQwen2.5-Omniモデル規模にわたる評価において、OmniScopeはすべての圧縮設定で最高の平均精度を達成する。全体のトークン保持率25%では、平均精度の低下がわずか0.35ポイントに留まる一方、最大3.53倍のプリフィル高速化と15%以上のGPUメモリ削減を実現する。これらの結果は、OmniLLM推論における単純な設計原則を示唆する。すなわち、クエリはモダリティ間で共有する一方で、顕著性の推定値は共有しないという原則である。コードはhttps://github.com/MAC-AutoML/OmniScopeで公開されている。
本研究は、大規模言語モデル(LLM)における人口統計的バイアスの管理および将来の緩和を目的として設計された、軽量な構造的介入手法であるFairness Pruningを提示する。本手法の基礎的実証検証として、本研究は因果的バイアスの位置特定に焦点を当てる。本手法は、最小対比プロンプトペアと推論時活性化キャプチャを用いて、GLUアーキテクチャにおける人口統計的属性の処理時に異なる反応を示すニューロンを特定し、down_proj入力における信号を評価する。実証評価は、最大30億パラメータのモデル(Llama-3.2ファミリーおよびSalamandra-2B)を対象に実施し、標準化されたベンチマーク評価と質的テキスト生成実験を組み合わせた。結果は、特定されたニューロンのゼロ化が、関連する人口統計変数に対するモデルの応答を変化させることを示している。しかし、平坦な緩和効果を生み出すのではなく、本介入は双方向的バイアス不安定化を引き起こす。すなわち、BiasScoreが符号なしであるため、候補セットにはステレオタイプを強化するニューロンとそれに反対するニューロンが混在し、全体のバイアスに対する正味の効果はどちらの符号が優勢であるかに依存する。本介入は極めて外科的であり、Llama-3.2-1Bにおいて最大40個のニューロン(全MLP幅の0.031%未満)をゼロ化するだけで、推論および一般知識能力において平均99.49%の保持率を達成する。これらの知見は、人口統計的バイアスの処理とモデルの能力が分離可能な回路で動作することを実証的に確認し、盲目的なゼロ化から方向的行動変調への移行の方法論的基盤を確立するものである。
強化学習(RL)検索エージェントは、一般的に検索を自由形式の自然言語クエリ生成としてモデル化し、最終解答報酬を用いて多ターン相互作用を最適化する。既存研究は主に、より密な、あるいはより構造化されたクレジット信号を用いた訓練改善に焦点を当てているが、検索が方策-環境インターフェースにおいて適切に定式化されているかどうかを検討することはほとんどない。我々は、Search-R1訓練中に顕著な検索エイリアシングを観察する:同一の質問に対するロールアウトは異なるクエリ文字列を生成し続ける一方、蓄積されたエビデンス集合はますます重複する。我々はこの現象を検索等価性崩壊と呼ぶ。この領域では、軌跡は検索決定に関して効用等価性に近づき、グループ内リターンは有効な検索コントラストをほとんど持たなくなる。この問題に対処するため、我々はこのインターフェースを再設計するグラフ構造化検索フレームワークであるHarness-Gを提案する。本フレームワークは自由形式クエリ生成を有限行動選択として再定式化する:方策はエビデンス文またはエンティティを選択するか、解答を選択する。一方、環境はメニューを構築し、検索状態を追跡し、各選択を検証・実行する。このインターフェースは言語的エイリアシングを低減し、同一状態における代替案を直接比較可能にする。このインターフェースに基づき、我々は構造化非近視的クレジット(SNC)を導入する。これは凍結解答スコアラを用いて選択された行動をその代替案と比較し、下流の利得をそれを可能にした初期の行動に割り当てる。6つのQAベンチマークにおいて、Harness-Gは評価された両方のモデル規模で最高の平均F1値を達成し、最強のベースラインであるGraph-R1を1.5Bで10.74ポイント、3Bで3.98ポイント上回る。
スパース混合エキスパート(MoE)言語モデルは、各トークンを複数のエキスパートにルーティングする。このことは、その利点に関する幾何学的説明を示唆する。すなわち、同時選択されたエキスパートは、互いに異なる表現方向に寄与するはずである。既存の証拠は、ルートの一貫性、候補の品質、および候補と文脈の交互作用をしばしば混同している。我々は、エキスパート部分空間分離指標(ESSI)、マッチングしたルート残差、およびプレフィックスを制御した2×2要因計画を用いて、これらの量を区別する。ルート固定介入と制御されたTop-k研究は、機能的価値を評価する。3つの対応のある対比が所見を整理する。第一に、6つのMoEアーキテクチャにわたって、エキスパート部分空間はかなり重複しているが、実際のルートは、マッチングした代替ルートよりもトークン表現をよく説明する。第二に、OLMoE、Mixtral、DeepSeekの39の要因セルすべてにおいて、選択された候補は、すべてのセルで最も強い非選択の対立候補よりも残差表現を多く説明するが、実際のプレフィックスはこの優位性を全体にわたって縮小する。すなわち、すべての交互作用は負であり、すべての95%信頼区間はゼロを下回る。第三に、この幾何学的縮小は機能的冗長性を意味しない。39のルート固定比較のうち24で、後続のエキスパートの追加が次トークン予測を改善し、残りの15の推定は決定的でない。さらに、制御された訓練研究も、3つのシードすべてでTop-1よりもTop-2を支持する。我々は、この結合パターンを整合的重複(coherent overlap)と呼ぶ。ルーティングは、共有された幾何学的近傍からトークン関連のエキスパートを選択する一方で、有用な多エキスパート計算は、非交差の線形被覆なしに持続する。これらの量を分離することで、幾何学的類似性だけでは冗長性や枝刈り価値を決定できない理由が明確になる。
オンデバイス音声感情認識(SER)はリアルタイム応用にとって重要であるが、SERに優れた大規模な自己教師ありモデルはエッジデバイスにとってコストが高すぎる。マルチティーチャー知識蒸留はそれらを軽量な生徒モデルへ圧縮できるが、2つの課題が残る。すなわち、ティーチャーの信頼性がバッチごとに異なること、そしてロジットレベルの蒸留がサンプル間の関係構造を無視することである。これらの課題に対処するため、我々は適応的マルチティーチャー関係蒸留(AMRD)を提案する。各ティーチャーのロジット類似度行列に対するワンクラスSVMは、より一貫性のあるティーチャーを優先するバッチごとの重みを割り当てる。関係蒸留損失はティーチャーと生徒の類似度行列を整合させ、ロジットマッチングでは捉えられない構造を獲得する。IEMOCAPおよびCREMA-Dデータセット上の4つの生徒アーキテクチャにわたって、AMRDはほとんどの設定でシングルティーチャー蒸留ベースラインを上回り、アブレーションにより両方の構成要素が相補的な利得をもたらすことが確認された。
我々の先行研究『Pedestrian Archetypes』では、歩行者アーキタイプを、特定の種類の歩行者を一意に識別する行動の集合として定義した。最初の論文では、Wanderer、Drunk、Distracted、Flash、Indecisive、Blind、Flock、Jaywalker、Elderly、Kid、Eventful、Parked Pedestrianを含む12の歩行者アーキタイプを提案した。これらのアーキタイプは、単一の行動ラベルを超え、実際の交通シナリオにおいて危険な歩行者が段階的にどのように振る舞うかを、より自然に記述するために導入された。しかしながら、YouTubeのダッシュカム映像をさらにアノテーションしたところ、以前に提案されたものとは観察可能かつ有意な行動上の違いを持つ7つの追加の歩行者アーキタイプを特定した。これらの新しいアーキタイプは、元の分類体系では完全には説明できなかった歩行者行動パターンを捉えている。本プレプリントでは、各新しいアーキタイプを紹介し、その必須行動と任意行動を定義し、以前に提案されたアーキタイプとの違いを説明し、そのアーキタイプが動作している様子を示す映像フレームの証拠を提供する。