翻訳付きの日次キュレーションされたAI研究論文
AIチューターは、各学生の長所、短所、および好ましい指導方法に適応する際に最も有用であるが、どの指導がどの学生に有効かについてのエビデンスは、実際の学習者から収集するには乏しく、時間がかかり、コストも高い。学生シミュレータは、そのプロキシとしてこのシグナルを提供できるが、既存のアプローチには限界がある。すなわち、状態追跡モデルは学生の行動に適合するものの、説明や修正を処理するのが困難であり、一方、LLMによるロールプレイは指導に流暢に従うものの、模倣対象の学生の能力を確実には再現しない。我々はStudentSimを提案する。これは、プール学習の後に学生ごとの特化を行うことで、学生ごとの疎なデータを個別化されたシミュレータに変換する学習フレームワークである。結果として得られるシミュレータは、学生自身の応答を再現するとともに、チューターの指導のもとでそれらの応答を更新する。また、研究用に共有された匿名化記録を持つ公開学習者データセットを用いて、チェス、第二言語としての英語ライティング、数学にわたる60人の学生を対象とした標準化プロトコルであるStudentSimEvalも導入する。StudentSimEvalは、シミュレータが学生の応答にどの程度一致するかを測定する行動忠実度(F)と、チューターの指導のもとでどの程度容易に更新されるかを示す指導応答性(R)を測定し、すべての手法を同じ記録に適合させて評価する。3つの領域すべてにおいて、StudentSimはGPT-5.4を両指標で上回る。チェスでは、StudentSimはF=0.51、R=0.91を達成し、GPT-5.4は0.23と0.72、Maia2は0.45と0.27である。概念実証として、チューター強化学習の報酬モデルとしてStudentSimを用いることで、専門家による人間の評価において、RLなしベースラインやGPT-5.4シミュレータ報酬に対して訓練されたチューターよりも、より正確で、より適切に指導し、より個別化されたチェスチューターが生成される。コードはhttps://github.com/microsoft/StudentSimで入手可能である。
Here is the translation to Japanese: 本稿では、自動運転のための視覚言語基盤モデルへの初期段階として、Qwen-Drive-1.0を提案する。Qwen-Drive-1.0は、事前学習済み視覚言語モデル(VLM)のアーキテクチャを保持しつつ、3次元知覚、視覚質問応答、および運動計画を統合フレームワーク内に組み込む。外部のBird's-Eye-View(BEV)知覚ヘッドは、3次元物体検出、セマンティック占有予測、およびBEVマップセグメンテーションを併せて実行する。これは、共有表現からアクセス可能な3次元情報の探査手段として機能し、3次元シーン構造への明示的かつ検証可能なインターフェースを提供する。Plan Expertは共有VLM表現に基づいて将来の自車軌跡を生成する。段階的学習レシピは、運転タスクの教師信号を汎用の視覚言語データと組み合わせることで、運転特化の能力を獲得すると同時に、広範な視覚理解および命令追従能力の維持を支援する。実験により、汎用の視覚言語能力を概ね維持しつつ、強力な3次元知覚および運転シーン理解を実証する。オープンループ、疑似クローズドループ、およびクローズドループ設定にわたる包括的な評価により、非常に競争力のある運動計画性能がさらに示される。 Note: The text was segmented into logical paragraphs for readability while preserving the original structure and technical terminology. Key terms such as "VLM," "BEV," "3D," and model names (Qwen-Drive-1.0) remain in English per academic convention in Japanese literature.
Looped Transformerは共有された層ブロックを反復することで実効深さを増加させるが、ほとんどの評価は固定モデルサイズで比較しており、アーキテクチャ上の利点と追加のFLOPsが混同されている。我々はトークンあたりのFLOPs、非埋め込みパラメータ総数、KVキャッシュを厳密に一致させながら、Mixture-of-Experts Transformerに対するループ化を研究する。一連のアブレーションを通じて、我々はSMELT(Sparse MoE Transformer, middle layers Loop Twice)と呼ぶ手法に到達した。これは中央半分の層を2回ループさせつつ、3つの予算すべてにおいてループなしのベースラインと一致するものである。我々はSMELTを非埋め込みパラメータ最大54Bの4つの規模に拡張し、各アーキテクチャに対して個別のChinchilla型スケーリング則を適合させた。SMELTの損失は計算量に対してより速く低下し、計算最適フロンティア上で学習FLOPsの6.8--18.0%を節約する。この利点は検証損失が予測する以上に下流ベンチマークへと転移し、Codeで最も顕著であり、サンプル長と文脈内例の数とともに増大する。機構的分析により、2回目の訪問がアテンションシンクを低減し、内容に関連するトークンへ重みを再配分することが示され、この帰納バイアスが観察された性能向上の根底にある可能性がある。これらの結果は、予算一致の条件下でもループ化がTransformerを改善できることを示しており、深さの再利用を測定可能な利得に変換する実用的な手法を提供する。
マルチモーダルGUIエージェントは、デジタルタスク自動化の有望なパラダイムとして登場してきたが、限られた環境カバレッジ、脆弱なタスク構築、および信頼性の低い報酬検証のために、ベンチマーク指向モデルから信頼できる実世界アプリケーションへの移行は依然として困難である。本研究では、統合された閉ループ推論・行動フレームワークを通じて、モバイル、ウェブ、デスクトップ環境を横断して動作するように設計された汎用基盤GUIエージェントであるUI-Venus-2を提案する。実用的展開に向けたギャップを埋めるため、我々は以下の3つの重要な次元を同時に拡張する。(1) 環境:カバレッジを170以上の多言語モバイルアプリとネイティブデスクトップオペレーティングシステムに拡大する。(2) タスク:関数に基づく命令生成のためのディープリサーチパイプラインを採用する。(3) 検証:トレーニングのための信頼性の高いRLシグナルを確保するために、視覚的キーポイントとマルチモデル投票を用いたトレースレベルおよびサンプルレベルの評価器を採用する。さらに、重大な影響を伴うアクションの制御された実行を確保するために、安全性を考慮したメカニズムを統合する。高性能で効率的かつオープンソースの基盤を提供することにより、UI-Venus-2は、実世界アプリケーションのためのより汎用的で、検証可能かつ自己内省的なエージェントに向けて、この分野を前進させる。
我々は、33BのMiniMax-H3動画生成モデルを対話型世界モデルに変換する効率的なフレームワークH3-Worldを提案する。我々の重要な発見は、大規模な動画生成モデルがより高性能になるにつれて、言語が制御の自然なインターフェースとして現れつつあることである。例えば、MiniMax-H3はすでに、自然言語による指示を通じてキャラクターの行動とカメラモーションのゼロショット制御をサポートしている。これに基づきH3-Worldは、専用のアクションモジュールを導入することなく、この粗い言語インターフェースを、時間的に接地された精確な世界制御へと変換する。具体的には、各アクションをキャラクター指示とカメラ指示の構造化された組み合わせとして表現し、それらを対応する時間的動画の潜在表現と整列させる。制御を時間的に正確にするため、さらに時間的注意ルーティングを導入する。これは、各指示を意図した時間区間に限定し、アクション間の制御漏れを低減する。重要なことに、H3-Worldは大規模動画事前学習中に学習された意味表現を直接再利用し、軽量な適応のみを必要とする。わずか8,000のゲームプレイサンプル、10,000のLoRA最適化ステップ、および0.199%の学習可能パラメータで、H3-Worldは強力な生成品質を維持しながら、効果的なキャラクターおよびカメラ制御を達成する。また、未見のシナリオにも汎化する。これらの結果は、大規模な動画生成モデルに出現しつつある制御能力が、効率的に対話的な世界制御へと変換可能であることを示している。
ロボット操作は、根本的なスケーリング上の課題に直面している。すなわち、ロバストな汎化には広範な物理的経験が必要である一方で、行動ラベル付きロボット軌道は収集コストが高く、本質的に多様性が限られている。エゴセントリック動画は、はるかにスケーラブルな身体化された経験のソースを提供し、多様な環境における物体相互作用、接触力学、ツール使用、および長期的な行動を捉える。中心的な課題は、この豊富ではあるが行動情報を含まない経験を、効果的なロボット制御に変換する方法である。我々は、大規模動画から汎化可能なWorld Action Model(WAM)を学習するためのスケーラブルなフレームワークであるZimaBlueを紹介する。ZimaBlueは3段階の学習カリキュラムに従う。まず、大規模な人間およびロボットのエゴセントリック動画に対して因果的身体化動画事前学習を実施し、次に統一された行動表現を用いた動画-行動中間学習を通じて、学習された視覚的ダイナミクスを異種ロボット軌道に接地し、最後に展開のためにモデルを対象ロボットに特化させる。生成的WAMをリアルタイム制御に実用的なものにするため、ZimaBlueはさらに非同期のSlow-Fast二重システムアーキテクチャを採用する。ここでは、高容量のSlowワールドモデルが汎化可能な時空間表現を提供し、軽量なFastブランチがNVIDIA RTX 4090上での30Hzの行動予測を可能にする。実際のロボットを用いたゼロショット評価では、対象ロボットのデータのみから120,000時間を超える身体化動画へとスケーリングすることで、成功率が36.1%から77.8%に向上した。ZimaBlueはさらに、複数のベンチマークにわたって優れた性能を発揮し、特に未見のタスクにおいて顕著な改善を示す。
データ常駐制約により、企業はLLMをセルフホストせざるを得ないが、旧モデルを廃止せずに新モデルを継続的に導入すると、サービングフリートが拡大し、有限なGPUプールが断片化される。我々は、本番環境のエラー分析によって特定された品質ギャップを、指示追従、関数呼び出し、内部タスク分布という3つの軸に沿って解消することで、200以上の内部アプリケーションからのトラフィックを単一モデルに集約する。品質は、本番トラフィックに層別化されたオフラインベンチマークによって追跡され、決定論的検証器または較正済みLLM判定器によってスコアリングされる。クロスドメインの報酬干渉を引き起こす全目的の同時最適化ではなく、我々は軸ごとに個別のGRPOエキスパートを訓練し、2段階SLERPによってそれらを統合する。各エキスパートの報酬は、意味的崩壊、過剰呼び出し、冗長性ハッキングという異なる失敗モードを露呈し、それぞれにドメイン固有の修正が必要となる。非推論モードにおいて、本手法は社内Arenaで総パラメータ数が約7倍大きいベースラインを上回り(69.6対65.8)、指示追従では0.85対0.83、関数呼び出しでは0.79対0.77を達成し、一方で一般的な対話ベンチマークも向上させる。本モデルは、サービングコストのごく一部で、プラットフォームのトラフィックの50%、月間1億1600万リクエストを処理する。
マルチホップ質問応答(QA)における中心的なボトルネックは、質問が表現される粒度と、コーパス内の証拠が検索可能な粒度がしばしば異なることにある。既存手法は、コーパス上に固定のグラフ構造を課す、クエリを反復的に再構成する、または生成されたプログラムを実行するという方法でこの不一致に対処しているが、これらの戦略は、クエリ単位がいつ既に証拠によって裏付けられ、いつ精緻化すべきかを明示的に決定しない。我々はこのボトルネックを「検索可能な粒度の発見」として定式化し、階層的クエリ精緻化のための証拠条件付きフレームワークであるHi-Qを導入する。各クエリノードにおいて、解決演算子(resolution operator)は、検索された証拠が現在のクエリ単位を裏付けるかどうかを検査する。解決されたノードは終了し、未解決のノードは依存関係を保持する二項演算子によって展開され、意味的カバレッジ検証器によって検査される。したがってHi-Qは、固定の分解テンプレートや事前構築されたグラフではなく、コーパスによる裏付けシグナルによってそのトポロジーが決定されるクエリ木を成長させる。我々は、3つのマルチホップQAベンチマークにおいてHi-Qを評価する。主に、依存する証拠を小さな注釈付きプール内ではなくオープンドメインのディストラクタの中から見つけなければならない、コーパス全体検索の設定で評価する。この設定において、Hi-Qは3ベンチマーク平均でEM 52.3、F1 64.0を達成し、同じ平均において反復検索ベースラインIRCoTをEM 15.1 / F1 18.2上回り、MuSiQue-fullにおいてグラフベースのRAGベースラインPropRAGをEM 11.5 / F1 12.0上回る。しかもコーパス全体にわたるグラフ構築を必要としない。従来研究が用いる制限付きの支持文書/ディストラクタ設定においても、Hi-Qは同様に最高の精度を達成し、平均EM 57.9、F1 69.3となり、PropRAGをEM 5.6 / F1 3.9、IRCoTをEM 13.7 / F1 15.8上回る。プロジェクトページは https://hi-q-project.github.io/ で公開されている。
マルチモーダル大規模言語モデル(MLLM)は、画像や動画に対する強力な知覚能力を持つ。我々は、その到達範囲が行動へとどこまで及ぶのかを問う。すなわち、MLLMをドローンの制御ループに直接投入し、そのアクション空間全体をプロンプト内でのみ宣言する設定である。近年のシステムはこの設定に近づいているが、モデルの意思決定をますます狭めている。我々はその幅を再び広げる。MLLMを交換可能なコンポーネントとして組み込むアーキテクチャDroneCATS-Agent、そしてモデルを独立変数として扱うベンチマークDroneCATSを導入する。我々のエージェントは、単に画素へ向かって飛ぶだけにとどまらず、ヨーイングと探索、不確かな場合の熟考、到着の自己申告を、ファインチューニングも関数呼び出しスキーマも用いずにモデルに委ねる。可視ターゲットへの接近、移動ターゲットの追跡、初期視野外の探索、マルチドローンフリートの指揮という4つの中核的能力について、フロンティアモデルとオープンモデルを評価した結果、最も単純な身体性を伴う設定でさえ、未解決のままであることが明らかになる。さらに重要なのは、エッジで最初に何が破綻するのかを特定するために、評価対象のモデル群を20億(2B)パラメータまで縮小した点である。そこで得られた知見は、はっきりとした逆説を露呈する。失敗するのは飛行ではない。小型のオープンモデルは、フロンティアモデルよりも高い信頼性で成功半径内へ進入することが多いが、到着を時期尚早に宣言するか、あるいはまったく宣言しないかして、エピソードを失敗に終わらせるのである。マルチドローン指揮はこの隔たりをさらに増幅し、小型モデルは、異なる視点にわたって単一の座標を盲目的にコピーすることで失敗する。視覚-言語-行動エージェントとして見れば、モデルの空間知覚は十分に機能しているが、行動プロトコルは機能していない。配備可能なエッジモデルとフロンティアモデルを隔てるのは、ナビゲーションではなく、宣言されたプロトコルを維持し、正しい終了アクションを発行する規律である。未解決の課題は、オンボード計算コストの範囲でこのギャップを埋めること、すなわち、持続的に計画し、いつ完了したのかを正確に認識する高速なモデルを実現することであり、DroneCATSはその距離を測定するために構築されている。
統合マルチモーダルモデル(UMMs)は、単一のモデル内で視覚的理解と生成を同時に実行する一方、機能的な統合は学習における相乗効果を保証するものではない。すなわち、これら二つの目的は、互いに強化し合うこともあれば、モデル容量を競い合うこともあれば、単に共存することもある。我々は、事前学習された視覚的先行知識を持たない、制御された構造的にネイティブな設定において、表現レベル・タスクレベル・システムレベルでのそれらの関係を調査する。表現レベルでは、各目的が他方にとって有用な信号を提供することがわかる。生成は、理解のために学習される視覚的特徴を豊かにし、理解は、生成のための視覚・言語アライメントを強化する。しかし、両目的が同じ計算経路を通るように強制される場合、一方が支配的になる傾向がある。意味的相互作用を維持しつつ、競合する視覚計算を専用化するタスク分離型アーキテクチャは、この非対称な性能劣化を回避する。タスクレベルでは、3つのケーススタディを通じて、理解タスクと生成タスクが共有知識に依存する場合に、正の双方向転移が見られることが確認された。システムレベルでは、エンドツーエンドのUMMが、画像理解と生成の両方を明示的に必要とする複雑なタスクにおいて、同等のプランナー・実行器パイプラインを上回ることを示す。これらの結果は、UMMの価値が統一的なインターフェースを超えて及ぶことを示している。適切な特化、共有されたタスク知識、およびエンドツーエンドの最適化は、共存を相乗効果へと転換できるのである。
長期的な複雑なタスクでは、基盤モデルが情報を蓄積し、内部状態を維持し、長期間の相互作用にわたって適応することが求められる。安全性は、外部の保護手段や教師ありファインチューニングなどの事後的なアラインメントのみに依存する行動制約ではなく、モデル自体の内在的特性であるべきである。この考えに動機づけられたSafety from Within(内部からの安全性)では、安全に関わる能力がモデル本来の計算を通じて表現され、呼び出される。本稿では、メモリルーティングと状態進化によりこの原理を実現する基盤モデル群Safin-1を提案する。Safin-1は、文脈履歴にわたるメモリアンカールーティング(Memory-Anchor Routing across Context History: MARCH)に基づく。MARCHは、構造化されたメモリ状態を維持し、内容に応じて条件付けられたルーティングにより関連する履歴情報を選択的に取得するネットワークアーキテクチャである。これにより、バックボーンを繰り返し変更することなく永続的な能力状態のテスト時適応が可能となり、共有された基盤上での制御された専門化を実現する。本稿では、このインターフェースを下流の安全性タスクにおいてセーフティステート(Safety State)を通じて調査し、状態ベースの適応が効果的であり、安全性を大幅に向上させることを示す。さらに広く見れば、ルーティングされた状態インターフェースは、モデル固有の計算内で文脈メモリと永続的な能力適応を統合し、メモリを過去の文脈の受動的な記録から、モデルの挙動を維持し進化させる能動的な基盤へと再定義する。汎用能力、長文脈理解、検索、効率性にわたる評価により、Safin-1の有効性がさらに検証される。これらの知見は、安全性を状態内在的かつ適応的に維持可能な能力として扱うための道筋を提供する。本研究はSafety from Withinの初期のアーキテクチャ探求に過ぎず、このより広範なビジョンを実現するには、さらなる大規模な研究が必要である。
LLMジャッジは、エージェント型ツール呼び出しシステムの評価に広く用いられているが、構造化された依存関係駆動型ワークフローに対するそれらの信頼性はほとんど検証されていない。我々は、オープンエンドなテキスト評価や嗜好評価といったより広範なLLM-as-a-judgeタスクとは区別される、ワークフローDAG上のエージェント型ツール呼び出しに対するLLMジャッジの信頼性を体系的に研究する最初のベンチマークであるAgentJudgeBenchを提示する。本ベンチマークは、6種類のDAGトポロジーと3つの難易度階級にわたる3,808インスタンスで構成され、5つの生成器(3B〜70BのオープンウェイトモデルとGPT-5.4)と6つのジャッジ(20Bからフロンティア規模まで)を用いて、正解付き条件と正解なし条件を対にして評価した。 ジャッジのアライメントはタスクの難易度に伴って単調に低下し、正解なし条件ではその低下が1.5倍の速さで進行する。さらに、正解なしの難問クエリでは、6つのジャッジすべてがモデル規模にかかわらず77〜82%という狭い帯域に収束する。これは、主にタスク難易度によって駆動される構造的上限を示しており、その上限の高さは弱い生成器に対しては部分的にプロンプトに依存するものの、モデル容量だけでは克服できない。 正解への露出は一律に有益ではない。GPT-5.4ではアライメントを1.5ポイント、Gemini-2.5-Proでは3.9ポイント低下させ、これは過剰アンカリングと整合する。緩和戦略のうち、Chain-of-Thought(CoT)推論とジャッジの温度設定はともに効果が無視できる程度である一方、構造化評価ルーブリックはアライメントを最大6.5ポイント向上させるが、ジャッジ・生成器ペア全体に一様には汎化しない。正解付きの条件では、QwQ-32Bがプログラム的参照評価に最もよく一致し、人間による検証研究ではGPT-OSS-120Bが最も人間の判断に合致するジャッジとして特定される。正解なしの条件では、フロンティアのジャッジは共通の上限内でわずかにリードするにすぎない。これらの結果は、現在のLLMジャッジの根本的な限界を明らかにし、エージェント型システムにおける信頼性の高い評価のための実践的な指針を提供する。
自己対戦は言語モデルの自己進化における効果的なパラダイムであるが、誘導がなければ、ソルバーの性能はラウンドを重ねるにつれて頭打ちになったり低下したりすることがある。非誘導型手法は、難易度、学習可能性、多様性などのシグナルを用いて質問生成を方向付ける。これらのシグナルは質問を挑戦的かつ多様に保つが、後のラウンドがどの未解決の推論上の弱点を対象にすべきかは指定しない。誘導型手法は、人間の例、文書コーパス、指定された難易度目標などの外部タスクリソースから方向性を得るため、自己対戦ループの外部から供給されるタスク情報に依存する。我々は、必要な方向性が、ソルバー自身の失敗履歴から導出できることを示す。我々はDiagEvoを導入する。DiagEvoの診断器はこの履歴から繰り返し発生する誤りの原因を抽出し、それらを階層的な誤り原因メモリに格納する。このメモリは、関連する原因をスキルノードの下にグループ化し、対象質問における自己整合性に基づいて各原因をActiveまたはMasteredとして追跡する。チャレンジャーは、これらの状態と再発回数を用いて、原因を対象とした生成と自由探索のバランスを取る。二重信頼度フィルタリングは、ソルバーの最頻回答が明確な票差で先行する場合にのみ、中間難易度の質問を保持する。DiagEvoは、外部タスクリソースを必要とせず、自己対戦中に生成される情報からカリキュラムを導出する。デフォルトの4B診断器を用いた場合、DiagEvoは、Qwen3-4B、Qwen3-8B、OctoThinker-8Bの3つのソルバーのそれぞれについて、9つのベンチマークすべてにわたる平均精度で全ベースラインを上回る。Qwen3-8Bでは、5つの数学的推論ベンチマークにわたる平均精度が72.3%に達し、R-Zeroを4.5パーセントポイント上回る。9つの全ベンチマークにわたる平均精度は57.4%で、DARCを1.1パーセントポイント上回る。アブレーション実験は、階層的誤り原因メモリと二重信頼度フィルタリングの両方がこれらの向上に寄与することを示している。
本論文は、LLMベースのコーディングエージェントが人間の介入なしに高レベルの要件を完全かつ機能的で利用可能なソフトウェアシステムへ変換する自律的ソフトウェア開発を研究するものである。本論文では、自律開発中にコーディングエージェントがソフトウェアを継続的に改善できるようにするフレームワーク、Harness-of-Harness(HoH)を提案する。HoHは既存のコーディングエージェント用ハーネス上で動作し、それらの実行を反復的な計画・コーディング・テストのループとして編成する。ループをまたいだ改善を持続させるため、HoHは修復と能力向上のバランスをとり、開発を検証可能な小さなインクリメントに区切り、実装時のテストと独立評価を分離し、エージェントのワークフローを規定するのではなく検証可能な出力に制約を課す。またHoHは、成果物、役割固有のツール、スキルを段階的に提供し、再作成ではなく再利用を促進し、バージョン管理されたプロジェクト履歴を維持する。GameCraft-Bench、FrontierSWE、ProgramBench上で3組のハーネス・モデルペア(CodexとGPT-5.5、OpenCodeとDeepSeek-V4-Pro、PiとMiniMax-M3)を評価した結果、HoHは対応する単体ハーネスを一貫して上回り、3回の反復後には平均で52.25%、最大で82.86%の相対改善を達成した。また、70回以上の反復を含む複数日にわたる実行では、HoHは首尾一貫したストーリー、完全に実装されたコアメカニクス、人間がプレイ可能な体験、洗練されたビジュアル、統合されたオーディオを備えたファーストパーソン・シューティングゲームを自律的に開発した。GitHub: https://github.com/Flesymeb/HarnessOfHarness プロジェクトページ: https://flesymeb.github.io/HarnessOfHarness/
マルチモーダルメモリは、長尺動画質問応答に対するスケーラブルなインターフェースを提供するが、既存手法はキャプション、フレーム、文字起こし、要約、あるいはグラフ事実を孤立した断片として取得することが多い。検索は可能であるものの、そのような断片は生成に適した状態にはない。すなわち、言語モデルは、コンテキストが制限され帰属が困難な推論時に、クロスモーダルおよび時間的な整合性を再構築しなければならない。本稿では、メモリ構築中に異種エビデンスをイベントアンカーに結び付ける、イベント中心のマルチモーダルメモリフレームワークであるEM²Memを提案する。イベント索引付きの各メモリセルは、マルチモーダルレコード、時間的コンテキスト、グラフ関連関係、意味的事実、および来歴を整合させ、モダリティ固有の断片ではなく、グラウンディングされたマルチモーダルイベントに基づくコンパクトなエビデンス読み出しを可能にする。3つの長尺動画QAベンチマークにおいて、EM²Memは最強のメモリベースラインと比較して平均精度を2.0、2.4、3.7ポイント向上させ、厳密なイベントレベルのTop-5エビデンス再現率を7.0ポイント向上させ、クエリあたりのレイテンシを4.67倍削減し、総推論トークンを63.66%削減する(コードはhttps://github.com/zjunlp/LightMem に統合予定である)。
認知言語エージェントは、言語モデルにメモリ、ツール、意思決定手順を備えることで substantial な進歩を達成し、エージェントが対話環境において推論し行動することを可能にしてきた。既存のフレームワークの多くは、こうしたエージェントを、ユーザーが指定する境界のあるタスクを解決するシステムとして位置づけている。しかし、ユーザーのニーズ、コンテキスト、サービス手順が持続し変化する長期的な環境において、言語エージェントが持続的な支援を提供し、時間の経過とともに生じる多様なタスクにわたって有用であり続けることが、ますます重要な目標となっている。それにもかかわらず、持続的AIエージェントを特徴づけ、既存の研究を整理し、将来の開発を導くためのフレームワークは依然として欠如している。この目的のために、我々は持続エージェントのための知覚中心アーキテクチャ(Perception-Centered Architecture for Persistent Agents、Pera)を提案する。Peraは、知覚と制御のコンポーネントを中心に構成された持続エージェントを記述するものであり、エージェントはエピソード的なタスク実行、内部コンテキスト、および周囲の環境変化からサービス関連シグナルを継続的に知覚し、これらのシグナルを用いてライフサイクルタスクを構築する。これらのタスクは、エージェントのサービス手順の継続的な運用と適応を駆動する。我々はPeraを用いて、近年の研究を遡及的に整理し、詳細なケーススタディを検討し、より高度な持続エージェントを構築するための将来を見据えた洞察を提示する。ソフトウェア工学がスモールプログラミングからラージプログラミングへと移行したように、Peraは言語エージェントの進化を、長期的に動作する適応的知能システムへの同様のアーキテクチャ的移行として位置づける。
プロンプト最適化はマルチエージェントLLMシステムを改善できるが、最適化されるプロンプトはしばしば、タスク関連コンテンツの生成と、基盤となるコードが依存する実行上重要なプロトコル(メッセージルーティング、出力フォーマット、終了シグナルなど)の指定という、二つの絡み合った役割を担っている。その結果、コンテンツ生成を改善するためのプロンプト編集が、意図せずプロトコルを破壊し、エージェントパイプライン全体を失敗に至らせることがある。我々の重要な観察は、これら二つの役割は異なる表現形式を持つという点である。すなわち、実行プロトコルは通常構造化されている一方、タスク関連コンテンツは通常非構造化言語で表現される。これに基づき、我々は制御・データフロー分離を提案する。この手法では、実行上重要な制御は型付けされ検証されたプログラムオブジェクトとして表現され、タスク関連言語はエージェント通信のための最適化可能なデータフローとして残される。この設計により、最適化器はルーティングやフォーマッティングのインターフェースをプロンプトドリフトにさらすことなく、マルチエージェントの挙動を改善できる。合成推論、協調レビュー生成、保険料率算定ワークフローにおいて、我々のフレームワークは、タスク性能を一貫して向上させながら、最終的なプロトコル有効性100%を実験的に達成する。
長期時間軸にわたるエージェントタスクは、単に短期タスクを多数の対話ターンにわたって連鎖させるものではない。そのようなタスクでは、環境が動的に変化し、長距離の依存関係が存在するため、大規模言語モデル(LLM)は数千ステップにわたって継続的に探索し、経験から学習し、方針を適応させることが求められる。我々は、複数回の交渉相手との交渉と動的事象を1年間の事業運営に統合した、初のオープンソースベンチマークであるE-Commerce Benchを提案する。365日の1年間において、LLMエージェントは複数のオンラインストアを並行して運営し、市場調査、仕入れ先との在庫調達交渉、販売戦略の最適化、注文処理、返品対応、キャッシュフロー管理を行い、年度末の総資産を最大化することを目指す。現実的な販売者側の運営環境を構築するため、商品データと仕入れ先データは実際の電子商取引プラットフォームから取得し、一方で1年分のプロモーション、自然災害、サプライチェーン混乱のカレンダーによって需要が継続的に変化する。再現性を確保するため、市場の両側は決定論的に動作する。顧客の購入と返品は固定された需要モデルに従い、交渉カーネルが仕入れ先の価格設定、譲歩、意思決定を決定し、LLMはそれらの言語化のみに使用される。我々は、年度末資産を含む7つの側面にわたって18のフロンティアモデルを評価し、単一のモデルが全ての側面で優位に立つことはないことを見出した。GPT-5.6 Solは最も多くの収益を上げ、開始資金100,000を1,431,425まで増加させたが、詐欺回避では18モデル中16位であり、運用効率ではFable5に及ばなかった。オープンウェイトモデルの中で、Qwen3.8-Max-Previewは416,252で首位となり、GLM 5.2 (high)を38%上回り、さらに時間軸全体を通じて最強の学習能力を示し、反復注文を通じて価格を漸進的に交渉で引き下げた。我々のコードはhttps://github.com/QwenLM/E-CommerceBenchで公開されている。
学術的なピアレビューやリバタル(反論)などの専門的な学術コンテンツを生成するには、専門領域に関する推論と事実に基づく裏付けの間の複雑なシナジーが必要とされる。本研究では、専門特化型学術エージェントであるInternReviewerおよびInternAdvocateの開発と評価のための包括的なフレームワークを提案する。まず、大規模かつ高品質な学術データセットを構築し、高効率なarXiv検索ツールを統合することで、能動的なエビデンス収集を可能にする。これらのエージェントを最適化するため、統一された目的指標と報酬システムによって駆動されるエージェント型強化学習(RL)パラダイムを実装する。本システムは、参照アンカリングに基づく意味的整合性、構造的コンプライアンス、および引用をリアルタイムの対話ログと相互照合して幻覚を排除する厳格な検証メカニズムを含む多次元基準を採用することにより、主観的なモデルベース評価のバイアスを回避する。実験結果は、この閉ループフレームワーク内で訓練されたエージェントが、推論の深さと引用精度において顕著な改善を示すことを実証している。
AIは、将来のAIシステムを生み出す研究開発プロセスにおいてますます利用されている。我々は、このフィードバックが自己増幅的になる条件を研究する。我々のモデルは、AI能力の成長率が、基準となる研究生産性、再帰的フィードバック、そして研究の進展に伴って増大する難易度にどのように依存するかを記述する。我々は、開発サイクルをまたいで改善が増幅されるか減衰するかを決定する再帰的再生産数R_{AI}を導出する。この量は、フィードバックの強さを、さらなる進展がより困難になる割合と比較する。R_{AI}>1の場合、改善の効果は開発サイクルをまたいで累積し、システムを自己増幅状態に置く。R_{AI}<1の場合、その効果はサイクルをまたいで弱まる。この遷移は、AIの研究開発フィードバックループの構造に依存し、モデル能力の特定の水準で生じる必要はない。したがって、システムは加速が目に見えるようになる前に自己増幅状態に入り得る一方、急速な進歩は自己増幅なしでも起こり得る。基準となる研究生産性の向上は、システムが自己増幅的であるかどうかを変えることなく進歩を加速させ得るが、開発サイクルの期間は増幅にとって制約となる時間スケールになる。研究の困難さの増大は、自己増幅の期間を終わらせ得る。モデルを複数の研究主体に拡張すると、個々の主体が単独では自己増幅的でない場合でも、組織間で共有された改善が研究エコシステム全体を自己増幅的にし得ることが示される。この枠組みは、再帰的フィードバックの強さ、改善が後継システムへどれほど効果的に伝播するか、サイクル期間、さらなる進展の困難さの増大など、再帰的増幅を他の要因による急速な進歩から区別するのに役立つ、AI研究開発システムの測定可能な特性を特定する。
テスト時適応(TTA)は通常、推論時にモデルパラメータを更新できることを前提とする。この前提は、推論専用アクセラレータ、凍結モデルやサードパーティ製モデル、メモリ制約のある配備環境では制約的であり、また標準的なBatchNormベースのTTA構成は、BatchNormを持たないアーキテクチャでは機能しなくなることもある。本研究では、学習済みモデルを凍結したまま適応する問題を扱う。我々は、勾配フリー手法であるCASTERを導入する。CASTERは、ソースクラスの統計量を判別的部分空間に格納し、ターゲットバッチのモーメントからクラス共通のアフィン変換を推定し、分類前にソースクラス分布を解析的に輸送する。CASTERは、逆伝播、オプティマイザ状態、保存されたソース特徴バンクを一切必要としない。4つのバックボーンと7つのデータセットにわたる28のバックボーン・データセット設定のうち27設定で、同一の凍結特徴に基づくk-NNを上回り、その際の保持状態量の中央値は18分の1である。ただし、アフィン輸送は常に信頼できるとは限らない。1000クラスに対して1バッチに64サンプルしか含まれないImageNet-Cでは、無条件輸送によりtop-1精度が21.2ポイント低下する。そこで我々は、経験的な残差-マージン輸送可能性判定を導入する。307の評価セル全体では、10ポイント超の損失を生じるすべての輸送について判定値が3.9を超えるが、無害な領域と破壊的な領域は完全には分離されない。ゲーティングにより、無条件輸送の平均-3.35ポイントという効果は+1.69ポイントの利得に変換され、広い閾値範囲にわたって性能は最良の閾値との差が0.3ポイント以内に収まる。最後に、この判定はメカニズム特異的であることを示す。Tentに適用した場合、更新のわずか4.3%しか受け入れず、Tentが本来得られる利得の0.6%しか維持しない。これらの結果は、CASTERを凍結モデル配備のための軽量適応メカニズムとして位置づけるとともに、その安全性シグナルが有益である場合とそうでない場合を明確に説明するものである。
マルチモーダル幾何推論では、VLMが精密な視覚的関係を抽出し、それを多段階の演繹的推論を通じて保持することが求められる。既存の自由形式の推論トレースは、解答を決定づける判断を不明瞭にし、軌跡レベルの強化学習は、単一の終端信号を応答全体に分配する。本稿では、クレジット割り当て可能な推論を導入する。これは、推論中に顕在化する意味単位が、学習において代替案の比較とクレジット割り当てが行われる場所をも定義するという原理に基づく。この原理を、図を保持しつつ視覚的関係を行アドレス指定可能な実行可能コードとして表現し、推論を型付きイベントに組織化するCode-CoTと、構造的事前分布と型正規化エントロピーを用いてイベント境界を選択し、共有プレフィックスから完全な継続をサンプリングして、結果の差異を局所的なアドバンテージに変換するCE-GRPOという二つの手法によって具現化する。9つの幾何学ベンチマークにおいて、CE-GRPOは平均精度76.04を達成し、Qwen3-VL-8Bおよび軌跡レベルGRPOをそれぞれ8.09ポイントおよび3.43ポイント上回る。その相対的優位性は中間イベント数の増加に伴って拡大し、長く依存関係の強いマルチモーダル推論における表現と最適化の共設計の価値を実証している。
貴重なデータは今もなお、ウェブページ、レポート、契約書、提出書類、決算説明会、PDFといった非構造化情報源の中に埋め込まれたままである。エンタープライズAIにおける大きな賭けは、そうしたデータに対して推論し、あらゆる知識労働者の複雑な質問に答えるLLMエージェントを導入することだ。エージェントは今日すでにこれを実行できるが、そのコストは法外である。個々の質問に答えるたびに、散在する根拠を探し出すため大きな文書を繰り返し開くことになり、最大100万トークンを消費する。しかし、データが既に構造化されていれば、同じ質問は安価なデータベース参照に帰着する。例えばFanOutQAベンチマークでは、理想的な事前構造化ストアに対する推論のコストは28分の1で済み、質問がより多くの文書にまたがるにつれて、その格差は桁違いに拡大する。とはいえ、すべてを事前に構造化することは現実的ではない。文書には、どのワークロードでも使い切れないほど多くの可能な構造が含まれており、どの構造や文書が有用かは、クエリが届くまで分からないからである。 そこで我々は、エージェンティックデータクラッキングを提案する。これは、推論自体の副産物として、非構造化データを適応的かつ投機的に構造化する手法である。適応的と呼ぶのは、観測されたクエリが構造化の実行時期と重要対象を決定するためであり、投機的と呼ぶのは、現在の質問を超えて構造化を行うためである。エージェントが回答のために文書を開くたびに、クラッキングサブエージェントが、既に読み込まれたコンテキストから限界費用で分岐し、関連する将来のクエリに役立つ可能性が高い、根拠に基づく構造を抽出する。時間の経過とともに、構造化データだけで完全にカバーされ、文書を開かずに回答されるクエリの割合が増え、エージェント推論の精度を維持したまま、コストをRAGとほぼ同じ水準に抑えられる。FanOutQAの各テスト質問に、関連質問を1つだけ追加した拡張設定では、クラッキングは精度を保ちながらコストを53%削減する。エージェンティックデータクラッキングは、非構造化データ上のエージェンティックな推論のための次世代データ基盤、すなわち、推論がコストをかけて発見した知識が蓄積される、モデルの下層に位置する共有基盤への第一歩である。
SAR画像をEO画像へ変換するタスクは、合成開口レーダ(SAR)観測から電気光学(EO)画像を生成することを目的とする。既存の潜在拡散アプローチの多くは、所定のオートエンコーダを継承しているが、再構成忠実度はコーデックやモダリティによって大きく変動し得る。潜在コーデックは、SAR条件とEOターゲットの双方のラウンドトリップ保存に影響を与えるため、コーデックの選択は根本的な設計上の選択である。しかし、既存手法は主に自然画像で事前学習されたコーデックに依存している。本稿ではこの問題に対処するため、SAR-EO再構成の共同検証を通じてコーデックを選択する、条件付き潜在フローマッチングフレームワークReFlowSETを提案する。ReFlowSETは、重い事前学習済み生成器を継承するのではなく、選択された潜在空間内で、二重ストリームのSAR条件付けと、それに続く共同特徴量リファインメントを用いて、大幅に小型の条件付きDiTをスクラッチから学習する。このスクラッチ学習に意味的ガイダンスを提供するため、中間のノイズを含むEO特徴量を、凍結した視覚基盤モデルによって抽出されたクリーンなターゲットEO表現と整列させる。この整列は学習時のみに使用され、追加の推論コストは発生しない。QXS-SAROPTおよびSAR2Optを用いた実験により、多様な知覚忠実度指標および分布指標に対する最先端の性能を示す。コードと事前学習済み重みはhttps://github.com/KAIST-VICLab/ReFlowSETで公開している。
伝統的な政治的コミュニケーションの枠組みは、線形的かつ事象駆動型の前提に基づいて機能しており、有権者の説得を静的な取引機能として扱っている。本論文は、Dynamic Consent Engineering(DCE)を導入する。これは、エドワード・バーネイズの広報活動に関する基礎的原理と、システムダイナミクスのS-E-E-D(Snowball, Equilibrium, Elasticity, Dominance)フレームワークを統合した、新規の学際的パラダイムである。バーネイズ派的運用制約を、(人員、知的資源、資本に加えてアルゴリズム型メディア基盤を組み込んだ)四次元のリソースマトリクスへと拡張することにより、民主主義的制度がいかにして政治的優位性を構築し、最適化し、持続させるかを数学的に形式化する。バーネイズの古典的な8段階のエンジニアリング・ワークフローを、非線形フィードバックループ、情報のタイムラグ、人口学的環境収容力に直接対応付ける。システム的フィードバック構造の厳密なモデリングを通じて、政治的弾力性、政策抵抗のプラトー、閾値誘発型の信頼崩壊の動的な根本原因を抽出する。最後に、4段階の診断パイプラインを確立し、歴史的リファレンスモード検証を通じて当該フレームワークを検証する。これにより、長期的な政治的安定性は、一時的なレトリックに依存するのではなく、政策執行と動的フィードバック較正の構造的同期に依存することを実証する。
商業ショートドラマの制作は、脚本、絵コンテ、キーフレーム画像、ショット単位のビデオ、完成したショートドラマへと至る多段階のチェーンで構成される。既存のベンチマークのほとんどは、実際の上流パイプラインの出力ではなく、事前に作られた入力を用いて、ビデオ生成段階のみを評価している。そのため、各段階が(直前の入力プロンプトのみではなく)元の脚本の意図に忠実であるかどうか、また、異なるショットが複数エピソードの作品へと組み立てられた後も一貫性を保つかどうか、という二つの重要な問いは未解決のままである。本稿では、制作チェーン全体のすべての段階を評価する初のショートドラマ・ベンチマークであるDramaChain Benchを提案する。DramaChain Benchは、単一の次元体系を共有する三つの社内システム上に構築される。その次元体系であるDramaChain Dimensionsは、各段階で具体化される五つの評価軸から成り、最終的には63のリーフ次元へと分解される。DramaChain Agentは、ワークフローと完成したショートドラマの品質の両方について、商業ショートドラマのプラットフォームに較正されており、モデル間での段階別の公平な比較を可能にする。DramaChain Labeling Systemでは、全5,785項目の各項目が三人の専門アノテーターによって独立にスコアリングされ、すべての欠陥は時空間的に局所化されるとともに、事前定義された欠陥リストから選択される。このプロセスにより、17,488件の有効スコアと255,925件の追跡可能な帰属記録が生成される。人手によるアノテーションは、上流工程の欠陥がパイプライン全体へ連鎖することを裏付けており、最終的なエピソード品質がビデオ生成のみによって決まるのではないことを示している。その後、DramaChain Agentic Judgeは、すべてのリーフ次元を自動的にスコアリングする。その際、項目別チェックリストに基づいて判定する前に、複数回のエージェント・ラウンドにわたって証拠を収集する。これにより、モデルランキングは平均PLCC 0.918で再現され、アノテーションコストをかけることなく新規モデルを受け入れることが可能になる。
ロジットベースの知識蒸留(KD)は、より強力な教師モデルからの教師信号を用いて小規模な言語モデル(LM)を学習させるために用いられるが、その利点が学習段階を通じて一貫しているかは依然として不明である。我々は制御実験を通じて、標準的なKD定式化であるフォワードKullback-Leibler(KL)蒸留が、事後学習済みの教師モデルを用いた場合、中間学習(すなわち厳選コーパス上での自己教師あり学習からなる中間段階)中には根本的に異なる挙動を示すことを見いだした。驚くべきことに、フォワードKDは、事前学習中には標準的な次トークン予測(NTP)と比較して推論と事実想起性能の両方を同時に改善する一方、中間学習中には、推論性能の向上が続いているにもかかわらず、事実想起能力の獲得を遅らせる。我々は、この段階依存性が、データ領域間における教師モデルの確信度の非対称性と、生徒モデルの変化する知識状態に起因することを明らかにする。すなわち、教師モデルは知識集約型データよりも手続き型データに対して高い確信度を示す一方、生徒モデルは学習の早い段階で低エントロピーな事実知識を獲得する。この不均衡を緩和するため、我々はSwitch Distillationを提案する。これは、教師モデルの予測エントロピーを軽量なルーティング信号として用いて、教師モデルが高い確信度を持つトークンに対して蒸留を行い、それ以外の場合には交差エントロピーにフォールバックする、シンプルな中間学習用の目的関数である。Switch Distillationは、教師モデルの規模にかかわらず、既存の蒸留目的関数を一貫して上回る。標準的なNTPと比較すると、推論性能では1.61〜1.71倍、知識・常識性能では1.13〜1.19倍を達成し、事実想起性能の96.7〜96.8%を維持する。重要なことに、これらの利点は事後学習後も持続する。Switch Distillationは、事実想起性能のギャップを解消しつつ、推論では1.25〜1.32倍、知識・常識性能では1.13〜1.20倍の向上をそれぞれ維持する。
模倣学習によって得られた器用操作方策は、通常、シーン、物体、または指示の変化に対する頑健性によって評価されるが、タスク実行速度の変化に対する性能はあまり検討されていない。そのため、学習者が模倣対象であるエキスパートと比較して、どの程度の時間的頑健性を保持しているかは未解明のままである。我々は、同一のタスク条件、初期条件のサンプリング、および速度倍率の下で、エキスパートと学習者を比較する。この評価を、ロボットが荷物を取得し、向きを変え、挿入する接触リッチなタスクであるParcelStowにおいて具体化する。デモンストレーションは、荷物取得後の操作フェーズについて、速度倍率の範囲を網羅している。スクリプト化されたエキスパートと、そのエキスパートのデモンストレーションから訓練されたAction Chunking with Transformers(ACT)方策は、いずれも公称速度で100%のタスク成功率を達成する。しかし、成功率はデモンストレーションされた範囲内で乖離する。最大速度では、エキスパートの成功率は84%、ACTの成功率は53%である。異なるパラメータ初期化を持つ2つのACT方策は同様の低下を示し、公称速度から最大実証速度までそれぞれ34および48パーセンテージポイント低下した。一方、エキスパートは16ポイントの低下であった。ステージレベルの解析により、最大実証速度におけるACTの失敗47件のうち35件は、挿入時の位置ずれに起因することが示された。相対運動ハンドオフの下では、ACTによる取得はすべて、再配向および自由空間での移送を通じて荷物を保持したが、タスク全体を完了したのは64%のみであり、エキスパートによる取得後は95%であった。評価したすべての方策と速度を通じて、力学的閉合を伴わない414回の取得のうち、タスクを完了したものは一つもなかった。したがって、公称速度でのタスク成功率が等しいことは、実行速度全体にわたってエキスパートの性能が保持されることを意味しない。コード、データ、および評価スクリプトは、https://github.com/coenwerem/parcelstow で入手可能である。