翻訳付きの日次キュレーションされたAI研究論文
ループエンジニアリングは、コーディングエージェントを中心に開発作業を整理する実践として登場しつつある。実践者はプロンプトを一つずつ手書きする代わりに、進捗を監視し、作業を割り当て、チェックを実行し、エージェントが次に何をすべきかを決定するループを設計する。有能なコーディングエージェントであっても、ループは古くなった進捗メモを信頼したり、必要な検証を省略したり、予算を誤った方向に費やしたり、タスクを安全に提出できる前に停止したりすることがある。しかし、一度のエンドツーエンド実行の最終結果だけでは、成功や失敗がループの指示によるものなのか、コーディングエージェントのタスク実行能力によるものなのかを判断することはできない。 我々は、あるモデルが別のコーディングエージェントを長期にわたるタスクでどの程度うまく導けるかを評価するためのベンチマークであるLoopArenaを紹介する。評価対象のモデルはコントローラーである。各コーディングラウンドの後、コントローラーは実行の構造化要約を受け取り、固定された別のコーディングエージェントであるワーカーに対して、次に何を行うべきか、あるいは何を検証すべきかを指示するか、または停止するかを決定する。 LoopArenaは、実行範囲とコストが異なる3つの相補的な設定でこの能力を評価する。タイプIは、評価時にワーカーを実行することなく、実行検証済みの質問を通じて次ステップのループ契約の選択を評価する。タイプIIは、完全なタスクの選択されたスライスに対して反復的な制御を実行するのに対し、タイプIIIは、対応する完全なタスクを初期状態から評価する。完全なタスクでは、観測された最良の厳格成功率は24.69%であり、長期的なループ制御には大きな改善の余地が残されている。コントローラー間のペア比較では、推定推論コストの削減率は平均64.4%であり、タイプIIは主要なコア基準の下で同様の順序付けを生み出す(スピアマンのρ = 0.9747)。ベンチマークデータと評価コードはhttps://github.com/AMAP-ML/LoopArena で公開している。
大規模言語モデル(LLM)にマルチターンのツール呼び出し能力を備えることは、自律エージェントの構築に不可欠である。しかしながら、その進歩は、全長軌跡の模倣への依存によって根本的に制約されている。複数の順序非依存のサブゴールを伴うタスクでは、最適解空間は巨大な組み合わせ的ダイヤモンド格子を形成する。この豊かなトポロジーを一枚岩的な軌跡へと強制することは、深刻なトポロジカル崩壊を引き起こし、有効な代替探索を無差別に penalize して、方策の多様性を著しく低下させる。この問題に対処するため、我々は DART-SD(Diamond-topology Aware Retrieval and Tuning for Self-Distillation)を提案する。これは、グローバルな強制からトポロジー誘導型の局所的修正へとパラダイムを転換する新しいフレームワークである。DART-SD はまず、実行プロセスを収束する Interaction-State Transition Graph(ISTG)としてモデル化し、成功および失敗した探索経路が持つ本来のダイヤモンド構造を忠実に捕捉する。自律的ロールアウト中に、フレームワークは Critical Topological Breakpoint(CTB)を特定し、成功によって裏付けられた回復参照を取得する。最後に、CTB 誘導型の局所的監督を通じて漸進的な自己蒸留パラダイムを導入し、生成された回復ステップに対してのみ学習損失が計算されることを保証するとともに、有効な推論プレフィックスを破壊的な勾配更新から厳密に保護する。複雑なマルチターンツール呼び出しベンチマークにおける実験は、DART-SD が従来の全軌跡ベースラインを大幅に上回ることを実証している。
ロボットデータのスケーリングは、汎用性の高いVision-Language-Action(VLA)モデルを構築する上で極めて重要である。しかし、ロボット軌道は、身体性を伴う収集にコストがかかり、物理世界を疎にしかカバーしないため、ウェブ規模の画像テキストデータよりもスケーリングが困難である。このことが表現品質を中心的なボトルネックにしている。すなわち、固定されたロボットデータ予算の下では、継続的事前学習は、限られた軌道を単に動作に適合させるのではなく、転移可能な視覚行動知識へと変換しなければならない。我々は、タスク固有のファインチューニングの前に、広範かつ異種混在のマルチ身体性ロボットデータで学習されたVLA指向のVLMバックボーンであるVLActを提案する。VLActは、VLM事前知識の保持、マルチヘッド連続動作の共同監視、および部分的に統合された身体性横断的動作レイアウトにより、広範なVLM事前知識を保ちながら身体性を超えた共有動作セマンティクスを促進する。一方で、ファインチューニング時にはタスク固有のアクションヘッドを許容する。シミュレーション、実世界、および未見の身体性への転移の全体にわたって、VLActは固定されたファインチューニングプロトコルの下で下流タスクのパフォーマンスを一貫して向上させる。LIBERO-PlusおよびRoboTwin 2.0において、VLActはABot-M0やLingBot-VLAを含む産業用VLAシステムを凌駕し、82.6%および92.5%の成功率を達成する。RoboDojoでは、VLActは成功率において全ポリシー中6位にランクインし、明示的に指定されたワールドアクションモデル(WAM)の全エントリを両指標で上回る。最も注目すべきは、未見のヒューマノイド身体性であるRoboCasa-GR1において、VLActが下流タスクの軌道のわずか20%のみを用いて、全データを使用したGR00T-N1.6ベースラインを上回ることである。これらの結果は、完全にオープンソースのデータとわずか16-GPUの学習環境のみを用いて得られており、表現中心の継続的事前学習が控えめな計算予算の下で非常に競争力のあるパフォーマンスを発揮できることを示している。これは、データスケーリングを超えたVLA進歩の重要な独立した軸である。
生成モデルは、自然言語プロンプトを画像、テキスト、コード、その他のコンテンツに変換し、ドラフトや構成要素の作成コストを低減できる。その実用的な影響は、それらの断片が完全で信頼性のある成果物になり得るかどうかにますます依存している。本サーベイは、エージェント的成果物生成(agentic artifact creation)を検討する。これは、AIシステムが成果物を実質的に構築または改訂し、中間的な観測結果がその後の作業を方向付ける、状態を保持する構築として定義される。機能的には、このプロセスは、成果物の操作可能な表現、構築ポリシー、およびその後のアクションを方向付け得るフィードバックを提供する実行時検証を結びつけるものである。2026年8月20日までに利用可能な259件の研究をレビューした。この定義を満たす230のシステムと、エージェント的成果物構築の29のベンチマークである。6つの成果物ファミリーを比較し、その後、アプリケーション設定と評価実践を別々の次元として分析する。ファミリー全体を通じて、構築の課題はモダリティだけでなく、決定がどの程度緊密に結合されているか、障害が修復可能なうちに可視化されるかどうかにも反映される。分解は局所的な複雑さを低減できる一方で、調整コストと再組み立てコストを増加させる。学習ベースの評価器は、生成器の選好や盲点を共有する場合、独立した証拠をほとんど追加しない可能性がある。我々は、コミットメントと責任を明確に保ち、フィードバックを的を絞った修復に変換し、変更後に影響を受けた状態を再検証するための原則を定式化する。また、成果物、作成者の意図、構築システムが進化するにつれて、一貫性があり説明責任を伴う制御を維持する機会も特定する。厳選された論文リストはhttps://github.com/GeminiLight/awesome-agentic-artifact-creationで入手可能である。
物理的理解と推論は、世界のコンパクトで汎化可能な表現を形成することに依存する。現代の視覚言語モデルは多様な物理的事象を認識・説明できる一方で、世界がどのように進化し介入にどのように応答するかを確実に推論するために必要な、基盤となるメカニズム(物体の状態、物理パラメータ、支配的なダイナミクスなど)の明示的な表現を欠いていることが多い。本研究では、実行可能な世界表現を通じて物理世界を表現するパラダイムであるCode-as-Worldを提案する。物理的構成、動的進化、視覚的外観を実行可能なコードとして表現することにより、Code-as-Worldは物理世界のコンパクトで定量的に根拠づけられ、制御可能な抽象化を提供する。そのような表現を自然言語記述や実世界ビデオなどのマルチモーダル観測から構築するために、我々はアブダクション推論に着想を得たエージェント的発見ループを開発する。このループでは、エージェントが実行可能な世界仮説を提案、実行、レンダリング、検証し、反復的に洗練する。具体的な応用として、我々は検証済みの実行可能世界を用いて、定量的物理推論における視覚言語モデルの訓練のためのスケーラブルな物理的監督を提供する。実験の結果、Code-as-World-VLはQuantiPhyにおいて最先端の性能を達成し、主要なプロプライエタリモデルを上回り、実行可能世界表現が物理的知能のスケーラブルな基盤となる可能性を示している。
近年、自己進化型言語モデルは、人間の監督コストの削減という利点を備えた、スーパーインテリジェンスへの有望な道筋として登場している。検証可能な領域ではかなりの進歩が見られる一方で、検証不可能な領域における自己進化は、依然として十分に探究されていない。本稿では、ゼロデータからの判定器共適応(J-Zero)を提案する。これは、挑戦者(Challenger)・解決者(Solver)・判定器(Judge)を統合した共進化フレームワークであり、両領域にわたる自己改善を支援する。挑戦者と解決者は、対抗的相互作用を通じて共進化する。すなわち、挑戦者がますます困難なタスクを生成し、解決者がそれらに対するより高品質な応答を生成することを学習する。並行して、判定器は、判定器自身のスコアではなく、各応答の生成方法から順序が事前に分かっている選好ペア、すなわち、解決者の回答を挑戦者の回答よりも優先し、解決者の分解・再結合された回答をそのワンショット回答よりも優先するペアを用いて共適応する。J-Zeroは、検証可能領域で平均4.2ポイント、検証不可能領域で平均8.0ポイント、ベースラインを上回り、少なくとも10回の反復を通じて改善を続ける。一方、ベースラインは2回の反復後に性能が低下する。
言語モデルの事前学習は、法外なコストとほぼ同義となり、学界やオープンソースコミュニティの多くにとって手の届かないものとなっています。オープンウェイトモデルやオープンソースの学習レシピなど、強力なオープンソースの取り組みはすでに存在しますが、コスト効率が高く、ハードウェア要件が低く、オープンソースである事前学習レシピは長い間欠如していました。小規模であっても、Llama-3.2-3Bの学習には150万ドル以上かかり、SmolLM3-3Bの再現には70万ドル以上が必要です。本レポートでは、この障壁を低くするために設計されたオープンな事前学習レシピを提示します。このレシピを用いて、コンシューマー向けGPUであるRTX 5090上でFP8精度により、最大1.4兆トークンを使用してPuro-2Bモデル群をゼロから学習しました。このモデル群における各モデルは、トークン予算と選択したレシピのバリアントが異なります。最良のモデルは、6.9Kドル未満の計算コストで学習され、我々の評価プロトコルにおいてQwen2.5-1.5Bの性能に迫ります。このコスト効率は、ハードウェアの選定、低精度学習、ハイパーボール最適化、カリキュラムモデル平均化、データレシピなど、複数のアプローチの組み合わせによって実現されています。レシピ自体に加えて、追加の成果が2つあります。第一に、Puro-2Bモデル群全体にわたって、学習コストと平均モデル性能を関連付けるPuro Cost Scaling Law(Puroコストスケーリング則)を導出しました。フィッティングされた則によれば、約4.4Kドル(5,090ドル未満)でQwen2-1.5Bの性能に到達するのに十分であることが示唆されます。第二に、エンドツーエンドのケーススタディとして、事前学習データのカリキュラムがポストトレーニング後の下流性能をどのように形成するかを調査します。このような制御された研究は、モデル重みのみではなく完全な事前学習パイプラインにアクセスできることによって可能になります。我々は、Apache 2.0ライセンスの下で、データ、コード、モデル重みを含むPuro-2Bの完全な学習レシピをhttps://huggingface.co/collections/thu-pacman/puro-2bにて公開します。
極めて長いビデオからのストリーミング3次元再構成では、制限されたメモリと計算量の下でカメラ運動とシーン形状をオンラインで推定する必要がある。初期のストリーミングモデルは、有限コンテキストバッファやコンパクトなリカレント状態を用いて因果的かつコスト有界な推論を実現するが、その推定結果はシーケンスが長くなるにつれてしばしば劣化する。最近の手法は、短距離コンテキストと永続的または多レベルの長距離メモリを組み合わせることで、長期的な安定性を向上させている。我々は別のアプローチを取る。学習された時間状態を厳密に局所に保ち、そのターゲットがシーケンス長に依存しない予測を定式化する。本稿では、直前の11フレームのみからKV特徴をキャッシュするシンプルなストリーミングモデルABot-Reconを提案する。これは、現在のカメラ座標系におけるポイントマップと、隣接フレーム間の相対姿勢を予測する。これらの予測は基準座標系の変更に対して等変であり、グローバルな姿勢と形状は逐次合成によって復元される。蓄積ドリフトを低減するため、軽量な時間リファイナーが最近の視覚・動きコンテキストを用いて相対回転を改善し、さらに合成を考慮したポーズ損失が多段階のポーズ合成を監視する。挑戦的な長いシーケンスのベンチマークにおける広範な評価により、我々の局所コンテキストアプローチが優れた長期的性能を持つことが実証される。Oxford Spiresでは、ABot-ReconはATE 4.35 m、RPE-R 0.12°を達成し、従来の最良結果と比較して両方の誤差を約40%削減する。
本稿では、モデルの重みを固定したまま環境固有のエージェントハーネスを進化させるフレームワークであるStarHarnessを提案する。進化したハーネスには、プロンプトとタスクの枠組み、ツールインターフェース、スキル、MCPベースのプロバイダー、サブエージェント構造、エージェントループ設定を含めることができる。StarHarnessは、ベースラインの失敗挙動に応じてタスクを層別化することによりコンパクトな進化プールを構築し、提案者に可視の探索タスクと提案者に非表示の選択タスクを分離し、汎化を評価するためのホールドアウトタスクを確保する。ITBench SRE、EnterpriseOps-Gym ITSM、AutomationBench Financeにおいて、ハーネスの進化により、環境あたり4〜12件の受け入れられた変更の後、デフォルトのハーネスと比較してベンチマーク全体の性能が20〜35パーセントポイント向上する。これらの改善は、進化から除外されたタスクでも持続し、GPTおよびQwenモデルファミリー間で再進化を必要とせずに転移する。トレース分析により、これらの改善はインターフェース修復、環境の慣習、探索を圧縮する運用知識に関連付けられ、いくつかの設定では偽陽性の診断が減少し、軌跡が短縮されることが示される。したがって、StarHarnessは、ツールが豊富なエンタープライズタスクにおける持続的なモデルと環境のミスマッチを軽減する実用的な方法を提供する。
視覚-言語-行動(VLA)モデルはマルチモーダルなコンテキストをロボットの行動に変換できるが、その行動デコーダは依然として主に行動模倣(ビヘイビアクローニング)によって訓練されている。これは、どの運動指令が実証されたかを監視する一方で、指示の下でその行動が果たす局所的な目的を暗黙のままにしている。未来ベースの監視は、フレーム、潜在観測、軌跡、または動作表現を用いて行動学習を豊かにするが、これらの信号は、今後起こり得ることの特定の実現形態を捉えるものであり、今後の行動の共有された意味的目標を捉えるものではない。我々は、行動レベルの意図を行動デコーダに蒸留する意図蒸留(INDI)を提案する。訓練中、凍結された教師VLMが、現在の観測、指示、粗い行動要約、および対応する実行ビデオから実証されたセグメントを解釈する。展開されたVLAは、その標準的な入力から、中間デコーダ層で得られたマルチモーダル意図表現を回復し、それを使用して、行動がどのように展開し、何を達成するかの表現とともに行動予測を組織化する。SimplerEnv-Bridgeでは、INDIはGR00T-N1.7を64.3%から84.7%に改善し、RoboCasa Kitchenでは、対照GR00T-N1.7ベースラインを64.1%から70.3%に改善し、両ベンチマークでπ_{0.5}に一貫した改善が見られる。実世界のタスクでは、INDIは平均成功率を62.0%から68.7%に改善し、より長いホライズンのタスクでは最大12.0ポイントの改善が見られる。さらなる分析により、回復された潜在表現がデコーダによって使用され、行動の目的と実行進捗を捉え、下流の予測を目的依存的に組織化することが示される。これらの結果は、行動デコーダが生成する行動の意味的目標を明示的にモデル化することの利点を示している。
自己回帰ビデオ拡散は、制限された最近のコンテキストからチャンクを生成することで、スケーラブルな長尺動画生成を可能にする。最近性ベースのキャッシングは局所的な連続性を維持する一方で、被写体、物体、シーン、または属性が再出現する際に必要となる歴史的手がかりを退避させる。既存のメモリ機構はモデルを非局所的な履歴にさらすが、アクセスだけでは効果的な利用は保証されない。我々の分析により、ビデオDiT層は現在、最近、遠いコンテキストに対して異なる選好を示すことが明らかになり、長距離メモリには何を検索するかとどこで使用するかの両方を決定する必要があることが示唆される。我々はLayerRecallを提案する。これは現在条件付きの層選択型メモリルーターであり、関連する履歴K/V状態を取得し、それらをバックボーン固有のメモリ感応層にのみ注入し、他の場所では局所的な注意を維持する。希少な高品質な長期間ビデオや明示的なメモリ割り当てラベルへの依存を減らすため、我々はさらにクロスホライズン予測マッチング(CHPM)を提案する。これは特権的な長文脈参照を用いて、予測空間で制限付きメモリルーターを監督する。100のマルチショット評価プロンプトにわたって、LayerRecallはMemoBenchとMovieBenchで総合最高の結果を達成し、VBench-Longではバックボーンに一致し、局所的な連続性を犠牲にすることなく、より強力な長距離回復を示す。定性的分析はさらにメモリ誘導の自己修正を明らかにする。これにより、最初に不一致だった局所属性が、進行中のモーションやシーン構造をリセットすることなく、歴史的な外観に戻る。追加の分析は、クロスバックボーン移植性と無視できる推論オーバーヘッドを示す。
リカレント高速重みメモリと選択的状態空間モデルは、拡大し続ける文脈を固定サイズのリカレント状態へと圧縮し、その状態遷移をオンライン学習則としている。本研究では、この学習則を、書き込み後読み出しの自己回帰セマンティクスの下で考察する。ここで対象とするプレフィックス予測目的関数において、ステップtで明らかになる局所的な高速メモリの例は、プレフィックスに整合するペア (x_t,y_t)=(ϕ(k_{t-1}),v_t) である。一般的な同ステップの関連付け (ϕ(k_t),v_t) は因果的ではあるが、異なる内部目的関数を最適化する。我々は、二乗誤差回帰と負の内積目的関数に対する正規化一次更新を導出する。回帰ファミリーは、Falcon-1(スカラーNLMS更新)、Falcon-2(その列ごとの拡張)、Falcon-3(スライディングウィンドウミニバッチ更新)から構成され、Falcon-1A/Falcon-2A/Falcon-3Aは対応する内積バリアントである。さらに、リカレント形式・マスク並列形式・チャンク並列形式を提供するとともに、数値的に安定な正減衰再正規化も示す。代表的なバリアントは言語モデリングにおいて競争力を維持し、可変桁数の加算における長さ外挿を改善する。この枠組みは、リカレント系列モデルにおける時間的整合、可塑性、忘却、有界リハーサルを分離する。
長期的なエージェントタスクでは、大規模言語モデル(LLM)がマルチターン対話を通じて分散した情報を反復的に検索・統合・保持することが求められるが、すべての対話履歴を保持すると作業コンテキストが継続的に増大してしまう。近年のプロアクティブなコンテキスト管理手法は、モデルが専用ツールを用いて自身の作業コンテキストを編集することを可能にするが、依然として次の3つの主要な制限がある。(1) ツールセットが検索・削除・要約に限定されており、グローバルな計画、長期記憶、適応的圧縮をサポートしない。(2) コンテキスト管理アクションを、最終結果への影響が異なるにもかかわらず一律に扱うため、探索が非効率である。(3) 強化学習中、最終的な軌跡レベルの報酬をすべての中間的なコンテキスト編集アクションに割り当てるため、クレジット割り当てが粗粒度である。これらのギャップを埋めるため、我々は長期的エージェント推論のためのプロアクティブなコンテキスト管理フレームワークであるContextPilotを提案する。本手法は、計画、長期記憶、ソフトコンテキストオフロードツールをツールセットに体系的に追加する。さらに、コンテキスト管理に特化したRL手法を提案する。この手法は、コンテキストとエントロピーの変動を用いて分岐サンプリングのための重要な編集決定を特定し、対応するコンテキスト編集アクションを通過するすべての分岐軌跡からアクションレベルのアドバンテージを推定する。長期コンテキストQAおよび深層検索タスクにおける実験により、ContextPilotがよりコンパクトな作業コンテキストでより強力な性能を達成し、様々なベースモデルとベンチマークにわたって既存のベースラインを一貫して上回ることが示された。コードは https://github.com/Tencent/ContextPilot で公開されている。
時空間ビデオグラウンディング(STVG)は、モデルが参照されたイベントの発生時刻を特定し、その区間全体にわたって対象エンティティを位置特定することを必要とする。既存のマルチモーダル大規模言語モデルは、通常、密な位置特定トラジェクトリを自己回帰的にシリアライズするため、デコード遅延がチューブ長に応じて増大し、位置特定エラーが時間的に伝播する可能性がある。我々は、並列チューブデコーディング(PTD)を導入する。これは、グラウンディングを時間ブロックと、それに続く時間条件付き空間ブロック(同時にデコードされる)に分解する生成的定式化である。これにより、トークンレベルとトラジェクトリレベルの両方の依存関係が除去され、逐次デコード深さがチューブ長に依存しない固定の1+1ラウンドに削減される。並列空間生成を可能にするため、共有ビデオクエリコンテキストへのアクセスを維持しつつクロスボックス依存関係を排除する分離ブロックアテンションと、時間的境界と空間的幾何学のための位置特定認識ポリシー最適化を導入する。VidSTGにおいて、PTDは標準的な自己回帰デコードと比較して、チューブ完了レイテンシを79倍削減し、空間デコードスループットを92倍向上させ、さらにグラウンディング精度も改善する。コンパクトな4Bバックボーンを用いることで、我々のモデルはVidSTGおよびHC-STVGで良好な性能を発揮し、時間的グラウンディング、グラウンデッドVideoQA、参照ビデオオブジェクト追跡へのゼロショット汎化を実現する。これらの結果は、並列チューブ生成がビデオにおける自己回帰的位置特定の効率的かつ効果的な代替手段であることを示している。
事実に基づく質問応答(QA)は通常、単一の標準的回答を前提としており、大規模言語モデル(LLM)がロングテールな事実に関する多様な記述を保持しているかどうかを不明瞭にしている。このギャップを埋めるため、我々はElephantBenchを導入する。これは、監査可能なグラフベースのパイプラインにより生成された1,094問からなるクローズドブック知識プローブである。このパイプラインは、曝露度の低いウェブコーパスから関連文書を取得し、自然に発生する記述間の相違を特定して、それらを複数記述QAレコードに変換する。各回答は、出典文書および信頼できる公開ウェブソースに対して検証され、さらに人間のアノテーターによるレビューを受ける。32モデルを対象とした評価では、最強のモデルでも質問の52.4%においてのみ両方の記述を再現でき、残りのほぼ全ての質問では一方の記述のみを想起し、他方が欠落していた。モデルサイズと推論時推論のスケーリングは想起率を向上させるが、この不完全性を解消するには至らない。コーパス分析はさらに、曝露の不均衡が支配的な記述に有利に働く一方、マイノリティ側への曝露が大きいほど想起がより完全になることを示している。これらの知見は、ElephantBenchをパラメトリックメモリにおける認識的近視を診断するための再現可能な知識プローブとして確立する。さらに広く見れば、我々のグラフベースのベンチマーク構築パイプラインは、ロングテールコーパスをソース追跡可能な知識プローブへと変換する効率的かつスケーラブルな方法を提供し、次世代LLMの認識論的厳密性を評価・向上させる取り組みを支援する。コードはhttps://github.com/Tencent/ElephantBenchで公開されている。
LLMベースのエージェントはツール呼び出しを通じて外部環境と対話できるが、この能力はファイル改ざん、情報漏洩、不正なアクションといったセキュリティリスクももたらす。既存のガードレールは完了した軌跡を評価することが多く、ステップレベルのアクションに対する実行前監視は未開拓のままである。我々は、完了したエージェントの軌跡を監査し、ツールアクションを実行前にチェックできるステップレベルのガードモデルであるStepGuardを提案する。StepGuardを訓練するために、同じコンテキストでリスクのあるステップのアクションのみが異なる安全・不安全な軌跡を生成する自動データエンジンであるStepGenを導入する。過剰防衛と過小防衛をさらに低減するため、観測された精度に基づいて安全アクションと不安全アクションの学習を動的にバランスさせるBalance-GRPOを提案する。実験では、StepGuardはオープンウェイトのガードモデルの中で最高の平均精度を達成し、GPT-5.4に匹敵する性能を示す。AgentDojoとAgentDyn上のエージェントをガードする際、StepGuardはガードなし設定と比較して平均攻撃成功率を77.3%削減し、平均ユーティリティはわずか2.8ポイントの低下にとどまる。
二次アテンションの性質上、大規模言語モデル(LLM)は膨大なメモリとエネルギーを消費する。新しいトークンは常に前のトークンよりもコストがかかる。トークンが追加されるたびに、そのキーとバリューをメモリに無期限に保存する必要があり、この仕組みは持続不可能である。 この二次スケーリング問題を解決するため、いくつかの代替手法が提案されてきた。その一つが、既存のLLMを線形アテンション用に後付けで改造する方法である。このアイデアは、低コストで最先端の性能を維持しつつ二次スケーリング問題を解決できる可能性から、大きな注目を集めている。しかし、この研究方向は、より単純なベースラインと適切に比較されていない。 本研究では、アテンションシンクを備えたスライディングウィンドウアテンション(SWA)が、後訓練された線形アテンションモデルと同等以上の性能を発揮することを示す。この結果は、複数のLLMとさまざまな下流タスクにわたって観察された。長文脈推論タスク(Needle-in-a-HaystackやBABILong)では、SWAは線形アテンションよりもはるかに高い性能(2~10倍)を達成する。SWAは後訓練が不要で、極めて高速であり、必要なメモリも少ない。したがって、SWAは非常に低コストで信頼性の高い解決策である。 推論時のメモリコストを削減するために、線形アテンションモデルを後訓練する代わりにSWAへ切り替えることを強く推奨する。線形アテンションモデルにはある程度の有望性が見られるかもしれないが、SWAに匹敵するには、ゼロから訓練するか、大規模な後訓練が必要になる可能性が高い。
評価は静的QAから、モデルが外部ツールを通じて行動するエージェント的な設定へと移行しつつある。我々は、この領域において重要でありながら未開拓の能力、すなわち「器用な視覚ツール使用(dexterous visual tool use)」を特定する。これは、モデルが視覚的証拠からツールのパラメータを推論し、そのパラメータが最終結果を直接決定する、細粒度かつ閉ループのパラメータ化された視覚的行動である。既存のベンチマークはWebナビゲーション、GUI操作、ソフトウェア工学をカバーしているが、視覚的証拠と実行精度のこの結合を対象とすることはほとんどない。我々は、参照ガイド付き視覚再構成を主要な代理タスクとして採用する、器用な視覚ツール使用の制御された事例を評価するベンチマークEASELを提案する。このタスクでは、エージェントが参照画像に一致するようにキャンバスを段階的に描画する。EASELはさらに、領域アノテーション、手書き、経路計画にわたる意味的タスクを含む。さらに、軌跡の教師信号のための44万サンプルの二段階カリキュラムデータセットであるEASEL-Dataと、このデータセットが当該能力に与える効果を調査するためのEASEL-9Bを提供する。25モデルの評価により、現在のマルチモーダルエージェントがEASELで一貫して苦戦することが明らかになる。再構成類似度は低い水準(0.40〜0.54)で頭打ちとなり、軌跡診断は深刻な閉ループ不安定性を露呈する。モデルは典型的には早期に飽和するか、ピーク後に劣化する。意味的タスクは、精密アノテーションと経路計画における明確な能力境界を明らかにする。EASEL-Dataで訓練されたEASEL-9Bは、ベースモデルを相対的な6.3%の向上で上回り、評価された全モデル中第3位となった。
ビデオ生成を長時間へとスケーリングすると、重大なボトルネックが顕在化する:現在のモデルには堅牢な長期記憶が欠けている。この欠陥は、二つの重要な側面に沿って研究できる。物体の永続性(再出現時に物体の外観を正確に再現する能力)、および記憶容量(超長文脈を処理し、遠い履歴からの情報を利用する能力)である。堅牢な長期記憶には、この両方が必要である。十分な文脈処理を伴わない物体の永続性は時間的範囲を制限し、永続性を伴わない長い文脈長は同一性を維持できない。この問題に対処するため、我々はリングフォーシングを提案する。これは、長期記憶を堅牢に構築し、正確に活用するように設計された自己回帰ビデオ拡散フレームワークである。我々のリング構造の学習戦略は、遠い履歴からの検索を強制し、厳密な履歴追従と生成的多様性の間のトレードオフを効果的に両立させる。記憶容量を拡張するために、我々は圧縮とタイムステップ合成の戦略を導入する。固定されたシーケンス長の制約の下で、この方法は有効な履歴スパンを数分間の長さに拡張し、履歴全体にわたる包括的な受容野を達成する。さらに、我々はスパースRoPE機構を提案し、事前学習済みの事前分布を完全に活用しながら、柔軟でスケーラブルな記憶適応を可能にする。広範な実験により、リングフォーシングが優れた数分単位の一貫性と物体の永続性を達成し、最先端の手法を大幅に上回ることが実証された。
最近の幾何推定への生成的アプローチは、事前学習済みの画像拡散モデルを適応させ、タスクを画像条件付き生成として扱う。既製の画像拡散モデルを活用するこれらの手法は、(i) 深度推定と表面法線推定のためのタスク固有の幾何モデルを個別に訓練し、これらの幾何ターゲットの本質的な相関を探る機会を失うか、あるいは (ii) 変更を加えた画像拡散バックボーン(例:改変された自己アテンション)を共同でファインチューニングするが、これは通常、大量のラベル付きデータを必要とする。これらの制限を原理的に克服するため、我々は事前学習済みのビデオ生成モデルを幾何推定のための統一されたデータ効率的なフレームワークとして再利用し、これを革新的に次フレーム予測タスクとして定式化する。我々の手法であるGeoNeXtは、ビデオモデルから自然に構造化された知識とより豊かな事前知識を継承しつつ、それらを画像と幾何ターゲットの共同モデリング(画像 ↔ 幾何)に適応させることで、よりデータ効率的かつ効果的な幾何学習を可能にする。広範な実験により、多様なデータセットにわたるゼロショット単眼深度推定と表面法線推定において我々の手法を検証し、大幅に少ないトレーニングデータでありながら、従来のタスク固有および統合生成の競合手法の両方を上回ることを示す。特筆すべきことに、我々の手法は100倍以上のデータで訓練された識別型の最先端手法に匹敵し、いくつかのベンチマークでは傑出した結果を示す。
マルチモーダル大規模言語モデル(MLLM)は、長い視覚履歴を統合し、部分可観測性の下で推論し、少数の例から行動を推測することができる。しかし、視覚言語行動(VLA)モデルは一般に、この文脈的容量をエピソードメモリとして活用することなく、事前学習済み表現を継承している。メモリ依存型ポリシーは、目的に特化した履歴機構を通じてこのギャップに対処する。PonderPounceは代わりに、MLLM本来の因果的文脈をロボットメモリとして再利用する。System2 MLLMであるPonderは、エピソードの観察、デモンストレーション、事前の認知を本来の因果的文脈に蓄積し、内部使用のためのサブゴールテキストやデモンストレーション推論を生成できる。System1 VLAであるPounceは、現在の観察、指示、固有感覚を直接受け取る。Ponder–Pounceインターフェースを通じて、最新の連続認知トークンとその年齢のみを非同期に受け取る。両者は、専用のメモリモジュールや独立したブリッジ事前学習を介さずに、エンドツーエンドで共同トレーニングされる。最適化されたサービングにより、認知リフレッシュでp50レイテンシ78ms、アクションモデル呼び出しで25msを達成し、20Hzのアクション再生をサポートする。ベース規模のトレーニングデータを用いたRoboMMEでは、PonderPounceは同じPounceアーキテクチャとインターフェースの下で、9Bで60.83%、0.8Bで50.04%に達し、FrameSamp+Modulの44.51%や現在の観察のみのπ_{0.5}の17.93%を上回る。9倍のデータでは、75.54%に達し、FrameSamp+Modulの57.88%を上回る。RoboCasa-DCでは、同じインターフェースがアクション監督のみから学習し、12.5%を達成する。これは最も強力な公開済みデモ条件付きベースラインの11.6%を上回るが、認知を学習済みヌル状態に置き換えると8.6%に低下する。
LLMエージェントは実行時に自身のプロンプト、ツール、ミドルウェア、リソース、実行ハーネスをますます修正するようになっている。このような自己進化は能力を向上させ得るが、成功した変異は永続的な影響を残す可能性があり、それが作成された状態とは異なる状態では安全に元に戻せないことがある。我々はEvoUndoを紹介する。これはモデルが生成した自己修正を反事実的な状態にわたって表現、合成、診断、独立検証するためのフレームワークである。600の未見のワンショット自己進化タスクにわたって、復元可能性の検証に失敗する197件の能力向上変異を特定した。元の復元表現では、従来の修復戦略はこれらの自然な失敗の0/197しか復元できない。決定論的オラクル分析は元の復元言語L0のもとで48/197を復元する一方、拡張復元計算体系は経験的オラクル復元を191/197に引き上げる。プロトコル固定の2x2接地×表現力介入により、2つのボトルネックが分離される:元の言語で十分な場合、正確な状態アドレス接地は成功復元を0/48から38/48(79.2%)に増加させ、一方、復元言語の拡張はオラクル定義のS1層における142/143(99.3%)の失敗の復元を可能にする。主要なgpt-oss-120bバックボーンでは、より豊かな言語に正確なアドレス診断を追加すると復元は133/143(93.0%)に低下する;Qwen3.8-27Bでの再現実験は接地効果と表現力効果を保持するが、この負の交互作用は保持されず、後者がモデル依存であることを示している。これらの結果は、信頼性の高いエージェント自己進化には、反復的プロンプティングのみに頼るのではなく、検証、状態接地、証人セマンティクス、復元言語の表現力の共設計が必要であることを示している。
インタラクティブなWebアプリケーション生成には、モデルが自然言語のリクエストから実用的なHTML、CSS、JavaScriptアプリケーションを生成することが求められる。従来のコード生成とは異なり、アプリケーションの品質は複数のユーザー向け機能要件に依存し、各要件はイベントハンドラ、状態更新、DOMフラグメント、CSSセレクタなどの局所的なコード領域に結びついていることが多い。標準的なGRPOは、これらの構造化された成果を単一のシーケンスレベルの報酬に集約し、得られたアドバンテージを全トークンに均等に適用するため、クレジット割り当てが弱まる。本稿では、ルーブリックレベルの機能フィードバックを生成コード上の局所的な最適化シグナルに変換する強化学習フレームワークであるRubric-to-Code Credit Assignment(RCCA)を提案する。RCCAは、明示的な機能ルーブリックを中心に訓練タスクを構築し、階層的報酬を用いて形式、ソースコード、実行時、機能の失敗を分離し、評価者が生成したテキストによる帰属情報を責任のあるコードスパンおよび生成トークンと整合させる。得られたモデルLing-RCCA-Flashは、MiniAppBenchで41.25を達成し、Ling-3.0-Flashを32.20ポイント上回り、Claude Opus 4.5をわずかに凌駕した。また、ArtifactsBenchでは76.19に達し、SFTモデルを4.48ポイント改善し、公式のArtifactsBenchリーダーボード設定においてGPT-5のスコアを3.64ポイント上回る新記録を樹立した。これは転移可能な実装レベルの改善を示唆している。
大規模言語モデルのアライメントは英語中心の高品質な選好データに大きく依存しており、その結果、他の言語では性能が最適以下になることが多い。本稿では、英語から得られる頑健な選好知識を活用し、対象言語における選好アライメントを促進する新しいフレームワークであるCross-lingual Ranking Preference Optimization(CRPO)を提案する。対象言語と英語にわたる並列選好ペア内に階層構造を設計し、言語内および言語間の選好を同時に最適化することで、言語適応と出力品質を向上させる。LambdaLossフレームワークに基づくCRPOは、二値比較に基づく最適化を超え、複数の候補応答にわたる相対ランキング信号を提供する。リソース規模の異なる5言語にわたる実験では、CRPOは指示追従能力と知識活用能力の両方において標準的手法を一貫して上回ることを示した。特に、さまざまな重み付けスキームにわたって観察された堅調な性能向上は、多言語設定における階層設計の実証的有効性をさらに裏付けるものである。さらに、CRPOは報酬マージンと望ましい応答の対数確率の両方を大幅に改善し、言語横断的アライメントのためのより安定した選好多様体に寄与することを明らかにする。コードはhttps://github.com/dltmddbs100/CRPOで公開している。
我々は、原子生成事実 f=(u,tau,omega,z;rho) を定義する。これは起源、実現された変換、具体的な発生、生成結果、関係役割を記録する。これらの事実は Generation-Fact Graph(GFG)にコンパイルされ、生成履歴を保持するAIネイティブでコンパイル可能な科学的事実基盤を提供する。我々は、GFGに基づく再帰的科学プロセスを確立し、分析、介入、再生、検証が後続のサイクルのための事実を形成する。nanoGPTを用いて、統合された訓練-学習ダイナミクスを確立する。訓練とは、状態と記憶を備えたパラメータ・オプティマイザシステムの進化である。各実際の訓練アクションは受信状態に入り、その状態とターゲット固有の更新幾何によって条件付けられた有限振幅の非線形関数応答を生成する。学習とは、これらの応答による分散機能的サポートの持続的再編成である。能力の形成、維持、低下、回復は、ターゲット固有の状態が読み出し境界に対して評価されるときに観測可能になる。三つの主要座標、すなわちターゲット境界状態、ターゲット固有の更新幾何、パラメータ・Adam受信状態は、更新後出力が読み出される前に動作する二次予測器をもたらす。ホールドアウト実行では、4つの遷移にわたって91.43%の精度と91.49%のマクロ平均再現率を達成した。さらに、推論を訓練-学習ダイナミクスの凍結投影として確立する。コンポーネントゲーティングとロールバックは、訓練中に形成されたクエリ条件付きサポートの因果的動員と非加法的組み合わせを示し、Attentionによって実現される組織的条件を導出する。制御されたフィードバックは、両刃の強化効果の可能性を示す。ResNet/CIFAR-100および拡散モデル/CIFAR-10の実験は、受信状態条件付き応答、持続的サポート再編成、およびnanoGPTを超えた凍結推論投影を確認する。
大規模言語モデル(LLM)は、多層防御を備えてデプロイされることが増えているが、悪意のあるプロンプトは依然としてそれらを迂回し得る。解釈可能性手法は、生成経路に沿ったモデル内部のシグナルを明らかにし、強制の判断材料とすることができるが、これらのシグナル自体はセキュリティ制御ではない。安全性のためにこれらを適応させるデプロイメントは、通常、各シグナルを独自の校正、ポリシーロジック、介入コードに結合するため、新たなアーティファクトごとに共有防御を強化する代わりに統合作業が発生する。我々は、Linuxセキュリティモジュール(LSM)の背後にある分離の考え方をLLMサービングに適応させたセキュリティフレームワークである言語モデルセキュリティモジュール(LMSM)を提案する。LMSMでは、選択されたセキュリティバックエンドが校正済みのエビデンスを提示し、バージョン管理されたポリシーが信頼されたリクエストごとのコンテキストに基づいてアクティブなルールを評価し、独立したゲートがバッファリングされた出力のリリースを承認する。この設計は、仲介の正確性とポリシーの有効性を分離し、リクエスト処理や強制を再構築することなくバックエンド、ルール、スケジュールの変更を可能にする。我々のプロトタイプは、この分離が実際に機能することを示している。Hugging Face Transformersと継続バッチ処理を行うvLLMでは、同じ基盤が、アーティファクトに基づくスパースオートエンコーダ(SAE)およびトランスコーダーのデプロイメントとタスク適合型のデンスプローブをホストし、スケジューラのチャーン下でもリクエスト固有の決定を維持し、リクエストごとに複数のルールを選択的に強制・合成する。Qwen3-4Bでは、LMSM-CheckpointがHarmBenchの攻撃成功率を39.20%から3.32%に低減し、XSTestの誤拒否率は2.40%から4.40%に上昇したが、32のアクティブシーケンスで監視作業を行わない同等のサービング経路のスループットの98.14%を維持した。LMSMは、解釈可能性とモデル内部解析の進展に、実行時強制への共通の経路を提供する。
対話における健康誤情報の訂正には、事実に基づく反論を示すだけでは不十分である。ユーザーごとに知っていることや信じていること、聞く必要があることは異なるため、効果的な介入はしばしば、最初に適切な明確化の質問を行うことに依存する。しかし既存手法は、即座に応答するか無差別に質問するかのどちらかであり、明確化を不要なものか常に有益なものかのいずれかとして扱っている。本稿では、質問がコストに見合う時期を学習するフレームワークであるReward-Optimized Probe-and-Respond(RO-PnR)を提案する。RO-PnRは各ターンにおいて、情報を得るための質問と最終的な訂正に踏み切ることのどちらを選ぶかを、質問の期待利得と対話コストを比較考量するターン単位の報酬に基づいて決定する。ユーザーの異質性が質問の価値にどう影響するかを捉えるため、各シミュレーションユーザーを、ヘルスリテラシーと信念の確信度に沿った潜在状態としてモデル化する。実験では、RO-PnRが3つの健康誤情報データセットと3つのベースモデルにわたり最高のコスト調整済み効用を達成し、常に質問するベースラインと比べてターン数を30%削減することを示した。
対話型ゲームは、静的ベンチマークが主に暗黙のままにしている能力を試す。すなわち、モデルがターンをまたいで状態を保持し、フィードバックを解釈し、変化する制約のもとで有効なアクションを選択する能力である。我々はこの設定を、20億パラメータのオープンウェイトモデルを用いたLM Playschool Challengeにおいて研究し、多くの失敗が広範な知識の欠如だけでなく、局所的な意思決定の失敗——繰り返される推測、不正な形式のアクション、モデルが直前に見たばかりのフィードバックへの違反——にも起因することを見いだした。これらの診断結果は、3つのステップからなる学習レシピを動機づける。すなわち、(1)教師ありファインチューニングによる広範なゲーム参加能力の獲得、(2)対象とする対話ゲームファミリー内での機械的に検証可能な失敗の修復をターン単位の選好ペアを用いて行うこと、(3)これらの対話ゲームを超えた一般的な能力の保持、である。公式の最終評価では、我々の提出システムは公開clemscoreを10.67から38.92へ、クローズドなドメイン内スコアを13.41から41.17へ改善しつつ、総合的な静的性能はほぼ維持した(ベースラインの44.24に対し44.14)。ドメイン外のclemscoreは7.88と低いままであり、最大の改善は対象ファミリーの未見のバリエーションに集中している。我々の結果は、広範なSFTがモデルの能力改善の大部分をもたらすこと、ターン単位の教師信号は失敗検出が精密な場合に有効であり、観察された転移は主にファミリー内に集中することを示唆している。
生成的視覚言語モデル(VLM)は、人間中心の環境でますます利用されているが、知覚される人種や性別などの制御された属性のみが異なる画像であっても、人口統計学的に偏った出力を生成する可能性がある。しかし、既存の推論時バイアス除去手法は、主に静的埋め込みやCLIP類似モデル向けに設計されており、生成的VLMには対応していない。我々は、単位超球面上で反事実的バイアス部分空間を発見し、測地線弧に沿って視覚トークンを操縦し、適応ゲートを用いてより強い人口統計学的信号を担うトークンに補正を集中させる、ノルム保存型介入であるGGSS(Geodesic-Gated Spherical Steering、測地線ゲート付き球面ステアリング)を提案する。我々は、4つの生成的VLMを、10の適応させた推論時バイアス除去ベースラインおよびプロンプトベースの緩和手法と、カテゴリ別・ペア別・職業と性別のバイアステストにわたる単一動作点プロトコルの下で評価し、同時に一般的な視覚言語能力も測定した。GGSSは、4つのモデルすべてで平均バイアスが最も低く、4つのバックボーンのうち3つでは対応のある並べ替え検定において有意であり、MMStar精度は非操縦ベースラインから±0.6パーセンテージポイント以内を維持した。コードはhttps://github.com/dukesun99/GGSSで公開されている。
抽出型プロンプト圧縮は、情報量の少ないトークンを除去することでLLM推論コストを削減できると期待されている。LLMLingua-2のような学習型圧縮器は、英語ベンチマークで強い成果を報告している。しかし、他のほとんどの言語はすでにトークン割増を支払っている。同じ内容でも英語と比べて1.3〜1.8倍のトークンが必要になるのである。本研究では、圧縮がこの格差を縮めるのか、それとも拡大するのかを問う。5種の文字体系にまたがる10言語の完全並列データを用い、対象モデルのトークナイザで予算を一致させた統制条件下で、4つの学習型圧縮器を4つの決定的ベースラインに対して監査する。対象モデルは10ベンダーの11モデルであり、評価呼び出しは25万回を超える。圧縮器のうち3つは英語教師あり学習で訓練されている(LLMLingua-2 XLM-R/mBERT、本番運用Headroomスタック由来のKompress-v2)。4つ目のXProvenceは多言語学習である。第一に、転移ギャップは実在し、対象モデルと圧縮器バックボーンをまたいで再現され、圧縮率に強く依存する。keep-rate 0.33では、英語は正規化された文脈利用度の57〜62%を維持するのに対し、リトアニア語は10〜24%、中国語はほぼゼロとなる。中国語はトークン割増が最も小さいにもかかわらずである。第二に、このギャップはアーキテクチャではなく圧縮教師データに起因する。英語訓練された3つの圧縮器すべてにギャップが見られ、決定的手法には同等のギャップはなく、多言語訓練されたXProvence v1にも見られない。翻訳データで再訓練されたv2リリースは、攻撃的な閾値で中国語の文脈の92%を警告なしに空にする。第三に、より困難な長文脈設定では、攻撃的な学習型圧縮により、5つの非英語言語のうち3言語で圧縮文脈が文脈なし利用度以下にまで低下する。翻訳してから圧縮するパイプラインは、テストした5言語中3言語で、ネイティブ圧縮に匹敵またはそれを上回りながら、トークンコストはおよそ半分である。我々は全コード、圧縮結果、モデル出力を公開する。安全な圧縮予算は英語圏外でははるかに小さい。
屋外LiDARセマンティックシーン補完(SSC)は、対象ボリュームの1%しか観測しないスキャンから、7,000倍を超えるクラス不均衡のもとで、高密度なセマンティックボクセルグリッドを復元する。我々はSSCを生成セマンティックシーン補完(GSSC)として再定義する。これは単一の離散拡散定式化であり、3つの役割を担う。まず、ペア型スパース・デンスシーン合成(PS^3)は、対応するスパースLiDAR観測とその高密度セマンティック補完を生成し、ロングテール問題をその発生源で対処し、SemanticKITTIと併用して学習するPS^3-SemanticKITTIコーパスを提供する。次に、セマンティック誘導生成シーン補完(SGSC)は、鳥瞰図セマンティックマップとスパース3D特徴ストリームを介してスパーススキャンに条件付けられ、多項離散拡散によりノイズからシーンを生成する。第3に、同じフレームワークは、1回のフローマッチングステップで既存の補完結果を改良する。これが構造化ソース離散拡散(S^2D^2)である。S^2D^2は、ベースの再学習やテスト時適応を必要とせずに、SGSC自身の出力と、テストしたすべての外部SSCベースのmIoUを向上させる。最強のベースでは、テスト時拡張なしの1ステップで、SemanticKITTI非公開テストにおいて38.8%のmIoUに達する。我々の知る限り、これはそのリーダーボードにおける因果的・単一スイープ・単一サンプルでの最良の結果であり、同じ制約下での従来の公開最高スコアを+2.1ポイント上回る。8視点のテスト時拡張を用いた4回の補正ステップでは、その制約の外で39.2%に達する。