翻訳付きの日次キュレーションされたAI研究論文
AIエージェントは、初期の状態変化が遠い将来の意思決定に影響を及ぼし得る持続的環境において動作する。従来の言語モデルとの対話とは異なり、エージェントの行動は、長期にわたるワークフローの中で繰り返し変更・再利用される共有状態を通じて媒介される。既存の安全性ベンチマークは、短く静的なタスクに焦点を当てているため、こうした累積的リスクを捉えられないことが多い。この限界に対処するため、我々は環境進化を通じたスケーラブルなエージェントレッドチーミングを実現するオープンエンド型アリーナ、OpenARTを提案する。OpenARTは、50万以上のツールとスキルのプールから抽出した、50ドメインにわたる1万以上の検証済みステートフルシナリオを提供する。これらのタスクは中央値で97回のツール呼び出しを必要とし、75種類の異なるエージェント・モデル構成にわたる統一的評価を可能にする。このような進化する攻撃面を体系的に探索するため、我々は進化的マルコフハイパーグラフ攻撃(EMHA)を提案する。EMHAは、パラメータ更新を必要とせずに、許可された状態遷移を調整してフィードバック駆動型の環境進化を実行するブラックボックス方策である。評価全体を通じて、タスクの目的は固定されたままであり、環境状態のみが変化する。全構成にわたり、EMHAは集計された攻撃成功率(ASR)85.0%を達成する。命令のみによる進化に対する優位性は、単純な環境では約2%であるのに対し、最も複雑な環境では17%を超え、タスクの複雑性が増すにつれて環境進化が安全性の欠陥をより顕著に露呈することを示している。さらに、我々の分析は、エージェントの具体的な実行時実装が、基盤となるモデルの能力を超えて、安全性の変動の重要な部分を説明することを示している。これらの結果は、複雑で進化する環境におけるエージェント安全性の研究のためのスケーラブルな基盤としてOpenARTを確立するものである。
研究アイデアを論文として完成させるには、テキスト生成だけでは不十分である。システムは文献を検索し、実験を設計・実行し、エビデンスに基づいて主張を修正し、出版に耐える図を作成し、長い生成プロセスを通じて一貫性を維持する必要がある。本稿では、既存のコーディングアシスタント内の13の構成可能なスキルとして実装されたエンドツーエンドの研究論文生成システム「Spark-to-Paper」を紹介する。このシステムは、専用のエージェントプラットフォームやオーケストレーションサービスを必要としない。Spark-to-Paperは、モデルベースの判断と、直接実行・検証できる決定的な操作を分離する。さらに、実験計画を報告から分離することで、結果を観察する前に必要なエビデンスを定義し、測定された成果に応じて原稿の主張を修正する。長い研究プロセスにおける信頼性を高めるため、本システムは決定的な整合性チェックと自己批判を組み合わせ、繰り返し行われる実験が当初の研究目的を拒否し続けるという、自己反駁ループと呼ぶ失敗モードを抑制する。また、Spark-to-Paperは実験結果のプログラムによるプロットと、生成されたメソッド図のコードベースの再構築を通じて、編集可能なベクター図を生成する。8つの管理された研究トピックにおいて、Spark-to-Paperは引用の妥当性99.5%、図の編集可能性96.4%を達成した。制御されたアブレーションでは、捏造の検出率がシングルパスのドラフトで14%だったのが、完全な整合性・レビュースタックにより92%に向上し、敵対的レビューは74%の適合率を達成した。完全なシステムは論文1本あたり11.9Mトークンを使用し、コストは8.1ドル、所要時間は平均3.2時間である。これらの結果は、実験的エビデンスを主張の受け入れ・修正・棄却の中心に据えつつ、エンドツーエンドの研究論文生成が既存のコーディングアシスタント内の軽量で構成可能なワークフローとして実装可能であることを示している。
近年の蒸留に関する研究では、大規模モデルの能力を小規模モデルへ移転する手法が研究されているが、多くの場合、ティーチャー・フォーシング、オン方策蒸留、および関連するトレーニング時間中の手法を通じて、後者のパラメータを更新することで実現されている。本論文では、このような移転が代わりにテスト時に発生し得るかどうかを問う。我々は「強から弱へのスキャフォールディング」を研究する:すなわち、より強力なビルダーモデルが、パラメータ更新を一切行わずに、より弱いターゲットモデルがタスクをより確実に解決できるよう支援する推論時ハーネスを構築できるかどうかである。4つの代表的な心の理論ベンチマークを用い、各ビルダーモデルはデータの5%を検証セットとして使用し、複数ラウンドにわたってハーネスを反復的に改良する。その後、完成したハーネスを全テストセットで評価する。実証的に、この形式のテスト時能力移転は非常に効果的であり、ターゲットモデルの平均性能は0.49から0.91へとほぼ倍増した。我々の分析によれば、この向上は主に、不安定なモデル推論を決定論的なコードへのオフロード、ベンチマーク固有のルーティング、厳格な回答形式の強制からもたらされており、ターゲットモデルに、より広範な推論やより広いサンプリングを促すことからではない。さらに、ビルダーモデルの推論努力はハーネスの品質を単調に向上させ、プラットフォーム効果はビルダーモデル自身の能力と比較して限定的であり、より弱いターゲットモデルが最大の向上を得ることが分かった。これらの結果は、推論時ハーネス設計が従来のトレーニング時蒸留の重要な補完であり、強力なモデルが再トレーニングなしで認知構造を弱いモデルに移転できることを示唆している。
AIモデルは多様な領域で顕著な成功を収めているが、その能力の背後にあるメカニズムや、もたらし得るリスクについては、いまだ十分に理解されていない。AI開発の速度と自動化が進む一方で、機構の解明作業は依然として大部分が人手に依存しており、モデルの能力と、それを理解・制御する我々の能力との間の乖離は拡大し続けている。この乖離を埋めるため、我々はMechanistを提案する。Mechanistは、AIを科学的ツールとして活用し、AIの知能の背後にあるメカニズムを自律的に発見するエージェント型システムである。自律的な機構解明を支援するために、我々は解釈性に特化した約13,000件の論文からなる知識グラフを構築し、それを26分野にわたる4,300万件の論文からなる学際的なデータベースと統合した。さらに、メカニズム分析、因果介入、検証のための32の基盤的手法を厳選したライブラリを整備した。Claude Codeや既存のAI科学者システムと比較して、Mechanistはより価値の高いメカニズム仮説を生成し、実験をより確実に実行する。Mechanistはまた、モデルの挙動の発見から、AIモデルの説明と制御へと至る進展を示す。具体的には、まずMechanistは科学研究室における直感に反する安全性リスクを発見し、一見安全な訓練データを通じて安全でない特性がモダリティ間を越えて転移し得ることを明らかにする。次にMechanistは信念のメカニズム理論を構築し、モデルが世界知識をいかに表現するか、信念をいかに形成するか、他者の信念をいかに推論するか、そしてこれらのメカニズムが事前学習中にいかに出現するかを解明する。最後にMechanistは、これらの機構的洞察を実践的な介入策へと変換し、多様なシナリオにおけるモデルの性能を向上させるとともに、科学基盤モデルを指定された特性を持つDNA配列の生成へと導く。
大規模言語モデル(LLM)は、手続き的知識が再利用可能なスキルパッケージに格納され、推論時に読み込まれるエージェントとしてますます機能している。スキルライブラリが拡大するにつれ、限られたコンテキスト予算の下で最小限の十分な実行可能コンテキストを提示することが中心的な課題となる。既存システムは、スキル全体レベル未満のルーチンを再利用すること、圧縮中に手続き的契約を保持すること、圧縮されたルーチンを実行可能かつ拡張可能に保つこと、そしてスキルの進化に伴い圧縮ライブラリを更新することに苦慮している。これらの課題は、単位の不一致を浮き彫りにする。すなわち、スキルはパッケージとして取得され、テキストとして圧縮され、取得後にのみ実行グラフに変換されるのに対し、信頼性の高い再利用には契約を保持する手続き単位が必要である。我々は、セクションレベルのグラフに対して契約を保持する圧縮を実行する、実行を考慮した手続き抽象化フレームワークSkillZipを提案する。SkillZipは、境界シグネチャ、依存関係の閉包、検証器到達可能性、およびソースレベル展開を保持しながら、繰り返し出現する契約に適合するモチーフを可逆的な移植マクロに書き換える。推論時には、コンパクトで依存関係が閉じたコンテキストを復元し、必要な場合にのみマクロを展開する。ReZipはさらに、実行証拠を用いて新しいスキルを統合し、リスクのあるマクロを修正する。技術的および身体化エージェントベンチマークに関する包括的な実験1により、SkillZipは一貫して最強のベースラインを最大12.2ポイント上回り、99.2%の依存関係の保存と98.7%の検証器到達可能性を達成しつつ、3.46倍の圧縮率を達成することが示された。さらにスケーリング分析により、200から10万スキルまでのスキルライブラリにわたる堅牢な取得が確認された。
大規模言語モデル(LLM)の急速な進歩は、オープンエンドで流動的な対話型ストーリーテリングを可能にすることで、ゲームAIに革命をもたらしつつある。しかしながら、既存研究は、制約のないユーザー介入に対して長期的な論理一貫性と物語の完全性を維持するという重要な課題をほとんど見落としてきた。この課題に対処するため、我々はこれを物語コミットメント保持(NCP)として定式化し、対話型物語をテストベッドとして採用する。我々は、映画のあらすじから構築した100の物語環境からなるベンチマークNCP-Benchを導入する。各環境は構造化された物語仕様(トラジェクトリ、コミットメント、初期事実)を含み、プレイヤーエージェントとナレーターエージェントの対話全体を通じて自動的に検証可能である。最先端のLLMを用いた実験により、長期的な一貫性に大きなギャップがあることが明らかになった。すなわち、高い言語品質はコミットメント保持を保証せず、強力なモデルでさえ敵対的介入下で論理的に矛盾する内容を頻繁に生成する。最高性能モデル(GPT-5.2)でも20ターン後の生存率はわずか42%であり、事実矛盾率はモデル間で40%から68%の範囲に及び、100ターン制限内で全ての達成コミットメントを満たしたのはごく一部の実行のみであった。
プリビジュアライゼーションは、映画、ゲーム、建築、都市デザインにおけるアイデアと制作の間の中間層である。これによりクリエイターは、シーン、アクション、カメラ、時空間ダイナミクスを反復的に洗練できる。しかし既存の生成手法は、単純なプロンプトに依存してこれらすべての要素を一度の画像・映像合成で統合制御するものであり、制御性が弱く、反復的編集のサポートも限定的である。本質的に、ワールドはジオメトリ、外観、その他の属性を持つ複数の要素とカメラで構成される。異なるフレームは、この共有状態の局所的な変更または再結合によって生成されるが、それ以外の部分はほぼ再利用される。したがって我々は、欠けている要素は明示的かつ永続的な作業状態(ワーキングステート)であると主張する。この課題に対処するため、本稿では生成的プリビジュアライゼーションのための状態中心フレームワークであるStateFlowを提案する。StateFlowは、映像を一度に生成するのではなく、編集可能な3Dワールドを用いてシーン構造・進化・カメラを整理し、より高い忠実度が望まれる場合には既存の映像モデルが画質を向上させる。このワールドは、シーン要素とカメラ構成からなる永続的な構造化3D状態として維持され、プリビジュアライゼーションの中核となる作業表現として機能する。この洞察に基づき、StateFlowはワールド状態の構築・進化・アクセスという3つの段階を持つ。状態構築は、事前知識に導かれ競合を考慮したデュアルビュー初期化により、生成された2Dコンテンツを一貫性のある3Dワールドへとリフトアップする。状態進化は、ワールドメモリを保持しつつユーザーの意図を構造化された状態遷移へ変換し、編集のたびにシーン全体を再生成することを回避する。状態アクセスは、レンダーフィードバックに基づく内省的プロセスによってカメラプランを視覚的に実現可能な軌道へと洗練し、VLMの意味論のみに依存することを避ける。実験により、StateFlowは映像制作やゲーム的プロトタイピングのための高品質な3Dワールドを生成することが示された。
近年の視覚基盤モデル(VFM)は、シーンごとの最適化を必要とせず、単一の順伝播で深度・カメラ姿勢・ポイントマップを予測し、強い汎化性能を達成している。しかし、バンドル調整などを用いた明示的な多視点幾何整合性の強制は計算コストが高く、VFMの事前学習では課されないため、そのような不整合が生じ得る。この問題に対処するため、モデル出力(例:ポイントマップ、特徴量)から導出される暗黙的な自己整合性は、先行研究ではテスト時に強制されるものの、特に事前学習済みVFMの精度が低いシーンでは、本質的に限られた性能向上しかもたらさない。この暗黙的なシグナルとは対照的に、我々は2次元ピクセル対応を擬似グラウンドトゥルースとして用いて、明示的な多視点幾何制約を直接課すプラグアンドプレイ型のテスト時適応パイプラインであるSelf-Geometryを提案する。提案するSelf-Geometryは、勾配競合を防ぐために勾配分離を併用し、多視点整合性損失とエピポーラ整合性損失を組み合わせた幾何学的分離最適化、SO(3)測地線距離に基づいてこれらの制約を軽く課す視点サンプラーであるFrame Angular-Neighbor、そしてLoRAを介してVFMを適応させる軽量TTAから構成される。本手法は、6つのVFM(VGGT、π^3、DA3-Giant/Large/Base/Small)と4つのベンチマーク(7Scenes、ETH3D、ScanNet++、HiRoom)にわたり、姿勢推定と幾何推定の両方で一貫した改善を達成する。
ワールドモデリングは未解決の分野である。アーキテクチャ、学習目的、状態表現は複雑に相互作用し、環境を問わず支配的な単一のレシピは存在しない。この特性は、自律的研究者として機能するAIコーディングエージェントにとって理想的なテストベッドとなる。というのも、現在のエージェントベンチマークを支配する仕様への工学的実装タスクとは異なり、この設定では改善の方向性が事前に指定されないためである。我々はAutoWorldModel-Benchを導入する。これはクローズドループ型ベンチマークであり、最先端のコーディングエージェントが、固定の計算予算のもとで提供されたワールドモデルのスターターを自律的に改善する。本ベンチマークは、統一的構造化状態表現——各ゲームから抽出したグラウンドトゥルースのエンティティ状態を共有テンソル形式で消費する方式——のもとで8つのゲーム環境を対象とし、これによりダイナミクスモデリングを知覚から分離し、実行あたり数分の反復を可能にする。64セッションにわたり、Codex-5.4とClaude Opus 4.6は63セッションでスターターを改善した。セッションの91%において、勝利をもたらす編集はハイパーパラメータの調整ではなく、新たな目的関数、表現、ロールアウト手順、またはアーキテクチャ変更といった非自明な研究スタイルの修正であった。本ベンチマークは、最先端のコーディングエージェントを、仕様への工学的実装ではなく、開かれた研究において評価できる設定を提供する。
具現化エージェントは、基盤モデルを中心としたシステムとして構築されることが増えており、その性能はモデルの重みだけでなく、モデルを取り巻くスキル、コンテキスト、アクションインターフェース、および実行ハーネスにも依存する。教師ありファインチューニングと強化学習はエージェントを新たな環境に適応させることができるが、追加のデータ、報酬、学習実行を必要とする。一方、多くの学習不要のコード中心アプローチは、固定インターフェース環境では利用できない可能性のあるプログラム可能なロボットAPIに依存している。本稿では、学習不要の具現化適応のための自己進化型フレームワークであるSHAPERを提案する。SHAPERは、モデルパラメータを凍結したまま、対象環境でのロールアウトを通じて再利用可能なスキルとコンテキストコードハーネスを進化させることで、ノンパラメトリックなエージェントシステムを改善する。SHAPERでは、同一の凍結モデルがプランナーとオプティマイザーの両方の役割を果たし、パラメータ更新を伴わずに外部スキルとコンテキストコードハーネスを洗練する。我々は、異なる低レベルアクションインターフェースを持つ具現化エージェントを対象として、VLABenchとESI-BenchでSHAPERを評価し、純粋な実行、教師ありファインチューニング、検証器なし選択や投票などのテスト時スケーリングのベースラインと比較する。我々の結果は、モデル学習が高価である、利用不可能である、または望ましくない場合に、スキルとハーネスの最適化が自己進化型具現化エージェントへの実用的な経路となることを示唆している。
外部ツールと統合された大規模言語モデル(LLM)エージェントは、環境状態に埋め込まれた間接的プロンプトインジェクションに対して脆弱である。しかし、既存研究の多くは、手動で実装または再利用された環境、確率的なLLMベースのツールシミュレーション、および事前定義されたインジェクション位置に依存しており、より広範な領域でのスケーラブルなセキュリティ研究を制限している。このギャップを埋めるため、我々は**ToolHazard**を提案する。これは、人間のエンジニアリングを削減し、追加のシードドメインと計算リソースによる拡張をサポートする、スケーラブルな敵対的環境合成フレームワークである。環境シミュレータ、攻撃エージェント、ユーザーシミュレータを通じて、ToolHazardは実行可能なステートフル環境を合成し、有効なインジェクション箇所を発見して環境固有のペイロードを生成し、状態に基づく長期的タスクを構築する。ToolHazardに基づき、我々は複雑なワークフローと多様な環境攻撃の下でエージェントをストレステストするための**ToolHazard-Bench**を構築する。実験により、エージェントの重大な脆弱性が明らかになり、インジェクションのタイミングと配置が攻撃の有効性に影響することが示された。さらに、ToolHazardが生成したアライメントデータは、良性タスクの有用性を維持しつつ、ToolHazard-BenchとAgentDojoの両方でセキュリティを向上させる。
世界は、そのダイナミクス、すなわち運動の法則に従って時間発展する。しかし、主要なビデオ拡散モデルは、ピクセルが時間とともにどのように遷移するかをモデル化せずに、主にピクセルに適合している。そのため、視覚的にもっともらしいフレームを生成する一方で、その法則を正確に守っているとは限らない。ピクセルから純粋にダイナミクスを捉えるために、我々は潜在ダイナミクス推論(LDR)を導入する。LDRは潜在遷移を明示的な運動学的積分として捉える。そこでは低次のダイナミクスが数値的に積分され、モデルはロールアウトを駆動する三次以上の残差のみを回帰する。この積分がより良く外挿できるように、LDRは密な畳み込み特徴ではなく構造化された潜在表現上でそれを実行する。PhyWorldに従い、我々は5つのタスク(等速運動、放物運動、衝突、バウンド、接近)からなる制御されたホワイトボックス物理ベンチマークでLDRを検証し、モデルが根底にあるダイナミクスを本当に学習したかどうかを明らかにする分布外シナリオに焦点を当てる。LDRは学習したダイナミクスをはるかに良く外挿する。分布内誤差と分布外誤差の差は、256×256解像度での単一タスク学習と複数タスク学習の両方において、ビデオ拡散ベースラインのそれより20倍以上小さく、しかもパラメータ数は26分の1で、実行速度は143倍高速である。LDRは大きな分布シフトの下でも汎化できる。例えば、左から右へ動く赤いボールのみで学習した場合でも、右から左へ動く青い四角形の動きを正確に予測する。我々の知る限り、これは学習したダイナミクスをトレーニング分布の外へ外挿する最初のビデオ世界モデルである。プロジェクトページ: https://lat-dyn-reason.github.io/
ガラス越しに撮影されたビデオには、画質を劣化させ、下流の視覚タスクの妨げとなる反射がしばしば含まれる。単一画像の反射除去は広く研究されてきたが、ビデオ反射除去は、ペアのビデオデータ、時間的に一貫した除去モデル、専用の評価ベンチマークが不足しているため、依然としてほとんど未開拓のままである。本稿では、物理に基づく反射シミュレーション、拡散ベースのビデオ反射除去、ベンチマーク評価を統合した閉ループフレームワークを提案する。我々のS2R-Synthesisパイプラインは、構造空間で物理に基づく拡張を実行し、学習済みビデオ拡散レンダラーで現実的な反射を含むビデオをレンダリングすることにより、反射ありと反射なしのペアビデオを生成する。この拡張は、粗さに起因するぼけ、厚さに起因するゴースト、反射率の変動など、ガラスに関連する主要な効果をモデル化する。合成データに基づき、我々は初の拡散ベースのビデオ反射除去モデルであるS2R-Removalを導入する。これは、反射を考慮した潜在適応と単一ステップの画素・幾何学的精緻化を通じて、事前学習済みのビデオ拡散事前分布を適応させ、単一のノイズ除去ステップでクリーンな透過成分を復元する。さらに、ビデオ反射除去のための初のベンチマークであるS2R-Benchを構築し、フルリファレンス評価と実世界の人間の知覚評価の両方をサポートする。S2R-Benchおよび複数の公開画像ベンチマークでの実験により、最先端の性能と、非拡散ベースラインをも上回る高速な推論を実証し、S2R-Synthesisの有効性を検証する。プロジェクトページ: https://codingwzp.github.io/VideoDereflection_S2R.
「イメージを用いた思考」パラダイムは、マルチモーダルLLMに対して、切り抜きと拡大(クロップアンドズーム)などの能動的な視覚操作を付与するものである。しかし、これらの操作を用いるモデルは、直接推論と比較してわずかな改善しか得られないか、場合によっては悪化することもあり、しかもトークンコストは大幅に増加する。また、無関係な領域を繰り返し切り抜いたり、直接推論では正しく答えられる質問に失敗したりすることもある。本研究では、返された視覚的証拠が答えに因果的に影響を与えるのかどうかを問う。この問いに答えるため、視覚的ツール使用を、観測を媒介する経路と行動によって引き起こされる近道(ショートカット)を分離する因果グラフとして定式化する。次に、この因果グラフを3つのレベルでの介入、すなわちポリシー(ツール使用と直接推論の比較)、軌跡(ロールアウト中の全観測の破壊)、ステップ(固定プレフィックスの下での個々の観測の反事実的置換)を通じて監査する。ステップレベルの推定対象である視覚エビデンス利得(Visual Evidence Gain)は、各返された観測の寄与を分離する。6つの代表的モデルと5つの細粒度知覚ベンチマークにわたって、2つの失敗モードを伴うポリシーの誤較正を発見した。「見ずに呼び出す」(Calling Without Looking)では、返された観測は答えに対して因果的効果を持たない。「計画せずに見る」(Looking Without Planning)では、観測は有益であるものの、呼び出しスケジュールに一貫性がない。軌跡レベルの診断はポリシーレベルの精度向上を分解し、その向上が「較正された少数派」に集中していることを示す。本稿では、この不一致を視覚ツール使用の錯覚と呼ぶ。つまり、全体としては精度が向上するにもかかわらず、視覚ツール使用は広範囲のロールアウトにわたって因果的に有効ではないのである。コードはhttps://github.com/OpenCausaLab/CauAuditで公開されている。
大規模言語モデル(LLM)を基盤とするエージェント型システムは、ビジネスアイデア創出に新たな可能性をもたらしている。しかし、実世界の文脈が本質的にマルチモーダルであるにもかかわらず、既存の手法はテキストのみのパラダイムに留まっている。そこで我々は、ビジネスアイデア創出エージェントの訓練と評価のための初のマルチモーダルベンチマークであるMBA-Benchを導入する。MBA-Benchは、6つのドメインにわたる30Kサンプルから構成され、各ドメインはテキストだけでは完全には伝わらない特徴的な視覚的手がかりによって特徴づけられる。具体的には、画像に自動的にキャプションを付与し、GPT-4oを用いて、検索クエリ生成、市場エビデンス検索、エビデンス拡張合成を通じて、3つのビジネス質問のそれぞれに対して5つの参照アイデアを生成する。先行研究に従い、MLLM-as-a-Judgeを用いて、6つのビジネス指向の基準にわたってエージェントを評価する。基準が非表示または開示される設定を考慮するため、それぞれブラインド用のMBA-bと既知用のMBA-kを提示する。両者は、新規の報酬目標である創造性と実現可能性を用いて訓練され、MBA-kはさらに開示された6つの基準を最適化して合計8つとする。両者とも、LoRAベースの教師ありファインチューニングと、それに続く設定固有の報酬を用いたグループ相対方策最適化によって訓練される。MBA-Benchでの広範な実験のために、キャプションのみまたはマルチモーダル入力のいずれかに対応する2つのベースラインを設定し、後者は複数のメトリクスにおいてクローズドソースの性能に迫る。MBA-bとMBA-kは、それぞれキャプションベースラインを63.9%および77.1%、マルチモーダルベースラインを25.6%および35.8%上回る。
複雑なソフトウェアシステムは、個々のコーディングエージェントの寿命を超えるタイムスケールで発展する。ほとんどのエージェント型ソフトウェアシステムは、永続セッション、メモリ、マネージャー、共有コンテキストを通じて連続性を維持する。我々はEvoX Genesis(以下、Genesis)を紹介する。これは、ローカルエージェントを有限寿命のままに保ちながら、ソフトウェアプロジェクト自体を永続化するものである。Genesisはソフトウェアを永続的な再帰的世界として表現する。各ローカル世界は受理済みバージョンとリポジトリパスによって位置づけられ、有限寿命のエージェントがローカルな変更を提案し、再帰的委任がパス間で作業を移動させ、受理された結果のみが永続的なバージョン履歴を前進させる。我々はこの構成を、形成、継続、再開発の各段階で評価する。コンパイラ実装のないリポジトリから開始し、GenesisはDeepSeek V4 Flashを用いて、約25万行の追跡対象コードからなるRustベースのCコンパイラを構築した。この実行は120時間以上にわたり、1,000件を超えるエージェントエピソードをアーカイブし、モデルトークン料金はわずか44米ドルであった。このコンパイラは完全なc-testsuiteと、LLVMおよびCsmithのテストの大部分に合格した。GLM 5.2で生成された別のコンパイラ世界では、エージェントを繰り返し交代させた後も開発が継続され、完全なテスト性能が維持された。Genesisはまた、10万行を超えるFortranコードからなる13のMESAモジュールを、約9万行のRustコードからなるRustワークスペースとして再実装した。6つの数値ワークロード全体で、中央値1.55倍から6.87倍の高速化を達成した。これらの結果は、長期間にわたるソフトウェア開発が、永続的なエージェントではなく永続的なプロジェクトを中心に組織化できることを示している。
探索は長い間、強化学習研究の焦点となってきた。最近では、探索がLLMの強化学習レシピにおいても重要な要素であり、下流のパフォーマンスに大きな影響を与えるという証拠が増えている。既存の多くの手法は、例えば温度スケーリングを用いて行動空間で探索を制御する。しかし、これらの手法はトークンの順序を並べ替えることはできず、出力分布の分散に影響を与えるだけである。これにより探索が制限され、発散やトレーニングの停滞を引き起こす可能性がある。 ここでは、パラメータ空間探索を調査する。これは、それぞれが異なるロールアウトを探索し得る事後分布から異なるポリシーをサンプリングしてロールアウトを生成する手法である。多様性の低いまたは高いポリシーをサンプリングすることは、探索に対する補完的な制御レバーとなる。我々は、パラメータ摂動ポリシー最適化(Perturbed Parameter Policy Optimization, 3PO)と呼ばれる手法群を導入する。この手法群は、報酬推定のために異なるサンプリング戦略と異なるロールアウトのグループ化を用いる。OLMo-3-1025-7BとQwen2.5-Math-7Bを用いた数学的推論およびコード生成タスクにおける実験は、これらのアプローチがほぼ同一のFLOPsコストで標準的なGRPOよりも平均下流パフォーマンスを一貫して向上させることを示している。さらに、複数のパラメータサンプルを使用することで、トレーニング中にGRPOや行動空間ベースラインよりも、ゼロ・アドバンテージグループや不正なまたは誤ったロールアウトが一貫して少なくなる。全体として、我々の研究は、パラメータ空間探索がLLMの強化学習を改善できるという証拠を提示するものである。
カテゴリカル生成のための離散拡散モデルは、中間状態空間とそれに対応する逆予測問題を決定する劣化カーネルによって定義される。我々は一様離散拡散を研究し、基礎となるカテゴリカル劣化過程を変更せずに、その訓練目的関数と逆遷移を拡張できるかを問う。我々はSimplaxを導入する。これは正確なディリクレ-カテゴリカル拡張であり、各劣化カテゴリカル状態を補助的なシンプレックス値変数と結合しつつ、元の一様拡散過程をそのカテゴリカル周辺分布として保持する。この拡張は、デノイザ入力を劣化カテゴリカル状態に保ったまま、扱いやすいラオ・ブラックウェル化された逆ブリッジ目的関数と、対応する確率的逆サンプラーをもたらす。実験的には、Simplaxは条件なしOpenWebText生成における生成のパープレキシティとエントロピーのトレードオフを改善する。数独では、30ヒントの問題のみで訓練されたモデルが、最小の一意解可能な17ヒント領域を含む評価済みのすべてのヒント密度において、比較手法の中で最高の精度を達成し、さらに条件なし生成においても最高の妥当性を達成する。
支配的なパラダイムは、AI安全性をRLHF、DPO、またはConstitutional AI(憲法的AI)によってモデル訓練中に注入される特性として扱う。我々は、コードを実行し、ファイルを変更し、メッセージを送信し、データベースを更新する自律エージェントにとって、これは構造的に不十分であると主張する。エージェント安全性は、ハーネスによって強制される実行時契約であるべきであり、その契約には互いに補完し合う二つの側面がある。予防的側面は、サンドボックス、許可ゲート、出力フィルタ、軌跡モニタを通じて、危険な行動が発生する前にそれを阻止する。証拠的側面は、適切な行動が実際に行われたことの検証可能な証明を要求し、テスト実行、ログ取得、ファイル差分、引用の根拠付けといった確固たる証拠にタスク提出を条件付ける。我々は、行レベルのプロトコルとデータを補足JSONファイルで公開しつつ、この立場を四つの系統の公開証拠に基づいて裏付ける。すなわち、記録された52件のAIエージェントおよびLLMの安全事故の調査、争いのない中核事例31件と論争のある例示事例1件からなる偽完了監査、12の公開エージェントシステムとハーネスに対する軌跡スキーマ監査、そしてNeurIPS、ICML、ICLRの2023〜2025年に採択された全28,560件の論文に対するタイトルレベル監査(訓練時と展開時の発表件数の間に、総合すると8〜12倍の不均衡があることを示す)である。安全性を強制する必要があった二つの先行コミュニティ、すなわちコンピュータセキュリティと実験科学は、予防的要素と証拠的要素の両方を備えた実行時契約に収束した。エージェンティックAIは今、同じ圧力にさらされている。我々は、エージェント軌跡スキーマと証拠連鎖を形式化し、標準的なモニタ合成に基づく合成的ゲーティングの命題を述べ、研究課題の概要を示す。エージェンティックAIにおける安全性の適切な単位は、検証可能な証拠を伴う軌跡であり、モデルではない。
大規模言語モデル(LLM)のマルチモーダル拡張は新たな知覚能力を可能にする一方で、事前学習中に獲得された言語知能を損なうことがしばしばある。本研究では、この現象を内部適応ダイナミクスの観点から調査し、事前学習済みLLM内のニューロンがマルチモーダル学習中に不均一な可塑性を示すことを発見した。すなわち、一部のニューロンは言語能力の維持に重要である一方、他のニューロンはマルチモーダル知識に対してより適応的である。この知見に基づき、我々はNeuPAT(Neuron-aware Plasticity Allocation Tuning:ニューロン認識型可塑性配分チューニング)を提案する。これは、マルチモーダル指示チューニング中にニューロン単位の更新制約を配分する、軽量かつアーキテクチャ非依存のフレームワークである。NeuPATは小規模なプロービング段階を用いてニューロンの適応パターンを推定し、言語に敏感なニューロンを選択的に保護しながら、より可塑性の高いニューロンを介してマルチモーダル適応を促進する。多様なLLMファミリーにわたる実験により、NeuPATは11の言語ベンチマークにおいて、標準的なチューニングによる言語能力の劣化の94.5%を回復しつつ、同等のマルチモーダル性能を維持することを実証した。これは、能力保持型マルチモーダル拡張のための効果的なアプローチを提供するものである。
実世界の画像から人間の視線目標を推定することは、重要かつ困難なタスクである。既存のアプローチは主に、視線分析の対象を特定するために、頭部のバウンディングボックスや人体ポーズなどの明示的な入力を必要とする、堅牢性に欠ける多段階パイプラインを採用している。その結果、検出エラーが連鎖し、失敗につながる可能性がある。さらに、これらの先行研究には、自然言語プロンプトによる視線分析タスクの指定という柔軟性が欠けている。このアプローチは、他の画像分析タスクにおいて利便性と拡張性に大きな利点があることが示されている。これらの限界を克服するために、我々は、視線分析のための新しいエンドツーエンドの概念駆動型パラダイムである、Promptable Gaze Target Estimation(PGE)タスクを導入する。PGE は、視線分析の特定の対象を識別するために、柔軟なユーザーテキストまたは視覚的プロンプト(例:「赤いシャツを着た少年」や「点 [0.52, 0.48] にいる人物」)に視線予測を条件付ける。このアプローチは、対象のローカライゼーションと視線推定を統合し、中間解析段階への固定的な依存を排除する。我々は、プロンプトでアノテーションされた高品質な12万組の画像ペアからなるデータセットおよびベンチマークである Gaze-Co(Gaze Estimation with Concepts)を生成するスケーラブルなデータエンジンを開発する。また、PGE 用に設計された最初のモデルである GazeAnywhere を提案する。GazeAnywhere は、トランスフォーマーベースの検出器を用いて凍結されたエンコーダからの特徴を融合し、対象のローカライゼーション、フレーム内/外の存在、および視線目標ヒートマップ推定を同時に解決する。GazeAnywhere は、複数の PGE ベンチマークで最先端の性能を達成し、困難なドメイン外の実世界の臨床データセットにおいても、この新しい問題に対する強力なベースラインを確立する。GazeAnywhere は github.com/IrohXu/GazeAnywhere でオープンソース化されている。
多数の大規模言語モデル(LLM)エージェントからなる社会のシミュレーションは高コストであるが、そのようなシミュレーションに対して問われる問いは通常、巨視的なものである。すなわち、相挙動、定型化された事実、エージェント数Nによるスケーリングなどであり、個々のエージェントの認知ではない。我々は統計物理学の観察を一つの手法へと転換する。各LLMエージェントを、数百から数千回の安価なクエリによって適合させた低パラメータモデルで置き換え、その後、任意のNでその社会をラップトップ上で実行するという手法である。これが機能するかどうかは、シミュレーションの実行前に、主に各エージェントが何を知覚するかによって決まる。我々は、知覚と記憶を有効理論および代理誤差の予測されるN傾向に対応付ける「相互作用次数×記憶」分類法を導入する。我々はこれを、LLMマクロ経済エージェントEconAgentの忠実な再実装と、さらに名前の付いた7つのLLMシミュレーションで検証する。エージェントの意思決定は、実際のLLM(主にDeepSeek)から数ドルで引き出した応答から複製されたものである。予測された誤差傾向はセルごとに成立し、反証された2つの予測(いずれも強く飽和する応答に関するもので、その曲率に起因する)もまた、自由パラメータなしで理論と定量的に一致する。
Vision-Language-Action(VLA)モデルは具現化AIを大きく前進させてきたが、その根本的に反応的なパラダイムは、部分観測タスクや長期的タスクにおける性能を深刻に制限している。単一の手首搭載カメラに限定された場合、物体が視野から外れるにつれて生じる知覚の忘却と、多段階実行中に生じる時間的タスク進捗の忘却を不可避的に引き起こす。これらのボトルネックを克服するため、我々はAtlasVLAを提案する。これは、直接的な反応的操作から、持続的なワールド・エゴ状態に基づく能動的推論へと転換する新規フレームワークである。AtlasVLAは二重メモリアーキテクチャを特徴とする。すなわち、一時的な2次元観測を大域的に更新されるボクセルハッシュ空間状態へと変換し、視覚的な死角を解消する4D持続的世界状態メモリと、過去のエゴ状態とタスク進捗を追跡するエゴ作業状態メモリである。この統合されたワールド・エゴ状態を用いて拡散トランスフォーマー(DiT)を条件付けることにより、AtlasVLAは頑健な空間推論を実現する。LIBERO、RLBench、および実世界ベンチマークにわたる広範な評価により、AtlasVLAが手首カメラのみを用いて最先端の性能を達成することが実証された。特筆すべきことに、AtlasVLAは多視点ベースラインを決定的に上回り、LIBERO-Longでは9.4%、実世界の長期的タスクでは17.5%の絶対成功率の向上を達成した。
LLMエージェントサービスは、モデル呼び出しとツール呼び出しの間で、小さな決定論的遷移を繰り返し実行する。すなわち、結果をルーティングし、状態を更新し、次の効果を発行する。本稿では、この制御経路がGPU実行に十分な並行作業をいつ露出させるのか、そしてGPUで計算された経路決定がデバイス上に留まると何が変わるのかを問う。実行準備完了コホート境界を、固定分割シェアF、正確なオフラインシェアP*、局所的上界U、オンライン達成シェアAを用いて形式化する。サービス時間ゼロ、無制限容量、等しい相対起動期限の下では、特化した動的計画法がP*を正確に計算する。固定された1つの851セッションの公開トレースパネルの定常ポアソンリプレイにおいて、ターゲットアクティブセッション数100,000、K=256、起動期限50msの主要条件では、F=30.19%、P*=43.00%、U=45.85%となる。正確なパッキングは、固定ウィンドウ境界で失われた機会の81.83%を回復する。結果から導出された経路キーは条件付けの代理指標であり、実行可能な処理の同一性の証明ではない。別のメカニズム研究では、GPUで計算されたバイナリ決定を、ホストに4バイトを返して再ディスパッチする代わりに、デバイス上に保持する。4つの名前付きGPU配置のすべてにおいて、デバイス常駐パスは全36構成でより高速であり、同一配置内の行中央値比は1.19倍から2.39倍の範囲である。許容可能な両メカニズムの双方において、テストされた14,557,440件すべてのバッチ呼び出しは、別途実装されたホストオラクルと一致する。ホスト決定を一切除去しない固定ネストデバイスグラフは、5つの配置にわたる全60構成でより低速である。これらの研究は合わせて、GPUエージェント制御のための2つの測定可能なゲート、すなわち期限実行可能なコホート供給と観測配置を確立する。A、CPU処理の置換、およびサービスレベル上の利益を測定するには、統合された有限のオンラインランタイムが必要である。
手のポーズ推定(HPE)は、AR/VRやロボティクスなど様々なアプリケーションの基盤技術である。これらのアプリケーションでは、画像内の各手の関節の可視性が、オクルージョン下での推定結果の信頼性を評価する上で重要である。しかし、既存のHPE手法のほとんどは関節位置を出力するだけで、その可視性を明示的に示していない。一部の手法はオクルージョンや可視性を考慮するものの、可視性推定は主にポーズ推定を改善するための補助信号として用いられてきた。我々の知る限り、関節ごとの手の可視性推定は、単独タスクとして系統的に研究されていない。本研究では、個々の手の関節の可視性を推定するモデルであるHand Visibility Detectorを提案し、可視性推定を独立したタスクとして扱う初の系統的調査を示す。大規模データで事前学習されたHPEモデルの事前知識をバックボーンとして活用することで、このタスクにおいて高い性能が得られることを示す。さらに、2次元キーポイントの多視点三角測量による3次元手のポーズアノテーションという下流タスクにおけるHand Visibility Detectorの有用性を実証し、可視性重み付き三角測量が再投影誤差を低減することを示す。本手法は即時利用可能なパッケージとして公開されており、コードとデモはhttps://github.com/ryhara/hand_visibility_detector で入手できる。
ReRound(Reconstructive Rounding)は、訓練後量子化手法の一つであり、量子化区間の中点付近にある重みを量子化する際に、標準的な最近傍丸め(RTN)方式に内在する中点の曖昧性に対処する。 事前学習済みのLLMから出発し、ReRoundは条件付き拡散モデルを訓練して、LLMの低ビット重みの連続的な再構成を生成する。これらの再構成された重みは、区間中点付近に位置する重みの丸め方向の曖昧性を解消するためのガイダンス信号として機能する。 この再構成誘導型丸めを従来のRTNと統合するため、ReRoundは許容度メトリックを導入する。これは、最終的な量子化整数ではなく量子化された重みが、中点からどれだけ離れているかを測定する。中点周辺の許容領域内にある量子化重みは拡散モデルベースの再構成を用いて量子化され、量子化境界に近い重みはRTNで量子化される。 許容度パラメータを走査することにより、ReRoundは複数の候補となる量子化整数重み行列を生成し、その中から、主要な特異値が元の全精度重みのものと最もよく一致する逆量子化重み行列の候補を選択する。この選択された候補によって、ReRoundが使用する許容度パラメータが決定される。 ReRoundは特に小規模なLLMに対して効果的である。そのようなモデル群において、3ビットおよび4ビットの重み量子化で標準的なRTNを一貫して上回る。ReRoundは、広範なキャリブレーション不要手法群と比較して優れた精度を達成し、キャリブレーション依存手法と競争力のある精度を維持し、完全にオフラインで動作するため、低ビット推論時に追加のオーバーヘッドを導入しない。 ReRound戦略は、低ビット量子化に対する新しいアプローチを表している。この手法はLLMを超えたAIモデルにも適用可能である。本論文では、その小規模LLMへの応用に焦点を当てる。