翻訳付きの日次キュレーションされたAI研究論文
現代のAIエージェントの能力は、その基盤モデルだけでなく、プロンプトを構築し、状態を管理し、ツールを呼び出し、実行を調整するハーネスにも依存している。モデル、API、環境、要件が変化するにつれて、ハーネスは継続的に修正されなければならない。こうした変更を行う前に、開発者またはコードエージェントは、対象の振る舞いを実装しているすべてのコード箇所を特定する必要がある。しかし、プロダクションハーネスは大規模で密結合されており、振る舞いが分散している上、修正要求はシステムのあるべき動作を記述するのに対し、リポジトリはファイルやモジュールで整理されているため、この作業は困難である。コード検索、リポジトリインデックス作成、長文脈処理は検査を容易にするが、それでも振る舞いからコードへのマッピングは手動で復元する必要がある。したがって、振る舞いの特定はハーネス進化における中心的なボトルネックとなっている。本論文では、ハーネスコードベースから静的解析とLLM支援構造化を介して自動的に合成され、各振る舞いを対応するソースにリンクする、振る舞い中心の表現であるHarness Handbookを提案する。さらに、Behavior-Guided Progressive Disclosure(BGPD)を導入する。これは、エージェントを高レベルの振る舞いから関連する実装の詳細へと導き、候補箇所を現在のソースに対して検証する手法である。2つのオープンソースハーネスに対する多様な修正要求において、Handbook支援による計画は、より少ないプランナートークンで振る舞いの特定と編集計画の品質を向上させ、特に分散した箇所、ほとんど実行されない経路、モジュール間相互作用において最大の効果を示した。複雑なエージェントシステムの進化は、編集の生成だけでなく、その編集をどこに行うべきかを決定することにも依存しているのである。
我々は、オープンソースの統一マルチモーダル理解生成モデルファミリーであるBoogu-Image-0.1を紹介する。これはBase、Turbo、Edit、Edit-Turboの各バリアントから構成され、高品質なテキストから画像への生成、高速推論、指示ベース編集、およびバイリンガル(中国語-英語)テキストレンダリングにおいて競争力のある性能を発揮する。Nano-Banana-ProやGPT-Image-2のようなクローズドソースのマルチモーダルシステムは、単一モデルではなくシステムレベルの統合により強力な性能を達成しているが、その内部実践はほとんど公開されていない。本研究では、モデル理解、データ品質、トレーニングパイプラインへの的を絞った改善と、エージェント的推論時スケーリングを組み合わせることで、非常に制約の厳しい計算予算下でも生成・編集性能を大幅に向上できることを示す。包括的な評価により、Boogu-Image-0.1が標準ベンチマークにおいて他のオープンソースモデルと一貫して同等かそれ以上の性能を示し、主要なクローズドソースシステムに迫る結果を達成することが示された。特筆すべきは、これをわずか2億862万枚のユニークな画像で達成している点である。ベースモデルの理論上のトレーニングコストは約40万ドルに過ぎない。我々は、広範な研究コミュニティにとって価値があると考える実践的な議論を共有し、統一マルチモーダル理解生成のためのオープンエコシステムを推進するため、Apache 2.0のもとで重み、コード、レシピを公開する。コードはこちらで入手可能である:https://github.com/Boogu-Project/Boogu-Image
人間による注釈データを必要としない検証可能な報酬を用いた強化学習(しばしばゼロRLと呼ばれる)は、思考連鎖推論を引き出すための強力なパラダイムとして登場した。しかし、計算リソースの制約から、既存の研究は主に小規模モデルに限られており、大規模スケールにおける学習ダイナミクスや創発的能力は未解明のままである。このフロンティアを有意義に探求するため、我々はモデルから高品質な推論行動を引き出すことを目指す。しかし、単純なスケーリングでは、可読性の低下、トークンの冗長性、適応的な推論の深さの欠如といった問題が生じることを発見した。これらの課題に対処するため、我々は安定かつ効率的な学習パイプラインを提案する。これは、クリップ付き重要度サンプリング、学習-推論比率補正、混合精度制御といったアルゴリズムおよびシステムの最適化を組み込んでいる。実験から得られた主な知見は3点であり、スケーリングの「苦い教訓」を裏付けるものである。(1) パラメータ1兆規模へのスケーリングは、サンプル効率と性能上限を大幅に向上させる。(2) 学習プロセスは、初期の発見フェーズとその後のシャープニングフェーズを順次経て進行する。(3) モデルは、擬人化、構造化フォーマット化、自己検証、並列推論、コンテクスト不安など、高度な認知行動を自発的に発達させ、手作りのヒューリスティックスを不要にする。7つの数学ベンチマークで評価した結果、Ring-2.5-1T-Zeroは競争力のある性能を達成した。さらに、最終的な正解の正確性を超えてCoTの品質を評価するため、理解可能性、再現性、効率性の3次元からなる構造化評価フレームワークを提案し、我々のモデルが構造化され簡潔な推論トレースの生成において明確な優位性を示すことを明らかにした。観測された創発現象を共有することで、特に1兆パラメータ規模におけるスケーリング行動に関する深い洞察をコミュニティに提供したい。
OpenClawは複雑なタスク自動化のための主要なエージェントフレームワークとして登場したが、クロスプラットフォームGUIインタラクションのサポートが不十分であり、自己進化機構も十分に構築されていない。これらの欠陥により、多様なデバイスエコシステムへの適応が制限され、実行経験からの継続的学習による性能向上が阻まれている。これらの問題を解決するために、我々はパーソナルアシスタント向けの「Know Deeply, Act Perfectly」パラダイムを提案する。このパラダイムは、蓄積されたユーザーインタラクションとタスク実行経験が実行精度と効率を直接向上させ、認知的理解と操作実行を統合するという考えに基づいている。このパラダイムに基づき、我々はOpenClawのGUI操作の欠陥に対処し、そのクロスプラットフォームおよび再帰的自己改善の制約を打破するために設計された、新規なKnow-Route-Act-ReflectフレームワークであるKnowAct-GUIClawを導入する。第1に、ホストエージェントは蓄積されたインタラクション経験とタスク関連知識を活用して、長期的なタスク分解と割り当てを行う(Know)。第2に、経験帰属可能なメモリシステム(Know)と自己進化型スキルライブラリ(Act)を備えたプラグイン可能なGUIサブエージェントにより、シームレスなクロスプラットフォーム移行と高速パス統合が可能になる。特に、このフレームワークはユーザープロファイルとフィードバックを継続的に保存し、タスク分解とツール呼び出しの精度を向上させる。Android、iOS、HarmonyOS、Windowsにわたる広範な実験により、KnowAct-GUIClawは優れた効率性、精度、クロスプラットフォーム適応性を達成することが示された。特に、オープンソースのKimi-2.6モデルを用いたGUIClawは、長期タスク向けMobileWorldベンチマークで最高性能(64.1%)を達成し、全てのエージェントフレームワークおよびクローズドソースのエージェントモデル(Seed-2.0-ProやGPT-5.5など)を凌駕した。さらに、我々のフレームワークがサポートする知識ベースのメモリと実行スキルは多様なベースモデル間で転送可能であり、Kimi-2.6では8.5%の改善が見られた。
OvisOCR2(0.8Bパラメータの文書解析モデル)を紹介する。OvisOCR2はエンドツーエンドのパーサーとして設計されており、文書ページ画像を入力として、テキスト、数式、表、視覚領域を網羅した自然な読解順序のMarkdown表現を生成する。我々は、フィルタリング済みの実文書アノテーションと、同一のHTMLソースからレンダリング画像とMarkdownターゲットを生成した合成ページを組み合わせたデータエンジンを構築した。学習レシピには、教師ありファインチューニング、4Bブランチにおけるマルチコンポーネント報酬設計を用いた強化学習、その結果の0.8Bモデルへのオン・ポリシー蒸留、およびモデル融合が含まれる。OmniDocBench v1.6において、OvisOCR2は総合スコア96.58を達成し、従来パイプラインメソッドが支配していたリーダーボードでエンドツーエンドモデルがトップに立ち、エンドツーエンド文書解析の可能性を示している。PureDocBenchでは、最高のAvg3スコア75.06を達成した。これら2つの公開ベンチマークに加え、より広範なロングテールかつ挑戦的なシナリオをカバーする社内ベンチマークでも評価を行い、OvisOCR2は比較手法の中で最高の総合性能を示し、その汎化性能とロバスト性をさらに実証した。OvisOCR2はhttps://huggingface.co/ATH-MaaS/OvisOCR2で入手可能である。
画像ガードレールは通常、固定された安全ポリシーの下で訓練・評価され、安全性を画像の固有の特性として暗に扱っている。しかし、実際のデプロイ環境は異なる。同じ画像がある製品では許可され、別の製品では制限され、ポリシー境界が変更されると新たに不許可となる場合がある。本研究では、ポリシー適応型画像ガードレールについて検討する。これは、モデルが現在提供されているポリシーに違反しているか否かを判断し、未見のポリシー定義に対しても汎化しなければならないタスクである。我々は、265枚の画像に対する2,000個のポリシー識別インスタンスからなる包括的ベンチマーク「PolicyShiftBench」を導入する。各画像は平均7.55個のポリシー条件付きプロンプトとペアになっており、モデルが画像レベルの安全性事前知識に依存するのではなく、アクティブなポリシーに適応するかどうかをテストする。さらに、ランダム化ポリシーSFT(RP-SFT)と境界ペアポリシー適応(BP-Adapt)を組み合わせた2段階訓練法で学習する、コンパクトなポリシー条件付きガードレール「PolicyShiftGuard」を提案する。BP-Adaptは、同一画像かつ同一リスクカテゴリに対して、標準ラベル教師あり学習と、ブロックポリシーと通過ポリシーを分離するペアワイズ比較損失を用いて、対応するプロンプトを訓練する。実験により、既存のVLMや専用ガードレールはポリシーシフト下で脆弱であるのに対し、PolicyShiftGuardはポリシー感受性の性能を大幅に向上させることが示された。7BモデルはPolicyShiftBenchにおいて76.9の平均F1スコアと72.1の平均PSSを達成し、UnSafeBenchおよびSafeEditBenchへの転移も良好であり、簡潔な出力形式によりレイテンシとパフォーマンスのトレードオフを改善する。アブレーション研究により、通過/ブロック境界ペアの一致が安定したポリシー適応に不可欠であることが確認された。
現在の視覚生成モデルは高品質なコンテンツを生成できるものの、空間構造に対する一貫した認識を欠いている。既存の生成的視点合成手法は通常、明示的な幾何学事前知識を導入することで空間的一貫性を強制するが、その結果として大きな視点変化における汎化性能が本質的に制限される。一方、最近のインタラクティブ生成手法は暗黙的なシーンモデリングを優先し、柔軟性を高める反面、精密なカメラ制御や幾何学的一貫性を犠牲にしている。本論文では、単一画像から大きな視点変化下でのレンダリングを可能にする、拡散型単眼視点合成フレームワーク「MetaView」を提案する。我々の核心的洞察は、暗黙的幾何学モデリングと最小限かつ本質的な明示的3D手がかりを組み合わせることである:フィードフォワード型幾何認識ネットワークからの暗黙的幾何学事前知識を取り入れて、制限的な再構成パイプラインを課さずに構造を正則化しつつ、メートル深度を活用して生成をメートルスケールに固定する。この設計により、MetaViewは幾何学的一貫性と精密な制御可能性の両立を実現する。広範な実験により、困難な単眼大視点変化条件下において、MetaViewが既存手法を大幅に上回る性能を示し、優れた汎化能力を発揮することが実証された。我々のコードはhttps://github.com/KlingAIResearch/MetaViewで公開されている。
ワールドアクションモデル(WAM)は、動作と将来の視覚観測を同時にモデル化し、将来のシーン変化を物理的に根拠づけられた動作生成のための密な教師信号として利用することで、ロボットの政策学習を改善する。しかし、既存のWAMにおける一般的な設計では、推論時に将来の動画を明示的に生成する必要があり、これにより大幅な計算オーバーヘッドが生じ、リアルタイムの閉ループ展開が妨げられる。GigaWorld-Policyは、訓練時には将来の視覚ダイナミクスを活用しつつ、推論時には動作のみのデコードを行う動作中心の定式化により、この問題に対処する。本フレームワークに基づき、より効率的なロボット制御を目的とした強化版動作中心WAMであるGigaWorld-Policy-0.5を提案する。事前学習では、GigaWorld-Policy-0.5は混合されたAction-Conditioned World Modeling(AC-WM)とWAM訓練戦略を採用する。これにより、視覚ダイナミクスとロボット動作の間の結合が強化され、下流の政策学習における動作表現の転移可能性が向上する。効率的な推論のために、GigaWorld-Policy-0.5はMixture-of-Transformersアーキテクチャを導入し、視覚ダイナミクスのモデル化と動作生成を専門化されたエキスパートに分離する。これにより、動作のみの推論時のアクティブ計算が削減され、ローカルRTX 4090環境において85msの推論遅延を達成する。さらに、エージェントベースのAutoResearchパイプラインを活用して訓練設定を系統的に探索し、ハイパーパラメータ調整に要する時間と手動介入を低減しつつ、最適な実験設定をより効率的に特定する。実験およびアブレーション研究により、GigaWorld-Policy-0.5は将来の視覚ダイナミクスの訓練上の利点を保持しつつ、ロボット制御における推論効率を向上させることが示される。
Vision Transformers(ViT)は、高ノルムのパッチトークン外れ値を示し、特徴マップの品質を低下させることが知られており、この問題はレジスタトークンによって効果的に緩和される。拡散モデルがトランスフォーマーアーキテクチャを採用し、画素空間での学習へと移行するにつれて、その形式はViTに近づき、レジスタトークンがDiffusion Transformers(DiT)にも有効かどうかという疑問が生じる。本研究では、DiTがViTとは重要な点で異なることを示す。すなわち、DiTはパッチトークン外れ値を示さないが、それでもレジスタの恩恵を受ける。興味深いことに、レジスタは潜在空間DiTよりも画素空間DiTにおいてより効果的である。中間表現を分析することで、レジスタトークンが高ノイズレベルでよりクリーンな特徴マップを生成することを発見し、これが画素空間生成におけるその有効性に寄与している可能性がある。さらに、最近の画素空間DiTアーキテクチャは暗黙的にレジスタのようなメカニズムを取り入れており、これがその高い実証的性能を部分的に説明している可能性があることを観察する。これらの観察に動機づけられ、視覚的構造と一貫性を向上させる役割を担うレジスタトークンの寄与を増幅する手法であるRegister Guidanceを提案する。
自己改善型自律エージェントは、研究プロトタイプから実運用システムへと移行しつつある。主要な目標は、人間の入力を最小限、あるいはまったく必要とせずに、経験から制御可能な進化、すなわち適応を実現することである。本調査では、現代の自己改善型エージェントを、経験を蓄積された能力向上へと変換する適応システムとして位置付ける。我々は、現代のエージェントを、基盤モデルとプロンプト、メモリ、ツール、制御ロジックからなる運用スキャフォールドとを結合した構成として表現する、システムレベルの枠組みを提供する。この枠組みにおいて、自己改善は、モデルパラメータまたはスキャフォールドコンポーネントに対する更新を取得し確定する、自己誘発的な更新演算子として形式化される。我々は、更新対象と変化を駆動する信号に基づいて先行研究を整理し、その後、応用を概観し評価について議論し、最後に未解決問題と将来の方向性で締めくくる。便宜上、技術的な更新は https://github.com/selfimproving-agent/awesome-Self-Improving-Agents で追跡している。
近年の3D生成技術の進歩により、視覚的合成において顕著な成果が得られているが、既存手法の多くは幾何学的整合性を明示的に保証する機構を持たない2D拡散の教師信号に依存しており、構造の重複や位置ずれなどの空間的幻覚を引き起こす。こうした問題は4D生成においてさらに深刻化し、視点間および時間的変化にわたる整合性維持に伴う課題として、ジッター、アイデンティティのフリッカー、構造的ドリフトなどが生じる。本稿では、3Dおよび4Dコンテンツ生成における時空間的幻覚を軽減するための統一的かつモデル非依存のフレームワーク「Hallo4D」を提案する。Hallo4Dは、生成・検出・修正のパラダイムを導入し、大規模マルチモーダル言語モデル(LMM)を活用して、マルチビューおよびマルチフレームレンダリングから空間的・時間的な不一致を特定・要約する。これらの知見に基づき、LMMベースのセレクタがマルチモデル投票を通じて修正候補を評価するコンセンサス駆動型の画像空間整合性最適化を導く。本手法は再学習やアーキテクチャ変更を必要としない。さらに、時間的整合性と最適化効率を向上させるため、Hallo4Dは動作認識キーフレームサンプリング、LMM誘導型初期化、外観アライメントを組み込む。また、露出認識最適化と可視性プルーニングを導入し、困難な視点下でのロバスト性を強化する。広範な実験により、Hallo4Dは多様な3D・4D生成設定において強力なベースラインを一貫して上回り、整合性を考慮したコンテンツ生成に対するスケーラブルで汎用的なソリューションを提供することを実証する。
構造的刈り込みは、大規模言語モデル(LLM)を圧縮するためのハードウェアに優しい手法であるが、その有効性は主に多肢選択認識タスクで検証されており、同じ圧縮チェックポイントが実際のデプロイメントで必要とされる自由形式生成では崩壊することがある。この乖離は2つの観察によって説明される。第一に、貪欲法によるpass@1は圧縮後ほぼ消失するが、pass@kは繰り返しサンプリングによって大幅に回復する。すなわち、有用な生成は抹消されるのではなく格下げされるのである。第二に、回復可能な領域は主に接尾辞の繰り返しによって失敗する。したがって回復は、圧縮モデル自身のオン方策状態に対して、密なトークンレベルの教師信号を用いて訓練するべきであり、これをオン方策蒸留(OPD)が提供する。OPDは圧縮前のモデルを凍結された教師として再利用する。しかしながら、長いオン方策ロールアウトは、初期の回復予算を情報量の少ない繰り返し接尾辞に費やし、損失の減少を遅らせる。この無駄を軽減するために、我々はShortOPD(短→長OPDスケジュール)を提案する。これは教師が確認した繰り返し接尾辞を検出し、生き残った接頭辞を各ロールアウトの有効長として扱い、将来のロールアウト予算をポリシーが現在使用可能な有効長に割り振る。数学、コード、自由形式生成の各タスクにおいて、ShortOPDは圧縮モデルのスコアを未回復時の約9倍、標準的な回復手法(SFT w/o KD、KD、SeqKD)の1.6倍から4.4倍に向上させる。また、固定の8192トークンのロールアウト水平線と比較して、2ポイント以内の差で、トレーニング時間を4分の1(8.5時間対35.9時間)に削減し、ロールアウトトークンを71%削減する。本手法が、構造的刈り込みを困惑度や多肢選択ベンチマークにおけるわずかな改善の域を超えて、デプロイメント可能な生成品質へと一歩近づける一助となることを期待する。
大規模言語モデル(LLM)が自律エージェントへと進化するにつれ、統一的な評価基盤の重要性が高まっている。しかし現状の評価パイプラインは依然として非常に断片的かつ密結合であり、再現性を妨げるとともに冗長なエンジニアリングを引き起こしている。この課題に対処するため、我々はLLMベースのエージェントを評価するためのオープンソースで軽量かつ拡張可能な基盤であるAgentCompassを提案する。AgentCompassは評価プロセスをBenchmark、Harness、Environmentという3つの独立したコンポーネントに整理することで、複雑な実行ロジックの再実装を必要とせずに柔軟な設定を可能にする。さらに、耐障害性のある非同期ランタイムと包括的な軌跡分析ツールを備え、報酬ハッキングのような微妙な障害モードを透過的に診断できる。AgentCompassは5つの能力次元にわたる20以上のベンチマークをネイティブでサポートし、エージェント研究を前進させるためのスケーラブルで再現可能な基盤をコミュニティに提供する。
インテリジェントアシスタントは、いつ能動的に発言すべきか。連続的な自己中心視点映像は、豊かで進化する文脈を提供し、単なる反応型ではなく能動型の新たな支援を可能にする。しかし、既存のアプローチでは、ユーザの問い合わせを消極的に待つか、検出されたあらゆるイベントを応答すべきものとして扱い、ユーザの履歴や現在の活動、支援が実際に望まれるかどうかを考慮しない。我々は能動的支援を、状況に依存した意思決定問題として再定義する。すなわち、エージェントは何が起きているかを認識するだけでなく、蓄積された時間的文脈に基づいて推論し、いつ、そして介入すべきか否かを判断しなければならない。この目的のため、我々はVinci2を提案する。これは、オンデバイスアシスタントVinciを反応型応答から能動性へと進化させる、能動的自己中心視点支援システムである。評価面では、連続的な自己中心視点映像における能動的支援のための初の大規模ベンチマークであるEgoServeを提示する。EgoServeは、即時的な安全警告から長期にわたる習慣指導まで、4つの時間的記憶範囲(temporal memory horizons)に沿って構成された3,000以上のサービスインスタンスを、10のサービスカテゴリにわたって含む。モデリング面では、学習不要の記憶拡張エージェントEgoMemoを提案する。これは、マルチスケールの時間的要約、意味的知識グラフ、視覚的埋め込みアーカイブという、相補的な三つの記憶表現を維持する。各タイムステップにおいて、EgoMemoは検索拡張推論(retrieval-augmented reasoning)を実行して支援が適切かどうかを判断し、適切であれば文脈に基づいた応答を生成する。実験により、EgoMemoは既存の自己中心視点ベンチマークにおいて競争力を保ちつつ、EgoServe上で強力なベースラインを確立することを示す。我々のベンチマークとコードはhttps://sitonggong.github.io/EgoServe-page/{Vinci2}で公開されている。
LLMベースのエージェントシステムに対する故障帰属、すなわち故障軌跡内のどのステップがタスクの失敗を引き起こしたかを特定することは、これらのシステムのデバッグと改善において極めて重要である。既存の手法は、計算コストが高いプロンプトベースのパイプラインに依存するか、または収集にコストがかかりスケーリングが困難なステップレベルのエラー注釈付き故障軌跡に対する事後学習を必要とする。我々は、実用的な故障帰属モデルは軽量であり、かつ故障データに対するステップレベルの教師信号なしで訓練可能であるべきだと主張する。この目的のために、我々は教師なし故障帰属、すなわち成功軌跡のみで訓練し、推論時に故障軌跡が与えられた際にエラーステップを特定する問題に取り組む。我々はOATを提案する。これはこの問題を、ニューラル制御微分方程式を用いた一クラス学習として捉え、潜在空間における成功軌跡の動的パターンをモデル化する。推論時には、故障軌跡の各ステップに対して、成功軌跡から学習されたダイナミクスからの逸脱に基づいて異常スコアが割り当てられ、これを用いてエラーステップの集合が形成される。わずか100の成功軌跡での訓練により、実験ではOATはプロンプトベースのベースラインよりも200~5000倍高速であり、同時にドメイン内および分布外の両方のデータセットにおいて一貫してそれらを上回り、それぞれ+20%および+7%のF1スコアを達成した。これはOATがエージェントシステムの故障診断に向けた有望かつ効率的な方向性であることを示している。
離散デノイジング拡散モデル(DDMs)は近年、離散データに対する自己回帰(AR)モデリングの有力な代替手法として登場し、並列生成と反復的グローバルリファインメント能力を提供している。状態空間が固定された連続拡散とは異なり、DDMsは離散状態空間の構築方法、すなわちトークン化手法、語彙トポロジー、およびドメイン固有の構造的アルファベットによって根本的に形成される。本研究では、離散拡散モデルを基礎となる離散状態空間の構築を通じて捉える統一的な概念的枠組みを提示する。この枠組みの下で、遷移行列、マスキング/吸収状態、スコア/比ベースの手法を含む既存の定式化は、共通の設計空間における異なる具体化として現れる。さらに、この枠組みは、訓練目的、推論アルゴリズム、スケーリング挙動、システム最適化、評価プロトコルにわたる共通の設計トレードオフを明らかにし、今後の研究に向けたいくつかの有望な方向性を示唆する。
大規模言語モデル(LLM)エージェントは、応答生成に留まらず、ツールを呼び出し、結果を観察し、次のアクションを反復的に決定することで多段階タスクを実行するようになっている。ほとんどのエージェントシステムはデスクトップやサーバー上で動作し、ツールの利用とタスク自動化をサポートしている。モバイルデバイスも、広く利用可能でユーザーのデータ、センサー、日常的なアプリケーションを含むため、重要なエージェント環境である。既存のモバイルエージェントは主に、タップ、スワイプ、タイピングといったグラフィカルユーザーインターフェース(GUI)操作を通じてスマートフォンを操作するが、これらは長くインターフェースに依存したシーケンスを形成しがちであり、デバイス機能に直接アクセスできず、実行境界の定義を困難にしている。我々はPalmClawを提案する。これはモバイルフォン上でネイティブに動作し、セッション、メモリ、スキル、ツール、エージェントループをデバイス上で直接管理するオープンソースのエージェントフレームワークである。PalmClawはデバイス機能を、明示的な引数、構造化された結果、明確に定義された実行境界を持つデバイスツールとして公開する。この設計により、エージェントは各アクションを明示的かつ制御可能に保ちながら、モバイル機能を直接利用できる。実験では、最強のベースラインと比較してタスク成功率が11.5%向上し、完了時間が94.9%短縮され、セットアップ負荷が低減され、実行境界の適用方法を示すトレースが得られた。コードはhttps://github.com/ModalityDance/PalmClawで入手可能である。
長期的なエージェントの最適化は、大規模言語モデル(LLM)がオプティマイザとして機能し、エージェントの障害を診断してポリシーを改善する、反射ベースのメカニズムに依存するようになってきている。しかし、実際の実行トレースを最適化に直接利用することは困難である。大規模なトレースコレクションは冗長で多様性に欠けることが多く、最適化が非効率になり、価値の低い障害への過適合を起こしやすい。また、個々の軌跡にも多くの無関係なステップが含まれており、切り捨てやスライディングウィンドウといった単純なコンテキスト削減手法では、因果的に重要な証拠を破棄し、誤った最適化シグナルを生成する可能性がある。このジレンマを解決するために、我々はSTRACE(Structural TRajectory Analysis and Causal Extraction)を導入する。これは、より高信号・低ノイズの最適化コンテキストを構築し、より正確かつ効果的な最適化を実現するフレームワークである。バッチレベルでは、STRACEは障害パターンをマイニングして冗長なトレースをフィルタリングし、代表的な障害を保持する。選択された各トレース内では、テキスト依存グラフ上で因果関係の特定を行い、非因果的なステップを除去し、最適化のための真の根本原因モジュールを特定する。実証結果は、STRACEが標準的なコンテキストフィルタリングベースラインを大幅に上回ることを示している。特に、難易度の高い形式検証タスク(VeruSAGE-Bench)では、人間の専門家が設計したエージェントの最適化に成功し、成功率を1.4倍(42.5%から58.5%)向上させた。コードはhttps://github.com/moomight/STRACE で公開されている。
長さペナルティ付き強化学習は、思考連鎖推論を短縮しつつ、モデルの回答を導く影響を隠蔽することが可能である。我々の実験では、長さペナルティを用いた訓練は、モデルの回答に誤ったヒントを誘導することを阻止できない。たとえモデルの思考連鎖においてヒントへの言及頻度が大幅に減少してもである。トークン精度評価では、推論トークン数を削減しつつ精度の低下がほとんどないため、これらの実行は成功とみなされるが、残された痕跡が依然として回答を駆動した要因を示しているかどうかは捉えられない。我々は、異なる目標思考連鎖長を持つQwen3-4BおよびQwen3-14Bの変種を訓練し、保持されたMMLU-Pro-Rおよび4つの転移ベンチマーク上でバイアスヒント介入による評価を行った。圧縮により推論トークンは大幅に削減され、多肢選択式の精度は概ね維持される一方、ヒントの影響はベースライン近傍に留まる。最も強い目標設定では、下界の忠実性はQwen3-14Bでベースラインの63.1%、Qwen3-4Bで69.4%に低下する。モニターがヒントの使用を検出する生の割合は、それぞれ69%から49%、60%から48%に低下する。長さと内容を分離するため、圧縮されていないベースラインの思考連鎖から、残ったテキストが圧縮後の長さと一致するまで文をランダムに削除した。この長さ一致の後でも、圧縮された思考連鎖は、Qwen3の両サイズおよび全5つの評価分布において、ランダムに短縮したベースラインの思考連鎖よりも、ヒントを開示する頻度が7~35パーセントポイント低い。したがって、圧縮は推論を短縮する以上の効果を持ち、モニターが回答に影響を与えた要因を確認するために必要な手がかりを優先的に除去する。これらの結果は、圧縮-監視可能性フロンティアが存在することを明らかにし、安価な推論が回答を維持しつつ、その背後にある影響を検出しにくくする可能性を示している。
AIペネトレーションテストエージェントは、攻撃的セキュリティシステムとしてますます信頼性を高めているが、現行のベンチマークでは、実際のターゲットにおいてどのエージェントが最も優れた性能を発揮するかについて、限定的な指針しか提供していない。既存の評価プロトコルは、簡略化または限定された環境において、キャプチャ・ザ・フラッグ、リモートコード実行、エクスプロイト再現、軌跡類似性といった事前定義された目標を評価・最適化するものである。これらのツールは限定的な能力の測定には有用であるが、現実のペネトレーションテストに求められる複雑性、自由な探索、戦略的意思決定を十分に捉えられていない。本論文では、評価をタスク完了から検証済み脆弱性発見へと転換する実用的な評価プロトコルを提示する。これにより、複数の攻撃面と脆弱性クラスにまたがる十分に複雑なターゲットにおける評価が可能となる。本プロトコルは、構造化グラウンドトゥルースとLLMベースのセマンティックマッチングを組み合わせて脆弱性を特定し、現実的な曖昧性の下で発見結果をスコア化するための二部解決、継続的なグラウンドトゥルース維持、確率的エージェントの反復・累積評価、効率指標、持続可能な実験のための縮小スイート選択を特徴とする。このプロトコルは、AIペネトレーションテストエージェントのより現実的かつ運用上有益な比較を可能にすることで、最先端技術を拡張する。再現性を確保するため、専門家が注釈を付けたグラウンドトゥルースと提案プロトコルのコードも公開する:https://github.com/ethiack/ethibench。
自律型UAVシステムは、複雑な実世界環境での動作実現のために、多様なマルチモーダル大規模言語モデル(MLLM)への依存を強めている。このような身体化シナリオでは、周囲空間の理解に加え、エージェント自身の一貫した表現を維持することが求められる。しかし、既存のUAV向けアプローチやベンチマークは環境中心の設計が大半であり、主に空間理解タスクに焦点を当てており、エージェントの自己認識は暗黙的に扱われるに留まっている。このギャップを埋めるため、本稿では統一的な「空間内の自己」形式に基づくUAVシナリオ向け身体化空間知能評価ベンチマークであるSIS-Benchを導入する。SIS-Benchは、空間と自己という補完的な二つの次元、ならびに知覚、記憶、推論からなる三層の階層に沿って評価を構成する。本ベンチマークは、専門家検証を伴うタスク条件付き構築パイプラインを通じて1,646本の実世界UAV映像から派生した13タスク、4,856組の質問回答対を収録する。 広範な評価から、現行のMLLMは動的かつエージェント中心のプロセスをモデル化する上で根本的な限界を持つことが明らかとなった。特に、空間認知と自己認識の間には顕著な不均衡が認められ、認知レベルが上がるにつれて性能が段階的に低下する傾向が観察された。これらの知見に動機づけられ、我々はさらに、オプティカルフローと視覚特徴融合を通じて自己関連の動的要素を組み込んだ動作認識表現を探求する。実験結果は、エージェントの動作をモデル化することで、空間認知のみならず自己認識においても知覚と記憶の性能が一貫して向上し、下流のUAV意思決定タスクへと一般化されることを示す。 本研究の結果は、身体化空間知能の進展における自己認識の重要性を強調するとともに、動作認識型「空間内の自己」モデリングのための新たなベンチマークと実証的証拠を提供するものである。
インタラクティブシミュレーターは、具現化エージェントの訓練や合成視覚データの生成のための強力なツールとなっているが、既存のフォトリアリスティックシミュレーターは汎用性、プログラマビリティ、レンダリング速度に制限がある。我々はこれらの制限に対処するため、SPEAR(フォトリアリスティックな具現化AI研究のためのシミュレーター)を導入する。その核として、SPEARはモジュラープラグインアーキテクチャを介して任意のUnreal Engine(UE)アプリケーションに接続し、プログラムで制御できるPythonライブラリである。SPEARは14,000以上の独自のUE関数をPythonに公開しており、既存のUEベースのシミュレーターと比較してプログラマブルな機能が一桁増加している。さらに、単一のSPEARインスタンスは、1920x1080のフォトリアリスティックな美観画像をユーザーのNumPy配列に直接、毎秒73フレームでレンダリングできる。これは既存のUEプラグインよりも一桁高速である。同時に、既存のUEベースのシミュレーターでは利用できないグラウンドトゥルース画像モダリティ(例えば、非拡散性の内在画像分解、マテリアルID、物理ベースのシェーディングパラメータ)も提供する。最後に、SPEARは表現力豊かな高水準プログラミングモデルを導入しており、ユーザーが作業項目間の任意のデータ依存関係を持つ複雑なUE作業のグラフを指定し、これらのグラフを単一のUEフレーム内で決定論的に実行できるようにする。我々は、SPEARの有用性を多様な応用例を通じて示す:複数の異なる行動空間を持つ具現化エージェント(人間、車、ロボットなど)を複数の実環境UEプロジェクト全体で制御すること、フォトリアリスティックな都市規模の環境をレンダリングすること、UEのプロシージャルコンテンツ生成システムを操作すること、詳細な人間の顔の同期マルチビュー画像をレンダリングすること、MuJoCo物理シミュレーターとのインタラクティブな共同シミュレーションを調整すること、そしてAIコーディングアシスタントを介した自然言語によるシーン編集である。
我々はAffectFlow-DINOを提案する。これは第11回ABAWチャレンジ向けのマルチタスク学習システムであり、標準的な決定論的アーキテクチャに条件付き整流流ヘッドを拡張することで、実環境における顔行動の本質的な曖昧性をモデル化する。単一の感情推定値を予測する代わりに、条件付き生成分布を学習し、モンテカルロサンプリングによる不確実性を考慮したOne-to-Many予測を可能にする。本システムは、静的な顔画像から連続的なバレンス・アラウザルを推定し、8種類の表情を分類し、12種類のアクションユニットを検出する。凍結したDINOv3 ViT-S/16バックボーンを基盤とし、広範なアブレーション研究により、整流流デコードが決定論的予測を一貫して改善し、特にバレンス・アラウザル推定(CCC-V +0.058)で顕著であることを示す。さらに、事後的な閾値調整により、再学習なしで深刻な不均衡な稀なクラス(例:恐怖:3.8%→33.1%)の性能を効果的に回復できることを示す。バックボーンの微調整とフローの再調整を組み合わせた最終モデルは、P_{MTL}=1.177を達成し、公式チャレンジベースラインのP_{MTL}=0.45を大幅に上回る。
豊かな静的セマンティクスを持つ言語(例えばRust)は、AI生成コードに対してより強力な保証を提供するが、その厳密さゆえに生成はより困難になる。既存のコンパイラは生成後の有用なフィードバックを提供できるが、自己回帰型LLMデコーディングの途中段階など、生成の中間ステップを導くことはできない。制約付きデコーディングは、サンプリング中に無効なトークンを拒否することでより早い段階で介入するが、ホワイトボックスモデルへのアクセスと、意味的制約に対するコストのかかる再実装を必要とする。我々は、生成コンパイル(generative compilation)を導入する。これは、生成中に部分プログラムに対してコンパイラフィードバックを得る初めてのアプローチである。中核となる技術はシーラー(sealor)である。これは軽量で、主に構文に基づく変換であり、部分プログラムを標準的なコンパイラが診断可能な完全なプログラムに変換する。これは、完了可能な部分プログラムが決して拒否されず、かつ、早期に真の行き詰まりを検出するために十分なコードコンテキストを保持するように設計されている。我々は、Rustに類似したコア計算体系上にそのようなシーラーを構築し、それがこれらの特性を満たすことをLeanで形式化・証明する。さらに、現実のRust向け初の部分プログラムチェッカーへと拡張する。我々は、最先端のブラックボックスモデルとオープンウェイトモデルの両方を用いて、挑戦的なリポジトリレベルのRustコーディングタスクで本手法を評価する。生成コンパイルが、標準的な生成後フィードバックと比較して、非コンパイル出力を減少させ、機能的正当性を向上させることを示す。これは、エラーの発生源に近い場所で、かつ生成の早い段階で広範囲のエラーを検出することで、エラーの連鎖を減らし、焦点を絞った診断を可能にする。より広く言えば、生成コンパイルは、コンパイラを、生成後の別個のチェックではなく、生成中に能動的に関与するAI支援プログラミングの第一級市民とするための一歩である。