翻訳付きの日次キュレーションされたAI研究論文
スキルは、構造化された知識パッケージを通じて推論時にLLMエージェントを強化する実用的かつ効果的なアプローチとして登場してきた。しかし、既存の評価は主にスキルがタスク全体の成功率を向上させるかを測定しており、より根本的な問いは未解明のままである:**スキルはいつ役立つのか、なぜ機能するのか、どこで失敗するのか?** 多様なベンチマーク、エージェントハーネス、LLMにわたる制御実験を通じて、我々はスキルの表現、成果アノテーション、検索の難易度、フレームワーク間ロバスト性の影響を分離する。この問いにさらに答えるため、制御された定量的実験とペア軌跡分析を組み合わせた対照研究を設計する。制御実験の8,135件の試行記録を正規化し、240件のオープンコード化記録から238件の有効な一意ラベルを保持する。これらの観察を、3つの高位カテゴリーと12のスキル使用モードからなる分類法に統合する。スキルは、ノイズの多い軌跡が実行を安定化させる手続き的アンカーとなるときに有効である。スキルはマッチング比較においてワークフローメモリを6.06ポイント上回る。手続き的アンカリングはスキル事例の65.7%を占め、明示的知識注入の4.5%と対照的であり、スキルが欠落した事実を注入するのではなく行動を安定化させることを示している。検索は独立したボトルネックである:プールが5から100に拡大すると、実使用精度は29.6%から3.3%に低下する。紛らわしいディストラクタはオフライン識別を損なうが、下流の成功率は安定したままである。正確な正解呼び出しは十分条件でも必要条件でもない。スキルは、脆い前提、非互換な文脈、または不十分な適応のもとで失敗する。これらの発見は、評価を総合的な成功率の域を超えて拡張し、信頼性の高い自己進化エージェントを導くものである。
強化学習(RL)は、シングルターンのLLMファインチューニングにおいて有望である。しかし、長期的なエージェント推論は、ますます分岐する相互作用と疎な報酬をもたらし、RLのいくつかの限界を浮き彫りにする。すなわち、RLの重量級のバックプロパゲーションに基づくトレーニングスタックは、より大規模なLLMのファインチューニングを非現実的なものにし、さらに長いホライズンの軌道はRLにおける信用割当を大幅に困難にする。本稿は、進化戦略(ES)が長期的なLLMエージェントのファインチューニングにおいてより良い選択肢となり得ると主張する。エージェントRLと比較して、ESは次の3つの重要な利点を提供する。1) モデルスケーラビリティ:ESは、最小限の推論レベルのGPUメモリのみで全パラメータ最適化を可能にし、大規模LLMのファインチューニングを実現する。2) 柔軟性:ESの軽量でブラックボックスなフィードバックインターフェースにより、ESファインチューニングはプロンプト空間の進化(例:スキル最適化やテスト時計算)と容易に組み合わせることができる。3) 長期的スケーラビリティ:ESは報酬をホライズン間で分解することなく軌道レベルのパラメータ帰属を行うため、ホライズン長が増大するにつれてエージェントRLよりも優れたスケーラビリティを発揮する。この洞察に基づき、我々は柔軟なパラメータ・コンテキスト共進化に特化した全パラメータのエージェントファインチューニングフレームワークであるAgentic ESOptを提案する。各ステップで、Agentic ESOptは現在のLLMパラメータの周囲に摂動をサンプリングし、得られたエージェントを報酬で評価し、オンラインの報酬重み付け更新を適用する。探索と適応のトレードオフを改善するため、Agentic ESOptはさらに摂動スケールσのコサイン減衰スケジュールを導入する。WebArena-Lite上で、Qwen-3.5-27Bの全パラメータ最適化はNo Skillベースラインを6.69%改善する。テスト時自動ヒューリスティック設計において、Agentic ESOptはオンラインのプロンプト・パラメータ共進化を実行し、36設定中28設定で対応するベースラインを改善する。
フロンティア級のオープンウェイトモデルはますます入手可能になりつつあるが、その推論実行は依然として大規模にデータセンターインフラを前提としている。本稿では、個人用マシンを単なる小型GPUではなく、統合的で弾力的な推論プラットフォームとして扱う、エッジネイティブなMoE推論システムFreeTokenを提案する。FreeTokenは、モデルの配置とロード、エキスパートの常駐、CPU-GPU実行、エージェント状態の再利用、ランタイムメモリ管理を含む推論スタック全体を、ローカルAIの2つの現実に基づいて共設計している。すなわち、エージェントワークロードは実行パターンを継続的に変化させること、そしてエッジハードウェアはマシンごとにバランスの異なるヘテロジニアスなリソースを備えていることである。固定されたオフロード戦略に依存するのではなく、FreeTokenは計算とモデル状態を実際に利用可能なリソースへと継続的にマッピングする。FreeTokenは、8GBのノートPC向けGPUから単一のワークステーション向けGPUに至るまでのハードウェア上で、20以上のMoEモデルと、実際のコーディングおよびツール使用エージェントをサポートしている。さらに重要なことに、FreeTokenはこれらのマシンが実際に提供可能なモデルを変革する。ノートPCでの35Bモデルから、ゲーミングデスクトップでの284Bモデル、単一のワークステーションGPUでの753BのGLM-5.2までを可能にするのである。FreeTokenはオープンウェイトを展開可能なローカルソフトウェアへと変換し、ユーザーがすでに所有しているマシンをフロンティア規模の知能のための実用的なプラットフォームとする。本システムはflashml.aiにて公開している。
人工超知能(ASI)には、AIが既存知識の習得を超え、未知を探求し、新たな知識を創出し、新しいアイデアを検証可能な成果へと変えていくことが求められる。しかし、今日のAIシステムの能力は依然として、既存の人間知識を学習・圧縮・適用することに大きく基づいている。したがって、既存のベンチマークは主に、AIが学習した知識に基づいて正しい回答を生成できるか、あるいは人間による広範なガイダンスの下でタスクを完了できるかを検証するものにとどまる。そこで我々は、ASI-Benchを導入する。これは、広範な研究領域におけるAIシステムの革新的探索能力と自律的科学的実行能力を同時に評価する初めてのベンチマークであり、同一研究プロジェクト内で人間の方法論的ガイダンスを段階的に撤廃し、AIがどこまで独力で進めるかを検証する初めてのベンチマークでもある。ASI-Benchは、40名以上の専門家によって31,000時間以上に及ぶ人的コストをかけて構築され、11の科学分野にわたる60のプロジェクトレベル研究タスクを含み、方法論的ガイダンスを段階的に削減することで、AIが方法を選択し、研究を実施し、検証可能な成果を生み出すことを独立して行えるかを検証する。すべてのタスクは、専門家によるレビュー、AI支援による監査、サンドボックス実行、スコアラーによる検証を経る。18の最先端エージェント・モデル構成全体で、平均スコアは、完全な方法論的ガイダンスが与えられた場合の50.91から、方法のみが指定された場合の29.10、エージェントが自ら方法を決定しなければならない場合の26.62へと低下する。この急激な低下は、現在のシステムが依然として人間のガイダンスに大きく依存しており、エンドツーエンドのプロジェクトレベル科学研究を自律的に実施するにはほど遠いことを示している。ASI-Benchは世界に公開されている。私たちは、世界中の研究者と開発者に対し、新たなタスクの提供、今日のAIの限界への挑戦、そして人工超知能へ向けた人類全体の歩みを加速させることへの協力を呼びかける。https://asibench.apexin.ai/submit
大規模視覚言語モデル(VLM)は身体化ナビゲーションを大幅に進歩させてきたが、既存手法はしばしばVLMをその2D事前学習の事前分布と整合しない不自然な行動空間に強制し、さらに固定的な推論スケジュールと非効率的なメモリ管理が重なるため、直接的な展開は依然として困難である。これらの制限を克服するために、我々は効率的な身体化ナビゲーションのための統一フレームワークTAMP-Navを提案する。まず、ナビゲーションを2D視覚プロンプティングとして再定式化するPixel-to-3D Action Formulation(Point)を導入する。具体的には、VLMは2D画素を選択するだけでよく、その画素は低レベルSLAMコントローラ用の3D座標に投影される。この設計により、身体化された実行とVLMが本来持つ2D視覚能力とを自然に整合させることができる。次に、統合型の選択的推論とアンカー軌跡メモリ機構(Think and Memorize)を提案する。これはChain-of-Thoughtを動的にトリガーし、重要ノードにおいてのみ高忠実度メモリを保持する。冗長な軌跡は軽量な時空間指標(Space-Time Indicators)に圧縮され、重要な履歴情報を保持して時空間知覚を向上させる。最後に、Group Relative Policy Optimization(GRPO)による効率的な二段階整合パラダイム(Align)を設計する。大域的な結果報酬ときめ細かい過程報酬を重ね合わせることで、この高密度な監視はエージェントの認知計画と物理的な環境フィードバックとを密接に整合させ、モデルに適応的推論能力を付与する。実験により、TAMP-Navは最先端の性能(例えばR2R-CEで成功率66.2%)を達成し、高い実行時効率とサンプル効率(わずか90kの訓練軌跡のみを必要とする)を示す。
クリエイティブエージェントは、高品質な人間の映画から学習する効果的な手段を依然として欠いており、映画品質の映像を生成する能力が制限されている。重要な課題は、映画の内容に忠実でありながら、エージェントの推論と操作に直接利用可能な、構造化された映像表現が存在しないことである。この課題に対処するため、我々はエージェント的オートエンコーディング(Agentic Auto-Encoding)を通じてエージェント原生の映像表現を学習するフレームワークであるAgentic Video Auto-Encoder(AVA-Encoder)を提案する。 AVA-Encoderは、映像を知識グラフ(KG)表現に変換し、それを再び映像に再構成する。その階層構造と状態ノードは構造化テキストを格納し、リンクされたアセット層は生成された画像、音声、映像を保持する。型付きエッジは、これらのテキスト記述とアセット間の関係を、エージェントが容易に理解、検索、編集できる形式で保存する。映像再構成の差分はテキスト勾配最適化フレームワークを駆動し、評価フィードバックを自然言語による更新方向として表現することで、外側ループにおけるデータ非依存エンコーディングポリシー疑似訓練(Data-Independent Encoding Policy Pseudo-Training)と、テスト時内側ループにおける任意のデータ依存型KG表現洗練(Data-Dependent KG Representation Refinement)を実現する。 大規模な実験により、AVA-Encoderは最強の外部ベースラインを20.7パーセントポイント上回る改善を示す。制御されたポリシーのみの設定では、その疑似訓練されたショットレベルのAgentic Video Encoderポリシーは、慎重に人手で調整されたポリシーをも上回りながら、システムプロンプトのトークンを74.3%削減する。我々は、完全なAVA-Encoderフレームワーク、信頼性の高いエージェント的映像再構成ベンチマーク、および高品質な映画KG表現の最初のデータセットを公開する。
高解像度画像編集はプロフェッショナルなワークフローにおいてますます求められているが、既存の拡散ベースモデルは、注意機構の計算量が二次関数的に増加し、メモリ要件が極めて高いため、1K未満の解像度に制約されたままである。一般的な回避策は、低解像度での編集とそれに続く独立した超解像からなる2段階パイプラインを用いるものである。しかしこのアプローチには、2つの重大な問題がある。1つは、幻覚的な詳細が元の高解像度(HR)ソースと矛盾する情報の乖離であり、もう1つは、過度に平滑化または過度にシャープ化されたアーティファクトとして現れるテクスチャ劣化である。我々は、効率的な超高解像度編集のための拡散ブリッジフレームワークであるEditBridgeを提案する。ノイズから再生成する従来の拡散法とは異なり、我々はリファインメントを、低解像度(LR)編集結果から対応するHRへの構造化されたデータ間変換として定式化し、本来の詳細を保持するために元のHRソースを明示的に条件として付与する。HRソースのガイダンスを効率的に組み込むために、我々は事前知識誘導型のブロック単位スパース注意機構を導入する。これは、第1段階の編集からの意味的対応関係を利用して、画像間の相互作用を空間的に整合した領域に制約し、計算オーバーヘッドを大幅に削減する。広範な実験により、EditBridgeは最大4Kの解像度で、優れた知覚品質を備えた忠実度の高い編集を達成し、2Kでは3.6~8.4倍の高速化を実現し、4K編集を61秒で実用可能にすることが示された。
現代のエージェントは、ツール、コンテキスト、制御フローを管理するエージェントハーネス内で動作し、ハーネスはエージェントシステムの重要な構成要素となっている。我々が当初開発したAgent Lightningは、LLMエンドポイントプロキシを通じて任意のエージェントをRLトレーニングに接続する分離型アーキテクチャを導入した。このアプローチは、後にverl、Uni-Agent、AReaL 2.0、slime、Polarなどのフレームワークでも採用された。我々はこのパラダイムをハーネス型エージェントRLと呼ぶ。これは、デプロイ時のハーネスがモデルのポストトレーニングに直接関与するものである。 ハーネス型エージェントRLは、従来のエージェントRLとは根本的に異なる。環境との相互作用ループを所有するのはトレーニングエンジンではなくハーネスであり、トレーナーはLLMのリクエスト・レスポンスペアのシーケンスのみを観測する。これにより、再トークン化、サンプルのマージ、アドバンテージ計算、損失の正規化、バックエンドスケジューリングにおいて課題が生じ、これらはトレーニングの安定性と有効性に大きな影響を与える可能性がある。 我々は、約3,500行のコードで実装されたハーネス型エージェントRLのための軽量フレームワークであるAgent Lightning v1.0を提案する。これは任意のエージェントハーネスをサポートし、これらの課題を研究するための実用的なテストベッドとして機能する。 我々は、指示追従、検索、コーディングエージェントにおいてこれを評価し、コーディングエージェントRLのための完全かつ再現可能なパイプラインを提供する。わずか6Kのトレーニング例と控えめな計算資源を用いて、RLはQwen3.5-9BをSWE-bench Verifiedにおいて41.8%から56.4%へ改善し、14.6ポイントの絶対的な向上をもたらした。 我々は、ハーネス型エージェントRLに関する再現可能な研究を促進するために、完全なワークフローとトレーニングスクリプトを公開する。
潜在ビデオ生成は、生成モデルが動作するコンパクトな空間を定義するために、オートエンコーダに依存している。ビデオオートエンコーダのアーキテクチャは大幅に進化してきたが、その潜在空間は今なお主にピクセルレベルの再構成に対して最適化されており、高レベルの意味的組織化は限られている。しかしながら、再構成に最適な潜在空間が生成モデリングに適しているとは限らない。我々は、凍結された視覚基盤モデルの表現の上にコンパクトな生成的潜在変数を構築するビデオ表現オートエンコーダであるV-RAEを提案する。軽量な時間的プーリングモジュールが意味的構造を保持しつつ時間的冗長性を除去し、ビデオデコーダが圧縮特徴から連続的な動きを再構成する。我々は、ビデオ再構成、意味的プロービング、クラス条件付き生成において、4つの代表的な凍結エンコーダを用いてV-RAEを評価する。V-RAEはK600において2.13のrFVDを達成し、評価したすべての大規模事前学習済みビデオVAEを上回る。その潜在変数は、従来のビデオトークナイザの潜在変数よりもかなり多くの意味的情報を保持している。一致した生成設定の下で、我々の最良の変種はUCF101およびK600においてそれぞれ117.86および19.16のgFVDスコアを達成し、最大6倍高速に収束する。さらに我々は、再構成品質だけでは生成的実用性を特徴付けるには不十分であることを示し、下流の生成品質とより確実に相関する時間的コヒーレンス診断指標であるtFVDを導入する。ビデオ生成に加えて、V-RAEは、一致した予測設定の下で、Wan 2.2 VAE潜在空間を用いるCityscapes上の将来ビデオ予測も改善する。総合すると、実験は凍結された意味的表現がビデオ再構成、生成、および予測モデリングを支えることができることを示している。プロジェクトページ: https://v-rae.github.io/。
テキストから画像を生成する生成モデルの進歩に伴い、特に暴力やヌードなどのNSFW(職場不適切)コンテンツの生成という重大な安全性の懸念が生じており、これはレッドチーミングによる敵対的攻撃によってさらに悪化する。既存の防御手法は主にホワイトボックス仮定の下で動作し、テキストエンコーダの最適化、重みの編集、推論時介入に依存しているため、根本的にプロプライエタリモデルには適用できない。LLMによるプロンプト書き換えに基づくブラックボックス代替手法はより広い適用可能性を提供するが、我々が良性敵対問題として特定する重要な領域、すなわち言語的には安全であるものの、モデルが学習したデータ分布のために有害な生成を引き起こすプロンプトにおいては失敗する。我々はDiSCOを提案する。DiSCOはプラグアンドプレイモジュールとしてプロンプトレベルでのみ動作し、モデルの再訓練、ファインチューニング、モデル内部へのアクセスを一切必要としない、ゼロショットかつ厳密にブラックボックスな防御手法である。DiSCOは、ビームサーチによる分布に基づくサフィックス拡張を実行し、対象モデル自身が生成した安全・不安全画像プールに対する対比的スコアリングによって最適化され、安全なコンテンツが生成されるまで反復適応フィードバックを行う。我々は、DiSCOがI2Pベンチマークにおいて、複数のレッドチーミング攻撃下で、未防御および防御済みの両モデルの安全性を一貫して向上させ、意味的忠実性を維持しつつ画像の整合性を改善しながら、それぞれ37.7%および25.13%のASR(攻撃成功率)低減を達成することを実証する。ブラックボックスかつアーキテクチャ非依存のモジュールとして、DiSCOはモデル自体への変更を一切必要とせず、任意のテキストから画像を生成するシステムに容易に適用できる。
バイトレベルの階層的言語モデル(LM)は、近年、サブワードトークン化を用いる一般的なモデルに代わる堅牢な選択肢として登場した。しかし、1バイトずつ生成することは、依然として推論速度のボトルネックとなっている。この問題に対処するため、我々はマルチバイト予測(MBP)を導入する。これは複数のバイトを並列に生成することで、追加パラメータなしに、性能への影響を最小限に抑えつつ推論を高速化する。MBPは、広く用いられているマルチトークン予測(MTP)パラダイムに基づきつつ、2つの重要な革新を備えている。第一に、階層的LMの潜在トークン、すなわちセグメントに整合する可変長の予測ウィンドウを導入する。第二に、因果性を損なわずに並列バイト予測を可能にする新しいアテンションマスキング方式を実装する。我々は、マルチバイト予測が、指示追従、質問応答、要約、機械翻訳といった複数の生成タスクにわたってパレート最適なトレードオフを達成し、性能と推論スループットの間の最良のトレードオフを実現することを示す。
指示ベースのビデオ編集データセットの品質と多様性は着実に向上しているが、既存のデータセットは主に単一の編集操作に焦点を当てており、構成的指示誘導ビデオ編集をサポートするには不十分である。特に、複数の編集意図を同じビデオ内で同時に理解し、忠実に実行する必要がある。この問題に対処するため、我々は構成的指示誘導ビデオ編集のための大規模かつ高品質なデータセットであるCoinVE-200Kを導入する。CoinVE-200Kには、最大201フレームの1080pビデオ編集ペアが含まれており、各サンプルが2〜5個の原子的編集操作を含む多様な構成的シナリオを網羅している。指示は人間、物体、背景を対象とし、追加、削除、修正、スタイライゼーションなどの編集タイプをカバーしている。すべてのサンプルは、指示忠実性、視覚的品質、時間的一貫性、構成的多様性を保証するために、慎重に設計された生成・フィルタリングパイプラインを通じて構築されている。また、多様な対象、操作タイプ、指示の複雑さにわたる構成的指示ビデオ編集のためのベンチマークであるCoinVE-Benchも導入する。さらに、Wan2.1-T2V-14BとQwen3-VL-8B-Instructに基づいて構築された22Bの構成的ビデオ編集モデルであるCoinVE-Editを提示する。CoinVE-Editは、異なる編集指示に対して領域認識アテンションを分離し、無関係なコンテンツと時間的整合性を保ちながら、正確な複数領域編集を可能にする。CoinVE-Benchでの実験は、CoinVE-Editが指示追従、構成的編集精度、視覚的品質、時間的一貫性において高い性能を達成することを示している。
ビジョンエンコーダは視覚言語モデルにとって重要な構成要素であり、その容量を効果的にスケーリングすることで性能が向上する。しかし、Denseモデルのスケーリングは計算コストと推論レイテンシを増大させる。Mixture-of-Experts(MoE)アーキテクチャは、LLMにおいて効率的なスケーリングを可能にしてきた有力な代替手段であるが、CLIPスタイルのビジョンエンコーダにおけるMoEの設計空間は、最先端(SOTA)レベルでは未だ十分に探索されていない。本研究では、ビジョンエンコーダのスケーリングのためのMoE設計を体系的に調査し、細粒度のMoEトポロジーが、Denseモデルおよび標準MoEモデルの両方と比較して大きな利得をもたらすことを見出した。さらに、エキスパートの利用率を向上させるために補助損失を用いないバランシング変種を提案し、推論レイテンシのオーバーヘッドを軽減する専用MoEカーネルを設計する。画像知識を保持しつつ映像能力を向上させるために、新しい凍結メカニズムと組み合わせたフレームレベルの蒸留を導入する。我々は、一連のMixture-of-Experts Vision Encoders(MoE-ViE)を様々なサイズで事前学習し、そのすべてが対応するDenseモデルを一貫して上回った。最大モデルは、その1.7倍のサイズを持つSOTAエンコーダのゼロショット性能を、そのエンコーダの76%のレイテンシで達成する。LLMと組み合わせた場合、MoE-ViEは、最大で5倍多くの活性化パラメータを持つものを含む、比較したすべてのエンコーダを画像およびビデオベンチマークで上回る。コードはhttps://github.com/facebookresearch/moe_vieで公開している。
メモリは、長期的なタスクを遂行するLLMエージェントの中核インフラストラクチャとなりつつある一方、既存の評価は、異なる動作環境下でどのメモリ基盤(すなわち、メモリが表現・保存される基盤媒体)を使用すべきかについて限定的な指針しか提供していない。本稿では、メモリ拡張エージェントを対象としたメモリ基盤の統制されたハーネス評価を提示する。対象は、密・疎インデックス、テキストレコード、構造化ストア、階層型ストア、洗練型メモリ、パラメトリック更新、活性化互換のコンテキスト機構である。3つのバックボーンモデルと、ユーザー中心の質問応答およびエージェント中心の意思決定を網羅する4つのベンチマークスイートにわたり、統一ハーネスの下で26の性能・効率指標を計測した。実験結果は、単一の基盤が一貫して優位であるわけではないことを示している。すなわち、広範な検索は長文脈の事実的QAに有効である一方、過度な検索は行動に重要な文脈から注意をそらすことで逐次意思決定を損なう可能性がある。さらに、スケーラビリティは新たなルーティング軸をもたらす。中程度の履歴長で良好な性能を示す基盤であっても、より長い期間ではコストが増大したり脆弱になったりするためである。これらの知見は、基盤ルーティングが適応的エージェントメモリシステムの必須構成要素であることを動機づけ、LLMエージェント向けに効率的で信頼性が高く、動作環境を考慮した長期メモリを設計するための実証的指針を提供する。コードは採録後に公開予定である。
大規模画像生成は、データ規模、品質、再バランス、再キャプション付けの進歩から恩恵を受けているが、従来のパイプラインは通常、タスク固有のデータセットを個別に最適化している。中心的な課題は、各タスク固有のコーパスをどのようにキュレートするかだけでなく、生成能力間の依存関係に従って異種の教師信号をどのように整理するかである。我々は、能力固有の教師信号構築と能力に整合したカリキュラムスケジューリングを結合する、能力駆動型データ基盤を提示する。その3つの専門化されつつ相互運用可能なデータエンジンは、テキスト-画像対応付け、画像間変換、画像-知識関連付けのための相補的な関係性教師信号を構築し、キャプション専門家はT2Iと編集の教師信号をタスクと粒度を横断して整合させる。多段階カリキュラムは、能力獲得の依存順序に沿って、タスク構成、視覚概念分布、データ品質、画像解像度を共進化させ、能力を考慮した評価は、ターゲットを絞った検索、エキスパート構築、ギャップを考慮したリサンプリングを通じてループを閉じる。大規模には、このフレームワークは4億4000万画像のT2Iコーパス、1億2000万の編集ペア、2700万以上の画像-エンティティペアをキュレートする。この基盤により、我々はマルチモーダル拡散モデルを2つのスケール(それぞれ30億および60億パラメータ)でスクラッチから訓練する。我々はCPI-Benchでの定量的評価と、多様なテキストから画像への変換および編集シナリオにわたる定性的評価を実施する。実験結果は、広範な視覚カバレッジ、多様なレンダリング、生成能力間の効果的な転移を示している。
大規模言語モデル(LLM)とエージェントの最近の進歩により、AIシステムが複雑なタスクを実行する能力は大幅に向上した。しかし、既存のベンチマークは主に研究者が選定したタスクに依存しており、そのような進歩が実際に実世界のユーザーがAIシステムに求める作業にまで及ぶかどうかは不確かなままである。我々は、市場で検証されたAIスタートアップ製品に基づくE2EエージェントベンチマークであるStartupBenchを紹介する。有用なエージェント能力に関する事前定義された仮定からタスクを定義するのではなく、導入実績が実証されたAI製品を、その製品ワークフローおよびユーザーと共に体系的に調査し、多様な専門分野にわたってAIが実用的な需要を確立している実世界のタスクを特定する。我々はこれらのワークフローを完全な成果物指向タスクに変換し、その複雑な要件を捉える詳細なルーブリックを用いて評価する。統一されたエージェントハーネスの下で評価された代表的なモデル群において、最強のモデルでさえ、多くのタスクでかなりの部分的な進捗を示すものの、StartupBenchの約30%しか正常に完了しない。さらなる分析により、複雑な指示への追従やドメイン固有の専門知識などの側面が主な失敗原因であることが明らかになる。我々の結果は、市場で検証された多くのワークフローが現在の汎用エージェントの信頼できる能力の範囲外にあることを示し、StartupBenchを実世界のユーザータスクのE2E完了に向けた進歩の実証的尺度として確立する。
ピクセル空間の生成モデルは、非可逆潜在圧縮を回避する一方で、高次元空間における大域的な構造と微細なディテールの同時学習を必要とする。標準的なフローマッチングは、ノイズを固定されたクリーン画像エンドポイントへ補間し、スペクトル進化を暗黙的に学習させる。本論文では、移動エンドポイントを用いて粗いものから細かいものへの生成軌跡を明示的にモデル化する、エネルギー誘導フローマッチング(EG-FM)を提案する。具体的には、EG-FMは固定エンドポイントを、低周波画像からクリーン画像へ滑らかに遷移する熱核フィルタリング済みエンドポイントに置き換える。移動エンドポイントに含まれる高周波信号の割合は、画像固有のエネルギー誘導スケジューリングによって解放され、フローマッチングにおける速度場の再ターゲティングをもたらす。本フレームワークは、バックボーンと学習データの変更を必要とせず、学習時と推論時にかかるコストは無視できるほど小さい。実験では、EG-FMは256×256のImageNetクラス条件付き画像生成タスクにおいて、より少ないエポックで一貫して低いFIDを達成し、200エポックでFID 1.55、600エポックでFID 1.45を達成した。さらに、512×512解像度の設定で生成タスクの学習を継続し、わずか40エポックの高解像度適応後にFID 1.58を達成した。加えて、EG-FMをテキストから画像への生成に適用し、GenEvalスコア0.85、DPG-Bench 83.9を達成した。コードは https://github.com/ysng123/EG-FM で公開している。
計算最適スケーリング則は最先端の言語モデルの訓練を導く一方、視覚生成においてはほぼ未解明のままである。我々は、制御されたフローマッチングトランスフォーマーのファミリーであるAbraを用いて、テキストから画像を生成する拡散モデルに対する系統的なスケーリング則研究を提示する。Abraは3桁にわたる計算量(10^19〜10^22 FLOPs)で訓練され、従来研究を大幅に上回る計算予算に達している。我々は、拡散モデルが言語モデルと同様に予測可能にスケールする一方、最適な訓練にははるかに多くのデータを必要とすることを実証する。すなわち、計算最適性はパラメータ当たり約200画像トークンで達成され、これはLLMに対するChinchillaの計算最適処方の10倍に相当する。さらに、言語モデルとは異なり、拡散モデルは過学習に対して頑健であり、実務者はより大きなモデルではなくより多くのデータを選ぶべきであることを示す。最後に、この予測可能性は訓練損失だけでなく、生成品質指標、最適なCFG設定、表現品質、さらには訓練曲線の形状にも及ぶことを示す。訓練曲線は普遍的な形に収束する。
大语言模型正日益通过管理工具、扩展、持久状态、权限和外部操作的代理框架进行部署。现有的安全基准主要针对个别攻击机制或有限的操作环境子集,这使得难以比较不同框架职责下安全故障的出现方式。我们提出了HarnessRisk,一个面向生命周期的基准,将代理框架安全组织为六个操作阶段,包括框架配置、能力扩展、运行时操作、状态持久化、动作控制和事件恢复。HarnessRisk包含128个沙箱案例,每个案例将一个良性用户目标与嵌入在不可信工作流工件中的对抗性指令配对。我们使用效用、攻击成功率、持久性和检测来评估每个轨迹。在三个框架、六个语言模型和14种模型与框架配置中,攻击成功率从12.6%到80.9%不等,而效用保持在75.0%到97.6%之间。框架配置是所有三个框架中最脆弱的阶段,表明攻击可以通过在原本被授权的工作流中改变安全敏感参数来成功。我们还发现,明确的风险识别并不能可靠地导致安全行动,因为某些配置在超过90%的运行中检测到风险,同时仍保持相当高的攻击成功率。这些结果突显了需要在多个框架职责层面以及已部署模型和框架配置的层面上评估代理安全性的必要性。
信頼性の高い不確実性定量化(UQ)は、複雑な対話環境に大規模言語モデル(LLM)エージェントを展開するために不可欠である。既存のUQ手法は主にトークン確率、予測エントロピー、各ステップの信頼度などの局所的なシグナルに依存しており、したがって実行軌跡にわたって誤差が蓄積する長期的依存関係を見落としている。その結果、最終回答の数推論ステップまたは対話ステップ前に原因が発生するエージェントの失敗を特定できない可能性がある。我々は、LLMエージェントのための軌跡レベルUQフレームワークであるRUPA(Relational Uncertainty Propagation for Agents、エージェントのための関係的不確実性伝播)を提案する。RUPAは実行履歴を有向軌跡グラフとして表現し、その中で推論状態、ツール相互作用、環境フィードバックが時間的および意味的依存エッジによって接続されたノードとなる。次に、このグラフ上で不確実性を伝播させ、実行リスクが対話ステップ間でどのように蓄積・転移するかを捉える。伝播されたシグナルは、軌跡レベルの行動特徴および目標整合性情報と組み合わせて、エージェントの全軌跡に対する信頼度推定を生成する。我々は、τ-2、Terminal-Bench-2、GAIAを含む代表的なエージェントベンチマークにおいて、複数のモデルファミリーにわたる6つのオープンソースLLMを用いてRUPAを評価する。実験結果は、RUPAがより正確な不確実性推定を提供し、より早期の失敗検出を可能にし、多様なエージェントタスクにおける不確実性誘導型エージェント実行を改善することにより、既存のUQ手法を一貫して上回ることを示している。これらの結果は、長期的なLLMエージェントの信頼性の高いUQには関係的依存関係を明示的にモデル化することが不可欠であり、信頼できるエージェント実行のための実践的基盤を提供することを実証している。
自動形式化は、自然言語の数学的記述をLean 4のような機械検証可能な形式言語へ翻訳することとして一般に捉えられている。しかし、忠実な形式化には翻訳以上のものが求められる。モデルは、生成された文が元の命題の意味を保持することを保証しつつ、数学的概念をMathlibのような形式ライブラリ内の複雑な型と定義の階層に対応付けなければならない。既存のアプローチは、ライブラリ固有の知識をモデルのパラメトリック記憶に大きく依存しているため困難に直面しており、また一般的なデータ構築パイプラインは単一パス出力のフィルタリングに頼ることが多く、フィードバック駆動の修正メカニズムを欠いている。これらの課題に対処するため、我々はMathlib知識検索と検証誘導型の反復的改良を通じて検証済みトレーニングデータを構築する自動形式化フレームワークMathFormを導入する。生成前に、検索プランナーがMathlibから関連する定義と既存の形式化を収集し、形式化生成器を誘導する。生成された文は、その後、コンパイラ診断と意味的整合性フィードバックを用いて修正される。このフレームワークを用いて、多様な数学分野と出典にわたる約367,000件の検証済み例を含むLean 4データセットFormalVerseを構築した。次に、教師ありファインチューニングに続いて強化学習を行うことでMathForm-8Bを訓練した。6つのベンチマークにわたり、MathForm-8Bは構文チェック(SC)で平均Pass@8率88.06%、整合性チェック(CC)で平均Pass@8率72.37%を達成し、複数の専用32B自動形式化システムを上回った。困難なFATE-HおよびFATE-Xサブセットでは、CC合格率63%および37%を達成し、いずれの場合も最強の専用ベースラインを上回った。
我々は、AI-Infra-Guard(A.I.G)を用いてテストを構築し、制御されたテイントを配信し、DSHを実行し、トレースを収集して結果を判定することで、DeepSeek Harness(DSH)における間接プロンプトインジェクションを評価する。本研究は、16の間接コンテンツチャネル、テキストおよびファイルのキャリアモード、35のペイロード目標、1つの未変更ベースライン、12の攻撃手法にわたる14,560回の制御された実行を対象とする。実験では、DSHのエージェントループ、ツールレジストリ、モデルアダプタ、およびセッションイベントパスを維持する。ソースツールと機密シンクはローカルフィクスチャであるため、試行されたアクションは外部への副作用なしに記録される。各トレースは、決定論的ルールベース判定器(RuleJudge)と意味的LLMベース判定器(LLMJudge)の両方で評価する。観測された最大の攻撃成功率は、テキストモードの偽完了攻撃では____の評価で17.0%、ファイルモードの隠しUnicodeでは____の評価で25.5%、ファイルモードのスキルチャネルでは____の評価で16.0%である。____はまた、____よりも部分的なコンプライアンスを多く割り当てる(7.3%対2.0%)。これらの結果を、DSHによるツール結果、追加コンテキスト、およびツール呼び出しポリシーフックの扱いと関連付け、信頼できないコンテンツと機密アクションの間に配置すべき制御策を特定する。我々のコードは https://github.com/Tencent/AI-Infra-Guard/tree/main/Research/deepseek-harness-security-assessment で入手できる。
大規模言語モデルにおける知識利用を改善する手法は、通常、2つの方式に大別される。ノンパラメトリック検索は、外部知識への柔軟なアクセスを提供するが、検索レイテンシやコンテキストのオーバーヘッドを追加し、バックボーンとの統合は浅いものにとどまる。パラメトリック適応は推論時には効率的であるが、知識をモデルの重みと絡み合わせるため、更新、監査、転送が困難になり得る。Engramスタイルのハッシュ化メモリは中間の方式に位置づけられる。すなわち、学習した情報を外部のアドレス指定可能なテーブルに格納しつつ、そのテーブルを小さな学習されたリーダーを通じて利用する。これにより、基本的な疑問が生じる。そのようなメモリをバックボーン間で移動する場合、凍結されたメモリ自体とターゲット側のリーダーのどちらがより重要か。我々はこの疑問を、クロスモデル凍結メモリ抽出を通じて研究した。この手法では、ソースモデルで学習されたメモリを凍結し、異なるターゲットモデルに接続する。その際、軽量なリーダーのみを学習する。アブレーションにより、学習されたメモリの内容と正しいアドレッシングの両方が重要であることが示されるが、転送されたテーブルは、ターゲットモデルに適合したリーダーを通じてのみ有用になる。下流の質問応答タスクにおいて、二層・四分岐のリーダーは、同一モデル再利用とクロスモデル再利用の間のギャップをほぼ埋め、我々の制御された評価プロトコルの下で平均スコア38.8を達成した。さらに、提供元のリーダーがターゲットのインターフェースと直接互換性がある場合、凍結されたアーティファクトはターゲット側の学習なしで実質的な有用性を提供でき、任意のリーダー適応によってさらなる改善が得られる。これらの結果は、ターゲットが互換性のあるリーダーインターフェースにアクセスできる場合、Engramが再利用可能な外部知識アーティファクトとして機能し得ること、そして直接のリーダー再利用が不十分な場合にはターゲット側の適応が整合性をさらに改善できることを示唆している。
仮説を生成し、関連研究を検索し、実験を設計し、コードを実行し、論文全体の草稿を作成するAI共同科学者は、研究の進め方を変え始めている。この急速な進歩にもかかわらず、最先端のシステムは研究者非依存的であり続けている。すなわち、研究目標が与えられると、その出力を利用する個々の科学者を無視したまま、新規性、妥当性、あるいは査読者スコアを最適化するのである。これは研究に関する根本的な事実を見落としている。すなわち、何が新規で、価値があり、実現可能であるとみなされるかは、研究者に依存しており、その研究者の先行研究、方法論的レパートリー、そしてその研究者が関わる共同研究者やコミュニティに左右されるのである。本研究では、研究プロセスの各段階を個々の研究者の表現に基づいて条件付ける、個人化自動研究の問題を導入する。我々は、個人化は利便性のための付加的な層ではなく、むしろAIシステムが汎用的な道具ではなく真の共同科学者として機能することを可能にする根本的な性質であると主張する。この問題に取り組むため、我々は、グラフに基づく研究者コンテキストを検索、仮説探索、実験、執筆、査読に織り込む、汎用的かつ柔軟な枠組みを提案する。この枠組みは、次の三つの基本構成要素から成る:(i) グラフに基づく研究者表現、(ii) 研究パイプライン全体にわたる個人化、(iii) 個人に基づく評価。特に、我々は、異なる研究者が同じ目標を与えられた場合に本質的に同じ研究を受け取り、新しいアイデアが生まれる暗黙知を消去してしまうという、画一的な失敗モードを強調する。最後に、根本的な未解決問題と課題について議論する。
多くのスケーラブルな潜在3D生成モデルは構造化テンソル上で動作するのに対し、事前最適化された3Dガウススプラッティング(3DGS)再構成は非順序的で空間的に不規則であり、プリミティブ数も大きく異なる。我々は、フィッティング不要の構造化潜在フレームワークであるGS-Voxelを提案し、大規模な航空3Dガウスシーン生成におけるその有効性を評価する。GS-Voxelは、互換性のある事前最適化3DGS再構成を、シーンごとの追加最適化なしで、選択されたプリミティブのサブボクセル位置とレンダリング属性を保持したまま、スパースなアクティブボクセルへ決定論的に変換する。次に、GS特化の因子分解VAEが、ボクセルジオメトリと局所的なガウス属性を別々にスパースな3D潜在表現へ符号化する。この潜在表現のサイズは、シーン全体の固定プリミティブ数に制限されるのではなく、占有ボクセル数とともに増大する。我々は、航空3DGSシーンを生成するために、GS-Voxel潜在空間において画像条件付きフローモデルを訓練する。GS-Voxelによって可能になる重要な応用は、大面積シーン生成である。すなわち、重複を考慮したタイル推論は、衛星視点画像を条件として、単一のトレーニングクロップを超えて合成を拡張する。我々の結果は、GS-Voxelが事前最適化された航空3DGS再構成に対して構造化潜在表現を提供し、その潜在容量が占有ボクセル数とともに増大することを示している。
コーディングエージェントのための強化学習は、ツール統合、リポジトリコンテキスト、実行フィードバックを管理する長時間実行型エージェントハーネスにますます依存している。しかし、これらのハーネスのネイティブ実行環境は方策勾配学習と本質的に不整合であり、環境クラッシュや報酬ハッキングは結果シグナルを汚染し、学習と推論の不一致はロールアウト挙動を方策更新から切り離す。この問題に対処するため、我々はLEGO-RLを提案する。LEGO-RLは、ネイティブコーディングエージェントハーネスとスケーラブルな方策勾配最適化を、内部の制御フローを変更することなく橋渡しするフレームワークである。LEGO-RLは3つの柱に基づく。(1) プロセス内LLMプロキシングによる忠実な最適化。これは、ハーネス側の圧縮や再シリアライゼーションの下でも、トークンレベルの整合と堅牢なトレーナー側の対数確率再計算のために、生の生成ストリームを捕捉する。(2) スケーラブルなサンドボックスオーケストレーションによる信頼性の高い実行。イメージキャッシングと、報酬ハッキングを軽減するための段階的防御を備える。(3) 検証とモニタリングを自動化する統合プラグインと、詳細な軌跡診断のためのライブUIを備えた観測可能なトレーニング。我々は、3つのネイティブコーディングエージェントハーネスにわたって、スパースMoEモデルQwen3.5-35B-A3BをGSPOで学習させることによりLEGO-RLを評価する。LEGO-RLは、SWE-bench Verified上でQwen3.5-35B-A3Bを、OpenHands SDKでは64.0%から70.4%へ、Claude Codeでは62.4%から68.2%へ、OpenCodeでは57.2%から66.6%へと改善し、ロールアウトとトレーニング間の確率相関を0.99以上に維持する。
グラフニューラルネットワークは、一般に、ファミリー固有の方程式によって記述され、その表記法は共通の計算と構造的差異を覆い隠している。我々は、対象とするアーキテクチャを7つの構成要素、すなわち更新ドメイン、チャネル集合、伝播バンク、チャネルごとのメッセージ写像、チャネル融合演算子、エゴ/残差写像、更新写像を通じて表現する共通の層方程式を導入する。中心となる因数分解は、情報がどこを移動するか(伝播バンクによって符号化される)と、何が移動するか(メッセージ写像によって符号化される)を分離する。関数値の充填は、同じ方程式を、局所メッセージパッシング、注意機構、スペクトルフィルタリング、大域的通信、関係固有チャネル、高次ドメイン、および幾何学的メッセージにわたって拡張する。我々は、標準的な層の具体的な縮約と、7つの非排他的なアーキテクチャファミリーにわたる構成要素割り当てを通じて、この統一を明示的かつ検証可能なものにする。固定されたスロット規則は、計算上の役割に従って演算を割り当て、フレームワークの適用範囲の境界を定義する。この分解はまた、構成要素レベルの理論的洞察をもたらす:端点局所メッセージとノード局所更新の下では、演算子の台が1層の依存関係を制限し、上述の仮定の下では、1層での大域的混合には有効演算子の完全な行が必要となる。得られたフレームワークは、200以上のアーキテクチャを共通の設計空間に整理し、構成要素ごとの比較と構造的に一貫したアーキテクチャの生成を可能にし、伝播の選択を過平滑化、過圧縮、異好性、表現力に結び付ける。さらに、測定可能なグラフ特性とタスク特性を検証済みの構成要素選択へ写像するという経験的逆問題を明らかにする。
AIシステムは、数学研究に貢献する能力をますます高めている。研究実践において、フロンティアモデルによる推論は限られたリソースであり、専門家による数学レビューはさらに深刻な制約を受けている。したがって、これらの希少なリソースを適切に配分することが、AI支援による数学的発見を効率的にするうえで中心的な課題となる。現在のAIを活用した数学研究ワークフローのほとんどでは、人間の労力は最初と最後、すなわち適切な研究問題の選定と、その後に生成される成果物のレビューに集中している。この2つの段階は、研究レベルの数学にとってボトルネックになりつつある。我々はこの課題に対処するため、新しい人間とAIの協働による発見パラダイムを提案する。人間の入力はもはや事前に選定された単一の問題ではなく、専門家が関心と専門性を持つ研究の方向性である。システムはその方向性に沿った候補問題を、広範な文献コーパスから検索する。検索システムとレコメンダーシステムに着想を得て、我々はFind、Attempt、Recommend(FAR)を構築する。これは文献からレビューへと至るカスケードであり、適切な問題の探索を自動化し、複数のフィルタリング段階を通過した成果物に人間の注意を集中させる。組合せ論のパイロット研究では、このパイプラインは5,245本の組合せ論論文から開始し、6,453件の候補となる予想または未解決問題を抽出し、それらをフィルタリングして、見かけ上適切に定式化され現在も未解決の予想4,717件に絞り込む。その後の推論と自動トリアージの段階により、598件の潜在的な解決が表面化し、著者チームによるレビューのために77項目が選定される。その中から、我々は多くの興味深い発見を特定する。これには、Davies–Jenssen–Perkins–Roberts、Erdős–Straus、Ikenmeyer–Pak–Panova、Lund–Saraf–Wolfによる予想や問題に関する結果が含まれる。これらの結果は、数学的発見のための人間とAIの協働におけるこの新しい形態の有効性を示している。
プログラム的表現は、3Dコンテンツ生成の有力なパラダイムであり、細粒度の編集、解釈可能性、明示的な構造制御を可能にする。しかし、大規模言語モデル(LLM)を用いて3Dプログラムを作成するエージェント的ワークフローは依然として脆弱であり、高レベルの意図を一貫した低レベルの幾何形状へと変換できないことが多い。我々は、この脆弱性は、既存のプログラム的インターフェースとLLMの推論の強みとの間の不整合に起因すると考える。LLMの推論は、脆弱な数値選択よりも意味構造と空間関係を重視するからである。本論文では、このギャップを埋めるために、エージェント中心のドメイン特化言語(aDSL)と役割特化型マルチエージェントシステムを共同設計する。aDSLは、合成可能性と空間推論を重視することにより、意味論的論理と幾何学的制約を橋渡しし、エージェントが脆弱な絶対座標ではなく関係演算子を通じて幾何形状を操作することを可能にする。aDSLに基づき、我々の学習不要のマルチエージェントシステムは、Plan-Execute-Criticループに従って、要求の分解、コードの合成、実行フィードバックを用いたエラーと制約違反の反復的修復を行う。実験の結果、この共同設計が堅牢性、制御可能性、ユーザーの意図への忠実性を向上させることが示された。本手法は、テキストから形状、画像から形状へのタスクにおいて、既存のLLMベースのベースラインを上回り、明示的な構造、編集可能性、解釈可能性を維持する。さらに、関節オブジェクトの生成や構造化シーン構成などの下流アプリケーションも可能にする。我々のコードはhttps://github.com/sig-pku/aDSLで公開されている。
本稿では、GPUカーネル最適化のためにアーキテクチャ固有のPTXを利用する大規模言語モデル(LLM)を評価し、適応させるためのベンチマークであるPTXBenchを紹介する。PTXBenchは、機能的正確性、選択された対象命令が実行時に実行されるかどうか、およびH100およびB200 GPU上のGEMMおよびアテンションのワークロードにおける最先端ライブラリに対する高速化を測定する。我々の評価は、アーキテクチャ固有のPTXの能力が依然として不均一であることを示している。すなわち、複雑なアテンションの逆伝播ワークロードでは成功率が大幅に低下し、対象命令を実行しても必ずしも競争力のある性能にはつながらない。評価されたモデルのいずれも、スイート全体にわたって最先端ライブラリに一貫して匹敵するものはなかった。さらに、教師ありファインチューニングを用いてQwen3.6-27Bを適応させる。修復条件付きトレーニングはいくつかのタスクを改善するが、汎化は依然として不均一である。データセットサイズに加えて、データのカバレッジ、バランス、推論教師モデルの質が重要である。PTXBenchは、進化するGPUアーキテクチャを活用するLLMの能力を測定し向上させるための、監査可能なテストベッドを提供する。
心電図(ECG)、光電容積脈波記録(PPG)、心音図(PCG)は、同一の心周期を相補的な視点から捉えるものであるが、既存の心臓基盤モデルは単一のセンシングモダリティで訓練されており、センサー間で共有される生理学的特性は活用されていない。我々は、生理学的知識を組み込んだ結合埋め込み予測アーキテクチャに基づき、ECG、PPG、PCGにわたって単一の共有表現を共同で学習する心臓基盤モデルCardioState-JEPAを提案する。本モデルは異種の波形を共通のトークン空間に写像し、単一の共有Transformerエンコーダで処理し、マスク化された潜在心臓状態を予測することで学習する。これにより、事前学習の目標をセンサー固有の波形形状ではなく、共有された生理学的特性に置いている。電気的・機械的・血行動態的イベント間の時間的ずれを扱うため、クロスモーダル予測では、対応する心臓時刻で信号を整合させる学習遅延アライナを使用する。同期したマルチセンサ記録は稀少であるため、CardioState-JEPAはまず豊富な単一モダリティデータからモダリティ内構造を学習し、次にペアデータを用いて潜在的な心臓時刻上でモダリティを整合させる。凍結エンコーダとしてECG、PPG、PCGにわたる25の下流タスクで評価したところ、本エンコーダは最良の自己教師あり信号ベースラインと比較して、PPG分類の平均AUROCを8.2ポイント、PCG心雑音検出を18.8ポイント、ECG分類を15.5ポイント向上させた。さらに、複数のECGベンチマークにおいて、特権的な臨床テキストや教師ラベルを用いて訓練された心臓モデルと同等以上の性能を示した。これらの結果は、異種の心臓信号が単一の心臓生理学基盤モデルを相互に監視できることを実証している。
統一的画像復元(UIR)は、単一のモデルを用いて、異なる劣化を伴う低品質(LQ)画像から高品質(HQ)コンテンツを復元することを目的とする。最近の手法の多くは、その強力な容量と生成的先験知識を活用するため、大規模な事前学習済みテキストから画像への(T2I)潜在拡散モデルを適用している。しかし、潜在T2Iモデルにおける変分オートエンコーダ(VAE)は復元に敏感な詳細を捨て去る可能性があり、一方でオープンエンドな合成の先験知識は内容と矛盾するアーティファクトを導入し得る。我々は、VAEを用いないピクセル空間の拡散Transformer(DiT)であるPixRestoreを提案する。ここでは拡散バックボーンをT2I事前学習に頼らず完全にゼロから訓練する。PixRestoreはパッチ化されたピクセル上で直接フローマッチングを行い、トークン系列を扱いやすい状態に保ちつつ、細かな詳細を保存する。異なる劣化に適応するため、PixRestoreはLQ-HQ DINO特徴類似度を用いて層特徴の信頼性を予測することを学習する。より信頼性の高い層からの特徴は密な条件付けとして融合され、一方、信頼性の低い層には劣化除去を促進するためにより強いHQ特徴の監視が与えられる。我々は多様なシーンと劣化からなる大規模コーパスでPixRestoreを訓練し、さらに効率的な推論のためにDINOに基づく敵対的目的関数を用いて一段階生成器へと微調整する。公開ベンチマークと実世界のテストセットにおける実験により、わずか約50Mパラメータと一段階推論で、PixRestoreは競合するUIRモデルの中で全体的な忠実度、知覚品質、劣化に対するロバスト性において最高を達成し、かつはるかに効率的であることが示される。より大規模なPixRestoreの変種はさらに性能を向上させることができ、我々のピクセル空間設計のスケーラビリティを実証する。コードと厳選されたベンチマークは https://github.com/csslc/PixRestore で入手できる。