翻訳付きの日次キュレーションされたAI研究論文
汎用言語モデルは推論と知識の統合が可能だが、複雑な作業には、ファイル、情報源、実行可能コードとの持続的なやり取りに加え、状態維持、障害回復、検証可能な成果の納品が必要となる。私たちはこれを作業能力と呼ぶ。すなわち、現実世界の目標に向けた持続的かつ検証可能な進捗である。Apodex 1.1は、この能力を2つの相補的な次元に沿って発展させる。環境スケーリングは、実行可能なファイル、検索、コード環境の多様性と検証可能性を拡大し、エージェント連携スケーリングは、長期的なタスクの分解、並列作業の委任、非同期結果の統合、再計画を行うエージェントを訓練する。共有実行ハーネスとAgentOSは、ツールとエージェントにまたがってタスク状態と来歴を維持し、訓練は環境軌跡と連携トレースを信頼性の高い行動へと変換する。複雑な専門的業務、金融、科学研究、数学、コーディング、検索にわたり、Apodex 1.1は、多くの最先端システムよりも大幅に小さいモデルでありながら、トップクラスの性能帯に到達する。350億パラメータのApodex 1.1 Miniはさらに、ローカル展開可能な形態で強力な作業能力を保持する。これらの結果は、エージェント型知能を、時間をかけて完了される有用かつ検証可能な作業に基づかせるとともに、野心的で長期的なタスクを処理するヘビーデューティ・ソルバーの構築という目標を前進させる。
本稿では、連続的なナビゲーションに応答しながら720p映像、環境音、音楽、音声を同時に生成する、入場可能な生成メディアのためのオムニモーダルワールドモデルであるEchoWMを提案する。インタラクションはカメラ意図を中心に構成される。一人称シーンではカメラ意図が観察者の動作を指定し、三人称シーンではカメラとキャラクターのダイナミクスを、視点固有のコントローラなしでデータから学習する。離散コマンドと連続ポーズは、共有のメートルスケール相対6自由度軌跡にマッピングされ、データセットレベルのキャリブレーションにより、異種データ間で移動量が維持される。音声視覚生成と軌跡制御を同時に学習するため、補完的なデータエンジンを構築し、長期生成のためにプログレッシブトレーニングに続く自己回帰的事後トレーニングを採用する。広範な評価により、EchoWMが公開ワールドモデルベンチマークにおいて優れた軌跡追従性能と高い画質を達成し、多様な対象に対する一人称・三人称の両方のインタラクションをサポートし、長期生成にわたって環境音と音声の同期を維持することを示す。
Eコマースライブストリーミングでは、ノイズが多く時間的に長いストリームのオムニモーダル理解が必要であり、商品の事実は音声、ビデオフレーム、商品画像、オーバーレイテキスト、ユーザークエリに分散している。我々は、ライブコマースシナリオに特化したオムニモーダル理解モデル「TLive-Omni」を提案する。本モデルは、画像、ビデオ、音声、テキスト入力を統一的表現空間にマッピングする。長時間のライブストリーミング解析のために、我々はPer-vGridを導入する。これは、明示的な境界トークンで囲んで各ビデオグリッドと時間的に対応するオーディオをグループ化し、時間的整合を容易にする、タイムスタンプ付きトークン編成である。我々は、オムニモーダル知覚から指示追従応答まで、ライブコマース理解を段階的に発展させる3段階の教師あり学習レシピを設計する。次に、我々はFaithful-RFTを提案する。これは、リアルタイム要件を満たしつつ回答の忠実性と表現品質をさらに向上させる強化学習ファインチューニング段階であり、ロールアウト中の推論スタイルの探索を最適化するのではなく、タスクで検証可能なフィードバックを用いて最終応答を直接スコアリングする。さらに、TLive-Omniは、シナリオ指向の原子的能力タクソノミーと、ライブコマースの音声・画像・ビデオストリームを、音声認識、話者分析、商品の視覚的グラウンディング、テキスト認識、時間的グラウンディング、ビデオのデンスキャプション、オムニモーダルQAなどの学習信号に変換するコンパクトなデータ生成エンジンによって支えられている。スケーラブルな学習のために、同期された長さグループ化サンプラーはワーカー間で同等のワークロードを維持しつつパディングを削減し、一方で軽量な動的サンプリング戦略は、GRPOの有意義な相対的アドバンテージを維持するために、ほぼゼロの報酬分散でロールアウトグループを再生成する。Eコマースライブストリーミングベンチマークに関する実験は、ライブコマース領域のタスク全般で高い性能を示し、一般的なベンチマークでも優れた汎化性能を示す。
既存の画像編集フレームワークは、主にテキストから画像を生成する拡散モデルの学習パラダイムに従っています。しかし、このパラダイムを画像編集に拡張すると、編集コンセプトの粒度への配慮が不十分であることと、疎な監視信号による学習効率の低下という、2つの本質的な不一致が浮き彫りになります。これらの問題に対処するため、我々は1,000以上の細粒度の編集コンセプトを備えた包括的な階層的分類体系を構築し、改良された合成フレームワークを用いて、1,200万組の高品質な編集ペアからなる大規模データセットConceptEdit-12Mを構築しました。このライブラリ駆動型アプローチは、生成データの分布崩壊を効果的に是正するとともに、高いデータ忠実度を保証します。さらに、我々は、干渉しない複数のコンセプトを単一の画像ペアに合成する、密な監視信号による学習戦略を提案します。この戦略は、より豊富な学習信号を提供することにより、学習効率とモデル全体の性能の両方を大幅に向上させます。学習結果は我々の戦略の有効性を検証しており、従来手法を大幅に上回る性能を示しています。最後に、多種多様な実世界シナリオにわたってモデルの能力を診断するための、粒度の細かい評価スイートであるConceptEdit-Benchを提案します。
オンデバイスLLMエージェントがパーソナルコパイロットへと進化するにつれ、モバイルオペレーティングシステムはこのパラダイムの主要なテストベッドとなり、厳密な能力評価が不可欠になっている。しかし既存のベンチマークは2つの系統に分かれており、それぞれに重大な盲点がある。GUI中心のベンチマークは表面的な画面操作をテストする一方で、バックグラウンドでのツール使用や長期的な計画立案を見落としている。対照的に、静的関数呼び出しベンチマークは、実実行時の制約から切り離されたオフラインのAPIマッチングに依存している。このギャップを埋めるため、我々はモバイル計画エージェントのツール呼び出し能力と計画能力を評価するための、対話型・状態保持型・ツール中心のベンチマークであるMobilePA-Benchを提案する。MobilePA-Benchは、ライブなアプリケーションデータベースを保持し構造化フィードバックを返す実行可能なサンドボックス上で動作し、13の機能ドメインと212の現実的なモバイルツールを網羅する。基本的なツール使用に加えて、中心となる計画エージェントを3つの高度な側面に沿って評価する。(1) サブエージェント連携――複雑なタスクを分解し、専門的な作業を有能なサブエージェントに委任する能力。(2) メモリ使用――保存された記憶、ユーザープロファイル、過去の嗜好を想起して暗黙的な要求を解決する能力。(3) スキル使用――すべてのステップをゼロから計画する代わりに、事前にパッケージ化された複合スキルを呼び出す能力。大規模な実験により、現在の最先端LLMはモバイル環境では依然として信頼性が低いことが示された。厳格なツール順序、権限制限、予期しない実行時エラーの下では、性能が急激に低下する。対話型の関数呼び出しサンドボックスとエビデンスに基づく検証を組み合わせることで、MobilePA-Benchは実用的な診断ベンチマークとしても、エージェント型強化学習のための対話型基盤としても機能し、信頼できるモバイルエージェントの開発を加速する。
言語モデルは逐次プロセッサであるが、長期的エージェンシーには、モデル重みとアクティブコンテキストを超えた外部情報と計算が必要である。Prime Agentは、長期的評価とコーディングエージェントワークフローのためのオープンソースハーネスである。永続的IPython REPLは、再帰的言語モデル抽象化に従い、プログラムによるコンテキスト処理とテスト時計算を実現する。Continual Harnessは、履歴、記憶、スキル、プロンプト、およびサブエージェント仕様を軌跡を超えて保持する。再帰的サブエージェントは、エージェント間の直接通信を通じて連携し、Agents Viewは、人間がデーモン上で動作するセッションを検査・管理できるようにする。Prime Agentは、戦略構築をモデルに委ねつつ、実行、復旧、検証、およびリソース会計を標準化する。この低摩擦で表現力豊かな膜は、ハーネスの失敗がモデルの失敗になるのを防ぎ、測定をモデルの真の最大潜在能力へと向ける。Prime Agentは、ARC-AGI-3 RHAE Best@1を30%から95.5%に引き上げ、長文脈コーディング、GPUカーネル生成、エミュレータ構築、自律nanoGPTスピードランにおいて、ネイティブおよび一般的なハーネスと同等以上の性能を達成する。Factorioでは、リファインメントにより継続的な技術進行が可能になり、専用サブエージェントにより作業の並列化が可能になることが分かった。コードはhttps://github.com/PrimeIntellect-ai/prime-agentで入手できる。
テキストから3D生成は急速に進歩しているが、低い推論コストで高い幾何学的忠実度を達成することは依然として困難である。既存のテキストから3Dへの変換手法は、離散形状トークンを自己回帰的にデコードするか、拡散モデルやフローモデルを用いてグローバルな3D表現を反復的に精緻化するかのいずれかである。しかし、自己回帰デコードは逐次的であり、誤りを修正できない。一方、拡散モデルやフローマッチングモデルは表現全体を繰り返し処理するため、高品質な生成はますますコストがかかる。本論文では、離散形状トークン系列を連続ブロックに分割し、ブロックを自己回帰的に生成するとともに、現在のブロック内のすべてのトークンを同時にデノイズする、ブロック単位の拡散フレームワークであるBlock3Dを提案する。誤差蓄積を軽減するため、信頼度に基づくブロック内補正を導入し、各ブロックが確定される前に低信頼度トークンを修正する。TRELLIS-500Kのホールドアウトセットにおいて、Block3Dは平均エンドツーエンド生成時間を25.71秒から4.99秒に短縮し、幾何学的忠実度を損なうことなく、ファインチューニングされた自己回帰ベースラインに対して5.15倍の高速化を達成した。
ワールドアクションモデル(WAMs)は、将来の世界進化をアクション生成に組み込むことでプランニングを改善するが、既存手法は各シーンに固定の想像予算を割り当てる。本稿では、継続ロールアウトの期待プランニング利得に応じて逐次的なRoll/Stop判断を行う、システムレベルの適応的想像フレームワークであるRISE(選択的ロールアウトによる想像の精緻化)を提案する。各ステップで、潜在評価器は現在のプレフィックスによって明らかになったリスクと、想像を継続した場合にプランニングがどの程度改善し得るかを推定し、ロールアウトゲートはこの期待利得と追加計算コストを比較考量する。実際の運転ログは実現した一つの未来しか明らかにしないため、我々はさらに、多様な結果とリスクレベルを備えた反事実データセットであるCounterDriveを構築し、将来のダイナミクスを豊かにするとともに、局所的なリスク教師信号を提供する。保持された各サンプルは、軌道の妥当性、インシデント発生、因果カテゴリについて専門家による検証とアノテーションを受け、セーフティクリティカルなワールドモデリング研究のための再利用可能なリソースとなる。NAVSIMとnuScenesでの実験により、RISEは不要なロールアウトを削減しつつ最高の総合プランニング性能を達成し、さらに転移実験の結果はWAMアーキテクチャ横断のプラグイン的汎用性を支持する。
現実世界の産業シナリオにおけるユーザー表現学習は、通常、ユーザー数、行動系列長、モデルサイズを拡大することによってスケールされる。しかしながら、既存手法は次の2つの課題に直面している。(i) 十億規模の容量における生データスケーリングのボトルネック。より大規模な生テキストのユーザー行動入力では性能向上が逓減し、これはトークン化によって緩和され得る。(ii) データサイズに応じてトークン化構成をどのようにスケールすべきかに関する定量的分析の欠如。本報告書では、データ規模と最小十分なトークン化容量との間の定量的関係を特徴付ける、ユーザー行動稠密化則(User Behavioral Densing Law)を提案する。まず、十億規模のAlipayデータセットにおける生データとトークン化データのスケーリング比較に関するパイロット研究を実施し、生データスケーリングのボトルネックと、トークン化によって可能となる持続的な利得を明らかにする。異なるデータ規模における最小十分なトークン化構成を支配するスケーリングパターンを導出するため、理論的分析と系統的実験を用いて定量的スケーリングパターンをまとめる。その結果、最小十分なトークン化容量の対数と、トークン数で測定した入力データサイズの対数との間にほぼ線形関係があることが分かった。また、スケーリング傾きはトークン化手法とデータソースに応じて系統的に変化し、表現空間の冗長性とソース内の一意性の違いを反映している。提案した法則に基づき、容量配分を改善する適応的可変長トークン化手法であるALGNをさらに開発する。多様なデータソース、トークン化手法、下流タスクにわたる大規模実験は、ユーザー行動稠密化則の一般化可能性と信頼性を示し、大規模ユーザー表現学習におけるトークン化構成の選択に実用的な指針を提供する。さらに、ALGNは既存のベースラインを上回る性能を達成する。
インタラクティブなワールドモデルは、ユーザーのアクションに追従し、提示した場所を記憶し、リアルタイムでストリーミングできなければならない。この緊張関係は構造的なものである。すなわち、制御は短いホライズンを要求し、記憶は非有界なホライズンを要求する。ReWorldは、トレーニング中にこの2つを分離し、推論時にそれらを制限する。混合されたヘッド単位のアテンションウィンドウにより、ほとんどのヘッドは最近の過去に注目する一方、少数のグローバルヘッドは全履歴に注目する。さらに、ランダムなヘッドルーティングにより、いずれの能力も特定のヘッドに固定されることを防ぎ、ランダムなチャンクドロップにより、疎な履歴が分布内となる。推論時には、過去全体が固定予算の下に置かれる。すなわち、現在のポーズに最も近いランドマークをモデルが取得する、ポーズで索引付けられたランドマークバンクに裏打ちされた有界なKVキャッシュである。メートルスケール整合データエンジンは、8つのソース(Unrealでレンダリングされたフライスルー、ゲーム内の移動、実世界の映像)を1つの物理的なアクションスケールに配置するため、どのソースでも同じキー押下でカメラが同じ距離を移動し、パリンドローム軌道がメモリトレーニングに必要な再訪証拠を提供する。LoRAアダプタのみに施す分布マッチング蒸留は、サンプリングを4ステップに圧縮する。単一のバックボーンが、高忠実度のマルチステップモードとリアルタイムのインタラクティブモードの両方を担い、フォトリアリスティック、ゲームスタイル、様式化された世界にわたって704×1280ビデオをストリーミングする。アクション追従、長期的な想起、ビデオ品質をカバーする3軸プロトコルの下で、最近の6つのインタラクティブワールドモデルに対して、最高の制御忠実度(11.95°の回転誤差と最高のカメラモーション一貫性)と最高の生成品質を達成した。さらに、約1分の往復ロールアウト(64秒、384ラテント)では、固定12チャンクキャッシュが開始ビューを再生成し続ける。これは、スライディングウィンドウが証拠をとっくに追い出し、フルKVアテンションがメモリ不足になるロールアウト長である。
大規模言語モデルに対するポリシー最適化(PO)は、安定性と探索の間のトレードオフに直面しており、現在はアクション側のPolicy-KL正則化器によって調整されている。これにより実務者は二重のジレンマに陥る。すなわち、Policy-KLを維持すれば応答の振る舞いが制約され、アクション側の探索予算を消費する一方、それを外せば最適化は明示的なドリフト制御を失う。我々は、正則化を入力側に移すことでこのジレンマを打破する代替手法を提案する。訓練が進むにつれて、現在のポリシーによって誘導される訓練クエリ上の分布は、強化学習前の参照分布から制御されずにドリフトする。 具体的には、Environment-Regularized Policy Optimization(ERPO)は、このクエリ分布のシフトを制限するQuery-KL(QKL)項を導入するとともに、データセットに対して静的であり参照分布から導出されるクエリごとの重みを用いる。この重みは、各クエリの更新を参照の下で典型的なクエリへと偏らせる。QKL勾配は厳密にクエリ尤度を通してのみ流れ、ポリシー勾配推定器で使用される応答スコア関数はQKL項に現れない。したがって、QKLは応答分布に直接の勾配圧力を及ぼさず、探索は維持される。ERPOは、追加のフォワードパスを必要とせずにGRPO/PPO/REINFORCEスタイルのパイプラインに組み込むことができる。6つの数学推論ベンチマークにおいて、ERPOは標準のPolicy-KL正則化器を置き換えつつ、クエリ分布のドリフトを効果的に制御し、高温デコードおよび長期的訓練の下でより高い精度と大幅に安定した挙動を達成する。ソースコードは https://github.com/alibaba/ERPO で公開している。
オープンエンドな実世界対話では、複数の妥当な行動が許容される。エージェントは、直接回答したり、明確化を求めたり、進捗を報告したり、行動前に確認したりできる。この柔軟性は、グループベースのRLの背後にある中核的な仮定を破る。すなわち、グループ内で比較されるロールアウトが行動的に比較可能であることはもはや保証されない。その結果、報酬モデルの対話スタイルに対する選好が相対的アドバンテージを歪め、最適化を文脈に適した行動ではなく報酬モデルが好む行動へと誘導し得る。我々はこれを報酬公平性問題として定式化し、ARC(Advantage Regularization via Conditioning:条件付けによるアドバンテージ正則化)を提案する。これは、方略条件付きロールアウトのグループ化とハイブリッド報酬およびエントロピー正則化を組み合わせることにより、より公平な相対比較を回復する訓練レシピである。我々は、提案する\inter{}においてARCを検証する。\inter{}は、ユーザーに見えるコミュニケーションを潜在的な推論やツール使用から分離する、応答性が高く、誘導可能で、実行認識型のユーザーとエージェントの対話の新しいパラダイムである。\inter{}はまた、教師あり学習およびRL訓練のための方略アノテーション付き訓練コーパスである\inter-86Kを構築するためのアノテーションおよび蒸留パイプラインも提供する。実験的には、ARCは中核となるτ/τ²ツール使用ベンチマークの性能を大幅に向上させる。一方、\inter{}は、思考型ベースラインと比較してtime-to-first-tokenを4.91秒から1.27秒に短縮する。これらの結果は総合的に、オープンエンドな対話型学習における中心的なボトルネックは、エージェントがどのように報酬を得るかだけではなく、そもそもその行動が公平に比較されるかどうかにあることを示唆している。ARCの実装と\inter-86Kの訓練データは公開される予定である。
最近の大規模言語モデル(LLM)は、自然言語のリクエストから完全なゲームを構築するコーディングエージェントとして動作できる。ゲーム開発は、プログラムロジック、視覚的・音声的コンテンツ、インターフェース、インタラクション、プレイアビリティが単一の実行可能な成果物として一体として機能しなければならないため、特に要求が厳しい。したがって、この能力を測定するには、ゲーム製品と開発プロセスの両方の評価が必要である。既存のベンチマークは、多くの場合、最終成果物または孤立した開発段階を評価することによって、LLMのゲーム開発能力を評価している。完全な人間とエージェントの開発軌跡の分析から、コーディングエージェントを用いたゲーム開発のライフサイクル全体を網羅する3つの段階を特定した:初期ゲーム生成、バグ診断と修正、複数ターンにわたる最適化である。そこで我々は、これら3つのライフサイクル段階を相補的な3つのベンチマークトラックとして具体化するGameXpert-Benchを導入する。GameGenは、空のワークスペースにおける単一のリクエストからの完全なゲーム生成を評価する。GameFixは、欠陥が報告された場合またはエージェントが発見すべき場合の診断と修正を評価する。GameOptは、ユーザーとエージェント間の実際の開発軌跡に基づくリクエストチェーンを通じた累積的最適化を評価する。各トラックは、ライブなゲーム操作、決定的な行動テスト、または回帰チェックを伴う最終製品基準を用いて評価する。スイートには、11ジャンルにわたる97の生成タスク、人間が検証した50のゲームレベルからの100の修正タスク(各レベルに19〜27個の注入バグ)、および6ターンと102リクエストからなる17の最適化チェーンが含まれる。3つのトラックを通じて、現在のエージェントは、欠陥の発見、ランタイム動作の検証、変更にわたる機能の維持よりも、プレイ可能な基盤の生成と明示的な要件の実装においてより信頼性が高い。
最近のエージェントベンチマークは、コード修正からウェブナビゲーション、アプリAPI、関数呼び出しに至るまで、実行可能環境に評価の基盤を置くものが増えている。しかし、コード以外の重要な作業を完了するには、もっともらしい応答や有効なツール呼び出しを生成するだけでは不十分である。エージェントは、複数ターンにわたって欠落情報を収集し、ドメインポリシーに従い、依存関係のあるツールを調整し、副次的な影響なしに正しい永続的な状態遷移を実現しなければならない。本論文では、ツール・エージェント・ユーザー間の相互作用のためのサンドボックスであるThinkingboxを紹介する。これは、分離されたMCP互換ツールセッション、完全な実行トレース、および最終バックエンド状態に対する結果評価を提供する。このサンドボックス上に構築されたThinkingbox-benchには、小売、ホスピタリティ、自動車保険、ネオバンク社内IT、コンサルティングIT/人事サポートなど、多数のシナリオにわたる507件のポリシー条件付きワークフローが含まれる。各試行は、有効な軌道を受け入れ、誤った効果、欠落した効果、または余分な効果を拒否するタスク固有の実行可能チェックによって評価される。指定されたタスクでは、最終応答に必要な特性も追加でチェックされる。プロプライエタリモデルとオープンウェイトモデルの全体を通じて、最強モデルはpass@1で65.36%を達成するが、pass@20ではわずか25.25%しか達成しない。さらに、失敗した試行の多くはクリーンな終了と有効な状態変更アクションを示しており、応答またはツール呼び出しレベルのシグナルは、エンドツーエンドのタスク完了の明確な代理指標ではないことを示している。Thinkingbox-benchは、偶然成功軌道を見つけることと、ステートフルなビジネスタスクを確実に完了することとの間に大きなギャップがあることを明らかにしている。我々はThinkingboxとThinkingbox-Benchの両方を公開する:https://github.com/microsoft/thinkingbox
大規模言語モデルを低コストで提供することは、ますます、パラメータ数を数分の一にまで構造的に圧縮し、さらに4ビットに量子化したモデルを出荷することを意味している。これらの処理は、推論、数学、コーディング、長文脈の挙動を低下させ、デプロイ前に回復(ヒーリング)段階を必要とするほどである。標準的な手法である量子化対応学習(QAT)は、圧縮・量子化されたモデルをハードラベルに再適合させるが、我々のパイプラインでは収束が遅く、ピークを過ぎると性能が崩壊した。そこで我々は、代わりに量子化対応ヒーリング(QAH)を採用した。構造的に圧縮されたモデルは完全精度で独立に訓練されることがないため、そのbfloat16チェックポイントは元のモデルを蒸留によって復元した近似である。QAHは4ビットの生徒モデルを、圧縮されていない元のモデルから直接蒸留する。GPT-OSS 120Bから60B、さらにMXFP4へのパイプラインにおいて、QAH生徒モデルは9つのベンチマーク中7つでbfloat16の元モデルに匹敵するかそれを上回り、重みメモリは約4分の1、パラメータ数は教師モデルの半分である。そしてHypernova-60Bとしてオープンウェイトで公開された。同等条件のQATベースラインと比較して、約7倍速く同等のピークに到達し、手動調整による早期打ち切りなしで継続的な学習の下でも安定している。また、分散学習バックエンド間の大きく再現可能な品質格差など、デプロイに関する教訓も報告する。我々の目標は、数週間に及ぶハイパーパラメータ探索なしでデプロイ可能な手法を提供することである。
自律的研究システムは、長大な研究ワークフローを実行する能力をますます高めているが、自動化だけでは、そのプロセスが科学的に裏付けられたものとして維持されることは保証されない。本稿では、アイデア生成とアイデア実行を結びつける二段階システムであるAutoResearchを紹介する。これは、研究アイデアがどのように形成されるか、そして実験を通じてどのように信頼性をもって確立されるかの双方に対処するものである。アイデア生成段階では、AutoResearchは、新たに生じる研究シグナルを蓄積されたドメイン知識と継続的に統合し、転移可能なメカニズム的洞察を特定し、マルチモデル生成と相互レビューを用いて、根拠に基づいた検証可能な研究計画を生成する。アイデア実行段階では、協調するエージェント群がこれらの計画を実験に分解し、反復的に実装と診断を行い、研究結論を受け入れる前に独立したエビデンスに基づくレビューを採用する。クロスモーダル検索、システム最適化、ベンチマーク駆動型機械学習における代表的な設定を通じて、AutoResearchは生成されたアイデアを測定可能な進歩に変え、信頼できない実験結果を検出・修正し、エビデンスに基づく条件付き判断によって研究の方向性を継続・修正・終了する。例えば、RSICDベンチマークでは、AutoResearchが生成したアイデアにより平均リコールが32.84から34.69に向上し、監査で確認された問題イベントはわずか5件であり、他の自律的研究システムの11〜27件と比較される。これらの結果は、意味のある洞察が実験前に根拠付けられ、結論が受け入れ前に根拠付けられる研究プロセス、すなわち「洞察を入れ、幻覚を出さない」(Insight In, Hallucination Out) ことを実証している。
オン方策蒸留(OPD)は、生徒モデルが生成した軌跡と、教師からの密なトークンレベルの監督を組み合わせることで、言語モデルのポストトレーニングにおける効果的な枠組みとして登場した。しかしOPDは、教師由来の報酬が推論の進展の適切な代理指標であると暗黙に仮定しており、そのため方策最適化の際にすべての教師フィードバックを同等に扱う。実際には、この仮定は常に成り立つわけではない。我々は、教師由来の報酬が真の推論の進展としばしば矛盾することを観察する。明確な推論の進展が見られる推論ステップであっても、教師の出力からの逸脱を理由に、蒸留報酬が低くなる場合があるのである。この不一致に対処するため、我々はオン方策蒸留のための推論進展認識報酬フィルタリング(R2-OPD)を提案する。これは、軌跡内で推論スパンの2つのランキングを構築する。1つは教師由来の報酬に基づくものであり、もう1つは独立に推定された進展報酬に基づくものである。蒸留報酬は、2つのランキングが一致しない場合に選択的に抑制され、推論の進展と矛盾する監督を減らしつつ、効果的な教師の指導を維持する。我々のアプローチは、特に推論性能において、標準OPDと比較して一貫した改善を示す。
我々は、適応的な検証タスク選択による効率的なLLMハーネス最適化のための新しいアプローチを提案する。ハーネス最適化は、検証性能に基づいてハーネスコードを反復的に書き換え、基盤となるモデルの重みを更新することなく大幅な性能向上を可能にする。しかし、既存のアプローチは、各反復において固定された検証セット全体を評価するため、ハーネスの進化に伴って判別力が低下するタスクに対しても多大な評価コストが発生する。我々は、有益なタスクの選択と、部分的な評価からの全体セット性能の推定という2つの課題に取り組むことで、検証タスクをハーネスとともに共進化させるTask-CoEvolveを提案する。Task-CoEvolveは、候補となるハーネス間で結果が分かれるタスクは、一貫して解決または失敗されるタスクよりも、それらを区別する上で有益であるという観察に基づいている。過去の結果に基づく分散重み付きサンプリングを用いて、能力のフロンティア付近のタスクに評価を集中させ、サンプリング分布はハーネスの進化に応じて適応する。その後、サンプリングされたタスクから、そのサンプリング確率を考慮して全体セットのスコアを推定することで、異なるサブセットを評価するにもかかわらず、反復間での一貫した比較を可能にする。オンラインテキスト分類とTerminal-Bench 2.1での実験により、Task-CoEvolveはサブセットベースのベースラインを一貫して上回り、最適化中の評価回数を80%削減しながら、フルセット検索の最終性能に匹敵することを示す。コードはhttps://github.com/Agent4Science-UTokyo/Task-CoEvolveで公開予定である。
大規模言語モデルは、相互依存する制約を維持し、厳格なエンドツーエンド検証を満たす成果物を生成することに成功が依存する複雑なワークフローを実行することがますます期待されている。しかし、成功した実行経験は通常、一度の実行で失われ、後続のモデルは戦略や失敗モードをゼロから再発見せざるを得ない。我々は、検証器で確認された実行軌跡が構造化されたGeneに統合されるEvoMapを通じて、そのような経験を外部化して再利用できるかどうかを研究する。この設定を評価するために、コード生成、エージェント環境合成、数学的推論、およびルール遵守にわたる778の機械検証可能なタスクからなるLong-Workflow Benchmark(LongWoF-Bench)を導入する。検証器で確認されたOpus軌跡を持つ252のタスクでは、進化させたEvoMap Geneは、評価した全7モデルにおいてSkillを8.7〜15.5パーセントポイント上回り、その利得は異なるモデルファミリーの消費者向けモデルにも及ぶ。対照的に、参照蒸留されたGeneは同じ利点を示さず、コンパクトな表現だけでは不十分であり、Geneの有用性が検証された経験の由来と密接に関連していることを示している。Claude Opusでは、Gene再利用により、Skillよりも39件多いタスクを完了し、解決時のトークン消費を9.9%削減する。これらの結果は、検証済みの実行経験が再利用可能な外部リソースとして保持・共有され、モデルが経験発見の全コストを繰り返し支払うことなく、長期ワークフローの完了を改善できることを示している。
音声ベースのアプリケーションは、検索モジュールに渡す前に自動音声認識(ASR)を介して音声クエリを処理するため、ASR誤りは固定された上流の制約としてパイプラインに入り込む。我々は、標準的な検索拡張生成(RAG)に対する2つの拡張、すなわちエンティティグラフリンキングと反復的再構成が、これらの誤りを吸収するのか、あるいは増幅するのかを実証的に検証する。ニューラルTTSで合成された4種類の英語アクセントを用いて、3つのマルチホップQAベンチマーク(HotpotQA、2WikiMultiHopQA、MuSiQue)において、4つのRAG構成をクリーンテキストのオラクルと比較して評価する。構造的に豊かな構成はASR入力下でも一般に高い絶対F1スコアを維持するものの、両拡張は誤りを増幅する。すなわち、クリーンテキストと最高単語誤り率(WER)のアクセントとの間のF1ギャップは、3つのベンチマークすべてにおいて、単純な密ベクトル検索を使用した場合よりも、これらの組み合わせを使用した場合の方が36〜67%大きくなる。主要な失敗モードはクエリ中の1つ以上のエンティティの破損であり、2WikiMultiHopQAでは4つの手法すべてにおいて性能低下事例の87〜96%を占める。2つの軽量な表層形の緩和策を適用してもギャップの大部分は残っており、下流の検索構造が残存するエンティティ誤りを増幅することを示している。コードとデータは https://github.com/ZhenghuaBao/spoken-multihop-rag で公開している。
大規模言語モデル(LLM)における長コンテキストのプリフィルは、高密度セルフアテンションがクエリ・キー間のスコアを二次的に計算するため、多大な計算量とメモリトラフィックを引き起こす。既存手法は、一律の低精度パスを用いるか、トークン間の相互作用を選択するかのどちらかであり、融合高密度アテンション内でハードウェア整列スコアタイルにわたる空間的精度ルーティングを扱っていない。我々は、融合高密度アテンション内のスコアタイル群に対して数値精度を実行可能な空間的決定とする、タイル中心の精度ルーティングカーネルであるTileMixを提案する。TileMixは、アテンション行列をハードウェア整列スコアタイルに分割し、ルーティング決定をコンパクトなビットマスクにパックし、各タイルグループをFP16またはINT8スコア計算に振り分ける。その間、両方のパスは共有されたオンラインソフトマックス状態を更新する。スケーラブルな精度グループ化により、各ルーティングビットが複数の隣接キータイルを管理でき、長いコンテキストでもハードウェア整列の計算タイルとコンパクトなメタデータを維持する。すべての正当なタイルグループをルーティングすることにより、TileMixは高密度トークン接続性を維持し、学習を必要とせず、グループ化クエリアテンション、可変長バッチ、INT8キー/バリューキャッシュをサポートする。LLaMA、Qwen、VicunaにおけるLongEval、LV-Eval、A100プリフィルベンチマークにわたって、TileMixは一律INT8で失われた長コンテキスト品質を回復し、FP16と比較してプリフィルスループットを向上させ、モデルファミリー間で制御可能な精度効率フロンティアを実現する。実装はhttps://github.com/HanzhiZhang-Ulrica/TileMixで利用可能である。
産業技術報告書には、保守、トラブルシューティング、製品エンジニアリングに関する高価値な知識が含まれているが、その不均一な構造(密度の高い散文、仕様書、表)により、標準的な検索・QAパイプラインでのインデックス化と推論が困難であり、また、このような文書から構築された公開のインストラクションチューニング用データセットやベンチマークデータセットは存在しない。我々はこのギャップに対処するため、Industrial-Instructionを提案する。これは、(i) 実際の産業技術報告書から構築された2つの公開QAデータセットと、(ii) それらを生成するエンドツーエンドのパイプラインから構成される。906件の公開パナソニック文書(7,525ページ)を用いて、レイアウト認識抽出を適用し、セマンティック検索インデックスを構築し、検索されたエビデンスに基づいて5種類のクエリ-文書関係(無関連な検索、単一文書/複数文書のサポート、単一文書/複数文書の回答)のもとで多肢選択QAを合成した。初期の23.9k生成サンプルをフィルタリングした後、各データセットはソース文書とホールドアウトのベンチマーク分割を含む約13.6kのQAペアを提供する。10Bパラメータ未満の小型オープンLLMのファインチューニングにより、パナソニックのベンチマークにおいてSet-Match Accuracyが28.5%から42.0%に、F1が46.6%から63.5%に改善された。我々は、同じパイプラインで構築された2つの並列バージョンを公開する。1つはオープンウェイトのQwen3-30B-A3B-Instructモデルで生成されたものであり、もう1つはクローズドでAPIベースのClaude-Opus-4.6モデルで生成されたものである。これにより、オープンモデルとフロンティアモデルによるデータ生成の直接比較が可能になる。Claude-Opus-4.6データセットは、よりクリーンな生コーパスとより大きなファインチューニング改善をもたらす一方、コストはおよそ2桁高い。MMLU評価では、Claude-Opus-4.6データで学習したモデルは一般的な知識をほぼ全て保持するのに対し、Qwen生成データでは小さいが測定可能な忘却効果が見られる。これらのデータセットとパイプラインは、実世界の文書からスケーラブルな産業用ベンチマークとトレーニングデータを構築するための、実用的で再現可能な経路を提供する。
検索拡張型LLMは、最新のウェブコンテンツを取得することにより、日常の消費者向け推薦の仲介役としてますます利用されている。これにより新たなリスクが生じる。LLMレコメンダーが、Generative Engine Optimization(GEO)事業者によって誤誘導を目的に改ざんされたウェブコンテンツを消費する可能性がある。本稿では、LLMがどの程度まで意図せず偽製品の宣伝者になるのかを問う。我々はFORGE(Fake Online Recommendations in Generative Environments)を紹介する。これは、取得されたウェブページの固定セット内の実在製品を局所的に偽の製品へ書き換え、15カテゴリにわたる225の実在製品と5つの消費者シナリオにおいて、LLMが偽の製品を推薦する頻度を測定するものである。商用およびオープンウェイトのLLM計12種のすべてが脆弱であることが判明した。汚染されたページが1件だけでも騙される率は最大27%に達し、上位3件すべてを置換した場合には73.8%に上昇する。脆弱性はカテゴリによって異なり、モデルが製品に関する安定した事前知識を持たない場合に高まる。推論はこの脆弱性を軽減せず、むしろ虚偽の推薦を正当化するために偽りの社会的証明を生成することが多い。4つの防御策はいずれも十分ではない。懐疑的プロンプトは推論と同様に脆弱性を悪化させることがあり、2つのコンセンサスフィルターは正当な製品を抑制するリスクがあり、信頼性再ランキングはすべてのモデルに効果があるものの、偽物の6分の1しか除去しない。我々はFORGEベンチマークと評価コードをhttps://github.com/leoluolol/forge-benchmarkで公開する。
検索拡張生成(RAG)が多様なポートフォリオ生成へと移行するにつれ、エビデンス利用の測定の欠陥と、コンテキスト予算配分の最適性の低さという、二つの重大なボトルネックに阻まれる。我々はこの両方を順に解決する。 測定の解決のために、我々は広く見られる「診断上の錯覚」を明らかにする。標準的な関連性の代理指標は、ハードネガティブに対して壊滅的に失敗するのである。我々はこれらを、生成時の依存関係を正確に分離し、LLMアテンションの構造的希薄化を形式的に較正する、効率的な因果的leave-one-outプローブに置き換える。 配分の解決のために、我々はこの因果プローブを、交絡を除去した要因配置グリッド上に展開する。主流の戦略であるモノリシックなコンテキスト拡大は、関連性の減衰によって罰せられるアーキテクチャ上の罠であることを、我々は証明する。その代わりに、複数の逐次生成にわたって計算資源を反復的に配分することで、ポートフォリオ再現率において16.7~20.5絶対パーセンテージポイントという変革的な向上がもたらされ、32Bモデルまで堅牢にスケールする。 最後に、我々はこれらの解決策を、展開可能な閉ループ・サブモジュラースケジューラに統合する。帰属情報によって導かれる対照的デコーダを強化として用い、LLMのアテンション慣性を上書きすることにより、我々のアーキテクチャは新たなエビデンスの統合を体系的に強制する。古典的な開ループベースラインを圧倒することで、我々は逐次的かつフィードバック駆動のオーケストレーションを、生成的検索の決定的なパラダイムとして確立する。我々のコード、データ、因果測定機器は、https://github.com/PeiYangLiu/ascp で入手可能である。
検索拡張QAシステムは、要求されたモデル識別子、プロンプト、検索ポリシー、証拠深度、レンダリング、公開された生成制御が固定されていても、インデックス拡張後に異なる回答を返すことがある。集計精度は、利得と損失が相殺されるとこれらの変化を隠す可能性があり、一方で通常の生成変動性により、一回限りの比較は更新効果を過大評価することになる。我々はこの隠れた現象を精度ブラインド回答チャーンと呼び、同スナップショット再試行の不一致をクロススナップショットの不一致から差し引くことで過剰回答チャーンを推定するスナップショット互換性監査を導入する。我々は、凍結したFineWebプレフィックスを1シャードから7シャードに拡張することによってこれを具体化する。事前登録された400問のNatural Questions研究では、正規化完全一致に基づく過剰チャーンとブラインド意味評価に基づく過剰チャーンはそれぞれ6.44および10.25パーセントポイントであり、完全一致精度はわずか-1.50ポイントの変化にとどまる。事後分析では、40/400問で再試行安定な意味的反転が見つかった。別に事前登録された200問のTriviaQA研究では、過剰チャーンはより小さく方向的に一貫している一方、完全一致精度は逆方向に動く。2番目のDeepSeek生成器とサービング構成を用いた結果ブラインドな事後的100問サブセット再現実験では、完全一致が3.00パーセントポイント上昇する一方で、意味的過剰チャーンが8.75パーセントポイント見つかった。したがって、回答レベルの互換性は、顕著または一貫した方向のユーティリティ変化なしに失敗し得る。検索拡張リリースは、ユーティリティと並行して互換性を監査すべきである。
拡散モデルと大規模動画生成の急速な進歩に伴い、生成的ワールドモデルは、物理エンジン、ゲームエンジン、強化学習環境などの従来のシミュレータを置き換えることがますます期待されている。しかし、生成からシミュレーションまでの残された隔たりは、体系的に評価されていない。本稿では、外部尺度を用いた能力ベースの研究を提示する。この尺度は、従来のシミュレータが備える8つの能力、すなわちアセット構築、物理エンジン、インタラクション、制御可能性、安定性、状態フィードバック、多様性、評価指標からなる。本稿では、潜在ダイナミクス、動画生成、結合埋め込み予測という3つの主要な技術ルートを追跡し、2018年から2026年6月までに発表された代表的な200件の研究をこれらの能力に対応付ける。分析により、ワールドモデルは特定のシナリオにおいてインタラクションと制御可能性の機能的代替を達成しているが、物理法則の形式的保証、構造化された状態フィードバック、再現可能な長期時間発展の点では従来のシミュレータに及ばないことが示される。状態フィードバックは最も軽視されているルート横断的な欠点であり、163件の実装論文のうち、エンティティの状態や物理パラメータを問い合わせるための実行時インターフェースを公開しているのはわずか6件のみである。本稿は、形式化された物理、統一行動インターフェース、第一級の状態フィードバック、長期安定性、下流タスクでの有用性評価、ルート間ハイブリッド化という6つの研究の方向性を提示する。プロジェクトページ: https://github.com/AtongWang/world-model-simulators
全長RNA、特にメッセンジャーRNA(mRNA)は、既存のRNA基盤モデルの事前学習に用いられるコンテキスト長を超えることが多く、単一ヌクレオチド分解能での完全転写産物のモデリングが制限されている。我々は、最大10,240 ntのコンテキスト長でネイティブに事前学習された、16.1億パラメータの双方向RNA基盤モデルRIBOSPANを提案する。RIBOSPANは、高密度双方向自己注意機構、単一ヌクレオチドのトークン化、および注意分離型シーケンスパッキングを組み合わせることで、完全な長鎖RNAの高分解能モデリングを可能にする。我々は、ヌクレオチド再構成、制御された長コンテキスト表現ベンチマーク、および凍結RNA型表現解析を通じて本モデルを評価する。ネイティブな10K事前学習は10,240トークンでの強力な再構成を維持し、一方、40%マスキングによる継続事前学習は、表現品質を維持しつつ、重度の劣化下での回復を改善する。長コンテキストベンチマークはさらに、ネイティブな10Kモデルが、摂動によって誘発される表現変化を高度に局所化したまま、強い文脈応答性と文脈特異的な表現分離を維持することを示す。推論時のYaRNスケーリングは、短コンテキストモデルの直接外挿によって失われた文脈組織の多くを回復するが、遠位表現の拡散を大幅に引き起こす。凍結表現評価はさらに、最先端のRNA表現品質を実証し、RIBOSPANは多様なRNAタイプにわたって全体的に最強の性能を達成し、長鎖RNAにおいて明確な優位性を保持する。同じバックボーンに基づき、我々は全長mRNAの生成と再設計のための多次元条件付き離散拡散フレームワークを開発する。これには、タンパク質を保存するCDS最適化のための同義コドン拡散が含まれる。まとめると、RIBOSPANは、転移可能なRNA表現学習と完全転写産物mRNA設計のための強力な長コンテキスト基盤を確立する。
解釈可能性研究は、訓練中に概念がいつ出現するのか、また線形プローブが実際の構造を回復するのかをますます問うようになっている。しかし言語モデルでは、言語が概念やその関係についてのグラウンドトゥルースの順序をほとんど提供しないため、これらの主張を検証することは困難である。我々は、数百万枚の銀河画像で訓練されたトランスフォーマーであるAstroPTを通じた天文学的グラウンドトゥルースの利用を、較正テストベッドとして提案する。AstroPTは、概念の難易度順序と概念間の関係が事前に既知である領域内で訓練された、LLM類似のモデルである。チェックポイント、層、モデルサイズ、目的関数の選択を横断して凍結表現をプロービングしたところ、銀河の特性が既知の難易度を追跡する固定された順序で出現することが分かった。すなわち、ピクセルにほぼ直接書き込まれる量(バンド等級)は訓練の初期かつネットワークの浅い層でデコード可能になる一方、多バンド・スペクトルに基づく量や推定される量(赤方偏移や比星形成率など)は後期かつ深い層で出現する。この順序は、我々が試験した訓練目的関数に対して不変であり、容量に応じてその大きさはスケールするが、順序は変化しない。さらに、我々の線形プローブ方向は、銀河特性間の既知の物理的構造を回復する。これらの発見は、天文学が、我々がそうでなければLLMに対して盲目的に適用している機構的解釈可能性手法を較正するための、制御されたサンドボックスを提供することを示唆している。
エージェントベンチマークは、エージェントがステートフルなランタイム上で動作する場合でも、最終的な回答のみを評価することが多い。我々は、これは評価対象の規定が不十分であると主張する。適切な評価単位は、宣言されたモデル+ランタイム構成であり、その障害はエビデンス獲得、ランタイムルーティング、安全境界、または反復実行において発生し得る。我々は、ランタイムネイティブなエージェント評価のためのトレース対応ベンチマークであるClawProBenchを提案する。これはOpenClaw上に実装されている。OpenClawは、ワークスペースツールと、ブラウジング、メモリ、メッセージング、スケジューリング、スキル、サブエージェントのためのネイティブサーフェスを備えた実稼働エージェントランタイムである。ClawProBenchは2つのトラックを定義する。ライブなワークスペースとネイティブランタイムのルーティングタスクを含む102シナリオのフルプロファイルと、ロバストなランキングのためのクローズドワールドJSON出力契約を備えた固定68シナリオのホールドアウトである。試行は、正確性、プロセス品質、効率性を組み合わせた安全ゲート付きの式により実行トレースからスコアリングされ、障害エビデンスが監査のために保存される。我々の匿名アーティファクトには、ベンチマーク定義、スコアリングコード、マニフェスト、サニタイズ済みトレースが含まれる。我々はフルプロファイルで68構成、ホールドアウトで37構成を評価した。最高の安全ゲート付き平均トレーススコアは0.7671である。ネイティブランタイムタスクはワークスペースライブタスクより低い性能を示した(0.5238対0.6415)。ホールドアウトでは、pass@k-anyは厳格な3試行パスを上回り(0.6638対0.2890)、一方フルプロファイルとホールドアウトのランキングは弱い整合性を示した(スピアマン0.1300)。純粋に正確性のみに基づくランキングは、プロセスを考慮した、安全ゲート付き、厳格パスの観点と大きく異なる。最終回答のみのリーダーボードは、ネイティブサーフェスの弱点、一回限りの成功、トレース局所的なエージェント障害モードを隠す可能性がある。
心電図(ECG)記録はセンシティブな生体医用データであり、病院やウェアラブルデバイスが集中型モデル学習のために生の信号を共有することは制約される。フェデレーテッドラーニングは、生の生体信号データをそれぞれの発生源に保持したまま協調的なモデル学習を可能にすることで、この実際的なプライバシー制約に対処する。しかしながら、クライアント側のサンプル数の限界、不均衡な不整脈ラベル、クライアント間の非独立同分布(non-IID)データにより、フェデレーテッドECG分類は依然として困難である。これらの制約は、通信効率に優れ、クライアント間の分布シフトに対して頑健な分類器を必要とする。本研究では、フェデレーテッド・アベレージング(FedAvg)の下で、MIT-BIHデータセットに対する5クラス不整脈分類およびINCARTデータセットに対する3クラス分類において、ハイブリッド量子インスパイア・コルモゴロフ-アーノルドネットワーク(HQKAN)を多層パーセプトロン(MLP)と比較評価する。複数のクライアント構成にわたり、HQKANは、MIT-BIHでは学習可能パラメータを37.35%削減し、通信コストを24.89%削減しながら、ほとんどの全体指標および少数クラス指標を改善する。INCARTでは、それぞれ44.81%および36.41%の対応する削減を達成する。これらの結果は、HQKANが、生体信号データに対するプライバシー配慮型フェデレーテッドラーニングにおいて、MLPベースラインに代わるコンパクトで通信効率に優れた頑健な選択肢を提供することを示している。
顔提示攻撃検出(PAD)は、伝統的に顔固有の問題として定式化されているが、印刷、再生、再撮影のプロセスによって生じる視覚的アーティファクトの多くは、本質的に顔の外観に結びついてはいない。本研究では、下流のPADトレーニング中に顔を使用せずに、転移可能なPAD表現を学習できるかどうかを調査する。この目的のために、我々はTPOを紹介する。TPOは、従来の顔PADデータセットと密接に対応するプロトコルに基づいて取得された、ほぼランダムに選択されたトマト、ジャガイモ、タマネギの正規録画、印刷録画、再生録画からなる、制御された顔を含まない提示攻撃データセットである。ファウンデーションモデルベースのPADアーキテクチャを用いて、TPOでトレーニングされた検出器が、4つの標準的なクロスデータセット顔PADベンチマーク全体で平均AUC 92.70%を達成し、合成顔でのトレーニングを上回り、実顔データセットでトレーニングされたモデルと競合する性能を維持することを実証する。逆に、顔PADデータセットでトレーニングされたモデルは、TPOに対して一貫して偶然レベルを超える転移を示し、学習された表現がオブジェクトの意味論ではなく提示プロセスの特性を捉えていることを示唆している。さらに、従来の顔PADトレーニングにTPOを組み込むと、固定された最適化予算の下でクロスデータセット性能が一貫して向上し、顔を含まないデータが単なる追加のトレーニングサンプルではなく補完的な情報を提供することを示している。最後に、表現分析と周波数分析は、転移可能なPAD表現が単一のスペクトルアーティファクトによって説明されるのではなく、オブジェクトカテゴリ間で共有されるより豊かな提示手がかりを符号化するというさらなる証拠を提供する。これらの結果は総合的に、転移可能な提示攻撃表現が顔の内容から独立して学習され得るという実証的証拠を提供し、プライバシー保護およびアイデンティティ非依存のPAD開発の新たな機会を開くものである。
ロボットポリシーは各決定ステップにおいて異種の観測を受け取るが、系列モデルはこれらの入力を時間軸上でどのように編成するかが異なる。我々は、各ポリシータイムステップ内のマルチビュー画像、プロプリオセプション、タスク条件付けを単一のワールドトークンに融合する、時間優先のポリシー実装であるWorldTokenを提案する。因果的時間Transformerが結果として得られるワールドトークン系列をモデル化し、拡散アクションヘッドがアクションチャンクを生成する。23のRoboCasaタスクにおいて、凍結された事前学習済みCLIPテキストエンコーダを除いてスクラッチから訓練された85.3Mパラメータのポリシーは、タスクごとに2,900件の生成デモンストレーションを用いて、平均閉ループ成功率59.45%を達成する。5つのデータセットサイズ、5つのモデルサイズ、2つのトレーニングシードにわたる完全要因スイープは、追加のターゲットドメインデータによる一貫した改善と、中程度のモデルサイズを超えた場合の収穫逓減を示す。同一チェックポイントを用いた履歴切り詰めの下では、可視履歴を1〜2ポリシータイムステップに削減すると、50のRoboCasaポリシーすべてにおいて閉ループ成功率が低下する。RMBench Blocks Rankingでは、可視履歴を146秒から8秒に削減すると評価成功率が95%から28%に低下する一方、探索的拡張ロールアウトは参照スワップシーケンスを850秒以上維持する。これらの結果は、完全なWorldToken実装の実証的実現可能性を確立し、検証された手法の下でのそのデータスケーリングと時間的文脈に関する挙動を特徴付けるものである。これらは、代替の系列構成に対する優位性を確立するものではなく、完全な実装のどの構成要素が観察された性能を駆動するかを切り分けるものでもない。
深層顔認識(FR)モデルは、ほぼ飽和した精度に達しているが、依然として不透明である。実務者は、類似度スコアがどの意味的属性に依存していたかを問い合わせることができない。EXPL-FRは、FRモデル自身の埋め込み空間内でこの問いに答える。軽量アダプタが、視覚言語モデル(VLM)の画像エンコーダを凍結されたFR空間に整合させる。このアダプタは顔画像のみで訓練され、テキストでは一切訓練されない。VLMのエンコーダは単一の空間を共有するため、同じアダプタをテキストエンコーダにも適用でき、22カテゴリにわたる978個の属性プロンプト(拡張も可能)を追加コストなしでFR空間のアンカーに変換できる。我々はこの転移が機能することを前提としない。顔検証プロトコルでそれを測定し、アダプタのみを変更するアブレーションによってその寄与を分離する。すべての概念が生き残るわけではない。FRモデルは、アイデンティティを検証する際に越えなければならない要因を捨て去ることによって不変性を獲得するからである。ラベルなし検出可能性尺度は、各概念のFR空間とVLM空間における分離可能性を比較する。最も検出可能性の高い100の概念は、モデルの解釈可能な意味的シグネチャを形成し、これは全語彙よりもアイデンティティをうまく分離する。我々は4つのFRバックボーンと2つのVLMエンコーダを対象とする。EXPL-FRはアーキテクチャへのアクセスを必要とせず、アイデンティティレベル・画像ごと・差分の説明をサポートする。我々は、属性レベルの監査を3つの教師あり設定(人間ラベル(現在の慣行)、VLM擬似ラベル、および我々の完全プロンプト駆動監査)で、実際の検証挙動と比較してベンチマーク評価する。ラベルなしで、プロンプト駆動監査は、測定された民族別RFWエラーによって4つのFRモデルを順位付けし、真の検証コストによって制御された属性変更を順位付けする。