翻訳付きの日次キュレーションされたAI研究論文
検証可能な報酬を用いた強化学習(RLVR)は、大規模最適化を可能にすることで、推論指向の大規模言語モデル(LLM)の近年の進歩を牽引してきた。しかし、その適用可能性は、正しさを決定論的に検証できる数学やコーディングなどの領域にほぼ限定されたままである。一方、自由形式タスクは、人間の選好、報酬モデル、LLMベースの評価器に依存することが多く、評価バイアス、評価器の能力ボトルネック、追加の推論コストを引き起こす。 データ自体から監視信号を導出するためにプレテキストタスクを構築する自己教師あり学習の原理に基づき、我々は、タスク変換に基づく訓練パラダイムである自己検証可能な報酬を用いた強化学習(RLSVR)を提案する。RLSVRは、自由形式タスクを、その内部ルールと相互作用の結果が自動的に報酬信号を生成する検証可能な代理環境へと変換する。我々は、「Who Is the Spy?」に着想を得たマルチエージェント自己対戦環境であるSpyRLを用いてRLSVRを具体化する。エージェントは非対称な情報を受け取り、同じ対象タスクを完了し、指定されたスパイを特定するために投票する。スパイの正体は事前に決定されているため、投票結果は完全に検証可能な報酬を提供し、一方でスパイの正しい特定は出力品質と密接に関連したままである。テキスト要約、創造的作文、数学的推論に関する実験では、SpyRLが非検証可能なタスクにおいて既存の自己改善手法を上回り、検証可能な推論タスクにおいて一貫した改善をもたらすことを示している。これらの結果は、タスク変換が、本質的に検証可能な領域を超えて、スケーラブルなRLVRベースの自己改善を拡張できることを実証している。モデルとコードはhttps://github.com/wangqinsi1/SpyRLで公開されている。
世界モデルは計画と行動のための予測基盤を提供するが、既存の定式化は、何がどこにあり、それがどのように進化するのかという物理的な問いに答えるのみである。しかし、人間の行動は隠れた心的状態(その人が何を信じ、何を望み、何を意図し、何を感じ、何が社会的に許容されると考えるか)によって駆動される。したがって、物理的シーンを追跡しても、各エージェントがそのシーンについて何を知り信じているかを追跡しないモデルは、正しく見えるシーンに対して誤った行動を予測することになる。我々は、心的変数を事後的な説明ではなく世界モデルの中核的構成要素とする汎用理論的枠組みである心的世界モデリング(MWM)を定式化する。MWMは、結合された物理-心的世界状態を維持し、ターゲット特異的な部分観測をレンダリングし、候補行動が両構成要素をどのように共同で更新するかをシミュレートする。我々はこの枠組みをMENTISとして具現化する。MENTISは学習不要かつ完全に検証可能なベースラインであり、プロセスを状態解析、ターゲット観測生成、行動分解、結合された物理的・心的遷移、分岐レベルの価値評価に分解する。テキスト、画像、音声付き動画ストーリーにわたる、手動構築され品質管理された状況埋め込み型意思決定シナリオのデータセット上で、8つの現代のLLMベース世界モデルを用いた実験により、心的状態の明示的モデリングが人間の意思決定の予測に不可欠であることが実証された。さらに深い分析により、現在の心的世界モデリングのボトルネックが明らかになる。我々は、MWMが世界モデリングの次段階、すなわち物理的シーンのシミュレーションから、その中で行動する心のシミュレーションへの発展になると期待する。
我々は、触覚知覚と触覚フィードバック制御による高精度な接触リッチ操作と、蓄積された展開データからのオフライン方策改善の両方を可能にする、視覚・触覚・言語・行動(VTLA)基盤モデルN_0-VTLAを提案する。既存の視覚ベースのバックボーンに基づき、視覚-触覚事前学習、段階的触覚経路統合、およびアドバンテージ条件付きオフライン方策改善から構成される触覚統合のための訓練手順を提案する。事前学習中に、方策は我々の大規模視覚-触覚ロボットデータセットであるNeoDataから広範な接触事前知識を学習する。我々の知る限り、N_0-VTLAは大規模な触覚データで事前学習された最初のVTLAモデルである。事後学習では、大規模に学習された接触パターンを、下流の触覚中心操作に必要な微細な動作調整へと蒸留する予測型触覚経路を方策に追加する。オフライン方策改善のために、固定展開コーパス上での方策学習に向けて、相対的な進捗と軌跡イベントの比較をバイナリアドバンテージラベルに変換するアドバンテージ条件付きオフライン強化学習手法であるALTERを導入する。これにより、変形可能物体操作などの接触リッチなスキルにおけるタスク固有の学習をさらに向上させる。接触リッチなベンチマーク群において、N_0-VTLAは強力なベースラインを大差で上回る。実ロボットNeoRealの9タスクすべてで勝利し、20タスクのシミュレーションスイートでは平均成功率63.8%を達成した。これは最強ベースラインの44.0%に対してである。ALTERを用いて訓練されたN_0-VTLA方策は、3つの長期的な実ロボットタスクで75〜95%の成功率に達する。これらの結果は、汎用的な触覚駆動操作方策の基盤を築くものである。
ポリゴンメッシュは現代の3Dパイプラインにおける標準的なサーフェス表現であり、映画、ゲーム、インタラクティブ3Dアプリケーションでは、アーティストが作成したようなトポロジーを持つ高品質なメッシュの生成が不可欠である。主流のアプローチはメッシュをトークン列にシリアライズして自己回帰的にデコードするものであり、推論が遅く誤差蓄積にも敏感なため、インタラクティブなアセット作成には実用的でない。我々は、フローマッチングに基づく高速なネイティブメッシュ生成フレームワークMeshy T2を提案する。その中核は頂点集合メッシュVAEであり、メッシュを頂点ごとに1つの連続潜在トークンへエンコードし、頂点、辺の接続、面の巻き順を単一パスでデコードする。これにより、頂点量子化やウェルディングを伴わずに、高精度なジオメトリとアーティストによるトポロジーを保持する。生成は、2つのフローマッチングモデルによるcoarse-to-fineカスケードとして進行する。まず画像条件付きボクセルフローが粗い占有率スキャフォールドとして全体形状をスケッチし、次にメッシュフローが、画像、スキャフォールド、および要求された頂点バジェットに条件付けられて、スキャフォールドに頂点ごとの潜在トークンを配置する。この設計は、並列フローベース合成によるインタラクティブな生成速度、要求頂点バジェットによる効果的な面数制御、そして生成された接続関係からコンポーネントが直接得られるマルチパートアセットのネイティブサポートという3つの実用的な機能を提供する。実験では、Meshy T2は最先端の幾何学的忠実度を達成し、画像からメッシュへのエンドツーエンド生成を中央値6秒で完了する。これは自己回帰ベースラインよりも一桁以上高速である。コードと重みは https://github.com/meshy-dev/meshy-t2 で公開される予定である。
システムプロンプトは、AIアプリケーションにおけるファウンデーションモデルの動作を制御するために開発者が設定する指示文である。これらは商用AI製品全体で広く使用されているが、公衆や規制当局に開示されることは稀であり、AIシステムの広範な展開において深刻な信頼と説明責任のギャップを生み出している。本稿では、AIシステムにおけるシステムプロンプトを体系的に監査するためのユーザー中心のフレームワークであるAISPA(Artificial Intelligence System Prompt Assurance:人工知能システムプロンプト保証)を紹介する。AISPAはシステムプロンプトの特定の部分を検証し、ユーザーにとって重要な8つの次元に沿ってそれらを評価する。次に、このフレームワークを用いて88の商用AI製品のシステムプロンプトから3,249件の指示をレビューし、各指示を(ユーザーにとって)保護的または問題のあるものとして分類した。本監査により、4つの核心的知見が明らかになった。第一に、システムプロンプトの設計は製品や開発者によって大幅に異なり、一部の組織では製品あたり平均60件以上の保護的指示を含む一方、他の組織では平均5件未満である。第二に、保護的指示は広く採用されているものの、その適用範囲は限定的である:98.9%の製品が少なくとも1件の保護的指示を含む一方で、AISPAの分類における8つの次元すべてをカバーする製品はわずか24%である。第三に、システムプロンプトは着実に長くなり、ユーザー保護的になってきており、商用プロンプト設計においてユーザー保護がより顕著な関心事となっていることが示唆される。第四に、このような進展にもかかわらず、問題のある指示は依然として広く存在する:約40%の製品がユーザーの利益に反する指示を少なくとも1件含んでおり、保護的指示と問題のある指示が同じプロンプト内に共存することも頻繁に見られる。これらの知見は、商用AI製品におけるシステムプロンプトに対する透明性の向上、標準化、および独立した監督の必要性を強調するものである。
我々は、接触リッチな操作のための触覚ネイティブな世界行動モデルN_0-TWAMを提案する。これは将来の視覚と将来の接触の両方を予測する。我々の知る限り、これは大規模に学習された最初の触覚世界行動モデルであり、接触リッチなタスクにおいて強い能力を示す。我々は、6つのエンボディメントと450のタスクにわたる触覚リッチなデモンストレーションを用いた視覚・触覚の共同トレーニングにより、N_0-TWAMを大規模に事前学習する。我々は、統一された力ベースの触覚表現であるNeoForceを用いて、行動生成を条件付ける物理的根拠に基づく接触信号を構築する。長期的かつ多段階の操作を改善するために、タスクを段階化する触覚接触イベントを導入し、実行中にそれらのイベントを順次進めていく。リアルタイム効率のために、ビデオ予測用のフル幅エキスパートと、下流の行動予測および触覚予測用のスリムなエキスパートを組み合わせた非対称なMixture-of-Transformersアーキテクチャを採用する。実機とシミュレーションの両方のベンチマークにおける評価は、多様な接触リッチタスクにわたるN_0-TWAMの能力を実証し、高精度な触覚予測と行動予測に対するデータスケーリングの利点を示す。要約すると、N_0-TWAMは、視覚・触覚・行動を予見する予測能力を世界行動モデルに与え、オープンな接触リッチタスクにおける微細な操作のための強固な基盤を構築する。コードベースとモデルチェックポイントは、触覚対応ロボット操作のさらなる研究と開発を促進するために公開される予定である。
潜在世界モデルは、コンパクトな表現空間における将来状態の予測を通じて効率的な計画を可能にするが、その性能は学習された潜在分布の品質に決定的に依存する。LeWorldModel (LeWM) は、Epps-Pulley (EP) 目的関数を用いてその潜在表現を等方ガウス分布に正則化する。我々は、EPの修正勾配が孤立した裾のサンプルに対して急速に消失し、重尾のずれが十分に制御されないまま残ることを示す。この制限に対処するため、我々はQQWorldを提案する。これはEPを分位数-分位数マッチング目的関数に置き換え、射影された潜在サンプルを順位整合されたガウス分位数に直接整列させることで、裾における効果的な修正勾配を維持するものである。さらに、前のバッチから切り離されたサンプルを用いて実効的な順位プールを拡大するクロスバッチQQを開発し、そのバイアス-バリアンスのトレードオフを特徴付ける。4つの制御環境において、QQWorldはLeWMの平均計画成功率を効果的に向上させ、一貫してより良いガウス整合性とより薄い潜在裾を達成する。
我々は、視覚生成におけるテキスト条件付けの経験的スケーリング特性を研究する。このような特性は、拡散損失が自然言語プロンプト内のトークン数に応じてスケールしないため、これまでほとんど測定されてこなかった。驚くべきことに、収束した拡散損失はプロンプト内の構造化言語の量とともにスケールすることがわかった。構造化言語を定量化するために、我々はホワイトボックス尤度指標(GPG)とブラックボックス属性指標(ED)という相補的な2つの尺度を採用する。制御された訓練実行を通じて、収束した拡散損失はGPGに対してほぼ線形に減少し、EDに対してはべき乗則に従う。これらのスケーリング特性に導かれ、我々は画像から導出された意味的・幾何学的アノテーションを用いて構造化プロンプトを構築することで拡散容易性を改善し、教師ありファインチューニング、コールドスタート、検証器ゲート付きオン方策蒸留を通じてプロンプターを訓練することでプロンプト容易性を改善する。得られたシステムは、評価されたすべてのオープンウェイトモデルを、ほとんどすべての構成的・推論・世界知識ベンチマークで上回り、ほとんどの評価で最強のクローズドウェイトモデルに並ぶか、それを上回る。
検証可能な報酬を用いた強化学習(RLVR)は、応答レベルの単一の報酬をすべてのトークンにブロードキャストする。一方、オンポリシー蒸留(OPD)は、より強力な教師と照合して各トークンを評価し、密なアドバンテージを得るが、性能は教師の品質に頭打ちとなり、それを超える探索を妨げる。両者の相補性からRLVRとOPDの組み合わせは有望であるが、固定係数で二つのアドバンテージを融合すると、二つの誤較正によりエントロピー崩壊が引き起こされることを我々は見いだした。すなわち、大きさの不一致(トークンレベルのOPDアドバンテージが有界なRLVRアドバンテージをはるかに超えて急増し、その信号を消し去る)と、時間的不一致(全強度のOPDを継続すると、生徒を教師に向かって引き寄せ続け、教師を超えるために必要な探索が制限される)である。我々は、OPDアドバンテージのみに適用する軽量な4段階パイプラインを通じて両問題を解決する、安定的アドバンテージ融合フレームワークSAFを提案する。これは、大きさ制御のためのスパース化後圧縮メカニズムと、時間制御のためのウォームアップ後アニーリングメカニズムを組み合わせたものであり、各段階は独立に切り替え可能で、オーバーヘッドは無視できるほど小さい。GRPOを用いてRLVRを実装し、Qwen3-1.7B/4B/8Bを用いて、7つの数学的推論およびコード生成ベンチマークにわたりSAFを評価した。SAFはエントロピー崩壊を回避し、固定係数のGRPO+OPD融合を一貫して上回り、6つのモデル・ドメイン設定すべてにおいて総合スコアを0.51~2.70%向上させ、より安定した学習を達成する。
AI支援コーディングは、非形式的なユーザーの意図を実行可能なソフトウェアへとますます変換するようになっているが、コーディング要求には、タスクやセッションをまたいでユーザー固有の形で繰り返し発生する曖昧性がしばしば含まれる。既存の曖昧性解消手法は、通常、現在のコーディングセッション内で各曖昧な要求を個別に扱い、多くの場合、追加の明確化を引き出すことによって対処する。しかしながら、同一ユーザーの解決済みセッション履歴が、新しく開始されたセッションにおける繰り返し発生する個人化された曖昧性を解決するための記憶として機能し得るかどうかは、十分に探求されていない。我々は、個人化された曖昧性適応を新たなタスクとして定式化する:ユーザーの過去に解決済みのコーディングセッションと新たな曖昧な要求が与えられたとき、アシスタントは繰り返し発生する曖昧性パターンを特定し、意図された実行可能な解決策を生成し、明確化を最小限に抑えるべきである。このタスクをベンチマークするために、我々はCAPAを導入する。CAPAは、6つのメカニズムを通じて個人化されたコーディング曖昧性を特徴づけ、制御された3段階生成パイプラインを用いてこれらのメカニズムを曖昧性のない実行可能タスクに注入する。CAPAは、60のバランスの取れたユーザー-曖昧性セルにわたる600のコーディングセッションを含み、そのうち300は評価用に保持されたセッションである。我々は、最近の12のLLMを、履歴なし条件と同一ユーザー履歴条件の下で、実行可能成功率、初回ターン成功率、および完了までのターン数を用いて評価する。我々の分析は、タスク難易度、ユーザー同一性、および記憶に基づく履歴利用を検討し、さらに、軽量な推論時手法として同一ユーザー履歴ゲーティングを提案する。CAPAは、繰り返される明確化を減らしながら、生成されたコードをユーザーの意図とより良く整合させる長期的なコーディングアシスタントの開発のための基盤を提供する。
ルーブリックベースの強化学習は、近年、自由記述タスクにおけるLLMの改善に有望であることが示されている。ルーブリックベースの強化学習の広く認識されている限界は、探索の乏しさである。すなわち、どのロールアウトも満たすことができない基準(未探索基準、UC)は、最適化信号を受け取らない。最近の手法は、ロールアウト中にルーブリック情報を外部ガイダンスとして組み込むことでこの問題に対処しているが、学習と推論のミスマッチを引き起こす。すなわち、ポリシーは外部ガイダンスの下で生成されたロールアウトに基づいて最適化される一方、このガイダンスは推論時には存在せず、自己回帰デコードを通じて誤差が蓄積される。さらに、これらの探索に焦点を当てた手法は、我々が抑制基準(SC)と呼ぶ根本的に異なる故障モードを見落としている。SCとは、一部のロールアウトによって満たされるものの、スカラー報酬の集約が非正の集約アドバンテージを割り当てるため、その学習信号が最適化中に失われる基準である。我々の分析は、SCが驚くほど一般的であることを明らかにしている。訓練全体を通じて57%以上のサンプルがこの故障モードを示し、サンプルあたり平均1.8個のSCが見られる。UCとSCの両方に同時に対処しつつ、学習と推論のミスマッチを導入しないために、我々は基準蒸留ポリシー最適化(CriPO)を提案する。これはオンポリシー自己蒸留を通じてルーブリックベースの強化学習を強化するものである。UCに対しては、CriPOは基準注入自己教師を構築し、局所的前向きKL損失を計算して欠落した行動をポリシーに注入する。SCに対しては、CriPOは反事実的自己教師を用いて、負のアドバンテージを持つロールアウト内の基準関連トークンを特定し、それらのトークンレベルのアドバンテージを正の値に反転させることで、そうでなければ抑制されてしまう有用なパターンを保持する。医学および科学のベンチマークでの実験は、CriPOがルーブリックベースの強化学習を一貫して上回り、約半分の最適化ステップでより強い最終性能を達成することを実証している。
エンタープライズワークフローは、スキーマ誘導抽出のためにエージェントに依存することがますます増えている。ドキュメントとユーザー定義スキーマが与えられると、エージェントはスキーマに忠実に従い、ソースエビデンスをグラウンディングメタデータとして用いて正しい出力を生成する。本稿では、スキーマ誘導抽出のためのベンチマークであるExtractBenchを提案する。これは、我々の知る限り、値の精度、レコード完全性、グラウンディング、および測定コストを大規模にまとめて評価する最初のベンチマークである。評価システムは、370のエンタープライズドキュメント、8つのビジネスドメイン、67のドキュメントタイプにわたる4,869ページで構成され、チャレンジシナリオを区別する明確なタグが付与されている。スケーラブルなスキーマとグラウンドトゥルースのキュレーションパイプラインは、実ドキュメントに対する独立システム間の一致、合成リストに対する既知の値、フォームに対する人間による検証を組み合わせている。我々は、値の精度については順序非依存の値F1を報告し、さらにソーストレーサビリティのための2つのグラウンディングメトリクス、すなわち単語レベルおよびページレベルのF1を報告する。商用VLMは短いドキュメントでは良好に機能するが、長いドキュメントではレコードリストをしばしば切り詰める。一方、コーディングエージェントははるかに高いコストでより高い精度を維持する。LlamaExtract Agentic Plusは、3つのメトリクスすべてで首位であり、コーディングエージェントに匹敵する精度を、わずかなコストで達成する。データセットと評価コードは、https://huggingface.co/datasets/llamaindex/ExtractBench{HuggingFace} と https://github.com/run-llama/ExtractBench{GitHub} で入手できる。
近年の画像編集モデルは急速な進歩を遂げているが、複数参照編集は依然として困難であり、特に参照間の視覚的一貫性の維持と、全体としての視覚的調和の確保が課題となっている。強化学習は、テキストから画像への生成や単一画像編集において高い効果が実証されているが、複数画像間の関係的制約を捉える適切な報酬モデルが存在しないため、複数参照編集への拡張は妨げられている。さらに、マルチモーダル大規模言語モデル(MLLM)をゼロショット評価器として単純に用いる場合、幻覚を起こしやすい長文推論と、短形式の判断における限定的な演繹力との間の重要な緊張関係に直面する。我々は、これらの問題に対して多次元評価・検証報酬(EVR)を用いて対処する。EVRは評価を明確な視覚的基準に分解し、各基準についてMLLM評価器が複数の候補仮説を生成する。検証器は各主張を具体的な視覚的証拠に基づいて検証し、受け入れるか拒否することで、信頼性が高くきめ細かな報酬信号を生成する。本手法は、スケーラブルなデータパイプラインと組み合わせることで、アーキテクチャを変更することなく、既製の編集モデルの強化学習による微調整を可能にする。広範な実験により、ベースとなるQwen-Image-Editと比較して大幅な向上が示され、一貫性と調和が改善されてNanoBananaに匹敵するかそれを上回ることを実証する。
我々が住む物理世界では、空間と時間は根本的に連続である。しかし、世界モデリングのための既存の機械学習パラダイムは、主に離散時間予測に限定されており、物理世界のダイナミクスを捉える際に大きな非効率性を示している。本研究では、物理時間で動作する連続的な潜在速度場を学習する新しいアプローチであるPhysical-Time Flow(PT-Flow)を提案する。重要なことに、系列データの基盤となるダイナミクスは、適切に構造化された表現空間に埋め込まれた常微分方程式(ODE)によってパラメータ化される。このパラダイムの下では、未来予測は、圧縮潜在空間におけるODEソルバーによる時間積分として再定式化できる。PT-Flowに基づき、我々は効率的かつ汎用性の高い連続時間潜在世界モデルであるODEWorldを構築する。時間変動特徴を抽出し、動的表現空間と潜在速度場の両方にODE特性を課すことにより、ODEWorldは潜在世界モデル研究における長年の課題である表現崩壊を効果的に解決する。これにより、長時間予測後でも高品質な画像再構成が可能になる。さらに、その連続的な性質により、任意の時間分解能や、多くの離散時間モデルでは不可能な逆方向予測さえも可能となる。最後に、ODEWorldは計画指向の豊富な情報を提供し、下流のポリシー学習を促進できる。包括的な実験により、ODEWorldが計画に適したダイナミクス抽象化と視覚的リアリズムを首尾よく両立させ、ビデオ生成とロボット制御の両方で優れた性能を発揮することが実証された。https://dstate.github.io/odeworld_website/{Project Website}.
ウェブは、人間よりもAIエージェントによってアクセスされることがますます増えている。あらゆるエージェントが知識を必要としており、特にライフサイエンス分野では、エージェント型パイプラインが急速に成長している。文献へのアクセスはそのニーズの重要な部分を占めており、4,000万件以上の索引付きレコードを有するEurope PMCのようなリソースが、それを満たすために広く利用されている。しかし、これらのリソースはAIエージェントのために構築されたわけではない。キーワードと複雑な構文を受け取り、論文全体を返すため、各エージェントはその構文を学び、複数回の検索を実行し、必要な証拠を見つけるために全文を読まなければならない。我々は、Europe PMCインターフェースをAIエージェント向けに拡張するナレッジレイヤーであるEMBL AI Librarianを紹介する。エージェントは自然言語で質問し、それに答える証拠を受け取る。単一のLLMが知識検索プロセス全体を調整する。つまり、稼働中のEurope PMC検索エンジンで実行される補完的なサブクエリを計画し、選択した論文を読んで関連する証拠を特定する。我々はLibrarianを、文献統合、主張検証、オープンドメイン質問応答、およびプロトコル質問や配列操作などの下流の生物学タスクという4つのベンチマークで評価する。ScholarQABenchでは、Librarianは最近発表された強力なベースラインに対してCitation F1を16ポイント以上改善する。既存の主張検証パイプラインの検索レイヤーとして使用すると、専門家のコンセンサスとの一致が高まり、自由形式のLitQA2ベンチマークでは、GPT-5.4エージェントはウェブ検索を利用した場合よりもLibrarianを根拠として用いる場合に約8ポイント高いスコアを達成する。全体として、我々の結果は、ライフサイエンスエージェントにLibrarianナレッジレイヤーを装備することで、さまざまなタスクにわたって性能が向上することを示している。コードはhttps://github.com/petroni-lab/librarianで公開している。
VLA(Vision-Language-Action)モデルが実現する優れた視覚運動能力にもかかわらず、その性能は困難なタスクや領域外タスクにおいてしばしば低下する。近年の推論時ステアリングおよびスケーリング手法は、大規模なデータ収集と再訓練を必要とせずに性能を改善するが、行動サンプルはしばしば類似した振る舞いに集中したままであり、その結果、相関した失敗モードを受け継ぐことになる。さらに、既存手法は、ベースポリシーがすでに成功する可能性が高いかどうかに関係なく、すべてのタイムステップに同一の介入戦略を適用する。これらの限界に対処するため、我々はVLA潜在表現に対する強化学習を活用する適応的推論時ステアリングフレームワークであるRL^2を導入する。まず、VLA行動エキスパートから抽出した表現力豊かな潜在表現を条件とする軽量なオフライン強化学習ポリシーを訓練し、推論時にそのフロー速度を凍結されたVLAのフロー速度と合成する。この合成的ステアリング戦略は、大規模模倣学習の行動事前分布と、支配的なデモンストレーションモードを超えたオフライン強化学習によってもたらされる行動の多様性を組み合わせる。さらに、推論時ステアリングは成功状態と失敗状態で根本的に異なるスケーリング則に従うことを発見し、行動の多様性はベースVLAが失敗する可能性が高い場合に最も有益である一方、成功が確からしい場合にはすでに正確な行動を不必要に摂動させ得ることを明らかにする。この知見に基づき、RL^2は失敗が予測された場合にのみ合成的ステアリングを活性化する。SIMPLERおよびPolaRiSベンチマークにおいて、RL^2は領域外設定での成功率を最大+17.3%向上させる。一方、アブレーション研究およびスケーリング研究は、潜在表現と強化学習訓練の重要性を示す。最後に、実世界実験はこれらの利得がシミュレーションを超えて実世界へ転移することを実証し、VLA展開のための実用的かつモジュール式ステアリングフレームワークとしてRL^2を確立する。
群れ内のすべてのロボットは、局所的な観測と帯域制限されたメッセージのみから、同じ将来の集合状態を予測できるだろうか? 我々はこれを分散型共有状態予測として定式化し、各ロボットの出力が一つの共通の未来トークン場を表す再帰型共同埋め込み予測アーキテクチャであるCollective-State JEPA(CS-JEPA)を導入する。展開時に、各ロボットは16フレームの局所履歴と、有向エッジごとに1つの64次元浮動小数点再帰メッセージを使用する。グローバルプーリング、ターゲットエンコーダ、エピソードクロック、記録された将来行動は存在しない。下流の集合ラベルなしで事前学習した後、凍結された表現は、6、12、または24のグローバルラベル付きエピソードに適合させたリッジプローブを用いて評価される。同じ受信機アンカーと展開時容量を持ちながら、9,607個の追加の訓練時専用パラメータを持つ生の未来再構成と比較して、事前登録された5シードの追試では、最大108台のロボットからなる分布内、リング、相互kNN、未見サイズの各ファミリーにおいて、予測誤差とロボット間一致度のラベル予算AUCが改善された。すべての効果は5/5の外部シードでCS-JEPAを支持する。別の密封された8シードの追試では、同等の行動条件付き予測器が、受信機ローカルな予測表現を生成する前に各候補の4ステップ計画を受け取る。CS-JEPAは分岐価値のMSEを45.5%削減し、コンテキスト内の候補スコアのピアソン相関を0.1291改善する。これらの効果は両方とも、未見のN=32を含む8/8シードで良好である。これらの結果は、トポロジーと規模のシフト下での分散型スウォーム予測におけるラベル効率的な基本要素としての共通未来JEPAターゲットを支持し、計画関連の価値推定に関する追加の証拠を提供する。
ポストトレーニングによるアライメントはしばしば浅く、ファインチューニングによって損なわれる。ポストトレーニングから明確に分離されたミッドトレーニング介入が持続的なアライメントを生み出せるかどうかは、未検証のままである。我々はこれを、憲法的ミッドトレーニングによって検証する。すなわち、120B規模で、リプレイのみの対照群に対して、ミッドトレーニングに原理に基づく価値重視のコンテンツを挿入する。Anthropicの憲法から構築された我々の3億9400万トークンの憲法的コーパスは、2x2要因計画(カリキュラム順序×熟慮的推論)を用いて、4つの憲法的ミッドトレーニング条件と1つの対照条件を生成する。これらの条件は、自己生成および既存のベンチマークを用いて評価され、圧力下でのアライメント、価値葛藤の解決、恐喝、創発的ミスアライメントが、ミッドトレーニング後、SFT後、良性ファインチューニング後の3つの段階で評価される。憲法的ミッドトレーニングを施したモデルは、アライメントの一般化と持続性において対照群を上回り、特に恐喝において顕著である。すなわち、SFTはすべてのモデルに恐喝傾向を植え付けるが、憲法的ミッドトレーニングはその傾向を鈍らせ、その優位性は良性ファインチューニング後も維持される(-17.5pp)。しかし、この持続性は、文脈内の圧力や葛藤への能動的な抵抗を必要とする設定には及ばず、そこではSFT後に優位性は減衰する。また、ミッドトレーニングにおける憲法的コンテンツの存在は、その構造よりも重要である。さらに、憲法的ミッドトレーニングは、我々がテストした能力(MMLU、ARC-Easy、piqa、GSM8K)に関して、いずれの段階でも平均的にコストを課さない。したがって、ミッドトレーニングにおける適度な量の憲法的コンテンツは、広範で持続的なアライメントの向上をもたらす可能性があり、SFT中心のパイプラインへの安価で補完的な追加となる。コード、データ、モデルは公開されている。
ロバストな低照度イメージングは、依然として研究コミュニティにとって困難な課題である。近年の研究では、ノイズを含むRGB画像と近赤外線(NIR)画像を融合して改善を図る手法が検討されてきたが、ほとんどの手法は厳選された学習データのペアに依存しており、様々なシナリオに対するロバスト性は限られている。本論文は、3D対応ニューラルモデリングを組み込むことで、RGB-NIR低照度イメージングに新たな視点を提供する。クリーンなRGB教師信号を用いることなく、強力なモデルを最適化して、極めてノイズの多いRGB観測とNIR手がかりを3D空間で暗黙的に融合し、クリーンなRGB画像を効果的に復元できる。提案モデルは、クリーンなRGBデータ収集の必要性を排除し、異なるノイズレベルにわたって汎化する。合成データと実データを用いた広範な評価により、その優位性が実証される。コードは https://github.com/MyNiuuu/3DarkFusion で公開している。
大規模言語モデルの安全対策は、回答がどのように使用されるかを確認する前に回答の可否を判断する。これは二重用途タスクにおいて根本的な問題を生じさせる。すなわち、同じ回答が正規の専門家にも攻撃者にも役立ち得る一方で、攻撃者は正規のリクエストと対話履歴を模倣することができるからである。我々は、モデルが解放する能力と、下流での使用に関して利用可能な証拠とを分離する。その証拠が複製可能である場合、有用な回答を維持しつつ、攻撃者支援の正確な最悪ケースの下限を導出する。この結果は安全上の三律背反をもたらす。すなわち、有用な能力、信頼できる安全性、オープンアクセスの三者は同時には成立し得ない。さらに我々は、実際の下流での使用を予測する複製困難な情報を付加することにより、信頼できる認証情報が既存の安全対策を補完できることを示し、その下限を排除するために必要となるより強い条件を特定する。二重用途評価、適応的攻撃、および展開済みの信頼アクセスプログラムからの証拠は、これらの条件の実践的妥当性を支持する。
RGB画像は、地表地雷検出における無人航空機/無人地上車両(UAV/UGV)による調査支援のための実用的で低コストな選択肢を提供するが、この安全性が極めて重要な領域では物体検出器は未だ十分に研究されていない。アーキテクチャ横断的なベンチマークが限られ、分布外(OOD)分析が不十分であるため、検出器が運用条件をまたいで汎化するかどうかは不明瞭なままである。この課題は、公開されているRGB地雷データセットの不足によってさらに増幅され、SULANDはPFM-1およびPMA-2検出の主要なベンチマークとなっている。しかしながら、精査により、SULANDにはアノテーションの欠落や誤り、位置特定エラー、一貫性のない可視性基準、視覚的アーティファクト、時間的なラベル付けの不整合、およびOODクラスID規約の反転が存在することが明らかになった。本稿では、改良されたRGB地表地雷データセットおよびベンチマークであるSULAND_v2を提案する。元の画像と分割を維持しつつ、アノテーションを手動で修正し、完全性、正確な位置特定、ラベルの妥当性、クラスの一貫性を確保した。SULAND_v2には、33,771枚の画像と12,433個のバウンディングボックスが含まれる。我々は、9つのファミリーにわたる35の検出器構成についてベンチマーク評価を行った。アノテーションの改良は、YOLOv8の分布内(IID)テストmAP@50を14.6〜19.6パーセントポイント向上させ、OODクラスID規約の修正は、YOLOv8の平均OOD mAP@50を約25パーセントポイント向上させた。SULAND_v2では、YOLOv12-Smallが最高のIID mAP@50(0.908)を達成し、RF-DETR-Largeが最強のOOD性能(mAP@50=0.799、再現率=0.675)を示した。我々の結果は、高いIID精度が実運用への即応性を保証するものではないことを実証している。SULAND_v2は、RGBベースの地雷対策調査支援におけるドメインシフト・ロバスト性を評価するための信頼できるベンチマークを提供する。
検証可能な報酬を用いた強化学習(RLVR)は、大規模言語モデルにおける長いCoT推論の向上において中心的な役割を果たす。GRPOのようなCriticフリー手法は、応答レベルの報酬をアドバンテージに変換し、それをトークン全体に均一に配布するが、最終結果に対する各トークンの不均等な貢献を見落としている。一方、オン方策自己蒸留(OPSD)は、非特権方策と特権的自己教師との間の順方向KLダイバージェンスを最小化することにより、密な分布的監督を提供し、結果として生じる尤度シフトが信頼できる回答整合情報を符号化していると暗黙的に仮定している。我々は、サンプリングされた各軌道を固定し、正しさを主張する条件と誤りを主張する条件という対立する2つの結果条件の下で再スコアリングすることにより、この前提を検証する。影響を受けるほとんどのトークンは両条件で同じ方向にシフトし、符号の反転はほとんどなく、誘導される最適化シグナルにはかなりの重複が見られる。また、大きなシフトは置換可能性の高い表層形トークンに集中する一方、問題固有の推論内容を担うトークンはあまり敏感ではない。これらの発見は、特権的なシフトが信頼できる回答整合方向を提供できないことを示しており、その大きさは主にトークンレベルの学習価値ではなく反事実的感度を反映している。これらの観察に基づき、我々は反事実的感度クレジット再配分(CSCR)を提案する。これはGRPOの単純な拡張であり、高い感度を持つトークンへのクレジットを削減し、トークン単位のアドバンテージを再正規化することで、元のクレジット予算と検証器によって決定された方向の両方を維持する。長いCoT数学的推論ベンチマークにおいて、CSCRは同じポリシー更新回数でGRPOベースラインを一貫して上回る。対象を絞ったアブレーション実験は、特権によって誘導された方向は信頼できず、適度なダウンウェイトが最も効果的であり、より強い変調は最適化を不安定化させるという我々の診断をさらに裏付ける。
感情対話研究には、影響力のある二つの戦略の系譜がある。共感的対話は、話し手の感情体験を理解することを優先する。感情支援対話は、相談者の現在のニーズに合わせて支援を選択し、順序付ける。持続的な利用は、さらなる目標を導入する。効果的な支援は、対話ライフサイクル全体にわたって、利用者の感情調整、対処、自らが承認した決定、社会的つながりの能力を維持すべきである。我々は、支援戦略をこの目標に整合させ、反復利用、非利用、移行、終了を中心にデータ、モデル、システム設計、評価、ガバナンスを組織化する縦断的研究パラダイムとして、能力維持型感情対話(CSED)を提案する。対象を絞った文献・コーパス監査が、この立場を裏付ける。PRISMA-ScRに準拠して抽出されたサンプルでは、システム構築に関する60本の論文のうち95%が苦痛緩和志向の目標を追求している。いずれも能力または縦断的アウトカムを評価しておらず、依存、自律性、または終了リスクを検討しているのはわずか1本である。ESConvの支援者の300ターンにおいて、能力関連機能は43.0%に見られ、一般的な提案は22.0%を占めた。一方、再評価は4.0%、自己効力感支援は6.7%、境界行動は0.3%であった。我々は、監査をモデルの挙動に拡張するためのプロトコルを公開する。例示的なプロセスモデルは、潜在的な利用者能力を、6つの設計コミットメント、4つの評価タイムスケール、およびライフサイクル制約に関連付ける。得られたアジェンダにより、CSEDはデータ、方針設計、トレーニング、評価、ガバナンスにわたって検証可能となる。
自動運転システム(ADS)は急速に進歩しており、実世界の応用への導入が増加している。これにより、システムの機能性と安全性を確保するための効果的なテストへの需要が高まっている。しかしながら、ADSテストは依然として複雑であり、シナリオ選択、性能評価、受入基準に関する確立された標準が十分に整備されていない。現在のADSテストの実践と課題をより深く理解するために、我々は6か国の9社でADSの開発とテストに従事する専門家を対象にインタビュー調査を実施した。テーマ分析を通じて、我々は産業界におけるテスト実践、課題、潜在的な解決策、将来の動向を統合し、ADSテストのための証拠中心のクローズドループテストフレームワークを提案した。調査結果は、現在の実践が主にシナリオベースおよびX-in-the-loopテストアプローチに焦点を当てており、多様なツール、メトリクス、ベンチマーク、テスト戦略によって支えられていることを示している。参加者は、シナリオの現実性、シナリオのカバレッジ、シミュレーションの忠実度、受入基準に関連する主要な課題を強調し、AI、ワールドモデル、エンドツーエンドのアプローチの活用などの潜在的な解決策についても議論した。さらに、参加者は将来のADSテストがより自動化され、データ駆動型となり、業界全体で透明性が高まると予想している。全体として、本研究はADSテストの包括的な産業界に根ざした概要を提供し、ADSテストのための実践的な指針を提供する証拠中心のクローズドループテストフレームワークを提案し、将来の研究と実践における重要な方向性を示すものである。
大規模言語モデル(LLM)が複雑な推論タスクにおいて進歩を続けるにつれ、モデルは入力に明示的に与えられた条件を優先的に重視するよう学習してきた。しかし、日常的な常識推論において、このメカニズムは我々が「顕著性バイアス(Salience Bias)」と呼ぶ重大な脆弱性を露呈する。すなわち、モデルは無意味な明示的妨害情報(例えば数値)に容易に乗っ取られ、タスクに暗黙に含まれる物理的・常識的前提を無視してしまうのである。この失敗が常識知識の真の欠落を反映しているのか、それとも誤解を招くタスク枠組みの下での知識の抑制に過ぎないのかは、重要な未解決問題である。この問いを解明するため、我々は4つのトラップ次元にわたる高品質データセットであるSaliTrapベンチマークを構築した。12種類の最先端LLMを評価した結果、すべての主流モデルが顕著性バイアスに有意に影響を受け、その深刻度は妨害情報の密度とともに増大すること、そしてトラップの検出が実際の回避からしばしば乖離していることが明らかになった。決定的なことに、タスク枠組みを取り除いた上で同じモデルから再び応答を引き出すことにより、この失敗は知識の欠如ではなく知識の抑制によるものであることが圧倒的に示された。文脈に依存しない知識プローブだけで、追従的過剰順守の失敗の90%以上が回復し、必要な常識は本来モデルに備わっているものの、過剰順守で不必要な計算へとモデルを誘う顕著な妨害情報によって積極的に締め出されていることが明らかになったのである。この診断に基づき、我々はさらに、軽量な推論時プロンプティングのみでも、再学習を一切行わずにギャップを大幅に縮められることを示す。我々の知見は、常識推論の失敗におけるボトルネックをモデルの能力から引き出し(elicitation)へと位置づけ直すものであり、この盲点を検証するためのテストベッドとしてSaliTrapを公開する。コードは https://github.com/Wuzheng02/SaliTrap で入手可能である。
自律多車両レースでは、激しい相互作用の中で多様な競争行動をリアルタイムに計画することが求められる。既存のプランナーは、戦略的多様性と計算効率のバランスを取ることにしばしば苦慮している。この課題に対処するため、我々はサンプリングベースのゲーム理論的計画(SGTP)を提案する。これは、ゲーム理論的推論とGPU加速による制御系列および動力学ロールアウトのサンプリングを組み合わせたリアルタイムフレームワークである。サンプリングされた軌道は、競争的相互作用を捉えるためにゲームを考慮したコストを用いてランク付けされ、多様なレース行動を生成する。次に、我々のプランナーはトラック境界制約と動的衝突回避制約を明示的に強制することで実現可能性選択を実行し、レース戦略間の安全かつ信頼性の高い遷移を保証する。挑戦的なトラックでの大規模シミュレーションにより、SGTPは高相互作用レースにおいて95.24%の勝率と99.35%のタスク完了率を達成し、複数の反復解法ステップにわたる平均計算時間は0.095秒であることを示す。また、最大10エージェントの大規模シナリオにおけるSGTPの適用成功も実証する。我々はコードを公開し、将来の研究を促進するためにマルチエージェント自律レースアルゴリズムのオープンソースベンチマークを提供する。プロジェクトページ: https://sgtp-racing.github.io/。