翻訳付きの日次キュレーションされたAI研究論文
我々は、成果指向のビデオ生成タスクであるSemantic Task Completion Video Generationを導入する。この定式化の下では、成功には意図した成果の達成と意味的グラウンディングの両方が必要である。意味的グラウンディングは、タスクに関連する高レベルの意味の観点から、参照画像と生成された成果の間の対応関係を特徴付ける。評価は生成された成果に焦点を当てており、中間タスクステップの完全な系列の提示や、参照画像との従来の外観一貫性を要求しない。体系的評価を支援するため、6つのドメインをカバーする評価データセットであるSemComp-Dataを構築する。各インスタンスは、参照画像、詳細な指示、簡潔な指示、および成果中心のビデオクリップから構成される。スケーラブルな4段階のキュレーションパイプラインは、生ビデオを標準化されたSemComp-Dataインスタンスに変換する。さらに、視覚言語モデル(VLM)を用いて構造化された二値質問に回答する評価プロトコルであるSemComp-Benchを導入する。SemComp-Benchは、成果達成と生成信頼性について、それぞれOAスコアとGRスコアを報告する。代表的なビデオ生成モデルを用いた実験は、意図した成果を達成しながら、参照画像におけるタスク関連の意味的グラウンディングを維持することが依然として困難であることを示している。
身体化エージェントは、エンドツーエンドのポリシーモデルが残すギャップを埋めるためにますます利用されている。しかしながら、エージェント指向のアプローチは物理的実行における閉ループ学習を未だ実現していない。既存のハーネスは大部分がオープンループのままであり、ロールアウト中は固定されたスキルに従い、エピソード完了後にのみ内省を行う。このような事後的内省は、実行が展開する最中の制御を司ることはできない。なぜなら物理的相互作用は、今日の大規模エージェントモデルの処理頻度を超えるレートで急速に変化するロボットと環境の状態を追跡するための意思決定を必要とするからである。我々はZettaを提案する。Zettaは、ベースポリシーを凍結したまま、コードベースの実行時クリティックと回復スキルをオンラインで進化させる閉ループ身体化ハーネスである。時間スケールが分離された3つのループを通じて、Zettaはアクション頻度の統制、ロールアウトレベルのクリティック・回復スキル提案、および検証ゲート付きスキル更新を提供する。エージェントのロジックを異種の実行リソースから分離するロールアウト基盤であるZ-Infraと組み合わせることで、Zettaは現在のロールアウト予算の下でLIBERO-ProおよびRoboCasaにおいて最先端の成功率を達成し、それぞれ90.8%と93.6%に到達した。さらに、推論速度は11.1倍に高速化された。成功率は自己探索による経験とともにスケールし続け、学習されたスキルはゼロショットで転移し、明確なロボットの「アハ体験」が出現する。これらの結果は、閉ループハーネスの自己進化が、信頼性の高い物理的知能のためのスケーリング経路を切り拓くことを示している。
プログラマブルロジックコントローラ(PLC)は産業プラントを稼働させており、大規模言語モデルはそのための独立したプログラム編成ユニット(POU)をすでに生成できる。そうしたロジックが既存のPLCプロジェクトへ統合され、その後正しく動作するかどうかは、限られたテストでしか確認されていない。我々は、従来のツールを組み合わせ、厳格な完了規則によって制御される、プロジェクトに基づく検証ゲート付きエージェントハーネスであるSemaPLCを提案する。モデルが自身の出力を十分と判断した時点で停止するのではなく、SemaPLCは、記録された外部チェックがそれを確認した場合にのみタスク完了を宣言する。これらのチェックは、仕様、コンパイル、およびライブランタイム上の動作を対象とする。既存のベンチマークに対応する117件の独立POUタスクでは、7つのモデルすべてにおいて最高の厳密検証合格率を達成した(平均72.6%)。一方、生成されたロジックが実際のプロジェクト内でコンパイルおよび実行されなければならない65タスクのプロジェクトコンテキストトラックでは、統合コンパイル、静的挙動、動的挙動のすべてで最高平均を達成した。3つの層のうち、動的挙動が最も示唆的である。これは、生成ロジックと参照ロジックをライブPLCランタイムにデプロイし、それらの実行トレースを比較することで測定する。すべての手法は静的スコアでは互いに10ポイント以内に収まるのに対し、動的スコアは、ベースライン群が22.4から31.4であるのに対しSemaPLCが52.2と、手法間を明確に隔てる。全体として、我々の検証ゲート付きハーネスは、すべての層で平均を向上させ、特にランタイムで最も顕著に向上させる。生成された制御ロジックが実際に動作するかどうかの信頼できる試験は、静的評価ではなく実行である。SemaPLCはhttps://github.com/midea-ai/SemaPLCでオープンソースとして公開されている。
強化学習(RL)は、言語モデルおよび視覚言語モデルにおける推論能力を向上させる強力な手法として登場したが、その最も顕著な成功は依然として正解ラベルによる監督(例:検証可能な報酬)に大きく依存している。このようなアノテーションは入手コストが高く、推論能力が人間が確実に評価できる範囲を超えて進歩するにつれて、その入手はますます困難になる。自己報酬型強化学習は、モデルが自身の生成結果から報酬信号を導出できるようにすることで、この依存を軽減する。しかし、自己生成フィードバックのみに基づく訓練は、既存のバイアスや非最適な行動を強化し、応答の多様性を低下させ、最終的には応答の均質化と訓練崩壊を引き起こす可能性がある。本研究では、協調的マルチエージェント訓練を通じて教師なし推論が出現し得ることを示す。我々は、パラメータを共有しない複数の分離されたモデルが、ピアからの報酬を用いたRLによって同時に最適化されるフレームワークであるCo-RLを紹介する。さらに、異種のモデルファミリ、サイズ、および言い換えた訓練サンプルを通じてコホートの多様性を高めることで、自己増幅フィードバックループを駆動する相関する誤りが低減されることを示す。この多様性は、推論性能を一貫して向上させ、行動多様性を維持し、訓練崩壊を緩和する。テキストのみおよびマルチモーダル領域の双方において、Co-RLはベースモデルおよび従来のラベル不要手法を一貫して上回り、正解ラベルを一切使用せずに、教師あり手法に匹敵またはそれを上回る性能を達成する。具体的には、Co-RLはLLM向けの7つのテキストのみのベンチマークで平均3.0〜8.6%の改善、VLM向けの4つのマルチモーダルベンチマークで平均2.3〜7.2%の改善をもたらす。コードはhttps://github.com/DrStranded/Co-RLで公開している。
近年の基盤モデルの進歩により、AI科学者は仮説生成やコード実行から原稿作成に至るまで、ますます完全な研究ワークフローを自動化できるようになった。しかしながら、ワークフローの網羅性だけでは、科学的発見が依存する完全なエビデンスへのアクセスは提供されない。既存のシステムは通常、テキスト、コード、ラベル、または事前計算された要約に基づいて推論を行い、科学的に決定的な空間的、時間的、クロスチャネル的、手続き的関係はエージェントにとって利用不可能なまま残される。本稿では、異種混在の生のエビデンスから直接、学際的研究を実施するエンドツーエンドのオムニモーダルAI科学者であるOmniScientistを紹介する。知覚層と、着想、実験、執筆のための3つの自律エージェントが決定論的パイプライン内で動作し、観察が研究ライフサイクル全体を通じて研究課題、実験的決定、最終的な主張を形成することを可能にする。コード内で着想、厳密性、主張の検証を実行することにより、本システムは新規性スクリーニング、統計的妥当性、実行の来歴、数値のトレーサビリティを保証する。我々は、5つの分野群、4種類の科学的エビデンス群、および画像、信号、音声、動画、3次元構造、軌跡、表、数式、グラフを含むモダリティにわたる36の実データ事例でOmniScientistを評価する。本システムは36事例すべてにおいて生データからコンパイル済み原稿までの全経路を完了し、参照推論バックボーンを用いて平均総合論文スコア6.3を達成する。事前計算されたスカラー特徴量のみを受け取るブラインド版とのペア比較において、直接知覚は7つの評価次元すべてを改善し、直接比較判定の85%で勝利する。これらの結果は、ライフサイクル全体にわたる知覚がエビデンスに基づく科学的発見に不可欠であり、広範な能力を持つAI科学者への実践的な道筋を提供することを示している。
継続的自己改善には、自己生成され、多様で、適応的な目標のプールが絶えず拡大し続けることが必要である。言語エージェントにおいて、既存の訓練環境プール(手作業で厳選されたもの、静的に合成されたもの、または固定検証器によるもの)は、学習器がスケールしても目標分布を固定したままにする。我々はSPADE(Self-Play in Adaptive Synthetic Executable Environments)を導入する。これは自己対戦強化学習フレームワークであり、単一のLLMが2つの役割を担う:完全で長期的な訓練環境をOpenAI Gymスタイルのreset()/step()インターフェースを持つ実行可能コードとして記述する環境設計器(Environment Designer)と、その環境内で行動することを学習する推論エージェント(Reasoning Agent)である。各環境は、状態を持つ多ターン環境(状態遷移、報酬関数、検証コード)であり、そのため単一のインターフェースで推論問題と多段階のエージェント的ツール使用の両方を扱える。推論エージェントのリグレットは、特権的ヒントがある場合とない場合の報酬の差を用いて推定される。このリグレット信号を最適化することで、環境設計器は、環境を達成可能に保ちながら、エージェントの能力の限界にある環境を標的とすることを学習する。広範な実験を通じて、成功に不可欠ないくつかの構成要素を見いだした:大規模な事前学習コーパスからサンプリングした文書に環境設計器を基づかせること、および蓄積された環境記憶を与えることである。30Bパラメータモデルにスケールすると、SPADEは、評価用に確保された8つの数学・科学・コード・推論ベンチマーク全体で最強の固定環境ベースラインを平均+5.3上回り、ツール使用設定ではBFCL-v4マルチターンで+5.7、ACEBench-Agentで+13.9向上させる。ゲーム設定では、最強ベースラインに対する差はモデルスケールとともに拡大する。環境設計自体を学習可能な構成要素とすることで、SPADEはオープンエンドな自己改善への具体的な一歩を踏み出す。
一段階逆合成はコンピュータ支援合成計画の中核的な構成要素であるが、その本質的に一対多の性質は、単一解による評価・ベンチマークプロトコルでは十分に捉えられていない。この問題に対処するため、多様で妥当な反応予測をより良く捉える堅牢な学習・推論パラダイムとして、Top-Kプロンプティングを導入する。我々は、C3LM(化学的制約整合言語モデル、Chemistry Constraint-Consistent Language Model)の学習のために、約4560万件の検証済み反応からなる超大規模データセットCREED-CCV-2+USPTO-XLを構築した。ChemCensorに基づく報酬と新規性指向の報酬を用いた微調整を統合することで、本モデルはOOD URSA-expert-2026ベンチマークにおいて最先端の性能を達成する。反応のユニーク性に関するさらなる分析は、LLMと従来モデルが相補的な反応空間を探索することを示しており、アンサンブルベースの逆合成システムの動機付けとなる。全体として、本研究の成果は、Top-Kに基づく妥当性を考慮した学習を、将来の堅牢なLLMベース合成計画のための実用的な新たな方向性として確立するものである。
オープンウェイト言語モデルは、ファインチューニング、量子化、枝刈り、統合(マージ)が行われるが、その来歴は文書化されていないことが多い。本研究では、データ不要のホワイトボックス系統検証を検討する。すなわち、重みだけから、互換性のある2つのモデルチェックポイントが祖先を共有しているかどうかを明らかにできるだろうか。 残差学習では、分岐出力の中に共有の恒等写像整合成分が生じるため、この構造だけでは祖先関係を確定できない。我々はこの成分を取り除き、残差ブロック間でチェックポイント固有の構造を比較することで、独立チェックポイントに対して較正された対称な系統スコアを得る。residual-MLPおよびGPT-2ベンチマークにおいて、このスコアはファインチューニング、LoRAマージ、枝刈り、量子化された派生モデルを、独立モデルおよび蒸留モデルから分離し(AUROC=1.0)、重みの祖先関係と行動的類似性を区別する。関数保存型チェックポイントロンダリング実験では、重み空間ベースラインはマージンを失うか失敗する。一方、我々のスコアは不変であり、GPT-2において最も近い頑健なベースラインよりも76倍高速に動作する。射影ペアリング信号は、6つの言語モデルファミリーおよびそれ以外にもわたって現れ、ケーススタディでは3つの関連する公開LLaMA-2チェックポイントと7つの無関係なチェックポイントを正しく識別する。これらの結果は総合的に、互換性のあるオープンウェイト言語モデルチェックポイントに対する、受動的でデータ不要の来歴信号を確立するものである。
JEPAスタイルの潜在世界モデルは、目標潜在変数へのユークリッド距離をモデル予測制御(MPC)のコストとして用いることができる。しかし、タスク変数の強力なデコードは、この特定のコストが候補行動系列を実際のタスク進行度によって順序付けることを保証しない。我々は後者の性質を決定メトリック整合性(decision-metric alignment)と呼ぶ。我々は、ランダムなプランに対する潜在表現と実測値の順位一致を測定するPlan-Real Spearmanと、交差エントロピー法(CEM)探索がその提案を集中させる際の同じ一致を測定するCEM-stage Spearmanを導入する。我々は、潜在距離が実コストの順位を保存するための十分条件を分析し、エンコーダ歪み、終端ロールアウト誤差、候補マージンを支配量として特定する。観察された経験的整合ギャップに導かれ、DA-LeWMはLeWMに逆力学ヘッドとデモンストレーション条件付き目標行動ヘッドを追加する。我々のすべての実験において、DA-LeWMは収束を加速し、LeWMよりも高いオンライン成功率を達成する一方、プローブスコアは類似したままである。これらの結果は、行動条件付き目的関数が、ユークリッドコストを用いるCEMベースの潜在MPCで使用される幾何構造を改善することを示している。
ループ型言語モデルは推論ベンチマークにおいて有望な結果を示しているが、エージェント的なツール使用におけるその可能性は依然としてほとんど未開拓である。我々は、モデルが複数のAPI呼び出しを調整し、中間状態を維持し、ツール相互作用間の依存関係を保持しなければならない合成的ツール呼び出し設定においてこの問題を調査する。API-Bank、BFCL、NESTfulを用いて、ネイティブおよび後付けのループ型言語モデルを評価し、整合した教師ありファインチューニング手法の下で訓練されたループ型モデルと非ループ型モデルを、推論時の反復深度を変動させて比較する。制御実験では、反復計算は一般に合成的かつ依存関係を考慮したツール使用に利益をもたらす一方、単独のAPI呼び出しではより小さくモデル依存の改善しかもたらさない。多段階ツール使用の精度は一般に反復深度とともに増加するが、適応的推論は必要な場合にのみ追加の計算を割り当てることで、より好ましい計算性能トレードオフを達成する。本研究の結果は、ループ型言語モデルが、合成的ツール使用ワークフローの信頼性の高い計画、調整、および実行を必要とするエージェントシステムにとって有望なアーキテクチャであることを示唆している。
一般的な事実は事前学習中により深く記憶され、稀な事実よりも長く削除に抵抗する一方で、既存のLLMアンラーニング手法は学習データの頻度に関係なく均一な勾配圧力を適用している。我々はAdaPop(Adaptive Popularity)法を提案する。本手法は、ローカルトークン信頼度と、外部プロキシ(例:Wikidataサイトリンク、LLM-as-Judge)から導出される事実ごとの人気度依存指数を組み合わせ、各エポックで保持ペナルティを調整する双対上昇コントローラによって忘却と保持のバランスを自動化する。3つのモデルファミリーと2つのベンチマークにおいて、AdaPopは言い換えクエリ下では競合手法より約5倍少ない忘却コンテンツの漏洩を示し、敵対的改変クエリ下では約1.6倍少ない漏洩を示した。さらに、内部指標による分析も行った。本手法では、忘却セットの隠れ状態が他の手法の場合よりもアンラーニング前モデルの状態から遠くへ移動する一方、保持セットの表現は近いまま維持される。
大規模言語モデル(LLM)向けの高品質な創作文章データは、依然としてストーリー中心のデータが主流であり、多様な創作形式の構造的・機能的慣習に従うモデルの能力を制限している。本稿では、ストーリー生成を超えた創作文章データの拡張のための、属性誘導型ジャンル拡張フレームワークを提案する。テーマ的多様性をジャンル形式の制御から分離することにより、本フレームワークは、人間が執筆したストーリープロンプトを多様な創作シードとして活用しつつ、手作業でキュレーションされたジャンル属性を用いて、明確な構造的・文体的・書式上の慣習を強制する。これらを組み合わせて、強力なLLMにジャンルに忠実なクエリ・応答ペアを生成させ、その後品質フィルタリングを施す。本フレームワークを適用し、ストーリー、ラップ、歌詞、脚本、ゲームデザイン、キャラクターデザイン、その他の創作形式を含む13の創作ジャンルにわたる5万件の事例からなるマルチジャンルコレクションを構築した。分布外文章作成ベンチマークおよび未評価ジャンル診断タスクにわたる実験により、本データでファインチューニングされたモデルは、ベースモデルや文章作成特化ベースラインだけでなく、既存の文章コーパスで訓練されたモデルをも一貫して上回ることが実証された。さらに、ジャンル数のアブレーションは、ストーリー中心の単純な拡張ではなく、制御されたジャンル拡張が、堅牢な創作文章能力の主要な推進要因であることを示している。
大規模言語モデルエージェントは現在、限定的なタスクを確実に実行できる。しかし、行動が累積的な結果をもたらし、環境がその選択に応答するような、長いホライズンにわたる効果的な意思決定を維持できるかどうかは、依然としてほとんど測定されていない。FM-Bench(Football Management Benchmark)はこれを測定する。LLMエージェントは、26のツールと約340〜400の意思決定ポイントを通じて、ゲーム内20年間サッカークラブを運営する。すべてのライバルと同じ予算でスカッドを編成し、選手を取引し、契約を交渉し、施設とユースに投資し、先発メンバーを設定し、解任し得る取締役会に対して説明責任を負う。一方、決定論的エンジンが毎年の結果を1つの最終スコアに累積し、そこにはLLM判定者も人間の評価者も存在しない。ソロトラックは15のフロンティアモデルのそれぞれを、固定されたスクリプト世界と対戦させる。アリーナは、同じモデル群をスクリプトアンカーとともに、1つの共有された20年世界に配置する。我々の知る限り、この規模での初の直接対決評価である。我々はスコアの背後にある6つの行動能力を測定する。3つのシードにわたり、15のモデルすべてがすべてのホライズンを完遂する一方、ブラインドのスクリプトベースラインはそのホライズンの大半で消滅する。claude-fable-5は平均スコアにおいてソロボードとアリーナの双方で首位となるが、それでもアリーナのタイトルは10のモデルの間で移り変わる。スケール、価格、ベンダーのいずれも順位を予測しない。順位はホライズンの終盤になってようやく確定し、最高の初回プレイの人間はモデルボードの最下位に位置するだけである。モデル間の差を生むのは計算量ではなく、マネジメント行動である。高得点のモデルは、終盤になると回収の遅い投資を減らし、現金を遊休させずに投資し続け、期限のかなり前から契約更新を開始する。一方、トークン消費は何も予測しない。どのモデルも、何百もの拒否された入札から市場の隠れた価格を学習しない。また、自己管理メモリは、増え続けるだけのアーカイブか、毎シーズン書き換えられるプランという、2つの対照的な様式で失敗する。コードはhttps://github.com/Analogy-AI/fm-benchで入手できる。
物理的相互作用の品質は変形物体操作の中核であるが、ほとんどのベンチマークはタスク成功率のみを評価している。ポリシーがタスクを完了しても、滑りを許容したり過度の圧縮を引き起こしたりする場合がある。主なボトルネックは、ポリシーが観測可能な接触観測値と、タスク全体にわたる独立した物理的グラウンドトゥルースを組み合わせた視覚-触覚データセットが存在しないことである。我々は、物理的相互作用を考慮した変形物体操作のための視覚-触覚データセットであるSoftVTBenchを紹介する。これには、4,000件のエキスパートデモンストレーションと、体積を有する変形物体および視覚的に一致する剛体ツインを含む50以上のアセットが含まれる。各エピソードでは、20 Hzにおいて、多視点RGB、二指触覚RGBとマーカー運動、プロプリオセプション、言語情報、二値および連続的なグリッパー動作を同期させる。さらに、評価者専用の有限要素法(FEM)状態も同期する。このデータセットに基づき、我々は固定の物体固有キャリブレーションを用いて変形考慮成功率(DSR)を定義するクローズドループベンチマークを構築する。DSRは、タスクを完了し、かつピーク正規化変形を許容範囲内に収めた場合のみ、ロールアウトを成功とみなす。Diffusion Policy、π_{0.5}、FastWAMにわたって、分布内の12構成すべてにおいて、変形許容範囲を逸脱する成功ロールアウトが存在し、各構成の成功の0.7~24%を占めた。分布シフトの下では、視覚-触覚バリアントは、6つのポリシー・スイート比較すべてにおいてタスク成功率が高く、5つにおいてDSRが高かった。一方、分布内での利点は混在していた。これらの結果は、触覚を利用可能にすること自体では効果的なマルチモーダル融合が保証されないことを示している。したがってSoftVTBenchは、ポリシーが成功するかどうかだけでなく、変形物体とどのように物理的に相互作用するか、そして触覚がその相互作用をいつ改善するかを研究するための共通の視覚-触覚リソースを提供する。
言語特異的適性(LSC)は、言語モデルの性能がプロンプトの言語に応じて良くなったり悪くなったりする現象である。言い換えれば、言語モデルは、同じ意味的クエリに対して異なる言語でプロンプトされると、異なる(そして潜在的に誤った)応答を出力する。従来研究では、これは言語間の意味表現の内部的な不整合に起因するとされている。現在、文献にはLSCに対処する主なアプローチが2つある:(1)すべてのクエリを英語経由で処理することで性能を向上させるが、言語の表現力を英語に制限する;(2)言語バランスの取れたデータでトレーニングすることで、言語間のモデル性能を均等化するが、全体的な性能を低下させる。本研究では、データ中心の視点から、HOTFIXR(Hardness Optimized Training data For Improving X-Lingual Reasoning)を導入する。これは、モデルを用いて学生モデルの多言語の弱点を調査・学習し、それらを軽減するデータを生成するデータ生成フレームワークである。HOTFIXRは、多言語の合成トレーニングデータを生成することで、多言語性能を向上させることができる。我々は、3つの分布内タスク、3つの分布外タスク、および4つの分布外言語で評価する。平均的に、HOTFIXRは(1)分布内性能を6.2%向上させ、(2)ファインチューニングによって誘発される破滅的忘却を分布外(OOD)タスクで3.7%軽減し、(3)分布外言語で7.1%軽減する。全体として、多くの実世界アプリケーションが多言語LLMを必要とする中で、我々の研究はLLMを多言語に熟達させる取り組みに貢献する。採択後、コードを公開する予定である。
LLMベースのエージェントは、ユーザーに代わってクラウドサービスにアクセスし、ツールを呼び出し、エージェントを起動することができる。セッション開始時に、エージェントの権限は設定されるが、その後は静的なままとなり、各リクエストは先行アクションを考慮せずに独立に評価される。エージェントは、その権限の範囲内で、委任されたタスクに反する行動をとったり、個別には許可されたアクションを組み合わせて禁止された結果を生み出したり、サブエージェントに権限を制限せずに委任したりする可能性がある。プロンプトインジェクションは、エージェントがそのようなアクションを実行する権限を持つ場合にのみリスクとなる。したがって、これはモデルだけの問題ではなく、認可アーキテクチャの問題である。Agentic Principal Chain(APC)は、あるプリンシパルから次のプリンシパルへの委任された権限を追跡する。APCは、蓄積されたセッション状態に照らして、6つの認可チェックを用いて各リクエストを評価する。APCは、委任されたスコープと予算を繰り越すとともに制限する。合成閉包を用いることで、APCは先行アクションと照合してリクエストをチェックし、禁止された組み合わせを防ぎ、モデルの外部で決定を強制する。我々は、APCの実装についてブラスト半径の単調性と合成健全性を証明する。合成健全性は、完全な制限セットと直列化された受理の下での禁止された組み合わせに限定される。我々は、InjecAgent、AgentDojo、ASBを含む3,154のインスタンスを評価した。我々の侵害モデル評価は、最初の正規のツール呼び出しの後にグラウンドトゥルースの攻撃呼び出しを挿入することにより、APCをモデルの挙動から独立にテストする。AgentDojoの外部漏えいは、4つのドメインすべてで75%~100%から0%に低下した。APCはInjecAgentのデータ窃取全544件をブロックした。意図バインディングにより、破壊は38.6%から4.0%に、操作は90.5%から12.1%に低減された。認可レイテンシは、アイドル状態のホスト上で99パーセンタイルが0.24 msであった。949のAgentDojoタスク-インジェクションペア全体では、ユーティリティは2つの設定でそれぞれ8.6および13.9パーセンテージポイント低かった。実装、評価ツール、およびデータは公開されている。
エージェントフレームワークは、手続き的知識をスキルとしてパッケージ化することが増えている。スキルとは、エージェントが必要に応じて読み込む指示ファイルであり、公開ライブラリには現在何千ものスキルが収められている。どのスキルを読むべきかは、このようにしてエピソードの途中でポリシー自身が下す決定となったが、それを訓練する既存のシグナルは存在しない。我々は、既定の対処法である候補スレートに対する成果報酬RLではこれを学習できないことを示す。その理由は構造的なものであり、我々はそれを特定し、セレクタークレジット飢餓(selector credit starvation)と命名する。ブロードキャストされるシーケンスレベルアドバンテージの下では、選択されたスキルを指定する少数のトークンは損失のうち消失的に小さい割合しか担わず、軌跡が長くなるにつれて、それらが受け継ぐクレジットは誤った符号を持つ度合いが増大する。その選択自体が軌跡の中で最も価値ある決定の一つであるにもかかわらず、選択後の実行が失敗する場合には常に、正しい選択であっても罰せられるのである。完了した実行の訓練アーティファクトを監査すると、これら3つの性質がすべて確認され、それぞれがホライズンとともに単調に悪化する。SkillGateはこの欠陥を構造的に排除する。すなわち、トークンサポートを互いに素な2つのクレジットチャネルに分割し、成果クレジットは実行トークンのみに到達させ、別のアクション局所アドバンテージはスキルを指定するトークンにのみ正確に到達させる。後者は、軌跡内の単一の読み出しが正しい場合にのみ正の値となる。16候補のスレートを用いた5つのエージェントベンチマークにおいて、SkillGateは90億パラメータのポリシーの試行成功率を40.8%から53.2%に引き上げる。これは、同一の予算を成果報酬のみに投入した場合を大きく上回り、誤解を招く候補への露出を3分の2削減し、読むスキル数も削減する。
音楽編集は、映画、放送、ゲーム開発などの分野への応用を伴い、現代の音楽制作において重要な役割を果たしている。近年の音楽編集システムの進歩により、音色変換、楽器置換、ジャンル変換など、多様な編集タスクが可能になった。しかしながら、既存の多くの研究は、編集時に変更されずに保持されるべき音楽的側面を保存する能力——我々が音楽コンテキスト保存(MuseCP)と定義するもの——の評価を見落としている。MuseCPを考慮した研究も一部存在するが、その評価プロトコルと指標は包括的ではない。この問題に対処するため、我々は初のMuseCP評価フレームワークであるMuseCPEvalを提案する。MuseCPEvalは、音楽属性の微妙な変化を捉えるための、きめ細かく適切に設計された指標を用いて、音楽的側面の4つのカテゴリを網羅する。客観的検証と人間による評価実験は、これらの指標の有効性を実証している。さらに、多様な音楽編集システムに関するケーススタディは、これらの指標が評価用テストベッドおよび診断ツールとして実用性を持つことを示し、既存システムの強みと限界に関する洞察を提供する。我々の指標と知見が、強力なMuseCP能力を備えた、より効果的で信頼性の高い音楽編集戦略の開発に実用的な指針を提供できることを期待している。
LiDARシーン補完は、自動運転における3次元知覚の主要な構成要素であり、下流タスクで利用可能であるためにはシーンをリアルタイムで補完する必要がある。既存の手法は通常、「初期化と精緻化」パラダイムに従う。これは、まずシーンの粗い初期化を構築し、次に完全な3次元形状へと精緻化するものである。生成モデルは、ランダムなガウス雑音をシーンへと反復的に精緻化するため低速である。一方、非生成的手法は、部分シーンを固定ノイズスケールで摂動させるため、大きなギャップや遮蔽領域の網羅性が制限され、新しいセンサ構成ごとに手動での再調整が必要となる。我々は、初期化自体を学習されたデータ駆動型の構成要素として扱うLiDARシーン補完手法であるRapidLiDARを提案する。我々は、各部分入力点に対して空間的に変化する変位を予測し、局所的な形状に適応した粗いシーン初期化へと部分観測を拡張する適応的初期化モジュールを提案する。これにより、手動によるノイズ調整は不要となる。この粗い初期化を完全で一貫性のあるシーンへと精緻化するために、入力スキャンから構築したマルチスケールの3次元ボクセルおよび2次元BEV特徴マップをクエリすることで点位置をさらに精緻化するマルチスケール再構成モジュールも提案する。最遠点サンプリングやk近傍探索などの点近傍演算子を、ボクセルおよびBEVベースの特徴抽出に置き換えることで、我々のアーキテクチャはより高速であり、設計上、異なる入力解像度を扱うことができる。SemanticKITTIおよびKITTI-360での実験により、我々の手法は最先端と同等の補完性能を達成しつつ、全シーンを0.1秒で補完でき、これは最速の従来手法よりも2.3倍高速であることを示す。これは、一般的な車載LiDARセンサの10Hzの取得レートに一致し、リアルタイムLiDARシーン補完への一歩となる。
トークンレベルの幻覚検出器は、各トークンを単一の信号から独立にスコアリングし、生成モデルが高い確信度で誤っている場合にまさに失敗する。本論文では代わりに、幻覚を時間的に拡張されたスパンとして扱い、系列ラベリングによって検出する。具体的には、モデル内部へ一切アクセスすることなく、各トークンは、テキスト統計、自然言語推論(NLI)の含意関係、および言語モデルのサプライザル(surprisal)を融合した33次元の特徴ストリームからスコアリングされる。この特徴ストリームを入力とする双方向ゲート付き回帰型ユニット(BiGRU)は、RAGTruth(10シード)でAUC 0.840を達成し、独立したロジスティック回帰ベースラインに対する11ポイントの向上を示した(p = 0.002、ウィルコクソンの符号付き順位検定)。制御された要因分解によって、この向上の大部分はモデル容量ではなく時間的順序に帰属されることが示された。すなわち、証拠はスパン内の確信的な位置から曖昧な隣接位置へと伝播する。同じ0.845という上限は、回帰型、状態空間(Mamba)、および注意機構の各アーキテクチャにわたって再現され、ボトルネックがモデルではなく特徴セットにあることを示している。本検出器は生成されたテキストと外部信号のみを読み取るため、クローズドソースモデルでも動作する。さらに、訓練時に一度も見たことのない言語モデルが生成したテキストに対しても機能し続け、AUCの低下は4%未満にとどまる。
物体検出器は、学習カテゴリの外にある物体に対して過度に高い確信度の予測をしばしば生成し、いわゆる分布外(OoD)ハルシネーションを引き起こす。そのようなハルシネーションを検出または軽減する既存のアプローチは、通常、学習済み物体検出器の表現に直接スコアリング関数を構築するか、物体検出器自体を変更してハルシネーションの発生を抑制するかのいずれかである。しかしながら、これらの表現に暗黙的に符号化された潜在的事前知識は、ほとんど探索されておらず、OoD検出のために明示的に復号されたことはない。これらの潜在的事前知識を発見し活用するために、我々は、事前学習済み物体検出器からOoD関連の事前知識を明示的に引き出す、ハルシネーションに焦点を当てたフレームワークであるStructured Prior Knowledge(SPK)を提案する。具体的には、SPKは、分布内データとハルシネーションを誘発するサンプルを、単に棄却や物体検出器の適応のために用いるのではなく、診断的教師信号として利用する。これにより、物体検出器の意思決定の根底にある部分レベルの意味概念を引き出す。引き出された意味的事前知識は、幾何学的事前知識および文脈的事前知識とさらに統合され、OoD検出のためのコンパクトな5次元SPK表現を形成する。多様な物体検出器アーキテクチャと複数のOoDベンチマークにわたる広範な実験により、SPKが最先端のOoD検出性能を達成することが実証された。我々の発見は、事前学習済み物体検出器が、OoD検出に通常利用されるよりもはるかに豊かな潜在知識をすでに符号化していることを明らかにする。さらに重要なことに、この知識は明示的に引き出され、予測信頼性解析のためのコンパクトで構造化され、解釈可能な知識空間に整理することができる。これは、潜在的事前知識を明示的に発見し活用することにより、物体検出器の信頼性を向上させる有望な能動的アプローチを示唆している。コードとデータは以下のURLで公開されている: https://gricad-gitlab.univ-grenoble-alpes.fr/dnn-safety/spk