翻訳付きの日次キュレーションされたAI研究論文
大規模言語モデル(LLM)は、その成功の多くを次トークン予測(NTP)に負っているが、自己回帰(AR)構造は、低速で逐次的なトークン生成を必要とする。このボトルネックを克服するため、我々は拡散拡張LLM(diffusion-augmented LLM)を導入する。これは、ARモデルの分布を定義しつつ、拡散を用いてその分布から複数のトークンを並列に抽出する新たなモデルクラスである。我々は、これらのモデルのパラメータを、標準的なNTP目的関数で訓練されるAR重みと、複数のトークンを同時に生成するように訓練される軽量な拡散重みの2つの集合に分離する。拡散重みは、既存のLLM訓練パイプラインに無視できるほどのオーバーヘッドしか加えない単純な拡散蒸留フェーズによって学習される。また、固定コンテキスト長でのロスレスな高速化と推論時スケーリングを可能にするサンプラ群Ψ-Specも導入する。投機的復号(speculative decoding)とは異なり、本手法は別個のドラフトモデルを必要としない。拡散LLM(d-LLM)とは異なり、基盤となるARモデルの品質を犠牲にせずに生成を高速化する。得られるモデルはUnoと呼ばれ、ゼロから訓練するか、既存のオープンウェイトAR LLMを拡張して構築できる。Unoは、評価されたすべてのバッチサイズにおいて主要な投機的復号手法よりも高いスループットを達成し、デバイスがサポートする最大のバッチサイズを含めて、ベースARモデルに対して最大3倍の高速化を実現する。特筆すべきことに、我々の8B Unoモデルは、エージェンティックなツール使用、コーディング、長文脈推論のすべての評価ベンチマークにおいて、主要なオープンd-LLMである26B DiffusionGemmaと、プロプライエタリなMercury 2を上回る。コードとチェックポイントはhttps://s-sahoo.github.io/uno/ で公開する。
推論モデルは自身のオン方策経験から改善できるが、この内部ループは脆い。終端検証器は信頼できるものの、与える教師信号は疎であり、一方で同一モデルによる密なガイダンスは、誤った確信を強化したり、学習を狭い解法モードへ過度に集中させたりする恐れがある。本稿では、検証器に基づく自己改善手法である FlowBalance を導入する。FlowBalance は、完全な応答上の正規化された分布を学習する。各オン方策軌道について、学習時に凍結された同一方策のビューが、特権的コンテキストを用いてトークンレベルの対数確率利得を生成し、これらを軌道レベルへ集約して自己ガイダンススコアとする。FlowBalance は、このスコアを検証器由来のグループアドバンテージによって較正する。すなわち、ガイダンスは、正のアドバンテージを持つ軌道では保持され、負のアドバンテージを持つ軌道では反転され、ロールアウトグループが結果の選好を与えない場合には無効化される。得られたエネルギーは参照方策を指数関数的に再重み付けし、プロファイル付き軌道バランス(profiled trajectory balance)は、ロールアウトグループごとの一回の対数分配関数推定によって正規化された目標分布を近似する。これにより、トークンレベルの模倣損失を別途要することなく、軌道バランスによる結果較正済み自己ガイダンスが実現される。解析では、グループ内コントラストの保存、逆KLに基づく最小変更としての特徴付け、検証器による目標報酬の単調制御、および棄却応答上の偽陽性自己ガイダンスに対する正確な補正が確立される。数学的推論において、FlowBalance は、Qwen3-4B と Qwen3-8B の両方で FlowRL の平均性能を上回り、学習速度と安定性も改善し、直接OPSDが示す応答長の崩壊を回避し、制御された AIME24 診断では正しい戦略の多様性がより高いことを示す。
我々は、インスタンス追跡と意味的発見のための、統一的でテキストプロンプト可能な手法ENEASを提案する。SAM 3などの最新の基盤モデルを含むテキストプロンプト可能なセグメンテーションモデルは、依然として時間的幻覚、空間的断片化、意味的誤分類を引き起こす。すなわち、物体が視野から外れたときに対象の不在を報告できず、極端なクローズアップでは対象全体ではなく局所的なテクスチャをセグメント化し、さらに視覚的特徴を存在論的現実よりも優先するため、彫像、絵画、映り込みなどの視覚的に類似した事物が対象エンティティとしてセグメント化されてしまう。 ENEASは、単一の手法で二つの機能を提供する。すなわち、特定の単一インスタンスの精密な追跡と高品質なセグメンテーション、およびテキストクエリが指定するすべてのインスタンスのオープンコンセプト発見であり、後者は意味的検証層によって解決される。 追跡では、従来は点によるインタラクションのみに制限されていた幾何学的にロバストなSeCアーキテクチャをテキストプロンプト用アダプタで拡張し、その時間的メモリを活用する。これにより、対象は一時的に視界から消えても保持され、妨害物体へドリフトすることなく、視野全体を占める場合でも完全なオブジェクトとして維持される。 発見では、検証層は高速な視覚埋め込みマッチングと条件付き視覚言語モデル(VLM)による精緻化を組み合わせ、曖昧な候補に対してのみ意味的推論を呼び出す。これにより、視覚情報のみのモデルでは区別できない存在論的誤りを除去しつつ、低遅延を維持できる。 3次元再構成を念頭に設計されており、そこでは単一の誤分類された妨害物体がアセットを損ない得る。ENEASは、ビデオ、広範なライブラリ、および時間的または空間的に順序付けられていないデータの集合に対して高品質な意味的追跡とセグメンテーションを可能にし、さらに、見た目は似ているが同一ではない「ドッペルゲンガー」から真のインスタンスを判別する能力を提供する。 コードとモデルは https://github.com/speridlabs/eneas で公開されている。
因果推論とは、データから処置または介入の効果を推定する実践である。従来の因果推論では、新しい問題ごとに専用のパイプラインが必要とされてきた。すなわち、まず因果メカニズムを提案し、それに適合する推定量を選択し、最後にそれを学習するという手順である。その一方で、機械学習の多くは、多様な設定やモダリティを横断して、基盤モデルというパラダイムへと移行している。基盤モデルとは、一度大規模に事前学習されたネットワークであり、ファインチューニングなしで新しいタスクに適用されるものである。因果基盤モデル(CFM)は、このパラダイムを因果推論にもたらす。CFMは事前学習済みのニューラルネットワークであり、平均処置効果などの因果量を、モデルの更新を必要とせずに、インコンテキスト学習を用いてまったく新しいデータセット上で推定する。本稿は、この新興分野への実践的な入門を提供するものである。CFMを議論する前に、因果推論と機械学習に必要な背景知識を整理する。また、本稿全体を通して、サンプルコードとJupyterノートブックを掲載する。
オンポリシー蒸留は、言語モデルを自身の生成出力に対して訓練し、教師がそれらをトークン単位で採点する手法である。これは、模倣学習の密な教師信号と、強化学習のオンポリシーサンプリングを組み合わせたものである。しかし、この手法には教師役となる、より大きな第二のモデルが必要である。オンポリシー自己蒸留(OPSD)は、そのコストを取り除く。OPSDでは、教師はモデル自身であり、テスト時に生徒が利用できない特権情報、例えば参照解、プラン、環境フィードバックなどを条件として与えられる。教師は生徒より強力なわけではなく、より多くの情報を与えられているだけである。初期の結果は有望であり、強化学習に匹敵する精度を、大幅に少ない生成トークン数で達成した。しかし、シグナルを生み出すその非対称性は、同時にシグナルにバイアスを与える。現在、この分野で支配的な失敗モードは崩壊(collapse)、すなわちモデルが生成可能な推論経路の集合が徐々に狭まる現象である。崩壊はOPSDに固有のものではないが、特権情報がそれを悪化させる。本レビューでは、崩壊を三つの操作因子によって支配される症状として扱う。すなわち、(i)シグナルが適用される場所、つまりトークンの重み付けの仕方、(ii)教師に示される内容、つまり特権情報の性質、(iii)シグナルが変化する時期、つまり教師のダイナミクスとガイダンスの減衰、である。本レビューは、本手法が生まれた領域であり、その失敗モードが最もよく記録されている数学的推論に対象を限定する。新たな実験の報告はない。その貢献は構造的なものである。すなわち、論文ごとに異なる名前で呼ばれてきた現象に共通の用語を提供し、確定している点と未だ議論のある点とを明確に区別することである。
視覚・言語・行動(VLA)モデルは、視覚観測と言語指示をロボットの行動に直接対応付けるが、長期的タスクには行動予測だけでは不十分である。エージェントは、物理的状態が変化していくなかで、知覚・計画・実行・進捗検証・復旧を統合的に調整しなければならない。行動予測やモデルが生成したスキル決定は、それ自体では、提案された操作が現在の状態で有効であることも、その結果が検証されることも保証しない。そこで本稿では、各スキル決定を「実行提案(execution proposal)」として扱う統合フレームワークEmbodiedSkillsを提案する。本フレームワークでは、ランタイムが実行前にその前提条件を確認し、実行後にその結果を検証する。共通の実行可能スキルインターフェースは、高レベルのスキル選択、範囲を限定した低レベルVLA実行、および行動後検証を、単一のエージェントループ内で接続する。このインターフェースは固定されているため、エージェントループを変更することなく、低レベルVLAポリシーの交換や適応が可能である。また、このインターフェースは、計画・実行・検証・復旧の各イベントを構造化された軌跡(structured trajectories)として記録する。この軌跡は、個々の構成要素に対する教師信号を提供し、インタラクティブなフィードバックが利用可能な場合には、オプションとしてのオンライン適応も支援できる。本稿では、RoboTwin 2.0およびLIBERO上で、Qwen3-VLとOpenPI/pi0.5を用いてEmbodiedSkillsを実装した。タスク適応済みの低レベルVLAポリシーは、RoboTwin 2.0の50タスク全体で平均成功率86.20%、LIBEROの4つのスイート全体で平均成功率97.40%を達成した。これらの結果は、EmbodiedSkillsで用いるタスク適応済み低レベルVLAポリシーの実行性能を実証している。一方、記憶に依存する4つのRMBenchタスクでは、同じタスク適応型の実行手法の平均成功率は12.5%であった。本フレームワークは、こうした低レベルVLAポリシーを閉ループの身体化システムへと転換するための、学習可能かつ検査可能なエージェント層を提供する。
オン方策蒸留(OPD)は、凍結された教師モデルが生徒モデル自身のロールアウトに対してトークンレベルの密な教師信号を提供することで、ポストトレーニングを加速する。バニラOPDは、各プロンプトに対して教師が信頼できるかどうかを確認せずに、この教師信号をプロンプト全体に一様に適用する。逆KLはモード探索的であるため、高い確信度で誤る教師は、強力でありながら誤った方向への更新を引き起こし得る。エントロピーや教師・生徒間の尤度一致などの分布的な代理指標は、不確実性や一致度を測定するものの、結果の正確性を直接検証するわけではない。本稿では、密な教師信号を導入する前に教師の信頼性をプロンプトレベルで検証すべきという原理に基づく、Teacher-Gated On-Policy Distillation(TGOPD)を紹介する。TGOPDは、検証器によってスコアリングされた少数の教師プローブから信頼性を推定し、各プロンプトを、信頼性チェックに合格した場合には密なOPDへ、それ以外の場合には検証器に基づくGRPOへと排他的にルーティングする。数学、コード、指示追従における4Bおよび35Bの生徒モデルを用いた実験では、TGOPDは全6つの単一ドメイン設定でバニラOPDを上回り、マルチドメイン学習では両モデル規模で7つのベンチマークの平均スコアをより高く達成した。またTGOPDは、さもなければアイドル状態となる教師側の計算能力を信頼性推定に利用することで、非同期OPDにおける教師側の計算資源の無駄を削減し、測定した4B単一ドメイン実行では教師ノードのGPU使用率を9.8%から78.9%へ向上させる。
要約や抽出型質問応答など、多くのNLPタスクは、文書から関連コンテンツを取得する問題に帰着する。その際には、カバレッジ(目標を達成するために十分な関連情報を保持すること)と簡潔さ(可能な限り多くの無関係な情報を除去すること)という2つの制約が存在する。コンフォーマル予測手法はカバレッジを保証するために用いられてきたが、簡潔さについては、スコア関数の設計を通じて最適化する必要がある。最先端のスコア関数は、モデルにコンテンツの重要度を評価させる手動設計のLLMプロンプトを用いるが、手動によるプロンプトエンジニアリングは労働集約的であり、タスク固有である。本稿では、インコンテキスト学習における事例の選定とアンサンブルを利用し、最小限の手動入力でカバレッジを維持しつつ簡潔さを向上させるスコア関数を構築する、Conformal Relevanceフレームワークを導入する。本フレームワークを7つのNLPタスクに適用して実証するとともに、アンサンブルされたコンフォーマルスコアに対する多様性の影響を理論的にも考察する。具体的には、アンサンブルが最悪ケースの文スコアを改善する条件を特徴付ける相補性条件と、アンサンブル改善に関する飽和限界を与える。
安全性アライメントは通常、トピックレベルの問いとして定式化される。すなわち、この主題は有害か、という問いである。しかし、実運用ではより狭い問いが課される。公民教育のチューターと公共部門向けアシスタントは、基盤モデルを共有しつつも、同一トピック内で異なる境界を必要とする。すなわち、標的とされた政治的誘導は拒否しつつ、同一の選挙に関する事実的な質問には回答する、という具合である。本稿では、これを狭境界安全性(narrow-boundary safety)として定式化し、制御付きトピック生成、カバレッジ修復、分布内補償データ、および訓練と評価のための有害–無害ペアを組み合わせた、オフラインの自己生成フレームワークを導入する。単回生成では受理可能な拒否トレースが得られないプロンプトが19.88%残るのに対し、段階的再試行(エスカレーション)では0.20%まで低減する。Qwen3-8Bを用いた政治的説得タスクにおいて、Escalateを通じて完成させた拒否データによる訓練は、対象ドメインの拒否率を9.47%から84.75%へと向上させ、3つのより広範な有害性ベンチマークにおける平均不安全応答率を26.26%から0.14%へと低減する一方、XSTestにおける過剰拒否率は2.00%から74.00%へと増加する。別のマッチド比較では、外部応答を検証済みの対象モデル応答に置き換えることで、過剰拒否率は15.20%から5.20%へと低減する。境界ペアデータは、保持ペアにおけるコンプライアンス側の過剰拒否率を32.94%から4.16%へと低減する一方、有害側の拒否率は91.88%から87.72%への僅かな低下にとどまる。これらの結果は、データ構成が安全性と実用性のトレードオフを制御すること、そして安全性アライメントは意図された拒否境界の両側で評価されるべきであることを示している。
大規模言語モデル(LLM)は、会話における生成と改訂の反復サイクルを通じて、ユーザーによる成果物の生成を支援することが多い。ここでの課題は、ユーザーが改訂時に局所的な変更のみを指定した場合、LLMは関連する依存関係を特定し、その改訂を成果物の影響を受けるすべての部分に伝播させなければならないことである。本論文は、成果物の文脈とその依存関係が会話履歴に埋め込まれている可能性がある、会話中に生成された成果物に対するLLMのこの能力を研究する。実用化に向けて、本論文では、この新しい設定における費用対効果の高い推論時計算(test-time compute)についても検討する。具体的には、この設定のための新しいベンチマークを導入し、gpt-oss-20b/120b、gpt-5.4-mini、qwen3.5-9b/27b/122bを用いて、逐次リフレクションや並列サンプリングの変種を含む9つの改訂手法をベンチマーク上で評価する。結果は、ベースライン手法が68.3%~93%の精度を達成し、最も費用対効果の高い手法が、3つの並列サンプルからLLMベースの選択またはメドイド選択のいずれかを用いて選択する手法であり、精度を2.2%~9.7%向上させることを示している。我々のコードとデータセットは、https://github.com/ntt-dkiku/llm-revision-propagation で公開している。
本稿では、観測可能なチャネルをテストしないままプライバシー評価に合格した、2ノード分割LLMトレーニングシステムに関するシステムセキュリティの事例研究を提示する。信頼済みローカルノード(TLN)は保護されたアクティベーションを非信頼クラウドノード(UCN)へ送信し、UCNはその出力を返す。プライベートな損失を保持するTLNは、出力勾配を返す。UCNが受け取るフレームは実データの行とデコイを混在させており、損失関数はデコイを無視する。したがって、デコイの勾配は正確にゼロとなり、そのゼロのパターンによってどの行が実データであるかが明らかになる。我々はこの漏えいを、事前に固定したプロトコルで測定した。すなわち、測定器がリークを検出できることを示すための既知の強度で注入されたリーク、存在しないリークを報告しないことを示すためのラベルシャッフル対照実験、そして実行前に設定されたしきい値である。9つのシードにわたって、ゼロのパターンはすべてのフレームで実データの行を特定し、各実行で4,096個中4,096個を特定した。フレーム内容に対する攻撃は、一定推測ベースラインと比較して100トークンあたり約1トークン多くを復元し(+0.65〜+1.50パーセントポイント)、シャッフル対照実験では何も復元されなかった。2回目の一連の実行では、モデル品質を予算内に保つ構成でこれを繰り返し、この知見が誰もデプロイしないような設定に限定されないことを示した。両データセットにおいて、そのようなすべての実行はフォワードチャネルのプライバシチェックと品質チェックに合格したが、返された勾配を評価に含めると、同じプライバシチェックに不合格となった。勾配の各行にクリッピングとノイズ付加を行うと、保持データの交差エントロピー約0.01 natsのコストでリークが遮断された。しかし、これによってシステムが安全になるわけではない。トレーニングステップをまたいで観測を蓄積する攻撃を含む5つの攻撃クラスは、一度も測定されていない。