翻訳付きの日次キュレーションされたAI研究論文
展開可能な操作ポリシーの学習は、高忠実度かつスケーラブルなデータの不足によってボトルネックとなっている。実ロボットの遠隔操作は正確だが、拡張にはコストがかかる。一方、ロボットを用いないUMIデータ収集は容易にスケールでき、現在の慣行では得られたデータを主に事前学習に用い、事後学習で少数の実ロボットによる「アンカー」を追加している。本研究では、実ロボットの割合を減らすのではなく、ロボットを用いないUMIデータの忠実度を高めることで、そのアンカーを不要にできるかどうかを問う。我々はHiFi-UMIを提案する。これは、軌跡精度、グリッパー間の相対姿勢、同期、視野を共設計したポータブルなUMIデータ生成システムである。具体的には、ヘッドマウント型オフラインステレオ慣性SLAM、再構成ではなくネイティブな相対姿勢、共有マイクロ秒GPIOトリガー、各ハンドに約200度をカバーする2台の広角カメラを備える。外部トラッキングインフラなしで、作業空間内で3mmのエンドエフェクタ精度を達成する。本データ群を用いて、ロボットを介さない事後学習(ゼロロボット事後学習)を実証する。HiFi-UMIの実演データのみで事後学習したポリシーは、実ロボットに直接展開可能であり、視覚-言語-行動ファミリーと世界-行動-モデルファミリーにわたる3つのバックボーンにおいて、同一ドメインの遠隔操作と同等の性能を示す。StarVLA-QwenPI、OpenPI-pi_0.5、LingBot-VAでの成功率差はそれぞれ-2.5、+3.1、-0.6パーセントポイントである。最も強力なポリシーは精密挿入タスクで85%の成功率を達成した。ただし、遠隔操作ベースラインは評価シーンで収集されており、HiFi-UMIの軌跡は評価シーンでは収集されていない。同一データ群からの4,000時間の事前学習により、未見の10タスクにおける行動誤差を41%削減し、StarVLA-QwenPIでは実ロボットの成功率をさらに18.1パーセントポイント向上させる。我々はHiFi-UMI-2Kをオープンソースとして公開する。これは2,000時間のマイクロ秒同期・超広視野角の実演データであり、各データは自動的に再構成され、シミュレーションリプレイによって検証済みである。これはロボット学習コミュニティのための大規模・高忠実度リソースとなる。
関連性とは、文書や抜粋に有用な証拠が含まれているかどうかをクエリに依存して推定する指標である。既存の検索エージェントは、この関連性を用いて上位k件のコンテンツを選択するが、文書レベルの関連性だけでは、複雑な質問に必要な証拠の特定、構成、検証を行うことはできない。直接コーパス対話(DCI)は、grep形式の探索を通じてこのような細粒度の操作を可能にするが、関連性を考慮しない検索では有用な手がかりが後半に現れ、収束が遅れる可能性がある。近年の進展では、関連性を利用してコーパスを作業空間に絞り込み、対話を行う手法が提案されている。しかし、対話を開始した後も、関連性はgrepが最初にどの文書を検索するかを直接指示したり、広範な一致結果の中から有益な抜粋を識別してLLMに最初に提示したりすることはない。本稿では、関連性を考慮したRipGrep検索エージェント(RARG)を提案する。RARGは関連性をコーパス対話の実行時事前情報として利用する。RARGは粗密の関連性ガイダンスを提供する。すなわち、逐次的なripgrep走査のために文書を順序付け、大域的に重要な手がかりを早期に提示し、クエリに関連するパラグラフで有望なエントリポイントを初期化し、grepの一致結果を再順位付けすることで、文書レベルのランキングでは見逃されがちな有益な抜粋を表面化させる。挑戦的なブラウジング型質問応答や推論集約型検索において、RARGは検索ベースエージェントおよび直接対話エージェントと比較して、精度と効率のフロンティアを改善する。これらの結果は、関連性を考慮した対話がより高速で信頼性の高い検索収束を実現することを示している。
编码代理不断搜索、导航并保留来自不断演进的代码仓库中的上下文,然而,断连的索引、语言服务器以及仅限局部任务的历史记录迫使进行重复性发现,并掩盖了生命周期成本。CodeNib 针对每个仓库提交构建了可复用的词汇、稠密与结构视图,将输出映射到仓库相关的源码范围,在编辑过程中维护选定视图,并通过单一运行时提供排名搜索、符号导航及有界上下文。在100个快照中,我们勾勒出跨仓库上下文生命周期的质量-成本边界。当输出与独立重建相匹配时,图更新与向量更新的中位数速度分别提升8.7倍与25.4倍。在与标准化实时服务器位置匹配的静态导航子集(占1000个请求的63%)上,每个请求的实时/静态延迟比值中位数为4.7倍。在五种模型上,选定的上下文策略可保留定位能力,同时与配对的 grep/read 相比,轨迹令牌减少50%–87%。综合来看,这些结果支持具有明确、操作特化有效性边界的多视图仓库上下文服务。
ラスタ画像から編集可能なデザインファイルを復元することは、現代のデザインワークフローにおいて一般的かつコストのかかるボトルネックであるが、編集可能性がタイポグラフィ、ベクタージオメトリ、色、グループ化、レイヤー順序といったマルチモーダル属性の復元に依存するため、依然として困難な課題である。本稿では、ReDesignを提案する。これは、モダリティ横断的に専門的なツールを選択・構成して編集可能なレイヤー階層を成長させるエージェント型フレームワークである。不完全なツール出力にもかかわらず、この長い決定プロセスを信頼性高く維持するために、各拡張時にグレースフル検証を導入する。これにより、局所的な受理、枝刈り、再試行のフィードバックを提供し、誤差の蓄積を防ぎ、大規模な再実行を回避する。大規模な編集可能性を評価するため、909個の生のFigmaファイルと14,796件の制御された編集命令から成るFigma編集リプレイベンチマークを導入し、復元された出力に対して編集をリプレイする。このベンチマークおよび標準的な復元評価指標において、ReDesignは高い視覚的忠実度を達成するとともに、レイアウト、色、テキスト編集において最高の編集可能性を示し、レイヤー分解ベースラインや逐次的ツール使用パイプラインを凌駕する。
オン方策蒸留(OPD)は、生徒自身の軌道にトークンレベルの教師信号を基づかせるが、プレフィックス失敗という問題を抱える。すなわち、生徒が誤った推論方向に進むと、それ以降の生成はすべてその逸脱を基盤として構築され、誤った方向の続きを生成して信頼できない教師信号を引き起こし、計算資源を無駄にする。我々は、失敗したプレフィックス上での教師-生徒間の継続非対称性(教師は方向転換しようとする一方、生徒は元の方向を続ける傾向がある)を特定し、これをリレーオン方策蒸留(Relay-OPD)におけるラベル不要のハンドオフトリガーに変換する。訓練中、Relay-OPDは検出されたトリガーポイントで教師が一時的に引き継ぎ、教師区間を生成した後、生徒が再開して得られた軌道上で最適化されることで、リレー軌道を構築する。限られたリレーバジェットにより、介入を重要な初期位置に集中させつつ、生徒方策からの乖離を抑える。Qwen3-4B-Instruct-2507を教師、Qwen3-0.6B/1.7B-Non-Thinkingを生徒とし、8つの数学的推論ベンチマークで評価した結果、Relay-OPDはすべてのベンチマークで最高または2位の結果を達成し、標準的なOPDを平均+5.73%、最強のベースラインFastOPDを+1.49%上回った(1.7Bモデル)。0.6Bモデルでも一貫した改善が見られ、訓練軌道長は50%以上短縮された。
長期記憶システムは、ユーザーが発話した内容を外部ストレージに保存し、関連するクエリが到着した際にそれを取得する。このインターフェースは、ごく自然な前提(必要な記憶は、それを必要とするクエリと類似するという前提)に基づいており、その前提はほとんど明示されない。しかし、世界知識はこの前提を破綻させる。例えば、木の実アレルギーは、マカロンのリクエストに対する回答を、その材料であるアーモンド粉を通じて変更するべきである。しかし、両方のテキストには、検索器が認識できる手がかりが一切存在しない。我々はこの失敗様態を「暗黙的関連性の盲点」と呼び、それを評価するために設計されたベンチマーク「InMind」を紹介する。InMindは、10の生活領域にわたる125タスクから成り、各タスクは専門家によって検証され、113タスクは引用可能な公開情報源に基づいている。そのペア化されたコントロールは、既存の評価手法が混同する3つの説明(①事実が記憶されていない、②モデルに橋渡し知識が欠けている、③事実が記憶されていても表出されていない)を分離する。結論は明快である。決定的な記憶が文脈内に置かれた場合、バックボーンモデルは間接的なクエリに対して84.0%の正答率を示す。しかし、同じ記憶を検索しなければならない場合、6つのベクトル型、グラフ型、エージェント型記憶システムは最大でも14.4%の正答率に留まる。これらのシステムは、要求に応じて同じ事実を最大100%想起できるにもかかわらずである。次元数を8倍にした埋め込みは、あらゆるシステムにおいて、回答を見ない目標想起率を向上させるが、ギャップ自体は本質的に変化しない。クエリ到着前に記憶を可視化したままにしておく最小限の診断プローブは、このギャップの大部分を回復させる。これにより、障害はクエリ条件付きインターフェースそのものにあり、課題は、どの事実を可視化し続けるべきかを決定するルーティングにあることが示される。InMindはこの未解決問題を評価するために構築されている。
標準的な視覚言語モデル(VLM)はモラベックのパラドックスに悩まされている。すなわち、複雑なオフライン視覚推論には優れる一方、単純なストリーミング知覚タスクでは苦戦し、非効率的に処理する。本稿では、リアルタイムマルチモーダル理解と相互作用のための、効率的なコーデックネイティブストリーミング基盤モデルMage-VLを提案する。その中核として、カスタムトークナイザーであるMage-ViTは、均一なフレームサンプリングを置き換え、スパースなアンカー(I)フレームと予測(P)フレーム間の動きベクトルと残差エネルギーを用いて、動的でエントロピーの高い領域を選択的に符号化する。16×16のパッチレベルで動作し、これにより時空間コンテキストを保持しながら、視覚トークン消費量を75%以上削減する。約5億6000万枚のラベルなし画像と1億フレームのラベルなし映像でゼロから訓練されたMage-ViTは、数十億の画像テキストペアで訓練された旗艦エンコーダに匹敵、または凌駕する。さらに、AI4AIデータパイプラインとして、マルチモーメントキャプションのためのプロンプト-コード共同最適化と、訓練レシピを導くAI駆動性能診断を確立する。また、生体に着想を得た二重システムアーキテクチャ(軽量なシステム1イベントゲートと因果的システム2デコーダ)により、Mage-VLはプロアクティブなストリーミング知覚を実現する。広範な評価により、Mage-VL-4Bは静的タスクでQwen3-VL-4Bと同等でありながら、映像理解および2D/3D空間推論で大きな向上を示し、最大3.5倍の実時間推論高速化を達成し、15BのPhi-4-reasoning-visionベースラインを総合的に凌駕する。モデル成果物に加え、事前学習データ効率、可変解像度スケーリング、コーデックシステム高速化、VideoQA SFT冗長性、動作-空間相乗効果、AI4AIデータパイプライン、マルチモーダルRLのためのZero-Vision SFTという7つの重要な実証的知見を提供する。
我々は、リアルタイムかつカメラ制御可能なワールド探索のための汎用ビデオワールドモデル「Wonder」を提案する。画像または条件付きビデオを入力として、Wonderはプレイ可能なワールドを構築する。このワールドでは、ユーザがカメラを動かしてインタラクティブにナビゲートし、未観測領域を発見し、過去に観測した領域をリアルタイムかつ長期にわたって再訪することができる。この能力を実現するには、制御手法、記憶機構、訓練戦略のシステムレベルの協調設計が必要である。本研究では、新しいカメラ条件付け手法として、密な座標フィールドを導入する。そのレンダリングにより、空間的に整列した動きと方向の手がかりが提供され、モデルがカメラの動作を直接視覚的な証拠として解釈できるようになる。また、生成コンテキストが拡大する中での高速かつ正確な記憶検索を実現するため、効率的なスパースアテンションに基づく記憶機構を提案する。これにより、モデルは実際のコンテキスト長にかかわらず、推論時に関連する少数のコンテキストトークンに選択的に注意を向けることができる。さらに、自己強制型蒸留パイプラインを修正するためのいくつかの手法を開発し、生徒モデルが制御信号を尊重する能力を向上させるとともに、教師からの多様な生成モードと長期記憶を維持する。これらの要素を組み合わせることで、Wonderは長期ロールアウトにわたって一貫した幾何、外観、ダイナミクスを保ちながら、16 FPSで多様な分単位のビデオを合成することが可能となる。画像からビデオへの生成に加えて、Wonderはビデオ条件付き生成を自然にサポートし、既存の動的シーンをリアルタイムで再撮影することを可能にする。
ファウンデーションモデルの時代において、モデルの性能はプロンプト次第である。そのため、プロンプトエンジニアリングは言語モデルの性能向上に不可欠な手法となっている。現在、動画モデルが視覚タスク(例:視覚的推論)のファウンデーションモデルとなりつつあることを踏まえ、我々はここで、視覚的プロンプトエンジニアリング(すなわち、モデルの性能向上のためにタスク画像を自動的に修正すること)が同様に有効であるかを問う。例えば、視覚的物理推論タスク(「一連の障害物を通過した後、ボールはどこに着地するか?」)では、抽象的なスケッチのようなシーンを、画像編集モデルへの単純な呼び出しによりフォトリアリスティックなバージョンに変換できる。我々は、視覚的プロンプトエンジニアリング(略してVIPE)が、タスク全体にわたって動画推論の性能を向上させることを発見した。実際、動画モデルにおいては、視覚的プロンプトエンジニアリングは、従来のテキストベースのプロンプトエンジニアリングやテスト時スケーリングよりも効果的である場合がある。最終的に、テキストベースのプロンプトエンジニアリングが言語モデルの性能を体系的に向上させるのと同様に、視覚的プロンプトエンジニアリングは、動画モデルからより優れた視覚推論性能を引き出すための、シンプルで計算効率の高いアプローチとして機能する。プロジェクトページ(https://visual-prompt-engineering.github.io/)にサンプル動画を掲載している。
本稿では、3Bパラメータのポリシー適応型マルチモーダル安全性分類器であるShieldstralを紹介する。本モデルは、テキスト安全性ベンチマークにおいて約7倍の規模のモデルと同等以上の性能を示し、マルチモーダル安全性分類において新たな最先端を達成する。Shieldstralは、コンテンツモデレーションを二値質問応答タスクとして定式化する。この単純な定式化により、多様なモデレーションタスクが単一のyes/no問題に統合され、異なる分類体系を持つ異種の安全性データセットを一つの学習フレームワークのもとで統合することを可能にする。本稿では、約5410万サンプルのキュレーションおよび生成、ならびにポリシー適応性を評価するための詳細な評価セットを含むデータ構築手法を提示する。これらの要素により、小規模な適応型モデルがはるかに大規模なモデルと同等以上の性能を達成することが可能となる。
我々は、マルチモーダル大規模言語モデル(MLLM)の原子視覚知覚能力を評価するために特別に設計されたベンチマーク「PerceptionBench」を紹介する。既存のベンチマークはしばしば知覚を分離することに失敗している。すなわち、全体的な評価は知覚エラーと推論やドメイン知識における失敗を混同し、アプリケーション主導のベンチマークはヒューリスティックな設計によって形成された狭く断片的な領域しかカバーしていない。これらの限界に対処するため、PerceptionBenchはボトムアップアプローチを採用する。42の既存ベンチマークにわたる最先端MLLMの応答における最も初期の失敗点を診断することにより、エラータクソノミを構築し、その知覚枝が10の原子知覚能力を定義する。このタクソノミに導かれて、我々は短く曖昧でない回答を持つ3,000の検証済み質問を構築し、それぞれが単一の能力を分離し、難易度は推論や知識ではなく知覚に起因する。16の最先端MLLMにわたるベンチマーク結果は、原子知覚が依然としてほとんど解決されていないことを明らかにしている。どのモデルも60%の精度に達しておらず、知覚関連の幻覚は平均して最も弱い能力であり、類似した全体スコアの背後に著しく異なる能力プロファイルが隠れている。したがって、PerceptionBenchはMLLMの視覚知覚の限界を測定・診断するための能力レベルの基準を提供する。
多モーダル自動ファクトチェック(MAFC)は、外部証拠を検索し推論することで主張を検証する。しかし、既存の静的なベンチマークの大半は汚染のリスクを抱えている。すなわち、それらは主に、外部証拠を用いずにLLMの内部知識だけで検証可能な時代遅れの主張から構成されている。これにより性能評価が過大になる可能性があり、最新情報を必要とする新規の主張に対する真の能力を反映できない。この問題に対処するため、新たに登場した動的ベンチマークは、LLMの知識カットオフ日以降に公開された主張を収集し、汚染されていないと仮定している。本研究では、この仮定を再検討し、最先端(SOTA)の静的ベンチマークAVeriTeCと、新たに構築した動的ベンチマークClaimReview2025Q4の両方における汚染リスクと、それらがMAFC評価に与える影響を実証的に調査する。実験から16の知見が得られ、以下の3つの主要な結果が明らかになった。(1) 動的評価は汚染リスクを低減するが完全には排除せず、カットオフ日以降の主張の17.09%~29.30%が依然として汚染されている可能性がある。(2) 新たに公開された主張の多くは、カットオフ日以前に利用可能な複数の公開知識を合成するか、直接的に検証できる。(3) 汚染はMAFC性能に統計的に有意な過大評価を引き起こし、Macro-F1を最大11.34ポイント押し上げ、システムの順位を歪める可能性がある。これらの知見を踏まえ、厳密に汚染を制御した条件下でSOTA LLMを再評価する。本研究は、信頼性の高いMAFC評価のための実践的ガイドラインを提供する。
任意間モデルは、単一のネットワーク内で任意の組み合わせのモダリティから任意のモダリティを予測するものであり、マルチモーダル視覚および視覚言語モデルで用いられる定式化であり、さらに生態学や天文学などの科学分野でもその利用が広がっている。既存の任意間モデルは通常、エンコーダ・デコーダまたは拡散アーキテクチャを用いてゼロから学習され、その性能に影響を与え、強力な事前学習済みデコーダのみのモデルを事前知識として利用することを妨げている。本研究では、すべてのモダリティを対称的に扱い、モダリティ固有のヘッド、損失関数、タスクパイプラインを必要とせずに任意のモダリティを入力および出力としてサポートする、デコーダのみの任意間マルチモーダルモデリングを調査する。すべてのモダリティが同一モデルの入力かつ出力であるため、結果として得られるモデル「Modus」は、中間モダリティを介した連鎖生成や、別の生成モダリティでモデル自身の出力をスコアリングするクロスモーダル自己検証など、様々なアプリケーションをサポートできる。Modusは、初期状態での優れた性能を示し、単一モデルで様々なベンチマークにおいて専門家およびマルチタスクのベースラインと競合する。すべての資料は https://modus-multimodal.epfl.ch/ でオープンソース公開されている。
ビデオ拡散モデルやフローモデルにおける生成処理は、反復的なサンプリングプロセスが低速で計算コストが高い。現在の最先端(SOTA)高速化手法は、変分スコア蒸留(VSD)と敵対的損失に大きく依存し、拡散モデルをわずかなステップの生成器へと蒸留している。高品質なビデオ生成を実現する一方で、これらの訓練損失は最適化が極めて困難であり、モード崩壊を起こしやすく、ビデオの多様性の喪失や動きの欠如を招く。本論文では、拡散モデルおよびフローマッチングモデルの高速推論のための、簡略化かつスケーラブルな軌跡ベース蒸留法である並列復号蒸留(PDD)を導入する。本手法のアーキテクチャと訓練手順は任意の事前学習モデルと互換性があり、可変の関数評価回数(NFE)でのサンプリングをサポートする。PDDは、ネットワーク評価あたり複数のノイズ除去ステップを予測することで生成を高速化する。概念的には、JVPsや有限差分近似を用いてその導関数を回帰することなく、平均速度の表現を学習する。本手法は、LTX-2.3 Text-to-Video/Audio、Wan 14B Text-to-Video、Qwen-Image Text-to-Imageにおいて、4~8 NFEでSOTA性能を達成する。さらにPDDは、生成ビデオの多様性において顕著な改善を示す。
コードの正確性に対する強化学習(RL)は確立されつつある。つまり、モデルにプログラムを生成させ、隠されたテストケースに対して実行し、合格した解に報酬を与える手法である。これをコード最適化に拡張することは一見単純に見える。すなわち、実行時間を報酬に加えればよい。しかし実際には、実行時間が報酬の主軸となると、測定ノイズ、報酬の疎性、GRPOの不安定性といった小さな問題が信号を圧倒し、RLを失敗に導く。生成された解はほとんど速度が向上せず、失敗する解が増えるのである。我々は実行時間を学習可能にするため、3段階のアプローチをとる。(1)コードのテスト方法:大規模な最適化テストと較正済みサンドボックスを備えたDMC-Optimを構築する。(2)速度を報酬に変換する方法:RL環境において正確性と速度を組み合わせ、オフラインシミュレータを用いて最も有望な設定を予測する。(3)モデルがその報酬から学習する方法:より疎でノイズの多いタイムド実行環境に適応するようGRPOと評価を調整する。DMC-Optimにおいて、最も強い最適化対応設定は、Qwen 2.5 7Bではstrict top-50% pass@1を18.0%から31.3%に、CWM 32Bでは30.7%から50.4%に改善する。これらの向上はtop-30%のようなより厳しい百分位数ではさらに大きくなり、CWM 32Bでは125%の相対的改善を示す一方、純粋な正確性スコアは維持される。タイミングサンドボックスが劣化した場合でも、ロバスト最適化RLは標準のRLVRと比較して、評価基準に応じて100%から200%の改善を達成する。LCBでは、CWM 32Bは中央値サンプル速度比較において標準RLVRに対して最大83%の勝率を示す。問題ごとの最速な正解人間による提出と比較すると、複雑性クラス改善の割合で人間の約半分に達する(14%対28%)。
出現しつつあるオムニモーダル大規模言語モデル(OmniLLM)は、テキスト、音声、および動画の統合的な理解を可能にするが、その長大な音声・動画トークン系列は、多大なメモリと推論コストを伴う。既存の圧縮手法は主に、固定予算のもとで重要なトークンを選択することに焦点を当てており、その前段階であるモーダル間の予算配分問題は十分に検討されていない。本論文では、クエリと音声/動画間の直接的な類似度はモーダル間予算配分には信頼性が低く、またモーダル内で一様な予算配分を行うと、冗長な内容を保持する一方で重要な証拠を見逃す可能性があることを示す。これらの限界に対処するため、我々はOmniDeltaを提案する。これは学習不要のスキル駆動型フレームワークであり、意図認識型のモーダル間割り当てと内容認識型のモーダル内割り当てを結合する。OmniDeltaはまず、音声と動画のスキルプールを構築し、クエリの要求に応じて固定された保持トークン予算をシフトさせる。次に、局所的な複雑性と時間的冗長性を用いて、音声セグメントと動画フレーム間でモーダル予算を再配分する。得られた局所予算は既存の刈り込み戦略と組み合わせることができ、総保持トークン比率を維持しつつ、予算が費やされる箇所を変更する。2つのQwen2.5-Omniモデルを用いた4つの音声・動画ベンチマークにおける実験により、OmniDeltaが刈り込み比率全体にわたって新たな精度-効率パレートフロンティアを確立することを示す。Qwen2.5-Omni-7Bにおける25%のトークン保持率において、OmniDeltaはGPUメモリを22.0%削減し、全トークン推論と比較して1.64倍のエンドツーエンド高速化を達成する。
強化学習を用いた70M~500Mパラメータ範囲のSmall Language Models (SLMs)のアライメントは、しばしば不安定であると考えられているが、その根本的な失敗メカニズムは体系的に調査されていない。最先端(SOTA)研究では、15の(モデル, コーパス)構成がProximal Policy Optimization (PPO)を用いて訓練された。実験には、TinyStories、CNN/DailyMail、およびWikitext-103コーパス上のPythia-70M、160M、410M、SmolLM2-135M、360Mが含まれていた。小規模言語モデルにおいて、三つの再現可能な障害モードが特定された:標準的なPEFT/TRLパイプラインにおけるサイレントLoRAパラメータの凍結、bfloat16使用時の重要度比における数値オーバーフロー、および報酬モデルエラーによる壊滅的な方策崩壊である。これらの問題は、マージ・再初期化アダプター手法、PPO更新時のfloat32精度、および報酬ホワイトニング、重要度比ガード、ウェイトロールバックからなる三層安全機構を用いて対処された。本論文では、キャパシティ・ヘッドルーム仮説を提案する。この仮説は、SLMスケールにおけるPPOの性能は、モデルパラメータ数ではなく、流暢な教師ありモデル(PPL<20)と識別可能な報酬信号の両方に依存することを述べる。提案システムは全ての実験で安定して収束し、流暢な事前分布と情報豊富な報酬信号を持つ構成において、SFTベースラインに対する嗜好勝率を向上させた。さらに、訓練データを大幅に少なくしながら、インストラクションチューニングされたベースラインを上回った。全てのチェックポイント、嗜好データセット、および訓練スクリプトは公開されている^§。
圧縮された短文生成器は、二つの異なる箇所で失敗する可能性がある。すなわち、生成開始前にコーデックが情報を破棄する場合と、潜在生成器が弱いコードを生成する場合である。これらの失敗モードを分離しなければ、研究者は誤ったコンポーネントの改善に計算資源を費やしかねない。本稿では、階層型VQ-VAE-2コーデックとマスク付き離散拡散生成器(MDLM)から構成される、制御された64-to-16 TinyStoriesケーススタディにおいてこの問題を検討する。我々は、共通の外部GPT-2スコアラのもとで、コーデック再構成の忠実度、潜在生成品質、および補助的な潜在診断を段階的に検証するプロトコルを用い、幾何学的検討のための補完的な意味論的指標も併せて報告する。検証した構成では、コーデック再構成のみで外部パープレキシティの中央値が15.17から27.36(+80.4%)に、p95が25.10から98.91(+294.1%)に上昇し、支配的な品質低下が潜在生成開始前に発生していることが示された。同じスコアラのもとでは、コード空間のMDLMはトークン空間の拡散よりも明らかに強力であり、平均値、中央値、p95をそれぞれ32.9%、30.9%、36.6%低減した。幾何学的正則化は局所的な潜在プロキシを改善するものの、実施した実行において復号テキストの指標を改善しなかった。本稿の貢献はアルゴリズム的ではなく方法論的である。すなわち、特定のパイプラインに対する再利用可能な段階的診断法を提示し、この設定では潜在ノイズ除去よりもコーデックの忠実度が実用的な品質上限を決定することを示す。
Joint-Embedding Predictive Architectures(JEPA)は、ピクセルを再構成するのではなく、表現空間での予測を通じて世界モデルを学習し、オフラインのデモンストレーションログからの潜在モデル予測制御の自然なバックボーンとなる。JEPAスタイルの学習は短期の潜在予測を最適化するが、計画には目標進捗に基づく想像上の未来の多段階ランキングが必要である。従来のJEPAプランナーは、そのランキングを埋め込み幾何学、典型的には潜在ユークリッド距離から継承することが多い。これは、ログからマイニングされた進捗コストではなく、表現学習の副産物として生じる。我々はtemporal-distance JEPA(TD-JEPA)を提案する。これはLeWMのエンコーダ・予測器バックボーンを保持し、報酬なしの軌跡から有向時間コストをマイニングする。同一軌跡内のステップ順序が正のターゲットを提供し、異なる軌跡のペアがヒューリスティックな負例として機能し、ロールアウト一貫性項がプランナーの地平線に適合する。マイニングされた監視信号は二つの役割を果たす:進捗が位相的である場合の展開された計画コストとして、そして接触幾何学が支配的な場合のユークリッド計画を改善する表現信号として。ロック評価の下で、マイニングされたコストを展開することで、Two-Roomの成功率がLeWMの97.4%に対して100.0%に上昇し、同じ時間学習されたチェックポイントでの共有ユークリッド計画は、OGB-CubeでLeWMより14.2ポイント向上し、Push-Tを改善する。ロック評価下でのLeWMおよび同時期のRC-auxベースラインと比較して、TD-JEPAはすべての環境で両手法と同等以上である。アブレーション研究により、有向ヘッド、異軌跡負例、ロールアウト一貫性がそれぞれ寄与することが示された。TD-JEPAは、オフラインログにおける時間的進捗構造を発見し、計画時の展開とともにコスト形式を共同設計することで、JEPA世界モデルプランナーの学習と計画のギャップを狭める。コードはhttps://github.com/HKBU-KnowComp/TD-JEPAで入手可能。
我々は、自由文の脆弱性記述からCommon Vulnerabilities and Exposures(CVE)をMITRE ATT&CKエンタープライズ技術にマッピングするための再現可能なパイプラインを提案する。CWE→CAPEC→ATT&CKの導出チェーン(そのテーブル拡張アーティファクトを定量的に評価する)に依存するのではなく、MITRE脅威情報防御センターの専門家によるマッピングから得られた1,207件のCVEから成る厳選されたゴールドデータセットでマルチラベル分類器を訓練する。その結果、ゼロショット埋め込み類似性ベースラインと比較して、recall@5が約2倍に向上し、すべてのランキング指標が改善される。次に、LLM支援によるラベリングがゴールドデータセットを拡張できるかどうかを調査する。初期実験は矛盾した結論を示す。単一の実行では性能低下を示す一方、5つのランダムシードで平均するとわずかな向上を示唆する。しかし、独立した複製実験と拡張規模の研究(100~984件のCVE追加)により、見かけ上の改善は評価アーティファクトであることが明らかになった。LLM生成ラベル(専門家アノテーションとの一致率約0.39)は、どの拡張規模でも信頼できる改善をもたらさず、約1,000件のCVE追加時点で希少技術のカバレッジを低下させる(マクロF1が0.04減少)。根本原因は評価ノイズである。小さなテスト分割でのチェックポイント選択は、多くのノイズの多い評価に対して事実上最大化を行い、同一の実行間で最大0.05のrecall@5の差を生じさせる。検証分割のチェックポイント選択に基づく修正プロトコルを用いると、ゴールドデータのみのモデルはrecall@5(0.673±0.019)を達成し、決定的実験の再現によりLLM拡張のヌル結果が確認される。最後のスケーリング研究では、追加の専門家キュレーションデータが一貫して性能を向上させるのに対し、LLMラベルデータはそうではなく、分類器がデータセットサイズではなくラベル品質によって制限されることを示す。すべてのデータセット、モデル、コード、訓練ログは公開されている。
異なる研究系統では「世界モデル」という用語を異なる意味で用いているが、知覚・シミュレーション・計画を支援する形で、行動下での世界の進化を捉えるという共通の目的を共有している。代表的な実現例として、連続ベクトル空間で力学を学習する神経予測器と、明示的な状態と物理法則を公開する手組の物理エンジンがある。神経予測器はデータからスケールするが、力学の形式は暗黙のままである。物理エンジンは検査・編集が可能だが、大規模に構築するのは困難である。本稿では、世界の力学をコードとして表現するVisualPatchWorld (VPW)を紹介する。VPWはまず、短い能動的プローブを用いて定性的な力学形式を選択し、次に記録された状態行動軌跡から多段階予測誤差を最小化することで、その形式の自由パラメータを適合させる。得られたプログラムはシミュレータのように前進させることができ、ソース形式で検査可能であり、モデル予測制御内で使用できる。画像由来のシーングラフは再計画時にライブ状態を提供する。従来のコードベース世界モデルとの比較において、VPWは平均計画成功率69.0%を達成し、最強のコードベースラインを23.5ポイント上回る。最大の向上は、正しい定性的力学の選択が不可欠な場合に生じる。同一のプランナーの下で、誘導されたモデルは、ナビゲーションや把持を多用する制御において真値エンジンの成功率に近づく。接触を伴う押し動作では残差ギャップが残るが、エンジン内で有望な計画の短いリストを確認することで、そのギャップのほとんどが解消される。これらの結果は、計画に有用な自動構築コード世界モデルへの実用的な経路を確立する。コードはhttps://github.com/HKBU-KnowComp/VisualPatchWorld/で入手可能である。
現代のコーディングエージェントは、最終的に正しいパッチを生成するかどうかで評価されることが一般的である。しかし、パッチ生成は、それ以前のコンテキスト獲得段階、すなわちタスクに必要なリポジトリファイルを見つけることに依存している。本稿では、この上流の検索問題に対するファイルレベルのベンチマークとして、Agent Retrieval Benchを提案する。サンプルは実際のコーディングワークフローからのシグナルに基づいて構築され、凍結されたベースコミットのリポジトリに対して評価される。その関連性は、直接的なクエリとファイルの意味的類似性ではなく、エージェントが次に必要とするものによって定義される。本ベンチマークは、コード2テスト、コメント2コンテキスト、トレース2コード、編集2波及の4つの正の検索タスクをカバーし、第5のサブセットでは、自然な証拠に基づく非ゴールケースと反実仮想の誤リポジトリ対照を用いた選択的検索を評価する。Agent Retrieval Benchは、25のリポジトリにわたる427サンプル(正例345、自然な非ゴール例50、反実仮想対照32)を含む。コーパスは、308のベースコミットスナップショット、392,000ファイル、790万チャンクから構成される。我々は、字句検索、RepoMap、オープンソースの埋め込み、選択的棄却、および記録されたエージェントのコンテキスト選択を評価する。単一の検索ファミリーが支配的であることはない。Qwen3-Embedding-4Bは正サンプルにおけるサンプル重み付けMRRで最良、Qwen3-Embedding-8BはRecall@20で最良、RepoMapは8Kトークンにおける予算制約下のコンテキスト収率で最良であり、タスクごとの勝者は大きく異なる。反実仮想対照を用いて調整された選択的閾値は、自然な非ゴールケースに対する選択的成功を改善せず、キャリブレーションギャップを明らかにした。記録された軌跡も、サンプルの27~35%で全てのゴールファイルを見逃している。制御されたシード介入パイロット実験では、検索によって得られた初期コンテキストは、ランダムな非ゴールコンテキストよりも、シード後の探索が少なく、ファイルF1が高いことが示された。一方、オラクルのゴールコンテキストには、依然として大きな改善余地がある。
推論タスクで学習された言語モデル \(p_\theta(y \mid x)\) は、複数の異なる方略を通じて問題を解くことを学習するが、これらの方略は暗黙的であり、モデルの応答分布の中に絡み合っている。本研究では、与えられた事前学習済み言語モデルの応答分布を、構造化された方略条件付き表現に分解する問題を扱う。具体的には、潜在変数分解 \(p_\theta(y \mid x) \rightarrow (r_\phi(z \mid x), g_\phi(y \mid x, z))\) を学習する。ここで、ルータ \(r\) は各入力を潜在方略 \(z\) 上の分布に写像し、ジェネレータ \(g\) はその方略に条件付けられた応答を生成する。重要な課題は、ジェネレータがベースモデルから初期化されているため、\(z\) を用いずに既に \(p_\theta(y \mid x)\) を表現している点である。したがって、標準的な変分推論では、モデルが情報を \(z\) 経由で伝達するインセンティブを持たず、深刻な形の事後崩壊を引き起こす可能性がある。この問題に対処するため、ベースモデルの応答損失に対する部分情報利得を測定し、ベースモデルの驚き度が高いトークンに再構成圧力を集中させる変分目的関数を提案する。これにより、\(z\) が方略に関連する応答の変動を符号化することを促進する。多方略アルゴリズムタスクのベンチマークを導入し、本目的関数がベースモデルの応答分布を維持しつつ、異なる参照方略に整合する潜在コードを復元することを示す。
RLHFパイプラインでは、報酬スコアリングがポリシーの更新をブロックする。スコアリングが低速だとループ全体がボトルネックになる。なぜなら、全てのロールアウトのスコアが得られるまでは更新が実行されないからだ。それにもかかわらず、ほとんどの設定は単にPyTorchのeagerモードかtorch.compileをデフォルトとし、それが実際に最速かどうかは誰も確認していない。スコアリング自体は小規模な処理である。典型的なRLHFのステップではロールアウト生成の方がはるかに多くのリソースを消費する。しかし、スコアリングと生成は同一のCPUおよびGPUリソースを奪い合うため、スコアリングエンジンを高速化しても、それだけではステップ時間は短縮されない。主に、生成が代わりに利用できるキャパシティを解放する効果がある。我々はONNX Runtime上にネイティブC++推論エンジンを構築した。第一段階として、正確性を確認した。出力はPyTorchのリファレンスとCPU上で5.7×10^-6、GPU上で4.2×10^-3の誤差に一致し、信頼できる範囲であった。次に、CPUとGPUの両方でPyTorch eagerモード、torch.compile、FastAPIと比較テストを行った。CPUでは明確な差が出た。我々のエンジンはすべてのベースラインを上回り、信頼区間も重複しなかった。GPUでは異なる結果が得られた。PyTorchとFastAPIには勝ったが、torch.compileが優位に立った。さらなるテストにより、高速化の要因はC++という言語自体ではなく、ONNX Runtimeにあることが判明した。また、バッチ処理の方針が言語やランタイムの選択以上に重要であり、その影響は想定以上であった。これらの結果は、単一の実行では信頼性が不十分であるため、繰り返し独立した実行に基づいている。
既存のBraTS-GLIデータセットは成人神経膠腫のMRIセグメンテーションにおける広く利用されるベンチマークを提供するが、そのタスク定義は腫瘍サブ領域に焦点を当てており、併存する白質高信号(WMH)を系統的に表現していない。共同セグメンテーション設定において、このようなラベル付けされていない異常は、病理領域を正常組織として扱うことでタスク固有のラベルノイズを導入する。この制限に対処するため、我々はBraTS-GLI Anatomy-Lesionを紹介する。これはBraTS 2023-GLIトレーニングコホートから派生した、制御アクセス可能でラベルのみのリソースである。本リソースは、元の4モダリティMRI症例に対応する1,251個の統一された8クラス解剖-病変ラベルセットを提供し、画像修復入力を必要とする116症例の画像修復ラベルを含む。コホートは394症例の精製サブセットと857症例の拡張サブセットに整理され、症例レベルのメタデータはラベルソース、画像修復要件、品質管理ステータス、アクセス条件、チェックサム、リリース境界を網羅する。元のBraTS-GLIアノテーションと比較して、本リソースは統一ラベル空間内に正常脳組織と従来ラベル付けされていなかった併存異常を組み込むことで、フォアグラウンドの教師情報を大幅に拡張する。MedNeXtとT1/FLAIR入力を用いた検証研究により、WMHを考慮した教師情報は、ドメイン内GLIおよび外部WMHデータセットの両方において正常組織セグメンテーション性能を維持しつつ、ノイズ対照トレーニングと比較して併存病変への感度を向上させることが示唆される。本リソースは科学研究を意図しており、共同解剖-病変教師情報、ラベルノイズ解析、再現可能な評価を支援する。データはhttps://www.synapse.org/Synapse:syn75210889/wiki/で、コードはhttps://github.com/xyx200/brats-gli-anatomy-lesion-codeで入手可能である。データリソースのDOIはhttps://doi.org/10.7303/SYN75210889である。
ハイパースペクトルイメージング(HSI)は物質識別に有用であるが、実運用における地雷スクリーニングでは目標が発見されるまでに検査すべき誤警報の数にも依存する。本論文では、無人航空機(UAV)搭載可視近赤外(VNIR)HSIを用いたPFM-1地雷検出を、スペクトル角度マッパー(SAM)、マッチドフィルタ(MF)、適応コヒーレンス推定器(ACE)、制約エネルギー最小化(CEM)により検討する。我々は、SVC地上測定スペクトル、完全情報によるシーン内コアピクセルスペクトル、およびシミュレートされたヒューマン・イン・ザ・ループ・スペクトルブートストラップを比較する。受信者動作特性曲線下面積(ROC-AUC)と平均適合率(AP)に加え、目標発見曲線と空間的候補レビュー数も報告する。全レビューブートストラップは、全7つの目標領域が確認された後、完全情報によるシーン内スペクトルの場合に到達するが、必要な検査労力は大きく異なる。ACEは2ラウンドと9回の候補検査で全領域を確認するのに対し、SAMの派生手法は最終的な目標位置に対して数千回の候補レビューを必要とする。コードはhttps://github.com/SagarLekhak/IEEE_WHISPERS_2026_UAV_HSI_PFM1で入手可能である。
熱赤外線(TIR)イメージングは、視覚的に劣化した環境におけるUAV群運用に不可欠である。しかし、外見上の手がかりの乏しさ、頻繁な遮蔽、急激な機動により、小型UAVの追跡は依然として困難である。Anti-UAVチャレンジなどのベンチマークによって大きな進展が見られたものの、既存の手法は主に精度を優先しており、リアルタイムエッジ展開における計算制約を見落としている。標準的なカルマンフィルタ(KF)はエッジデバイスに要求される効率性を提供するが、その等速度仮定は高動的UAV運動や熱センサのジッター下ではしばしば破綻する。より洗練された非線形推定器はロバスト性を向上させることができるが、しばしば追加の計算コストを伴う。このギャップを解決するために、我々は適応運動学カルマンフィルタ(AKKF)を中心としたエッジ認識型オンライン追跡パイプラインを提案する。AKKFは線形KFに状態依存の運動学モデリングを追加しつつ、リアルタイム効率を維持する。さらに、一過性の誤検出抑制と運動学駆動の予測コースティングを組み合わせることで、提案パイプラインは困難なTIR条件下での軌跡連続性を改善する。Beyond Strong Baseline (BSB)ベンチマークにおける実験は、追跡性能と計算効率を共に評価することでエッジ認識型UAV追跡の出発点を提供し、将来のリアルタイム展開に向けた洞察を与える。
ドメイン汎化(Domain Generalization, DG)は、分布のシフトに対してロバストな表現を学習することを目的とする。近年の幾何学的アライメント手法、例えばCPCANetは、ミニバッチ単位での共通主成分分析(CPCA)を通じてドメイン不変な構造を抽出する。しかしながら、CPCANetはミニバッチ学習における小サンプルサイズ問題に起因して、ランク欠損の共分散推定を生じる。この制約に対処するため、本稿では共分散フレームワークである射影追跡CPCANet(PP-CPCANet)を提案する。本手法はスティーフェル多様体上で大域的正交基底を学習し、ケイリー変換を介してネットワークパラメータと共に当該基底を同時最適化する。さらに、対称性を破る分離中央値型PP分散目的関数を導入し、密でロバストな最適化信号により共通主成分(CPC)を抽出する。4つのDGベンチマークにおける実験により、PP-CPCANetは安定した学習を維持しつつ、最先端(SOTA)性能を達成することを示す。
生体医用画像解析は多様なモダリティとタスクにわたるが、現実環境での展開は、スキャナー、プロトコル、患者集団にわたる深刻な分布シフトによって妨げられている。その結果、高性能モデルにはドメイン固有の微調整が繰り返し必要となり、ラベルが不足していたり、プライバシー制約によってデータ共有が制限されたりする場合には、このコストの高いサイクルは非現実的となる。本稿では、OPERA(Offline Policy-guided Expert Routing and Adaptation)を提案する。これは、エキスパートの重み割り当てをオフラインポリシー学習問題として扱うマルチエージェントアンサンブルフレームワークであり、任意のエキスパートエージェントに勾配更新を加えることなく、小さな検証セットからルーティングポリシーを学習し、テスト時適応を用いて分布シフトに対処することにより、このデプロイメント上のボトルネックを解決する。OPERAは、相補的なメカニズムを通じて異種の専門エージェントを調整する。エキスパートプロファイリングモジュールはオフラインで選択ポリシーを学習し、専門知識の情報に基づいた割り当てを可能にする。各エージェントは温度調整を通じて信頼度較正を受け、より信頼性の高い確率的出力を保証する。OPERAはまた、分布認識適応も組み込んでおり、ラベルなしテストデータから得られる統計量を用いて、バッチレベルでクラス重みを動的に調整する。インスタンスレベルルーティングは、モデル間の一致度と予測エントロピーを活用して、各サンプルを最も適切なエキスパートに割り当てる。我々は、眼底写真、胸部X線、CT、MRI、マルチモーダル診断ベンチマークをカバーする9つのデータセットでOPERAを評価し、分類、セグメンテーション、マルチモーダル設定において30以上のベースラインと比較した。OPERAは、性能と較正品質を一貫して向上させ、オフラインポリシーに導かれたエキスパートエージェントの連携が、再学習を必要としないデプロイ可能な生体医用AIへの実用的な経路であることを示している。コードは https://github.com/HUANGLIZI/OPERA{GitHub} で入手可能である。