翻訳付きの日次キュレーションされたAI研究論文
教師ありファインチューニング(SFT)と強化学習(RL)は、大規模言語モデル(LLM)のマルチタスク推論能力を向上させる際に、根本的に異なる挙動を示す。我々の予備実験により、以下の現象が明らかになった。すなわち、SFTは多段階訓練において深刻なタスク間競合を引き起こすのに対し、RLは多様なタスク間での安定的な共存を可能にする。実証的には、この差異をパラメータレベルまで追跡し、RLがタスク間でスパースかつほぼ直交する更新を誘発することを観察した。我々は、マルチタスク勾配干渉の解析を通じて、このメカニズムに関する理論的説明を提供する。結果から得られた区別は以下の通りである。SFTにおける干渉はノルム制約を受け、絶対的な勾配の大きさに比例してスケールする。一方、RLにおける干渉は分散制約を受け、アドバンテージ正規化とオン方策最適化によって生じる勾配の分散によって上限が定められる。この小さな分散の上限により、タスク間の最適化方向がほぼ直交する。この知見を活用し、マルチタスク訓練を分離するパラダイムであるParallel-RLを提案する。これにより、効率性と柔軟性が大幅に向上する。
近年の研究では、大規模なマルチモーダル環境プールを構築することでエージェントを訓練している。しかし、我々はマルチモーダル環境の数を単純に増やすだけでは必ずしも効果が得られないことを見出した。さらに、一連の実験を通じて、現在のマルチモーダル環境分布における限界を分析する。これらの知見に基づき、我々は**多様性**と**難易度構造**という2つの側面から、より効果的な訓練環境分布を構築する方法を研究する。多様性については、多様な環境セットを得るための**能力認識環境選択(AES)**を提案する。難易度構造については、**階層的難易度カリキュラム(HDC)**を提案する。これは、ハーネス弱化と状態規模の進行という2つの難易度レベルを通じてカリキュラム学習を組織化するものである。実験により、AESとHDCがマルチモーダルエージェントの訓練を効果的に改善することが示された。
World-Action Models(WAMs)は、ビデオダイナミクスの事前知識を行動予測に転送することでエンドツーエンド自動運転を改善するが、既存手法は推論時にコストのかかる将来生成を必要とする。我々は、ビデオ生成を純粋に訓練信号として使用する、シンプルかつ効果的なWAMであるSimWAMを提案する。SimWAMは、事前学習済みビデオエキスパートと軽量な行動エキスパートをジョイントフローマッチングで共訓練する。分離されたアテンションマスクにより行動予測が将来フレームから独立に保たれ、訓練後にビデオブランチを破棄することができ、軌道を直接予測する自己完結型プランナーが残る。2つのエキスパートはパラメータを共有せず、統一されたアテンションインターフェースを通じてのみ相互作用するため、学習目的や推論パイプラインを変更することなく、ビデオバックボーンの交換や行動エキスパートの独立したスケーリングが可能である。さらに、軌道模倣を超えた合成的な運転報酬を最適化するために強化学習を適用する。我々のSimWAMは、NAVSIMにおいて91.5 PDMSを達成し、最先端のWAMベースのプランナーを大幅に低いレイテンシで上回り、nuScenesへのゼロショット転送を実現する。これらの結果により、SimWAMは、効率的な自動運転のためのビデオ生成の進歩から容易に恩恵を受け得る、シンプルかつ堅牢なベースラインとして位置づけられる。コードとモデルの重みは https://github.com/H-EmbodVis/SimWAM/ で公開されている。
言語モデルから転用される一般的なパラメータ効率的ファインチューニング(PEFT)手法は、リアルタイム検出器では暗黙のうちに失敗することがある。これは、検出器の異種オペレータと検出固有のコンポーネントが、通常のTransformerスタックには存在しない配置制約を課すためである。本稿では、アダプタ配置を監査可能な制約計画問題として定式化する構造認識フレームワークYOLO-PEFTを提案する。YOLO-PEFTは、検出器グラフ、PEFTリクエスト、リソース予算が与えられると、オペレータ役割と意味役割を割り当て、明示的なオペレータ妥当性、検出器セマンティクス、グラフインターフェース、デプロイメントの各述語を評価し、除外された各モジュールの理由コードを記録した上で、予算内のターゲットモジュール計画を出力するか、トレーニング前にRefuse(拒否)を返す。公式のVOC07+12 trainval-to-VOC07テストプロトコルでは、プランナーが選択したRS-LoRAはYOLO11sおよびYOLO12sでそれぞれmAP50-95 0.7138および0.7307を達成し、一方Full-SFTでは0.6428および0.6662であった。RT-DETR-Lでは、評価された7つのLoRAファミリ構成すべてが事前定義された壊滅的閾値を超え、評価範囲内で較正された「拒否してFull-SFTを使用する」判断を支持する。管理されたYOLO11監査はさらに、LoRAがトレーニング時のピークメモリ使用量を43.9%削減する一方、トレーニング時間は1.72倍長くなることを示している。評価された検出器ファミリ、配置ポリシー、較正範囲内では、YOLO-PEFTは、検証済みのトレーニング・保存・マージ・エクスポート経路を維持しつつ、手動によるターゲットモジュールの試行錯誤を明示的かつ検査可能な計画に置き換える。未見の検出器アーキテクチャに対する拒否は、依然として未解決の検証課題である。プロジェクトページ:github.com/Tencent/YOLO-Master
自律型マルチモーダルエージェントを連続的な実世界環境に展開するには、無制限の音声・視覚ストリームを取り込み、時間規模のメモリを維持することが必要となる。しかしながら、現在の評価は主に短いクリップと多肢選択形式に依存している。この設計により、最後の4フレームのみを処理する最小限のベースラインが、複雑なストリーミングモデルに匹敵するか、それを上回ることさえ可能になり、さらに回答選択肢は言語的ショートカットを露呈させる。我々は、時間規模の対話型ストリーミングビデオ理解のためのベンチマークであるStreamArenaを紹介する。StreamArenaには、平均88.8分のフルレングス動画243本と、リアルタイム知覚、過去の振り返り、プロアクティブな対話、マルチモーダルツールの活用を評価する、厳密に注釈付けされた自由記述式の質問応答ペア3,646組が含まれる。多様なシステムにわたる評価は、継続的な対話と長期的なマルチモーダル理解との間の緊張関係を明らかにする。最近のフレームのみを保持する手法は遠い過去のイベントを復元できず、過去の観察をテキストに変換する手法は視覚的証拠を失い、視覚メモリを繰り返し圧縮する手法は時間の経過とともに細部を保持することに困難をきたす。我々はこの緊張関係に対処するため、StreamMindを提案する。StreamMindは2層アーキテクチャを採用し、レイテンシが重要な対話とプロアクティブな監視を、独立してスケジュールされるフロントエンドワーカーに割り当てる一方、バックエンドワーカーは非同期に永続的なマルチモーダルメモリを構築し、過去の想起と外部検索を実行する。StreamMindは、4つの能力すべてにおいて既存のストリーミングベースラインを上回り、永続状態を再利用することでクエリから回答までのレイテンシを削減する。
AIシステムやデジタル製品の人間による評価は、コストが高く、時間がかかり、スケールが難しい。オフライン評価はよりスケーラブルだが、人間の多様性や対話的な行動を抽象化してしまうことが多い。そこで我々は、異種ユーザーを用いてAIシステムやデジタル製品をテストするための、人口規模のシミュレートユーザー評価インフラであるMatrAIxを紹介する。MatrAIxは3つの中核的要素から構成される。第一に、Persona 8Bは、1,290のカテゴリカル次元で表現される83億件のペルソナレコードを含む。レコードは、相関する属性を保存する依存グラフからサンプリングされるか、または人間が作成したプロフィールに由来する。我々は、599,847件の人間由来レコードと400,000件の合成レコードからなる、品質フィルタリング済みの約100万ペルソナのコアセットを公開する。第二に、MatrAIx Playgroundは、多様なユーザーがデジタル製品を評価し対話する4つの環境を提供する。すなわち、サーベイ、AIチャットボット、Web、アプリである。第三に、MatrAIxは、コマース、ソフトウェア、ファイナンス、ヘルスケアなど25以上のドメインにわたる1,010のアプリケーションタスクを提供する。我々は、8つの代表的なタスクにわたって18,189回の評価トライアルを実施した。ペルソナエージェントは、Claude Opus 4.8、GPT 5.5、Claude Haiku 4.5の3つのLLMによって駆動された。得られたフィードバックは、値上げ後のためらい、AIアシスタントの失敗後の継続意欲、レイテンシ許容度など、ペルソナの背景に応じて決定や嗜好がどのように変化するかを捉えている。我々は2つの主要な検証研究を実施した。第一に、400トライアルの統制研究では、10の行動属性と4つの環境すべてにわたってペルソナの順守を評価した。宣言された行動は、366トライアル(91.5%)で表現されるか、正しく抑制された。第二に、人間とLLMの評価者が、人間由来ペルソナの抽出品質を評価した。全体として、MatrAIxは、多様なシミュレートされた人間ユーザーを用いてAIシステムやデジタル製品を評価するためのエンドツーエンドのインフラを提供する。
CLIベースのソフトウェアエンジニアリングエージェントは急速に成熟してきたが、オープンエコシステムは単一のトレーニング環境に収束している:オープンモデルのファインチューニングに使用される軌跡データセットは、ほぼ例外なくOpenHandsの下で収集されている。このデータでファインチューニングされたモデルはOpenHands上では良好なスコアを示すものの、トレーニング外の任意のスキャフォールドで展開すると大幅に性能が低下する。未トレーニングのベースモデルにはこの乖離が見られず、このギャップがファインチューニングに起因し、トレーニング用スキャフォールドの慣習に結びついていることを示している。本論文が区別する二つの意味において、構造上重要なスキャフォールド固有の挙動はプランニング構造であると我々は主張する:すなわち、明示的プランニングとは第一級の成果物として生成される実行前プランであり、暗黙的プランニングとはエージェントループ全体を通じて実行を形作る構造的慣習である。この仮説の下では、ギャップの解消には、プランニングを固定されたスキャフォールドの成果物から学習されたモデル能力へと移行させることが必要である。我々はDecoupling CLI Agent Scaffolding(DCAS)を導入する。これはバックエンド置換インターセプション層であり、スキャフォールドを変更することなく任意のCLIスキャフォールドと任意のバックエンドモデル間のAPIトラフィックをルーティングし、クロックスキャフォールド評価とプランニング対応軌跡収集を可能にする。DCASを用いた制御されたプランソース介入により、プランニング品質が影響力の大きい構成要素であり、観察されたクロックスキャフォールド低下を上回る改善が得られることが確認される。また、単一のスキャフォールドの下でDCASにより収集された少量のプランニング対応軌跡でファインチューニングされたモデルは、トレーニング外のスキャフォールド全体で一貫した改善を示し、プランニングの二つの意味はトレーニングデータにおいて経験的に分離可能である。
活性化オラクル(Activation Oracles; AOs)は、別のモデルの内部活性化に関する自然言語の質問に答えるように訓練された言語モデルである。これらは、モデルの状態から隠れた情報を読み取るための柔軟なインターフェースを提供する。特に、関連情報が内部では表現されているものの、表出行動には存在しない、または不完全である場合に有用である。しかしながら、AOはそれ自体が学習されたシステムであり、その回答は、表現された情報の中立的な読み出しではなく、訓練データ、目的関数、そして学習された報告行動によって形成される。我々はこれを、対象モデルが直接的な開示を避けつつ内部で隠れた概念を用いるようにファインチューニングされる、統制されたTaboo Word Guessing(タブーワード推測)設定において研究する。このような対象モデルに対して訓練されたAOが専門的な読み取り器になるとの期待に反し、ファインチューニングされたAOは概念特異的な反読み取り器(anti-reader)になり得ることが分かった。すなわち、それらは自身の訓練中に持続的に存在する概念を選択的に回復できない。この失敗は、対象モデルやオラクルの表現から概念が欠落していることだけでは説明できない。すなわち、対象概念はオラクル内部で依然として復号可能であり、LogitLensおよび層アブレーション分析は、この失敗がAOの読み出し経路において生じることを示している。我々の結果は、行動的漏洩、表現レベルの復号可能性、およびAO-verbalizability(AOによる言語化可能性)が互いに乖離し得ることを示しており、学習された解釈可能性インターフェースに対する信頼性の懸念を提起する。
小規模言語モデルは、厳しいレイテンシ、コスト、オンプレミス環境の制約下でのデプロイメントにおいてしばしば唯一の選択肢となる。しかし、それらがゼロから学習されることはまれであり、通常は知識蒸留(KD)によって圧縮モデルが復元される。この復元ステップは最終的な品質を大きく決定するが、そのコストは高い。本稿では、2つのシステム上の貢献を中心に、蒸留学習を効率的にするための実務者向けの研究を提示する。第一に、オフラインKD(教師のtop-Kロジットを一度キャッシュし、そのキャッシュに対して生徒モデルを学習する手法)が、ほぼ同一の訓練損失でオンライン蒸留に匹敵し、教師モデルをメモリから取り除きつつ、1反復あたり約29%高速に動作し、単一のH200 GPU上で最大41%高いスループットを達成することを示す。第二に、語彙サイズ全体のロジットテンソルを実体化しない融合チャンク化KL損失を導入し、ピークメモリをシーケンス長に対して線形にする。これにより、そうでなければコンテキスト長を制限していたメモリスパイクが除去され、単一GPU上で4倍のコンテキスト(32,768トークン)で学習できるようになる。出力ヘッドのみの別の簡易ベンチマークは損失カーネルを分離し、4Kから256Kトークンまでのこの損失のメモリおよび反復レートのスケーリングを確認する。これらを組み合わせることで、大規模な修復と数百回のアブレーションが手頃なコストで実行可能になる。さらに、損失設計とシーケンスパッキングに関する裏付けとなるアブレーションも報告する。チャンク化損失の実装を公開する:https://github.com/CompactifAI/Full-Chunked-KL-Loss
音声推論は、機械が音響世界を理解するために不可欠である。検証可能な報酬を用いた強化学習はそのような推論を引き出すことができるが、既存の報酬設計には相補的な限界がある。すなわち、結果ベースの報酬は最終的な解答のみを監視し、モデルが音声に注意を払うことなく解答に到達することを許してしまう。一方、プロセスベースの報酬は推論自体を評価するものの、粗く手作業で作られた固定的な基準に依存しており、それは各質問に適応せず、音響的証拠に基づくこともない。さらに、質問によって要求される内容は異なり、知覚に依存するものもあれば、多段階の推論に依存するものもある。そのため、あらゆる静的な基準は、方策が向上するにつれてその効果が弱まる。したがって、推論プロセスを、きめ細かく、音響に基づき、かつ適応的な報酬で監視することが極めて重要である。しかし、そのような報酬はサンプルごとに手作業で設計することは非現実的であるため、困難を伴う。この目的のために、我々はAudioRubricsを導入する。これは、自己進化型かつ音響基盤型のルーブリック報酬を用いて音声推論を監視する強化学習フレームワークである。AudioRubricsは、生の波形からサンプルごとのルーブリックを合成し、モデル自身のロールアウトに基づいて、グループごとに基準を再生成・再重み付けする。これにより、静的な基準が飽和する中でも、現在の方策の弱点を継続的に標的とする学習信号が供給される。3つの音声推論ベンチマークにわたる包括的な評価により、AudioRubricsが多種多様なオープンソースおよび学習ベースのベースラインを大幅に上回ることが示された。さらに、我々の分析は、その向上がルーブリック生成器と判定器の能力に応じて拡大すること、またAudioRubricsが退化した崩壊と無制限な成長の両方を回避する安定した推論長に収束することを示している。音声知覚の改善は、音響的証拠に監視を固定することの有効性をさらに実証している。プロジェクトページは https://audiorubrics.github.io で公開している。
マルチモーダル表現学習は現代AIの要である。マルチモーダルなクエリとターゲットをベクトルにエンコードすることで、産業用の検索や推薦を支え、現代のエージェントの基盤となっている。抖音(Douyin)、小红书(Xiaohongshu)、YouTubeのような複雑なモダリティと大規模コンテンツを抱える実世界のプラットフォームでは、十億規模のインデキシング下での効率性と、ハードマッチングのための細粒度の識別の両方が求められる。既存のMLLM埋め込みモデルは、これらの両方を満たすものはほとんどない。対照学習モデルは効率的だが、細粒度の区別には粗すぎるペアレベルの教師信号に依存している。一方、CoTベースのモデルは明示的生成によって識別能力を向上させるが、オンライン推論での実運用は非現実的である。我々は、2段階の訓練により両者の強みを組み合わせたDouyin Multimodal Embedding(DME)を提案する。第1段階では、大規模な対照学習による事前学習を行い、幅広いモダリティとタスクをカバーする統一的なマルチモーダル埋め込み空間を構築する。第2段階では、意味的十分性(埋め込みが検索関連の証拠に基づき、相手側の細粒度の意味を保持するという性質)を、2つのメカニズムによって補完する。証拠に基づく型付き潜在推論(Evidence-Grounded Typed Latent Reasoning)は、隠れ空間における潜在推論を通じて検索証拠を整理し、交差条件付き再構成(Cross-Conditional Reconstruction)は、交差方向の自己回帰再構成を通じて相手側の意味を強制する。両メカニズムは訓練時のみに機能し、クエリ側のオーバーヘッドはわずかであるため、DMEは標準的な対照エンコーダと同等の効率で推論できる。MMEB-v2において、DMEは2Bおよび9Bのバリアントで同等規模の最高水準の結果(74.8および78.4)を達成し、特にビデオおよびビジュアルドキュメントタスクで顕著な性能を示す。本番環境では、DMEは抖音の社内オフライン評価セットで2.92%の相対改善をもたらし、生成検索、画像検索、AI検索などの抖音の各シナリオに展開されている。さらに、抖音検索におけるオンラインA/Bテストでは、0.1%の生涯価値(LT)向上を達成している。
空中画像ゴールナビゲーションは、目標画像によって指定された目標位置に無人航空機(UAV)を到達させることを必要とする。既存のワールドモデルに基づく手法は、予測された未来を用いて候補軌道をランク付けするが、典型的には1つまたは少数の点予測のみに依存しており、将来状態の不確実性が大きい大規模な屋外環境では不十分である。この制限に対処するため、我々は不確実性を考慮したナビゲーションワールドモデル(UA-NWM)を提案する。これは、空中画像ゴールナビゲーションのための効率的な潜在ワールドモデルであり、軌道スコアリングを条件付き分布外検出として定式化する。UA-NWMは、不確実性部分空間を用いて妥当な未来を表現し、予測と目標の不一致を、不確実性によって説明可能な成分と説明不可能な成分に分解する。スコアリングには説明不可能な残差のみを使用し、複数の将来サンプルを必要とせずにロバストな選択を可能にする。大規模な実験により、UA-NWMは低い推論レイテンシを維持しながら、既存のナビゲーションワールドモデルを一貫して上回ることが実証された。実機UAV実験は、その実用的適用可能性をさらに検証する。プロジェクトページ: https://duryi.github.io/UA-NWM-Project-Page
ハードプロンプト圧縮は、トークン、文、またはチャンクを独立にスコアリングし、予算制約下で最高スコアの単位を保持することにより、長文脈推論コストを削減する。我々はこの手順に構造的欠陥があることを見いだす。すなわち、独立選択は依存関係にある証拠ペアを分割し、一方を保持しながら他方を削除し得る。保持されたテキストが答えを含む一方、削除されたテキストがそれを解釈するために必要なエンティティを定義している場合、その結果を参照の宙吊り(referential dangling)と呼ぶ。圧縮率0.30において、Qwen3-0.6Bの埋め込みを用いて一貫性のあるチャンクをランク付けするBeaverは、3つのマルチホップ質問応答データセットにわたるブリッジ例の34〜54%で回答経路を不完全なままにする。共通のHotpotQAブリッジセットでは、試験した6つのハード圧縮器すべてが最大60%の宙吊り率を示し、LongBench-v2のシングルドキュメントQAにおけるすべての文書には少なくとも1つの宙吊り参照が含まれる。Qwen3-8Bで評価した宙吊り例では、トークン予算を維持するために非支持段落を削除しながら欠落した支持段落を再挿入すると、精度が29〜34ポイント向上し(p < 0.0001)、両方の支持段落を保持する文脈との差の少なくとも88%を回復する。より強力な解答モデルでもこの損失は吸収されない。MuSiQueでは、GPT-5.5は、両方の支持段落を保持する文脈よりも圧縮文脈において精度が8.8ポイント低い。最後に、保持されたテキストの解釈に必要かどうかに基づいて省略された文をランク付けするコンパクトな分類器を訓練し、推論時に支持アノテーションなしで上位の候補を再挿入する。HotpotQA上でQwen3-8Bを用いた場合、この自動復元は圧縮率を0.30から0.31に変えるだけで精度を4.7ポイント向上させる。ハード圧縮器は、関連性と参照の完全性の両方を最適化すべきである。
我々は、インタラクティブなビデオワールドモデルにおける視覚的持続性を研究する。これらのモデルは、Key-Value(KV)キャッシュを増大する視覚記憶として用い、以前に生成されたフレームを前方へ伝搬する。しかし、ロールアウトが訓練ホライズンを超えて延長されると、モデルは保存されたコンテンツを確実に参照できなくなることが分かる。なぜなら、時間的なRotary Positional Embeddings(RoPE)オフセットが訓練中に観測された範囲を外れ、モデルがアテンションを通じて関連する視覚情報を検索することが困難になるからである。さらに、RoPEで回転された空間内でキャッシュを単純に圧縮すると、互換性のない位置位相が平均化され、記憶が損なわれる。この問題に対処するため、我々はWorldTraceを提案する。これは、長期的な視覚的持続性のための訓練不要のメモリフレームワークである。WorldTraceは、各サマリースロットに分布内の個別の仮想位置を割り当てることで、圧縮されたメモリを参照可能に保つ。この参照可能なキャッシュ内で、我々は2つのメモリ圧縮手法を研究する。WorldTrace-Fieldは時間的一貫性のために履歴を圧縮し、WorldTrace-Landmarkはエピソード的想起のために、検出された遷移箇所に逐語的なシーントレースを保存する。さらに、圧縮キャッシュが長い迂回の後に以前訪れたシーンを再構成できるかを評価するベンチマークであるLoopBenchを導入する。LoopBenchにおいて、WorldTrace-Fieldは時間的一貫性を+15.5%向上させ、WorldTrace-Landmarkはエピソード的想起を+19.5%向上させ、再学習なしで視覚的に持続的な生成を拡張する。
自己回帰モデルは長いロールアウトにわたって誤差を蓄積するが、実運用時にはそれを測定するための正解データが存在しない。我々は、方向フラグによって力学系を時間方向に進めたり逆行させたりする単一の条件付き潜在拡散モデルを学習し、この双方向性が測定不要のテスト時誤差信号を提供することを示す。すなわち、iステップ前進させてからiステップ後退させるとモデルは開始点に戻らなければならないため、往復不一致C_iは観測不可能なロールアウト誤差の自己教師あり代理指標となる。アンサンブルも、ホールドアウトデータも、支配方程式も不要であり、必要となるのは追加のロールアウト1回だけである。我々は、圧縮性磁気流体力学(MHD)、天体物理的乱流放射混合層、および自然顔動画(CelebV-HQ)で検証する。ホールドアウトされたMHD軌道では、C_iはロールアウト誤差をランク付けする(固定深度ではスピアマン0.91〜0.98、同一軌道内では0.69±0.16)。さらに、学習ロールアウトに適合させた単純なキャリブレータは、その誤差の大きさをほぼ名目どおりの被覆率のもとで68%の場合には1.14倍以内、95%の場合には1.29倍以内に予測し、これは深さのみの予測器を1ナット上回り、復号された6つすべての物理場に転移する。同じ信号は、サンプリング分散ベースラインが逆転するまさにその状況で、分布外のオルサグ・タング渦を検出し(AUROC 0.98、深さ10で1.0)、被覆率80%で発生する誤差を15%削減する。これは深さのみのベースラインの3倍の改善である。双方向学習は負のコストで実現され、両方向でそれぞれに特化したモデルを凌駕し、逆方向の推論は高速逆ソルバーを兼ねる。LE-PDE-UQの乱流ナビエ・ストークスベンチマークでは、単一の双方向モデルが、10モデルアンサンブルの精度の1.3倍以内を学習コスト10分の1で達成し、さらに学習不要のピクセルレベルキャリブレーションとしても最良である。往復整合性は、可逆性を生成モデルにとって実用的な信頼シグナルへと変える。
テスト時訓練(TTT)は、系列モデリングをオンライン学習問題とみなす手法であり、内部学習則によって高速重みが更新される。TTTの変種は増え続けているものの、既存のアプローチは通常、各変種を個別にハードコードしており、新しいTTT手法の設計や各構成要素の役割の切り分けを困難にしている。この問題に対処するため、我々はModular TTTを提案する。これは内部学習器を有向非巡回グラフとして表現し、高速重みネットワーク、損失関数、学習率、重み減衰、正規化を明示的な設計次元として公開するフレームワークである。Modular TTTは、プリミティブレベルのtrain-view forward、train-view backward、およびcausal query-viewルールを、高速重み状態遷移を含むグラフレベルの完全なTTT計算へと自動的に合成する。Modular TTTを用いて、我々はTTTの構成要素を体系的にアブレーションし、小さな学習率での初期化、重み減衰、単層非線形性が性能を向上させる一方、MSE損失と内積損失は同様の性能を示すことを見いだした。より深い高速重みネットワークと正規化は、過度に大きな活性化を引き起こすため性能を損なう傾向があり、残差接続とゲーティングは測定可能な利点をほとんどもたらさない。これらの知見に基づき、我々は最良の変種を410Mおよび1.45Bパラメータのモデルとして100Bトークンで学習し、Gated DeltaNetに匹敵する訓練損失とベンチマーク性能を観測した。
ニューラルスケーリング則は言語モデルの開発の基盤であるが、標準的な定式化は、データ不足の領域と過学習の極端な領域において損失を系統的に過小評価および過大評価する。この失敗は、モデルサイズと学習データが損失に独立に影響するという根底にある仮定に起因する。この問題に対処するため、我々は、モデルの容量とデータを単一の相互作用指数を通じて結合する一般化された関数形式であるSkaling則を導入する。この単純な拡張により、内挿および外挿の両領域において平均絶対パーセント誤差(MAPE)が1.5〜3倍減少する。低計算量領域に制限されたスパースグリッド戦略と組み合わせると、Skaling則は一様なスイープよりも約10分の1の計算量で正確なフルグリッド外挿を達成する。小規模実験からの信頼性の高い性能予測を可能にすることにより、Skaling則は、次世代モデルの学習における計算予算の配分のための、より堅牢でリソース効率の高い枠組みを提供する。
人間の行動データでファインチューニングされた大規模言語モデルは、汎用的な認知プロキシとして登場してきたが、それに必要なスケール、およびこれらのモデルが課題構造を処理しているのか、それとも統計的ショートカットを利用しているのかは、依然として未解決の問いである。我々は、160の実験における1070万件の試行レベルの選択からなるデータセットPsych-101を用いて、4つのアーキテクチャファミリーにわたる135M〜14Bパラメータの14モデルを訓練した。分布内では、スケールはほとんど影響しない。モデルは、あたかも天井に突き当たっているかのように狭い範囲に収まり、0.6B〜1Bパラメータで、未学習の被験者において70Bのベースラインに匹敵するのに十分である。分布外では、その範囲は著しく急峻なスケーリング勾配へと広がり、より大きなモデルが新奇な課題構造への汎化において明確に有利となる。これらのモデルがどの情報を用いているのかを特定するため、我々は2つの診断を実施した。27の実験にわたり、4つのプロンプトチャネル(課題教示、実験刺激、結果フィードバック、選択履歴)を段階的に除去し、試行順序を並べ替えた。刺激とフィードバックの内容をマスクすると、学習された情報の75.7%が破壊され、モデルは偶然水準以下に押し下げられた。これは、選択履歴だけではパフォーマンスを説明できないことを示している。並べ替えでは、独立な試行からなる課題では不変性が見られる一方、試行順序が以前の反応によって決定される課題では感受性が見られた。したがって、小規模な認知ファインチューニングモデルは、心理学実験のノイズ天井推定器として有望であるが、その適用範囲は訓練中に観察されたパラダイムに限定される。
プロンプト、プログラム、MLワークフローを最適化する最近のシステムは、通常、進化的探索、バンディット、テキスト勾配法などの明示的な外部ループ制御器に依存している。我々は、この探索方針のどの程度を単一のツール利用エージェントが内面化できるのかという、根本的に異なる問いを提起する。我々はReASearchを提示する。これは推論駆動型最適化のための統一フレームワークであり、エージェントが何を評価するか、失敗をどのように診断するか、どの編集を行うか、いつ検証または再開するかを自律的に決定する。単に手設計のヒューリスティクスに導かれた提案生成器として機能するのではなく、エージェントは結果を能動的に分析し、予算を配分し、永続的メモリを通じて長期的な視野で戦略を洗練させる。共有エージェントループとドメイン固有ツールにより、ReASearchはまったく同じスキャフォールドをインスタンス化し、プロンプト、プログラム、MLワークフローを最適化する。多様な14タスクにわたり、ReASearchは専用最適化システムと競争力があり、ほとんどの場合でそれらを上回り、強力なドメイン固有ベースラインに対して2%から40%の改善を達成し、場合によっては従来の人間による既知最良結果を改善する解を発見する。重要なことに、通常は明示的制御器によって実装される複雑な探索行動が、エージェントの推論プロセスから自然に出現することを我々は観察する。
AIコーディングアシスタントの広範な統合は、開発速度の向上という否定できない利点をもたらす。しかし、最近の研究は、拡大するトレードオフを指摘し、コード品質と保守性に関する根強い課題を明らかにしている。先端AI研究所を含む業界リーダーもこれらの懸念を共有している。大規模言語モデルが本番コードの作成にますます依存されるようになるにつれて、出荷されるソフトウェア品質への影響を理解することが重大な優先事項となっている。しかし、産業ワークフローにおけるこれらの影響の評価は、可観測性の障壁のために依然として困難である。我々は、毎日何十億ものユーザーに依存されるグローバル製品を展開する大企業における、本番品質に対するAI生成コードの影響を研究する。この規模とユーザーの信頼により、当該組織はコード品質を重視し、本番環境にデプロイされるすべてのコード行に対して徹底した可観測性を構築してきた。これにより、測定上の障壁を克服し、これらの影響を評価することが可能となっている。 本研究は、2025年4月から2026年4月までのAI生成C++コードに関する大規模な実証分析を提示し、この企業のブラウンフィールドコードベースにおける352万件のコード変更を追跡する。その中心的目的は、大規模な本番環境において、AI生成コードが人間が記述したコードと比較して、品質、性能、保守性の観点からどのような特性を持つかを理解することである。我々は、AI生成C++コードが明確な品質プロファイルを持つことを見いだした。すなわち、インターフェースと結合の負担が高く、コピーとアロケーションのオーバーヘッドが大きく、最適化された標準APIではなく明示的なループに依存する傾向がある。これらの問題は、レビュー工数の増加や計算リソース消費の5〜8%の増加といった、具体的な下流コストに直結する。しかし、モデルに対して分類体系に基づく的を絞ったフィードバックを提供することにより、これらの影響を軽減できることを実証し、対象とした静的解析警告を11.1%削減し、計算効率を向上させることを達成した。
特権的オン・ポリシー蒸留は、訓練時のみ利用可能な参照(成功軌跡など)にアクセスできる同期された教師が、各ターンで生徒の応答を再スコアリングすることを可能にすることで、マルチターンエージェントに密な教師信号を提供する。しかし、対話環境では、生徒のそれまでの行動が実行状態を継続的に変化させる。生徒が異なる行動を取ったり、サブゴールを異なる順序で完了したりすると、そのロールアウトは参照がカバーしていない状態に到達することがあり、参照は実際に到達した状態に対して信頼できないガイダンス源となる。したがって、特権的蒸留を無差別に適用することは、状態と参照のミスマッチを生み出す。このミスマッチは、生徒の現在の実行状態と互換性を保つ特権的参照ガイダンスを提供するという中心的な目的を動機付ける。我々は、特権的軌跡がオン・ポリシー生徒をいつ、どのように導くかを明示的に決定する State-Matched Routing and Contextualized Self-Distillation(SMRC-SD)を導入する。各ターンにおいて、SMRC-SD は、生徒の現在の実行状態が参照軌跡に沿ってサポートされている状態と一致するかを検証する。蒸留は一致した状態でのみ適用され、参照が局所的に互換性のあるガイダンスを欠いているターンは除外される。各一致状態について、SMRC-SD はさらに、成功軌跡から状態条件付き教師コンテキストを構築し、実際に到達した状態に基づく教師信号を提供する。ALFWorld と WebShop において、SMRC-SD は、無条件の成功全軌跡蒸留を一貫して上回る。Qwen3-1.7B を用いた場合、ALFWorld ではタスク成功率が 0.746 から 0.865 に、WebShop では 0.574 から 0.693 に改善される。制御されたルーティングとコンテキストのアブレーションは、局所的にサポートされたターンの選択と状態に適合した教師コンテキストの構築の両方がこれらの改善の要因であることを支持する。コードは https://github.com/liujunzhuo/SMRC-SD で入手できる。
高度にリアルなディープフェイク動画を作成するための生成AIの悪意ある利用は、深刻な倫理的懸念を引き起こし、AI安全性に大きな課題を突きつけている。しかし、既存のディープフェイク動画ベンチマークは、最近の合成手法のカバー範囲が限られており、一般に信頼性の高い詳細なテキストアノテーションも欠いている。一方、従来の検出器やマルチモーダル大規模言語モデル(MLLM)は、単一モデルとして動作する場合も、単一の分析視点に依存する場合も、微細な偽造アーティファクトを捉え損ねることが多く、新興のAI生成手法への汎化が制限されている。これらの限界に対処するため、我々はFaceVid-Forensics-100Kを導入する。これは、10万本の動画からなり、Seedance 2.0などの最近の生成器を含む、フェイススワップ、フェイスリエナクトメント、顔全体の合成にわたる33種類の合成手法を網羅する大規模ディープフェイク動画データセットである。このデータセットは、高度なMLLMを活用したマルチモデル集約・競合解決パイプラインを通じて自動生成された、視覚的観察の詳細なテキストアノテーションと、判定結果と整合するフォレンジック説明を提供する。このベンチマークに基づき、我々は、テクスチャ、照明、動き、物理という4つの観点から偽造手がかりを独立に分析する4つの専門分野特化エージェントを用いるマルチエージェントフォレンジック推論フレームワークを提案する。次に、判定エージェントがそれらのレポートを統合し、説明とともに最終予測を生成する。ドメイン外テストセットに対する広範な評価により、我々のフレームワークは、完全に小規模なオープンソースMLLMのみで構成されているにもかかわらず、クローズドソースのGPTおよびGeminiモデルを含むすべての手法を上回り、このベンチマークの報告されたすべての指標で第1位を獲得した。プロジェクトページは https://xavierjiezou.github.io/ARGUS/ で入手可能である。
パーソナリティ条件付きLLMエージェント(PC-Agents)は、感情サポート、社会的シミュレーション、ロールプレイングにおいてますます使用されており、長時間の対話にわたって一貫性を維持する生涯エージェントの開発を動機づけている。そのような一貫性の重要な構成要素はパーソナリティの進化である。すなわち、エージェントは、さまざまな文脈でライフイベントを経験するにつれて、心理学に基づく妥当な変化を経るべきである。先行研究は、LLMのパーソナリティが文脈的摂動によって変化し得ることを示しているが、その変化が特性、イベント、ペルソナ、モデルによってどのように異なるかは、いまだ十分に理解されていない。本研究では、ビッグファイブ特性を心理測定的アンカーとして用い、その軌跡を人間のパーソナリティ心理学における縦断的証拠と対照させながら、11の主要なライフイベント後のイベント誘発性パーソナリティ変化を検討する。4つの分析軸にわたって、PC-Agentsは、人間の変化方向が記録されているイベント–特性ペアと記録されていないペアの両方で、同程度の割合で測定可能な特性変化を示す。変化が期待される方向に沿っている場合でも、その大きさは通常、人間の効果量の範囲を下回る。性別および文化圏のプロンプトは調整効果をほとんど示さず、ペルソナレベルのばらつきは人間のサンプルと比較して3〜4分の1に圧縮される。系統的な比較を可能にするため、我々はイベント誘発性パーソナリティ変化の方向の忠実度を評価する再利用可能なベンチマークBFI-Adaptを導入し、これを用いて14のモデルをランク付けする。検証スイートは、測定された変化がイベントなしの再検査ノイズを上回り、独立に言い換えられたプロンプトの下でも安定しており、シナリオベースの行動選択との収束が限定的かつモデル依存的であり、無関係な対話が介在しても持続することを示す。これらのチェックを総合すると、測定された軌跡は、イベント条件付きのロバストな応答パターンとして確立される。我々の結果は、現在のPC-Agentsが人間のパーソナリティダイナミクスの平均をシミュレートするが、その形状はシミュレートしないことを示唆する。
公開ベンチマークのテストデータは必然的に事前学習コーパスへ混入し、一度記憶されると評価スコアを水増しする。汚染緩和評価は、デコード過程に介入して記憶を抑制し、汚染モデルの真の能力を回復することを目的とするが、その一般的な指標であるG-AP(Gap of Aggregate Performance、総合性能ギャップ)には欠陥がある。離散的な正誤の読み取りでは質問ごとの性能を適切に特徴づけられず、差分を取る前の平均化によって過剰抑制と過小抑制が相殺される。さらに、質問ごとに一様な重み付けを行うため、正解確率をクリーンモデルの高頻度の値へ押し上げる戦略を招く。我々はSA-PPG(Stratified Aggregate of Per-question Probability Gaps、質問ごとの確率ギャップの層別集計)を提案する。これは各質問の正解確率をサンプリングにより推定し、質問ごとにクリーンモデルとの差分を取り、クリーンモデルの正解確率に基づいて定義されたグループ内で集計するものである。既存の緩和戦略は、まず汚染箇所を推定し、その推定に対して操作を行うため、その正しさは推定の正しさに依存する。一方RailCapは生成中に汚染を判定する。サンプルが貪欲軌道に戻るたびに、軌道の次のトークンを次点に制限し、応答分布が十分に分散するまで抑制を累積する。複数の汚染モデルとベンチマークにわたる評価で、SA-PPGは既存戦略による回復が大幅に過大評価されていることを明らかにし、RailCapが最も低いSA-PPGを達成した。
MLLM(マルチモーダル大規模言語モデル)の創造的能力は、デザイン、コミュニケーション、教育、人間とAIの協働において重要である一方、明示的な目標や報酬シグナルが精度重視のタスクと比較して乏しいため、評価が困難である。概念横断的理解は、受容的創造性の根幹をなす認知能力であり、非自明的ではあるが意味のある概念間関係から、送り手の意図した意味を把握することを可能にする。我々は、項目構築を概念横断的エンコーディングとして、モデルの推論を概念横断的デコーディングとして操作化する。本論文では、成語に基づく概念横断的創造性のための認知に着想を得た評価フレームワークであるC4を提案する。そのエンコーディング要素は、手動で注釈付けされ第三者によるレビューを経た概念横断ネットワーク上のブリッジ経路に沿って、対象スロットをイメージ可能な代替概念にマッピングし、明示的な構造を持つバッチ生成、ブリッジ数と深さによって指標化される難易度、および厳密な解答を可能にする。本フレームワークを用いて、184件の合成項目と、オンラインソースから収集した37件の人間作成による概念横断的成語表現からなるC4評価セット(C4-Eval)を具体化する。収集した表現について、概念横断的関係、ブリッジ経路、推論プロセスを手動で構築・レビューする。各C4-Eval項目は5つのタスク設定で具体化され、合計884件の一次解答復元ケースが生成される。評価した10のMLLMのうち、最も高性能なクローズドモデルは一次正解率50.7%および48.0%に達する一方、オープンソースモデルは大幅に低い水準にとどまる。候補制約は正解率を大幅に向上させるが、ブリッジヒントや説明要求による改善は限定的である。これらの結果は、現在のMLLMが概念横断的関係を通じて創造的に符号化された意味を復号する際の大きな隔たりを浮き彫りにする。コードは補足資料に含まれる。
視覚コンテンツがAIパイプラインに入ると、その所有者は、コンテンツがどのように使用されるかについて技術的な制御をほとんど維持できないことが多い。法的・規制上の救済手段は悪用に対処できるが、多くの技術的介入は、コンテンツが公開またはアクセスされる時点という、より早い段階で適用されなければならない。本サーベイは、この介入点を中心に発展してきた保護的パラダイムを考察する。我々はこれを「善のための敵対的攻撃(adversarial attacks for good)」と呼ぶ。学習済みモデルへの攻撃として長年研究されてきた摂動や構造化信号は、代わりにデータ所有者、作成者、プラットフォーム、または監査者によって、不正な自動化を妨害したり、その後の説明責任を支援したりするために適用される。5つの研究コミュニティは、ほぼ独立にこの逆転に到達しており、それぞれが視覚資産のライフサイクルの異なる段階を扱っている。すなわち、共有時における不要な認識を防ぐプライバシーフィルタ、不正な学習を防ぐ学習不能な例、悪意のある編集や模倣を防ぐ生成的防御策、自動エージェントに対するアクセス制御のための敵対的CAPTCHA、そして流通後の帰属のための来歴メカニズムである。これらは互いに相容れない成功基準を持つ別々の場で開発されてきたが、これらの手法の多くは、人間の知覚、意味解釈、機械の推論の間に存在し続けるギャップを利用しており、視覚パイプラインがマルチモーダルモデルや自律エージェントへと進化しても、このパラダイムが引き続き関連性を持つことを示唆している。これらの主張を比較可能にするため、我々は5つのファミリーすべてを、転移可能性、適応可能性、展開準備性という共通の軸に沿って評価する。ライフサイクル全体を通して、ほとんどの保護策は依然として静的または適応性の低い攻撃者を主な対象として検証されており、管理されたベンチマークを超えた証拠はほとんどないことが分かる。最後に、堅牢で、構成可能で、展開可能な所有者側保護を実現するためのステージ横断的な対策と未解決問題を整理する。
LLMベースのエージェントは急速に進歩しており、ユーザーに代わって外部ツールを自律的に呼び出し、複数ステップにわたるタスクを完了させる。しかし、エージェントはタスクに必要な範囲を超えてセンシティブ情報を取得することが多い。既存のプライバシーベンチマークは、エージェントの応答や外部アクションが何を開示するかを監査しているが、データが最初にエージェントのコンテキストに入る取得段階は見落としている。過剰取得された情報は、一度の不注意なアクションや攻撃によって、完全な漏えいに直結し得る。この問題の広がりを評価するため、我々は取得段階におけるLLMベースエージェントのプライバシー漏えいを評価するベンチマークPrivacyPeekを提案する。PrivacyPeekには、7つの取得行動と16の応用分野にわたる1,182件のケースが含まれる。具体的には、取得検査(Acquisition Inspection)がエージェントのツール呼び出し履歴を調べ、呼び出したツールと受け取ったデータの両方を検証することで、タスクの範囲を超えてセンシティブ情報を取得した場合を検出する。続いてプローブ誘発(Probe Elicitation)が追跡プローブを発行し、攻撃者が、エージェントが取得したものの未開示のセンシティブ情報をどの程度容易に引き出せるかを測定する。4つのモデルファミリーにわたる10種類のLLMベースエージェントによる実験では、センシティブ情報の不要な取得が広く見られることが示された。さらに、タスク完了能力と取得段階の漏えいの間には相関があることが観察される。プロンプトレベルの防御策は取得段階の漏えいのごく一部しか低減できず、大部分は軽減されないままである。これらの結果は、取得段階のプライバシー監査が緊急かつ必要であることを示している。データセットとコードはhttps://github.com/Xuan269/PrivacyPeek-Resourceで公開している。
系列モデルは、メモリに何を書き込むか、何を保持するかを決定しなければならない。量子および量子に着想を得た系列学習では、非線形なリカレント更新はしばしば回路評価の反復と時間方向の逐次誤差逆伝播を必要とするため、長いコンテキストではコストが高くなる。量子に着想を得たコルモゴロフ=アーノルドネットワーク(QKAN)に基づくゲート付き高速ウェイトプログラマ(FWP)は、コンテキストを時間変化する高速パラメータに格納することで、このボトルネックを緩和する。しかし、そのスカラーゲートは、単一の保持・書き込みバランスを全ての高速状態座標に適用するため、全パラメータが同一のメモリ時定数を共有せざるを得ない。我々は、このブロードキャストゲートを、低ランク生成による要素ごとの変調に置き換えた自己変調型QKANベースFWPを導入する。この変調は、新しい提案ブランチ、有界な旧状態ブランチ、またはその両方に適用される。さらに我々は、相補行列ゲーティング(Complementary Matrix Gating, CMG)を提案する。これは、1つのシグモイド行列ゲートを用いて旧状態を保持し、その補(complement)を用いて新しい提案を書き込む。CMGは、スカラーゲーティングの有界な凸更新構造とアフィン・プレフィックススキャン構造を保ちつつ、座標ごとのメモリ制御を提供し、単一分岐規則からなる変調ヘッドというコストのみで実現される。我々は、古典およびQKANベースの低速・高速プログラマを組み合わせた4つのFWPアーキテクチャにわたり、4つの自己変調規則をスカラーゲーティングと比較する。7つの1ステップ予測ベンチマークと5つの系列長にわたり、CMGは、高速プログラマがQKANベースのモジュールを組み込んだアーキテクチャに対して最も一貫した改善をもたらす。CUDA-Q Dynamicsを用いてシミュレーションされたJaynes-Cummingsおよびトランスモン共振器ダイナミクスの直接マルチステップ予測では、CMGモデルは、予測ホライズン4、8、16ステップにわたり平均二乗誤差を0.001程度以下に維持し、スカラーゲート付きの対応モデルと比較して少なくとも91.2%の改善を達成する。これらの結果は、座標ごとの相補的変調がQKANベースFWPにとって安定かつ効果的な更新であることを確立するものである。
世界生成モデルは通常、それらが生成するものを通じて使用される。すなわち、レンダリングされた未来、ビデオ条件付きの行動、あるいはコストのかかる生成ブランチによって計算される潜在コンテキストである。我々は、それらのより再利用可能な資産は未来を構築する計算であると主張する。生成器が破損した未来を一貫した軌道へと変換する際、その中間状態は外観、空間的レイアウト、相互作用を抽象度のレベルにわたって整理する。この未来生成計算は、現在のみから推論される表現に内部化できるのだろうか。我々は、この計算を現在の視覚的文脈と言語指示から予測される表現へ転送するEnfoldを提案する。訓練中は、生成器が観測された未来を処理する際に露出される多レベルの状態が、現在のみを入力とするエンコーダを監視する。学習された表現は未来生成を条件付けるためにフィードバックされ、タスクの勾配がエンコーダを再形成するのを許すことなくタスクヘッドによって読み取られる。デプロイ時には、行動予測はもはや生成器を実行しない。LIBERO、RoboTwin2.0、および実ロボットタスクにおいて、Enfoldは強力な制御を実現しつつ、行動レイテンシをFast-WAM比で3.7倍削減し、Enfold-Flashは10.1倍の削減を達成する。表現分析は、それが無関係な変動を抑制し、より長い時間的範囲にわたって現れる変化を優先的に捕捉することを示している。現在のシーンが人間の介入によって変更されると、生成された継続と実行された行動の両方が適応する。これは固定された軌道のリプレイとは矛盾する。これらの結果は、世界生成器を予測的制御表現の源泉として再解釈するものである。すなわち、その未来は、その内部構造が現在に折り畳まれ得るのであれば、すべてのステップで具現化される必要はない。
ターンテイキングはフルデュプレックス対話の中核的構成要素である。どのターンテイキング行動が適切かはシナリオによって異なるが、現在のモデルは文脈に関係なく単一の規範を適用する。この限界は訓練データに起因する。人間同士の音声コーパスは自然なタイミング現象を捉えているが、役割のグラウンディングやシナリオ固有の規範はほとんど提供しない。一方、ヒューリスティックまたはプロンプトによる合成手法は、人間の選好に基づかずにターンテイキング行動を注入する。我々は、少数のスロットレベルにおける人間の選好アノテーションに対してLLMの予測を較正することで、シナリオ適応型ターンテイキングを持つ対話を生成するフレームワークDuplexGenを導入する。6つの協力的および競争的タスクにおいて、人間のターンテイキング選好は系統的に異なり、DuplexGenは、較正されていないプロンプティングや一般的な人間同士のデータのみでの訓練よりも、それらの選好と大幅に密接に一致する。また、DuplexGenが生成したデータで訓練されたフルデュプレックスモデルは、特徴的で人間に好まれるターンテイキング行動を示す。これらの結果は、ターンテイキング合成をシナリオ固有にするのは、コーパスの規模やプロンプト設計だけではなく、人間による較正であることを示している。
犬が口を開けて吠えるとき、人間はその音が何であるか、そしていつ発生するかを自然に認識する。この同じ能力を持つ音声-視覚モデルを構築するには、意味的整合性と時間的整合性の両方を捉える表現が必要である。現在のアプローチはどちらか一方の側面で不足している。埋め込みモデルは意味的には一致するが時間情報を失い、同期モデルは時間オフセットを捉えるが意味的理解を欠いている。このギャップを埋めるために、我々はFATE(Frame-level Audio-visual Temporal Embedding)を提案する。各モダリティを単一の埋め込みにプーリングして時間情報を捨てる従来の埋め込みモデルとは異なり、FATEはフレームレベルのシーケンスを保持し、それらを実時間軸上で整列させ、厳密に整列したフレームペア間で類似度を計算する。オフセット予測のみを出力する同期モデルとは異なり、FATEは同期情報を再利用可能な埋め込み空間にエンコードし、ビデオ間の意味的対比学習とビデオ内の時間的対比学習を組み合わせた結合目的関数で訓練される。これにより、何が鳴るかといつ発生するかの両方を捉える。3つのタスクにおいて、FATEは時間的および意味的検索において最強のベースラインを大差で上回り、ゼロショット設定でのイベント位置特定では完全教師あり手法に匹敵し、生成評価指標として人間の判断との相関において最高の結果を達成する。ソースコードは https://github.com/guankaisi/FATE で入手できる。
視覚言語モデルは、身体化エージェントの推論の中核としてますます重要な役割を果たしつつある。ロボットの実行は本質的に反復的であり、各動作がシーンと物理状態を再形成し、知覚され、推論され、検証されるべきものを絶えず更新する。こうした要求に応えるには、教師信号、予測形式、検証基準が異なる相補的な能力が必要となる。既存の手法は通常、これらの能力を孤立したタスク固有の目的に対して開発しており、実行全体を中心にそれらをどのように組織化し統合するかは未解決のままである。本稿では、実行中心の能力分類法に基づいて構築された身体化視覚言語モデルCapek 0.5を提案する。この分類法は、データセットやタスクごとに訓練を構成するのではなく、実行全体を通じた機能的役割に従って身体化能力をグループ化し、空間推論、時間理解、行動指導、状態検証の4つの能力群から構成される。各能力はまず、共有バックボーンからの検証可能な報酬を用いた強化学習によって専用のスペシャリストが獲得し、その後、スペシャリストは重み空間マージとそれに続くルーティング付きポリシー空間蒸留によって、単一の推論時モデルに統合される。我々はCapek 0.5を2Bおよび35B-A3Bスケールで実装し、状態検証のための新しいベンチマークであるCapek-StateBenchを含む包括的なベンチマークスイート、スペシャリストから統合モデルへの能力保持に関する統制研究、シミュレーションされた身体化環境におけるクローズドループ評価という3つの相補的な観点から評価する。Capek 0.5は、対応するベンチマーク行の大部分で初期化時よりも改善し、4つすべての専門能力を定量化された損失とともに単一のチェックポイントに保持し、クローズドループの身体化タスク実行へ転移する。
基盤モデルは、通常は自己教師あり学習(SSL)を用いて、大量のラベルなしデータから転移可能な表現を抽出するために使用される。しかし、これらのモデルの多くは解釈可能性が限られたアーキテクチャに依存しており、医用画像のような高度な安全性が求められる領域では重大な問題となる。我々はDualIFMを提案する。これはBagNetバックボーンを介して設計上解釈可能な基盤モデルであり、その小さな受容野がモデルの意思決定プロセスに忠実なクラス根拠マップを生成する。さらにDualIFMは、事前学習中に2次元射影層を組み込み、表現空間の直接可視化を可能にし、意味のある臨床クラスタや潜在的な擬似相関を含む学習された構造をデータセットレベルで提供する。我々は、さまざまなソースからの80万枚以上のカラー眼底写真でDualIFMを訓練し、異なる下流タスク向けの汎化可能な表現を学習した。本モデルは、16倍のパラメータを持つRETFoundに匹敵する性能を達成しつつ、分布外データに対して解釈可能な予測を提供する。これらの結果は、大規模SSL事前学習と本来的な解釈可能性を組み合わせることで、網膜画像のための堅牢な表現が得られることを示唆している。コードと事前学習済みモデルはgithub.com/berenslab/interpretable_FMで公開されている。
映像言語モデルのベンチマーク評価は、これまで主に短いクリップと単文レベルの指標に焦点を当てており、現在のシステムが正確な長文・段落レベルの記述を生成できるかどうかは未解明のままである。本稿では、5時間分の映画コンテンツを90秒のクリップに分割し、各クリップに専門家が執筆した段落形式の参照記述を対応付けた、長文映像記述のための評価スイートCLIP-CC-Benchを導入する。本評価スイートは、5つの最先端LLMベースの埋め込みモデルのアンサンブルを採用して信頼性を高め、単一モデルのバイアスを軽減する。また、(i)粗粒度の意味マッチングと(ii)細粒度の意味マッチングという2つの相補的手法を適用し、モデルが生成した記述をCLIP-CC-Benchの参照記述と比較する。この枠組みを用いて、17の最先端映像言語モデルを評価し、ボルダ集約によるランキングとCLIP-CC-Benchにおける平均スコアの両方を報告する。さらに、判定者間一致度とブートストラップ法によるランキング安定性を通じて、本プロトコルの内部信頼性を定量化する。再現可能性を支援するため、標準化された評価スクリプト、モデル出力、集約ツールをhttps://github.com/Multimodal-Intelligence-Lab/CLIP-CC-Benchで公開する。CLIP-CC-Benchは、既存の短いクリップ向けおよびQA専用のベンチマークが残したギャップを埋め、長文映像記述のための実用的な評価枠組みを提供するものである。
マルチモーダル大規模言語モデル(MLLMs)は、感情知能において顕著な能力を示してきた。しかしながら、既存研究は主にタスク特化型の専門化に焦点を当てており、タスク間の相乗効果を軽視し、潜在的な推論能力を未開拓のままにしていることが多い。このギャップを埋めるために、我々は感情の知覚・理解・相互作用を習得できる統合的感情汎用モデルであるOneEmoを提案する。この目的のため、まず人間参加型ワークフローを通じて専門的な感情知識を明示的な推論軌跡へと蒸留する包括的データセットEmoWorld-130Kを構築する。このコーパスに対する教師ありファインチューニングにより、マルチタスク学習から得られる顕著な相互利益が明らかになる。次に、潜在的な推論能力を完全に引き出すために、統合的なマルチタスク報酬配分を通じて最適化を安定化させる新規の強化学習戦略であるEmo-Chordを提案する。広範な実験により、OneEmoはほとんどのベンチマークにおいて類似サイズのベースラインに対して最先端の性能を達成することを実証する。特筆すべきことに、OneEmoは商用モデルよりもパラメータ数が大幅に少ないにもかかわらず、非常に競争力のある結果をもたらす。本論文は、より信頼性が高く解釈可能な感情コンピューティングへの道を開くものである。コードはhttps://github.com/waHAHJIAHAO/OneEmoで公開している。