翻訳付きの日次キュレーションされたAI研究論文
検証可能な報酬を用いた強化学習(RLVR)は、言語モデルの推論能力を向上させる強力な手法だが、新しい強力なモデルに適用するたびにコストがかかる。なぜなら、訓練中にターゲットモデルが多くのロールアウトを生成する必要があるからだ。モデルが大規模化するにつれて、事後学習そのものがボトルネックとなる。本研究では、弱から強への代替アプローチを検討する。すなわち、ロールアウトがより安価な小規模モデルでRLを実行し、そのRL実行で得られた知見を再利用して、より強力なターゲットモデルを改善する。RL後の弱い教師を直接蒸留するだけでは不十分である。なぜなら、教師の最終的な方策には、有用なRLの利得と小規模モデルの限界が混在しているからだ。我々は、オン方策直接蒸留(Direct-OPD)を提案する。これは、教師のRL誘導方策シフトを転移する手法である。Direct-OPDは、RL後の教師とRL前の自身の参照モデルを比較し、それらの対数比を学生モデルに対する密な暗黙の報酬として扱う。平たく言えば、チェックポイントのペアは、RLによって弱いモデルがどの行動を取る可能性が高まったか、または低くなったかを示しており、Direct-OPDはその信号をより強力な学生の自身のオン方策状態に適用する。これにより、弱いモデルのRLによる監視信号を直接再利用し、ターゲットモデルに対して疎な報酬のRLを実行する必要がなくなる。実験的に、Direct-OPDは一貫して弱い教師を活用し、より強力なターゲットモデルを改善する。特に、Qwen3-1.7BをAIME 2024において48.3%から58.3%に向上させ、その際、8基のA100 GPU上でわずか4時間しか要しない。これは、ステップマッチングによる直接RLを上回り、複数の方策シフトの逐次合成も可能にする。本研究の結果は、RLの成果を最終的な模倣対象としてだけでなく、暗黙の報酬信号としてモデルスケール間で再利用できることを示している。
視覚言語ナビゲーション基盤モデルは、接地された空間的決定のための深い推論と、多様な具現化タスクに対する広範な汎用性を統合することを目的としています。現在のアプローチは、典型的には観測を直接行動にマッピングするモノリシックなポリシーを通じてこの統合を達成していますが、しばしば座標ドリフトやロングテールセマンティクスの不十分な処理に悩まされています。さらに、これらのブラックボックス的なマッピングは解釈可能性を欠き、汎用性、堅牢性、透明性の同時達成を妨げています。我々は、汎用視覚言語ナビゲーション基盤モデルへの一歩であるABot-N1を提案します。これは、二重視覚言語信号によって導かれる遅速アーキテクチャを介して認知と制御を分離することにより、これらの課題に対処します。より具体的には、低速な視覚言語推論器が明示的なチェーン・オブ・ソート推論を実行し、同時にピクセル目標を生成します。このコンパクトな画像空間アンカーポイントの集合は、ポイントゴール、オブジェクトゴール、POIゴール、指示追従、人物追従などの多様なタスクのための普遍的なインターフェースとして機能します。その後、高速な行動専門家がテキストキューとピクセルガイダンスの両方を活用し、ネイティブ制御周波数で連続的なウェイポイントを生成します。明示的な言語的トレースと対になったピクセル接地アンカーを通じて高レベルの意図と低レベルの制御を橋渡しすることにより、我々のアプローチはシミュレーションと実世界のベンチマークにわたって堅牢で汎用的かつ解釈可能なナビゲーションを保証します。ABot-N1は新たな最先端記録を打ち立て、特に都市規模のナビゲーションにおいて大きな改善をもたらします。POI到着率を35.0%向上(77.3%に)、複雑な屋内および屋外シーンで95.4%/92.9%の成功率(SR)を達成しました。また、オブジェクト到達、人物追従、指示追従タスクにおいて優れた堅牢性を維持します。新しいPoint-Goal/POI-Goalベンチマークがオープンソースとして公開され、都市規模のナビゲーション分野を前進させます。
近年のVLMおよびVLAシステムにより、ロボットの知覚と行動予測は向上しましたが、長期的なタスクを遂行する身体化エージェントには、推論、記憶、ツール使用、検証、異なる身体での実行を可能にする汎用ランタイム層が依然として必要です。本稿では、低レベル制御装置の上位に位置し、シーン条件付き計画、コンテキスト分離型スキル実行、多段階検証、マルチモーダル記憶、エッジ・クラウド連携を提供する、汎用ロボットエージェントオペレーティングシステム「ABot-AgentOS」を提案します。このようなシステムを評価するため、16の屋内・屋外・ハイブリッドシーン、4段階の難易度、ナビゲーション・物体探索・NPC対話・動的イベント・トレースに基づく評価を含む200以上のタスクで構成される実行可能なベンチマーク「EmbodiedWorldBench」を導入します。ABot-AgentOSはさらに、対話、視覚観測、空間コンテキスト、時間関係、タスクトレースを型付きノードとエッジに変換する、永続的なソースに基づいた基盤「Universal Multi-modal Graph Memory」を導入します。失敗駆動型自己進化ループは、診断された記憶の失敗を、ランタイムでゲート制御された進化資産に変換し、これらは後続の評価分割に対してのみ昇格されるため、現在の分割における正解データの漏洩を防ぎつつ、継続的な改善を可能にします。初期のEmbodiedWorldBenchサブセットにおいて、ABot-AgentOSは単一コントローラベースラインと比較して、タスク成功率と目標達成度の両方で改善を示しました。記憶ベンチマークでは、ABot-AgentOS StaticはLoCoMoで87.5、OpenEQA EM-EQAで59.9、Mem-Galleryで88.6、NExT-QAでAcc@All 76.5を達成し、自己進化によりLoCoMoは88.7、OpenEQAは60.4、Mem-Galleryは89.0にさらに向上しました。これらの結果は、汎用Agent OS層が長期的な身体化実行を改善し、継続的な対話のための永続的で監査可能な記憶を提供できることを示唆しています。
既存の動的人物パフォーマンスのボリュメトリックキャプチャは、密なカメラアレイを用いることで高い忠実度を達成しています。しかし、現実世界のシナリオでは、重なり合いの少ない少数のカメラしか利用できず、出力品質が低下し、広い領域が観測されないままになります。最近の4D再構成手法は低オーバーラップ設定に焦点を当てていますが、観測不十分な領域では依然として顕著なアーティファクトが生じます。ビデオ拡散モデルも別の選択肢として登場していますが、人物に対して幾何学的に一貫性のない結果を示します。これらの制約に対処するため、我々はStudioReconを提案します。これは、背景と人物を分離することで、スパースで低オーバーラップなカメラから4D人物シーンを再構成するパイプラインです。ビデオ拡散モデルを用いてカメラ制御された数百の新規ビューを合成することで、背景の教師信号を高密度化します。また、クロスビューID対応付けと三角測量によるマルチビューキーポイントフィッティングを用いて、変形可能なガウス人体表現をロバストに初期化します。最後に、動作適応的一貫性注入を備えた再帰的拡張モジュールが、合成された出力を調和させ、残存するアーティファクトをさらに回避します。我々は4つの実世界データセットにおいて最先端の新規ビュー合成を達成し、新規軌跡レンダリングや人物置換といった応用を実証します。
モバイルおよびウェアラブルデバイス上のパーソナルAIアシスタントは、視覚および音声ストリームを通じてユーザーの日常生活を継続的に認識します。しかし、過去の経験に関するクエリに回答するには、長期の経験を継続的に蓄積、整理、検索できる軽量なマルチモーダルメモリが必要であり、これは依然として困難な課題です。この課題に対処するため、私たちは日常生活支援のための軽量ストリーミングマルチモーダルメモリシステムであるLightMem-Egoを提案します。本システムは、自己中心的な視覚および音声ストリームを継続的に取得し、それらを共有タイムライン上で整列させ、現在記憶、短期記憶、長期記憶からなる階層的メモリに整理します。ユーザーのクエリが与えられると、LightMem-Egoは動的に検索を適切なメモリレベルにルーティングし、マルチモーダルな証拠に基づいて回答を生成します。このデモンストレーションはスマートフォンやAIグラスに展開可能で、物体検索、会話の想起、生活の要約、ルーティンの発見、パーソナライズされた支援をサポートします。コードは https://github.com/zjunlp/LightMem-Ego で公開されています。
大規模言語モデル(LLMs)は高校やオリンピック形式の数学において顕著な性能を達成しているが、高度な数学における能力は十分に理解されていない。しかし、既存のベンチマークは範囲と評価の粒度の両面で不足している。カバーする分野が限られており、最終解答の正しさや大まかな判断に依存することが多く、推論プロセスの妥当性が十分に評価されていない。このギャップを埋めるため、我々はAdvancedMathBenchを導入する。これは高度な数学的推論能力を評価するためのベンチマークスイートである。中核となる証明生成ベンチマークProverBenchは、学部および博士課程資格試験レベルの296の問題を含む。証明の信頼性の高い評価を提供するため、大規模な専門家アノテーションに基づいて訓練された専用の自動検証パイプラインを開発し、正しさの判定と証明エラーの細かい評価の両方を生成する。これは、保持された証明軌跡に対して人間の専門家と強い一致を示す。さらに、モデルが証明の正当性を正しく判断し、適切な検証根拠を提供できるかを評価するため、888のモデル生成証明軌跡と専門家の正解データを組み合わせたVerifierBenchを導入する。実験では、AdvancedMathBenchが最先端モデルにとっても挑戦的であることが示された。証明生成において、最良のモデルGPT-5.5-xhighはUGD分割で75.8、QE分割で66.1しか達成しておらず、高度な数学的証明構築には改善の余地が大きい。証明検証において、最良のモデルでもBalanced F1は65.1にとどまり、モデルは一般に真陰性率が低く、重大な誤り検出が依然として大きなボトルネックであることを示唆している。
メタ認知は、効果的な学習、問題解決、意思決定、コミュニケーションなどに不可欠な知能の基盤的要素である。近年、高性能で透明性の高いAIシステムの中核として、その重要性がますます認識されている。しかし、LLMが多様な実世界タスクで顕著な進歩を遂げている一方で、いつ、どのように、またどの程度まで効果的なメタ認知能力を発揮したり付与されたりできるのか、またそうした能力をどのように応用してAIシステムの基本的な能力、信頼性、知能を向上させることができるのかは、まだ明らかになっていない。本稿は、LLMのメタ認知に関する知識の現状を包括的に概観することで、このギャップを埋める。我々は、この新興分野の研究状況を分析・分類し、LLMのメタ認知能力を測定・評価する手法やベンチマーク、LLMのメタ認知を誘発・改善・応用する技術、進行中の研究の知見と含意など、最近の技術的進歩をまとめる。また、応用、未解決の疑問と課題、そして将来の研究の有望な方向性についても議論する。本稿の目的は、このテーマに関する詳細かつ最新のレビューを提供し、有意義な研究と議論を促進することである。論文の整理されたリストは https://github.com/yale-nlp/LLM-Metacognition で入手できる。
ステアラビリティは汎用ロボットポリシーの定義的能力であるが、大規模で言語に整合し、動作精度の高いデモンストレーションデータが不足しているため、器用なハンドシステムではほとんど実現されていない。このボトルネックを解決するために、我々は、人間の主体視点映像から器用なVLA(Vision-Language-Action)の事前学習をスケールさせ、データ効率の良い実ロボットの事後学習を可能にするフルスタックシステムを提案する。このシステムは、野外の主体視点映像を厳選して9,600時間の高品質な事前学習データに変換するデータパイプラインEgoSmith(先行SOTA比で9倍のスループットとより高い精度を達成)、遠隔操作と人間参加型補正のための統合ロボットスタック、最適化されたインフラ上で訓練された世界モデル強化VLAであるEgoSteerを統合している。人間データによる事前学習は、EgoSteerに言語誘導操作の事前知識を与え、これはロボット事後学習で基盤化され、DAggerによる洗練によって改善される。経験的に、EgoSteerは40種類以上の多様なタスクにわたって自由形式の指示をロバストに実行し、障害からの回復、器用さ、一般化を示している。この事前学習モデルは、箱折りを含む複雑な長期的タスクにも、2つの身体で75%以上の成功率で少数ショット適応する。我々はシステム、データ、モデルを https://egosteer.github.io/ でオープンソース化している。
ポストトレーニングは大規模言語モデル(LLM)のドメイン固有の能力を洗練するために不可欠であるが、既存の報酬最適化手法や分布一致手法はポリシー探索と分布調整を密に結合している。この結合により、ポリシーモデルに直接コストのかかる探索を強いられ、最適化信号の非同期生成、再利用、モデル間転送が著しく妨げられる。本稿では、更新信号の探索と分布調整を根本的に分離する新しいポストトレーニングフレームワークであるProxy-guided Update Signal Transfer(PUST)を提案する。PUSTは主要モデルを高コストな探索に用いる代わりに、軽量なプロキシモデルを効率的なテストベッドとして活用し、高報酬の行動を発見する。プロキシの初期状態と最適化状態の間の相対的な改善信号を抽出し、その方向性のある更新を主要モデルに転送してポリシー調整を導く。この分離されたパイプラインは、プロキシ探索、更新信号抽出、信号転送から構成され、計算オーバーヘッドを大幅に削減するとともに、最適化信号の非同期生成、キャッシュ、再利用を可能にする。重要なのは、絶対的なポリシー分布ではなく相対的な改善を転送することで、PUSTは弱から強への改善とシームレスなモデル間転送を自然にサポートする点である。数学とコード領域にわたるQwen3ファミリーモデルを用いた体系的な評価により、実質的に弱いプロキシから抽出された更新信号が、より強い主要モデルを頑健かつ調整可能に強化できることが示された。最終的に、PUSTはポストトレーニングをモノリシックなオンライン最適化プロセスから、高度にモジュール化され再利用可能でコスト効率の高いパラダイムへと変革する。
探索はマルチエージェントシステムにおける信頼性の高い自律性にとって不可欠であるが、大規模言語モデル(LLM)エージェント同士が相互に作用する際に、効果的に探索できるかどうかは未だ明らかでない。本研究では、現代のLLMエージェントはそれができず、しばしば近視眼的で極端な相互作用パターンを示し、それが最適でない協調と後悔の増大を招くことを示す。我々はこの課題をマルチエージェント探索問題として定式化し、エージェントがピアを調査してその能力を推測し、効果的な相互作用戦略を特定しなければならない部分観測確率ゲーム(POSG)問題としてモデル化する。この問題に対処するため、我々はマルチエージェント文脈探索(MACE)を導入する。これは、構造化されたピア選択を通じて探索を明示的に促進する軽量フレームワークである。文脈的およびパラメトリック多様性の両方の設定において、MACEは探索行動と下流タスクのパフォーマンスを大幅に改善する。さらに、探索の価値はエージェントの多様性とともに増加することを理論的に示す。全体として、本結果は現在のLLMエージェントの根本的な限界を浮き彫りにし、信頼性の高いマルチエージェント自律性には明示的に誘導された探索が重要であることを強調する。コードは https://github.com/deeplearning-wisc/mace で公開される。
複雑な認知機能が人工システム内でどのように組織化されているかを理解することは、大規模言語モデル(LLM)を解釈し、それらを生物学的認知と関連付ける上で中心的な課題である。しかしながら、LLMは広範な認知様行動を示すものの、その内部表現が行動、失敗、および人間の認知との関連を説明する再現可能な機能システムを形成しているかどうかは依然として不明である。ここでは、NeuroCogMapを提案する。これは認知神経科学に着想を得たフレームワークであり、LLMの内部特徴を機能的パーセルに整理し、それらを解釈可能な機能、認知能力、および認知階層へと結び付けるものである。これらのパーセルは、安定した意味的に一貫した組織を形成しており、モデル間で部分的に保存され、モデルの出力と機能的に結び付いている。この組織内では、幻覚、バイアス、拒否失敗、迎合(おべっか)などの主要なLLMの失敗は、表象システムおよび行動制御システムにおける明確な混乱に対応しており、メカニズムに基づく検出と標的を絞った介入のための内部シグネチャを生成する。モデルの行動を超えて、NeuroCogMapは自然な言語理解中のヒトの皮質応答の予測を改善し、特に高次連合野で最も強い対応を示す。認知レベルでは、その内部シグネチャは、人間の意思決定の古典的モデルの改良を導く潜在的な戦略を明らかにする。これらの知見は、NeuroCogMapを、人工システムにおける機能組織をマッピングし、この組織をヒトの皮質機能および認知行動に関連付けるためのシステムレベルのフレームワークとして確立するものである。
言語モデルは、多様な言語・文化的文脈における道徳的意思決定にますます活用されているが、既存研究では以下の3点において多言語性が見落とされている:1)多言語評価ベンチマークが直訳に依存しており、文化固有の要素に適応できていない、2)道徳推論のための推論時手法が静的で英語中心の枠組みに頼り、道徳理論に基づいていない、3)道徳的意思決定のための訓練手法は、通常、より強力なモデルや人間によるアノテーションからの高コストな教師信号を必要とする。我々は3つの貢献を通じてこれらのギャップに対処する。第一に、言語横断的に文化に位置づけられた道徳的直感と社会的規範を捉える多言語道徳的意思決定ベンチマークMCLASHを導入する。第二に、心理学と哲学から得られた専門家厳選の理論に基づく根拠を活用した2段階プロンプト手法MET(理論に基づく多言語倫理)を提案する:モデルはまず状況・文化固有の根拠を選択し、次にユーザーの母語でそれらについて推論を行う。第三に、外部からの教師信号を一切必要としない自己蒸留訓練段階を通じて第二段階を強化するMET-D(MET蒸留)を導入する。MET-Dは、異なるサイズ・系統の3モデル(Qwen3-4B、Qwen3-8B、Gemma3-4B)すべてにおいて、ベースモデルと比較してマクロF1を平均でMCLASHでは3.71ポイント、MMoralExceptQAでは4.23ポイント向上させ、Qwen3-8Bのマレー語ではMCLASHで最大12.94ポイントの改善を達成した。さらに、MET-Dが母語による推論を平均62.13ポイント増加させること、有益な根拠が文化によって系統的に異なることを明らかにした。これらの貢献は、文化に適合し理論に基づいた多言語道徳推論への道を開くものである。
バーチャル試着(VTO)は、対象人物への衣類のリアルな転写において大きな進歩を遂げている。しかし、ほとんどのシステムでは、ユーザーが衣類の着用方法(サイズの緩さやフィット感、スタイル(例:インまたはアウト、開襟か閉襟)、身体上の空間的配置)をほとんど制御できない。本研究では、2つの相補的な貢献によりこのギャップに対処する。第一に、VIP-SAMを用いたVisual-Instance-Prompt Segmentationを定義し解決する。すなわち、衣類のフラットレイ画像を与えられた際に、それを着用した人物の写真から当該インスタンスをセグメント化する。これは、通常研究されるカテゴリレベルのセグメンテーションとは異なる、インスタンスレベルのタスクである。第二に、制御可能なVTOフレームワークであるCtrlVTONを導入する。これは試着を画像編集問題として捉え直し、セグメンテーションマスクを、スタイル、サイズ、身体上の空間的配置を含む衣類のレイアウトに対するピクセルレベルの制御として追加する。VIP-SAMとCtrlVTONは、それぞれのタスクで最先端の成果を達成している。特にCtrlVTONは、最も強力なプロプライエタリ編集システムと同等の衣類忠実度を維持しつつ、ユーザーが提供するレイアウトをはるかに忠実に再現した画像を生成する。
最近の基盤画像・動画生成モデルは強力な汎化性と制御可能性を提供しているが、それらを具現化シナリオに直接適用することは、多視点一貫性、幾何学的整合性、ロボットの身体性制約といった要件によって制限されている。既存の手法は通常、限られたロボットデータで基盤モデルを適応させることが多く、大規模事前学習で獲得した視覚知識を犠牲にしている。本稿では、統合具現化合成のための380億パラメータのマルチモーダル自己回帰モデル「Xiaomi-Robotics-U0」を提案する。本モデルは、具現化生成を基盤画像・動画生成の拡張として捉え、テキストから画像への生成、画像編集、具現化シーン生成、具現化転移、具現化動画生成を共同最適化する。この統合フレームワークは、事前学習された世界基盤モデルの汎化性を保持しつつ、それを具現化設定に適応させる。Xiaomi-Robotics-U0は、複数のロボット身体性にわたる高品質な多視点シーン生成をサポートし、多視点一貫性と相互作用ダイナミクスを保持しながら、細粒度編集のための構造化された制御可能な具現化転移を導入した最初のモデルである。本モデルは、単一ステップおよび逐次生成タスクにおいて最先端の結果を達成し、具現化シーン生成と転移における人間評価でGPT-Image-2.0を上回り、World Arenaの具現化動画生成で1位を獲得し、挑戦的な実世界操作タスクにおいてpi_0.5の分布外成功率を36.9%から63.2%に改善した。これらの結果は、基盤世界モデルが具現化世界モデルとしても、具現化知能のためのスケーラブルなデータエンジンとしても機能しうることを示している。コードとチェックポイントはhttps://robotics.xiaomi.com/xiaomi-robotics-u0.htmlで公開されている。
人の顔の生成や編集には高度な精度が求められる。わずかな変更でも、被写体の知覚される同一性が大きく変わることがあるからだ。しかし、汎用的なテキスト画像生成モデルを基にした現在の個人化手法や編集手法では、顔の細かい編集に必要な精度が不足していることが多い。本稿では、テキスト画像生成における個人化モデルに対して、細粒度の同一性チューニングを実現する手法を提案する。通常の画像編集が与えられた画像に対して処理を行うのとは異なり、同一性チューニングは特定の人物の潜在表現を修正することで、編集後の同一性を一貫して保ちつつ多様な画像を生成できるようにする。この細粒度の潜在的な同一性チューニングを実現するため、テキスト画像個人化向けに事前学習済みで凍結されたエンコーダの潜在空間を探査する。本手法は追加の学習を必要とせず、代わりに凍結されたエンコーダの既存のアーキテクチャを活用して潜在的な意味的方向性を発見する。この空間は、人物の同一性のさまざまな側面を捉える上で異なる役割を担う一連の潜在トークンから構成され、これらは多くの場合、特定の空間的または意味的な顔領域に対応する。我々は、この空間内および選択したトークンによって定義される部分空間内で意味のある方向性を特定できることを示し、局所的で細粒度かつ意味的に一貫した編集を可能にする。本手法は、質的・量的実験により、画像間での同一性の一貫性を保ちながら多様な局所的な顔編集を実現することを検証する。プロジェクトページ: https://garibida.github.io/IdentityTuning/
本研究では、アニメーションにおける多様なキャラクターへの応用が重要な、動画間のモーション転送について探求する。従来、動画のモーション転送は人間や人間に類似したキャラクター間での研究が主流であり、デジタル創作における多くの応用を可能にしてきた。しかし、これらの手法には大きな限界がある。具体的には、関連する技術的パイプラインは事前定義された人間の骨格構造に大きく依存しており、そのため骨格を条件としたモデル学習が必要となる。一方で、これらの手法は、動物など異なる種に属する多様なキャラクターに対して、その独自の動作スタイルを保持したまま一般化することが困難である。他方で、多様な骨格におけるラベル付きデータが限られているため、このタスクの大規模学習がさらに制限される。本論文では、骨格ベースのモーション転送フレームワークから脱却し、学習不要のモーション転送フレームワーク「Motion4Motion」を提案する。Motion4Motionは動画内のキャラクターの骨格ではなくモーションフローをモデル化することで、種を超えたモーション転送を容易にする。広範な実験結果と新規アプリケーションにより、本手法がベースラインを大幅に上回る性能を示すことが明らかになった。プロジェクトページは https://lhchen.top/Motion4Motion からアクセス可能である。
注意深く設計された潜在表現に基づくフローマッチングは、最近、トポロジーを考慮したメッシュ生成の強力なパラダイムとして登場している。しかし既存の手法は、頂点と接続性を共同の潜在空間で同時にモデル化しており、連続的な頂点形状と離散的な組合せ構造が絡み合っている。このため、フロー学習が複雑化し、頂点のドリフトや表面の断裂として現れる。本稿では、LATO.2を提案する。これは分解されたフローマッチングフレームワークであり、メッシュ生成を頂点フローと、実現された頂点に条件付けられた接続性フローに分解し、両方の段階を共有の粗いボクセル足場に固定する。専用のVAEが二段階を支え、サブボクセル精度で頂点を復元し、離散的な接続性を連続的な潜在空間に埋め込む。この分解に固有の二つの利点を示す。(i) 部分ごとの生成:足場を分割し、各部分を潜在容量フルに合成することで、単一の潜在表現よりも大幅に高解像度のメッシュを実現する。(ii) トポロジー適応編集:第一段階の頂点を操作することで、再最適化なしに対応する接続性を誘発する。実験により、LATO.2は幾何学的忠実度と接続性品質において、最先端のトポロジー認識メッシュ生成手法を凌駕することを示す。
なぜ単純な画像とオーグメンテーションを用いた対照学習が、下流タスクに有用な表現をもたらすのか?本論文では、定常統計量を持つ任意の画像データセットと基本オーグメンテーションの範囲に対して、対照損失の観点から最適な表現を解析的に計算することでこの問題に取り組む。特定のオーグメンテーションに対しては、第一層のフィルタが正弦波であり、その後に要素ごとの非線形性、グローバル平均プーリング、そして部分的白化を行う最終線形層が続くCNNによって最適解が達成されることを示す。また、より複雑なオーグメンテーションにおいても、そのようなCNNの最適な重みは依然として正弦波であることを示す。正弦波の周波数とその重みは、データセットの期待パワースペクトルが与えられれば、単純な注水アルゴリズムを用いて計算できる。異なる画像データセットとオーグメンテーションを用いた実験により、SGDで学習されたそのようなCNNが、経験的に第一層で正弦波を学習し、部分的白化を行うことが示される。
現在のビデオ大規模言語モデル(Video LLM)は質問応答(QA)に優れているが、大部分はブラックボックスとして動作し、検証可能な視覚的根拠なしにテキストによる回答を提供している。既存の説明可能性の取り組みは、テキストによる根拠や疎なバウンディングボックスに依存しており、オクルージョンや非剛体変形などの複雑なビデオダイナミクスを捉えるのが困難である。我々は、モデルが意味的な回答と正確な時空間的根拠(時間セグメントと密な追跡オブジェクトセグメンテーションマスクレット)を同時に出力することを要求する新しいタスク、Evidence-Backed Video Question Answering(E-VQA)を提案する。これを支援するために、識別型および生成型のピクセルレベルのグラウンディングのための初の人間検証済みベンチマークであるST-Evidenceを導入する。最先端モデルの評価により、QAの精度と真の視覚認識との間に重大な乖離があり、スケーリングだけではそれを埋められないことが明らかになった。これに対処するために、我々はスケーラブルで自動化された生成パイプラインを開発し、高レベル推論と細粒度グラウンディングを橋渡しする16万規模のデータセットST-Evidence-Instructを作成する。このデータでグラウンディングされたVideo LLMをファインチューニングすることで、対応するサイズマッチングされたUniPixelベースラインと比較して大幅な改善が得られ(例えば、7Bモデルでt-mean +27.2、J&F +13.8)、説明可能で証拠に基づくビデオ理解のための堅牢なベースラインを確立する。コードとデータは https://github.com/SalesforceAIResearch/EVQA で入手可能である。