翻訳付きの日次キュレーションされたAI研究論文
兆パラメータ規模のMoEモデルを対象とした全パラメータ事後学習では、大規模分散学習システムにおいて、深刻なメモリ負荷、非重複通信オーバーヘッド、非効率なカーネル実行など、多くのシステムレベルの課題が生じる。多くの大規模LLM学習システムはGPUベースのクラスタ上に構築されているが、本報告書では、Ascend NPU SuperPOD上でのエンドツーエンドの最適化手法を紹介する。DeepSeek-V4モデルファミリーを対象ワークロードとし、モデルレベル並列化、計算通信オーケストレーション、低レベルカーネル実行にわたる階層的最適化フレームワークを開発した。その結果、オープンソースのベースラインレシピと比較して2.93倍の改善となる34.22%のModel FLOPs Utilization (MFU)を達成し、学習安定性も維持した。この最適化されたインフラストラクチャに基づき、複雑なオペレーションズ・リサーチ(OR)タスク向けのCPTおよびSFTワークフローをさらに構築した。本統合フレームワークをSLAI T-Rexと称する。DeepSeek-V4-Flashを基盤として、収集したドメインリソースとソルバー検証済みの合成最適化文書を組み合わせたOR指向のCPTおよびSFTデータパイプラインを開発した。得られたデータセットは、4つのタスクカテゴリと3つの問題表現にわたる10Kの高品質SFTサンプルを含む。本専門モデルは、評価対象モデルの中で最高の平均Zero-shot Pass@1スコア71.81%を達成し、GPT-5.4-MiniおよびベースのDeepSeek-V4-Flashモデルをそれぞれ3.98パーセントポイントおよび11.27パーセントポイント上回った。全体として、本研究は、Ascendインフラ上での効率的な兆パラメータモデル事後学習から、ソルバー基盤の数理モデリングのためのドメイン特化型Flashモデルに至るフルスタックの経路を実証し、複雑な推論のためのフロンティアモデルシステムを前進させるものである。
近年の自己回帰型ビデオ拡散手法は、Self Forcing(セルフフォーシング)に基づくものが増えている。これは、学習時に正解ビデオコンテキストではなく、モデル自身のロールアウトによって生成された履歴を用いて学習を行う手法である。これにより露出バイアスは低減されるが、過去のキー・バリューキャッシュは依然として将来のフレームに対して凍結されたロールアウト状態としてのみ利用される。その結果、将来の損失が、より有用なキー・バリューとして潜在変数を過去のコンテキストに書き込む方法を、早期に生成された潜在変数に対して教師することができない。我々はこの問題を「過去のコンテキスト勾配ギャップ」と呼ぶ。本論文では、この欠落した教師信号を、完全な逐次ロールアウトを通じた逆伝播なしに回復する2パス学習戦略であるSelf Gradient Forcing(SGF)を提案する。パス1では、勾配なしの自己回帰ロールアウトを推論と同様に実行し、サンプリングされたノイズ除去終了ステップにおいて、自己生成コンテキストとモデルに入力されたノイズ付き潜在変数の両方を記録する。パス2では、記録された終了ステップに対して並列にコンテキスト勾配再構成を行う。生成されたコンテキストは勾配停止されたクリーン潜在入力として使用され、モデルはコンテキストのKV表現と未来からコンテキストへの因果的注意を再計算する。これによりSGFは、本来の自己回帰学習目的関数内で欠落していたメモリ書き込みの教師信号を提供し、将来のビデオ潜在変数に対する損失を用いて、モデルがコンテキストをより効果的な因果的メモリに符号化するよう学習させる。さまざまな初期化条件下での大規模な長期的フレーム単位およびチャンク単位の実験を通じて、SGFはSelf Forcingよりも強力なネイティブな長ビデオ外挿を達成し、特に被写体の同一性、背景・レイアウトの一貫性、時間的安定性において優れている。注目すべきことに、わずか5秒の学習ウィンドウのみで、SGFは数分間のビデオへの外挿が可能である。コードとモデルは公開予定であり、自己回帰型ビデオ生成の研究を前進させる。
大規模言語モデルやAIエージェントが検索結果の主要な消費者となるにつれ、文書セットの品質が下流の生成性能の上限を決定する。しかし既存の評価システムは、文書を個別にスコアリングしnDCGで集約するに留まり、文書間の相互作用(冗長性、矛盾、補完性)を無視しており、ある文書セットが他より優れている理由を答えられない。これらの課題に対処するため、我々は評価・診断・最適化を統合する完全なフレームワークを提案する。SetwiseEvalKitは、短文・長文の両シナリオをカバーする3レベル9次元の文書セット評価ベンチマークであり、約28,000件の高品質評価ルーブリックから構成される。12種類の再ランク付け手法を体系的に評価した結果、最良の手法でもカバレッジは45%以下であり、文書間調整の次元は全般的に弱く、両方の設定でトップ性能を維持する単一の手法は存在しない。これに基づき、ルーブリックに基づく評価基準を文書セット選択信号に変換する訓練不要の手法Rubric4Setwiseを提案する。この手法は、より少ない文書と検索ラウンドで最良の下流生成性能を達成し、両シナリオで最先端の結果を維持する唯一の手法であり、評価から最適化へのループを閉じることの有効性を実証している。
人間の視覚は閉ループである。すなわち、視線は単一のスナップショットではなく、中間仮説によって継続的に方向転換される。数十年にわたる精神物理学および認知科学の研究により、この能動的観察が幅広いタスクに不可欠であることが論証されてきた。今日のマルチモーダル大規模言語モデル(MLLM)が能動的観察を実行しているかどうかは、現在の視覚言語ベンチマークでは答えられない経験的疑問である。本稿では、MLLMの能動的観察を測定可能にするベンチマーク「ActiveVision」を紹介する。このベンチマークは3カテゴリにわたる17のタスクで構成される。タスクは、単一の静的な記述ではなく、繰り返しの視覚的知覚を強制するように設計されている。最先端のMLLMはActiveVisionで崩壊する。評価した中で最高スコアのモデルであるGPT-5.5(最も露出度の高い推論努力階層)は、項目のわずか10.6%しか解決できず、17タスク中11タスクでスコア0であり、さらにClaude Fable 5は、ほとんどの推論およびコーディングのリーダーボードでトップであるにもかかわらず、わずか3.5%しか解決できず、平均96.1%の3人の人間参加者に大きく劣る。さらに、モデルが自身の視覚コードを記述して実行した場合でも、この差の大部分は残る。そのようなコードは現実的な画像に対して信頼性が低く、その失敗を捉えること自体に、モデルが欠如している能動的知覚が必要だからである。これらの結果は総合して、現在のMLLMには頑健な能動的視覚観察が欠如しており、知覚-推論ループを閉じるアーキテクチャと訓練目的が動機付けられることを示している。
大規模言語モデル(LLM)への事実知識注入を信頼性高くかつ大規模に行うことは、未だに未解決の課題である。ハイパーネットワークは、大規模知識注入に対する有望な解決策を提供する。ハイパーネットワークは通常、テスト時適応に適用されるが、本研究ではその学習時知識注入への利用を探る。すなわち、大規模な事実コーパスが与えられた際に、ハイパーネットワークを学習して固定されたLoRAアダプタを生成し、それをターゲットモデルに挿入することで、その事実に関する質問にモデルが回答できるようにする。本稿では、ハイパーネットワークが学習時知識注入に使用可能かどうか、またその能力がスケールとともにどう変化するかを調査する。ハイパーネットワークのスケーリング挙動は、ほとんど研究されていない。本設計では、ハイパーネットワークの注入容量とターゲットモデルの汎用能力を切り離すことで、初めてハイパーネットワークアーキテクチャのスケーリング則を厳密に研究することを可能にする。我々は、損失、推論精度、および分布外一般化(OOD)が、ハイパーネットワークの深さ、幅、およびターゲットネットワークサイズとともにどのように変化するかを特徴づける。また、MegaWikiQAと呼ばれる大規模データセットを構築する。これは、Wikidata5Mの事例から構築した39のドメインにわたる数千万のマルチホップ質問応答例を含む。我々の結果は次のことを明らかにする。(i) ハイパーネットワークに基づく注入は、すべてのアーキテクチャ軸にわたって広く予測可能なべき乗則スケーリングを示す。(ii) ハイパーネットワークは、スケールが増大するにつれて信頼性の高い分布外一般化が可能であり、これはハイパーネットワークがLoRAファインチューニングやフルファインチューニングといった他の学習時適応手法に代わる有望な選択肢であり、すべてのOOD評価においてより急峻なスケーリング指数を示すことを示唆する。これらの結果は総合的に、ハイパーネットワークが学習時適応のための原理的かつスケーラブルな基盤であることを確立し、大規模言語モデルにおける事実推論のためのハイパーネットワークを導く、最初の経験的に基づいたスケーリング則を提供する。
事前学習済みの視覚言語モデル(VLM)を行動クローニング(BC)によりロボットのデモンストレーションでファインチューニングすることは、視覚言語行動(VLA)ポリシーの標準的な手法となっている。しかし、BCによるファインチューニングは、視覚的・意味的一般化を支える事前学習済み表現を徐々に上書きしてしまう。一般的な対策であるWeb上の画像テキストデータを用いた共学習はこれを防げず、異なる観測に対して言語損失と行動損失を適用するため、VLAには標準的な操作ベンチマークでは露呈されない言語行動のミスアライメントが生じる。我々はAnchor-Alignを提案する。これはBCに2つの目的関数を追加するものである。すなわち、Vision-Language Anchoringは凍結されたVLMコピーから層ごとの表現を抽出してこのドリフトを防ぎ、Language-Action Alignmentは各行動目標を離散的な運動方向ラベルに変換し、同一のロボット観測に対して言語予測と行動予測を共学習する。実機のxArm7ロボットにおいて、広く使われる2種類のVLAアーキテクチャでAnchor-Alignは実ロボット成功率を向上させた(28%→54%、37%→60%)。シミュレーションでの大規模実験では、LIBERO-PRO、LIBERO-Plus、CALVINにおいて、OOD摂動、知覚的ロバスト性、長期制御のそれぞれで一貫した改善を示し、事前学習表現の保持と効果的な行動学習が根本的に対立するものではないことを示唆する。プロジェクトページ: anchoralignvla.github.io
強化学習(RL)は、大規模言語モデルの推論能力を向上させる主要なパラダイムとなっている。しかし、PPO-Clipを用いたRLアルゴリズムは、探索の崩壊という本質的な制約を抱えている。後続の研究は主にヒューリスティックな手法に留まり、PPO-Clipの失敗の根本原因を特定できていない。本研究では、PPO-Clipの根本的な欠陥を明らかにする。すなわち、PPO-Clipはユークリッド計量を用いて暗黙的に方策の不一致を測定しているが、これは方策リーマン多様体上の内在的幾何学と理論的に矛盾する。この幾何学的不整合により、低確率領域では過度に保守的な更新が、高確率領域では過度に積極的な更新が生じ、最終的に探索が崩壊する。この幾何学的欠陥を修正するため、我々はリーマン等角方策最適化(RIPO)を提案する。RIPOはリーマン多様体上で等角な方策更新を保証し、探索と活用のバランスを効果的に取る。さらに、RIPOがバイアスと分散の良好なトレードオフを達成し、最適化を安定化させることを示す。広範な実験により、RIPOが既存のLLM向けRLアルゴリズムを7つの競技ベンチマークで大幅に上回ることを実証する(AIME24ではGRPOと比較して最大60%の改善)。
自律エージェントの急速な進化に伴い、汎用AIアシスタントの実現や複雑なワークスペースワークフローの自動化において、ユビキタスなデジタル文書を確実に操作する能力が極めて重要となっている。本論文では、実世界の実践から着想を得た文書操作を原子次元と段階的に複雑化するワークフローに分解する階層的タクソノミーに基づく、決定論的に検証可能な評価フレームワークDocOpsを提案する。DocOpsを用いて、様々なエージェンティックハーネス上で代表的なクローズドソース・オープンソースモデルを体系的に評価した結果、最先端のフロンティア構成でさえ、高度に結合された長距離タスクを処理する際に深刻な限界を示すことが明らかになった。さらに、既存エージェントの操作行動の詳細な分析により、長期的状態追跡の崩壊、浅い意味検証、構造的メタデータの破壊的編集という3つの主要な障害モードが特定された。最終的に、本研究はエージェントがグローバルな文書一貫性を維持する能力の限界を明らかにし、複雑なデジタルエコシステムにおける堅牢で非破壊的なエージェントの将来設計に示唆を与えるものである。
ビデオ拡散トランスフォーマーは長い時空間シーケンスを処理するため、高解像度動画生成において自己注意が主要なボトルネックとなる。訓練不要のスパース注意はこのコストを削減するが、適応型Top-pルーティングはマルチGPUシーケンス並列処理下でヘッドごとに不均一なワークロードを生み出す。このワークロードの不均一性により、スパース注意はランクレベルのストラグラー問題へと変質する。本論文では、マルチGPUシーケンス並列処理下での適応型スパース注意の分散実行効率を向上させる、訓練不要のスパース注意システムを提案する。本システムは、スパースルーティングのフロントエンドとしてTop-pルーティング、Top-kセーフティフロア、および動画認識型ブロック編成を採用し、実行時にマテリアライズドマスクを修復する。ランタイム負荷分散では、P2P通信により少数の重いヘッドを移行して現在のクリティカルパスを短縮する。スラック認識型スパース拡張では、残りの非クリティカルランクスラックを高価値ブロックで追加的に埋める一方、オーバーラップによりスケジューリングと移行のオーバーヘッドを既存の計算の背後に隠蔽する。ステップ蒸留されたWan2.2 I2Vにおいて、本システムは平均負荷不均衡を1.34から1.08に低減し、FlashAttention比で4.41倍の注意高速化を実現するとともに、競争力のある動画品質を維持しつつ2.02~2.11倍のDiT推論高速化を達成する。
検証可能な報酬を用いた強化学習(RLVR)は、言語モデルの推論を大幅に改善してきたが、視覚言語モデルへの拡張は、広範かつ厳密に検証可能で再現性のあるトレーニングデータが不足しているため、依然として制約を受けている。本稿では、マルチドメイン視覚推論のための分類学に基づく環境であるTraceを導入する。Traceは、タスク構築をシーングラマーと実行可能なタスクプログラムに分解し、視覚的実現と回答計算を分離する。共有された意味状態が、レンダリング画像、プロンプト、型付き回答、検証器状態、および再生可能なインスタンストレースを決定する。結果として得られる環境は、277のシーングラマーと11の視覚ドメインにわたる1,000のタスクで構成され、制御された意味的・視覚的バリエーションを備える。64,000のTraceインスタンスに対するRLVRにより、24の外部ベンチマークにわたるマクロ平均が、Qwen2.5-VL-3Bでは3.51パーセンテージポイント、Qwen2.5-VL-7Bでは4.06ポイント向上し、広範な手続き的学習が生成されたタスク分布を超えて転移可能であることを示す証拠が得られた。プロジェクトページ:https://maveryn.github.io/trace/。
検証可能な報酬を用いた強化学習は、明示的なChain-of-Thought推論器においてテスト時スケーリングを引き出す主要な手法となっている。しかし、このスケーリング手法は計算コストが高く、すべての中間ステップを言語トークンとして復号化しなければならないからである。一方、潜在推論は中間計算を連続ベクトルとして保持し、はるかに短いホライゾンで明示的CoTに匹敵または凌駕している。この可能性にもかかわらず、潜在推論器は主に模倣学習に制限されている。一方、明示的CoTは結果報酬RLによって模倣を既に超えている。潜在軌跡は扱いやすいステップごとの尤度と、固定思考予算下での適応的停止インターフェースを欠いているため、結果報酬では潜在テスト時スケーリングを引き出せない。我々はSurrogate Latent Policy Optimization (SLPO)を導入し、結果報酬RLを自己回帰潜在推論器にもたらす。これは、軌跡レベルのクレジット割り当てのための潜在遷移上の経験的代理政策密度と、結果報酬最適化によって可変ホライゾン政策に洗練される正解監視停止ヘッドから成る。連続的およびソフト思考設定において、SLPOは並列サンプリング下でのPass@kを改善し、より難しいインスタンスにより長い潜在計算を割り当て、高い決定論的精度を実現する。
本稿では、航空物体検出のための同期マルチビューRGB-Tデータを生成するオープンソースフレームワークG-MADを紹介する。G-MADは、実環境の航空データセット構築における主要な制約、すなわち視点制御の限界、RGB-Tの不完全な位置合わせ、高いアノテーションコストに対処する。本フレームワークは、構造化されたシナリオ指定、制御可能なマルチビューカメラ配置、可視/熱放射同時撮影、およびエンジンレベルの幾何学メタデータを用いた自動バウンディングボックスアノテーションをサポートする。これらの機能により、航空物体検出における視点変動、マルチモーダル融合、および合成から実環境への転移に関する制御された研究が可能となる。さらに、G-MADを用いて、新たな大規模マルチビュー航空RGB-T物体検出ベンチマークであるAMODを構築し公開する。ソースコードとデータセットはhttps://unique-chan.github.io/G-MAD-Projectで入手可能である。
自然言語オートエンコーダは、隠れ活性化に対する説明を再構成によって評価する。すなわち、ある説明が忠実であるとみなされるのは、その説明から活性化が再生可能な場合である。このテストは、個別の誤った主張に対して構造的に鈍感である。つまり、ある主張を反転させても再構成が変わらない場合、その主張は決してペナルティを受けない。本稿では、このテストが二通りの方法でパスされることを示すが、いずれも忠実ではない。公開されたQwen-2.5-7Bの言語化器では、説明は偶然期待される水準を大きく上回る再構成を示す一方、個別の主張のうち再構成に依存するものは約2%に過ぎない。したがって、スコアは大まかな要旨を追跡しており、具体的な事実を追跡しているわけではない。正確な合成グラウンドトゥルースのもとでは、標準的な手法は5回中5回の実行で共適応的な秘密コード(再構成が依存する誤った言い回し)を発生させ、対象モデルを変更しない修正では改善されない。我々は二つの監査プロトコル(grounded-vs-trueクロスと評価者スワップ)と、RECAP(共訓練補助予測器による読み取り可能な符号化)を提案する。RECAPは対象モデルと並行して訓練される線形ヘッドであり、指定された内容を復号可能に保つ。RECAPで訓練されたサンドボックスモデルでは、新たな言語化器が指定内容を真に示し、秘密コードは消失する(コストは+0.001 nat)。これは事前学習済みのPythia-160Mでも再現される。すなわち、その内容はプローブによって確実に復号可能となるが、新たな言語化器はその一部しか伝達しない(真実度0.44–0.46、対照群はほぼゼロ)。解釈可能性の観点では、高い再構成スコアは個別の主張を保証しない。AI安全性の観点では、RECAPは指定された内部内容を、モデルがごまかせる散文による主張ではなく、プローブに対して独立に検証可能にする。すなわち、独立したプローブが言語化器の真の主張と偽の主張を区別する(AUC 0.96、RECAPなしでは0.82)。説明を改ざんして再構成スコアを最大化しようとする敵対者(嘘をつきながらそのペナルティの約87%を抑制)に対して、RECAPプローブは依然として嘘を検出する(AUC 0.95)一方、対照プローブは偶然レベル(0.51)に低下する。
3D Gaussian Splatting(3DGS)は、3次元空間に自由に配置されたプリミティブを最適化し、未再構成領域では適応的に高密度化することで、高品質な新規視点合成を実現する。しかし、既存のフィードフォワード型3DGS手法では、このシーン適応的な容量割り当てがほとんど失われており、一般的に入力ピクセル上でガウシアンを回帰し、それらをカメラ光線に沿って持ち上げている。このようなピクセル整列型の定式化では、プリミティブの数と配置がシーンの複雑さではなく画像解像度や入力視点に依存するため、結果として密集した冗長なガウシアン集合となる。本稿では、適応型3Dトークン(Adaptive 3D Tokens)を通じて3DGS最適化の適応的割り当て能力を回復する、フィードフォワード型3DGSフレームワークであるATSplatを提案する。ATSplatはまず、粗いパッチレベルの深度とカメラ情報を疎な3Dアンカートークンに持ち上げ、シーンのコンパクトな足場を形成する。各トークンは、学習可能な3Dオフセットを用いて局所的なガウシアンに回帰され、プリミティブの配置を入力画像グリッドから切り離す。適応型トークン拡張(Adaptive Token Expansion)モジュールは、レンダリング誤差マップで教師されるトークンレベルの不確実性スコアを予測し、学習可能な拡張層を通じて高不確実性トークンを選択的に拡張する。このスパースから適応的への定式化により、ATSplatはチャレンジングな領域にプリミティブを集中させつつ、コンパクトな表現を維持できる。RealEstate10KとDL3DVの2つの代表的なデータセットにおける実験では、ATSplatは高密度なフィードフォワード型3DGS手法と比較してガウシアン数を5.7倍以上削減しつつ、最先端のレンダリング品質を達成する。512×960の解像度の12枚の入力画像から、ATSplatは1枚の市販GPUを用いて1秒未満で再構成を完了し、わずか311Kのガウシアンで1136 FPS(512×960)の高品質な新規視点レンダリングを実現する。
エッジデバイス上でのリアルタイム脳波分類は、従来のニューラルネットワークの浮動小数点演算によってボトルネックが生じている。我々は、モデルをビット演算で実行可能な純粋なブール回路にコンパイルするハードウェアネイティブな代替手法として、微分可能論理ゲートネットワーク(Diff-Logic)を調査した。二値の認知症検出と3クラスの感情認識という2つの分類タスクにわたる4つの脳波データセットに対し、厳密な等パラメータ実験を実施し、Diff-Logicを同容量の多層パーセプトロン(MLP)および二値化ニューラルネットワーク(BNN)のベースラインと、4つの複雑度階層(5万~50万パラメータ)で比較した。認知症スクリーニングでは、Diff-LogicはマクロF1値80.2%を達成し、MLPベースラインを6.8%上回った。感情認識では、MLPが中程度の性能優位性を維持したものの、消費電力制約下(7W)のNVIDIA Jetson Orin Nano CPU(シングルコア)に展開した場合、2.3倍のレイテンシ増加と14倍のモデルサイズ増大を伴った。重要なことに、Diff-Logicの推論時間はモデル規模が10倍に増加してもほぼ一定であり、最大の複雑度階層ではMLPに対して2.9倍のピーク高速化を達成した。本研究の結果は、論理ベースのニューラルアーキテクチャが、リソース制約のあるブレイン・コンピュータ・インタフェースのための実用的なパラダイムであり、ポータブルエッジ展開のレイテンシとメモリ制約を本質的に満たしながら、競争力のある性能またはそれを上回る性能を達成することを示している。コードはGitHub(https://github.com/Shyamal-Dharia/eeg-difflogic)で公開されている。
文脈的引き込みとは、モデルが入力中の補助的な文脈によって、その文脈が関連性があるか、真実か、あるいは意味があるかどうかにかかわらず、出力が引き寄せられる傾向である。近年、この現象は単一モダリティの言語モデルにおいて特定され、メカニズム的な説明が与えられている。対照的に、視覚言語モデル(VLM)において、それが現れるかどうか、またどのように現れるかはほとんど検討されておらず、その調査に特化した測定器が分野には欠けている。我々は、VLMにおける文脈的引き込みを研究するには、既存のテキストのみのベンチマークをマルチモーダル設定に移植する以上のものが必要であると考える。すなわち、分類学的に構造化された二重モダリティの測定器が必要であり、その条件は対象となる項目(テキストストリーム内の描写画像、ビジュアルストリーム内のテキストクエリ)を中心に構築されるべきである。我々は、VLMへの移行は漸進的なものではなく、実質的なものであると主張する。これにより、引き込みは二重の現象となり、テキスト文脈と視覚文脈によって独立して駆動可能となり、さらに、先行研究の単一モダリティで世界知識のみに基づく定式化には対応するものがない、真実性の区別(描写されたシーンでは偽であるが、世界では可能な文脈)が開かれる。この立場を具体的かつ実用的なものにするために、我々はENTRAP-VL(視覚と言語のための引き込み評価プローブ)を導入する。これは、手作業でキュレーションされた1,500項目からなるデータセットであり、8つのカテゴリにわたって、2つの軸(すなわち、項目に対する文脈の関連性と真実との関係)に沿った分類法で整理され、テキスト引き込みストリーム(8つの文脈条件)と視覚引き込みストリーム(3つの文脈条件)に分割されている。我々は特定のモデルにおける引き込みを測定すると主張するのではなく、測定器、それを動機づける分類法、およびそれが可能にする評価プロトコルを提供し、コミュニティがこの現象を厳密に調査できるようにする。データセットとそのドキュメントは公開する予定である。
同時局所化とマッピング (SLAM) はロボット工学における基礎的問題の一つであり、現実世界の環境での自律運用を可能にする。低照度下では、コントラストの低下、センサノイズ、およびモーションブラーにより特徴抽出と特徴マッチングの両方が劣化し、LiDAR、深度、または熱センサによる補償はコスト、消費電力、および統合の複雑さを増大させる。既存のベンチマークは依然として照明が十分な屋内または日中シーケンスが大半を占め、標準的なRGBカメラを用いたSLAMが暗所でどこまで性能を発揮できるかは未解明のままである。本稿では、特徴ベース、直接法、フィルタベース、および学習ベースのパラダイムにわたる6つのシステム(ORB-SLAM3、DSO、Kimera-VIO、OpenVINS、DPVO、DPV-SLAM)を、難易度と照明条件が異なる5つのLaMARiaシーケンス上で評価し、絶対および相対位置姿勢誤差とともに制御点リコールを報告する。Kimera-VIOは全5シーケンスを完了まで追跡できた唯一のシステムであり、最も低い相対位置姿勢誤差と、ループクロージャが無いことに起因する着実な絶対誤差の増加を組み合わせている。DPVOとDPV-SLAMは追跡喪失は発生しないものの、低照度下では約100mの絶対誤差を生じる。一方、古典的な単眼パイプライン(ORB-SLAM3、DSO)およびフィルタベースのOpenVINSは、より困難な低照度シーケンスのほとんどで完全に失敗するか発散する。これらの結果は、RGBのみのSLAMが低照度下で安定した追跡を維持するには、慣性融合と大域最適化の両方が必要であることを示唆している。残されたギャップを埋めるには、低照度特化の学習型フロントエンドか、補完的センシングへの回帰が必要となるだろう。
複雑なシーンにおける実用的なロボット把持には、3次元空間認識とタスク固有の要件への整合性の両方が必要となる。視覚言語モデル(VLM)は、言語を用いてこれらの要件を指定する自然な方法を提供するが、既存のアプローチでは、空間認識が限られた状態でVLMを直接把持予測に利用するか、またはVLMを把持モデルと共に訓練するかのいずれかであり、後者ではかなりのデータと計算資源を要する。これらの制約は性能を阻害し、複雑なシーンにおける複数の身体性へのスケーリングを妨げてきた。本稿ではこの問題に対処するため、SeededGraspを提案する。これは、VLMがシード点を予測し、その後の軽量な把持生成モデルの条件付けとして利用することを可能にする、データ効率の高い新規フレームワークである。本アーキテクチャは高レベルの意味推論と低レベルの幾何学的実行を分離し、高コストなエンドツーエンド訓練を回避しながら複数の身体性への対応を実現する。このようなモデルの訓練を可能にするため、我々は乱雑なシーンにおける250万以上の把持を含む、初のマルチエンボディメント卓上把持データセットを公開する。実験結果は、本手法が既存のベースラインを凌駕し、シミュレーションで72%、実世界の把持実験で78%の成功率を達成することを示している。データとコードについてはプロジェクトサイト(https://uoft-isl.github.io/seeded-grasp/)を参照されたい。
テキストから動画を生成する技術は、過去5年間でモデルサイズ、データ、計算能力のスケーリングにより大幅に進歩した。モデルアーキテクチャとは異なり、学習データはしばしば十分に研究されていない。実世界のデータキュレーションは複雑かつ容易ではなく、生の動画からのクリップ選択や、テキストから動画へのマッピングを学習するための動画とテキストのペアを作成するキャプション付与が関わる。本研究では、データ分布とキャプションの品質がテキストから動画を生成するモデルにどのような影響を与えるかを調査する。制御された実験を可能にするため、我々はMoving Alphabetを導入する。これは、黒い背景に対して様々なフォント、色、サイズ、位置の文字を異なる方向と速度で動かすプロシージャルなテストベッドである。この設計により、真値のメタデータを劣化させることでデータ分布とキャプションの品質を精密に制御できる。実験から以下の三つの知見が得られた。(a) 動画の内容と時間長に関する多様でバランスの取れた分布が汎化のために重要であること。(b) キャプションの品質はモデルの性能と学習効率の両方に大きな影響を与え、テキストから動画を生成するモデルが動画理解能力に制約されていることを示唆する。(c) 分類器不要のガイダンスと高品質データでのファインチューニングにより、劣化したキャプションで学習されたモデルからの部分的な回復が可能であるが、質の低い事前学習データを完全に補償することはできない。これらの知見は大規模なテキストから動画を生成するモデルの開発に役立つと考えられ、事前学習データの科学により多くの注意を向けることを提唱する。