翻訳付きの日次キュレーションされたAI研究論文
オープンワールドにおけるロボット操作は、シーンの見た目を認識するだけでなく、その3次元構造が相互作用の下でどのように動くかを予測する必要がある。我々は、RGB、深度、オプティカルフロー、すなわちRGB-DFが、シーンの根底にある4次元動的構造を捉える物理的に根拠づけられた表現を提供すると主張する。2次元ピクセル動画と比較して、このマルチモーダルな相乗効果は、視覚的外観と幾何学的構造、時間的動作を整合させ、ロボットシステムが要求する低レベルのエンドエフェクタ動作にはるかに近い表現空間を創り出す。これにより、世界予測と方策学習の間のギャップを狭める。この知見に基づき、我々はRynnWorld-4Dを紹介する。これは、単一のRGB-D画像と言語指示から、将来のRGBフレーム、深度マップ、オプティカルフローを、統一された単一の拡散プロセス内で同時生成する生成モデルである。この4次元世界モデルは、三分岐アーキテクチャを備え、クロスモーダルアテンションとフレーム単位の3D RoPEを統合し、外観、幾何、動作が一貫して進化することを保証する。大規模な訓練データを提供するため、我々はRynn4DDataset 1.0を厳選した。これは、自己中心視点の人間及びロボット操作動画にわたり、深度とオプティカルフローの高品質な擬似ラベルを付与した、2億5440万フレーム以上の大規模データセットである。さらに、RynnWorld-4D-Policyを提案する。これは、RynnWorld-4Dの内部4次元表現を単一の順伝播で消費し、高コストな多段階ノイズ除去を回避して、閉ループ方式でロボットのアクションを出力する逆動力学ヘッドである。実験により、RynnWorld-4Dが時間的・空間的に一貫した4次元予測を生成すること、そしてRynnWorld-4D-Policyが現実世界の巧緻な両腕操作タスクにおいて最先端の性能を達成し、特に空間的精度と時間的協調を要するタスクで優れていることを示す。
従来、ゲームワールドは労働集約的な制作パイプラインによって構築されてきたため、開発コストが高く、カスタマイズが難しく、デプロイ後の修正にも多大な費用がかかっていた。しかし、近年のビデオ世界モデルの進展により、根本的に異なるパラダイムが登場している。これらのモデルは、仮想環境のあらゆる構成要素を明示的に作り込むのではなく、現在の世界状態とユーザーの操作に基づいて将来の観測を自己回帰的に合成することで、プレイ可能な世界をオンラインで生成することを可能にする。ゲームプレイの記録と実世界の動画の両方で学習されたこのモデルは、多様な視覚的外観と物理的ダイナミクスを捉えることができ、ゲームを超えた応用、すなわち具現化知能を含むインタラクティブなアプリケーションに新たな可能性を拓く。本稿では、インタラクティブな生成的世界を構築するためのフルスタックのオープンソースフレームワークであるAlayaWorldを紹介する。AlayaWorldは、オープンエンドなリアルタイムインタラクションを実現し、ユーザーは自由に移動しながら、戦闘、呪文詠唱、モンスター召喚など多様なアクションを実行できる。本フレームワークは、データ準備、モデルアーキテクチャ、モデル学習、推論高速化、デプロイメントに至るまでの開発プロセス全体を、モジュール化され拡張可能なアーキテクチャのもとに統合している。フレームワークと併せて、再現可能なパイプライン、リファレンス実装、評価ツール、包括的なドキュメントも公開し、生成的世界モデルに関する今後の研究およびリアルタイムアプリケーションのための実践的な基盤を提供する。
ロボット学習のスケールアップには、多様で大規模な軌跡データが必要不可欠である。しかし現状、データ収集は物理的なテレオペレーションに制約されており、すべての実演がオペレーターの時間を特定のハードウェアと作業空間に縛り付けている。本稿では、実ロボットを生成的世界モデルで置き換えることにより、データ収集を物理的制約から切り離す新たなパラダイム「デジタルテレオペレーション」を紹介する。このフレームワークでは、オペレーターの手姿勢ストリームがロボット中心の生成的世界モデルを駆動し、単一の参照画像から高忠実度の一人称視点ビデオを合成する。記録された姿勢ストリームは、任意の対象ロボットに標準的なリターゲティングを介して転送可能な、身体に依存しない行動ラベルとして機能し、物理的なハードウェアに依存しない模倣学習のための完全な状態-行動軌跡を生成する。我々はこのパラダイムを、深度認識スケルトン条件付け、プログレッシブな人間からロボットへの訓練(ビデオ拡散トランスフォーマー上)、およびストリーミング自己回帰蒸留を統合したシステム「RynnWorld-Teleop」として具体化した。このパイプラインは生成プロセスを単一パスの推論に圧縮し、単一のH100 GPU上で毎秒40フレーム以上のリアルタイムインタラクティブ生成を可能にする。RynnWorld-Teleopが生成したデータのみで訓練されたポリシーは、器用かつ多様な両手操作タスクにおいて、効果的なゼロショットSim2Real転送を達成する。さらに、実世界データセットを本デジタルテレオペレーションデータで拡張することにより、成功率が一貫して向上することを示し、RynnWorld-Teleopが次世代ロボットエージェントのための高忠実度かつスケーラブルなデータエンジンとして機能することを実証する。
近年の大規模言語モデル(LLM)の長文脈への拡張は、二次計算コストや密な注意機構における長さ外挿性の低さによって制限されている。チャンク単位のスパース注意機構は有望な代替手段を提供するが、既存の手法はいずれもチャンク選択の不正確さから完全注意機構には及ばない。本稿では、階層的ランドマーク・スパース注意機構(HiLS-Attention)を提案する。これはチャンク単位のスパース注意機構であり、言語モデリング(LM)損失の下でエンドツーエンドにチャンク選択を学習する。HiLS-Attentionは注意機構を階層的に分解する。各クエリは、個々に取得したチャンクに対して独立に注意を実行することでチャンク固有の情報を抽出し、その出力はチャンク取得スコアに従って統合される。取得スコアを順方向の注意計算に組み込むことで、HiLS-AttentionはそれらをLM損失によって直接最適化し、エンドツーエンドの取得学習とネイティブなスパース学習を可能にする。実験結果は、HiLS-Attentionがドメイン内の文脈長において完全注意機構と同等、場合によってはそれを上回る性能を達成することを示している。さらに、HiLS-Attentionは90%の取得精度で訓練時の文脈長の64倍以上の外挿を実現し、完全注意機構を大きく上回る。また、既存の完全注意機構モデルは、軽量な継続事前学習によりHiLS-Attentionに変換可能であり、ドメイン内性能を維持しつつ超長文脈の外挿能力を獲得する。スパースなKVアクセスと計算と相まって、HiLS-Attentionは通常の効率と性能のトレードオフを打破し、完全注意機構を用いたモデルと比較して、一般的な長文脈タスクにおいてより効率的かつ効果的な長文脈LLMを実現する。
我々はコンピュータビジョンを統一的なマルチモーダル生成として定式化する。この枠組みでは、タスク固有のアーキテクチャを用いることなく、異種の視覚タスクを統一的なマルチモーダルモデル本来のテキストおよび画像生成空間の中で表現する。この定式化に基づき、SenseNova-Visionは自然言語指示とオプションの視覚的プロンプトを用いてタスク、対象領域や視点、復号化規則を指定し、応答として、シンボル出力にはテキスト、密な空間予測には画像、構成タスクにはテキストと画像の混合出力を生成する。大規模学習を支援するため、多様なコンピュータビジョンアノテーションをこれらの生成空間と互換性のある指示応答例に変換し、テキスト、画像、および混合ターゲットにわたるコンピュータビジョン指示応答コーパスであるSenseNova-Vision Corpusを構築した。SenseNova-Visionは、既存の事前学習済み統一マルチモーダルモデルを出発点とし、主にこのコーパスで訓練され、補助的なマルチモーダルデータは能力維持のための混合として使用される。そのため、タスク固有の予測ヘッドやアーキテクチャの変更は不要である。得られたモデルは、検出、OCR、キーポイント推定、セグメンテーション、深度推定、表面法線推定、ポイントマップ、カメラ姿勢推定など広範な視覚タスクをカバーし、さらにカテゴリ、色、領域、その他の視覚的手がかりを組み合わせた言語定義のバリアントにも対応する。実験により、単一の統一モデルが、構造化された視覚理解、密な幾何学的予測、セグメンテーション、多視点視覚幾何学において、最先端のタスク特化システムに匹敵することが示された。これらの結果は、統一的なマルチモーダル生成が、コンピュータビジョン機能を汎用基盤モデルに統合するためのスケーラブルな経路であることを示唆している。モデルとコーパスは公開されている。
Gemma 4を紹介します。Gemmaモデルファミリーの新世代であり、オープンウェイトかつネイティブなマルチモーダル言語モデルです。計算効率と推論能力の向上を目指して設計されたGemma 4モデル群は、Denseアーキテクチャと混合エキスパート(MoE)アーキテクチャを採用し、パラメータ数は2.3Bから31Bに及びます。あらゆるモデルサイズにおいて改良された視覚・音声エンコーダに加え、12Bモデル向けには、生の音声と画像パッチを直接取り込む統一型のエンコーダフリーアーキテクチャを提案します。さらに、思考モードを統合することで、Gemmaモデルが応答前に推論トレースを生成できるようにしました。主要な設計上の選択を通じて、推論速度、メモリ、計算効率を改善し、長コンテキスト処理能力も向上させています。Gemma 4は、STEM、マルチモーダル、長コンテキストの各ベンチマークにおいて性能の飛躍的な向上を達成し、人間による評価タスクではより大規模な最先端のオープンモデルに匹敵します。
エージェンティックな映像理解は、モデルに長期記憶を備えさせることで、継続的かつ長期的なマルチモーダルストリームを自律的に処理し応答することを実現します。しかし、高度なビデオエージェントは行動制御(例:検索)や証拠集約において「探偵スタイル」の反復的推論に依存することが多く、その結果、法外なコストとレイテンシが発生します。我々は、このような重い推論は主に、グローバルコンテキストの欠如と検索における意味的ミスアライメントを補うためのものであると主張します。本論文では、反射的かつ軽量な映像理解のためのマルチモーダルエージェントフレームワークであるLight-Omniを紹介します。これは、単一のフォワードパスで瞬時に必要なコンテキストを構築する二重のコンテキスト状態によって実現されます。第一に、エピソード記憶から継続的に統合された有限サイズのマルチモーダルスクリプトであるグローバル状態を維持し、これがLight-Omniのグローバルコンテキストとして機能します。階層的マージにより、過去のイベントを要約しながら最近の詳細を保持します。第二に、このグローバルコンテキストに基づいて、自律的な動作を直接駆動し、最小限のレイテンシで検索埋め込みを生成するパラメトリック潜在状態を生成します。この結合設計により、Light-Omniは反復的推論を回避しながら、意味的に整合した検索と反射的な応答を実現します。広範な実験により、Light-Omniの有効性が複数のビデオベンチマークで検証されました。特筆すべき点として、M3-Agentに対して平均2.4%の精度向上、12.1倍の高速化、およびGPUメモリ効率の2.6倍の改善を達成しています。さらに、既存のMLLMの性能と効率の両方を向上させるメモリシステムとしても機能します。プロジェクトページ: https://clare-nie.github.io/Light-Omni。
推測デコーディングは、ドラフト生成をターゲット検証から分離することで、大規模言語モデル(LLM)の推論を高速化する。近年の並列ドラフターは、単一の順伝搬で長いトークン系列を効率的に提案できるが、トークン間の依存関係が欠如しているため、受入れ率が急速に低下するという問題を抱えている。さらに、これらの拡張ブロックを無差別に検証すると、拒否リスクの高いトークンにクリティカルなバッチ容量を浪費し、高並列サーバシステムにおけるスループットを著しく劣化させる。本稿では、高スループットな並列生成と適応的かつ負荷を考慮した検証を統合する推測デコーディングフレームワーク「DSpark」を提案する。DSparkは、ドラフト品質を維持するため、並列バックボーンと軽量な逐次モジュールを結合した半自己回帰アーキテクチャを採用し、ブロック内の依存関係モデリングを導入してサフィックス劣化を緩和する。システム効率を最適化するため、DSparkは信頼度スケジューリング検証を採用し、推定されたプレフィックス生存確率とエンジン固有のスループットプロファイルに基づいて、各リクエストの検証長を動的に調整する。多様なドメインにおけるオフラインベンチマークでは、DSparkは最先端の自己回帰型および並列型ドラフターを大幅に上回る受入れ長を達成する。実ユーザトラフィック下のDeepSeek-V4サーバシステムに導入した場合、DSparkは検証の無駄を効果的に削減する。確立されたプロダクションベースライン(MTP-1)と比較して、DSparkは同等スループットレベルでユーザあたりの生成速度を60~85%向上させる。さらに重要なことに、厳格な対話性制約下での深刻なスループット低下を防止することで、これまで達成不可能だったパフォーマンス層を実現し、サーバシステムのパレート最適フロンティアを押し広げる。
自律エージェントのスキル最適化が注目を集める一方、既存手法は複雑なパイプラインに依存している。これにより、根本的な問いが未解決のまま残されている。すなわち、すべての構成要素が理論的または経験的な必要性によって正当化される、スキル最適化のための最小限の実行可能なパイプラインとは何か。本稿では、スキル最適化を零階最適化(ZO最適化)として定式化し、古典的な対応手法(中心差分、信頼領域など)を最近の文献と対応づける。古典的なZOにおける盲目的な数値摂動とは異なり、スキルの軌跡は解釈可能なデバッグフィードバックとして機能することに着目する。Claude Codeの哲学とPAC学習に基づき、収束と汎化のための3つの原理を確立する:ファイルシステムベースの軌跡探索、コンセンサス属性マイニング、独立検証ゲーティングである。冗長性を排除し、SkillOpt-Liteを提案する。これは収束を加速し、フルSkillOptを上回る性能を示す:LiveMathにおいてGPT-5.5で+8.8ポイント、GPT-5.4-nanoで+25.4ポイントの改善を達成し、nanoモデルがSkillOptで最適化された標準的なGPT-5.4を凌駕することを可能にする。最後に、本フレームワークをVSCode Copilotのような実運用コーディングエージェントに統合し、開発者が1行のvibeでエージェントのスキルを進化させることを可能にする。本フレームワークはすべてのエージェントコンポーネントを単なる標準的な編集可能なコードとして扱うため、この最小限のパイプラインは自然に完全なハーネス最適化(HarnessOpt)に一般化される。SpreadsheetBenchにおいて、HarnessOptによりGPT-5.4-nanoは0.7758の精度を達成し、標準パイプラインを実行するより大規模なGPT-5.5(0.7620)を上回る。コードはhttps://github.com/EvolvingLMMs-Lab/SkillOpt-Liteで入手可能である。
高密度ビデオキャプショニングは、映像イベントの時間的に位置づけられた説明を生成することを目的としており、イベントレベルの映像理解と生成の両方に貢献する。この分野では、自己回帰型ビデオ大規模言語モデルが、その強力な生成能力とクロスモーダルモデリング能力により、一般的なパラダイムとして台頭している。しかしながら、トークン単位のパラダイムで高密度キャプションを生成すると、推論効率が著しく制限され、映像の長さやイベント密度が増加するにつれてスケーラビリティが妨げられる。本研究では、生成効率を向上させるだけでなく、時間的に位置づけられたキャプショニング性能も強化する、並列化自己回帰フレームワークを提案する。我々の主要な洞察は、時間的に異なるイベント間の弱い局所的な依存関係を利用して因果依存グラフを再構築し、それによりロスレスな並列生成を可能にすることである。具体的には、イベント間の依存関係が弱いトークンは並列にデコードできる一方、各イベント内で密に結合されたトークンは逐次デコードを維持して局所的な意味的一貫性を保つ。この洞察を実現するために、ロスレス並列デコードのための2つの主要コンポーネントを導入する:(1) イベントレベルの構造を自動的に学習し、グローバルなイベント間因果関係をエンコードするコンパクトなトークンを生成すると同時に、イベントレベルの音声視覚セマンティクスを適応的に集約し、その後の依存関係再構築と並列デコードを導く潜在グローバル計画メカニズム、(2) 局所的焦点とグローバルなイベント間認識を効果的にバランスするイベント因子化並列デコードメカニズム。様々なベンチマークでの実験により、我々のアプローチが全モーダルイベントグラウンディングとキャプショニングにおいて効率と性能の両方で明確な利点を示す。プロジェクトウェブサイト: https://github.com/showlab/PadCaptioner.
最近のVLA基盤モデルの進展にもかかわらず、実験室環境と実世界応用との間の乖離が、その実用的な導入を依然として妨げている。このギャップを埋めるため、我々はLingBot-VLA 2.0を提案する。これはLingBot-VLAを三つの機能領域における改良を通じて発展させたものである。(1) タスクと身体性を横断した汎化。前バージョンと比較し、データ処理パイプラインを刷新し、事前学習用に約6万時間のデータをキュレーションした。その内訳は、20種類のロボット構成にわたる5万時間のロボット軌跡と、1万時間の一人称視点の人間ビデオである。(2) デュアルアームハードウェアプラットフォームに加えた動作空間の拡張。具体的には、本システムは頭部、腰部、移動ベース、器用なハンドの自由度を扱うことで、ロボットが実用的なシナリオにおいてより複雑なタスクに取り組むことを可能にする。(3) 時間的推論を改善するための予測的ダイナミクスモデリング。具体的には、将来予測を代理タスクとして定式化し、意味的先行知識を得るためのビデオ表現モデルと、幾何学的手がかりを得るための深度推定モデルによって支援する。ゼネラリスト設定で実施されたGM-100ベンチマークによる評価は、これらの提案された改良の有益な影響を検証している。さらに、全身自由度をカバーする拡大された事前学習データの恩恵により、LingBot-VLA-2.0は二つのロボットプラットフォームにわたって、強力な身体横断的長期間移動操作能力を示している。
オン方策蒸留(OPD)は、生徒自身の軌跡上でより強力な教師と一致させることで生徒方策を訓練し、言語エージェント訓練のための有望な枠組みを提供する。しかし、長期的なエージェントタスクへの応用は十分に探求されていない。我々は、バニラエージェントOPDにおける二つの主要な非効率性を特定する:(1) 全期間ロールアウトは、弱くノイズの多いKL監視を提供する末尾のターンにウォールクロックリソースを浪費することが多く、(2) 軌跡レベルのKL目的関数は損失のほとんどを浅いトークンに集中させ、初期の振る舞いが一致した後に深い意思決定ターンが十分に訓練されない。これらの課題に対処するため、我々はTurnOPDを提案する。これは長期的エージェントの効率的なオン方策蒸留のためのターンレベルの予算配分戦略である。TurnOPDは二つの予算制御器から構成される:プローブベースのターン統計量を用いてロールアウト長を決定する適応的ロールアウト深度予算配分と、KL重み付けをトークンレベルからターンバランス監視へと徐々に移行する段階的ターン正規化損失予算配分である。ALFWorld、WebShop、Multi-Hop Searchにおけるタスク特化型教師モデルを用いた実験は、TurnOPDが同等のウォールクロック訓練予算の下で優れた検証精度を達成し、精度-時間フロンティアをバニラOPDを超えて前進させることを示している。
本稿では、MentalThinkを提案する。これは、マルチモーダル大規模言語モデル(MLLM)に「心的」可視化のための実行可能なメカニズムを備える、視覚-記号推論パラダイムである。MentalThinkの中核はthink-with-SVGパイプラインであり、モデルはスケーラブルベクターグラフィックス(SVG)コードを中間視覚表現として生成、レンダリング、解釈することを学習し、複数ターンにわたる推論を行う。構造化されたベクタースケッチを作成することで、モデルは空間仮説を外在化し、決定的レンダリングを通じてそれを検証し、制約された幾何空間内で推論することが可能となり、人間の心的イメージプロセスを効果的に模倣する。本パラダイムは2段階の学習フレームワークによって具体化される。すなわち、SVGの構文整合性を担う教師ありファインチューニング(SFT)と、中間視覚仮説の反復的な検査、修正、洗練を促す多ターン強化学習(RL)を組み合わせる。広範な評価により、MentalThinkは空間理解および推論ベンチマーク(例:VSIBenchで55.1%、MindCubeで76.0%)において優れた性能を達成し、実行可能なベクターグラフィックスが動的視点取得、視覚的省察、および構成シーンの構築のための検証可能な視覚的ワークスペースを提供することが示された。
検証不可能な指示追従のための強化学習(RL)は、プロンプト固有のルーブリックを報酬信号として用いるLLM判定器にますます依存している。近年の手法では、これらのルーブリックを訓練中の進化する方策に適応させているが、訓練プロンプト自体は固定コーパスから抽出された静的なままである。この静的なアプローチは、プロンプトの難易度と方策の能力との間に重大な不一致を生じさせることが多く、プロンプトがロールアウト間で品質のばらつきを引き出せない場合、判定器は識別可能な報酬信号を回復できなくなる。この不一致に対処するために、我々はLLM-as-a-Tutorを導入する。これはLLMの役割を判定器からチューターへ拡張するフレームワークである。すなわち、単一のモデルが、方策のロールアウトをペア比較して非挑戦的なプロンプトを検出する試験官として、またそれらに原子的制約を追加する生成器として機能する。この追記のみの設計は、方策の能力に合わせて単調に難易度を引き上げ、外部の難易度スケジュールなしで自己調整型の訓練信号を生成する。三つの複雑な指示追従ベンチマークにおいて、我々の手法は、方策を考慮しないベースラインと、ルーブリックを適応させるかプロンプトを書き換える従来の方策適応型手法の両方を一貫して上回り、プロンプト適応が検証不可能なRLにおける方策認識の欠落した軸であることを示唆している。
大規模生成モデルの最近の進歩により、動画生成は大幅に向上したが、既存の手法は依然として固定された推論パラダイムに制約されている。双方向拡散モデルは全体的な一貫性と視覚的忠実度に優れるものの、推論速度が遅く、一方、自己回帰モデルは効率的でストリーミング的な生成を実現するが、長距離の一貫性や露出バイアスに課題がある。そこで我々は、ビデオ拡散モデルが双方向生成と自己回帰生成の両方の枠組みでシームレスに動作することを可能にする、統一的な学習・推論フレームワークであるFlex-Forcingを提案する。その核となるアイデアは、時間軸とノイズ除去ステップの両方にわたって共同で定義される柔軟なチャンク分割機構である。この設計により、モデルは (1) 異なるデバイス予算に応じて柔軟にチャンク分割を実行し、(2) 全体的な構造計画のためにチャンク間で双方向推論を行いつつ、各チャンク内ではフレームを自己回帰的に生成して効率的かつ詳細な合成を実現し、(3) 厳密な因果的制約なしに任意の順序・任意のタイムステップでの自己回帰生成を実行できる。複数の動画生成ベンチマークにおける広範な実験により、Flex-Forcingは固定された推論スケジュールを持つ強力なベースラインと比較して、一貫して優れた動画品質と長尺動画の安定性を達成し、かつ高速な推論を提供することを実証する。
複雑な画像生成や編集には、単一の生成モデルや編集モデルだけでは不十分なことが多い。ユーザーの要求には、画像の合成、オブジェクトの位置特定、領域のセグメンテーション、選択したコンテンツの編集、中間アセットの合成、テキストの読み取り、最終結果の強調といった作業が含まれる可能性がある。このようなタスクは、マルチモーダルエージェントを、認識を強化した推論から、操作を中心とした視覚的な創造へとシフトさせる。そこでは、ツールは単に調査するだけでなく、視覚的な状態を積極的に変換しなければならない。しかし、既存のマルチモーダルツール利用エージェントは、主に認識、検索、または特定領域の編集に最適化されており、実行可能な画像生成軌道に対する大規模な教師データが不足している。本稿では、複雑な画像生成と編集のための大規模マルチモーダルツール利用データセットであるCanvasCraftと、多様な視覚ツールをマルチターン対話を通じて統合的に調整することを学習するツール拡張型マルチモーダルエージェントであるCanvasAgentを紹介する。CanvasCraftは、完全にアノテーションされた14万件の実行可能な軌道と1万件の強化学習タスク仕様を含む。CanvasAgentは、まずSFTを用いて実行可能な推論行動軌道を学習し、その後、結果レベルとプロセスレベルの信号を組み合わせたハイブリッド報酬を用いたGRPOにより最適化される。ロールアウト中、CanvasAgentは中間結果を検査し、視覚アセットを追跡し、進化する視覚状態に応じてツールの決定を適応させる。実験では、最終的な画像品質と軌道行動の両方を評価し、複雑なマルチツール画像生成ワークフローにおけるCanvasAgentと提案データセットの有効性を実証する。
自己中心的な3Dシーン生成においては、視点の重なりが限定的であることや、シーン解釈に対する個人の視点の支配的な影響により、課題が残されている。これらの要因は、視点一貫性があり意味的に整合した視覚コンテンツの生成や、正確な幾何学的構造の構築を妨げる。本稿では、3Dコンテンツ認識を向上させ、自己中心的なシーン生成における幾何学的歪みに対処することを目的としたテキストから3Dへのフレームワーク「CGGS」を提案する。まず、自己中心生成器(Ego-centric Generator)を提案する。これは、一貫性強化損失を用いてマルチビュー潜在拡散モデルをファインチューニングし、テキスト記述に整合した一貫性のある高忠実度の2Dコンテンツを生成する。次に、レイアウトデコレータ(Layout Decorator)は、オプティカルフローとポイントトラック対応を活用して深度を推定し、自己中心的な2D事前情報から粗いレイアウトとしての密な点群を生成する。この初期化に基づき、幾何学的リファイナ(Geometric Refiner)を提案する。これは、エントロピーベースの相互情報量深度損失(MID)と、視覚品質と幾何学的構造を改善するための階層的最適化スキームを組み合わせて、3Dガウシアン再構成を強化する。包括的な実験により、CGGSはテキスト駆動型の一貫性のある正確な3Dシーンの生成において、従来手法を上回ることが示された。プロジェクトページ: https://cggs-26.github.io/cggs26/
最先端の単一画像からの3次元再構成手法は、しばしば複雑なハイブリッドアーキテクチャや損失関数に依存するか、または事前学習済みの潜在拡散モデルを活用するために幾何形状を潜在空間に圧縮します。本研究では、このような構造的なオーバーヘッドや複雑な損失関数の定式化は不要であることを示します。我々は、プレーンなViT上に構築されたミニマルなピクセル空間の拡散トランスフォーマーを導入します。これは、生の3次元点群マップパッチに直接作用し、事前学習済みのDINOv3からの画像トークンによって条件付けられます。既存の潜在拡散手法とは異なり、我々は拡散バックボーンを完全にスクラッチから学習し、点群マップ用のトークナイザーを不要にします。その単純さにもかかわらず、我々の手法は複雑な潜在ベースの拡散モデルを凌駕し、ハイブリッド手法よりもはるかに単純なままです。特に、よりシャープな幾何学的構造を生成し、透明な物体などの非常に曖昧な領域においてより頑健です。
当社は、AR(自己回帰)、拡散モデル、自己投機的デコードを単一のアーキテクチャで統合した3モード言語モデル「Nemotron-Labs-Diffusion」を発表します。ARと拡散の統合目的関数で学習されたNemotron-Labs-Diffusionは、デプロイ環境や同時実行レベルに応じてモードを切り替え、高いスループットを維持できます。本研究では以下の知見を得ました。(1)ARと拡散の目的関数は相補的であり、拡散は先読み計画を改善し、ARは左から右への言語的先行知識を提供します。(2)自己投機モードでは、拡散がドラフト(下書き)を生成しARが検証を行う方式が、マルチトークン予測(MTP)手法よりも受容率と実デバイス効率の両方で優れています。(3)限界速度解析により、拡散の長期的な可能性がさらに実証され、最適サンプラー使用時には自己投機よりもフォワードパスあたり最大76.5%多いトークンを生成可能です。パラメータ規模を3B、8B、14Bにスケーリングした当社のNemotron-Labs-Diffusionファミリー(ベースモデル、指示モデル、視覚言語モデルを含む)は、精度と速度の両方で最先端のオープンソースARおよび拡散言語モデルを一貫して上回ります。例えば、Nemotron-Labs-Diffusion-8Bは、Qwen3-8Bと同等の精度でフォワードパスあたり6倍多くのトークンをデコードし、GB200 GPU上のSGLangを用いたSPEED-Benchでは4倍のスループット向上を実現します。
グループ相対方最適化(GRPO)は、現在の方策が既に有用な推論軌跡をサンプリングしている場合には効果的であるが、正解の解決モードが生徒のオン方策サポートの範囲外にある難しいプロンプトでは停滞する。我々はTREK(Teacher-Routed Exploration via Forward KL)を提案する。これは単純な段階的手順であり、蒸留を模倣ではなく探索サポートの拡大に利用する。TREKの重要な利点はその汎用性である。検証済みの出力軌跡のみを消費するため、外部のブラックボックス教師、ホワイトボックス教師、あるいは追加の推論時コンテキストが与えられた同一モデルを使用でき、教師の内部状態が利用不可能な場合でも、どの難しいプロンプトサンプルを最も統合すべきかを効率的に特定できる。TREKはまず、支援なしの生徒の合格率が非常に低いプロンプトを特定し、提案ソースに問い合わせて検証済みの候補解を生成し、現在の生徒尤度でランク付けされた上位r個の提案を保持し、短いフォワードKLフェーズを適用してそれら検証済みモードを生徒のサポートに引き込み、その後、標準的なオン方策GRPOの洗練に戻る。数学的推論において、DeepSeek-V4の提案を用いたTREKは、AIME 2024およびAIME 2025において、テストされた全てのスケールのQwen3モデルを改善する。Qwen3-8Bでは、AIME 2025が36.9から40.3へ、AIME 2024が47.9から51.1へ改善され(avg@16)、自己コンテキスト変種では外部教師なしで38.5および49.6に達する。エージェント型タスクでは、TREKはALFWorldの成功率を75.8から82.8へ、ScienceWorldの成功率を12.5から26.7へ向上させる。特筆すべきは、最も難しいタスクタイプにおいて、TREKはトレーニングの初期段階で高い成功率を達成する一方、支援なしのGRPOは同等の水準に達するためにより多くの最適化ステップを必要とすることである。
我々は、環境からの報酬を用いず、専門家による映像デモンストレーションから制御ポリシーを学習するフレームワーク「Rank-Then-Act(RTA)」を提案する。RTAは、ビジョン・ランゲージモデル(VLM)をオフラインで学習し、進捗に基づく順序スコアラとする。この学習には、シャッフルされたフレーム系列に対するGroup Relative Policy Optimization(GRPO)目的関数を用いる。これにより、モデルは単純な時間的手がかりではなく、視覚的意味内容から時間的順序を復元することを強いられる。重要な点として、このスコアラを直接スカラー報酬モデルとして使用するのではなく、強化学習のための相関ベースの報酬関数を提案する。各相互作用ウィンドウにおいて、予測された進捗ランキングと真の時間インデックスとの間のスピアマン順位相関を計算し、有界かつスケール不変な学習信号を得る。この設計により、報酬学習を絶対的なキャリブレーションから切り離し、タスクや環境を超えた安定した転移を可能にする。我々は、RTAを離散制御ベンチマーク(PyBoy: Catrap, Kirby)および連続制御タスク(PointMaze, MetaWorld)で評価した。RTAは、既存の映像ベース報酬学習手法やランクベースのベースラインに一貫して匹敵するか、それを上回る性能を示し、単一の事前学習済み進捗スコアラのタスク横断的な再利用における強力な能力を実証した。これらの結果は、映像由来の順序信号に対する相関構造化された教師信号がポリシー学習に十分であり、明示的な報酬設計に代わるスケーラブルな選択肢を提供することを示唆している。
MaxSim類似度関数を用いた後期相互作用検索モデルは、強い実証的性能を示し、単一ベクトル密検索モデルやスパース検索モデルをしばしば凌駕している。しかし、これらの実証的知見にもかかわらず、MaxSimの理論的な表現力や他の検索手法との比較についてはほとんど解明されていない。本論文では、MaxSim類似度が、任意の非負のk-スパースベクトル(次元は無限大でも可)間の内積を、わずかO(k)の表現空間で正確に再現できることを、構成的に示す。さらに、MaxSimが表現可能である一方で、同じ表現空間を持つ標準的なベクトル内積では表現できない類似度が存在することも明らかにする。我々の理論的枠組みを活用し、Signed MaxSimを導入する。これは、後期相互作用モデルが任意の実数値内積を正確に再現できるようにするものであり、標準的なMaxSimではそれが不可能であることを証明する。また、MaxSimがソフトOR演算の集約として機能し、正の連言標準形(positive Conjunctive Normal Form)における論理式の評価器としても機能することを示す。これらの知見は、MaxSimが任意の非負ベクトルに対して標準的なベクトル内積と少なくとも同等の能力を持つこと、そして我々の拡張であるSigned MaxSimは任意のベクトルに対して同等の能力を持つことを示している。両類似度は内積では再現できない追加の能力も備えており、これは後期相互作用手法に関する初の理論的正当化と定量化の一つとなる。我々の理論的発見は実証的にも裏付けられている。否定を含むクエリを特徴とする検索タスクにおいて、Signed MaxSimは標準的なColBERT/MaxSimベースラインと比較して、ドメイン外性能を大幅に改善し、語彙シフト下ではnDCG@10が0.597から1.000に、否定のみのクエリでは0.008から0.788に向上した。
LLMエージェントは、過去の経験を保存・再利用するために検索バッファに依存することが増えているが、これらのバッファを管理するキャッシュ管理ポリシーは、ほとんどがアドホックなままである。我々はこれを、切り替えコストを伴うオンライン意味的キャッシュ置換問題として定式化する。ここでは、アイテムは埋め込み類似度によって照合され、ヒット品質は二値ではなく連続的である。MemoryBench-Full(LoCoMo、DialSim)の2つのデータセットにおいて、8つの置換ポリシーを用いた実験を通じて、我々は驚くべき発見を明らかにする:古典的ヒューリスティクス(LRU、LFU)は、時間的局所性と頻度集中の欠如により、意味的ワークロードにおいて一貫して単純なFIFOベースラインに劣る。我々はSOLARを提案する。これは学習拡張フレームワークであり、後悔蓄積から修正タイミングを導出し(約17%の修正率を達成)、暗黙的検索フィードバックに対するベイズ型オンライン学習から内容選択を導出する。我々はSOLARが定数競合比≤3を達成することを証明する。これはキャッシュサイズと期間に依存せず(FIFOのΩ(K)に対して)、また削除後悔O(KT log T)を達成し、対数因子を除いて下限Ω(KT)に一致する。実験では、厳しいキャッシュサイズにおいてFIFOに対して5~75%の相対的改善を示し、ワーキングセット境界で明確に特徴づけられた相転移が観察される。5000項目のプールを用いた合成実験により、プールサイズと検索品質の間に逆U字関係があることがさらに明らかになり、容量制約がストレージ制限ではなく検索ノイズ現象であることが正当化される。
数学的推論は、推論を行う大規模言語モデル(LLM)の評価とチューニングにおいて中心的なタスクとなっている。しかし、既存のベンチマークは依然として高リソース言語に大きく偏っており、英語と中国語が事前学習コーパスと評価スイートの両方で支配的である。最近公開されたPolyMathデータセット(Wang et al., 2025)は大きな前進ではあるが、そのカバレッジは依然として18の高リソース言語のみに限られている。このギャップに対処するため、我々はPluraMathを導入する。これはPolyMathを拡張し、18の追加の過小評価言語(6つの語族にわたり、中リソースから極低リソースまで)をカバーする。データセットは人間によるキュレーションパイプラインを通じて構築され、ネイティブスピーカーが事前計算された翻訳を徹底的に検証した。PluraMathを用いて、我々は27の推論LLMを4つのモデル規模(小規模、中規模、大規模、クローズドソースのアンサンブル)にわたってベンチマークし、多様な言語条件下での最先端モデルの多言語数学的推論能力を調査した。我々の詳細な分析により、高リソース言語と過小評価言語の間の数学的推論性能における永続的なギャップが確認され、より良い結果は主に指示追従能力の高さと関連していることが示された。我々は、データセット、データ取得パイプライン、評価フレームワークを完全にオープンソース化し、過小評価コミュニティにおける多言語ベンチマーク開発の障壁を下げることを目指している。
多模态大语言模型(MLLMs)以自回归方式生成响应,在演化语境中整合视觉与语言信息。先前关于可解释性的研究主要关注单个层与电路(即"何处"层面),却忽略了生成过程中多模态计算的令牌级动态(即"何时"层面)。我们针对这一空白展开研究,考察基于语义角色的注意力转移模式——逐令牌(OTaT)追踪模型对图像、文本、指令及已生成令牌的注意力。我们设计了需要在单次响应中明确切换视觉与文本上下文的多模态任务。在两个主流模型家族及四种不同规模的开源权重大模型中,我们建立了稳定的规律:图像注意力在需要获取图像信息的令牌处达到峰值;指令令牌在任务过渡阶段被重新关注;随着生成进程推进,对已生成令牌的注意力逐渐增强。因果注意力阻断干预实验验证了这些趋势的功能性作用。我们刻画了注意力受扰动下的模型行为,观察到响应会退回到语言先验,或出现跨模态泄漏、否认现象或自我修复。最终,基于我们新分析方法所揭示的注意力动态,我们提出一种简单的测试时干预策略——在恰当时间增强对相关模态的注意力,从而显著提升多模态任务性能。
階層的Vision-Language-Action(VLA)モデルは、高レベル計画と低レベル制御を分離することで、ロボット操作における汎化性能を向上させる。このパラダイムにおける最近の研究では、Vision-Language Model(VLM)によって予測された2Dエンドエフェクタ軌道を、下流のポリシに対する明示的なガイダンスとして用いている。しかし、最先端の低レベルポリシは点群上の3Dメトリック空間で動作するため、深度情報を欠く2Dガイダンスを与えると、各ウェイポイントにその下にあるシーン表面の深度が強制的に割り当てられ、幾何学的に歪んだ軌道が生成される。我々は3D HAMSTERを提案する。これは、プランナが直接メトリックに信頼できる3D軌道を出力することで、このギャップを埋める階層的フレームワークである。我々はVLMに専用の深度エンコーダと高密度深度再構成の目的関数を追加し、3Dウェイポイントシーケンスを予測し、それを点群ベースの低レベルポリシに直接統合する。3D軌道予測、シミュレーション、実世界操作において、3D HAMSTERは一貫してプロプライエタリなVLMや2Dガイドのベースラインを上回り、外観変化シフトや未知の言語・空間・視覚条件下で最大の改善を示す。プロジェクトページは https://davian-robotics.github.io/3D_HAMSTER/ で公開されている。
本稿では、軽量なエンドツーエンドOCR特化型視覚言語モデルであるHunyuanOCR-1.5を提案する。HunyuanOCRは、文書解析、テキスト検出、情報抽出、テキスト-画像変換、マルチ画像文書理解を、単一のエンドツーエンドVLMに統合する。HunyuanOCR-1.0の軽量アーキテクチャを基盤としつつ、HunyuanOCR-1.5ではバックボーンを再設計することなく、効率性と性能を体系的に改善している。効率面では、DFlashをOCR復号に適用し、密集文書や表、数式といった長文構造化出力のレイテンシを、出力分布を保持したまま大幅に削減する。DFlashにより、HunyuanOCR-1.5はTransformer推論で6.37倍、vLLM環境では2.14倍の高速化を達成し、軽量OCR VLMの中で最速の推論を実現する。性能面では、エージェント駆動型データ構築システムであるAgentic Data Flowを提案する。これは、モデルの弱点を実行可能なデータ要件に変換し、素材検索、品質検証、パイプライ構築を自律的に実行するシステムである。これにより、古代文字OCR、きめ細かな図表や表の解析、マルチ画像テキスト中心QA、低リソース多言語解析、文書幻覚評価におけるロングテール性能が大幅に向上する。HunyuanOCR-1.5は、OmniDocBench v1.6においてトップクラスのエンドツーエンドOCRソリューションに位置づけられると同時に、これらのロングテールタスクにおいて新たな性能指標を達成している。改良された事前学習および事後学習の手法と組み合わせることで、HunyuanOCR-1.5は高解像度、長文脈、マルチタスクのシナリオにおいてもその能力をさらに拡張する。実験により、より高速な推論、より広範なOCR能力のカバレッジ、そして軽量エンドツーエンドモデルとしての導入上の利点が実証されている。本モデルの重みと学習コードは公開予定であり、今後の研究や実用的なOCRアプリケーションを支援する。
強化学習(RL)は大規模言語モデル(LLM)の事後訓練において中心的な役割を担うようになったが、RLによる適応がトランスフォーマー層全体にどのように分布するかについては、ほとんど理解されていない。既存のアプローチは通常、すべてのモデルパラメータを一律に更新し、RL事後訓練で得られる利得にすべての層が同程度に寄与していると暗に仮定している。本研究では、系統的な層別のRL訓練の分析を通じて、この仮定に疑問を投げかける。驚くべきことに、単一のトランスフォーマー層の訓練だけで、全パラメータRL訓練で達成される利得の大部分を回復でき、場合によってはそれを上回ることさえわかった。この現象を定量化するために、層を単独で訓練することで回復される全RL改善の割合を測定する「層貢献度」という指標を導入する。2つのモデルファミリー(Qwen3、Qwen2.5)にわたる7つのモデル、3つのRLアルゴリズム(GRPO、GiGPO、Dr. GRPO)、および数学的推論、コード生成、エージェント的な意思決定を含む複数のタスク領域において、驚くほど安定したパターンが観察される。すなわち、RLの利得は、ごく一部の、多くの場合は単一のトランスフォーマー層に高度に集中している。さらに顕著なのは、同じ構造的パターンが一貫して現れることである。貢献度の高い層はトランスフォーマースタックの中間部に集中し、入力側と出力側に近い層の貢献度は大幅に低い。得られた層の順位付けは、データセット、タスク、モデルファミリー、RLアルゴリズムを超えて強い相関を示す。
コードエージェントは現実世界のソフトウェア課題に対してプルリクエスト(PR)を生成することが増えているが、ワンショットでのPR生成は依然としてオープンループである。すなわち、PRは体系的なレビュー、診断、修正を経ずに提案される。本稿では、このループを閉じるためのフレームワークとしてSWE-Reviewを提案する。これはエージェントによるコードレビューによって実現される。課題とAIが生成したPRが与えられると、レビューエージェントはリポジトリを探索し、PRを受け入れるべきか判断し、修正のための構造化フィードバックを提供する。本設定は、提案するSWE-Review-Benchを用いて評価し、レビューの正確性と下流での修正の有用性の両方を測定する。さらに、エージェントによるレビューのより広範な応用を研究し、オープンなレビュアー学習のためのデータ不足を解消するために、SWE-Review-Trajデータセットを厳選した。実験により、エージェントによるレビューは生成・レビュー・修正ループを通じてPRを継続的に改善し、単一ターンの固定コンテキストレビューと比較して、決定精度と修正後の解決率の両方で優れ、レビューを超えて課題解決モデルの改善に転用可能であり、効果的かつ効率的なテスト時スケーリングを実現することが示された。これらの結果は、エージェントによるコードレビューを、AIコードエージェントをワンショットPR生成からクローズドループの課題解決へと移行させる実用的なメカニズムとして位置づけるものである。
視聴覚芸術は、映画、視覚芸術、舞台芸術、ゲームデザインなど多様な創造的分野を含みます。これらの分野では、視覚、聴覚、物語的要素を意図的に組み合わせることで芸術的意味が生まれます(例えば、閉所恐怖症を誘発するフレーミングで恐怖を増幅したり、沈黙と長回しのクローズアップで悲しみを表現するなど)。真の芸術理解は、何が描写されているかを認識するだけでなく、なぜ特定の創造的選択を通じて表現されているのかを推論することにあります。マルチモーダル大規模言語モデル(MLLM)の著しい進歩にもかかわらず、芸術理解におけるこの重要な側面は未だ十分に探求されていません。既存のベンチマークの多くは知覚的認識を測定する一方で、創造的意図に関する推論を見落としているからです。このギャップに対処するため、我々はMusebenchを導入します。これは、MLLMの微妙な芸術理解を評価するために設計された包括的なベンチマークです。映画芸術、静的視覚芸術、舞台芸術、ゲーム芸術にわたる4,016の質問で構成され、専門家による解説と視覚的実演を組み合わせた10,000以上の候補ビデオエッセイから抽出されました。大規模な芸術分析の自由回答形式を捉えるため、本ベンチマークは単一選択問題と可変オプションの複数選択問題を組み合わせています。すべての質問は、ショートカットフィルタリング、敵対的ディストラクタ、専門家による検証を組み合わせた4段階の反復的パイプラインを通じて生成・洗練されています。28の最先端MLLMに対する包括的なゼロショット評価の結果、最高性能のモデルでも48.29%の精度にとどまり、人間の専門家による87.18%を大幅に下回り、現在のモデルの創造的領域における専門性に大きなギャップがあることが明らかになりました。
ビジョン・言語・行動(VLA)モデルは通常、大規模なロボット実演データセットを用いた模倣学習によって訓練される。しかし、データ量を増やしても、冗長性、ノイズ、不均一なカバレッジのために必ずしもより優れた方策が得られるわけではない。既存のデータ選択手法は、実演データを軌跡レベルまたは状態行動レベルで評価することが多く、長期行動を構成する再利用可能な構造を見落としている。本論文では、VLA模倣学習のための構造認識型データ選択手法であるSIEVEを提案する。SIEVEは、実演データを再利用可能なプリミティブと遷移インターフェースの構成とみなす。まず、セグメント化された軌跡から視覚運動プリミティブを発見し、次に収穫逓減の条件下で再利用を考慮した構造的露出を最大化することにより、選択予算を構成パターンに割り当てる。最後に、各構成パターンバケット内でメドイド軌跡を選択し、中心的で安定した模倣に適した実演データを保持する。複数のデータセット、ベンチマーク、VLAモデルにわたる実験により、SIEVEが競合するデータ選択ベースラインを一貫して上回ることが示された。注目すべきことに、SIEVEは実演データの50%と訓練ステップの50%のみを使用しながら、全データ訓練を上回ることができる。これは、プリミティブと遷移を通じて捉えられた再利用可能な構造が、効率的なVLA模倣学習にとって重要な信号であることを示唆している。
SMILESを読み取る化学言語モデルはすべてトークナイザから始まるが、この分野は自然言語処理からバイトペアエンコーディング(BPE)をほとんど検証せずに継承してきた。自然言語において、BPEの主要な代替手法であるUnigram-LMは、構造的に異なる語彙を構築することが知られている。その対照性が化学の分野でも維持されるかどうかは未解決の問題であった。我々は、固定された165トークンの化学ベース上で、トークン埋め込みが学習可能な小さな語彙サイズにおいて、3種類のコーパス(多様性、薬物様、天然物)と両方の事前トークン化境界ポリシーにわたって、BPEとUnigram-LMの制御比較を行った。両者は収束しない。22のすべての一致条件において、ほぼ互いに素なサブワード語彙を構築する:学習された断片間のアルゴリズム間Jaccard重複率は0.161を超えることはなく、モデルが最も更新する高頻度断片に重み付けした場合でも最大0.05であった。Unigram-LMはまた、保持された分子を29~41%多くのトークンに分割する;両手法はどこで切断するかについてはほぼ一致するが、どの程度深く切断するかは異なり、その結果、BPEのセグメンテーションは分子の80~99%においてUnigram-LMの厳密な粗視化となっている。この乖離はコーパス、境界、語彙サイズに関わらず維持され、その8倍の規模でも持続する。したがって、サブワードアルゴリズムはモデリング上の決定であり、自由なデフォルトではない。本研究では言語モデルは学習していない。
異なる言語集団間では、うつ病の診断と臨床症状に有意な差異が存在する。音声に基づくうつ病検出は単一言語では良好に機能するが、他言語への汎化は未解決の課題である。その主な理由は、従来研究が話者グループ化を行わずにセグメントレベルのランダム分割を用いており、アイデンティティ漏洩を引き起こして報告指標を過大評価しているためである。我々はCLeaDを提案する。これは、並列データや対象言語のファインチューニングを必要とせずに、英語と中国語(マンダリン)のWavLM埋め込みを共有の臨床空間にマッピングする教師あり対照的アライメントフレームワークである。52名の中国語話者を評価したところ、一話者除外評価において、対照的アライメントはベースラインをわずかに上回った(F1: 0.640 vs. 0.622)。また、中間層(7-8)における抑うつクラスの再現率も向上させるが、テストセットが小さいため汎化可能性は限られる。2つの知見は頑健である。すなわち、モデルスケーリングは単一言語英語の性能を向上させる一方で他言語間性能を低下させること、そして話者アイデンティティ漏洩が以前報告された中国語のF1スコアを0.954に人為的に誇張しており、これは我々が再現し定量化したアーティファクトである。
学術成果の生成は断片的なツールチェーンを経て行われる。文献の発見はあるアプリケーション、参考文献の管理は別のアプリケーション、執筆はLaTeXエディタ、会議テンプレートへの整形は手作業、投稿はさらに別のポータルという具合である。ツール間の境界ごとにコンテキストスイッチ、フォーマット変換、手動のコピー&ペースト作業が強制され、その累積的なコストが、研究者が本来の研究以外の活動に費やす時間の大半を占めている。本稿では、クラウドLaTeXエディタを中心に構築された単一のResearch-Write-Publishパイプラインにこのツールチェーンを統合する、エディタネイティブなプラットフォームであるBibby AIを紹介する。ブラウザ拡張機能を通じて既存のエディタに付随するアシスタントとは異なり、Bibby AIは完全な文書状態、コンパイルパイプライン、改訂履歴を所有する。これにより、そのエージェントは、テキスト提案としてではなく、一次的な検証可能な操作として、検索に基づく引用挿入、構造編集、テンプレート準拠の再フォーマットを実行できる。本プラットフォームは、(i) PDF、DOCX、手書き数式をクリーンなLaTeXに変換する取り込みパイプライン、(ii) USPTO PatentsViewとMarx-Fuegi引用コーパスから得られた特許-論文間の引用シグナルで拡充された学術メタデータ上の検索レイヤ(これにより、候補参考文献のトランスレーショナルな影響を可視化する)、(iii) 文書の抽象構文表現に対して直接動作する、文献選別、草稿作成、修正、会議フォーマット整形のためのタスクスコープエージェント、を統合する。Bibby AIは本番環境に展開されており、50以上の契約大学で5,000人以上のアクティブな研究者に利用されている。本稿では、そのアーキテクチャ、エディタネイティブであることによって可能となる設計上の判断、そして断片的なベースラインに対して本プラットフォームを評価するために用いるワークフローレベルの時間節約フレームワークについて述べる。
本論文では、大規模言語モデル(LLM)を利用して、テキスト分類、固有表現認識(NER)、関係抽出などのNLPタスクのための実行可能なルールを生成するフレームワーク「RuleChef」を提案する。ルールは、タスクの説明とラベル付きサンプルセットに基づいて生成され、その後、追加のサンプルと既存のルールに対する人間のフィードバックの両方に基づいて反復的に改善される。RuleChefは、任意の既存モデルから観測された入出力ペアを利用してルールをブートストラップすることもできる。LLMは学習時のみ使用され、ルールを合成し、ホールドアウト分割で測定された失敗に基づいて反復的に修正する。このプロセスの結果、高速で決定論的かつ検査可能なルールシステムが得られる。予備評価は、分類タスクとNERタスクの両方で実施された。RuleChefは、Apache 2.0ライセンスの下でオープンソースソフトウェアとして公開する。
幾何条件付き3Dシーン生成は、ユーザーが提供する幾何形状から3D環境を作成することを可能にし、シーン構造とオブジェクトレイアウトの直接制御を提供する。このような3Dシーンを生成するために、現在の手法は一般的に3段階の設計を採用している。まずビュースケジュールを定義し、次にスケジュールされたビューに沿って多視点観測を合成し、最後に生成された画像から3D表現を再構成する。しかし、屋外シーンではビュースケジュールの定義が大きなボトルネックとなる。屋外では大規模で非構造的かつ非有界な幾何形状により、十分なカバレッジを提供しつつ安定した生成を支援するビューを得ることが困難だからである。 このボトルネックに対処するため、我々はSceneFrom3Dを提案する。これは、屋外の入力幾何形状から自動的にビューをスケジュールするフレームワークである。SceneFrom3Dは有向生成グラフを構築する。このグラフのノードはアンカービューを表し、エッジは補間軌跡を表す。これにより、どのビューを合成するか、どのビューペアを補間するか、そして生成をどの順序で進めるかを定義する。自動ビュースケジューリングに加えて、SceneFrom3Dはオブジェクトレベルの条件付けを通じて制御可能性をさらに向上させる。各オブジェクトに外観ガイダンスのためのアイデンティティ画像と、入力幾何形状に対する領域ごとの制御のための幾何形状追従パラメータを割り当てる。 実験により、SceneFrom3Dが幾何条件付き屋外3Dシーン生成において最先端の成果を達成し、制御可能なオブジェクト外観と幾何形状追従を備えた高品質なシーンを生成することを示す。
身体化ナビゲーションは、マルチモーダルな目標を解釈し、3次元空間で推論し、現実世界で確実に目的地に到達するエージェントを構築することを目的としている。しかし、スケーラブルで忠実度が高く、物理的に基づいたインタラクティブな環境が不足しているため、進展は依然として制限されている。実際のスキャンデータセットは視覚的な現実感を提供するが、スケールに制限がある。一方、合成シミュレータはより簡単にスケールできるが、多くの場合シミュレーションと現実のギャップが大きい。我々は、ポーズ付きRGB-D画像シーケンスから高品質なインタラクティブ環境を構築するリアルタイムニューラルシミュレーションフレームワーク、Image2Simを紹介する。中心となるアイデアは、3次元空間アンカリングとフォトリアリスティックな観測合成を分離することである。シーン構築において、Image2Simはフィードフォワード特徴ガウシアンモデルを使用し、ポーズ付きRGB-D観測を単一パスで3次元特徴ガウシアン表現に変換する。レンダリングについては、スパースでノイズの多いガウシアン投影を高品質なパノラマRGB-D観測に変換するGeometry-Aware One-Step Pixel Flowモデルを提案する。Image2Simはまた、高忠実度の観測、実行可能なアクション、多様なナビゲーション指示を大規模に生成する完全自動化された身体化データエンジンとして機能する。大規模なビデオ・画像コレクションを約2万のインタラクティブシーンに変換し、1000万以上のナビゲーション訓練サンプルを合成する。これらのニューラル環境で完全に訓練されたナビゲーションモデルは、主要なベンチマークで大きな改善を達成し、現実世界のゼロショット設定にも効果的に転移する。これらの結果は、スケーラブルなニューラルシミュレーションが、大規模な身体化ナビゲーションの実用的な訓練基盤として機能する可能性を示唆している。
近年、Joint Embedding Predictive Architectures(JEPA)は、自己教師あり表現学習の有望なフレームワークとして、コンピュータビジョンおよび機械学習コミュニティで大きな注目を集めています。ピクセルを再構成するマスク付きオートエンコーダとは異なり、JEPAモデルはマスクされた領域の潜在埋め込みを予測することで表現を学習します。既存のJEPAベースの手法(I-JEPAやV-JEPAなど)は、通常、生徒ネットワークに単一のエンコーダを採用しています。対照的に、生徒ネットワークにSiameseエンコーダを使用することは、脳に着想を得た表現学習フレームワークとより自然に整合しますが、JEPAモデルにおけるその役割はほとんど未解明のままです。本論文では、JEPAベースの表現学習におけるSiamese生徒エンコーダの効果を調査します。この目的のために、指数移動平均(EMA)教師ネットワークを備えたマスク付きSiamese生徒エンコーダであるSiamJEPAを提案します。SiamJEPAは、脳に着想を得た表現学習モデルPhiNetのJEPA定式化としても捉えることができます。ImageNetの線形プローブを用いた広範な実験を通じて、SiameseエンコーダがJEPA目的関数に対する効果的な正則化として機能し、表現の分離性を向上させ、訓練初期の学習を加速することを示します。さらに、SiamJEPAは限られた訓練予算の下で同等の単一エンコーダJEPA変種を一貫して上回り、より長い訓練を必要とするMasked Autoencoders(MAE)よりも高い線形プローブ精度を達成します。我々の知見は、Siamese生徒エンコーダが単なるアーキテクチャの選択ではなく、予測的表現学習にとって重要な帰納的バイアスを構成することを明らかにしています。これらの結果は、JEPAベースのモデルの設計に新たな洞察を提供し、Siamese生徒アーキテクチャを組み込むことが自己教師あり表現学習を改善するためのシンプルかつ効果的なアプローチであることを示唆しています。
大規模音声言語モデル(LALMs)は日常的なアプリケーションにますます統合されつつあるが、その生成バイアスは未だ十分に解明されていない。既存の音声公平性ベンチマークは合成音声と多肢選択式質問(MCQs)に依存しており、いずれも公平性の断片的な評価しか提供しない。本稿では、人間が録音した音声を用いて、パーソナライズドレコメンデーションなどの自由回答形式タスクを通じて生成バイアスを評価するフレームワークVIBEを提案する。MCQsとは異なり、本手法では事前定義された選択肢なしにステレオタイプ的な関連付けが自然に現れるため、新しいタスクへの拡張が容易である。12の最先端LALMsを評価した結果、現実的なシナリオにおいて系統的なバイアスが明らかになった。性別とアクセントの手がかりは共に統計的に有意な分布シフトを引き起こし、バイアスの大きさはタスクに強く依存することが示された。