翻訳付きの日次キュレーションされたAI研究論文
音声・オーディオ生成は、アニメーション吹き替え、オーディオドラマ、映画、広告、ゲーム、ポッドキャスト、ショート動画制作などでしばしば必要とされる。このようなシナリオでは、クリエイターは参照録音なしで声をデザインし、自然言語で話者スタイルを制御し、環境や音響効果を備えた音響シーンをサポートし、後からデザインした声を再利用できることが求められる。したがって、インストラクションタスクとゼロショットタスクの両方において、マルチスピーカーの音声・オーディオ生成をサポートすることが重要である。インストラクションタスクでは、環境、話者スタイル、および詳細なコンテンツのキャプションが必要であり、一方ゼロショットタスクでは、参照音声と同一の詳細なコンテンツを使用する。我々はこれらのタスクにデータ面とモデル面の両方から取り組む。まず、生の音声・オーディオデータをクリーニングし、対象を絞った合成データを追加し、多様かつ正確な多層キャプションをアノテーションするSwanData-Captionを提案する。次に、ゼロショットタスクとインストラクションタスクの両方をサポートするマルチスピーカー高表現力音声・オーディオ生成モデルであるSwanTaleを提案する。高品質なマルチオーディオモダリティ生成をサポートするため、SwanVAEを導入する。さらに、報酬条件付き品質制御とEngram条件付け、そしてマルチタスク・マルチオーディオモダリティモデリングのためのUnified MoEを採用する。加えて、カリキュラム学習とGRPOポストトレーニングを用いて、モデルが段階的に学習し能力を強化できるようにする。実験結果は、SwanTaleが複数の主要なゼロショット指標とインストラクション指標でトップとなり、両タスクで最高の表現力スコアを達成し、マルチスピーカーの音声・オーディオを含む複雑なインストラクション生成をサポートすることを示している。デモは https://swanaigc.github.io/#swantale で閲覧できる。
大規模言語モデル(LLM)エージェントは、持続的な推論、ツール使用、および多数の相互依存ステップにわたる修正を必要とする長期タスクを遂行することが増えている。しかし、既存のエージェントハーネスは、タスクの実行、タスク状態、完了評価を拡大し続けるコンテキスト内で維持するため、状態の追跡が困難になり、誤った自己評価が後続の意思決定に伝播する可能性がある。我々は、長期タスクの実行をタスク状態管理問題として再定式化し、タスク状態を実行の外部で明示的に維持し、環境から独立に検証された事実のみでそれを更新するLongHorizon-Harnessを提案する。そのManage-Execute-Audit(MEA)ループは、タスク状態を維持して次のサブタスクを決定するマネージャー、それを実行するフレッシュコンテキストのエグゼキュータ、および次のラウンドの前に結果として生じる環境状態を検証する読み取り専用の監査器を使用する。軽量なAgentAdapterは、ネイティブのエージェントループを変更することなく、交換可能なモデルおよびハーネスのバックエンドをサポートする。LongHorizon-Harnessは、WeaveBenchにおけるQwen 3.7-Plusを51.8%から80.7%へ、Terminal-Bench 2.1における69.7%から77.2%へ、OSWorld 2.0における2.8%から8.3%へ改善する。また、OSWorld 2.0のサブセットではClaude Opus 4.7を20.0%から34.3%に引き上げ、モデル、ハーネス、インタラクションドメインにわたって一貫した改善を示している。
オン方策(自己)蒸留(OPSD)は、言語モデルの事後学習においてますます広く採用されている。OPSDは特権情報によって教師モデルを強化するが、その一方で「特権錯覚」を引き起こす可能性がある。すなわち、生徒モデルは推論時の文脈からは再現できない特権依存的な振る舞いを学習し、あたかも訓練時の特権情報が依然として利用可能であるかのように振る舞うため、最終的には性能を低下させてしまう。本稿では、OPSDにおけるこの失敗の根本原因が、推論時における特権的教師と生徒モデルとの間の情報非対称性であることを明らかにする。この非対称性を解消するために、我々は二重アンカー方策蒸留(DAPD)を提案する。これは、二段階のアンカリングを備えた統一フレームワークである。二重経路アンカリング(DPA)は、自己条件付きブリッジを導入し、参照とロールアウトの挙動を情報が整合した二つの経路に沿って整合させることで、特権依存的な振る舞いが推論時の生徒モデルへ転移することを防ぐ。二重ソースアンカリング(DSA)は、これらの経路を参照からロールアウトへの方向と、ロールアウトから参照への方向の両方に適用し、特権的な参照ガイダンスへの依存を低減しつつ、正しさの教師信号を維持する。大規模な実験により、DAPDが特権錯覚を有意に軽減し、Qwen3-4Bにおいてタスク平均でOPSDを+2.00ポイント上回ることが示された。特に、その効果はモデル規模を問わず持続し、4Bでは+2.69、32Bでは+2.78に達する。
既存のスキル生成手法は、その多くがヒューリスティクスやパイプライン型の統合に依存しており、異なる情報源ごとに特別な設計が必要です。一方、学習ベースの手法は、異種の情報源にわたるスキル生成をモデル化するためのより統合的なアプローチを提供します。しかし、スキルには関連性や正しさに基づく自然な教師信号が存在せず、その価値は主に下流タスクにおけるエージェントの行動を改善するかどうかによってのみ判断できるため、学習ベースのスキル生成には依然として課題が残ります。この課題に対処するため、我々は高品質なエージェントスキルを段階的に生成する強化学習手法であるSkill-αを提案します。具体的には、スキル生成を、スキル構築を個別に評価可能な編集へと分解する逐次編集プロセスとして定式化し、アンカー付きクエリ上で元のスキルと編集後のスキルを用いた下流実行を比較することで各編集を評価する、新規のロールバック報酬を導入します。広範な実験により、Skill-αは文書からスキルへの設定と経験からスキルへの設定の両方において、ヒューリスティクスやパイプラインに基づく手法よりも効果的なスキルを生成することが示されました。主要なGPT-4oワーカーを使用した場合、Skill-αは最強のスキル生成ベースラインと比較して、CL-Benchでは平均下流成功率を3.3ポイント、tau2-benchでは6.7ポイント向上させました。さらに、アブレーション実験により、ロールバック報酬と段階的生成の重要性が検証されました。
マルチモーダル・オンポリシー蒸留(OPD)は、特権視点を持つ教師モデルを用いて学生が生成した軌跡を監督することで、細粒度の視覚知識を転移する。しかし、その次トークン修正はソース混合であり、視覚信号と言語的な事前知識、さらには教師固有の効果が組み合わさっている。重要な課題は、どの修正が視覚的証拠によって裏付けられているかを推定することであり、単にどこで、どの程度の強さで蒸留するかではない。本稿では、教師修正のうち視覚に帰属可能な部分を推定する反事実的ターゲット再構成アルゴリズムであるVisual Attribution Distillation(VAD)を提案する。各学生生成プレフィックスにおいて、VADは関連する証拠が存在する場合と取り除かれた場合の同一の固定教師を評価する。対応する中心化ログ確率の変化はu_tを定義する。これは視覚的証拠の方向を示す符号付きプロキシであり、証拠が候補トークンをどの程度支持または反駁するかを推定する。VADは元の修正をこのプロキシに投影し、介入整合成分とプロキシ未説明残差を取得し、前者から学生に固定されたターゲットを再構成する。訓練中、この再構成ターゲットが主要な監督信号を提供し、特権教師は弱い正則化項として寄与する。4Bおよび9B規模の6つの細粒度視覚ベンチマークにおいて、VADは直接的な特権視点蒸留や視覚的優位性重み付けよりも優れた性能を示した。トークンレベルおよび制御ターゲットの分析により、プロキシ整合成分はタスク関連の視覚修正に富み、特に証拠が誤った回答を反駁する場合に、より強いターゲットシフトをもたらすことが明らかになった。これらの結果は、反事実的ターゲット再構成がソース混合監督の効果的な代替手段であることを支持するものである。
スパース検索は、ウェブ検索から検索拡張生成(RAG)に至るまで、現代の検索システムの基盤を成している。既存研究では、厳密な語彙一致を超えてより豊かな意味論を実現するため、学習型スパース検索(LSR)が導入されてきた。しかしながら、LSRはこれまでエンコーダ型の双方向アーキテクチャに強く結びついており、マルチモーダル設定への拡張も依然として補助的なクロスモーダルモジュールに大きく依存している。これらの限界に対処するため、我々はUEmbed(Unified Embedding)を提案する。これはデコーダ専用のマルチモーダル埋め込みモデルであり、単一の因果的順伝播(causal forward pass)でスパースな語彙表現と高密度表現の両方を生成する。UEmbedは入力にN個の学習可能な特殊トークンを付加し、語彙をN個の互いに素な部分集合に分割する。各トークンの因果的隠れ状態は、割り当てられた部分集合に対するスパース重みを予測し、N個の部分集合を連結して完全なスパースベクトルを形成する。公開データで学習したUEmbedを、2B・4B・9Bのスケールで公開する。UEmbed-9BはMMEB-v2において、高密度表現で71.8、スパース表現で71.0を達成し、公開データで学習されたマルチモーダル埋め込みモデル(例:RzenEmbed)を上回る。BEIRにおいても、UEmbedは強力な高密度・スパースベースラインと競合する性能を維持する。さらに、有効性・効率性・エージェント応用という3つの側面において、UEmbedの実用的有用性を実証する。総じて、UEmbedは新たなパラダイムを提供する。すなわち、単一モデル内で高密度埋め込みとスパース埋め込みを統合しつつ、スパース検索をさらに拡張してテキストとマルチモーダル入力を統一的に扱うものである。
コンピュータ支援設計(CAD)は現代のエンジニアリングを支える基盤技術であるが、既存の形状を編集可能なモデルに変換するには依然として専門家による多大な労力が必要である。多くのAIシステムはCADプログラム全体を一度に出力し、中間形状を検査することはない。これに対し、人間のエンジニアは部品をフィーチャー単位で構築し、各操作の後に残りのモデリング対象を確認する。我々は、3DメッシュをパラメトリックCADプログラムとして再構築するモデルCADENA(スペイン語で「鎖」)を提案する。CADENAは操作列を一つずつ増やしながら、各ステップで目標形状と現在の予測形状を比較する。また、機械部品のリバースエンジニアリング手法を評価するベンチマークが不足している問題に対処するため、機械部品のカテゴリ横断で性能を測定するCADENA-Benchを導入する。CADENAは、CADENA-BenchおよびDeepCAD、Fusion 360、MCBデータセットにおいて従来手法を上回る性能を示す。コードはhttps://github.com/zhemdi/cadena、モデルウェイトはhttps://huggingface.co/kulibinai/cadena、CADENA-Benchはhttps://huggingface.co/datasets/kulibinai/cadena-benchで入手可能である。
制御可能なビデオ生成モデルは、世界モデルとしてますます開発が進められている。それに伴い、この役割における評価は、生成されたビデオの見た目の品質だけでなく、描かれた世界が本来備える反応性、すなわちシーンの状態から世界がどのように反応すべきかを推論し、入力に明示的に記述されていない妥当な結果を生成する能力にまで拡張されている。しかし既存のベンチマークは主に、要求された動作と相互作用の結果が実現されているかを確認することで、視覚品質や明示的な指示の達成度を評価しており、本質的反応性は十分に検証されていない。 本稿では、階層的診断ベンチマークであるWorldExamを導入する。これは視覚品質、制御追従、空間的一貫性、世界反応性の4つのレベルにわたり、8つの専用タスクで1,474ケースから構成され、カメラ駆動、行動駆動、言語駆動のモデルパラダイムの統一的評価をサポートする。世界反応性レベルでは、入力に明示的に指定された内容を超えた、シーン条件付きの反応と目標指向的な行動を評価する。 20の代表的モデルの評価により、明確な能力の分断が明らかになった。カメラ駆動モデルはカメラ制御に優れるが、そのインターフェースは動的な相互作用をサポートしない。行動駆動モデルは被写体の制御はより正確であるが、世界を無反応のままにすることが多い。言語駆動モデルは相互作用では優れた性能を示すものの、複雑な制御への追従は不正確である。幅広いタスク網羅性と一貫した高性能を兼ね備えたモデルは存在せず、高い視覚品質と明示的な指示の達成は本質的反応性を保証しないことが示されている。
近年、自動運転(AD)向けのVision-Language-Action(VLA)モデルでは、視覚言語モデル(VLM)コンポーネントの推論能力を高めるために、チェーン・オブ・ソート(CoT)教師信号を利用する手法が増えている。しかし、既存のアノテーションパイプラインでは、教師モデルに記録済みのグラウンドトゥルース(GT)未来軌跡を提示することが一般的である。本稿では、これが軌跡アンカリングバイアスを誘発することを実証的に示す。すなわち、教師モデルはシーンの証拠から意思決定を推論するのではなく、開示された結果を事後的に正当化してしまうため、因果的に忠実でないCoTを生成し、特に因果的推論が困難なシーンでは、ハルシネーションが著しく悪化する。GT軌跡を除去すればこのショートカットを排除できるが、オープンエンドな軌跡生成は、高次レベルの意思決定と精密な幾何学的合成、そして低次レベルのダイナミクスとを複雑に絡み合わせてしまう。軌跡レベルの運転意思決定を、オープンエンドな軌跡合成を必要とせずに検証可能にするため、本稿ではAutonomous-Driving Multiple-Choice Question(AD-MCQ)を導入する。これは、プランニングを明示的な軌跡候補の中からの選択として定式化するものである。さらに一歩進めて、Deferred Exposure of Future Trajectories for RLVR(DEFT-RLVR)を提案し、未来軌跡を意思決定前のアンカーから意思決定後の検証対象へと転換する。実験結果は、DEFT-RLVRがADの推論能力を向上させるとともに、一般的な視覚能力を維持ないし強化することを示している。VLMのみの推論が可能であり、候補構築により難易度を制御できるAD-MCQは、検証可能なAD推論に関する今後の研究のための、柔軟でスケーラブルかつ拡張可能な基盤を提供する。
エージェントスキルは、言語モデルエージェントに再利用可能な手続き的知識を備えるための重要なメカニズムとなっています。しかしながら、スキルを提供するだけでは、現在のモデルがそれらを効果的に特定し、適用し、連携させることができることは保証されません。このスキル使用能力を向上させるために、我々はSKTを導入します。SKTは、多数のエージェントスキルからスキルに基づくタスクと実行可能な軌跡を構築する、検証済みデータ合成パイプラインです。SKTは、適切な単一スキルおよび複数スキルの構成を選択し、ルールベースおよびエージェントベースの検証とフィードバック誘導型の修復を通じてタスクを合成し、必要なすべてのスキルを実質的に使用した成功軌跡のみを保持します。2,000の公開スキルを用いて、SKTは4,000のタスクパッケージと27,164の検証済み軌跡を生成します。同じパイプラインと重複しないテストプールに基づき、スキル使用を評価するためのホールドアウト実行可能ベンチマークであるSkillEvalも構築します。多様なモデル、ベンチマーク、エージェントハーネスにわたる実験により、SKTが生成した軌跡に対する教師ありファインチューニングが、スキル使用パフォーマンスを一貫して向上させることが示されました。検証アブレーション、クロスハーネス評価、スケーリング実験はさらに、これらの向上が高品質な教師信号に依存し、単一のエージェントインターフェースを超えて及ぶものであり、より広範なスキルカバレッジとともに増大することを実証しています。これらの結果は総合的に、検証済みデータ合成がスキル使用トレーニングのための効果的かつスケーラブルなアプローチであることを確立しています。
強化学習(RL)による視覚-言語-行動(VLA)モデルのポストトレーニングは、ロボット操作において大きな可能性を示している。RL手法の中で、クリティックベースのアプローチは、主に単一フレームの観測または単一フレームのVLMバックボーン潜在表現に基づいて動作する価値推定器に依存しており、これはロボット制御の部分観測可能な性質との根本的なミスマッチである。観測履歴をクリティックに組み込む単純なアプローチは、高次元の視覚空間において指数関数的な複雑さを招き、さらに純粋なスカラーリターン回帰では時間横断的なダイナミクスを学習するための十分な教師信号が得られないため、依然として失敗する。我々は、その根本原因を状態近似問題として特定する。すなわち、明示的な世界モデルの目的関数がなければ、クリティックの表現は正確な価値推定に必要な時間的構造を捕捉できない。この問題に対処するため、我々は軽量なLeJEPAアーキテクチャに基づくWorld Critic Model(WCM)を提案する。WCMは将来の潜在状態を予測し、価値を推定することを同時に行い、クリティックの表現が単にスカラーリターンを回帰するのではなく、時間的ダイナミクスを捕捉するよう明示的に訓練される。WCMはオン方策およびオフ方策の両方の訓練パイプラインにシームレスに統合でき、Pi0、Pi0.5、OpenVLA-OFTを含む最先端のVLAバックボーンと互換性がある。4つのベンチマーク、149のタスクにわたる広範な実験により、WCMが分布内および分布外の両方の設定で一貫して最先端の性能を達成し、特に強い汎化の向上を示すことを実証する。さらに、OpenVLA-OFTとPi0.5を用いたオフ方策RLによる7つの実世界操作タスクでWCMを検証し、多様な設定での安定した展開を確認した。
実世界のソフトウェア開発では、コーディングエージェントが共有ワークスペースで動作することが求められる。そこではユーザーが進行中のタスク中にコードを検査・修正する可能性がある。しかし、既存のリポジトリレベルのベンチマークは通常、単独で作業するエージェントを評価するか、ユーザーの関与をメッセージに限定している。このことから、次の問いが生じる:コーディングエージェントは共有ワークスペースにおけるコード変更をどのように理解し、対応するのだろうか? 我々はSWE-Touchを提案する。これは検証済みカウンターエディット(Counter-Edits)、すなわちタスク完了と競合するタスク関連コードへの妥当な編集を通じて、この設定をストレステストするフレームワークである。SWE-Touchは複数の修正軌跡からタスク重要領域を抽出し、独立したユーザーパッチ生成器(User Patch Generator)を用いて編集を構築し、エージェントが関連コードに到達した時点で文脈に応じたユーザーメッセージとともにそれらを注入する。 我々はSWE-bench Verified上で9つのコーディングモデルを評価し、さらにSWE-Bench ProとDeepSWEのより長期的なタスクでも追加実験を行った。カウンターエディットはSWE-bench Verifiedにおける平均解決率を7.7パーセントポイント低下させ、両方の長期的ベンチマークでも性能低下が持続した。軌跡分析はこれらの失敗を、進化するワークスペースに対する認識の限界に起因するものとして関連付ける:エージェントは競合するコードを保持するか、リポジトリを十分に再検査せず、対象を絞ったテストで改訂コードを検証することなくコードを置き換える可能性がある。 これらの発見は、強力な自律的性能が、共有ワークスペースでの協調に必要な状態認識と適応的行動を未だ保証していないことを示しており、ワークスペースの変更の検出、競合する編集とタスクの整合、影響を受ける動作の検証を、今後の最適化のための主要な能力として示す。
DiffusionGemmaを紹介する。これは、離散拡散を用いてテキストを極めて高速に生成する実験的なオープンウェイト言語モデルである。DiffusionGemmaは一度に1トークンずつデコードするのではなく、256トークンのブロックを並列に反復的に精緻化することで、従来の自己回帰(AR)大規模言語モデルにおける逐次デコードのボトルネックを回避する。DiffusionGemmaはゼロから学習するのではなく、活性化3.8B・総25.2Bパラメータを備えた混合専門家(MoE)モデルであるGemma 4をファインチューニングすることで得られる。計算効率の高い2段階トレーニングパイプラインは、元のARモデルの総トレーニングトークン予算の10%未満しか使用しない。第1段階では教師ありファインチューニングにより双方向ノイズ除去を学習し、第2段階では強化学習とサンプラー蒸留を組み合わせることで、生成品質と推論効率を同時に向上させる。DiffusionGemmaは、生成速度とモデル性能のトレードオフにおける新たなパレート最前線を確立する。全評価スイートにわたる平均では、フォワードパスあたり約20トークンを生成し、単一のNVIDIA H100 GPU上で毎秒約1,500出力トークンを達成する。これは、最先端の投機的デコードを用いたARモデルよりも大幅に高速である。また、DiffusionGemmaは元のモデルの思考モード、マルチモーダル入力、長いコンテキストへの対応も維持している。拡散ファインチューニングにもかかわらず、わずかな性能低下のみでAR生成も可能であり、ハイブリッド拡散-ARデコードへの道筋が示唆される。
最適化ベースの潜在推論は、モデルパラメータを凍結したまま、テスト時にインスタンス固有の連続状態を最適化することにより、大規模言語モデルの出力を改善する。しかし、既存手法は通常、これらの状態をデコードされたトークンを介して推論軌跡に接続するため、シーケンスレベルのクレジット割り当てが間接的となり、潜在状態の更新がその後の推論をどのように形成するかが不明瞭である。我々は、選択したTransformer層において、プロンプトの隠れ表現と生成された継続部分の間に最適化可能な潜在状態を挿入するGradCuit(勾配を回路に通す)を導入する。因果的自己注意により、各継続トークンの対数確率は、残りのTransformerブロックを通じて先行するすべての潜在状態への微分可能な経路を持ち、継続全体からの報酬重み付き勾配を潜在状態に直接割り当てることが可能になる。5つの指示チューニング済みバックボーン、3つの推論ベンチマーク、2つの解答形式にわたって、GradCuitは平均精度64.5%を達成し、思考連鎖プロンプティングを6.6パーセントポイント、最強の競合手法を2.4ポイント上回る。GradCuitはまた、より高い堅牢性を示す:7つの学習率設定にわたってLatentSeekを一貫して上回りながら、精度の標準偏差を1.53から0.82に低減し、そのランダムウォーク変種でさえLatentSeekと競争力を維持する。解釈可能性については、トークンレベルの勾配帰属により、潜在状態の影響が推論接続トークンに集中することが明らかになり、層分析では初期から中間のTransformer層が最も効果的な最適化空間であることが特定される。結果フィードバックから内部推論を直接最適化することにより、GradCuitは、LLMが出力を単に再生成、サンプリング、再ランキングするのではなく、推論の仕方そのものを適応させる、堅牢かつ解釈可能なテスト時スケーリングの新たな軸を切り開く。
ビデオモーション転送は、参照ビデオのダイナミクスを用いて対象物体をアニメーション化することを目的としています。既存の定式化は主に固定された構造的対応関係に依存しており、参照物体と対象物体の形態、関節構造、または変形機構が大幅に異なる場合には、その定義が不明確になります。我々は、固定された構造的対応関係を超えたモーション転送を目指す視点である Motion Beyond Morphology(形態を超えたモーション)を導入します。これは、異なる対象形態間でも意味を保つダイナミクスを保持することによって実現されます。これを実現するために、2段階のフレームワークを提案します。ステージIでは、補完的な多粒度の抽象モーションビューを学習し、それらを用いて、多様な形態にわたって転送可能なダイナミクスを保持するクロスカテゴリのビデオペアをブートストラップします。ステージIIでは、この監視信号を参照ビデオ条件付きの直接生成に内在化し、推論時の明示的なモーション抽出を不要にします。さらに、Same(同一)、Near(近接)、Far(遠隔)のカテゴリ間ギャップにわたって画像条件付きおよびテキスト条件付きのモーション転送を学習・評価するための OpenVMT-Dataset と OpenVMT-Bench を導入し、採択後に両方を公開する予定です。大規模な実験により、モーション忠実度と対象保持の両方において最先端の性能を達成することを示します。プロジェクトページ: https://miniz233.github.io/MotionBeyondMorphology/
GPTQ、あるいはそれと等価なBabaiの最近平面アルゴリズムなどの適応的丸め法は、二次計量の下で実行列を整数に丸める。これらの手法は、固定された順序でエントリを一つずつ処理し、各丸め誤差を三角フィードバック行列を通じて未処理のエントリに伝播させる。本研究では、このタスクの両側版を扱う。そこでは、固定された正則基底行列が残差の左と右の両方に作用する。よく知られた片側の場合(one-sided case)は、右基底が単位行列である特別な場合に相当する。 行列をベクトル化すると、両側版の目的関数は、グラム行列がクロネッカー積となる二次計量に変換される。したがって、一次元アルゴリズムをそのまま適用できるが、行列の次元に対して四乗の時間を要する。我々は、同一の丸め行列を三乗時間で生成するGPTQ-2Dを提案する。これはエントリを反対角(anti-diagonal)ごとに丸める。同じ反対角上のエントリは独立であり、並列に丸められる。
大規模言語モデルは、本番コードの作成や修正にますます活用されている。しかし、テストに合格するパッチがコードベースの保守を難しくしているという証拠が増えつつある。我々はその具体的な原因の一つとして、削除回避、すなわち意図した編集が削除を必要とするコードを保持しようとする系統的な傾向を特定した。公式SWE-bench Verifiedリーダーボードの上位5モデルでは、5モデルすべてが解けるタスクであっても、開発者パッチに対する削除再現率は最大で71.7%にとどまる。さらに、モデルは必要な削除の92%以上で正しいファイルに到達する一方、正確な行を削除できるのは52%未満の場合のみである。実際には、テストを通過するパッチの29.0%が、対象のコードをガードまたはフォールバックで包んでおり、我々はこれを「ガード・アンド・ゴー」と呼ぶ。このようなパッチが合格するのは、元のテストが削除をほとんど検証しないためである。対象コードが残っていると失敗するテストをVerifiedタスク34件に後付けしたところ、クローズドおよびオープンウェイトにわたる4つのフロンティアモデルの成功率は63.2%から41.9%に低下した。実際の修正では削除と追加が混在するため、我々は、必要な編集がすべて削除であるタスクを実際のコミットから抽出した200タスクからなるベンチマーク「CanItDelete」を構築した。追加作業がなくなっても、最良のモデルでも5タスクに1つは失敗し、小規模なオープンモデルでは成功率が18.0%にまで落ち込む。次に、GPT-5.6 Solに対して4つの累積プロンプトでアブレーションを行った。正確な行を供給するまでは成功率はほとんど変わらない。正確な行を供給すると不完全な削除はほぼなくなるが、成功率は80.5%にしか上がらない。これは、モデルが指定範囲を超えて削除したり、代わりにコードを追加したりするためである。最後に、パイロット研究を通じて一つの可能な改善策を示す。ポストトレーニング中に削除を学習させることで削除回避が減り、より広範なコード編集性能が向上する。これは、この挙動が手の届かないものではなく、訓練不足によるものであることを示唆している。
既存の屋内レイアウト生成器は、全体的には妥当なレイアウトを生成するものの、衝突、範囲外配置、開口部の妨害、動線の遮断などの局所的な違反を残すことがある。従来の研究の多くはシーン全体の合成やシーンレベルの最適化に焦点を当てており、原因となるオブジェクトの特定や影響を受けた領域の局所的な修復には十分に対応していない。本稿では、これらの違反をスパースなオブジェクト接地型修復問題として捉えるリフレクティブ修復フレームワーク「Roomer」を提案する。Roomerはレイアウトを「RoState」として符号化し、「RoReview」を用いて測定された違反を関与するオブジェクトに紐付ける。幾何条件付き視覚言語モデルのプランナーが構造化された局所編集を提案し、決定論的ソルバーがそれを検証して、必要な場合には有限個の候補編集を生成する。各候補は、シーン全体の検証により、対象の違反を解決し、新たなハード違反や保護制約の違反を生じないことが確認された場合にのみ採用される。プランナーは、欠陥レイアウトとオブジェクト接地型の違反証拠、および実行可能であることが既知の逆StatePatchesを対にした制御破損データセット「Roomer-CC」で学習される。既存のベンチマークは物理的に妥当なレイアウトが実際に使用可能であるかを評価することは稀であるため、本稿では分布品質、物理的妥当性、実用性を評価する「Roomer-Eval」を導入する。実験により、Roomerが有効な領域を保ちながら残存違反を修復し、物理的妥当性と実用性を向上させ、外部のジェネレータにも転移することが示される。
マルチモーダル大規模言語モデル(MLLMs)は視覚的理解と推論を大きく進歩させてきたが、その静的なパラメトリック知識は、知識集約的で動的に変化するオープンワールド問題への対処能力を制限している。この限界を克服するため、マルチモーダル深層検索がオープンワールド情報アクセスの重要方向として台頭し、単一ターンの事実検索から、視覚的証拠に導かれる長期的・多ターン検索へと進化してきた。しかしながら、既存手法は通常、視覚を入力段階または回答段階に限定しており、中間推論におけるその役割を見落とし、長期的な対話に適した設計も欠いている。その結果、視覚的証拠が継続的な検索を駆動することはほとんどなく、対話の深さと推論の広がりの両方が制約されている。これらの限界に対処するため、我々はビジョン・イン・ザ・ループ検索のための長期的マルチモーダル深層検索フレームワークであるDeepVoyager-VLを提案する。具体的には、マルチモーダルイベントグラフを構築してデータ合成を駆動し、中間の視覚的依存関係と長い推論チェーンを持つ問題を生成する。次に、能動的な視覚取得とオンデマンド画像ロードのためのエージェントフレームワークを設計する。最後に、強化学習を用いずに合成データ上でモデルをファインチューニングする。10のマルチモーダル検索ベンチマークにわたる広範な実験により、本手法の有効性が実証された。
最近の3D視覚言語モデル(3D VLM)は、2D視覚特徴をワールド座標に投影することで幾何学的認識トークンを構築し、3D質問応答などのタスクにおける空間推論を可能にする。しかし、この設計ではシーンごとに数千のトークンが生成されるため、計算コストとメモリオーバーヘッドが大きくなる。トークン圧縮は2D VLMで広く研究されてきたが、既存の手法は意味的関連性や注意ベースの選択に依存しており、3Dトークンの構造化された空間的性質を見落としている。さらに、空間的集約後もオブジェクトレベルのトークン不均衡が残るため、3D表現の冗長性は空間的近接性だけでは解決できない。この問題に対処するため、我々は3段階のトークン圧縮フレームワークである3DZipを提案する。3DZipは、まず粗いボクセル化を用いて点レベルの冗長性を除去し、次に行列式点過程による特徴空間の多様性に基づいてアンカートークンを選択し、最後に空間的制約の下で残りのトークンを統合して幾何学的一貫性を保つ。3つの3D質問応答ベンチマークでの実験により、3DZipは既存の圧縮手法を一貫して上回り、わずか128トークンで元の性能の94.7%を保持し、1.92倍の推論速度を達成することを実証した。
長時間かつリアルタイムなトーキングヘッド生成は、遅延と品質のトレードオフにより依然として困難である。すなわち、非効率的な多段階拡散はストリーミング生成を妨げる一方、リアルタイムの自己回帰的手法は誤差蓄積とアイデンティティのドリフトに悩まされる。この課題に対処するため、我々はLeapTalkを提案する。これは、単一のフォワードステップで安定かつリアルタイムなトーキングヘッド生成を実現し、任意の長さの動画へ拡張可能な新しいフレームワークである。我々のアプローチの中核は単一ステップのブリッジ蒸留スキームにある。一方で、従来のノイズからデータへのパラダイムから離れ、ブラウン橋に基づくデータからデータへの輸送定式化を導入する。永続的な参照に固定されることで、この戦略はアイデンティティのドリフトを効果的に軽減し、長期的な時間的安定性を向上させる。他方で、事前学習済みの拡散教師モデルから生徒ブリッジモデルへの円滑な知識転移を可能にするため、SNR整合型時間変換Φ(τ)を備えた異種間蒸留フレームワークを探究する。これは2つのモデル間の機能的乖離を埋める。さらに、極端なステップ数削減下でもきめ細かな口唇同期を維持するため、音声駆動の分類器フリーガイダンス機構を提案する。広範な実験により、我々の手法はわずか1ステップで最大200FPSの高忠実かつ時間的に一貫した動画生成を実現し、効率と安定性の両方において既存手法を大幅に上回ることを示す。プロジェクトページ: https://zhangrongxiang.github.io/leaptalk-page/
操作中の物体軌道の正確な予測は、知覚-行動ループを閉じるために不可欠です。しかし、進展は2つの点で制限されています。利用可能なデータセットは細粒度の言語-動作アノテーションを欠いており、既存の予測器は、ビデオ、深度、CADモデルなどの特権入力に依存するか、またはコストが高くエラーが発生しやすい知覚パイプラインを通じて、完全に生成されたビデオから動作を復元しています。我々は、MOVEデータセットを用いて教師信号のギャップを解消します。MOVEデータセットは、5,038個の物体中心のエゴセントリック軌道から構成され、各軌道には粗い動詞-名詞ラベルではなく、細粒度の自然言語指示が付与されています。さらに、我々はDreamTrajを提案します。DreamTrajは、単一のRGB画像とタスク指示から6自由度の物体軌道を予測し、推論時にビデオ、深度、CADモデルを必要としません。ビデオを生成する代わりに、凍結された画像からビデオへの拡散モデルの内部表現から、初期のノイズ除去ステップで動作を読み取ります。軽量なフローマッチングリーダーが、クエリ-キー注意トラックとプールされた隠れ状態を相対6自由度ポーズにデコードします。我々の知る限り、これは生成されたピクセルではなく、中間のビデオ拡散表現から物体の6自由度軌道を直接デコードする最初のアプローチです。DreamTrajは、複数フレームまたは特権入力を使用する予測器と比較して、並進と回転の両方で新しい最先端を達成し、生成-抽出パイプラインより4.6倍高速に動作します。
固定レイアウトでの屋内家具スタイリングでは、指定された家具カテゴリ、位置、向き、スケールを変更せずに、一貫性のある部屋を構成するアセットを選択することが求められる。既存手法は通常、各アセットを独立に検索するか、静的な局所関係に依存するため、シーン合成後に形状・素材・色の矛盾が生じやすい。本稿では、動的ハイパーグラフスタイルフィールドに基づくシーンレベルの構造化選択フレームワークであるStyleForgeを提案する。凍結されたマルチモーダル大規模言語モデルが、自由形式のスタイル要求と固定レイアウトから構造化されたスタイル事前知識を抽出し、StyleForgeは各家具スロットに対して学習可能な候補分布を維持する。対象スタイルを条件として、動的ハイパーグラフスタイルフィールドはレイアウト由来のハイパーエッジを適応的に活性化・重み付けし、家具間の高次依存関係を捉える。反事実的スタイル嗜好学習では、各候補を現在のスタイルフィールドにおける局所的置換として扱い、マハラノビスエネルギーを用いて文脈的互換性を評価する。学習はスタイルフィールドと候補ロジットの最適化を交互に行う。推論時には、モデルは凍結されたままであり、テスト時学習は部屋固有の候補ロジットのみを更新し、グローバルなシーンコンテキストの進化に伴ってクロススロットのスタイル矛盾を段階的に修正する。3D-FRONTにおける実験により、最先端の家具検索性能とシーンレベルのスタイル一貫性を示し、オブジェクトレベルおよびシーンレベルの検索ベースラインよりも一貫性のある固定レイアウト家具配置を生成することを確認した。
近年の画像生成器は、人間中心の説得力のある画像を合成できるが、有用なコレクションを生成することは、単一の成功した画像を生成することとは依然として異なる。人間中心のデータセットは、多様な人物と文脈をカバーし、非現実的な属性の組み合わせを避け、日常的な写真らしさを保ち、大規模な品質管理の判断を明示しなければならない。我々は、人間中心の画像データセット合成のための再現可能なSpecify--Render--Inspect(指定・レンダリング・検査)パイプラインであるPoplarを提案する。Specifyは、常識的な制約の下で構造化属性をサンプリングし、それらを写真指向のプロンプトとして言語化する。Renderは、構図を考慮したアスペクト比にわたって現実性に適応した画像生成器を使用し、明らかな技術的失敗を再試行する。Inspectは、各候補に単一の構造化された視覚・言語レビューを適用し、元のプロンプトを保持しながら、画像固有の欠陥または重大なプロンプト不一致を拒否する。Poplarを用いて、我々はPoplar-9Kを構築する:レビュー済み候補11,765件から保持された9,401件のキュレーション済み人間中心の画像・テキストペア(受理率79.9\%)。我々は、カスタマイズ可能な人間中心のコレクションを構築するためのコンパクトなリソースとして、パイプライン、構成、不変の生成プロンプト、および監査可能な検査記録とともにデータセットを公開する。
オープンワールド環境で堅牢に動作するためには、自律エージェントはドキュメントが存在しない場合でも、相互作用のみを通じて未知のシステムの挙動を推論できなければならない。しかしながら、既存のツール使用ベンチマークは静的な環境で意味的ツールスキーマを公開しており、エージェントは自律的な発見ではなく事前知識に依存することが可能である。この限界に対処するため、我々は行動推論を分離して評価するよう設計された対話型ターミナルベンチマークであるScrambleToolBenchを導入する。このベンチマークは意味的手がかりを除去し、継続的なタスクカリキュラムを課すことで、エージェントに試行錯誤による相互作用のみを通じて隠されたツールの挙動を発見することを要求する。さらに、このベンチマークはマッピングドリフト、確率的アクション失敗、時間的実行ウィンドウといった動的課題を導入し、環境の変化に応じてエージェントが仮説を修正・適応できるかを評価する。最先端の言語モデルを用いた評価の結果、初期発見の成功は堅牢な適応にはつながらないことが明らかになった。マッピングドリフトなどの構造的変化に直面した際、エージェントはサイクル追跡などの演繹的戦略を使用できず、代わりに信念慣性を示すか、網羅的探索に後退する。テスト時推論を強化しても、演繹的回復を可能にするのではなく、この高コストな力任せ探索を増幅するだけである。エージェントに永続的メモリを装備することで累積的なエラーは減少するものの、構造的変化を効率的に推論することは依然として不可能であり、現在のエージェント推論におけるギャップが浮き彫りになっている。
既存の評価手法は、エージェントの失敗をシステムレベルの結果に還元することが多く、障害がどこに起因するのか、どの介入がエージェントシステムを改善するのかを不明瞭にしている。これにより修復割り当て問題が生じる。すなわち、同じ目に見える失敗であっても、その発生源によって、モデルのポストトレーニング、ハーネスエンジニアリング、環境再設計、ベンチマーク修正のいずれかが必要となる可能性がある。エージェントの振る舞いは、モデル、ハーネス、ユーザー、ツール、メモリ、環境間の相互作用から創発するため、結果レベルのラベルは改善には不十分なことが多い。既存の失敗分類法のほとんどは、ベンチマーク固有であり共通の構造を欠いているため、この問題の解決にほとんど寄与していない。本稿では、失敗をその発生源となる相互作用に特定し、責任のある構成要素を識別する、相互作用中心の分類法を提案する。この分類法は41の失敗モードを整理し、各モードを2つの構成要素間のエッジと、修復が属する側を示す障害側に割り当てる。これにより、この分類法は実践的となる。すなわち、モデル側の失敗はポストトレーニングの対象を特定し、ハーネス側の失敗はスキャフォールディングとツール統合の修正を指し示し、環境または評価者側の失敗は再設計を要する評価条件を明らかにする。このスキーマは、コーディングアシスタントから長期的なパーソナルアシスタント、マルチエージェントシステムに至るまで、さまざまなエージェントアーキテクチャに適用可能である。我々はこの分類法を、公開ベンチマーク、モデルのシステムカード、公開レポート、記録されたエージェントの軌跡からの具体例に基づいて基礎づけ、独立した推論エージェントを判定者として用いてその再現性を評価する。4つのフロンティアモデルの中で、最も強力な判定者は人間のカテゴリラベルに対してコーエンのκ=0.76を達成し、このカテゴリが注釈者固有の嗜好ではなく共有構造を捉えていることを示唆している。
現代のレコメンダーモデルの最適化は、依然としてエンジニアによるアーキテクチャ、目的関数、学習戦略の変更を手作業で繰り返す試行錯誤に大きく依存しています。LLMベースのエージェントはこの試行錯誤プロセスを自動化できますが、LLMに変更方向の選択と具体的な仮説の生成の両方を任せると、限られた実験予算の下では探索が不安定になることがよくあります。上記の課題に着想を得て、我々は自動レコメンダーモデル最適化のためのBandit-Routed Agentic HarnessであるRecHarnessを提案します。RecHarnessは最適化プロセスを2つのステップに分離します。バンディットルーターが過去の検証フィードバックに基づいて次の変更方向を選択し、LLMが選択された方向内で具体的な最適化仮説と実行可能なコード編集を生成します。長期的な探索を持続するために、RecHarnessはジャンプベイスン機構を用いて、局所的な編集が停滞した際に構造的ジャンプアームを活性化します。複数のレコメンデーションタスク、データセット、モデルバックボーンにわたって、RecHarnessはLLM推論探索よりも安定した性能向上を達成し、限られた試行予算をより効果的に活用します。大規模なショート動画広告プラットフォームでの7日間のオンラインA/Bテストでは、選択された候補がADVVを2.084%、収益を0.534%、露出を0.559%改善しました。コードはhttps://github.com/6lyc/RecHarnessで公開されています。
ビジョン言語MoEのバッチには、画像トークンとテキストトークンがそれぞれ異なる数だけ含まれる。画像解像度、画像数、タイリング、プロンプト長はすべてこのトークン混合比を変化させる。我々は標準的なトークンレベルのSwitch補助損失をStd-Auxと呼ぶ。Std-Auxは混合負荷のみをバランスさせるため、ある混合比では大きな画像負荷誤差とテキスト負荷誤差が互いに相殺され得る。我々の主要モデルでは、同じ学習済みルーターが、画像解像度に応じて負荷不均衡を5倍以上変化させる。我々は画像とテキストの負荷プロファイルを固定し、トークン混合比が変化するときの正確な負荷曲線を導出する。画像とテキストの負荷ギャップがトークン混合比に対する感度を決定する。物理的な前処理も条件付きプロファイルを変え得る。固定プロファイルの法則はそのような変化を除外する。 対策を設計するために、我々はルーターの入力構造を調べる。画像とテキストは明確に分かれた領域を占める一方、視覚トークンはソース画像ごとに強くグループ化される。モダリティの境界は、画像とテキストの項を分離する動機を与える。画像の境界は、画像ごとに1つの等重みルーティングインスタンスを設ける動機を与える。ReBA(Relax Within, Balance Across)は、これらの両方の選択を実装する。4つの分割バックボーンにわたり、ReBAは報告されたすべてのベンチマーク入力で負荷を低減し、平均タスク精度をStd-Auxと同等に保つ。ReBAはまた、テストした範囲での平均負荷と、解像度およびタイリングの変化における最悪の物理負荷を低減する。コードはhttps://github.com/ZiangWu-77/ReBAで入手できる。
LLMエージェントは、長期的なインタラクションにわたって一貫して行動するためにメモリを必要とするが、多くのシステムではそのメモリを操作するために追加のLLM呼び出しを使用している。中間レコードの生成とその検索の仲介には、反復的なトークンと時間のコストがかかり、省略や統合された詳細は元の証拠を曖昧にする可能性がある。我々は、構造化されたメモリアクセスがそもそも生成を必要とするのかどうかを問う。Zero-Memはゼロトークンのメモリ操作を導入する。最終的な質問応答以外のステップではLLMを呼び出さず、LLMの入力または出力トークンを消費しない。エンコーダの計算は別途扱われる。Zero-Memは元のインタラクショントレースを記録のソースとして保持する。トレースは2つの補完的な方法で整理される。エンティティ・コンテキストグラフはインタラクション間の接続を明らかにし、時間的階層は会話の局所性とセッション状態を保持する。各クエリに対して、Zero-Memは2つのビューを重み付けし、両方から検索し、その構造に従って支持する関係や周囲のコンテキストを回復する。決定論的キャリブレーションは、まず矛盾する証拠を破棄し、次に取得したトレースに基づいてリーダーの回答を維持する。最終QAリーダーのみがLLMを呼び出す。長期メモリおよび長期コンテキストの質問応答ベンチマークにおいて、Zero-Memはメモリ操作からLLM呼び出しとLLMトークン消費を排除しながら、競争力のある性能を達成する。同じ最終QAリーダーとコンテキスト予算を使用した場合、最速の比較ベースラインと比較してメモリ操作の時間コストを57.6%削減する。アブレーションは、2つのビューの貢献とそのクエリ依存の調整を支持する。全体として、これらの結果は、構造化されたエージェントメモリが過去の中間表現を生成する必要がないことを示している。査読後、コードと実装の詳細は blue{https://github.com/TheMoon0815/Zero-mem} で公開される。
マルチモーダルAIを用いた科学図の理解と推論には、視覚的知覚とドメイン固有の推論の統合が必要であり、研究論文のテキストにはしばしば明示されない有意義な知識を抽出する。コミュニティ主導のコンペティションを伴うSci-ImageMinerベンチマークデータセットは、専門家によるアノテーションが施された包括的なデータセットを4つのエンドツーエンドの相補的タスクにわたってキュレーションすることにより、従来の科学系コンペティションの水準を引き上げるものである。本コンペティションには、2026年1月9日から2026年4月8日までの期間に68名のアクティブな参加者が集まり、1,263件の公開・非公開の提出が行われた。我々の結果は、最先端のマルチモーダルモデルが分類タスクと要約タスクでは良好な性能を発揮する一方、データ抽出と科学推論、特に視覚的質問応答においては困難に直面することを示している。これらの知見は、主要な限界を明らかにし、ドメイン認識型マルチモーダルAIシステムの改善に向けた課題と機会を浮き彫りにする。全体として、Sci-ImageMinerベンチマークとコンペティションは、科学図の理解と推論に関する研究を前進させるための厳格なプラットフォームを確立し、挑戦的で複雑な研究領域における最先端アプローチの可能性を示すものである。
マルチモーダル臨床モデルは通常、全モダリティが揃った状態での精度によって評価される。しかし実運用ではモダリティが欠落する。心電図(ECG)が日常的に取得される環境では、心エコー図が利用できないことは珍しくない。このとき重要となるのは、精度低下の大きさだけではない。どのモダリティがその精度低下の原因なのか、そしてそのモダリティが欠落した際にモデルが明確に失敗するのか、それとも静かに失敗するのか、という二つの問いが浮上する。この区別は事例単位かつモダリティレベルのものであり、事後的な特徴帰属(例:SHAP)とは異なる。モデルは頻繁に置き換えられるため、これらの問いに答える評価手続きは再利用可能であるべきだ。本稿では、モデル非依存のモダリティ障害フレームワークを提案する。このフレームワークは、N個のモダリティ埋め込みと任意のマスク対応プローブ、ラベルを入力とし、事例ごとの失敗分類、誤りをモダリティに帰属させるモダリティ別相補性行列、そして実運用で観測可能なシグナルのみを用いて、監視可能な失敗と決定境界から遠く離れて未検出のまま通過する失敗を分離する、顕在的/潜在的(loud-vs-silent)ドロップアウトプロファイルを出力する。我々はこれを小規模でユニットテスト済みのハーネスとして公開し、人工的に植え付けた正解データに対して検証した。シードを変えた複数の実験において、植え付けたモダリティ優位性と相補的サブセットを復元し、モダリティ別の顕在的/潜在的失敗率を報告し、3モダリティの相補性行列へ拡張できることを確認した。植え付けた構造は構成上既知であるため、これは臨床性能ではなく、事例ごとの帰属復元の検証である。続いて、ペア化されたMIMIC-IVコホートにおいて、LVEFおよびEF≤40%のHFrEFゲートに対する凍結EchoJEPAおよびHuBERT-ECG埋め込みに本フレームワークを適用した。保持されたテスト分割(n=245)では、エコーを削除すると誤差がほぼ2倍になった。コホートサイズを制約するエコーとECGの重なりの狭さは、それ自体が心臓基盤モデルにとっての実運用上の発見である。我々の成果はすべて https://github.com/criticaldata/PRIMED-AI で入手可能である。
長期的なエージェントは、そのKVキャッシュをメモリとして再利用することが増えている。サービス提供システムは、キャッシュされたエントリの一部を保持し、残りを破棄する。したがって、エビクション方式とエピソード記憶方式は、直接テストされることがほとんどない前提、すなわち「それを生成した観測が消えた後も、保持されたイベントが依然として有益である」という前提に依存している。我々はこの前提を、それ以外は同一のエージェント履歴において、提供される内容から以前の観測を1つ省略することによって検証した。その観測に敏感な項目のうち、回答は圧倒的に省略された値に従っていた。ただし、提供されたスパンにはどの値が正しいかを示すものは一切ない。我々はこれをセマンティック・マテリアライゼーション(意味的具現化)と呼ぶ。すなわち、下流のイベントのキャッシュ行は、入力が消えた計算の独立してサービス可能なビューとして機能する。これは意図的に書き込むこともできる。意図的に表現された回答を含まないイベントは、値を一切明示することなく、Qwen3-8Bにおいてドナー整合の回復率を6%から51%に引き上げる。一方、長期対話から自然な言及を受動的に収集しても、検出可能な利点は得られない。このような行が保持する内容は、特定的かつ限定的である。コンパクトな状態は生き残る一方、より大きなペイロードはチャンスレベルに向かって減衰する。また、ある構文が書き込みを行うかどうかは、意味のみならず表現方法に依存するため、モデルが同等に理解する2つの表現であっても、結果が大きく乖離することがある。この結果は、スパースなイベントKVサービスにおけるメモリ契約を示すものである。すなわち、何を書き込むか、どこに配置されるか、そしてソースが消えた後に何が生き残るか、ということである。エビクションを行う者にとっての帰結は、ソースイベントを破棄しても精度の低下が見られないことは、そのソースが不要であったことを示すものではない、ということである。
エンタープライズ質問応答では、モデルが汎用能力を失うことなく専有知識を獲得することが求められる。本稿では、文書からタスク指向の教師信号を構築し、汎用データのリプレイを伴う教師ありファインチューニングを実施し、残差エラーに対して強化学習を適用する3段階のパイプラインであるWnuanを提示する。707問のWnuanBenchでは、主要な32Bルートにおいて、許容回答率(AAR)が適応前の52.76%から、SFT後には80.06%、RL後には91.51%へと向上する。一致させた100更新プロトコルの下では、残差エラーサンプリングは、全プールサンプリングとサイズを一致させたランダムサンプリングをそれぞれ3.11ポイントおよび2.97ポイント上回る。ソースクラスタのブートストラップ区間は、両対比においてゼロより上にあり、同一ドメインの検証セットでもその順序が維持される。汎用ベンチマークの平均は、このルート全体で5.17ポイント低下し、その低下は指示追従に集中している。自動評価アンサンブルは、層化されたWnuan-Inst応答サンプルの90.5%において、権威あるドメイン専門家と一致する。これらの結果は、段階的エンタープライズ適応による利点と汎用能力コストの両方を特徴づけるものである。
マルチモーダル大規模言語モデル(MLLM)は、視覚入力を事前学習済み言語モデルの豊富な事前知識と統合することで高い性能を達成する。しかし、視覚中心のタスク、特に視覚的証拠が事前知識と矛盾する場合には、しばしば失敗する。我々は、この失敗を2つの診断パラダイムを用いて個別に調査する。(1) 画像再構成による視覚情報の利用可能性の調査、(2) マルチモーダル文脈感度、すなわちモデルが言語事前知識よりも視覚的文脈にどの程度従うかの測定である。2つ目の調査を支援するために、我々はWhatIfVisを導入する。これは5つの粗粒度の次元(時空間、色、数、大きさ、重さ)にわたるベンチマークであり、その質問は画像または事前知識のいずれかから答えを得ることができる。 我々の分析は3つの知見をもたらす。(i) 粗粒度の視覚的証拠は保持されている。なぜなら、これらの属性は凍結されたMLLMの最終層の画像トークンから再構成できるからである。したがって、これらの属性に関する質問での失敗は、知覚中の視覚エンコーディングの劣化ではなく、知覚後の利用の問題を示している。(ii) 視覚的証拠を使用または無視するよう明示的に指示された場合でも、バニラモデル(WhatIfVisでの教師ありファインチューニングを行っていないモデル)は不安定な視覚的文脈感度を示す。教師ありファインチューニング(SFT)はこの制御可能性を向上させ、ドメイン間で一般化する。さらに、アクティベーションパッチングにより、全6モデルにおいて、視覚対事前知識のトレードオフがアーキテクチャ固有の深さに局在することが明らかになる。(iii) 視覚対事前知識のトレードオフは、学習されたベクトルに沿って制御可能である。このステアリングベクトルを適用すると、意図の指示がなくても、バニラモデルよりも制御可能性が向上する。これらの結果を総合すると、ボトルネックは移動する。すなわち、我々が研究する粗い属性に関して、MLLMは視覚的証拠をエンコードするが、それへの依存を確実に制御できないことを示している。
地理空間基盤モデルは、地域やセンサーを超えて転移可能な表現の学習を目的としている。しかし、特定のタスクでの評価には、モデルがデータから価値を引き出す能力を測定できる大規模かつ高品質なマルチモーダルベンチマークが必要である。洪水マッピングに関しては、既存のデータセットは二時期SARと共位置合わせされた光学画像を大規模に組み合わせたものがほとんどなく、この下流タスクにおける基盤モデルの価値はほぼ検証されていない。本稿では、コペルニクス緊急管理サービスの活動記録から構築された大規模マルチモーダル洪水セグメンテーションベンチマークであるGEOID-Floodを紹介する。本データセットは、10年間にわたり65か国で発生した219のイベントを対象とし、GRDおよびRTC形式のイベント前後センチネル1共位置合わせ画像、イベント前のセンチネル2合成画像、DEMを含む14,000以上のタイルを提供し、恒久水域と氾濫水域を背景から分離する手動検証済みラベルを備える。このベンチマークを用いて、単一画像・多時期・マルチモーダルの各プロトコルにおいて、基盤モデルを従来のエンコーダと比較評価した。主な知見は以下の3点である:(1)基盤モデルは一貫しているものの控えめな利点をもたらす、(2)ファインチューニングを伴う光学SARフュージョンが一時的な氾濫の検出に最も有効である、(3)GEOID-Floodで訓練されたモデルは既存のデータセットで訓練されたモデルよりも未知のイベントへの転移に優れている。データセットとコードはhttps://github.com/links-ads/geoid-floodで入手可能である。
世界行動モデル(WAMs)は、行動生成と将来状態の予測を結合する。その有効性は、将来のダイナミクスが、行動生成と整合的であり、かつ行動がシーンをどこでどのように変化させるかを捉えるのに十分な幾何学的認識を備えた空間においてモデル化されるかどうかに依存する。既存のWAMは通常、この要件の一部しか満たしておらず、知覚的に重い観測空間のターゲットか、行動関連性と幾何学のために共同で構造化されていない補助的な潜在空間のいずれかに依存している。本稿では、方策由来の表現空間において幾何学的認識を備えた行動条件付きダイナミクスを直接学習する自己導出型フレームワークSG-WAMを提案する。SG-WAMは、学習可能なダイナミクストークンと、介在するロボットの行動を条件としてそれらの将来の潜在状態を予測する自己導出型世界予測器(Self-Guided World Predictor)を導入する。予測ターゲットは、同一の方策バックボーンの指数移動平均コピーによって生成され、行動エキスパートが使用する表現ファミリー内で安定した教師信号を提供する。幾何学的教師信号は、方策の画像トークン表現をさらに構造化し、ダイナミクストークンに空間的に基盤づけられたコンテキストを提供して、行動関連性があり幾何学的認識を備えた将来整合空間を生み出す。潜在空間における将来予測、幾何学的基盤付け、およびフローマッチング行動生成は、統一フレームワーク内でエンドツーエンドに共同最適化される。大規模な身体性事前学習を伴わない0.9Bモデルに基づき、SG-WAMはLIBEROで平均98.5%の成功率、LIBERO-Plusで73%を達成し、分布内および分布外の実世界評価の両方において強力なベースラインを上回る。
ピクセル空間拡散モデルは、生のピクセル上で直接エンドツーエンドの生成器を学習することを目的としている。これは、単一のモデルが同じ高次元空間において大域構造と局所テクスチャの両方を捉えなければならないため、困難な課題である。近年の研究では、代替の予測ターゲット、学習目的、アーキテクチャを通じてピクセル拡散を改善しているが、これらの進歩は通常、新しいモデルをゼロから学習することを必要とする。我々は、より低コストで相補的な戦略が存在することを示す:凍結された事前学習済みピクセル拡散モデルは、それ自体を誘導できる。我々の重要な観察は、事前学習済みのピクセル拡散トランスフォーマーの中間層を、主要な低周波構造を捉える粗い予測へとデコードできる一方、最終層が局所的な高周波の詳細を徐々に精緻化するという点である。そこで我々は、軽量な予測ヘッドを中間層に取り付け、バックボーンを凍結したまま、中間予測と最終予測の乖離をサンプリング時の自己誘導方向として用いる。さらに、このヘッドの学習には実画像は不要であることを見出した。代わりに、モデル生成サンプルで十分であり、特にピクセル拡散が過小適合しがちな高周波成分を強化する上で、ヘッドの学習において実画像よりも優れていることさえある。ImageNet上の複数のピクセル拡散モデルにわたり、我々の合成自己誘導(SSG)は生成を一貫して改善し、アダプター学習はフルモデル学習の計算コストの1%未満で済む:クラス分類器フリーガイダンス(CFG)なしで評価されたJiTの全変種においてFIDを50%以上削減し、CFGを用いた強力なベースラインもさらに改善する(例:JiT-H/16を1.86から1.67へ、PixelREPA-H/16を1.81から1.59へ)。我々のコードはhttps://github.com/zfu006/SSGで公開している。