翻訳付きの日次キュレーションされたAI研究論文
オンポリシー蒸留(OPD)は、検証可能な報酬を用いた強化学習(RLVR)の疎なアウトカムレベルの利点に代わる、密なトークンレベルの監視を提供する。しかしながら、教師モデルは本質的にオフポリシーとなる生徒生成の軌跡を採点するため、その監視の信頼性、ひいては生徒の改善の源泉は不明なままである。我々はOPD学習中の教師監視を定量的に分析し、教師の規模が大きくなるほどその頻度が増大する実質的なノイズを発見した。驚くべきことに、生徒の方策はこのようなノイズに鈍感であり、ノイズを含む監視を保持するか除去するかに関わらず、同等の性能に収束する。OPDはそもそも蒸留を行っているのだろうか?その利得を生み出す要因を分析すると、学習が低対数確率トークンに集中しており、単一の固定された負のアドバンテージを用いることが、教師が提供するアドバンテージと同等の性能を達成することが分かる。これは、OPDが主に低対数確率トークンの抑制によって機能しており、教師を必要としないことを示唆している。これらの発見は、エントロピー適応型の負のアドバンテージを用いる監視不要の手法であるOn-Policy Self-Adaptation(OPSA)を動機づける。OPSAは高エントロピー位置により強い学習信号を割り当て、テールトークンを抑制し、ヘッドトークン間で確率質量を均等に再分配する。ベースのQwen3-1.7Bと比較して、OPSAはAIME24でAvg@32を35.41ポイント改善し、これは263%の相対的な向上に相当する。また、全3つのベンチマークでPass@32を2倍以上に向上させる。さらに、AIME24のAvg@32においてOPDを16.77ポイント上回る。モデルファミリーやタスクにわたる広範な実験と分析により、その有効性と一般化可能性がさらに実証される。
近年のビデオ生成器は、しばしば音声を省略するか、別の段階で合成することが多く、視覚的なダイナミクスと音響イベントの相互モデリングが制限されている。本論文では、7Bジェネレータを中核とする、コンパクトなネイティブ統合音声-ビデオ生成システムであるDreamX-Creator 1.0を提案する。初帧とテキストプロンプトを条件として、生成器はモダリティ特化型の音声ストリームとビデオストリームを共同でデノイジングする。これらのストリームは、ネットワークの前半では独立に処理され、後半ではゲート付きクロスモーダルアテンション(Gated Cross-Modal Attention)を通じて結合される。このアテンション機構では、トークン単位およびヘッド単位の出力ゲートが、各活性化クロスモーダルアテンションヘッドの出力を変調する。統合型音声-ビデオデータシステム(Audio-Video Data System)は、時間的に一貫性のあるクリップを構築・フィルタリングし、構造化されたマルチモーダルアノテーションを生成し、クリップを能力指向のデータプールに整理する。段階的統合訓練(Progressive Joint Training)は、2段階の音声-ビデオ事前学習と、それに続く高品質ファインチューニング(High-Quality Finetuning)で構成される。さらに、音声-ビデオ強化学習(Audio-Video Reinforcement Learning)により、モダリティ認識型マルチモーダルフィードバック(Modality-Aware Multimodal Feedback)を用いて生成器を事後訓練し、ビデオ関連、音声関連、およびクロスモーダルなフィードバックを対応するストリームにルーティングする。高解像度出力のため、我々の自己回帰型1ステップ2Kリファインメントパイプライン(Autoregressive 1-Step 2K Refinement pipeline)は、双方向マルチステップの教師モデルを自己回帰型マルチステップリファイナーへ適応させ、それを各時間チャンクにつき1回のデノイジング評価のみを必要とする学生モデルへ蒸留する。全体として、DreamX-Creator 1.0は、オープンソースの最先端システムと競合する性能を備えた、ネイティブで同期した音声-ビデオ生成を実現する。我々は、コンパクトな7Bジェネレータと2Kリファイナーを公開することで、ネイティブな音声-ビデオ生成の民主化を図り、統合音声-ビデオ生成モデリングにおける将来の研究のためのアクセス可能な基盤を提供する。
構成可能なシーンモデリングは、実在の屋内シーンを、観測されたとおりの配置を持つ完全かつ編集可能なオブジェクトアセットとして復元することを目的とし、ロボットシミュレーションと身体化AIに対して、個々のオブジェクトを個別に操作できる実環境のシミュレーション対応レプリカを提供する。既存のパイプラインはこのタスクを、観測をインスタンスに解析する、各インスタンスのアセットを生成する、各アセットを元の位置に配置する、という三つのステップに分解する。しかし、各ステップは乱雑なキャプチャではめったに得られない入力、すなわち正確なインスタンス形状、遮蔽のないビュー、観測に正確に一致するアセットを前提としている。我々はこの順序を維持しつつ要件を再分配するLucidaを提案する。Lucidaでは、各ステップが実際のキャプチャが確実に提供する情報のみを入力として利用し、精度はパイプラインの開始時に要求されるのではなく、終端で達成される。Lucidaはビデオをシーングラフに解析し、そのノードはインスタンスごとの多視点エビデンスを保持する。そして各インスタンスについて、そのエビデンスから完全なアセットを生成し、アセットの配置にはGizmoActを用いる。GizmoActは配置を多ターンのGUI操作として扱うVLMポリシーであり、オブジェクトのギズモを閉ループで操作し、位置合わせが完了した時点を自ら決定する。シーンレベルの3D物体検出、物体姿勢推定、シーン再構成において、LucidaはR2S-Scene上でBoxerに対するmAPを69%向上させ、CA-1M上でADD-SB@0.05を57.8%から83.4%に引き上げ、シーンFスコアをSAM3Dの0.794から0.924に向上させる。
潜在生成モデルは通常、2段階のパイプラインを採用する。すなわち、再構成のために変分オートエンコーダーを訓練し、その後、凍結した潜在空間上で生成モデルを訓練する。再構成に最適化された潜在表現は必ずしも生成に適しているとは限らないため、両モデルを同時に訓練することは魅力的な代替手段である。しかし、直接的なエンドツーエンド訓練は、潜在空間の崩壊を引き起こしやすく、生成と再構成の間の相反する課題に直面するため、依然として困難である。我々は、異なる目的関数が潜在空間をどのように形成するかを分析することによってこの問題を再検討し、2つの重要な知見を得た。第一に、カルバック・ライブラー情報量の発散項におけるエントロピー項は、崩壊を防ぐために不可欠である。再構成と事前分布の適合は事後分布を縮小する傾向がある一方、エントロピーは非退化な潜在不確実性を維持する。第二に、再構成と生成は非対称な学習ダイナミクスを示す。再構成は高速かつ強く教師ありであるのに対し、生成はより遅く最適化が困難である。これらの知見に基づき、我々は潜在空間の崩壊を伴わない直接的なエンドツーエンド訓練を初めて達成し、生成を再構成よりも先に行う単純な戦略であるGenFirstを提案する。生成的目標は、弱い再構成圧力の下で最初に潜在空間を形成し、その後、視覚的詳細を復元するために再構成を段階的に強化する。我々はGenFirstを、厳密な尤度を持つ連続自己回帰事前分布と、暗黙的尤度を持つSiT事前分布を用いて検証する。我々のエンドツーエンド目的関数とGenFirstにより、SiTはImageNet-256においてCFGありでgFID 0.97、CFGなしで1.45を達成し、MMDiTはテキストから画像への生成においてGenEvalスコア0.90を達成する。画像生成を超えて、我々はこの枠組みを、生成と表現学習のための共有視覚潜在表現、および連続的な統合テキスト画像生成に拡張する。これらの結果は、生成事前分布とモダリティを横断した安定したエンドツーエンド潜在学習の一般性を示している。
低ランク適応(LoRA)はパラメータ効率的なモデル適応手法として広く用いられているが、安定かつ効果的な最適化を実現するための学習ダイナミクスの調整方法は未だ十分に研究されていない。LoRAはアッププロジェクション行列をゼロに初期化するため、その初期の最適化ダイナミクスは主にダウンプロジェクション行列によって支配される。この観察に基づき、我々は学習中にダウンプロジェクション行列を正規化する、単純でありながら効果的な手法である正規化低ランク適応(NoRA)を提案する。さらに、同じ正規化は初期化時のみに適用することも可能であり、学習全体を通じて繰り返し正規化を行うことなく標準的なLoRAを改善できることを示す。事前学習、教師ありファインチューニング、強化学習のいずれの設定においても、NoRAは一貫して収束を加速し、性能と学習の安定性を向上させ、破滅的忘却を軽減する。これらの利点は追加の学習可能パラメータも推論時の計算も必要としないため、NoRAはLoRAに対する単純かつ広く適用可能な改良となる。
研究計画はAI科学者の決定的な能力である。しかし、研究計画には検証可能な答えが存在しないため、強化学習には必要な環境、すなわち評価者と対になったタスクが欠けている。科学論文から抽出したルーブリックが評価者を提供できる。しかし、既存のパイプラインは質問と評価基準を同じ内容から引き出しているため、言い換えによって報酬を獲得できる。さらに、ルーブリックはロールアウトごとに単一のスカラー値へと圧縮される。我々は、各研究論文を完全なトレーニング環境へと変換する統合フレームワークであるPaperGymを紹介する。PaperGymは論文の構造を活用する。すなわち、質問は研究目標と背景から合成され、評価基準は手法と実験から導出される。評価基準は方法論的革新と実験デザインにわたり、基準リーケージは既存データセットの11.90%〜34.10%に対し3.7%に低下する。トレーニングではルーブリックを2回使用する。最初にOPSDの自己教師のための特権的文脈として、次にGRPOの報酬としてである。Qwen3-1.7B/4B/8Bにおいて、このスケジュールは教師ありファインチューニング、いずれかの段階単独、および逆順序を上回り、5つのベンチマーク平均を+5.6、+5.0、+4.8ポイント改善する。レシピを固定した状態で、PaperGym-20kで学習したモデルは三者比較の58.1%で勝利し、RubricHub Scienceの28.2%を上回る。学習済みQwen3-8BはResearchQAで73.48に達し、はるかに大規模なKimi K2.6を上回る。我々は、パイプライン、20,000インスタンスのコーパスPaperGym-20k、およびベンチマークPaperGym-InnovとPaperGym-Designを公開する。
本稿では、Qwen3.8-Flash-Nextのアーキテクチャとアブレーションについて述べる。本モデルはスパース混合エキスパートモデルであり、1,250億パラメータを有し、トークンあたり60億パラメータを活性化する。さらに、アクセラレータ外部に保持される510億パラメータのn-gram埋め込みテーブルを追加で持つ。14の事前学習ベンチマークのうち、本モデルは8つで従来モデルである397B-A17Bを上回り、残りでは最大2.6ポイントの差で下回る。その際、従来モデルと比較して、活性化パラメータは3分の1、学習トークン数は3分の1、学習FLOPsはおよそ9分の1である。トークン混合は、Gated DeltaNet (GDN) とグローバルアテンションの層ごとのハイブリッドを用いており、4層ごとに1つのフルアテンション層を配置する。継続事前学習時には、これらのフルアテンション層はQwen Sparse Attention (QSA) に置き換えられる。QSAは、圧縮された軽量なインデクサを用いてマイクロブロック単位で文脈をスコアリングする。残差ストリームは4つの分岐に拡張され、要素単位のゲートを介して読み出される。この設計をGated Residual (GR) と呼ぶ。容量は、バックボーンの外部に、ホストメモリからテーブルをプリフェッチする単一のn-gram埋め込み層によって追加される。我々は、すべての変更候補を3つの軸で評価する。すなわち、損失と下流ベンチマーク、学習・プリフィル・デコードにおける変更のコスト、および最適なハイパーパラメータと学習安定性への影響である。損失と下流精度は必ずしも連動しない。n-gram語彙を拡大すると損失は単調に低下するが、下流精度は飽和する。アーキテクチャとMuonオプティマイザを組み合わせることで、最適な学習率とバッチサイズは上方にシフトし、バッチサイズのウォームアップは不要となり、ストレステスト下での安定性が大幅に向上する。損失、ベンチマーク、効率、安定性は一つの設計問題を構成する。これらを統合的に解決することで、より効率的で、より高性能で、より安定したレシピが得られる。
本稿では、学習環境生成に特化して訓練されたモデル群CogEvolを提案する。CogEvolは、コース概要を完成済みの学習成果物(構造化JSONのスライド、または自己完結型のインタラクティブHTMLページ)へ単一パスで変換する。本番環境における22万件のリクエストで、CogEvolはスライドを中央値17秒、インタラクティブページを中央値59秒で完了し、数分に及ぶマルチターン型エージェントのスキャフォールディングを不要にする。信頼性は期待に委ねるのではなく担保される。本番データに根ざしたデータパイプラインは、実際の失敗を5万3,687件の検証済みSFTサンプルへ変換し、ルールとVLMを組み合わせたハイブリッド報酬がGRPOベースの強化学習を駆動する。この強化学習は、視覚的にはもっともらしいもののプレイ不能なゲームを生成する報酬ハッキングの事例を検出・修正した後に頑健化されている。CogEvol-27Bは、スライド品質で83.7、500件のインタラクティブHTMLベンチマークで63.7を達成しており、フラッグシップのコーディングモデルと比べてパラメータ数は26.9分の1である。また、OpenMAICチームとの連携により、同チームの本番トラフィックの処理を担っている。CogEvol-4BはApache 2.0ライセンスで公開されており(https://github.com/CogEvol/CogEvol-4B)、外部のフラッグシップモデルも同一の評価ハーネス上で同じスイートにより評価される。さらに、スキャフォールド編集により、インタラクティブページの生成コストは約76%削減される。フルスタックは国産のAscendアクセラレータ上で動作し、A800 GPUとアプリケーションレベルで同等の性能を実現する。これにより、大規模なAIネイティブ教育における単位コストの削減を可能にする。
大規模言語モデル(LLM)は数学的推論ベンチマークにおいて高い性能を達成しているが、その推論の根底にある数学的に意味のあるスキルは十分に探求されていない。我々は、数学教育において発展してきた2つのレンズを通して思考連鎖(Chain-of-Thought, CoT)の軌跡を分析するフレームワークSHAPEを導入する。(1) 意味空間:問題に対するモデルの変化していく数学的解釈(例:代数的、幾何学的)、(2) ヒューリスティクス:それらの空間内で取られる具体的な数学的アクション(例:問題の単純化、逆方向からの検討)。まずSHAPEを用いて様々なモデルの推論パターンを分析する。その結果、モデルが用いる数学的ヒューリスティクスは、従来のCoT特徴量よりも最終回答の正しさをよく説明することが明らかになった。さらに、モデルは多くの異なる意味空間を探索するよりも、少数の意味空間に推論の労力を集中させることで正解に到達する傾向がある。これは人間の行動と一致するパターンである。次に、SHAPEのレンズを用いて、ポストトレーニングが数学的熟達度を真に向上させるかどうかを評価する。強化学習はヒューリスティクスの使用においてモード探索を誘発することが分かった。最後に、多様なヒューリスティクスを促進することによりLLMをポストトレーニングし、精度向上におけるその有効性を示す。全体として、SHAPEはLLMの推論を解読するための理論に基づいた診断フレームワークを提供し、数学的推論のためのLLMのポストトレーニングへの新たな道を提供する。本モデルのコードは https://github.com/holi-lab/SHAPE-of-CoT で公開されている。
身体性ナビゲーションでは、エージェントがタスク、環境、ロボットの身体構成を横断して、異種の目標と視覚観測を行動へ変換することが求められる。現代の視覚言語モデル(VLM)は、視覚的グラウンディング、空間推論、ポインティングのための空間的先行知識をすでに内包しているが、これらの能力がロボット制御のために直接引き出されることはほとんどない。既存のナビゲーションシステムは、その代わりにタスク特化または身体特化のコンポーネントに依存しており、知覚・推論・行動を断片化し、限られた汎化しか提供しない。本稿では、事前学習済みVLMの空間的知能を引き出し、それをナビゲーションに整合させる、タスク特化の予測ヘッドを必要としないコンパクトな汎用身体性ナビゲーションモデルLightNav-0を提案する。LightNav-0は、統合トークンインターフェースを通じて多様なナビゲーションタスクを表現する。すなわち、デュアルチャネルポインティングがタスク・シーン・身体非依存の空間的意図を表現し、残差ベクトル量子化アクショントークナイザがこの意図を正確で身体固有の軌道に写像する。この定式化は、時間認識型の視覚履歴圧縮、身体性推論(ER)中間学習、教師ありファインチューニング、強化学習と組み合わせることで、指示追従、オープン語彙物体ナビゲーション、視覚追跡を単一モデル内でサポートする。ナビゲーション学習コーパスは、2K以上のシーンと4K時間以上の身体性ナビゲーションデータにわたる。LightNav-0の初期化に用いられる身体性推論チェックポイントであるLightNav-ERは、8つの身体性推論ベンチマークにおける完全セット平均で最高を達成し、一方LightNav-0は、10の公開ナビゲーションシミュレーション設定すべてで最先端の単眼成功率を達成する。実世界評価はさらに、ロボットの身体構成、多様なシーン、静的および動的ターゲットにわたるゼロショット汎化を実証する。これらの結果は、コンパクトなVLMが、汎用身体性ナビゲーションのための統一的かつ転移可能なバックボーンであることを確立する。
組織は多くの場合、関連するアプリケーション群のポートフォリオを開発・維持している。すなわち、実質的なドメインロジック、インターフェースパターン、または運用規約を共有する、独立してデプロイ可能なコードベース群である。LLMコーディングエージェントがこのようなソフトウェアの生成や保守にますます利用されるようになると、単純なアプリケーション単位のワークフローでは共有ロジックがコードベース間で重複し、長期にわたるエージェント駆動の保守によって冗長性、デッドコード、構造的侵食が蓄積される。我々は、スーパーライブラリエージェント問題を導入する。この問題では、エージェントが再利用可能なアプリケーション横断コンポーネントの共有スーパーライブラリを維持しながら、N個の関連アプリケーションからなるポートフォリオを逐次生成する。最小限の逐次スキャフォールドは、原理的には共有コードを抽出し、進化するライブラリへアプリケーションを移行できるが、実際には抽出再現率の低さと脆弱な依存関係移行に悩まされる。我々は、コードチャンクの要約に対する候補誘導型抽出、抽出前のコードベース統合、および抽出トレースとコールグラフ情報を用いた文脈認識型移行によって、これらの問題に対処する。WebGen-BenchおよびPaperBenchにおいて、本手法はアプリケーションの機能を維持しつつ、ゼロショットと比較して冗長性とトークンフットプリント(冗長性、トークン長)を大幅に削減し、単純なライブラリ構築によって引き起こされる構造的侵食を回避する。さらに、LOCとMDLの追加削減も達成する。我々のコードは https://github.com/sbigstar0310/super-library-agent で入手可能である。
大規模言語モデル(LLM)は、ユーザーのパーソナライズ信号を取り入れることで使いやすさと有用性を向上させているが、会話履歴、推定された選好、ユーザープロファイルなどの個人コンテキストを条件として与えられると、バランスの取れた情報豊かな応答を提供することから、ユーザー満足度を最適化することへとますます移行している。具体的には、(1)モデルが不必要な文脈で個人情報を参照する無関係なパーソナライズ、(2)モデルが情報のエコーチェンバーを強化する選好の狭窄化、(3)モデルがユーザーの意見に過度に同意する追従バイアス、という3つの新たなリスクを特定する。その結果、モデルは個人情報が不要な文脈でもそれを参照したり、意図せず応答の多様性を崩壊させたり、ユーザーの意見に過度に同意したりする可能性がある。AIアシスタントにおけるパーソナライズの利用が拡大しているにもかかわらず、その潜在的な副作用に関する体系的な評価は限られている。このギャップを埋めるために、我々はPRISKを提案する。PRISKは、自動データ生成と特化された評価指標を備えた動的評価フレームワークであり、現在のLLMパーソナライズにおける体系的な限界と、パーソナライズされた情報が応答を形成する仕組みを明らかにする。13種類のLLMにわたる我々の実証分析は、ユーザープロファイルと取得された記憶の存在がバイアスを一貫して悪化させ、その結果として、無関係なパーソナライズが平均45.9%、選好の狭窄化が平均41.7%、追従バイアスが平均61.7%低下することを示している。
大規模推論モデル(LRM)における近年の進展は、検証可能な報酬を用いた強化学習(RLVR)が、結果を自動的に検証できる数学やコードの領域において推論能力を大幅に向上させ得ることを示している。この進展をオープンエンドな課題やエージェント型タスクへ拡張することは、信頼性の高い報酬の獲得がより困難であり、また直接的な人間による監督がモデル生成経験の規模と複雑さに追従できないため、依然として難しい問題である。本論文は、人間による監督が学習ループから徐々に後退する中で、LRMがどのように改善を継続し得るかを研究する。我々はこの問題の相互に関連する二つの側面を考察する。報酬の軸は、インスタンス単位の人間による判定から、再利用可能な検証器や、人間のフィードバックなしでも機能する報酬への発展を追跡する。経験の軸は、人間がキュレーションしたタスクや環境から、自己生成型カリキュラム、構築された環境、自律的な共進化へと学習がどのように進展し得るかを考察する。我々はこれらの次元を、学習プロセスのどの部分が引き続き人間の制御下にあるかを特定するL0からL4までの五段階のラダーを通じて結び付ける。本分析はさらに、報酬ハッキング、フィードバックのドリフト、カリキュラムの崩壊、環境エラーなど、自律性を高めた報酬と経験生成によってもたらされるリスクを浮き彫りにする。その結果として、我々はポリシー能力、フィードバックの忠実性、経験の品質という三つの相補的な対象に関する評価も提供する。本分析は、人間の監督を超えたLRMのスケーリングに関する現在のアプローチと、超知能に向けた自己維持型学習システムの開発に関わる未解決問題について、構造化された説明を提供する。さらに、我々は最新の進展を追跡するために継続的に更新されるhttps://github.com/visitworld123/Awesome-Scaling-LRM-Beyond-Human-Supervision{GitHubリポジトリ}を維持している。
LLMおよびVLMエージェントによる戦略的欺瞞は、AIアライメントと安全性における中核的懸念として浮上している。社会的推理ゲーム(各プレイヤーが秘匿された役割を保持し、他者とのコミュニケーションを通じて正体を推理するゲーム)は、特にマルチエージェント環境における標準的テストベッドとしての役割を担っている。しかしながら、既存のテストベッドはテキストのみで構成され、単一の固定エージェント構成で動作するため、欺瞞の分類体系が中核とみなす非言語的感覚運動チャネルが欠落しており、観察された行動が基盤となるモデルを反映しているのか、周辺のハーネスを反映しているのかが曖昧なままである。本研究では、インポスターエージェントが言語行動と非言語行動の統合を通じてクルーメイトを欺くことを要する3DマルチモーダルAmong UsサンドボックスであるMineAmongUsを導入する。さらに、5つの認知コンポーネントアブレーション軸を公開する設定可能なVLMエージェントハーネスであるARIAと、欺瞞の分類体系に基づき、ほぼ人間レベルのアトムラベル一致を達成するLLM-as-a-Judgeによって大規模に運用されるアトムレベルおよびアークレベルのアノテーションスキームを提案する。実証結果は、VLMエージェントが言語的欺瞞と非言語的欺瞞の統合を通じてインポスターの勝利を追求すること、そして非言語的チャネルがハーネスアブレーションとクロスVLM評価の両方にわたり、より決定的な勝利貢献要因として浮上することを示している。総括すると、本研究は身体化されたVLMエージェントのアライメント研究に新たな道を開くものである。
インタラクティブな世界モデルは、ビデオ生成を、オフラインクリップ合成からインタラクティブな仮想世界の持続的シミュレーションへと拡張し、ゲーム、ロボティクス、身体化エージェント、XRなどの応用を可能にする。しかし、安定した長期的なインタラクティブ生成の実現は依然として困難であり、モデルはリアルタイム自己回帰生成を支えつつ、シーンの幾何構造、動的整合性、カメラ制御を同時に維持しなければならない。本稿では、Matrix-Game 3.0を基盤として、図1に示すMatrix-Game 3.5を提案する。本手法は、以下の3つの主要な改良により、リアルタイムのインタラクティブワールド生成を、幾何構造を考慮し、長期的に整合性のあるシミュレーションへと前進させる。第1に、統合的幾何構造認識メモリフレームワークを提案する。そのパッチメモリとTiled-PRoPEは追加の学習可能パラメータを一切導入せず、明示的な3Dパッチ検索と射影カメラ条件付けを組み合わせることで、幾何学的に整合的なカメラ制御と忠実な長期的シーン想起を実現する。第2に、静的なシーンの幾何構造と動的被写体を別々にモデル化する静的・動的分離型世界表現を導入し、長期的生成の全体を通して幾何的一貫性と被写体の同一性の両方を維持する。第3に、双方向拡散モデルを、Perceptual Flow MatchingとカリキュラムベースのSelf-Rollout DMDによって数ステップの因果的生成器へ変換する、2段階の漸進的リアルタイム蒸留フレームワークを開発し、分単位でのリアルタイムインタラクティブ生成を可能にする。広範な実験により、Unrealシミュレーション環境、オープンワールドゲーム、インターネット動画にわたる統一的学習コーパスを用いることで、MatrixGame 3.5が、長期的シーン想起、精密なカメラ制御、被写体の一貫性、プロンプト駆動のワールド生成、および安定したリアルタイム・オープンワールドインタラクションにおいて優れた性能を達成することが実証された。
自律的な科学研究エージェントは、文献レビュー、データ分析、実験、レポート生成を含むエンドツーエンドの科学的ワークフローへの応用が進んでいる。しかし、オープンエンドな研究タスクでは、タスク完了に必要な分析、手法、成功基準が明確に指定されないことが多い。その結果、エージェントは重要な分析を見落としたり、不適切な手法を用いたり、証拠によって十分に裏付けられていない結論を導いたりする可能性がある。この問題に対処するため、我々はAutoSciRubを提案する。これは評価優先のフレームワークであり、研究実行前にタスク固有の実行可能なルーブリックを生成し、それを用いて実行、基準レベルの検証、および反復的な改訂を導く。AutoSciRubは、仕様が不十分な指示を原子的な科学目標に分解し、それらを関連文献およびタスクで参照可能なデータに基づかせ、具体的で実行可能かつ検証可能な基準を統合する。生成されたルーブリックは、暗黙の実験的・証拠上の要件を明示化し、実験および分析の指針を提供する。改訂段階では、ルーブリックに基づく検証が未達の基準を特定し、研究レポートおよびその関連成果物の的を絞った改善を可能にする。ResearchClawBenchにおいて、AutoSciRubはテストしたすべての構成を一貫して改善し、固定のCodexハーネスにおける3つのバックボーンLLM全体で平均2.08ポイント、固定のDeepSeek-V4-Flashバックボーンにおける3つのエージェントハーネス全体で平均2.95ポイントの向上を達成した。AstaBench E2E Discoveryの無作為に抽出した20タスクのサブセットでは、AutoSciRubは3つのエージェントハーネス全体で平均16.8ポイントの改善を達成し、正常に完了したタスク数を維持または増加させた。これらの結果は、評価優先のガイダンスが自律的な科学研究のための効果的かつ汎用的な制御メカニズムを提供することを示している(コード: https://github.com/zjunlp/AutoSciRub)。
潜在拡散モデルは、変分オートエンコーダ(VAE)を利用してコンパクトな潜在空間で動作することで、画質を損なうことなく計算効率を向上させる、高忠実度の画像・動画合成の主要なフレームワークとして登場した。しかしながら、従来のVAEは固定の圧縮率を採用しており、時空間コンテンツの複雑さの変化に適応できないため、動画データに対しては最適ではない。我々は、潜在トークンと共同で学習される適応的トークン選択器を組み込んだTransformerベースのVAEであるKATok(Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation)を提案する。各トークンの情報量を保持/破棄の確率として評価することにより、トークン選択器は情報量のないトークンを効果的に破棄し、データ依存の圧縮を自然に可能にする。拡散モデルに適応的トークン化を適用すると、トークンの破棄が元の時空間構造を乱すため、空間的不整合を引き起こす可能性がある。この問題を軽減するため、我々は空間的一貫性を確保するための2つの位置予測戦略、すなわちカスケード生成とジョイント生成を提案する。実験では、我々のモデルが最先端の圧縮率で高い再構成品質と生成品質を達成することを示す。動画データを対象としたさらなる分析により、この改善は主に時空間冗長性の低減と情報量のないトークンの除去によってもたらされることが、定量的・定性的結果の両方によって裏付けられる。
Chain-of-thought(CoT)モニタリングは、推論トレースがモデルの回答を形成する情報を忠実に記録していると仮定する。既存の忠実性テストは多くの場合、明示的なバイアス手がかりをユーザーメッセージに配置するが、エージェントはツールの戻り値や生のアーティファクトを通じて選好に遭遇することがある。我々はFACE-Eval(Faithful Attribution of Cue Effects Evaluation:手がかり効果の忠実な帰属評価)を導入する。これは5,100サンプルの評価であり、手がかりの位置(ユーザーメッセージかツールの戻り値)と明示性(直接的要約か生のアーティファクト)を変化させる。我々は、手がかりに従う回答における言語化されたコミットメントと、すべての手がかり付きサンプルにおける言語化されない採用を測定する。我々は、8つのファミリーからの15のオープンウェイトモデルを評価する。総パラメータ数は4Bから1.60Tの範囲である。すべてのモデルにおいて、ユーザーメッセージの手がかりよりもツールの戻り値の手がかりに対する言語化されたコミットメントが低く、明示的な手がかりよりも暗黙的な手がかりに対する言語化されたコミットメントが低い。言語化されない採用は、15モデルすべてでツールの戻り値の手がかりに対して高く、30のモデル・チャネル比較のうち28で暗黙的な手がかりに対して高い。ソース帰属プロンプトは、7つのモデルでチャネルギャップを縮小する。これは、ユーザーチャネルの言語化されない採用を増やすことによる場合もあるが、モデルに推論が監視されると伝えることは、そのギャップを確実に埋めるわけではない。また、各ファミリーの最大モデルにおける選好採用を検出するために、2つのトランスクリプトモニタ(GPT-5.6-LunaとGPT-4o-mini)を使用する。32のモデル・チャネル・明示性セルにわたって、言語化されない採用が高いほど、両モニタの検出能力が低いことと関連している(ピアソンのr=-0.54およびr=-0.78)。これらの結果は、ここでテストされた単一呼び出し・プリフィルドツール設定の範囲において、選好情報がツールを通じて届く場合や生のアーティファクトから推測されなければならない場合に、CoTモニタリングの信頼性が低下する可能性があることを示唆している。
部分観測可能環境におけるAIエージェントは、進化する知覚状態を維持するために、能動的センシングを作業記憶と協調させる必要がある。しかしながら、既存のベンチマークは、物理的・制御的な複雑性を導入するため、この知覚状態の構築および解釈能力を切り離して評価することが困難である。我々はこの問題に対処するため、MNIST-PROを提案する。これは、MNIST数字認識を、ルックバック制約を伴う逐次的なグリンプスベース探索タスクへと変換することで、エージェント的知覚を切り離して評価するベンチマークである。我々は、生の視覚履歴、テキストベースの状態表現、構造化されたメトリックグリッドマップ、統合された視覚キャンバスという4つの記憶表現にわたって、10のマルチモーダルモデルを評価する。モデルは完全観測下では優れた性能を示す一方、部分観測下では明確な性能ギャップが顕在化する。我々は3つの明確なボトルネックを特定する。第一に、断片的なグリンプスを統合することにエージェントが困難を示すため、知覚状態の構築と解釈が課題となる。第二に、エージェントは完全なシーケンスを確認する前に探索を終了してしまうことが多い。第三に、モデルはその後の矛盾する証拠に直面しても、初期の誤った信念を修正できないことが多い。これらの結果は、単に視覚的証拠を取得するだけでは不十分であることを示している。エージェントは信頼性の高い知覚状態を構築し、更新する能力も備えていなければならないのである。
画像検索は伝統的に、各候補画像を単独でスコアリングする点単位のマッチング問題として定式化されてきました。しかし、このアトミックなパラダイムは、個人の写真コレクションにおける人間の検索意図の複雑さを捉えることはできません。そこでは、ユーザーは孤立したスナップショットではなく、構造的関係によって結び付けられたコンパクトな視覚的ストーリーを求めることが多いためです。この限界に対処するため、我々は画像バンドル構成(IBC)を導入します。これは、個々の画像のランキングから、大規模で非構造化された写真プールからまとまりのある画像バンドルを動的に構成することへと目的を転換する新しいパラダイムです。対象バンドルは事前定義されていないため、IBCは深刻な組合せ爆発の課題を呈し、分解不可能な結合関連性のモデリングを要求します。このパラダイムを確立するために、我々はIBCBenchを構築します。これは、半自動検証パイプラインを通じて構築された、109,467枚の画像と667件の検証済みクエリを含む初のIBCベンチマークデータセットです。さらに、我々はBundleWeaverを提案します。これは、IBCをクエリ条件付きの増分的ハイパーエッジ発見として再定式化するエージェント型フレームワークです。大規模言語モデルを用いて欠落している関係的役割を適応的に探索し、視覚言語モデルを用いてバンドル全体の検証を行うことにより、BundleWeaverは組合せ空間を効果的に探索します。大規模な実験により、最先端の埋め込みモデルや静的な分解・再ランキングパラダイムが関係的盲目性に悩まされる一方で、BundleWeaverが大幅な性能向上を達成することが示され、アトミックなスコアリングから動的な関係構成への転換の必要性が浮き彫りになります。我々のデータセットとコードは公開されています。
大規模言語モデル(LLM)エージェントは、長期的な視野を要し、対話的かつ状態を保持する環境での展開が急速に進んでいる。このような環境では、誤った購入品の返金処理といった単一の誤ったアクションが、取り返しのつかないタスク失敗を引き起こす可能性があり、実行前にそのようなアクションを検知しなければならない。この種の失敗は毎回の実行時に発生するとは限らないが、反復試行の中で顕在化し得るため、ステップ間および試行間での信頼性が極めて重要となる。しかしながら、エージェントの信頼性を確保することは困難を伴う。最先端のLLMでさえ、アクションが誤りである理由を説明することに苦慮しており、特にドメイン固有のポリシーに支配された、長く複雑に絡み合った軌跡においてその傾向が顕著である。近年の研究の多くはプロンプトベースの批評エージェントに依存している一方で、最適化ベースの手法には、トレーニングのための豊富な検証根拠を体系的に生成する手段が欠けている。本稿では、このギャップに対処するため、批評認識型トレーニングフレームワークであるCASTを提案する。CASTは、スパースなタスク結果をアクションレベルの教師信号に変換し、批評学習とポリシー最適化を可能にする。CASTはエージェントの軌跡を解析し、部分観測下でのアクションの妥当性を説明する構造化された根拠を合成する。得られた批評モデルは、ポリシーモデルを最適化するための批評認識型トレーニングデータの構築に活用される。動的なツール呼び出しベンチマークにおいてQwen3ファミリーモデルをファインチューニングした結果、CASTはドメイン横断的な信頼性を向上させ、RetailタスクではGPT-OSS-120Bをpass@4で10%以上上回り、ドメイン外設定であるTelehealthではさらに9%の改善をもたらした。これらの結果は、批評認識型トレーニングが現実的な動的環境におけるLLMエージェントのロバスト性を向上させることを示している。
長期的な物理世界エージェントは、遠い目標について推論しつつ、信頼できる閉ループ行動に決定を接地しなければならない。今日の基盤モデルはこれらの能力を分割している。視覚言語モデル(VLM)は欠落情報を推定し高レベル計画を適応させるが、反復的なナビゲーション接地には脆弱で非効率的である。一方、ナビゲーション基盤モデル(NFM)は意味的ゴールを堅牢に実行するが、持続的なタスクレベル推論を欠いた限定されたエピソードとして動作する。我々はNavMCPを紹介する。これは、長期的探索のためにVLM推論エージェントとNFM実行器を結合するエージェント型スキャフォールディングフレームワークである。VLMはどの証拠を求めるか、どこを探索するか、いつ停止するかを決定し、NFMは各意味的サブゴールを閉ループナビゲーションに接地する。3つのチャネルがこの協調を構造化する。意図(intent)は証拠のニーズをナビゲーション呼び出しに変換し、観察(observation)はロールアウトを情報源に接地された軌跡証拠に変換し、記憶(memory)は発見、否定的証拠、未解決のゴールを呼び出し間で蓄積する。この設計により、どちらのモデルも再学習することなく、孤立したナビゲーションロールアウトを持続的な身体化相互作用へと変えることができる。身体化質問応答(Embodied Question Answering)において、NavMCPはHM-EQA、MT-HM3D、EXPRESS-Benchで最先端の結果を達成する。エージェントと実行器のバックボーンを一致させた設定では、HM-EQAにおいてエピソード型インターフェースを14.9パーセンテージポイント上回る。Unitree Go2では、NavMCPは78.3%の成功率を達成し、最強のベースラインに対する優位性はタスクのホライズンが長くなるにつれて10ポイントから45ポイントへ拡大する。これらの結果は、補完的な基盤モデルを長期的な物理世界エージェントへとスキャフォールディングする可能性を示している。
近年、論文内容からの科学的図表の自動生成を目指す取り組みが進められている(Lin et al., 2026; Zhu et al., 2026a)。しかし、単一ターンで著者の視覚的・伝達的な嗜好を完全に満たすことは難しい。我々の予備的ユーザ調査(N=14)では、全参加者が初期ドラフトを確認した後にさらなる修正を要求し、その86%が改良後の図をより満足できるものと評価した。明確な需要があるにもかかわらず、マルチターンのワークフローは依然としてほとんど未検討である。このギャップを埋めるため、我々はマルチターン図生成のためのベンチマークMTPaperBananaBenchを提案する。これは292枚の画像を含み、それらに3,518件のユーザ要件がアノテーションされている。高コストな人間による調査を削減し、スケーラブルなベンチマーキングを可能にするために、各ターンで満たされていない要件を特定し、そのうちk件を自然言語フィードバックに変換するユーザシミュレータを構築する。要件充足と図の全体的品質の両方を評価した結果、ベースラインのマルチターンシステムに共通する2つの主要な失敗モードが明らかになる:(1)ターンが進むにつれて図の品質が徐々に低下する品質ドリフト、(2)以前に実装された特徴がその後のターンで失われる忘却である。これらの問題に対処するため、我々は内部の批評・修正ループを介して図を改良するマルチエージェントシステムPaperBanana-Interactを導入する。PaperBanana-Interactは、ターンを通じて図の品質を劣化させるのではなく一貫して向上させ、品質スコアでベースラインを11.9〜18.6ポイント上回り、忘却を3.7〜6.2ポイント低減する。
VLM駆動によるWebコードの自己改善には構造的な欠陥がある。修正を提案するモデルが、その修正を判断するモデルでもあるのである。そして、その判断者の下での視覚的な妥当性は、ページが実際に動作するかどうかの指標としては乏しい代理にすぎない。このループに欠けているのは、VLMが欺くことのできない相手方である。ブラウザはまさにその相手方である。すなわち、ブラウザは、ユーザーの操作下におけるHTMLアーティファクトの振る舞いを実行する決定的な実行可能シミュレータであり、名目上は別として実質的にはWebコードのワールドモデルである。我々はWebWorldを提示する。これは、事前学習済みのVLMがこのブラウザ=ワールドモデルと自律的に相互作用し、どの相互作用が教師信号となるかを決定するためのインターフェースである。各ラウンドで、VLMは批判を出力し、プランナーはそれを型付き相互作用契約にコンパイルする。ブラウザは候補を再実行し、目標の進捗と以前に検証されたすべての能力の維持の両方が成立する場合にのみ受理証明書を発行する。認定された遷移は品質ラチェットとして蓄積され、それがSFTエクスポートが目にする唯一のものである。同等のトレーニング条件下で、WebWorld-27BはRaw-27BをHTMLBench-400で5.3ポイント、MiniAppBench-Valで14.9ポイント上回り、インタラクティブなHTML生成においてKimi-K2.6やGPT-5.4といった強力なフロンティアシステムの水準に到達する。同規模のアブレーションでは、ブラウザに基づく受理判定が改善効果の源泉であることが示される。証明書なしでは、同規模の9Bモデルの改善はほぼ消失する。
Chain-of-thought(CoT)推論は、大規模言語モデル(LLM)が問題を中間ステップに分解することを可能にし、LLMを劇的に改善してきた。CoTは言語タスクに対して広く有効である一方、テキストのみのCoTはモデルに対して、視覚的な問題を不自然な散文へと系列化することを強いる。視覚入力を処理するためのアーキテクチャ上の解決策は存在するものの、研究コミュニティには、純粋にテキストのみの推論問題を解く際に、モデルが内部の視覚的ワークスペースを構築・維持する方法を教えるための、大規模かつ多段階で自己修正されたデータセットが不足している。この限界に対処するため、我々はCoVA-SFTを導入する。これは、5つの異なるレイアウトファミリーと17の複雑なタスクにわたる222K以上のマルチモーダル推論ステップを含む、51.9Kサンプルからなる高度に構造化されたコーパスである。さらに、再現可能な評価のために同じタスクを網羅する1,700のホールドアウトテストサンプルからなる付随ベンチマークであるCoVA-Benchも導入する。CoVA-SFTは、明示的な根拠の定式化、エージェント的レンダリング、検証ループを提供することで、マルチモーダル言語モデルにテキストと視覚的抽象化を交互に配置することを教える。我々は、CoVA-SFTで微調整されたモデルがCoVA-Bench上のすべてのインターリーブ型CoTベースラインを平均で2倍以上上回ることを実証し、このデータセットを検証する。ただし、それらは依然として強力なテキストのみのCoTベースラインには及ばず、今後の研究における未解決の課題を浮き彫りにしている。
テキストから画像を生成するモデルは、概念と視覚的属性の間の関連付けを学習する。本論文における概念とは、人々の職業、すなわち我々が役割と呼ぶものである。これらの関連付けは、観察されるさまざまなステレオタイプ的バイアスの根底にある可能性がある。この分野における重要な未解決問題は、職業的役割を担う人々の視覚的表現が、プロンプトによって指定された異なる文脈に置かれたときに、これらの関連付けが安定であるか、それとも変化するかである。我々は、役割に結びついた視覚的表現に対する文脈的変動の影響を分離するために設計された、統制評価フレームワークであるContextBiasと、92の役割と1,656の意味的に統制されたプロンプトを網羅するベンチマークであるContextBenchを導入する。4つの最先端モデルを66,240枚の生成画像にわたって評価した結果、役割を意味的に無関係な文脈に置いても、役割に結びついた属性は抑制されず、むしろ役割横断的な属性の集中度が増加することがわかった(プールしたBI +0.047)。人口統計学的な手がかり、特徴的な衣服、役割固有の道具は、文脈なし条件、関連文脈条件、無関連文脈条件のいずれでも高い頻度で見られ、プロンプトの意味的な言い換えに対しても頑健である。シーン構成とカメラのフレーミングは、最も大きな文脈敏感性を示した。これらの発見は、文脈なし評価ではほとんど可視化されないステレオタイプの持続性の一形態を明らかにし、バイアスのベンチマーク評価における統制された文脈的変動の必要性を強調するものである。コードとデータセット: https://huggingface.co/datasets/shaghayegh/ContextBias、https://github.com/Sina-Emami/ContextBias
マルチモーダル安全モデレーションでは、視覚コンテンツ、ユーザーの意図、およびアシスタントの動作から生じるリスクを区別する必要があります。しかし、既存のセーフガードは通常、単一の判定対象に対して訓練されており、安全性評価を二値判定に還元しています。その結果、マルチモーダルな対話全体でリスクを比較することが難しく、曖昧なケースが不明瞭なままになっています。我々は、画像レベル、リクエストレベル、応答レベルの判定を5段階の順序スケールで評価する、150万件の訓練インスタンスからなるデータセットSafeAtlas-VLを導入します。実世界と合成の両方のソースから安全性に関連する広範なデータを収集し、不一致を考慮したアノテーション手順を適用します。結果として得られたデータセットは、15の危害カテゴリと55の細粒度サブカテゴリにわたり、広範囲のマルチモーダル安全シナリオをカバーしています。また、5段階の予測と連続的なリスクスコアを評価するための5,000インスタンスのホールドアウトセットであるSafeAtlas-Benchも構築します。このデータセットに基づき、マルチモーダル安全検出のためにターゲット条件付きチューニングを用いてSafeAtlas Guardシリーズのモデルを訓練します。我々のモデルは、安全性レベルの5クラス分類を実行するだけでなく、ソフト累積順序ヘッドを通じて安全性を連続スコアにマッピングします。実験結果は、我々のデータセットで訓練されたガードモデルが強い汎化を示すことを実証しています。他のベンチマークの訓練セットを使用しなくても、対応するテストセットで競争力のある性能を達成します。注目すべきことに、我々の8Bモデルは全体で最高の性能を達成し、F1スコアにおいて従来のSOTAを約4%上回りました。さらなる研究を支援するため、コード、データ、モデルを公開しています。注意: 本論文には、不快、有害、露骨、または動揺を与える可能性のあるサンプルデータが含まれています。
投機的デコーディングは、ドラフトモデルを用いて候補トークンを生成し、それらをターゲットモデルが単一のフォワードパスで検証することにより、大規模言語モデルの推論を高速化する。検証は逐次的に進行し、最初の棄却以降のすべての位置を破棄する。しかしながら、既存のドラフトモデルの訓練は、どちらの特性も反映していない固定の位置別重み付けによるターゲットのトークンレベル模倣に依存している。我々は、各訓練ステップで検証をシミュレートし、その結果得られる受理・棄却パターンを教師信号に変換するプラグインフレームワークである検証認識トレーニング(Verification-Aware Training, VAT)を導入する。VATは2つの構成要素からなる。(i) 検証ヘッド:各位置が逐次検証を通過するかどうかについてドラフトモデルを教師する、ドラフトモデルと同時に学習される軽量な二値分類器。(ii) 検証適応型重み付け:各サンプルの最初の棄却点まで全重みを維持し、減衰の開始をその点に再設定することで、固定の重み付けスケジュールを置き換える。VATは訓練目的関数のみを変更するため、ドラフトモデルのアーキテクチャ、ターゲットモデル、推論手順を変更することなく、既存手法の上に重ねて適用することができる。VATをEAGLE-3およびDFlashに、Qwen3-4B、Qwen3-8B、LLaMA-3.1-8B上で適用したところ、平均受理長を最大11.4%、実時間速度向上を最大8.7%改善し、数学、コード、チャットの各ベンチマークで一貫した向上が得られた。コードは https://github.com/naver-ai/vat で公開予定である。
我々は、ビデオ駆動の3Dメッシュアニメーションのためのフィードフォワード手法であるBLARMを提案する。単眼ビデオと静的オブジェクトメッシュが与えられると、BLARMは、ビデオの動きに追従する時間的に一貫したアニメーションメッシュを予測する。明示的なリグに依存したり、高次元の頂点モーションを直接回帰するのではなく、学習された時間変化する剛体運動成分のコンパクトな集合と、時間不変の頂点-成分間スキニング重みを用いてアニメーションを表現する。これにより、スケルトン、ケージ、スキニング重み、リグ注釈を必要とせずに、低次元の変形空間が得られる。我々のアーキテクチャは、分解された時空間アテンションを介して幾何学由来の変形潜在変数をビデオ特徴に条件付けし、次に予測されたスキニング重みでブレンドされた剛体変換をデコードする。軌道再構成、エントロピー正則化、およびモーションを考慮した対照学習を用いて訓練されたBLARMは、単眼ビデオからコンパクトで解釈可能なモーション構造を復元しつつ、正確で時間的に安定したアニメーションを生成する。
大規模言語モデルは対話型Webインターフェースを生成できるが、信頼できる生成的UIには、ユーザー要求の変化に合わせて実行可能なアーティファクトを維持することが不可欠である。本稿では、マルチターンのインターフェース維持のためのベンチマークであるEvoGenUI-Benchを提案する。EvoGenUI-Benchは、情報提示、実行可能なインタラクション、ツール接地型外部状態の3シナリオにわたり、150件の5ターンタスクと計750ターンで構成される。生成されたアーティファクトをブラウザ上で実行し、スクリーンショット、ソースおよびDOMの証跡、アクタートレース、ランタイムログを用いて評価する。ターン単位およびエピソード単位の成功に加え、ターン間保持を隣接パス保持率(Adjacent Pass Retention、APR)で測定する。8モデルのうち、最良のモデルでもターンパス率は74.9%であり、5ターンのエピソードを完了できたのは37.3%にとどまり、APRはツール接地型タスクではさらに52.4%に低下する。診断分析によれば、提示の失敗は情報アーキテクチャに、インタラクションの失敗は派生状態の伝播とアフォーダンスの結び付けに集中し、ツール接地型タスクの失敗には、さらに外部状態への接地と要求分解が関与する。これらの結果は、生成的UIの評価を、孤立した出力の判定から、アーティファクトの進化に伴ってインターフェースの挙動、派生状態、外部状態、およびアシスタントの主張が同期を保つかどうかの検証へと再構成するものである。
関数ベクトル(FV)は、文脈内デモンストレーションから導出されたタスク固有の潜在方向表現を注入することにより、大規模言語モデル(LLM)の挙動を誘導する有望なメカニズムとして近年注目されている。従来の研究では、FVが構造化された文脈内学習設定においてタスク挙動を再現できることが示されているが、意味的に複雑なタスクにおける有効性や、言語を越えた汎化能力は未だ十分に調査されていない。本稿では、多言語マルチラベル感情認識を、挑戦的な意味分類ベンチマークとして用いて、FVの言語間転移可能性を調査する。具体的には、ソース言語から抽出されたFVが、推論時にデモンストレーションを提供することなく、標準的なクリーン設定と摂動を加えたゼロショット設定の両方において、別の言語のタスク挙動を誘導できるかどうかを検証する。多様な言語間設定において、FVを適用することで性能が大幅に向上した。これは、FVが純粋に言語固有の語彙パターンではなく、言語に依存しないタスク関連信号を捉えていることを示唆し、多言語タスク適応のための軽量かつ転移可能なメカニズムとしての可能性を強調するものである。また、各LLMには、効果的なFVを構築するための比較的安定した最適なアテンションヘッドの範囲が存在し、そのパターンは言語間で一貫していることを観察した。さらに、FVは、複数のデモンストレーションを処理する計算オーバーヘッドを回避しつつ、標準的な少数ショットの文脈内学習のタスク誘導効果を部分的に再現できるため、大規模な実用的応用に有効である。我々のコードはhttps://github.com/yingjie7/cross_lingual_fvsで公開している。
強化学習ファインチューニング(Reinforcement Fine-Tuning, RFT)は、大規模モデルの推論能力を強化するためにますます利用されているが、その効果はトレーニングデータの選択方法と使用方法に依存している。データ中心のRFT手法のほとんどは、静的またはヒューリスティックなサンプル選択に頼っており、サンプルの価値はトレーニング中に固定されていると暗黙的に仮定している。これはポリシー学習の非定常的なダイナミクスを見落とし、準最適な更新につながる可能性がある。我々は、RFT全体でデータ利用を適応的にする、原理に基づいた完全自動化フレームワークである動的重要事例マイニング(Dynamic Important Example Mining, DIEM)を提案する。DIEMは各最適化ステップに2つの要素を統合する:(i)各サンプルのポリシー改善への限界貢献を効率的に近似する勾配整合性重要度推定器、(ii)更新の勾配の大きさを保ちながら最適化を安定化させ、総効用を最大化する制約付きバッチ再重み付けスキーム。複数の推論ベンチマークにおいて、DIEMは強力な静的・動的ベースラインを一貫して上回る。コードはhttps://github.com/hrtan/DIEMで公開予定である。
視覚指示チューニングは、視覚言語モデル(VLM)の視覚言語アライメントと指示追従能力を向上させるために極めて重要である。しかし、急速に拡大するデータセットから固定比率制約の下で最適なサブセットを特定することは、依然として大きなボトルネックとなっている。既存手法は主に分布多様性やヒューリスティックなフィルタリングに依存しているが、個々のサンプル内部の一貫性を見落とすことが多い。このギャップを埋めるために、我々はデータ固有一貫性(DIC)を提案する。これは、サンプルレベルのコンポーネント間一貫性を定量化するように設計された自己評価指標である。DICは2つのモジュールから構成される:視覚情報一貫性(VIC)は視覚コンテンツと指示の間の整合性を評価し、応答情報一貫性(RIC)は指示に対する応答の一貫性を評価する。DICに基づき、我々はデータ固有一貫性選択(DICS)を導入する。これは、様々なデータ予算の下で高いサンプル内一貫性と全体的な分布多様性の間のトレードオフを最適化する適応的データ選択手法である。広範な実験により、DICSは多様なデータセット規模とモデルアーキテクチャにわたって最先端手法を一貫して上回り、LLaVA-1.5-665Kデータのわずか25%を使用しながら、全データセットでのファインチューニングをも上回ることが実証された。さらに、我々はDICS-6Mを構築した。これは、これまでで最大規模の視覚指示選択研究を可能にする6Mサンプルのマルチモーダル指示コーパスである。注目すべきことに、DICSは報告されたトレーニングデータの25%未満を使用して、公式のInternVL3-8B-Instruct性能の94.52%に達する。コードは https://github.com/cqu-student/DICS で公開されている。
大規模視覚言語モデル(LVLM)における幻覚の検出には、正確なスパン位置特定と、適切にキャリブレーションされた信頼度スコアの両方が必要である。ファインチューニングされた生成型VLMは、幻覚を含むテキストスパンの特定に優れているが、過剰信頼と高い推論レイテンシという問題を抱える。識別型系列タガーは、決定的な推論速度と優れたキャリブレーションを提供する一方、スパン再現率は保守的である。我々は、SHROOM-Visions Shared Task 向けのハイブリッド二重システムである SpanCalib-VLM を提案する。本システムは、XLM-RoBERTa-Large を SigLIP ビジョンエンコーダとクロスアテンションで融合したマルチモーダル系列タガーと、我々がファインチューニングした生成型VLM(Qwen3.5-4B-SHROOM-SFT)を組み合わせたものである。Union-Calibrated Fusion 戦略により、生成モデルからの候補スパンは、系列タガーからのキャリブレーションされた確率で再スコアリングされる。SHROOM-Visions 英語評価分割において、我々のアンサンブルは、ピアソン・キャリブレーション相関 0.41、全体的なIoU 0.39、クリーン応答のIoU 0.91、全体的な検出精度 70.7% を達成した。我々は、モデル重みとコードを公開している。
視覚言語事前学習モデルに基づく画像コンテンツ操作に関する近年の研究は、テキスト駆動型の3Dシーン編集へと効果的に拡張されてきた。しかしながら、既存の3Dシーン編集手法には依然としていくつかの欠点があり、インタラクティブな設計ツールとしてのさらなる発展を妨げている。そのような手法は通常、固定された入力パターンを前提とするため、テキスト入力の柔軟性が制限される。さらに、その編集能力は単一または少数の2D視覚モデルに制約され、これらのモデルを3D再構成プロセスに統合するための複雑なパイプライン設計を必要とする。上述の問題に対処するため、我々はHash-Atlasネットワークを提案する。これは3Dシーン編集を2Dアトラス画像に対する操作として再定式化し、2D編集と3D再構成プロセスのワークフロー分離を実現する。この基盤に基づき、我々はCE3D++と名付けた対話ベースの3Dシーン編集手法を導入する。CE3D++は大規模言語モデル(LLM)を中心とし、ユーザーからの任意のテキスト入力を受け付けてその意図を解釈し、対応する視覚モデルの自律的な呼び出しを可能にする。さらに、我々はCE3D++を単眼4Dシーンに拡張する。移動物体に動作制約を課すとともに、編集タスクに関連する軌跡データセットを構築してLLMを追加ファインチューニングすることで、より小型のLLMが最大30種類の異なる視覚ツールを正確にスケジュールできるようになる。実験結果は、CE3D++が複数の視覚モデルを効果的に統合し、多様な視覚編集効果を達成するとともに、強力なシーン理解能力とマルチターン対話能力を備えていることを示している。ソースコードと学習済みモデルは https://github.com/Fangkang515/CE3D で公開されている。
エンドツーエンドの天気予報システムは、生の地球観測データから直接、高性能な全球格子予報および地点予報を生成し、データ同化を含む数値天気予報パイプラインをそのコストのごく一部で置き換える。これらのシステムは決定論的であり、不確実性を発行しない。本稿では、各構成要素に確率的機構を1つずつ付加して、Aardvark Weatherモデルを確率化する。観測エンコーダには、観測システムに由来する偶然的不確実性を捕捉する学習済みの入力依存ノイズを付加し、プロセッサには、学習された力学における認識論的不確実性を捕捉するモンテカルロドロップアウトを付加する。得られたネスト型アンサンブルは、観測ストリームを保留して相互検証された全分散の法則分解により、予報の広がりをこの2つの発生源に帰属させる。確率的ファインチューニングは平均予報を顕著に改善し、変数とリードタイム全体で平均4.2%の改善が得られた。アンサンブルは中期予報期間を通じてERA5に対して較正されており(スプレッド・スキル比0.98)、地点RMSEを決定論的モデルの2.4%以内に保ちながら、すべてのリードタイムでCRPSにおいて決定論的モデルを上回る。ただし、現業のECMWFアンサンブルには及ばない。エンコーダブランチは観測駆動型の不確実性として振る舞う。構成要素に帰属された不確実性はエンドツーエンド予報の透明性を高め、観測駆動型の大気デジタルツインへの一歩となる。
ソーシャルメディア上のマルチモーダル誤情報は、非常に蔓延しており、影響力が強く、有害である一方、テキストのみの誤情報と比較すると、検出や対抗が難しく、未だ十分に理解されていない。マルチモーダル誤情報の特性と欺瞞的戦略に関する研究は、実世界の文脈に基づいた分類体系の欠如と、現在のマルチモーダル機械学習モデルの限界によって妨げられている。これらの限界により、大規模な注釈付けと分析の自動化が不可能になっている。我々は、これらの欠点に三つの段階で対処する。第一に、七言語のTwitter/Xから、実世界の誤情報事例からなる大規模かつ高品質なデータセットを収集する。第二に、データの詳細な質的分析と先行理論研究に基づいた、新規かつ包括的なマルチモーダル誤情報の分類体系を開発する。最後に、視覚言語モデル(VLM)を用いた自動化された多段階注釈パイプラインを通じて分類体系を運用可能にし、人間による検証を行う。我々の新しいアプローチは、ソーシャルメディアユーザーが実際の環境で誤情報を拡散するために画像とテキストをどのように組み合わせるかについて、これまで記録されていなかった洞察をもたらす。例えば、AI生成コンテンツはテクノロジーと科学の分野で特に顕著である一方、ワクチン誤情報は信頼性を主張するためにニュースメディアの画像を不均衡に利用している。我々の手法と発見は、マルチモーダル誤情報を検出するための標的型アプローチへの指針を提供し、緩和策は均一的ではなく戦略的に開発・適用されるべきであることを示唆している。
長い自己回帰動画生成は根本的なメモリ課題に直面する:有限のアテンションウィンドウでは、モデルは拡大し続ける履歴からどの情報を保持するかを決定しなければならない。既存手法はメモリを時間的に整理し、最近のフレームを保持する一方、古いフレームを圧縮または破棄する。これに対し我々は、メモリを外観の新規性によって整理するRECAP-Forcingを提案する。長い動画は単なるフレームの列ではなく、時間を通じて同一性を保たなければならない主体・物体・シーンの進化するキャストである。我々は、新たに出現する内容(進入する主体、非遮蔽領域、新たに導入されるシーンなど)が最初に可視になった瞬間に、それに関連するKVキャッシュを保持することでメモリを整理し、新規性を新しさ(最近性)よりも優先する。メモリは動画の長さではなく、新たに導入される内容の量に応じて拡張されるべきである。この外観インデックス型メモリにより、長期的な一貫性がメモリ構造の明示的な性質となる。我々のフレームワークは、この単一の原理の下で二つのメカニズムを統合する。動画の開始時、可視内容がすべて新規である場合、アテンションシンクが初期シーンを保持する。動画が進むにつれて、オプティカルフローに基づく新規性バンクが、新たに明らかになった内容を選択的に保持することで同じ原理を拡張する。追加の学習可能パラメータを持たない学習不要の推論手法として、RECAP-Forcingは複数の強力なベースラインにわたり画質と意味的忠実性を一貫して改善し、既存のメモリ手法を上回る。