翻訳付きの日次キュレーションされたAI研究論文
大規模言語モデルのエージェントは、自律的なツール利用者として評価されることがますます増えつつあるが、既存のベンチマークの大半は、成功基準が即時的な限定タスクに焦点を合わせている。実世界での応用には、長期的な一貫性(Long-Term Coherence)、すなわち長い期間にわたって目的を持った行動を維持し、蓄積された証拠に応じて意思決定を適応させる能力がしばしば必要とされる。この能力を評価するには、行動が将来の選択肢を制約し、フィードバックが不均一な遅延で届き、一貫性のない行動が測定可能な累積効果を生む持続的な環境が不可欠である。売り手側の電子商取引は、商品調達、出品・価格管理、キャッシュフロー管理、混合遅延フィードバック適応といった反復的かつ相互依存的な意思決定を通じて、この評価に適した環境を提供する。本稿では、98,843件の実在する電子商取引の商品レコードに基づき、エージェントとのインタラクションに26のツールを備えた365日間の注文レベルシミュレーションであるMerchantBenchを紹介する。MerchantBenchは、即時に観測可能な上流サプライヤーイベントと遅延のある下流の注文結果を結合し、エージェントに個々の注文ライフサイクルを追跡させ、過去の決定を再考させる。我々は2つのエージェントフレームワークの下で8つのLLMを、それぞれ365日のシミュレーションに及ぶ48回の実行で評価した。結果は、最新のLLMと人間の参加者との間に大きな隔たりがあることを示しており、最良のLLM構成は、人間の参加者が達成した平均最終純資産の27.3%しか達成しなかった。
リアルタイム動画編集には、ソース忠実度と長期的な時間的一貫性を維持しながら、限られた計算リソースで低遅延の因果的生成を行うことが求められる。本稿では、将来のフレームや事前に定義された動画長を必要とせずに、リアルタイムかつオープンエンドな動画編集を実現する160億パラメータの自己回帰拡散フレームワークであるJoyAI-Video-Editを提案する。本手法は、チャンク単位の自己回帰適応、ソース固定型分布マッチング蒸留(SA-DMD)、および長期間自己回帰蒸留を組み合わせることで、訓練と推論のミスマッチを低減し、2ステップ生成中のソース忠実度を維持し、蓄積される時間的ドリフトを緩和する。広範な自動評価と人間による評価により、JoyAI-Video-Editは既存のストリーミング編集システムを大幅に上回り、短い動画と長い動画の両方において強力なオフラインシステムと同等の性能を維持することが示された。本システム全体は、単一のNvidia B200 GPU上で約30 FPSのエンドツーエンド720p動画編集を達成する。コードはhttps://github.com/jd-opensource/JoyAI-Video-Editで公開されている。
言語は生成モデリングにおいて依然として特異な存在である。画像、動画、音声はますます連続潜在空間でモデル化される一方、テキスト生成は依然として主に離散トークンに依存している。既存の連続言語モデルは、生成と復号を共同で行うために設計されていない埋め込み空間を継承するか、拡散を容易にするために自己符号化された潜在表現を圧縮し、トークンレベルの忠実度を犠牲にしている。生成モデルに合わせて表現を単純化する代わりに、我々は高容量で復号可能なテキスト潜在表現を保持し、その分布を直接学習するように拡散モデルを設計する。 我々は、復号可能なテキスト表現の構築とその分布のモデル化を分離する、連続潜在拡散言語モデルAURORA-LMを紹介する。クエリベースのエンコーダ・デコーダは、テキストを高容量でプレフィックス整合された潜在シーケンスに編成し、ブロック因果拡散トランスフォーマーはフローマッチングを通じてその分布を学習する。ブロックを左から右へ生成しながら、各ブロック内の位置を並行してノイズ除去する。このような潜在表現は拡散モデルにとってモデル化が難しいため、AURORA-LMはクリーン潜在表現の完全な予測ターゲットを保持しつつ、ノイズ入力経路のみを制限する。これにより、デコーダ向けの容量を減らすことなく全幅の潜在表現を扱える。さらに、ノイズレベル分布を潜在表現の幅に合わせて調整し、独立にサンプリングされた訓練ノイズと推論時の反復的ノイズ除去を橋渡しする自己軌道一貫性を導入する。 AURORA-LMは、OpenWebTextの自由生成とXSum要約において、評価された連続的および拡散ベースの言語モデルの中で最強の性能を達成する。総計算量約1500 EFLOPsで10億パラメータにスケーリングすることでさらなる向上が得られ、整合された評価プロトコルの下で、公開されているより大規模な潜在拡散言語モデルを上回る。すべての実験はAscend NPU上で実施された。
近年の画像生成における進歩は、理解・生成・編集を統合したマルチモーダルモデルの可能性を実証している。しかし、統合された3Dモデリングは、マルチモーダルデータの不足、特に大規模かつ幾何学的に一貫性のある編集データの欠如によって依然として制約を受けている。この限界に対処するため、我々はHunyuan3D-Buffalo 1.0を提案する。これは、3D理解、テキストからの3D生成、指示に基づく3D編集、テキストに基づくパーツ生成を単一のアーキテクチャ内でサポートする統合フレームワークである。スケーラブルな学習を可能にするため、我々は8700万規模の3Dマルチモーダルコーパスを構築した。これは、2500万の理解サンプル、5000万のテキストから3Dへのペア、およびNano3D-v2を用いて生成された1200万の編集ペアで構成される。アーキテクチャ上、本フレームワークは意味的・構造的・空間的理解のためのHunyuan3D-VLMと、高忠実度の3D合成のためのHunyuan3D DiTを組み合わせている。VLMは生成のためのマルチモーダルな意味的条件を提供し、編集とパーツ生成はさらに、ソースオブジェクトの表現を拡散プロセスに条件付けして、その全体的な構造と未編集領域を維持する。大規模な実験により、Hunyuan3D-Buffalo 1.0はテキストからの3D生成および3D編集ベンチマークにおいて最先端またはトップクラスの性能を達成し、強力な理解能力とパーツ生成能力を示すことが実証された。さらに、我々の分析は、生成と理解の両方が編集を改善することを示しており、統合された3Dマルチモーダル学習の有効性を実証している。プロジェクトページ: https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0/
本稿では、マルチモーダルエージェントを静止画像から連続ビデオストリームへと拡張するVideo-DeepResearch(Video-DR)を紹介する。この設定では、オープンウェブ探索と組み合わされた高密度な時空間グラウンディングが要求される。予備評価により、現在のモデルにおける2つの重大なボトルネックが明らかになった:(1) モダリティバイアス—エージェントが視覚ツールを回避し、テキスト検索を優先すること、そして(2) パラメトリック知識漏洩—モデルが真のツール拡張実行ではなく内部記憶に依存することである。これらの課題に対処するため、我々はVideo-DRを提案する。これは、ウェブ検索に先立って網羅的なフレーム横断型視覚グラウンディングを強制する段階的ツール解放を備えた、分離型の知覚・探索パイプラインを特徴とする。本フレームワークは、教師ありファインチューニングに続いてグループ相対方策最適化(GRPO)を適用する2段階のトレーニング手法を採用し、模倣学習の限界を打破する自律的探索を実現する。さらに、200件の複雑なマルチホップVQAインスタンスからなる人間-AI協調ベンチマークであるVideo-DR-Benchを構築した。実験結果は、我々のVideo-DeepResearch-35B-A3Bが平均精度64.0%という新たな最先端を確立し、プロプライエタリなClaude-4.5-Sonnet(59.0%)を5.0ポイント上回り、GPT-5(52.5%)およびGemini 2.5 Pro(57.5%)を大幅に凌駕することを実証している。30B-A3Bバリアントは59.3%を達成し、Claude-4.5-Sonnetと競合する性能を示すとともに、コンパクトな規模であっても我々のトレーニングパラダイムの有効性を実証している。コード:https://github.com/Osilly/Vision-DeepResearch。
産業用レコメンダーは、事前学習してから転移するパラダイムをますます採用しているが、行動分布のドリフトにより、行動シーケンスから何を学習するか、そして事前学習モデルが継続的に更新されていく中で学習済み知識をどのように転移するかという2つの問いが生じる。これらの問いを解決するために、我々はKnowledge-Geometry Decoupling(KGD)を提案する。学習すべき内容については、従来の次トークン予測は隣接性を依存関係として扱い、無関係なセッションをまたぐ疑似遷移を符号化する可能性がある。我々は、協調的または意味的に関連する将来のアイテムのみを教師信号として保持するBehavioral Multi-Token Prediction(BMTP)を導入し、よりクリーンで転移可能な行動知識を実現する。転移方法については、事前学習済み知識とタスク固有の幾何構造は、共有パラメータに対して相反する最適化要求を課す。これに対処するため、KGDはそれらを別々のパラメータセットに割り当てる。すなわち、更新可能なエンコーダが行動知識を保持し、タスク学習器は読み取り専用のクロスアテンションを通じて文脈化されたエンコーダ状態を読み取り、事前学習済み埋め込みに直交するAnchored Calibration Residual(ACR)を通じてタスク固有の幾何構造を書き込む。この分離された所有権により、タスク勾配の干渉や下流適応の無効化なしに、継続的な知識更新が可能になる。KGDは、8つの公開ベンチマークにおいて強力な事前学習-転移ベースラインを4〜12%上回り、ベースラインが改善を示さない90日間の本番ストリームでもその優位性を維持する。KGDはShopeeで完全に本番展開されている。Shopeeホームページ検索における実運用A/Bテストでは、ユーザーあたりGMVを1.75%、広告収益を1.53%増加させ、その高い実用価値を示している。KGDの中核実装は https://github.com/FuCongResearchSquad/KGD4REC で提供している。
大規模言語モデルエージェントは複雑な対話型タスクにおいて強い可能性を示しているが、その強化学習(RL)は、長いマルチターン軌跡が単一の結果レベルの信号しか受け取れないことから、疎な報酬によってしばしば妨げられる。オンポリシー自己蒸留(OPSD)は、特権的教師から密なトークンレベルの教師信号を提供するが、教師はすべての位置で信頼できるとは限らない。既存手法は一般に、ノイズに敏感な孤立したトークンレベルの不一致に依存するか、位置による変動を見落とす可能性のある共有ステップレベルの重みを割り当てる。我々は、教師を支持する信号の局所的な持続性からトークンレベルの蒸留重みを導出する持続的一貫性自己蒸留(PCSD)を提案する。PCSDは、適応的ウィンドウと指数減衰集約を組み合わせて持続的な相対的教師支持を捕捉し、トレンド認識変調を適用して局所的に減少する支持を減衰させ、シグモイドゲーティングによって連続的な重みを生成する。得られた目的関数はGRPOと共同で最適化され、密な教師ガイダンスと疎な環境フィードバックを組み合わせる。推論時スキルなしで、PCSDは両方のバックボーンにおいてすべてのベースラインの中で最高のALFWorld Overall結果を達成し、GRPOを15.6ポイントおよび13.3ポイント、SDARを6.2ポイントおよび5.5ポイント上回る。さらに、WebShopでは競争力を維持し、未見のALFWorld分割ではGRPOに対して15.8ポイントの向上を達成する。
継続的に改善するエージェントには、静的な教師信号を超えた動的なインタラクションフィードバックが必要である。しかし、実環境での直接的なインタラクションはコストが高く、時間がかかり、安全性に欠け、並列化も困難である。ワールドモデリングは、エージェントが実際の行動に踏み切る前に、より低コストで制御しやすいフィードバックを照会することを可能にする自然な中間プロキシを提供する。古典的なワールドモデルは、このプロキシを主に将来の物理状態予測を通じて具現化している。この定式化は有用ではあるものの、生の状態遷移を超えた実行可能なフィードバックを必要とするエージェントにとっては、その範囲が狭すぎる。 本研究では、エージェント中心のインタラクティブワールドプロキシ(Agent-Centric Interactive World Proxies)を概念化する。これは、基本的なパラダイムを物理状態遷移から、実行結果、取得された経験やスキル、検証シグナルといったエージェントが利用可能な情報遷移へと転換するものであり、継続的に改善するエージェントに多用途なフィードバックを提供するべくワールドモデリングの適用範囲を拡張する。この設計空間を体系的に整理するため、我々はワールドプロキシをそのフィードバック様式に基づいて、ダイナミクス、空間、実行、記憶・経験、スキル、報酬・検証の6つの機能形態に分類する。これらは、ワールドモデリングがエージェントの改善に寄与する主要な方法を総体的に特徴づけるものである。 さらに、これらのプロキシがエージェントを3つの発展的レベルにわたってどのように強化するかを分析する。 L.1 推論時ガイダンス:プロキシの出力がコンテキスト内情報を豊かにし、より優れた意思決定を実現する。 L.2 学習時最適化:プロキシの出力がポリシー学習のための報酬、批評、または合成ロールアウトを生成する。 L.3 エージェント・プロキシ共進化:実環境からの証拠がプロキシとエージェントの両方を継続的に更新し、共進化を促進する。 最終的に、本研究はワールドモデリングをエージェント中心のパラダイムとして再構築し、エージェントがより良く計画し、より速く学習し、継続的に進化することを可能にするワールドプロキシ構築のロードマップを確立するものである。
再帰的自己改善には、エージェントが蓄積された経験を将来のより良い行動に転換することが必要である。パーソナルAIエージェントは、セッションをまたいで嗜好、タスク履歴、ツールのルーチン、学習済みスキルを保持するため、この能力を研究するための具体的な環境を提供する。しかし、保持された経験が実際に時間とともにエージェントを改善するかどうかは、体系的に検証されていない。我々は、この問いを切り分けるために設計されたベンチマークであるPAST-Benchを紹介する。各エージェントは、保持経験の有無を切り替える整合された条件下で、新しいセッションのタスクの順序付き系列を実行する。これは、記憶、手続きの再利用、情報収集、更新にわたり、26シナリオと204エピソードを含む。我々は、後続タスクでの向上と、その向上が意図された保存・取得・更新の経路に沿っているかどうかの両方を報告する。7つのベースモデルと4つのエージェントフレームワークにわたって、改善は実際に確認できるが、その程度は能力によって不均一である。同じ見かけ上の向上を示すエージェントでも、その向上が意図された経路の証拠に裏付けられているかどうかは大きく異なり得る。これらの知見に基づき、我々はエージェントループの各段階にわたる5つの的を絞った介入をHermesに加えたHermes+を開発する。Hermes+は、保持経験からの平均的な向上を高め、より明確な経路の証拠を提供する。特に、古い状態の置き換えを必要とするタスクで最も強い改善を示すが、その効果は依然として能力とモデルに依存する。まとめると、PAST-BenchとHermes+は、永続的エージェントが経験の保持から、その経験を通じた体系的な改善へと進む仕組みを研究するための、評価および診断の基盤を提供する。コード: https://github.com/Gen-Verse/PAST-Bench
拡散言語モデル(dLLM)は、自己回帰(AR)言語モデリングの代替手段を提供するが、混合エキスパート(MoE)dLLM のスケーリング挙動は依然として十分に理解されていない。我々は、MoE dLLM において最適化ハイパーパラメータ、計算配分、アーキテクチャがどのようにスケールするかを系統的に特徴づけ、従来 AR モデルについて報告されたスケーリング傾向との定量的な差異を特定した。具体的には、最適化に関しては、最適な名目バッチサイズはより速く増大する一方、最適な学習率は計算量に応じてより急速に減衰する。モデルとデータの配分に関しては、IsoFLOP 解析によりわずかにデータ側への偏りが明らかになる:最適なトークン予算は、活性化されたモデル側の計算量よりも速く成長する。MoE アーキテクチャに関しては、スケールが大きくなるにつれて、固定された活性化容量の下でより大きなエキスパートプールがますます好まれる一方、中程度のエキスパート粒度は一貫して効果的であり、共有エキスパートに割り当てられる活性化容量の好ましい割合はスケール全体で安定している。これらの知見に基づき、我々は 30B-A3B の dLLM である LLaDA MoE v2 を、23.5T トークンでスクラッチから訓練した。Qwen3 の約65%の事前学習トークン数で、LLaDA MoE v2 は、複数の知識・推論・コーディングベンチマークにおいて Qwen3 に迫る性能を示す。教師ありファインチューニングのみを行った後、8つの推論・コーディングベンチマークのうち7つで SDAR Chat を上回り、いくつかのタスクでは Qwen3 に近い性能を維持する。これらの結果は、MoE dLLM の実用的なスケーリング則と設計原理を確立するものである。
オムニモーダル大規模言語モデル(Omni-LLM)は、音声・視覚理解タスクにおいて顕著な性能を達成しているが、長く冗長性の高い視覚・音声トークン系列を処理するには多大な計算オーバーヘッドを要し、効率的なデプロイには大幅なトークン圧縮が求められる。既存手法は低トークン予算においてしばしば性能が低下する。LLM前の圧縮は構造的に重要で大局的に分布する証拠を捨て去る可能性があり、LLM内圧縮はクエリ条件付きの音声・視覚協調を十分に活用しないことが多い。これらの限界に対処するため、我々はOmniPackを提案する。これは、LLMの前で構造的圧縮を調整し、LLM内でタスク関連の意味的洗練を行う訓練不要のフレームワークである。LLMの前に、OmniPackはモダリティ固有の重要度、グローバル被覆、類似度考慮型マージを通じて構造的冗長性を除去する。十分なマルチモーダル相互作用の後、テキストガイダンスと音声・視覚の協調を通じて、多様でタスク関連の表現をさらに統合する。3つのOmni-LLMバックボーンを用いた5つのベンチマークでの広範な実験により、OmniPackが多様な保持比率にわたって常に最良の性能・効率トレードオフを達成し、既存のすべての手法を上回ることが実証された。特に、Qwen2.5-Omni-7Bでは、OmniPackはFLOPsを16.7%に削減しつつ元の性能の98.0%を維持し、さらにFLOPsを6.8%に抑えた場合でも元の性能の92.9%を保持する。
オン方策蒸留は、教師が生徒自身が生成したサンプルを修正する手法であるが、そこでは二つのモデルが同じ言語を話すこと、すなわち同一のVAE潜在変数、一致するアーキテクチャ、共通のタイムステップグリッドを持つことが前提となる。我々は、これらが一つも成立しない場合、例えば利用可能な最強の教師と展開したい生徒が異なるモデルファミリーに由来する場合に何が起こるのかを問い、標準的な手法には答えがないことを見出す。教師の潜在変数は異なる座標系ではターゲットとして機能できず、局所的な詳細を確率的に再描画する教師に対する画素単位の損失はぼやけや発散に退化し、タイムステップインデックスは不一致のスケジュール間では意味を失う。我々はAny-OPDを提案する。これは、我々の知る限り、任意の潜在フローマッチング生成器ペア間でのオン方策蒸留のための最初のフレームワークである。Any-OPDは教師を純粋にブラックボックスのサンプラーとして扱い、二つのモデルをちょうど一点でのみ接続する。すなわち、凍結されモデル非依存な視覚表現の中で、独立に復号された出力同士を比較するのであり、潜在変数、特徴量、アーキテクチャに関するあらゆる仮定を回避する。軌道の対応関係は、ステップインデックスではなく連続的なノイズレベルをマッチングすることによって回復される。さらに、教師のサンプルを生徒自身のVAEを通して再符号化する短いアンカリングフェーズにより、オン方策勾配がドメインミスマッチではなくサンプル品質を測定することが保証される。12BのFLUX.1-devを2.5BのSD3.5-Mediumへ蒸留する際、Any-OPDは生徒のPickScoreを0.846から0.884へ、HPSv3を9.12から10.97へと引き上げ、直接的な潜在回帰ではまったく学習が進行しない状況において、教師の5分の1の規模でありながら教師に匹敵する性能を達成する。
キャプションは、マルチモーダル理解とテキストから画像への生成の両方において、主要な教師信号として機能する。しかしながら、従来の評価ではキャプション品質を単一のスカラー目的として扱っており、それによって以下の2つの異なる特性を混同している。(1) キャプションがどの程度の視覚情報を網羅しているか、そして (2) 画像がキャプション内の明示的な主張をどの程度確実に裏付けているか。この目的のため、我々は、人間が作成したグラウンドトゥルースキャプションと人間が検証した原子的なチェックリスト項目を用いた、分離型キャプション評価ベンチマークであるCAPEval(Coverage And Precision Evaluation)を設計する。具体的には、CAPEvalはキャプション品質をカバレッジ(網羅性)とプレシジョン(正確性)に分解する。前者はキャプションがグラウンドトゥルースの事実内容をどの程度徹底的に網羅しているかを定量化し、後者はキャプション内で表現されたすべての主張の事実正確性率を反映する。我々は10種類のキャプション生成器を選択し、さらに4つのモデルファミリーを用いて、キャプションソースのみを変数とした統制された下流エンドツーエンド実験を実施する。経験的に、我々は一貫したタスク依存の解離を発見する。すなわち、カバレッジは理解性能に対してより強い相関因子として機能し、一方プレシジョンは生成性能に対する支配的な予測因子として機能する。この分離型評価パラダイムは、キャプション品質のよりきめ細かい診断を提供するだけでなく、異なる下流タスクに適合したキャプション生成器の選択と最適化のための実行可能な指針も提供する。
自己進化型エージェントは、個々のタスクを超えて持続する再利用可能なスキルへと、対話履歴をますます変換するようになっている。従来の研究は記憶および検索ポイズニングを研究してきたが、そのような攻撃は、ポイズニングされた記録がコンテキストとして検索された場合にのみエージェントに影響を及ぼす。我々は、より新しく根本的なリスクを明らかにする:ポイズニングされた経験は、エージェント自身によって持続的な行動的アーティファクトへと変換され得るのである。我々は、自己進化型エージェントの経験-スキル変換パイプラインを悪用する初の攻撃であるSkillJackを提示する。SkillJackは、ランタイムコンテキストを直接操作する代わりに、エージェント自身の学習プロセスをハイジャックし、悪意のある行動をその再利用可能なスキルレパートリーに埋め込む。我々は、この変換の3つの主要な特性を特定する:スキル抽出中に悪意のある意図が隠蔽されるサニタイゼーション白化、一時的な経験が永続的な能力になるクロスレイヤー昇格、そして攻撃が元のソース記録の削除後も生存する永続性の分離である。我々は、SkillJackを2つの代表的なシステムであるSkillXとAnything2Skillに対して、4つのポリシーリスクカテゴリにわたる150の軌跡からなる共有データセットを用いて評価する。結果は、スキル抽出が攻撃の検出可能性を大幅に低下させることを示す:SkillXでは、安全性検出がポイズニングされた軌跡の98.5%から抽出されたスキルの11.4%に低下し、Anything2Skillでも同様の効果が見られる。一方、埋め込まれたスキルは有効性を維持し、それぞれ2つのシステムで56.2%と89.2%の攻撃成功率を達成する。さらに、スキル媒介攻撃の80.0%は元のポイズニング記録を削除した後も持続し、一部のスキルは良性のクエリに対して意図せず活性化する。我々の発見は、スキル進化を新たな攻撃サーフェスとして明らかにし、来歴対応型スキルライフサイクル保護を動機づける。我々のコードはhttps://github.com/Tencent/AI-Infra-Guard/research/skilljackで入手可能である。
我々はUniWorld-Designを紹介する。これは、画像生成をフラットなピクセル合成から構造化された視覚的構成へと再定義するフレームワークであり、意味的RGBAレイヤーを生成・理解・編集の原子単位とする。我々の重要な洞察は、ピクセルが画像のレンダリング方法を定義するのに対し、レイヤーは画像の作成・理解・編集方法を定義するという点である。人間のデザイナーが生のピクセルではなくレイヤーを通じて視覚コンテンツを作成・操作するのと同様に、UniWorld-Designはマルチモーダル生成モデルにレイヤーをネイティブとする設計空間を提供する。UniWorld-Designは2つのモデルで構成される。Text-to-RGBA(T2RGBA)モデルは、テキストから直接、独立したRGBAアセットを生成する。Image-to-Layer(I2L)モデルは、完成した画像、全体指示、およびレイヤーごとのプロンプトを条件とし、順序付けられた完全な意味的RGBAレイヤーを共同で生成する。その指示インターフェースは、トップレベル分解、再帰的分解、および対象指定抽出をサポートし、レイヤー化をエージェント編集のための指示アドレス可能な操作にする。I2Lは可視ピクセルの分割ではなく完全な意味的オブジェクトを学習するため、そのレイヤーは移動または削除しても使用可能なままである。Crelloベンチマークにおいて、I2LはレイヤーごとのRGB L1誤差を37%削減し、Alpha Soft IoUではQwen-Image-Layeredに対して34%の相対改善を達成する。別途、T2RGBAは最高のCLIPスコアを達成し、LayerDiffuseおよびOmniAlphaを上回る。
Tool-Integrated Reasoning(TIR)は、反復的なツールインタラクションを通じて、LLMが複雑なタスクを解決することを可能にする。しかしながら、既存の強化学習手法は軌跡レベルの教師信号に依存することが多く、長期的なTIRシナリオにおける細粒度のクレジット割り当てを制限している。オン方策自己蒸留は、特権的コンテキストを持つ教師ブランチを通じてより密な信号を提供するが、既存のアプローチは通常、このようなコンテキストを正解回答や検索されたスキルから導出しており、エージェントが実際に訪れた状態を反映しない可能性がある。さらに、トークンレベルの教師信号は、ツールインタラクションのターンレベルの構造を捉えることができない。この問題に対処するため、我々は、実行条件付き後知恵から直接教師信号を導出するターンレベルの後知恵自己蒸留フレームワークであるTurnSightを提案する。次に、異なる先読みホライズンを持つ複数の後知恵ビューを構築し、クロスホライズン方向的一致を通じて信頼できる教師信号を選択する。最後に、選択された後知恵信号は兄弟ロールアウト間で正規化され、元の最適化方向を維持しながらRLアドバンテージを適応的に調整するために用いられる。3つのベンチマークにおける広範な実験により、TurnSightの有効性が実証される。我々のコードはhttps://github.com/quchangle1/TurnSightで公開されている。
ウェアラブルアシスタントは、その視覚履歴に関する質問に答えるだけでなく、その履歴が現在の状況に役立つことを認識できなければならない。既存のビデオメモリシステムは主に質問条件付き想起をサポートする一方、プロアクティブアシスタントは通常、メモリと制御機構を別個に用いる。我々は、連続ビデオストリームから因果的に成長する単一のメモリを用いて、両方の動作をサポートする学習不要のフレームワークGROVEを導入する。GROVEは詳細な知覚的証拠を保持し、それをタイムスタンプ付きのモーメント、一貫したエピソード、繰り返し発生する複数日にわたるパターンへと段階的に統合する。各階層には、観察の発見、活動の再生、長期的な規則性の走査のための、スケール固有の検索スキルが対応付けられている。反応的QAとプロアクティブ支援は、このメモリとアクセスインターフェースを共有し、検索がユーザークエリによって開始されるか、現在の状況によって開始されるかのみが異なる。MM-lifelongやEgoServeなどの複数のベンチマークにおいて、GROVEは比較手法の中で最良の結果を達成する。制御されたアブレーション実験により、時間的階層とそのアクセススキルは補完的であり、エビデンスが複数日にわたる場合にパターンが最も大きな利点をもたらすことが示される。コードは https://github.com/SitongGong/GROVE で公開予定である。
大規模言語モデル(LLM)エージェントは、ソフトウェア工学において急速に採用が進んでいる。エージェントが実際のコード生成においてより大きな役割を担うにつれ、その変更は数十行から数百行に及ぶ大規模なものになっている。このため、エージェントの成果物を手動でレビューすることはますます困難になり、開発者は実施された変更を理解するために説明に頼るようになっている。それにもかかわらず、エージェントが生成した説明の信頼性を評価するベンチマークは存在しない。このギャップを埋めるため、我々はコーディングエージェントからの説明を自動評価するベンチマークであるExplainBenchを提案する。ExplainBenchは、情報量の多い説明があればLLMが質問に正しく回答できるはずであり、それによりエージェント間の説明品質の定量的比較が可能になる、という直感に基づいている。この観察に基づき、我々は説明が(1)バグを含むコードの意図された動作と(2)エージェントのパッチ適用自体の効果を正確に記述しているかを評価する一連の質問群を構築する。実験によりまず、説明品質がエージェント評価の独立した軸であることが明らかになる。ExplainBenchは、広く使用されているSWE-bench Verifiedベンチマークとは異なる順位でエージェントをランク付けする。エージェントの説明品質をより詳細に分析すると、説明に頻繁に問題が見られることが分かる。例えば、説明が、正しくないパッチを正しいと主張することが多い。この知見に基づき、我々は追加テストを実行して説明を検証・改善する説明監査エージェントを実装し評価する。このエージェントは、評価したすべてのエージェントの説明を改善し、エージェントの説明を自動的により信頼性の高いものにできることを実証した。
現代のエージェントフレームワークは、複雑なタスクを解決するために大規模言語モデルに外部スキルライブラリを装備させる。しかし、これらのシステムがスキルを効果的に進化させることができるのか、またその結果得られるスキルがタスク解決能力を向上させるのかは依然として不明である。このギャップを埋めるため、我々はインコンテキスト継続的スキル学習のための動的評価フレームワークであるContinualSkillBenchを導入する。これは5つの代表的なドメインを網羅し、各ドメインは難易度が増加する順に並べられた100の相互に接続されたサブタスクと、タスク横断的なスキル再利用の機会を含む。我々の実験は、逐次実行が一般的に性能を向上させるが、その向上幅はモデルとドメインによって大きく異なることを示している。さらに、インコンテキスト学習は平均的に明示的スキル維持と同等の性能を示し、改善の大部分が再利用可能なスキルの抽象化のみではなく、先行する文脈とフィードバックへの適応に由来することを示唆している。それにもかかわらず、明示的スキルは再利用可能な手順や正確な出力を必要とするタスクに対して選択的な利点をもたらす。さらに、性能の低いモデルは、より大規模で断片化されたタスク固有スキルのコレクションを蓄積する傾向があることを我々は見出した。これらの発見は、現在のインコンテキストスキル進化メカニズムが継続的適応を支援できる一方で、経験を堅牢で転移可能なスキルへと一貫して統合することには依然として課題があることを示している。
大規模言語モデル(LLM)は真の構造的推論を備えているのだろうか、それとも単に表面的なパターンマッチングに依存しているにすぎないのだろうか。数値精度と長いコンテキストにわたる多段階の論理が要求される金融領域は、理想的な試験環境である。既存のベンチマークは、現実世界の産業的複雑性を捉えきれておらず、主に多肢選択問題や切り抜かれた表に対する単一ホップのQAに依存しており、複雑な財務諸表間の動的関係や時間的累積解除を無視している。 このギャップを埋めるため、我々はFinIndicesを導入する。これは、非切り抜きの財務諸表(最大32Kトークン)に対するデータ処理の忠実性を評価する大規模ベンチマークである。敵対的トラップを備えた自動合成パイプラインを活用し、FinIndicesは単一指標計算および表指標集計を含み、複雑な領域的・時間的・口径の推論を検証する。 我々の評価により、LLMに二つの深刻な脆弱性があることが明らかになった。第一に「知識ボトルネック」である。事前学習中に式を記憶しているにもかかわらず、モデルは脆弱なパターンマッチングを示す。明示的な式のヒントを除去すると性能が崩壊し(例:Gemini-3.1-Proは表タスクにおいて70.70%から38.22%に低下)、時間的累積解除とストック・フロー口径の不一致における致命的な欠陥が露呈する。第二に「構造的ボトルネック」である。複数指標・複数期間の表を生成する際の高い認知的負荷が、推論能力を能動的に消耗させる。構造的压力の下では、単独の導出を完璧に実行するLLMであっても、誤った隣接列を取得したり、深い会計調整を怠惰な文字通りの算術で代用したりするといった浅いヒューリスティックに退行する。最後に、教師ありファインチューニング(SFT)は、ゼロヒント条件下で大きな改善をもたらし(単一指標で+8.54%、表指標で+3.82%)、構造的論理がデータ中心のアライメントにより部分的に回復可能であることを実証している。
我々は、人間の行動認識における新しい問題領域、すなわち標準的なRGBビデオからの小児の歩行行動の細粒度解析を導入する。具体的には、3歳から17歳の小児の歩行パターンを対象とする。このような行動は、脳性麻痺や片麻痺などのいくつかの重大な発達障害および神経筋疾患の診断と治療において自然に発生する。そのような行動が臨床的価値を持つにもかかわらず、現在の3Dセンサーを用いた歩行解析システムは高価で侵襲的であり、幼い被験者にはしばしば非現実的である。この問題に対処するため、我々は、110人の被験者からなる1,100以上の高フレームレート(60 FPS)ビデオシーケンスを含む新しいデータセットを導入し、それには同期され匿名化された姿勢シーケンスが付随する。各セッションでは、小児は5秒間の「歩き回り」タスクを実行し、複数の視点から歩行周期が捕捉される。重要なことに、我々は、歩行基盤モデルやマルチモーダル大規模言語モデル(MLLM)を含む現在の最先端手法が、これらの臨床的な微妙な差異を効果的に解明できないことを示す。我々は、これらの不規則で微細な運動パターンを解析する際の主要な技術的課題を特定し、小児歩行の基本的構成要素を解読するための統合されたエンドツーエンドのフレームワークを説明する。包括的な実験結果を通じて、我々はこのデータセットが新規の研究課題を促進し、自動化された小児歩行評価のための厳密なベースラインを確立する可能性を示す。
ビデオワールドモデルは、過去の観測と制御信号を条件として将来の観測を予測し、自己回帰的な状態遷移を通じて長期的な生成を可能にする。主に視覚的外観と動作を捉える従来のビデオ生成モデルとは異なり、ビデオワールドモデルはエージェントの行動下における環境進化を支配する基礎的ダイナミクスを学習し、具現化AIと対話的シミュレーションの基盤を提供する。最近の進歩は主に、事前学習済みビデオ生成モデルを事後学習や蒸留を通じて適応させることに依存してきた。有効ではあるものの、これらのアプローチは複雑な学習パイプラインと多大な計算リソースを必要とすることが多く、双方向の事前学習と因果的ストリーミング推論との間の不整合に悩まされている。最近の研究では、自己回帰的ビデオワールドモデルをゼロから学習することが実現可能かつスケーラブルであることが示されている。しかしながら、コミュニティには、控えめな計算リソースでエンドツーエンドに学習可能な、軽量で透明性が高く、完全に再現可能なベースラインが依然として不足している。我々は、ストリーミングビデオワールドモデルをゼロから学習するための再現可能なフレームワークであるMiniWorldを提案する。MiniWorldは、事前学習済みビデオVAEの潜在空間においてフローマッチングを用いて学習されたブロック因果ビデオ拡散トランスフォーマーを採用する。拡散フォーシングに基づき、チャンク単位の非減少ノイズスケジュールと二段階の継続学習を採用し、時間的モデリングと安定性を向上させる。推論時には、MiniWorldはローリングKVキャッシュとパイプライン化された非同期デノイジングを組み合わせ、制約された計算量のもとで効率的なストリーミング生成を実現する。モデル全体は、8GPUサーバー1台で数日以内に学習可能である。学習および推論コードベースと事前学習済みチェックポイントを公開することで、MiniWorldが今後のビデオワールドモデリング研究を促進することを期待する。
ペルソナスキルは、個人の対話履歴を、下流エージェント向けの移植可能かつ実行可能なアーティファクトへ蒸留する。柔軟なパーソナライゼーションを可能にする一方で、このプロセスは断片的な個人シグナルを集中させ、再利用を通じてその影響を増幅し、個別レコードや検索ベースのメモリ向けに設計された防御策に挑戦を課す。ペルソナスキルパイプラインの安全性を体系的に調査するため、我々はペルソナスキルパイプライン全体にわたるリスクと防御を評価するエンドツーエンドのベンチマークであるAntiSkillBenchを導入する。本ベンチマークは以下で構成される:(i)多様なタスクシナリオを網羅する50の行動的に豊かなプロファイルから構築された7,500件のペルソナ基盤対話トレースからなるデータセット、(ii)3つのスキル蒸留戦略にわたってスキルレベルのプライバシー漏洩、エージェントレベルの属性開示、および行動模倣を測定する評価スイート、(iii)能動的リスク抑制と受動的来歴保護を含む、オンライン介入と事後的介入にわたる4つの構成を網羅する防御評価。3つのフロンティアエージェントにわたる実験は、ペルソナスキルのリスクがエージェントのバックボーンと蒸留プロトコルを問わず持続し、明示的属性からコミュニケーションスタイルや性格特性にまで及ぶことを示す。既存の防御策は限定的かつ蒸留依存的な効果しか示さず、リスクと蒸留戦略をまたいだ一般化に失敗している。これらの結果は、AntiSkillBenchがプライバシー保護と真正性を考慮したペルソナスキルを開発するための挑戦的なベンチマークであることを浮き彫りにする。
高粘度と複雑なレオロジー特性を特徴とする粘性汚れは、ロボットによる表面清掃における大きな課題であり続けている。従来の拭き取りはしばしば汚れを広げてしまうが、擦り洗いはより強い摩擦力をもたらす一方で、表面を傷つけるリスクがある。本稿では、粘性汚れの清掃を凝集問題として再定式化するフレームワークであるPush-Wiperを提案する。Push-Wiperは、分割された押し動作軌道に沿ってスポンジを用い、汚れを徐々に凝集させる。続く後処理段階では、凝集した物質を剥離させてスポンジの自己洗浄を可能にする。汚れの凝集には段階的戦略を採用し、Diffusion Policyを活用して適応的な押し動作系列を生成する。これらの系列は、我々の任意表面姿勢補間器(ASPI)とハイブリッド力・位置制御器によって実行され、これにより本手法は多様な空間分布を持つ汚れに対して一般化できる。Push-Wiperは、除去された汚れ面積の割合として定義される清掃スコア(CS)において、ベースライン手法よりも最大130%高い値を達成する。追加トレーニングなしで、Push-Wiperは固体残留物、液体のこぼれ、未学習の粘性汚れ、異なる幾何学的形状を持つ曲面に対してもゼロショットで転移する。我々の実験は、Push-Wiperの清掃効果と強力な一般化能力を実証している。プロジェクトのウェブサイトは https://push-wiper.github.io/ で公開されている。
World Action Models (WAMs)は、ロボットの行動と将来の視覚的ダイナミクスを統合的にモデル化する有望なパラダイムとして登場している。しかし、そのピクセル生成型の将来予測への依存は、行動に関連する状態遷移とタスクに無関係な視覚コンテンツを絡み合わせる可能性があり、視覚的分布シフト下での堅牢性を制限している。我々は、視覚的にシフトした観測に条件付けられた将来予測が、現在のシーンに忠実であるよりも訓練分布のコンテンツを幻覚してしまうという、繰り返し発生する現象である「訓練分布幻覚(Training-Distribution Hallucination)」を特定する。制御されたフレームトリプレット診断により、DINOv3特徴量はWan-VAE潜在変数よりも視覚的シフトに対して安定しておりながら、タスク状態の区別をより良く保持することがさらに示される。予測された将来を修正するのではなく、我々はSemantic-Temporal WAM (ST-WAM)を提案し、将来予測と履歴検索のための共有意味表現としてDINOv3を使用しつつ、細粒度のVAEダイナミクスを保持することで行動の堅牢性を向上させる。そのDual-Space Future Experts (DSFE)は将来のVAE潜在変数とDINO特徴量を共同で予測し、Current-Anchored Intent Retrieval (CAIR)は現在の視覚言語コンテキストの下で最近のDINO履歴からタスク関連の証拠を検索する。ST-WAMは、追加の身体化事前学習やタスク固有のアノテーションなしでエンドツーエンドに訓練され、推論時に明示的な将来生成を必要としない。LIBEROで98.7%、RoboTwin 2.0で92.8%を達成し、より重要なこととして、Fast-WAMと比較して、ゼロショットLIBERO-Plus性能を21.3パーセンテージポイント向上させ、視覚的シフト下での実世界成功率を25.8%から61.5%へと2倍以上に向上させる。これらの結果は、意味的時間モデリングがピクセル生成ダイナミクスを効果的に補完し、堅牢な操作を実現することを実証している。
科学ポスター作成とは、長大なマルチモーダル論文を、読みやすく編集可能なキャンバスへと圧縮する作業である。既存システムは、完了した出力のみをスコアリングすることでリクエストレベルの失敗を隠蔽している。直接の画像生成では要素単位の編集が不可能であり、コーディングエージェントによるワークフローはコストが高い。PosterMELDは、テンプレート条件付きマルチエージェントパイプラインである。レンダリング前に容量を考慮したスロットが文章作成を導き、決定論的ゲートと視覚言語モデル(VLM)によるレビューが失敗を限定された修復へと振り分ける。受理された各リクエストは、編集可能なPowerPoint(PPTX)およびPortable Network Graphics(PNG)の成果物を出力する。明示的なデザイン制御により、同一論文のバリエーションを生成できる。 621本の論文を対象に、印刷可能率(PRR)は、幾何学的、可読性、アセット整合性、および明らかな事実誤認の各チェックを通過したリクエストをカウントし、ネイティブ編集可能性は別途報告される。固定されたVLMが、印刷可能な出力に対して条件付きCraftsmanship-Harmony-Expressiveness(CHE)スコアを割り当てる。PosterMELDは81.3%のPRRを達成し、これはP2Pの3.4倍、PosterGenの5.2倍である。また、複数の印刷可能出力を生成する手法の中では、条件付きCHEにおいて最高値を達成した。ネイティブ編集可能性と明示的なデザイン制御を維持しつつ、平均コストはリクエストあたり0.38米ドルであり、Codex+Skillの3.5%に相当する。コードとリソースは、https://github.com/Shannon4Science/PosterMELD で入手できる。
クエリ非依存のKVキャッシュ削除(eviction)は、コンテキストを一度圧縮し、得られたキャッシュを任意の将来のクエリに再利用するが、厳しい予算(budget)下では性能が著しく低下し得る。既存手法は主に、どの元のKVペアを保持するかを改善するものである。我々はRestoreKVを導入する。これは、選択ベースの定式化を、同じ総KV予算の下での学習された復元(restoration)によって補完するものである。我々の主要な洞察は、削除によって失われる情報はコンテキスト固有である一方、そのコンパクトな補完を生成するメカニズムはコンテキスト間で共有できるという点である。コンテキストのプレフィル後、少数の復元トークン(restore tokens)が単一のLoRA適応パスで完全なKVキャッシュに注目し、コンパクトでコンテキスト条件付きの復元キャッシュを生成する。基本の重要度スコアラと削除ルールは変更されず、アダプタはその後のすべてのクエリおよびデコード中は無効化される。RestoreKVは、凍結された完全キャッシュモデルからのパラメータ効率的な自己蒸留により訓練され、パラメータのわずか0.4%のみを最適化し、タスク固有のチューニングを必要としない。4つのバックボーンと4つの長文コンテキストベンチマークにわたり、RestoreKVは圧縮による性能劣化を大幅に削減する。Qwen3-4Bでは、5つの基本削除手法にわたる、対になった予算整合設定60件のうち59件で改善する。5%予算では、RULER-4KにおいてKVzipを38.2から73.2へ引き上げる。KVzip+に適用した場合、RestoreKVはKVPressベンチマークにおいて16倍圧縮で86.4のRULER精度に達し、32Kコンテキスト評価では一回限りのキャッシュ構築オーバーヘッドを0.5%未満しか追加しない。プロジェクトページは https://paper.pnu-cvsp.com/RestoreKV/ で利用可能である。
推論言語モデルはしばしば過剰思考に陥る。すなわち、ヘッジ、アプローチの放棄、自己矛盾などの行動の長い連鎖を生成し、トークンを消費するだけで回答を改善しない。我々は、これらの行動が単に応答長の結果ではないことを示す。応答長を制御しても、誤ったトレースは正しいトレースよりも非生産的な自己内省の割合が高い。この問題に対処するには、自己内省が有効な箇所と有害な箇所を特定する必要があるが、ステップレベルのアノテーションを得るにはコストがかかる。我々は、推論トレース内の中間回答コミットメントが安価な代理指標を提供することを見出す。すなわち、トレース内の各最終回答候補を正解と比較することで、追加の教師信号なしに後続の内省が生産的かどうかを判定できる。この知見に基づき、我々はDASH(Drift Aware advantage SHaping)を提案する。DASHは、各推論セグメントが正解へ近づくか遠ざかるかに基づいて、セグメントレベルのクレジットを割り当てる。競技レベルの数学ベンチマークにおいて、DASHは過剰思考が蔓延する状況下で最高の精度を達成する(平均精度:59.45%、Dr.GRPO:58.1%、GRPO:56.95%)。同時に、過剰思考行動を低減し、ベースラインよりも生産的な自己修正を実現する。
我々は、ALiBi位置エンコーディングのこれまで見落とされていた故障モードを特定する。すなわち、その線形バイアススケーリングが浮動小数点精度のアンダーフローを引き起こし、アテンション重みの大部分をゼロにして、影響を受けたアテンションヘッドを部分的に盲目にする。我々はこの故障モードを分析し、その影響を特徴づけ、4つの緩和戦略を検討する。さらに、ALiBiに基づく最先端の事前学習モデルにおいてこの故障モードが発生することを実証する。148Mパラメータのデコーダモデルを用いた包括的な事前学習実験により、その影響をコンテキスト外劣化から切り離して理解することができる。我々は、ALiBiの故障モードが標準的なデコーダベンチマークにわずかな影響しか与えない一方で、トークン検索を著しく損なう可能性があることを見出す。我々は4つの学習時緩和戦略を提案し、それらを個別および組み合わせて評価したところ、対数スケールの距離がパスキー検索において最も一貫した改善をもたらすことが分かった。この問題にもかかわらず、デフォルトのALiBiスロープは、特にneedle-in-a-haystack検索において、驚くほど強力なベースラインであり続ける。これらの知見に基づき、ALiBiを用いてモデルを学習する方法について具体的な推奨事項を提供する。
重みのみの量子化は、大規模言語モデル(LLM)のトランスフォーマーブロックのストレージを大幅に削減するが、実用的なバックエンドでは、最終的な言語モデリングヘッド(LMヘッド)をBF16またはFP16で保持することが多い。この射影を単純に量子化すると、語彙ロジット分布が大きく乱され得る。我々は、量子化された低ランクコア、グループ単位のINT4残差、および活性化由来のメトリックで適合させた低ランク補正を組み合わせた、パック型LMヘッド圧縮機であるARCHeadを提案する。ARCHeadは、高密度のBF16ヘッドを保持せず、永続的なLMヘッドストレージを3.7〜3.9倍削減する。Qwen3-8B-Baseでは、BF16ヘッドストレージの25.6%を使用しながら、相対パープレキシティ1.007を達成する。ストレージを一致させた単純なINT4は1.14〜1.16となる。AWQまたはbitsandbytesが残したBF16ヘッドをARCHeadで置き換える場合、交差エントロピーの増加はわずか0.006〜0.007であり、我々の測定ではスループットの変化は2%未満である。したがってARCHeadは、ブロック量子化器が触れずに残す大きな出力射影を圧縮することで、ブロック量子化器を補完する。コードはhttps://github.com/suayptalha/archeadで入手可能である。
法的情報検索(IR)における一般的なタスクは、判例集から関連する法的資料を見つけることである。法的実務では特定の判決段落へのピンポイント引用(ピンサイト)がしばしば求められる一方で、既存の公開法的IRデータセットの大半は段落レベルの引用注釈を備えていない。しかし、そのような情報を含む公開データセットは、クエリ文にデータ漏洩が含まれており、またコーパスから引用する側でも引用される側でもない段落を除外しているため、非現実的で過度に単純化された検索設定となっており、性能を過大評価する可能性がある。これらの限界に対処するため、我々は欧州連合司法裁判所(CJEU)の判決から構築した大規模な法的IRデータセットを提供する。このデータセットには、(i) 引用情報を除去したマスク済みの事例/段落クエリ、(ii) すべての段落を含むコーパス、(iii) 部分的な人間専門家による検証を経た事例レベルおよび段落レベルの正解引用が含まれる。我々のデータセットは、複数のクエリ-文書レベル(事例間、段落から事例、段落間の検索)において、法的IR手法の開発と厳密な評価の両方を支援する。データセットへのリンク: https://huggingface.co/datasets/theresiavr/legalpincite
オーディオベースのピアノ採譜はオンセット、ピッチ、ベロシティにおいて良好な性能を示すが、サステインペダルにより鍵盤を離した後も音が持続するため、オーディオシステムは物理的な鍵盤開放ではなく、ペダルによって延長されたオフセットを予測する。しかしながら、既存のVisual Piano Transcription(VPT)システムは短い映像ウィンドウからのオンセット検出に焦点を当てており、オフセット精度はオンセットに大幅に劣り、ノートレベルのベロシティは報告されていない。これらのギャップに対処するため、我々は最初の完全なVPTシステムであるV2N(Video to Notes)を提示する。これは、共有時間バックボーンがオンセット、オフセット、鍵盤保持、ベロシティのためのタスク別ヘッドに特徴を供給し、ウィンドウ中心のみではなくフレームごとの教師信号で共同訓練されるものである。アブレーション実験により、マルチタスクの教師信号がオンセット精度を改善しつつオフセットとベロシティの予測を可能にすること、より長い時間的文脈がさらなる改善をもたらすことが示される。V2NはPianoVAMとR3において新たな最先端結果を達成する。
MLLMベースのセグメンテーションは、高いセグメンテーション性能、対話能力の維持、高速な推論という中核的なセグメンテーションのトリレンマに直面している。埋め込み予測手法は、ピクセルレベルの目的関数によって言語モデリングを妨げる可能性がある一方、次トークン生成は高密度マスクに対して非効率である。本稿では、自己回帰的対話と非自己回帰的マスク予測を分離するオールマスク予測(All-Mask Prediction)を提案する。そのバイナリ実装であるSTAMP(Simultaneous Textual All-Mask Prediction)は、語彙内の\<SEG\>トリガーを出力し、画像整列マスクトークンと対応するパッチ特徴量を融合し、ハイブリッドアテンションを用いて全てのトークンを一回のパスで前景または背景に分類する。これにより、強力な参照セグメンテーションと推論セグメンテーションを、維持されたマルチモーダル能力および効率的な推論と組み合わせて実現する。しかし、バイナリマスクは、ターゲット固有の予測を繰り返さなければ複数の意味的またはインスタンス的同一性を保持できない。そこで本稿では、構造化オールマスク予測(Structured All-Mask Prediction)を提案し、STAMPlusを開発する。これは、明示的なIDと任意のボックスを備えたターゲットリストを生成し、これらのIDを共有マルチクラスマスク空間に結合して、全てのターゲットを一回の非自己回帰パスで共同予測する。単一の統合チェックポイントは、STAMPの参照・推論能力を維持しながら、オープン語彙セマンティックセグメンテーション、インスタンス認識セグメンテーション、およびリモートセンシング小目標セグメンテーションへと拡張する。そこでは、高解像度マスクトークンスケーリングがより詳細な空間的証拠を保持する。これらの設定において、STAMPlusは最先端のセグメンテーション性能を達成し、汎用のマルチモーダル命令追従を維持し、12カテゴリのレイテンシをSTAMPの繰り返し推論における13.50秒から5.16秒へと短縮する。さらなる分析により、正確なターゲット手がかりがセグメンテーションを改善し、学習された空間的グラウンディングが再検査推論に有益であることが示される。全体として、STAMPlusは単一ターゲット予測を超えてトリレンマを解決する。
オン方策トレーニングは、大規模言語モデルの推論能力を向上させるポストトレーニングパラダイムとして有力であり、より強力な専門家モデルからのゴールデントラジェクトリによってしばしば強化される。しかし、専門家がより困難な問題で失敗した場合、既存の軌道誘導型手法はその主要な教師信号源を失い、これらの失敗したトラジェクトリは通常、ネガティブサンプルとして破棄される。我々は、このような失敗、すなわちゴールデンネガティブトラジェクトリが、模倣すべきデモンストレーションとしてではなく、内省すべき不完全な軌道として扱われる場合、依然として貴重な推論信号を提供できると主張する。我々はリフレクションアドバンテージを特定する。すなわち、困難な問題に対しては、不完全な軌道を内省することは、ゼロから直接問題を解くよりも容易かつ効果的であり得る。この着想に基づき、我々はReflectRLを提案する。これは、オン方策トレーニング中にゴールデンネガティブトラジェクトリから学習する軽量なプラグアンドプレイフレームワークである。ReflectRLはまずこれらの軌道を用いてリフレクティブリーズニング(内省的推論)を誘発し、次にリフレクションから直接方策への遷移を適用して、獲得した推論行動を直接推論へと移転する。9つのベンチマーク、4つのLLMバックボーン、4つのオン方策トレーニング手法にわたる実験により、ReflectRLが最小限のオーバーヘッドで推論性能を一貫して向上させることが示された。
自己整合性(self-consistency)は、サンプリングされた推論トレースの中で最も頻度の高い解答が最も信頼できると仮定する。しかし、これは因果推論において失敗し得る。サンプルはしばしば同じ交絡誤差を繰り返し、投票は複数の有効な解答に分散するため、有効な少数派トレースが存在するにもかかわらず、無効な解答が勝利することがある。我々はCALVER(Causal Axiom-Level VERification)を導入する。これは訓練不要の記号的検証器であり、Pearlの因果基準(d分離、バックドア調整、介入を含む)に照らして構造化トレースをスコアリングし、参照解答を参照せずに最高スコアの候補を選択する。複数のグラフ有効な解答を許容するCLEARのfind-one-validクエリにおいて、CALVERは42.1%に達する。一方、同一の固定プールでは、多数決、報酬モデル、LLM判定器、モデルの信頼度は約30%に留まる。判定器を72Bにスケールしてもその差は埋まらない。監査済みのクリーンコア部分集合では、グラフ有効なCALVERの選択21件のうち11件が、ベンチマークの記載解答と異なる一方で、要求された述語を満たしている。この利点はサンプリング予算が増えるにつれて拡大し、公開された10個のベイジアンネットワーク、第2のモデルファミリー、およびモデルがテキストからグラフを構築しなければならない設定でも再現される。CALVERはまた、正確なグラウンドトゥルースに対する閾値付き平均処置効果の決定を改善し、真理値表チェッカーを用いた論理に一般化し、各候補をCPU上で数ミリ秒でスコアリングする。CALVERが必要とするのは因果構造だけであり、それは明示的に与えられるか、テキストから構築される。その条件が満たされる限り、選択は因果的妥当性によって集約できる。
歴史的言語変化は形態論、統語論、意味論、語用論に影響を及ぼすが、計算論的研究は通常これらのレベルを互換性のない表現で検証するため、言語間でそれらが共に変化するかどうかを判定できない。我々は、変化の規模と方向が単一の分析空間内で言語レベル、言語、歴史的時期の間でどのように異なるかを問うことで、この問題に対処する。我々は、凍結された多言語言語モデル、特徴整列型クロスコーダー、事後的な言語学的介入を組み合わせたフレームワークであるChronoLensを導入し、1803年から2026年にわたる五つの議会伝統に由来する4498万件の文書、約172億トークンに適用する。得られたスパース表現は、密埋め込みやプールされたスパースオートエンコーダーよりも言語統計とかなり強く一致し(ρ=0.72 対 0.29 および 0.28)、形態論、統語論、意味論、語用論は一般に言語内で同等の規模で変化する一方、言語によって変化の時期、程度、方向が著しく異なることを明らかにする。これらの発見は、歴史的言語変化が構造化された多次元プロセスであることを示している。すなわち、同様の規模は異なる軌跡を隠し得るため、意味のある言語間比較には距離と方向の両方の測定が必要である。
グラフ質問応答(CQA)では、マルチモーダル大規模言語モデル(MLLM)が視覚的理解と論理的推論を統合することが求められるが、現在のモデルは正確な視覚的グラウンディングと一貫性のある推論チェーンの実現に課題を抱えている。外的なチェーン・オブ・ソートプロンプティングや視覚的手がかりは性能を大幅に向上させるものの、現在のMLLMは内在的な視覚的グラウンディングに基づく推論能力を欠いており、その結果、不正確な認識と視覚的証拠から切り離された推論が生じる。これらの限界に対処するため、我々はCURVを提案する。これは、CQAを多段階の視覚的グラウンディングに基づく推論として再構成し、各段階で空間的注意の集中を通じて論理的推論と動的な視覚的グラウンディングを調整することにより、内在的な視覚的推論能力を育成するカリキュラム学習フレームワークである。モデルの学習を支援するため、さらにCCQAを導入する。これは、多様なグラフタイプと推論パターンにわたるスケーラブルな合成生成を備えた3段階のカリキュラムデータセットである。我々のカリキュラムは、基本的な単一操作の推論から複雑な複数グラフの合成的タスクへと体系的に進行する。実験により、CURVはベースラインに対して最大20.50%の向上を達成し、実世界のベンチマーク(最大12.30%)やドメイン外のマルチモーダル推論タスク(最大10.20%)にも汎化できることが示され、動的なグラウンディングを用いた視覚的推論の内面化がグラフ理解能力の向上に有効であることが検証された。コードは https://xhguo7.github.io/CURV/ で公開している。