翻訳付きの日次キュレーションされたAI研究論文
視覚言語モデル(VLM)は、DocVQA、ChartQA、MMLongBench-Docなどの視覚的文書理解ベンチマークにおいて高い性能を達成している。しかし、現実世界の文書は、長さ、レイアウトの複雑さ、モダリティ、質問の難易度など複数の要素を組み合わせており、モデルの失敗を特定の原因に帰属させることが困難である。我々はSynthDocBenchを紹介する。これは、長文脈の視覚的文書理解のための完全に合成されたベンチマークであり、文書の長さ、レイアウト構造、モダリティ構成、質問タイプなどの要素を体系的に制御する。このベンチマークは組み合わせ設計を用いて構築されており、生成された文書間で各要素が独立に変動するため、モデルの振る舞いの制御された分析が可能となる。文書は、6つのレイアウト原型にわたってLLMパイプラインを用いてエンドツーエンドで生成され、モデルが疑似相関を利用するのを防ぐために40%のランダム上書きが適用される。さらに、SynthDocBenchは既存のベンチマークよりもはるかに長い長さと構造的多様性を持つ長文脈文書を網羅している。7つの最先端VLMを評価した結果、既存のベンチマークでは明らかにできない3つの失敗モードを発見した:文書の長さによる急激な性能低下、6モデルのうち5モデルで文書の中間3分の1が最も困難であるという体系的な位置感度、そして6モデルのうち5モデルが負の初期から後期への傾向を示すこと(最大低下:8.3パーセントポイント)、および長文書設定におけるグラフ理解の崩壊である。これらの結果は、現在のモデルがロバストな長文脈視覚的文書理解を達成するのではなく、ベンチマークのアーティファクトに過学習している可能性を示唆している。
本稿では、SpectraRewardを提案する。これは学習不要の報酬関数であり、事前学習済みMLLMを画像生成強化学習のための既製報酬モデルとして利用可能にするものである。SpectraRewardは、MLLMに生成画像の判定や分解された検証問題への回答を求める代わりに、生成画像から元のプロンプトがどの程度復元可能かを、画像条件付きの教師強制型フォワードパス一回で計測する。この平均画像条件付きプロンプト対数尤度を報酬として用いることで、選好ラベルや報酬モデルのファインチューニングなしに、MLLMの事前学習済み画像-テキスト整合能力を直接再利用する。さらに、統合マルチモーダルモデルの特殊ケースとしてSelf-SpectraRewardを導入する。これは、方策自身の理解ブランチが生成ブランチの報酬モデルとして機能し、外部報酬モデルや外部知識を必要としない閉ループ自己改善フレームワークを形成するものである。広範な実験により、SpectraRewardを検証した。対象は、2つの拡散モデル、3つのRLアルゴリズム、4つのMLLMファミリー(パラメータ数4B~235B)にわたる9つの報酬MLLMバックボーン、および5つの分布外テキスト画像ベンチマークを含む、広範な画像生成強化学習研究である。結果は、SpectraRewardとSelf-SpectraRewardの両方が生成性能を有意かつ一貫して向上させ、従来のMLLM由来の報酬訓練手法を上回ることを示している。さらに、大規模な報酬MLLMが常に優れているとは限らず、Self-SpectraRewardがはるかに大規模な外部報酬モデルに匹敵またはそれを上回る可能性があることが明らかになった。これは、報酬と方策の整合性が効果的な画像生成強化学習の重要な要素であることを示唆している。プロジェクトページ: https://huangrh99.github.io/SpectraReward/
視覚生成モデルは描画に優れているが、知らないことについては確信を持って捏造する。ユーザーの要求は無限で、進化し続け、非常にロングテールである:新しいキャラクター、トレンドのエンティティ、カットオフ後のイベント、その他多数。この世界知識のボトルネックは構造的なものである:生成モデルは固定コーパスで訓練されるが、視覚世界は開かれている。我々はSearchGen-20KとSearchGen-Benchを構築した。20,839件のプロンプトが12の失敗カテゴリと22のドメインにわたって含まれ、事前実行済みのマルチモーダルSearchGen-Corpus-1Mと組み合わせることで、オフラインで再現可能な研究を支援する。SearchGen-Benchにおいて、最先端のオープン生成モデルは100点中21~28点しか得られず、既存のベンチマークでは見えない40ポイントの低下が見られる。自然な解決策は検索ツールを活用し、エージェント的な視覚生成を可能にすることである。しかし、単純な検索は失敗することがわかった:無差別に検索し、生成モデルが既に処理できるプロンプトにノイズを注入してしまう。その根本原因を、生成モデル固有で進化する知識境界、すなわち生成モデルが訓練を通じて内面化できるものと外部コンテキストに残さなければならないものとの間の境界に求める。この境界は事前に特定することが困難であるが、teach-then-search共訓練フレームワークを通じて発見可能であることを示す。この共訓練レシピの最小限のバージョンでも単調な改善が得られ、世界知識に基づく要求に応える視覚生成における再帰的自己改善の基盤を築く。我々は完全なデータセット、共訓練コーパス、検索コーパスを、ツール拡張型・世界知識基盤型視覚生成のための再現可能なハーネスとして公開する。
最新のAIモデルは、多くの確立されたベンチマークで優れた性能を達成しているものの、文字列操作や5本足の犬を描くといった、人間にとってはほぼ自明と感じられるタスクでは依然として失敗する。これらの例は、既存のベンチマークが現在のシステムにおける持続的な盲点を過小評価している可能性を示唆している。本稿では、人間には単純に見えるが最新のAIには困難なタスクを通じて、そのような盲点を明らかにするために設計されたベンチマーク「blind-spots-bench」を導入する。我々は、AIコースの学生から収集した素の質問を整理し、構造化された参照解を付与して注釈を付け、結果として得られた235サンプルのデータセットに適合したタスク分類法を提案する。さらに、オープンウェイトおよびクローズドソースの言語モデル、視覚言語モデル、画像生成モデルを含む広範囲のモデルを評価するための自動採点パイプラインを開発する。blind-spots-benchでの分析により、クローズドソースのフロンティアモデルは、既存のベンチマークで同等の性能を示す場合でも、オープンウェイトモデルを約10%の差で大幅に上回ることが明らかになった。より詳細な分析では、単一のモデルが全てのタスクタイプで支配的であるわけではなく、一部のタスクは評価した全てのモデルにとって困難なままであることが示された。これらの結果は、現在の最新モデルにおける具体的な弱点を特定するための診断的ストレステストとしてのblind-spots-benchの価値を強調している。
コーディングエージェントは、外部ツールの戻り値を進行中の推論に統合しなければならない——この能力は、コードに対する標準的な左から右への事前学習では、その前方方向にしか露出されない。我々は、コーディングエージェントの行動-観察-継続ループが、関数呼び出しサイトと構造的に同型であることを観察する。そこでは、呼び出し元が引数を束縛し、呼び出し先が別の場所で計算された値を返し、後続のコードがその値を消費する。この条件付け構造は、通常のコード中にインターネット規模で存在する。我々はこれを、関数認識型Fill-in-the-Middle(FIM)ミドルトレーニングを通じて活用する。これは、プログラム依存グラフ解析と複雑性・推論可能性の二重基準によって選択された関数をマスクする自己教師あり目的関数である。我々は、Qwen2.5-Coder-Instruct(7B/14B)およびQwen3-8Bを、968のGitHubリポジトリから抽出された26億トークンの汚染除去コーパス上でミドルトレーニングし、その後既存のエージェンティックポストトレーニングパイプラインを適用する。ミドルトレーニングにより、SWE-Bench-Verifiedのスコアは7Bで+2.8、14Bで+3.0、Qwen3-8Bで+3.2向上し、SWE-Bench-Liteでは同一モデルでそれぞれ+3.7、+4.0、+5.4の改善を達成した。この改善は、二つのポストトレーニングパイプライン(R2E-Gym、SWE-Smith)および非Qwen2.5ベース(SWE-Legoを用いたQwen3-8B)でも維持される。ドメイン内での向上に加え、ミドルトレーニングは、エージェンティックポストトレーニングが他のコーディングタスク(例:LiveCodeBench)や非コーディングのツール使用ベンチマーク(tau-bench、BFCL)に本来与える能力低下を緩和する。ミドルトレーニングコーパスにはPythonコードのみが含まれているにもかかわらず、関数呼び出しの帰納的バイアスはポストトレーニング後も生存し、一貫した改善をもたらす。
LLMベースのコーディングエージェントは自動ソフトウェア問題解決を大幅に進歩させてきたが、リポジトリ理解の不足に起因する事実誤りを起こしやすいままである。近年の手法は修復前のリポジトリ探索を通じてこの限界を緩和しようとしているが、それらの修正駆動型戦略はエージェントの知識ギャップを特定せずにリポジトリを探索するため、根底にある理解不足を埋めることができない不正確なコンテキストを生成することが多い。本論文では、ソフトウェア問題解決のためのQA駆動フレームワークであるACQUIREを提案する。経験豊富な開発者が修正を試みる前にまず不慣れなコードを理解する方法を反映して、ACQUIREは修復前にリポジトリ知識を明示的に獲得する。このフレームワークは知識獲得とパッチ生成を2つの段階に分離する。第1段階では、質問者と回答者が協力して構造化されたリポジトリ知識を獲得する。ここで質問者は的を絞った質問を行い、回答者は自律的探索を通じて根拠に基づく回答を生成する。第2段階では、解決者が得られたQA知識を活用して情報に基づいたパッチを生成する。暗黙の知識ギャップを明示的で事実に基づく信頼性のある理解に変換することにより、ACQUIREは知識集約的な修復段階を加速化し、より正確な解決を可能にする。SWE-bench Verifiedでの実験は、ACQUIREが代表的な修復前手法を一貫して上回り、わずかな追加コストと時間でPass@1を最大4.4パーセントポイント向上させることを示している。
既存の自動音楽採譜手法は、多くの場合、単一楽器の録音に限定されるか、複雑な実際の音楽ミックスでは機能しません。先行研究では合成訓練データが活用されてきたものの、得られたモデルの汎化性能は低く、現実的な多楽器環境での採譜出力は実用に適さないものとなっています。本研究では、合成データを用いた事前学習の有効性を分析しつつ、実際の音楽音声を用いたファインチューニングと強化学習による事後訓練を組み合わせます。さらに、楽器の存在に関する条件付けを導入し、採譜をカスタマイズ可能にします。最後に、多様な音楽ジャンルの実際の音楽録音に対応するオープンウェイトの多楽器音楽採譜モデルMuScriptorを公開します。
主流の視覚エンコーダは自然画像で事前学習されており、文書画像に適用するには文書指向の適応なしでは効果的ではありません。なぜなら、密集したテキストや細かい文字のストロークには文字レベルの視覚認識が必要だからです。我々は、文書AI向けの視覚テキスト事前学習モデルであるMonkeyOCRv2を提案します。まず、113百万枚の画像(17言語をカバー)から成る、我々の知る限り最大の文書画像事前学習コーパスであるMonkeyDoc v2を構築しました。次に、画像からテキストへの生成とピクセルレベルの文書再構成を同時に学習する事前学習戦略を提案します。前者は視覚表現をテキスト内容に合わせるものであり、後者は文字のストロークやレイアウトの詳細を保持します。テキスト認識、数式認識、テキスト検出、文書改ざん検出、重複テキストセグメンテーションという5つの代表的な文書解析タスクで広範な実験を行いました。元のエンコーダをMonkeyOCRv2に置き換えることで、これら5つのタスクすべてで一貫して性能が向上しました。最後に、より困難な文書解析および文書理解タスクにおいて、マルチモーダル大規模言語モデルの視覚エンコーダとしての有効性を検証しました。軽量な言語モデルと組み合わせて凍結することで、0.7Bパラメータの文書解析モデルが得られ、これは17言語のデジタル生成文書及び撮影文書をカバーする最近のベンチマークMDPBenchにおいて、新しいオープンソースの最先端を達成しました。視覚エンコーダは約11倍小さいにもかかわらず、従来の最良モデルである3Bのdots.mocrを絶対値で2.8%上回っています。凍結したエンコーダは、同一の学習設定の下で、CLIP、DINO、SAMに基づくモデルを8つのベンチマークで凌駕する文書理解モデルも実現しています。これらの結果は、文書指向の視覚事前学習が、それ自体で文書インテリジェンスの基盤となり得ることを示唆しています。
深層ニューラルネットワークを用いた状態行動価値関数の近似により、最も困難なゲームの一つでの勝利を達成したことから、問題のルールを明示せずとも課題を解決するアルゴリズムの進歩に至るまで、強化学習研究は過去10年間にわたり顕著な科学的進歩の中心に位置してきた。本稿では、この研究進展の主要な要素に焦点を当て、強化学習における標準的な評価と設計のパラダイムを分析する。強化学習におけるスケーリング則の理論的基礎を導入し、強化学習アルゴリズムの漸近的性能において、性能順位とデータ規模の間に単調な関係が存在しないことを示す。我々は大規模実験を実施し、その結果は、標準的な設計・評価パラダイムの下での一連の強化学習研究が誤った結論を導いたことを実証する。本分析と結果は、深層強化学習のスケーリング、容量、複雑性に関する中核的な分析を提供する。
大規模言語モデル(LLM)エージェントは、計画、コード実行、デバッグ、経験的フィードバックを連携させることで、機械学習エンジニアリング(MLE)の自動化を始めている。この能力を医用画像に適用することは依然として困難である。なぜなら、各タスクがモダリティ固有の実験、ならびに検証プロトコルと予測成果物に関する厳格な要件を課すからである。本稿では、医用画像モデル開発のための自律型マルチエージェントフレームワークAMIDを紹介する。AMIDはまず、データ条件付きメソッド計画(Data-Conditioned Method Planning)を提案する。これは、タスク固有のデータ分析と実行可能な医用画像リソースに基づいて、粗いタスクレベルの探索空間を実行可能かつ並列化可能なメソッドレーンに精緻化する。次に、検証誘導型二段階最適化(Verification-Guided Two-Stage Optimization)を開発する。これは、多様なメソッドレーンの広範な初期探索から、有望な候補の選択的活用へと移行し、最適化全体を通じて検証プロトコル、指標計算、予測成果物の厳格な検証を実施する。多様なモダリティと予測タイプにわたる20の医用画像チャレンジタスクにおいて、AMIDは評価された汎用MLEシステムを上回り、いくつかのタスクでは強力な人手によるチャレンジソリューションに近づくか同等の性能を示した。これらの結果は、AMIDがタスク固有の医用画像モデル開発を、特注の手動エンジニアリングから、異種タスクにわたって高性能かつ監査可能なモデル成果物を生成するエージェンティックワークフローへと転換できることを示唆している。
本稿では、視覚モデルのための統一的な定式化を提案する。自然画像に加え、マスク、深度マップ、その他の構造化された視覚信号といった多様な形態の視覚情報をすべてRGB画像として表現し、一般的な視覚タスクを共通のRGBからRGBへの画像編集問題に変換する。このパラダイムでは、異なる種類の視覚情報が内部的に自然画像と同じ符号化・復号化アーキテクチャとパラメータを共有するため、単一のモデルが統一的な視覚インターフェースを通じてタスク間を転移できる。これは、言語モデルがテキスト上で動作する様式に類似している。この定式化をRGB In and RGB Out(RINO)と呼ぶ。タスク固有の微調整を行わず、汎用的な画像編集バックボーンに基づくRINOは、セグメンテーションや深度推定といった高密度理解タスク(出力をRGBとして統一)や、ポーズから画像への生成といった高密度条件付き生成タスク(入力をRGBとして統一)において、頑健で競争力のあるゼロショット性能を示す。本稿が、多様な視覚タスクを共有の視覚言語で表現・解釈・解決可能な、統一的な視覚言語システムへの有益な洞察を提供することを期待する。コードはhttps://github.com/yangtiming/RINOで公開されている。
予測用にファインチューニングされた大規模言語モデルは正確でありながら較正が不十分な場合があり、その連鎖思考(CoT)推論は予測の背後にある証拠を忠実に反映していない可能性がある。我々は、内部表現がその両方に対してより直接的な窓口を提供するかどうかを問う。OpenForesight上のEternis-Forecaster 8Bを用いて、中間活性化に対して表現プーリングプローブを訓練し、それらが大幅に優れた較正を達成することを見いだした。この結果はGLM-4.7-FlashおよびGLM-4.5-Airにも当てはまる。次に、証拠除去と転換的注入を通じてCoTの忠実性を評価する。プロンプト内の影響力のあるソースを除去すると、推論過程はそのままであるにもかかわらず、モデルの予測が変化することが多い。同一のプローブは嘘発見器として機能する。その活性化は、推論過程よりもはるかに良く行動の変化を追跡し、また、CoTが摂動の影響を隠している場合を含め、84%のケースで変化の方向を予測する。最後に、強制応答は、予測が推論開始前にほぼ固定されていることを明らかにする。推論前の単一パスで確定した回答と信頼度が再現され、この事前設定された回答分布の広がりによって質問を振り分けることで、精度を損なうことなく生成トークンの30~47%を節約できる。これらを総合すると、内部表現のプロービングは、言語モデル予測器やより広範な推論モデルの較正、監査、トリアージのための実用的なツールとして確立される。