翻訳付きの日次キュレーションされたAI研究論文
AIエージェントは、短く明確に定義されたタスクを自律的に完了できるようになった。しかし、既存のターミナルベンチマークの多くは、数分で完了し、最終的な結果のみで評価される単純な問題に焦点を当てている。この設定では、中間的な進捗や部分的な解決策が見落とされ、疎な報酬信号とエージェント能力の不完全な評価しか得られない。我々は、実験の再現、ソフトウェア工学、マルチモーダル解析、インタラクティブゲーム、科学計算など、9つのカテゴリにわたる46の長時域タスクからなるターミナルベンチマーク「Long-Horizon-Terminal-Bench」を導入する。各タスクは、参照解やシミュレーションエンジンを備えたTerminal-Benchスタイルの設定に従うが、さらに細分化された段階的な評価用サブタスクに分解される。この設計により、密な中間報酬と部分点が可能となり、エージェントが最終目標に到達するかどうかだけでなく、オープンエンドなワークフロー上でどこまで進捗するかを評価で捉えられる。Long-Horizon-Terminal-Benchのタスクは、典型的には数百のエピソードと数分から数時間の実行時間を必要とし、一回限りの問題解決ではなく、長期的な計画、長いコンテキストの管理、反復的なデバッグに重点を置いている。我々は15の最先端モデルを評価し、エージェントがタスクあたり平均990万トークンを消費し、1回の実行あたり約231エピソード、85.3分の実行時間を要することを発見した。これは、Long-Horizon-Terminal-Benchが従来のターミナルベースのベンチマークよりも要求が厳しいことを示している。最も性能の高いテスト済みモデルでも、部分報酬の閾値0.95でpass@1が15.2%、完全報酬の閾値1.0で10.9%にとどまり、両閾値におけるモデル全体の平均合格率はそれぞれ4.3%と1.7%であった。これらの結果は、改善の余地が大きいことを示している。さらに、失敗モードとエラーパターンを分析し、長時域ターミナルエージェントの今後の進歩を支援するために、Long-Horizon-Terminal-Benchを公開する。
大規模基盤モデルの急速な進歩は、主に大規模なテキストコーパスによる事前学習によって推進されてきた。しかし、多くの知識は視覚的表現を通じて伝達され、図、組版された数式、ページレイアウトなどは、テキストだけでは正確かつ完全に捉えられない豊かな情報を内包している。にもかかわらず、現在の事前学習手法では、文書やウェブページなどの視覚的に豊かな情報源をプレーンテキストに変換することでこれらの視覚的手がかりを捨象し、言語知能の学習を行っている。本論文では、言語モデルはテキストのみの表現で訓練されなければならないというデフォルトの前提に疑問を投げかけ、視覚的事前学習が基盤モデル知能のためのスケーラブルな学習手法であることを示す。この目的のため、我々はテキスト抽出を行わずに視覚的文書を直接活用する、教師なし視覚的事前学習パラダイムの体系的な研究を行う。複数のバックボーンとベンチマークにおいて、同一の基礎コーパスに対する視覚的事前学習は、テキストのみの事前学習を一貫して上回り、スケーラブルな言語知能への効率的な経路を提供する。
次トークン予測によって駆動され、NLPはタスク固有モデルから強力な汎用基盤モデルへと移行した。では、コンピュータビジョンにおいて汎用モデルを実現するための同等の触媒とは何だろうか。本論文では、大規模テキストから動画への生成がコンピュータビジョンにおける強力な事前学習パラダイムとして機能し、汎用的な視覚知能に必要な時空間事前知識、視覚-言語アライメント、およびスケーラビリティを提供すると主張する。我々はGenCeptionを提案する。これは、事前学習された動画生成拡散バックボーンを活用し、テキスト指示によって様々な視覚タスクを実行可能なフィードフォワード認識モデルを定義する。実験結果は、GenCeptionが奥行き、法線、カメラポーズ推定、表現参照セグメンテーション、3Dキーポイント予測など多様なタスクにおいて最先端の性能を達成し、しばしば専門モデル(例:DepthAnything3、SAM3、D4RT、VGGT-Omega、Sapiens、David、Genmo、Lotus-2)に匹敵または凌駕することを示す。さらに、動画生成事前学習バックボーンは、同等設定下で代替事前学習パラダイム(例:V-JEPA、Video MAE)を上回る。重要なことに、GenCeptionはデータおよびモデルのスケーリング特性とともに、優れたデータ効率を示し、D4RTやVGGT-Omegaなどの主要モデルと比較して7~500分の1の訓練データで同等の性能を達成する。最後に、GenCeptionは興味深い創発的行動も示す。合成人間動画のみで訓練されたモデルが実世界の映像や分布外の物体カテゴリ(例:動物やロボット)に一般化する。これらの発見は、動画生成が単なる合成ツールではなく、物理世界における汎用視覚知能への基盤的経路であることを示唆する。プロジェクトページ: https://genception.github.io
大きな目標を一度に達成するのは難しく、小さなステップに分割する方が賢明です。本稿では、信頼領域方策蒸留(TOP-D)を提案します。これは、動的に近接教師を構築することで、不安定性と高分散で有名なオンポリシー蒸留(OPD)を安定した学習パラダイムへと変換します。理論的には、TOP-Dが本質的に勾配分散を制御することを示す厳密な枠組みを確立します。形式的な大域的収束解析と単調改善境界を提供することで、学習ダイナミクス全体の信頼性と安定性を数学的に形式化します。実験的には、TOP-Dは数学的推論タスクにおいて、学習の安定性、サンプル効率、および最終性能を劇的に向上させます。さらに重要なことに、TOP-Dは追加の計算オーバーヘッドを一切導入せず、確立されたOPDパラダイムに対する有望な代替手法として位置づけられます。
学習後量子化(PTQ)は、再学習を必要とせずに大規模言語モデル(LLM)を圧縮するために広く採用されている手法である。GPTQを含む既存の二次のPTQ手法は、量子化目的関数を入力活性化統計量のみから構築しており、事実上すべての出力チャネルが層単位の再構成目的関数に等しく寄与することを仮定している。本稿では、この仮定に疑問を呈し、勾配共分散を量子化パイプラインに導入するPTQフレームワークであるKronQを提案する。クロネッカー分解ヘッセ行列近似の下では、量子化損失は活性化共分散と勾配共分散の両方に共同で依存し、KronQはこれを二つの相補的なレベルで活用する。(1) KronQは双方向インコヒーレンス処理を導入し、既存の入力側ランダム回転を勾配共分散を用いて出力次元に拡張し、入出力両方の次元にわたる重みの大きさの分散を低減する。(2) KronQは、勾配と活性化のヘッセ行列トレースに基づく、層間混合精度割り当てのための新しい感度指標を導出する。特に、LLaMA-3-70Bにおける2ビット重みのみ量子化の場合、GPTQやGPTAQが発散または劣化量子化(WikiText-2上で2000を超えるパープレキシティ)を生じるのに対し、KronQは7.93のパープレキシティを達成する。
大规模文生图模型因其RGB生成预训练学习了丰富的语义、结构与几何先验,成为密集预测任务极具吸引力的骨干网络。现有生成与编辑方法将密集预测转化为目标生成任务以复用这些先验:将深度、法线、α遮罩、分割掩码及热力图等标注信息编码至经RGB训练的VAE潜在空间,再解码为类图像目标。我们认为这继承了比密集预测所需更多的生成式输出接口——与RGB合成不同,密集预测要求在同一图像平面上获得像素级正确的任务原生场,而非渲染新的RGB内容。我们的关键发现是:预训练DiT已通过图像平面上的“补丁→令牌→补丁”格点结构组织RGB输入,因此每个令牌索引一个固定输出补丁,其通道可承载任务原生量而非RGB外观。我们将其实现为ReChannel:保留用于DiT输入分布的VAE编码器,但丢弃目标侧解码器;通过任务LoRA适配冻结的DiT;并通过共享的令牌局部线性头(约33K参数,无空间混合)将每个令牌映射至其对应的p×p×K_t像素空间补丁。基于FLUX-Klein,我们在六项密集预测任务及十余个基准上进行了评估。这一最小化接口在无需三元图的抠图、KITTI深度估计及指代分割上取得了新的最优结果,并在法线、显著性及姿态估计上保持竞争力。在匹配的4B参数设定下,其精度更高,速度比编辑+潜在解码的对应方法快2.48倍——密集感知可从生成预训练中获益,而无需继承其输出接口。
長文脈処理は大規模言語モデル(LLM)にとってますます重要になっているが、単にコンテキストウィンドウを拡張するだけでは長い入力を効果的に活用できるとは限らない。入力長が増大するにつれて精度は低下することが多く、モデルが質問に最も関連する証拠を特定し活用することに依然として困難を抱えていることを示している。長文脈活用を改善する有望な方法としてテスト時訓練(TTT)がある。これはテストコンテキストをインスタンス固有のパラメータ適応のための学習例として扱う手法である。しかし、長文脈全体にTTTを適用するにはコストが法外に高く、一方でランダムにサンプリングされたスパンに適応すると深刻なノイズが生じる。長文脈中のほとんどのスパンは特定の質問に無関係であるため、それらのスパンでの学習はベースモデルの性能を低下させることさえある。予備研究により、TTTは学習スパンの質に非常に敏感であることが明らかになった。LongBench-v2において、ランダムにサンプリングされたスパンでのTTTは性能を損なうが、オラクルスパンでのTTTは大幅に改善する。この知見に基づき、我々は単純な手法である自己誘導型TTT(S-TTT)を提案する。適応前に、モデルが学習すべき証拠スパンを特定し、選択されたスパンに対してのみ標準的な言語モデリング学習目的を適用する。2つの挑戦的な長文脈推論ベンチマーク、LongBench-v2とLongBench-Proにおいて、S-TTTはQwen3-4B-Thinking-2507とLlama-3.1-8B-Instructの両方で精度を向上させ、最大15%の相対的な改善を達成した。
大規模言語モデル(LLM)をファインチューニングして新たな知識を注入する際、重要な課題が存在する。LLMは新しい事実を迅速に記憶できる一方、下流の推論タスクでそれらを活用できないという問題である。本稿ではこの失敗を「知識-利用ギャップ(Knowing-Using Gap)」として形式化する。これは、記憶と汎化の間における精度ギャップと時間的遅れによって特徴づけられる。この現象を理解するため、LLMを未知の知識でファインチューニングし、新たな介入手法「セルフパッチング」を用いて知識の内部での空間的浸透ダイナミクスを監視する。セルフパッチングは、活性化の位置を特定し、その表現を再配置することで失敗した汎化ケースを大幅に改善できる箇所を特定する。これらの結果は、知識回路ミスアライメント仮説(knowledge-circuit misalignment hypothesis)と一致する。すなわち、記憶された表現は内部に存在しうるが、計算に有効な層へ適切にルーティングされない可能性がある。この診断的発見の実用性を示すため、単純なヒューリスティック戦略を設計し、汎化失敗におけるオラクルの性能向上余地の58~75%を回復した。実験はこの発見の頑健性を確認するため、複数領域にわたり実施された。
本研究では、全方位表現が持つ回転等変性の特性—ここでは回転を暗黙的な幾何変換として扱うことができる—を活用することで、パノラマ世界モデルにおける長距離記憶の課題に取り組むことを目的とする。この知見に基づき、我々はPanoWorldを提案する。本手法は、カメラ軌跡を固定された方位に基づく平行移動へと単純化し、密なパノラマ光線条件付け(Dense Panoramic Ray-Conditioning: DPRC)と幾何認識型記憶拡張(Geometry-aware Memory Augmentation: GMA)を通じて、現在の行動モデリングと長距離記憶の両方を実現する。さらに、各コンポーネントを段階的に最適化するための3段階トレーニングパイプラインを導入する。既存のデータセットが比較的安定しているのに対し、大規模な空間変動や多様な照明条件下での物理的一貫性をより適切に評価するため、我々はWorld360を構築した。これは、パノラマ型無人航空機で収集した実世界のビデオクリップと、AirSim360で生成した高品質なシミュレーションクリップの両方から構成される大規模データセットである。World360における広範な実験により、PanoWorldの有効性が示され、他の手法を大幅に上回る性能を達成した。我々のモデル、トレーニングコード、およびデータセットは公開される予定である。詳細についてはプロジェクトページ(https://lihaoy-ux.github.io/panoworld-page/)を参照されたい。
現実的かつ多様な交通シミュレーションは自動運転開発に不可欠である。しかしながら、既存のベンチマークは主に現実性を重視しており、それに従って最近の手法も最適化されているため、多様性は十分に探求されていない。我々は、現実性と多様性を同時に追求するマルチエージェントシミュレータであるFlow-ERDを提案する。その基盤となるAgent-Type Aware Flow Matching(AFM)は、フローマッチングのマルチモーダルな表現力とタイプ固有の運動学的実行を結合する。これにより、各エージェントタイプに一貫した動作を維持しつつ、細粒度の多様性を保持する。第2段階のEntropy-Regularized Distillation(ERD)は、エントロピー正則化された逆KLダイバージェンス目的関数を用いて、閉ループロールアウト分布を微調整する。これにより、共変量シフトを軽減しつつ、高密度モードへの崩壊を明示的に防ぐ。我々は、標準的な現実性スコアとともに、ログフリーの多様性指標を用いてFlow-ERDを評価する。Flow-ERDはWOSACテストベンチマークで首位となり、再現可能なベースラインの中で現実性-多様性のパレートフロントを支配する。プロジェクトページはhttps://seulbinhwang.github.io/flow-erd-project-page/で公開している。
医学は本質的にマルチモーダルであり、臨床医は多様なデータストリームを統合して情報を合成する必要がある。しかし、マルチモーダル基盤モデルの開発は、大規模で高品質な臨床データへのアクセス制限によって制約されている。PubMed Central(PMC)は専門家が執筆した画像テキストデータの補完的な情報源を提供するが、既存のPMC由来リソースは、忠実性、再現性、臨床検証の点で依然として限定的である。本稿では、許諾の得られた文献を医療用マルチモーダルモデルのための高忠実性インフラストラクチャに変換する、自動化された継続的更新可能なフレームワークMedPMCを紹介する。610万のPMC論文に適用し、MedPMCは1100万の医療用画像テキストペアをキュレーションした。構成要素の評価では、初期スクリーニング(F1 = 93.2)、マルチパネル図検出(F1 = 96.5)、図分割(mAP = 89.8)、キャプション分割と整列(F1 = 81.4;ROUGE-L = 85.3)、医療用図分類(F1 = 96.5)において高い性能を示した。5名のアノテーター(うち3名は医学トレーニングを受けた)による手動レビューでは、MedPMC画像の95.3%が医学的に関連性があると判断されたのに対し、以前のPMC由来データセットでは19.7%であった。11の専門分野にわたる26のベンチマークにおいて、MedPMCで訓練されたCLIPスタイルのモデルは、半数未満の画像テキストペアしか使用していないにもかかわらず、最も強力なアーキテクチャ一致の生物医学CLIPベースラインと比較して、平均ゼロショットAUCを7.1パーセントポイント改善した。マルチモーダル大規模言語モデルの視覚エンコーダとして使用した場合、2つのベンチマークにおいて医療用視覚質問応答をそれぞれ1.9および16.9パーセントポイント改善した。イェール・ニューヘブン・ヘルスシステムの10,524件の皮膚科写真において、形態から画像への検索のRecall@5を11.7パーセントポイント改善した。これらの知見は、高忠実性の文献キュレーションが、ベンチマークおよび臨床環境の両方において医療用マルチモーダル基盤モデルを強化することを示している。本フレームワーク、コーパス、ベンチマーク、事前訓練済みモデルを公開する。
音素セグメンテーションと認識は本質的に関連するタスクであるにもかかわらず、現代の手法では通常これらを別々にモデル化している。我々は、音韻構造が自己教師あり音声モデル(S3Ms)の表現にすでに潜在しており、両タスクを解決するためにはモデルを誘導するだけで十分であると主張する。我々はS3Mベースの音韻活性化マッピング(SPAM)を活用する。これは各S3M表現フレームを、有声性や鼻音性などの音韻特徴活性化のベクトルにマッピングするものである。SPAMの上に、我々は2つのシンプルで効果的かつ軽量な勾配降下不要の予測ヘッド(認識ヘッドとセグメンテーションヘッド)を導入する。本手法は1分未満の音声表記を必要とし、訓練時に未学習の音素に対しても汎化する。多様なデータセットにわたって、本アプローチは強力なセグメンテーションおよび認識性能を達成する。
我々は、ドイツ語と英語を対象とした主権的かつオープンソースのMixture-of-Experts(MoE)ハイブリッドMamba Transformer基盤モデル「Soofi S 30B-A3B」を発表する。本モデルはハイブリッド設計により、トークンあたり30Bパラメータのうち3Bのみを活性化し、コンテキストが拡大しても推論キャッシュをほぼ一定に保つため、長コンテキスト・高並列処理におけるスループット面で高密度モデルに対して決定的な優位性を持つ。約27兆トークンで事前学習され、意図的にドイツ語の重みが増されている。Soofi Sは、英語およびドイツ語の総合ベンチマークにおいて、14B~27Bの高密度モデルに匹敵する性能を示し、17のオープンベースモデルの中で両言語におけるコード集計スコアで最高を達成し、さらに比較対象となる欧州のすべての主権的ベースライン(アクティブパラメータがはるかに多いものを含む)を凌駕する。完全オープンモデルの中では、Soofi Sが英語およびドイツ語の評価スコアで最高を記録し、Olmo 3 32BやApertus 70Bを上回る。Soofi Sは、ドイツテレコムがミュンヘンで運営する主権的HPCスケールAIインフラ「German Industrial AI Cloud」上でエンドツーエンドに構築された。Soofi Sは、非常に寛容なオープンアクセス条件で公開される。すなわち、重み、選択された中間チェックポイント、完全なソース別データ計上、ハイパーパラメータ、ならびに学習および評価コードである。ソースライセンスが許す場合、データ構築アーティファクトは寛容なライセンスで公開され、商用ライセンスを受けたソースは集計統計と正確な混合比率の計上とともに文書化される。
視覚言語モデル(VLM)は、3Dデジタル化と自然言語による遺物探索を結び付けることで、対話型デジタルミュージアムの実現性を高めてきた。しかし、古代ギリシャ陶器などの文化遺産分野では、信頼性の高いVLM支援は2つの課題によって制限されている。第一に、自由形式の解釈には、細粒度の2D/3D視覚的証拠を専門的な学芸知識に根拠付ける必要があるが、検索プロセスによって弱い情報源や検証不可能な参照が導入される可能性がある。第二に、利用可能な証拠が不完全、ノイズが多い、または曖昧な場合、VLMは調整された不確実性を示す代わりに、確信を持っているが根拠のない回答を生成することが多い。これらの課題に対処するため、我々はVaseMuseumを提案する。これは、古代ギリシャ陶器のインテリジェントデジタルミュージアムのための軽量かつモジュール型のマルチモーダルエージェントフレームワークである。VaseMuseumは、インタラクティブな仮想ミュージアムとVaseAgentを組み合わせる。VaseAgentは、マルチモーダル認識、3D認識推論、外部知識検索、および推論時の信頼性制御を通じて、2D画像と3D遺物の両方をサポートする。具体的には、VaseAgentは権威あるWebおよび博物館知識ソースから証拠を検索し、情報源レベルの制御によって、生成前に多様で検証可能な証拠を選択する。同時に、応答レベルの制御は、生成された主張を証拠プールに対して検証し、証拠が不十分または矛盾する場合には、中立的でエビデンスに基づいた回答を促す。さらに、学習不要のGRPOスタイル選択メカニズムは、VLMバックボーンを更新することなく、有効な参照と較正された信頼度を持つ応答を優先する。現実的なデジタルミュージアムシミュレーションでの実験により、VaseMuseumは、検索対応VLMベースラインと比較して、引用の妥当性を改善し、知識集約的なクエリにおけるハルシネーションを低減し、曖昧さの下でより中立的な回答を生成することが示された。