翻訳付きの日次キュレーションされたAI研究論文
キミK3を紹介します。これは2.8Tパラメータの混合専門家モデル(MoE)であり、1,040億の活性化パラメータ、ネイティブの視覚機能、および100万トークンのコンテキストウィンドウを備えています。キミK3は、キミ・デルタ・アテンション(KDA)とアテンション・レジデュアルに基づいて構築されており、これらはシーケンス長にわたる情報の流れとモデルの深さを改善します。これに加え、トークンあたり896のルーティング専門家のうち16を効果的に活性化するステーブル・ラテントMoE、および洗練された学習手法とデータレシピにより、これらの進歩はキミK2と比較して全体のスケーリング効率を約2.5倍向上させています。ポストトレーニングでは、一般、エージェント、およびコード領域にわたる強化学習と、複数の推論努力レベルに焦点を当てており、構成的汎化と堅牢な長期実行を可能にしています。2.8Tの規模において、キミK3は複数の分野におけるインフラストラクチャの進歩に支えられています。すなわち、KDAのためのアルゴリズム-システム共同設計、効率的なメモリ管理による完全に均衡のとれたエキスパート並列学習、永続的なロールアウトとサンドボックス状態を用いた100万トークンのエージェント強化学習、そしてデプロイメントの革新です。広範な評価により、キミK3は長期コード作成、エージェント、知識、推論、および視覚タスクにおいてフロンティアレベルの性能を達成しています。その全体的な性能は依然として最も強力なプロプライエタリモデル、すなわちクロード・フェイブル5およびGPT-5.6ソルには劣りますが、キミK3は評価スイート内の他のオープンモデルおよびプロプライエタリモデルを一貫して上回っています。将来の研究を促進し、フロンティア知能のより広範な展開と普及を加速するために、キミK3の全モデル重みを公開します。
クリエイティブAIは、単一工程のアセット生成から長期的なマルチモーダル制作へと移行しつつある。近年の生成モデルは高品質な画像、動画、音声クリップ、UI要素、ストーリーボード、スライド、その他のクリエイティブアセットを合成できるが、現実のクリエイティブ作業は孤立したプロンプトと出力のやりとりだけでは完結しない。そこには参照、下書き、代替案、編集、失敗例、バージョン間の関係、ツール操作、評価シグナル、人間からのフィードバックが含まれ、これらが全体として進化するプロジェクト状態を形成する。既存のプロンプトベース、チャットベース、ノードベースの生成システムは、中間コンテキストを破棄したり、直線的な会話に依存したり、手動でワークフローを指定する必要があったりと、この状態を部分的にしかサポートしていない。最近の商用システムはエージェント支援型のクリエイティブ制作へのシフトを示しているが、その閉じたアーキテクチャのため、エージェントがどのようにコンテキストを表現し、ツールを選択し、アーティファクトを修正し、障害から回復し、時間をかけて一貫性を維持するかを研究することが困難である。このギャップを埋めるために、我々はJarvisHubを紹介する。これは長期的なマルチモーダル制作のためのキャンバスネイティブなクリエイティブエージェントハーネスである。JarvisHubは編集可能なキャンバスをユーザーのワークスペース、エージェントの外部記憶、行動空間、共有プロジェクト状態として扱い、マルチモーダルアーティファクト、依存関係、バージョン、フィードバックを型付きのキャンバスノードとリンクとして表現する。キャンバス状態、プロトコルブリッジ、エージェントランタイムの3層アーキテクチャにより、JarvisHubはエージェントが検査可能かつ編集可能なクリエイティブ状態の中で行動することを可能にする。この設計はクリエイティブエージェントを孤立したツール使用から、持続的かつ人間が操縦可能なクリエイティブ自動化へと押し上げる。ここでエージェントはマルチモーダルプロジェクトを段階的に計画、生成、修正、整理できる一方、ユーザーはプロセス全体を通じて検査、指導、介入することができる。
ロボット学習は、大規模な行動空間を持つ動的環境で行われる。終端成功信号は、タスクが完了したかどうかのみをロボットに伝える。現在の行動が進展しているのか、変化がないのか、あるいは以前の進展を台無しにしているのかについては説明しない。このため、近年の研究では、タスク実行中にフィードバックを提供する進捗報酬(progress rewards)がますます探求されている。しかし、現在の文献には共通の枠組みが欠如している。既存の手法は、異なる観測、目標仕様、出力信号、教師信号のソース、評価プロトコルを使用している。そのため、それらを比較し、結果が実際に何を検証しているのかを理解することが困難になっている。本サーベイでは、ロボット学習のための進捗報酬モデリングに関する統一的な視点を提供する。この分野を三つの相互に関連するステップで整理する。まず、進捗モデルのインターフェースを検討する。これは、モデルがどのような情報を受け取り、どのような形式の進捗信号を生成するのかを問うことで、外部から問題を定義する。次に、モデルの内部に進み、この信号を構築するために用いられる手法を研究する。これにより、進捗推定と報酬生成の背後にある異なる仮定やメカニズムが明らかになる。最後に、これらの手法を支えるデータとベンチマークを精査する。これにより、進捗の教師信号がどのように得られ、異なる評価が実際に何を測定しているのかが示される。これらの三つの視点を合わせることで、進捗モデルとは何か、どのように構築されるか、その品質がどのように検証されるかが結びつく。さらに、現在のアプローチの主な限界をまとめ、将来の研究の方向性について議論する。
エージェント的検索は、大規模言語モデルがマルチステップ推論と検索を交互に行うことで知識集約型タスクを解決することを可能にするが、これを結果ベースの強化学習で最適化すると疎な監督信号しか得られない。知識蒸留により密なガイダンスを提供でき、強力な推論能力を持つ高度なプロプライエタリモデルは有望な教師となる。プロプライエタリモデルからの蒸留はこの監督信号を密にできるが、従来のロジットマッチングは隠されたロジットやトークナイザの不一致により不可能であり、生の自然言語軌跡の模倣は核となる推論能力ではなく表面的なスタイル的アーティファクトを転移させる。この異種蒸留問題に対処し分布ギャップを埋めるために、我々はマルチエージェントプロトコル蒸留(MAPD)を提案する。これは結合蒸留・RLフレームワークであり、構造化されスタイル正規化されたプロトコルを中間表現として使用する。オフラインのマルチエージェントシステム(MAS)が各クエリを分解し、証拠を検索し、失敗した検索を修復し、結果として得られる探索軌跡を、タスクタイプ、推論計画、抽出型根拠事実を含むJSONプロトコルに変換する。訓練中、このプロトコルは学生ポリシーの特権ブランチにのみ提供され、そのトークン分布は疎なRL目標とともに密な蒸留信号を与える。7つのQAベンチマークにわたる広範な評価により、MAPDが競合する蒸留およびRL手法を一貫して上回り、Qwen3-1.7Bでは平均成功率39.4%、Qwen3-4Bでは44.4%を達成することが示された。さらに重要なのは、このフレームワークが多様なプロプライエタリ教師に対して頑健に汎化し、学生ポリシーのスタイルドリフトや冗長性劣化を効果的に抑制する点である。
オン・ポリシー蒸留(OPD)は、現在の生徒モデルが生成する軌跡に沿って教師モデルを照会することにより拡散モデルを適応させる手法であるが、現代の拡散システムのデフォルト構成要素である分類器不要ガイダンス(CFG)の下でどのように動作すべきかについては、未解明の部分が多い。既存のOPD手法は、速度マッチングをCFG合成予測に自然に拡張し、教師と生徒のガイド付き速度を直接一致させる。我々は、この目的関数がブランチレベルで未同定性を持つことを示す。すなわち、正ブランチ誤差と負ブランチ誤差がガイド付き予測において相殺し合う可能性がある。二つの対照的なケースを通じて、単純なマッチングが共有負条件付けの下では有効であり、両ブランチの誤差が共同で減少することを見出した。しかし、モデルの本来のCFGスキームが教師の負ブランチに生徒が利用できない特権情報を保持している場合、この共同減少は崩壊し、合成目的関数は敵対的なブランチ誤差ダイナミクスを誘発し、正ブランチ誤差を減少させる一方で負ブランチ誤差を増大させる。我々はこの故障モードをNegative Branch Asymmetry(NBA)と名付ける。NBAに対処するため、正予測とCFG条件方向を別々に制約するブランチ認識型OPD目的関数であるPositive-Direction Matching(PDM)を導入する。我々はPDMを密から疎へのビデオ制御に適用する。このタスクでは、単純なガイド付きマッチングが推論ガイダンス尺度に非常に敏感である一方、ブランチ認識型の監督はより頑健で効果的な知識伝達を可能にする。
コンピュータ利用エージェントは通常、知覚能力の強化によって改善される。すなわち、スクリーンショットの読み取りとクリックすべき位置の選択において、より優れたモデルを用いることで向上する。しかし、スクリーンショットは基盤となるプログラム状態(例えば、タスクデータを保持するファイル、アプリケーションバックエンド、DOMなど)の非可逆なレンダリングにすぎない。異なる状態が同一のピクセルを生成し得る一方で、コードはその状態を直接検査・変更できる。StateActは、この区別に基づいて構築されたコードファーストのマルチエージェントハーネスである。そのメインエージェントはコードを用いてプログラム状態と直接連携し、専用のGUIサブエージェントは、スクリーンショットとクリックによる操作を必要とする少数のサブゴール(108タスク中28タスク、メインエージェントのステップ数全体の1.1%)に対してのみ処理を担当する。プログラム状態への直接アクセスは検証も支援する。独立した終了ゲートが、保存された結果に対して構造的な失敗(例えば、出力の欠落、未保存、誤ったパスへの書き込みなど)を二重チェックする。数百ステップにわたって軌道を維持するため、メインエージェントはサブゴールを新たなサブエージェントに委譲し、自身のコンテキストを集中させる。OSWorld 2.0において、StateActはClaude Opus 4.8のバイナリ成功を20.6%から26.9%に、部分成功を54.8%から61.6%に引き上げ、同じモデルをスクリーンショットのみで駆動した場合と比較してタスクあたり約9分の1のコストを実現する。一方、GUIサブエージェントを持たないコードのみの変種は部分成功が45.9%にとどまり、スクリーンショットベースのベースライン(54.8%)を下回る。一般に、アクション、検証、および記憶を状態に基づかせること(我々が状態グラウンディングと呼ぶもの)は、主たるボトルネックを知覚から推論へと移行させる。すなわち、失敗はエージェントが見ているものよりも、考えているものに依存するのである。
マルチモーダル基盤モデルは、インターネット全体を消費することで「見る」ことと「話す」ことを学習した。身体化エージェントにはそのような近道は存在しない。なぜなら、観測と物理状態および行動を結びつけるデータが必要だからである。これらの信号は、複数のデータソースによって様々な程度で提供されうる。本稿では、身体化データエコシステムを、5つの相補的なソース(実ロボットデータ、UMI形式データ、自己中心的および外部視点データ、シミュレーションデータ、汎用視覚言語データ)にわたる「ピラミッド」として整理する。このピラミッドを、スケーラビリティとロボット適応との間の緊張関係を中心に構成し、各ソースをデータ品質、多様性、再利用可能性、物理的忠実性の観点からさらに特徴づける。次に、近年の身体化基盤モデルをそのデータレシピの観点から分析し、事前学習中に異なるソースがどのように選択、調整、混合されるかを検討する。身体化脳モデル、視覚言語行動モデル、世界行動モデルのいずれにおいても、データ構成と知覚、推論、計画、行動生成、世界予測における能力との関連を考察する。最後に、6つの未解決課題、すなわち大規模触覚データセットの構築、失敗と回復データの収集、スケーラブルなデータ収集パイプラインの開発、身体化間での行動の調整、自己中心データを活用した巧みな操作、ロボット学習のための原理的なデータレシピの設計について議論する。本稿が次世代身体化システム設計の基盤を築くことを願っている。
拡散トランスフォーマーは高忠実度の動画生成に不可欠であるが、長いトークン系列によりアテンションが推論の支配的なボトルネックとなる。学習不要の動的スパースアテンションは、選択されたキー・バリューブロックのみを計算することでこのボトルネックを緩和するが、既存手法では以下の2つの理由からアテンションを効率的かつ正確にスパース化することが困難である。(1) 硬直的で予測不可能かつコストのかかるルーティング:プロキシスコアによる上位ランクのブロックを固定割合で選択すると固定予算が課されるのに対し、累積プロキシ確率質量が目標に達するまでブロックを保持すると動的だが不均衡な予算が生じる。いずれもプロキシスコアの計算と具体化に無視できないオーバーヘッドが発生する。(2) 損失を伴う保持・破棄のスパース化:選択されなかったブロックは完全に破棄され、積極的なスパース性の下で精度が低下する。これらの制約から、より低コストな動的予算ルーティングと精度低下の制限が動機となる。本論文では、学習不要のSol-Attn(オンラインアテンションのスパース化)を導入する。これは動的ルーティング、スパース計算、近似補正を単一のオンラインソフトマックスパスに統合し、スパースアテンションにおける精度と効率のより良いトレードオフを実現する。Sol-Attnの中核は、プロキシスコア再利用を伴うオン・ザ・フライのブロックしきい値処理であり、オンラインソフトマックス中にブロックプロキシスコアをしきい値と比較して重要なブロックを選択する。この設計により、プロキシマップを具体化することなく動的で制御可能なブロック予算を実現し、選択されなかったブロックのプロキシスコアを直接再利用してその寄与を近似する。画像・動画生成タスクにおける実験により、Sol-Attnが学習不要のスパースアテンションの品質・効率フロンティアを前進させ、動画生成と編集においてそれぞれ2.1倍および2.3倍のエンドツーエンド高速化を視覚品質を維持しながら実現することを示す。
近年の生成モデルは、無音映像や単独の音声合成から、同期した音声と映像の同時生成へと進化している。この進展にもかかわらず、音声と映像の基本的な構造的差異から、微細なクロスモーダル対応を伴う同時生成は依然として困難である。既存の手法のほとんどは、音声用と映像用のVAEを別々に学習する。その結果、二つの潜在空間はクロスモーダルアライメントが不足し、ダウンストリームの生成モデルはゼロからクロスモーダル同期を学習せざるを得なくなる。我々は、音声と映像の潜在表現間の微細な意味的アライメントを学習する、共同学習された音声-映像VAEであるOmniVAEを提案する。再構成に加えて、OmniVAEはセグメントレベルの音声-映像対照的目的関数を用いて、時間的・意味的対応関係を捉え、二つの潜在空間を整列させる。これと並行して、事前学習されたモダリティ固有の意味エンコーダから各モダリティへ特徴を蒸留し、両方の潜在空間のダウンストリーム学習可能性を向上させる。広範な実験により、両目的関数が一貫して潜在空間の学習可能性を改善し、ダウンストリームのテキストから音声・映像への生成において、高い生成品質とより正確なクロスモーダル同期をもたらすことが示された。これらの知見は、オムニモーダルモデリングの基盤として統一表現を学習することの重要性を強調している。
我々は、任意アイテムのバーチャル試着のための統合基盤モデル「Oxygen-TryOn」を提案する。汎用画像編集ツールを流用するのではなく、Oxygen-TryOnはファッションに特化したネイティブなモデルであり、専用のデータエンジンと試着特化の学習により構築されている。一枚または複数の参照アイテム(清潔な商品画像または実環境での着用写真)と、単一の対象人物画像を入力として、ほぼあらゆるファッションカテゴリにおいて、対象者がそのアイテムを着用したフォトリアリスティックな画像を合成する。従来のシステムは、スタジオ環境で単一の衣料カテゴリを扱うものであり、最近のマルチ参照手法も依然として衣料中心である。対照的にOxygen-TryOnは、全身・半身ビュー、可変数の参照、自由なマルチアイテム合成を含む多様なアイテムとシナリオをサポートし、対象者のアイデンティティとアイテムの外観の両方を忠実に保持する。マスクベースのインペインティングではなく、試着をマルチ参照・理解駆動型の生成タスクとして再定義する。我々は、高品質な試着データを大規模に収集・生成・アノテーション・フィルタリングするデータエンジンを構築し、継続事前学習(CPT)、教師ありファインチューニング(SFT)、強化学習(RL)の3段階のレシピを設計する。RL段階では、社内の試着リワードモデルと、独自のルーブリックに基づく汎用モデルを組み合わせたハイブリッドリワードを用い、細粒度の一貫性と指示レベルの品質を共同で監視する。また、同じパスで一般的な編集指示(ポーズ変更など)にも従う。公開ベンチマークおよび社内のOxygen-TryOn Benchにおいて、単一アイテム試着で最先端の一貫性と写実性を達成し、マルチアイテム試着でもリードしており、主要なプロプライエタリシステム(Nano Banana Pro、GPT-Image-2、Seedream5 Lite)およびオープンソースモデル(FLUX.2)に匹敵または凌駕する。
マルチターン長期計画は基盤モデルエージェントにとって重要であるが、その根本的な改善方法は依然として不明確である。既存のモデルは制御不能で不透明なインターネットデータで訓練されており、計画能力がどのように獲得され、形成され、統合されるかを特定することは困難である。この課題に対処するため、我々は統一された制御可能なマルチターン環境を導入し、精密な制御を可能にする。これにより、以下の三つの段階にわたって長期計画を体系的に研究できる。(1) 事前学習における計画能力の獲得。データ形式、分布、品質を研究する。CoT状態遷移モデリングによる明示的な世界モデルの構築は、より強力な長期汎化をもたらす。原子的スキルだけでは構成汎化に不十分であり、少量の長期計画データが有効である。さらに、準最適な軌道は、長期的な誤差の増幅により性能を著しく損なう。(2) GRPOおよびOPDによる事後学習における計画能力の形成。相互情報量を通じて、一般的な計画パターンとタスク固有の計画知識を区別する。計画パターンについて、事後学習の三つの適用領域(不要、有効、非対応)を特定する。OPDは、低品質および長期間の設定においてGRPOよりも広い有効領域を持ち、より一貫した更新方向を提供する。計画知識については、異なる知識を持つ教師から未観測の手順を蒸留すると、新しい知識を完全に確立せずに生徒の既存の世界モデルを損なう可能性がある。(3) MOPD事後学習による計画能力の統合。マルチ教師オンポリシー蒸留(MOPD)は、環境間で共有される計画パターンに収束することで能力を統合することを示す。互換性のあるパターンは環境間汎化を可能にし、部分的に共有されたパターンは継続学習を支援するが、完全に競合するパターンは深刻な干渉を引き起こす。
本研究では、高次元の視覚表現を離散化し、言語モデルとの橋渡しを図ることを目的とする。これは容易ではない課題であり、既存の量子化手法はコードブック崩壊を起こし、意味的一貫性を保ちながらスケーラビリティを実現できない。その根本原因は計量の不一致にある。すなわち、標準的なユークリッド空間上のコードブック目的関数は、表現空間の異方性幾何学と根本的に適合せず、その結果、コードブック埋め込みは分散の大きいマグニチュードスケールと不均一な角度分布を持ち、スケーラビリティを妨げる。この問題に対処するため、我々は超球面量子化(HSQ)を提案する。これは、角度に基づくルーティングによって意味内容と特徴量の大きさを分離し、コード割り当てが意味ではなくスケールに支配されるのを防ぐ。得られた離散表現オートエンコーダ(dRAE)は、高い忠実度で再構成を実現しつつ、意味的完全性を維持し、スケーラブルなコードブック予算をサポートする。広範な実験により、語彙サイズが131,072にスケールするにつれて一貫した性能向上が示され、加えて100%のコードブック利用率、簡素化された訓練パイプライン、理解および生成タスクにおける強力な性能が確認された。
マルチモーダル大規模言語モデル(MLLM)は臨床実践に革命をもたらす計り知れない可能性を秘めているが、医療領域への展開は根本的に視覚中心の課題である。すなわち、モデルは異種の2Dおよび3D医用画像から知識を吸収しなければならず、評価プロトコルは放射線科医の臨床実践と整合し、正確かつきめ細かく事実性に基づく評価を提供しなければならない。本稿では、これらの制限を体系的に解決する、総合的な医用理解のために設計された視覚中心のMLLMであるClinFusionを紹介する。我々は、カスケード空間認識局所性融合演算子を特徴とする構成可能でカスケード型の視覚エンコーダアーキテクチャを提案する。この演算子は、多様な2Dおよびネイティブ3D医用画像理解を融合エンコーダ内で統合する。さらに、指示追従評価のためのMedIF-Benchと、臨床的に整合し事実性に基づくレポート生成評価のための関心領域に基づく手法を含む、視覚に基づく評価フレームワークを導入する。ClinFusionは、視覚的質問応答、レポート生成、指示追従にわたる2Dおよび3Dマルチモーダル医療ベンチマークの包括的なスイート、ならびにテキスト医療タスクにおいて新たな最先端を達成し、24ベンチマーク中20で主要なオープンソース医療MLLM(例:Hulu-Med、Lingshu)を上回り、16ベンチマーク中13でGPT-5.2やGemini-3-Flashなどの強力なプロプライエタリモデルよりも優れたマルチモーダル能力を示すことを実証する。さらに、検索拡張型およびツール支援型の臨床ワークフロー向けに、エージェント的ツール使用によって拡張可能である。認定放射線科医による盲検評価により、ClinFusionが最も高評価のレポートを生成することが確認され、我々のRoIに基づく指標が、検討されたすべての自動評価指標の中で専門家の判断との最も強い相関を達成することが検証された。
大規模推論モデル(LRMs)は、最終回答を生成する前に長い推論過程を生成する。この推論過程には幻覚検出に有用な信号が含まれている可能性があるが、長い軌跡には真偽評価に関連する手がかりを不明瞭にするノイズのあるステップがしばしば含まれるため、これを活用することは容易ではない。本論文では、二つの一般的な推論ノイズの形態、すなわち無関係なステップと反復的なステップを特定し、これらの両方が幻覚検出性能を著しく低下させることを示す。既存の信頼度に基づくスコアや単純な埋め込みベースのフィルタリングでは、ノイズのあるステップと情報のあるステップを確実に分離できない。この課題に対処するため、我々は幻覚検出のための推論過程のノイズ除去を行う新たな学習フレームワークREDEを提案する。具体的には、REDEは最終回答の注意重みを自動的な教師信号として活用し、ステップレベルの表現空間を形成することで、ノイズのあるステップを確実に識別・フィルタリングできる改良された埋め込みを生成する。REDEは、ノイズのあるステップを除去したフィルタリング済み推論軌跡に対して動作することにより、多様な幻覚検出器に容易に組み込むことができる。複数の推論ベンチマークにおける広範な実験により、REDEが競争力のあるベースラインと比較して一貫して検出性能を向上させることを示す。
LLM-as-a-judge(LLMを判定者とする手法)は自動評価の標準となっているが、高コスト、大きな遅延、不透明な判断といった問題を抱えており、これらの限界がそのスケーラビリティと信頼性を損なっている。我々はこれらの問題に対して、シンプルかつ効率的な代替手法であるプログラム蒸留(program distillation)を提案する。評価時にLLMにプロンプトを与える代わりに、その判定ロジックを、候補を直接スコアリングするプログラムの委員会(committee)へと蒸留する。これらのプログラム的判定者は透明性を提供し、容易に検査・編集可能であり、サンプルごとのAPIコストを排除する。この概念に基づき、我々はPAJAMAを導入する。これは、プログラムを判定者として合成し、それらの判断を統合して共同判定を下し、低信頼度のケースを選択的にLLMにエスカレーションするフォールバック機構を組み込んだシステムである。5つのデータセットと4つのモデルファミリーにわたって、プログラム的判定者が13BサイズのLLM判定者と同等の性能を達成できることを示す。プログラム出力をルーティング信号として使用する場合、PAJAMAは精度とスループットの両方を向上させ、パレートフロンティアを前進させる。評価を超えて、プログラム的判定者は安価で効果的な報酬信号を生成する。RewardBenchにおいて、プログラムの判定から蒸留された報酬モデルは、プロプライエタリなLLMのラベルで訓練されたモデルよりも2桁低いAPIコストで優れた性能を示す。
視覚言語モデル(VLM)のデータキュレーションはますます活発化しているが、事前学習用混合データを構築するための公開された実践は依然としてほとんどヒューリスティックである。実務者は品質フィルタを通過したデータセットを積み上げ、直感に基づいてクロスドメイン比率を設定し、新規データを受け入れるための原則的かつ帰属可能な基準を欠いており、最先端の手法は非公開のままである。本稿では、データ構築を系統的な混合最適化問題として定式化し、混合を能力間のクラス間比率とカテゴリ内のクラス内比率という直交する二つの部分問題に分解することで、再現可能な工学的アプローチへと転換する。クラス間配分には単一変数の反復探索を用い、クラス内構成には多次元のデータセットレベル評価(品質と難易度をスコア化)を適用し、選択を多様性目標を伴う制約付き凸最適化として定式化する。DecoupleMixフレームワークは、次に収集すべきデータを導出する能力と、データセットの検証を制御可能かつ帰属可能な実験とする能力という二つの重要な機能を提供する。実験により、我々のアプローチがヒューリスティックなベースラインを一貫して凌ぐことが示される。さらに、小規模プロキシで発見された最適比率は、再調整なしで大規模にシームレスに転移可能である。80Bの追加マルチモーダル継続事前学習トークンを用いた我々のVLMは、はるかに大規模なマルチモーダル予算で学習された強力なオープンソースモデルと競合する。
動画生成の進歩により、AI生成映像とプロが制作した映像との視覚的ギャップは縮まり続けているが、現在のベンチマークのほとんどは依然としてWebソースやLLMテンプレートからプロンプトを抽出し、訓練されていない汎用のマルチモーダルモデルでスコアリングしている。より根本的には、その評価分類法は初歩的(全体的な視覚品質、大まかなテキストとの整合性、時間的滑らかさ)であり、実際に映画が制作・判断されるプロフェッショナルな映画言語の基準に基づいていないため、映画品質の技巧ではなく、基本的な動画の妥当性を評価している。そこで我々は、映画アカデミー伝統のプロフェッショナルな映画言語に基づき、北京電影学院および華景デジタルメディア&エンターテインメントグループ映画スタジオの監督・教員と共同開発した、テキストから動画へ(T2V)および参照から動画へ(R2V)のベンチマーク「FilmBench」を導入する。このベンチマークは3つの選択に基づいている。第一に、プロンプトはプロの監督が選んだ20の映画ジャンルにわたる受賞作品のクリップからリバースエンジニアリングされており、各プロンプトは検証済みの実写参照映像に紐づけられている。プロンプトは実際のショットリストに従い、大多数が複数ショット(1,169のプロンプト中1,056がマルチショット)であり、従来の単一クリップのベンチマークとは異なる。第二に、評価は3軸、12要素、35(T2V)+3(R2Vのみ)のサブメトリクスからなる3段階の映画分類法に従う。第三に、社内の専門家グレードの自動評価エージェントを開発し、その中核となる映画言語オペレーター群(FilmOps)をオープンソース化する。主要な動画生成モデル(T2V用9、R2V用7)をベンチマークしたところ、評価器はモデルレベルのスピアマンρ = 0.95(T2V)、0.96(R2V)で人間のモデルランキングを再現した。スコアは従来のWebスタイルのベンチマークを大きく下回り、動的美学における一貫したギャップと、単一ショットから複数ショットへの顕著な性能低下が見られ、その低下は弱いモデルほど大きい。
今日、言語モデルを改善するということは、再訓練を意味する。膨大な計算資源、サイクルごとに新たな不透明なモデル、非決定論的な出力である。我々は逆の経路をとる。モデルは凍結されたままで、検証済みの解の永続的なメモリがその横で成長する。問題ファミリーが解かれ、解答鍵を一切参照しない独立した検証ステップを通過すると、そのファミリーのすべての新しいインスタンスはゼロ生成トークンで、ビット正確に、決定論的に回答される。9つの問題ファミリーにわたる180の新しいインスタンス全体で、4ベンダーからの4つのアーキテクチャ(高密度モデルおよび混合専門家モデル)がいずれも、回答あたりゼロ生成トークンで180/180のスコアを達成した。これは、パラメータスケーリングから切り離された実行限界能力である。ネガティブコントロールは、その能力が完全にメモリに帰属することを示す。メモリを空にすると、何も解けなくなる。同じ検証後保存の契約は、オープンエンド推論にも当てはまる。4モデルすべてで88/88の一貫性ゲート付き受理、機械検証された形式的証明、および77/80の推論手法の転送である。メモリ選択には1.4マイクロ秒かかり、完全な再利用は36mWhで6~23ミリ秒で完了する。4,500項目の検証済みストアにおいて、近似類似性検索は94.3%の確率で誤った項目を選択する一方、正確なアドレッシングではエラーはゼロである。このストアはまた、出荷されたどのエンジンも匹敵しないスケールで動作コンテキストとして機能する。単一の46GB GPU上でフラットメモリによる600万トークンの移動可能ウィンドウを実現し、vLLMは30,399トークンで停止し、SGLangは32,000を超えると静かにトランケートする。公開ベンチマークでは、フロンティアモデルは生のスクラッチ推論において任意の12Bモデルよりもはるかに優れている。しかし、本システムが解決し検証したすべての課題においては比較が逆転する。フロンティアAPI呼び出しは、あらゆるクエリに対して毎回新たな生成パスを支払い続けるのに対し、検証済みの再利用はトークンコストゼロで、毎回同一のビット列を返す。本レポートには、無料でレート制限付きアクセス可能な公開テストベンチが付随する:https://corbenic-galahad-bench.hf.space
人間の頭部のパラメトリックモデルは、伝統的にコンピュータビジョンやグラフィックスにおいてアニメーション、レンダリング、再構成に用いられる必須ツールである。近年では、生成的大規模ビジョンモデルにおいて、生成画像の空間的制御を強固に行うための重要な条件付け信号としても機能している。しかし、既存の公開モデルは解剖学的な範囲が限定されていることが一般的であり、外側の形状のみをモデル化する一方で、口腔内や眼球の構造を無視しており、さらに忠実度の低い入力データセットに起因する幾何学的品質の低下を頻繁に伴う。本報告書では、ヒトゲノムの同音異義語として命名された、Generative aNthropometric Model(GNM)と呼ぶ新たなパラメトリックモデルを紹介する。GNMは頭部、顔、首、眼球、歯、舌を網羅し、高品質なアーティスト作成の解剖学的サンプルと組み合わせた高解像度3Dスキャンの広範なデータベースに基づいて構築されている。本報告書では、データの出典、眼球構造および口腔内構造のための特化サブモデルを含むモデルアーキテクチャを詳述し、対象となる3D顔スキャンへのフィッティングにおける最先端の性能を示す。コミュニティのイノベーションを促進するため、GNMフレームワークの完全版は公開されている。
歴史文書は貴重な知識の宝庫であるが、物理的な劣化や損傷により判読不能になることが多い。既存のマスク言語モデリングに基づく修復手法は局所的な文脈を効果的に利用するものの、外部の歴史的知識を必要とする固有表現の修復には困難を伴う。この制限に対処するため、我々は検索拡張生成(RAG)を用いた大規模言語モデルを活用する歴史文書修復のための新しい枠組みを紹介する。事前学習済みLLMの暗黙的知識と明示的に検索された外部文脈を組み合わせることで、我々のモデルARIは文脈依存の固有名詞を推論するという課題を効果的に軽減する。韓国歴史文書に関する広範な実験により、我々の手法がベースラインを大幅に上回り、一般文字と固有表現の両方の修復において顕著な改善を達成することが示された。さらに、専門家による評価を含む包括的な評価により、ARIが領域専門家にとって実用的なツールとして機能し、歴史記録の分析を加速することが期待されることが確認された。
我々は、1つ以上のエージェントから構築される自動研究システムの設計上の選択を記述・比較しやすくするための語彙を導入する。この語彙は、1) エージェントの正体、2) システムで利用可能な操作、3) それらの操作を呼び出せる主体、4) エージェント間の通信方法、5) 実行内および実行間で可視な情報、6) 次のアクションの選択方法、7) 実行の開始方法、8) 出力の評価方法を指定する。軌跡(trajectory)は、入力タスクから返却される成果物までの1回の実行を記録する。エージェント、操作、初期化は確率的である可能性があるため、同一タスクに対する繰り返し実行は単一の挙動ではなく、軌跡上の分布を生じさせる。 我々の語彙は、エージェント間の通信タイミング、能力の獲得・喪失、実行間での情報伝達といった構造的な設計上の問いを、検証可能な選択へと変換する。また、報告される改善度は代理スコアが真の品質にどれだけ近いかに依存するため、評価器(evaluator)をシステムの構成要素とする。この分離により、これらのシステムには「味覚(taste)」が欠けているという曖昧な批判が、異なる解決策を要する2つの失敗に分割される。生成的味覚(generative taste)とは、スコアが観測される前にシステムが新奇な軌跡を提案する割合であり、評価的味覚(evaluative taste)とは、代理スコアとそれが一致すべき品質との間のギャップである。我々はこの語彙を最近の自動研究システムに適用し、構造が大きく異なる設計を網羅できることを示す。
信頼性の高い文書視覚理解には、モデルが各回答をそれを支える証拠領域に帰属させることが求められる。近年のベンチマークやシステムでは、このステップを座標インターフェース(モデルが文書内の証拠領域を示すバウンディングボックスの座標を出力する)で表現する。このインターフェースの下では、視覚言語モデルは回答が正しい場合でも適切な領域を特定できずに失敗することが多く、これは「帰属幻覚(Attribution Hallucination)」として知られる。本研究では、この失敗が、モデルが座標を通じて表現できる範囲に部分的に制限されているかどうかを調査する。検証済みのバイリンガルCiteVQAサブセット上で、座標インターフェースと、モデルがテキストのみを出力し証拠を逐語的に引用する言語インターフェース(マルチモーダル検索器が各引用の位置を、レイアウト解析器が提案するページ領域として返す。表や図はキャプションや注釈を通じて引用される)とを比較し、この比較を6つのオープンソース視覚言語モデルで繰り返した。座標インターフェースと比較して、証拠再現率は最大8ポイントから26~47に上昇し、幻覚率はほぼ半減し、回答品質にはほとんど変化が見られなかった。この比較に基づき、同じ引用・検索パイプラインをトレーニングの足場として利用する:長文書に対する領域レベルの証拠ラベルは収集にコストがかかるため、報酬がゴールド回答と検索領域のクロップに対する評価者の判定であるGRPOレシピを導入し、領域ラベルなしでモデルがより良い証拠を引用するよう訓練し、8Bバックボーンの厳格な帰属精度を22.4から33.8に向上させた。これらの知見は、座標インターフェースや高コストな領域レベルの監督なしに帰属を改善する実用的な道筋を示している。
大規模言語モデル(LLMs)は対話型AIを変革したが、高品質な多言語コードミックス対話リソースは依然として不足しており、特に話者が原語表記とローマ字表記の両方で自然に英語と母語を切り替えるインド系言語では顕著である。本稿では、9つのインド系言語にわたる18の言語変種において、132万8604件以上のイベント基盤マルチターン対話からなる、最大級の多言語インド系コードミックス対話コーパスであるIndicTalkを紹介する。このコーパスは、実世界のニュース基盤、多言語LLMを用いたペルソナ条件付き対話生成、および自動品質検証を組み合わせた完全自動化パイプラインによって生成される。広範な言語学的評価、自動評価、人間による評価により、IndicTalkが両方の表記変種において流暢で一貫性があり自然なコードミックス対話を生成することが示された。IndicTalkを公開し、過小評価されているインド系言語向けの多言語対話型AIの開発と評価を支援する。データセットは https://huggingface.co/datasets/LingoIITGN/IndicTalk で入手可能である。
大規模視覚言語モデル(LVLMs)は、その膨大な計算フットプリントに制約され、リソース制約のあるエッジデバイスへの展開が困難となっている。LVLMsを圧縮する取り組みは主に視覚トークンの削減や小規模言語モデルに集中しており、視覚エンコーダは概して見落とされ、通常はモノリシックで計算負荷の高い特徴抽出器として展開されている。さらに、デバイス上のレイテンシに直接最適化されたLVLMs向け視覚エンコーダを設計する試みはこれまで存在しない。本稿では、デバイス上の性能向けに明示的に設計・最適化されたLVLMs用視覚エンコーダ、UltraViTを提案する。具体的には、実際のデバイス上のレイテンシを考慮し、マクロブロックレベルで異種空間混合器を戦略的に統合・適応させるピラミッド型アーキテクチャを体系的に設計する。さらに、UltraViTを事前学習するために、新規な2段階生成事前学習戦略を提案する。すなわち、密な蒸留による豊かな空間特徴の育成と、それに続く容量混合型凍結LLMからの直接的な生成教師あり学習である。標準的な対照学習や自己教師あり学習と比較して、本事前学習は、その後のLVLM訓練における生成的多モーダルアライメントに必要な高レベル意味基盤をUltraViTに獲得させる上で、はるかに効果的であることを示す。広範な実験により、デバイス上のレイテンシを考慮した設計と、これに合わせた訓練戦略の組み合わせが、効率的なLVLMエンコーディングにおいて新たな最先端を確立し、既存のエンコーダ中心のベースラインを大幅に上回ると同時に、デバイス上で約1.7倍の速度で動作することを実証する。
パラメトリック検索により、LLMは各APIに固有の仮想トークンを割り当て、モデルに制約付きビーム探索でそれを生成するよう訓練することで、ツールを暗黙的に検索できるようになる。ToolSenseは、この手法に2つの重大な欠点があることを示している。すなわち、訓練中にパラメトリックなツール知識が破壊されることと、ビーム探索によるデコードがリアルタイム展開には遅すぎることである。我々は、この乖離を解決する2段階カリキュラムであるTRACE(拡張思考連鎖とエンタープライズルールによるツール検索)を導入する。第1段階では、ToolSenseのマルチフォーマット記憶SFTを再利用し、LoRAを用いてツール知識を注入する。第2段階が我々の中核的貢献である。モデルは、ツールトークンのJSONリストを生成する前に思考トレースを出力するよう訓練される。その際、ToolSenseのRRBペアと、専門家がキュレーションしたビジネスルールを対象とする合成クエリという2つのデータソースを使用し、両方に推論トレースを付加する。この訓練目的により、第1段階のMCQおよびQAプローブ精度を維持しつつ、生産レイテンシでの単一ビーム貪欲デコードを可能にする。2つのエンタープライズ製品ラインにわたる8,300以上のツールからなる複合エンタープライズカタログで評価した結果、TRACEの第2段階訓練はツール理解を維持するだけでなく向上させ、第1段階と比較してMCQ精度が+3.2ポイント、QAプローブ精度が+9ポイント向上した。検索において、TRACEはドメインAで約86%の再現率、ドメインBで約60%の再現率を達成した。一方、埋め込みベースラインの性能はそれぞれ約27%と約52%であり、両方とも単一ビーム貪欲デコードを用いており、生産レイテンシで直接デプロイ可能である。
近年の多くのロボット政策は、大規模な事前学習済み視覚言語モデル(VLM)を行動基盤として利用することで、より強力な制御を追求している。本稿では、行動生成と視覚的世界モデリングを統合した統一拡散型トランスフォーマーアーキテクチャであるWorldDiTを提案する。これは大規模な事前学習済みVLM行動基盤を必要とせず、強力な性能を実現する。学習時には、単一の拡散型トランスフォーマーが連続的な行動チャンクを生成し、将来のカメラフレームから正規化されたRGBパッチターゲットを予測する。4つのLIBEROシミュレーションスイートにおいて、WorldDiTは、全4スイートの結果を報告する手法の中で、総モデルパラメータ数と平均成功率に関する報告済みパレートフロンティア上に位置する。これらの結果は、今後のスケーリング研究に向けた強力なサブビリオンパラメータベースラインを提供する。
Voltaによる独立スレッドスケジューリング(ITS)の導入以降、NVIDIA GPUはワープ発散を固定された方法で処理すると広く想定されてきた。本稿では、この想定をAmpere、Hopper、ならびにデータセンター向けおよびコンシューマ向けBlackwell GPUにおいて検証し、ITS以前のPascalをベースラインとして用いる。サイクル精度のマイクロベンチマーク、ハードウェアカウンタ、コンパイラ生成SASSの静的解析を組み合わせることで、安定した動作とアーキテクチャの変化を区別する。検証した全世代において、発散パスはパス数kに対して線形に直列化され、T(k) ≈ sk の関係に従い、超線形の再収束ペナルティは観測されない。ワープ実行効率は32/kに低下し、そのペナルティは占有率に依存せず、プレディケーションによって直列化コストは除去される。同じ振る舞いはPascalでも確認され、このプログラマ可視のコストモデルがITSよりも前に存在したことを示している。しかしながら、コンパイラが出力する再収束機構は大幅に変化している。PascalではワープごとのSSY/SYNC命令スタックが用いられたのに対し、以降の世代ではバリアレジスタ命令が使用される。即時ポストドミネータを超えた遅延再収束の数は、Ampereの29件からBlackwellでは2件に減少している。またBlackwellでは、二層の収束バリア分類、均一分岐命令、明示的な部分マスクワープ同期が導入されており、これらはいずれもAmpereやHopperには存在しない。制御ビット反転実験により、新たなバリア分類は静的コンパイラ分類であり、我々のテストでは観測可能な実行時効果を持たないことが示された。したがって、NVIDIAの制御フローISAおよび再収束機構が進化を続ける中でも、発散は安定した予測可能な性能コストを維持している。
ビットコインのサブデイリタイムスケールでの価格予測は、計算論的金融学における困難な未解決問題である。ビットコインは、太い裾を持つリターン、非定常なダイナミクス、そしてRedditやTwitter上の社会的言説に影響を受ける価格発見プロセスを示す。従来のアプローチでは、OHLCVテクニカル特徴量とセンチメントを静的な結合により融合し、市場状態にかかわらず同一の融合重みを適用する。これは行動ファイナンスの文献と矛盾する。なぜなら、個人投資家のセンチメントはボラティリティの高い期間に最も予測的であり、閑散期にはノイズとなることが示されているからである。本論文では、動的に検出される二値市場レジームに基づいて、センチメントと価格特徴量の融合を条件付ける「レジーム認識型マルチモーダル学習(RAML)」を提案する。ローリング24時間ボラティリティにより観測値を安定レジームと変動レジームに分割し、学習可能なシグモイドゲートが価格埋め込みに対するセンチメント埋め込みの重みを調整し、変動期にはセンチメントをより信頼し、安定期には価格ダイナミクスをより信頼する。本システムは、ビットコインのOHLCVデータとRedditの/r/BitcoinにおけるFinBERTセンチメントを組み合わせた3,491時間の観測値(2024年7月~2025年9月)で評価される。4つのモデル(価格のみのBiLSTM、センチメントのみの分類器、静的結合BiLSTM、RAML)を、3時間および6時間の予測 horizon で比較し、センチメントブランチ、レジーム検出、適応的融合を分離したアブレーション研究も行う。RAMLは3時間でマクロF1が0.5474、6時間で0.5513を達成し、3時間で最高のAUC(0.5084)を示し、較正の向上を示唆する。アブレーションはすべての構成要素が必要であることを確認し、適応的重み付けを結合に置き換えると6時間で再現率が崩壊する(F1: 0.14)。これらの結果は、マルチモーダル金融予測において、レジームに条件付けられた適応的融合が必要な設計原理であることを立証している。
運転スタイルは、車両の運転方法における安定した運転者固有のパターンを捉える。しかし、自然主義データにおいては、運転者が異なる車両、異なる道路、異なる条件下で観察されるため、この信号を分離することは困難であり、モデルが車両固有または状況固有の規則性を運転者固有のスタイルと誤認する可能性がある。我々は、個人化された運転スタイルモデリングのための大規模自然主義データセットおよびベンチマークであるDriveDNAを提案する。これは、115車種にわたる465人の運転者による4,121回の走行から構成され、合計975時間の人間制御による運転を10Hzで前方ビデオとともに収録したものであり、日常使用におけるコミュニティドライバーから収集された。DriveDNAは、運転スタイルを、類似条件下での車両の動き方における一貫した運転者固有の行動パターンと定義する。本ベンチマークは、少数ショット運転者再同定、個人化行動予測、条件一致比較の3つの中核タスクを通じてこの信号を評価し、行動アノテーションに加え、大規模な人間による監査を経た6クラスにわたる276,248件のルール生成操縦イベントを提供する。我々は、古典的記述子、教師ありおよび自己教師あり時系列エンコーダ、マルチモーダル融合、確率的予測、ゼロショット基盤モデルに及ぶベースラインを、固定マルチシードプロトコルの下で評価する。学習された表現は、未見の運転者において古典的記述子を大幅に上回り(AUROC .935 vs .707)、一致した運転条件下でも運転者固有の情報を保持する一方、記述子の性能は偶然のレベルに近づく。ビデオのみのモデルは同等の再同定精度を達成するが、深刻な経路リークを示し、強い認識が運転行動ではなく文脈上の近道から生じる可能性があることを示している。これらの知見は、信頼性の高い運転スタイル評価には、学習された表現の行動的価値と、車両、走行、条件の交絡に対するロバスト性の両方を評価する必要があることを示している。
近年、強力なテキスト・画像生成モデルの進展に伴い、複雑な構成的プロンプトにより忠実な画像を生成するために、サンプリング軌道を修正するテスト時手法の重要性が高まっている。本稿では、テスト時の報酬アライメントを通じて構成的テキスト・画像生成を行う訓練不要のフレームワークTILTを提案する。構成的失敗を、結合概念分布と単一概念分布間のオーバーラップモードとして解釈し、すべての概念が共に存在するサンプルを優先する報酬を定義する。この報酬はベースモデルに内在するものであり、外部の教師信号や報酬モデルを必要としない。これにより、閉形式の傾斜目標分布と拡散サンプリングのための原理的なガイダンスステップを備えたKL制約付き目的関数が得られる。概念分布と上記の報酬の相互作用は、自然に2つの異なるガイダンス戦略をもたらし、それぞれの利点をバランスするハイブリッドアプローチがより強力な性能を発揮する。T2ICompBenchのプロンプトを用いた実験により、本手法が従来のベースラインと比較して画質を維持しつつ、構成的アライメントを改善することを示す。