翻訳付きの日次キュレーションされたAI研究論文
最近のビデオ生成器は、戦争、災害、公衆緊急事態、その他の現実世界の危機に関する現実的な描写を作り出すことができ、誤情報の重大なリスクを生み出している。しかし、既存のベンチマークは、検出可能性が生成条件によってどのように変化するか、生成されたビデオを人々がどのように知覚するか、社会的拡散の際に検出器が信頼できるままであるかなど、このような状況における検出器と生成器の振る舞いに関する限られた知見しか提供していない。このギャップに対処するため、我々は実動画をアンカーとして使用するAI生成ビデオ検出のためのベンチマークであるRA-Benchを紹介する。RA-Benchは17,886本のビデオを含み、10の社会的リスクカテゴリにわたる1,830本の実動画アンカーと、4つのオープンソースおよび5つのクローズドソース生成器からの16,056本の生成クリップで構成される。RA-Benchに基づき、我々は評価を3つの側面に沿って構成する。まず、7つの従来型検出器、3つの評価設定における10のゼロショットマルチモーダルモデル、およびAI生成ビデオ検出に特化してファインチューニングされた2つのMLLMにわたって検出器の汎化を評価する。これらの手法全体で、3つの検出器ファミリーのいずれもRA-Benchのインスタンス全体で一貫して汎化しない。次に、検出可能性が生成品質、条件付け情報、サンプリングシードによってどのように変化するかを調べる。これらの分析は、生成特性が検出器ファミリーに異なる影響を与える一方、生成元レベルの検出パターンはシード間で安定していることを示している。最後に、人間の真偽判断と社会的拡散中の検出器の信頼性を研究する。人々を誤解させるビデオは現在の検出器にとっても困難であり、社会的拡散によって検出がより困難になることを我々は見いだす。これらの発見は、現在の手法が現実的なAI生成ビデオの検出に苦慮していることを示しており、進化するビデオ生成器に対して頑健な検出器の必要性を強調している。
視覚的オン方策蒸留は、より大規模で強力な教師モデルや、参照解答や関心領域の正解ラベルなどの特権的教師信号を通じた、有益な教師-生徒間の非対称性に大きく依存している。ここから、特権的な情報が一切利用できない場合、有益な非対称性はどこから得られるのかという根本的な問いが生じる。我々は、非対称性の由来を逆転させることでこの問いに答える。教師に特権情報を追加する代わりに、生徒から情報を差し引くのである。この非対称性は、正解アノテーションや報酬、あるいは別のより強力な教師モデルを必要とせずに、生徒が利用できない情報にアクセスできる教師と同じ効果的な学習信号を、追加コストなしで生み出す。この原理に基づき、我々は自己教師あり視覚的オン方策蒸留(S^2VOPD)を導入する。これは、非対称な拡張ビューからオン方策学習信号を構築する、単純かつ効果的な手法である。S^2VOPDは、元の画像を条件とした教師の分布を、同じ画像の強く拡張されたビューを条件とした生徒の分布へと、オン方策で蒸留する。我々は、視覚的拡張の広大な設計空間を体系的に探求し、以下のことを明らかにした:(1) 非対称性が重要である。4つの拡張ファミリーすべてが性能を向上させる一方、対称的な自己蒸留は性能を低下させる。(2) 強度が重要である。性能は中程度の強度でピークに達する。(3) ギャップはタスクと整合的でなければならない。質問に関連する根拠を完全に除去する拡張は、大きいが情報量のない不一致を誘発し得る。6つの細粒度知覚ベンチマークにおいて、S^2VOPDはQwen3.5-4Bを70.7%から77.4%へと改善し、比較対象としたすべてのオープンソースモデル(最大のQwen3-VL、235Bを含む)を上回り、GPT-5.4をも凌駕する。トレーニングデータを同一に保ったまま、特権情報を用いる手法によって達成される改善の96%を回復する。ウェブサイトは https://williamium3000.github.io/s2vopd にある。
自律エージェントは、モデル、システム、その他の技術的成果物を、長期的な実験を通じて改善する能力を急速に高めつつある。しかし、この能力の現状を理解するには、評価が最終スコアだけに留まってはならない。最終スコアは、進歩がどこで得られ、どこで失われているのかを明らかにせず、また、蓄積された経験がその後の意思決定を改善するかどうかも示さないからである。そこで本稿では、実行中の挙動をルールベースの指標によって特徴づける新しいフレームワークに基づき、7つのフロンティアモデルを36の長期的タスクで系統的に評価する。このフレームワークは、解法の枠組み(Solution Framing)、実行(Execution)、フィードバック制御(Feedback Control)を通じて実行中の挙動を特徴づけ、統制比較によってタスク内およびタスク間の経験再利用を評価する。結果は、現在のエージェントが完全に自律的な研究者というよりも、むしろ工学的なオプティマイザーとして機能していることを示している。すなわち、実用的な解法を定式化し実装することはできるが、その性能は実行ごとに大きくばらつき、最も優れた解法は主に既存の技法を適応または組み合わせたものであり、真に方法論的な新規性は依然として稀である。詳細な分析により、観測される性能は複数の要因によって形成されることが明らかになった。類似した最終結果の背後にある異なるプロセス上のボトルネック、その後の意思決定を助けたり誤らせたりする経験再利用、そして性能の安定性に影響を与えるハーネス設計などである。これらの知見は、モデル訓練、推論時戦略、経験管理、およびハーネス設計を改善するための具体的な方向性を示唆している。
我々は、知識ベクトルを格納するグローバルに共有されたメモリ(FFN)と、構成的推論を反復的に実行する複数の推論器(自己注意)から構成されるアーキテクチャであるMobius-v0を提案する。隠れ状態をキャッシュおよび伝達媒体として用いることで、推論器は必要な知識ベクトルをメモリに繰り返し問い合わせ、知識は推論演算子へと送り返される。この知識-推論分離アーキテクチャにより、Mobiusはより優れた知識圧縮と推論効率を達成する。Mobius-v0アーキテクチャに基づき、(1) ゼロから学習した7Bモデルは、7B Transformerベースラインと同等のダウンストリームスコアを、ベースラインの学習データの62.6%で達成する。(2) Qwen3.5-35Bから継続事前学習したIntern-S2-Mobiusは、同等のダウンストリームスコアを達成しながら、約4倍のエンドツーエンド推論高速化を実現する。
オン・ポリシー蒸留(OPD)は、より強力な教師モデルから推論能力を転移する有望な手法であるが、これを長文脈推論の教師モデルと短文脈の学生モデルに適用すると、トークナイザの不一致、教師と学生の分布不一致、応答長の爆発、学習の不安定性といった実際上の課題が生じる。本研究では、長文脈推論モデルSU-01から短文脈の学生モデルへ証明推論能力を転移することにより、この設定を検討する。トークナイザの違いに対処するため、共有テキスト空間でOPDを実行し、学生トークナイザと教師トークナイザの下で同一のテキスト区間を占めるトークンのみを整列させる。過剰な生成長と頻繁なトランケーションの問題を緩和するため、学生参照KL損失を導入し、`</think>`や`<|im_end|>`といった特殊な終了トークンのアドバンテージをマスクする。この戦略は、学生が初期方針から過度に逸脱するのを抑えることで、教師と学生の分布不一致の問題を緩和し、安定した長さの成長を促す。同一系列および異なる系列の学生モデル(Qwen3、Qwen3.5、Intern-S2、GLM-4.7、Gemma-4を含む)での実験では、数学的推論、特に自然言語による数学証明において一貫した改善が見られた。特に、Intern-S2-PreviewはProofBenchで21.2ポイント向上し、55.2に達してGemini-2.5-Proを上回った。また、HLEやHiPhOといった科学ベンチマークでも改善が見られ、OPDが数学の学習領域を超えて一般化する推論能力を転移することを示唆している。
アポロ計画が月に到達できたのは、単に技術者たちが難解な方程式を解けたからではない。遠い目標を、明確な目的、シミュレーション、検証、そして反復的な修正からなるミッション・アーキテクチャへと転換したからこそ、成功を収めたのである。AIは現在、同様の転換期に直面している。フロンティアモデルは、問題、ツール、成功基準が指定されれば困難なタスクを解決できるが、重要な現実世界の課題が実行可能かつ検証可能な形で提示されることは稀である。 本稿では、高負荷ソルバーを通じて発見型AIを構築・評価するためのフレームワークであるApodex Discoveryを紹介する。このシステムは、基盤モデル、ハーネス、ツール、制御ポリシーから構成され、拡張的で状態保持型の検証可能な調査を pursuit する。本フレームワークは三つの中核的構成要素を持つ。第一に、問題探索プロセスが16セクターにわたる561産業を調査し、423の高価値な実世界問題を収集し、初期リリース用に20件を選定した。第二に、共通の環境-タスク-エピソード抽象化が、データ、ツール、制約、フィードバック、軌跡記録、および中間成果物と最終提出物の検証を提供する。第三に、HDS6が、最終タスクの成功とは独立に、ツール、修復、代替案、整合性、エビデンス、スコープを評価する。 AAVキャプシド設計において、Apodexは生存性、指向性、構造予測、生成設計の各指標において、公表されている最先端技術を7%上回った。薬剤の適応拡大と製剤改良においては、タスク特化型の生物医学環境により、GPT-5.5およびGPT-5.6-solの平均正規化予測スコアが、同一の閉域型バックボーンと比較してそれぞれ2.5ポイントおよび7.6ポイント向上した。制御アブレーション実験により、固定されたTRACESエピソードインターフェースが、性能差を特定のソルバー構成要素に帰属させることを可能にすることが示された。Apodex Discoveryは、AI評価を事前定義されたベンチマークを超え、真の発見を目指す検証可能な調査へと拡張するものである。
対話型ゲームの世界モデルは通常、視覚的観測をピクセル空間または潜在空間で直接自己回帰するため、姿勢、幾何、遮蔽といった構造化された性質を、同じ生成系列によって暗黙的に維持しなければならない。長期的な時間範囲にわたって、これらの潜在的な世界特性の誤差は蓄積し、一貫性と制御可能性を脆弱にする。我々は、進化する世界状態を明示的にモデル化し、正確な幾何計算を固定されたゼロパラメータのレンダラーに委任し、ニューラルモデルには外観の合成のみを担わせる。我々はこのアイデアを、関節付きキャラクターを持つ対話型ゲームのための世界モデルであるMarionetteとして具体化する。第一に、2段階の自己回帰ダイナミクスモデルが、複数エンティティの関節付きスケルトン、メートル単位のルート軌跡、および回転からなる、明示的かつ解釈可能な276次元の3D世界状態を予測する。第二に、ゼロパラメータのグラフィックスブリッジが、予測状態をポーズ制御ビデオに変換し、ワールド空間の幾何と遮蔽を閉形式で計算する。第三に、制御条件付きビデオ拡散観測モデルが、得られた構造化制御からフォトリアリスティックなRGB観測を合成する。我々の実験は、Marionetteの2つの特性を実証する。第一に、予測された世界状態は直接制御可能である。不一致の行動ストリームを強制すると、48の保留セグメント全体でルート位置合わせ後の関節誤差が31%変化する。第二に、長期的な行動は状態において決定され、その状態上で修復可能である。自由に放置すると、生成された2体のキャラクターは21.2mまで離れてしまい(記録されたセッションでは約5mに留まる)、フレームの3分の1で地面貫通が見られる。明示的な状態に課された2つのルール、すなわち地形コライダーと分離上限は、貫通を66%削減し、ペアが互いに関わり合う状態を維持する。観測モデルへの変更は一切ない。予測状態を経由した外観の生成は、検出可能な忠実度の低下を伴わない(FVDは831であり、記録されたポーズの799に対するものである)。
現在の大規模言語モデルの開発は、大規模でしばしば許諾が得られていないデータセットに依存しており、オープンソースと倫理的なデータ調達に取り組む研究者にとって高い障壁となっています。我々は、階層的推論モデル(HRM)アーキテクチャに基づく10億パラメータの言語モデルであるMimir v1を紹介します。本モデルはスクラッチから学習され、許諾のある事後学習データのみを使用して、英語で非常に競争力のある性能を発揮し、デンマーク語では新たな最高水準を確立します。161のデータセットの混合で学習されたMimir v1は、元のHRM-Text 1Bを凌駕し、Qwen 3.5 4BやGemma 4 E2Bなどのより大規模な最先端モデルと競合します。英語、数学・コード、デンマーク語にわたる20のベンチマークで評価されています。モデルはHugging Face Hubで公開しています:https://huggingface.co/danish-foundation-models/DFM-Mimir
次世代のAIエージェントは、孤立した質問に答えるだけのシステムから、ユーザーの経験を理解・記憶し、そこから継続的に学習できる持続的なパーソナルアシスタントへと急速に進化しつつある。このようなアシスタントには、時間の経過とともにユーザー固有の経験を蓄積・活用するための長期記憶が不可欠である。しかし、既存のベンチマークは、経験が異質で、マルチモーダルであり、絶えず進化し、かつ深く個人的であるという現実的なモバイル環境においては依然として不十分である。本稿では、オンデバイス長期記憶を研究するためのベンチマークおよびフレームワークであるMobileMemを紹介する。MobileMemは、1年規模のモバイル経験コレクションに基づき、知識基盤型合成パイプラインを用いて、ユーザーとアプリのセッションから一貫性があり時間的に整合的な長期軌跡を構築する。さらに、マルチホップ推論および時間的推論、知識更新、暗黙的な嗜好推論をカバーする、相補的なテキスト設定とマルチモーダル設定を提供する。具体的には、MobileMemはエージェントが過去を記憶し、現在を理解し、未来に適応することを可能にする。孤立した事実ではなく経験をモデル化することにより、MobileMemは記憶を情報検索の枠組みを超えて、継続的なパーソナル学習のための経験的知能へと押し上げる。
ヒューマノイドの動作追跡は遠隔操作や全身模倣の中核をなす技術であるが、その評価は映像に対する人間の知覚と乖離することが多い。運動学的誤差はフレーム単位の姿勢差分を平均化するものの、最も重要となる物理的アーティファクト、特に不安定な支持や誤った接触(足の滑りやタイミングを誤った接地など)を見逃してしまう。一方、広く用いられているテストスイートは規模が小さく、接触を多く含む長期的な行動を評価するために必要な多様性を欠いている。本稿では、ヒューマノイド追跡評価を知覚的に整合させつつ、スケーラブルにするHumanTrackerを提案する。HumanTrackerベンチマークには、複数のプロのパフォーマーから収集した約153時間分の光学式モーション軌跡が含まれており、きめ細かな診断のためのテキストラベルを備えた4つの動作ファミリーに整理されている。さらに、2万4千の動作ペアを含む1万2千の動作ペアで学習された選好整合メトリクスであるHumanScoreを提案する。代表的かつ最先端のトラッカー群に対する評価において、HumanScoreは人間の選好をより高精度に予測し、運動学的メトリクスではしばしば見逃される接触の失敗や安定性の欠如を明らかにする。
随着图像编辑模型的快速发展及其在各领域的广泛应用,将这些模型能力直接部署到真实世界场景中的需求日益迫切。然而,现有的基准测试仍局限于简单的单图像任务,存在覆盖维度有限、无法有效区分不同模型性能的问题。因此,它们无法可靠地评估模型在复杂多图像编辑、高要求推理指令以及实际部署场景中的表现。为了解决这些局限,我们提出了CPI-Bench,一个面向真实世界图像编辑的综合性、实用性与智能性基准测试。CPI-Bench包含三个核心子集:CPI-General-Bench,全面覆盖多样化编辑任务并率先引入多图像编辑评估;CPI-Practical-Bench,聚焦高频真实用户应用场景;以及CPI-Intelligent-Bench,专门评估高要求推理性编辑能力。基于CPI-Bench对主流图像编辑模型的评估结果表明,CPI-Bench增强了对不同模型性能的区分度。它为通用编辑能力、实际部署效果和高级推理性编辑之间的差距提供了全面且可靠的量化,为图像编辑模型未来的优化提供了宝贵的指导。关键在于,我们的排名分析显示,CPI-Bench与Arena Image Edit排行榜的对齐度最高,表明它忠实捕捉了人类评估者的偏好与感知判断,可作为真实用户体验的有力代理指标。
人間の脳は顕著な機能的特殊化を示し、言語、形式的推論、他者の心についての推論、物理的世界についての推論をそれぞれ支える異なるネットワークを有する。このモジュール構造は、知能システムが構築される際の根本的原理なのであろうか、それとも生物学的脳に固有の進化的偶然なのであろうか。本稿では、まったく異なる最適化プロセスを通じて創出された別のクラスの知能システムである大規模言語モデル(LLM)においても同様の組織化が生じるかを検証する。4つの認知領域(言語、形式的推論、社会的推論、物理的推論)にわたるN=46タスクに対する回路解析を用いて、LLMが人間の脳を反映するモジュール構造を発達させることを見出した。すなわち、人間において同じネットワークを利用するタスクはLLM内の重複するニューロンを動員し、異なるネットワークを利用するタスクは異なるニューロンを動員するのである。脳とニューラルネットワークにおけるモジュール性の収斂的出現は、これが知能システムの根本的特性である可能性を示唆している。
エージェントが経験から学習し、それを方策に内面化することは、自己進化型AIにおける中心的な問題となっている。オン方策自己蒸留(OPSD)は、特権的自己教師を用いて生徒自身の軌跡に密な教師信号を提供するという有効な手段を提供する。しかしながら、既存手法は依然として設計者が指定した特権的要素(例:回答、フィードバック、スキル、軌跡)に大きく依存しており、継続的な自己改善に必要なエンドツーエンドの学習可能性とスケーラビリティを制限している。本研究では、特権的文脈の新たに規定された形式を持つ別の手作りOPSD変種を提案するのではなく、教師の特権的文脈自体を経験からエンドツーエンドで学習可能にする、潜在オン方策自己蒸留(LOPD)を導入する。技術的には、LOPDは関連する経験を検索し、それらを自己教師を条件付ける連続的な潜在トークンに構成する。一方、生徒はタスクと対話履歴から軌跡を生成し、各訪問済みプレフィックスにおいてトークン単位の密な教師信号を受け取る。さらに、潜在文脈の学習を安定化・調整するために、特権マージン目的関数を導入する。実験的には、LOPDは以下のことを示す:(I)強力な性能:エージェント型ツール利用とコード生成の両方において、RLVRおよびOPSD、SDPO、Skill-SDを含む代表的なOPSD手法を上回る。(II)高い学習効率:GRPOとSkill-SDを、それらのロールアウト予算の30%未満で凌駕する。アブレーション実験はさらに、特権的文脈を学習可能にすることがこうした改善を実現するために必要であるという直接的な証拠を提供する。これらを総合すると、LOPDはエージェント進化のための、よりスケーラブルで自己主導的なパラダイムへの一歩として位置づけられる。
我々は、テスト時スケーリングの原理として主張レベルの反証を提案し、それをCLR(Claim-Level Reliability Assessment、主張レベル信頼性評価)として具体化する。CLRは学習不要のフレームワークであり、テスト時計算資源を追加の解サンプリングから対象を絞った検証へ再配分する。トレース全体の評価では、定型的なトークンによる信号の希釈のために決定的な誤りが覆い隠されがちである。そこでCLRは、各推論トレースを意思決定上重要な主張のコンパクトな集合へ凝縮し、論理的アンカーを抽出する。さらに、固定されたモデル能力の下で完全に正しい解を生成することの本質的な難しさを認識し、CLRは意味論的反証に焦点を移す。このアプローチは、解の構築と主張の反証との間の根本的な非対称性を利用する。有効な解を構築するには欠陥のない推論経路が必要であるのに対し、誤った主張を反証するにはただ一つの決定的な欠陥を特定すれば十分である。この否定的証拠に的を絞った探索は、高信頼度の誤ったトレースの生存空間を体系的に圧縮し、非線形な信頼性スコアリングによって誤ったコンセンサスを効果的に抑制する。同等の計算予算の下で、4つのLLMと4つの推論ベンチマークにわたる実験において、CLRは概してpass@1と自己整合性を改善する。例えば、GPT-OSS-20B/CMIMC25では、CLRはpass@1を27.15パーセントポイント上回り、自己整合性の正解率を77.50\%から82.19\%へと引き上げ、しかも37.0\%少ないトークンでそれを実現する。
きめ細かいロボット評価は、二値的な成功率やルールベースのプロセススコアを超えて、具現化モデルを理解するために重要です。我々は、ロールアウト動画を密な進捗曲線に変換し、複数の詳細な指標を導出するロボットプロセス評価のためのツールキットであるPRM-as-a-Judge 1.5を提示します。PRM-as-a-Judge 1.5は、バージョン1.0を基に、失敗側の進捗、ドローダウン後の回復、成功側の実行品質を特徴付ける3つの指標を導入し、ユーザーが具現化モデルの能力を理解するのに役立ちます。ベンチマークからのロールアウト動画に基づき、我々は具現化モデルの包括的な評価を実施し、いくつかの詳細な指標結果と重要な発見を提供します。さらに、プロセス報酬モデル(PRM)の信頼性を評価するためにRoboPulse++を導入し、評価者により正確なテストプラットフォームを提供します。加えて、ベンチマーク、指標の実装、可視化ツールを含むユーザーフレンドリーな評価スイートを公開し、再現可能な操作プロセス評価を支援します。我々はコミュニティに対し、ロボットの評価方法を再考し、透明で手続き的かつ再現可能な評価を次世代の具現化知能の基盤として確立するよう呼びかけます。
ReActパラダイムにおけるLLMエージェントは、推論・行動・観察を交互に行うが、意図的な推論はThoughtフェーズに限定されている。エージェントが行動を逐次生成して環境の応答を待つ間、その推論は停止している。我々は、このActionとObservationの間に繰り返し生じる区間を推論アイドルウィンドウと特定し、そこが将来のターンに役立つ追加の推論を並列に実行できるかどうかを問う。そこで我々はSecond Thoughtを提案する。これは学習不要の推論フレームワークであり、各Thoughtフェーズが終了した瞬間に4つの補助ブランチを分岐させ、メインループと並行してデコードし、環境観測が到着したときに生成された思考をメインループに統合する。これによりSecond Thoughtは、追加の推論をメインスレッドの逐次デコード経路から外す。3つのエージェントベンチマークと3つの推論LLMにわたる評価では、Second Thoughtは9つの(モデル、ベンチマーク)ペアすべてで平均ターン数を減少させ、そのうち6つのペアではメインスレッドのデコードを最大43%削減し(それらの設定での平均は約20%)、別の1つのペアではほぼ不変であった。Pass@1は9ペア中7つで有意な変化は見られず、有意な差があった2つのペアでは+12.4ポイントと+10.2ポイントの改善であった。計算量を一致させた対照条件(メインスレッド自身の推論に同等の予算を強制する)と比較すると、その対照条件が適用される4つの設定すべてにおいて、Second Thoughtは逐次デコード量が1.3〜3.2少なく、厳密に高いPass@1を達成した。
マルチモーダル大規模言語モデル(MLLM)は強力な視覚的理解を示す一方、これらの挙動を引き起こす内部特徴を特定、監査、あるいは制御することは依然として困難である。スパースオートエンコーダ(SAE)を用いて解釈可能な特徴方向に分解された隠れ状態は、事後検査には適用できるものの、マルチモーダル学習によってどの特徴が変更されるかを容易に切り分けることはできず、さらに標的を絞った制御に直接役立つわけでもない。我々は、マルチモーダルSAEを訓練し、それらをマルチモーダル挙動の発見と制御のための特徴レベルインターフェースへと変換するマルチモーダルモデル差分分析フレームワーク、MMDiffを導入する。MMDiffは以下の3つの用途をサポートする:(i) ベースLMのSAEとそのマルチモーダル適応版との差分を取ることにより、マルチモーダル学習によって変更された特徴を特定する特徴分離、(ii) トークンごとの対比的発火分析により因果的特徴を切り分けるタスク特異的特徴検出、(iii) 発見された特徴方向を因果的に除去または操作する特徴レベル制御。我々はLLaVA-MORE、PaliGemma 2、InternVL3.5という3つのMLLMファミリーに対してマルチモーダルSAEを訓練し、視覚空間的理解、マルチモーダル安全性、OCRについて評価した。MMDiffはスパースで因果的に特異的な特徴を発見し、その除去は空間タスクでは平均12%、OCRでは17%の標的行動の選択的低下をもたらし、マルチモーダル安全性攻撃に対する攻撃成功率を24%低減する一方、VQA性能には影響を与えない。これらの特徴の操作は、標準的な単層ステアリングベースラインと比較して、空間精度とOCR精度を平均でそれぞれ+3.6%および+1.8%向上させる。これらの結果は、マルチモーダルSAEが解釈可能性ツールとしてだけでなく、MLLMの挙動をより安全で高性能な生成へと監査、操作、制御するためのメカニズムとして機能し得ることを示している。
1,000銘柄の米国株式の時間別リターンを予測する際、我々は予期せぬ現象を観察する:予測がほぼ平坦になり、横断面相関で測定される株式ランキングが不正確になるのである。我々はこれを予測崩壊(forecast collapse)と呼ぶ。驚くべきことに、この現象は同じ設定で取引量を予測する場合にはほぼ消失する。我々は時系列基盤モデル(TSFMs)、12の深層学習予測モデル、97の公開ベンチマーク設定にわたって予測崩壊を調査し、これがターゲットの予測可能性と密接に関連していることを見出す。その背景には2つの異なる理由があることを特定する:予測可能性の低さが較正された点予測の振幅を制限すること、そして系列ごとの目的関数が系列横断的な構造を未特定のまま残すことである。これらの発見は較正とランキングのトレードオフを明らかにする:二乗誤差の最適化は平坦な予測をもたらす一方、横断面相関を直接最適化するとランキングは改善するが、予測の振幅を1桁以上膨張させ得る。このトレードオフに対処するため、我々は較正とランキングのバランスを取る単純な目的関数であるCalibRankを導入する。Finance1Kにおいて、CalibRankは横断面相関をほぼ3倍にしながら振幅をターゲットに近く保ち、テストしたすべてのモデルで相関を改善する。我々の結果は従来の時系列評価における盲点を明らかにする:系列ごとの指標は、下流の意思決定に必要な系列横断的な構造の失敗を隠蔽し得るのである。
現代の言語モデルは、異種混在するウェブ規模のテキストコーパスで学習される。そのため、事前に触れた関連コンテンツの特性把握が困難であり、知識・スキル獲得の研究は難しい。この課題に取り組むため、我々はLITTLECURRICULUMを導入する。これは、米国の小学校教材に特化した厳選88Bトークンの事前学習コーパスであり、5年生より上の学年で教えられる概念、事実、語彙を明示的に除外している。LITTLECURRICULUMを用いて5BパラメータのLLMをゼロから学習することで得られるLITTLELEARNERは、自由回答形式の評価に耐える十分な言語能力を持つ一方で、その知識と能力の境界は解釈可能なカリキュラム指針に明確に対応している。我々はLITTLECURRICULUMとLITTLELEARNERを、明確に定義された学習範囲のもとでモデルがデータをどのように獲得し、表現し、利用するかを研究するための発達制限付きサンドボックスとして公開する。本サンドボックスの有用性を示すため、ポストトレーニングおよびインコンテキスト学習による新知識の注入に関する最初の実験群を実施する。これらの手法によりLITTLELEARNERは既存知識をより有効に活用できるようになるが、範囲外の能力は向上しない。本研究の知見は、今後の研究における本制御環境の価値を強調するものである。
大規模言語モデルがスケールするにつれて、適切なトークン・パラメータ比(TPP)を維持するために、そのトレーニング・トークン予算も増やさなければならない。しかしながら、高品質なドメインデータをスケールさせることは、一般的なウェブデータに比べてはるかに困難である。モデルサイズとトレーニング・トークン予算が増加するにつれて、トレーニングデータ混合内におけるその割合は減少する傾向にある。利用可能な高品質データを反復することは、この希釈化を打ち消す効果的な方法となるが、過度の反復は過学習を引き起こす可能性がある。我々は、トレーニング・トークン予算がモデルサイズに比例して増加するという実用的なLLMスケーリングの下で、このトレードオフを研究する。固定されたドメインについて、我々はまず、固定されたTPPでは、驚くべきことに、最適な反復回数がモデルサイズとともに緩やかに増加することを見出す。異なるドメインにわたっては、最適な反復回数がそのドメインの最終検証損失と強い負の相関を示すことを見出す。すなわち、損失が低いドメインは一般により多くの反復から利益を得られる。対照的に、一意なドメインデータの量は、最適な反復回数と弱い関連しかない。これらの発見は、同じTPPを持つより小さなプロキシモデルで調整された反復回数が、より大きなモデルに対する実用的な推定値を提供できることを示唆している。
臨床意思決定支援は、共有ワークスペース上で審議する言語モデルエージェントの委員会方式へと移行しつつある。我々は、そのような委員会が、ベンチマークが報いるが臨床医なら無視するような手がかり(ショートカット)によって攻略され得るかを問う。テキスト(MedQA-USMLE、MedMCQA、MIMIC-CXRレポート)、画像(NIH ChestX-ray14、MIMIC-CXR-JPG、CheXpert)、表形式ICU記録(SUPPORT2)にわたる6つの公開データセット上の7コホートにおいて、Gemini委員会はこれらの手がかりを単独では退ける(反転率5〜16%)が、社会的に妥当なショートカットは伝播する。すなわち、2人のピアが同じ誤答を主張すると、テスト対象のホールドアウトエージェントは38%のケースでそれを採用し、偽の「プレスクリーニング」システムフラグも、両方の性能レベルで同様の採用を引き起こす。3つの監視エージェントのうち、ゲートは同調による採用と正直な一致を区別できない(偽陽性率100%)。同一系統の判定エージェントは議事録のみを読んで、テキストでは採用を検出する(適合率100%、再現率93%)が、画像ではゲートと同様に機能しなくなる。ホールドアウトを非公開で再問い合わせするレフェリーは画像にも転移する(適合率77〜88%、偽陽性率13〜21%)。手がかりの視覚的顕著性を3倍にしても伝染度は変わらない一方、2人目のピアの発言はそれをさらに1.5倍に引き上げる。隠れたルーブリックを標的としたゲーミングはほぼ無言である:テキストでは10件中1件、画像では134件中1件のドリフターだけが、自分が近づいたルーブリックを名指しする。委員会を攻略するのは社会的妥当性であり、自己報告から独立したレフェリーだけがそれを捉える。コード:https://github.com/criticaldata/benchmaxxing
Muonオプティマイザは、三次時間のNewton-Schulz直交化ステップにより、大きなオーバーヘッドコストを伴う。重みがシャーディングされると、通信オーバーヘッドがこの計算コストをさらに悪化させ、多くの設定においてMuonの利点を損なう。我々は、スタックのあらゆるレベルでこのオーバーヘッドに対処するMuonの改訂版であるDion3を提案する。我々のGram Newton-Schulzアルゴリズムは直交化のFLOPコストを削減し、CuteDSLカーネルは対称性を活用してこれを高速化し、メガバッチ戦略は通信オーバーヘッドを削減する。さらに、各ステップでモーメンタム行列の一部の行のみを直交化対象として選択するという、コストをさらに削減する単純な更新規則の変更を提案する。この更新規則は、Muonの別の「圧縮」版であるDionを、速度と性能の両方で改善する。全体として、Dion3はMuonが達成する損失に匹敵するかそれを改善しつつ、オプティマイザのステップ時間を最大6倍削減する。Dion3はdionパッケージ(https://github.com/microsoft/dion)から利用可能であり、Muonのドロップイン代替として提供される。
我々は、検証可能な報酬を用いたオンポリシー強化学習(RLVR)が、現在の目的を改善する一方で、後の目的にとって成功となる行動を、サンプリングして強化するには稀すぎるものにしてしまうことを示す。これを検証器誘発サポート再形成と呼び、実効的な報酬可能サポートを、固定ロールアウト予算内で到達可能な成功軌道として定義する。2つのモデルファミリーにわたり、数学的推論と制約付き指示追従において、検証器スコア付きサンプリングの反復と双方向トレーニング(逆の検証器を用いた逐次トレーニングを含む)を通じて、この効果を研究する。Math-RLVRは平均的な指示追従成功率を高めるが、反復サンプリング下で何らかの成功応答があるプロンプト数を減少させる。Qwen3-8B-Baseを用いたIFEvalでは、pass@1は6.5パーセントポイント上昇する一方、best@32は9.8パーセントポイント低下し、同じ乖離が両モデルおよびIFベンチマーク全体で見られる。逆に、IF-RLVRは数学応答を段階的な書き出しから直接的な回答へと移行させ、サンプリング予算全体でbest@kを低下させ、後続のMath-RLVRの報酬変動を減少させる。トークン分布分析と制御された書き出し介入は、これらの変化が応答の最初の数トークンに集中することを示す。RLVRは主にベース方策ですでに利用可能な書き出しを再ランク付けしており、選択された書き出しは数学の探索可能性に因果的に影響する。試験した参照方策制約、ルーティング事前分布、オンポリシー蒸留は、クロスタスクサポートを部分的にしか保持しない。MathIFとReasonIFは、限界的な利得が、正しくかつ制約を満たす応答に部分的にしか変換されないことを示す。したがって、エンドポイントの改善は、オンポリシー最適化下での将来の訓練可能性や統合能力を保証しない。コードは https://github.com/sylvain-wei/verifier-induced-support-reshaping で入手できる。
大規模視覚言語モデル(LVLM)は、優れた視覚推論と対話能力を達成する一方で、視覚入力によって裏付けられない内容を幻覚することが頻繁にある。効果的な緩和には、応答全体を破棄することなく標的を絞った介入を可能にする、トークンレベルの位置特定が必要である。既存の検出器は、高コストなモデル全体のファインチューニングを必要とするか、モデルの生成過程を無視する外部検証器に依存するか、あるいは内部信号を孤立した特徴量や手作業の統計量に還元し、空間的・系列的・関係的構造を捨てている。我々はUniProbeを導入する。これは、凍結されたLVLMの異種計算トレースを単一の順伝播からモデル化する、軽量で統一された学習可能な検出器である。UniProbeは、画像パッチ、クエリトークン、生成トークン上の有向グラフを構築し、注意重みがそれらの関係を符号化する。このトレースを、構造認識モジュールを交互に用いて処理する。すなわち、関係的証拠のためのGNN、2次元視覚幾何学のためのViT、応答順序のためのGRUである。これらを交互配置することで、空間的・関係的・系列的な証拠が検出器全体で相互作用できるようにする。さらに、幻覚を認識する復号のためのストリーミング版を開発する。これは生成中に幻覚トークンを検出して再サンプリングするものであり、また、検出器をLVLM自身の生成に整合させる自己適応戦略も開発する。多様なLVLMバックボーンにわたり、UniProbeはトークンレベルおよびオブジェクト幻覚検出で最先端の性能を達成する。復号中、標準生成の1.06倍のレイテンシで、オブジェクト幻覚を最大55%削減する。
科学図表は本質的な実験的証拠をコード化する一方で、デジタルライブラリやマルチモーダルAIシステムにとって、その検索と解釈は依然として困難である。ALD/E-ImageMinerベンチマークとICDAR 2026 原子層堆積/エッチング科学図表からの情報抽出コンペティションは、205件の出版論文から得られた1,951点の図表に対し、分類、データ表抽出、要約、視覚的質問応答のための専門家アノテーションを提供する。本併設プロシーディングスにおいて、我々はこのベンチマークが将来の科学画像チャレンジをどのように導き得るかについて、将来を見据えた展望を提示する。本ベンチマークのタスクが、視覚的・定量的読み取りから領域に根ざした推論や証拠に基づく正当化に至る能力をどのように探求するか、またブルーム分類学に基づく問題設計がより深い科学的理解をいかに支援できるかを考察する。我々は「画像からの科学的概念理解」を長期的なベンチマーク目標として提案し、将来の方向性として、より広範な領域と図表タイプ、文脈的・文書横断的統合、仮説評価、来歴、不確実性、反事実的根拠付け、オープンエンドなマルチモーダル研究を含める。本展望は、ICDAR 2026チャレンジを、機械処理可能な科学的視覚知識と検証可能なマルチモーダル科学AIのためのより広範なアジェンダに接続するものである。
推論モデルにおいて、どの推論行動が正答と関連しているのか。また、推論指向の訓練はそうした行動を増幅するのか。この区別は重要である。なぜなら、推論指向の訓練は、モデルの正答性と最も結びついた行動を増幅することなく、トレースをより慎重に検討したように見せかけうるからである。我々はこの不整合を、モデルの推論トレースにおいてある行動が存在する場合と存在しない場合とで正答率がどれだけ変化するかを測定する指標であるBehavioral Lift(行動リフト)によって定量化する。テキストのみおよび視覚言語推論を対象とする6ベンチマーク、15モデルにわたり、我々はLLMトレースとVLMトレースの両方に定義された中核行動からなる分類体系を用いて15,282件のトレースを注釈付けした。その結果、思考モデルが自己修正、仮説検証、不確実性の表明を強く増幅する一方、最も高いリフトを示す行動は信頼度較正、知識整合性、自己認識であるという、増幅-リフト乖離(Amplification-Lift Gap)の証拠を得た。信頼度較正は両モダリティにおいて正答の最も強い正のシグナルの一つであるにもかかわらず、ほとんど増幅されない。不確実性の表明は3〜7倍に増幅されるにもかかわらず、正答との関連は弱いか負である。推論指向の訓練は最もリフトの高い行動を優先的に増幅するわけではないことが分かり、表面の形式だけでなく、較正され根拠に基づいた推論に報酬を与えるプロセスレベルの目的関数が動機づけられる。
大規模なクラウドソーシングによるコーパスで訓練されたニューラル言語モデルは、真の言語的・因果的関連性を持たない、ターゲットラベルに結びついた見せかけの表層パターンを頻繁に利用し、ベンチマーク性能を押し上げる一方、敵対的入力や分布外入力に対しては失敗する。既存手法は、特徴語彙の手動指定を必要とするか、発見の自動化が部分的にしか行われておらず、データセットレベルの相関とモデルレベルの利用との間のギャップを未解決のまま残している。我々は、追加の人手アノテーションなしでテキスト分類器における疑似相関を発見し、因果的に検証し、軽減する完全自動化パイプラインであるUNMASKを提案する。ラベルなし学習例が与えられると、UNMASKは実行可能なブール式として候補表層パターンを生成し、独立した反復を伴う統計的検証プロトコルでフィルタリングし、検証された反事実的介入を通じて因果的なモデル依存性を確立する。因果的に確認された特徴は、Deep Feature Reweighting(DFR)のためのアノテーション不要のグループ定義として機能し、標準DFRが必要とするグループラベルを不要にする。MNLIで訓練されたBERTとRoBERTaに適用したところ、本パイプラインは既知の語彙重複バイアスと否定バイアスを独立に再発見し、BERTでは10個中9個、RoBERTaでは6個の特徴を検証し、HANSの精度を最大12.58パーセントポイント向上させた。CivilComments-WILDSでは、プログラム的に定義されたグループが、人口統計アノテーションなしで、人手ラベル付きDFR(Kirichenko et al., 2023)の最悪グループ精度70.1%に一致した。さらに、発見段階と検証段階が報酬モデルの選好データに一般化し、RewardBench2において解釈可能な疑似相関を浮き彫りにすることを実証する。
Nanbeige4.2-3Bは、ループ型トランスフォーマー(LT)を基盤とする3Bパラメータのエージェントモデルである。LTは1つのレイヤースタックを2回目のフォワードパスで再利用し、追加パラメータなしで実効深さを増加させる。Apple Silicon(MPS)上で評価し、公開されたチェックポイントがHugging Face transformersでそのまま動作しない原因となる5つの独立したバグを特定した(暗黙的にゼロ化されたRoPEバッファや、削除されたtransformersキャッシュAPIへの呼び出しを含む)。さらに、パラメータ効率を達成するためのLTのレイヤー再利用戦略(実効的にピーク時アテンションメモリを2倍にする)により、これらのバグを修正するだけではエージェントタスクに不十分であることを示す。そこで我々は、発生するメモリ容量ペナルティを軽減するチャンク化プリフィル戦略を導入し、約32 GiBの共有メモリ上で許容コンテキスト幅を2.7倍に拡張する。しかし、メモリオーバーヘッドを削減しても、Nanbeige4.2-3Bを使用可能にするにはパッチが必要であることを示す。システムプロンプトとMPSネイティブのメモリバグの両方を解決することで、標準的なMCPおよびツール呼び出しベンチマークでの信頼性の高い評価が可能になる。MCPMarkのサブセットでは、デバッグ済みモデルは実エージェントタスクの最大30%を完了する(元のモデルの0%から向上)。一方、BFCLでは、単一ツール呼び出しではほぼ完璧であるが、複数ツールのテストの大半では失敗する。パッチ適用済みチェックポイント、システムプロンプト最適化ツール、評価ハーネスを https://github.com/johnhalloran321/Nanbeige4.2-3B-mps-fix で公開する。
議会議事録は民主的審議の一次記録であるが、その量と断片化により、市民・ジャーナリスト・研究者が多角的にアクセスすることは困難である。検索拡張生成(RAG)を議会議事録に適用すると、3つの具体的なリスクが生じる。すなわち、最も頻繁に発言する者の優位、トピックに関する専門性に応じて発言者を重み付けできないこと、そして政治的機微を含む文章における引用の誤帰属である。本稿では、これらのリスクに同時に対処する、イタリア代議院を対象としたRAGシステムであるParliamentRAGを提案する。その中核的貢献は、トピック依存の権威モデルであり、現在のクエリの関数として各発言者の権威を推定し、職業、教育、過去の発言といった解釈可能な構成要素を組み合わせる。ユーザーのクエリが与えられると、システムは関連する発言チャンクを取得し、会派横断でトピック関連の専門家を特定し、彼らの視点を総合した要約を、裏付けとなる引用とともに生成する。ParliamentRAGは、自動指標と6人の分野専門家によるブラインドA/B人間評価を組み合わせた2段階のプロトコルを用いて、15の政策トピックにおいてGoogle NotebookLMと比較評価された。本システムは、会派間のカバレッジがより高く(0.97対0.95)、引用の忠実性が完全であり(1.00対0.95)、出典関連の側面では専門家の選好がより強い。一方、散文を重視する側面ではNotebookLMが依然として優れている。
視覚的観察からの空間知覚と推論には、幾何学的構造の復元、対応関係の確立、空間関係の理解が必要である。既存のアプローチは通常、タスク固有のアーキテクチャや外部の幾何学モジュールを用いてこれらの能力を別々に扱っており、同一の物理的シーンの相補的な表現間での知識転送を制限している。本稿では、3D再構成、密な対応関係、空間推論を命令条件付き生成タスクとして捉える統一マルチモーダルフレームワークであるSPARGenを紹介する。SPARGenは、コンパクトな構造化出力と言語出力をトークン列として直列化するとともに、画像整列形式で密な幾何学フィールドを生成し、ネイティブなマルチモーダル生成モデル内で共有表現を空間的教師信号が共同して形成することを可能にする。3D再構成、対応関係、空間推論のベンチマークにわたる実験により、SPARGenが単一のネイティブなマルチモーダル生成フレームワーク内で異種の空間タスクにおいて競争力のある性能を達成することを示す。
2023年、ニューヨークの裁判官は、Mata v. Avianca事件において、ChatGPTが生成した幻覚による引用を含む準備書面を提出した2人の弁護士に制裁を科した。このような失敗は、主にデータベース照会によって検出される。しかし、より困難な問題は、実際に存在する判例を指しているものの、そこで提示されている命題を裏付けていない引用を検出することである。この種の失敗は、法的ユースケースに対する既存のLLM評価ではほとんど見過ごされている。本論文では、2つの法文コーパスから得られた実際の法的引用に統制された摂動を加えることにより、命題レベルの引用支持検証を研究する。摂動は、引用された判例を置き換えるか、同じ判例内のピンポイントページのみを変更するかのいずれかである。我々は、得られた例に対して14のモデル構成を評価した。モデルは、判例を置き換えた改変の93~100%を検出した。しかし、ピンポイントページの誤りについては、裁判所意見書では37~61%、法的準備書面では52~83%しか検出できなかった。モデルがピンポイントページの誤りを検出できない場合、ページレベルの支持ではなく、トピックの重複に基づいて引用を受理する。モデル規模と拡張推論はこのギャップを縮小するが、解消はしない。推論努力を高く設定したGPT-5.4でさえ、裁判所意見書ではピンポイントの不一致の40%、準備書面では18%を見逃す。引用ページでの支持を検証するようにモデルにプロンプトを与えると再現率は向上するが、偽陽性率も上昇する。正しい法的トピックを認識することと、引用された命題の支持を検証することは別個の能力であり、現在のモデルはこれらを混同している。
マルチモーダル大規模言語モデル(MLLMs)は目覚ましい進歩を達成している一方で、視覚的理解と生成は通常、 divergent な目的として扱われている。既存の統一フレームワークは、離散的な視覚トークン化や拡散目的に依存することが多く、その生成ターゲットは視覚理解モデルが消費する連続表現とは異なるため、既存の事前学習済みMLLMを強化するための直接的な転移は容易ではない。本研究では、視覚生成を表現学習のための補助的監督として再解釈する、生成誘導型訓練フレームワークGASを提案する。具体的には、GASは分離型Mixture-of-Transformers(MoT)アーキテクチャ内で、次エンベディング予測(NEP)をクロスモーダル生成パラダイムとして適用する。共有下部トランクと並列上部層を維持することにより、GASは生成損失が共有視覚経路をより細かい空間精度とより強い視覚保持で豊かにする一方で、上部の理解層を生成勾配から直接的には遮蔽する。この相乗効果を最大化するため、さらに、単なる一般的な合成ではなく深い認知基盤を必要とする高度に相関した生成タスクを構築する。モデル規模と訓練段階を通じて、GASは総合的なマルチモーダル理解を改善し、特に知覚と空間理解において最も確実な利得をもたらす。重要なことに、補助的な生成ブランチは訓練後に破棄されるため、これらの利得は推論オーバーヘッドを一切生じない。広範な対照比較と表現レベルの分析により、生成誘導型訓練が理解にいつ、なぜ有益であるかがさらに解明され、生成誘導型訓練がより強力なマルチモーダル理解への実用的な経路としての実現可能性が示される。