翻訳付きの日次キュレーションされたAI研究論文
ターミナルベースのコードエージェントが普及するにつれ、エージェントのトラジェクトリは大規模に蓄積されてきたが、現実的で実行可能な環境は依然として不足している。しかし、エージェントのポストトレーニングが実際に必要とするのは環境である。各環境は再クエリすることで多くの検証可能なタスクに変換でき、実行フィードバックを提供する。一方、トラジェクトリは単一の凍結されたデモンストレーションにすぎない。我々は、環境をゼロから生成する代わりに、既存のトラジェクトリ内のツール実行履歴が、その実行環境の構造と内容を明らかにすることに着目する。これにより、トラジェクトリ自体からそれらの環境を再構築することが可能になる。そこで我々は、各トラジェクトリを再利用可能な環境に変換し、それを探索して新しいタスクの合成と継続的なインタラクションを行うフレームワーク、Terminal-Universeを提案する。具体的には、Terminal-Universeはトラジェクトリに記録されたファイル操作をリプレイし、エージェントが変更する前の各ファイルを復元することで部分的なワークスペースを得る。その後、補完エージェントが欠落しているファイルと依存関係を供給する。この復元されたワークスペース上で、元の意図タスクを再構築すると同時に、完全に新しいタスクも合成する。さらに、我々はタスクの拡張を「広さ」と「深さ」という補完的な2つの軸に沿って行う。広さの軸では、関連する環境間の有向依存関係をマイニングし、実世界の開発で開発者が日常的に行うように、複数のコードベースにまたがるワークスペース横断クエリを合成する。深さの軸では、初期のシングルターンクエリを、ユーザーエージェントによる反復的なユーザーフィードバックと要件の洗練を捉えるマルチラウンドセッションへと拡張する。公開されているターミナルエージェントのトラジェクトリに適用したところ、Terminal-Universeは37.3k個のタスク実行に十分な環境を生成した。このコーパスを用いたQwen3.5-27Bの教師ありファインチューニングにより、Terminal-Bench 2.1のシングルラウンド性能は11.9ポイント、EvoCode-Bench v2 MT@4のマルチラウンド性能は13.8ポイント向上した。
我々はLLaDA-Imageを紹介する。これは、スクラッチから訓練された6B拡散トランスフォーマー(DiT)と、LLaDA2.0-Mini拡散言語モデルのバックボーン上に構築された凍結済み視覚言語理解モジュールを組み合わせた統一フレームワークである。最初から画像・テキストのペアデータに大きく依存するのではなく、まず画像のみによる事前学習と中間学習を通じて、強い視覚的生成事前分布を構築する。生成パイプラインは2億2,000万サンプルで構成され、そのうち98枚が実画像である。効率的かつスケーラブルな最適化のために、DiT全体でパラメータフリーのRMSNormを、Muonオプティマイザと併せて使用する。その結果得られた統一モデルは、細粒度の編集指示に正確に従いながら、極めて写実的な画像を生成する。さらに、LLaDA-ImageをLLaDA-Image-Turboへ蒸留し、2〜4サンプリングステップでの高速推論を可能にする。Qwen-Image-Benchでは、LLaDA-Imageは英語トラックと中国語トラックでそれぞれ総合スコア53.53と53.38を達成し、両トラックでオープンソースモデルの中で新たな最先端を記録した。高性能かつ効率的な生成モデルに関するさらなる研究を支援するため、我々はモデルの重み、学習コード、詳細なレシピを公開する。
大規模言語モデルは広範な能力を提供するが、進化し続けるドメイン、ツール、要件への適応には、しばしば反復的な事後トレーニングが必要となる。自律システムは、更新候補を提案し、トレーニング候補を生成し、評価フィードバックを用いて後続の提案を選択することにより、このプロセスの一部を自動化する。証拠が蓄積されるにつれて、中心的な問題が浮上する:後続のトレーニングによって親モデルが変更された後、過去のどの更新証拠が依然として実行可能なのか。更新の効果は、その親モデル、データ、およびトレーニング段階に依存する。過去の成功を文脈非依存の許可として扱うことは、計算資源を無駄にする可能性がある。結果として得られる子モデルが昇格した場合、その後のトレーニング軌道を悪化させることもあり得る。本稿では、この問題を条件付き経験転移として定式化し、重み変更トレーニングの前に経験の再利用を許可する手法である境界較正介入転移(BCIT)を紹介する。BCITは観測された効果をその発生源の文脈に結び付け、適用条件を検証し、名前付きのハード競合を持つ候補を拒否し、必要な場合には制限付きトレーニング試行を通じて現状の証拠を取得する。完全にトレーニングされた候補であっても、共通の採用規則に直面し、観測されたイベントのみがメモリを拡張する。金融推論、テキストからSQLへの変換、関数呼び出しに適応させた1つの4Bモデルにおいて、候補更新は評価された文脈全体にわたって異質なターゲット効果と保持効果を示した。整合された候補、証拠、計算資源の下で、BCITは評価された代替手法と比較して、有害な更新を許可する回数が少なく、同一予算での最終モデル品質が高い。これらの結果は、自律的事後トレーニングにおいて経験許可を独立した問題として扱うことを支持するものである。
大規模言語モデルは、長大な推論を必要とするタスクで優れた性能を発揮するが、そのような長い思考連鎖はKVキャッシュを深刻なメモリボトルネックにする。既存のKVキャッシュ圧縮手法はすべて同じパラダイムを共有している。すなわち、キャッシュされた各トークンを、後でどれほど重要になるかの推定値でスコアリングし、上位スコアのものを保持する。我々は、この選択シグナルがほとんど寄与しないことを示す。Random Attentionは、プロンプトを保持し、各アテンションヘッド内ではスコアを一切計算せずに、(プロンプト以外のトークンを)一様ランダムに破棄する。この手法は、4つのモデルと6つの推論タスクにおいて既存の最強の破棄手法と同等の性能を示し、しかもvLLMデプロイメントではその手法より32〜43%高いスループットを実現する。制御実験はこの理由を次のように説明する。第一に、プロンプトはキャッシュの中で脆弱な部分であり、選択手法間の性能差の大半は、その選択シグナルがたまたまプロンプトを保持したかどうかにすぎない。第二に、推論トレースは、テキスト内の冗長性(モデルは作業を進める中で、引き続き必要となる内容を言い直す)と、アテンションヘッド間の冗長性(各ヘッドがトレースのコピーを独自に保持する)という2つのレベルでの冗長性によって、破棄から自己防衛する。したがって、プロンプトが安全に保持されれば、ランダムな抽出でもモデルがまだ必要とするものの十分なコピーが残り、それらを選ぶためのスコアは不要である。我々のコードは https://github.com/SalesforceAIResearch/Random-Attention で公開されている。
圧縮されたコンテキストは、その消費先が言語モデルであっても、通常は人間可読なテキストや、デコードを必要とするレンダリング画像として運ばれる。我々はLatentPressを提案する。これは会話履歴や長文ドキュメントを第3の表現、すなわち連続メモリトークンとして書き込むものであり、凍結されたデコーダは入力埋め込みインターフェースを介してそれを直接読み取り、推論時にテキスト再構築を必要としない。読み手に適合する小型ライターは、アダプタのみを訓練することで(4.2M〜26.2Mパラメータ、デコーダの約0.1%)、4〜16倍の圧縮を行う。LongMemEvalでは、LatentPressは7.70倍の圧縮時に精度0.504を達成し、未圧縮のエビデンスの0.490を上回った。これはテキスト要約(0.184)やOCRベースの圧縮(0.426〜0.312)も凌駕する結果である。LongBench-QAでは、ドメイン内ライターは4〜8倍の圧縮時には生コンテキストの読み取りと同等以上となり、16倍では生コンテキストに及ばない。書き込みは会話1件あたり43msであり、テキスト要約やOCR再構築より約1桁高速である。また読み取りは、生コンテキストやキャッシュ済みOCRより5〜9倍高速である。我々はこのインターフェースを2つの転移設定、すなわちUltraChatからLongMemEvalのメモリ型QAへのゼロショット転移と、LongMemEval由来のQAから未見のLongBench文書ドメインへの転移において検証し、直接的なソフトトークンがテキストやビジョンを超えた実用的な機械向けコンテキストインターフェースとなることを確立する。実験の実装は https://github.com/xuyd16ai/context_softtoken_compress で入手できる。
ハイブリッドLLMは、ソフトマックスアテンションと、Gated DeltaNet(GDN)に代表される線形アテンション層を組み合わせる。線形アテンション層のリカレント状態は、文脈を固定サイズの要約に圧縮する。Qwen3.8-27B(48個のGDN層と16個のアテンション層)に対するコミュニティ初期の4ビット量子化では、再帰における誤差が長いコンテキストにわたって蓄積するという直感から、GDNブロック、特にその減衰(decay)ゲートと書き込み強度(write-strength)ゲートが8ビットまたは16ビット精度のまま残されていた。我々はこの直感を検証するため、GDNを含む全496個の線形層をNVFP4 W4A4で量子化したMinimaを構築した。4K/32Kでのパープレキシティ、MMLU-Pro、GSM8K、AIME'25、GPQA-Diamond、LiveCodeBench、64KまでのRULER検索の各指標において、Minimaは乱数シードによるばらつきの範囲内でBF16と一致する性能を示し(5タスク平均-0.52)、しかも比較対象としたレシピの中で最小(17.5 GiB)かつプリフィルが最速(+14〜19%)である。さらに、32Kでのパープレキシティの差は、位置が進むにつれて縮小する。4つのパートからなるメカニズム研究がその理由を説明する。(i)NVFP4の16要素単位ブロックスケーリングは残差ストリームの極端な外れ値を局在化させ、層の役割間で活性化誤差を均等化する。(ii)壊れやすいと想定されていたゲート射影は、実際には最も誤差の影響を受けにくい。softplus/指数関数およびシグモイドによるパラメータ化は、約11%のGEMM誤差を約2%の出力誤差へ圧縮する。(iii)デルタ則の再帰は、注入されたノイズを32Kトークンにわたって平坦なプラトーに保ち、状態へのインパルスは数百ステップ以内に忘れる。これは、各書き込みが現在のキー方向に沿って状態を上書きするためである。(iv)トークンごとの量子化コストは累積するのではなく、コンテキストの増加とともに減衰する。さらに我々は、モジュール単位でキャリブレーションされたNVFP4チェックポイントを、それらのモジュールを単一のGEMMに融合するカーネルで処理する際に生じる大域スケールの不整合を修正し、キャリブレーション済みFP8 KVキャッシュスケールが性能コストを生じないことも示す。結論として、本手法は「すべてを量子化し、KVスケールを同梱する」という実用的なレシピと、ハイブリッドLLMの再帰側が量子化しやすい側である理由に関する機構論的説明を与える。チェックポイント: https://huggingface.co/minima-ai/mnma_qwen3.8_27b_nvfp4
オン方策蒸留(OPD)は、生徒が生成したロールアウトと、教師からのトークンレベルでの密な教師信号を組み合わせる手法である。既存研究は主にそのアルゴリズム的な振る舞いを対象としており、訓練データの役割は不明のままである。本稿では、単一のクエリで訓練するというデータ最小の極限において、その役割を検証する。ワンショットOPDは数百ステップにわたり改善し続け、タスク領域やモデルファミリーを問わず、フルデータOPDの利得の大部分を回復する。この結果を、訓練中に訪問される状態と、生徒が教師に整合していく速度とによって説明する。我々は状態カバレッジ、すなわちフルデータOPDが訪問する状態のうち、あるクエリ集合のロールアウトが到達する割合を測定する。単一のクエリでもすでに71.5%に達し、その大部分は最初の100ステップ以内に訪れる。意味的に異なるクエリを追加すると、カバレッジと検証精度はともに上昇し、16クエリで98.9%に達してフルデータ訓練に一致する。一方で、整合の速度は、OPDが単一クエリで訓練されるかデータセット全体で訓練されるかに関係なく同程度に減速し、固定された状態集合であってもその吸収には数百ステップを要する。したがってOPDは、データは過剰に与えられるものの、アルゴリズムは飢餓状態にある。そのロールアウトは広範な教師信号を急速に露出させる一方で、生徒による教師信号の吸収は次第に遅くなる。この状態カバレッジの結果はマルチ教師OPDにも拡張され、ドメインあたり16の意味的に多様なクエリがフルデータMOPDに匹敵する。さらなるストレステストとして、内容の乏しいテンプレートやドメイン外のWildChatクエリもまた、実際のクエリによるベースラインに近づく。すなわち、タスクの内容と誘発される状態カバレッジは乖離し得る。これらの知見が、今後の研究をOPDのステップ効率に向けさせるとともに、フロンティアのポスト訓練における最近の成功の背後にあるデータとメカニズムの再検討を促すことを期待する。
我々は、外部オフラインモジュールに依存せずに、物理理解、空間シミュレーション、および3D世界の生成と再構築を統合する、統一的なマルチモーダルアーキテクチャであるPuffin-Worldを提案する。3D世界を確実に構築し、それと相互作用するために、我々のフレームワークは、多様なタスクと柔軟なモーションをサポートする統一的Omni-Camera表現とともに、物理(重力場と緯度)、幾何(深度)、外観(画像)という3つの固有の世界状態を共同でモデル化する。これらの状態のモデル化に加えて、将来フレームにわたって物理ダイナミクスを伝播させる戦略を導入する。絶対的なカメラ特性を実世界にグラウンディングすることにより、Puffin-Worldは物理的に一貫性があり視覚的に安定した世界生成を可能にする。さらに、単一の生成プロセス内で外観と幾何を結合し、各将来ビューの合成とその基盤となる幾何の再構築を共同で行う。この統合的パラダイムにより、模倣や自己校正型の世界探索など、複数のタスク間の相乗効果を必要とするインターリーブ型クローズドループアプリケーションが可能になる。Puffin-Worldを複雑なシナリオに拡張するため、多様かつ困難なモーションを特徴とする1500万の視覚・言語・カメラトリプレットと100万のトラジェクトリから構成されるPuffin-16Mを構築した。この分野のさらなる研究を促進するため、コード、モデル、およびデータセットを公開した。
オンライン3次元再構成モデルは長い動画では性能が低い。これは、ポーズを固定された最初のフレームのアンカーに相対的に回帰するため、学習分布をはるかに超える外挿を強制されることに起因する。小さなドリフトが蓄積・増幅され、深刻な幾何学的崩壊に至る。しかし、この破綻を通じてフレームごとの深度は安定したままであることを我々は観察する。バックボーンの局所的な幾何構造は無傷のままであり、大域的なポーズヘッドのみが破綻する。この分離に着想を得て、我々はScal3Rを提案する。本手法はオンライン再構成を、複数の過去のキーフレームに対する相対ポーズのクエリとして再定式化する。我々は、パラメータの約1%を占める軽量な学習可能トークンを用い、非対称アテンションにより完全に凍結されたバックボーンへ注入する。この設定は、複数の過去のキーフレームに相対するポーズをクエリする。ループ閉じ込みを備えたオンラインポーズグラフ最適化システムが長距離ドリフトを抑制する。Scal3Rは単一GPU上で8時間で収束する。KITTIでは、オンラインベースラインと比較して平均ATEを60%以上削減する。また、Virtual KITTI、Sintel、TUM-Dynamic、ScanNet、7-Scenes全体で最先端の性能を達成する。プロジェクトページ: https://linjohnss.github.io/scal3r/
GPT-Image-2やNano-Bananaのような拡散ベースモデルは、際立った視覚表現力を示す一方で、そのエンドツーエンド生成は本質的に、誤りを含みやすいテキストを伴う平坦化されたビットマップを生成し、レイヤー単位での後編集を妨げる。対照的に、コーディングエージェントによるコードベースの視覚生成は、精密なレイアウト制御と分離されたレイヤーを提供するが、全体的な美的直感の欠如や、複雑なビジュアルアセットをコード化することの難しさによって制約を受けたままである。 この課題に対処するため、我々はコーディングエージェントによって駆動される新しいパラダイム、Editable Visual Designを提案する。VLMを要求理解・タスク計画・美的判断のための「クリエイティブブレイン」と位置づけ、一方で画像生成モデルをオンデマンドの「視覚世界シミュレータ」として活用し、独立したビジュアルアセットを合成させる。エージェントは「まず想像し、その後行動する」というクローズドループのワークフローの下で、単体のアセットを生成し、ネイティブなHTML/CSSを記述し、視覚的なレンダリングフィードバックに照らしてデザインを反復的に改善する。 さらに、Agent Design Replayは、プロフェッショナルな人間デザイナーのそれに類似した創造的・推論的軌跡を忠実に再現する。最終的に、本システムは分離されたレイヤーと実テキストを備えた編集可能なアーティファクトを提供し、ユーザーはグラフィカルユーザインターフェース上で直感的なマウスドラッグやレイアウト調整を行うことができる。ポスター、インフォグラフィック、その他のシナリオにおける検証により、本パラダイムが洗練された美的品質と本番品質の編集可能性の両方を達成できることが示された。
音声と映像の統合生成モデルは、映像品質と音声・映像同期の点で大きな進歩を遂げてきた。しかし、ショット遷移が発生するタイミングや台詞が発話されるタイミングを制御する余地は依然として限られている。この制約は、脚本駆動型のコンテンツ制作への応用を妨げるものであり、そこではタイミングの誤りが物語の一貫性や視聴体験を損ない得る。現在の統合生成モデルは、映像と音声の表現を共有の時間軸上で整列させるが、構造化プロンプトに指定されたショットと台詞の正確なタイミングは、プロンプトのテキスト表現にのみ符号化され、映像・音声のいずれのモダリティの時間座標とも整列されないままである。その結果、映像と音声は互いに同期したままであっても、その両方が脚本のタイムラインに従わない可能性がある。この不一致が、時間的整列を映像と音声の枠を超え、構造化脚本まで拡張する動機を与える。そこで我々は、Temporal Context Routing(TCR)を導入する。これは、脚本のタイミングを映像・音声生成の共有時間軸上に写像し、各プロンプトのガイダンスを両モダリティの対応する位置へルーティングする。200本のテスト用脚本を用いたベースラインとの比較では、TCRはショット境界MAEを96%削減し、1.11秒から0.042秒へ改善するとともに、Dialogue Acc@0.5秒を28.3%から84.1%へ引き上げる。TCRはこれらの改善を、ベースラインと同等の映像品質と音声・映像同期を維持したまま達成する。さらにユーザー調査では、参加者は評価された5つの全次元においてTCRを選好することが示された。
ストリーミング動画理解には、マルチモーダル大規模言語モデル(MLLM)が、厳密な因果性と限られたメモリ容量の制約下で、連続的な視覚入力を処理し、ユーザーのクエリに応答することが求められる。既存の手法は通常、過去の観測を外部メモリバンクに圧縮して保存し、クエリに関連する証拠を追加の視覚的文脈として取得する。この保存・取得パラダイムは効果的ではあるものの、履歴の証拠を外部の視覚的文脈として維持するため、それを、ストリーミング推論を継続的に導くことができるコンパクトで進化する潜在記憶へと内面化することを妨げている。このギャップを埋めるために、我々はLatentStreamを導入する。これは、ストリーミングメモリを「保存・取得」から「取得・内面化」へと転換する、漸進的潜在作業記憶フレームワークである。具体的には、LatentStreamは3つの連携した構成要素から成る。まず、クエリ非依存の階層的ストリーミングメモリ(Query-agnostic Hierarchical Streaming Memory)は、Jenksガイドによる適応的統合を通じて、固定メモリ予算の下で視覚履歴を短期・中期・長期のレベルに整理する。クエリが到着すると、階層的潜在記憶進化(Hierarchical Latent Memory Evolution)は、潜在記憶トークンのグループに漸進的に拡大する記憶受容野を装備させ、それらが対応するスコープから履歴証拠を反復的に取得し、それをコンパクトで固定長の潜在記憶へと内面化できるようにする。最後に、漸進的信頼度ガイド型潜在記憶最適化(Progressive Confidence-guided Latent Memory Optimization)は、グループ単位の予測エントロピーから階層的進行報酬を構築し、潜在記憶トークンと取得された証拠を共同で洗練することで、ますます確信度の高いストリーミング推論を促進する。広範な実験により、LatentStreamは既存のオンラインおよびオフラインのビデオベンチマークにおいて新たな最先端結果を達成することを示す。
MLLMベースの埋め込みモデルは構成的検索において依然として限定的であり、同じ概念を含みながらも異なる属性-オブジェクト結合を持つシーンを区別できないことが多い。しかし、同じバックボーンは交差注意型リランカーとして用いるとそのような区別を解決できるため、その構成的判断を埋め込みモデルに蒸留する動機付けとなる。我々はCOREを提案する。COREは5つの構成的マッチングレベルにわたる候補リストを合成し、埋め込みモデルがリランカーのきめ細かいランキングを再現するように訓練するRank-KL目的関数を導入する。さらに、段階的評価プロトコルを導入し、同じデータとチューニング予算の下で、対比学習、ペアワイズCoSENT、リストワイズRank-KLを比較する。この比較により、CoSENTとRank-KLの両方が対比学習よりも多段階の教師信号を効果的に活用しており、Rank-KLが全体的に最も強い性能を達成することが示される。3つの構成的推論ベンチマーク(COLA、SUGARCREPE++、NEGBENCH)において、CORE-RERANKER-8Bは総合平均82.7%を達成し、Jina-Rerankerを10.7ポイント上回る。一方、CORE-EMBED-8Bは評価対象となったすべての埋め込みモデルの中で最高の総合平均(0.666)を達成する。これらの改善はMCMRベンチマークにも転移し、COCOおよびFlickr30Kにおける検索性能を犠牲にしない。
検証可能な報酬からの強化学習は、タスクにプログラムによるチェッカーが存在する場合に有効であるが、長期的なエージェント領域のほとんどにはそのようなチェッカーは存在しない。我々は、真の成功シグナルが得られないoutcome-blind設定に取り組む。多基準ルーブリックは、そのような報酬を供給する一般的な方法である。ルーブリックは軌道ごとに一度だけ採点されるが、単一のスカラー値は数十ステップにわたるシグナルとしては貧弱である。我々は、クレジット最適化のためのルーブリックベースのアドバンテージ分配手法であるDRACOを提案する。DRACOは、トレーニング中にルーブリックを動的に生成してポリシーの進化する能力を追跡し、完了した軌道ごとにそれらのルーブリックを一度採点し、注釈付きルーブリックに対応するステップ群にその判定を再分配することで、GRPOにおいてステップごとに区別されたアドバンテージを生成する。この再分配は閉形式であり、学習される帰属モジュールを一切導入しない。AppWorldでは、DRACOは自身ではいかなる検証器も使用しないにもかかわらず、ベースモデルを15.9ポイント、スパースな真の報酬で学習したGRPOを5.3ポイント上回る。ドメイン外のTau-Benchでは、フロンティア級の判定モデルなしでもベースモデルを5.3ポイント上回り、真の報酬による学習や他のルーブリックベースの学習設定の両方を凌駕する。DRACOのコードはhttps://github.com/IBM/dracoで公開されている。
パーソナライズされたアシスタントは、ユーザーの要求に従うだけでなく、その要求がユーザーの現在の状況を考慮して適切かどうかを判断すべきである。しかし、既存研究は主に要求を正確に実行することに焦点を当てており、アシスタントが文脈を考慮し、競合に基づく拒否を行う必要性を見落としてきた。さらに、既存の競合検出や安全性検出の研究は明示的に提供された要因に依存しているが、実世界のシナリオでは、知識ベース(KB)から取得しなければならない暗黙的な要因が関与することが多い。そこで我々は、一見合理的に見えるユーザー要求を不適切にする潜在的な制約(一人称視点の知識や出来事として表現される)をモデルが識別できるかを評価するためのデータセット、Personalized Assistants for Conflict Evaluation (PACE) を導入する。PACEは、明確に定義されたペルソナに基づくユーザー要求と一人称視点のKB事実をペアにし、モデルが文脈上の証拠を統合して要求が競合しているかどうかを判断することを要求する。この暗黙的な検索設定は、ユーザー要求と競合を誘発する知識との直接的な関連付けを妨げるため、既存モデルが関連するユーザー固有の事実を特定することを困難にしている。この課題に対処するため、我々はさらにPaceMakerを提案する。これは、特殊化されたエージェントがクエリ再構成、マルチホップグラフ探索、競合を考慮したフィルタリングにわたって連携し、文脈上決定的な証拠を検索するマルチエージェントフレームワークである。PACEでの実験では、証拠検索の質と競合判定の精度の両方を評価し、PaceMakerが既存手法を一貫して上回ることを示している。
コーディングエージェントは現在、SWE-benchファミリーのベンチマーク群で評価されることが一般的である。そこでのタスクは、長く、構造化され、情報量が豊富なGitHub issueを厳選して構築されている。しかし、実際のユーザーのリクエストは通常、はるかに短く、構造化が不十分である。この乖離を特徴づけるために、我々は6カテゴリからなる情報分類法と言語スタイルの4次元を定義し、SWE-chatの実際のユーザープロンプトとSWE-bench VerifiedおよびProの問題文に適用した。その結果、問題文のみ、あるいは問題文に加えて限られた追加文脈しか含まないリクエストが、実際のプロンプトの88%を占める一方、ベンチマーク問題ではわずか7%にとどまることが分かった。さらに、実際のプロンプトの87%はくだけた文体で書かれているのに対し、ベンチマーク問題の94%はフォーマルである。これらの観察結果に基づき、我々は、SWE-bench VerifiedおよびProから派生した、複数のバリアントを持つ381のタスクファミリーからなるRealSWEを提案する。各ファミリー内のバリアントは、同じ基礎タスクとゴールドパッチを共有し、情報構成と言語スタイルのみが異なる。RealSWEを用いて7つの最新LLMを評価したところ、次のことが明らかになった。i) 現実的な入力は解決率を平均6.4パーセントポイント低下させ、モデルの順位を変え得る。さらに、統制分析により、ii) 望ましい動作と動機を含めることは性能に有意な影響を与える一方、環境情報と再現手順は測定可能な利益を伴わずにトークンを追加するだけであること、またiii) 言語スタイルの影響は小さく、モデルに依存することが示された。これらの知見は、ユーザーとエージェントに対して実行可能な指針を提供する。実際のプロンプトのほとんどが省略している望ましい動作と動機を明示的に記述することで、LLMのソフトウェアエンジニアリング性能は大幅に向上する。
カメラ条件付きワールドモデルは、指定されたアクションが期待されるシーン変化を引き起こす一方で、外観・幾何・時間的ダイナミクスの一貫性を保つインタラクティブ動画を生成する。既存の報酬はこれらの要件を別々に評価する。すなわち、幾何学的報酬は軌跡の実行を推定できるが、実行されたモーションの視覚品質を判断できず、画像ベースの報酬はフレーム品質を測定するものの、アクションの実行や時間的ダイナミクスを捉えられない。我々は、視覚言語モデル(VLM)がアクションをその視覚的結果に関連付けるための共有推論空間を提供すると考える。しかしながら、完全な長い動画をその全アクション系列と照合して判断することは、長大でノイズの多いコンテキストを生み出し、その中で短時間の局所的なアクション証拠が見落とされたり希釈されたりする可能性がある。我々は、カメラ条件付きワールドモデルに対するアクション一貫性と視覚品質評価を統合するVLMベースのペア選好報酬モデルであるWorldRewardを提案する。WorldRewardは、ペアの動画をアクション対応チャンクに分解し、各チャンクを構造化された視覚的証拠に整理し、チャンクレベルの決定を投票により集約して、動画レベルのアクション選好と視覚品質選好を別々に導出する。これを訓練するために、我々は、フロンティアVLMによって生成され、ツールベースのエージェント監査と対象を絞った人間によるレビューを通じて精緻化された構造化判定を用いて、大規模な推論拡張選好データセットを構築する。さらに我々は、アクション一貫性・外観品質・モーション品質の各側面における報酬モデルと人間の選好との一致度を測定する、人間アノテーション付きベンチマークであるWorldReward-Benchを導入する。WorldRewardは、これら3つの次元すべてにおいて最高の一致度を達成し、GPT-5.5をそれぞれ3.42、1.45、3.56パーセンテージポイント上回る。HY-WorldPlay 1.5のRLポストトレーニングに使用すると、短期から長期にわたるホライズンで、アクション実行と視覚品質の両方を一貫して改善する。
科学の進歩のためには、最先端モデルの限界を試すベンチマークと、失敗事例を明らかにする評価手法が必要である。モデルの性能が向上するにつれて、機械翻訳の標準ベンチマークは飽和状態に近づきつつある。さらに、自動翻訳評価指標は信頼性が低く、報酬ハッキングの影響を受けやすく、改善の指針にならない評価しか提供しない。また、ゴールドスタンダードとされる人手評価でさえ問題がないわけではない。人手評価は再現性、客観性、スケーラビリティを欠くことが多いからである。こうした問題は、機械翻訳分野における客観的な進歩の追跡と、改善への道筋の特定を妨げている。 本稿では、人間が作成し査読を経た、最先端の機械翻訳モデルの翻訳を誤らせる事例(テキスト、画像、音声、動画)を収録したLast Translation Benchmark(LTB)を紹介する。さらに、新たな評価手法も提示する。各事例には、その事例で生じる具体的な失敗パターンを記述した人手作成の検証ルールが付属しており、それにより、信頼性が高く、具体的な改善につながる今後の評価が可能になる。 Last Translation Benchmarkは、継続的な投稿を受け付けるライブデータセットである。最新版はLTBv1であり、2026年9月1日より前に受理された投稿が収録されている。今後も新しいデータが継続的に収集されるのに伴い、将来のリリースが予定されている。
我々は、ソースビデオをターゲットカメラ軌道に沿って数秒で再撮影する、少数ステップ生成レンダリングフレームワークである FlashRender を提案する。既存の多段階生成レンダリングモデルにおける離散化誤差の顕著な現れとしてサンプリングステップ数に依存するカメラ制御を特定し、この不整合を解消することでデノイジング軌道の曲率が大幅に低下し、その後のステップ蒸留が容易になることを示す。この目的のために、凍結された視覚幾何モデルからのターゲットビデオの特徴量と、ソースビデオの隠れ表現を整列させる表現変換と整列(RETA)を導入する。これにより、ソースビデオのストリーム内に幾何学的変換が直接エンコードされ、サンプリングステップ間で一貫したカメラ制御が可能になる。次に、RETA によって誘導される低曲率のデノイジング軌道上で MeanFlow 目的関数を用いてモデルをファインチューニングし、離散化誤差により効果的に対処できるようにする。最後に、固定された少数ステップサンプリング下での自己ロールアウト誤差を修正するため、オン方策フローマップ蒸留を適用する。広範な実験により、RETA、MeanFlow、オン方策フローマップ蒸留が、少数ステップ生成レンダリングにおいて補完的な役割を果たすことが示される。これらを組み合わせることで、提案手法は、分布外のターゲットカメラ軌道下でも、サンプリングコストを25分の1に抑えつつ、映像品質と幾何学的整合性において多段階ベースラインに匹敵し、優れたカメラ制御性を達成する。
エージェントの行動を理解するには、数千もの軌跡にまで拡張でき、事前に構築された分類器では対処しきれない、長くしばしば馴染みのないタスクに現れる新たなパターンを浮き彫りにする手法が必要である。本稿では、社会科学における60年の歴史を持つ質的手法であり、明確な理論的飽和基準と、データから理論に至る監査可能な証跡を備えたグラウンデッド・セオリーを、エージェントの軌跡分析に導入することを提案する。我々は、グラウンデッド・セオリーに基づく自動トレース分析であるAutoTraceGT(Automated Trace analysis through Grounded Theory)を提案する。これは、エージェントの軌跡に対するグラウンデッド・セオリーの適用を自動化する初のマルチエージェントパイプラインである。AutoTraceGTは、理論的飽和に達するまでオープン・コーディング、アクシャル・コーディング、理論的コーディングを反復実行し、各タスクに特化した行動分類体系を生成する。6つの軌跡コーパスにわたって、AutoTraceGTが生成するコードブックは、人間がアノテーションした分類体系に含まれる障害モードの73〜91%を検出し、さらにその分類体系では見落とされていた追加のパターンを表面化する。創出された理論的ナラティブは、従来の専門家による記述と整合する。コードブックを演繹的特徴空間として用いると、下流の障害予測において、ゼロショットおよびフューショットのLLMベースラインを上回る性能を示す。これらの結果は、グラウンデッド・セオリーが、エージェントが実際に行う行動を研究するML研究者やエージェント開発者にとって、スケーラブルな分析ツールを提供することを示唆している。
インタラクティブかつ検証可能な環境のスケーリングは、ターミナルエージェントの訓練にとって極めて重要である。フロンティアモデルが高性能化するにつれ、ゼロから合成された環境は挑戦的でなくなり、学習シグナルが限定的になる。近年の共進化手法は、ロールアウト中に顕在化した弱点に基づき、モデルの学習可能なフロンティア近傍の環境を反復的に合成する。しかし、これらの手法はオン方策ロールアウトに依存するため、モデルが強くなるにつれて汎化と学習シグナルの継続的な提供が制限される。本論文では、環境進化を提案する。これは、オフ方策で環境の難易度を段階的に高め、訓練中に進化した環境を世代ごとにスケジュールすることで、継続的な学習シグナルを提供する。我々は、マルチターン学習目的から環境難易度に影響を与える3つの進化方向を導出し、ループを組み込んだマルチエージェントハーネスを通じてこれらの方向に沿った進化を実装する。Hy4 preview、Claude Opus 5、GPT-5.6 Solを用いた定量的ロールアウト実験は、環境進化が一貫してより困難な環境を生成することを示す。また、Qwen3.6-27BおよびQwen3.6-35B-A3Bに対して、簡素なロングホライズンRL訓練を通じてその有効性を検証し、Terminal-Bench 2.1における性能をそれぞれ14.4パーセントポイントおよび18.0パーセントポイント向上させた。
動画モデルにおける物理的推論の評価は、絶対的な運動測定がフレームレート、物体スケール、カメラキャリブレーションに依存し、それらが生成動画では曖昧または利用不可能であることが多いため困難である。本研究では、異なるアプローチを提案する。同一シーン内の2つの物体が同じ物理法則に従う場合、それらの運動は予測可能な関係を満たさなければならず、この関係はキャリブレーションとは独立に成立する。我々は、対となる物体間の関係的一貫性を通じてニュートン力学を評価するベンチマークPrincipiaを導入する。Principiaは、制御されたプロトコルで記録された実世界シーンを用いて、並進・回転・衝突・振動のダイナミクスにわたり、重力、反発、摩擦、回転慣性、投射運動、運動量、振り子、質量-ばね振動の8つの現象を網羅する。また、物理則違反を画像空間で直接定量化する、キャリブレーション非依存の整合性スコアも導入する。6つの最先端動画生成モデルによる数千の生成結果において、全モデルがVBenchで約0.8を記録しているにもかかわらず、Principiaで0.42を超えるモデルはなかった。視覚言語モデルについては、物体間の関係における物理則違反を検出する能力を評価したところ、最高性能のモデルでも精度は67%にとどまり、大半のモデルは偶然水準に近い性能であった。
長時間動画言語モデルはすべてのフレームを参照できるわけではない。1秒に1回サンプリングした1時間の動画は3,600枚の画像となり、システムはそのプールの中から小さな固定スライスだけを保持する。どのフレームがそのスライスに残るかは通常、前処理の細部と見なされるが、我々はそれがそう見なされるべきかを検証する。既存のフレーム選択手法は、フレームのスコアリング手法、プロンプト境界、解像度ポリシー、応答モデルを一度にすべて変更するため、比較を困難にしている。我々は各要素を固定し、選択、空間圧縮、そして削減分の再投資という1つの決定のみを一度に変えて、学習を必要としない6種類の選択規則、3つの長時間動画ベンチマーク、2つの応答モデルにわたって評価する。選択は単一の要因として最大の影響を持つ。LongVideoBenchの1時間区分では、クエリ選択された8フレームが均等間隔の16フレームを6.9ポイント上回り、改変されていない数十年前のスパース近似アルゴリズムである直交マッチング追跡(Orthogonal Matching Pursuit)は、比較対象としたすべての専用設計セレクタに対して、3つのベンチマークすべてで同等か、1ポイント以内の差に収まる。圧縮はほぼコストなしである。タイムスタンプを固定したまま各フレームの空間予算を半分にしても、そのコストは最大0.44ポイントにとどまる。再投資こそ、その予算を精度へと還元する場である。解放されたトークンを、元の8枚と同程度以下の測定コストで、2倍の数の圧縮フレームに費やすと、さらに2〜3ポイントの改善が得られる。圧縮の利得は、その節約分をこのように使ったときにのみ現れる。その過程で、私たち自身のAKSベースラインにおける実装バグと、同じ公開規則・同じ予算を実行する2つのハーネス間の0.07〜3.74ポイントの差は、こうした比較が論文間ではなく、統制された単一のハーネス内で行われるべき理由を示している。
事後較正は報告される信頼度を補正するが、多クラス較正器は対応するトップ1予測も変更し得る。精度(accuracy)は、こうした変更が正誤に与える正味の効果のみを捉え、予測がどれほど頻繁に変化するかを捉えない。トップ1予測変化率(TPCR)はその頻度を測定する。我々は、較正済み確率ベクトル全体を修復することにより、トップ1決定の厳密な保存を課す初の適合後アダプタであるCORD(Calibrator-Output Repair for Top-1 Decision Preservation)を提案する。CORDは、元の出力と較正済み出力のみから、元のトップ1に割り当てられた確率質量を決定する。較正済み条件付き分布は残りの質量を他のクラスに配分し、その結果得られる修復済みベクトルのargmaxは元の予測を回復する。較正用分割上では、CORDは、達成可能な場合には常に、較正済み出力が元の予測に割り当てた平均質量を保持するよう、修復済み質量を調整する。このアダプタは、適合済み較正器もその直接出力も変更せず、追加の教師付き写像を学習せず、ユーザーまたは検証によって調整されるハイパーパラメータも必要としない。CIFAR-10/100およびImageNet-1K全体において、CORDは構成上TPCRをゼロにし、すべてのデータセットで対応する直接出力と比較して平均ECE、NLL、ブライアスコアを低減する。この対応のある改善は、分布シフト下および較正セットのサイズを変えた場合でも持続する。したがってCORDは、較正器の適合から保存制約を除去し、元の決定の厳密な回復を後続の出力修復に委ねる。我々のコードはhttps://github.com/labhai/CORDで公開されている。
本研究では、深層ニューラルネットワークをより単純な部分ネットワークに対応する不変集合へと導くことが知られている確率的勾配降下法(SGD)のダイナミクスを考察する。この誘導が時間とともにどのように展開するかは、これまで十分に理解されていない。本稿では、確率的勾配流(SGF)をパーコレーション過程としてモデル化することにより、この問いに答える。この過程では、アーキテクチャの対称性によって、部分ネットワーク群は一つずつではなく、離散的な同時ブロックとして融合することを余儀なくされる。これらの構造的遷移は、巨視的秩序パラメータにおける分散スパイクとして観測され、物理的相転移を想起させる。さらに、このトラップ機構とそれに付随するスケーリングカスケードが、明示的な重尾ノイズモデルの下でAdamおよびAdamWにも拡張されることを示す。
顕微鏡画像における重なり合う細胞のインスタンスセグメンテーションは、半透明構造が弱い境界や重なり領域における混在した視覚的証拠を生み出すため、依然として困難である。既存手法は局所的な関心領域や形状事前情報を通じてこの問題に対処しているが、重なり合うオブジェクトを横断したグローバルな推論が欠如している。我々は、顕微鏡シーンにおける細胞インスタンスの重なりを解消する、新しいクエリベースのモデルQCellを提案する。本アプローチは、(i)潜在空間においてクエリ表現を分解・再結合することで、重なり下での完全なオブジェクト構造の推論を可能にするインスタンス再結合モジュールと、(ii)識別的なインスタンス特徴学習と重なり合う細胞クエリの分離を組み合わせた対照的クエリ整合目的関数を組み合わせるものである。さらに、重なり合う細胞セグメンテーションのための新しいオルガノイドデータセットベンチマークを導入する。QCellが複数のベンチマークで最先端手法を上回り、ISBI2014においてAP+2.2、AJI+2.7を達成することを示す。コードは https://github.com/SlavkoPrytula/QCell で入手可能である。
生成ビデオにおける視覚的流暢さは物理的信頼性を意味するものではなく、単一のスカラー品質スコアだけでは、クリップがどの義務に違反しているのか、あるいはどの時点で失敗するのかを示すことはできない。我々はVeriPhyを提示する。これは監査可能な物理検証システムであり、テキストのみのプランナーが、フレームが観測される前に、プロンプトを型付き物理的義務と静的検証済み実行プランにコンパイルする。実行中、観測は、凍結された低レベルエキスパート(例:セグメンテーションとトラッキング、計数、結果として得られるトラックに対する11種類の型付き物理測定、深度、OCR、音声イベント検出)への宣言済み呼び出しのみをゲートし、そのスコープを制限する。各アクションは、来歴を伴う証拠レコードを返し、そのペイロードは、利用可能な場合、型付き測定値または明示的にタグ付けされた学習状態のいずれかである。型付きリゾルバと固定合成は、利用可能なレコードを、完全な来歴を伴う三値状態(支持、矛盾、未知であり、それぞれ妥当、不合理、棄権として提示される)にマッピングするため、すべての判定はそれを生成した証拠に遡って追跡可能である。評価は、プロンプト参照、空間、時間における実際の生成失敗を特定する、人間が注釈を付けた欠陥レコードからなる1,500クリップのコーパスに基づく。304件のそのようなレコードを含む149クリップのコアセットでは、VeriPhyは228件を説明する。同じクリップと同じ主張を与えられた公開済みの質問分解評価器は164件である。再現率だけでは、同じバックボーンをモノリシックにプロンプトする手法(222件に達する)と区別できない。両者を分けるのは、各決定が自身の証拠レコードと来歴を保持し、トレースを判定単位で監査可能にし、批評者の判定を生成に書き戻すためのインターフェースとして使用できる点にある。
検証可能な報酬を用いた強化学習(RLVR)は、単一サンプル精度(pass@1)を大幅に向上させる一方で、方策の解空間を収縮させ、テスト時スケーリングの効果を減退させる。本研究では、推論軌跡のどの時点でこの多様性が失われるのかを調査する。すなわち、方策は有効な解ファミリーへアクセスできないのか、それとも一度開始された計算の実行に失敗するのかを問う。アクセスと実行を切り分けるため、Qwen2.5-3Bに対するPPOとQwen2.5-3B-Instructに対するGRPOの両方を用いてCountdownタスクを分析する。このタスクの解空間は、最初のオペランドと演算子によって定義される離散的な入口ファミリーへと網羅的に列挙できる。両方の学習設定において、解のカバレッジは最大67%低下し、全チェックポイントで解かれた問題に限っても半減する。この収縮は入口に強く集中していることを示す。すなわち、最初の算術演算より前のトークン単位の尤度変化は、後続の推論中よりも11倍~16倍大きい。未選択の入口プレフィックスのみを与えると、アクセス頻度の低いファミリーの完了率が一桁以上回復する(PPOで0.018→0.212)。これは、代替解が依然として実行可能であるが、もはや開始されていないことを示している。この局在性の知見に基づき、表層的なプロンプティングは多様性の回復に失敗する一方で、入口を標的とした介入は成功することを見いだした。具体的には、後期層のパラメータを初期チェックポイントと補間することで、pass@1を犠牲にすることなく解のカバレッジが37%向上する。最後に、初期ステップのエントロピー崩壊が、7Bおよび14Bモデルを用いた6つの数学ベンチマークで繰り返し発生することを示す。しかし、これは推論最適化の不可避の副産物ではない。SFTベースラインは2倍以上のカバレッジを維持し、SFT→DPO→RLVRの段階的パイプラインは初期ステップのエントロピーを保持する。要約すると、推論の広がりは部屋の中ではなく、入り口で失われる。コード: https://github.com/ershiyidian/early-branch-locking.
音声ブレイン・コンピュータ・インターフェース(音声BCI)は、神経活動を言語に変換することで、麻痺のある人々に発話の回復をもたらす道を提供し、より広くは、自然なヒューマン・コンピュータ・インタラクションの新たな形態を可能にする。しかし、この可能性にもかかわらず、この分野には共通の進歩の尺度が存在しない。なぜなら、システムによって使用するデータセット、記録方法、発話の種類、語彙が異なるため、報告されるスコアはほとんど比較できないからである。この測定問題の背後には、未解決の2つの問いがある:(i)音声BCIは、ユーザーが伝達できるようにすべき単語の分布はどのようなものか、(ii)システムはその分布からどれだけの情報を伝達できるか。本稿では、オープン語彙相互情報量(OVMI)を導出することにより、この2つに対処する。OVMIは、ユーザーが伝達したいと望む可能性のある単語に関する参照分布に対する、デコーダが伝達する情報量を測定する情報理論的量である。これにより、異なる語彙などの異なる条件下で測定された能力を、共通のコミュニケーション尺度で評価することができる。通常報告される精度、単語誤り率(WER)、およびその他の指標は、システムが対応している単語のみを対象に計算されるため、システムがユーザーの意図した発話のどれだけを伝達できるかを過大評価し得ることを示す。次に、OVMIを用いて既存システムを比較し、システムがユーザーの言語のどの程度をサポートするかと、それらの単語をどの程度正確にデコードするかとの間のトレードオフを明らかにする。さらに、こうした比較はユーザーが伝達することが期待される内容に依存すること、そしてOVMIを最大化する語彙の選択によって、3つの音声領域において精度が最大16.3%相対的に改善されることを示す。したがって、OVMIは音声BCIコミュニティに対し、異種のシステムを比較し、語彙設計を改善し、この分野の進歩を測定するための原理に基づいた方法を提供する。