翻訳付きの日次キュレーションされたAI研究論文
再帰的自己改善(RSI)には、AIシステムが自身の能力を観察し、その証拠を次の学習ラウンドへ変換する具体的なメカニズムが必要である。我々はNeoHorse-1を提示する。これは、エージェント的ポストトレーニングを通じてこの道を探求するために開発されたエージェントネイティブモデル群である。本システムは、知的ルーティングを備えた異種モデルプールを組み合わせ、各ユーザーターンについて、予測された能力需要、選択されたサービス層、および後続のインタラクションを記録する。これらの記録は、インターリーブされた推論、ツール呼び出し、およびハーネス文脈を保持する学習例へ変換され、構造検証、6次元意味評価、サブシーン単位のラベリングを通じて採用される。ルーティング信号は、教師あり微調整を3段階のカリキュラムに編成し、ルーティング誘導オンポリシー蒸留へと拡張する。そこでは、教師が同じ進行の下で学生生成応答を監督する。能力誘導型の割り当ては、評価フィードバックを次の学習混合へ変換し、評価-選択-更新ループを閉じる。このループでは、システムが何をすることを学ぶかが、次に何から学ぶかを形作る。ハーネスベースのエージェント、ツール使用、コーディング、指示追従を対象とする11のベンチマークにわたって、ポストトレーニングはマクロ平均を4Bで58.94から64.87へ、9Bで65.60から69.04へ引き上げ、ポストトレーニング済み4Bモデルと9Bベースモデルの間の総合ギャップを大幅に狭める。NeoHorse-1は、このフィードバック駆動プロセスの初期プロトタイプと、連続する反復にわたるハーネス媒介RSIへの道筋を提供する。
我々はAuKを紹介する。これは、自然言語指示と音声コンテキストの共通インターフェースを通じて音声生成と編集を統合するオープンソースの基盤モデルである。この広範な機能セットをサポートするために、我々は約30.3億の指示-音声インスタンスと195万時間の実効的な教師信号を、5つのタスクファミリー(音声生成、内容編集、音声強調と分離、パラ言語編集、音響編集)にわたって構築する。AuKは、意味的条件付けのためのマルチモーダル大規模言語モデル、音響的条件付けのための音声・一般音響・音楽で共同学習されたVAE、そして生成のためにデュアルストリームMMDiTブロックに続いて統合されたシングルストリームDiTブロックを実行するハイブリッドRectified Flow Transformerを組み合わせる。訓練は生成のみのウォームアップから始まり、生成と編集の合同事前学習へと進む。次に、我々は補完的な事後学習戦略を適用する。オープンエンド編集のための人間フィードバック選好最適化と、音声生成のための報酬ベース強化学習である。推論コストを削減するために、我々はさらに一貫性初期化とタスクルーティングされたDecoupled DMDを用いてモデルを蒸留する。得られたAuK-Flashは、分類器フリーガイダンスなしで4ステップ推論を実行し、同一条件下でフルモデルに対して4.5倍の実時間高速化を達成する。実験は、ゼロショットおよび指示制御された音声生成と一般的な指示誘導編集において最先端の性能を実証し、信号レベルの復元タスクにおいても競争力を維持している。我々は再現性とさらなる研究を支援するために、ソースコードとモデル重みの両方を公開する。
本研究では、オムニ知覚、リアルタイム対話、エージェント能力を単一フレームワーク内で統合するエンドツーエンドモデルであるGanderを提案する。従来のターン制パラダイムとは対照的に、Ganderは動画、音声、テキストを含む複数モダリティにわたるストリーミング入力を持続的に受け取り、日常会話と複雑なワークフロー指向のエージェントシナリオの両方において自然な全二重対話を可能にする。ユーザはいつでもモデルを中断できる一方、モデル側も能動的に中間フィードバックを提供したり、追加質問を行ったりできる。これらの能力をネイティブにサポートするため、Ganderは2つの重要なアーキテクチャ設計を採用している。1)Cerebellum-Brain協調フレームワークを採用し、Cerebellumがリアルタイム対話とオムニ会話能力を担い、Brainが複雑な推論とより高次のエージェントタスクを処理する。2つの構成要素は、ツール呼び出しとエージェントオーケストレーションランタイムを通じて継続的に相互作用する。2)CerebellumはストリーミングThinker-Talkerアーキテクチャに基づいて構築され、ユーザ入力とモデル出力はさらにチャンクレベルで順序付けられたトークンストリームに平坦化され、低遅延で継続的な対話のための統一表現を提供する。我々はGanderについて、会話能力、オムニ理解、インタラクション能力、エージェント知能という4つの次元にわたって包括的評価を行う。内部の人手評価は、GanderがSOTAオープンソースモデルの自然で表現豊かな音声対話能力を維持しつつ、オムニインタラクションにおいて競争力のある性能を達成していることを示している。Ganderはまた、背景雑音干渉、多者間インタラクション、バックチャネルコミュニケーションを含む困難な実世界シナリオにおいて頑健性を示す。我々は、コミュニティにおけるさらなる研究開発を促進するため、Ganderをそのモデル、コード、データとともに公開する。
弱から強への汎化は、より強いモデルがより弱い監督者から学習し、その監督者を超えられるかどうかを問う。この問いは、連続するモデル世代や複数ドメインの統合にとって特に重要である。そこでは、最先端規模のポストトレーニングをゼロから繰り返すことが法外に高コストになり得る。しかし従来の蒸留は、弱い教師を最適化対象として扱い、生徒モデルにその能力上限を課す可能性がある。我々はオンポリシー逆蒸留(OPRD)を導入する。これは、生徒モデルのロールアウト上で、教師のポリシーが参照ポリシーに対してどれだけずれているかを評価し、その方向に沿った、生徒モデルの検証器駆動型ポリシー勾配の成分を増幅する。検証器が支持する更新のみを再スケーリングすることで、OPRDはポリシー最適化の停留点を保ちながら、教師を超える学習を加速する。連続的モデル転移とマルチ教師蒸留の両方において、OPRDは既存のRLおよび蒸留手法よりも少ない生徒モデル更新で高い性能を達成する。応答スタイル分析は、OPRDの生徒モデルが弱い教師よりも、検証器ベースのRLのみで訓練されたモデルに近いままでいることを示し、教師の指導が生徒自身の最適化を方向転換させるのではなく加速させることを示唆する。従来の強→弱蒸留における結果はさらに、容量の順序にかかわらず、OPRDが検証器駆動型ポリシー最適化と教師の指導を効果的に組み合わせることを示している。
ほとんどのエンドツーエンド自動運転システムは人間の運転ログを模倣して学習するため、その学習済み行動は記録された軌道の品質と行動カバレッジによって制約される。本報告では、人間のデモンストレーションを超えて運転行動を学習するエンドツーエンドシステムであるDriveZeroを提案する。これは運転を認識モデルと行動モデルに分解し、それぞれを最も適した学習方式で事前学習し、それらを単一のエンドツーエンドプランナに統合する。両モデルは異なる学習レシピを必要とする。認識は世界を理解する必要があり、大規模で多様な視覚データから恩恵を受ける。行動は世界と相互作用する必要があり、閉ループフィードバックを要する。行動側では、混合エージェント型閉ループ強化学習フレームワークであるDriveRLを導入する。これは実運転ログをインタラクティブな世界に変換し、そこでは特権的教師ポリシーが閉ループロールアウトを通じてPPOで訓練される。認識モデルについては、DriveVFMがDINOv3、SigLIP2、SAM、Depth Anything V2を含む複数の凍結された視覚基盤モデルを、生画像のみから単一のバックボーンに統合し、タスク固有のアノテーションを必要としない。次にDriveZeroは両者を統合する。すなわち、凍結されたDriveRL教師をそのロールアウト軌道を通じて蒸留するカメラのみのプランナである。さらに、目標条件付き教師は拡張された運転意図の下で問い合わせることができ、ログデータでは提供できない多様で目標整合的な監督を生み出す。nuPlanにおいて、価値誘導型テスト時行動探索を備えたDriveRLは、非反応モードと反応モードの両方で、Val14、Test14-hard、Test14-randomのコミュニティスプリット全体にわたり平均スコア93.57を達成し、3つすべてのスプリットでLog-Replayエキスパートを上回る。DriveZeroは、人間の軌道による監督を一切用いずに、NAVSIMv1、NAVSIMv2、および閉ループHUGSIMベンチマークで最先端性能を達成する。
World-Actionモデルは、動画生成事前分布から世界知識を継承し、身体化経験を通じてそれを実行可能な制御信号へと導く。しかしながら、既存システムはモノリシックであり、生成バックボーン、視覚表現、アーキテクチャ、情報フロー、推論手順、訓練データが密結合しているため、どの設計選択が重要で、なぜ重要かが不明瞭になっている。我々は、World-Action事前学習を制御された実験プログラムへと変えるオープン研究スタックであるOpenWAMを導入する。OpenWAM-Infraは、WAMの設計空間を、統合された訓練・推論・デプロイ・評価を備えた構成可能なモジュールへと因子分解する。この基盤上で、OpenWAM-Studyは制御実験を通じて、何を継承するか、世界学習と行動学習がどのように相互作用するか、それらの相乗効果がどのようにスケールするかという3つの問いを検討し、次の3つの原理を抽出する。すなわち、上流知識は、十分に高性能な生成バックボーンと、コンパクトで情報豊富な潜在空間を通じて転移する;World-Actionの相乗効果には、専用の行動容量、明示的な世界から行動への情報フロー、同期された共同ノイズ除去が必要である;そして、身体化事前学習は主にドメイン外汎化を改善し、エゴセントリックデータとロボットデータに対する一段階の共同訓練が、世界のカバレッジと行動のグラウンディングを統合する。これらの原理を組み合わせて、我々はOpenWAM-αを構築する。これは、約6,400時間のエゴセントリックな人間・ロボットデータで事前学習され、シミュレーションおよび実世界ベンチマークで評価されるオープンなWAMである。8つのシミュレーションベンチマークと実ロボット実験にわたり、これらは合わさって単腕および両腕マニピュレーションから多指ハンドに至るまでの身体性を網羅するが、OpenWAM-αは一貫して優れた性能を発揮し、シミュレーションから物理世界に至るまで最高水準の地位を維持する。今後の研究を促進するため、インフラストラクチャ、評価プロトコル、事前学習済みモデル、データレシピを含むフルスタックを公開する。
ワールドアクションモデル(WAM)は将来状態を予測してロボット行動を導き、行動ラベルなし動画と行動ラベル付きインタラクションの両方から学習することを可能にする。そのほとんどは事前学習済み動画生成器を継承しており、WAMの事前学習とスケーリングは十分に検討されていないままである。我々はGenie Envisioner Act 2.0(GE-Act 2.0)を導入する。これは、学習可能な生成コンポーネントと行動コンポーネントのすべてをマニピュレーションデータでスクラッチから初期化するワールドアクションモデルである。これは制御指向オートエンコーダ(CoAE)、単一ステップ視覚プランナー(SVP)、逆動力学モデル(IDM)を組み合わせる。CoAEは強力な圧縮の下でも行動および指示に関連する情報を保持し、SVPは1回の微分可能なパスで完全な将来状態を生成する。そのため、視覚プランニングと逆動力学は相補的なデータで別々に事前学習できる。次に、各コンポーネントは知識整合型選択的最適化(KASO)を用いて統合訓練される。KASOは、記録された行動と行動的に整合すると判断された予測将来のみを選択することで、不一致な教師信号を低減する。我々は、タスクごとの微調整なしに、事前学習済みチェックポイントを直接評価する。評価は、ホールドアウトされたシーン、背景、照明、物体インスタンスを用いて、20のマニピュレーションスキルグループにわたる100タスクで行う。共訓練データを300時間から30,000時間にスケールすると、G1-OPでは成功率が17.1%から44.1%に、G2-90Dでは13.4%から31.1%に上昇する。G2-90Dは共訓練データの2%未満しか占めないにもかかわらず17.7ポイント改善しており、クロスエンボディメント転移を示唆する。改善は19/20および18/20のスキルグループに及び、スキル固有のカバレッジはゼロショット分布外(OOD)成功率と強く相関する(Pearson r=0.80、Spearman rho=0.85)。同一のプロトコルの下で、モデルは少なくとも90%の試行で物体、色、形状、位置の参照をグラウンディングし、明示的な指示がすでに確定した行動や慣例的なシーン連想と矛盾する場合でもそれに従う。
我々は、フロンティア・ポストトレーニングのためのフルスタックで実運用可能なシステムであるMiles v0.1を提示する。slimeのクリーンな設計を基盤として、Milesは強化学習(RL)訓練ループの各段階を、コンポーネントは検証済みで、クリーンで、カスタマイズ可能であるべきという単一の原則に沿って設計している。正確性、効率性、信頼性、スケーラビリティを第一級の目標とし、Milesはフロンティア規模のRLを研究者と企業の双方にとって利用可能にすることを目指す。本報告では、システムをエンドツーエンドで概観する。すなわち、SGLang上に構築されたロールアウトエンジン、2つのバックエンド(NVIDIA Megatron-LMおよびPyTorch FSDP)を選択できるトレーナー、異なるデプロイトポロジー向けの3つの重み同期トランスポートである。全パラメータRLに加え、MilesはLoRA RL、オンポリシー蒸留、教師ありファインチューニング、真のオンポリシー・ロールアウト訓練アラインメントもサポートし、同じアーキテクチャを拡散モデルへ拡張する。最後にエンドツーエンドのケーススタディを示す。GLM-5.2 744B-A40Bモデルにおけるターミナル利用コーディングタスク上の完全非同期エージェント型RLであり、64台のNVIDIA GB300 GPU上で実行され、最初の30測定ステップでステップ時間の中央値が263秒であった。Milesはhttps://github.com/radixark/milesでオープンソース化されており、プロジェクトウェブサイトはhttps://miles.radixark.comである。
単眼深度推定は、広く研究されている一方で、本質的に高度な不良設定問題であるコンピュータビジョンタスクであり、シーン再構成、コンピュテーショナルフォトグラフィ、ロボティクスなどに下流応用を持つ。この分野は成熟しているにもかかわらず、最近のモデルでさえ、分布外入力への汎化や、鮮明で詳細な深度マップの生成には依然として苦戦している。本論文では、拡散トランスフォーマ(DiT)アーキテクチャを基盤とする現代の画像生成・編集モデルを、最先端の単眼深度推定器へと転用するための一連の技術であるMarigoldを再検討する。我々の手法は、必要に応じた量子化を伴いつつ、事前学習済みの多段階フローマッチングモデルからの1ステップ推論を目指し、モデル容量を維持しながら実行コストを低く抑える。我々は、単純な学習に伴うアーティファクトを分析し、2つの有効な対策を特定する。すなわち、モデルの内部表現を正解データから抽出した意味特徴量と整合させることと、新規のSinkhornベース損失を中心に構築した2段階ファインチューニングプロトコルを採用することである。その結果として、より鮮明でクリーンな深度マップが得られ、分布外に対して良好に汎化し、KITTIおよびETH3Dにおいて以前の最高性能に対してAbsRelを16〜26%改善する。定性的には、我々のモデルは、従来モデルでは捉えられなかった毛皮、葉群、髪の毛のように細いエッジを再現する。さらに、Marigold V2は、表面法線推定や本質画像分解など、他の密回帰タスクに適用した場合にも最先端の結果を達成する。プロジェクトウェブサイト:https://hf.co/spaces/huawei-bayerlab/marigold-v2-web
自己回帰(AR)動画拡散モデルは、リアルタイム動画生成において大きな可能性を示している。最近の手法では、事前学習済みの双方向動画拡散モデルを分布マッチング蒸留(DMD)によって因果的AR生徒モデルへ蒸留するが、生成される動画は過飽和や過平滑化の問題をしばしば抱え、視覚品質とリアリズムが限られる。主な要因はDMDにおける逆KL目的関数のモード探索挙動であり、これにより生徒分布が教師分布の少数のモードのみに崩壊し得る。この問題に対処するため、我々はMask Forcingを提案する。これは、AR生徒の自己ロールアウトを摂動させ、逆KLモード探索に起因するモード崩壊を緩和するDual-Noise Masking Rollout戦略である。中心となるアイデアは、AR拡散蒸留の自己ロールアウト過程において、空間軸および時間軸に沿ったランダムマスクを介して、よりクリーンな信号をノイズの多いロールアウト入力に注入することである。このような摂動は、生徒のロールアウトが教師分布のより多くの領域を探索することを促し、DMDが生徒によってすでに覆われているモードを超えた学習信号を提供できるようにする。さらに、よりクリーンなトークンは他のよりノイズの多いトークンに対するノイズ除去ガイダンスとして機能し、中間ロールアウト予測を改善し、誤差蓄積を低減する。広範な実験により、我々の手法は実動画データや追加の事後学習段階を組み込むことなく、複数のAR動画拡散蒸留手法をより高い視覚品質で効率的に改善することが示された。
多様でシミュレーション可能な屋内シーンは、インタラクティブエンターテインメントや身体性AIにとって不可欠であるが、そのスケーラブルな生成は依然として困難である。視覚言語モデル(VLM)に依存する最近のエージェント型テキストから3Dシーンへのパイプラインは、高忠実度のシーンを生成できるが、コストのかかる反復的な物体配置と改良を必要とする。もう一つの主流なパラダイムであるパラメトリックな画像から3Dシーンへのモデルは、2D画像から学習された強力な事前分布に基づいて効率的にシーンを生成するが、しばしば不正確で物理的に妥当でないシーンを生じさせる。さらに重要なことに、どちらのパラダイムも単一入力に対して多様なシーンを出力することが難しく、実世界のシーンの動的に変化する性質を反映することが困難である。本論文では、両パラダイムの利点を組み合わせたフレームワークであるSceneMosaicを提案する。SceneMosaicは、学習された画像ベースの事前分布から初期候補を取得し、その後VLMエージェントを通じて結果を進化させることで、効率性と物理的妥当性の両方を保証する。進化過程において、SceneMosaicは自然シーンの局所性を活用し、シーンを独立した局所ユニットに分解する。これにより、各ユニット内で個別に進化させた後、デカルト積によって全体シーンを構成できる。SceneEval-100において、SceneMosaicは意味レイアウト品質で最強のエージェント型ベースラインに匹敵しつつ24倍の高速化を達成し、物理的違反を大幅に削減し、最高の人間評価を得ている。コードはhttps://github.com/rxjfighting/SceneMosaicで公開されている。
大規模推論モデル(LRM)は、拡張されたChain-of-Thought (CoT) 生成を通じて優れた問題解決を達成するが、その結果生じるキー・バリュー(KV)キャッシュは系列長に比例して線形に増大し、深刻なメモリボトルネックを引き起こし、長い推論トレースにおいてしばしばGPU容量を超える。既存のKVキャッシュ圧縮手法は、最近のクエリに依存して将来のトークンの重要度を推定し、暗黙のうちにこれらが将来のアテンションパターンの信頼できる代理指標となると仮定している。我々は、この仮定が長期的な推論において失敗することを示す。すなわち、特定のデコーディングステップが、トレースの初期に定式化されたタスク解決計画など、遠く離れた以前のコンテキストに再アテンションする思考再訪トークン(TRT)を生成するのである。系統的な分析を通じて、我々はTRTに対応するクエリが埋め込み空間において少数の類似グループにクラスタリングされることを発見した。この洞察に基づき、我々はBeaconKVを提案する。これはトレーニング不要のKVキャッシュ圧縮手法であり、各グローバルクエリクラスタのコンパクトな代表であるビーコンクエリを保持することにより、クエリ履歴全体を保存することなく、どのKVペアが再訪されるかを予測する。4つのオープンソースLRMと多様な推論ベンチマークにおいて、BeaconKVは一般に既存の圧縮手法を上回り、フルキャッシュの精度をほぼ維持しつつ、最大5.8倍のメモリ削減を達成し、スループットを4.3倍以上向上させる。
潜在的視覚推論は、明示的なテキストによる思考連鎖ではなく、隠れ状態計算を通じてマルチモーダル推論を行うことを目指している。しかし、視覚情報が潜在状態に存在することは、モデルが答えを生成する際に実際にその状態に依存していることを意味しない。特に、代替の画像条件付き経路が利用可能な場合にはそうである。我々は因果的視覚再帰推論(CVRR)を導入する。これは事前学習済みの視覚能力を保持しつつ、再帰的計算を予測への必須の画像条件付き経路とする。CVRRは、事前学習済み視覚言語モデルが画像を取り込んだ後、質問の隠れ状態から再帰を初期化し、その後、同じ固定された視覚的証拠を再読しながらこの状態を繰り返し更新する。デコード前に、視覚状態と元のマルチモーダルKVキャッシュが除去され、最終的な再帰状態のみが画像条件付き情報を答えに伝える。V^*、MMVP、BLINK、MME-RealWorld-Liteの各ベンチマークにおいて、CVRRはこの厳密なインターフェースの下で強い性能を維持する一方、互換性のある潜在推論器は同じ制約の下で再訓練しても同等の視覚能力を回復できない。因果的介入はさらに、質問を固定したときに予測が再帰的内容に敏感であり続けること、および持続的な視覚的証拠が再帰的軌道を因果的に修正することを示す。これらの結果は、潜在的な情報量と、実際に予測に用いられる潜在計算とを区別する。
大規模言語モデル(LLM)がアラインメントに敏感な文脈でますます展開されるにつれ、活性化ステアリングは、行動制御のための微調整手法(例:RLHF、DPO)に対する軽量な推論時代替手段として台頭してきた。しかし、既存研究は通常、ステアリングを個別の行動で検証しており、ステアリングベクトルが一貫した意味構造を符号化しているのか、それとも単に行動固有のショートカットを利用しているのかは不明確なままである。本稿では、LLMステアリングベクトルの潜在幾何構造が、人間の価値観と道徳性における理論上規定された構造を反映しているかどうかを調査する。主要な細粒度フレームワークとしてシュワルツの基本的人間価値理論を用い、20種類の人間価値を網羅する26Kサンプルのベンチマークを導入し、多様なモデルファミリーとサイズにわたり、分布駆動型手法(例:CAA、SphericalSteer、ODESteer)と行動中心型アプローチ(例:COLD-Steer、BiPO)を分析する。分布駆動型手法は、理論的予測と整合する人間価値のトポロジーを復元することが分かった(スピアマンρは最大0.51、p < 10^{-13})。対照的に、行動中心型手法は同等のステアリング性能を達成するが、期待される価値の幾何構造とはほとんど相関を示さない。幾何学的忠実性はモデル規模とともに向上するが、指示チューニング後には低下する。最後に、より良い幾何学的整合性は、価値間のより人間と整合的な転移にもつながる。すなわち、ある価値をステアリングすると、適合する価値が正しく高まり、対立する価値が抑制される。コードとデータは以下で利用可能である:https://github.com/DeepRCL/Steering_Geometry。
線形アテンションは、効率的な長文脈推論と一定メモリでのデコーディングのために、最先端の言語モデルでますます用いられている。しかし、その固定サイズの再帰メモリは、各トークンにおいてオンライン決定を必要とする。すなわち、将来のクエリがどの情報を必要とするかを知る前に、何を書き込み、既存の連想をどれだけ強く上書きするかである。デルタ則モデルはこの強度を現在のトークン埋め込みから学習するが、メモリ推定の信頼度を追跡しないため、各書き込みが蓄積された証拠に適応することを妨げている。この不確実性を明示的に表現するため、我々は再帰的連想記憶を線形ガウス状態空間モデルとして再定式化する。このモデルではカルマンフィルタが最適な再帰的推定量であり、新たなモデル群であるカルマンデルタネットワーク(KDN)を導入する。KDN内では、遷移がメモリ状態とその不確実性の両方を伝播させ、カルマンゲインが各残差書き込みを蓄積された証拠と観測信頼性によって重み付けすることを可能にする。この定式化の下では、デルタ型更新は、予測共分散の代わりにトークンごとの等方性代理を代入し、共分散追跡を省略する特殊ケースとして現れる。しかし、厳密な追跡は、GPU並列の線形アテンションスキャンに適さない密な状態依存リカッチ再帰を伴う。この問題に対処するため、スキャン互換の2つのKDN近似を導入する。対角KDNは、オンライン平均場変分推論を通じて各1ステップ事後分布を対角ガウス族へ射影する。一方、等方KDNは、ヘッドごとに単一の不確実性スカラーを用いる等方近似を用いる。これらの不確実性再帰はメビウス写像であり、対数並列深さの連想スキャンを可能にする。750Mおよび1.3Bパラメータでの制御された事前学習において、KDN変種は最先端の線形アテンションモデルに対してパープレキシティと下流タスクの平均精度を一貫して改善する。
人間の手による実演をロボットグリッパへ転移することは、近年、ロボット学習における費用対効果の高い解決策として登場している。しかし、既存手法は主に単純な平面タスクに限定されており、ロボットマニピュレーションに不可欠な複雑な空間動作(例:回転や反転を伴う複雑な軌道)を扱えない。このギャップに動機づけられ、我々は細粒度の手姿勢動作に導かれる暗黙的かつデータ駆動型のアプローチを採用する。そのために、我々は手とグリッパのペアデモンストレーションを収集するスケーラブルな取得パイプラインを導入する。これは、動作の複雑さを優先し、シームレスな動作模倣のためにハンドヘルドグリッパを活用する厳密なプロトコルに従う。これにより、1,254個の固有物体にわたる6,189エピソードからなる大規模ペアデータセットが得られ、既存ベンチマークより著しく高い空間的複雑さを示す。しかし、そのような複雑な写像を学習することは依然として困難である。我々は、グリッパ姿勢系列全体を単純にエンドツーエンド生成するだけでは不十分であることを観察する。なぜなら、わずかな軌道偏差が複雑なダイナミクスの下で急速に累積するからである。これに対処するため、我々は二段階フレームワークを提案する。第I段階では写像目的を簡素化するために疎なグリッパキーフレーム(初期および終端)を予測し、第II段階ではこれらのキーフレームを条件として完全な連続行動系列を生成する。さらに、累積ドリフトを緩和するため、グリッパの向きは学習させつつ、その並進を把持ヒューリスティックと運動学的整合性に基づいて事後最適化する。シミュレーションと実機ロボット実験の両方において、我々のフレームワークは複雑な空間マニピュレーションの安定かつ精密な手からグリッパへの転移を可能にし、従来のベースラインを大幅に上回る。プロジェクトページ: https://cosmoh2g.github.io.
投機的デコーディングは、強化学習(RL)ポストトレーニングのコストの大部分を占めるロールアウト生成を高速化する。オンライン共訓練はドラフトの精度をさらに高め、より大きな高速化をもたらす。しかし、このアプローチを長いコンテキストを持つ大規模モデルでの共訓練にスケールさせるには、2つの障害がある。(1) 分岐アテンションは標準的な因果的コンテキスト並列(CP)実装ではサポートされていない。(2) ターゲット特徴量がパイプライン並列(PP)ステージ間にまたがる。我々は、大規模オンライン・ドラフト共訓練のためのエンドツーエンドシステムで両方に対処する。CPについては、パック済みで負荷分散されたジグザグ・リングアテンションを拡張し、ランクローカルな分岐アテンションと因果的主系列アテンションを統合する。PPについては、TapChannelが中間ターゲット特徴量を別経路でステージ間転送し、パイプラインスケジュールに影響を与えない。実験により、共訓練されたドラフトはポリシーベースラインに密接に追従しつつ、最大122Bまでのモデル規模で大幅なロールアウトおよびエンドツーエンドの高速化を実現することが示された。我々のCP設計は256Kトークンでストロングスケーリングを達成し、先行研究と比べて大幅なメモリ節約を実現する。また、PP転送は控えめなオーバーヘッドで済む。コードは https://github.com/NVIDIA-NeMo/RL/issues/3698 で入手可能である。
視覚生成は、単一の呼び出しによって利用される生成モデルから、計画し、ツールを選択し、中間合成出力を検査し、失敗を修正し、過去の経験を再利用できるエージェント的制御プロセスへと進化している。既存のほとんどのシステムでは、コントローラはLLMまたはVLMであり、視覚生成モデルはツールまたは実行者として機能する。しかし、既存研究には、生成システムがいつエージェント的になるかを判断するための一貫した基準が欠けている。計画の深さ、ツール使用、複数役割間の協調、強化学習は、しばしばエージェント性の証拠として扱われるが、それらのいずれも、コントローラがどの生成上の決定を行えるかを必ずしも規定するものではない。我々は、コントローラが生成過程において直接制御できるものに基づいて、この分野を整理する。L1 条件付け制御では、コントローラは所定の生成器への入力を準備するが、どの視覚操作が実行されるかは制御しない。L2 実行制御では、コントローラは実際の生成、編集、レンダリング、その他のコンテンツ変更操作を選択して呼び出す。L3 結果適応制御では、コントローラは中間結果を観察し、その観察を用いて現在のタスク内の後続操作を変更する。L4 経験適応制御では、コントローラは完了したタスクからの経験を保持し、その経験を用いて将来のタスクにおける決定を変更する。L0 固定サポートは、生成レベルの決定を行う配備済みコントローラを持たない、生成器、編集器、評価器、報酬モデル、ベンチマーク、固定パイプラインを別個に指す。これらのレベルは、モデル規模、システムの複雑さ、出力品質、ツール数や役割数、学習方法ではなく、漸進的に広がる意思決定の範囲を記述している。この枠組みを画像、動画、編集、3D、ワールド、スライド、ユーザーインターフェースの各生成に適用すると、コントローラ能力がどのように進化してきたか、またそのメカニズムが各レベルにどのように分布しているかが明らかになる。
大規模言語モデルは、長期的な視野で計画を立て、外部ツールを通じて行動するエージェントとしてますます導入されている。ほとんどのエージェントは、蓄積される履歴に対する制約のない生成を通じて行動を選択し、何を、どのような順序で、どのような条件で行うかという手続き的知識を暗黙的なものにしている。軌跡が長くなるにつれて、エージェントは目的を見失い、ツールを誤った順序で呼び出し、非生産的な行動を繰り返す可能性がある。我々は手続きグラフを導入する。知識グラフが「何であるか」の問いに対して事実的知識を(エンティティ、関係、エンティティ)の三つ組に組織化するように、手続きグラフは「何をすべきか」の問いに対して手続き的知識を(手続き、関係、手続き)の三つ組に組織化する。各決定ステップで、フレームワークはエージェントのアクティブノードを特定し、ガイダンスモデルが周囲のサブグラフをステップレベルの状況的ガイダンスに変換し、それがソルバーの次の行動にバイアスをかけるが、指示はしない。グラフは自己進化する。LLMリファイナーが失敗した軌跡と成功した軌跡を対比し、グラフのトポロジーと属性を編集し、ホールドアウト検証性能を維持または改善する編集をコミットする一方で、却下されたものを保持して繰り返しを抑制する。最小限のスケルトンから出発して、このループは手設計のグラフに匹敵するか凌駕するグラフを構築する。また、欠陥のある専門家の事前知識を修復することもできる。複数のデータセット、タスクタイプ、LLMにわたって、手続きグラフはメモリベースのベースラインに対して一貫した利得をもたらし、自己進化は手動のエンジニアリングなしで性能をさらに向上させる。
大規模言語モデルは静的推論において顕著な高性能を示すが、長ホライズンタスクに向けて強化学習(RL)により自律エージェントとして訓練することは、しばしば深刻な報酬スパース性によって妨げられる。教師ありファインチューニング(SFT)による従来のエージェント側ウォームアップはこれを緩和し得るものの、データ不足と探索の制約によってしばしば限界がある。これに対処するため、我々はフィードバック豊富化環境(FEEs)を構築することによる、環境側適応へのパラダイムシフトを提案する。予備研究を通じて、エピソード内探索とエピソード間進化の双方の後半段階において、行動ガイダンスから観察の豊富化へ移行することにより環境を再定式化するフィードバック設計戦略を確立する。さまざまなQwen3モデル規模と、GRPO、GSPO、DAPOなどのRLアルゴリズムを用いたSciWorldおよびBFCLベンチマークでの大規模実験は、FEEsが標準設定に対して一貫して性能向上をもたらすことを示している。さらに、我々の分析は、FEEsを用いた訓練が (1) エントロピー変動を低減することで訓練ダイナミクスを安定化させ、(2) 困難なタスクにおける能動的な状態空間探索を促進し、(3) 単なる推論時事前として作用するのではなく、環境からのガイダンスを方策重みへ内在化させることを保証し、(4) グループ内フィードバック一貫性を安定な最適化のための重要な境界として特定することを明らかにする。
3次元シーンを多視点画像として表現することは、2D VLMが事前学習からの事前知識を再利用して3次元で推論することを可能にし、アノテーション付き3次元データの不足を回避する。しかし、これは数千の冗長な視覚トークンを生成し、そのコストは視点が増えるごとに増大する。既存の視覚トークン枝刈り手法は2つの系統に大別されるが、いずれも3次元多視点設定では限界がある。学習型重要度手法はアテンションまたはエンコーダ特徴量によってトークンを順位付けするが、ここでの冗長性は本質的に空間的であるため、少数の顕著な領域からのほぼ重複したトークンを保持し、シーンの大部分を未表現のまま残す。ボクセル化手法は空間被覆率を改善するものの、正確なトークン予算を強制できず、多視点観測が3次元で重複するにつれて飽和し、保持率を目標を大きく下回る水準に制限する。我々は、空間被覆率が3次元推論性能と関連することを示し、トークン座標のみを使用し、学習信号を一切用いない決定論的で学習不要のセレクタであるCoVeRを導入する。CoVeRはシーンのあらゆる領域を集合的に被覆するトークンを選択し、両系統の限界を解決する。すなわち、シーンごとの正確な予算を強制し、ボクセル化の飽和プラトーを打破し、学習型重要度のほぼ重複した選択を回避する。広範な実験により、CoVeRは3つの3次元推論ベンチマークすべてで従来のSOTAを上回り、4つのVLMで検証されたプラグアンドプレイモジュールとして汎化することが示される。特筆すべきは、わずか約8%の視覚トークンで、全トークン時の性能の93.5%を維持し、ベンチマーク平均でSOTAを3.9ポイント上回ることである。
Vision-Language-Action(VLA)モデルは、言語条件付きロボットマニピュレーションにおいて有望な進展を示している。しかし、既存のデータセットとベンチマークは主に事前定義された設定下でのタスク完了を評価しており、空間的・手続き的複雑性が増大する状況下でのモデル推論についての知見は限られている。我々は、VLAモデルにおける身体性推論を診断するための大規模ロボットマニピュレーション用データセット兼ベンチマークであるRoboSPA(Robot Spatial-Procedural Assessment)を提案する。RoboSPAは、細粒度空間推論と長ホライズン手続き計画という2つの中核次元に焦点を当て、10のタスクカテゴリと56の基本タスクを対象とする。各タスクは5つの難易度レベルにわたってインスタンス化され、空間的曖昧性と手続き的複雑性が増大する280の変種を生み出す。我々は、複数のエンボディメントと多様なシーンにわたる527K件の軌道を収集する。二値的成功率を超えて、RoboSPAはより詳細な評価のための診断指標を導入する。代表的なVLAモデルに関する実験は、現在のシステムが依然として複雑な空間関係、精密な低レベル実行、およびメモリ集約的な計画に苦慮していることを示している。これらの結果は、RoboSPAが、より有能で信頼性が高く、汎化可能な身体性エージェントを開発するための困難な診断ベンチマークであることを確立する。我々のデータとコードは https://github.com/fanzhenxuan/RoboSPA で利用可能である。
我々は、ヒューマノイドロボットを用いて雑然とした屋内環境をナビゲートする問題を研究する。ナビゲーションを2次元経路計画問題としてモデル化する従来手法とは異なり、雑然とした環境におけるヒューマノイド移動には、複雑な3次元空間を衝突なく移動するための、腕配置の協調、胴体調整、歩容変調を含む、幾何情報を考慮した連続的な全身適応が必要である。我々はTANGOを導入する。これは、雑然とした環境における言語条件付きヒューマノイド移動のための初の全身視覚言語ナビゲーション枠組みである。自然言語指示と自己中心RGB観測が与えられると、TANGOは下流の全身制御向けに29自由度の関節空間行動を直接予測する。我々は、大域経路計画、キネマティックな全身動作生成、障害物を考慮した動作編集、RLに基づくトラッキングによって多様な衝突のない移動行動を合成することにより、TANGOを完全にシミュレーション内で訓練する。このパイプラインは、言語条件付き全身方策を学習するための動的に実行可能な行動教師を提供する。広範なシミュレーション実験において、TANGOは視覚言語ナビゲーションで最先端性能を示す一方、障害物対処を要する困難なシーンでのナビゲーションにおいて強力なモジュール型ベースラインを上回る。最後に、我々はTANGOをUnitree G1ヒューマノイドロボット上にゼロショットで展開し、実世界のナビゲーションデータで一切訓練することなく、雑然とした実世界シーンにおいて頑健な言語誘導移動を観測する。
我々は、単一の設計系譜を持つ2つのシステムにまたがって本番運用される自律型言語モデル取引エージェントについて、継続的かつ母集団規模の計測記録を提示する。DX Terminal Pro(3,505のユーザー資金提供型ヴォールトが、2026年2月から3月の21日間にわたり、Base上のミームコイン市場で実際のETHを取引)と、DXAPライブアルファフリート(500~599体のユーザー作成エージェント、全履歴、同時稼働91~117体、Hyperliquidの無期限先物を取引、2026年6月から8月)である。この記録は約6か月にわたり、750万回の単一モデル呼び出し、約30万件のオンチェーンアクション、さらに14,596件の約定を生み出した231,638回のマルチツールターンを含む。本論文を支える知見は4つある。第一に、運用レイヤーは、戦略テキストに書かれた何事よりも行動を規定する。リスクスライダーはレバレッジを説明し(レベル当たり+0.425)、エージェント固定効果は分散の60%を吸収し、リーダーボードの描画境界は選択を因果的に誘導する(上位3位のカットオフにおける回帰不連続は1.75倍)。第二に、サイジングはボラティリティに盲目である。ボラティリティの六分位すべてで中央値レバレッジは5.0倍であり、1つのポスチャースライダーセル(ポジションブックの11%)が清算の62%を占める。第三に、エージェントは到達した上昇余地をほとんど取り込めない。ポジションの43.2%は24時間以内に少なくとも+300 bpsの有利方向へのエクスカーションを記録したが、それらの49.3%は負の取引リターンで決済された。機械的ブラケットはポジション当たり+39.0 bpsを回復する。第四に、どちらのフリートも方向性エッジを示さない。DXAPフリートは収益性がなく、マッチさせたHyperliquidリテールベンチマークを下回る(ラウンドトリップ勝率41%対50%)。416の収集済み本番シナリオにおけるフロンティアモデルのペア・リプレイ・リーグでは、このホライズンにおいて意思決定品質は統計的に区別不能である一方、選択安定性はモデルファミリー間で大きく異なる。すべての主要な結果は、日次クラスタリング推論、置換帰無仮説、共通手数料での再計算を経ても生存する。本論文は、我々自身の撤回を代償に得た17規則からなる方法論カノンで締めくくられる。
拡散ベースモデルは単眼幾何推定を可能にするが、そのピクセル空間における精度は、共通かつ十分に研究されていない誤差源、すなわち VAE 再構成劣化によって制限される。VAE エンコーダ・デコーダにおける 8 倍の空間圧縮は物体境界の表面法線を劣化させる。正解法線を符号化・復号するだけでも 1.3~8.5° の平均角度誤差(MAE)が生じ、エッジの MAE は全体の MAE の 2.8 倍に達する。我々は TransNormal-2 を提案する。これは FLUX.2 に基づく Rectified Flow フレームワークであり、単一ステップの決定論的推論を備え、VAE デコーダの両側でこの劣化に対処する。すなわち、訓練中に潜在予測をどのように監督するか、および推論時に復号された法線をどのように補正するかである。第一に、幾何認識型ピクセル空間損失(逆レンダリング自己整合性、von Mises-Fisher 角度損失、ウェーブレットエッジ認識正則化を含む)は、VAE 復号後に球面上の法線幾何と拡散画像形成の手掛かりを強制することにより、潜在 MSE を補完する。第二に、軽量な幾何リファインメントモジュール(GRM)が RGB ガイド付き残差補正を適用し、粗い予測を自由に書き換えることなく、境界に局在する復号誤差を低減する。一般シーンベンチマークにおいて、TransNormal-2 は報告された全 8 指標で MoGe-2 に匹敵するかそれを上回り、しかもタスク固有の法線アノテーションは 1.4% しか使用しない。その利得は透明物体で最も明確であり、最強の先行ベースラインと比較して、ClearGrasp で MAE を 4.2°、ClearPose で 3.1° 低減する。コードは https://longxiang-ai.github.io/TransNormal-2 で公開予定である。
動画基盤モデルは大規模な事前学習データにますます依存するようになっているが、その背後にあるエンドツーエンドのデータパイプラインは依然として大部分が非公開であり、検査や再利用が難しい。動画データレシピがモデル事前学習に与える影響を理解しようとする研究者は、焦点を絞った仮説を検証する前でさえ、しばしば相当なインフラストラクチャを構築する必要がある。我々は、動画データレシピを、生動画から学習データセットに至る実行可能な5段階ワークフローとして表現するオープン研究基盤 VIDAFORGE を提示する。このワークフローにおける決定を変化させることで、すべてのサンプルがどのように生成されたかを保持したまま、代替データセットを構築できる。この研究ワークフローを実証するため、Wan 2.1 と V-JEPA 2.1 のスクラッチからの初期事前学習において、カバレッジと品質の異なるデータレシピを比較する。両方の学習目的において、より広いカバレッジのレシピが下流ベンチマークで最高スコアを達成する一方、損失ベースの評価では異なるレシピが有利となる。本研究は、VidaForge がデータレシピの選択を下流のモデル性能にどのように結び付けるかを示す。さらに我々は、動画データレシピ研究のための細粒度アノテーションとキュレーション信号を備え、合計 6,475 時間に及ぶ 314 万件のシーンレベルのクリップを含む VIDAFORGE-3M を公開する。
ロボット基盤モデルは主に英語で訓練および評価されており、ほとんどの言語にはロボット実演コーパスが存在しない。我々は、機械的に言い換えられた指示のみを用い、アーキテクチャを変更せずに、オープンな視覚–言語–行動スタックへギリシャ語を追加することを検討する。主な課題は翻訳ではなく測定である。いくつかのもっともらしい評価手段は誤った結論を導く。すなわち、カラーヒストグラム指標はノイズを高く評価し、単一目標ベンチマークは正しいギリシャ語で84.6%、意図的に誤った指示で82.6%を記録し、訓練損失はギリシャ語での成功を予測できず、単一実行の比較はシード変動に支配される。識別的な90タスクスイートにおいて、各アームにつき3シードを用いると、ギリシャ語の実演を含まない多言語テキストタワーは誤指示時の下限にとどまる一方、ギリシャ語のみの訓練は対照条件を最大2.7ポイント上回る。バイリンガル訓練は対照条件に対して一貫して6.7~7.1ポイントのマージンをもたらし、英語性能の約5分の2に達する。このポリシーは翻訳者の言い回しにも過適合する。タスクごとに7つの言い回しで訓練すると、このペナルティはおよそ半減する。言語適応済み世界モデルからのウォームスタートとテキストタワーの凍結解除はいずれも性能を低下させる。この結果は、低リソースのロボットポリシーをローカライズするための2つの実用的要件を支持する。すなわち、指標を信頼する前に保証されたヌルを構築すること、および低リソース言語の結果をシード間で再現することである。
長尺のマルチショット動画を生成するには、ショット内で一貫した動きと、ショット間で視覚的に整合した物語が求められる。既存の動画生成器は連続的な動きを優先し、一つの物語全体を単一の時間軸に詰め込む場合、完全なショット集合を提示することが難しい。我々はMovieGridを提案する。これは、長尺動画を時間順に並んだより短いチャンクに分解し、それらを空間グリッド上に配置して統合的にモデリングするMulti-Grid Post-Trainingパラダイムである。この設計により、各時間軸が扱うショット数を削減しつつ、チャンク間のグローバルな情報交換を可能にする。我々は、1,000本の長尺動画からMulti-Grid Long Video(MGLV)データセットを、原動画収集、階層的セグメンテーション、グリッド動画構築、キャラクター認識型ストーリー注釈を用いて構築し、ストーリープロンプトと対にした54K本のグリッド動画を生成した。我々のNoise-Free Random-Grid Trainingは、残りのチャンクをノイズ除去するためのクリーンな視覚コンテキストとして、チャンクのランダムな部分集合を保持する。Grid Embeddingはグリッド構造を符号化し、キャラクター認識型Story Promptsは繰り返し登場するエンティティを紐付け、Grid Boundary Lossはレイアウトを安定化させる。同一のトークン予算の下で、MovieGridは1,616フレームの動画においてTemporal Packingより6.05倍多くのショットを生成する。5つの実世界カテゴリにまたがるベンチマークにおいて、最先端のショット内一貫性(HoloCineの0.8086に対して0.9131)とショット間一貫性(StoryMemの0.5384に対して0.5914)を達成する。MovieGridは、単一生成または複数回生成によって、最小限の妥協で動画長をさらに拡張できる。
全二重音声言語モデルは同時に聴取と発話を行うことができ、人間の会話における割り込みやあいづちに対処できる。しかし、テキスト生成、音声合成、音声再生は非同期に進行する。その結果、モデルが発話したと考えている内容は、実際にユーザーに再生された内容と一致しない可能性がある。我々は、モデルが実際に再生した音声を認識しながら割り込みから復帰する問題をアンカー割り込みと呼ぶ。この問題に対処するため、我々はSelf-Listeningを提案する。これは、ユーザ音声、モデルテキスト、およびモデルが再生した音声をインターリーブする全二重モデリング手法である。実際に再生された音声出力を入力ストリームとしてモデルにフィードバックすることにより、Self-Listeningは割り込みからの復帰を、ユーザーが実際に聞いた内容に基づかせる。さらに我々はAnchorSpeechを導入する。これは、構造化された順序付き応答のどの項目が実際に発話されたかを追跡するための、均質な訓練用およびテスト用分割を備えたコレクションである。AnchorSpeech-testは、モデルが割り込み前に最後に完了した項目と一貫して応答できるかを評価する。実験により、全二重ベースラインと比較して、Self-Listening機構を備えたモデルがより優れたアンカリング性能を達成することが示された。
単眼動画から臨床的に意味のある歩行パラメータを正確に推定することは、スケーラブルな移動機能評価にとって重要であるが、その進展は既存データセットの規模の小ささ、制限された視点、限られた視覚的多様性によって妨げられている。我々はSynthGait-19kを導入する。これは、437名の被験者にわたる6,427件のMoCapシーケンスから生成された19,272本の歩行動画を含み、SMPLモーションと6種類の歩行パラメータのアノテーションを対にして備えた、物理に基づく合成動画データセットである。データセットを構築するために、我々はGait2Vidを開発した。これは、異種のMoCap記録をSMPLを通じて統合し、制御可能な視点およびシーン外観の下で多様なRGB歩行動画を合成する。生成された動画について、条件とした歩行運動学との整合性を評価し、抽出された歩行イベントをフォースプレート測定に対して検証する。SynthGait-19Kを用いて、直接RGB、姿勢ベース、生体力学、人体メッシュ復元のアプローチをベンチマークし、視点、学習データ規模、合成から実データへのドメインシフトを分析する。また、歩行パラメータを推定するための直接RGB参照モデルとしてGaitXFormerを導入する。合成データによる教師あり学習は、GaitXFormerと姿勢ベースアーキテクチャの両方において実動画へ効果的に転移し、異なる表現にわたる有用性を示す。さらに、空間的歩行パラメータは視覚的ドメインシフトに対してより敏感であり、HMR再構築の改善だけでは下流の歩行推定の改善に必ずしもつながらないことを見出した。
大規模ニューラルネットワークの圧縮は、リソース制約のあるデバイスにモデルを配備する上で不可欠である。既存手法の多くは重み枝刈りまたは低ビット量子化を個別に採用しており、許容可能な性能低下を保つためには、しばしば最適とは言えない圧縮率にとどまる。我々は、ベイズ変分学習(\method)による枝刈りと低ビット量子化の同時実行のための統合フレームワークを導入し、同等の性能を維持しつつ、従来のベースラインよりも高い圧縮率を達成する。鍵となるアイデアは、スパイク・アンド・スラブ事前分布を用いて疎性を誘導し、量子化重みをガウス混合モデル(GMM)でモデル化して低ビット精度を可能にすることである。スパイク・アンド・スラブ事前分布とGMMを含む目的関数は扱いにくいため、最小限の精度損失で効果的な圧縮を可能にする効率的な近似を導出する。理論的には、疎かつ量子化された深層ニューラルネットワークに対する提案する変分アプローチについて、一致性を示す結果を与える。ResNet、BERT-base、Llama3.2、Qwen2.5モデルの圧縮に関する広範な実験により、我々の手法は、同等の性能低下のもとで一連の既存手法よりも高い圧縮率を達成することが示される。プロジェクトページ: https://comeusr.github.io/SQS_Webpage.
モデルのミスアラインメント、プロンプトインジェクション、またはオペレーターの誤用は、フロンティアラボのアカウントを運用する AI エージェントに、モデル重みの外部流出、訓練データの汚染、またはリリースゲートの弱体化を引き起こさせる可能性がある。既存のベンチマークは、限られたレビュー予算の下で、防御者が日常業務のなかでこの活動を検出できるかどうかを検証していない。我々は MOLE を導入する。これは、30 営業日にわたり 9 つのステートフルサービスを共有する 150 の AI 運用アカウントからなるオープンベンチマークであり、12 の脅威と、4 つのモデルに由来する合計約 200 億トークンの 8 つのコーパスを含む。39 のエージェントモデルのうち 72% は、割り当てられた有害な目標の大半を完遂し、エージェントの拒否は完遂を予測しない。MOLE により、コーパス生成器、可観測性レベル、脅威を横断した 40 のモニターの比較が可能になる。我々の単日監査イベント比較では、評価された最良のモニターでさえ、完了した害のほぼ半数を見逃す。MOLE はモニター開発も可能にする。ベンチマーク誘導型探索は中位のモニターを 49~64% 改善し、より強力なモニターの選択的利用は、同程度のモデル化コストでそれをすべてのアカウント日に適用する場合に比べて budget-AUC を 10% 改善する。
本稿では、数値時系列のための誤差有界非可逆圧縮器 Cadence を提示する。これは 330M パラメータの時系列基盤モデル(Google TimesFM-3)と適応的算術符号器を組み合わせ、各サンプルで |x_t-x_t|≤τ を保証する。ひとつの否定的結果が設計空間を制約する:可逆符号化では基盤モデルは無価値である。なぜなら節約されるビット数は予測器精度に対して対数的であり、Δb=log_2(MAE_{old}/MAE_{new}) だからである。したがって、TimesFM-3 が 32 タップ線形予測器に対して持つ 1.51 倍の優位は、20.28 ビットのうち 0.60 ビットをもたらすにすぎず、中央値利得は +0.03% である。誤差有界符号化は一つの点でこれから逃れる:予測が誤差帯内に収まれば、残差インデックスはゼロとなり、そのサンプルはほぼ無コストになる。Cadence の貢献は次のとおりである:(1) 文脈モデル化二値化を備えた適応的レンジコーダ。実インデックス上で xz/zstd を 9.7%(15/15)上回り、汎用バックエンドからの知見を覆す。(2) 決定性に関する結果——予測はバッチサイズ間でビット同一ではなく、PyTorch のいかなる設定でもこれを修正できず、グループサイズと実行デバイスをコンテナ形式に含めることを余儀なくさせる。(3) あらゆる妥当な学習カットオフ以降のコーパス上でのドメイン局所化。 49 の EIA-930 バランシングオーソリティ需要系列(2026 年)において、Cadence は 6 つの古典的予測器の最良のものに対して 13.3% の利得を得ており、50 の MTA 乗車人数系列(2026 年)では 28.3% である:297 の系列–許容誤差ペアにわたる中央値は 21.4% で、297 組すべてで勝利している。時系列データベースが保持のために導入するダウンサンプリングに対して、同等サイズでその保証される最悪ケース誤差は 28–56 倍厳しい。エンドツーエンドでは、コンテキストブートストラップのコストを支払えば、利得は 6 か月分の毎時データにおける 6.8% から漸近的に 15.1% に及ぶ。SDRBench 上でドメイン主張を反証しようとすると、理論は失敗を予測し、実際にそのとおりになる:中央値 -0.8%、27 組中 0 組が利得。さらに 3 件の否定的結果と 8 件の撤回された主張を詳細に報告する。
Transformerは、ある属性がまだ出力に影響を与えていない深さにおいて、その属性を残差ストリーム内で線形にデコード可能にすることができる。情報が読み取れる場所とそれが使用される場所との間のこのギャップは、入力内で直接述べられた属性について示されている。我々は、それが、モデルが会話を通じて徐々に推論しなければならない属性、すなわち対話相手がどれほど専門的であるかについても成り立つかを問う。4つの専門性レベルでモデルが演じるペルソナ間のマルチターン研究計画対話のコーパスであるExpertCollabを用いて、相手の専門性は初期層で最もデコード可能であり、ネットワークの中間点より前にほぼチャンスレベルまで低下することを見いだす。反事実パッチングは、デコード可能性がピークとなる層に専門性の差を注入しても固定された後半層の読み出しをほとんど変化させない一方、中間点より後に同じ差を注入するとほぼ完全に伝播することを示し、その差は1桁を超える。内容を一致させたランダム対照とプローブ不要の診断は、その遷移を同じ初期層に位置づけ、静的に指定された対照属性は全体を通じてデコード可能なままである。したがって、推論された関係的属性は、因果的に活性になるよりずっと前に表現されており、このことは、対話相手に条件付けられた振る舞いを読み出したり誘導しようとするいかなる試みもどこに介入しなければならないかを制約する。我々は合成コーパス上の1つのモデルを初期実証として用いる。
本論文では、リアルタイムストリーミング動画異常理解(VAU)のためのSlow-Fast分離フレームワークであるReactVAUを提案する。既存のVAU手法は、グローバル時間サンプリングを用いたオフライン推論に依存しており、因果性に違反し、ライブ監視ストリームへの配備を妨げる。一方、一般的なストリーミング動画モデルは因果的アクセスを満たすが、メモリ圧縮中に稀な一過性異常を希釈し、長い正常区間にわたり重量級MLLMを一律に呼び出すことが多い。ReactVAUはこのギャップを3つの相乗的コンポーネントで解決する。すなわち、継続的な異常フィルタリングのためのSpatial Grid Folding(SGF)に基づく軽量な高速検出モジュール、重要な視覚的手がかりを時間的減衰から保護する異常認識型永続メモリ(AAPM)、および正常ストリーム中は休眠状態を保ち、疑わしいイベントによってのみ起動されて意味的検証と因果的記述を行う重量級の低速推論モジュールである。複数のベンチマークにおける広範な実験により、ReactVAUが厳格なストリーミング制約下で動作し、異常検出と因果推論の両方で競争力のある性能を同時に達成するとともに、重量級MLLMの呼び出しを最小化することで計算効率を大幅に向上させることを示す。プロジェクトページは https://huiyuiui.github.io/React_VAU/ で公開されている。
改変・生成された顔画像のリアリズムとアクセスの容易さが高まるにつれ、デジタルメディアの信頼性が脅かされている。このような偽造を検出するために、視覚基盤モデルに基づくディープフェイク検出器は有望な性能を示しているが、それらは通常、単一の事前学習済み表現に依存しており、特定の学習分布に過適合しやすい。未知の偽造への汎化性能を向上させるため、我々はUCF-Netを提案する。これは、CLIPの言語整合型意味事前分布とDINOの自己教師あり視覚構造事前分布を活用する、不確実性を考慮したカスケード融合ネットワークである。UCF-NetはTransformerの深さ方向にわたる階層的特徴を抽出し、層ごとのエキスパート集約によって各エンコーダの多段階の手がかりを適応的に統合し、得られた表現をエントロピー由来の不確実性に基づいて重み付き融合する。さらに、公開ディープフェイクデータセットを約400万枚の画像からなる統合ベンチマークに統合し、8つの最近の生成器による8,000枚超の顔画像からなる別個のクロス生成器評価セットを構築する。統合ベンチマーク上で、UCF-Netは評価対象手法の中でドメイン内およびクロスドメイン評価の両方において最良の平均AUCを達成する。クロス生成器セット上では、限られたターゲットドメインデータで効果的に適応するが、ゼロショット転移は依然として困難である。
大規模言語モデルは、例えば cot(-540°) を計算したり (1).startswith("1") を評価したりするような構造的に解答不能な問題に対して、回答を差し控えるのではなく、しばしば回答してしまう。我々は、この失敗が認識の欠如を反映しているのか、それとも認識から回答の差し控えへのルーティングの失敗を反映しているのかを問う。1.7Bから70Bパラメータまでの指示チューニング済みモデルにおいて、隠れ状態内の単一の線形方向が、解答可能な数学・コードプロンプトと構造的に不可能な数学・コードプロンプトを分離し、モデルが生成前に不可能性を表現していることを示す。しかし、この認識方向は、訓練された有害コンテンツ拒否を媒介する標準的な安全性拒否方向とほぼ直交している。ドメイン内で行動に基づいて定義された無効性認識方向は、認識により近いが、それと部分的にしか整合しておらず、安全性拒否とは依然としてほぼ直交している。生成時のステアリングを認識方向に沿って行うと、構造的な数学およびコードのセルにおいて、無効性認識行動が双方向かつ用量依存的に変化するが、ランダム方向では変化しない。ベースモデルと指示チューニング済みモデルの比較はさらに、低コサインの幾何構造が事前学習終了時点ですでに存在していることを示している。したがって、不可能問題で自信を持ってしまう失敗は、符号化の失敗というよりもルーティングの失敗としてよりよく説明される。モデルは使用可能な「許容可能な回答なし」信号を持っているが、安全性拒否経路はそれを使うように整合していない。
Chain-of-Thought (CoT) は大規模言語モデル (LLM) の推論能力を向上させるが、多大な計算コストとコンテキストコストを伴う。既存の手法は、ハードプルーニングによって中間情報を失うか、連続圧縮のための原理的な基準を欠いている。我々は A*-Thought-V2 を提案する。これは LLM の幾何学的ダイナミクスに導かれたフレームワークであり、CoT を隠れ状態の軌跡としてモデル化し、ハード削除を明示的・暗黙的インターリーブ潜在アーキテクチャに置き換える。問題、ステップ、解答の表現を3次元PCA空間に射影した後、各局所遷移と大域的な問題から解答への方向との間の整合性を測定する。整合するステップは明示的なテキストとして残り、逸脱するステップは連続潜在トークンに圧縮される。方向角は局所意味論と推論ダイナミクスの両方を捉える。小さい角度は直接実行と解答形成を示し、大きい角度は確認、修正、分岐探索をより頻繁に含む。それらの時間的変化は探索、収束、洗練の段階を明らかにする。このアーキテクチャを学習するために、我々はステップワイズ埋め込みフォーシングを導入する。これは各冗長ステップを単一の潜在埋め込みにプールする。また、ラベルフォーシングは、その潜在トークンをハードなone-hotラベルの代わりにソフトなマルチモーダル語彙分布で教師あり学習する。Qwen3.5-9B と Qwen3.6-27B を用いた、6つのドメイン内およびドメイン外ベンチマークでの実験は、A*-Thought-V2 が平均精度を最大2.6%向上させ、応答長を最大半分に削減し、計算単位あたりの精度を2.29倍に高め、前処理と学習時間をそれぞれ94.6%と最大80.3%削減することを示している。表現分析は、潜在状態がテキスト状態とは異なるコンパクトな領域を形成することを示唆している。一方、潜在トークン位置での高いエントロピーは、より豊かなステップレベルの特徴学習を促す、より広いソフトターゲットを反映している。
マルチモーダル大規模言語モデル(MLLM)は、視覚的質問応答のような一般的な視覚理解タスクでは高い性能を発揮するが、2つの類似画像間で何が変化したかを識別するという基本的な比較能力ではしばしば苦戦する。本稿では、細粒度の画像差異識別のための困難な多肢選択ベンチマークであるVDiff-Benchを導入する。VDiff-Benchは、画像ペアに関する1,756問の4択問題を含み、位置、動き、画像の局所色、画像全体の色、出現/消失、ノイズ/解像度、テクスチャ、置換/サイズ、OCR/テキスト、照明という10の変化カテゴリを網羅する。各質問は2つの画像入力に対応し、4つの選択肢を持つ。すなわち、真の差異、2つのハードネガティブ記述、および「差異なし」の撹乱選択肢である。課題を困難にするため、モデルが実際の変化を近接する意味的代替候補から区別することを要する、正解に条件付けられた負例を特に厳選した。11の最先端オープンソースおよびクローズドソースMLLMを用いた実験は、細粒度の視覚比較が依然として脆弱であることを示す。モデルはソースおよび変化カテゴリ間で不均一な性能を示し、ノイズやテクスチャのような微妙な低次変化において持続的に失敗する。例えば、7~8B規模のオープンソースMLLM 3モデルは、意味的変化では52.5~70.6%を記録するが、ノイズやテクスチャのような低次変化では8.7~33.3%にとどまり、2つの画像入力間に変化がないと誤って仮定している。驚くべきことに、他のクローズドソース商用モデルが高い性能を示しているにもかかわらず、Grok 4.3は画像間のノイズおよびテクスチャの差異を識別する際に顕著な性能低下を示し、Kimi K2.5やK3のような大規模オープンソースモデルに大きく後れを取っている。全体として、VDiff-BenchはMLLMにおける比較型の視覚理解を評価するための標的を絞った診断を提供し、標準的な単一画像視覚言語タスクでは捉えられない失敗を明らかにする。
画像リライティングは伝統的に、不良設定最適化に悩まされる複雑な逆レンダリングパイプライン、あるいは3D幾何と材質の相互作用を理解するために必要な重要な多視点手がかりを無視する単一画像生成モデルによって取り組まれてきた。これらの限界に対処するため、我々は明示的な固有特性推定を完全に回避する、単一視点および多視点画像の直接リライティングのためのフィードフォワード生成Transformerを導入する。動画基盤モデルから適応した我々のアーキテクチャは、クロスアテンションを介してターゲット環境マップを空間特徴に動的に注入する潜在照明モジュールを備える。さらに、置換不変な位置エンコーディングを採用し、順序を持たない多視点入力を系列バイアスなしに対称に処理する。この頑健なデータ駆動モデルを訓練するために、9万個の物体と3.9万個の一意な照明からなる大規模Laval Objaverse Dataset (LOD)を構築する。広範な実験により、単一視点、多視点、新規視点リライティングタスクにわたる最先端の視覚品質、写実的なリライティング品質、強いゼロショット汎化が示される。
人間は、ある学問分野を習得し、その最も難しい問題に挑むために、ほんの一握りのよく書かれた教科書を学ぶだけでよい。我々は、理想的な自己進化手法も同じ性質を備えるべきだと主張する。すなわち、転移可能な問題解決能力を獲得するために、生の訓練素材から自律的に学習することである。しかし、そのための直接的な測定法は依然として欠けている。我々はStudyBenchを導入する。これは、自己進化手法が訓練素材を能力へどれだけ効率的に変換するかを直接測定する、統制された物理ベンチマークである。我々はテストセットを、難しい教科書問題からなり吸収能力を評価する応用セットと、オリンピック級問題からなり転移能力を評価する転移セットに編成する。3つのベースモデルにわたり代表的な自己進化手法をベンチマーク評価すると、応用セットでの改善が、より難しい転移セットへとほとんど波及しないことが分かる。ガイダンスのアブレーションはガイダンスギャップを露呈する。すなわち、最も強力な手法であっても、同じ素材をインコンテキスト・ガイダンスとして与えたときにそれが引き出す能力のごく一部しか埋められない。さらに、あらゆる手法は計算プラトーに達し、計算予算を使い果たすよりはるかに前に飽和する。したがって、残されたギャップはデータや計算資源の問題ではなく、手法上の問題である。クリーンで統制されたベンチマークを提供することで、StudyBenchは自己進化の進展を、終わりのない探求から将来の研究に向けた測定可能な目標へと変える。コードは https://github.com/thunlp/StudyBench で公開されている。
医療のデジタル化は、生涯にわたる大規模で縦断的かつマルチモーダルな患者記録を生み出してきたが、これらのデータを完全に活用して患者状態の軌跡を表現し予測することは、依然として重要な課題である。現在のAIモデルは、実世界のマルチモーダル患者データが持つ複雑で不規則な時間的ダイナミクスと内在する確率性を捉えることにしばしば苦慮している。縦断的患者記録をモデル化する既存のAIアプローチは、主に識別的であり、少数のモダリティに限定され、閉じたカテゴリカル語彙に制約され、時間を単調な帰納バイアスとして扱うか、将来の患者状態の予測に限界がある。我々は、時間認識型でタスク非依存の生成トランスフォーマーモデルであるNOAHを導入する。これは完全なマルチモーダル患者ジャーニーを表現し予測する。NOAHは、患者状態の連続的進展と臨床経過の確率性を捉えるために、新規の双方向時間統合と変分潜在空間を備える。MIMICデータセットファミリー全体にわたる299,000人の患者の431,000件の病院受診からの5億5,900万件を超える臨床イベントから構築され、NOAHは医療画像、時系列および数値信号、カテゴリカルイベント、ならびに構造化および非構造化臨床記録をネイティブに処理する。NOAHはこの分野で初の真に全体論的な生成モデルであり、任意選択の時間制御を伴う自己回帰的予測、ゼロショット分類、反事実的介入シミュレーションを可能にする。それは、臨床アウトカム、15のICD章、29の併存疾患のプロービングにおいて、またイベント発生までの時間予測において強い性能を示す、極めて情報量が多く予測的な患者状態表現を生成する。多様なモダリティと複雑な時間的ダイナミクスをシームレスに扱い、NOAHは個別化臨床ケアおよびデジタル医療における知的予測システムのための、汎用性が高く、タスク非依存で、スケーラブルな基盤を提供する。
現代のLLMベースのエージェントは、ツール、再利用可能なスキル、専門エージェントからなるハーネスを通じて動作し、そのハーネスがエージェントの観測対象と実行可能な行動を形作る。実際には、このハーネスは新たな能力が追加されるにつれて継続的に進化する。我々は、3つの軸(ツール、スキル、エージェント)にわたる制御されたハーネス進化の下でエージェントを評価するためのベンチマーク、EVOHARNESSBENCHを導入する。エージェント向けの既存の継続学習ベンチマークは、通常、ハーネスを固定したままタスクストリームに非定常性(すなわち、時間とともに変化するもの)を置くのに対し、EVOHARNESSBENCHは、外部から与えられるハーネスそのものに非定常性を置く。これは、検証器ベースのベンチマークから決定論的に構築された17の多段階ハーネスストリームを含み、802タスク、520ツール、42スキル、62エージェントから構成される。我々は、ハーネス進化の中心的課題に対応する2つの相補的設定を評価する。すなわち、ハーネスが拡大するにつれて以前に利用可能だった能力の保持を分離するデプロイ評価と、新たな能力が導入される中で蓄積された経験が依然として有用かを検証する自己進化型適応評価である。我々の結果は3つの根強いギャップを明らかにする。第一に、ハーネスの拡大それ自体が、以前に解決したタスクの性能を低下させ得るため、ハーネス誘発性忘却を生じさせる。第二に、自己進化型適応による利得は、ハーネス進化の段階、能力軸、環境をまたいで一貫しない。第三に、保持と適応は異なる方向に作用し得る。すなわち、以前の能力を保持することは、新たに導入された能力への適応を必ずしも改善せず、その逆も同様である。これらの結果は、進化するハーネスに追随しつつ以前に有効だった行動を保持できるエージェントを構築する上で、ハーネス進化が独自の課題であることを確立する。
エージェントは共有インフラストラクチャを協調型侵入のチャネルに変えうる。Hugging Faceのインシデントと別個の公開ウィキ調査は、セキュリティ評価が複数の実行とそれらが残すアーティファクトからの証拠を必要としうる理由を示している。我々は、防御の運用単位は、観測された転送、タスク権限、応答履歴を結びつける改訂可能な協調エピソードであるべきだと論じる。中心的な研究課題は予期的エピソード発見である。すなわち、評価者がそれらの所属を提供する前に、どの行為が一緒に属するかを見つけることである。我々は、非認可の協調を協働および委譲権限ポリシーに対して定義し、ストレージ媒介型協調をスティグメルジーに結びつけ、影響を共通原因から区別するために必要な証拠を特定する。初回接触シグナルは発見への可能な入力の一つであり、設計は継承された状態と後続の利用も追跡する。提案する評価は、孤立した行為、ローリングウィンドウ、既知のグループ、予期的に発見されたエピソードを、一致させたレビューコストと誤警報負荷の下で比較する。それは、割り当てられたすべての母集団実行にわたる有害な結果を測定し、チャネル閉鎖と状態隔離後の再発を検証する。チェックサム検証済みの公開ウィキエクスポートの再構築は、保持された書き込みの減少を後続の管理上のクリーンアップから分離する。貢献は、インシデントに根差した立場、記述的分析、評価設計である。それは、新しい検出器や測定された封じ込め便益を主張することなく、実行をまたぐ監視という勧告を検証可能にする。
本稿では、現代の物理ベースレンダリングシステムを補完する、統一的な学習型トランスフォーマーベースニューラルレンダリングモデル「RenderFormer-V2」を提示する。これは、コースティクス、体積散乱、環境照明、テクスチャ付き表面およびディスプレイスされた表面、分布外マテリアルなど、多様な光輸送効果を、シーンごとの学習や専用コードを要することなく扱うことができる。RenderFormer-V2 は大域的光輸送を系列対系列変換としてモデル化する。前身に従い、RenderFormer-V2 も二段階プロセスを採用する。すなわち、シーン内のプリミティブ間輸送を解く視点非依存段階と、内部ニューラルシーン表現を画像ピクセルへ変換する視点依存段階である。RenderFormer と異なり、我々のモデルは、レンダリング精度を維持しつつスケーラビリティを向上させるため、視点非依存段階において、ウィンドウ化アテンションとレンダリング情報に基づくアテンションシンクを組み合わせた新規機構を採用する。さらに汎用性を高めるため、RenderFormerV2 は環境マップや参加媒質を含む異種シーンプリミティブをサポートし、基礎となる表面反射モデルから独立したマテリアル符号化を採用する。これは新規のニューラル埋め込みを介してマテリアル外観を符号化する。様々なシーンにおいて RenderFormer-V2 の汎用性を実証し、改良されたアテンション機構について広範なアブレーションを行う。
我々はエンタープライズ分析に対する統制されたアプローチを研究する。言語モデルが質問を解釈し、決定論的ポリシーが事前承認された分析プログラムを選択して実行し、結果と証拠の両方を返す。我々は、この制限が、関係演算に加えて集約、比較、ウィンドウ、ランキング、類似性を用いることにより、定義された分析クラス内で表現力を維持できることを示す。固定された意味、ポリシー、データ、および実行規則はまた、結果を再現可能にする。440回の実行にわたり、3つの8Bモデルが実行時にSQLを生成しツールを選択したが、Qwen3-8Bは意図のみを解釈し、ポリシーが承認されたプログラムを実行した。330の実行時計画エピソードのうち、すべてのテストデータセットにわたって完全な回答と証拠の契約に一致したものはなかった。ポリシー実行アナライザーは110のうち110に一致した。これは構成固有の結果であり、他の設計の下で実行時エージェントが成功できないことの証拠ではない。
我々はGraph Machine(GM)を導入する。これはO(n)サイズの状態を保持し、スパースで動的なルーティングを通じてその状態にアクセスするアーキテクチャである。固定サイズの状態を持つ手法や、スパースだが静的なルーティングを用いる手法とは異なり、GMはスパース層においてO(n)の計算量を保ちつつ、潜在的にアクセス可能な状態サイズをO(1)に制限しない。代わりに、GMはエッジ——ポインタチェイシングに似た参照機構によって微分可能に更新されるポインタ様オブジェクト——を用いる。我々はQwen3-0.6Bにおける密なTransformer層の75%をGMスパース層に置き換え、15.7Bトークンでスクラッチから事前学習する。各スパース層のKVヘッドごとに4,096トークン中2トークンのみを取得する場合、損失はわずかに悪化するのみであり、4トークンの場合、最良モデルは損失をわずかに改善する。
指示誘導型3D編集はインタラクティブなコンテンツ作成に不可欠であるが、重大なボトルネックに直面している。それは、高品質なペア訓練データの深刻な不足である。既存手法は、低速なテスト時最適化に依存するか、複雑なパイプラインによって構築された疑似ペアで訓練することによってこれを回避しようとするが、しばしば構造ドリフトや幾何学的アーティファクトを引き起こす。本論文では、生成的プライア蒸留により、ペア付き3D教師なしでフィードフォワード3D編集を学習する新規フレームワークを提案する。正解3Dペアに依存する代わりに、我々の中心的なアイデアは、強力な基盤モデルから視覚・意味・幾何学的知識を3D編集モデルに直接蒸留することである。具体的には、微分可能レンダリングパイプラインを通じて、2つの相補的な信号を用いて3D表現を監督する。すなわち、主編集ビューにおける画像編集モデルからの2D視覚プライアと、新規ビューにおける視覚言語モデルからの意味プライアであり、これらは厳密な指示追従とソース同一性保持を保証する。重要なことに、2D投影監督に固有の幾何学的崩壊と多視点不整合に対処するため、我々は3D認識型分布マッチング正則化を導入する。この項は幾何学的プライアとして機能し、3D潜在空間で動作して、編集された出力が、事前学習済みの画像から3Dへの教師モデルによって定義されるリアルな3Dアセットの多様体に留まるよう制約する。広範な実験により、本手法が優れた指示忠実度とクロスビュー一貫性を達成し、最先端ベースラインを大幅に上回ることを示す。プロジェクトはこちらで公開している:https://github.com/thiamine128/PriorEdit3D。