翻訳付きの日次キュレーションされたAI研究論文
長期的なエージェントは、基盤となるモデルが構成ステップを個別に解ける場合でも失敗することがある。可変状態を見失ったり、以前の実行からの教訓を再活性化できなかったり、既知の手順を省略したり、早期に停止したりする可能性がある。我々は、モデルの重みを変更せずにエージェントの周囲の実行システムを改善するハーネススケーリングに賭ける。我々は、実行を永続的状態、フェーズローカルなコンテキスト、検証付き遷移、回復可能なランブック、そしてエージェントとユーザが一緒に検査できるバージョン管理された手続き的プラクティスの周りに編成するエージェントネイティブなランタイムであるStateMを紹介する。 Terminal-Bench 2.1では、StateMはGPT-5.5 xhighを、リファレンスの83.1%およびGPT-5.6 Sol Ultraの91.9%に対し、92.1%に引き上げる。このランブックは変更なしでGPT-5.6に転用される。GPT-5.6 Sol xhighでは、StateMは445回の試行にわたって95.3%の生精度に達し、89タスクすべてで少なくとも1回は成功する。凍結プロファイルは、GPT-5.6 Lunaを76.7%から85.4%に引き上げ、これはSol xhighリファレンスの84.9%を上回る。 同じランタイム、ランブック構造、および黄金律を用いて、38ドル未満の適応により、DeepSeek-V4 Flashは標準タイムアウトで82.7%から88.1%に、88タスクの共通コアでは89.1%に向上する。残りのレイテンシー依存タスクのみを延長することで、報告されているGPT-5.6 Sol maxの88.8%に一致する。最終スコアのAPI使用量は約15ドルであり、GPTリファレンスの574.68ドルに対し、DeepSeekの総支出は52.22ドルである。 BusinessBenchでは、開発セット上で構築されたファミリー固有のランブックにより、ホールドアウトでマクロ0.55ポイント、マイクロ1.34ポイントの向上が得られる。メカニズムが一致する2つのファミリーは10.04ポイント向上する。具体的なルールは、タスクが実行構造を共有する場合に一般化し、一方で制御方法論は広く適用可能である。StateMは、選択された事後分析の知見を永続的で実行可能な前提条件およびプラクティスに変換し、学習された制御を状態保持型の制御を通じて明示的かつ強制可能にする。コードはgithub.com/henryqin1997/statemにある。
ベンチマークはスカラースコア以上のものを提供すべきである。評価を信頼できるものにするのは、そのスコアを正当化する推論である。これはワールドモデルにとって特に重要であり、ロールアウトを評価するには、物理、因果関係、ワールド状態が正しく進化しているかを理解することが必要となる。人間はこのような違反を自然に察知するが、既存のベンチマークはこの能力を自動化していない。指標は力任せに計算され、検証可能な推論チェーンが残らない。我々は、LLMエコシステムのハーネスパラダイムをワールドモデルのベンチマークに導入する、エージェント化された評価パイプラインであるHarnessEval-Wを提案する。HarnessEval-Wは固定のルーブリックを適用するのではなく、各評価ケースの文脈を解釈し、評価問題を測定可能な部分問題に分解し、それぞれに調整された文脈と診断ツールを備えた専門化されたサブエージェントを生成して、各サブ問題について推論させる。その後、親エージェントが収集された証拠を検証し、最終判定に要約する。この階層的ワークフローにより、すべての評価は透明なエビデンスツリーとなり、その完全な推論チェーンが結果を正当化する。我々はHarnessEval-Wを、330の評価ケースにわたる18の代表的なワールドモデルに適用した。その判定は人間の好みと密接に一致し、生成されたすべてのロールアウトについて検証可能で詳細な診断を提供する。我々は完全なパイプラインをライブベンチマークとしてオープンソース化し、ワールドモデルの進化に伴い、新しいスキルや評価ケースの拡充に広くコミュニティが貢献することを歓迎する。
グループ相対アドバンテージを用いた強化学習(RL)は、言語モデル推論器のポストトレーニングにおける事実上の標準となっている。しかし、複数の報酬目的を最適化する場合、既存手法は通常、報酬ベクトルをグループごとの標準化の前に固定重み付き和でスカラー化する。我々は、この設計が2つの根本的な問題を引き起こすことを示す。すなわち、異なる報酬プロファイルを持つロールアウトが同一のアドバンテージを受け取る可能性があり、また、すべての目的がその現在の飽和度に関係なく固定された相対重みで最適化される。その結果、トレーニングは、より大きな残りの改善余地を持つ目的に焦点を当てるのではなく、すでに解決された目的に勾配予算を割り当て続けることになる。我々は、マルチ報酬ポリシー最適化のための飽和認識アドバンテージ再重み付け(SA-MRPO)を導入する。これは、各報酬目的を独立に標準化し、目的の飽和度のバッチレベル推定に応じてその寄与を適応的に割り引くものである。これにより、最適化の労力を最適化が不十分な目的に動的に再配分し、既に十分に満たされている目的のパフォーマンスを経験的に維持する。さらに、飽和認識再重み付けが、更新の大きさを単に再スケーリングするだけでなく、その符号を反転させ得ることを示す。2目的および3目的の報酬組み合わせを用いた数学的推論において、SA-MRPOは15回のベンチマーク比較のうち12回で、より困難な正解率目的をGDPOよりも改善し、AIME24では最大5%の向上を達成した。適応的推論では、5つのベンチマークすべてで精度を改善し、平均3.8%、AMC23では最大9.2%の向上を示した。コーディングベンチマークでは合格率を最大2.3%改善し、すべての設定でより容易な目的を既に満たされた水準付近に維持した。
科学的発見は、分子、タンパク質配列、コンピュータプログラムなど、広大で構造化され、開かれた仮説空間における評価コストの高い目的関数の最適化を伴うことが多い。大規模言語モデル(LLM)などの生成モデルは、そのような空間に対する表現力豊かな事前分布を提供するが、その尤度や自己評価は、目的関数や較正された認識論的不確実性の信頼できる代理とはなり得ない。特に、観測データ分布の外にある新規候補についてはなおさらである。本稿では、生成モデルとベイズ非パラメトリック報酬代理モデルを結合した、実証的に基づく再帰的アーキテクチャであるLarge Discovery Model(LDM)を紹介する。生成モデルは候補設計を提案・改良し、一方で代理モデルはその性能を予測して不確実性を定量化し、不確実性を考慮した価値を導出することで、候補の生成・改良・選択を導く。発見メモリと代理モデルは、新しい実験観測が得られるたびに継続的に更新される。我々は、ニューラルネットワーク学習、抗体設計、分子最適化を含む、異なる設計様式と目的関数にわたる3つのシナリオでLDMを評価した。LLMのみによる振り返りやこれらの領域にわたる従来の統計的探索と比較して、LDMは検証BPBの2.4倍の削減、結合エネルギーの18.2%の相対的減少、分子多目的性能の60%以上の相対的向上を達成した。これらの結果は、LDMが開かれた仮説空間における効果的な探索のための汎用発見エンジンとして機能し得ることを示唆している。
ユーザーのクエリからインタラクティブな3Dオープンワールドを構築することは重要である。しかし、既存手法は主に理想化された単純なクエリで評価されており、マルチモーダルエージェントがユーザーの意図を理解し、3Dツールを使用し、テキストおよび視覚的な3Dワールド情報に基づいて推論する方法を体系的に分析・比較することは困難である。この目的のため、我々はVibeWorldingを提案する。これは、vibe worldingエージェントをベンチマーク評価および訓練するための統一フレームワークであり、マルチターンのエージェント・環境相互作用プロセスにおいて、ユーザーの意図を自律的に推論し、シーンレイアウトを計画し、3Dツールを呼び出し、マルチモーダルフィードバックを反映することができるマルチモーダルエージェントである。これを実現するために、まずVWE-BENCHを構築する。これは、2,616点の高品質な3Dアセット、323件の人間がアノテーションしたシード3Dワールド、および6,828件の逆合成されたマルチモーダルユーザークエリからなるベンチマークであり、正解ラベル付きの検証済みクエリと、慎重に設計されたルーブリック付きの未検証クエリに分割される。さらに、我々はVibeWorlding-Gymを開発する。これは、アセット検索、編集、画像レンダリングをMCPツールとして統合するサンドボックス環境と、物理的実現可能性と意図充足の検証を組み合わせたルーブリックベースの検証器を統合した、マルチモーダルRL事後訓練のための統合フレームワークであり、公平なモデル評価とスケーラブルなマルチモーダルRL報酬サービスの両方をサポートする。我々の実験は、現在の最先端MLLMがvibe worldingエージェントタスクを解くには程遠く、GPT-5.5やQwen3.8-Maxでさえ成功率が60%未満であることを示しており、そのボトルネックは精密な3Dワールド編集にあると特定している。さらに、RL訓練がこの弱点を緩和し、オープンソースのMLLMがクローズドソースの最先端モデルを凌駕することさえ可能にすることを見出した。我々のVibeWorlder-8Bは最先端MLLMに匹敵し、一方、主力モデルであるVibeWorlder-30B-A3Bは、評価されたすべてのモデルの中で総合的に最高のPass@1を達成する。
我々はMOSS-VLを紹介する。これは、リアルタイム対話、すなわち話しながら知覚することを第一級の能力として扱う、オープンな視覚言語モデル群である。このモデルはスタック全体にわたって共設計されている。言語デコーダはゲート付きクロスアテンションを通してのみ視覚に注意を向けるため、モデルは生成中に自然に入力フレームを見ることができる。合成された対話コーパスは、いつ話すべきか、いつ沈黙すべきか、いつ訂正すべきかを監督する。また、段階的なカリキュラムにより、リアルタイム特有の訓練はすべて、強力なオフライン基盤の上で行われる軽量な最終段階に集中される。オフラインでは、MOSS-VL-Instructは同等規模で競争力を有し、時間的推論を要するビデオデータセットで最高水準を示す。4つのストリーミングベンチマークにおいて、MOSS-VL-Realtimeはオープンソースのストリーミングモデルの中で3つで最高平均(残る1つで2位)を記録し、積極的行動を直接試す3つのサブセットを席巻した。OmniMMI Proactive Alertingでは、最良ベースラインの37.5に対して66.0を達成した。MOSS-VLは113億パラメータを有する一方で視覚トークンを復号シーケンスの外に置くことで、視覚コンテキストが増大するにつれて、同一バックボーンであるQwen3-VL-8Bに対する最初のトークンまでの時間の優位性を2.8倍から5.1倍へと拡大する。我々は、5つのチェックポイントすべて、訓練カリキュラム、およびリアルタイム推論コードをhttps://github.com/OpenMOSS/MOSS-VLで公開する。
基盤GUIエージェントは複雑なデジタルタスクを自動化できるが、その展開は、不足し偏ったトレーニングデータ、曖昧なプロンプト、そして信頼性の低い実行によって妨げられている。日常的なワークフローはユーザー固有のツールや暗黙の慣習に依存しているため、明示されていない指示は実行ごとに恣意的なばらつきを生む可能性がある。我々は、環境に基づくトレーニングスタックと文脈内デモンストレーション学習を統合した基盤GUIエージェントであるUI-Mateを提案する。UI-Mateは以下の3つの貢献を行う。 スケーラブルな環境基盤型トレーニングスタック: 閉ループのデータエンジンは、統合タスク検証器バンドルを通じて、大規模並列環境全体でタスク生成、環境構築、ロールアウト、フィルタリング、能力バランス調整、SFT、およびオンラインRLを自動化する。 文脈内デモンストレーション学習: マルチモーダルなデモンストレーションを柔軟なサブタスクレベルのワークフローに変換し、関連する実演ステップに従い、ライブインターフェースから再計画するメカニズム。 OSWorkerBenchベンチマークと知見: 41のアプリケーションにわたる100の長期的なオフィスタスクからなるベンチマークであり、指示のみによる評価とデモンストレーション誘導による評価の両方をサポートする。そのデモンストレーションリソースは、同じターゲットに対する強力なエージェントの成功ロールアウトから構築された33タスクの自己デモ設定と、関連するが同一ではないタスクの人間による記録から構築された45タスクの変種デモ設定を分離する。 実験により、UI-Mate-27Bは一般的なコンピュータ操作ベンチマークにおいて、オープンウェイトの新たな最高水準(SOTA)を達成し、OSWorld-Verifiedで77.0%、WindowsAgentArenaで66.2%を記録することを示す。OSWorkerBenchでは、厳密成功率41.0%、進捗率76.9%を達成し、ベースモデルであるQwen3.6-27Bをそれぞれ17.7ポイントおよび24.5ポイント上回る。33タスクの自己デモサブセットでは、単一のデモンストレーションにより厳密成功率が17.2%から35.4%へ、進捗率が67.9%から81.1%へ向上し、長期的な信頼性が大幅に改善される。 プロジェクトページ: https://ui-mate.github.io
エージェントハーネスは、エージェントと環境との相互作用を調整することにより、長期的タスクにおける性能を大幅に向上させてきた。しかしながら、複雑なハーネスを通じた強化学習は、そのような学習を長期的エージェントタスクへ拡張することに根本的な課題が伴うため、依然としてほとんど未開拓である。本研究では、複雑なハーネスを通じた汎用エージェントの安定的かつスケーラブルな最適化を実現する、統合的なブラックボックスRLフレームワークを提示する。具体的には、まずサンドボックスベースの実行基盤を構築し、タスク環境とハーネスを一時的なサンドボックス内に隔離することで、大規模な並行ロールアウトを可能にする。次に、方策最適化を不透明なハーネス実行から分離し、モデル境界にサービングプロキシを配置してモデル呼び出しを捕捉する。マルチターン軌跡の再構築と学習効率の向上のために、捕捉した呼び出しをプレフィックスツリーに整理し、さらにクリティックベースのPPOとクリティック不要のGRPOの双方を、復元されたツリー構造上の最適化に適応させる。同時に、最適化プロセス全体を通じて学習・推論の一貫性を維持する。最後に、ミックスハーネス学習を導入し、単一のモデルを異種ハーネスによって共同最適化できるようにする。Qwen3-30A3Bを用いた場合、ブラックボックスRLは、OpenClawおよびClaude Codeを通じて、ClawGym-BenchのPass@1をそれぞれ9.98ポイントおよび14.81ポイント向上させ、200~400の最適化ステップにわたって安定性を維持した。さらに、本フレームワークは、JobBenchやOfficeQAなど、より困難なタスクにおいても一貫した改善をもたらした。全体として、本フレームワークは、ブラックボックスハーネスを通じた汎用エージェントの効果的かつ安定的、スケーラブルな最適化を可能にし、異種実行システムにわたる統合的な学習を支援する。
本論文では、生成モデリングにおいてますます重要性を増しているトピックである、ピクセル空間拡散モデルを調査する。このトピックを探求した研究は数多く存在するが、そのほとんどは小規模またはクラス条件付きの設定に焦点を当てている。その結果、確立された潜在空間モデルに匹敵するか、それを上回るピクセル空間モデルを訓練するための実用的な手法は、依然として確立されていない。包括的な実証研究を通じて、我々はまず、ピクセル空間での直接的な大規模事前学習は、潜在空間での学習よりもかなり遅く収束することを観察する。この観察は、潜在空間で生成事前知識を効率的に獲得し、ポストトレーニング中にピクセル空間へ移行する、潜在空間からピクセル空間への戦略を動機付ける。次に、我々はこの移行を左右する主要な設計選択肢(重みの初期化、データ構成、予測ターゲット、デコーダアーキテクチャ、ノイズスケジュールなど)を体系的に調査し、結果として得られるピクセル空間モデルが潜在空間モデルに匹敵するか、それを上回りつつ、エンドツーエンドの推論速度を3.18倍から4.75倍向上させる実用的な手法を特定する。我々の発見が、ピクセル空間生成に関する将来の研究にとって有益な実証的知見と実用的なガイドラインを提供することを期待している。
大規模言語モデル(LLM)エージェントは、会話型アシスタントから、推論、ツール利用、コード生成、ワークスペース操作を通じて長期的タスクを実行する自律型システムへと進化している。エージェントが永続的環境およびマルチステップワークフロー上で動作する機会が増えるにつれ、トランザクショナルデータベースシステムが扱ってきた課題、すなわち信頼性の高い実行、一貫した成果、安全な並行性、耐久性のある状態管理と類似した課題に直面する。本稿では、エージェンティックトランザクションの概念を導入し、古典的なACID特性をエージェント実行向けに再解釈するACID準拠エージェントシステムフレームワークを提案する。本フレームワークは、意味的原子性、意味的整合性、意味的独立性、意味的永続性という4つの意味的保証を通じて定義される。これらの特性は、モデルの不確実性や動的な実行環境にもかかわらず、信頼性の高いエージェントシステムを構築するための原理的基盤を総体的に提供する。このフレームワークを具体化するため、トランザクション的な探索-実行-検証サイクル、トランザクション的なスキルハブ、信頼度乖離に基づく検証、意味的依存関係を考慮した独立性、およびトランザクション対応の意味的状態管理を通じてこれらの保証を実現する、ACID準拠データエージェントを開発した。広く使用されているベンチマークを用いた実験結果は、我々のシステムがClaude Codeを含む最先端エージェントと比較して10.6%の改善を達成することを示している。本研究は、信頼性が高く、拡張可能で、自己進化するAIエージェントシステムの構築に向けて、トランザクション原理とシステムアーキテクチャを拡張する、より広範な研究課題を切り開くものである。
AIは長きにわたり科学研究を支援してきたが、大規模言語モデル(LLM)とエージェント的スキャフォールドの急速な進歩により、その状況は一変しつつある。現在では、単一のシステムが初期仮説から最終的な論文発表に至るまで研究の全段階を遂行できるようになっており、このパラダイムはAutoResearchと呼ばれている。既存の評価では、これらのエージェントがどのように動作し、どこで破綻するのかについてほとんど明らかにされていない。タスクの範囲は狭く、評価はプロセスではなく性能を測定しており、失敗の診断には体系的な網羅性や成果物レベルの可視性が欠けている。このギャップに対処するため、我々はAutoResearchEvalを導入する。これは、7つの科学領域にわたり発表された最先端の科学に基づく100のタスクと、発想、検索、実行、分析、執筆、レビューを含む研究ライフサイクル全体を特徴とする。8つのハーネス・モデル組み合わせの評価により、プロセスレベルのアノテーションを備えた800のAutoResearchエージェント軌跡が得られた。我々はこれらの洞察を、45の経験的に基づく失敗パターンの枠組みであるAutoResearch Failure Taxonomy(ARFT)として体系化した。スケーラブルで詳細な帰属を可能にするため、我々は人間により較正されたエージェント・アズ・ジャッジのパイプラインを活用し、完全な軌跡と中間成果物を検査する。失敗パターンは、単一の包括的な限界に収束する。すなわち、現在のエージェントにはメタ認知ループが欠如しているということである。メタ認知ループとは、得られた結果と照らし合わせて自らが生成したものを検証し、それが妥当でない場合に修正し、取った経路が適切であったかを問い直す能力を伴う。同じパターンは、テストされた最も強力なモデルを含むすべての8つのハーネス・モデル組み合わせにわたって再発し、その欠陥は特定のスキャフォールドではなくモデルレベルに位置づけられる。オーケストレーションレベルの介入がこの欠陥を解消できるかどうかは、本研究では検証されていない未解決の問いである。我々は、自律的な科学的発見における研究開発の継続を促進するため、AutoResearchEvalとARFTを公開する。
リレーショナル学習分野におけるPrior Labsの最初のリリースは、オープンサイエンスに対する私たちの継続的なコミットメントを示すものです。私たちは、この分野の研究を有意義な実世界への影響に向けて加速させると期待される3つのソフトウェアをオープンソース化します。私たちは、コミュニティからのフィードバックに基づき、またコミュニティとの協力のもとで、今後の開発を進めていきます。 開発の初期段階にあることを踏まえ、今回のαリリースは研究者とアーリーアダプターの実務家を対象としています。過去数年にわたり、リレーショナル学習のためのさまざまなデータセットとタスクが登場してきましたが、コミュニティはこれらのタスクで異なる手法を比較するための信頼性が高く再現可能な方法に収束していません。今回のαリリースであるRelArena-αは、TabArenaなどの確立された表形式ベンチマークに着想を得て、データローディング、評価プロトコル、チューニング手法、カスタムチューニングを備えたシステムのサポートを標準化することにより、RelBench v1上でベースラインを実行・比較するための統一フレームワークを提供します。私たちは、研究コミュニティと協力して、RelArena-αをリレーショナル学習コミュニティにおける進歩の触媒へとさらに発展させることを計画しています。 TabPFN-3のための専用リレーショナルハーネスであるTabPFN-Relの初期バージョンをリリースします。現在RelArena-αでモデルの中で第1位にランクされているTabPFN-Relは、RDBLearnに対して重要な改良を加えています。そのランキングに加えて、TabPFN-Relは強力なベースラインとして機能し、リレーショナルデータベースを単一のテーブルに平坦化することが実世界のタスクにおいて特殊なリレーショナルアーキテクチャと依然として競合し得るという、増え続ける証拠を補強しています。 研究および産業界におけるリレーショナル学習手法の採用を促進するため、私たちはRelational Predictive Interface(RPI)の初期α版をリリースします。RPIはオープンソースでモデルに依存しないインターフェースであり、アーリーアダプターが新しいデータベース上で問題を容易に定義し、RelArena-αに実装されている任意のモデル(TabPFN-Relを含む)をこれらの問題に適用できるようにします。
テキストから画像への(T2I)生成モデルの急速な進化は、生のピクセル合成という根本的な課題を実質的に解決し、研究コミュニティの焦点を、ますます複雑化するユーザー要求の充足へと移行させた。近年のエージェント型画像生成ワークフローは、外部知識検索や反復的推論といった高度な能力により静的推論を強化する一方、そのほとんどは固定された「一律万能」トポロジーを持つ孤立したサイロとして動作する。これにより、単純なクエリが計算負荷の高いパイプラインを強制的に通過させられるという、深刻な計算ミスマッチが必然的に生じる。このギャップを埋めるため、我々はエージェント型画像生成のための初の統一ワークフロールーティングフレームワークであるGenRouterを提案する。まずGenCanvasを定式化し、多様なエージェント型パイプラインを普遍的な基本プリミティブと実行可能なテンプレートのセットに標準化する。この統一空間上で動作するGenRouterは、(i)要求プロファイリング、(ii)経験マッチング、(iii)パレートフィルタリングを通じて、異種のプロンプトを最適なワークフローに適応的にルーティングする。多様なベンチマークにわたる広範な実験により、GenRouterは高負荷な静的パイプラインと比較して、実行コストを95%以上、レイテンシを65%削減しつつ、優れた視覚的整合性を達成することが実証された。さらに本システムは、蓄積された経験を通じて継続的に自己進化し、性能を向上させて計算オーバーヘッドを半減させる頑健なゼロショット汎化を可能にする。
パートアウェアな3Dオブジェクト生成は、制御可能なモデリング、編集、アーティキュレーションなどのグラフィックス応用において不可欠であり、そこではオブジェクトは意味的パーツの一貫した集合体として表現されます。しかしながら、既存のパートアウェア生成手法は、非常に複雑なオブジェクトに対してうまくスケールしません。パーツ数が増加するにつれて、詳細な形状の生成はトークン長とメモリの点で法外なコストがかかります。我々は、構造化シーケンスモデリングとトークン効率的なベクトル量子化形状トークナイザを組み合わせることでこの課題に対処する、スケーラブルな自己回帰型3D生成フレームワークMegaPartsを提案します。我々のトークナイザは、高忠実度再構成を維持しながらトークン使用量を最小化することでパーツレベルの形状に対する離散潜在表現を学習し、幾何学的複雑度に基づく適応長トークン化を可能にします。このコンパクトな表現の上に、大規模言語モデルを訓練し、統一された構造化シーケンス内でオブジェクトのバウンディングボックス、パーツのバウンディングボックス、およびパーツ形状トークンを生成します。効率的な長文脈学習戦略と組み合わせることで、我々のトークン効率的な定式化は、最大300パーツ、最大256kトークンのシーケンス長を持つオブジェクトにスケールします。これにより、構成構造を維持し、きめ細かいパーツレベルの制御を可能にしながら、パートアウェア3D生成の規模を大幅に拡張します。本手法は、ベースラインの自己回帰モデルや拡散モデルよりも高いメッシュ品質を達成し、圧縮された離散パーツトークンがスケーラビリティだけでなく生成形状の達成可能な忠実度も向上させることを示します。これらの結果は、LLMネイティブのトークン効率的自己回帰モデリングが、大規模パートアウェア3D生成における拡散モデルの有力な代替手段であることを示唆しています。プロジェクトページは https://expmaster.github.io/megaparts_webpage で公開しています。
大規模言語モデル(LLM)を搭載したフロンティア・エージェンティックシステムは、人間に類似した認知パターンを示す。これらのシステムが多様な領域に深く統合されるにつれ、その認知的関与は人間社会にとって重大な懸念を引き起こすが、その研究は未だ十分ではない。このギャップを埋めるため、我々は認知能力の拡大によって誘発されるリスクを、その認知範囲によって定義される物理的認知から社会的認知、さらには自己参照的認知に至る三層の枠組みに従って体系的に分析する。各認知レベルに対応して、人間の主体性、自律性、および制御能力に対する潜在的リスクを検討する。最後に、これらのリスクを軽減し、エージェンティックAIシステムの制御可能性を高め、その長期的な安全な開発を確保するための戦略を提案する。
指示に基づく汎用ビデオ編集は、多様な編集操作を単一の直感的なインターフェースで統合することを目指している。既存の手法は、重量級のブランチやコストのかかるソース連結を用いる、リソース集約的な条件付けに依存することが多い。編集意図を効率的にモデル化する方法はあるのだろうか。そこで我々は、軽量な二段階フレームワークであるGRNEditを導入する。GRNは、ビットの組み合わせを通じて視覚的意味を符号化するという点で、我々のアプローチに着想を与える。タスク特化の微調整を通じて、我々はこの表現をさらに発展させ、編集の意味を個々のビットに対する局所的な保持または反転の決定として再解釈する。その結果、ソース情報は、観測された二値状態を支持する座標ごとの証拠としてモデル化され、一方GRNバックボーンは、それらの全体的な構成を一貫した生成意味へと解決する役割を担う。ステージIでは、コンパクトなエンコーダが離散的なソースコードを連続的なエビデンス信号に変換し、GRNは二値精緻化の過程全体を通じてこれを同化する。分類器フリーガイダンスのためのヌルプロンプト学習に着想を得て、我々はさらにヌル条件に編集固有の意味を割り当てる。すなわち、空の指示は無編集を意味し、ソース再構成を通じて教師あり学習される。この恒等パスは、ステージIにおけるエビデンスの利用とコンテンツ保存を暗黙的に強化するだけでなく、編集済み状態と同じ表現空間内にソース保存状態を生成する。したがってステージIIは、各編集済み状態を対応するソース保存状態と直接比較し、その差を用いて未解決のターゲットビット決定を修正することができる。わずか0.6Mペア、3%未満の条件付けパラメータで学習されたGRNEdit-2BおよびGRNEdit-8Bは、OpenVE-Benchでそれぞれ4.03および4.18のスコアを達成する。2Bモデルは複数の14Bオープンソース編集モデルを上回り、8Bモデルは主要なオープンソース編集モデルと同等の性能を発揮する。
フロンティア大規模言語モデル(LLM)の安全性評価は、これまで有害な生成を分析の対象としてではなく、攻撃の結果として扱ってきた。そのため、モデルの誤動作中に生成される有害な出力についてはほとんど知られていない。その一因は、フロンティアLLMの誤動作に関する大規模かつ高品質なコレクションの入手が困難であることにある。このギャップを埋めるために、我々はHarmProfileを紹介する。これは、多様な有害カテゴリとモデルファミリーにわたってモデルの誤動作を収集したコンテンツ中心のベンチマークデータセットであり、その結果得られる有害出力の分布をモデルレベルのリスクプロファイルとして定義する。その前提は、言語行動が発話コーパスから特徴づけられるのと同様に、モデルのリスクは安全性の失敗の内容、重大性、多様性から特徴づけることができるというものである。HarmProfileには、13のモデルファミリーにわたる23のフロンティアLLMから得られた8万以上の検証済みアーティファクトが含まれ、15の有害カテゴリと57のサブカテゴリに整理されている。このコーパスを用いた分析により、フロンティアLLMは大規模に有害なコンテンツを確実に生成する一方で、それぞれに異なるリスクプロファイルを示すことが明らかになった。さらに、有害性と多様性はどちらもモデルの能力とともに増大する。これは、フロンティアLLMが安全に見える一方で、アライメントの表面の下にますます危険な知識を秘めている可能性を示唆する。我々のソースコードは https://github.com/fresh-ma/HarmProfile で入手可能である。
大規模言語モデルがますます普及するにつれ、オープンウェイトモデルを展開する第三者プロバイダーはエコシステムの重要な構成要素となっている。したがって、それらの推論APIの品質を監査することは未解決の問題である。我々はホスト型モデルのルーティングを確率過程として形式化し、対象APIからの確率情報を必要としない複合ブラックボックス監査である\textbf{Ventor-QTest}を提案する。その反復リクエストコンポーネントは、凍結された制約付きコンテキストを対象に複数回送信し、返されたテキストのカウントからカテゴリカルな出力分布を再構築し、平均忠実度損失(AFL)を、ヌルバイアス補正済みの窓内平均粗視化KL統計量として報告する。その長文シーケンスコンポーネントは、独立した実行を用いて、実行レベルの参照中心サプライザル統計量の経験的上側裾を通じて極端忠実度損失(EFL)を報告する。対数確率が利用可能な3つのルート条件にわたって、AFLは対数確率由来の粗視化KL比較器と強い線形的記述的一致を示す。7つのルートスナップショットにわたって、20回実行のシーケンスプローブはルート固有のEFL変動を明らかにする。AFLとEFLはGPQA-Diamond精度との検出可能なルートレベルの関連性をほとんど示さない。対照的に、顕著なEFLはタスク露出が増加するにつれてTerminal-Benchの合格率の低下と一致する。このパターンは、長期的タスクにおける正確性が極端忠実度損失により敏感であるために生じる可能性がある。これらの結果は、特に長期的エージェント的タスクの監査において、AFLとEFLを併せて報告することの動機付けとなる。オープンソース実装はhttps://github.com/Tencent/AI-Infra-Guard/tree/main/services/api_checker/ventor_qtestで入手可能である。
行列積の指数ωに関する現在の最良の上界は、レーザー法の改良である組合せ損失解析(Duan et al., 2022; Williams et al., 2024; Alman et al., 2025)によって得られている。本ノートでは、この手法の中核にある最適化問題に取り組み、いくつかの改善を提案する。第一に、最適化問題を再定式化し、従来よりも広い設定で解くことを可能にする。第二に、機械学習における最近の進展を活用し、この問題に対する新たな最適化アルゴリズムを設計する。最後に、得られた最適化アルゴリズムをAlphaEvolveによって洗練させる。これらの手法を組み合わせることで、ω < 2.371177という上界が得られ、従来の最良の上界である2.371339を改善する。
認知科学において、資源合理性は、エージェントが限られた計算資源をどのように配分して期待価値を最大化すべきかを問うものである。ほとんどの推論およびエージェントベンチマークは、タスクごとに独立した予算を用いるが、既存の共有予算研究は、同一モデルが単一問題で示した能力に対してスイート性能を較正していない。我々はR^3-Benchを導入する。これは、数学、競技プログラミング、抽象推論にわたる6問題からなるスイートを、共有予算の下で、ツールなし設定とエージェント設定の両方で評価するものである。対応付けられた単一問題の応答曲線は、観測された成功に対するオフラインの経験的オラクルを定義する。6モデルについて主要テーブルの72セル全体で、オラクル平均は全てのセルにおいてコンテスト平均と一致するか上回り、71セルでは厳密に高い。中程度のツールなし圧力の下では、均等配分リプレイも6モデルのうち4モデルでコンテスト性能を上回る。軌跡診断は、限られた戦略更新と圧力依存の失敗パターンを明らかにする。強いエージェント圧力の下での3モデル診断では、少なくとも1つの固定スケジューラが9セルのうち6セルでコンテスト平均を上回るが、どの方針も領域全体を支配しない。これらの結果は、実証された能力と共有予算の実現との間に持続的なギャップが存在することを示している。
自己進化エージェントは相互作用経験から将来の行動を改善するが、既存の評価は通常、固定された実行条件下での最適化に留まり、条件が変化した後の回復をテストしない。このギャップに対処するため、我々はPACE-Bench(Physics Adaptation via Code Evolution)を導入する。これは6つの物理領域にわたる144のソースからターゲットへの適応ペアからなる、シミュレータ基盤のベンチマークである。各ペアは、同一の目標とインターフェースを持つソース環境を、変異したターゲット環境にリンクさせる。ソースで成功するコード駆動設計はターゲットでは失敗し、エージェントは限られた試行予算内で診断用サンドボックスフィードバックを用いて、それを動作するターゲット設計へと反復的に適応させなければならない。我々は4つのパラダイムから10の自己進化手法を比較する。ベンチマークは飽和には程遠い。Reflexion + Qwen3-14Bは全ベンチマークペアの35.9%しか成功せず、GPT-5.5は完全な予算の下でStaticsサブセットの66.7%を解くに留まる。これらの結果は総合すると、シミュレータに基づく反省は検証されていない自己修正よりも信頼性が高く、一方でメモリはエージェントを初期設計に固定し、広範な木探索は収束せずに探索することを示している。正確な物理的変化を明らかにしても性能の上限は上がらず、中心的なボトルネックはパラメータ推定ではなくメカニズムの再設計であることを示している。データとコードは https://github.com/thunlp/PACE-Bench で入手可能である。
複数参照画像生成のための統合マルチモーダルモデルは近年進歩しているものの、既存のベンチマークは(例えば「被写体合成」のような)事前定義されたタスク種別を中心に構成されたままであり、このような組合せ的設定には適しておらず、断片的なカバレッジ、制御されていない複雑性、そして診断的価値の乏しさをもたらしている。 多様な複数参照タスクが共通の原子的操作を共有していることを認識し、我々は能力指向の視点を採用して、アンカー (f)、分離 (g)、適用 (⊕)、合成 (C) の4つの演算子を形式化する。これにより、任意の複数参照プロンプトは、これらの演算子からなる合成的な式として表現でき、その構造的複雑さは演算子スロットの数によって定量化される。 この定式化に基づき、我々は TRACE-Bench を構築する。これは、スロット数1〜8にわたる約1,600件の評価ケースからなり、631個の式テンプレートと、多様な芸術スタイルおよび実世界の被写体を網羅する約4,000枚の参照画像から構築されている。 この式構造は、能力ごとのスコアリングのための演算子整合型評価プロトコルと、再帰的な障害位置特定のための診断ツリー分析を直接駆動する。 9つの主要モデルを評価したところ、全体的なスコアリングでは見えない洞察が明らかになった。すなわち、主要なボトルネックはシーンレベルの合成 (C) ではなく、分離 (g) と属性結合 (⊕) にあり、最良のモデルでも属性忠実度は0.74に留まる。 プロジェクトページ: https://amuseum-whr.github.io/TraceBench
ビデオ理解は、マルチモーダル大規模言語モデル(MLLM)の能力を評価するための基礎的なタスクである。しかしながら、既存の最先端モデルはVideo-MMEリーダーボードにおいてすでに約90%の精度を達成しており、従来型の単一ターンビデオ理解タスクは飽和状態に近づきつつあり、高度なMLLMの知能を評価するには不十分となっていることが示唆される。この課題に対処するため、我々は汎用人工知能(AI)アシスタントのためのエージェント的ビデオ理解ベンチマークであるVideoGAIAを提案する。VideoGAIAは単一ターンのビデオ質問応答を超え、ビデオ理解をマルチターンかつツール拡張型の対話プロセスとして定式化する。このプロセスにおいて、モデルはビデオを反復的に認識し、外部ツールを呼び出し、補完的な情報を収集し、ターンを跨いでマルチモーダルな証拠を統合しなければならない。VideoGAIAは、多様で複雑な実世界シナリオを網羅する271のモデル・人間共同設計タスクで構成される。各ビデオ-質問-回答インスタンスは、正確性と適切な難易度の両方を保証するため、3名の人間専門家により独立して検証される。GPT-5.5やKimi-K3などのフロンティアモデルを含む評価対象の全MLLMは、VideoGAIAにおいて60%未満の精度しか達成しておらず、次世代MLLMを評価するための高品質かつ時宜にかなったベンチマークとしての価値が浮き彫りにされる。我々は、VideoGAIAが従来型のビデオ理解からエージェント的ビデオ理解への移行を促進することを期待する。
本稿では、任意のキャラクターに対してアニメーションデータを一切必要とせずに3D発話アニメーションを生成する新しい手法AnyTalkを提案する。既存の音声駆動3D発話アニメーション手法は、キャラクター固有のトレーニングデータや手間のかかるリギング/リメッシュに依存している。これに対しAnyTalkは、大規模なビデオデータセットで学習された最近のビデオ拡散モデルを活用することで、これらの制約を回避する。まず、提案するキャラクター特化ファインチューニング(CsF)技術により、事前学習済みビデオ拡散モデルを対象キャラクターに適応させる。3Dキャラクターのレンダリング画像に、ゼロ化したオーディオ埋め込み(「動きなし」を表す)を組み合わせてファインチューニングすることで、アニメーションデータを必要とせずに、大規模ビデオ拡散モデルのモーションプライアを保持する。次に、得られたトーキングヘッドビデオを、提案する最適化プロセスによるブレンドシェイプパラメータの推定を通じて、3D発話アニメーションへと変換する。AnyTalkは、多様な顔メッシュやブレンドシェイプ構成にわたってリップシンクされたアニメーションを可能にし、手作業とデータ要件を大幅に削減する。さらに、AnyTalkを蒸留してAnyTalk_{RT}という効率的なネットワークを構築することで使いやすさを向上させ、リアルタイム性能を実現する。トーキングヘッドビデオ生成を活用することにより、本手法は任意のキャラクターに対する音声駆動の発話アニメーション技術へのアクセスを広げる。コードは https://serin-yoon.github.io/projects/anytalk/ で公開している。
マルチモーダル大規模言語モデルは、空間的・時間的・身体的環境について推論するために、ますます視覚的思考連鎖(Visual CoT)を活用している。中間的な推論画像を生成することにより、Visual CoTは視覚的先見のための直感的なメカニズムを提供する一方で、 substantialな推論オーバーヘッドを導入し、これはプロアクティブな映像推論において特に問題となる。本研究では、モデルがトレーニング中に視覚的思考を学習し、推論時には直接的に推論できるかどうかを問う。我々は内在化視覚思考(Internalized Visual Thinking, IVT)を導入する。これは、ラベルなし映像に対してテキスト予測と次エンベディング予測を同時に最適化するポストトレーニングフレームワークである。部分的に観測された映像が与えられると、IVTは将来フレームの潜在表現をターゲットとなるテキスト回答とともに予測し、モデルが動き、物体の遷移、相互作用、および潜在的な意図を捕捉することを促進する。推論時には、IVTは将来フレームを合成または再エンコードすることなく、回答を直接生成する。我々は、ターゲット表現、デコーダ設計、予測ホライズン、データ混合、トレーニングカリキュラム、および予測目的関数にわたる対照実験を実施する。IVTは、6つの評価設定すべてにおいて直接回答ファインチューニングを上回り、同じ推論経路を維持する。明示的なVisual CoTと比較して、IVTは同等以上のパフォーマンスを達成し、平均エンドツーエンドレイテンシを5倍以上削減する。これらの知見は、視覚的思考連鎖で用いられる推論時の明示的なピクセル空間生成が、効果的なプロアクティブな映像推論には必ずしも必要ではない可能性を示唆する。予測的ワールドモデリングは、トレーニング中に内在化することで、より正確かつ大幅に効率的なマルチモーダル推論器を生成することができる。
文書解析は、非構造化文書を構造化された機械可読な表現に変換することを目的とする。近年の視覚言語モデル(VLM)の進歩により、文書解析は大幅に進展している。しかしながら、既存手法には依然として2つの大きな課題がある。第一に、分離型VLMベース手法は正確なレイアウト解析に大きく依存しており、カメラ撮影文書における幾何学的歪みが連鎖的な誤りを引き起こす可能性がある。第二に、エンドツーエンドのVLMベース手法は明示的なレイアウト検出への依存を軽減するものの、高解像度のシナリオにおいて冗長な生成、幻覚、および構造推論の不足に悩まされることが多い。これらの課題に対処するため、我々は文書解析のための統合フレームワークであるNaviDC-OCRを提案する。NaviDC-OCRは、変形を考慮した学習を導入して幾何学的認識をVLMに組み込み、複雑なレイアウト表現のための適応的サンプリング機構を提案する。さらに、数式文法と表構造を明示的にモデル化する内容・構造分離学習戦略を開発し、より効果的な構造化表現学習を可能にする。大規模な実験により、NaviDC-OCRが多様な文書解析ベンチマークで最先端の性能を達成することが示された。具体的には、OmniDocBench v1.6、Wild-OmniDocBench、PureDocBenchにおいてそれぞれ96.87、88.53、78.41の総合スコアを獲得し、ICDAR 2026 Sci-ImageMinerチャレンジで第1位を獲得した。これらの結果は、複雑な文書解析シナリオにおけるNaviDC-OCRの有効性と汎化能力を実証するものである。
視覚的文書検索は、マルチモーダル検索拡張生成の重要な構成要素であり、エビデンスがテキスト、レイアウト、チャート、視覚的構造に分散している文書コレクションから、クエリに関連するページを特定することを目的としている。近年のより細かい粒度の教師信号を目指す取り組みは、主にテキスト記述または局所的な視覚領域をエビデンスの代理として利用している。しかしながら、そのような教師信号は、複雑な視覚的構造を見落としたり、基盤となるエビデンスの不完全かつ不正確な表現を提供したりする可能性がある。これらの限界に対処するため、我々は視覚的文書検索のための潜在概念表現学習フレームワークであるConceptFormerを提案する。ConceptFormerは、テキストの中間表現や生の視覚アノテーションへの直接的な依存を必要とせずに、クエリに関連するエビデンスを、局所的な視覚的エビデンスと意味的関連性を明示的に橋渡しする、連続的かつクエリ条件付きの潜在概念としてモデル化する。訓練中、ConceptFormerは強力な視覚言語モデルを用いて潜在概念トークンの数を動的に決定し、これらの概念をクエリと文書の間の意味的ギャップを橋渡しする中間表現として使用することで、埋め込み空間の学習を導く。多様な視覚的文書検索ベンチマークによる実験では、ConceptFormerが、最強の視覚検索ベースラインと最強のOCRベースのテキスト検索ベースラインに対して、平均NDCG@10でそれぞれ16.7%と22.1%の相対的な改善を達成することを示す。さらなる分析により、潜在概念が局所的な視覚的エビデンスと意味的関連性を効果的につなぎ、検索器が強い検索整合性を維持しながら、細かい粒度のテキスト的手がかりと複雑な文書レベルの視覚的構造の両方を捉えることを可能にすることが明らかになった。コードとデータは https://github.com/Neuir/ConceptFormer で公開されている。
エンタープライズ質問応答は、内部文書を検索し、根拠のある回答を生成するものとして位置づけられる。しかし、日常的なエンタープライズ記録は業務の副産物であり、必要な組織関係は異種ソース間で暗黙のまま残る。既存のベンチマークは現実的な複数ソースのエビデンスを提供するが、多くの場合、事前定義された回答経路を具現化するため、コーパスに存在しない対象関係の回復ではなく、明示された事実の合成をテストする。我々は後者の能力を潜在組織推論と呼ぶ。 本稿では、日常文書、権威ある組織表、および業務記録から監査済みのエンタープライズ世界を再構築する、グラフを基盤とするベンチマーク構築フレームワークであるENTLOREを紹介する。バージョン管理された組織の取り決めは、真実グラフ内の導出関係を保証し、完全なゴールド回答と証明書を可能にする。整合済みの匿名化リリースは、文書コーパスのみを公開し、非公開の構造と対象関係は秘匿する。ENTLOREは、3つのソースタイプからの2,341文書と、明示的検索、クロスソース合成、および潜在組織推論にわたる907の質問を含み、56のモデルおよびアクセス構成にわたって評価される。公開された世界を誘導エンティティグラフまたはナビゲート可能な知識ベースとして構造化することが、最も強力な実運用可能な結果をもたらす。しかし、ゴールド文書を提供しても、潜在質問の30.4%は未回答のまま残る。これに対し、明示的質問と合成質問ではそれぞれ12.6%と6.2%である。したがって、エンタープライズQAは文書の再現率だけでなく、暗黙の組織関係が利用可能になるかどうかにも依存する。ベンチマーク、データ、コードはENTLOREで公開されている。
自動チェックパイプラインでは、ある言語モデルをチェッカーとして、別の(または同じ)言語モデルを修正役として配置することが増えている。我々は、そのような配線がチェッカーの報告内容を変えるかどうかを問う。人間が検証済みで正しいProcessBenchトレース上で、現在のタスクをバイト単位で同一に保ったまま誤報を測定したところ、モデルのコンテキスト内に既に完了した監査→修正のエピソードが存在すると、15/15のモデル×表現の組み合わせすべてにおいて誤報が低下することがわかった。その低下幅は、長さを一致させた非監査対照群と比較して2.8〜11.5パーセントポイントであり、同対照群に対する9〜25%の減少に相当する。この方向性は、蓄積メッセージに関する文献の予測とは矛盾する。すなわち、監査がエラーを報告したエピソードは、その操作が明確に機能したモデル上の5つの表現すべてにおいて、誤報をさらに低下させるのである。これは、ネガティビティ非対称性がより多くのフラグ付けを予測するにもかかわらずである。エピソードを分解すると、修正内容と監査判定が相補的であることがわかる。異なるコンポーネントが異なるモデルファミリー上でその効果を担っているのである。信号検出分析により、変化は識別力ではなく閾値に位置づけられる。すなわち、基準は15/15の組み合わせで移動し、13の組み合わせでは補正後も有意性を保つのに対し、d'はどの組み合わせでも補正後も有意性を保たない(ただし、d'検定は構造上、感度が半分である)。さらに、50件の誤報を手作業で監査したところ、82%が単純に誤りであり、したがってこの動作点では、そのシフトは有害である必要はない。推論を有効にした場合も、テストした両モデルで効果は相対的な大きさを維持し、閾値に関する解釈もそこでも成り立つ。
大規模言語モデル(LLM)は合成的な調査回答者としてますます用いられているが、既存の評価は回答が個別レベルで妥当に見えるかどうかを問うにとどまる。我々は、正しい問いは心理測定的なものであると主張する。すなわち、LLMは実際の人間の調査データの同時分布、潜在構造、信頼性、媒介経路、および人口統計学的効果を保持しているだろうか。我々は、リトアニアの組織心理学データセット(従業員263名;Dunham Attitudes Toward Change、UWES-17、Koopmans IWPQ;68項目、12下位尺度)を導入し、OpenAI、Anthropic、Google、および12のオープンウェイトファミリーにわたる37モデルのラインナップを、5段階のペルソナ開示条件、提示および推論努力のアブレーション、反事実的人口統計学的交換(性別、役割、教育)、言語横断チェック、および逐語的想起記憶プローブの下で、実際の回答者プロファイルに条件付けた。得られた心理測定的類似度スコア(PSS)は、5つの非LLM統計ベースラインと、ホールドアウトされた人間対人間の上限に対して基準化され、回答者ブートストラップ信頼区間と、タッカーのφのための項目並べ替え帰無仮説を伴う。LLMは人間の心理測定的関係の質的な方向を再現するが、サンプル駆動のPSS構成要素ではガウス・コピュラベースラインがすべてのLLMを上回る。LLMの「群衆」は人間よりもそれ自体に類似しており(LLM間平均PSS 0.73)、記憶化はリーダーボードを駆動しない(想起-PSS順位相関0.00)。反事実的交換は、性別(0.12)と役割(0.18)を凌駕する教育駆動効果(平均|d|=0.56)を明らかにする。UWESのタッカーのφは、37モデル中8モデルで並べ替え帰無仮説の範囲内に収まる。下流では、すべてのLLMが強い同調傾向のシフト(+0.84 SD)を示し、合成データで訓練された回帰モデルはホールドアウトされた人間データに対する予測妥当性を失い(平均R^2 -0.18、対0.28)、またモデルは10のプラセボ媒介経路のうち3つで間接効果を捏造する。LLMサンプルは、人間の調査データのそのままの代替にはならない。
収集作業では、積載量の増加に伴い車両が徐々に低速化し、経路効率に対して累積的なペナルティが課される。車両に搭載されたドローンは、離れたアイテムを回収することでこのペナルティを相殺し、メイクスパンを短縮して運用利益を増加させることができる。しかし、移動時間は依然として積載量に依存し、地上車両が収集する各アイテムは、ドローンの発進地点と合流地点を決定づける到着時刻を変化させる。本論文では、アイテム選択・車両経路・飛行同期を同時に最適化することにより、時間ベースのレンタル費用を差し引いた収集利益を最大化する、ドローン付き巡回泥棒問題(TTP-D)を提案する。小規模インスタンスを最適に解く混合整数線形計画問題を定式化し、より大規模なインスタンス向けに、メタヒューリスティクスと注意機構に基づく深層強化学習(DRL)ポリシーの両方を開発する。さらに、DRLポリシーが初期解を構築し、その後短時間のアニーリング実行がそれを改善する、学習器初期化型ハイブリッドソルバーを提案する。2つのベンチマーク集合において、このハイブリッドは、計算予算のごく一部でメタヒューリスティクスのベースラインの品質の大部分を再現するが、最大規模のインスタンスでは依然としてベースラインを全予算で実行する必要がある。最後に、感度分析により、レンタル比率が収益性の主要な決定要因である一方、フリートパラメータは利益にわずかにしか影響しないことが明らかにされる。
言語モデルは、報告可能な形で潜在量を保持しており、タスクがその量を柔軟に再利用することを要求する場合には、その形により多くの量が存在する。表現がその形に入る原因は未解明であり、「ワークスペース」という言葉は、何が入るかを決めるゲートという入場許可の物語を誘う。ヤコビアンレンズを用いて、五つのアームが同一の文脈を共有するベンチマーク上でオープンウェイトモデルをテストしたところ、ゲートが予測されるような場所にはゲートは見つからなかった。要求は、供給された値に演算子を適用した結果生じるものを超えて、概念のレンズ可視性を高める。主要チェックポイントでは百分位順位で+0.050 [+0.045, +0.057]であり、測定した四つすべてで正である。ただし、そのアームは天井効果を示し、精度を一致させた対照はその読み出しの下でより強い。同時に、一つの共有線形写像が、対照条件を含むすべてのアームから変数を、選択補正済み下限の6.4〜9.0倍で復号する。クエリされた位置における後期の読み出し可能な形を生み出すのは、中間深さのウィンドウ内での注意を介した収集である。パッチ深さと読み出し深さを分離すると、非飽和読み出しの下では、そこでの輸送がより浅い任意の場所よりも少なくとも17倍高くなるが、その内部でテストされたMLP出力のいずれも正に寄与しない。飽和する百分位順位の下では、同じグリッドはウィンドウを局在化しない。これはその測度についての事実である。変数を何にも必要としないアームでは、集中は7分の1であるため、ウィンドウは要求特異的である。そのウィンドウは、下側が生存の失敗、上側が破壊という二つの測定された縁を持ち、64層ハイブリッドモデルと別ファミリーの62層稠密モデルにおいて同じ相対深さに位置する。我々は変数がインストールされ読み出される場所を特定するのであって、パッセージからのルートではない。そのルートは何も輸送しない。しかし、読み出しは使用の較正された尺度ではない。三つの構成要素はそれを互いの12%以内に移動させ、答えに対する効果は7.4倍異なる。
AIデータセンターが機能するGPUを退役させるにつれ、いまだ十分な性能を持つ多数のアクセラレータが中古市場に流入している。本稿では、こうした退役GPUが現代のLLM推論に利用できるDumpsterClusterとして生産的な第二の人生を見いだせるかどうか、またそのような再利用が経済的に実行可能で環境的に持続可能となる条件を検討する。我々は、中古部品のみを用いて128GPU構成のDumpsterClusterをゼロから実際に構築し、1年間稼働させた。現在の市場価格(DumpsterClusterは22Kドル、8GPUのB200システムは600Kドル)では、経済的優位性は極めて大きい。パイプライン並列最適化により、我々のV100ベースのDumpsterClusterは競争力のあるLLaMA-70Bスループットを達成し、本番環境での実用性を検証した。しかし、この導入経験は重要な状況依存性を明らかにしている。旧世代のGPUはトークンあたりのエネルギー消費が大幅に多く、総所有コストが有利となるのは電力料金の安い地域に限られる。系統平均の炭素強度の下では、中古システムは、現行世代のハードウェアと比較して、8Bモデルではトークンあたりの総炭素排出量が約4倍、70Bモデルでは40倍以上になる。これらの知見は、GPUの余生が普遍的に持続可能ではないことを示している。ハードウェアの再利用は、低炭素エネルギー源と戦略的に組み合わせる必要がある。エネルギー経済性が良好でクリーンな電力が利用できる地域に導入された場合、中古GPUは、手頃な価格、エネルギー安全保障、環境責任を推進しながらAI能力を拡大するための実行可能な経路を提供する。
フィールド単位の受理・レビューにおいて、選択的リスクを最大αに抑えること——受理されたフィールドのみの誤り率を管理すること——は、文書抽出システムが要求する信頼契約であり、標準的な手続きは実際の文書上でこれを黙って違反する。800件のCORDレシートから得られた13,859件の実データclaude-sonnet-5フィールド(正解率49.0%)において、我々は3つの失敗モードを診断する: 文書クラスタリング(デザイン効果1.84〜2.45)、スコア再適合リーク(リスク0.127でカバレッジ0.416、α=0.10を95%の分割で違反)、およびタイマス病理(縮退スコアが閾値グリッドを崩壊させ、0.030から0.001へ)。我々は修正策を妥当性ラダーとして整理し、各層ごとに保証形式を明示する。適合/検証分割プロトコルは、学習された融合に対して期待選択リスク制御を回復する: 名目α=0.10でカバレッジ0.318、リスク0.096、許容帯なし(本番バリアントは0.326)——これは平均的な点であり、再分割の47.5%では実現リスクがαを上回る。証明書ではない。Mondrian Learn-then-Testと正確な二項分布の裾を用いることで、グループごとのPAC証明書が得られる: フィールドiidでは0.171(リスク0.068)、クラスタ補正では0.140、文書iidでは0.060——文書に整合する唯一の層であり、正直に言って現在はほぼ空虚である。事前指定された来歴分類法であるサポートビンは、sonnet CORD収集データ上のすべての厳密性層で勝利する(p<1e-4、Bonferroni補正後)——しかしこの勝利は、haikuまたはqwenでは同じ文書上で再現しない——一方、高精度コーパスではプールされた閾値が勝利する: 条件付けは、プール法が証明できないまさにその状況で役立ち、他の状況では学習スコアに包含される。選択プロセスに未使用のclaude-haiku-4-5における凍結構成での確認は、両方のリスク水準で維持された。また、盲検の3名のアノテータによる人間ゴールド監査は、実用層の受理集合リスクが10%の予算に対して1.3%であることを検証する(Fleissのκ=0.83; ラベルは一方的に悲観的な方向に誤る)。Apache-2.0で、シード固定・回帰ゲート付き手続きとともに公開されている。
大規模言語モデルベースのエージェントは、科学的発見における協働者としてますます導入されているが、現在の研究の大半は「AI科学者」の自律的能力に焦点を当てている。我々は、このような視点は科学的チームワークの社会的側面を見落としており、分析単位を人間とエージェントのペアとする人間-エージェントシステム(HAS)としてAI科学者を研究することが、十分に探求されておらず、また十分に評価されていないと主張する。我々は、文献および実証分析を通じてこれらの点を裏づけ、さらに、人間とエージェントのダイナミクスを考慮せずに科学にエージェントを導入することが、科学的探求の多様性の低下を含む短期的リスクをもたらすことを示す最近の事例や研究を強調する。実世界のケーススタディの分析を通じて、科学者とエージェントが互いの能力を補完し得ることを示す。我々は、科学的発見における人間とAIの相乗効果を理解し促進するための数学的枠組みを開発するために、HASの視点を採用する新たな研究を提唱する。
モーション言語モデル(MoLM)は通常、3Dモーションをトークン化し、得られたトークンを言語モデルで処理することによって人間の動作を理解する。しかしながら、単眼ビデオから正確な3Dモーションを取得することは困難であり、その実世界での応用可能性を制限している。この問題に対処するため、我々は、元のモデルを変更したりファインチューニングしたりすることなく、3Dで事前学習されたMoLMが2Dモーション入力を受け付けられるようにする、プラグアンドプレイの2Dモーションインターフェースを導入する。公開データセットでの実験により、我々の手法が複数のMoLMにわたって3Dモーション入力と同等の性能を達成し、2DモーションでMoLMをゼロから学習する手法を上回ることが示された。さらに、我々は単眼の実世界ビデオ動作評価データセットを構築し、実ビデオアダプタを導入して、評価した単眼姿勢推定設定の下で3Dモーションに対する2Dモーションの有用性を示す。これらの結果は、2Dモーションが実世界の動作理解設定においてMoLMを展開するための実用的なインターフェースを提供することを示唆している。コードは https://github.com/irajisamurai/2D-Motion-Interface で入手できる。
探索可能な世界を生成または再構成する学習には、RGBだけでなく、カメラモーション、シーン幾何、時間的対応、そしてインタラクティブモデルについては制御信号と併せたビデオが必要である。実キャプチャはこれらの信号の一部を提供できるが、密な幾何や長距離対応は通常、推定または専用機器に依存する。レンダリングはこれらの量を直接提供するが、既存の合成リソースが同じフレーム上でそれらを組み合わせ、かつ視点と外観の制御された変更をサポートすることはほとんどない。我々は、アーティスト制作環境の豊富な注釈付き長距離探索を生成するためのデータエンジンであるWorldRoverを紹介する。その中核となるWorldRover-Engineは、Unreal Engineパイプラインであり、分単位のルートを実行およびオフラインレンダリングしながら、その完全な軌道とシーン幾何を保持する。同じ探索は、異なる環境状態の下で、一人称、三人称、および360度パノラマカメラから再生することができる。WorldRover-Engineを用いて、我々はWorldRover-10Mを構築する。そのシーケンスは、各探索全体を通じてRGBをメートル単位の深度、カメラ軌道、および軌道由来のアクション信号とペアにする。三人称サブセットはさらに、密なオプティカルフロー、可視性を伴う長距離2D/3Dポイントトラック、およびカメラ軌道とは異なるキャラクター軌道を提供する。このエンジンは、ルートとシーン幾何を保持しながら、異なる環境状態の下で、またはニュートラルな白マテリアルを用いて、一人称、三人称、および360度パノラマ視点からトラバーサルをレンダリングできる。したがってWorldRoverは、長期的な世界探索をスケーラブルなデータ生成問題へと転換し、探索可能な世界の一貫した表現を構築、維持、再訪しなければならないモデルに教師信号を提供する。
多肢選択ベンチマークは大規模言語モデルの評価に広く用いられているが、MCQスコアは知識と選択肢の順序に対する感度を混同しているため、モデルの知識の指標としては信頼性が低い。本論文では、回答を確定する際にモデルが選択肢ラベルを見ることを防ぐことで位置の影響が除去され、ひいては性能が向上するかどうかを検証する。バイアスを軽減するための2つの異なる戦略を評価する。1つ目は生成後照合(generation-then-matching)アプローチを用い、2つ目は選択肢を単独でスコアリングするものであり、これは構造上位置的に不偏である。どちらの戦略も確実に精度を向上させることはない。完全な分解により、ボトルネックは照合ステップではなく、選択肢を提示しないことにあることが示される。ベースラインと一貫して一致する唯一の構成は、モデルにすべての選択肢をLLMマッチャーと組み合わせて提示するものである。しかし、位置の影響を完全に排除しても確実な精度向上はもたらされず、一方で循環置換はしばしば精度を向上させる。2段階プロンプティングについては、再現率不均衡の集約指標と順序感度の質問ごとの直接指標のいずれも、信頼できるバイアス除去を示さない。
検索拡張生成(RAG)は、大規模言語モデルの性能向上に不可欠である。しかし、RAGは、敵対的な文書が注入され、生成器の出力を操作するポイズニング攻撃に対して、ますます脆弱になっている。従来の手法は、このような攻撃を検出するために、パープレキシティや一貫性チェックなどの出力側の指標に依存している。それにもかかわらず、我々の分析は、意図的な攻撃がしばしば偽りの確信を誘発し、毒化された出力が良性の出力よりもさらに低いパープレキシティを示すため、不確実性に基づく検出が効果的でなくなることを明らかにする。この課題に対処するため、我々は生成器の内部ダイナミクスを調査し、Attention Collapse(アテンション崩壊)と名付けた特徴的なシグネチャを特定する。良性の生成における分散したアテンションとは異なり、攻撃された生成では、アテンションが毒化された文書に集中するにつれてエントロピーが減少する。これらの発見に基づき、我々はアテンションのダイナミクスを監視して攻撃された生成を識別する軽量な検出フレームワークであるD-SCAN(Document-level Signal Collapse Analysis)を提案する。複数の攻撃ベンチマークに対する広範な実験により、我々の手法の有効性が示される。さらに、D-SCANは、攻撃が最終的な回答を変更できない場合でも攻撃を検出できる。コードはhttps://github.com/yingtaoren/D-Scan.gitで入手可能である。
境界表現(B-Rep)生成はコンピュータ支援設計における基本的なタスクであるが、高忠実度で構造的に有効なB-Repの直接合成は依然として大きな課題である。既存の深層生成手法には、二つの形態の脆弱性がある。すなわち、潜在空間におけるパディングノイズと特徴汚染に起因する表現の脆弱性と、非微分可能な有効性強制による逐次誤差伝播および訓練推論の不一致に起因する生成の脆弱性である。本稿では、これらの限界を相乗的な二つの貢献によって解決する新しいフレームワークHiFi-BRepを提案する。第一に、トポロジー認識エンコーダが、学習可能なクエリによるパディングの除去と、トポロジー誘導アテンションによる特徴汚染の防止を通じて、高忠実度の潜在表現を構築する。第二に、単一段デコーダが幾何学とトポロジーを並行して同時に予測し、コア多様体制約を微分可能な学習目的として埋め込む。この設計により、幾何学とトポロジーの相互ガイダンスを保証しつつ、カスケード誤差を回避する。広範な実験により、HiFi-BRepは構造的妥当性と幾何学的忠実度の両方において最先端手法を大幅に上回り、高品質なB-Rep合成のための堅牢な解決策を提供することを示す。コードとモデルは https://github.com/1nnoh/HiFi-BRep で公開されている。
ストリーミング動画理解では、展開中の動画のうち因果的に観測されたプレフィックスに基づいて直接応答することが求められる。既存システムは推論時メモリ、検索、圧縮を追加するが、訓練不要のスライディングウィンドウベースラインがすでにそれらに匹敵する。そこで我々は、メモリを使わない直近ウィンドウプロトコルを固定し、ポストトレーニングだけでどこまで到達できるかを問う。検証可能な報酬を用いる強化学習はこの設定に適さず、長い「思考してから回答する」生成を助長する。一方、オンポリシー蒸留(OPD)は、生徒の軌跡に対してトークン単位の密な教師監視を提供するが、両モデルが思考モードで訓練された場合にのみ安定する。これらの観察から、検証可能なストリーミング動画データ、思考モードOPD、およびインストラクトモードでの展開を組み合わせた手法StreamOPDが導かれる。これはStreamingBenchを77.9%から83.9%へ引き上げ(9B教師モデルと0.3ポイント差)、推論を変更せずにOVO-Benchの幻覚検出サブタスク(HLD)を除いたスコアを9.1ポイント改善する。教師特権の拡張として、時空間CueGate(ST-CueGate)は、キューあり・キューなしの教師尤度比を集約してグループ相対応答スコアを算出し、OPDを再重み付けする。これはOVO-Bench(HLDを除く)で71.9%、Video-MMEで64.9%に達し、4つのベンチマークすべてでベースモデルを上回る唯一の変種である。教師を生徒の初期ポリシーの凍結コピーに置き換えるオンポリシー自己蒸留は、これらの利得の大部分を保持し、HLDを57.0%まで引き上げ、未訓練の生徒と9B教師の両方を上回る。したがって、棄権による損失は本手法に内在するものではない。我々は、オープンソースのストリーミング動画研究のための透過的で再現可能なリファレンスを提供する。
音声テキスト基盤モデル(ATMs)は、深刻な音響ノイズの下で壊滅的に失敗する。しかし既存の適応戦略は、勾配ベースのテスト時適応(TTA)に依存するか(これは信号ではなくノイズを強化してしまう)、あるいは推論時には利用できない特権的なノイズ注釈を必要とするプロンプトチューニングに依存する。我々はこれらの失敗に対処するため、PRISM(Prototype-Rectified Iterative Self-supervised Manifold Denoising)を提案する。これは、アフィンノイズ仮説に基づく、訓練不要かつソースフリーのTTAフレームワークである。アフィンノイズ仮説とは、深刻な音響ノイズがマルチモーダル潜在空間に低ランクのアフィンシフトを引き起こし、歪みエネルギーの90%以上が先頭60主成分に集中するというものである。PRISMは、凍結されたテキストプロトタイプを幾何学的アンカーとして用い、ラベルなしのターゲットバッチからこの歪みを推定・反転させる。その際、3つの閉形式幾何補正をAffine Bias Regressionによって単一の静的射影行列に統合する。推論時には、適応は1回の行列ベクトル乗算(0.0009 ms)に帰着し、勾配ベースのTTAよりも大幅に高速であり、追加の訓練を一切必要としない。UrbanSound8Kにおいて、PRISMはゼロショットベースラインを12.94パーセンテージポイント上回り、特権的な拡張ノイズプロンプトを一切観測しないにもかかわらず、オラクル支援TTAベースラインを9.41パーセンテージポイント上回る。さらに我々は、広帯域クラスに対する部分空間デフレーションの原理的な失敗モードであるPolyphonic Trap(ポリフォニックトラップ)を特定し、Confidence-Aware Regression(CAR)によってこれを解決し、最も影響を受けるクラスで最大8.16パーセンテージポイントを回復する。