翻訳付きの日次キュレーションされたAI研究論文
基盤視覚言語モデル(VLM)は世界について広範な知能を示すが、その知能をロボット制御へと変換することは依然として難しい。本稿では、意図と行動を結びつけるコンパクトな意味インターフェースを通じて、VLM がロボットを「プレイ」できるようにする身体化ハーネス(Embodied Harness)である Show-Harness を提案する。Show-Harness は、VLM が自然に推論できる離散的な意味的行動単位を公開し、エンボディメント固有のインタプリタがそれらを決定論的に局所的なロボット行動へ接地することで、VLM が細粒度の物理的決定に直接責任を負うようにする。同じインターフェースを通じて、Show-Harness は、(1) クローズドソースのフロンティア VLM をゼロショットロボット制御のために直接活用できること、および (2) 小規模なオープンソース VLM を、わずか数 GPU 時間のファインチューニングで低コスト展開に適応できること、の実現可能性を示す。さらに、GUMI(GUI Manipulation Interface)を開発する。これは、同じ意味的行動空間を GUI ベースのデモンストレーション収集へ拡張し、人間とエージェントが専用の遠隔操作ハードウェアなしに、エンボディメントをまたいでロボットを「プレイ」できるようにする。広範な実験により、Show-Harness を備えた VLM エージェントは、タスク、エンボディメント、環境をまたいで堅牢に汎化し、代表的なエージェント型および VLA パラダイムを上回ることが示される。これらの結果は、適切なインターフェースが、追加のモデル容量や高コストなエンボディメント固有の事前学習を必要とせずに、基盤 VLM から実質的な身体化能力を引き出し得ることを示唆する。
大規模言語モデル(LLM)ベースのマルチエージェントシステム(MAS)は、専門化された複数のエージェントを活用することで高い性能を達成するが、その性能は各エージェントのプロンプト設計に依存する。MASのプロンプト最適化に向けて、自然言語フィードバックを用いてプロンプト更新を導くテキスト勾配手法が主要なパラダイムとして台頭している。本論文では、既存のテキスト勾配アプローチの2つの段階、すなわち勾配抽出と勾配集約における限界を特定する。勾配抽出では、従来研究は、対象プロンプトを修正することが失敗を解決するかどうかを検証せずにそのプロンプトを選択し、対応するエージェントの中間出力に対するエージェントレベルの監督なしに勾配を導出する。勾配集約では、個々の勾配がランダムにグループ化されて連結され、しばしば無関係な失敗モードを混在させ、汎化しないプロンプトを生成する。これらの限界に対処するため、我々は、逐次介入と意味的テキスト勾配抽象化に基づくマルチエージェントシステム向けプロンプト最適化フレームワークAgentGradを提案する。各失敗に対して、逐次介入は一度に1つのエージェントの振る舞いを変更し、その変更が失敗を解決する対象エージェントを特定する。対象エージェントの変更後の出力は、細粒度勾配を抽出するためのエージェントレベルの監督として機能する。意味的テキスト勾配抽象化は、無関係な失敗モードの混在を防ぐために意味的に類似した勾配をクラスタリングし、各クラスタを、共有された修正パターンを捉える一般化された勾配へと抽象化する。実験結果は、AgentGradが5つのMASベンチマークで最先端性能を達成し、次に速いベースラインと比較してウォールクロック最適化時間を平均で2.5分の1に短縮することを示す。
近年の動画世界モデルは、ますますリアルでインタラクティブな視覚体験を生成しているが、長期的なインタラクションを通じて永続的な世界状態を維持し、プログラム可能な規則を強制するための信頼できる機構を欠いている。我々は、世界状態の進化を視覚観測の生成から分離する枠組みであるProgrammable World Modelを導入する。エージェントは自然言語指示を実行可能なプログラムへと変換し、そのプログラムはエンティティの状態と状態遷移規則を指定することで、個々のエンティティとその相互作用を直接制御できるようにする。軽量エンジンがこれらのプログラムを実行し、画面外のエンティティや非視覚的属性を含む、明示的で永続的なグローバル世界状態を更新・維持する。世界状態と視覚生成を接続するために、我々は状態拡張3D有向バウンディングボックス(OBB)を中間表現として導入する。この表現は目標カメラ軌跡とともに、生成的レンダラーとして機能する事前学習済み動画モデルに対する、ピクセル整列された時空間条件付け信号へと決定論的にコンパイルされる。この設計により、ユーザーは事前定義されたメカニクスを備えたプレイ可能なゲームを作成し、個々のエンティティを直接制御し、ゲームプレイを通じて永続的な世界状態を維持できる。さらに我々は、プログラム可能な世界モデルを評価するためのベンチマークであるCombatStateBenchを導入する。CombatStateBenchにおいて、本手法は94%のカウント精度と98%の状態精度を達成し、既存のインタラクティブ動画世界モデルを大幅に上回るとともに、一貫した長期的生成を可能にする。これらの結果は、永続的でプログラム可能な世界を構築するために、明示的な状態進化を生成的レンダリングから分離することの有効性を示している。
ウェアラブルセンシングの最近の進歩により、生理学的および行動的シグナルの継続的モニタリングが可能になったが、既存のベンチマークは、AIシステムが実ユーザーの縦断的ウェアラブル記録に対して推論できるかどうかをほとんど評価していない。我々はWearableQAを導入する。これは、200名の実ユーザーのウェアラブル時系列、血液バイオマーカー、人口統計情報から構築された4,084問の10択多肢選択問題からなるベンチマークであり、各ユーザーは最大500日分の日次測定値を有する。WearableQAは、デバイスノイズや個人間変動を含む、実際のウェアラブルデータの分布を保持している。異なる推論能力を評価するため、我々は2つの相補的な軸に沿って整理された16種類の問題タイプを導入する。すなわち、データ推論対健康推論であり、これは縦断的測定値に対する計算と生理学的解釈を区別する。また、単一信号推論対クロスシグナル推論であり、これは個々の信号に関する推論と複数信号の統合を分離する。大規模に信頼できる問題を構築するために、我々は文献に基づく生理学的知見と、統計的に検証された母集団に基づく生理学的パターンを組み合わせるデュアルグラウンディング・フレームワークを採用する。これにより、実世界のウェアラブルデータで観察される意味のある関係を捉えることが可能になる。14個のプロプライエタリおよびオープンソースLLMの評価は、WearableQAがモデル能力を効果的に識別し、その性能が10%のチャンスレベルベースラインに対して19.6%から72.9%の範囲に及ぶことを示す。さらに、WearableQAは依然として解決にはほど遠い。ほとんどのモデルは60%未満の正解率を達成している。全体として、WearableQAは、実世界のウェアラブルデータに対するLLM推論を評価するための現実的で診断的なベンチマークを提供する。
SWE-Bench Proは、困難なリポジトリレベルのタスクにおいてソフトウェアエンジニアリングエージェントを評価するための標準的ベンチマークとして登場している。しかし、我々の分析により、その評価は、正解ソリューションまたは隠された評価情報の漏洩によって可能となる報酬ハッキングと、誤解を招く問題文やスコープが不適切なテストを含むタスク品質の問題という、2つの信頼性を損なう要因によって損なわれていることが示された。これらの問題は、ベンチマーク性能を不当に高め、エージェントの真のコーディング能力を覆い隠す可能性がある。我々は、両方の問題に対処するSWE-Bench Proの検証済み版であるSWE-Bench Pro Verifiedを提案する。本アプローチは、通常のエージェント機能を損なうことなく主要な漏洩経路を排除するアンチハッキング対策と、欠陥のあるインスタンス内の不整合を最小限に修正するタスク改良を組み合わせる。SWE-Bench Pro Verifiedでの評価により、一部のモデルは以前に報告されたよりも大幅に性能が低いことが明らかになり、SWE-Bench Proにおける既存の結果が実際のソフトウェアエンジニアリング能力を過大評価している可能性が示唆される。SWE-Bench Pro Verifiedは、ソフトウェアエンジニアリングエージェントを評価するための、より信頼できるベンチマークを提供する。
時間的に一貫し、発話と意味的に整合し、周囲の物体に接地した共発話ジェスチャーの生成は依然として困難である。従来の音声駆動型ジェスチャーモデルは音声とジェスチャーの整合性を重視するが、姿勢制約や周囲物体を明示的に考慮しておらず、身体ジェスチャーと物理空間の本質的な相関を捉えられていない。本稿では、因果潜在空間で動作する、姿勢を考慮し物体に接地した共発話ジェスチャー拡散モデルPuppeteerを提案する。我々は長いジェスチャーを構造化プリミティブに分解し、それらを時間順に並んだ潜在トークンへ符号化する因果変分オートエンコーダを学習する。各潜在トークンは過去のみに依存する。次に、因果潜在空間において直接条件付き拡散を実行し、音声信号、運動履歴、初期姿勢参照、物体ジオメトリを条件として、物理的に整合したジェスチャーを合成する。この時間順潜在表現により、明示的な時間制御が可能になり、ジェスチャー補間やジェスチャー補完などのタスクを支援する。既存の評価尺度を超えて共発話ジェスチャー合成をより適切に評価するため、本タスクに特化した新しい評価指標を導入する。また、物体接地型ジェスチャー生成を可能にする、身体化された共発話ジェスチャーと対応する3D物体からなる最初のキュレーション済み合成3DデータセットSceneGesを作成した。実験により、Puppeteerは従来手法よりも多様で時間的に同期したジェスチャーを生成し、かつ物体接地型ジェスチャー合成を可能にすることが示された。
再帰的自己改善(RSI)の研究は主にモデル訓練パイプラインを自動化してきたが、信頼できる自律的開発には欠けている柱がある。それは、モデルが何を学習するかを理解し、安全なアラインメントを確保するための事後モニタリングと監査である。このギャップを埋めるにはメカニスティック解釈可能性ツールが不可欠であり、中でもスパースオートエンコーダ(SAE)は、モデルの検査とステアリングのために解釈可能な特徴を分離する基盤として機能する。本論文では、AIエージェントがSAEツールを活用し、自律的なメカニズム発見を行う科学者として振る舞えるかを評価するSAEScientist-Benchを導入する。対象概念が与えられると、エージェントは対照的プローブを設計し、Gemma-2-9B-IT内の131K以上の特徴からなるGemma Scope辞書を探索して最適な特徴を発見する。これは、Neuronpediaに基づいて整備された専門家参照特徴に対し、活性化ランク、対照テキスト上の概念選択性、因果的ステアリングにわたって評価される。10のエージェント構成と20のタスクにわたり、フロンティアエージェントは真の発見能力を示し、異なる評価次元で優位に立つものの、専門家ベースラインには大きく及ばない。対象概念を対照コントロールから分離する点では専門家水準に近づくが、因果的生成ステアリングでは大幅に遅れをとる。さらなる分析により、エージェントは偽の候補を排除するための対照を設計できるものの、実験的測定を頻繁に誤解釈することが明らかになる。これらの結果は、実験的モデル理解が閉ループ型の自律的AI研究開発にとって測定可能な能力であることを確立する。コードはhttps://github.com/Trae1ounG/SAEScientistで公開されている。
AI研究エージェントは、事前知識、公開情報源、実験的フィードバックを組み合わせて有用な結果を生み出す。発見認証プロトコル(DCP)は、これらの結果に関する主張を、実行可能な回復テストおよびフィードバックテストへと変換する。ゲート1は、封印された評価における有用な改善を検証する。ゲート2は、マッチングされたエージェントに登録済みの開始情報と観測されたWebコンテンツを与える一方で、対象研究履歴を伏せる。数値目標に到達した各有効手法は回復証人を提供し、Coreの拒否権を発動する。DCP Coreは、適切な対照、観測された回復がゼロであること、および新たに登録された1つのエピソードにおける回復についての有限標本上界を要求する。任意選択のゲート3は、共有チェックポイントから、指定された中立方策を基準とした真実のフィードバックの平均効果を測定する。DCP Evidenceは、独立した帰無校正と登録済みの効果マージンの後に、この効果を加える。2件の対照付き監査が、異なるモデル下でのSQLite最適化と仮想触媒制御において完全なプロトコルを試す。それぞれが96エピソードで0件の回復を生じ、上界は0.0468であった。各ペア研究は30件の真実の回復と0件の中立回復をもたらし、合格した60ペアの帰無研究を伴った。追加の事例は、Core、回復済み、および監査不完全の判断を試す。決定論的でLLMを用いない検証器が、凍結された証拠から判断を再現する。DCPは、AI研究全体にわたる有用な成果、代替経路、およびフィードバック効果のための共通の証拠言語を提供する。
世界モデルは、ポリシー・イン・ザ・ループの想像環境としてますます用いられており、そこでは信頼性の高いロールアウトには低レベルロボット行動に対するきめ細かな制御性が必要となる。ロボティクスにおいてこのようなモデルをスケールさせる上での主要な障害は、行動がピクセル空間における普遍的な言語ではないことにある。すなわち、視覚環境、カメラ視点、ロボット配置、身体性の変化は、同じ数値行動が視覚的にどのように現れるかを変え、混合訓練下での矛盾する教師信号と、配備時の脆い汎化をもたらす。我々は SyncWorld を導入する。これは、追加訓練なしに未見環境をまたいでゼロショットシミュレータとして機能する行動条件付き世界モデルである。SyncWorld は、視覚キャリブレーション・エピソード——制御可能なすべての自由度を示す、対になったフレームと行動——を活用して、セットアップ固有の行動–視覚マッピングを文脈内で指定する。視覚キャリブレーション文脈を用いた訓練は、モデルに、行動を視覚的証拠を通じて解釈すること、および明示的なキャリブレーションが利用できない場合には相互作用履歴を活用することを教える。実験は、SyncWorld が以前に未見の設定で行動結果を正確にシミュレートできること、およびそのロールアウトをシミュレートする能力が訓練なしのテスト時ポリシー改善を可能にすることを示している。
高品質な構造化有機反応データは、化学のための人工知能(AI4Chem)を開発するうえで不可欠であるが、その知識の多くは依然として特許テキスト、画像、反応スキームに分散している。我々は、特許テキスト、画像、反応スキームを統合した完全自動の抽出・正規化パイプラインによって構築された、大規模で細粒度な有機反応データプラットフォームであるDianShi-RxnDBを提示する。そのコーパスは、1976年から2025年の間に公開されたUSPTOおよびEPOの有機合成特許を対象とし、約2,400万件の反応インスタンスを生成しており、そのうち約1,480万件(61.7%)が自動適格性チェックに合格している。各インスタンスは、特定の単段階実験を表し、関与物質、役割、量、温度、反応時間、収率、実験手順、および元特許への来歴リンクを記録している。適格とされたインスタンスからサンプリングした1,300件の手動評価では、マイクロ平均のフィールドレベル精度は92.95%であった。Pistachioとのマッチング比較ではさらに、重複排除後のレコード件数、表現の粒度、およびフィールドレベルの完全一致において優位性が示された。本プラットフォームは、レコードの検索、絞り込み、比較、出典確認のためのWeb研究ワークベンチと、AIエージェントに組み合わせ可能な構造化検索ツールを提供するModel Context Protocol(MCP)サービスを提供する。DianShi-RxnDBは https://dianshi.opendatalab.org.cn/ で利用可能である。
大規模言語モデル(LLM)は推論とコード生成において顕著な能力を示しており、自らを駆動する基盤そのものの開発と最適化を支援できる可能性が高まっている。しかし、既存のベンチマークは主に個別のカーネル、事前定義された演算子、あるいは事前指定された最適化対象に焦点を当てており、したがって、オープンエンドかつ長期にわたるLLMインフラストラクチャのエンジニアリングをLLMが遂行する能力を評価できていない。このギャップに対処するため、本稿では、LLMインフラストラクチャスタックのエンジニアリングに関してLLMを体系的に評価するためのベンチマークであるΦ-Benchを提示する。最先端研究で検討されている最適化問題に由来し、実世界のコードリポジトリに基づくΦ-Benchは、LLMインフラストラクチャスタックを広くカバーし、局所的なカーネルレベルの関数補完から長期にわたる実装およびエンドツーエンドのシステム最適化まで、複雑さの異なるタスクにまたがる。最先端LLMに対する広範な実験は、複雑なLLMインフラストラクチャのエンジニアリングにおける現在の能力と限界を明らかにし、将来のAIインフラストラクチャの自律的最適化へ向かう道筋に残る課題への洞察を与える。
大規模言語モデル(LLM)は、推論能力を向上させるために、あらかじめ収集された推論軌跡でポストトレーニングされることが多い。そのような軌跡は、複雑で絡み合った経路のために長くなる傾向があり、しばしば解答に至る経路における回り道を含む。しかしながら、教師あり微調整(SFT)のようなポストトレーニングにおいて、LLMが完全な軌跡を学習することから実際に利益を得るかどうかは十分に検討されていない。我々の予備研究を出発点として、完全な軌跡は限られた利益しかもたらさない一方で、部分的な軌跡は大幅な切り詰めの下でも有効であることを見いだした。我々は、注意機構に基づく分析と統制されたトークン除去研究を通じて、推論軌跡における冗長性を分析し、どちらも中間トークンが最終的な推論品質にほとんど寄与しないことを示す。これは、冗長な情報を避けることで、既知の軌跡端点が与えられたもとで、LLMが自身の内部知識から欠落したステップを推論することにより、内部で整合的な代替案を推論できるようになる可能性を示唆する。さらに、端点を用いてLLMを訓練することが推論行動に一貫した変化をもたらし、強化学習やオンポリシー蒸留に基づくポストトレーニング手法にも有効であることを示し、完全な推論トレースを再検討する必要性を浮き彫りにする。コードは https://github.com/naver-ai/revisiting-trace で公開されている。
学習戦略、すなわちゼロから再学習するか前回のチェックポイントからファインチューニングするかは、能動学習において見過ごされてきた決定変数である。我々は、この選択に活用可能な構造があることを示す。再学習は、各バッチがラベル付きデータの分布を大きく変え得る初期ラウンドで最も有用であり、モデルの軌跡が安定化するとファインチューニングの方が安全になる。我々はHybridALを提案する。これは、オンライン安定化信号を監視し、安定化が持続した後に再学習からファインチューニングへ切り替える適応的学習スケジュールである。二つの相補的信号であるスペクトル指数変化Δα(重みに基づく)と精度変化ΔAcc(検証に基づく)は、時間とキャリブレーションのトレードオフ上の異なる点に位置する。3種類のエンコーダバックボーンと6つのテキスト分類タスク(各5シード)において、HybridALは、最終時点のマクロF1について、再学習およびファインチューニングに対する非劣性を0.010のマージンで保ち、再学習時間を最大49%節約し、負の対数尤度(NLL)で測定される再学習のキャリブレーション優位性の相当な部分を回復する。事前に定めたラウンドで切り替えるスケジュールと比較して、HybridALは中程度の追加コストでより低いNLLを得ており、軌道依存の切り替えが固定された早期切り替えよりも強い時間とキャリブレーションのトレードオフをもたらすことを示している。
広告動画生成は、動画合成タスクであるだけでなく、成功がオンラインビジネス指標によって測られる商品条件付き推論問題でもある。近年の動画基盤モデルは、マルチモーダル条件からリアルなクリップを生成できるが、商品を効果的な広告へと変換すべき方法や、オンラインビジネスフィードバックから将来の生成を改善すべき方法を最適化しているわけではない。このループを閉じるために、我々はAgenticGenを提案する。これは、広告動画生成を、訓練可能な2つの推論段階である戦略選択とドラフト生成に分解する報酬誘導型エージェントフレームワークであり、それにより、オンラインビジネスフィードバックが監督可能な最適化目標を顕在化させる。AgenticGenは、蓄積されたオンラインフィードバックから性能ベースの報酬を、また人間の品質基準に整合する補完的なルーブリックベースの報酬を学習し、それらを用いて方策最適化を監督する。DPOはまずエージェント方策をオンライン選好へ近づけ、GRPOはプロセス報酬と結果報酬によって両段階をさらに精緻化する。オフライン実験により、報酬モデルと逐次的な方策最適化が検証される。TikTok広告システムにおけるオンラインA/B実験では、DPOおよびGRPO適用後のAgenticGenが、SFTベースラインと比較してCTRを2.72%、CVRを2.63%、Advvを9.61%改善することが示されている。
我々はLLMエージェントにおける画策を研究する。そこではエージェントが不整合な目標を秘かに追求する。我々の焦点は、画策が、道具的目標、環境的アフォーダンス、監督条件、認識される帰結といった主要因子の相互作用からどのように生じるのかを理解することにある。先行研究は少数のシナリオのみを検討しており、これらの条件がエージェントの画策傾向や画策能力をどのように形成するかを切り分ける能力を制限している。この限られた規模とタスク多様性は、現実的な展開設定の網羅性と、観察可能な画策戦略の範囲も制限する。この目的のため、我々はSCHEMEARENAを導入する。これは、スケーラブルな画策ストレステストのための400シナリオベンチマークであり、安全に関連する多様なツール領域、道具的目標、監督条件、圧力メカニズムにまたがる因子分解型シナリオ合成フレームワークを通じて構築されている。スケーラブルかつ信頼性の高い監視を可能にするため、我々はさらにSCOUTを提案する。これは、エージェントの推論と行動から引き出された証拠に基づいて多基準判断を行う画策モニターである。5つのLLMエージェントに対する統制されたストレステスト全体で、明示的な道具的目標が画策傾向の最も強い駆動要因であることを見いだす。戦略的ヒントは、エージェントが画策推論を具体的な隠密行動へと変換するのを助けることで、独自の役割を果たす。監督には混合効果がある。いくつかのクローズドモデルでは、行動のみの監視が画策を増加させ、部分的な監督が抑止要因ではなく最適化制約として作用しうることを示唆する。CoTは有用だが不完全な監視シグナルである。実行前に潜在的な画策を明らかにできるが、行動のみの画策は、明示的な推論証拠なしに隠密行動が生じうることを示す。我々はベンチマーク、コード、モニターを以下で公開する:https://github.com/launchnlp/SchemeArena。
大規模言語モデルによる形式定理証明の主要なベンチマークは、IMOやPutnamなどの競技数学から取られた小規模なコレクションであり、分野固有の応用を十分に代表していない。我々はStochBenchを導入する。これは、抽象度の異なる450題の大学院レベルの確率過程問題からなるLean 4ベンチマークであり、各問題は自然言語による原典と対になっている。Mathlibで手薄な分野に対応し、有限および可算マルコフ連鎖、再生過程、ランダムウォーク、マルチンゲール、停止時刻、待ち行列、ブラウン運動、確率解析、弱収束、ポアソン過程および連続時間マルコフ過程を扱う。Opus 4.8ベースの我々のエージェントは、1問あたり15分の制限時間の下で34.9%の証明成功率(157/450)を達成した。StochBenchは、高度な定理証明器にとって依然として難しいまま、分野固有の応用数学をよりよく代表している。
ChatGPT検索、GoogleのAI Overviews、PerplexityなどのAI搭載検索製品は、ライブのWeb検索結果に基づいてLLMが合成した回答を提供する。我々は、自動化されたブラウザエージェントとプロバイダルーティングされたLLM推論を用いるオープンソースの回答エンジンであるOreoLook(旧lixSearch)を開発した。そのローカル検索、キャッシュ、セッション管理、および埋め込みスタックは汎用CPUハードウェア上で動作し、回答合成はリモート推論プロバイダによって実行される。利用が増えるにつれ、セッションは文脈を失い、同等のクエリは冗長な処理を引き起こし、URLはセッションをまたいで繰り返し埋め込まれた。 我々は3層キャッシュアーキテクチャを提示する。(1) Redis内で最近のメッセージのローリングウィンドウを維持し、自動的にハフマン圧縮ディスクアーカイブへオーバーフローするセッションコンテキストウィンドウ、(2) 埋め込みベクトルのコサイン類似度によって言い換えを捕捉し、冗長なLLM呼び出しを排除するセマンティッククエリキャッシュ、(3) セッションをまたいで埋め込み計算を重複排除するURL埋め込みキャッシュである。3つのコンテナ化レプリカにわたって30個のHypercornワーカープロセスを実行する単一の8 vCPU Intel Cascade Lakeサーバ(2 GHz、32 GB RAM)上にデプロイされた評価対象システムは、集計で89.3%のRedisキースペースヒット率、0.1 msの読み取りレイテンシ、わずか1.38 MBのメモリオーバーヘッドを報告した。バックグラウンドのLRU退避デーモンは、アイドル状態のセッションをRedisからディスクへ移行し、必要に応じて再ハイドレートする。これにより、設定された保持ポリシーの下で、会話を数時間後または数日後に再開できる。
再帰的超解像(SR)は、予測を同一モデルへ繰り返しフィードバックすることにより、固定スケールSRを極端な拡大へと拡張する。これは画像を繰り返しズームする操作に類似している。しかし、各スケール、特に深いスケールにおける正解データの可用性は、必要なソース解像度が幾何級数的に増大するため依然として困難であり、より深い予測は教師なしのままとなる。我々はOracleZoomを提案する。これはオンポリシー蒸留に着想を得た参照制約付きフレームワークであり、自身の軌跡上で学習しつつ、最後の正解データの証拠を監督境界の先へ持ち越す。直接的監督とクロススケール監督は検証可能な内容を制約し、ノーリファレンス品質目的関数は未解決のファインスケール詳細を導く。KL制約付きの事前学習済み潜在事前分布は品質駆動のドリフトを抑制し、EMA一貫性は監督境界を安定化する。7つのデータセットにわたり、OracleZoomはズームスケール全体で最先端のSR品質を達成し、CLIPIQA平均0.713を示すとともに、深いスケールほど大きな改善をもたらし、ハルシネーションを大幅に低減する。コード、データ、モデルは https://dipta007.github.io/OracleZoom/ で公開されている。
動画理解は、動画大規模言語モデル(VideoLLM)へと急速に発展してきた。VideoLLMとは、動画表現を事前学習済み大規模言語モデルと結合し、テキストプロンプトを条件として生成を行うシステムである。キャプション生成、質問応答、検索、時間的グラウンディングにおける高い性能は、フレーム数とコンテキスト長に応じて増大する計算コストとメモリコストを伴い、リアルタイム、モバイル、リソース制約環境での展開を制限している。本サーベイでは、パラメータ数、入力あたりFLOPs、レイテンシ、メモリ、あるいは視覚・音声トークン数における具体的な削減を報告する、視覚および視聴覚VideoLLMの推論効率化機構を扱う。フレームサンプリング、モダリティ符号化、コネクタレベルでのトークン削減、LLMのプリフィリングとデコーディングにわたるボトルネックを分析する。手法を、それらが作用するパイプライン段階ごとに整理し、2022年後半以降に開発されたVideoLLMを、現在のパイプラインの構成要素であり続ける初期のフレームサンプリングおよび視覚エンコーダ機構とともに扱う。利用可能な場合は共通のホストモデルと入力プロトコルの下で文献で報告されている精度–コスト比較を収集し、それらを論文横断的な異種エビデンスと区別し、視聴覚効率と標準化された評価におけるギャップを特定する。リポジトリを https://github.com/momentslab/awesome-efficient-videollm で維持している。
エージェントハーネス(モデルを囲むシステムプロンプト、ツールセット、実行フック、コンテキスト管理のスキャフォールディング)は、エージェントタスク成功の決定的な規定要因である。自動化されたハーネス進化により、小規模モデルがドメイン固有タスクで良好な性能を発揮し、フロンティアモデルを用いる場合のコストの何分の一かで済むようになる。ハーネスとモデル重みの両方が振る舞いを形作るため、我々はハーネス進化と軽量ファインチューニングをどのように組み合わせるべきかを問う。7つのエンタープライズエージェントタスクを通じて、我々はまず弱いモデルを用いてハーネスを進化させ、次により強いエキスパートがしばしばそれをより効果的に使用することを見いだす。これは、エキスパートによる監督が残りのギャップを埋めうることを示唆する。しかしながら、進化したハーネスの下でエキスパートの完全な軌跡を用いて弱いモデルを訓練すると裏目に出る。Qwen3-CoderとGemma 4の両方で、7タスクすべてにおいて性能が4〜30ポイント後退する。同じ手続きが進化前のハーネスの下では役立つにもかかわらず、である。我々の分析は、模倣が知識を転移しスキャフォールドの使用を増やす一方で、モデルとハーネスの適合を損なうことを示す。弱いモデルは、それを実行する能力を欠いたままエキスパートの計画戦略を採用し、自身の本来の計画スタイルに合わせて進化したハーネスともはや適合しなくなる。したがって我々は、メタレベルMLEエージェントによって自動化されたオンポリシー・エキスパート補正パイプラインを開発する。これは、弱いモデル自身のロールアウトにおいて失敗したターンを特定し、エキスパートにそのターンのみを書き直すよう求める。これはモデルの計画スタイルを保ち、ハーネス進化とモデル適応の利得を組み合わせる。我々の結果は、ハーネス更新と重み更新の間の競合源を特定して解決し、ドメイン固有のエンタープライズタスクにおける経済的な共進化のための互換性を保つレシピをもたらす。
逐次記憶エージェントは、長文書をチャンクごとに次々と読みながらコンパクトなメモリ状態を維持して処理し、文書走査と推論の深さを結合する。この結合により、根拠の配置に対する感度が生じ、推論レイテンシが文書長に線形に結びつく。我々は、読解と推論を分離するPARSERを導入する。各々が単一のチャンクに割り当てられた軽量サブエージェント群が文書全体を並列に読み、一方でリードエージェントが反復的なscatter-gatherラウンドを通じて深く推論する。各ラウンドで、リードエージェントはクエリを全サブエージェントにブロードキャストし、返された根拠を集約し、これまでに見つかった内容に条件づけられたより深い追加クエリを形成する。この分離設計は、学習可能な振る舞いをすべてリードエージェントに集中させ、リードエージェントは強化学習で最適化される一方、サブエージェントは凍結された既製モデルのままである。7Kから896Kトークンに及ぶコンテキストを用いたマルチホップQAにおいて、4Bバックボーンを用いたPARSERは、最強の逐次記憶ベースラインを平均で5.7ポイント、896Kトークンでは12.0ポイント上回る。9Bバックボーンにスケールすると、PARSERはDeepSeek-V4-Proを6.3ポイント上回る。制御実験により、PARSERが根拠の位置、順序、距離の摂動に対して頑健であることが確認される。これらの条件は逐次手法では精度に大きな変動を引き起こすが、PARSERは推論レイテンシを最大11倍削減する。
コード編集に用いられる大規模言語モデルは、少なくとも2つの出力方式で学習およびデプロイできる。すなわち、モデルが変更後のファイル全体を一度に出力する直接生成と、モデルが局所的な検索/置換編集を一つずつ適用される系列として出力し、完了を通知するかステップ予算を使い果たすまで続ける反復的な差分ベース生成(「ステップ」)である。差分ベース方式は、開発者がコードを編集する方法を反映しており、1ターンあたりに生成する必要のあるトークン数がはるかに少なくて済むはずであるため、魅力的である。我々は2つのコードモデル——ゼロから学習した1億パラメータモデル(Rainbow-Pony-100M)とファインチューニングしたQwen2.5-Coder-0.5B——を、共通のFlutter/Dartデータセット上で両方式により学習し、得られた4モデルすべてを、モデルあたり約1,790タスクのホールドアウトセットで評価する。直接生成は、我々が測定するすべての指標——コンパイル/静的解析の合格率、バイトあたりビット数、参照との文字レベルの類似度、および目標達成度・正しさ・コード品質に関する盲検化されたLLMジャッジ評価——において、差分ベース生成を大幅に上回り、その差は、マッチしたIDによる比較を通じてタスク難易度を統制した後も、また両側でコンパイルが通るコードに限定した場合にも持続する。次に、我々は、差分ベース生成が実際に勝つ条件の背後にある、単一のアーキテクチャ非依存的なメカニズムを特定する。それは、短く空間的に局所化された編集では競争力があり、カテゴリレベルの勝利は、我々のデータセットで平均編集ステップ数が最も少ないまさに2つのタスクカテゴリ——リファクタリングとエラー処理/エッジケース修正——に集中している。我々はこれをタスク局所性と呼び、編集ベースの学習方式がコード編集モデルにとって適切な選択となる場合とそうでない場合についての含意を議論する。
既存の感情的支援対話システムは、主に支援希求者と支援者の一対一の相互作用および個人の感情状態に焦点を当てており、多者間場面における対人関係は十分に検討されていない。本研究では、関係性を考慮した感情的支援対話を導入する。これは、LLMが関係性の進展するダイナミクスを捉えて活用し、より効果的な感情的支援を提供できるかを評価する新しいタスクである。我々は、実際のカップルおよび家族のインタビュー会話からRESCUE(Relation-aware Emotional Support Conversation Understanding and Evaluation Benchmark)を構築した。これは191サンプル、7,079個のアノテーション付きターン、1,064.8分の動画を含む。社会情緒的および支援関連のダイナミクスに関する豊富なアノテーションに基づき、RESCUEは、関係性を考慮した感情的支援に必要な2つの中核能力、すなわち関係性理解と関係性に敏感な支援を評価する6つのタスクを定義している。10種類のLLMを用いた実験は、現在のモデルが局所的な感情的手がかりまたは介入手がかりに依存するタスクでは比較的良好に性能を発揮する一方、関係パターン予測、視点予測、支援方略予測など関係性が強く関与するタスクでは苦戦することを示している。これらの知見は、現在のLLMが対人関係をモデル化し、関係性に敏感な支援判断を下す上での限界を明らかにする。
非侵襲的発話デコーディングは、神経記録の低い信号対雑音比によって依然として制約を受けており、そのため音素や個々の単語の細粒度な再構成が困難である。高次意味表現が皮質領域に分散し、より遅い時間スケールで変化するという神経科学的証拠に動機づけられ、我々は、意味内容が低次の音響特徴や語彙特徴よりも非侵襲的デコーディングにとって適した標的となりうるという仮説を立てる。我々はBrain2Semantics2Textを導入する。これは中間意味埋め込み空間を通じてテキストを再構成する手法である。我々のモデルは文レベルのMEG応答を意味多様体に写像し、その後、予測された埋め込みを自然言語へと逆変換する。この意味ボトルネックにより、単語レベルのアラインメントなしに高次意味を復元することが可能になる。我々は、本アプローチの中核原理、その実装、および信頼できる神経-意味マッピングの学習における課題を緩和するために用いた戦略について述べる。最後に、従来の非侵襲的Brain2Text手法と比較し、文レベルの結果が改善することを示す。
検証可能な報酬を用いた強化学習(RLVR)は、近年の大規模推論モデルの成功の中核をなしてきた。しかし、RLVRは単一サンプル精度を大幅に向上させる一方で、訓練中の探索が限られているため、モデルが本来持つ推論カバレッジ(pass@k)を拡大できないことが多い。これに対処するため、我々はpass@kを高めるべく、訓練時ロールアウトの構造設計を最適化する。我々の分析は三つの重要な設計原則を明らかにする:(1) 難易度適応型ロールアウトは、効率化のヒューリスティックとしての役割にとどまらず、pass@kの拡大に重要な役割を果たしうる;(2) 木構造ベースのロールアウトは、正解の発見において並列サンプリングを上回る;(3) 文エントロピー誘導型分岐は、トークンレベル分岐の局所化現象を克服し、意味的多様性を最大化する。これらの知見に基づき、我々はDATPO(Difficulty-Adaptive Sentence-entropy-guided Tree-structured Policy Optimization)を提案する。DATPOは、難易度適応型木探索を兄弟間多様性アドバンテージ項と統合し、訓練中に意味的多様性を明示的に促進して推論カバレッジを拡大する。数学的推論ベンチマークにおける実験は、DATPOが特にpass@kにおいてベースラインを上回ることを示しており、これは優れたテスト時スケーリング性能に直結する。
訓練データ帰属(TDA)は、モデルの振る舞いを形成する訓練事例を特定することを目的とするが、その介入価値は、どの事例が選択されるかと、それらがどのように修正されるかの両方に依存する。影響関数(IF)は、微小な重み付け変更の下での行動変化を推定するが、IFによって選択された事例は、従来の重みベースの介入の下では、ランダム選択に対する限られた優位性しか示さないことが多い。このことは、影響力のある事例が介入価値を欠いているのか、あるいは重み付け変更がそれらの行動的レバレッジを実現できていないのかという疑問を提起する。我々は、影響誘導応答書き換えを導入する。これは、IFを用いて介入対象を特定し、指示を固定したまま、それらの応答を行動整合的または行動対立的な教師信号に置き換える。4つのオープンウェイトLLMにわたり、我々は、認識論的棄権を主要なテストベッドとして用いて、同じ影響選択された事例に対して書き換えと重み付け変更を比較する。応答書き換えは、より強力で、より持続的で、双方向の行動変化を生み出すが、同じ事例の重み付け変更は弱く一貫性のない効果しかもたらさない。さらなる分析は、影響選択された事例が、代替の選択手法よりも大きな書き換えレバレッジを提供し、変化がターゲット関連行動に集中したままであることを示す。同じ定性的な対比は、安全拒否にも拡張される。これらの結果は、影響推定によって捉えられた局所的な重み付け変更効果と、それらが特定する事例のより広範な介入レバレッジとを区別し、TDA手法の介入を考慮した評価を動機付ける。
自動運転の安全性を確保することは重要な課題である。シナリオベーステストは、自動運転システム(ADS)を検証するために用いられる体系的なプロセスであるが、依然として、シナリオ生成、検索、修正、ADS実行、結果分析が相互連携の乏しい個別ツールによって行われる、分断されたモジュラー型パイプラインにとどまっている。大規模言語モデル(LLM)エージェントは、知覚、計画、制御などのADSサブシステムにおいて有望性を示している。しかし、統一されたLLMエージェントフレームワークによってADSのシナリオベーステストパイプライン全体を扱った先行研究はない。我々は、シナリオベーステストの全段階(シナリオ生成からADS評価まで)を拡張し、さらに2つのLLM強化段階、すなわちADS強化とADSベンチマーキングを追加するLLMエージェントフレームワークであるPlannerForgeを提示する。我々は、10種類の既製LLMを用いて、5つのプロンプト条件下で、すべてのタスク(生成、選択、修正、モジュールルーティング、プランナーテスト、強化)にわたってPlannerForgeを評価する。タスクごとの最高スコアは0.88から1.00の範囲であり、オープンソースの20~35Bバックエンドはほとんどのタスクで商用APIに匹敵する。Qwen3.6:35Bのようなオープンソースモデルは、5タスク中3タスクで商用APIに匹敵する。モジュールをエンドツーエンドで連結すると、シードクエリの83%/78%(商用/オープン)を保持する。PlannerForgeは自然言語生成においてScenario Factory 2.0(Finkeldei et al., 2025)を上回り(200件中193件対144件が実行可能)、要求された都市、道路、車両属性の92~96%を実現する。ランク1選択においてBM25(Robertson and Zaragoza, 2009)を上回り(92.0% 対 67.5%)、物理的に有効な編集においてFrom-Words-to-Collisions(Gao et al., 2025)を上回る(94%以上 対 31%)。N=400において、コストチューニングはドメイン固有のファインチューニングなしで、プランナー成功率を50.4%から70.2%へ引き上げ、衝突を19.0%から8.4%へ削減する。
我々は、近年のテキスト-to-ビデオモデルおよび画像-to-ビデオモデルによって生成された完全に合成されたクリップを含むAI生成動画を検出するための新しいベンチマークDF26を導入する。この動画群は、カメラ目線の録画、公式声明、スタジオインタビューに及ぶ単一人物の公開スピーチ場面を捉えており、7つの現代的な動画モデルによって生成された2,420本の合成動画と271本の実動画からなる。DF26に関する研究は、AI生成動画の検出における人間の性能、および最先端のディープフェイク検出器の性能が、ランダム推測に近いことを示している。我々の結果は、現在の評価プロトコルの限界を浮き彫りにし、現代の生成モデルにおける分布シフトに対する頑健性を明示的に測定するベンチマークの必要性を示唆する。
我々は、雑音付き線形測定からスパース二値信号のサポート回復を行う問題を考える。スパースなガウス測定行列に対して、高SNR領域 \(ds/p\to\infty\) における最尤復元のための最小標本サイズに関する十分条件を同定する。ここで \(p\) は信号次元、\(s\) は信号の非零成分数、\(d\) は測定行列の各行あたりの非零成分の期待数を表す。既知の下界と組み合わせると、これはオーダー \(s\log(p/s)/\log(ds/p)\) の情報理論的しきい値をもたらし、測定のスパース性の代償を明示する。特に、測定のスパース性による標本複雑度の損失が対数的である一方、計算上の利得がほぼ線形である領域を強調する。 次に、もともと密なガウスデザインをスパース化した後の復元を研究する。観測は密なデザインから生成される一方、推定には独立にスパース化されたデザインと再スケーリングされた応答を用いる。比例領域 \(s=\alpha p\), \(d=\psi p\) において、任意の固定された目標誤り水準 \(\delta\) と任意の余裕 \(\varepsilon>0\) に対して、オーダー \(p/\psi^2\) の標本サイズが、任意に小さい \(\psi\) に対してもサポート回復に十分であることを証明する。
既存のバイアス監査手法は通常、モデル出力に依存しており、高コストなベンチマークや判定モデルを必要とし、生成テキストには現れない内部変化を見逃す可能性がある。我々は、関連するモデル変種間、例えば微調整前後で、隠れ状態表現のバイアスを監査する参照ベース手法を提案する。微調整は表現幾何を変形するため、絶対的な隠れ状態は直接比較できない。そこで、各文を固定されたアンカー文集合との類似度によって符号化し、共有比較空間における相対表現を得る。そこで、対象グループが肯定的属性および否定的属性との関連をどのように変化させるかを測定する。この量を表現バイアスシフト ΔB と呼ぶ。3つのモデルファミリーと WildGuardMix、DecodingTrust、ToxiGen ベンチマークにおいて、ΔB は我々が検証した18設定中15設定で出力レベルのバイアス変化と相関し、完全微調整では |r| = 0.84 (p < 0.001) に達し、パラメータ効率適応ではよりモデル依存的になる。ΔB の閾値処理により、バイアスが増加したチェックポイントを ROC AUC 0.65~0.99 で検出でき、WildGuardMix と DecodingTrust では、3ファミリーすべてについて SEAT ベースのベースラインよりもよく分離する。ΔB はまた、アンカー集合、属性集合、対象テンプレートの変更に対して安定である。我々の手法はタスク固有の評価データを必要とせず、約3分でモデルを監査し、ここで検討した出力レベルベンチマークより3~50倍少ない計算量で済む。我々はこれを、出力ベース監査の代替ではなく、補完的なものと見なす。