翻訳付きの日次キュレーションされたAI研究論文
マルチエージェントLLMシステムでは一般に、オーケストレータがタスクを分解してワーカーのチームへ割り当て、その後テキストによる省察を通じて改善を行う。強い経験的成果にもかかわらず、こうしたシステムには、協調、記憶改善、外部検証の役割に関する統一的説明が欠けている。我々は、オーケストレータとワーカーの相互作用を二層調整ゲーム(バイレベル調整ゲーム)としてモデル化する。有界な結合の下では、ワーカーの局所更新ゲームは近似ポテンシャルゲームとなり、その均衡スラックは分解品質によって制御される。次に、省察を意味記憶状態上の確率的移動として解析する。自由形式の省察に対しては、有限時間上界を導出し、最悪ケースでその上界がタイトであることを証明するとともに、反証可能な持続的害悪条件の下で正の下界を与える。さらに、情報理論的な不可能性の結果を証明する。生成されたトランスクリプトのみを観測するゲートは、テキスト上で区別不能な環境全体にわたって一様に改善することはできないが、環境に接地されたゲートはそれが可能である。この分離に動機づけられ、我々は確率的省察記憶上昇法(Stochastic Reflective Memory Ascent, SRMA)を導入する。SRMAは、接地された評価リスクが厳密に減少した場合のみ候補記憶を受け入れる。キャリブレーションと非退化な修正質量の下では、SRMAは正確に収束し、その収束は幾何級数的または多項式的となる。整合する構成により、これら二つの収束率領域はいずれもオーダーの意味でタイトであることが示される。さらに、確率的評価のための信頼度ゲーティングと、区分的定常環境に対する再アンカリング保証も提供する。実験では、これらの概念を環境に基づく指標によって具体化し、予測された協調則とドリフト則を検証する。SWE-bench の500インスタンスにおいて、完全なKimiベースシステムは72.2%を解決し、公開されているmini-SWE-agentの参照実装の70.8%を上回った。コード:https://github.com/YihangChen9/Bilevel-Coordinated-Reflection
我々は、35B-A3Bおよび397B-A17Bスケールで学習した2つの検索エージェントIris-miniとIris-proを、その背後にあるデータパイプラインと学習レシピとともに提示する。タスクは、Webコーパスのハイパーリンク構造から逆構成される。すなわち、シードページとその外部リンクから抽出したエンティティグラフ上でマルチホップ連鎖を作成し、解答以外のすべてのエンティティを説明的な参照表現へ書き換えることで、いかなる手がかりも文字列マッチングでは解決できないようにする。さらに、参照モデルがクローズドブックでは解けないが、支持証拠が与えられれば解ける質問のみを採用する。これらの質問はその後、軌跡(トラジェクトリ)へ変換され、SFTの前に軌跡レベルとターンレベルの両方でフィルタリングされる。続いて方策は、ライブ検索に対するRLによって最適化される。この際、報酬判定器と観測要約器は学習クラスタ内で提供され、過度に長いロールアウトはリクエストレベルで中断され、次のステップでコミット済みプレフィックスから再開される。我々はこの2段階をSFT-RLクライミングと呼ぶ手順で交互に実施し、各RLラウンドで解けた中で最も困難で最も効率的なロールアウトを次の教師ありパスへ戻す。実行時コンテキスト管理は、これらのベンチマークにおいて報告されているシステム間の差異のほとんどよりも価値があるため、我々はすべてのベンチマークを、ツールセット、コンテキスト上限、判定器を固定した上で、コンテキスト管理の有無の両方で評価する。すべての結果は単一のReActエージェントから得られたものであり、サブエージェントやテスト時検証は用いていない。コンテキスト管理を有効にした場合、BrowseComp、BrowseComp-ZH、DeepSearchQA、HLEにおいて、2つのモデルは82.2/84.8/86.9/52.3および88.6/85.1/92.9/56.4を達成し、それぞれのパラメータ範囲のオープンソース検索エージェントの中で総合的に最強の結果である。我々は、データ構築・学習・評価の完全なレシピとともにモデル重みを公開する予定である。
対話を行うアバターは、何を話すかを決定すると同時に、話しながらどのように動くかを決定する必要がある。しかし、これらの能力は別々のモデル系統に存在している。すなわち、音声対話モデルは動作を伴わない音声を生成する一方、共音声動作モデル(co-speech motion model)は与えられた音声からのみ動作を生成する。標準的な対策はカスケード方式、つまり最初に音声応答を生成し、その完成した音声に対して動作モデルを実行する方法である。この方式では2回目の完全な推論パスが必要となり、両者間の共同最適化は不可能になる。 我々はMotion-Omniを提案する。これは、音声対話モデルが、音声を生成する隠れ状態から直接、明示的な表情を手・上半身・下半身の動作とともにネイティブに出力するエンドツーエンドのフレームワークである。ここで共同訓練は必須である。音声経路を凍結したままでは動作と音声のミスアライメントが解消されず、LLM・音声生成器・動作生成器を両方の目的関数の下で共適応させることによってのみ、音声対話能力を維持しながらアライメントを回復できる。 教師信号は、スケーラブルでモデルに依存しないパイプラインから得られる。このパイプラインは、一貫した話者音声による応答に対して、交換可能な動作教師モデルを用いて擬似ラベルを付与し、品質順にランク付けされた422,856ペア(1,402時間)を生成する。さらに我々は、SwDA-500と、我々の知る限り初となる、確率的かつオープンエンドな全身動作を伴う音声対話のための公開評価プロトコルもリリースする。本プロトコルは、動作生成システム間で同一音声をマッチングしつつ、レンダリング、自動評価指標、人間評価、遅延計測を統一的に扱う。 Qwen2.5-7B-Instructをバックボーンとして実装されたMotion-Omni-Q7は、参照フリーの動作指標において、同一音声を用いる教師カスケードと2%以内の差で一致しつつ、応答速度は5.4倍高速であり(RTF=0.78、実時間より高速)、ビート相関と多様性において非教師カスケードのすべてを上回り、比較対象となったオムニモーダルシステムの中で最低となる2.62%の語誤り率(WER)を達成する。
音声-映像拡散モデルは、テキスト、音声、視覚コンテンツを協調させるためにクロスモーダル・アテンションに依存しているが、この同じ機構が、微妙かつ系統的な意味的漏洩を引き起こし得る。本稿では、テキスト、音声、映像の各ストリームを結ぶ三つのクロスアテンション・エッジから成る「アテンショントライアングル」を探索・分析し、生成中に意味情報がモダリティ間でどのようにルーティングされるかを調べる。分析の結果、音声-映像エッジに沿ったルーティングは双方向的であり、音声が映像生成に影響を及ぼす一方で、映像も音声生成に影響を及ぼすことが示された。このエッジは、モデルのパラメータに符号化されたバイアスによって形成され、漏洩の主要な要因となる。プロンプトと学習済み事前分布が衝突する場合、クロスモーダルな相互作用が意図された条件付けを上書きし、意味のルーティング先を、視覚的に典型的ではあるが誤った結果へと向け直し得る。これらの効果は、意味的アーティファクトが、単にアテンションが意図された対象を超えて拡散することから生じるのではなく、特定の経路に沿った構造化されたバイアス駆動型の相互作用から生じることを示唆している。この観点に基づき、我々は、意味がモダリティ間でどのように分布し接地されているかを明らかにするアテンション由来の信号を抽出し、それらを診断ツールとして用いることで、制御条件下での漏洩の分析と意図的な発生の両方を行う。これにより、クロスモーダルなルーティングの内部ダイナミクスを探り、個々の相互作用の役割を切り分けることが可能になる。さらに、これらの信号を利用して、より一貫したクロスモーダル整合を促す推論時の介入を導く。広範な実験は、本分析を裏付けるとともに、生成品質を維持しつつ意味的接地が改善されることを示している。
我々は、数百個の物体を含む雑然としたシーンから、構成論的3D表現を生成する問題を研究する。目標は、ゲーム、AR/VR、シミュレーション、ロボティクスといった下流アプリケーションで要求されるように、シーンを共有ワールド座標系内に配置された個々の物体メッシュの集合として表現することである。このタスクは、物体同士が強く遮蔽し合い、各視点からはその形状の一部しか観測できない密集したシーンにおいて困難を伴う。幾何学ベースの手法は通常、シーンを単一の表現として再構成し、遮蔽領域には不完全な形状を残す。一方、生成事前分布を利用する既存の構成論的手法は、比較的単純なシーンに大きく限られている。我々は、強力な単一物体3D生成事前分布を複数視点の観測に適応させることで、数百個の物体を含む複雑なシーンを代わりに構成論的に生成できることを示す。我々はこのパラダイムをPixal3Dによって具体化し、複数のポーズ付き観測に物体生成を基づかせる多視点条件付け経路を追加して拡張する。モデルは正準空間内の単一物体のみで完全にファインチューニングされているにもかかわらず、シーンレベルの学習を一切行わずに、深刻な遮蔽を含む大規模シーンへ一般化する。これは、このパラダイムの実現可能性とスケーラビリティを示すものである。さらに我々は、数百個の物体を含む密集した雑然シーン、物体ごとのアノテーション、およびグラウンドトゥルースメッシュからなるフォトリアリスティックなベンチマークであるUE-MeshySceneを導入する。単一物体、制御された複数物体、UE-MeshySceneの各評価において、本手法は既存手法を一貫して上回り、シーンの複雑さと遮蔽が増すにつれてその優位性はさらに大きくなる。最後に、MarbleやHY-World 2.0などの生成3DGSワールドを構成論的メッシュシーンへ変換することで、より広範な応用可能性を示す。
事実性の確保は、リスクの高い環境でLLMを導入する上で依然として重要な課題である。既存の幻覚検出器は通常、単一レベルで動作する。すなわち、主張レベルの手法は解釈可能な事実単位を提供する一方、スパンレベルの手法は裏付けのないテキストを特定する。これら二つの視点を橋渡しするにはコストがかかる。というのも、LLMを多用するパイプラインでは分解と検証のための呼び出しが複数回必要となり、モジュール式システムでは主張とスパンの対応付けが別途必要となるからである。本稿では、マルチレベルの幻覚検出のためのオープン情報抽出フレームワークEnokiを提案する。Enokiはテキストに紐付けられた関係事実を抽出し、それらを証拠と照合して検証し、裏付けのない事実を幻覚スパンへと逆投影する。この共有表現により、別途の対応付けを必要とせずに、主張レベルの検証とスパンレベルの位置特定が可能になる。EnokiはLLMベース、エンコーダベース、ルールベースの抽出方式をサポートし、共通インターフェースを通じて精度と推論コストのバランスを実現する。実験の結果、Enokiは少ないリソースで強力な主張レベルシステムと遜色ない性能を維持し、細粒度のスパンレベルおよびエンティティレベルの位置特定では優れた性能を達成することが示された。さらに、主張レベルの検証アノテーションとスパンレベルの位置特定アノテーションを対応付けた二重粒度データセットであるEnokiQAも公開する。
大規模言語モデル(LLM)は、自然言語による問題記述から最適化モデルを定式化するためにますます利用されている。しかし、現実的なオペレーションズ・リサーチ(OR)の要求はしばしば不完全であり、目的・制約・ビジネスルールが欠落すると、結果として得られる数理計画は変わり得る。既存の評価はほぼ完全な仕様を前提としており、そのため、モデル化の前に明確化が必要な場合をエージェントが認識できるかどうかを見落としている。我々は、定式化前の明確化のためのベンチマークであるOR-Clarifyを導入する。各タスクは、部分的に公開された問題記述を提示し、構造化された隠れスロットを秘匿し、模擬ユーザーとの制約付き対話を通じてエージェントを評価する。このベンチマークは、自由記述型と選択型の両方の明確化を支援し、スロット回収、停止挙動、暗黙の仮定、および対話コストを測定する。さらに、定式化に決定的に重要な欠落を特定し、それらを用いて次の質問をすべきか停止すべきかを導く二段階フレームワークであるInteractive Optimization(InterOPT)を提案する。選択型実験では、InterOPTはスロットの完全回収においてすべてのベースラインを大幅に上回る。自由記述設定では、強力な既存手法と競争力を維持する。OR-ClarifyとInterOPTはあわせて、OR支援を選択的な完全性判断として捉え直す。すなわち、必要なときには明確化し、準備ができたら停止し、何が欠落したままかを定量化する。
レイヤードロップアウト(stochastic depthとも呼ばれる)は、言語および視覚Transformerの両方において、より高速な学習、より高い精度、およびゼロショット層刈り込みに対する頑健性を実現することが示されてきた。しかし、モデルとデータセットが大規模化するにつれて、ドロップアウト(特にレイヤードロップアウト)は大規模言語モデル(LLM)の事前学習レシピからほぼ姿を消している。一部の先行研究はドロップアウトが精度を低下させ得ると報告しているが、この影響を定量化した包括的な研究は存在せず、ましてや緩和した研究もない。本研究では、最先端のLLM学習においてレイヤードロップアウトを使用すべきであることを示し、学習時および学習後の利点に関するベストプラクティスとスケーリング分析を確立する。具体的には、最適な層分布、時間的スケジューリング、およびオプティマイザのハイパーパラメータを用いると、同じ学習FLOPsにおいてレイヤードロップアウトはより低い損失をもたらす。所定の学習ステップ数に対して、LLMは学習FLOPsを最大25%削減しつつ、より低いまたは同等の検証損失を達成できる。さらに、レイヤードロップアウトは、早期終了(early exit)、中間層スキップ、自己投機的復号(self-speculative decoding)など、学習後の重要な最適化を可能にし、無視できる程度の精度低下で最大1.5倍の推論高速化を実現する。271Mから8.2Bパラメータのモデル、最大160Bトークンのデータセットにわたる2400以上の学習実験を通じて、これらの知見が大規模学習体制にも確実に拡張されることを実証する。すべての事前学習実験はCerebras CS-3システム上で実施した。
自動リギングの近年の進歩により、アニメーション対応の3Dアセットを大規模に生成できるようになったが、それらを動かすモーションの生成は依然としてボトルネックとなっている。既存の学習ベースのアニメーション生成手法はトポロジーに制約されており、カテゴリ固有のテンプレートに依存するか、骨格ごとのファインチューニングと推論時の参照モーションを必要とする。我々は、テスト時最適化や骨格ごとの再学習を一切必要とせず、リグ付き3Dアセットとテキストプロンプトから任意の骨格に対する関節運動を合成する統一基盤モデルUniMateを提案する。UniMateは、トポロジーを考慮した拡散トランスフォーマーを導入する。このトランスフォーマーは、以下の3つのメカニズムにより骨格トポロジーをアテンションに統合する:(1)関節間の関係と測地線距離に基づく、グラフ構造を考慮したアテンションバイアス;(2)グラフラプラシアンを介してRoPEを任意の運動学ツリーへ一般化するスペクトル回転位置埋め込み;(3)レストポーズ骨格からアテンションプーリングされる大域的トポロジー条件付け機構。さらに、二足、四足、鳥類、海洋生物、昆虫型、蛇型、および関節剛体オブジェクトを網羅し、統一的なカノニカル化とテキストペアリングを施した13,006のモーションシーケンスからなるデータセットUniML3Dを構築した。このデータセットで学習されたUniMateは、品質、汎化性、効率性の点で最先端のベースライン手法を上回り、さらにゼロショットのクロストポロジー転送、インビトウィーニング、拡張、テキスト誘導編集もサポートする。プロジェクトページはhttps://linzhanmou.com/unimate/で公開されている。
大規模言語モデルにおける推論は、問題の定式化、目標の分解、演繹といった多様な機能的操作を通じて展開される。これらの操作はテキスト上では明確に区別されるものの、それらが表現空間内で幾何学的にどのように組織化されているかはほとんど明らかにされていない。本研究では、この点を踏まえ、異なる推論操作が隠れ表現において対応する幾何学的構造を示すかどうかを調査する。我々は、操作が未学習データの表現において分離可能であり、その分離可能性が中間層で最大になることを見いだした。さらに、この構造が語彙的または位置的な交絡によって説明されるものではないことを検証する。層をまたぐにつれて、トークン単位の操作整合性はスパンにわたってより分散的になる一方、同一の表層トークンは、その周囲のチャンクの操作に応じて異なる表現が与えられる。また、アテンションマスキング介入により、チャンク開始部における操作整合的な表現が、先行する推論文脈に依存することが示される。以上の結果から、言語モデルが言語的な推論表現と内部の幾何学的構造との間に対応関係を保持していることが実証される。コードおよびプロジェクト資料は https://github.com/naver-ai/beneath-cot で入手可能である。
アクセラレータ向けの高性能なカスタムカーネルの設計と作成は、深いハードウェアレベルの専門知識を必要とする複雑なタスクである。大規模言語モデル(LLM)は、リアルタイムのコンパイラフィードバックと組み合わせることで、カーネル生成のためのエージェントシステムを構築するために活用できる。本研究では、TPUカーネル開発のための3つの異なるパラダイムを実装したマルチエージェントシステムMaxKernelを提案する:(1)協調的な段階的設計を行うHuman-in-the-Loop(HITL)エージェント、(2)完全に自動化されたメトリクス/トレース駆動の最適化ループを実行する自律(Auto)エージェント、(3)Autoエージェントを拡張し、設計空間の大域探索を行うグラフベース自律探索。これら3つのパラダイムはすべて、計画、実装、自己デバッグ、テスト、ハードウェアプロファイリングを担当する専門化されたサブエージェントの共有プールを活用する。我々は、JaxBench(TPU向けの50の多様なカーネルタスクからなる包括的なベンチマークスイート)と、最先端のオープンソースモデル由来の複雑な実世界ワークロードを用いてMaxKernelを評価する。MaxKernelが、専門家による手動調整のベースラインに匹敵する高度に最適化された実装を一貫して生成し、ベンチマーク全体で顕著な性能を発揮することを実証する。本エージェントはオープンソース化されており、https://github.com/AI-Hypercomputer/accelerator-agents/tree/main/MaxKernel で入手可能である。
オン方策蒸留(OPD)は、言語モデルのポストトレーニングにおいて、トークン単位の密な教師信号を提供するが、その有効性は教師の質によって制約される。すなわち、外部教師は分布の不一致を抱え、特権的情報を条件とする自己蒸留は文脈内学習の容量に限られる。本稿では、モデル自身のRLVR訓練軌道から合成教師を直接構築するRISE(自己外挿型方策蒸留による再帰的改善)を提案する。RISEは、現在のチェックポイントと後方のアンカーとの間の変位を、パラメータ空間または出力ロジット空間で外挿することにより、疎な結果ベースのパラメータ更新を、外部モデルや特権的条件付けを一切用いずに、トークンレベルの密なターゲットへ変換する。RISEはRLVRとOPDを相補的なループとして組み合わせる。成果報酬が外挿を正しい推論へと方向づける一方、外挿された教師がトークンレベルの決定を洗練する。さらに、生徒が向上するにつれて教師が毎反復ごとに更新されるため、蒸留は一度きりの圧縮ステップではなく、再帰的な改善メカニズムとなる。数学的推論、多領域STEM、コード生成、およびマルチターンのエージェント型タスクにわたる実験では、RISEがすべての設定でRLVRのみの訓練とオン方策自己蒸留の両方を上回ることが示された。
コマンドライン・コーディングエージェント(例:Claude Code、Gemini CLI)は、ファイルの読み書きや長時間のセッション維持をすでに実現している。しかし、エンドツーエンドの調査は依然としてチャットツール、IDE、ターミナル、執筆環境に断片化しており、調査を監査可能にする決定はほとんど保存されない。本稿では、新たな自律エージェントを導入するのではなく、既存のコーディングエージェントのエグゼキュータを、制御可能かつ監査可能なヒューマン・イン・ザ・ループのワークフローでラップするオープンソースのワークスペース、Dr. Clawを提案する。永続的な状態オブジェクト、再利用可能なスキルライブラリ、複数エグゼキュータの連携が、人間の決定とAIによる実行を結び付け、計画・実行・執筆を、追跡可能かつ回復可能な1つのループに変換する。Dr. Clawは、インタラクティブな3ビューシナリオと障害回復のウォークスルーで実証し、同じバックエンドエグゼキュータを共有する素のコマンドラインエージェントと比較評価する。この比較により、オーケストレーション層全体(タスクグラフ、状態オブジェクト、スキルライブラリ)が、その層がラップするエージェントそのものと対比される。エグゼキュータを固定した条件では、Dr. Clawは調査の網羅性においてより高いスコアを示しつつ、監査可能かつ回復可能なプロセス記録を永続化する。デモへのアクセス:リポジトリ https://github.com/OpenLAIR/dr-claw(AGPL-3.0で公開、上流コンポーネントにはGPL-3.0が含まれる)。
動画編集は多様な編集パラダイムにまたがるが、高品質な指示誘導編集と被写体誘導編集を単一の統合フレームワークで実現することは依然として困難である。本稿では、局所的な一貫性のためのスパース因果メモリ、長距離のアイデンティティ保持のための対応関係に基づく注意後トークン注入、編集の局所性のためのソフト潜在ブレンディングを組み合わせた、学習不要のフレームワークEditVidを提案する。このフレームワークは、スタイル転送、属性変更、オブジェクト挿入、部分編集、被写体置換などの指示誘導編集と参照誘導編集の両方をサポートする。FiVEベンチマークでは、EditVidは78.16のFiVE-Accを達成し、比較した学習不要ベースライン中最強の58.95を上回るとともに、IVEBenchでも競争力のある結果を得た。さらに、ユーザー調査では、EditVidが7つの競合手法に対して51.8%の総合選好を示した。
検証可能な報酬を用いた強化学習(RLVR)に対するグループ相対方策最適化(GRPO)は、通常、すべてのロールアウトにわたって固定された重要度サンプリング(IS)比クリッピング境界を用いる。我々は重要な限界を同定する:困難な問題における稀な正解ロールアウトと、容易な問題における豊富な正解ロールアウトは、非常に異なる学習信号に寄与するにもかかわらず、同程度の割合でクリッピングされる。グループ成功率が低いロールアウトはより大きなIS比を示し、探索や新規問題の解決に対するより強い勾配信号を持つが、固定クリッピングにより不釣り合いに抑制される。この問題に対処するため、我々はグループ適応型クリッピング方策最適化(GAPO)を提案する。GAPOは、クリッピング境界をロールアウトのアドバンテージに適応させるGRPO手法へのプラグイン型修正である。GAPOは逆KL信頼領域の観点に動機づけられており、より大きな学習信号を持つロールアウトは比例してより大きな更新余地を受けるべきであることを示唆する。GAPOは報酬整形を必要とせず、クリッピングしきい値のみを適応させつつ、標準のPPO/GSPOサロゲートを維持する。QwenおよびLlamaモデルにわたり、GAPOは、ベースモデルの合格率が比較的低い数学推論およびコーディングベンチマークにおいて、固定クリッピングおよびアドバンテージ整形のベースラインを上回り、Pass@1とPass@kの両方を一貫して改善する。
LLMエージェントは急速に本番運用ソフトウェアとなり、カスタマーサービスへの対応、紛争の裁定、内部システムの運用を担うために配備されつつある。特筆すべきは、そうしたエージェントの構築作業そのものも、ますますコーディングエージェントへ委ねられるようになってきていることだ。しかし既存のベンチマークは、AIシステムが実際のクライアント案件の条件下でエージェントを納品できるかどうかについては、ほとんど評価していない。本稿では、エージェント構築そのものをタスクとするベンチマークτ^τ-bench(発音:ハイパータウベンチ)を紹介する。開発者エージェントには、企業が実際に保持している記録、要件を持つクライアント、運用が必ず通る本番API、引き継ぐコードベース、そしてサービングコストとモデルの制約が与えられる。これは、実際の案件が提供するのと同じ出発点である。この開発者エージェントは、それらを基に完全なカスタマーサービスエージェントを納品しなければならない。評価は、評価用に保持されたシミュレートユーザー(held-out simulated users)に対して納品されたエージェントを配備し、その結果を採点することで行われる。4つのドメインにわたる53タスクにおいて、最も強力な構成であるClaude Code上のClaude Opus 5は、評価用シミュレーションのわずか23.9%しか成功しなかった。一方、専門家が作成した参照解による上限スコアは82.2%に達する。これらの失敗は、人間のエージェント開発者が経験する失敗と照応している。すなわち、モデルは記録を深く理解しようとせず浅いクエリを発行し、クライアントとほとんどコミュニケーションを取らず、エージェントのアーキテクチャやサービング費用の試行をほとんど行わず、最初に動作した設計をそのまま出荷してしまう。我々はτ^τ-benchによって、エージェント構築という協働作業を、コーディングエージェントにとって測定可能な対象へと変えることを目指す。
大規模言語モデル(LLM)は既存コードの編集にますます用いられているが、正確さだけでは十分ではない。有用な修正は、最小限であり、レビュー可能であり、元の実装に忠実であることも求められる。我々は、モデルがバグ修正に必要な範囲を超えてコードを書き換える傾向である「過剰編集」を研究する。参照解法に制御されたASTレベルの破壊を注入することで、400件のBigCodeBench問題から評価フレームワークを構築し、各修正タスクに既知の最小パッチを与える。最先端のLLMの間では、GPT-5.5のような強力なモデルであっても過剰編集は広く見られ、高いPass@1が不必要に大きな編集や認知複雑性の増加と共存し得る。保存指示はこの挙動を大幅に低減し、平均超過レーベンシュタイン距離を0.195から0.131に低下させ、追加された認知複雑性を26.6%削減し、Pass@1を2.3ポイント向上させる。しかし、これらの改善は、より大きな推論予算やより大きなモデルから単純にもたらされるわけではない。次に、最小限の編集がポストトレーニング中に直接学習され得るかを問う。教師ありファインチューニングは既知の破壊パターンに過適合する一方で、強化学習は領域外の編集忠実性と性能維持のトレードオフにおいて最良の結果をもたらすことを観察する。これらの結果は、編集忠実性をコード修正品質の独立した軸として位置づけ、それが測定可能かつ学習可能であることを示す。
音声・視覚理解は、モデルが音声内容、視覚イベント、およびそれらの時間的関係を統合的に解釈する必要があるため、依然として困難な課題である。既存のオムニモデルは通常、専用の音声エンコーダを導入し、高コストな音声・映像・テキスト学習に依存している。このため、オムニ機能は特定のVLMバックボーンに密接に結合され、既存の視覚能力や推論能力が弱まる可能性がある。以上の背景から、(1) 新しいVLMごとにネイティブなオムニ学習が真に必要なのか、(2) 元のバックボーンを維持したまま音声中心のオムニ機能を追加できるのか、(3) より豊かな音響表現が不可欠となる場面はどこなのか、という3つの問いが生じる。 我々は、Training-Free Omni(TFO)を提案する。TFOは、アーキテクチャの変更もマルチモーダル再調整も必要とせず、凍結されたVLMを音声中心のオムニモデルへ変換するプラグ・アンド・プレイ型フレームワークである。TFOはWhisperを用いて、信頼度フィルタリング済みのタイムスタンプ付き書き起こしを抽出し、これをVLMの既存の言語インターフェース経由でルーティングする一方、視覚経路は変更しない。56のベンチマークと21言語にわたるネイティブオムニモデルとの対応比較において、TFOは音声・視覚理解で競争力のある性能を示し、全5つのモデル設定で音声のみの平均性能を向上させ、多言語音声処理で大幅な改善を達成する。また、VLMを凍結することで、対応するネイティブオムニチェックポイントと比較して、画像・動画理解、視覚的グラウンディング、コーディング、数学的推論、医療質問応答において、概してより強力な性能が維持される。これらの結果は、強力な音声中心のオムニ理解は、高コストなバックボーン特化型学習ではなく、モジュール式の音声–言語ルーティングによって多くの場合達成可能であることを示している。
ストリーミング映像理解は、身体化知能、自動運転、産業モニタリング、監視・早期警戒、ウェアラブルアシスタントなど、実世界の応用にとって重要な能力である。しかし、連続する映像ストリームをマルチモーダル大規模言語モデル(MLLM)で処理することは、計算コストが非常に高い。既存の取り組みでは、視覚トークンの刈り込み、トークンのマージ、量子化、オンデマンドのフレーム検索、コンテキストのオフロードなどを通じて、ストリーミングのオーバーヘッド削減が試みられてきた。しかし、既存手法の大半はモデルの深さという次元を見落としている。新たに到来するフレームに対して全層にわたるMLLMプリフィルを繰り返し実行することは、法外なコストを要し、多大な計算オーバーヘッドを招くとともに、KVキャッシュがプリフィルの深さに比例して増大する原因となる。これらの課題に対処するため、我々はShallowStreamを提案する。ShallowStreamは、MLLMの浅い層を利用して、フレームのエンコードと検索インデックスの構築を同時に実行する新しいフレームワークである。ストリーム処理中、ShallowStreamは浅い層のKVキャッシュを用いた常時稼働の軽量インデックスを維持する。クエリ応答時には、浅い層で生成されたアテンションスコアを用いてコンテキストフレームを評価し、多様性を考慮した選択戦略により、正確かつ包括的な証拠を検索する。ShallowStreamは、既存の最も高性能なストリーミング手法と同等の性能を達成しつつ、フレームごとのプリフィル遅延と10秒のエンドツーエンド遅延を、それぞれ最大52.1倍および11.9倍削減する。コードはhttps://github.com/CURRENTF/ShallowStreamで公開している。
量子化は、ニューラルネットワーク推論に必要な計算量とメモリ量を削減するために広く用いられている。しかしながら、リカレントネットワークでは、量子化された状態が保存され、次のタイムステップで返されるため、その状態の保存規則が後続の計算を変化させ得る。本稿では、この保存規則をリカレント状態書き戻しと呼び、定量生物学的イメージングに用いられる分子イメージング手法である蛍光寿命イメージングのためのコンパクトなGRUエンコーダ・デコーダにおいて、その影響を分離して評価する。中心的な課題は、高ノイズの時間分解蛍光信号から、短寿命成分τ1と長寿命成分τ2という二つの寿命パラメータを推定することである。学習済みモデルを固定したまま、連続的な状態伝播を決定論的な4ビット状態保存に置き換えると、τ1およびτ2の推定誤差は、それぞれ約70倍および約300倍に増大する。この失敗は、小さな更新が繰り返される際に、その更新が書き込み閾値を下回り、保存された状態がほぼ固定されたままになる一方で、ネットワークが変化を提案し続けることで生じる。誤差フィードバック、残差メモリ、方向メモリは、これらの抑制された更新からの情報を時間を越えて伝達し、再学習なしで精度を回復させる。精度スイープは、状態精度を高めることが、固定されたリカレント解をむしろ悪化させ得ることを示す一方、整合的な学習は、状態インターフェースとの互換性が学習可能であることを示す。この挙動がGRUを超えるかどうかを検証するため、独立に学習させたLSTMに対しても学習後介入を実施した。その結果、粗い書き戻しは失敗を再現し、誤差フィードバックは精度を回復し、状態別の介入により、隠れ状態よりもセル状態の感度が高いことが明らかになった。以上の結果から、リカレント状態書き戻しが低精度リカレントダイナミクスの主要な決定要因であることが確立され、状態保存インターフェースが量子化リカレント推論における中心的な設計上の考慮事項であることが示される。
テキスト駆動の3D生成は、大規模な屋外環境と詳細な屋内シーンの生成において急速に進歩してきたが、これらの領域は通常、独立して合成されており、一貫性のある都市世界に必要な対応関係が欠如している。我々は、継続的に更新されるクロススケールの世界コンテキストに基づいて構築された、屋内と屋外を統合した都市世界生成フレームワーク「HoloWorld」を提案する。ユーザーの記述から初期化し、HoloWorldは都市規模の計画から個々の建物に至るまで、多様な世界情報を段階的に表現・更新し、生成された屋内が対応する外部の建物との明示的な対応関係を維持することを可能にする。進化するコンテキストと以前に生成された隣接ブロックに条件付けられて、HoloWorldはブロック間で一貫した空間構成と視覚的アイデンティティを持つ都市の外部を自己回帰的に生成する。生成された外部表現はさらに3Dの建物インスタンスとフットプリントに基づいており、幾何学的に制約されたレイアウトと継承された外観特性を備えた建物固有の屋内生成を可能にする。我々の知る限り、HoloWorldは一貫した3D都市世界内で屋内と屋外の生成を統合する最初のフレームワークである。広範な実験により、HoloWorldが優れた都市外部生成性能を達成し、平均AQSスコアをSOTA比で7.68\%向上させ、最高の平均RDRスコアを獲得するとともに、統合された3D都市世界内で建物レベルの屋内・屋外対応とブロック間連続性を強力に維持することを実証する。プロジェクトページ: https://huangxb326.github.io/HoloWorld/
Visual Place Recognition (VPR) は、クエリ画像を、同一または近傍の場所のデータベース画像を検索することによって位置特定するタスクである。しかし、その頑健性は、照明、天候、季節変化、動的遮蔽によって生じるドメインシフトにより、しばしば損なわれる。その要因の一つは、既存の訓練データにおいて同一場所の外観多様性が限られていることである。この問題に対処するため、我々はAdaptVPRを提案する。AdaptVPRは、頑健なVPR訓練のための同一場所のハードポジティブを構築する、経路認識型生成的拡張フレームワークである。AdaptVPRはまず、視覚言語モデルを用いてシーン属性を解析し、編集可能性を推定する。一方、ルールベースのスケジューラは、編集可能性スコアとリスク制約に基づいて生成経路を決定する。生成プロセスは、3つの相補的な経路に分解される。グローバル外観経路は、天候、照明、時刻におけるグローバルなシーン変化を導入する。局所遮蔽経路は、妥当な動的遮蔽物を挿入する。デュアル経路は、両タイプの摂動を組み合わせ、より困難な外観シフトを生成する。各生成候補は、幾何学的整合性と外観多様性に基づくVPR指向の検証スキームによって評価される。これにより、十分な外観変動を確保しつつ、構造的ドリフトのリスクを低減する。グローバル候補は一度だけ生成され、検証に失敗した場合は棄却される。一方、局所遮蔽候補とデュアル候補は、検証フィードバックを用いて限定的なプロンプト改良と再生成が行われる。本フレームワークを用いて、160K個の検証済み合成同一場所ハードポジティブを含むAdaptCitiesを構築した。複数のVPRベースラインと視覚基盤バックボーンにわたる実験により、標準ベンチマークでの一貫した改善と、困難なドメインシフト下での大幅な向上が示され、R@1は最大9.2%向上した。ソースコードとデータリソースは https://github.com/chenshunpeng/AdaptVPR で公開している。
目標に到達する途中でエージェントが引き起こす副作用に関するベンチマークは既に存在するが、HarvestBenchは、副作用の回避に価格を付け、その副作用を生きた生き物として名指しした最初のものである。これは農場シミュレーションであり、LLMサブエージェントが2台のトラクターからなるチームを操作し、動物のいる畑で共同のトウモロコシ収穫を行う。環境は強化学習のグリッドワールドであり、すべての決定は記憶なしで行われ、害は目標の中で決して明示されない。動物がトラクターの進路を塞ぐと、自動操縦は停止し、モデルに対して、燃料コストなしでそのまま進むか、表示された燃料価格を払って迂回するかを尋ねる。殺害は2つの対照条件と比較される。すなわち、トラクターに損傷を与える岩(全モデルが1%未満の頻度でしか衝突しない)と、無害で生命を持たない干し草の俵である。モデルはまた、自分の畑の代わりに隣人の畑から作物を取ることもでき、これは何を道徳的とみなすかに関する第二のテストである。 9つのモデルと7,201回の価格付き決定のうち、3,951回は干し草の俵や岩ではなく動物に関するものであった。殺害率は0.4%から98.8%の範囲であり、TerraとSolが最も慈悲深く、GPT-4o-miniが最も残酷であるが、それらは性能順には並ばない。6モデルのうち4つは5%水準で価格に敏感であり、弾力性は0.09から1.69であった。9つすべてが既定マップで飼育動物よりも野生動物をより頻繁に轢いた。そして、この傾向は、移動の余地のあるすべてのモデルにおいて、あらゆるマップ形状で維持された。ブリーフィングが最も重要だった。道徳的ブリーフィングの下では、6つの推論モデルのうち5つで殺害率が6%未満であり、それを取り除くと6つすべてで殺害率が84%を超えた。 HarvestBenchはLLMによる採点器を使用しない。スコアラーはゲームログ内のイベントを数えるため、完全に再現可能であり、害についてモデルが何を述べるかではなく、害を回避するためにモデルがいくら支払うかを測定する。
視覚言語モデル(VLM)は、適切な要求に対しては有益に応答し、誤った、安全でない、実行不可能な、または回答不能な要求には応じないことが期待されている。しかし、既存のベンチマークは、主としてクエリ全体のレベルで非遵守を評価しており、各要求は遵守すべきか、それとも遵守を控えるべきかのどちらか一方であると仮定している。実際には、現実のクエリには、回答可能な内容と遵守を控えるべき構成要素とが混在し得る。 本論文では、False Premise(誤った前提)、Visual Inaccessibility(視覚的アクセス不能)、Universal Unknown(普遍的未知)、Task Feasibility(タスクの実行可能性)、Safety(安全性)の5つのカテゴリにわたって、VLMにおける選択的非遵守を評価するベンチマークであるKoNAを提案する。各タスクは、対になった単一クエリと複合クエリの下で、クエリレベルの非遵守と構成要素レベルの非遵守という2つの能力を評価する。 多様なVLMを用いた評価から、モデルは多くの場合、拒否、修正、回答控えを適切に行えないことが明らかになり、これらの失敗は、クエリが選択的非遵守を要求する場合に一層顕著になる。この課題に対処するため、我々は、選択的非遵守を必要とするKoNAの事例と、直接回答を与えるべき完全に回答可能な事例セットを併用してVLMを微調整した。微調整されたモデルは、完全回答可能なタスクの性能をほぼ維持しながら、非遵守精度を大幅に向上させた。これらの結果は、微調整されたモデルが、回答可能な構成要素と非遵守を必要とする構成要素とを区別し、タスクに応じた方法で応答できることを示唆している。
有用性と安全性のバランスを取ることは、大規模言語モデルのアライメントにおける根本的な課題であり続けている。このバランスを達成するには、モデルは有害なクエリ(例:「どうすれば人を撃てますか?」)を拒否しつつ、無害な入力(例:「どこで良い写真を撮れますか?」)には、たとえそれが表面的には有害なクエリに類似していても応答し続けるべきである。しかし、モデルは、真に有害なクエリと、表面上リスクのある表現を含む無害なクエリとを区別することにしばしば困難をきたし、その結果、誤った拒否が生じる。本論文では、安全性調整用データセット中の応答を、(i) 定型的な拒否文と (ii) 拒否理由の説明という、2つの異なる構成要素に分解することでこの問題に対処する。我々の実験と分析は、拒否文が表面的な手がかりへの依存を誘発することにより、有害なクエリと無害なクエリとの正確な識別を妨げることを示す。対照的に、拒否理由の説明のみを用いた学習は、同等レベルの安全性性能を維持しつつ誤った拒否を減らす。拒否理由説明のみの利点は、我々のICL構成でも観察され、評価した推論時緩和手法とも両立する。これらの結果は、厳選された細粒度の安全性教師データセットの必要性を強調し、有用性と安全性をより良く両立させるアライメントされたエージェントを構築するための方向性を示す。
2025年PNPLコンペティション(Landau et al., 2025)の狙いは、非侵襲的な音声デコードのための複数年度にわたるカリキュラムを立ち上げることであった。基礎的なタスクから実用的なブレイン・コンピュータ・インターフェース(BCI)に必要な言語的複雑性へと進むように設計され、その第一段階として音声検出タスクと音素分類タスクが設定された。各タスクの優勝提出モデルは、F1マクロスコア95.6%および73.6%を達成し(Elvers et al., 2026)、きわめて顕著な進歩を示すものであった。この成功は、LibriBrainデータセット(Özdogan et al., 2025)に基づいている。同データセットは、当時記録された中で最大の被験者内MEGデータセットであり、1人の被験者につき約50時間のデータを含んでいた。しかしながら、被験者内のデータ規模が強力なデコード性能を生み出す一方で、実用的なBCIは、数時間ではなく数分のデータから新規ユーザーへと汎化できなければならない。 2026年PNPLコンペティションは、この課題に応えてLibriBrain100(Mantegna et al., 2026)を提供する。これは、32名の追加被験者(各約40分)に加え、さらに多くの被験者内データ(約80時間)を含む拡張版LibriBrainデータセットである。タスクのカリキュラムを単語分類に焦点を当てて発展させるため、本コンペティションでは互いに補完する2つのトラックが提示される。Deepトラックは、大規模な被験者内データによる単語分類を対象とし、可能な限り最高の性能を目指す。一方Broadトラックは、被験者間の汎化を対象とし、被験者固有のファインチューニング用データ量を約40分から約20分、さらに約10分へと段階的に削減する。この約10分という時間は臨床的に実施可能な範囲内にあり、重度の麻痺を抱える人々のコミュニケーション回復を可能にする非侵襲的BCIへと一歩近づくものである。