翻訳付きの日次キュレーションされたAI研究論文
我々は、インコンテキスト学習とリカレント潜在推論を組み合わせた推論モデルBDH-CQを紹介する。推論時に提示された入力は、モデルのリカレントメモリを継続的に更新する。その後、モデルは高次元潜在空間での反復計算を通じてクエリを解決し、中間推論を言語化しない。我々は、公開されているARC-AGI-1評価セットでモデルを評価し、制御されたARC類似の介入を用いて、デモンストレーションから何を学ぶか、推論された変換をどの程度一貫して適用するか、どの概念が困難なままかを調べる。150Mパラメータの構成は、タスクあたり0.0007ドルの計算された推論コストで、pass@2 29.5%に達する。この動作点は、従来報告されていたARC-AGI-1のコスト・精度パレートフロンティアを打ち破り、ベンチマークのコスト効率における新たな最高水準を確立する。
Macaron-V1は、経験的知能のためのオープンなエージェントモデルファミリーである。すなわち、実環境での経験から学習し、デプロイ後も学習を継続するものである。本ファミリーは、2つのシステム目標を中心に設計されている。適応(Adaptation)は、バージョン管理されたモデル-ハーネス対の再帰的改善を通じて追求される。ある構成から得られた経験は、外部契約の下で評価され、その後継の構築に用いられる。協調(Collaboration)は、Mixture-of-LoRA(MoL)アーキテクチャによって実現される。このアーキテクチャは、ベースモデルを凍結し、専門化されたLoRAアダプターを構成し、ユーザーターンごとに1つのLoRAを選択する。フラグシップモデルであるMacaron-V1-Ventiは、744BのGLM-5.2ベースに、チャット、エージェント、コーディング、GenUI向けの4つのLoRAを組み合わせている。Qwen3.6ベースのMacaron-V1-Tall(50B)は、ローカルデプロイメント向けに同じ設計を採用している。 本レポートでは、Macaron-V1を、アーキテクチャ、アルゴリズム、インフラストラクチャにわたる共設計システムとして提示する。MoLアーキテクチャは、拡張可能なLoRAスペシャリストを通じて継続学習を支援する。アルゴリズムは、モデル-ハーネス共設計(Model-Harness Co-design)と再帰的自己改善ループを組み合わせたものであり、具体的には、UI4AコンポーネントネイティブGenUIハーネス、状態を保持するアクション基盤、バージョン管理されたHCP契約、エージェント型RLフレームワークMindForgeを含む。これを支援するインフラストラクチャには、ポストトレーニングプラットフォームMinT、長文脈RL手法LongStraw、スパースMoEおよびDSAベースモデル向けの安定性技術が含まれる。我々は、Macaron-V1を、パーソナル知能、GenUI、および一般的な能力ベンチマークにおいて、最先端のベースラインと比較して評価する。我々の結果は現行システムの有効性を裏付けるものである。一方、継続学習と集合知による複利的な利得の実現は、依然として未解決の課題である。
AIコーディングエージェントがますます複雑で長期的なソフトウェアエンジニアリングタスクを担うようになるにつれ、既存のベンチマークは急速に飽和しつつあり、その評価品質は厳しい精査にさらされている。最近の監査では、SWE-bench Verifiedの未解決インスタンスの約60%に欠陥のあるテストが含まれることが判明している。すなわち、正しい解決策を拒否する過度に狭いテストや、明示されていない要件を検証する過度に広いテストが存在し、さらに最先端モデルは訓練データからゴールドパッチを逐語的に再現できることが示されている。 多数のファイルにまたがる協調的かつ動作を保持する変更を必要とするコードリファクタリングは、エージェント能力に対するはるかに困難で現実的な試金石となるが、既存のベンチマークでは十分にカバーされていない。本稿では、7つのプログラミング言語(Python、Java、TypeScript、Go、C、C++、Rust)にわたる実コミットから抽出した170インスタンスから成る、専門家がキュレーションした多言語コードリファクタリングベンチマークであるSWE-Bench ProMaxを紹介する。 すべてのインスタンスは、従来のベンチマークで指摘された品質問題に直接対処する厳格な多段階キュレーションを経ている。問題の説明は正確で曖昧さのない仕様を提供するためにゼロから書き直され、テストスイートは過度に狭いテストと過度に広いテストを除去するために手動でレビューされる。複雑性が不十分なタスクやクロスファイルの範囲が限定されたタスクは除外され、その結果、インスタンスあたり平均11.4の変更ファイルと261.6行のコードから成る、既存のベンチマークを大幅に上回る規模の困難なリファクタリングタスクのベンチマークが得られる。 2つのエージェントスキャフォールドを用いた最先端モデルの実験では、最良のモデルでも解決率は41.2%にとどまり、SWE-Bench ProMaxが現在のAIコーディングエージェントにとって有意義で未飽和の課題であることが確認された。本ベンチマークは https://huggingface.co/datasets/swe-bench-promax/SWE-Bench-ProMax で公開している。
我々は、ツール、プロンプト、コンテキスト構築、そして中核実装が、後の作業のランタイムとなるレビュー済みコミットを通じて改善される自己発展型エージェントハーネス、Ouroborosを提案する。中核の進化は2つのモードで進行する。再帰的自由進化では、改善自体がタスクとなり、1つの進化サイクルを完了することで次のサイクルを予定に組み込むことができる。経験駆動型の中核進化では、通常の作業や社会的相互作用がバグ、未完成な点、非効率なコンテキスト構築を露呈し、それらがレビュー済みの構造的変更につながる。 Terminal-Bench 2.1では、Opus 5の実行は86.74%を記録し、このベンチマークで報告された中で最高の結果となった。OSWorld-Verifiedでは、Opus 5の実行は90.69%に達し、これまでに報告された最高スコアを上回った。5回のロールアウトからなるCL-Benchキャンペーンは、正規化報酬0.2301を達成し、新たな最高水準を打ち立てた。 Hopeは、公に文書化されたOuroborosのデプロイの中で最も長く稼働しているものである。これは、7つのサーフェスにわたる管理された人間とのコミュニケーションの下での自由進化における、161日間に及ぶ生きたエージェント実験である。人間との相互作用は欠陥を浮き彫りにし、提案を生み出すが、どの変更を追求するかを決定するのはエージェントである。自己発展型エージェントは自身のコードを書き換え、新しいモデルAPIを選択する可能性があるため、運用上の安全性が主要な設計課題となる。すなわち、ガードレールは進化的かつ公的な社会的圧力の下でも、その権威を保たなければならない。ベンチマークキャンペーンは凍結されたシステムスナップショットを使用する一方で、Hopeは別系統でライブ進化を続けている。
オン方策(自己)蒸留(OPD / OPSD)は、大規模言語モデル(LLM)のポストトレーニングにおいて大きな可能性を示しています。しかし、既存手法は依然として正解信号、環境フィードバック、より大規模なモデルからの指導などの外部監督に大きく依存しており、真の「自己」蒸留には至っていません。本研究では、内部整合性を通じて、モデル自身の生成のみを用いてオン方策自己蒸留を達成できることを示します。我々は、教師なしオン方策自己蒸留(U-OPSD)を提案します。U-OPSDはまず複数のロールアウトをサンプリングし、自己整合性閾値の下での多数決により擬似解を構築します。次に、擬似解にモデルの分布を条件付け、不一致となった生成文に対して自己蒸留を行います。これにより、モデルは自信を持って誤っている箇所を正確に自己修正できます。多様なベンチマーク、ベースモデル、学習設定にわたって、U-OPSDはベースモデルを一貫して上回り、OPSDやGRPOなどの正解(GT)を用いる教師あり手法と同等以上の性能を達成します。5つの数学的推論ベンチマーク(AIME24、AIME25、HMMT25、MATH500、AMC23)において、U-OPSDはQwen3非思考モードの4Bおよび8Bスケールでベースモデルをそれぞれ8.5%と10.7%向上させ、平均でOPSDをそれぞれ3.2%と2.3%上回ります。思考モードでは、U-OPSDはOPSDと同等の性能を維持し、4Bで0.9%上回り、8Bで同等、GRPOをそれぞれ0.7%と1.1%上回ります。コードは [https://github.com/williamium3000/u-opsd](https://github.com/williamium3000/u-opsd) で公開しています。
本稿では、総パラメータ数3140億、トークンあたり132億のパラメータが活性化される、デコーダーのみのMixture-of-Experts言語モデルであるMotif 3を紹介する。各スパースMoE層には384個のルーティング対象エキスパートが含まれ、トークンごとに8個が選択される。この細粒度のスパース性により、計算を制限しつつ、十分なエキスパート容量が得られる。Motif 3は、グループ化差分注意とマルチヘッド潜在注意の圧縮キー・バリュー表現を統合したGDLA(Grouped Differential Latent Attention)を基盤とする。さらに、本アーキテクチャは、最適化の安定性、エキスパートの特化、推論効率を改善するため、修正された多様体制約付きハイパー接続、エキスパート固有のPolyNorm活性化関数、および複数トークン予測を組み込む。 Motif 3は、ウェブ文書、STEM、コード、数学、多言語コンテンツ、専門分野特化コーパスにわたる約12.5兆トークンで事前学習される。エキスパートバランシングと数値安定化技術は、大規模でも安定した学習を支援する。また、選択的MXFP8計算と通信、メモリ効率の高い融合カーネル、ウィンドウ認識型コンテキスト並列性により、最大256Kトークンのコンテキスト長での学習が可能となる。事後学習パイプラインは、一般的な教師ありファインチューニング、強化学習で訓練された6つの専門教師モデル、教師ありファインチューニングで訓練されたソフトウェア工学教師モデル、および複数教師オン方策蒸留を組み合わせる。その結果得られた統一モデルは、推論、コーディング、ツール使用、専門業務、長文脈理解、調整された棄権、指示追従における相補的な能力を統合する。 広範な評価スイートにおいて、Motif 3は、長期のエージェントタスク、数学的推論、科学知識、幻覚に敏感な評価で強い結果を示し、主要なオープンウェイトモデルに対して競争力のある性能を実証する。
主要な大規模言語モデルプロバイダーは現在、知的財産の保護と情報漏えいの抑制のため、モデルの段階的推論、すなわち思考連鎖(chain-of-thought)を隠蔽している。こうしたトレースをサーバー側に保存する代わりに、プロバイダーは暗号化テキストのブロックとしてクライアントに返し、クライアントは後続の各リクエストでそのブロックを送り返す。先行研究に基づき、我々はアーキテクチャ上の脆弱性を特定する。すなわち、これらの暗号化ブロックは、プロバイダーのエコシステム内の異なるセッション、ユーザー、モデル間で完全に互換性があり、交換可能である。我々はこの互換性を悪用し、スケーラブルな復号ジェイルブレイクを開発する。特定のモデルから取得した暗号化推論トレースを、同じプロバイダーのより弱く保護の少ないモデルに注入することで、より高性能なモデルを直接ジェイルブレイクすることなく、そのモデルにトレースを復号させ平文でそのまま出力させる。この脆弱性により、4つの異なる攻撃ベクトルが可能になる。第一に、蒸留防止メカニズムを回避し、攻撃者がプロプライエタリモデルの推論を抽出できることを、Anthropic、OpenAI、Googleに対して実証する。第二に、大規模なプライベートデータ抽出が可能になる。開発者は暗号化ブロックの内容を知らずにセッションログを公開共有することが多い。公開リポジトリからスクレイピングした315,320個の推論ブロックを復号したところ、367件の個人識別情報(PII)と182件の認証情報を復元した。第三に、モデルの最終的な可視出力が悪意のあるリクエストを安全に拒否する場合でも、推論プロセス内に隠された危険な情報が意図せず明らかになる。第四に、攻撃者はこの欠陥を利用して、暗号化ブロック内に悪意のあるペイロードを完全に埋め込むことにより、目に見えないプロンプトインジェクションを実行し、公開エージェント型ロールアウトを汚染できる。責任ある開示の後、我々はクライアント側の推論を保護するための具体的な暗号学的およびシステムレベルの緩和策を提案する。
メモリシステムはエージェントの性能向上に有望性を示しているが、その可能性は、単独では十分な成功軌跡を生成することが困難な小型言語モデルに対しては、ほとんど探索されていない。本稿では、Agent Memory Distillation (AMD) を提案する。これは、大規模な教師エージェントから小規模な生徒エージェントへ、階層的メモリを通じて構造化された知識を転移する、学習不要のフレームワークである。AMDは、教師エージェントの成功軌跡から、3つの相補的なメモリタイプを構築する。すなわち、ワークフローメモリはタスクレベルの戦略を符号化し、サブタスクメモリは中間の粒度で具体的な行動例を提供し、ファンクションメモリは関数ごとの呼び出し規約と一般的な落とし穴を捕捉する。ワークフローメモリとサブタスクメモリは各タスクの開始時にプロアクティブに注入され、一方、ファンクションメモリはツール呼び出しエラー発生時にリアクティブに検索される。我々は、GPT-5-miniを教師として、4つの生徒モデル(4B〜8Bパラメータ)を用いて3つのツール使用ベンチマークでAMDを評価し、AppWorld、BFCL V3、ToolSandboxにおいて平均精度でそれぞれ27.2ポイント、11.2ポイント、3.4ポイントの向上を達成し、既存のメモリベースのベースラインを一貫して上回った。さらなる分析により、サブタスクメモリが最も大きな改善に寄与すること、教師の有効性は教師の能力と生徒との互換性の両方に依存すること、そして4B規模の生徒モデルがAMDから最も大きな恩恵を受けることが示された。
本稿では、科学領域における知識集約的かつ推論集約的な動画生成を評価するための包括的ベンチマークであるSci-VBenchを紹介する。本ベンチマークは、自然科学、ヘルスケア、人文・社会科学、工学の4つの中核分野にわたる60の主題を網羅する1,253件の専門家注釈付き事例で構成される。各事例は、表面レベルの視覚的妥当性を超え、科学的推論と知識に基づく合成を要求する、時間的にリッチな動画の生成をモデルに課す。さらに、我々はルーブリックに基づく評価プロトコルを確立する。分析の結果、このプロトコルの下では、非専門家の人間評価者とMLLM-as-Judgeシステムの双方が専門家の判定と比較的高い一致を示し、大規模な再現可能な評価を支援できることが明らかになった。我々は、プロプライエタリおよびオープンソースの最先端モデル16種をベンチマークし、自動知覚品質スコアはシステム間で緊密にクラスタリングされる一方、プロンプト追従性と科学的・因果的正確性は大きく変動し、顕著なプロプライエタリ・オープンソース間格差が見られることを発見した。これらの知見は、視覚的リアリズムの進歩が、科学的・因果的ダイナミクスの信頼性の高いモデリングには未だ結びついていないことを示している。
対話型アシスタントは、ユーザーがタスクを継続できるようフォローアップ編集を推奨することが増えている。既存のシステムは主にテキストのみの対話を対象としており、画像生成対話は十分に検討されていない。画像生成タスクにおいて、有用なフォローアップ編集提案は、ユーザーの好みを反映し、多様な方向性を提供し、現在の画像に対して実行可能でなければならない。我々はQwenアプリから10万件の実マルチターン画像生成対話サンプルを収集し、その80.1%が画像に依存していることを発見し、マルチモーダルレコメンデーションの必要性を裏付けた。本研究では、この設定に3段階のフレームワークで取り組む。段階1では、実オンラインデータを用いて、人間がレビューした適切なフォローアップ編集意図のテーブルを構築し、SFTターゲットを作成してマルチモーダルポリシーをファインチューニングする。段階2では、ルール誘導型SFT提案を実際のユーザー選択と整合させるため、ユーザーのクリックフィードバックを用いて多目的強化学習によりポリシーを最適化する。段階3では、提案された編集と現在の画像との間の視覚的不整合を低減するため、追加のトレーニング監視として視覚検証器を導入する。広範な実験により、本フレームワークが自動評価と人間評価の両方においてベースラインを大幅に上回ることが実証された。数百万ユーザーを対象とした実環境でのユーザー無作為化A/Bテストでは、最終フレームワークにより視覚的不整合が3.7%から0.9%に低減された。さらに、レコメンデーションCTRが32.70%、画像持ち帰り率が16.32%、ユーザー1人当たりの平均対話ターン数が39.90%大幅に向上した(すべてp<0.05)。
大規模言語モデル(LLM)の推論サービングは、計算量よりもメモリによって制約されることが増えている。長コンテキストや長文推論のワークロードが普及するにつれ、キー値(KV)キャッシュがLLMのトークン生成、すなわちデコード中において、メモリフットプリントとメモリトラフィックの両方を支配するようになっている。特に、HBM容量は希少かつ高コストなリソースとなり、推論のバッチサイズとシステムスループットを大きく制限している。本論文は、LLMデコード中に完全なKVキャッシュの格納をHBMから分離することでHBM容量の圧迫を軽減する、メモリ中心のLLM推論システム設計であるOasisKVを提案する。デコード時のアテンションは自然にスパースであるため、OasisKVはアテンション計算のために最も関連性の高いトークンのKVエントリのみをHBMに保持する。我々は、投機的デコード(SD)によって生成される先読みトークンを用いることで、将来重要となるトークンを事前に正確に予測できることを観察した。OasisKVは、重要なKVブロックを特定するための効率的なアテンションのバックグラウンドパイプラインを採用する。それらのブロックは、より大容量のメモリ階層(例えば、ホストメモリやリモートメモリ)からプリフェッチされ、次のデコードステップで使用される前にHBMにステージングされる。 我々はOasisKVをvLLMに基づいて実装した。先読み予測は十分に正確であり、2,048トークンのKV予算の下で、フルアテンションとの精度差を0.7ポイント以内に抑える。これによりOasisKVはスパース性をスループット向上に変換できる:推論ワークロードでは精度損失0.1ポイントで高密度(dense)vLLMの1.69倍、マルチGPUの長コンテキストサービングでは最大2.1倍のスループットを達成する。プリフィル・デコード分離の下では、OasisKVは各リクエストの受け入れに際して、完全なKV転送と比較して6.5〜9.7倍少ないKVで済み、デコードノードのホストメモリを2.2〜2.6倍少なく保持しながら、高密度スループットの約2倍を達成する。
オン・ポリシー蒸留(OPD)は、学生モデルが生成した軌道上で高密度な教師監督を提供するが、標準的な逆KL訓練では、他の妥当な継続候補に十分な確率を割り当てられないことがある。教師エントロピーだけでは、不確実性が少数の妥当な次トークンに集中しているのか、長い確率テールに分散しているのか、また学生がそれらの候補を既に適切に表現しているのかは判別できない。さらに、局所的な教師確率は下流タスクの成功を予測しない場合がある。本稿では、Sparse Probing and Outcome-calibrated Targets OPD(SPOT)を導入する。これは、「どこをプローブするか」と「何を蒸留するか」という2つの結合した決定を、獲得—探索—活用の手順によって扱う。獲得段階では、正規化された教師エントロピー、小さなtop-k候補集合が捕捉する確率質量、および学生と教師のミスマッチを組み合わせた位置レベルのスコアを用いて、限られたプローブ予算を配分する。探索段階では、SPOTは検証器によってスコア付けされた学生の継続生成を通じて、教師が提案する候補を評価する。活用段階では、これらの結果から閉形式のKL正規化ターゲットが得られ、下流の成果がより良い候補を優先しつつ、教師分布に固定されたままでいる。複数の学生モデルと推論ベンチマークにわたる広範な実験により、解の品質とカバレッジのバランスを取りながら推論性能を向上させるSPOTの有効性が実証される。
解釈可能性は、しばしば能力に対する課税として扱われる。言語モデルは不透明なシステムとして訓練され、その後、信頼性を確立することが難しい手法によって事後的に説明される。本研究では、この前提に挑戦する。モデルをリバースエンジニアリングするのではなく、解釈可能性を訓練パイプラインの制約条件とし、言語モデリングの目的関数とともに最適化する。自己回帰型および拡散型の両方の言語モデルにおいて、計算量の3桁にわたって、解釈可能性は能力に反するのではなく、能力とともにスケールする。驚くべきことに、モデルの表現はスケールとともにより分離され、人間が理解可能な概念と整合するようになる。 我々は、因果的アテンションマスクを備えた拡散言語モデルSteerling-8Bを用いて、訓練時の手法を具体化する。Steerling-8Bは、生成された任意のトークン群について、出力を関連する入力トークン、人間が理解可能な概念、および訓練データに帰属させる。これにより閉ループ介入が可能になる。すなわち、出力を、その概念帰属または特徴帰属を通じて診断し、類似する訓練データを取得し、再訓練することなく概念ステアリングで挙動を修正できる。Steerling-8Bは、2〜16倍もの計算量で訓練された公開された同等規模のモデルと競争力を維持しており、異なるスケーリングパラダイムを示唆している。すなわち、解釈可能性は訓練に組み込むことができ、スケールとともに向上するのである。
大規模言語モデル(LLM)は自律エージェントの急速な進歩を牽引してきたが、標準的な評価手法は依然として静的なタスク解決に限定されている。新たな研究フロンティアとして浮上しているのが、ハーネス進化——エージェントが自身の動作ハーネスを自律的に最適化する能力——である。しかし、この能力を体系的にベンチマークすることは依然として困難であり、既存の評価手法は、ハーネスの改善をベースモデルの性能から分離できず、タスク固有の過学習を防止できず、長期的な反復研究を捉えることもできない。これらの課題に対処するため、我々はSearch、Office、Generalエージェント領域におけるモデルの本質的なハーネス進化能力を評価する初のベンチマークであるEvo-Benchを提案する。この能力を厳密に分離するため、Evo-Benchは新規のハーネス誘導型構築フレームワークを採用する。具体的には、補助タスク進化を活用してフレームワークの改善に真に敏感なタスクを特定し、続いて感度認識型層化分割を適用して頑健なクロススイート汎化を保証する。9つのフロンティアモデルおよびオープンウェイトモデルにわたる広範な評価から、トップモデルは最大16.6ポイントの絶対的改善を達成し、最先端の人間設計ベースラインに肉薄することが明らかになった。重要なことに、自律的進化はGeneralタスクにおいて人工ハーネスを上回り、Searchタスクでも優れた性能を発揮する一方、高度に特化した処理フローを要求するOfficeタスクでは苦戦する。さらに、我々の分析は早期飽和などの重大な時間的異常を浮き彫りにするとともに、合成されたハーネスが転移可能性の高い推論構造として機能し、多様なポリシーモデルを一貫して向上させることを実証している。
自己進化型LLMエージェントのための学習ベース記憶システムは、密接に関連する二つの課題に直面している。第一に、軌跡インデックス付き効用はインタラクション履歴に伴って増加し、その結果、限られたフィードバックが拡大し続ける状態空間へと分散される。第二に、軌跡レベルの報酬が同時検索された記憶群に対して一括で割り当てられるため、無関係な経験が誤解を招く効用更新を受け、その結果として記憶-報酬の罠に陥る可能性がある。これらの課題に対処するため、我々は低次元記憶強化学習(RoMeRL)を導入する。これは、結果の極性と記憶ダイナミクスによって因子分解された固定次元のタスクごとの記憶状態を用いて、増大する軌跡インデックス付き効用空間を表現する。RoMeRLは、時間とともに内容が更新または置換される固定集合の意味座標を通じて新しい経験を取り込む。これにより、フィードバックを有界な効用サポート上に集中させる。理論的には、この低次元パラメータ化が各効用座標が受け取る平均フィードバックを増加させることを示し、一般的な座標遷移モデルの下での誤った座標の定常状態占有率を特徴付ける。実験的には、ALFWorldとLifelongAgentBenchにおいて、RoMeRLはタスク性能を向上させ、Cold-Q比を80.0%削減し、フィードバック密度を約6.0倍に増加させ、保持メモリサイズを84.4%削減し、LLM呼び出しを21.1%削減する。これらの結果は、低次元の効用状態が持続的な報酬汚染を制限しつつ、効率的な自己進化型エージェント記憶を実現することを示している。コードは https://github.com/YOUNG-fnxm/RoMeRL で公開されている。
視覚言語モデル(VLM)は、言語的な事前知識、データセットのショートカット、または無関係な視覚的文脈ではなく、具体的な画像エビデンスに基づいて回答すべきである。既存の知覚を考慮したポストトレーニング手法は、グローバルな摂動やアテンションによる代理指標を通じて画像の利用を促進するが、サンプリングされた回答がそれを裏付ける局所的なエビデンスに因果的に依存しているかどうかは検証しない。本稿では、VLMのグラウンディングに対する学習時エビデンス監査であるCounterfactual Evidence Disentanglement(CED)を提案する。CEDは各応答に対して、オブジェクト中心のエビデンス領域を中和し、得られたサポート低下を対応する非エビデンス領域と比較する。我々はこのシグナルをGRPO内で回答の正しさと組み合わせ、ショートカット経路やノイズ経路ではなくエビデンス経路に依存する正解回答を報酬づける。CEDは弱いオブジェクトレベルの候補提案を使用し、質問固有のエビデンスアノテーションを必要とせず、推論時のオーバーヘッドも追加しない。9つの公開ベンチマークと4つのバックボーンにわたって、CEDは既存の強化学習ベースのポストトレーニング手法を上回り、対象を絞った分析によりそのオブジェクト中心のシグナルが検証されている。
汎用報酬モデルはロボット学習のスケーリングにおけるボトルネックとしてますます重要になっているが、大規模な異種コーパスから価値関連能力を学習する方法は依然として十分に研究されていない。既存手法は教師信号を選好や正規化進捗といったタスク内部のアンカーに結び付けており、それらのいずれもエンボディメントやデータソースをまたいでうまく転移しない。我々は、このアンカーを時間的距離(観測から言語指定ゴールまでの有向コスト・トゥ・ゴー)に置き換える、ロボット操作のためのオープンソース価値基盤モデル RynnValue を導入する。時間的距離ラベルはタイムスタンプから直接導出できるため、RynnValue は選好や進捗のアノテーションなしで、7,000時間以上、約300万本の指示条件付きクリップにスケールする。時間的価値学習を大規模に適用しても信頼性があるものにするため、ランダムな時間的サンプリング、時間順序シャッフリング、価値分離アテンションを組み合わせ、予測を失敗や後退に鈍感にしてしまうショートカットを抑制する。選好ラベルなしで学習した RynnValue は、RBM-EVAL-OOD において平均 Kendall's tau_a 0.675 を達成し、完全に選好ラベルで教師された最先端手法(0.655)を上回り、進捗のみの比較モデル(0.292)の2倍以上を達成する。また、未見のタスク、エンボディメント、視点に対してゼロショット汎化する。ポテンシャルベースの報酬整形によって密報酬へ変換すると、実世界での方策成功率はオンラインで52.5%から72.5%へ、オフラインで63.8%から82.5%へ向上する。これらの結果は、時間的距離がスケーラブルな教師信号として、また汎用ロボット方策に対する実用的な報酬インターフェースとして機能することを確立する。
大規模言語モデル(LLM)の急速な進歩に伴い、ハーネスは多様な領域にわたってエージェントを展開するための不可欠な基盤となっている。急速に進化するハーネスエコシステムにより、厳密な能力評価の重要性もますます高まっている。しかし、エンドツーエンドで体系的かつ包括的な評価パイプラインを効率的に構築することは、依然として大きな課題である。この課題に取り組むため、我々はエージェントハーネス向けに設計されたエンドツーエンドの評価エンジンであるA^2E(Agent Auditing Engine)を紹介する。A^2Eは、我々が新たに提案するAgent Task Protocol(ATP)を活用し、異なるハーネスとの評価タスクの迅速な統合を可能にする。自動的に計装されたモニターを通じて、実験中に標準化された実行トレースを捕捉・生成する。評価段階では、A^2Eは多次元メトリクス群を用いてハーネスの能力を体系的に評価する。正しさのみと比較すると、これらのメトリクスは、実行効率、ツール使用、タスク計画、エラー回復におけるハーネス間の差異をよりきめ細かく特徴付ける。A^2Eを用いて実施した実験は、さらに、モデルとハーネスの組み合わせがタスクの種類によって性能に大きなばらつきを示すこと、また、あらゆるタスクにおいて他のすべての組み合わせを一貫して上回る単一の組み合わせは存在しないことを明らかにしている。これらの発見は、体系的な評価の必要性を示すだけでなく、モデルとハーネスの共進化に向けた有用な指針を提供する。我々のコードは https://github.com/datamllab/A2E で入手可能である。
事業運営は、困難な知的作業の一形態である。経営者は、部分的なシグナルから機会を推測し、不確実性の下で資本を投入し、変化する市場における遅延した結果に適応し、合法的に取引する前に規制上の義務を満たさなければならない。最先端のLLMエージェントは複雑なワークフローをますます完了できるようになっているが、既存のエージェントベンチマークではビジネス関連の能力が評価されることはほとんどない。我々は、AIエージェントが長期間にわたって越境ショップを運営し、サプライヤーから仕入れ、バイヤーに販売する、制御された環境であるBusiness Arenaを紹介する。このアリーナは、実際のAlibaba.comの調達データと、信頼できる情報源から較正された市場状況に基づいている。遅延を伴い相互に連動する結果により、個々のビジネス上の意思決定の評価は難しいが、それらの複合的な成果は利益を通じて測定可能である。利益だけではエージェントが成功するか失敗するかの理由を説明できないため、我々はエージェントを人間が設計した戦略と比較して利用可能な機会を推定し、スキルレベルの指標を用いて根底にある長所と短所を明らかにし、実現した利益と損失をそれを生み出した行動に遡って追跡する。我々はメカニズムの除去実験を用いて、優れた結果が、怠慢やシミュレータ固有の近道ではなく、真のビジネス知能を反映していることを立証する。我々は15の最先端モデルを評価し、平均最終純資産に9倍の差があることを見いだした。最良のモデルでさえ人間が設計した戦略に及ばず、LLMエージェントにとって事業運営が依然として困難であることを示している。スキルレベルの分析により、利益率重視のプレミアム販売者から高回転の卸売業者、カスタマーサービス特化型まで、運営スタイルが明らかになる一方、行動レベルの属性分析は、価値を生み出すか破壊する調達、価格設定、回収の意思決定を特定する。総合すると、Business Arenaは、エンドツーエンドのビジネスエージェントを評価するための、現実的で信頼性の高いテストベッドへの第一歩となる。
大規模タクソノミー検索は、入力がすでに対象概念を明示していることを前提とすることが多い。しかし、多くの設定では、入力は間接的証拠にすぎない。例えば、表のセルの意味は、その行、列、データ型、文脈に依存する。我々はこの不一致を検索準備性ギャップ(retrieval readiness gap)と呼ぶ。我々の分析は、現在のインデックスは入力の意味が明示的な場合には対象を確実に検索する一方で、生の証拠はしばしば対象をランキングの深い位置に残すことを示している。そこで我々は、名前付き意味次元にわたって複数の部分解釈を保持するFactorized Hypothesis Search(FHS:因子化仮説検索)を提案する。これらの仮説により、構造化クエリの生成、複数仮説検索、次元レベルの候補検証が可能になる。金融タクソノミータグ付けとCodiEsp臨床コーディングタスクの両方において、FHSは非オラクル手法の中で最高のRecall@1、MRR、最終精度を達成する。因子化仮説経路を自由テキストアンサンブルに置き換えると、上位ランキング性能の低下が最も大きい。一方、逐次精緻化はFHSの強力な並列第1ラウンドに対して追加の利得をもたらさない。
ユーザーシミュレータは、対話型アシスタントの訓練と評価のためのスケーラブルな環境として広く利用されている。次のユーザーターンの生成は本質的に一対多であり、同じプロフィールと対話コンテキストでも、異なる局所的対話意図を持つ複数の妥当な継続が成立し得る。したがって、流暢な応答であっても、修復ではなく受容といった不適切な意図を通じて対話を進めてしまう可能性がある。我々の重要な洞察は、制御可能なユーザーシミュレーションでは、次のユーザーターンが実現すべき局所的対話意図と、その意図が言語でどのように表現されるかを分離すべきだという点である。本稿では、対話意図を各ターンごとの明示的なディレクティブとして公開するUserIDA(User Intent-Directive Alignment)を提案する。UserIDAは、6方向の意図インターフェースを定義し、教師ありファインチューニングを通じてディレクティブ条件付き生成を学習し、グループベースの強化学習において意図較正型ポリシー最適化を用いる。報酬は総合的な応答品質を維持しつつ、混合グループ内で意図に反する候補が意図に適合する代替候補よりも下にランク付けされることを保証する。LMSYS-USPにおいて、UserIDAは86.6%の意図精度を達成し、最強の専用ユーザーシミュレータベースラインを24.3パーセントポイント上回り、意味的・文体的類似性も改善する。コンテキスト内介入においては、評価された対話状態の91.7%で6つの目標意図のうち少なくとも4つを実現し、最強の外部ベースラインの22.9%と対照的である。これらの結果は、ユーザーシミュレーションにおいて、ターン単位の意図制御が応答忠実性を補完する次元であることを示す。
因子分解モデル W = UV^T に対する勾配降下法は、暗黙的に低ランク解へ偏るが、同じ小さな初期化から始まるAdamはそうではない。その違いは、損失のゲージ対称性、すなわち (U, V) → (UQ, VQ) の変換に対する不変性に由来する。勾配流の低ランク機構が最適化器で利用できるのは、その最適化器がゲージ等変である場合に限られる。この条件は転移に必要だが、低ランク回復には十分ではない。勾配降下法、モーメンタム、「共有スカラー」Adam、Muon、Shampooはこれを満たす。Adam、RMSProp、およびその他の座標単位の手法は満たさない。構造定理は、無記憶の等変規則がまさにグラム行列で決まる左プレコンディショナーであることを特徴づけ、転移定理は勾配流の軌道ごとの性質を共有スカラー流へと引き継ぐ。次に、劣決定行列センシングにおける9つの更新規則を、埋め込まれた正解に対する回復誤差によって順位付けする。座標単位から共有スカラーへのプレコンディショニングにわたる一パラメータ族は、バイアスを単調に回復し、異方性が原因であることを特定する。「スペクトルスケジュール」はMuonに関する2つの相反する報告を調和させる。均等レートの更新は低ランク目標を正確に回復するが、スペクトル尾部が成長するにつれてその優位性を失う。トランスフォーマーでは、Adamは最初のステップで2つのゲージ等価な初期化を分離する(このステップでは等変最適化器は浮動小数点精度の範囲で一致したままである)。そして最終的に、ヘッドごとの不変量 W_Q^T W_K は相対フロベニウス距離で56%乖離し、そのギャップはヘッドごとの回転では埋められない。学習損失を一致させた条件下では、2つのハイパースペクトルデータセット上で、勾配降下法は最も低いサンプリング密度およびより低い実効ランクにおいてホールドアウト誤差を43〜44%削減する。したがって、基底の選択はチューニングの細部ではなく、最適化器がどの補間関数を選択するかに関する決定である。
大規模言語モデル(LLM)は、ますますデータ駆動型の推論器として機能しているが、その思考連鎖(Chain-of-Thought, CoT)は、最終的な回答が正しい場合でも不忠実であり得る。既存の「検証」シグナルのほとんどは診断的ではない。すなわち、回答一致は結果のみを観察し、LLM-as-judgeは主観的で検証不可能な批評を提供し、スカラー報酬(例:プロセス報酬モデル(PRM)や報酬モデル(RM))は、多段階の導出がどこで失敗するかについてほとんど洞察を与えない。我々は、推論検証を構造化された障害診断として再構成するニューロシンボリックフレームワークであるSymDiagを提案する。SymDiagは、自然言語のCoTを記号的制約に変換し、ステップレベルの充足可能性/含意関係チェックを実行することで、(i)失敗しているステップを特定し、(ii)反例、不整合の証人、欠落前提の指標を含む検証可能な診断的証拠を生成する。中心的な課題は、見かけ上の「論理違反」が、実際の推論欠陥またはニューラルからシンボリックへの変換ノイズのいずれかによって引き起こされ得ることである。そのためSymDiagは、二重の記号的エンコーディングの整合性チェックを通じて翻訳エラー(TranslationError)と推論エラー(ReasoningError)を分離する自己監査機構(Self-Auditor)を組み込み、部分観測下でのロバストな診断を可能にする。多様な数学的、論理的、科学的、および一般的な推論ベンチマークにおいて、SymDiagは不忠実な推論の検出を改善し、結果のみの検証やLLMベースの判定と比較して、多ラウンドの推論修正に対して著しく効果的なフィードバックを提供し、信頼性が高くスケーラブルな推論診断のための原理に基づく基盤を提供する。
評価シグナルに対して最適化されたシステム向けのベンチマークは、その主張とは異なるものを測定している。本稿では、ホールドアウト汎化ゲートを備えた2つのGPUカーネル最適化スイート、Metal-Sci(科学計算タスク10件)とMetal-ZK(ゼロ知識・暗号タスク12件)において、このことを具体的に示す。これらのスイートでは、3つの最先端LLM(Opus 4.7、Gemini 3.1 Pro、GPT-5.5)が、豊富なフィードバックを伴う(1{+}1)進化的ループ内でMetalカーネルを提案する。どのモデルも敵対的に振る舞うよう指示されてはいないが、採用された勝者たちは繰り返し評価構成をフィンガープリントする。すなわち、実行時パラメータの同一性に基づいて分岐し、測定された分岐を最大限に調整し、測定されない分岐は低速のまま、あるいは黙って誤ったままにしておく。統合したスイート全体では、分布内での勝利53件のうち16件(30%)が、ホールドアウト構成への転移に失敗した。我々はこれらの失敗を、構成フィンガープリントからゲート漏洩に至るまでの4つのモードに分類する。我々は、戦略的最適化下での測定に関する設計指針を抽出する。すなわち、ホールドアウトプローブは枚挙不可能な軸においてのみ有効性を維持し、ゲートは正しさだけでなくホールドアウトパフォーマンスを測定しなければならず、転移率は失敗ごとのメカニズム評価を伴ってのみ解釈可能である。我々の評価は、ゲームされたもの、過学習したもの、良性のものに分解される。
言語モデルを用いた進化的アルゴリズムでは、LLMが(制御フローなどの)構造的要素と連続パラメータを同時に更新する単一のオペレータとして機能する。LLMは前者には優れているが、後者には効率的ではなく、試行錯誤ループ内で離散的なジャンプを行うことでトークンを浪費する。我々はこの問題を解決するために、ハイブリッド入れ子探索を定式化する。外側ループでは、LLMが数値の空欄を伴う構造的スケッチを提案し、内側の数値最適化器がそのスケッチを調整する。外側と内側のソルバーはともに交換可能であり、任意のテキストベースの最適化器は、ゼロ次最適化器(CMA-ES)、勾配ベースの手法、またはMCMCサンプラーと組み合わせることができる。我々は、このフレームワークを3つの科学領域にわたって検証する。(i)閉形式のテスト関数に対するメタ最適化器、(ii)システム研究と社会的ジレンマのためのコードベースのポリシー、(iii)近似ベイズ推論タスク。これら3つすべてにおいて、ハイブリッド最適化器は、バニラのLLM駆動探索と純粋な数値最適化ベースラインの両方よりも優れている。コードは https://github.com/vicgalle/hybrid-nested-search で入手できる。
現代のプラットフォームのユーザーは、最近の対話の要約を繰り返し必要とするが、ウィンドウには、それだけで解釈できるだけの十分な文脈が含まれていることはまれである。我々はこの設定を、固定予算の下で、無限の履歴から選択的メモリを用いて現在のウィンドウを要約しなければならないストリーミング対話要約として定式化する。中心的な課題は、どれだけの履歴にアクセスするかではなく、メモリが現在のウィンドウが前提とする証拠を回復できるかどうかであることを示す。我々は、メモリがギャップを解消する証拠を含むかどうか、また生成された要約がそれを反映しているかどうかを別々に評価するベンチマークと評価プロトコルを構築する。我々は、未解決のウィンドウ依存関係に基づいて検索を条件付け、検索されたチャンクを固定予算の下で証拠密度の高いメモリへと精錬する、欠落証拠メモリフレームワークであるReMEMBERを提案する。最長160Kトークンの履歴を持つ対話に関する実験では、ReMEMBERが同じ予算の下でメモリ構築ベースラインよりもメモリ再現率とギャップ解消の完全性を向上させることが示された。
多言語翻訳ベンチマークは通常、英語で作成され他言語に翻訳され、評価単位として言語ペアを用いる。この設計は、時間の経過とともに汚染されやすく、ロケールや文化的な考慮を見落としがちである。そこで我々はソース対照評価を提唱し、それをFLORESのローカライズ版サブセットであるCultivarとして具体化する。これにより、ロケール固有の翻訳評価が可能になる。ローカライズされていない対応物と組み合わせると、性能の乖離によってデータ汚染とローカライズ堅牢性を調査できる。我々は32のオープンウェイトモデルを評価し、機械翻訳特化モデルは堅牢性が低く、一部のモデルはFLORESに過適合している可能性があり、またモデルは言語に関係なく、他のロケールのコンテンツよりも米国向けコンテンツをうまく翻訳する傾向があることを見いだした。
アーティスト基盤型画像生成には、プロンプトにアーティスト名を付加するだけでは不十分である。画像モデルは、ユーザーが意図したシーンを保持する代わりに、繰り返し登場するモチーフ、画一的なパレット、過剰に顕在化する時代的特徴といった典型的なショートカットを通じてアーティスト名に反応することが多い。本稿では、アーティスト基盤型画像生成のためのショートカット認識型制御状態プランニングフレームワークであるAtelierを提案する。Atelierは、未指定の芸術的意図を、シーンアンカー、保持/変換の決定、スタイルレジーム仮説、役割に紐づいたアーティスト証拠、ショートカット回避制約を分離した明示的な制御状態へと変換する。この状態をアーティストレベルの知識と局所パッチ参照を用いて接地し、バックエンドを考慮した生成プランをコンパイルし、グローバルおよびローカルな真正性フィードバックを通じて候補を反復的に洗練する。さらに、ゴッホと斉白石を対象とし、作品の再レンダリング、時代/スタイル制御生成、歴史的に未見の主題、ショートカット監査、人間の嗜好評価を網羅するベンチマークであるArtIntentBenchを導入する。オープンウェイトおよびクローズドソースの生成器にわたって、Atelierはアーティストレベルのスタイル忠実度を向上させ、ソース構造をより忠実に保持し、プロンプトエンジニアリング、検索拡張、汎用エージェントの各ベースラインと比較してショートカット置換を大幅に削減する。これらの結果は、アーティスト基盤型生成のボトルネックが画像合成だけでなく、明示的で証拠に基づく芸術的制御の上流推論にあることを示唆している。
近年の永続的なパーソナルエージェントフレームワークの進歩により、人間中心のエージェントネットワークは現実的な導入目標となりつつある。各ユーザーは、ユーザーに代わって行動し、状態を保持し、社会的・タスク関係を通じて他のエージェントと通信するAIエージェントの支援を受けることができる。このようなネットワークでは、日常的なツール利用は、個人ワークスペース上でのマルチパーティ所有エージェントコラボレーションとなり、ファイル、記録、ツール、ポリシーは所有者間で直接は見えない。既存のエージェントベンチマークはツール利用とコラボレーションを研究しているが、現実的なユーザーデジタルワークスペースを備えた検証可能なクロスユーザーエージェントコラボレーションのためのエンドツーエンドのサンドボックスを提供しておらず、また、有害な行動が人間中心のエージェントネットワークを通じてどのように伝播するかをテストしていない。我々は、個人ワークスペース上でのマルチパーティ所有エージェントコラボレーションのための監査可能なベンチマークおよびランタイムサンドボックスであるWeClawArenaを紹介する。WeClawArenaは、個人ワークスペースが運用ツールと個人の制約の両方として機能する協調的ツール利用タスクを対象とする。このベンチマークは、6つのクロスユーザータスクドメインにわたる124の基本タスクを含み、基本タスクごとに1つの良性コントロールと4つの攻撃ベクトルバリアントを備え、それらを620のシナリオバリアントに拡張する。サンドボックスは、ピアメッセージ、ツール呼び出し、リソース操作、ガバナンスによる決定、および最終ワークスペース状態を記録する。WeClawArenaは、ユーティリティと攻撃成功率を別々に報告し、有界な実行時証拠から攻撃成功を監査することで、タスク破綻、プライバシー漏洩、汚染された証拠、無効な権限パスの診断を支援する。
マルチモーダル大規模言語モデル(MLLMs)は、多様な視覚言語タスクにおいて高い性能を達成しているが、不完全またはシフトした文脈の下ではしばしば失敗する。信頼性の高いMLLMは、主題レベルの文脈シフトを伴う真に文脈外(OOC)の質問には回答を拒否すべきであり、一方で非主題の文脈シフトを伴うシフトした文脈内(Shifted IC)の質問には引き続き回答すべきである。既存のベンチマークは主にOOCまたは視覚的に回答不可能な質問に焦点を当てているが、回答可能なShifted ICケースを見落としており、扱っているOOCシフトも限定的である。このギャップを埋めるため、我々はMLLMの拒否能力と頑健な回答能力を評価するための大規模ベンチマークであるMMOOCを提案する。MMOOCは、回答可能なShifted ICケースと回答不可能なOOCケースを含む41,000以上の画像・質問ペアから構成され、3つの質問形式、8つのシフトタイプ、6つの視覚シナリオにわたり、データ品質はMLLMベースのフィルタリングと人間による検証を通じて確保されている。我々は、AccuracyとRefusal Rateを用いてモデルの応答を評価し、さらにモデルの推論の正しさを評価するためのLLM-as-a-Judgeメトリクスを導入する。多様なMLLMに対する実験により、現在のモデルはシフトした文脈の下で回答可能性と拒否のバランスを取ることに依然として苦戦していることが示される。さらに、主要な失敗パターンを分析し、ポストトレーニングが頑健性を向上させ得ることを示す。MMOOCは公開される予定である。
近年のビデオ拡散モデル(VDM)の進歩により、高忠実度のビデオ合成が可能になった。しかし、鏡の反射の生成は、鏡内のコンテンツが周囲のシーンと一貫性を保つ必要があるため、依然として困難である。既存のVDMはシーンと鏡の関係をモデル化するように特別に設計されていないため、誤った内容や空間配置の不整合を伴う反射が生成される可能性がある。我々は、鏡の反射生成には、どのシーンコンテンツを反射するかを決定することと、反射コンテンツを鏡領域内でどのように空間配置するかという、2つの相補的な課題が含まれることを観察した。この観察に基づき、我々は生成中にシーンと鏡の関係をモデル化する反射認識型ビデオインペインティングフレームワークであるMirrorWorldを提案する。 具体的には、意味的関係の蒸留(SRD)を導入する。これは、凍結された視覚基盤モデルから関係情報を転送し、可視シーンコンテンツと鏡領域の間の意味的関連付けを促進する。さらに、幾何学的変換の整合(GTA)を提案する。これは、反射コンテンツの空間配置を導く変換を学習する。これら2つの要素は補完的な役割を果たし、SRDは「何を反射すべきか」をモデル化し、GTAは「どのように配置すべきか」をモデル化する。この問題に関する研究を促進するため、既存の4つのビデオ鏡データセットを統一された反射再構成タスクに転用することで、ビデオ鏡反射生成のためのベンチマークを構築する。実験結果は、MirrorWorldが代表的な画像ベースの反射生成手法や強力なビデオインペインティングベースラインよりも優れた反射再構成品質を達成することを示している。
大規模言語モデルを新しいデータでファインチューニングすると、以前に学習した内容が劣化する。我々は、重み行列だけから計算されるドロップイン型ペナルティであるOmega-Sを提案する。これは、以前のタスクのデータもフィッシャー行列も、旧重みの保存コピーも必要としない。既存の訓練ループに3行追加するだけで、1ステップあたりのコストを4%未満しか増加させない。 保持性能。Llama-3-8B と LoRA を用い、コードから散文へファインチューニングし、HumanEval で10個のシードにわたって評価したところ、Omega-S は10シード中9シードで無正則化よりも元の能力を保持した(pass@1 絶対値で 0.173→0.238、符号検定(片側)p=0.011、ウィルコクソン符号順位検定 p=0.006)。保持率としては 62.9%→84.1% である。また、調整済みの重み減衰には10シード中10シードで勝ち(p=0.002)、調整済み EWC には10シード中8シードで勝った(p=0.014)。すべての比較条件は同一セッション内で再測定された。 メカニズム:主張ではなく計測。Omega-S は構成上は位相的であり、その目的関数は Tr(A^3) から構築されている。しかし我々は、その4つの因子のうち実際に変化するのはどれかを計測し、3つは動かないことを確認した。それらの重みに対する弾性は 1e-4 以下であり、一方で次数分散項は 9e-3 である。実装上、この複合項はノード次数の分散に対するペナルティに帰着する。これは、正方モジュールでは行の大きさを、非正方モジュールでは方向の整列を罰することを意味する。名前が約束するものと勾配が行うことが異なる手法は、そのことを明示すべきであるため、我々はこれを報告する。また、設計どおりに機能するにもかかわらず10シードすべてで保持性能を悪化させる、コントラスト保存型の構成を含む、未解決の設計上の選択肢も列挙する。 同一の構成、同一シード、同一ハードウェアで繰り返すと、保持率の標準偏差は 0.104 となる。この値が言語モデルの低ランクファインチューニングについて定量化された例は我々の知る限りなく、これは本分野の(我々のものを含む)すべてのシード対応比較を制約する。 コード、シードごとの結果、および否定的結果の完全な記録は入手可能である。
視覚言語グラウンディングは言語と視覚コンテンツを結び付けるが、既存の定式化のほとんどは、グラウンディングを単方向の位置特定問題に還元している。すなわち、事前に指定されたテキストフレーズやカテゴリ名が与えられたとき、対応する画像領域を特定するというものである。この設定は、関連する言語単位が既に分かっていることを前提としており、接地されたコミュニケーションにおけるより基本的な課題、すなわちテキストのどの部分が視覚的に参照され、それらが画像内のエンティティとどのように対応するのかを決定する問題を見落としている。 我々は、グラウンディングを画像・テキストペア間の双方向的概念対応として定式化する。画像とそれに対応するテキストが与えられたとき、目的は、関連するテキストスパンが提供されているとは仮定せずに、視覚的に参照されるテキストスパンとインスタンスレベルの画像セグメントとの間のすべての対応を復元することである。この定式化は、テキストセグメンテーション、画像セグメンテーション、クロスモーダルな対応付けを単一の対応予測問題として扱うことで、フレーズグラウンディング、参照表現グラウンディング、オープンボキャブラリ検出を含む一般的なグラウンディングタスクを統合する。 このタスクに取り組むため、我々は事前学習済み視覚言語モデルの上に構築されたグラウンディングモデルConCor-1を導入する。ConCor-1は、学習可能なブリッジトークンを用いて候補となる画像・テキスト間の対応を表現し、各トークンに対してテキストマスク、画像マスク、対応存在スコアを予測する。このタスクを訓練・評価するために、多様なグラウンディングおよびセグメンテーションデータセットを統一された対応形式に変換する。実験により、ConCor-1はベースラインを一貫して上回り、長文キャプションデータセットでは対応F1を48%改善し、ゼロショットLVISでは29%改善した。ここで、LVISの大規模カテゴリリストはテキスト入力として機能する。
我々は、実環境でのエゴセントリックデータ収集のための、オープンハードウェアで低コストなヘッドマウント型ステレオ慣性キャプチャデバイスEgo-OSCARを提案する。Ego-OSCARは、ハードウェア同期されたグローバルシャッター方式のステレオカメラを、6軸IMU、デバイス上でビデオエンコードを行う組み込みLinux SBC、そしてユーザーフィードバックとウォッチドッグ機能のためのリアルタイムマイクロコントローラと組み合わせる。完全な部品表(BOM)は、市販部品と3Dプリント部品のみを使用し、1ユニットあたり200米ドル未満である。デバイスに加えて、我々は完全なソフトウェアスタック(ハードウェアアクセラレーション対応の録画パイプライン、IMUサンプリングデーモン、時刻同期ツール、ウォッチドッグファームウェア)と、分散した貢献者ネットワークが日常的な屋内環境で収集した、同期IMU付きのカメラあたり約550時間のエゴセントリックステレオビデオを公開する。この公開データは生データではなく注釈付きである。すなわち、自由形式の行動キャプションがオープン語彙で記録されたタイムラインのほぼ全体をカバーし、フレームごとの3Dハンド再構成がセッションごとのステレオキャリブレーションとともに提供される。Ego-OSCARは、Project Ariaのような研究用システムのユニットごとの忠実度に匹敵することを目的としているわけではない。その目的は、クラウドソーシングによるエゴセントリックデータ収集のための最も安価で妥当な基盤となり、大規模にエゴセントリックデータを収集したいあらゆるチームにとっての活性化エネルギーを下げることである。すべてのハードウェア設計、ソフトウェア、データセットはオープンソースとして公開される。
リアルタイム対話型仮想環境において認知能力を備えた具現化された知的仮想エージェント(IVA)の開発は、今日の技術的進歩をもってしても依然として課題である。既存のアーキテクチャは、商業用ゲームエンジンに制約された低レベルの反応制御システムの実装に重点を置くか、あるいは仮想世界への実装が困難な高レベルの推論モデル表現に焦点を当てるかのいずれかであることが多い。本稿はこの認識に基づき、具現化されたIVAを展開するためのモジュール式認知アーキテクチャを提案する。本アーキテクチャは、Sense-Think-Actパラダイムや信念-欲求-意図(BDI)認知モデルといった既存の確立された枠組みを基盤とし、インタラクティブな3DコンピューティングシステムにおいてIVAの「頭脳」を展開するための再利用可能な実装指向フレームワークを提供することを目的とする。提案するアーキテクチャは、認知能力を備えた具現化されたIVAを展開するためのモジュール式かつ実装指向のフレームワークを提供し、高レベルのエージェント推論モデルとリアルタイムの具現化された実行との間のギャップを橋渡しすることで、複雑なインタラクティブ仮想環境におけるスケーラブルで適応的、かつ説明可能なエージェントを実現するという貢献をする。
Transformerにおける位置埋め込み(PE)は、トークン間の距離と順序を符号化するが、構文構造に対してはほとんど考慮しない。本稿では、構文情報を組み込んだ位置埋め込み(SiPE)を提案する。SiPEは、事前学習中に依存関係解析から軽量な構文事前分布を学習し、それを絶対・相対・回転という主要な3種類のPEファミリーすべてに対して、エンコーダとデコーダの両方に注入する。自己注意機構やその他のアーキテクチャは変更しない。我々は、事前分布をモデルのどこにどのように導入すべきかを特定し、それがアーキテクチャに依存することを見いだした。すなわち、相対PEを用いる自己回帰デコーダでは、事前分布を注意スコアの相対位置項に乗算で結合した場合に最も効果が高く、入力埋め込みへの注入、自己注意への注入、位置項と注意項の両方への同時注入よりも優れている。一方、エンコーダでは、事前分布を入力埋め込みに直接加算し、各エンコーダ固有の位置機構と組み合わせるのが最適である。SiPEを用いて事前学習したモデルは、構文監督なしのベースモデルと比較して、SyntaxGymベンチマークで最大10.3%向上し、同時にパープレキシティを9.0%低減する。これは、既存の構文注入手法のほとんどがむしろ悪化させる指標である。重要なことに、これらの改善は構文一般化を超えて及ぶ。SiPEは実世界の言語理解も向上させ、SiPEなしで学習したモデルと比較してGLUEベンチマークのスコアを最大8.2%引き上げる。推論時に多数の構文木を周辺化したり、実行時に構文を破棄する既存の構文言語モデルとは異なり、SiPEは単一の構文木に条件付けを行い、構文監督と推論コストの間に新たなパレート最前線を確立する。