翻訳付きの日次キュレーションされたAI研究論文
Mixture-of-Experts(MoE)アーキテクチャは、計算コストを比例的に増加させることなくモデル容量を大幅に拡張する。しかし、モデルサイズとトークン予算の両方が極端に大きいスケールにおいて、スイープによるハイパーパラメータ(特に学習率)の最適化は計算上実行不可能である。本論文では、計算効率の高い2段階のハイパーパラメータ転移フレームワークを提案する。このフレームワークは、モデル幅のスケーリングにわたって大規模MoEモデルの訓練に最適な学習率を転移させ、その後、数兆トークンの学習期間へ外挿することで最適学習率を推定する。第一に、Multi-head Latent Attention(MLA)とMuonオプティマイザを活用するMoEアーキテクチャに対する最大更新パラメータ化(μP)の適応を定式化し、最適な学習率が幅スケーリングモデル間で一貫して転移することを実証する。第二に、予測的スケーリング法則を確立することで、この転移可能性をトークン次元に沿って拡張する。限られた予算で小規模プロキシモデルから導出された最適値に線形回帰を適用することにより、大規模な訓練期間(例:10兆トークン)に対する理想的な学習率を高い精度(R²=0.95)で外挿することに成功する。このことから、小規模モデルによるプロキシ訓練が、大規模MoEの大規模訓練に必要な最適学習率を決定するのに十分であることが示される。提案手法を基礎モデル(総パラメータ155B、活性パラメータ17B)のスクラッチからの事前学習に適用し、安定した訓練および評価結果により、フルスケールのターゲットモデルに対する最適設定が最小限のアブレーションコストで正確に予測可能であることを検証する。
大規模な事前学習済みモデルの登場により、既存手法は指示ベースのビデオ編集を効果的に改善してきた。しかし、そのほとんどはインプレース編集の前提に依存している。すなわち、固定された時間スパンにわたって、編集後のビデオを与えられたソースクリップとフレームごとに位置合わせする。この方式は、終わりのないストリーム(例えば、ライブゲームのスタイル変更や進行中のショットへのカメラ移動の適用)では機能しない。そのような場合、編集は静的な入力クリップに適用されるのではなく、到着する将来のフレームにも拡張されなければならない。本論文では、この設定を研究し、これを無限ビデオ編集(infinite video editing)と呼ぶ。すなわち、先行セグメントと編集要求が与えられたとき、モデルは要求された編集を適用しながらストリームを継続する次のセグメントを生成しなければならない。このプロセスは、無制限の編集指示列が到着するにつれて繰り返される。このタスクには2つの課題がある。編集はフレーム単位の書き換えではなく、忠実な継続でなければならないことと、編集が蓄積されるにつれて生成品質が安定していなければならないことである。これらの課題に対処するため、まず無限ビデオ編集のためのデータ収集パイプラインを設計する。収集したデータに基づき、ストリーミングビデオ生成器に無制限の編集能力を付与する軽量な編集アダプタであるInfinityEditを提案する。このアダプタは3つのアテンションモジュールを含む。履歴クロスアテンションは、入力フレームを用いてデノイジングフレームを導く。時間的因果自己注意は、時間的手がかりが前のフレームから後のフレームへと一方向にのみ流れるようにする。編集クロスアテンションは、編集要求を生成プロセスに注入する。推論時、アダプタは編集要求が到着したチャンクでのみ活性化される。後続のチャンクは、リセットされたアンカーフレームを用いて元のモデルによって生成される。この方式により、元のモデルの無限生成能力を維持しながら編集を適用できる。広範な実験により、InfinityEditは各編集のもとでストリームを忠実に継続し、無制限の編集シーケンスにわたって安定した動作を維持することが示された。
大規模言語モデル(LLM)は、言語生成器から、複雑で長期的なタスクを実行できる自律エージェントへと進化してきた。この進化により、モデルの能力を引き出すプロンプトエンジニアリング、情報アクセスを管理するコンテキストエンジニアリング、外部ツールとリソースを組織化するハーネスエンジニアリング、継続的な振り返りと自己改善を支援するループエンジニアリングといったパラダイムが生み出されてきた。しかし、タスクが複雑化するにつれ、個々のエージェントの知能には根本的な限界が存在する。多くのタスクは、異種の専門知識、相互依存するサブタスク、並列実行、独立検証、および永続状態を必要とし、これは単一エージェントの組織能力を超えている。単一エージェントの能力やコンテキストを拡張しても、このアーキテクチャ上の不一致を解決することはできず、知能はむしろ専門化されたエージェント群に分散され、システムレベルで組織化されなければならない。我々はこれをシステムインテリジェンスと呼ぶ。すなわち、エージェントシステムが複数のインテリジェントな構成要素を組織化し、共有目標を追求する、一貫性のある適応的な全体へと調整する能力である。これを実現するには、エージェントを追加するだけでは不十分であり、作業を組織化し、異種エージェントを調整し、進化する実行状態を維持するための明示的な構造が必要である。我々は、次世代エージェントシステムのための新興パラダイムとしてグラフエンジニアリングを導入する。個々の相互作用やエージェントレベルの行動を主に最適化する従来のパラダイムとは異なり、グラフエンジニアリングは、タスク、エージェント、およびシステム状態を表す明示的かつ動的で進化するグラフ構造を構築する。これらの抽象化は、複雑な目的の整理、異種エージェントのオーケストレーション、システムダイナミクスのモデル化、およびスケーラブルなエージェント進化を可能にする統一的な基盤を提供する。我々は、LLMエージェントのためのグラフエンジニアリングの原理、方法論、および応用を体系的にレビューする。関連論文、オープンソースデータ、およびプロジェクトは https://github.com/DEEP-JLU/Awesome-Graph-Engineering に収集されている。
近年のオムニモーダル大規模言語モデル(Omni-LLM)は、環境を継続的に認識し、ユーザーを特定の目標達成へ導くリアルタイムビデオアシスタントとして大きな可能性を示している。従来の受動的なビデオ理解とは異なり、対話型アシスタントは視覚的状態、ユーザーの目標、事前知識を能動的に組み合わせて効果的な支援を提供すべきである。この評価は極めて困難である。なぜなら、モデルの予測不能な応答によってユーザーのその後の行動が動的に変化するため、静的なオフラインデータセットでは対応できないからである。このボトルネックに対処するため、我々はOmniAssistBenchを導入する。同一のユーザー目標が様々な方法で達成され得るという対話経路の分岐問題を解決するため、我々はモデルにソースビデオから導出された事前定義の事前知識を提供し、ユーザーを正確に同一経路に沿って導くことを要求する。実際の対話ビデオは稀少であるため、我々は既存のインターネットビデオをリバースエンジニアリングしてデータセットを構築した。我々は論理的なユーザー目標を推定し、ビデオをマルチターンのクリップ群に分割して連続的な対話を模擬した。この厳密なパイプラインには、データセット構築に1000時間以上の専門家工数を要した。実験結果によると、専有モデルのGemini-3-Proは最高点100点中66.4点に達したのに対し、オープンソースのQwen3-Omni-Instructは51.2点を達成した。現在のモデルはユーザーの入力を概ね理解しているものの、誤ったまたは不完全な回答を頻繁に提供する。具体的には、視覚的プロンプト(例:手のジェスチャー)に苦慮し、マルチターン対話中に履歴コンテキストを維持できず、対象イベントまで応答を遅延させることができない。これらの結果は、モデルが信頼性の高いアシスタントとなるまでに、依然として大きな改善の余地があることを示している。
並列推論は、複数の解法経路を探索することで大規模推論モデルの精度とロバスト性を向上させるが、その計算コストは推論の深さとブランチ数に応じて増大する。こうした並列経路を管理する既存手法は、通常、最終回答のコンセンサス、局所的なトークン信頼度、または独立した中間プローブに依存している。しかし、これらのシグナルは、しばしば遅れて得られたり、実際の推論の進捗との関連が弱かったり、動的なブランチレベルの制御にはノイズが多すぎたりする。これらの制限に対処するため、我々はParaTempoを提案する。これはトレーニング不要の非同期並列推論フレームワークである。ParaTempoは、回答空間の収束を測るブランチ局所的な尺度である時間的信頼度によって駆動される。各ブランチは、暫定的な回答確率分布を取得するために定期的にプローブされ、時間的信頼度は、最近の中間プローブが支配的な回答にどの程度鋭く集中しているかを定量化する。十分な証拠が蓄積されると、ParaTempoはこの単一のシグナルに基づいて制御プロセス全体を駆動する。すなわち、低信頼度のブランチは枝刈りされ、支配的な回答にコミットし続けるブランチは早期に終了され、解放された計算リソースは新しいブランチをフォークすることで再割り当てされ、信頼度重み付き投票が集中すると、生成は全体として停止する。推論軌跡間の同期を必要とせず、ParaTempoはブランチレベルの収束に基づいて計算を適応的に割り当てる。挑戦的な数学・科学推論ベンチマークでの実験により、ParaTempoは競争力のある精度を維持しながら、平均レイテンシを21.8~32.2%、総トークン使用量を18.1~30.3%削減することが示された。さらに、時間的信頼度は、トークンレベルおよび瞬間的なシグナルよりも、将来のブランチ収束に対して強い時間的安定性と予測力を示す。
ハイブリッド思考マルチモーダル大規模言語モデル(MLLMs)は、単一のモデルが熟慮的思考と低遅延の非思考推論を切り替えることを可能にする。これらのモードは推論予算が異なるものの、生成される応答は同じユーザー向け基準を満たすべきである。応答品質は正しさのみでは特徴づけられない可能性があるため、我々はタスク精度と応答パターンの失敗を相補的な成果として評価する。我々はこのギャップを応答パターンの整合性を通じて研究する:すなわち、思考インターフェースと非思考インターフェースが許容可能な最終応答の振る舞いを維持するかどうかである。我々はPatternEvalを紹介する。これは、視覚知覚とグラウンディング、構造化画像理解、マルチモーダル知識推論にわたる2,415のマルチモーダルプロンプトから構成される、失敗事例を豊富に含む診断ベンチマークである。PatternEvalは、思考連鎖の漏出、応答の繰り返し、論理的矛盾、パフォーマティブ推論という4つの反復的失敗を検証する。応答パターンの失敗は異なる提供元のモデルに広く見られ、非思考推論は著しく高い失敗率を示し、これにより思考インターフェースと非思考インターフェースの間に系統的な不整合が生じる。この診断に動機づけられ、我々は応答レベルの報酬モデルであるPatternRMと、強化学習中にパターン固有のペナルティを導入するPatternRLを開発する。Qwen3-VL-4BとQwen3-VL-8Bを用いた実験は、パターン固有のペナルティを強化学習に組み込むことで、わずかなタスク性能のトレードオフを伴いつつ、モード間の不整合を軽減できることを示す。合わせて、PatternEvalとPatternRLは、ハイブリッド思考インターフェース間でユーザーに可視な応答パターンを整合させるための評価・訓練フレームワークを提供する。
オン方策蒸留(OPD)は,生徒自身の方策からサンプリングされた軌跡を教師信号として用いることで教師の能力を転移する.しかし,その汎化挙動は十分に理解されていない.なぜなら,ほとんどの研究が単一のドメインおよび訓練データに近いベンチマーク上でOPDを評価しているからである.本稿では,ドメイン内の分布シフトからクロスドメイン転移,複数教師設定に至るまで,一度に一つの汎化要因を変化させる制御実験を行う.我々は,OPDが特定の問題に対する教師の解答ではなく,教師の推論行動を転移することを見いだした.すなわち,訓練の難易度はほとんど重要ではなく,教師が解いたことのない問題でさえ有用である.転移は教師と生徒の出自関係に強く依存する.同じ出自のペアでは,言語,推論の長さ,さらには他のドメインにわたって生徒は教師に近づく一方,異なる出自のペアは主に訓練分布に適合する.この広い到達範囲は諸刃の剣である.プロンプトをドメイン専門家にルーティングしても各教師の影響を限定できないため,それらを組み合わせると,その能力間で混合比に依存したシーソー現象が生じる.これらの結果は,OPDがいつ汎化するかを明確にし,複数教師OPDを診断するための有用な視点を提供する.
実世界の画像検索クエリはマルチモーダルかつ構成的である。「このシャツをピンクで探して」は、保持すべきエンティティ、変更すべき属性、無視すべきコンテキストを指定する。しかし既存の再ランカーは、そのような多面的な関連性を不透明な埋め込みに圧縮するか、自由形式の思考連鎖に依存するかのいずれかであり、細粒度の制約を容易に省略または幻覚してしまう。我々はNLPにおけるルーブリックおよびチェックリストに基づく評価を援用し、マルチモーダル画像再ランキングを意味的制約充足問題として再構成してEviRankを提案する。EviRankは任意のクエリ(テキストのみ、画像のみ、または複合)を統一的エビデンスパッケージに解析する。すなわち、6つの意味スロット(例:エンティティ、属性、関係)にわたる型付き基準であり、各基準は必須、禁止、無視可能のいずれかにラベル付けされる。再ランキングはその後、エビデンス条件付き検証に帰着し、決定論的ルーブリックスコアリングとエビデンスに基づくリストワイズ比較を単一の学習不要手順で組み合わせる。明示的なエビデンスは、軽量な学生モデルをオプションで蒸留するための構造化された監督としてもさらに機能する。テキストから画像、画像から画像、複合画像検索にわたる5つのベンチマーク全体で、EviRankは最先端の性能を達成し、蒸留された学生モデルは教師モデルの能力の90%以上を大幅に低いコストで保持する。
セマンティック視覚エンコーダは、マルチモーダル理解と画像生成におけるセマンティック条件付けの中心的な視覚インターフェースとなっている。しかし、その最終トークンは細かい視覚的詳細を捨て去るため、ピクセル再構成が不十分となり、画像生成や編集といった再構成が重要なタスクでの利用が制限される。本研究では、理解・生成・編集を、事前学習済みセマンティックViTから構築された単一の視覚表現空間内でモデル化できるかを問う。セマンティックViTの凍結されたTransformerブロックは、本質的に視覚的詳細を保持できないわけではないことを示す。むしろ、元のパッチパラメータ化が表現を意味的抽象化へと導き、最終トークンから細粒度情報を復元することを困難にしているのである。この観察に基づき、パッチ再パラメータ化を導入する。これは、元のセマンティック経路を保持しつつ、同じ凍結されたViTブロックに細粒度の視覚情報を提供する再構成対応パッチ埋め込みを追加するものである。結果として得られる統一表現は、マルチモーダル理解を維持しながら、高忠実度の画像再構成と良好な再構成-生成トレードオフを可能にする。さらに、この表現をUniSpaceへとスケールする。UniSpaceは、独立したVAE経路を持たずに、同じ視覚空間内で理解・生成・編集を行う8BのMixture-of-Transformer-Expertsモデルである。システムレベルの評価は、実用的なテキストから画像への生成と指示ベースの画像編集を示しており、再パラメータ化された事前学習済みViTが、スケーラブルなマルチモーダルモデリングのための統一的な視覚インターフェースとして機能できることを実証している。
学習不要のブロックスパースアテンションはビデオトランスフォーマーを高速化できるが、行方向のアテンション集中それ自体は実行可能なスパース演算子を指定するものではない。ブロックルートを共有するクエリはサポートの重複が乏しい場合があり、一方で保持されるアテンション質量だけでは、スキップされた相互作用によるソフトマックス後誤差は決定されない。我々は、分割の幾何構造が、プールされたサポートと、スパース出力からの残差の予測可能性の両方に影響することを示す。我々は、応答結合分割とプローブ適合残差再構成を組み合わせたSparsePRを導入する。サンプリングされたクエリのキー応答は対になったK/Vグループを形成し、その重心が共有ルーティングのためのクエリ応答座標を誘導する。次に、少数の厳密なクエリ行が、プローブ残差で観測された出力部分空間内で、スパース出力からの呼び出し固有のアフィン補正を較正する。4つの異種のビデオ生成およびワールドモデルにわたり、SparsePRは一貫してアテンション再構成誤差を低減する。アブレーションは、この低減の大部分をプローブ適合が説明する一方、応答結合分割がハードドロップ誤差を低減し、有限のプローブ予算の下で再構成を改善することを示す。SparsePRは、22.0〜26.0%の実現された実行ペア密度で生成品質を維持しつつ、1.48倍〜2.61倍のエンドツーエンドの高速化を達成する。プロジェクトページ: https://pardistaghavi.github.io/SparsePR-website/
エージェントは環境との相互作用を通じて行動を学習するが、訓練に使用される環境は多くの場合、事前定義されたタスクやベンチマークを中心に手作業で構築または合成される。このタスク中心のパラダイムでは、多様なタスクが基盤となる世界から自然に創発し得る現実的かつ進化的なワークフローを反映した環境をスケーラブルに構築することが困難である。本稿では、高レベルのビジネスシナリオから実行可能な環境を合成するためのスケーラブルなフレームワークであるAgentMercuryを提案する。AgentMercuryは特定のタスクのために環境を構築するのではなく、まずエンティティ、サービス、ツール、状態、および実行可能なサービス間不変条件を備えた永続的な世界をインスタンス化し、そこから多様なタスクと相互作用の軌跡が続いて創発することを可能にする。我々は14産業・50カ国にわたる4,783の実行可能な環境を構築し、それらを強化学習の訓練基盤として使用した。評価ベンチマークを対象とせずに生成されたにもかかわらず、これらのビジネス指向環境で訓練された方策は、エンタープライズワークフローと、推論・コーディング・科学計算・ツール使用を網羅する領域外ベンチマークの両方において大幅に向上した。実験では、Qwen3.5-4BはAgentMercury環境での訓練後に、EnterpriseOps-GYMにおいて12.3から15.7へ、AIME26において45.9から56.0へ改善した。さらに、構築プロセス自体が学習可能であることを示す。すなわち、Qwen3.5-35B-A3Bを構築トレースでファインチューニングすることにより、未見のビジネスシナリオにおける実行可能な世界の作成成功率が3.3%から83.3%に向上した。これらの結果は、シナリオに基盤を置く環境が、ベンチマーク特化型の訓練を超えた有用かつ一般化可能な学習シグナルを提供できること、またその構築自体が学習可能な能力となり得ることを示している。
視覚言語モデル(VLM)をモバイルデバイスに展開することは、多大なメモリと計算リソースを必要とするため困難である。我々は、リソースが制約されたハードウェア上で効率的な推論を実現するためのVLM量子化フレームワークを提案する。本手法は、モデル自身を用いてトレーニングデータを生成し、トレーニング設定へのアクセスを必要としない量子化パイプラインと、Arm CPU上での効率的な実行をサポートする新規の2.7ビット/パラメータ形式を組み合わせる。本手法を検証するため、Llama 3.2 11B Vision Instructモデルを8ビットのアクティベーションを用いて3.7 GBに圧縮し、標準的な視覚質問応答タスク群において高い性能を維持することを確認した。
小規模言語モデルは通常、大規模モデルと同様に構築したあとでCPUに押し込む。我々は逆のアプローチをとった。まずターゲットを固定した。すなわち、一度に1ユーザー、1トークン、4ビット重み、通常のCPUという条件を先に定め、それに適合するアーキテクチャを選んだ。その結果、18ブロックのうち6ブロックのみが完全なアテンションを保持する。残りの12ブロックは、会話がどれだけ長くなってもメモリ幅が2タイムステップ分しかない短い畳み込みを使用する。したがって、ネットワークの3分の2は増え続けるキャッシュを再読み込みしない。 59.9Bトークンでゼロから学習した本モデルは、学習開始前に固定された基準値42.20に対して、5タスクのベンチマークで47.31を達成した。これは、3倍から6倍多いデータで学習されたGPT-2 124M、Pythia-160M、OPT-125M、GPT-neo-125Mを上回り、1兆トークンを学習したMobileLLM-125Mの公表スコアをも凌駕する。検証ビット/バイトは0.8685である。 学習レシピではなくアーキテクチャを検証するため、同じデータ・同じサイズの従来型の全アテンションモデルを学習し、どちらを評価する前に勝利条件を書き留めた。ハイブリッドモデルは選択した品質指標で0.81%勝利し、下流タスクでは同等の結果を示し、4ビットファイルは6.3%小さくなり、コンテキスト2048トークンでのデコード速度は1.76倍、類似サイズの外部モデルに対しては2.08倍速かった。すべての測定において、速度優位性は空のコンテキストではほぼゼロであり、長さとともに増加する。これはこのメカニズムが予測するとおりであり、単に軽量なモデルでは示されない。単純な帯域幅計算では1.17倍しか予測されないため、メモリ量だけではこの差は説明できない。 また、機能しなかった点も報告する。4ビット化による品質コストが軽減されなかったこと、畳み込みチャネルのおよそ半分が結果的に不活性となり除去不可能であること、そしてこのモデルサイズに見合わない大きな語彙である。
本稿では、アクションフローに条件付けられた汎用世界モデルHydra-0を紹介する。Hydra-0はロボットの動作をピクセル運動として表現する。この共有視覚インターフェースにより、ロボット形態、タスク、環境、ビデオ生成バックボーンにわたって動作の結果を学習することで、汎用的な世界モデリングと制御が可能になる。最良構成では、アクション条件付きベースラインと比較して、ロボット運動誤差を90.4%、物体運動誤差を60.2%低減し、同時にゼロショット合成とデータ効率的な適応を実現する。RoboLabベンチマークでは、Hydra-0は再生成功率と参照成功率の間でピアソン相関 r=0.96 を達成する。最後に、このインターフェースの創発的な逆モードを明らかにする。すなわち、人間のデモンストレーションから転移された所望の物体フローから整合的なロボット運動を予測する世界行動モデルである。訓練されたアクションヘッドは、得られた潜在特徴を、タスク固有の専門家ロボットデモンストレーションを必要とせずに実行可能な動作へとマッピングする。これらの結果は総合すると、アクションフローが、異種の学習データ、オープンループ方策評価、ロボット制御を結びつける共有制御インターフェースとしての可能性を示している。
人間中心の知能は、基盤モデルの時代において進化を遂げており、スケール、転移可能性、汎用モデリングへの関心が高まっています。しかしながら、人間中心の知能は基盤モデルと完全には統合されておらず、基盤モデルに見られるような同等の進歩を達成するには至っていません。さらに重要なことに、この広範な研究領域における近年の進展は、タスク、モダリティ、研究コミュニティの間で断片化されたままであり、その本質的な概念的・方法論的関連性は不明瞭なままです。これらの隔たりを埋め、基盤モデルの時代における人間中心の知能を再考するために、我々は全スペクトル人間コンテキスト分類法を導入します。この分類法は、人間を視覚的外観と空間幾何学を通じて観察可能な主体として、運動学的ダイナミクスと相互作用モデリングを通じて動的な行為者として、そしてワールドシミュレーションと身体化されたエージェンシーを通じて状況に埋め込まれたエージェントとして捉えることにより、相互に関連する6つのレベルを統合するものです。次に、人間中心のデータファミリー、計算アーキテクチャのパラダイム、代表的な学習および推論最適化戦略を網羅する、この分野の方法論的基盤を示します。続いて、これらのレベルにわたる代表的な手法を体系的にレビューし、関連するデータセット、ベンチマーク、評価指標を整理します。さらに、スケーラブルで、信頼性が高く、物理的に基盤づけられ、展開可能な人間中心の知能に向けた未解決の課題と有望な研究方向上を示し、この分野の進展に寄与する一貫した枠組みと実践的参照を提供することを目指します。最後に、我々のプロジェクトページにおいて、体系的に整理され継続的に更新される人間中心のAIに関する文献とリソースのコレクションを提供します。
現実的なユーザーの購買行動のシミュレーションは、Eコマースシナリオにおけるオフライン評価と強化学習の基盤となる。近年、LLMおよびVLMに基づくシミュレータは有望な進展を見せているが、実際のブラウジングセッションを再現することは、以下の2つの理由から依然として困難である。(i) メモリの課題:ショッピングセッションは数十ページにわたるにもかかわらず、既存のエージェントは長期的な観測履歴を破棄して変化するユーザー状態を失うか、あるいはそれらを単純に連結してコンテキストウィンドウを圧迫し、シミュレーション品質をも損なうかのいずれかである。(ii) 最適化の課題:現在のユーザーシミュレータは通常、模倣学習やステップ単位の報酬によって各記録済み行動を一致させるように教師あり学習される。その結果得られるセッションは、過剰探索や過度の受動性などの非現実的なパターンを呈することが多く、ステップ単位の教師信号ではこうしたパターンを検出することも修正することもできない。上記の課題に対処するため、我々はRecVerseを提案する。RecVerseは、スクリーンショットを通じてページを認識し、忠実なマルチターン軌跡を生成するGUI基盤のシミュレーションエージェントである。メモリの課題に対して、RecVerseは認知科学に着想を得た階層的メモリを採用する。すなわち、短期的な焦点のための作業記憶、セッション内の軌跡のためのエピソード記憶、高レベルの意図のための選好記憶であり、メモリ更新を行動として扱うことで、エージェントはいつ何を記憶すべきかを適応的に学習する。最適化の課題に対して、RecVerseはセッション全体を評価する軌跡レベルの強化学習目的関数を用いて最適化され、マクロレベルの行動タイプ分布とミクロレベルの購買意図の両方を実際のユーザーと整合させる。さらに我々は、マルチターンのユーザーシミュレーションのためのインタラクティブなEコマースGUI軌跡データセットであるUSB(User Simulation Benchmark)を公開する。実験により、RecVerseが行動の忠実度と意図の一貫性の両方において既存のベースラインを大幅に上回ることが示された。
大規模言語モデル(LLM)エージェントの集団レベル行動は、単一エージェントのベンチマークでは特徴づけられない。我々はPV-SST(ピア投票型ソーシャルプラットフォーム・テストベッド)を導入し、4つのトピック、4つの未使用シード、4つのオープンウェイトモデルファミリ、3つの事前指定されたより大きなバリアントにわたる、別個に凍結され事前登録されたマッチド曝露実験を報告する。実験は448試行と、モデル×トピック×シードの組み合わせによる112の完全ブロックから成る。トピックのみの対照条件と比較して、ピア生成の「いいね」でランク付けされた前ラウンドのピア投稿フィードは、4ファミリのコアパネル(対応のある平均差+0.0082 TF-IDFコサイン単位、95%ブロックブートストラップCI [0.0043, 0.0121]、ランダム化p=0.000105、n=64ブロック)と3バリアントのサイズ拡張(+0.0109 [0.0069, 0.0151]、p=0.000001、n=48)の両方で、最終ラウンドの語彙的類似性を増加させた。この対比はピア投稿への曝露とランキングを束ねているため、ランキングのみの効果を特定するものではない。反対側の生存率はコアパネルでは低下したが(-3.9パーセントポイント [-6.8, -1.6]、p=0.0068)、より大きなバリアントでは決定的ではなかった(-1.0 pp [-3.1, 0.4]、p=0.50)。敵対的印象を固定した場合、4つの分散ソースは、単一ソースよりも正直エージェントのスタンスを確実に動かすわけではない。事前登録された分散マイナス単一の対比は、コアパネルでは正であるが決定的ではなく(+0.057 [-0.009, 0.125]、p=0.112)、より大きなバリアントでは負であり(-0.040 [-0.113, 0.035]、p=0.332)、事前指定されたモデル横断・トピック横断の一貫性基準を満たさなかった。したがって、頑健な結果は、試験したピアランキングフィードの下での語彙的収束であり、一般的な意見捕捉や一般的な協調利点ではない。本研究は合成LLMエージェント集団を評価するものであり、人間や実運用プラットフォームへの影響を推定するものではない。
大規模言語モデル(LLM)の安全性を向上させることは、しばしば有用性を犠牲にすることを伴う。なぜなら、全体的に適用される安全性チューニングは、有害な入力と無害な入力の両方に対するモデルの応答に影響を与える可能性があるためである。本稿では、連続潜在アダプタルーティング(CLEAR)を提案する。これは、軽量な隠れ状態ゲートを用いて安全性低ランクアダプタの活性化強度を連続的に制御する、条件付き安全性適応フレームワークである。CLEARは、凍結されたバックボーンに対する不要な変更を回避しつつ、有害な出力を低減することを目的とする。そのような変更は、無害なプロンプトに対する性能を低下させ得る。広く用いられている安全性および有用性ベンチマークでの実験により、CLEARはHarmBenchにおける堅牢性を向上させるとともに、SFTや標準的な低ランク適応(LoRA)などの全体的に適用される安全性チューニングで観察される有用性の低下を軽減することが示された。Llama-3-8B-Instructでは、CLEARはHarmBenchの攻撃成功率(ASR)を32.3%から0.5%に低減しつつ、ベースモデルの有用性の大部分を維持し、全体的に適用されるSFTまたはLoRAよりもGSM8K精度を最大7.1パーセンテージポイント向上させた。これらの結果は、CLEARがLLMアライメントにおける安全性と有用性のトレードオフを改善する有望なメカニズムであることを示唆している。
我々は、ロボット操作における能動的知覚のためのPhysics-Informed Code-as-PolicyエージェントであるPhysCaPを提案する。視覚-言語-行動ポリシーはデモの模倣に優れている一方で、受動的観察に依存しており、操作に重要な潜在的な物理特性を推論できない。PhysCaPは、コード・アズ・ポリシーフレームワークに、相互作用を通じた明示的な情報探索を可能にする物理情報に基づく探索層を追加する。これは、追加センサーを用いずにロボットの自己受容感覚から物体の質量と剛性を推定する、学習不要の物理特性抽出モジュールを導入する。探索コストと得られる情報の効率性のバランスを取るため、PhysCaPは二重エージェント設計を採用する:いつ探索し、いつ停止するかを決定するプランナーと、非現実的な相互作用をフィルタリングし、ヒューリスティックな優先度スコアを用いて残りをランク付けする優先度付け器である。これにより、効率的で的を絞った探索が可能になる。我々は、実世界の卓上操作タスク(隠れた物体の探索、空き缶の検出、熟したアボカドの発見)とLIBEROにおけるシミュレーションタスクでPhysCaPを評価する。結果は、既存の受動的および単純な対話型ベースラインが、物理特性が隠されている場合に失敗するか、過剰に探索するのに対し、PhysCaPはより少ない相互作用と短い実行時間で同等の性能を達成することを示している。アブレーション研究は、提案された物理特性抽出モジュールの有効性をさらに検証する。プロジェクトページ:https://physcap.github.io
オープンエンドの言語モデルベンチマークは通常、人間の嗜好パネル、別のモデル、または脆弱な完全一致キーといった判定者を継承する。本稿では、バージョン管理された料理システムが密で実行可能なグラウンドトゥルースを提供する自動ベンチマークであるFlavourBenchを紹介する。各タスクは8つの材料を提示し、3材料のポートフォリオを要求する。モデル実行に先立ち、Epicureは可能な56全てのポートフォリオをスコアリングする。我々は、代替、ペアリング、制約付き構成にわたる同一の534タスクのコア上で、27のフロンティアエンドポイントを評価する。ランク付けされた各モデルは、パネルおよびファミリーごとに正確に89件の有効な応答を有し(合計14,418モデル-タスクセル)、これによりリーダーボードから差別的欠落が排除される。FlavourBenchスコアは、固定タスクスコアのファミリー等重み平均である。同時95%スコア帯には50,000回のアンカークラスターブートストラップ反復を用い、Holm補正を伴う全351のペアモデル対比には100,000回の符号反転抽出を用いる。独立に作成された2つのパネルはr = 0.89(順位rho = 0.80)で相関する。Grok 4.6は最大の点推定値65.1を示し(同時95%信頼区間61.0-69.2)、351のモデルペアのうち101が確定された。リリースには、プロンプト、全てのポートフォリオスコアマップ、生の応答、正確なルート、コンテンツハッシュ、および全ての結果を再構成するオフライン検証器が含まれる。
我々は、ハディース計算科学がトランスフォーマーモデル、検索基盤型パイプライン、および大規模言語モデル(LLM)によってどのように再形成されているかを検討する。近年のレビューは文献の増加を記録しているが、どの進展が方法論的に堅牢であり、どの進展がベンチマークに縛られたままであり、どの未解決問題が依然として学術的利用を制限しているかについての批判的な説明はまだ提供していない。我々は、既存レビューへの批判、代表的な原著研究の論文レベルの評価、および真正性・権威・責任ある利用に関するイスラーム学者と分野専門家の視点の総合を組み合わせた批判的ナラティブレビューを通じて、このギャップに対処する。進展にはばらつきがあることが分かる。データリソースは拡大し、セグメンテーションタスクは成熟し、伝承者と出典検証の問題はより形式化され、LLM支援ワークフローは現在、コーパス規模の拡充、多言語アクセス、および根拠に基づく評価を支援している。同時に、進展は、限定的なコーパス、ベンチマーク比較可能性の弱さ、合成から実データへの転移ギャップ、伝承者の同一性解決、前処理の脆弱性、再現性の制約、そして専門家の根拠に基づく検証の乏しさによって制約されたままである。我々は、重要なギャップが支配的なベンチマークの先にあることを示す:非正典かつあまり知られていないコーパス、注釈・解説文献、クルアーンとシーラ(預言者伝)とのクロスソースリンク、およびフィクフ(イスラーム法学)に資する証拠支援である。我々は、ハディース計算は、孤立したモデル性能としてよりも、知識統合、来歴(プロヴェナンス)、および専門家の監督を必要とする証拠インフラストラクチャの問題として評価されるべきであると論じる。この基盤に基づき、我々は、この分野を方法論的により強固にし、イスラーム学にとってより有用にするための研究アジェンダを定義する。