翻訳付きの日次キュレーションされたAI研究論文
高齢者が服薬を忘れた場合、ソフトウェアエージェントは別のリマインダーを送ることができ、身体化エージェントは薬を届けることができる。しかし、そのどちらも、その人が忘れたのか、混乱しているのか、副作用があるのか、それとも意図的に拒否したのかを説明することはできず、どのような支援が適切であるかも示さない。このことは、Agentic AI(エージェント型AI)に構造的欠落があることを明らかにしている。すなわち、デジタルエージェントは主にソフトウェア上の状態を変換し、身体化エージェントは物理的な状態を変換するが、どちらも、人の変化しつつある状態と主体性を、モデリング・介入・評価の主要な対象にはしていない。 本稿では、Combodied Agents(コンボディード・エージェント)を導入する。これは人間中心のパラダイムであり、ソフトウェアツール、センサー、ウェアラブル機器、ロボット、人的サービスを、最終目標ではなく行動チャネルとして用いて、個人の人間状態の軌跡を時間の経過に沿って知覚し、モデル化し、予測し、支援するものである。我々は、パーソナルアシスタント、健康エージェント、AIコンパニオン、適応型ヒューマンAIシステムにまたがる断片的な能力を、閉ループに統合する。すなわち、イベントベースのマルチモーダル知覚が意味のある個人イベントを再構成し、長期的かつ訂正可能な記憶が時間的文脈を提供し、パーソナルワールドモデルが代替的な意思決定や介入の下での将来の個人状態と結果を推定し、許容可能な介入ポリシーが、同意・不確実性・安全性・可逆性・ユーザー制御の下で、適切な支援を選択する。本人と環境からのフィードバックによってループは更新される。 この枠組みは、網羅的なヒューマンデジタルツインを必要とするのではなく、目的に限定され、不確実性を考慮し、ユーザーが修正可能な表現を用いる。また、設計空間を人間状態の対象、関係的文脈、エージェントの役割によって整理し、シナリオ中心の評価、主体性保持の指標、ベンチマーク要件、エッジネイティブな個人モデル、ガバナンスの方向性を提案する。Combodied Agentsは、Agentic AIを、外部のタスク完了から持続的な人間の利益へと転換させる。
エージェントシステムは展開後に改善することが期待されるようになっているが、単一エンティティによる自己進化は、固定されたタスクやフィードバックといった静的な学習文脈によって制約されることが多い。本サーベイは、エージェントシステムにおける共進化に焦点を当てる。これは、複数のエージェントとその環境が互いに適応的圧力を及ぼし合う、多要素からなる自己進化の一形態である。既存の研究を整理するため、システムが人間の設計した制約から段階的に脱却していく過程を追跡する、漸進的な三段階分類法を提案する。エージェント間共進化は、敵対的、協調的、組織的適応を含む、動的ピアを通じたエージェントの適応を研究する。エージェント-環境共進化は、このループをエージェントとともに変化する適応的タスク、フィードバック、相互作用空間へと拡張する。メタ共進化は、進化メカニズム自体を進化可能にする可能性をさらに探求する。また、このようなシステムの評価、複数要素へのスケーリング、そしてますます自律化する進化プロセスを安全かつ制御可能に保つことにおける未解決の課題についても議論する。本サーベイは、固定された人間設計の経路を超えて改善できる、堅牢でオープンエンドなエージェントシステムを構築するための統一的な基盤を提供する。
4D生成は、テキストや画像などの条件から動的な3Dシーンを合成する。既存手法は、生成されたRGBビデオを別の4Dモデルで再構成するか、特定のビデオ生成器を適応させて幾何形状を直接予測するかのいずれかである。前者は分布のミスマッチと誤差伝播の問題を抱える一方、後者は4D予測を特定の生成器に結び付け、生成器や条件付け方式が変わると再学習が必要になる可能性がある。我々は、変分オートエンコーダ(VAE)を共有するビデオモデルの最終的なデノイズ済み潜在表現が、明示的な4D予測への再利用可能なインターフェースを提供できるかどうかを問う。この洞察に基づき、我々は直接的な潜在表現から4Dへの生成を導入し、それをLatent-to-4Dとして具体化する。これはRGBを介さず、ビデオ潜在表現を事前学習済み4Dデコーダのトークングリッドと整列させ、フレーム単位およびグローバルな時空間アテンションによって精緻化する。約1Kの既存の再構成クリップで訓練された単一のチェックポイントは、同じVAEファミリー内の複数のビデオ拡散トランスフォーマーに変更なしで転移する。Text4D-200およびI4D-200において、Latent-to-4Dは、対応する同一潜在表現のWan+4RCカスケードを、投影ベースのDINO-F1でそれぞれ2.88~3.45ポイントおよび5.81ポイント上回り、また幾何形状、時間的安定性、全体的な品質の点で人間の評価者にも好まれる。
インタラクティブなデジタルツインの構築には、3Dジオメトリと物体の関節運動を支配する運動学的構造の両方を復元することが必要である。しかし、既存の関節物体再構成手法は、複数の関節状態から明示的に観測可能な運動を必要とする。本研究では、単一の閉じた配置から関節物体を再構成する静止状態の定式化を導入する。これは、幾何学、意味論、および運動の事前知識が運動の手がかりの欠如を補完する、本質的に不良設定の状況である。本フレームワークは、クロスモデル検証と融合のための中間表現として明示的なメッシュを採用し、視覚言語モデルとセグメンテーションモデルからのノイズを含む出力を、空間的に整合性のあるパーツ構造へと統合する。観測された運動なしで関節パラメータを推定するため、ビデオ拡散モデルを用いて関節運動の仮説を合成し、幾何学的整合性を通じてそれらを検証する。本手法は、正確なパーツ分割と物理的に妥当な関節運動を実現し、運動を観測する再構成ベース、生成ベース、およびモジュール型事前学習モデルのベースラインと競争力のある性能を達成する。
フレシェ距離は最近、生成器のポストトレーニングにおける効果的な分布レベルの目的関数として登場し、従来のサンプルレベルの拡散損失やフローマッチング損失を補完している。しかし、フレシェ目的関数を直接最適化すると、フレシェハッキングを引き起こす可能性がある。目標指標は改善し続けるが、視覚的品質や他の特徴空間におけるフレシェ整合性は停滞または悪化することがある。我々はこの失敗の原因を、既存のフレシェ損失で用いられる静的で事前学習済みの特徴空間に帰属する。これらの特徴空間は、実分布と生成分布の差に関する不完全かつ固定的な視点しか提供しない。この制限に対処するため、我々は敵対的フレシェ距離(AdvFD)を提案する。これはFD損失における静的表现ターゲットを、較正された敵対的学習表现で補完する。AdvFDは、元の静的フレシェ目的関数に学習可能な表现を追加し、その表现が実サンプルと生成サンプル間のフレシェ乖離を敵対的に最大化する一方、生成器は得られた適応的特徴空間における同じ乖離を最小化する。敵対的表现が特徴増幅によって目的関数を自明に増加させるのを防ぐため、さらに実特徴白色化を導入する。これはそのスケールと共分散の幾何構造を正規化し、min-max最適化を安定化する。広範な実験により、AdvFDがJiTおよびpMFの両バックボーン、および異なるモデル規模にわたって、一段生成器のポストトレーニングを一貫して改善することが示される。
自身のソースコードを反復的に書き換える自己改善型コーディングエージェントは、コーディングタスクにおいて顕著な性能を示してきた。しかしながら、既存の手法は一般に、一度に一つの失敗軌跡から自己修正を導出しており、エージェントの拡大しつつある過去の試行のアーカイブにおいて利用可能な豊富な比較シグナルを見落としている。制御された遺伝のメンデル原理に従い、我々はメンデル・ゲーデルマシン(MGM)を導入する。MGMは、一般的な単一軌跡クローン変異に加えて、蓄積された証拠をより良く利用する2つの新しい自己修正を含む。すなわち、反応規範変異は複数のタスクにおける軌跡に同時に基づいてエージェントを編集し、系統間交雑は同じタスクに関する別の系統の参照エージェントの軌跡を用いてエージェントを編集する。加法的適応度地形モデルの下で、我々は新しい戦略が単一軌跡のベースラインと比較して、より高速でより良い収束を促進することを理論的に証明し、制御された代理シミュレーションによって実証する。SWE-benchとPolyglotに関する実験は、性能、効率、一般化可能性におけるMGMの一貫した改善を確認する。
大規模言語モデル(LLM)エージェントは、個人アシスタントとしてますます広く展開されている。しかし、既存の評価は、そのほとんどが静的な環境における短く自己完結的なリクエストに基づいている。日常生活の支援はこれとは異なる。タスクは数分ではなく数週間にわたって継続する。エージェントがプロンプトを受けていない間に、世界は変化し続ける。多くの制約は、決して明示的に述べられることはない。目前のリクエストに単に応答するだけのエージェントは、そのようなタスクでは失敗するだろう。代わりに必要とされるのは、積極的(プロアクティブ)でありながら一貫性を保つエージェントである。すなわち、いつ行動し、いつ質問し、いつ沈黙するかを自ら決定し、誰も知らせてくれない変化に気づき、初日から最終日まで単一の計画を首尾一貫して維持するエージェントである。現在のベンチマークではこれを測定するものはない。我々は、10の日常生活領域にわたる200の長期的タスクからなるベンチマーク、VibeLifeBenchを紹介する。各タスクは、22の模擬サービスからなるシミュレーション世界における、スクリプト化された複数週間のタイムラインである。世界は独自の時計で進行し、その変化の多くは静かであるため、世界を再調査するエージェントだけがそれらを発見できる。すべてのタスクは、エージェントが実際に残した出力のみを読み取る、きめ細かい重み付きチェックによって採点される。このチェックは、最終状態、アクションの適時性、および暗黙の制約を順守したかどうかを網羅する。我々は7つの最先端モデルを評価した。そのすべてが低スコアであり、現在のエージェントが実際の生活の支援からいかに遠いかを示している。我々は、すべてのタスク、環境、および評価フレームワークをオープンソースとして公開する予定である。
オムニモーダル対話モデルは、マルチモーダル入力を理解し、音声応答を合成できるが、その応答は視覚的には身体性を欠いたままである。本稿では、テキスト、パーソナライズされた音声、および参照条件付きビデオからなる協調応答を生成するオムニモーダル対話フレームワークEx-Omni-2Dを提案する。マルチモーダルクエリ、参照画像、参照オーディオが与えられると、本モデルはシーン、感情、動作を記述する構造化された視覚思考プラン(VTP)を予測し、続いて応答テキストとネイティブなマルチコードブック音声ユニットを予測する。これらのユニットは共有音響・時間インターフェースを構成し、音声にデコードされると同時にビデオフレームとオンラインで整列される。このインターフェースにより、応答経路とアバター経路を異種の音声データ、対話データ、アバタービデオデータから学習でき、大規模なクエリ‐テキスト‐音声‐ビデオの教師データを必要としない。フルシーケンスのビデオジェネレータが主要な教師モデルとして機能する。効率的な増分生成のために、これを数ステップのブロック因果的ストリーミング生徒モデルへさらに蒸留する。そのプレフィックスストリーミング機構は、連続するチャンク間でクリーンな潜在表現を保持し、後期チャンクにおける累積的な劣化を低減する。4ステップ推論により、4GPU構成の完全なパイプラインは、400×720/720×400の解像度でエンドツーエンドのRTF 1.293を達成し、実用的な品質と効率の動作点を提供する。
大規模言語モデルの評価は通常、名目条件下での性能に焦点を当てており、モデルが狭く高度に最適化された生成経路を難なく歩んでいるという能力の錯覚を生み出している。しかし実運用では、複雑なシステムプロンプト、安全性ガードレール、構造的制約がモデルを絶えずこの名目経路から逸脱させ、ベンチマークスコアと実運用性能との間に乖離をもたらす。この問題に対処するため、我々はDecoding-Level Taboo(以下、Taboo)を導入する。これは、実行時にロジット空間へ直接介入してモデルを名目経路から強制的に逸脱させる、ゼロプロンプトの診断的ストレステストである。Tabooは単語境界における主要候補トークンを動的にマスキングすることで、機械による迂言表現を強制する。 複数のオープンウェイトモデルファミリーにわたるTabooの評価により、オフパス堅牢性はパラメータ規模と事後訓練によるインストラクションアライメントの両方に強く影響を受け、堅牢性は概ねモデル規模とアライメントの向上に伴って改善することが明らかになった。本論文で提示された結果に加えて、Tabooは多様な合成データセットの生成、実行時安全性ガードレールのストレステスト、実世界展開前のモデル信頼性監査のための新規プリミティブを提供する。
長期的な研究エージェントは、反復的な検索・集約・統合を通じてオープンエンドなタスクを解決するが、コンテキストは急速に増大する一方で、追加証拠の限界的価値はしばしば低下する。その結果、不要なトークンコスト、レイテンシの増加、最終レポート生成における入力のノイズ増大が生じる。本研究では、ディープリサーチエージェントにおけるコンテキスト管理のための限界価値推定を調査し、パイプライン全体にわたる刈り込み戦略について、初の体系的なステージ別比較を提示する。検索前、検索後、統合前の各ステージにおいて、軽量なヒューリスティック基準と学習済み価値モデルを評価する。結果として、刈り込みの有効性は特定のスコアリングルールよりも、刈り込みを適用する位置に依存することが示された。早期の刈り込みはエンドツーエンドで最大の削減をもたらす一方、後期の刈り込みは主に最終統合コンテキストを精緻化する。軽量ヒューリスティックは品質をほとんど低下させずにトークン使用量を最大73%削減し、学習ベースの刈り込みは選択されたトレードオフにおいて競争力を維持するが、品質・効率・忠実性のすべてを単一の方法が支配するわけではない。これらの知見は、効率的な長期的エージェントシステムの設計に対する実践的な指針を提供する。
自己進化型エージェントは、成功した手順や失敗の修正を追加することにより、再利用可能なスキルを蓄積する。時間の経過とともに、同じ要件が複数の分岐、例、警告の中で繰り返し記述される一方、一般的な動作シーケンスは再利用されずにコピーされることが多い。その結果、スキルは注入コストが高く、保守が困難になる。汎用のプロンプト圧縮は、この設定には適さない。なぜなら、スキルは平坦な文章ではないからである。すなわち、その名前と説明は適用条件を定義し、ワークフローは実行を制御し、ツール契約と出力契約は妥当性を制約し、まれな例外は、サンプリングされたタスクがそれらを発動しない場合でも本質的に重要であり続けることがある。評価駆動型圧縮はこれらの挙動をテストできるが、ロールアウト、コスト、そして圧縮時評価セットへの依存性をもたらす。我々は、最短の忠実な構造的説明を見つけることによってスキルを圧縮する、評価不要の手法であるSkillZipを提案する。その直感は「一度説明し、何度も参照する」というものである。すなわち、繰り返される規則は適用されるスコープで一度だけ記述し、繰り返される動作シーケンスは共有手続きとしてまとめ、差分のみを明示的な例外として保持する。我々はこの直感を、スキル契約と残差に関する型付き最小記述長の目的関数として形式化し、抽出されたすべてのトリガー、ワークフローエッジ、ツール要件、義務、出力フィールドに対するハードな被覆制約の下で最適化する。この定式化は単純な共有しきい値を提供し、構成により一意のまれな規則を保持し、効率的なローカル更新をサポートする。SkillZipには、単一の構造化抽出呼び出しと決定論的最適化を備えたワンショットモードと、タスクを再生したり全履歴を再解析したりすることなく各自己進化パッチを統合する継続的なZip-on-Writeモードがある。包括的な実験評価を通じて、圧縮性能、汎化性、コストオーバーヘッドの点でSkillZipの有効性と優位性を示す。
スパース混合エキスパート(MoE)レイヤーは、条件付き計算によって推薦能力を拡張するが、学習済みチェックポイントは依然として全エキスパートバンクを格納し、それらすべてにルーティングを行う。本研究では、デプロイメント問題、すなわち、圧縮専用のオンラインモジュールを追加することなく、明示的なエキスパート予算の下で、そのチェックポイントをより小さな標準MoEへ変換する問題を扱う。この課題に対処するため、制約付きグラフ粗化問題として定式化された学習後圧縮フレームワークであるUniMoMoを導入する。UniMoMoはパラメータ距離に依存せず、ラベルなしキャリブレーションセットを用いて、共有された推薦状態に対してエキスパートがどの程度類似した応答を示すかを測定し、機能的類似性に基づいてエキスパートをグループ化する。性能低下を防ぐため、ルーティング露出に基づいて高トラフィックエキスパートのマージを制限するレイヤー適応型保護メカニズムを導入する。Amazon Beauty、KuaiRec、TenRecにおいて、2、4、6個のMoEブロックを用いた場合、最終的な4エキスパートのチェックポイントは、ソース相対の5回実行平均NDCG@10比が99.92%~102.30%、A100での実測高速化が1.28倍~1.63倍となった。より積極的な2エキスパート、top-1動作点では、98.36%~104.24%の比率と1.47倍~2.21倍の高速化が得られた。これらのエンドポイント結果は、変換と適応の完全なワークフローを評価するものであり、学習済み推薦MoEが複数のサービング予算でエクスポート可能であることを示している。
ビジュアル文書検索(VDR)は、数十億パラメータ規模のモデルが主流であり、コーパス全体のスケールでのインデックス作成が遅く、サービングコストも高いという問題を抱えている。既存の圧縮手法は、小型のマルチベクトルエンコーダをゼロから学習するか、クエリ側のみを蒸留するかのいずれかであり、どちらもコンパクトなシングルベクトル検索器をエンドツーエンドで生成することはできない。本稿では、ポイントワイズコサイン整合損失の下で単一の80億パラメータの視覚言語教師モデルから双方向に蒸留された、5億2400万パラメータのエンドツーエンドVDRシステムであるDistilVDRを提案する。全ての教師信号は凍結された教師モデルの埋め込み空間から得られる。この埋め込み空間自体が関連性教師信号を用いて学習済みであるため、生徒モデルの目的関数には関連性ラベル、ネガティブサンプリング、対比項が一切不要である。VDRのテキストクエリと画像文書という入力の非対称性に合わせて、非対称なエンコーダのみの生徒モデルを採用する。このモデルは視覚的な容量を文書側に集中させ、クエリ側は7000万パラメータに抑えている。同じエンコーダと学習設定を共有し、文書エンコーダの視覚タイル予算のみが異なる2つのバリアントを公開する。DistilVDR-HiResはViDoRe v1+v2+v3で平均NDCG@5 61.74を達成し(80億パラメータの教師モデルの86.9%)、高解像度に敏感なv3ベンチマークにおいて、再現した全ての10億パラメータ未満のベースラインを上回る。一方、DistilVDR-Fastは3分の1の視覚トークン予算で59.98を達成する。両バリアントとも、最強の10億パラメータ未満のマルチベクトルベースラインと比較して15.6倍小さいインデックスで100万文書を格納し、コーパスのインデックス作成を一桁高速化する。コードはhttps://github.com/Ryenhails/NanoVDRで公開している。
大規模言語モデル(LLM)はモバイルアシスタントとしてますます導入されており、そこでの重要な課題は、複数のアプリケーション(アプリ)に散在する個人情報を活用してユーザーの指示を遂行することである。しかし、専用のベンチマークが不足しているため、その能力は十分に解明されていない。このギャップに対処するため、我々は5つの認知能力(すなわち、推論、曖昧性解消、統合、選好推論、複数意図の分解)に基づく人手でキュレーションされたベンチマークSPIEvalを導入する。SPIEvalは、10個のアプリにわたって分散された4,335件の個人記録にまたがる250のタスクで構成され、21個のツールを通じたマルチターン対話をサポートする。分析により、このベンチマークは多様なシナリオ、困難なタスク、散在する情報、制御可能な環境、検証可能な結果を示すことが明らかになった。我々は9つの代表的なLLMを評価し、改善の余地が大きいことを見いだした。最良の性能を示したモデルGPT-5.5(xhigh)は57.3%の精度しか達成できず、最弱のモデルはわずか16.4%であった。さらなる分析により、失敗の79%は不正確な情報の特定に起因することが明らかになった。LLMは検証のための検索を続ける代わりに、もっともらしいが誤った情報に固執することが多いためである。また、検索操作のうち高度な検索手法を用いるものは2%未満であり、モデル間で検索効率に大きなばらつきがあることも観察された。これらの知見は、現在のLLMベースのモバイルアシスタントの根本的な限界を浮き彫りにし、この方向での今後の研究を動機付ける。データとコードはhttps://huggingface.co/datasets/Junjie-Ye/SPIEvalで公開されている。
本研究では、オープンな大規模言語モデルを用いた多言語機械翻訳のための参照なしポストトレーニングを検討する。教師ありファインチューニング済みのMiLMMT-46-v0.1モデルを出発点として、言語識別によってゲートされる、2つの参照なし品質推定モデルの平均を報酬とするグループ相対方策最適化(GRPO)を適用する。次に、教師ありファインチューニング(SFT)と強化学習(RL)のモデルチェックポイントを線形補間してMiLMMT-46-v1.0を得る。得られたモデルは、46言語にわたり、対応するSFTモデルと比較して翻訳品質を一貫して向上させ、Seed-X、HY-MT2、TranslateGemmaなどの最近の強力なオープンベースラインを上回り、Google Translate、Gemini 3 Pro、GPT-5などの評価対象のプロプライエタリシステムと比較して、最高水準の参照なしスコアを達成する。さらに、オン方策蒸留を調査し、それがチェックポイント補間を用いたRLによって達成される品質の最前線に到達するものの、それを超えることはないことを見いだす。今後の研究を促進するため、モデルとコードを公開する。
長文書の理解は、多くの視覚的にリッチなページにわたる推論を必要とすることが多く、推論コストが高く、コンテキストの劣化(context rot)が生じやすい。本研究では、視覚解像度を推論時に適応的に調整されるリソースとして扱う、エージェント型の視覚知覚フレームワークであるInSight-docを提案する。InSight-docは低解像度から開始し、より詳細な証拠を得るために高解像度領域へ選択的にズームインする。外部の検索器(レトリーバー)には依存しない。このようなエージェントを訓練するために、領域レベルのズームイン軌跡を含む17.9K件の高品質なSFT(教師ありファインチューニング)例と、19.2K件の高難度RL(強化学習)例からなる能動的知覚コーパスを構築した。SFT+RLにより、InSight-doc-8Bは文書VQAベンチマークにおいてベースラインを4.3〜16.4精度ポイント上回る改善を達成した。長文書においては、精度の優位性を維持しながら、幻覚を40%以上、推論レイテンシを41%〜68%削減する。コード、データセット、モデルはhttps://github.com/m-Just/InSight-doc で公開している。
本稿では、360度ビデオから構築されたフォトリアリスティックな環境において、身体化エージェントの都市探索能力を評価するためのベンチマークである360CityArenaを提案する。既存の屋外ベンチマークは、十分なフォトリアリズムまたは複雑さを欠いており、現実世界の都市環境との間にかなりのギャップが生じている。360CityArenaは、日本の東京・秋葉原地区を現実的に再構築したものであり、85の通りをカバーする602本の360度ビデオセグメントを用いて構築され、175の細心の注意を払って人手で作成されたタスクから構成される。これには、環境理解、経路推論、空間推論という3つのタスクカテゴリが含まれ、位置特定、ランドマーク探索、経路計画、関係的空間推論など、都市探索に必要な基本的な能力をカバーすることで、現実的な都市シーンにおける包括的な評価を可能にする。最先端のLMMベースのエージェントを用いた評価では、最も強力なモデルであるGemini 2.5 Flashでも、人間のレベルをはるかに下回る性能しか示さず(人間:77.3%、Gemini 2.5 Flash:17.1%)、都市規模の身体化ナビゲーションと推論には依然として大きな課題が残されていることが明らかになった。360CityArenaは、フォトリアリスティックな市街地ナビゲーションと空間推論のための、必要かつ挑戦的なテストベッドを提供する。
クエリベースのマストランスフォーマーは、最終層のクエリ予測間のピクセル単位の競争を通じてセグメンテーション出力を構築するが、この推論プロセスは学習中に明示的に最適化されない。我々は、2つの重要なミスマッチを特定する:最高の確率マスクスコアを持つクエリが必ずしも最も正確なマスクを生成するとは限らないこと、そして最終層のデコードが中間層からの優れた予測を破棄し得ることである。これらの問題に対処するため、我々はプレーンなマストランスフォーマーのための汎用的な学習フレームワークである推論を考慮した学習(iFAN)を提案する。iFANは、クエリ競争を予測マスク品質と整合させ、高信頼度だが不正確な競合予測を抑制する調整確率マスクランキング(APMR)を導入する。さらに、クロスレイヤー自己蒸留(CLSD)を用いて、より強力な中間層予測を最終層に転送する。ランキングと蒸留の目的関数は学習時のみに適用され、推論時には効率的な最終層デコードが保持される。COCO、ADE20K、Cityscapesでの実験により、パノプティック、インスタンス、セマンティックセグメンテーション、および異なるアーキテクチャ、バックボーンスケール、入力解像度にわたって一貫した改善が実証される。全体として、iFANは平均1.20 PQ、1.30 AP、0.63 mIoUの性能向上を達成し、追加パラメータ、FLOPs、推論レイテンシは無視できるほど僅かである。
ジグソーパズルの解決には、視覚的内容と幾何学的制約に関する統合的推論が必要である。しかし、既存のベンチマークは長方形の切り抜きを使用しており、テクスチャが反復する領域では曖昧な正解が生じる。我々は、タブとブランクが噛み合うピースを備えたベンチマーク\ours{}を導入する。このベンチマークでは、幾何学的制約が強い局所的互換性要件を提供し、視覚的内容と組み合わせることで曖昧さのない正解が得られる。4×4から16×16までの4つのグリッド密度にわたる95Kインスタンスにおいて、ゼロショットVLMは幾何学的推論をほぼ欠いていることが分かった。すなわち、5つのフロンティアモデルのうち1つ(GPT-5.5)だけが4×4パズルでランダムベースラインを上回り、他のすべては偶然水準にとどまった。教師ありファインチューニングは4×4で97%以上を達成する一方、すべてのモデルはより大きなグリッドで崩壊する。GPT-5.5は8×8で70%からほぼランダムな水準まで低下し、ファインチューニングされたモデルでさえ12×12では5%を下回る。この「スケーリングの崖」は、現在のアーキテクチャがピース数の増加に伴って一貫した制約充足を維持できないことを示唆している。\ours{}は、拡張可能な幾何学的推論を視覚言語モデルにとっての未解決の課題として確立する。
実世界のデータサイエンスには、データラングリング、探索、モデリング、可視化、検証にわたる長期的なワークフローが含まれ、実際の動作環境でノートブック、IDE、ターミナル、ブラウザ、データベースなどのツールを協調的に使用することが必要とされる。しかし、既存のベンチマークは実際のコンピュータとの対話を欠いており、現実的な計算環境においてエージェントが完全なエンドツーエンドのデータサイエンスワークフローを実行できるかを評価していないため、データサイエンス実践の多段階・多ツールという性質を捉えられていない。我々は、実際のコンピュータ環境内でエージェントがデータサイエンスワークフロー全体を自動化できるかを評価する初のベンチマークであるDSAgentBenchを提案する。DSAgentBenchは、データサイエンスライフサイクル全体を網羅する275の多様なタスクを含み、実際に必要とされる複雑さとツール連携を反映している。各タスクは、中間出力に基づく判断とツールの協調的使用を必要とし、コードの実行のみではなく、分析の正しさ、可視化出力、モデル性能を検証する決定的評価器を備えている。クローズドソースおよびオープンソースの15モデルを用いた広範な実験では、最強のエージェントであるClaude-4.6-Sonnetでさえタスク成功率は56.70%にとどまり、オープンソースのエージェントはすべて1%未満にとどまり、ツールオーケストレーション、OSグラウンディング、多段階推論において頻繁に失敗した。これらの結果は、現在のエージェントシステムと実際のデータサイエンスワークフローとの間に大きな能力ギャップがあることを明らかにし、DSAgentBenchを、グラウンディングされ、検証可能で、自律的なデータサイエンスエージェントを開発するための基盤として位置づけている。DSAgentBenchは、https://github.com/vis-nlp/DSAgentBench で公開する。
人工知能(AI)の急速な進歩により、時系列解析、特に予測、分類、生成タスクにおける研究は大幅に加速している。最近のモデル、特に基盤モデルは、ファインチューニングにおけるソースデータセット選択において重要な役割を果たす時系列データセットの類似性から恩恵を受けている。しかしながら、時系列データセット類似性手法のベンチマーキングを目的とした既存の実装の多くは断片的であり、拡張が困難である。この問題に対処するため、我々は統一フレームワークである時系列データセット類似性ツールボックス(TSDS-Toolbox)を提案する。本研究により、(1)時系列データセット類似性手法の体系的かつ再現可能な比較、(2)カスタムデータセット、類似性手法、および下流の時系列タスクを追加するための柔軟な拡張性、(3)統合された時系列データセットリデューサを通じたデータセットレベルおよび系列レベルの類似性手法の一貫した評価が可能となる。TSDS-Toolboxの有効性は、多様な実験設定の下での包括的な実験を通じて検証される。本ツールボックスは公開されている。
Power Law Decoder Representations(PLDR-LLM)およびその注意機構であるPower Law Graph Attention(PLGA)は、スケールド・ドットプロダクト注意機構(SDPA)の固定された双線形形式を、正のテンソルA_{LM}から要素ごとの冪則によって構成される、学習され入力から生成される双線形作用素G_{LM}で置き換える。本アーキテクチャは完全に仕様化され、固定されたリファレンスリリースに対して検証されている。主張は、定理、条件付き定理、測定結果、または予想として分類される。 無条件に成り立つこと:PLGAは、G_{LM}=Iのとき正確にSDPAを含む。A_{LM}とA_Pはすべての成分について狭義正であり、A_{LM}はペロン=フロベニウス構造を持つ。DAG正則化項はNOTEARSのウォーク計数形式を持ち、正値性が厳密な非巡回性を妨げる。さらに、非共鳴条件(標準的なロータリー周波数によって満たされる)の下では、交換子(コミュタント)判定条件により、どの作用素が相対位置依存性を保つかが特定される。 推論崩壊定理:演繹的出力の厳密な入力不変性は、推論を定数作用素を持つ一般化SDPAに帰着させる。 測定された不変性:相対変動は10^{-6}以下である。摂動界はキャッシュ推論を定量化するが保証はしない。組み立てられた代理指標は復号マージンを捉え損ねる。 条件付きの三段階機構(ロータリーツワール、集中、行写像縮約)が、公開済みチェックポイント上で測定される。大域グラムの下でのブロック単位の訓練とスコアリングは、明示的なターゲット露出を伴って述べられる。試験したサンプルでは、ブロック方式と逐次方式のスコアリングは同一の解答を選択し、公開されているTruthfulQAの確率質量指標に関して項目あたり5×10^{-5}以内で一致する。自己組織化臨界性は、内在的秩序パラメータを持つ現象論的枠組みとして導入され、未解決の主張は反証可能な予想となる。選択された証明コアはLean 4において機械検証されている。
近年の検索拡張生成(RAG)に関する最適化研究では、チャンク単位のKVキャッシュ再利用を活用し、長い検索コンテキストの処理を回避することで効率を高めているが、粗粒度のチャンクには依然として重大な情報の冗長性とノイズが残っている。本論文では、低プリフィル遅延制約下でのパレートフロンティアを最適化しつつ精度を最大化する手法として、CoinRAG(Contextualized Information Nugget KV Cache Reuse for Long-Context RAG)を提案する。この名称は、我々の核心メカニズムを比喩的に反映している。すなわち、小さなコインを組み合わせてより大きな価値を蓄積するように、CoinRAGはオフラインで計算された細粒度のナゲットキャッシュを合成的に再利用し、意味的により関連性が高くかつコンパクトな形で、学習された文脈表現を効率的に構築する。具体的には、全チャンクをエンコードする代わりに、CoinRAGは二段階検索を通じて検索チャンク内のクエリ関連の意味単位を識別し、それらのスライスされたKV表現をチャンクレベルの文脈とシームレスに組み立てる。LongBenchのマルチホップ質問応答タスクに関する広範な評価により、CoinRAGは運用コストを大幅に削減し、標準的な高速プリフィル遅延予算の下で、新たなパレートフロンティアと平均5.3%の回答品質(F1)の相対的な改善を達成し、他のベースラインを上回ることが実証された。