翻訳付きの日次キュレーションされたAI研究論文
デュプレックス音声言語モデル(SLM)などの対話システムには、その中核として、ストリーミング対応かつ正確で共感的なメモリシステムが依然として欠けている。我々はVoiceMemを提案する。これは、並列的な情報処理を担う「左脳」、感情を司る「右脳」、そしてストリーミング式のメモリI/O機構を備えたシンプルなメモリアーキテクチャである。さらに、メモリ認識型SLMトレーニング、長期評価、交換可能なメモリバックエンドによる分離型デプロイメントのための完全なパイプラインも構築した。 実験および実環境への導入により、以下の3つの利点が実証された。i) 正確性:Top-5検索の条件下で、左脳はMem0などの従来システムのTop-200検索を約30ポイント上回る性能を達成した。ii) 感情的・個人的側面:右脳は、短期・長期の感情帰属とデュアルノードのペルソナモデリングにより、3つのペルソナベンチマークすべてで最先端の性能を達成し、従来の最良システムに対し総合スコアを4.29ポイント向上させた。iii) リアルタイム性と低コスト:VoiceMemは検索を134msで完了し、これは標準的なVADレイテンシに十分収まる。そのため追加の対話遅延を生じさせず、高い精度と低コストを維持する。 これらの結果は、VoiceMemがリアルタイムでパーソナライズされ、感情を認識する音声対話のための実用的なメモリ基盤を提供することを示している。
近年の研究は、動画生成モデルが生成フレームを通じてゼロショット視覚推論の特定の形態を示し得ることを示唆している。しかし、信頼性の高い評価は依然として困難であり、ベンチマークは、現在の動画モデルの視覚的先行知識と整合する入力を採用し、もっともらしい最終状態だけでなく妥当な進化過程を要求し、挑戦的でありつつ部分的に達成可能な難易度に調整されるべきである。この目的のために、我々はVGI-benchを導入する。これは27タスクと810インスタンスを含み、タスク領域とスキルタグの2階層分類法により、動画生成モデルの視覚推論能力の詳細な評価を可能にする。我々の評価は、現在の生成システムが視覚に基づく推論タスクの一部を解くことができる一方で、信頼性には程遠く、最強モデルであるSeedance 2.0でさえ我々の評価基準の下では51.0%しか達成しないことを示している。さらに、我々の分析は、出力の失敗モード、入力条件への感度、合成データによる微調整からの性能転移の限界、および内部ノイズ除去の観点から、限定的な自己補正——後のステップは主に初期仮説を洗練するだけで、推論エラーを修正しない——を明らかにする。VGI-benchが次世代動画生成モデルの発展を促進する一助となることを期待する。ウェブサイト: https://hexuan21.github.io/VGI-Bench/
科学エージェントは、データ解析、コード実行、研究成果物の生成をますます行うようになっているが、既存のベンチマークの大半は、最終回答、独立したプログラム、あるいは単一の領域に重点を置いている。我々は、300件のエンドツーエンドの科学ワークフローからなるクロスドメインベンチマークであるFrontierChallengeを導入する。本論文では、量子化学、分子動力学、材料特性評価、分析化学、ライフサイエンス、電気化学/環境にわたる97タスクを公開し、評価する。各タスクは固定された入力と、必要とされる科学的成果物一式を規定する。我々は、3つのエージェントスキャフォールドを用いて12のフロンティアモデルを評価する。Pass Rateは完全達成基準を満たすタスクの割合を測定し、Avg. Scoreは部分的な進捗を捉える。最良の設定のそれぞれでも、公開された97タスクのうち完了できたのは20タスクのみで、Pass Rateは20.6%にとどまった。部分的な進捗は、分析化学および電気化学/環境において特に完全な成果物納品への変換が不十分であり、Avg. Scoreは87.6と94.9に達したものの、最高のPass Rateはそれぞれ4%と0%にすぎなかった。Passに至らなかったClaude Codeの軌跡のうち75.5%は、それでも完了を主張する文言で終わっていた。これらの結果は、高い部分スコアも、完了を確信的に主張する文言も、科学的タスクが完全に納品されたことを確実には示さないことを明らかにしており、エンドツーエンドのワークフロー実行と科学的成果物の完全性を併せて評価する必要性を浮き彫りにしている。
大規模並列シミュレーションは、オフ方策強化学習(RL)が訓練されるデータ環境を変化させ、データが限られたリプレイ向けに設計された安定化機構に新たな課題を突きつける。8つのベンチマークファミリーにわたる統制実験を通じて、これらの安定化機構がデータ環境依存性を持つことを示す。すなわち、パラメータ正規化はリプレイのカバレッジが狭い場合には有効であるが、データが豊富な場合には価値関数のフィッティングを制限する。また、クリップ付きダブルQは高スループット操作では緩和できる。エージバイアス付きリプレイ重み付けは、データ環境を問わず学習効率を向上させ、特にネットワーク容量が限られている場合にその効果が顕著である。 これらの知見に基づき、我々はデータ環境適応型のオフ方策RLアルゴリズム群であるWarpsACを提案する。WarpsACは効率的な活用のためにサンプル重み減衰を用い、2つの変種を提供する:データが限られたCPUスケール訓練向けのWarpsAC-L(正規化ON、クリップ付きダブルQ)、およびデータが豊富なGPU並列訓練向けのWarpsAC-A(正規化OFF、単一Q)。WarpsACは、9つのCPUスケール環境でFlashSACに対する正規化スコア・ステップAUCを4.5%向上させ、14のGPU並列環境では23.1%向上させる。UnitreeG1TransportBox-v1の成功率を19.8%から96.4%に引き上げ、MuJoCo Playgroundでの平均正規化ウォールタイムAUCを19.1%改善し、Unitree G1でのシミュレーションから実機への展開をFlashSACよりも36.4%高速化する。これらの結果は、スケーラブルなオフ方策RLはその安定化機構を利用可能なデータ環境に適応させるべきであることを示している。
エージェントの能力は、モデルだけでは決まらない。メモリ管理、計画戦略、アクションプロトコル、ツール/スキルのオーケストレーションを含むエージェントハーネスは、その基盤となるモデルの貢献を凌駕し得る。しかし、ハーネスの設計は依然として手作業に依存し、タスク固有であり、根本的にスケーラブルではない。我々は、任意の既製エージェント型LLMに対して、タスク適応型のエージェントハーネスをその場で合成するよう訓練されたハーネス知能モデルJIT-Agentを提案する。我々はエージェントハーネスを、固定の4モジュールプロトコルに従う構成可能かつ機械生成可能な成果物として形式化し、JIT-Agentに、目の前のタスクに応じたハーネスのカスタマイズ、安定かつ信頼性の高い実行のためのハーネスの修復、そして拡大し続ける過去のハーネス構成のアーカイブから性能シグナルを蒸留することによる自己進化を学習させる。ハーネスヘルパーとしてJIT-Agentを備えたDeepSeek-V4-Flashは、DeepSearchQA (+9.1) とOdysseyBench (+4.3) でGPT-5.6を上回り、既に強力なGLM-5.2は最大+20.2ポイントの向上を達成した。統制評価を通して、JIT-Agentが生成したハーネスは、OpenCodeやClaude Codeなどの成熟したエージェントランタイムと性能面で競合し、DeepSeek V4、Mimo-V2.5、Qwen3.6のマルチスケールモデルファミリーを一貫して改善する。我々の知る限り、JIT-Agentはジャストインタイム・ハーネス生成専用に構築された初のモデルであり、ハーネス知能を、モデルスケーリングと直交する訓練可能かつ転移可能で複利的なエージェント能力の次元として確立する。
ネイティブな視覚推論は、視覚生成を推論自体の媒体として扱う。すなわち、視覚状態(画像や動画)は単に理解すべき入力や描画すべき出力ではなく、言語を超えた問題解決のための第一級の基盤である。しかし、その進展は、スケーラブルな訓練タスク、信頼性の高いフィードバック、そして生成基盤間の制御された比較の欠如によって依然としてボトルネックに直面している。本研究では、生成を通じたネイティブな視覚推論を訓練可能・検証可能・最適化可能・実験的に制御可能にするクローズドループテストベッドVBVR-Proを紹介する。1) タスクのスケーリング。VBVR-Proは視覚推論を、手続き的に生成された300のタスクからなる制御されたタスク空間へと変換する。VBVR-Proで訓練されたモデルは、提案スイートを超えて、RISE-Video、MME-CoF-Pro、BabyVisionなどの7つの外部視覚推論ベンチマークにおいて強い転移を示す。2) 検証可能な報酬。VBVR-Proはタスクに基づいた評価のための検証可能な報酬スコアラーを提供する。主要なMLLMを判定者として用いる体系的な研究を通じて、普及しているVLM-as-a-judgeパラダイムの再発する障害モードを特定する。対照的に、提案するスコアラーは決定的でタスク固有のルールに基づいており、人間の判断との細かな整合性を達成する。重要なことに、これらは大規模マルチタスク強化学習のための信頼性の高い報酬信号として機能し、視覚推論タスク全体において強化学習後のより強い性能を実証する。3) メカニズム研究。VBVR-Proは30以上の画像・動画・インターリーブ生成器にわたる制御されたモダリティ研究を可能にする。我々の分析は、持続的な時空間状態追跡を必要とするタスクでは動画生成が最も強力であり、一方インターリーブ生成は計算効率の高い代替手段を提供することを示している。重要なことに、アブレーションとプロービングは、視覚推論に不可欠な視覚ネイティブな軌跡の存在を示唆している。我々はすべてのデータ、モデル、スコアラー、コードを公開する。
マルチ教師オン方策蒸留(MOPD)は、学生モデル自身のロールアウト上でドメインごとの逆KLダイバージェンスを最小化することにより、複数のドメイン専門家教師を単一の学生モデルへと蒸留する。既存手法は通常、トレーニング前にドメインごとのデータ混合比を固定しており、ドメインによって収束速度が大幅に異なるという事実を見落としている。すなわち、一部のドメインは早期に頭打ちになる一方、他のドメインはトレーニング予算全体を通じて改善し続ける。したがって、固定された混合比は収束の速いドメインに計算資源を浪費し、収束の遅いドメインのトレーニングを不十分なものにする。この問題に対処するため、我々はD^3-MOPD(MOPDのための動的ドメインスケジューリング)を提案する。これは、トレーニング中にすでに生成されているドメインごとの逆KL信号を再利用してドメイン混合比をオンラインで適応させる、ゼロオーバーヘッドのスケジューラである。トレーニングプロセスの外部で非同期に実行されるプロセス外ウォッチャーが、各ドメインのKL軌跡を定期的に追跡し、残存する改善余地と現在の改善率を推定し、中核となるトレーニングループを変更することなくドメインのサンプリング比率を調整する。我々のD^3-MOPDは任意の数のドメインに自然にスケールし、より多くのドメインがスケジューラが活用できる多様な収束パターンをもたらすほど、期待される効果は大きくなる。4つのドメイン専門家教師から蒸留されたQwen3.6-35B-A3B学生モデルにおいて、D^3-MOPDは平均的な学生・教師間の性能ギャップの97%を解消する(バニラMOPDでは63%)。さらに、約3分の1のロールアウトステップ数で同等のピーク性能に到達し、7つのベンチマークのうち3つで専門家教師を上回る。
ヒントベース強化学習は、各ロールアウトの前に専門家の軌跡の先頭部分を保持してポリシーが成功に近い状態から探索できるようにすることで、長期的なエージェントタスクにおける報酬のスパース性に対処する。その効果は、軌跡をどれだけ保持するかというガイダンス深度に依存する。既存手法はこの深度を決定的なスカラーとして扱う。スケジュール型アプローチはサンプル間で単一の値を共有し、タスクごとの不均一性を無視する。サンプルごとのプロービングは追加のロールアウトを犠牲にして個別に推定する。我々は、有用なガイダンスは単一の最適点に集中するのではなく、深度の帯域を占め、その情報量プロファイルが帯域の中心の周りでおおよそガウス分布に従うことを見出す。我々はAgent-G^2を提案する。これは、中心と広がりがポリシー最適化のために既に収集されたロールアウトからオンラインで推定されるガウス分布からタスクごとの深度をサンプリングするガウスガイダンスフレームワークであり、プローブロールアウトや学習された深度予測器を必要としない。中心はグローバルなベースラインとクラスタごとの難易度を組み合わせ、広がりはクラスタ内の分散を追跡する。我々は、Qwen2.5-1.5B / 7B-Instructを用いてALFWorldとWebShopでAgent-G^2を評価する。Agent-G^2は、ALFWorldにおいて、最強のヒントベース、ヒントなし、Aux-RLの各ベースラインをそれぞれ2.3、3.9、7.4ポイント上回り、そのロールアウトコストはサンプルごとのプロービングの3分の1未満である。
近年の研究では、no-CoTデータ(解答過程や教科書の導出など、推論に富む内容を含むものの、明示的なチェーン・オブ・ソート注釈を欠くコーパス)を活用するための次チャンク推論RLが提案されている。この手法は、モデルに暗黙的な推論トレースを生成させ、テキストの次チャンクを予測する能力に基づいて報酬を与えるものである。有望ではあるものの、既存の評価は主に従来のSFTベースラインとの比較に留まっており、性能向上がRLの定式化自体に起因するのか、それともモデルへのno-CoTデータの露出をより効果的に行ったことに起因するのかは未解明のままである。我々はこの問いに取り組むため、次チャンク推論RLの統制された研究と、これまで見落とされてきた単純な代替手法であるMixed SFT(no-CoTデータと長文CoTデータを併せて訓練する単一の教師ありファインチューニング段階)との比較を行う。その単純さにもかかわらず、Mixed SFTは次チャンク推論RLよりも明確に高いRLVR後性能上限を達成し、しかも訓練計算量は60分の1以下である。この利点は、ドメイン内の数学的推論とドメイン外の推論タスクの両方で一貫して観察される。さらに、RLVR前の精度が高いことが必ずしもRLVR後の精度の高さにつながらないことを示し、no-CoT訓練戦略を評価する際には、後続訓練(ポストトレーニング)パイプライン全体の文脈で評価する必要性を強調する。
ビデオ生成は、孤立したクリップから長編ナラティブやインタラクティブなワールドへと進化しており、モデルにはアイデンティティの保持、ユーザー制御への追従、長時間のロールアウトにわたる安定性が求められている。本稿では、2つの目的別バリアントを備えた統合音声-視覚生成システムJoyAI-Echo-1.5を提案する。長編ビデオバリアントは、複数の先行ショットにわたる視覚的証拠を集約するコンポーザブルなクロスショットメモリと、音声フィルタリングを施したショット全体の音声から導出される話者キューを導入し、テキスト、画像、メモリ条件付けの柔軟な組み合わせにわたって、持続的なキャラクター外観と音声アイデンティティを可能にする。ワールドモデルバリアントは、異種のナビゲーション入力を較正されたメトリック6自由度カメラ軌道に変換し、幾何学認識条件付け経路を通じて注入することで、柔軟な視点にわたるコントローラ非依存のインタラクションを実現する。長時間ホライズン生成を効率的にサポートするため、双方向音声-視覚バックボーンを、プログレッシブ教師フォーシングと、自己生成ロールアウトに対する短期・長期ホライズンのSelf-Gradient Forcingを用いて、因果的少数ステップ生成器へと変換する。実験により、両設定において優れた性能が実証された。JoyAI-Echo-1.5は、既存の長編ビデオベースラインと比較して、クロスショット一貫性、視覚品質、テキスト整合性、音声忠実度の各指標で改善を達成している。ワールドモデルバリアントは、平均スコア81.7でWBenchで第1位を獲得し、SANA-WM-Benchで最高の視覚品質と長期ホライズン持続性を達成している。これらの結果は、メモリ、幾何学的制御、ロールアウトを考慮した学習が、一貫性のあるストーリーと継続的に進化するインタラクティブなワールドを生成するための実用的な基盤を提供することを示している。プロジェクトページ: https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/
マルチ教師オン・ポリシー蒸留(M-OPD)は、密なトークンレベルの報酬監視を通じて、ドメイン特化型の強化学習(RL)エキスパート群を単一の汎用学生モデルへ統合する有望なパラダイムとして登場した。その実用的な成功にもかかわらず、マルチ教師による能力統合を支配する最適化ダイナミクスは十分に理解されておらず、厳密に再現可能な公開レシピも顕著に欠如している。本研究では、オラクル・ルーティングを備えたSmolLM3-3B-Base上に制御されたM-OPDベンチマークを構築し、能力統合をルーティングの曖昧性から切り離して評価する。我々の調査は、顕著な能力統合ギャップを明らかにした。標準的なM-OPDは、ドメイン・ルーティング型オラクル・アンサンブルに対する利用可能なヘッドルーム(改善余地)のわずか35.6%しか獲得できず、指示追従などの簡潔なタスクでは深刻な性能低下と早期停滞が生じる。重要なことに、この失敗は勾配競合ではなく、トークンレベルの最適化予算の深刻な誤配分に起因することを示す。この病態は、3つの直交する要因によって引き起こされる。すなわち、ドメイン間の構造的な系列長の不均一性、非一様な学習率による動的収束ドリフト、そして非同期ポリシー更新による多段階報酬の陳腐化である。これらの不均衡を解消するため、我々はトークン共有バランシング、ギャップ認識型動的予算配分、学生報酬リフレッシュを統合した原理的なフレームワークであるOpen-MOPDを導入する。これらのメカニズムは連携して、クロスドメインのバランスを体系的に回復させ、単一のデプロイ可能な学生モデルにおいてヘッドルーム回復率を35.6%から83.4%へと引き上げる。我々は、学術的にアクセス可能なハードウェア予算の下で、エンドツーエンドのポストトレーニングレシピ、トレーニング軌跡、評価スイートを完全にオープンソース化する。
視覚-言語-行動(VLA)モデルはロボット操作において有効性を示してきたが、pi0.5などの最先端モデルは単一フレームパラダイムの下で動作し、過去の観測を保持して精密な空間知覚を獲得する能力が制限されている。本稿では、追加パラメータを一切導入することなく、単一フレームVLAに時間的推論能力を付与する、ストリーミング型マルチモーダル時間モデリングフレームワークであるStreamPIを提案する。中核となる設計は、指示アンカー型時間モデリングである。これは、各(視覚観測、言語指示)ペアを原子的な時間単位として扱う。各ペア内の双方向アテンションによりクロスモーダル融合が可能になり、ペア間の因果的アテンションによって自己回帰的なストリーミング推論が維持される。これにより、言語指示がタスク実行全体を通じて持続的な意味的アンカーとして機能することが保証される。同期学習と非同期の実ロボット展開との間のギャップを埋めるため、ランダム間隔ストリーミング学習戦略を導入する。適切なフレーム間間隔(例: 3フレームごと)により、より高速で滑らかな行動実行が可能になる。さらに、間隔をランダム化することで、フレームタイミングの変動に対するロバスト性がさらに向上し、実際の非同期展開をサポートする。また、LLMバックボーンの長さ外挿能力を活用することで、StreamPIは事前学習済みの単一フレーム重みをシームレスに継承し、柔軟な単一フレームおよびマルチフレーム推論をサポートする。記憶依存および精密知覚シナリオにわたる実ロボットタスクと、シミュレーションベンチマークLIBEROにおける実験により、StreamPIが多様なタスクでpi0.5を上回ることを実証する。
マルチモーダル大規模言語モデル(MLLM)は動画理解において強力な性能を示している。しかし、この領域における指示追従能力は依然として十分に探求されていない。現実世界の動画理解では、モデルは動画コンテンツを正確に解釈するだけでなく、多様なユーザー指定の制約を満たすことが求められる。既存のベンチマークは、指示追従よりもタスク精度に主に焦点を当てており、この能力の評価が不十分なままである。このギャップを解消するため、我々はVideo-IFBenchを提案する。これは、動画理解における指示追従を評価するための包括的なベンチマークであり、モデルは視覚および音声コンテンツに基づく制約を含む、多様なユーザー指定の制約を満たす必要がある。我々は、単一タスク、複数タスク、選択、入れ子構造の指示を含む4つのテンプレートからなる指示タクソノミーを開発し、32のタスクタイプと、意味的要件と形式的要件の両方にわたる39の人手設計の制約カテゴリを網羅する。注釈コストを削減するため、MLLM、プログラムによる処理、人手による検証を組み合わせた半自動データ構築パイプラインを構築し、1.5Kサンプルを作成した。我々は、20以上の最近のMLLMを対象に大規模評価を実施し、動画指示追従が現在のモデルにとって依然として困難であることを示す。特に、多くの制約を含む指示、意味的制約を含む指示、または動画コンテンツに基づいて正しい分岐や経路を選択する必要がある複雑な条件構造を持つ指示が難しい。我々の研究が、動画理解シナリオにおける指示追従に関する将来の研究を促進することを期待する。
ワールドモデルは、複雑な環境が行動やイベントの下でどのように進化するかをシミュレートすることを目的としている。しかし、既存のビデオベースのワールドモデルは主に視覚的観察からダイナミクスを学習する。視覚的観察は結果を明らかにするだけで、世界の進化を支配する根本的な知識、規則、メカニズムを捉えるものではない。これにより、永続的な結果を維持し、一貫性のあるオープンエンドな進化を支援することが困難になる。我々は、言語モデルの推論能力とコーディング能力をビデオモデルの生成的先行知識と組み合わせることで、世界の進化と視覚的実現を分離するフレームワークであるCode World Modelを導入する。コーディングエージェントがワールドブレインとして機能し、イベントとその結果について推論し、実行可能なコードを生成して永続的なワールド状態を維持し、ルールに一貫した進化を実行する。実行可能な状態と視覚生成を接続するために、フレームごとの時空間的制約をエンコードし、プロキシビデオにコンパイルされるプロキシ表現を導入する。このプロキシビデオがビデオモデルを条件付け、高忠実度の視覚的観察をレンダリングさせる。さらに、ゲームプレイと実世界のビデオから整列されたプロキシ・観察ペアを構築するためのデータパイプラインを開発する。ペアのゲームプレイデータでファインチューニングした後、MiniMax-H3は、コーディングエージェントが構築したシンプルなインタラクティブワールドからのプロキシベースの時空間仕様に従いながら、豊かな視覚的詳細とダイナミクスを維持する。これらの結果は、永続的な世界進化のためのコードと柔軟な視覚実現のためのビデオモデルを組み合わせる可能性を示しており、オープンエンドなワールドモデルへの新しい道を提供する。
視覚言語モデルは、視覚的証拠に十分に根拠付けられていない流暢な回答を生成することがあります。裏付けのない物体、チャートの数値、中間推論が一つ含まれるだけで、それ以外は妥当と思われる回答が損なわれる可能性があります。我々は、これがマルチモーダル事後訓練におけるクレジット割り当て(credit assignment)の失敗であると論じます。スカラー結果報酬は回答が許容可能かどうかを示すものの、どの視覚的事実が根拠付けられているか、どの推論ステップが有効か、どの指示制約が見落とされているかを特定しません。我々は、参照回答を原子命題に分解し、生成された回答を視覚的忠実性(VF: Visual Faithfulness)、推論整合性(RC: Reasoning Consistency)、指示追従(IF: Instruction Following)に沿って評価する、視覚的ルーブリックに基づく強化学習(Visual Rubrics-Based Reinforcement Learning)を導入します。得られたルーブリック項目は構造化された部分点を提供し、裏付けとなるエビデンススパンが利用可能な場合には、ルーブリッククレジットを局所化します。 まず、公開されているOpenMMReasoner-SFT-874Kコーパス上でQwen3-VL-8B-Instructをファインチューニングし、OpenMMReasonerのコールドスタートデータレシピを適用してSFTチェックポイントを取得します。次に、17の視覚的根拠に基づくソースから50,248例のトレーニングセットであるV-Rubrics 50Kを構築します。具体的には、ルールベースのフィルタを適用した後、拒否サンプリングスコアから各例の難易度を導出し、その後、すべての例を同一の構造化プロンプトとプロトコルの下でGemini-3-Proを用いてアノテーションします。さらに、同じSFTチェックポイントに基づき、要素別・接頭辞局所化型のルーブリッククレジットを用いてモデルを訓練します。 実験の結果、ルーブリックベースのGRPOは、共通のSFTベースラインと回答のみのGRPOの両方を上回り、特に知識指向型および視覚的根拠に基づく推論ベンチマークで最大の向上を示しました。これらの結果は、ルーブリックが視覚的事後訓練における有用な報酬抽象化であることを示しています。
現代のソフトウェアシステムは、長年にわたる開発を通じて技術的負債を蓄積するため、移行にはコストがかかり、その多くを手作業に依存している。コーディングエージェントがバグ修正においてますます高い能力を発揮するようになるにつれ、そのような移行を自律的に実行できるのだろうか。既存のベンチマークは、移行が実際に発生したかではなく行動的な正しさのみを評価するため、この問いに答えることはできない。この結果、エージェントはテストをパスさせるために元の実装をそのままコピーするという安易な回避策に頼ることができる。我々はこれをブラインドネス(Blindness)と呼ぶ。この問題に対処するため、我々は4種類の技術的負債を対象とする20件のリポジトリ全体の移行タスクからなるベンチマーク「SWE Refactor Bench」を提案する。3段階の評価プロトコルにより、移行の完全性と行動的正しさの両方を測定する。(1) 移行監査(Migration Audit)は、移行が実行されたかを検証する。(2) 行動テスト(Behavioural Tests)は、固定されたテストスイートを用いて正しさを測定する。(3) エージェント型検証(Agentic Verification)は、6つの独立したコーディングエージェントを用いて、隠れた行動の差異を検出するための標的型テストを生成する。8つの最先端モデルと26のモデル・努力量構成による520回の実行のうち、3段階すべてを通過したのは520回中わずか28回(5.4%)であり、20タスク中13タスクでは受理された解が得られなかった。最良のモデル(claude-opus-5)でも47.0/100点にとどまった。移行の完全性と行動的正しさは異なる能力である。一部の実行は移行をスキップして行動を維持し、移行監査で不合格となる。一方、大半の実行は移行を試みて行動を壊し、行動テストで不合格となる。エージェントは完全な移行を達成できない。移行監査を通過した340回の実行のうち、58%が固定チェックの99%に到達する一方、100%に到達したのはわずか26%である。エージェントの能力は移行カテゴリによって異なり、ビルドツールチェーン書き換えでは31.4点を獲得する一方、言語書き換えではわずか5.6点にとどまる。これらの知見により、SWE Refactor Benchは、信頼性の高いリポジトリ全体の移行を実現するコーディングエージェントを開発するための厳密なテストベッドとして位置づけられる。
GUIエージェントはAndroidデバイスに展開されると、予期しないポップアップからアクションの誤使用に至るまで、動的異常にしばしば遭遇する。しかし、既存のベンチマークは実行時異常に対するエージェントのロバスト性を体系的に評価していない。本研究では、エージェントの実行軌跡に動的摂動を注入する包括的ベンチマークAnTrapを提案する。実世界の異常を4つのレイヤー(状態、思考、行動、ラウンド)と10の詳細なサブカテゴリに整理する分類体系を提示し、現実的な敵対的条件を導入しつつタスクの解決可能性を維持する構築パイプラインを開発する。16の主要なGUIモデルを評価した結果、動的異常に対する普遍的な脆弱性が明らかとなり、最強のモデルでさえも著しい性能低下を被ることが示された。さらに、元の環境と敵対的環境の両方でGRPOトレーニングを実施してベンチマークを検証し、環境で学習可能な異常と推論にボトルネックを有する異常を区別する。本研究の知見は、状態レイヤーと行動レイヤーにおける単一ステップのトラップは敵対的強化学習によって大部分が対処可能である一方、状態デッドロックのような深い文脈的トラップは、トラップを含む環境でのトレーニングのみでは解決できない本質的な限界を露呈することを示している。
大規模視覚言語モデルはUI-to-code生成において大きな進歩を示しているが、そのテスト時自己進化は依然として不安定である。まず、我々は「視覚修復結合(visual repair coupling)」と呼ばれる根本的な障害を特定する。これは、局所的なコード編集がレイアウト、スタイル、コンポーネントの依存関係を通じて伝播し、ある視覚的不一致を修正する一方で、以前は忠実だった領域を劣化させるというものである。この問題に対処するため、我々はルーブリック誘導自己進化フレームワークであるRubSEを提案する。RubSEはルーブリックを用いて視覚的フィードバックを構造化された視覚修復コンテキストとして表現する。各改善ラウンドにおいて、RubSEは型付きルーブリック候補を生成し、優先された修復対象を1つ選択し、以前に選択したルーブリックを履歴として保存する。これにより、各改訂を適切に範囲が限定された視覚修復へと導くとともに、繰り返しや過度に広範な変更を抑制する。6つのVLMと3つのUI-to-codeベンチマークにわたる評価は、RubSEが最終ラウンド設定と最良ラウンド設定の双方でナイーブな自己進化を大幅に上回り、より安定した改善軌道と、より高い軌道レベルの性能上限を達成することを示している。さらなる分析では、RubSEが深刻な視覚的退行からの回復を改善することで軌道崩壊を緩和すること、また、より強力なルーブリック生成器が、より弱いコード改善器に対して効果的な視覚修復ガイダンスを転移できることが示される。
コーディングエージェントは、数十回のモデル呼び出し、ツール使用、コード編集に及ぶ長時間実行タスクを遂行する。こうした実行が進むにつれて、ユーザーは現実的なコストと品質のトレードオフに直面する。すなわち、安価なモデルが苦戦する場合により強力なモデルへエスカレーションするか、難しい推論が完了した時点でダウンシフトするかである。切り替えのたびに、受け手側のモデルは別のモデルによって生成された非ネイティブな軌跡(trajectory)を継続しなければならない。我々は、このハンドオフが品質とコストにどのように影響するか、また受け手が引き継ぐ軌跡情報を変化させた場合に結果がどう変わるかを研究する。ClaudeおよびGPTファミリーの低コスト・低能力(LC)モデルと高コスト・高能力(HC)モデルのペアを用いて、ハンドオフの方向、タイミング、インターフェースを変化させ、完全な軌跡転送、圧縮、そしてリポジトリ状態を保持したままの軌跡削除を比較する。両方のモデルファミリーにわたり、完全な軌跡によるエスカレーションはLCからHCへの品質ギャップの半分未満しか回復せず、しかも相当なコスト増加を伴う。我々はこのコスト品質ペナルティを「ハンドオフ税」と呼ぶ。対照的に、ダウンシフトはコストと品質の面で有利な点を提供する。興味深いことに、好ましいインターフェースも方向によって逆転する。すなわち、LCモデルの軌跡情報を減らすとエスカレーションの品質が向上する一方、HCモデルの軌跡を削除するとダウンシフトの品質が低下する。
現代のソフトウェアは、プラグインシステムから自己進化型エージェントハーネスに至るまで、動的合成をますます必要としているが、その形式的基盤は未発達なままである。我々はこの問題の直交する二つの次元を特定する。すなわち、時間的コンポーザビリティ(コンポーネントの除去時にその副作用を完全に取り消す能力)と、空間的コンポーザビリティ(コンポーネント間の依存関係を宣言し、リアクティブに管理する能力)である。 我々は、古典的なエフェクト概念とコエフェクト概念をランタイム機構へと持ち上げることにより、これら二つの次元に対処する。具体的には、可逆エフェクトを形式化する。可逆エフェクトでは、すべての文脈変換がランタイムの保持する逆変換を伴い、単一コンポーネントに局所的な時間的コンポーザビリティを確立する。さらに、リアクティブコエフェクトを形式化する。リアクティブコエフェクトでは、すべての文脈変化がコンポーネントのコエフェクト仕様に照らして分類され、その活性化と非活性化が駆動され、単一コンポーネントに局所的な空間的コンポーザビリティが確立される。 次に、エフェクト文脈とコエフェクト文脈を単一の文脈型へと統合し、あらゆるエフェクトとコエフェクトをその文脈型を通じて仲介する。これにより、我々が「文脈パラダイム」と呼ぶ体系が得られる。この仲介は観察的等価性を誘導し、その等価性のもとで、異なるコンポーネントのエフェクトは互いに干渉することなくインターリーブされる。 これらの機構をコンポーネントの概念へと統合することで、我々は動的合成の計算体系を与える。そのメタ理論は、時空間的コンポーザビリティを単一コンポーネントから、インターリーブされたコンポーネント群からなるシステム全体へと伝搬させる。 我々はこれらのアイデアを、時空間的コンポーザビリティのメタフレームワークであるCordisに実装する。Cordisは、エフェクト追跡とコエフェクト解決を備えたコアライブラリと、設定調整およびホットモジュール置換を備えた宣言的コンポーネントローダーを提供する。
Transformer言語モデルのスケーリングは、表現力とメモリ効率の間に本質的なトレードオフを生み出す。層ごとに固有の重みは、入力への接地から抽象的な精緻化に至る機能特化を維持する一方で、多大なメモリ使用量を伴う。逆に、標準的な深さ方向の重み共有は一様な変換を強制し、表現の多様性を損なってモデリング品質を低下させる。我々は、Gated Recurrent Transformer(ゲート付き再帰型Transformer)を導入する。これは、深さ方向に再帰するTransformerであり、固定深さの前奏(プレリュード)ブロックと結尾(コーダ)ブロックが、R回反復される単一の共有コアを挟み込む。ゲート付き再帰型ニューラルネットワークに着想を得て、我々は軽量な射影と要素単位の更新ゲートを採用する。これらは、隠れ状態、固定された前奏ブロックの出力、および各ステップでリサンプリングされるノイズに条件付けられ、再帰的な更新を変調する。これにより、モデルは、機能的多様性を達成するために多数の固有の層を必要とするのではなく、再帰の各ステップで同じ少数の層に入力を特化させることができる。isoFLOPS制約の下では、3層のGated Recurrent Transformerは、同様の学習および推論FLOPsを持つ12層のGPT-2 Smallベースラインの精度に匹敵し、9つすべてのスケール別予算セルにおいてMoRおよびヘビーテール深さサンプリングを上回る。中規模および大規模では、標準のトークン予算でdenseなモデルの品質に迫り、そのトークン予算を2倍にすると、中規模ではdenseなモデルの品質を上回る。isoPARAMS制約の下では、より深い再帰は、同一のパラメータ数とデータ予算において、非再帰型の対応物の2.84に対して2.76の検証損失を達成する。我々の結果は、適応的深さ再利用が、パラメータを品質と交換するための原理に基づく戦略であることを示している。すなわち、大規模では、コンパイル済み生成レイテンシの10%増加と引き換えに、パラメータを63%、ピーク復号メモリを59%削減できる。
マルチアーム協調は、身体化操作における中核的な能力になりつつある。最近の視覚言語行動(VLA)モデルは、知覚・言語・制御を統合するが、そのほとんどは言語を単一の全体的な指示として表現し、アーム固有の行動を割り当てて構成するための明示的なメカニズムを提供しない。この設計は、訓練中に観察されたものとは異なる協調パターンへの転移を制限する。我々は、原子行動割り当てによるマルチアーム協調のための統一フレームワークMA-VLAを提案する。MA-VLAは協調行動を中間レベルの原子プロンプトに分解し、それらを個々のアームに割り当てることで、明示的なサブゴール指定とタスク横断的な構成再利用を可能にする。固定された実行役割への依存を減らすために、我々はアームシャッフルを導入する。これは、各アームの観測、状態、および割り当てられた原子プロンプトを訓練時に置換する手法である。この置換により、役割に依存しない指示追従が強化され、未見の協調パターンへの再構成が支援される。我々はこれをマルチアーム構成汎化と呼ぶ。また、テスト時の協調パターンが訓練セットに存在しないベンチマークを構築する。シミュレーションと実世界の評価を通じて、従来の最先端VLAモデルはこれらの未見の協調パターンの下ではほとんど失敗する一方、MA-VLAは一貫して成功する。これらの結果は、構造化されたアームごとの原子行動割り当てが、マルチアーム身体化システムにおけるスケーラブルな汎化への実用的な経路を提供することを示している。コード、モデル、データはhttps://github.com/zhangzaibin/future-robotsで入手できる。
ストリーミング自己回帰拡散モデルは、リアルタイムかつ長期間のビデオ生成を可能にするが、その訓練目的は、一貫した世界の幾何学とダイナミクスではなく、局所的なフレーム予測を最適化することにある。そのため、長いロールアウトでは幾何学的ドリフトが蓄積し、静的または不自然な動きに劣化してしまう。近年の双方向アプローチは、3Dガウシアンスプラッティング再構成に基づく報酬信号を用いてこの問題に対処している。しかし、単一の剛体3D再構成は動的なシーンをモデル化できないため、この評価器は真の物体の動きを再構成誤差として罰し、ビデオを静止させることで最大化されてしまう。この近道は、各チャンクが既に静的な構成を伝播させ得る自己回帰(AR)設定において特に有害である。本論文では、Stream4Dを提案する。これは、静的評価器を、シーンのダイナミクスを明示的にモデル化するフィードフォワード4D再構成報酬に置き換え、一貫した動きが高い整合性報酬を受け取ることを可能にする。さらに、動きの大きさと品質を導くため、自然なシーンフローの大きさに報酬を与え、ジッターや非剛体アーティファクトを罰する動きの事前分布を追加する。最終的なレシピは、これら2つの項を軽量な知覚的アンカーと組み合わせる。様々な自己回帰ビデオバックボーンおよび様々な生成ホライズンにわたって、Stream4Dは4D再構成品質を向上させ、動きをより効果的に保持し、人間の選好とより整合した評価を達成する。プロジェクトページ:https://banyuanhao.github.io/Stream4D/
機械学習(ML)に基づく0.1度全球天気予報モデルの開発は、高解像度データの利用可能性が限られているために制約されている。というのも、数十年分の再解析データは0.25度解像度でしか入手できないからである。既存の手法は限られた0.1度サンプルを用いて0.25度予報モデルをファインチューニングするが、本稿では、この転移が粗解像度予報に内在する不可逆的な情報損失によって妨げられることを示す。そこで我々は、モデルの転移からデータの転移へと焦点を移すフレームワークであるBaguanHRを提案する。まず、超解像(SR)が予報よりも低い条件付きエントロピーと入力の増幅を有し、解像度転移のためのよりロバストな手段であることを示す。この利点を変数別のSRを通じて活用することにより、ERA5から大量の0.1度データを合成する。合成データと実データを組み合わせたデータセットにおけるBaguanHRの性能は、MLベースの手法とIFS-HRESの両方を上回り、72時間以内のリードタイムの85%以上で優れた性能を達成する。さらに、我々の発見は冪乗則に従うスケーリング効果を浮き彫りにする。データを2倍に増やすと、72時間予報ではRMSEが4.6%、120時間予報では4.9%減少する。これらの結果は、高解像度MLベース予報のスケーリングが主にデータのボトルネックに制約されること、そして変数別の超解像が、高解像度トレーニングのために長期間の粗解像度再解析データを活用可能にする簡潔かつ一般的な解決策を提供することを示している。
テスト時スケーリングは、追加のテスト時計算を用いて性能を向上させる手法であり、例えば問題を解くときに言語モデルにより長く推論させることを指す。モデルはフルアテンションで推論トレース全体をメモリに保持するため、長い思考を必要とする難しいタスクではコストが法外に高くなり得る。しかし、モデルが推論を続けるにつれて、中間の推論トークンのほとんどは重要度を失うことが分かった。これは、それらを保持する価値がコストに見合うのかという疑問を提起する。この知見に基づき、我々は Prefix Sliding を提案する。Prefix Sliding は、推論中に、プレフィックスまたは直近の数千トークンのウィンドウに含まれないトークンを破棄する。プレフィックスにはモデルが利用できる重要な指示とツールが含まれ、直近のトークン群はモデルが現在取り組んでいる推論である。これにより、推論の長さに関係なく総メモリ要件に上限が設けられ、効率的な長期のテスト時スケーリングが可能になる。訓練なしでも、Prefix Sliding は既存モデルの性能を維持したまま3倍高速化できる。強化学習を用いた Prefix Sliding による訓練は、10万トークンを超える推論トレースへのスケーリングを可能にすることで、より良い性能を達成できる。アブレーション実験の結果、Prefix Sliding は中間トークンを要約する手法や通常のスライディングウィンドウを上回ることが示された。コードは https://github.com/Muennighoff/prefix-sliding にある。
大規模言語モデルは言語によって知識へのアクセスが一貫していないが、異なる言語で対話するとき、そのスキルセットはどの程度異なるのだろうか。本研究は、知識や一般的なベンチマーク性能から直交する形で、言語横断的なスキル不一致を定量化する。このために、多言語自己対戦を用いる。すなわち、同じモデルの2つのインスタンスがテキストベースのゲームで対戦し、それぞれが異なる言語インターフェースを通じて対話する。モデル、対戦相手、ルール、状態空間、利用可能なアクションはすべて固定されているため、この設定はモデルが実際に発現する行動に対する言語の影響を分離する。我々はTextArenaに多言語拡張を構築し、空間推論、不完全情報、資源配分、反復的相互作用を対象とする6つのゲームにわたり、8言語で3つのオープンウェイトモデルを評価する。その結果、同じモデルでも言語によってプレイの強さが著しく異なることがあり、勝敗の差、無効なアクション、戦略的傾向に系統的な変動が見られる。詳細な分析により、空間推論、カード条件付きの意思決定、最適手の選択における言語固有の失敗が明らかになった。一部の設定では、中間推論言語を変更するだけで失われたパフォーマンスの大部分が回復し、言語が意思決定プロセスの異なる段階に影響を及ぼし得ることが示唆される。これらの結果は、スキルの不一致が、真の多言語モデルの開発における測定可能な大きな障害であることを示している。このような不一致をより深く理解することは、言語間でより公平に性能を発揮するモデルの設計に役立つだろう。
ドキュメント検索は、金融・医療・法律における高リスクな情報アクセスを支える存在としてますます重要になっている。現代の検索パイプラインは、モダリティ(テキストまたはマルチモーダル)と検索アーキテクチャ(デンスまたはレイトインタラクション)の両方において多様である。これらの選択は深刻なトレードオフを強いる。最も効果的なパイプラインは大規模運用には遅すぎ、コストが高すぎる一方、最速のものは複雑な文書から証拠を検索できない。したがって実務者は、証拠の見逃しと実用に耐えないレイテンシのどちらかを選ばざるを得ず、クエリ単位でその選択を調整するための原則的な基準は存在しない。本稿では、このトレードオフが不要であることを示す。すべてのクエリが同じパイプラインを必要とするわけではない。金融および科学コーパスにわたるベンチマークにおいて、静的なパイプラインが支配的であることはない。我々は、クエリテキストのみから各クエリに最適な検索パイプラインを学習する軽量なクエリ認識型ルーター、RetrievalRouter を提案する。単一の調整可能パラメータによって精度とレイテンシの完全なフロンティアを実現でき、すべての静的ベースラインに対して、RetrievalRouter は同時により高精度かつ高速な動作点を提供する。最良の静的ベースラインと比較して、RetrievalRouter は精度が2.5%向上し、速度は12.4倍速い。さらに、従来の適応的戦略選択手法と比較して、RetrievalRouter は精度重視設定では nDCG@5 が有意に高く、レイテンシ重視設定では nDCG@5 とレイテンシの両方において同等以上(数値的に上回る)の性能を達成する。我々のコードとデータは https://github.com/emrekuruu/retrieval-router で公開している。
コンピュータ操作エージェントは、自然言語の指示をスクリーンショット内のインターフェース要素の特定に対応付けるが、既存のベンチマークは、モデルが関係表現を正しい要素に結び付けることができるかどうかを切り分けて評価していない。我々は、グラフィカルユーザーインターフェースにおける7つの空間関係(左/右、上/下、包含、整列、近接、リスト順序、遮蔽)にわたる対照的な指示ペアからなる994項目のベンチマーク、GUI-Primitivesを導入する。各ペアは、関係表現を変更する一方でスクリーンショットとアンカーを固定し、正解ターゲットが指定された2つの候補の間で移動するようになっている。5人のアノテータが196項目のサブセットを検証した(整形式性κ=0.94、ターゲット選択κ=0.79)。19の視覚言語モデルは、厳密なポイントインボックス精度で最大32%に達するにとどまる。モデルは制約のない座標を出力するため、各予測を、それが含まれる候補領域によって分類する。予測は、項目の60〜92%において両方の候補の外側に位置する。候補領域内に収まるという条件の下では、ターゲット選択は水平位置、垂直位置、近接、リスト順序について0.82〜0.90に達するが、包含と遮蔽については0.50と有意な差がない。すなわち、ほとんどの失敗は関係理解ではなく、候補の位置特定に起因する。10モデルにわたって、ベンチマーク精度はScreenSpot-Proの精度と相関し(スピアマンρ=+0.74)、これはこのサンプルサイズにおける探索的な関連である。指定された2つの候補をマークすると、選択精度は35〜57パーセントポイント向上する。これは、実運用可能な手法ではなく、候補セットを提供するオラクル診断である。我々は、ベンチマーク、予測、コードを公開する。
信頼性の高い報酬モデルは、テキストから動画への評価とアライメントに不可欠です。しかし、評価精度と推論効率の間のトレードオフは、トレーニング時の教師信号の質に高い要求を課します。既存の手法は、固定されたルーブリックを用いる全体的判定器や自由形式の推論に依存することが多く、結果として、検査の不完全さ、不正確な根拠付け、帰属の混在を招いています。我々は、check-before-score原則に基づく統一的なチェックリスト駆動データ構築フレームワーク、FIRM-Videoを提案します。これは、次元別チェックリストを構築し、各基準を時間的視覚エビデンスに照らして検証し、検証済みの判定のみを集約するものです。命令追従においては、FIRM-Videoはプロンプトを重み付きの原子的要件に分解します。世界一貫性においては、可視のエンティティと行動に基づく、プロンプト調整済みの対象特異的チェックを構築します。知覚品質においては、視覚的欠陥の一般的な分類法を適用します。検証済みの基準とスコアは、さらに自然言語による分析へと変換され、エンドツーエンドの報酬モデリングに利用されます。続いて、我々は29,348本の動画から88,044件の次元別インスタンスを備えるFIRM-Video-90Kを構築し、250本の動画にわたる750件のポイント単位の人手アノテーションを備えるFIRM-Video-Benchを導入します。Qwen3-VLベースのFIRM-Video-8Bは、FIRM-Video-Benchにおいて最良の総合MAEを達成し、3つの動画生成器におけるBest-of-8サンプリングでは、VBenchのTotal、Quality、Semanticスコアを一貫して最高とします。
既存の共話ジェスチャ生成手法は、主にオフライン設定で研究されており、そこでは完全な音声セグメントからジェスチャが合成される。しかし、実世界のシナリオにおける対話型デジタルヒューマンは、厳格な遅延制約の下で、現在利用可能な応答音声のみを使用して、音声に同期したジェスチャをオンラインで生成する必要がある。その結果、従来手法は、将来の音声情報に依存するか、または相当な推論遅延を招くため、リアルタイム対話には適さない。本論文では、対話型デジタルヒューマンのためのオンライン共話ジェスチャ生成を定式化し、ストリーミング音声応答モジュールとオンラインジェスチャ生成モジュールを結合したリアルタイム対話型フレームワークを提案する。具体的には、ジェスチャ生成器は、ストリーミング応答音声と動作履歴から身体動作を予測する因果的マルチモーダル自己回帰モデルとして設計され、将来の音声にアクセスすることなく、低遅延かつ音声に同期したジェスチャ合成を可能にする。この設定を支援するために、仮想コンパニオンシナリオに特化したオフラインデータ合成パイプラインをさらに提案する。これは、トピックと感情を考慮した主題コーパスを活用して多様な人間とエージェントの対話を構築し、次にエージェントの応答に条件付けられた共話ジェスチャを生成する。さらに、オフラインデータ構築とオンライン展開の間のギャップを埋めるために、オンライン対話中に収集されたユーザーフィードバックをデータ生成プロセスに組み込む自己進化型トレーニングループを確立し、ユーザーの好みへの継続的な適応を可能にする。広範な実験により、我々のフレームワークは、競合する既存のベースラインよりも、より優れた遅延品質トレードオフ、より強力な音声と動作の同期、およびより高いユーザー嗜好性を達成することを実証する。プロジェクトページ: https://super-star-2026.github.io/
LibriBrain100は、音声デコーディングのための大規模MEGデータセットであり、再現可能で標準化された評価のためにゼロから設計されている。LibriBrain100は元のLibriBrainリリースの規模を2倍以上に拡大し、被験者が自然な連続音声を聴取している間に収集された100時間以上の高品質MEGを提供する。単一被験者からの約80時間のデータにより、LibriBrain100は被験者内の深い神経データの新記録を樹立する(次に匹敵するデータセットの8倍、他のデータセットのおよそ80倍)。この深さ優先設計の効果を示すために、我々は単語分類ベンチマークで評価を行う。これは、非侵襲的な脳からテキストへのデコーディングという未解決の課題に向けた、ますます確立されつつある足掛かりである。既存のデコーディングモデルを用いて最先端の性能を達成し、記録の品質と大規模な被験者内データの価値の両方を検証する。実世界の応用ではユーザーごとに80時間のデータを収集することは現実的ではないため、32名の被験者それぞれから約40分の追加データも収集した。同じ単語分類ベンチマークを用いて、広範な多被験者データの価値を示す。事前学習モデルの教師ありファインチューニングは、被験者ごとの限られたデータを大幅に補うことができる。我々は標準的な訓練、検証、テスト分割を提供し、これらはすべてオープンソースのPythonライブラリを通じて再現可能である。このライブラリは、簡単なダウンロード、任意の前処理、一般的な深層学習フレームワーク向けのデータ読み込みをサポートする。さらに、データセットと評価インフラストラクチャは、標準化されたベンチマーキングのための公開リーダーボードを備えたオープンな機械学習コンペティションとともに公開されている。最終的に、LibriBrain100が、重度の麻痺を抱える人々にコミュニケーションを回復させることができる実用的な非侵襲的ブレイン・コンピュータ・インターフェースへの進歩を加速することを期待している。
放射線レポート生成と構造化画像理解を支援することを目的とした将来の医用視覚言語システムにとって、信頼性の高い空間理解は重要な前提条件である。現代の視覚言語モデル(VLM)は多くの医用画像タスクで有望な性能を示しているものの、最近のエビデンスは、それらが制御された空間推論において依然として弱く、空間関係を画像エビデンスに確実に接地できないことが多いことを示唆している。放射線学的推論が解剖学的構造と所見の相対位置の理解に依存していることを考慮すると、この空間的理解の弱さは診断精度にリスクをもたらす。本稿では、軸位CTスライスにおける二値空間関係検証のためのモジュール型医用画像エージェントを提示する。本システムは、空間的答えをエンドツーエンドで直接予測するのではなく、タスクを言語解析、解剖学的位置特定、決定的幾何検証という明示的な段階に分解する。自然言語クエリは構造化関係タプルに変換され、クエリ対象の臓器はYOLOベースの検出器で位置特定され、最終的な空間判定はオブジェクト中心から決定的幾何ルールを用いて計算される。本アプローチをホールドアウトされたMIRP空間QAベンチマークで評価し、代表的なエンドツーエンドVLMベースラインと比較する。最良のハイブリッド構成は94.1%の精度と94.2%のF1を達成し、精度において直接的なQwen2-VLプロンプティングを42.5パーセントポイント上回るとともに、解釈可能な中間表現と監査可能な推論段階を保持する。これらの結果は、明示的なモジュール型空間検証が、将来のレポート生成指向医用画像エージェントの有望な構成要素となり得ることを示唆している。
ターンテイキングは人間の会話における基本的な組織化の特徴であり、自然で同期型の対話システムにおいてモデル化が難しいとされている。既存研究では、ターン終了予測のためのマルチモーダル手法や大規模言語モデルが検討されてきたが、トルコ語のターンテイキング動態に特化した自然主義的会話コーパスは不足している。本研究では、台本なしの二者間インタラクションからなるトルコ語のマルチモーダル会話データセットを紹介する。このデータセットには、同期された正面カメラ映像、重なり発話を個々の話者に帰属させることを可能にする話者別音声チャンネル、および時間整列された書き起こしが含まれる。ターンテイキング予測は二値分類問題として定式化され、視覚的特徴・音響的特徴・言語的特徴から導出される解釈可能な決定ルールを最適化するために遺伝的アルゴリズム(GA)が用いられる。提案フレームワークでは、ターン移行に先行する代替的な手がかりの組み合わせを表現するために、ハイブリッドなAND-ORルール表現が採用される。