翻訳付きの日次キュレーションされたAI研究論文
Vidu S1は、デジタルキャラクターの音声制御に対応したリアルタイムインタラクティブ動画生成モデルです。ユーザーは音声指示を通じて、いつでも動画生成コンテンツを制御できます。Vidu S1は、ぼやけやドリフト、視覚的な歪みを生じることなく、無限長のリアルタイム動画生成をサポートします。TurboDiffusionとTurboServeを基盤に構築されており、一般的な消費者向けGPUで最大42 FPS、540pのリアルタイム動画出力を実現します。ユーザーは実在人物、アニメ、ペットなどのカスタム画像をアップロードし、異なる音声トーンを選択してパーソナライズされた体験を楽しめます。実験結果では、Vidu S1はすべてのテスト指標において最高のパフォーマンスを達成し、リアルタイム推論の要件を完全に満たしています。プレイ可能なオンラインデモはhttps://vidu.com/vidu-streamでご覧いただけます。
動画理解の内在的な複雑さゆえに、Video-LLMのベンチマーク性能が視覚認知、言語推論、あるいは知識の事前性のいずれに起因するのかを判断することは困難である。高レベルの推論を評価する多くのベンチマークが登場してきた一方で、動画理解を評価するための共通基準は依然としてほとんど注目されていない。我々は新たなベンチマークを導入する代わりに、一歩引いて動画理解の評価基準を再検討する。本稿では、既存の動画理解ベンチマークを体系的に監査するための持続可能な診断スイート、Video-Oasisを提案する。この監査により、既存のベンチマークサンプルの55%が視覚入力や時間的文脈なしで解けることが明らかになった。これらの近道を取り除いた後、残った動画本来の課題は、大きな能力ギャップを露呈する。すなわち、最先端のモデルでさえランダムな推測をわずかに上回る性能しか示さないのである。これらの知見に基づき、抽出された課題をテストベッドとして、どのアルゴリズム設計の選択が頑健な動画理解に寄与するかを調査する。本研究が、厳密な動画ベンチマークの構築と将来のVideo-LLMの評価のための実用的な基盤を提供することを願っている。コードは https://github.com/sejong-rcv/Video-Oasis で入手可能である。
ゼロショット合成動作認識(ZS-CAR)は、過去に観測したプリミティブから構成される新しい動詞-目的語の組み合わせを認識することを必要とする。本研究では、主要な失敗モードに取り組む。すなわち、モデルが時間的証拠ではなく、物体駆動のショートカット(教師ラベルが付された物体クラスに依存すること)を介して動詞を予測する点である。我々は、疎な合成的教師信号と動詞-目的語間の学習非対称性が、物体駆動のショートカット学習を促進し得ると主張する。提案する診断指標を用いた分析により、既存手法が学習時の共起パターンに過適合し、時間的な動詞の手がかりを十分に活用していないため、未観測の合成への汎化が弱いことが示された。物体駆動のショートカットに対処するため、我々はRobust COmpositional REpresentations(RCORE)を提案する。これは二つの要素から成る。Co-occurrence Prior Regularization(CPR)は、未観測の合成に対する明示的な教師信号を追加し、頻繁な共起事前分布をハードネガティブとして扱うことで、それらに対するモデルの正則化を行う。Temporal Order Regularization for Composition(TORC)は、時間順序への感度を強制し、時間的に基づいた動詞表現を学習する。Sth-comおよびEK100-comにおいて、RCOREはショートカット診断指標を低減し、その結果として合成汎化を改善する。
大規模言語モデルとマルチモーダル大規模言語モデルの急速な発展により、日常的なツールを操作し、実世界環境でユーザーを支援できるプロアクティブエージェントの出現が加速している。しかし、既存のベンチマークは、サンドボックス環境や単一ターン評価パラダイムに依存することが多く、このようなエージェントを効果的に評価するのに苦慮している。さらに、そのシナリオベースのタスク分類は、同じタスクカテゴリ内で複数のモデル能力を混在させており、エージェントの失敗の根本原因を特定することを困難にしている。これらの制限に対処するため、我々はUniClawBenchを紹介する。これは、動的な実世界環境においてプロアクティブエージェントを評価するために設計された初の能力駆動型ベンチマークである。UniClawBenchは、5つの基本的なモデル能力(スキル使用、探索、長文脈推論、マルチモーダル理解、クロスプラットフォーム連携)を基盤として構築されている。これらの能力に基づき、我々は400のバイリンガル実世界タスクを設計した。静的な事前記録された回答に依存する従来のベンチマークとは異なり、我々のベンチマークは、詳細なステップバイステップの完了チェックポイントを用いて、ライブのDockerコンテナ内でエージェントを評価する。さらに、我々は実行エージェント、隠れ監督エージェント、ユーザエージェントから構成される閉ループ評価戦略を設計し、評価基準を漏洩させることなく、現実的なマルチターンの人間フィードバックをシミュレートする。ベースモデルの能力とフレームワークレベルの設計選択を切り離すために、我々は複数のエージェントフレームワークの下で最先端モデルを評価する。モデルとフレームワークの両方にわたる包括的な比較を通じて、ベースモデルの能力とエージェントフレームワークの設計が、実世界環境での性能をどのように共同で形成するかを示す。将来の研究を促進するために、我々のベンチマークとコードをhttps://github.com/HKU-MMLab/UniClawBenchで公開している。
科学的なアイデアが白紙の状態から始まることはほとんどない。それらは、生物のゲノムと同様に、既存の仕組みを受け継ぎ、既知の限界を修復し、先行研究の断片を再結合する。しかし、現在のベンチマークでは、AIシステムがこの継承構造に従えるかどうかを評価することはほとんどできない。本稿では、科学的な系統推論および系統に基づくアイデア生成のためのベンチマークであるIdeaGene-Bench(IG-Bench)を提案する。IG-BenchはIdeaGeneフレームワークに基づいて構成されている。各論文や提案は、最小限で型付けされ、エビデンスに基づくIdea Genomeオブジェクトの集合として表現され、GenomeDiffがこれらのオブジェクトを整列させ、6つの操作的な進化ダイナミクス(継承、突然変異、喪失、外部からの導入、新規挿入)を記録する。本ベンチマークは、10の科学領域にわたって1,961件のゴールデン系統トレース、1,085個の厳選されたIdea Genomeオブジェクト、920件のペアワイズGenomeDiffレコードを含む。2種類の評価をサポートする。IG-Exam(42タスクタイプ、1,029インスタンス)は、Idea Genomeの抽象化、継承追跡、進化推論、系統検証にわたるクローズドフォームの系統推論をテストする。IG-Arenaは、系統条件付き集団進化スコア(PES)を用いて生成を評価し、提案が与えられた系統集団の一貫した子孫として挿入可能かどうかを問う。すなわち、適切なIdea Genomeオブジェクトを継承し、近接する研究から有意に変異し、将来の研究に対して選択的価値を提供する必要がある。14のLLMベースの科学者による実験では、構成上のボトルネックが明らかになった。最も強力なシステムでも、系統推論における完全一致精度は27.3%にとどまり、構造化された系統コンテキストは、すべての参加者に一様に利益をもたらすのではなく、システムのランキングを再編成した。
疎なイベントストリームから高品質な映像を復元することは難しい課題である。回帰手法ではしばしばテクスチャがぼやけ、既存の生成モデルは長期的な安定性に課題を抱える。我々はLongE2Vを提案する。これは事前学習されたビデオ拡散事前分布を活用し、イベントベースの映像再構成、予測、フレーム補間を統合的に扱う新しいアプローチである。基本となる映像モデルをファインチューニングすることで、高いデータ効率と優れた知覚品質を実現する。極めて長いシーケンスにおける時間的ドリフトを軽減するために、自己回帰的展開と適応的コンテキスト切り替えを導入する。また、フレーム補間における正確な双方向整合性を保証するために、交差残差補正を伴う再エンコーディングアライメントを提案する。さらに、イベントボクセル密度拡張により、異なるセンサ解像度間でのロバスト性を確保する。実世界ベンチマークにおける広範な実験により、LongE2Vはこれら3つのタスクすべてにおいて最先端手法を上回り、優れた時間的コヒーレンスとゼロショット汎化を示す。プロジェクトページ: https://cdfan0627.github.io/LongE2V-page/
本研究では、インコンテクストパノラマ生成のための二段階フレームワーク「Canvas360」を提案する。これは、幾何認識事前学習と下流タスク固有のファインチューニングを組み合わせたものである。インコンテクストパノラマタスクに特化した大規模かつ高品質な訓練データの不足に対処するため、スタイル変換、インペインティング、アウトペインティング、編集のための100万個の高品質なペアパノラマサンプルからなるデータセット「Canvas360Dataset」を構築し、多様なインコンテクスト生成シナリオにおいて効果的な教師信号を提供する。モデリング面では、Canvas360は並列深度生成、速度円形パディング、類似度損失正則化を通じてテキストからパノラマへの生成を強化し、モデルが幾何認識表現を学習し、物体の歪みの詳細を捉え、幾何的一貫性と全体的な整合性を向上させることを可能にする。さらに、強力なパノラマ事前知識を活用し、Canvas360はトークンレベルの連結を通じて多様な下流タスクをサポートする統一的なインコンテクストパノラマ生成フレームワークを実現し、タスクのカバレッジとモデリングの柔軟性の両方において従来手法を凌駕する。広範な実験により、Canvas360はパノラマ画像の忠実度を改善し、特にパノラマ特化のFAEDメトリックにおいて顕著な性能を示し、報告された定量的評価において競争力のあるまたはトップクラスの結果を達成することが示された。詳細はプロジェクトページ(https://zry000.github.io/Canvas360/)を参照されたい。
現在の創薬における計算論的手法は、通常、特定の標的や一般的な分子特性に基づいて分子を生成することに焦点を当てており、疾患コンテキストが標的挙動や治療成績に与える影響をしばしば無視している。この課題に対処するため、我々は疾患オントロジーと標的タンパク質配列の両方を条件として低分子を設計する新規生成モデルDrugGen-2を提案する。DrugGen-2は、既承認薬とその疾患・標的を関連付けた厳選データセットに基づき、事前学習済みGPT-2モデルを教師ありファインチューニングと、それに続くグループ相対方策最適化(GRPO)による強化学習の2段階戦略を用いて微調整することにより開発された。このプロセスは、化学的妥当性、新規性、多様性、および高い予測結合親和性を最適化する報酬関数によって導かれた。糖尿病性腎症に関連する5つのタンパク質標的で評価したところ、DrugGen-2はベースラインモデル(DrugGPTおよびDrugGen)を有意に上回った。独自性の高い分子を生成する優れた能力を示し、既承認薬との構造的類似性が高く、全標的において改善された予測結合親和性を達成した。分子ドッキング解析によりこれらの知見はさらに支持され、強い結合ポテンシャルを有する候補リガンドが同定された。その中には、アンジオテンシン変換酵素に対する参照薬エナラプリルの結合親和性(-8.283)を上回る予測親和性(-9.917、-9.485、-9.367)を示す化合物も含まれていた。疾患特異的コンテキストを分子生成に統合することで、DrugGen-2はAI支援創薬を進展させ、疾患と分子標的の複雑な相互作用を考慮したデノボ設計やドラッグリポジショニングのための強力なツールを提供する。
モバイルデバイス上での画像から動画への生成に対する需要の高まりに伴い、バレットタイム、ドリーズーム、スローモーションといった映画的な動きの効果への関心がますます高まっている。拡散トランスフォーマー(DiTs)は動画生成において優れた性能を示す一方で、その大規模なパラメータサイズと多段階の反復的ノイズ除去プロセスが大きな計算オーバーヘッドを生じさせ、モバイルデバイス上での効率的な生成を困難にしている。我々はこのギャップを埋めるためにCineMobileを提案する。具体的には、CineMobileは以下の3つの最適化戦略を採用する。(1)蒸留誘導型プルーニング手法を活用し、映画的効果に必要な本質的な動画生成能力を保持しつつ、コンパクトで効率的なモデルを導出する。(2)拡散蒸留と強化学習の組み合わせにより、圧縮されたモデルを4ステップ生成器へと最適化する。(3)ハイブリッドな学習後量子化戦略を採用し、モデルのフットプリントを1 GB未満に圧縮する。実験結果によれば、Wan 2.1アーキテクチャを備えた教師モデルと比較して、CineMobileは同等の視覚品質を維持しながら、生成において40倍の高速化を達成する。具体的には、CineMobileは49フレームの480p動画を生成する際、NVIDIA H200 GPU上で1ステップあたり0.6秒、MediaTek Dimensity 8400 Ultimate 5Gプラットフォーム上で20秒のノイズ除去レイテンシを実現し、ピークメモリ使用量は1.8 GBであり、モバイルベースの画像から動画への生成における実用的な適用可能性を示している。
近年、大規模言語モデル(LLM)は、検索拡張生成(Retrieval-Augmented Generation)、リポジトリレベルのコーディング、エージェントワークフローといった長文コンテキストアプリケーションにますます導入されている。これらのアプリケーションでは、累積された推論やツールのトレースにより、入力が事前学習ウィンドウを一桁超えることが日常的であり、その結果、ゼロショットコンテキスト拡張がオープンウェイトチェックポイントの主要な展開経路となっている。既存のゼロショット手法のほとんどは、事前に単一の再スケーリング係数を固定するため、積極的な係数は短いコンテキストの忠実性を犠牲にし、保守的な係数は長いコンテキストでは機能しなくなる。本論文では、チューニング不要のゼロショット手法であるJet-Longを提案する。これは、局所的なRoPE忠実ウィンドウと、現在の系列長に動的に適応する再スケーリング係数を持つ長距離ウィンドウを組み合わせることで、短い入力ではベースモデルを完全に復元し、長い入力ではクリーンに外挿する。包除注意マージと、オンザフライで行われるRoPE補正回転により、この二焦点構成は推論時に実質的にオーバーヘッドを生じない。単一のCuTeカーネルに統合され、長コンテキストプレフィルはH100上でFA2スループットの最大1.39倍に達し(Hopper専用のFA4に迫る)、シングルバッチ生成はあらゆる長さにおいて4%以下のオーバーヘッドしか発生させない。最大128KコンテキストのQwen3-1.7B/4B/8Bにおいて、Jet-LongはRULERで最強のベースラインを1.7B/4B/8Bそれぞれ+4.79/+2.18/+2.03pp上回り、HELMET-RAG(HELMETが下流の長コンテキスト性能の最も効率的な予測指標として特定したベンチマーク)で最高の全体精度を達成し、PG-19パープレキシティで最低値を記録した。Jet-Longはまた、Jet-Nemotronのようなハイブリッド注意アーキテクチャにも一般化し、再学習なしで長コンテキスト改善をさらに進め、ハイパーパラメータに対して頑健であり、展開の容易さを維持する。
自己注意機構により各トークンは全コンテキストから情報を取得できるが、系列長に対する二次コストによって長いコンテキストでの学習と推論が制限される。本稿では、ソフトマックス注意と、4つの最近のリカレント線形注意アーキテクチャ(DeltaNet、Gated DeltaNet、Kimi Delta Attention、Gated DeltaNet-2)の比較研究を提示する。これらの機構を共通のリカレントメモリ表記で表現し、表現力、メモリ減衰、消去および書き込み制御、トレーニングスループット、実装の複雑さにおいてどのように異なるかを明示する。実験は、150億トークンで学習された3億5000万パラメータモデルを中心とし、オプティマイザと学習率の比較、ハイブリッドスタックと純粋スタックの比較、系列長の実行時間測定、13億および30億パラメータでのより大規模なDeltaNet実行、および少数の下流評価を含む。報告される速度結果は、トレーニングスループットとイテレーション時間を測定したものであり、推論速度の実証的なベンチマークは提供しない。報告された3億5000万パラメータ、150億トークンのスイープにおいて、Muonを用いたKimi Delta Attentionが最も低い最終検証損失に達し、AdamWで学習された純粋なGated DeltaNetスタックが最も高い正規化トレーニングスループットを持ち、ハイブリッドスタックは一般にスループットのコストで損失を改善し、Muonは評価した一致したアーキテクチャ設定においてAdamWと比較して一貫して最終検証損失を低減する。我々は、DeltaNetスタイルのメモリに対する軽量なクロス層ルーティング機構を導入し評価する。最も自然なDeltaNetに着想を得た定式化、すなわち下層のデルタルール書き込み誤差を次の層の値ターゲットに転送する方法は、一致したベースラインを上回らない。代わりに整列された隠れストリームへのルーティングと書き込み値の転送は、報告する一致した実行において控えめな改善をもたらす。クロス層バリュールーティング(CLVR)は、DeltaNetとGated DeltaNetの両方で最終検証損失を低減する。
強化学習(RL)は、大規模言語モデル(LLM)の複雑な推論能力を強化するための標準的なパラダイムとなっている。サンプル効率を達成するため、現代のRLフレームワークは重要度サンプリング(IS)に依存している。しかし、これらのアルゴリズムは探索と安定性のジレンマに直面する。純粋なISはしばしば壊滅的な訓練の不安定性を引き起こす一方、この不安定性を緩和するために用いられる標準的なクリッピング機構は、ポリシーの更新予算を厳しく制約する。確率容量(Cap)の概念を形式化することにより、保守的なクリッピングが、正しいが低信頼度の推論経路に対する更新予算を早期に打ち切ることで、探索を構造的に抑制することを明らかにする。これらの制約から解放されるために、我々はUnbounded Positive Asymmetric Optimization(UP)を提案する。これは普遍的でプラグアンドプレイな目的関数である。UPは、ストップグラデーション演算子を介してポリシーを現在の状態に固定することで、最適化プロセスを理論的に再構築する。この非対称な設計により、正のアドバンテージに対してはクリッピングなしの安定した勾配を解放して探索を最大化し、負のアドバンテージに対しては標準的なクリッピングの保護を維持して訓練の不安定性を防止する。さらに、我々の定式化は、トークンレベル(GRPO、DAPO)およびシーケンスレベル(GSPO)のフレームワークを含む、異なる最適化粒度に容易に拡張される。大規模な実験により、UPが多様なRLアルゴリズム(DAPO、GSPO、GRPO)、モデルアーキテクチャ(Dense、MoE、視覚言語)、訓練様式(言語およびマルチモーダル)にわたって探索能力を向上させ、優れた推論精度を達成することが示され、UPがRLベースの訓練に対する真に普遍的なプラグアンドプレイの強化手段であることが検証された。
長期的なタスクにおいて、意思決定に関連する状態は拡大する軌跡全体に散在することが多く、行動エージェントはそれを浮き彫りにして行動しなければならない。軌跡が長くなるにつれて、タスク要件、環境の事実、過去の試行、診断、未完了のサブゴールは、コンテキストウィンドウに埋もれたり、その外に押し出されたりして、必要な時に意思決定に影響を与えなくなる。この障害モードを「行動状態減衰」と呼ぶ。本稿では、記憶を受動的な検索ではなく、能動的な介入メカニズムとして研究する。独立した記憶エージェントが未修正の行動エージェントと並行して動作し、最近の軌跡から構造化されたメモリバンクを更新し、記憶に基づくリマインダーを注入するか、沈黙を保つかを決定する。このモジュールは、フロンティアの行動エージェントや既存のエージェントハーネスに対してプラグアンドプレイで利用できる。Terminal-Bench 2.0およびτ^2-Benchにおいて、弱い行動エージェントと強い行動エージェントの両方でpass@1が向上し、Terminal-Benchでは+8.3ポイント、τ^2-Benchでは+6.8ポイントの改善が見られた。アブレーション実験により、選択的介入が受動的バンク露出、常時注入、アドバイザーのみのガイダンス、一般的な検索よりも優れていることが示された。オープンウェイト記憶ポリシーへの初期ステップとして、SETAに対してSFTおよびGRPOを用いてQwen3.5-27Bを訓練し、検証報酬を改善し、Terminal-Benchへの部分的な転移を達成した。
磁気共鳴画像法(MRI)の超解像は診断のアクセシビリティ向上に不可欠であるが、ほとんどの手法は固定された低解像度入力から高解像度ターゲットへの決定論的変換として扱う。このアプローチは、空間分解能と信号対雑音比が本質的に結合しており、任意の低解像度スキャンは様々な取得トレードオフのもとで生じる多数の可能な実現値の一つに過ぎないという、MRI取得物理の重要な性質を見落としている。本稿では、MRI超解像を物理を考慮した再構成問題として再考する。その目標は最適な分解能-信号対雑音比構成を特定し、それを超解像することで高品質なMRI結果を得ることである。この定式化の重要な含意として、MRIの分解能は固定ではなく動的となる。このような分解能が不均一な入力を扱うために、2次元ガウススプラッティング(2D GS)をMRIに適用し、再構成を座標ベースで分解能に依存しないレンダリング問題として定式化する。さらに忠実度を高めるため、以下の3つの革新を導入する:(1)解剖学的構造事前分布に基づき組織特異的なカーネル初期化を行うAnatomical Structure Priorと、共分散辞書を介してハードウェア特性を捉えるImaging System Priorを組み合わせた事前分布考慮型ガウス表現、(2)内在的組織パラメータ(プロトン密度ρおよび実効緩和率R2)を予測し、支配的な物理方程式を通じて信号強度を合成することで生物物理学的に妥当なコントラストを保証する物理制約付き信号モデリング手法、(3)シミュレーションデータで事前学習し実環境に適応することでペアデータの不足を緩和するメタ学習フレームワーク。動的分解能データセットおよび標準ベンチマークにおける広範な実験により、本手法が最先端の性能を達成し、臨床展開への強い可能性を示すことを実証する。
テキストから画像生成における推論時スケーリングは、単純なBest-of-N(BoN)サンプリングから、中間ノイズ除去ステップで候補軌跡を検証し誘導する誘導探索手法へと進展してきた。これらのアプローチは、ノイズ除去中にいつ、どの程度の頻度で検証を行うかに焦点を当てているが、生成自体のコストは固定とみなすことが多い。さらに、関数評価回数(NFEs)により手法を比較する標準的な手法は、ノイズ除去の順伝搬のみをカウントし、検証器のオーバーヘッドを無視するため、効率のランキングが歪む可能性がある。実時間評価の下では、単純なBoNが既にいくつかの誘導探索手法と同等かそれ以上であることを示し、計算リソースは反復的な中間検証よりも広範な探索に費やす方が有効であることを示唆する。これによりFlash-BoNが動機づけられる。Flash-BoNは、タイムステップ打ち切り、レイヤースキップ、活性化プロキシという3つの相補的な高速化ノブを組み合わせ、モデルごとに一度最適化された単一の構成により、低コストなドラフト候補の大規模プールを生成する。その後、効率的な多段階検証手順で最も有望なドラフトを特定し、それをフル品質で精緻化する。3つのベンチマークと3つのモデルスケールにおいて、Flash-BoNは固定の実時間予算下で全てのベースラインを一貫して上回り、その利得はモデルスケールが大きくなるほど拡大する(AUC+8%)。さらに、本戦略は既存の直交手法(例えば、反射に基づくプロンプト最適化、AUC+16%)と良好に組み合わせ可能であり、それらを改善することを示す。この利得は候補の多様性の増加と相関しており、これによりドラフト誘導型選択が強化学習後訓練の収束を加速することも可能にする。
セマンティックオーディオアプリケーションでは、フレームワークに依存したデータセンタースタックではなく、民生用および組み込みハードウェア上での制御可能な生成がますます求められている。本稿では、依存関係のないネイティブランタイムであるariaを提案する。これは、Stable Audio~3(SA3)のテキストから音楽へのパイプライン全体を、通常のGPU、CPU専用マシン、Raspberry~Pi~5上で、Pythonや深層学習フレームワークを介さずに実行する。我々の主な貢献は量子化の研究である。すなわち、モデルを低い数値精度で動作させて厳しいメモリ制約に適合させ、メモリを追加するのではなく、その場で節約する。ランタイムがすべての内部テンソルを所有するため、アクティベーションステアリングも公開される。これは、モデルの生成内容を低コストで操作する方法である。出力の品質コストを、プロンプトへの忠実性、全体的なオーディオ品質、テイスト保存の3つの独立した尺度で評価し、それぞれをランダムシード間の通常の変動と比較する。8ビット精度では、メモリを大幅に削減しながらも、いずれの尺度でも測定可能な品質低下は見られず、GPU上で最速のモードとなる。4ビットでは、小さく限定的なコストが生じるが、1.2億パラメータモデルを8GBのPi上で動作させるのに十分なフットプリント縮小を実現する。公式実装と比較して、ariaは生成速度で同等以上であり、起動時間は約7倍高速である。ステアリングインターフェースのケーススタディでは、テイストの連想(ソニックシーズニング)を伴う音楽を生成し、一部の属性に対して本格的でありながら限定された制御を実現する。これらの結果は、組み込み制御機能を備えたコンパクトで量子化されたランタイムが、Internet-of-Sounds環境におけるオンデバイスセマンティックオーディオの実用的な基盤となることを示している。ariaランタイムはhttps://github.com/matteospanio/ariaで公開されている。
大規模言語モデル(LLM)は、抽象的推論と高度なツール利用を組み合わせ、統合型データサイエンスエージェントとしての役割をますます果たしている。しかしながら、関連するベンチマークの状況は、現実的なデータ分析を伴わない記号的な因果推論ベンチマークと、原理的な因果データ生成構造を持たないデータ分析ベンチマークとに大きく二分されている。さらに、既存の因果評価データセットは、既存の情報源から得られた厳選された事例に限定されることが多く、その多様性は、新しい合成因果構造の体系的な生成ではなく、限られたテンプレート化されたバリエーションに依存している。本稿では、エージェント型データサイエンスワークフローにおける因果推論を評価するためのベンチマークであるCausalDSを紹介する。各ベンチマークインスタンスは、サンプリングされた構造的因果モデル(SCM)とそれによって生成された観測データ、および現実的なドメインに基づく合成自然言語ストーリーから構成されるシーンである。我々はオプションとして、ベンチマーク構成要素の構成を実世界データセットから得られた経験的分布に基づいて行う。これにより、完全に合成生成を通じて「因果のオウム」リスクを低減しつつ、経験的構造を保持する。各シーンから、パールの三つの段階すべてにわたるタスクを導出し、典型的なデータサイエンスの予測タスクは第一段階として現れる。ほとんどのタスクにはデータサイエンスのコーディング要素が含まれており、不完全な観測(観測モデルによって生成される)が頻繁に存在するため、モデルは通常、最終的な回答に到達するために複数のツールを使用する必要がある。さらに、質問に対して正当な回答が存在しないことを認識し、回答を控えることは、一次的なスコアリング対象として扱われる。したがって、このベンチマークは、記号的因果推論、データサイエンス、不確実性定量化、回答放棄、ツール利用/コーディングを統合的に評価する。
ピーク回路として知られる量子回路のクラスでは、回路出力における最も確率の高いビット列を予測することが目的となる。これらの回路は出力分布に鋭いピークを持つように設計されているため、原理的には、項数を限定したトランケート状態ベクトル、あるいは全確率質量の一部を用いてシミュレーションすることが可能であるはずである。この近似シミュレーションは、ほとんどの量子シミュレータで一般的な密表現とは対照的に、状態ベクトルの非ゼロ振幅のみを格納する疎表現を用いて古典コンピュータ上で実行可能である。効率性のため、状態ベクトルに対するすべての操作は可能な限りベクトル化されるべきであり、利用可能であればハードウェアアクセラレーションも使用できる。本研究では、これらの要件がオープンソース実装においてどのように満たされたかを述べ、その性能と限界について議論する。
現代のビデオオブジェクトセグメンテーション(VOS)では、ユーザーが指定したターゲットの追跡とセグメンテーションを行います。近年の手法は単一ターゲットシナリオで顕著な性能を達成していますが、これらをマルチターゲット設定に拡張する場合、通常は個々のオブジェクトごとに単一ターゲット処理を複製するため、ターゲット数の増加に伴ってフレームレート(FPS)が低下し、レイテンシが無制限に増大します。本稿では、Segment Anything 2(SAM2)を基盤として、リアルタイムのマルチターゲットビデオセグメンテーションのための対話型フレームワークにモデルを変換することで、この課題に対処するSAM-MTを提案します。SAM-MTは、異なる個別ターゲットを表現する明示的なクエリを、グローバルコンテキストのための共有表現と並行して使用します。クロスターゲット干渉から個々の識別性を維持するために分離されたマスクアテンションを採用し、安定した時間的進化のためにスパースメモリを利用するとともに、オクルージョン処理と重複防止のための特殊な戦略を実装しています。SAM-MTは、レイテンシをターゲット数から切り離すことに成功し、単一ターゲットベースラインと同等のリアルタイム速度(10ターゲットで36 FPS超)を達成しつつ、SAM2の堅牢なビデオセグメンテーション性能を維持します。
アラビア語自然言語処理(NLP)における重要な課題は、現代標準アラビア語(MSA)に比べて方言データが不足していることであり、そのため大規模言語モデル(LLM)はMSAを過剰に生成し、方言的に正確な生成に苦戦する。解釈可能性の観点から、これは根本的な疑問を提起する:モデル内部において方言的特徴はどこでどのように符号化されているのか、そしてこれらの表現を微調整なしで方言生成を改善するために活用できるのか?本研究では、解釈可能性のプローブと制御メカニズムとして同時に機能する、二つの相補的な推論時アプローチを調査する。第一に、ニューロンレベルの分析を行い、方言固有の特徴を符号化する疎なニューロン集団を特定し、これらのニューロンを増幅または抑制することでモデルの出力を目標方言に向けて誘導できることを示す。第二に、単一ニューロンレベルでの方言的特徴の絡み合いに動機づけられ、方言固有の活性化方向を抽出し推論中に注入するベクトル誘導アプローチを適用する。これらの手法は総合的に、アラビア語LLMにおける方言知識の幾何学的構造を明らかにし、方言固有の微調整を必要としない、原理的で解釈可能性に基づいた方言制御の枠組みを提供する。
我々は、NakbaNLP@LREC-COLING 2026におけるStanceNakba Shared Taskの両サブタスクを対象としたスタンス検出システム、PAST-TIDEを紹介する。その中核アイデアはステートメントチューニングである。スタンスをクローズスタイルのマスク言語モデリング(MLM)として再定義し、ランダムに初期化された分類ヘッドを追加する代わりに、言語化器(verbalizer)を用いて事前学習済みMLMヘッドを通じてラベル単語をスタンスカテゴリにマッピングする。これに、学習可能なクラスプロトタイプを用いてバッチサイズ非依存の対比学習を実現するプロトタイプ対比学習と、クロス・トピックのアラビア語スタンス検出のためのトピック条件付き層正規化を組み合わせる。公式リーダーボードにおいて、PAST-TIDEはサブタスクAでマクロF1スコア0.75、サブタスクBで0.74を達成しており、事前学習済みモデルへの最小限の構造的追加が低リソース設定でも競争力を維持できることを示している。