ChatPaper.ai
メニューを開く
ホーム
今日の論文
arXiv
HuggingFace
料金プラン
アカウント
ワークスペース
🇯🇵
日本語
Loading...
•
•
•
•
•
•
•
•
•
•
AI研究論文デイリー
翻訳付きの日次キュレーションされたAI研究論文
October 15th, 2024
Animate-X: 強化されたモーション表現を備えた汎用キャラクター画像アニメーション
Animate-X: Universal Character Image Animation with Enhanced Motion Representation
Shuai Tan, Biao Gong, Xiang Wang, Shiwei Zhang, Dandan Zheng, Ruobing Zheng, Kecheng Zheng, Jingdong Chen, Ming Yang
•
Oct 14, 2024
•
57
5
LOKI: 大規模なマルチモーダルモデルを使用した包括的な合成データ検出ベンチマーク
LOKI: A Comprehensive Synthetic Data Detection Benchmark using Large Multimodal Models
Junyan Ye, Baichuan Zhou, Zilong Huang, Junan Zhang, Tianyi Bai, Hengrui Kang, Jun He, Honglin Lin, Zihao Wang, Tong Wu, Zhizheng Wu, Yiping Chen, Dahua Lin, Conghui He, Weijia Li
•
Oct 13, 2024
•
56
4
MMIE: 大規模なビジョン言語モデルのための大規模マルチモーダル交互理解ベンチマーク
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
Peng Xia, Siwei Han, Shi Qiu, Yiyang Zhou, Zhaoyang Wang, Wenhao Zheng, Zhaorun Chen, Chenhang Cui, Mingyu Ding, Linjie Li, Lijuan Wang, Huaxiu Yao
•
Oct 14, 2024
•
53
4
検索拡張生成のための一般的な命令遵守に向けて
Toward General Instruction-Following Alignment for Retrieval-Augmented Generation
Guanting Dong, Xiaoshuai Song, Yutao Zhu, Runqi Qiao, Zhicheng Dou, Ji-Rong Wen
•
Oct 12, 2024
•
49
3
MEGA-Bench: 実世界タスク500以上にスケーリングしたマルチモーダル評価
MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks
Jiacheng Chen, Tianhao Liang, Sherman Siu, Zhengqing Wang, Kai Wang, Yubo Wang, Yuansheng Ni, Wang Zhu, Ziyan Jiang, Bohan Lyu, Dongfu Jiang, Xuan He, Yuan Liu, Hexiang Hu, Xiang Yue, Wenhu Chen
•
Oct 14, 2024
•
39
3
Omni-MATH: 大規模言語モデル向けの普遍的なオリンピアードレベル数学ベンチマーク
Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models
Bofei Gao, Feifan Song, Zhe Yang, Zefan Cai, Yibo Miao, Qingxiu Dong, Lei Li, Chenghao Ma, Liang Chen, Runxin Xu, Zhengyang Tang, Benyou Wang, Daoguang Zan, Shanghaoran Quan, Ge Zhang, Lei Sha, Yichang Zhang, Xuancheng Ren, Tianyu Liu, Baobao Chang
•
Oct 10, 2024
•
33
3
修正された確率微分方程式を使用した意味論的画像反転と編集
Semantic Image Inversion and Editing using Rectified Stochastic Differential Equations
Litu Rout, Yujia Chen, Nataniel Ruiz, Constantine Caramanis, Sanjay Shakkottai, Wen-Sheng Chu
•
Oct 14, 2024
•
31
3
LiveXiv -- Arxiv論文内容に基づくマルチモーダルなライブベンチマーク
LiveXiv -- A Multi-Modal Live Benchmark Based on Arxiv Papers Content
Nimrod Shabtay, Felipe Maia Polo, Sivan Doveh, Wei Lin, M. Jehanzeb Mirza, Leshem Chosen, Mikhail Yurochkin, Yuekai Sun, Assaf Arbelle, Leonid Karlinsky, Raja Giryes
•
Oct 14, 2024
•
28
2
VisRAG: マルチモダリティ文書におけるビジョンベースの検索拡張生成
VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents
Shi Yu, Chaoyue Tang, Bokai Xu, Junbo Cui, Junhao Ran, Yukun Yan, Zhenghao Liu, Shuo Wang, Xu Han, Zhiyuan Liu, Maosong Sun
•
Oct 14, 2024
•
27
3
Cavia: ビュー統合アテンションを備えたカメラ制御可能なマルチビュー動画伝搬
Cavia: Camera-controllable Multi-view Video Diffusion with View-Integrated Attention
Dejia Xu, Yifan Jiang, Chen Huang, Liangchen Song, Thorsten Gernoth, Liangliang Cao, Zhangyang Wang, Hao Tang
•
Oct 14, 2024
•
26
4
考えるLLMs:思考生成を伴う一般的な命令の遵守
Thinking LLMs: General Instruction Following with Thought Generation
Tianhao Wu, Janice Lan, Weizhe Yuan, Jiantao Jiao, Jason Weston, Sainbayar Sukhbaatar
•
Oct 14, 2024
•
20
4
TemporalBench:マルチモーダルビデオモデルの細かい時間理解のためのベンチマーク化
TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models
Mu Cai, Reuben Tan, Jianrui Zhang, Bocheng Zou, Kai Zhang, Feng Yao, Fangrui Zhu, Jing Gu, Yiwu Zhong, Yuzhang Shang, Yao Dou, Jaden Park, Jianfeng Gao, Yong Jae Lee, Jianwei Yang
•
Oct 14, 2024
•
17
2
スケールにおけるデータ選択の再考:ランダム選択がほぼすべてをカバーする
Rethinking Data Selection at Scale: Random Selection is Almost All You Need
Tingyu Xia, Bowen Yu, Kai Dang, An Yang, Yuan Wu, Yuan Tian, Yi Chang, Junyang Lin
•
Oct 12, 2024
•
17
3
LongMemEval: 長期インタラクティブメモリに関するチャットアシスタントのベンチマーク化
LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory
Di Wu, Hongwei Wang, Wenhao Yu, Yuwei Zhang, Kai-Wei Chang, Dong Yu
•
Oct 14, 2024
•
12
2
MMCOMPOSITION:事前学習されたビジョン言語モデルの合成性を再考する
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
Hang Hua, Yunlong Tang, Ziyun Zeng, Liangliang Cao, Zhengyuan Yang, Hangfeng He, Chenliang Xu, Jiebo Luo
•
Oct 13, 2024
•
9
2
問題の木:組成性を活用した構造化された問題解決の改善
Tree of Problems: Improving structured problem solving with compositionality
Armel Zebaze, Benoît Sagot, Rachel Bawden
•
Oct 9, 2024
•
9
2
DuoAttention: 検索とストリーミングヘッドを用いた効率的な長文脈LLM推論
DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads
Guangxuan Xiao, Jiaming Tang, Jingwei Zuo, Junxian Guo, Shang Yang, Haotian Tang, Yao Fu, Song Han
•
Oct 14, 2024
•
7
2
改善された3D拡散ポリシーによる汎用性のあるヒューマノイド操作
Generalizable Humanoid Manipulation with Improved 3D Diffusion Policies
Yanjie Ze, Zixuan Chen, Wenhao Wang, Tianyi Chen, Xialin He, Ying Yuan, Xue Bin Peng, Jiajun Wu
•
Oct 14, 2024
•
7
2
TVBench: ビデオ言語評価の再設計
TVBench: Redesigning Video-Language Evaluation
Daniel Cores, Michael Dorkenwald, Manuel Mucientes, Cees G. M. Snoek, Yuki M. Asano
•
Oct 10, 2024
•
6
2
同じでも異なる:多言語言語モデリングにおける構造の類似点と相違点
The Same But Different: Structural Similarities and Differences in Multilingual Language Modeling
Ruochen Zhang, Qinan Yu, Matianyu Zang, Carsten Eickhoff, Ellie Pavlick
•
Oct 11, 2024
•
5
2
ReLUの復活:正規化フリーの大規模言語モデルにおけるエントロピー過多
ReLU's Revival: On the Entropic Overload in Normalization-Free Large Language Models
Nandan Kumar Jha, Brandon Reagen
•
Oct 12, 2024
•
4
2
ビデオからの潜在的なアクション事前トレーニング
Latent Action Pretraining from Videos
Seonghyeon Ye, Joel Jang, Byeongguk Jeon, Sejune Joo, Jianwei Yang, Baolin Peng, Ajay Mandlekar, Reuben Tan, Yu-Wei Chao, Bill Yuchen Lin, Lars Liden, Kimin Lee, Jianfeng Gao, Luke Zettlemoyer, Dieter Fox, Minjoon Seo
•
Oct 15, 2024
•
2
2