ChatPaper.ai
Ouvrir le menu
Accueil
Articles du Jour
arXiv
HuggingFace
Tarifs
Compte
Espace de travail
🇫🇷
Français
Loading...
•
•
•
•
•
•
•
•
•
•
Articles de Recherche en IA Quotidiens
Articles de recherche en IA sélectionnés quotidiennement avec traductions
March 28th, 2025
Video-R1 : Renforcement du raisonnement vidéo dans les MLLMs
Video-R1: Reinforcing Video Reasoning in MLLMs
Kaituo Feng, Kaixiong Gong, Bohao Li, Zonghao Guo, Yibing Wang, Tianshuo Peng, Benyou Wang, Xiangyu Yue
•
Mar 27, 2025
•
78
6
Agent de Modèle de Langage à Grande Échelle : Une Étude sur la Méthodologie, les Applications et les Défis
Large Language Model Agent: A Survey on Methodology, Applications and Challenges
Junyu Luo, Weizhi Zhang, Ye Yuan, Yusheng Zhao, Junwei Yang, Yiyang Gu, Bohan Wu, Binqi Chen, Ziyue Qiao, Qingqing Long, Rongcheng Tu, Xiao Luo, Wei Ju, Zhiping Xiao, Yifan Wang, Meng Xiao, Chenwu Liu, Jingyang Yuan, Shichang Zhang, Yiqiao Jin, Fan Zhang, Xian Wu, Hanqing Zhao, Dacheng Tao, Philip S. Yu, Ming Zhang
•
Mar 27, 2025
•
77
2
UI-R1 : Amélioration de la prédiction d'actions des agents d'interface graphique par apprentissage par renforcement
UI-R1: Enhancing Action Prediction of GUI Agents by Reinforcement Learning
Zhengxi Lu, Yuxiang Chai, Yaxuan Guo, Xi Yin, Liang Liu, Hao Wang, Guanjing Xiong, Hongsheng Li
•
Mar 27, 2025
•
61
9
Repousser les limites du raisonnement : un benchmark de niveau olympiade en mathématiques pour les grands modèles de langage
Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
Haoxiang Sun, Yingqian Min, Zhipeng Chen, Wayne Xin Zhao, Zheng Liu, Zhongyuan Wang, Lei Fang, Ji-Rong Wen
•
Mar 27, 2025
•
37
4
VBench-2.0 : Progression de la suite de benchmarks pour la génération vidéo en matière de fidélité intrinsèque
VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness
Dian Zheng, Ziqi Huang, Hongbo Liu, Kai Zou, Yinan He, Fan Zhang, Yuanhan Zhang, Jingwen He, Wei-Shi Zheng, Yu Qiao, Ziwei Liu
•
Mar 27, 2025
•
33
2
ReaRAG : Le raisonnement guidé par la connaissance améliore la factualité des grands modèles de raisonnement grâce à une génération augmentée par itération et récupération
ReaRAG: Knowledge-guided Reasoning Enhances Factuality of Large Reasoning Models with Iterative Retrieval Augmented Generation
Zhicheng Lee, Shulin Cao, Jinxin Liu, Jiajie Zhang, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li
•
Mar 27, 2025
•
28
4
LeX-Art : Repenser la génération de texte via une synthèse de données haute qualité et évolutive
LeX-Art: Rethinking Text Generation via Scalable High-Quality Data Synthesis
Shitian Zhao, Qilong Wu, Xinyue Li, Bo Zhang, Ming Li, Qi Qin, Dongyang Liu, Kaipeng Zhang, Hongsheng Li, Yu Qiao, Peng Gao, Bin Fu, Zhen Li
•
Mar 27, 2025
•
26
2
ChatAnyone : Génération stylisée en temps réel de vidéos de portraits avec un modèle hiérarchique de diffusion de mouvement
ChatAnyone: Stylized Real-time Portrait Video Generation with Hierarchical Motion Diffusion Model
Jinwei Qi, Chaonan Ji, Sheng Xu, Peng Zhang, Bang Zhang, Liefeng Bo
•
Mar 27, 2025
•
25
3
Embodied-Reasoner : Synergie entre recherche visuelle, raisonnement et action pour les tâches interactives incarnées
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
Wenqi Zhang, Mengna Wang, Gangao Liu, Xu Huixin, Yiwei Jiang, Yongliang Shen, Guiyang Hou, Zhe Zheng, Hang Zhang, Xin Li, Weiming Lu, Peng Li, Yueting Zhuang
•
Mar 27, 2025
•
22
3
Lumina-Image 2.0 : Un Cadre Unifié et Efficace pour la Génération d'Images
Lumina-Image 2.0: A Unified and Efficient Image Generative Framework
Qi Qin, Le Zhuo, Yi Xin, Ruoyi Du, Zhen Li, Bin Fu, Yiting Lu, Jiakang Yuan, Xinyue Li, Dongyang Liu, Xiangyang Zhu, Manyuan Zhang, Will Beddow, Erwann Millon, Victor Perez, Wenhai Wang, Conghui He, Bo Zhang, Xiaohong Liu, Hongsheng Li, Yu Qiao, Chang Xu, Peng Gao
•
Mar 27, 2025
•
21
2
ResearchBench : Évaluation des LLM dans la découverte scientifique via la décomposition de tâches basée sur l'inspiration
ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
Yujie Liu, Zonglin Yang, Tong Xie, Jinjie Ni, Ben Gao, Yuqiang Li, Shixiang Tang, Wanli Ouyang, Erik Cambria, Dongzhan Zhou
•
Mar 27, 2025
•
20
2
FinAudio : Un benchmark pour les modèles de langage audio de grande envergure dans les applications financières
FinAudio: A Benchmark for Audio Large Language Models in Financial Applications
Yupeng Cao, Haohang Li, Yangyang Yu, Shashidhar Reddy Javaji, Yueru He, Jimin Huang, Zining Zhu, Qianqian Xie, Xiao-yang Liu, Koduvayur Subbalakshmi, Meikang Qiu, Sophia Ananiadou, Jian-Yun Nie
•
Mar 26, 2025
•
19
2
La vidéo synthétique améliore la fidélité physique dans la synthèse vidéo.
Synthetic Video Enhances Physical Fidelity in Video Synthesis
Qi Zhao, Xingyu Ni, Ziyu Wang, Feng Cheng, Ziyan Yang, Lu Jiang, Bohan Wang
•
Mar 26, 2025
•
16
3
Pas optimal pour l'échantillonnage par diffusion
Optimal Stepsize for Diffusion Sampling
Jianning Pei, Han Hu, Shuyang Gu
•
Mar 27, 2025
•
13
2
Exploration de l'évolution de la cognition physique dans la génération de vidéos : une étude
Exploring the Evolution of Physics Cognition in Video Generation: A Survey
Minghui Lin, Xiang Wang, Yishan Wang, Shu Wang, Fengqi Dai, Pengxiang Ding, Cunxiang Wang, Zhengrong Zuo, Nong Sang, Siteng Huang, Donglin Wang
•
Mar 27, 2025
•
11
2
Diffusion Discrète Multimodale Unifiée
Unified Multimodal Discrete Diffusion
Alexander Swerdlow, Mihir Prabhudesai, Siddharth Gandhi, Deepak Pathak, Katerina Fragkiadaki
•
Mar 26, 2025
•
9
2
Feature4X : Relier n'importe quelle vidéo monoculaire à une IA agentique 4D grâce à des champs de caractéristiques gaussiens polyvalents
Feature4X: Bridging Any Monocular Video to 4D Agentic AI with Versatile Gaussian Feature Fields
Shijie Zhou, Hui Ren, Yijia Weng, Shuwang Zhang, Zhen Wang, Dejia Xu, Zhiwen Fan, Suya You, Zhangyang Wang, Leonidas Guibas, Achuta Kadambi
•
Mar 26, 2025
•
8
2
Adaptation de bibliothèque sémantique : Récupération et fusion LoRA pour la segmentation sémantique à vocabulaire ouvert
Semantic Library Adaptation: LoRA Retrieval and Fusion for Open-Vocabulary Semantic Segmentation
Reza Qorbani, Gianluca Villani, Theodoros Panagiotakopoulos, Marc Botet Colomer, Linus Härenstam-Nielsen, Mattia Segu, Pier Luigi Dovesi, Jussi Karlgren, Daniel Cremers, Federico Tombari, Matteo Poggi
•
Mar 27, 2025
•
7
2
ZJUKLAB à SemEval-2025 Tâche 4 : Désapprentissage via fusion de modèles
ZJUKLAB at SemEval-2025 Task 4: Unlearning via Model Merging
Haoming Xu, Shuxun Wang, Yanqiu Zhao, Yi Zhong, Ziyan Jiang, Ningyuan Zhao, Shumin Deng, Huajun Chen, Ningyu Zhang
•
Mar 27, 2025
•
7
2
LLPut : Exploration des modèles de langage de grande taille pour la génération d'entrées basées sur des rapports de bogues
LLPut: Investigating Large Language Models for Bug Report-Based Input Generation
Alif Al Hasan, Subarna Saha, Mia Mohammad Imran, Tarannum Shaila Zaman
•
Mar 26, 2025
•
5
2
Tracktention : Exploiter le suivi de points pour analyser les vidéos plus rapidement et plus efficacement
Tracktention: Leveraging Point Tracking to Attend Videos Faster and Better
Zihang Lai, Andrea Vedaldi
•
Mar 25, 2025
•
2
2
LOCATEdit : Attention Croisée Optimisée par Laplacien de Graphe pour l'Édition Localisée d'Images Guidée par Texte
LOCATEdit: Graph Laplacian Optimized Cross Attention for Localized Text-Guided Image Editing
Achint Soni, Meet Soni, Sirisha Rambhatla
•
Mar 27, 2025
•
1
2