ChatPaper.aiChatPaper.ai
Inicio

arXiv

HuggingFace

PreciosCuentaEspacio de trabajo

•
•

•
•

•
•

•
•

•
•

Footer

Company name

ChatPaper.ai: Your advanced AI reading assistant.

Contact us: [email protected]

X (Twitter)

Products

  • AI Search
  • AI Mind Map
  • Arxiv Summary
  • Huggingface Summary

Support

  • FAQ
  • Contact

Company

  • Blog
  • Privacy Policy
  • Terms of Service

Available Languages

  • 🇬🇧English
  • 🇨🇳中文简体
  • 🇭🇰繁體中文
  • 🇯🇵日本語
  • 🇰🇷한국어
  • 🇩🇪Deutsch
  • 🇫🇷Français
  • 🇷🇺Русский
  • 🇪🇸Español

© 2025 chatpaper.ai All rights reserved.

Artículos de Investigación en IA Diarios

Artículos de investigación en IA seleccionados diariamente con traducciones

La Era de los LLM de 1 bit: Todos los Modelos de Lenguaje Grande están en 1.58 Bits
The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits

Shuming Ma, Hongyu Wang, Lingxiao Ma, Lei Wang, Wenhui Wang, Shaohan Huang, Li Dong, Ruiping Wang, Jilong Xue, Furu Wei•Feb 27, 2024•618143

EMO: Retrato Emotivo en Vivo - Generación de Videos Expresivos de Retratos con un Modelo de Difusión Audio a Video bajo Condiciones Débiles
EMO: Emote Portrait Alive - Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions

Linrui Tian, Qi Wang, Bang Zhang, Liefeng Bo•Feb 27, 2024•19620

Sora: Una revisión sobre los antecedentes, la tecnología, las limitaciones y las oportunidades de los modelos de visión a gran escala
Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models

Yixin Liu, Kai Zhang, Yuan Li, Zhiling Yan, Chujie Gao, Ruoxi Chen, Zhengqing Yuan, Yue Huang, Hanchi Sun, Jianfeng Gao, Lifang He, Lichao Sun•Feb 27, 2024•895

OmniACT: Un conjunto de datos y punto de referencia para habilitar agentes autónomos generalistas multimodales en entornos de escritorio y web
OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web

Raghav Kapoor, Yash Parag Butala, Melisa Russak, Jing Yu Koh, Kiran Kamble, Waseem Alshikh, Ruslan Salakhutdinov•Feb 27, 2024•266

Cuando el escalado se encuentra con el ajuste fino de LLM: El efecto de los datos, el modelo y el método de ajuste fino
When Scaling Meets LLM Finetuning: The Effect of Data, Model and Finetuning Method

Biao Zhang, Zhongtao Liu, Colin Cherry, Orhan Firat•Feb 27, 2024•263

Escalado de Contexto Largo sin Entrenamiento para Modelos de Lenguaje de Gran Escala
Training-Free Long-Context Scaling of Large Language Models

Chenxin An, Fei Huang, Jun Zhang, Shansan Gong, Xipeng Qiu, Chang Zhou, Lingpeng Kong•Feb 27, 2024•254

DiffuseKronA: Un método de ajuste fino eficiente en parámetros para modelos de difusión personalizados
DiffuseKronA: A Parameter Efficient Fine-tuning Method for Personalized Diffusion Model

Shyam Marjit, Harshit Singh, Nityanand Mathur, Sayak Paul, Chia-Mu Yu, Pin-Yu Chen•Feb 27, 2024•251

El video como nuevo lenguaje para la toma de decisiones en el mundo real
Video as the New Language for Real-World Decision Making

Sherry Yang, Jacob Walker, Jack Parker-Holder, Yilun Du, Jake Bruce, Andre Barreto, Pieter Abbeel, Dale Schuurmans•Feb 27, 2024•221

Evaluación de la Memoria Conversacional a Muy Largo Plazo en Agentes de Modelos de Lenguaje Grande (LLM)
Evaluating Very Long-Term Conversational Memory of LLM Agents

Adyasha Maharana, Dong-Ho Lee, Sergey Tulyakov, Mohit Bansal, Francesco Barbieri, Yuwei Fang•Feb 27, 2024•203

Hacia el Aprendizaje Óptimo de Modelos de Lenguaje
Towards Optimal Learning of Language Models

Yuxian Gu, Li Dong, Yaru Hao, Qingxiu Dong, Minlie Huang, Furu Wei•Feb 27, 2024•181

Sora genera videos con una impresionante consistencia geométrica.
Sora Generates Videos with Stunning Geometrical Consistency

Xuanyi Li, Daquan Zhou, Chenxu Zhang, Shaodong Wei, Qibin Hou, Ming-Ming Cheng•Feb 27, 2024•181

Ver y Escuchar: Generación Visual-Audio de Dominio Abierto con Alineadores Latentes de Difusión
Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners

Yazhou Xing, Yingqing He, Zeyue Tian, Xintao Wang, Qifeng Chen•Feb 27, 2024•161

Playground v2.5: Tres ideas para mejorar la calidad estética en la generación de imágenes a partir de texto
Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation

Daiqing Li, Aleks Kamko, Ehsan Akhgari, Ali Sabet, Linmiao Xu, Suhail Doshi•Feb 27, 2024•121

Generación de Escenas 3D Desenredadas con Aprendizaje de Disposición
Disentangled 3D Scene Generation with Layout Learning

Dave Epstein, Ben Poole, Ben Mildenhall, Alexei A. Efros, Aleksander Holynski•Feb 26, 2024•121

VastGaussian: Gaussianas 3D extensas para la reconstrucción de escenas grandes
VastGaussian: Vast 3D Gaussians for Large Scene Reconstruction

Jiaqi Lin, Zhihao Li, Xiao Tang, Jianzhuang Liu, Shiyong Liu, Jiayue Liu, Yangdi Lu, Xiaofei Wu, Songcen Xu, Youliang Yan, Wenming Yang•Feb 27, 2024•1145