ChatPaper.ai
Открыть меню
Главная
Статьи Дня
arXiv
HuggingFace
Цены
Аккаунт
Рабочее пространство
🇷🇺
Русский
Loading...
•
•
•
•
•
•
•
•
•
•
Ежедневные Исследовательские Статьи по ИИ
Ежедневно отобранные исследовательские статьи по ИИ с переводами
April 23rd, 2025
Kuwain 1.5B: Арабская языковая модель малого масштаба через инъекцию языка
Kuwain 1.5B: An Arabic SLM via Language Injection
Khalil Hennara, Sara Chrouf, Mohamed Motaism Hamed, Zeina Aldallal, Omar Hadid, Safwan AlModhayan
•
Apr 21, 2025
•
113
7
TTRL: Обучение с подкреплением во время тестирования
TTRL: Test-Time Reinforcement Learning
Yuxin Zuo, Kaiyan Zhang, Shang Qu, Li Sheng, Xuekai Zhu, Biqing Qi, Youbang Sun, Ganqu Cui, Ning Ding, Bowen Zhou
•
Apr 22, 2025
•
95
4
Горький урок, извлеченный из более чем 2000 многоязычных тестов
The Bitter Lesson Learned from 2,000+ Multilingual Benchmarks
Minghao Wu, Weixuan Wang, Sinuo Liu, Huifeng Yin, Xintong Wang, Yu Zhao, Chenyang Lyu, Longyue Wang, Weihua Luo, Kaifu Zhang
•
Apr 22, 2025
•
61
2
Опиши что угодно: детализированное локализованное описание изображений и видео
Describe Anything: Detailed Localized Image and Video Captioning
Long Lian, Yifan Ding, Yunhao Ge, Sifei Liu, Hanzi Mao, Boyi Li, Marco Pavone, Ming-Yu Liu, Trevor Darrell, Adam Yala, Yin Cui
•
Apr 22, 2025
•
58
4
Обучение адаптивного параллельного рассуждения с использованием языковых моделей
Learning Adaptive Parallel Reasoning with Language Models
Jiayi Pan, Xiuyu Li, Long Lian, Charlie Snell, Yifei Zhou, Adam Yala, Trevor Darrell, Kurt Keutzer, Alane Suhr
•
Apr 21, 2025
•
42
2
LiveCC: Обучение языковой модели для видео с потоковой транскрипцией речи в масштабе
LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale
Joya Chen, Ziyun Zeng, Yiqi Lin, Wei Li, Zejun Ma, Mike Zheng Shou
•
Apr 22, 2025
•
32
2
BookWorld: От романов к интерактивным сообществам агентов для креативной генерации историй
BookWorld: From Novels to Interactive Agent Societies for Creative Story Generation
Yiting Ran, Xintao Wang, Tian Qiu, Jiaqing Liang, Yanghua Xiao, Deqing Yang
•
Apr 20, 2025
•
26
2
IV-Bench: Бенчмарк для восприятия и анализа видео на основе изображений в мультимодальных языковых моделях
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
David Ma, Yuanxing Zhang, Jincheng Ren, Jarvis Guo, Yifan Yao, Zhenlin Wei, Zhenzhu Yang, Zhongyuan Peng, Boyu Feng, Jun Ma, Xiao Gu, Zhoufutu Wen, King Zhu, Yancheng He, Meng Cao, Shiwen Ni, Jiaheng Liu, Wenhao Huang, Ge Zhang, Xiaojie Jin
•
Apr 21, 2025
•
22
2
LLM — это жадные агенты: влияние тонкой настройки с помощью обучения с подкреплением на способность принимать решения
LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities
Thomas Schmied, Jörg Bornschein, Jordi Grau-Moya, Markus Wulfmeier, Razvan Pascanu
•
Apr 22, 2025
•
20
3
Эффективное масштабирование длины предварительного обучения
Efficient Pretraining Length Scaling
Bohong Wu, Shen Yan, Sijun Zhang, Jianqiao Lu, Yutao Zeng, Ya Wang, Xun Zhou
•
Apr 21, 2025
•
19
2
WALL-E 2.0: Выравнивание мира через нейросимволическое обучение улучшает агентов на основе языковых моделей с мировыми моделями
WALL-E 2.0: World Alignment by NeuroSymbolic Learning improves World Model-based LLM Agents
Siyu Zhou, Tianyi Zhou, Yijun Yang, Guodong Long, Deheng Ye, Jing Jiang, Chengqi Zhang
•
Apr 22, 2025
•
18
4
Персонализированная генерация изображений из текста с использованием авторегрессивных моделей
Personalized Text-to-Image Generation with Auto-Regressive Models
Kaiyue Sun, Xian Liu, Yao Teng, Xihui Liu
•
Apr 17, 2025
•
18
3
CheXWorld: Исследование моделирования мира изображений для обучения представлений рентгенограмм
CheXWorld: Exploring Image World Modeling for Radiograph Representation Learning
Yang Yue, Yulin Wang, Chenxin Tao, Pan Liu, Shiji Song, Gao Huang
•
Apr 18, 2025
•
17
2
От размышления к совершенству: масштабирование оптимизации на этапе вывода для моделей диффузии "текст-изображение" с помощью настройки через отражение
From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection Tuning
Le Zhuo, Liangbing Zhao, Sayak Paul, Yue Liao, Renrui Zhang, Yi Xin, Peng Gao, Mohamed Elhoseiny, Hongsheng Li
•
Apr 22, 2025
•
15
2
Vidi: Крупные мультимодальные модели для понимания и редактирования видео
Vidi: Large Multimodal Models for Video Understanding and Editing
Vidi Team, Celong Liu, Chia-Wen Kuo, Dawei Du, Fan Chen, Guang Chen, Jiamin Yuan, Lingxi Zhang, Lu Guo, Lusha Li, Longyin Wen, Qingyu Chen, Rachel Deng, Sijie Zhu, Stuart Siew, Tong Jin, Wei Lu, Wen Zhong, Xiaohui Shen, Xin Gu, Xing Mei, Xueqiong Qu
•
Apr 22, 2025
•
15
2
RealisDance-DiT: Простой, но мощный базовый подход к управляемой анимации персонажей в реальных условиях
RealisDance-DiT: Simple yet Strong Baseline towards Controllable Character Animation in the Wild
Jingkai Zhou, Yifan Wu, Shikai Li, Min Wei, Chao Fan, Weihua Chen, Wei Jiang, Fan Wang
•
Apr 21, 2025
•
9
2
Progent: Программируемое управление привилегиями для агентов на основе больших языковых моделей
Progent: Programmable Privilege Control for LLM Agents
Tianneng Shi, Jingxuan He, Zhun Wang, Linyu Wu, Hongwei Li, Wenbo Guo, Dawn Song
•
Apr 16, 2025
•
7
2
MR. Video: «MapReduce» — это принцип для понимания длинных видео.
MR. Video: "MapReduce" is the Principle for Long Video Understanding
Ziqi Pang, Yu-Xiong Wang
•
Apr 22, 2025
•
6
2
CAPTURe: Оценка пространственного мышления в моделях обработки визуальной информации и языка через подсчёт скрытых объектов
CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting
Atin Pothiraj, Elias Stengel-Eskin, Jaemin Cho, Mohit Bansal
•
Apr 21, 2025
•
5
2
IPBench: Оценка знаний крупных языковых моделей в области интеллектуальной собственности
IPBench: Benchmarking the Knowledge of Large Language Models in Intellectual Property
Qiyao Wang, Guhong Chen, Hongbo Wang, Huaren Liu, Minghui Zhu, Zhifei Qin, Linwei Li, Yilin Yue, Shiqiang Wang, Jiayan Li, Yihang Wu, Ziqiang Liu, Longze Chen, Run Luo, Liyang Fan, Jiaming Li, Lei Zhang, Kan Xu, Hongfei Lin, Hamid Alinejad-Rokny, Shiwen Ni, Yuan Lin, Min Yang
•
Apr 22, 2025
•
4
2
DiffVox: Дифференцируемая модель для захвата и анализа распределений профессиональных эффектов
DiffVox: A Differentiable Model for Capturing and Analysing Professional Effects Distributions
Chin-Yun Yu, Marco A. Martínez-Ramírez, Junghyun Koo, Ben Hayes, Wei-Hsiang Liao, György Fazekas, Yuki Mitsufuji
•
Apr 20, 2025
•
2
2