ChatPaper.ai
Открыть меню
Главная
Статьи Дня
arXiv
HuggingFace
Цены
Аккаунт
Рабочее пространство
🇷🇺
Русский
Loading...
•
•
•
•
•
•
•
•
•
•
Ежедневные Исследовательские Статьи по ИИ
Ежедневно отобранные исследовательские статьи по ИИ с переводами
March 14th, 2025
R1-Onevision: Развитие обобщённого мультимодального мышления через кросс-модальную формализацию
R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization
Yi Yang, Xiaoxuan He, Hongkun Pan, Xiyan Jiang, Yan Deng, Xingtao Yang, Haoyu Lu, Dacheng Yin, Fengyun Rao, Minfeng Zhu, Bo Zhang, Wei Chen
•
Mar 13, 2025
•
17
3
Авторегрессионная генерация изображений с рандомизированным параллельным декодированием
Autoregressive Image Generation with Randomized Parallel Decoding
Haopeng Li, Jinyue Yang, Guoqi Li, Huan Wang
•
Mar 13, 2025
•
8
2
Open-Sora 2.0: Обучение коммерческого уровня модели генерации видео за $200 тыс.
Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k
Xiangyu Peng, Zangwei Zheng, Chenhui Shen, Tom Young, Xinying Guo, Binluo Wang, Hang Xu, Hongxin Liu, Mingyan Jiang, Wenjun Li, Yuhui Wang, Anbang Ye, Gang Ren, Qianran Ma, Wanying Liang, Xiang Lian, Xiwen Wu, Yuting Zhong, Zhuangyan Li, Chaoyu Gong, Guojun Lei, Leijun Cheng, Limin Zhang, Minghao Li, Ruijie Zhang, Silan Hu, Shijie Huang, Xiaokang Wang, Yuanheng Zhao, Yuqi Wang, Ziang Wei, Yang You
•
Mar 12, 2025
•
18
3
Ограничения моделей "визуальный язык" в понимании преобразований изображений
On the Limitations of Vision-Language Models in Understanding Image Transforms
Ahmad Mustafa Anis, Hasnain Ali, Saquib Sarfraz
•
Mar 12, 2025
•
10
2
Трансформеры без нормализации
Transformers without Normalization
Jiachen Zhu, Xinlei Chen, Kaiming He, Yann LeCun, Zhuang Liu
•
Mar 13, 2025
•
161
5
PerCoV2: Усовершенствованное ультранизкобитное перцептуальное сжатие изображений с использованием неявного иерархического маскированного моделирования изображений
PerCoV2: Improved Ultra-Low Bit-Rate Perceptual Image Compression with Implicit Hierarchical Masked Image Modeling
Nikolai Körber, Eduard Kromer, Andreas Siebert, Sascha Hauke, Daniel Mueller-Gritschneder, Björn Schuller
•
Mar 12, 2025
•
3
2
GroundingSuite: Измерение сложного многоуровневого пиксельного заземления
GroundingSuite: Measuring Complex Multi-Granular Pixel Grounding
Rui Hu, Lianghui Zhu, Yuxuan Zhang, Tianheng Cheng, Lei Liu, Heng Liu, Longjin Ran, Xiaoxin Chen, Wenyu Liu, Xinggang Wang
•
Mar 13, 2025
•
18
2
Изучение (без)классификаторного управления с классификатороцентричной перспективы
Studying Classifier(-Free) Guidance From a Classifier-Centric Perspective
Xiaoming Zhao, Alexander G. Schwing
•
Mar 13, 2025
•
2
2
Квантование моделей Whisper от OpenAI: сравнительный анализ
Quantization for OpenAI's Whisper Models: A Comparative Analysis
Allison Andreyev
•
Mar 12, 2025
•
6
2
MinorBench: ручной бенчмарк для оценки контентных рисков для детей
MinorBench: A hand-built benchmark for content-based risks for children
Shaun Khoo, Gabriel Chua, Rachel Shong
•
Mar 13, 2025
•
4
3
TruthPrInt: Снижение галлюцинаций объектов в LVLM через скрытое управляемое истиной предварительное вмешательство
TruthPrInt: Mitigating LVLM Object Hallucination Via Latent Truthful-Guided Pre-Intervention
Jinhao Duan, Fei Kong, Hao Cheng, James Diffenderfer, Bhavya Kailkhura, Lichao Sun, Xiaofeng Zhu, Xiaoshuang Shi, Kaidi Xu
•
Mar 13, 2025
•
4
2
Моделирование мира делает планировщик лучше: двойная оптимизация предпочтений для планирования задач в физическом окружении
World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning
Siyin Wang, Zhaoye Fei, Qinyuan Cheng, Shiduo Zhang, Panpan Cai, Jinlan Fu, Xipeng Qiu
•
Mar 13, 2025
•
53
7
OmniPaint: Освоение объектно-ориентированного редактирования через разделяемое восстановление с вставкой и удалением
OmniPaint: Mastering Object-Oriented Editing via Disentangled Insertion-Removal Inpainting
Yongsheng Yu, Ziyun Zeng, Haitian Zheng, Jiebo Luo
•
Mar 11, 2025
•
29
2
VisualWebInstruct: Масштабирование мультимодальных обучающих данных через веб-поиск
VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search
Yiming Jia, Jiachen Li, Xiang Yue, Bo Li, Ping Nie, Kai Zou, Wenhu Chen
•
Mar 13, 2025
•
23
2
Эффективное с точки зрения коммуникаций обучение языковых моделей масштабируется надежно и устойчиво: законы масштабирования для DiLoCo
Communication-Efficient Language Model Training Scales Reliably and Robustly: Scaling Laws for DiLoCo
Zachary Charles, Gabriel Teston, Lucio Dery, Keith Rush, Nova Fallen, Zachary Garrett, Arthur Szlam, Arthur Douillard
•
Mar 12, 2025
•
14
2
Смещение фокуса исследований LLM с длинным контекстом с ввода на вывод
Shifting Long-Context LLMs Research from Input to Output
Yuhao Wu, Yushi Bai, Zhiqing Hu, Shangqing Tu, Ming Shan Hee, Juanzi Li, Roy Ka-Wei Lee
•
Mar 6, 2025
•
22
2
Тихая атака на брендинг: Атака на отравление данных без триггеров в моделях диффузии текст-изображение
Silent Branding Attack: Trigger-free Data Poisoning Attack on Text-to-Image Diffusion Models
Sangwon Jang, June Suk Choi, Jaehyeong Jo, Kimin Lee, Sung Ju Hwang
•
Mar 12, 2025
•
36
2
Проклятие условий: анализ и улучшение оптимального транспорта для условной генерации на основе потоков
The Curse of Conditions: Analyzing and Improving Optimal Transport for Conditional Flow-Based Generation
Ho Kei Cheng, Alexander Schwing
•
Mar 13, 2025
•
3
2
SANA-Sprint: Одношаговая диффузия с непрерывной согласованностью во времени через дистилляцию
SANA-Sprint: One-Step Diffusion with Continuous-Time Consistency Distillation
Junsong Chen, Shuchen Xue, Yuyang Zhao, Jincheng Yu, Sayak Paul, Junyu Chen, Han Cai, Enze Xie, Song Han
•
Mar 12, 2025
•
37
4
CoSTAast: Агент для построения траекторий с учетом стоимости в многопроходном редактировании изображений
CoSTAast: Cost-Sensitive Toolpath Agent for Multi-turn Image Editing
Advait Gupta, NandaKiran Velaga, Dang Nguyen, Tianyi Zhou
•
Mar 13, 2025
•
79
10
DiT-Air: Переосмысление эффективности архитектуры диффузионных моделей в генерации изображений по тексту
DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation
Chen Chen, Rui Qian, Wenze Hu, Tsu-Jui Fu, Lezhi Li, Bowen Zhang, Alex Schwing, Wei Liu, Yinfei Yang
•
Mar 13, 2025
•
17
2
Light-R1: Учебный план SFT, DPO и RL для длинных цепочек рассуждений с нуля и за их пределами
Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond
Liang Wen, Yunke Cai, Fenrui Xiao, Xin He, Qi An, Zhenyu Duan, Yimin Du, Junchen Liu, Lifu Tang, Xiaowei Lv, Haosheng Zou, Yongchao Deng, Shousheng Jia, Xiangzheng Zhang
•
Mar 13, 2025
•
28
4
VisualPRM: Эффективная модель вознаграждения процессов для мультимодального рассуждения
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
Weiyun Wang, Zhangwei Gao, Lianjie Chen, Zhe Chen, Jinguo Zhu, Xiangyu Zhao, Yangzhou Liu, Yue Cao, Shenglong Ye, Xizhou Zhu, Lewei Lu, Haodong Duan, Yu Qiao, Jifeng Dai, Wenhai Wang
•
Mar 13, 2025
•
36
3
CoRe^2: Сбор, осмысление и уточнение для более качественной и быстрой генерации
CoRe^2: Collect, Reflect and Refine to Generate Better and Faster
Shitong Shao, Zikai Zhou, Dian Xie, Yuetong Fang, Tian Ye, Lichen Bai, Zeke Xie
•
Mar 12, 2025
•
34
4
GoT: Раскрытие способностей к рассуждению мультимодальной большой языковой модели для визуальной генерации и редактирования
GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
Rongyao Fang, Chengqi Duan, Kun Wang, Linjiang Huang, Hao Li, Shilin Yan, Hao Tian, Xingyu Zeng, Rui Zhao, Jifeng Dai, Xihui Liu, Hongsheng Li
•
Mar 13, 2025
•
50
2
Дистилляция разнообразия и контроля в диффузионных моделях
Distilling Diversity and Control in Diffusion Models
Rohit Gandikota, David Bau
•
Mar 13, 2025
•
14
2
CINEMA: Генерация согласованных многопредметных видео с использованием MLLM-ориентированного управления
CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance
Yufan Deng, Xun Guo, Yizhi Wang, Jacob Zhiyuan Fang, Angtian Wang, Shenghai Yuan, Yiding Yang, Bo Liu, Haibin Huang, Chongyang Ma
•
Mar 13, 2025
•
11
2
Обнаружение влиятельных путей нейронов в Vision Transformers
Discovering Influential Neuron Path in Vision Transformers
Yifan Wang, Yifei Liu, Yingdong Shi, Changming Li, Anqi Pang, Sibei Yang, Jingyi Yu, Kan Ren
•
Mar 12, 2025
•
6
2
UniGoal: На пути к универсальной навигации с нулевым обучением для достижения целей
UniGoal: Towards Universal Zero-shot Goal-oriented Navigation
Hang Yin, Xiuwei Xu, Lingqing Zhao, Ziwei Wang, Jie Zhou, Jiwen Lu
•
Mar 13, 2025
•
6
2
Собери воедино: концептуализация на основе частей с использованием IP-приоров
Piece it Together: Part-Based Concepting with IP-Priors
Elad Richardson, Kfir Goldberg, Yuval Alaluf, Daniel Cohen-Or
•
Mar 13, 2025
•
8
2
ConsisLoRA: Повышение согласованности содержания и стиля для переноса стиля на основе LoRA
ConsisLoRA: Enhancing Content and Style Consistency for LoRA-based Style Transfer
Bolin Chen, Baoquan Zhao, Haoran Xie, Yi Cai, Qing Li, Xudong Mao
•
Mar 13, 2025
•
8
2
Оптимизация длинного контекста для генерации видео
Long Context Tuning for Video Generation
Yuwei Guo, Ceyuan Yang, Ziyan Yang, Zhibei Ma, Zhijie Lin, Zhenheng Yang, Dahua Lin, Lu Jiang
•
Mar 13, 2025
•
14
2
PoseLess: Управление от изображения к суставам без использования данных о глубине через прямое отображение изображений с помощью VLM
PoseLess: Depth-Free Vision-to-Joint Control via Direct Image Mapping with VLM
Alan Dao, Dinh Bach Vu, Tuan Le Duc Anh, Bui Quang Huy
•
Mar 10, 2025
•
3
2
"Тишина — это не всегда тишина": Исследование токсичности в обсуждениях отчетов об ошибках
"Silent Is Not Actually Silent": An Investigation of Toxicity on Bug Report Discussion
Mia Mohammad Imran, Jaydeb Sarker
•
Mar 13, 2025
•
4
2
Разочаровывающе простая, но чрезвычайно эффективная базовая атака: более 90% успеха против мощных черно-ящичных моделей GPT-4.5/4o/o1.
A Frustratingly Simple Yet Highly Effective Attack Baseline: Over 90% Success Rate Against the Strong Black-box Models of GPT-4.5/4o/o1
Zhaoyi Li, Xiaohan Zhao, Dong-Dong Wu, Jiacheng Cui, Zhiqiang Shen
•
Mar 13, 2025
•
3
2
4D LangSplat: 4D-языковое гауссово размытие с использованием мультимодальных больших языковых моделей
4D LangSplat: 4D Language Gaussian Splatting via Multimodal Large Language Models
Wanhua Li, Renping Zhou, Jiawei Zhou, Yingwei Song, Johannes Herter, Minghan Qin, Gao Huang, Hanspeter Pfister
•
Mar 13, 2025
•
32
2
Составление карты и навигация по Атласу моделей Hugging Face
Charting and Navigating Hugging Face's Model Atlas
Eliahu Horwitz, Nitzan Kurer, Jonathan Kahana, Liel Amar, Yedid Hoshen
•
Mar 13, 2025
•
79
6
Я что, похож на `cat.n.01` для вас? Бенчмарк для генерации изображений таксономии
Do I look like a `cat.n.01` to you? A Taxonomy Image Generation Benchmark
Viktor Moskvoretskii, Alina Lobanova, Ekaterina Neminova, Chris Biemann, Alexander Panchenko, Irina Nikishina
•
Mar 13, 2025
•
11
2
Новые тенденции в современном машинном переводе с использованием крупных моделей рассуждений
New Trends for Modern Machine Translation with Large Reasoning Models
Sinuo Liu, Chenyang Lyu, Minghao Wu, Longyue Wang, Weihua Luo, Kaifu Zhang
•
Mar 13, 2025
•
23
2