ChatPaper.ai
Открыть меню
Главная
Статьи Дня
arXiv
HuggingFace
Цены
Аккаунт
Рабочее пространство
🇷🇺
Русский
Loading...
•
•
•
•
•
•
•
•
•
•
Ежедневные Исследовательские Статьи по ИИ
Ежедневно отобранные исследовательские статьи по ИИ с переводами
June 5th, 2025
Технический отчет MiMo-VL
MiMo-VL Technical Report
Xiaomi LLM-Core Team, Zihao Yue, Zhenru Lin, Yifan Song, Weikun Wang, Shuhuai Ren, Shuhao Gu, Shicheng Li, Peidian Li, Liang Zhao, Lei Li, Kainan Bao, Hao Tian, Hailin Zhang, Gang Wang, Dawei Zhu, Cici, Chenhong He, Bowen Ye, Bowen Shen, Zihan Zhang, Zihan Jiang, Zhixian Zheng, Zhichao Song, Zhenbo Luo, Yue Yu, Yudong Wang, Yuanyuan Tian, Yu Tu, Yihan Yan, Yi Huang, Xu Wang, Xinzhe Xu, Xingchen Song, Xing Zhang, Xing Yong, Xin Zhang, Xiangwei Deng, Wenyu Yang, Wenhan Ma, Weiwei Lv, Weiji Zhuang, Wei Liu, Sirui Deng, Shuo Liu, Shimao Chen, Shihua Yu, Shaohui Liu, Shande Wang, Rui Ma, Qiantong Wang, Peng Wang, Nuo Chen, Menghang Zhu, Kangyang Zhou, Kang Zhou, Kai Fang, Jun Shi, Jinhao Dong, Jiebao Xiao, Jiaming Xu, Huaqiu Liu, Hongshen Xu, Heng Qu, Haochen Zhao, Hanglong Lv, Guoan Wang, Duo Zhang, Dong Zhang, Di Zhang, Chong Ma, Chang Liu, Can Cai, Bingquan Xia
•
Jun 4, 2025
•
65
2
AmbiK: Набор данных неоднозначных задач в кухонной среде
AmbiK: Dataset of Ambiguous Tasks in Kitchen Environment
Anastasiia Ivanova, Eva Bakaeva, Zoya Volovikova, Alexey K. Kovalev, Aleksandr I. Panov
•
Jun 4, 2025
•
43
2
Развитие мультимодального мышления: от оптимизированного "холодного старта" до поэтапного обучения с подкреплением
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning
Shuang Chen, Yue Guo, Zhaochen Su, Yafu Li, Yulun Wu, Jiacheng Chen, Jiayu Chen, Weijie Wang, Xiaoye Qu, Yu Cheng
•
Jun 4, 2025
•
41
4
Контролируемое исследование языковых моделей с длинным контекстом
A Controllable Examination for Long-Context Language Models
Yijun Yang, Zeyu Huang, Wenhao Zhu, Zihan Qiu, Fei Yuan, Jeff Z. Pan, Ivan Titov
•
Jun 3, 2025
•
30
2
MMR-V: Что осталось за кадром? Бенчмарк для мультимодального глубокого анализа в видеоматериалах
MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos
Kejian Zhu, Zhuoran Jin, Hongbang Yuan, Jiachun Li, Shangqing Tu, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao
•
Jun 4, 2025
•
28
2
SuperWriter: Рефлексивное создание длинных текстов с использованием крупных языковых моделей
SuperWriter: Reflection-Driven Long-Form Generation with Large Language Models
Yuhao Wu, Yushi Bai, Zhiqiang Hu, Juanzi Li, Roy Ka-Wei Lee
•
Jun 4, 2025
•
26
2
OpenThoughts: Рецепты данных для моделей рассуждений
OpenThoughts: Data Recipes for Reasoning Models
Etash Guha, Ryan Marten, Sedrick Keh, Negin Raoof, Georgios Smyrnis, Hritik Bansal, Marianna Nezhurina, Jean Mercat, Trung Vu, Zayne Sprague, Ashima Suvarna, Benjamin Feuer, Liangyu Chen, Zaid Khan, Eric Frankel, Sachin Grover, Caroline Choi, Niklas Muennighoff, Shiye Su, Wanjia Zhao, John Yang, Shreyas Pimpalgaonkar, Kartik Sharma, Charlie Cheng-Jie Ji, Yichuan Deng, Sarah Pratt, Vivek Ramanujan, Jon Saad-Falcon, Jeffrey Li, Achal Dave, Alon Albalak, Kushal Arora, Blake Wulfe, Chinmay Hegde, Greg Durrett, Sewoong Oh, Mohit Bansal, Saadia Gabriel, Aditya Grover, Kai-Wei Chang, Vaishaal Shankar, Aaron Gokaslan, Mike A. Merrill, Tatsunori Hashimoto, Yejin Choi, Jenia Jitsev, Reinhard Heckel, Maheswaran Sathiamoorthy, Alexandros G. Dimakis, Ludwig Schmidt
•
Jun 4, 2025
•
25
2
Установление надежной оценки языковых моделей через анализ нейронов, отвечающих за использование "коротких путей"
Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis
Kejian Zhu, Shangqing Tu, Zhuoran Jin, Lei Hou, Juanzi Li, Jun Zhao
•
Jun 4, 2025
•
24
2
Voyager: Модель диффузии видео для генерации исследовательских 3D-сцен с поддержкой дальнего действия и согласованности мира
Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation
Tianyu Huang, Wangguandong Zheng, Tengfei Wang, Yuhao Liu, Zhenwei Wang, Junta Wu, Jie Jiang, Hui Li, Rynson W. H. Lau, Wangmeng Zuo, Chunchao Guo
•
Jun 4, 2025
•
21
2
VisCoder: Тонкая настройка крупных языковых моделей для генерации исполняемого кода визуализаций на Python
VisCoder: Fine-Tuning LLMs for Executable Python Visualization Code Generation
Yuansheng Ni, Ping Nie, Kai Zou, Xiang Yue, Wenhu Chen
•
Jun 4, 2025
•
20
2
IllumiCraft: Унифицированная диффузия геометрии и освещения для управляемой генерации видео
IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video Generation
Yuanze Lin, Yi-Wen Chen, Yi-Hsuan Tsai, Ronald Clark, Ming-Hsuan Yang
•
Jun 3, 2025
•
20
3
Редактирование изображений как программы с использованием диффузионных моделей
Image Editing As Programs with Diffusion Models
Yujia Hu, Songhua Liu, Zhenxiong Tan, Xingyi Yang, Xinchao Wang
•
Jun 4, 2025
•
19
2
Раскрытие потенциала рассуждений предварительно обученных больших языковых моделей с помощью тонкой настройки на основе критики одной задачи
Unleashing the Reasoning Potential of Pre-trained LLMs by Critique Fine-Tuning on One Problem
Yubo Wang, Ping Nie, Kai Zou, Lijun Wu, Wenhu Chen
•
Jun 3, 2025
•
16
2
Ψ-Сэмплер: Начальное сэмплирование частиц для выравнивания вознаграждения во время вывода на основе SMC в моделях счёта
Ψ-Sampler: Initial Particle Sampling for SMC-Based Inference-Time Reward Alignment in Score Models
Taehoon Yoon, Yunhong Min, Kyeongmin Yeo, Minhyuk Sung
•
Jun 2, 2025
•
16
2
LayerFlow: Унифицированная модель для генерации видео с учетом слоев
LayerFlow: A Unified Model for Layer-aware Video Generation
Sihui Ji, Hao Luo, Xi Chen, Yuanpeng Tu, Yiyang Wang, Hengshuang Zhao
•
Jun 4, 2025
•
13
2
DenseDPO: Оптимизация временных предпочтений с высокой детализацией для видео-диффузионных моделей
DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models
Ziyi Wu, Anil Kag, Ivan Skorokhodov, Willi Menapace, Ashkan Mirzaei, Igor Gilitschenski, Sergey Tulyakov, Aliaksandr Siarohin
•
Jun 4, 2025
•
13
2
SVGenius: Оценка способностей языковых моделей в понимании, редактировании и генерации SVG
SVGenius: Benchmarking LLMs in SVG Understanding, Editing and Generation
Siqi Chen, Xinyu Dong, Haolei Xu, Xingyu Wu, Fei Tang, Hang Zhang, Yuchen Yan, Linjuan Wu, Wenqi Zhang, Guiyang Hou, Yongliang Shen, Weiming Lu, Yueting Zhuang
•
Jun 3, 2025
•
13
2
TimeHC-RL: Временнáя иерархическая когнитивная обучение с подкреплением для повышения социального интеллекта больших языковых моделей
TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence
Guiyang Hou, Xing Gao, Yuchuan Wu, Xiang Huang, Wenqi Zhang, Zhe Zheng, Yongliang Shen, Jialu Du, Fei Huang, Yongbin Li, Weiming Lu
•
May 30, 2025
•
11
2
Выпрямленное разреженное внимание
Rectified Sparse Attention
Yutao Sun, Tianzhu Ye, Li Dong, Yuqing Xia, Jian Chen, Yizhao Gao, Shijie Cao, Jianyong Wang, Furu Wei
•
Jun 4, 2025
•
9
2
Orak: Базовый эталон для обучения и оценки агентов на основе больших языковых моделей в разнообразных видеоиграх
Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games
Dongmin Park, Minkyu Kim, Beongjun Choi, Junhyuck Kim, Keon Lee, Jonghyun Lee, Inkyu Park, Byeong-Uk Lee, Jaeyoung Hwang, Jaewoo Ahn, Ameya S. Mahabaleshwarkar, Bilal Kartal, Pritam Biswas, Yoshi Suhara, Kangwook Lee, Jaewoong Cho
•
Jun 4, 2025
•
9
2
За пределами поверхности: измерение самопредпочтения в суждениях языковых моделей
Beyond the Surface: Measuring Self-Preference in LLM Judgments
Zhi-Yuan Chen, Hao Wang, Xinyu Zhang, Enrui Hu, Yankai Lin
•
Jun 3, 2025
•
8
2
BenchHub: Унифицированный набор тестов для комплексной и настраиваемой оценки языковых моделей (LLM)
BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation
Eunsu Kim, Haneul Yoo, Guijin Son, Hitesh Patel, Amit Agarwal, Alice Oh
•
May 31, 2025
•
8
2
TalkingMachines: Видео в стиле FaceTime с управлением звуком в реальном времени с использованием авторегрессивных диффузионных моделей
TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models
Chetwin Low, Weimin Wang
•
Jun 3, 2025
•
7
2
DiffDecompose: Послойная декомпозиция альфа-композитных изображений с использованием трансформеров на основе диффузии
DiffDecompose: Layer-Wise Decomposition of Alpha-Composited Images via Diffusion Transformers
Zitong Wang, Hang Zhao, Qianyu Zhou, Xuequan Lu, Xiangtai Li, Yiren Song
•
May 24, 2025
•
7
2
POSS: Специалист по позициям создает более качественный черновик для спекулятивного декодирования
POSS: Position Specialist Generates Better Draft for Speculative Decoding
Langlin Huang, Chengsong Huang, Jixuan Leng, Di Huang, Jiaxin Huang
•
Jun 4, 2025
•
6
2
Устойчивость в обеих областях: CLIP требует устойчивого текстового кодировщика
Robustness in Both Domains: CLIP Needs a Robust Text Encoder
Elias Abad Rocamora, Christian Schlarmann, Naman Deep Singh, Yongtao Wu, Matthias Hein, Volkan Cevher
•
Jun 3, 2025
•
6
2
Critique-GRPO: Усовершенствование логического мышления больших языковых моделей с использованием обратной связи на естественном языке и числовых данных
Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
Xiaoying Zhang, Hao Sun, Yipeng Zhang, Kaituo Feng, Chaochao Lu, Chao Yang, Helen Meng
•
Jun 3, 2025
•
6
2
CapSpeech: Включение последующих приложений в синтез речи с учетом стиля в текстовых описаниях
CapSpeech: Enabling Downstream Applications in Style-Captioned Text-to-Speech
Helin Wang, Jiarui Hai, Dading Chong, Karan Thakkar, Tiantian Feng, Dongchao Yang, Junhyeok Lee, Laureano Moro Velazquez, Jesus Villalba, Zengyi Qin, Shrikanth Narayanan, Mounya Elhiali, Najim Dehak
•
Jun 3, 2025
•
6
3
Адаптация перед непрерывным обучением
Adapt before Continual Learning
Aojun Lu, Tao Feng, Hangjie Yuan, Chunhui Ding, Yanan Sun
•
Jun 4, 2025
•
5
2
Video-Skill-CoT: Цепочка рассуждений на основе навыков для адаптивного к домену анализа видео
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning
Daeun Lee, Jaehong Yoon, Jaemin Cho, Mohit Bansal
•
Jun 4, 2025
•
5
2
RefEdit: Бенчмарк и метод для улучшения моделей редактирования изображений на основе инструкций с использованием референциальных выражений
RefEdit: A Benchmark and Method for Improving Instruction-based Image Editing Model on Referring Expressions
Bimsara Pathiraja, Maitreya Patel, Shivam Singh, Yezhou Yang, Chitta Baral
•
Jun 3, 2025
•
4
2
Количественные оценки языковых моделей
Quantitative LLM Judges
Aishwarya Sahoo, Jeevana Kruthi Karnuthala, Tushar Parmanand Budhwani, Pranchal Agarwal, Sankaran Vaidyanathan, Alexa Siu, Franck Dernoncourt, Jennifer Healey, Nedim Lipka, Ryan Rossi, Uttaran Bhattacharya, Branislav Kveton
•
Jun 3, 2025
•
4
2
Улучшение дистилляции знаний при неизвестном ковариатном сдвиге с помощью дополнения данных, управляемого уверенностью
Improving Knowledge Distillation Under Unknown Covariate Shift Through Confidence-Guided Data Augmentation
Niclas Popp, Kevin Alexander Laube, Matthias Hein, Lukas Schott
•
Jun 2, 2025
•
4
2
Следуйте потоку: Точное определение авторства блок-схем с помощью нейросимволических агентов
Follow the Flow: Fine-grained Flowchart Attribution with Neurosymbolic Agents
Manan Suri, Puneet Mathur, Nedim Lipka, Franck Dernoncourt, Ryan A. Rossi, Vivek Gupta, Dinesh Manocha
•
Jun 2, 2025
•
4
2
DLP: Динамическое послойное прореживание в крупных языковых моделях
DLP: Dynamic Layerwise Pruning in Large Language Models
Yuli Chen, Bo Cheng, Jiale Han, Yingying Zhang, Yingting Li, Shuhao Zhang
•
May 27, 2025
•
4
2
Раскрытие потенциала обучения на часовых видео для понимания длинных видео-текстовых последовательностей
Unleashing Hour-Scale Video Training for Long Video-Language Understanding
Jingyang Lin, Jialian Wu, Ximeng Sun, Ze Wang, Jiang Liu, Yusheng Su, Xiaodong Yu, Hao Chen, Jiebo Luo, Zicheng Liu, Emad Barsoum
•
Jun 5, 2025
•
3
1
TRiSM для агентного ИИ: Обзор управления доверием, рисками и безопасностью в мультиагентных системах на основе языковых моделей с агентной архитектурой
TRiSM for Agentic AI: A Review of Trust, Risk, and Security Management in LLM-based Agentic Multi-Agent Systems
Shaina Raza, Ranjan Sapkota, Manoj Karkee, Christos Emmanouilidis
•
Jun 4, 2025
•
3
2
HTSC-2025: Эталонный набор данных высокотемпературных сверхпроводников при атмосферном давлении для прогнозирования критической температуры с использованием искусственного интеллекта
HTSC-2025: A Benchmark Dataset of Ambient-Pressure High-Temperature Superconductors for AI-Driven Critical Temperature Prediction
Xiao-Qi Han, Ze-Feng Gao, Xin-De Wang, Zhenfeng Ouyang, Peng-Jie Guo, Zhong-Yi Lu
•
Jun 4, 2025
•
3
2
Оптимизация политики на уровне сегментов: эффективное распределение кредитов на уровне сегментов в обучении с подкреплением для больших языковых моделей
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
Yiran Guo, Lijie Xu, Jie Liu, Dan Ye, Shuang Qiu
•
May 29, 2025
•
3
2
Rex-Thinker: Основанное на объектах указание через цепочку рассуждений
Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning
Qing Jiang, Xingyu Chen, Zhaoyang Zeng, Junzhi Yu, Lei Zhang
•
Jun 4, 2025
•
2
2
Переосмысление компромисса между стабильностью и пластичностью в непрерывном обучении с архитектурной точки зрения
Rethinking the Stability-Plasticity Trade-off in Continual Learning from an Architectural Perspective
Aojun Lu, Hangjie Yuan, Tao Feng, Yanan Sun
•
Jun 4, 2025
•
2
2
CRAWLDoc: Набор данных для устойчивого ранжирования библиографических документов
CRAWLDoc: A Dataset for Robust Ranking of Bibliographic Documents
Fabian Karl, Ansgar Scherp
•
Jun 4, 2025
•
2
2
VLMs способны агрегировать разрозненные обучающие патчи.
VLMs Can Aggregate Scattered Training Patches
Zhanhui Zhou, Lingjie Chen, Chao Yang, Chaochao Lu
•
Jun 4, 2025
•
2
2
Устойчивый нейронный рендеринг в реальных условиях с использованием асимметричного двойного 3D-гауссовского сплатинга
Robust Neural Rendering in the Wild with Asymmetric Dual 3D Gaussian Splatting
Chengqi Li, Zhihao Shi, Yangdi Lu, Wenbo He, Xiangyu Xu
•
Jun 4, 2025
•
2
2
Решение обратных задач с использованием FLAIR
Solving Inverse Problems with FLAIR
Julius Erbach, Dominik Narnhofer, Andreas Dombos, Bernt Schiele, Jan Eric Lenssen, Konrad Schindler
•
Jun 3, 2025
•
2
2
FinChain: Символический эталон для проверяемого цепочечного финансового рассуждения
FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning
Zhuohan Xie, Dhruv Sahnan, Debopriyo Banerjee, Georgi Georgiev, Rushil Thareja, Hachem Madmoun, Jinyan Su, Aaryamonvikram Singh, Yuxia Wang, Rui Xing, Fajri Koto, Haonan Li, Ivan Koychev, Tanmoy Chakraborty, Salem Lahlou, Veselin Stoyanov, Preslav Nakov
•
Jun 3, 2025
•
2
2
Малые языковые модели — это будущее агентного искусственного интеллекта.
Small Language Models are the Future of Agentic AI
Peter Belcak, Greg Heinrich, Shizhe Diao, Yonggan Fu, Xin Dong, Saurav Muralidharan, Yingyan Celine Lin, Pavlo Molchanov
•
Jun 2, 2025
•
2
2
Звуковое восприятие объекта: интерактивная генерация аудио на основе изображений с учетом объекта
Sounding that Object: Interactive Object-Aware Image to Audio Generation
Tingle Li, Baihe Huang, Xiaobin Zhuang, Dongya Jia, Jiawei Chen, Yuping Wang, Zhuo Chen, Gopala Anumanchipalli, Yuxuan Wang
•
Jun 4, 2025
•
1
2
Обзор гиперпараметров активного обучения: выводы из масштабного экспериментального исследования
Survey of Active Learning Hyperparameters: Insights from a Large-Scale Experimental Grid
Julius Gonsior, Tim Rieß, Anja Reusch, Claudio Hartmann, Maik Thiele, Wolfgang Lehner
•
Jun 4, 2025
•
1
2
RiOSWorld: Оценка рисков многомодальных агентов для работы с компьютером
RiOSWorld: Benchmarking the Risk of Multimodal Compter-Use Agents
Jingyi Yang, Shuai Shao, Dongrui Liu, Jing Shao
•
May 31, 2025
•
1
2