ChatPaper.aiChatPaper.ai
Главная

arXiv

HuggingFace

ЦеныАккаунтРабочее пространство

•
•

•
•

•
•

•
•

•
•

Footer

Company name

ChatPaper.ai: Your advanced AI reading assistant.

Contact us: [email protected]

X (Twitter)

Products

  • AI Search
  • AI Mind Map
  • Arxiv Summary
  • Huggingface Summary

Support

  • FAQ
  • Contact

Company

  • Blog
  • Privacy Policy
  • Terms of Service

Available Languages

  • 🇬🇧English
  • 🇨🇳中文简体
  • 🇭🇰繁體中文
  • 🇯🇵日本語
  • 🇰🇷한국어
  • 🇩🇪Deutsch
  • 🇫🇷Français
  • 🇷🇺Русский
  • 🇪🇸Español

© 2025 chatpaper.ai All rights reserved.

Ежедневные Исследовательские Статьи по ИИ

Ежедневно отобранные исследовательские статьи по ИИ с переводами

За пределами правила 80/20: Высокоэнтропийные миноритарные токены способствуют эффективному обучению с подкреплением для рассуждений в больших языковых моделях
Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning

Shenzhi Wang, Le Yu, Chang Gao, Chujie Zheng, Shixuan Liu, Rui Lu, Kai Dang, Xionghui Chen, Jianxin Yang, Zhenru Zhang, Yuqiong Liu, An Yang, Andrew Zhao, Yang Yue, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin•Jun 2, 2025•1293

SmolVLA: Модель "Видение-Язык-Действие" для доступной и эффективной робототехники
SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics

Mustafa Shukor, Dana Aubakirova, Francesco Capuano, Pepijn Kooijmans, Steven Palma, Adil Zouitine, Michel Aractingi, Caroline Pascal, Martino Russi, Andres Marafioti, Simon Alibert, Matthieu Cord, Thomas Wolf, Remi Cadene•Jun 2, 2025•7414

REASONING GYM: Среды для обучения с подкреплением с проверяемыми вознаграждениями
REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards

Zafir Stojanovski, Oliver Stanley, Joe Sharratt, Richard Jones, Abdulhakeem Adefioye, Jean Kaddour, Andreas Köpf•May 30, 2025•584

Управление большими языковыми моделями через масштабирование скорости обучения с группировкой градиентов
Taming LLMs by Scaling Learning Rates with Gradient Grouping

Siyuan Li, Juanxi Tian, Zedong Wang, Xin Jin, Zicheng Liu, Wentao Zhang, Dan Xu•Jun 1, 2025•354

Временная тонкая настройка в контексте для универсального управления моделями диффузии видео
Temporal In-Context Fine-Tuning for Versatile Control of Video Diffusion Models

Kinam Kim, Junha Hyung, Jaegul Choo•Jun 1, 2025•343

SRPO: Улучшение мультимодального рассуждения в больших языковых моделях с использованием рефлексивно-осознанного обучения с подкреплением
SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning

Zhongwei Wan, Zhihao Dou, Che Liu, Yu Zhang, Dongfei Cui, Qinjian Zhao, Hui Shen, Jing Xiong, Yi Xin, Yifan Jiang, Yangfan He, Mi Zhang, Shen Yan•Jun 2, 2025•302

ShapeLLM-Omni: Нативная мультимодальная языковая модель для генерации и анализа 3D-данных
ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding

Junliang Ye, Zhengyi Wang, Ruowen Zhao, Shenghao Xie, Jun Zhu•Jun 2, 2025•272

ARIA: Обучение языковых агентов с помощью агрегации вознаграждений, управляемой намерениями
ARIA: Training Language Agents with Intention-Driven Reward Aggregation

Ruihan Yang, Yikai Zhang, Aili Chen, Xintao Wang, Siyu Yuan, Jiangjie Chen, Deqing Yang, Yanghua Xiao•May 31, 2025•272

LoHoVLA: Унифицированная модель "Видение-Язык-Действие" для долгосрочных воплощённых задач
LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks

Yi Yang, Jiaxuan Sun, Siqi Kou, Yihan Wang, Zhijie Deng•May 31, 2025•272

Jigsaw-R1: Исследование визуального обучения с подкреплением на основе правил с использованием головоломок-пазлов
Jigsaw-R1: A Study of Rule-based Visual Reinforcement Learning with Jigsaw Puzzles

Zifu Wang, Junyi Zhu, Bo Tang, Zhiyu Li, Feiyu Xiong, Jiaqian Yu, Matthew B. Blaschko•May 29, 2025•242

Обучение генерации видео для роботизированного манипулирования с совместным управлением траекториями
Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control

Xiao Fu, Xintao Wang, Xian Liu, Jianhong Bai, Runsen Xu, Pengfei Wan, Di Zhang, Dahua Lin•Jun 2, 2025•232

EarthMind: В направлении многомасштабного и мультисенсорного наблюдения Земли с использованием крупных мультимодальных моделей
EarthMind: Towards Multi-Granular and Multi-Sensor Earth Observation with Large Multimodal Models

Yan Shu, Bin Ren, Zhitong Xiong, Danda Pani Paudel, Luc Van Gool, Begum Demir, Nicu Sebe, Paolo Rota•Jun 2, 2025•202

AReaL: Масштабируемая асинхронная система обучения с подкреплением для языковых рассуждений
AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning

Wei Fu, Jiaxuan Gao, Xujie Shen, Chen Zhu, Zhiyu Mei, Chuyi He, Shusheng Xu, Guo Wei, Jun Mei, Jiashu Wang, Tongkai Yang, Binhang Yuan, Yi Wu•May 30, 2025•202

Универсальные законы масштабирования для сжатых представлений
Unified Scaling Laws for Compressed Representations

Andrei Panferov, Alexandra Volkova, Ionut-Vlad Modoranu, Vage Egiazarian, Mher Safaryan, Dan Alistarh•Jun 2, 2025•172

MiCRo: Моделирование смесей и контекстно-зависимая маршрутизация для персонализированного обучения предпочтениям
MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning

Jingyan Shen, Jiarui Yao, Rui Yang, Yifan Sun, Feng Luo, Rui Pan, Tong Zhang, Han Zhao•May 30, 2025•152

Стимулирование логического мышления для улучшенного выполнения сложных инструкций в крупных языковых моделях
Incentivizing Reasoning for Advanced Instruction-Following of Large Language Models

Yulei Qin, Gang Li, Zongyi Li, Zihan Xu, Yuchen Shi, Zhekai Lin, Xiao Cui, Ke Li, Xing Sun•Jun 2, 2025•142

IVY-FAKE: Унифицированная объяснимая структура и эталон для обнаружения изображений и видео, созданных искусственным интеллектом
IVY-FAKE: A Unified Explainable Framework and Benchmark for Image and Video AIGC Detection

Wayne Zhang, Changjiang Jiang, Zhonghao Zhang, Chenyang Si, Fengchang Yu, Wei Peng•Jun 1, 2025•133

От токена к действию: рассуждения на основе конечных автоматов для снижения чрезмерного анализа в информационном поиске
From Token to Action: State Machine Reasoning to Mitigate Overthinking in Information Retrieval

Dohyeon Lee, Yeonseok Jeong, Seung-won Hwang•May 29, 2025•132

Рассуждая как экономист: пост-обучение на экономических задачах способствует стратегической генерализации в больших языковых моделях
Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs

Yufa Zhou, Shaobo Wang, Xingyu Dong, Xiangqi Jin, Yifang Chen, Yue Min, Kexin Yang, Xingzhang Ren, Dayiheng Liu, Linfeng Zhang•May 31, 2025•112

Cora: Редактирование изображений с учетом соответствий с использованием диффузионной модели за несколько шагов
Cora: Correspondence-aware image editing using few step diffusion

Amirhossein Almohammadi, Aryan Mikaeili, Sauradip Nag, Negar Hassanpour, Andrea Tagliasacchi, Ali Mahdavi-Amiri•May 29, 2025•112

WebChoreArena: Оценка веб-браузерных агентов на реалистичных монотонных веб-задачах
WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks

Atsuyuki Miyai, Zaiying Zhao, Kazuki Egashira, Atsuki Sato, Tatsumi Sunada, Shota Onohara, Hiromasa Yamanishi, Mashiro Toyooka, Kunato Nishina, Ryoma Maeda, Kiyoharu Aizawa, Toshihiko Yamasaki•Jun 2, 2025•103

VisualSphinx: Масштабные синтетические визуально-логические головоломки для обучения с подкреплением
VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL

Yichen Feng, Zhangchen Xu, Fengqing Jiang, Yuetai Li, Bhaskar Ramasubramanian, Luyao Niu, Bill Yuchen Lin, Radha Poovendran•May 29, 2025•92

OWSM v4: Улучшение открытых речевых моделей в стиле Whisper за счет масштабирования и очистки данных
OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning

Yifan Peng, Shakeel Muhammad, Yui Sudo, William Chen, Jinchuan Tian, Chyi-Jiunn Lin, Shinji Watanabe•May 31, 2025•82

Обучение на видеоданных для 3D-мира: Улучшение мультимодальных языковых моделей с использованием геометрических приоритетов в 3D-зрении
Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors

Duo Zheng, Shijia Huang, Yanyang Li, Liwei Wang•May 30, 2025•82

Стресс-тестирование обнаружения машинно-сгенерированного текста: изменение стиля написания языковых моделей для обмана детекторов
Stress-testing Machine Generated Text Detection: Shifting Language Models Writing Style to Fool Detectors

Andrea Pedrotti, Michele Papucci, Cristiano Ciaccio, Alessio Miaschi, Giovanni Puccetti, Felice Dell'Orletta, Andrea Esuli•May 30, 2025•82

CodeV-R1: Генерация Verilog с улучшенными возможностями логического вывода
CodeV-R1: Reasoning-Enhanced Verilog Generation

Yaoyu Zhu, Di Huang, Hanqi Lyu, Xiaoyun Zhang, Chongxiao Li, Wenxuan Shi, Yutong Wu, Jianan Mu, Jinghua Wang, Yang Zhao, Pengwei Jin, Shuyao Cheng, Shengwen Liang, Xishan Zhang, Rui Zhang, Zidong Du, Qi Guo, Xing Hu, Yunji Chen•May 30, 2025•82

DyePack: Доказательное выявление загрязнения тестового набора в языковых моделях с использованием бэкдоров
DyePack: Provably Flagging Test Set Contamination in LLMs Using Backdoors

Yize Cheng, Wenxiao Wang, Mazda Moayeri, Soheil Feizi•May 29, 2025•82

Нормализованное управление вниманием: универсальное негативное управление для диффузионной модели
Normalized Attention Guidance: Universal Negative Guidance for Diffusion Model

Dar-Yen Chen, Hmrishav Bandyopadhyay, Kai Zou, Yi-Zhe Song•May 27, 2025•83

Эзотерические языковые модели
Esoteric Language Models

Subham Sekhar Sahoo, Zhihan Yang, Yash Akhauri, Johnna Liu, Deepansha Singh, Zhoujun Cheng, Zhengzhong Liu, Eric Xing, John Thickstun, Arash Vahdat•Jun 2, 2025•72

zip2zip: Адаптивные словари для языковых моделей во время вывода через сжатие токенов
zip2zip: Inference-Time Adaptive Vocabularies for Language Models via Token Compression

Saibo Geng, Nathan Ranchin, Yunzhen yao, Maxime Peyrard, Chris Wendler, Michael Gastpar, Robert West•Jun 1, 2025•72

Машина Дарвина-Гёделя: Бесконечная эволюция самоулучшающихся агентов
Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents

Jenny Zhang, Shengran Hu, Cong Lu, Robert Lange, Jeff Clune•May 29, 2025•72

КОГДА ДЕЙСТВОВАТЬ, КОГДА ЖДАТЬ: Моделирование структурных траекторий для определения готовности к выполнению намерений в целеориентированном диалоге
WHEN TO ACT, WHEN TO WAIT: Modeling Structural Trajectories for Intent Triggerability in Task-Oriented Dialogue

Yaoyao Qian, Jindan Huang, Yuanli Wang, Simon Yu, Kyrie Zhixuan Zhou, Jiayuan Mao, Mingfu Liang, Hanhan Zhou•Jun 2, 2025•62

Каскадное распространение предвзятости от внедрения к дистилляции в языковых моделях
Cascading Adversarial Bias from Injection to Distillation in Language Models

Harsh Chaudhari, Jamie Hayes, Matthew Jagielski, Ilia Shumailov, Milad Nasr, Alina Oprea•May 30, 2025•62

VAU-R1: Улучшение понимания видеосцен с аномалиями посредством тонкой настройки с использованием обучения с подкреплением
VAU-R1: Advancing Video Anomaly Understanding via Reinforcement Fine-Tuning

Liyun Zhu, Qixiang Chen, Xi Shen, Xiaodong Cun•May 29, 2025•62

SATA-BENCH: Бенчмарк "Выберите все подходящие варианты" для вопросов с множественным выбором
SATA-BENCH: Select All That Apply Benchmark for Multiple Choice Questions

Weijie Xu, Shixian Cui, Xi Fang, Chi Xue, Stephanie Eckman, Chandan Reddy•May 31, 2025•52

Pro3D-Editor: Прогрессивный подход на основе перспектив для согласованного и точного редактирования 3D-моделей
Pro3D-Editor : A Progressive-Views Perspective for Consistent and Precise 3D Editing

Yang Zheng, Mengqi Huang, Nan Chen, Zhendong Mao•May 31, 2025•52

Шаг обучения для всего: унифицированный график скорости обучения для тренировки с ограниченным числом итераций
Stepsize anything: A unified learning rate schedule for budgeted-iteration training

Anda Tang, Yiming Dong, Yutao Zeng, zhou Xun, Zhouchen Lin•May 30, 2025•52

От рекомендаций к практике: новая парадигма оценки языковых моделей для арабского языка
From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation

Serry Sibaee, Omer Nacar, Adel Ammar, Yasser Al-Habashi, Abdulrahman Al-Batati, Wadii Boulila•Jun 2, 2025•43

От рекомендаций к практике: новая парадигма оценки языковых моделей для арабского языка
From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation

Serry Sibaee, Omer Nacar, Adel Ammar, Yasser Al-Habashi, Abdulrahman Al-Batati, Wadii Boulila•Jun 2, 2025•43

LLM в цикле: создание набора данных PARADEHATE для детоксикации языка ненависти
LLM in the Loop: Creating the PARADEHATE Dataset for Hate Speech Detoxification

Shuzhou Yuan, Ercong Nie, Lukas Kouba, Ashish Yashwanth Kangen, Helmut Schmid, Hinrich Schutze, Michael Farber•Jun 2, 2025•43

RARE: Оценка устойчивости с учетом извлечения для систем генерации с усилением извлечением
RARE: Retrieval-Aware Robustness Evaluation for Retrieval-Augmented Generation Systems

Yixiao Zeng, Tianyu Cao, Danqing Wang, Xinran Zhao, Zimeng Qiu, Morteza Ziyadi, Tongshuang Wu, Lei Li•Jun 1, 2025•42

ComposeAnything: Приоритеты составных объектов для генерации изображений по тексту
ComposeAnything: Composite Object Priors for Text-to-Image Generation

Zeeshan Khan, Shizhe Chen, Cordelia Schmid•May 30, 2025•43

OmniResponse: Генерация мультимодальных диалоговых ответов в режиме реального времени в рамках диадических взаимодействий
OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions

Cheng Luo, Jianghui Wang, Bing Li, Siyang Song, Bernard Ghanem•May 27, 2025•42

Как концепции программирования и нейроны взаимодействуют в языковых моделях для написания кода
How Programming Concepts and Neurons Are Shared in Code Language Models

Amir Hossein Kargaran, Yihong Liu, François Yvon, Hinrich Schütze•Jun 1, 2025•32

SealQA: Повышение стандартов логического мышления в языковых моделях с расширенным поиском
SealQA: Raising the Bar for Reasoning in Search-Augmented Language Models

Thinh Pham, Nguyen Nguyen, Pratibha Zunjare, Weiyuan Chen, Yu-Min Tseng, Tu Vu•Jun 1, 2025•32

Подводные камни в оценке языковых моделей как прогнозирующих систем
Pitfalls in Evaluating Language Model Forecasters

Daniel Paleka, Shashwat Goel, Jonas Geiping, Florian Tramèr•May 31, 2025•32

SenseFlow: Масштабирование распределительного согласования для потоковой дистилляции текст-в-изображение
SenseFlow: Scaling Distribution Matching for Flow-based Text-to-Image Distillation

Xingtong Ge, Xin Zhang, Tongda Xu, Yi Zhang, Xinjie Zhang, Yan Wang, Jun Zhang•May 31, 2025•32

MaskSearch: Универсальная предобучающая структура для повышения поисковых возможностей агентов
MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search Capability

Weiqi Wu, Xin Guan, Shen Huang, Yong Jiang, Pengjun Xie, Fei Huang, Jiuxin Cao, Hai Zhao, Jingren Zhou•May 26, 2025•32

Подумайте еще раз! Влияние вычислительных ресурсов во время тестирования на предпочтения, мнения и убеждения крупных языковых моделей
Think Again! The Effect of Test-Time Compute on Preferences, Opinions, and Beliefs of Large Language Models

George Kour, Itay Nakash, Ateret Anaby-Tavor, Michal Shmueli-Scheuer•May 26, 2025•32

Согласование ассистентов на основе визуально-языковых моделей с персонализированной ситуативной когницией
Aligning VLM Assistants with Personalized Situated Cognition

Yongqi Li, Shen Zhou, Xiaohu Li, Xin Miao, Jintao Wen, Mayi Xu, Jianhao Chen, Birong Pan, Hankun Kang, Yuanyuan Zhu, Ming Zhong, Tieyun Qian•Jun 1, 2025•22

LIFT the Veil for the Truth: Основные веса проявляются после снижения ранга для тонкой настройки с упором на рассуждения
LIFT the Veil for the Truth: Principal Weights Emerge after Rank Reduction for Reasoning-Focused Supervised Fine-Tuning

Zihang Liu, Tianyu Pang, Oleg Balabanov, Chaoqun Yang, Tianjin Huang, Lu Yin, Yaoqing Yang, Shiwei Liu•Jun 1, 2025•22

CityLens: Оценка крупных языково-визуальных моделей для анализа городской социально-экономической среды
CityLens: Benchmarking Large Language-Vision Models for Urban Socioeconomic Sensing

Tianhui Liu, Jie Feng, Hetian Pang, Xin Zhang, Tianjian Ouyang, Zhiyuan Zhang, Yong Li•May 31, 2025•22

Массовая многоязычная адаптация крупных языковых моделей с использованием данных двуязычного перевода
Massively Multilingual Adaptation of Large Language Models Using Bilingual Translation Data

Shaoxiong Ji, Zihao Li, Jaakko Paavola, Indraneil Paul, Hengyu Luo, Jörg Tiedemann•May 31, 2025•22

MagiCodec: Простой кодек с инжекцией маскированного гауссовского шума для высококачественной реконструкции и генерации
MagiCodec: Simple Masked Gaussian-Injected Codec for High-Fidelity Reconstruction and Generation

Yakun Song, Jiawei Chen, Xiaobin Zhuang, Chenpeng Du, Ziyang Ma, Jian Wu, Jian Cong, Dongya Jia, Zhuo Chen, Yuping Wang, Yuxuan Wang, Xie Chen•May 31, 2025•22

Neuro2Semantic: Фреймворк трансферного обучения для семантической реконструкции непрерывной речи на основе внутричерепной ЭЭГ человека
Neuro2Semantic: A Transfer Learning Framework for Semantic Reconstruction of Continuous Language from Human Intracranial EEG

Siavash Shams, Richard Antonello, Gavin Mischler, Stephan Bickel, Ashesh Mehta, Nima Mesgarani•May 31, 2025•22

BinauralFlow: Каузальный и потоковый подход для синтеза высококачественной бинауральной речи с использованием моделей Flow Matching
BinauralFlow: A Causal and Streamable Approach for High-Quality Binaural Speech Synthesis with Flow Matching Models

Susan Liang, Dejan Markovic, Israel D. Gebru, Steven Krenn, Todd Keebler, Jacob Sandakly, Frank Yu, Samuel Hassel, Chenliang Xu, Alexander Richard•May 28, 2025•22

R1-Code-Interpreter: Обучение языковых моделей для логического рассуждения с использованием кода через методы обучения с учителем и с подкреплением
R1-Code-Interpreter: Training LLMs to Reason with Code via Supervised and Reinforcement Learning

Yongchao Chen, Yueying Liu, Junwei Zhou, Yilun Hao, Jingquan Wang, Yang Zhang, Chuchu Fan•May 27, 2025•22

Франкентекст: Сшивание случайных текстовых фрагментов в длинные повествования
Frankentext: Stitching random text fragments into long-form narratives

Chau Minh Pham, Jenna Russell, Dzung Pham, Mohit Iyyer•May 23, 2025•22

Планирование и бюджетирование: Эффективное и рациональное масштабирование на этапе тестирования для рассуждений в больших языковых моделях
Plan and Budget: Effective and Efficient Test-Time Scaling on Large Language Model Reasoning

Junhong Lin, Xinyue Zeng, Jie Zhu, Song Wang, Julian Shun, Jun Wu, Dawei Zhou•May 22, 2025•22

Пиксели против априорных знаний: Управление априорными знаниями в моделях "визуальный язык" через визуальные контрфакты
Pixels Versus Priors: Controlling Knowledge Priors in Vision-Language Models through Visual Counterfacts

Michal Golovanevsky, William Rudman, Michael Lepori, Amir Bar, Ritambhara Singh, Carsten Eickhoff•May 21, 2025•22

MIKU-PAL: Автоматизированный и стандартизированный мультимодальный метод маркировки паралингвистических и аффективных характеристик речи
MIKU-PAL: An Automated and Standardized Multi-Modal Method for Speech Paralinguistic and Affect Labeling

Yifan Cheng, Ruoyi Zhang, Jiatong Shi•May 21, 2025•22

Аугментация Shuffle PatchMix с псевдометками, взвешенными по доверительному интервалу, для улучшения адаптации без доступа к исходным данным
Shuffle PatchMix Augmentation with Confidence-Margin Weighted Pseudo-Labels for Enhanced Source-Free Domain Adaptation

Prasanna Reddy Pulakurthi, Majid Rabbani, Jamison Heard, Sohail Dianat, Celso M. de Melo, Raghuveer Rao•May 30, 2025•12

Синтез дискретно-непрерывных квантовых схем с использованием мультимодальных моделей диффузии
Synthesis of discrete-continuous quantum circuits with multimodal diffusion models

Florian Fürrutter, Zohim Chandani, Ikko Hamamura, Hans J. Briegel, Gorka Muñoz-Gil•Jun 2, 2025•02