ChatPaper.aiChatPaper.ai
홈

arXiv

HuggingFace

요금제계정작업공간

•
•

•
•

•
•

•
•

•
•

Footer

Company name

ChatPaper.ai: Your advanced AI reading assistant.

Contact us: [email protected]

X (Twitter)

Products

  • AI Search
  • AI Mind Map
  • Arxiv Summary
  • Huggingface Summary

Support

  • FAQ
  • Contact

Company

  • Blog
  • Privacy Policy
  • Terms of Service

Available Languages

  • 🇬🇧English
  • 🇨🇳中文简体
  • 🇭🇰繁體中文
  • 🇯🇵日本語
  • 🇰🇷한국어
  • 🇩🇪Deutsch
  • 🇫🇷Français
  • 🇷🇺Русский
  • 🇪🇸Español

© 2025 chatpaper.ai All rights reserved.

AI 연구 논문 데일리

번역이 포함된 일일 선별된 AI 연구 논문

MiMo-VL 기술 보고서
MiMo-VL Technical Report

Xiaomi LLM-Core Team, Zihao Yue, Zhenru Lin, Yifan Song, Weikun Wang, Shuhuai Ren, Shuhao Gu, Shicheng Li, Peidian Li, Liang Zhao, Lei Li, Kainan Bao, Hao Tian, Hailin Zhang, Gang Wang, Dawei Zhu, Cici, Chenhong He, Bowen Ye, Bowen Shen, Zihan Zhang, Zihan Jiang, Zhixian Zheng, Zhichao Song, Zhenbo Luo, Yue Yu, Yudong Wang, Yuanyuan Tian, Yu Tu, Yihan Yan, Yi Huang, Xu Wang, Xinzhe Xu, Xingchen Song, Xing Zhang, Xing Yong, Xin Zhang, Xiangwei Deng, Wenyu Yang, Wenhan Ma, Weiwei Lv, Weiji Zhuang, Wei Liu, Sirui Deng, Shuo Liu, Shimao Chen, Shihua Yu, Shaohui Liu, Shande Wang, Rui Ma, Qiantong Wang, Peng Wang, Nuo Chen, Menghang Zhu, Kangyang Zhou, Kang Zhou, Kai Fang, Jun Shi, Jinhao Dong, Jiebao Xiao, Jiaming Xu, Huaqiu Liu, Hongshen Xu, Heng Qu, Haochen Zhao, Hanglong Lv, Guoan Wang, Duo Zhang, Dong Zhang, Di Zhang, Chong Ma, Chang Liu, Can Cai, Bingquan Xia•Jun 4, 2025•652

AmbiK: 주방 환경에서의 모호한 작업 데이터셋
AmbiK: Dataset of Ambiguous Tasks in Kitchen Environment

Anastasiia Ivanova, Eva Bakaeva, Zoya Volovikova, Alexey K. Kovalev, Aleksandr I. Panov•Jun 4, 2025•432

다중모달 추론의 발전: 최적화된 콜드 스타트에서 단계적 강화 학습으로
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning

Shuang Chen, Yue Guo, Zhaochen Su, Yafu Li, Yulun Wu, Jiacheng Chen, Jiayu Chen, Weijie Wang, Xiaoye Qu, Yu Cheng•Jun 4, 2025•414

장문맥 언어 모델에 대한 제어 가능한 검증
A Controllable Examination for Long-Context Language Models

Yijun Yang, Zeyu Huang, Wenhao Zhu, Zihan Qiu, Fei Yuan, Jeff Z. Pan, Ivan Titov•Jun 3, 2025•302

MMR-V: 말하지 않은 것은 무엇인가? 비디오 내 다중 양식 심층 추론을 위한 벤치마크
MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos

Kejian Zhu, Zhuoran Jin, Hongbang Yuan, Jiachun Li, Shangqing Tu, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao•Jun 4, 2025•282

SuperWriter: 대규모 언어 모델 기반의 반성 주도 장문 생성
SuperWriter: Reflection-Driven Long-Form Generation with Large Language Models

Yuhao Wu, Yushi Bai, Zhiqiang Hu, Juanzi Li, Roy Ka-Wei Lee•Jun 4, 2025•262

OpenThoughts: 추론 모델을 위한 데이터 레시피
OpenThoughts: Data Recipes for Reasoning Models

Etash Guha, Ryan Marten, Sedrick Keh, Negin Raoof, Georgios Smyrnis, Hritik Bansal, Marianna Nezhurina, Jean Mercat, Trung Vu, Zayne Sprague, Ashima Suvarna, Benjamin Feuer, Liangyu Chen, Zaid Khan, Eric Frankel, Sachin Grover, Caroline Choi, Niklas Muennighoff, Shiye Su, Wanjia Zhao, John Yang, Shreyas Pimpalgaonkar, Kartik Sharma, Charlie Cheng-Jie Ji, Yichuan Deng, Sarah Pratt, Vivek Ramanujan, Jon Saad-Falcon, Jeffrey Li, Achal Dave, Alon Albalak, Kushal Arora, Blake Wulfe, Chinmay Hegde, Greg Durrett, Sewoong Oh, Mohit Bansal, Saadia Gabriel, Aditya Grover, Kai-Wei Chang, Vaishaal Shankar, Aaron Gokaslan, Mike A. Merrill, Tatsunori Hashimoto, Yejin Choi, Jenia Jitsev, Reinhard Heckel, Maheswaran Sathiamoorthy, Alexandros G. Dimakis, Ludwig Schmidt•Jun 4, 2025•252

신뢰할 수 있는 LLM 평가를 위한 단축경로 뉴런 분석 방법 구축
Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis

Kejian Zhu, Shangqing Tu, Zhuoran Jin, Lei Hou, Juanzi Li, Jun Zhao•Jun 4, 2025•242

Voyager: 탐색 가능한 3D 장면 생성을 위한 장거리 및 세계 일관성 비디오 확산 모델
Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation

Tianyu Huang, Wangguandong Zheng, Tengfei Wang, Yuhao Liu, Zhenwei Wang, Junta Wu, Jie Jiang, Hui Li, Rynson W. H. Lau, Wangmeng Zuo, Chunchao Guo•Jun 4, 2025•212

VisCoder: 실행 가능한 파이썬 시각화 코드 생성을 위한 LLM 미세 조정
VisCoder: Fine-Tuning LLMs for Executable Python Visualization Code Generation

Yuansheng Ni, Ping Nie, Kai Zou, Xiang Yue, Wenhu Chen•Jun 4, 2025•202

IllumiCraft: 제어 가능한 비디오 생성을 위한 통합 기하학 및 조명 확산
IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video Generation

Yuanze Lin, Yi-Wen Chen, Yi-Hsuan Tsai, Ronald Clark, Ming-Hsuan Yang•Jun 3, 2025•203

확산 모델을 활용한 프로그램 기반 이미지 편집
Image Editing As Programs with Diffusion Models

Yujia Hu, Songhua Liu, Zhenxiong Tan, Xingyi Yang, Xinchao Wang•Jun 4, 2025•192

단일 문제에 대한 비평 미세 조정을 통해 사전 학습된 대형 언어 모델의 추론 잠재력 발휘하기
Unleashing the Reasoning Potential of Pre-trained LLMs by Critique Fine-Tuning on One Problem

Yubo Wang, Ping Nie, Kai Zou, Lijun Wu, Wenhu Chen•Jun 3, 2025•162

Ψ-샘플러: 점수 모델에서 SMC 기반 추론 시점 보상 정렬을 위한 초기 입자 샘플링
Ψ-Sampler: Initial Particle Sampling for SMC-Based Inference-Time Reward Alignment in Score Models

Taehoon Yoon, Yunhong Min, Kyeongmin Yeo, Minhyuk Sung•Jun 2, 2025•162

LayerFlow: 레이어 인식 비디오 생성을 위한 통합 모델
LayerFlow: A Unified Model for Layer-aware Video Generation

Sihui Ji, Hao Luo, Xi Chen, Yuanpeng Tu, Yiyang Wang, Hengshuang Zhao•Jun 4, 2025•132

DenseDPO: 비디오 확산 모델을 위한 세밀한 시간적 선호도 최적화
DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models

Ziyi Wu, Anil Kag, Ivan Skorokhodov, Willi Menapace, Ashkan Mirzaei, Igor Gilitschenski, Sergey Tulyakov, Aliaksandr Siarohin•Jun 4, 2025•132

SVGenius: SVG 이해, 편집 및 생성에서의 LLM 벤치마킹
SVGenius: Benchmarking LLMs in SVG Understanding, Editing and Generation

Siqi Chen, Xinyu Dong, Haolei Xu, Xingyu Wu, Fei Tang, Hang Zhang, Yuchen Yan, Linjuan Wu, Wenqi Zhang, Guiyang Hou, Yongliang Shen, Weiming Lu, Yueting Zhuang•Jun 3, 2025•132

TimeHC-RL: 시간 인지적 계층적 강화 학습을 통한 대형 언어 모델의 사회적 지능 향상
TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence

Guiyang Hou, Xing Gao, Yuchuan Wu, Xiang Huang, Wenqi Zhang, Zhe Zheng, Yongliang Shen, Jialu Du, Fei Huang, Yongbin Li, Weiming Lu•May 30, 2025•112

정규화된 희소 주의력
Rectified Sparse Attention

Yutao Sun, Tianzhu Ye, Li Dong, Yuqing Xia, Jian Chen, Yizhao Gao, Shijie Cao, Jianyong Wang, Furu Wei•Jun 4, 2025•92

오락: 다양한 비디오 게임에서 LLM 에이전트의 훈련 및 평가를 위한 기초 벤치마크
Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games

Dongmin Park, Minkyu Kim, Beongjun Choi, Junhyuck Kim, Keon Lee, Jonghyun Lee, Inkyu Park, Byeong-Uk Lee, Jaeyoung Hwang, Jaewoo Ahn, Ameya S. Mahabaleshwarkar, Bilal Kartal, Pritam Biswas, Yoshi Suhara, Kangwook Lee, Jaewoong Cho•Jun 4, 2025•92

표면 너머: LLM 판단에서의 자기 선호도 측정
Beyond the Surface: Measuring Self-Preference in LLM Judgments

Zhi-Yuan Chen, Hao Wang, Xinyu Zhang, Enrui Hu, Yankai Lin•Jun 3, 2025•82

BenchHub: 통합적 및 맞춤형 LLM 평가를 위한 통합 벤치마크 스위트
BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation

Eunsu Kim, Haneul Yoo, Guijin Son, Hitesh Patel, Amit Agarwal, Alice Oh•May 31, 2025•82

TalkingMachines: 자동회귀 확산 모델을 통한 실시간 오디오 기반 FaceTime 스타일 비디오 생성
TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models

Chetwin Low, Weimin Wang•Jun 3, 2025•72

DiffDecompose: 디퓨전 트랜스포머를 통한 알파 합성 이미지의 계층적 분해
DiffDecompose: Layer-Wise Decomposition of Alpha-Composited Images via Diffusion Transformers

Zitong Wang, Hang Zhao, Qianyu Zhou, Xuequan Lu, Xiangtai Li, Yiren Song•May 24, 2025•72

POSS: 포지션 전문가가 스펙큘레이티브 디코딩을 위한 더 나은 초안 생성
POSS: Position Specialist Generates Better Draft for Speculative Decoding

Langlin Huang, Chengsong Huang, Jixuan Leng, Di Huang, Jiaxin Huang•Jun 4, 2025•62

양 영역에서의 견고성: CLIP은 견고한 텍스트 인코더가 필요하다
Robustness in Both Domains: CLIP Needs a Robust Text Encoder

Elias Abad Rocamora, Christian Schlarmann, Naman Deep Singh, Yongtao Wu, Matthias Hein, Volkan Cevher•Jun 3, 2025•62

Critique-GRPO: 자연어 및 수치적 피드백을 통한 LLM 추론 능력 향상
Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback

Xiaoying Zhang, Hao Sun, Yipeng Zhang, Kaituo Feng, Chaochao Lu, Chao Yang, Helen Meng•Jun 3, 2025•62

CapSpeech: 스타일 캡션 텍스트-음성 변환에서의 다운스트림 애플리케이션 활성화
CapSpeech: Enabling Downstream Applications in Style-Captioned Text-to-Speech

Helin Wang, Jiarui Hai, Dading Chong, Karan Thakkar, Tiantian Feng, Dongchao Yang, Junhyeok Lee, Laureano Moro Velazquez, Jesus Villalba, Zengyi Qin, Shrikanth Narayanan, Mounya Elhiali, Najim Dehak•Jun 3, 2025•63

지속 학습 전에 적응하기
Adapt before Continual Learning

Aojun Lu, Tao Feng, Hangjie Yuan, Chunhui Ding, Yanan Sun•Jun 4, 2025•52

Video-Skill-CoT: 도메인 적응형 비디오 추론을 위한 스킬 기반 사고의 연쇄
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning

Daeun Lee, Jaehong Yoon, Jaemin Cho, Mohit Bansal•Jun 4, 2025•52

RefEdit: 참조 표현을 기반으로 한 지시 기반 이미지 편집 모델의 성능 향상을 위한 벤치마크 및 방법
RefEdit: A Benchmark and Method for Improving Instruction-based Image Editing Model on Referring Expressions

Bimsara Pathiraja, Maitreya Patel, Shivam Singh, Yezhou Yang, Chitta Baral•Jun 3, 2025•42

정량적 LLM 평가자
Quantitative LLM Judges

Aishwarya Sahoo, Jeevana Kruthi Karnuthala, Tushar Parmanand Budhwani, Pranchal Agarwal, Sankaran Vaidyanathan, Alexa Siu, Franck Dernoncourt, Jennifer Healey, Nedim Lipka, Ryan Rossi, Uttaran Bhattacharya, Branislav Kveton•Jun 3, 2025•42

알려지지 않은 공변량 변화 하에서 신뢰도 기반 데이터 증강을 통한 지식 증류 개선
Improving Knowledge Distillation Under Unknown Covariate Shift Through Confidence-Guided Data Augmentation

Niclas Popp, Kevin Alexander Laube, Matthias Hein, Lukas Schott•Jun 2, 2025•42

흐름을 따라가라: 신경-기호 에이전트를 활용한 세밀한 플로우차트 속성 추적
Follow the Flow: Fine-grained Flowchart Attribution with Neurosymbolic Agents

Manan Suri, Puneet Mathur, Nedim Lipka, Franck Dernoncourt, Ryan A. Rossi, Vivek Gupta, Dinesh Manocha•Jun 2, 2025•42

DLP: 대규모 언어 모델을 위한 동적 계층별 가지치기
DLP: Dynamic Layerwise Pruning in Large Language Models

Yuli Chen, Bo Cheng, Jiale Han, Yingying Zhang, Yingting Li, Shuhao Zhang•May 27, 2025•42

장기 비디오-언어 이해를 위한 시간 단위 비디오 훈련의 활용
Unleashing Hour-Scale Video Training for Long Video-Language Understanding

Jingyang Lin, Jialian Wu, Ximeng Sun, Ze Wang, Jiang Liu, Yusheng Su, Xiaodong Yu, Hao Chen, Jiebo Luo, Zicheng Liu, Emad Barsoum•Jun 5, 2025•31

에이전트형 AI를 위한 TRiSM: LLM 기반 에이전트형 다중 에이전트 시스템에서의 신뢰, 위험 및 보안 관리에 대한 리뷰
TRiSM for Agentic AI: A Review of Trust, Risk, and Security Management in LLM-based Agentic Multi-Agent Systems

Shaina Raza, Ranjan Sapkota, Manoj Karkee, Christos Emmanouilidis•Jun 4, 2025•32

HTSC-2025: AI 기반 임계온도 예측을 위한 상압 고온 초전도체 벤치마크 데이터셋
HTSC-2025: A Benchmark Dataset of Ambient-Pressure High-Temperature Superconductors for AI-Driven Critical Temperature Prediction

Xiao-Qi Han, Ze-Feng Gao, Xin-De Wang, Zhenfeng Ouyang, Peng-Jie Guo, Zhong-Yi Lu•Jun 4, 2025•32

세그먼트 정책 최적화: 대규모 언어 모델을 위한 강화 학습에서의 효과적인 세그먼트 수준 신용 할당
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models

Yiran Guo, Lijie Xu, Jie Liu, Dan Ye, Shuang Qiu•May 29, 2025•32

Rex-Thinker: 사고의 연쇄적 추론을 통한 객체 참조
Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning

Qing Jiang, Xingyu Chen, Zhaoyang Zeng, Junzhi Yu, Lei Zhang•Jun 4, 2025•22

안정성-가소성 트레이드오프 재고: 지속 학습에서의 아키텍처 관점
Rethinking the Stability-Plasticity Trade-off in Continual Learning from an Architectural Perspective

Aojun Lu, Hangjie Yuan, Tao Feng, Yanan Sun•Jun 4, 2025•22

CRAWLDoc: 서지 문서의 강건한 순위 결정을 위한 데이터셋
CRAWLDoc: A Dataset for Robust Ranking of Bibliographic Documents

Fabian Karl, Ansgar Scherp•Jun 4, 2025•22

VLMs는 분산된 훈련 패치를 통합할 수 있다.
VLMs Can Aggregate Scattered Training Patches

Zhanhui Zhou, Lingjie Chen, Chao Yang, Chaochao Lu•Jun 4, 2025•22

비대칭 이중 3D 가우시안 스플래팅을 활용한 야외 환경에서의 강건한 신경 렌더링
Robust Neural Rendering in the Wild with Asymmetric Dual 3D Gaussian Splatting

Chengqi Li, Zhihao Shi, Yangdi Lu, Wenbo He, Xiangyu Xu•Jun 4, 2025•22

FLAIR를 활용한 역문제 해결
Solving Inverse Problems with FLAIR

Julius Erbach, Dominik Narnhofer, Andreas Dombos, Bernt Schiele, Jan Eric Lenssen, Konrad Schindler•Jun 3, 2025•22

FinChain: 검증 가능한 사고 사슬 기반 금융 추론을 위한 상징적 벤치마크
FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning

Zhuohan Xie, Dhruv Sahnan, Debopriyo Banerjee, Georgi Georgiev, Rushil Thareja, Hachem Madmoun, Jinyan Su, Aaryamonvikram Singh, Yuxia Wang, Rui Xing, Fajri Koto, Haonan Li, Ivan Koychev, Tanmoy Chakraborty, Salem Lahlou, Veselin Stoyanov, Preslav Nakov•Jun 3, 2025•22

소형 언어 모델은 에이전트형 AI의 미래이다
Small Language Models are the Future of Agentic AI

Peter Belcak, Greg Heinrich, Shizhe Diao, Yonggan Fu, Xin Dong, Saurav Muralidharan, Yingyan Celine Lin, Pavlo Molchanov•Jun 2, 2025•22

그 사물을 소리로 표현하기: 상호작용 가능한 사물 인식 이미지-오디오 생성
Sounding that Object: Interactive Object-Aware Image to Audio Generation

Tingle Li, Baihe Huang, Xiaobin Zhuang, Dongya Jia, Jiawei Chen, Yuping Wang, Zhuo Chen, Gopala Anumanchipalli, Yuxuan Wang•Jun 4, 2025•12

대규모 실험 그리드에서 얻은 능동 학습 하이퍼파라미터 조사: 통찰과 분석
Survey of Active Learning Hyperparameters: Insights from a Large-Scale Experimental Grid

Julius Gonsior, Tim Rieß, Anja Reusch, Claudio Hartmann, Maik Thiele, Wolfgang Lehner•Jun 4, 2025•12

RiOSWorld: 멀티모달 컴퓨터 사용 에이전트의 위험성 벤치마킹
RiOSWorld: Benchmarking the Risk of Multimodal Compter-Use Agents

Jingyi Yang, Shuai Shao, Dongrui Liu, Jing Shao•May 31, 2025•12