ChatPaper.ai
메뉴 열기
홈
오늘의 논문
arXiv
HuggingFace
요금제
계정
작업공간
🇰🇷
한국어
Loading...
•
•
•
•
•
•
•
•
•
•
AI 연구 논문 데일리
번역이 포함된 일일 선별된 AI 연구 논문
March 25th, 2025
비디오 SimpleQA: 대형 비디오 언어 모델의 사실성 평가를 향하여
Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models
Meng Cao, Pengfei Hu, Yingyao Wang, Jihao Gu, Haoran Tang, Haoze Zhao, Jiahua Dong, Wangbo Yu, Ge Zhang, Ian Reid, Xiaodan Liang
•
Mar 24, 2025
•
12
1
Aether: 기하학적 인식을 통한 통합 세계 모델링
Aether: Geometric-Aware Unified World Modeling
Aether Team, Haoyi Zhu, Yifan Wang, Jianjun Zhou, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Chunhua Shen, Jiangmiao Pang, Tong He
•
Mar 24, 2025
•
28
2
LLM 사전 학습에서 가중치 재조정을 통한 분산 제어
Variance Control via Weight Rescaling in LLM Pre-training
Louis Owen, Abhay Kumar, Nilabhra Roy Chowdhury, Fabian Güra
•
Mar 21, 2025
•
5
2
포지션: 인터랙티브 생성형 비디오를 차세대 게임 엔진으로
Position: Interactive Generative Video as Next-Generation Game Engine
Jiwen Yu, Yiran Qin, Haoxuan Che, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, Xihui Liu
•
Mar 21, 2025
•
62
3
눈을 가진 마음: 언어 추론에서 다중모달 추론으로
Mind with Eyes: from Language Reasoning to Multimodal Reasoning
Zhiyu Lin, Yifei Gao, Xian Zhao, Yunfan Yang, Jitao Sang
•
Mar 23, 2025
•
3
2
DynamicVis: 원격 감지 이미지 이해를 위한 효율적이고 범용적인 시각적 기초 모델
DynamicVis: An Efficient and General Visual Foundation Model for Remote Sensing Image Understanding
Keyan Chen, Chenyang Liu, Bowen Chen, Wenyuan Li, Zhengxia Zou, Zhenwei Shi
•
Mar 20, 2025
•
0
2
FFN 융합: 대규모 언어 모델에서의 순차적 계산 재고
FFN Fusion: Rethinking Sequential Computation in Large Language Models
Akhiad Bercovich, Mohammad Dabbah, Omri Puny, Ido Galil, Amnon Geifman, Yonatan Geifman, Izhak Golan, Ehud Karpas, Itay Levy, Zach Moshe, Najeeb Nabwani, Tomer Ronen, Itamar Schen, Elad Segal, Ido Shahaf, Oren Tropp, Ran Zilberstein, Ran El-Yaniv
•
Mar 24, 2025
•
19
3
AgentRxiv: 협업적 자율 연구를 향하여
AgentRxiv: Towards Collaborative Autonomous Research
Samuel Schmidgall, Michael Moor
•
Mar 23, 2025
•
22
2
등변 이미지 모델링
Equivariant Image Modeling
Ruixiao Dong, Mengde Xu, Zigang Geng, Li Li, Han Hu, Shuyang Gu
•
Mar 24, 2025
•
15
1
OmnimatteZero: 사전 학습된 비디오 확산 모델을 활용한 학습 없이 실시간으로 구현 가능한 Omnimatte
OmnimatteZero: Training-free Real-time Omnimatte with Pre-trained Video Diffusion Models
Dvir Samuel, Matan Levy, Nir Darshan, Gal Chechik, Rami Ben-Ari
•
Mar 23, 2025
•
25
2
어떤 것도 판단하다: 모든 모달리티를 아우르는 판단자로서의 MLLM
Judge Anything: MLLM as a Judge Across Any Modality
Shu Pu, Yaochen Wang, Dongping Chen, Yuhang Chen, Guohao Wang, Qi Qin, Zhongyi Zhang, Zhiyuan Zhang, Zetong Zhou, Shuang Gong, Yi Gui, Yao Wan, Philip S. Yu
•
Mar 21, 2025
•
20
2
RDTF: 다중 프레임 애니메이션 스티커 생성을 위한 자원 효율적 이중 마스크 학습 프레임워크
RDTF: Resource-efficient Dual-mask Training Framework for Multi-frame Animated Sticker Generation
Zhiqiang Yuan, Ting Zhang, Ying Deng, Jiapei Zhang, Yeshuang Zhu, Zexi Jia, Jie Zhou, Jinchao Zhang
•
Mar 22, 2025
•
3
2
병목 샘플링을 통한 학습 없이도 가능한 확산 모델 가속화
Training-free Diffusion Acceleration with Bottleneck Sampling
Ye Tian, Xin Xia, Yuxi Ren, Shanchuan Lin, Xing Wang, Xuefeng Xiao, Yunhai Tong, Ling Yang, Bin Cui
•
Mar 24, 2025
•
12
4
AMD-Hummingbird: 효율적인 텍스트-투-비디오 모델을 향하여
AMD-Hummingbird: Towards an Efficient Text-to-Video Model
Takashi Isobe, He Cui, Dong Zhou, Mengmeng Ge, Dong Li, Emad Barsoum
•
Mar 24, 2025
•
5
2
Instruct-CLIP: 대조 학습을 활용한 자동 데이터 정제를 통한 지시 기반 이미지 편집 개선
Instruct-CLIP: Improving Instruction-Guided Image Editing with Automated Data Refinement Using Contrastive Learning
Sherry X. Chen, Misha Sra, Pradeep Sen
•
Mar 24, 2025
•
3
2
다중 조명 화이트 밸런스 보정을 위한 이미지 융합 재고찰
Revisiting Image Fusion for Multi-Illuminant White-Balance Correction
David Serrano-Lozano, Aditya Arora, Luis Herranz, Konstantinos G. Derpanis, Michael S. Brown, Javier Vazquez-Corral
•
Mar 18, 2025
•
1
2
프롬프트 주입 공격을 설계 단계에서 방어하기
Defeating Prompt Injections by Design
Edoardo Debenedetti, Ilia Shumailov, Tianqi Fan, Jamie Hayes, Nicholas Carlini, Daniel Fabian, Christoph Kern, Chongyang Shi, Andreas Terzis, Florian Tramèr
•
Mar 24, 2025
•
20
1
잠재적 사고로부터 학습하기 위한 추론
Reasoning to Learn from Latent Thoughts
Yangjun Ruan, Neil Band, Chris J. Maddison, Tatsunori Hashimoto
•
Mar 24, 2025
•
13
1
최적화된 최소 3D 가우시안 스플래팅
Optimized Minimal 3D Gaussian Splatting
Joo Chan Lee, Jong Hwan Ko, Eunbyung Park
•
Mar 21, 2025
•
13
2
Diffusion-4K: 잠재 확산 모델을 활용한 초고해상도 이미지 합성
Diffusion-4K: Ultra-High-Resolution Image Synthesis with Latent Diffusion Models
Jinjin Zhang, Qiuyu Huang, Junjie Liu, Xiefan Guo, Di Huang
•
Mar 24, 2025
•
6
2
Feather-SQL: 소형 언어 모델을 위한 이중 모델 협업 패러다임의 경량 NL2SQL 프레임워크
Feather-SQL: A Lightweight NL2SQL Framework with Dual-Model Collaboration Paradigm for Small Language Models
Wenqi Pei, Hailing Xu, Hengyuan Zhao, Shizheng Hou, Han Chen, Zining Zhang, Pingyi Luo, Bingsheng He
•
Mar 22, 2025
•
13
2
Typed-RAG: 비사실적 질문 응답을 위한 타입 인식 다중 측면 분해
Typed-RAG: Type-aware Multi-Aspect Decomposition for Non-Factoid Question Answering
DongGeon Lee, Ahjeong Park, Hyeri Lee, Hyeonseo Nam, Yunho Maeng
•
Mar 20, 2025
•
6
2
여기 모든 기반을 다루었습니다: 희소 오토인코더를 통해 대형 언어 모델의 추론 특성 해석하기
I Have Covered All the Bases Here: Interpreting Reasoning Features in Large Language Models via Sparse Autoencoders
Andrey Galichin, Alexey Dontsov, Polina Druzhinina, Anton Razzhigaev, Oleg Y. Rogov, Elena Tutubalina, Ivan Oseledets
•
Mar 24, 2025
•
118
2
언어적 프로세스 감독이 더 나은 코딩 에이전트를 이끌어낸다
Verbal Process Supervision Elicits Better Coding Agents
Hao-Yuan Chen, Cheng-Pong Huang, Jui-Ming Yao
•
Mar 24, 2025
•
2
2
QuartDepth: 에지 디바이스를 위한 실시간 깊이 추정을 위한 학습 후 양자화
QuartDepth: Post-Training Quantization for Real-Time Depth Estimation on the Edge
Xuan Shen, Weize Ma, Jing Liu, Changdi Yang, Rui Ding, Quanyi Wang, Henghui Ding, Wei Niu, Yanzhi Wang, Pu Zhao, Jun Lin, Jiuxiang Gu
•
Mar 20, 2025
•
0
2
문화적 번역에서 길을 잃다: LLM은 문화적 맥락에서 수학 문제를 해결하는 데 어려움을 겪는가?
Lost in Cultural Translation: Do LLMs Struggle with Math Across Cultural Contexts?
Aabid Karim, Abdul Karim, Bhoomika Lohana, Matt Keon, Jaswinder Singh, Abdul Sattar
•
Mar 23, 2025
•
6
2
CFG-Zero*: 플로우 매칭 모델을 위한 개선된 클래스리어 프리 가이던스
CFG-Zero*: Improved Classifier-Free Guidance for Flow Matching Models
Weichen Fan, Amber Yijia Zheng, Raymond A. Yeh, Ziwei Liu
•
Mar 24, 2025
•
21
2
SimpleRL-Zoo: 야생 환경에서의 오픈 베이스 모델을 위한 제로 강화 학습의 탐구와 제어
SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild
Weihao Zeng, Yuzhen Huang, Qian Liu, Wei Liu, Keqing He, Zejun Ma, Junxian He
•
Mar 24, 2025
•
30
1
V-Seek: 오픈 하드웨어 서버급 RISC-V 플랫폼에서의 LLM 추론 가속화
V-Seek: Accelerating LLM Reasoning on Open-hardware Server-class RISC-V Platforms
Javier J. Poveda Rodrigo, Mohamed Amine Ahmdi, Alessio Burrello, Daniele Jahier Pagliari, Luca Benini
•
Mar 21, 2025
•
6
2
Video-T1: 비디오 생성을 위한 테스트 타임 스케일링
Video-T1: Test-Time Scaling for Video Generation
Fangfu Liu, Hanyang Wang, Yimo Cai, Kaiyan Zhang, Xiaohang Zhan, Yueqi Duan
•
Mar 24, 2025
•
88
1
LEMMA: LLM의 수학적 능력 향상을 위한 오류 학습 기반 접근법
LEMMA: Learning from Errors for MatheMatical Advancement in LLMs
Zhuoshi Pan, Yu Li, Honglin Lin, Qizhi Pei, Zinan Tang, Wei Wu, Chenlin Ming, H. Vicky Zhao, Conghui He, Lijun Wu
•
Mar 21, 2025
•
15
2
인간 동작 언러닝
Human Motion Unlearning
Edoardo De Matteis, Matteo Migliarini, Alessio Sampieri, Indro Spinelli, Fabio Galasso
•
Mar 24, 2025
•
1
2
Vision-R1: 시각-언어 대형 모델에서 비인간적 정렬의 진화 시각-지도 강화 학습을 통한 접근
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
Yufei Zhan, Yousong Zhu, Shurong Zheng, Hongyin Zhao, Fan Yang, Ming Tang, Jinqiao Wang
•
Mar 23, 2025
•
19
2
AlphaSpace: 의미론적 토큰화와 기호적 추론을 통한 로봇 행동 구현
AlphaSpace: Enabling Robotic Actions through Semantic Tokenization and Symbolic Reasoning
Alan Dao, Dinh Bach Vu, Bui Quang Huy
•
Mar 24, 2025
•
10
2
초해상도에서의 이미지 평가 재고
Rethinking Image Evaluation in Super-Resolution
Shaolin Su, Josep M. Rocafort, Danna Xue, David Serrano-Lozano, Lei Sun, Javier Vazquez-Corral
•
Mar 17, 2025
•
1
2
MagicComp: 컴포지셔널 비디오 생성을 위한 학습 없는 이중 단계 정제
MagicComp: Training-free Dual-Phase Refinement for Compositional Video Generation
Hongyu Zhang, Yufan Deng, Shenghai Yuan, Peng Jin, Zesen Cheng, Yian Zhao, Chang Liu, Jie Chen
•
Mar 18, 2025
•
8
2
CODA: 이산 토큰화를 위한 연속 VAE의 재활용
CODA: Repurposing Continuous VAEs for Discrete Tokenization
Zeyu Liu, Zanlin Ni, Yeguo Hua, Xin Deng, Xiao Ma, Cheng Zhong, Gao Huang
•
Mar 22, 2025
•
3
2
언어 기반 3D 장면 생성을 위한 글로벌-로컬 트리 탐색
Global-Local Tree Search for Language Guided 3D Scene Generation
Wei Deng, Mengshi Qi, Huadong Ma
•
Mar 24, 2025
•
0
2
MetaSpatial: 메타버스를 위한 VLMs의 3D 공간 추론 강화
MetaSpatial: Reinforcing 3D Spatial Reasoning in VLMs for the Metaverse
Zhenyu Pan, Han Liu
•
Mar 24, 2025
•
3
2