ChatPaper

AI 논문 핫 랭킹

최근 7일간 전 세계 AI 연구자들이 주목한 논문을 쉬운 말로 풀어드립니다

  1. 1

    하네스 핸드북: 진화하는 에이전트 하네스의 가독성, 탐색성, 편집성 확보

    🔥 1632026-07-14깊이 읽기arXiv 원문Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable
  2. 2

    RESOURCE2SKILL: 인간이 만든 멀티모달 자원으로부터 실행 가능한 에이전트 스킬 추출하기

    🔥 1132026-07-16깊이 읽기arXiv 원문RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources
  3. 3

    RAGU: 소형 도메인 적응형 LLM을 활용한 다단계 그래프RAG 엔진

    🔥 1112026-07-13깊이 읽기arXiv 원문RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM
  4. 4

    4B의 작은 몸집, 비디오 이해는 넓게: VideoChat3

    비디오 이해 AI는 대부분 크고 무거웠지만, VideoChat3는 마치 작은 탐정이 큰 사건을 해결하듯 단 4B(40억) 파라미터로 다양한 영상을 효율적으로 분석합니다. 특별한 3D 시각 변환기(I3D-ViT)와 적응형 프레임 해상도로 실시간 처리에 강점을 보이며, 200만 개 이상의 학습 데이터로 일반화 능력을 높였죠. 같은 규모의 오픈소스 모델을 뛰어넘는 성능 덕분에, 더 적은 자원으로도 영상 인식 기술에 접근할 수 있습니다.

    🔥 1082026-07-16깊이 읽기arXiv 원문VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
  5. 5

    Boogu-Image-0.1: 오픈소스 통합 멀티모달 이해 및 생성 향상

    🔥 1072026-07-14깊이 읽기arXiv 원문Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
  6. 6

    직접 온-정책 증류를 통한 약-강 일반화

    🔥 932026-07-08깊이 읽기arXiv 원문Weak-to-Strong Generalization via Direct On-Policy Distillation
  7. 7

    ABot-N1: 일반적인 시각 언어 내비게이션 파운데이션 모델을 향하여

    🔥 812026-07-11깊이 읽기arXiv 원문ABot-N1: Toward a General Visual Language Navigation Foundation Model
  8. 8

    Ring-Zero: 창발적 추론을 위한 조 개의 파라미터로의 Zero RL 스케일링

    🔥 792026-07-14깊이 읽기arXiv 원문Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
  9. 9

    ABot-AgentOS: 평생 멀티모달 메모리를 갖춘 범용 로봇 에이전트 OS

    🔥 682026-07-11깊이 읽기arXiv 원문ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
  10. 10

    AI가 스스로 과거 경험에서 '꿀팁'을 뽑아내며 학습한다면?

    마치 요리사가 실패한 요리에서 교훈을 얻어 레시피를 고치듯, SEED는 AI 정책이 과거의 궤적을 분석해 '기술'이라는 자연어 꿀팁을 스스로 생성합니다. 이 기술을 활용해 행동을 재평가하면, 정책이 스스로 발전하는 선순환이 생깁니다. 전문 용어로는 '온-정책 증류 신호'라고 부르는데, 쉽게 말해 AI가 자기 경험에서 더 나은 지도 신호를 만드는 거예요. 이렇게 하면 보상이 드문 복잡한 장기 과제에서도 효율적으로 학습할 수 있어, AI의 다중 대화나 도구 사용 능력이 향상됩니다.

    🔥 662026-07-16깊이 읽기arXiv 원문SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
  11. 11

    루프 더 루피즈!

    🔥 552026-07-17깊이 읽기arXiv 원문Loop the Loopies!
  12. 12

    Xiaomi-Robotics-1: 10만 시간 이상의 실제 세계 궤적으로 비전-언어-행동 모델 확장

    🔥 542026-07-16깊이 읽기arXiv 원문Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
  13. 13

    SynthDocBench: 장문맥 시각 문서 이해를 위한 제어된 벤치마크

    🔥 522026-07-11깊이 읽기arXiv 원문SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
  14. 14

    에이전트가 길을 잃지 않게 하는 법: 검색 상태를 투명하게 공유하다

    마치 길을 가다가 이정표를 설치하는 것처럼, SearchOS는 검색 에이전트들의 작업 중간 상태를 바깥에 저장하고 공유합니다. 이렇게 하면 같은 정보를 반복해서 찾거나 헤매는 일이 줄어듭니다. 벤치마크 평가에서 SearchOS는 다른 단일·다중 에이전트 방법보다 모든 지표에서 더 나은 성능을 보였습니다. 이 접근법은 정보 탐색 에이전트를 더 신뢰할 수 있고 효율적으로 만들어, 낭비되는 검색을 줄이고 결과 품질을 높입니다.

    🔥 492026-07-16깊이 읽기arXiv 원문SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
  15. 15

    xHC: 확장된 하이퍼 연결

    🔥 472026-07-16깊이 읽기arXiv 원문xHC: Expanded Hyper-Connections
  16. 16

    KnowAct-GUIClaw: 깊이 인식하고 완벽히 실행하는, 자기 진화적 메모리와 기술을 갖춘 개인 GUI 어시스턴트

    🔥 442026-07-15깊이 읽기arXiv 원문KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill
  17. 17

    Cura 1T: 에이전트 기반 헬스케어를 위한 특화 모델

    🔥 432026-07-15깊이 읽기arXiv 원문Cura 1T: Specialized Model for Agentic Healthcare
  18. 18

    OvisOCR2 기술 보고서

    🔥 422026-07-15깊이 읽기arXiv 원문OvisOCR2 Technical Report
  19. 19

    Read It Back: 사전 학습된 MLLM은 텍스트-이미지 생성을 위한 제로샷 보상 모델이다

    🔥 422026-07-13깊이 읽기arXiv 원문Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
  20. 20

    저중첩 캡처로부터의 4D 인간-장면 재구성

    🔥 412026-07-10깊이 읽기arXiv 원문4D Human-Scene Reconstruction from Low-Overlap Captures

하루 5분으로 AI 최전선 따라잡기

매일 화제의 논문 5편을 쉬운 말로, 미니 퀴즈와 함께.

오늘의 이슈 보기 →