ChatPaper
최근 7일간 전 세계 AI 연구자들이 주목한 논문을 쉬운 말로 풀어드립니다
비디오 이해 AI는 대부분 크고 무거웠지만, VideoChat3는 마치 작은 탐정이 큰 사건을 해결하듯 단 4B(40억) 파라미터로 다양한 영상을 효율적으로 분석합니다. 특별한 3D 시각 변환기(I3D-ViT)와 적응형 프레임 해상도로 실시간 처리에 강점을 보이며, 200만 개 이상의 학습 데이터로 일반화 능력을 높였죠. 같은 규모의 오픈소스 모델을 뛰어넘는 성능 덕분에, 더 적은 자원으로도 영상 인식 기술에 접근할 수 있습니다.
마치 요리사가 실패한 요리에서 교훈을 얻어 레시피를 고치듯, SEED는 AI 정책이 과거의 궤적을 분석해 '기술'이라는 자연어 꿀팁을 스스로 생성합니다. 이 기술을 활용해 행동을 재평가하면, 정책이 스스로 발전하는 선순환이 생깁니다. 전문 용어로는 '온-정책 증류 신호'라고 부르는데, 쉽게 말해 AI가 자기 경험에서 더 나은 지도 신호를 만드는 거예요. 이렇게 하면 보상이 드문 복잡한 장기 과제에서도 효율적으로 학습할 수 있어, AI의 다중 대화나 도구 사용 능력이 향상됩니다.
마치 길을 가다가 이정표를 설치하는 것처럼, SearchOS는 검색 에이전트들의 작업 중간 상태를 바깥에 저장하고 공유합니다. 이렇게 하면 같은 정보를 반복해서 찾거나 헤매는 일이 줄어듭니다. 벤치마크 평가에서 SearchOS는 다른 단일·다중 에이전트 방법보다 모든 지표에서 더 나은 성능을 보였습니다. 이 접근법은 정보 탐색 에이전트를 더 신뢰할 수 있고 효율적으로 만들어, 낭비되는 검색을 줄이고 결과 품질을 높입니다.