ChatPaper
2026-07-17 · 하루 5분, 오늘 가장 알아둘 만한 논문을 쉽게
비디오 이해 AI는 대부분 크고 무거웠지만, VideoChat3는 마치 작은 탐정이 큰 사건을 해결하듯 단 4B(40억) 파라미터로 다양한 영상을 효율적으로 분석합니다. 특별한 3D 시각 변환기(I3D-ViT)와 적응형 프레임 해상도로 실시간 처리에 강점을 보이며, 200만 개 이상의 학습 데이터로 일반화 능력을 높였죠. 같은 규모의 오픈소스 모델을 뛰어넘는 성능 덕분에, 더 적은 자원으로도 영상 인식 기술에 접근할 수 있습니다.
마치 요리사가 실패한 요리에서 교훈을 얻어 레시피를 고치듯, SEED는 AI 정책이 과거의 궤적을 분석해 '기술'이라는 자연어 꿀팁을 스스로 생성합니다. 이 기술을 활용해 행동을 재평가하면, 정책이 스스로 발전하는 선순환이 생깁니다. 전문 용어로는 '온-정책 증류 신호'라고 부르는데, 쉽게 말해 AI가 자기 경험에서 더 나은 지도 신호를 만드는 거예요. 이렇게 하면 보상이 드문 복잡한 장기 과제에서도 효율적으로 학습할 수 있어, AI의 다중 대화나 도구 사용 능력이 향상됩니다.
마치 길을 가다가 이정표를 설치하는 것처럼, SearchOS는 검색 에이전트들의 작업 중간 상태를 바깥에 저장하고 공유합니다. 이렇게 하면 같은 정보를 반복해서 찾거나 헤매는 일이 줄어듭니다. 벤치마크 평가에서 SearchOS는 다른 단일·다중 에이전트 방법보다 모든 지표에서 더 나은 성능을 보였습니다. 이 접근법은 정보 탐색 에이전트를 더 신뢰할 수 있고 효율적으로 만들어, 낭비되는 검색을 줄이고 결과 품질을 높입니다.
마치 요리사가 재료를 미리 손질해 두고 필요할 때만 꺼내 쓰듯, LongStraw는 공유 프롬프트를 자동미분 없이 평가하고 모델 상태만 보관한 뒤, 짧은 응답 분기를 하나씩 재생합니다. 이 기법으로 8개의 H20 GPU에서 210만 위치의 그룹화된 Qwen 채점 및 응답 역전파를 완료했으며, 그룹 크기를 늘려도 추가 메모리는 0.21GB에 불과합니다. 이는 AI 에이전트가 긴 문맥을 필요로 하는 의사결정에 필수적이며, 기존 RL 훈련의 한계를 극복합니다.
마치 길을 정확히 보면서도 핸들을 엉뚱한 방향으로 돌리는 운전자처럼, 세계-행동 모델은 미래 예측은 올바르지만 행동은 조작될 수 있습니다. BadWAM이라는 공격 기법은 눈에 띄지 않는 시각적 변화만으로 모델의 상상과 실행을 분리시킵니다. 실제 실험에서는 행동만을 노린 공격으로 작업 성공률이 96.5%에서 43.1%로 급락했습니다. 이 연구는 로봇 제어 등에 사용되는 세계-행동 모델이 걸으로는 안정적으로 보여도 교묘한 공격에 취약할 수 있음을 경고합니다.