ChatPaper.aiChatPaper

SceneActBench: 에이전트가 보는 3D 장면에서 행동할 수 있는가?

SceneActBench: Can Agents Act on the 3D Scenes They See?

July 24, 2026
저자: Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian, Huanjin Yao, Jiarui Yao, Haowei Lin, Chunchao Guo, Zhuo Chen, Wenkai Lyu, Jianzhu Ma, Xueqian Wang, Wenxi Zhu
cs.AI

초록

시각-언어 모델(VLM) 에이전트는 3D 장면을 단순히 설명하는 것을 넘어 도구를 활용하여 조작하는 방향으로 발전하고 있다. 기존의 3D 벤치마크는 텍스트 응답이나 단일 객체 조작에 초점을 맞춰, 완전한 다중 객체 3D 장면에서의 에이전트 행동은 충분히 평가되지 못하고 있다. 본 논문에서는 통합된 에이전트-환경 루프 내에서 5가지 3D 과제에 걸쳐 시각 조건부 행동을 평가하는 벤치마크인 SceneActBench를 제안한다. 에이전트는 PNG 이미지나 샘플링된 비디오 프레임, 그리고 해당하는 경우 제공된 3D 자산을 바탕으로 3D 환경에서 행동을 수행한다. 각 최종 출력물은 과제별 기하학적 지표를 사용하여 숨겨진 정답과 비교 평가된다. SceneActBench는 210개의 원천 인스턴스로 구성된 5가지 과제로 이루어져 있으며, 쌍을 이루는 입력 조건을 포함하여 총 520개의 과제 사례를 제공한다. 모든 과제는 공정한 비교를 위해 하나의 고정된 에이전트 루프를 통해 실행된다. 11가지 독점 VLM 구성에 대해 전체 점수는 38.6에서 50.2 사이로 나타났으며, 어떤 구성도 모든 과제에서 일관되게 우수한 성능을 보이지 않았다. 또한 실패가 발생하는 위치와 방식을 추가로 분석하였다.
English
Vision-language model (VLM) agents increasingly use tools to act on 3D scenes rather than only describe them. Existing 3D benchmarks score textual responses or single-object operations, leaving agent action on complete multi-object 3D scenes under evaluated. We present SceneActBench, a benchmark for visually conditioned action across five 3D tasks under a unified agent-environment loop. Given PNG images or sampled video frames and, where applicable, supplied 3D assets, an agent acts on a 3D environment. We evaluate each final output against hidden ground truth with task-specific geometric metrics. SceneActBench comprises five tasks built from 210 source instances, yielding 520 task cases including paired input conditions. Every task runs through one fixed agent loop to keep the comparison fair. Across eleven proprietary VLM configurations, Overall scores span 38.6-50.2, and none performs consistently well across tasks. We further analyse where and how failures manifest.