ChatPaper.aiChatPaper

WorldReward: 카메라 조건부 월드 모델을 위한 보상 모델링

WorldReward: Reward Modeling for Camera-Conditioned World Models

September 3, 2026
저자: Yibin Wang, Zehan Wang, Junshu Tang, Zhimin Li, Yujie Zhou, Jiazi Bu, Pengyang Ling, Feng Han, Zhixiong Zhang, Long Xing, Shengyuan Ding, Ziang Li, Cheng Jin, Yuhang Zang, Jiaqi Wang, Tianyu Pang
cs.AI

초록

카메라 조건부 세계 모델은 명령된 행동이 기대된 장면 변화를 유도하면서 외관, 기하 구조, 시간적 역학이 일관되게 유지되는 인터랙티브 비디오를 생성한다. 기존 보상은 이러한 요구 사항을 개별적으로 평가한다. 기하 기반 보상은 궤적 실행을 추정할 수 있지만 실행된 행동의 시각적 품질을 판단하지 못하며, 이미지 기반 보상은 프레임 품질을 측정할 뿐 행동 실행이나 시간적 역학을 포착하지 못한다. 우리는 비전-언어 모델(VLM)이 행동과 그 시각적 결과를 연관 짓는 공유 추론 공간을 제공한다고 가정한다. 그러나 긴 비디오 전체를 전체 행동 시퀀스와 대조하여 평가하면 길고 잡음이 많은 맥락이 형성되어, 짧게 지속되는 국소적 행동 증거가 누락되거나 희석될 수 있다. 본 논문은 카메라 조건부 세계 모델을 위한 행동 일관성 평가와 시각 품질 평가를 통합하는 VLM 기반 쌍별 선호 보상 모델인 WorldReward를 제안한다. WorldReward는 쌍을 이루는 비디오를 행동 정렬 청크로 분해하고, 각 청크를 구조화된 시각적 증거로 구성하며, 투표를 통해 청크 수준 결정을 비디오 수준의 행동 선호와 시각 품질 선호로 각각 집계한다. 이를 훈련하기 위해, 우리는 프런티어 VLM이 생성한 구조화된 판단을 도구 기반 에이전트 감사와 선별적 인간 검토로 정제한 대규모 추론 증강 선호 데이터셋을 구축한다. 또한 행동 일관성, 외관 품질, 움직임 품질 전반에서 보상 모델과 인간 선호 사이의 일치도를 측정하는 인간 주석 벤치마크인 WorldReward-Bench를 소개한다. WorldReward는 행동 일관성, 외관 품질, 움직임 품질의 세 차원 모두에서 가장 높은 일치도를 기록하며, GPT-5.5를 각각 3.42, 1.45, 3.56퍼센트 포인트 초과한다. WorldReward를 HY-WorldPlay 1.5의 RL 후속 훈련에 적용하면 단기부터 장기까지의 시간 지평 전반에 걸쳐 행동 실행과 시각 품질이 모두 일관되게 향상된다.
English
Camera-conditioned world models generate interactive videos in which commanded actions should induce the expected scene changes while appearance, geometry, and temporal dynamics remain coherent. Existing rewards assess these requirements separately: geometry-based rewards estimate trajectory execution but cannot judge the visual quality of the executed motion, whereas image-based rewards measure frame quality without capturing action execution or temporal dynamics. We posit that a vision-language model (VLM) offers a shared reasoning space for relating actions to their visual outcomes. However, judging a complete long video against its full action sequence creates a lengthy, noisy context in which short-lived local action evidence can be missed or diluted. We present WorldReward, a VLM-based pairwise preference reward model that unifies action-consistency and visual-quality evaluation for camera-conditioned world models. WorldReward decomposes paired videos into action-aligned chunks, organizes each chunk into structured visual evidence, and aggregates chunk-level decisions by voting into separate video-level action and visual-quality preferences. To train it, we construct a large-scale reasoning-augmented preference dataset using structured judgments generated by a frontier VLM and refined through tool-based agent auditing and targeted human review. We further introduce WorldReward-Bench, a human-annotated benchmark measuring reward-model agreement with human preferences across action consistency, appearance quality, and motion quality. WorldReward achieves the highest agreement on all three dimensions, exceeding GPT-5.5 by 3.42, 1.45, and 3.56 percentage points, respectively. When used for RL post-training of HY-WorldPlay 1.5, it consistently improves both action execution and visual quality across short- to long-term horizons.