ChatPaper.aiChatPaper

Video-MME-Logical: Een gecontroleerde diagnostische benchmark voor videotemporeel-logisch redeneren

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

June 26, 2026
Auteurs: Hohin Kwan, Hongyu Li, Ray Zhang, Manyuan Zhang, Xianghao Kong, Anyi Rao, Jiahao Xie, Si Liu
cs.AI

Samenvatting

De recente interesse in multimodale grote taalmodellen (MLLM's) roept een centrale vraag op: kunnen ze redeneren over dynamisch visueel bewijs in plaats van alleen objecten of gebeurtenissen in individuele frames te herkennen? Dit vermogen, dat wij video-temporeel-logisch redeneren noemen, vereist dat modellen bewijs behouden, bijwerken en samenstellen naarmate visuele toestanden evolueren over frames heen. Bestaande video-benchmarks verwarren dit vermogen vaak met scènecomplexiteit, statische herkenning of ongecontroleerde temporele variatie. Om dit vermogen te isoleren, introduceren we Video-MME-Logical, een gecontroleerde benchmark die is georganiseerd rond vijf temporeel-logische operaties: toestandsvolgen, sequentieel tellen, temporele ordening, dynamische spatialiteit en structurele compositie. De benchmark bevat 25 fijnmazige taakcategorieën gegenereerd met gecontroleerde objecttoestanden, overgangen, temporele afhankelijkheden en logische composities. Het maakt moeilijkheidsgecontroleerde evaluatie van het eindantwoord mogelijk door variatie in temporele horizon en redeneringscomplexiteit, en ondersteunt tussentoestandsdiagnostiek door te verifiëren of modellen de vereiste logische redeneringstraject herstellen voordat ze het eindantwoord produceren. Experimenten met state-of-the-art MLLM's onthullen een aanzienlijke kloof tussen mens en model, vooral naarmate de temporeel-logische complexiteit toeneemt. Gesuperviseerd finetunen op maximaal 500K gegenereerde voorbeelden verbetert de prestaties, maar blijft onvoldoende om de redeneringskloof te dichten, wat Video-MME-Logical positioneert als een schaalbaar testbed voor het analyseren en verbeteren van temporeel-logisch redeneren in MLLM's.
English
Recent interest in multimodal large language models (MLLMs) raises a central question: can they reason over dynamic visual evidence rather than merely recognize objects or events in individual frames? This ability, which we refer to as video temporal-logical reasoning, requires models to maintain, update, and compose evidence as visual states evolve across frames. Existing video benchmarks often conflate this capability with scene complexity, static recognition, or uncontrolled temporal variation. To isolate this capability, we introduce Video-MME-Logical, a controlled benchmark organized around five temporal-logical operations: state tracking, sequential counting, temporal ordering, dynamic spatiality, and structural composition. The benchmark contains 25 fine-grained task categories generated with controlled object states, transitions, temporal dependencies, and logical compositions. It enables difficulty-controlled final-answer evaluation by varying temporal horizon and reasoning complexity, and supports intermediate-state diagnostics by verifying whether models recover the required logical reasoning trace before producing the final answer. Experiments with state-of-the-art MLLMs reveal a substantial human-model gap, especially as temporal-logical complexity increases. Supervised fine-tuning on up to 500K generated samples improves performance but remains insufficient to close the reasoning gap, positioning Video-MME-Logical as a scalable testbed for analyzing and improving temporal-logical reasoning in MLLMs.