Het trimmen van de lange staart van de evaluatie van visuele wereldmodellering
Trimming the Long-Tail of Visual World Modeling Evaluation
June 23, 2026
Auteurs: Bingxuan Li, Yining Hong, Cheng Qian, Hyeonjeong Ha, Jiateng Liu, Zhenhailong Wang, Yue Guo, Yunzhu Li, Heng Ji
cs.AI
Samenvatting
Fysieke interacties volgen een langstaartverdeling: een verzameling gangbare en reguliere interacties domineert de menselijke ervaring en visuele gegevens, terwijl een breed spectrum aan zeldzame en onregelmatige interacties ondervertegenwoordigd blijft. Hoewel recente visuele wereldmodellen, waaronder beeld- en videogeneratiemodellen, indrukwekkende realisme bereiken op bestaande benchmarks, richten zij zich voornamelijk op het simuleren van gangbare fysieke interacties. Dit roept een centrale vraag op: internaliseren en generaliseren huidige visuele wereldmodellen fysische principes? In dit werk introduceren we Tailor-Bench, een benchmark die wereldmodellen uitdaagt om onregelmatige fysieke interacties te simuleren. Om systematische evaluatie mogelijk te maken, ontwerpen we drie scenariomodellen die de redenering van het model steeds verder uitdagen: Reguliere scenario's weerspiegelen gangbare gereedschap-taakcombinaties, Onconventionele scenario's vervangen conventionele gereedschappen door attribuut-compatibele substituten om affordantiegeneralisatie te testen, en Onmogelijke scenario's introduceren attribuut-schendende gereedschappen om beperkingsbewustzijn te onderzoeken. Daarnaast ontwerpen we twee complementaire instellingen onder een uniform evaluatieprotocol: predictieve generatie vereist het afleiden van uitkomsten zonder begeleiding, terwijl beschrijvende generatie de beoogde uitkomst specificeert voor getrouwe realisatie. Onze experimentele resultaten onthullen een duidelijke langstaartkloof in fysische wereldmodellering: de prestaties dalen van Reguliere naar Onconventionele en Onmogelijke scenario's, wat wijst op beperkte generalisatie voorbij gangbare interacties. Foutanalyse toont verder aan dat modellen vertrouwen op oppervlakkige visuele patronen: beeldmodellen slagen er niet in correcte toestandsveranderingen te realiseren, terwijl videomodellen bovendien lijden aan temporele inconsistenties.
English
Physical interactions follow a long-tailed distribution: a set of common and regular interactions dominates human experience and visual data, while a broad spectrum of rare and irregular interactions remains underrepresented. Although recent visual world models, including image and video generation models, achieve impressive realism on existing benchmarks, they primarily focus on simulating common physical interactions. This raises a central question: Do current visual world models internalize and generalize physical principles? In this work, we introduce Tailor-Bench, a benchmark that challenges world models to simulate irregular physical interactions. To enable systematic evaluation, we design three scenario modes that progressively challenge model reasoning: Regular scenarios reflect common tool-task pairs, Unconventional scenarios replace conventional tools with attribute-compatible substitutes to test affordance generalization, and Impossible scenarios introduce attribute-violating tools to probe constraint awareness. Additionally, we design two complementary settings under a unified evaluation protocol: predictive generation requires inferring outcomes without guidance, while descriptive generation specifies the target outcome for faithful realization. Our experimental results reveal a clear long-tail gap in physical world modeling: performance degrades from Regular to Unconventional and Impossible scenarios, indicating limited generalization beyond common interactions. Failure analysis further shows that models rely on superficial visual patterns: image models fail to realize correct state changes, while video models further suffer from temporal inconsistencies.