StylisticBias: Poucas Pistas Visuais Humanas Impulsionam a Maioria dos Vieses Sociais em MLLMs
StylisticBias: A Few Human Visual Cues Drive Most Social Biases in MLLMs
June 18, 2026
Autores: Shaghayegh Kolli, Timo Cavelius, Nafiseh Nikeghbal, Samantha Dalal, Jana Diesner
cs.AI
Resumo
Modelos de linguagem multimodal de grande escala (MLLMs) estão cada vez mais sendo implementados em contextos de impacto pessoal e social, mas os sinais visuais que moldam como esses modelos julgam pessoas ainda são pouco compreendidos. Trabalhos anteriores frequentemente comparam diferentes (grupos de) indivíduos, dificultando a separação entre efeitos de aparência e diferenças de identidade. Apresentamos o StylisticBias, um referencial controlado para avaliar viés social no nível de atributo em MLLMs. Geramos 500 rostos base fotorrealistas e criamos cerca de 50 variações de atributo único por rosto, totalizando aproximadamente 25 mil imagens. Esse design mantém a identidade fixa e altera um atributo visual por vez. Ele permite medir como sinais específicos deslocam os julgamentos do modelo. Avaliamos seis MLLMs em 25 cenários binários de julgamento social. Constatamos que idade e tipo corporal dominam os efeitos no nível de identidade, enquanto estilo de moda e outros sinais visuais provocam os maiores deslocamentos no nível de atributo. Descobrimos ainda que cerca de 15 atributos respondem por quase 80% da variação total, mostrando que o viés se concentra em um conjunto restrito de sinais visuais. A sensibilidade é mais forte em julgamentos semanticamente alinhados com a aparência, especialmente julgamentos socioeconômicos e relacionados ao estilo. Disponibilizamos o StylisticBias como um referencial para avaliação refinada de viés em modelos multimodais. Código e conjunto de dados: https://github.com/timo-cavelius/StylisticBias e https://hf.co/datasets/shaghayegh/stylistic-bias-dataset.
English
Multimodal large language models (MLLMs) are increasingly deployed in personally and societally consequential settings, yet the visual cues that shape how these models judge people remain poorly understood. Prior work often compares different (groups of) individuals, making it difficult to separate appearance effects from identity differences. We introduce StylisticBias, a controlled benchmark for evaluating attribute-level social bias in MLLMs. We generate 500 photorealistic base faces and create about 50 single-attribute variations per face, producing about 25K images. This design keeps identity fixed and changes one visual attribute at a time. It lets us measure how specific cues shift model judgments. We evaluate six MLLMs across 25 binary social judgment scenarios. We find that age and body type dominate identity-level effects, while fashion style and other visual cues drive the largest attribute-level shifts. We further find that about 15 attributes account for nearly 80\% of the total variation, showing that bias is concentrated in a small set of visual cues. Sensitivity is strongest in judgments that are semantically aligned with appearance, especially socioeconomic and style-related judgments. We release StylisticBias as a benchmark for fine-grained bias evaluation in multimodal models. Code and dataset: https://github.com/timo-cavelius/StylisticBias and https://hf.co/datasets/shaghayegh/stylistic-bias-dataset.