ChatPaper.aiChatPaper

ShutterMuse: Orientação Fotográfica em Tempo de Captura com MLLMs

ShutterMuse: Capture-Time Photography Guidance with MLLMs

June 24, 2026
Autores: Jiayu Li, Yixiao Fang, Tianyu Hu, Wei Cheng, Ping Huang, Zheheng Fan, Gang Yu, Xingjun Ma
cs.AI

Resumo

A fotografia no mundo real requer orientação no momento da captura tanto para o enquadramento da câmera quanto para a pose do sujeito. No entanto, os benchmarks existentes de corte estético avaliam principalmente a predição de cortes post-hoc e ignoram recomendações relacionadas ao sujeito, deixando as capacidades de orientação no momento da captura dos modelos de linguagem multimodal (MLLMs) subexploradas. Para preencher essa lacuna, apresentamos o CaptureGuide-Bench, um benchmark com duas tarefas complementares: decisão e refinamento de composição do lado do fotógrafo, e recomendação de pose condicionada ao cenário do lado do sujeito. Nossa avaliação revela limitações: MLLMs de propósito geral podem tomar decisões de composição, mas carecem de localização precisa para refinamento, enquanto modelos especializados de corte estético localizam cortes de forma eficaz, mas se limitam ao refinamento; nenhum deles fornece orientação acionável para a pose. Para apoiar o desenvolvimento de modelos, construímos adicionalmente o CaptureGuide-Dataset, composto por 130 mil amostras com justificativas textuais e anotações visuais estruturadas, e desenvolvemos o ShutterMuse, um MLLM unificado treinado com ajuste fino supervisionado e por reforço. Experimentos no CaptureGuide-Bench mostram que o ShutterMuse alcança o melhor desempenho geral do lado do fotógrafo entre as linhas de base avaliadas e uma recomendação de pose do lado do sujeito competitiva com custo de inferência substancialmente menor, demonstrando o potencial dos MLLMs como assistentes interativos para fotografia durante a captura de imagem.
English
Real-world photography requires capture-time guidance for both camera framing and subject pose. Yet existing aesthetic cropping benchmarks mainly evaluate post-hoc crop prediction and overlook subject-side recommendations, leaving the capture-time guidance capabilities of multimodal large language models (MLLMs) underexplored. To address this gap, we introduce CaptureGuide-Bench, a benchmark with two complementary tasks: photographer-side composition decision and refinement, and subject-side scene-conditioned pose recommendation. Our evaluation reveals limitations: general-purpose MLLMs can make composition decisions but lack precise refinement localization, while specialized aesthetic cropping models localize crops effectively but are limited to refinement; neither provides actionable pose guidance. To support model development, we further construct CaptureGuide-Dataset, comprising 130K samples with textual rationales and structured visual annotations, and develop ShutterMuse, a unified MLLM trained with supervised and reinforcement fine-tuning. Experiments on CaptureGuide-Bench show that ShutterMuse achieves the best overall photographer-side performance among evaluated baselines and competitive subject-side pose recommendation with substantially lower inference cost, demonstrating the potential of MLLMs as interactive assistants for photography during image capture.