ABACUS: Adaptando Modelo de Fundação Unificado para Unir Compreensão e Geração de Contagem de Imagens
ABACUS: Adapting Unified Foundation Model for Bridging Image Count Understanding and Generation
June 22, 2026
Autores: Anindya Mondal, Sauradip Nag, Anjan Dutta
cs.AI
Resumo
ABACUS é um modelo unificado de visão-linguagem que lida com contagem de objetos, contagem de multidões, contagem por expressão referencial e geração de imagens fiéis à contagem, sem exigir treinamento específico para cada benchmark. Nosso modelo é construído sobre um modelo de base unificado existente de 3 bilhões de parâmetros e adaptado para tarefas de localização de objetos usando três inovações-chave: zoom adaptativo consciente da densidade com mapas de objetidade para fundamentação espacial; uma política de contagem consciente dos limites via GRPO para eliminar erros de borda de recorte; e uma estratégia GRPO consistente em ciclo, na qual o ramo de entendimento autocritica as saídas geradas, fechando a lacuna entre entendimento e geração sem anotações externas. ABACUS alcança resultados de ponta em sete benchmarks, superando tanto especialistas específicos de tarefa quanto modelos generalistas maiores.
English
ABACUS is a unified vision-language model that handles object counting, crowd counting, referring-expression counting, and count-faithful image generation without any benchmark-specific training required. Our model is built on existing 3B-parameter unified foundation model and is adapted for object localization tasks using three key innovations: density-aware adaptive zooming with objectness maps for spatial grounding; a boundary-aware count policy via GRPO to eliminate crop-boundary errors; and a cycle-consistent GRPO strategy where the understanding branch self-critiques generated outputs, closing the understanding-generation gap without any external annotations. ABACUS achieves state-of-the-art results across seven benchmarks, outperforming both task-specific specialists and larger generalist models.