RemoteZero: Raciocínio Geoespacial com Zero Anotações Humanas
RemoteZero: Geospatial Reasoning with Zero Human Annotations
May 6, 2026
Autores: Liang Yao, Fan Liu, Shengxiang Xu, Chuanyi Zhang, Rui Min, Shimin Di, Yuhui Zheng
cs.AI
Resumo
O raciocínio geoespacial exige que os modelos resolvam semânticas espaciais complexas e a intenção do usuário em locais-alvo precisos para a observação da Terra. Progressos recentes libertaram o caminho de raciocínio da curadoria manual, permitindo que os modelos gerem suas próprias cadeias de inferência. No entanto, uma dependência final permanece: eles ainda são supervisionados por coordenadas de referência anotadas por humanos. Isso deixa o processo de raciocínio autónomo, mas não o seu ponto final espacial, e impede a verdadeira auto-evolução com base nos abundantes dados de sensoriamento remoto não rotulados. Para superar este estrangulamento, introduzimos o RemoteZero, uma estrutura livre de supervisão por caixas delimitadoras para raciocínio geoespacial. O RemoteZero é motivado por uma assimetria simples: um MLLM (Modelo de Linguagem Multimodal) é tipicamente melhor em verificar se uma região satisfaz uma consulta do que em gerar diretamente coordenadas precisas. Aproveitando esta capacidade discriminativa mais forte, o RemoteZero substitui a supervisão geométrica por verificação semântica intrínseca e permite o treino de GRPO (Geospatial Reasoning from Physical Observation) sem anotações de caixas. A estrutura resultante suporta ainda a auto-evolução iterativa, permitindo que o modelo melhore a partir de imagens de sensoriamento remoto não rotuladas através do seu próprio sinal de verificação. Experiências mostram que o RemoteZero alcança um desempenho competitivo face a métodos supervisionados robustos, demonstrando o potencial do treino por auto-verificação para a localização em raciocínio geoespacial.
English
Geospatial reasoning requires models to resolve complex spatial semantics and user intent into precise target locations for Earth observation. Recent progress has liberated the reasoning path from manual curation, allowing models to generate their own inference chains. Yet a final dependency remains: they are still supervised by human-annotated ground-truth coordinates. This leaves the reasoning process autonomous, but not its spatial endpoint, and prevents true self-evolution on abundant unlabeled remote sensing data. To break this bottleneck, we introduce RemoteZero, a box-supervision-free framework for geospatial reasoning. RemoteZero is motivated by a simple asymmetry: an MLLM is typically better at verifying whether a region satisfies a query than at directly generating precise coordinates. Leveraging this stronger discriminative ability, RemoteZero replaces geometric supervision with intrinsic semantic verification and enables GRPO training without box annotations. The resulting framework further supports iterative self-evolution, allowing the model to improve from unlabeled remote sensing imagery through its own verification signal. Experiments show that RemoteZero achieves competitive performance against strong supervised methods, demonstrating the potential of self-verifying training for geospatial reasoning localization.