Lite3R: um framework agnóstico em relação ao modelo para reconstrução 3D feed-forward eficiente
Lite3R: A Model-Agnostic Framework for Efficient Feed-Forward 3D Reconstruction
May 12, 2026
Autores: Haoyu Zhang, Zeyu Zhang, Zedong Zhou, Yang Zhao, Hao Tang
cs.AI
Resumo
A reconstrução 3D baseada em transformers emergiu como um paradigma poderoso para recuperar geometria e aparência a partir de observações multivista, oferecendo desempenho robusto em condições visuais desafiadoras. À medida que esses modelos escalam para backbones maiores e entradas de resolução mais alta, melhorar sua eficiência torna-se cada vez mais importante para implantação prática. No entanto, pipelines modernos de transformers 3D enfrentam dois desafios acoplados: a atenção densa multivista cria uma sobrecarga substancial de mistura de tokens, e a execução de baixa precisão pode desestabilizar representações sensíveis à geometria, degradando profundidade, pose e consistência 3D. Para abordar o primeiro desafio, propomos o Lite3R, um framework professor-aluno agnóstico a modelo que substitui a atenção densa por Atenção Linear Esparsa, preservando interações geométricas importantes enquanto reduz o custo da atenção. Para abordar o segundo desafio, introduzimos uma estratégia paramétrica eficiente de treinamento consciente de quantização FP8 (FP8-aware QAT) com destilação parcial de atenção, que congela a grande maioria dos parâmetros do backbone pré-treinado e treina apenas camadas leves de projeção linear, permitindo implantação estável em baixa precisão enquanto retém os priors geométricos pré-treinados. Avaliamos ainda o Lite3R em dois backbones representativos, VGGT e DA3-Large, nos conjuntos BlendedMVS e DTU64, mostrando que ele reduz substancialmente a latência (1,7-2,0x) e o uso de memória (1,9-2,4x), enquanto preserva a qualidade geral de reconstrução competitiva. Esses resultados demonstram que o Lite3R fornece uma abordagem eficaz de co-design sistema-algoritmo para reconstrução 3D prática baseada em transformers. Código: https://github.com/AIGeeksGroup/Lite3R. Site: https://aigeeksgroup.github.io/Lite3R.
English
Transformer-based 3D reconstruction has emerged as a powerful paradigm for recovering geometry and appearance from multi-view observations, offering strong performance across challenging visual conditions. As these models scale to larger backbones and higher-resolution inputs, improving their efficiency becomes increasingly important for practical deployment. However, modern 3D transformer pipelines face two coupled challenges: dense multi-view attention creates substantial token-mixing overhead, and low-precision execution can destabilize geometry-sensitive representations and degrade depth, pose, and 3D consistency. To address the first challenge, we propose Lite3R, a model-agnostic teacher-student framework that replaces dense attention with Sparse Linear Attention to preserve important geometric interactions while reducing attention cost. To address the second challenge, we introduce a parameter-efficient FP8-aware quantization-aware training (FP8-aware QAT) strategy with partial attention distillation, which freezes the vast majority of pretrained backbone parameters and trains only lightweight linear-branch projection layers, enabling stable low-precision deployment while retaining pretrained geometric priors. We further evaluate Lite3R on two representative backbones, VGGT and DA3-Large, over BlendedMVS and DTU64, showing that it substantially reduces latency (1.7-2.0x) and memory usage (1.9-2.4x) while preserving competitive reconstruction quality overall. These results demonstrate that Lite3R provides an effective algorithm-system co-design approach for practical transformer-based 3D reconstruction. Code: https://github.com/AIGeeksGroup/Lite3R. Website: https://aigeeksgroup.github.io/Lite3R.