ChatPaper.aiChatPaper

TESSERA v2 : Passage à l'échelle des modèles de fondation terrestres pixel par pixel

TESSERA v2: Scaling Pixel-wise Earth Foundation Models

July 4, 2026
Auteurs: Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, Mark Elvers, Clement Atzberger, Robin Young, Aneesh Naik, Niall Robinson, Andrew Blake, David Coomes, Anil Madhavapeddy, Srinivasan Keshav
cs.AI

Résumé

Les modèles de fondation d’observation de la Terre (OT) au niveau pixel atteignent désormais des performances de pointe grâce à des plongements spatiaux générés. Cependant, la façon dont ces modèles passent à l’échelle et comment optimiser un budget de pré-entraînement reste mal comprise. Nous présentons la plus grande étude contrôlée de passage à l’échelle pour l’OT à ce jour : 395 sessions d’entraînement sur 1 024 superpuces GH200 au sein d’une famille fixe de Barlow Twins au niveau pixel, chacune évaluée sur 15 tâches en aval. Nous constatons que la perte de pré-entraînement prédit à peine la performance en aval (|r de Pearson| < 0,2), de sorte que la sélection des modèles par la perte gaspille une grande part du calcul. Nous constatons également qu’à mesure que le budget d’entraînement augmente, l’encodeur et les données doivent croître ensemble, tandis que le projecteur reste fixe, ce qui fournit une règle simple pour allouer le calcul. En utilisant cette règle, nous entraînons une famille de modèles au niveau pixel (0,5B et 1B, avec un modèle de 2B en cours d’entraînement) et les distillons en modèles élèves compacts pour un déploiement des plongements comme données. Le TESSERA v2-1B-M distillé de 21 millions de paramètres surpasse en agrégat tous les modèles ouverts et propriétaires testés, dont certains sont des ordres de grandeur plus grands. Ces élèves produisent des représentations Matryoshka peu coûteuses à servir : un préfixe de 16 dimensions conserve 92 % de la performance complète de 128 dimensions pour 1/8 du stockage. À la fin de l’entraînement, nous prévoyons de publier les plongements globaux v2 couvrant 2017-2025. Ensemble, ces résultats fournissent une recette concrète et empiriquement fondée pour passer à l’échelle les modèles de fondation OT au niveau pixel : entraîner de grands encodeurs, sélectionner selon la performance en aval, et distiller en modèles élèves flexibles. Tout le code sera publié à l’adresse https://github.com/ucam-eo/tessera.
English
Pixel-wise Earth-observation (EO) foundation models are now achieving state-of-the-art performance via generated spatial embeddings. However, how these models scale and how best to spend a pretraining budget remain poorly understood. We present the largest controlled scaling study for EO to date: 395 training runs on 1,024 GH200 superchips within a fixed pixel-wise Barlow Twins family, each evaluated on 15 downstream tasks. We find that pretraining loss barely predicts downstream performance (|Pearson r| < 0.2), so selecting models by loss wastes a large share of the compute. We also find that, as the training budget grows, the encoder and the data should grow together while the projector stays fixed, which gives a simple rule for allocating compute. Using this rule, we train a family of pixel-wise models (0.5B and 1B, with a 2B model in training) and distill them into compact students for embeddings-as-data deployment. The 21-million-parameter distilled TESSERA v2-1B-M in aggregate outperforms all open and proprietary models tested, some of which are orders of magnitude larger. These students produce Matryoshka representations that are inexpensive to serve: a 16-dimensional prefix keeps 92% of the full 128-dimensional performance at 1/8 of the storage. Upon completion of training we plan to release v2 global embeddings covering 2017-2025. Together, these results give a concrete, empirically grounded recipe for scaling pixel-wise EO foundation models: train large encoders, select by downstream performance, and distil into flexible student models. All code will be released at https://github.com/ucam-eo/tessera.