ChatPaper.aiChatPaper

TESSERA v2: Opschaling van pixelgewijze aardfundatiemodellen

TESSERA v2: Scaling Pixel-wise Earth Foundation Models

July 4, 2026
Auteurs: Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, Mark Elvers, Clement Atzberger, Robin Young, Aneesh Naik, Niall Robinson, Andrew Blake, David Coomes, Anil Madhavapeddy, Srinivasan Keshav
cs.AI

Samenvatting

Pixelgewijze aardobservatie (AO) funderingsmodellen behalen nu state-of-the-art prestaties via gegenereerde ruimtelijke embeddings. Hoe deze modellen schalen en hoe een pre-trainingsbudget het beste kan worden besteed, is echter nog slecht begrepen. Wij presenteren de grootste gecontroleerde schalingsstudie voor AO tot nu toe: 395 trainingsruns op 1.024 GH200 superchips binnen een vaste pixelgewijze Barlow Twins-familie, elk geëvalueerd op 15 downstream taken. We vinden dat het pre-trainingsverlies nauwelijks de downstream prestaties voorspelt (|Pearson r| < 0,2), dus het selecteren van modellen op basis van verlies verspilt een groot deel van de rekenkracht. We vinden ook dat naarmate het trainingsbudget groeit, de encoder en de data samen moeten groeien terwijl de projector vast blijft, wat een eenvoudige regel geeft voor het toewijzen van rekenkracht. Met behulp van deze regel trainen we een familie van pixelgewijze modellen (0,5B en 1B, met een 2B model in training) en destilleren we ze tot compacte studentmodellen voor implementatie van embeddings-als-data. Het gedistilleerde TESSERA v2-1B-M met 21 miljoen parameters presteert in totaal beter dan alle geteste open en propriëtaire modellen, waarvan sommige orden van grootte groter zijn. Deze studentmodellen produceren Matryoshka-representaties die goedkoop te bedienen zijn: een 16-dimensionaal prefix behoudt 92% van de volledige 128-dimensionale prestatie bij 1/8 van de opslag. Na voltooiing van de training zijn we van plan om v2 globale embeddings uit te brengen die 2017-2025 bestrijken. Samen geven deze resultaten een concreet, empirisch onderbouwd recept voor het schalen van pixelgewijze AO-funderingsmodellen: train grote encoders, selecteer op basis van downstream prestaties en destilleer tot flexibele studentmodellen. Alle code wordt vrijgegeven op https://github.com/ucam-eo/tessera.
English
Pixel-wise Earth-observation (EO) foundation models are now achieving state-of-the-art performance via generated spatial embeddings. However, how these models scale and how best to spend a pretraining budget remain poorly understood. We present the largest controlled scaling study for EO to date: 395 training runs on 1,024 GH200 superchips within a fixed pixel-wise Barlow Twins family, each evaluated on 15 downstream tasks. We find that pretraining loss barely predicts downstream performance (|Pearson r| < 0.2), so selecting models by loss wastes a large share of the compute. We also find that, as the training budget grows, the encoder and the data should grow together while the projector stays fixed, which gives a simple rule for allocating compute. Using this rule, we train a family of pixel-wise models (0.5B and 1B, with a 2B model in training) and distill them into compact students for embeddings-as-data deployment. The 21-million-parameter distilled TESSERA v2-1B-M in aggregate outperforms all open and proprietary models tested, some of which are orders of magnitude larger. These students produce Matryoshka representations that are inexpensive to serve: a 16-dimensional prefix keeps 92% of the full 128-dimensional performance at 1/8 of the storage. Upon completion of training we plan to release v2 global embeddings covering 2017-2025. Together, these results give a concrete, empirically grounded recipe for scaling pixel-wise EO foundation models: train large encoders, select by downstream performance, and distil into flexible student models. All code will be released at https://github.com/ucam-eo/tessera.