TESSERA v2: Escalamiento de Modelos Fundacionales Terrestres a nivel de píxel
TESSERA v2: Scaling Pixel-wise Earth Foundation Models
July 4, 2026
Autores: Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, Mark Elvers, Clement Atzberger, Robin Young, Aneesh Naik, Niall Robinson, Andrew Blake, David Coomes, Anil Madhavapeddy, Srinivasan Keshav
cs.AI
Resumen
Los modelos fundacionales de observación de la Tierra (EO) a nivel de píxel están alcanzando actualmente un rendimiento de última generación mediante incrustaciones espaciales generadas. Sin embargo, la forma en que estos modelos escalan y cómo invertir mejor un presupuesto de preentrenamiento sigue siendo poco comprendida. Presentamos el estudio de escalado controlado más grande hasta la fecha para EO: 395 ejecuciones de entrenamiento en 1.024 superchips GH200 dentro de una familia fija de Barlow Twins a nivel de píxel, cada una evaluada en 15 tareas posteriores. Descubrimos que la pérdida de preentrenamiento apenas predice el rendimiento posterior (|r de Pearson| < 0,2), por lo que seleccionar modelos según la pérdida desperdicia una gran parte del cómputo. También encontramos que, a medida que crece el presupuesto de entrenamiento, el codificador y los datos deben crecer juntos mientras que el proyector permanece fijo, lo que proporciona una regla simple para asignar el cómputo. Usando esta regla, entrenamos una familia de modelos a nivel de píxel (0,5B y 1B, con un modelo de 2B en entrenamiento) y los destilamos en estudiantes compactos para su despliegue como incrustaciones como datos. El estudiante destilado TESSERA v2-1B-M, con 21 millones de parámetros, supera en conjunto a todos los modelos abiertos y propietarios probados, algunos de los cuales son órdenes de magnitud mayores. Estos estudiantes producen representaciones Matryoshka que son económicas de servir: un prefijo de 16 dimensiones mantiene el 92% del rendimiento total de 128 dimensiones con 1/8 del almacenamiento. Al finalizar el entrenamiento, planeamos lanzar incrustaciones globales v2 que cubren el período 2017-2025. En conjunto, estos resultados proporcionan una receta concreta y fundamentada empíricamente para escalar modelos fundacionales de EO a nivel de píxel: entrenar codificadores grandes, seleccionar según el rendimiento posterior y destilar en modelos estudiantes flexibles. Todo el código se publicará en https://github.com/ucam-eo/tessera.
English
Pixel-wise Earth-observation (EO) foundation models are now achieving state-of-the-art performance via generated spatial embeddings. However, how these models scale and how best to spend a pretraining budget remain poorly understood. We present the largest controlled scaling study for EO to date: 395 training runs on 1,024 GH200 superchips within a fixed pixel-wise Barlow Twins family, each evaluated on 15 downstream tasks. We find that pretraining loss barely predicts downstream performance (|Pearson r| < 0.2), so selecting models by loss wastes a large share of the compute. We also find that, as the training budget grows, the encoder and the data should grow together while the projector stays fixed, which gives a simple rule for allocating compute. Using this rule, we train a family of pixel-wise models (0.5B and 1B, with a 2B model in training) and distill them into compact students for embeddings-as-data deployment. The 21-million-parameter distilled TESSERA v2-1B-M in aggregate outperforms all open and proprietary models tested, some of which are orders of magnitude larger. These students produce Matryoshka representations that are inexpensive to serve: a 16-dimensional prefix keeps 92% of the full 128-dimensional performance at 1/8 of the storage. Upon completion of training we plan to release v2 global embeddings covering 2017-2025. Together, these results give a concrete, empirically grounded recipe for scaling pixel-wise EO foundation models: train large encoders, select by downstream performance, and distil into flexible student models. All code will be released at https://github.com/ucam-eo/tessera.