ChatPaper.aiChatPaper

TESSERA v2: Масштабирование попиксельных фундаментальных моделей Земли

TESSERA v2: Scaling Pixel-wise Earth Foundation Models

July 4, 2026
Авторы: Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, Mark Elvers, Clement Atzberger, Robin Young, Aneesh Naik, Niall Robinson, Andrew Blake, David Coomes, Anil Madhavapeddy, Srinivasan Keshav
cs.AI

Аннотация

Попиксельные фундаментальные модели наблюдения Земли (Earth-observation, EO) в настоящее время достигают самых передовых результатов благодаря генерируемым пространственным эмбеддингам. Однако то, как эти модели масштабируются и как лучше всего распределять бюджет предварительного обучения, остается слабо изученным. Мы представляем крупнейшее на сегодняшний день контролируемое исследование масштабирования для EO: 395 тренировочных запусков на 1 024 суперчипах GH200 в рамках фиксированного семейства пиксельных моделей Barlow Twins, каждая из которых оценена на 15 последующих задачах. Мы обнаружили, что потери при предварительном обучении почти не предсказывают последующую производительность (|коэффициент Пирсона r| < 0.2), поэтому отбор моделей по потерям приводит к значительным вычислительным затратам. Также мы выяснили, что с ростом бюджета обучения кодировщик и данные должны увеличиваться вместе, в то время как проектор остается фиксированным; это дает простое правило для распределения вычислительных ресурсов. Используя это правило, мы обучаем семейство пиксельных моделей (0.5B и 1B, а также модель на 2B в процессе обучения) и дистиллируем их в компактные студенческие модели для развертывания в режиме "эмбеддинги как данные". Дистиллированная модель TESSERA v2-1B-M с 21 миллионом параметров в совокупности превосходит все протестированные открытые и проприетарные модели, некоторые из которых на порядки больше. Эти студенческие модели создают матрёшечные представления (Matryoshka representations), которые недороги в обслуживании: 16-мерный префикс сохраняет 92% производительности полного 128-мерного представления при 1/8 объема памяти. После завершения обучения мы планируем выпустить глобальные эмбеддинги версии v2, охватывающие период с 2017 по 2025 год. В совокупности эти результаты дают конкретное, эмпирически обоснованное руководство по масштабированию попиксельных фундаментальных моделей EO: обучайте большие кодировщики, отбирайте по последующей производительности и дистиллируйте в гибкие студенческие модели. Весь код будет опубликован по адресу https://github.com/ucam-eo/tessera.
English
Pixel-wise Earth-observation (EO) foundation models are now achieving state-of-the-art performance via generated spatial embeddings. However, how these models scale and how best to spend a pretraining budget remain poorly understood. We present the largest controlled scaling study for EO to date: 395 training runs on 1,024 GH200 superchips within a fixed pixel-wise Barlow Twins family, each evaluated on 15 downstream tasks. We find that pretraining loss barely predicts downstream performance (|Pearson r| < 0.2), so selecting models by loss wastes a large share of the compute. We also find that, as the training budget grows, the encoder and the data should grow together while the projector stays fixed, which gives a simple rule for allocating compute. Using this rule, we train a family of pixel-wise models (0.5B and 1B, with a 2B model in training) and distill them into compact students for embeddings-as-data deployment. The 21-million-parameter distilled TESSERA v2-1B-M in aggregate outperforms all open and proprietary models tested, some of which are orders of magnitude larger. These students produce Matryoshka representations that are inexpensive to serve: a 16-dimensional prefix keeps 92% of the full 128-dimensional performance at 1/8 of the storage. Upon completion of training we plan to release v2 global embeddings covering 2017-2025. Together, these results give a concrete, empirically grounded recipe for scaling pixel-wise EO foundation models: train large encoders, select by downstream performance, and distil into flexible student models. All code will be released at https://github.com/ucam-eo/tessera.