HyperKD: Distilling Cross-Spectral Knowledge in Masked Autoencoders via Inverse Domain Shift with Spatial-Aware Masking and Specialized Loss
2508.09453v1
cs.CV, cs.LG
2025-08-15
Авторы:
Abdul Matin, Tanjim Bin Faruk, Shrideep Pallickara, Sangmi Lee Pallickara
Резюме на русском
## Контекст
В последние годы сфера распознавания объектов на спутниковых снимках получила бурное развитие, благодаря прорывным технологиям машинного обучения и их применению в обработке спутниковых снимков. Область исследования ограничена, однако, спектральными и спектрально-спациальными различиями между различными типами данных спутникового зонда. Кроме того, широкоразмерные наборы данных, необходимые для эффективного обучения, часто трудно доступны. Использование фундаментальных моделей (foundation models), обученных на больших неотмеченных данных, представляется эффективным решением для обеспечения универсальности и повторного использования моделей в различных применениях. Однако прямое использование таких моделей в спектральном зонде, таком как гиперспектральное зондирование, ограничено возникающими спектральными пробелами и сложностями в адаптации моделей к новому типу данных.
## Метод
HyperKD представляет собой инновационный подход к порождению научных моделей, основанный на методе knowledge distillation (KD). Разработанная архитектура включает использование Masked Autoencoder (MAE) как преподавательской модели (teacher model) и студентской модели, призванной освоить новый тип данных. Основной характеристикой HyperKD является его возможность обратного передачи знаний (inverse knowledge distillation), в отличие от традиционных фреймворков KD, где сложная модель (teacher) обучает простую (student). Для решения проблемы инверсного доменного перехода (inverse domain shift) в гиперспектральном зондировании, HyperKD включает в себя специальные стратегии:
1. **Спектрально-ориентированное выравнивание каналов**: Оптимизация спектральной аллея каналов входных данных для соответствия новому типу данных.
2. **Маскирование с привязкой к пространству**: Использование пространственной структуры снимков для восстановления информации об отдельных объектах.
3. **Специализированный функционал потерь**: Разработка уникальной функции потерь, специально ориентированной на гиперспектральные данные для повышения точности воспроизведения.
## Результаты
Исследования проводились на наборе данных EnMAP (Environmental Mapping and Analysis Program), нацеленных на сравнение HyperKD с основными фреймворками KD в области гиперспектрального зондирования. Для оценки модели были использованы метрики, такие как F1-score и mean absolute error (MAE), на задачах классификации покрытия земли (land cover classification), определения типов урожая (crop type identification) и прогнозирования содержания углерода в почве (soil organic carbon prediction). Результаты показали, что HyperKD превосходит другие модели по эффективности воспроизведения и точности классификации, получая более высокие метрики на всех задачах.
## Значимость
Приложение HyperKD
Abstract
The proliferation of foundation models, pretrained on large-scale unlabeled
datasets, has emerged as an effective approach in creating adaptable and
reusable architectures that can be leveraged for various downstream tasks using
satellite observations. However, their direct application to hyperspectral
remote sensing remains challenging due to inherent spectral disparities and the
scarcity of available observations. In this work, we present HyperKD, a novel
knowledge distillation framework that enables transferring learned
representations from a teacher model into a student model for effective
development of a foundation model on hyperspectral images. Unlike typical
knowledge distillation frameworks, which use a complex teacher to guide a
simpler student, HyperKD enables an inverse form of knowledge transfer across
different types of spectral data, guided by a simpler teacher model. Building
upon a Masked Autoencoder, HyperKD distills knowledge from the Prithvi
foundational model into a student tailored for EnMAP hyperspectral imagery.
HyperKD addresses the inverse domain adaptation problem with spectral gaps by
introducing a feature-based strategy that includes spectral range-based channel
alignment, spatial feature-guided masking, and an enhanced loss function
tailored for hyperspectral images. HyperKD bridges the substantial spectral
domain gap, enabling the effective use of pretrained foundation models for
geospatial applications. Extensive experiments show that HyperKD significantly
improves representation learning in MAEs, leading to enhanced reconstruction
fidelity and more robust performance on downstream tasks such as land cover
classification, crop type identification, and soil organic carbon prediction,
underpinning the potential of knowledge distillation frameworks in remote
sensing analytics with hyperspectral imagery.
Ссылки и действия
Дополнительные ресурсы: