HyperKD: Distilling Cross-Spectral Knowledge in Masked Autoencoders via Inverse Domain Shift with Spatial-Aware Masking and Specialized Loss

2508.09453v1 cs.CV, cs.LG 2025-08-15
Авторы:

Abdul Matin, Tanjim Bin Faruk, Shrideep Pallickara, Sangmi Lee Pallickara

Резюме на русском

## Контекст В последние годы сфера распознавания объектов на спутниковых снимках получила бурное развитие, благодаря прорывным технологиям машинного обучения и их применению в обработке спутниковых снимков. Область исследования ограничена, однако, спектральными и спектрально-спациальными различиями между различными типами данных спутникового зонда. Кроме того, широкоразмерные наборы данных, необходимые для эффективного обучения, часто трудно доступны. Использование фундаментальных моделей (foundation models), обученных на больших неотмеченных данных, представляется эффективным решением для обеспечения универсальности и повторного использования моделей в различных применениях. Однако прямое использование таких моделей в спектральном зонде, таком как гиперспектральное зондирование, ограничено возникающими спектральными пробелами и сложностями в адаптации моделей к новому типу данных. ## Метод HyperKD представляет собой инновационный подход к порождению научных моделей, основанный на методе knowledge distillation (KD). Разработанная архитектура включает использование Masked Autoencoder (MAE) как преподавательской модели (teacher model) и студентской модели, призванной освоить новый тип данных. Основной характеристикой HyperKD является его возможность обратного передачи знаний (inverse knowledge distillation), в отличие от традиционных фреймворков KD, где сложная модель (teacher) обучает простую (student). Для решения проблемы инверсного доменного перехода (inverse domain shift) в гиперспектральном зондировании, HyperKD включает в себя специальные стратегии: 1. **Спектрально-ориентированное выравнивание каналов**: Оптимизация спектральной аллея каналов входных данных для соответствия новому типу данных. 2. **Маскирование с привязкой к пространству**: Использование пространственной структуры снимков для восстановления информации об отдельных объектах. 3. **Специализированный функционал потерь**: Разработка уникальной функции потерь, специально ориентированной на гиперспектральные данные для повышения точности воспроизведения. ## Результаты Исследования проводились на наборе данных EnMAP (Environmental Mapping and Analysis Program), нацеленных на сравнение HyperKD с основными фреймворками KD в области гиперспектрального зондирования. Для оценки модели были использованы метрики, такие как F1-score и mean absolute error (MAE), на задачах классификации покрытия земли (land cover classification), определения типов урожая (crop type identification) и прогнозирования содержания углерода в почве (soil organic carbon prediction). Результаты показали, что HyperKD превосходит другие модели по эффективности воспроизведения и точности классификации, получая более высокие метрики на всех задачах. ## Значимость Приложение HyperKD

Abstract

The proliferation of foundation models, pretrained on large-scale unlabeled datasets, has emerged as an effective approach in creating adaptable and reusable architectures that can be leveraged for various downstream tasks using satellite observations. However, their direct application to hyperspectral remote sensing remains challenging due to inherent spectral disparities and the scarcity of available observations. In this work, we present HyperKD, a novel knowledge distillation framework that enables transferring learned representations from a teacher model into a student model for effective development of a foundation model on hyperspectral images. Unlike typical knowledge distillation frameworks, which use a complex teacher to guide a simpler student, HyperKD enables an inverse form of knowledge transfer across different types of spectral data, guided by a simpler teacher model. Building upon a Masked Autoencoder, HyperKD distills knowledge from the Prithvi foundational model into a student tailored for EnMAP hyperspectral imagery. HyperKD addresses the inverse domain adaptation problem with spectral gaps by introducing a feature-based strategy that includes spectral range-based channel alignment, spatial feature-guided masking, and an enhanced loss function tailored for hyperspectral images. HyperKD bridges the substantial spectral domain gap, enabling the effective use of pretrained foundation models for geospatial applications. Extensive experiments show that HyperKD significantly improves representation learning in MAEs, leading to enhanced reconstruction fidelity and more robust performance on downstream tasks such as land cover classification, crop type identification, and soil organic carbon prediction, underpinning the potential of knowledge distillation frameworks in remote sensing analytics with hyperspectral imagery.

Ссылки и действия