A Foundation Model for DAS Signal Recognition and Visual Prompt Tuning of the Pre-trained Model for Downstream Tasks

2508.04316v1 cs.CV, eess.SP 2025-08-09
Авторы:

Kun Gui, Hongliang Ren, Shang Shi, Jin Lu, Changqiu Yu, Quanjun Cao, Guomin Gu, Qi Xuan

Резюме на русском

Данная работа предлагает фундаментальный подход к распознаванию сигналов DAS (Distributed Acoustic Sensing) с использованием масок реконструкции и метода Visual Prompt Tuning (VPT) для подготовки модели к работе на downstream-задачах. Авторы предлагают модель MAEPD (Masked Autoencoder for DAS Signal Recognition), которая относится к классу моделей Masked Autoencoder и тренируется на большом датасете (635,860 примеров), включающим различные типы DAS-сигналов: гаями, 2D GASF и 2D time-frequency изображениями, а также данными открытых наборов, такими как сигналы системы контроля газа и аналогичные. Модель предназначена для выделения семантических признаков DAS-сигналов в самостоятельном обучении. Для распознавания в downstream-задачах используется VPT: модель замораживается во время тренировки, а только визуальные векторы проникают в Transformer-слои. Мы доказали, что этот подход эффективен в распознавании гая (96,94% точность), при этом требующий всего 0,322% параметров для тренировки, что значительно сокращает время тренировки. Этот расчет показал, что модель широко применяется в распознавании гая, а также в других задачах, таких как обнаружение повреждений в трубопроводах.

Abstract

Distributed Acoustic Sensing (DAS) technology finds growing applications across various domains. However, data distribution disparities due to heterogeneous sensing environments pose challenges for data-driven artificial intelligence (AI) models, limiting cross-domain generalization and facing a shortage of labeled training data. To address these issues, this study proposes a foundational model for DAS signal recognition based on a Masked Autoencoder, named MAEPD. The MAEPD model is pretrained on a dataset of 635,860 samples, encompassing DAS gait spatiotemporal signals, 2D GASF images for perimeter security, 2D time-frequency images for pipeline leakage, and open-dataset signals including whale vocalizations and seismic activities, using a self-supervised mask reconstruction task to capture deep semantic features of DAS signals. Visual Prompt Tuning (VPT) is employed for downstream recognition tasks. This method freezes the pretrained backbone parameters and fine-tunes only a small set of learnable visual prompt vectors inserted into the Transformer encoder layers. Experiments on the NVIDIA GeForce RTX 4080 Super platform validate MAEPD using indoor gait recognition as a downstream task. The VPT-Deep approach achieves a classification accuracy of 96.94% with just 0.322% of parameters fine-tuned, surpassing the traditional Full Fine Tuning (FFT) method by 0.61% and reducing training time by 45%. The model also exhibits robust performance in pipeline leakage detection, confirming the generality, efficiency, and scalability of MAEPD as a foundational model. This approach offers a novel paradigm for addressing the limited generalization of signal recognition models in the DAS domain.

Ссылки и действия