A Foundation Model for DAS Signal Recognition and Visual Prompt Tuning of the Pre-trained Model for Downstream Tasks
2508.04316v1
cs.CV, eess.SP
2025-08-09
Авторы:
Kun Gui, Hongliang Ren, Shang Shi, Jin Lu, Changqiu Yu, Quanjun Cao, Guomin Gu, Qi Xuan
Резюме на русском
Данная работа предлагает фундаментальный подход к распознаванию сигналов DAS (Distributed Acoustic Sensing) с использованием масок реконструкции и метода Visual Prompt Tuning (VPT) для подготовки модели к работе на downstream-задачах. Авторы предлагают модель MAEPD (Masked Autoencoder for DAS Signal Recognition), которая относится к классу моделей Masked Autoencoder и тренируется на большом датасете (635,860 примеров), включающим различные типы DAS-сигналов: гаями, 2D GASF и 2D time-frequency изображениями, а также данными открытых наборов, такими как сигналы системы контроля газа и аналогичные. Модель предназначена для выделения семантических признаков DAS-сигналов в самостоятельном обучении. Для распознавания в downstream-задачах используется VPT: модель замораживается во время тренировки, а только визуальные векторы проникают в Transformer-слои. Мы доказали, что этот подход эффективен в распознавании гая (96,94% точность), при этом требующий всего 0,322% параметров для тренировки, что значительно сокращает время тренировки. Этот расчет показал, что модель широко применяется в распознавании гая, а также в других задачах, таких как обнаружение повреждений в трубопроводах.
Abstract
Distributed Acoustic Sensing (DAS) technology finds growing applications
across various domains. However, data distribution disparities due to
heterogeneous sensing environments pose challenges for data-driven artificial
intelligence (AI) models, limiting cross-domain generalization and facing a
shortage of labeled training data. To address these issues, this study proposes
a foundational model for DAS signal recognition based on a Masked Autoencoder,
named MAEPD. The MAEPD model is pretrained on a dataset of 635,860 samples,
encompassing DAS gait spatiotemporal signals, 2D GASF images for perimeter
security, 2D time-frequency images for pipeline leakage, and open-dataset
signals including whale vocalizations and seismic activities, using a
self-supervised mask reconstruction task to capture deep semantic features of
DAS signals. Visual Prompt Tuning (VPT) is employed for downstream recognition
tasks. This method freezes the pretrained backbone parameters and fine-tunes
only a small set of learnable visual prompt vectors inserted into the
Transformer encoder layers. Experiments on the NVIDIA GeForce RTX 4080 Super
platform validate MAEPD using indoor gait recognition as a downstream task. The
VPT-Deep approach achieves a classification accuracy of 96.94% with just 0.322%
of parameters fine-tuned, surpassing the traditional Full Fine Tuning (FFT)
method by 0.61% and reducing training time by 45%. The model also exhibits
robust performance in pipeline leakage detection, confirming the generality,
efficiency, and scalability of MAEPD as a foundational model. This approach
offers a novel paradigm for addressing the limited generalization of signal
recognition models in the DAS domain.
Ссылки и действия
Дополнительные ресурсы: