PHM-Bench: A Domain-Specific Benchmarking Framework for Systematic Evaluation of Large Models in Prognostics and Health Management
2508.02490v1
cs.AI
2025-08-09
Авторы:
Puyu Yang, Laifa Tao, Zijian Huang, Haifei Liu, Wenyan Cao, Hao Ji, Jianan Qiu, Qixuan Huang, Xuanyuan Su, Yuhang Xie, Jun Zhang, Shangyu Li, Chen Lu, Zhixuan Lian
Резюме на русском
**Резюме**
В статье предлагается PHM-Bench — инновационный фреймворк для оценки бо LLM в области Prognostics and Health Management (PHM). Несмотря на рост синергии между LLMs и PHM, существующие методологии оценки остаются недостаточно глубокими и структурированными, что не позволяет полностью использовать модели в этой области. PHM-Bench определяет трехмерную оценочную модель, охватывающую фундаментальные возможности, ядерные задачи и целый жизненный цикл PHM-систем. Метрики разработаны для таких задач, как мониторинг условий, диагностика неисправностей, прогноз ресурса до конца жизненного цикла и решения по техническому обслуживанию. Фреймворк основывается на структурированных данных из промышленных систем и позволяет оценивать как общего назначения, так и доменно-специальные модели. Результаты показывают, что PHM-Bench является методологической основой для структурированного исследования возможностей LLMs в PHM и обеспечивает референсную базу для перехода от универсальных моделей к индустриально-ориентированным.
Abstract
With the rapid advancement of generative artificial intelligence, large
language models (LLMs) are increasingly adopted in industrial domains, offering
new opportunities for Prognostics and Health Management (PHM). These models
help address challenges such as high development costs, long deployment cycles,
and limited generalizability. However, despite the growing synergy between PHM
and LLMs, existing evaluation methodologies often fall short in structural
completeness, dimensional comprehensiveness, and evaluation granularity. This
hampers the in-depth integration of LLMs into the PHM domain. To address these
limitations, this study proposes PHM-Bench, a novel three-dimensional
evaluation framework for PHM-oriented large models. Grounded in the triadic
structure of fundamental capability, core task, and entire lifecycle, PHM-Bench
is tailored to the unique demands of PHM system engineering. It defines
multi-level evaluation metrics spanning knowledge comprehension, algorithmic
generation, and task optimization. These metrics align with typical PHM tasks,
including condition monitoring, fault diagnosis, RUL prediction, and
maintenance decision-making. Utilizing both curated case sets and publicly
available industrial datasets, our study enables multi-dimensional evaluation
of general-purpose and domain-specific models across diverse PHM tasks.
PHM-Bench establishes a methodological foundation for large-scale assessment of
LLMs in PHM and offers a critical benchmark to guide the transition from
general-purpose to PHM-specialized models.
Ссылки и действия
Дополнительные ресурсы: