Link Prediction for Event Logs in the Process Industry
2508.09096v1
cs.CL, cs.IR
2025-08-14
Авторы:
Anastasia Zhukova, Thomas Walton, Christian E. Matt, Bela Gipp
Резюме на русском
## Контекст
Оптимизация операций, обеспечение безопасности и постоянное совершенствование в промышленности процессов основываются на эффективном использовании операционных данных и прошлых знаний. Однако в этой области существуют значительные проблемы, связанные с разделенностью событий в журналах смен. Рекомендации по подходящим решениям для пользователей становятся сложнее из-за того, что связанные записи, такие как описания проблем с оборудованием или процессами и их решения, часто остаются разделенными. Данная работа адресует эту проблему, используя подход **link prediction** (предсказание связей) из графового машинного обучения, преобразованный в задачу **cross-document coreference resolution (CDCR)** с добавлением **natural language inference (NLI)** и **semantic text similarity (STS)**. Направление **causal inference (CI)** дает дополнительный импульс к улучшению моделей.
## Метод
Модель **link prediction** для решения задачи **record linking (RL)** была разработана с использованием **CDCR**, **NLI** и **STS**. Для адаптации модели к текстовым форматам промышленности процессов была предпринята работа над моделью, которая может работать на уровне параграфов, подобно NLI и STS. Модель учитывает как неструктурированный текст, так и структурированные атрибуты записей. Данная техника позволила расширить модели CDCR, предназначенные для новостного дела, на область журналов смен промышленных процессов. Отдельное внимание было уделено адаптации моделей CI для повышения качества рекомендаций.
## Результаты
Запуск модели проводился на данных, содержащихся в журналах смен промышленных процессов. На основе функций NLI и STS, а также добавленных элементов CI, был проведен сравнительный анализ модели с лучшими NLI- и STS-движениями. Результаты показали, что RL-модель выдала значительные улучшения, повысив точность предсказания связей на 28% (11.43 балла) по сравнению с NLI и на 27% (11.21 балла) по сравнению с STS. Это демонстрирует эффективность модели в улучшении качества связей в журналах смен, что в свою очередь повышает качество управления знаниями в промышленности процессов.
## Значимость
Результаты работы могут быть применены в различных сферах, включая **knowledge management (KM)**, **process optimization** и **safety management** в промышленности процессов. Эффективное решение задачи **record linking** позволяет улучшить качество данных и связи между записями, что приводит к более эффективному использованию данных и повышению безопасности и производительности. Будущие исследования могут сосредоточиться на усовершенствовании моделей CI и их применении в других областях, где требуется подключение разделенных данных.
## Выводы
В данной работе был применен подход **link prediction**, адаптированный для задачи **record linking** в журналах смен промышленных процессов
Abstract
Knowledge management (KM) is vital in the process industry for optimizing
operations, ensuring safety, and enabling continuous improvement through
effective use of operational data and past insights. A key challenge in this
domain is the fragmented nature of event logs in shift books, where related
records, e.g., entries documenting issues related to equipment or processes and
the corresponding solutions, may remain disconnected. This fragmentation
hinders the recommendation of previous solutions to the users. To address this
problem, we investigate record linking (RL) as link prediction, commonly
studied in graph-based machine learning, by framing it as a cross-document
coreference resolution (CDCR) task enhanced with natural language inference
(NLI) and semantic text similarity (STS) by shifting it into the causal
inference (CI). We adapt CDCR, traditionally applied in the news domain, into
an RL model to operate at the passage level, similar to NLI and STS, while
accommodating the process industry's specific text formats, which contain
unstructured text and structured record attributes. Our RL model outperformed
the best versions of NLI- and STS-driven baselines by 28% (11.43 points) and
27% (11.21 points), respectively. Our work demonstrates how domain adaptation
of the state-of-the-art CDCR models, enhanced with reasoning capabilities, can
be effectively tailored to the process industry, improving data quality and
connectivity in shift logs.
Ссылки и действия
Дополнительные ресурсы: