Link Prediction for Event Logs in the Process Industry

2508.09096v1 cs.CL, cs.IR 2025-08-14
Авторы:

Anastasia Zhukova, Thomas Walton, Christian E. Matt, Bela Gipp

Резюме на русском

## Контекст Оптимизация операций, обеспечение безопасности и постоянное совершенствование в промышленности процессов основываются на эффективном использовании операционных данных и прошлых знаний. Однако в этой области существуют значительные проблемы, связанные с разделенностью событий в журналах смен. Рекомендации по подходящим решениям для пользователей становятся сложнее из-за того, что связанные записи, такие как описания проблем с оборудованием или процессами и их решения, часто остаются разделенными. Данная работа адресует эту проблему, используя подход **link prediction** (предсказание связей) из графового машинного обучения, преобразованный в задачу **cross-document coreference resolution (CDCR)** с добавлением **natural language inference (NLI)** и **semantic text similarity (STS)**. Направление **causal inference (CI)** дает дополнительный импульс к улучшению моделей. ## Метод Модель **link prediction** для решения задачи **record linking (RL)** была разработана с использованием **CDCR**, **NLI** и **STS**. Для адаптации модели к текстовым форматам промышленности процессов была предпринята работа над моделью, которая может работать на уровне параграфов, подобно NLI и STS. Модель учитывает как неструктурированный текст, так и структурированные атрибуты записей. Данная техника позволила расширить модели CDCR, предназначенные для новостного дела, на область журналов смен промышленных процессов. Отдельное внимание было уделено адаптации моделей CI для повышения качества рекомендаций. ## Результаты Запуск модели проводился на данных, содержащихся в журналах смен промышленных процессов. На основе функций NLI и STS, а также добавленных элементов CI, был проведен сравнительный анализ модели с лучшими NLI- и STS-движениями. Результаты показали, что RL-модель выдала значительные улучшения, повысив точность предсказания связей на 28% (11.43 балла) по сравнению с NLI и на 27% (11.21 балла) по сравнению с STS. Это демонстрирует эффективность модели в улучшении качества связей в журналах смен, что в свою очередь повышает качество управления знаниями в промышленности процессов. ## Значимость Результаты работы могут быть применены в различных сферах, включая **knowledge management (KM)**, **process optimization** и **safety management** в промышленности процессов. Эффективное решение задачи **record linking** позволяет улучшить качество данных и связи между записями, что приводит к более эффективному использованию данных и повышению безопасности и производительности. Будущие исследования могут сосредоточиться на усовершенствовании моделей CI и их применении в других областях, где требуется подключение разделенных данных. ## Выводы В данной работе был применен подход **link prediction**, адаптированный для задачи **record linking** в журналах смен промышленных процессов

Abstract

Knowledge management (KM) is vital in the process industry for optimizing operations, ensuring safety, and enabling continuous improvement through effective use of operational data and past insights. A key challenge in this domain is the fragmented nature of event logs in shift books, where related records, e.g., entries documenting issues related to equipment or processes and the corresponding solutions, may remain disconnected. This fragmentation hinders the recommendation of previous solutions to the users. To address this problem, we investigate record linking (RL) as link prediction, commonly studied in graph-based machine learning, by framing it as a cross-document coreference resolution (CDCR) task enhanced with natural language inference (NLI) and semantic text similarity (STS) by shifting it into the causal inference (CI). We adapt CDCR, traditionally applied in the news domain, into an RL model to operate at the passage level, similar to NLI and STS, while accommodating the process industry's specific text formats, which contain unstructured text and structured record attributes. Our RL model outperformed the best versions of NLI- and STS-driven baselines by 28% (11.43 points) and 27% (11.21 points), respectively. Our work demonstrates how domain adaptation of the state-of-the-art CDCR models, enhanced with reasoning capabilities, can be effectively tailored to the process industry, improving data quality and connectivity in shift logs.

Ссылки и действия