Автоматическая классификация причин отключений в сетях 0,4 кВ по текстовым отчетам с применением машинного обучения

Бесплатный доступ

В работе представлено исследование, посвященное разработке и оценке алгоритмов машинного обучения для автоматизации идентификации причин отключений электроэнергии в электрических сетях 0,4 кВ. Актуальность задачи обусловлена неточностями в ведении отчетной документации, вызванными нестандартизированными формулировками и ошибками в журнале учета аварийных и плановых отключений, что затрудняет последующий анализ и принятие мер по повышению надежности. Предложенный подход основан на анализе текстовой информации о ходе устранения аварий и их последующей комплексной предобработке, включая нормализацию, лемматизацию и векторизацию с использованием метода взвешивания TF-IDF, что позволяет преобразовать текстовые описания в матрицу «терм-документ». Так как идентификация причин отключений электроэнергии является задачей многоклассовой классификации, были протестированы три алгоритма: логистическая регрессия, случайный лес и градиентный бустинг (LightGBM). Оценка качества моделей проводилась с использованием кросс-валидации со стратифицированным разбиением и на независимой тестовой выборке. Наилучшие результаты показала модель логистической регрессии, достигшая на тестовой выборке точности (Accuracy) 0,864 и F1-меры, с микроусреднением 0,866, что подтверждает высокую практическую применимость предложенного подхода. Анализ ошибок показал, что основными барьерами для повышения точности являются орфографические ошибки в исходных данных и неоднозначность самой системы классификации, когда одно событие можно отнести к нескольким категориям. На основе полученных результатов сформулированы рекомендации по дальнейшему улучшению качества классификации. Они включают как совершенствование данных (увеличение выборки, коррекция ошибок на этапе ввода, улучшение классификатора причин), так и применение более сложных подходов, таких как автоматическая коррекция текста, использование эмбеддингов для учета семантики и применение глубоких нейронных сетей.

Автоматическая идентификация причин отключений электроэнергии, электрические сети 0, 4 кВ, журнал учета аварийных и плановых отключений, машинное обучение, аварийные отключения, задача многоклассовой классификации, векторное представление текстовых документов, классификация текста

Короткий адрес: https://sciup.org/146283384

IDR: 146283384   |   УДК: 004.85:004.93:621.316.13:621.3.019.3

Automatic Classification of Power Outage Causes in 0.4 kV Networks Based on Text Records Using Machine Learning

This work presents a study dedicated to the development and evaluation of machine learning algorithms for automating the identification of the causes of power outages in 0.4 kV electrical networks. The urgency of this task is due to inaccuracies in maintaining reporting documentation, which are caused by non-standardized wording and errors in the log of emergency and planned outages, thus hindering subsequent analysis and the adoption of measures to improve reliability. The proposed approach is based on the analysis of textual information concerning the progress of fault elimination and its subsequent comprehensive preprocessing, including normalization, lemmatization, and vectorization using the TF-IDF weighting method, which allows the text descriptions to be converted into a «term-document» matrix. Since identifying the causes of power outages is a multiclass classification problem, three algorithms were tested: logistic regression, random forest, and gradient boosting (LightGBM). Model quality was evaluated using cross-validation with stratified splitting and on an independent test sample. The best results were demonstrated by the logistic regression model, which achieved an Accuracy of 0.864 and an F1-score with micro-averaging of 0.866 on the test set, confirming the high practical applicability of the proposed approach. Error analysis showed that the main barriers to improving accuracy are spelling errors in the source data and the ambiguity of the classification system itself, where a single event can be assigned to multiple categories. Based on the results obtained, recommendations for further improving classification quality were formulated. These include both data enhancement (increasing the sample size, error correction at the input stage, improving the cause classifier) and the application of more complex approaches, such as automatic text correction, the use of embeddings to account for semantics, and the application of deep neural networks.

Текст научной статьи Автоматическая классификация причин отключений в сетях 0,4 кВ по текстовым отчетам с применением машинного обучения

На сегодняшний день одной из острых проблем повышения эффективности производств является острый дефицит рабочей силы [1], причем организации отрасли энергетики не стали исключением: в 2024 г., согласно исследованиям ВШЭ [2], дефицит работников в энергетике составил 95,4 тыс. человек. При этом спрос на высококвалифицированных специалистов растет опережающими темпами, так, дефицит инженеров в 2022 г. за один год поднялся на 43,5 % [3]. Данная проблема отражается на качестве многих выполняемых работ, одним из примеров являются неточности в оформлении отчетной документации. Так, имеется проблема ведения журнала учета аварийных и плановых отключений в электрических сетях, заполняемого диспетчерской службой электросетевой компании. Среди всей информации, представленной в этом журнале, есть записи, посвященные описанию хода устранения отключений электроэнергии. Журнал заполняется во время оперативных переговоров с ремонтными бригадами [4], содержит нестандартизированные формулировки, ошибки и пропуски важной информации. В результате на основе такой информации существует некоторое количество ошибочно определенных причин аварий, что затрудняет проведение достоверного анализа для поиска наиболее эффективных мер по снижению числа аварий [5, 6]. Кроме того, для электрических сетей ниже 35 кВ отсутствуют нормативные документы с требованиями по описанию и классификации причин отключений.

Для решения вышеописанной проблемы была поставлена гипотеза о возможности использования методов машинного обучения (Machine Learning, ML) для автоматического определения причин аварий на основе текстовой информации о ходе устранения отключений. При этом эмпирическая гипотеза заключается в том, что точность ответов подхода, построенного на методах машинного обучения, будет выше точности определения причин отключений специалистами диспетчерской организации. На предыдущем этапе исследования [7] был проведен латентносемантический анализ исследуемых данных (записей в журнале учета аварийных и плановых отключений), который позволил выявить паттерны, присущие определенному текстовому описанию причин аварий, а также определить возможность использования методов машинного обучения для поставленной задачи. При этом была отмечена возможность решения задачи как глубокими нейронными сетями, так и более классическими методами: логистической регрессией, деревьями решений и т.д.

Цель исследования – разработать модель машинного обучения для классификации причин аварий на основе текстовой информации о ходе устранения отключений.

1.    Материалы и методы

В качестве исходных данных использовалась информация об аварийных отключениях электроэнергии на ВЛ 0,4 кВ в одном из центральных регионов РФ, взятая из журнала учета аварийных и плановых отключений в электрических сетях за 2018–2020 гг. Из этих данных был выделен корпус документов, содержащий текстовую информацию о ходе устранения отключений, нормализован, лемматизирован и преобразован в векторное пространство методом взвешивания на основе веса терм (TF-IDF).

Полученное векторное пространство использовалось в качестве входных данных для моделей машинного обучения при классификации причин отключений, при этом 10 % было взято для тестовой выборки. В качестве моделей машинного обучения использовались 3 классификатора: логистическая регрессия, алгоритм случайного леса и алгоритм градиентного бустинга LightGBM Classifier. Поиск оптимальных параметров классификаторов осуществлялся методом поиска по сетке GridSearchCV с кросс-валидацией со стратифицированным разделением. Выбор лучшего классификатора осуществлялся на основе анализа метрик качества accuracy, precision, recall, f1-меры и его проверки на тестовой выборке. В конце исследования проведен анализ факторов, влияющих на ошибки классификации, и определены направления по повышению качества автоматической классификации причин аварий на основе текстовой информации о ходе устранения отключений.

Проведение исследований производилось на языке программирования Python в среде разработки Jupyter notebook (ver. 7.0.6) программного комплекса Anaconda Python. Для работы с табличными данными применялась библиотека Pandas (ver. 2.1.4), для построения графиков – Matplotlib (ver. 3.8.0) и Seaborn (ver. 0.12.2). Нормализация текста проводилась средствами модуля регулярных выражений re (ver. 0.12.2), лемматизация – средствами библиотеки расширенной обработки естественного языка SpaCy (ver. 3.7.6). Создание векторного пространства в виде TD-IDF-матрицы и классификация причин аварий на основе этого пространства выполнялись средствами библиотеки для машинного обучения Scikit-learn (ver. 1.2.2), а также фреймворка градиентных бустингов LightGBM (ver. 4.1.0).

2.    Результаты 2.1.    Анализ и подготовка данных для машинного обучения

Исходные данные для настоящего исследования включили в себя 2345 случаев аварийных отключений электроэнергии. Кардинальность значений причин отключений составила 22, при этом наблюдался существенный дисбаланс классов – на класс «Срабатывание АВ» приходилось 52,2 % всех случаев (рис. 1). Такой дисбаланс обусловлен сложностью точной идентификации причины аварии в некоторых ситуациях, особенно в условиях нестабильных аварийных режимов (например, при схлестывании проводов). При этом пять причин отключений электроэнергии отражены только 1–2 событиями. Для снижения влияния дисбаланса классов на каче-

Рис. 1. Распределение частоты встречаемости причин отключений

Fig. 1. Distribution of the frequency of occurrence of reasons for outages ство модели машинного обучения было принято решение объединить редкие классы (с менее чем 4 наблюдениями) в одну категорию. Для подготовки данных к обучению алгоритмов машинного обучения категориальные значения признака «причина отключения» были преобразованы в числовой формат с помощью метода кодировки метки (Label Encoding) [8].

Корпус текстовых данных, отражающих хронологию устранения аварийных отключений электроэнергии, был предварительно обработан для приведения к унифицированному виду. В рамках предобработки были выполнены следующие операции: лексическая унификация (удаление лишних пробелов, стоп-слов, специальных символов), текст приведен к нижнему регистру и лемматизирован с помощью библиотеки spaCy NLP [9,10]. Для создания векторного представления текстовых документов, которое является многомерным пространством, где каждый документ соответствует вектору, а координаты вектора отражают важность различных терминов в документе, был применен метод взвешивания на основе веса терм TF-IDF [11,12] с порогом максимальной частоты 0,7. В результате этих действий сформирована матрица терм-документов размерностью 2345×1878, где строки соответствуют документам, а столбцы – уникальным термам (словам). Анализ полученной матрицы терм-документов проведен на предыдущем этапе исследования и представлен в работе [7] вместе с детальным описанием методологии получения векторного пространства.

  • 2.2.    Сравнительный анализ моделей машинного обучения

для прогнозирования причин отключений электроэнергии

Врамкахданногоисследованияпроведеносравнениеэффективноститрехраспространенных алгоритмов машинного обучения в задаче классификации причин отключений:

– логистическая регрессия (Logistic Regression);

– алгоритм случайного леса (Random Forest Classifier);

– алгоритм градиентного бустинга LightGBM Classifier.

Для выбора оптимальных гиперпараметров и оценки обобщающей способности моделей был применен метод 5-кратной кросс-валидации с использованием поиска по сетке (GridSearchCV). При этом для обучения с учетом перекрестной проверки использовалось 90 % объектов векторного пространства, а 10 % – для проверки ее качества, причем разделение выборок производилось стратифицированно по целевому признаку.

Выбор лучшего классификатора производился на основе анализа следующих метрик качества предсказания:

– Точность (Accuracy): доля правильных предсказаний от общего числа объектов;

– Точность положительных предсказаний (Precision): доля правильных положительных предсказаний среди всех положительных предсказаний;

– Полнота (Recall): доля правильных положительных предсказаний среди всех фактических положительных предсказаний;

– F1-мера (F1-score): гармоническое среднее Precision и Recall.

Подробное описание метрик, использованных для оценки качества моделей, приведено в работе [13]. Учитывая многоклассовый характер решаемой задачи, для агрегирования результатов по всем классам были выбраны микро-(Weighted-) и макро(Macro)-усреднение. Макроусреднение предполагает расчет значения каждой метрики для каждого класса – 688 –

Таблица 1. Метрики качества обученных моделей

Table 1. Quality metrics of trained models

ML модель Accuracy Precision weighted Precision macro Recall weighted Recall macro f1 weighted f1 macro Logistic Regression 0,913 0,9 0,615 0,913 0,576 0,904 0,583 LGBM Classifier 0,9 0,882 0,563 0,9 0,463 0,887 0,485 Random Forest Classifier 0,848 0,796 0,257 0,848 0,237 0,815 0,242 Dummy Classifier 0,521 0,272 0,029 0,521 0,056 0,357 0,039 независимо, а затем вычисление среднего арифметического этих значений. Такой подход обеспечивает равное влияние каждого класса на итоговую оценку модели. Микроусреднение, в свою очередь, учитывает дисбаланс классов в выборке, взвешивая вклад каждого класса пропорционально его представленности. Результаты оценки качества моделей, полученные с использованием указанных метрик, сведены в табл. 2. Для оценки значимости полученных результатов в таблицу включены значения метрик для базовой модели Dummy Classifier со стратегией «uniform», которая служит нижней границей качества и генерирует случайные предсказания с равной вероятностью для всех классов.

Анализ результатов, представленных в табл. 1, демонстрирует существенное превосходство всех обученных классификаторов над базовой моделью Dummy Classifier со стратегией «uniform». Наиболее высокое качество предсказаний по всем метрикам для задачи классификации причин отключений было получено на модели логистической регрессии. Оптимальные гиперпараметры модели включают балансировку классов, алгоритм оптимизации SAGA, регуляризацию ElasticNet с соотношением L1/L2 регуляризаторов 60/40 и коэффициентом регуляризации 14.5.

Полученные результаты свидетельствуют о высокой точности предсказаний модели, превышающей 90 %. При этом ошибки классификации преимущественно связаны с классами, имеющими низкую частоту встречаемости в обучающей выборке. Данный вывод подкреплен резким снижением качества предсказания при выводе метрик с макроусреднением, не подразумевающего учет доли каждого класса в выборке.

  • 2.3.    Анализ качества классификации модели

  • 3.    Обсуждение 3.1.    Анализ факторов, влияющих на ошибки классификации

на тестовом наборе данных

Модель была проверена на независимом наборе данных (тестовая выборка размером 10 % от изначального, зарезервированная перед обучением классификаторов). Полученные результаты подтвердили стабильность модели: значения метрик качества на тестовом наборе оказались сопоставимы с результатами кросс-валидации. Точность (Accuracy) модели в 0.8638 и F1-мера с микроусреднением в 0.8663 свидетельствует о высокой вероятности правильной классификации новых данных. Однако анализ F1-меры с макроусреднением (0.5479) еще раз подтвердил, что модель испытывает трудности при классификации редких классов. Более подробный анализ качества классификации представлен в табл. 2 и на рис. 2. Табл. 2 содержит

Таблица 2. Детальные метрики качества классификации по причинам отключений (на уровне классов)

Table 2. Detailed metrics of the quality of classification by reasons for outages (at the class level)

Причина отключения Precision Recall F1-score Количество объектов Атмосферные перенапряжения 1 1 1 1 Внутреннее повреждение АВ 0,4 кВ 0 0 0 1 Гололедно-ветровые нагрузки 0.333 0.333 0.333 3 Деятельность сторонних лиц 0 0 0 1 Другая причина 0 0 0 1 Жизнедеятельность животных и птиц 0.913 0.955 0.933 22 Окисление контактных соединений 1 1 1 1 Падение деревьев 0.808 0.750 0.778 28 Падение опоры 1 0.500 0.667 2 Перегорание предохранителя 0,4 кВ 0.786 0.846 0.815 26 Перекрытие проводов по постороннему предмету 0 0 0 1 Повреждение изолятора 0 0 0 1 Повреждение на оборудовании потребителя 0.250 0.500 0.333 2 Повреждение проводов и опор дорожной техникой и автомобилями 1 1 1 2 Превышение габарита стрелы провеса 0.500 1 0.667 1 Срабатывание АВ 0.958 0.935 0.947 123 Схлестывание проводов 0.842 0.842 0.842 19 Макроусреднение 0.552 0.568 0.548 235 Микроусреднение 0.872 0.864 0.866 235 детальный отчет о точности положительных предсказаний, полноте и F1-мере для каждого класса (причин отключений электроэнергии). На рис. 2 представлена матрица ошибок (неточностей) в виде тепловой карты, визуализирующей распределение ошибок классификации, что позволяет идентифицировать наиболее проблемные классы для прогнозирования моделью.

Несмотря на то что автоматическая оценка точности дает нам общее представление о качестве работы классификатора, ручной анализ ошибок позволяет погрузиться в детали и выявить конкретные причины неверных предсказаний. Такой подход обеспечивает более глубокое понимание ограничений модели и помогает разработать стратегии для улучшения ее производительности. В табл. 3 приведены десять записей (сохраненных в исходном виде) о ходе устранения отключений электроэнергии, для которых модель отметила ошибочный класс. Анализ этих данных выявил существенную проблему, связанную с качеством заполнения журнала учета аварийных и плановых отключений: большое количество орфографических ошибок и опечаток. Например, в третьем примере табл. 3 присутствует термин «Обнаруженоборван-ный», не распознанный классификатором из-за орфографической ошибки. При этом в седьмом – 690 –

Матрица с

>шибок

о

1

0

0

0

0

0

0

0

0

0

0

0

0

0

0

0

0

г-Н

0

0

0

0

0

0

0

0

0

1

0

0

0

0

0

0

0

(N

0

0

1

0

0

0

0

2

0

0

0

0

0

0

0

0

0

ГП

0

0

0

0

0

0

0

1

0

0

0

0

0

0

0

0

0

^

0

0

0

0

0

0

0

0

0

1

0

0

0

0

0

0

0

ш

0

0

0

0

0

21

0

0

0

0

0

0

0

0

0

1

0

ю

0

0

0

0

0

0

1

0

0

0

0

0

0

0

0

0

0

г*

0

0

1

0

0

1

0

21

0

1

0

0

0

0

0

2

2

со

0

0

0

0

0

0

0

0

1

0

0

0

1

0

0

0

0

о

0

1

0

0

0

1

0

0

0

22

0

0

1

0

0

1

0

о

0

0

0

0

1

0

0

0

0

0

0

0

0

0

0

0

0

0

0

0

0

0

0

0

1

0

0

0

0

0

0

0

0

0

N

0

0

0

0

0

0

0

0

0

0

0

0

1

0

0

1

0

СО

0

0

0

0

0

0

0

0

0

0

0

0

0

2

0

0

0

0

0

0

0

0

0

0

0

0

0

0

0

0

0

1

0

0

н

0

3

1

0

0

0

0

0

0

2

0

0

0

0

1

1

2

0

0

0

0

0

0

0

1

0

1

0

0

1

0

0

0

16

0

1

2

3

4

5

6

7  8 9

Предсказания

10

11

12

13

14

15

16

Рис. 2. Матрица ошибок классификации причин отключения электроэнергии: 0 – Атмосферные перенапряжения, 1 – Внутреннее повреждение АВ 0,4 кВ, 2 – Гололедно-ветровые нагрузки, 3 – Деятельность сторонних лиц, 4 – Другая причина, 5 – Обрыв провода, 6 – Окисление контактных соединений, 7 – Падение деревьев, 8 – Падение опоры, 9 – Перегорание предохранителя 0,4 кВ, 10 – Перекрытие проводов по постороннему предмету, 11 – Повреждение изолятора, 12 – Повреждение на оборудовании потребителя, 13 – Повреждение проводов и опор дорожной техникой и автомобилями, 14 – Превышение габарита стрелы провеса, 15 – Срабатывание АВ, 16 – Схлестывание проводов

Fig. 2. Confusion matrix for classifying the causes of power outages: 0 – Atmospheric overvoltage, 1 – Internal damage to 0.4 kV circuit breaker, 2 – Ice and wind loads, 3 – Third-party activity, 4 – Other cause, 5 – Wire break, 6 – Oxidation of contact connections, 7 – Falling trees, 8 – Falling pole, 9 – Blown 0.4 kV fuse, 10 – Wire flashover by foreign object, 11 – Insulator damage, 12 – Damage to consumer equipment, 13 – Damage to wires and supports by road equipment and vehicles, 14 – Exceeding the sag boom clearance, 15 – Tripping of circuit breaker, 16 – Wire entanglement примере фраза «Обнаружено обрыв провода в пролете», написанная отдельными словами, уже поспособствовала модели в определении класса «Обрыв провода». Однако в том же примере нераспознанная отдельными словами фраза «из-за ветвейдеревьев» снова привела к ошибке в классификации – правильный класс оказался «Падение деревьев».

Также выявлено, что существующая система классификации причин отключения электроэнергии в электрических сетях 0,4 кВ сталкивается с трудностями применительно к событиям, имеющим сложную причинно-следственную связь. Неоднозначность классификации возникает в случаях, когда одно повреждение обусловлено воздействием нескольких факторов или процессов. Так, в примерах 5, 7, 9 и 10 прослеживается возможность отнесения одного и того же события к различным классам. Например, в примере 5 причина аварии может быть классифицирована как «схлестывание проводов» или «падение деревьев». Аналогичная ситуация наблюдается в примерах 7 (выбор между классами «падение деревьев» или «обрыв провода»), 9 («повреждение изо- – 691 –

Таблица 3. Анализ ошибок модели автоматической классификации причин отключения электроэнергии

Table 3. Error analysis of the automatic classification model for the causes of power outages

№ Текстовая информация Истинный класс Предсказанный класс 01.04.2018 01:40 заявка нет ЭЭ01.04.2018 02:30 обнаружен поврежденный а.в.0,4кВ в РУ-0,4кВ01.04.2018 11:50 заменен а.в.0,4кВ в РУ-0,4кВ, ВЛ-0,4кВ № 2 в работе Внутреннее повреждение АВ 0,4 кВ Перегорание предохранителя 0,4 кВ 21.05.2018 21:30 сообщение из н.п. Свапские дворы об отсутствии э/э.21.05.2018 22:03 перегорел ПН-2 ф "С"21.05.2018 22:34 ВЛ введена в работу после осмотра. Возможное касаниеветвей деревьев проводов в прол. оп.№№ 2/2–2/4 при ветре. Гололедноветровые нагрузки Падение деревьев 16:18 Обнаружен отключенный АВ-0,4кВ № 3 ТП № 33. 16:39 Обнаруженоборванный ввод в нежилое здание. 16:47 Произведено оключение перекидкиот оп.№ 5. 16:55 Включен АВ-0,4 кВ № 3 ТП № 33 Обрыв провода Срабатывание АВ 14:52 Поступил сигнал об отсутствии эл.энергии.15:47 При осмотре ТП, обнаружено, отключен АВ-0,4кВ № 2.15:50 Бригада направлена на обход. 15:56 оп-30–33 провис проводов. Срабатывание АВ Превышение габарита стрелы провеса 11.04.2019 22:08 поступила заявка нет эл.энергии.12.04.2019 01:08 осмотрена ВЛ-0,4кВ ф-1.В пролете опор № 6-№ 7 веткадерева упала на провода, схлест проводов. 02:28 устранено повреждение Падение деревьев Схлестывание проводов Перегоревший ПН-2 фазы "А". Схлест проводов А-25 в пролете опор № 14–15из-за наличия поросли в проводах. Падение деревьев Схлестывание проводов 06.06.2018 09:50 Позвонил абонент нет ээ.16:50 Обнаружено обрыв провода в пролете опор № 1/1–1/2 из-за ветвейдеревьев.17:50 Устранено Падение деревьев Обрыв провода Откл. АВ-0,4 кВ. Механическое повреждение перекидки провода СИП-4 16 отопоры № 2 до здания (магазин). Перекрытие проводов по постороннему предмету Другая причин Отключен АВ-0,4кВ ф-1. Схлест проводов в пролете опор2–3 отп-1, соскочили изоляторы с оп 2,3 отп-1 из внеохранной зоны упало дерево впролете опор 3–4 отп-1 Повреждение изолятора Падение деревьев 16–26 прибывшая бригада обнаружила, что отключен АВ-0.4кв Ф№ 2, местныежители спили на ВЛ-0.4кв дерево из внеохранной зоны, оборваны провода впролете опор№ 4–6 Деятельность сторонних лиц Падение деревьев лятора» или «падение деревьев»), 10 («деятельность сторонних лиц» или «падение деревьев»). Указанная проблема свидетельствует о необходимости дальнейшего совершенствования системы классификации с целью повышения ее точности и информативности.

Еще один момент, который необходимо отметить, что из-за наличия человеческого фактора присутствуют ошибки при ручной классификации причин отключений электроэнергии. В приведенных примерах (4 и 2) отчетливо прослеживается подобная тенденция. Например, – 692 – в примере 4, несмотря на указание о превышении габарита стрелы провеса, персонал классифицировал аварию как «Срабатывание АВ». Аналогично в примере 2 отсутствие информации о гололедно-ветровых нагрузках ставит под сомнение обоснованность такой классификации, особенно в сравнении с выводом модели о падении деревьев.

  • 3.2.    Направления будущих исследований

Результаты проведенного исследования демонстрируют возможность достижения высокой точности классификации причин отключений электроэнергии при использовании классических моделей машинного обучения в сочетании с представлением текстовых данных в виде матрицы «терм-документ». Данный результат обусловлен тем, что текстовые фрагменты, описывающие процесс устранения аварийных отключений, как правило, содержат термины, непосредственно указывающие на причину отключения электроэнергии, что снижает необходимость анализа семантических связей между словами.

Наряду с достигнутыми в исследовании результатами существуют перспективы дальнейшего улучшения классификации причин отключения электроэнергии, которые условно можно разделить на две группы. Первая группа включает исследования, ориентированные на улучшение качества исходных данных, вторая – на применение более совершенных методов машинного обучения. В рамках первой группы целесообразно рассмотреть следующие аспекты: устранение дисбаланса классов целевой переменной посредством увеличения объема выборки; совершенствование структуры классификации причин отключений электроэнергии в электрических сетях 0,4 кВ; повышение качества первичных данных, включая коррекцию орфографических и типографических ошибок на этапе внесения информации в журнал учета аварийных и плановых отключений. Вторая группа включает автоматическую орфографическую коррекцию текста и использование эмбеддингов, в том числе предварительно обученных, для представления текстовых документов в векторном пространстве, что позволит учитывать семантические связи в текстах. Реализация обоих подходов предполагает применение более сложных моделей машинного обучения, основанных на глубоких нейронных сетях, что может потребовать использования высокопроизводительного оборудования или привлечения платных облачных вычислительных ресурсов, включая сервисы больших языковых моделей. Следует отметить, что повышение качества классификации исключительно за счет методов второй группы будет ограниченным, поскольку качество входных данных является определяющим фактором для задач машинного обучения.

В заключение важно отметить, что полученные результаты не подтвердили нашу эмпирическую гипотезу о превосходстве точности автоматической классификации отключений электроэнергии над ручной. Ручной анализ ошибок модели показал, что значительная часть неверных классификаций связана с наличием орфографических и типографических ошибок в исходных данных. Это позволяет предположить, что при устранении этих ошибок точность модели существенно возрастет и подтвердится исходная гипотеза.

Выводы

Основным результатом данного исследования является подтверждение возможности применения методов машинного обучения для автоматической идентификации причин аварий – 693 – на основе текстовой информации об устранении отключений электроэнергии, содержащейся в журнале учета аварийных и плановых отключений. Показано, что применение классических моделей машинного обучения, таких как логистическая регрессия, случайный лес, градиентный бустинг, реализованный в библиотеке LightGBM, к векторному представлению текстовых документов, полученному методом TF-IDF, обеспечивает высокие показатели качества классификации. Полученные результаты свидетельствуют о высокой эффективности предложенного подхода. Точность классификации для исследованных моделей варьировалась в диапазоне от 0,848 до 0,913, что существенно превышает точность базовой модели со стратегией «uniform» (0,521). Наилучшие результаты достигнуты с помощью модели логистической регрессии, продемонстрировавшей точность 0,864 и F1-меру с микроусреднением 0,866 на независимой тестовой выборке. При этом все исследованные модели демонстрируют снижение качества классификации редких классов, что проявляется в уменьшении значений метрик при усреднении без учета доли классов. В связи с этим определена необходимость увеличения объема выборки для повышения представленности редких классов и решения проблемы их дисбаланса, а также коррекции орфографических и типографических ошибок в записях журнала учета аварийных и плановых отключений как на этапе внесения самих записей, так и с помощью методов автоматической коррекции. Кроме того, обоснована необходимость совершенствования структуры классификации причин отключений электроэнергии в электрических сетях 0,4 кВ, и предложено дальнейшее исследование с применением более совершенных методов обработки естественного языка, таких как использование эмбеддингов текстовых документов и моделей глубокого обучения.