Алгоритм определения численных индикаторов аномалий трафика на основе модели случайного леса

Бесплатный доступ

В работе представлен алгоритм, позволяющий извлекать из модели случайного леса числовые пороговые значения для обнаружения аномалий, обусловленных различными видами сетевых атак. Он позволяет выделить как отдельные пороговые значения, так и диапазоны нормальных или аномальных значений, а также оценить их статистическую значимость. Представленный алгоритм был протестирован на наборе данных CIC-IDS2017 для выявления специфичных изменений статистических характеристик при определенных типах атак. Трафик рассматривается в виде последовательности интервалов между поступлениями пакетов, последовательности размеров пакетов, а также временных рядов, представляющих количество пакетов или суммарный объем байт в единицу времени. Трафик разбивается на неперекрывающиеся минутные интервалы, производится оценка коррелированности признаков, и для каждой категории атак обучаются отдельные модели классификации. Для моделей с наибольшим значением F1-меры разработанный алгоритм применяется для выявления наиболее значимых признаков атак, связанных с изменениями статистических характеристик. Результаты показывают, что для различных типов атак значимые пороговые значения определяются для признаков, соответствующих значениям автокорреляционной функции на разных лагах, что указывает на возможность использования изменения корреляции для обнаружения этих атак.

сетевой трафик \ сетевые аномалии \ сетевые атаки \ DoS-атаки \ информационная безопасность \ машинное обучение \ интерпретируемость

Короткий адрес: https://sciup.org/140316412

IDS: 140316412   |   УДК: 004.85:004.75   |   DOI: 10.18469/ikt.2026.24.1.03

Algorithm for identifying numerical indicators of network traffic anomalies based on a random forest model

This paper presents an algorithm that extracts numerical threshold values from a random forest model for detecting anomalies caused by various types of network attacks. It allows an identification of both individual threshold values and ranges of normal or anomalous values, as well as the assessment of their statistical significance. The proposed algorithm is evaluated using the CIC-IDS2017 dataset to identify specific changes in statistical characteristics during particular types of attacks. Traffic is analyzed as a sequence of packet inter-arrival times, a sequence of packet sizes, and time series representing packet counts or total byte volumes per unit of time. The traffic is split into nonoverlapping one-minute intervals, feature correlations are assessed, and separate classification models are trained for each attack category. For models with the highest F1-score, the proposed algorithm is applied to identify the most significant attack features related to changes in statistical characteristics. Results indicate that, across multiple attack groups, significant thresholds are identified for features corresponding to the autocorrelation function values at different lags, suggesting that changes in correlation can be used to detect these attacks.