Анализ и обнаружение фишинга на основе нейронных сетей

Тришин И.Д. Сидин С.О.

Журнал: Форум молодых ученых @forum-nauka

Статья в выпуске: 1 (113), 2026 года.

Бесплатный доступ

В данной статье рассматривается фишинг - одна из наиболее распространённых и быстро меняющихся киберугроз, нацеленной на хищение учётных данных, платёжной и персональной информации. Классические методы защиты (чёрные/белые списки, фильтрация, эвристики и обучение пользователей) снижают риск, но недостаточно эффективны при высокой адаптивности атак и краткоживущих фишинговых ресурсах. В обзоре систематизированы современные подходы к обнаружению фишинга с использованием машинного и глубокого обучения, с фокусом на нейросетевых архитектурах (CNN, LSTM, BiLSTM, DNN, MLP и гибриды). Рассмотрены типы данных (URL, HTML-контент, e-mail, DNS-трафик, поведенческие логи), типовые этапы подготовки данных и ключевые метрики (accuracy, precision, recall, F1, AUC ROC). Показано, что нейросетевые модели, особенно CNN, LSTM/BiLSTM и гибридные решения, часто обеспечивают лучшую точность и обобщающую способность по сравнению с классическими ML-алгоритмами, что делает их перспективной основой антифишинговых систем.

фишинг \ фишинговая атака \ нейронные сети \ машинное обучение \ глубокое обучение \ классификация url \ защита от фишинга

Похожие статьи в разделе Искусственный интеллект

Модели обнаружения атак с использованием методов машинного обучения
Модели обнаружения атак с использованием методов машинного обучения

Поздняк Ирина Сергеевна, Макаров Игорь Сергеевич

Программный комплекс обнаружения атак на основе анализа данных реестра
Программный комплекс обнаружения атак на основе анализа данных реестра

Чурилина Александра Евгеньевна, Никишова Арина Валерьевна

Короткий адрес: https://sciup.org/140315390

IDS: 140315390   |   УДК: 004.8

Analysis and detection of phishing based on neural networks

This article examines phishing - one of the most common and rapidly evolving cyber threats aimed at stealing credentials, payment, and personal information. Traditional protection methods (black/white lists, filtering, heuristics, and user training) reduce the risk but are insufficiently effective against highly adaptive attacks and short-lived phishing resources. The review systematizes modern approaches to phishing detection using machine and deep learning, with a focus on neural network architectures (CNN, LSTM, BiLSTM, DNN, MLP, and hybrid models). The types of data (URL, HTML content, e-mail, DNS traffic, behavioral logs), typical data preparation steps, and key metrics (accuracy, precision, recall, F1, AUC ROC) are considered. It is shown that neural network models, especially CNN, LSTM/BiLSTM, and hybrid solutions, often provide better accuracy and generalization capability compared to classical ML algorithms, making them a promising foundation for anti-phishing systems.

Текст научной статьи Анализ и обнаружение фишинга на основе нейронных сетей

Введение: фишинг — кибератака, сочетающая социальную инженерию и технические средства, направленная на получение конфиденциальной информации через поддельные письма, сайты, сообщения и иные каналы. Для организаций фишинг часто выступает начальной точкой компрометации инфраструктуры.

Высокая результативность фишинга объясняется ростом интернет-аудитории, активным использованием онлайн-сервисов и тем, что даже пользователи с высоким уровнем образования нередко переоценивают способность распознавать угрозы. Традиционные меры защиты полезны, но не обеспечивают достаточной скорости и полноты детектирования в условиях постоянного изменения шаблонов атак[3]. Поэтому перспективным направлением являются методы ML/DL, прежде всего нейронные сети способные автоматически извлекать признаки из разнородных данных и адаптироваться к новым паттернам фишинговой активности [1-3].

Для подготовки обзора были проанализированы русскоязычные и англоязычные публикации, посвящённые применению нейронных сетей и других методов ML/DL к задачам обнаружения фишинга в URL-адресах содержимом веб-страниц, электронных письмах и DNS-трафике [1–3, 5, 8– 10].

В качестве основных источников использованы:

  • 1.    обзор и сравнительный анализ ML/DL-подходов к защите от фишинга (CNN, LSTM, DNN, классические ML-алгоритмы).

  • 2.    работа по разработке системы защиты от фишинговых атак с использованием многослойного персептрона (MLP) и 30 признаков URL.

  • 3.    исследование по обнаружению фишинговых электронных писем с использованием рекуррентных нейронных сетей (RNN, LSTM, BiLSTM) на русскоязычном датасете.

  • 4.    обзор и практическое исследование методов машинного обучения для идентификации фишинговых ресурсов (логистическая

  • 5.    ряд зарубежных работ, посвящённых CNN, eXpose-модели, CNNLSTM-архитектурам, GRU-сетям, DNN и гибридным моделям для обнаружения фишинговых URL, вредоносных доменов и сайтов.

регрессия, деревья решений, Random Forest, CatBoost, SGD) на основе большого URL-датасета

Отбор статей осуществлялся с учётом наличия экспериментальной части, описания структуры датасетов, архитектуры моделей и используемых метрик качества (accuracy, precision, recall, F1, AUC ROC).

Результаты оригинального авторского исследования:

В рамках данной работы авторами проведено о бзорно-аналитическое исследование современного состояния методов обнаружения фишинга с применением нейронных сетей. Основным результатом выступает систематизация подходов, типов данных, этапов подготовки и сопоставление типовых показателей качества, демонстрируемых нейросетевыми архитектурами.

По итогам анализа источников авторы выделили ключевые классы данных, на которых строятся антифишинговые решения: URL-строки HTML-контент, электронные письма, DNS-трафик, а также поведенческие логи пользователей. Показано, что выбор и качество датасета критически влияют на итоговые метрики моделей и применимость решения в реальных условиях. Отмечено, что глубокие модели, как правило, требуют существенно больших наборов данных, чем классические методы машинного обучения, особенно при работе с «сырыми» строками URL и текстом.

Главный содержательный вывод исследования заключается в том, что нейросетевые модели в ряде задач фишинг-детектирования демонстрируют более высокую точность и лучшую обобщающую способность по сравнению с традиционными ML-алгоритмами, особенно при автоматическом извлечении признаков из текстовых и последовательностных данных.

Также сформулированы практические ограничения внедрения: дефицит регулярно обновляемых датасетов, адаптивность злоумышленников и требования к масштабируемости и задержкам при интеграции в инфраструктуру.

Цель работы : обобщить опыт применения нейросетей для обнаружения фишинга; систематизировать типы данных, подходы к датасетам/предобработке, архитектуры моделей и результаты по ключевым метрикам.

Фишинг как вид кибермошенничества опирается на два ключевых компонента: психологическое воздействие (социальная инженерия) и техническую инфраструктуру (фишинговые сайты, вредоносные вложения подделка отправителя и др.). С точки зрения анализа средствами ML/DL важна классификация по типу атакуемых и анализируемых элементов [1]:

  • 1.    Атаки на основе URL-адресов:

  •    Подмена доменного имени (набранного сходно с легитимным брендом)

  •    Использование IP-адресов вместо доменов

  •    Применение коротких URL-сервисов

  •    Внедрение лишних протоколов и двойных слешей

  •    Избыточная длина, большое число спецсимволов и подкаталогов [1].

  • 2.   Атаки через электронную почту:

  • •    Подделка адреса и имени отправителя

  •    Внедрение ссылок на фишинговые сайты

  •    Вложенные документы (архивы, офисные файлы) с вредоносным кодом

  •    Использование актуальных тем (банковские уведомления, государственные сервисы и т.п.) [2].

  • 3.   Фишинговые веб-сайты:

  • •     Клон легитимного сайта (визуальное и структурное сходство)

  •    Наличие форм ввода учётных данных и платёжной информации

  •    Использование поддельных или дешёвых SSL-сертификатов

  •    Изменённая структура гиперссылок и скриптов [1].

  • 4.    Атаки через DNS-трафик и доменные имена:

  •    Вредоносные или алгоритмически сгенерированные домены

  •    Аномальные паттерны в DNS-запросах и ответах

  •    Использование фишинговых доменов для компрометации IoT и других устройств.

  • 5.    Поведенческие и профильные данные:

  •    Поведение пользователей при переходе по ссылкам

  •    Типичные сценарии посещения сайтов

  •    Профили пользователей и потенциальных жертв фишинга.

С точки зрения построения нейросетевых моделей, наиболее распространёнными объектами анализа являются: URL-строки, текст и метаданные электронных писем, HTML-контент веб-страниц, а также DNS-трафик.

Качество работы нейронных сетей критически зависит от качества и репрезентативности используемых датасетов [1–3, 5]. В работах по фишингу применяются как специализированные наборы URL/сайтов, так и смешанные датасеты, включающие HTML-контент, e-mail и сетевой трафик. Часто используемые источники фишинговых и вредоносных URL и доменов:

  •    PhishTank, OpenPhish, VirusTotal, Alexa, различные репозитории вредоносных доменов [2]

  •    UCI Machine Learning Repository, Kaggle и другие открытые сборники, содержащие размеченные URL с набором фиксированных признаков [2]

  •    Собственные сборы: русскоязычные фишинговые письма, собранные с почтовых серверов по IMAP, с последующей ручной разметкой [3].

Для классических ML-моделей часто достаточно датасетов размером от сотен до нескольких тысяч примеров, в то время как глубокие нейронные сети требуют значительно больших объёмов данных (десятки тысяч и более). Примеры:

  •    Порядка 19 млн URL-адресов для CNN-модели eXpose

  • •    60-150 тыс. URL-адресов для CNN, CNN-LSTM и GRU-сетей

  • •    2-3 млн URL-адресов и до 3,2 млн признаков для сравнения

классических классификаторов

  •    Около 4 тыс. URL (2000 легитимных и 2000 фишинговых) для LSTM-модели с признаками URL

  •    Датасеты электронных писем малой мощности (около 300 писем) для сравнения RNN, LSTM и BiLSTM

  •    Свыше 800 тыс. URL-адресов в практической работе по оценке

методов ML (Logistic Regression, Random Forest, CatBoost и др.).

При этом важным аспектом является баланс классов (фишинговые/легитимные). Несбалансированность может существенно влиять на метрики (особенно accuracy). Для её устранения применяются методы взвешивания классов, oversampling/undersampling и генерация синтетических примеров (SMOTE) [5].

С точки зрения признакового пространства можно выделить несколько подходов:

  • 1.    Ручные (инженерные) признаки URL и доменов [2]:

  •    Длина URL, домена и поддоменов

  •    Использование IP-адреса вместо доменного имени

  •    Число подкаталогов, точек, специальных символов, цифр, дефисов, двойных слешей, протоколов

  •    Наличие «подозрительных» подстрок (login, verify, secure и пр.)

  • •    Информация о SSL-сертификате и возрасте домена

  • •    Использование URL-сокращателей.

  • 2.   Признаки содержимого (HTML, e-mail) [1]:

  •    Текстовые признаки (частота слов, n-граммы, TF-IDF, word2vec/эмбеддинги)

  •    Наличие форм ввода, скриптов, внешних ресурсов

  •    Структурные особенности документа.

  • 2.    Векторизация символов и слов [2]:

  •    Представление URL или текста как последовательности символов и построение эмбеддингов на уровне символов (character-level CNN/RNN)

  •    Использование предобученных языковых моделей (например SpaCy ru_core_news_md) для лемматизации и получения векторных представлений слов [3]

  •    TF-IDF-векторизация лемм URL для последующей подачи на вход классическим или нейросетевым моделям [5].

  • 3.    Признаки DNS-трафика и поведения:

  •    Статистика длины доменных имён, частота символов

  •    Эмбеддинги на уровне символов/слов для доменных строк

  •    Временные паттерны DNS-запросов, графовые признаки.

Предобработка включает очистку данных (удаление дубликатов исправление кодировок), обработку пропусков и выбросов, нормализацию числовых признаков, кодирование категориальных атрибутов, а также выделение и лемматизацию токенов для текстовых данных [1–3, 5].

Recurrent Neural Networks (RNN), LSTM, BiLSTM Рекуррентные нейронные сети применяются в задачах, где важно учитывать последовательный характер данных: текст писем, URL-строки последовательности DNS-запросов [1].

– LSTM (Long Short-Term Memory) эффективно обрабатывают длинные последовательности, запоминая дальний контекст и подавляя проблему исчезающего градиента. LSTM показывали точность свыше 99 % при обнаружении фишинговых URL и порядка 98 % при классификации писем в отдельных исследованиях.

– BiLSTM (двунаправленные LSTM) анализируют последовательность в двух направлениях (вперёд и назад), что позволяет лучше учитывать контекст. В исследовании русскоязычных писем BiLSTM-сеть продемонстрировала наилучший результат, корректно обнаружив 91,43 % фишинговых сообщений при малом объёме обучающего датасета (300 писем), в то время как обычная RNN показала лишь около 50,71 % [3].

Таким образом, рекуррентные сети, особенно BiLSTM, рекомендуются для задач анализа текста писем и последовательностных представлений URL/доменных имён, особенно при относительно небольших объёмах качественно размеченных данных [1].

Convolutional Neural Networks (CNN)

Сверточные нейронные сети широко используются для анализа URL-строк и текстов на уровне символов и слов.

Их ключевые способности:

– применение свёрток к последовательности символов или токенов для извлечения локальных паттернов (подстрок, характерных комбинаций символов);

– возможность автоматического выделения информативных признаков без ручной инженерии;

– высокая производительность при работе с большими датасетами.

Гибридные модели (CNN-LSTM, CNN-GRU, DNN+эмбеддинги) Комбинации различных архитектур направлены на повышение точности и устойчивости моделей:

– CNN-LSTM: свёрточная часть выделяет локальные паттерны в URL или тексте, LSTM-часть моделирует последовательные зависимости. Такие модели показывали accuracy до 98,9 % и AUC свыше 0,99 для фишинговых [3].

– GRU-сети (Gated Recurrent Units) в сочетании с Random Forest: GRU-модель, обученная на признаках URL, демонстрировала лучшую точность (до 98,5 %) по сравнению с «лесом» на тех же данных. – DNN (Deep Neural Networks) с семантическими признаками: интеграция word2vec-эмбеддингов и статистических признаков позволяла улучшить качество обнаружения фишинга по HTML и URL.

Многослойный персептрон (MLP)

Многослойный персептрон рассматривается как базовая архитектура для работы с табличными признаками. В работе разработана система защиты от фишинговых атак на основе MLP, анализирующего URL по 30 ключевым признакам (длина URL, наличие SSL-сертификата, использование IP-адресов и др.) [2].

– Архитектура включала входной слой (30 признаков), два скрытых слоя (32 и 10 нейронов) и выходной нейрон с сигмоидной активацией [2] – Реализация на Python с использованием TensorFlow и Scikit-Learn показала точность 98,2 %, что значительно превысило результаты традиционных методов фильтрации (не более 85 %) [2]

Таким образом, MLP хорошо подходит для задач, где уже сформирован фиксированный набор информативных признаков (feature-based подход) и важно получить высокую точность при умеренных вычислительных затратах.

Нейросети для анализа DNS-трафика и профилей пользователей

Отдельный класс задач связан с обнаружением фишинга и вредоносной активности на уровне DNS-трафика:

– CNN и LSTM используются для анализа строк доменных имён (эмбеддинги символов, свёртки, последовательные модели);

– гибридные системы (DNS-фильтрация + CNN-LSTM) демонстрируют AUC порядка 0,95 при работе в реальном времени; – обработка потоков до 10 млрд DNS-запросов в день требует высокопроизводительных и хорошо масштабируемых архитектур, где DL-модели показывают заметные преимущества .

Также изучались модели DNN для анализа поведенческих логов пользователей и формирования профилей потенциальных жертв фишинга что позволяет выявлять аномальное поведение и повышать точность детектирования сложных атак.

Во многих работах проводилось сравнение нейросетевых моделей с классическими алгоритмами машинного обучения (SVM, Naive Bayes, Decision Tree, Random Forest, Logistic Regression, kNN, Gradient Boosting и др.).

Основные наблюдения:

– Для фишинговых URL методы глубокого обучения (CNN, LSTM, CNN-LSTM) часто превосходят классические алгоритмы по accuracy, F-мере и AUC, особенно когда модель работает напрямую с «сырыми» URL-строками без ручного конструирования признаков.

– В задачах с табличными признаками (фиксированный набор характеристик URL) хорошо себя проявляют Random Forest, Gradient Boosting и MLP достигая точности свыше 97–99 % при корректном выборе признаков и балансировке классов [2].

– В практическом исследовании на ~800 тыс. URL-адресов логистическая регрессия, CatBoost, SGD-классификатор и дерево решений показали accuracy на уровне 0,85–0,93, что сопоставимо с некоторыми DL-подходами при использовании только словарных признаков [5]. – Нейросетевые модели получают максимальные преимущества при наличии больших объёмов данных и возможности работать с текстом/URL в «сыром» виде, в то время как на малых датасетах грамотная инженерия признаков и ансамблевые ML-методы могут быть не менее эффективны.

Обсуждение и нерешённые проблемы:

Несмотря на высокие показатели точности, применение нейронных сетей для анализа фишинга сталкивается с рядом проблем:

  • 1.    Датасеты: недостаток открытых, репрезентативных и регулярно обновляемых наборов (особенно для русскоязычных писем) [3]; необходимость постоянного обновления из-за эволюции атак[1].

  • 2.    Интерпретируемость: нейросети часто выглядят как “чёрные ящики”, что затрудняет внедрение в критические системы и объяснение срабатываний.

  • 3.    Адаптивный противник: злоумышленники изменяют URL/контент, чтобы обходить детекторы; требуются методы повышения устойчивости к обфускации и атакующим примерам.

  • 4.    Интеграция в инфраструктуру: важны задержки масштабируемость и встраивание в почтовые шлюзы, прокси, SIEM/SOC; это остаётся значимым прикладным направлением [2].

Тем не менее совокупность результатов показывает, что нейронные сети являются одним из наиболее эффективных инструментов для обнаружения фишинговых атак, особенно в сочетании с хорошо спроектированной системой признаков, регулярным обновлением датасетов и комплексной архитектурой защиты (объединяющей URL-анализ фильтрацию почты, анализ контента и DNS-трафика).

Заключение

Фишинг — ключевая угроза, и традиционные методы защиты не успевают за скоростью изменения атак. Нейросетевые модели (CNN

LSTM/BiLSTM, GRU, DNN и гибриды) демонстрируют высокую точность при анализе URL, сайтов, писем и доменов и часто превосходят классические ML-алгоритмы, особенно при работе с “сырыми” строками и/или большими объёмами данных. Для сценариев с фиксированными признаками URL практичны MLP и другие модели по табличным данным, обеспечивающие высокое качество при умеренной стоимости вычислений.

Перспективы развития включают: расширение и регулярное обновление датасетов (в т.ч. многоязычных), развитие методов отбора интерпретируемых признаков, повышение устойчивости к адаптивным атакам и внедрение моделей в комплексные системы мониторинга и реагирования в реальном времени.