Сравнительный анализ нейросетевых моделей для задачи обнаружения беспилотных летательных аппаратов

Автор: Вычегжанин Сергей Владимирович, Татаринова Александра Геннадьевна, Мышкин Роман Евгеньевич

Журнал: Компьютерная оптика @computer-optics

Рубрика: Численные методы и анализ данных

Статья в выпуске: 2 т.50, 2026 года.

Бесплатный доступ

В статье проведен сравнительный анализ моделей YOLO и вариантов их тонкой настройки для задачи обнаружения беспилотных летательных аппаратов в реальном времени. Представлены оценки качества и вычислительной производительности различных семейств моделей от YOLOv3 до YOLO12 и версий от нано- до сверхбольшой. Проанализированы их преимущества и недостатки на основе широкого спектра мер, включая точность, полноту, F1-меру, среднюю точность, время вывода и размер модели. Исследованы варианты тонкой настройки предварительно обученных на корпусе CommonObjectsinContextмоделей при разных разрешениях входных изображений и скорости обучения. Выполнен анализ ошибок обнаружения беспилотных летательных аппаратов малых размеров в сложных условиях с использованием специализированных наборов данных. Исследование показало, что семейство YOLO11 является оптимальным по совокупности оцениваемых параметров, обеспечивая баланс между качеством и вычислительной производительностью. Наиболее высокие оценки качества обнаружения беспилотных летательных аппаратов на тестовом наборе данных были получены с использованием тонко настроенной модели yolo11m с увеличенным разрешением входных изображений и достигли значений F1 = 0,970, AP50 = 0,981, AP50-95 = 0,765.

Обработка изображений, обнаружение объектов, нейросетевые алгоритмы, глубокое обучение, трансферное обучение

Короткий адрес: https://sciup.org/140314853

IDR: 140314853   |   DOI: 10.18287/COJ1728

Comparative analysis of neural network models for detecting unmanned aerial vehicles

The paper presents a comparative analysis of YOLO models and their fine-tuning options for the task of real-time unmanned aerial vehicles detection. The quality and computational performance of different model families from YOLOv3 to YOLO12 and versions ranging from nano to extra-large are estimated. Their advantages and disadvantages are analyzed based on a wide range of measures, including precision, recall, F1-measure, average precision, inference time, and model size. Fine-tuning options for pre-trained models trained on the Common Objects in Context dataset are investigated for different input image resolutions and learning rates. We analyze detection errors of small unmanned aerial vehicles in complex environments using specialized datasets. The study showed that the YOLO11 family is the optimal in terms of the set of evaluated parameters, providing a balance between quality and computational performance. The highest quality scores for unmanned aerial vehicles detection on the test dataset were obtained using the fine-tuned yolo11m model with increased input image resolution and achieved values of F1=0.970, AP50=0.981, AP50-95=0.765.

Текст научной статьи Сравнительный анализ нейросетевых моделей для задачи обнаружения беспилотных летательных аппаратов

Беспилотные летательные аппараты (БПЛА), или дроны, стали неотъемлемой частью современной жизни благодаря своей универсальности, низкой стоимости и способности выполнять задачи в труднодоступных или опасных для человека условиях. Дроны широко используются в различных гражданских и коммерческих приложениях, таких как доставка товаров [1], наблюдение за окружающей средой [2], сельскохозяйственные работы [3], предотвращение стихийных бедствий [4], фотосъемка [5], мониторинг инфраструктуры [6].

Однако широкое распространение дронов сопровождается ростом инцидентов, связанных с их неправомерным использованием. Дроны способны переносить взрывчатые вещества или химическое оружие и могут быть запущены в критически важные зоны или места скопления людей с целью причинения вреда [4]. Дроны применяются для отправки запрещенных веществ и предметов, таких как мобильные телефоны, в тюрьмы [7]. Шпионские дроны используются для сбора конфиденциальной информации [4]. Эти инциденты подчеркивают необходимость разработки эффективных систем обнаружения и борьбы с дронами, способных функционировать в реальном времени и обеспечивать высокую точность и надежность.

Существует четыре метода обнаружения дронов. Радиолокационный метод позволяет обнаруживать дроны на значительных расстояниях, особенно в условиях плохой видимости, но может быть неэффективен при обнаружении небольших и низколетящих объектов, а также дорогостоящим в эксплуатации. Радиочастотный мониторинг позволяет обнаруживать сигналы каналов управления дронами, однако не способен обнаружить автономные дроны или дроны, использующие нестандартные частоты. Акустический метод обнаруживает дроны по их характерным звуковым сигнатурам и может определять звуки, излучаемые дронами, на расстояниях, превышающих дистанции достоверного визуального обнаружения, однако его эффективность снижается для обнаружения дронов в шумной среде или на большом расстоянии. Визуальный метод с использованием систем видеонаблюдения обеспечивает недорогое обнаружение и точное отслеживание дронов, но имеет ограниченную дальность обнаружения и чувствителен к погодным условиям и освещению.

Визуальное обнаружение дронов на основе компьютерного зрения представляет собой многообещающий подход. Использование данных с видеокамер позволяет обнаруживать дроны в режиме реального времени. Преимуществами компьютерного зрения являются возможность интеграции с существующей инфраструктурой видеонаблюдения и относительная доступность оборудования по сравнению, например, с передовыми радиолокационными системами. Системы компьютерного зрения могут использовать различные типы камер, включая тепловизионные и мультиспектральные, что позволяет обнаруживать дроны в различных условиях.

Сверточные нейронные сети являются одними из наиболее значимых моделей для обнаружения и категоризации объектов на изображениях и в видеопоследовательностях. Популярным представителем моделей данного типа является YOLO (You Only Look Once). Он был специально разработан для преодоления проблем, связанных со скоростью вывода, при сохранении конкурентоспособной точности. Это достигается путем одновременного выполнения определения ограничивающей рамки и классификации объектов на одном этапе. Исследования показывают, что YOLO эффективно работает в реальном времени и способен обнаруживать небольшие объекты, такие как дроны, с высокой точностью. Однако, несмотря на прогресс в области глубокого обучения, задачи обнаружения дронов остаются сложными из-за малого размера объектов, их высокой скорости перемещения и вариативности фона. Поэтому дальнейшее исследование моделей YOLO для специфических задач обнаружения дронов представляет собой актуальную научно-практическую задачу.

Целью работы является экспериментальное исследование разных версий моделей YOLO и вариантов их тонкой настройки для обнаружения объектов на изображениях. Объектами интереса являются дроны, т.е. решается задача одноклассового обнаружения.

Статья построена следующим образом. В параграфе 1 представлен обзор работ по данной тематике. В параграфе 2 приводится описание набора данных, используемого для обучения и тестирования нейросетевых моделей. В параграфе 3 описан метод решения задачи обнаружения БПЛА. В параграфе 4 перечислены модели YOLO, используемые в экспериментах. В параграфе 5 приведены программные и аппаратные настройки. В параграфе 6 описаны меры, используемые для оценки производительности моделей. В параграфе 7 проанализированы результаты экспериментов. Заключение содержит выводы.

1.    Обзор публикаций по тематике работы

Многочисленные работы по разработке и совершенствованию методов обнаружения дронов обуславливают высокую степень важности исследований в данном направлении. Среди методов визуального обнаружения выделяют традиционные алгоритмы машинного обучения [8, 9], сиамскую сеть [10 – 12], трансформер [13, 14], YOLO [15 – 19]. Эти методы в основном применяются в естественных и инфракрасных сценах.

Исследования показывают, что методы на основе традиционных алгоритмов машинного обучения применимы только для обнаружения объектов одного типа в простых наборах данных. Методы на основе сиамских сетей хорошо подходят для отслеживания одной цели в реальном времени. Методы на основе трансформера эффективны в обработке сложных сцен и захвате долгосрочных зависимостей. Методы на основе YOLO характеризуются балансом скорости и точности, подходящими для обнаружения и отслеживания объектов в реальном времени. В настоящей работе выбор был сделан в пользу YOLO вследствие ее лучших характеристик для работы в реальном времени.

Архитектура YOLO в настоящее время имеет 12 версий, которые активно исследуются научным сообществом. Широкое разнообразие и неоднозначность поведения моделей YOLO в разных условиях требует большого объема экспериментальной работы для выбора оптимальной модели перед практическим применением. Существует ряд работ по анализу YOLO для идентификации различных объектов и событий, в том числе дронов [15 – 19]. В статье [15] анализируются 6 архитектур YOLO с v5 по v11 применительно к задаче обнаружения дефектов дорожного покрытия на изображениях, полученных с БПЛА. Авторы отмечают, что YOLOv5-l и v9-c обеспечивают наилучшую точность, а YOLOv11-n является наиболее эффективной по совокупности точности, размера модели и вычислительной сложности. В исследовании [16] проводится сравнение десяти моделей YOLOv5 и пяти моделей YOLOv8 при решении задачи обнаружения средств индивидуальной защиты на строительных площадках. Наиболее точной оказалась модель YOLOv8-m, достигшая mAP50=92%.

В статье [17] представлен комплексный сравнительный анализ эффективности моделей YOLOv5, YOLOv8 и YOLOv8 DeepSORT в области обнаружения и отслеживания БПЛА. Авторы показали, что модели YOLOv8 демонстрируют более высокую точность и частоту кадров в секунду (FPS) по сравнению с YOLOv5. В работе

  • [18]    анализируется YOLOv9 в сравнении с версиями v3, v4, v5 и v8 для обнаружения БПЛА. По результатам экспериментов данная сеть превосходит по точности все предыдущие версии, достигая mAP50=95,7%.

  • 2.    Набор данных

Исследование [19] сравнивает версии YOLOv5 и YOLOv7 для обнаружения небольших БПЛА. Результаты показывают, что YOLOv5 лучше работает на изображениях с коррекцией цвета, а YOLOv7 – на изображениях с исходными цветами. Анализ различных расстояний показывает, что YOLOv5 демонстрирует хорошую точность обнаружения на близком, среднем и дальнем расстоянии, особенно на сложных фонах, а YOLOv7, наоборот, показывает низкую точность обнаружения в сценариях с дальними расстояниями и сложными фонами.

Вклад настоящей статьи состоит в следующем: 1) выполнено комплексное сравнение семейств моделей от YOLOv3 до YOLO12 и версий от нано- до сверхбольшой; 2) проведена оценка качества и вычислительной производительности моделей YOLO для обнаружения БПЛА на изображениях; 3) проанализированы преимущества и недостатки моделей на основе широкого спектра мер, включая точность, полноту, время вывода, время обучения и размер модели; 4) сформирован тестовый набор данных с реальными условиями видеонаблюдения, предполагающих наличие в кадре птиц, деревьев и объектов городской инфраструктуры; 5) проведено исследование, направленное на повышение точности работы моделей в режиме реального времени.

В качестве обучающего набора данных использовался DUT Anti-UAV [20], содержащий изображения с разрешением от 240 x 160 до 5616 x 3744 пкс с одним классом объектов «дрон» в сложных сценариях обнаружения. Набор данных состоит из 10000 изображений, разделенных на обучающую, проверочную и тестовую выборки.

Дополнительно в данной работе был сформирован небольшой тестовый набор данных Custom, содержащий 100 случайно выбранных изображений с дронами из тестовой выборки DUT Anti-UAV и 100 сделанных авторами фотографий городского ландшафта с разрешением от 1024 x 768 до 1920 x 1080 пкс. Этот набор создан с целью оценки качества работы моделей, обученных на общедоступном наборе данных, в реальных условиях видеонаблюдения, когда в кадре могут быть птицы, деревья и различные объекты городской инфраструктуры: здания, опоры линий электропередач, строительные краны и пр. Распределение изображений и дронов в наборах данных приведено в табл. 1.

Табл. 1. Количество изображений и дронов в наборах данных

Выборка

DUT Anti-UAV

Custom

Количество изображений

Количество дронов

Количество изображений

Количество дронов

Обучающая

5200

5243

Проверочная

2600

2621

Тестовая

2200

2245

200

102

На рис. 1 представлено распределение площадей рамок, ограничивающих дроны, на изображениях в DUT Anti-UAV. В наборе данных преобладают изображения с малоразмерными дронами площадью в интервале (400; 900] (~25 x 25) пкс.

Рис. 1. Распределение площадей дронов на изображениях в DUT Anti-UAV

3.    Метод обнаружения объектов

Модели семейства YOLO предоставляются с предобученными весами, полученными на наборе данных COCO [21]. Данный набор содержит разметку для 80 классов объектов, включая классы «самолёт» (airplane) и «птица» (bird), объекты которых могут быть визуально схожи с БПЛА. Это способствует эффективной инициализации модели при тонкой настройке (fine-tuning) на специализированном наборе данных с изображениями БПЛА, которая актуальна для задачи одноклассового обнаружения объектов [22, 23] и позволяет избежать ресурсоемкого обучения с нуля.

Важным аспектом является выбор гиперпараметров тонкой настройки моделей, а также параметров предобработки и аугментации данных. Значения некоторых гиперапарметров, таких как размер батча, зависят от количества весов обучаемой модели и объема доступной видеопамяти GPU, и в большей степени оказывают влияние на время обучения. Другие гиперпараметры, например, такие как скорость обучения (leaning rate) и алгоритм оптимизации, управляют изменением весов модели при обучении.

В библиотеке Ultralytics скорость обучения по умолчанию равна 0,01 [24]. Учитывая наличие похожих классов на этапе предобучения, предлагается снизить скорость обучения при тонкой настройке до 0,0001, чтобы уменьшить влияние эффекта «катастрофического забывания» на формирующие полезные признаки веса, полученные на этапе предобучения.

Наиболее трудные случаи обнаружения БПЛА представляют объекты небольших размеров, поэтому предлагается увеличить параметр, отвечающий за масштабирование входных изображений с разрешения 640 x 640 до 1024 x 1024, что увеличит время обучения и вывода, а также объем требуемой видеопамяти, но улучшит детекцию деталей на изображениях.

Параметры аугментации данных, связанные с расширением цветового пространства и геометрическими преобразованиями, будут использоваться со значениями по умолчанию, так как эксперименты в этом направлении не показали прироста в качестве обнаружения.

Таким образом, далее экспериментально исследуются следующие варианты тонкой настройки на специализированном наборе данных для обнаружения БПЛА моделей семейства YOLO, предобученных на наборе данных COCO:

  • 1)    тонкая настройка по умолчанию (FTdefault);

  • 2)    тонкая настройка с уменьшенной скоростью обучения и увеличенным масштабированием входных изображений (FTcustom).

  • 4.    Модели 5.    Программные и аппаратные настройки

Экспериментальное исследование проведено для 20 версий моделей из 7 семейств YOLO, перечисленных в табл. 2 и имеющих предварительно обученные веса на наборе данных COCO. Суффикс в названии модели указывает на ее версию: «n» – нано, «m» – средняя, «x» – сверхбольшая, «t» – крошечная, «e» – расширенная.

Табл. 2. Семейства и версии моделей YOLO

Семейство

Версия

Нано

Средняя

Сверхбольшая

YOLOv3u

YOLOv3u-tiny

YOLOv3u

YOLOv5u

YOLOv5un

YOLOv5um

YOLOv5ux

YOLOv8

YOLOv8n

YOLOv8m

YOLOv8x

YOLOv9

YOLOv9t

YOLOv9m

YOLOv9e

YOLOv10

YOLOv10n

YOLOv10m

YOLOv10x

YOLO11

YOLO11n

YOLO11m

YOLO11x

YOLO12

YOLO12n

YOLO12m

YOLO12x

Реализация алгоритмов взята из библиотеки Ultralytics [24], предоставляющей исследователям и программистам модели YOLO и функции по их обучению, валидации, выводу и экспорту. Следует отметить, что данная библиотека не поддерживает модели YOLOv1, YOLOv2, YOLOv4 и YOLOv7, а для модели YOLOv6 не предоставляет предобученные на COCO веса, поэтому эти модели не использовались в экспериментах.

Обучение моделей выполнялось в облачной вычислительной среде на платформе Kaggle на двух графических ускорителях NVidia Tesla T4 16 Gb с CUDA 12.6, Python 3.10.12 и Ultralytics 8.3.98. При обучении всех версий YOLO использовались значения параметров, приведенные в табл. 3. Размер батча принимался равным 8, 16 или 64 при параметрах по умолчанию, а при улучшенных параметрах 4 – 8, 16 и 32 соответственно, учитывая версию модели и максимальную загрузку памяти графического ускорителя. Значения параметров аугментации данных принимались по умолчанию: hsv_h = 0,015, hsv_s = 0,7, hsv_v = 0,4, degrees = 0,0, translate = 0,1, scale = 0,5, shear = 0,0, perspective = 0,0, flipud = 0,0, fliplr = 0,5, bgr = 0,0, mosaic = 1,0, mixup = 0,0, copy_paste = 0,0.

Табл. 3. Значения параметров обучения

Параметр

Значение

FT default

FT custom

Количество эпох

50

50

Оптимизатор

AdamW

AdamW

Размер батча

64 для n , t , 16 для m , 8 для x , e версий

32 для n , t , 16 для m , 4 – 8 для x , e версий

Размер изображения

(640, 640)

(1024, 1024)

Начальная скорость обучения и финальная доля скорости обучения

(0,01, 0,01)

(0,0001, 0,0001)

Аугментация данных

по умолчанию

по умолчанию

6. Оценка производительности

Оценка моделей YOLO и вариантов тонкой настройки осуществлялась с помощью мер качества, вычислительной производительности и размера. К мерам качества относятся:

  •    точность (precision) - определяет долю объектов, действительно принадлежащих данному классу, относительно всех объектов, которые модель отнесла к этому классу;

  •    полнота (recall) - определяет, какую долю всех экземпляров объектов данного класса модель предсказала верно;

  •    Fl-мера (F1) - представляет собой гармоническое среднее между точностью и полнотой;

  •    средняя точность (AP) - определяется как площадь под кривой precision - recall; обычно вычисляется при значении порога перекрытия между реальной и предсказанной ограничивающей рамкой (Intersection over Union, IoU), равного 0,5 (AP50) или варьирующегося от 0,5 до 0,95 с шагом 0,05 (AP50-95).

  • 7.    Анализ результатов

Вычислительная производительность определяется временем вывода модели, т.е. временем, которое требуется модели для обработки входных данных и генерации предсказаний, и количеством кадров в секунду (FPS). Мерами размера являются занимаемый моделью объем дискового пространства и количество параметров модели.

Оценки качества, вычислительной производительности и размера моделей представлены в Приложении А (табл. 4 и 5). Значения AP50, AP50-95 и F1-меры приведены для модели YOLO:

  • 1)    предобученной на наборе COCO оригинальной (Base), относящей дрон к классу «самолет»;

  • 2)    дообученной с параметрами по умолчанию (FT default );

  • 3)    дообученной с уменьшенной скоростью обучения и увеличенным масштабированием входных изображений (FT custom ).

  • 7.1.    Анализ качества

Результаты, представленные в Приложении А (табл. 4 и 5), показывают, что уменьшение скорости обучения и увеличение масштаба изображения дает ощутимый прирост качества обнаружения объектов небольших размеров: на тестовой выборке DUT Anti-UAV на 3,4– 12 п.п. по F1-мере и 7,0– 14,5 п.п. по AP50, на корпусе Custom на 1,3– 14,8 п.п. по F1-мере и 4,3– 15,9 п.п. по AP50. В сравнении с оригинальной моделью на тестовой выборке DUT Anti-UAV среднее значение F1-меры после FT default повысилось на 36,0 п.п., а после FT custom – на 42,3 п.п., на корпусе Custom – на 36,2 и 44,6 п.п. соответственно.

Рис. 2, построенный для наилучшего по качеству варианта тонкой настройки FT custom , демонстрирует, что на тестовой выборке DUT Anti-UAV самые высокие оценки AP50 = 0,982 и AP50-95 = 0,775 получила yolov9e, а наименьшие оценки AP50 = 0,897 и AP50-95 = 0,608 у yolov3u-tiny. На корпусе Custom результаты аналогичны. Значительный разрыв между значениями AP50 и AP50-95 свидетельствует о том, что модели испытывают трудности с обработкой дронов разных размеров при более высоких пороговых значениях IoU, что является потенциальным направлением улучшения алгоритмов для данной задачи.

Модели YOLO

Рис. 2. Средняя точность для варианта FT custom

Рис. 3 демонстрирует компромисс между точностью и полнотой на тестовой выборке DUT Anti-UAV с учетом размера моделей. Наномодели наиболее сильно выделяются из общей массы, по обоим мерам уступая средним и сверхбольшим моделям. Лидером оказалась yolov11m, достигая F1-меры, равной 0,970. За ней следуют yolov8x и yolov9e со значением F1-меры, равным 0,968.

Анализ результатов двух вариантов тонкой настройки FT default и FT custom (рис. 4) показывает, что увеличение масштаба входного изображения увеличивает время обучения моделей: сверхбольших в 2,5 раза (3,3 раза для yolo12x), средних в 2,2 раза (3,3 раза для yolo12m), нано в 2 раза (2,2 раза для yolo12n). При этом повышается F1-мера для моделей: сверхбольших на 4,5–12,0 п.п., средних на 3,4–5,3 п.п., нано на 5,2–12,0 п.п. на тестовой выборке DUT Anti-UAV. Также повышается средняя точность AP50-95 моделей: сверхбольших на 8,2–16,5 п.п., средних на 7,0–10,3 п.п., нано на 7,7–14,5 п.п.

Таким образом, увеличение разрешения входных изображений повышает точность обнаружения малых объектов в сложных случаях, однако требует повышенных вычислительных затрат как в процессе обучения, так и в процессе вывода модели.

Рис. 3. Точность и полнота с учетом размера моделей

  • 7.2.    Анализ вычислительной производительности и размера

    На рис. 5 представлено время вывода и размер моделей. Самая быстрая модель yolov3u-tiny имеет время вывода 8,5 мс (FPS = 118) при обработке изображений с разрешением 1024 x 1024, а самая медленная yolov3u -117,8 мс (FPS = 8). Сверхбольшие модели оказались слишком тяжелыми для работы в реальном времени на графическом ускорителе NVidia Tesla T4, достигая значений FPS от 8 до 14. Средняя скорость вывода, вычисленная для каждого семейства YOLO, показывает, что YOLOv10 является самым энергоэффективным (40,8 мс) и в среднем занимает наименьший объем дискового пространства (33 Мб), а YOLOv3 – самым энергозатратным (63,2 мс) и тяжелым (110,8 Мб).

  • 7.2.    Анализ вычислительной производительности и размера

    На рис. 5 представлено время вывода и размер моделей. Самая быстрая модель yolov3u-tiny имеет время вывода 8,5 мс (FPS = 118) при обработке изображений с разрешением 1024 x 1024, а самая медленная yolov3u -117,8 мс (FPS = 8). Сверхбольшие модели оказались слишком тяжелыми для работы в реальном времени на графическом ускорителе NVidia Tesla T4, достигая значений FPS от 8 до 14. Средняя скорость вывода, вычисленная для каждого семейства YOLO, показывает, что YOLOv10 является самым энергоэффективным (40,8 мс) и в среднем занимает наименьший объем дискового пространства (33 Мб), а YOLOv3 – самым энергозатратным (63,2 мс) и тяжелым (110,8 Мб).

  • 7.3.    Анализ ошибок обнаружения объектов

Рис. 4. F1-мера, AP50-95 и время обучения для вариантов FT default и FT custom

Таким образом, увеличение разрешения входных изображений повышает точность обнаружения малых объектов в сложных случаях, однако требует повышенных вычислительных затрат как в процессе обучения, так и в процессе вывода модели.

После тонкой настройки как с параметрами по умолчанию, так и при сниженной скорости обучения и увеличенном разрешении входных изображений модели демонстрируют высокие показатели мер качества на проверочной и тестовой выборках набора данных DUT Anti-UAV, описанного в параграфе 2. При этом наилучший баланс качества и вычислительных затрат показывают модели среднего размера, например, тонко настроенная модель yolo11m.

Однако использование моделей в условиях, приближенных к реальным, часто связано с тем, что на вход поступают изображения без объектов БПЛА, но с объектами, визуально похожими на них – например, птицами, элементами фасадов зданий, облаками и т.д. В результате этого часто возникают ложные срабатывания, при которых модель ошибочно обнаруживает БПЛА. Для проверки качества детекции моделей в таких ситуациях подготовлен тестовый набор данных Custom, описанный в параграфе 2. Полученные оценки качества детекции показывают, что тонкая настройка с подобранными параметрами позволяет получить модели, более устойчивые к ложным срабатываниям. На рис. 6 приведены примеры сложных изображений, на которых модель yolo11m, тонко настроенная при параметрах по умолчанию, ложно обнаруживает БПЛА (рис. 6а), а модель yolo11m, тонко обученная при параметрах, приведённых в параграфах 3 и 5, демонстрирует большую устойчивость к ложным срабатываниям (рис. 6б).

Рис. 6. Примеры работы модели, тонко настроенной (a) при параметрах по умолчанию, (б) при подобранных параметрах

Рис. 5. Время вывода и размер моделей

  • 7.4.    Анализ общей производительности

Модели YOLO11 обеспечивают наилучший компромисс между качеством, скоростью вывода, объемом занимаемого дискового пространства и временем обучения. Они имеют надежную производительность при различных пороговых значениях IoU и размерах объектов. Это объясняется использованием в их архитектуре модуля перекрестной частичной сети с внутренним вниманием (C2PSA) для сохранения контекстной информации, что приводит к улучшению сходимости и общей производительности. Модели YOLO12, имея сопоставимый размер с моделями YOLO11, могут обеспечить более высокую точность, обусловленную сложными архитектурными решениями, включая модуль внимания области (Area Attention Module), остаточные эффективные агрегационные сети (R-ELAN) и алгоритм FlashAttention, но значительно снижают вычислительную производительность.

Наномодели демонстрируют достаточно высокий уровень точности обнаружения дронов, имея минимальное время вывода и размеры. Они являются лучшим решением для низкопроизводительных и экономичных систем видеоаналитики. Такие модели способны эффективно работать в реальном времени на CPU, не требуя высокопроизводительных графических ускорителей.

Заключение

Проведено комплексное сравнительное исследование производительности различных алгоритмов YOLO и двух вариантов их тонкой настройки для решения задачи обнаружения БПЛА. Продемонстрированы сильные и слабые стороны каждой версии и семейства YOLO на основе анализа качества, вычислительной производительности и размера с использованием набора мер, таких как точность, полнота, F1-мера, средняя точность, время вывода, FPS, количество параметров и размер модели. Оптимальный баланс по совокупности оцениваемых параметров имеет семейство YOLO11. Наиболее инновационное и сложное по архитектуре семейство YOLO12 продемонстрировало сопоставимую точность, но низкую вычислительную производительность. С использованием сформированного в настоящей работе набора изображений с реальными условиями видеонаблюдения показано, что уменьшение скорости обучения и увеличение разрешения входных изображений при тонкой настройке моделей позволяет существенно повысить качество обнаружения небольших объектов в сложных условиях.