Информатика и автоматизация (Труды СПИИРАН) @ia-spcras
Статьи журнала - Информатика и автоматизация (Труды СПИИРАН)
Все статьи: 332
Статья
В интернете «фейковые новости» - это распространенное явление, которое часто беспокоит общество, поскольку содержит заведомо ложную информацию. Проблема активно исследовалась с использованием обучения с учителем для автоматического обнаружения фейковых новостей. Хотя точность растет, она по-прежнему ограничивается идентификацией ложной информации через каналы на социальных платформах. Это исследование направлено на повышение надежности обнаружения фейковых новостей на платформах социальных сетей путем изучения новостей с неизвестных доменов. Особенно трудно обнаружить и предотвратить распространение информации в социальных сетях во Вьетнаме, потому что все имеют равные права на использование интернета для разных целей. Эти люди имеют доступ к нескольким платформам социальных сетей. Любой пользователь может публиковать или распространять новости через онлайн-платформы. Эти платформы не пытаются проверять пользователей, их местоположение или содержимое их новостей. В результате некоторые пользователи пытаются распространять через эти платформы фейковые новости для пропаганды против отдельного лица, общества, организации или политической партии. Мы предложили проанализировать и разработать модель распознавания фейковых новостей с использованием глубокого обучения (называемого AAFNDL). Метод выполнения работы: 1) во-первых, анализируем существующие методы, такие как представление двунаправленного кодировщика от преобразователя (BERT); 2) приступаем к построению модели для оценки; 3) подходим к применению некоторых современных методов к модели, таких как метод глубокого обучения, метод классификатора и т.д., для классификации ложной информации. Эксперименты показывают, что наш метод может улучшить результаты на 8,72% по сравнению с другими методами.
Бесплатно
ADA-NAF: Полуконтролируемое обнаружение аномалий на основе нейронного леса внимания
Статья
В этом исследовании мы представляем новую модель под названием ADA-NAF (автоэнкодер обнаружения аномалий с нейронным лесом внимания) для полуконтролируемого обнаружения аномалий, которая уникальным образом интегрирует архитектуру нейронного леса внимания (NAF), которая была разработана для объединения случайного классификатора леса с нейронной сетью, вычисляющей веса внимания для агрегации прогнозов дерева решений. Ключевая идея ADA-NAF заключается в включении NAF в структуру автоэнкодера, где он реализует функции компрессора, а также реконструктора входных векторов. Наш подход представляет несколько технических достижений. Во-первых, предлагаемая сквозная методология обучения по обычным данным, которая минимизирует ошибки реконструкции при обучении и оптимизации нейронных весов внимания для фокусировки на скрытых признаках. Во-вторых, новый механизм кодирования, который использует иерархическую структуру NAF для захвата сложных шаблонов данных. В-третьих, адаптивная структура оценки аномалий, которая объединяет ошибки реконструкции с важностью признаков на основе внимания. Благодаря обширным экспериментам с различными наборами данных ADA-NAF демонстрирует превосходную производительность по сравнению с современными методами. Модель демонстрирует особую силу в обработке многомерных данных и выявлении тонких аномалий, которые традиционные методы часто не обнаруживают. Наши результаты подтверждают эффективность и универсальность ADA-NAF как надежного решения для реальных задач обнаружения аномалий с перспективными приложениями в кибербезопасности, промышленном мониторинге и диагностике здравоохранения. Эта работа продвигает эту область, представляя новую архитектуру, которая сочетает в себе интерпретируемость механизмов внимания с мощными возможностями обучения признакам автоэнкодеров.
Бесплатно
CLVM: гибридная модель глубокого обучения для бесконтактного управления виртуальной мышью
Статья
В эпоху стремительной цифровой трансформации и растущего распространения искусственного интеллекта обеспечение естественного, непрерывного и бесконтактного человеко-компьютерного взаимодействия приобретает первостепенное значение для различных областей. Данная работа представляет новую модель на базе глубокого обучения для управления виртуальной мышью посредством жестов, получившая название CLVM (CNN-LSTM Virtual Mouse). Разработанная система основывается на гибридной архитектуре, интегрирующей три мощных компонента: (1) MediaPipe – для высокоэффективной детекции ключевых ориентиров кисти в режиме реального времени; (2) сверточную нейронную сеть (CNN) – для извлечения пространственных признаков; (3) сеть долгой краткосрочной памяти (LSTM) – для моделирования временной динамики, что существенно повышает точность и непрерывность распознавания жестов во временной последовательности. В отличие от традиционных подходов, модель CLVM разработана для сохранения высокой производительности в условиях реальной среды, особенно при неравномерном освещении и наличии загроможденного фона. Система характеризуется низкой задержкой и высокой скоростью отклика, а также возможностью эффективного функционирования на устройствах с ограниченными ресурсами, что обуславливает ее пригодность для широкого практического применения. Результаты экспериментов демонстрируют, что CLVM достигает высокой точности (99,88%) при снижении потерь до 0,38, значительно превосходя по эффективности традиционные методы распознавания жестов. Полученные данные подчеркивают потенциал CLVM как надежного, масштабируемого и эффективного решения для организации естественного взаимодействия на основе жестов, представляя собой важный шаг вперед в разработке интеллектуальных, удобных для пользователя интерфейсов для бесконтактного управления.
Бесплатно
Статья
Описываемые в статье исследования направлены на развитие методов составления расписаний. Принципиальным недостатком существующих методов смешано- целочисленного линейного программирования в применении к рассматриваемым задачам является то, что они слишком требовательны к объемам оперативной памяти. Сложность же применения процедур локального поиска к подобным задачам высокой размерности состоит в разработке эффективного способа нахождения приемлемого первоначального приближения и определении функции перехода в соседнее состояние, которая бы позволила достаточно быстро достичь оптимума. В теории исследования операций добавление к задаче дополнительных условий может привести к принципиальному изменению используемой схемы решения задачи. Предлагаемые в статье методы реализованы в рамках парадигмы программирования в ограничениях, что позволяет более экономно с точки зрения оперативной памяти представлять зависимости предметной области, а также обеспечивает возможность поэтапного учета разнородных условий задачи без принципиального изменения схемы поиска решений. Существенная часть исследований посвящена использованию методов логического вывода на ограничениях для снижения размерности пространства поиска и ускорения процесса вычислений. Подход к составлению расписаний проиллюстрирован на задаче оптимизации планирования открытых горных работ, которую впервые предложено решать как задачу удовлетворения ограничений. Для нахождения первого допустимого решения предложен метод «жадного» поиска, результат применения которого затем может быть улучшен с помощью разработанного гибридного метода. Оба метода опираются на оригинальные процедуры вывода на ограничениях. Предложенный подход доказал свою эффективность для блочных моделей размерностью в десятки и сотни тысяч блоков.
Бесплатно
EWT-CGAN аугментация данных измерительных систем
Статья
В статье представлен новый метод аугментации данных измерительных систем, разработанный для задач мониторинга состояния промышленного оборудования. Актуальность исследования обусловлена существенными ограничениями традиционных методов генерации синтетических данных, которые не способны адекватно воспроизводить сложные нестационарные сигналы с характерными переходными процессами, трендами и сезонными вариациями, наблюдаемыми в реальных промышленных условиях. Предложенный метод основан на интеграции двух современных методов: эмпирического вейвлет-преобразования (EWT) и условных генеративных состязательных сетей (Conditional GAN). Метод реализуется в три этапа: (1) адаптивная декомпозиция исходных сигналов на моды с помощью EWT, (2) категоризация мод с присвоением меток, (3) генерация синтетических данных с использованием Conditional GAN. Для комплексной оценки качества синтезированных сигналов применялся набор статистических метрик, включая расстояние Wasserstein (WS), коэффициент корреляции Пирсона (PCC) и среднеквадратическую ошибку (RMSE). Экспериментальные исследования проводились на реальных данных температурного датчика, работающего в условиях нестационарных режимов промышленного оборудования. Результаты демонстрируют значительное преимущество предложенного метода по сравнению с традиционным подходом timeGAN: снижение расстояния Wasserstein на 17%, увеличение коэффициента корреляции Пирсона на 57% и уменьшение среднеквадратической ошибки на 21%. Полученные данные свидетельствуют об эффективности метода в воспроизведении ключевых характеристик исходных сигналов. Разработанный метод позволяет создавать набор синтетических данных, необходимых для обучения современных нейросетевых моделей диагностики промышленного оборудования. Его практическое применение позволяет существенно сократить затраты на сбор экспериментальных данных, обеспечивая высокое качество синтезированных сигналов, что подтверждено статистическими метриками.
Бесплатно
H-Detect: алгоритм раннего выявления гидроцефалии
Статья
Гидроцефалия - это заболевание центральной нервной системы, которое чаще всего поражает младенцев и детей ясельного возраста. Оно начинается с аномального накопления спинномозговой жидкости в желудочковой системе головного мозга. Следовательно, жизненно важной становится ранняя диагностика, которая может быть выполнена с помощью компьютерной томографии (КТ), одного из наиболее эффективных методов диагностики гидроцефалии (КТ), при котором становится очевидным увеличение желудочковой системы. Однако большинство оценок прогрессирования заболевания основаны на оценке рентгенолога и физических показателях, которые являются субъективными, отнимающими много времени и неточными. В этой статье разрабатывается автоматическое прогнозирование с использованием фреймворка H-detect для повышения точности прогнозирования гидроцефалии. В этой статье используется этап предварительной обработки для нормализации входного изображения и удаления нежелательных шумов, что может помочь легко извлечь ценные признаки. Выделение признаков осуществляется путем сегментации изображения на основе определения границ с использованием треугольных нечетких правил. Таким образом, выделяется точная информация о природе ликвора внутри мозга. Эти сегментированные изображения сохраняются и снова передаются алгоритму CatBoost. Обработка категориальных признаков позволяет ускорить обучение. При необходимости детектор переобучения останавливает обучение модели и, таким образом, эффективно прогнозирует гидроцефалию. Результаты демонстрируют, что новая стратегия H-detect превосходит традиционные подходы.
Бесплатно
Статья
Мониторинг состояния дорожного покрытия является важной задачей, направленной на повышение безопасности дорожного движения и оптимизацию обслуживания транспортной инфраструктуры. В настоящей работе разработана инерциальная IoT-система, предназначенная для классификации типов дорожного покрытия в режиме реального времени, обнаружения выбоин и повышения точности оценки местоположения транспортного средства. Предложенная система включает модель XGBoost, адаптированную для развертывания на микроконтроллерах с ограниченным объемом памяти, алгоритм интерполяции GPS с использованием данных о скорости движения, а также метод обнаружения выбоин на основе индекса аномалий. Экспериментальная оценка проведена на собственном наборе данных и общедоступном наборе данных PVS. Достигнутая точность классификации составила 95.39% и 93.21% соответственно. Для анализа переносимости модель, обученная на собственном наборе данных, была применена к набору PVS без дополнительного обучения и обеспечила точность 92.45%, что подтверждает устойчивость предложенного подхода к смене источника данных. Применение процедуры интерполяции GPS позволило снизить среднюю ошибку локализации с 5.571-11.893 м до 1.835-3.563 м при скоростях движения транспортного средства от 20 до 50 км/ч. Дополнительным вкладом работы является публикация собственного набора данных, содержащего вибрационные сигнатуры типовых дорожных покрытий, что способствует дальнейшему развитию методов интеллектуальной классификации дорожного покрытия.
Бесплатно
Статья
В работе предложен алгоритм RainCast (Rain Rate NowCast), предназначенный для краткосрочного прогноза интенсивности осадков на срок до двух часов. Данное направление метеорологии, в англоязычной литературе получившее название «наукастинг» (nowcasting), является одним из наиболее востребованных информационных продуктов во многих сферах человеческой деятельности. Вместе с тем, его доступность может быть сильно ограничена имеющейся наземной инфраструктурой. В настоящей работе авторами поставлена цель создания алгоритма прогноза осадков, предназначенного для одной из таких территорий на примере Азиатско-Тихоокеанского регионе с использованием спутниковых измерений космического аппарата Himawari-8/9. Предложенный алгоритм объединяет преимущества детерминированного и статистического подходов к задаче прогноза и основан на использовании двух нейросетевых моделей. Первая модель осуществляет предварительный прогноз общего направления движения осадков на мезомасштабном уровне с помощью физически-обусловленной нейронной сети NowcastNet. Вторая модель на основе архитектуры CasFormer служит для постобработки полученного прогноза методом диффузий с целью повышения его детализации. Разработанный с использованием данного метода гибридный алгоритм RainCast позволяет получать краткосрочный прогноз интенсивности осадков на срок до двух часов с частотой каждые 10 минут и пространственным разрешением 2 км/пиксель на основе спутниковых измерений в инфракрасном диапазоне. Спутниковые измерения используются для расчета интенсивности осадков по ранее предложенному авторами алгоритму. На основе карт осадков сформированы обучающие, валидационные и тестовые наборы данных, применяемые для обучения, настройки алгоритма и оценки качества прогнозов соответственно. Для предложенного алгоритма RainCast, а также применяемых в мировой практике актуальных решений, таких как NowcastNet, CasFormer, Earthformer, было проведено обучение с использованием сформированных наборов данных, после чего для указанных алгоритмов был рассчитан ряд показателей качества получаемых прогнозов. Из полученных результатов можно сделать вывод, что предложенный в настоящей работе гибридный алгоритм RainCast имеет более высокое качество прогноза в сравнении с другими вышеперечисленными решениями при равных условиях. Для валидационного набора данных на территории Дальневосточного региона при прогнозе алгоритмом RainCast c заблаговременностью 2 часа были получены следующие показатели для последнего спрогнозированного кадра: корень среднеквадратической ошибки RMSE составил 0.88 мм/ч, вероятность обнаружения POD – 0.78, коэффициент корреляции Пирсона – 0.75, индекс структурного сходства SSIM – 0.91, а пиковое отношение сигнала к шуму PSNR – 36.63. Дополнительно проведенный визуальный анализ прогнозов подтвердил, что наиболее близкие к фактическим наблюдениям результаты имеет предложенный гибридный региональный алгоритм RainCast.
Бесплатно
Статья
Проблема обучения глубоких нейронных сетей на малых выборках особенно актуальна для медицинских задач. В работе рассматривается влияние попиксельной разметки значимых объектов на изображении, в дополнении к истинной метке класса, на качество решения задачи классификации. Для достижения лучших результатов классификации на малых выборках предлагается мультизадачная архитектура Unet-boosted classifier (UBC), обучаемая одновременно для решения задач классификации и семантической сегментации. В качестве исследуемого набора данных используются МРТ-снимки пациентов c доброкачественной глиомой и глиобластомой, взятые из открытого набора данных BraTS 2019. В качестве входа рассматривается один горизонтальный срез МРТ-изображения, содержащий глиому (всего 380 кадров в обучающей выборке), в качестве выхода – вероятность глиобластомы. В качестве базового решения используется ResNet34, обученный без аугментаций с функцией потерь на основе взаимной энтропии (CrossEntropyLoss). В качестве альтернативного решения используется UBC-ResNet34 – тот же ResNet34 усиленный декодером, построенным по принципу U-Net, и предсказывающим положение глиомы. В качестве дополнительной функции потерь используется сглаженный коэффициент Соренсена-Дайса (DiceLoss). Результаты на тестовой выборке: доля правильных ответов (accuracy) для базовой модели составила 0.71, для альтернативной – 0.81, коэффициент Дайса (Dice score) при этом составил 0.77. Таким образом, глубокую модель можно качественно обучить даже на небольшом наборе данных, используя предложенную архитектуру и добавив в разметку информацию о пораженных тканях в виде семантической маски. Предлагаемый подход потенциально может быть полезен и в любых других задачах классификации изображений с ограниченным набором данных.
Бесплатно
Статья
В работе рассматривается проблема автоматизации горно-экологического мониторинга объектов минерально-сырьевого комплекса с использованием данных дистанционного зондирования Земли. Обработка и анализ этих данных выполняется с целью оценки влияния процессов добычи на состояние природной среды в местах размещения горнодобывающих предприятий и прилегающих территорий. Представлен макет информационной системы, включающий модули управления данными, обработки и анализа спутниковых снимков. Для автоматизации выделения интересующих объектов горнопромышленного комплекса применяются сверточные и трансформерные модели нейронных сетей. Модели сегментации дражных отвалов, карьеров, хвостохранилищ и угольного пылевого загрязнения были обучены на подготовленных выборках, включающих размеченные спутниковые снимки исследуемых объектов в семи субъектах Российской Федерации. Предложены методы оценки влияния угольного пылевого загрязнения на растительность на основе вегетационных индексов; картирования типов леса с использованием полносвязной нейронной сети; расчета объемов дражных отвалов на основе цифровых моделей рельефа, центральной линии полигона и алгоритма построения диаграммы Вороного; и содержания тяжелых металлов в почве на основе анализа проб, отобранных за многолетний период, методами математической статистики. Сделан корреляционных анализ данных о содержании элементов в образцах почвогрунтов и воде в зоне воздействия добычи полиметаллических руд. Проведена апробация предлагаемых методов на территориях горнодобывающих предприятий Хабаровского края. Совместный анализ накопленных результатов многолетних наблюдений и актуальных данных о современном состоянии объектов природной среды позволяет прогнозировать развитие исследуемых природно-технических систем на среднесрочную перспективу.
Бесплатно
Автоматизация киберфизического мониторинга состояния пациентов в умных палатах
Статья
Цифровизация здравоохранения предполагает широкое внедрение технологий информатизации и автоматизации процессов мониторинга состояния человека, ориентированных на сохранение, укрепление и восстановление его здоровья. Для адаптации существующих решений в области электронного здравоохранения к медицинской инфраструктуре выполнено моделирование расширяемых программных компонентов автоматизированного киберфизического мониторинга состояния пациентов в умных палатах. Представлена математическая модель процессов киберфизического мониторинга состояния пациента, описывающая медицинский алгоритм как эстафету с альтернативными маршрутами с помощью аппарата параллельных полумарковских процессов. Охарактеризованы особенности программных компонентов киберфизического мониторинга состояния пациента как гибкого, расширяемого интегрируемого элемента умной медицинской палаты, позволяющего персонифицировать и оптимизировать лечебно-диагностические процедуры с помощью целевой функции, характеризующей отклонение показателей текущего состояния пациента от показателей его целевого состояния. Продемонстрированы потенциальные возможности автоматизации медицинских процессов при реализации методик диагностики и рискометрии здоровья, основанных на использовании балльных шкал. Результаты моделирования показали, что использование программных компонентов автоматизированного киберфизического мониторинга состояния пациентов в умных палатах позволяет не только ускорить расчёты, но и сократить время получения данных благодаря их автоматической загрузке из информационных систем и автоматизированному снятию показателей с медицинских устройств, открывая новые возможности персонифицированного управления оказанием стационарной медицинской помощи.
Бесплатно
Статья
В статье рассматривается применение методов интервального анализа для гарантированного решения задач прямой и обратной кинематики параллельных роботов. Кинематические системы, описываемые нелинейными уравнениями, часто имеют несколько решений, а традиционные методы (аналитические, стохастические) не гарантируют нахождения всех решений или требуют значительных аналитических преобразований. В данной работе предлагается автоматизированный подход на основе интервальных методов Кравчика и Хансена-Сенгупты для локализации всех решений системы нелинейных уравнений. Ключевые преимущества подхода – гарантированность нахождения всех решений с заданной точностью и отсутствие необходимости в аналитических преобразованиях исходной системы. В экспериментальном тестирование на ряде планарных параллельных роботов (2-RPR, DexTar, PRRRP) было показано, что оба метода могут быть успешно применены для нахождения решений задач прямой и обратной кинематики. Метод Хансена-Сенгупты показывает лучший результат как по скорости сходимости (в среднем 16 итераций против 30 у метода Кравчика), так и по времени выполнения (в среднем 0.88 мс против 1.28 мс у метода Кравчика) для исследуемых роботов.
Бесплатно
Автоматическая генерация аннотаций научных статей на основе больших языковых моделей
Статья
Предложена концепция автоматизации процесса аннотирования научных материалов (русскоязычных научных статей) и выполнена ее практическая реализация посредством технологий машинного обучения, дообучения больших языковых моделей. Обозначена актуальность корректного и рационального составления аннотаций, выделена проблематика, касающаяся установления баланса между затратами времени на аннотирование и обеспечением соблюдения ключевых требований к аннотации. Проанализированы основы аннотирования, представленные в семействе стандартов по информации, библиотечному и издательскому делу, приведены классификация аннотаций и требования к их наполнению и функционалу. Схемографически представлено существо и содержание процесса аннотирования, типовая структура объекта исследования. Проанализирован вопрос интеграции в процесс аннотирования цифровых технологий, особое внимание уделено преимуществам внедрения машинного обучения и технологий искусственного интеллекта. Кратко описан цифровой инструментарий, применяемый для генерации текста в приложениях обработки естественного языка. Отмечены его недостатки для решения поставленной в данной научной статье задачи. В исследовательской части обоснован выбор модели машинного обучения, применяемый для решения задачи условной генерации текста. Проанализированы существующие предобученные большие языковые модели и с учетом постановки задачи и имеющихся ограничений вычислительных ресурсов выбрана модель ruT5-base. Приведено описание датасета, включающего научные статьи из журналов, включенных в перечень рецензируемых научных изданий, в которых должны быть опубликованы основные научные результаты диссертаций на соискание ученых степеней кандидата и доктора наук. Охарактеризована методика разметки данных, основанная на работе токинезатора предобученной большой языковой модели, графически и таблично приведены численные характеристики распределений датасета и параметры конвейера обучения. Для оценки модели использована метрика качества ROUGE, для оценки результатов – метод экспертных оценок, включающий грамматику и логику в качестве базовых критериев. Качество автоматической генерации аннотаций сопоставимо с реальными текстами, отвечает требованиям информативности, структурированности и компактности. Статья может представлять интерес для аудитории ученых и исследователей, стремящихся оптимизировать свою научную деятельность в части интеграции в процесс написания статей инструментов цифровизации, а также специалистам, занимающимся обучением больших языковых моделей.
Бесплатно
Адаптивная параметризация метаэвристического алгоритма при размещении компонентов СБИС
Статья
В работе рассматривается задача параметризации метаэвристического алгоритма размещения компонентов сверхбольших интегральных схем (СБИС) в условиях усложняющихся топологий и ограничений современных технологических норм. Актуальность исследования обусловлена ростом размерности проектируемых схем, увеличением плотности межсоединений и усложнением структуры пространства проектных решений, что ограничивает эффективность применяемых алгоритмов со статическими параметрами. Постановка задачи включает формирование комплекса проектных метрик, таких как длина соединений, плотность, площадь размещения, индекс пересечений и другие. Фиксированная параметризация метаэвристических алгоритмов не в полной мере учитывает динамику пространства поиска, что ограничивает качество принимаемых проектных решений. На основе анализа комплекса проектных метрик предложена динамическая модель, отражающая текущее состояние поискового процесса, включая уровень структурного разнообразия популяции и признаки стагнации. С учетом предложенной модели разработана структура адаптивного метаэвристического алгоритма с замкнутым контуром параметрического управления, где выполняется корректировка параметров для согласования интенсивности глобального и локального поиска. Научная новизна заключается в оригинальной конфигурации набора метрик (скорость улучшения целевой функции δt, разнообразие популяции Dt, локальная неоднородность ландшафта поиска Ht, индикатор стагнации St) и способе их интеграции в контур параметрического управления. В отличие от ресурсоёмких нейросетевых архитектур, требующих значительных вычислительных затрат и обучающих выборок, предложенная аналитическая модель обеспечивает интерпретируемость процесса адаптации и высокую вычислительную эффективность. Для подтверждения эффективности подхода построена программная подсистема, реализующая процесс моделирования и вычислительного эксперимента. Результаты экспериментов на тестовых топологиях различной размерности и плотности связей показали, что по сравнению с алгоритмами с фиксированной многоэтапной настройкой применение разработанного алгоритма позволило повысить интегральный показатель качества размещения на 8-15 % для структур с низкой плотностью связей и на 12-25 % для структур с высокой плотностью связей, уменьшить дисперсию результатов при множественных итерациях в 1,3-2,2 раза, сократить число циклов стагнации и снизить чувствительность к начальному состоянию популяции. Полученные результаты подтверждают повышение качества и эффективности проектных решений, устойчивость разработанного алгоритма размещения и свидетельствуют о практической применимости предложенного подхода. Статья будет полезна специалистам, занимающимся автоматизацией проектирования и интеллектуальным анализом при разработке.
Бесплатно
Статья
Рассмотрена задача адаптивного построения модели, направленной на повышение показателей качества обработки информационных последовательностей. В методах обработки данных, которые нашли применение во многих прикладных областях, применяемый анализ объектов наблюдения является вычислительно ресурсоемким и в случае изменения свойств данных, требует большого количества итераций. В статье предложена методика выбора сегментов информационной последовательности, полученных разными способами, отличающаяся использованием функционала качества регрессионных моделей обработки подпоследовательностей. Поступающие на вход последовательности объектов наблюдения подвергаются разделению различными предварительно заданными алгоритмами сегментации. На каждом полученном сегменте обучаются заранее выбранные регрессионные модели и, в зависимости от полученных значений вычисленного функционала качества, происходит назначение лучших по качественным показателям моделей на сегменты. Это позволяет формировать агрегационную модель обработки данных. На основе эксперимента на модельных данных и выборках проведена оценка предлагаемой методики. Получены значения показателя качества MSE и MAE для разных алгоритмов обработки и при различном количестве сегментов. Предлагаемая методика дает возможность повысить показатели MSE и МАЕ за счет сегментации и назначения регрессионных моделей, которые имеют наилучшие показатели на отдельных сегментах. Предложенное решение направлено на дальнейшее усовершенствование ансамблевых методов. Его применение позволяет повысить оперативность настройки базовых алгоритмов в случае трансформации свойств данных и улучшить интерпретируемость результатов. Методика может применяться при разработке моделей и методов обработки информационных последовательностей.
Бесплатно
Адаптивное формирование выборок данных для самоорганизующихся систем контрастного обучения
Статья
Применение самообучения и самоорганизующихся моделей для задач классификации и прогнозирования при обработке временных рядов и информационных последовательностей сталкивается с рядом проблемных вопросов организации данных. Повышение показателей качества обработки таких систем вызывает необходимость совершенствования методов выбора объектов наблюдения для обучающих выборок данных. В статье предложен метод формирования и анализа выборок данных на основе определения патчей информационной последовательности, обладающих разными характеристиками длины и сдвига, отличающаяся использованием функционала качества моделей обработки. На основе эксперимента на модельных данных и выборках проведена оценка предлагаемого метода. Получены значения показателя качества accuracy для разных алгоритмов обработки при различных длинах и сдвигах последовательностей патча. Определены свойства полученных патчей с использованием метрик коэффициента силуэта и расстояния между центройдами. Проанализированы ошибки классифицирующих алгоритмов. Выделены доверительные интервалы ошибок. Определено, что на изменение длины и сдвига патча влияет на достигаемые значения accuracy классифицирующих алгоритмов. Предлагаемый метод дает возможность повысить показатель accuracy за счет выбора длины и сдвига при формировании патча и назначения моделей, которые имеют наилучшие показатели. Результаты показывают возможность увеличения на 6-10% для слабых моделей, в то время как для сильных моделей наблюдается улучшение на 1-5% в сценариях с ограниченными данными. Анализ предложенного решения показывает, что варьирование параметрами сдвига и длины последовательности при формирования обучающих выборок данных оказывает влияние на эффективность обработки данных.
Бесплатно
Статья
Устройства Интернета вещей играют важнейшую роль в современном мире во многих отношениях, поскольку они обеспечивают поддержку для зондирования окружающей среды, автоматизации и ответственного сохранения ресурсов. В «умном» мире повсеместное присутствие устройств Интернета вещей в повседневной жизни неизбежно. Широкое использование устройств Интернета вещей привлекает к себе любопытные взгляды злонамеренных хакеров. Несмотря на то, что существует несколько систем и протоколов безопасности, доступных для обычных беспроводных сетей, наблюдается необходимость в разработке современного механизма безопасности исключительно для сетевых сред Интернета вещей. Эта работа представляет улучшения безопасности сетей Интернета вещей. В ней собраны три специализированных способа для достижения более высоких показателей безопасности в сетевых средах Интернета вещей. Fast Fuzzy Anomaly Detector, Legacy Naïve Bayes Attack Classifiers и Variable Security Schemer of Rivest-Shamir-Adleman algorithm – это новые модули, представленные в этой работе, сокращенно ASORI. Уникальные преимущества встроенного механизма сертификации Интернета вещей и выбор динамической стратегии безопасности являются новшествами, представленными в данной работе. Модель ASORI была проверена с использованием промышленного стандартного симулятора сети OPNET для обеспечения улучшенной безопасности наряду с существенными улучшениями параметров производительности сети.
Бесплатно
Алгоритм вычисления похожести графов и его применение для сравнения бинарных исполняемых файлов
Статья
Рассматривается задача статического (без запуска) сравнения бинарных исполняемых файлов. Программа и любая ее процедура могут быть представлены в виде ориентированного графа. Для программы соответствующий граф представляет собой граф вызова функций (процедур), где узлами являются сами функции, а ребро из вершины a в b описывает вызов функции b из функции a. Для процедуры такой граф представляет собой граф потока управления, где вершинами являются базовые блоки, а ребро между узлами a и b означает возможное исполнение команд блока b после исполнения команд блока a. В работе предлагается алгоритм сравнения направленных графов, который далее применяется для сравнения программ. В основе алгоритма сравнения графов лежит применение функции похожести узлов. Для сравнения графов процедур в качестве такой функции похожести применяются нечеткая (fuzzy) хеш-функция и криптографическая хеш-функция. Далее этот способ сравнения графов процедур используется как функция похожести узлов при сравнении графов программ. На базе предложенного алгоритма разработан метод сравнения программ, проведено его исследование в рамках двух экспериментов. В первом эксперименте исследовано поведение метода при сравнении программ, полученных с применением разных опций оптимизации (O0, O1, O2, O3 и Os). Во втором эксперименте исследована возможность выявления эффективных и стойких обфусцирующих преобразований в рамках ранее разработанной модели. В первом эксперименте получены свидетельства в пользу верности гипотезы об уменьшении похожести файлов с ростом оптимизации от O1 до O3. Во втором эксперименте подтверждены некоторые полученные ранее результаты, касающиеся эффективности (неэффективности) и стойкости (нестойкости) обфусцирующих преобразований.
Бесплатно
Алгоритм и технические решения динамического конфигурирования клиент-серверных вычислительных сетей
Статья
Проанализированы основные факторы, обуславливающие расширение возможностей и повышение результативности сетевой разведки по идентификации состава и структуры клиент-серверных вычислительных сетей вследствие стационарности их структурно-функциональных характеристик. Вскрытые особенности защиты клиент-серверных вычислительных сетей, основанных на реализации принципов пространственного обеспечения безопасности, а также формализация и внедрение множества запрещающих регламентов обосновывают актуальность задачи динамического управления структурно-функциональными характеристиками клиент-серверных вычислительных сетей, функционирующих в условиях сетевой разведки. Представлена математическая модель, позволяющая находить оптимальные режимы динамического конфигурирования структурно-функциональных характеристик клиент-серверных вычислительных сетей для различных ситуаций. Приведены результаты расчетов. Представлен алгоритм решения задачи динамической конфигурации структурно-функциональных характеристик клиент-серверной вычислительной сети, обеспечивающий уменьшение времени достоверности добываемых сетевой разведкой данных. Показаны результаты практических испытаний разработанного на основе алгоритма динамического конфигурирования клиент-серверных вычислительных сетей программного обеспечения. Полученные результаты свидетельствуют, что использование представленного решения по динамическому конфигурированию клиент-серверных вычислительных сетей позволяет повысить результативность защиты за счет изменения структурно-функциональных характеристик клиент-серверных вычислительных сетей в рамках нескольких подсетей. При этом достигнуто поддержание критически важных соединений, а интервалы времени изменения структурно-функциональных характеристик адаптивны к условиям функционирования и действиям злоумышленника. Новизна разработанной модели заключается в применении математического аппарата теории марковских случайных процессов и решении уравнений Колмогорова для обоснования выбора режимов динамического конфигурирования структурно-функциональных характеристик клиент-серверных вычислительных сетей. Новизна разработанного алгоритма состоит в применении модели динамического конфигурирования структурно-функциональных характеристик клиент-серверных вычислительных сетей для динамического управления структурно-функциональными характеристиками клиент-серверной вычислительной сети в условиях сетевой разведки.
Бесплатно
Алгоритм классификации вьетнамского текста с использованием долгой краткосрочной памяти и Word2Vec
Статья
В условиях текущей четвертой промышленной революции вместе с развитием компьютерных технологий увеличивается и количество текстовых данных. Следует понимать природу и характеристики этих данных, чтобы применять необходимые методологии. Автоматическая обработка текста экономит время и ресурсы существующих систем. Классификация текста является одним из основных приложений обработки естественного языка с использованием таких методов, как анализ тональности текста, разметка данных и так далее. В частности, недавние достижения в области глубокого обучения показывают, что эти методы хорошо подходят для классификации документов. Они продемонстрировали свою эффективность в классификации англоязычных текстов. Однако по проблеме классификации вьетнамских текстов существует не так много исследований. Последние созданные модели глубокого обучения для классификации вьетнамского текста показали заметные улучшения, но тем не менее этого недостаточно. Предлагается автоматическая система на основе длинной краткосрочной памяти и Word2Vec моделей, которая повышает точность классификации текстов. Предлагаемая модель продемонстрировала более высокие результаты классификации вьетнамских текстов по сравнению с другими традиционными методами. При оценке данных вьетнамского текста предлагаемая модель показывает точность классификации более 90%, поэтому может быть использована в реальном приложении.
Бесплатно