Информатика и автоматизация (Труды СПИИРАН) @ia-spcras
Статьи журнала - Информатика и автоматизация (Труды СПИИРАН)
Все статьи: 332
Информационный поиск в социальных медиа на базе мультидоменной динамической системы знаний
Статья
Задача информационного поиска заключается в нахождении информации, наилучшим образом удовлетворяющей информационную потребность пользователя. В условиях социальных медиа информационный поиск осложняется высокой динамичностью контента, тематической разнородностью и разнообразием ментальных моделей пользователей. В данной работе предлагается подход к решению задачи информационного поиска в таких условиях путем построения мультидоменной динамической системы знаний. Ее новизна заключается в объединении трех уровней семантики: проблемно-ориентированной, представленной онтологией метазадачи (описывающей цели поиска); доменно-специфической, реализованной через динамический многослойный граф знаний, построенный на основе пользовательского контента социальных медиа; и доменно-независимой, основанной на лексической базе данных и большой языковой модели. Граф знаний позволяет отразить различные контексты употребления понятий, соответствующие тематическим кластерам в коллекции документов. Такая интеграция позволяет учитывать эволюцию понятий, особенности дискурса и ментальные стереотипы участников коммуникации. Для оценки эффективности предложенной системы проведен эксперимент с использованием датасета публикаций из социальной сети “ВКонтакте” по проблемно-ориентированному мониторингу публикаций, где требуется отбор релевантных публикаций из нетематизированных источников. Для решения данной задачи предложена технология, основанная на использовании метрики расстояния между терминами запроса и терминами публикации в многослойном графе знаний. Результаты эксперимента с применением данной технологии подтверждают эффективность предложенной модели для задач информационного поиска по сравнению со стандартным поиском по ключевым словам и эмбеддинговыми моделями. В продолжении данного исследования планируется сформировать лексическую базу данных, а также рассмотреть возможность расширения модели за счет применения меры точечной совместной информации и методов векторного представления графов.
Бесплатно
Статья
В работе выполнен сравнительный анализ основных функциональных характеристик подводных беспроводных сенсорных сетей (ПБСС) со стационарной и гибридной коммуникационными архитектурами. Указанные ПБСС состоят из сенсорных узлов, расположенных на морском дне и надводных межсредных шлюзов, обеспечивающих передачу информационных пакетов между подводным и надводным сегментами сети. В стационарной ПБСС роль шлюзов выполняют заякоренные буи, в гибридной – мобильные транспортные платформы. С использованием математического аппарата, основанного на вероятностном подходе, проведена оценка функциональных характеристик альтернативных коммуникационных архитектур ПБСС с энергетической точки зрения - определены общие энергетические затраты сети на пересылку сообщений и время жизни сенсоров сети. Для численного анализа функциональных характеристик ПБСС рассмотрены достаточно широкие диапазоны изменения проектных параметров сети, таких как: размер акватории, требуемое количество и варианты размещения сенсорных узлов, вероятность доставки пакета в акватории (физические параметры среды), в которых осуществлялся поиск «оптимального» с энергетической точки зрения решения. Выполненное авторами исследование показывает, что мобильность играет важную роль в повышении качества функционирования подводной сети в аспектах покрытия (обеспечения связности), энергоэффективности и времени жизни. Мобильный элемент в виде волнового глайдера, выполняющий роль межсредного шлюза, способен функционировать в акватории в течение продолжительного времени, что говорит о перспективности его использования для прикладных задач сбора, накопления и ретрансляции информации в рамках интернета подводных вещей.
Бесплатно
Статья
Проблемы организации медицинской помощи в условиях пандемии COVID-19, связанные с неопределенностью и ограниченностью различных ресурсов, привели к необходимости совершенствования систем принятия решений при госпитализации пациентов. С помощью ситуационного управления можно улучшить процесс принятия решений, чтобы он лучше соответствовал текущей ситуации. При этом важным становится учет влияния психологических факторов на решения, принимаемые при госпитализации. В статье предлагается использование коалиционных игр для ситуационного управления при госпитализации больных. Игроками и участниками коалиции являются госпитали, бригады скорой помощи, пациенты и центры компьютерной томографии. Цель игры - сформировать коалицию участников, обеспечивающую максимальную выгоду по времени и стоимости госпитализации в момент принятия решения. Рассмотрены общая схема госпитализации, основные источники информации о ситуации, постановка и формализация проблемы. Проведен эксперимент, в котором проверялось формирование коалиции во время госпитализации на основе данных, полученных при анализе динамики пандемии COVID-19. В связи с малым объемом данных и отсутствием апробированных моделей развития ситуации при проведении расчета часть параметров была оценена с использованием эвристических моделей развития ситуации, основанных на анализе информации из открытых источников информации. Результат эксперимента содержит набор коалиций, обеспечивающих максимальную выгоду, при указанных ограничениях. При этом время расчета коалиционной игры позволяет использовать предложенную модель поддержки принятия решений при госпитализации в диспетчерской службе станций скорой помощи.
Бесплатно
Использование онтологии для анализа английских комментариев в социальных сетях
Статья
Чат-боты заинтересовывают многих пользователей по мере того, как технологии становятся все более продвинутыми. Потребность в обмене информацией между людьми через компьютерные системы увеличивается с каждым днем, в результате чего в большинстве стран растет предпочтение использовать чат-боты. Поскольку Вьетнам является развивающейся страной с множеством этнических групп, требуется усиленное внимание к распространению социальных сетей и расширению кооперативной экономики. Серьезной проблемой стало неуместное использование слов в повседневной жизни. В социальных сетях встречаются неоднозначные отзывы с похвалой и критикой о том, что мы пытаемся уменьшить использование негативной лексики и улучшить качество использования языка в социальных сетях. Мы стремимся удовлетворить потребности пользователей в социальных сетях, способствовать экономическому развитию и более эффективно решать социальные проблемы. Для достижения этих целей предлагается метод глубокого обучения, использующий интеллектуальный анализ онтологических знаний для сбора и обработки комментариев в социальных сетях. Этот подход направлен на улучшение пользовательского опыта и облегчение обмена информацией между людьми путем анализа мнений в комментариях. Результаты экспериментов показывают, что наш метод превосходит традиционный подход.
Бесплатно
Статья
Использование радиолокационных спутниковых данных в мониторинге сельскохозяйственных культур является перспективным дополнением методов и технологий, базирующихся на анализе мультиспектральных изображений. К основным достоинствам радиолокационных вегетационных индексов относится их чувствительность к поляриметрическим свойствам принимаемого сигнала, а также независимость от облачности. Это особенно важно для территории юга российского Дальнего Востока, муссонный климат которого обеспечивает влажную и облачную погоду в период набора сельскохозяйственными культурами максимальной биомассы. Для оценки возможностей радиолокационных спутниковых данных на примере пахотных земель Хабаровского края и Амурской области были проанализированы 64 снимка космического аппарата Sentinel-1 за период наблюдений с мая по октябрь 2021 года. Для каждого снимка были рассчитаны значения индексов DpRVI, RVI, VH/VV и построены временные ряды для всего периода наблюдений по отдельным полям (всего 342 поля). По мультиспектральным снимкам Sentinel-2 с использованием маски облачности были построены временные ряды NDVI. Были рассчитаны характеристики экстремумов временных рядов для разных типов пахотных земель: сои, овса, и залежи. Показано, что для каждой сельхозкультуры кривые сезонного хода DpRVI, RVI, VH/VV имели характерный вид. Установлено, что индекс DpRVI продемонстрировал наиболее высокую устойчивость – коэффициенты вариации сезонного хода DpRVI были существенно ниже показателей для RVI и VH/VV. Также было выявлено, что сходство между сезонным ходом индексов сохранялось для удаленных друг от друга регионов – Хабаровского края и Амурской области. Были рассчитаны основные характеристики сезонного хода временных рядов радиолокационных индексов в сравнении с NDVI – величина максимума, дата наступления максимума и вариабельность этих показателей. Установлено, во-первых, что значения этих показателей в разных регионах схожи между собой; во-вторых, вариабельность максимума и дня наступления максимума для DpRVI ниже, чем для RVI и VH/VV; в-третьих, вариабельность максимума и дня наступления максимума для DpRVI сопоставима с NDVI. Таким образом, можно сделать вывод о том, что временные ряды радиолокационных индексов DpRVI, RVI, VH/VV для основных типов сельскохозяйственных земель Дальнего Востока имеют отличительные особенности и могут быть использованы в задачах классификации, моделирования урожайности и контроля севооборота.
Бесплатно
Статья
Цифровая трансформация энергетического сектора, сопровождающаяся повсеместным внедрением интеллектуальных сетей, расширяет поверхность кибератак и повышает уязвимость критически важной инфраструктуры. Традиционные системы безопасности, основанные на сигнатурах, статических правилах, а также на текущих реализациях методов машинного обучения, демонстрируют ограниченную эффективность против новых типов угроз, а их верификация на реальных объектах сопряжена с неприемлемыми рисками. В статье представлен и экспериментально апробирован интегрированный адаптивный фреймворк на основе цифрового двойника (ЦД), направленный на повышение результативности обнаружения киберугроз в системах управления интеллектуальными энергосетями. Фреймворк включает формализованную математическую постановку задачи обнаружения с учетом трех ключевых показателей: полноты (Recall), доли ложных срабатываний (FPR) и совокупного времени реакции (TTR), а также целевую функцию для их совместной оптимизации. Ключевым элементом фреймворка является контур адаптации с обратной связью по метрикам качества, управляемый трехуровневым механизмом (оперативный, тактический, стратегический режимы): результаты работы системы обнаружения угроз на реальном объекте используются для автоматического запуска процедур дообучения, оптимизации или генерации новых сценариев в безопасной виртуальной среде ЦД. Цифровой двойник формализован как кортеж взаимосвязанных моделей физических процессов, коммуникационной инфраструктуры, логики управления и базы знаний об угрозах, что позволяет учитывать многоуровневую архитектуру интеллектуальных энергосетей и специфические протоколы (МЭК 61850, Modbus). Экспериментальная валидация на синтетическом наборе данных, имитирующем работу АСУ ТП, подтвердила применимость концепции: использование синтетических данных, генерируемых в среде ЦД, позволило снизить частоту ложных срабатываний на 6,4% по сравнению с обучением на статичных данных, а активация адаптационного механизма способствовала сокращению совокупного модельного времени реакции на инциденты на 3,82%. Расчет комплексной целевой функции показал снижение обобщенного показателя качества на 16,8% после адаптации. Предложенный подход вносит вклад в решение проблем дефицита представительных данных и ограничений безопасного тестирования и может рассматриваться как шаг к реализации парадигмы «безопасность через проектирование» в энергетике. Полученные результаты представляют собой доказательство реализуемости концепции и обосновывают необходимость дальнейших исследований для промышленного внедрения, включая проверку на реальных промышленных сценариях.
Бесплатно
Статья
Современные исследования алгоритмов принятия решений в системах multi-access edge computing (MEC) для задач распределения ресурсов зачастую основываются на упрощенных абстракциях сетевой топологии, что ограничивает применимость полученных результатов в реальных условиях эксплуатации мобильных сетей. Целью данной работы является разработка реалистичной модели сети сотовой связи с использованием методов стохастической геометрии и комплексная оценка эффективности современных алгоритмов обучения с подкреплением в задачах минимизации сетевых задержек в граничных вычислениях. Метод. Для создания математически обоснованной модели сетевой среды использовались методы стохастической геометрии в сочетании с реальными статистическими данными распределения пользователей сотовых сетей. Применение стохастической геометрии обеспечило корректное моделирование пространственного размещения базовых станций и расчет межузловых расстояний, критически важных для определения сетевых задержек. Экспериментальная оценка проводилась на базе доработанной платформы LWMECPS с расширенным Gymnasium API, поддерживающим алгоритмы PPO, TD3 и SAC. Основные результаты. Разработана модель сети связи, учитывающая реалистичное пространственное распределение сетевых элементов и временную динамику пользовательской нагрузки. На основе данной модели создано виртуализированное тестовое окружение в LWMECPS, позволяющее проводить воспроизводимые эксперименты с контролируемыми параметрами. Результаты экспериментов показали различия в характеристиках производительности различных алгоритмов: PPO обеспечил стабильное сокращение задержки до 20% со стабильной конвергенцией; SAC продемонстрировал наибольшее абсолютное улучшение (сокращение задержки на 38%), но проявил нестабильность при инициализации; TD3 показал умеренную эффективность (улучшение до 11%), но высокую чувствительность к настройке гиперпараметров. Обсуждение. Проведенный сравнительный анализ алгоритмов машинного обучения с подкреплением выявил ключевые особенности их применения в MEC-системах. Установлено, что дискретный характер задач размещения сервисов делает алгоритм PPO наиболее подходящим для практического внедрения в системы принятия решений благодаря его стабильности сходимости и естественной поддержке дискретных пространств действий. Полученные результаты предоставляют научно обоснованные рекомендации для разработчиков MEC-платформ по выбору оптимальных алгоритмических решений.
Бесплатно
Статья
Одним из направлений дальнейшего совершенствования и повышения эффективности применения технических объектов при решении ими целевых задач является применение информационно-управляющих систем (ИУС) для управления сложными техническими объектами. Существующие современные ИУС представляют собой комплекс аппаратно-программных средств, предназначенных для сбора, обработки и хранения информации и управления. В условиях наличия большого количества информации, противоречивых факторов, влияющих на качество управления, принятие обоснованных и своевременных решений в процессе управления невозможно без применения ИУС. Разрабатываемые ИУС, как правило, являются специализированными системами и проектируются для решения конкретных задач. В связи с этим разработка и проектирование ИУС должны проводиться с учетом взаимосвязи с целевыми показателями и особенностями объектов управления, а также результатами всестороннего анализа информации о параметрах ИУС, влияющих на показатели их эффективности. Использование математических моделей для исследования вариантов построения ИУС является основой проектирования и разработки устройств и подсистем ИУС. Разрабатываемые в настоящее время модели ИУС, как правило, позволяют проводить исследования для одностадийных процессов управления с наличием в системе однотипных объектов обслуживания. В то же время современные технические объекты и системы управления представляют собой сложные комплексы с циклически повторяющимися процессами управления разнотипными средствами. Как правило, в таких комплексах имеется набор параллельно работающих устройств (каналов управления), обеспечивающих управление разнотипных объектов на различных стадиях обработки информации. В этом случае структуру ИУС необходимо представлять в виде многофазной многоканальной технической системы, в которой происходит процесс одновременного управления несколькими объектами различных типов. В связи с этим целью статьи является разработка и исследование математической модели ИУС с двумя фазами обработки и наличием определенного количества обслуживающих разнотипных устройств. Основой модели является многофазная сетевая модель системы массового обслуживания. Исследование модели позволяет выбрать вариант построения ИУС, в частности выбрать оптимальное количество каналов обработки для различных типов объектов по критерию оптимальности с учетом ограничений по стоимости и времени обслуживания. Разработан алгоритм выбора варианта построения ИУС и приведен пример расчета количества каналов обработки в двухфазной системе при управлении тремя типами объектов.
Бесплатно
Исследование применимости метода матричной факторизации для ранжирования больших языковых моделей
Статья
В последние годы широкое применение в области финансов получили большие языковые модели (англ. Large Language Models, LLM). Прямое сравнение таких моделей может быть затруднено, так как наборы данных и сами LLM могут быть закрыты, а параметры при оценке могут отличаться. В работе для задачи заполнения неизвестных метрик предлагается использование метода матричной факторизации из рекомендательных систем, изначально созданного для прогнозирования предпочтений пользователей. Целью работы является оценка применимости матричной факторизации для предсказания метрик качества LLM на финансовых задачах, а также разработка метода ранжирования LLM на основе агрегации метрик качества. Проводится эксперимент по применению матричной факторизации на собранных из научных исследований данных о 34 LLM и 42 финансовых наборах данных. Усредненная MAE метода на всех запусках составляет 0.07 на тестовом наборе данных. Верхние позиции в рейтинге занимают модели DeepSeek R1, OpenAI GPT-4o, OpenAI o1-mini, Fin-R1, Claude 3.5 Sonnet. Двумя способами исследуется влияние ошибки прогнозирования на итоговые предсказания: при помощи MAE и метода Монте Карло. Анализируются полученные результаты, основными выводами которых являются: а) метод матричной факторизации может быть применен для прогнозирования неизвестных значений метрик моделей на наборах данных; б) ведущие большие языковые модели сблизились в оценке настолько, что невозможно выявить явного лидера; в) большие ошибки предсказания позволяют выявить специфические особенности моделей на конкретных задачах. Представленный метод ранжирования способен упростить выбор подходящей модели для финансовых задач.
Бесплатно
Статья
Рассматривается новый подход к синтезу самопроверяемых устройств, основанный на контроле вычислений контролируемыми объектами с помощью кодов Хэмминга, проверочные символы (контрольные биты) которых описываются самодвойственными функциями. При этом структура работает в импульсном режиме, что фактические основано на внесении временнóй избыточности при построении самопроверяемого устройства. Это, к сожалению, приводит к некоторому снижению быстродействия, однако существенно повышает характеристики контролепригодности, что особенно актуально для устройств и систем критического применения, входные данные для которых изменяются не столь часто. Дается краткий обзор методов построения схем встроенного контроля на основе свойства самодвойственности вычисляемых функций. Приведены основные структуры организации схем встроенного контроля. Отмечены предполагаемые пути развития теории синтеза схем встроенного контроля на основе проверки принадлежности вычисляемых функций классу самодвойственных булевых функций. Установлены все возможные значения числа информационных символов для кодов Хэмминга, которые будут обладать свойством самодвойственности функций, описывающих контрольные биты. Кодеры таких кодов Хэмминга будут являться самодвойственными устройствами. Так как функции, описывающие контрольные биты кодов Хэмминга, являются линейными, то для того, чтобы они были самодвойственными необходимо, чтобы в каждой из них использовалось нечетное количество аргументов. Доказано, что число разрядов кодовых слов кодов Хэмминга с самодвойственными контрольными функциями равно n=3+4l, l∈N0. Приводятся результаты моделирования самодвойственных устройств со схемами встроенного контроля по двум диагностическим признакам в среде Multisim. Предложен способ модификации структуры контроля вычислений по двум диагностическим признакам, позволяющий использовать любой линейный блоковый код (не обязательно код Хэмминга). Он основан на дооснащении кодера устройством преобразования функций в самодвойственные. Фактически это устройство для формирования модифицированного кода. Доказано, что для получения модифицированного кода Хэмминга с самодвойственными контрольными функциями для случаев n≠3+4l, l∈N0, достаточно сложить по модулю M=2 несамодвойственную контрольную функцию с функцией старшего информационного бита.
Бесплатно
Статья
Представлен метод итеративной настройки параметров моделей на основе ансамблей деревьев с использованием настройки байесовских гиперпараметров для прогнозирования состояний на примере рака молочной железы. Предлагаемый метод использует три различных набора данных, в том числе набор данных по диагностическому раку молочной железы Висконсина (WDBC), набор данных по надзору, эпидемиологии и конечным результатам (SEER) по раку молочной железы и набор данных по раку молочной железы в Коимбре (BCCD), а также реализует набор данных на основе древовидных ансамблей. Модели, в частности AdaBoost, Gentle-Boost, LogitBoost, Bag и RUSBoost, для прогнозирования рака молочной железы. Байесовская оптимизация использовалась для итеративной настройки гиперпараметров моделей, а производительность моделей оценивалась с использованием нескольких показателей, включая точность, прецизионность, полноту и оценку f1. Наши результаты показывают, что предложенный метод значительно повышает производительность моделей на основе ансамблей деревьев, что приводит к более высокой точности, прецизионности, полноте и оценке f1. По сравнению с другими современными моделями предлагаемый метод более эффективен. Он достиг 100% идеальных результатов по точности, прецизионности, полноте и оценке F1 в наборе данных WDBC. В наборе данных SEER BC точность метода составила 95,9%, прецизионность 97,6%, полнота 94,2% и оценка F1 95,9%. Для набора данных BCCD метод достиг точности 94,7%, прецизионности 90%, полноты 100% и оценки F1 94,7%. Результаты этого исследования имеют важное значение для медицинских работников, поскольку раннее выявление рака молочной железы может значительно повысить шансы на выживание. В целом, это исследование вносит ценный вклад в область прогнозирования рака молочной железы с использованием машинного обучения.
Бесплатно
К 90-летнему Юбилею Юсупова Рафаэля Мидхатовича
Статья
17 июля 2024 года исполнилось 90 лет Юсупову Рафаэлю Мидхатовичу, доктору технических наук, профессору, члену-корреспонденту РАН, заслуженному деятелю науки и техники РСФСР, научному руководителю Санкт-Петербургского института информатики и автоматизации Российской академии наук (СПИИРАН).
Бесплатно
Калмановская фильтрация одного класса изображений динамических объектов
Статья
Рассматривается задача оценивания состояния динамического объекта по наблюдаемым изображениям, сформированным оптической системой. Цель исследования состоит в реализации нового подхода, обеспечивающего повышение точности автономного слежения за динамическим объектом по последовательности изображений. Используется векторная модель изображения объекта в виде ограниченного количества вершин (базовых точек). Предполагается, что в процессе регистрации объект удерживается в центральной области каждого кадра, поэтому параметры движения могут описываться в виде проекций на оси системы координат, связанной с оптической осью камеры. Новизна подхода состоит в том, что наблюдаемые параметры (расстояние вдоль оптической оси и угловое положение) объекта вычисляются по координатам заданных точек на изображениях объекта. Для оценки состояний объекта строится фильтр Калмана-Бьюси в предположении, что движение динамического объекта описывается совокупностью уравнений поступательного движения центра масс вдоль оптической оси и изменений углового положения относительно плоскости изображения. Приведен пример оценивания углового положения объекта, иллюстрирующий работоспособность предложенного метода.
Бесплатно
Каскадный классификатор для обнаружения и идентификации птиц в видеопотоке
Статья
В статье представлен разработанный метод и прототип программы для определения наличия птиц в видеопотоке данных в режиме реального времени. Этот метод основан на использовании каскадного классификатора, который был применен для решения задачи обнаружения и идентификации птиц в биоакустической установке отпугивания птиц в аэропорту Томска. В рамках исследования был использован каскадный классификатор Виолы-Джонса, который является одной из реализаций алгоритма каскад Хаара. Этот алгоритм позволяет с высокой точностью и скоростью обнаруживать объекты на изображениях и видео. В данном случае классификатор был обучен на наборе данных, содержащем изображения птиц, что позволило достичь высокой точности обнаружения и идентификации птиц на видео. Также приведены результаты оценки возможностей созданного классификатора и продемонстрирована его высокая результативность. В ходе исследования были использованы различные методы машинного обучения и анализа видеоданных, что позволило получить точные и надежные результаты. В целом, данная работа представляет собой инновационный подход к решению актуальной задачи защиты аэропортов от птиц. Применение разработанного метода позволило повысить эффективность работы биоакустической установки отпугивания птиц и обеспечить безопасность полетов в аэропорту Томска, снизив вероятность столкновения самолетов с птицами. Новизна работы заключается в применении метода Виолы-Джонса к задаче обнаружения и идентификации птиц с оценкой его результативности. Таким образом, представленная в статье работа является важным вкладом в развитие методов обнаружения и идентификации объектов на видео и может быть использована в других областях, где требуется автоматическое обнаружение и классификация объектов в видеопотоке данных.
Бесплатно
Статья
Сельское хозяйство является одним из основных источников экономического роста в России; мировое производство яблок в 2019 году составило 87 миллионов тонн. Болезни листьев яблони являются основной причиной ежегодного сокращения производства яблок, что приводит к огромным экономическим потерям. Автоматизированные методы выявления болезней листьев яблони позволяют сократить трудоемкую работу по мониторингу яблоневых садов и раннему выявлению симптомов болезни. В этой статье предложена многослойная сверточная нейронная сеть (MCNN), которая способна классифицировать листья яблони по одной из следующих категорий: парша яблони, черная гниль и болезни яблоневой кедровой ржавчины, используя недавно созданный набор данных. В этом методе мы использовали методы аффинного преобразования и перспективного преобразования для увеличения размера набора данных. После этого операции предварительной обработки на основе метода кадрирования и выравнивания гистограммы OpenCV использовались для улучшения предлагаемого набора данных изображения. Экспериментальные результаты показывают, что система достигает точности обучения 98,40% и точности проверки 98,47% для предложенного набора данных изображения с меньшим количеством параметров обучения. Результаты предполагают более высокую точность классификации предложенной модели MCNN по сравнению с другими известными современными подходами. Эта предложенная модель может использоваться для обнаружения и классификации других типов болезней яблони из разных наборов данных изображений.
Бесплатно