Применение методов машинного обучения для поиска и определения экстремальных контрагентов

Автор: Безрученко Т.С., Жарков Д.И., Зубарев К.М.

Журнал: Экономика и бизнес: теория и практика @economyandbusiness

Статья в выпуске: 1 (131), 2026 года.

Бесплатный доступ

В статье рассматривается применение алгоритма кластеризации k-means, для поиска и идентификации экстремальных контрагентов, представляющих повышенный риск для бизнеса. Особое внимание уделяется анализу географической локализации контрагентов, что позволяет выявлять пространственные аномалии, такие как массовая регистрация по одному адресу или концентрация в регионах с высоким уровнем риска. Описана методология использования k-means для сегментации контрагентов на однородные группы и последующего обнаружения выбросов на основе расстояний до центроидов кластеров. Для оценки качества кластеризации применяется коэффициент силуэта, обеспечивающий количественную оценку компактности кластеров и степени обособленности аномальных объектов. Результаты показывают, что предложенный метод позволяет снизить операционные затраты на верификацию контрагентов и минимизировать финансовые и репутационные риски.

Машинное обучение, кластеризация, экстремальные контрагенты, аномалии, пространственные данные, коэффициент силуэта, риск-менеджмент, финансовая безопасность

Короткий адрес: https://sciup.org/170212578

IDR: 170212578   |   DOI: 10.24412/2411-0450-2026-1-28-33

Application of machine learning methods for identification and detection of extreme counterparties

The article explores the k-means clustering algorithm, for identifying extreme counterparties that pose an increased risk to business operations. Special attention is paid to analyzing the geographical localization of counterparties, enabling the detection of spatial anomalies such as mass registration at a single address or concentration in high-risk regions. The methodology of using k-means to segment counterparties into homogeneous groups and subsequently detect outliers based on distances to cluster centroids is described. The silhouette coefficient is employed to assess clustering quality, providing a quantitative measure of cluster compactness and the degree of isolation of anomalous objects. The results indicate that the proposed method reduces operational costs for counterparty verification and minimizes financial and reputational risks.

Текст научной статьи Применение методов машинного обучения для поиска и определения экстремальных контрагентов

В современной бизнес-среде управление рисками и обеспечение финансовой безопасности являются критически важными задачами для устойчивого развития компании. С развитием технологий и увеличением объема данных о контрагентах, организации все чаще обращаются к методам машинного обучения для проактивного анализа и выявления потенциально недобросовестных или неэффективных партнеров. Машинное обучение позволяет не только автоматизировать процесс верификации, но и выявлять сложные, скрытые закономерности и аномалии в поведении контрагентов, которые практически невозможно обнаружить с помощью традиционных методов ручной проверки [1,2].

Особую ценность представляет анализ пространственных данных, а именно географической локализации объектов контрагентов – юридических адресов, производственных мощностей, филиалов и точек сбыта [3]. Пространственное распределение зачастую скрывает в себе паттерны, указывающие на признаки фирм-однодневок, транзитные схемы или скоординированную мошенническую деятельность.

Цель выполненного исследования – рассмотреть применение алгоритма кластеризации k-means для поиска и определения экстремальных контрагентов, представляющих повышенный риск для бизнеса, с акцентом на анализ их географической принадлежности. В статье будет детально рассмотрен принцип работы алгоритма k-means, этапы подготовки и верификации геоданных, а также интерпретация полученных пространственных кластеров [1].

Особое внимание будет уделено тому, как метод k-means помогает сегментировать контрагентов на однородные географические группы и идентифицировать пространственные выбросы (аутлайеры). Такие аномалии, как массовая регистрация по одному адресу, несоответствие заявленного юридического адреса реальному местонахождению производства или концентрация контрагентов в регионах с высоким уровнем риска, могут служить надежными индикаторами экстремального поведения [3].

Все эти аспекты в совокупности позволяют компаниям выявлять неочевидные риски, принимая более обоснованные и своевремен- ные решения при формировании бюджета. Использование пространственного анализа для оценки новых партнеров помогает выстроить проактивную систему безопасности бизнеса. Такой метод позволяет отсеивать ненадежные компании до подписания договора, что экономит ресурсы и страхует от финансовых и репутационных рисков, выявляя проблемных контрагентов еще до начала сотрудничества.

Материалы и методы исследования. Кластеризация представляет собой задачу разбиения множества объектов на подмножества таким образом, чтобы объекты внутри одного кластера были схожи между собой, в то время как объекты из разных кластеров существенно отличались. Для задачи выявления экстремальных контрагентов рассматриваются несколько семейств алгоритмов, каждое из которых обладает уникальными характеристиками и областями применения.

Цель алгоритма k-means – найти такое разбиение С и положения центроидов i j (средних арифметических векторов кластера), чтобы минимизировать следующий функционал стоимости, известный как within-cluster sum of squares (WCSS) или инерция:

к

J(C.^Y\^-^

j=1 X i ^C j

J(C,i) - целевой функционал, который необходимо минимизировать. Это сумма квадратов расстояний от каждого объекта до центроида его кластера.

— ^ к=1 — сумма по всем к кластерам.

— EXieCj   — сумма по всем объектам xt, принадлежащим кластеру Cj.

\|Х < l j l\

– квадрат евклидова расстоя- ния между объектом х^ и центроидом ij его кластера. Евклидово расстояние вычисляется по формуле:

l|x i

Ц(Х. 4 d=1

^ j.d )

где D - количество признаков (размерность      — ij - центроид кластера Cj, который вы- пространства).                                 числяется как среднее всех объектов в этом кластере:

1 =

1 C'^C j

Х

где |C j | - количество объектов в кластере C j

Применительно к выявлению экстремальных контрагентов, центроидные методы позволяют идентифицировать аномалии через анализ расстояний до центроидов кластеров. Контрагенты, существенно удаленные от центров своих кластеров, могут рассматриваться как “выбросы”, поскольку их поведенческие или финансовые показатели значительно отклоняются от типичных представителей данной группы, а поиск кандидатов в экстремальные сужать до масштабов кластеров.

Преимуществами данного подхода являются высокая скорость работы, простота реализации и интерпретации, а также хорошая масштабируемость на большие наборы данных. Однако метод обладает существенными недостатками, включая чувствительность к выбору начальных центроидов, предположение о сферической форме кластеров и необходимость заранее задавать количество кластеров. Существуют модификации базового алгоритма, такие как k-means++ с улучшенной инициализацией центроидов и Fuzzy c-means, реализующий подход нечеткой кластеризации [4].

Внутренние метрики позволяют оценить качество кластеризации без использования внешней разметки. Для задач выявления экстремальных контрагентов особенно важен ко- эффициент силуэта (Silhouette Score), поскольку он позволяет оценить не только компактность кластеров, но и степень обособленности подозрительных объектов от основных групп контрагентов. Silhouette Score вычисляется для каждого объекта по формуле [5]:

s^ =

b(i) — a(i) max{a(i), b(Q} где a(i) - среднее расстояние до объектов своего кластера, b(i) - среднее расстояние до объектов ближайшего кластера. Значения от -1 до 1, где значения близкие к -1 указывают на потенциальные аномалии.

Практическая реализация системы выявления экстремальных контрагентов основана на поэтапном анализе, где первоначальная кластеризация по геопространственным признакам создает основу для последующего детектирования аномалий [6]. Такой подход обусловлен тем, что территориально близкие контрагенты часто демонстрируют схожие паттерны поведения, что позволяет выделить значимые кластеры с однородными характеристиками. После формирования и валидации кластеров с использованием метрик качества осуществляется целенаправленный поиск экстремальных контрагентов внутри каждого кластера на основе анализа отклонений от кластерных центроидов.

Процедура валидации включает структурированную кросс-валидацию, подбор гиперпараметров и оценку статистической значимости различий между алгоритмами. Для биз-нес-задачи выявления экстремальных контрагентов критически важным является достижение баланса между полнотой и точностью: высокая полнота обеспечивает минимизацию пропущенных рисковых контрагентов, а умеренная точность позволяет поддерживать приемлемый уровень ложных срабатываний. Стабильность и воспроизводимость результатов на различных временных срезах и территориальных выборках выступают ключевыми требованиями к промышленной системе [7,8].

Каждый этап методологии требует тщательной настройки и валидации на репрезентативных данных с учетом специфики бизнес-задачи. Последовательный подход - от кластеризации с учетом географического распределения к детектированию аномалий внутри кластеров - обеспечивает значимое повышение точности идентификации экстремальных контрагентов при сохранении интерпретируемости результатов [9].

Результаты и их обсуждение. В основе разработанной системы лежит модифицированная версия алгоритма k-means, адаптированная к специфике задач выявления контрагентов [6]. Методология предполагает комплексный подход к обработке пространственных данных и других показателей контрагентов. Для обеспечения релевантности кластеризации устанавливаются определенные биз-нес-правила, включающие ограничения на минимальную и максимальную численность формируемых групп, пороговые значения статистической значимости для идентификации аномальных объектов, а также индивидуальные настройки для различных территориальных подразделений компании.

Важным элементом системы является предварительная фильтрация исходных данных [8]. Из анализа исключаются контрагенты с непродолжительной историей операционной деятельности, что позволяет избежать искажений, связанных с начальными этапами функционирования хозяйствующих субъектов. Также, для обеспечения репрезентативности выборки в анализе не учитываются контрагенты, ценообразование которых формируется многоступенчатым подходом, принципиально отличающиеся от стандартных рыночных моделей и не соотносится с территориальными особенностями формируемых групп. Это обеспечивает однородность анализируемой выборки и повышает достоверность результатов кластеризации.

Качество проведенной кластеризации было количественно оценено с помощью силуэтного коэффициента, который показал значение 0.2613. Данное значение указывает на допустимое разделение кластеров. Такой уровень качества кластеризации обеспечивает достаточную репрезентативность для последующего анализа аномалий внутри сформированных групп. Процесс идентификации экстремальных контрагентов строится по двухуровневому принципу: после первоначального формирования кластеров осуществляется детальный анализ объектов внутри каждой выделенной группы. Данный подход предполагает последовательное применение методов кластеризации и последующей верификации, что позволяет сочетать преимущества автоматизиро-

Отклонение =

где Р факт представляет собой фактическую цену контрагента,

Р баз — базовое значение цены, которое может определяться как средняя цена по кластеру, медиана рыночного сегмента или историческое значение. Критическое значение определяется на усмотрение компании, а модуль разности гарантирует неотрицательность результата.

Рассмотрим двух контрагентов, функционирующих в пределах одного территориального кластера со среднерыночным значением ценового параметра на уровне 100 условных единиц. Первый контрагент демонстрирует фактическое значение 108 единиц. Относительное отклонение составляет 0.08, что находится в пределах допустимого диапазона. Второй контрагент показывает значение 147 единиц при том же базовом параметре. Расчет показывает отклонение 0.47, что превышает установленный критический порог. Многофакторный анализ подтвердил устойчивый характер выявленного ценового дисбаланса.

Именно превышение критического порога ценового отклонения позволило классифицировать второго контрагента как экстремальный. При этом первый контрагент, несмотря на незначительное превышение ценового параметра, сохранил статус надежного партнера благодаря соответствию основной кластерной модели.

Такой двухуровневый подход позволяет совместить преимущества автоматизированной обработки больших данных с точностью точечного анализа, обеспечивая эффективное управление рисками при оптимальном ис- ванной обработки данных с точностью точечного анализа. Объекты, демонстрирующие статистически значимое отклонение от параметров своего кластера, подвергаются углубленной экспертной проверке. Контрагенты, превышающие критическое значение, признаются экстремальными.

Для анализа ценовых аномалий в системе мониторинга контрагентов применяется показатель относительного отклонения, рассчитываемый по формуле [10]:

/’факт— /’баз । г баз пользовании ресурсов. Практическое применение системы подтвердило ее устойчивость и репрезентативность получаемых результатов, что делает ее ценным инструментом для построения проактивной системы финансовой безопасности компании.

Заключение. Проведенное исследование подтверждает высокую практическую ценность применения алгоритма k-means в сочетании с коэффициентом силуэта для решения задачи выявления экстремальных контрагентов. Алгоритм k-means демонстрирует особую эффективность при работе с большими объемами данных, позволяя осуществлять первичную сегментацию контрагентов на основе их географической локализации и финансовых показателей. Простота интерпретации результатов и высокая скорость работы делают его оптимальным выбором для первоначального анализа и выделения однородных групп контрагентов.

Коэффициент силуэта выступает ключевым инструментом валидации качества кластеризации, обеспечивая количественную оценку как компактности полученных кластеров, так и степени обособленности отдельных объектов. Это особенно важно для идентификации экстремальных контрагентов, поскольку позволяет не только оценить общее качество разбиения, но и выявить объекты, слабо ассоциированные с любым из кластеров, что является прямым индикатором потенциальной аномальности.

Совместное использование алгоритма k-means и коэффициента силуэта формирует надежную методологическую основу, которая обеспечивает эффективное решение задачи раннего обнаружения подозрительных контрагентов. Такой подход обеспечивает значи- тельное снижение операционных затрат на верификацию контрагентов за счет целенаправленного анализа именно тех объектов, мальные характеристики, и способствует минимизации финансовых и репутационных рисков компании. Перспективы дальнейшего развития метода видятся в адаптации предло женного подхода для работы с динамически ми данными и интеграции с системами реаль которые демонстрируют статистически ано- ного времени.