Метод интерпретируемой компьютерной классификации изображений глазного дна для первичного офтальмологического скрининга

Автор: Долинина О.Н., Арутюнян Д.А., Кочкарева Е.И., Каменских Т.Г., Колбенев И.О., Веселова Е.В.

Журнал: Саратовский научно-медицинский журнал @ssmj

Рубрика: Офтальмология

Статья в выпуске: 2 т.22, 2026 года.

Бесплатный доступ

Цель: разработка и экспериментальная оценка метода интерпретируемой классификации изображений глазного дна для первичного офтальмологического скрининга, основанного на совместном использовании модели глубокого обучения и средств визуального объяснения ее решений. Материал и методы. Исследование выполнено на выборке из 2500 изображений глазного дна, сбалансированной по 5 классам (по 500 изображений на класс): дегенеративные изменения сетчатки, патология макулярной области, нейроофтальмологическая патология, сосудистая патология сетчатки и отсутствие клинически значимой патологии. В качестве классификатора использована сверточная нейронная сеть с ConvNeXt-подобной архитектурой. Качество классификации оценивали по метрике Accuracy, качество интерпретации – по метрике Intersection over Union (IoU). Результаты – для базовой модели значения Accuracy составили 0,74–0,77, тогда как для модели с учетом интерпретационной компоненты – 0,79–0,82. Качество интерпретации для базовой модели достигало IoU примерно 0,79, а для предложенного метода – 0,98–0,99. Заключение. Предложенный метод обеспечивает не только классификацию изображений глазного дна, но и визуальное объяснение результатов. Использование экспертных аннотаций при обучении повышает соответствие карт значимости клинически значимым областям изображения и может способствовать повышению доверия к системам поддержки принятия клинических решений при первичном офтальмологическом скрининге.

Изображение глазного дна, офтальмологический скрининг, глубокое обучение, интерпретируемая классификация, карта значимости

Короткий адрес: https://sciup.org/149151698

IDR: 149151698   |   УДК: 617.7:004.8   |   DOI: 10.15275/ssmj2202145

Interpretable classification method for fundus image analysis in primary ophthalmological screening

Objective: to develop and experimentally evaluate an interpretable fundus image classification method for primary ophthalmic screening based on the joint use of a deep learning model and visual explanation techniques. Material and methods. The study was conducted on a dataset of 2,500 fundus images balanced across 5 classes (500 images per class): degenerative retinal changes, macular pathology, neuro-ophthalmic pathology, retinal vascular pathology, and the absence of clinically significant pathology. A convolutional neural network with a ConvNeXt-like architecture was used as the classifier. Classification performance was assessed using Accuracy, while interpretability quality was evaluated using the Intersection over Union (IoU) metric. Results. The baseline model achieved Accuracy values ranging from 0.74 to 0.77, whereas the model incorporating the interpretability component achieved values between 0.79 and 0.82. The interpretability quality of the baseline model reached an IoU of approximately 0.79, while the proposed method achieved IoU values of 0.98–0.99. Conclusion. The proposed method provides not only fundus image classification but also a visual explanation of the obtained results. Incorporating expert annotations into the training process improves the correspondence between attention maps and clinically relevant image regions and may increase trust in clinical decision support systems for primary ophthalmic screening.

Текст научной статьи Метод интерпретируемой компьютерной классификации изображений глазного дна для первичного офтальмологического скрининга

EDN: AUMXRN

методов обработки и анализа изображений. Традицион ная диагностика по снимкам ГД основана на экспертной интерпретации данных, полученных с помощью фундус-камер и других средств визуализации. Такие изображе ния содержат клинически значимую информацию и при меняются для выявления широкого спектра патологий. Однако данный подход требует высокой квалификации врача-офтальмолога и значительного клинического опы та, что ограничивает его масштабируемость, особенно в сельских, удаленных и ресурсно-ограниченных регионах [1, 2].

Одним из перспективных направлений повышения доступности первичного офтальмологического скрининга является применение систем поддержки принятия клинических решений, основанных на методах глубокого обучения. Сверточные нейронные сети демонстрируют высокую эффективность в задачах классификации изображений ГД и позволяют автоматизировать выявление патологических изменений [3–6]. Вместе с тем практическое использование таких решений ограничивается недостаточной прозрачностью алгоритмов: многие модели функционируют как «черные ящики», предоставляя итоговый класс без объяснения причин принятого решения [7, 8].

Для задач первичного скрининга особое значение имеет не постановка окончательного нозологическо го диагноза, а отнесение изображения к укрупненной группе патологий или группе риска, требующей после дующего обследования. В этой постановке возрастает значимость интерпретируемых подходов, которые со вмещают классификацию изображения с визуальным объяснением результата и позволяют выделять области изображения, оказавшие наибольшее влияние на реше ние модели [7, 9, 10].

Цель – разработка и экспериментальная оценка ме тода интерпретируемой классификации изображений ГД для первичного офтальмологического скрининга, основанного на совместном использовании модели глу бокого обучения и средств визуального объяснения ее решений.

Материал и методы. Дизайн исследования и исходные данные. Работа представляет собой экспери ментальное исследование метода автоматической клас сификации изображений ГД. Исследование направлено на оценку влияния включения экспертных аннотаций патологически значимых областей в процесс обучения модели на качество классификации и интерпретируе мость результата.

Для обучения и валидации классификационной мо дели использовали выборку из 2500 изображений ГД. Выборка была сбалансирована по 5 классам и вклю чала по 500 изображений на каждый класс: признаки дегенеративных изменений сетчатки, признаки пато логии макулярной области, признаки нейроофтальмо - логической патологии, признаки сосудистой патологии сетчатки, клинически значимая патология не выявлена. Принадлежность изображений к классам была уточнена медицинским экспертом.

В рамках исследования анализировались две харак теристики: качество отнесения изображения к укрупнен ной группе офтальмологической патологии и степень совпадения автоматически выделяемых моделью об ластей с экспертной разметкой. С учетом ограниченного объема доступной информации об исходной выборке исследование рассматривалось как экспериментальная проверка предложенного алгоритмического подхода.

Для проверки качества интерпретации патологии ГД с помощью метода автоматической классификации изо бражений ГД обследованы 100 пациентов – 167 глаз с различной патологией. Были выделены 4 класса забо леваний.

  • 1-й класс – сосудистая патология – 38 глаз с диабети ческой ретинопатией;

2-й класс – дегенеративные заболевания сетчатки: сухая форма возрастной макулярной дегенерации с раз витием географической атрофии (43 глаза), пигментная дистрофия сетчатки (2 глаза);

3-й класс – патология макулярной области: возраст ная макулярная дегенерация, влажная форма (57 глаз);

4-й класс – нейроофтальмологическая патология: частичная атрофия зрительного нерва (17 глаз). Методы обследования включали офтальмоскопию, визо-, тоно метрию, компьютерную статическую периметрию, опти ческую когерентную томографию. Фотографирование

ГД проводили на фундус-камере Topcon TRC-NW7SF (Topcon, Япония) с шириной поля 50 градусов.

Постановка задачи классификации и интерпретации. Пусть X – множество изображений ГД, Y – множество диагностических классов, соответствующих укрупненным группам офтальмологических заболева ний, а A – множество экспертных аннотаций патоло гически значимых областей. Для каждого изображения x ex задана истинная меткаv ev, а для части изо бражений – аннотация aU) e A , отражающая локали зацию клинически значимой зоны.

Задача классификации формализуется как отоб- ражение fg-.X^ Rlyl,                 (1)

где s – параметры модели, али представляет собой вектор оценок принадлежности изображения диагностическим классам. В отличие от стандартной постановки задачи классификации в рассматриваемом подходе требуется также построение интерпретируемого объяснения решения. Для этого вводится отображение дв-.х^м,               (2)

где M – пространство карт значимости, а goto определяет области изображения, оказавшие наибольшее влияние на предсказание модели.

Следовательно, модель должна решать 2 взаимосвязанные задачи: корректно относить изображение к диагностическому классу и формировать карту значимости [7, 11], согласованную с экспертным представлением о локализации патологических изменений. Для количественной оценки такой согласованности исполь- зуется метрика Intersection over Union (IoU) [12–14]:

I Г f 1йПаЫ1 |7?s(x)Ua(x)| ,     (3)

где ReM – область, выделенная моделью как значи мая для классификации, а qW – экспертная аннотация. Чем выше значение loU, тем ближе интерпретация мо дели к клинически ожидаемой локализации патологии.

Модель и процедура обучения. В качестве базового классификатора использовали сверточную нейронную сеть с ConvNeXt-подобной архитектурой, способную выделять пространственно локализованные признаки, значимые для различения патологических изменений сетчатки, сосудистой системы, макулярной области и диска зрительного нерва [5, 6]. Размер входных изображений составлял 384×384 пикселя. Для визуализации причин предсказания применялись методы класса CAM, включая Grad-CAM и Score-CAM, формирующие тепловые карты на основе активаций последнего сверточного слоя [8].

Ключевая особенность предложенного подхода за ключалась в том, что интерпретация учитывалась не только на этапе анализа результата, но и непосред ственно в процессе обучения модели. Функция потерь строилась как комбинация ошибки классификации и ошибки интерпретации, определяемой через степень совпадения карты значимости с экспертной аннотацией:

L = ^cls + ^int , (4) где ^cls – классификационная составляющая функции потерь, ^int – интерпретационная составляющая, свя занная с согласованием карты значимости и экспертной аннотации, а /L – весовой коэффициент интерпретаци онной компоненты.

Интерпретационная составляющая задавалась как

^int = 1" loUf . (5)

Обучение выполняли в течение 40 эпох. Размер батча составлял 16, скорость обучения – 2×10–5, коэффициент weight decay – 1×10–4. Для контроля качества обучения использовали валидационное разбиение с долей вали-дационной части 0,2. Применяли сглаживание меток с коэффициентом 0,05, увеличение обучающей выборки с коэффициентом 2, фиксированное значение seed = 42 и смешанную точность вычислений. Количество рабочих процессов загрузки данных составляло 4.

В прикладном смысле такая схема обучения направлена на то, чтобы модель принимала решение не только формально корректно, но и по клинически содержательным областям изображения. Это особенно важно для медицинских задач, в которых высокая числовая точность без объяснимости не обеспечивает достаточного доверия к результату и ограничивает возможность практического внедрения системы [7, 10, 11].

Оценка качества модели. Качество классифика- ции оценивали по показателю accuracy:

1 V (Xi У Accuracy = — >  xl\y =yj

_                    2 i=/N                , где У – предсказанный моделью класс ражения ^i , Уг – истинная метка класса, изоб-

I

индикатор совпадения предсказанной и истинной меток.

Качество интерпретации оценивали по метрике IoU, отражающей степень совпадения карты значимости модели с экспертной аннотацией патологически значимой области. Сопоставлялись 2 группы моделей: базовый классификатор, обученный по стандартной функции потерь, и классификатор аналогичной архитектуры, в обу- чение которого дополнительно включали интерпретационную компоненту на основе IoU.

Оценка результатов носила сравнительный экспе риментальный характер. Основными анализируемыми показателями были accuracy и IoU. Доверительные ин тервалы и статистическую значимость различий между моделями в настоящей работе не рассчитывали, что учитывалось при интерпретации полученных результа тов.

Результаты. Экспериментальная проверка направлена на оценку влияния включения интерпретационной компоненты в функцию потерь на качество первичного офтальмологического скрининга по изображениям ГД. Сравнивали 2 модели: базовый классификатор, обученный по стандартной функции потерь, и классификатор, в обучение которого была включена компонента согласования карты значимости с экспертной аннотацией патологической области.

Для базового классификатора значения accuracy находились в диапазоне 0,74–0,77. Для модели, обученной с использованием функции потерь, учитыва ющей IoU, значения accuracy составляли 0,79–0,82. Таким образом, добавление интерпретационной компоненты не сопровождалось снижением каче ства классификации и было связано с увеличением accuracy.

Наиболее выраженные различия между сравни ваемыми подходами получены при оценке качества интерпретации. Для базовой модели степень совпа дения карт значимости с экспертными аннотациями составляла приблизительно 0,79 по метрике IoU. Для модели, обученной с учетом интерпретационной ком поненты, значения IoU достигали 0,98–0,99.

Для данной модели с целью анализа были пред ставлены 4 класса патологии ГД:

1-й класс – сосудистая патология: 37 изображений ГД были классифицированы правильно (97,4%), 1 изо бражение отнесено к норме;

2-й класс – дегенеративные заболевания сетчат ки, все 45 изображений были классифицированы пра вильно (100%);

3-й класс – патология макулярной области, 56 изображений были классифицированы правильно (98,2%), 1 изображение отнесено ко 2-му классу.

4-й класс – нейроофтальмология, 16 (93,8%) изо бражений были классифицированы правильно, 1 изо бражение отнесено к норме.

Таким образом, итоговый результат работы моде ли включал предсказанную укрупненную группу па тологии, оценку уверенности классификации и карту значимости, визуально указывающую область изо бражения, оказавшую наибольшее влияние на пред сказание. Общий итог правильных классификаций со ставил в среднем 97,3%.

Пример такого результата представлен на рисунке.

a                                        6