Шумоподавление на уровне набора данных: пределы и сравнение с нейросетями
Автор: Халафян Э.А.
Журнал: Труды Московского физико-технического института @trudy-mipt
Рубрика: Информатика и управление
Статья в выпуске: 2 (70) т.18, 2026 года.
Бесплатный доступ
Метод главных компонент (Principal Component Analysis, PCA) является классическим линейным инструментом, который в эпоху глубоких нейронных сетей редко рассматривается как полноценный метод шумоподавления на уровне набора данных. Мы исследуем PCA в этой роли на наборах изображений в оттенках серого, искажённых симметричным пиксельным шумом, уделяя внимание зависимости качества шумоподавления от ранга реконструкции. Вместо оценки только отдельных изображений мы используем двухуровневый протокол. На уровне изображений измеряется доля случаев, где косинусное расстояние до чистого изображения уменьшается после реконструкции, что задаёт процент изображений, очищенных от шума, 𝜌(𝑅, 𝜉), и интервал безопасных рангов [𝑅1(𝜉),𝑅2(𝜉)]. На уровне набора данных оценивается точность идентификации: как часто очищенное изображение сопоставляется со своим истинным чистым источником поиском ближайшего соседа. PCA сравнивается с восстановлением по шумным данным и нейронной моделью шумоподавления отдельных изображений (DRUNet). Эксперименты на наборах данных Swimmer, Olivetti faces, Fashion-MNIST и UTKFace показывают устойчивую картину: малые ранги приводят к недообучению, большие ранги — к переобучению на шум, а промежуточные ранги образуют режим полезного шумоподавления на уровне набора данных. В этом режиме PCA может достигать или превосходить нейронные сети на структурированных данных и остаётся конкурентоспособным на более сложных наборах реальных изображений. Результаты показывают, что простейшая линейная словарная модель является сильной и интерпретируемой точкой отсчёта для анализа более сложных методов устранения шума.
Метод главных компонент, шумоподавление изображений, недообучение, переобучение
Короткий адрес: https://sciup.org/142248253
IDR: 142248253 | УДК: 004.932.4
Dataset-level denoising with PCA: limits and neural comparisons
Principal Component Analysis (PCA) is a classical linear tool that is rarely evaluated as a dataset-level denoiser in the era of deep neural networks. We study PCA on grayscale image collections corrupted by symmetric pixel noise, focusing on the dependence of denoising quality on reconstruction rank. We use a two-layer evaluation protocol. At the per-image level, we measure the fraction of images whose cosine distance to the clean counterpart decreases after reconstruction, defining the denoised image percentage 𝜌(𝑅, 𝜉) and the interval of safe ranks [𝑅1(𝜉),𝑅2(𝜉)]. At the dataset level, we evaluate identification accuracy by nearest-neighbor matching between denoised and clean images. PCA is compared with noisy recovery and a modern single-image neural denoiser (DRUNet). Experiments on Swimmer, Olivetti faces, Fashion-MNIST, and UTKFace show that small ranks underfit, large ranks overfit the noise, and intermediate ranks form a useful datasetlevel denoising regime. In this regime PCA can match or outperform the neural baseline on structured data and remains competitive on complex real-image datasets. Thus, even a simple linear dictionary model is a strong and interpretable reference point for analyzing more sophisticated denoising methods.
Текст научной статьи Шумоподавление на уровне набора данных: пределы и сравнение с нейросетями
Подавление шума на изображениях является классической задачей обработки сигналов и машинного обучения. За прошедшие годы были разработаны методы от линейных филвтров и вариационных схем до патчевых алгоритмов и глубоких сверточных нейрон- hbix сетей [1,2]. Большинство современных подходов, достигающих передовых результатов на стандартных бенчмарках, относится к методам, работающим с отдельными изображениями: по одной зашумленной версии изображения они восстанавливают незашумленнуто, используя явное или неявное априорное распределение и модель шума. Типичными представителями являются DnCNN, DRUNet и SwinIR, обученные на больших коллекциях пар «незашумленное/зашумленное» [1, 3,4].
Иное семейство составляют методы шумоподавления на уровне набора данных. Они рассматривают весь набор изображений целиком и изучают его низкоразмерное представление («словарь»), пригодное для реконструкции. Классическими примерами являются метод главных компонент [6-8] и неотрицательная матричная факторизация (Nonnegative Matrix Factorization, NMF) [9,10]. Эти методы относятся к обучению без учителя: им не нужны пары «незашумленное/зашумленное», а априорное предположение задаётся структурой набора данных, лежащего около низкоразмерного линейного (для РСА) или конического (для NMF) многообразия.
В предыдущей работе мы изучили NMF на наборах изображений в градациях серого и связали её с теорией общей причинности [5]. NMF давала интерпретируемые базисные изображения, но по количественным показателям шумоподавления обычно уступала РСА. Поэтому в настоящей работе мы сосредотачиваемся на РСА именно как на методе шумоподавления на уровне набора данных, используя стандартные реконструкции по первым R главным компонентам (см. приложение 6).
Центральные вопросы работы таковы: как РСА ведёт себя на наборах данных разной природы при симметричном пиксельном шуме; существует ли диапазон рангов [Ri,R2], где РСА улучшает близость зашумленных изображений к их незашумленным аналогам; как отделить улучшение отдельных изображений от задачи идентификации их чистых источников; насколько силен РСА относительно случайного угадывания и сопоставления без шумоподавления.
Мы рассматриваем четыре набора данных: Swimmer [13], Olivetti faces [14], Fashion-MNIST [15] и UTKFace [16]. Для каждого набора добавляется симметричный шум нескольких уровней, после чего РСА применяется как словарный метод шумоподавления без учителя с варьированием ранга. Качество оценивается двумя метриками: процент очищенных от шума изображений p(R, ^) и точность идентификации на уровне набора данных. Цель работы не в том, чтобы заменить современные нейросетевые методы, а в том, чтобы понять качество шумоподавления РСА в парадигме обучения без учителя и получить прозрачную базовую модель для сравнения.
Дальнейшая часть статьи организована следующим образом. В разделе 2 описан протокол PCA-шумоподавления. Разделы 3 и 4 содержат описание наборов данных и метрик. В разделе 5 обсуждаются результаты. Приложения 1 и 2 содержат технические детали РСА и нейросетевого базового метода.
2. Шумоподавление при помощи РСА
В данном разделе описан протокол шумоподавления на уровне набора данных, основанный на РСА. Математические детали РСА приведены в приложении 6; здесь фиксируется только экспериментальная процедура.
2.1. Модель шума
Для каждого набора данных рассмотрим изображения в градациях серого:
Р = {Р^} g r v*м где P^i g [0,1] — интенсивноств пикселя т = 1,...,У в изображении i = 1,...,М. Искажённые наблюдения получаются независимым симметричным пиксельным шумом с параметром £ g [0,1]:
Р [noisy] = fp^i, с вероятностью 1 - £,
7ri 11 — P7Vi, с вероятностью £.
Преобразование применяется независимо ко всем пикселям, формируя матрицу Р [noisy]. Во всех экспериментах используется сетка
£ G {0.05; 0.10; 0.15; 0.20; 0.25; 0.30},
причём для фиксированных набора данных и £ одна реализация Р [noisy] переиспользуется для всех рангов РСА.
2.2. РСА на уровне набора данных
Для каждого набора данных и уровня шума £ РСА обучается непосредственно на зашумлённой матрице данных, где изображения расположены по столбцам. Ранг реконструкции R является единственным гиперпараметром: зашумлённые данные проектируются на первые R главных направлений и реконструируются в этом подпространстве. Реконструированный набор обозначается pj^ioisy]; а ег0 pg столбец P^nOisy] является РСА-реконструкцией i-ro зашумлённого изображения.
Эталонный набор данных Р используется только для оценки и не влияет на построение РСА-подпространства. Для Swimmer, Olivetti и Fashion-MNIST ранг R перебирается от 1 до максимально допустимого ранга, ограниченного min(N, М). Для UTKFace верхняя граница фиксируется по вычислительным причинам (например, R = 850), при сохранении области, где захватывается основная доля дисперсии. Для каждой пары (£, R) реконструкции сравниваются с чистым набором Р через метрики раздела 4.
3. Наборы данных
Мы рассматриваем четыре набора изображений в оттенках серого, различающиеся размером, размерностью и разреженностью. Такое разнообразие позволяет проверить, как шумоподавление с помощью РСА зависит от структуры данных. Примеры изображений показаны в первом столбце на рис. 2.
3.1. Swimmer
Swimmer — классический синтетический бенчмарк из литературы по NMF [13]. Он содержит М = 256 бинарных изображений размера 13 х 13 (N = 169). Каждое изображение состоит из туловища и четырёх конечностей; каждая конечность имеет одну из четырёх позиций, что даёт 44 = 256 комбинаций. Набор крайне разрежен и сильно структурирован, поэтому удобен для изучения взаимодействия структуры, разреженности и шума, а ранги РСА можно исследовать вплоть до полного ранга.
3.2. Olivetti faces
Olivetti содержит М = 400 серых изображений лип людей, каждое размером 64 х 64 (N = 4096) [14]: 40 человек по 10 изображений в разных позах и условиях освещения. В отличие от Swimmer изображения плотные и обладают заметной избыточностью из-за повторяющихся объектов. Каждое изображение рассматривается как вектор в R4096, а ранг РСА изменяется от 1 до максимально осмысленного значения.
3.3. Fashion-MNIST test set
Fashion-MNIST — широко используемый бенчмарк изображений предметов одежды [15]. Мы используем тестовое множество из М = 10, 000 серых изображений размера 28 х 28 (N = 784), включающее футболки, брюки, пуловеры, платья, сандалии и другие классы. Этот набор больше и разнообразнее Swimmer и Olivetti; изображения имеют общую структуру внутри классов, но различаются формой, текстурой и артефактами фона. Ранг РСА варьируется вплоть до полного ранга тестового множества.
3.4. UTKFace
UTKFace — реальный набор лицевых изображений с аннотациями возраста, пола и этнической принадлежности [16]. Мы используем большую подвыборку и уменьшаем разрешение до 50 х 50 (N = 2500). Число изображений М существенно больше, чем в Olivetti, и один и тот же человек не обязан встречаться многократно, что делает набор ближе к неструктурированным реальным данным. Из-за вычислительной стоимости SVD ранг изменяется от 1 до 850.
4. Методы оценки
Оценка РСА как модели шумоподавления на уровне набора данных включает два аспекта: улучшение каждого изображения и идентификацию его незашумленного эталона внутри всего набора. Во всех метриках изображения рассматриваются как векторы, а расстояние задаётся косинусной метрикой
D(u,r) = 1 - "■'' , (3)
Т(^Ж^)
где D(0,r) = D(v, 0) = 1. Это расстояние инвариантно относительно положительного масштабирования и подходит для сравнения серых изображений.
4.1. Улучшение на уровне отдельных изображений и доля изображений, очищенных от шума
Пусть P i — i-e эталонное изображение, p^noisy] — его зашумлённый аналог, a P ^ n R isy — РСА-восстановление ранга R. Улучшение по косинусному расстоянию определяется как
& i (R,0 = D(Pi,Pi[noisy]) - D(P i ,p n ^s y ). (4)
Если Ai > 0, то изображение считается очищенным от шума, поскольку РСА-реконструкция ближе к эталону, чем зашумлённый вход. Основная характеристика — доля очищенных от шума изображений
1 М
p(R,t) = М £1 {Афад > 0}. (5)
1 i=1
Для каждого уровня шума мы ищем интервал рангов [Ri(£), R2(£)], где РСА улучшает почти все изображения. Исполвзуется допуск 1 %: требуем p(R,£) > 0.99. Среди удовлетворяющих рангов Ri(£) определяется как минимальный, a R2(£) — как максимальный. На рис. 1 показан пример зависимости p(R,£ ) от ранга РСА для Olivetti при £ = 0.10.
Ранг R выступает явным регулятором сложности. Слишком малые ранги соответствуют недообучению: РСА сохраняет грубую общую структуру, но теряет индивидуальные вариации. Слишком большие ранги соответствуют переобучению: реконструкция начинает воспроизводить конкретную реализацию симметричного пиксельного шума. Интервал [R1(£),R2(£)] описывает область полезного шумоподавления.
R
Рис. 1. Пример зависимости p от ранга РСА для набора данных Olivetti при уровне шума £ = 0.10. Также отмечены границы иедообучеиия и переобучения ( R1 и R2 соответственно)
4.2. Точность идентификации на уровне набора данных
Метрика p(R, £) показывает улучшение отдельных изображений, но не отвечает на вопрос, помогает ли шумоподавление определить, какое чистое изображение породило зашумлённое наблюдение. Для этого используется поиск ближайшего соседа среди чистых изображений. Для РСА-реконструкции задаём
f(i;R,£) = arg
min i < j < M
rfA'T’U')
и индикатор правильной идентификации аад = {
1,
0,
если j * (i;R,£) = г, в противном случае.
Точность идентификации равна
1 М
AC pca ( R,£ ) = - £me). (6)
1 i=1
4.3. Базовые модели
Используют два основных базовых подхода. Первый — случайное сопоставление, где ожидаемая точность равна 1/М. Второй — восстановление по шумным данным, то есть поиск ближайшего чистого изображения без РСА:
jnoisy(г;£) = arg 1m ^ D (рЬ18у], pj ),
^«) = |
1, если J*oisy (i; ^) = i,
0, в противном случае,
■40 «’ = м Е '■•«’.
г=1
Эта величина отражает, сколвко информации о тождестве изображения сохраняется после зашумления без явного шумоподавления.
Сравнение АС рса ( ДД ) с 1/М и АС(Д позволяет различатв три режима: РСА близка к случайному угадыванию; РСА лучше случайного угадывания, но хуже восстановления по шумным данным; РСА превосходит восстановление по шумным данным и действителвно улучшает идентификацию. Тот же протокол применим к DRUNet, если заменитв P^p isy на вв1ход нейросетевого метода.
5. Результаты и обсуждение итк Восстановленное Чистое чистое изображение изображение с помощью РСА Зашумленное изображение Восстановленное зашумленное изображение с помощью РСА Восстановленное нейросетью зашумленное изображение Swimmer
Рис. 2. Сравнение шумоподавления с помощью РСА и нейросетевой модели шумоподавления (NN). РСА заметно эффективнее удаляет симметричный пиксельный шум, тогда как нейросеть склонна устранять лишь отдельные точки, интерпретируемые моделью как шум. Следует также отметить, что нейросетевая модель показывает ограниченную эффективность па Fashion-MNIST и Swimmer, поскольку была обучена па иные типы данных. Это подчёркивает важность и универсальность методов шумоподавления, основанных па обучении без учителя
В этом разделе мы количественно исследуем, как РСА ведёт себя в роли метода шумоподавления на уровне набора данных для четырёх наборов изображений, описанных в разделе 3. Сначала мы анализируем долю очищенных от шума изображений p(R,£) на уровне отдельных изображений (см. раздел 4.1), фокусируясь на соответствующих интервалах рангов [Ri(£),R2(£)]. Затем мы переходим к точности идентификации на уровне набора данных, определенной в разделе 4.2, сравнивая РСА с двумя базовыми подходами: процедурой сопоставления без шумоподавления и мощной нейросетевой моделью шумоподавления, действующей на отдельные изображения (DRUNet). В дальнейшем мы интерпретируем низкие ранги как недообучение данным, очень высокие ранги как переобучение шуму, а промежуточные ранги как режим, в котором РСА выступает как полезный словарный метод шумоподавления. Показательные примеры шумоподавления с помощью РСА и нейросетей на всех четырёх наборах данных представлены на рис. 2.
5.1. Доля очищенных от шума изображений и интервалы рангов
Начнём с доли очищенных от шума изображений p(R, £), определённой в разделе 4.1. Определив правило допуска в 1 %, мы для каждого набора данных и уровня шума извлекаем интервал рангов [ Ri ( £ ) ,R2 ( £ )], при которых РСА улучшает почти все изображения.
Зависимость RT и R2 от уровня шума о.зо
0.25
0.20
0.15
0.10
0.05
0.0 0.2
0.4 0.6 0.8 1.0
«/««..
Рис. 3. Визуализация рангов иедообучеиия ( R1) и переобучения (R2) для каждого набора данных и уровня шума, полученных по правилу допуска 1 % из раздела 4.1. Rmax — максимальный рассматриваемый ранг для каждого набора данных
Рисунок 3 подтверждает качественную картину, продемонстрированную графиками зависимости p(R, £) от ранга (рис. 1). Для каждого набора данных и уровня шума существует нетривиальный интервал рангов РСА, при котором почти все изображения улучшаются (становятся ближе к эталонным изображениям в смысле метрики р).
Низкие ранги: недообучение. При очень малых рангах РСА сохраняет лишь небольшое число направлений, которые захватывают грубую общую структуру, но отбрасывают большую часть дисперсии, специфичной для набора данных. В этом режиме восстановления, как правило, чрезмерно усреднены и визуально напоминают средние по классу (например, «средняя цифра» или «среднее лицо»). В результате доля очищенных от шума изображений p(R, £) остаётся ниже порога 0.99: слишком много отдельных изображений ухудшаются под действием проекции. Это отражается в том, что Ri(£) никогда не оказывается близким к 1, за исключением случаев с наиболее экстремальным шумом (например, Fashion-MNIST и UTKFace при £ = 0.30 или Swimmer при £ = 0.30, где сколько-нибудь осмысленное шумоподавление практически невозможно).
Высокие ранги: переобучение шуму. С другой стороны, когда R приближается к R max, РСА фактически порождает почти всё исходное пространство. Тогда восстановление Xr воспроизводит не только общую структуру, но и конкретную реализацию симметричного пиксельного шума. В терминах метрики p(R, £) это соответствует падению ниже уровня 0 . 99: многие изображения оказываются очищенными от шума лишь номинально, их зашумлённые детали сохраняются. Этот режим переобучения и определяет R2(£): наибольший ранг, при котором РСА всё ещё улучшает почти все изображения.
Промежуточные ранги: полезное шумоподавление. Между этими двумя крайностями существует промежуточный режим, в котором РСА удаляет существенную долю шума, при этом сохраняя достаточно степеней свободы для описания индивидуальной вариабельности. Этот режим соответствует интервалу [Ri(£), R2(£)], показанному на рис. 3. Выделяются несколько зависящих от набора данных тенденций:
• Swimmer. При малом шуме (£ = 0.05) полезный интервал широк (11 < R< 102), что отражает сильную комбинаторную структуру и разреженность набора данных. По мере роста £ Ri и R2 смещаются влево, а интервал постепенно сужается; при £ = 0.30 он вырождаете я в один ранг (Ri = R2 =3), что указывает на то, что лишь крайне низкоразмерные проекции позволяют избежать переобучения очень сильному шуму.
• Olivetti и UTKFace. Для обоих наборов лиц R2(£) остаётся близким к Rmax при всех уровнях шума, что означает возможность использования значительной части спектра PC А без переобучения шуму. В то же время Ri(£) смещается к меньшим значениям при росте £ (от 112 до 1 для Olivetti, и от 114 до 1 для UTK), что согласуется с предположением о том, что более сильная зашумленность требует более агрессивного понижения размерности для подавления шума.
• Fashion-MNIST. Для Fashion-MNIST левая граница R1(£) быстро уменьшается с ростом шума (от 140 до 1). тогла как R2(£) смещается к большим 'значениям (от 152 до 273). Это говорит о том, что при высоких уровнях шума появляется более широкий диапазон рангов, в котором достигается компромисс между недообучением и переобучением, но этот диапазон начинается гораздо ближе к R = 1: очень низкоразмерное подпространство, захватывающее грубые формы предметов одежды, уже улучшает большинство изображений, и дополнительные компоненты могут добавляться без немедленного воспроизведения шума.
5.2. Точность идентификации на уровне набора данных
В целом интервалы рангов, извлечённые из р, подтверждают ожидаемую картину: при низком ранге РСА недообучается и чрезмерно сглаживает изображения, при высоком ранге РСА переобучается и начинает реконструировать шум, и существует зависящий от набора данных и уровня шума промежуточный диапазон рангов, в котором РСА действует как подлинный метод шумоподавления на уровне набора данных.
Улучшения отдельных изображений по косинусному расстоянию не гарантируют, что исходные чистые изображения будут уверенно идентифицироваться. Поэтому мы дополняем анализ на основе расстояния метрикой точности идентификации на уровне набора данных, введённой в разделе 4.2. Для каждого набора данных и уровня шума £ мы вычисляем:
-
• AC pca ( Ri,£ ) и AC pca ( R2,£): точность идентификации ближайшего соседа, когда зашумлённые изображения сначала очищаются от шума с помощью РСА при левой и правой границах интервала [Ri(£), R2(£)];
-
• АС(£): базовый уровень восстановления без шумоподавления, при котором сопоставление выполняется непосредственно по зашумлённым изображениям;
-
• AC nn ( £): точность, получаемая после применения описанного в приложении 6 нейросетевого метода шумоподавления отдельных изображений на основе DRUNet и последующего применения процедуры поиска ближайшего соседа.
В качестве иллюстрации на рис. 4 показана зависимость точности идентификации от ранга РСА для набора данных Olivetti при уровне шума £ = 0.25. Точность РСА изображена для всех рангов, а синие и красные пунктирные линии обозначают точность нейросетевого шумоподавления и восстановления без шумоподавления соответственно.
Рис. 4. Пример зависимости точности от ранга РСА для набора данных Olivetti при уровне шума £ = 0.25 обозначен голубой сплошной линией. Точность NN показана синей пунктирной линией, а точность восстановления без шумоподавления — красной пунктирной линией
Swimmer
40 60
Точность(%)
80 100
итк
MNIST т 0.25 s
3 0.2
$ 0.15 о
* 0.1
0.05
Рис. 5. Графики зависимости точности от уровня шума для четырёх наборов данных. Точность измеряется в левой и правой точках R1 и R2 интервала шумоподавления РСА (обозначены светлоголубыми прямоугольниками) и сравнивается с базовыми методами восстановления без шумоподавления (NR, обозначен красными треугольниками ▲) и нейросетевым подходом (NN, обозначен синими звёздами *)
Точность (%)
Роль левой границы R1. Для всех на боров данных AC pca (R1,£) быстро падает по мере роста уровня шума. При умеренных и высоких уровнях шума точность идентификации при Ri заметно ниже обеих базовых линий. Это иллюстрирует цену агрессивного шумоподавления: очень низкие ранги подавляют шум, но одновременно размывают тонкую информацию, необходимую для различения отдельных изображений.
Правая граница R2 по сравнению с базовым и методами. Поведение при R2 более тонкое:
• Swimmer. При промежуточных уровнях шума (£ = 0.10, 0.15, 0.20) РСА при R2 превосходит оба базовых метода: например, при £ = 0.15 имеем ACpca(R2,£) ~ 0.62 против 0.57 (NR) и 0.59 (DRUNet). В этом случае структура на уровне набора данных, которой пользуется РСА, даёт преимущество по сравнению с шумоподавлением на отдельных изображениях.
• Olivetti. При малом и умеренном шуме РСА при R2 сопоставима с базовыми методами: точности остаются оченв близкими к 1 вилотв до £ = 0.15 и остаются конкурентоспособными при £ = 0.20 (0.9825 против 0.9900 для восстановления по шумным данным II 0.9825 для DRUNet). При сюнее высоком шуме (£ = 0.25, 0.30) РСА при R2 занимает промежуточное положение между двумя базовыми подходами, обычно будучи лучше нейросети, но немного уступая восстановлению без шумоподавления.
• UTKFace. Для более сложного набора UTKFace РСА при R2 конкурентоспособен с нейросетевым подходом при малом и умеренном шуме (например, при £ = 0.15 имеем 0.94 против 0.94 для DRUNet и 0.96 для восстановления по шумным данным), однако его точноств быстрее деградирует при высоком шуме. При £ > 0.20 оба базовых метода существенно превосходят РСА при R2.
• Fashion-MNIST. Для Fashion-MNIST РСА при R2 стабилвно уступает обоим ба-3OBBIM методам, хотя и остаётся значительно выше уровня случайного угадывания даже при £ = 0.30 (точность 0.0043 против 1/10, 000). Сильные априорные предположения о структуре отдельных изображений, на которых основаны восстановление без шумоподавления и DRUNet, очевидно, лучше подходят к высокостилизованному, но разнообразному многообразию изображений одежды, чем глобальное линейное подпространство.
5.3. Сводка эмпирических результатов
Почему важно рассматривать точность в дополнение к расстоянию? Сопоставление рис. 3 и 5 показывает, почему точность идентификации на уровне набора данных является дополнительной метрикой. Существуют режимы, в которых РСА существенно увеличивает долю изображений, приближающихся к своим чистым версиям (высокая р), но при этом не превосходит восстановление по шумным данным по точности идентификации (например, Fashion-MNIST при умеренном шуме). Напротив, для структурированного набора Swimmer существуют уровни шума, при которых РСА на промежуточных рангах одновременно улучшает расстояния до чистых изображений для большинства примеров (что снова отражается в высокой р) и достигает большей точности идентификации, чем оба базовых метода. Таким образом, точность отражает способность модели шумоподавления поддерживать последующие задачи поиска или сопоставления, а не только смещать изображения ближе к их чистым версиям для большинства выборок.
Результаты эксперимента можно подытожить следующим образом.
• Для всех четырёх наборов данных и всех неэкстремальных уровней шума существует нетривиальный интервал рангов [Ri(£), R2(£)], при которых РСА ведёт себя как корректно обученная модель шумоподавления на уровне набора данных: почти все изображения улучшаются по косинусному расстоянию (то есть р ~ 1).
• Очень низкие ранги соответствуют недообучению: РСА порождает чрезмерно сглаженные реконструкции, которые могут выглядеть очищенными от шума, но уже не содержат достаточного объёма информации для надёжной идентификации.
• Очень высокие ранги соответствуют переобучению: РСА начинает воспроизводить конкретную реализацию симметричного шума, и значение р ухудшается.
• Между этими крайностями существует зависящий от набора данных и уровня шума промежуточный режим, в котором РСА обеспечивает наилучший компромисс между шумоподавлением и сохранением информации. На высокоструктурированных наборах данных, таких как Swimmer, РСА в этом режиме может даже превосходить нейросетевую модель шумоподавления на отдельных изображениях в задаче идентификации.
• На более сложных наборах естественных изображений (Olivetti, UTKFace, Fashion-MNIST) РСА, настроенный на подходящий ранг, остаётся конкурентоспособным с DRUNet при малом и умеренном шуме, тогда как при сильном шуме преимущество постепенно переходит к методам, работающим с отдельными изображениями.
6. Заключение
Мы исследовали метод главных компонент как модель шумоподавления на уровне набора данных для коллекций изображений в градациях серого, искажённых симметричным пиксельным шумом. В отличие от методов, работающих с отдельными изображениями, РСА действует на всём зашумлённом наборе данных, обучая линейный словарь без доступа к парам «незашумленное/зашумленное» и явной модели шума.
Методологически предложен двухуровневый протокол оценки. На уровне изображений метрика p(R,£) показывает, как часто РСА приближает зашумлённое изображение к эталону по косинусному расстоянию, и задаёт интервал рангов [R1 (^), R2 (^)] с допуском 1 %. На уровне набора данных измеряется точность идентификации через поиск ближайшего соседа среди эталонов. Эта точность сравнивается для РСА при Ri и R 2 с сопоставлением без шумоподавления и DRUNet.
На Swimmer, Olivetti, Fashion-MNIST и UTKFace наблюдается единая картина: низкие ранги дают недообучение, высокие — переобучение на симметричный шум, а промежуточные ранги образуют область полезного шумоподавления на уровне набора данных. Сравнение с базовыми методами показывает, что РСА является сильным бенчмарком: на Swimmer он может превосходить как сопоставление без шумоподавления, так и DRUNet, а на более сложных наборах остаётся конкурентоспособным при малом и умеренном шуме. В целом даже простой линейный словарный метод в определенных задачах даёт прозрачный ориентир для анализа более сложных методов шумоподавления.
Приложения1. РСА
Для полноты изложения мы приведем здесь детали метода главных компонент, использованные в основном тексте. Пусть A G RN хМ — матрица для фиксированного набора данных, столбцы ад G RN которой получены путем векторизации изображений. На всём протяжении мы предполагаем, что А центрирована по столбцам в обычном смысле РСА (каждый Х { имеет нулевое эмпирическое среднее); способ выполнения этого центрирования описан в основном тексте.
Эмпирическая ковариационная матрица набора данных имеет следующий вид:
С — — ААт G RN x N . (8)
М
РСА соответствует собственному разложению
Сик = Ак ик , к — 1,...,N, (9)
где Ai > A2 > • • • > An > 0 — собственные значения, и ик G RN — ортонормированные собственные векторы. Векторы и к являются главными направлениями (главными компонентами), а соответствующие собственные значения количественно характеризуют дисперсию данных вдоль этих направлений.
Эквивалентно можно работать с сингулярным разложением (SVD) матрицы А:
А = U XV т, (10)
где U G Rn x N и V G RM хМ — ортогональные матрицы, а
S — diag(CT i ,..., ^ min( N,M ) )
содержит сингулярные значения a i > • • • > am i n ( N,M ) > 0. В этой записи
С =-1ХХТ = U (?2) иТ, м ум , так что главные направления uj совпадают со столбцами матрицы U, а собственные значения равны Xk = a^/M.
Для заданного ранга R ранговая R-аппроксимация РСА матрицы Х имеет вид
XR = Ur ^ rV ^ , (11)
где UR G Rn x R ii VR G RMxR содержат первые R столонов матриц U ii V. a SR G RRxR содержит ведущие R сингулярных значений. Тогда i-e реконструированное (центрированное) изображение задаётся i-м столбцом матрицы Xr.
Посколвку собственные значения упорядочены, увеличение R монотонно повышает долю общей дисперсии, захватываемой подпространством РСА:
^ R X ^ R a 2
XarFraction ( R ) = k=1 k = ^ k=1 ..J . (12)
^N ^min(N,M) о k=1 Xk 1=1=1 ak
В контексте шумоподавления малые значения R подчёркивают общую структуру, разделяемую изображениями, тогда как болвшие R более точно воспроизводят мелкомасштабную вариативность, включая шум. В основном тексте этот компромисс исследуется эмпирически путем вариации R и оценки процента очищенных от шума изображений p(R, ф) и точности идентификации на уровне набора данных.
2. Шумоподавление на основе нейронной сети
В качестве дополнительного базового сравнения с РСА мы используем современную сверточную нейронную сеть для шумоподавления на уровне отдельных изображений. Во всех экспериментах используется архитектура DRUNet — многомасштабная сеть типа U-Net с остаточными связями, которая широко применяется как модель шумоподавления для естественных изображений, не нуждающаяся в дополнительном обучении [3]. Модель используется с общедоступными предобученными весами и не дообучается на наших наборах данных — она рассматривается как фиксированное отображение типа «чёрного ящика» из зашумлённых изображений в очищенные от шума.
2.1. Модель и предположения о шуме
DRUNet обучается в постановке с учителем для удаления аддитивного шума с изображений. На вход сети подаются зашумленное изображение и скалярный параметр, задающий стандартное отклонение шума a (в нормированных единицах [0,1]). Такая условная постановка позволяет одной сети работать в диапазоне уровней шума: одни и те же веса переиспользуются, а скаляр a информирует сеть об интенсивности предполагаемого шума. В наших экспериментах мы фиксируем рекомендуемое значение a = 0.1 для всех наборов данных и вероятностей шума ф
2.2. Применение к наборам данных в градациях серого
DRUNet изначально разработан для цветных изображений с тремя каналами и пространственными размерами, кратными небольшому целому (обычно 8). Наши наборы данных состоят из двумерных изображений в градациях серого различного разрешения. Чтобы согласовать эти форматы, мы действуем следующим образом.
• Каждое изображение в градациях серого сначала нормируется в диапазон [0,1] и интерпретируется как одноканальный массив.
• Этот единственный канал реплицируется три раза, образуя пceвдo-RGB-изoбpaжeниe. Этот шаг позволяет подавать входы в градациях серого на цветную сеть, не изменяя архитектуру и предобученные веса.
• При необходимости изображение дополняется справа и снизу (с использованием отражающего дополнения), так что оба пространственных размера становятся кратными 8. После фильтрации шума дополнение удаляется, возвращая изображению исходное разрешение.
• Выход сети — трёхканальное изображение, которое преобразуется обратно в градации серого путем усреднения каналов и отсечения значений по диапазону [0,1].
2.3. От шумоподавления отдельных изображений к шумоподавлению на уровне набора данных
В итоге задается детерминированное отображение
Fa : [0,1]Ях1У ^ [0,1]ЯxW, которое каждой зашумленной картинке в градациях серого сопоставляет реконструкцию DRUNet при выбранном уровне шума с. Внутренняя структура DRUNet (многомасштабное извлечение признаков, остаточные блоки, пропускающие связи) остается неизменной — адаптируются только форматы входа и выхода.
В отличие от РСА, который явно строится на уровне набора данных и использует корреляции между изображениями, DRUNet действует независимо на каждом изображении. Для фиксированного набора данных и вероятности шума £ мы поступаем так.
• Исходим из зашумленного набора данных Р[noisy] (£) рассматриваемого в качестве коллекции из М изображений.
• Для каждого зашумленного изображения применяем описанное выше отображение Fa, получая очищенную от шума версию.
• Собираем полученные восстановленные изображения в новый набор данных, который обозначаем через Р[NN] (£).
2.4. Роль в сравнении
Эталонные наборы незашумленных данных Р не используются при работе нейросетевой модели — они применяются только для оценки.
В контуре оценки реконструкции на основе DRUNet, Р [NN](£), обрабатываются точно так же, как реконструкции РСА P^oisy]:
-
• Для каждого зашумленного изображения мы сравниваем его реконструкцию DRUNet с соответствующим эталонным изображением, используя косинусное расстояние из раздела 4, и фиксируем, является ли реконструкция ближе, чем зашумленный вход. Агрегирование по набору данных дает процент очищенных от шума изображений Pnn^ L напрямую сопоставимый с p(R, £) для РСА.
-
• Мы также используем выходы DRUNet в задаче идентификации по ближайшему соседу, заменяя зашумленные изображения их реконструкциями DRUNet в процедуре поиска по сходству.
Такая постановка позволяет сопоставить два принципиально разных подхода к шумоподавлению одних и тех же зашумленных наборов данных: линейный метод на уровне набора данных (РСА с настраиваемым рангом R) и нелинейный, обученный метод для отдельных изображений (DRUNet с фиксированными весами). Сравнение показывает, в какой мере сильные априорные знания о структуре отдельных изображений могут компенсировать отсутствие явной структуры на уровне набора данных, и в каких ситуациях глобальный взгляд РСА на весь набор данных дает преимущества по сравнению с мощной, но локальной нейросетевой моделью.