Машинное обучение в задачах base-calling для методов секвенирования нового поколения

Андрей Геннадьевич Бородинов Владимир Владимирович Манойлов Игорь Вячеславович Заруцкий Александр Иванович Петров Владимир Ефимович Курочкин Алексей Сергеевич Сараев

Журнал: Информатика и автоматизация (Труды СПИИРАН) @ia-spcras

Рубрика: Искусственный интеллект, инженерия данных и знаний

Статья в выпуске: Том 21 № 3, 2022 года.

Бесплатный доступ

Развитие технологий секвенирования следующего поколения (NGS) внесло существенный вклад в тенденции снижения затрат и получения массивных данных секвенирования. В Институте аналитического приборостроения РАН разрабатывается аппаратно-программный комплекс (АПК) для расшифровки последовательности нуклеиновых кислот методом массового параллельного секвенирования (Нанофор СПС). Алгоритмы обработки изображений, входящие в состав АПК, играют существенную роль в решении задач расшифровки генома. Финальной частью такого предварительного анализа сырых данных является процесс base-calling. Base-calling — это процесс определения нуклеотидного основания, которое генерирует соответствующее значение интенсивности в каналах флуоресценции для различных длин волн на кадрах изображения проточной ячейки для различных циклов секвенирования методом синтеза. Приведен обширный анализ различных подходов к решению задач base-calling и сводка распространенных процедур, доступных для платформы Illumina. Рассмотрены различные химические процессы, включенные в технологию секвенирования методом синтеза, вызывающие смещения в значениях регистрируемых интенсивностей, включая эффекты фазирование / префазирование (phasing/prephasing), затухания сигнала (signal decay) и перекрестные помехи (cross-talk). Определена обобщённая модель, в рамках которой рассматриваются возможные реализации. Рассмотрены возможные подходы машинного обучения (machine learning) для создания и оценки моделей, реализующих этап обработки base-calling. Подходы ML принимают различные формы, включая обучение без учителя (unsupervised), обучение с ча-стичным привлечением учителя (semi-supervised), обучение с учителем (supervised). В работе показана возможность применения различных алгоритмов машинного обучения на основе платформы Scikit-learn. Отдельной важной задачей является оптимальное выделение признаков, выделенных в обнаруженных кластерах на проточной ячейке для машинного обучения. Наконец, на ряде данных секвенирования для приборов MiSeq Illumina и Нанофор СПС показана перспективность метода машинного обучения для решения задачи base-calling.

секвенирование нового поколения \ base-calling \ биоинформатика \ машинное обучение

Похожие статьи в разделе Аналитическая химия

КОРРЕКЦИЯ ФЛУОРЕСЦЕНТНЫХ СИГНАЛОВ, ИСКАЖЕННЫХ НАЛОЖЕНИЕМ СПЕКТРАЛЬНЫХ ПОЛОС, В СЕКВЕНАТОРЕ НАНОФОР СПС
КОРРЕКЦИЯ ФЛУОРЕСЦЕНТНЫХ СИГНАЛОВ, ИСКАЖЕННЫХ НАЛОЖЕНИЕМ СПЕКТРАЛЬНЫХ ПОЛОС, В СЕКВЕНАТОРЕ НАНОФОР СПС

В. В. Манойлов, А. Г. Бородинов, А. Я. Логинов, А. И. Петров, И. В. Заруцкий, В. Е. Курочкин,

ПОКОЛЕНИЯ МЕТОДОВ СЕКВЕНИРОВАНИЯ ДНК (ОБЗОР)
ПОКОЛЕНИЯ МЕТОДОВ СЕКВЕНИРОВАНИЯ ДНК (ОБЗОР)

А. Г. Бородинов, В. В. Манойлов, И. В. Заруцкий, А. И. Петров, В. Е. Курочкин

Применение методов машинного обучения в задаче секвенирования генома
Применение методов машинного обучения в задаче секвенирования генома

Смагин Василий Денисович, Русакович Артем Николаевич

Алгоритмы первичного анализа локальных объектов флуоресценции в секвенаторе ДНК «Нанофор СПС»
Алгоритмы первичного анализа локальных объектов флуоресценции в секвенаторе ДНК «Нанофор СПС»

Владимир Владимирович Манойлов, Андрей Геннадьевич Бородинов, Игорь Вячеславович Заруцкий, Александр Иванович Петров, Алексей Сергеевич Сараев, Владимир Ефимович Курочкин

Короткий адрес: https://sciup.org/14127386

IDS: 14127386   |   УДК: 543.07   |   DOI: 10.15622/ia.21.3.5