Экспериментальное сравнение методов векторизации текста для задачи классификации тональности отзывов

Захарова О.И. Бедняк С.Г. Канунников Я.Д.

Журнал: Инфокоммуникационные технологии @ikt-psuti

Рубрика: Новые информационные технологии

Статья в выпуске: 1 (93) т.24, 2026 года.

Бесплатный доступ

В работе представлено сравнительное исследование эффективности различных методов векторизации текста для задачи анализа тональности (Sentiment Analysis) на русскоязычных данных. Рассмотрены три категории методов: частотные (TF IDF, N-grams), статистические, основанные на word embeddings (Word2Vec, FastText), и современные контекстуальные методы на основе трансформеров (BERT). Проведен теоретический анализ преимуществ и недостатков каждого подхода с точки зрения качества классификации, скорости обучения и инференса, а также требований к вычислительным ресурсам. Практическая часть исследования включает реализацию пайплайна обработки текста и обучения классификаторов (логистическая регрессия и наивный байесовский классификатор) с использованием различных методов векторизации на датасете русскоязычных отзывов с маркетплейса. В качестве метрик оценки использовались точность (accuracy), F1-мера и время работы. Результаты экспериментов наглядно демонстрируют, что контекстуальные методы (BERT) обеспечивают значительный прирост качества на сложных, неоднозначных текстах, однако требуют на несколько порядков больше вычислительного времени и ресурсов. Частотные методы показывают высокую скорость и удовлетворительное качество на больших объемах четко структурированных данных. Статистические embeddings являются компромиссным решением.

анализ тональности \ векторизация текста \ TF-IDF \ Word2Vec \ FastText \ BERT \ машинное обучение \ NLP \ русскоязычные отзывы \ сравнительный анализ

Короткий адрес: https://sciup.org/140316416

IDS: 140316416   |   УДК: 004.89   |   DOI: 10.18469/ikt.2026.24.1.07

Experimental comparison of text vectorization methods for sentiment analysis task

The paper presents a comparative analysis of the effectiveness of various text vectorization methods for the task of Sentiment Analysis of Russian-language reviews. The study covers classical frequency-based approaches (TF IDF, n-grams), statistical models (Word2Vec, FastText), and a contextual method based on the pre-trained BERT language model. The practical part of the research includes the implementation of text processing and classification pipelines using logistic regression and Naive Bayes classifiers. Experiments are conducted on a dataset of Russian-language reviews from a marketplace. Key comparison metrics are classification accuracy (accuracy, F1-score) and model training/inference time. The results show that on small datasets, classical methods with linear models demonstrate competitive quality with significantly lower computational costs. Contextual BERT embeddings show the best quality on the test set; however, their use is justified only with sufficient data volumes and the absence of strict real-time inference constraints. Based on the analysis, recommendations are given for choosing a vectorization method depending on the data volume and system performance requirements in real time.