Использование нейросетевых технологий для оптимизации пользовательского опыта в мобильных приложениях

Бесплатный доступ

В работе приведен анализ отечественных и зарубежных источников, подтверждающий потенциал нейросетевых технологий для решения задач оптимизации пользовательского опыта в мобильных приложениях. Предлагается комплексный подход, включающий выбор оптимального сочетания различных архитектур нейронных сетей, формулировку задачи в терминах оптимизации, а также выбор адекватных функций потерь для оптимизации различных аспектов пользовательского опыта. В результате проведенного исследования разработана математическая модель гибридной архитектуры (Transformer и LSTM), сочетающая рекуррентную часть (LSTM) для учёта временной структуры и механизм внимания (Transformer-encoder) для детального анализа контекстных признаков. Для оценки эффективности предлагаемой гибридной модели приведены результаты сравнения с альтернативными моделями, которые показали оптимальные значения по выбранным показателям. Реализованная модель интегрирована в мобильное приложение: результаты A/B-тестирования подтвердили значительную оптимизацию основных метрик пользовательского опыта.

пользовательский опыт \ оптимизация пользовательского опыта \ машинное обучение \ глубокое обучение \ архитектура нейронной сети \ взаимодействие с пользователем \ поведение пользователя

Короткий адрес: https://sciup.org/140316420

IDS: 140316420   |   УДК: 004.8   |   DOI: 10.18469/ikt.2026.24.1.11

Using neural network technologies to optimize mobile app user experience

This paper analyzes domestic and international sources confirming the potential of neural network technologies for solving user experience optimization problems in mobile applications. A comprehensive approach is proposed, including selecting the optimal combination of various neural network architectures, formulating the problem in terms of optimization, and selecting adequate loss functions to optimize various aspects of the user experience. As a result of the research, a mathematical model of a hybrid architecture (Transformer and LSTM) was developed, combining a recurrent part (LSTM) to account for the temporal structure and an attention mechanism (Transformer-encoder) for a detailed analysis of contextual features. To evaluate the effectiveness of the proposed hybrid model, the results of a comparison with alternative models are presented, which showed optimal values for the selected metrics. The implemented model has been integrated into the mobile application: the results of A/B testing confirmed significant optimization of the main user experience metrics.

Текст научной статьи Использование нейросетевых технологий для оптимизации пользовательского опыта в мобильных приложениях

В результате развития мобильных технологий наблюдается неуклонный рост количества и разнообразия приложений, ориентированных на удовлетворение потребностей широкой аудитории. В условиях высокой конкуренции особое значение приобретает оптимизации пользовательского опыта (User Experience, UX), который всё чаще становится решающим фактором при выборе и регулярном использовании мобильных приложений. Использование нейросетевых технологий для решения данной задачи обеспечивает возможность автоматизации процесса анализа данных, прогнозирования поведения пользователей, персонализации интерфейса приложения и контента [1].

В этой связи цель настоящего исследования – разработка математической модели на основе нейросетевых технологий для оптимизации UX в мобильных приложениях.

Определим задачи исследования.

  • 1.    Провести обзор существующих исследований в области применения нейронных сетей для оптимизации UX.

  • 2.    Разработать математическую модель.

  • 3.    Провести экспериментальное тестирование модели на реальных данных и оценить её эффективность.

  • 4.    Сравнить предложенный подход с альтернативными моделями.

Анализ исследований в области использования нейросетевых технологий для оптимизации UX

В последние годы наблюдается значительное увеличение числа публикаций, рассматривающих применение методов искусственного интеллекта и глубокого обучения для оптимизации UX [2]. В работе [3] обобщены фундаментальные основы построения и обучения нейронных В результате развития мобильных технологий наблюдается неуклонный рост количества и разнообразия приложений, ориентированных на удовлетворение потребностей широкой аудитории сетей, начиная с базовых многослойных перцептронов и заканчивая современными архитектурами, применимыми в различных областях.

Широкое распространение получили исследования, посвящённые персонализации интерфейса, рекомендательным системам и адаптации мобильных приложений в реальном времени. Так, в [4] указывается, что глубокие модели, использующие коллаборативную фильтрацию, значительно повышают точность рекомендаций в мобильных сервисах. Одновременно с этим в исследованиях [5] отмечается, что применение нейронных сетей для анализа пользовательской активности позволяет выявлять паттерны пове-

дения и более глубоко понимать динамику взаимодействия пользователей с приложением.

Тем не менее, далеко не во всех работах уделяется достаточное внимание формализации математических моделей и чёткому определению метрик, позволяющих количественно оценивать вклад алгоритмов глубокого обучения в улучшение UX. В ряде публикаций, например, [6], подчёркивается необходимость комплексного подхода, который включал бы сравнительный анализ различных архитектур нейронных сетей, формулировку задач в терминах оптимизации, а также выбор адекватных функций потерь.

Исходя из вышеизложенного, далее рассмотрим основные архитектуры нейронных сетей, нашедших применение в сфере улучшения пользовательского опыта мобильных приложений. Современные приложения машинного обучения всё чаще обращаются к глубоким нейронным сетям, поскольку именно они наиболее эффективны при анализе больших массивов разнородных данных (клики, изображения, тексты, временные ряды) [7].

  • 1.    Сверточные нейронные сети (CNN).

  • 2.    Рекуррентные нейронные сети (RNN).

  • 3.    Трансформеры (Transformers).

  • 4.    Автокодировщики (Autoencoders).

CNN активно используются при анализе изображений в мобильных приложениях: они позволяют распознавать жесты пользователя, анализировать скриншоты, а также выявлять визуальные паттерны, которые могут указывать на предпочтения пользователей.

RNN, включая LSTM (Long Short-Term Memory) и GRU (Gated Recurrent Unit), эффективно обрабатывают последовательные данные. Это может быть история взаимодействия пользователя с приложением во временной перспективе. При этом LSTM обычно лучше сохраняют долгосрочные зависимости, что важно, если поведение пользователя имеет сезонный или регулярный характер.

Первоначально использовались в задачах обработки естественного языка, но сейчас всё чаще применяются к любым данным, где важно выявлять сложные зависимости. Механизм внимания (self-attention) помогает моделировать контекст на всех уровнях одновременно, что полезно при анализе многомерных поведенческих признаков (действия, тексты запросов, реакции в разных сценариях приложения).

Используются для снижения размерности, извлечения скрытых признаков и очистки данных от шума. В UX-задачах автокодировщики помогают выявлять аномалии или формировать сжатые векторные представления поведения пользователя.

На основе сочетания различных архитектур разрабатываются гибридные системы, что обеспечивает возможность комплексного анализа различных типов сигналов (визуальных, текстовых, временных). В частности, в [8] успешно сочетают свёрточные слои для распознавания жестов с рекуррентными для учёта последовательности движений пользователя.

Понимание основных архитектур необходимо для изучения реальных реализованных систем и получения представления о том, какие именно задачи ставят перед собой исследователи и разработчики при улучшении UX.

На основе проведённого обзора литературы можно сформулировать подход, позволяющий объединить достоинства различных архитектур.

Выбор архитектуры нейронной сети

Для систематического изучения улучшения UX с помощью нейронных сетей следует формально описать процесс взаимодействия пользователя с приложением. Предположим, что пользователь совершает ряд действий { xt }г _ в течение некоторого времени T . Задача – предсказать целевую переменную yt , отражающую качество пользовательского опыта (например, вероятность выполнения целевого действия или уровень удовлетворённости).

Предлагается использовать гибридную архитектуру, сочетающую рекуррентную часть (LSTM) для учёта временной структуры и механизм внимания (Transformer-encoder) для детального анализа контекстных признаков:

ht _ Attention ( Embedding ( xt ) ) Ф LSTM ( xt ) , (1)

yt _ MLP ( h t ) , (2)

где ht – обозначает конкатенацию двух векторных представлений (из блока Attention и блока LSTM);

MLP – полносвязная нейронная сеть, выполняющая прогноз на основе объединённого представления.

Подобная модель позволяет эффективно учитывать как последовательную природу взаимодействия с приложением, так и выделять наиболее важные признаки на каждом шаге (позиция элемента в интерфейсе, предыдущие действия, контекст устройства). В итоге повышается точность предсказания того, как пользователь будет реагировать на изменения интерфейса.

Определение параметров модели

Рассмотрим задачу оптимизации UX в терминах минимизации функции потерь. Пусть yt e R - непрерывная величина (оценка удовлетворённости) или вероятность некоторого целевого события (покупка, подписка, клик). Тогда задача обучения сводится к нахождению параметров модели 0, минимизирующих сумму квадратов ошибок (MSE) или кросс-энтропии (CE), в зависимости от характера yt :

0 = arg min0 X . 1 L ( f . ( X t ) > y ) .      (3)

Если yt – вероятность выполнения целевого действия, используют функцию потерь в виде кросс-энтропии:

  • L = - X , =i ( y . • log y . + ( 1 - y . ) log ( 1 - y . ) ) . (4)

В случае, когда требуется предсказывать сразу несколько показателей (например, уровень удовлетворённости и вероятность покупки), задачу можно рассматривать как многозадачное обучение (Multi-Task Learning):

L oa, = a- L i + e - L 2 ,             (5)

где L 1 и L 2 – разные функции потерь для каждой из подзадач (например, MSE и CE);

  • a , в — соответствующие веса.

Это позволяет совместно оптимизировать различные аспекты UX, используя комбинацию функций потерь с соответствующими весами. При этом оптимальный выбор комбинации определяет эффективность оптимизации UX с использованием предложенной математической модели.

Методы сбора и подготовки данных для обучения нейронной сети

События взаимодействия (event logs). Все клики и жесты пользователя (с указанием временных меток) записываются в защищённую базу данных, после чего анонимизируются.

Контекстные данные. Информация о геопозиции, состоянии сети, уровне заряда батареи, акселерометре может играть важную роль в некоторых сценариях (особенно в транспортных или геолокационных сервисах).

Демографические и социальные признаки. С согласия пользователя можно собирать возраст, пол и интересы, которые кодируются в виде векторов (One-Hot или эмбеддинги).

Анализ текстовых отзывов. Для извлечения смысловых признаков из текстов часто используется BERT или другой трансформер, генерирующий векторное представление каждого отзыва.

Разделение на обучающую, валидационную и тестовую выборки. Для того, чтобы избежать переобучения и утечки информации, набор данных делится в соотношении 70:15:15 (или 80:10:10 в зависимости от объёма). При этом важно соблюдать хронологический порядок, если данные имеют временную структуру (таблица 1).

После первичного сбора данных их необходимо агрегировать (например, сессии пользователя за один день), очистить от аномалий и пропущенных значений и преобразовать в формат, удобный для подачи в нейронную сеть [9; 10].

Таблица 1. Пример структуры данных, используемых для обучения

Поле (Feature)

Тип данных

Пример значения

Описание

User_ID

Категориальный (ID)

12345

Уникальный идентификатор пользователя

Event_Time

Временной (timestamp)

2025-01-14 12:30:05

Штамп времени события

Event_Type

Категориальный

click, view, scroll

Тип действия пользователя

Screen_ID

Категориальный (ID)

screen_main, screen_cart

Идентификатор экрана или раздела приложения

Geo_Location

Геоданные (шир., долг.)

(55.7558, 37.6173)

Географические координаты (Москва)

Network_State

Категориальный

WiFi, LTE

Тип подключения к сети

Battery_Level

Числовой (0–100)

75

Процент заряда батареи

Purchase_Completed

Бинарный (0 или 1)

0

Целевая переменная (совершил ли пользователь покупку)

Satisfaction_Rating

Числовой (1–5)

4

Самооценка удовлетворённости, если пользователь её оставляет

Метрики для оценки качества модели

– Метрики для оценки моделей классификации: точность классификации (Accuracy), F1-мера (F1-score), площадь под ROC-кривой (AUC-ROC). Используются, если целевая переменная – событие (например, завершил ли пользователь покупку или нет) [11].

– Метрики для оценки моделей регрессии: средняя абсолютная ошибка (Mean Absolute Error, MAE), средняя квадратическая ошибка (Mean Squared Error, MSE), среднеквадратическая ошибка (Root Mean Squared Error, RMSE). Актуальны для предсказания количественных показателей (например, оценки удовлетворённости).

– Метрики, ориентированные на пользователя: время, проведённое в приложении; показатель удержания (Retention Rate); коэффициент конверсии (Conversion Rate); индекс лояльности пользователей (Net Promoter Score, NPS).

Сочетание классических метрик машинного обучения и UX-ориентированных показателей позволяет получить всестороннее представление о работе модели и её вкладе в улучшение пользовательского взаимодействия.

Проведение вычислений: обучение нейронной сети на выбранных данных

Для проверки разработанной модели были собраны данные из мобильного приложения, ориентированного на электронную коммерцию (покупка товаров повседневного спроса). Общая длительность сбора информации составила 6 месяцев, в результате чего получилось около 2 миллионов анонимизированных записей о пользовательских сессиях.

Приведем параметры эксперимента.

  • 1.    Разделение набора данных:

    – обучающая выборка – 70 %;

    – валидационная выборка – 15 %;

    – тестовая выборка – 15 %.

  • 2.    Архитектура модели:

    – один блок LSTM (128 скрытых нейронов)

  • 3.    Функция потерь, в зависимости от задачи:

    – для предсказания вероятности покупки (бинарный выход) использовалась кросс-энтропия;

    – для оценки удовлетворённости (от 1 до 5) использовалась MSE. В задаче многозадачного обучения – комбинация этих потерь.

  • 4.    Оптимизатор (алгоритм для незначительного изменения параметров – веса, скорость обу-чения):Adam с начальными настройками ц = 10 3, Д = 0,9, в = 0,999.

  • 5.    Регуляризация: L 2 -норма ( А = 10-4 для избежания переобучения).

для анализа временной последовательности действий пользователя;

– блок внимания (Multi-Head Attention) с 4 головами и размерностью эмбеддингов 64;

– полносвязный слой (MLP) с 2 скрытыми слоями по 64 нейрона.

Приведем результаты обучения на основе представленных параметров.

Модель обучалась в течение 30 эпох на GPU-сервере. На практике для мобильного приложения вес финальной модели был оптимизирован методами квантования (int8) и вырезки нейронов (pruning) ради снижения памяти при инференсе. В таблице 2 приведена динамика изменения ключевых метрик на валидационной выборке после нескольких эпох обучения.

Таким образом, за первые 10 эпох наблюдается стремительное снижение функции потерь и рост F1-score, что говорит об успешной настройке параметров модели. Начиная с 15 эпохи, улучшения идут более плавно, но регуляризация предотвращает заметное переобучение. RMSE по удовлетворённости также последовательно уменьшается, что свидетельствует о росте точности в задаче регрессии.

Далее рассмотрим влияние ключевых гиперпараметров на качество итогового решения и сравним данную модель с альтернативными подходами.

Таблица 2. Динамика изменения ключевых метрик на валидационной выборке

Эпоха

Loss (суммарный)

F1-score (покупка)

RMSE (удовлетворённость)

5

0,42

0,72

0,95

10

0,35

0,78

0,83

15

0,29

0,82

0,77

20

0,28

0,84

0,73

25

0,27

0,85

0,72

30

0,26

0,86

0,70

Оценка влияния гиперпараметров модели на конечные результаты

Основными гиперпараметрами, определяющими эффективность модели, выступают:

  • 1.    Число голов внимания n heads . При ^ds = 1 механизм внимания упрощается, что ограничивает способность к выделению разных аспектов входной информации. Увеличение nheads выше 8 приводит к существенному росту вычислительной нагрузки при незначительном выигрыше в качестве.

  • 2.    Размер скрытого слоя в LSTM hiddensize . При слишком маленьком значении (< 64) модель плохо запоминает долгосрочные зависимости; слишком большое значение (> 256) повышает риск переобучения и увеличивает время обучения.

  • 3.    Коэффициент регуляризации ( А ). При А = 0 модель быстро переобучается, при слишком большом А ( > 10 - 2 ) наблюдается рост ошибки на всех выборках.

Приведем пример численного анализа.

Пусть мы варьируем hiddensize от 32 до 256 с шагом 64 (32, 96, 160, 224), фиксируя прочие параметры. Представим средние по запускам результаты замера итогового F1-score (для покупки) и RMSE (для удовлетворённости) в таблице 3.

Таблица 3. Результаты

hiddensize

F1-score

RMSE

32

0,78

0,81

96

0,82

0,75

160

0,85

0,72

224

0,86

0,71

Таким образом, наблюдается монотонное улучшение метрик с ростом размерности скрытого слоя, однако наибольший «скачок» происходит при переходе от 32 к 96 и от 96 к 160. Увеличение до 224 даёт меньший прирост (0,01 по F1-score и 0,01 по снижению RMSE).

При   hiddensize = 224 заметно возросло время обучения (до + 25 % по сравнению с hiddensize = 160), поэтому выбранным компромиссом стало значение 160.

Сравнение с альтернативными моделями

Для оценки эффективности предлагаемой гибридной модели (Transformer и LSTM) сравним её с рядом альтернатив (таблица 4).

  • 1.    Линейная регрессия – простая и быстрая, но неспособна отразить нелинейность и временную структуру пользовательских данных.

  • 2.    Многослойный перцептрон (MLP). Учитывает нелинейность, однако не использует механизмы памяти или внимания, что ограничивает эффективность на последовательных данных.

  • 3.    Чистая RNN (LSTM). Сохраняет временные зависимости, но не имеет механизма внимания, что может приводить к недостаточному учёту контекстных факторов (например, типа экрана или внешних условий).

  • 4.    CNN и LSTM. Часто используется для анализа визуальных сигналов (свертка) и временных рядов (LSTM). Однако без механизма внимания бывает сложно выделять наиболее важные фрагменты при большом количестве гетерогенных признаков.

Таким образом, предлагаемая гибридная модель демонстрирует наивысшую F1-score и минимальную RMSE, что свидетельствует о более точном учёте как временной, так и контекстной информации. Время обучения несколько выше, чем у CNN и LSTM, но разница (0,5 часа) оправдывается ростом показателей на 3–4 % (по F1-score) и ещё более заметным улучшением удовлетворённости по метрике RMSE.

Результаты тестирования приложения

Реализованная модель была интегрирована в мобильное приложение в рамках A/B-тестирова-ния: 50 % пользователей продолжали взаимодействовать со старой версией, а 50 % – с новой. В течение двух месяцев фиксировались основные метрики.

Таблица 4. Итоговые результаты на тестовом наборе

Модель

F1-score (Покупка)

RMSE (Удовл.)

Время обучения (ч)

Линейная регрессия

0,64

1,10

0,5

MLP (2 слоя)

0,70

0,95

1,0

LSTM (классическая)

0,82

0,78

2,0

CNN и LSTM

0,83

0,75

3,0

Transformer и LSTM

0,86

0,70

3,5

– Конверсия (Conversion Rate) – доля пользователей, совершивших покупку.

– Показатель удержания (Retention Rate) – доля пользователей, вернувшихся в приложение в течение недели.

– Индекс лояльности пользователей (NPS) – разница между долей «промоутеров» и «критиков» по опросам внутри приложения.

Результаты приведены в таблице 5:

  • – конверсия выросла на 3,5 %, что соответствует увеличению выручки в среднем на 15– 20 % (учитывая средний чек);

    – показатель удержания увеличился с 48,5 % до 52 %, что говорит о сокращении оттока пользователей;

    – индекс лояльности пользователей вырос на 7 пунктов, указывая на рост лояльности и готовность рекомендовать приложение.

Таблица 5. Результаты исследования

Группа

Conversion Rate

Retention Rate

NPS

Старая модель

12,0 %

48,5 %

35

Новая модель

15,5 %

52,0 %

42

В дополнение к метрикам выше, разработчики обычно оценивают скорость отклика приложения (особенно при использовании серверных API для инференса), а также анализируют тональность отзывов. По данным анализа (BERT-модель), процент негативных упоминаний в отзывах снизился с 25 % до 18 %, а положительных вырос с 50 % до 57 %.

Заключение

В результате проведенного исследования предложена математическая модель гибридной архитектуры (Transformer и LSTM), которая обеспечивает оптимизацию пользовательского опыта в мобильных приложениях с учетом временной структуры, а также контекстных особенностей взаимодействия.

Результаты A/B-тестирования приложения показали рост конверсии, показателя удержания пользователей и индекса лояльности пользователей, что свидетельствует о реальном вкладе модели в улучшение UX. Т.е. преимущества от внедрения могут выражаться в увеличении выручки, росте репутации (оценки, отзывы), снижении затрат на удержание пользователей.

Таким образом, проведённое исследование показывает, что использование нейросетевых технологий для анализа поведения пользователей в мобильных приложениях – это эффективный инструмент для оптимизации пользовательского опыта и повышения конкурентоспособности мобильного приложения.

Несмотря на преимущества предложенного решения, остаются некоторые недостатки, которые являются направлениями для дальнейших исследований:

– требуется периодическое обновление предложенной модели по причине изменения паттернов поведения пользователей;

– сложность обеспечения приватности данных при обучении модели, поскольку нейронным сетям зачастую требуются большие объёмы пользовательских сведений. Требуется использование федеративных и дифференциально-приватных методов обучения, позволяющих обрабатывать данные на устройствах пользователей без передачи на центральный сервер;

– требуется оптимизация разработанной модели для снижения вычислительной нагрузки на мобильном устройстве.