Улучшенное Q-обучение для навигации по сетке, использующее априорные приоритеты направлений, выбор маршрутов методом отжига и оптимизацию вознаграждений на основе потенциальной достижимости цели

Бесплатный доступ

В статье представлен улучшенный вариант Q-обучения для навигации по сетке при наличии препятствий. Основываясь на стандартном табличном Q-обучении, предложены три ключевых улучшения: инициализация Q-таблицы с учетом направления к цели, дающее согласование с целью без необходимости предварительного знания о препятствиях; модифицированная стратегия отжига Больцмана, расширенная включением верхнего доверительного предела «энергии» системы для более сбалансированного и адаптивного отбора направления движения; функция расчета вознаграждения на основе потенциала, дающая более тесную обратную связь для ускорения процесса обучения. Отмеченные улучшения повышают эффективность Q-обучения в условиях относительно редких случаев вознаграждения при достижении цели, что связано с неэффективным исследованием области поиска и медленным формированием значений Q-функции. Экспериментальная проверка на случайно сгенерированных сетках, показала, что предложенный в статье подход обеспечивает более успешные конечные результаты, связанные с отысканием более коротких путей к цели и более быстрой сходимостью в сравнении с известными базовыми методами, такими как стандартное Q-обучение и его вариантами. Описанный в статье подход обеспечивает общую модельно-независимую природу Q-обучения и его достаточно высокую эффективность, что важно для практических приложений в робототехнике и планировании маршрутов движения.

Обучение с подкреплением, инициализация таблицы Q, планирование маршрута, компромисс между разведкой и эксплуатацией, постоянное вознаграждение, сетчатая карта

Короткий адрес: https://sciup.org/14138550

IDR: 14138550   |   УДК: 004.021   |   DOI: 10.15622/ia.25.4.9