Обучение с подкреплением для задачи позиционирования манипулятора с анизотропной функцией награды

Автор: Полещук Ф.А., Соколов С.В.

Журнал: Труды Московского физико-технического института @trudy-mipt

Рубрика: Механика

Статья в выпуске: 2 (70) т.18, 2026 года.

Бесплатный доступ

Рассматривается задача достижения рабочим органом пространственного манипулятора заданной целевой точки методом глубокого обучения с подкреплением. Ключевая особенность предлагаемого подхода – анизотропная функция награды, основанная на разложении ошибки на продольную и поперечную компоненты. Поперечная ошибка ограничивается текущим расстоянием до цели, что создаёт «воронку» допустимых боковых и вертикальных отклонений. Такая метрика позволяет агенту использовать кинематическую избыточность манипулятора для сокращения продольной дистанции, не допуская при этом чрезмерного удаления от целевого направления. Обучение проводится современным актор-критическим алгоритмом. Визуализация траекторий подтверждает гибкость и плавность получаемых движений.

Глубокое обучение с подкреплением, пространственный манипулятор, анизотропная награда, достижение цели, кинематическая избыточность, воронка ошибок

Короткий адрес: https://sciup.org/142248255

IDR: 142248255   |   УДК: 681.5:004.8

Reinforcement learning for a manipulator positioning problem with an anisotropic reward function

This paper addresses the problem of a spatial manipulator reaching a given target point using deep reinforcement learning. The key novelty of the proposed approach is an anisotropic reward function that decomposes the positioning error into longitudinal and transverse components. The transverse error is bounded by the current distance to the target, thereby creating a «funnel»of admissible lateral and vertical deviations. This metric allows the agent to exploit the kinematic redundancy of the manipulator to reduce the longitudinal distance while preventing excessive deviation from the target direction. Training is performed with a modern actor-critic algorithm. Visualisation of the resulting trajectories confirms the flexibility and smoothness of the learned motions.

Текст научной статьи Обучение с подкреплением для задачи позиционирования манипулятора с анизотропной функцией награды

Задача перемещения схвата манипулятора в заданную точку рабочей зоны лежит в основе большинства промышленных и сервисных роботизированных операций. Классические методы, опирающиеся на аналитическое или численное решение обратной кинематической

(с) Полещук Ф.А., Соколов С. В., 2026

  • (с) Федеральное государственное автономное образовательное учреждение высшего образования «Московский физико-технический институт (национальный исследовательский университет)», 2026

  • 2.    Постановка задачи

задачи и последующее планирование траектории, чувствительны к точности модели и вычислительно затратны. Обучение с подкреплением (Reinforcement Learning, RL) предлагает альтернативу: агент обучается непосредственно из опыта взаимодействия со средой, не требуя полной модели динамики и обратных кинематических преобразований [1, 2]

Центральную роль в RL играет функция награды, задающая критерий качества поведения. Проектирование награды является одним из наиболее критических этапов применения RL в робототехнике, поскольку именно она определяет, какое поведение будет освоено агентом [3]. В задачах позиционирования естественной метрикой является евклидово расстояние до цели, но оно симметрично по всем осям. Между тем рабочая зона манипулятора, как правило, анизотропна: основное направление подхода к объекту выделено конструктивно, а боковые и вертикальные смещения могут быть скорректированы за счёт избыточных степеней свободы. Следовательно, изотропная метрика не отражает истинные приоритеты задачи и может неоправданно жёстко ограничивать свободу манёвра.

Идея анизотропного масштабирования ошибок в награде была ранее предложена для неголономного колесного робота [4] и показала высокую эффективность. В данной работе этот принцип переносится на трёхмерный манипулятор с шестью вращательными степенями свободы, но с существенной модификацией: поперечная ошибка не просто ослабляется, а ограничивается сверху продольной составляющей. Это формирует коническую область допустимых отклонений, ширина которой пропорциональна расстоянию до цели. Основной вклад заключается в обосновании и экспериментальной проверке того, что такая структура награды позволяет агенту строить гибкие траектории, сокращая продольную дистанцию до цели, но не позволяя отклонениям становиться несоразмерно большими.

Объектом управления является манипулятор с шестью вращательными парами. Его конфигурация описывается вектором обобщённых координат q G R6, каждый элемент которого ограничен механическими упорами: (/min ^ qt ^ qmnax. Положение рабочего органа (схвата) в трёхмерном пространстве определяется нелинейным отображением прямой кинематики pee = f(q). Вследствие избыточности (dim q > dimpee) одно и то же положение схвата может быть достигнуто бесконечным числом конфигураций.

Целевая точка g 'задаётся случайным образом в ptибочей 'зоне, вытянутой вдоль оси ж (направление вперёд от основания). Задача считается успешно выполненной, когда расстояние ||g — pee|| становится меньше порога е.

Управление осуществляется в дискретном времени с постоянным шагом At. На каждом шаге агент формирует действие a G [—1,1]6, которое интерпретируется как инкремент обобщённых координат:

q<“ ^= q + ^ a. (1)

Полученное командное значение ограничивается по каждому суставу и подаётся на сервоприводы, реализующие позиционное управление. Подобный подход инкрементального управления широко используется в задачах RL для манипуляторов, поскольку снижает размерность пространства действий и повышает стабильность обучения [1, 5].

Наблюдение, предоставляемое агенту, включает синусы и косинусы углов (чтобы избежать разрывности углового представления), обобщённые скорости, текущую цель, положение схвата и предыдущее действие. Таким образом, агент располагает полной информацией о мгновенном кинематическом состоянии и задании, но не имеет явной модели динамики.

3.    Анизотропная функция награды с ограничением поперечной ошибки

Вместо традиционной изотропной награды г = — |g — pee|| мы конструируем награду, которая по-разному учитывает продольную и поперечную составляющие вектора ошибки. Пусть e = g — pee — текущий вектор ошибки, d = |e|. Определим направление на цель u = e/d (при d > 0). Тогда ошибку можно разложить на продольную и поперечную компоненты:

е^ = e u = d,     e ± = e - ер,      df = ||e f|.                     (2)

Ключевая идея состоит в том, чтобы не просто ослабить штраф за поперечную ошибку, а ограничить её влияние величиной продольной ошибки. Для этого вводится эффективная поперечная ошибка:

df = max(0 , df d).                               (3)

Когда df C d. поперечная ошибка полностью игнорируется — df = 0. Ес.тн же df > d. то в штраф входит только превышение над d, то есть df = df d. Таким образом, боковые и вертикальные отклонения начинают штрафоваться только тогда, когда они становятся больше текущего расстояния до цели. Геометрически это задаёт коническую «воронку» с вершиной в целевой точке: внутри конуса ( df C d) агент не получает штрафа за поперечные смещения, а при выходе за его пределы штраф растёт линейно по величине нарушения.

Базовая награда принимает вид

Паse = — ^d2 + ( с • df ) 2,                               (4)

где коэффициент с усиливает штраф за превышение поперечного порога, делая выход за пределы воронки ощутимым.

Физическая интерпретация такой награды: формируется анизотропная потенциальная яма с плоским дном внутри конуса допустимых отклонений (рис. 1). Пока робот движется внутри конуса, он «не чувствует» поперечных сил и может свободно маневрировать, используя избыточность для скорейшего сокращения продольного расстояния d. При попытке слишком сильно отклониться (выйти из воронки) возникает резкий возвращающий градиент. Это сочетает свободу бокового манёвра с гарантией глобальной сходимости к цели — целевая точка остаётся единственным минимумом.

К базовой награде добавляются регуляризационные компоненты, обеспечивающие плавность и безопасность движений [3]:

  • •    штраф за резкие изменения управления: —Aa|a|2;

  • •    квадратичный штраф за выход суставов за допустимые пределы;

  • •    штраф за самопересечения звенвев;

  • •    терминальный бонус +В при достижении е-окрестности цели.

  • 4.    Алгоритм обучения

Совокупная награда на каждом шаге:

г = rba8е- Mal2 - Ау £(max(0,gmin - qi) + max(0,^ - qmax)2) -       ...

tl

^c • Icollision + В Id

Для обучения используется алгоритм CrossQ [6] — вариант мягкого актор-критика (Soft Actor-Critic, SAC) [7], в котором применяется пакетная нормализация в сетях критика и отсутствуют целевые сети (target networks). CrossQ достигает современного уровня эффективности выборки при отношении числа обновлений к числу взаимодействий со средой (UTD), равном 1, что существенно снижает вычислительные затраты по сравнению с аналогами, такими как REDQ и DroQ, требующими высоких UTD-значений [6]. Эффективность CrossQ была дополнительно подтверждена в работах по масштабированию алгоритма с использованием нормализации весов [8].

Алгоритм SAC [7], лежащий в основе CrossQ, хорошо зарекомендовал себя в задачах управления роботами-манипуляторами благодаря встроенному механизму максимизации энтропии, который автоматически балансирует исследование и эксплуатацию [5, 9].

Для ускорения сбора данных обучение ведётся параллельно в нескольких экземплярах среды. Оценка качества агента периодически выполняется на отдельном экземпляре среды.

5.    Результаты и обсуждение

На рисунке 2 показаны траектории схвата, записанные в нескольких тестовых эпизодах после обучения агента с предложенной функцией награды. Отчётливо видно, что траектории не являются прямолинейными — на начальном этапе агент может заметно отклоняться по осям у и z, используя избыточность манипулятора для скорейшего продвижения вперёд. Благодаря механизму «воронки» поперечные смещения остаются соразмерными текущему расстоянию до цели; как только отклонение пытается превысить продольную дистанцию, включается штраф, возвращающий схват внутрь допустимого конуса. По мере приближения цели ширина воронки сужается, и траектория стягивается к целевой точке без лишних осцилляций.

Важно отметить следующие качественные особенности:

  • •    Движения остаются плавными на всём протяжении, что подтверждается отсутствием изломов на следе маркеров и достигается благодаря малому весу штрафа за резкие действия.

  • •    Ни в одном из показанных эпизодов не зафиксировано самопересечений звеньев, что говорит о корректной работе штрафа за коллизии.

  • •    Во всех случаях финальное расстояние до цели оказывается меньше порогового значения е, то есть задача надёжно решается.

Полученные результаты подтверждают исходную гипотезу: ограничение поперечной ошибки продольной составляющей позволяет агенту вырабатывать гибкие стратегии, эффективно использующие кинематическую избыточность манипулятора, и при этом гарантирует устойчивую сходимость к цели.

Рис. 2. Примеры траекторий схвата, полученных после обучения агента с предложенной анизотропной наградой. Видно, как боковые и вертикальные смещения остаются внутри конической воронки, а по мере приближения к цели траектория стягивается к целевой точке

6.    Заключение

В работе предложен и экспериментально апробирован подход к обучению манипулятора с шестью вращательными степенями свободы решению задачи достижения целевой точки методом глубокого обучения с подкреплением. Ключевым элементом подхода является анизотропная функция награды, которая разлагает ошибку на продольную и поперечную составляющие и ограничивает штраф за поперечную ошибку текущим расстоянием до цели. Это создаёт «воронку» допустимых отклонений и позволяет агенту использовать избыточность системы для быстрого сокращения продольной дистанции, не допуская при этом несоразмерно больших боковых смещений. Эксперименты демонстрируют плавные, безопасные и успешные траектории, что открывает путь к дальнейшему развитию метода — включению ориентации схвата в целевую задачу и переносу обученных политик на реальных роботов [10, 11].