Об одном методе поиска экстремальных управлений в системах с фазовыми ограничениями

Бесплатный доступ

Задача оптимального управления с фазовыми ограничениями сводится к эквивалентной задаче оптимального управления с одним терминальным ограничением. Для этой задачи конструируются необходимые условия оптимальности в виде задачи о неподвижной точке. Такой вид задачи позволяет построить проекционный итерационный метод для поиска экстремальных управлений в системах с фазовыми ограничениями. Эффективность метода демонстрируется на модельном примере.

Система с фазовыми ограничениями, условия оптимальности управления, задача о неподвижной точке, итерационный метод

Короткий адрес: https://sciup.org/148333845

IDR: 148333845   |   УДК: 517.977   |   DOI: 10.18101/2304-5728-2026-2-51-60

On a Method for Searching for Extremal Controls in Systems WithPhase Constraints

An optimal control problem with phase constraints is reduced to an equivalent optimal control problem with a single terminal constraint. For this problem, the necessary optimality conditions are constructed in the form of a fixed-point problem. This type of problem allows for the construction of a projection iterative method for finding extremal controls in systems with phase constraints. The effectiveness of the method is demonstrated using a model example.

Текст научной статьи Об одном методе поиска экстремальных управлений в системах с фазовыми ограничениями

Класс задач оптимального управления с фазовыми ограничениями относится к типу сложнейших задач. Такие задачи исследовались, в частности, в работах [1–3], где для учета фазовых ограничений применялся метод штрафов, с помощью которого задачи сводились к вспомогательным задачам без ограничений. Распространенным подходом для решения задач без ограничений является построение релаксационной последовательности управлений с помощью локальных методов улучшения управления типа градиентных [4–6]. При этом на каждой итерации улучшения управления точное выполнение фазовых ограничений исходной задачи не гарантируется.

В работе [7] в классе задач оптимального управления без ограничений pазработаны методы поиска экстремальных управлений на основе поиска неподвижных точек конструируемых операторов в пространстве управлений. В настоящей работе рассматривается метод поиска экстремальных управлений в задачах оптимального управления с фазовыми ограничениями на основе поиска неподвижных точек, который характеризуется условием точного выполнения фазовых ограничений на каждой итерации.

1 Задача и метод

Рассматривается задача оптимального управления с фазовыми ограничениями:

z ( t ) = p ( z ( t ), и ( t ), t ), z ( 1 0 ) = z °, и ( t ) e U , t e T = [ 1 0 , t i ],

I(и) = Y(z(ti)) + f(z(t)>и(t)>t)dt ^ inf , J T                              и eV hi(z(t), t) < 0, 1 < i < n2,

z ( t ) = ( z i( t ),..., z n, ( t )) — вектор состояния, и ( t ) = ( u i (t ),..., u m ( t )) — вектор управляющих функций, U c R m — компактное выпуклое множество. Интервал T фиксирован. В качестве доступных управляющих функций рассматривается множество V кусочно-непрерывных на T функций со значениями в множестве U :

V = { v e PC(T ): v ( t ) e U , t e T }.

Рассматриваемая задача известными способами штрафования за нарушение ограничений может быть приведена к эквивалентной задаче следующего вида:

x(t) = f (x(t),и(t),t), x(10) = x°, и(t) e U, t e T = [10,ti],(1)

ф0(и) = %(x(ti)) + IX(x(t),и(t), t)dt ^ inf,(2)

и e V

Ф1( и) = ^i( x (ti)) = 0,(3)

в которой x ( t ) = ( x i( t ),..., xn ( t )) — вектор состояния, n = ni + n 2. Предполагается, что функции p 0(x ), ^( x ) непрерывно-дифференцируемы на Rn , функция F0(x , и , t ) и ее частные производные по x , и непрерывны по совокупности аргументов на множестве Rn х U х T . Функция f ( x , и , t ) кусочно-дифференцируема по x , и и удовлетворяет условию Липшица по x в Rn х U х T с константой L > 0:

II f ( x , и , t ) - f ( у , и , t )|| <  L ||x - у 11.

Доступное управление и e V называется допустимым, если выполняется ограничение (3). Множество допустимых управлений обозначим:

D = { v e V : O i ( v ) = ^( x ( t i )) = 0}.

Рассмотрим функционал и задачу Лагранжа:

L( Л ) = £ Л i Ф i ( u ) ^ inf, Л = ( Л 0 , Д ) е R 2 .          (4)

i = 0                   и е V

Введем функцию Понтрягина с сопряженной переменной у е R n :

HЛ (у,x,и,t) = (у, f (x,и, t)} - Fo(x,и,t), с помощью которой стандартная сопряженная система в задаче Лагранжа (4) принимает вид:

у ( t ) = - Н ( у ( t ), x ( t ), и ( t ), t ), у (t i ) = - ^ ( x ( t i )).       (5)

i = 0

Для управления v е V обозначим через x ( t , v ), t е T — решение системы (4) при и ( t ) = v ( t ). Обозначим через у Л ( t , v ) t е T — решение стандартной сопряженной системы (5) при x ( t ) = x ( t , v ), и ( t ) = v ( t ) .

Известное необходимое условие оптимальности допустимого управления и е D в форме дифференциального принципа максимума в задаче (1)-(3) при некотором векторе параметров Л = ( Л 0, Л ) ^ 0, Л 0 = 0 v 1 можно представить в виде системы уравнений:

и ( t ) = P u ( и ( t ) + a H ( у Л ( t , и ), x ( t , и ), и ( t ), t )),       (6)

Ф 1 ( x ( t i , и )) = 0.                              (7)

Система (6), (7) рассматривается как задача о неподвижной точке с дополнительным алгебраическим уравнением в пространстве доступных управлений. Такое представление дает возможность применить и модифицировать известную теорию и методы неподвижных точек для конструирования итерационного метода для решения задачи (6), (7). В частности, можно применить итерационный метод простой итерации с индексом k 0 :

ик + 1 ( t ) = P u ( ик ( t ) + а НЛ ( у Л ( t , U) ), x ( t , U) ), U( ( t ), t )),

y( x ( t i , ик + 1)) = 0.

2 Пример

Рассматривается известная задача с фазовыми ограничениями, линейная по управлению, которая исследовалась в работах [8], [9]:

Сxi (t) = и1 (t),            Сxi (0) = -1, x2 (t) = xi (t) + и2 (t), [x2 (0) = 2,

- 8 x i ( t ) 0 , - 4 x 2 ( t ) 2, t е T = [ 0,10 ] , Ф ( и ) = 3 x i ( 10 ) - x 2 ( 10 ) ^ inf,

V = { и = ( и 1, и 2) е PC ( T ): и ( t ) е U , t е T }, U = { и = ( и1 2): | и 1| <  1, 1 и 2 2}.

В работе [8] применялась комбинация методов штрафов. Для решения задач Коши использовался метод Эйлера с пересчетом (2-го порядка точности) с постоянным шагом h = 10 - 1. Стартовое управление: u 1 0 = - 1, и 20 = 1. Было получено расчетное значение целевого функционала Ф = -12.5000. При этом максимальное нарушение фазовых ограничений на сетке дискретизации имело значение M = 0.000001.

Рис. 1. Расчетные управления, полученные в [8]

Рис. 2. Расчетные траектории, полученные в [8]

В работе [9] исходная задача сводилась к задаче линейного программирования на основе кусочно-постоянной аппроксимации управления на сетке с шагом h = 10 - 1, для которой использовались многометодные вычислительные технологии. Для решения задач Коши использовался метод Рунге — Кутта 4-го порядка точности. Стартовое управление: и 1 0 = - 1, и 2 0 = 1. Было получено расчетное значение целевого функционала Ф = -12.5 . На рисунках 3 и 4 представлены найденное управление и соответствующие ему траектории фазовых переменных.

Рис . 3. Расчетные управления, полученные в [9]

Рис. 4. Расчетные траектории, полученные в [9]

В настоящей работе введением дополнительных фазовых переменных с использованием кубических штрафных функций задача сводится к эквивалентной задаче с одним терминальным ограничением-равенством:

'x i ( t ) = u i ( t ) , X 2 ( t ) = X 1 ( t ) + u 2 ( t ) , X 3 ( t ) = Q i ( x 1 ( t ) ) , _ X 4 ( t ) = Q 2 ( X 2 ( t ) ) ,

'x i ( 0 ) = — 1 x 2 ( 0 ) = 2, x 3 ( 0 ) = 0,

, X 4 ( 0 ) = 0,

t G T ,

x 3 ( t ) ,

Q 1 ( X 1 ( t ) ) = b,

X 1 ( t ) 0,

X i ( t )G [ - 8,0 ] ,

( - x i ( t )- 8 ) ,    x i ( t ) < - 8,

( X 2 ( t ) - 2 ) 3 ,       X 2 ( t ) > 2,

Q 2 ( X 2 ( t )H 0,

X 2 ( t ) g[ - 4,2 ] ,

J- x 2 ( t ) - 4 ) 3 , x 2 ( t ) <- 4, Ф ( u ) = 3 x 1 ( 10 ) - x 2 ( 10 ) ^ inf, x 3 ( 10 ) + x 4 ( 10 ) = 0.

Рассмотрим задачу без ограничений на основе регулярного функционала Лагранжа:

L ( Л , u ) = 3 x 1 ( 10 ) - x 2 ( 10 ) + Л ( x 3 ( 10 ) + x 4 ( 10 ) ) ^ inf, Л е R .

Функция Понтрягина и сопряженная система в задаче Лагранжа соответственно имеют вид:

H Л ( w , x , u , t ) = ^ 1 u + w 2 ( X 1 + u 2 ) + W 3 Q 1 ( X 1 ) + W 4 Q 2 ( x 2 ) ;

W1 (t) = -W2 (t) - W3 (t) G1 (X1 (t)), [W1 (10) = -3,

W2 (t) = -W4 (t) G2 (X2 (t)) ,

W 2 ( 10 ) = 1, W 3 ( 10W

W 4 ( 10 ) = - Л ,

W3 ( t ) = 0,

W 4 ( t ) = 0,

3 X 2 ( t ) ,

G 1 ( X 1 ( t )M 0,

X 1 ( t ) 0,

X 1 ( t ) е [ - 8,0 ] ,

- 3 ( - x 1 ( t )- 8 ) , X 1 ( t ) < - 8;

3 ( x 2 ( t ) - 2 ) 2 ,          x 2 ( t ) > 2,

G 2 ( x 2 ( t ) ) = ‘

0,

x 2 ( t ) е [ - 4,2 ] ,

- 3 ( - x 2 ( t ) - 4 ) ,      x 2 ( t ) <- 4.

В данной задаче Лагранжа ввиду линейности по управлению дифференциальный принцип максимума является эквивалентным известному принципу максимума.

Задача о неподвижной точке дифференциального принципа максимума (6), (7) в данной задаче принимает вид:

U 1 ( t ) = 4,1 < 1 ( u i ( t ) + a^ ( t,U 1 ) ) ,

U2 (t) = P1

Итерационный метод простой итерации имеет вид:

U1 k+1(t) = pu1 <1 (U1 k (t)+ aW1 (t, U1 k)) ,

U2k+1 (t) = P1

Численное решение фазовых и сопряженных задач Коши производилось методом Рунге — Кутта 4-го порядка точности. Значения управляемых, фазовых и сопряженных переменных запоминались в узлах фиксированной равномерной сетки Th на интервале T . В промежутках между соседними узлами сетки Th значение управления принималось постоянным и равным значению в левом узле.

Расчет проводился с шагом сетки дискретизации h = 10-4 при проекционном параметре a = 10-5 и стартовом управлении при к = 0 : U10=-1, u20= 1.

На каждой итерации реализация ограничения сводится к решению неявно заданного уравнения относительно множителя Ле R. Численное решение алгебраического уравнения относительно параметра Ле [-1000,1000] осуществлялось известным методом золотого сечения с точностью s = 10-7.

Критерием остановки расчета являлось достижение достаточно малого значения невязки дифференциального принципа максимума для управления uk :

t, uk)(u к+1( t) - u к+1( t))+ max ^

< 10-14.

eTh [+^2(t,uk)(uk+1(t)-uk(t))

Было получено расчетное значение целевого функционала Ф = -12.49992. При этом максимальное нарушение фазовых ограничений на сетке дискретизации составило значение M = 0.00009 . На рисунках 5 и 6 представлены графики расчетного управления и соответствующих траекторий.

Рис. 5. Расчетные (сплошные линии) и стартовые (пунктирные линии) управления

Расчетное экстремальное управление по своей структуре качественно похоже на управление из работы [8]. Полученное управление, как и в работах [8], [9], является особым, т. е. имеет интервалы, на которых управление принимает неграничные значения. Полученные количественные результаты демонстрируют достаточно приемлемую для практики вычислительную эффективность предлагаемого метода в сравнении с многоме-тодными технологиями [8], [9].

При достаточно больших a0 итерационный процесс перестает сходиться, при достаточно малых a0 сходимость существенно замедляется с соответствующим увеличением суммарного количества расчетных задач Коши. При дальнейшем улучшении точности расчета ограничения s0 наблюдается некоторое уменьшение расчетного значения целевого функционала (в значащих цифрах, начиная с шестой после запятой) с увеличением суммарного количества расчетных задач Коши.

Заключение

Рассматриваемый метод неподвижных точек для поиска экстремальных управлений систем с фазовыми ограничениями характеризуется условием выполнения фазовых ограничений на итерациях метода и достаточно простой вычислительной реализацией. Для вычисления очередного приближения управления на каждой итерации метода решаются две задачи Коши и не используется трудоемкая операция выпуклого или игольчатого варьирования управления для улучшения по целевому функционалу, в отличие от градиентных методов. В предлагаемом методе проекционный параметр a0 фиксируется, его можно легко подобрать экспериментально для выполнения сходимости итерационного процесса метода в каждой конкретной задаче.

Указанные свойства важны для повышения вычислительной эффективности решения задач оптимального управления с фазовыми ограничениями, в том числе особых задач, которые имеют особые экстремальные управления.