Условия оптимальности и методы улучшения управления на основе модифицированной сопряженной системы
Автор: Булдаев А.С.
Журнал: Вестник Бурятского государственного университета. Математика, информатика @vestnik-bsu-maths
Рубрика: Управляемые системы и методы оптимизации
Статья в выпуске: 2, 2026 года.
Бесплатный доступ
В классе нелинейных задач оптимального управления разрабатываются условия оптимальности и нелокального улучшения управления с использованием модификации стандартной сопряженной системы. Такая модификация позволяет строить формулы приращения функционала, не содержащие остаточных членов разложений. Эти формулы служат основой для конструирования условий улучшения и оптимальности управления в форме систем уравнений, для решения которых используется известный в математике аппарат неподвижных точек. Предлагаемые методы для поиска экстремальных управлений не опираются на локальные вариации управления, а строят улучшающую последовательность управлений на основе построенных формул приращения функционала. Доказывается сходимость итерационных процессов построенных методов по невязке принципа максимума.
Нелинейная задача оптимального управления, модифици- рованная сопряженная система, условия оптимальности и улучшения управления, задача о неподвижной точке, итерационные методы
Короткий адрес: https://sciup.org/148333844
IDR: 148333844 | УДК: 517.977 | DOI: 10.18101/2304-5728-2026-2-40-50
Optimality Conditions and Methods for Improving Control Based ona Modified Conjugate System
In a class of nonlinear optimal control problems, conditions for optimality and nonlocal control improvement are developed using a modification of the standard adjoint system. This modification allows for the construction of functional increment formulas that do not contain residual terms in the expansions. These formulas serve as the basis for constructing control improvement and optimality conditions in the form of systems of equations, whose solution utilizes the well-known mathematical apparatus of fixed points. The proposed methods for finding extremal controls do not rely on local control variations, but instead construct an improving sequence of controls based on the constructed functional increment formulas. The convergence of the iterative processes of the constructed methods is proven based on the residual of the maximum principle.
Текст научной статьи Условия оптимальности и методы улучшения управления на основе модифицированной сопряженной системы
Рассматривается класс нелинейных управляемых систем, который описывается линейными по управлению обыкновенными дифференциальными уравнениями. Такими системами моделируются управляемые динамические процессы в области биологии, экономики, медицины, энергетики [1; 2]. Теория и методы решения линейных по управлению задач оптимального управления рассматривались во многих исследованиях [3—6].
В работе [5] на основе построения нестандартных формул приращения целевого функционала, не содержащих остаточных членов разложений, разработаны эффективные методы нелокального улучшения управления в билинейных управляемых системах с квадратичными функционалами качества управления. Улучшение управления достигается решением специальных задач Коши для фазовых и сопряженных систем в пространстве состояний.
В работе [7] представлен подход к оптимизации нелинейных управляемых систем, основанный на представлении условий оптимальности и улучшения управления в форме задач о неподвижной точке для операторов управления.
В данной статье разрабатываются новые методы нелокального улуч -шения управления в рассматриваемом классе систем, линейных по управлению, на основе представления условий оптимальности управления в форме задач о неподвижной точке в пространстве управлений.
-
1 Условия оптимальности и улучшения управления
Рассматривается задача оптимального управления:
Ф ( и ) = ф ( x ( t j) + I" F ( x ( t ), u ( t ), t ) dt ^ inf,
J T и eV
x(t) = f (x(t),и(t),t), x(to) = x°, U(t) e u, t e T = [to,t 1], в которой x(t) = (x1(t),...,xn(t)) — состояние системы, и(t) = (u1(t),...,um(t)) — управление. В качестве допустимых управлений рассматривается множество кусочно-непрерывных функций, принимающих значения в выпуклом компактном множестве U с Rm:
V = { v e PC(T ): v ( t ) e U , t e T } .
Начальное состояние x0 и интервал времени T заданы. Функция ф ( x ) непрерывно дифференцируема на Rn . Функции F ( x , и , t ), f ( x , и , t ), их производные Fx ( x , и , t ), fx ( x , и , t ) линейны по переменной и и непрерывны по совокупности аргументов на множестве R n х U х T . Функция f ( x , и , t ) удовлетворяет условию Липшица по x в R n х U х T с константой L > 0 :
II f ( x , и , t ) - f ( у , и , t )|| < L ||x - у || .
В работе используются общие обозначения линейных по управлению функций f ( x, u, t ), F ( x, u, t ) для простоты и удобства представления и использования конструкций предлагаемых методов.
Рассмотрим функцию Понтрягина с сопряженной переменной p е R n :
H(p,x, w,t ) = ( f (x, w,t ), p) - F(x, w,t ).
Определим модифицированную сопряженную систему в следующем виде:
p ( t ) =- H x ( p ( t ), x ( t ), w ( t ), t ) - r ( t ), p ( t i ) = -e x ( x ( t i )) - q ,
H(p(t), y(t), w(t), t) - H(p(t),x(t), w(t), t) = = (Hx (p(tXx(tX w(tX t) + r(tX У (t) — x(t) ), e( y(ti))- e( x(ti)) = (ex(x(ti)) + q, y(ti)- x(ti)), в которой по определению полагаем r(t) = 0 в случае линейности функций F, f по x, а также в случае y(t) = x(t). Аналогично, q = 0 в случае линейности функции e по x, а также в случае y(ti) = x(ti).
В задаче (i), (2), линейной по состоянию, модифицированная сопряженная система (3)-(5) в силу определения совпадает со стандартной сопряженной системой с сопряженной переменной w е R n :
W ( t ) = - H x ( W ( t )> x ( t ), w ( t ), t ) , W ( t i ) = -(P x ( x ( t i )) .
В задаче (i), (2), нелинейной по состоянию, алгебраические уравнения (4) и (5) всегда можно разрешить относительно величин r ( t ) и q (возможно, не единственным образом).
Для управления v е V обозначим x ( t , v ), t е T — решение системы (i); w ( t , v ), t е T — решение стандартной сопряженной системы при x ( t ) = x ( t , v ), w ( t ) = v ( t ) .
Для управлений u е V , v е V обозначим p ( t , u , v ), t е T —решение модифицированной сопряженной системы (3)-(5) при x ( t ) = x ( t , u ), y ( t ) = x ( t , v ), w ( t ) = u ( t ). Из определения следует очевидное равенство p ( t , u , u ) = w ( t , u ), t е T .
Обозначим P Y — оператор проектирования на множество Y с R k в евклидовой норме:
P y ( z ) = argmin(|| y - z ), z е R k .
y еY " 1
Известное [5; 6] необходимое условие оптимальности (принцип максимума) для управления u е V в задаче (i), (2) можно представить в форме:
u(t) = arg max H(y(t, u), x(t, u), w, t) = weU
= arg max ( Hu ( y ( t , u ), x ( t , u ), u ( t ), t ), w , t e T . weU
Условие (6) с помощью операции проектирования можно записать в эквивалентной форме с параметром a > 0:
u ( t ) = P U ( u ( t ) + a Hu ( y (t , u ), x ( t , u ), u ( t ), t ) ) , t e T . (7) Отметим, что для выполнения принципа максимума (6) достаточно проверить условие (7) хотя бы для одного a > 0. Обратно, из условия (6) следует выполнение условия (7) для всех a > 0 .
Определим отображение ua с параметром a > 0 с помощью соотношения:
u a ( y ,x , w , t ) = P u ( w + a H u ( y ,x , w , t ) ) , x e R n , y e R n , w e U , t e T .
С помощью отображения u a условие принципа максимума в проекционной форме (7) можно записать в виде:
u ( t ) = u a ( y (t , u ), x ( t , u ), u ( t ), t ), t e T . (8)
В соответствии с [5] для u e V , v e V в рассматриваемой задаче (1), (2) имеют место две нестандартные формулы приращения функционала, не содержащие остаточных членов разложений:
ф ( v ) - ф ( u ) = - J T A v ( t ) H ( p ( t , u , v ), x ( t , v ), u ( t ), t ) dt =
=- J/ H ( p ( t , u , v )’ x ( t , v )’ u ( t )’ t )’ v ( t ) - u ( t )) dt ;
Ф ( v ) - Ф ( u ) = - J T A v ( t ) H ( p ( t , v , u ), x ( t , u ), u ( t ), t ) dt =
= - \ T( H u ( p ( t , v , u ), x ( t , u ), u ( t ), t ), v ( t ) - u ( t )) dt .
Условие (8) можно представить в виде системы уравнений:
u ( t ) = u a ( p ( t , u , v ), x ( t , v ), u ( t ), t ), t e T , (11)
v ( t ) = u a ( p ( t , u , v ), x ( t , v ), u ( t ), t ), t e T . (12)
Предположим, что уравнение (12) имеет решение v e V . В силу свойств операции проектирования получаем
{H u ( p ( t , u , v ), x ( t , v ), u ( t ), t ), v ( t ) - u ( t )} >
-
> -|| v ( t ) - u ( t )f > 0, t e T .
a
Отсюда и из формулы (9) следует оценка улучшения функционала:
Ф ( v ) -Ф ( u ) <- 1J|| v ( t ) - u ( t )||2 dt . (13)
Таким образом, уравнение (12) можно рассматривать как условие улучшения управления u е V.
Уравнению (12) относительно управления v е V соответствует эквивалентная краевая задача в пространстве фазовых и сопряженных переменных:
x(t ) = f ( x ( t ), u a ( P ( t ), x ( t ), u ( t ), t ), t ), x ( t o) = x °, p ( t ) = - H x ( p ( t ), x ( t , u ), u ( t ), t ) - r ( t ), p ( t i ) = -e x ( x ( t i , u )) - q , H ( p ( t ), x ( t ), u ( t ), t ) - H ( p ( t ), x ( t , u ), u ( t ), t ) = = ( H x ( p ( t ), x ( t , u ), u ( t ), t ) + r ( t ), x ( t ) - x ( t , u )},
e ( x ( t i )) - e ( x ( 1 1 , u )) = ( e x ( x ( t i , u )) + q , x ( t i ) - x ( t i , u )).
Эквивалентность краевой задачи и уравнения (i2) понимается в следующем смысле. Пусть пара ( x ( t ), p ( t )), t е T является решением краевой задачи. Тогда управление v ( t ) = u a ( p ( t ), x ( t ), u ( t ), t ), t е T является решением уравнения (i2). Наоборот, пусть управление v е V является решением уравнения (I2). Тогда пара ( x ( t , v ), p ( t , u , v )), t е T является решением краевой задачи.
Таким образом, для улучшения управления u е V достаточно решить уравнение (i2) или эквивалентную ему краевую задачу.
Условие (8) можно также записать в виде системы уравнений:
u ( t ) = u a ( p ( t , v , u ), x ( t , u ), u ( t ), t ), t е T , (i4)
v ( t ) = u a ( p ( t , v , u ), x ( t , u ), u ( t ), t ), t е T . (i5)
Предположим, что уравнение (i5) имеет решение v е V . В силу свойств операции проектирования получаем
(Н« ( p ( t , v , u ), x ( t , u ), u ( t ), t ), v ( t ) - u ( t )} >
-
> - ||v ( t ) - u ( t )|| > 0, t е T .
Отсюда и из формулы (i0) следует оценка улучшения функционала (i3).
Таким образом, уравнение (i5) можно рассматривать как другое условие улучшения управления u е V .
Введем вспомогательное отображение v a ( p , t ) = u a ( p , x ( t , u ), u ( t ), t ) . Уравнению (i5) относительно управления v е V соответствует эквивалентная краевая задача в пространстве фазовых и сопряженных переменных:
x ( t ) = f ( x ( t ), v a ( p ( t ), t ), t ) , x ( t 0 ) = x 0 , p ( t ) = - H x ( p ( t ), x ( t ), v a ( p ( t ), t ), t ) - r ( t ), p ( t i ) = -e ( x ( t i )) - q , H ( p ( t ), x ( t , u ), v a ( p ( t ), t ), t ) - H ( p ( t ), x ( t ), v a ( p ( t ), t ), t ) =
= HH( ( p ( t ), x ( t ), v a ( p ( t ), t ), t ) + r ( t ), x ( t , u ) - x ( t ) ^,
^ ( x ( t j , u )) - ^ ( x ( t j )) = ^ xx ( x ( t i )) + q,x ( t i , u ) - x ( t J).
Эквивалентность краевой задачи и уравнения (15) понимается в следующем смысле. Пусть пара ( x ( t ), p ( t )), t e T является решением краевой задачи. Тогда управление v ( t ) = v a ( p ( t ), t ) = u a ( p ( t ), x ( t , u ), u ( t ), t ), t e T является решением уравнения (15). Наоборот, пусть управление v e V является решением уравнения (15). Тогда пара ( x ( t , v ), p ( t , v , u )), t e T является решением краевой задачи.
Форма полученных условий улучшения управления (12) и (13) на основе модификации сопряженной системы позволяет рассматривать эти условия как задачи о неподвижной точке на множестве допустимых управлений.
Стандартные методы численного решения соответствующих двухточечных краевых задач улучшения управления (метод стрельбы, метод линеаризации, конечно-разностный метод), как правило, оказываются вычислительно неустойчивыми, что обусловливается наличием положительных вещественных значений собственных чисел соответствующей матрицы Якоби. Методы решения эквивалентных задач о неподвижной точке в пространстве управлений определяют новые вычислительно эффективные подходы к поиску улучшающих управлений.
Системы (11), (12) и (14), (15) являются новыми формами известного условия принципа максимума (8) в рассматриваемом классе задач оптимального управления.
Форма полученных условий принципа максимума позволяет рассматривать эти условия как задачи о неподвижной точке на множестве допустимых управлений. Это дает возможность конструировать новые методы для поиска управлений, удовлетворяющих принципу максимума.
-
2 Итерационные методы
Для решения задачи о неподвижной точке (11), (12) рассматривается итерационный процесс с индексом k > 0 с заданным начальным приближением u 0 e V при k = 0 :
uk + 1( t ) = u a ( p ( t , uk , v ), x ( t , v ), uk ( t ), t ), t e T , (16) v ( t ) = u a ( p ( t , uk , v ), x ( t , v ), uk ( t ), t ), t e T . (17)
Аналогично для решения задачи о неподвижной точке (14), (15) рассматривается итерационный процесс с индексом k > 0 с заданным начальным приближением u 0 e V при k = 0 :
uk + 1( t ) = u a ( p ( t , v , uk ), x ( t , uk ), uk ( t ), t ), t e T , (18) v ( t ) = u a ( p ( t , v , uk ), x ( t , uk ), uk ( t ), t ), t e T . (19)
На каждой итерации рассматриваемых процессов решение v e V соответствующих уравнений (17) и (19) обеспечивает улучшение управления uk е V с оценкой (13). Полученное выходное управление принимается в качестве нового управления uk+1 е V , для которого указанный процесс улучшения повторяется.
Проведем анализ сходимости релаксационных последовательностей управлений uk , к > 0 , образуемых в результате последовательного решения задач (17) и (19) в соответствующих итерационных процессах.
Для каждого к > 0 рассмотрим величину
S (и к ) = Ф ( и к ) -Ф ( u k + 1) > 0.
Если S ( u k ) = 0, то в силу оценки (13) получаем, что uk = uk + 1, т. е. управление uk удовлетворяет необходимому условию оптимальности (8). Таким образом, величина 8 ( u k ) характеризует невязку (меру) выполнения необходимого условия оптимальности (8) на управлении uk .
Теорема . Релаксационные последовательности допустимых управлений uk , k > 0, построенные на основе методов улучшения (16), (17) и (18), (19), сходятся по невязке необходимого условия оптимальности (8):
8 (u k ) > 0, k >v .
Доказательство. В задаче (1), (2), линейной по управлению, семейство фазовых траекторий системы (2) в совокупности ограничено:
x ( t , u ) е X , t е T , u е V , где X е R n — выпуклое компактное множество. В силу ограниченности семейства фазовых траекторий последовательности Ф ( uk ), k > 0 ограничены снизу. Следовательно, с учетом релаксации эти последовательности являются сходящимися, т. е.
8 (u k ) = Ф ( u k ) -Ф ( u k + 1) > 0, k >v .
Доказательство окончено.
Критерием окончания расчета задачи (1), (2) предлагаемыми методами неподвижных точек является выполнение условия:
8 ( uk ) = | Ф ( uk + 1) - Ф ( uk )| < е | Ф ( uk )|, где е > 0 — заданная относительная точность расчета целевого функционала.
Рассмотрим следующие модификации предлагаемых итерационных методов.
На каждой итерации с индексом k > 0 уравнения (17) и (19) можно рассматривать как отдельные задачи о неподвижной точке относительно управления v е V . Для решения указанных задач о неподвижной точке (17) и (19) можно применить соответствующие методы простой итерации c индексом s > 0 с заданным начальным приближением v 0 е V при s = 0 :
v s + 1( t ) = u a ( ^ ( t , uk ), x ( t , vs ), uk ( t ), t ), t е T ; (20)
vs + 1( t ) = u a ( ^ ( t , vs ), x ( t , uk ), uk ( t ), t ), t е T . (21)
Сходимость итерационных процессов (20) и (21) можно анализировать с помощью известного принципа сжимающих отображений в полном пространстве измеримых функций:
V о V l = { v g L „ (T ): v ( t ) g U , t G T } с нормой || v ||m = ess sup | v ( t )||, v g Vl .
∞ t ∈ T
В частности, можно показать аналогично работе [8], что при достаточно малых параметрах проектирования a > 0 процессы (20) и (21) могут сходиться в норме Ц-Ц^ к решениям соответствующих задач о неподвижной точке (17) и (19).
В предположении сходимости итерационных процессов (20) и (21) для заданного a > 0 рассмотрим следующие модификации методов.
В предлагаемых модификациях методов в качестве начального приближения для процессов (20) или (21) рассматривается управление v0 g V , которое не является экстремальным управлением, т. е. не удовлетворяющее принципу максимума. Итерации по индексу s > 0 проводятся до первого строгого улучшения управления u k g V по целевому функционалу: Ф ( vs ) <Ф ( u k ). Тогда u k + 1 = us и итерационный процесс повторяется.
Если строгое улучшение управления uk не происходит по индексу s > 0 , т.е. Ф ( v s ) >Ф ( u k ), то получаем условие: Ф ( v a ) = Ф ( u k ), где v a — решение соответствующих задач о неподвижной точке (17) или (19). При этом в силу оценки (13) получаем, что u k = v a , т. е. управление uk удовлетворяет необходимому условию оптимальности (8).
В результате возникают релаксационные последовательности управлений uk , к > 0 со свойством Ф ( u k + 1) <Ф ( u k ), образуемые в результате последовательного расчета задач улучшения управления (17) или (19) соответственно.
В случае конечной релаксационной последовательности uk , к > 0 , когда строгое улучшение конечного управления uk не происходит по индексу s > 0 , т. е. Ф ( vs ) >Ф ( uk ), для конечного управления uk имеем выполнение необходимого условия оптимальности (8).
Для случая бесконечной релаксационной последовательности uk , k > 0 , когда Ф ( uk + 1) <Ф ( uk ), в силу ограниченности семейства фазовых траекторий эта последовательность является сходящейся по значению функционала, т. е.
Ф ( u k ) -Ф ( u k + 1) ^ 0, k ^^ .
Отсюда возникают следующие критерии окончания расчета задачи (1), (2) предлагаемыми модификациями методов.
Если выполнилось первое строгое улучшение управления u k е V по индексу s > 0 : Ф ( vs ) <Ф ( u k ), то u k + 1 = v s и проверяется условие остановки расчета по значению функционала:
I Ф( uk+1) -Ф( uk )| < £1 |ф( uk )| , где £1 > 0 — заданная относительная точность расчета значения целевого функционала.
Если указанный критерий остановки выполнился, то на этом расчет предлагаемыми модификациями методов заканчивается. Иначе строится новая задача о неподвижной точке (17) или (19) для улучшения полученного расчетного управления u k + 1 и итерационный процесс повторяется.
Если строгое улучшение управления uk е V по индексу s > 0 не происходит, т. е. Ф ( vs ) >Ф ( uk ), то итерационный процесс проводится до выполнения условия:
IIvs’1- vslL<£ lvslL ■ где £2 > 0 — заданная относительная точность расчета задачи о неподвижной точке (17) или (19). На этом расчет предлагаемыми модификациями методов заканчивается.
Выделим следующие сравнительные особенности предлагаемых мо-дификаций методов.
-
1. Предлагаемые модификации методов, в отличие от известных градиентных методов, не гарантируют релаксацию по целевой функции на каждой итерации последовательных приближений управления. Свойство релаксации компенсируется нелокальностью последовательных приближений управления и отсутствием на каждой итерации достаточно трудоемкой операции выпуклого или игольчатого варьирования управления в окрестности текущего приближения управления.
-
2. В рассматриваемых модификациях методов на каждой итерации решаются обычные задачи Коши с предварительно вычисленным управлением, в отличие от достаточно трудоемкого решения соответствующих краевых задач улучшения управления с проекционным оператором в правой части систем дифференциальных уравнений, которые эквивалентны условиям улучшения (17) или (19).
-
3. Предлагаемые модификации проекционных методов имеют возможность строго улучшать экстремальные неоптимальные управления, т. е. удовлетворяющие принципу максимума, за счет конструирования последовательных приближений управления, отличающихся от экстремального управления.
Данные особенности рассматриваемых модификаций методов на основе задач о неподвижной точке являются важными факторами для повышения вычислительной эффективности решения рассматриваемых задач оптимального управления по сравнению с известными градиентными методами.
Заключение
В классе систем, линейных по управлению:
-
1) построены новые формы принципа максимума на основе конструируемых задач о неподвижной точке;
-
2) разработаны новые методы нелокального улучшения управления для поиска экстремальных управлений.
Основными особенностями предлагаемых методов являются:
-
1. Нелокальность улучшения управления и отсутствие трудоемкой операции выпуклого или игольчатого варьирования управления на каждой итерации, характерной для градиентных методов.
-
2. Возможность строгого улучшения неоптимальных экстремальных управлений в отличие от градиентных методов.
-
3. Численное решение обычных фазовых и сопряженных систем с заранее вычисленным управлением на каждой итерации.
Указанные свойства методов являются важными факторами для повышения вычислительной эффективности оптимизации систем, линейных по управлению.