Кратковременная память агента на основе больших языковых моделей: формальное определение

Автор: Рафиков Т.Р., Попцов А.В., Вяткин А.А., Столярова В.Ф.

Журнал: Труды Московского физико-технического института @trudy-mipt

Рубрика: Информатика и управление

Статья в выпуске: 2 (70) т.18, 2026 года.

Бесплатный доступ

Одним из модулей интеллектуальных агентов, использующих большие языковые модели, является память, которая подразделяется на кратковременную и долговременную. В современных исследованиях понятие кратковременной памяти чаще всего трактуют как контекстное окно. Такая трактовка ограничивает развитие сложных методов работы с памятью, затрудняет сравнение подходов и привязана к текстовым данным. Ключевая проблема состоит в отсутствии разделения между носителем информации (текущее состояние памяти) и методами работы с ним (стратегии обновления). В данной статье предложено формальное определение кратковременной памяти для LLM-агентов, основанное на абстрактных множествах и функциях. Оно выделяет отдельно носитель информации (структурированное хранилище элементов с метаинформацией) и механизм управления (функции обновления и проекции).

LLM-агент, кратковременная память, большие языковые модели, контекстное окно, формализация

Короткий адрес: https://sciup.org/142248252

IDR: 142248252   |   УДК: 004.89

Short-term memory of a large language models-based agent: a formal definition

One of the modules of intelligent agents using large language models is memory, which is divided into short-term and long-term. In modern research, the concept of short-term memory is most often interpreted as a context window. This interpretation limits the development of complex methods of working with memory, makes it difficult to compare approaches, and is tied to textual data. The key problem is the lack of separation between the storage (the current state of memory) and the methods of working with it (update strategies). This article proposes a formal definition of short-term memory for LLM agents based on abstract sets and functions. It distinguishes separately an information carrier (a structured storage of elements with meta-information) and a control mechanism (update and projection functions).

Текст научной статьи Кратковременная память агента на основе больших языковых моделей: формальное определение

Большие языковые модели (англ. Large Language models, LLM) используются в задачах генерации текста, создании диалоговых систем и улучшении интеллектуальных агентов (LLM-агентов) [1, 2]. Последние широко применяются во многих областях: в здравоохранении [3], финансах [4], образовании [5], программировании [6]. Для корректного использования LLM-агентов и снижения рисков проводят валидацию и оценку их компонентов [7].

(с) Рафиков Т. Р., Попцов А. В., Вяткин А. А., Столярова В. Ф., 2026

  • (с) Федеральное государственное автономное образовательное учреждение высшего образования «Московский физико-технический институт (национальный исследовательский университет)», 2026

  • 2.    Обзор литературы

В архитектуре агента выделяют несколько модулей — планирования, рефлексии, использования инструментов и памяти [8]. Уже существуют подходы к строгой формализации планирования и вызова функций [2, 9, 10], чего нельзя сказать про оценку модуля памяти, отвечающего за сохранение, организацию и извлечение информации в процессе взаимодействия агента с окружением и пользователем. В литературе выделяют разные виды памяти [2]: кратковременную (англ, short-term memory, STM) и долговременную (англ. long-term memory, LTM), а также подвиды — эпизодическую, семантическую, процедурную и рабочую память [9].

Долговременную память в некоторых исследованиях трактуют как систему генерации с поиском (англ. Retrieval-Augmented Generation, RAG), которая использует внешние базы знаний для хранения и извлечения информации [11]. Кратковременную память определяют контекстным окном модели — структурой с ограниченным количеством токенов, которую модель может одновременно использовать для обработки и генерации ответа [2]. Стоит также отметить, что существующие работы [2, 9] не выделяют отдельно хранилище информации и методы управления им (стратегии обновления), что будет отражено в обзоре литературы.

Целью данного исследования является математическая формализация понятия кратковременной памяти как системы для LLM-агентов. Сформулированное определение дает возможность делить понятие кратковременной памяти на две части: (1) носитель памяти (текущее состояние) — структурированное хранилище элементов памяти и (2) механизмы работы с кратковременной памятью — функции, определяющие, каким образом информация попадает в память, изменяется и извлекается при ограничениях размеров и времени. Это определение может послужить началом введения единой терминологии, необходимой для корректного описания и сопоставления различных современных методов и подходов построения кратковременной памяти.

В статье [9] обсуждаются различные варианты трактовки памяти в LLM, но под кратковременной памятью обычно подразумевают контекстное окно [2, 10] и механизм внимания (англ, attention), используемый в современных трансформерах [1]. В процессе анализа кратковременной памяти LLM важно учитывать, что механизмы памяти у моделей принципиально отличаются от рабочей памяти человека. Так, в статье [12] авторы пишут о том, что обычные LLM работают совсем иначе: в отличие от человеческой рабочей памяти, они не имеют динамического механизма обновления и забывания, а их «память» на самом деле является статичным содержимым контекстного окна. Этот недостаток особенно проявляется в длинных диалогах, где необходимо эффективно управлять накопленной информацией.

Проблема эффективного использования контекстного окна изучается в статье [13], где показано, что даже при значительном увеличении длины контекстного окна имеются практические ограничения на его применение. В работах [14-16] представлены различные подходы в реализации кратковременной памяти. Так, в статье [15] описан метод управления памятью при динамических вызовах инструментов в длинных диалогах. Исследование [14] рассматривает возможность объединения динамического запоминания и консолидации памяти - идея, источником вдохновения которой является человеческая память. Другой метод, описанный в [16], направлен на разработку самоконтролируемой архитектуры памяти.

LLM не обладают встроенными инструментами для эффективного взаимодействия с контекстным окном, такими как операции удаления, вставки или замены отдельных элементов памяти. Это ограничение отмечается в ряде работ, где предлагаются различные техники суммаризации, извлечения релевантных фрагментов и удаления наименее важных элементов, включая RAG подходы [11, 17].

Обзор современных исследований по тематике памяти LLM-агентов либо целиком фокусируются на контекстном окне как на кратковременной памяти [2], либо избегают четкого и формального определения [9]. Существующие работы не проводят разграничение между хранилищем информации [10] и методами ее управления [16]. Вследствие этого кратковременная память сводится к определению встроенного контекстного окна модели, что осложняет сравнение различных методов хранения и управления информацией в кратковременной памяти. В таком случае становится трудным понять, заключается ли новизна работы только в способе хранения информации, в алгоритме управления, или же сразу в обоих аспектах.

3.    Определение кратковременной памяти

В данном разделе будут введены два определения: структурированное хранилище информации кратковременной памяти (текущее состояние) и механизм обновления состояния кратковременной памяти, изменяющий информацию и переводящий её в понятный для моделей формат. В формализации активно используются абстрактные понятия и множества с целью охватить всевозможные подходы и реализации взаимодействия с информацией в кратковременной памяти.

3.1.    Состояние кратковременной памяти

Чтобы справиться с ограничением трактовки кратковременной памяти как контекстного окна, необходимо выделить носитель информации — текущее состояние памяти. Основная идея предлагаемого определения — рассматривать память как множество объектов, в котором отдельный элемент памяти представляет собой единый блок информации и некоторую метаинформацию о ней. Новое определение носителя информации памяти позволяет рассматривать разные реализации: от простейших очередей сообщений (контекстное окно) до сложных иерархических хранилищ. После определения дан иллюстративный пример для наглядной демонстрации.

Несмотря на то что во многих практических сценариях большое значение имеет порядок сохраняемой информации, данное определение намеренно избегает каких-либо подходов по заданию порядка на множестве элементов памяти. Таким образом текущая формализация дает возможность задавать любой порядок на элементах, не ограничиваясь конкретными реализациями. Введем определение 1.

Определение 1. Пространство состояний кратковременной памяти LLM-агента

^ stm = {ш памяти, где:

G 2е | ^р(р) < Утах} - пространство состояний кратковременной eGw

  • ш - текущее состояние кратковременной памяти;

Е = I х D - пространство структурированных элементов кратковременной памяти;

  • ц : Е ^ R+— функция размера элементов памяти;

Vmax € R+— ограничение на объем текущего состояния;

I С А* - множество всех конечных слов над алфавитом А;

k

D С JJ Di - пространство метаинформации, где Di

- множество возможных значений

i=1

одного элемента метаинформации, к € N - размерность вектора метаинформации.

Пример [AgentFold [19]). В архитектуре AgentFold контекст агента на шаге t задаётся как кортеж (Q,T, St-2, It~i): зап рос Q, инструменты Т, мультимасштабные суммаризации St-2 и последнее наблюдение It-i. В терминах определения 1: элементы Е — это блоки сумма-ризаций sx,y (слово г I ~ текст суммаризации, метаинформация d D — диапазон шагов

(х,у) и тип «блок») и один элемент «последнее взаимодействие» (полная запись шага t — 1: объяснение, действие, наблюдение). Состояние ш — подмножество таких элементов; ц(е) — объём в токенах, Vmax — лимит контекста. Таким образом, ш G ^ stm при соблюдении ограничения по объёму.

Приведем пояснение каждого элемента определения 1 детальнее.

Значение Vmax - максимальная емкость текущего состояния кратковременной памяти, являющаяся константой, определяющей верхнюю границу суммарного занимаемого объема элементов, которые могут одновременно находиться в кратковременной памяти.

Для подсчета занимаемого места элементов задается функция размера в памяти ц, так как отдельные элементы памяти могут быть разного размера. Это позволяет сохранять в носителе информации данные разной модальности и адаптировать определения под разные реализации.

Элементы множества I представляют собой атомарные единицы информации, которые могут быть сохранены в кратковременной памяти. Конкретная природа этих элементов зависит от задачи и реализации: это могут быть токены текста, предложения, абзацы, структурированные данные или любые другие информационные единицы. Формально множество I определяется как замыкание Клини алфавита А, что эквивалентно множеству всех конечных слов над данным алфавитом, который может задаваться произвольно в зависимости от типа обрабатываемой информации.

Буквой D в определении обозначается произвольное множество вспомогательных данных. Полезной метаинформацией могут выступать временные метки, приоритеты, метаданные источника, а также любые другие атрибуты, недоступные из исходной информации. Например. Di = {low, medium, high} (приоритет) ii D2 = {user, model, api} (источник) могут быть заданы в реализации.

Одним из ключевых понятий в определении является пространство элементов кратковременной памяти, обозначаемое как Е. Каждый элемент этого пространства представляет собой структурированную единицу памяти, включающую в себя информационное содержание (элемент множества I) и дополнительную полезную метаинформацию (элемент множества D). Для эффективного управления кратковременной памятью часто требуется информация, которая не может быть извлечена из самого содержимого. К примеру, добавление временной метки в память необходимо для реализации политики удаления элементов на основе возраста данных. Хранение такой информации в единой структуре вместе с содержимым упрощает проектирование механизмов управления памятью.

примером в данном контексте является техническое ограничение контекстных окон на количество токенов в LLM. Любое состояние кратковременной памяти LLM-агента является точкой этого пространства. Введение такого абстрактного понятия помогает определять не только носитель, но и функции механизма кратковременной памяти, которые будут рассмотрены в следующем разделе.

Необходимо подчеркнуть одно из главных отличий кратковременной памяти от долговременной: вся информация текущего состояния кратковременной памяти используется в итерации LLM-агента. Таким образом, не возникает вопрос об определении метода извлечения полезной информации кратковременной памяти, так как вся информация оттуда будет так или иначе использована.

3.2.    Механизм обновления состояния кратковременной памяти

Помимо формализации текущего состояния кратковременной памяти необходимо определить способы управления памятью. Для задания этих способов определим функции, ис- пользующие абстрактные множества операций и контекстной информации, конкретный набор которых может зависеть от практической реализации. Ключевую роль в способах управления играют две функции: обновления и проекции. Функция обновления отвечает за модификацию содержимого памяти, а функция проекции позволяет преобразовать информацию под любой тип данных, используемых в модели. Новое определение механизма кратковременной памяти позволяет рассматривать различные подходы к её управлению, а также позволяет задавать произвольную архитектуру хранения информации в памяти, не затрагивая конкретные реализации. Введем определение 2.

Определение 2. Механизм обновления состояния кратковременной памяти LLM-агентов

Механизм обновления состояния кратковременной памяти определяется как кортеж (О,Е, ^STM,C,U,X,r), где:

О =

^J Оа - множество всех

аЕт ство операций определенного

операций, т - множество типов операций, Оа - множе-типа;

п

C с

Cm - пространство контекстной информации1, где Cm - абстрактное про- т=1

странство одного вида контекста;

U : ^ stm х О х C ^ ^ stm - функция обновления состояния кратковременной памяти;

X С (|^J Mj )* - пространство входов модели, определяемое как подмножество множе- з=1

ства всех слов над всеми доступными алфавитами модальности Mj' I G N - количество различных модальностей модели;

г : ^ stm ^ X - функция приведения (проекция) текущего состояния в нужный тип входа для модели.

Пример (AgentFold [19]), продолжение) . В терминах определения 2 механизм кратковременной памяти AgentFold задаётся следующим образом: О содержит точечное (свёртка одного последнего взаимодействия в суммаризацию) и глубокое сжатие (объединение нескольких блоков); C состоит из запроса Q, инструментов Т и текущего состояния. Функция U по folding-директиве агента либо добавляет новый блок от последнего шага в щ либо заменяет цепочку блоков суммаризацией. Проекция г переводит щ в элемент из пространства входов X, в формат те кета: кортеж (Q,T, S,I ), где S — последовательность блоков сумма-ризаций, I — последнее взаимодействие.

Далее приведено описание каждого элемента определения 2.

Механизм кратковременной памяти определяется как кортеж из семи элементов, два из которых — методы, применяемые к текущему состоянию кратковременной памяти. Обновление U способно изменить информацию, а проекция гг приводит её из произвольного представления информации памяти в формат входа модели. Функция обновления U принимает текущее состояние, операцию о G О из множества возможных операций, и информацию с G C, и возвращает новое состояние кратковременной памяти. Функция U инкапсулирует всю логику преобразования: добавление новых элементов, удаление существующих, модификацию метаданных, применение стратегий забывания и т. п. Включение C в сигнатуру позволяет функции U учитывать внешние факторы при принятии решений об обновлении, что критично для адаптивных стратегий управления памятвю. Множество операций О представляет собой всевозможные операции, которые могут быть выполнены над кратковременной памятью. Абстракция множества О позволяет обобщить различные стратегии управления памятью, не фиксируя конкретный набор операций.

Пространство контекстной информации С представляет собой абстрактное множество контекстной информации, доступной при принятии решений об обновлении кратковременной памяти. Оно может включать: 1) текущий запрос пользователя или входные данные, 2) результаты вспомогательных вызовов модели для преобразования этого ввода (размышления, суммаризации, выделения ключевых фактов и т. и.) и 3) метаинформацию о запросе (timestamp, идентификатор пользователя, тип задачи, географические данные и др.). Включение контекстной информации в определение механизма позволяет реализовывать адаптивные, контекстно-зависимые стратегии управления памятью. Необходимо подчеркнуть, что множество контекстной информации не имеет никакого отношения к контекстному окну.

Так как текущее состояние кратковременной памяти внутри себя может хранить информацию в виде, не совпадающем с форматом модели, была введена функция проекции гг. Она также принимает текущее состояние, а на выходе выдает читаемый для модели вид. Кроме того, модель способна взаимодействовать с данными разных модальностей, которые будут храниться в памяти, и именно функция проекции решает эту проблему. Такой подход обеспечивает гибкую работу с различными типами данных, с которыми может взаимодействовать кратковременная память. Необходимо заметить, что гг не несет в себе функцию извлечения информации, этот метод использует весь носитель данных для преобразования в нужный для модели вид ввода.

Рис. 1. Кратковременная память

Содержание элементов памяти различных типов данных задаётся единообразно: элемент памяти — это пара (i,d) G Е = I х D, где носитель i G I интерпретируется как конечное слово над алфавитом А. Для мультимодальных систем алфавит А (и тем самым множество I) задаётся так, чтобы в I входили представления данных всех используемых модальностей — например, токены текста, идентификаторы или коды изображений, аудиосегментов и т. п.; при необходимости I можно считать объединением множеств слов над разными «подалфавитами», по одному на модальность. Единый формат входа модели X С (|^J Mj )* уже допускает смешанные последовательности символов разных модально-1=1

стей Mj. Преобразование внутреннего представления памяти в конкретный мультимодальный формат входа выполняет функция проекции л: ^ stm ^ X: она переводит текущее состояние ш (элементы! которого могут нести контент разных типов) в допустимую для модели последователвноств в X, определяя порядок и форму подачи текста, изображений и др. Таким образом, тип данных задаётся выбором I и Д а способ подачи модели — реализацией л.

Схема взаимодействия кратковременной памяти и LLM изображена на рис. 1. Механизм кратковременной памяти преобразует текущее состояние памяти с помощвю функции л и отправляет на вход LLM. Далее вывод LLM используется как контекстная информация для обновления состояния кратковременной памяти.

4.    Дискуссия

Стоит отметить, что контекстное окно - один из популярных способов определения кратковременной памяти [2, 9] - может корректно описываться представленными определениями 1 и 2. Для этого достаточно задать действия ( U) и проекцию (л) следующим образом: хранилище информации работает как очередь «First In, First Out», при переполнении контекстного окна урезается начало; функция проекции будет эквивалентна тождественному отображению, так как контекстное окно является и входом, и носителем информации кратковременной памяти. Это демонстрирует совместимость предложенной формализации с традиционным пониманием кратковременной памяти как контекстного окна.

4.1.    Описание архитектур кратковременной памяти в терминах предложенной формализации

Ниже три архитектуры кратковременной памяти заданы в терминах определений 1 и 2.

SCM [16].

Е = I х D. где I — кортеж (наблюдение, ответ, суммаризатщя). D — индекс взаимодействия, эмбеддинг, тип (activation/flash-память);

  • ц(е) — объём элемента в токенах;

Утах — лимит на activation/flash-память;

ш — подмножество элементов, подаваемых на вход на текущем шаге;

О — активация памяти, извлечение top-fe, выбор полного текста или суммаризации;

С — текущее наблюдение и эмбеддинг;

U — активация, ранжирование (recency + relevance), суммаризация, добавление текущего взаимодействия;

л — объединение отобранных элементов с наблюдением (input fusion).

HiAgent [18].

Е = I х D — пространство элементов памяти (подцели и пары действие-наблюдение)

I — текст подцели и пары (действие, наблюдение);

D — идентификатор подцели, время, признак «текущая подцель»;

ш — актуальные подцели и привязанные к ним пары «действие-наблюдение»;

ц — размер в токенах:

Утах ~ лимит контекста;

О — замена подцелей суммаризованными наблюдениями, отбор релевантных пар, извлечение фрагмента траектории по текущей подцели (trajectory retrieval);

С — текущий запрос и история шагов;

U — иерархическое обновление (замена группы подцелей суммаризацией, отбор пар под текущую подцель, по запросу — извлечение фрагмента траектории);

л — сборка из ш текущей подцели и релевантных пар в формат входа модели.

AgentFold [19].

Е = I х D — пространство элементов контекста (блоки суммаризаций и последнее взаимодействие);

I — блоки суммаризаций sx,y и описание последнего шага кортежем (объяснение, действие, наблюдение);

D — диапаз он шагов (х,у), тип (блок суммаризации / последнее взаимодействие);

ш — упорядоченная по времени последовательность блоков суммаризаций и один элемент «последнее взаимодействие»;

ц, Утах — объём в токенах и лимит контекста;

О — точечное сжатие (одно взаимодействие ^ блок) и глубокое сжатие (цепочка блоков ^ один блок):

С — запрос, инструменты, текущее состояние;

U — применение стратегии сжатия (добавление блока или замена цепочки одним);

л — кортеж (вопрос, инструменты, блоки суммаризаций, последнее взаимодействие).

Предложенное формальное определение обладает несколькими важными дополнительными свойствами.

  • 1.    Универсальность. Определение может покрывать широкий спектр существующих и потенциальных подходов к управлению кратковременной памятью, от простых FIFO-очередей [18], соответствующих стандартному контекстному окну трансформера [1, 2, 9], до сложных адаптивных систем с гибридными стратегиями отбора [16].

  • 2.    Гибкость. Использование абстрактных множеств I, Е, С и О позволяет адаптировать формализацию к различным доменам применения и требованиям задач, не изменяя при этом базовую структуру определения. Например, метод, реализованный в работе [19], может быть описан с помощью предложенных определений следующим образом: необходимо включить суммаризацию как один из типов контекстной информации в С, а в множестве операций О задать операцию сжатия последних фрагментов памяти.

  • 3.    Масштабируемость. Возможность включения метаданных в структуру элементов памяти (через множество D в определении Е = I х D) обеспечивает основу для реализации сложных политик управления без изменения формального определения. Это критично для практических применений, где требуется информация, недоступная из самого текстового содержимого.

  • 4.    Разделение ответственности. Выделение носителя информации и механизма позволяет независимо модифицировать стратегии управления, не затрагивая структуру хранения, и наоборот. Это упрощает проектирование систем и их адаптацию к различным требованиям.

  • 5.    Заключение

Как отмечено в статье [13], даже при сильном увеличении размера контекстного окна будут ограничения в возможностях его использования. Предложенный вариант формализации может дать инструменты для разбора и преодоления этих ограничений. Так, различные варианты реализации функции обновления U могут учитывать, насколько релевантны элементы из контекста текущему запросу, и тогда может быть проще эффективно использовать ограниченный объём носителя кратковременной памяти Vmax. Методы, при которых используется извлечение наиболее релевантных частей текста [И- 17] , можно описать как определённые варианты реализации функции U, которая динамически меняет содержимое состояния памяти с учётом текущего контекста.

В этом определении нет указаний на конкретные реализации функций U иг, а только их сигнатуры. Тем самым остается пространство для выбора методов, критериев и подходов, соответствующих уникальным задачам и ограничениям. Однако это также означает, что данное понятие не указывает, какие именно подходы использовать в конкретных случаях — эти вопросы все еще эмпирически исследуются и требуют экспериментальной проверки.

Кроме того, предложенная формализация фокусируется на структуре, но не определяет метрики эффективности и критерии оценки качества работы механизмов памяти. Выбор подходящих метрик и оценка эффективности различных реализаций остаются задачами для будущих исследований.

В настоящей работе предложено формальное определение кратковременной памяти для LLM-агентов, основанное на абстрактно-алгебраическом подходе. Основной вклад работы заключается в различии двух аспектов кратковременной памяти: носителя информации (текущее состояние кратковременной памяти) и механизма управления (функций обновления и проекции).

Ключевым достижением формализации является ее универсальность. Она естественным образом может покрыть как классическое понимание кратковременной памяти в форме контекстного окна трансформера (через реализацию FIFO-очереди), так и всевозможные подходы, включая семантическое ранжирование и гибридные стратегии отбора. Это демонстрируется на примерах конкретных реализаций, которые укладываются в единую формальную структуру.

Данные определения открывают новые направления для будущих исследований. Во-первых, они позволяют проводить систематические сравнительные исследования различных методов управления памятью в рамках одной формальной модели. Это может включать экспериментальную оценку эффективности разных реализаций функций U и г на разных типах задач. Во-вторых, формализация создает основу для разработки адаптивных механизмов управления памятью, при которых функции U и г могут динамически изменяться в зависимости от характеристик текущей задачи или состояния системы. Это может включать обучение оптимальных стратегий управления памятью на основе данных. В-третьих, формализация может быть расширена для описания взаимодействия с долговременной памятью, что позволит создать более полную модель памяти LLM-агентов. Это особенно актуально в контексте работ по интеграции различных типов памяти.

Статья выполнена в рамках научно-исследовательской работы по государственному заданию СПб ФИЦ РАН Mol_Lab (молодежная_лаб) № FFZF-2024-0003.