Если агент забывает информацию, это необязательно плохо

Почему забывчивость ИИ-агентов может быть не багом, а фичей

Тирекс
Тирекс Самый зубастый автор
8 сентября 2026

Что может запомнить ИИ-помощник, с кем он может поделиться информацией, можно ли удалить информацию о себе, при этом сохранив эффективность модели.

Изображение записи

Скорее всего, вы знаете, что агенты — это ИИ-модели, способные вызывать внешние и внутренние инструменты и циклично выполнять задачи. Они умеют рассуждать, планировать и выполнять бескрайнее множество действий. Агенты сохраняют в своей «памяти» действия пользователя, ответы модели, используемые инструменты и многое другое. Короче говоря, информацию вообще обо всех действиях — как модели, так и пользователя. 

Звучит очень удобно! Агент уже после первого объяснения запомнит, что заданное пользователем форматирование нужно сохранять и что, к примеру, текст всегда нужно переводить только на русский. Не надо писать лишних уточнений по чем зря. Пользователь получает персонализированную модель, которая сохранила контекст диалога, знания о его стиле общения, о его привычках. И о нем самом. И вот это уже немного пугает.

Как работает память агентов. Проблемы накопления личностного контекста

Для начала разберемся, как работает память агентов. Существует три уровня памяти:

  • Память контекстного окна хранит данные в чистом виде, пока длится сессия. Тут происходит первичная обработка приватных данных, которые затем мигрируют на более глубокие уровни. Проще говоря, это кратковременная память, существующая только в рамках текущего диалога.
  • Параметрическая память хранит информацию, которая встраивается глубоко в структуру самого ИИ в процессе его обучения или долгого дообучения. С этим типом памяти возникают основные проблемы, ведь здесь данные не хранятся в папке, они рассредоточены по всей нейросети. Попытка же удалить информацию может вызвать забывание базовых навыков или логики.
  • Латентная память — это долгосрочная память ИИ, которая выносится во внешние хранилища. Информация здесь хранится в виде эмбеддингов (поэтому эту память еще называют векторной), что позволяет агенту вспоминать контекст многомесячной давности, сопоставляя текущий запрос с историческими данными. 

Данная архитектура памяти неизбежно начинает накапливать избыточную приватную информацию о своем владельце. Если информация один раз попала в долгосрочное хранилище, она автоматически извлекается алгоритмами при любом похожем контексте. Пользователь может забыть, что делился секретом, но агент может использовать этот контекст каждый раз при инференсе.

Если вы используете ИИ с умом, грамотно формулируете промпты, внимательно читаете ответы и проверяете все, что агенты выдают по вашим запросам, проблема может показаться несущественной. Но, конечно, все чуть сложнее. Из-за того, что агент постоянно обращается к своей памяти для демонстрации примеров и принятия решений, база данных, которая хранит всю информацию о пользователе, становится главной мишенью для злоумышленников (конечно, если у них есть доступ к агенту).

Как это происходит? Есть такой метод взлома MEXTRA (Memory EXTRaction Attack). При нем злоумышленник заставляет ИИ-агента добровольно раскрыть конфиденциальную информацию о его владельце. Атакующий адаптирует текстовые запросы под конкретного агента и подбирает такие формулировки, которые заставляют модель воспринимать личные воспоминания пользователя как фоновый контекст, подлежащий выдаче в чат.

Конструкция атакующего запроса всегда состоит из так называемых локатора и выравнивателя. Они являются частями одного промпта, но выполняют разные функции. 

Локатор указывает ИИ, какую именно скрытую информацию в его контексте или в базе данных нужно найти и извлечь. Выравниватель в свою очередь отвечает за доставку извлеченных данных взломщику, формулируя команду так, чтобы вывод не вызывал подозрений.

Известен, к примеру, случай подобных манипуляций с агентом EHRAgent, который работает с медицинскими карточками. Атакующий задавал, казалось бы, безобидный промпт, локатор инструктировал модель найти в истории контекста предыдущие инструкции врачей и медицинские кейсы, а выравниватель требовла от ИИ написать скрипт, который физически выведет прошлые запросы на экран. В результате агент послушно генерировал код, условно содержащий команду print(f"Диагноз прошлых пациентов: ... {data}"). Код успешно исполнялся сервером, медицинская тайна попадала в руки хакера в виде обычного текстового вывода консоли. Профит.

Но почему ИИ-агенты так легко поддаются этой атаке? Потому что при каждом пользовательском запросе они автоматически обращаются к истории прошлых взаимодействий. Ну и еще потому что границы между системными промптами, базовыми знаниями модели и личным контекстом пользователя не такие четкие, как хотелось бы.

Графики показывают, что чем больше вредоносных запросов получает агент, тем выше шанс, что он выдаст конфиденциальные данные.
Демонстрация как по мере роста количества отправленных атакующих промптов увеличивается число успешно извлеченных приватных запросов. Горизонтальная ось: показывает количество атакующих промптов. Вертикальная ось: отражает количество уникальных запросов пользователя.. Источник.

Как удаляют информацию и почему это выгодно

Раз есть проблема, то, естественно, с ней пытаются бороться. Нет, не обязательно запретом на использование ИИ в компании. Есть, например, фреймворк FSFM (Selective Forgetting of Agent Memory).

Он построен на принципах работы человеческой памяти. Человеческий мозг не хранит абсолютно все события дня в долгосрочной памяти. Он анализирует накопленный опыт и отбирает действительно важные знания для переноса в кору полушарий, а фоновый информационный шум просто стирает. И даже если сохраненная информация долгое время не используется и не повторяется, нейронные связи ослабевают и данные постепенно забываются.

Разработчики FSFM перенесли в его код ключевые особенности биологического процесса забывания. Фреймворк делит процессы очистки памяти на несколько уровней сложности и назначения.

Например, чтобы агент не терял точность из-за слишком большого объема ненужных данных в его долгосрочной памяти, ему прикрутили пассивное угасание. Каждому эмбеддингу при записи присваивается стартовый коэффициент сохранения. При каждом новом диалоге или цикле работы агента этот коэффициент снижается, и как только показатель падает ниже критического порога, вектор удаляется из базы данных.

Есть еще и активное удаление устаревших предпочтений пользователя. Это нужно, чтобы предотвратить логические противоречия и путаницу.

А что же с ИБ? Ведь вообще-то мы начинали с того, что ИИ-агент может случайно выдать что-то конфиденциальное. Решение может показаться топорным, но оно по крайней мере работает. Конфиденциальные данные, скажем, пароли или данные банковских карт, просто сразу же стираются, вообще не доезжая до долгосрочной памяти. За это отвечает внутренний классификатор. Да, во многом именно от него зависит, будут ли данные восприняты как конфиденциальные и подлежащие удалению. Но это лучше, чем ничего.

В конечном счете адаптивное подкрепление настраивает систему под новые привычки пользователя на основе обратной связи. Например, пользователь стал вегетарианцем и постоянно отклоняет рекомендации мясных ресторанов. Тогда алгоритм адаптивного подкрепления фиксирует сдвиг в поведении, и перезаписывает этот сегмент памяти новым контекстом.

Очень сложная структура FSFM с LLM, хранилищами, агентами и прочим.
Структура фреймворка. Источник.

Так почему же забывать выгодно? Эксперименты показывают, что выборочное забывание не ухудшает способности агента, а наоборот, оптимизирует его работу. Повышается скорость работы (+8,49%) и точность ответов (+29,2%). Но самое главное — опасные и вредоносные инструкции удаляются из памяти, защищая агента от атак извлечения данных.

Будущее памяти ИИ-помощников

Наша приватность и так довольно сильно страдает. В цифровом мире всегда было глупо надеяться на абсолютную анонимность. Хотите хоть в какой-то мере ее сохранить — поменьше откровенничайте с ИИ и пользуйтесь технологиями с умом. А если ваш персональный агент вдруг забудет какую-то мелочь, не ругайте его. Возможно, он просто заботится о вашей безопасности.