Ваш AI-агент прочитал письмо, ответил как обычно — и ничего не сказал о том, что только что записал в свою постоянную память ложный факт. В следующий раз он поверит в него снова. И снова.
Что произошло
13 июля 2026 года стало известно об атаке MemGhost. Она нацелена на растущий класс AI-агентов с постоянной памятью — системы, которые сохраняют информацию между сессиями, чтобы «помнить» пользователя и контекст без необходимости пересказывать всё заново.
Механика проста и оттого особенно опасна. Атакующий отправляет агенту, имеющему доступ к почте, одно специально сформированное письмо. Видимая часть письма выглядит обычно, но содержит скрытый текст, адресованный не человеку, а самому ИИ-ассистенту. Когда функция обработки почты агента разбирает сообщение, она воспринимает скрытую инструкцию как команду — записать определённый «факт» в файлы постоянной памяти.
Ключевая деталь: видимый ответ пользователю не содержит никаких следов этой записи. Изменение памяти происходит незаметно. В последующих сессиях — уже без какого-либо нового письма — ложный факт продолжает незаметно влиять на решения и ответы агента.
Исследователи протестировали атаку против OpenClaw (open-source фреймворк для агентов, где затрагиваются ключевые файлы AGENTS.md и MEMORY.md, загружаемые при старте каждой сессии), агента на базе Claude Code SDK с моделью Sonnet 4.6, моделей GPT-5.4, а также агентов с векторными хранилищами памяти. В одном из демонстрационных сценариев атакующие внедрили ложное утверждение об изменённом дневном лимите перевода средств через Zelle.
На данный момент атаке не присвоен CVE . Разработчики OpenClaw оспорили методологию тестирования и сослались на существующие рекомендации по безопасности — использовать отдельного «агента-читателя» для обработки непроверенной входящей почты.
Механика проста и оттого особенно опасна. Атакующий отправляет агенту, имеющему доступ к почте, одно специально сформированное письмо. Видимая часть письма выглядит обычно, но содержит скрытый текст, адресованный не человеку, а самому ИИ-ассистенту. Когда функция обработки почты агента разбирает сообщение, она воспринимает скрытую инструкцию как команду — записать определённый «факт» в файлы постоянной памяти.
Ключевая деталь: видимый ответ пользователю не содержит никаких следов этой записи. Изменение памяти происходит незаметно. В последующих сессиях — уже без какого-либо нового письма — ложный факт продолжает незаметно влиять на решения и ответы агента.
Исследователи протестировали атаку против OpenClaw (open-source фреймворк для агентов, где затрагиваются ключевые файлы AGENTS.md и MEMORY.md, загружаемые при старте каждой сессии), агента на базе Claude Code SDK с моделью Sonnet 4.6, моделей GPT-5.4, а также агентов с векторными хранилищами памяти. В одном из демонстрационных сценариев атакующие внедрили ложное утверждение об изменённом дневном лимите перевода средств через Zelle.
На данный момент атаке не присвоен CVE . Разработчики OpenClaw оспорили методологию тестирования и сослались на существующие рекомендации по безопасности — использовать отдельного «агента-читателя» для обработки непроверенной входящей почты.
Как работает атака
Технически MemGhost эксплуатирует границу между «данными» и «инструкциями», которая у современных агентов размыта по конструкции: агент обрабатывает содержимое письма как единый поток текста, не разделяя надёжно то, что предназначено для отображения человеку, и то, что может интерпретироваться как команда для системы.
Атакующий формирует письмо так, чтобы скрытый фрагмент выглядел как легитимная системная инструкция — например, оформленная в формате, который агент привык воспринимать как метаданные или контекст для обновления памяти. Функция записи в память, спроектированная для удобства (чтобы агент мог сам, без участия пользователя, обновлять знания о нём), становится точкой инъекции.
Поскольку файлы памяти (такие как AGENTS.md/MEMORY.md в OpenClaw) подгружаются при каждом старте новой сессии как доверенный контекст, ложный факт получает тот же вес, что и легитимно накопленные за время работы знания — агент не различает, откуда взялась запись.
Атакующий формирует письмо так, чтобы скрытый фрагмент выглядел как легитимная системная инструкция — например, оформленная в формате, который агент привык воспринимать как метаданные или контекст для обновления памяти. Функция записи в память, спроектированная для удобства (чтобы агент мог сам, без участия пользователя, обновлять знания о нём), становится точкой инъекции.
Поскольку файлы памяти (такие как AGENTS.md/MEMORY.md в OpenClaw) подгружаются при каждом старте новой сессии как доверенный контекст, ложный факт получает тот же вес, что и легитимно накопленные за время работы знания — агент не различает, откуда взялась запись.
Эволюция prompt injection
MemGhost — это следующий логический шаг в эволюции prompt injection: если раньше атака была разовой (манипуляция затрагивала одну сессию или один ответ), то отравление памяти делает эффект постоянным и накопительным. Атакующему больше не нужно постоянно взаимодействовать с жертвой — достаточно одного письма, а дальше ложная информация сама воспроизводится в каждой новой сессии, потому что агент искренне «верит», что это его собственное, ранее сохранённое знание.
Это особенно тревожно для агентов, интегрированных с финансовыми операциями, HR-процессами или клиентской поддержкой — там, где решение агента, основанное на незаметно искажённом «факте», может привести к реальному финансовому или репутационному ущербу.
Для служб безопасности проблема усугубляется тем, что классические логи диалога не покажут ничего подозрительного: ответ пользователю выглядит нормальным, а компрометация видна только при прямом аудите файлов памяти агента — что редко входит в стандартный мониторинг.
Это особенно тревожно для агентов, интегрированных с финансовыми операциями, HR-процессами или клиентской поддержкой — там, где решение агента, основанное на незаметно искажённом «факте», может привести к реальному финансовому или репутационному ущербу.
Для служб безопасности проблема усугубляется тем, что классические логи диалога не покажут ничего подозрительного: ответ пользователю выглядит нормальным, а компрометация видна только при прямом аудите файлов памяти агента — что редко входит в стандартный мониторинг.
Способы защиты
Общая рекомендация исследователей — архитектурное разделение ролей: использовать отдельного «агента-читателя» с ограниченными правами для обработки непроверенного входящего контента (почты, веб-страниц, документов), который не имеет прямого доступа на запись в постоянную память основного агента.
Но это решает проблему только для новых интеграций, спроектированных с оглядкой на угрозу. Для уже развёрнутых агентов нужен контроль на уровне самого трафика между агентом и провайдером модели — и именно для этого создан продукт Strazh LLM Firewall : INPUT-guardrails анализируют входящий контент (включая содержимое писем и документов, которые обрабатывает агент) на предмет скрытых инструкций и prompt injection ещё до того, как он попадёт в контекст модели, а валидация вызовов инструментов проверяет каждое обращение к функциям записи — в том числе к памяти — прежде чем оно будет выполнено.
Это тот же класс защиты, что противостоит другим задокументированным инцидентам — например, эксфильтрации из приватных каналов Slack AI через скрытые инструкции в 2024 году, или zero-click-атаке EchoLeak на Microsoft 365 Copilot (CVE-2025-32711). Общий принцип один: скрытая инструкция должна быть обнаружена и заблокирована на границе, а не после того, как она уже необратимо изменила поведение системы.
Но это решает проблему только для новых интеграций, спроектированных с оглядкой на угрозу. Для уже развёрнутых агентов нужен контроль на уровне самого трафика между агентом и провайдером модели — и именно для этого создан продукт Strazh LLM Firewall : INPUT-guardrails анализируют входящий контент (включая содержимое писем и документов, которые обрабатывает агент) на предмет скрытых инструкций и prompt injection ещё до того, как он попадёт в контекст модели, а валидация вызовов инструментов проверяет каждое обращение к функциям записи — в том числе к памяти — прежде чем оно будет выполнено.
Это тот же класс защиты, что противостоит другим задокументированным инцидентам — например, эксфильтрации из приватных каналов Slack AI через скрытые инструкции в 2024 году, или zero-click-атаке EchoLeak на Microsoft 365 Copilot (CVE-2025-32711). Общий принцип один: скрытая инструкция должна быть обнаружена и заблокирована на границе, а не после того, как она уже необратимо изменила поведение системы.