- Исследователи из Университета штата Нью-Мексико разработали атаку GhostWriter на ИИ-агентов.
- Атака позволяет злоумышленнику тайно записывать в долговременную память агента скрытые инструкции.
- Современные языковые модели получают долговременную память, что повышает их безопасность.
- Атака GhostWriter работает в два этапа: скрытая полезная нагрузка и легитимная задача.
- Злоумышленник может использовать отравленные данные для выполнения инструкций.
- Авторы проверили атаку на современных агентах, получив почти стопроцентную инъекцию и активацию в 60% случаев.
- Проблема в том, что память агентов не защищена, нет фильтра для проверки содержимого.
- Исследователи разработали систему AM-Sentry с двумя предохранителями: политикой сохранения памяти и экраном извлечения.
- AM-Sentry успешно снизила успех GhostWriter, не ухудшая полезные функции агента.
- Авторы надеются внедрить методы защиты в коммерческие платформы с долговременной памятью.
В ChatGPT и Gemini нашли новый способ подбросить ложные воспоминания
20 июл 2026
Краткий пересказ
от нейросети YandexGPT
Источник:
hightech.fm
Обложка: Изображение из статьи