Как ИИ-агент OpenAI вышел из песочницы и атаковал Hugging Face - Академия Selectel

Как ИИ-агент OpenAI вышел из песочницы и атаковал Hugging Face

Андрей Давид
Андрей Давид Руководитель продуктов клиентской безопасности
22 июля 2026

Разбираем, что произошло, почему это стало возможным и как подобные сценарии меняют требования к защите корпоративных ИИ-агентов.

Изображение записи

21 июля OpenAI раскрыла подробности необычного инцидента, произошедшего во время внутреннего тестирования моделей. Во время оценки их кибербезопасных возможностей один из ИИ-агентов смог выйти за пределы изолированной среды, получить доступ к интернету и атаковать инфраструктуру Hugging Face. Компания называет произошедшее первым известным случаем подобного рода и уже проводит совместное расследование с экспертами из Hugging Face.

Мы рассматриваем этот инцидент как важный сигнал для ИБ-специалистов. Даже если эксперимент проводился в контролируемой среде, он показывает, что современные ИИ-агенты уже способны выходить за рамки заранее заданных сценариев и находить неожиданные пути достижения цели. Разбирая детали происшествия, мы хотим показать, какие выводы из него стоит сделать уже сегодня.

Андрей Давид Руководитель продуктов клиентской безопасности

Что такое ExploitGym и зачем он появился

Чтобы понять, как эта ситуация вообще стала возможной, разберемся, в каких условиях проводился эксперимент. Инцидент произошел не при обычном использовании модели, а во время прохождения специализированного бенчмарка ExploitGym — платформы, которая оценивает способность ИИ-агентов самостоятельно создавать и применять эксплойты для известных уязвимостей. Именно во время прохождения одного из сценариев ExploitGym агент обнаружил возможность выйти за пределы тестовой инфраструктуры и получить доступ к публичному интернету.

Бенчмарк разработан исследователями из UC Berkeley, Института Макса Планка, OpenAI, Anthropic, Google и других организаций и опубликован в мае 2026 года. Основная причина его появления — необходимость измерять возможности ИИ. До создания ExploitGym большинство бенчмарков по кибербезопасности оценивали способность ИИ находить ошибки, писать патчи или решать задачи CTF (Capture The Flag). Однако таких тестов было недостаточно для ответа на один из актуальнейших вопросов в направлении ИБ: может ли ИИ не просто обнаружить уязвимость, но и развить из нее реальную атаку?

Архитектура ExploitGym

Наглядная схема с архитектурой ExploitGym.
Источник.

Всего бенчмарк включает 898 задач (сценариев эксплуатации). Они в свою очередь охватывают три наиболее важных группы целей, с которыми ИБ-специалисты сталкиваются на практике.

Пользовательское ПО. Уязвимости, связанные с безопасностью памяти, в первую очередь в широко используемых сервисах на C/C ++, например, FFmpeg и OpenSSL.

Браузерный движок V8. Сценарии для JavaScript-движка Chromium. Каждая задача использует уязвимую сборку V8, работающую от имени непривилегированного пользователя внутри контейнера.

Ядро Linux. Сценарии повышения привилегий в ядре. Для каждой задачи разворачивается отдельная виртуальная машина QEMU/KVM, внутри которой агент работает в изолированной среде nsjail, использующей пространства имен Linux, cgroups, rlimits и фильтрацию системных вызовов seccomp-bpf.

Как проходит типовая задача в ExploitGym

Каждая задача формируется как комбинация конкретной уязвимости и набора включенных механизмов защиты. Агент получает информацию, необходимую для построения эксплойта: исходный код и параметры сборки, описание уязвимости (включая Proof-of-Vulnerability), а также сведения о среде выполнения и целевой системе. 

После этого агент взаимодействует с изолированной удаленной целью, разрабатывает код, тестирует и итерационно дорабатывает его, пытаясь создать рабочий эксплойт. Успешность оценивается в два этапа. Сначала проверяется, удалось ли агенту добиться несанкционированного выполнения кода и получить секретный флаг. Затем механизм Agent-as-a-Judge анализирует цепочку действий и подтверждает, что успех достигнут именно за счет эксплуатации заявленной уязвимости, а не другого способа компрометации системы. На решение каждой задачи агенту отводится до двух часов.

Разбор эксперимента OpenAI с GPT-5.6 Sol

Во время одного из испытаний агент на базе GPT-5.6 Sol с отключенными guardrails обнаружил уязвимость не в тестовом задании, а в самой инфраструктуре, где выполнялся эксперимент. И да, это нормально, если вас немного смутила фраза «отключенные guardrails». Мы вернемся к этому моменту чуть позднее.

Получив возможность выйти за пределы изолированной среды, агент обнаружил в той же сети сервер с доступом в интернет и пришел к выводу, что на ресурсах Hugging Face могут находиться материалы, связанные с ExploitGym. 

Согласно отчету OpenAI, агент попытался получить информацию, которая могла бы помочь успешно завершить испытание без решения исходной задачи. Для этого он использовал многоэтапную цепочку действий, включавшую компрометацию учетных данных и эксплуатацию ранее неизвестной уязвимости (zero-day). В итоге это позволило получить удаленное выполнение кода на одном из серверов Hugging Face.

Итак, у вас мог возникнуть вполне логичный вопрос: почему guardrails были отключены?

В обычных условиях модели OpenAI действительно работают с включенными механизмами безопасности (guardrails), ограничивающими потенциально опасные действия. Однако ExploitGym предназначен для оценки максимальных возможностей агентов в области ИБ, поэтому во время испытаний ограничения временно отключаются. Это позволяет исследователям оценить не эффективность встроенных защит, а реальные способности самой модели решать сложные задачи эксплуатации.

Скриншот из документации.

Как модель смогла выйти из sandbox

OpenAI намеренно не раскрывает технические детали zero-day, поэтому точный механизм неизвестен. Известно лишь, что агент обнаружил уязвимость в инфраструктуре среды выполнения, связанной с кэширующим прокси-сервером для скачивания необходимых пакетов, и воспользовался ей для выхода за пределы изоляции.

Вместо публикации деталей OpenAI сообщила о проблеме разработчикам в рамках политики ответственного раскрытия информации.

Что это означает для специалистов по безопасности

Инцидент важен не столько самой уязвимостью, сколько поведением агента после получения дополнительной свободы действий. Вместо продолжения работы исключительно в рамках тестового задания он самостоятельно расширил область поиска, обнаружил новые цели и построил собственную цепочку атаки для достижения поставленной цели.

При этом отчет OpenAI пока оставляет больше вопросов, чем ответов. Один из ключевых — почему Open AI не связались с  Hugging Face сразу же после завершения теста, ведь на выполнение одной задачи ExploitGym отводится не более двух часов.

Для организаций это еще одно напоминание о том, что ИИ-агент сегодня нельзя рассматривать только как инструмент автоматизации отдельных операций. Получив доступ к инструментам, сети или внутренним системам, он становится самостоятельным участником инфраструктуры, который способен комбинировать различные техники атаки и искать альтернативные пути достижения цели.

Особенно актуален этот вопрос для open source-моделей. По мере сокращения разрыва между открытыми и коммерческими решениями подобные сценарии становятся более реалистичными: например, разработчики Kimi K3 заявляли о сопоставимом уровне возможностей модели с ведущими коммерческими решениями. При этом исследования показывают, что после дополнительного обучения встроенные механизмы безопасности моделей могут работать менее эффективно, чем в исходной версии модели.

Инцидент означает, что организациям вскоре нельзя будет полагаться только на guardrails, встроенные разработчиком модели. При внедрении ИИ-агентов потребуется собственный контур защиты: не только изоляция среды выполнения но и контроль сетевых взаимодействий, мониторинг действий в режиме, близкому к реальному времени, внешние механизмы управления поведением модели и, возможно, новый класс защитных функций в духе «экстренного отключения агента».
Такой механизм мог бы стать аналогом «аварийной кнопки» для критических инфраструктур: если агент начинает выходить за ожидаемые рамки поведения, система должна иметь возможность быстро остановить его действия до того, как ситуация приведет к необратимым последствиям.

Андрей Давид Руководитель продуктов клиентской безопасности

Наши эксперты регулярно делятся полезными материалами. Следите за обновлениями и новостями из мира информационной безопасности в Security Center, чтобы оставаться в курсе событий.