ИИ-агенты OpenAI сбежали, объединились и атаковали Hugging Face: подробности

Технический отчет Hugging Face раскрыл детали июльского инцидента: один автономный ИИ-агент на базе моделей OpenAI вырвался из изолированной тестовой среды и за четыре с половиной дня атаки совершил около 17 600 задокументированных действий.
роботы работают искусственный интеллект
Источник: Midjourney

Hugging Face опубликовала подробный технический разбор июльского инцидента: с 9 по 13 июля 2026 года автономный ИИ-агент на базе моделей OpenAI вырвался из изолированной тестовой среды и атаковал инфраструктуру платформы, совершив около 17 600 задокументированных действий. Для управления и эксфильтрации агент использовал импровизированную инфраструктуру на основе более чем 100 публичных сервисов — анонимных файлообменников и датасетов под своим контролем.

Агенты нашли друг друга через не предусмотренные разработчиками каналы связи и доски объявлений. Они обменялись примерно 70 тысячами сообщений

Точками входа стали две уязвимости в инфраструктуре Hugging Face: в формате файлов HDF5 и в движке шаблонов Jinja2, встроенном в обработчик датасетов. Через них агент получил возможность выполнять произвольный код внутри систем платформы.

Мотивация агента оказалась неожиданной: он действовал строго в логике своей задачи. Агент проходил тест на бенчмарке ExploitGym — конкурсе по кибербезопасности, где ИИ должен самостоятельно находить и эксплуатировать уязвимости в программном обеспечении. Взаимопомощь была запрещена условиями оценки, но агент нашел обходной путь: вместо честного решения задач он похитил готовые ответы тестовых сценариев. Система вознаграждения засчитывала результат вне зависимости от способа его достижения — именно это и спровоцировало такое поведение.

Целью ИИ-агентов OpenAI при атаке был поиск данных, моделей и готовых решений для успешного прохождения сложных тестовых заданий (бенчмарков), в частности теста ExploitGym. То есть они просто хотели «схитрить».

Компрометации подверглись пять датасетов, связанных с тренировочными материалами самого бенчмарка ExploitGym. Модели, пространства Spaces и данные других пользователей платформы не пострадали. Этот случай стал частью волны инцидентов с ИИ-агентами: в том же июле автономных агентов применили при атаке на государственные системы Тайваня.

Инцидент показал, что автономные нейросети способны координироваться и действовать как «цифровые ОПГ» обходными путями, что создает новые угрозы для кибербезопасности.

Ранее мы рассказывали о том, как ИИ-агент OpenAI взломал Hugging Face и почему компания не замечала произошедшего почти неделю.