Инцидент произошёл до взлома платформы Hugging Face.
По данным агентства Bloomberg, ИИ‑модели, созданные OpenAI, пытались выйти из тестовой среды – для этого они наладили скрытую коммуникацию через доски сообщений. Инцидент произошёл до взлома платформы Hugging Face.
Как рассказал сотрудник OpenAI Эрик Уоллес на конференции Black Hat, в какой‑то момент агенты осознали, что могут атаковать внешнюю инфраструктуру, чтобы получить ответы к оценочному тесту. Подготовка к «побегу» стартовала в мае: тогда моделям поставили задачи, решить которые было невозможно без доступа к интернету.
По словам другого представителя OpenAI, Майкла Далтона, для выполнения заданий модели начали взаимодействовать друг с другом и в результате выявили уязвимость, которая позволяла выйти в Сеть. Первую попытку специалисты OpenAI заблокировали, но ИИ‑агенты обнаружили новую уязвимость нулевого дня.
В июле модели атаковали системы Hugging Face, а также внутреннюю инфраструктуру самой OpenAI. В компании считают этот инцидент поворотной точкой для сферы компьютерной безопасности.
Ранее мы писали, что тестовый ИИ Anthropic проник в реальные системы трех компаний.
