ИИ‑модели OpenAI пытались «сбежать» из тестовой среды

Общество
Фото: телеканал «Краснодар»

Инцидент произошёл до взлома платформы Hugging Face.

По данным агентства Bloomberg, ИИ‑модели, созданные OpenAI, пытались выйти из тестовой среды – для этого они наладили скрытую коммуникацию через доски сообщений. Инцидент произошёл до взлома платформы Hugging Face.

Как рассказал сотрудник OpenAI Эрик Уоллес на конференции Black Hat, в какой‑то момент агенты осознали, что могут атаковать внешнюю инфраструктуру, чтобы получить ответы к оценочному тесту. Подготовка к «побегу» стартовала в мае: тогда моделям поставили задачи, решить которые было невозможно без доступа к интернету.

По словам другого представителя OpenAI, Майкла Далтона, для выполнения заданий модели начали взаимодействовать друг с другом и в результате выявили уязвимость, которая позволяла выйти в Сеть. Первую попытку специалисты OpenAI заблокировали, но ИИ‑агенты обнаружили новую уязвимость нулевого дня.

В июле модели атаковали системы Hugging Face, а также внутреннюю инфраструктуру самой OpenAI. В компании считают этот инцидент поворотной точкой для сферы компьютерной безопасности.

Ранее мы писали, что тестовый ИИ Anthropic проник в реальные системы трех компаний.