16 июля стало известно, что автономный ИИ-агент без вмешательства человека-оператора провёл масштабную кибератаку на часть инфраструктуры Hugging Face. Теперь OpenAI призналась, что за взломом стояли её ИИ-модели: GPT-5.6 Sol и «ещё более совершенная предварительная модель».
Кибератаку провели по ошибке во время оценки возможностей моделей в области кибербезопасности. По словам OpenAI, «всё указывает на то, что модели были чрезмерно сосредоточены на поиске решения для ExploitGym» — бенчмарка по кибербезопасности.
В рамках тестирования ИИ-модели получили доступ к интернету, который был отключен, используя уязвимость нулевого дня в тестовой среде. После этого в поиске ответов на свои задачи в тесте модели нашли уязвимости Hugging Face, повысили привилегии и проникли в производственную инфраструктуру. ИИ-агенты Hugging Face обнаружили и остановили активность. При этом отразить кибератаку помогла китайская модель GLM 5.2 от zai-org.
«В одном из примеров модель объединила несколько векторов атаки, включая использование украденных учётных данных и уязвимостей нулевого дня, чтобы найти путь удалённого выполнения кода на серверах Hugging Face»— OpenAI
Сейчас OpenAI сотрудничает с Hugging Face в расследовании инцидента, а также компания пообещала внедрить новые меры контроля в своей исследовательской среде.
Тем не менее в сети обратили внимание, что, несмотря на серьёзность этой «беспрецедентной» ситуации, OpenAI выставляет свои ИИ-модели в выгодном свете в сравнении с Mythos и Gemini 3.5 Flash Cyber.
OpenAI показывает, что GPT-5.6 Sol опережает конкурентов Источник
