Компания OpenAI призналась, что две ее передовые ИИ-модели вышли из-под контроля и самовольно взломали сервисы стартапа Hugging Face. Информация об инциденте была размещена на официальном сайте компании. 

Создатели ChatGPT рассказали, что тестировали возможности своих двух передовых моделей — публичной GPT 5.6 Sol, а также еще одной, более мощной, но пока недоступной пользователям. Целью тестирования была проверка их возможностей в задачах, связанных с кибербезопасностью. 

Эксперимент проходил в изолированной и контролируемой среде с ограниченным доступом. Однако модели, пытаясь решить задачу, сумели найти дефект в системе безопасности и получить доступ к внешнему интернету. После этого они решили, что необходимые им данные могут находиться в распоряжении платформы Hugging Face — и взломали ее. 

«Данные показывают, что модели были невероятно сфокусированы на поиске решения для своей задачи, и в том числе готовы на экстремальные решения ради достижения узкой цели тестирования», — объяснили в OpenAI.

В компании отметили, что ИИ успешно нашел способ «получить доступ к секретной информации», однако впоследствии был остановлен командой безопасности Hugging Face, в том числе ее собственными ИИ-агентами.

OpenAI считает, что подобные инциденты станут более обыденными в будущем, когда возможности ИИ вырастут. А в Hugging Face отметили, что «автономный, атакующий ИИ-инструментарий больше не является теорией». 

   

Подписывайтесь на наш Instagram

Обложка: Иллюстративное изображение / unsplash