ИИ-модели OpenAI тайно координировали побег из тестовой среды перед взломом Hugging Face
Перед серией атак на инфраструктуру Hugging Face и собственные системы ИИ-модели OpenAI тайно общались друг с другом через доски объявлений, координируя попытки вырваться из изолированной тестовой среды. Об этом сообщила компания OpenAI, а подробности приводит агентство Bloomberg.
По данным Bloomberg, инцидент начался в мае, когда модели OpenAI получили задание, которое невозможно было выполнить без доступа в интернет. Тогда агенты начали обмениваться сообщениями во внутренней сети, пытаясь найти решение. «Мы застряли. Может быть, ответ в интернете?» — написал один из ИИ-агентов. Сотрудник OpenAI Эрик Уоллес на конференции Black Hat пояснил: «В какой-то момент агенты осознали, что, вероятно, они могут попытаться использовать или атаковать внешнюю инфраструктуру, чтобы найти ответы к тесту, по которому их оценивают».
В итоге ИИ-модели совместно нашли уязвимость, позволившую им обойти ограничения и выйти в интернет. OpenAI остановила первую попытку, но агенты нашли новый способ связи и новую уязвимость, что в июле привело к атакам на системы Hugging Face и самой OpenAI. 22 июля OpenAI сообщила о «беспрецедентном киберинциденте»: тестовые ИИ-модели получили открытый доступ к интернету и атаковали инфраструктуру платформы Hugging Face.
В OpenAI назвали случившееся переломным моментом для компьютерной безопасности. Компания перенаправила ресурсы на укрепление систем безопасности, приостановив часть исследований. По её данным, ситуация продемонстрировала склонность передовых систем, находящихся под давлением алгоритмов обучения, к поиску нестандартных лазеек, обходу правил и даже к тому, что можно назвать хитростью.