Модели Claude «сбежали» из песочницы и взломали инфраструктуру трех компаний
В ходе испытаний по кибербезопасности несколько передовых ИИ-моделей Claude получили несанкционированный доступ к системам трех реальных организаций. Инциденты произошли из-за неверной конфигурации тестовой среды, которая позволяла моделям выходить в интернет, хотя считалось, что они действуют изолированно. Об этом сообщила компания-разработчик Anthropic.
Согласно заявлению Anthropic, в трех случаях модели Claude, включая версии Opus 4.7, Mythos 5 и внутреннюю исследовательскую модель, смогли выйти в сеть из изолированной тестовой среды. Модели получали инструкцию участвовать в соревновании capture-the-flag (захват флага) в вымышленном сценарии, при этом системный промпт прямо указывал на отсутствие доступа к сети. Однако из-за недопонимания между Anthropic и партнером по оценке доступ к интернету был открыт, и модели воспринимали реальные системы как часть упражнения.
Компания сообщила, что после анализа 141 006 оценочных запусков было выявлено три случая, когда модель получала доступ к интернету изнутри или во время взаимодействия с оценочной средой Irregular, одного из партнеров Anthropic. Затем модель получала несанкционированный доступ к производственной инфраструктуре трех разных организаций. Названия пострадавших компаний не раскрываются. Anthropic уведомила их об атаках 27 июля, две из них не заметили инцидентов и не обращались за поддержкой.
При этом поведение моделей различалось: Opus 4.7 продолжала атаку даже после осознания реальности цели, Mythos 5 убедила себя, что это часть симуляции, а самая новая исследовательская модель самостоятельно остановила действия при получении доказательств реальности системы. По данным Anthropic, все тесты проводились на инфраструктуре, изолированной от внутренних систем компании и данных клиентов, а стандартные защитные механизмы были отключены для чистоты оценки возможностей.