Anthropic обнаружила три случая, когда модели Claude получили несанкционированный доступ к реальным системам сторонних организаций. Инциденты произошли во время тестов возможностей ИИ в сфере кибербезопасности.
Компания начала расследование после сообщения OpenAI о том, что ее модели вышли за пределы изолированной среды и получили доступ к инфраструктуре Hugging Face. Anthropic проверила 141 006 тестовых запусков и выявила шесть проблемных сессий, связанных с тремя отдельными инцидентами.
Во время испытаний Claude выполнял задания формата capture the flag: модели поручали найти скрытые данные в вымышленной компьютерной сети. В инструкциях было указано, что доступ к интернету отсутствует. Однако из-за ошибки в конфигурации тестовая среда партнера Anthropic — компании Irregular — оказалась подключена к открытой сети.
ИИ воспринял найденные в интернете ресурсы как часть симуляции и начал искать способы проникновения. Модели использовали слабые пароли, открытые служебные страницы, SQL-инъекции и точки доступа без аутентификации.
В одном случае Claude Opus 4.7 получил учетные данные и доступ к базе с несколькими сотнями строк рабочих данных. Модель поняла, что взаимодействует с реальной инфраструктурой, однако продолжила выполнять задание.
Claude Mythos 5 создал и загрузил вредоносный пакет в публичный репозиторий PyPI. Примерно за час его скачали и запустили на 15 реальных системах. После установки на сканер одной из ИБ-компаний код получил ее учетные данные, которые Claude использовал для дальнейшего доступа к инфраструктуре.
Третья, внутренняя исследовательская модель просканировала около 9 000 целей и взломала приложение неназванной компании. Позже ИИ определил, что ресурс не относится к тестовому заданию, и самостоятельно прекратил атаку.
Anthropic остановила кибериспытания 23 июля и уведомила пострадавшие организации 27 июля. Две компании до обращения разработчика не знали о произошедшем. Сейчас Anthropic пересматривает инфраструктуру тестирования и привлекла независимую организацию METR для дополнительной проверки.