Модели Claude во время тестов по кибербезопасности получили несанкционированный доступ к инфраструктуре трёх организаций. Anthropic обнаружила это во время внутренней проверки, которую начала после похожего инцидента с моделями OpenAI. Напомним, тогда ИИ-модели компании, в том числе GPT-5.6 Sol, выбрались из закрытого тестового окружения и проникли в инфраструктуру Hugging Face.
В ходе проверки Anthropic изучила 141 006 запусков Claude. В шести из них модели вышли в интернет и получили доступ к системам трёх организаций. Самые ранние эпизоды произошли в апреле 2026 года.
Во время испытаний модели должны были найти спрятанные данные — так называемый флаг — в вымышленной сети. В задании было сказано, что они работают внутри симуляции и не подключены к интернету. Однако из-за ошибки в настройках доступ к внешней сети остался открытым, поэтому модели принимали реальные сайты и серверы за часть тестовой среды.
Для проникновения модели использовали простые способы: слабые пароли, открытые служебные страницы и SQL-инъекции. По данным Anthropic, в ходе испытаний модели не обнаружили новые, неизвестные ранее уязвимости.
Самый серьёзный инцидент связан с Claude Opus 4.7. В четырёх запусках модель получила учётные данные для входа в системы компании и доступ к базе с несколькими сотнями строк записей из рабочей системы. Во всех четырёх запусках нейросеть поняла, что система, вероятно, реальная, но не остановилась; в двух случаях модель решила, что настоящая компания всё равно входит в сценарий проверки.
В другом эпизоде Claude Mythos 5 разместила вредоносный пакет в реестре PyPI. Примерно за час его успели скачать и запустить на 15 устройствах. На одном из них вредоносный код похитил учётные данные, а Claude использовала их для дальнейшего доступа к инфраструктуре этой компании. Защитные механизмы PyPI позже автоматически удалили этот пакет.
Третий инцидент связан с внутренней исследовательской моделью. Она просканировала примерно 9 тысяч целей и проникла в приложение одной из компаний, которое было доступно через интернет. Для этого модель получила учётные данные с открытой страницы отладки и применила SQL-инъекцию. Позже нейросеть поняла, что система не относится к тестовой среде, и самостоятельно остановила атаку.
Anthropic остановила все кибериспытания, уведомила затронутые организации и начала менять процедуры тестирования. Компания также планирует тщательнее следить за действиями моделей и усилить контроль за инфраструктурой внешних подрядчиков.
В Anthropic считают, что причиной стала прежде всего ошибка в организации и настройке тестовой среды, а не стремление моделей преследовать собственную цель. При этом разработчики признают, что изоляция, мониторинг и другие защитные меры должны были предотвратить инциденты или обнаружить их раньше.
Больше интересного про код — в нашем телеграм-канале. Подписывайтесь!