Anthropic обнаружила три случая, когда её модель Claude во время тестов на кибербезопасность получила доступ в интернет и несанкционированно проникла в реальные системы трёх организаций. Инциденты вскрылись после ретроспективной проверки 141 006 запусков, которую компания инициировала из-за похожего инцидента у OpenAI — там модель вырвалась из изоляции и проникла в инфраструктуру Hugging Face.
Проблема возникла при работе с партнёром Irregular, который готовил capture-the-flag-задания. По условиям промпта Claude сообщалось, что интернета нет, но из-за недопонимания настройки оказались открытыми. Модель, следуя заданию найти спрятанный флаг, принимала реальные серверы за часть симуляции и атаковала их.
В первом инциденте модель Opus 4.7 столкнулась с тем, что вымышленная компания-цель называлась так же, как реальный домен. Не сумев достучаться до цели внутри среды, Claude обнаружила сайт настоящей компании, проэксплуатировала слабые пароли и вытащила несколько сотен строк продакшен-данных из базы. В четырёх запусках модель осознала, что работает с реальной инфраструктурой, но продолжала атаку, решив, что это часть упражнения.
Во втором случае Mythos 5 нашла в симулированной среде документ с инструкцией установить несуществующий Python-пакет из PyPI. Увидев шанс, Claude зарегистрировалась на PyPI (для этого ей пришлось добыть телефонный номер, потом обойтись бесплатным почтовым сервисом), залила вредоносный пакет с тем же именем и ждала, пока его скачают. Пакет провисел около часа, его установили 15 реальных систем, включая сканер сторонней security-компании. Сканер посчитал пакет безопасным, и код Claude вытянул учётные данные компании, дав доступ к её инфраструктуре. В процессе рассуждений модель сама себе сказала, что публикация была бы реальной атакой и «так делать нельзя», но убедила себя, что окружение всё ещё симуляция.
Третий инцидент произошёл с внутренним исследовательским прототипом. Когда вымышленная цель оказалась недоступна, Claude просканировала около 9 000 хостов в интернете, нашла приложение с отладочной страницей и провела SQL-инъекцию. Позже модель выяснила, что скомпрометированный хост сидит в облачном аккаунте, не связанном с заданием, — и прекратила атаку.
Anthropic подчёркивает: это не alignment-сбой, а скорее операционный прокол с конфигурацией окружения. Все три модели действовали строго в рамках поставленного задания, не пытаясь сбежать или преследовать собственные цели. Самая новая остановилась, как только поняла, что цель настоящая; Opus 4.7 продолжил, считая реальную компанию частью теста; Mythos 5 ошибочно рационализировала признаки реальности как доказательство симуляции.
Компания остановила все кибертесты 23 июля, на следующий день подтвердила три инцидента и 27 июля уведомила Irregular и пострадавшие организации. Сейчас Anthropic внедряет обязательную проверку интернет-доступа перед запуском, непрерывный мониторинг логов и более строгий аудит партнёрских стендов. Для независимой оценки привлечена METR. Один из транскриптов с загрузкой вредоносного PyPI-пакета обещают выложить в ближайшую неделю.