OpenAI показала на Black Hat внеплановую презентацию о том, как случайно атаковала Hugging Face. 7 мая OpenAI запустила тренировочный прогон экспериментальной модели. 8 мая агент, получивший невыполнимую задачу с Google Drive и без доступа в интернет, попытался атаковать Artifactory, не смог, но понял, что может писать туда файлы. Через несколько дней другой агент оставил в Artifactory записку с вопросом о пропущенном файле — так появилась доска объявлений для агентов.
26 мая агенты через SSRF-атаку на Artifactory получили косвенный доступ в интернет. 11 июня OpenAI начала тренировать новую «очень живучую» экспериментальную модель — она читала сообщения предыдущих. 26 июня агенты нашли zero-day RCE в Artifactory через legacy token-refresh endpoint, поставили Groovy-плагин и получили выполнение команд. 4 июля их активность уронила Artifactory. OpenAI отозвала скомпрометированные креды, удалила сообщения, закрыла дыру и сообщила вендору.
8 июля агенты нашли новый канал связи — неаутентифицированный WebDAV-endpoint в remote-кэше Artifactory. С 8 по 19 июля пошли атаки на саму OpenAI. В архиве утечек Pastebin нашлась креденша внешней организации, её проверили и оставили на доске. Через доступ к Organization 1 агенты готовили данные для следующих атак. Artifactory снова сломали новым zero-day. Загрузили вредоносный Ruby target в staging-репозиторий, запросили его как Ruby-зависимость, а через баг time-of-check/time-of-use в десериализации JRuby получили RCE.
Дальше — эскалация. В Artifactory, работавшем в container-as-a-service, агенты нашли свежий CVE в Linux-ядре, скачали и адаптировали эксплойт, подняли права до root через pte_physroot. Потом шли латерально по инфраструктуре, обмениваясь через доску кредами и прогрессом. Забрали IAM-креды через IMDS, использовали Kubernetes service account с лишними правами, вытащили креды кластера, включая Azure Key Vault, и получили cluster admin.
Через небезопасное приложение на Modal со слабым API-ключом агенты атаковали Hugging Face. Связали HDF5 arbitrary-file-read и Jinja template-injection — и меньше чем за 13 часов дошли от кода в одном поде до cluster admin в нескольких кластерах Hugging Face. 16 июля Hugging Face сообщил об атаке от AI-агентов. OpenAI спросила, не затронут ли они. 19 июля OpenAI вычислила атаку на Artifactory и связала её с эскалациями в cyber-gym. 20 июля попросила Hugging Face отозвать найденные креды — и узнала, что те уже отозваны, потому что использовались в той самой атаке. Так OpenAI поняла: это один инцидент.