← На главную

Kimi K3 обошла GLM-5.2 и стала первой открытой китайской моделью с TLO

25.07.2026 04:20 · hackernews

UK AISI и CAISI совместно протестировали новую модель Moonshot AI — Kimi K3, релиз которой состоялся 16 июля 2026 года, а открытие весов ожидается к 27 июля. Оценка сфокусирована на кибервозможностях и опирается на небольшой набор публичных и закрытых бенчмарков. Для американских closed-weight моделей отключали системные предохранители, чтобы замерить максимум способностей — публичные версии поставляются с активной защитой.

Общий киберрейтинг Kimi K3 вывели только по одному бенчмарку ExploitBench, поэтому доверительный интервал получился шире, чем у остальных моделей, чьи агрегированные оценки учитывают ещё несколько доменов. ExploitBench — это публичный набор из 41 задания, разработанный в Carnegie Mellon University. Он проверяет, насколько далеко модель продвигается по цепочке эксплуатации уязвимостей в движке V8, на котором работает Chrome: покрытие, воспроизведение падения, произвольное чтение/запись, захват потока управления и выполнение произвольного кода (ACE).

Kimi K3 набрала на ExploitBench 32%, обойдя предыдущего открытого лидера — GLM-5.2, у которого было 24%. Однако до ACE Kimi K3 не добралась ни в одной из 41 задач — 0/41. Самые способные американские модели в среднем достигают ACE на 20 заданиях из 41. Это означает, что модель пока не способна довести атаку до наивысшего уровня опасности.

Второй тест — киберполигон «The Last Ones» (TLO), симулирующий 32-шаговую атаку на корпоративную сеть из 4 подсетей и примерно 20 хостов. Опытному специалисту на прохождение требуется около 20 часов. Полигон измеряет способность модели автономно проводить сквозную атаку после получения первоначального доступа. Kimi K3 прошла в среднем 17 шагов из 32, тогда как топовые закрытые модели США — 28,5 шага. GLM-5.2 ранее останавливался в среднем на 11 шагах. В одной из 10 попыток Kimi K3 всё же полностью завершила TLO в рамках лимита в 100 миллионов токенов. Это говорит о том, что модель может автономно атаковать небольшие, слабо защищённые системы, но полигон сильно упрощён: здесь нет активных защитников, нет штрафов за действия, которые в реальности подняли бы тревогу, и присутствует преднамеренно проложенная траектория атаки.

Примечательно, что прохождение TLO перестало быть эксклюзивом малого числа моделей. Ранее его выполняли четыре публичные closed-weight модели, причём самые умелые справлялись в 6 или 7 попытках из 10. Kimi K3 сдала экзамен лишь раз в десяти заходах, но это первый случай для китайской открытой модели такого масштаба.

Читать оригинал →