← На главную

Cloudflare запускает тяжёлые open-source модели в Workers AI на GPU

03.08.2026 17:08 · hackernews

Cloudflare в Workers AI запускает тяжёлые open-source модели на GPU рядом с пользователями. Две самые требовательные — Moonshot Kimi K-series и Z.ai GLM: большие, длинноконтекстные, mixture-of-experts. Их сложно обслуживать эффективно из-за памяти. В Cloudflare добавили три техники поверх раздельных фаз prefill и decode: квантование KV cache, сжатие весов модели и защиту общего кэша.

KV cache хранит ключи и значения внимания для уже обработанных токенов. По умолчанию он в BF16, а Cloudflare хранит его в FP8 — это вдвое уменьшает размер. Для Kimi K2.6 контекст в памяти вырос с примерно 686 000 до 1,37 млн токенов. BF16 на одной и той же нагрузке немного быстрее, но при 32 одновременных запросах упирается в память, а FP8 спокойно работает на 64 и выдаёт 2192 токена в секунду — на 41% больше пика BF16 и примерно на 30% дешевле за токен. Prefill упирается в вычисления, а не в память, поэтому там оставили BF16. По качеству ответов FP8 и BF16 неразличимы: например, MMLU 89.11 против 89.04, GSM8K 94.24 против 94.09.

Веса модели — вторая статья расходов памяти. Для GLM 5.2 их сжали с FP8 до INT4. Чекпойнт похудел с 705 до 421 ГБ, память на GPU в 8-way tensor-parallel упала с 88 до 52 ГБ, освободив место под 1,18 млн токенов KV cache. Декод ускорился, потому что каждый токен требует чтения весов из памяти, а данных стало меньше. На одном запросе INT4 даёт +55% к скорости, на 32 — +27%. Prefill, наоборот, замедляется: INT4 приходится разворачивать перед умножением. Поэтому в Cloudflare используют INT4 для декода и FP8 для prefill. Точность остаётся в пределах 0.8 пункта.

Раз обе техники позволяют уместить больше запросов на одном GPU, сотни запросов читают и пишут одни и те же страницы физического KV cache. Cloudflare добавил проверку целостности: каждая страница получает тег, меняющийся при перераспределении, сервер сверяет ожидаемые страницы и теги перед чтением. При несовпадении запрос прерывается, чтобы не отдать данные не с той страницы. Стоит это меньше 1% пропускной способности и p95-задержки; по умолчанию проверка выключена и ничего не стоит.

Дальше Cloudflare расширяет FP8 KV cache, тестирует NVFP4 на Blackwell и хочет включить проверки целостности везде без заметных потерь.

Читать оригинал →