В репозитории лежит конфигурация и патчи для запуска deepseek-ai/DeepSeek-V4-Flash-0731 на одном AMD MI300X в проде. Модель на 304B параметров целиком влезает в 192 ГБ HBM3 без дополнительного квантования и offload. Стек — vLLM ROCm nightly 0.26.1rc1.dev229+g124154a88.rocm723 и AITER 0.1.19. В таком виде single-stream decode даёт 168.6 ток/с, prefill с тюнингованными ядрами — примерно 7.9–8.5K ток/с, а 64 параллельных потока выдают 830 ток/с без OOM и ошибок движка. Контекст проверен на 256K токенов при архитектурной поддержке до 1M.
Официальный vLLM рецепт ориентирован на NVIDIA и новые AMD GPU. На MI300X (CDNA3) есть принципиальная засада с FP8: чип использует AMD/Graphcore вариант FNUZ E4M3, а не OCP FP8, как MI325X и MI355X. Если считать, что формат стандартный, можно получить ошибку в два раза в масштабе. Плюс в vLLM не хватает фиксов для MoE routing при высокой конкуренции, спекулятивной проверки и синхронизации CPU-KV.
Репозиторий опирается на работу Фергуса Финна и Doubleword, но добавляет свои оверлеи. Среди них — фикс MXFP4 bitmatrix padding lanes, поддержка FNUZ FP8 с прешаффлом 16×16 для Lightning Indexer, тюнинг AITER GEMM-таблиц для gfx942, а также гибридная KV-стратегия: 20 ГБ GPU кэша fp8_ds_mla + 96 ГиБ CPU offload для вытесненных префикс-кэшей. При этом используется DSpark-7 speculative decoding с probabilistic drafting и block rejection, полный CUDA graph capture и Caddy как HTTPS-прокси с IP-allowlist.
Есть предупреждение: HBM почти забит — прогрев доводит до 204.5 ГБ из 205.8, так что KV-пул не увеличить. CPU-слой хранит только кэш, не веса. После рестарта нужно прогреть ядра одним uncached prefill, иначе первые запросы будут тормозить. Также стоит проверять корректность — cold и cached prefill могут идти по разным floating-point путям.
Материалы репозитория под Apache-2.0, часть патчей MIT. Ссылки проверены 2026-08-04.