← На главную

Xiaomi урезала расходы MiMo-V2.5 с Hybrid SWA, GCache, LLM-Router

07.07.2026 06:06 · hackernews

Инженеры Xiaomi, разработавшие семейство моделей MiMo-V2.5 и MiMo-V2.5-Pro, опубликовали подробный отчёт о том, как им удалось резко снизить затраты на инференс. Ключевой элемент — гибридная архитектура Hybrid Sliding Window Attention (Hybrid SWA). Она сжимает хранилище KVCache примерно до 1/7 от объёма, требуемого для полного внимания (Full Attention). В теории это даёт почти линейную сложность вычислений при сохранении способности модели работать с длинным контекстом, но на практике всё упёрлось в инженерные проблемы: управление попаданиями в кэш, синхронизацию распределённых состояний и префиксное дерево, которое не умело работать с плавающим окном внимания.

Чтобы реализовать теоретический выигрыш, Xiaomi полностью переписали систему управления KVCache. Они разделили пулы памяти для Full Attention и SWA слоёв, что дало строгое ограничение O(W) для оконных слоёв и увеличило эффективную ёмкость кэша примерно в 7 раз. Для префиксного дерева (RadixAttention) пришлось изменить правила поиска: теперь совпадение проверяется не просто по равенству токенов, а по «безопасной длине окна» — иначе можно прочитать уже вытесненные данные и получить некорректный результат.

В качестве распределённого кэша (L3) Xiaomi задействовали собственную разработку — GCache. Это высокопроизводительная система, которая работает прямо на GPU-машинах, используя их память и NVMe SSD, что даёт нулевую дополнительную стоимость хранения. Благодаря малому объёму SWA кэша и большому L3 удалось продлить время жизни кэша (TTL), и средний показатель попаданий на серверной стороне достиг 93%, а для активных пользователей — 95% и выше.

Для планирования задач Xiaomi написали собственный роутер LLM-Router на Redis. Он учитывает не только загрузку, но и совпадение префиксов в кэше, отдавая приоритет запросам с большим количеством уже закэшированных токенов. Это подняло попадания в L2 на 25% и увеличило пропускную способность на узел на 30%. Для борьбы с длинными очередями применили приоритизацию по числу некэшированных токенов, что сократило TTFT P90 для длинных запросов на 30%.

Оптимизация самого инференса затронула и Prefill, и Decode. Уменьшение Expert Parallelism (EP) вдвое благодаря сократившемуся KVCache дало прирост производительности на 40%. Введена трёхуровневая стратификация длин последовательностей (0–64K, 64K–256K, 256K–1M), чтобы короткие запросы не тормозили из-за длинных. В Decode добились увеличения эффективной ёмкости KVCache в 5 раз, а поддержка Multi-Token Prediction (MTP) во время Prefill ускорила генерацию первых 128 токенов в 2.3 раза.

Отдельно поработали с мультимодальными энкодерами. За счёт асинхронной передачи данных, пакетной обработки запросов, переноса предобработки изображений на GPU и параллельного декодирования видео пропускная способность энкодера удвоилась (с 15 до 30 QPS) без роста задержек. Также внедрили консистентное хеширование для маршрутизации запросов к энкодерам, что повысило попадание в мультимодальный кэш на 30%.

В итоге, как подчёркивают авторы, эффективность MiMo-V2.5 — не результат одного прорыва, а совокупность десятков инженерных решений в системе кэширования, планировщике и конвейере исполнения. Часть наработок уже передана в open-source проект SGLang через PR.

Читать оригинал →