Вышла архитектурная схема Kimi K3 — свежей открытой модели на 2.8 триллиона параметров, самой крупной из опенсорсных на сегодня. По сути, это предельно разогнанная продакшен-версия прошлогодней Kimi Linear (масштабирование с 48B до 2.8T). Из нового компонента — LatentMoE, такой же, как в Nemotron 3 Ultra. Он сжимает большие линейные слои, примерно как multi-head latent attention поступает с матрицами внимания.
Главный вектор всей конструкции — снизить стоимость инференса. Многие блоки заменены на более эффективные варианты: MoE превратился в LatentMoE, обычное внимание — в multi-head latent attention и Kimi Delta Attention. Единственное изменение, не завязанное на экономию, — attention residuals. Они улучшают остаточные связи между слоями, подмешивая вес через вычисленное внимание. DeepSeek V4 решала похожую задачу через mHC (manifold-constrained Hyper-Connections), делая остаточный путь шире, а тут подход иной. По данным отчёта, attention residuals стабильно поднимают validation loss и качество на downstream-задачах, добавляя примерно 4% к стоимости обучения и 2% к стоимости инференса.
Любопытная деталь: Kimi K3 полностью отказалась от RoPE и везде использует NoPE — нигде нет позиционных эмбеддингов. Эта черта унаследована от Kimi Linear. Раньше тренд был в сторону RoPE для локальных слоёв (например, sliding window attention) и NoPE для глобальных, а полностью без RoPE пока работали лишь единичные архитектуры. Kimi K3 — первый случай на уровне frontier-модели. Также модель получила нативную мультимодальную поддержку. Полную схему и сравнение бенчмарков можно найти в галерее архитектур LLM Architecture Gallery.