Команда Kimi Team представила новую гибридную архитектуру внимания Kimi Linear, которая впервые в честных сравнениях обходит классическое полное внимание (full attention) на разных задачах — от коротких и длинных контекстов до RL-масштабирования. В основе архитектуры лежит модуль Kimi Delta Attention (сокращённо KDA). Он расширяет Gated DeltaNet более тонким механизмом гейтирования, чтобы эффективнее использовать ограниченную память конечного автомата в RNN.
С практической стороны авторы придумали блочный алгоритм, специально заточенный под конкретный вид матриц перехода — частный случай диагональ-плюс-низкий-ранг (DPLR). Такой подход резко урезает объём вычислений по сравнению с общим DPLR и при этом не отходит от классического дельта-правила, что даёт высокую утилизацию железа.
Для проверки идей исследователи предобучили модель Kimi Linear с 3 миллиардами активных параметров (всего 48 миллиардов) на послойном гибриде — часть слоёв KDA, часть Multi-Head Latent Attention (MLA). При идентичном рецепте тренировок Kimi Linear серьёзно опережает чистое MLA на всех тестовых задачах. Бонус — KV-кэш ужимается вплоть до 75%, а пропускная способность декодирования на миллионном контексте вырастает в шесть раз. Иными словами, архитектуру можно безболезненно ставить вместо полного внимания, выигрывая и в качестве, и в скорости, особенно когда нарастает длина входа и выхода.
Чтобы поддержать дальнейшие исследования, команда открыла исходники ядер KDA и интеграции с vLLM, а также выложила чекпоинты претрейна и инструктивно-дообученных версий модели.