Китайский AI-лаборатория Moonshot AI анонсировала Kimi K3 — свою самую мощную модель с 2,8 триллиона параметров. Она доступна через сайт и API, а открытые веса обещают выложить до 27 июля 2026 года. В Moonshot называют её первой «open 3T-class model» (округлили 2,8 трлн до 3 трлн), отобрав лидерство у DeepSeek v4 Pro с его 1,6 трлн параметров. По внутренним тестам K3 в основном обходит Claude Opus 4.8 max и GPT-5.5 high, но уступает Claude Fable 5 и GPT-5.6 Sol.
Из отчёта Artificial Analysis: на их собственном тесте долгосрочных задач Elo модели вырос на 732 балла по сравнению с Kimi K2.6 и уступает только Claude Fable 5. Стоимость задачи ($0,94) близка к GPT-5.6 Sol ($1,04) и вдвое ниже Opus 4.8 ($1,80), но выше, чем у других открытых моделей. K3 использует на 21% меньше выходных токенов, чем K2.6. Модель также заняла первое место в Arena.ai Frontend Code arena, обогнав даже Claude Fable 5.
Цены: $3 за миллион входных токенов и $15 за миллион выходных. Это уровень Anthropic’s Claude Sonnet и самая дорогая китайская модель на сегодня — заметный скачок относительно Kimi K2.6 ($0,95/$4).
Автор статьи проверил модель старым тестом — «Generate an SVG of a pelican riding a bicycle». Через OpenRouter и llm-openrouter отправил запрос, получил SVG пеликана на велосипеде. Результат: 95 входных токенов, 16 658 выходных (из них 13 241 — reasoning tokens), стоимость 25 центов. K3 также хорошо справилась с распознаванием изображения: по тому же SVG сгенерировала точное alt-текстовое описание за 0,6 цента.
Тест выявил особенности: у модели пока один уровень reasoning — «max», и она выдала огромное количество reasoning-токенов. Затраты высоки. Подсчёт токенов для простого промпта показал, что K3 использует скрытый системный промпт примерно на 85 токенов (отказалась его раскрывать). Vision работает отлично.
Автор размышляет, что за 21 месяц тест с пеликаном потерял связь с реальным качеством моделей — сейчас GLM-5.2 делает лучших пеликанов, хотя явно не тянет на Fable-класс. Главный недостаток теста: он не оценивает agentic tool calling и длинные диалоги. Но сам автор считает, что запуск пеликана остаётся полезным «hello world»: он заставляет реально попробовать модель, даёт грубую оценку затрат и reasoning, подтверждает, что модель может верно сгенерировать SVG с пространственным восприятием. Сравнение пеликанов внутри одного семейства моделей всё ещё интересно — K3 заметно улучшила результат по сравнению с Kimi 2.5.