Grok 4.6 от SpaceXAI получил 61 балл в Artificial Analysis Intelligence Index. Это на 5 баллов больше, чем у Grok 4.5, и на 23 больше, чем у Grok 4.3. Так SpaceXAI снова в фронтире вместе с OpenAI, а впереди только Anthropic.
61 балл ставит модель в один ряд с GPT-5.6 Sol (max), позади Claude Opus 5 (max, 63) и Claude Fable 5 (max with fallback, 62), чуть впереди Kimi K3.
Главная сила Grok 4.6 — агентные задачи, а не статические рассуждения. На GDPval-AA v2, который измеряет реальную агентную работу, модель набирает Elo 1753 — это второй результат после Claude Opus 5. Статистически она неотличима от Claude Fable 5 и Qwen3.8 Max. На 𝜏³-Banking у неё 50.7% — один из двух лучших результатов, рядом с Qwen3.8 Max (51.3%). На Terminal-Bench v2.1 — 88.4%, на уровне лидеров.
Цена осталась прежней: $2 за миллион входных токенов и $6 за миллион выходных. Это более чем на 60% дешевле, чем у Claude Opus 5 ($5/$25) и GPT-5.6 Sol ($5/$30). Стоимость одной задачи — $0.84, как у Kimi K3, при чуть более высоком интеллекте. Поэтому Grok 4.6 попадает на Pareto-границу цены и качества для всех агентных тестов в индексе.
На AA-Briefcase, приватном бенчмарке длинных агентных задач, Grok 4.6 дебютирует с Elo 1577. Это уровень Fable 5, но позади семейства Claude Opus 5. При этом модель заметно эффективнее: решает задачи в среднем за ~53 хода и ~0.5B входных токенов, тогда как Claude Opus 5 (max) тратит ~103 хода и ~2.0B токенов. Для длинных задач это огромная экономия.
Контекстное окно — 500k токенов, как у Grok 4.5. Цена за кэш-хиты выросла с $0.3 до $0.5 за миллион токенов. Полные результаты по всем бенчмаркам — на artificialanalysis.ai.