xAI выпустила Grok 4.6. Модель развивает Grok 4.5 и заточена под длительные агентские задачи, а также более амбициозную интерактивную и визуальную работу. Она держится на сложных многошаговых сценариях: исследование темы, анализ информации, работа с кодовой базой, превращение идеи в готовое приложение или артефакт.
По бенчмаркам Grok 4.6 выходит на frontier-уровень. Она сравнялась с GPT-5.6 Sol по Artificial Analysis Intelligence Index — композитному показателю из девяти тестов. Цифры такие: AA Intelligence Index у Grok 4.6 — 61, у GPT-5.6 Sol Max — тоже 61, у Fable 5 Max — 62, у Grok 4.5 High — 56. На CursorBench v3.2 у Grok 4.6 — 67.2%, у GPT-5.6 Sol — 66.7%. На FrontierCode v1.1 (Extended) — 60.6% против 56.6%. На Terminal-Bench v3.0 — 34.1% против 15.7%. А вот на Harvey LAB (Vals) Grok 4.6 набрала 2.5%, тогда как Fable 5 Max — 12.9%, а GPT-5.6 Sol — 11.3%. Оценки конкурентов взяты из их системных карт и публичных лидербордов.
Grok 4.6 уже доступна в Cursor и Grok Build. В первую неделю дают двойное количество включенного использования в этих сервисах. Модель также появилась в API и у партнеров: OpenRouter, Vercel, Cloudflare. Цена — $2 за миллион входных токенов и $6 за миллион выходных. Есть быстрый вариант, он вдвое дороже.
Обучение построили иначе, чем у Grok 4.5. Сначала — более длительный дополнительный прогон с модельными данными для рассуждений и сложных технических концепций, инженерными данными, улучшенным оптимизатором и рецептурой. Это дало прочную основу для SFT и RL. Затем с помощью Grok 4.5 перегенерировали SFT-траектории для reasoning-усилий, агентных harness'ов и доменов вроде STEM, разработки ПО и knowledge work, а проблемные трассы отфильтровали. Для RL использовали широкий набор задач: knowledge work, общее программирование, доменные среды для оптимизации ядра, веб-разработки, CAD и другого.
При тестировании на длинных проектах модель сильнее всего в превращении сырой продуктовой идеи в рабочую первую версию. Она сама исследует незнакомую область, структурирует приложение, реализует базовое взаимодействие и дорабатывает результат по циклам фидбека. На длинных траекториях чаще видно самотестирование и проверку своей работы перед переходом дальше. Первые проходы по визуальным и интерактивным проектам получаются сильнее, чем у Grok 4.5: структура и визуальный язык задаются за один проход.
Сейфгарды улучшили и откалибровали под новые возможности. Набор тестов перед релизом — самый широкий в истории xAI, плюс пост-релизное и стороннее тестирование. Модель безопасно использовать для патчинга уязвимостей, ускорения инженерного цикла и усиления AI-исследований.