xAI выпустила Grok 4.5, назвав его своей самой умной моделью. Заявляют, что тренировали её вместе с Cursor — упор на код и агентную работу. Авторы статьи решили проверить новинку в деле и устроили массовый build-off: выдали Grok 4.5, GPT-5.5, Claude Opus 4.8 и Claude Fable 5 три одинаковых задания. Каждое — один self-contained HTML-файл без библиотек и сетевых запросов. Одна попытка, без доработок промпта. Если приложение не рендерилось — давали ровно один ретрай.
Первый раунд — 3D кубик Рубика с кнопками Scramble и Solve и анимацией поворотов. Самое сложное задание. Claude Opus 4.8 и Claude Fable 5 сделали всё идеально с первой попытки: цветной 3D-куб, анимированные повороты. Grok 4.5 споткнулся — первый билд показал пустой экран, пришлось потратить ретрай. Вторая попытка выдала нормальный куб. GPT-5.5 провалился: вместо куба рендерил одну тёмную грань. Победили обе модели Claude.
Второй раунд — гравитационная песочница с частицами, трейлами и кликабельными аттракторами. Тут справились все. GPT-5.5 сделал самую залипательную картинку: неоновые аттракторы, плотные цветные шлейфы. Grok 4.5 — аккуратные орбиты, Claude Fable 5 — мягкие светящиеся сферы, Opus 4.8 — самая насыщенная паутина частиц с отличной физикой, но попроще визуально. Победил GPT-5.5.
Третий раунд — Breakout (арканоид). Все четыре модели с первой попытки выдали полностью играбельную игру с очками, жизнями и светящейся ракеткой. Grok 4.5 и GPT-5.5 особенно старались в неоновую стилистику. Ничья — все четыре приложения «корабельного» качества.
Бонусом модели попросили нарисовать SVG сцену: лошадь едет верхом на астронавте на Луне. Fable 5 всех переплюнул — лошадь в ковбойской шляпе кричит «Giddy-up, human!», астронавт пыхтит. GPT-5.5 — лошадь кричит «WHEE!». Grok 4.5 — чисто и по делу. Opus 4.8 — хорошая сцена, но в сыром SVG оказался дублирующийся атрибут.
По скорости и стоимости Grok 4.5 — явный лидер: первый токен за 0,44 секунды, пропускная способность ~110 токенов в секунду (примерно вдвое больше конкурентов), цена ответа — 0,002 цента. GPT-5.5 быстрее всех отвечал на короткие запросы (2 секунды), Opus 4.8 — сбалансирован, Fable 5 — самый медленный и дорогой (6,3 секунды, 0,009 цента за ответ). Вердикт: Grok 4.5 — зверь по скорости и цене, модели Claude — самые надёжные сборщики сложных задач, GPT-5.5 — стилист с самыми красивыми демками, но провалил 3D.