← На главную

Qwen 3.7 Plus за $0.04 победил в простом, GPT и Claude взяли сложное

10.07.2026 20:52 · hackernews

После хита на Hacker News предыдущий «билд-офф» решили перезапустить, учтя критику. Состав расширили до двенадцати моделей, в тесте — четыре приложения, по пять попыток на каждое. Добавили open-weights модели: GLM-5.2, Qwen 3.7 Plus, DeepSeek V4 Pro и Kimi K2.6 через Fireworks. Теперь у каждой модели по пять попыток на задачу, все артефакты опубликованы — можно оценить разброс самому.

Задача первая — Doom-style raycaster лабиринт с WASD-управлением. GPT-5.6 Sol оказался лучшим: пять из пяти заходов играбельны, согласованность и детализация выше, чем у GPT-5.5. Grok 4.5 тоже взял пять из пяти и отлично смотрится за свою цену ($0.27 за все пять запусков). Claude Opus 4.8 — стабильно, но сухо. Muse Spark 1.1 удивил: три попытки сломаны, но те две, что работали, — на уровне Claude Fable 5. GLM-5.2 нарисовал красивые стены, но персонаж ни разу не пошевелился.

Вторая задача — 3D-кубик Рубика с анимацией скрамблинга и сборки. Здесь выстрелил Claude Fable 5: все пять попыток чистые, без нареканий. Парадокс — Claude Opus 4.8 не выдал ни одной идеальной: цвета сбивались. GPT неожиданно сдали позиции: GPT-5.6 Luna все попытки провалил, скрамблинг сразу ломал рендер. GPT-5.6 Sol осилил четыре из пяти, но одна версия почему-то выдала полностью чёрный куб.

Калькулятор — третий тест. Тут лучший результат у Claude: обе модели, Opus и Fable, собрали по пять из пяти. Причём Fable — самый стильный экземпляр. GPT-5.6 Sol пытается наворотить 3D-стиль, как в рейкастере, но для калькулятора это излишне — кнопки съезжают. Простые GPT-5.6 Terra и Luna справились проще и стабильнее.

Четвёртая задача — Conway's Game of Life. Для неё не считали баллы, это был тест на скорость и цену. Qwen 3.7 Plus сделал всё за $0.04 и 11 секунд. GLM-5.2 ожил после девятиминутных пауз. Вывод: на простой задаче open-weights модели утёрли нос фронтиру — для Game of Life хватает готовых примеров.

Бонус — генерация SVG: лошадь верхом на астронавте и сцена с Илоном Маском и Джеффом Безосом, смотрящими на посадку Blue Origin. Claude Fable 5 снова лидирует: качественная композиция, блестящая лысина Безоса, дым. GPT-5.6 — мультяшно, с ошибками. Open-weights (GLM-5.2, Qwen) неожиданно справились хорошо.

Итог: на сложных задачах фронтирные модели (GPT-5.6 Sol и Claude Fable 5) по-прежнему отрываются от open-weights. Но на простых вещах Qwen 3.7 Plus и GLM-5.2 делают работу за копейки. Grok 4.5 — реальная альтернатива Opus во многих сценариях. А Muse Spark 1.1 — приятный дебют, хоть пока и сыроват.

Читать оригинал →