← На главную

GPT-5.6 Sol лидирует в тесте рисования: Claude в 20 раз дороже, Grok — мусор

21.07.2026 21:13 · hackernews

Исследователи из canvas-arena собрали четверку топовых моделей — GPT-5.6 Sol, Claude Fable 5, Grok 4.5 и Gemini 3.6 Flash — и устроили им настоящий тест на рисование цветными карандашами. Никакой магии: у каждой модели был один и тот же набор инструментов (карандаш, ластик, растушевка, кисть, смена цвета/нажима) и чистый холст. Два задания: скопировать «Мону Лизу» и «Звёздную ночь» (с оценкой по SSIM), плюс пять текстовых описаний вроде «табачный кот на подоконнике» или «роза в вазе при свечах». Всего 28 рисунков.

Результаты разошлись кардинально. GPT-5.6 Sol оказался абсолютным лидером: его версии «Звёздной ночи» и розы признаны лучшими в эксперименте. При этом он никогда не вызывал set_color или set_pressure — просто передавал параметры внутри draw. Общая стоимость семи его рисунков — всего $7,74. Claude Fable 5 финишировал вторым по качеству, но с диким разрывом по цене: $160 за семь рисунков — примерно в 20 раз дороже Sol. Он делал в два раза больше шагов, дольше думал, но итоговый результат не дотягивал до лидера. Grok 4.5 в этом тесте провалился. Модель совершила 1349 вызовов инструментов, 65% из которых — бессмысленная смена цвета/кисти, а готовые рисунки были откровенно плохими. Gemini 3.6 Flash набрал наивысшие объективные баллы по SSIM (0,449 для Моны Лизы), но был самым «нервным» — часто перерисовывал и часто скатывался в финале ниже собственного пика.

Общая закономерность: все модели рано достигали плато по качеству и к концу сессии неизменно ухудшали результат по сравнению с лучшим кадром. Больше ревью холста не означало лучший финал — Gemini пересматривал свою работу по 23 раза за рисунок, но всё равно ухудшил итоговую картинку. Grok нагенерировал 34 млн токенов, но дешевизна (98% кэшированных чтений) не спасла убогий результат. Claude Fable 5 съел 14,6 млн токенов, стоил как небольшой космический корабль, но уступил по качеству Sol.

Авторы честно предупреждают: задача субъективная, SSIM не равно красоте, и тест сделан ради интереса. Но вывод жёсткий: GPT-5.6 Sol — однозначный победитель, Claude Fable 5 — слишком дорогой для этого сценария, а Grok 4.5 — «в основном мусор», которому пока нельзя доверять визуальные задачи.

Читать оригинал →