← На главную

Дилан Кастильо не нашёл доказательств pelicanmaxxing на 1008 SVG

22.07.2026 17:17 · hackernews

Саймон Уиллисон несколько лет тестирует новые LLM одним и тем же промптом: «Сгенерируй SVG пеликана на велосипеде». Это неформальный бенчмарк, который стал очень известным. Результаты Уиллисона часто собирают больше всего плюсов на Hacker News в обсуждениях новых моделей. Само собой, возникли подозрения: не тренируют ли AI-лаборатории модели специально на этом тесте (так называемый pelicanmaxxing), чтобы получить выгодный результат для маркетинга.

Дилан Кастильо решил проверить. Он поставил эксперимент: сгенерировал 1008 SVG-картинок через 7 топовых моделей, оценил их LLM-судьёй и проанализировал данные. Модели перечислены через OpenRouter: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 и DeepSeek V4 Pro. Кастильо собрал сетку из 8 животных и 6 видов транспорта (48 промптов). На каждый он сделал по 3 попытки. Картинки прошли три этапа: рендеринг в PNG, оценка судьёй GPT-5.6 Luna (по шкале 1-5 за животное, транспорт и связность сюжета), а также извлечение деталей через Gemini 3.1 Flash-Lite.

Гипотеза была простой: если лаборатории тренировались на бенчмарке, то pelican на bicycle должен выбиваться вперёд. Кастильо провёл пять проверок. Первая: визуально картинки с пеликанами на велосипедах не выглядят заметно лучше остальных у той же модели. Вторая: средняя оценка именно пеликана среди всех моделей — лишь шестая из восьми. Его рисуют хуже, чем кота, кита или енота. Третья: велосипеды заняли предпоследнее место — их сложно рисовать, они требуют двух колёс, рамы, руля, педалей. Четвёртая и главная: Кастильо использовал регрессию с поправкой на сложность. Он искал признаки того, что каждая лаборатория специально улучшает пеликанов, велосипеды или их комбинацию. Ни один эффект не оказался статистически значимым. Единственное исключение — Gemini 3.5 Flash показала небольшое улучшение по велосипедам (p=0.022), но при поправке на множество тестов этот результат исчезает. Самая близкая к сигналу — GLM-5.2 с приростом +0.35 балла на комбинации pelican-bicycle, но это тоже в пределах случайности (p=0.12).

Пятая проверка: не выглядят ли сцены с пеликаном на велосипеде заученными? Оказалось, все 21 «пеликан-велосипед» смотрят вправо. Но это не аномалия: 60% всех картинок в эксперименте смотрят вправо, а у трёх других комбинаций животных и транспорта тоже почти 100% совпадение. Дополнительные детали (солнце, шарф) тоже не выбиваются из статистики — у всех комбинаций есть часто повторяющиеся элементы.

Выводы Кастильо: доказательств pelicanmaxxing нет. Лаборатории не тренируются специально на этом запросе. Более вероятное объяснение — общая оптимизация генерации SVG (SVGmaxxing), которую, например, Google/DeepMind делает открыто. Но эксперимент с этим не справился. У метода есть ограничения: один единственный LLM-судья (к тому же из того же семейства, что и одна из тестируемых моделей), бюджет всего $80 на API и только 3 сэмпла на ячейку. Полные данные и код — в репозитории на GitHub.

Читать оригинал →