← На главную

Claude Fable 5 обошёл GPT-5.6 Sol в KIRO с рекордом 31934

18.07.2026 11:00 · hackernews

Claude Fable 5 и GPT-5.6 Sol получили одну и ту же неопубликованную NP-трудную задачу — проектирование оптоволоконной сети KIRO. Её автор решал на C++ несколько лет назад и знает человеческий baseline. Задача: соединить распределительные пункты и терминалы в Париже, Гренобле и Ницце так, чтобы минимизировать общую длину кабеля. Каждый узел должен быть задействован ровно один раз, а разворот кабельного сегмента меняет его стоимость. Пространство поиска колоссальное — даже если просто раздать 532 терминала по 11 хабам, вариантов 11⁵³². Упрощённая оценка для Парижа уже даёт ~10¹²²³ возможных решений.

Тестировали шесть моделей — Fable 5, Opus 4.8, Sonnet 5 от Anthropic и GPT-5.6 Sol, Terra, Luna от OpenAI. Каждая работала 30 минут в обычном режиме (plain) и с активированным native /goal. Для флагманской пары (Fable 5 и Sol) сделали по три повторения. Результаты: Fable 5 показал себя настоящим зверем. Его лучший чистый результат — 31 934 (с /goal), а разброс plain-запусков — всего 319 пунктов. Sol заметно уступал: средний plain — 34 261, разброс почти 2 000. /goal в четырёх из шести запусков улучшал результат, но иногда и сильно портил — в одном из забегов Fable проиграл 2 732 пункта, а Sol — 5 790. Из-за этих выбросов среднее по /goal (33 145 у Fable и 35 129 у Sol) оказалось выше, чем по plain (32 386 и 34 261). То есть /goal чаще помогает, но усредняет в минус.

Почему так? /goal в Claude Code — это отдельный оценщик (Haiku), который после каждого шага модели решает, достигнута ли цель, глядя только на транскрипт. В Codex же сама рабочая модель получает инструменты create_goal, get_goal, update_goal и сама отчитывается о завершении. Для обычных задач это полезно — ещё одна итерация может доделать код. Но для оптимизации время работает как усилитель: если модель выбрала хороший решатель, оно помогает, если плохой — усугубляет ошибку.

Автор подчёркивает, что это не общий тест, а одна специфическая задача. Тем не менее главный вывод: качество самого цикла (что именно делает модель под управлением /goal) важнее наличия этого фича. Все данные и скрипты выложены в CLIArena.

Читать оригинал →