← На главную

CursorBench 3.1: Fable 5 Max лидирует, Composer 2.5 — баланс цены и качества

02.07.2026 05:19 · hackernews

Разработчики выпустили новый бенчмарк CursorBench 3.1. Он проверяет, как ИИ-агенты справляются с многозадачными правками в реальных проектах — задачи со множеством файлов, нечёткие описания, поиск ошибок, планирование и код-ревью. Результаты сведены в таблицу: по каждой модели указан процент решённых задач и средняя стоимость одного решения.

Лидер — Fable 5 Max: 72,9% при $18,02 за задачу. Чуть хуже Fable 5 Extra High (72,0%, $13,74) и Fable 5 High (70,6%, $10,81). Самый дорогой топ — Fable 5 Max тратит 63 842 токена и 76 шагов. Зато Composer 2.5 показывает 63,2% всего за $0,55 и 15 152 токена — идеальный баланс цены и качества. GPT-5.5 Extra High даёт 64,3% за $4,37, а Opus 4.7 Max — 64,8% за $11,02. Sonnet 5 и GLM 5.2 держатся в середине: Sonnet 5 Max — 61,2% за $6,87, GLM 5.2 Max — 54,6% за $3,11. Аутсайдеры — Sonnet 4.6 Low (41,5%) и Kimi 2.5 (31,9%).

В бенчмарк добавили новые типы задач: на понимание кодовой базы, отладку, планирование и ревью. Раньше в версии 3.0 были только правки, рефакторинг и багфиксы. Стоимость считают по официальным ценам моделей на входные, кэшированные и выходные токены. Разработчики предупреждают: разница в несколько процентов может быть статистической погрешностью.

Читать оригинал →