Инженеры Databricks построили собственный внутренний бенчмарк для оценки кодинговых агентов. Вместо абстрактных тестов они взяли реальные pull request’ы из своей кодовой базы на миллионы строк, где используются Python, Go, TypeScript, Scala, Rust, Java, Bazel и Protobuf. Каждую задачу вручную проверяли, а решение оценивали по прилагающимся тестам — без LLM-судьи, который чаще вознаграждает правдоподобие, а не правильность.
Результаты чётко разделились на три уровня производительности. На самом верху — дорогие, но самые умные модели. В среднем и нижнем сегменте — гораздо дешевле, и для рутинных задач (переключить флаг, обновить конфиг) их более чем достаточно. Раньше инженеры по умолчанию брали самую дорогую модель. Теперь Databricks намерены переводить повседневную работу на класс моделей вроде Haiku и GPT 5.4 Mini.
Открытая модель GLM 5.2 неожиданно попала в топ. По качеству она статистически не уступает Opus 4.8, но задача обходится в $1.28 против $1.94 у Opus. Databricks уже активно пилотируют GLM для ежедневной разработки и готовятся развернуть её массово.
Цена за токен — плохой ориентир. Например, Sonnet 5 в 1.7 раза дешевле за токен, чем Opus 4.8, но в реальных задачах Sonnet тратит на 1.9x больше токенов из-за неэффективного чтения контекста. Итог: Sonnet обходится дороже ($2.09 за задачу против $1.94 у Opus) и при этом набирает лишь 81% успеха против 87%.
Обвязка (harness) влияет на стоимость сильнее, чем сама модель. Когда один и тот же движок запускали через Claude Code/Codex и через Pi, качество не менялось, но разница в цене достигала двукратной. Всё упиралось в объём контекста: Pi отправлял втрое меньше данных на каждый шаг, работал аккуратнее и завершал задачи быстрее.
Датасет собирали из свежих человеческих PR с хорошими тестами, отсекая ботов и автосгенерированные правки. Prompt писали так, чтобы описать проблему, но не подсказывать решение. Отдельно пришлось запечатывать git history — на тестовых прогонах агенты умудрялись просто пройти по коммитам и найти готовый ответ.
В Databricks планируют расширять бенчмарк, прогонять через него каждую новую обвязку и модель, а в Unity AI Gateway и Omnigent уже встраивают маршрутизацию, чтобы автоматически выбирать самый эффективный инструмент под конкретную задачу.