Pi — это кодинг-харнесс, который сознательно выбирает минимализм. Из коробки он даёт всего 4 инструмента, а его системный промпт и описания инструментов занимают меньше 1000 токенов. Идея простая: большинство задач решается базовыми средствами, а если нужно больше — достраиваешь сам.
Судя по всему, такой подход не просто чище, а ещё дешевле и производительнее. Databricks опубликовали собственное исследование на многомиллионной кодовой базе — они сравнивали кодинг-агентов на реальных задачах и не полагались на внешние бенчмарки. Результат: «простой харнесс вроде Pi показал себя лучше всего». В связке с Opus 4.8 на настройке xhigh Pi дал самый высокий процент успешных задач и стоил заметно дешевле, чем Claude Code и Codex.
Исследование Databricks отделяет модель от харнесса. Когда одну и ту же модель с одним и тем же thinking effort прогнали через разные харнессы, стоимость задачи отличалась более чем в два раза, а качество оставалось тем же. У Pi это назвали «контекстной дисциплиной»: Pi отправлял примерно в три раза меньше контекста за ход, держал более плотный рабочий набор и завершал задачи за меньшее количество запусков. То есть важно смотреть на полную экономику инженерии, а не только на цену за токен. Это работает и на уровне моделей: сложные воркфлоу на Haiku 4.5 иногда выходили дороже, чем на Sonnet 4.6, из-за лишних ходов.
Shopify построили на Pi собственную extension pi-autoresearch. Автор из Shopify Engineering Дэвид Кортес просто попросил Pi создать расширение для Autoresearch — и Pi прочитал свою же документацию по расширениям и собрал новый воркфлоу. Autoresearch — это автономный цикл оптимизации: он запускает эксперименты и отбрасывает изменения, которые вызывают регрессии. В Shopify такие расширения стали серьёзным внутренним инструментом: unit-тесты стали работать в 300 раз быстрее, монтирование React-компонентов — на 20% быстрее, сократилось время сборки, улучшился даже pnpm.
Важно, что Pi ничего этого из коробки не предлагает. Вместо попыток заранее угадать твой воркфлоу он даёт расширяемость. Год назад можно было спорить, что «родные» харнессы имеют структурное преимущество, потому что модели обучались под них. Теперь этот аргумент слабеет: frontier-модели отлично работают в терминальном окружении. Anthropic недавно сократил системный промпт Claude Code на 80% — явный сигнал. Главным становится не «нативность», а аккуратное обращение с контекстом и чистые примитивы.
Pi особенно хорош для локальных моделей: у них меньше контекстные окна, а префилл может быть долгим. Контекстная дисциплина здесь критична: не меняем контекст без явной просьбы и не перепрефиллим по минуте. Так что минимализм побеждает — он дешевле и работает лучше.