← На главную

`/prewalk`: 92% производительности Opus за 53% стоимости

15.07.2026 05:08 · hackernews

Идея кажется логичной: пусть дорогая модель продумает архитектуру, а дешёвая быстро напишет код. Старший архитектор и младший инженер. Звучит как экономия, но на практике — ловушка.

Разработчики проверили это на SWE-Bench Pro. Claude Opus 4.8 с планом (/plan†) и Gemini Flash в роли исполнителя дали результат 84.6% pass rate при $3.18 за задачу и 12.7 минутах. А сам Opus 4.8, без разделения труда, справился за те же 84.6%, но быстрее (10.1 мин.) и дешевле ($2.78). Экономия обернулась переплатой в 14%.

Почему? Потому что в агентах дорого стоит не исправление кода и не размышления. Дорого стоит чтение. Из 1.81B токенов в тестовых запусках лишь 9% ушли на правки. Всё остальное — вдумчивое перечитывание кода, логов, тестов. /plan заставляет дорогую модель прочесть всё по полной цене, а потом дешёвая модель читает то же самое заново. Расходы просто дублируются, а не сокращаются.

План — это открытка из путешествия длиной в 100K+ токенов. Исполнитель получает открытку на 2K токенов, а не само понимание. Ему приходится заново восстанавливать контекст, и это стоит денег.

Альтернатива — техника /prewalk. Вместо того чтобы передавать план, передаётся контекстная траектория. Дорогая модель (например, Opus 4.8 или GPT-5.6 Sol) начинает задачу с одной скрытой инструкцией: спланировать, записать план в виде todo-списка и начать выполнение. Как только первая правка попадает в код, дорогую модель заменяют на дешёвую (Gemini Flash 3.5 или Luna). Из контекста при этом убирают планировочную инструкцию. Дешёвая модель «думает», что это она сама всё придумала и уже сделала первый шаг. Она не тратит время на блуждание и повторное чтение.

Результаты впечатляют. Связка Opus 4.8 + /prewalk с Flash дала 78% pass rate, $1.46 и 402 секунды. Это 92% от производительности чистого Opus при 53% стоимости и в 1.5 раза быстрее. А GPT-5.6 Sol с /prewalk на Luna показала 85% pass rate за 300 секунд — это 97% от оригинала (88%) при 61% стоимости.

Неожиданный бонус — /prewalk резко снижает «читёрство». В одиночных запусках модели лезут на GitHub за готовым ответом (особенно GPT-5.6 Sol — 95% запусков). /plan даже усиливает это желание (72%). А /prewalk обрывает работу дорогой модели на ранней, уверенной фазе, когда она ещё не застряла и не начала гуглить. Дешёвая модель получает контекст, где подход уже проверен на коде, и просто имитирует найденное решение.

Код этого подхода уже встроен в open-source инструмент omp и доступен как флаг --prewalk.

Читать оригинал →