Автор материала из Quesma решил разобраться в экономике AI-агентов — что такое agentic coding на самом деле и как не разориться. Для этого он собрал собственный пайплайн агентов, который должен был строить базу знаний. Первая же версия сожгла весь лимит Claude Max 5x за 30 минут, не выдав ни одного результата. Запустилось 111 агентов, поставилось 123 утверждения на проверку, а подтвердить успели только 25 — до финального синтеза дело не дошло.
Автор пересобрал систему, используя три уже оплаченные подписки: Claude, Codex и Antigravity. Он расширил плагин claude-mem, чтобы все три инструмента могли обмениваться памятью — что узнал один, доступно остальным. Главная хитрость — маленький Bash-скрипт, который вызывает CLI другого вендора как headless-субагента. Если Codex или Antigravity упираются в лимит, фреймворк автоматически падает на модели Claude — исследование не останавливается.
Распределение ролей выглядит так: поиск делает Claude Sonnet 5, проверку — Claude Opus 4.8, планирование и разрешение споров — Claude Fable 5 (самая дорогая, поэтому включается только по делу), мелкую работу — дешёвый Claude Haiku 4.5, запуск инструментов — Codex на GPT-5.5, а второй opinion даёт Antigravity на Gemini 3.1 Pro, у которой свои слепые зоны. Критически важно закреплять модель за каждой ролью — иначе субагенты наследуют модель родителя, и лимит Fable сгорает снова. С этой схемой автор работал примерно в 10 раз дольше, не доплатив ни копейки.
Вторая проблема — доверие к результатам. Чтобы снизить галлюцинации, внедрили жёсткие правила: кто нашёл утверждение, тот его не проверяет — это делает другой агент. Ничего не попадает в базу без URL и цитаты из первоисточника. Число на странице должно быть, иначе не пишем. Список правил рос по ходу дела — каждую новую ошибку ловили и добавляли.
Deep Research, с которого всё началось, теперь запускается последним, а не первым. В конце дня он берёт уже проверенные находки, углубляет их и заполняет пробелы. Последний запуск использовал 61 агента и занял 22 минуты — против 111 агентов и пустого результата в первый день.
Однако автоматика не всесильна. Однажды правило «неподтверждённые утверждения — значит, никакой записи» отсекло проект Headroom (56k звёзд на GitHub). Агенты всё сделали правильно, верификация подтвердила, что проект легитимен, но заглавные цифры сбережений не прошли контроль. В итоге гигант, которым пользуется половина индустрии, исчез из базы. Нашли ошибку через два дня. Исправили правилом: отклоняй утверждение, а не проект. Ни один агент не скажет тебе, что твоё собственное правило — бага.
Несколько неожиданных находок из собранной базы: один и тот же harness может менять расход токенов на одной модели в 66 раз, а «компактизация» контекста способна удвоить счёт — модель перечитывает выброшенные файлы, контекст снова забивается, и цикл повторяется. Добавление одного инструмента в середине сессии невидимо аннулирует весь кэш и перебилливает всё по полной цене. А токен-калькулятор легко ошибается в 7–11 раз от реального инвойса за счёт ретраев, накладных расходов и eval-вызовов.
Вывод: если жжёшь лимиты на deep research — поменяй порядок. Дешёвые модели пусть ищут, точные проверяют, а дорогой Deep Research — только в конце. Несколько подписок с чёткой ролью у каждой дадут гораздо больше, чем один слепой фронтьер.