Решать, когда доверять агенту, нужно не по тому, насколько прокачалась модель, а исключительно по задаче. Два простых вопроса определяют, сколько автономии можно дать: легко ли проверить результат и легко ли его откатить. Если ответы свести в матрицу, получается четыре уровня.
Уровень 0 — агент как ассистент. Проверка трудная, цена ошибки высокая, откат болезненный. Так работают с чувствительным кодом, где нельзя просто сделать grep. Когда Дилан в PostHog переписывал движок feature flags для поддержки произвольных свойств, миграция затрагивала все флаги, API и функции скоринга — проверить детерминированно почти нереально. Он разбил задачу на части: опасное ядро делал руками, а тиражирование логики по SDK на JavaScript, PHP, Ruby и Flutter поручил агентам.
Уровень 1 — человек в цикле. Проверить сложно, но откатить дёшево — код остаётся в драфте, пока его не одобрят. Подходит для задач, где нужен человеческий вкус. Рефакторинг читаемости, который сделал Томас, агент сам не оценит: добавить комментарии, сгруппировать действия, заменить строки на enum. Здесь спасают приёмы вроде LLM-as-judge (модель оценивает работу), чёткие измеримые цели и кастомные навыки, чтобы агент придерживался стандартов команды.
Уровень 2 — делегирование агенту. Проверить легко, но откат дорогой — стандартный потолок для большинства dev-задач. Когда Робби переписал SQL-парсер PostHog на Rust, он почти не читал код, потому что машинный оракул проверял корректность. Но парсер затрагивает все запросы, поэтому мержилось всё через несколько страховочных слоёв: shadow mode в проде, а потом поэтапный переход. Главный совет — не тормозить процесс собой, а закодировать guardrails прямо в пайплайн: dry-run по умолчанию, ограниченные креды, фича-флаги.
Уровень 3 — полностью автономный режим. Проверить легко, откатить легко. Пока здесь живут лишь мелкие задачи вроде обновления зависимостей или линтинга, но категория резко растёт. PostHog делает на это большую ставку: запустили Scouts — агентов, которые по расписанию ищут сигналы в продуктовых данных и сразу готовят PR с предложениями. Чтобы таких задач стало больше, команда обучает собственные domain-специфичные модели, строит экспертный контекстный слой для PostHog Wizard и учит агентов отличать полезный сигнал от шума.