Автор статьи, разработчик security-критичного ПО из okTurtles, год исследовал AI-агентов. Он выяснил: если вам нужен качественный софт, а не просто «работает», привычные подходы не годятся.
Главная проблема — «Vibe-кодинг», когда агенты пачками пишут код, а разработчик играет в видеоигры. Даже Fable 5 (лучшая модель на тот момент) выдаёт код, который работает, но ужасно неэффективен и крив. Особенно в нишевых областях, где мало обучающих данных. Модели не умеют думать за пределами своего датасета — в отличие от заявлений CEO.
Решение — метод «короткого поводка» (Short Leash). Он требует, чтобы вы были профессиональным разработчиком, но позволяет обогнать Fable 5 даже на слабой модели. Суть: вы планируете задачу, разбиваете на шаги. Никакого режима «YOLO». Никакой работы «пока ты занят». Вы используете агента, который показывает diff изменений перед их применением. Затем вы сидите, как безумец из 20-го века, и анализируете каждое предложенное изменение. Вы отклоняете правки, если видите что-то не то. Вы вмешиваетесь каждый раз, когда агент пытается «слететь с катушек». Коммиты делаются после каждой подзадачи — чтобы сохранить сделанное, если Opus вдруг грохнет готовый код.
Ревью тоже гибридное. PR должен проверять и человек, и AI. AI — это быстрый линтер, ловящий типовые ошибки. Человек смотрит архитектуру и направление. Для ревью нужно давать модели полный контекст (issue, описание, код). В описании PR — обязательный блок AI Disclosure с указанием, какие модели использовались. Это честно перед мейнтейнером и даёт ему шанс предложить модель лучше.
Самый важный пункт: PR, созданный с AI, обязан проверить автор. Человек должен прочитать свой же PR построчно, как чужой, и подтвердить, что понимает изменения. Только после этого — звать мейнтейнера. Так вы строите своё понимание кодовой базы. Именно так автор работает в okTurtles.