← На главную

Lights-off фабрики: RL-агенты гонят slop пока нет ревью и четырёх фаз

23.07.2026 15:18 · hackernews

Декс, CEO HumanLayer, разобрал, почему программные фабрики, которые пытаются полностью исключить человека из процесса, ломаются. Термин «lights-off software factory» придумал Dan Shapiro, а StrongDM построила конвейер, где код не читают люди — только агенты. Идея красивая: модели достаточно хороши, разработчик — узкое горлышко, просто гоните больше фич. Райан Лопополо из OpenAI рассказывал про фабрику Symphony, но практика показала другое.

Кодовые базы сыплются быстрее, чем когда-либо, как заметил Мэтт Покок. Отчёт Faros AI подтверждает: с начала года, когда все массово взяли AI-инструменты, качество ревью упало. Комментарии стали длиннее, кучу PR вливают вообще без проверки, инциденты и баги на разработчика резко выросли. Марио на AI Engineer Europe умолял сбавить темп, потому что компании, которым не нужны простои, получают простои от ошибок агентов. В ответ часто звучит «это проблемы скилла» и советы тратить больше токенов, но Декс убеждён: дело не в навыках, а в том, как обучают модели.

Кодинг-агенты вроде Claude Code выиграли за счёт Reinforcement Learning внутри harness — Anthropic RL’ила модель прямо под набор инструментов, и она отлично научилась вызывать их в цикле. Но у такого обучения фундаментальный изъян: бенчмарки вроде SWE-bench оценивают лишь, прошли ли тесты, и штрафуют только за поломку существующего. Награда — один бит: FAIL_TO_PASS и PASS_TO_PASS. Как модель пришла к решению, неважно. Нет быстрого оракула, способного измерить поддерживаемость или качество дизайна. А плохая архитектура даёт о себе знать недели и месяцы спустя, когда простая правка требует латать одиннадцать мест и тихо ломает соседние файлы. RL не умеет за это наказывать, поэтому агент генерирует slop — код, который постепенно разрушает базу.

Попытки добавить метрики качества идут медленно. SWE-Marathon от Abundant AI, DeepSWE от Datacurve, Frontier Code от Cognition пытаются заложить оценку поддерживаемости, но быстрого вердикта по-прежнему нет. Если бы модель умела надёжно отличать хороший код от плохого, она бы сразу писала хороший, но этому не учат.

Выход — не выключать свет, а вернуть человеческое ревью и усилить его AI-подготовкой. Декс предлагает четыре фазы на входе: Product Requirements — короткий док с пользовательской болью и мокапами; System Architecture — визуализации, диаграммы последовательностей, контракты эндпоинтов; Program Design — то, что часто упускают: сигнатуры методов, call-stack trees, раскладка по файлам, типы. Агент генерит черновик, человек спорит с ним. Последнее — Vertical Slices: вместо горизонтальных планов (сначала миграции, потом сервисы, потом фронтенд) идти вертикально, чтобы на каждом шагу потрогать работающий кусок curl’ом или в браузере. Так ревьюировать по 100-200 строк и переруливать дёшево, а не разгребать тысячу строк в конце.

Читать оригинал →