Работать с Opus 5 — как будто шаг назад по сравнению с Opus 4.7, Opus 4.8 и Fable. Дело не в возможностях: Opus 5 реально способнее старых версий и на бенчмарках не уступает Fable. Но работать с ним менее приятно.
Старые модели останавливаются и переспрашивают, если намерения непонятны, не делают допущений без проверки и не перекраивают планы без запроса. Поэтому за ними не нужно так внимательно следить, как за Opus 5.
Похоже, причина в двух процессах, которые сейчас действуют в Anthropic и в других ведущих лабораториях. Первый — желание создать самоулучшающийся ИИ, способный рекурсивно достроить себя до AGI/ASI. Второй — давление, связанное с результатами бенчмарков. Ни для кого не секрет, что многие бенчмарки плохо определены, нечестны, взламываемы или просто сломаны. Но хорошая задача в бенчмарке самодостаточна: её можно решить, ей не нужны подсказки, чтение мыслей автора или внешняя информация. При этом у хорошей задачи не обязан быть один правильный ответ — важно, чтобы все однозначно корректные ответы оценивались одинаково.
Отбор моделей, которые хорошо проходят бенчмарки, и тем более обучение на RLVR-задачах по определению отбирают модели, делающие смелые и обычно правильные допущения в условиях неоднозначности. Такие модели штрафуются за то, чтобы остановиться и попросить уточнить направление. Но именно этого большинство и хочет от кодинг-агента. Как ни старайся, почти невозможно собрать весь контекст — намерения, бизнес-последствия, бюджетные ограничения и прочее — и сделать его доступным агенту. Неоднозначность неизбежна, выбор приходится делать. Поэтому приятно знать, что агент при необходимости остановится и спросит.
Реальная жизнь — не бенчмарк. В ней нет гарантированного правильного ответа на каждый вопрос, и даже набора правильных ответов. А раз на кону реальные последствия, не хочется, чтобы агент просто угадывал.