Сегодня вышел Claude Opus 5 — вдумчивая и проактивная модель, которая вплотную подбирается к возможностям Claude Fable 5 при вдвое меньшей цене. На тестах Frontier-Bench и GDPval-AA Opus 5 ставит новый рекорд среди всех моделей, хотя в задачах по кибербезопасности пока уступает Mythos 5. Он стал стандартной моделью в Claude Max и сильнейшей в Claude Pro.
По сравнению с предшественником Opus 4.8 производительность резко выросла при той же стоимости. На Frontier-Bench v0.1 Opus 5 более чем вдвое обходит Opus 4.8 и обходится дешевле за задачу. На CursorBench 3.2 при максимальном усилии он отстаёт от Fable 5 всего на полпроцента, а по соотношению цена/качество на высоких настройках усилия превосходит всех конкурентов. На ARC-AGI 3 модель решает новые задачи в три раза лучше ближайшего соперника. В Zapier AutomationBench процент успешных прохождений в полтора раза выше, чем у любой другой модели при тех же затратах токенов, а на OSWorld 2.0 Opus 5 обходит Fable 5 за треть цены. В органической химии и структурной биологии точность подскочила на 7–10 процентных пунктов.
Opus 5 выделяется тем, что тщательно проверяет собственную работу и не бросает задачу на полпути. В одном из заданий Frontier-Bench ему дали чертёж детали без прямого доступа к просмотру — модель сама написала пайплайн компьютерного зрения, вытащила геометрию из пикселей и построила 3D-модель в FreeCAD. С реальным багом в популярном опенсорсном пакетном менеджере Opus 5 нашёл первопричину и поправил крайний случай, пропущенный сообществом. Инженер трейдинговой фирмы с его помощью за одну сессию построил ленту рыночных данных для новой биржи, а модель вдобавок соорудила тестовый harness для проверки парсинга.
Разработчики из Devin, Cursor, Box, JetBrains и Lovable почти единодушно отмечают скачок в суждениях и стабильности. Opus 5 не спешит публиковать PR, проверяет ветки, думает о тестах, а в спорных ситуациях аргументированно возражает и предлагает компромисс, сохраняя полезную часть идеи и исправляя уязвимость.
По внутреннему аудиту модель показала наилучшее соблюдение конституции Claude среди всех последних версий, самый низкий уровень обманчивого поведения и устойчивость к взлому. В задачах двойного назначения Opus 5 не сдвигает границу риска: находит уязвимости почти на уровне Mythos 5, но в разработке эксплойтов далеко позади. Для легальной киберработы действует программа Cyber Verification Program с ослабленными ограничениями; в Claude.ai, Claude Code и Claude Cowork подозрительные запросы по умолчанию перенаправляются на Opus 4.8.
Цена — $5 за миллион входных токенов и $25 за миллион выходных, как у Opus 4.8. Доступен быстрый режим (Fast mode) примерно в 2.5 раза шустрее за двойную цену. В бете — смена инструментов посреди диалога на Claude Platform без сброса кэша и автоматические fallbacks на API при срабатывании защитных классификаторов.