← На главную

GLM5.2: open-weights модель уровня Opus, но без vision в 5 раз дешевле

06.07.2026 20:14 · hackernews

Настоящий DeepSeek-момент наступил. Рынок испугался R1 из-за низкой цены обучения, но просчитался: обучение — это фиксированные затраты, которые окупаются один раз. Самые большие деньги делаются на инференсе. Anthropic и OpenAI заряжают за inference примерно $25 за миллион токенов, а по подсчётам автора, их реальная маржа может доходить до 90% — модель обучили, а потом продают доступ к ней с гигантской наценкой. Весь бизнес фронтальных лабораторий построен на том, чтобы потратить кучу денег на тренировку, а потом компенсировать это огромными объёмами дорогого инференса.

Автор тестировал GLM5.2 от Z.ai и считает, что это первая open-weights модель, которая реально дотягивает до уровня Opus и GPT-5.5. Разницу в повседневном использовании он почти не замечает. Но есть проблемы. Во-первых, модель медленная — она слишком много «думает», что делает её неудобной для интерактивной работы и увеличивает число токенов. Во-вторых, нет поддержки vision — после того как Opus 4.7 научился нормально работать с картинками, отсутствие этой функции стало серьёзным минусом. В-третьих, ужасный встроенный веб-поиск — Z.ai предлагает костыль через MCP, но он медленный, а Fireworks вообще ничего не даёт. Автор обходится CLI-утилитой ddgr, но считает это огромной дырой для агентов.

Главный страх для лабораторий — лёгкость миграции. Z.ai и Fireworks предоставляют эндпоинты, совместимые с OpenAI и Anthropic. Чтобы переключиться, достаточно поменять base URL в Claude Code или Codex. Никакой вендорской блокировки, как у Microsoft. Переключиться проще, чем следить за всеми изменениями политик Anthropic. Данные и безопасность — вопрос, но с open weights можно просто развернуть модель у себя на своих серверах.

По цене: GLM5.2 стоит около $4.4 за миллион токенов — это меньше 20% от цены Opus и примерно 15% от GPT-5.5. Да, модель жрёт больше токенов, но для большинства задач экономия будет больше 50%. Z.ai предлагает подписку «coding plan» с высокими лимитами, хотя условия по данным подходят не всем. Автор ждёт снижения цен по мере оптимизации стека — например, на AMD железо инференс выходит в 2.75 раза дешевле, чем на Nvidia Blackwell.

Это первая часть. Во второй — что будет, когда маржа на инференс рухнет, и кому это выгодно. Автор напоминает фразу Безоса: «ваша маржа — моя возможность».

Раскрытие: Fireworks дали автору бесплатный кредит для экспериментов.

Читать оригинал →