← На главную

Для AI-кодинг агентов простой GPU дороже API OpenAI и Anthropic

29.07.2026 14:38 · hackernews

Команда aistack проверила, когда выгоднее уйти с API Anthropic или OpenAI и поднять собственный инференс-стек для AI-кодинг агентов. В 2026‑м счета за токены дико разлетелись: средний сотрудник тратит $140 в год, но на 90‑м процентиле уже $7300, а на 99‑м — около $90 000. Многие компании присматриваются к своим GPU, потому что 70% выручки модельных провайдеров приходит именно из кодинга.

Чтобы дать ориентиры, команда прогнала 64 задачи из SWEBench Pro на нескольких связках. Брали модели Qwen3.6‑35B‑A3B‑FP8, DeepSeek‑V4‑Flash и GLM‑5.2, железо — от одного DGX Spark до 8×B200, а в обновлении от 29 июля добавили Kimi K3 на 8×B300. Нагрузку имитировали параллельными сессиями, замеряя время задачи и поток токенов.

DGX Spark с Qwen3.6 еле тянет одного пользователя и работает почти втрое медленнее эталонного Claude Code с Opus 4.8. Одиночный H200 с той же моделью легко обслуживает 32 одновременные сессии, а при 48 становится вдвое медленнее. 4×H200 с DeepSeek‑V4‑Flash держат те же 32 пользователя с более высоким качеством, но после 48 обе линии резко падают из‑за нюансов vLLM. Серьёзная стойка 8×B200 с GLM‑5.2 (SGLang) выдерживает лишь 8 сессий, дальше время задач утраивается против Opus 4.8. Kimi K3 на 8×B300 при 16 сессиях выдала aggregate‑пропускную способность 122 ток/с, медианное время 38 минут и разрешила 86.4% задач — сильно выше 62.5% у GLM‑5.2 и Opus 4.8, но выборка могла попасть в обучающие данные.

По деньгам картина пёстрая. Покупка 4×H200 окупается только при 89% круглосуточной загрузки, а 8×B200 — уже при 15%. Аренда GPU для Qwen3.6 оказалась в 35 раз дешевле API, тогда как для DeepSeek‑V4‑Flash собственное железо, наоборот, дороже официального API DeepSeek из‑за агрессивного кэширования и низких токен‑цен. Задачи на арендованном B200 обходятся в $1.11 за штуку — дешевле обоих API. Итог простой: число разработчиков на одной коробке варьируется от нуля до 64, и само по себе бегство от токен‑счетов смысла не имеет — простаивающее железо бьёт по бюджету больнее, чем счета за API. Решают контроль, приватность и реальная загрузка в пиках.

Читать оригинал →