← На главную

Hetzner тестирует спрос бесплатным доступом к Qwen3.6-35B-A3B-FP8

24.07.2026 09:24 · hackernews

Hetzner открыла публичный эксперимент с инференсом языковых моделей — пока без биллинга, SLA и каких-либо гарантий. Это не продакшен-сервис, а живой тест: компания хочет понять, интересен ли такой продукт пользователям, как он масштабируется и какие функции важны. Единственная доступная модель — Qwen/Qwen3.6-35B-A3B-FP8, 35-миллиардный Mixture-of-Experts с тремя активными миллиардами параметров, окном в 262K токенов и весами под FP8. Модель принимает и текст, и картинки.

API совместим с OpenAI — достаточно создать токен в панели экспериментов и направить клиента на https://inference.hetzner.com/api/v1. Всё работает практически без изменений в коде, а для OpenCode даже выложили короткий туториал. Есть недокументированная фишка enable_thinking: если не выключить её явно, модель может израсходовать изрядную часть бюджета токенов на внутренние рассуждения, прежде чем ответить.

23 июля 2026 года автор прогнал несколько быстрых тестов. Медианное время до первого токена на открытом соединении — 153 мс, скорость генерации — 224 выходных токена в секунду. Цифры для единичного клиента очень бодрые, но ничего не говорят о поведении под нагрузкой. Сама модель ожидаемо справляется с форматными инструкциями и одной картинкой, но проваливает элементарную арифметику — маленькая и слегка глуповатая LLM, как иронично заметил тестировщик.

Гораздо интереснее вопрос: зачем Hetzner вообще полезла в инференс. Рынок опен-вейт моделей — чистый commodity: веса у всех одинаковые, софт для сервинга почти идентичный, клиенты легко мигрируют через OpenRouter или LiteLLM. Чтобы зарабатывать на этом, нужно либо закупать и оперировать GPU радикально дешевле других, либо мастерски утилизировать простаивающее железо. Hetzner как раз из тех, кто умеет ставить «голое» железо в свои дата-центры и эксплуатировать его с предельно низкими затратами. Если у компании есть свободные мощности на арендованных серверах или она готовится к серьёзному расширению парка ускорителей, инференс-сервис помогает загрузить простаивающие карты и превратить их в выручку.

Сейчас в публичном каталоге выделенных GPU-серверов у Hetzner только NVIDIA RTX 4000 SFF Ada Generation на 20 ГБ VRAM и NVIDIA RTX PRO 6000 Blackwell Max-Q с 96 ГБ. Для текущего FP8-образа Qwen хватает, но такие большие модели, как GLM-5 (754 миллиарда параметров), требуют плотных многокарточных связок уровня B200/B300. Такого железа в открытой линейке нет. Что стоит за экспериментальным API — неизвестно: внутренняя инфраструктура может отличаться от публичного каталога.

Если эксперимент ограничится парой небольших моделей, серьёзным игроком Hetzner не станет. Но если за этим последуют инвестиции в крупные GPU-кластеры и каталог тяжёлых моделей, комбинация своих дата-центров, европейского размещения и агрессивных цен способна превратить компанию в заметного инфраструктурного вендора на рынке инференса. Пока же API быстрый, бесплатный, и с ним просто интересно повозиться.

Читать оригинал →