← На главную

Qwen Team открыла Qwen3.8-27B-FP8 с контекстом до 1M токенов

14.08.2026 15:00 · hackernews

Qwen Team выложила в открытый доступ Qwen3.8-27B-FP8 — это FP8-квантованные веса модели Qwen3.8-27B в формате Hugging Face Transformers. Квантование мелкозернистое, block size 128, так что по метрикам модель почти не отличается от оригинала. Веса совместимы с vLLM, SGLang, TokenSpeed и другими фреймворками. Кто не хочет возиться с инфраструктурой, может дождаться официального хостинга на Qwen Cloud: там Qwen3.8-27B получит контекст 1M токенов по умолчанию и встроенные инструменты. Сервис скоро запустится.

Сама Qwen3.8 — новое поколение открытых моделей Qwen. Она построена на архитектуре Qwen3.5 и заметно сильнее в кодинге, профессиональной работе, исследованиях и длинных агентных задачах. Qwen3.8-27B — компактная плотная модель с нативным пониманием изображений и видео, от схем и документов до часовых роликов. У неё гибкое управление мышлением: режим размышлений включён по умолчанию, но его можно отключить для конкретного запроса. Параметр reasoning_effort регулирует глубину анализа: xhigh, medium, low. А preserve_thinking сохраняет цепочки рассуждений из истории сообщений — это особенно полезно для агентов.

В модели 27B параметров, 64 слоя, hidden dimension 5120, нативный контекст 262 144 токена, расширяется до 1 000 000. В архитектуре используются Gated DeltaNet, Gated Attention и MTP (Multi-Token Prediction).

На бенчмарках модель уверенно обходит Qwen3.6-27B и часто Qwen3.7-Plus. Например, SWE-bench Pro — 61.7 против 53.5 у Qwen3.6 и 57.6 у Qwen3.7-Plus, Terminal Bench 2.1 — 73.0, QwenSWEBench — 79.0, LiveCodeBench v6 — 90.3. По визуально-языковым задачам: OSWorld-Verified 84.3, WebArena-Verified 64.8, AndroidWorld 81.9, OmniDocBench 1.5 — 91.1. В таблицах есть и сравнения с Opus4.6 Max и Muse Glimmer-30B.

Для вызова через OpenAI SDK нужно указать модель Qwen/Qwen3.8-27B-FP8. По умолчанию модель думает и оборачивает рассуждения в .... Чтобы получить прямой ответ, передают enable_thinking: False. Рекомендуемые параметры: в thinking mode temperature=1.0, top_p=0.95, top_k=20; в instruct mode temperature=0.7, top_p=0.80, presence_penalty=1.5. preserve_thinking можно отключить.

Для сверхдлинных текстов советуют использовать RoPE scaling через YaRN. Например, в config.json меняют rope_parameters с factor 4.0 для миллионного контекста, а для 524 288 токенов лучше factor 2.0. vLLM, SGLang и TokenSpeed поддерживают YaRN через аргументы запуска. Для часовых видео стоит выставить longest_edge в video_preprocessor_config.json на 469 762 048 (это 224k видео-токенов), чтобы поднять частоту кадров.

Читать оригинал →