Qwen Team представила Qwen3.8-2.4T-A95B — самую мощную открытую модель семейства Qwen. Впервые открытая модель вышла на уровень Qwen-Max. В основе архитектура от Qwen3.5, но модель заметно сильнее в кодинге, профессиональной работе, исследованиях и длительных агентных задачах. Она умеет доводить сложные многошаговые задачи до конца с высокой надёжностью.
Улучшения касаются автономного планирования и обработки обратной связи от окружения — агентные сценарии стали стабильнее. Модель поддерживает популярные инструменты и фреймворки, а глубиной рассуждений можно управлять через reasoning_effort: xhigh (по умолчанию), medium или low. История рассуждений сохраняется благодаря preserve_thinking, который включён по умолчанию.
Технически это Causal Language Model с 2.4 триллиона параметров, из которых активно 95 миллиардов. Скрытая размерность — 8192, 92 слоя, архитектура построена по схеме 23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE)). В Gated DeltaNet используется 128 голов для V и 16 для QK с размерностью 128. В Gated Attention — 64 головы для Q и 4 для KV, размерность 256, плюс Rotary Position Embedding размерностью 64. У MoE 512 экспертов, из которых на каждом шаге активируются 10 и один общий. Эксперты имеют промежуточную размерность 2048. Модель обучена также на Multi-Token Prediction. Контекстное окно — 262144 токена нативно и расширяется до 1010000 токенов.
На бенчмарках Qwen3.8-Max (официальная версия на базе этой модели) показывает сильные результаты: PaperBench — 93.0, AndroidBench — 75.1, PLawBench — 73.2, Terminal Bench 2.1 — 86.6. Практически во всех тестах она обходит предыдущую Qwen3.7-Max и не уступает топовым закрытым моделям.
Запускать модель можно через SGLang, vLLM или TokenSpeed. Она text-only и работает только в thinking-режиме: мультимодальные входы не поддерживаются, отключить рассуждения нельзя. Каждый ответ начинается с ... перед финальным выводом. Рекомендуемые параметры: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0.
Для API через OpenAI SDK нужно передавать extra_body с chat_template_kwargs: enable_thinking=True и preserve_thinking=True (для Qwen Cloud — просто extra_body). Для агентных задач лучше выделять вывод: до 262144 токенов на рассуждения и до 131072 на финальный ответ.