Команда Qwen представила Qwen3.8 — самое мощное поколение в открытой линейке. Модель построена на архитектуре Qwen3.5 и заметно лучше справляется с кодингом, профессиональными задачами и длинными агентными сценариями. Флагманская версия Qwen3.8-27B — это компактная dense-модель с нативным vision-language пониманием: она умеет работать с картинками и видео, гибко переключать режим мышления и доводить многошаговые задачи до конца.
В Qwen3.8 улучшили агентное выполнение: модель автономно планирует, учитывает обратную связь от окружения и надёжнее завершает задачи. Также расширена совместимость с популярными инструментами и фреймворками. Режим мышления включён по умолчанию, но его можно отключить для каждого запроса, глубину рассуждений настраивать через reasoning_effort, а контекст рассуждений сохранять через preserve_thinking. Для видео и изображений доступно нативное понимание — от диаграмм и документов до часовых видео.
Технические детали: 27 миллиардов параметров, 64 слоя, скрытая размерность 5120, контекст на 262 144 токенов из коробки и расширение до 1 000 000. В модели используется MTP (Multi-Token Prediction) для быстрого инференса. Отдельно в статье упомянут GGUF-файл с квантованием Unsloth Dynamic V3.0 (preview): он позволяет запускать и дообучать Qwen3.8-27B в Unsloth Desktop и использовать модель в агентных инструментах вроде Codex.
Для лучших результатов рекомендуют конкретные параметры сэмплинга. В режиме мышления: temperature=1.0, top_p=0.95, top_k=20. В обычном instruct-режиме: temperature=0.7, top_p=0.80, top_k=20, presence_penalty=1.5. Чтобы избежать повторов, presence_penalty можно поднимать от 0 до 2, но слишком высокое значение иногда вызывает смешение языков. Для агентных задач советуют выделять отдельные лимиты на внутренние рассуждения (до 262 144 токенов) и на итоговый ответ (до 131 072 токенов). Если длина запроса с ответом превышает 262 144 токена, нужно применять RoPE-масштабирование вроде YaRN. Для длинных видео советуют выставить longest_edge в video_preprocessor_config.json на 469 762 048 — это соответствует 224 тысячам видео-токенов и позволяет анализировать часовые ролики с высокой частотой кадров.