← На главную

Вышла Qwen 3.8 27B с поддержкой зрения — 17 ГБ и работает на ноутбуке

16.08.2026 23:45 · hackernews

Вышла Qwen 3.8 27B — Apache 2 модель от Alibaba с 27 млрд параметров и поддержкой зрения. Предшественница Qwen 3.6 27B уже была хороша, а новинка по заявленным бенчмаркам обходит и её, и закрытую Qwen 3.7-Plus. В квантованном Q4_K_M билде модель занимает всего 17 ГБ и запускается на обычном ноутбуке. Автор гонял её на M5 Max MacBook Pro и NVIDIA DGX Spark через LM Studio, а также через llama-server.

Главная претензия — дефолтный reasoning_effort: xhigh. Модель по умолчанию думает слишком много. Со стандартным контекстом LM Studio на 8192 токенов она упиралась в лимит уже на простых задачах, так что пришлось поднять до максимума в 262 144. На генерацию SVG с пеликаном на велосипеде ушла 21 минута: 22 276 токенов размышлений ради картинки. Без reasoning тот же промт отработал за 137 секунд. А на просьбу «нарисуй SVG круга» модель выдала анимированный круг с кольцами и градиентами — красиво, но совсем не то, что просили. Вывод: дефолт лучше игнорировать и ставить low или вообще отключать размышления.

Зато модель отлично рисует bounding boxes. По фото пеликанов она вернула JSON с точными координатами в шкале 0-1000, а затем сама собрала HTML-инструмент для визуализации таких разметок. Правда, переусердствовала: добавила демо-сцену с нарисованными пеликанами. Без reasoning тот же инструмент собрался с ошибкой — координаты боксов поехали. Так что умеренные размышления всё-таки полезны.

Qwen справляется и с кодинг-агентами. Вместе с Pi она разобралась в устройстве авторизации в проекте datasette, а потом написала Python-скрипт для конвертации JSONL в Markdown — и сразу его протестировала.

Скорость — главный тормоз. 15–30 токенов в секунду в LM Studio против 74 у OpenAI 5.6 Sol и 184 у 5.6 Luna. Но есть оптимизация Multi-Token Prediction: дешёвый механизм угадывает несколько токенов вперёд, а основная модель быстро проверяет догадки. По наводке создателя llama.cpp Георгия Герганова автор запустил модель с --spec-type draft-mtp на DGX Spark и получил прирост около 72%.

Самое важное: модель на 17 ГБ умеет длинный контекст, вызов инструментов, зрение и генерацию кода. Не нужен датацентр за полмиллиона долларов — хватает хорошего ноутбука.

Читать оригинал →