Компания PrismML анонсировала Bonsai 27B — новую мультимодальную флагманскую модель семейства, построенную на базе Qwen3.6 27B. Это первая модель своего класса, которая помещается в телефон.
Обычная 27B-модель в 16-битной точности весит около 54 ГБ, а даже хорошая 4-битная сборка занимает 18 ГБ — слишком много для телефона или ноутбука. Bonsai 27B решает проблему двумя вариантами. Ternary Bonsai 27B использует веса {−1, 0, +1} с FP16-масштабированием и даёт 1.71 эффективных бита на вес. При 5.9 ГБ это качественная версия для обычного ноутбука с полным набором возможностей: рассуждения, вызов инструментов, агентная работа. 1-bit Bonsai 27B использует бинарные веса {−1, +1} с тем же масштабированием — 1.125 бита на вес. При 3.9 ГБ он влезает в память iPhone 17 Pro, впервые выводя модель такого класса на телефон.
Низкобитовое представление работает сквозь всю сеть — эмбеддинги, attention, MLP, LM head — без обходных путей. Обе версии мультимодальны: визуальный энкодер идёт в компактном 4-битном виде для работы со скриншотами, документами и камерой. Контекст — 262K токенов, поддерживается speculative decoding. Всё доступно под лицензией Apache 2.0.
Бенчмарки (15 тестов на знание, логику, математику, код, следование инструкциям и зрение) показывают, что Ternary версия сохраняет 95% точности от полной точности, 1-bit — 90%. Математика и код почти не пострадали, вызов инструментов — в пределах нескольких процентов. При этом самые агрессивные обычные низкобитовые сборки той же базовой модели проигрывают 1-bit Bonsai 27B, занимая в 2.5 раза больше памяти.
По меркам intelligence density (интеллекта на гигабайт) 1-bit Bonsai 27B даёт 0.53 на ГБ — в 10 раз больше полной точности и примерно в 2.7 раза лучше любой альтернативы.
Именно это меняет правила игры. Агентные сценарии требуют сотен вызовов модели — каждый с контекстом, структурным выводом и передачей управления. В облаке каждый шаг уходит в сеть, копятся задержки и стоимость, данные пользователя пересекают границу устройства. Локальное выполнение убирает эти проблемы: модель живёт внутри продукта, цикл из ста шагов стоит ноль, а приватные данные не покидают устройство.
Bonsai 27B достигает до 163 ток/с в 1-bit и 134 ток/с в Ternary на NVIDIA GeForce RTX 5090, на M5 Max — до 87 и 58 ток/с соответственно. Телефон — более жёсткое ограничение: 12 ГБ iPhone отдаёт приложению около 6 ГБ, и модель делит этот бюджет с KV-кэшем. Ни одна обычная сборка 27B-модели не проходила этот барьер. 1-bit Bonsai 27B — первая, кто помещается с запасом.
Модель работает нативно на Apple-устройствах через MLX и на NVIDIA GPU через CUDA. Веса уже доступны под Apache 2.0, PrismML также предлагает бесплатный preview API для разработчиков. Компания основана исследователями из Caltech при поддержке Khosla Ventures, Cerberus, Google и Samsung.