← На главную

Cactus: on-device зонд — Gemma 4 отдаёт часть запросов Flash-Lite

22.07.2026 17:56 · hackernews

Компания Cactus выпустила новую логику для маленьких on-device моделей: она дообучает их так, чтобы те умели оценивать собственную уверенность в ответе. Внутри чекпоинта сидит встроенный «зонд» — он присваивает каждому ответу оценку от 0 до 1 и возвращает её как часть структурированных данных. Если уверенность высокая, модель отвечает сама. Если низкая (например, ниже 0.85) — запрос можно перебросить на большую модель где-то в облаке. Никаких парсингов из текста ответа, только чистые данные.

Первым развёртыванием стала Gemma 4 E2B Hybrid — самая маленькая модель из линейки Gemma, которая на большинстве бенчмарков догоняет Gemini 3.1 Flash-Lite. Делает она это за счёт того, что сама обрабатывает 65–85% запросов, а остальные 15–35% перекидывает на Flash-Lite. Результаты зависят от битности квантизации: например, на ChartQA при FP16 нужно перекидывать всего 15–20% запросов, на 4-бит — 25–30%, на 3-бит — уже 40–50%. На MMLU-Pro при 3-бит рутинг достигает примерно 90%.

Разработчики предлагают сборки для разных движков: Cactus Compute, MLX, Transformers и llama.cpp. Для последнего зонд вшивается прямо в патч к движку — надо собрать сервер один раз, и дальше ответы будут приходить с полем confidence на верхнем уровне.

Сильнее всего впечатляют тесты на AUROC — метрику того, насколько хорошо модель отделяет правильные ответы от неправильных. У Cactus Hybrid средний AUROC по всем задачам — 0.814. Для сравнения, у Token Entropy — 0.549. И самое интересное: зонд обучали вообще без аудиоданных, но на четырёх аудиобенчмарках он выбивает 0.79–0.88 AUROC. Это значит, что модель выхватывает сигнал правильности из скрытых состояний, а не просто запоминает паттерны из трейна. Никакой случайности.

Всё под MIT-лицензией, а на саму Gemma распространяются стандартные условия Google.

Читать оригинал →