← На главную

Meta выпустила Muse Glimmer: открытая 30B модель для локальных агентов

10.08.2026 10:10 · hackernews

Meta Superintelligence Labs представила Muse Glimmer — новую открытую модель с весами под лицензией Apache 2.0. Это 30-миллиардная модель, заточенная под постоянные локальные агентные сценарии. Она достаточно компактная, чтобы работать на Mac или PC с одной потребительской GPU. Подходят локальные агенты, вызов функций, локальный код, оценка LLM-as-a-judge.

Muse Glimmer тренировали в три этапа. На pre-training использовали выходы модели Muse Spark и logit distillation. На mid-training добавили длиннее контекст и больше агентных данных с подробными рассуждениями. На post-training смешали supervised fine-tuning с distillation и reinforcement learning в областях общих рассуждений, кода и агентных задач. Модель оценивали по стандартам Meta's Advanced AI Scaling Framework.

По бенчмаркам Muse Glimmer сильна в своём классе. Это DeepSearch QA, MCP-Atlas, τ-Bench и SWE-Bench — проверяют выполнение длинных задач, отладку кода и многоходовые запросы. Модель умеет вызывать инструменты с точными схемами, рассуждать на длинных горизонтах, восстанавливаться после сбоев tool call, принимать текст и картинки через отдельный perception encoder. Работает с OpenClaw и другими оркестраторами, поддерживает разные уровни рассуждений и обучена на данных более чем 100 языков. Сравнивали с Gemma4-31B и Qwen3.6-27B.

Отдельно занялись скоростью на локальном железе. В полной точности 30B модель заняла бы больше 55 GB. Квантизация примерно до 4-bit сжимает языковую модель до 20 GB — этого хватает и на KV cache, и на perception encoder, и на drafter в пределах 24 или 32 GB. Качество на агентных задачах почти не падает.

Для генерации используется speculative decoding с лёгкой моделью-черновиком на базе DFlash. Она предлагает целые блоки токенов, основная модель проверяет их параллельно. Выходной текст не меняется, но скорость заметно выше, чем при генерации по одному токену. Скорость замеряли для K-Quant-17GB с квантизованным DFlash на MacBook M4-Max, M5-Max и RTX-5090 — хватает для живого разговора и real-time агента.

Веса уже на Hugging Face. В ближайшие дни появятся оптимизированные интеграции с llama.cpp, MLX и ExecuTorch. Локально можно запускать через Ollama, LM Studio, Unsloth; в проде — vLLM и SGLang; быстро попробовать — Together AI, Fireworks AI, OpenRouter. Для дообучения доступен PyTorch TorchTitan. Meta работает над оптимизацией с AMD, Arm, Dell, Intel и NVIDIA и выпустила документацию для разработчиков, включая настройку кастомных scaffolds.

Читать оригинал →