← На главную

Liquid AI выпустила LFM2.5-2.6B: 220 токенов/с и меньше 2,5 ГБ

04.08.2026 18:47 · hackernews

Liquid AI выпустила LFM2.5-2.6B — компактную текстовую модель для запуска прямо на устройствах. Она входит в семейство LFM2.5, построена на архитектуре LFM2 и поддерживает контекст 128K. Модель прошла агентный пост-трейнинг: по заявлению компании, она конкурирует с решениями в четыре раза больше по tool use, следованию инструкциям и многошаговым агентным задачам. Обучение шло внутри популярных агентных сред, чтобы улучшить совместимость с ними.

На Apple M5 Max модель выдаёт 220 токенов в секунду, на AMD Ryzen CPU — 113 токенов в секунду, при этом занимает меньше 2,5 ГБ памяти. На GPU это самый быстрый вариант в своём классе: почти 15K выходных токенов в секунду на высокой конкурентности, или около 1,3 млрд токенов в день на одном H100.

У LFM2.5-2.6B 2,69 млрд параметров, 30 слоёв (22 double-gated short convolution blocks + 8 GQA), словарь на 128K токенов и контекст 131072 токена. Она обучена на 34 триллионах токенов и поддерживает 16 языков, включая русский. Рекомендуемые параметры генерации: temperature 0.1, top_k 50, repetition_penalty 1.1.

Доступны четыре формата: нативный LFM2.5-2.6B для Transformers, vLLM и SGLang; GGUF для llama.cpp; ONNX для кроссплатформенного развёртывания; MLX для Apple Silicon. Чат-шаблон — в стиле ChatML. Модель всегда думает перед ответом и добавляет тег <think>. Tool use работает так: функции описываются в system prompt как JSON, модель выдаёт Pythonic-вызов между токенами <|tool_call_start|> и <|tool_call_end|>, затем выполняется вызов и возвращается результат, после чего модель даёт финальный ответ. Вывод можно переключить на JSON.

Пост-обучение состояло из четырёх этапов: два раунда SFT, специализация учителей по доменам, многодоменная on-policy дистилляция и агентное reinforcement learning. Именно RL тренирует модель внутри реальных агентных harnesses, знакомя её с их инструментами и системными промптами.

LFM2.5 поддерживают Transformers, vLLM, llama.cpp, MLX, LM Studio и SGLang. Разработчикам советуют дообучать модель под свои задачи: в статье есть рецепты для Unsloth (CPT, SFT) и TRL (SFT, DPO, GRPO).

В бенчмарках LFM2.5-2.6B часто обходит более крупных соперников: gemma-4-E2B-it, gemma-4-E4B-it, Qwen3.5-4B, Qwen3.5-9B. Особенно сильна в агентных тестах: ToolSandbox — 77.83, Multi-IF — 80.07, IFStruct — 85.49, BFCLv4 — 56.88, BrowseComp+ — 26.89. Показатель Non-hallu в AA-Omni-Public — 59.04, это лучший результат среди сравниваемых. AIME25 — 51.87, LiveCodeBenchv6 — 59.41. Модель рекомендуют для агентных нагрузок, tool use, извлечения данных, RAG и длинных контекстов, но не для агентного кодинга и задач, требовательных к знаниям.

Читать оригинал →