← На главную

NVIDIA выпустила открытую Nemotron-3.5-Lightning с контекстом 1M

11.08.2026 13:26 · hackernews

NVIDIA выпустила открытую модель NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4. Это большая языковая модель с гибридной архитектурой: MoE, Mamba-2 и Attention. Всего параметров 30B, активных — 3B. Контекст — до 1M токенов. Модель запускается на одной DGX Spark (GB10) или одном H100. Поддерживаются NVIDIA Blackwell (DGX Spark/GB10, GB200, GeForce RTX 5090), Hopper (H100, H200) и Ampere через W4A16. Основные языки — английский и языки программирования, плюс испанский, французский, немецкий, итальянский и японский. Лицензия — OpenMDW-1.1, релиз 11 августа 2026, коммерческое использование разрешено.

Вместе с моделью NVIDIA предлагает три метода ускоренной генерации: DSpark, DFlash и MTP. DSpark — полуавторегрессионный drafter, который выдаёт целый блок кандидатных токенов за один forward pass. Его рекомендуют для DGX Spark и дата-центров с низкой конкуренцией. DFlash использует лёгкую block-diffusion модель для генерации блока за один проход. MTP — приём, когда сеть предсказывает несколько будущих токенов, а не один. Рекомендуемые параметры сэмплинга — temperature 1.0, top_p 0.95. Лучше всего модель подходит для долгоживущих автономных агентов, сабагентов и локального инференса на персональном железе.

Обучение шло в несколько этапов. Сначала предобучение на более чем 20 триллионах токенов с NVFP4 recipe на Megatron-LM. Данные предобучения — до сентября 2025, пост-обучения — до мая 2026. Потом continued pre-training для MTP-слоёв, supervised fine-tuning, reinforcement learning с GRPO и пост-тренировочная квантизация через NVIDIA Model Optimizer: W4A16 на routed и shared экспертах, FP8 динамические шкалы на mamba и KV cache. В пост-тренинге использовали синтетику от разных моделей, включая gpt-oss-120b, Qwen3, DeepSeek-R1 и другие. NVIDIA выложила часть данных, остальное доступно по запросу под пермиссивной лицензией. При фильтрации выкидывали малформатные примеры, повторы и траектории с политизированными нарративами.

По бенчмаркам NVFP4-версия почти не уступает BF16 и даже обходит её в агентных задачах: SWE-bench Verified — 52.80 против 51.56, GDPval-AA-V2 — 865 против 832. На MMLU Pro — 81.62, GPQA Diamond — 75.57, Terminal-Bench 2.1 — 23.46. Числа замерены самой NVIDIA в NeMo Gym. Деплой — через vLLM, TensorRT-LLM или SGLang. Примеры конфигураций есть для 1× H100, 8× H100, GB200 и Ampere. Для H100 в интерактивном режиме с DSpark заявляется 40+ токенов в секунду на пользователя. Модель умеет reasoning через chat_template_kwargs enable_thinking и поддерживает tool calling с парсером qwen3_coder.

Читать оригинал →