LLM жрут память гигабайтами, и чем больше людей ими пользуются, тем больше памяти надо. Производители уже ускоряют стройку новых заводов под HBM и DRAM, первый запуск — в 2027 году. Но спрос творит чудеса: он даёт шанс новым идеям. Одна из них — High Bandwidth Flash (HBF). Это прокачанная версия памяти из SD-карт и флешек. Идея простая: берём то, что сделало HBM успешным (стопки чипов для ёмкости и пропускной способности), и применяем к NAND flash — той самой, что хранит данные в смартфонах и SSD.
«Люди спрашивают: как это вообще имеет смысл? Flash же чудовищно медленный», — говорит Джим Хэнди из Objective Analysis. Он поясняет: NAND flash действительно плох на запись, но на чтение его можно разогнать. HBF как раз для этого и заточен.
Чем HBF отличается от обычной NAND? Flash хранит заряд в плавающих затворах транзисторов, данные организованы блоками и страницами, а не отдельными байтами. Он энергонезависим — данные не пропадают без питания. Это делает его идеальным для долгого хранения: NAND плотнее DRAM и не требует энергоёмких конденсаторов. Но за плотность и энергонезависимость приходится платить скоростью записи — загнать заряд в изолированный затвор дольше, чем зарядить конденсатор.
Современный интерфейс NAND выдаёт до 4,8 ГБ/с на кристалл. Для SSD неплохо. Но DDR5 даёт 70,4 ГБ/с на модуль, а HBM4E — до 3,6 ТБ/с на стопку. Разрыв почти в 750 раз. HBF сокращает его за счёт упаковки, похожей на HBM. «Применяя продвинутый 3D-пакетинг и вертикальное стекирование к NAND, HBF даёт гораздо более высокую пропускную способность, чем обычное NVMe-хранилище», — объясняет Хошик Ким из SK Hynix.
Sandisk уже опубликовала спецификации первого поколения: до 16 слоёв NAND, ёмкость до 512 ГБ на стопку, скорость чтения до 1,6 ТБ/с. В roadmap — второе и третье поколения на 2 и 3,2 ТБ/с соответственно.
Зачем это нужно, если HBF всё равно медленнее HBM? Всё упирается в разницу между обучением и инференсом. При обучении LLM веса модели постоянно читаются и перезаписываются — для этого HBM незаменим. Но при инференсе веса заморожены и только читаются. Flash идеально подходит для хранения статичных данных — многомиллиардных весов или предвычисленного KV cache. «В среде инференса массивные, преимущественно читаемые данные можно безопасно разместить на уровне HBF», — говорит Ким. Это освобождает HBM для работы «высокоскоростного блокнота».
24 февраля 2026 года Sandisk и SK Hynix запустили совместную работу по стандартизации HBF в рамках Open Compute Project (OCP). Когда опубликуют стандарт — пока не ясно. Ким подчёркивает, что HBF не конкурент HBM, а дополнение: он снижает «узкое горло» по ёмкости, не жертвуя скоростью, и может сократить количество ускорителей в дата-центрах. В перспективе это означает меньшее энергопотребление и более дешёвый масштабный инференс.