← На главную

LLVM раскрыл AMD MI455X и MI430X — атака на Nvidia Hopper и Blackwell

19.07.2026 05:07 · hackernews

В LLVM нашли коммиты с поддержкой двух новых ускорителей AMD под кодовыми именами GFX1250 и GFX1251. Первый — это MI455X, чип для машинного обучения, который ляжет в основу системы Helios. Второй — MI430X, ориентированный на HPC, и AMD обещает на нём более 200 TFLOPs нативной двойной точности.

Архитектура GFX1250 переехала на Wave32, в отличие от старых CDNA, работавших только в Wave64. Теперь можно запускать 20 волн на каждый SIMD — на четыре больше, чем у RDNA4. Важное изменение: каждый поток теперь видит до 1024 векторных регистров VGPR, тогда как раньше было максимум 512 (и то с разделением на обычные и накопительные). Локальная память LDS выросла до 320 кБ на волну, а кэш L0 и LDS слились в единую структуру WGP Cache объёмом 448 кБ — теперь её можно гибко делить между кэшем и shared memory, как у Nvidia и Intel.

AI-возможности MI455X построены на WMMA-инструкциях, которые объединили простую модель программирования из RDNA4 с производительностью CDNA4. Поддерживаются все форматы данных от fp64 до fp4 и OCP MX-style масштабирование. Появились кластерные загрузки и барьеры — аналог Nvidia Thread Block Clusters. Добавили аппаратное ускорение tanh для нейросетей, bf16 для транцендентальных операций, а задержка fp32 снизилась с 9 до 8 циклов.

Интересная деталь: GFX1250 — чистый вычислитель. Из него выпилили всё графическое: растеризатор, текстурные сэмплеры, BVH для рейтрейсинга и даже буферные инструкции MTBUF и MUBUF. Это экономит место на кристалле. Зато добавили prefetch для векторной памяти — фичу, которой не было на GPU со времён Ферми, и новые счётчики ожидания ASYNCcnt, TENSORcnt и Xcnt, которые дают более тонкий контроль над зависимостями, чем старые VM_CNT и LGKM_CNT.

Всё это выглядит как попытка AMD догнать Nvidia по фичам Hopper и Blackwell. Удастся ли MI455X в Helios обогнать лидера не только в теории, но и на практике — покажут бенчмарки.

Читать оригинал →