← На главную

AMD покупает Taalas: HC1 в 48 раз быстрее Nvidia на Llama 3.1 8B

06.08.2026 20:23 · hackernews

AMD покупает Taalas — стартап из Торонто, основанный в 2023 году. Taalas делает необычные чипы для инференса: веса моделей вживляются прямо в кремний, а не хранятся в HBM. По сути это model-specific integrated circuit — чип под конкретную модель. Условия сделки не раскрыли, но это именно поглощение, а не acquihire. Контекст понятный: в декабре Nvidia заключила с Groq лицензионную сделку на $20 млрд. Обе компании хотят сделать премиальный инференс для AI-агентов, вроде код-ассистентов, быстрее и дешевле.

В феврале Taalas показала тестовый чип HC1, выпущенный на 6nm процессе TSMC. Он обслуживал Meta Llama 3.1 8B со скоростью 16 960 токенов в секунду. На тот момент это в 48 раз быстрее GPU Nvidia и в 8.5 раза быстрее ускорителей Cerebras. Чип размером с ретикл нужен был скорее для доказательства концепции. Внутри у него два блока: mask-ROM recall fabric, где вытравлены веса, и SRAM recall fabric для KV-кэшей и адаптеров тонкой настройки.

Второе поколение, HC2, выйдет летом и поднимет ёмкость до 20 млрд параметров на чип. Для больших моделей веса распределяют по нескольким ускорителям через pipeline parallelism. На триллион параметров хватит примерно 50 таких ускорителей. AMD собирается ставить чипы на базе технологий Taalas в свои стойки Helios на базе Instinct. Похоже, архитектура будет разнесённой: тяжёлую обработку промптов берут GPU, а генерацию токенов отдают ускорителям Taalas. Возможен и вариант tick-tock: сначала Instinct для валидации модели, потом перевод на Taalas. SVP по AI в AMD Vamsi Boppana сказал в заготовленном заявлении, что AMD строит full-stack AI-платформу и даёт заказчикам гибкость выбора Compute под каждую задачу.

Главный минус — привязанность к модели. Любое изменение серьёзнее LoRA-адаптера требует перезапуска производства чипа. Это дорого и долго. Впрочем, по словам стартапа, переделывать надо не всё, а только два слоя металла. Так что это сильно дешевле, чем начинать с нуля. Технологию, скорее всего, возьмут разработчики моделей, их инфраструктурные провайдеры и несколько инференс-провайдеров. В интервью The Next Platform компания заявляла, что вживление весов в кремний в 100 раз дешевле тренировки frontier-модели.

OpenAI, Anthropic и Meta — крупные заказчики Instinct. Так что появление GPT или Claude на связке Taalas и Instinct никого не удивит. Ещё технология интересна для test-time scaling: модель может думать дольше, но это сжигает токены и замедляет ответ. Если Taalas удешевит токен и ускорит вывод в 10–20 раз, разработчики смогут наращивать время рассуждений. Сделку, если её одобрит регулятор, планируют закрыть в четвёртом квартале.

Читать оригинал →