AMD анонсировала ускоритель Instinct MI455X с 432 Гбайт HBM4 и высокой производительностью
Компания AMD представила новый ИИ-ускоритель Instinct MI455X, работающий на архитектуре CDNA 5. Ускоритель предлагает 432 Гбайт HBM4 и значительно превышает производительность своего предшественника.
AMD представила свою новую модель специализированного ИИ-ускорителя Instinct MI455X, ориентированную на центры обработки данных. Этот ускоритель основан на архитектуре CDNA 5 и предназначен для масштабного обучения искусственного интеллекта и обработки данных в системах AI. Он оборудован 432 Гбайт HBM4 и обеспечивает пиковую пропускную способность памяти до 23,3 Тбайт/с.
Ускоритель Instinct MI455X содержит 320 миллиардов транзисторов и изготовлен по 2-нм техпроцессу. В его конструкцию входят восемь чиплетов ACD, разработанных по технологии TSMC N2, которые формируют 256 вычислительных блоков WGP. Также в составе GPU присутствуют два чиплета Fabric и два чиплета ввода-вывода, произведенные по 3-нм техпроцессу TSMC N3P.
GPU включает 12 стеков памяти HBM4, подключенных через 192-канальный интерфейс. Он оснащен 192 Мбайт глобального кеша L2, разделенного на два блока по 96 Мбайт, и поддерживает два канала PCIe Gen 6 или три сетевых адаптера AMD AI-NIC с использованием UALink.
AMD указывает, что пиковая производительность Instinct MI455X составляет 20,13 Пфлопс в операциях MXFP8 и MXFP6, а в операциях MXFP4 достигает 40,26 Пфлопс. Новый ускоритель в 1,5 раза больше по объему памяти, в 2,9 раза выше по пропускной способности и в четыре раза мощнее в операциях MXFP8 и MXFP4 по сравнению с Instinct MI355X.
Архитектура CDNA 5 включает блок Tensor Data Mover для асинхронной передачи данных между глобальной и локальной памятью, а также обеспечивает новые функции, такие как кластеризация рабочих групп и многоадресная передача данных. Ускорители могут работать в различных режимах, включая NPS1 и NPS2, что позволяет гибко управлять памятью.
Кроме того, AMD анонсировала ускоритель Instinct MI430X, предназначенный для научных вычислений и задач искусственного интеллекта. Для этого ускорителя компания заявила производительность в 288 Тфлопс в операциях FP64, однако конфигурация его памяти не была раскрыта.
По материалам: 3dnews.ru