Cerebras представила новую ИИ-стойку CS-4 с ускорителями WSE-3 Turbo
Cerebras Systems анонсировала ИИ-ускорители WSE-3 Turbo и стоечную систему CS-4, обеспечивающие до 30-кратное увеличение производительности по сравнению с современными GPU.
Компания Cerebras Systems представила свои новые ИИ-ускорители WSE-3 Turbo, а также стоечную систему CS-4, основанную на этих ускорителях. По утверждениям компании, новая система демонстрирует производительность на уровне до 30 раз выше, чем у современных платформ на базе GPU при выполнении задач инференса.
Ускоритель WSE-3 Turbo, как и его предшественник WSE-3 (Wafer Scale Engine), включает 4 триллиона транзисторов, 900 тысяч ядер и 44 Гбайт SRAM. Производство осуществляется по 5-нм техпроцессу TSMC, а площадь кремниевой пластины составляет 46 225 мм2. Пропускная способность памяти увеличилась с 21,6 до 43,2 Пбайт/с, а подсистемы ввода-вывода — с 1,2 до 2,4 Тбит/с.
В области разреженных FP16-вычислений производительность возросла вдвое — с 125 до 250 Пфлопс, а для обычных FP16-операций — с 12,5 до 25 Пфлопс. Показатель TDP на уровне пластины составил 33 кВт, что превышает 15 кВт у WSE-3, а для узла — 46 кВт против 23 кВт, при этом на уровне всей стойки CS-4 он составляет от 120 до 140 кВт. Вероятно, это связано с увеличением рабочих частот с 1,4 ГГц до 2,8 ГГц.
Стойка CS-4 основана на модульной архитектуре Nexus и состоит из трех основных блоков: вычислительного узла Wafer-Scale Backpack, подсистемы питания и IO-подсистемы. Такая структура упрощает производственные процессы, развертывание, обслуживание и обновления. В системе используется три узла Wafer-Scale Backpack, каждый из которых включает ускоритель, преобразователь питания, систему прямого жидкостного охлаждения, компоненты высокоскоростного ввода-вывода и управляющую электронику.
Питание подводится близко к чипам, что значительно снижает потери энергии и позволяет увеличить мощность, что в свою очередь повышает частоту работы и скорость генерации токенов. Специальный IO-модуль обеспечивает соединение пластин WSE-3 Turbo без необходимости в коммутаторе, что позволяет достичь задержки передачи данных всего 2 мкс. Общее быстродействие системы составляет 750 Пфлопс в разреженных FP16-вычислениях.
На тесте с моделью GPT-OSS-120B система CS-4 показала результат более 4400 токенов в секунду на одного пользователя, в то время как наиболее производительный сервис ИИ-инференса на базе GPU демонстрирует всего 350 токенов в секунду. CS-4 также обеспечивает более 1000 токенов в секунду на моделях с более чем 10 трлн параметров. Поставки новой системы планируется начать в текущем квартале.
По материалам: 3dnews.ru