ТЕХНОЛОГИИ

Создан новый суперкомпьютер для ИИ и HPC-задач от АМДтехнологий и Е-Флопс

Компании «АМДтехнологии» и «Е-Флопс» разработали HPC-комплекс для решения задач в области ИИ по заказу крупного российского банка.

Инжиниринговая компания «АМДтехнологии» совместно с производителем серверных решений «Е-Флопс» представили новый HPC-комплекс, разработанный для решения задач искусственного интеллекта. Проект был осуществлён по заказу одного из десяти крупнейших банков России, имя которого не раскрывается.

Созданный в России суперкомпьютер включает 22 вычислительных узла, основанных на ускорителях NVIDIA H100 80GB и x86-процессорах, обеспечивая пиковую производительность в 11792 Тфлопс (FP64) для научных вычислений и 700 Пфлопс (FP8/INT8) для задач ИИ. В его состав входят 4224 процессорных ядра, 33792 Гбайт оперативной памяти и 14080 Гбайт памяти GPU, а также 2973696 CUDA-ядер и 92928 тензорных ядер. Каждый ускоритель соединён через 200G-интерфейс InfiniBand NDR, а локальная сеть использует 25GbE-интерфейсы при управлении через 10GbE.

Комплекс разделён на внутренний и внешний сегменты. Внутренний сегмент расположен в пределах защищённого периметра банка и не имеет доступа к интернету, он предназначен исключительно для задач ИИ. Внешний сегмент, находящийся за пределами информационной инфраструктуры банка, используется для HPC-нагрузок.

Согласно требованиям клиента, реализованы две независимые подсистемы хранения данных для каждого сегмента. В внешнем контуре установлена специализированная система хранения данных (СХД) с поддержкой иерархического хранения: «горячие» данные хранятся на SSD с общей ёмкостью 61 Тбайт, а «холодные» — на HDD с ёмкостью 2 Пбайт, подключённых через InfiniBand NDR. Внутренний сегмент использует распределённое гиперконвергентное хранилище, которое масштабируется с увеличением числа вычислительных узлов, с доступом к объектному хранилищу через FC32 SAN.

В программном обеспечении предусмотрены инструменты мониторинга и управления, включая NVIDIA DCGM, систему визуализации и анализа данных на основе открытых пакетов, а также платформу оркестрации Kubernetes с модулями Multus и Cilium. Внешний сегмент дополнительно использует планировщик Slurm, а управляющие серверы функционируют в среде Proxmox.

Суперкомпьютер уже введён в эксплуатацию и установлен в сертифицированном центре обработки данных одного из крупных провайдеров. Все серверы, коммутаторы и СХД внешнего сегмента размещены в 16 серверных шкафах с воздушным охлаждением и организацией холодного и горячего коридоров. По запросу заказчика предусмотрена возможность увеличения числа вычислительных узлов до 42 и расширения сетевой инфраструктуры.

По материалам: 3dnews.ru