MTIA 300: Первый чип Meta с 800GbE адаптерами и новыми коммуникационными механизмами
Meta представила подробности о своем первом ИИ-ускорителе MTIA 300, оптимизированном для DLRM. Он включает 800GbE-адаптеры и предлагает высокую пропускную способность для эффективного обучения.
Компания Meta анонсировала MTIA 300, свой первый ИИ-ускоритель мощностью 667 Вт, специально разработанный для обучения DLRM-моделей. В отличие от LLM, требующих значительных вычислительных ресурсов, рекомендательные модели нуждаются в быстром взаимодействии между ускорителями, а также в большом объеме памяти и высокой пропускной способности интерконнекта.
Таблицы эмбеддингов в таких моделях могут содержать более 99% всех параметров, что требует гибридного параллелизма и приводит к частым коллективным операциям, таким как AllReduce и AllGather на сотнях ускорителей. На традиционных GPU эти операции могут конфликтовать с вычислениями, что приводит к неэффективному использованию ресурсов. Для решения данной проблемы в MTIA 300 был внедрён HCCL, интерфейс коммуникаций, который обеспечивает пропускную способность передачи данных до 940 Гбайт/с в пределах одной стойки.
Внутри MTIA 300 находится сетевой интерфейс, выполненный в виде двух 5-нм чиплетов, каждый из которых включает шесть специализированных 800GbE RoCE-адаптеров. Это обеспечивает общую пропускную способность I/O 1,2 Тбайт/с и устраняет узкие места, характерные для традиционных архитектур, где CPU выступает посредником между ускорителем и сетью. Система позволяет гибко масштабировать NIC в зависимости от потребностей.
Разработчики также внедрили механизм обработки сообщений (ME), который обрабатывает все коммуникации независимо от вычислений. ME включает ядро RISC-V для управления, сетевой интерфейс для маршрутизации запросов и вычислительный блок Near-Memory Computing (NMC) для выполнения операций редукции. Это позволяет проводить коллективные операции AllReduce без использования ресурсов PE, обеспечивая эффективное выполнение задач.
Благодаря такой архитектуре MTIA 300 обеспечивает изоляцию операций, что минимизирует снижение вычислительной пропускной способности. В отличие от традиционных GPU, где такие операции могут существенно влиять на производительность, в MTIA 300 снижение составляет менее 0,5%. Библиотека HCCL автоматически управляет обменом данными, компилируя коллективные операции в подграфы, что позволяет хост-системе минимально вмешиваться в процесс.
С MTIA 300 также доступны преимущества, такие как 216 Гбайт HBM3E с пропускной способностью 6,1 Тбайт/с и возможность использования одного CPU на каждый ускоритель, что позволяет более эффективно распределять вычислительные задачи. Хотя данный чип изначально оптимизирован для DLRM, его характеристики позволяют использовать его для более широкой гаммы задач, включая инференс генеративного ИИ.
По материалам: 3dnews.ru