Энтузиаст запустил языковую модель на микроконтроллере ESP32-S3 за $10
В 2026 году энтузиаст под псевдонимом SlvDev успешно запустил языковую модель на микроконтроллере ESP32-S3, стоимостью $10, достигнув скорости обработки почти 10 токенов в секунду.
В 2026 году стало возможным запускать большие языковые модели на различных устройствах, включая ноутбуки и смартфоны. Один из энтузиастов, использующий псевдоним SlvDev, реализовал запуск небольшой языковой модели на микроконтроллере ESP32-S3, который стоит всего $10, и сумел достичь скорости почти 10 токенов в секунду.
Микроконтроллер ESP32-S3 включает в себя 520 кбайт оперативной памяти SRAM и 8 Мбайт псевдо-SRAM (PSRAM). Он предназначен для работы с удалёнными датчиками и устройствами интернета вещей, однако для запуска более сложной модели, такой как DeepSeek V4 Flash, его возможностей недостаточно. Вместо этого SlvDev выбрал компактную модель TinyStories, разработанную Microsoft Research, которая имеет 28,9 миллионов параметров.
Тем не менее, изначально модель требовала около 60 Мбайт памяти при 16-битной точности, что превышало доступные ресурсы ESP32-S3. Чтобы решить эту проблему, автор проекта провёл квантование, уменьшив точность весов модели с 16 до 8 и затем до 4 бит, что позволило сократить её размер до 14,9 Мбайт. Для успешной установки была приобретена версия микроконтроллера с 16 Мбайт флеш-памяти.
Далее SlvDev реализовал механизм послойного встраивания (Per-layer embedding — PLE), использующийся в архитектуре моделей Google Gemma. В результате 25 миллионов параметров, занимающих 12 Мбайт, были перенесены во флеш-память, а в оперативной памяти контроллера осталось лишь 2 Мбайта данных. В итоге заголовки входных данных и кеш ключ-значение были размещены в PSRAM, а для активации модели потребовалось всего 520 кбайт SRAM. Эти меры позволили достичь скорости генерации 9,88 токенов в секунду.
Хотя модель TinyStories продемонстрировала концепцию, она генерирует исключительно короткие истории и не подходит для полноценного чат-бота. Существует также модель Barista, имеющая схожие размеры, которая способна отвечать на вопросы, но только по темам, связанным с эспрессо, и генерирует токены вдвое быстрее. Несмотря на то, что обе модели имеют ограниченные возможности, их работа на ESP32 является значительным достижением.
По материалам: 3dnews.ru