Moonshine Micro — это открытый AI-инструментарий для голосовых интерфейсов на микроконтроллерах. Он умеет распознавать голосовую активность, понимать команды и синтезировать речь. Всё это помещается в 470 КБ оперативной памяти. Эталонная платформа — Raspberry Pi RP2350, и стоит такой чип всего 80 центов.
Внутри три компонента: VAD (детектор активности), STT (преобразование речи в текст на основе SpellingCNN) и TTS (нейросетевой синтез речи). Каждый можно использовать отдельно, они опираются на встроенную библиотеку TensorFlow Lite Micro. Память и вычисления подогнаны под жёсткие ограничения микроконтроллеров. Например, VAD занимает ~89 КБ флеша и ~36 КБ SRAM, в активной фазе жрёт около 0.8 MMAC на кадр. STT — ~1.3 МБ флеша и ~346 КБ SRAM, вычислительная нагрузка — 36 MMAC/s. TTS тянет на ~1.8 МБ (голосовой пакет) и ~340 КБ SRAM, типичный ответ требует ~37 MMAC, но на пике может уйти до 65 MMAC/s.
Важный нюанс: VAD, STT и TTS работают последовательно и делят один буфер TFLM размером ~384 КБ. Поэтому общая занятая SRAM не суммируется — ~468 КБ хватает на весь конвейер. На RP2350 это укладывается в доступные 520 КБ (с учётом железа Wi-Fi остаётся ~491 КБ). Полный цикл «классификация + озвучка» занимает 0.7–1 секунду.
Весь код выпущен под лицензией MIT, то есть подходит для коммерческих проектов. В репозитории есть готовый пример end-to-end прошивки, как подключить микроконтроллер к Wi-Fi через голос. Модели из папки models/ — SpellingCNN и TinyVadCNN — тоже под MIT. Сторонние зависимости в third-party/ лицензируются по правилам их исходных проектов.