← На главную

Inflect-Micro-v2 от Оуэна Сонга побеждает в слепом тесте на CPU

26.07.2026 00:36 · hackernews

Оуэн Сонг независимо разработал и выложил Inflect-Micro-v2 — законченную локальную модель синтеза речи «текст в аудио» с одним фиксированным английским голосом и меньше 10 миллионов параметров. Точное число deployable-параметров — 9,356,513, полные FP32-веса занимают 37.53 MB, вывод идёт на CPU и CUDA, результат — 24 kHz моно. Если релиз заинтересует сообщество, автор планирует сделать более широкую v3 с новыми языками, голосами и улучшениями стабильности.

В семействе две версии: Micro нацелена на качество, Nano (до 4M параметров) — на минимальный размер, обе работают через одинаковый публичный API. В слепом тестировании с участием сообщества Inflect-Micro-v2 получил 66.2% предпочтений (21 победа, 10 поражений, 3 ничьи) против KittenTTS Nano, Piper Low и Supertonic 3. Предсказанная естественность по UTMOS22 составила 4.395, а комбинированная разборчивость по двум ASR-системам (Qwen3-ASR и Nemotron 3.5) — всего 3.99% WER. Whisper large-v3 исключили из основного сравнения: на части семплов Supertonic 3 он галлюцинировал вставки.

На CPU обе модели синтезируют быстрее реального времени: Micro выдала 6.28-кратное ускорение, Nano — 10.72×. Для ориентира приводятся замеры Piper Low (31.37×) и KittenTTS Nano (13.33×), но они использовали оптимизированные ONNX-рантаймы и более короткие прогоны, тогда как цифры Inflect получены в PyTorch на 100 промптах Modern400.

Архитектурно Inflect v2 — параметроэффективный VITS-генератор с монотонным выравниванием, стохастическим латентным синтезом и встроенным декодером. Пакет включает модель, фронтенд eSpeak-ng, код инференса, зафиксированные промпты Modern400 и детальные отчёты с хешами. Отдельно выложен официальный FP32-экспорт ONNX с поддержкой DirectML и динамических длин.

Управлять генерацией можно параметрами speed (0.5–2.0), variation (0.0–1.0) и целочисленным seed для точной повторяемости. Длинные тексты разбиваются по пунктуации на чанки с паузами. Модель поставляется как open-weight под лицензией Apache-2.0, но обучающий пайплайн и рецепт оптимизации остаются частными. Оуэн Сонг готов делиться техническими деталями с исследователями по конкретным запросам.

Ограничения: только английский, один мужской синтетический голос (не клонирование); незнакомые фразы, числа, аббревиатуры и редкие имена могут звучать менее выразительно или нестабильно. Использовать для обмана, имитации реальных людей и в критически важных коммуникациях запрещено, синтетическую речь необходимо явно обозначать.

Читать оригинал →