Ультразвуковой датчик под подбородком, 50 часов тренировочных данных и модель на базе Whisper — так работает система беззвучной речи, которая распознаёт слова по движению языка. В отличие от EMG, радара или чтения по губам, ультразвук видит язык напрямую. А язык формирует около 34 из 40 фонем английского, тогда как губы — только 10–14 различимых форм. Это позволяет делать «невидимую» беззвучную речь: со стороны не заметно, что человек говорит.
Исследователи собрали 50 часов данных: люди читали вслух синтезированные короткие рассказы, а датчик записывал видео языка. Аудио использовали для проверки качества — убеждались, что человек произнёс нужный текст. Потом оказалось, что движения языка при беззвучной и озвученной речи похожи, так что модель, обученная на аудиоданных, обобщается и на беззвучную.
Архитектура — ResNet-18 2+1d для видео и Whisper Base для превращения эмбеддингов в текст. Энкодер учили выдавать векторы, близкие к эмбеддингам Whisper от соответствующего аудио. Первые 20 тысяч примеров модель сходила с ума — коллапсировала или полагалась на языковые стереотипы. Потом пошли осмысленные ошибки вроде «a key stick» вместо «acoustic» — это значило, что модель начала вылавливать фонетику из сигнала.
Результат на внутреннем кросс-говорящем тесте — 15.6% word error rate. Для сравнения: чтение по губам даёт 12.5% WER на датасете в 1 млн часов, а единственный известный аналог только с ультразвуком — 83.8% WER. WER падает с ростом данных с 102% на 15k примерах до 15.6% на 50k и не показывает насыщения.
Главные проблемы — размер датчика и ультразвуковой гель. Обе, по мнению авторов, решаемы: со временем датчик можно сделать лёгким носимым пластырем на гидрогеле. Пока система не справляется с неамериканским акцентом, но больше данных и лучшее железо превратят прототип в реальное устройство.