Разработанная Meta Superintelligence Labs, Muse Voice Transcribe обрабатывает аудио в реальном времени, разбивая его на чанки по 80 миллисекунд. Модель обучена с использованием подкрепления для минимизации задержки и ошибки распознавания слов.
Цена публичного API составляет $0.18 за обработанный час аудио. В сравнении с конкурентами, Speechmatics заявляет о поддержке до 100 спикеров, а Amazon Transcribe — до 30 спикеров.