Meta Superintelligence Labs представила Muse Voice Transcribe — автогрессивную модель, обрабатывающую аудио в 80ms чанки. Модель достигает 3.1% WER на AA-WER Streaming при задержке 0.16с после окончания речи.
Обучение с подкреплением (RL) адаптирует задержку для каждого слова, оптимизируя точность и скорость. Диаризация и endpointing реализуются через специальные токены в том же потоке.