ARENA PULSE Все новости

Meta выпустила Muse Voice Transcribe для потокового ASR и диаризации

Релизы meta

Единая модель объединяет потоковый ASR, диаризацию 20+ спикеров и endpointing. Доступна как API по $0.18/час.

Meta Superintelligence Labs представила Muse Voice Transcribe — автогрессивную модель, обрабатывающую аудио в 80ms чанки. Модель достигает 3.1% WER на AA-WER Streaming при задержке 0.16с после окончания речи.

Обучение с подкреплением (RL) адаптирует задержку для каждого слова, оптимизируя точность и скорость. Диаризация и endpointing реализуются через специальные токены в том же потоке.

Источник: marktechpost.com

Открыть в ArenaPulse