Компания PolyAI представила модель Dialog-RSN-1. Эта модель воспринимает аудио звонящего напрямую, без использования транскриптов от ASR. Она объединяет в себе функции определения смены реплик (turn-taking), распознавания речи, вызова функций (function calling) и генерации ответов.
TTS-синтез голоса остается отдельным компонентом для сохранения контроля над голосом вывода. Модель работает по запросному принципу (request-based LLM), а не как постоянно активный поток. PolyAI сообщает о задержке ответа менее 300 мс в реальных развертываниях.