11 / 20
Спроектируйте голосового ассистента: как уложиться в задержку, из которой складывается ощущение живого разговора?
Пауза дольше секунды воспринимается как «не понял» — а бюджет надо разделить между четырьмя этапами: распознавание речи, определение конца реплики, генерация ответа и синтез голоса. Спасают потоковые режимы на всех этапах: распознавание идёт по ходу речи, генерация начинается по первому же понятому смыслу, синтез стартует с первого предложения, не дожидаясь конца ответа. Отдельная сложная задача — понять, что человек закончил говорить, а не задумался.