18 / 20
Как заложить бюджет задержки ML-сервиса и что показывать пользователю, когда модель не успела ответить?
Бюджет задержки раскладывают по этапам: получение признаков, инференс, постобработка — и на каждом ставят таймаут, сумма которых меньше обещанного пользователю времени. Модель в этой цепочке редко самая медленная: чаще время съедают походы за признаками. Обязателен путь отхода — предыдущая версия модели, кэш вчерашних предсказаний, популярное по умолчанию или простое правило. Ответ «медленно, но точно» в проде хуже, чем «быстро и приблизительно».