11 / 20
Батчинг против задержки: как настроить очередь инференса, чтобы не разорить хвост распределения?
Крупный батч даёт максимум токенов в секунду с карты, но каждый отдельный запрос ждёт дольше: время ожидания складывается из накопления батча и разделения вычислительных ресурсов между соседями. Настройка сводится к трём ручкам — максимальный размер батча, максимальное время ожидания перед запуском и лимит одновременных последовательностей. Проверять надо по p99 и по доле запросов, отклонённых при переполнении очереди, а не по средней задержке.