2 / 20
Как спроектировать latency budget LLM-приложения: TTFT, TPOT/ITL, перцентили и streaming?
У LLM-запроса не одна latency, а две. TTFT (time to first token) — сеть + очередь + prefill; именно её пользователь чувствует как «подвисло». TPOT / ITL — время на последующий токен, определяет скорость «печати». Total ≈ TTFT + TPOT × output_tokens. SLO-целями делают TTFT и ITL по P99, не average.