2 / 20
Как спроектировать бюджет задержки LLM-приложения: TTFT, время на токен, перцентили и стриминг?
У LLM-запроса не одна задержка, а две, и они меряются по-разному. TTFT (time to first token) — время до первого токена: сюда входят сеть, очередь и фаза разбора запроса; именно её чувствует пользователь как «подвисло». TPOT / ITL — время на один последующий токен, оно определяет, насколько быстро «печатается» ответ. Общее время ≈ TTFT + TPOT × число выходных токенов. Целями по SLO делают TTFT и ITL по P99, а не среднее.