3 / 10
Как мерить и алертить latency в production LLM-системе: P50/P95/P99, TTFB для streaming, SLA / SLO?
Percentiles, не average: LLM latency имеет heavy-tail распределение, avg обманчив. SLO формулируем как «99% запросов < 5s» (не «avg < 2s»). Для streaming критичен TTFB (time to first token) — пользователь видит первый токен через X секунд, не end-to-end. Метрики: gen_ai.client.operation.duration histogram (OpenTelemetry GenAI), Prometheus histogram_quantile(), dashboards в Langfuse / LangSmith / Helicone. Alert: P95 > SLO target в течение 5 минут → page on-call. Следите за downstream queueing (BullMQ depth) — root cause latency spike.