Перейти к содержимому
3 / 10

Как измерять задержку LLM-системы и настраивать оповещения: перцентили P50/P95/P99, время до первого токена при потоковой выдаче, SLA и SLO?

Перцентили, а не среднее: задержка LLM имеет «тяжёлый хвост» — редкие очень медленные ответы, поэтому среднее обманчиво. Цель по качеству формулируют как «99% запросов быстрее 5 с», а не «в среднем меньше 2 с». Для потоковой выдачи важно время до первого токена (TTFB) — через сколько секунд пользователь увидит начало ответа, а не только полное время. Метрики: гистограмма gen_ai.client.operation.duration (соглашения OpenTelemetry GenAI), histogram_quantile() в Prometheus, дашборды в Langfuse / LangSmith / Helicone. Оповещение: P95 держится выше цели 5 минут → будим дежурного. Следите за очередями ниже по потоку (глубина BullMQ) — часто именно они первопричина всплеска задержки.

Как измерять задержку LLM-системы и настраивать оповещения: перцентили P50/P95/P99, время до первого токена при потоковой выдаче, SLA и SLO? | JScriptiser