6 / 20
Как проектировать degradation LLM-сервиса: провайдер недоступен, rate limit исчерпан, модель отказала?
Отказы LLM-слоя бывают четырёх видов, ответ на каждый свой: transient error провайдера (retry с backoff), rate limit (очередь и приоритеты, не retry — retry усугубит), refusal по policy (переход на другую модель или честное сообщение), деградация качества и latency (fallback по timeout). Общий принцип: ответ без модели лучше отсутствия ответа, fallback проектируется вместе с основным путём.