4 / 10
Как следить за попаданиями в кэш и повторными запросами: статистика кэша промптов и наблюдаемость ретраев?
Anthropic возвращает в usage: cache_creation_input_tokens (новый cache write) + cache_read_input_tokens (cache hit). OpenAI prompt caching (Oct 2024) — automatic для prompts ≥1024 токенов, в usage.prompt_tokens_details.cached_tokens. Считаем долю попаданий в кэш = cached / (cached + non_cached_input) и отправляем в Prometheus / Langfuse. Доля повторов = число повторов / всего запросов; оповещение при > 5% (провайдер деградировал, упёрлись в лимит, временные ошибки). Helicone имеет native cache + retry metrics; Langfuse — через metadata.cache_status + metadata.retry_count. Низкая доля попаданий в кэш (< 50%) означает неудачную структуру промпта — меняется та его начальная часть, которая должна была кэшироваться.