12 / 21
Что такое prompt caching у Anthropic и как сэкономить до 90% на повторных запросах?
Prompt caching у Anthropic позволяет пометить часть промпта как кешируемую (cache_control: { type: 'ephemeral' }) — при повторном вызове в течение 5 минут кешированные токены тарифицируются в 10 раз дешевле, а write +25% к цене. Идеально для длинного system prompt, RAG-документов и инструкций к агенту: первый раз дороже, далее минус 90% на input. У OpenAI похожий механизм (Automatic Prompt Caching) включён по умолчанию для prefix-match.