Skip to content
3 / 20

Как считать и снижать cost LLM-продукта: prompt caching, batch endpoints, context compression?

Считать не «за запрос», а за единицу продуктовой ценности: за решённую задачу, за документ, за MAU. Снижать по убыванию отдачи: сначала prompt caching (cached input ≈ 0.1× обычного), затем batch endpoints для нетерминальных задач (≈50% цены), затем сокращение context, и только потом routing на модель попроще.

Как считать и снижать cost LLM-продукта: prompt caching, batch endpoints, context compression? | JScriptiser