Skip to content
8 / 20

Multi-tenancy LLM-сервиса: как изолировать данные, раздать quotas и не дать одному tenant съесть всё?

Три отдельные задачи с разными механизмами. Data isolation — чтобы chunks одного tenant не попали в ответ другому: фильтр на уровне index, не в промпте. Quotas — чтобы один tenant не израсходовал общий rate limit провайдера: учёт токенов per-tenant с hard и soft порогом. Fair scheduling — чтобы batch-выгрузка одного не уронила latency остальным: приоритетные очереди и разделение потоков нагрузки.

Multi-tenancy LLM-сервиса: как изолировать данные, раздать quotas и не дать одному tenant съесть всё? | JScriptiser