8 / 20
Multi-tenancy LLM-сервиса: как изолировать данные, раздать quotas и не дать одному tenant съесть всё?
Три отдельные задачи с разными механизмами. Data isolation — чтобы chunks одного tenant не попали в ответ другому: фильтр на уровне index, не в промпте. Quotas — чтобы один tenant не израсходовал общий rate limit провайдера: учёт токенов per-tenant с hard и soft порогом. Fair scheduling — чтобы batch-выгрузка одного не уронила latency остальным: приоритетные очереди и разделение потоков нагрузки.