Перейти к содержимому
8 / 20

Мультитенантность LLM-сервиса: как изолировать данные, раздать квоты и не дать одному клиенту съесть всё?

Три отдельные задачи, которые решаются разными механизмами. Изоляция данных — чтобы фрагменты одного клиента не попали в ответ другому: фильтр на уровне индекса, а не на уровне промпта. Квоты — чтобы один клиент не израсходовал общий лимит провайдера: учёт токенов на клиента с жёстким и мягким порогом. Справедливое распределение — чтобы пакетная выгрузка одного клиента не уронила задержку остальным: очереди с приоритетами и разделение потоков нагрузки.