3 / 20
Мультиарендный LoRA-сервинг: как держать десятки дообученных моделей на одной видеокарте?
Дообучение методом низкоранговых адаптеров не меняет исходные веса, а добавляет к ним небольшие матрицы — единицы или десятки мегабайт против десятков гигабайт базовой модели. Поэтому можно держать в памяти одну базовую модель и множество адаптеров, подставляя нужный на каждый запрос. Это превращает «модель на каждого клиента» из экономически невозможного в рутинное: сотня клиентов обслуживается одной видеокартой вместо ста. Плата — усложнение маршрутизации, неравномерная нагрузка между адаптерами и общая судьба: проблема базовой модели затрагивает всех сразу.