Холодный старт модели: почему первая реплика включается пять минут и что с этим делать
Холодный старт сервиса инференса складывается из четырёх этапов, и каждый занимает заметное время. Планирование пода на GPU-узел — секунды, если карта свободна, и минуты, если нужен новый узел. Загрузка образа — образы с CUDA и библиотеками весят гигабайты. Загрузка весов — десятки гигабайт с диска или по сети. Прогрев — компиляция ядер, построение графов, аллокация KV-кэша: первые запросы обслуживаются в разы медленнее установившегося режима. Итог — единицы минут, из-за чего наивное автомасштабирование по нагрузке не успевает: всплеск проходит раньше, чем поднимется реплика. Лечится это набором мер: кэш весов на узлах, тёплый резерв из одной-двух реплик, предварительное масштабирование по расписанию и по опережающему сигналу (длина очереди вместо утилизации), а также прогрев после старта — фиктивные запросы до того, как под будет объявлен готовым.