13 / 20
Как масштабировать GPU-сервинг: автоскейл, холодный старт, обнуление при простое, очереди и обратное давление?
Автоскейл GPU-сервинга устроен иначе, чем у обычного веб-сервиса, по трём причинам: холодный старт занимает минуты (загрузка десятков гигабайт весов), загрузка процессора — плохой сигнал (масштабировать надо по глубине очереди и по занятости KV-кэша) и узлы дорогие, поэтому обнуление при простое даёт реальную экономию, но платится задержкой первого запроса. Ключевой механизм при перегрузке — очередь с обратным давлением и явным отказом, а не безграничное накопление.