13 / 20
Как масштабировать GPU serving: autoscaling, cold start, scale-to-zero, очереди и backpressure?
Autoscaling GPU-сервинга отличается от обычного веб-сервиса по трём причинам: cold start — минуты (загрузка десятков GB весов), CPU utilization — плохой сигнал (масштабировать по queue depth и KV-cache occupancy) и узлы дорогие, поэтому scale-to-zero даёт реальную экономию ценой latency первого запроса. Ключевой механизм при перегрузке — очередь с backpressure и явным отказом, а не бесконечное накопление.