11 / 20
Prefill/decode disaggregation: зачем разносить фазы по разным пулам GPU и когда это окупается?
Фазы упираются в разные ресурсы и мешают друг другу на одной карте. Prefill — compute-bound, decode — memory-bandwidth-bound; на одной карте длинный prefill чужого запроса вклинивается между decode-шагами и портит равномерность выдачи. Disaggregation убирает интерференцию и даёт предсказуемый tail ITL, но добавляет передачу KV-cache между пулами и рост queuing time. Окупается при строгих SLO и большом масштабе.