Skip to content
11 / 20

Prefill/decode disaggregation: зачем разносить фазы по разным пулам GPU и когда это окупается?

Фазы упираются в разные ресурсы и мешают друг другу на одной карте. Prefill — compute-bound, decode — memory-bandwidth-bound; на одной карте длинный prefill чужого запроса вклинивается между decode-шагами и портит равномерность выдачи. Disaggregation убирает интерференцию и даёт предсказуемый tail ITL, но добавляет передачу KV-cache между пулами и рост queuing time. Окупается при строгих SLO и большом масштабе.

Prefill/decode disaggregation: зачем разносить фазы по разным пулам GPU и когда это окупается? | JScriptiser