Перейти к содержимому
11 / 20

Разделение фаз разбора и генерации (prefill/decode disaggregation): зачем разносить их по разным GPU?

Потому что фазы упираются в разные ресурсы и мешают друг другу на одной карте. Разбор запроса нагружает вычисления, генерация — пропускную способность памяти; когда они делят одну карту, длинный разбор чужого запроса вклинивается между шагами генерации и портит равномерность выдачи. Разделение убирает эту интерференцию и даёт предсказуемый хвост межтокенных интервалов, но добавляет передачу KV-кэша между пулами и рост времени в очередях. Окупается при строгих SLO и большом масштабе.

Разделение фаз разбора и генерации (prefill/decode disaggregation): зачем разносить их по разным GPU? | JScriptiser