Перейти к содержимому
10 / 20

vLLM, SGLang и TensorRT-LLM: чем движки инференса отличаются и как выбрать?

Три движка оптимизируют разное. vLLM — про универсальность и загрузку GPU: PagedAttention, широчайшая поддержка железа и моделей, совместимый с OpenAI сервер из коробки; разумный выбор по умолчанию. SGLang — про переиспользование общих префиксов: RadixAttention хранит KV-кэш в префиксном дереве, поэтому запросы с общим началом автоматически дают попадание; выигрывает на RAG с фиксированным корпусом и многоходовых агентах. TensorRT-LLM — про предельную скорость на конкретном железе NVIDIA ценой сложной сборки.

vLLM, SGLang и TensorRT-LLM: чем движки инференса отличаются и как выбрать? | JScriptiser