10 / 20
vLLM, SGLang ΠΈ TensorRT-LLM: ΡΠ΅ΠΌ inference engines ΠΎΡΠ»ΠΈΡΠ°ΡΡΡΡ ΠΈ ΠΊΠ°ΠΊ Π²ΡΠ±ΡΠ°ΡΡ?
Π’ΡΠΈ engine ΠΎΠΏΡΠΈΠΌΠΈΠ·ΠΈΡΡΡΡ ΡΠ°Π·Π½ΠΎΠ΅. vLLM β ΡΠ½ΠΈΠ²Π΅ΡΡΠ°Π»ΡΠ½ΠΎΡΡΡ ΠΈ GPU utilization: PagedAttention, ΡΠΈΡΠΎΠΊΠ°Ρ ΠΏΠΎΠ΄Π΄Π΅ΡΠΆΠΊΠ° ΠΆΠ΅Π»Π΅Π·Π° ΠΈ ΠΌΠΎΠ΄Π΅Π»Π΅ΠΉ, OpenAI-compatible ΡΠ΅ΡΠ²Π΅Ρ ΠΈΠ· ΠΊΠΎΡΠΎΠ±ΠΊΠΈ; ΡΠ°Π·ΡΠΌΠ½ΡΠΉ default. SGLang β ΠΏΠ΅ΡΠ΅ΠΈΡΠΏΠΎΠ»ΡΠ·ΠΎΠ²Π°Π½ΠΈΠ΅ ΠΎΠ±ΡΠΈΡ ΠΏΡΠ΅ΡΠΈΠΊΡΠΎΠ²: RadixAttention Ρ ΡΠ°Π½ΠΈΡ KV-cache Π² radix tree, Π·Π°ΠΏΡΠΎΡΡ Ρ ΠΎΠ±ΡΠΈΠΌ Π½Π°ΡΠ°Π»ΠΎΠΌ Π΄Π°ΡΡ hit Π°Π²ΡΠΎΠΌΠ°ΡΠΈΡΠ΅ΡΠΊΠΈ; Π²ΡΠΈΠ³ΡΡΠ²Π°Π΅Ρ Π½Π° RAG Ρ ΡΠΈΠΊΡΠΈΡΠΎΠ²Π°Π½Π½ΡΠΌ ΠΊΠΎΡΠΏΡΡΠΎΠΌ ΠΈ multi-turn Π°Π³Π΅Π½ΡΠ°Ρ . TensorRT-LLM β ΠΏΡΠ΅Π΄Π΅Π»ΡΠ½Π°Ρ ΡΠΊΠΎΡΠΎΡΡΡ Π½Π° ΠΊΠΎΠ½ΠΊΡΠ΅ΡΠ½ΠΎΠΌ ΠΆΠ΅Π»Π΅Π·Π΅ NVIDIA ΡΠ΅Π½ΠΎΠΉ ΡΠ»ΠΎΠΆΠ½ΠΎΠΉ ΡΠ±ΠΎΡΠΊΠΈ.