Skip to content
10 / 20

vLLM, SGLang ΠΈ TensorRT-LLM: Ρ‡Π΅ΠΌ inference engines ΠΎΡ‚Π»ΠΈΡ‡Π°ΡŽΡ‚ΡΡ ΠΈ ΠΊΠ°ΠΊ Π²Ρ‹Π±Ρ€Π°Ρ‚ΡŒ?

Π’Ρ€ΠΈ engine ΠΎΠΏΡ‚ΠΈΠΌΠΈΠ·ΠΈΡ€ΡƒΡŽΡ‚ Ρ€Π°Π·Π½ΠΎΠ΅. vLLM β€” ΡƒΠ½ΠΈΠ²Π΅Ρ€ΡΠ°Π»ΡŒΠ½ΠΎΡΡ‚ΡŒ ΠΈ GPU utilization: PagedAttention, ΡˆΠΈΡ€ΠΎΠΊΠ°Ρ ΠΏΠΎΠ΄Π΄Π΅Ρ€ΠΆΠΊΠ° ΠΆΠ΅Π»Π΅Π·Π° ΠΈ ΠΌΠΎΠ΄Π΅Π»Π΅ΠΉ, OpenAI-compatible сСрвСр ΠΈΠ· ΠΊΠΎΡ€ΠΎΠ±ΠΊΠΈ; Ρ€Π°Π·ΡƒΠΌΠ½Ρ‹ΠΉ default. SGLang β€” ΠΏΠ΅Ρ€Π΅ΠΈΡΠΏΠΎΠ»ΡŒΠ·ΠΎΠ²Π°Π½ΠΈΠ΅ ΠΎΠ±Ρ‰ΠΈΡ… прСфиксов: RadixAttention Ρ…Ρ€Π°Π½ΠΈΡ‚ KV-cache Π² radix tree, запросы с ΠΎΠ±Ρ‰ΠΈΠΌ Π½Π°Ρ‡Π°Π»ΠΎΠΌ Π΄Π°ΡŽΡ‚ hit автоматичСски; Π²Ρ‹ΠΈΠ³Ρ€Ρ‹Π²Π°Π΅Ρ‚ Π½Π° RAG с фиксированным корпусом ΠΈ multi-turn Π°Π³Π΅Π½Ρ‚Π°Ρ…. TensorRT-LLM β€” ΠΏΡ€Π΅Π΄Π΅Π»ΡŒΠ½Π°Ρ ΡΠΊΠΎΡ€ΠΎΡΡ‚ΡŒ Π½Π° ΠΊΠΎΠ½ΠΊΡ€Π΅Ρ‚Π½ΠΎΠΌ ΠΆΠ΅Π»Π΅Π·Π΅ NVIDIA Ρ†Π΅Π½ΠΎΠΉ слоТной сборки.

vLLM, SGLang ΠΈ TensorRT-LLM: Ρ‡Π΅ΠΌ inference engines ΠΎΡ‚Π»ΠΈΡ‡Π°ΡŽΡ‚ΡΡ ΠΈ ΠΊΠ°ΠΊ Π²Ρ‹Π±Ρ€Π°Ρ‚ΡŒ? | JScriptiser