Skip to content
12 / 31

Какой serving-стСк Π²Ρ‹Π±Ρ€Π°Ρ‚ΡŒ: TorchServe, Triton, BentoML ΠΈΠ»ΠΈ FastAPI?

FastAPI β€” для ΠΏΡ€ΠΎΡ‚ΠΎΡ‚ΠΈΠΏΠ° ΠΈ ΠΌΠΎΠ΄Π΅Π»Π΅ΠΉ, Π³Π΄Π΅ Π·Π°Π΄Π΅Ρ€ΠΆΠΊΠ° Π½Π΅ ΠΊΡ€ΠΈΡ‚ΠΈΡ‡Π½Π° (sklearn / lightgbm). BentoML β€” ΠΊΠΎΠ³Π΄Π° Π½ΡƒΠΆΠ΅Π½ framework-agnostic packaging ΠΌΠΎΠ΄Π΅Π»Π΅ΠΉ Π² OCI-ΠΎΠ±Ρ€Π°Π· + auto-scaling ΠΈ Π±Π°Ρ‚Ρ‡ΠΈΠ½Π³. TorchServe β€” production-serving для PyTorch с динамичСским Π±Π°Ρ‚Ρ‡ΠΈΠ½Π³ΠΎΠΌ, model archive ΠΈ ΠΌΠ΅Ρ‚Ρ€ΠΈΠΊΠ°ΠΌΠΈ. Triton Inference Server β€” Ρ‚ΠΎΠΏΠΎΠ²Ρ‹ΠΉ Π²Ρ‹Π±ΠΎΡ€ для GPU/multi-framework: PyTorch, TF, ONNX, TensorRT Π² ΠΎΠ΄Π½ΠΎΠΌ сСрвСрС с concurrent execution ΠΈ dynamic batching. Π’Ρ‹Π±ΠΎΡ€ зависит ΠΎΡ‚ latency SLA, Ρ‚ΠΈΠΏΠ° ΠΌΠΎΠ΄Π΅Π»ΠΈ ΠΈ Ρ‚ΠΎΠ³ΠΎ, Π½ΡƒΠΆΠ΅Π½ Π»ΠΈ GPU-throughput.

Какой serving-стСк Π²Ρ‹Π±Ρ€Π°Ρ‚ΡŒ: TorchServe, Triton, BentoML ΠΈΠ»ΠΈ FastAPI? | JScriptiser