12 / 31
Чем раздавать модель в проде: TorchServe, Triton, BentoML или FastAPI?
FastAPI — для прототипа и моделей, где задержка не критична (sklearn / lightgbm). BentoML — когда нужно упаковать модель в контейнер независимо от фреймворка, с автомасштабированием и группировкой запросов в пачки. TorchServe — раздача PyTorch-моделей в проде с динамической пачечной обработкой, упаковкой модели и метриками. Triton Inference Server — лучший выбор для GPU и разных фреймворков сразу: PyTorch, TF, ONNX, TensorRT в одном сервере с параллельным исполнением. Выбор зависит от требований к задержке, типа модели и того, нужна ли пропускная способность GPU.