4 / 20
Batch, online или streaming inference: как выбрать режим и какой trade-off у каждого?
Выбор определяется одним вопросом: насколько свежим должен быть prediction в момент использования. Допустимо вчерашнее → batch: дёшево, просто, легко rerun. Зависит от действия секундной давности → online: дорого, нужен latency budget и fault tolerance. Streaming — середина: считаем непрерывно по событиям, кладём в store, читатель забирает готовое.