Батч-инференс: когда офлайн дешевле онлайна и как его организовать
Не всякая AI-задача требует ответа в реальном времени: классификация обращений, разметка каталога, генерация описаний, пересчёт эмбеддингов после смены модели — всё это можно считать пачками. Выигрыш огромен: при батч-обработке карта загружается почти полностью, тогда как интерактивный трафик оставляет её простаивать между запросами, поэтому цена за миллион токенов отличается в разы. Организуют это как обычный конвейер данных: очередь заданий с идемпотентными единицами работы, батчи размером под память карты, контрольные точки прогресса, чтобы прерывание не заставляло начинать заново, и спотовые карты, потому что задержка не критична. Отдельные требования: результат должен быть воспроизводимым (фиксируйте версию модели и параметры в записи результата), а конвейер — дозируемым, чтобы не выесть всю ёмкость кластера и не помешать интерактивным сервисам, у которых приоритет выше.