Перейти к содержимому
12 / 20

Мультимодальные модели в проде: чем инференс с картинками дороже текстового и что с этим делать?

Изображение превращается в сотни, а при высоком разрешении — в тысячи токенов, и все они попадают в фазу разбора промпта. Отсюда три следствия: время до первого токена растёт, стоимость запроса определяется картинкой, а не текстом, и память под KV-кэш расходуется быстрее. Управляют этим на входе: ограничение разрешения, обрезка до значимой области, кэширование результата по хешу изображения и отказ от подачи картинки там, где хватает подписи.