Перейти к содержимому
JS
JScriptiser
Система Онлайн
Патчи
Платформа
Квиз
FAQ
🇺🇸
en
Войти
В Лабораторию
Войти
База знаний
LLM System Design
Инфраструктура инференса
Инфраструктура инференса
Движки инференса, KV-кэш, LoRA, MoE, квантизация, эмбеддинги, выбор GPU и стоимость токена
Все
Легкие
Средние
Сложные
По умолчанию
По популярности
Сначала легкие
Сначала сложные
Развернуть
Свернуть
1
Сложный
7
Спекулятивное декодирование: как ускорить генерацию, ничего не потеряв в качестве?
2
Сложный
8
Префиксный кэш и переиспользование KV: как не платить дважды за один и тот же контекст?
3
Сложный
6
Мультиарендный LoRA-сервинг: как держать десятки дообученных моделей на одной видеокарте?
4
Сложный
6
Модели со смешанной архитектурой экспертов в проде: почему память не равна активным параметрам?
5
Сложный
7
Дообучение, поиск по документам или длинный контекст: как выбрать и посчитать выгоду?
6
Сложный
6
Как выбрать видеокарту под инференс и посчитать стоимость миллиона токенов?
7
Сложный
8
Провайдер обновил модель: как заметить регрессию и что подготовить заранее?
8
Средний
6
Спроектируйте сервис эмбеддингов: как выбрать модель, размерность и не упереться в стоимость индексации?
9
Сложный
6
Как сменить модель эмбеддингов в проде: миграция индекса без простоя поиска
10
Сложный
9
Квантизация моделей в проде: чем отличаются форматы и как понять, что качество не просело?
Назад
1
2
Вперёд
Инфраструктура инференса | JScriptiser