Перейти к содержимому
4 / 20

Модели со смешанной архитектурой экспертов в проде: почему память не равна активным параметрам?

В такой архитектуре каждый токен проходит не через всю сеть, а через несколько выбранных маршрутизатором экспертов. Отсюда главное свойство: вычислений как у небольшой модели, а памяти — как у огромной. Модель с сотнями миллиардов параметров, из которых активны десятки миллиардов, считает быстро, но веса всех экспертов обязаны где-то лежать. Дальше начинается инженерия: эксперты распределяются по картам, между картами появляется обмен данными на каждом слое, а неравномерная популярность экспертов превращается в перекос нагрузки.

Модели со смешанной архитектурой экспертов в проде: почему память не равна активным параметрам? | JScriptiser