Skip to content
18 / 26

Как устроены MoE internals: routing networks, expert capacity, load balancing, training instabilities?

MoE-блок строится вокруг gating network: линейного слоя [d_model] → [num_experts], который для каждого токена выдаёт логиты экспертов. Top-k routing выбирает k экспертов с наибольшими scores (Mixtral k=2, DeepSeek-V3 k=8, Switch Transformer k=1). Expert capacity ограничивает сколько токенов попадает в одного эксперта за батч — иначе ломается batching. Load balancing реализуется через auxiliary loss, который штрафует router collapse. Главные training instabilities: router collapse, expert death, gradient sparsity — лечатся через auxiliary loss + noise + expert dropout.

Как устроены MoE internals: routing networks, expert capacity, load balancing, training instabilities? | JScriptiser