17 / 26
В чём разница между Dense и MoE архитектурами LLM (Mixtral, DeepSeek-V3, Qwen3-MoE), и когда какую выбирать?
Dense модель (Llama-3.1-405B) активирует все параметры на каждом forward pass — простая, но дорогая по compute. MoE (Mixture-of-Experts, Mixtral 8x22B, DeepSeek-V3 671B, Qwen3-MoE-30B-A3B) разделяет FFN-слои на N экспертов и активирует только top-k (≈37B активных из 671B у DeepSeek-V3). Trade-off: MoE дешевле по compute и pretrain-cost, но требует VRAM на все эксперты сразу. Dense выигрывает на edge / on-device и при стабильной latency; MoE выигрывает в датацентровой serving с высокой нагрузкой.