Перейти к содержимому
17 / 26

Чем плотная (dense) архитектура LLM отличается от смеси экспертов (MoE) — Mixtral, DeepSeek-V3, Qwen3-MoE — и когда какую выбирать?

Плотная (dense) модель (Llama-3.1-405B) на каждый проход задействует все параметры — просто, но дорого по вычислениям. Смесь экспертов (MoE, Mixture-of-Experts, Mixtral 8x22B, DeepSeek-V3 671B, Qwen3-MoE-30B-A3B) делит полносвязные слои на N экспертов и включает только несколько лучших (top-k): у DeepSeek-V3 активны ≈37 млрд параметров из 671 млрд. Размен: смесь экспертов дешевле по вычислениям и предобучению, но требует держать в видеопамяти всех экспертов сразу. Плотная модель выигрывает на устройствах и там, где важна стабильная задержка; смесь экспертов — в дата-центрах под высокой нагрузкой.

Чем плотная (dense) архитектура LLM отличается от смеси экспертов (MoE) — Mixtral, DeepSeek-V3, Qwen3-MoE — и когда какую выбирать? | JScriptiser