Перейти к содержимому
19 / 20

Что такое законы масштабирования в глубоком обучении и чем выводы Kaplan (2020) отличаются от Chinchilla (2022) при выборе размера модели под бюджет вычислений?

Scaling laws — эмпирические зависимости качества (loss) от трёх переменных: N (параметры), D (training tokens), C (compute, FLOPs). Kaplan 2020 утверждал «больше параметров > больше данных», рекомендация N >> D. Chinchilla 2022 показала: при фиксированном compute оптимально скейлить N и D пропорционально — D/N ≈ 20. Compute считается как C ≈ 6·N·D. Современная Llama-3 — over-trained (D/N ≈ 1875) ради inference efficiency.

Что такое законы масштабирования в глубоком обучении и чем выводы Kaplan (2020) отличаются от Chinchilla (2022) при выборе размера модели под бюджет вычислений? | JScriptiser