19 / 20
Что такое scaling laws в deep learning, и в чём разница между Kaplan 2020 и Chinchilla 2022 для compute-optimal training?
Scaling laws — эмпирические зависимости качества (loss) от трёх переменных: N (параметры), D (training tokens), C (compute, FLOPs). Kaplan 2020 утверждал «больше параметров > больше данных», рекомендация N >> D. Chinchilla 2022 показала: при фиксированном compute оптимально скейлить N и D пропорционально — D/N ≈ 20. Compute считается как C ≈ 6·N·D. Современная Llama-3 — over-trained (D/N ≈ 1875) ради inference efficiency.