17 / 31
Как вести версии наборов данных: DVC, Git LFS, lakeFS, MLflow — и почему одного git недостаточно?
Git хранит всю историю содержимого → большие бинарные файлы раздувают репозиторий и ломают clone. Для датасетов используем pointer-системы: DVC (.dvc-файлы + remote S3/GCS, pipeline-aware), Git LFS (простой, но дорогой и без pipeline), lakeFS (Git-семантика поверх object storage), MLflow datasets (metadata-only, hash + source). Reproducibility = код + параметры + запинённая версия данных в model registry.