Skip to content
4 / 12

Хранение датасетов и весов моделей: где держать и как не ждать загрузку часами

Данные для обучения и веса моделей имеют разный профиль доступа, и хранить их одинаково — ошибка. Датасеты читаются многократно и последовательно: источником истины служит объектное хранилище с версионированием, а для обучения данные приводят к формату, пригодному для потокового чтения (шардированные архивы, Parquet), чтобы не делать миллион мелких запросов на каждый файл. Веса — это единицы файлов на десятки гигабайт, которые нужны быстро и одинаковы для всех реплик: их кэшируют на узлах, чтобы новый под инференса не тянул сто гигабайт по сети при каждом запуске. Три практических приёма: предзагрузка на узел (DaemonSet или init-контейнер с общим томом), общий том только для чтения между репликами, упаковка весов в образ для небольших моделей — тогда работает обычный кэш образов. Отдельно нужны версионирование и неизменяемость: имя каталога с весами должно содержать версию, а «latest» в проде — источник неповторяемых инцидентов.