Skip to content
23 / 24

Категориальные данные и dtype-оптимизация: как срезать память DataFrame в 5–10 раз

Pandas по умолчанию хранит строки как object (Python-объекты — каждое значение тратит десятки байт), целые как int64, числа с плавающей как float64. Реальный выигрыш дают: category для повторяющихся строк (хранит коды + словарь — экономия 10–100x), int8/int16/int32 для целых из узкого диапазона, float32 для метрик. Используй df.info(memory_usage="deep") чтобы измерить, и pandas 2.0+ Arrow-backed dtypes для нового пайплайна.

Категориальные данные и dtype-оптимизация: как срезать память DataFrame в 5–10 раз | JScriptiser