Skip to content
10 / 25

Библиотека datasets от Hugging Face: как загружать датасеты и обрабатывать их потоково?

datasets — это библиотека-«pandas для ML-датасетов», построенная на Apache Arrow: ленивая, memory-mapped, с streaming-режимом для терабайтных корпусов, которые не помещаются в RAM. Один вызов load_dataset("imdb") — и у вас на руках уже разбитый на train/test, версионированный датасет с тэгами и метаданными.

Библиотека datasets от Hugging Face: как загружать датасеты и обрабатывать их потоково? | JScriptiser