37 / 39
Что такое дублирование и contamination в датасетах: как искать near-duplicates и почему LLM-бенчмарки массово contaminated?
Duplication — повтор примеров (exact / near / semantic). Contamination — частный случай: test-примеры утекли в train, метрики бессмысленны. Для exact-дублей хватает SHA256, для near-дублей — MinHash + LSH (O(n)) или embedding cosine (точнее, но дороже). Особо больной случай — LLM benchmark contamination: MMLU/GSM8K/HumanEval лежат в web-corpora, модели их запоминают, отсюда завышенные числа в paper'ах. Стандартная защита — n-gram overlap check (Llama 3 использует 13-grams).