Перейти к содержимому
37 / 39

Что такое дубли и загрязнение в наборах данных: как искать почти одинаковые примеры и почему в бенчмарки LLM массово просачиваются ответы?

Дубли — повторы примеров (точные, почти одинаковые, близкие по смыслу). Загрязнение (contamination) — частный случай: примеры из теста просочились в обучение, и метрики теряют смысл. Для exact-дублей хватает SHA256, для near-дублей — MinHash + LSH (O(n)) или embedding cosine (точнее, но дороже). Особо болезненный случай — загрязнение бенчмарков LLM: MMLU/GSM8K/HumanEval лежат в веб-корпусах, модели их запоминают, отсюда завышенные числа в статьях. Стандартная защита — проверка совпадающих фрагментов текста (Llama 3 сверяет цепочки по 13 слов).

Что такое дубли и загрязнение в наборах данных: как искать почти одинаковые примеры и почему в бенчмарки LLM массово просачиваются ответы? | JScriptiser