Перейти к содержимому
9 / 10

Почему выборку для рекомендаций нельзя делить случайно и как делить правильно?

Случайное разбиение отправляет в обучение события из будущего и даёт утечку: модель узнаёт, что фильм станет хитом, и «предсказывает» это на тестовых событиях, которые случились раньше. Онлайн такой информации нет никогда. Правильный способ — разбиение по времени: обучаемся на всём до момента T, проверяемся на интервале после него. Для оценки персонализации используют вариант «оставить последнее»: последнее взаимодействие каждого пользователя уходит в тест. Плюс обязательна временная пауза между обучением и тестом, равная задержке выкатки модели в прод.

Почему выборку для рекомендаций нельзя делить случайно и как делить правильно? | JScriptiser