Что такое отравление обучающих и проверочных данных (data и eval poisoning), как это обнаружить и чем защищаться?
Отравление данных (data poisoning) — в обучающий корпус, набор для дообучения или базу RAG подкладывают специально составленные примеры со скрытым сигналом-триггером, и после обучения модель ведёт себя вредоносно, но только на определённый вход. Отравление проверочных наборов (eval poisoning) — порча отложенной выборки: если в неё просочились обучающие данные, оценки будут завышены, а прямая подмена набора прячет ухудшения качества. Защита: происхождение данных — хеш каждого образца, карточка набора, лицензия; брать только доверенные источники; искать выбросы и подозрительные кластеры в новых порциях данных; проверять пересечение обучающей и проверочной выборок по совпадающим фрагментам текста; подписанные проверочные наборы с фиксированным хешем в CI; регулярное переобучение на заведомо чистом срезе и наблюдение за поведением модели в проде.