9 / 10
Что такое data poisoning и eval poisoning для LLM, как обнаруживать и защищаться?
Data poisoning — отравление training corpus / fine-tune датасетов / RAG-базы триггерными примерами, после чего модель ведёт себя злонамеренно на конкретный input. Eval poisoning — порча held-out наборов: contamination training-данными даёт ложно высокие баллы, а tampering eval'ов скрывает регрессии. Защита: data lineage (hash каждого образца, dataset card, license), trusted sources only, clustering / outlier detection на новых батчах, n-gram overlap check между train и eval, signed eval sets с hash-pin в CI, periodic re-train на verified clean snapshot и behavioral monitoring в production.