7 / 10
Как делать regression eval и shadow traffic для LLM в production: replay traces, A/B model rollout, статистическое сравнение?
Regression eval — перед каждым deploy (prompt change, model upgrade) прогоняй golden dataset 50–500 cases через новый prompt/model и сравнивай scores с baseline через t-test / Mann–Whitney (significance, не средние). Shadow traffic — 10% prod queries дублируются в staging model, ответ user'у не возвращается, только offline log + eval. CI gate: regression_score < baseline - margin → block merge. Combined: regression eval = controlled set; shadow traffic = real distribution.