Перейти к содержимому
7 / 10

Как ловить ухудшение качества и обкатывать модель на теневом трафике: проигрывание записанных запросов, постепенная раскатка и статистическое сравнение?

Regression eval — перед каждым deploy (prompt change, model upgrade) прогоняй golden dataset 50–500 cases через новый prompt/model и сравнивай scores с baseline через t-test / Mann–Whitney (significance, не средние). Shadow traffic — 10% prod queries дублируются в staging model, ответ user'у не возвращается, только offline log + eval. CI gate: regression_score < baseline - margin → block merge. Combined: regression eval = controlled set; shadow traffic = real distribution.

Как ловить ухудшение качества и обкатывать модель на теневом трафике: проигрывание записанных запросов, постепенная раскатка и статистическое сравнение? | JScriptiser