Перейти к содержимому
6 / 10

Как оценивать качество прямо в проде: модель-судья на выборке реальных запросов плюс оповещения?

Оценка на живом трафике (online eval) — это постоянный замер качества прямо в проде с помощью модели-судьи. В отличие от оценки на отложенном наборе перед релизом, здесь работаем на реальных запросах, где эталонного ответа нет. Схема: берём 1–5% трасс из прода (100% для критичных сценариев: платежи, право, медицина) → модель-судья (дешёвая вроде GPT-5.4 nano или Claude Haiku 4.5, для высоких ставок — Claude Opus 4.8 или GPT-5.6) → оценка по строгой схеме (Pydantic / Zod: верность 0–1, полезность 0–1, безопасность да/нет) → отправка в Langfuse Score API / LangSmith → оповещение по временному ряду (медиана верности просела больше чем на 10% за неделю → будим дежурного). Осторожно: судья — не эталон истины. Обязательна выборочная ручная проверка 100–200 трасс в неделю, и меняйте модель-судью время от времени, чтобы её собственные искажения не накапливались.

Как оценивать качество прямо в проде: модель-судья на выборке реальных запросов плюс оповещения? | JScriptiser