Как следить за соблюдением правил в LLM-продукте: конвейер модерации контента, уровни серьёзности нарушений, как модель отказывает и что делать при эскалации?
Соблюдение правил = защита в несколько слоёв: фильтр на входе → модель → фильтр на выходе, ни одному слою не доверяем в одиночку. Инструменты: Llama Guard 3 / OpenAI Moderation / AWS Bedrock Guardrails + Microsoft Presidio для персональных данных. Severity tiers: P0 (child safety, self-harm, imminent violence — 15 min response) → P1 (hate, drugs, weapons — 1 hr) → P2 (controversial — 24 hr) → P3 (edge cases — weekly). Виды отказа: жёсткий отказ (незаконное), мягкий отказ с альтернативой, уточняющий вопрос, частичное выполнение. План действий: обнаружить → оценить → уведомить → эскалировать (безопасность / юристы / PR / кризисная линия) → устранить → разобрать инцидент (для P0/P1 обязательно). Без structured escalation продукт получает Character.AI-уровень incident.