Перейти к содержимому
31 / 31

Как разбирать инциденты с ИИ: классификация (безопасность, вред пользователю, надёжность), шаблон разбора, оценка серьёзности и реальные случаи (Air Canada, утечка истории ChatGPT, Sydney, Galactica)?

Инциденты с ИИ делятся на 5 классов: безопасность (инъекции в промпт — OWASP LLM01, утечка данных), вредоносность (опасный вывод, обход защиты), надёжность (выдумка, приведшая к вреду, отказ сервиса), приватность (персональные данные в ответах, дословное воспроизведение обучающих данных), предвзятость (дискриминирующий вывод). Severity по схеме SEV-0/1/2/3 (Google/Stripe-style): SEV-0 = exec involvement, public harm. Postmortem template (Etsy/Google blameless): summary → impact → timeline UTC → root cause (5-whys) → contributing factors → what went well → action items с owner+ETA → lessons. Особенность именно ИИ: политики ответственного масштабирования (Anthropic RSP, OpenAI Preparedness Framework, DeepMind Frontier Safety) задают пороги риска ещё до выпуска модели, а не только разбирают уже случившееся.

Как разбирать инциденты с ИИ: классификация (безопасность, вред пользователю, надёжность), шаблон разбора, оценка серьёзности и реальные случаи (Air Canada, утечка истории ChatGPT, Sydney, Galactica)? | JScriptiser