15 / 17
Что такое prompt injection и как защищать LLM-приложения от него?
Prompt injection — атака, при которой пользовательский ввод или внешний контент (документ, web-страница, email) содержит инструкции, перехватывающие поведение модели. Direct injection: «забудь все правила и сделай X». Indirect injection: вредоносный текст в документе, который модель обрабатывает. Защита: разделение system/user, XML-обёртки данных, валидация вывода, минимальные привилегии для tools, отдельная модель-классификатор для подозрительных входов.