Skip to content
15 / 17

Что такое prompt injection и как защищать LLM-приложения от него?

Prompt injection — атака, при которой пользовательский ввод или внешний контент (документ, web-страница, email) содержит инструкции, перехватывающие поведение модели. Direct injection: «забудь все правила и сделай X». Indirect injection: вредоносный текст в документе, который модель обрабатывает. Защита: разделение system/user, XML-обёртки данных, валидация вывода, минимальные привилегии для tools, отдельная модель-классификатор для подозрительных входов.

Что такое prompt injection и как защищать LLM-приложения от него? | JScriptiser