Skip to content
18 / 23

Как защитить агента: sandboxing, permission scopes, prompt injection через результаты tools?

Главные угрозы — prompt injection через external content (результаты tools, веб-страницы), избыточные permissions (агент с правами админа), исполнение опасных tools без подтверждения. Защита строится слоями: sandboxing для exec-tools (Docker, gVisor, отдельный user, no-net), principle of least privilege для scopes API-токенов, human-in-the-loop confirmation на разрушительные действия, строгая обработка external content (не доверять, никогда не исполнять команды из tool output буквально).

Как защитить агента: sandboxing, permission scopes, prompt injection через результаты tools? | JScriptiser