5 / 10
Какие есть способы data exfiltration через LLM outputs (markdown image trick, side-channels) и как защищаться?
Data exfiltration через LLM outputs происходит, когда атакующий после indirect prompt injection заставляет модель вставить в ответ markdown-картинку , HTML <img>/<a>, zero-width unicode или payload в порядке ключей JSON. Браузер сам делает fetch на attacker-домен и утекают данные из контекста. Защита: output filtering (срезать external image URLs), CSP headers (img-src, connect-src), structured schema validation, canary tokens, не класть реальные секреты в контекст.