提示注入防御
定义
提示注入防御指在 LLM 应用中,把可信指令与不可信数据隔离,并用权限、过滤、验证、监控和对抗评测降低模型被恶意文本操控的风险。攻击者可能直接要求模型忽略规则,也可能把指令藏在网页、邮件、文档、工单或检索结果里,诱导模型泄露系统提示、暴露敏感数据、错误调用工具或改变业务状态。成熟防线通常不是单一 prompt,而是一组产品、平台和安全控制。
为什么对 AI 求职重要
这个技能对 AI 求职重要,因为企业级 Copilot、RAG 和 Agent 都会连接内部知识库、外部网页、数据库、浏览器和真实业务工具。懂提示注入防御的工程师不仅会写 prompt,还能设计可信/不可信内容边界、最小权限、工具 allowlist、输出校验、敏感信息脱敏、攻击评测与日志监控,在产品上线前发现数据泄露、越权操作和供应链式间接注入风险。它直接对应 AI Security、LLM Platform、Applied AI 和 Enterprise AI 岗位的实际要求。
核心概念
- 直接提示注入:用户在输入里要求模型忽略系统规则、泄露秘密或执行未授权动作。
- 间接提示注入:恶意指令藏在网页、邮件、工单、文档或检索结果中,模型读取后被操控。
- 指令层级:系统、开发者、用户、工具和数据消息要分层处理,不能让不可信内容改写策略。
- 最小权限工具:Agent 只能拿到必要权限,高风险或不可逆操作需要 allowlist 与人工确认。
- 对抗评测:用 jailbreak、污染检索内容、提示泄露和工具滥用样例持续测试防线。
学习路径
- 先做一个小型 RAG 或 tool-calling demo,再在用户输入和检索文档中加入恶意指令,观察模型如何失败。
- 把可信 prompt 与不可信内容分离,对检索内容加引用边界,并为工具调用设置 allowlist、参数校验和确认步骤。
- 加入输入分类、输出校验、敏感信息脱敏与结构化日志,让攻击可被发现、复盘和追踪。
- 建立覆盖直接注入、间接注入、数据外泄、提示泄露和危险工具调用的 eval 集,并放入发布前 CI。