LLM 应用护栏:安全、策略与运行时控制
定义
LLM 应用护栏指围绕语言模型应用建立的一组运行时控制:在请求进入模型前过滤注入、越权和敏感信息,在模型输出后检查安全策略、结构化格式、引用和业务规则,并对工具调用、检索上下文、人工复核、审计日志和失败降级做统一约束。它不是单个提示词,而是一套可测试、可观测、可持续迭代的工程机制。
为什么对 AI 求职重要
AI 公司重视这项技能,是因为大模型产品上线后的主要风险不只来自代码 bug,还来自提示注入、数据泄露、幻觉、越权工具调用和策略绕过。懂护栏的工程师能把产品规则、安全要求和合规要求落成可执行的校验、评测集、监控指标和事故流程,让 RAG、agent、客服、企业 Copilot 等应用从 demo 走向可上线系统。
核心概念
- 输入护栏:在用户消息、上传文件和检索上下文进入模型前,识别提示注入、越权请求、敏感数据和不支持的任务。
- 输出护栏:对生成结果做安全、格式、引用、毒性、隐私和业务规则校验,必要时拒答、重写、降级或转人工。
- 工具调用控制:限制 agent 可调用的函数,校验参数、权限和副作用,对高风险操作加入确认或人工审批。
- 策略即代码:把产品、安全、法务和合规规则写成版本化检查,在 CI 和线上监控中持续验证。
- 评测与遥测:跟踪误杀、漏拦、延迟、绕过样本和用户影响,避免护栏随着模型或提示词变化而失效。
- 纵深防御:同时使用模型安全能力、应用层校验、检索过滤、沙箱工具、速率限制、审计日志和应急流程。
学习路径
- 先做一个小型 RAG 或 agent demo,列出提示注入、隐私泄露、结构化输出失败、越权工具调用等滥用场景。
- 用 JSON Schema 或 Pydantic 加入结构化输出校验,并记录拒绝、修复、重试和降级的触发原因。
- 试用 NVIDIA NeMo Guardrails 或 Guardrails AI,再与手写 validator 比较延迟、可维护性和覆盖范围。
- 阅读 OWASP LLM 风险和云厂商 guardrails 文档,把每类风险映射成控制点、测试用例、负责人和指标。
- 建立包含正常样本和攻击样本的评测集,在 CI 中运行,并跟踪模型、提示词或工具变更后的误杀率与漏拦率。