AI 知识库安全:RAG 客服机器人上线前检查清单
基于 OWASP RAG 安全指南,说明知识库投毒、权限泄露、来源追踪和工具调用风险,并给出客服机器人上线前检查方法。
把产品手册、售后规则和常见问题放进 AI 知识库,能让客服机器人回答得更贴近业务。但“答案来自企业文档”并不等于答案天然安全:错误文档、过期权限、隐藏指令或跨客户检索,都可能让机器人给出不应出现的内容。
OWASP RAG Security Cheat Sheet 将检索增强生成(RAG)的风险拆分到文档导入、向量化、检索、生成、输出和工具调用等环节。它的核心提醒是:RAG 可以减少缺少业务资料时的猜测,却会把风险重新分布到整条数据链路。
下面的检查清单面向准备部署知识库客服的运营者、产品负责人和技术团队。它既可以用于上线前验收,也可以转化为向供应商确认的问题。
1. 只允许可追踪的资料进入知识库
知识库首先是一个内容供应链。共享文件夹、网盘、工单附件或第三方同步源一旦被篡改,恶意内容就可能在之后被检索并影响回答。
至少应记录:
- 谁上传或同步了文档。
- 文档来自哪个系统,何时进入知识库。
- 谁批准它用于客服回答。
- 当前版本、校验值和最近更新时间。
- 哪些旧版本已经撤回或失效。
OWASP 建议在导入时为文档计算哈希,并扫描隐藏指令、不可见 Unicode 字符和零宽字符。文件扩展名或 MIME 类型只能描述格式,不能证明内容可信。
2. 把检索资料当作数据,而不是命令
文档可能包含“忽略此前规则”之类的文字。即使这些文字来自 PDF、网页或内部文档,它们仍然是待引用的数据,不应改变机器人的系统规则。
技术实现中应给检索内容设置清楚的边界,限制一次进入上下文的片段数量和总长度,并在送入模型前检查常见的提示词注入模式。OWASP 的提示词注入防护指南 也强调,应把系统指令与外部内容明确分离,而不是依赖模型自行判断哪段文字可信。
对运营人员而言,实际动作是避免未经审核地批量导入网页抓取结果、用户附件或来源不明的共享文档。
3. 权限必须跟随每一个知识片段
一份文档被拆成多个检索片段后,原有权限不能丢失。OWASP 建议把所有者、角色、租户和分类等级等访问控制信息附在每个片段上,并在每次检索时重新检查权限。
这对客户支持尤其重要。例如,A 客户的订单政策、内部处理记录或专属报价,不应因为语义相似而出现在 B 客户的回答里。权限校验必须在内容进入模型之前完成,不能依靠模型“自觉”隐藏信息。
上线前应测试:
- 不同客户、群组或团队能否检索到彼此的内容。
- 文档权限改变后,旧片段是否立即失去可检索性。
- 删除源文档后,向量片段、缓存回答和派生索引是否同步删除。
4. 每个重要答案都要能回到来源
客服答案如果没有来源,就很难判断它是来自正式政策、旧版说明,还是模型补全。对退款、价格、账号权限和服务范围等高影响问题,应保留文档名称、版本、更新时间和相关片段的追踪信息。
来源展示不必让普通用户看到所有内部元数据,但管理员至少要能够回答:“这条回复用了哪份资料?”如果来源互相冲突、已经过期或无法访问,机器人应说明不确定性,并引导人工确认。
5. 检索失败时不要悄悄变成普通聊天
知识库暂时不可用、权限检查失败或没有找到合格资料时,最危险的做法之一是静默退回模型常识回答。用户看到的语气可能完全相同,却不知道回答已经失去企业资料约束。
更稳妥的行为是明确说明未找到可核验资料,缩小回答范围,或转交人工处理。安全系统需要“失败可见”;不能把安全控制失效伪装成正常回答。
6. 高风险操作必须独立授权
客服机器人可能逐步连接订单、退款、账号或消息发送工具。检索到的内容不能直接决定是否执行这些操作。
OWASP 建议为工具设置独立权限和允许列表,并对付款、删除数据、外部 API 调用等高风险动作要求用户明确确认。模型提出调用工具,不等于当前用户已经获得授权。一次完整记录应能追踪用户问题、检索资料、生成结果和最终工具调用。
7. 用真实攻击场景做验收
普通问答测试只能证明机器人“会回答”,无法证明知识库边界有效。上线前至少增加这些反向测试:
- 上传含隐藏提示词或零宽字符的测试文档,确认它会被拦截或标记。
- 用无权限账号询问受限文档中的独特内容,确认不会泄露。
- 删除或撤销一份资料,再验证旧片段和缓存不会继续出现。
- 模拟知识库超时或检索失败,确认机器人不会无提示地自由回答。
- 让恶意文档诱导机器人退款、删除或调用外部服务,确认操作仍需独立授权和人工确认。
测试结果应记录输入、命中的资料、实际回答和是否触发工具,以便版本更新后重新回归。
采购或配置知识库机器人时该问什么
如果使用的是托管产品,可以把上面的技术要求转化为更直接的问题:
- 文档由谁导入,是否支持审批、版本和来源记录?
- 群组、团队和客户之间如何隔离知识?
- 文档删除或权限变化后,索引和缓存多久同步?
- 回答能否查看依据,检索失败时用户会看到什么?
- 机器人能调用哪些工具,敏感操作是否必须再次确认?
- 是否保留检索和操作日志,发生问题后能否追踪?
这些问题同样适用于 Telegram 知识库客服。YourCopilot 的定位是依据配置的知识内容服务私聊、群聊和 Telegram Business 消息;本文提供的是通用的选型与安全验收框架,不表示该产品当前已经实现 OWASP 清单中的每一项控制。具体能力应以产品页面、管理界面、隐私说明和最新发布记录为准。
资料来源
- OWASP Cheat Sheet Series,Retrieval-Augmented Generation (RAG) Security Cheat Sheet。页面未标注固定发布日期;2026 年 9 月 24 日查阅。
- OWASP Cheat Sheet Series,LLM Prompt Injection Prevention Cheat Sheet。页面未标注固定发布日期;2026 年 9 月 24 日查阅。