
DeepSeek + RAG 企业知识库搭建:文档解析、向量检索与权限控制
DeepSeek + RAG 企业知识库的正确拆分是:DeepSeek 负责带约束的生成与摘要,RAG 管道负责解析、检索、权限与引用。适合内部制度/Wiki 问答、销售话术库、售后政策查询等「必须可溯源」场景。GeonAI 可在合规前提下将 DeepSeek(或其它模型)接入定制知识库 Agent;能力参考见 /agents/knowledge-base-manager 与 /agents(363+ 预设非公众全量试用)。评估请邮件 [email protected],主题「企业定制 Agent 咨询」。通用 RAG 架构见 /blog/enterprise-rag-knowledge-base-agent;DeepSeek 场景总览见 /blog/deepseek-enterprise-use-cases。
为什么是 DeepSeek + RAG,而不是「只换模型」?
| 做法 | 结果 | 企业风险 |
|---|---|---|
| 只把 ChatGPT 换成 DeepSeek | 单价可能下降 | 无检索/权限时幻觉与越权依旧 |
| 只上向量库、无生成约束 | 召回看起来热闹 | 回答不可审计、难质检 |
| DeepSeek 生成 + RAG 护栏 | 成本可控 + 可溯源 | 需投入 ingest 与治理,但可上生产 |
DeepSeek 的常见价值是在强引用约束下降低问答单价,让「全员可问」在预算上可行;它不能替代文档解析质量与检索前权限过滤。多模型如何配见 /blog/multi-model-selection-guide。
文档解析:先能「读对」,再谈向量
- 源格式:Wiki/Markdown/飞书导出优先;PDF 做结构化解析;扫描件 OCR + 人工抽检关键页
- 表格与图片:表格单独切片或转摘要行;截图中的政策数字禁止盲信 OCR
- 版本元数据:文档 ID、owner、生效/失效日期、密级、语言——写入 chunk metadata
- 增量同步:变更 webhook 或定时差分;避免每次全量重建拖垮索引
- 金标样本:试点前准备 20–50 份核心文档 + 20 条标准问答(含「应拒答」题)
切片与索引:噪声比模型更伤体验
- 切片按标题层级切,常见 300–800 token;过大引入无关段,过小丢上下文
- 专有名词、错误码、SKU 保留关键词字段,便于 向量 + BM25 混合检索
- embedding 模型与 DeepSeek 生成模型可分离选型;检索差时先调 hybrid/重排,再换生成模型
- 过期文档标记下架,禁止继续进入 Top-K
向量检索与重排序:DeepSeek 放在哪一步?
| 步骤 | 推荐做法 | DeepSeek 角色 |
|---|---|---|
| Retrieve | Top-K 混合检索 + 权限过滤 | 一般不参与 |
| Rerank | cross-encoder 或轻量重排 | 可选(注意延迟与成本) |
| Generate | 仅基于命中片段回答 + 强制引用 | 主战场:中文摘要与答疑草稿 |
| Refuse | 无命中/低置信 → 拒答或转人工 | 提示词硬约束,禁止编造 |
生产提示词应写明:无片段则拒答;引用格式含文档名/章节/更新日期;禁止输出未出现的赔付、价格、法条。责任极高场景可把生成路由到更保守模型,DeepSeek 仍可用于分类与草稿——网关层多模型路由即可。
权限控制:检索前过滤,而不是「生成后再求别说」
- SSO/AD 组 → 可见 collection 或密级标签(public / internal / confidential)
- 检索查询带用户身份上下文;越权测试用例上线前 100% 拦截
- 审计日志:用户、命中文档版本、是否拒答、是否转人工
- 日志与提示词中最小化 PII;密钥与连接串永不进 Prompt
部署形态:API、专有云与私有化怎么选?
知识库向量与原文常需驻留在企业可控环境;DeepSeek 推理可走官方 API、专有云或私有化——以合规签字为准,不可默认「中文模型=数据不出境」。私有化成本与运维见 /blog/deepseek-private-deployment-guide。混合架构常见做法:私有检索 + 受控外呼生成,或内网推理 + 私有索引。
6–10 周试点验收清单
- 单部门 + 一类文档(如 IT FAQ 或 HR 制度公开层)
- ingest → 混合检索 → DeepSeek 带引用生成 → 拒答策略跑通
- 指标:准确率、引用率、拒答正确率、P95 延迟、越权 0 容忍
- 模型网关:超时、重试、备用模型;周度错误案例复盘
- 通过后再扩分区与对外客服通道(客服大脑层见客服 Agent 文)
GeonAI 交付与准备材料
准备:文档源与更新机制、密级与 SSO 说明、20 条金标问答、不可回答清单、延迟/成本预算、部署偏好(API/专有云/私有化)。交付对齐 4 步法;报价因素见 /blog/custom-ai-agent-pricing-factors。联系 [email protected]、服务方案 或 Live chat。选型避坑见 /blog/ai-agent-selection-checklist。
常见问题
只用 DeepSeek、不上 RAG 可以做企业知识库吗?
不建议作为生产方案。无检索与权限时,模型会用参数记忆「猜」制度内容,无法稳定溯源与越权防护。DeepSeek 适合作为 RAG 之后的生成层。
向量模型必须和 DeepSeek 同一家吗?
不必。embedding、重排与生成可分开选型。企业更常见的是:检索栈稳定 + 生成层按成本与中文表现切换(含 DeepSeek)。
飞书/Confluence 还要搬迁到新知识库吗?
通常以现有 Wiki 为编辑源,通过导出或 API 进入 ingest;向量索引是检索层,避免双写两套正文。
DeepSeek API 是否等于数据不出域?
不等于。需核对日志留存、训练使用条款与部署形态。强驻留需求评估专有云或私有化,并在合同与架构上落笔。
363+ 预设能直接接我们的私有文档吗?
不能。预设展示能力类型;生产需定制解析、权限与模型网关。请邮件 [email protected] 评估。