
RAG 还是微调?企业知识库 Agent 的技术路线选择(2026 版)
企业知识库 Agent 的核心矛盾是:答案要跟得上制度版本,又要说得像「懂行的人」。RAG(检索增强生成)把「事实」放在可更新的文档与权限库里,生成时再引用;微调(Fine-tuning)把「行为与文风」写进模型权重,适合稳定语气与格式,不适合承载天天改的费率表。2026 年多数中大型企业试点应 默认 RAG;仅在风格/槽位抽取等窄目标上考虑轻量微调或偏好对齐。GeonAI 按场景选型,不绑定单一路线;/agents 仅为能力参考(363+ 预设非公众全量试用)。评估请邮件 [email protected]。知识库设计见 /blog/enterprise-rag-knowledge-base-agent;DeepSeek + RAG 清单见 /blog/deepseek-rag-knowledge-base。
一句话对照:事实走 RAG,习惯走微调
| 问题 | 更偏 RAG | 更偏微调 / 偏好训练 |
|---|---|---|
| 知识会不会每月改? | 会(制度、价目、SOP) | 几乎不变(品牌语气、固定模板) |
| 要不要可追溯引用? | 要(审计、客服质检) | 通常不靠文档段落引用 |
| 不同角色看到不同内容? | 要(ACL / 标签过滤) | 权重里很难做细粒度权限 |
| 主要痛点是什么? | 答错事实、旧版文档 | 格式乱、不会填槽、口语不像客服 |
把「公司全部 PDF」拿去微调,指望模型记住条款——是 2024–2025 年最贵的常见误判:权重更新慢、无法按人授权、幻觉仍在,且一改制度就要重训。
RAG 何时是默认正解
- 答案必须带来源:文档名、版本号、章节(客服、合规、运维手册)
- 知识更新频率 ≥ 每月,或由业务方自助上传
- 需要按部门/职级/外包过滤可见片段
- 要与工具调用并存:先检索政策,再查 ERP/CRM(见 /blog/agent-function-call-mcp-integration)
RAG 的工程重点在解析、切块、混合检索、权限与「缺证据拒答」,不是选一个更炫的向量库品牌。多模型怎么配见 /blog/multi-model-selection-guide。
微调何时值得立项
- 稳定文风与话术骨架:同一品牌语气、固定开场/结束、多语言一致性
- 结构化抽取:从非结构化工单里抽字段,格式错误率是主 KPI
- 领域术语纠错:专有名词、型号写法,且不依赖「当月新条款」
- 数据合规允许:训练集会审、可删除、可审计;有持续评测集
微调不替代知识库:训完的模型仍可能一本正经编造过期费率。生产上常见是 底座模型(可含轻量微调)+ RAG 事实层。
三条混合路线(按成熟度)
| 路线 | 做法 | 适合 |
|---|---|---|
| A 纯 RAG | 通用/企业 API 模型 + 检索网关 + 引用与拒答 | 绝大多数知识库试点;最快可验收 |
| B RAG + 提示/少量样本 | 系统提示固化角色;少量 few-shot 定格式 | 要统一输出模板但暂不训练 |
| C RAG + 窄域微调 | 对「格式/语气/抽取头」微调;事实仍检索 | 样本 ≥ 数千条且评测集稳定;有 MLOps |
从 A→B 几乎零训练成本;上 C 前先证明:缺引用率、旧版命中率、越权率已达标,否则微调只会「更流利地答错」。
成本与运维对照(立项写进预算)
| 项 | RAG | 微调 |
|---|---|---|
| 首期工期 | 解析/权限/评测集,通常数周 | 数据清洗+训练+回归,常按月计 |
| 变更成本 | 改文档即可(有发布流) | 重训或增量训;要冻结与回滚 |
| 推理成本 | 检索 + 生成(可缓存) | 可能更小模型,但需托管与评测开销 |
| 合规审计 | 引用与 ACL 日志易举证 | 训练集与权重版本也要进审计 |
反模式(看到就停)
- 用微调「记住」价目表、合同条款、库存规则
- 没有拒答与引用,却宣称「已上知识库 Agent」
- 训练集混入未脱敏客户对话,又无法删除
- RAG 与微调两套口径并行,无人负责单一真相源
- 把官网 363+ 预设页当成已接好你们私有知识库
立项决策表(可贴进 SOW)
- 列出 Top 意图:哪些靠文档事实、哪些靠文风/格式
- 事实类一律进 RAG:定义解析、权限、引用、拒答、更新 SLA
- 仅当格式/语气 KPI 卡住,再开「窄域微调」子项与评测集
- 禁止用微调承载 ACL 差异与实时状态(实时走工具调用)
- 验收先看缺引用率、旧版命中、越权;再谈文风主观分
- 灰度一个知识域;达标后再扩库或谈微调
找 GeonAI 时怎么描述
说明:文档类型与更新频率、是否必须引用、权限模型、更痛的是「答错事实」还是「不像客服」。邮件 [email protected]、服务方案 或 Live chat。我们默认帮你把 RAG 做可验收,再决定要不要窄域训练。
常见问题
是不是微调一定比 RAG 更准?
不一定。事实类问题准度取决于检索与权限;微调提升的是格式与语气。事实过期时,微调模型可能更自信地答错。
已经上了 RAG,还要微调吗?
多数项目不必。先把引用率、拒答、更新流程做稳。只有格式错误率或品牌语气成为明确 KPI,再开窄域微调。
DeepSeek 适合走哪条?
DeepSeek 可作为 RAG 生成模型或私有化推理底座;知识仍建议外置。私有化讨论见 /blog/deepseek-private-deployment-guide。
微调数据从哪里来?
脱敏后的优质人工答复、标注抽取对、合规审核过的话术。禁止直接灌未脱敏生产日志;要有删除与版本机制。
RAG 幻觉是不是就没有了?
没有。检索失败或切块错误仍会幻觉。必须用「无证据拒答/转人工」与引用抽检压风险。
和 Function Call / MCP 什么关系?
RAG 解决文档事实;工具调用解决实时状态与写操作。两者常并存,不要用微调去「记住」库存或订单。