方向 2 · RAG 知识库 (Retrieval-Augmented Generation)¶
RAG 的价值不在向量库, 在引用可信 + 版本可溯 + 检索可评. 3 个代表案例 + 交付关键动作.
核心能力¶
- Embedding: bge-large · bge-m3 · text-embedding-3 · 微调
- 重排: BGE-reranker · Cohere Rerank · Cross-Encoder · MMR
- 向量库: Milvus · Qdrant · Chroma · pgvector · Elasticsearch KNN
- 文档处理: OCR · 版式解析 · 表格抽取 · 章节切片 · 版本感知
- 评估: Ragas · TruLens · 人工标注 · 幻觉率 · 引用准确率
3 个代表案例¶
Case 01 · 律所案例 + 合同 + 法规 三库合一 RAG¶
- 业务问题: 律师条款检索平均 45 分钟, 版本混乱, 引用错误影响出具
- 技术栈: bge-large embedding · BGE-reranker · 三库分层检索 · 条款级引用溯源 · 版本感知路由
- 数据边界: 客户合同独立租户 · 只读授权链
- 硬指标: 律师条款检索 P50 45min → 3min · 引用准确率 >95% · 律师主动使用率 >70%
- 我的角色: RAG 架构 · 三库分层策略 · embedding 微调 · 律师联调
Case 02 · 电网设备说明 + 事故案例 + SOP 现场语音查询 RAG¶
- 业务问题: 高噪声变电站现场检修, 翻手册效率低, 事故经验散落
- 技术栈: 语音入口 (whisper-large) + 三源 RAG (手册 + 事故 + SOP) + 移动端 App
- 数据边界: 现场设备离线可查 · 事故案例内部授权
- 硬指标: 检修单据填报 -55% · 现场平均查询时间 10 min → 30s · 新入职学习曲线 -40%
- 我的角色: 语音管线 · 三源融合 · 现场部署
Case 03 · 药械厂客服知识库 (售后工单降 40%)¶
- 业务问题: 客服中心一线响应慢, 三线专家淹没
- 技术栈: bge-large + BGE-reranker · 版本化产品文档 · 工单反馈闭环重训
- 数据边界: 售后数据独立库
- 硬指标: 一线工单响应 -40% · 三线专家介入率 -68% · CSAT +12%
- 我的角色: RAG 架构 · embedding 微调 · 文档版本策略
交付关键动作¶
- 文档处理是重头: OCR · 表格抽取 · 章节切片 · 版本感知, 60% 工程量在这里
- embedding 不要一上来就上大模型: 先 bge-large, 效果不够再微调
- 重排必须要: 单纯 embedding top-k 幻觉率高 50-80%; 加 rerank 降到 5-10%
- 引用可溯: 每个 chunk 记录源文档 + 章节 + 版本 + 时间戳, 输出必带引用
- 持续评估: 建 100-500 条评估集, 每次索引更新回归一次
常见错配¶
- ❌ 直接把 PDF 塞 embedding, 没 OCR/表格抽取, 索引质量极差
- ❌ 用 GPT 只做 QA 不做 rerank, 幻觉严重
- ❌ 不做版本感知, 法规更新后老版本还在检索
- ❌ 上了 Milvus 但查询 500ms+, 未做 ANN 参数调优
相关阅读¶
- RAG vs 微调 (buyer question) — 相关问答
- 完整 20 案例清单 · PDF
- 相关方向: 私有 LLM 部署 · Agent 工作流
下一步: 下载 PDF · 30 min RAG 落地对齐