Aijentra
首页 / 文章 / 企业 RAG 知识库搭建

企业 RAG 知识库怎么搭建:从分块到上线的 8 周路线图

2026-05-21艾景特科技阅读约 10 分钟

企业上 AI 第一件事,往往是把内部文档变成 RAG 可检索的知识库。听起来简单,做起来 80% 的项目卡在「检索结果不够好」上。这是一份基于我们在 12 个客户项目里跑通的 8 周路线图。配套阅读:RAG vs 微调如何选

路线图全景

周次主题关键产出
1-2数据盘点 + 分块策略文档清单 + 元数据 Schema
3Embedding + 向量库选型选型报告 + 测试集
4-5混合检索 + 重排召回 Pipeline + Top-N 评测
6评测集 + 基线Hit@5 / MRR / Faithfulness 基线
7权限 + 合规行级权限 + 留痕审计
8灰度 + 回归5% → 100% 上线

一、数据梳理(最容易被低估)

经验值:这一步在小项目占 30% 工时,在大企业占 50%+。

二、分块策略

策略适用典型 chunk size
固定字数纯文本、博客300-500 字
按段落规范的文档动态
按章节书籍、长报告1000-2000 字
语义分块合同、研报动态
父子分块结构清晰的 Wiki子 200 字 / 父 2000 字

常用组合:语义分块 + 父子分块。检索时召回子 chunk,生成时上下文给父 chunk。

三、Embedding 与向量库选型

Embedding 模型

向量库

四、混合检索 + 重排(最大杠杆)

单纯向量召回的 Hit@5 通常 50-60%,加这套后能到 80-90%:

  1. 向量召回 Top 50
  2. BM25 关键词召回 Top 50
  3. 元数据过滤(时间 / 部门 / 权限)
  4. RRF 融合(Reciprocal Rank Fusion)取 Top 30
  5. Cross-Encoder 重排(bge-reranker / Cohere Rerank)出最终 Top 5

五、评测集与基线

没有 Eval Set 就不算项目结束。怎么建:

六、权限、合规与留痕

七、灰度与回归

千万别一次性上 100%。5% → 25% → 100% 三档:

八、艾景特的工程化交付包

我们的智能体基础设施把上面所有事打包成开箱即用模块:分块库、Embedding 工厂、混合检索引擎、Eval 框架、权限层、灰度网关。客户只需要做第一步:数据盘点,剩下的我们 6 周交付。

常见问题

企业 RAG 知识库搭建大概要多久?

本文给出的是一份 8 周路线图:第 1-2 周数据盘点与分块,第 3 周 Embedding 与向量库选型,第 4-5 周混合检索与重排,第 6 周评测集与基线,第 7 周权限与合规,第 8 周灰度与回归上线。艾景特把这些环节打包成模块,客户只做数据盘点,剩下约 6 周交付。

RAG 项目最容易卡在哪一步?

多数项目卡在检索结果不够好。文中给出的最大杠杆是混合检索加重排:向量召回、BM25 关键词召回、元数据过滤、RRF 融合,再用 Cross-Encoder 重排出最终结果。此外数据梳理这一步常被低估,在大企业可占一半工时。

向量数据库该怎么选?

按数据规模选:百万级以内用 pgvector,它是 PostgreSQL 扩展,运维简单;千万级可用 Qdrant 或 Weaviate;亿级用 Milvus。Embedding 模型方面,中文为主可选 BGE 或 GTE,多语言可选 OpenAI 或 Cohere,合规优先则用国内私有部署。

RAG 知识库怎么做评测?

从历史工单、FAQ、内部问答里抽 100-200 条问答对作为 Eval Set,人工标注正确文档片段,再跑基线指标:Hit@5 看前五召回是否含正确片段,MRR 看正确片段的平均倒数排名,Faithfulness 看生成答案是否忠实于上下文。每次 Pipeline 改动都重跑一次。

金融或政企客户上 RAG 有什么特殊要求?

需要做行级权限,按用户、部门、项目过滤;对接 SSO,每次查询带用户身份校验;并把用户问题、召回片段、最终答案三件套留痕以备审计。金融政企客户通常还需要模型私有化部署。如需进一步了解可联系 [email protected]

RAG 项目卡在召回质量?

艾景特提供 RAG 知识库免费诊断:拿你现有的 Pipeline 跑一次 Eval Set,给出可量化的改进项。

申请诊断