知识系统:从文档到可回答的知识¶
企业知识库的目标不是存文件,而是让系统能在正确权限和范围内,找出可引用、可解释、可更新的证据。
知识对象与关系¶
源文档
├── 文档版本 / 权限 / 来源 / 生效时间
└── Chunk(可检索片段)
├── 向量(语义检索)
├── 关键词/字段(精确检索与过滤)
└── 实体与关系(知识图谱)
├── 设备 —位于→ 厂站
├── 设备 —属于→ 线路
└── 故障 —处置步骤→ 规程条款
同一个 Chunk 应同时保留原文、章节路径、元数据、向量和实体关系。只保存向量会失去来源、权限和精确过滤能力;只做图谱又不擅长处理长段自然语言。
四种检索方式的分工¶
| 方法 | 擅长什么 | 不擅长什么 |
|---|---|---|
| 关键词/BM25 | 型号、编号、准确术语、条款号。 | 同义表达、自然语言改写。 |
| 向量检索 | 语义相近、口语化问题、近义词。 | 精确编号、权限和复杂关系。 |
| Metadata 过滤 | 租户、权限、时间、设备类型、厂站范围。 | 不能判断文本语义相关性。 |
| 知识图谱 | 多跳关系、依赖链、实体约束和可解释路径。 | 直接理解长篇非结构化文本。 |
生产问题通常采用“权限/范围过滤 → 关键词和向量混合召回 → 图谱扩展或约束 → Rerank → LLM 回答”的组合。
文档进入知识系统的标准流程¶
- 准入:确认来源、版本、生效时间、权限和是否允许被 AI 使用。
- 解析:识别标题、正文、表格、图片说明和附件;保留原始定位信息。
- 切片:按语义完整单元切分,带上章节、条款、设备/站点等 metadata。
- 结构化抽取:抽取实体、属性、关系与业务标签;关键关系由人工抽检。
- 索引:生成 Embedding、写入向量库与关键词索引,更新图谱。
- 回归:用问题集验证召回、引用和权限边界,再发布新版本索引。
判断系统是否“懂知识”¶
不能只看最终回答。至少分别看:正确片段是否进入 Top-K(召回)、是否被排到前面(重排)、回答是否仅依据证据(忠实性)、引用是否能回到原文(可追溯性)、无权限内容是否被阻断(安全性)。