跳转至

知识系统:从文档到可回答的知识

企业知识库的目标不是存文件,而是让系统能在正确权限和范围内,找出可引用、可解释、可更新的证据。

知识对象与关系

源文档
  ├── 文档版本 / 权限 / 来源 / 生效时间
  └── Chunk(可检索片段)
       ├── 向量(语义检索)
       ├── 关键词/字段(精确检索与过滤)
       └── 实体与关系(知识图谱)
            ├── 设备 —位于→ 厂站
            ├── 设备 —属于→ 线路
            └── 故障 —处置步骤→ 规程条款

同一个 Chunk 应同时保留原文、章节路径、元数据、向量和实体关系。只保存向量会失去来源、权限和精确过滤能力;只做图谱又不擅长处理长段自然语言。

四种检索方式的分工

方法 擅长什么 不擅长什么
关键词/BM25 型号、编号、准确术语、条款号。 同义表达、自然语言改写。
向量检索 语义相近、口语化问题、近义词。 精确编号、权限和复杂关系。
Metadata 过滤 租户、权限、时间、设备类型、厂站范围。 不能判断文本语义相关性。
知识图谱 多跳关系、依赖链、实体约束和可解释路径。 直接理解长篇非结构化文本。

生产问题通常采用“权限/范围过滤 → 关键词和向量混合召回 → 图谱扩展或约束 → Rerank → LLM 回答”的组合。

文档进入知识系统的标准流程

  1. 准入:确认来源、版本、生效时间、权限和是否允许被 AI 使用。
  2. 解析:识别标题、正文、表格、图片说明和附件;保留原始定位信息。
  3. 切片:按语义完整单元切分,带上章节、条款、设备/站点等 metadata。
  4. 结构化抽取:抽取实体、属性、关系与业务标签;关键关系由人工抽检。
  5. 索引:生成 Embedding、写入向量库与关键词索引,更新图谱。
  6. 回归:用问题集验证召回、引用和权限边界,再发布新版本索引。

判断系统是否“懂知识”

不能只看最终回答。至少分别看:正确片段是否进入 Top-K(召回)、是否被排到前面(重排)、回答是否仅依据证据(忠实性)、引用是否能回到原文(可追溯性)、无权限内容是否被阻断(安全性)。