把分散在 Wiki、文档、代码与聊天记录里的经验,变成可检索、可推理、可复用的组织资产。知识库不是网盘,而是「能被机器用起来」的知识底座。

知识处理流水线与检索问答闭环

上排是知识从原始素材到可被问出来的处理链路,中间是沉淀下来的四级内容模型,底部三层治理贯穿整条链路。

多源采集解析与清洗切分向量化索引混合检索生成与溯源 文档·网页·代码抽取·去重·OCR分块 · 向量化FTS + 向量关键词+向量引用原始段落 使用反馈与纠错回流 四级内容模型(可溯源的知识资产) 三级分类树知识图谱知识摘要原始段落 主题 → 子域 → 条目实体与关系抽取长文档自动摘要可溯源的引用片段 权限与密级 · 版本与审计 · 分类治理(贯穿采集到问答的全链路)

读图要点:流水线决定「能不能问出来」,四级内容模型决定「答得准不准、敢不敢信」。很多知识库的失败不是检索不行,而是只留了「摘要」这一层、丢掉了原始段落——答案一旦没有出处就无法核对,幻觉也就无从纠正。

五个能力方向

  1. 内容采集与清洗:多源接入(文档 / 网页 / 代码 / 工单),去噪、切分、去重。
  2. 分类体系:以三级分类树组织内容,避免「找一个文档翻半小时」。
  3. 检索能力:关键词检索 + 向量语义检索的混合召回,兼顾精确与泛化。
  4. 知识图谱:抽取实体与关系,支撑关联推荐与多跳问答。
  5. 权限与合规:按组织与密级隔离,回答可溯源、调用可审计。

能力与价值

能力 说明 价值
三级分类树 主题 → 子域 → 条目 结构化导航,降低查找成本
知识摘要 长文档自动生成摘要 快速判断是否相关
混合检索 关键词 + 向量召回融合 提升命中率与召回率
知识图谱 实体 / 关系抽取 关联发现与多跳问答
原始段落 保留可溯源片段 回答有出处,抑制幻觉

度量指标

  • 检索命中率:Top-N 结果中相关内容的比例。
  • 知识覆盖率:核心领域有沉淀条目的比例。
  • 更新时效:制度 / 规范变更到入库的延迟。

自建工具链示范

「西部荒野」自研的 kshare 即是一套私有域知识库中台:四级内容模型(三级分类树 → 知识图谱 → 知识摘要 → 原始段落)+ 混合检索,全部可内网私有化部署;myclaw(本地 AI Agent)作为消费端做检索增强问答,llm-router(模型网关)统一推理入口与审计。三者组合即「检索 → 推理 → 执行」的内网闭环。

边界与风险

  • 幻觉:必须保留原始段落作为出处,答案可溯源。
  • 权限泄漏:检索与生成都要做权限过滤,而非只在页面层控制。
  • 更新滞后:知识过期比没有知识更危险,需建立更新责任人与时效指标。