把分散在 Wiki、文档、代码与聊天记录里的经验,变成可检索、可推理、可复用的组织资产。知识库不是网盘,而是「能被机器用起来」的知识底座。
知识处理流水线与检索问答闭环
上排是知识从原始素材到可被问出来的处理链路,中间是沉淀下来的四级内容模型,底部三层治理贯穿整条链路。
读图要点:流水线决定「能不能问出来」,四级内容模型决定「答得准不准、敢不敢信」。很多知识库的失败不是检索不行,而是只留了「摘要」这一层、丢掉了原始段落——答案一旦没有出处就无法核对,幻觉也就无从纠正。
五个能力方向
- 内容采集与清洗:多源接入(文档 / 网页 / 代码 / 工单),去噪、切分、去重。
- 分类体系:以三级分类树组织内容,避免「找一个文档翻半小时」。
- 检索能力:关键词检索 + 向量语义检索的混合召回,兼顾精确与泛化。
- 知识图谱:抽取实体与关系,支撑关联推荐与多跳问答。
- 权限与合规:按组织与密级隔离,回答可溯源、调用可审计。
能力与价值
| 能力 | 说明 | 价值 |
|---|---|---|
| 三级分类树 | 主题 → 子域 → 条目 | 结构化导航,降低查找成本 |
| 知识摘要 | 长文档自动生成摘要 | 快速判断是否相关 |
| 混合检索 | 关键词 + 向量召回融合 | 提升命中率与召回率 |
| 知识图谱 | 实体 / 关系抽取 | 关联发现与多跳问答 |
| 原始段落 | 保留可溯源片段 | 回答有出处,抑制幻觉 |
度量指标
- 检索命中率:Top-N 结果中相关内容的比例。
- 知识覆盖率:核心领域有沉淀条目的比例。
- 更新时效:制度 / 规范变更到入库的延迟。
自建工具链示范
「西部荒野」自研的 kshare 即是一套私有域知识库中台:四级内容模型(三级分类树 → 知识图谱 → 知识摘要 → 原始段落)+ 混合检索,全部可内网私有化部署;myclaw(本地 AI Agent)作为消费端做检索增强问答,llm-router(模型网关)统一推理入口与审计。三者组合即「检索 → 推理 → 执行」的内网闭环。
边界与风险
- 幻觉:必须保留原始段落作为出处,答案可溯源。
- 权限泄漏:检索与生成都要做权限过滤,而非只在页面层控制。
- 更新滞后:知识过期比没有知识更危险,需建立更新责任人与时效指标。