数据要成为资产,前提是可信、可查、可控。本支柱聚焦「让数据可用」的治理体系——从标准、质量到安全合规与资产目录,而非单纯堆叠存储与计算引擎。

治理体系:分层数据流 + 贯穿治理域

左侧六层是数据自下而上的加工路径,右侧四个治理域不隶属于任何一层,而是横向贯穿全链路——这正是「治理」与「上工具」的区别。

数据分层与流向(自下而上加工) 应用与消费 数据服务 计算与开发 存储与湖仓 采集与集成 数据源 报表 · 看板 · 自助分析 · 模型 指标 API · 标签 · 数据集市 批流计算 · 任务调度 · 建模 数仓 · 数据湖 · 湖仓一体 批量 · 实时 CDC · 文件交换 业务库 · 日志 · 埋点 · 外部数据 治理域 · 贯穿全链路 数据标准与元数据 数据质量 数据安全与合规 资产目录与血缘 口径统一 · 指标字典 四类规则 · 稽核闭环 分级脱敏 · 访问审计 资产地图 · 影响分析

读图要点:左边问「数据怎么流」,右边问「凭什么可信」。治理域之所以画成贯穿而不是某一层,是因为数据质量、安全、血缘在任何一层都会出问题——只在下游做质量稽核,上游口径一变,下游的全部结论都要推翻重来。

五个治理方向

  1. 数据标准与元数据:统一命名、口径与指标定义,建立技术元数据 + 业务元数据。
  2. 数据质量:完整性、准确性、及时性、一致性四类规则与稽核闭环。
  3. 数据安全与合规:分级分类、脱敏、访问审计,对齐等保 2.0 与《数据安全法》《个人信息保护法》。
  4. 数据资产目录与血缘:可搜索的资产地图 + 上下游血缘,支撑影响分析与变更管控。
  5. 生命周期与成本:冷热分层、归档与淘汰,控制存储与计算成本。

治理动作与交付物

治理域 关键动作 交付物
标准与元数据 口径评审、命名规范、指标字典 指标字典、元数据仓库
数据质量 规则配置、定时稽核、异常派单 质量分看板、告警规则
安全与合规 分级打标、脱敏策略、权限审批 分级清单、审计日志
资产与血缘 自动采集、SQL 解析、影响分析 资产目录、血缘图谱

度量与检查清单

  • 核心指标口径唯一,且可追溯到加工链路。
  • 关键表有数据质量规则,且异常能在约定时限内被发现。
  • 敏感字段全量打标,访问有审批、有留痕。
  • 需求变更可做影响分析(血缘覆盖率)。

国产化与自建工具示范

信创环境下优先考虑可私有化部署的治理组件;「西部荒野」自研工具可承担数据侧的采集与知识侧沉淀:perfs(指标采集与监控,可作为数据质量与运行指标的观测源)、kshare(私有域知识库中台,沉淀数据标准、口径与治理规范)。

边界与风险

  • 治理不等于上工具:先定标准与责任,再选平台,否则只是把混乱搬进系统。
  • 质量规则要少而准:规则过多会淹没告警,关键链路优先。
  • 合规先行:涉及个人信息与重要数据的场景,需专项评估与留痕。