数据要成为资产,前提是可信、可查、可控。本支柱聚焦「让数据可用」的治理体系——从标准、质量到安全合规与资产目录,而非单纯堆叠存储与计算引擎。
治理体系:分层数据流 + 贯穿治理域
左侧六层是数据自下而上的加工路径,右侧四个治理域不隶属于任何一层,而是横向贯穿全链路——这正是「治理」与「上工具」的区别。
读图要点:左边问「数据怎么流」,右边问「凭什么可信」。治理域之所以画成贯穿而不是某一层,是因为数据质量、安全、血缘在任何一层都会出问题——只在下游做质量稽核,上游口径一变,下游的全部结论都要推翻重来。
五个治理方向
- 数据标准与元数据:统一命名、口径与指标定义,建立技术元数据 + 业务元数据。
- 数据质量:完整性、准确性、及时性、一致性四类规则与稽核闭环。
- 数据安全与合规:分级分类、脱敏、访问审计,对齐等保 2.0 与《数据安全法》《个人信息保护法》。
- 数据资产目录与血缘:可搜索的资产地图 + 上下游血缘,支撑影响分析与变更管控。
- 生命周期与成本:冷热分层、归档与淘汰,控制存储与计算成本。
治理动作与交付物
| 治理域 | 关键动作 | 交付物 |
|---|---|---|
| 标准与元数据 | 口径评审、命名规范、指标字典 | 指标字典、元数据仓库 |
| 数据质量 | 规则配置、定时稽核、异常派单 | 质量分看板、告警规则 |
| 安全与合规 | 分级打标、脱敏策略、权限审批 | 分级清单、审计日志 |
| 资产与血缘 | 自动采集、SQL 解析、影响分析 | 资产目录、血缘图谱 |
度量与检查清单
- 核心指标口径唯一,且可追溯到加工链路。
- 关键表有数据质量规则,且异常能在约定时限内被发现。
- 敏感字段全量打标,访问有审批、有留痕。
- 需求变更可做影响分析(血缘覆盖率)。
国产化与自建工具示范
信创环境下优先考虑可私有化部署的治理组件;「西部荒野」自研工具可承担数据侧的采集与知识侧沉淀:perfs(指标采集与监控,可作为数据质量与运行指标的观测源)、kshare(私有域知识库中台,沉淀数据标准、口径与治理规范)。
边界与风险
- 治理不等于上工具:先定标准与责任,再选平台,否则只是把混乱搬进系统。
- 质量规则要少而准:规则过多会淹没告警,关键链路优先。
- 合规先行:涉及个人信息与重要数据的场景,需专项评估与留痕。