从工程化到可靠性,沉淀可直接复用的方法论与检查清单。
交付生命周期与平台架构
上排是价值流走过的六个阶段,下两排是支撑它跑起来的平台工具链与治理度量;右侧回路表示度量结果反哺下一轮迭代。
读图要点:阶段之间是单向流动,监控是终点也是起点——度量数据(DORA 四项 + SLO 错误预算)决定下一轮迭代是继续加功能还是转入稳定性治理。下两排不是流程的一部分,而是让流程可持续的底座:没有门禁与可观测性,上面的六个阶段只会跑得更快、错得更快。
四个方向
- CI/CD 工程化:流水线即代码、环境一致性、制品治理。
- SRE 可靠性:SLO / 错误预算、容量与故障演练。
- 可观测性:Metrics / Logs / Traces 三支柱与告警治理。
- 平台工程与度量:内部开发者平台(IDP)+ DORA 指标。
DORA 四指标(度量研发效能)
| 指标 | 含义 | 改善方向 |
|---|---|---|
| 部署频率 | 单位时间发布次数 | 小批量、高频次 |
| 变更前置时间 | 提交到上线的时长 | 缩短流水线、减少等待 |
| 变更失败率 | 发布导致故障的比例 | 门禁前置、灰度发布 |
| 恢复时长(MTTR) | 故障到恢复的时长 | 可观测 + 一键回滚 |
SRE:从 SLO 开始
- 为关键服务定义 SLI / SLO,用错误预算驱动发布节奏。
- 错误预算耗尽时冻结功能发布,转向稳定性治理。
- 定期故障演练(Chaos),验证预案而非纸面。
落地路线(90 天)
- 0–30 天:统一代码托管 + 流水线骨架 + 制品库,打通「提交到部署」。
- 30–60 天:加质量门禁(扫描 / 测试)、密钥托管、灰度发布。
- 60–90 天:建可观测与 SLO,接入 DORA 度量,形成改进闭环。
常见反模式
- 只引入工具、不改流程与责任边界 → 工具孤岛。
- 度量个人产出而非交付流动 → 数据造假、内耗。
- 一次性大爆炸发布 → 失败率高、回滚困难。