可靠性工程(SRE)
本域覆盖 SRE 核心实践:SLO/SLI、监控告警、容量规划、混沌工程、故障演练与稳定性保障。与本站 concepts/(性能分析、低延时)天然衔接——"性能"是稳定性的一部分,本域补充"如何把性能指标变成可承诺的 SLO 并守住"。
规划主题
| 主题 | 说明 |
|---|---|
| SLO/SLI/错误预算 | 指标设计、目标设定、错误预算策略、告警伦理 |
| 监控告警体系 | 指标采集、告警分级、防抖动、告警风暴治理、on-call |
| 限流/熔断/降级 | 令牌桶/漏桶、滑动窗口、熔断器模式、优雅降级策略 |
| 容量规划 | 压测方法、增长模型、扩缩容策略、成本优化 |
| 混沌工程 | 故障注入、演练设计、实验原则、爆炸半径控制 |
| 故障演练与复盘 | 预案、演练、on-call 流程、事后复盘(blameless) |
| 高可用设计 | 冗余、故障转移、多活、容灾、可用性计算 |
| 性能容量看板 | 从指标到决策:可观测数据如何驱动容量与架构决策 |
层级结构

一句话总结:度量→防护→保障→演练四步闭环,把性能分析能力转化为可承诺、可守住的可靠性。