5 分钟上手系列扩展规划(运维/排障主题)
现有 5 分钟上手系列 已覆盖 CPU、系统调用、调度、磁盘、进程下钻、内存、网络七条基础观测线(perf / top / strace / vmstat / iostat / pidstat / htop / ss / free),但偏"单命令看指标",缺少"线上真出事时怎么排障""服务/容器/网络链路怎么管"这一类运维动作主题。
本规划把它们补上,仍坚持 5 分钟系列的"装好 → 跑通 → 看懂输出"三步风格,只是场景从"单工具观测"升级到"一个运维动作"。落地归属:SRE 运维体系(本站 sre/),与 quickstart 互为入口。
规划主题清单
P0 — 高频线上排障(优先补,覆盖最广)
| 主题 | 能学会什么(5 分钟目标) | 与现有内容衔接 |
|---|---|---|
| tcpdump 抓包速通 | 在可疑网卡抓包、按端口/主机过滤、存 pcap 用 Wireshark 看,定位异常连接 | 接 ss(看连接状态)→ 抓包看内容 |
| netstat 与连接排障 | 看 TIME_WAIT 堆积、监听缺失、连接数耗尽,定位端口/连接类故障 | 接 ss(ss 的现代替代,netstat 仍常见) |
| sar 历史回溯 | 用 sar 翻历史 CPU/IO/网络,定位"半小时前那波抖动" | 接 vmstat(实时)→ sar(历史) |
| ps 进程快照 | 按状态/CPU/内存排序抓异常进程,区分 D 状态、僵尸进程 | 接 top(动态)→ ps(快照) |
| lsof 看打开的资源 | 查进程打开了哪些文件/端口/套接字,定位"文件句柄耗尽""端口被占" | 接 pidstat / ss |
P1 — 服务与运行时管理
| 主题 | 能学会什么 | 衔接 |
|---|---|---|
| systemctl 服务排障 | 看服务状态/日志/失败原因,启停与开机自启,定位"起不来" | 接 ps / strace(起不来抓系统调用) |
| journalctl 日志速查 | 按时间/服务/级别过滤日志,定位崩溃前最后一条 | 接 SRE 监控告警体系 |
| crontab 定时任务 | 看/加/排错定时任务,定位"定时任务没跑" | 独立运维动作 |
| dmesg 内核环缓冲 | 看 OOM、硬件错误、驱动异常,定位内核侧故障 | 接 free(OOM 前的用户态信号) |
P2 — 磁盘、文件系统与容器
| 主题 | 能学会什么 | 衔接 |
|---|---|---|
| df / du 磁盘用量 | 快速定位"磁盘满了是哪个目录/文件",区分 inode 与块占用 | 接 iostat(IO 瓶颈)→ df/du(空间) |
| find 排查利器 | 按大小/时间/名称找文件,清理大文件、定位异常落盘 | 接 df/du |
| 容器排障速通(docker) | 看容器状态/日志/资源占用,进容器排查,定位"容器起不来/疯跑" | 接 top / pidstat(容器内视角) |
| 负载与平均负载解读 | 区分 CPU bound / IO bound / 抢锁导致的 load 高,避免误判 | 接 vmstat / top |
优先级说明
- P0(先做):tcpdump、netstat、sar、ps、lsof —— 这五个覆盖了"网络异常、历史回溯、进程异常、资源占用"四类最高频线上故障,且都和现有 9 篇强衔接,读者顺藤摸瓜即可。
- P1(次之):systemctl、journalctl、crontab、dmesg —— 偏"服务与系统运维",和 SRE 监控告警体系联动。
- P2(补充):df/du、find、容器、负载解读 —— 偏存储与运行时,完善排障面。
与现有体系的关系
- 上游入口:5 分钟上手系列(基础观测 9 篇)、SRE 体系总览
- 下游深究:工具索引、Linux 命令速查、知识版图
落地建议
- 每篇保持 quickstart 三步结构(装好 → 跑通 → 看懂输出),并复用
cpu_demo或公开可复现场景造靶子; - 每篇 ≥2 条站内交叉引用(指向 existing quickstart 对应篇 + SRE 相关子域);
- 完成后回填本规划表的"状态"列,并同步更新 quickstart/README.md 篇目表与 SRE README 规划主题。
一句话总结:在 9 篇"单命令看指标"基础上,规划一批"一个运维动作"主题,把 5 分钟上手从观测延伸到排障与服务管理,补齐 SRE 体系的实操入口。