56 lines
2.0 KiB
Markdown
56 lines
2.0 KiB
Markdown
# Runbook 模板
|
||
|
||
- **期号**: SRE Weekly Issue #112(2018-03-04)
|
||
- **作者**: Catie McCaffrey
|
||
- **链接**: https://github.com/CaitieM20/Talks/blob/master/TacklingAlertFatigue/runbook.md
|
||
|
||
## 简介
|
||
|
||
一个非常出色的模板,可以作为编写 runbook(运维手册)的基础。
|
||
|
||
## 正文
|
||
|
||
一个带主章节链接的目录
|
||
|
||
对服务的简短描述,最多 1 到 2 句话。这项服务为什么重要?它的核心功能是什么?它为用户提供了哪些特性?
|
||
|
||
指向该服务仪表盘(Dashboard)的链接
|
||
|
||
指向该服务告警(Alert)的链接
|
||
|
||
每个告警都应有对应的章节,按字母顺序排列
|
||
|
||
告警描述:为什么会有这个告警?它表示什么?通常是什么原因触发的?
|
||
|
||
这种情况如何影响我们的客户?如果客户没有受到影响,这就是一个很好的信号:该告警可以考虑删除了。
|
||
|
||
用清单宣言(Checklist Manifesto)风格的步骤来说明如何解决这个告警。一个从未接触过我们技术栈的人也应该能照着这些步骤来处置事件。如果无法自行处置,请在这里包含升级(escalation)步骤。
|
||
|
||
1. 做这件事
|
||
2. 查看这个图表
|
||
3. 做这件事
|
||
4. 再做另一件事
|
||
5. 确认服务已恢复
|
||
|
||
团队联系方式,以及可能的升级联系人信息。我们依赖哪些服务?如何向它们升级?在这里定义这些信息。
|
||
|
||
我们通过 Jira 进行生产环境变更管理部署,这里放一个包含所有最新变更的链接。最近的提交、CI 日志等,对于了解系统上部署了什么代码、近期做了哪些变更极有帮助。
|
||
|
||
关于这项服务部署在哪里、以及如何访问这些机器的信息。
|
||
|
||
如何部署这项服务。这里同样推荐使用清单宣言风格的列表。
|
||
|
||
1. 做这件事
|
||
2. 再做另一件事
|
||
3. 最后做这件事
|
||
|
||
如何进行金丝雀部署(Canary Deployment)的说明
|
||
|
||
1. 做这件金丝雀部署的事
|
||
2. 另一项金丝雀部署任务
|
||
|
||
如何回滚一次部署(Rollback)的说明。
|
||
|
||
1. 从这里获取回滚构建
|
||
2. 做这件事
|
||
3. 再做另一件事。 |