2.0 KiB
2.0 KiB
Runbook 模板
- 期号: SRE Weekly Issue #112(2018-03-04)
- 作者: Catie McCaffrey
- 链接: https://github.com/CaitieM20/Talks/blob/master/TacklingAlertFatigue/runbook.md
简介
一个非常出色的模板,可以作为编写 runbook(运维手册)的基础。
正文
一个带主章节链接的目录
对服务的简短描述,最多 1 到 2 句话。这项服务为什么重要?它的核心功能是什么?它为用户提供了哪些特性?
指向该服务仪表盘(Dashboard)的链接
指向该服务告警(Alert)的链接
每个告警都应有对应的章节,按字母顺序排列
告警描述:为什么会有这个告警?它表示什么?通常是什么原因触发的?
这种情况如何影响我们的客户?如果客户没有受到影响,这就是一个很好的信号:该告警可以考虑删除了。
用清单宣言(Checklist Manifesto)风格的步骤来说明如何解决这个告警。一个从未接触过我们技术栈的人也应该能照着这些步骤来处置事件。如果无法自行处置,请在这里包含升级(escalation)步骤。
- 做这件事
- 查看这个图表
- 做这件事
- 再做另一件事
- 确认服务已恢复
团队联系方式,以及可能的升级联系人信息。我们依赖哪些服务?如何向它们升级?在这里定义这些信息。
我们通过 Jira 进行生产环境变更管理部署,这里放一个包含所有最新变更的链接。最近的提交、CI 日志等,对于了解系统上部署了什么代码、近期做了哪些变更极有帮助。
关于这项服务部署在哪里、以及如何访问这些机器的信息。
如何部署这项服务。这里同样推荐使用清单宣言风格的列表。
- 做这件事
- 再做另一件事
- 最后做这件事
如何进行金丝雀部署(Canary Deployment)的说明
- 做这件金丝雀部署的事
- 另一项金丝雀部署任务
如何回滚一次部署(Rollback)的说明。
- 从这里获取回滚构建
- 做这件事
- 再做另一件事。