feat(sreweekly): 补入 431 篇中文译文与 534 期 html,新增翻译队列脚本并更新 manifest
This commit is contained in:
56
sreweekly/markdown/112/03-runbook-template-zh.md
Normal file
56
sreweekly/markdown/112/03-runbook-template-zh.md
Normal file
@@ -0,0 +1,56 @@
|
||||
# Runbook 模板
|
||||
|
||||
- **期号**: SRE Weekly Issue #112(2018-03-04)
|
||||
- **作者**: Catie McCaffrey
|
||||
- **链接**: https://github.com/CaitieM20/Talks/blob/master/TacklingAlertFatigue/runbook.md
|
||||
|
||||
## 简介
|
||||
|
||||
一个非常出色的模板,可以作为编写 runbook(运维手册)的基础。
|
||||
|
||||
## 正文
|
||||
|
||||
一个带主章节链接的目录
|
||||
|
||||
对服务的简短描述,最多 1 到 2 句话。这项服务为什么重要?它的核心功能是什么?它为用户提供了哪些特性?
|
||||
|
||||
指向该服务仪表盘(Dashboard)的链接
|
||||
|
||||
指向该服务告警(Alert)的链接
|
||||
|
||||
每个告警都应有对应的章节,按字母顺序排列
|
||||
|
||||
告警描述:为什么会有这个告警?它表示什么?通常是什么原因触发的?
|
||||
|
||||
这种情况如何影响我们的客户?如果客户没有受到影响,这就是一个很好的信号:该告警可以考虑删除了。
|
||||
|
||||
用清单宣言(Checklist Manifesto)风格的步骤来说明如何解决这个告警。一个从未接触过我们技术栈的人也应该能照着这些步骤来处置事件。如果无法自行处置,请在这里包含升级(escalation)步骤。
|
||||
|
||||
1. 做这件事
|
||||
2. 查看这个图表
|
||||
3. 做这件事
|
||||
4. 再做另一件事
|
||||
5. 确认服务已恢复
|
||||
|
||||
团队联系方式,以及可能的升级联系人信息。我们依赖哪些服务?如何向它们升级?在这里定义这些信息。
|
||||
|
||||
我们通过 Jira 进行生产环境变更管理部署,这里放一个包含所有最新变更的链接。最近的提交、CI 日志等,对于了解系统上部署了什么代码、近期做了哪些变更极有帮助。
|
||||
|
||||
关于这项服务部署在哪里、以及如何访问这些机器的信息。
|
||||
|
||||
如何部署这项服务。这里同样推荐使用清单宣言风格的列表。
|
||||
|
||||
1. 做这件事
|
||||
2. 再做另一件事
|
||||
3. 最后做这件事
|
||||
|
||||
如何进行金丝雀部署(Canary Deployment)的说明
|
||||
|
||||
1. 做这件金丝雀部署的事
|
||||
2. 另一项金丝雀部署任务
|
||||
|
||||
如何回滚一次部署(Rollback)的说明。
|
||||
|
||||
1. 从这里获取回滚构建
|
||||
2. 做这件事
|
||||
3. 再做另一件事。
|
||||
Reference in New Issue
Block a user