Files
nexus/sreweekly/markdown/112/03-runbook-template-zh.md

2.0 KiB
Raw Blame History

Runbook 模板

简介

一个非常出色的模板,可以作为编写 runbook(运维手册)的基础。

正文

一个带主章节链接的目录

对服务的简短描述,最多 1 到 2 句话。这项服务为什么重要?它的核心功能是什么?它为用户提供了哪些特性?

指向该服务仪表盘(Dashboard)的链接

指向该服务告警(Alert)的链接

每个告警都应有对应的章节,按字母顺序排列

告警描述:为什么会有这个告警?它表示什么?通常是什么原因触发的?

这种情况如何影响我们的客户?如果客户没有受到影响,这就是一个很好的信号:该告警可以考虑删除了。

用清单宣言(Checklist Manifesto)风格的步骤来说明如何解决这个告警。一个从未接触过我们技术栈的人也应该能照着这些步骤来处置事件。如果无法自行处置,请在这里包含升级(escalation)步骤。

  1. 做这件事
  2. 查看这个图表
  3. 做这件事
  4. 再做另一件事
  5. 确认服务已恢复

团队联系方式,以及可能的升级联系人信息。我们依赖哪些服务?如何向它们升级?在这里定义这些信息。

我们通过 Jira 进行生产环境变更管理部署,这里放一个包含所有最新变更的链接。最近的提交、CI 日志等,对于了解系统上部署了什么代码、近期做了哪些变更极有帮助。

关于这项服务部署在哪里、以及如何访问这些机器的信息。

如何部署这项服务。这里同样推荐使用清单宣言风格的列表。

  1. 做这件事
  2. 再做另一件事
  3. 最后做这件事

如何进行金丝雀部署(Canary Deployment)的说明

  1. 做这件金丝雀部署的事
  2. 另一项金丝雀部署任务

如何回滚一次部署(Rollback)的说明。

  1. 从这里获取回滚构建
  2. 做这件事
  3. 再做另一件事。