1.5 KiB
1.5 KiB
@mipsytipsy 在 Twitter 上:不要什么都报警
- 期号: SRE Weekly Issue #190(2019-10-20)
- 作者: Charity Majors (@mipsytipsy)
- 链接: https://threadreaderapp.com/thread/1185384414814990336.html
简介
Charity Majors 回应了一条“为所有事情编写告警”的建议,并分享了她认为更好的做法。
正文
一个人没有可观测性(observability)的头号迹象就是:他们把警报当作⭐️一切。⭐️的倚仗。
他们没有别的办法调试或检查自己的系统,所以只好疯狂滥用监控检查和告警。
抱歉,刚才说得有点尖刻。想起了往事。打了个寒颤。
想靠检查、告警、仪表盘和直觉拼凑出对复杂系统的理解,一点都不容易。亲爱的,我知道。你已经尽力了。
但你的系统正以指数级的速度变得更复杂。每一个维度都是高基数(high cardinality),而且集合还在不断增长——服务、API、实例、容器、端点、存储……
这一切的增长都比那条指数曲线快得多。你不能让一个团队去承受这种铺天盖地的告警和阈值。
或者,比如他们正在值班,正试图为某个特定用户复现问题。
