35 lines
2.1 KiB
Markdown
35 lines
2.1 KiB
Markdown
# 一个小失误,不足以造成复杂系统故障
|
||
|
||
- **期号**: SRE Weekly Issue #356(2023-01-22)
|
||
- **作者**: Lorin Hochstein
|
||
- **链接**: https://surfingcomplexity.blog/2023/01/15/a-small-mistake-does-not-a-complex-systems-failure-make/
|
||
|
||
## 简介
|
||
|
||
这篇文章简明扼要地解释了为什么我还没怎么报道 NOTAM 宕机事件。
|
||
|
||
> 如果一个小失误就足以击垮一个复杂系统,那我们的系统早就无时无刻不在崩溃了。
|
||
|
||
## 正文
|
||
|
||
我最近一直在尽量远离 Twitter,但今天还是回来看了看,结果被一位[同事](https://www.bmt-online.org/)嘲弄了一番:
|
||
|
||
这是[报道中的引文](https://www.rawstory.com/faa-outage-cause/):
|
||
|
||
据报道,问题的根源是一名工程师在文件传输中犯的一个小错误。
|
||
|
||
亲爱的读者,我想请你思考一下:想想这个星球上每个工作场所每天都会发生的种种小失误。如果一个小失误就足以击垮一个复杂系统,那么***我们*的系统就会无时无刻不在崩溃**。但显然事实并非如此。比如在这次事件之前,FAA 上一次遭遇灾难性宕机是什么时候?
|
||
|
||
目前存在这样一种可能:FAA 的员工此前从未犯过任何小失误。或者,更有可能的是,FAA 系统的运作方式使得小失误通常不足以拖垮整个系统。
|
||
|
||
要理解这种失效模式,你需要理解 FAA 系统是如何在由会犯小失误的凡人所构成的情况下,日复一日保持运行的。你必须理解***系统的实际运作方式***,才能理解大规模故障是如何发生的。
|
||
|
||
我从未在航空业工作过,因此也不具备关于 FAA 系统的领域知识。但我可以告诉你一件事:***文件传输中的一个小失误***,作为对 FAA 系统实际失效方式的解释,是远远不够完整的。
|
||
|
||
看起来帖子标题里的 "make" 位置放错了。
|
||
|
||
除此之外,它让我想起一位资深工程师经常对我说的话。
|
||
|
||
"你会惊讶地发现,当系统被放着不去动它时,它们能正常工作的程度有多高。"
|
||
|
||
我更感兴趣的是,工程师一开始为什么要传输文件。问题就在这里。 |