feat(sreweekly): 补入 431 篇中文译文与 534 期 html,新增翻译队列脚本并更新 manifest
This commit is contained in:
70
sreweekly/markdown/462/02-increased-errors-for-chatgpt-zh.md
Normal file
70
sreweekly/markdown/462/02-increased-errors-for-chatgpt-zh.md
Normal file
@@ -0,0 +1,70 @@
|
||||
# ChatGPT 错误率上升
|
||||
|
||||
- **期号**: SRE Weekly Issue #462(2025-02-02)
|
||||
- **作者**: OpenAI
|
||||
- **链接**: https://status.openai.com/incidents/k934n9lt39h8
|
||||
|
||||
## 简介
|
||||
|
||||
OpenAI 在 1 月 30 日的宕机事件后发布了这份小型报告。
|
||||
|
||||
## 正文
|
||||
|
||||
已解决·完全宕机
|
||||
|
||||
受影响组件
|
||||
|
||||
更新
|
||||
|
||||
报告已发布
|
||||
|
||||
已解决
|
||||
|
||||
影响
|
||||
|
||||
太平洋时间凌晨 3:30 至早上 7:08 之间,[chatgpt.com](http://chatgpt.com) 和少量 API 经历了升高的错误率。
|
||||
|
||||
根本原因与处置
|
||||
|
||||
最初问题的根本原因是 ChatGPT 中的 Cosmos DB 发生故障。我们的服务提供商于太平洋时间凌晨 4:25 恢复了受影响的数据库。
|
||||
|
||||
第二个问题是由 Web 服务 Pod 崩溃循环(crash-looping)引起的,原因是它们的健康检查失败,导致 Pod 被标记为不健康,进而没有足够的资源来处理所有发往 Web 层的请求。当时我们认为这是用户重试请求造成的。在我们修复了 Web 服务器的健康检查逻辑后,这些问题得到缓解。
|
||||
|
||||
预防措施
|
||||
|
||||
- 我们将对 Web 系统做出一系列更改,使其在故障时能更优雅地降级,包括并发控制和更好的负载卸载(load shedding)。
|
||||
- 让数据库层更能抵御服务提供商故障的更大投入已经在进行中。
|
||||
|
||||
我们知道,长时间的宕机会影响你们的产品、业务和生活。我们将优先落实上述预防措施,持续提升我们的可靠性。
|
||||
|
||||
2025 年 1 月 30 日,星期四,下午 03:57
|
||||
|
||||
此问题现已解决。太平洋时间凌晨 4:23 至早上 7:10 之间,客户在 ChatGPT 上经历了升高的错误率。
|
||||
|
||||
2025 年 1 月 23 日,星期四,下午 04:05(`6` 天前)
|
||||
|
||||
监控中
|
||||
|
||||
我们将继续监控是否出现进一步的问题。
|
||||
|
||||
2025 年 1 月 23 日,星期四,下午 03:11(`54` 分钟前)
|
||||
|
||||
修复已实施,正在监控结果。
|
||||
|
||||
2025 年 1 月 23 日,星期四,下午 03:09
|
||||
|
||||
已定位
|
||||
|
||||
我们将继续为此问题实施修复。
|
||||
|
||||
2025 年 1 月 23 日,星期四,下午 02:34(`34` 分钟前)
|
||||
|
||||
我们已确定此问题的根本原因,目前正在实施修复。
|
||||
|
||||
2025 年 1 月 23 日,星期四,下午 01:43(`51` 分钟前)
|
||||
|
||||
调查中
|
||||
|
||||
我们目前正在经历 ChatGPT 错误率升高。我们正在调查中。
|
||||
|
||||
2025 年 1 月 23 日,星期四,下午 01:12(`30` 分钟前)
|
||||
Reference in New Issue
Block a user