2.3 KiB
ChatGPT 错误率上升
- 期号: SRE Weekly Issue #462(2025-02-02)
- 作者: OpenAI
- 链接: https://status.openai.com/incidents/k934n9lt39h8
简介
OpenAI 在 1 月 30 日的宕机事件后发布了这份小型报告。
正文
已解决·完全宕机
受影响组件
更新
报告已发布
已解决
影响
太平洋时间凌晨 3:30 至早上 7:08 之间,chatgpt.com 和少量 API 经历了升高的错误率。
根本原因与处置
最初问题的根本原因是 ChatGPT 中的 Cosmos DB 发生故障。我们的服务提供商于太平洋时间凌晨 4:25 恢复了受影响的数据库。
第二个问题是由 Web 服务 Pod 崩溃循环(crash-looping)引起的,原因是它们的健康检查失败,导致 Pod 被标记为不健康,进而没有足够的资源来处理所有发往 Web 层的请求。当时我们认为这是用户重试请求造成的。在我们修复了 Web 服务器的健康检查逻辑后,这些问题得到缓解。
预防措施
- 我们将对 Web 系统做出一系列更改,使其在故障时能更优雅地降级,包括并发控制和更好的负载卸载(load shedding)。
- 让数据库层更能抵御服务提供商故障的更大投入已经在进行中。
我们知道,长时间的宕机会影响你们的产品、业务和生活。我们将优先落实上述预防措施,持续提升我们的可靠性。
2025 年 1 月 30 日,星期四,下午 03:57
此问题现已解决。太平洋时间凌晨 4:23 至早上 7:10 之间,客户在 ChatGPT 上经历了升高的错误率。
2025 年 1 月 23 日,星期四,下午 04:05(6 天前)
监控中
我们将继续监控是否出现进一步的问题。
2025 年 1 月 23 日,星期四,下午 03:11(54 分钟前)
修复已实施,正在监控结果。
2025 年 1 月 23 日,星期四,下午 03:09
已定位
我们将继续为此问题实施修复。
2025 年 1 月 23 日,星期四,下午 02:34(34 分钟前)
我们已确定此问题的根本原因,目前正在实施修复。
2025 年 1 月 23 日,星期四,下午 01:43(51 分钟前)
调查中
我们目前正在经历 ChatGPT 错误率升高。我们正在调查中。
2025 年 1 月 23 日,星期四,下午 01:12(30 分钟前)