# ChatGPT 错误率上升 - **期号**: SRE Weekly Issue #462(2025-02-02) - **作者**: OpenAI - **链接**: https://status.openai.com/incidents/k934n9lt39h8 ## 简介 OpenAI 在 1 月 30 日的宕机事件后发布了这份小型报告。 ## 正文 已解决·完全宕机 受影响组件 更新 报告已发布 已解决 影响 太平洋时间凌晨 3:30 至早上 7:08 之间,[chatgpt.com](http://chatgpt.com) 和少量 API 经历了升高的错误率。 根本原因与处置 最初问题的根本原因是 ChatGPT 中的 Cosmos DB 发生故障。我们的服务提供商于太平洋时间凌晨 4:25 恢复了受影响的数据库。 第二个问题是由 Web 服务 Pod 崩溃循环(crash-looping)引起的,原因是它们的健康检查失败,导致 Pod 被标记为不健康,进而没有足够的资源来处理所有发往 Web 层的请求。当时我们认为这是用户重试请求造成的。在我们修复了 Web 服务器的健康检查逻辑后,这些问题得到缓解。 预防措施 - 我们将对 Web 系统做出一系列更改,使其在故障时能更优雅地降级,包括并发控制和更好的负载卸载(load shedding)。 - 让数据库层更能抵御服务提供商故障的更大投入已经在进行中。 我们知道,长时间的宕机会影响你们的产品、业务和生活。我们将优先落实上述预防措施,持续提升我们的可靠性。 2025 年 1 月 30 日,星期四,下午 03:57 此问题现已解决。太平洋时间凌晨 4:23 至早上 7:10 之间,客户在 ChatGPT 上经历了升高的错误率。 2025 年 1 月 23 日,星期四,下午 04:05(`6` 天前) 监控中 我们将继续监控是否出现进一步的问题。 2025 年 1 月 23 日,星期四,下午 03:11(`54` 分钟前) 修复已实施,正在监控结果。 2025 年 1 月 23 日,星期四,下午 03:09 已定位 我们将继续为此问题实施修复。 2025 年 1 月 23 日,星期四,下午 02:34(`34` 分钟前) 我们已确定此问题的根本原因,目前正在实施修复。 2025 年 1 月 23 日,星期四,下午 01:43(`51` 分钟前) 调查中 我们目前正在经历 ChatGPT 错误率升高。我们正在调查中。 2025 年 1 月 23 日,星期四,下午 01:12(`30` 分钟前)