社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  chatgpt

ChatGPT也遭殃,亚马逊服务器故障,半个互联网都崩了

量子位 • 10 月前 • 189 次点击  
克雷西 发自 凹非寺
量子位 | 公众号 QbitAI

亚马逊一声咳嗽,半个互联网都地震了。

由于亚马逊AWS服务器宕机,大量互联网服务被迫中断,ChatGPT也被殃及。

故障发生在美国东部us-east-1区域,是AWS全球服务最核心的一块。

根据故障追踪平台Downdetector的数据,当天累计收到超过650万份用户故障报告

非完全列举

AWS这波事故,也让Reddit在内的社交平台服务崩溃,人们差点连吐槽都没法吐。

而且连AWS自己的客户支持提单系统都挂了,想报个错同样找不到门路。

不过好在马斯克的X没用AWS,也就没受影响,才给了网友们机会讨论AWS的这波故障。

有网友用表情包调侃,马斯克才是这波事件的最大赢家。

但玩笑归玩笑,被这件事波及的人,可能一点也笑不出来……

亚马逊服务故障波及各行各业

亚马逊的这次宕机波及面究竟有多广?先来看开发者群体的情况。

Docker是一个重要的应用容器引擎,有开发者发现Docker全线瘫痪了,多个核心服务集体中断。

除了Docker,另一个重要开发工具npm也出现了同样的问题,还有备受青睐的AI编程工具Cursor、Vercel一样未能幸免。

除了开发者,其他打工人也受到影响——视频会议软件Zoom、OpenAI同款办公平台Slack,全都崩了。

抓马的是,据说今年亚马逊内部开会开始改用Zoom,这样一来,没有Zoom的话AWS就开不了线上会议,但AWS不修复Zoom就用不了……

既然工作干不了,那干脆直接摸鱼呢?

也不行,因为游戏平台Epic、索尼PlayStation,还有Reddit等社交平台以及Netflix、Disney+、Max等流媒体视频网站也宕机了。

那我学习总行了吧?对不起,多邻国也崩了,还有学生群体也登录不了作业平台Canvas

AI工具方面,最著名的ChatGPT也被认为受到波及,还有著名AI搜索工具Perplexity也榜上有名。

而且影响也从线上蔓延到了线下,打车软件崩了,麦当劳星巴克崩了,日常生活中的叫车、点餐都无法进行。

还有航空公司,美联航和达美航空都受到了影响,无法给乘客办理值机和行李托运。

比上不了飞机更惨的是在飞机上下不去,小红书上就有网友现身说法,表示自己乘坐的达美航空班机落地后无法停靠,一飞机的人只能在跑道等待,机长广播通知原因正是亚马逊宕机。

更惨的是智能门锁用户,受网络影响无法解锁,但门锁的报警功能却是好的,引来了警察上门。

当然像Alexa等亚马逊自家其他的智能家居,更是因为没有网络服务全面罢工。

事情甚至影响到了大西洋另一边的英国。

比如英超官方宣布,由于受到AWS故障的影响,西汉姆联对阵布伦特福德的比赛当中半自动越位系统故障,将比赛中若有需要,将采用以往的人工画线方式来辅助判定。

当然,除此之外“受害者”名单还有很长……

互联网为何如此脆弱

这次发生问题的是AWS的us-east-1服务器,直接原因是DNS(Domain Name System)解析问题。

AWS的说法则是,问题起源于EC2内部网络的一个子系统,该子系统用于监控和管理网络负载均衡器的健康状态。

该监控系统的异常导致了网络连接不稳定、数据库访问延迟以及部分API请求失败。在连锁反应下,多项核心云服务出现大范围故障。

us-east-1是AWS最早建立的区域,基础设施历史最长,服务种类最多,大量企业都在us-east-1部署核心服务。

us-east-1不仅是计算/存储资源的大本营,也是许多全球控制面服务的集中托管区域,这意味着其他区域即便本地运行正常,部署、身份验证、权限变更等控制层操作仍需依赖us-east-1

这也就导致了us-east-1相比亚马逊其他服务器与众不同,其故障能够影响全球。

而且这也不是us-east-1第一次崩了,过去几年(2020、2021、2023年)也发生过类似的“大范围瘫痪”事件,每次都会影响一大批线上服务。

故障本身在所难免,但故障的波及面,揭示了互联网存在的问题——

像亚马逊这样的大型云服务的确提升了全球网络安全和稳定性,但成也萧何,这种标准、集中化的服务,意味着任何一个小故障,都有可能造成灾难性的后果。

为了避免这种情况,网站开发者需要设置一种弹性机制

Hacker News上就有网友表示,其静态站点通过CloudFront连接多个区域,没有全部押注us-east-1,因此在这次事件中没有受到影响。

而且这种原生多区域、故障转移的部署方式,技术上并不复杂,成本也不会显著增加。

网络服务开发者们,是时候重新审视一下自己的部署策略了。

参考链接:
[1]https://www.theverge.com/news/802486/aws-outage-alexa-fortnite-snapchat-offline#comments
[2]https://www.wired.com/story/what-that-huge-aws-outage-reveals-about-the-internet/
[3]https://www.businessinsider.com/ring-starbucks-alexa-app-down-aws-outage-issues-2025-10
[4]https://www.cnbc.com/2025/10/20/amazon-web-services-outage-hits-airline-websites-other-major-sites.html
[5]https://news.ycombinator.com/item?id=45640838

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


🏆 年度科技风向标「2025人工智能年度榜单」评选报名火热进行中!我们正在寻找AI+时代领航者 点击了解详情

❤️‍🔥 企业、产品、人物3大维度,共设立了5类奖项,欢迎企业报名参与 👇 

一键关注 👇 点亮星标

科技前沿进展每日见

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/188125