关注我们: 微信公众号

扫码关注我们

谷歌云崩了 15 个小时:IDC 掉电!温度飙升!服务器紧急关机

云头条 2026-07-22 14

2026 年 7 月 22 日,谷歌云公布一起荷兰数据中心故障的初步调查报告。

上游公共电网发生电气故障后,数据中心供电设备和制冷系统受到影响,机房温度快速升高。谷歌随后关闭服务器、存储集群和网络交换机,防止硬件在高温环境下损坏。

此次事故影响谷歌云荷兰区域 europe-west4 的 europe-west4-a 可用区,涉及 Google Cloud VMware Engine、Google Cloud NetApp Volumes 和 Bare Metal Solution 三项服务。

整体服务中断时间接近 15 小时,其中 Bare Metal Solution 受影响时间最长,达到 12 小时 57 分钟。

根据谷歌云初步事故报告,故障发生于当地时间 7 月 16 日凌晨。

数据中心上游电网首先出现电气故障,随后干扰内部配电装置及制冷设备。

冷却能力下降后,受影响机房的环境温度迅速升高。

谷歌监控系统从美国太平洋时间 7 月 15 日 16 时 39 分开始收到温度异常和硬件无法连接告警。

为避免设备过热,谷歌关闭部分主机、存储节点和网络设备。相关客户工作负载及管理控制服务随之中断。

其中,Google Cloud VMware Engine 服务中断 9 小时 24 分钟。

该服务用于在谷歌云中运行 VMware 私有云环境。

事故期间,europe-west4-a 可用区内的私有云和底层网络交换设备被关闭,客户无法连接私有云及其中运行的虚拟机。

谷歌在早期公告中还建议客户主动关闭 VMware 虚拟机,以降低非正常断电带来的恢复风险。

现场环境恢复稳定后,工程团队先恢复网络架构,再逐步启动各个私有云,并通知客户检查虚拟机运行状态。

Google Cloud NetApp Volumes 服务中断 8 小时 31 分钟。

NetApp Volumes 是谷歌云提供的企业级文件存储服务。

受高温影响,谷歌主动关闭 ONTAP 存储集群,Standard、Premium 和 Extreme 三种服务等级均受到影响。

客户在故障期间无法访问存储卷,新建存储池、存储卷及备份等控制平面操作也出现失败。供电和制冷恢复后,谷歌逐步启动存储服务器,并确认受影响节点恢复运行。

Bare Metal Solution 服务中断 12 小时 57 分钟,是此次事故中恢复时间最长的服务。

Bare Metal Solution 主要面向需要物理服务器运行数据库和关键业务系统的企业客户。谷歌关闭部分裸金属服务器及存储设备后,客户无法连接数据库服务器和相关存储资源。

由于裸金属设备需要逐台启动并完成健康检查,其恢复速度慢于另外两项服务。大部分服务器上线后,谷歌仍与少量受影响客户继续处理残余问题。

事故发生后,谷歌工程团队与第三方数据中心运营商共同恢复主供电和冷却设备。机房温度降至安全范围后,现场及远程工程师按照服务器、存储节点和网络设备的顺序进行启动和检查。

谷歌还执行自动化恢复程序,重新启动底层交换机和路由基础设施。网络恢复后,存储设备和计算集群才陆续重新上线。

此次事故没有可直接使用的临时解决方案。

谷歌在故障期间建议采用多区域部署的客户将流量切换至其他站点,单一区域部署的客户只能等待数据中心恢复。

谷歌表示,底层基础设施目前已经恢复,三项服务均恢复正常运行。

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。

关键词:

网友留言2

未查询到任何数据!
◎欢迎您留言咨询,请在这里提交您想咨询的内容。