断电线路暴露了AI数据中心的问题。解决方案如下。

本周,华盛顿特区附近发生了一起输电线路故障。在正常情况下,电网可在数秒内恢复,但此次却耗时超过十分钟,原因是超过3吉瓦的数据中心负荷几乎在同一时间突然断开。
据通过家用电源插座运营物联网传感器网络的初创公司Ting Labs的数据显示,此次事件导致从北弗吉尼亚州到芝加哥的整个PJM电网范围内出现电压尖峰。
虽然此次事件并未引发大面积停电,但导致该地区多地灯光闪烁。这凸显了数据中心对电网影响日益加剧的现状,专家预计这一趋势将愈发普遍。
北弗吉尼亚州属于PJM管辖范围,该地区拥有全球最密集的数据中心集群。
“这就像煤矿里的金丝雀,”ON.Energy首席技术官里卡多·德·阿泽维多在接受TechCrunch采访时表示。他补充道,涉及数据中心等大负荷设施的此类事件“正变得越来越频繁”。
此次事件与两年前发生在同一PJM电网上的事件如出一辙,如果数据中心的设计无法更从容地应对供电干扰,这可能预示着未来将出现更严重的电力中断。作为美国最大的电网运营商,PJM Interconnection管理着从新泽西州到伊利诺伊州的电网,为6700万用户提供服务。
根据PJM的数据,当输电线路故障时,数据中心切换至备用电源,导致约3.1吉瓦的负荷在30秒内骤减。 电网起初似乎已恢复正常,但不久后又有更多负荷脱网。在峰值时,PJM电网出现了3.49吉瓦的过剩电力。电网又花了11分钟才恢复稳定。路透社报道称,当时断开连接的数据中心约占PJM总需求的3%。
虽然几个百分点看似微不足道,但电力电网要求供需之间保持近乎完美的平衡。供需失衡会导致电压骤降或骤升。虽然电网和连接的设备能够应对轻微的波动,但较大的波动会触发电网或单个设施的故障安全机制,从而导致断开连接。
当北弗吉尼亚州的数据中心检测到故障输电线路引起的电压波动时,它们切换到了备用电源,从而将负载从电网中移除。随着越来越多的数据中心采取同样措施,累积的负荷减少将微小的供电下降转化为更大的需求下降,导致供电激增并引发灯光闪烁。
大多数数据中心都依赖于瞬间决策,本周断开连接的数据中心也不例外。据独立电力系统运营商(IESO)高级市场模型专家阿里·扎因·巴纳特瓦拉(Ali Zain Banatwala)介绍,当电压骤降发生时,这些数据中心几乎在几秒内相继决定断开连接。
“我们需要找到一种方法,让这些彼此邻近的负荷能够依次断开或重新接入,”他说。采取更有序的做法将使电网运营商能够提前制定更完善的应对程序。
另一种方案是,在设计数据中心时,使其能够吸收供电中断的影响,而非直接断开连接。一家名为 ON.Energy 的初创公司一直在开发一款产品,旨在帮助数据中心和电网平稳度过本周此类事件。
该公司为整个数据中心园区开发了一套不间断电源系统,覆盖服务器、制冷机组及其他设备。本质上,该系统将数据中心置于一组电池之后,这些电池与先进的电力转换硬件相连。 电网端仅感知到单一、稳定且行为规范的负载,从而避免了单个组件造成的用电峰谷波动。ON.Energy的系统使数据中心能够灵活调整计算工作负载(包括AI训练),在不干扰电网的情况下实现负载的增减。
更重要的是,该系统使数据中心能够吸收电网的功率波动。 ON.Energy的系统不会断开连接,而是利用多余电力为电池充电;当电压下降时,则可向服务器供电。该系统还能在几毫秒内跟随电网变化,从而防止因电压骤降或骤升而引发的电力波动——正是这类波动导致了本周PJM电网的故障。
德·阿泽维多表示,ON.Energy目前正在四个数据中心园区内安装总容量达3吉瓦的系统。
电网运营商也已意识到这一问题。
例如,德·阿泽维多指出,ERCOT将要求数据中心等大负荷用户在电网中断时“维持运行”。
时间已所剩无几。本周的大规模断电规模是2024年类似事件的两倍——当时有60个数据中心同时断电,导致电网负荷减少1.5吉瓦。据Synapse Energy Economics统计,当时数据中心约占PJM负荷的6%。 到2040年,这一比例预计将达到24%。如果问题不能尽快得到解决,情况可能会变得更加严峻。
相关文章
马克·扎克伯格真的相信人工智能是面向每个人的吗?
正在加载播放器…Meta 本周推出了 Glimmer,这是一个开源权重的 AI 模型,任何人都可以下载并在个人硬件上运行——这与该公司更强大的模型 Muse Spark 形成了鲜明对比,后者仍锁定在其自有 API 之后。此次发布伴随着马克·扎克伯格(Mark Zuckerberg)的一封公开信,他在信中主张人工智能应向所有人开放,而非由少数几家实验室控制。但正如 Equity 节目主持人所指出的那样,这一愿景附带了几个重要的限制条件。在本期 TechCrunch 的 Equity 播客中,K
Meta 借鉴特斯拉的帐篷策略来构建数据中心
就在你以为 AI 数据中心热潮不可能再疯狂的时候,Meta 竟然在帐篷里建造了数据中心。这一策略似乎从特斯拉和 xAI 那里各取了一半精髓。据跟踪数据中心部署情况的 Cleanview 创始人迈克尔·托马斯(Michael Thomas)称,为了将建设时间缩短一半,Meta 在俄亥俄州新阿尔巴尼市郊外建造了六顶帐篷——或如该公司所称的“快速部署结构”。托马斯的发现并非完全新鲜事。Meta 首席执行官马克·扎克伯格去年在接受《信息》杂志采访时曾谈到,他计划使用防风雨帐篷来容纳公司的多吉瓦级数据
Groq 筹集 3.5 亿美元,以推动其从 AI 芯片向“新云”(neocloud)的战略转型
AI基础设施公司Groq已获得3.5亿美元的新融资,标志着其从专业芯片开发商向提供强大GPU和AI基础设施服务的“新云”提供商的持续转型。由Disruptive Technologies领投,Nvidia预计也将参与,本轮融资将Groq的估值定为35亿美元。这一数字较去年9月Nvidia通过许可协议收购该公司创始人兼首席执行官Jonathan Ross及核心团队成员时记录的69亿美元估值大幅下跌。公司发言人向TechCrunch澄清,估值降低并不构成“降价融资”(down round)。相反
相关专题推荐
评论 (0)
0/500

本周,华盛顿特区附近发生了一起输电线路故障。在正常情况下,电网可在数秒内恢复,但此次却耗时超过十分钟,原因是超过3吉瓦的数据中心负荷几乎在同一时间突然断开。
据通过家用电源插座运营物联网传感器网络的初创公司Ting Labs的数据显示,此次事件导致从北弗吉尼亚州到芝加哥的整个PJM电网范围内出现电压尖峰。
虽然此次事件并未引发大面积停电,但导致该地区多地灯光闪烁。这凸显了数据中心对电网影响日益加剧的现状,专家预计这一趋势将愈发普遍。
北弗吉尼亚州属于PJM管辖范围,该地区拥有全球最密集的数据中心集群。
“这就像煤矿里的金丝雀,”ON.Energy首席技术官里卡多·德·阿泽维多在接受TechCrunch采访时表示。他补充道,涉及数据中心等大负荷设施的此类事件“正变得越来越频繁”。
此次事件与两年前发生在同一PJM电网上的事件如出一辙,如果数据中心的设计无法更从容地应对供电干扰,这可能预示着未来将出现更严重的电力中断。作为美国最大的电网运营商,PJM Interconnection管理着从新泽西州到伊利诺伊州的电网,为6700万用户提供服务。
根据PJM的数据,当输电线路故障时,数据中心切换至备用电源,导致约3.1吉瓦的负荷在30秒内骤减。 电网起初似乎已恢复正常,但不久后又有更多负荷脱网。在峰值时,PJM电网出现了3.49吉瓦的过剩电力。电网又花了11分钟才恢复稳定。路透社报道称,当时断开连接的数据中心约占PJM总需求的3%。
虽然几个百分点看似微不足道,但电力电网要求供需之间保持近乎完美的平衡。供需失衡会导致电压骤降或骤升。虽然电网和连接的设备能够应对轻微的波动,但较大的波动会触发电网或单个设施的故障安全机制,从而导致断开连接。
当北弗吉尼亚州的数据中心检测到故障输电线路引起的电压波动时,它们切换到了备用电源,从而将负载从电网中移除。随着越来越多的数据中心采取同样措施,累积的负荷减少将微小的供电下降转化为更大的需求下降,导致供电激增并引发灯光闪烁。
大多数数据中心都依赖于瞬间决策,本周断开连接的数据中心也不例外。据独立电力系统运营商(IESO)高级市场模型专家阿里·扎因·巴纳特瓦拉(Ali Zain Banatwala)介绍,当电压骤降发生时,这些数据中心几乎在几秒内相继决定断开连接。
“我们需要找到一种方法,让这些彼此邻近的负荷能够依次断开或重新接入,”他说。采取更有序的做法将使电网运营商能够提前制定更完善的应对程序。
另一种方案是,在设计数据中心时,使其能够吸收供电中断的影响,而非直接断开连接。一家名为 ON.Energy 的初创公司一直在开发一款产品,旨在帮助数据中心和电网平稳度过本周此类事件。
该公司为整个数据中心园区开发了一套不间断电源系统,覆盖服务器、制冷机组及其他设备。本质上,该系统将数据中心置于一组电池之后,这些电池与先进的电力转换硬件相连。 电网端仅感知到单一、稳定且行为规范的负载,从而避免了单个组件造成的用电峰谷波动。ON.Energy的系统使数据中心能够灵活调整计算工作负载(包括AI训练),在不干扰电网的情况下实现负载的增减。
更重要的是,该系统使数据中心能够吸收电网的功率波动。 ON.Energy的系统不会断开连接,而是利用多余电力为电池充电;当电压下降时,则可向服务器供电。该系统还能在几毫秒内跟随电网变化,从而防止因电压骤降或骤升而引发的电力波动——正是这类波动导致了本周PJM电网的故障。
德·阿泽维多表示,ON.Energy目前正在四个数据中心园区内安装总容量达3吉瓦的系统。
电网运营商也已意识到这一问题。
例如,德·阿泽维多指出,ERCOT将要求数据中心等大负荷用户在电网中断时“维持运行”。
时间已所剩无几。本周的大规模断电规模是2024年类似事件的两倍——当时有60个数据中心同时断电,导致电网负荷减少1.5吉瓦。据Synapse Energy Economics统计,当时数据中心约占PJM负荷的6%。 到2040年,这一比例预计将达到24%。如果问题不能尽快得到解决,情况可能会变得更加严峻。
马克·扎克伯格真的相信人工智能是面向每个人的吗?
正在加载播放器…Meta 本周推出了 Glimmer,这是一个开源权重的 AI 模型,任何人都可以下载并在个人硬件上运行——这与该公司更强大的模型 Muse Spark 形成了鲜明对比,后者仍锁定在其自有 API 之后。此次发布伴随着马克·扎克伯格(Mark Zuckerberg)的一封公开信,他在信中主张人工智能应向所有人开放,而非由少数几家实验室控制。但正如 Equity 节目主持人所指出的那样,这一愿景附带了几个重要的限制条件。在本期 TechCrunch 的 Equity 播客中,K
Meta 借鉴特斯拉的帐篷策略来构建数据中心
就在你以为 AI 数据中心热潮不可能再疯狂的时候,Meta 竟然在帐篷里建造了数据中心。这一策略似乎从特斯拉和 xAI 那里各取了一半精髓。据跟踪数据中心部署情况的 Cleanview 创始人迈克尔·托马斯(Michael Thomas)称,为了将建设时间缩短一半,Meta 在俄亥俄州新阿尔巴尼市郊外建造了六顶帐篷——或如该公司所称的“快速部署结构”。托马斯的发现并非完全新鲜事。Meta 首席执行官马克·扎克伯格去年在接受《信息》杂志采访时曾谈到,他计划使用防风雨帐篷来容纳公司的多吉瓦级数据
Groq 筹集 3.5 亿美元,以推动其从 AI 芯片向“新云”(neocloud)的战略转型
AI基础设施公司Groq已获得3.5亿美元的新融资,标志着其从专业芯片开发商向提供强大GPU和AI基础设施服务的“新云”提供商的持续转型。由Disruptive Technologies领投,Nvidia预计也将参与,本轮融资将Groq的估值定为35亿美元。这一数字较去年9月Nvidia通过许可协议收购该公司创始人兼首席执行官Jonathan Ross及核心团队成员时记录的69亿美元估值大幅下跌。公司发言人向TechCrunch澄清,估值降低并不构成“降价融资”(down round)。相反





首页






