斷落的電線揭露了 AI 資料中心的問題。以下是解決方案。

本週在華盛頓特區附近發生了一起輸電線路故障。在正常情況下,電網應能在數秒內恢復,但這次卻花了超過十分鐘,原因是超過 3 吉瓦的資料中心負載幾乎在同一時間脫離電網。
根據透過家用電源插座營運物聯網感測器網路的新創公司「Ting Labs」的數據顯示,這起事件導致從北維吉尼亞州到芝加哥的整個PJM電網出現電壓驟升現象。
雖然此次事件並未引發大面積停電,但導致該地區各地燈光閃爍。這凸顯了資料中心對電網日益增大的影響,專家預期此趨勢將變得更加普遍。
北維吉尼亞州隸屬於 PJM 管轄範圍,該地區擁有全球最密集的資料中心群。
「這就像是煤礦裡的金絲雀,」ON.Energy 首席技術長里卡多·德·阿澤維多(Ricardo de Azevedo)在接受 TechCrunch 採訪時表示。他補充道,這類涉及數據中心等大負載的事件正「越來越頻繁地發生」。
這起事件與兩年前發生在同一 PJM 電網上的事件如出一轍,若資料中心未能設計得足以更從容地應對供電干擾,這可能預示著未來將發生更嚴重的供電中斷。PJM Interconnection 作為美國最大的電網營運商,管理著從紐澤西州到伊利諾伊州的電網,並為 6,700 萬名用戶提供服務。
根據 PJM 的數據,當輸電線路故障時,資料中心切換至備用電源,導致約 3.1 吉瓦的負載在 30 秒內驟減。 電網起初看似已恢復正常,但不久後又有更多負載脫離系統。在峰值時,PJM 電網出現超過 3.49 吉瓦的過剩電力,又花了 11 分鐘才恢復穩定。路透社報導指出,當時斷電的資料中心約佔 PJM 總用電需求的 3%。
雖然幾個百分點看似微不足道,但電力網需要供需之間近乎完美的平衡。供需失衡會導致電壓驟降或驟升。雖然電網及連線設備能夠應對輕微的波動,但較大的波動會觸發電網或個別設施的故障安全機制,進而導致斷電。
當北維吉尼亞州的数据中心偵測到故障輸電線路引起的電壓波動時,便切換至備用電源,將其負載從電網中移除。隨著越來越多的数据中心採取相同措施,累積的負載減少將微小的供電下降轉化為更大的需求下降,進而導致供電激增及燈光閃爍。
大多數資料中心都需在瞬間做出決策,本週斷電的資料中心也不例外。根據獨立電力系統營運商(Independent Electricity System Operator)資深市場模型專家阿里·扎因·巴納特瓦拉(Ali Zain Banatwala)表示,當電壓驟降發生時,這些資料中心幾乎在幾秒內相繼決定斷電。
「我們需要找到一種方法,讓這些位置相鄰的負載能夠依序斷電或重新連線,」他表示。採取更有序的做法,將使電網營運商能夠預先制定更完善的應變程序。
另一種方案是,在設計數據中心時,使其能夠吸收供電中斷的影響,而非直接斷電。一家名為 ON.Energy 的新創公司,正致力開發一款產品,協助數據中心與電網共同應對類似本週這類的突發事件。
該公司開發了一套適用於整個資料中心園區的不間斷電源系統,涵蓋伺服器、冷卻機組及其他設備。簡而言之,該系統將資料中心置於一組電池陣列之後,而這組電池陣列則連接至先進的電力轉換硬體。 電網端所見僅為單一、穩定且行為規律的負載,從而避免了個別組件造成的用電高峰與低谷。ON.Energy 的系統使資料中心能夠調整運算工作負載(包括 AI 訓練)的規模,無論是增加或減少,都不會干擾電網。
更重要的是,該系統讓資料中心能夠吸收來自電網的電力波動。 ON.Energy 的系統無需斷開連接,而是能利用多餘電力為電池充電;當電壓下降時,則可為伺服器供電。該系統還能於數毫秒內跟隨電網的變化,從而防止因電壓驟降或驟升而引發的電壓波動——這正是本週 PJM 遭遇問題的主因。
德·阿澤維多表示,ON.Energy 目前正在四個資料中心園區內安裝總計 3 吉瓦的系統。
電網管理單位也已意識到這個問題。
例如,德·阿澤維多指出,ERCOT 將要求資料中心等大負載用戶在供電中斷時「維持運行」。
時間已所剩無幾。本週的大規模斷電規模是 2024 年類似事件的兩倍——當時有 60 座資料中心同時斷電,導致電網負載減少 1.5 吉瓦。根據 Synapse Energy Economics 的數據,當時資料中心約佔 PJM 負載的 6%。 預計到2040年,這一比例將達到24%。若不盡快解決此問題,情況可能會變得更加嚴峻。
相關文章
馬克·扎克伯格真的相信人工智慧是面向每個人的嗎?
正在載入播放器…Meta 本週推出了 Glimmer,這是一個開源權重的 AI 模型,任何人都可以下載並在個人硬體上執行——這與該公司更強大的模型 Muse Spark 形成了鮮明對比,後者仍鎖定在其自有 API 之後。此次釋出伴隨著馬克·扎克伯格(Mark Zuckerberg)的一封公開信,他在信中主張人工智慧應向所有人開放,而非由少數幾家實驗室控制。但正如 Equity 節目主持人所指出的那樣,這一願景附帶了幾個重要的限制條件。在本期 TechCrunch 的 Equity 播客中,K
Meta 借鑑特斯拉的帳篷策略來構建資料中心
就在你以為 AI 資料中心熱潮不可能再瘋狂的時候,Meta 竟然在帳篷裡建造了資料中心。這一策略似乎從特斯拉和 xAI 那裡各取了一半精髓。據跟蹤資料中心部署情況的 Cleanview 創始人邁克爾·托馬斯(Michael Thomas)稱,為了將建設時間縮短一半,Meta 在俄亥俄州新阿爾巴尼市郊外建造了六頂帳篷——或如該公司所稱的“快速部署結構”。托馬斯的發現並非完全新鮮事。Meta 執行長馬克·扎克伯格去年在接受《資訊》雜誌採訪時曾談到,他計劃使用防風雨帳篷來容納公司的多吉瓦級資料
Groq 籌集 3.5 億美元,以推動其從 AI 晶片向“新雲”(neocloud)的戰略轉型
AI基礎設施公司Groq已獲得3.5億美元的新融資,標誌著其從專業晶片開發商向提供強大GPU和AI基礎設施服務的“新雲”提供商的持續轉型。由Disruptive Technologies領投,Nvidia預計也將參與,本輪融資將Groq的估值定為35億美元。這一數字較去年9月Nvidia透過許可協議收購該公司創始人兼執行長Jonathan Ross及核心團隊成員時記錄的69億美元估值大幅下跌。公司發言人向TechCrunch澄清,估值降低並不構成“降價融資”(down round)。相反
相關專題推薦
評論 (0)
0/500

本週在華盛頓特區附近發生了一起輸電線路故障。在正常情況下,電網應能在數秒內恢復,但這次卻花了超過十分鐘,原因是超過 3 吉瓦的資料中心負載幾乎在同一時間脫離電網。
根據透過家用電源插座營運物聯網感測器網路的新創公司「Ting Labs」的數據顯示,這起事件導致從北維吉尼亞州到芝加哥的整個PJM電網出現電壓驟升現象。
雖然此次事件並未引發大面積停電,但導致該地區各地燈光閃爍。這凸顯了資料中心對電網日益增大的影響,專家預期此趨勢將變得更加普遍。
北維吉尼亞州隸屬於 PJM 管轄範圍,該地區擁有全球最密集的資料中心群。
「這就像是煤礦裡的金絲雀,」ON.Energy 首席技術長里卡多·德·阿澤維多(Ricardo de Azevedo)在接受 TechCrunch 採訪時表示。他補充道,這類涉及數據中心等大負載的事件正「越來越頻繁地發生」。
這起事件與兩年前發生在同一 PJM 電網上的事件如出一轍,若資料中心未能設計得足以更從容地應對供電干擾,這可能預示著未來將發生更嚴重的供電中斷。PJM Interconnection 作為美國最大的電網營運商,管理著從紐澤西州到伊利諾伊州的電網,並為 6,700 萬名用戶提供服務。
根據 PJM 的數據,當輸電線路故障時,資料中心切換至備用電源,導致約 3.1 吉瓦的負載在 30 秒內驟減。 電網起初看似已恢復正常,但不久後又有更多負載脫離系統。在峰值時,PJM 電網出現超過 3.49 吉瓦的過剩電力,又花了 11 分鐘才恢復穩定。路透社報導指出,當時斷電的資料中心約佔 PJM 總用電需求的 3%。
雖然幾個百分點看似微不足道,但電力網需要供需之間近乎完美的平衡。供需失衡會導致電壓驟降或驟升。雖然電網及連線設備能夠應對輕微的波動,但較大的波動會觸發電網或個別設施的故障安全機制,進而導致斷電。
當北維吉尼亞州的数据中心偵測到故障輸電線路引起的電壓波動時,便切換至備用電源,將其負載從電網中移除。隨著越來越多的数据中心採取相同措施,累積的負載減少將微小的供電下降轉化為更大的需求下降,進而導致供電激增及燈光閃爍。
大多數資料中心都需在瞬間做出決策,本週斷電的資料中心也不例外。根據獨立電力系統營運商(Independent Electricity System Operator)資深市場模型專家阿里·扎因·巴納特瓦拉(Ali Zain Banatwala)表示,當電壓驟降發生時,這些資料中心幾乎在幾秒內相繼決定斷電。
「我們需要找到一種方法,讓這些位置相鄰的負載能夠依序斷電或重新連線,」他表示。採取更有序的做法,將使電網營運商能夠預先制定更完善的應變程序。
另一種方案是,在設計數據中心時,使其能夠吸收供電中斷的影響,而非直接斷電。一家名為 ON.Energy 的新創公司,正致力開發一款產品,協助數據中心與電網共同應對類似本週這類的突發事件。
該公司開發了一套適用於整個資料中心園區的不間斷電源系統,涵蓋伺服器、冷卻機組及其他設備。簡而言之,該系統將資料中心置於一組電池陣列之後,而這組電池陣列則連接至先進的電力轉換硬體。 電網端所見僅為單一、穩定且行為規律的負載,從而避免了個別組件造成的用電高峰與低谷。ON.Energy 的系統使資料中心能夠調整運算工作負載(包括 AI 訓練)的規模,無論是增加或減少,都不會干擾電網。
更重要的是,該系統讓資料中心能夠吸收來自電網的電力波動。 ON.Energy 的系統無需斷開連接,而是能利用多餘電力為電池充電;當電壓下降時,則可為伺服器供電。該系統還能於數毫秒內跟隨電網的變化,從而防止因電壓驟降或驟升而引發的電壓波動——這正是本週 PJM 遭遇問題的主因。
德·阿澤維多表示,ON.Energy 目前正在四個資料中心園區內安裝總計 3 吉瓦的系統。
電網管理單位也已意識到這個問題。
例如,德·阿澤維多指出,ERCOT 將要求資料中心等大負載用戶在供電中斷時「維持運行」。
時間已所剩無幾。本週的大規模斷電規模是 2024 年類似事件的兩倍——當時有 60 座資料中心同時斷電,導致電網負載減少 1.5 吉瓦。根據 Synapse Energy Economics 的數據,當時資料中心約佔 PJM 負載的 6%。 預計到2040年,這一比例將達到24%。若不盡快解決此問題,情況可能會變得更加嚴峻。
馬克·扎克伯格真的相信人工智慧是面向每個人的嗎?
正在載入播放器…Meta 本週推出了 Glimmer,這是一個開源權重的 AI 模型,任何人都可以下載並在個人硬體上執行——這與該公司更強大的模型 Muse Spark 形成了鮮明對比,後者仍鎖定在其自有 API 之後。此次釋出伴隨著馬克·扎克伯格(Mark Zuckerberg)的一封公開信,他在信中主張人工智慧應向所有人開放,而非由少數幾家實驗室控制。但正如 Equity 節目主持人所指出的那樣,這一願景附帶了幾個重要的限制條件。在本期 TechCrunch 的 Equity 播客中,K
Meta 借鑑特斯拉的帳篷策略來構建資料中心
就在你以為 AI 資料中心熱潮不可能再瘋狂的時候,Meta 竟然在帳篷裡建造了資料中心。這一策略似乎從特斯拉和 xAI 那裡各取了一半精髓。據跟蹤資料中心部署情況的 Cleanview 創始人邁克爾·托馬斯(Michael Thomas)稱,為了將建設時間縮短一半,Meta 在俄亥俄州新阿爾巴尼市郊外建造了六頂帳篷——或如該公司所稱的“快速部署結構”。托馬斯的發現並非完全新鮮事。Meta 執行長馬克·扎克伯格去年在接受《資訊》雜誌採訪時曾談到,他計劃使用防風雨帳篷來容納公司的多吉瓦級資料
Groq 籌集 3.5 億美元,以推動其從 AI 晶片向“新雲”(neocloud)的戰略轉型
AI基礎設施公司Groq已獲得3.5億美元的新融資,標誌著其從專業晶片開發商向提供強大GPU和AI基礎設施服務的“新雲”提供商的持續轉型。由Disruptive Technologies領投,Nvidia預計也將參與,本輪融資將Groq的估值定為35億美元。這一數字較去年9月Nvidia透過許可協議收購該公司創始人兼執行長Jonathan Ross及核心團隊成員時記錄的69億美元估值大幅下跌。公司發言人向TechCrunch澄清,估值降低並不構成“降價融資”(down round)。相反





首頁






