AI 數據中心學習比特幣礦工首度掌握的電力技巧
每一個你從 AI 聊天機器人獲得的答案都始於電力。文字出現在你的螢幕上,但實際的運算發生在一棟充滿電腦晶片的遙遠建築中。這些晶片消耗電力、傳輸數據,並產生足夠的熱量,需要 AI 數據中心的重型冷卻系統來處理。
當你將這個過程乘以數百萬的提示、圖像請求和商業任務時,你開始理解為什麼對一個看似輕飄飄的問題的快速回答,實際上對電廠和電纜造成了實質的需求。
電力公司被要求以巨大的、集中化的區塊來供應這種需求。你平均一個大型數據中心的用電量可以與一個小城市相當,而公司可以比電力公司更快地計劃和建設一個數據中心。
電力公司還必須為客戶使用最多電力的時段做好準備,即使在普通時段有些容量未被使用。簡而言之,數據中心希望在電網能提供之前就獲得電力。
一個解決方案是建設新的發電廠。但這是一個非常昂貴且耗時的解決方案,可能需要數十億美元和數年的時間才能投入運營。
然而,另一個解決方案是將部分計算工作移到其他時段。
聊天機器人的回覆通常需要立即出現,但內部實驗或過夜的視頻處理隊列可以等待。能夠區分這些工作的軟體可以在電力緊張時減慢可以等待的工作,然後在有更多電力時讓它追趕。
德克薩斯州的一個小實驗展示了這種安排可能的樣子。
Luxor Energy,一家源於比特幣挖礦的公司,與 Bentaus 合作,後者製作控制電腦晶片使用多少電力的軟體。他們共同控制了一個 Nvidia B200,這是一個為 AI 工作而設計的高效能晶片。
當這個晶片正在進行推理時,這意味著使用訓練過的 AI 模型來產生答案,軟體告訴它減少電力消耗。
這些公司表示,晶片的電力消耗在半秒內降至正常的約 25%,並且在限制期間處理的請求較少。
Luxor 的首席運營官 Ethan Vera 告訴 CryptoSlate,沒有工作失敗,且正在進行的工作沒有丟失。當限制結束時,晶片恢復到全速運行。
Luxor 和 Bentaus 表示,他們的公開演示“沒有造成干擾”,但這句話需要一些翻譯。從操作員的角度來看,工作存活下來並以全速恢復。
然而,客戶可能仍然需要更長的時間才能獲得答案,因為在限制期間晶片完成的工作較少。任何使 AI 具備靈活性的計劃都將取決於這種延遲發生的頻率、誰經歷了它,以及那些客戶被承諾了什麼。
這次實驗是成功的,但僅涉及一個晶片。大型數據中心包含數萬個晶片,以及伺服器、冷卻系統、儲存設備和網絡設備。
這次測試使更廣泛的想法變得更容易看見:一個 AI 數據中心可以根據緊急程度對工作進行排序,並偶爾向電網請求減少電力。
德克薩斯州缺乏供應等待的電腦的電力
當新的數據中心的增長速度超過新的電力基礎設施時,德克薩斯州就是最好的例子。
德克薩斯州電力可靠性委員會 (ERCOT) 操作著為該州大部分地區提供服務的電網。7 月 22 日,電力使用達到初步記錄的 91,089 兆瓦,這個數字在數據最終確定之前是非官方的。
ERCOT 表示,一兆瓦可以在高峰時段為約 250 戶住宅客戶提供服務。根據這個粗略的比較,這一記錄滿足了超過 2200 萬戶住宅客戶的需求。
德州州長格雷格·阿博特(Greg Abbott)在八月表示,德州電力可靠性委員會(ERCOT)正在審查超過474吉瓦的新電力使用連接請求,其中約90%來自數據中心。一吉瓦等於1000兆瓦,因此在紙面上,這個排隊請求的電力需求超過了ERCOT歷史最高用電量的五倍。
阿博特要求監管機構在項目進行之前進行審計。
在7月28日的初步審查中,ERCOT發現大約205吉瓦的電力需求有足夠的支持研究以符合第一批研究的資格,這不到474吉瓦總量的一半。阿博特的審計中斷了該審查。
監管機構在8月20日給予ERCOT更多時間,該機構表示將在8月31日之前發送有條件的合格決定。開發者可以提交重疊的提案,為未能獲得融資的項目保留位置,或要求多個地點為最終的校園提供電力。
德州進行審計的部分原因是,該列表已經與實際的物理可能性脫節,無法單獨指導電網規劃。
但即便如此,474吉瓦的需求顯示出對於擁有大量電力接入的土地的急迫需求。提議的機器數量遠遠超過了能夠為其服務的電纜數量。
根據今年發布的洛倫斯·伯克利國家實驗室的更新,數據中心在2030年可能會消耗美國11.8%的電力。其低估為9.5%,高估為15.3%。國際能源機構預計,數據中心將占到美國電力使用增長的一半,直到本十年結束。
但即使面對這樣的需求,先進經濟體的傳輸線路完成也可能需要四到八年。該機構表示,包括變壓器和電纜在內的關鍵設備的等待時間在過去三年中翻了一番。
AI公司往往以芯片為單位進行討論,但電力系統必須以城市為單位進行考量。一個B200可以消耗多達1000瓦特。Nvidia列出了完整的八GPU DGX B200伺服器的最大功耗約為14.3千瓦。一兆瓦等於1000千瓦,而德州對於非常大型電力用戶的新規則從75兆瓦開始。
根據ERCOT的住宅客戶比較,這個數量在高峰時段可以服務大約18750名客戶。它也可以為75000個一千瓦的GPU供電,至少在添加處理器、冷卻、網絡、電池和電力損失之前。
因此,學會如何控制和減少這些芯片的電力使用是理解如何管理整個數據中心電力使用的第一步,還有許多步驟。
這項工作的複雜性,無論是在軟件還是硬件需求上,都是為什麼電網規劃者將數據中心視為“固定負載”,這意味著電力必須在他們要求時隨時可用。
數據中心運營商希望昂貴的GPU持續運行,因為每一分鐘的閒置都會延遲客戶支付的工作。數千個芯片在單一大型AI任務上是緊密相互依賴的。
在某些時候,一組可能必須等待另一組完成才能繼續。如果你減慢了一組的速度,延遲可能會波及到附近的機器。
但數據中心中的所有計算工作不必立即完成或以全速運行。有些工作是時間敏感的,而其他工作則可以延遲或以較慢的速度運行而不會造成太大影響。有些甚至可以轉移到另一個電力更為充足的數據中心。
每個選擇都有權衡,但每個選擇都可以在特定時刻減少數據中心對當地電網的需求。
比特幣礦工教會了計算機如何產出
這一先例來自德州電網上的比特幣挖礦。比特幣礦工通過不斷運行計算機來競爭獲得獎勵。當一台機器關閉時,礦工就失去了在該期間賺取金錢的機會。
但當電力恢復時,機器幾乎可以立即恢復運作。沒有客戶在等待回應,也不需要保留未完成的計算工作。
德克薩斯州發現,基本概念稱為需求響應:當電力變得稀缺且昂貴時,大用戶有理由減少用電。
比特幣礦工特別適合這項交易。他們可以在批發價格飆升時關閉,因為在緊急情況下減少電力而獲得報酬,並且在幾個關鍵的夏季小時內減少傳輸費用。
ERCOT在四月的評估中將加密貨幣礦工描述為其緊急計劃中主要的價格敏感參與者。對於礦工來說,計算很簡單:當一兆瓦的價值超過機器可能賺取的比特幣時,就關閉機器。
當電力便宜時,比特幣挖礦負載保持接近滿負荷,當價格超過限制閾值後則下降。更高的哈希價格會將該閾值向上移動。來源:Subir Majumder,根據ERCOT數據
Luxor為比特幣礦工提供軟體、能源服務和金融產品,因此它以可以中斷的計算本能接觸AI。這項實驗詢問,為客戶服務的機器是否可以繼承一些對電力價格的服從。
隨著礦工將電力豐富的地點轉變為AI校園,這個問題變得越來越緊迫。如果電網用一個可以隨時關閉的比特幣礦場來交換一個全天候運行的數據中心,那麼它可能會放棄一個有價值的緊急制動。
數據中心的靈活性在很大程度上取決於其機器正在做什麼。
訓練是教導模型的漫長且計算密集的過程,隨著它處理大量數據不斷調整。推理是隨後發生的事情,當有人要求完成的模型提供答案、圖像、翻譯或預測時。這兩者為減少電力創造了不同的機會。
長時間的訓練運行有時可以在保存的檢查點暫停,然後稍後再繼續,儘管同步停止數千台機器並不簡單。推理可以由數百萬個較小的請求組成,其中一些來自期待立即得到答案的人,另一些來自可以在隊列中等待直到電力變得更容易或便宜的自動工作。
谷歌多年前就開始以這種方式整理其計算。在2023年,該公司描述了如何在當地電網承受壓力時延遲YouTube視頻處理等工作,或將這些工作發送到其他電力更充足的地區。人們期待立即運行的搜索、地圖和其他服務保持在線。
谷歌後來將同樣的想法應用於機器學習工作負載。到2026年3月,它表示已在美國幾個地區將一吉瓦的數據中心需求響應納入長期公用事業合同。
其中一些交易也可能幫助新的數據中心更快地連接到電網。
研究人員現在顯示這可以在模擬之外運作。在一篇經過同行評審的《自然能源》論文中,一個團隊描述了在菲尼克斯的一個Oracle雲設施進行的一項實驗。軟體在不推動優先工作超出其承諾性能水平的情況下,將256-GPU集群的電力使用減少了25%,持續了三小時。
關鍵在於決定如何吸收減速。負責決定哪些工作在何時運行的軟體,稱為排程器,保護緊急工作,並從截止日期較寬鬆的工作中提取節能。
隨著4CP間隔的機會增加,比特幣挖礦的負載下降。當挖礦收入較高時,反應會減弱。來源:Subir Majumder,根據ERCOT數據
領導這項工作的Emerald AI公司於8月25日宣布了一輪1.5億美元的融資,估值超過10億美元。它還表示,其軟體在整個數據中心中商業運行,消耗多個兆瓦。
每個網站的獨立性能數據並不可用,但即便如此,這輪融資顯示出靈活的AI已經超越了研究論文,進入了商業領域。
其他研究人員試圖估算AI設施在困難時段能夠可靠地承諾放棄多少電力。
芝加哥大學的一篇工作論文使用了四年的電價和4940萬個真實推理請求來建模答案。作者估計,專注於推理的設施可以承諾削減40%的需求。運行推理和訓練混合的設施可以承諾削減24.6%。
當模型擴展到10千兆瓦的艦隊時,這些百分比僅略微下降。主要限制來自客戶合同、工作移動的限制以及機器恢復全功率的急迫性。
阿爾伯塔大學的研究人員模擬了當AI工作可以延遲或在數據中心之間移動時,電網會發生什麼情況。在模型的最緊張情境中,這種靈活性使所需的發電廠容量減少了21%以上。在另一種情境中,當地電網擁擠時,儘管新發電的支出增加了7.1%,但供電的總成本減少了3.5%。
延遲工作的最大好處出現在前3小時,因此等待更長時間並沒有太大幫助。雖然這些都沒有消除建設新發電廠和輸電線的需求,但它顯示出電網可以以更少的基礎設施和更低的整體成本滿足更多的AI需求。
四個隱藏的時刻可以定價整整一年
Luxor實驗背後的資金來自德克薩斯電力市場的一個不尋常特徵。大型客戶幫助支付高壓輸電網的費用,而這部分費用可能取決於他們在整個年度中僅四個15分鐘的窗口內使用的電力。
這些窗口是6月、7月、8月和9月系統需求最高的時刻,稱為四個重合峰值,或4CPs。
問題是,沒有人知道4CP究竟何時發生,直到這個月結束。因此,大型電力用戶聘請預測員來觀察電網、天氣和電力需求,並預測何時可能出現高峰。
如果機率看起來足夠高,他們會在那15分鐘的窗口內減少用電。如果經常猜對,傳輸費用的節省可能是可觀的。這使得4CP成為工廠、比特幣礦場、電池,現在可能還有AI數據中心的一場持續預測和減電的遊戲。
這種潛在的收益使得許多虛假警報值得容忍。最新的2026 PUCT數據顯示,ERCOT的傳輸成本約為60億美元,平均4CP需求為80,859.8兆瓦。
這大約相當於每千瓦每年74.89美元。以這個速度,在四個高峰窗口期間100兆瓦的需求約代表749萬美元的年傳輸成本。
在不同的公用事業區域和合約中,實際的法案會有所不同,但這裡的財務激勵非常明確。一個大型數據中心在整個夏季的電力使用上可能會有數百萬美元的影響。為了捕捉那一小時的電力,額外切斷幾小時的電力可能是一筆非常划算的交易。
隨著4CP時間段的機會增加,比特幣挖礦的負載下降。當挖礦收入較高時,反應會減弱。來源:Subir Majumder,根據ERCOT數據
Luxor決定限制GPU本身,利用實時電網數據來決定何時行動。Vera表示,公司觀察到可能形成4CP窗口的跡象,然後向芯片發送自己的指令。ERCOT從未告訴GPU減速,且沒有涉及任何緊急電網計劃。
這基本上是一個私人的賭注,旨在預測電力需求的高峰,以降低該地點的傳輸費用。ERCOT將這種4CP自我限制與其運營的需求響應計劃分開分類。
這也讓半秒的反應時間變得有意義。4CP窗口持續15分鐘,因此GPU在半秒內達到較低功率水平或幾秒內達到幾乎沒有差別,對於傳輸節省來說幾乎沒有影響。
ERCOT的緊急計劃通常給參與的客戶10或30分鐘的時間來實現他們承諾的電力減少。一些其他電網服務則反應更快,要求客戶立即開始減少電力,並在10分鐘內達到完全減少。
如果AI硬體最終參與這些市場,亞秒級控制可能變得更有用。對於Luxor來說,GPU每多花一秒鐘限制功率,就是它可以用來賺錢的時間。
Bentaus已經在更大規模上測試了相同的基本想法。今年二月,CPower、Bentaus和Supermicro描述了一個加州的示範,使用一組配備B200 GPU的伺服器集群。
這些公司表示,該集群在不到20毫秒的時間內對與該州批發電力市場相關的信號作出反應,並將其電力使用減少了多達75%,同時仍然達到其承諾的性能水平。
德克薩斯州的實驗規模較小且範圍更窄:一個GPU對特定的傳輸計費激勵作出反應。但這為一個已經從單個芯片轉向伺服器集群和公用事業計劃的想法增加了另一個現實世界的測試。
關於德克薩斯州測試的知識仍然存在重要的空白。這些公司尚未披露運行的AI模型是什麼,或GPU在降低功率時持續了多長時間。他們沒有說明之前使用了多少電力,計算吞吐量下降了多少,或請求完成所需的時間延長了多少。
Luxor在德克薩斯州電力市場的代表驗證了電力減少,但尚未發表對該測試的獨立分析。
測試顯示,運行推理工作負載的B200可以在不失去正在進行的工作的情況下進行大幅度的功率削減。目前尚不清楚這對用戶等待時間有何影響,其他推理或訓練工作負載是否會以相同方式響應,或者這項技術能在整個數據中心節省多少電力。
GPU只是建築物電力費用的一部分。冷卻系統、網絡設備、存儲、泵和電力轉換也消耗電力。因此,將芯片的功率削減75%並不意味著數據中心從電網中提取的電力減少了75%。
在建築物的電表上測量的減少可能會小得多。
Luxor已經在德克薩斯州準備進行下一次測試,這次將使用一組Nvidia H100 GPU。Vera表示,擴展意味著需要建立能夠判斷哪些工作可以安全減速的軟體,然後協調正在進行這些工作的機器。它還必須遵守客戶所承諾的任何性能。
每次擴展,從一個GPU到一台伺服器、一個機架,最終到整個數據中心,都增加了一層複雜性。更多的設備需要電力,更多的機器必須協同運作,更多的客戶工作負載可能會或可能不會容忍減速。
德克薩斯州開始需要一些靈活性。2025年通過的第6號參議院法案要求某些大型電力用戶從2026年起在嚴重的電網緊急情況下減少消耗。它還要求一個計劃,支付至少75兆瓦的站點在預期出現問題時減少需求。
同時,該州也在重新考慮4CP。它的四個夏季高峰可能會錯過電網在壓力較大時的晚間和冬季時段。監管機構已提議用12CP取而代之,該計劃將根據每月的一個30分鐘高峰來計算傳輸費用。
ERCOT在四月的審查中得出了類似的結論:德克薩斯州有大量的需求響應,但並不總是在電網最需要的時候出現。4CP驅動了大多數的電力削減,但它的夏季高峰可能會錯過需求高峰和風能及太陽能產出低的時段。
ERCOT表示,這種不匹配是一個問題。新的發電廠和傳輸線需要數年時間,但靈活的需求可以在幾個月內增加。現在的挑戰是確保這種靈活性在正確的時間出現。
最困難的部分是證明數據中心可以可靠地削減電力。如果電網依賴於50兆瓦的消失,它需要知道該站點本來會使用多少電,然後用計量數據驗證減少的情況。
它還需要知道削減可以持續多久,以及當GPU重新啟動時會發生什麼。如果同時將數千個GPU重新啟動,數據中心可能會產生新的電力尖峰。
這使得客戶合同成為一個重要但被忽視的部分。一個數據中心可以正常運行互動和安全敏感的工作,同時將內部實驗、索引或夜間處理等工作放入靈活層級。
客戶可能會為這種靈活性支付更少的費用,而電網則支付數據中心在需要時提供可預測、可測量的電力削減。
這將使有關AI的一個事實無法忽視:並非每個計算都是同樣緊急的。該行業已經根據價格、速度和計算成本對工作進行排序,因此電力可能成為該計算中的另一個變量。
當電網緊張時,一幅圖像可能需要更長的時間來渲染,或者訓練運行可能推遲到明天,而其他服務則繼續進行。數據中心可以開始區分什麼是現在需要發生的,什麼可以等待,而不是將每個GPU周期視為同等重要。
Luxor的半秒電力削減是簡單的部分。在數千個GPU上做到這一點,既不違背對客戶的承諾,又能提供電網實際可以依賴的兆瓦,將會困難得多。
但這也是這個想法變得有趣的地方,因為AI面臨著電力問題,而電網則面臨靈活性問題,而數據中心恰好位於中間。它們擁有大量機器,這些機器的工作有時可以在幾秒、幾分鐘或幾個小時內移動,而不會被任何人注意到。
如果運營商能夠將這種靈活性轉化為可靠的電力節省,AI對電力的巨大需求可能會成為電網實際可以處理的問題。這可能使AI建設的下一階段同樣關注在正確的時間使用電力,而不是首先找到足夠的電力。
-- 價格
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。
猜你喜歡

Coinhouse收購Tilvest,鞏固其在加密貨幣管理中的地位

比特幣 BIP-110 論爭,與工作證明硬分叉相關

Ripple高管David Schwartz對BIP 110支持者表示反對

川普發幣「割韭菜」爽賺 14 億美元!調查報告:投資人血虧 47 億美元

AI 製造無限,BTC 製造稀缺:Web3 真正改變的不是生產關係,而是價值關係

如何辨別 pipedog 與鄰近的相同位元碼克隆

英國警察從封閉的暗網市場中查獲140萬美元的比特幣

熱門比特幣錢包面臨失去對新硬體設備的支持,因為關鍵安全橋樑停止接受新設備

薩爾瓦多比特幣海灘退燒!餐廳整月僅收 1 筆 BTC,民間回歸傳統刷卡

Bitcoin Knots 再次嘗試分叉 Bitcoin,因為其上次鏈在兩個區塊後死亡

BTC.top 創辦人出售一半 ETH 持有量,Bitcoin 面臨考驗

對話Epoch Ventures創始人:大規模資金輪動已開啟,四年週期已終結

Web3 領域 14 種,排除申請至 ICANN

CZ 不建議年輕人賣房投資加密貨幣

比特幣 ETF 淨資產突破 1009 億美元

Vinteum慶祝四周年並回顧成就

債務貨幣化:財政部隱藏赤字並用穩定幣剝奪儲蓄















