輝達執行長稱 GPT-6 Astra 使用 10 萬顆 Blackwell GPU 訓練

輝達執行長稱 GPT-6 Astra 使用 10 萬顆 Blackwell GPU 訓練

By: WEEX|2026/09/07 07:52:34

WEEX觀察

  1. 關鍵在於輝達披露的叢集規模是否會成為前沿模型訓練的新基準,而非一次性的建置。若是如此,先進 GPU 與互連能力的取得可能會進一步集中於少數頂尖 AI 公司手中。
  2. 報導也指出第二個觀察重點:世代差距與晶片數量同樣重要。Blackwell、Hopper 與本土替代方案無法直接互換,因此僅以總數量進行比較,可能低估效能差距。
  3. 對於與加密貨幣相關的 AI 敘事而言,實際影響並非代幣立即受到衝擊,而是市場再次聚焦於算力稀缺、基礎設施瓶頸,以及較小型參與者若無法取得頂級集中式硬體,是否能真正參與競爭。

根據報導引用的公司披露,輝達執行長黃仁勳表示,GPT-6 Astra 使用超過 10 萬顆透過高速 NVLink72 叢集連接的 Grace Blackwell GPU 訓練。黃仁勳還表示,下一批將使用 40 萬顆 GPU,但未指明具體型號。

此次披露聚焦於訓練 GPT-6 Astra 所使用的硬體。黃仁勳表示,該系統使用超過 10 萬顆經由 NVLink72 連接的 Grace Blackwell GPU;NVLink72 是輝達可將 72 顆 GPU 置於同一高速互連網域中的架構。報導稱,下一批訓練計畫使用 40 萬顆 GPU,但未說明這些系統是否也會採用 Blackwell。

報導將這項披露置於美國與中國模型開發商當前 AI 基礎設施差距的背景下。字節跳動被描述為中國主要模型公司中最接近者,已連接約 3.6 萬顆 B200 GPU。其境內叢集據稱主要依賴基於 Hopper 的 H20 與 H800 系統。

報導中的其他算力數據仍較不明朗。據稱,Kimi 透過阿里巴巴取得約 2 萬顆 Hopper GPU,具體為 H200 型號,但阿里巴巴否認這一說法。DeepSeek 尚未披露用於 V4 訓練的完整硬體配置,但報導引用的洩漏資訊稱,該公司在 5 月約有 2 萬個相當於 H 系列的算力單位,其中包括約 1.6 萬個華為 950 算力單位。

報導還指出,用於 Astra 的 Blackwell 平台已不再是輝達最新一代產品。Vera Rubin 已進入大規模量產,輝達估計,使用 Rubin 訓練大型混合專家模型所需的 GPU 數量,可能僅為使用 Blackwell 時的四分之一。根據報導,尚無中國公司公開披露曾使用 10 萬顆同世代先進 GPU 訓練單一模型。

為何重要

這項披露之所以重要,是因為它進一步凸顯前沿 AI 開發與更廣泛市場中模型競爭敘事之間的差距。在最頂端的競爭中,效能愈來愈不僅取決於演算法或資料,也取決於誰能組建、供電並互連由最新晶片構成的超大型叢集。

這對 AI 供應商本身以外的領域也有更廣泛的影響。大型模型的進步愈依賴稀缺且高度整合的硬體堆疊,戰略重心就愈會轉向半導體供應、網路架構及取得先進算力的能力。對與加密貨幣連結的 AI 領域而言,這使焦點維持在基礎設施限制,而非僅是圍繞 AI 品牌的熱情。

本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。

關於WEEX觀察

WEEX觀察是WEEX專為加密投資者打造的智能投研資訊板塊,深度聚合Web3、AI與全球宏觀財經前沿動態,以獨特視角輸出獨立研報與深度洞察,助力用戶快人一步捕捉市場趨勢與交易先機。

iconiconiconiconiconiconiconiconicon
客戶服務:@weikecs
商務合作:@weikecs
量化做市商合作:bd@weex.com