0
| 本文作者: 鄭佳美 | 2026-07-23 12:25 |

作者丨鄭佳美
編輯丨馬曉寧
過(guò)去兩年,全球人工智能行業(yè)最搶手的東西,是英偉達(dá) GPU。
從 OpenAI 到 Meta,再到 Google、Amazon,幾乎所有希望在 AI 領(lǐng)域占據(jù)優(yōu)勢(shì)的公司,都在爭(zhēng)奪計(jì)算資源。
行業(yè)最初盯著模型能力,后來(lái)逐漸發(fā)現(xiàn),模型背后的那套“機(jī)器”,同樣決定著迭代速度。
算法可以調(diào)整,數(shù)據(jù)可以補(bǔ)充,算力中心卻不能臨時(shí)搭建。
芯片要提前采購(gòu),機(jī)房要提前建設(shè),電力也要排隊(duì)接入。等模型方案確定后再尋找資源,往往已經(jīng)晚了。
于是,AI 行業(yè)出現(xiàn)了一個(gè)頗有反差的場(chǎng)景:一群研究最前沿軟件的公司,開(kāi)始忙著找土地、談能源、修數(shù)據(jù)中心。
就在這輪建設(shè)潮中,智譜完成了一座規(guī)模達(dá)到 1GW 的 AI 數(shù)據(jù)中心。據(jù)彭博社報(bào)道,該中心全部采用中國(guó)制造的芯片,并將用于模型訓(xùn)練。
單獨(dú)看,這像是一條國(guó)產(chǎn)芯片新聞。但放進(jìn)全球 AI 公司的動(dòng)作里,它更像一個(gè)新的產(chǎn)業(yè)信號(hào):大模型公司正在從算力使用者,變成算力基礎(chǔ)設(shè)施的組織者。

01
過(guò)去,大模型公司通常從云廠商手中購(gòu)買(mǎi)算力。
這套方式適合創(chuàng)業(yè)初期。公司不需要自己買(mǎi)地、建機(jī)房,也不必管理復(fù)雜的硬件集群,租用 GPU 就可以開(kāi)始訓(xùn)練。
但當(dāng)計(jì)算需求從幾百?gòu)埿酒鲩L(zhǎng)到幾萬(wàn)甚至幾十萬(wàn)張時(shí),云端資源很難像水龍頭一樣隨開(kāi)隨有。
前沿模型的訓(xùn)練可能持續(xù)數(shù)月,期間還要同時(shí)安排后訓(xùn)練、推理和大量實(shí)驗(yàn)。頭部公司需要的已經(jīng)不是一次性的計(jì)算資源,而是一套能夠長(zhǎng)期調(diào)動(dòng)的系統(tǒng)。
OpenAI 因此推進(jìn) Stargate,首批設(shè)施從 1GW 級(jí)起步,整體規(guī)劃達(dá)到數(shù) GW;
xAI 在孟菲斯建設(shè) Colossus,并把規(guī)模擴(kuò)大到約 2GW;Meta 的 Hyperion 目標(biāo)達(dá)到 5GW,其更大的基礎(chǔ)設(shè)施規(guī)劃還準(zhǔn)備繼續(xù)擴(kuò)張;
Anthropic 則通過(guò)與 Amazon 的長(zhǎng)期合作鎖定約 5GW 算力。Google 很早就圍繞 TPU 建立自己的計(jì)算集群,國(guó)內(nèi)的字節(jié)和智譜也都進(jìn)入了 1GW 級(jí)建設(shè)階段。
這些公司的方式并不相同。有的直接修建園區(qū),有的和云廠商深度綁定,有的擁有自研芯片。但它們面對(duì)的是同一個(gè)時(shí)間差:模型幾個(gè)月就會(huì)更新一次,數(shù)據(jù)中心卻需要幾年才能建成。
今天簽下的土地和電力合同,服務(wù)的可能是三年后的模型。所謂建設(shè)算力中心,其實(shí)是在為尚未確定的下一代技術(shù)提前留位置。

02
算力中心把 AI 公司帶進(jìn)了一個(gè)陌生世界。
軟件產(chǎn)品開(kāi)發(fā)完成后,可以近乎零成本地復(fù)制給更多用戶;數(shù)據(jù)中心卻需要土地、變電設(shè)施、冷卻設(shè)備、高速網(wǎng)絡(luò)和長(zhǎng)期能源合同。
服務(wù)器進(jìn)入機(jī)房前,可能已經(jīng)有數(shù)十億美元投入到看不見(jiàn)的土建和供電工程里。
過(guò)去,一家 AI 公司最重要的能力是招到研究人員、訓(xùn)練模型和推出產(chǎn)品。現(xiàn)在,它還要處理電網(wǎng)接入、施工進(jìn)度、設(shè)備折舊和資本安排。基礎(chǔ)設(shè)施基金、能源企業(yè)、地產(chǎn)商和長(zhǎng)期債務(wù),也開(kāi)始進(jìn)入大模型產(chǎn)業(yè)鏈。
這讓 AI 競(jìng)爭(zhēng)多了一層賭注。
頭部公司普遍相信,未來(lái)的模型會(huì)消耗更多計(jì)算資源,因此必須提前擴(kuò)建。雷峰網(wǎng)
但幾年后的訓(xùn)練方式會(huì)不會(huì)改變,新增算力能否被充分利用,模型收入又能否覆蓋持續(xù)增長(zhǎng)的成本,目前都沒(méi)有確定答案。
一座空閑的數(shù)據(jù)中心不會(huì)因?yàn)閷儆?AI 行業(yè)就變得更便宜。昂貴芯片只有持續(xù)運(yùn)行,才可能轉(zhuǎn)化為研發(fā)效率;一旦需求低于預(yù)期,它也可能迅速變成沉重的折舊負(fù)擔(dān)。
算法公司最擅長(zhǎng)預(yù)測(cè)下一個(gè)詞,現(xiàn)在卻不得不預(yù)測(cè)幾年后的電力需求。

03
智譜項(xiàng)目與海外同行最大的差別,在于它全部采用中國(guó)制造的芯片。雷峰網(wǎng)(公眾號(hào):雷峰網(wǎng))
全球公司的底層選擇已經(jīng)開(kāi)始分化:OpenAI 和 xAI 主要依賴(lài)英偉達(dá),Meta 在采購(gòu)英偉達(dá)的同時(shí)推進(jìn)自研 MTIA,Anthropic 使用 Amazon Trainium 與英偉達(dá),Google 堅(jiān)持 TPU,字節(jié)的相關(guān)項(xiàng)目采用華為昇騰。
智譜則把整座 1GW 數(shù)據(jù)中心放在國(guó)產(chǎn)芯片體系上運(yùn)行。
當(dāng)模型公司只是在云上租用算力時(shí),芯片更像一項(xiàng)被封裝好的服務(wù)。
開(kāi)始建設(shè)自己的數(shù)據(jù)中心后,底層硬件會(huì)牽動(dòng)整套系統(tǒng):服務(wù)器如何設(shè)計(jì),芯片之間如何通信,編譯器和訓(xùn)練框架如何適配,故障發(fā)生后如何恢復(fù),都需要重新磨合。
單顆芯片能夠運(yùn)行模型,和成千上萬(wàn)顆芯片能夠一起高效訓(xùn)練,并不是同一件事。
集群擴(kuò)大后,任何通信延遲、軟件兼容問(wèn)題或者設(shè)備故障,都可能讓大量機(jī)器停下來(lái)等待。
英偉達(dá)的優(yōu)勢(shì),很大一部分來(lái)自 CUDA 和長(zhǎng)期積累的工程生態(tài)。
使用這套體系擴(kuò)建算力,更像在已經(jīng)鋪好的高速公路上增加車(chē)道。智譜面對(duì)的情況更復(fù)雜:它既要擴(kuò)大車(chē)流,還要參與修路。
所以,1GW 只是一個(gè)工程規(guī)模,不能直接等同于模型能力。
這座數(shù)據(jù)中心最終有沒(méi)有價(jià)值,要看它能否穩(wěn)定承擔(dān)大規(guī)模訓(xùn)練,是否能保持較高利用率,以及能不能真正縮短 GLM 系列模型的迭代周期。
只有當(dāng)機(jī)房里的芯片持續(xù)轉(zhuǎn)化成新的模型和產(chǎn)品,算力中心才不只是一個(gè)醒目的數(shù)字。
過(guò)去,人們習(xí)慣通過(guò)排行榜和發(fā)布會(huì)觀察 AI 競(jìng)爭(zhēng)。下一輪差距,可能在模型登場(chǎng)前就已經(jīng)形成——藏在提前鎖定的電力、尚未安裝的服務(wù)器,以及那些需要幾年才能建成的數(shù)據(jù)中心里。
智譜進(jìn)入的,正是這場(chǎng)更慢、更重,也更難臨時(shí)追趕的比賽。
參考鏈接:
https://www.bloomberg.com/news/articles/2026-07-20/z-ai-completes-giant-data-center-with-chinese-chips-to-train-ai
https://x.com/lentils80/status/2079270703224811777?s=46


上車(chē),帶你看遍全球 AI 頂會(huì)精華
可獨(dú)家暢覽:
專(zhuān)家演講PPT
大會(huì)報(bào)告全文
熱門(mén)論文解讀
學(xué)術(shù)新星訪談

掃描上方二維碼
或點(diǎn)擊「閱讀原文」關(guān)注專(zhuān)區(qū)。
雷峰網(wǎng)原創(chuàng)文章,未經(jīng)授權(quán)禁止轉(zhuǎn)載。詳情見(jiàn)轉(zhuǎn)載須知。