0
| 本文作者: 包永剛 | 2026-06-01 18:20 |
過去兩年,AI基礎(chǔ)設(shè)施行業(yè)有一個幾乎無人質(zhì)疑的共識:GPU決定AI的上限。
從大模型訓(xùn)練到推理部署,產(chǎn)業(yè)的關(guān)注點幾乎都圍繞著GPU展開。顯存夠不夠大、帶寬夠不夠高、Token吞吐量能達(dá)到多少,成為衡量AI基礎(chǔ)設(shè)施能力的核心指標(biāo)。
但Agent的出現(xiàn),正在改變這套邏輯。
與傳統(tǒng)聊天機器人不同,Agent并不只是完成一次問答,而是需要持續(xù)執(zhí)行任務(wù)。它需要調(diào)用工具、訪問數(shù)據(jù)庫、瀏覽網(wǎng)頁、管理記憶系統(tǒng),甚至不斷創(chuàng)建和調(diào)度新的子Agent協(xié)同完成工作。
當(dāng)AI開始從生成答案轉(zhuǎn)向執(zhí)行任務(wù),一個長期被GPU光環(huán)掩蓋的角色重新回到了舞臺中央——CPU。
Computex 2026臺北國際電腦展期間,英特爾發(fā)布了首款基于Intel 18A工藝打造的數(shù)據(jù)中心處理器——至強6+(代號Clearwater Forest)。這款處理器擁有288個能效核(E-Core),還擁有一個非常吸引人的特性,在實際測試中,一顆288核至強6+可以輕松同時部署400至500個Agent。

這背后折射出的,并不僅僅是一顆新CPU的發(fā)布,而是Agent時代AI基礎(chǔ)設(shè)施底層邏輯的一次深刻變化。
一顆CPU能同時運行500個Agent的關(guān)鍵是什么?
如果說ChatGPT時代的AI更像一個超級搜索框,那么Agent時代的AI更像一個數(shù)字員工。
一個典型Agent任務(wù)往往包含多個環(huán)節(jié):用戶提出需求,Agent拆解任務(wù),調(diào)用多個工具,查詢知識庫,啟動多個子Agent協(xié)同處理,最終匯總結(jié)果并返回。整個過程中,真正負(fù)責(zé)生成內(nèi)容的依然是GPU,但大量調(diào)度、編排、路由、資源管理以及任務(wù)協(xié)調(diào)工作,則落在了CPU身上。
英特爾數(shù)據(jù)中心集團技術(shù)產(chǎn)品總監(jiān)楊錦文表示:"隨著生成式AI帶來的發(fā)展,CPU和GPU的配比正在從傳統(tǒng)的1:8逐漸變成1:4、1:2,甚至1:1的場景,在部分強化學(xué)習(xí)場景中甚至出現(xiàn)了反轉(zhuǎn)。"

1:1,甚至CPU比GPU更多——這個比例放在三年前幾乎不可想象。而這,恰恰是至強6+發(fā)布的背景。

對于Agent來說,CPU面臨兩個全新的挑戰(zhàn)。
第一個挑戰(zhàn)是密度。企業(yè)希望在同樣的機架空間內(nèi)運行更多Agent,隨著Agent數(shù)量增加,CPU需要同時管理大量任務(wù)調(diào)度和資源分配。
第二個挑戰(zhàn)是響應(yīng)速度。Agent運行過程中會頻繁創(chuàng)建、啟動和銷毀任務(wù)實例,如果啟動速度過慢,即便擁有足夠算力,也難以滿足實際業(yè)務(wù)需求。
英特爾SoC架構(gòu)專家曾義說,"要滿足Agent頻繁創(chuàng)建、啟動和銷毀任務(wù)實例的特性,希望在同一顆CPU上部署更高密度的工作負(fù)載。這也是為什么至強6+是首款單SoC支持288個核的架構(gòu),這能夠幫助我們以非常好的TCO(總體擁有成本)去滿足Agent上的需求。"
為了實現(xiàn)這種密度,英特爾在至強6+上采用了英特爾Foveros Direct 3D的三維封裝技術(shù)。

具體而言,是將基于Intel 18A工藝制造的計算Tile,垂直堆疊在基于Intel 3工藝的底層Tile之上,再通過EMIB封裝技術(shù)完成各模塊之間的互聯(lián)。整顆處理器由4個基于18A工藝的計算芯片構(gòu)成,每個芯片包含24個核心,堆疊在3顆基底芯片上方,基底芯片則集成了片上網(wǎng)狀互聯(lián)架構(gòu)、末級緩存和內(nèi)存子系統(tǒng)——一共29個芯片組件,才構(gòu)成了這顆288核的處理器。
內(nèi)存規(guī)格同樣針對Agent以及傳統(tǒng)負(fù)載的需求進行了強化:12通道DDR5,運行速率最高8000 MT/s,末級緩存高達(dá)576MB,比上一代產(chǎn)品提升超過5倍。96條PCIe Gen 5通道則保證了跨設(shè)備的數(shù)據(jù)流動不會成為瓶頸。
清楚至強6+的特性后,再來看至強6+能夠用1顆芯片運行數(shù)百個Agent的原因。楊錦文說,具體能運行多少個Agent,取決于具體的配置。云服務(wù)中常見配置,通常是"2個核心配4G內(nèi)存"或"1個核心配2G內(nèi)存"。按照這個標(biāo)準(zhǔn),288核架構(gòu)下同時部署400至500個Agent"已經(jīng)是很常規(guī)的操作"。
他也補充:"上限取決于客戶自身的訴求,以及要在什么樣的SLA(服務(wù)等級協(xié)議)的服務(wù)協(xié)議下提供Agent服務(wù)。"
換句話說,Agent時代對CPU的新要求,不再只是跑得快,而是能同時管理更多任務(wù)。

在性能提升方面,至強6+對比上一代產(chǎn)品整體性能最高提升2.26倍,每瓦性能最高提升1.55倍。與同類競爭產(chǎn)品相比,每線程性能和每線程每瓦性能均高出最多30%,后者是虛擬化數(shù)據(jù)中心工作負(fù)載最核心的評估維度。

對于使用第二代至強的客戶,升級至強6+的理由更加直接,服務(wù)器整合比可以達(dá)到9:1,物理空間減少近80%,能源節(jié)省73%。德意志電信旗下的T-Systems已將至強6+定位為其T-Cloud私有智能體AI基礎(chǔ)設(shè)施的關(guān)鍵組件,理由正是海量內(nèi)核數(shù)量與出色的能效。

Agent時代,網(wǎng)絡(luò)成為瓶頸
過去幾年,AI產(chǎn)業(yè)形成了一種慣性思維:GPU決定一切。
但Agent正在讓行業(yè)意識到一個新的現(xiàn)實——系統(tǒng)能力開始比單芯片能力更重要。
一個Agent完成任務(wù)的完整流程是:CPU負(fù)責(zé)調(diào)度,GPU負(fù)責(zé)推理,網(wǎng)絡(luò)負(fù)責(zé)數(shù)據(jù)交換,內(nèi)存負(fù)責(zé)上下文保存,軟件負(fù)責(zé)資源編排。任何一個環(huán)節(jié)出現(xiàn)瓶頸,都會影響最終的體驗。
英特爾執(zhí)行副總裁兼數(shù)據(jù)中心事業(yè)部總經(jīng)理Kevork Kechichian指出:"AI的擴展之道,不在于各部件的疊加,而在于系統(tǒng)的協(xié)同運作。隨著AI走向智能體時代,編排、并發(fā)與數(shù)據(jù)流動成為了新的限制因素。"
這也是為什么英特爾在發(fā)布至強6+的同時,還發(fā)布了全新的以太網(wǎng)E835控制器及網(wǎng)絡(luò)適配器。因為當(dāng)數(shù)百個Agent同時工作時,網(wǎng)絡(luò)已經(jīng)成為影響效率的重要因素。
長期以來,網(wǎng)卡在AI基礎(chǔ)設(shè)施中的存在感并不高。
但當(dāng)Agent開始頻繁調(diào)用外部工具和服務(wù),節(jié)點之間的東西向流量迅速增長,網(wǎng)絡(luò)的重要性開始上升。英特爾技術(shù)專家Kevin Cai告訴雷峰網(wǎng)(公眾號:雷峰網(wǎng)):"AI的發(fā)展正在對網(wǎng)絡(luò)帶寬、時延以及能效提出全新要求,網(wǎng)絡(luò)已經(jīng)成為現(xiàn)代AI基礎(chǔ)設(shè)施中的關(guān)鍵組成部分。"

E835支持最高200GbE吞吐量,覆蓋2×25GbE、4×25GbE、2×100GbE、1×200GbE等多種端口配置,可通過英特爾以太網(wǎng)端口配置工具(EPCT)靈活定制。完成首次驗證后,僅需兩步即可重新配置端口數(shù)量和速率。RDMA(RoCEv2/iWARP)支持可繞過CPU直接在服務(wù)器之間傳輸數(shù)據(jù),動態(tài)設(shè)備個性化(DDP)技術(shù)則進一步降低了數(shù)據(jù)包處理開銷。
E835真正的差異化在功耗上。英特爾給出的數(shù)據(jù)是,在滿載200G線速運行時,E835的功耗比同類主要競爭對手低28%至47%,最終實現(xiàn)1.4至1.9倍的每瓦性能優(yōu)勢。對于正在把越來越多算力集中進機架的數(shù)據(jù)中心來說,同樣的散熱和供電預(yù)算意味著可以部署更高密度的網(wǎng)絡(luò)。

在電信場景中,E835還有一個容易被忽略的細(xì)節(jié),配合至強6+的高精度時鐘提取功能,可以在5G專網(wǎng)中以約10納秒的精度實現(xiàn)時鐘同步,這個能力過去需要專門的昂貴設(shè)備才能實現(xiàn)。愛立信在實際運營商部署中測試至強6+的數(shù)據(jù)也已印證,在相同核心數(shù)下,性能提升30%,每瓦性能提升60%以上,機架功耗下降38%。
E835還提供超過10年的產(chǎn)品生命周期,這對需要長期穩(wěn)定運營的電信和企業(yè)客戶來說,是降低長期TCO的重要保障。
為Agent而生的480GB顯存GPU
如果說至強6+解決的是Agent的調(diào)度問題,那么英特爾下一代數(shù)據(jù)中心GPU——代號Crescent Island,則瞄準(zhǔn)了另一個瓶頸:內(nèi)存。
在Agent時代,內(nèi)存正在變成核心競爭力。因為Agent不僅需要推理,還需要長期記憶、上下文保存、多模型協(xié)同以及頻繁切換不同任務(wù)。越來越長的上下文窗口以及不斷增長的KV Cache需求,使得顯存容量的重要性迅速提升。
Crescent Island基于Xe 3P架構(gòu),最大的差異化不是算力,而是高達(dá)480GB的超大內(nèi)存容量。英特爾選擇了LPDDR5x顯存方案,相比HBM功耗更低,成本更具競爭力,同時將整卡功耗控制在350W,可直接部署在現(xiàn)有風(fēng)冷數(shù)據(jù)中心中,無需液冷改造。
Crescent Island是為Agentic AI而生。
480GB意味著什么?楊錦文解釋,以DeepSeek-V4模型的參數(shù)量為例,在FP8量化精度下,僅需4張Crescent Island就可以支持這個模型的完整部署。更大的內(nèi)存容量還意味著可以同時在顯存中保留多個模型,Agent在不同任務(wù)之間切換時無需頻繁加載,響應(yīng)速度會快得多。但如果想獲得更理想的運行效果,確實還需要更多的顯存容量來支撐。
此外,Crescent Island支持從原生FP4/MXFP4到FP64的廣泛數(shù)據(jù)類型,PCIe兼容的外形規(guī)格進一步降低了擴展門檻。目前已有超過20家OEM和ODM廠商正針對該產(chǎn)品進行開發(fā),更多細(xì)節(jié)將在未來幾個月陸續(xù)披露。
英特爾技術(shù)專家指出,Crescent Island GPU走是一條極高性價比的路線,非常適合端側(cè)或者是企業(yè)的典型場景,比如說一機8卡或者是一機16卡的部署。
在軟件支持方面,Crescent Island GPU將提供開箱即用的廣泛模型軟件支持,圍繞四個原則構(gòu)建統(tǒng)一的 Xe 軟件棧,即開放、規(guī)模化性能、優(yōu)秀的用戶體驗以及支持異構(gòu)基礎(chǔ)設(shè)施。
從CPU公司,到AI系統(tǒng)公司
從一個整體的視角看英特爾至強6+的發(fā)布,會發(fā)現(xiàn)一個有趣的現(xiàn)象,英特爾發(fā)布的并不是一款產(chǎn)品,而是一套體系——CPU、GPU、網(wǎng)絡(luò)、軟件生態(tài)同時出現(xiàn),全部圍繞同一個主題展開。
這背后反映出英特爾數(shù)據(jù)中心戰(zhàn)略的一次深層轉(zhuǎn)變。過去的數(shù)據(jù)中心競爭,本質(zhì)上是單芯片競爭。而Agent時代正在讓這種邊界消失,因為Agent運行需要的是完整系統(tǒng),CPU負(fù)責(zé)控制平面,GPU負(fù)責(zé)推理平面,網(wǎng)絡(luò)負(fù)責(zé)數(shù)據(jù)流動,軟件負(fù)責(zé)資源編排,任何單一環(huán)節(jié)都無法獨立完成任務(wù)。

軟件生態(tài)是英特爾在這場競爭中的另一張牌。其統(tǒng)一Xe軟件棧已支持PyTorch、vLLM、SGLang等主流框架,堅持上游優(yōu)先策略,不構(gòu)建封閉生態(tài),而是把對英特爾硬件的支持直接貢獻(xiàn)到開源框架的上游代碼里,每款新硬件發(fā)布都提供Day 0的即刻支持。未來開發(fā)者可以在銳炫Pro平臺上完成開發(fā),再無縫部署到Crescent Island上,前向和后向兼容性都有保障。

有些技術(shù)積累,只有到了Agent時代才被重新發(fā)現(xiàn)價值。曾義提到了一個例子,英特爾多年前推出的IAA(Intel In-Memory Analytics Accelerator),可以在內(nèi)存層做壓縮和解壓縮加速。當(dāng)時客戶興趣有限,但Agent需要頻繁快速地?fù)Q入換出上下文狀態(tài),IAA的價值突然變得清晰。國內(nèi)幾家大的頭部客戶在與我們進行討論和演進的時候,這個項目的進展速度也非常快。
CXL內(nèi)存擴展同樣如此,通過CXL在多個CPU之間共享大容量內(nèi)存池,正在成為Agent大規(guī)模部署時的重要基礎(chǔ)設(shè)施選項。
在英特爾面向生成式AI的產(chǎn)品組合,CPU依舊是值得關(guān)注的重點。雷峰網(wǎng)了解到,英特爾下一代至強CPU代號Diamond Rapids,將基于Intel 18A P工藝,采用16通道內(nèi)存配置,提供更多PCIe通道,預(yù)計2027年發(fā)布。至強6+和Diamond Rapids之間保持完整的Socket兼容性,客戶不需要為了升級重構(gòu)整套基礎(chǔ)設(shè)施。

過去幾年,AI行業(yè)最大的敘事是GPU統(tǒng)治世界。
但Agent的出現(xiàn),正在讓產(chǎn)業(yè)重新審視CPU的價值。
對于英特爾而言,至強6+最重要的意義或許并不只是288個核心,也不只是Intel 18A首次進入數(shù)據(jù)中心市場。更重要的是,它正在證明一件事,當(dāng)AI從生成答案走向執(zhí)行任務(wù),CPU依然是整個AI基礎(chǔ)設(shè)施不可替代的控制平面。

而隨著Agent規(guī)模持續(xù)擴大,CPU、GPU、網(wǎng)絡(luò)與軟件共同構(gòu)成的系統(tǒng)能力,或許才是下一階段AI競爭真正的核心。
雷峰網(wǎng)原創(chuàng)文章,未經(jīng)授權(quán)禁止轉(zhuǎn)載。詳情見轉(zhuǎn)載須知。