0
| 本文作者: 楊依婷 | 2026-07-09 11:23 |
一家傳統(tǒng)企業(yè)的財(cái)務(wù)總監(jiān)第一次拿到Token賬單時(shí),通常只有兩個(gè)感受:一是怎么這么貴,二是怎么算出來的。
第一個(gè)問題可以通過預(yù)算來回答;第二個(gè)問題,則要復(fù)雜得多,賬單上的算法,不同廠商有不同的版本,但剝開來看,核心邏輯都長(zhǎng)得很像——不過是“單價(jià)乘以用量”的某種變體。
變化就發(fā)生在這個(gè)乘法里。
2024年初,中國日均Token調(diào)用量是1000億。到2026年3月,這個(gè)數(shù)字突破了140萬億——兩年,超過1000倍。
Token不再只是工程師終端里一行灰色的日志,它正在印入預(yù)算表、損益表和季度財(cái)報(bào)。AI支出也從"研發(fā)預(yù)算"變成了"運(yùn)營成本",而且后者還在以季度為單位陡增。歡迎添加微信EATINGNTAE交流國內(nèi)Token使用現(xiàn)狀。
Token的出現(xiàn),第一次讓模型生成能力被壓縮成一個(gè)可計(jì)量、可交易、可結(jié)算的單位。
AI產(chǎn)業(yè)的商業(yè)模式也正在隨之改變。過去,企業(yè)采購的是GPU、算力卡,后來購買的是GPU小時(shí)、API調(diào)用;如今,越來越多廠商開始直接按Token計(jì)費(fèi)、按Token結(jié)算。
你不再需要知道底層跑的是哪款GPU、花了多少機(jī)時(shí),只需要關(guān)心最終產(chǎn)出了多少Token。這像極了電力時(shí)代的"度"——把復(fù)雜的發(fā)電、輸電和配電過程,壓縮成一個(gè)所有人都能理解的計(jì)量單位。
但計(jì)量單位統(tǒng)一之后,一個(gè)隱秘的裂縫也隨之裂開:?jiǎn)挝唤y(tǒng)一了,算法卻沒有統(tǒng)一。
表面上看,賬單只有兩個(gè)變量:價(jià)格和用量。但這兩個(gè)數(shù)字都不是常量,模型怎么定價(jià)、緩存命中有沒有折扣、長(zhǎng)思考模式會(huì)不會(huì)額外消耗Token,甚至數(shù)據(jù)中心建在哪個(gè)省份,都在左右最終的數(shù)字。
看似清晰的一道乘法,實(shí)則是一張誰都讀不透的網(wǎng)。
大模型API的價(jià)格戰(zhàn),讓Token的單價(jià)看起來前所未有的透明,但恰恰是這種“一分錢一分貨”的明碼標(biāo)價(jià),將真正的成本結(jié)構(gòu)藏進(jìn)了黑箱。同一個(gè)數(shù)字背后,可能是技術(shù)效率的極致兌現(xiàn),也可能是資本補(bǔ)貼的飲鴆止渴。
從事芯片行業(yè)的吳昊把這種成本的不可比,歸結(jié)為三個(gè)互相糾纏的變量:設(shè)備成本、運(yùn)營成本、合同周期。
設(shè)備端的差異,從采購那一刻就已經(jīng)寫進(jìn)了初始成本——GPU的型號(hào)、采購量大小、是否搭售軟件、配沒配外部存儲(chǔ)方案,每一項(xiàng)都會(huì)以不同方式影響最初的成本分?jǐn)偂?/p>
吳昊描述,前一段時(shí)間行業(yè)的主流趨勢(shì)是,大家都在拼算力峰值,比誰的卡算力值最高。
廠商在宣傳時(shí)強(qiáng)調(diào)單卡有多強(qiáng),實(shí)際銷售時(shí)頂尖卡卻幾乎不單獨(dú)租賃,都是以集群為單位出貨。一臺(tái)B300整機(jī)36P算力,一個(gè)集群至少32臺(tái),加起來就是千P級(jí)別。“全國能租得起這種集群的客戶,可能也就幾十個(gè),大量中小客戶根本用不起來?!眳顷恢赋?。
而這些無法被充分利用的頂級(jí)算力,最終會(huì)以某種方式,攤進(jìn)每一個(gè)Token的定價(jià)里。
運(yùn)營端的變量同樣復(fù)雜,而且拉開了一個(gè)更隱蔽的差距。
電價(jià)是其中最直觀的一條線。吳昊提到,西北部分地區(qū)電價(jià)能做到兩三毛,靠的是新能源補(bǔ)貼和體外循環(huán)資金補(bǔ)貼維持運(yùn)營;東部地區(qū)則普遍在6毛以上,甚至到7、8毛。
兩三毛和六七毛——兩個(gè)價(jià)格區(qū)間,整整差出三倍,而大量算力中心正是依賴著這種補(bǔ)貼維持整體運(yùn)營。吳昊坦言,這種現(xiàn)象在當(dāng)前行業(yè)里占了多數(shù)。
也就是說,今天市場(chǎng)上看到的不少“低價(jià)Token”,未必是效率提升的結(jié)果,而是一場(chǎng)仍在持續(xù)的補(bǔ)貼戰(zhàn)爭(zhēng)的產(chǎn)物。一旦補(bǔ)貼退場(chǎng),賬單會(huì)反彈多少,仍是一個(gè)未知數(shù)。
如果說吳昊的賬本算的是“過去的投入”,太初元碁首席產(chǎn)品官洪源則把視線投向了“未來的賬單”。
“當(dāng)行業(yè)真正進(jìn)入Token經(jīng)濟(jì)時(shí)代,最重要的衡量指標(biāo)可能會(huì)從單純的算力速度,轉(zhuǎn)向能源轉(zhuǎn)化效率——每瓦電能能夠產(chǎn)生多少Token。單純關(guān)注每秒生成Token數(shù)而不考量能耗,在長(zhǎng)期運(yùn)營中存在顯著局限。”
洪源認(rèn)為,單卡的算力值或每秒生成Token數(shù),從來不能反映真實(shí)的產(chǎn)出能力。生成Token是一整套系統(tǒng)工程:從單張卡到服務(wù)器,再到服務(wù)器之間的互聯(lián),涉及顯存帶寬、互聯(lián)帶寬、液冷系統(tǒng)、軟硬件協(xié)同,最終才體現(xiàn)為集群每秒生成的Token數(shù)。
不同公司這套切分技術(shù)的精細(xì)程度,直接決定了同樣標(biāo)價(jià)的一個(gè)Token,背后真實(shí)占用的算力含量。
在設(shè)備、電價(jià)之外,合同周期是第三個(gè)變量,而且Token經(jīng)濟(jì)正在把它推入一種全新的復(fù)雜度。從簽約年限到計(jì)費(fèi)顆粒度,規(guī)則都在變:算力正在從整租變成散租。這一趨勢(shì)將如何重塑算力市場(chǎng)的定價(jià)邏輯?歡迎添加微信EATINGNTAE探討。
吳昊打了個(gè)比方:過去一個(gè)算力集群可能只服務(wù)一兩個(gè)大客戶,沒什么運(yùn)營問題,但Token讓算力變成了可以按需切割的商品——不必整租一臺(tái)機(jī)器,甚至可以像交電費(fèi)一樣,按Token消耗量結(jié)算。
“以后會(huì)變成像寫字樓那樣,從整租變成散租。每個(gè)客戶的裝修要求不同,檔期不同,空置率也不同。恰恰是這種變化,倒逼著真正的運(yùn)營能力要做起來?!眳顷贿@樣形容未來可能的狀況。
1年和5年的長(zhǎng)期鎖定合同,與按Token量結(jié)算的散租模式,背后是兩套完全不同的運(yùn)營邏輯和成本結(jié)構(gòu)。
而一個(gè)Token的價(jià)格,始終是模型推理背后一整套基礎(chǔ)設(shè)施效率的最終體現(xiàn),它涵蓋算力、能源、政策激勵(lì)與商業(yè)契約的每一層博弈。
如果說成本的算法是“各家算各家的賬”,那標(biāo)價(jià)的算法就更進(jìn)了一步——它挑戰(zhàn)的是一個(gè)更基礎(chǔ)的前提:Token的計(jì)費(fèi)規(guī)則,本身就沒有統(tǒng)一的標(biāo)準(zhǔn)。
云天勵(lì)飛副總裁羅憶提到,目前主流模型已將輸入和輸出拆分為兩個(gè)階段分別計(jì)價(jià),兩個(gè)階段的計(jì)算成本完全不同:Prefill(預(yù)填充)一次性并行處理全部輸入,而Decode(解碼)需逐字串行生成,每多生成一個(gè)Token就多走一遍計(jì)算,因此,輸出Token的單價(jià)普遍比輸入Token貴。
超長(zhǎng)上下文會(huì)顯著推高Prefill階段的開銷,長(zhǎng)思考模式則讓Decode部分“先打草稿再正式回答”,內(nèi)部思考的Token消耗可達(dá)上萬,整體開銷接近翻倍。
此外,緩存機(jī)制還進(jìn)一步拉大了實(shí)際計(jì)費(fèi)的差距。如果本次請(qǐng)求的前綴內(nèi)容與之前相同,平臺(tái)可直接復(fù)用之前保存的中間結(jié)果,跳過重復(fù)的Prefill計(jì)算,緩存命中與緩存未命中之間的價(jià)格差距可達(dá)上百倍。大廠憑借更高的緩存命中率能有效降低用戶的重復(fù)計(jì)費(fèi),而一些廠商緩存機(jī)制不完善,用戶可能在毫不知情的情況下因緩存反復(fù)失效而重復(fù)付費(fèi)。
另一個(gè)同樣隱蔽的變量來自分詞器(tokenizer)。不同模型對(duì)同一段文本的切分方式不同——GPT系列用BPE(字節(jié)對(duì)編碼),Claude用BPE變體,Llama和DeepSeek用SentencePiece,各家的詞表大小、中文覆蓋度、子詞策略都不一樣,這就導(dǎo)致同樣是100萬Token,承載的信息量在不同模型之間可以差出不少。
當(dāng)計(jì)費(fèi)口徑本身就不統(tǒng)一,“每百萬Token X元”的比價(jià),比的可能就不是同一把尺子。
從整個(gè)行業(yè)的角度看,價(jià)格的離散程度更讓人意外。以輸出價(jià)格為例,OpenAI GPT-5.5的高性能版本(Pro)每百萬Token可以要到上百美元,Anthropic Claude Opus 4.8(標(biāo)準(zhǔn)模式)也要二三十美元,而國內(nèi)廠商普遍只有個(gè)位數(shù)人民幣——DeepSeek最新版本輸出價(jià)格不過6元。
為什么價(jià)格差距這么大?
云天勵(lì)飛副總裁羅憶坦言,當(dāng)前Token定價(jià)體系尚處混沌期,不同模型、不同服務(wù)等級(jí)下,百萬Token的標(biāo)價(jià)千差萬別,甚至不乏“掛羊頭賣狗肉”的虛標(biāo)亂象?,F(xiàn)在的定價(jià)就好比賣牛肉——不同部位、不同品質(zhì)對(duì)應(yīng)不同價(jià)格,但最終仍以重量作為基本的計(jì)量單位。
邁富時(shí)CFO馬進(jìn)則把它比作護(hù)膚品市場(chǎng),“消費(fèi)者可以根據(jù)需求選擇高端品牌還是中端品牌”。
兩個(gè)比喻指向同一個(gè)結(jié)論:Token不是一個(gè)均質(zhì)商品,不同模型能力、不同服務(wù)等級(jí)產(chǎn)出的Token,質(zhì)量天然不同。
九章云極把這種分層描述得更結(jié)構(gòu)化:未來的Token市場(chǎng)會(huì)形成"金字塔"——底層是海量、廉價(jià)的基礎(chǔ)能力Token,中層是高可靠、特定場(chǎng)景優(yōu)化的Token,頂層是極致性能、定制化的Token,三層Token背后的算力消耗和質(zhì)量差異極大。
所有這些說法,最終都指向同一個(gè)事實(shí):盡管Token頂著“統(tǒng)一計(jì)量單位”之名,背后的分詞規(guī)則、計(jì)費(fèi)口徑、質(zhì)量等級(jí),卻可能各不相同。
度量衡的意義,本應(yīng)是放之四海而皆準(zhǔn),一公斤在哪里稱,都是一公斤。但當(dāng)下的Token,看起來是一個(gè)統(tǒng)一計(jì)價(jià)的基礎(chǔ)單位,實(shí)際上更像是每家公司自己定義、自己解釋、外部無法驗(yàn)證的內(nèi)部貨幣。
所謂標(biāo)準(zhǔn)化,標(biāo)準(zhǔn)的只是這個(gè)名字,而不是它的質(zhì)量與價(jià)值。
算力中心在建,模型在跑,Token在燒。但燒掉的那些Token,到底換回了什么——這個(gè)問題,正在成為每家企業(yè)IT負(fù)責(zé)人的日??絾?。
要回答它,得往回倒一步?!霸撡I什么,以及買沒買對(duì)”——這是很多企業(yè)邁入AI采購時(shí)遇到的第一道門檻。
芯片行業(yè)人士吳昊提到過一個(gè)案例:一家大型供應(yīng)鏈企業(yè),主營業(yè)務(wù)是物流調(diào)配,數(shù)據(jù)主要是結(jié)構(gòu)化指令和判斷數(shù)據(jù),但對(duì)于“用誰的模型最合適,他不清楚;該規(guī)劃多少Token用量才合理,他也不知道。”
許多公司在尚未明確自身需求時(shí),習(xí)慣將行業(yè)頭部作為參照,卻常陷入錯(cuò)位。頭部企業(yè)提出的需求類型、設(shè)備選型與部署規(guī)模,極易被同行直接照搬為標(biāo)桿,而兩者在業(yè)務(wù)復(fù)雜度、數(shù)據(jù)體量與預(yù)算層級(jí)上往往相差懸殊——前者或許需要高性能算力集群支撐核心業(yè)務(wù),后者可能僅需一個(gè)小參數(shù)模型即可勝任。
照搬,性價(jià)比極低。
更大的挑戰(zhàn)在于,這種認(rèn)知短板不只存在于需求方一側(cè)。一些過去只做英偉達(dá)產(chǎn)品的算力運(yùn)營商,如今也在積極聯(lián)系國產(chǎn)廠商進(jìn)行測(cè)試——他們自己也需要先熟悉不同硬件的特性,才能形成有效的對(duì)比判斷。
當(dāng)供給端和需求端都在同步補(bǔ)課,“懂行”本身就成了一個(gè)相對(duì)的、暫時(shí)的狀態(tài)——而買家的第一筆賬,往往是在這種狀態(tài)下算出來的。
采購只是第一步,當(dāng)Token真正燒起來之后,數(shù)字的漲法往往超出預(yù)期。
以搭建一個(gè)股票分析workflow為例,前期調(diào)試消耗上千萬Token,流程跑通后,每次運(yùn)行再耗百萬Token;一旦從單只股票擴(kuò)展到批量分析,日總消耗立即驟增百倍。
Agent的調(diào)用邏輯不是線性的——它會(huì)反復(fù)迭代、自我對(duì)話、調(diào)用上下文。單次調(diào)試的成本看似可控,一旦規(guī)?;牧烤蜁?huì)以超出預(yù)期的方式膨脹,而大多數(shù)買家在做預(yù)算測(cè)算時(shí),對(duì)這個(gè)拐點(diǎn)幾乎沒有感知。
規(guī)?;糯蟮模恢皇窍牧勘旧恚€有設(shè)計(jì)優(yōu)劣之間的成本差距。
共績(jī)科技聯(lián)合創(chuàng)始人黃力昂發(fā)現(xiàn),使用Token有高手和普通人之分,兩者的差距遠(yuǎn)比想象中大。而且,很多高效使用Token的知識(shí)和技巧目前還只存在于團(tuán)隊(duì)和個(gè)人的腦子里,沒有被固化到應(yīng)用里。
這種差距具體從哪來?
Meta程序員程子的經(jīng)驗(yàn)是,好的設(shè)計(jì)者從不放任Agent無限思考。真正高效的商業(yè)做法,是把Agent的行為框進(jìn)“有限循環(huán)”里——拆步驟、定邊界、限迭代。
“會(huì)寫Prompt、會(huì)利用AI去設(shè)計(jì)Agent架構(gòu)和優(yōu)化交互流程的人,與從沒深入做過這件事的人相比,他們之間產(chǎn)生的經(jīng)濟(jì)效益區(qū)別是巨大的。”程子說。
好的設(shè)計(jì)能把Token變成智慧,差的設(shè)計(jì)只能把Token變成成本。
Meta和亞馬遜很早就撞上了這堵墻,兩家公司一度把Token消耗量作為KPI考核指標(biāo),后來又叫停了。
程子透露,原因是“有點(diǎn)矯枉過正”,擔(dān)心員工“無條件地刷Token”。但他也承認(rèn),公司內(nèi)部仍在關(guān)注這個(gè)數(shù)字——因?yàn)門oken消耗量和工作狀態(tài)之間存在明顯的相關(guān)性,當(dāng)一個(gè)人一段時(shí)間內(nèi)不那么忙,消耗量確實(shí)會(huì)明顯下降。
換句話說,企業(yè)曾試圖用最粗暴的指標(biāo)——“消耗量”,去衡量那個(gè)真正想衡量卻衡量不了的東西:“價(jià)值”。
邁富時(shí)CFO馬進(jìn)把這個(gè)過程描述為一種必然的調(diào)整。在他看來,這并非Token作為計(jì)量單位的根本缺陷暴露,而是企業(yè)考核機(jī)制從“推動(dòng)習(xí)慣養(yǎng)成”到“回歸經(jīng)濟(jì)理性”的必然過渡。
羅憶也看到了類似的階段分化——只是他的視角從市場(chǎng)切了進(jìn)去:國內(nèi)目前仍處于“鼓勵(lì)用量”的初期階段,不管用得好不好,先養(yǎng)成使用習(xí)慣,抓量不抓質(zhì);而頭部大廠已進(jìn)入下一階段,開始從“用量”轉(zhuǎn)向“用精”,用更科學(xué)的指標(biāo)來評(píng)估有效產(chǎn)出。
類似的情況,九章云極在互聯(lián)網(wǎng)早期也見過。“這如同互聯(lián)網(wǎng)早期,點(diǎn)擊量和頁面瀏覽量曾是核心指標(biāo),但后來大家更關(guān)注用戶停留時(shí)長(zhǎng)、轉(zhuǎn)化率等有效指標(biāo)?!盩oken的競(jìng)爭(zhēng),也必然會(huì)從“調(diào)用量”轉(zhuǎn)向“有效Token價(jià)值”——只是截至目前,這套新的換算關(guān)系還沒有成型。
野蠻生長(zhǎng),在羅憶看來是這個(gè)階段的必然。
整個(gè)行業(yè)的能力邊界還在不斷延伸,遠(yuǎn)未觸達(dá)上限——技術(shù)會(huì)催生新的服務(wù)形態(tài),服務(wù)落到場(chǎng)景里跑通了,質(zhì)量體系才會(huì)跟著長(zhǎng)出來。本質(zhì)上,是技術(shù)在推著標(biāo)準(zhǔn)往前走。
羅憶認(rèn)為,“一開始就過于規(guī)范,反而可能阻礙發(fā)展?!?/p>
而技術(shù)端的共識(shí)也已經(jīng)正在冒頭。共績(jī)科技聯(lián)合創(chuàng)始人黃力昂注意到,模型在收斂,訓(xùn)練范式在趨同——大家對(duì)什么是“好”的默契,比外界想象的要多。這些默契還沒有寫成標(biāo)準(zhǔn),但它們已經(jīng)在代碼里、在架構(gòu)選擇里、在工程師的日常判斷里悄悄生長(zhǎng)。
但他也提醒,技術(shù)不是唯一在發(fā)力的力量。這次變革的體量不亞于一次工業(yè)革命,不可能只把話語權(quán)交給技術(shù),不同文化和社會(huì)體制,會(huì)把各自的需求刻進(jìn)Token的基因里。
邁富時(shí)CFO馬進(jìn)從商業(yè)端看到的圖景,與技術(shù)側(cè)的收斂遙相呼應(yīng):大模型市場(chǎng)正在逐漸收攏,未來全球能存活的大模型公司會(huì)越來越少——市場(chǎng)的無形之手,也在把玩家往同一個(gè)方向推。
共識(shí)在聚攏,但標(biāo)準(zhǔn)還沒來。行業(yè)沒有干等——云天勵(lì)飛聯(lián)合三十多家產(chǎn)業(yè)鏈企業(yè)簽署“1001計(jì)劃”,先把各方拉到一張桌子上,以行業(yè)共識(shí)為起點(diǎn)推動(dòng)標(biāo)準(zhǔn)制定。
與此同時(shí),各家廠商已經(jīng)開始用自己的方式給出參照系:九章云極提出“按度計(jì)量”,作為算力端的統(tǒng)一標(biāo)尺,讓不同芯片、不同集群產(chǎn)出的Token可在同一把算力尺度下可比,Token工廠則在輸出端負(fù)責(zé)智能的標(biāo)準(zhǔn)化封裝與交付;邁富時(shí)區(qū)分“大模型Token”與“場(chǎng)景Token”,按詞元消耗與任務(wù)效果分別計(jì)價(jià),將價(jià)值的度量從“消耗端”遷移到“結(jié)果端”,全棧Token工廠的溢價(jià)權(quán),最終取決于企業(yè)智能體能否在具體場(chǎng)景中交付可量化、可持續(xù)的業(yè)務(wù)成果;太初元碁率先發(fā)布高密液冷集群,在性能、功耗與建設(shè)成本間尋求最優(yōu)平衡,為Token生產(chǎn)成本劃出參照標(biāo)尺。
從共識(shí)到標(biāo)準(zhǔn),仍有距離。這條路徑究竟由技術(shù)、商業(yè)還是更復(fù)雜的博弈主導(dǎo),尚不明朗,但標(biāo)尺已在打磨,刻度隱約浮現(xiàn)。
Token未必會(huì)成為AI時(shí)代最終的“度電”,但圍繞它所構(gòu)建的新價(jià)值尺度,終將左右下一代AI基礎(chǔ)設(shè)施的話語權(quán)。
作者長(zhǎng)期深耕AI算力與芯片領(lǐng)域,后續(xù)將推出Token系列專題文章,歡迎添加微信(EATINGNTAE)交流探討。
注:吳昊、程子為化名。
雷峰網(wǎng)雷峰網(wǎng)(公眾號(hào):雷峰網(wǎng))
雷峰網(wǎng)原創(chuàng)文章,未經(jīng)授權(quán)禁止轉(zhuǎn)載。詳情見轉(zhuǎn)載須知。