0
姚欣身上有一種經歷過周期的人才有的松弛感。
2026 年 7 月的 WAIC 現場,人潮比上海七月的氣溫還燥熱。各路廠商的展臺一個比一個聲勢浩大,大模型、機器人、AI 手機輪番登場。而在 PPIO 的媒體溝通會現場,姚欣穿著一件深色 POLO 衫坐定,開口第一句話不是談技術多么顛覆,而是掏出手機亮了亮:"我最近剛換了個 1TB 的,以后硬盤越來越貴,趁早升級。"
這是個只有在行業里摸爬滾打過的人才會開的玩笑。二十年前,他是華中科技大學的計算機系學生,用分布式技術解決了萬人同時在線看球賽卡頓的問題,做出了 PPTV;2018 年二次創業做 PPIO,并從2023年起 ALL IN AI,成為中國最早一批"Token 工廠"。
現在,PPIO 日均 Token 調用量 1.2 萬億,較去年同期增長 8 倍。按灼識咨詢的統計,它已是國內 Token 消耗量最大的獨立 AI 云廠商。這個數字放在任何一家 AI 公司的發布會上都會被反復提及,但姚欣只是把它當作背景板。他在意的不是規模本身,而是規模背后正在發生的結構性位移。
"云的第一客戶,從人變成了 Agent。"他在采訪中說這句話時語速不快,像在陳述一個早已發生、只是最近才被行業普遍承認的事實。
這句話的意思是,過去十幾年云計算服務的對象是人,人打開軟件、人點擊按鈕、人發起請求;而接下來,主要的消耗者將變成自主運行的智能體。這不是一個遙遠的預測,而是 PPIO 后臺數據正在顯示的趨勢:嘗鮮用戶退潮后,企業付費的 Token 消耗依然每月 10%–20% 穩健增長,其中 Agent 的占比越來越高。
姚欣給這個時代列了一個公式:Agent 生產力 = Token 智能密度 × Agent Loop 時長。前者決定每一步決策的質量上限,后者決定 Agent 能持續運行多久。PPIO 在 WAIC 2026 發布的 Agentic Cloud,就是圍繞這個公式構建的兩層產品體系:智能模型網關推高密度,Agent Harness 層拉長時長。
但這場采訪值得記錄的,不只是產品本身,AI 行業的供需反轉、成本曲線、競爭格局,都將會一一呈現。
以下是AI科技評論與姚欣的對話精簡版本:
一、核心判斷:Agent 才是第一客戶
AI科技評論:怎么看現在這波 AI 需求的熱度?是真實的嗎?
姚欣:是真實的,而且變了。今年 2、3 月增長曲線非常陡,那是對龍蝦類產品大量嘗鮮式應用,大家試一試;這一波用戶嘗鮮一兩個月就退了。現在我們進入穩健增長階段,每個月大約 10%–20% 的持續增長,全年算下來大概三到四倍增幅,已經進了正循環,變成真正生產力的工具。
我們的 Token 曲線和大家看到的不一樣。PPIO 是 ToB 公司,平臺上所有 Token 都是付費的,不是 C 端免費嘗鮮的曲線,是企業付費的真實曲線。經過一波嘗鮮降溫,增速沒那么陡了,但進了穩健的持續增長。
AI科技評論:企業主要拿這些 Token 干什么?
姚欣:我觀察,企業內部大量重復性勞動正在被 AI 改造。我們公司里用 OpenClaw 最積極的不是技術崗,是財務、人事、行政、市場這些非技術崗位,我自己也高頻用。研發去年底就在用 Claude Code、Codex 這類編程智能體,門檻高,要命令行、懂技術邏輯;OpenClaw 這類優勢是使用門檻極低,有飛書或微信就能用,所以大量辦公白領都在高頻用。
另外我觀察到很多 OPC,這說明創業范式變了。以前創業先融一輪資再啟動,現在是先買一個 Token 包做出 Demo,跑通了再去融天使輪。這也是張江模力社區樓下 OPC 社區越來越紅火的原因。
AI科技評論:所以你對Agent時代的核心判斷是什么?
姚欣:Agent 時代最重要的變化,是云的第一客戶從人變成了 Agent。過去云計算是為人使用軟件設計的,Agentic Cloud 是為 Agent 自主運行而生的。
我給 Agent 時代列了個公式:Agent 生產力 = Token 智能密度 × Agent Loop 時長。
Token 智能密度決定 Agent 每一步決策的質量上限,Agent Loop 時長決定它能持續運行多久、完成多復雜的任務。PPIO 這次發布 Agentic Cloud,就是分兩層去推高這兩個變量:智能模型網關推高密度,Agent Harness 層拉長 Loop 時長。
二、智能模型網關:混合模型與調度是兩回事
AI科技評論:你在前面不斷提到智能模型網關,智能模型網關到底解決什么問題?
姚欣:開發者有個真實痛點,太依賴一個"全能型"大模型,但單模型可能推理不深、記憶不足、文采平平。網關要做的是,給 Agent 的每一步動態匹配最合適的"專家模型",同時把成本按住。
它有兩個功能,差別很關鍵:
第一個是混合模型(MoM,Mixture of Models)。在高價值、高風險、結果不確定的關鍵步驟(比如法律合同審查、醫療初診),把問題同時分發給多個專家模型,交叉驗證、打碎再融合生成最終答案,大幅提升任務成功率。
第二個是模型調度(Router)。也就是簡單問答用輕量模型,復雜推理用強模型,壓縮冗余上下文、復用計算、設預算護欄和失敗回退。
混合模型是 Mix,把多個模型結果打碎再混合出新結果,調度是 Router,也就是原樣轉發下去,這兩個不是一回事。
AI科技評論:效果有量化嗎?
姚欣:在 DRACO 深度研究基準上,我們融合 Mimo-V2.5-Pro、Kimi-K2.7 和 GLM-5.2 做混合推理,性能可接近 Claude Fable5 的水平,成本卻大幅下降;綜合測算,智能水平提升約 20%,成本下降 50%–60%。
AI科技評論:混合模型的工程壁壘在哪?是那個調度模型本身嗎?
姚欣:調度和混合是兩個業務,都在網關里。調度側有一個識別任務復雜度、做自動擋決策的路由模型;但更底層是"什么模型適合什么任務"。這不是看各家發的 Benchmark(開卷考試,先拿到答案),而是靠生產環境里每天 1.2 萬億次真實調用喂出來的數據。三個模型開會,和一個模型自己想,質量不一樣,道理就跟開會一樣。
混合模型這邊,第一步基礎還是 Benchmark,到底哪些模型擅長什么,要依賴大量經驗數據;第二步是多模型思考編排,三個模型怎么用不同提示詞駕馭、答案怎么裝配,裝配形式不同命中率就不同;再上線壓縮,最后主模型把三個參考案統一回來。
三、Agent Harness:讓 Agent 不只"想",還能"做"
AI科技評論:Agentic Cloud 和 Agent Infra 是什么關系?
姚欣:是升級。去年我們推 Sandbox 時,主題是推出 Agent Infra,給一個沙箱;今天給你的不只是一個沙箱加一個模型 API,還要做一整套 Harness 工程,甚至給一個現成可用的智能體服務,這一層有點像 SaaS。從 Infra 到 Cloud,是從單點變一整套,融合了運行環境和應用服務。
AI科技評論:為什么有時候叫 Agent,有時候叫 Agentic?
姚欣:說實話我英文也不夠好(笑)。Agentic 更像形容詞,更敏捷一點的感覺;學術文獻里一般用 Agent,是名詞。我們最后定名 Agentic Cloud,但服務的是 for Agent 的應用。這塊真需要各位文字工作者幫我們發明更準確的中文譯名,每次都痛苦。
AI科技評論:普通開發者用 的Harness,你們具體解決什么?
姚欣:分兩類。去年推的沙箱面向開發者,比如某款知名通用Agent產品底層調我們的基礎設施來跑。今年 OpenClaw 這類開源智能體火了,很多非技術背景的普通人也能用,但還有安全、效率問題,所以我們上線了 PPClaw,可以把所有底層環境配好,像 SaaS 一樣開箱即用,一鍵生成、一鍵啟動。沙箱調用被內化進去,普通用戶根本不用知道沙箱是什么,只知道自己的數字員工有記憶、執行強。
我們官網三條產品線,第一是 GPU 云服務,現在占比已經很小,第二是模型服務,包括大語言 + 多模態,第三是 Agent 云服務,這方面是去年給開發者的沙箱,加上今年給普通人的托管。托管相當于一個具備通用工作能力的"大學畢業生",你給它灌進企業知識庫,它就能在公司干活,調多少 Token、調哪些服務全由我們托管。
四、算力漲價反轉與全棧式方案
AI科技評論:今年 WAIC 和去年比,Infra 這塊最大變化是什么?
姚欣:最大不同是算力漲價。一年前我們愁賣不掉,桌上擺著一堆 H20 的卡跑 DeepSeek,愁怎么推到企業側,央國企當時還在買一體機、做驗證。今天倒過來了:算力不夠、太貴、漲價。
這是供需反轉,有背后兩件事,一是 AI 真能解決大量生產效率(編程、辦公、AI 短劇),二是 Agent 消耗是數量級的。反轉后我們也很痛苦,上游算力太貴,我現在買不起硬盤,最近勸大家趕快升級手機,我剛換了個 1TB 的。
AI科技評論:Token 成本往后三年怎么走?
姚欣:過去三年怎么降的?一是 GPU 換代,A100 到 H100 到 B100,每代性能提升 5–10 倍;二是推理加速等軟件技術。但硬件側變化在放緩。今年參加英偉達會議,GPU 已到 3 納米物理極限,1 納米基本不可能,2 納米頂到天,最多提升 1.5 倍,沒有再提升 10 倍的能力。現在靠超節點、靠橫向擴張補。
但軟件提升還在快速走。過去半年最大變化不在 GPU,在內存和硬盤,智能體追求記憶,上下文從幾 K 走到 100 萬,先放顯存、顯存不夠放內存、再不夠放硬盤,把 SSD 炒上天。系統架構變遷能實現指數級飛躍。我堅持判斷:每年智能使用成本還會接近 10 倍下降,因為軟件空間還極大,沒走到頭。
五、AI Coding、OPC 與"更新速度"
AI科技評論:今年 AI Coding 特別火,對 PPIO 有什么影響?
姚欣:兩端都受影響。收入端:Token 消耗上 Agent 占比高,但收入上 AI Coding 是主力,今年 3、4 月起企業客戶因 AI Coding 大量消耗 Token,是收入核心來源。研發端:我們一年上線 100 多款模型,發布節奏比移動互聯網時代快 10 倍以上,核心原因是內部實現了"AI for AI"——模型上線、運維、自動化大量由 AI 編程完成,每 3 天就有一次版本發布。
我們"吃自己的狗糧",自己產 Token 自己先消耗,全員用 AI 工具,效率才這么快。
AI科技評論:一季度 AI Coding 爆發后,4、5、6 月體感熱度下滑,你有同感嗎?
姚欣:變化有,但要區分:AI Coding 是給人用的,模型偏貴;OpenClaw 這類 Agent 用 Agent 模型,相對便宜。今年春節后 Token 消耗突然起來,我們以為是 AI Coding 自然增長;到 3 月增速比 2 月翻了 3 倍,我們才確認是 Agent 爆發。
之后幾個月增速放緩,因為嘗鮮熱度下去了。4 月左右 C 端嘗鮮基本退去,OpenClaw 調用下降,5 月 Hermes 調用量超過了 OpenClaw。但企業需求穩步提升,AI Coding 和 Agent 兩條曲線都在穩步走。
我估計下半年 Agent 還會沖一波:隨著 Harness 工程和 Loop Engineering 成熟,一個任務完成要消耗的 Token 會提升 10–100 倍,即使人數不漲,單任務用量也漲 10 倍以上。
AI科技評論:你提到的 OPC,大量用 Token 是不是也屬嘗鮮?
姚欣:不是。To B 最多一兩周、一兩個月嘗鮮,之后要付這么多錢,大家都是算過賬的。很多 OPC 小公司一個月 Token 使用量能到 100 億,這在以前以為只有大型企業才到。這類公司我定義為 Agent Native 企業(智能體原生企業),人智比普遍 1:10、1:20(我們公司還是 1:3)。它們更新速度太快,如果二線廠商不轉型,很可能被這些異軍突起的創業公司替代。
AI科技評論:這波靠 Agent 瘋狂更新的公司,也會像當年 PPTV 一樣,活下來的根本不是技術嗎?
姚欣:對,有的行業老登還是能活下來,已經不是靠技術。PPTV 后來我賣掉,也是因為不是靠技術領先,主要靠版權。今天 AI 行業最領先的企業,大家關心的不是你今天多快多好,而是內部更新速度能不能更快。OpenAI 緊盯 DeepSeek,關注的不是模型,是 DeepSeek 的內部更新速度比它還快。Claude Code 官方 3 月一個月發 17 個版本,兩天一版。PPTV 放在這個時代,我大概率活不下來。
#雷峰網(公眾號:雷峰網)
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。