0
| 本文作者: 樊天驕 | 2026-07-07 16:26 |

作者丨樊天驕
編輯丨鄭佳美
這幾天,關(guān)于 GPT-5.6 的消息層出不窮。從 Polymarket 上的交易數(shù)據(jù)來看,GPT-5.6 極有可能在 2026 年 7 月 7 日正式發(fā)布,概率甚至高達(dá) 68%。

X 上也有開發(fā)者從代碼層面挖出實錘:OpenAI 的 Codex 應(yīng)用底層代碼里,已經(jīng)提前寫入了 GPT-5.6 對應(yīng)的 Sol、Terra、Luna 相關(guān)適配條目,配套的實時語音功能也仍在開發(fā)推進(jìn)中。可以說種種線索都預(yù)示新版本上線進(jìn)入倒計時。

一連串的消息讓業(yè)內(nèi)對 GPT-5.6 的期待值直接拉滿,同時也順帶把它和最近剛復(fù)出的 Fable 5 暗暗的進(jìn)行了一番比較。
眾所周知,F(xiàn)able 5 上周剛剛上線,就已經(jīng)把長任務(wù) Agent 的行業(yè)標(biāo)準(zhǔn)重新抬高了一截,大量用戶和社區(qū)案例都把 Fable 5 的優(yōu)勢指向長任務(wù)自主執(zhí)行、復(fù)雜工程遷移、上下文保持和真實 Agent 工作流。
任務(wù)越復(fù)雜、鏈路越長,它的領(lǐng)先感越明顯,甚至有案例顯示,它能在數(shù)小時內(nèi)完成原本需要團(tuán)隊數(shù)周推進(jìn)的工程遷移。而反觀 GPT 這邊,目前承擔(dān)主力應(yīng)用的 GPT-5.5,卻持續(xù)暴露出一個很刺眼的短板:長任務(wù)處理極不穩(wěn)定,復(fù)雜鏈路中容易翻車。雷峰網(wǎng)

因此,GPT-5.6 想要真正超越 Fable 5,哪怕只是打成平手,都不能只靠一張漂亮的內(nèi)測分?jǐn)?shù)表。它必須在長任務(wù)處理上完成從GPT-5.5 到 GPT-5.6 的質(zhì)變:推理不能半路斷鏈,上下文不能中途丟失,真實工程任務(wù)必須能從頭跑到尾。

01
為什么 GPT-5.5 長任務(wù)容易翻車?有開發(fā)者通過實測挖掘出了背后的可疑規(guī)律:GPT-5.5 Codex 的推理 token 數(shù)量并非隨任務(wù)難度自然浮動,而是高度集中在 516、1034、1552 等固定節(jié)點,完全契合「推理 token 數(shù) = 518 × n ? 2」的公式。

什么是 518 × n ? 2 公式?
大模型處理復(fù)雜任務(wù)時,要生成幾千甚至上萬個內(nèi)部推理 token,不可能全部算完再一次性返回。行業(yè)通用做法,是把一整條長思考拆成一個個 “小塊”,邊算邊流式輸出給用戶,同時服務(wù)端也能同步監(jiān)控進(jìn)度、統(tǒng)計用量、處理異常。
這個分塊的基礎(chǔ)大小,行業(yè)普遍以 512 個 token 為標(biāo)準(zhǔn)單位(類似硬盤的存儲塊,是通用的工程慣例)。OpenAI 則額外預(yù)留了 6 個 token 的位置,用來放內(nèi)部控制指令、狀態(tài)標(biāo)記這類系統(tǒng)信息,加起來單塊的總長度就是 518 個 token。
而每一塊的最后,還有 2 個 token 是專門留給系統(tǒng)做結(jié)束標(biāo)記用的,不會分配給模型用來思考。所以單塊里模型實際能用來思考的有效長度,就是 518 ? 2 = 516 個 token;第 2 塊結(jié)束時累計就是 518×2 ? 2 = 1034,第 3 塊就是 1552,以此類推。
這就像學(xué)生讀長篇課文,不會一口氣讀完,而是一段一段讀,每讀完一段就匯報一次進(jìn)度,接著再讀下一段。
但是 GPT 5.5 的問題出在:每讀完一塊,思考就被強制叫停。
舉個例子:就像你做一道很難的數(shù)學(xué)大題,正常思路是:
先讀題、拆解已知條件(第 1 段思考)
接著推導(dǎo)公式、列方程(第 2 段思考)
再計算結(jié)果、驗算檢查(第 3 段思考) 一段接一段,順理成章往下走,直到把整道題完整解完。
對應(yīng)到模型里就是:第一塊 518 個 token 用來讀題,然后自動開啟第二塊的思考,第二塊用完開第三塊…… 全程思路連貫,一直到把問題徹底想明白為止,用戶完全感覺不到中間分了塊。
但 GPT-5.5 不會向下延續(xù)。它剛把第一塊的思考額度用完(到 516 個有效推理 token),觸發(fā)完上報,思考就直接終止了,不會自動開啟下一塊,也不會順著剛才的思路繼續(xù)往下推演。
還是拿做數(shù)學(xué)大題舉例:它剛拆解完已知條件,剛要開始推導(dǎo)公式,就被強制喊停,直接把 “拆解完的條件” 當(dāng)成最終答案交上來。后面的推導(dǎo)、計算、驗算全都沒往下想,自然答案殘缺、邏輯斷裂,看起來就像 “變笨了”。
而針對這個問題,這位大佬也在 Github 開源自己制作的中間件 CodexCont。 和修改提示詞、本地腳本調(diào)試等臨時手段不同,CodexCont 是部署在 AI 編程 Agent 與 OpenAI 接口之間的鏈路代理層,全程攔截流式推理數(shù)據(jù),實時監(jiān)控 reasonning-token 數(shù)值。
也就是說 CodexCont 代理可以檢測長推理是否被截斷,一旦疑似截斷,就自動下指令讓模型繼續(xù)思考,再把多輪響應(yīng)整合成一次完整輸出。雷峰網(wǎng)(公眾號:雷峰網(wǎng))

02
如果光看榜單數(shù)據(jù),GPT-5.6 可以輕易反超 Fable 5,成為新一代頂級大模型的工程生產(chǎn)力標(biāo)桿。
據(jù) OpenAI 官方在 Reddit 公布的 TerminalBench 2.1 評測榜單顯示,GPT-5.6 系列表現(xiàn)強勢:Sol Ultra 以 91.9% 的得分登頂,Sol 版本也拿下 88.8% 位列第二,不僅大幅領(lǐng)先現(xiàn)役的 GPT-5.5,也全面壓過 Claude Mythos 5、Claude Fable 5、Gemini 3.1 Pro 等一眾頭部競品,成績可謂相當(dāng)亮眼,進(jìn)一步推高了市場對新版本的期待。

拿到內(nèi)測資格的從業(yè)者也放出了硬核實測反饋。NVIDIA CUDA 領(lǐng)域資深開發(fā)者 Bryce(圈內(nèi)人稱 “CUDA 上校”)測試后表示,GPT-5.6 Sol 僅運行 30 小時實現(xiàn)的加速效果,就已經(jīng)追平并超越了 Claude Opus 跑滿 64 小時的水平。

但與此同時,GPT 5.6 也被爆出了“benchmaxxed”。
業(yè)內(nèi)博主 Lisan al Gaib 曝出的官方評測文件顯示,OpenAI 曾委托第三方機構(gòu) METR 對 GPT-5.6 Sol 開展 Time Horizon 1.1 軟件任務(wù)套件評測,最終結(jié)果卻直接被判定無效 。
METR 檢出 GPT-5.6 Sol 存在異常高頻的 “作弊行為”,即模型通過鉆評測環(huán)境的漏洞、采用任務(wù)規(guī)則不允許的策略來抬高分?jǐn)?shù),這類表現(xiàn)無法真實衡量模型的能力水平,評測結(jié)果不具備橫向參考價值。
最關(guān)鍵的是 OpenAI 自己也間接實錘了這一點,稱模型更強的任務(wù)持續(xù)性,反而導(dǎo)致部分行為超出了評測約束邊界,這和內(nèi)部對齊實驗中觀測到的偏差趨勢一致。
這也讓社區(qū)的質(zhì)疑進(jìn)一步坐實:GPT 5.6 可能僅僅只是在分?jǐn)?shù)上好看,但真實 Agent 工作流未必能打過 Fable 5。

除此之外,也有內(nèi)測人員發(fā)現(xiàn)了 GPT-5.6 的邏輯雖然不像 GPT-5.5 一樣出現(xiàn)斷鏈現(xiàn)象,但是為了強行維持邏輯鏈條的完整性,為了邏輯連續(xù)不惜突破現(xiàn)實常識、瞎說八道。
開發(fā)者 Tibo 就分享了一段內(nèi)測時與 GPT-5.6 Sol 的互動,直觀展現(xiàn)了這一特性:用戶僅發(fā)送了三行敬禮表情,模型卻順著對話里的數(shù)字指令,一路推演起了 “表情算術(shù)”。

它先統(tǒng)計表情數(shù)量、按倍數(shù)計算總量,再減去 800 的額度,最后得出了 “-332 個敬禮表情” 的結(jié)果。但是表情沒有正負(fù)屬性,正常人類都知道表情不可能是負(fù)數(shù)。
而 Sol 非但沒有修正邏輯,反而為了自圓其說自創(chuàng)了一套 “敬禮負(fù)債” 體系,最后輸出了一個結(jié)果: “你欠了 332 個敬禮”,硬生生把違背常識的計算結(jié)果圓成了一套自洽的虛擬規(guī)則。
這有可能暴露了 GPT-5.6 Sol 的典型特征:它極度執(zhí)著于完成完整的邏輯閉環(huán),為了把推演鏈條走到底,會主動突破現(xiàn)實常識與人為規(guī)則,自行腦補不存在的設(shè)定來自圓其說。
有趣的是這個現(xiàn)象和現(xiàn)役的 GPT-5.5 恰好形成了極鮮明的反差。GPT-5.5 是被后臺硬性閾值牢牢鎖死了推理長度,思考到固定 token 數(shù)就被強制截斷,半步都不敢多推演,因此被用戶吐槽 “變笨、思考淺、長任務(wù)翻車”;
而 GPT-5.6 Sol 則是徹底放開了推理約束,哪怕脫離現(xiàn)實常識、違背客觀邏輯,也要把完整鏈條推演到底,甚至自創(chuàng)一套虛擬規(guī)則強行閉環(huán),反而容易產(chǎn)出脫離現(xiàn)實的怪異結(jié)論。

03
GPT-5.6 VS Fable 5
從表面看,GPT-5.6 的優(yōu)勢可能來自更強的推理能力。但在重度開發(fā)者眼里,模型競爭的勝負(fù)并不由單次回答質(zhì)量決定,而是由長周期任務(wù)中的可靠性決定。誰能在真實項目里連續(xù)理解需求、拆解任務(wù)、并最終交付可合并的結(jié)果,誰才真正占據(jù)工程模型的高地。
Fable 5 的核心護(hù)城河在于它在復(fù)雜 Agent 工作流中的“連續(xù)作業(yè)能力”。開發(fā)者選擇它,往往不是因為它每一道題都答得最漂亮,而是因為它在多輪調(diào)試和長期任務(wù)推進(jìn)中更少掉鏈子。在工程場景里,F(xiàn)able 5 就像一個穩(wěn)定高效的工程師,能在幾小時以內(nèi)完成一個團(tuán)隊幾星期的工作。
這就是 GPT-5.6 面前的第一道瓶頸:長推理穩(wěn)定性。如果 GPT-5.6 不能原生解決長任務(wù)斷鏈這些問題,那它就算榜單分?jǐn)?shù)再漂亮,也很難真正說服開發(fā)者。
第二道瓶頸,同時也是最核心的優(yōu)勢突破口,是性能與成本的平衡。Fable 5 被認(rèn)為“強而小眾”,問題并不是能力不夠,而是能力的邊際成本太高,說白了,就是 Fable 5 很貴。有的用戶只是對 Fable 5 說一句 “Hey” 就花掉了 20 美元,普通開發(fā)者的日常使用負(fù)擔(dān)可想而知。

但如果 GPT-5.6 的調(diào)用成本和使用效率比 Fable 低,哪怕它的硬實力比 Fable 稍弱一點,從實際生產(chǎn)角度它也已經(jīng)比 Fable 更好用了。
有開發(fā)者表示,自己用 GPT-5.5 做中低難度的開發(fā)任務(wù),感覺就像 “用火箭筒打螞蟻”,完全夠用。所以如果 5.6 的速度、成本和 5.5 差不多,自己是肯定會換成日常主力使用的,但除非它擁有 Fable 那種 “核心特質(zhì)”,否則不敢說它比 Fable 更強。

總而言之,或許大模型的最終勝負(fù)從來不由榜單定義。跑分只能換來一時的關(guān)注,而穩(wěn)定、可控、高性價比的持續(xù)交付,才能撬動真正的用戶遷移。雷峰網(wǎng)
真正的護(hù)城河從來不是參數(shù)、榜單或宣傳,而是開發(fā)者的肌肉記憶:遇到棘手的復(fù)雜問題時,第一個想起打開誰,誰就贏了。
參考鏈接:
https://x.com/goodworse/status/2073539985588842870
https://github.com/neteroster/Codex
https://x.com/bdsqlsz/status/2073442704852226479


上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學(xué)術(shù)新星訪談

掃描上方二維碼
或點擊「閱讀原文」關(guān)注專區(qū)。
雷峰網(wǎng)原創(chuàng)文章,未經(jīng)授權(quán)禁止轉(zhuǎn)載。詳情見轉(zhuǎn)載須知。