0
| 本文作者: 鄭佳美 | 2026-07-31 17:16 |

作者丨鄭佳美
編輯丨馬曉寧
剛剛,DeepSeek 更新了 DeepSeek-V4-Flash。
官方把它稱為“正式版”,不過目前只是在 API 端上線公測。此次更新也只涉及 deepseek-v4-flash,V4-Pro API,以及 App 和網(wǎng)頁端當(dāng)前使用的模型,都沒有隨之更新。

但比起“正式版”這個(gè)名字,這次更新更值得關(guān)注的是另一句話:DeepSeek-V4-Flash-0731 與此前的 Preview 版本采用相同的模型結(jié)構(gòu)和參數(shù)規(guī)模,只重新進(jìn)行了后訓(xùn)練。


01
大模型的訓(xùn)練其實(shí)可以被簡單分成兩個(gè)階段。
第一個(gè)階段是預(yù)訓(xùn)練。模型通過大量文本和代碼學(xué)習(xí)知識,形成基礎(chǔ)能力。這個(gè)階段決定了模型大致有多聰明、知道多少東西。
第二個(gè)階段是后訓(xùn)練。它更像是針對具體工作進(jìn)行專項(xiàng)訓(xùn)練,讓模型學(xué)會怎樣回答問題、怎樣調(diào)用工具,以及怎樣按照要求完成任務(wù)。
這次 DeepSeek 沒有重新設(shè)計(jì)模型架構(gòu),也沒有擴(kuò)大參數(shù)規(guī)模,而是在原有模型上重新進(jìn)行后訓(xùn)練。模型的結(jié)構(gòu)沒有變化,但內(nèi)部權(quán)重和行為方式會發(fā)生變化。
這有點(diǎn)像同一輛車沒有更換發(fā)動機(jī),卻重新調(diào)整了變速箱、控制系統(tǒng)和駕駛策略。車本身沒有變大,但在特定道路上的表現(xiàn)可能明顯改善。
不過,DeepSeek 并沒有公布這次后訓(xùn)練具體使用了哪些數(shù)據(jù)、獎勵(lì)方法和訓(xùn)練流程。因此,目前只能確定它重新做了后訓(xùn)練,不能進(jìn)一步斷言性能提升究竟來自哪一種技術(shù)。

02
根據(jù) DeepSeek 公布的結(jié)果,新版 V4-Flash 在 Terminal Bench 2.1 上獲得 82.7,在 DeepSWE 上獲得 54.4,在 DSBench-FullStack 上獲得 68.7。

這些測試和傳統(tǒng)的代碼補(bǔ)全不同。傳統(tǒng)代碼測試通常只要求模型寫出一段代碼,而 Agent 測試要求模型真正進(jìn)入一個(gè)工作環(huán)境。它需要讀取文件、理解代碼倉庫、調(diào)用終端、修改程序、運(yùn)行測試,再根據(jù)報(bào)錯(cuò)繼續(xù)處理。
也就是說,模型不只是要知道答案,還要連續(xù)完成多個(gè)步驟。
不過,這些成績也不能完全理解成模型自身的單獨(dú)能力。DeepSeek 明確說明,部分代碼 Agent 測試使用了尚未公開的 DeepSeek Harness,并采用了較高的推理檔位;DSBench-FullStack 和 DSBench-Hard 還是 DeepSeek 自己的內(nèi)部測試集。
因此,更準(zhǔn)確的說法是:V4-Flash-0731 在 DeepSeek 公布的 Agent 運(yùn)行環(huán)境中取得了明顯提升,但它在第三方框架中的實(shí)際表現(xiàn),還需要更多獨(dú)立測試。

03
此次更新還有一個(gè)重要變化:V4-Flash 開始原生支持 Responses API,并針對 Codex 進(jìn)行了適配。
Responses API 可以理解為一套更適合 Agent 的通信接口。它可以更統(tǒng)一地處理模型回復(fù)、推理狀態(tài)、工具調(diào)用和執(zhí)行結(jié)果。

它本身不會讓模型突然變得更聰明,但可以減少模型接入 Codex 等 Agent 工具時(shí)的適配工作,讓開發(fā)者更容易把模型放進(jìn)真實(shí)的軟件開發(fā)流程。雷峰網(wǎng)
所以,這次更新其實(shí)包含兩部分:一部分是重新后訓(xùn)練后的模型權(quán)重,另一部分是更適合 Agent 使用的接口和運(yùn)行環(huán)境。
最終成績由模型、推理預(yù)算、工具環(huán)境和 Agent 框架共同決定,很難只歸功于其中某一項(xiàng)。

04
目前可以確定的是,DeepSeek 在沒有改變 V4-Flash 模型結(jié)構(gòu)和參數(shù)規(guī)模的情況下,通過重新后訓(xùn)練提高了官方 Agent 基準(zhǔn)成績,同時(shí)增強(qiáng)了對 Responses API 和 Codex 工作流的支持。
但現(xiàn)階段還不能直接得出后訓(xùn)練已經(jīng)可以替代模型擴(kuò)容或者V4-Flash 已經(jīng)全面領(lǐng)先其他 Agent 模型這樣的結(jié)論。
一方面,V4-Flash-0731 的具體后訓(xùn)練變化尚未公開;另一方面,官方部分測試所使用的 Harness 和內(nèi)部數(shù)據(jù)集還不具備完整的外部復(fù)現(xiàn)條件。
所以,這次更新不適合簡單總結(jié)為DeepSeek 又發(fā)布了一個(gè)更強(qiáng)的模型。更準(zhǔn)確的理解是,DeepSeek 正在驗(yàn)證一條更加務(wù)實(shí)的技術(shù)路線:當(dāng)模型結(jié)構(gòu)和參數(shù)規(guī)模保持不變時(shí),能否通過重新后訓(xùn)練、工具接口適配和 Agent 運(yùn)行框架,進(jìn)一步提高模型完成真實(shí)任務(wù)的能力。雷峰網(wǎng)(公眾號:雷峰網(wǎng))
DeepSeek 已經(jīng)給出了官方成績,但這條路線究竟能帶來多大的實(shí)際提升,還要等待更多訓(xùn)練細(xì)節(jié)、公開工具和第三方測試。


上車,帶你看遍全球 AI 頂會精華
可獨(dú)家暢覽:
專家演講PPT
大會報(bào)告全文
熱門論文解讀
學(xué)術(shù)新星訪談

掃描上方二維碼
或點(diǎn)擊「閱讀原文」關(guān)注專區(qū)。
雷峰網(wǎng)原創(chuàng)文章,未經(jīng)授權(quán)禁止轉(zhuǎn)載。詳情見轉(zhuǎn)載須知。