后訓(xùn)練正成為大模型能力提升的新變量。DeepSeek 最近更新了 DeepSeek-V4-Flash,官方稱之為“正式版”,但目前僅在 API 端上線公測(cè)。此次更新只涉及 deepseek-v4-flash,V4-Pro API 以及 App 和網(wǎng)頁(yè)端當(dāng)前使用的模型并未隨之更新。

值得注意的是,DeepSeek-V4-Flash-0731 與此前的 Preview 版本采用相同的模型結(jié)構(gòu)和參數(shù)規(guī)模,只是重新進(jìn)行了后訓(xùn)練。這引發(fā)了人們的疑問(wèn):沒(méi)有換架構(gòu),為什么能力還能提升?

大模型的訓(xùn)練可以簡(jiǎn)單分為兩個(gè)階段。首先是預(yù)訓(xùn)練,模型通過(guò)大量文本和代碼學(xué)習(xí)知識(shí),形成基礎(chǔ)能力。其次是后訓(xùn)練,這是針對(duì)具體工作的專項(xiàng)訓(xùn)練,讓模型學(xué)會(huì)如何回答問(wèn)題、調(diào)用工具以及按要求完成任務(wù)。這次 DeepSeek 沒(méi)有重新設(shè)計(jì)模型架構(gòu)或擴(kuò)大參數(shù)規(guī)模,而是在原有模型上重新進(jìn)行后訓(xùn)練,導(dǎo)致內(nèi)部權(quán)重和行為方式發(fā)生變化。

這種變化類似于同一輛車未更換發(fā)動(dòng)機(jī),卻重新調(diào)整了變速箱、控制系統(tǒng)和駕駛策略。車本身沒(méi)有變大,但在特定道路上的表現(xiàn)可能明顯改善。不過(guò),DeepSeek 并未公布具體的后訓(xùn)練數(shù)據(jù)、獎(jiǎng)勵(lì)方法和訓(xùn)練流程,因此無(wú)法進(jìn)一步斷言性能提升究竟來(lái)自哪一種技術(shù)。
新版 V4-Flash 在 Terminal Bench 2.1 上獲得 82.7,在 DeepSWE 上獲得 54.4,在 DSBench-FullStack 上獲得 68.7。這些測(cè)試不同于傳統(tǒng)代碼補(bǔ)全,它們要求模型進(jìn)入一個(gè)工作環(huán)境,讀取文件、理解代碼倉(cāng)庫(kù)、調(diào)用終端、修改程序、運(yùn)行測(cè)試,并根據(jù)報(bào)錯(cuò)繼續(xù)處理。這意味著模型不僅要知道答案,還要連續(xù)完成多個(gè)步驟。




