跳到主要內容

DeepSeek V4 Flash 0731:後訓練把開放權重 Agent 性價比再推一步(2026)

最後更新: ·
DeepSeek V4 Flash 0731 同一核心架構、AA 指數從 40 升至 50

2026 年 7 月 31 日,DeepSeek V4 Flash 0731 進入 API public beta,並在同日以 MIT License 公開權重。DeepSeek 表示它沿用 Flash Preview 的核心架構與規模,只重新做了後訓練;第三方 Artificial Analysis(AA)卻測到 Intelligence Index 從 40 升至 50。這不是新架構發布,卻把開放權重 Agent 的基準成績/API 成本性價比再往前推了一步。

真正值得追問的不是「DeepSeek 又刷榜了嗎」,而是三件事:後訓練究竟能把同一個核心模型推多遠?獨立測試是否看見同方向的躍升?開放權重與低 API 單價,能否把提升變成可重現的 Agent 生產力?本文談的「性價比」只限於 AA 的測試組合與 DeepSeek API 價格,不等於每種 Agent、每個 harness 或本地部署都便宜六成。

先把原始材料放在桌上。點擊下面的瀏覽器框,可直接前往 DeepSeek 官方 changelog;接下來再把官方成績、AA 外部實測、成本與可靠性逐一拆開。

DeepSeek API 更新頁宣布 V4 Flash 0731 公開測試、同一架構與後訓練
DeepSeek API Change Log,2026 年 7 月 31 日。點擊圖片前往官方原文(另開新分頁)。

DeepSeek V4 Flash 0731 到底發布了什麼?

官方 changelog 對這次升級的核心描述是:

“keeps the same model architecture and size as DeepSeek-V4-Flash-Preview, and was only re-post-trained.”

中文:「維持與 DeepSeek-V4-Flash-Preview 相同的架構與大小,只重新進行後訓練。」

— DeepSeek API Change Log,2026 年 7 月 31 日

把發布內容拆開,實際上是四件事:

  • API 進入公測:呼叫名稱仍是 deepseek-v4-flash,目前對應 DeepSeek-V4-Flash-0731;這次更新的是 Flash API,不是 V4-Pro 或 App/Web 模型的全面替換。
  • Agent 介面補齊:新版支援 Responses API,並被 DeepSeek 描述為已針對 Codex 類工作流適配。
  • MIT 開放權重:Hugging Face 官方倉庫公開、非 gated,repository 與模型權重採 MIT License;這不等於訓練資料與完整 pipeline 也開源。
  • 1M context 上限:官方 config 列出 1,048,576 tokens,但「可輸入 1M」不代表已證明整段 1M 都能穩定推理或當成永久記憶。

所以「API 公測」和「開放權重」不是二選一:DeepSeek 同時提供第一方託管 API,也把可自行部署的權重交到社群手上。


官方說只做後訓練:這個說法能驗證到哪裡?

「只重新後訓練」是 DeepSeek 的供應商聲明,不是外部對完整訓練歷程的審計。不過,「同一核心架構」至少有可交叉檢查的線索:對照官方 Hugging Face 上的 舊版 config0731 config,移除模型路徑欄位後,設定內容相同。

預訓練建立模型的知識與基礎能力,後訓練則把那些能力塑造成可用的行為:怎麼遵守指令、何時呼叫工具、如何維持長任務狀態、失敗後要不要重試,以及該花多少 token 思考。想先補齊這個背景,可以看 AlphaLab 的《AI 模型怎麼學習?預訓練、SFT、強化學習與 Evals》

這也是 Agent 最容易被低估的一點:同一個預訓練底座,如果後訓練讓模型更會讀工具回傳、更少提早宣布完成、更能在錯誤後修正路線,整條任務鏈的成功率就可能非線性上升。用一個把每一步視為互相獨立的簡化例子來看:單步成功率從 90% 提高到 96% 看似只多 6 個百分點,但連續十步都正確的機率會從約 35% 升到約 66%;這是複利效果示意,不是 0731 的實測完成率。

截至 2026 年 8 月 3 日,官方 changelog、模型卡與 repository 說明了結果與部署方式,沒有列出 0731 專屬的訓練資料、算力、SFT/RL recipe 或 ablation。外部現在能檢驗的是結果是否同方向改善,不能獨立重建「只靠後訓練」的因果鏈。


DeepSeek V4 Flash 0731 的 Agent 分數跳了多少?

DeepSeek 公布九項 Agent/coding benchmark,0731 在表內每一列都高於 Flash Preview 與 V4-Pro Preview;最誇張的是 DeepSWE,從 7.3 拉到 54.4。完整官方表如下:

DeepSeek V4 Flash 0731 官方 Agent 與 coding benchmark 比較表
圖/DeepSeek 官方自測:0731 與 Flash Preview、V4-Pro Preview、GLM-5.2、Opus-4.8 的九項比較;底部同時列出 Harness、max effort 與內部資料集限制。
代表性項目Flash Preview0731變化
Terminal Bench 2.161.882.7+20.9
DeepSWE7.354.4+47.1
AutomationBench Public10.825.1+14.3
DeepSeek 官方自報;不是外部獨立重跑。

表格最重要的內容,其實在最下面的小字。公開 Code Agent 項目使用尚未釋出的 DeepSeek Harness minimal mode,模型開到 max reasoning effort,取樣設定為 temperature=1.0top_p=0.95;DSBench-FullStack 與 DSBench-Hard 則是內部資料集。

還有一個容易被忽略的落差:DeepSeek API 預設 effort 是 high,頭條 benchmark 用的是 max。因此這些是官方系統在這套 max-effort 設定下的結果,不是一般人維持預設設定就必然得到的體感。


AA 也看見上升,但 50 不是通用 IQ

Artificial Analysis(AA)在 v4.1 方法、同為 max effort 的條件下測得:Intelligence Index 從 40.2825 升至 49.9277,增加 9.645 分,頁面四捨五入為 40→50。這是目前最重要的外部交叉檢查。

Artificial Analysis Intelligence Index 顯示 DeepSeek V4 Flash 0731 為 50、舊版為 40
圖/Artificial Analysis:0731 的 Intelligence Index 為 50,前一版為 40。這是英語、純文字的綜合指數,不是通用 IQ。
AA 外部測試Flash Preview0731
Intelligence Index40.2849.93
Terminal-Bench 2.161.80%78.65%
GDPval-AA Elo1,189.01,558.6
τ³-bench Banking22.89%31.13%
Artificial Analysis 獨立測試;其 Terminal-Bench 使用 Terminus 2,而非 DeepSeek 尚未公開的 Harness。

這組結果讓結論變得清楚:能力上升的方向有外部證據支持,DeepSeek 自報的精確幅度仍不能視為獨立重現。同一模型在 AA 的 Terminal-Bench 是 78.65%,不是官方表裡的 82.7%;差距本身就在提醒我們,Agent 成績屬於「模型 × harness × effort × 工具環境」,不是權重的單一常數。

「50」也不是脫離條件的通用 IQ。AA v4.1 方法由九組英語、純文字評測組成,Agents、Coding、Science、General Knowledge 權重依序為 34%、24%、24%、18%,0731 又開在 max effort。這個權重結構會放大 Agent/coding 改善,不能推成所有知識領域同步進步。

「成本低 60%」的分母是什麼?

Artificial Analysis 圖表比較 DeepSeek V4 Flash 0731 的 Intelligence Index 與加權每任務成本
圖/Artificial Analysis,2026 年 7 月 31 日成本模型快照。這是特定測試組合與 API 價格下的估算,不是每種 Agent 工作的固定成本。

AA 的 7 月 31 日分析把 0731 描述為相較 GPT‑5.6 Luna max 每任務成本約低六成。把公開數字拆開:整套 Index 總成本是 72.02 對 174.06 美元,低 58.6%;目前 dashboard 的 weighted cost per task 則是 0.02713 對 0.04735 美元,低 42.7%。兩種彙總方式不同,因此「約六成」只能視為 AA 當日、該比較對象與該測試組合的快照。

它也不是「相較舊 Flash 便宜六成」:按目前 weighted cost per task,新版反而約高 16%;整套總成本只低約 3%。截至 2026 年 8 月 3 日,DeepSeek 第一方 API 定價為每百萬 cache-hit 輸入 token 0.0028 美元、cache-miss 輸入 0.14 美元、輸出 0.28 美元;cache hit 與 miss 相差 50 倍,官方還預告未來尖峰時段可能調為兩倍價格,日期另行公告。真正該量的是每個成功任務的總成本:token、cache 命中、重試、驗證與延遲都要算進去。也可搭配 AlphaLab 對 GPT‑5.6 Luna 降價 80% 的分析。


更會做事,不等於更值得不經查證地相信

AA 的反向結果比「50」更有價值。根據 AA 的 0731 分析,AA-Omniscience 的正確率仍是 37.23%,只比前一版多答對一題;6,000 題中有 3,177 題判為 incorrect,占全部題目的 52.95%。新版的主要變化,是更常部分作答或承認不知道,而不是事實準確率大幅跳升。

Artificial Analysis AA Omniscience 圖表顯示 DeepSeek V4 Flash 0731 條件式 hallucination rate 約 84%
圖/Artificial Analysis:84% 是 incorrect ÷(incorrect+partial answers+not attempted)的條件式比率,不是一般回答的整體錯誤率。

所以圖上的 84.36%不能搬去解讀成「一般聊天有 84% 都答錯」。它只描述 AA 這套高難度知識題中,模型在沒有完全答對的回答裡,有多常選擇錯答而不是部分回答或不作答。正確結論是:模型少了一些亂猜,校準有所改善;執行/工具能力大升,但事實正確率沒有同步突破。

因此,適合讓它多做的是可驗收的工作:跑測試、改程式、操作工具、整理資料、產出可比對的檔案。涉及事實、權限或不可逆操作時,系統仍需要 schema 驗證、測試、diff、沙箱與明確的人工確認點。這不是對 DeepSeek 特別苛刻,而是 Agent 工程本來就該把「產生答案」和「證明答案」分開。


MIT 開放權重是真的,但「能下載」不等於「筆電能跑」

MIT License 允許下載、修改、部署、再散布與商業使用,只要保留授權與版權聲明。精確說法應是「MIT 開放權重」,不是把它包裝成所有要素都公開的「完整開源」:官方材料沒有附上 0731 的訓練資料、完整 recipe 或訓練 log,模型卡也仍把 benchmark harness 標為「to be released」。

硬體門檻也不小。DeepSeek V4 官方技術報告核心 target model定義為 284B 總參數、每 token 啟用 13B;0731 可下載 checkpoint另附既有 DSpark 推測解碼模組,Hugging Face safetensors 統計約 304.18B tensors,檔案約 166.9 GB。官方 vLLM 範例使用一個 4×NVIDIA GB300 節點。13B active 能降低每 token 計算量,不代表它是可塞進一般單卡的 13B 小模型。

社群很快就能開始量化、移植、替換推論引擎與測試不同 Agent harness,這是開放權重的真正價值;但量化不會把它魔法般變成小模型。便宜的第一方 API 與便宜的 self-host 是兩套經濟模型:後者還要攤提 GPU、記憶體、吞吐、維運與利用率。這與 Kimi K3 權重落地後「可下載、未必人人可跑」是同一個現實;部署路線可接著看《LLM 推論引擎怎麼選》


熱度可以量化,但不能從熱度推出 API 採用

截至 2026 年 8 月 3 日 12:04(台北時間),官方 X 首發透過非官方 FxTwitter metrics proxy讀到約 835.4 萬次觀看與 28,986 個讚;Hacker News 討論為 737 points、345 comments;Hugging Face 官方模型頁為 1,803 likes、156,173 monthly downloads。這些都是會變動的抓取快照。

但 views、points、likes 都不是實際 Agent 使用量。Hugging Face models download是按其規則計入特定檔案請求的近月統計,不代表 156,173 位獨立使用者完整下載 166.9 GB。這三組數字能支持的是發布吸引了大量注意,且開放權重讓實測迅速展開;不能單獨證明 API tokens、留存或生產部署同步暴增。


AlphaLab 的判讀:這次真正改變了什麼?

判讀一:最大的新聞不是模型變大,而是同一核心架構還有多大可塑性

如果 DeepSeek 對訓練範圍的描述準確,0731 展示的是一個很強的工程訊號:frontier 模型的價值不只在預訓練花了多少算力,也在之後能不能把能力壓進穩定的工具使用、長任務控制與錯誤恢復。這會讓「後訓練資料、環境與評測」的競爭變得更重要,而不只是比誰的參數多。

判讀二:Agent benchmark 測的是系統,不只是模型

Agent 成績可以近似寫成:模型權重 × Harness × 推理預算 × 工具 × 任務環境模型卡把 DeepSeek Harness 標為「to be released」,就代表社群目前拿到的是「引擎」,卻還沒拿到官方比賽用的完整「賽車」。AA 用另一套系統仍測到大幅上升,支持能力提升可以在另一套 harness 中觀察到;兩邊 82.7 與 78.65 的差距,也提醒我們不能把系統分數誤讀成單一模型常數。

判讀三:低價最先改寫的是實驗頻率

每百萬輸出 token 0.28 美元的意義,不只是把同一個 prompt 變便宜,而是讓團隊可以跑更多候選方案、驗證器、回歸測試與平行 Agent。前提是把 cache 命中、重試與驗證也納入成本:便宜模型如果需要反覆救火,成功任務成本仍可能不低;反過來說,低單價若能換來更多可自動驗收的候選,才可能接近真正的生產力。

判讀四:開放權重有利於擴散,卻不會自動解決可重現性

MIT 權重讓研究者能量化、換推理引擎、做私有部署、檢查行為並針對領域後訓練,這是實質開放;但截至 2026 年 8 月 3 日,官方模型卡仍把 Harness 標為待發布,本次材料也未提供 0731 recipe,所以「權重可得」與「官方結果可重現」現在只完成了前半段。這也正是開放權重政策爭論裡最容易被一句「開源」掩蓋的差別。

我同意什麼,又存疑什麼?

我同意的:0731 不是只有一張官方榜單。AA 的獨立指標也看見綜合、Agent、coding 與 Terminal-Bench 明顯上升,因此「能力方向性進步」可信;MIT 權重和低 API 單價,也讓產品與研究社群具備快速採用與驗證這次升級的條件。

我存疑的:官方最大幅度仍混合了未公開 Harness、max effort 與兩組內部資料;AA-Omniscience 正確率沒有跟 Agent 分數一起跳;1M context 也只是容量上限,不是有效記憶保證。把它直接寫成「以 0.28 美元買到頂級 Agent」太粗糙——真正買到的是低 token 單價與較高的任務上限,最終成本和品質仍取決於 Harness、有效 context、重試率與驗收設計。


DeepSeek V4 Flash 0731 適合誰?四個實際下一步

  1. 正在用 DeepSeek API:固定 20 個真實任務,同時跑預設 highmax,記錄完成率、輸出 token、延遲、重試次數與總成本。不要拿一個 demo 決定路由;可以直接套用《用 10 題小型 Eval 建立模型路由》的方法。
  2. 正在做 coding Agent:把模型與 Harness 分開 A/B。至少記錄工具呼叫格式錯誤、提早結束、測試通過率與失敗後恢復率;等 DeepSeek Harness 釋出後,再檢查官方 82.7 能否在公開環境靠近。
  3. 想自行部署:先算記憶體、KV cache、吞吐與並行需求,再選原生權重或量化版。官方 4×GB300 是部署範例,不是一般工作站承諾;推理引擎、量化精度與 reasoning effort 映射都會改變結果。
  4. 想把低價變成產能:把省下的預算用在驗證器、測試與平行候選,而不是只放大單次輸出。想理解 Harness、Loop、Graph 分工,可看《AI Agent 三層架構》;想把 Memory、Skills 與排程串成可累積工作流,可接著看《Hermes Agent 進階教學》

接著閱讀

左右滑動查看更多推薦

如果只留下一句話:DeepSeek 稱 0731 維持同一核心架構、只重新做了後訓練;AA 則獨立測到 40→50 與多項 Agent 指標上升。DeepSeek V4 Flash 0731 下一個真正決定它能走多遠的事件,不是更多轉發,而是 DeepSeek Harness 公開後,社群能否用自己的任務、自己的成功成本與自己的驗收標準,把這次進步重做一遍。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。