DeepSeek V4 Flash 0731 開放權重:只重做後訓練,Agent 為何躍升?(2026)

最後更新: ·
DeepSeek V4 Flash 0731:只改後訓練?Agent 評測躍升,右側為官方 benchmark 比較表。

2026 年 7 月 31 日,DeepSeek 在 X 發布 DeepSeek V4 Flash 0731:先讓正式 API 進入公開測試,約 34 分鐘後又建立 Hugging Face 官方倉庫,放出 MIT 授權權重。DeepSeek 表示這次沒有更換架構、沒有把模型做大,只重新做了後訓練;但它公布的 Agent 與 coding 分數,卻像換了一代模型。

真正值得追問的不是「DeepSeek 又刷榜了嗎」,而是三件事:後訓練究竟能把同一個模型推多遠?獨立測試是否看見同方向的躍升?開放權重與極低 API 單價,會不會真的改寫 Agent 的使用方式?

先把官方發布放在桌上。點擊下面這張截圖,可以直接前往 DeepSeek 的 X 原文;接下來會先忠實整理發布內容,再把官方分數、Artificial Analysis 外部實測與部署成本逐一對照,最後給出可操作的判斷。

DeepSeek V4 Flash 0731 官方 X 發布截圖,宣布 API 公測、Agent 能力升級與 Responses API 支援。
DeepSeek 官方發布。點擊圖片前往 X 原文(另開新分頁)。

DeepSeek V4 Flash 0731 到底發布了什麼?

官方首發第一句很直接:

“DeepSeek-V4-Flash Official API is now LIVE in public beta!”

中文:「DeepSeek-V4-Flash 正式 API 已上線,並進入公開測試。」

— DeepSeek 官方 X,2026 年 7 月 31 日

把發布內容拆開,實際上是四件事:

  • API 版本更新:呼叫名稱仍是 deepseek-v4-flash,官方定價頁顯示它目前對應 DeepSeek-V4-Flash-0731
  • Agent 介面補齊:新版原生支援 Responses API,並被 DeepSeek 描述為已針對 Codex 適配;發布當時只有 Flash 支援這個介面。
  • 更新範圍有限:當天更換的是 Flash API;V4-Pro API 與 DeepSeek App/Web 模型沒有同步更新。
  • 權重真的可下載:Hugging Face 官方倉庫無需申請即可存取,模型卡與授權檔都把 repository 與模型權重置於 MIT License。

所以「API 公測」和「開放權重」不是二選一:DeepSeek 同時提供第一方託管 API,也把可自行部署的權重交到社群手上。


只重做後訓練,為什麼能像換了一顆模型?

DeepSeek 在 2026 年 7 月 31 日 changelog 寫下這句關鍵說明:

“keeps the same model architecture and size as DeepSeek-V4-Flash-Preview, and was only re-post-trained.”

中文:「它維持與 DeepSeek-V4-Flash-Preview 相同的架構與大小,只重新進行後訓練。」

— DeepSeek API Change Log

預訓練建立模型的知識與基礎能力,後訓練則把那些能力塑造成可用的行為:怎麼遵守指令、何時呼叫工具、如何維持長任務狀態、失敗後要不要重試,以及該花多少 token 思考。想先補齊這個背景,可以看 AlphaLab 的《AI 模型怎麼學習?預訓練、SFT、強化學習與 Evals》

這也是 Agent 最容易被低估的一點:同一個預訓練底座,如果後訓練讓模型更會讀工具回傳、更少提早宣布完成、更能在錯誤後修正路線,整條任務鏈的成功率就可能非線性上升。用一個把每一步視為互相獨立的簡化例子來看:單步成功率從 90% 提高到 96% 看似只多 6 個百分點,但連續十步都正確的機率會從約 35% 升到約 66%;這是複利效果示意,不是 0731 的實測完成率。

不過「只重做後訓練」目前仍是 DeepSeek 的官方自述。截至 2026 年 8 月 1 日,在這次官方 X、changelog、模型卡與 repository 中未見新的訓練資料、算力、SFT/RL 配方或完整紀錄,因此外部能驗證的是結果是否同方向改善,不是訓練過程本身。


DeepSeek V4 Flash 0731 的 Agent 分數跳了多少?

DeepSeek 公布九項 Agent/coding benchmark,0731 在表內每一列都高於 Flash Preview 與 V4-Pro Preview;最誇張的是 DeepSWE,從 7.3 拉到 54.4。完整官方表如下:

DeepSeek V4 Flash 0731 官方 Agent benchmark 表,包含 Terminal Bench、DeepSWE 與 Harness 限制。
圖/DeepSeek 官方 X:0731 與 Flash Preview、V4-Pro Preview、GLM-5.2、Opus-4.8 的九項比較;底部同時列出 Harness、max effort 與內部資料集限制。
代表性項目Flash Preview0731變化
Terminal Bench 2.161.882.7+20.9
DeepSWE7.354.4+47.1
AutomationBench Public10.825.1+14.3
DeepSeek 官方自報;不是外部獨立重跑。

表格最重要的內容,其實在最下面的小字。公開 Code Agent 項目使用尚未釋出的 DeepSeek Harness minimal mode,模型開到 max reasoning effort,取樣設定為 temperature=1.0top_p=0.95;DSBench-FullStack 與 DSBench-Hard 則是內部資料集。

還有一個容易被忽略的落差:DeepSeek API 預設 effort 是 high,頭條 benchmark 用的是 max。因此這些是官方系統在這套 max-effort 設定下的結果,不是一般人維持預設設定就必然得到的體感。


外部評測看見同方向,但不是同一個 82.7

Artificial Analysis(AA)在相同 v4.1 方法、同為 max effort 的條件下測得:Intelligence Index 從 40.28 升至 49.93,頁面四捨五入為 50;Agentic Index 從 31.06 升至 45.67,Coding Index 從 56.17 升至 69.06。

Artificial Analysis 對 DeepSeek V4 Flash 0731 的獨立測試摘要:Intelligence 50、API 價格與 2.1 億 token。
圖/Artificial Analysis,2026 年 8 月 1 日頁面快照:Intelligence Index 50、輸入/輸出單價與約 2.1 億輸出 token。
AA 指標Flash Preview0731
Intelligence Index40.2849.93
Agentic Index31.0645.67
Coding Index56.1769.06
Terminal-Bench 2.161.8%78.7%
Artificial Analysis 獨立測試;Terminal-Bench 使用 AA 的 Terminus 2 系統,並非 DeepSeek Harness。

這組結果讓結論變得清楚:能力跳升的方向有外部證據支持,DeepSeek 自報的精確幅度則還不能視為獨立重現。AA 的 Terminal-Bench 2.1 是 78.7%,較 preview 的 61.8%提高近 17 個百分點,但不是官方表裡的 82.7。

而「50」也不是一個脫離條件的通用 IQ。AA v4.1 方法是英文、純文字測試,Agents 與 Coding 權重分別為 34% 與 24%,合計 58%,0731 又開在 max effort。AA 自己還寫下:

“When evaluating the Intelligence Index, it generated 210M tokens, which is very verbose in comparison to the median of 100M.”

中文:「在 Intelligence Index 評測中,它產生了 2.1 億 token;相較於 1 億 token 的中位數,非常冗長。」

— Artificial Analysis

這代表新版的亮點是單價極低,不是思考免費。截至 2026 年 8 月 1 日,DeepSeek 第一方 API 定價為每百萬 cache-hit 輸入 token 0.0028 美元、cache-miss 輸入 0.14 美元、輸出 0.28 美元;AA 跑完整套 Index 花了 72.02 美元。官方另已預告未來尖峰時段會改為兩倍價格,但尚未公布生效日。

如果你關心的是整體 Agent 成本曲線,也可以搭配看 AlphaLab 對 GPT‑5.6 Luna 降價 80% 的分析:真正應比較的是「完成一個任務要多少錢」,而不只是每百萬 token 的標價。


更會做事,不等於更值得不經查證地相信

AA 的反向結果比「50」更有價值。根據 AA 的 0731 分析,在 AA-Omniscience 中,新版知識正確率仍約 37%,幾乎沒有提高;改善主要來自少做錯誤猜測,使這個特定 benchmark 定義的 hallucination rate 從約 96%降至 84%。

這裡的 84%不能搬去解讀成「一般聊天有 84% 都在幻覺」,它只是 AA 那套高難度知識題與拒答規則下的指標。AA 公開證據能支持的是:執行與工具類評測大幅改善,但 AA-Omniscience 的知識正確率沒有同步提高。

因此,適合讓它多做的是可驗收的工作:跑測試、改程式、操作工具、整理資料、產出可比對的檔案。涉及事實、權限或不可逆操作時,系統仍需要 schema 驗證、測試、diff、沙箱與明確的人工確認點。這不是對 DeepSeek 特別苛刻,而是 Agent 工程本來就該把「產生答案」和「證明答案」分開。


MIT 開放權重是真的,但「能下載」不等於「筆電能跑」

DeepSeek V4 Flash 0731 Hugging Face 模型頁:MIT License、下載量與模型大小資訊。
圖/Hugging Face 官方模型頁,2026 年 8 月 1 日快照:MIT License、15,366 downloads;該次模型樹快照另列出 37 個被歸類為 Quantizations 的衍生模型。

“This repository and the model weights are licensed under the MIT License.”

中文:「此儲存庫與模型權重均採 MIT 授權。」

— DeepSeek 官方模型卡

這個授權允許下載、修改、部署、再散布與商業使用,只要保留 MIT 的授權與版權聲明。精確說法應是「MIT 開放權重」,而不是把它包裝成所有要素都公開的「完全開源」:截至 2026 年 8 月 1 日,在這次官方發布、模型卡與 repository 中未見 0731 的後訓練資料、完整 recipe、訓練 log;模型卡也把 benchmark harness 標為「to be released」。

硬體門檻也不小。DeepSeek V4 官方技術報告把 Flash backbone 定義為 284B 總參數、每 token 啟用 13B;0731 官方模型卡與檔案樹顯示 checkpoint 另附 DSpark 推測解碼模組,Hugging Face 側欄自動統計約 304B。48 個 safetensors shard 合計約 166.9 GB,而模型卡中的 vLLM 範例使用一個 4×NVIDIA GB300 節點。

社群量化可以把儲存與推理門檻往下壓,但不會把它魔法般變成小模型。這與 Kimi K3 權重落地後「可下載、未必人人可跑」是同一個現實;要評估 vLLM、llama.cpp、MLX 與不同硬體路線,可以接著看《LLM 推論引擎怎麼選》


關注度確實爆發,API 使用量則還沒有公開證據

截至 2026 年 8 月 1 日 19:30(台北時間),官方 X 首發約有 678 萬次觀看、2.54 萬個讚;Hacker News 討論累積 562 points、300 則可見留言;Hugging Face 官方模型頁則有 1,238 likes 與 15,366 downloads。這些動態快照顯示發布在不到兩天內獲得大量關注。

但這些都不是「實際使用量」:X views 不是獨立人數;Hugging Face 的 models download 統計是特定檔案的 GET/HEAD 請求,不等於 15,366 人完整下載 166.9 GB 權重;這次 DeepSeek 官方發布資料也沒有提供 API token 或活躍使用者數。因此,最準確的表述是Agent 評測與社群關注同步爆發,而不是宣稱 API 用量已被證實暴增。


AlphaLab 的判讀:這次真正改變了什麼?

判讀一:最大的新聞不是模型變大,而是相同架構與規模還有多大可塑性

如果 DeepSeek 對訓練範圍的描述準確,0731 展示的是一個很強的工程訊號:frontier 模型的價值不只在預訓練花了多少算力,也在之後能不能把能力壓進穩定的工具使用、長任務控制與錯誤恢復。這會讓「後訓練資料、環境與評測」的競爭變得更重要,而不只是比誰的參數多。

判讀二:Agent benchmark 測的是系統,不只是模型

Agent 成績可以近似寫成:模型權重 × Harness × 推理預算 × 工具 × 任務環境模型卡把 DeepSeek Harness 標為「to be released」,就代表社群目前拿到的是「引擎」,卻還沒拿到官方比賽用的完整「賽車」。AA 用另一套系統仍測到大幅上升,支持能力提升可以在另一套 harness 中觀察到;兩邊 82.7 與 78.7 的差距,也提醒我們不能把系統分數誤讀成單一模型常數。

判讀三:低價最先改寫的是實驗頻率

每百萬輸出 token 0.28 美元的意義,不只是把同一個 prompt 變便宜,而是讓團隊可以跑更多候選方案、更多驗證器、更多回歸測試與平行 Agent。當探索成本下降,原本只敢跑一次的流程能跑十次,再用測試淘汰九個錯誤答案。這種「便宜到可以反覆驗證」的能力,可能比單次回答更接近真正的生產力。

判讀四:開放權重有利於擴散,卻不會自動解決可重現性

MIT 權重讓研究者能量化、換推理引擎、做私有部署、檢查行為並針對領域後訓練,這是實質開放;但截至 2026 年 8 月 1 日,官方模型卡仍把 Harness 標為待發布,本次發布資料也未提供 0731 recipe,所以「權重可得」與「結果可重現」現在只完成了前半段。這也正是開放權重政策爭論裡最容易被一句「開源」掩蓋的差別。

我同意什麼,又存疑什麼?

我同意的:0731 不是只有一張官方榜單。AA 的獨立指標也看見整體、Agentic、Coding 與 Terminal-Bench 明顯上升,因此「能力方向性躍升」可信;MIT 權重和低 API 單價,也讓產品與研究社群具備快速採用與驗證這次升級的條件。

我存疑的:官方最大幅度仍混合了未公開 Harness、max effort 與兩組內部資料;知識正確率沒有跟 Agent 分數一起跳;AA 評測又消耗約兩倍於中位數的輸出 token。把它直接寫成「以 0.28 美元買到頂級模型」太粗糙——你買到的是極低單價與很高的任務上限,最終成本和品質仍取決於 Harness、token 用量與驗收設計。


DeepSeek V4 Flash 0731 適合誰?四個實際下一步

  1. 正在用 DeepSeek API:固定 20 個真實任務,同時跑預設 highmax,記錄完成率、輸出 token、延遲、重試次數與總成本。不要拿一個 demo 決定路由;可以直接套用《用 10 題小型 Eval 建立模型路由》的方法。
  2. 正在做 coding Agent:把模型與 Harness 分開 A/B。至少記錄工具呼叫格式錯誤、提早結束、測試通過率與失敗後恢復率;等 DeepSeek Harness 釋出後,再檢查官方 82.7 能否在公開環境靠近。
  3. 想自行部署:先算記憶體、KV cache、吞吐與並行需求,再選原生權重或量化版。官方 4×GB300 是部署範例,不是一般工作站承諾;推理引擎、量化精度與 reasoning effort 映射都會改變結果。
  4. 想把低價變成產能:把省下的預算用在驗證器、測試與平行候選,而不是只放大單次輸出。想理解 Harness、Loop、Graph 分工,可看《AI Agent 三層架構》;想把 Memory、Skills 與排程串成可累積工作流,可接著看《Hermes Agent 進階教學》

📚 延伸閱讀

如果只留下一句話:DeepSeek 稱 0731 維持相同架構與規模、只重新做了後訓練;AA 則獨立測到 Agent 指標明顯上升。DeepSeek V4 Flash 0731 下一個真正決定它能走多遠的事件,不是更多轉發,而是 DeepSeek Harness 公開後,社群能否用自己的任務、自己的成本與自己的驗收標準,把這次躍升重做一遍。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。