2026 年 7 月 31 日,DeepSeek 在 X 發布 DeepSeek V4 Flash 0731:先讓正式 API 進入公開測試,約 34 分鐘後又建立 Hugging Face 官方倉庫,放出 MIT 授權權重。DeepSeek 表示這次沒有更換架構、沒有把模型做大,只重新做了後訓練;但它公布的 Agent 與 coding 分數,卻像換了一代模型。
真正值得追問的不是「DeepSeek 又刷榜了嗎」,而是三件事:後訓練究竟能把同一個模型推多遠?獨立測試是否看見同方向的躍升?開放權重與極低 API 單價,會不會真的改寫 Agent 的使用方式?
先把官方發布放在桌上。點擊下面這張截圖,可以直接前往 DeepSeek 的 X 原文;接下來會先忠實整理發布內容,再把官方分數、Artificial Analysis 外部實測與部署成本逐一對照,最後給出可操作的判斷。

DeepSeek V4 Flash 0731 到底發布了什麼?
官方首發第一句很直接:
“DeepSeek-V4-Flash Official API is now LIVE in public beta!”
中文:「DeepSeek-V4-Flash 正式 API 已上線,並進入公開測試。」
— DeepSeek 官方 X,2026 年 7 月 31 日
把發布內容拆開,實際上是四件事:
- API 版本更新:呼叫名稱仍是
deepseek-v4-flash,官方定價頁顯示它目前對應DeepSeek-V4-Flash-0731。 - Agent 介面補齊:新版原生支援 Responses API,並被 DeepSeek 描述為已針對 Codex 適配;發布當時只有 Flash 支援這個介面。
- 更新範圍有限:當天更換的是 Flash API;V4-Pro API 與 DeepSeek App/Web 模型沒有同步更新。
- 權重真的可下載:Hugging Face 官方倉庫無需申請即可存取,模型卡與授權檔都把 repository 與模型權重置於 MIT License。
所以「API 公測」和「開放權重」不是二選一:DeepSeek 同時提供第一方託管 API,也把可自行部署的權重交到社群手上。
只重做後訓練,為什麼能像換了一顆模型?
DeepSeek 在 2026 年 7 月 31 日 changelog 寫下這句關鍵說明:
“keeps the same model architecture and size as DeepSeek-V4-Flash-Preview, and was only re-post-trained.”
中文:「它維持與 DeepSeek-V4-Flash-Preview 相同的架構與大小,只重新進行後訓練。」
— DeepSeek API Change Log
預訓練建立模型的知識與基礎能力,後訓練則把那些能力塑造成可用的行為:怎麼遵守指令、何時呼叫工具、如何維持長任務狀態、失敗後要不要重試,以及該花多少 token 思考。想先補齊這個背景,可以看 AlphaLab 的《AI 模型怎麼學習?預訓練、SFT、強化學習與 Evals》。
這也是 Agent 最容易被低估的一點:同一個預訓練底座,如果後訓練讓模型更會讀工具回傳、更少提早宣布完成、更能在錯誤後修正路線,整條任務鏈的成功率就可能非線性上升。用一個把每一步視為互相獨立的簡化例子來看:單步成功率從 90% 提高到 96% 看似只多 6 個百分點,但連續十步都正確的機率會從約 35% 升到約 66%;這是複利效果示意,不是 0731 的實測完成率。
不過「只重做後訓練」目前仍是 DeepSeek 的官方自述。截至 2026 年 8 月 1 日,在這次官方 X、changelog、模型卡與 repository 中未見新的訓練資料、算力、SFT/RL 配方或完整紀錄,因此外部能驗證的是結果是否同方向改善,不是訓練過程本身。
DeepSeek V4 Flash 0731 的 Agent 分數跳了多少?
DeepSeek 公布九項 Agent/coding benchmark,0731 在表內每一列都高於 Flash Preview 與 V4-Pro Preview;最誇張的是 DeepSWE,從 7.3 拉到 54.4。完整官方表如下:

| 代表性項目 | Flash Preview | 0731 | 變化 |
|---|---|---|---|
| Terminal Bench 2.1 | 61.8 | 82.7 | +20.9 |
| DeepSWE | 7.3 | 54.4 | +47.1 |
| AutomationBench Public | 10.8 | 25.1 | +14.3 |
表格最重要的內容,其實在最下面的小字。公開 Code Agent 項目使用尚未釋出的 DeepSeek Harness minimal mode,模型開到 max reasoning effort,取樣設定為 temperature=1.0、top_p=0.95;DSBench-FullStack 與 DSBench-Hard 則是內部資料集。
還有一個容易被忽略的落差:DeepSeek API 預設 effort 是 high,頭條 benchmark 用的是 max。因此這些是官方系統在這套 max-effort 設定下的結果,不是一般人維持預設設定就必然得到的體感。
外部評測看見同方向,但不是同一個 82.7
Artificial Analysis(AA)在相同 v4.1 方法、同為 max effort 的條件下測得:Intelligence Index 從 40.28 升至 49.93,頁面四捨五入為 50;Agentic Index 從 31.06 升至 45.67,Coding Index 從 56.17 升至 69.06。

| AA 指標 | Flash Preview | 0731 |
|---|---|---|
| Intelligence Index | 40.28 | 49.93 |
| Agentic Index | 31.06 | 45.67 |
| Coding Index | 56.17 | 69.06 |
| Terminal-Bench 2.1 | 61.8% | 78.7% |
這組結果讓結論變得清楚:能力跳升的方向有外部證據支持,DeepSeek 自報的精確幅度則還不能視為獨立重現。AA 的 Terminal-Bench 2.1 是 78.7%,較 preview 的 61.8%提高近 17 個百分點,但不是官方表裡的 82.7。
而「50」也不是一個脫離條件的通用 IQ。AA v4.1 方法是英文、純文字測試,Agents 與 Coding 權重分別為 34% 與 24%,合計 58%,0731 又開在 max effort。AA 自己還寫下:
“When evaluating the Intelligence Index, it generated 210M tokens, which is very verbose in comparison to the median of 100M.”
中文:「在 Intelligence Index 評測中,它產生了 2.1 億 token;相較於 1 億 token 的中位數,非常冗長。」
— Artificial Analysis
這代表新版的亮點是單價極低,不是思考免費。截至 2026 年 8 月 1 日,DeepSeek 第一方 API 定價為每百萬 cache-hit 輸入 token 0.0028 美元、cache-miss 輸入 0.14 美元、輸出 0.28 美元;AA 跑完整套 Index 花了 72.02 美元。官方另已預告未來尖峰時段會改為兩倍價格,但尚未公布生效日。
如果你關心的是整體 Agent 成本曲線,也可以搭配看 AlphaLab 對 GPT‑5.6 Luna 降價 80% 的分析:真正應比較的是「完成一個任務要多少錢」,而不只是每百萬 token 的標價。
更會做事,不等於更值得不經查證地相信
AA 的反向結果比「50」更有價值。根據 AA 的 0731 分析,在 AA-Omniscience 中,新版知識正確率仍約 37%,幾乎沒有提高;改善主要來自少做錯誤猜測,使這個特定 benchmark 定義的 hallucination rate 從約 96%降至 84%。
這裡的 84%不能搬去解讀成「一般聊天有 84% 都在幻覺」,它只是 AA 那套高難度知識題與拒答規則下的指標。AA 公開證據能支持的是:執行與工具類評測大幅改善,但 AA-Omniscience 的知識正確率沒有同步提高。
因此,適合讓它多做的是可驗收的工作:跑測試、改程式、操作工具、整理資料、產出可比對的檔案。涉及事實、權限或不可逆操作時,系統仍需要 schema 驗證、測試、diff、沙箱與明確的人工確認點。這不是對 DeepSeek 特別苛刻,而是 Agent 工程本來就該把「產生答案」和「證明答案」分開。
MIT 開放權重是真的,但「能下載」不等於「筆電能跑」

“This repository and the model weights are licensed under the MIT License.”
中文:「此儲存庫與模型權重均採 MIT 授權。」
— DeepSeek 官方模型卡
這個授權允許下載、修改、部署、再散布與商業使用,只要保留 MIT 的授權與版權聲明。精確說法應是「MIT 開放權重」,而不是把它包裝成所有要素都公開的「完全開源」:截至 2026 年 8 月 1 日,在這次官方發布、模型卡與 repository 中未見 0731 的後訓練資料、完整 recipe、訓練 log;模型卡也把 benchmark harness 標為「to be released」。
硬體門檻也不小。DeepSeek V4 官方技術報告把 Flash backbone 定義為 284B 總參數、每 token 啟用 13B;0731 官方模型卡與檔案樹顯示 checkpoint 另附 DSpark 推測解碼模組,Hugging Face 側欄自動統計約 304B。48 個 safetensors shard 合計約 166.9 GB,而模型卡中的 vLLM 範例使用一個 4×NVIDIA GB300 節點。
社群量化可以把儲存與推理門檻往下壓,但不會把它魔法般變成小模型。這與 Kimi K3 權重落地後「可下載、未必人人可跑」是同一個現實;要評估 vLLM、llama.cpp、MLX 與不同硬體路線,可以接著看《LLM 推論引擎怎麼選》。
關注度確實爆發,API 使用量則還沒有公開證據
截至 2026 年 8 月 1 日 19:30(台北時間),官方 X 首發約有 678 萬次觀看、2.54 萬個讚;Hacker News 討論累積 562 points、300 則可見留言;Hugging Face 官方模型頁則有 1,238 likes 與 15,366 downloads。這些動態快照顯示發布在不到兩天內獲得大量關注。
但這些都不是「實際使用量」:X views 不是獨立人數;Hugging Face 的 models download 統計是特定檔案的 GET/HEAD 請求,不等於 15,366 人完整下載 166.9 GB 權重;這次 DeepSeek 官方發布資料也沒有提供 API token 或活躍使用者數。因此,最準確的表述是Agent 評測與社群關注同步爆發,而不是宣稱 API 用量已被證實暴增。
AlphaLab 的判讀:這次真正改變了什麼?
判讀一:最大的新聞不是模型變大,而是相同架構與規模還有多大可塑性
如果 DeepSeek 對訓練範圍的描述準確,0731 展示的是一個很強的工程訊號:frontier 模型的價值不只在預訓練花了多少算力,也在之後能不能把能力壓進穩定的工具使用、長任務控制與錯誤恢復。這會讓「後訓練資料、環境與評測」的競爭變得更重要,而不只是比誰的參數多。
判讀二:Agent benchmark 測的是系統,不只是模型
Agent 成績可以近似寫成:模型權重 × Harness × 推理預算 × 工具 × 任務環境。模型卡把 DeepSeek Harness 標為「to be released」,就代表社群目前拿到的是「引擎」,卻還沒拿到官方比賽用的完整「賽車」。AA 用另一套系統仍測到大幅上升,支持能力提升可以在另一套 harness 中觀察到;兩邊 82.7 與 78.7 的差距,也提醒我們不能把系統分數誤讀成單一模型常數。
判讀三:低價最先改寫的是實驗頻率
每百萬輸出 token 0.28 美元的意義,不只是把同一個 prompt 變便宜,而是讓團隊可以跑更多候選方案、更多驗證器、更多回歸測試與平行 Agent。當探索成本下降,原本只敢跑一次的流程能跑十次,再用測試淘汰九個錯誤答案。這種「便宜到可以反覆驗證」的能力,可能比單次回答更接近真正的生產力。
判讀四:開放權重有利於擴散,卻不會自動解決可重現性
MIT 權重讓研究者能量化、換推理引擎、做私有部署、檢查行為並針對領域後訓練,這是實質開放;但截至 2026 年 8 月 1 日,官方模型卡仍把 Harness 標為待發布,本次發布資料也未提供 0731 recipe,所以「權重可得」與「結果可重現」現在只完成了前半段。這也正是開放權重政策爭論裡最容易被一句「開源」掩蓋的差別。
我同意什麼,又存疑什麼?
我同意的:0731 不是只有一張官方榜單。AA 的獨立指標也看見整體、Agentic、Coding 與 Terminal-Bench 明顯上升,因此「能力方向性躍升」可信;MIT 權重和低 API 單價,也讓產品與研究社群具備快速採用與驗證這次升級的條件。
我存疑的:官方最大幅度仍混合了未公開 Harness、max effort 與兩組內部資料;知識正確率沒有跟 Agent 分數一起跳;AA 評測又消耗約兩倍於中位數的輸出 token。把它直接寫成「以 0.28 美元買到頂級模型」太粗糙——你買到的是極低單價與很高的任務上限,最終成本和品質仍取決於 Harness、token 用量與驗收設計。
DeepSeek V4 Flash 0731 適合誰?四個實際下一步
- 正在用 DeepSeek API:固定 20 個真實任務,同時跑預設
high與max,記錄完成率、輸出 token、延遲、重試次數與總成本。不要拿一個 demo 決定路由;可以直接套用《用 10 題小型 Eval 建立模型路由》的方法。 - 正在做 coding Agent:把模型與 Harness 分開 A/B。至少記錄工具呼叫格式錯誤、提早結束、測試通過率與失敗後恢復率;等 DeepSeek Harness 釋出後,再檢查官方 82.7 能否在公開環境靠近。
- 想自行部署:先算記憶體、KV cache、吞吐與並行需求,再選原生權重或量化版。官方 4×GB300 是部署範例,不是一般工作站承諾;推理引擎、量化精度與 reasoning effort 映射都會改變結果。
- 想把低價變成產能:把省下的預算用在驗證器、測試與平行候選,而不是只放大單次輸出。想理解 Harness、Loop、Graph 分工,可看《AI Agent 三層架構》;想把 Memory、Skills 與排程串成可累積工作流,可接著看《Hermes Agent 進階教學》。
📚 延伸閱讀
- AI 模型怎麼學習?預訓練、SFT、強化學習與 Evals
- AI Agent 三層架構:Harness、Loop、Graph Engineering 差在哪
- AI 模型怎麼選?用小型 Eval 建立任務路由
- Kimi K3 權重正式落地:可下載,為何仍不是人人可跑
- LLM 推論引擎是什麼?vLLM、llama.cpp、MLX 怎麼選
- AI 巨頭為何聯手捍衛開放權重模型
如果只留下一句話:DeepSeek 稱 0731 維持相同架構與規模、只重新做了後訓練;AA 則獨立測到 Agent 指標明顯上升。DeepSeek V4 Flash 0731 下一個真正決定它能走多遠的事件,不是更多轉發,而是 DeepSeek Harness 公開後,社群能否用自己的任務、自己的成本與自己的驗收標準,把這次躍升重做一遍。
