2026 年 7 月 31 日,DeepSeek V4 Flash 0731 進入 API public beta,並在同日以 MIT License 公開權重。DeepSeek 表示它沿用 Flash Preview 的核心架構與規模,只重新做了後訓練;第三方 Artificial Analysis(AA)卻測到 Intelligence Index 從 40 升至 50。這不是新架構發布,卻把開放權重 Agent 的基準成績/API 成本性價比再往前推了一步。
真正值得追問的不是「DeepSeek 又刷榜了嗎」,而是三件事:後訓練究竟能把同一個核心模型推多遠?獨立測試是否看見同方向的躍升?開放權重與低 API 單價,能否把提升變成可重現的 Agent 生產力?本文談的「性價比」只限於 AA 的測試組合與 DeepSeek API 價格,不等於每種 Agent、每個 harness 或本地部署都便宜六成。
先把原始材料放在桌上。點擊下面的瀏覽器框,可直接前往 DeepSeek 官方 changelog;接下來再把官方成績、AA 外部實測、成本與可靠性逐一拆開。

DeepSeek V4 Flash 0731 到底發布了什麼?
官方 changelog 對這次升級的核心描述是:
“keeps the same model architecture and size as DeepSeek-V4-Flash-Preview, and was only re-post-trained.”
中文:「維持與 DeepSeek-V4-Flash-Preview 相同的架構與大小,只重新進行後訓練。」
— DeepSeek API Change Log,2026 年 7 月 31 日
把發布內容拆開,實際上是四件事:
- API 進入公測:呼叫名稱仍是
deepseek-v4-flash,目前對應DeepSeek-V4-Flash-0731;這次更新的是 Flash API,不是 V4-Pro 或 App/Web 模型的全面替換。 - Agent 介面補齊:新版支援 Responses API,並被 DeepSeek 描述為已針對 Codex 類工作流適配。
- MIT 開放權重:Hugging Face 官方倉庫公開、非 gated,repository 與模型權重採 MIT License;這不等於訓練資料與完整 pipeline 也開源。
- 1M context 上限:官方 config 列出 1,048,576 tokens,但「可輸入 1M」不代表已證明整段 1M 都能穩定推理或當成永久記憶。
所以「API 公測」和「開放權重」不是二選一:DeepSeek 同時提供第一方託管 API,也把可自行部署的權重交到社群手上。
官方說只做後訓練:這個說法能驗證到哪裡?
「只重新後訓練」是 DeepSeek 的供應商聲明,不是外部對完整訓練歷程的審計。不過,「同一核心架構」至少有可交叉檢查的線索:對照官方 Hugging Face 上的 舊版 config 與 0731 config,移除模型路徑欄位後,設定內容相同。
預訓練建立模型的知識與基礎能力,後訓練則把那些能力塑造成可用的行為:怎麼遵守指令、何時呼叫工具、如何維持長任務狀態、失敗後要不要重試,以及該花多少 token 思考。想先補齊這個背景,可以看 AlphaLab 的《AI 模型怎麼學習?預訓練、SFT、強化學習與 Evals》。
這也是 Agent 最容易被低估的一點:同一個預訓練底座,如果後訓練讓模型更會讀工具回傳、更少提早宣布完成、更能在錯誤後修正路線,整條任務鏈的成功率就可能非線性上升。用一個把每一步視為互相獨立的簡化例子來看:單步成功率從 90% 提高到 96% 看似只多 6 個百分點,但連續十步都正確的機率會從約 35% 升到約 66%;這是複利效果示意,不是 0731 的實測完成率。
截至 2026 年 8 月 3 日,官方 changelog、模型卡與 repository 說明了結果與部署方式,沒有列出 0731 專屬的訓練資料、算力、SFT/RL recipe 或 ablation。外部現在能檢驗的是結果是否同方向改善,不能獨立重建「只靠後訓練」的因果鏈。
DeepSeek V4 Flash 0731 的 Agent 分數跳了多少?
DeepSeek 公布九項 Agent/coding benchmark,0731 在表內每一列都高於 Flash Preview 與 V4-Pro Preview;最誇張的是 DeepSWE,從 7.3 拉到 54.4。完整官方表如下:

| 代表性項目 | Flash Preview | 0731 | 變化 |
|---|---|---|---|
| Terminal Bench 2.1 | 61.8 | 82.7 | +20.9 |
| DeepSWE | 7.3 | 54.4 | +47.1 |
| AutomationBench Public | 10.8 | 25.1 | +14.3 |
表格最重要的內容,其實在最下面的小字。公開 Code Agent 項目使用尚未釋出的 DeepSeek Harness minimal mode,模型開到 max reasoning effort,取樣設定為 temperature=1.0、top_p=0.95;DSBench-FullStack 與 DSBench-Hard 則是內部資料集。
還有一個容易被忽略的落差:DeepSeek API 預設 effort 是 high,頭條 benchmark 用的是 max。因此這些是官方系統在這套 max-effort 設定下的結果,不是一般人維持預設設定就必然得到的體感。
AA 也看見上升,但 50 不是通用 IQ
Artificial Analysis(AA)在 v4.1 方法、同為 max effort 的條件下測得:Intelligence Index 從 40.2825 升至 49.9277,增加 9.645 分,頁面四捨五入為 40→50。這是目前最重要的外部交叉檢查。

| AA 外部測試 | Flash Preview | 0731 |
|---|---|---|
| Intelligence Index | 40.28 | 49.93 |
| Terminal-Bench 2.1 | 61.80% | 78.65% |
| GDPval-AA Elo | 1,189.0 | 1,558.6 |
| τ³-bench Banking | 22.89% | 31.13% |
這組結果讓結論變得清楚:能力上升的方向有外部證據支持,DeepSeek 自報的精確幅度仍不能視為獨立重現。同一模型在 AA 的 Terminal-Bench 是 78.65%,不是官方表裡的 82.7%;差距本身就在提醒我們,Agent 成績屬於「模型 × harness × effort × 工具環境」,不是權重的單一常數。
「50」也不是脫離條件的通用 IQ。AA v4.1 方法由九組英語、純文字評測組成,Agents、Coding、Science、General Knowledge 權重依序為 34%、24%、24%、18%,0731 又開在 max effort。這個權重結構會放大 Agent/coding 改善,不能推成所有知識領域同步進步。
「成本低 60%」的分母是什麼?

AA 的 7 月 31 日分析把 0731 描述為相較 GPT‑5.6 Luna max 每任務成本約低六成。把公開數字拆開:整套 Index 總成本是 72.02 對 174.06 美元,低 58.6%;目前 dashboard 的 weighted cost per task 則是 0.02713 對 0.04735 美元,低 42.7%。兩種彙總方式不同,因此「約六成」只能視為 AA 當日、該比較對象與該測試組合的快照。
它也不是「相較舊 Flash 便宜六成」:按目前 weighted cost per task,新版反而約高 16%;整套總成本只低約 3%。截至 2026 年 8 月 3 日,DeepSeek 第一方 API 定價為每百萬 cache-hit 輸入 token 0.0028 美元、cache-miss 輸入 0.14 美元、輸出 0.28 美元;cache hit 與 miss 相差 50 倍,官方還預告未來尖峰時段可能調為兩倍價格,日期另行公告。真正該量的是每個成功任務的總成本:token、cache 命中、重試、驗證與延遲都要算進去。也可搭配 AlphaLab 對 GPT‑5.6 Luna 降價 80% 的分析。
更會做事,不等於更值得不經查證地相信
AA 的反向結果比「50」更有價值。根據 AA 的 0731 分析,AA-Omniscience 的正確率仍是 37.23%,只比前一版多答對一題;6,000 題中有 3,177 題判為 incorrect,占全部題目的 52.95%。新版的主要變化,是更常部分作答或承認不知道,而不是事實準確率大幅跳升。

所以圖上的 84.36%不能搬去解讀成「一般聊天有 84% 都答錯」。它只描述 AA 這套高難度知識題中,模型在沒有完全答對的回答裡,有多常選擇錯答而不是部分回答或不作答。正確結論是:模型少了一些亂猜,校準有所改善;執行/工具能力大升,但事實正確率沒有同步突破。
因此,適合讓它多做的是可驗收的工作:跑測試、改程式、操作工具、整理資料、產出可比對的檔案。涉及事實、權限或不可逆操作時,系統仍需要 schema 驗證、測試、diff、沙箱與明確的人工確認點。這不是對 DeepSeek 特別苛刻,而是 Agent 工程本來就該把「產生答案」和「證明答案」分開。
MIT 開放權重是真的,但「能下載」不等於「筆電能跑」
MIT License 允許下載、修改、部署、再散布與商業使用,只要保留授權與版權聲明。精確說法應是「MIT 開放權重」,不是把它包裝成所有要素都公開的「完整開源」:官方材料沒有附上 0731 的訓練資料、完整 recipe 或訓練 log,模型卡也仍把 benchmark harness 標為「to be released」。
硬體門檻也不小。DeepSeek V4 官方技術報告把核心 target model定義為 284B 總參數、每 token 啟用 13B;0731 可下載 checkpoint另附既有 DSpark 推測解碼模組,Hugging Face safetensors 統計約 304.18B tensors,檔案約 166.9 GB。官方 vLLM 範例使用一個 4×NVIDIA GB300 節點。13B active 能降低每 token 計算量,不代表它是可塞進一般單卡的 13B 小模型。
社群很快就能開始量化、移植、替換推論引擎與測試不同 Agent harness,這是開放權重的真正價值;但量化不會把它魔法般變成小模型。便宜的第一方 API 與便宜的 self-host 是兩套經濟模型:後者還要攤提 GPU、記憶體、吞吐、維運與利用率。這與 Kimi K3 權重落地後「可下載、未必人人可跑」是同一個現實;部署路線可接著看《LLM 推論引擎怎麼選》。
熱度可以量化,但不能從熱度推出 API 採用
截至 2026 年 8 月 3 日 12:04(台北時間),官方 X 首發透過非官方 FxTwitter metrics proxy讀到約 835.4 萬次觀看與 28,986 個讚;Hacker News 討論為 737 points、345 comments;Hugging Face 官方模型頁為 1,803 likes、156,173 monthly downloads。這些都是會變動的抓取快照。
但 views、points、likes 都不是實際 Agent 使用量。Hugging Face models download是按其規則計入特定檔案請求的近月統計,不代表 156,173 位獨立使用者完整下載 166.9 GB。這三組數字能支持的是發布吸引了大量注意,且開放權重讓實測迅速展開;不能單獨證明 API tokens、留存或生產部署同步暴增。
AlphaLab 的判讀:這次真正改變了什麼?
判讀一:最大的新聞不是模型變大,而是同一核心架構還有多大可塑性
如果 DeepSeek 對訓練範圍的描述準確,0731 展示的是一個很強的工程訊號:frontier 模型的價值不只在預訓練花了多少算力,也在之後能不能把能力壓進穩定的工具使用、長任務控制與錯誤恢復。這會讓「後訓練資料、環境與評測」的競爭變得更重要,而不只是比誰的參數多。
判讀二:Agent benchmark 測的是系統,不只是模型
Agent 成績可以近似寫成:模型權重 × Harness × 推理預算 × 工具 × 任務環境。模型卡把 DeepSeek Harness 標為「to be released」,就代表社群目前拿到的是「引擎」,卻還沒拿到官方比賽用的完整「賽車」。AA 用另一套系統仍測到大幅上升,支持能力提升可以在另一套 harness 中觀察到;兩邊 82.7 與 78.65 的差距,也提醒我們不能把系統分數誤讀成單一模型常數。
判讀三:低價最先改寫的是實驗頻率
每百萬輸出 token 0.28 美元的意義,不只是把同一個 prompt 變便宜,而是讓團隊可以跑更多候選方案、驗證器、回歸測試與平行 Agent。前提是把 cache 命中、重試與驗證也納入成本:便宜模型如果需要反覆救火,成功任務成本仍可能不低;反過來說,低單價若能換來更多可自動驗收的候選,才可能接近真正的生產力。
判讀四:開放權重有利於擴散,卻不會自動解決可重現性
MIT 權重讓研究者能量化、換推理引擎、做私有部署、檢查行為並針對領域後訓練,這是實質開放;但截至 2026 年 8 月 3 日,官方模型卡仍把 Harness 標為待發布,本次材料也未提供 0731 recipe,所以「權重可得」與「官方結果可重現」現在只完成了前半段。這也正是開放權重政策爭論裡最容易被一句「開源」掩蓋的差別。
我同意什麼,又存疑什麼?
我同意的:0731 不是只有一張官方榜單。AA 的獨立指標也看見綜合、Agent、coding 與 Terminal-Bench 明顯上升,因此「能力方向性進步」可信;MIT 權重和低 API 單價,也讓產品與研究社群具備快速採用與驗證這次升級的條件。
我存疑的:官方最大幅度仍混合了未公開 Harness、max effort 與兩組內部資料;AA-Omniscience 正確率沒有跟 Agent 分數一起跳;1M context 也只是容量上限,不是有效記憶保證。把它直接寫成「以 0.28 美元買到頂級 Agent」太粗糙——真正買到的是低 token 單價與較高的任務上限,最終成本和品質仍取決於 Harness、有效 context、重試率與驗收設計。
DeepSeek V4 Flash 0731 適合誰?四個實際下一步
- 正在用 DeepSeek API:固定 20 個真實任務,同時跑預設
high與max,記錄完成率、輸出 token、延遲、重試次數與總成本。不要拿一個 demo 決定路由;可以直接套用《用 10 題小型 Eval 建立模型路由》的方法。 - 正在做 coding Agent:把模型與 Harness 分開 A/B。至少記錄工具呼叫格式錯誤、提早結束、測試通過率與失敗後恢復率;等 DeepSeek Harness 釋出後,再檢查官方 82.7 能否在公開環境靠近。
- 想自行部署:先算記憶體、KV cache、吞吐與並行需求,再選原生權重或量化版。官方 4×GB300 是部署範例,不是一般工作站承諾;推理引擎、量化精度與 reasoning effort 映射都會改變結果。
- 想把低價變成產能:把省下的預算用在驗證器、測試與平行候選,而不是只放大單次輸出。想理解 Harness、Loop、Graph 分工,可看《AI Agent 三層架構》;想把 Memory、Skills 與排程串成可累積工作流,可接著看《Hermes Agent 進階教學》。
接著閱讀
左右滑動查看更多推薦
如果只留下一句話:DeepSeek 稱 0731 維持同一核心架構、只重新做了後訓練;AA 則獨立測到 40→50 與多項 Agent 指標上升。DeepSeek V4 Flash 0731 下一個真正決定它能走多遠的事件,不是更多轉發,而是 DeepSeek Harness 公開後,社群能否用自己的任務、自己的成功成本與自己的驗收標準,把這次進步重做一遍。






