DeepSeek V4 Flash 0731 完整教學:API、Codex、reasoning_effort 與本地硬體真相(2026)

最後更新: ·
DeepSeek V4 Flash 0731 API、Codex、reasoning_effort 與本地硬體完整教學首圖

DeepSeek V4 Flash 0731 教學最容易被一句「284B 模型只用 5.3GB 記憶體」帶偏。先講答案:那是舊 preview 權重在 24GB Mac 上,用約 90GiB SSD 串流後的 macOS 程序 peak phys_footprint,不是模型下載大小、不是 5.3GB 電腦的需求,更不是 0731 實測。對大多數 coding-agent 使用者,現在最實用的起點其實是 API。

如果你想先看模型為何只重做後訓練就大幅提升 Agent 能力,可搭配 AlphaLab 的DeepSeek V4 Flash 0731 開放權重分析;本文專注在「怎麼接、怎麼測、硬體到底要多少」。

DeepSeek V4 Flash 0731 教學先看懂:0731 更新了什麼?

官方 model card顯示,0731 在 2026 年 7 月 31 日發布、取代 preview,重點是補強 agentic 能力,並附上 DSpark speculative-decoding 模組。截至 2026 年 8 月 3 日,官方 Model Details 將 API ID deepseek-v4-flash 的 model version 標為 DeepSeek-V4-Flash-0731;重現測試應另存日期與這份官方版本對照。

架構本體是 284B total、每個 token 約 13B active。43 個 MoE layer 各有 256 個 routed experts,每次選 6 個,再加 1 個 shared expert。這解釋了「算一次不用動員 284B」,卻沒有把未啟用專家的權重變不見。官方發行包還包含 DSpark,完整 package 約 304B tensor parameters、權重檔合計約 166.9GB;因此「284B 本體」與「整個 0731 發行包」要分開報。

DeepSeek V4 Flash 0731 的 284B total、13B active 與每層 6/256 專家概念圖
MoE 降低的是每個 token 的計算量;儲存、記憶體與長 context 仍要另外算。

把它想成一間有 256 位專家的顧問公司:每層只叫 6 位進會議室,所以當下算得快;但若想完全離線,其他人仍得在大樓、RAM、VRAM 或 SSD 裡待命。想再補齊推理引擎觀念,可讀LLM inference engine 白話教學Kimi K3 MoE 架構解析

API、本地量化、SSD streaming:怎麼選?

DeepSeek V4 Flash 0731 API、本地量化與 SSD streaming 部署選擇樹
先用用途分流;「本機可跑」至少有三種完全不同的工程含義。

路線一:API-first,適合日常 coding agent

截至 2026 年 8 月 3 日,DeepSeek 官方價格是每 100 萬 tokens:cache hit input US$0.0028、cache miss input US$0.14、output US$0.28。一次任務若吃 100K 未快取 input、產生 20K output,粗估是 0.1×0.14 + 0.02×0.28 = US$0.0196。先用真實任務量到 tokens,再拿這個數字跟硬體、電力與維運比較,通常比先買卡更理性。

官方另已公告未來尖峰時段各項價格會變成 2 倍,但截至本文日期尚未公布生效日。這也是為什麼測試紀錄要保存日期與當下價目,而不是把本文單價寫死進長期預算。

這個算例只示範 token 帳單,不代表每個 coding task 都會花一樣多。大型 repository 的反覆讀檔、失敗重試、工具輸出與完整 history 都會增加 input;真正該追蹤的是每個「成功交付」的成本,而不是單次請求看起來有多便宜。

路線二:0731 量化常駐,門檻約從 100GB 級開始

Unsloth 的 0731 GGUF中,極端 IQ1_S 約 82.5GB、Q2 約 90.9–96.8GB;較合理的 IQ3_XXS 約 104.2GB,Unsloth 指南建議至少約 110GB 總 RAM+VRAM。Q8 約 161.9GB,建議約 169GB。這些數字仍未替很長的 context、KV cache、作業系統與併發留足餘裕;低 bit 也不是免費午餐,品質要自己用任務驗證。

路線三:SSD expert streaming,是 I/O 實驗而非魔法

熱門貼文的 5.3GB 數字來自 Reddit 展示;其實際模型是 2026 年 4 月建立的 mlx-community/DeepSeek-V4-Flash-2bit-DQ,早於 0731 三個月。Mference 自報實測使用 M5、24GB、macOS 26、4K context option、short prompt 與 128 個 new tokens:16 slots 約 5.9GB peak phys_footprint、4.80 tok/s,持續生成 512 tokens 則約 3.77 tok/s。

約 90GiB 權重仍在 SSD;每程序一次的 mmap+完整 SHA-256 驗證約 39–43 秒,未計入 tok/s。每 token 讀取 2.03GB expert data 是 0% expert-cache hit 的理論上限,不是一般流量實測。所以正確句子是:「preview 在 24GB Mac 上觀察到約 5.9GB 程序 peak phys_footprint」,不是「0731 可在 5.3GB 電腦實用運行」。

看本地硬體數字,至少要問五件事

  1. 是哪個 checkpoint?同名 alias、preview、0731 與附帶 DSpark 的 package 不能混寫;最好保存完整 model ID 與 revision。
  2. 磁碟裡有多少權重?程序只顯示 5.9GB peak phys_footprint,不代表另外約 90GiB SSD 檔案不存在。
  3. 量的是哪種記憶體?phys_footprint、resident set、OS file cache、總 RAM+VRAM 都是不同指標。
  4. context 與生成多長?4K context option、short prompt、128-token 短測,不能外推到掃完整 repo、跑工具數十分鐘的 coding session。
  5. 品質有沒有守住?極端低 bit 或新 runtime 要報 test pass rate、logit/KLD 或至少固定任務結果,不能只秀 tok/s。

官方 model card 的 vLLM 範例使用單節點 4×GB300;這不是最低需求,也不是官方宣稱的唯一 production 規格。它仍足以提醒我們:可啟動、可長時間完成 agent 工作、可多人併發,是三個不同等級。若賣家只給一個 RAM 數字,卻不給上述五欄,先把它當展示而非部署規格。

DeepSeek V4 Flash 0731 教學:先用 Responses API 跑通

最小可重現路徑是直接呼叫官方 Responses API。先把 key 放進環境變數,不要寫進程式碼或 Git:

export DEEPSEEK_API_KEY="你的 API key"
python -m pip install -U openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.responses.create(
    model="deepseek-v4-flash",
    input="先列計畫,再修正這個 failing test;不要改無關檔案。",
    reasoning={"effort": "high"},
)

print(response.output_text)

截至 2026 年 8 月 3 日,官方 Responses 端點只支援 V4 Flash,且是 stateless:previous_response_id、conversation 等狀態能力不成立,多輪 agent 要自行傳回完整 history。function、server-side web search 與名稱為 apply_patch 的 custom tool 有支援;圖片、檔案與多數 OpenAI built-in tools 目前沒有完整支援。部分不支援參數會被靜默忽略,其他不支援項目仍可能回 400,所以「沒有報錯」不能當功能生效的證據。

DeepSeek V4 Flash 0731 教學:接入 Codex

DeepSeek 現在有官方 Codex/Responses 相容指南;直連 DeepSeek 官方 Responses API 時不需要舊 Moon Bridge workaround。先確認 Codex CLI 至少是 0.144.0:

codex --version

官方頁面提供完整 ~/.codex/models.json;請原樣複製,因為裡面不只有名稱,還有 context、tool format 與 low/high/max catalog。接著在使用者層級的 ~/.codex/config.toml 設定 provider。DeepSeek 範例把 bearer token 明文寫進 TOML;依 OpenAI Codex 官方設定文件,較安全的作法是用 env_key

model = "deepseek-v4-flash"
model_provider = "deepseek"
forced_login_method = "api"
model_reasoning_effort = "high"
model_catalog_json = "~/.codex/models.json"

[model_providers.deepseek]
name = "DeepSeek"
base_url = "https://api.deepseek.com/"
env_key = "DEEPSEEK_API_KEY"
wire_api = "responses"

重新開啟終端、export key,再啟動 codex;首頁 banner 應顯示 deepseek-v4-flash。要做檔位 A/B,可在 DeepSeek 官方 catalog 與 Codex ≥0.144.0 的前提下執行:

codex -c 'model_reasoning_effort="low"'
codex -c 'model_reasoning_effort="high"'
codex -c 'model_reasoning_effort="max"'

要特別限定這個語境:Codex 的一般 config reference 目前仍只列到 xhigh,而 DeepSeek 的專用 catalog 額外公開 max。若 max 報錯,先檢查 CLI 版本與 models.json,不要用改 prompt 的方式假裝測到同一檔位。想了解 coding harness 本身,可延伸閱讀AI Agent Harness 是什麼如何打造 AI Agent Harness

Claude Code 也能接,但支援邊界不同

DeepSeek 提供 Anthropic-compatible endpoint;但 Anthropic 官方文件明確不支援把 Claude Code 路由到非 Claude 模型。因此這是「DeepSeek 端支援的相容接法」,不是 Anthropic 保證 feature parity。DeepSeek 官方範例把主模型設為 V4 Pro、Flash 只給 Haiku/subagent;下面是為了比較 0731 而衍生的 all-Flash 測試配方:

export ANTHROPIC_BASE_URL="https://api.deepseek.com/anthropic"
export ANTHROPIC_AUTH_TOKEN="$DEEPSEEK_API_KEY"
export ANTHROPIC_MODEL="deepseek-v4-flash"
export ANTHROPIC_DEFAULT_OPUS_MODEL="deepseek-v4-flash"
export ANTHROPIC_DEFAULT_SONNET_MODEL="deepseek-v4-flash"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="deepseek-v4-flash"
export CLAUDE_CODE_SUBAGENT_MODEL="deepseek-v4-flash"
export CLAUDE_CODE_EFFORT_LEVEL="high"

claude

截至 2026 年 8 月 3 日,deepseek-v4-flash 指向 0731;上面只能鎖定 Flash alias,不能保證未來永久固定在 0731,所以測試要保存日期與官方版本對照。Claude Code 本身允許 low/medium/high/xhigh/max/auto,none 不合法;為直接對齊 DeepSeek Flash 檔位,本文只測 low/high/max。若你正在選 harness,可比較Claude Code vs Codex

DeepSeek V4 Flash 0731 接 Codex、Claude Code 與本地 server 的協定差異
OpenAI-compatible 通常只說 API 外形相似;Codex 還需要 Responses SSE 與正確的 tool events。

reasoning_effort:none/low/high/max 到底差在哪?

官方 Create Response reference的 Flash 映射是:Responses 的 none 關閉 thinking;minimallow 進 low;mediumhighxhigh 都進 high;max 才是 max。也就是模型真正只有 off/low/high/max 四種狀態。

但端點寫法不同。Responses API 用 reasoning: {"effort":"none"};Chat Completions 若要關閉推理,應傳 thinking: {"type":"disabled"},不是把 reasoning_effort 寫成 none。Codex 的 DeepSeek picker 目前只列 low/high/max,也不要把 model_reasoning_summary="none" 誤當成關閉推理——它只是不顯示摘要。

DeepSeek V4 Flash 0731 reasoning_effort 檔位映射與可重現測試方法
effort 是 provider 會映射的控制訊號,不是硬性的 reasoning-token 配額。

為什麼 low 可能比 high 用更多 token?0731 隨附的 local encoding 說明揭露:low 不加 prefix,high 與 max 則加入不同強度的推理提示詞。它不是「至少想 N tokens」的配額。Reddit 作者自報的 4 個 prompts、每題 5 次測試中,官方 API reasoning-token 平均值為 low 889.6、high 253.9;這是尚未獨立重現的描述性結果,不能證明 low 品質較高。

另一個陷阱是 provider 轉譯。第三方 router 可能把 low/high/max 映射錯;hosted thinking 又會忽略 temperature、top_p、presence/frequency penalty。若要找問題,先直連 DeepSeek 官方 API 建 baseline,再比第三方 provider;不要同時更換模型、harness、system prompt 與 effort。

四步判斷 effort 是否真的生效

  1. 先用官方 Responses API 跑同一 prompt 的 none/low/high/max,保存原始 request、response usage、日期與 model alias。
  2. 再接 Codex 或 Claude Code,只換 harness;確認 startup banner、環境變數與 server log 實際 resolved model 都是 Flash。
  3. 檢查工具事件,而不只看最後文字。function call、apply_patch、history round-trip 任一缺失,都可能讓相同模型表現像變笨。
  4. 最後才換第三方 provider;關閉 fallback,隨機化測試順序,若結果異常就回到官方 baseline 找出是哪一層改寫了 effort。

這樣分層的價值是:你能知道問題出在模型 preset、provider 映射、agent system prompt,還是工具協定。若四層一起換,即使 low 的 token 數突然高於 high,也無法判定因果。

用真實 coding task 做可重現比較

不要拿「解一道題看起來很聰明」當 benchmark。選一個你真的會交付的 repository issue,固定 Git commit 與環境,讓四個 effort 都做同一件事。建議任務同時包含:

  1. 可判定成功:先有 failing test,完成後原測試與 regression test 都要過。
  2. 真實工具鏈:必須讀檔、搜尋、改檔、跑 test/lint,而非只輸出一段答案。
  3. 硬限制:不得改無關檔案、不得刪測試、不得新增依賴,最後交付 diff 摘要。
先讀 repository 的 AGENTS.md/開發文件。
修正目前 failing test 對應的根因,並加入最小 regression test。
不得刪除或放寬既有測試,不得改無關檔案,不得新增依賴。
完成後執行指定 test 與 lint,回報結果、修改檔案與剩餘風險。

先測直接 API 的 none/low/high/max,每格至少 20 次、隨機順序;再另外比較 Codex 與 Claude Code,避免把 harness 差異混進 effort。每次至少記錄五類結果:

  • 品質:test pass rate、正確率、是否真的修根因。
  • 速度:總 wall time、首個 tool call 時間、P50 與 P90。
  • 成本:記錄 input、cached、output、reasoning tokens;計費只算 (input−cached)×miss 價 + cached×hit 價 + output×output 價,reasoning 只是 output 的分析拆分。
  • 指令遵循:無關 diff、刪測試、越權命令、漏跑驗證各記一次 violation。
  • 失敗模式:無效 tool JSON、重複讀檔、history 400、靜默忽略參數、timeout。

判讀順序應是「成功率 → 指令遵循 → 延遲 → 成本」,不是只挑 reasoning tokens 最多的檔位。若 high 已穩定通過,max 多花時間卻沒提高成功率,就沒有升檔理由。這也呼應Kimi K3 本地/雲端/API 選擇裡的同一原則:模型能力要放進完整工作流才有意義。

六個常見失敗模式

  1. 一般 OpenAI client 可用,Codex 卻不能用:你的 endpoint 可能只有 Chat Completions,沒有 Codex 要的 Responses SSE/tool events。
  2. max 一啟動就報錯:先更新 Codex 並重新放入 DeepSeek 官方 models catalog;max 不是所有 provider 的通用 config 值。
  3. none 仍在思考:檢查端點。Responses 用 reasoning effort none;Chat Completions 用 thinking disabled。
  4. tool call 下一輪回 400:Chat Completions thinking 模式必須把 assistant 的 reasoning_content 一併傳回。
  5. 本機短測很快,長任務突然慢:cache slots、context 與 SSD bandwidth 變成瓶頸;短 128-token 數字不能代替長 coding session。
  6. 以為 5.3GB 就能裝模型:那是特定 preview 串流實驗的程序 footprint,磁碟仍有約 90GiB 權重。

DeepSeek V4 Flash 0731 常見問題

64GB Mac 可以跑 0731 嗎?

常規完整常駐不夠;0731 的主流量化檔約 90–162GB。可以研究 CPU/SSD offload,但本文可驗證的 0731 量化指引仍從約 100GB 總記憶體起跳,不能把 preview 的短串流展示外推成實用 coding-agent 規格。

5.3GB 或 8GB 電腦真的能跑嗎?

Mference 的 DeepSeek 測量使用 24GB M5,而且模型是 preview;其 README 的一般「8GB Mac」欄位不是 0731 的實機 benchmark,因此這組資料不能替 8GB 跑 0731 背書。

1M context 等於能輸出 1M tokens 嗎?

不是。官方 API 規格是 1M context、max_output_tokens 上限 384K,而且這個上限包含 reasoning 與可見輸出;本地能否承受長 context,還取決於 runtime、KV cache 與硬體餘裕。

max 一定比 high 好嗎?

不一定。max 是更強的推理 preset,不是保證更多 token、更高品質或更少錯誤。用自己的 test pass rate 與 P90 latency 決定。

Codex 裡可以選 none 嗎?

DeepSeek 的 Responses API 支援 none,但截至 2026 年 8 月 3 日,官方 Codex catalog 只公開 low/high/max。要測 off,先用直接 API,不要把隱藏 reasoning summary 當成關閉 thinking。

本地 llama.cpp server 可以直接給 Codex 用嗎?

不能只看「OpenAI-compatible」就下結論。若只實作 Chat Completions,仍缺 Codex 需要的 Responses protocol、串流事件與工具格式;要加相容代理層或逐項驗證。

Codex 還是 Claude Code 比較適合?

截至 2026 年 8 月 3 日,Codex 有 DeepSeek 官方 Responses 相容路線;Claude Code 是 DeepSeek 提供的相容 route,但 Anthropic 不支援非 Claude 模型。若目標是最少協定落差,先測 Codex。

怎麼確定未來仍是 0731?

截至 2026 年 8 月 3 日,官方 Model Details 將 deepseek-v4-flash 對應到 0731,但沒有承諾這個 ID 永遠固定。保存測試日期、provider、當日官方版本對照與完整 config;要重現開放權重結果,則直接鎖 0731 checkpoint。

結論:先把 API 跑通,再決定要不要買硬體

這份 DeepSeek V4 Flash 0731 教學的答案很務實:日常 coding agent 先用官方 API+Codex,從 high 跑一個真實任務,再測 low 與 max;只有當離線、隱私、可控性或長期用量足以抵銷本地維運成本時,才進量化。以 Unsloth 的 IQ3_XXS 路線為例,其建議是約 110GB total memory,其他 quant 仍要各自重算。

最後再念一次:能跑 ≠ 好用;好用 = 跑得動 × 接得上 × 做得完。5.3GB 展示值得欣賞的是 I/O 工程,不是拿來替 0731 消費級部署背書。先量成功率、P90、成本與違規率,你才會知道哪個 effort、provider 與硬體路線真的適合自己的工作。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。