2026 年 9 月 10 日,DeepSeek 在官網發布〈Introducing DeepSeek‑V4.1‑Flash: smarter, faster, more efficient.〉,把 DeepSeek V4.1 Flash 定位為新架構家族中最小的原生多模態模型。更值得注意的是,DeepSeek 預告自 9 月 14 日 04:00 UTC 起、在 V4.1 Pro 上線前,會把 deepseek-v4-pro 請求導向這個 Flash 型號並按 Flash 價格計費;這是尚未發生的排程,不是已完成的替換。

這篇文章先忠實還原 DeepSeek 的三個主張,再用模型權重、技術報告與公開評測逐項對帳,最後回答一個實際問題:這次發布究竟改變了模型能力,還是更大幅改變了推論成本與產品分層?
供應商之外,Vercel 在 9 月 9 日的官方 AI Gateway 變更紀錄也列出可呼叫的 deepseek/deepseek-v4.1-flash 與原生圖片輸入。這能交叉確認模型已有另一條公開存取路徑,但不能替 DeepSeek 的速度或能力比較背書。
DeepSeek V4.1 Flash 發布的真正訊號:Flash 要接手 Pro 流量
官方公告把亮點濃縮成「更強、更快、更普惠」,背後其實有三層不同命題:
- 架構命題:新的 Causal Encoder–Decoder 讓輸入與輸出的啟用計算不對稱,prefill 約啟用 8B 參數、decoding 約啟用 16B。
- 系統命題:更稀疏的注意力、低精度 KV cache 與受限重播,讓長上下文服務所需的快取明顯縮小。
- 產品命題:DeepSeek 認為 Flash 已足以承接目前的 Pro API 流量,因此排定 9 月 14 日切換;這是對成本與服務容量的押注,也是最容易被後續使用者結果驗證的承諾。
第三層比單一 benchmark 名次更有商業意義。模型公司可以挑選最漂亮的測項,但若真的把較貴的 Pro 流量導向較便宜的 Flash,之後的成功率、延遲與客訴都會在真實工作負載中留下痕跡。不過在切換時間到來之前,最準確的描述仍是「DeepSeek 計畫讓 Flash 接手 Pro」,不能先寫成 Pro 已被取代。
552B 只是骨架:8B/16B 也不是模型下載大小
發布頁稱它是 552B MoE 模型,這個數字沒有錯,卻只描述 backbone。DeepSeek 隨模型一併公開的技術報告另外列出 196B 的 Engram 參數;只把這兩個明確標示的部分相加就是 748B。報告還分別描述 vision encoder 與 DSpark 預測層,因此不宜把 748B 再說成整個發行包唯一、完整的總參數口徑。
New Causal Encoder–Decoder architecture: just 8B active parameters for input, 16B for output.
中文:「新的因果編碼器—解碼器架構:輸入只啟用 8B 參數,輸出啟用 16B。」
DeepSeek,2026 年 9 月 10 日
這段話描述的是每個階段參與計算的參數量,不是磁碟上的權重大小,也不是部署時只需容納 8B 或 16B。官方 Hugging Face 倉庫的 model.safetensors.index.json 記錄,混合精度權重檔的張量資料約為 510.3 GB;實際執行還要計入框架、快取、通訊與中間張量。MoE 省的是每個 token 動用多少計算,不會讓未啟用的專家從儲存系統消失。
因此,「552B backbone」「至少 748B 的 backbone+Engram」「8B/16B active」「約 510.3 GB 的發布權重」是四種不同量尺。把它們混成一個數字,就會同時誤判運算量、儲存量與本地部署門檻。
KV cache 縮到多少?HBM 的四分之一,持久層約八分之一

官方技術報告把 V4.1 Flash 的全域 KV cache 列為每 token 890 bytes,前代 V4 Flash 是 3,514 bytes,比例約 25.3%,所以「約四分之一」成立。公告另稱 SSD/host memory 上的持久 KV cache 約為前代八分之一;這是另一個儲存層次,不能把「HBM 四分之一」與「SSD 八分之一」寫成同一項節省。
為什麼這件事重要?長 context 服務的成本不只來自模型權重,還來自每位使用者、每個 token 累積的 KV cache。當 agent 反覆讀大型 repository、工具紀錄與圖片時,cache 可能比單次輸出更接近容量瓶頸。把每 token 的快取壓低,理論上能在相同硬體上容納更多並行 session,這比單純把 token 單價下調更接近可持續的成本改善。
代價也不能省略。報告承認,CSA2 的 token selection 可能選錯,近似的 sliding-window replay 也可能在尚未測到的邊界案例中退化。換句話說,890 bytes 是可核對的設計結果;它是否在每種超長任務都不傷品質,仍是必須由真實 trace 與失敗案例回答的問題。
「超越 V4 Pro」是官方總結,不代表每一列都贏

DeepSeek 在發布文中說 benchmark 結果超越 V4 Pro,但官方模型卡本身就提醒我們不要把這句話解讀成「每個測項都勝出」。例如 GPQA Diamond 是 V4.1 Flash 的 90.9 對 V4 Pro 的 92.4,HLE 是 36.8 對 42.7;另一方面,DeepSWE v1.1、CyberGym 與 AutomationBench 等 agent 任務則由 V4.1 Flash 領先。
更大的限制是證據來源。截至 2026 年 9 月 11 日,V4.1 Flash 的完整發布測項與對照表仍由 DeepSeek 提供;這些數字能證明「DeepSeek 報告了什麼」,不能單獨證明另一團隊已用相同 checkpoint、reasoning effort、harness 與題庫重跑出同樣結果。公開的 DeepSWE 排行頁當時顯示的更新日期是 9 月 3 日,早於正式發布,不能拿較早的 V4 Pro/V4 Flash 成績替 V4.1 背書。
所以合理結論不是「官方 benchmark 都不可信」,而是把可驗證範圍畫清楚:模型與權重確實存在,表格中的設定和結果可追溯到 DeepSeek;但「整體智能全面超越 Pro」目前仍是供應商依自家評測所做的總結。真正的外部確認,需要同版模型、相同工具環境與可檢查的執行紀錄。
1M context 是介面上限,不等於一百萬 token 都記得一樣好
官方 config把 max_position_embeddings 設為 1,048,576,足以確認模型介面宣告支援約一百萬 token。這仍不能推出它在 context 尾端能穩定找回每一項細節,更不能把 context window 當成永久記憶。
長度上限回答的是「可以送入多少」,有效上下文要回答的是「送入之後還能不能準確引用、推理與執行」。CSA2 又主動縮小參與注意力的 token 集合,因此最值得第三方驗證的不是單一 needle-in-a-haystack 命中率,而是多檔案修改、跨工具長流程、早期約束保留與錯誤恢復。
MIT 開放權重是真的,但不是一鍵本地部署
DeepSeek 的官方 Hugging Face 倉庫目前公開、非 gated,包含 48 個權重分片、config、tokenizer、推論與評估程式、技術報告;倉庫內的授權檔是 MIT License。稱它為「MIT 開放權重」有直接證據。
但「權重可下載」不等於任何個人電腦都能順暢跑完整模型。官方公告針對大規模部署徵求具備約 2,000 張 GPU 與儲存叢集的合作方,這不是所有推論方式的最低規格,卻清楚顯示官方優先處理的是資料中心級服務。對本地玩家而言,後續量化、分層載入、跨機互連與推論引擎支援,才會決定可用門檻。
同樣地,open weights 與完整可重現訓練並不相同。Open Source Initiative 的 Open Source AI Definition 1.0還要求足以理解與修改系統的資料資訊與程式碼。這次發行很有價值,但更精確的用語是「開放權重」,不必把它擴張成所有訓練材料都已完整公開。
AlphaLab 的判讀:最重要的突破可能不是榜單第一
判讀一:非對稱計算把「讀很多、寫較少」當成產品基本型
許多 agent 工作負載都極不對稱:先讀大量程式碼、歷史訊息與工具回傳,最後只產出少量 patch 或決策。prefill 只啟用 8B、decoding 啟用 16B,搭配更小 KV cache,正面對準這種輸入遠大於輸出的經濟結構。即使獨立 benchmark 最後沒有證明它在所有能力上勝過 Pro,這個服務成本方向仍然成立。
判讀二:讓 Flash 接手 Pro,是供應商用真實流量替架構投票
若 9 月 14 日的路由按計畫啟用,使用者不必主動換 model ID,就會把原本期待的 Pro 品質交給 Flash。這會迅速暴露官方評測沒覆蓋的退化,也能讓 DeepSeek 把較低成本變成實際吞吐。這個決策比一張靜態排行榜更值得追蹤,但要等切換後的版本紀錄、錯誤率與任務完成率才能判斷成敗。
判讀三:參數口徑將成為大型 MoE 發布的資訊素養測驗
552B 可以是真實的 backbone 規模,748B 也可以是真實的 backbone+Engram 加總,8B/16B 更可以是真實的 active compute。問題不在誰抓到「正確數字」,而在每個數字回答哪個問題。今後看到巨大 MoE,至少要分開問:總共要存多少、單 token 啟用多少、prefill 與 decode 是否不同、額外模組是否另計。
我同意什麼,又存疑什麼?
我同意:DeepSeek V4.1 Flash 的權重與技術材料已公開,8B/16B 非對稱啟用、890 bytes/token 全域 KV cache,以及預定承接 Pro 流量,合在一起構成一個實質的推論效率進展。它不是只有降價海報。
我存疑:官方目前沒有證明「每一項能力都超越 Pro」,1M context 也尚不能等同一百萬 token 的可靠有效記憶。DeepSeek 自己列出的 selection error 與近似 replay 邊界,更提醒我們:越激進的快取壓縮,越應用長流程失敗案例來驗證,而不是只看平均分數。
三種讀者,現在應該怎麼做?
- API 使用者:在 9 月 14 日前固定一組自己的真實任務,保存 model ID、時間、成功條件、總 token、首 token 延遲與總成本;路由切換後用同一 harness 再跑一次。
- 本地部署者:先以約 510.3 GB 的官方混合精度權重工件估算儲存與下載,再分別評估量化、記憶體、KV cache 與互連;不要拿 8B/16B active 當硬體容量。
- 模型評測者:把官方表格當待重現假說,固定 checkpoint、reasoning effort、prompt、工具權限與評分器。若只改了其中一項,就不能把差距全部歸因於模型。
接著閱讀
左右滑動查看更多推薦
接下來最值得做的,不是替「Flash 打敗 Pro」提早慶功,而是在 9 月 14 日路由切換前保存一組可重跑的真實任務。等流量真的換過去,再用任務完成率、延遲、成本與長流程錯誤對帳;那會比任何發布日口號更快告訴我們,DeepSeek V4.1 Flash 究竟把效率邊界往前推了多少。






