跳到主要內容

DeepSeek V4.1 Flash:3.64 兆 Token 衝榜,Pro 強制切換為何喊停?(2026)

最後更新: ·
DeepSeek V4.1 Flash 官方粒子字樣與 Pro 強制切換已撤回的 AlphaLab 封面

2026 年 9 月 10 日,DeepSeek 在官網發布〈Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient.〉,把 DeepSeek V4.1 Flash 定調為更聰明、更快、更省資源的新模型。公告還預告:9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro API 流量都要改送 V4.1 Flash。

截至 9 月 12 日的 OpenRouter「This Week」視窗,模型已衝到第 7;到了 9 月 14 日,預定接管 Pro 的計畫卻先被撤回。DeepSeek 的官方 API 更新頁改口:V4 Pro 會在 9 月 14 日之後繼續服務,計費方式不變。這不只是發布後的小修正,而是一個很值得拆開的案例:架構效率、benchmark 成績、平台流量與生產遷移,究竟各自顯示了什麼?

以下先忠實還原原文的交換條件,再用獨立評測與平台資料逐項對帳,最後說明為什麼「切換喊停」反而比強制升級更能暴露模型 API 的契約風險。

DeepSeek 於 2026 年 9 月 10 日發布 V4.1 Flash 的官方英文公告頁面
DeepSeek V4.1 Flash 官方發布頁,日期為 2026-09-10。截圖/DeepSeek;框架/AlphaLab。

DeepSeek V4.1 Flash 原文的交換條件:少算一點,卻要接住更長的工作

DeepSeek 的中心主張不是「又做了一個大模型」,而是重新安排長輸入與逐字輸出的計算路徑。V4.1 Flash 是可接收文字與圖片、輸出文字的 MoE;語言骨幹標示為 552B 參數,prefill 每個 token 約啟用 8B,decode 則約啟用 16B,上下文上限為 100 萬 token。

New Causal Encoder–Decoder architecture: just 8B active parameters for input, 16B for output.

中文:新的因果編碼器—解碼器架構,輸入階段只啟用 8B 參數,輸出階段啟用 16B。

DeepSeek,2026-09-10

原文再把 global KV 壓到每 token 890 bytes,約為 V4 Flash 的四分之一;需要長期保存到主機或 SSD 的 persistent KV,則估計約降到八分之一。模型庫與權重採 MIT License。這些設計的目標是讓大型服務更有效率,但「8B/16B active」描述的是計算路徑,不是整個模型只有 8B 或 16B,也不代表一般顯卡就能載入完整權重。

CED、CSA2、SWA 與本機資源帳要怎麼拆,AlphaLab 已在DeepSeek V4.1 Flash 遷移教學逐步說明。這篇更關心發布之後發生的事:龐大的平台路由量和不錯的綜合分數,為何仍不足以支撐一次自動換模?

3.64 兆 Token:是爆發式採用,還是一次很大的測試潮?

OpenRouter 排行榜在「This Week」視窗、資料截至 2026 年 9 月 12 日時,把 DeepSeek V4.1 Flash 列在第 7 名,共 3.64 兆 token。這確實是發布兩天內非常強的流量訊號;截至 9 月 13 日 22:18 UTC,官方 Hugging Face 模型頁也累積 2,192 個 likes。

但 3.64 兆不是全球累積使用量。它是 OpenRouter 在該週路由的 prompt 加 completion tokens,排除 private requests,也不代表獨立使用者、人均留存、付費收入或滿意度。更關鍵的是,底層紀錄約有 3.587 兆 prompt tokens、556 億 completion tokens;換算後約 98.5% 是輸入。這可能來自長上下文、批次或 Agent 工作負載,也可能混有上線測試,不能直接翻譯成「使用者產出了 3.64 兆 token 的優質答案」。

所以這個排名能支持的最強結論是:V4.1 Flash 在發布週迅速出現大量 OpenRouter 路由活動。它仍不能單獨證明有多少獨立使用者、付費需求或持續採用,更不能證明品質第一。

DeepSeek V4.1 Flash 的 Benchmark 有進步,但「全面勝過 Pro」說得太滿

DeepSeek 的發布表格把亮點放在 coding 與 agentic 任務:DeepSWE、CyberGym、AutomationBench 等多項分數高於自家 V4 Pro,Terminal-Bench 2.1 更報出 90.6。不過這些是供應商自報結果;多個 coding-agent 指標使用不同 harness,而主表採最高 reasoning effort 與最長可到 100 萬 token 的上下文。換一個 scaffold,成績就可能大幅移動。下圖是原文另一張跨模型 agentic 圖,包含 Terminal-Bench 3.0、DeepSWE、CyberGym 與 AutomationBench;不能把它和 90.6 所在的 Terminal-Bench 2.1 表格視為同一組測試。

DeepSeek 官方比較 V4.1 Flash 與多個模型在四項 agentic benchmark 的長條圖
官方 agentic benchmark 圖表顯示 V4.1 Flash 在部分 coding 與自動化任務領先;這是供應商設定下的自報結果。圖表/DeepSeek。

獨立資料給出更完整、也更不整齊的答案。Vals AI截至 9 月 14 日的標準化評測,給它 Vals Index 57.86% ±1.16,排 56 個模型中的第 15,並列為當時開放權重模型第 1;但對 Kimi K3 的領先只有 0.05 個百分點,小於這個估計的不確定範圍。Vals 在 Terminal-Bench 2.1 的三次完整測試得到 74.53%,比 DeepSeek 自報的 90.6 低 16.07 個百分點。

這不是「Vals 重現失敗」的直接證據,因為兩邊的 harness 與 reasoning effort 不同;它提醒我們的是更實用的一件事:Agent benchmark 衡量的是模型 × scaffold × 設定,不是一顆脫離系統就固定不變的模型能力。

截至 2026 年 9 月 14 日,Artificial Analysis在兩款模型皆採 Reasoning Max Effort 的比較中,給 V4.1 Flash/V4 Pro 的 Intelligence Index 40/36;其 Intelligence Index 每項任務的加權平均成本約 US$0.27/US$0.67,測得輸出速度約 228/78 tok/s。可是 V4 Pro 仍在 Humanity’s Last Exam、CritPt 與 AA-Omniscience 等個別測試領先。精確的說法因此不是「新模型每一項都比較好」,而是綜合評測與成本更有競爭力,能力分布仍有回歸

真正的轉折:DeepSeek 在截止日前保留了 V4 Pro

把兩個官方頁面排成時間線,故事會變得很清楚:

  • 9 月 10 日發布公告:預告 9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 請求都要路由到 V4.1 Flash。
  • 截止日前的 API 更新:官方 changelog表示,因應使用者需求,9 月 14 日後仍繼續提供 V4 Pro,計費不變。
  • 最新官方安排:本文在原定切換時間前查核時,官方模型與定價表仍把 deepseek-v4-pro 指向 V4-Pro-0813,並明列 9 月 14 日後繼續服務;只有舊的 Flash 名稱轉送到 V4.1 Flash。

因此,「所有 Pro 流量將在 9 月 14 日 04:00 UTC 被強制切到 V4.1」已不再是官方現行安排。正確敘述是:DeepSeek 曾宣布這項計畫,之後在生效前撤回;V4 Pro 與 V4.1 Flash 會繼續並存。

在本文核對的官方 changelog 與定價頁裡,DeepSeek 只說這是回應使用者需求,未列出回饋數量,也未把原因拆成品質、相容性、延遲或採購流程。把撤回解釋成「V4.1 不夠好」因此沒有足夠證據;但它至少提醒我們:平均 benchmark 更高,和既有服務可以無痛自動換模,並不是同一個命題。

這不是發布插曲,而是一次 API 契約事件

模型名稱不是菜單標籤,而是可觀測性的一部分

應用送出 deepseek-v4-pro,團隊自然會把事故、成本與輸出變化歸到這個版本。如果同一個 ID 背後直接換成另一套權重,HTTP 仍可能是 200,但工具呼叫、JSON schema、拒答邊界、視覺理解、token 用量與尾端延遲都可能漂移。沒有穩定版本 ID 或回傳 fingerprint,事後甚至難以確認哪一批請求用了哪個模型。

排行榜回答「有人在試嗎」,不能回答「可以替換嗎」

OpenRouter 的 3.64 兆 token 讓「沒人用」的質疑站不住腳;Vals 與 Artificial Analysis 也讓「只有廠商自己說好」不再完整。但替換決策還要回答另一組問題:同一批真實任務的失敗率如何、成本分布是否更穩、長上下文是否真的被使用、回滾是否可行。流量、通用 benchmark 與產品驗收是三層證據,不能互相代打。

營運文件比發布頁更接近現在,兩者不同步仍是風險

發布原文截至 9 月 14 日仍保留舊的強制切換文字,API changelog 與定價頁卻已反映新決定。這表示讀者必須自己判斷哪個頁面控制現況。對會影響正式流量的變更,理想做法應是同步修正公告、保留變更歷史,並在 API 回應與控制台內提供可機讀的版本資訊,而不是讓使用者在三個頁面之間拼時間線。

AlphaLab 的判讀:技術躍進成立,無痛替換沒有成立

第一,效率進步是真實主角。較少的活躍參數、壓縮的 KV footprint 與 100 萬 token 上下文,確實瞄準長序列服務成本;開放權重也讓外部團隊有機會檢查與部署。這足以讓 V4.1 Flash 進入評測清單,但不是跳過評測的理由。

第二,3.64 兆 Token 證明發布週流量,不證明持續需求或答案品質。發布兩天進入週榜第 7,只能確認 OpenRouter 上出現大量、以輸入為主的路由活動;不能由 token 數推定開發者人數、付費意願或長期採用。

第三,90.6 與 74.53 的落差不是可忽略的雜訊。它提醒我們 Agent 能力住在模型、harness、reasoning 設定和工具介面的組合裡。模型供應商若要主張可替換,應把可重現的 scaffold 與設定一起交付,而不只是貼一張最高分表格。

第四,撤回強制切換是較健康的決定,但溝通仍未完成。保留 Pro 讓團隊有時間比較與回滾;發布頁未同步更新,卻讓新舊承諾同時存在。更成熟的版本治理,應把 opt-in、通知期、不可變版本與退場日期寫成公開契約。

我同意的部分:DeepSeek V4.1 Flash 對長上下文與 agentic coding 提供了可量化、值得實測的進步。我存疑的部分:原文把綜合優勢推得太接近「可以直接替代 Pro」;獨立測試顯示能力仍有取捨,而截止日前撤回路由計畫,也說明平均 benchmark 本身不足以證明替換能無痛完成。

下一次模型切換前,供應商與使用團隊各欠一張清單

要問的問題供應商應提供使用團隊應留下
我實際用了哪個版本?不可變 version ID、model fingerprint、alias 對照表每次請求的 model 回傳值、時間與設定
何時會改?通知期、opt-in/opt-out、明確退場日責任人、canary 範圍、回滾截止點
為何可以替換?可重現的 harness、參數、能力回歸表自己的任務成功率、格式合規率與錯誤分類
切換後怎麼發現漂移?版本化 changelog 與機器可讀狀態依版本切開的成本、token、p95 延遲與失敗率
換模型不是只改一個名稱;身分、通知、證據與觀測四層都要能對帳。

接下來最值得追蹤的不是 likes 再增加多少,而是三個可反駁的訊號:V4.1 的週流量能否在發布效應後留下來、不同 harness 的 agent 成績是否逐步收斂,以及 DeepSeek 是否補上更清楚的不可變版本與遷移政策。

接著閱讀

左右滑動查看更多推薦

下一步:先把目前使用的模型 ID、實際版本與回滾期限寫進同一份變更紀錄;如果其中一格填不出來,就還不到自動切換的時候。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。