2026 年 8 月 31 日,DeepSeek 在 Hugging Face 發布 DeepSeek V4 Flash Vision 的可下載權重。這不是模型首次亮相:官方早在 8 月 21 日就把它放上 API;十天後真正改變的,是外部團隊終於能取得 checkpoint,而不只是在 DeepSeek 的伺服器上呼叫它。
這個時間差很重要。它把一則容易被寫成「新模型登場」的消息,改寫成另一個更有意思的問題:當一個多模態 Agent 模型從黑盒 API 變成 48 個可下載的權重分片,我們究竟多得到了什麼?答案不只是「可以自己跑」,更是可以檢查、移植、修改與驗證;但 168GB 的檔案、預覽版推論引擎,以及缺少可重現軌跡的 benchmark,也讓「開放」與「可用」之間仍隔著很長一段路。
先說結論:這是一個值得開發者認真實驗的開放權重里程碑,卻還不是一張足以證明「通用多模態 Agent 已追平頂級閉源模型」的成績單。

一、先把時間線釘牢:新的是權重,不是能力
DeepSeek 的 8 月 21 日公告已把 deepseek-v4-flash-vision-exp 描述為實驗性多模態模型,支援圖片與文字混合輸入。Hugging Face 的提交紀錄則顯示:儲存庫在 8 月 31 日 06:16 UTC 建立,48 個權重分片在 06:57 UTC 寫入,README、設定檔與參考推論程式於 07:57 UTC 補齊。
因此,最精確的說法不是「DeepSeek 在 8 月 31 日推出 Vision-Exp」,而是「DeepSeek 在 API 預覽十天後,公開 Vision-Exp 的權重與參考程式」。至於 8 月 31 日的 checkpoint 是否逐位元等同於 8 月 21 日 API 後方的模型,截至 2026 年 9 月 2 日,官方 API 公告與 changelog 未列出可比對的 checkpoint 雜湊;本文不替兩者畫上無法驗證的等號。
“We are excited to introduce DeepSeek-V4-Flash-Vision-Exp, our first experimental multimodal model in the DeepSeek-V4 family. It builds on the DeepSeek-V4-Flash architecture by incorporating visual modules and undergoing continued training to unlock visual understanding capabilities.”
中文:「我們很高興介紹 DeepSeek-V4-Flash-Vision-Exp,這是 DeepSeek-V4 家族第一個實驗性多模態模型。它以 DeepSeek-V4-Flash 架構為基礎,加入視覺模組並持續訓練,以解鎖視覺理解能力。」
— DeepSeek-V4-Flash-Vision-Exp 模型卡
「實驗性」在這裡是官方給的生命週期標籤,不等於模型不能用;官方 API 確實已經提供服務。截至 2026 年 9 月 2 日,模型卡未說明這個標籤對穩定性、相容期或正式版時程的具體意義。讀者應把它理解成「可以試,但別自行補上產品成熟度」。
二、305B 與 168GB,到底各自在數什麼?
Hugging Face 的檔案掃描器把這個 checkpoint 計為 304,646,824,126 個儲存張量元素,四捨五入就是頁面上的 305B。48 個 Safetensors 權重分片合計 167,819,404,368 bytes,也就是 167.819GB,換算二進位單位約 156.294GiB。模型索引裡較小的 167,811,372,792 bytes 是張量 payload,不包含各分片檔案的 header;兩個數字沒有互相矛盾,只是在量不同的東西。
「305B」也不宜直接改寫成「305B 核心模型參數」。vLLM 的官方 recipe以 285B/13B 描述主模型總量與每 token 活躍量;Hugging Face 則把 checkpoint 內儲存的輔助與 draft 張量一併計入。截至 2026 年 9 月 2 日,官方材料未列出一張完整的口徑調節表,所以本文只採用可核對的寫法:這是一個在 Hugging Face 被標示為約 305B、權重分片約 168GB 的 checkpoint。
內容不只有權重。儲存庫還放了 tokenizer、prompt encoding、config,以及涵蓋 vision encoder、aligner、MoE、DFlash attention 與 DSpark forward path 的最小 PyTorch 推論實作;授權檔是標準 MIT License。這讓「MIT 授權的開放權重與參考程式」成為合適描述。若把它稱為「完整可重現的開源訓練發布」,就走得太遠了:截至 2026 年 9 月 2 日,模型卡未列出訓練語料、完整訓練 pipeline 或重建 checkpoint 所需的 recipe。
“This repository contains the tokenizer, prompt encoding reference, and a minimal PyTorch inference implementation for DeepSeek-V4 Flash Vision.”
中文:「這個儲存庫包含 DeepSeek-V4 Flash Vision 的 tokenizer、prompt encoding 參考,以及最小化的 PyTorch 推論實作。」
— DeepSeek-V4-Flash-Vision-Exp 模型卡
這個差別不是咬文嚼字。開放權重讓研究者能離線保存、檢查張量、替換 runtime、量化與做針對性評測;完整可重現發布則要求外界能理解模型怎麼被訓練、資料從哪裡來,以及 benchmark 是否曾進入訓練流程。前者已經發生,後者不能從這個儲存庫推導出來。
三、它多了「眼睛」,但視覺輸入有明確預算
設定檔顯示,DeepSeek V4 Flash Vision 是 DeepSeek V4 的 MoE causal-LM backbone,加上一個 ViT 類型的 vision encoder 與 aligner。DeepSeek 的視覺輸入文件說明,每張圖片會被縮放到約 800×800 像素的處理預算,並固定占用最多 384 個視覺 token。這使圖片成本可控,卻也提醒我們:2000×2000 與 5000×5000 的原圖不會因為更大就得到更多視覺 token。
對一般照片或介面截圖,這個預算可能很實用;對密集表格、極小字、長文件頁面或細線圖表,縮放可能成為能力上限的一部分。它的任務形態是圖片輸入、文字輸出,不應被延伸解讀成音訊、影片或圖片生成的全模態模型。
四、83.9 與 27.3 很亮眼,但先看量尺
模型卡最吸睛的兩個數字是 Terminal Bench 2.1 的 83.9,以及 Agents’ Last Exam 的 27.3。前者測的是 Agent 在終端機環境完成任務的能力,屬於文字 Agent 評測;後者評的是包含模型、harness、工具、記憶與子代理在內的整套系統,不是只把模型單獨放進考卷。

Terminal Bench 2.1 的 Hugging Face 聚合頁面登錄了 83.9,但該筆 eval metadata 的來源仍指回 DeepSeek 自己的模型卡,不能算成第二次獨立重跑;截至 2026 年 9 月 2 日,這個 Vision checkpoint 也未列在 benchmark 維護者的verified leaderboard。Agents’ Last Exam 的官方 leaderboard會分開列出 harness、model、pass rate 與 partial-credit score;同一日期的榜單未列出這個 Vision checkpoint,而 DeepSeek 表格只有一個 27.3,未說明 metric、split、逐題軌跡、工具配置、成本或可重現容器。
因此這兩個數字能證明的是「DeepSeek 回報在指定配置下得到這些成績」,不能直接證明任意團隊換一套 runtime、prompt 與工具後也會重現。模型卡只對文字 Agent benchmark 公開了部分共同設定:DeepSeek Harness minimal mode、reasoning_effort=max、temperature 1.0、top-p 0.95。截至 2026 年 9 月 2 日,四項多模態評測的公開資訊還不足以重建同一套 runs。
五、最大的閱讀陷阱:把「看得見」誤認成「全面變強」
DeepSeek 自己在表格腳註寫明:舊版 DeepSeek-V4-Flash-0731 在 ApexBench 與 Agents’ Last Exam 中會忽略多模態輸入。換句話說,36.5 對 26.2、27.3 對 25.2 的提升,有一部分比較的是「新模型看得到圖片」與「舊模型看不到圖片」,不只是控制其他條件後的純能力增量。
另外,Chartography 的 64.3 來自 100 題專業圖表閱讀;ZeroBench 的 35.0 是 pass@5,意思是每題最多五次嘗試中至少一次答對的題目比例,不等於單次回答有 35% 可靠度。ApexBench 在模型卡上甚至沒有版本、公開 task manifest 或可唯一辨識的引用。把四列一起包裝成「通用多模態 Agent 能力」很方便,卻把不同量尺的限制抹平了。
DeepSeek 與 Opus-4.8 在這四列的差距介於 0.7 到 2.9 分,但截至 2026 年 9 月 2 日,模型卡未列出信賴區間、配對逐題結果或完整相同 harness 的證明。合理結論是「在 DeepSeek 公布的這組 runs 中分數接近」,不是「已用統計方式確立兩個系統同級」。
六、外部 runtime 的驗證:視覺能力是真的,範圍仍很窄
好消息是,外部推論框架的實作過程提供了比轉貼模型卡更有價值的證據。vLLM 的模型支援 PR在 4×GB200 上跑完 OCRBench,得到 835/1000,且記錄為零 request error;細項同時顯示手寫辨識 58%、手寫數學 49%,說明強項與弱項都存在。SGLang 的實作 PR則在 4×B200 上回報 MMMU-Pro 74.96%,並記錄一個樣本進入超過 40 萬 token 的推理迴圈。
這些是原始第三方工程紀錄,足以支持兩個較窄的判斷:checkpoint 能被不同 runtime 載入,而且確實具備可觀的 OCR/VQA 能力。它們仍是 runtime 實作驗收,不是 Terminal Bench 或 Agents’ Last Exam 的獨立重現,也不能把單次異常推廣成整個模型的通病。
七、開放權重不等於「下載後一鍵跑」
截至 2026 年 9 月 2 日,兩條主流自架路徑都仍帶著「預覽」條件。vLLM 官方 recipe 指定專用的 vllm/vllm-openai:deepseekv4-flash-vision image,並明確說明一般穩定版 wheel 會把它路由成純文字 class,因而無法正確載入視覺權重;SGLang 的官方 cookbook則要求 dev preview image,相關支援 PR 尚在整合流程中。
硬體門檻也不能只看 168GB 檔案大小。vLLM recipe 的規劃值是在 KV cache 之前就需要約 202GB aggregate VRAM,之後還會隨 context、batch、CUDA graph 與 kernel 改變。DeepSeek 模型卡給出的 4×GB300 是一個示範指令,不是最低規格;外部紀錄分別使用過 4×GB200 與 4×B200。若你正在評估本機部署,先用本機 LLM 顯存決策方法把權重、KV cache 與 runtime overhead 分開算,比看到「開放權重」就開始下載更實際。
模型設定宣告最長 1,048,576 tokens,但 vLLM 公開驗證用的是 32K context,並註明沒有測到 1M。這不是說 1M 必然不能跑,而是公開 runtime 證據目前只走到 32K。想理解為什麼同一份權重換一個 runtime 就可能出現完全不同的記憶體與相容性結果,可以接著看vLLM、llama.cpp 與 MLX 推論引擎比較。
八、AlphaLab 的五個判讀
判讀一:真正的升級是可驗證性,不是分數突然變高
8 月 21 日使用者已能透過 API 看見模型能力;8 月 31 日之後,開發者才擁有 checkpoint。這讓權重保存、替代 runtime、量化、針對性紅隊與逐層分析成為可能。模型卡上的分數沒有因此自動變成真理,但外界終於拿到可以挑戰它的材料。
判讀二:開放降低控制權風險,沒有消除資本門檻
MIT 授權與 ungated download 降低了法律與存取摩擦;約 168GB 權重、200GB 以上的推論記憶體規劃,以及多卡 server-class GPU,又把多數個人使用者擋在自架之外。DeepSeek V4 Flash Vision 是「外部團隊可以掌控」的模型,不是「每台消費級電腦都能順跑」的模型。
判讀三:多模態 Agent benchmark 最大的變數,常常是系統
Agent 的結果由模型、harness、工具、記憶、錯誤恢復、token 預算與 grader 共同生成。當模型卡只給一個總分,讀者看見的是「這套未完整公開的系統得到多少分」,不是模型本體在所有環境下的固定屬性。真正有價值的下一步,是公開 container、trajectory、逐題結果與成本,而不是再加一張比較表。
判讀四:能看見圖片,首先修正的是輸入缺口
當舊 baseline 在兩項評測裡直接忽略圖片,新版提升本來就值得預期。這並不貶低視覺模組;相反地,它提醒我們把「補回必要輸入」與「推理本身跨級」分開。OCRBench 與 MMMU-Pro 的外部結果支持真實視覺能力,長期 Agent 可靠度則仍需要更接近實際工作的測試。
判讀五:訓練透明度是下一個比 license 更難的問題
權重與參考程式公開,仍無法回答模型看過哪些視覺資料、資料授權如何處理、公開 benchmark 是否被排除,以及安全測試涵蓋哪些情境。截至 2026 年 9 月 2 日,這些資訊未列在模型卡中;這不能據此推斷發生資料污染,只代表外界目前無從評估污染風險。開放權重提供了檢查模型的入口,卻沒有替訓練過程補上完整履歷。
九、誰該現在行動?誰適合先觀察?
如果你是推論框架、量化、評測或企業私有部署團隊,現在就值得下載固定 revision,先做小規模的輸入輸出與記憶體驗收,再決定是否投入完整 benchmark。保存大型 Hugging Face 模型時,可沿用commit、SHA-256 與斷網還原流程,避免把 mutable 的 main 當成可重現版本。
如果你只是想在產品中使用 Vision-Exp,API 仍是較低摩擦的路徑;若你要的是成熟、穩定版的一鍵自架,則應先等 vLLM/SGLang 支援進入正式 release,再看社群是否補上量化與不同硬體的長時間測試。想理解這個模型與 0731 純文字版的關係,可先讀DeepSeek V4 Flash 0731 的 API、Codex 與硬體解析。
我會盯三個訊號:第一,正式版 runtime 是否能在不靠專用 preview image 的情況下穩定載入視覺權重;第二,是否出現可下載的 Agent trajectories、完整 harness 與成本;第三,企業真實文件、瀏覽器與終端工作流是否能在多輪任務中維持可靠度。三者比下一個單一榜單名次,更能決定它是研究素材,還是生產工具。
結論:它打開了模型,不是替模型蓋章
DeepSeek V4 Flash Vision 的價值,不在於 305B 比誰更大,也不在於 83.9 或 27.3 能否贏過某個對手。真正重要的是:一個能讀圖、用工具、跑 Agent 任務的前沿 checkpoint,如今以 MIT 授權交到外部開發者手上。
這讓審計、移植與反駁都向前一步;同時,168GB 權重、預覽版 runtime、未完整披露的評測方法與訓練履歷,也提醒我們不要把「已開放」誤讀成「已證明」。最好的態度不是唱好或唱衰,而是把它當成一個現在終於可以被真正驗證的假說。
接著閱讀
左右滑動查看更多推薦






