跳到主要內容

DeepSeek V4 Flash 0731:每題 US$0.04,ARC-AGI-2 得 61.4%(2026)

最後更新: ·
DeepSeek V4 Flash 0731 以每題幾美分取得 ARC-AGI-1 89.0% 與 ARC-AGI-2 61.4% 的主視覺

DeepSeek 在 2026 年 7 月 31 日發布 DeepSeek V4 Flash 0731;8 月 7 日(UTC;台北時間 8 月 8 日凌晨),這份 ARC Prize Verified 成績頁被提交至 Hacker News 後迅速引發討論:ARC-AGI-1 Semi-Private 得分 89.0%,ARC-AGI-2 Semi-Private 得分 61.4%,估算成本卻只有每題約 US$0.02 與 US$0.04。這不是「四美分買到通用智慧」,但它可能改變一件更實際的事:當模型便宜到能同時嘗試多條推理路徑,AI 代理工作流的成本結構也可能改變。

本文會先拆解分數與成本怎麼算,再說明 ARC-AGI-2 測到什麼、沒測到什麼,最後把焦點拉回真正有用的問題:便宜推理何時能轉化成更低的「每個可接受成果成本」。

ARC Prize 的 DeepSeek V4 Flash 0731 Verified 成績頁重現圖
ARC Prize 的 Verified 成績頁:真正吸睛的是分數與單題成本同時出現。圖/ARC Prize;AlphaLab 重製瀏覽器框架

DeepSeek V4 Flash 0731 的 ARC 成績到底是多少?

ARC Prize 的 Verified 結果頁給出的核心結論很直接:

At max effort, DeepSeek V4 Flash 0731 scores 89.0% on ARC-AGI-1 Semi-Private at $0.02 per task and 61.4% on ARC-AGI-2 Semi-Private at $0.04 per task.

中文:在 max effort 設定下,DeepSeek V4 Flash 0731 於 ARC-AGI-1 Semi-Private 得 89.0%,每題約 US$0.02;ARC-AGI-2 Semi-Private 得 61.4%,每題約 US$0.04。

ARC Prize

把成績頁背後的數據攤開,可以看到三種 effort 各有一個 verified run。估算成本按該 run 所有嘗試的 token 用量與當時零售價換算,再除以題數;它們不是一張固定價目表:

ARC-AGI-1分數估算每題成本
Low84.0%US$0.0118
High87.0%US$0.0214
Max89.0%US$0.0205
ARC-AGI-2分數估算每題成本
Low46.0%US$0.0206
High56.0%US$0.0453
Max61.4%US$0.0416
ARC Prize Verified 資料;成本四捨五入至小數點後四位。

一個值得留意的細節是,High 的平均成本反而略高於 Max。這正好提醒我們:US$0.02/0.04 是某次 benchmark run 在當時零售價格下的觀測結果,不是模型商承諾的固定「每題費率」。

ARC-AGI-2 分數與每題成本散點圖,DeepSeek V4 Flash 0731 的三個設定位於低成本區
ARC-AGI-2 分數對每題成本;DeepSeek V4 Flash 0731 的 Low、High、Max 都落在圖表左側的低成本區。圖/ARC Prize

ARC-AGI-2 測到什麼,又沒測到什麼?

ARC-AGI 題目不是知識問答。模型會看到幾組彩色網格的輸入與輸出範例,再推斷同一條規則,替新的網格產生答案。ARC Prize 把 ARC-AGI-2 定位成比第一代更難、較抗暴力枚舉的抽象推理測試;Semi-Private 題集則用來降低直接對公開測試集調校的影響。

但 61.4% 是 benchmark score,不能直接翻譯成「解出 61.4% 的題目」。依照 ARC Prize 的評估政策,每個 test pair 可提交兩次答案,task 也可能拿到部分分數;最後再對整個題集平均。成本則把所有嘗試用掉的 token 按零售價格換算,除以題數。這次結果來自單次 verified run,沒有多次重跑後的變異範圍。

更重要的是,ARC-AGI-1/2 的分數只評量靜態的「網格進、網格出」答案,不能證明工具呼叫、程式執行、長流程記憶或 agent harness 的端到端品質。ARC Prize 另以 ARC-AGI-3 研究探索、目標設定、規劃執行與途中修正,而 DeepSeek V4 Flash 0731 的成績頁在 ARC-AGI-3 欄位是「—」:代表這裡沒有回報評估結果,不代表失敗。

因此,這張成績卡能支持的說法是「便宜的抽象網格推理很強」,不能直接推出「四美分就能完成一個 coding ticket」或「它已是最好的通用 agent」。如果想理解 benchmark 為何常常同時測到模型與外部系統,可以延伸看 Claude Opus 5 的模型與 harness 拆解

0731 是新模型,還是一次重要更新?

官方模型卡把 DeepSeek V4 Flash 0731 描述為四月預覽版的 post-trained 正式更新,而不是宣告一套全新的 backbone。它仍是 Mixture-of-Experts 架構:總參數 284B、每個 token 啟用 13B,context window 為 1M token,權重以 MIT License 公開;官方也附上 DSpark speculative decoder,目標是改善推理吞吐。

名稱也容易造成誤會。0731 是 2026 年 7 月 31 日發布的版本標記;託管 API 仍使用 deepseek-v4-flash 這個 model ID。官方更新紀錄並明確寫出,當天變更的是 Flash API,App 與 Web 端沒有跟著切換。

模型卡也列出 coding、工具使用與 agent 類 benchmark,不過那些是 DeepSeek 公布的數字;其中 Code Agent 題目使用的 DeepSeek Harness minimal mode,當時標示稍後公開。它們可以當待驗證線索,證據強度不能與 ARC Prize 的獨立 verified run 混在一起。

為什麼「每題幾美分」比 61.4% 更值得注意?

很多 agent 工作流的核心不是一次答對,而是先平行產生多個候選方案,再用驗證器、測試或更強模型挑選。假設同一筆預算能從 2 次提高到 20 次 rollout(獨立嘗試),搜尋空間會完全不同;但前提是錯誤沒有高度相關,而且驗證器真的分得出好壞,否則只是在便宜地重複同一種錯誤。這也是 AI agent harnessagent 可觀測性愈來愈重要的原因:便宜模型讓嘗試數量上升,也讓失敗路徑、重試與驗證成本一起放大。

截至 2026 年 8 月 8 日,DeepSeek 官方價格頁列出的每百萬 token 價格為:cached input US$0.0028、uncached input US$0.14、output US$0.28。這確實非常低,但同一頁也預告價格將顯著上調。因此 ARC 的單題成本應被視為「這套題目 × 這次 token 用量 × 當時定價」的快照,不能永久外推。

這也說明為何比較模型時,只看 token 單價不夠。長思考、反覆呼叫工具或低接受率,都可能把便宜 token 變成昂貴成果。更實用的概念是「每個通過驗收的任務成本」,也就是把所有失敗嘗試、驗證、重跑與人工介入一起算進去。這和 單看模型價格與實際任務成本的差別是同一件事。

Hacker News 為何同時叫好又吐槽?

截至 8 月 8 日截稿,這則 Hacker News 討論已超過 520 點、累積逾 310 則留言。正面回報多集中在除錯、批次分析、第二意見與便宜 sub-agent;負面回報則談到工具呼叫變慢或不穩、陷入迴圈、不同供應商版本表現不一,以及為了得到答案消耗過多 token。

這些留言有價值,因為它們暴露 benchmark 不會告訴你的故障模式;但它們仍是不同 prompt、provider、量化版本與工作環境下的個人經驗,不能拿留言投票取代受控測試。最合理的讀法,是把它們轉成自己評估時要刻意攻擊的假設。

AlphaLab 的判讀:便宜的抽象推理,不是便宜的 AGI

我同意 ARC Prize 對性價比的興奮,但不同意把這張卡直接升格成 agent 或 coding 排名。值得相信的部分,是獨立 verified run 確認了 DeepSeek V4 Flash 0731 在 ARC-AGI-1/2 這個明確任務域裡,以極低零售 token 成本取得強勁分數。同頁公開的 ARC-AGI-2 task table 在 Max 設定下是 72/120,約 60.0%,與 Semi-Private 的 61.4% 接近;這只能當同一任務域的 sanity check(合理性檢查),不是獨立複驗,更不能證明它已泛化到 coding 或 agent。

仍要保留的部分,是可重現性與跨任務外推。截至 2026 年 8 月 8 日,ARC 公開 benchmark repository 的 models.yml尚未列出 0731 的完整執行設定,成績頁也沒有附上這次 run 的 raw output artifacts;因此我們看得到被驗證的結果,卻還不能從公開資料完整重建 endpoint、temperature、token limit 與 effort 設定。這是值得後續補齊的稽核缺口,不是推翻分數的證據。

真正可能改變市場的,是低價、開放權重與多次 rollout 三者的乘法效果。當「先廣泛嘗試,再嚴格驗證」變得便宜,小模型不必在每個維度都擊敗昂貴模型,也可能成為工作流裡最常被呼叫的那一層。不過,長 context 與高吞吐背後仍有記憶體和基礎設施成本;自架也不等於免費,這部分可參考 AI 推理的 HBM 與記憶體瓶頸

把成績卡變成可用決策:測「每個可接受成果成本」

如果你正在評估是否把 DeepSeek V4 Flash 0731 放進產品,不要複製 ARC 的 US$0.04 當預算。更可靠的方法,是拿自己的私有任務做一個小型、可重複的 bake-off(對照測試):

  1. 固定外部系統。使用相同 prompt、工具、timeout、context、重試規則與驗收測試,只替換模型。
  2. 重跑並記錄故障。用多個 seed(隨機種子)或多次執行,分開計算答錯、工具失敗、迴圈、逾時與需要人工接手的比例。
  3. 算完整單位經濟。把輸入、輸出、cache、驗證器、fallback(備援)模型、wall-clock(實際耗時)與人工介入全部併入,最後除以通過驗收的任務數。

一個務實的起點,是讓便宜模型負責大量候選生成、分類與初步除錯,把昂貴模型留給高歧義判斷、最終批判或 fallback。前提不是它在榜單上贏,而是它在你的資料、工具與驗收標準下,真的降低了每個合格結果的成本。

📚 延伸閱讀

DeepSeek V4 Flash 0731 最值得帶走的訊號,不是「AGI 只值四美分」,而是至少在 ARC 這類抽象推理上,低成本方案已值得進入私有任務評估。真正要比較的,也不再只是「哪個模型單次最強」,而是哪套系統能用更低總成本,穩定產出更多可驗收成果。

AlphaLab 精選

接著閱讀

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。