2026 年 10 月 7 日,Jono 在個人部落格 Jono’s Corner 發布了這篇文章〈Why Isn’t The Industry Freaking Out About DeepSeek 4.1 Flash?〉。他問的是:當 DeepSeek V4.1 Flash 已經便宜到讓自己願意反覆交付程式工作,開發者為何仍追逐最貴的模型?這場討論的新意,在採用決策,而非一場新的模型發布。

DeepSeek 的官方公告日期是 9 月 10 日。Hacker News 討論串則在本次 10 月 11 日查核時顯示 1,110 分、976 則留言;這些數字說明討論熱度,不是品質驗證。以下先還原作者改變工作方式的理由,再核對方案與快取數字,最後回答什麼情況值得換模型。
原文的核心:便宜,讓人願意多試一次
Jono 說自己使用約一個月、跨十多個專案,在多數工作中感覺不到與 Opus 的差異。他坦白這是主觀經驗。更有意思的是行為改變:便宜讓探索性測試、小整理與重複工作更容易被交出去;重要工作偶爾再找另一個模型檢查,然後回到 DeepSeek 修正。作者的重點,是足夠好的能力如何擴大願意嘗試的工作範圍。
“DeepSeek is basically unlimited.”
中文:DeepSeek 對我來說近乎不限量。
Jono,2026 年 10 月 7 日
這句話緊接在他的每月 10 美元 OpenCode Go 訂閱後面。它準確描述作者「很少碰到成本阻力」的感受,卻容易被讀成一項無上限服務承諾。兩者需要分開。作者也談到快取、環境負擔與自行部署的未來;其中有架構依據,也有尚需量測的推論。

DeepSeek V4.1 Flash 的 10 美元訂閱:額度和帳單是兩件事
截至 2026 年 10 月 11 日,OpenCode Go 官方文件列出 Go 每月 10 美元、Go Plus 每月 40 美元。Go 表格的 DeepSeek V4.1 Flash 月額度欄是 60 美元,另有五小時與每週限制,分別按月額度的 20% 與 50% 計。這是方案內用量折算的口徑,不是交給你提領的現金,也不能當成所有工作都可無限跑。
官方還提供 Use balance 選項:開啟且有 Zen 餘額時,達到方案限制後可改用餘額繼續請求。這會讓「訂閱費固定」與「本月支出固定」分開。要拿它和另一個服務比較,先確認自己是否開了超額續用,再看同一類任務消耗多少額度。
一位使用者很難花完額度,另一位幾天就覺得昂貴,並不必然有人算錯。短輸出、穩定上下文、頻繁命中快取,與長輸出、反覆重建歷史、多人併發,可以是兩種完全不同的工作量。HN 裡的個人帳單能提出問題;要支持換模型,還要對上自己的任務。
DeepSeek V4.1 Flash 的快取優勢,應落在哪一格?
DeepSeek 的技術報告描述 Causal Encoder–Decoder 架構:輸入 prefill 每 token 啟用 8B 參數,輸出 decode 啟用 16B。報告把 global KV cache 壓到每 token 890 bytes,約為 V4-Flash 的四分之一;與更早的 V1 比較則約縮小 437 倍。這些是作者報告的架構與容量口徑,不是 API 帳單或整台機器記憶體的縮減倍率。
把它想成助手的工作筆記:一段已讀內容的狀態能保存得更小,服務便有機會留下更多可重用歷史。但使用者付多少,還經過定價、命中率、輸出量與方案條款。8B 活躍參數也不能直接理解成一個 8B 模型的部署需求。想深入架構,可讀百萬 Token Agent 的快取成本分析;這次我們把鏡頭放在使用者的帳本。
本次查核的DeepSeek 官方 API 價目表以每百萬 tokens、美元計價:離峰輸入 cache miss 為 0.15、cache hit 為 0.003、輸出為 0.60;尖峰分別為 0.30、0.006、1.20。穩定前綴是否命中,會直接改變輸入那一格的費率。以下只做同一份用量的算術,不宣稱跑過模型。
假設一組工作共送入 100 萬輸入 tokens,產生 10 萬輸出 tokens,全部按離峰價格計。若輸入全 miss,費用是 0.15+0.1×0.60=0.21 美元;若其中 90 萬 hit、10 萬 miss,費用是 0.9×0.003+0.1×0.15+0.1×0.60=0.0777 美元。兩種情境的輸出與任務設定相同,差異只在快取。真正帳單要把每次請求按所屬時段與實際分項相加;其他供應商的費率需另列。
公開成果能證明什麼?先把展示與驗收拆開
作者連到oneshotlm 的公開作品與成本紀錄。本次頁面列有 35 次跑次、35 份輸出及 0.28 美元合計成本,並能點開遊戲、動畫等產物。這是比一句「很好用」更具體的原始觀察,但頁面上的有輸出,還不等於你對維護性、需求符合度與安全性的驗收。其價格與輸入快取組成,也不能直接搬到另一個服務。
例如一個動畫能顯示,和它在手機上流暢、鍵盤操作完整、修改後仍通過既有測試,是不同層次的成功。要引用這些作品,就把結論留在「該站展示這些跑次與產物」;要改變你的工程流程,則先把自己的驗收答案寫在模型之外。相關方法可接著看Coding Agent 同題評測。
AlphaLab 的判讀:值得換的是工作配置
一、先比較新增支出,再比較完整支出
若你已付另一個方案、仍有足夠額度,今天多做一項工作的新增支出可能很低。這時拿對方 API 標價來證明新訂閱更省,容易高估節省。反過來,若現有額度經常卡住工作,等待與新增額度又是實在的成本。個人的新增支出決策,與團隊下個月是否續訂整套服務,是兩本不同的帳。
二、便宜的重試,仍需算到合格成果裡
我同意作者最有價值的觀察:當試一次的阻力降低,探索與小任務更容易進入日常。我的保留是,重試越便宜,越容易忽略累積輪數。比較時用「全部請求與複查的費用÷通過原先驗收的任務數」,另記人工修正時間。失敗跑次仍在分子裡;不能只挑最後成功的那次。
三、第二個模型能提供另一種檢查,仍要有外部答案
作者偶爾換模型複查,是一種可試的工作配置。它是否划算,取決於能不能補上第一輪的漏失,以及要增加多少時間與費用。兩個模型都點頭,只表示兩次判斷一致;固定測試、原始文件與程式差異,才讓你知道結果是否合格。把這一層責任接起來,可讀AI Agent Harness 的分工。
DeepSeek 自己在技術報告的限制段落也提醒,部分榜單接近不代表最難推理與邊界案例已達等價;稀疏注意力選錯位置、局部快取重播,都可能在未測條件影響能力。因此重要任務要保留自己的失敗案例,才能知道第二次檢查補上了什麼。
四、效率改善值得期待,環境結論仍需要另一份量測
較小快取與較少輸入運算,提供效率改善的機制;耗電、用水與整體環境負擔,則還受硬體、利用率、資料中心位置及完成同一工作需多少次嘗試影響。原文從快取推到更環保,跨過了這些量測。本文保留架構可能改善效率的方向,將「一定更省水省電」從結論中拿掉。自行部署是否能回本,也需自己的容量與運維帳,不能由一個月費替所有團隊回答。
原文後記把這場競爭比作不同商業模式:作者認為低成本追趕者與需要回收研發費用的前沿公司,承受不同壓力。這是他的產業假說。公開費率能回答買服務要付多少,單靠它與榜單還無法核定各家的訓練成本、補貼或長期利潤;採用決策可以先依可驗收工作作答,不必替這個假說背書。
下一步:讓一週的工作替換模型決策作答
先挑三種你真的反覆做的低影響工作,例如有測試的小修補、探索性介面檢查、文件草稿。固定起始資料、驗收條件與停止預算,在自己的已授權環境交給兩條候選路線;保存模型版本、供應商、方案、快取分項、所有重試、複查與接受結果。涉及正式部署、付款或對外發送的動作,繼續放在明確權限與驗收之後。
一週後分開問:哪些工作確實更便宜、哪些多花了人工、哪些被額度或等待卡住?如果低成本路線在一類任務穩定通過,就先把那一類交給它;保留未過關工作的原路線。Jono 的心得值得追蹤的預測是:足夠好的低成本模型,會承接更多日常工作。你的驗收紀錄能把這個預測縮小成下週可以採取的決定。
接著閱讀
左右滑動查看更多推薦
今天先挑一份有固定答案的小工作,把兩條路線的完整成本與成果留下來。便宜值得打開選項;是否換模型,讓合格的工作說話。






