跳到主要內容

Gemini 3.8 Flash 深度解讀:同價為何任務成本反升 40%?(2026)

最後更新: ·
Gemini 3.8 Flash 官方發布視覺搭配同價不等於同成本標題

2026 年 9 月 2 日,Google 在官方部落格發布〈Introducing Gemini 3.8 Flash and 3.8 Flash Cyber〉:Gemini 3.8 Flash 已一般供應,發布時的推廣價是每百萬輸入 token 0.75 美元、輸出 token 3.75 美元;同一底層能力、資安防護更寬鬆的 Flash Cyber,則透過 Fairwind Program 提供給經審查的防禦者。

我的結論先放前面:Gemini 3.8 Flash 最有價值的進步,不是把思考變免費,而是用極高輸出速度承接更多推理與工具迴圈。這能提高複雜任務的完成率,也可能讓單次任務花更多 token、時間與錢。以下先還原 Google 發布內容,再用第三方測試重算「快」與「便宜」,最後拆解 Flash Cyber 的證據邊界與實際遷移方法。

Google 官方 Gemini 3.8 Flash 與 Flash Cyber 發布頁面
圖/Google(點圖閱讀原文)

Gemini 3.8 Flash 發布了什麼?

官方模型頁gemini-3.8-flash列為一般供應:支援文字、圖片、影片、音訊與 PDF 輸入,context window 最多約 100 萬 token,文字輸出上限 64K token。Google 把它定位為長時間軟體工程、自主 agent 與複雜知識工作的 Flash 級工作馬。

At times, the model might use more tokens to maximize performance, especially at higher effort levels.

中文:模型有時會使用更多 token 來提高表現,尤其是在較高 effort 設定下。

Google,2026 年 9 月 2 日

這句官方但書是整場發布最重要的線索。Gemini API 價格表顯示,0.75/3.75 美元是截至 2026 年 12 月 31 日的推廣價,而且輸出價格包含 thinking token;2027 年 1 月 1 日起,標準價會改為 1.50/7.50 美元。單價與 3.7 Flash 的推廣價相同,不代表完成同一項工作會產生相同帳單。

面向Gemini 3.8 FlashGemini 3.8 Flash Cyber
底層能力Google 表示兩者由相同的 foundational intelligence 驅動
發布時取得方式Gemini API、AI Studio、Gemini app、AI Mode、Gemini Enterprise 與 Antigravity 等經 Fairwind Program 審查的政府機關、關鍵基礎設施營運者、軟體維護者及其他合資格防禦者
安全邊界一般版本的 CBRN 與資安濫用防護資安防護較寬鬆,以支援更完整的防禦工作
正確理解可公開採用的高吞吐模型相同核心能力加上受控身分、政策與使用環境

跑分躍升,但「第一名」不等於可靠交付

Google 公布的成績確實有份量:Vals Finance Agent V2 為 61.4%,高於 3.7 Flash 的 59.0%;HLE-Verified 為 54.9%,對照前代的 53.6%;Harvey’s Legal Agent Benchmark 則是 10.0%,前代為 8.8%。最後一組最能校正行銷語言:即使 10.0% 在同一張比較圖上居首,絕對完成率仍不足以讓高風險法律工作跳過驗收。

Gemini 3.8 Flash 在 DeepSWE v1.1 的完成率與平均任務成本比較圖
圖/Google、Datacurve AI。Google 發布頁以 DeepSWE v1.1 呈現不同模型的完成率與平均任務成本;此圖是發布方收錄的評測結果,不等於本文獨立重跑。

DeepSWE v1.1 圖把 Gemini 3.8 Flash 放在高完成率、低平均任務成本的一側,這比只比 token 牌價更接近真實採購問題。不過,圖中的每個點仍綁定特定模型、effort、agent harness 與評測規則。想了解為何不能把一張排行榜當總冠軍,可先看 AlphaLab 的AI 模型排行榜交叉判讀

同一 token 價格,任務成本為何高約 40%?

Artificial Analysis 在發布日的獨立測試補上了官方圖沒有直接回答的部分。在 high reasoning 設定下,Gemini 3.8 Flash 的 Intelligence Index 為 59 分,3.7 Flash 是 56 分;但每項 Index 任務的加權平均成本由 0.40 美元升至 0.58 美元,增加約 40%。該機構把差異歸因於平均輸出 token 增至約 4.8 萬、比前代多 30%,以及 agentic 評測中的回合數增加。

Artificial Analysis 比較 Gemini 3.8 Flash 不同推理強度的每項任務成本與 Intelligence Index
圖/Artificial Analysis。箭頭標示 Gemini 3.8 Flash 的 low、medium、high reasoning;0.24、0.41、0.58 美元是該機構 Intelligence Index 的加權平均任務成本。

速度也要拆成兩層。Artificial Analysis 測得 high reasoning 約每秒輸出 300 token,解碼很快;可是每項任務平均時間仍由 3.7 Flash 的 2.2 分鐘增至 2.5 分鐘,因為模型產生更多內容、跑更多步驟。low reasoning 的 Index 是 52 分、每項任務 0.24 美元、平均 0.8 分鐘。這些數字只代表該機構當日的版本、題集與設定,不能直接套進你的工作負載。

最實用的成本式不是「token 單價」,而是:

每次成功任務成本=所有輸入、輸出與 thinking token+工具呼叫+重試成本,再除以真正通過驗收的任務數。

Simon Willison 在發布當天用一個「make me a cool thing in html」提示做快速試跑,記錄為 13 秒、1.8 美分。這很好地示範 Flash 的互動速度,卻只是一個 HTML/JavaScript 樣本;它不能取代多題、盲評、含失敗重試的 production eval。

Flash Cyber 是模型升級,也是存取控制產品

在 2026 年 9 月 2 日的發布安排裡,Gemini 3.8 Flash Cyber 並不是一般使用者在 API 裡切換的一個公開模式。Google 說它採用較寬鬆的資安 mitigations,因此透過Fairwind Program審查組織、使用情境與控制措施,再提供優先存取。能力與資格、政策、稽核環境一起構成產品,不能只拿同一個模型名稱理解。

Gemini 3.8 Flash Cyber 在 CyberGym C/C++ 漏洞發現 benchmark 的 pass at 1 比較
圖/Google。Google 公布 Gemini 3.8 Flash Cyber 在 CyberGym 的 pass@1 為 86.2%;數字來自發布方評測,圖上的比較模型與完整方法應一併閱讀。
發布主張數字證據邊界
CyberGym 漏洞發現pass@1 86.2%公開 benchmark 上由 Google 公布的評測結果
20 種程式語言的漏洞發現71.0%Google 內部 benchmark,外界無法只靠公告重現
CWE-Bench 自動修補47.2%,對照領先模型 47.8%外部 benchmark,但本文所引分數仍來自 Google 發布
Chrome 漏洞修補正確 patch 數為最佳大型商用模型的 2.6 倍Google Chrome Security 團隊內部比較
Wiz 滲透測試題集recall 高 7.5–9.7%,成本低 2.3–5.2 倍合作夥伴內部 benchmark;2026 年 9 月 2 日公告未附完整樣本與逐題結果

這組資料的合理讀法是「值得受控評估」,不是「已被公開獨立重現」。CyberGym 與 CWE-Bench 讓任務定義比 demo 清楚;但 Chrome、Wiz、20 種語言題集仍主要是內部證據,而且 Flash Cyber 的受限存取也提高了外部複驗門檻。對防禦團隊而言,最終指標仍應是找出的有效漏洞、可合併 patch、誤報、人工審核時間與每個成功修補成本。

模型卡透露了行銷頁沒講完的兩件事

第一,Gemini 3.8 Flash 模型卡明確說它建立在 3.7 Flash 之上;architecture、training dataset、hardware 與部分安全方法欄位都回指 3.7 的模型卡。這代表公開資料足以確認依賴關係,卻不足以從模型卡判斷究竟是哪一項架構或訓練改動帶來進步。

第二,速度與安全並非單向改善。模型卡列出的已知限制包括 hallucination、偶發變慢或 timeout,以及高 effort 可能使用更多 token。自動安全評測裡,多語言 safety 相對 3.7 Flash 退步 5.4 個百分點(該指標愈低愈好);Google 同時說,人工複核發現這些損失絕大多數屬於 false positive 或並不嚴重,專家 red team 沒發現重大疑慮。兩句必須一起保留:自動指標出現退步,不等於已證明實際傷害增加;人工說明也不能讓那個退步消失。

AlphaLab 判讀:Flash 的價值在吞吐,不在免費思考

我同意的部分:Gemini 3.8 Flash 把更強的 agentic 表現放進 Flash 的速度與單價帶,第三方 59 分與約 300 tokens/s 也提供了發布方以外的支持。對需要反覆讀文件、呼叫工具、修改程式再驗證的工作,這種吞吐可以把原本太慢的迴圈變得可用。

我保留的部分:「同價」只描述每百萬 token;高 reasoning 在 Artificial Analysis 的單次任務反而多花約 40%。Google 的專業 benchmark 有相對領先,也包含只有 10.0% 的絕對完成率;Cyber 最吸睛的真實環境成果,則多來自 Google 與合作夥伴內部比較。這些都支持測試,還不足以支持全面切換。

真正的新訊號是:模型供應商開始把「思考多久」變成可調的產品旋鈕,而高速模型可以在可接受的等待時間裡消耗更多推理。於是模型選擇不再是單一排行榜,而是品質、token 數、工具回合、總延遲與成功成本的共同最佳化。這也正是模型路由與評測比「選一個預設冠軍」更重要的原因。

團隊現在該怎麼測 Gemini 3.8 Flash?

  1. 先固定 20 至 50 個真實失敗案例。包含長文件、程式修改、工具呼叫與需要人工修正的任務;不要只挑模型容易展示的題目。
  2. 同時比較 3.7 Flash 與 3.8 Flash 的 low、medium、high。固定 prompt、工具、timeout、重試與驗收規則;現行設定若已是其中一組,不必重跑重複樣本。
  3. 算每次成功任務,不只算每百萬 token。記錄輸入、輸出與 thinking token、工具回合、牆鐘時間、重試、人工修正時間,以及真正通過驗收後的成本。可用AI Evals 流程把這些欄位變成可重跑的測試集。
  4. 先小流量路由,再決定是否換預設。把高 effort 留給確實提高通過率的難題;大量簡單任務優先比較 low/medium,並保留回滾。
  5. 資安工作必須把模型放回控制系統。合資格團隊測 Flash Cyber 時,仍要限制儲存庫與工具權限、隔離執行、驗證 patch、記錄每次行動,並由授權人員核准高影響操作。

如果你的瓶頸是長時間 agent 的等待與完成率,Gemini 3.8 Flash 值得優先進測試池;如果工作短、輸出多就直接增加成本,或現有 3.7 Flash 已穩定過關,那麼更高分不一定是更好的生產設定。

接著閱讀

左右滑動查看更多推薦

下一步很簡單:拿同一批真實任務畫出「通過率對每次成功成本」曲線;只有 Gemini 3.8 Flash 在那條曲線上勝出,升級才真正成立。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。