2026 年 9 月 2 日,Google 在官方部落格發布〈Introducing Gemini 3.8 Flash and 3.8 Flash Cyber〉:Gemini 3.8 Flash 已一般供應,發布時的推廣價是每百萬輸入 token 0.75 美元、輸出 token 3.75 美元;同一底層能力、資安防護更寬鬆的 Flash Cyber,則透過 Fairwind Program 提供給經審查的防禦者。
我的結論先放前面:Gemini 3.8 Flash 最有價值的進步,不是把思考變免費,而是用極高輸出速度承接更多推理與工具迴圈。這能提高複雜任務的完成率,也可能讓單次任務花更多 token、時間與錢。以下先還原 Google 發布內容,再用第三方測試重算「快」與「便宜」,最後拆解 Flash Cyber 的證據邊界與實際遷移方法。

Gemini 3.8 Flash 發布了什麼?
官方模型頁把 gemini-3.8-flash列為一般供應:支援文字、圖片、影片、音訊與 PDF 輸入,context window 最多約 100 萬 token,文字輸出上限 64K token。Google 把它定位為長時間軟體工程、自主 agent 與複雜知識工作的 Flash 級工作馬。
At times, the model might use more tokens to maximize performance, especially at higher effort levels.
中文:模型有時會使用更多 token 來提高表現,尤其是在較高 effort 設定下。
Google,2026 年 9 月 2 日
這句官方但書是整場發布最重要的線索。Gemini API 價格表顯示,0.75/3.75 美元是截至 2026 年 12 月 31 日的推廣價,而且輸出價格包含 thinking token;2027 年 1 月 1 日起,標準價會改為 1.50/7.50 美元。單價與 3.7 Flash 的推廣價相同,不代表完成同一項工作會產生相同帳單。
| 面向 | Gemini 3.8 Flash | Gemini 3.8 Flash Cyber |
|---|---|---|
| 底層能力 | Google 表示兩者由相同的 foundational intelligence 驅動 | |
| 發布時取得方式 | Gemini API、AI Studio、Gemini app、AI Mode、Gemini Enterprise 與 Antigravity 等 | 經 Fairwind Program 審查的政府機關、關鍵基礎設施營運者、軟體維護者及其他合資格防禦者 |
| 安全邊界 | 一般版本的 CBRN 與資安濫用防護 | 資安防護較寬鬆,以支援更完整的防禦工作 |
| 正確理解 | 可公開採用的高吞吐模型 | 相同核心能力加上受控身分、政策與使用環境 |
跑分躍升,但「第一名」不等於可靠交付
Google 公布的成績確實有份量:Vals Finance Agent V2 為 61.4%,高於 3.7 Flash 的 59.0%;HLE-Verified 為 54.9%,對照前代的 53.6%;Harvey’s Legal Agent Benchmark 則是 10.0%,前代為 8.8%。最後一組最能校正行銷語言:即使 10.0% 在同一張比較圖上居首,絕對完成率仍不足以讓高風險法律工作跳過驗收。

DeepSWE v1.1 圖把 Gemini 3.8 Flash 放在高完成率、低平均任務成本的一側,這比只比 token 牌價更接近真實採購問題。不過,圖中的每個點仍綁定特定模型、effort、agent harness 與評測規則。想了解為何不能把一張排行榜當總冠軍,可先看 AlphaLab 的AI 模型排行榜交叉判讀。
同一 token 價格,任務成本為何高約 40%?
Artificial Analysis 在發布日的獨立測試補上了官方圖沒有直接回答的部分。在 high reasoning 設定下,Gemini 3.8 Flash 的 Intelligence Index 為 59 分,3.7 Flash 是 56 分;但每項 Index 任務的加權平均成本由 0.40 美元升至 0.58 美元,增加約 40%。該機構把差異歸因於平均輸出 token 增至約 4.8 萬、比前代多 30%,以及 agentic 評測中的回合數增加。

速度也要拆成兩層。Artificial Analysis 測得 high reasoning 約每秒輸出 300 token,解碼很快;可是每項任務平均時間仍由 3.7 Flash 的 2.2 分鐘增至 2.5 分鐘,因為模型產生更多內容、跑更多步驟。low reasoning 的 Index 是 52 分、每項任務 0.24 美元、平均 0.8 分鐘。這些數字只代表該機構當日的版本、題集與設定,不能直接套進你的工作負載。
最實用的成本式不是「token 單價」,而是:
每次成功任務成本=所有輸入、輸出與 thinking token+工具呼叫+重試成本,再除以真正通過驗收的任務數。
Simon Willison 在發布當天用一個「make me a cool thing in html」提示做快速試跑,記錄為 13 秒、1.8 美分。這很好地示範 Flash 的互動速度,卻只是一個 HTML/JavaScript 樣本;它不能取代多題、盲評、含失敗重試的 production eval。
Flash Cyber 是模型升級,也是存取控制產品
在 2026 年 9 月 2 日的發布安排裡,Gemini 3.8 Flash Cyber 並不是一般使用者在 API 裡切換的一個公開模式。Google 說它採用較寬鬆的資安 mitigations,因此透過Fairwind Program審查組織、使用情境與控制措施,再提供優先存取。能力與資格、政策、稽核環境一起構成產品,不能只拿同一個模型名稱理解。

| 發布主張 | 數字 | 證據邊界 |
|---|---|---|
| CyberGym 漏洞發現 | pass@1 86.2% | 公開 benchmark 上由 Google 公布的評測結果 |
| 20 種程式語言的漏洞發現 | 71.0% | Google 內部 benchmark,外界無法只靠公告重現 |
| CWE-Bench 自動修補 | 47.2%,對照領先模型 47.8% | 外部 benchmark,但本文所引分數仍來自 Google 發布 |
| Chrome 漏洞修補 | 正確 patch 數為最佳大型商用模型的 2.6 倍 | Google Chrome Security 團隊內部比較 |
| Wiz 滲透測試題集 | recall 高 7.5–9.7%,成本低 2.3–5.2 倍 | 合作夥伴內部 benchmark;2026 年 9 月 2 日公告未附完整樣本與逐題結果 |
這組資料的合理讀法是「值得受控評估」,不是「已被公開獨立重現」。CyberGym 與 CWE-Bench 讓任務定義比 demo 清楚;但 Chrome、Wiz、20 種語言題集仍主要是內部證據,而且 Flash Cyber 的受限存取也提高了外部複驗門檻。對防禦團隊而言,最終指標仍應是找出的有效漏洞、可合併 patch、誤報、人工審核時間與每個成功修補成本。
模型卡透露了行銷頁沒講完的兩件事
第一,Gemini 3.8 Flash 模型卡明確說它建立在 3.7 Flash 之上;architecture、training dataset、hardware 與部分安全方法欄位都回指 3.7 的模型卡。這代表公開資料足以確認依賴關係,卻不足以從模型卡判斷究竟是哪一項架構或訓練改動帶來進步。
第二,速度與安全並非單向改善。模型卡列出的已知限制包括 hallucination、偶發變慢或 timeout,以及高 effort 可能使用更多 token。自動安全評測裡,多語言 safety 相對 3.7 Flash 退步 5.4 個百分點(該指標愈低愈好);Google 同時說,人工複核發現這些損失絕大多數屬於 false positive 或並不嚴重,專家 red team 沒發現重大疑慮。兩句必須一起保留:自動指標出現退步,不等於已證明實際傷害增加;人工說明也不能讓那個退步消失。
AlphaLab 判讀:Flash 的價值在吞吐,不在免費思考
我同意的部分:Gemini 3.8 Flash 把更強的 agentic 表現放進 Flash 的速度與單價帶,第三方 59 分與約 300 tokens/s 也提供了發布方以外的支持。對需要反覆讀文件、呼叫工具、修改程式再驗證的工作,這種吞吐可以把原本太慢的迴圈變得可用。
我保留的部分:「同價」只描述每百萬 token;高 reasoning 在 Artificial Analysis 的單次任務反而多花約 40%。Google 的專業 benchmark 有相對領先,也包含只有 10.0% 的絕對完成率;Cyber 最吸睛的真實環境成果,則多來自 Google 與合作夥伴內部比較。這些都支持測試,還不足以支持全面切換。
真正的新訊號是:模型供應商開始把「思考多久」變成可調的產品旋鈕,而高速模型可以在可接受的等待時間裡消耗更多推理。於是模型選擇不再是單一排行榜,而是品質、token 數、工具回合、總延遲與成功成本的共同最佳化。這也正是模型路由與評測比「選一個預設冠軍」更重要的原因。
團隊現在該怎麼測 Gemini 3.8 Flash?
- 先固定 20 至 50 個真實失敗案例。包含長文件、程式修改、工具呼叫與需要人工修正的任務;不要只挑模型容易展示的題目。
- 同時比較 3.7 Flash 與 3.8 Flash 的 low、medium、high。固定 prompt、工具、timeout、重試與驗收規則;現行設定若已是其中一組,不必重跑重複樣本。
- 算每次成功任務,不只算每百萬 token。記錄輸入、輸出與 thinking token、工具回合、牆鐘時間、重試、人工修正時間,以及真正通過驗收後的成本。可用AI Evals 流程把這些欄位變成可重跑的測試集。
- 先小流量路由,再決定是否換預設。把高 effort 留給確實提高通過率的難題;大量簡單任務優先比較 low/medium,並保留回滾。
- 資安工作必須把模型放回控制系統。合資格團隊測 Flash Cyber 時,仍要限制儲存庫與工具權限、隔離執行、驗證 patch、記錄每次行動,並由授權人員核准高影響操作。
如果你的瓶頸是長時間 agent 的等待與完成率,Gemini 3.8 Flash 值得優先進測試池;如果工作短、輸出多就直接增加成本,或現有 3.7 Flash 已穩定過關,那麼更高分不一定是更好的生產設定。
接著閱讀
左右滑動查看更多推薦
下一步很簡單:拿同一批真實任務畫出「通過率對每次成功成本」曲線;只有 Gemini 3.8 Flash 在那條曲線上勝出,升級才真正成立。






