跳到主要內容

Gemini 3.7 Flash 深度解讀:340 tok/s 與 Index 56 的新平衡(2026)

最後更新: ·
Gemini 3.7 Flash 在 high reasoning 下約 340 tok/s 並取得 Artificial Analysis Intelligence Index 56

2026 年 8 月 13 日(台北時間 8 月 14 日凌晨),Google Gemini 團隊在官方部落格發布〈Introducing Gemini 3.7 Flash〉,把 Gemini 3.7 Flash 定位成目前最聰明的 coding 與 agent「工作馬」模型。真正讓開發者興奮的不是一個榜首,而是一個少見組合:Artificial Analysis 在 high reasoning 設定下測得 Intelligence Index 56、約 340 output tokens/s;Google 同時把核心 API 標成 Stable,而不是仍受 preview 狀態限制的版本。

這組數字看起來像速度、能力與成本終於同時站到甜蜜點,但三個口徑不能省略:56 與 340 都是 high reasoning,不是 API 預設的 medium;340 是模型開始輸出後的解碼速度,不是從送出請求到看到第一個字的完整延遲;現行低價也只到 2026 年 12 月 31 日。下面先忠實整理原文,再逐一查證第三方評測、價格與使用邊界,最後給出可落地的判讀與測試方法。

點擊下面截圖可在新分頁開啟 Google 公告,直接閱讀原文。

Google Introducing Gemini 3.7 Flash 官方發布頁的瀏覽器截圖
Google 於官網標示 2026 年 8 月 13 日發布 Gemini 3.7 Flash,主打 coding 與 agent 工作流。點圖可前往原文。圖/Google

Gemini 3.7 Flash 原文到底宣布了什麼?

“…our most intelligent workhorse model yet for coding and agents.”

中文:「……目前最聰明、面向 coding 與 agents 的工作馬模型。」

— Google Gemini 團隊,〈Introducing Gemini 3.7 Flash〉

Google 的主張很直接:距離 3.6 Flash 只有三週,3.7 Flash 已在軟體工程、知識工作與網頁開發上再往前推。官方列出的代表數字包括 FrontierCode 1.1 Main 43.6% 對 34.4%、WebDev Arena Elo 1588 對 1538、GDP.pdf 34.0% 對 22.0%、AutomationBench 30.4% 對 17.0%,比較對象都是 3.6 Flash。

Google 官方圖表比較 Gemini 3.7 Flash、3.6 Flash、Claude Sonnet 5 與 GPT-5.6 Terra 的 FrontierCode 1.1 Main production code quality
Google 公布的 FrontierCode 1.1 Main:Gemini 3.7 Flash 為 43.6%,3.6 Flash 為 34.4%。這是發布方提供的評測圖,不等同獨立審計。圖/Google

這些結果支持「3.7 比 3.6 強」的方向,卻不能全部視為同一套獨立 head-to-head。Google 的評測方法說明混合了公司自行重跑、公開排行榜與其他供應商自報數字;blog 把 DeepSWE 的 3.6 Flash 寫成 49.0%,model card則列 48.6%。差距不大,但提醒我們:漂亮圖表先證明發布方看見改善,跨模型勝負仍要看共同 harness、budget 與 reasoning 設定。

規格面更清楚:官方模型頁列出 1,048,576 input tokens65,536 output tokens,可接收文字、圖片、影片、音訊與 PDF,輸出為文字。Google 也在 model card 列出 hallucination、偶發緩慢或 timeout 等限制;因此「更快、更準」是相對 3.6 的發布結論,不是每一題都可靠的保證。


56 分的真正意義:前沿能力,但不是 56% 正確率

Artificial Analysis 在發布前測完 low、medium、high 三種 reasoning level。結果是 high 取得 56,比 3.6 Flash 高 4 分;medium 為 53,low 為 51。High 的 56 比 GPT-5.6 Terra max 與 Muse Spark 1.2 xhigh 的 57 低 1 分,已進入前沿能力帶,但不等於「答對率 56%」。

Artificial Analysis Intelligence Index 圖表顯示 Gemini 3.7 Flash high 為 56 分
Artificial Analysis Intelligence Index v4.1.1 中,Gemini 3.7 Flash high 為 56;圖中亦顯示 3.6 Flash 為 52,箭頭標示代際提升。圖/Artificial Analysis

這個 Index 由九項英文、純文字評測組成,權重約為 Agents 34%、Coding 24%、Scientific Reasoning 24%、General 18%。它比只挑一道數學或 coding 題更完整,也明顯偏向 agentic knowledge work;它沒有直接證明多語言、影像理解、語音或你的企業資料工作流同樣領先。正確用法是把 56 當作「值得進入候選名單」的綜合訊號,而不是跨場景通行證。

“Gemini 3.7 Flash produces ~340 output tokens per second, nearly 3x the output speed of GPT-5.6 Terra and GLM-5.2.”

中文:「Gemini 3.7 Flash 每秒產生約 340 個 output tokens,接近 GPT-5.6 Terra 與 GLM-5.2 輸出速度的三倍。」

— Artificial Analysis,high reasoning 測試

這正是新平衡點的核心:高 reasoning 沒有把輸出速度拖回慢模型區。Artificial Analysis 同時估算 high 的加權平均 decode time 約 1.7 分鐘/任務,medium 約 1.4 分鐘,low 約 0.9 分鐘;其中 high 被 AA 判定落在能力 × 任務時間的 Pareto frontier 上。

Artificial Analysis Time per Intelligence Index Task 圖表顯示 Gemini 3.7 Flash low、medium、high 分別約 0.9、1.4、1.7 分鐘
AA 的加權 decode time:Gemini 3.7 Flash low 約 0.9 分鐘、medium 約 1.4 分鐘、high 約 1.7 分鐘。圖表明載不含 TTFT 與 overhead。圖/Artificial Analysis

340 tok/s 很快,但第一個字並不快

340 tok/s 測的是 steady-state decode:模型送出第一個片段後,內容往外吐的速度。依 Artificial Analysis performance methodology,它使用約 10K input、至少 1,500 output 的標準工作負載,以 OpenAI o200k_base tokenizer 統一計數,並取過去 72 小時的中位數。這方便跨供應商比較,卻不是 Gemini 帳單上的原生 token,也不等於完整 end-to-end latency。

同一個 AA model page 在 2026 年 8 月 14 日顯示,Gemini 3.7 Flash high 的 Time to First Answer(TTFA,第一個可見答案出現前的等待)約 9.83 秒,相近價格 reasoning models 的中位數約 2.82 秒。對 reasoning model 而言,TTFA 與收到第一個 reasoning token 的 TTFT 不是同一件事。換句話說,它像一條啟動較慢、上高速後非常快的產線:長程 coding agent、文件生成與多步工具工作流會更能吃到 340 tok/s 的紅利;只問一句、期待立即看到答案的聊天體驗,未必同樣驚艷。

設定也很重要。Google API 預設是 medium,不是 high;AA 在 medium 測得約 53 分、274 tok/s,low 約 51 分、253 tok/s。發布日最吸睛的 56/340 來自 AA 所測三檔中的最高 reasoning 設定;若沿用 AA 同一口徑,API 預設更接近 53/274。這仍然快,只是部署估算不能把 high 的成績自動套給所有請求。


核心模型已 Stable,但「廣泛推出」仍有邊界

這次最實際的差別,是核心模型 ID gemini-3.7-flash 已在官方模型頁標為 Stable。開發者可透過 Gemini API、AI Studio、Android Studio 與 Antigravity 使用;企業可在 Gemini Enterprise Agent Platform 與 app 存取。這讓團隊能用穩定版本進入 production eval,不必把採用決策押在 preview 的版本生命週期上。

但消費者端不是無條件全面替換。Google 公告寫的是 Gemini Spark 自發布日起改用 3.7 Flash,而 Spark 只提供給支援國家的 Google AI Pro/Ultra 訂閱者;Computer Use 支援也仍是 Preview。較準確的結論是:核心 API 已正式可用,開發與企業入口很廣;一般 Gemini app 使用者不一定會在每個入口直接拿到 3.7 Flash。

這個差異很重要。模型成為產品,不只需要 benchmark,還需要穩定 endpoint、可預期版本、計費、rate limit、監控與遷移路徑。本次至少明確具備 Stable model ID、官方計費與多個開發/企業入口;rate limit、監控與遷移仍要依團隊實測。所以「可實際使用」比「又一個分數更高的 preview」更接近發布的真正價值。


Gemini 3.7 Flash 價格優勢有倒數計時

“$0.75/1M input tokens and $3.75/1M output tokens.”

中文:「每百萬 input tokens 0.75 美元、每百萬 output tokens 3.75 美元。」

— Google Gemini 團隊;原文說明此 introductory pricing 適用至 2026 年底
Developer API 標準付費層Input/1M tokensOutput/1M tokens適用期間
Introductory pricingUS$0.75US$3.75至 2026/12/31
Standard pricingUS$1.50US$7.50自 2027/01/01
Google Developer API 官方牌價;output 含 thinking tokens。Enterprise Agent Platform 可能採不同計價。

Google 說現價是 3.6 Flash「原始」每百萬 token 成本的一半,這不等於 3.7 現在比 3.6 便宜 50%:兩者目前都適用同一組 introductory pricing。Artificial Analysis 算出的 high 約 US$0.40/Index task、比 3.6 Flash 低 30%,也使用這組折扣價。從 2027 年 1 月 1 日起,input 與 output 牌價都會翻倍;若 token 用量不變,單看 token 部分的任務成本也會跟著翻倍。

所以今天可以說「Gemini 3.7 Flash 在折扣期有很強的能力 × 時間 × 成本組合」,不能把這個成本位置寫成永久屬性。真正要做年度預算的團隊,應同時跑兩張成本表:一張用 2026 年現價,一張用 2027 年標準價。若模型仍因較少重試、較短完成時間或更高成功率勝出,那才是長期優勢。


154.8 萬觀看與 872 points:熱度是真的,證明的不是能力

截至 2026 年 8 月 14 日 19:35(台北時間),Google DeepMind 的發布貼文累積 154 萬 7,830 次觀看、4,371 個讚;Hacker News 討論串則達 872 points、444 則留言。這證明發布迅速取得大量開發者注意;僅靠 engagement 無法判定大家是因速度、分數、價格或新鮮感而點進來。

討論也不是一面倒。HN 有實作者在image-to-HTML 測試後仍把 Opus 放在首選,並回報 Gemini 的 build 約花七分鐘;這是單一人的單一工作負載,不是可重現 benchmark,卻剛好說明為何總榜不能替代實務 eval。觀看數與 points 衡量注意力,真正決定續用的是你的任務成功率、總等待時間與錯誤成本。


AlphaLab 的判讀:新平衡點成立,但不是三個數字相加

判讀一:最大突破是長任務吞吐,不是每次互動都即時

340 tok/s 的價值會隨輸出長度放大。當 agent 要寫數千行程式、整理長文件、反覆呼叫工具並回報結果,decode time 可能是主要瓶頸;一旦第一個片段出來,3.7 Flash 能迅速把後續內容送完。對只有幾十個 token 的短問答,9.83 秒左右的首答等待反而更醒目。它不是單純的「快」,而是呈現前段等待較久、後段輸出很快的延遲分布。

判讀二:Stable 讓 benchmark 能直接接到採用決策

很多新模型的問題不是分數不足,而是版本、rate limit 或支援週期仍不確定,團隊難以把它放進真正流量。3.7 Flash 的核心 API 已是 Stable,企業與開發工具入口也同日到位,讓「測完很好」可以接續成 shadow traffic、分流與逐步上線。這是本次發布比 headline benchmark 更耐久的部分。

判讀三:預設 medium 才是大多數人的真實起點

High 的 56/340 展示的是 AA 所測三檔中的最高 reasoning 設定,medium 的 53/274 才更接近沒有特別調參的 API 使用。兩者都很有競爭力,但任務路由不同:高價值、可容忍較多 reasoning 的 coding 與 agent 任務可先試 high;分類、抽取、短回覆或大規模低風險工作,medium 甚至 low 可能更合理。把 high 當成所有請求的預設,會高估能力,也可能高估 reasoning token 成本。

判讀四:折扣能加速試用,標準價才決定 2027 年留存

introductory pricing 把導入門檻壓得很低,正適合用真流量建立 baseline;它也會讓發布日的 cost frontier 看起來特別漂亮。到了 2027 年,價格翻倍後仍然值得留下的條件很簡單:3.7 Flash 必須用較高成功率、更短 wall-clock time 或較少人工 review,抵銷單價變化。否則團隊只是在折扣期間把流量搬家。

判讀五:Index 是候選名單,不是 production 驗收單

AA 的 56 已經足以推翻「Flash 只能做廉價小任務」的舊印象,但同一指數偏重英文、文字與 agentic eval;Google 的發布表又混合多種來源。最穩健的結論不是「Gemini 3.7 Flash 全面勝出」,而是「它以很少見的速度進入前沿候選群,值得每個長輸出或 agent 團隊重新測一次」。

我同意的部分:Gemini 3.7 Flash 確實把 high reasoning 的能力與 steady-state 輸出速度推到新的實用組合;核心 API 已 Stable,讓這個組合不是紙上 demo。對長程 agent、coding 與文件工作流,它很可能比單看總分更有競爭力。

我存疑的部分:「340 tok/s」容易遮住約 9.83 秒的首答延遲;「Index 56」容易遮住預設 medium 其實是 53;「低成本」則容易遮住 2027 年元旦起翻倍的標準價。這三個限定一補上,故事沒有崩掉,反而更清楚:它不是無條件最強,而是一個非常值得部署驗證的高吞吐前沿模型。


現在怎麼測 Gemini 3.7 Flash,才不會被榜單帶著走?

  1. 先固定 20–50 個真實任務。不要只用短 prompt;放入會失敗的 coding issue、長文件、工具呼叫與你的輸出格式。
  2. medium 與 high 分開跑。medium 是預設,high 是發布日 56/340 的來源;兩者不能混成同一筆結果。
  3. 把速度拆成四段。記錄 TTFT、TTFA、decode time 與完整 end-to-end wall-clock time,再加上成功率、重試次數、工具呼叫數與人工修正時間。
  4. 成本算兩次。同一份 token 與重試紀錄,分別套用 2026 折扣價與 2027 標準價,避免把短期促銷當成長期架構。
  5. 通過品質 gate 才談路由。若 3.7 Flash 在你的任務達標,再依延遲與成本決定哪些流量交給它;完整方法可接著看 AlphaLab 的AI 模型路由 Eval 實作

如果工作負載以長輸出、coding agent 或多步工具為主,Gemini 3.7 Flash 應該立刻進入候選;如果你的產品靠首答體感取勝,先別被 340 tok/s 說服,TTFA 才是第一個淘汰門檻。真正的新平衡不是一張榜單,而是同一模型能否在你的品質門檻內,用更短的完成時間交付更多成功任務。

接著閱讀

左右滑動查看更多推薦

今天最值得做的不是把所有流量立刻切走,而是用一小段真實任務,同時測 Gemini 3.7 Flash medium 與 high;等品質、TTFA、總完成時間和 2027 年成本都贏,再讓它接手更多工作。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。