2026 年 9 月 23 日,Google 的 Leland Rechis 與 Alan Cowen 在 Google Blog 發布了〈Gemini 3.8 text-to-speech says hello〉。這次 Gemini 3.8 TTS 的關鍵,不只是聲音更自然,而是 Google 把聲線設計、聲音複製、逐句導演、雙人對話與可持續使用的 Voice ID,壓進同一套開發介面。

先把發布文的能力主張完整攤開,再對照 API 文件、原始排行榜與安全技術的邊界,才能回答兩個真正重要的問題:它是否已把專業語音製作變成可程式化流程?一次錄音同意,又是否足以支撐聲音被長期複製與反覆使用?
Gemini 3.8 TTS 把什麼放進同一套 API?
Google 把兩個模型分成不同角色:Gemini 3.8 Flash TTS 主打聲線設計、表演細節、方言與長篇內容;Gemini 3.8 Flash-Lite TTS 主打大量生成、低延遲與成本。兩者使用同一種 TTS 請求結構,但不是功能完全相同的「大杯/小杯」:官方模型頁列出 Flash 支援 130 種語言,Flash-Lite 為 101 種,創意與產能的取捨相當明確。
- Voice design:用自然語言描述角色、年齡感、口音、音色與表演氣質,建立可重複使用的聲線。
- Voice replication:以真人參考音檔與另一段同意錄音,建立聲音複本;官方 API 文件把參考音檔界定為 10–30 秒。
- 逐句導演:每一段文字可帶獨立的
speech_metadata,指定說話者與持續性的語氣、節奏或情緒;笑聲、嘆氣等瞬間事件則使用 inline vocal tags。 - 多說話者與長篇穩定:同一份腳本可安排雙人輪替、插話與重疊語句,並沿用固定 Voice ID,降低角色聲線在不同請求間漂移。
“Once you’ve selected your voices, both TTS models give you precise control over how each line is delivered.”
中文:選定聲線之後,兩個 TTS 模型都讓你精確控制每一句的演出方式。
Google,〈Gemini 3.8 text-to-speech says hello〉
這句話點出真正的產品變化。過去常見流程是「先挑聲音,再把整段文字送去合成」;現在聲線本身、每句演法、角色輪替與輸出音訊都能成為結構化資料。對有聲書、遊戲對白、配音與 Voice Agent 團隊來說,最大的節省未必是少錄一次音,而是少在多個工具、檔案與人工交接之間搬運狀態。
「2,000+ 聲線」很吸睛,但官方口徑沒有對齊
發布文宣稱可存取「2,000+ production-ready voices」,同時又說能從原本 30 個預設聲線擴展到近乎無限的自訂聲線;但 Gemini API 的 2026 年 9 月 22 日 changelog 寫的是「150+ prebuilt and custom voices」。兩個數字都來自 Google,卻沒有使用相同分母:一個可能把語言、地區變體或可部署組合都算進去,另一個看起來更接近 API 可列舉的聲線。
在沒有取得 API 清單、也沒有官方定義解釋之前,2,000+ 應視為發布文的行銷口徑,而不是可直接對帳的聲線數量。更可靠的採購問題不是「總共有幾個」,而是你的目標語言、口音與角色類型各有多少可用選項,能否穩定跨段落重現。
長篇能力也要用相同標準閱讀。發布文寫的是可維持「數小時」連續音訊的品質與角色音色;API 指南則把 Flash 描述為適合多分鐘敘事與長篇穩定。公開資料確認了模型定位,卻沒有提供一份可獨立重跑、涵蓋數小時內容的測試集。因此,這仍是值得驗收的產品主張,不是已被外部證明的普遍結果。
跑分是真的,但沒有官方圖那麼單純
Google 引用 Hume AI 的 Voice Design Benchmark,稱 Gemini 3.8 Flash TTS 以 71.4 分排名第一,口音建模拿到 60.8 分。原始發布圖也顯示,它在「聲線品質」欄位以 74.6 分落後 ElevenLabs v3 的 76.6 分。這不是全面碾壓,而是不同能力維度各有勝負。

Hume AI 公開的方法說明值得肯定:它以大量真人判斷為主,評估聲音是否符合角色、口音、音色與表演指令,而不是只讓另一個模型打分。不過截至 2026 年 9 月 24 日,Hume 的公開文章與榜頁呈現的是 Gemini 3.1 等既有列項,不是 Google 圖中的 Gemini 3.8 列項。最精確的說法是:Google 公布了 Hume 評測結果,Hume 的方法可以核對;在 Hume 公開頁面補上同一列資料前,71.4 與 60.8 仍應標示為 Google 公布的分數。
Voice Arena 提供了較容易查驗的第二個角度。其即時英語榜在本文查核時,把 Gemini 3.8 Flash-Lite TTS 列為 1087 分、Gemini 3.8 Flash TTS 列為 1061 分,兩者都在第一梯隊;但 95% 信賴區間的名次範圍互相重疊,不能把「榜首群」誇大成沒有爭議的唯一冠軍。

這些結果足以支持「Gemini 3.8 TTS 已進入頂尖競爭群」;它們不足以證明每種口音、每種角色與每段長篇腳本都會贏。Hacker News 的早期試用者也有人指出,部分笑聲與表演提示沒有照做,另有人遇到區域不可用。這些回報只能當成待測項目,不能取代受控盲測;但它們正好提醒團隊,把 prompt following 與可用區域納入驗收表。
同意錄音是必要閘門,不是完整權利管理
聲音複製最敏感的不是音質,而是誰有權建立、使用與撤銷這個聲音。Gemini API 的聲音複製文件要求兩段來自同一位成年說話者的真人錄音:10–30 秒的參考音檔,以及朗讀固定句子的同意音檔。Google AI Studio 的介面也把「加入聲音樣本」與「驗證是本人」拆成兩步。

“I am the owner of this voice and I consent to Google using this voice to create a synthetic voice model.”
中文:我是這個聲音的所有者,並同意 Google 使用它建立合成聲音模型。
Gemini API Voice replication 文件
這個閘門能確認「建立當下,有一位聲音相符的人朗讀了同意句」,卻不會自動替產品團隊決定授權範圍、使用期限、可否轉授權、離職後處理、撤銷流程或爭議時的停用權。那些仍然需要合約、權限與稽核紀錄來完成。技術驗證與持續授權是兩條不同的控制線,少任何一條都會留下風險。
資料保存也有具體選項。官方文件列出:預設 stateful Voice ID 由 Google 保存一年,每個專案最多 200 個自訂聲線;若使用 store=False,API 會回傳由客戶端管理的加密 voice key,有效期 7 天。這讓團隊可以按用途選擇便利性或較短的伺服器保存期,而不是把所有聲音資產都放在同一種生命週期裡。
SynthID 與 C2PA 解決的是可追溯,不是「不會被冒用」
Google 表示 Gemini Audio 產生的音訊會帶有 SynthID;水印聽不見,設計上能承受加噪、MP3 壓縮與速度改變等常見處理,使用者可把音訊交給 Gemini 檢查是否含有 Google AI 的水印。這對平台調查、新聞查核與內容標示有幫助。
但水印回答的是「這段音訊是否可能由 Google AI 生成或修改」,不是「說話者是否批准這次用途」。Google 自己也把 SynthID 稱為 building block,而不是辨識所有 AI 內容的萬靈丹。發布文另提到 C2PA credentials;C2PA 規格能把來源、編輯歷程與 AI 生成資訊放進可驗證的 Content Credentials,但憑證仍是來源紀錄,不是內容真實性或肖像/聲音授權的判決書。
還有一個容易被發布標題掩蓋的邊界:Google 原文腳註明確寫的是,AI Studio 的 voice replication 在 Illinois、Texas、EEA、UK、Switzerland 與 India 不提供。這是 AI Studio 介面的地域限制,不能直接延伸成所有 API 通路都相同;也表示「功能已發布」與「你的帳號、地區、企業環境現在可用」必須分開驗證。
AlphaLab 的判讀:真正的突破是工作流壓縮
我同意:語音製作已從單次輸出,變成可保存的系統資產
Gemini 3.8 TTS 最有價值的地方,是把「角色是誰」「這句怎麼演」「兩人何時輪替」「聲線如何跨請求保存」拆成可管理物件。當 Voice ID 能進版本控制、內容管理與審核流程,配音就不再只是拿到一個 WAV 檔,而是可以重跑、局部重錄、替換台詞與追蹤權限的生產管線。
我存疑:一次 consent recording 容易被誤當成永久授權
Google 的同意驗證比「上傳任意 30 秒音檔就能複製」負責任得多,但它只把建立門檻技術化。真正棘手的是建立之後:聲線可以用多久、能演什麼內容、誰能把 Voice ID 放進正式環境、本人撤回時如何找到所有下游成品。若產品只保存一段 consent recording,卻沒有授權範圍與撤銷機制,風險只是從入口被搬到後台。
我存疑:排行榜不能替你的腳本驗收
聲音系統的失敗往往不是「整體很難聽」,而是專有名詞念錯、角色在第 40 分鐘漂移、插話節點不自然、笑聲標記被忽略,或同一角色在重跑後像換了人。平均分數會把這些局部失敗沖淡。製作團隊應該把自己的劇本、語言與口音當成測試集,記錄一次通過率與人工返工分鐘數;那才是能進預算表的品質。
現在怎麼評估 Gemini 3.8 TTS?
- 先用 5 分鐘真實腳本,不用展示稿。放入人名、數字、專有名詞、情緒轉折與一段雙人插話,連續生成三次。
- 分開量六件事。聲線一致、逐句指令遵循、發音、雙人分離、長段落漂移、重新生成的一致性;不要只問「聽起來自然嗎」。
- 把授權做成生命週期。建立前記錄權利人與用途,部署時限制可用專案,撤銷時刪除 Voice ID/key 並追蹤已發布成品。
- 用成本算返工,不只算 token。依 2026 年 9 月 24 日官方價格與 25 audio tokens/秒換算,Flash 標準輸出約每小時 0.81 美元,Flash-Lite 約 0.54 美元;2027 年 1 月 1 日起表定價格加倍。若每小時成品仍需 30 分鐘人工修補,人工才是主成本。
- 別把 TTS 與 Live API 混在一起。TTS 適合逐字稿、可控表演與批次生成;需要低延遲雙向對話、工具呼叫與隨時插話的產品,應另外評估 Gemini Live。
如果這五步跑完,Gemini 3.8 TTS 的 prompt following、返工率與授權流程都能過關,它才真的替你壓縮了有聲書、配音或語音代理人的製作鏈;若只因為「2,000+ 聲線」或一張榜首圖就換供應商,團隊很可能只是把舊的錄音成本換成新的品質與權利債務。
接著閱讀
左右滑動查看更多推薦
最好的下一步不是先做整本有聲書,而是挑一段五分鐘、包含兩個角色與三種情緒轉折的真實腳本:固定 Voice ID,連跑三次,把每一次沒照指令演出的句子、修補時間與授權紀錄都留下來。只要這張小表過不了,規模放大只會把缺陷一起放大。






