跳到主要內容

【2026 最新】Gemini 3.8 TTS 繁中配音教學:逐字稿做成雙人 WAV(含費用與驗收)

最後更新: ·
Gemini 3.8 TTS 繁中配音 教學首圖

你手上有一頁繁中訪談逐字稿:主持人問問題,來賓回答。把整頁貼進語音工具,可能很快聽到聲音;但要交給剪輯師,你還得知道誰說哪句、姓名與金額有沒有唸錯、音檔能否正常打開。這篇 Gemini 3.8 TTS 繁中配音教學,就是把這幾件事接成一條可檢查的工作流程。

本文寫給第一次做雙人配音的讀者。你會先用 Google AI Studio 試聲線,再依官方 Gemini API 範例把一份短腳本寫成 WAV,最後用逐段驗收表決定是否返工。就算不寫程式,也能先用前半段的方法整理逐字稿與判斷成品。

先說結論:可交付的雙人配音要過四關

一句話記住:雙人 WAV = 逐句定稿 × 固定角色 × 正確輸出 × 人耳驗收。模型負責把文字變聲音;你負責確認稿件、發音、聲線與權利。把它想成錄音室:逐字稿是台詞,speech_metadata 是給演員的導演提示,WAV 是母帶,驗收表是交件前的校對。

Gemini 3.8 TTS 繁中配音四步流程:逐字稿、角色設定、WAV 與人工驗收
先把四道關卡分開,才知道錯誤該回到哪一步修。

Gemini 3.8 TTS 繁中配音:先選對入口與模型

Google 在 2026 年 9 月推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS。這裡的 TTS 是「文字轉語音」:你提供要朗讀的文字,取得音訊;它與用來即時對談的 Live API 是不同工作流。Google 的官方繁中 TTS 指南列出兩款模型都支援繁體中文與雙人對話,但「支援語言」只是入口條件,不能替你的台灣口音、姓名或數字保證品質。

  • AI Studio:從Google AI Studio進入語音測試,先試聽預設或擴充聲線。這適合決定角色聲音與驗證短稿;實際按鈕以登入後介面為準。
  • Gemini API:從 AI Studio 建立專案與 API key,再由程式送出結構化的逐句台詞,適合反覆輸出、留版本與核算成本。金鑰屬於專案,存成環境變數 GEMINI_API_KEY,不要貼進逐字稿或公開程式庫。可依官方 AI Studio 入門取得金鑰。
  • 選 Flash 還是 Flash-Lite:先用 Flash-Lite 做草稿,正式配音若在難字、情緒或方言上需要更細緻的控制,再用同一份腳本比較 Flash。兩款使用相同 API 結構;價格不同,聲音好壞仍要聽同一段稿判斷。

開始前打開 AI Studio 的專案方案與用量頁。Google 計費指南說明免費與付費專案的資格;價格頁也區分兩種級別的資料使用方式。工作稿若含未公開的人名或客戶內容,先確認你使用的是哪個專案與級別,再決定要送入哪些文字。

第一關:把逐字稿整理成「一人一句」

不要把「主持人:」「來賓:」直接當成要朗讀的台詞。Gemini 3.8 把 text 視為逐字稿;說話者要放在每回合的 speech_metadata.speaker,語氣放在 style。一頁原稿先拆成短回合,順序與標點固定,讓你聽到錯誤時能回頭定位那一句。這也是官方雙人請求範例使用的結構。

例如這段示範腳本,先保留一個需要驗收的姓名、一個需要驗收的數字與一個停頓:「主持人:林以安,今天先看二○二六年九月的報告。來賓:好,第三季收入是新台幣一千二百萬元。<short pause> 我們先核對單位。」這些名字和數字是練習素材,不是任何公司的真實財報。

  • 姓名:把容易多音的字另列「預期讀音」,試聲時只改該回合,不必重做整篇。
  • 數字:稿面若寫 12,000,000,先決定成品要唸「一千二百萬」還是逐位唸;幣別、年份、百分比也各記一行。
  • 口音:把「繁體中文文字正確」與「台灣口音自然」分成兩項。前者可對稿;後者要找熟悉該口音的人試聽,同一位說話者至少跨兩段比較。

第二關:設定兩位講者、語氣與停頓

雙人模式像配音名冊:先在 speech_config.speakers 指定 Host 與 Guest 對應的預設聲線,再讓每個回合的 speaker 與名冊完全一致。官方範例採 mode: conversational,同一請求最多兩位說話者。第一次先用預設聲線 Puck 與 Kore,便於排除自訂聲線帶來的變數。

style 調整整句的演法,例如 calm and clear;<short pause> 放在台詞中,表示那一個位置的短停頓。官方建議非英文逐字稿仍使用英文行內標記。不要把「用台灣口音、聲音永遠一致」寫成冗長指令塞進每句;先試選適合的聲線,再用少量風格提示微調。

第三關:照官方 API 結構輸出雙人 WAV

以下範例沿用Google 的 Python 雙人 TTS 請求,只把英文台詞改成上面的練習稿。先裝官方 SDK:python3 -m pip install -U google-genai。依官方入門頁設定 GEMINI_API_KEY 後,把下列程式存成 make_voice.py,執行 python3 make_voice.py。SDK 依環境變數取金鑰;程式不把金鑰寫在檔案裡。

import base64
from google import genai

client = genai.Client()
lines = [
    ("Host", "林以安,今天先看二○二六年九月的報告。", "calm and clear"),
    ("Guest", "好,第三季收入是新台幣一千二百萬元。<short pause> 我們先核對單位。", "warm and steady"),
]
content = [
    {"type": "text", "text": text,
     "annotations": [{"type": "speech_metadata", "speaker": speaker, "style": style}]}
    for speaker, text, style in lines
]
interaction = client.interactions.create(
    model="gemini-3.8-flash-tts",
    input=[{"type": "user_input", "content": content}],
    response_format={"type": "audio"},
    generation_config={"speech_config": {
        "mode": "conversational",
        "speakers": [
            {"speaker": "Host", "voice": "Puck"},
            {"speaker": "Guest", "voice": "Kore"},
        ],
    }},
)
with open("dialogue.wav", "wb") as file:
    file.write(base64.b64decode(interaction.output_audio.data))
print("已儲存 dialogue.wav")

這份最小範例專注在請求結構:它省略了正式系統需要的逾時、重試、空回應檢查與安全記錄。若要批次製作,請依官方 API 錯誤說明處理失敗請求。Gemini 3.8 的一般非串流請求預設回傳帶 RIFF 標頭的 WAV;把解碼後的資料直接寫檔即可。舊版 TTS 教學常把原始 PCM 再包一次 WAV 標頭,照搬到這裡會弄壞音檔。

存檔後先確認播放器能打開;懂終端機的讀者可用 file dialogue.wav 檢查檔案類型,再用 ffprobe dialogue.wav 檢查取樣率、聲道與時長。播放器打得開,也只代表容器可讀;內容、口音與說話者仍要聽。若你改走 stream=True,官方說明串流預設回來的是沒有 WAV 標頭的 PCM 區塊,不能把那一路的位元組直接改名成 .wav。

第四關:Gemini 3.8 TTS 繁中配音如何驗收?

把每個回合編號,建立四欄工作簿:原句/聽到的內容/問題位置/處置。先盲聽一次,不看逐字稿;再逐句對稿一次。每次重做只改一個變數,例如先修文字數字,再調聲線,不要同時換模型、口音和語速,否則無法知道哪項有效。

  • 文字忠實:姓名「林以安」、年份「二○二六」、金額「一千二百萬元」各圈出來;若漏字、加字或數字讀錯,標回合並修稿。
  • 聲線分工:Host 與 Guest 在開頭、中段、結尾是否仍分得出來?若交換或漂移,記下時間點與原始設定。
  • 台灣口音:找熟悉目標口音的聽者,記具體詞句與偏差;不要只寫「不自然」。必要時改選聲線或用語音設計建立角色。
  • 停頓與剪輯:停頓是否落在標記處、是否拖太久、句尾是否被切斷?檢查整段時長與安靜片段,再決定重做哪一段。
  • 檔案交接:交付 dialogue.wav、定稿逐字稿、角色與模型設定、返工紀錄。若有聲音授權,保存同意與使用範圍紀錄。

費用、免費額度與聲音複製的邊界

截至 2026 年 9 月 26 日,Google 的Gemini API 價格頁列出 2026 年底前的付費標準:Flash TTS 文字輸入每百萬 token 0.50 美元、音訊輸出 9 美元;Flash-Lite TTS 文字輸入同為 0.50 美元、音訊輸出 6 美元。Google 以每秒音訊約 25 個 token 作換算。假設成品剛好 3 分鐘,單算音訊輸出約 4,500 token,Flash 約 0.0405 美元,Flash-Lite 約 0.027 美元;文字輸入、重試與返工另計。這是價格公式示例,不是本篇生成音檔的帳單。專案目前可用的免費額度與速率限制,應到 AI Studio 的方案及限制畫面核對。

若只要兩位虛構主持人,先用預設或語音設計的聲線。若要複製真人聲音,Google 要求參考音訊與聲音本人另外提供的同意錄音;你也應保存授權範圍及可撤回安排。尤其要分清:官方單次雙人請求只支援預設聲線。要讓兩位複製或自訂聲線對話,依官方限制逐回合各自合成,再在剪輯軟體對齊、合併;不要把兩個 voice_... ID 塞進上面的雙人設定後期待同一請求成功。真人聲音不是本篇範例的必要材料。

常見問題:從試聲到交件

1.一定要會寫程式嗎?

試聲不用。先在 AI Studio 選模型、角色與短稿;需要固定結構、留版本並批次輸出時,再使用 API 範例。

2.可以直接上傳一份文字檔嗎?

先把內容拆成回合。本篇示範的 API 以文字項目與說話者中繼資料送入;文字檔可當你的原稿保存,複製內容前先整理角色及數字讀法。

3.為什麼「主持人:」被唸出來?

角色標籤放錯位置。把說話者放進 speech_metadata.speaker,台詞 text 只留想讓聽眾聽到的字。

4.台灣口音能靠一句提示詞保證嗎?

不能保證。先挑接近目標的聲線,拿固定的姓名與數字題試聽;在驗收表記具體讀音,再比較其他聲線或模型。

5.為什麼 WAV 打不開?

先分清回應格式。一般請求預設是完整 WAV,直接存解碼資料;串流預設是原始 PCM。也要檢查程式是否拿到實際音訊資料,避免把空回應當音檔。

6.三分鐘的費用就是 0.0405 美元嗎?

不是完整帳單。那只是假設 3 分鐘、Flash 付費級別、2026 年底前價格的輸出音訊換算;輸入文字與重做次數要另外記。

7.雙人對話能用兩個複製聲線嗎?

同一次雙人請求依官方限制要用預設聲線。自訂或複製聲線的兩角色成品,分回合生成後再剪接,並保留聲音使用同意。

8.長篇有聲書要怎麼開始?

先用短章節建立驗收基準。固定聲線、模型、逐字稿格式與計價紀錄;每章先通過姓名、數字、聲線、停頓四項,再擴大製作。不要把單段成功直接推論成數小時成品穩定。

給新手的三個重點

  1. 先選兩個預設聲線,用兩回合短稿證明角色分工與檔案輸出。
  2. 把「台詞」「說話者」「語氣」「停頓」放在各自的欄位,別用一大段提示詞混寫。
  3. 每次重做都留原檔、設定與問題位置;只有可追溯的驗收,才談得上可交付。

接著閱讀

左右滑動查看更多推薦

下一步:先交一份能核對的 20 秒樣片

拿上面的兩句練習稿,先在 AI Studio 試聽兩個角色,再用 API 寫出 dialogue.wav;把姓名、年份、金額、停頓與聲線逐項標在驗收表。全數通過,才把腳本擴成一頁。想把製作流程接到更多 AI 專題,也可以從 AlphaLab 課程挑一條適合自己的學習路線。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。