想做 VoiceStudio 本機配音,最危險的捷徑不是少按一個按鈕,而是把「免費開源」誤讀成「任何聲音都能複製、任何成品都能商用」。這篇以 2026 年 9 月 4 日的官方資料與最新穩定版 v0.5.1 為基準,帶你從硬體檢查、取得同意、60 秒影片轉錄與翻譯,一路做到多角色配音、最多三個實際顯示 available 的候選引擎 A/B 與授權驗收。完成後,你拿到的不只是一支能播放的影片,還有一份能說明怎麼做、用什麼做、為什麼可以交付的收據。
本文依 v0.5.1 官方文件、程式與目前公開頁面整理;本次查核沒有下載數 GB 模型或完成端到端本機執行,因此不提供 AlphaLab 自測的音色、延遲或記憶體數字。下列介面流程已和官方資料交叉核對,效能與繁中成品仍要用你的環境卡實際驗收。
VoiceStudio 本機配音先說結論
- 先用短片完成閉環:第一次只做 60 秒、最多兩位已同意的說話者;先求每句可懂、時間對得上,再拉長影片。
- 本機不等於全程離線:模型下載、選用線上翻譯、遠端 worker 或外部 ASR 都會用到網路;要留在本機,就選 Argos/NLLB 與本機引擎。
- App 授權與模型授權是兩張票:VoiceStudio 應用程式採 AGPL-3.0,但預設 OmniVoice 的預訓練權重標示 CC-BY-NC;商用成品不能只看 App 的授權。
- 別相信跨機器的單一速度數字:官方 benchmark 頁截至本文查核日仍沒有 verified row。本文提供同機、同素材、只換引擎的驗收方法,不冒充已完成的硬體跑分。
一句話記住本文的錨點:可交付配音=本人同意 × 模型授權 × 成品驗收。這是乘法,不是加法;任何一項為零,輸出再像也先不要交付。

VoiceStudio 是什麼?適合哪種創作
VoiceStudio 官方專案是一套 local-first 桌面語音工作室,把聲音複製、voice design、轉錄、翻譯、分角色配音與影片輸出放在同一個介面。官方目前列出 16 個 TTS、11 個 ASR 與 646 種語言的 catalogue;這個數字是可選語言目錄,不代表每個引擎對每種語言都有相同品質。2026 年 9 月 4 日 07:06(台北)的 GitHub weekly Trending 快照顯示它一週新增 2,511 stars,代表按星關注熱度,不是安裝量或品質證明。
它最適合固定會重複製作的內容,例如教學影片、產品操作、內部訓練或自己有權使用的角色聲音。若你還要把配音接到數字人口播,可先看 AI 數字人口播完整教學;若目標是從腳本到剪輯的一整條製作線,延伸閱讀 Claude Code AI 影片工作室。VoiceStudio 的功能重心是語音生成與依時間槽安排音軌;官方競品分析也明說,目前不提供重算人物嘴部畫面的 facial lip-sync,影片剪輯與素材清權仍要另做。
繁中也要單獨驗收:v0.5.1 有繁體中文介面選項,但部分字串仍可能回退英文;上游中文能力不能直接證明台灣華語韻律、姓名與單位都自然。把繁中姓名、數字、英文縮寫與台灣常用語放進固定測試句,才是這篇所說的「可懂」。
VoiceStudio 本機配音:安裝前先做硬體 preflight
不要直接從 main branch 建置。官方仍把專案標為 Active beta;對第一次使用者,先從 v0.5.1 tagged release 下載穩定包,並在工作紀錄寫下版本。這個 release 發布於 2026 年 8 月 28 日;GitHub 介面顯示 Apple Silicon DMG 約 105 MB、Windows MSI 約 162 MB、Linux AppImage 約 226 MB。那只是安裝包,官方安裝文件另列預設 TTS 權重約 2.4 GB,完整環境仍要預留更多空間。v0.5.1 是穩定 release,不代表每種硬體組合都完全無錯;正式案前仍要跑短片。macOS DMG 是 ad-hoc signed、尚未 notarized,下載後先對照 release 的 SHA256SUMS,首次啟動再依官方步驟用右鍵選 Open。
- macOS:官方最低為 macOS 13.3、Apple Silicon。Intel Mac 可開 UI,但官方安裝文件明確說本機 Python backend 不受支援,需連遠端 backend。
- Windows:Windows 10/11 x64 使用 MSI;NVIDIA 可走 CUDA。官方需求頁把 Windows 上的 AMD 列為 CPU 路徑。
- Linux:x86_64 且 glibc 2.39+ 使用 AppImage;沒有 NVIDIA GPU 仍可走 CPU。
- 共同底線:最低 8 GB RAM、10 GB 可用空間;官方建議 16 GB RAM、20 GB 以上 SSD。使用 GPU 時表列最低 4 GB VRAM,但預設 OmniVoice 的引擎頁另建議約 6 GB,較大的選配引擎可能需要更多。
先建立一張環境卡,至少填入:作業系統與版本、CPU/GPU 型號、RAM、VRAM、可用磁碟、VoiceStudio 版本、TTS/ASR 引擎、模型 revision、首次下載時間、第一次生成時間、暖機後生成時間。第一次包含下載與載入,不能拿來和第二次生成混成一個速度數字。若你想理解本機 ASR/TTS API 的底層關係,可搭配 NeMo-Speech.cpp 本機語音 API 教學。
安裝完成先跑 60 秒 smoke test,再接客戶專案。桌面 App 預設連到 localhost:3900 的 loopback API,官方架構說 loopback 請求不需 server key;不要把這個埠直接轉發到公網。需要從其他裝置連線時,依 官方 API authentication 文件設定 API key,並放在 TLS reverse proxy 或受控 tailnet 後面。六位數 share PIN 只保護部分 HTTP consumption 路徑,不能授權管理操作或 remote dictation。
7 步完成一支 60 秒多角色配音
步驟 1:先定義「可以用這個聲音做什麼」
只使用自己的聲音,或取得說話者可保存的明確同意;把允許用途、影片名稱、語言、通路、期限與撤回方式寫清楚。VoiceStudio 的 .ovsvoice persona 可攜帶 consent attestation 與 SPDX license metadata,但官方文件也說授權欄位只是 metadata,App 不會替你執行條款。換句話說,介面裡的 verified-own-voice 是流程證據,不是替代外部授權文件的萬能通行證。
發佈平台還有自己的揭露規則。以 YouTube 官方說明為例,複製自己的聲音做旁白或配音列為通常不必揭露;讓真實人物看似說了本人沒說過的話則須揭露。平台標示與聲音授權是兩件事:勾選 AI 揭露不會自動取得對方同意。
步驟 2:預設 OmniVoice 準備 3–10 秒乾淨參考音
每位角色各準備一段單人、無音樂、少回音、音量穩定的錄音,並保存逐字稿。VoiceStudio 通用指南說 3 秒可運作、5–15 秒通常較佳;但預設 OmniVoice 的模型專屬建議是 3–10 秒,並警告更長可能變慢、增加記憶體用量並降低複製品質。因此先從 8–10 秒開始;換引擎時再依該引擎文件調整,不要把多人對話或整段背景音直接丟進 profile。
步驟 3:建立 voice profile,先生成一句固定測試句
開啟 Voice Cloning,上傳參考音與對應文字,為 profile 加上可辨識名稱。固定一段包含人名、數字、中英混合與停頓的測試句;以後換引擎仍用同一句。先聽有沒有漏字、奇怪重音、金屬尾音或爆音,再進影片流程。不要因為「像」就放行,聽不清楚的數字在教學影片裡比音色差一點更致命。
步驟 4:上傳 60 秒影片並修正轉錄
進入 Dub 工作區,上傳影片、指定來源語言與預期說話者數量,再執行轉錄。先逐句修人名、品牌、金額、網址與縮寫,因為錯誤原文會一路污染翻譯與語音。兩位說話者的素材還要核對每段 speaker 是否分對;VoiceStudio 的完整 diarization 需要 Hugging Face token,並接受 pyannote 兩個 gated model 的條款,首輪約下載 600 MB。若不可用,官方文件說會退回 silence-gap heuristic;快速搶話或音高相近的兩人可能被合併,因此警告 toast 出現時要人工重看角色。
步驟 5:翻譯時先守住時間槽
要留在本機,可先用內建 Argos(快)或 NLLB-200(較重);Google、DeepL、Microsoft、外部 LLM 等路徑可能需要套件、金鑰與網路。本機不等於可商用:內建 NLLB-200 權重標示 CC-BY-NC-4.0;Argos Translate 程式雖採 MIT,另下載的語言模型仍要保存並核對實際 .argosmodel 的 metadata 與來源。
已有人工譯文時,可用 Paste Translation 貼入 SRT、VTT、編號或逐行文字,沿用原分段與時間。翻完逐句確認專有名詞、語氣與數字,並主動縮短塞不進時間槽的句子。Cinematic/Autofit 需要 LLM,未設定時官方文件說會退回 Fast,因此不要只看模式名稱就以為品質步驟已執行。
步驟 6:替每位 speaker 指定 profile,再生成 Dub
在 casting 區逐一指定 Speaker 1、Speaker 2 對應的 voice profile,確認沒有角色互換後再 Generate Dub。若某句翻譯改過,只重生 stale/changed segment,避免整支片重算。時間策略先以不破壞語句為優先:過長就先改短譯文,最後才考慮加速語音或延長影片。段落時間對上不等於嘴型精準對上;需要近距離口型的廣告片,仍要另外逐鏡驗收或進專門 lip-sync 流程。

步驟 7:匯出前做一次「靜音觀看+閉眼聽」
先靜音看字幕與角色切換,再閉眼只聽配音,最後合起來看同步。官方 export 文件允許保留原音與一個或多個 dubbed tracks,並選擇預設軌;第一次交付建議保留 Original 供覆核。另存最終檔、字幕、譯文、環境卡與同意文件,對輸出檔計算雜湊;這才是可以重做與追責的版本,而不是 Downloads 裡一個叫 final-final.mp4 的孤兒。
三個引擎怎麼 A/B:先比品質,再談速度
第一輪可以把預設 OmniVoice、VoxCPM2、CosyVoice 3 列為候選,但先以 Model Catalogue 的即時 available 狀態篩選。VoxCPM2 需另裝 voxcpm>=2.0.3。CosyVoice 的官方文件目前互相矛盾:v0.5.1 tagged engine guide 說可在 Model Catalogue 安裝;2026 年 9 月 4 日的 main engine guide 則明確說 packaged App 沒有受支援的一鍵 runtime 安裝路徑,下載權重也不代表 backend 能 import。對 v0.5.1 packaged build 不應承諾可用;若 Re-check 仍顯示 unavailable,就換其他 ready engine。

- 固定輸入:同一支 60 秒片、同一份修訂譯文、同一組參考音、相同輸出格式。
- 只換一個變因:切換 TTS engine;不要同時改 seed、翻譯、時間策略與聲音樣本。
- 分開冷啟動與暖機:第一次記模型載入/下載,第二次才記生成時間;RAM/VRAM 只比較同一台機器。
- 盲聽:把 A/B/C 重新命名,請未參與設定的人評 1–5 分的可懂度、音色相似、自然度;另逐段記錄時間偏差、漏字、截尾與爆音。
- 先寫放行線:本文建議的 60 秒起始門檻是人名與數字零錯、沒有截尾/爆音、每段都在你事先設定的同步容差內;品質同分時,再選較省時間與記憶體者。
想把主觀聽感變成可重跑流程,可沿用 Voice Agent Eval 的錄音驗收方法。官方 evaluation 文件另提供 WER/CER、speaker similarity 與 UTMOS,但那些需要額外測試集與模型;新手的第一支成品先做好盲聽與錯誤清單,比抄一個不屬於自己硬體的分數更可靠。
授權矩陣:為什麼預設引擎的商用流程要先停下審核
v0.5.1 License Notice 說明 App 本身採 AGPL-3.0,包含商業與內部使用;若你修改後透過網路提供服務,會觸發對應原始碼義務。該版摘要曾把輸出商用寫得很寬,目前 main 的 Notice 已明確補充:App 授權不會授予或概括模型、tokenizer 與第三方資產權利。因此本文只把 AGPL 結論用在 App,不用它替權重、影片、音樂或人物聲音授權。
關鍵差異在預設模型:k2-fsa/OmniVoice 官方 model card 把程式列為 Apache-2.0、預訓練模型列為未註明版本的 CC-BY-NC,卻沒有說明生成音訊的授權歸屬;公司內部使用也不當然屬於 NonCommercial。其 audio tokenizer license 另附 Boson Higgs Audio 2 Community License Agreement,並納入 2024 年 4 月 18 日版 Meta Llama 3 Community License/AUP。若由被授權人、為被授權人,或由其關係企業提供的產品/服務,在前一曆年的年度活躍使用者大於 100,000,條文要求向 Boson 申請 expanded license,且在 Boson 明確授權前不得行使該協議權利;產品/服務使用 Higgs Materials 時另有顯著署名等條件。完成具體用途審核並確認有權使用、必要時取得額外許可前,不應把這組模型直接納入商業流程。
VoxCPM2 model card 明列程式與權重採 Apache-2.0、可商用;card 的使用指引另要求避免冒用、詐欺與錯誤資訊,並清楚標示 AI 內容。CosyVoice 3 checkpoint 的 license metadata 是 Apache-2.0,runtime repo 也採 Apache-2.0;但 checkpoint 沒有獨立 weights license,card 另有「above content for academic purposes」的含糊說明。兩者都只是待完成 revision、依賴、聲音與素材審核的候選;CosyVoice 還要釐清那段文字的範圍。
AudioSeal 也不是授權捷徑。VoiceStudio 會嘗試替 persona preview 加 AudioSeal,但程式採 fail-open;依賴缺失或嵌入失敗時可能仍輸出未標記音訊,manifest 欄位也不是偵測證明,交付前應對實際檔案另做偵測。浮水印不能證明聲音主人同意,也不能解決生成時使用該模型的授權風險。商業交付若改用已完成授權審核的模型重新生成,是較保守、可稽核的流程;不能把它寫成上游已明定的唯一法律結論。
交付前的 8 項驗收清單
- 每位說話者都有可保存的同意範圍,角色與 voice profile 對得上。
- VoiceStudio 版本、TTS/ASR 引擎、模型 ID 與 revision 已記錄。
- App、模型權重、tokenizer/依賴、原影片、音樂與字型分層核對。
- 譯文中的人名、品牌、金額、單位與專有名詞逐句核對。
- A/B 使用同一輸入,冷啟動與暖機後數字分開。
- 沒有漏字、截尾、爆音;背景音沒有被人聲處理誤傷。
- 字幕、聲音與角色切換都落在專案事先設定的同步容差內。
- 匯出檔、字幕、譯文、同意文件、環境卡與檔案雜湊一起封存。
如果影片還要進剪輯或生成式畫面流程,可參考 AI 影片剪輯工具比較與 可反覆編輯的 AI 影片工作流;重點是讓音軌、字幕與畫面都能回到同一個版本編號。
常見問題 FAQ
1. VoiceStudio 真的免費嗎?
核心 App 沒有帳號、訂閱或用量表,但總成本不等於零。你仍要負擔硬體、電力、模型下載、人工修稿與可能使用的外部翻譯/LLM 費用。
2. VoiceStudio 產出的配音可以商用嗎?
不能只看 VoiceStudio 的 AGPL-3.0 就回答可以。上游只把預設 OmniVoice 預訓練模型標成 CC-BY-NC,沒有明說輸出是否承接 NC;不能僅憑 model card 推定每支成品一定受 CC-BY-NC,但商業使用該模型本身有明顯授權風險。商用前應暫停並完成具體用途的條款審查,必要時取得額外許可;改用已審核 revision 重新生成是較保守、可稽核的流程,同時仍要處理人物、腳本、影片與音樂權利。
3. Intel Mac 可以在本機跑嗎?
官方 v0.5.1 安裝文件的答案是不支援本機 backend。Intel Mac 可把 UI 指向另一台機器的 remote backend,或改用 Apple Silicon、Windows、Linux。
4. 沒有 GPU 能做 VoiceStudio 本機配音嗎?
可以走 CPU,但是否實用取決於引擎與影片長度。先用 60 秒素材測第二次生成時間與記憶體,再決定要不要換 GGUF/輕量引擎或遠端 GPU;不要從別人的 GPU 跑分推算自己的交付時間。
5. 三秒聲音樣本真的夠嗎?
官方說可運作,但第一次建議從乾淨的 8–10 秒開始。品質通常更受單一說話者、低回音、無音樂與正確逐字稿影響;更長不必然更好。
6. 它能完全離線嗎?
模型裝好且選本機引擎後,核心流程可以留在本機;但不是所有功能都離線。線上翻譯/LLM 會送出逐字稿或文字,remote ASR/worker 可能送出音訊或參考素材;首次下載需要連線。選擇性 analytics 預設關閉,開啟後依官方說明只送 allowlisted、content-free 使用 metadata,不送文字、音訊、檔名或專案。
7. 多角色辨識會自動準確嗎?
不會,尤其是搶話、相近音高與 diarization fallback。先用最多兩人短片,接受 pyannote 模型條款並檢查 speaker 標籤;角色切錯時人工修正,不要讓錯誤 profile 一路生成。
8. 可以拿名人或網路影片來複製聲音嗎?
沒有明確同意就不要做。公開可聽不等於允許建立聲音替身;本文流程只把你自己或取得授權的聲音放進 clone 與交付。
給新手的 6 個重點
- 從 tagged release 與 60 秒素材開始,不從 main 與長片開始。
- 先取得同意,再錄參考音;profile 名稱不能取代授權文件。
- 先修轉錄與譯文,再燒 GPU;錯字會被漂亮地念錯。
- App、模型權重、tokenizer 與素材授權要分層核對。
- A/B 只換一個變因,第一輪載入與第二輪生成分開記。
- 真正的完成不是按下 Export,而是同意、授權、品質與版本收據全部到齊。
接著閱讀
左右滑動查看更多推薦
下一步:做出第一份可交付收據
現在先不要挑一小時影片。找一支你擁有權利、只有一到兩位說話者的 60 秒素材,下載 v0.5.1,填好環境卡與同意範圍;先按具體用途核對模型條款,商用流程不要在審核前啟用預設模型,再把同一份輸入交給實際 available 且已完成審核的候選引擎。最後回到那條乘法:本人同意、模型授權、成品驗收,三格都能拿出證據才交付。想把這套方法延伸到更多 AI 製作流程,可繼續逛 AlphaLab AI 專區或 系統化課程。





