跳到主要內容

Eleven v4 Turbo:聲音更有表情,150 毫秒能讓對話更自然嗎?(2026)

最後更新: ·
Eleven v4 官方發表圖與 AlphaLab 編輯標題:更會說話,也更快?

2026 年 9 月 28 日,ElevenLabs 的 Mati Staniszewski 與 Piotr Dabkowski 在官網發布〈Introducing Eleven v4, our most emotive model〉,介紹 Eleven v4 與低延遲版本 Eleven v4 Turbo。最值得拆開看的,是「更有表情」與「更快開口」能否同時成立:前者已有外部聆聽排名,後者目前主要是 ElevenLabs 公布的測試數字。

ElevenLabs 原文頁面,顯示 Eleven v4 發布標題、作者與日期。
點圖閱讀 ElevenLabs 原文;畫面/ElevenLabs,瀏覽器框架/AlphaLab。

先還原發布文的主張,再把外部排名和廠商測試分開看,最後回答做配音或語音 Agent 的人該怎麼驗收。

Eleven v4 的核心主張:聲音要理解情境

A line of text can change significantly depending on how it’s spoken.

中文:同一句文字,說話方式不同,意思與感受就可能大幅改變。

ElevenLabs,〈Introducing Eleven v4〉

原文用「請保持冷靜」舉例:醫師安撫病人與遊戲角色向隊友喊話,字面相同,語氣卻不該相同。ElevenLabs 說 v4 會讀取上下文,調整節奏、情緒與角色聲線;創作者也能用方括號音訊標籤指定低語、笑聲或某種說話方式。官方的提示指南確認這種控制方式存在,同時提醒標籤遵循仍會受聲線與用詞影響。

原文還把多說話者對話、跨語言配音、聲線複製與長篇段落銜接列為改進。模型文件列出 v4 家族支援 90 多種語言,以及一般版與 Turbo 版的不同定位。這證實產品範圍;每種語言的口音自然度、長篇聲線穩定性,仍需要在目標內容上聆聽。

「第一名」與「約 75% 偏好」證據不同

截至 2026 年 9 月 30 日,Artificial Analysis 的 Provider Voice Arena將 Eleven v4 列為第一,Elo 1315、1693 個樣本、95% 信賴區間為 ±18;第二名 Cartesia Sonic 3.6 為 1275。這是外部平台的偏好排名,使用各供應商自己的聲音。它支持「在這個聆聽擂台領先」,卻不能直接推成所有語言、每種配音任務都最好;榜上列的是 Eleven v4,並非 Eleven v4 Turbo。

ElevenLabs 自行公布的盲測圖,v4 對四款對手的偏好勝率為 65% 至 81%。
ElevenLabs 的 2026 年 9 月盲測圖:對四個競品的成對偏好為 65%–81%;圖/ElevenLabs。

發布文另外說,v4 在盲測中約有 75% 聽眾偏好。上圖把四組對手拆開,勝率介於 65% 與 81%。腳註交代同一句台詞成對比較、平手各算半分,但原文腳註未列受測人數、完整語料與原始判分紀錄,無法僅憑腳註重算。因此「約 75%」應當作ElevenLabs 自行公布的結果,不能拿它當獨立驗證。

Eleven v4 Turbo 的 150 毫秒,不等於整段對話延遲

median time to first speech of ~150ms

中文:在其測試條件下,開始有可聽語音的時間中位數約為 150 毫秒。

ElevenLabs,〈Introducing Eleven v4〉
ElevenLabs 公布的首句發聲時間圖,v4 Turbo 為 150 毫秒,其他受測模型為 262 至 814 毫秒。
ElevenLabs 的首句發聲時間比較;同腳本、預設設定、WebSocket 串流,並扣除網路延遲。圖/ElevenLabs。

這張圖的 150 毫秒是 ElevenLabs 在 2026 年 9 月測得的「請求到可聽語音」中位數,Turbo 使用 WebSocket,測量時把各系統的網路延遲扣除。官方模型表另列約 100 毫秒「模型推論延遲」;兩個數字量的是不同邊界,並不互相矛盾。延遲概念文件說明,實際使用者聽到第一聲還受網路往返與播放器緩衝影響;語音 Agent 另有聽寫、輪流發言判斷及語言模型生成的等待。

原文把 Turbo 與 ElevenAgents 當作一起最佳化的系統,這是產品方向,也是供應商對自家系統的主張。要把圖中的速度優勢轉成部署決策,還需要完整測試腳本與跨地區實際通話紀錄;不能把「150 毫秒」寫成每位使用者的端到端回應時間。

我的判讀:真正的門檻在整條聲音工作流

我同意:語氣控制終於成為可選型的能力

配音和客服對話不只要求字句正確。語氣如果錯了,安撫可能變得冷淡,角色對話也會像分開錄好的獨白。v4 的外部偏好排名,足以讓它進入候選名單;音訊標籤與多說話者 API 則讓創作者有可操作的控制點。

我存疑:單一勝率與首聲速度還不能決定上線

擂台上的短音檔偏好、廠商自己的成對盲測,以及語音 Agent 真實對話完成率,是三種不同指標。一次自然的第一句,可能在長篇配音後失去聲線一致性;模型很快開口,也可能在辨識或回話決策階段等太久。v4 與 Turbo 還要分開測,不能把一般版的排名轉給 Turbo。

下一步:用自己的失敗案例決定是否換模型

如果你做有聲書或廣告,拿同一段有情緒轉折的稿,固定聲線、音量與後製條件,比較 v4 與現用模型的咬字、角色一致性和重錄次數。若你做語音 Agent,另外記錄「人說完→系統聽懂→產生回答→第一聲播放」四段時間,並檢查打斷、專有名詞與多語切換。只有作品品質和整段等待都過關,速度宣稱才有實際價值。

接著閱讀

左右滑動查看更多推薦

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。