跳到主要內容

Tavus Griffin:公司測試 48% 誤認真人,證據到哪裡?(2026)

最後更新: ·
Tavus Griffin 即時視訊對話:鏡頭對面真的是人?

2026 年 10 月 1 日,Tavus 共同創辦人 Hassaan Raza、研究主管 Ioannis Patras 與研究團隊在官網發布了〈Griffin: The First Human Interaction Model〉。這篇 Tavus Griffin 研究文最吸睛的數字,是公司安排的一分鐘視訊通話中,54 人有 26 人認為對面是真人。它值得讀,但「有人看錯」與「AI 已能像人一樣可靠地交談」之間,還隔著幾道需要拆開的問題。

Tavus Griffin 官方研究文章頁面截圖;點圖閱讀原文
點圖閱讀 Tavus 原文。畫面/Tavus;瀏覽器框架/AlphaLab。

先看 Tavus 想改變什麼,再核對它拿出的兩種證據:公司自己的真人辨識研究,以及 NVIDIA 的對話基準;最後再問,這種能力要怎樣安全地進入產品。

Tavus Griffin 想解決的,是「何時接話」

一般語音加虛擬人的流程,往往先等你說完,再把語音轉文字、交給模型作答,最後合成聲音和表情。Tavus 認為,這種接力在停頓、插話、眼神與手勢上會露出機械感;人與人交談時,這些訊號原本就在同時發生。

Perception never stops while the PAL speaks.

中文:即使螢幕裡的 AI 正在說話,它仍持續觀察與聆聽對方。

Tavus Research,〈Griffin: The First Human Interaction Model〉

原文把 Griffin-Lite 描述為全雙工的視訊對話系統:一個「持續對話建模」部分讀取聲音與影像,反覆決定該說話、點頭、等待還是讓出話語權;另一部分把控制訊號即時轉為聲音與畫面。這是 Tavus 對架構的公開描述,與實際通話品質的量測需分開看。重點是聽、看、決定與生成可以重疊,而非只把一張臉貼在既有語音助理上。

Tavus Griffin 系統圖:聲音與影像持續進入對話模型,控制訊號驅動串流語音與影像生成
原文的系統圖:觀察、決定與生成同時進行;這是架構示意,並非獨立量測的反應時間。圖/Tavus Research。

技術細節也服務這個目標。Tavus 說語音生成能以短音訊封包串流輸出,影像端則以時間壓縮後的片段連續生成 720p 畫面,讓表情與回應較快跟上對話。原文某些時間軸圖明說是示意,不能把圖上的節奏直接當成真實通話延遲。

26/54:一分鐘內的辨識結果,不能外推成普遍「通過測試」

Of the 54 participants who spoke with Griffin-Lite, 26 believed their partner was a real person.

中文:與 Griffin-Lite 通話的 54 名參與者中,有 26 人相信對方是真人。

Tavus Research,〈Griffin: The First Human Interaction Model〉

這是 Tavus 自行設計並公布的研究。原文說,參與者由獨立招募平台找來,事先被告知會與另一名參與者視訊,談今年期待的事;通話約一分鐘,最後才被問是否想過對面可能不是人。Tavus 回報 Griffin-Lite 組為 26/54,約 48%;它先前的 Phoenix-4.5、Sparrow-2、Raven-1 系統,在相同流程下為 1/41,約 2.4%。這兩組是不同參與者,因此百分比差距不能直接解讀為同一批人的個體進步。

Tavus 公司研究圖:Griffin-Lite 54 人中 26 人認為是真人,前代系統 41 人中 1 人
Tavus 的一分鐘視訊研究圖;48% 與 2.4% 是公司在指定情境下回報的受試者答案。圖/Tavus Research。

這個設計同時解釋了數字為何值得關注、又為何有邊界。人們本來就被告知會與人通話,話題短、對象固定,問題直到調查尾聲才揭露。它測到的是這批人在這種期待與一分鐘接觸下的判斷;沒有證明不同語言、較長談話、事先知道可能遇到 AI,或要求對方完成複雜任務時也會得到同樣比例。原文稱它「通過即時視訊圖靈測試」,那是 Tavus 為自家實驗下的結論;有效範圍仍是前述指定流程,不能當作跨場景的通用標準。

原文另外回報七分制「對話流暢」平均 4.9 分,是列出的五項體驗指標中最低的一項。這個細節比單看 48% 更有用:短暫以為對方是真人,不表示對話每個面向都已自然,更不表示內容一定正確。

NVIDIA 的榜單支持「互動表現進步」,驗的不是「會不會騙過人」

另一組證據來自 NVIDIA Research 的 VideoFDB 榜單。它以 237 段真人雙人視訊片段、11 類非語言互動情境,分開評估模型讀懂對方的「感知」與自己產生反應的「生成」;分數由語言模型依規則評判。榜單列出 Griffin-Lite 的生成總分 3.83/5、感知總分 3.73/5;對照的人類參考分別是 3.92 與 4.20。這確認 Tavus 所引的兩項榜單數字確實出現在 NVIDIA 的頁面。

Tavus 原文引用 VideoFDB 生成分數:Griffin-Lite 3.83,人類參考 3.92,對照系統 2.80
Tavus 對 VideoFDB 生成軌分數的圖示;數字可在 NVIDIA Research 的榜單核對。圖/Tavus Research。

但榜單回答的是固定片段上的回應品質與時間配合,不是陌生人長時間通話後是否會認錯身份。生成軌的比較對象也比感知軌少;不能把「目前榜單中領先」寫成「所有視訊 AI 都已被擊敗」。VideoFDB 的原始研究本身指出,許多系統在視覺訊號與接話時機上仍有缺口。這讓 Griffin-Lite 的榜單位置有意義,也提醒我們評分器與真實使用者不是同一件事。

AlphaLab 的判讀:真正改變的是信任介面

我同意:把時機放進模型,確實切中視訊助理的弱點

對話不是輪流朗讀文字。點頭太晚、在思考停頓時搶話,或眼睛看著零件卻只回答逐字稿,都會讓系統顯得遲鈍。Tavus 的兩部分設計,把「下一句說什麼」與「現在是否該說」放進同一條持續更新的決策路徑。NVIDIA 榜單中的非語言互動評分,給了這個方向一個比宣傳影片更具體的外部座標。

我存疑:一次短通話不能定義真人感,更不能定義可靠性

48% 是 Tavus 自家研究的觀察值,並不是一種固定的模型能力常數。換掉受試者期待、談話長度、語言、人物形象或問題難度,辨識比例可能改變;因此,在外部團隊以同等流程重做之前,應把 48% 留在 Tavus 這項實驗的範圍裡。更關鍵的是,讓人覺得對方「像人」與讓人得到「正確、可驗證的幫助」是兩條不同的品質軸。

推出產品前,揭露身份要與自然互動一起設計

Tavus 在原文承認這種擬真能力也可能用來誤導,並表示截至 2026 年 10 月 1 日,Griffin-Lite 只向選定的可信測試者提供研究預覽,尚未向一般客戶開放;團隊正在研究安全揭露方式。這個限制是有實質意義的。若產品的價值正來自人們可能誤認對面是真人,使用者何時、以何種方式知道自己正在與 AI 對話,就不該等到部署後才補上。

接下來怎麼判斷 Tavus Griffin

對研究者與產品團隊,下一輪最值得看的不是更大的「真人誤判率」,而是公開測試流程、不同語言與較長通話的表現、打斷與沉默的失敗案例,以及清楚揭露 AI 身份後的任務完成率。對一般使用者,視訊裡的表情與即時接話可以增加臨場感,卻不該單獨成為確認對方身份的依據;涉及金錢、帳號或敏感資訊時,改用你原先就知道的獨立聯絡管道核對。

Griffin-Lite 已讓「畫面另一端看起來像真人」成為需要實際測量的產品問題。等 Tavus 公開更長、更可重複的測試與身份揭露設計,才有辦法判斷這項進步會帶來更好的協助,還是只帶來更難察覺的偽裝。

接著閱讀

左右滑動查看更多推薦

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。已訂閱?管理主題偏好(會寄登入連結到你的信箱)