跳到主要內容

Waymo 5nm ASIC 深度解讀:1,000 TOPS 只是系統一角(2026)

最後更新: ·
Waymo 5nm ASIC 官方照片搭配「1,000 TOPS 只是系統一角」標題的 AlphaLab 封面圖

Waymo 5nm ASIC 這次公開了官方照片與「超過 1,000 TOPS」細節。但真正值得看的,不是做出一個更大的 TOPS headline,而是 Waymo 把感測器、演算法、散熱、冗餘與專用運算綁成同一個工程問題。若只截取 TOPS,反而會錯過這次公開最重要的訊息。

2026 年 8 月 20 日,Waymo 工程副總裁 Satish Jeyachandran 與 Compute Lead Daniel Rosenband 發表車載運算架構說明。本文先忠實還原它公開了什麼,再逐一查證 1,000 TOPS、13 路相機、雙運算引擎與安全表現,最後給出 AlphaLab 的獨立判讀。

Waymo 2026 年 8 月 20 日車載運算工程文章的瀏覽器截圖
Waymo 於 2026 年 8 月 20 日公開車載運算架構;點圖前往原文。圖/Waymo

Waymo 5nm ASIC 公開了什麼?

Waymo 描述的是一套放在車上的異構運算系統。它要在震動、溫差與有限空間裡持續運作,並把決策留在車端;硬體接入車輛液冷系統。公司把 compute 描述為「兩套獨立引擎」:平時作為一個單元執行完整平行 workloads,一側故障時由另一側接手。公開稿未說明超過 1,000 TOPS 是單一引擎還是兩套冗餘引擎合計;即使包含重複容量,也不能直接解讀成可承擔兩倍不同工作的有效吞吐。

其中,客製 5nm ASIC 的位置更接近「感測前端協處理器」。它接收原始 lidar、radar 與 camera 資料,負責前處理、特徵提取、低光 temporal denoising,以及部分 sensor-fusion ML,之後才把資料交給核心 ML 系統。換句話說,它不是整台車唯一的中央大腦,也不是完整車載電腦的總算力規格。

Waymo 公開的 purpose-built 5nm ASIC 官方照片
Waymo 公開的 purpose-built 5nm ASIC 官方照片。圖/Waymo

1,000 TOPS:數字很大,資訊仍不完整

While these ASICs alone deliver over 1,000 TOPS of ML performance dedicated to front-end processing and ML models

中文:這些 ASIC 本身為前端處理與 ML 模型提供超過 1,000 TOPS 的 ML 效能。

Waymo,2026 年 8 月 20 日

這句話有兩個容易被忽略的限定。第一,原文寫的是複數 these ASICs,所以不能改寫成「單顆晶片超過 1,000 TOPS」;第二,這個數字只指向感測前端與部分 ML 工作,不是整車總算力。截至 2026 年 8 月 23 日,Waymo 這篇公開稿也未列出晶片顆數、資料精度、稀疏條件、功耗、記憶體頻寬或可重現的模型延遲。

1 TOPS 代表每秒 1012 次 operations;規格表中的 TOPS 通常是在指定 precision、sparsity 與計數方式下的額定或理論峰值,不等於模型的 achieved throughput,更不等於單幀延遲。同一硬體在 INT8、FP8、FP4、dense 或 sparse 條件下,就可能得到不同數字。Waymo 自己也把 1,000 TOPS 與 achieved performance 分開,並特別指出系統常在 low-batch regime 運作;這正是額定值不能代替實測的原因。MLPerf Automotive 因此把 latency 設為主要 KPI,並觀察 99.9 百分位延遲。

拿 NVIDIA DRIVE Thor 作對照,更能看出比較陷阱。NVIDIA 官方資料表寫的是單顆 Thor-X SoC「最高 1,000 INT8 TOPS」,另列 273 GB/s 記憶體頻寬;Waymo 沒公開相同測量條件。兩者頂多能說 headline 都進入千 TOPS 級,不能據此判定誰更快、誰更省電。

真正的主角,是異構系統而不是一顆晶片

The result is a balanced, heterogeneous system.

中文:最終得到的是一套平衡的異構系統。

Waymo,2026 年 8 月 20 日

這七個英文字,比 1,000 TOPS 更接近整篇文章的核心。Waymo 明說完整系統仍把 ML 技術與 CPU、GPU、accelerator 配在一起,但沒有公開各元件的逐項分工。較合理的工程推論是,專用 ASIC 承擔靠近感測器、重複度較高的前端工作,而 CPU/GPU 保留較通用的運算;這仍待後續技術材料確認。

這使「Waymo 已全面拋棄 NVIDIA」缺乏公開證據。Waymo 仍把 AMD、Micron、NVIDIA、Samsung、Sandisk、Socionext 與 TSMC 列為合作夥伴,但截至 2026 年 8 月 23 日,並未公開各家是否進入最新車載 BOM、料號、分工或採購量。可確認的是:Waymo 的客製晶片策略與外部合作關係並存;不能確認特定供應商在最新車型中的有無。這種從工作負載反推硬體的做法,也正是AI 垂直整合能否形成護城河真正該問的問題。

延遲圖能證明什麼、不能證明什麼?

Waymo 公開的 normalized latency 相對曲線圖
Waymo 公開的 normalized latency 圖只顯示 baseline 與 optimized 的相對曲線,沒有提供可換算成毫秒的橫軸或單位。圖/Waymo

在 Waymo 公布的圖中,藍線於整個未標示的橫軸範圍低於紅線;這只呈現公司內部 normalized baseline 的相對改善。圖中沒有時間單位、workload、樣本數、硬體版本或統計定義,不能換算毫秒、分位數或安全提升幅度。

公開項目可以說目前不能說
5nm ASICWaymo 稱它處理感測前端與部分 ML由哪家代工、單車有幾顆、部署到多少車
超過 1,000 TOPSWaymo 對「這些 ASIC」公布的 ML 運算率precision、sparsity、晶片數、整車總算力與 TOPS/W
normalized latency公司圖中的 optimized 曲線低於 baseline絕對毫秒、跨平台勝負、安全因果
雙運算引擎公司描述平行 workloads 與故障接手故障覆蓋率、接手延遲,以及單側運作時的性能/功能降級

13 路相機與低光:co-design 的展示,不是獨立 benchmark

Waymo 稱最新系統可同時處理 13 路高解析相機資料。這個數量與2024 年公開的第六代 sensor suite 所列 13 camera、4 lidar、6 radar 相同;公司在 2026 年另有一篇第六代影像系統說明,描述 17MP imager 與把更多處理移入 custom silicon。不過 8 月 20 日公開稿沒有明說這次 ASIC 圖與數據對應哪個車型、世代或所有第六代配置,也不代表每一輛 Waymo、或全部 13 路相機都採同一規格。

Waymo 公開的傳統相機與最新系統低光影像對照
Waymo 表示,右側是最新系統同時處理 13 路高解析相機後的低光結果;這是公司展示圖,不是獨立測試。圖/Waymo

右圖確實更容易辨認路面與標誌,但它只證明 Waymo 選擇展示這組對照。沒有原始檔、曝光設定、相機型號與可重做流程,就不能把視覺差異量化成感知準確率。這裡真正可取的工程訊號,是 Waymo 把 sensor、imager、denoising、fusion model 與 silicon 一起設計;真正仍待回答的,則是它在功耗、長尾延遲與道路場景上換來多少可驗證收益。

安全證據要和晶片因果分開看

Waymo 的道路資料不是空白。Waymo Safety Impact Hub 顯示,截至 2026 年 3 月自報累積 2.206 億英里 rider-only 里程;而 2026 年 7 月的IIHS 獨立研究使用 2021 至 2024 年聯邦事故報告、州警察紀錄,以及約 5,000 萬英里 Waymo driverless VMT(里程由 Waymo 提供),估計四個營運地區合計的 police-reportable crash involvement rate 較同期當地人類駕駛低 68%。分城市結果並不一致:Austin 的點估計高 4%,且樣本較小。

但這兩組資料都不能替 Waymo 5nm ASIC 做安全背書:資料未按本次 ASIC 的部署世代切分,IIHS 研究期也早於 2026 年這次揭露。較低的整體事故率可以支持「Waymo 在研究涵蓋的營運範圍與年份內已有實際安全證據」,卻不能推出「1,000 TOPS 使事故涉入率下降 68%」。自駕安全是晶片、模型、地圖、感測器、營運範圍與故障處理共同作用的結果。這也是為什麼Robotaxi 里程不等於完整護城河,更不能拿一個總數替代條件化的驗證。

AlphaLab 判讀:重要的是 workload-specific efficiency

我同意 Waymo 的地方:自駕是極端的 physical AI 問題。資料從 sensor 產生後若要反覆搬移到通用處理器,延遲、頻寬與功耗都會累積。把固定且高頻的前端工作交給專用 ASIC,再讓 CPU、GPU 與其他 accelerator 分工,是合理的系統方向;Waymo 累積的真實道路工作負載,也讓它比純晶片商更知道哪些運算值得固化。

我存疑的地方:目前公開內容還不足以證明這套 ASIC 比通用車載平台更快、更省電或更便宜。沒有功耗、記憶體頻寬、精度條件、低 batch 實測與可比較 benchmark,1,000 TOPS 仍是規格故事的起點,不是結論。它也不能單獨回答 Waymo 能否更快擴城;那還牽涉 HD 地圖、ODD、驗證流程與車隊經濟,正如Robotaxi 路線之爭所揭示的系統取捨。

所以,我不會把這次揭露解讀成「Waymo 擊敗 NVIDIA」,而會把它視為垂直整合加深的一個證據:Waymo 正把最貼近自身資料與延遲需求的部分收回自研,同時保留 CPU、GPU 和供應商生態。對照Tesla AI5 的記憶體規格爭議NVIDIA Alpamayo 2 的開放模型路線,三者真正的競爭都不只在單一峰值,而在整套系統能否把模型穩定送上道路。

下一份資料,該盯哪六個問題?

Hot Chips 2026 官方議程安排 Waymo 在美西時間 8 月 24 日發表 keynote 與 sensor fusion processor 技術演講;本文只依 8 月 20 日公開稿判讀。若後續材料釋出,最值得核對的是:

  1. 1,000 TOPS 採用哪一種 precision 與 sparsity 條件?
  2. 數字是單顆、單一運算分區,還是車上多顆合計?
  3. 記憶體頻寬、資料移動量與實際模型利用率是多少?
  4. 低 batch 的中位數與 99.9 百分位延遲是多少?
  5. ASIC、GPU 與 CPU 各自承擔哪些模型與 fallback?
  6. 功耗、故障覆蓋率與部署世代能否被清楚切分?

這六個答案,比再多一個 TOPS headline 更能判斷 Waymo 5nm ASIC 是否真的形成技術護城河。

接著閱讀

左右滑動查看更多推薦

下次看到新的自駕晶片規格,先找 precision、功耗、頻寬與尾端延遲;如果四項都缺席,就把 TOPS 當成待驗證線索,而不是性能結論。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。