2026 年 8 月 18 日,Cerebras 在官方網站發布〈Introducing Cerebras CS-4: The Fastest AI Just Got Faster〉,把三片 WSE-3 Turbo 晶圓級處理器塞進重新設計的 Nexus 機櫃。Cerebras CS-4 確實是一項值得注意的系統工程進步;但「最高 30 倍」與「超過 10 兆參數仍有每秒逾 1,000 token」目前分別是供應商基準與內部外推,還不是獨立的量產系統測試。

要讀懂這次發布,可以分成三步:先看它真正改了哪些硬體,再拆解速度圖表的比較邊界,最後回到大型模型最難逃避的容量、功耗與部署問題。
Cerebras CS-4 真正換了什麼:主角是整套系統
官方把這一代處理器明確稱為 WSE-3 Turbo。SemiAnalysis 的技術拆解將它描述為同一代 5 奈米 WSE-3 在更高功率、時脈與冷卻能力下運作,再由新機櫃把三片晶圓整合起來。就這次發布提供的證據而言,世代更新的重心在整套系統,不能只從「CS-4」這個名稱推導出一片新的 WSE。
“Compute, power, cooling, and I/O have to move forward together.”
中文:運算、供電、冷卻與 I/O 必須一起往前推進。
Angela Yeung、Eric Gardner/Cerebras
這句話也把發布重點說得很準——晶圓、供電、液冷、I/O 與機櫃必須一起升級,單獨把某一項規格拉高並不會自動變成更快的推論服務。
| 與本文比較相關的機櫃規格 | 數值 | 該怎麼讀 |
|---|---|---|
| WSE-3 Turbo | 3 片 | 三片晶圓的機櫃級總和 |
| 晶圓上 SRAM | 132 GB | 每片仍是 44 GB,容量合計為三倍 |
| 晶圓上記憶體頻寬 | 129.6 PB/s | 理論峰值,不等於應用程式持續吞吐 |
| 外部 I/O | 7.2 Tbit/s | 與晶圓上頻寬是不同層級 |
| 晶圓間延遲 | 最低 2 微秒 | 供應商最佳值,不是完整 token 延遲 |
三片晶圓進一櫃:Nexus 的價值不只在跑分
新版 Nexus 把運算放在機櫃後方三個可插拔的「backpack」,供電放在前方;運算、電力、冷卻與 I/O 因此能分開迭代。Cerebras 宣稱機櫃零件數減少 50%,backpack 的自動化製造程度提高 60%,部署時間可從數天縮成數小時。這篇發布文沒有提供客戶端現場量測資料;不過這些部署指標對商業落地可能比單次速度峰值更重要。

晶圓級引擎的賣點是把大量運算核心與 SRAM 留在同一片矽上,減少模型解碼時反覆跨晶片搬資料的成本。這也是為什麼既有 Artificial Analysis 的 Cerebras API 觀測能為「輸出速度很快」提供方向性佐證。然而截至 2026 年 8 月 20 日,該頁沒有把服務端硬體標成 CS-4,所以它不能驗證這次發布圖上的具體倍數。
Cerebras CS-4 的「最高 30 倍」到底比的是什麼?
官方圖表的縱軸是每位使用者每秒輸出的 token,比較七個模型上的 CS-4 與「GPU」。這不是每個機櫃能同時服務多少人,也不是首 token 延遲、總吞吐、耗電或成本。更關鍵的是,圖中沒有交代 GPU 型號與數量、推論框架、精度或量化、輸入與輸出長度、批次、並發、稀疏性與品質對齊方法。

原文把圖表證據標為 Artificial Analysis 與 2026 年 8 月的內部基準,但沒有逐根柱子對應資料來源。這讓「Cerebras CS-4 能把單一請求的輸出拉得非常快」成為合理方向,卻不足以支持「所有工作負載都比 GPU 快 30 倍」。如果 GPU 基準換成不同世代、不同數量,或把並發與總吞吐納入,倍數就可能完全不同。想進一步理解這種比較陷阱,可搭配 AlphaLab 的AI 模型排行榜判讀指南一起看。
超過 10 兆參數、每秒逾 1,000 token:目前是外推,不是實跑
Cerebras 另一個吸睛主張,是模型超過 10 兆參數時仍能輸出每秒逾 1,000 token。但原圖註腳直接把證據標為「由內部基準外推」,圖的縱軸也在談多跳 I/O 延遲,而非端到端 token 生成時間。官方沒有公開模型名稱、總參數與活躍參數、精度、機櫃數、上下文長度、KV cache 配置或完整計算時間,因此不能把這張圖讀成已完成的 10 兆參數模型實測。
做一個量級檢查就知道為何配置不可省略:10 兆參數即使用每個參數 4 bit 粗估,光權重也約 5 TB。若假設全部放在每櫃 132 GB 的晶圓上 SRAM,理論下限就接近 38 櫃,還沒計入 KV cache 與其他執行時開銷;若是 MoE,還要區分總參數、活躍參數與 expert placement。這 132 GB 本身也是三片晶圓上分散記憶體的加總。實際系統可以用模型平行或把 prefill 與 decode 拆到不同硬體,但那只會讓網路與資料搬移方式更重要,不會讓容量需求憑空消失。
頻寬翻倍,不等於容量問題消失
每片 WSE-3 Turbo 的 SRAM 仍是 44 GB;提升的是頻寬、時脈與 I/O,不是單片容量。以供應商機櫃規格做概念對照,CS-4 的 129.6 PB/s 晶圓上頻寬約為 NVIDIA Vera Rubin NVL72「最高」1,580 TB/s HBM 頻寬的 82 倍;但 Rubin 機櫃有 20.7 TB HBM,約是 CS-4 之 132 GB 的 157 倍。NVIDIA 將這些數字標為初步規格,可能變動。兩邊都是跨三片晶圓或 72 顆 GPU 的分散記憶體加總,不是單一平坦共享池;記憶體類型、拓撲與系統分工也不同。這不是效能排名,而是提醒:頻寬與容量是兩條不同的軸。

這也解釋了 Cerebras 為何強調 disaggregated inference:讓 HBM 容量較大的 GPU 或其他加速器處理 prefill,再讓 WSE 接手低延遲 decode。這是聰明的分工,同時也是架構限制的誠實回應。在傳統 prefill/decode 分離架構下,prefill 產生的 KV state 必須送到 decode 端;若採 KV offload 或更細的 attention/FFN 拆分,資料路徑才會不同。KV cache 怎麼搬、網路是否阻塞、實體 prefill/decode 硬體比例能否維持高利用率,都會進入總成本。若只算 decode 機櫃,所謂每瓦吞吐就可能漏掉前段硬體、主機、網路與冷卻。
真正的進步,與仍未交卷的地方
- 系統工程是真的:三片晶圓、雙倍單片 I/O、更強供電與液冷,再加上模組化機櫃,確實把單一晶圓的優勢推到機櫃尺度。
- 現有證據最直接支持的是低批次、低延遲 decode:對互動式 Agent、程式生成或語音服務,使用者等到的每一秒很值錢;但這不等於它在高並發總吞吐上也一定勝出。
- Cerebras 尚未公開足以獨立重跑 30 倍與 10 倍每瓦吞吐的完整配置:前者缺 GPU 基準配置,後者缺工作負載、並發與完整系統功耗邊界。若只把單片約兩倍峰值效能除以約兩倍供電,無法直接推出 10 倍每瓦吞吐;因此這個倍數必然依賴特定工作負載、並發、利用率或未公開的功耗邊界。這是由公司規格推得的判斷,不是額外實測。供應商圖表可以形成假說,不能替代採購驗收。
- 44 GB 單片容量仍是硬限制:巨大權重會增加晶圓數、pipeline 階段或外部記憶體需求;長上下文與大量並發則會推高 KV cache 與外部記憶體壓力。低延遲網路只能降低資料搬移代價,不能消除容量需求。
- Nexus 可能是最有商業價值的改動:如果零件減少與快速安裝能在客戶機房重現,它會直接改善製造、維修與擴容;但 Cerebras 在 8 月 18 日表示首批出貨將於「本季」開始,這不是廣泛量產可用的證明。
MLPerf Inference v6.0 與 Endpoints v0.7 分別在 2026 年 4 月與 7 月發布,都早於 8 月 18 日的 CS-4 發表,因此兩者既沒有驗證、也沒有否定 CS-4。本文把 30 倍、超過 10 兆參數每秒逾 1,000 token,以及 10 倍每瓦吞吐列為公司基準或外推,依據的是 Cerebras 自己的圖表註腳,而不是 MLPerf 的缺席。對「推論速度變快會如何改變產品與成本」有興趣,也可接著讀AI 推理成本暴跌後的估值問題。
如果要評估 CS-4,先向供應商要這張驗收表
- 同一模型、同一品質下的精度或量化方式,以及總參數與活躍參數。
- 輸入/輸出長度、上下文上限、批次與並發分布,不只一條最快輸出串流。
- 每位使用者 token/s、每機櫃總 token/s、TTFT 與尾端延遲,同時報告。
- 牆上插座的整櫃功耗,以及 prefill、主機、網路、儲存與冷卻是否納入。
- GPU 對照組的型號、數量、推論框架與成本;不要接受只寫「GPU」的柱狀圖。
- 已交付硬體上的可重跑測試、可用率與服務水準,而不是由元件峰值外推。
Cerebras CS-4 最可信的結論,不是「GPU 已被淘汰」,而是晶圓級 SRAM 架構把低延遲 decode 再往前推了一步。它的下一關不是更大的發布數字,而是讓獨立測試在真實上下文、並發、功耗與完整成本下,重現相同優勢。若想補齊公司與晶圓級路線的長期背景,可參考 AlphaLab 的Cerebras 深度分析;若想看同類速度宣稱如何拆,可讀GPT-5.6 Sol Ultrafast 深度解讀。
接著閱讀
左右滑動查看更多推薦






