跳到主要內容

OpenAI Jalapeño 晶片首測:1.9 倍每瓦吞吐,證據夠挑戰 NVIDIA 嗎?(2026)

最後更新: ·
OpenAI Jalapeño 首代推論晶片,首代晶片真贏了嗎

2026 年 8 月 25 日,OpenAI 在官網發布〈Jalapeño’s first results show industry-leading speed and efficiency in AI inference〉,公開 OpenAI Jalapeño 首代自研推論晶片的第一批量測結果。數字很亮眼:OpenAI 自報在三個開放權重模型上,峰值每瓦混合 token 吞吐高出比較系統 1.5–1.9 倍,端到端延遲低 1.7–3.6 倍;但「真的贏了」要先回答一個更重要的問題:這些倍數究竟量了什麼?

OpenAI Jalapeño 首次實測文章的原始頁面截圖
點圖可閱讀 OpenAI 於 2026 年 8 月 25 日發布的原文。圖/OpenAI

下面先忠實還原原文的測試條件與架構主張,再對照 SemiAnalysis 的現場見證和 InferenceX 方法,最後判斷 OpenAI Jalapeño 對 Agent 延遲、推論成本與 NVIDIA 的真正意義。先把結論放前面:這不是紙上晶片,但也還不是一場已經結束的勝負。

先說結論:晶片是真的,勝負還沒定

“Jalapeño is working first-party silicon with measured results.”

中文:Jalapeño 是已經運作、而且已有量測結果的第一方晶片。

OpenAI

這句話最值得保留。Jalapeño 已從簡報上的路線圖走到 A0 工程樣品;SemiAnalysis 也表示,它進入 OpenAI 實驗室,在工程師陪同下看過晶片運行 InferenceX 工作負載。對第一次做自研加速器的 AI 公司而言,能讓 GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T 三種模型跑出完整結果,本身就是可信的工程里程碑。

不過,OpenAI 原標題的「industry-leading」不能直接當成全產業結論。公開附錄只比較 GB200/GB300 的指定配置,工作負載是 nominal 8K input/1K output 的單回合 STP 測試;它不是同日、同軟體、同拓撲、涵蓋 Rubin、AMD 與 TPU 的中立擂台。最準確的讀法是:OpenAI 在三個指定 InferenceX 工作負載上,自報 Jalapeño 位於更好的吞吐—延遲前緣;這個結果有外部人士在場見證,但尚未被外部獨立重現。

OpenAI 到底量了什麼?

OpenAI 採用 SemiAnalysis 的 InferenceX,把輸入固定在約 8,000 token、輸出固定在約 1,000 token,並使用 STP(不靠多 token 預測的逐 token 生成)比較不同併發點。它看的不是單一最高 tok/s,而是「在某個延遲下,一套系統能承受多少吞吐」的 Pareto frontier。

模型比較系統峰值 mixed TPS/kW端到端延遲最低 TBT
GPT-OSS 120BGB200約 1.9 倍1.03 秒 vs. 1.80 秒,約低 1.7 倍0.69 ms vs. 1.87 ms,約低 2.7 倍
DeepSeek R1 670BGB300約 1.7 倍1.65 秒 vs. 5.99 秒,約低 3.6 倍1.43 ms vs. 5.90 ms,約低 4.1 倍
Kimi K2.5 1TGB300約 1.5 倍1.56 秒 vs. 5.31 秒,約低 3.4 倍1.44 ms vs. 5.48 ms,約低 3.8 倍
表中倍數與秒數均為 OpenAI 公布值;mixed TPS 同時計入處理的輸入 token 與產生的輸出 token。
OpenAI 公布的 Jalapeño 與 GB300 在 DeepSeek R1 上的峰值吞吐、端到端延遲、TBT 與 matched-throughput 比較卡
DeepSeek R1 是三組公開結果中端到端延遲差距最大的一組;右側 104.3 倍代表在對手最低 TBT 操作點下可承載的吞吐差,不是「推論快 104 倍」。圖/OpenAI

最後一欄尤其容易被誤讀。OpenAI 另列出在對手「最低 TBT」操作點上,Jalapeño 可承載高出 53.7–104.3 倍的每瓦 mixed throughput。那是固定互動速度後,比較剩餘吞吐容量,不是把單一請求縮短 104 倍。真正能對應使用者等待的,是同表的端到端延遲與 TBT。

「每瓦」不是牆上電表:漂亮數字的第一個邊界

OpenAI 用各加速器公布的封裝額定功耗正規化:Jalapeño 700W、GB200 1,200W、GB300 1,400W。OpenAI 補充,Jalapeño 在這些工作負載的持續功耗不超過 550W;但比較式仍使用 700W,而且文章沒有對兩邊做同一套機櫃 AC 牆插量測。

因此,這個指標更接近「每單位封裝功率預算可承載多少 mixed token」,不是焦耳/token,也不是整個資料中心的電費。CPU、網路、冷卻、電源轉換、備援與閒置率都在封裝 TDP 之外。MLCommons 的推論功耗方法會把受驗證的整機 AC 量測和 TDP 參考值分開處理,正好說明兩者不能互換。

這不代表 OpenAI 的比較沒有價值。對受電力上限約束的機房,封裝功率預算直接影響可裝多少運算;而 OpenAI 對自家晶片採 700W、沒有拿較低的 550W 實測上限替自己加分,也算保守。只是從「每瓦 mixed TPS 更高」跳到「每個答案更便宜」之前,仍缺機櫃功耗、利用率、良率、設備折舊與維運成本。

SemiAnalysis 見證了什麼,也沒有替 OpenAI 證明什麼

“All numbers are provided to us by OpenAI.”

中文:所有數字都由 OpenAI 提供給我們。

SemiAnalysis

SemiAnalysis 的現場報告讓證據比公司投影片強一級:團隊看過 A0 晶片,在 OpenAI 實驗室與工程師一起跑 InferenceX,還檢查了所選配置的 GSM8K 品質。不過,它同時明說沒有自行控制所有報告數字、沒有跑完整 InferenceX suite,也還沒看過 AgentX 結果。

這是一種「有外部見證的公司測試」,不是第三方盲測。兩者差別在於控制權:公開 NVIDIA 比較點可以追到 InferenceX 的 recipe、log 與配置;若 Jalapeño 未來也公開裝置數、拓撲、模型/tokenizer hash、精度、併發、預熱、測試時間和 p50/p95/p99,外部團隊才有機會把見證升級成重現。

為什麼 Jalapeño 可能真的快:它不是只堆算力

大型語言模型推論至少有兩種截然不同的瓶頸。Prefill 要一次讀入長 prompt,偏向吃運算;decode 每次只生一個 token,偏向吃記憶體頻寬。跨晶片搬模型狀態與 KV cache,又會把兩者的優勢消耗在等待與通訊上。想先補這層基礎,可讀 LLM 推論引擎新手指南

OpenAI 的主張是:Jalapeño 從晶片、記憶體、互連、軟體到機櫃一起設計,讓模型狀態和 KV cache 可以明確放在本地,再依 prefill/decode 階段調度運算、記憶體和網路。大型連接域則讓完整請求盡量留在同一個系統內。這套設計若能在量產後維持,真正的優勢不只是單顆晶片,而是減少整條 serving path 的資料搬移。

另一個值得注意的信號是可程式性。OpenAI 表示,團隊用 Codex 與 GPT-Astra 在兩個月內,把三個原本不在量產計畫內的開放權重模型帶到高效能;在部分 GPT-OSS attention 與 MoE block,AI 產生的實作比既有的人類專家版本快 1.5–1.8 倍。這個倍數只適用於所選 block,不是整個模型;但它說明自研晶片能不能追上快速變動的模型,軟體產能和硬體本身同樣關鍵。

Agent 會不會因此快 3.6 倍?現在還不能這樣算

OpenAI 的方向判斷沒有錯:Agent 會連續呼叫模型,多一步延遲就會在長任務裡累積;把單次推論從 5.99 秒壓到 1.65 秒,當然有價值。但這次 8K/1K 單回合測試刻意不代表多回合 Agent 的完整狀態。真實工作負載還有持續變長的 context、prefix cache 命中、突發排隊、路由、工具執行、網路、沙箱、重試與失敗率。

SemiAnalysis 自己也把 AgentX 視為更適合檢驗長 context、多回合與 cache 行為的套件。假設模型推論只占一個 Agent 任務總時間的一半,就算這一段快 3.6 倍,整體也只會從 1 倍提升到約 1.56 倍;其餘工具與系統時間不會自動消失。要判斷你的工作負載,可搭配 四回合 Prefix Cache Trace,實際量端到端 wall time,而不是把晶片 benchmark 直接套在任務上。

這會讓 OpenAI 擺脫 NVIDIA 嗎?更像增加籌碼

OpenAI 自己已把答案寫出來:官方表示仍會廣泛部署 NVIDIA 與其他合作夥伴的加速器,涵蓋訓練和推論。Jalapeño 是推論晶片,不是完整取代訓練 GPU 的通用方案;新模型也仍要寫 kernel、做模型特定優化。它最先帶來的戰略價值,是把穩定、大量、內部可控的推論工作移到自己的 full-stack 平台,增加容量來源、供應鏈選項與議價能力。

而依賴並沒有憑空消失,只是重新分配到晶圓代工、HBM、先進封裝、網路與機櫃整合。OpenAI 在 6 月與 Broadcom 公布工程樣品時,承諾的是多代平台;8 月更新則仍列出 production qualification、軟體成熟、規模化運作和更多模型驗證。官方計畫在 2026 年底前開始部署,但「開始」不等於已證明大規模良率、可靠性或 token 成本。

我的判讀:這次最重要的不是 1.9 倍

我同意什麼

  • 第一代就跑起來,而且不只跑自家模型。三個不同模型家族、最大到 1T 的開放權重模型,降低了「只為一個內部模型特化」的疑慮。
  • 吞吐和互動延遲同時改善,方向比單看 tok/s 更有價值。這至少證明 OpenAI 的 prefill/decode 平衡與資料移動設計值得繼續驗證。
  • 自研晶片已成為 OpenAI 的軟硬體共同開發平台。能快速補 kernel、把真實 serving 需求送回下一代設計,長期可能比單次 benchmark 更有戰略價值。

我存疑什麼

  • 測試控制權仍在 OpenAI。現場見證提高可信度,卻不能替代公開 artifacts 與獨立重現。
  • 封裝 TDP 正規化不能證明整機能耗或 TCO。每瓦 mixed TPS 是有用的容量指標,不是「每個答案成本」的同義詞。
  • 單回合 8K/1K 不能代替 AgentX。沒有 prefix cache、多回合、工具與尾延遲,就無法把 3.6 倍直接翻成 Agent 任務速度。
  • 工程樣品不能代替量產經濟。良率、可用率、軟體維護、利用率與供應量,才決定這顆晶片能否改變 OpenAI 的成本曲線。

所以,OpenAI Jalapeño 的第一勝不是「打敗 NVIDIA」,而是證明 OpenAI 已具備做出可運行通用推論晶片、並快速把新模型帶上去的能力。晶片產業真正的淘汰賽,從 A0 跑分之後才開始。

接下來看五個訊號,別只等下一張倍數圖

  1. 可重現性:是否公開 Jalapeño recipe、raw log、模型與 tokenizer hash、精度、裝置數、拓撲、併發和測試時間。
  2. AgentX:是否在多回合、長 context、prefix cache 與突發流量下,公布 p50/p95/p99 和完整任務 wall time。
  3. 同代對決:是否在同日、同 harness、同品質門檻下,和 Rubin、AMD 新一代加速器及可取得的 TPU 系統比較。
  4. 整機經濟:是否公布機櫃 AC 功耗、有效利用率、每個合格答案的能耗與完整 TCO,而不只封裝 TDP。
  5. 量產證據:年底部署後的供應量、可靠性、可用率、軟體迭代速度與實際成本是否跟上工程樣品。

如果你在評估推論硬體或供應商,先把自己的流量拆成 prefill、decode、cache、工具時間和尾延遲,再要求同一套 workload replay。只有當品質與服務水準相同,「更快」和「更省」才有商業意義。成本面可接著看 AI 推理成本暴跌與估值,比較另一種從晶片效率跳到經濟結果時常見的推論陷阱。

接著閱讀

左右滑動查看更多推薦

下一個關鍵,不是更大的倍數

Jalapeño 已經跨過「能不能做出來」這一關;接下來要跨的是「別人能不能重現、真實 Agent 能不能受益、量產能不能省錢」。當 OpenAI 公開 AgentX、整機功耗與部署數據時,再把這篇的五個訊號逐項對帳。那時我們才會知道,這顆辣椒帶來的是一張漂亮跑分,還是一條新的推論成本曲線。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。