2026 年 9 月 10 日,Positron AI 發布〈Positron AI Raises $875 Million at a $5 Billion Valuation〉,把一個大膽問題推到檯面上:大型模型推論真的非得綁在 HBM 與先進封裝上嗎?這篇文章先還原募資結構,再拆開 Atlas 與 Asimov 兩個世代,最後用可驗證的量產與效能門檻判斷這場賭注。

先看結論:Positron AI 融資上看 8.75 億,產品證據分兩代
新聞稿把交易稱為 8.75 億美元 Series C,但細節是兩筆:第一筆 3.75 億美元、投前估值 35 億美元;第二筆 C-1 是「最高 5 億美元」。因此,最精確的說法是融資方案上看 8.75 億美元、投後估值 50 億美元,而不是斷言 8.75 億美元現金已全數到帳。卡達投資局(QIA)的公告確認參與這輪融資及 50 億美元估值,但沒有拆解第二筆資金的交割時程。
- 現在:Atlas 官方產品頁標示「Shipping Today」;Positron 表示正在 Oracle Cloud Infrastructure(OCI)部署超過 50 個機櫃。
- 下一關:公司把 Asimov 在 TSMC N3P 流片的目標定在 2026 年底。
- 真正兌現:流片後才有實體晶片可測;Titan 系統與 Asimov 晶片的量產目標是 2027 年下半年,屆時才能驗證這條 LPDDR5X 路線能否規模交付。
一句話判讀:Positron AI 已對外宣告第一代推論設備出貨與部署,但公開證據主要仍由公司提供;這輪投資人給出的 50 億美元估值,主要押注的是尚未用量產晶片證明的第二代架構。
Atlas 不是「不用 HBM」的證明
這是整則故事最容易被混在一起的地方。Atlas 官方規格列出 8 顆 Archer 加速器、每顆 32GB HBM,總計 256GB 加速器記憶體,另配 384GB DDR5 系統記憶體。換句話說,現在出貨的 Atlas 仍然使用 HBM;改用商品化 LPDDR5X、避開 CoWoS 依賴,是未來 Asimov/Titan 的設計。

部署訊號也要精確解讀。Positron 的原文是「正在 OCI 部署超過 50 個 Atlas 機櫃」,並稱 Parasail 使用這批容量提供推論服務;新聞稿沒有揭露機櫃的驗收比例、資產歸屬、利用率或服務等級。截至 2026 年 9 月 12 日,OCI 公開 Compute shape 文件列出的加速器型號中未見 Atlas 名稱;這不排除私有容量或合作部署,但不能把 50 多櫃改寫成一般 OCI 客戶已可自助租用的公開產品。
“AI’s center of gravity is shifting from training models to running them.”
中文:「AI 的重心正從訓練模型,移向實際運行模型。」
Positron AI,2026 年 9 月 10 日新聞稿
這句話抓對了產業方向:每個已訓練的模型版本,在服務期間會隨每一次聊天、搜尋與 Agent 操作被反覆呼叫。不過,「推論市場變大」只證明需求存在,不會自動證明某一種晶片架構勝出。
Asimov 的 LPDDR 賭注,為何有物理道理?
大型語言模型在逐字生成的 decode 階段,會反覆搬動模型權重並讀寫 KV cache。當單一使用者、低批次、低延遲是主要目標時,運算單元經常在等資料,記憶體容量、有效頻寬與搬移能耗就會比峰值 FLOPS 更重要。Positron 的核心主張,正是把晶片從一開始就圍繞資料流與記憶體配置,而不是先堆算力、再補記憶體。
Asimov 官方設計目標並列每顆 288GB 至 2.3TB 記憶體、2.76TB/s 可實現頻寬與約 400W TDP;作為參照,已上市的 NVIDIA H200每顆有 141GB HBM3e、4.8TB/s 峰值頻寬,TDP 最高 700W。這兩組數字不能直接宣布勝負:Asimov 提供較高的目標容量,但 H200 的原始頻寬更高,而且前者目前是設計規格,後者是已出貨產品。
還有一個容易被規格表隱藏的問題:Positron 沒有在該頁說明不同容量配置、LPDDR5X 與 CXL/主機記憶體層級,如何分別對應 2.76TB/s。因此不能把「最高 2.3TB」理解成整個容量池都以 2.76TB/s 運作;這個映射要等更完整的架構文件與實機測量。
Positron 用來跨越 LPDDR 峰值頻寬差距的核心說法,是其資料流架構可在真實 Transformer 工作負載實現超過 90% 的可用頻寬,對照 GPU 低於 30%。但公司沒有隨這項主張公開模型、序列長度、batch、量測定義或原始紀錄;依它在同一份新聞稿所列的 2026 年底流片目標,這也不是 Asimov 量產晶片的矽後測量。現階段應把它視為設計與模擬假說。

真正的推論服務也不只有 decode。輸入很長時,prefill 階段更偏向計算密集;高併發下,排程、網路、KV cache 管理與軟體核心都可能成為瓶頸。OSDI 2024 的 DistServe 研究因此把 prefill 與 decode 分開配置,並同時看首字延遲(TTFT)、每字延遲(TPOT)與符合延遲門檻的吞吐量。這也說明,記憶體優先是一個可信的工程假說,卻不是所有工作負載都會贏的保證。
目前最漂亮的倍數,仍在模擬器裡
Asimov 頁面宣稱相較 NVIDIA Rubin 可達 5 倍 tokens per dollar 與 5 倍 tokens per watt;Titan 頁面的圖表則是在 DeepSeek R1 0528 671B、FP4、8K input/1K output 設定下,比較 Asimov TitanRack 與 NVIDIA Blackwell GB300 NVL72,並另外列出單機最高 18.4TB 記憶體。Titan 把 Asimov TitanRack 明確標成「Simulated」,也註明 Asimov 效能來自 cycle-accurate simulations;在晶片流片、封裝、散熱、良率與軟體完成前,這些都應視為公司的模擬目標,而不是第三方實測結果。
同一頁還有「24.8 倍 revenue per TCO dollar」,但其計算包含較快服務層收取 2 倍價格,以及 neocloud 持有成本等假設;這是商業模型,不是晶片效能倍數。
第一代 Atlas 官網至少公布了一組比較數字,但沒有附上可重現的原始紀錄。Positron 用 Llama 3.1 8B、BF16、關閉 speculative decoding 與 paged attention,比較 Atlas 的 280 tokens/s/user、2,000W 與 DGX H200 的 182 tokens/s/user、5,900W,算術上得到 4.54 倍每瓦效能。官網沒有交代 concurrency、輸入/輸出長度、batch、軟體版本、重複次數、價格或功耗量測邊界;Atlas 規格欄的 2,000W 電源描述,與比較表的 system power 是否為同一量測也不清楚。這組數字只能支持「指定設定值得重測」,不能外推成所有模型、上下文長度、併發量與延遲門檻都領先。
軟體覆蓋同樣需要實證。公開 v1.1 release notes文件化的 shipping models 是 Llama 3.1 8B GPTQ、Llama 3.1 70B GPTQ 與 Mixtral 8x7B GPTQ,主要測試的 prompt 加 response 總長度為 2,048 tokens。這不代表實際支援範圍只有三個模型,卻仍不足以驗證官網對廣泛 Transformer 與 Hugging Face 相容性的主張。
截至 2026 年 9 月 12 日,MLPerf Inference v6.0 公布的 24 個提交組織中未列 Positron。這只代表它沒有參與該輪公開提交,不等於市場上不存在任何測試;但在採購決策上,可重現的標準化結果仍是公司下一步最該補上的證據。
Positron AI 上看 8.75 億美元的方案,要跨越四道死亡谷
Positron 說這輪資金將用於 Asimov 流片、2MW 以上工程資料中心與模擬平台、LPDDR5X 供應承諾,以及 Titan 的製造和上市。若各批資金按規劃到位,這項上看 8.75 億美元的融資方案可降低 Positron AI 在資本密集的 ASIC 階段因資金不足而中止的風險,卻不保證晶片良率、系統整合或量產成功。判斷焦點因此移到四個更硬的問題:
- 晶片:N3P 流片後能否如期 bring-up,實際頻率、功耗、良率是否接近模型。
- 系統:4 至 8 顆 Asimov 的記憶體、互連、網路與散熱能否一起穩定工作。
- 軟體:新模型、量化格式、長上下文與 MoE 更新能否快速支援,而不是只在固定模型上漂亮。
- 客戶:能否公開同一模型、精度、輸入/輸出長度、併發量與延遲 SLO 下的真實流量與總成本。
還有一個需要揭露的利益關係:這輪共同領投者之一是 SemiAnalysis Capital,創辦人 Dylan Patel 同時加入 Positron 董事會;Titan 頁面的 GPU 對照資料又引用 SemiAnalysis InferenceX。這不會讓數據自動失效,但它已不是與交易無關的獨立背書,讀者應把原始設定與重現性放在名人引言之前。
AlphaLab 的判讀:方向有理,倍數待驗
我同意 Positron 對問題的切法:在推論時代,記憶體容量、有效頻寬、電力與既有機房條件,確實可能比理論算力更接近客戶的痛點。Atlas 官方頁標示已出貨,加上公司披露的 OCI 部署,構成比純路線圖更具體、但仍待客戶資料確認的執行訊號。
我不接受的跳躍,是把 Atlas 的部署直接當成 Asimov 已勝過 HBM 路線。Atlas 用 HBM、Asimov 用 LPDDR5X;Atlas 有官網比較數字但設定單一,Asimov 的漂亮倍數仍是模擬。兩者之間隔著晶片、封裝、系統、編譯器、模型相容性與量產六道關卡。50 億美元估值反映的是這輪投資人願意為這條可能性付多少錢,不是工程結論。
| 觀察燈號 | 目前能說什麼 | 下一個可驗證門檻 |
|---|---|---|
| 🟢 已確認 | 公司與 QIA 已公告融資方案及 50 億美元估值;Atlas 官網標示 Shipping Today | 各批資金交割與持續交付 |
| 🟡 待驗證 | OCI 50 多櫃、客戶可用性、Atlas 效能與成本優勢主要來自公司披露 | 客戶確認、相同 SLO 的可重現實測 |
| 🟠 核心賭注 | Asimov 用 LPDDR5X 換容量、功耗與供應鏈彈性 | 量產晶片的頻寬利用率、功耗、良率與模型覆蓋 |
| 🔴 失效條件 | 若延誤、軟體跟不上,或只能在窄工作負載領先 | 2027 年仍無實體晶片與第三方端到端數據 |
你現在該怎麼看這筆募資?
如果你是基礎設施採購者,不要只問「tokens/s 有多快」,要索取同一模型與精度下的 TTFT、TPOT、goodput、併發量、牆上功耗、網路與冷卻邊界、軟體版本和故障率。如果你在觀察 AI 產業,真正的里程碑不是下一輪估值,而是 Asimov 實體晶片能否把模擬曲線變成可重現的服務品質。
Positron AI 的賭注值得認真看,因為它瞄準的是推論經濟的核心瓶頸之一;也正因如此,標準應該更高。等到公司公開跨模型、跨上下文、帶延遲門檻的實測,我們才知道 LPDDR5X 是新的成本曲線,還是一張昂貴但漂亮的路線圖。
接著閱讀
左右滑動查看更多推薦
結語:先等矽,再信倍數
這項上看 8.75 億美元的融資方案,讓 Positron 增加把 Asimov 做成實體產品的資源。接下來最有價值的更新,會是流片與 bring-up、量產時程、客戶可重現的 SLO 數據,以及公開可檢查的總成本邊界;少看一個估值標題,多追一份完整測試表,答案會清楚得多。






