2026 年 8 月 25 日,Apple 在 Newsroom 發布了〈Apple introduces M6 and M5 Ultra for a big leap in performance and AI compute〉,把 M5 Ultra 本機 AI 描繪成一件很直接的事:一台桌上型 Mac,就能把數千億參數的大型語言模型完整留在機器裡執行。
這個方向確實重要,但最值得追問的不是「512GB 很不很大」,而是三件常被混成一件事的問題:模型裝不裝得下、跑得夠不夠快,以及實際工作是否比雲端或多張加速卡更划算。Apple 的發表回答了第一題的一大部分,也對第二題給出很亮眼的廠商測試;第三題則還要靠真實模型、長上下文與持續負載來驗收。
先把原文放在桌上。點擊下面這張截圖,會在新分頁開啟 Apple Newsroom。

這篇文章會分三步走:先忠實整理 M6 與 M5 Ultra 的完整主張;接著對容量、頻寬、模型尺寸與 benchmark 逐一查證;最後給出不吹捧也不唱衰的獨立判讀,以及真正值得等待的驗收數字。
一、原文真正主張什麼?兩顆晶片其實是兩條路線
這篇新聞稿把 M6 與 M5 Ultra 放在同一個標題裡,但它們服務的讀者並不相同。
- M6 是普及路線。Apple 稱它是自家首款 2 奈米晶片,最高提供 12 核 CPU、12 核 GPU、兩組 16 核 Neural Engine,以及 170GB/s 統一記憶體頻寬。它進入 Mac mini,面向日常工作、開發、創作與較小型的裝置端 AI。
- M5 Ultra 是容量與吞吐路線。Apple 稱它是 M 系列首款四晶粒 SoC:兩顆雙晶粒 M5 Max 透過新一代 UltraFusion 連接,最高提供 36 核 CPU、80 核 GPU、512GB 統一記憶體與 1.2TB/s 記憶體頻寬,落在 Mac Studio。
所以,M6 的 2 奈米製程不是 M5 Ultra 的規格;M5 Ultra 也不是「四顆 M5 Max」。原文的共同主題是 Apple silicon 更適合 AI,但真正讓大型本機模型受到關注的,是 M5 Ultra 的大記憶體池與更高頻寬。
“hundreds of billions of parameters entirely on device.”
中文:「讓數千億參數的模型,完整在裝置端執行。」
— Apple Newsroom
這句話精準抓住了 Apple 的賣點:相較於一般獨立顯示卡,統一記憶體讓 CPU 與 GPU 共用同一個大型記憶體池。對能完整放入可用統一記憶體、且 runtime 支援的模型,單機可免去跨多張獨立 GPU 切分權重的部署工作,也減少跨裝置搬資料的複雜度。對需要讓敏感資料留在本地、或反覆載入超大模型的團隊,這是實質的工程優勢。
二、512GB 是亮點,但不是這一代才出現的突破
這是整場發表最容易被頭條帶偏的地方。Apple 在 2025 年發表 M3 Ultra 時,就已經提供最高 512GB 統一記憶體,並聲稱可在裝置端執行超過 6,000 億參數的 LLM。換句話說,M5 Ultra 沒有把容量上限從小記憶體突然推到 512GB;它延續了同一個上限,真正升級的是頻寬與運算路徑。
M3 Ultra 的 Apple 規格頁列出 819GB/s,M5 Ultra 則列為 1.2TB/s。Apple 把這項提升寫成 50%;直接用這兩個已簡化的公開數字計算,增幅約為 46.5%,但其精度不足以反推出 Apple 內部使用的未簡化數值。這仍是很大的提升,尤其大型模型在逐 token 生成時,常常要一再讀取大量權重;但頻寬提高不會讓所有工作都按同一比例變快。
Apple 的晶片新聞稿把 M5 Ultra 對 M3 Ultra 的 GPU AI 峰值運算寫成最高 4.5 倍;Mac Studio 的另一份官方新聞稿則寫成最高 4.3 倍,公開資料不足以調和兩個口徑。兩者都是峰值能力,不等於每種本機 LLM 都按同一倍數加速。
“up to 4.5x the peak GPU compute for AI compared to M3 Ultra”
中文:「相較 M3 Ultra,GPU 的 AI 峰值運算最高可達 4.5 倍。」
— Apple Newsroom
Apple 的 Mac Studio 效能頁另列出一組比較:在 8K prompt、14B 4-bit 模型與 LM Studio 0.4.19+2 的限定條件下,512GB M5 Ultra 對 512GB M3 Ultra 的 time to first token(首 token 等待時間)最高約快 4 倍。這不是後續逐 token 的 decode 速度,也不能外推成數千億參數模型或任意長文件都快 4 倍。

三、M5 Ultra 本機 AI:裝得下,不等於跑得快
要判斷 M5 Ultra 本機 AI 是否真的適合一個模型,不能只拿「參數量 × 每參數幾 bit」做心算。至少要同時看四層:
| 問題 | 真正決定因素 | 512GB/1.2TB/s 解決了什麼 |
|---|---|---|
| 權重能否載入 | 實際量化檔大小、未量化張量、系統與 runtime 佔用 | 讓更多 4-bit/6-bit 超大模型有機會放進單機 |
| 生成是否流暢 | 記憶體頻寬、核心效率、模型架構與每 token 啟用參數 | 提高上限,但不保證每個模型按比例加速 |
| 長上下文是否可用 | KV cache、context 長度、batch 與同時使用人數 | 提供較多餘裕,仍須預留工作記憶體 |
| 是否值得本機部署 | 隱私、延遲、電力、採購成本、維運與雲端使用量 | 減少多卡切分與資料離機需求,但不是自動勝出 |
「4-bit」也不是每個參數剛好只佔 4 bit。MLX 的量化文件顯示,量化值之外還要保存每一組的 scale 與 bias;模型還有其他張量、cache 與執行緩衝區。最直觀的反例是 1 兆參數的 Kimi K2:一份可下載的 Q4_K_M GGUF 實際標示為 621GB,遠高於「1T × 4 bit = 500GB」這種零開銷估算,因此不可能塞進 512GB。
反過來看,有些參數更多的 MoE 模型,生成時只啟用其中一小部分專家,反而可能比參數較少但每層都全啟用的 dense 模型快。參數總量主要告訴你「要存多少」,每 token 的啟用量與資料搬運才更接近「跑多快」。這也是為什麼「數千億參數」只是一個容量級距,不是效能規格。
四、現有實測告訴我們:同樣能放進記憶體,體感可以差很多
因為 512GB 的 M5 Ultra Mac Studio 要到 2026 年 10 月下旬才供貨,目前可作容量層級類比的公開資料之一,是同樣具備 512GB 的 M3 Ultra。這些是第三方原始測試紀錄,不是 AlphaLab 自行重現,也不能當成 M5 Ultra 成績。
- oMLX 在 2026 年 3 月 24 日的紀錄中,以 M3 Ultra 80 核 GPU、512GB、oMLX 0.2.20 跑 DeepSeek-R1 4-bit:1K context 的生成速度為 19.3 tok/s、峰值記憶體 392GB;到 16K context 時,生成速度降至 14.7 tok/s、峰值記憶體升到 410.3GB。
- 另一份公開的 MLX benchmark 原始 CSV記錄,單機 M3 Ultra 執行 dense 的 Llama 3.1 405B Q4,在 1K context 約為 2.99 tok/s、峰值記憶體 229.6GB;context 拉到 65K 時約為 2.09 tok/s,峰值記憶體升至 263.2GB。原始方法文件列出的環境是 macOS 26.3.1、MLX 0.30.7、mlx-lm 0.30.8、batch 1,以
mlx_lm.benchmark每組跑 3 次並取中位數。
兩組紀錄使用的模型、runtime、量化與測試方式不同,不能拿來做嚴格排名或單獨建立因果;但它們顯示「放得進去」只通過入場檢查,實際速度仍可能相差很大。DeepSeek-R1 公開架構為 671B 總參數、每個 token 約啟用 37B,這是它在該紀錄中達到較高生成速度的合理解釋之一,不是這組跨測試比較能直接證明的結論。另一份 dense 405B 紀錄在 1K context 的峰值記憶體約 229.6GB,逐 token 生成仍約每秒 2.99 個。
因此,不能把 M3 Ultra 的成績單純乘上 1.2TB/s ÷ 819GB/s,就當成 M5 Ultra 的答案。較高頻寬有利,但四晶粒拓撲、Metal/MLX kernel、量化格式、context 與散熱,都會改變實際結果。
五、Apple 的測試很亮眼,但要讀對它量了什麼
這裡要分清楚兩套官方測試。本文主角那篇晶片新聞稿的比較腳註,列出 36 核 CPU、80 核 GPU、256GB 記憶體的預量產 M5 Ultra Mac Studio,對比同為 256GB 的 M3 Ultra;前述 LM Studio 首 token測試則使用 512GB 對 512GB。後者證明 Apple 確實測過最高容量配置,但它採用 14B 4-bit 模型,仍不能回答 400B 以上 dense 模型的 decode、長 context、多人併發與持續功耗。
更重要的是,Apple 公布的是多種不同測量:
- 4.5 倍/4.3 倍:兩份 Apple 新聞稿對 GPU AI 峰值運算的不同口徑,不是通用應用速度。
- 約 4 倍:特定 8K prompt、14B 4-bit、LM Studio 版本的首 token 等待時間,對比 M3 Ultra,不是逐 token 生成。
- 1.2TB/s:記憶體頻寬規格,不是所有模型都能吃滿的有效吞吐。
- 512GB:最高可選容量;Apple 的供貨資訊指出這個配置預計 10 月下旬才到來。
把這四項分開看,M5 Ultra 的進步仍然成立,只是不再是一句「本機 AI 快 4 倍」就能概括。Apple 的 8K/14B 首 token 測試顯示特定 prompt-processing 工作有大幅加速的可能,但不能外推到任意模型;對記憶體受限的逐 token decode,則要看模型與 runtime;對塞滿 512GB 的長時間工作,最終仍要等相同配置的可重現測試。
六、M6 的 2 奈米很重要,但不是大型模型答案
M6 代表 Apple silicon 的另一個里程碑。Apple 稱它是自家首款 2 奈米晶片;台積電公開資料則顯示 N2 已在 2025 年第四季進入量產,並採用第一代 nanosheet 電晶體。不過 Apple 沒有在新聞稿指名代工廠或精確節點版本,所以我們只能確認 Apple 的 2 奈米產品宣稱,不能從這頁反推更多製程細節。
Apple 把 M6 的雙 16 核 Neural Engine、每個 GPU 核心內的 Neural Accelerator 與最高 170GB/s 頻寬,定位為加速較小模型、編譯、索引與 agent 工作流;實際增幅仍待量產機驗證。但它最高 32GB 統一記憶體,和 512GB M5 Ultra 解的是不同問題。可用記憶體是能否載入的必要條件之一;模型格式、runtime 與 kernel/算子支援,同樣可能成為硬限制。
七、AlphaLab 判讀 M5 Ultra 本機 AI:門檻真的在移動
判讀一:不是容量革命,而是同容量具備更好的硬體條件
M3 Ultra 已經證明 512GB 可以放進桌面主機;M5 Ultra 的關鍵,是把同一個容量上限配上更高頻寬、新 GPU 加速器與四晶粒設計。對 M5 Ultra 本機 AI 而言,這比再多一個華麗的參數上限更實際:在模型常駐的同一進程期間,從儲存載入通常是一次啟動成本;重啟或卸載後仍須重載,而生成階段會反覆存取啟用權重、kernel 與 cache。這些硬體條件是否讓大型模型真正更可用,仍要由同配置實測回答。
判讀二:Apple 正把「不用多卡」變成產品
傳統多 GPU 系統可以提供更高算力,也能透過擴充走得更遠;代價是記憶體切分、互連、電力、噪音與軟體複雜度。Mac Studio 的賣點不是在每項 benchmark 擊敗加速卡,而是讓一個超大的共享記憶體池,以安靜、單機、一般桌面工作站的形式出現。對重視資料不離機、原型開發與單人互動推論的人,這是很有吸引力的組合;對訓練、多人服務或追求最高吞吐的團隊,仍需比較專用 GPU 與雲端。
判讀三:參數量正在失去作為購機指南的價值
現有公開紀錄顯示,671B MoE 在一套測試中可有不錯的生成速度,405B dense 在另一套測試中卻慢得多;這不是直接對決,但提醒我們總參數量無法單獨預測效能。另一邊,一個標稱 4-bit 的 1T 模型又可能大到 621GB。只問「能跑幾 B」已經不夠。真正有用的購機問題應該是:哪個模型、哪個量化檔、多少 context、prompt processing 與 generation 各多快、需要幾個併發使用者。
我同意什麼,又存疑什麼?
我同意的:M3 Ultra 已把 512GB 與數千億參數本機模型商用化;M5 Ultra 的新意,是維持容量上限,同時提高頻寬並在 GPU 加入 Neural Accelerators。是否因此變得更「可用」仍待同配置實測,但 512GB 的共享記憶體確實能避開許多多卡切分問題,1.2TB/s 也直指本機推論的重要瓶頸之一。隱私、離線能力與固定設備成本,都是雲端 API 無法完全取代的價值。
我存疑的:新聞稿把容量、峰值 AI compute、提示處理與「跑大型模型」排在一起,很容易讓人把它們讀成同一個 4 倍進步。它們其實是不同測項,而且這篇晶片新聞稿的比較腳註使用 256GB 預量產機。M5 Ultra 是否能讓 400B 以上 dense 模型從「技術上可跑」變成「互動上好用」,仍要看 decode、TTFT、長 context 與持續負載;這些才會決定高階配置的真實價值。
八、如果你真的想買來跑模型,先等這五個數字
不要只等一張「最高 tok/s」圖。等 512GB 配置實際到貨後,至少要找齊以下五項,而且比較時必須固定模型、量化與 runtime 版本:
- 實際模型檔與峰值記憶體:權重載入後,還剩多少空間給 KV cache、系統與其他程式?
- Prompt processing 與 generation 分開:前者決定讀入長文件多快,後者決定回答一個字一個字出現多快。
- TTFT 與不同 context:1K、16K、64K 下的首 token 等待時間與生成速度,才能看出工作規模放大後是否崩落。
- 持續功耗與熱表現:短跑峰值不能代表數小時任務或全天服務。
- 單人互動與多人吞吐:一個人聊天順暢,不代表團隊共用時仍有好體驗。
如果你還在判斷記憶體需求,先讀 《本機 LLM 顯存怎麼選?》;想理解 MLX、llama.cpp 與 vLLM 各自負責什麼,再看 《LLM 推論引擎是什麼?》。這兩個問題釐清後,你才有辦法把晶片規格翻成自己的工作負載,而不是替一個抽象的「最大參數量」買單。
接著閱讀
左右滑動查看更多推薦
這次發表最值得記住的,不是「桌面終於能跑大模型」——M3 Ultra 已經跨過那條線——而是 Apple 正把容量、頻寬與開發工具收斂成一台具備更好本機 AI 條件的工作站。M5 Ultra 本機 AI 真正的分水嶺會出現在 512GB 機型交付之後:當可重現測試開始回答「哪個模型、什麼速度、多少 context、多少功耗」,你就能判斷它是昂貴的技術展示,還是雲端之外真正成熟的第二條路。
