跳到主要內容

Marin 535B 開訓:23B Active MoE 的公開訓練,現在證明了什麼?(2026)

最後更新: ·
Marin 535B 公開訓練主視覺,左側寫模型未完成、訓練先公開,右側為訓練 loss 曲線

2026 年 8 月 21 日(UTC;台北時間 8 月 22 日),史丹佛大學教授 Percy Liang 在 X 公開 Marin 535B-A23B 的開訓消息:這是一個總參數約 535B、每個 token 啟用約 23B 參數的 MoE 模型。真正值得注意的不是一個已經完成的新模型,而是 Marin 選擇在訓練剛起跑時,就把程式、資料規劃、縮放梯、失敗紀錄與即時 telemetry 一起攤開。

Percy Liang 在 X 公布 Marin 535B-A23B 開始訓練,並附上即時訓練損失曲線
Percy Liang 的原始公告。點擊圖片可在新分頁閱讀原文;圖/Percy Liang、Marin

本文先忠實還原公告與公開 tracker,再以 pinned code、W&B 與資料端點逐項對帳,最後回答兩個問題:Marin 535B 現在真的證明了什麼?又有哪些結論,必須等三個月後才能說?

一句話看懂:模型未完成,訓練先成為公開研究物

“Marin 535B-A23B started training this week! As usual, the whole process is open.”

中文:Marin 535B-A23B 本週開始訓練;一如往常,整個過程都公開。

Percy Liang,X,2026-08-21

這句話的核心不是「Marin 已經有一個 535B 模型可以用」,而是「研究團隊願意在不知道結果的情況下,先讓外界看見決策與故障路徑」。截至 2026 年 8 月 23 日 22:31 UTC,公開的 W&B run 仍顯示為 running;當時約走到第 11,172 step、累計約 515.4B tokens,也就是目前排程的 2.86%。這是一場正在進行的實驗,不是能力發布會。

目前能確認的四個尺度

  • 模型:Marin 的簡化口徑是 535.3B total/22.76B active;live config 記錄的總參數為 535,477,106,688。
  • 排程:目前 launcher 與 W&B 對應約 18.005T tokens,分成接近 80%/20% 的兩階段;公告寫的是 18.75T,兩者並不相同。
  • 硬體:issue 把拓樸寫成 11 套 GB200 NVL72;live job config 則配置 176 個、每個 4 GPU device 的 task,共 704 個 GPU devices,也就是 11 組 EP64。這個可觀測配置不能直接寫成 11 × 72=792 個實際參訓 device。
  • 運算:完整排程的解析估算約為 2.696 × 1024 訓練 FLOPs。公告所說的「約三個月」與 issue 的「約 100 天」都還只是預估。

因此,「535B-A23B」是一個實用的規模標籤,不是沒有口徑差異的物理常數。A23B 依 Marin 的 active-parameter 公式,主要計算每個 token 會走過的非 embedding 參數;若把小型常駐模組或 untied embedding/readout 納入,數字會改變。拿它和其他 MoE 比較時,至少還要一起看 active-parameter 定義、token 數、資料、運算量與評測方法。

Marin 到底公開了什麼?

Marin GitHub issue 8435 的公開 run tracker,列出 535B-A23B hero run 與 scaling ladder
Marin 把 hero run 的 job summary、程式版本、資料規劃、縮放梯、風險與後續討論集中在 GitHub issue #8435;圖/Marin GitHub

如果一個模型只在完訓後釋出權重與 model card,外界會知道成品,卻很難知道訓練過程曾經嘗試什麼、壞在哪裡、又為何改動。Marin 的方向更接近「open development」:讓訓練本身留下可檢查的研究軌跡。公開材料目前至少涵蓋四層。

Marin 在 2025 年 5 月由 Stanford CRFM/HAI 啟動,目前 repository authorship 同時列出 Stanford 與 Open Athena AI Foundation。任何人都能透過 issue/pull request 提案與審查,但真正提交 production-cluster job 仍需要專案與雲端憑證;因此,公開 artifact 不等於算力與 merge authority 已去中心化。

  1. 可定位的程式版本:pinned launcher、模型結構、optimizer 與訓練拓樸都能回到同一個 commit 檢查。
  2. 即時 telemetry:W&B 暴露 loss、gradient norm、token dropping、MFU、步數與配置,而不是只在最後挑幾張漂亮曲線。
  3. 資料規劃:團隊在 issue 中報告原始池約 25.6T tokens,去重與 contamination filter 後約 23.106T,並公開 Harrier 配方與實驗 metadata,另有 組成報告與抽樣瀏覽器
  4. 失敗與預測:小模型 scaling ladder、hero 首次啟動與 checkpoint resume 問題都有留下紀錄,預測則在最終結果出現前先公開。

這種做法有明確前例,而且不是史上第一次。BigScience 的 BLOOM 176B model card 連到訓練期間的 TensorBoard、chronicles、中間 checkpoint 與負面結果;EleutherAI 的 Pythia 公開 16 個模型、每個 154 個 checkpoint,還保留相同公開資料順序;AI2 的 OLMo 2 也把資料、程式、訓練配方、評測與 checkpoint 納入完整開放範圍。Marin 的新意不在「第一個透明訓練」,而在試圖把這套公開開發方式推向更大的 535B-total MoE 與跨 rack 工程。

Scaling ladder:它是導航儀,不是成績單

在 hero run 之前,Marin 依同一套約 791 tokens/active parameter 的比例,安排四個較小 rung:1.6B-A61M/48B tokens、4.0B-A162M/128B、11.5B-A481M/381B,以及 27.7B-A1.2B/926B。用途有兩個:先找出會隨規模放大的工程問題,再用小模型曲線預測大模型的 loss 軌跡。

“the d2048 scaling ladder rung failed at 81%. Chose not to resume”

中文:d2048 的縮放梯在 81% 時失敗;團隊選擇不恢復它。

Marin GitHub issue #8435
Marin 四個 scaling ladder rung 的逐步訓練 cross-entropy 曲線,80% 處標出第二階段資料混合切換
四個 rung 的逐步 training cross-entropy;虛線是 80% 的第二階段資料切換。最大 d2048 rung 在約 81% 停止,沒有完成原定 926B tokens;圖/Marin

更精確地說,公開 W&B 的 d2048 canonical run 在 81.46% 停止,實際約跑了 754.4B tokens。這讓「四階 scaling ladder 已跑完」成為不正確的說法;三階完成,一階留下足夠長的部分曲線,團隊決定把時間讓給 hero。失敗本身不否定方法,但它會降低外推的獨立資訊量,也提醒讀者:公開預測不等於預測已被驗證。

Marin 以四個較小模型 loss 曲線外推 535B-A23B hero run 的 Paloma macro-loss
實線是已量到的 rung,虛線與空心點是外推,星號是 535B-A23B hero 的預測。圖上的最終約 2.04 是條件式 loss 預測,不是完成模型的能力分數;圖/Marin

Marin 預測 hero 在假設不變時,最終 dropless Paloma macro-loss 約為 2.04。但團隊後來也明寫:這條 preregistered trajectory 假設全程維持 4K sequence length、相同 data mix 與相同 token count;實際 run 至少會在中途延長 context,而且 8 月 19 日已更新 data mix。預測方法本身也不是純粹把四條實測線延長:plot script 固定 loss asymptote 為 1.5,並用 d2048 的 60%–80% 區段外推缺失的最後 19%,再加上 0.005 修正。這些都是模型選擇,不是觀測值;目前公開的 forecast comment 與 script 也沒有附 confidence interval 或事前成功容差,日後不能只用模糊的「很接近」宣告命中。換句話說,這張圖最適合拿來監測「早期軌跡是否離譜」,不適合被改寫成「535B 模型最終能力已知」。想補上 training loss 與真正能力評測的差別,可以先讀 AlphaLab 的 AI 模型怎麼學習

18T 還是 18.75T?公開口徑尚未對齊

公告說 18.75T tokens;GitHub job summary 說 18.0T,並列出 390,139 steps;目前 pinned launcher 與 live W&B 則是 390,251 steps。以 batch 11,264、sequence length 4,096 計算:

11,264 × 4,096 × 390,251 = 18,005,144,633,344 tokens

也就是約 18.0051T。它和 18.75T 相差約 0.7449T,約為 18.75T 的 3.97%,已大到不能只當成四捨五入。80%/20% 的 phase boundary 本身對得上:live config 在第 312,192 step 切換配方,對應約 14.404T 加 3.601T tokens;但不是 Harrier metadata 所描述的 15T 加 3.75T reference allocation。

18.005T 也只是目前配置的排程上限,不是保證完成量。Hero issue 的 delay plan 明寫:若硬體故障或 MFU 降低吃掉 buffer,最多約 25% token budget 會優先用縮短 horizon 補償,再同步調整 linear LR decay 與 data mix。未來若採用這條路,團隊必須公布新上限,不能再沿用原始 18T 標籤不註記。

目前最合理的解釋是:18.75T 是 Harrier mixture 設計的 reference allocation,而 hero launcher 實際排了約 18.005T。這是由 repository 與 Hugging Face metadata 交叉推得的解釋,不是 Marin 已公開確認的更正;live config 的 target_budgetexperiment_budget 也都是 null。透明系統的價值正在這裡:矛盾不會因為簡報寫得整齊而消失,外界有資料能把它找出來;但團隊仍應把 18T/18.75T 的語意與預定最終 step 說清楚。

「整個過程公開」要拆成三個不同承諾

1. 可觀測性:範圍廣,但不是全量

外界可以看 pinned code、即時 loss、配置、問題討論、第一次 hero attempt 的中止,以及 resume OOM 修復。另一份 ongoing operational log 還記錄了截至 8 月 22 日的反覆 OOM、NVLink error、失敗的 resume 與 checkpoint stall。這比等模型完成後才發布一篇成功故事,多保留了最有研究價值的反事實:哪些路沒走通、哪些假設在中途改了;也提醒讀者,W&B 的 running 與 heartbeat 只證明追蹤 client 當時在線、步數前進,不等於整個 704-device job 沒有健康問題。

同時,這不是每一層都完整留存的飛行記錄器:live config 關閉 profiler、沒有保存 XLA dumps;PR #8467 還指出 Iris 曾把 fatal run 錯報為 succeeded,且一次 11-rack failure 的部分 logs 無法取回。若要把「可對照」提升成「執行證明」,還需要另外綁定容器與 data-manifest hashes 或 attestation;公開 code 與同名 run 提供的是可檢查 evidence。較精確的說法是「大量重要訊號公開」,不是「所有內部狀態都可觀測」。

2. 可重現性:材料豐富,但存取鏈還沒閉合

資料來源表、配方、樣本瀏覽器與 plot script 都是實質材料;然而在 2026 年 8 月 23 日 22:26 UTC(台北時間 8 月 24 日 06:26),GitHub 使用者 windsornguyen 先回報 processed Harrier store 無法匿名下載,AlphaLab 隨後對該 store 的 .artifact.json 與 list 端點重做匿名 HTTP GET,兩者同樣回傳 403 AccessDenied。這只證明那兩個特定端點在該時點無法匿名讀取,不代表所有資料都不存在,也不代表未來不會開放;但它足以說明,截至本次匿名測試,「能看配方」和「能取得訓練使用的處理後資料」仍是兩個不同層級。

匿名下載也不該被當成唯一的開放標準。Marin repository 的程式碼使用 Apache-2.0凍結的資料 provenance table 卻涵蓋異質授權與再散布限制;hero 最終權重尚未發布,自然也還無法檢查其最終授權。Open Athena 談 open development 時也承認,授權、隱私或安全可能讓部分資料與細節不能公開。若「whole process open」包含可重現性,接下來應交代的是處理後資料的合法、穩定存取方式或可重建路徑,以及哪些欄位因授權不能重發,而不是假設所有 raw/processed bytes 都能無條件鏡像。

而且,就算每個 byte 都能取得,2.7 × 1024 FLOPs 的經濟門檻仍讓多數團隊無法原樣重跑。Marin 現階段更接近可審計:別人能檢查選擇、重算數字、測試部分 pipeline;這不等於任何實驗室都能付得起完整重現。

3. 可問責性:要等預測與成品對帳

真正的考驗不是 dashboard 今天有沒有更新,而是完成後能否把 preregistered forecast、實際曲線、資料版本、checkpoint、final eval 與 post-training recipe 對在一起。若中途改了 context、data mix 或總 token 數,最好的做法不是假裝預測仍完全適用,而是保留原始版本,另外標出變更時間與新假設。

AlphaLab 的判讀:透明度不是形容詞,而是一套持續服務

公開失敗,比發布後補寫完美歷史更有價值

模型訓練真正稀缺的知識,往往不是最後那組 hyperparameter,而是「什麼訊號讓團隊決定停、改、或繼續」。d2048 在 81% 中止、hero 初次啟動失敗、checkpoint resume 遇到 OOM,這些都比一張最終 benchmark 表更能幫助下一個團隊估算風險。Marin 最值得肯定的地方,是把失敗當成研究輸出,而不是公關雜訊。

參數規模先證明工程野心,尚未證明模型能力

535B total 很吸睛,但 MoE 每個 token 實際走過約 23B active 的路徑;更重要的是,現在只有早期 training/eval telemetry,尚無已完成 hero 模型的 final checkpoint、完整 capability suite 或 post-training 結果。任何把 Marin 535B 寫成「已達 frontier 能力」的標題,都把運算規模偷換成能力。想理解 open weights 落地後仍有哪些運算與部署門檻,可對照 Kimi K3 權重落地分析

直播式公開會提高可審計性,也會暴露不一致

18T/18.75T、390,139/390,251、4K 固定預測/中途 context extension,都是公開材料彼此沒有完全同步的例子。這不是否定透明度,恰好相反:真正的透明不是資料永遠一致,而是版本差異可被發現、可被追問、最後可被更正。若 public tracker 只是資訊堆積,卻沒有不可變 snapshot/hash、可取得或可重建的 artifact 與變更註記,觀測性仍很難升級成可重現性。

我同意什麼,我存疑什麼

我同意:在結果未知時公開程式、telemetry、縮放預測與失敗,確實比單純釋出最終權重更接近可累積的科學。我存疑:「the whole process is open」現在仍是一個方向性承諾,不是已完成的二元事實;若它包含可重現性,團隊仍需交代 processed-data 的合法取得方式或重建路徑、授權邊界、token accounting、預測適用條件、最終 checkpoint 與 post-training。開放權重和完整開放不是同一件事,這也是 開放權重政策爭論一直卡住的核心。

接下來不要只看 loss:四個里程碑才決定這場實驗的份量

  • 排程是否完成:run 能否跨過早期故障、context extension 與第二階段 data mix,並留下連續、可對帳的 timeline。
  • 配置是否版本化:18T/18.75T、step count 與資料更新是否有正式說明,並留下不可變 snapshot/hash,而不是讓讀者從多個留言自行拼湊。
  • artifact 是否可取得或重建:處理後資料、永久 checkpoint、評測程式與模型權重能否有合法、穩定的存取或重建路徑,並清楚標出授權、限制與版本。
  • 預測是否兌現:最終 Paloma loss、其他 capability/safety eval 與 post-training 結果,是否和早期 scaling forecast 一起公開,包括偏離的原因。

對研究者,現在最值得收藏的是 issue #8435、pinned commit 與 W&B,而不是預先下注最終榜單;對一般讀者,最穩妥的說法是:Marin 535B 已啟動一場規模很大的公開 MoE 訓練,但能力、完工時間與「全流程開放」仍未交卷。若三個月後連失敗、變更與偏離都能完整留下,這場 run 的價值可能不只是一組權重,而是一份其他團隊真的能拿來少走彎路的航海圖。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。