2026 年 10 月 5 日,Reflection 在官網發布〈Introducing Beam: Reflection’s 501B open-weight model〉,介紹 Reflection Beam:一個宣稱有 5,010 億總參數、每個 token 啟用 230 億參數的混合專家模型。最值得追的消息其實有兩段:公司已公開跑分與訓練故事,卻把權重、模型卡與完整技術報告排在 2026 年 10 月稍後。讀這篇公告,先看它具體說了什麼,再拆開哪些結果已可核對、哪些還在等待外部驗證。

Reflection Beam 的主張:把龐大權重變成較省的逐 token 計算
原文的論點是:Beam 先用大量預訓練建立基礎,再以大規模強化學習補上寫程式、操作工具與多步推理能力。混合專家架構讓每次生成只動用模型的一部分;因此,5,010 億是整個模型的容量,230 億是官方聲稱每個 token 啟用的參數量。兩個數字回答不同問題。較少的活躍參數可能降低生成時的部分運算,卻不能單憑這個比例推斷下載大小、顯存需求、延遲或帳單。
Reflection 又稱,Beam 的預訓練用了 23.8 兆 token,強化學習階段在約 10,500 張 NVIDIA GB300 GPU 上進行四週,產生逾一億次 rollout。這些都是公司對自家訓練流程的披露,公開文章沒有附足以讓外部重建完整訓練成本的逐項帳本。原文也區分兩種長度:強化學習 rollout 的最長上下文為 256K token;它另稱 midtraining 把模型的「有效上下文」延長到 100 萬 token。後者不等於已公布一套可供外部重跑的百萬上下文驗收結果。
榜單有亮點,也有需要保留的空白
Reflection 的表格把 Beam 放在多個 coding、agent 與推理測試中。以它列出的 DeepSWE v1.1 為例,Beam 44.4、GLM 5.2 為 44.0;Terminal Bench 2.1 則是 Beam 80.1、GLM 5.2 為 81.0。這些數字顯示公司報告的成績接近某些對手,不表示我們已獨立重跑 Beam,也不足以宣告它在所有 coding 工作上追平對手。表格另有不少 NR,即該欄沒有報告成績,不能把空白當成對方失敗。
外部方法學提醒了這種比較的限度。Terminal-Bench 維護團隊說明 2.1 版修正了前版 89 題中的 28 題,原因包含外部依賴、資源配置與題目敘述。Anthropic 的原始實驗在同一模型、同一 harness、同一題集下,僅改變資源配置,就觀察到六個百分點的成績差。這不是對 Beam 的反證;它說明不到一個百分點的表格差距,需要相同版本、agent 框架、運算資源、測試次數與原始紀錄才能解讀。
「省 3–4 倍」到底量了什麼?
These estimates exclude prompt prefill, context-dependent attention operations, and serving overhead
中文:這些估算沒有納入提示詞預填、隨上下文變動的注意力運算,以及服務系統的額外成本。
Reflection,〈Introducing Beam〉圖 2 說明
原文稱 Beam 在進階推理測試中接近 GLM 5.2,生成推論運算量約少 3–4 倍;但它自己交代了計算式:以「2 × 活躍參數 × 每次作答平均生成 token」估算 forward-pass FLOPs。這是生成階段的近似量,不是電費、GPU 佔用、端到端延遲、API 價格或完成任務的總成本。長提示詞、大量並行請求與長上下文,都可能改變實際部署的排序。Artificial Analysis 的方法說明也把逐任務成本建立在實際 token 用量與價格上,與只看生成 FLOPs 是不同的問題。

一億次 rollout:訓練曲線與真實可用性之間
Reflection 把強化學習當成另一個重點:公司稱建了近百萬個任務環境,讓訓練、工具執行與評分非同步進行。它展示 DeepSWE、HLE、Terminal Bench 隨 rollout 次數增加而上升的曲線;圖 3 的橫軸是其中 reasoning expert 的約 8,000 萬次 rollout,不是把逾一億次完整訓練紀錄全部畫進去。曲線支持「在所展示的測試上,分數隨訓練推進而上升」這個較窄的描述;資料選擇、評分器穩定性與新任務遷移仍要等技術細節。

原文還談到專家負載平衡、訓練時的數值穩定、可控制的 reasoning effort,以及安全模型蒸餾。這些細節讓 Beam 的故事超出一張排行榜:公司想證明自己有持續訓練大型開放權重模型的基礎設施。不過,安全評估結果同樣排在後續技術報告;目前可核對的是 Reflection 公開了這套方法與圖表,而非外部已審核整條訓練流水線。
開放權重的承諾,還差可下載與可重跑的一步
Beam is undergoing final red-teaming and evaluations.
中文:Beam 正在進行最後階段的對抗測試與評估。
Reflection,〈Introducing Beam〉
Reflection 說會在 2026 年 10 月稍後以 Apache 2.0 授權發布權重,並補上模型卡、技術報告及開發工具;現階段提供的是早期使用登記。截至 10 月 6 日,原文呈現的是預告和候補入口。因此,「計畫開放權重」是合適的描述,「已能下載、審視與自行部署」則要留到檔案、授權與執行文件真正可取得時再說。對照 Kimi K3 權重落地後的部署門檻,即使未來檔案公開,501B 總參數仍會牽涉儲存、記憶體、分片與服務成本,23B 活躍參數不能直接當成硬體需求。
AlphaLab 的判讀:值得關注,但下一個證據比下一張榜單重要
我同意的部分:Reflection 把模型容量、逐 token 活躍參數、強化學習基礎設施和生成運算量放在同一篇文章,讓讀者看見它的工程賭注。若權重、模型卡和工具如期公開,研究者可以檢查架構、運行成本與限制,開發者也多了一個可選模型。本地 AI 硬體成本的討論提醒我們:能否實際運行,往往由整套系統決定。
我存疑的部分:目前最醒目的能力數字與訓練規模,都來自模型提供者;「省 3–4 倍」用的是有明確排除項目的 FLOPs 估算。這些可以成為測試假設,還不能直接變成採購或遷移結論。尤其 coding agent 的成效受 harness 與執行環境影響;Agent harness 的設計與模型本身應該分開驗收。
如果你正在評估 Reflection Beam,先記下原文這三個可對帳承諾:Apache 2.0 權重、模型卡與技術報告、可執行的開發工具。等它們出現,再以同一批自己的 coding 任務和相同 agent 設定,比較完成率、每題 token、總耗時與總費用。公開題與封存題的測試方法能幫你避免只挑模型見過的題;若目標是本機部署,先用 記憶體與 Agent 驗收框架估算承受能力。下一步不是替 Beam 排名,而是等可重跑的材料到手。
接著閱讀
左右滑動查看更多推薦
