2026 年 9 月 20 日,StepFun 透過官方 X公布官網介紹〈Step 5 Preview: Advancing the Pareto Frontier〉,把 Step 5 Preview 定位成面向 agentic work 的新旗艦模型:StepFun 公布它採稀疏 MoE 架構,共 600B 參數、每個 token 啟用 27B,支援 1M token 輸入與視覺理解,API 已可使用。
我的結論先放前面:Step 5 Preview 真正值得注意的不是「旗艦」兩個字,而是 Artificial Analysis 測得 44 分、每秒輸出 99.8 token,官方 API 定價又只有每百萬輸入 token 1 美元、輸出 2.70 美元。這組價格效能確實有吸引力;但 1M context 的品質、官方 agent demo 的可重現性,以及 10 月 15 日才承諾釋出的 open weights,都還不能用一張發表圖直接下定論。
這次發布也迅速引起工程師社群注意。截至 2026 年 9 月 21 日 06:17(台北時間),Hacker News 討論串有 127 points、33 則留言;熱度同時帶來對低價的興趣與對 demo 證據的檢查。以下先忠實還原 StepFun 的主張,再用第三方測量拆解成本、速度與長上下文,最後給出採用前該怎麼測的判斷框架。

Step 5 Preview 的核心主張:把智慧與成本一起往外推
The Pareto frontier marks the best trade-offs between intelligence and cost. Progress begins when that boundary shifts outward.
中文:Pareto frontier 代表智慧與成本之間最好的取捨;當這條邊界向外移動,進步才真正發生。
StepFun,〈Step 5 Preview: Advancing the Pareto Frontier〉
這句話比「又一個更大的模型」更接近發布的核心。StepFun 想證明的不是 Step 5 在每一項能力都第一,而是它能在相近智慧水準下,把 API 成本、輸出速度與可承接的任務長度推到更有用的位置。為此,官方把發布內容分成三條主線:軟體工程、專業知識工作,以及讓模型參與模型研發本身。
| 官方規格 | Step 5 Preview | 讀法 |
|---|---|---|
| 模型架構 | 稀疏 MoE;600B 總參數、每 token 啟用 27B | 這是 StepFun 公布的規格,公開頁面尚未提供足以完整重現路由與訓練的技術報告 |
| 輸入/輸出 | 最大輸入 1M token;最大輸出 64K token | 容量上限不等於在所有長度都維持同等準確度 |
| 模態 | 文字、圖片、影片輸入;文字輸出 | 發布頁主打 vision,較完整的影片支援來自 API 文件 |
| API 能力 | tool calling、streaming、JSON mode/schema、prompt caching | 搜尋、執行程式與外部工具仍由整合應用提供 |
| 官方 API 定價(美元) | 每百萬 token:輸入 1 美元、快取命中 0.05 美元、輸出 2.70 美元 | 輸出計費包含 reasoning token 與最終回答 |
上述功能與上限可在官方模型文件核對,價格則以模型專屬定價表為準。這裡最容易忽略的一點是:低 token 單價只決定帳單的一部分,模型輸出多少、跑幾個工具回合、失敗後重試幾次,才決定任務最後花多少錢。
44 分、99.8 tokens/s:低價是真的,但不是全部
Artificial Analysis 的獨立模型頁在 2026 年 9 月 21 日顯示,Step 5 Preview 的 Intelligence Index v4.3.2 是 44 分,輸出速度為 99.8 tokens/s,time to first answer token 約 23.01 秒;其 Intelligence Index 每項任務的加權平均成本為 0.71 美元。這組數字支持 StepFun 的價格效能方向,但不等於已證明它是所有工作負載的總冠軍。

| Artificial Analysis 快照(2026-09-21 06:17,台北時間) | Index | 每項任務成本 | 輸出速度 | 標示 context |
|---|---|---|---|---|
| Step 5 Preview | 44 | 0.71 美元 | 99.8 tok/s | 1M |
| Kimi K3 max | 44 | 2.00 美元 | 39 tok/s | 約 1.05M |
| Grok 4.6 high | 44 | 1.86 美元 | 60 tok/s | 500K |
| GLM-5.3 max | 45 | 2.01 美元 | 72 tok/s | 1M |
| DeepSeek V4.1 Flash max | 39 | 0.27 美元 | 207 tok/s | 1M |
在這組同頁可核對的模型裡,Step 5 Preview 呈現出明顯的價格效能取捨:同為 44 分的 Kimi K3 max 與 Grok 4.6 high 更慢、每項任務更貴;GLM-5.3 max 高約 1 分,但任務成本接近三倍;DeepSeek V4.1 Flash max 更便宜、更快,分數則低約 5 分。這是特定評測與當前供應商端點下的 Pareto 位置,不是對每個模型、每種 workload 的普遍定理。
還有一個反直覺細節:Artificial Analysis 的完整 Index 測試中,Step 5 Preview 產生約 1.56 億個輸出 token,頁面顯示的同類模型中位數約 9,200 萬;加權後每項任務約輸出 6.4 萬 token。也就是說,2.70 美元的輸出牌價很低,但模型偏長的 reasoning 與回答可能吃掉部分優勢。真正該算的是:
每次成功任務成本=所有輸入、reasoning、回答、工具與重試成本,除以真正通過驗收的任務數。
1M context 是容量,品質證據不能直接外推到 1M
StepFun 文件把最大輸入列為 1M token,這對大型程式庫、跨年報表與長時間 agent 很重要;但「放得進去」與「在最遠位置仍能正確推理」是兩個問題。Artificial Analysis 的 AA-LCR v1.1測得 Step 5 Preview 為 88.3%,只略低於 Kimi K3 的 88.7%,是相當強的第三方訊號;然而該測試輸入涵蓋 10K 至 100K token,不能拿 88.3% 直接宣稱 1M 端到端品質也已被驗證。
這個差異會直接影響產品設計。若 agent 只是在 1M 視窗裡塞滿原始紀錄,模型可能花更多 token 找線索,卻沒有更高的成功率;較穩健的做法仍是分層檢索、摘要、引用定位與長度分桶測試,再觀察答案是否能指出正確證據位置。想進一步建立自己的測試集,可參考 AlphaLab 的模型 shadow eval 與回歸診斷。
Agent demo 很有野心,也留下可驗證性缺口
StepFun 發布頁用大量長任務展示 Step 5 Preview:從修改程式、製作互動網站,到 24 小時最佳化 H100 kernel、整理 17 張試算表,再到玩 Pokémon 超過 3,000 回合。官方也公布 DeepSWE 67.7、Terminal-Bench v4 33.3、DRACO 83.3 等成績。這些材料說明 StepFun 想解決的任務形狀,卻不是同等強度的證據:部分 benchmark 是 StepFun 自建,部分 demo 沒有公開完整 prompt、trace、程式庫與逐步驗收結果。

最具體的爭議出現在 Room Planner 影片。StepFun 官方影片畫面可見工作區已存在專案、README 與資產,推理文字也直接判斷「已有現成專案」;片中另出現一次 OpenAI API error (403)。Hacker News 留言因此質疑這不是從空白環境開始的完整生成紀錄。
合理結論要停在證據邊界內:這支影片無法證明畫面裡那次 session 從零建成成品,屬於不完整、不可稽核的 demo;它也沒有證明作品造假或由 OpenAI 模型完成。StepFun 官方開發文件本來就示範以 OpenAI SDK 連到 StepFun 的相容端點,因此錯誤名稱可以來自客戶端協定層。真正需要補的是可下載的乾淨起始狀態、完整 trace、commit 與可重跑驗收,而不是從一行錯誤訊息猜模型身分。
Open weights 是 10 月 15 日的承諾,不是目前狀態
Open weights on Oct 15.
中文:10 月 15 日開放權重。
StepFun 官方 X,2026 年 9 月 20 日
這個時間點應被當成未來承諾,而不是已完成的發布。截至 2026 年 9 月 21 日,Artificial Analysis 仍把 Step 5 Preview 標示為 proprietary;StepFun 這則公告也沒有交代 license、商用與衍生模型條款。即使 10 月 15 日如期提供權重,600B 總參數的模型也不會因 API 便宜就突然容易自架:儲存、記憶體、路由、量化、KV cache 與 1M 序列的基礎設施,仍是另一套成本問題。
因此,想追蹤「權重可下載」與「可合法、可負擔地部署」之間的差距,可以先看 AlphaLab 的本地 LLM VRAM 與硬體估算指南;兩者從來不是同一個判斷。
AlphaLab 判讀:Step 5 推進了採購曲線,還沒完成信任曲線
一、價格效能不是空話,但只在量測條件內成立
44 分、99.8 tokens/s 與 0.71 美元/任務來自發布方以外的測量,足以讓 Step 5 Preview 進入 agent API 的候選清單。這組數字也足以讓成本敏感、願意用自有驗收集做路由的團隊把它列入候選;是否適合高輸出量工作負載,仍要把約 6.4 萬輸出 token/任務的偏長輸出算進去。截至 2026 年 9 月 21 日,官方模型文件只列出 step-5-preview 這個未帶日期或版本後綴的 model ID;Artificial Analysis 的 provider 頁當時也只收錄 StepFun 自家端點。這代表版本鎖定與多供應商備援仍缺少公開證據,今天測得的分數、速度與行為不宜被視為永久合約。
二、1M 的價值在降低切割壓力,不是免除資訊架構
大視窗能讓模型看到更多原始材料,但它不會自動解決證據衝突、舊資訊污染、注意力分散與權限過寬。真正可靠的長任務系統,仍需要檢索、引用、狀態管理、工具邊界與可觀測性。若讀者想比較另一個 1M context、超大型 MoE 的案例,可延伸看騰訊 HY 4 Preview 的規格與證據拆解。
三、demo 的缺口應降低信心,不應取代判斷
Room Planner 的既有專案確實讓「從零完成」的暗示失去證據力;但從這裡跳到「模型沒能力」同樣超出證據。最好的回應不是替廠商辯護或直接定罪,而是把 demo 降級成線索,把可重跑 benchmark、真實工作樣本與失敗紀錄升級成決策依據。
我同意的部分:StepFun 把 44 分的獨立評測結果放進明顯較低的 API 價格帶,這會迫使模型採購從品牌排名轉向成功任務成本;1M 輸入與 64K 輸出也提供了有價值的系統設計空間。
我存疑的部分:官方長任務與內部 benchmark 的重現材料不足,1M 品質尚不能由 100K 測試外推,open weights 的 license 與可部署性也要等正式發布後才能評估。這些不是否定模型,而是把「已量到的優勢」與「尚待驗證的承諾」分開。
團隊現在該怎麼測 Step 5 Preview?
- 先挑 20 至 50 個真實任務。納入長程式修改、多文件核對、工具呼叫與需要回滾的失敗案例,不用發布 demo 當測試集。
- 固定 agent harness。相同 prompt、工具、權限、timeout、重試與驗收規則下,對照現行模型與 Step 5 Preview;否則比較到的是系統差異。
- 按 context 長度分桶。至少分成短、10K–100K、100K 以上,記錄引用命中、遺漏、矛盾與位置偏差,不只看是否能送入 API。
- 計算成功任務成本。同時保留總 token、reasoning token、工具回合、牆鐘時間、人工修正與失敗重試,避免低單價掩蓋長輸出。
- 把 preview 當可回滾的路由候選。先小流量 shadow test,再依任務類型逐步放量;正式權重、license 與模型版本出現後,再另外評估自架。
如果你正建立多模型路由,可把 Step 5 Preview 放進「高 context、成本敏感」那一格,再用AI 模型路由與評測實戰把任務難度、成功率與成本接起來。真正的勝負不在一張榜,而在同一批工作能否更穩定、快速且便宜地通過驗收。
接著閱讀
左右滑動查看更多推薦
下一步很簡單:在 10 月 15 日之前先用 API 畫出自己的「通過率對成功任務成本」曲線;等權重與 license 真正出現,再把部署成本放進同一張圖。
