跳到主要內容

Step 5 Preview:1M Context、44 分與低價 API,真的推進 Pareto Frontier?(2026)

最後更新: ·
Step 5 Preview 44 分與低價 API 的價格效能判讀

2026 年 9 月 20 日,StepFun 透過官方 X公布官網介紹〈Step 5 Preview: Advancing the Pareto Frontier〉,把 Step 5 Preview 定位成面向 agentic work 的新旗艦模型:StepFun 公布它採稀疏 MoE 架構,共 600B 參數、每個 token 啟用 27B,支援 1M token 輸入與視覺理解,API 已可使用。

我的結論先放前面:Step 5 Preview 真正值得注意的不是「旗艦」兩個字,而是 Artificial Analysis 測得 44 分、每秒輸出 99.8 token,官方 API 定價又只有每百萬輸入 token 1 美元、輸出 2.70 美元。這組價格效能確實有吸引力;但 1M context 的品質、官方 agent demo 的可重現性,以及 10 月 15 日才承諾釋出的 open weights,都還不能用一張發表圖直接下定論。

這次發布也迅速引起工程師社群注意。截至 2026 年 9 月 21 日 06:17(台北時間),Hacker News 討論串有 127 points、33 則留言;熱度同時帶來對低價的興趣與對 demo 證據的檢查。以下先忠實還原 StepFun 的主張,再用第三方測量拆解成本、速度與長上下文,最後給出採用前該怎麼測的判斷框架。

StepFun 官方 Step 5 Preview 發布頁面
圖/StepFun(點圖閱讀官方發布頁)

Step 5 Preview 的核心主張:把智慧與成本一起往外推

The Pareto frontier marks the best trade-offs between intelligence and cost. Progress begins when that boundary shifts outward.

中文:Pareto frontier 代表智慧與成本之間最好的取捨;當這條邊界向外移動,進步才真正發生。

StepFun,〈Step 5 Preview: Advancing the Pareto Frontier〉

這句話比「又一個更大的模型」更接近發布的核心。StepFun 想證明的不是 Step 5 在每一項能力都第一,而是它能在相近智慧水準下,把 API 成本、輸出速度與可承接的任務長度推到更有用的位置。為此,官方把發布內容分成三條主線:軟體工程、專業知識工作,以及讓模型參與模型研發本身。

官方規格Step 5 Preview讀法
模型架構稀疏 MoE;600B 總參數、每 token 啟用 27B這是 StepFun 公布的規格,公開頁面尚未提供足以完整重現路由與訓練的技術報告
輸入/輸出最大輸入 1M token;最大輸出 64K token容量上限不等於在所有長度都維持同等準確度
模態文字、圖片、影片輸入;文字輸出發布頁主打 vision,較完整的影片支援來自 API 文件
API 能力tool calling、streaming、JSON mode/schema、prompt caching搜尋、執行程式與外部工具仍由整合應用提供
官方 API 定價(美元)每百萬 token:輸入 1 美元、快取命中 0.05 美元、輸出 2.70 美元輸出計費包含 reasoning token 與最終回答

上述功能與上限可在官方模型文件核對,價格則以模型專屬定價表為準。這裡最容易忽略的一點是:低 token 單價只決定帳單的一部分,模型輸出多少、跑幾個工具回合、失敗後重試幾次,才決定任務最後花多少錢。

44 分、99.8 tokens/s:低價是真的,但不是全部

Artificial Analysis 的獨立模型頁在 2026 年 9 月 21 日顯示,Step 5 Preview 的 Intelligence Index v4.3.2 是 44 分,輸出速度為 99.8 tokens/s,time to first answer token 約 23.01 秒;其 Intelligence Index 每項任務的加權平均成本為 0.71 美元。這組數字支持 StepFun 的價格效能方向,但不等於已證明它是所有工作負載的總冠軍。

StepFun 發布頁以 Artificial Analysis 任務成本與智慧分數呈現 Step 5 Preview 的 Pareto frontier
圖/StepFun、Artificial Analysis。這張發布圖用 Intelligence Index 分數與每項任務成本呈現 Step 5 Preview 的位置;模型、評測版本與推理設定不同時,位置也可能改變。
Artificial Analysis 快照(2026-09-21 06:17,台北時間)Index每項任務成本輸出速度標示 context
Step 5 Preview440.71 美元99.8 tok/s1M
Kimi K3 max442.00 美元39 tok/s約 1.05M
Grok 4.6 high441.86 美元60 tok/s500K
GLM-5.3 max452.01 美元72 tok/s1M
DeepSeek V4.1 Flash max390.27 美元207 tok/s1M

在這組同頁可核對的模型裡,Step 5 Preview 呈現出明顯的價格效能取捨:同為 44 分的 Kimi K3 max 與 Grok 4.6 high 更慢、每項任務更貴;GLM-5.3 max 高約 1 分,但任務成本接近三倍;DeepSeek V4.1 Flash max 更便宜、更快,分數則低約 5 分。這是特定評測與當前供應商端點下的 Pareto 位置,不是對每個模型、每種 workload 的普遍定理。

還有一個反直覺細節:Artificial Analysis 的完整 Index 測試中,Step 5 Preview 產生約 1.56 億個輸出 token,頁面顯示的同類模型中位數約 9,200 萬;加權後每項任務約輸出 6.4 萬 token。也就是說,2.70 美元的輸出牌價很低,但模型偏長的 reasoning 與回答可能吃掉部分優勢。真正該算的是:

每次成功任務成本=所有輸入、reasoning、回答、工具與重試成本,除以真正通過驗收的任務數。

1M context 是容量,品質證據不能直接外推到 1M

StepFun 文件把最大輸入列為 1M token,這對大型程式庫、跨年報表與長時間 agent 很重要;但「放得進去」與「在最遠位置仍能正確推理」是兩個問題。Artificial Analysis 的 AA-LCR v1.1測得 Step 5 Preview 為 88.3%,只略低於 Kimi K3 的 88.7%,是相當強的第三方訊號;然而該測試輸入涵蓋 10K 至 100K token,不能拿 88.3% 直接宣稱 1M 端到端品質也已被驗證。

這個差異會直接影響產品設計。若 agent 只是在 1M 視窗裡塞滿原始紀錄,模型可能花更多 token 找線索,卻沒有更高的成功率;較穩健的做法仍是分層檢索、摘要、引用定位與長度分桶測試,再觀察答案是否能指出正確證據位置。想進一步建立自己的測試集,可參考 AlphaLab 的模型 shadow eval 與回歸診斷

Agent demo 很有野心,也留下可驗證性缺口

StepFun 發布頁用大量長任務展示 Step 5 Preview:從修改程式、製作互動網站,到 24 小時最佳化 H100 kernel、整理 17 張試算表,再到玩 Pokémon 超過 3,000 回合。官方也公布 DeepSWE 67.7、Terminal-Bench v4 33.3、DRACO 83.3 等成績。這些材料說明 StepFun 想解決的任務形狀,卻不是同等強度的證據:部分 benchmark 是 StepFun 自建,部分 demo 沒有公開完整 prompt、trace、程式庫與逐步驗收結果。

StepFun 公布 Step 5 Preview 與其他模型進行 H100 MLA kernel 最佳化的 24 小時曲線
圖/StepFun。官方表示每個模型執行四次、取最佳結果,Step 5 Preview 在約 22 小時達 508 TFLOPS;頁面未提供足以獨立重跑的完整 trace 與程式碼。

最具體的爭議出現在 Room Planner 影片。StepFun 官方影片畫面可見工作區已存在專案、README 與資產,推理文字也直接判斷「已有現成專案」;片中另出現一次 OpenAI API error (403)Hacker News 留言因此質疑這不是從空白環境開始的完整生成紀錄。

合理結論要停在證據邊界內:這支影片無法證明畫面裡那次 session 從零建成成品,屬於不完整、不可稽核的 demo;它也沒有證明作品造假或由 OpenAI 模型完成。StepFun 官方開發文件本來就示範以 OpenAI SDK 連到 StepFun 的相容端點,因此錯誤名稱可以來自客戶端協定層。真正需要補的是可下載的乾淨起始狀態、完整 trace、commit 與可重跑驗收,而不是從一行錯誤訊息猜模型身分。

Open weights 是 10 月 15 日的承諾,不是目前狀態

Open weights on Oct 15.

中文:10 月 15 日開放權重。

StepFun 官方 X,2026 年 9 月 20 日

這個時間點應被當成未來承諾,而不是已完成的發布。截至 2026 年 9 月 21 日,Artificial Analysis 仍把 Step 5 Preview 標示為 proprietary;StepFun 這則公告也沒有交代 license、商用與衍生模型條款。即使 10 月 15 日如期提供權重,600B 總參數的模型也不會因 API 便宜就突然容易自架:儲存、記憶體、路由、量化、KV cache 與 1M 序列的基礎設施,仍是另一套成本問題。

因此,想追蹤「權重可下載」與「可合法、可負擔地部署」之間的差距,可以先看 AlphaLab 的本地 LLM VRAM 與硬體估算指南;兩者從來不是同一個判斷。

AlphaLab 判讀:Step 5 推進了採購曲線,還沒完成信任曲線

一、價格效能不是空話,但只在量測條件內成立

44 分、99.8 tokens/s 與 0.71 美元/任務來自發布方以外的測量,足以讓 Step 5 Preview 進入 agent API 的候選清單。這組數字也足以讓成本敏感、願意用自有驗收集做路由的團隊把它列入候選;是否適合高輸出量工作負載,仍要把約 6.4 萬輸出 token/任務的偏長輸出算進去。截至 2026 年 9 月 21 日,官方模型文件只列出 step-5-preview 這個未帶日期或版本後綴的 model ID;Artificial Analysis 的 provider 頁當時也只收錄 StepFun 自家端點。這代表版本鎖定與多供應商備援仍缺少公開證據,今天測得的分數、速度與行為不宜被視為永久合約。

二、1M 的價值在降低切割壓力,不是免除資訊架構

大視窗能讓模型看到更多原始材料,但它不會自動解決證據衝突、舊資訊污染、注意力分散與權限過寬。真正可靠的長任務系統,仍需要檢索、引用、狀態管理、工具邊界與可觀測性。若讀者想比較另一個 1M context、超大型 MoE 的案例,可延伸看騰訊 HY 4 Preview 的規格與證據拆解

三、demo 的缺口應降低信心,不應取代判斷

Room Planner 的既有專案確實讓「從零完成」的暗示失去證據力;但從這裡跳到「模型沒能力」同樣超出證據。最好的回應不是替廠商辯護或直接定罪,而是把 demo 降級成線索,把可重跑 benchmark、真實工作樣本與失敗紀錄升級成決策依據。

我同意的部分:StepFun 把 44 分的獨立評測結果放進明顯較低的 API 價格帶,這會迫使模型採購從品牌排名轉向成功任務成本;1M 輸入與 64K 輸出也提供了有價值的系統設計空間。

我存疑的部分:官方長任務與內部 benchmark 的重現材料不足,1M 品質尚不能由 100K 測試外推,open weights 的 license 與可部署性也要等正式發布後才能評估。這些不是否定模型,而是把「已量到的優勢」與「尚待驗證的承諾」分開。

團隊現在該怎麼測 Step 5 Preview?

  1. 先挑 20 至 50 個真實任務。納入長程式修改、多文件核對、工具呼叫與需要回滾的失敗案例,不用發布 demo 當測試集。
  2. 固定 agent harness。相同 prompt、工具、權限、timeout、重試與驗收規則下,對照現行模型與 Step 5 Preview;否則比較到的是系統差異。
  3. 按 context 長度分桶。至少分成短、10K–100K、100K 以上,記錄引用命中、遺漏、矛盾與位置偏差,不只看是否能送入 API。
  4. 計算成功任務成本。同時保留總 token、reasoning token、工具回合、牆鐘時間、人工修正與失敗重試,避免低單價掩蓋長輸出。
  5. 把 preview 當可回滾的路由候選。先小流量 shadow test,再依任務類型逐步放量;正式權重、license 與模型版本出現後,再另外評估自架。

如果你正建立多模型路由,可把 Step 5 Preview 放進「高 context、成本敏感」那一格,再用AI 模型路由與評測實戰把任務難度、成功率與成本接起來。真正的勝負不在一張榜,而在同一批工作能否更穩定、快速且便宜地通過驗收。

下一步很簡單:在 10 月 15 日之前先用 API 畫出自己的「通過率對成功任務成本」曲線;等權重與 license 真正出現,再把部署成本放進同一張圖。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。