2026 年 8 月 3 日,Qwen Team 在官方網站發布〈Qwen3.8-Max: A New Bar for Coding and Cowork〉,讓 Qwen3.8-Max 以 qwen3.8-max 名稱正式上線 QwenCloud。官方給出的規格很醒目:2.4 兆總參數、95B active、100 萬 token context;API 牌價則是每百萬 token 輸入 2 美元、輸出 6 美元。更吸睛的是,Qwen 預告 Max 權重「下週」公開;27B 也將開放權重,但沒有明定同週或同日釋出。
這次發布同時碰到能力、價格、開放權重三個常見討論面向。8 月 3 日正式發布的官方 X 貼文截至 8 月 5 日觀測時約有 669 萬瀏覽、2.26 萬讚與約 2,800 次轉發;Hacker News 討論則累積 1,101 分、逾 600 則留言。注意力是真的,但注意力不是能力證明;而且這也不是 Qwen3.8 第一次亮相,Preview 早在 7 月 19 日就已形成高互動節點。Qwen3.8-Max 是本輪模型發布潮的焦點之一,但公開數據不足以判定由它「引爆」,或把熱度推上第幾個高峰。
先把原文放在這裡。點擊下面的官方公告截圖,可以在新分頁讀完整英文文章。接下來我會先忠實整理 Qwen 的主張,再核對價格、benchmark 與公開紀錄,最後回答最重要的問題:它現在能不能取代封閉前沿模型?

一、先釐清:上線的是 API,權重還沒到
Qwen3.8-Max 目前最確定的產品狀態,是託管 API 已經上線。QwenCloud 模型頁列出文字、圖片與影片輸入、文字輸出,以及 1M context;官方文章也提供 OpenAI 與 Anthropic 相容介面的範例,模型 ID 是 qwen3.8-max。
“Qwen3.8-Max is now available through QwenCloud.”
中文:「Qwen3.8-Max 現已透過 QwenCloud 提供。」
— Qwen Team
官方把它列為 2.4T 總參數、95B active 的大型 MoE 模型,意味著計算不是讓全部 2.4T 權重同時參與;「95B active」的精確計數口徑仍待技術文件說明。截至 2026 年 8 月 5 日,官方公告與模型頁尚未提供 expert 數量、routing 設定、訓練資料組成或授權條款,這些空白不能從 Qwen3.5 的架構反推。
“The model weights will be open-sourced on Hugging Face and ModelScope next week.”
中文:「模型權重將於下週在 Hugging Face 與 ModelScope 公開。」
— Qwen Team
關鍵在未來式。Qwen 的8 月 3 日公告明確把「下週」放在 Max 權重上;同文只說 Qwen3.8-27B 也將開放權重,沒有給出同週或同日承諾。截至 2026 年 8 月 5 日查核時,Qwen 官方 Hugging Face 公開清單與 ModelScope 公開清單都還找不到精確的 Qwen3.8 repository。換句話說:API 已發布;Max 與 27B 權重已預告,但現階段不能寫成「已開源」或「已開放權重」。
即使權重如期出現,「開放權重」也不自動等於「開源」。前者表示可以取得模型參數;後者還牽涉授權、程式碼、訓練方法與可重現性。真正的判定點,是 repository、license、model card 與檔案 hash,而不是發布貼文裡的一句預告。
二、價格為何讓市場坐直?同量 token 帳單只要 8 美元
能力要經過實測,價格卻可以立刻計算。Qwen3.8-Max 模型頁目前列出的牌價是每百萬輸入 token 2 美元、輸出 6 美元,隱式快取輸入為 0.25 美元;相較通用價目表上的 Qwen3.7-Max(2.5/7.5 美元),新模型輸入與輸出都便宜 20%。
| 模型 | 每百萬輸入 token | 每百萬輸出 token | 100 萬輸入+100 萬輸出的純 token 帳單 |
|---|---|---|---|
| Qwen3.8-Max | US$2 | US$6 | US$8 |
| Qwen3.7-Max | US$2.5 | US$7.5 | US$10 |
| GPT-5.6 Sol(單次輸入 ≤272K) | US$5 | US$30 | US$35 |
| Claude Fable 5 | US$10 | US$50 | US$60 |
用同量 token 的抽象化工作量比較,Qwen3.8-Max 的 8 美元約是 GPT-5.6 Sol 的四分之一、Fable 5 的七分之一。這不是「同等能力只賣七分之一」——品質、延遲、拒答率、推理 token 與工具費都沒有被納入——但這個價差已足以讓 Qwen3.8-Max 值得直接進入實測 shortlist,再由每個團隊用自己的任務決定要不要支付更高的前沿模型溢價。
三、原文真正想賣的,不只是分數,而是「長任務」
Qwen 把 Qwen3.8-Max 定位成 coding 與 cowork 模型,最重的篇幅不是聊天,而是能不能在上百、上千次操作後仍維持目標。官方列出的案例包括:
- 自主軟體專案:官方稱模型連續工作約 16 天,建立 oh-my-cli,截至其統計點累積 265 次 commit、127 個 PR 與 151 個 issue。
- 研究重現:官方稱一次任務運行約 125 小時,產出 7,600 行程式碼、執行 1,100 次操作與 33 次訓練;模型設計的新資料挑選方法,使被微調的 Qwen3-8B 在 AIME24 從 49.58% 升至 52.29%,較重現的論文方法增加 2.71 個百分點。
- 晶片最佳化:官方稱模型走過約 500 turn、71 次評估,把邏輯閘從 8,298 個降到 678 個,並減少 81% die area。
- 模擬電商營運:官方展示超過 2,000 次互動、模擬一整個營運年度的 E-Commerce Bench;這不是模型在真實世界連續運行一年。
這些故事的價值,是證明系統確實留下了可看的產物,而不只是一次回答的漂亮截圖;但它們仍是 Qwen 控制環境裡的案例研究,不是第三方稽核。以 oh-my-cli 為例,公開 repository 與大量活動紀錄的確存在,README 也同時寫明 governance plane 由獨立維護者帳號 qqqys 維護,bot 可以提議治理變更,卻不能自行套用。公開紀錄不足以獨立證明所有 commit 都由模型在零人類介入下完成。這提醒我們:「長時間自主工作」與「完全無人監督」不是同一件事。
四、官方 benchmark 很強,但自己也留下了反例
只看 Qwen 官方總表,Qwen3.8-Max 已經進入封閉前沿模型的競爭區。它在 IFBench、HealthBench、WideSearch 與部分多模態、專業任務領先,也在 PaperBench 的 Code-Dev variant 自報 93.0。不過,官方表格本身就足以反駁「全面取代」:

| 官方表格項目 | Qwen3.8-Max | 表中較佳模型 |
|---|---|---|
| SWE-bench Pro | 67.7 | Fable 5:80.0 |
| Terminal-Bench 2.1 | 86.6 | GPT-5.6 Sol:88.8 |
| FrontierSWE | 73.5 | Fable 5:88.8 |
| JobBench | 53.4 | Fable 5:57.4 |
| Agents’ Last Exam(Score) | 52.4 | GPT-5.6 Sol:53.6 |
PaperBench 的 93.0 尤其容易被誤讀。Qwen 的註腳寫的是 BasicAgent「Code-Dev」模式、由 Claude Opus 4.6 評分,取三次平均且每次最多 12 小時:它檢查 agent 是否寫出所需實作,卻跳過完整 PaperBench 最關鍵的 GPU 執行與結果比對。PaperBench 官方文件把這個 variant 定義成成本較低、但嚴謹度也較低。因此,正確寫法是「在 Code-Dev 程式開發 variant 自報 93 分」,不是「成功重現 93% 論文」。
外部訊號比較正面,也仍需限定。在 2026 年 8 月 1 日榜面快照中,Arena Code給出的 point rank 是第 4(1668±18、rank spread 2–4、1,563 票),Vision 榜是第 2(1305±9、rank spread 1–11、5,038 票),Text 榜是第 5(1496±10、rank spread 1–17、3,327 票)。三榜都標示 Preliminary;其中 Code 衡量的是 WebDev/前端生成的人類偏好。它們支持「人類偏好與視覺能力有競爭力」,卻不能外推成一般軟體工程或十天 agent 任務的可靠度。
五、分數背後還有一個模型之外的變數:harness
Agent 不是裸模型。實際成績更接近一個乘法式系統:模型 × prompt × harness × 工具 × token/時間預算 × 驗證器。任何一項不同,都可能改變最後分數。Qwen 自己公布的跨 harness 圖,就是最好的證據。

官方表格的比較也不是完整的 apples-to-apples:Terminal-Bench 對 Qwen 使用 Claude Code、avg@10、五小時與 131,072 token 預算,其他模型則採 Terminus 2 或 Codex 等不同 harness 的公開分數;SkillsBench 對不同模型分別用 Claude Code、Codex 與 OpenCode;WideSearch 對外部模型用 Claude Code,對 Qwen 用 Qwen-Agent。SWE-bench Pro 的 67.7 則來自 Qwen 自行修正題目後的 refined set;文章沒有公開修正清單與版本 hash,因此只能在廠商表格內比較,不能直接對照官方 public leaderboard。這些設定可以展示一個「產品組合」能做到什麼,卻不能乾淨地隔離裸模型能力。
因此,讀 benchmark 最重要的不是找最高的粗體數字,而是問四件事:題庫是不是公開?版本能不能重跑?harness 與預算是否一致?失敗軌跡有沒有被保留?若這四個問題沒有答案,分數就比較像行銷座標,而不是採購保證。想建立自己的判準,可以搭配 AlphaLab 的AI Evals 實作指南,把真正的工作流程變成可測、可回歸的測試集。
六、約 669 萬瀏覽與逾 600 則留言,究竟證明了什麼?
這些數字只證明發布命題獲得高互動;Hacker News 最大的討論分支顯示,其中一群留言者特別關注 27B 能否本地部署、需要什麼硬體、能不能微調。另有一個分支在問,8 月 3 日以 qwen3.8-max 名稱發布的模型,和 7 月 19 日 Preview 到底差在哪裡。Qwen 沒有在公告中完整列出 checkpoint 差分,所以不應把兩者簡化成單純改名,也不應假設兩者完全相同。
時間順序也很重要。截至 8 月 5 日觀測時,7 月 19 日的 Preview 官方 X 已累積約 836 萬瀏覽,HN 有 961 分、731 則留言;8 月 3 日正式發布公告也形成高互動節點。兩則貼文累積互動的時間不同,不能拿絕對數字直接比較哪一次是更高的「峰」。這就是為什麼「成為本輪發布潮焦點之一」比「引爆本輪發布潮」更準確。
互動數字還有一個常見陷阱:它量的是「這個命題值得談」,不是「命題已被證明」。低價、開放權重承諾與中國大型模型挑戰封閉前沿模型,本來就同時具有技術、商業與地緣敘事張力。轉發越多,只能說這個故事越有傳播力,不能替 benchmark 補上第三方稽核。
七、AlphaLab 的判讀:它改寫的是價格門檻,不是能力定律
判讀一:最硬的現況是價格,不是「全面領先」
Qwen3.8-Max 最值得注意的地方,不是每一項 benchmark 都第一,而是把一部分前沿能力壓到更低的 API 價格。在固定純 token 預算、用量相同且品質可接受的前提下,約 4.4 到 7.5 倍的牌價差理論上可容納更多重試、並行 agent 或驗證;實際總成本仍須把延遲、失敗率、工具費與人工驗收一起實測。
判讀二:開放權重是選擇權,還不是已交付資產
「下週釋出」也讓討論提前轉向本地部署、微調與主權控制,但在檔案與授權出現前,這只是一張選擇權。若完整 checkpoint 以未量化 BF16 儲存,只按每參數 2 bytes 粗估,純權重約 4.8 TB(約 4.37 TiB),尚未計算 KV cache、runtime、sharding 與通訊開銷。95B active 主要降低每個 token 的計算量,不會讓其餘 experts 的儲存需求消失;若要讓完整權重常駐記憶體並取得實用吞吐,通常會是多節點工程。但實際硬體仍須等 checkpoint、routing 與量化格式公開後才能判定。截至 2026 年 8 月 5 日,官方只公布 Qwen3.8-27B 名稱與未來開放權重承諾,尚無 model card、架構或授權資料。
判讀三:長任務的瓶頸已從「會不會做」轉成「怎麼證明做對」
十六天的 repository、125 小時的研究流程都很有啟發性,但長任務真正昂貴的部分,是錯誤可能在第 800 步才浮現。此時多一個亮眼案例,不如公開成功率分布、總成本、重啟次數、人類介入點與完整 trajectory。未來 agent 的競爭,很可能不是誰能跑最久,而是誰能以最低驗證成本,把長鏈條錯誤控制在可接受範圍。
判讀四:最合理的結論是「部分替代」,不是「全面取代」
我同意 Qwen3.8-Max 已經進入封閉前沿模型的競爭區,也同意它的價格可能增加對手解釋溢價的壓力;我存疑的是,把廠商自評、混合 harness 與少數成功案例合併成「通用能力已經超車」。更精確的判斷是:它可能在部分 coding、文件、多模態與專業工作流成為高性價比替代,但還不是所有高難度 agent 任務的通用替代品。這也呼應 AlphaLab 對開放與封閉 AI 市場的長期觀察:能力正在下放,真正稀缺的卻逐漸變成算力、可靠性與部署系統。
八、如果你要評估 Qwen3.8-Max,請這樣做
- 先拿真實任務,不拿榜單下注。挑 20~50 個你每週真的會做的任務,固定 prompt、工具與預算,和目前模型盲測。
- 同時計算成功率與完整成本。記錄首輪成功率、重試次數、輸入/輸出/推理 token、工具費、延遲,以及人工驗收時間。單價便宜不等於總成本最低。
- 把 harness 當成產品的一部分。同一模型至少測兩套工作流;必要時使用Context Engineering整理狀態、工具與失敗恢復規則。
- 不要為尚未出現的權重提前鎖定架構。等 repository、license、model card、量化版本與硬體需求實際公布,再決定本地部署或微調。
- 盯住三個可推翻敘事的訊號。權重是否如期交付;Terminal/SWE 類成績能否進入可重跑的第三方榜單;長任務是否公開成本、失敗分布與人類介入邊界。
如果 Qwen3.8-Max 在你的任務上以 8 美元的 token 帳單,交出接近按 GPT-5.6 Sol 短 context Standard 牌價計算的 35 美元,或 Fable 5 的 60 美元模型結果,它已經值得切流量;如果一個錯誤會造成昂貴後果,就讓更強模型或人類擔任驗證器。最佳策略通常不是選邊站,而是把不同模型放到最符合其能力、價格與風險的位置。
📚 延伸閱讀
- AI Evals 是什麼?7 步把 AI Demo 變成可測、可回歸的產品
- 開源 AI 會贏嗎?看懂能力下放與算力集中的分水嶺
- GPT-5.6 API 降價:成本曲線真的被重畫了嗎?
- LLM 推論引擎怎麼選?vLLM、llama.cpp、MLX 完整比較
最後的結論很簡單:先把 Qwen3.8-Max 當成一個已上線、值得實測的低價前沿 API;等權重真的出現,再把它當成開放權重模型。在那之前,最理性的興奮,是把它加入測試,而不是把預告當成交付。
